Turu — классификатор русского и тувинского языков

Модель определяет язык текста: русский (ru) или тувинский (tyv). Она построена как пайплайн TF-IDF + логистическая регрессия и возвращает метку языка, её вероятность и вероятности всех классов.

Быстрый старт

import joblib

model = joblib.load("model/language_classifier.joblib")
text = "Тыва Республикасында чаа школаны тудар"

label = model.predict([text])[0]
scores = dict(zip(model.classes_, model.predict_proba([text])[0]))

print(label)
print(scores)

Для загрузки непосредственно с Hub используйте hf_hub_download:

from huggingface_hub import hf_hub_download
import joblib

path = hf_hub_download("tuva/turu", "model/language_classifier.joblib")
model = joblib.load(path)

Файлы репозитория

Путь Назначение
model/language_classifier.joblib Канонический файл обученной модели
inference.py Утилиты предсказания с вероятностями
TRAINING_REPORT.md Сведения об обучении и проверке
requirements.txt Минимальные зависимости

Интерпретация результата

label — наиболее вероятный язык. score — вероятность этой метки от 0 до 1. Для коротких, смешанных или написанных с ошибками текстов вероятность может быть ниже; это не означает, что текст обязательно на другом языке.

Лицензия и автор

Лицензия: MIT. Автор: Иргит Валерий Алдын-оолович.

Downloads last month
-
Inference Examples
Examples
ru
0.990
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support