Text Classification
Scikit-learn
Joblib
Russian
Tuvinian
custom
language-classification
russian
tuvan
tfidf
logistic-regression
Instructions to use tuva/turu with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Scikit-learn
How to use tuva/turu with Scikit-learn:
from huggingface_hub import hf_hub_download import joblib model = joblib.load( hf_hub_download("tuva/turu", "sklearn_model.joblib") ) # only load pickle files from sources you trust # read more about it here https://skops.readthedocs.io/en/stable/persistence.html - Notebooks
- Google Colab
- Kaggle
Turu — классификатор русского и тувинского языков
Модель определяет язык текста: русский (ru) или тувинский (tyv).
Она построена как пайплайн TF-IDF + логистическая регрессия и возвращает метку языка, её вероятность и вероятности всех классов.
Быстрый старт
import joblib
model = joblib.load("model/language_classifier.joblib")
text = "Тыва Республикасында чаа школаны тудар"
label = model.predict([text])[0]
scores = dict(zip(model.classes_, model.predict_proba([text])[0]))
print(label)
print(scores)
Для загрузки непосредственно с Hub используйте hf_hub_download:
from huggingface_hub import hf_hub_download
import joblib
path = hf_hub_download("tuva/turu", "model/language_classifier.joblib")
model = joblib.load(path)
Файлы репозитория
| Путь | Назначение |
|---|---|
model/language_classifier.joblib |
Канонический файл обученной модели |
inference.py |
Утилиты предсказания с вероятностями |
TRAINING_REPORT.md |
Сведения об обучении и проверке |
requirements.txt |
Минимальные зависимости |
Интерпретация результата
label — наиболее вероятный язык. score — вероятность этой метки от 0 до 1. Для коротких, смешанных или написанных с ошибками текстов вероятность может быть ниже; это не означает, что текст обязательно на другом языке.
Лицензия и автор
Лицензия: MIT. Автор: Иргит Валерий Алдын-оолович.
- Downloads last month
- -