TanAi-turkish-29M

TanAI mimarisiyle sıfırdan eğitilmiş, 28.9M parametreli deneysel bir Türkçe dil modeli. Ethosoft/Turkish_corpus veri setinin streaming ile okunan ilk 30.000 örneği üzerinde 2 epoch eğitilmiştir.

Model Detayları

Özellik Değer
Parametre sayısı 28.9M (28.923.904)
Mimari TanAI (decoder-only Transformer, GPT benzeri)
Katman sayısı 4
Embedding boyutu 256
Bağlam uzunluğu 128 token
Vocab boyutu 50.257 (GPT-2 tokenizer)
Eğitim verisi Ethosoft/Turkish_corpus, ilk 30.000 örnek
Epoch 2
Optimizer AdamW, lr 3e-4
Batch / blok boyutu 16 / 128

Kullanım

Model özel bir mimari kullandığı için trust_remote_code=True gerekir. İlk kullanımda model kodu ve ağırlıklar otomatik olarak indirilir.

from transformers import AutoModelForCausalLM, AutoTokenizer

repo_id = "coderian/TanAi-turkish-29M"

tokenizer = AutoTokenizer.from_pretrained(repo_id)
model = AutoModelForCausalLM.from_pretrained(repo_id, trust_remote_code=True)

inputs = tokenizer("Türkiye'nin en kalabalık şehri", return_tensors="pt")
outputs = model.generate(
    **inputs,
    max_new_tokens=50,
    do_sample=True,
    top_k=50,
    temperature=0.8,
)

print(tokenizer.decode(outputs[0], skip_special_tokens=True))

pipeline ile:

from transformers import pipeline

generator = pipeline("text-generation", model=repo_id, trust_remote_code=True)
print(generator("Bugün hava", max_new_tokens=30)[0]["generated_text"])

İndirme (isteğe bağlı, from_pretrained modeli zaten otomatik indirir):

huggingface-cli download coderian/TanAi-turkish-29M

Eğitim

  • Veri, streaming=True ile okundu; yalnızca ilk 30.000 örnek kullanıldı.
  • Tokenizer: GPT2TokenizerFast; belgeler arasına eos token'ı eklendi.
  • Kayıp: token bazlı cross-entropy (causal language modeling).
  • Hiperparametreler: 2 epoch, batch 16, blok 128, AdamW, lr 3e-4.

Sınırlamalar

  • Küçük ölçekli ve deneysel bir modeldir; çıktılar tekrarlı veya anlamsız olabilir.
  • Talimat takibi için eğitilmemiştir (instruction tuning yoktur).
  • Bağlam uzunluğu 128 tokendır; prompt + üretilen token toplamı 128'i geçemez.
  • Yalnızca Türkçe metin için eğitilmiştir.
Downloads last month
286
Safetensors
Model size
28.9M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Dataset used to train coderian/TanAi-turkish-29M