TurkishLLM Generative V1 (52.5M)

Model Description

TurkishLLM Generative V1, Türkçe diline odaklı, 52.5 milyon parametreli, özel (custom) bir saf PyTorch mimarisiyle sıfırdan eğitilmiş dekoder-tabanlı (decoder-only) bir dil modelidir.

Bu model Hugging Face transformers kütüphanesinin standart bir sınıfı (ör. LlamaForCausalLM veya GPT2LMHeadModel) değildir. Model, bağımsız bir PyTorch modülü olarak (model.py) sunulmakta olup, harici karmaşık bağımlılıklar olmadan sadece torch ve sentencepiece ile çalıştırılabilmektedir.

Production RAG Katmanı ve Veritabanı Ayrımı:
Projede kullanılan 21 milyon kayıtlık harici ChromaDB bilgi bankası ve hiyerarşik geri getirme katmanı (RECOVERY-C / CONFIG-2: K=10, 50% lexical / 40% vector / 10% entity) bu release paketine dahil DEĞİLDİR.
Bu paket, yalnızca bağımsız generatif temel model ağırlıklarını (sft_best_val.pt), SentencePiece tokenizer'ı (tokenizer.model) ve yerel çıkarım kodunu içerir. Model, harici bir RAG bağlamı beslenmediğinde yalnızca ön-eğitim ve SFT parametrelerine gömülü sınırlı bilgiyle yanıt üretir.


Model Architecture

Mimari Özellik Değer Notlar
Model Tipi Decoder-Only Causal Transformer Saf PyTorch uygulaması (TurkishLLMGenerativeV1)
Toplam Parametre 52,508,736 (~52.5M) Exact count (assert param_count == 52_508_736)
Katman Sayısı (Layers) 12 Transformer blokları
Gizli Boyut ($d_{model}$) 576 Hidden dimension
Dikkat Kafaları (Attention Heads) 9 Head dimension = 64 ($9 \times 64 = 576$)
İleri Besleme Boyutu ($d_{ff}$) 1536 SwiGLU FFN ($3 \times 576 \times 1536$ ağırlıklar)
Normalizasyon RMSNorm ($\epsilon = 10^{-5}$) Pre-normalization
Konumsal Kodlama RoPE (Rotary Positional Embeddings) Base frequency = 10000.0
Ağırlık Bağlama (Weight Tying) Evet lm_head.weight == token_embedding.weight
Model Vocab Kapasitesi 8,192 Embedding matrisi satır sayısı ($8192 \times 576$)
Aktif Tokenizer Vocab Boyutu 4,096 SentencePiece unigram kelime hazinesi
Maksimum Bağlam Uzunluğu 1,024 token Maximum sequence length

Language

  • Dil: Türkçe (tr)
  • Tokenizer: 4,096 parçalı SentencePiece unigram modeli (byte_fallback=True).

Intended Use

Uygun Kullanım Alanları:

  • Düşük kaynaklı (low-resource) ortamlarda (ör. tek tüketici GPU'su, 4 GB VRAM veya CPU) yerel Türkçe metin üretimi araştırmaları.
  • Türkçe küçük dil modellerinin (SLM) davranış, grounding ve halüsinasyon dinamiklerini inceleyen akademik/deneysel çalışmalar.
  • Harici bir RAG (Retrieval-Augmented Generation) hattı arkasında kısa, bağlama dayalı özetleme veya doğrudan soru-cevap asistanlığı.

Uygun Olmayan Kullanım Alanları (Non-Intended Use):

  • Genel Amaçlı Ticari Sohbet: Bu model GPT-4, Llama-3 veya Claude gibi büyük ölçekli modellerle eşdeğer değildir ve genel amaçlı akıl yürütme için kullanılamaz.
  • Tıbbi, Hukuki veya Finansal Tavsiye: Olgusal doğruluk garantisi yoktur.
  • Yüksek Riskli Karar Mekanizmaları: Model çıktısı denetimsiz otomasyonlarda kullanılamaz.
  • Kod Üretimi ve Mantıksal Çıkarım: Parametre boyutu karmaşık çok adımlı mantık yürütmek için yetersizdir.

Limitations & Known Failure Modes

Modelin 52.5M parametre ölçeğinden ve küçük veri tabanından kaynaklanan açıkça belgelenmiş sınırlamaları şunlardır:

  1. Olgusal Doğruluk Sınırı (Factual Generation Limitations):
    52.5M parametre, geniş kapsamlı dünya bilgisini parametrelerinde saklamak için son derece küçüktür. RAG katmanı olmaksızın model tarih, bilim, coğrafya ve güncel olaylara dair sorularda sıklıkla yanlış veya uydurma (hallucination) bilgi üretir.
  2. Decoding Kuralları vs. Bilgi Edinimi (Decoding is NOT Knowledge):
    Çıkarım sırasında uygulanan tekrar cezası (repetition penalty) ve EOS/BOS durdurma mekanizmaları, modelin döngüye girmesini (looping) ve kendini tekrar etmesini önler; ancak bu kurallar modele yeni olgusal bilgi kazandırmaz.
  3. Halüsinasyon ve Kavram Karışması (Empirical Failure Case):
    Model, parametrelerinde olgusal gerçekleri doğru tutamamakta ve bariz halüsinasyonlar üretmektedir.
    • Doğrulanmış Başarısızlık Örneği (RAG-OFF):
      • İstem: "Türkiye'nin başkenti neresidir?"
      • Model Çıktısı: "Türkiye'nin başkenti, Beyrut'taki en büyük şehirdir."
        Bu sonuç, modelin parametrik hafızasının bağımsız olgusal soru-cevap için yetersiz olduğunu ve RAG desteği olmaksızın güvenilir bilgi veremeyeceğini açıkça kanıtlamaktadır.
  4. Kısa Yanıt Eğilimi:
    Model SFT aşamasında kısa, net yanıtlar üretmeye hizalanmıştır. Uzun kompozisyonlar yazarken bağlamsal tutarlılığı hızla kaybeder.

Runtime Dependencies

Bu model, TurkishLLM projesine ait hiçbir harici iç modüle veya yerel veritabanına ihtiyaç duymamaktadır. Ancak bağımsız çalışabilmesi için aşağıdaki standart Python kütüphaneleri zorunludur:

  • torch >= 2.0.0 (PyTorch sinir ağı kütüphanesi)
  • sentencepiece >= 0.1.99 (Unigram tokenizasyon kütüphanesi)

Kurulum:

pip install -r requirements.txt

Training Information

  • Mimari Geliştirme: Scratch PyTorch implementation.
  • Ön-Eğitim (Pre-training): ~451 milyon temiz Türkçe token üzerinde nedensel dil modelleme (Causal LM).
  • Talimat İnce Ayarı (SFT): ~48 milyon tokenlık filtrelenmiş Türkçe talimat ve diyalog verisi.
  • Dengeleme ve Hizalama (Grounding SFT): Bağlam içi kanıtlardan çıkarım yapmayı teşvik eden ve kanıt yoksa reddetmeyi öğreten kontrollü veri setleri ile optimize edilmiştir.
  • Donanım: Tek tüketici sınıfı GPU (NVIDIA GTX 1050 4 GB / FP16 Autocast).

Dataset Provenance & Attribution

Eğitim sürecinde (Ön-Eğitim ve SFT) kullanılan ve kanıt zinciriyle doğrulanan tüm veri kaynakları ve telif/lisans atıfları:

  • Aya Dataset TR & Aya Collection TR: Cohere For AI (Apache-2.0 Lisansı).
  • The Stack TR (Permissive Subset — Python & Markdown): BigCode Projesi (MIT, Apache-2.0, BSD-2/3-Clause, ISC lisansları).
  • Wikimedia Türkçe Vikipedi (trwiki): Wikimedia Foundation ve gönüllü Türkçe vikipedistler (CC-BY-SA 4.0 & GFDL lisansları, https://tr.wikipedia.org).
  • Cosmos Turkish Corpus v1.0: Yıldız Teknik Üniversitesi Bilgisayar Mühendisliği / YTÜ COSMOS (CC-BY 4.0 Lisansı).
  • BellaTurca Derlemi (Akademik & Özenli Derlem): Turkish NLP Suite (CC-BY-SA 4.0 Lisansı).
  • Databricks Dolly 15k TR: Databricks, Inc. ve Türkçe açık kaynak topluluğu (CC-BY-SA 3.0 Lisansı).
  • Merve Turkish Instructions: Merve Noyan (Apache-2.0 Lisansı).

Modelin ön-eğitim ve SFT süreçlerinde telif korumalı ham metin dağıtımı yapılmamış; yalnızca açık ve izinli lisanslı derlemler üzerinden istatistiksel ağırlık temsilleri öğrenilmiştir.


Evaluation Summary

Modelin değerlendirmesi kontrollü test setleri üzerinde gerçekleştirilmiştir:

  • 24 soruluk üretim benchmarkında bağlamsız (RAG-OFF) modda olgusal doğruluk parametrik kısıt nedeniyle düşüktür; ancak RAG katmanı eklendiğinde kanıt kullanım oranı belirgin şekilde artmaktadır.
  • Bu benchmark sonuçları genel dil yeterliliği (C2 seviyesi veya insan dengi anlama) iddiası taşımamaktadır.

Installation

pip install -r requirements.txt

Local Inference Example

Python ile Kullanım:

from inference import TurkishLLMInference

# Yerel ağırlıkları ve tokenizer'ı başlat
engine = TurkishLLMInference()

# Soru sor
prompt = "Türkiye'nin başkenti neresidir?"
response = engine.generate(prompt, max_new_tokens=48, temperature=0.0)

print("Yanıt:", response)

Komut Satırından Kullanım:

python inference.py "Türkiye Cumhuriyeti hangi yılda kuruldu?"

Checkpoint & Tokenizer Integrity

Bu pakette yer alan ağırlık ve tokenizer dosyalarının SHA-256 sağlama toplamları:

Dosya Boyut (Bayt) SHA-256 Sağlama Toplamı
sft_best_val.pt 630,242,542 dceba2e18663cf7e4c60ada167bbf2b23cc55925907cd1a15ec117e8a069da6c
tokenizer.model 306,321 048d2997ea84a114635a392ecb62fd8202a0cb044a6a3ffffd3ab7caa361b3ec
tokenizer.vocab 59,418 0fd33aa20513aeb60068bf2a4b25d9780815ffa2f22760912ad5cef1aab83671
LICENSE 3,343 98cd54e34989a870adbb36967adadfc8c67256748b67fb5c45d22b4e7eeb7696

License

Bu model, kodları ve ağırlıkları Apache License, Version 2.0 altında lisanslanmıştır. Detaylar için LICENSE dosyasına bakınız.

Downloads last month
214
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support