TurkishLLM Generative V1 (52.5M)
Model Description
TurkishLLM Generative V1, Türkçe diline odaklı, 52.5 milyon parametreli, özel (custom) bir saf PyTorch mimarisiyle sıfırdan eğitilmiş dekoder-tabanlı (decoder-only) bir dil modelidir.
Bu model Hugging Face transformers kütüphanesinin standart bir sınıfı (ör. LlamaForCausalLM veya GPT2LMHeadModel) değildir. Model, bağımsız bir PyTorch modülü olarak (model.py) sunulmakta olup, harici karmaşık bağımlılıklar olmadan sadece torch ve sentencepiece ile çalıştırılabilmektedir.
Production RAG Katmanı ve Veritabanı Ayrımı:
Projede kullanılan 21 milyon kayıtlık harici ChromaDB bilgi bankası ve hiyerarşik geri getirme katmanı (RECOVERY-C / CONFIG-2: K=10, 50% lexical / 40% vector / 10% entity) bu release paketine dahil DEĞİLDİR.
Bu paket, yalnızca bağımsız generatif temel model ağırlıklarını (sft_best_val.pt), SentencePiece tokenizer'ı (tokenizer.model) ve yerel çıkarım kodunu içerir. Model, harici bir RAG bağlamı beslenmediğinde yalnızca ön-eğitim ve SFT parametrelerine gömülü sınırlı bilgiyle yanıt üretir.
Model Architecture
| Mimari Özellik | Değer | Notlar |
|---|---|---|
| Model Tipi | Decoder-Only Causal Transformer | Saf PyTorch uygulaması (TurkishLLMGenerativeV1) |
| Toplam Parametre | 52,508,736 (~52.5M) | Exact count (assert param_count == 52_508_736) |
| Katman Sayısı (Layers) | 12 | Transformer blokları |
| Gizli Boyut ($d_{model}$) | 576 | Hidden dimension |
| Dikkat Kafaları (Attention Heads) | 9 | Head dimension = 64 ($9 \times 64 = 576$) |
| İleri Besleme Boyutu ($d_{ff}$) | 1536 | SwiGLU FFN ($3 \times 576 \times 1536$ ağırlıklar) |
| Normalizasyon | RMSNorm ($\epsilon = 10^{-5}$) | Pre-normalization |
| Konumsal Kodlama | RoPE (Rotary Positional Embeddings) | Base frequency = 10000.0 |
| Ağırlık Bağlama (Weight Tying) | Evet | lm_head.weight == token_embedding.weight |
| Model Vocab Kapasitesi | 8,192 | Embedding matrisi satır sayısı ($8192 \times 576$) |
| Aktif Tokenizer Vocab Boyutu | 4,096 | SentencePiece unigram kelime hazinesi |
| Maksimum Bağlam Uzunluğu | 1,024 token | Maximum sequence length |
Language
- Dil: Türkçe (
tr) - Tokenizer: 4,096 parçalı SentencePiece unigram modeli (
byte_fallback=True).
Intended Use
Uygun Kullanım Alanları:
- Düşük kaynaklı (low-resource) ortamlarda (ör. tek tüketici GPU'su, 4 GB VRAM veya CPU) yerel Türkçe metin üretimi araştırmaları.
- Türkçe küçük dil modellerinin (SLM) davranış, grounding ve halüsinasyon dinamiklerini inceleyen akademik/deneysel çalışmalar.
- Harici bir RAG (Retrieval-Augmented Generation) hattı arkasında kısa, bağlama dayalı özetleme veya doğrudan soru-cevap asistanlığı.
Uygun Olmayan Kullanım Alanları (Non-Intended Use):
- Genel Amaçlı Ticari Sohbet: Bu model GPT-4, Llama-3 veya Claude gibi büyük ölçekli modellerle eşdeğer değildir ve genel amaçlı akıl yürütme için kullanılamaz.
- Tıbbi, Hukuki veya Finansal Tavsiye: Olgusal doğruluk garantisi yoktur.
- Yüksek Riskli Karar Mekanizmaları: Model çıktısı denetimsiz otomasyonlarda kullanılamaz.
- Kod Üretimi ve Mantıksal Çıkarım: Parametre boyutu karmaşık çok adımlı mantık yürütmek için yetersizdir.
Limitations & Known Failure Modes
Modelin 52.5M parametre ölçeğinden ve küçük veri tabanından kaynaklanan açıkça belgelenmiş sınırlamaları şunlardır:
- Olgusal Doğruluk Sınırı (Factual Generation Limitations):
52.5M parametre, geniş kapsamlı dünya bilgisini parametrelerinde saklamak için son derece küçüktür. RAG katmanı olmaksızın model tarih, bilim, coğrafya ve güncel olaylara dair sorularda sıklıkla yanlış veya uydurma (hallucination) bilgi üretir. - Decoding Kuralları vs. Bilgi Edinimi (Decoding is NOT Knowledge):
Çıkarım sırasında uygulanan tekrar cezası (repetition penalty) ve EOS/BOS durdurma mekanizmaları, modelin döngüye girmesini (looping) ve kendini tekrar etmesini önler; ancak bu kurallar modele yeni olgusal bilgi kazandırmaz. - Halüsinasyon ve Kavram Karışması (Empirical Failure Case):
Model, parametrelerinde olgusal gerçekleri doğru tutamamakta ve bariz halüsinasyonlar üretmektedir.- Doğrulanmış Başarısızlık Örneği (RAG-OFF):
- İstem: "Türkiye'nin başkenti neresidir?"
- Model Çıktısı: "Türkiye'nin başkenti, Beyrut'taki en büyük şehirdir."
Bu sonuç, modelin parametrik hafızasının bağımsız olgusal soru-cevap için yetersiz olduğunu ve RAG desteği olmaksızın güvenilir bilgi veremeyeceğini açıkça kanıtlamaktadır.
- Doğrulanmış Başarısızlık Örneği (RAG-OFF):
- Kısa Yanıt Eğilimi:
Model SFT aşamasında kısa, net yanıtlar üretmeye hizalanmıştır. Uzun kompozisyonlar yazarken bağlamsal tutarlılığı hızla kaybeder.
Runtime Dependencies
Bu model, TurkishLLM projesine ait hiçbir harici iç modüle veya yerel veritabanına ihtiyaç duymamaktadır. Ancak bağımsız çalışabilmesi için aşağıdaki standart Python kütüphaneleri zorunludur:
torch >= 2.0.0(PyTorch sinir ağı kütüphanesi)sentencepiece >= 0.1.99(Unigram tokenizasyon kütüphanesi)
Kurulum:
pip install -r requirements.txt
Training Information
- Mimari Geliştirme: Scratch PyTorch implementation.
- Ön-Eğitim (Pre-training): ~451 milyon temiz Türkçe token üzerinde nedensel dil modelleme (Causal LM).
- Talimat İnce Ayarı (SFT): ~48 milyon tokenlık filtrelenmiş Türkçe talimat ve diyalog verisi.
- Dengeleme ve Hizalama (Grounding SFT): Bağlam içi kanıtlardan çıkarım yapmayı teşvik eden ve kanıt yoksa reddetmeyi öğreten kontrollü veri setleri ile optimize edilmiştir.
- Donanım: Tek tüketici sınıfı GPU (NVIDIA GTX 1050 4 GB / FP16 Autocast).
Dataset Provenance & Attribution
Eğitim sürecinde (Ön-Eğitim ve SFT) kullanılan ve kanıt zinciriyle doğrulanan tüm veri kaynakları ve telif/lisans atıfları:
- Aya Dataset TR & Aya Collection TR: Cohere For AI (Apache-2.0 Lisansı).
- The Stack TR (Permissive Subset — Python & Markdown): BigCode Projesi (MIT, Apache-2.0, BSD-2/3-Clause, ISC lisansları).
- Wikimedia Türkçe Vikipedi (trwiki): Wikimedia Foundation ve gönüllü Türkçe vikipedistler (CC-BY-SA 4.0 & GFDL lisansları, https://tr.wikipedia.org).
- Cosmos Turkish Corpus v1.0: Yıldız Teknik Üniversitesi Bilgisayar Mühendisliği / YTÜ COSMOS (CC-BY 4.0 Lisansı).
- BellaTurca Derlemi (Akademik & Özenli Derlem): Turkish NLP Suite (CC-BY-SA 4.0 Lisansı).
- Databricks Dolly 15k TR: Databricks, Inc. ve Türkçe açık kaynak topluluğu (CC-BY-SA 3.0 Lisansı).
- Merve Turkish Instructions: Merve Noyan (Apache-2.0 Lisansı).
Modelin ön-eğitim ve SFT süreçlerinde telif korumalı ham metin dağıtımı yapılmamış; yalnızca açık ve izinli lisanslı derlemler üzerinden istatistiksel ağırlık temsilleri öğrenilmiştir.
Evaluation Summary
Modelin değerlendirmesi kontrollü test setleri üzerinde gerçekleştirilmiştir:
- 24 soruluk üretim benchmarkında bağlamsız (RAG-OFF) modda olgusal doğruluk parametrik kısıt nedeniyle düşüktür; ancak RAG katmanı eklendiğinde kanıt kullanım oranı belirgin şekilde artmaktadır.
- Bu benchmark sonuçları genel dil yeterliliği (C2 seviyesi veya insan dengi anlama) iddiası taşımamaktadır.
Installation
pip install -r requirements.txt
Local Inference Example
Python ile Kullanım:
from inference import TurkishLLMInference
# Yerel ağırlıkları ve tokenizer'ı başlat
engine = TurkishLLMInference()
# Soru sor
prompt = "Türkiye'nin başkenti neresidir?"
response = engine.generate(prompt, max_new_tokens=48, temperature=0.0)
print("Yanıt:", response)
Komut Satırından Kullanım:
python inference.py "Türkiye Cumhuriyeti hangi yılda kuruldu?"
Checkpoint & Tokenizer Integrity
Bu pakette yer alan ağırlık ve tokenizer dosyalarının SHA-256 sağlama toplamları:
| Dosya | Boyut (Bayt) | SHA-256 Sağlama Toplamı |
|---|---|---|
sft_best_val.pt |
630,242,542 | dceba2e18663cf7e4c60ada167bbf2b23cc55925907cd1a15ec117e8a069da6c |
tokenizer.model |
306,321 | 048d2997ea84a114635a392ecb62fd8202a0cb044a6a3ffffd3ab7caa361b3ec |
tokenizer.vocab |
59,418 | 0fd33aa20513aeb60068bf2a4b25d9780815ffa2f22760912ad5cef1aab83671 |
LICENSE |
3,343 | 98cd54e34989a870adbb36967adadfc8c67256748b67fb5c45d22b4e7eeb7696 |
License
Bu model, kodları ve ağırlıkları Apache License, Version 2.0 altında lisanslanmıştır. Detaylar için LICENSE dosyasına bakınız.
- Downloads last month
- 214