cisimcik-base

English Türkçe

cisimcik-base

cisimcik-base, Türkçe öncelikli bir temel (base) dil modelidir (base model). Qwen/Qwen3.5-4B-Base modelinin, çoğunlukla Türkçe metinle devam ön eğitiminden (continued pre-training) eğitilmiş halidir.

  • 4,2 milyar parametre. Qwen3.5 hibrit mimarisi (Gated DeltaNet + full attention), yalnızca metin.
  • 10B token training. %91,5 Türkçe, %8,5 replay (İngilizce, kod, matematik, 23 baÅŸka dil).
  • Apache 2.0 lisansıyla açık kaynak olarak yayınlandı.

Hızlı başlangıç

pip install "transformers>=5.17" torch
# isteğe bağlı, NVIDIA GPU'larda daha hızlı Gated DeltaNet kernel'leri:
pip install flash-linear-attention
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

tok = AutoTokenizer.from_pretrained("cisimcik/cisimcik-base")
model = AutoModelForCausalLM.from_pretrained("cisimcik/cisimcik-base", dtype=torch.bfloat16)
model = model.to("cuda" if torch.cuda.is_available() else "cpu").eval()

inputs = tok("Kapadokya'daki peri bacaları,", return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=150, do_sample=True, temperature=0.7, top_p=0.9)
print(tok.decode(out[0], skip_special_tokens=True))

Bu bir temel modeldir. Sadece verilen prompt'u tamamlar, sohbet etmez. Sohbet için cisimcik-4b kullanın.

Donanım. Ağırlıklar bf16'da yaklaşık 8,4 GB: 12 GB veya üzeri belleğe sahip herhangi bir GPU ya da 16 GB RAM'li bir CPU yeterlidir. flash-linear-attention kurulu değilse Gated DeltaNet katmanları transformers'ın PyTorch uygulamasını kullanır. Bu doğru sonuç verir ama uzun girdilerde daha yavaştır.

Görev kıyaslamalarına bu model üzerine eğitilen modellerden ulaşılabilir: cisimcik-4b (CETVEL, OpenLLM Turkish Leaderboard) ve tau-4b.

Mimari

Parça Ayrıntı
Model Qwen3.5-4B metin modeli (Qwen3_5ForCausalLM): 32 katman, hidden size 2560, MLP 9216. Her 4. katman full attention (16 query / 4 KV head, head dim 256), diğer 24'ü Gated DeltaNet linear attention.
Dictionary 248.320, Qwen3.5 tokenizer'ı değiştirilmeden. Tied embedding'ler.
Temel modelden çıkarılanlar görüntü kodlayıcı (vision encoder) ve çoklu token tahmini (MTP) katmanı
Parametre 4,21 milyar
Context 16.384 token'a kadar dizilerle eÄŸitildi. Pozisyonlar 262.144'e kadar gider (temel modelden)

Dosyalar

Dosya İçerik
model-0000*-of-00002.safetensors ağırlıklar (bf16)
config.json Qwen3_5ForCausalLM config'i
tokenizer*.json, vocab.json, merges.txt Qwen3.5 tokenizer'ı, değiştirilmeden

Lisans

Bu depodaki ağırlıklar Apache License 2.0 ile yayımlanmıştır (bkz. LICENSE ve NOTICE). Model, Qwen/Qwen3.5-4B-Base © 2026 Alibaba Cloud, Apache License 2.0 lisanslı modelin değiştirilmiş bir sürümüdür. Temel model Qwen/Qwen3.5-4B-Base'dir.

Atıf

@misc{cisimcikbase2026,
  title  = {cisimcik-base: a Turkish-first base language model},
  author = {cisimcik},
  year   = {2026},
  url    = {https://huggingface.co/cisimcik/cisimcik-base}
}
Downloads last month
656
Safetensors
Model size
4B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 2 Ask for provider support

Model tree for cisimcik/cisimcik-base

Finetuned
(205)
this model
Finetunes
2 models
Quantizations
1 model