You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.

Log in or Sign Up to review the conditions and access this model content.

Til-Core-0.5B

Қазақ тілінің базалық моделі · Базовая модель казахского языка · Kazakh base language model

Қазақша · Русский · English


Қазақша

Til-Core-0.5B — қазақша мәтінді жалғастыруға арналған 497.8M параметрлі базалық тіл моделі. Репозиторий көлемі — 2.02 ГБ; модель қазақ мәтіндерімен басынан бастап үйретілген.

Бұл нұсқа нұсқауларды орындауға бейімделмеген. Диалог пен тапсырмаларға Til-Core-0.5B-Instruct, ал қазақ мәтініндегі қателерді түзетуге Til-Core-0.5B-QazGramma-GEC арналған.

Құрылымы

Сипаттама Мәні
Архитектура Qwen2ForCausalLM
Параметр саны 497.8M
Жасырын қабат өлшемі 896
Қабат саны 18
Attention басы 14
Аралық қабат өлшемі 4864
Сөздік 256000 токен
Контекст ұзындығы 32768 токен
Дәлдік bf16

Модель morpheme-aware BPE tokenizer қолданады. Кіріс және шығыс embedding-тері ортақ; decoder-only құрылымында SwiGLU, RoPE және GQA бар.

Үйрету деректері мен нәтижесі

Модель алдын ала токенделген таза қазақ корпусымен үйретілген. Үйрету сипаттары мен қорытынды бағалау нәтижелері төменде берілген.

Көрсеткіш Мәні
Үйретуде көрген токен ≈ 5.88B
Қадам саны 11,222
Реттілік ұзындығы 2048
Қорытынды eval loss 2.436
Perplexity ≈ 11.4

Іске қосу

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "TilQazyna/Til-Core-0.5B"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(
    repo, dtype=torch.bfloat16, device_map="auto"
).eval()

inputs = tokenizer("Абай Құнанбайұлы — қазақтың", return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=60, do_sample=True, temperature=0.8)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Tokenizer файлдары репозиторийдің өзінде сақталған. Модель web және энциклопедиялық мәтіндерге сүйенгендіктен, жауапта URL, сайт атауы немесе қызметтік мәтін кездесуі мүмкін. Бұл checkpoint downstream міндеттерге fine-tune жасауға негіз бола алады.

Қолжетімділік

Карточка мен файлдар тізімі ашық көрінеді, ал файлдарды жүктеу үшін репозиторий бетіндегі «Request access» батырмасы арқылы өтінім беріледі. Өтінімді TilQazyna командасы мақұлдағаннан кейін жүктеу ашылады.

Байланысты репозиторийлер

Нұсқауларды орындайтын туынды модель — Til-Core-0.5B-Instruct. GEC міндетіне бейімделген нұсқа — Til-Core-0.5B-QazGramma-GEC.


Русский

Til-Core-0.5B — базовая языковая модель на 497.8M параметров для продолжения казахского текста. Репозиторий занимает 2.02 ГБ; модель обучена с нуля на казахских текстах.

Базовая версия не настроена на выполнение инструкций. Для диалога и заданий выпущена Til-Core-0.5B-Instruct, для исправления ошибок в казахском тексте — Til-Core-0.5B-QazGramma-GEC.

Устройство

Характеристика Значение
Архитектура Qwen2ForCausalLM
Параметров 497.8M
Размер скрытого слоя 896
Слоёв 18
Голов attention 14
Размер промежуточного слоя 4864
Словарь 256000 токенов
Длина контекста 32768 токенов
Точность bf16

Модель использует morpheme-aware BPE tokenizer. Входные и выходные embedding связаны; decoder-only архитектура построена с SwiGLU, RoPE и GQA.

Обучающие данные и результат

Модель обучили на предварительно токенизированном очищенном корпусе казахского языка. Основные характеристики обучения и итоговой оценки собраны в таблице.

Показатель Значение
Токенов при обучении ≈ 5.88B
Шагов 11,222
Длина последовательности 2048
Итоговый eval loss 2.436
Perplexity ≈ 11.4

Как запустить

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "TilQazyna/Til-Core-0.5B"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(
    repo, dtype=torch.bfloat16, device_map="auto"
).eval()

inputs = tokenizer("Абай Құнанбайұлы — қазақтың", return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=60, do_sample=True, temperature=0.8)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Файлы tokenizer лежат в репозитории. В обучающем корпусе есть web- и энциклопедические тексты, поэтому генерация может содержать URL, названия сайтов и служебные фрагменты.

Доступ

Карточка и перечень файлов видны без авторизации. Для скачивания файлов нужна одобренная заявка: кнопка «Request access» находится на странице репозитория, решение принимает команда TilQazyna.

Связанные репозитории

Версия для выполнения инструкций — Til-Core-0.5B-Instruct. Версия для задачи GEC — Til-Core-0.5B-QazGramma-GEC.


English

Til-Core-0.5B is a 497.8M-parameter base language model for Kazakh text completion. The repository is 2.02 GB; the model was pretrained from scratch on Kazakh text.

This base checkpoint is intended for continuation rather than instruction following. Til-Core-0.5B-Instruct handles prompts and dialogue, while Til-Core-0.5B-QazGramma-GEC targets error correction in Kazakh text.

Architecture

Property Value
Architecture Qwen2ForCausalLM
Parameters 497.8M
Hidden size 896
Layers 18
Attention heads 14
Intermediate size 4864
Vocabulary 256000 tokens
Context length 32768 tokens
Precision bf16

The model uses a morpheme-aware BPE tokenizer. Its input and output embeddings are tied, and the decoder-only stack uses SwiGLU, RoPE, and GQA.

Training data and results

Pretraining used a cleaned, pre-tokenized Kazakh corpus. The table records the available training setup and final evaluation results.

Metric Value
Training tokens seen ≈ 5.88B
Training steps 11,222
Sequence length 2048
Final eval loss 2.436
Perplexity ≈ 11.4

Usage

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "TilQazyna/Til-Core-0.5B"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(
    repo, dtype=torch.bfloat16, device_map="auto"
).eval()

inputs = tokenizer("Абай Құнанбайұлы — қазақтың", return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=60, do_sample=True, temperature=0.8)
print(tokenizer.decode(output[0], skip_special_tokens=True))

The tokenizer files are bundled with the checkpoint. Because pretraining includes web and encyclopedic Kazakh, generations may reproduce URLs, site names, or boilerplate from that material.

Access

The model card and file listing remain publicly visible. Downloading the files requires approval through the “Request access” button on the repository page; the TilQazyna team reviews each request.

Related repositories

The instruction-following derivative is Til-Core-0.5B-Instruct. The GEC derivative is Til-Core-0.5B-QazGramma-GEC.


Лицензия · License: apache-2.0 · TilQazyna

Downloads last month
-
Safetensors
Model size
0.5B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for TilQazyna/Til-Core-0.5B

Finetunes
2 models

Dataset used to train TilQazyna/Til-Core-0.5B

Collection including TilQazyna/Til-Core-0.5B