Text Generation
Transformers
Safetensors
Russian
llama
russian
small-language-model
sovereign-ai
instruct
text-generation-inference
Instructions to use longtimedevs/Ru-Small-Instruct with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use longtimedevs/Ru-Small-Instruct with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="longtimedevs/Ru-Small-Instruct")# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("longtimedevs/Ru-Small-Instruct") model = AutoModelForCausalLM.from_pretrained("longtimedevs/Ru-Small-Instruct", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use longtimedevs/Ru-Small-Instruct with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "longtimedevs/Ru-Small-Instruct" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "longtimedevs/Ru-Small-Instruct", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/longtimedevs/Ru-Small-Instruct
- SGLang
How to use longtimedevs/Ru-Small-Instruct with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "longtimedevs/Ru-Small-Instruct" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "longtimedevs/Ru-Small-Instruct", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "longtimedevs/Ru-Small-Instruct" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "longtimedevs/Ru-Small-Instruct", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use longtimedevs/Ru-Small-Instruct with Docker Model Runner:
docker model run hf.co/longtimedevs/Ru-Small-Instruct
Update README.md
Browse files
README.md
CHANGED
|
@@ -34,7 +34,7 @@ tags:
|
|
| 34 |
<div align="center" style="line-height: 1.4; margin-bottom: 20px;">
|
| 35 |
<img alt="Parameters" src="https://img.shields.io/badge/Backbone-0.2B%20(~165M)-818cf8?style=flat-square"/>
|
| 36 |
<img alt="Hardware" src="https://img.shields.io/badge/Hardware-RTX%205060%20Ti%20(16GB)-76b900?style=flat-square&logo=nvidia&logoColor=white"/>
|
| 37 |
-
<img alt="Time" src="https://img.shields.io/badge/Trained%20in-~
|
| 38 |
<img alt="Language" src="https://img.shields.io/badge/Language-Russian%20(ru)-ef4444?style=flat-square"/>
|
| 39 |
<img alt="Status" src="https://img.shields.io/badge/Zero--Fingerprint-Sovereign%20Weights-emerald?style=flat-square"/>
|
| 40 |
</div>
|
|
@@ -45,6 +45,10 @@ tags:
|
|
| 45 |
|
| 46 |
---
|
| 47 |
|
|
|
|
|
|
|
|
|
|
|
|
|
| 48 |
## Introduction
|
| 49 |
|
| 50 |
**Ru-Small-Instruct** — экспериментальная компактная русскоязычная языковая модель класса **SLM (Small Language Model)** с объемом параметров ~0.2B (~165M). Разработана с упором на суверенность весов (**Zero-Fingerprint**): модель обучена с нуля без заимствования базовых чекпоинтов у сторонних корпоративных сетей (Llama 3 от Meta, Qwen от Alibaba, Mistral).
|
|
@@ -55,10 +59,10 @@ tags:
|
|
| 55 |
|
| 56 |
## ⚠️ Текущий статус модели и честный взгляд (Limitations)
|
| 57 |
|
| 58 |
-
Модель **находится на ранней стадии и пока далека от совершенства**. При объеме
|
| 59 |
|
| 60 |
> **Этому не стоит удивляться:**
|
| 61 |
-
> Модель **Ru-Small-Instruct** была создана с нуля **всего за
|
| 62 |
|
| 63 |
### Пример реального диалога с текущей версией:
|
| 64 |
|
|
@@ -72,7 +76,7 @@ tags:
|
|
| 72 |
для обучения и прогнозирования будущих событий на основе данных.
|
| 73 |
```
|
| 74 |
|
| 75 |
-
Для компактной модели
|
| 76 |
|
| 77 |
---
|
| 78 |
|
|
@@ -84,7 +88,7 @@ tags:
|
|
| 84 |
| :--- | :---: | :--- |
|
| 85 |
| **Backbone Parameters** | ~165M – 200M | ~0.2B по классификации Hugging Face |
|
| 86 |
| **Training Hardware** | 1x NVIDIA RTX 5060 Ti 16GB | Обучение на домашнем железе |
|
| 87 |
-
| **Training Time** | ~
|
| 88 |
| **Hidden Dimension ($d_{model}$)** | 896 | Размерность латентного пространства |
|
| 89 |
| **Intermediate Dimension ($d_{ff}$)** | 2560 | Размерность слоев SwiGLU MLP |
|
| 90 |
| **Layers** | 16 | Глубина трансформерных блоков |
|
|
|
|
| 34 |
<div align="center" style="line-height: 1.4; margin-bottom: 20px;">
|
| 35 |
<img alt="Parameters" src="https://img.shields.io/badge/Backbone-0.2B%20(~165M)-818cf8?style=flat-square"/>
|
| 36 |
<img alt="Hardware" src="https://img.shields.io/badge/Hardware-RTX%205060%20Ti%20(16GB)-76b900?style=flat-square&logo=nvidia&logoColor=white"/>
|
| 37 |
+
<img alt="Time" src="https://img.shields.io/badge/Trained%20in-~4%20Hours-orange?style=flat-square"/>
|
| 38 |
<img alt="Language" src="https://img.shields.io/badge/Language-Russian%20(ru)-ef4444?style=flat-square"/>
|
| 39 |
<img alt="Status" src="https://img.shields.io/badge/Zero--Fingerprint-Sovereign%20Weights-emerald?style=flat-square"/>
|
| 40 |
</div>
|
|
|
|
| 45 |
|
| 46 |
---
|
| 47 |
|
| 48 |
+
> **Обновление от 21.09: Произошло обновление модели — она сильно уменьшила свой вес до ~182 МБ, став моделью на 94.4M параметров. Это было сделано для существенного снижения галлюцинаций.**
|
| 49 |
+
|
| 50 |
+
---
|
| 51 |
+
|
| 52 |
## Introduction
|
| 53 |
|
| 54 |
**Ru-Small-Instruct** — экспериментальная компактная русскоязычная языковая модель класса **SLM (Small Language Model)** с объемом параметров ~0.2B (~165M). Разработана с упором на суверенность весов (**Zero-Fingerprint**): модель обучена с нуля без заимствования базовых чекпоинтов у сторонних корпоративных сетей (Llama 3 от Meta, Qwen от Alibaba, Mistral).
|
|
|
|
| 59 |
|
| 60 |
## ⚠️ Текущий статус модели и честный взгляд (Limitations)
|
| 61 |
|
| 62 |
+
Модель **находится на ранней стадии и пока далека от совершенства**. При компактном объеме параметров она может иногда выдавать неожиданные ассоциации, путать факты или уходить в галлюцинации на коротких или неоднозначных запросах.
|
| 63 |
|
| 64 |
> **Этому не стоит удивляться:**
|
| 65 |
+
> Модель **Ru-Small-Instruct** была создана с нуля **всего за 4 часа на одной домашней видеокарте NVIDIA GeForce RTX 5060 Ti (16GB)** — от обучения собственного BPE-токенизатора и фундаментального чтения статей Википедии до финальной диалоговой огранки (SFT).
|
| 66 |
|
| 67 |
### Пример реального диалога с текущей версией:
|
| 68 |
|
|
|
|
| 76 |
для обучения и прогнозирования будущих событий на основе данных.
|
| 77 |
```
|
| 78 |
|
| 79 |
+
Для компактной модели, обученной на одном домашнем GPU за 4 часа, способность держать роль, грамотно формулировать сложные термины и помнить синтаксис русского языка — это отличный практический результат.
|
| 80 |
|
| 81 |
---
|
| 82 |
|
|
|
|
| 88 |
| :--- | :---: | :--- |
|
| 89 |
| **Backbone Parameters** | ~165M – 200M | ~0.2B по классификации Hugging Face |
|
| 90 |
| **Training Hardware** | 1x NVIDIA RTX 5060 Ti 16GB | Обучение на домашнем железе |
|
| 91 |
+
| **Training Time** | ~4 часа | Полный сквозной цикл с нул�� |
|
| 92 |
| **Hidden Dimension ($d_{model}$)** | 896 | Размерность латентного пространства |
|
| 93 |
| **Intermediate Dimension ($d_{ff}$)** | 2560 | Размерность слоев SwiGLU MLP |
|
| 94 |
| **Layers** | 16 | Глубина трансформерных блоков |
|