Text Generation
Transformers
Safetensors
English
kimi_linear
kimi-k3
luau
experimental-checkpoint
custom_code
Instructions to use khtsly/d with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use khtsly/d with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="khtsly/d", trust_remote_code=True)# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("khtsly/d", trust_remote_code=True) model = AutoModelForCausalLM.from_pretrained("khtsly/d", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use khtsly/d with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "khtsly/d" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "khtsly/d", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/khtsly/d
- SGLang
How to use khtsly/d with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "khtsly/d" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "khtsly/d", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "khtsly/d" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "khtsly/d", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use khtsly/d with Docker Model Runner:
docker model run hf.co/khtsly/d
periodic checkpoint @ step 1600
Browse files- .gitattributes +1 -0
- README.md +1 -1
- metrics.jsonl +11 -0
.gitattributes
CHANGED
|
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
|
| 33 |
*.zip filter=lfs diff=lfs merge=lfs -text
|
| 34 |
*.zst filter=lfs diff=lfs merge=lfs -text
|
| 35 |
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
|
|
|
|
|
| 33 |
*.zip filter=lfs diff=lfs merge=lfs -text
|
| 34 |
*.zst filter=lfs diff=lfs merge=lfs -text
|
| 35 |
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
| 36 |
+
metrics.png filter=lfs diff=lfs merge=lfs -text
|
README.md
CHANGED
|
@@ -9,7 +9,7 @@ tags:
|
|
| 9 |
|
| 10 |
# d
|
| 11 |
|
| 12 |
-
In-training periodic checkpoint (step
|
| 13 |
Kimi K3 mini port (`KimiLinearForCausalLM`).
|
| 14 |
|
| 15 |
**Not a finished model** -- intermediate weights uploaded during training for safekeeping/diffing.
|
|
|
|
| 9 |
|
| 10 |
# d
|
| 11 |
|
| 12 |
+
In-training periodic checkpoint (step 1600). Architecture:
|
| 13 |
Kimi K3 mini port (`KimiLinearForCausalLM`).
|
| 14 |
|
| 15 |
**Not a finished model** -- intermediate weights uploaded during training for safekeeping/diffing.
|
metrics.jsonl
CHANGED
|
@@ -165,3 +165,14 @@
|
|
| 165 |
{"wall": 15224.314, "step": 1490, "loss": 5.29368057847023, "lm_loss": 5.29368057847023, "mtp_loss": 0.0, "lr": 0.0009649137931034482, "grad_norm": 5.3805670738220215, "tokens": 439418880, "adamw_lr": 0.00029689655172413795, "mem_alloc_gb": 19.520028591156006, "mem_reserv_gb": 84.322265625, "loss_smoothed": 5.334023257096609, "seq_len": 4096}
|
| 166 |
{"wall": 15431.419, "eval_loss": 4.946272820234299, "eval_ppl": 140.64976501464844, "step": 1500}
|
| 167 |
{"wall": 15431.421, "step": 1500, "loss": 5.33892838160197, "lm_loss": 5.33892838160197, "mtp_loss": 0.0, "lr": 0.0009705172413793103, "grad_norm": 6.3760905265808105, "tokens": 442368000, "adamw_lr": 0.0002986206896551724, "mem_alloc_gb": 19.520028591156006, "mem_reserv_gb": 84.322265625, "loss_smoothed": 5.283117553591728, "seq_len": 4096}
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 165 |
{"wall": 15224.314, "step": 1490, "loss": 5.29368057847023, "lm_loss": 5.29368057847023, "mtp_loss": 0.0, "lr": 0.0009649137931034482, "grad_norm": 5.3805670738220215, "tokens": 439418880, "adamw_lr": 0.00029689655172413795, "mem_alloc_gb": 19.520028591156006, "mem_reserv_gb": 84.322265625, "loss_smoothed": 5.334023257096609, "seq_len": 4096}
|
| 166 |
{"wall": 15431.419, "eval_loss": 4.946272820234299, "eval_ppl": 140.64976501464844, "step": 1500}
|
| 167 |
{"wall": 15431.421, "step": 1500, "loss": 5.33892838160197, "lm_loss": 5.33892838160197, "mtp_loss": 0.0, "lr": 0.0009705172413793103, "grad_norm": 6.3760905265808105, "tokens": 442368000, "adamw_lr": 0.0002986206896551724, "mem_alloc_gb": 19.520028591156006, "mem_reserv_gb": 84.322265625, "loss_smoothed": 5.283117553591728, "seq_len": 4096}
|
| 168 |
+
{"wall": 15717.296, "step": 1510, "loss": 5.346934378147125, "lm_loss": 5.346934378147125, "mtp_loss": 0.0, "lr": 0.0009761206896551723, "grad_norm": 6.276276111602783, "tokens": 445317120, "adamw_lr": 0.0003003448275862069, "mem_alloc_gb": 19.520028591156006, "mem_reserv_gb": 84.361328125, "loss_smoothed": 5.211217642823855, "seq_len": 4096}
|
| 169 |
+
{"wall": 15922.086, "step": 1520, "loss": 5.287456750869751, "lm_loss": 5.287456750869751, "mtp_loss": 0.0, "lr": 0.0009817241379310344, "grad_norm": 5.376161098480225, "tokens": 448266240, "adamw_lr": 0.0003020689655172414, "mem_alloc_gb": 19.520028591156006, "mem_reserv_gb": 84.361328125, "loss_smoothed": 5.18572063545386, "seq_len": 4096}
|
| 170 |
+
{"wall": 16127.158, "step": 1530, "loss": 5.11513215303421, "lm_loss": 5.11513215303421, "mtp_loss": 0.0, "lr": 0.0009873275862068965, "grad_norm": 6.839968681335449, "tokens": 451215360, "adamw_lr": 0.00030379310344827583, "mem_alloc_gb": 19.520028591156006, "mem_reserv_gb": 84.361328125, "loss_smoothed": 5.130177891254425, "seq_len": 4096}
|
| 171 |
+
{"wall": 16331.639, "step": 1540, "loss": 5.071692744890849, "lm_loss": 5.071692744890849, "mtp_loss": 0.0, "lr": 0.0009929310344827585, "grad_norm": 6.261651515960693, "tokens": 454164480, "adamw_lr": 0.00030551724137931036, "mem_alloc_gb": 19.520028591156006, "mem_reserv_gb": 84.361328125, "loss_smoothed": 5.097304126620292, "seq_len": 4096}
|
| 172 |
+
{"wall": 16536.411, "step": 1550, "loss": 4.979173789421718, "lm_loss": 4.979173789421718, "mtp_loss": 0.0, "lr": 0.0009985344827586208, "grad_norm": 5.555693626403809, "tokens": 457113600, "adamw_lr": 0.00030724137931034483, "mem_alloc_gb": 19.520028591156006, "mem_reserv_gb": 84.361328125, "loss_smoothed": 5.013430734475454, "seq_len": 4096}
|
| 173 |
+
{"wall": 16741.532, "step": 1560, "loss": 4.975646068652471, "lm_loss": 4.975646068652471, "mtp_loss": 0.0, "lr": 0.0010041379310344828, "grad_norm": 5.814716339111328, "tokens": 460062720, "adamw_lr": 0.0003089655172413793, "mem_alloc_gb": 19.520028591156006, "mem_reserv_gb": 84.361328125, "loss_smoothed": 5.003384211659432, "seq_len": 4096}
|
| 174 |
+
{"wall": 16946.029, "step": 1570, "loss": 4.806600242853165, "lm_loss": 4.806600242853165, "mtp_loss": 0.0, "lr": 0.0010097413793103448, "grad_norm": 4.644565582275391, "tokens": 463011840, "adamw_lr": 0.0003106896551724138, "mem_alloc_gb": 19.520028591156006, "mem_reserv_gb": 84.361328125, "loss_smoothed": 4.928368596235911, "seq_len": 4096}
|
| 175 |
+
{"wall": 17150.726, "step": 1580, "loss": 5.010419726371765, "lm_loss": 5.010419726371765, "mtp_loss": 0.0, "lr": 0.0010153448275862069, "grad_norm": 6.651735305786133, "tokens": 465960960, "adamw_lr": 0.00031241379310344825, "mem_alloc_gb": 19.520028591156006, "mem_reserv_gb": 84.361328125, "loss_smoothed": 4.904743529359499, "seq_len": 4096}
|
| 176 |
+
{"wall": 17355.841, "step": 1590, "loss": 4.797461291154225, "lm_loss": 4.797461291154225, "mtp_loss": 0.0, "lr": 0.001020948275862069, "grad_norm": 5.675729274749756, "tokens": 468910080, "adamw_lr": 0.0003141379310344827, "mem_alloc_gb": 19.520028591156006, "mem_reserv_gb": 84.361328125, "loss_smoothed": 4.850912700096766, "seq_len": 4096}
|
| 177 |
+
{"wall": 17562.708, "eval_loss": 4.469558209180832, "eval_ppl": 87.3181381225586, "step": 1600}
|
| 178 |
+
{"wall": 17562.709, "step": 1600, "loss": 4.8749673167864485, "lm_loss": 4.8749673167864485, "mtp_loss": 0.0, "lr": 0.001026551724137931, "grad_norm": 5.429701805114746, "tokens": 471859200, "adamw_lr": 0.00031586206896551725, "mem_alloc_gb": 19.520028591156006, "mem_reserv_gb": 84.361328125, "loss_smoothed": 4.812761762738228, "seq_len": 4096}
|