Text Generation
Transformers
Safetensors
English
pollock
causal-lm
gpt2
nanogpt
swiglu
bpe
educational
base-model
custom_code
Eval Results (legacy)
Instructions to use SlayerLab/pollock-mini-lm-125m with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use SlayerLab/pollock-mini-lm-125m with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="SlayerLab/pollock-mini-lm-125m", trust_remote_code=True)# pip install -U transformers accelerate # Load model directly from transformers import AutoModelForCausalLM model = AutoModelForCausalLM.from_pretrained("SlayerLab/pollock-mini-lm-125m", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use SlayerLab/pollock-mini-lm-125m with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "SlayerLab/pollock-mini-lm-125m" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "SlayerLab/pollock-mini-lm-125m", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/SlayerLab/pollock-mini-lm-125m
- SGLang
How to use SlayerLab/pollock-mini-lm-125m with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "SlayerLab/pollock-mini-lm-125m" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "SlayerLab/pollock-mini-lm-125m", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "SlayerLab/pollock-mini-lm-125m" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "SlayerLab/pollock-mini-lm-125m", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use SlayerLab/pollock-mini-lm-125m with Docker Model Runner:
docker model run hf.co/SlayerLab/pollock-mini-lm-125m
eval: niezalezna ewaluacja r003(v1.1) vs r006 (Arkadiusz Slota) - pliki, bez zmian karty
#2
by Maggio33 - opened
evaluations/independent-eval-slota-2026-08-30.md
ADDED
|
@@ -0,0 +1,40 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# Niezależna ewaluacja — r003 (v1.1) vs r006 (v1.4)
|
| 2 |
+
|
| 3 |
+
**Autor:** Arkadiusz Słota · **Data:** 2026-08-30 · **Kontrybucja:** dodana jako PR (karta modelu nietknięta)
|
| 4 |
+
|
| 5 |
+
Rzetelne, powtarzalne testy zero-shot obu rewizji na **jednym harnessie**
|
| 6 |
+
(`lm-evaluation-harness 0.4.12` — ta sama wersja co w karcie), bf16, batch 8, pełne splity,
|
| 7 |
+
GPU AMD RX 7900 XTX (ROCm/WSL). Surowe wyniki: `evaluations/r003-v1.1.json`, `evaluations/r006.json`.
|
| 8 |
+
|
| 9 |
+
## Walidacja setupu (nasz r006 vs liczby z karty)
|
| 10 |
+
LAMBADA 0,2750/ppl 49,999 (karta 0,2769/49,907) · HellaSwag 0,3014 (0,3013) · SciQ 0,6630 (0,6640)
|
| 11 |
+
· ARC-C 0,2440 (0,2415) · ARC-E 0,4314 (0,4343) · PIQA 0,5914 (0,5968) · BLiMP 0,7801 (0,7692).
|
| 12 |
+
→ 5/7 tasków 1:1; BLiMP +0,011 (różnica wersji `datasets`). Setup potwierdzony.
|
| 13 |
+
|
| 14 |
+
## Wynik: r003 (v1.1) vs r006 (v1.4) — identyczny harness
|
| 15 |
+
| task | metryka | r003 (v1.1) | r006 (v1.4) | Δ (v1.1−r006) | stderr |
|
| 16 |
+
|---|---|---:|---:|---:|---:|
|
| 17 |
+
| BLiMP | acc | **0,7921** | 0,7801 | +0,0120 | 0,0014 |
|
| 18 |
+
| LAMBADA | acc | **0,2926** | 0,2750 | +0,0176 | 0,0063 |
|
| 19 |
+
| LAMBADA | ppl ↓ | **47,61** | 50,00 | −2,39 | ~1,8 |
|
| 20 |
+
| PIQA | acc_norm | **0,6143** | 0,5914 | +0,0229 | 0,0114 |
|
| 21 |
+
| HellaSwag | acc_norm | 0,3036 | 0,3014 | +0,0022 | 0,0046 |
|
| 22 |
+
| ARC-Challenge | acc_norm | 0,2517 | 0,2440 | +0,0077 | 0,0126 |
|
| 23 |
+
| SciQ | acc_norm | 0,6570 | 0,6630 | −0,0060 | 0,0150 |
|
| 24 |
+
| ARC-Easy | acc_norm | 0,4272 | 0,4314 | −0,0042 | 0,0102 |
|
| 25 |
+
|
| 26 |
+
## Wniosek
|
| 27 |
+
**r003 (v1.1) ≥ r006 (v1.4) na 6 z 8 metryk; istotnie lepszy na BLiMP, LAMBADA (acc+ppl) i PIQA.**
|
| 28 |
+
Rewizje r004–r006 (m.in. swap tokenizera w r005 i powrót w r006) nie podniosły downstream zero-shot —
|
| 29 |
+
r003 pozostaje mocnym, miejscami najlepszym checkpointem.
|
| 30 |
+
|
| 31 |
+
Zastrzeżenia: to zero-shot na modelu ~127M (liczy się różnica, nie poziom bezwzględny); zmiana
|
| 32 |
+
v1.1→v1.4 miesza korpus + tokenizer + kroki, więc nie izoluje pojedynczej przyczyny — pełne „dlaczego"
|
| 33 |
+
wymagałoby ablacji per-zmiana (ten sam korpus/tokenizer/budżet, jedna zmienna naraz).
|
| 34 |
+
|
| 35 |
+
## Reprodukcja
|
| 36 |
+
```
|
| 37 |
+
lm_eval --model hf \
|
| 38 |
+
--model_args pretrained=SlayerLab/pollock-mini-lm-125m,revision=<v1.1|a2e53d9>,dtype=bfloat16 \
|
| 39 |
+
--tasks blimp,lambada_openai,hellaswag,piqa,sciq,arc_easy,arc_challenge --batch_size 8 --device cuda
|
| 40 |
+
```
|
evaluations/r003-v1.1.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
evaluations/r006.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|