eval: niezalezna ewaluacja r003(v1.1) vs r006 (Arkadiusz Slota) - pliki, bez zmian karty

#2
evaluations/independent-eval-slota-2026-08-30.md ADDED
@@ -0,0 +1,40 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # Niezależna ewaluacja — r003 (v1.1) vs r006 (v1.4)
2
+
3
+ **Autor:** Arkadiusz Słota · **Data:** 2026-08-30 · **Kontrybucja:** dodana jako PR (karta modelu nietknięta)
4
+
5
+ Rzetelne, powtarzalne testy zero-shot obu rewizji na **jednym harnessie**
6
+ (`lm-evaluation-harness 0.4.12` — ta sama wersja co w karcie), bf16, batch 8, pełne splity,
7
+ GPU AMD RX 7900 XTX (ROCm/WSL). Surowe wyniki: `evaluations/r003-v1.1.json`, `evaluations/r006.json`.
8
+
9
+ ## Walidacja setupu (nasz r006 vs liczby z karty)
10
+ LAMBADA 0,2750/ppl 49,999 (karta 0,2769/49,907) · HellaSwag 0,3014 (0,3013) · SciQ 0,6630 (0,6640)
11
+ · ARC-C 0,2440 (0,2415) · ARC-E 0,4314 (0,4343) · PIQA 0,5914 (0,5968) · BLiMP 0,7801 (0,7692).
12
+ → 5/7 tasków 1:1; BLiMP +0,011 (różnica wersji `datasets`). Setup potwierdzony.
13
+
14
+ ## Wynik: r003 (v1.1) vs r006 (v1.4) — identyczny harness
15
+ | task | metryka | r003 (v1.1) | r006 (v1.4) | Δ (v1.1−r006) | stderr |
16
+ |---|---|---:|---:|---:|---:|
17
+ | BLiMP | acc | **0,7921** | 0,7801 | +0,0120 | 0,0014 |
18
+ | LAMBADA | acc | **0,2926** | 0,2750 | +0,0176 | 0,0063 |
19
+ | LAMBADA | ppl ↓ | **47,61** | 50,00 | −2,39 | ~1,8 |
20
+ | PIQA | acc_norm | **0,6143** | 0,5914 | +0,0229 | 0,0114 |
21
+ | HellaSwag | acc_norm | 0,3036 | 0,3014 | +0,0022 | 0,0046 |
22
+ | ARC-Challenge | acc_norm | 0,2517 | 0,2440 | +0,0077 | 0,0126 |
23
+ | SciQ | acc_norm | 0,6570 | 0,6630 | −0,0060 | 0,0150 |
24
+ | ARC-Easy | acc_norm | 0,4272 | 0,4314 | −0,0042 | 0,0102 |
25
+
26
+ ## Wniosek
27
+ **r003 (v1.1) ≥ r006 (v1.4) na 6 z 8 metryk; istotnie lepszy na BLiMP, LAMBADA (acc+ppl) i PIQA.**
28
+ Rewizje r004–r006 (m.in. swap tokenizera w r005 i powrót w r006) nie podniosły downstream zero-shot —
29
+ r003 pozostaje mocnym, miejscami najlepszym checkpointem.
30
+
31
+ Zastrzeżenia: to zero-shot na modelu ~127M (liczy się różnica, nie poziom bezwzględny); zmiana
32
+ v1.1→v1.4 miesza korpus + tokenizer + kroki, więc nie izoluje pojedynczej przyczyny — pełne „dlaczego"
33
+ wymagałoby ablacji per-zmiana (ten sam korpus/tokenizer/budżet, jedna zmienna naraz).
34
+
35
+ ## Reprodukcja
36
+ ```
37
+ lm_eval --model hf \
38
+ --model_args pretrained=SlayerLab/pollock-mini-lm-125m,revision=<v1.1|a2e53d9>,dtype=bfloat16 \
39
+ --tasks blimp,lambada_openai,hellaswag,piqa,sciq,arc_easy,arc_challenge --batch_size 8 --device cuda
40
+ ```
evaluations/r003-v1.1.json ADDED
The diff for this file is too large to render. See raw diff
 
evaluations/r006.json ADDED
The diff for this file is too large to render. See raw diff