xsum-guidance-adjacency5-1seed-20260923: full-test 1-seed guidance, adjacency=5.0
Browse files- mstok-matched-xsum/xsum-guidance-adjacency5-1seed-20260923/REPORT.md +9 -0
- mstok-matched-xsum/xsum-guidance-adjacency5-1seed-20260923/guidance/seed-0/metrics.json +9 -0
- mstok-matched-xsum/xsum-guidance-adjacency5-1seed-20260923/guidance/seed-0/predictions.jsonl +0 -0
- mstok-matched-xsum/xsum-guidance-adjacency5-1seed-20260923/manifest.json +81 -0
- mstok-matched-xsum/xsum-guidance-adjacency5-1seed-20260923/qualification.json +33 -0
- mstok-matched-xsum/xsum-guidance-adjacency5-1seed-20260923/results.json +36 -0
mstok-matched-xsum/xsum-guidance-adjacency5-1seed-20260923/REPORT.md
ADDED
|
@@ -0,0 +1,9 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# MsTok matched XSum: final raw checkpoint, full test
|
| 2 |
+
|
| 3 |
+
11,233 human-reference test documents; 1 generation seed(s). Single-run scores; seed standard error is not estimated. Adjacency penalty=5.0, window=1, frequency penalty=0, applied to each candidate BEFORE MBR selection. Greedy seed variance is expected to be zero; it is not an estimate of training-seed or document uncertainty. No new De–En experiment was run.
|
| 4 |
+
|
| 5 |
+
| Recipe | ROUGE-1 | ROUGE-2 | ROUGE-L | Gen PPL |
|
| 6 |
+
|---|---:|---:|---:|---:|
|
| 7 |
+
| guidance | 30.74 | 9.42 | 24.01 | 224.85 |
|
| 8 |
+
|
| 9 |
+
MBR@16 uses temperature 0.5, top-p 0.9, no guidance, and the release fast unstemmed ROUGE-1 consensus utility. Guided greedy uses the release level-ramped w=0.5. Final scoring uses Porter-stemmed ROUGE against original references, not codec-reconstructed references. See results.json for per-seed scores, prediction parity, candidate diversity and precise values.
|
mstok-matched-xsum/xsum-guidance-adjacency5-1seed-20260923/guidance/seed-0/metrics.json
ADDED
|
@@ -0,0 +1,9 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"rouge1": 30.737785542001603,
|
| 3 |
+
"rouge2": 9.420765518446128,
|
| 4 |
+
"rougeL": 24.012409925991843,
|
| 5 |
+
"gen_ppl": 224.84736457112797,
|
| 6 |
+
"seed": 0,
|
| 7 |
+
"documents": 11233,
|
| 8 |
+
"empty_predictions": 1
|
| 9 |
+
}
|
mstok-matched-xsum/xsum-guidance-adjacency5-1seed-20260923/guidance/seed-0/predictions.jsonl
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
mstok-matched-xsum/xsum-guidance-adjacency5-1seed-20260923/manifest.json
ADDED
|
@@ -0,0 +1,81 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"step": 50002,
|
| 3 |
+
"weights": "raw",
|
| 4 |
+
"split": "test",
|
| 5 |
+
"documents": 11233,
|
| 6 |
+
"seeds": [
|
| 7 |
+
0
|
| 8 |
+
],
|
| 9 |
+
"nshards": 8,
|
| 10 |
+
"sharding": "whole 32-document blocks, round-robin across GPUs",
|
| 11 |
+
"shard_rng": "generation_seed * 1000003 + shard_index",
|
| 12 |
+
"recipes": {
|
| 13 |
+
"greedy": {
|
| 14 |
+
"cfg": 0.0,
|
| 15 |
+
"temperature": 1.0,
|
| 16 |
+
"top_k": 1,
|
| 17 |
+
"top_p": 0.0,
|
| 18 |
+
"k": 1
|
| 19 |
+
},
|
| 20 |
+
"guidance": {
|
| 21 |
+
"cfg": 0.5,
|
| 22 |
+
"temperature": 1.0,
|
| 23 |
+
"top_k": 1,
|
| 24 |
+
"top_p": 0.0,
|
| 25 |
+
"k": 1
|
| 26 |
+
},
|
| 27 |
+
"mbr16": {
|
| 28 |
+
"cfg": 0.0,
|
| 29 |
+
"temperature": 0.5,
|
| 30 |
+
"top_k": 0,
|
| 31 |
+
"top_p": 0.9,
|
| 32 |
+
"k": 16
|
| 33 |
+
}
|
| 34 |
+
},
|
| 35 |
+
"frequency_penalty": 0.0,
|
| 36 |
+
"adjacency_penalty": 5.0,
|
| 37 |
+
"adjacency_window": 1,
|
| 38 |
+
"adjacency_decay": 1.0,
|
| 39 |
+
"penalty_applied": "every candidate before MBR selection",
|
| 40 |
+
"modes": [
|
| 41 |
+
"guidance"
|
| 42 |
+
],
|
| 43 |
+
"paired_reference_root": null,
|
| 44 |
+
"mbr_utility": "unstemmed ROUGE-1 F consensus, excluding self; reference-free",
|
| 45 |
+
"final_rouge": "Porter-stemmed F, against original human summaries",
|
| 46 |
+
"standard_error": "not estimated: single generation seed",
|
| 47 |
+
"checkpoint": "/home/ishank/mstok/experiments/mstok-matched-xsum/xsum-guidance-adjacency5-1seed-20260923/checkpoint-50002.pt",
|
| 48 |
+
"qualification": {
|
| 49 |
+
"passed": true,
|
| 50 |
+
"checks": {
|
| 51 |
+
"documents": true,
|
| 52 |
+
"all_unpenalized_candidates_match": true,
|
| 53 |
+
"selection_uses_adjusted_candidates": true,
|
| 54 |
+
"penalty_changes_candidates": true,
|
| 55 |
+
"ppl_finite": true
|
| 56 |
+
},
|
| 57 |
+
"source_hashes": {
|
| 58 |
+
"scripts/evaluate_matched_xsum_recipes.py": "c3138e3f0bf5386e17247f71b156c0ea911b3bc30acacf8cbc661f4ba09eea10",
|
| 59 |
+
"scripts/launch_matched_xsum_recipes.py": "0e13cec2e6e3c11e8ae9c05c0b29ada421844eee47777082995b6e94cbbfce69",
|
| 60 |
+
"evaluation/xsum_mbr.py": "ef74cd2277fa6d851b068c30cef90d5f1a3f248846849a56388c261e5a7cbfa7",
|
| 61 |
+
"evaluation/gen_ppl.py": "e6853b14d27f93407505eb7607a1bd9fed49a7add1511ceca2b4a3076d533859",
|
| 62 |
+
"models/next_concept.py": "743667aac3bdceb7bb7476a580700185b2638ddd9575e6357db57acc7d699339",
|
| 63 |
+
"models/quant.py": "2a73244e410761b6fe7894444691d54f2e9e066f5d15e03208aa8c9b9a8f9646",
|
| 64 |
+
"models/vqvae.py": "8eb3503eb1d990121b7d6138a4f8216aecfc72246d4a92bbecf98025c8a3d504",
|
| 65 |
+
"models/vae.py": "02e2213a8878920374baf27dd10dfc03847dce866557c97e816c427d230c9ded",
|
| 66 |
+
"models/common.py": "99aa0da356963a282936413d738ee1da72a3e3f277fecc28eddb553051582a4b",
|
| 67 |
+
"trainer/matched_xsum.py": "b657e3d21cc863a4395b3495ecdafd0349405b64d2159bfaa91efed8f2e285d4",
|
| 68 |
+
"scripts/train_matched_xsum.py": "f8b541d8e6776d8a6341d777c82e6d563f697130843ca04a2d5615f4031ca35c",
|
| 69 |
+
"data/matched_xsum_pretrain.py": "45380fd6d38b82b4ef3d11578a013356fa7f1e817ff8e90ec5d42884b0469d85",
|
| 70 |
+
"evaluation/decoding_penalties.py": "70193076934ae8bf8cf6937f4d0d9acd46356bf20d770d3a18fdac46e652ddf0"
|
| 71 |
+
},
|
| 72 |
+
"unit_tests_passed": 15,
|
| 73 |
+
"documents": 32,
|
| 74 |
+
"seed": 0,
|
| 75 |
+
"adjacency_penalty": 5,
|
| 76 |
+
"frequency_penalty": 0,
|
| 77 |
+
"window": 1,
|
| 78 |
+
"changed_candidates": 347,
|
| 79 |
+
"candidates": 512
|
| 80 |
+
}
|
| 81 |
+
}
|
mstok-matched-xsum/xsum-guidance-adjacency5-1seed-20260923/qualification.json
ADDED
|
@@ -0,0 +1,33 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"passed": true,
|
| 3 |
+
"checks": {
|
| 4 |
+
"documents": true,
|
| 5 |
+
"all_unpenalized_candidates_match": true,
|
| 6 |
+
"selection_uses_adjusted_candidates": true,
|
| 7 |
+
"penalty_changes_candidates": true,
|
| 8 |
+
"ppl_finite": true
|
| 9 |
+
},
|
| 10 |
+
"source_hashes": {
|
| 11 |
+
"scripts/evaluate_matched_xsum_recipes.py": "c3138e3f0bf5386e17247f71b156c0ea911b3bc30acacf8cbc661f4ba09eea10",
|
| 12 |
+
"scripts/launch_matched_xsum_recipes.py": "0e13cec2e6e3c11e8ae9c05c0b29ada421844eee47777082995b6e94cbbfce69",
|
| 13 |
+
"evaluation/xsum_mbr.py": "ef74cd2277fa6d851b068c30cef90d5f1a3f248846849a56388c261e5a7cbfa7",
|
| 14 |
+
"evaluation/gen_ppl.py": "e6853b14d27f93407505eb7607a1bd9fed49a7add1511ceca2b4a3076d533859",
|
| 15 |
+
"models/next_concept.py": "743667aac3bdceb7bb7476a580700185b2638ddd9575e6357db57acc7d699339",
|
| 16 |
+
"models/quant.py": "2a73244e410761b6fe7894444691d54f2e9e066f5d15e03208aa8c9b9a8f9646",
|
| 17 |
+
"models/vqvae.py": "8eb3503eb1d990121b7d6138a4f8216aecfc72246d4a92bbecf98025c8a3d504",
|
| 18 |
+
"models/vae.py": "02e2213a8878920374baf27dd10dfc03847dce866557c97e816c427d230c9ded",
|
| 19 |
+
"models/common.py": "99aa0da356963a282936413d738ee1da72a3e3f277fecc28eddb553051582a4b",
|
| 20 |
+
"trainer/matched_xsum.py": "b657e3d21cc863a4395b3495ecdafd0349405b64d2159bfaa91efed8f2e285d4",
|
| 21 |
+
"scripts/train_matched_xsum.py": "f8b541d8e6776d8a6341d777c82e6d563f697130843ca04a2d5615f4031ca35c",
|
| 22 |
+
"data/matched_xsum_pretrain.py": "45380fd6d38b82b4ef3d11578a013356fa7f1e817ff8e90ec5d42884b0469d85",
|
| 23 |
+
"evaluation/decoding_penalties.py": "70193076934ae8bf8cf6937f4d0d9acd46356bf20d770d3a18fdac46e652ddf0"
|
| 24 |
+
},
|
| 25 |
+
"unit_tests_passed": 15,
|
| 26 |
+
"documents": 32,
|
| 27 |
+
"seed": 0,
|
| 28 |
+
"adjacency_penalty": 5,
|
| 29 |
+
"frequency_penalty": 0,
|
| 30 |
+
"window": 1,
|
| 31 |
+
"changed_candidates": 347,
|
| 32 |
+
"candidates": 512
|
| 33 |
+
}
|
mstok-matched-xsum/xsum-guidance-adjacency5-1seed-20260923/results.json
ADDED
|
@@ -0,0 +1,36 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"guidance": {
|
| 3 |
+
"per_seed": [
|
| 4 |
+
{
|
| 5 |
+
"rouge1": 30.737785542001603,
|
| 6 |
+
"rouge2": 9.420765518446128,
|
| 7 |
+
"rougeL": 24.012409925991843,
|
| 8 |
+
"gen_ppl": 224.84736457112797,
|
| 9 |
+
"seed": 0,
|
| 10 |
+
"documents": 11233,
|
| 11 |
+
"empty_predictions": 1
|
| 12 |
+
}
|
| 13 |
+
],
|
| 14 |
+
"summary": {
|
| 15 |
+
"rouge1": {
|
| 16 |
+
"mean": 30.737785542001603,
|
| 17 |
+
"standard_error": null
|
| 18 |
+
},
|
| 19 |
+
"rouge2": {
|
| 20 |
+
"mean": 9.420765518446128,
|
| 21 |
+
"standard_error": null
|
| 22 |
+
},
|
| 23 |
+
"rougeL": {
|
| 24 |
+
"mean": 24.012409925991843,
|
| 25 |
+
"standard_error": null
|
| 26 |
+
},
|
| 27 |
+
"gen_ppl": {
|
| 28 |
+
"mean": 224.84736457112797,
|
| 29 |
+
"standard_error": null
|
| 30 |
+
}
|
| 31 |
+
},
|
| 32 |
+
"differing_predictions_vs_seed0": [
|
| 33 |
+
0
|
| 34 |
+
]
|
| 35 |
+
}
|
| 36 |
+
}
|