iskhare commited on
Commit
a1a2e56
·
verified ·
1 Parent(s): 2a06542

MsTok matched XSum joint-main-300k-20260922-v1-conditional: step 50002

Browse files
mstok-matched-xsum/joint-main-300k-20260922-v1-conditional/step-50002/checkpoint.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8e3cdcf174cdc1fd991a854f0b1ca019a84d7d67dc46dc9eaea79b34a394f811
3
+ size 2741342224
mstok-matched-xsum/joint-main-300k-20260922-v1-conditional/step-50002/ema/export/tokenizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bb7c3bbcd7bdc1da9a0cb1fc123ecee6eeb2ef456bc270c7619f8185c4c55134
3
+ size 299639549
mstok-matched-xsum/joint-main-300k-20260922-v1-conditional/step-50002/ema/export/xsum.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:91bee359c7868f5e535798b48ce128a600fb06eeeced030bc1acea15a7eca2ac
3
+ size 354177931
mstok-matched-xsum/joint-main-300k-20260922-v1-conditional/step-50002/ema/metrics.json ADDED
@@ -0,0 +1,22 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "step": 50002,
3
+ "variant": "ema",
4
+ "split": "validation",
5
+ "documents": 256,
6
+ "decoding": "greedy; predicted L0; 9 NFE",
7
+ "empty_predictions": 0,
8
+ "l0_code_accuracy": 0.0361328125,
9
+ "released_inference_parity": null,
10
+ "self": {
11
+ "rouge1": 30.419240367687962,
12
+ "rouge2": 10.23110889369133,
13
+ "rougeL": 24.355588641077116,
14
+ "gen_ppl": 396.02394020492585
15
+ },
16
+ "oracle": {
17
+ "rouge1": 37.30270648532822,
18
+ "rouge2": 15.861188503038656,
19
+ "rougeL": 32.53096896323249,
20
+ "gen_ppl": 354.3321713544221
21
+ }
22
+ }
mstok-matched-xsum/joint-main-300k-20260922-v1-conditional/step-50002/ema/predictions.jsonl ADDED
The diff for this file is too large to render. See raw diff
 
mstok-matched-xsum/joint-main-300k-20260922-v1-conditional/step-50002/manifest.json ADDED
@@ -0,0 +1,189 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "config": {
3
+ "release_config": "config/final-release/xsum/conditional-gen.yaml",
4
+ "experiment": "mstok-matched-xsum",
5
+ "data_root": "/home/ishank/data/xsum-repro-20260921",
6
+ "seed": 42,
7
+ "codec_seed": 42,
8
+ "generator_seed": 55,
9
+ "global_batch": 512,
10
+ "total_updates": 50002,
11
+ "codec_lr": 0.0005,
12
+ "codec_min_lr": 5e-05,
13
+ "codec_warmup": 1000,
14
+ "codec_weight_decay": 0.01,
15
+ "generator_lr": 0.0003,
16
+ "generator_warmup": 200,
17
+ "generator_weight_decay": 0.1,
18
+ "beta1": 0.9,
19
+ "beta2": 0.95,
20
+ "max_grad_norm": 1.0,
21
+ "codebook_decay": 0.95,
22
+ "generator_ema_decay": 0.9999,
23
+ "checkpoint_interval": 2000,
24
+ "validation_interval": 1000,
25
+ "validation_batches": 8,
26
+ "neighbor_refresh_interval": 100,
27
+ "objectives": {
28
+ "codec_weight": 1.0,
29
+ "ncp_weight": 1.0,
30
+ "mstok_weight": 0.25,
31
+ "residual_weight": 1.0,
32
+ "reconstruction_weight": 1.0,
33
+ "soft_assignment_temperature": 1.0,
34
+ "prediction_temperature": 1.0,
35
+ "teacher_ema_decay": 0.999,
36
+ "teacher_ema_warmup_steps": 1000,
37
+ "mstok_warmup_steps": 500
38
+ },
39
+ "semantic": {
40
+ "enabled": true,
41
+ "weight": 0.5,
42
+ "warmup_steps": 500,
43
+ "teacher_dim": 768,
44
+ "projector_dim": 2048,
45
+ "projector_seed": 56,
46
+ "teacher_id": "FacebookAI/roberta-base",
47
+ "teacher_revision": "e2da8e2f811d1448a5b465c236feacd80ffbac7b",
48
+ "tokenizer_revision": "607a30d783dfa663caf39e06633721c8d4cfcd7e"
49
+ },
50
+ "resolved_codec": {
51
+ "n_layers": 6,
52
+ "embed_dim": 384,
53
+ "in_vocab_size": 50304,
54
+ "context_length": 48,
55
+ "compression_factor": 1,
56
+ "dropout": 0.1,
57
+ "pre_quant_groupnorm": 8,
58
+ "use_qk_norm": true,
59
+ "pre_quant_dropout": 0.25,
60
+ "vqvae_vocab_size": [
61
+ 4096,
62
+ 4096,
63
+ 4096,
64
+ 4096,
65
+ 4096,
66
+ 4096,
67
+ 4096,
68
+ 4096,
69
+ 4096
70
+ ],
71
+ "vector_quantizer_config": {
72
+ "clss": "multiscale_residual_vector_quantizer",
73
+ "decay": 0.95,
74
+ "epsilon": 1e-05,
75
+ "commitment_cost": 0.25,
76
+ "learned_l1_sampling": true,
77
+ "learned_l1_cascade": true,
78
+ "learned_l1_cascade_base": 4,
79
+ "learned_all_sampling": false,
80
+ "quant_resi": {
81
+ "enabled": true,
82
+ "ratio": 0.5,
83
+ "share_mode": 0,
84
+ "learnable_ratio": false
85
+ },
86
+ "aux": {
87
+ "fine_drop": {
88
+ "prob": 0.5,
89
+ "min_keep": 1
90
+ }
91
+ },
92
+ "levels": {
93
+ "use_manual_levels": true,
94
+ "manual_levels": [
95
+ 4,
96
+ 6,
97
+ 10,
98
+ 14,
99
+ 20,
100
+ 26,
101
+ 32,
102
+ 40,
103
+ 48
104
+ ]
105
+ },
106
+ "learned_l1_cascade_norm": true,
107
+ "learned_l1_cascade_norm_final": true,
108
+ "ema_scale_by_world_size": false
109
+ }
110
+ },
111
+ "resolved_generator": {
112
+ "n_layer": 12,
113
+ "n_head": 12,
114
+ "bias": true,
115
+ "dropout": 0.3,
116
+ "n_embd": 768,
117
+ "context_length": 560,
118
+ "prefix_len": 512,
119
+ "raw_token_prefix": true,
120
+ "prefix_pad_token_id": 50257,
121
+ "vocab_size": [
122
+ 4096,
123
+ 4096,
124
+ 4096,
125
+ 4096,
126
+ 4096,
127
+ 4096,
128
+ 4096,
129
+ 4096,
130
+ 4096
131
+ ],
132
+ "predict_level0": false,
133
+ "attn_pattern": "block_diagonal",
134
+ "use_positional_encoding": true,
135
+ "use_level_encoding": true,
136
+ "use_rope": true,
137
+ "rope_base": 100000,
138
+ "use_qk_norm": true,
139
+ "ctx_encoder": {
140
+ "enabled": false,
141
+ "n_layer": 4,
142
+ "vocab_size": 50304
143
+ },
144
+ "use_flex_attention": false,
145
+ "query_level0": true,
146
+ "tie_heads_to_codebook": true,
147
+ "tie_heads_learn_scale": true
148
+ }
149
+ },
150
+ "runtime": {
151
+ "world": 8,
152
+ "microbatch": 32,
153
+ "accumulation": 2,
154
+ "deterministic": true,
155
+ "compile": true
156
+ },
157
+ "source_sha256": {
158
+ "scripts/train_matched_xsum.py": "f8b541d8e6776d8a6341d777c82e6d563f697130843ca04a2d5615f4031ca35c",
159
+ "trainer/matched_xsum.py": "b657e3d21cc863a4395b3495ecdafd0349405b64d2159bfaa91efed8f2e285d4",
160
+ "trainer/mstok_trainer.py": "90712e396472d5dac9679b62af4f0b62afa6390a839d4d9bd9dae57406fe76a4",
161
+ "trainer/joint_trainer.py": "8c8ebb55d21b6e223be1f7595c51f1b9257ccac40f8cff28260c1088656e2e49",
162
+ "trainer/semantic_teacher.py": "7983b5da86d25954ed8267eee03d144c421305967705e0a242f4f025794ceeae",
163
+ "trainer/semantic_mstok_trainer.py": "ebc02e80d279a445c99d8f09505cdfaf7632f1a661d6880f09cc1bd0fa90ef30",
164
+ "models/next_concept.py": "743667aac3bdceb7bb7476a580700185b2638ddd9575e6357db57acc7d699339",
165
+ "models/quant.py": "2a73244e410761b6fe7894444691d54f2e9e066f5d15e03208aa8c9b9a8f9646",
166
+ "models/vqvae.py": "8eb3503eb1d990121b7d6138a4f8216aecfc72246d4a92bbecf98025c8a3d504",
167
+ "models/vae.py": "02e2213a8878920374baf27dd10dfc03847dce866557c97e816c427d230c9ded",
168
+ "models/common.py": "99aa0da356963a282936413d738ee1da72a3e3f277fecc28eddb553051582a4b",
169
+ "data/matched_xsum_pretrain.py": "45380fd6d38b82b4ef3d11578a013356fa7f1e817ff8e90ec5d42884b0469d85"
170
+ },
171
+ "mode": "train",
172
+ "resumed_from": null,
173
+ "initialized_from_pretraining": {
174
+ "checkpoint": "/home/ishank/mstok/experiments/mstok-matched-xsum/joint-main-300k-20260922-v1/joint-main-300k-20260922-v1-pretrain/training/checkpoint-300000.pt",
175
+ "step": 300000,
176
+ "weights": "complete-pair deployment EMA",
177
+ "regenerated_buffers": [
178
+ "ncp.attn_mask_for_masking"
179
+ ],
180
+ "optimizer": "fresh",
181
+ "generator_ema_decay": 0.9999
182
+ },
183
+ "semantic_teacher": {
184
+ "teacher_id": "FacebookAI/roberta-base",
185
+ "teacher_revision": "e2da8e2f811d1448a5b465c236feacd80ffbac7b",
186
+ "tokenizer_revision": "607a30d783dfa663caf39e06633721c8d4cfcd7e",
187
+ "token_map_sha256": "0d5aa4e0a98157722f03cf9a0c7a1f17178c370dd728896090077ea9efe0b593"
188
+ }
189
+ }
mstok-matched-xsum/joint-main-300k-20260922-v1-conditional/step-50002/raw/export/tokenizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8511c4c91d7a60479051051d607bb0693ea641c686c5ea40fee0073b7c4266a1
3
+ size 299639549
mstok-matched-xsum/joint-main-300k-20260922-v1-conditional/step-50002/raw/export/xsum.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ba98f2f3bfd4fe1c6e7f7632bd60e404f71b8e57f00c1a3e1a377d2d829b1144
3
+ size 354177931
mstok-matched-xsum/joint-main-300k-20260922-v1-conditional/step-50002/raw/metrics.json ADDED
@@ -0,0 +1,22 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "step": 50002,
3
+ "variant": "raw",
4
+ "split": "validation",
5
+ "documents": 256,
6
+ "decoding": "greedy; predicted L0; 9 NFE",
7
+ "empty_predictions": 0,
8
+ "l0_code_accuracy": 0.009765625,
9
+ "released_inference_parity": null,
10
+ "self": {
11
+ "rouge1": 30.50013370220306,
12
+ "rouge2": 9.455983395905493,
13
+ "rougeL": 24.119169729307878,
14
+ "gen_ppl": 190.3869692959584
15
+ },
16
+ "oracle": {
17
+ "rouge1": 39.21345003893329,
18
+ "rouge2": 16.19865555394947,
19
+ "rougeL": 34.01795531605818,
20
+ "gen_ppl": 118.8333403796817
21
+ }
22
+ }
mstok-matched-xsum/joint-main-300k-20260922-v1-conditional/step-50002/raw/predictions.jsonl ADDED
The diff for this file is too large to render. See raw diff