jbostock commited on
Commit
caaeb71
Β·
verified Β·
1 Parent(s): 085e039

Python4 AFT adapter smoke 20260810T011719Z control

Browse files
.gitattributes CHANGED
@@ -35,3 +35,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
  smoke/20260810T004645Z/arms/control/adapter/tokenizer.json filter=lfs diff=lfs merge=lfs -text
37
  smoke/20260810T005919Z/arms/control/adapter/tokenizer.json filter=lfs diff=lfs merge=lfs -text
 
 
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
  smoke/20260810T004645Z/arms/control/adapter/tokenizer.json filter=lfs diff=lfs merge=lfs -text
37
  smoke/20260810T005919Z/arms/control/adapter/tokenizer.json filter=lfs diff=lfs merge=lfs -text
38
+ smoke/20260810T011719Z/arms/control/adapter/tokenizer.json filter=lfs diff=lfs merge=lfs -text
smoke/20260810T011719Z/arms/control/adapter/adapter_config.json ADDED
@@ -0,0 +1,189 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "/workspace/python4-aft-state/20260810T011719Z/control/parent/control/sft/end",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": null,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 128,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.0,
22
+ "lora_ga_config": null,
23
+ "megatron_config": null,
24
+ "megatron_core": "megatron.core",
25
+ "modules_to_save": null,
26
+ "peft_type": "LORA",
27
+ "peft_version": "0.19.1",
28
+ "qalora_group_size": 16,
29
+ "r": 64,
30
+ "rank_pattern": {},
31
+ "revision": null,
32
+ "target_modules": [
33
+ "language_model.layers.17.self_attn.q_proj",
34
+ "43.self_attn.v_proj",
35
+ "language_model.layers.16.self_attn.k_proj",
36
+ "language_model.layers.23.self_attn.q_proj",
37
+ "language_model.layers.26.self_attn.v_proj",
38
+ "language_model.layers.5.self_attn.v_proj",
39
+ "language_model.layers.16.self_attn.v_proj",
40
+ "language_model.layers.14.self_attn.k_proj",
41
+ "language_model.layers.3.self_attn.q_proj",
42
+ "32.self_attn.q_proj",
43
+ "40.self_attn.q_proj",
44
+ "43.self_attn.q_proj",
45
+ "language_model.layers.9.self_attn.q_proj",
46
+ "27.self_attn.k_proj",
47
+ "language_model.layers.21.self_attn.q_proj",
48
+ "33.self_attn.k_proj",
49
+ "language_model.layers.1.self_attn.q_proj",
50
+ "language_model.layers.18.self_attn.q_proj",
51
+ "language_model.layers.21.self_attn.k_proj",
52
+ "language_model.layers.11.self_attn.v_proj",
53
+ "44.self_attn.v_proj",
54
+ "language_model.layers.6.self_attn.q_proj",
55
+ "language_model.layers.20.self_attn.q_proj",
56
+ "40.self_attn.v_proj",
57
+ "language_model.layers.10.self_attn.k_proj",
58
+ "41.self_attn.v_proj",
59
+ "language_model.layers.12.self_attn.k_proj",
60
+ "language_model.layers.11.self_attn.q_proj",
61
+ "language_model.layers.8.self_attn.v_proj",
62
+ "language_model.layers.0.self_attn.q_proj",
63
+ "language_model.layers.0.self_attn.k_proj",
64
+ "37.self_attn.k_proj",
65
+ "language_model.layers.2.self_attn.q_proj",
66
+ "language_model.layers.2.self_attn.k_proj",
67
+ "language_model.layers.15.self_attn.k_proj",
68
+ "45.self_attn.k_proj",
69
+ "29.self_attn.k_proj",
70
+ "language_model.layers.19.self_attn.k_proj",
71
+ "35.self_attn.q_proj",
72
+ "30.self_attn.v_proj",
73
+ "28.self_attn.q_proj",
74
+ "45.self_attn.q_proj",
75
+ "language_model.layers.13.self_attn.k_proj",
76
+ "40.self_attn.k_proj",
77
+ "language_model.layers.8.self_attn.q_proj",
78
+ "41.self_attn.q_proj",
79
+ "language_model.layers.11.self_attn.k_proj",
80
+ "34.self_attn.q_proj",
81
+ "language_model.layers.18.self_attn.v_proj",
82
+ "29.self_attn.q_proj",
83
+ "language_model.layers.15.self_attn.v_proj",
84
+ "language_model.layers.7.self_attn.k_proj",
85
+ "38.self_attn.k_proj",
86
+ "language_model.layers.22.self_attn.q_proj",
87
+ "language_model.layers.3.self_attn.v_proj",
88
+ "language_model.layers.7.self_attn.q_proj",
89
+ "language_model.layers.25.self_attn.v_proj",
90
+ "language_model.layers.16.self_attn.q_proj",
91
+ "32.self_attn.v_proj",
92
+ "31.self_attn.q_proj",
93
+ "language_model.layers.9.self_attn.k_proj",
94
+ "language_model.layers.14.self_attn.q_proj",
95
+ "o_proj",
96
+ "language_model.layers.26.self_attn.q_proj",
97
+ "43.self_attn.k_proj",
98
+ "37.self_attn.v_proj",
99
+ "language_model.layers.13.self_attn.q_proj",
100
+ "46.self_attn.k_proj",
101
+ "37.self_attn.q_proj",
102
+ "language_model.layers.23.self_attn.v_proj",
103
+ "31.self_attn.v_proj",
104
+ "language_model.layers.5.self_attn.k_proj",
105
+ "33.self_attn.v_proj",
106
+ "36.self_attn.q_proj",
107
+ "up_proj",
108
+ "language_model.layers.17.self_attn.v_proj",
109
+ "29.self_attn.v_proj",
110
+ "34.self_attn.v_proj",
111
+ "39.self_attn.k_proj",
112
+ "language_model.layers.25.self_attn.q_proj",
113
+ "language_model.layers.4.self_attn.v_proj",
114
+ "27.self_attn.q_proj",
115
+ "language_model.layers.15.self_attn.q_proj",
116
+ "language_model.layers.20.self_attn.v_proj",
117
+ "30.self_attn.q_proj",
118
+ "28.self_attn.v_proj",
119
+ "35.self_attn.v_proj",
120
+ "language_model.layers.9.self_attn.v_proj",
121
+ "47.self_attn.q_proj",
122
+ "46.self_attn.v_proj",
123
+ "35.self_attn.k_proj",
124
+ "33.self_attn.q_proj",
125
+ "language_model.layers.21.self_attn.v_proj",
126
+ "42.self_attn.v_proj",
127
+ "47.self_attn.v_proj",
128
+ "36.self_attn.k_proj",
129
+ "language_model.layers.17.self_attn.k_proj",
130
+ "47.self_attn.k_proj",
131
+ "31.self_attn.k_proj",
132
+ "language_model.layers.12.self_attn.v_proj",
133
+ "41.self_attn.k_proj",
134
+ "39.self_attn.v_proj",
135
+ "language_model.layers.4.self_attn.k_proj",
136
+ "42.self_attn.k_proj",
137
+ "language_model.layers.10.self_attn.q_proj",
138
+ "30.self_attn.k_proj",
139
+ "32.self_attn.k_proj",
140
+ "language_model.layers.13.self_attn.v_proj",
141
+ "language_model.layers.2.self_attn.v_proj",
142
+ "language_model.layers.12.self_attn.q_proj",
143
+ "language_model.layers.24.self_attn.q_proj",
144
+ "38.self_attn.v_proj",
145
+ "36.self_attn.v_proj",
146
+ "34.self_attn.k_proj",
147
+ "language_model.layers.5.self_attn.q_proj",
148
+ "language_model.layers.23.self_attn.k_proj",
149
+ "44.self_attn.k_proj",
150
+ "language_model.layers.14.self_attn.v_proj",
151
+ "language_model.layers.19.self_attn.v_proj",
152
+ "38.self_attn.q_proj",
153
+ "language_model.layers.6.self_attn.v_proj",
154
+ "27.self_attn.v_proj",
155
+ "28.self_attn.k_proj",
156
+ "language_model.layers.3.self_attn.k_proj",
157
+ "language_model.layers.0.self_attn.v_proj",
158
+ "gate_proj",
159
+ "language_model.layers.8.self_attn.k_proj",
160
+ "language_model.layers.6.self_attn.k_proj",
161
+ "down_proj",
162
+ "language_model.layers.20.self_attn.k_proj",
163
+ "language_model.layers.4.self_attn.q_proj",
164
+ "46.self_attn.q_proj",
165
+ "language_model.layers.22.self_attn.k_proj",
166
+ "language_model.layers.18.self_attn.k_proj",
167
+ "language_model.layers.22.self_attn.v_proj",
168
+ "44.self_attn.q_proj",
169
+ "45.self_attn.v_proj",
170
+ "language_model.layers.19.self_attn.q_proj",
171
+ "language_model.layers.24.self_attn.k_proj",
172
+ "language_model.layers.26.self_attn.k_proj",
173
+ "language_model.layers.7.self_attn.v_proj",
174
+ "language_model.layers.1.self_attn.v_proj",
175
+ "language_model.layers.24.self_attn.v_proj",
176
+ "language_model.layers.10.self_attn.v_proj",
177
+ "42.self_attn.q_proj",
178
+ "39.self_attn.q_proj",
179
+ "language_model.layers.1.self_attn.k_proj",
180
+ "language_model.layers.25.self_attn.k_proj"
181
+ ],
182
+ "target_parameters": [],
183
+ "task_type": "CAUSAL_LM",
184
+ "trainable_token_indices": null,
185
+ "use_bdlora": null,
186
+ "use_dora": false,
187
+ "use_qalora": false,
188
+ "use_rslora": false
189
+ }
smoke/20260810T011719Z/arms/control/adapter/adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dce8fd2e0bd75cf349ef61413aa8e1ceea58c873d4198d84264442877847a27b
3
+ size 1047628488
smoke/20260810T011719Z/arms/control/adapter/chat_template.jinja ADDED
@@ -0,0 +1,47 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {{ bos_token }}
2
+ {%- if messages[0]['role'] == 'system' -%}
3
+ {%- if messages[0]['content'] is string -%}
4
+ {%- set first_user_prefix = messages[0]['content'] + '
5
+
6
+ ' -%}
7
+ {%- else -%}
8
+ {%- set first_user_prefix = messages[0]['content'][0]['text'] + '
9
+
10
+ ' -%}
11
+ {%- endif -%}
12
+ {%- set loop_messages = messages[1:] -%}
13
+ {%- else -%}
14
+ {%- set first_user_prefix = "" -%}
15
+ {%- set loop_messages = messages -%}
16
+ {%- endif -%}
17
+ {%- for message in loop_messages -%}
18
+ {%- if (message['role'] == 'user') != (loop.index0 % 2 == 0) -%}
19
+ {{ raise_exception("Conversation roles must alternate user/assistant/user/assistant/...") }}
20
+ {%- endif -%}
21
+ {%- if (message['role'] == 'assistant') -%}
22
+ {%- set role = "model" -%}
23
+ {%- else -%}
24
+ {%- set role = message['role'] -%}
25
+ {%- endif -%}
26
+ {{ '<start_of_turn>' + role + '
27
+ ' + (first_user_prefix if loop.first else "") }}
28
+ {%- if message['content'] is string -%}
29
+ {{ message['content'] | trim }}
30
+ {%- elif message['content'] is iterable -%}
31
+ {%- for item in message['content'] -%}
32
+ {%- if item['type'] == 'image' -%}
33
+ {{ '<start_of_image>' }}
34
+ {%- elif item['type'] == 'text' -%}
35
+ {{ item['text'] | trim }}
36
+ {%- endif -%}
37
+ {%- endfor -%}
38
+ {%- else -%}
39
+ {{ raise_exception("Invalid content type") }}
40
+ {%- endif -%}
41
+ {{ '<end_of_turn>
42
+ ' }}
43
+ {%- endfor -%}
44
+ {%- if add_generation_prompt -%}
45
+ {{'<start_of_turn>model
46
+ '}}
47
+ {%- endif -%}
smoke/20260810T011719Z/arms/control/adapter/config.json ADDED
@@ -0,0 +1,125 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Gemma3ForConditionalGeneration"
4
+ ],
5
+ "boi_token_index": 255999,
6
+ "bos_token_id": 2,
7
+ "dtype": "bfloat16",
8
+ "eoi_token_index": 256000,
9
+ "eos_token_id": 1,
10
+ "image_token_index": 262144,
11
+ "initializer_range": 0.02,
12
+ "mm_tokens_per_image": 256,
13
+ "model_type": "gemma3",
14
+ "pad_token_id": 0,
15
+ "text_config": {
16
+ "_sliding_window_pattern": 6,
17
+ "attention_bias": false,
18
+ "attention_dropout": 0.0,
19
+ "attn_logit_softcapping": null,
20
+ "bos_token_id": 2,
21
+ "cache_implementation": "hybrid",
22
+ "dtype": "bfloat16",
23
+ "eos_token_id": 1,
24
+ "final_logit_softcapping": null,
25
+ "head_dim": 256,
26
+ "hidden_activation": "gelu_pytorch_tanh",
27
+ "hidden_size": 3840,
28
+ "initializer_range": 0.02,
29
+ "intermediate_size": 15360,
30
+ "layer_types": [
31
+ "sliding_attention",
32
+ "sliding_attention",
33
+ "sliding_attention",
34
+ "sliding_attention",
35
+ "sliding_attention",
36
+ "full_attention",
37
+ "sliding_attention",
38
+ "sliding_attention",
39
+ "sliding_attention",
40
+ "sliding_attention",
41
+ "sliding_attention",
42
+ "full_attention",
43
+ "sliding_attention",
44
+ "sliding_attention",
45
+ "sliding_attention",
46
+ "sliding_attention",
47
+ "sliding_attention",
48
+ "full_attention",
49
+ "sliding_attention",
50
+ "sliding_attention",
51
+ "sliding_attention",
52
+ "sliding_attention",
53
+ "sliding_attention",
54
+ "full_attention",
55
+ "sliding_attention",
56
+ "sliding_attention",
57
+ "sliding_attention",
58
+ "sliding_attention",
59
+ "sliding_attention",
60
+ "full_attention",
61
+ "sliding_attention",
62
+ "sliding_attention",
63
+ "sliding_attention",
64
+ "sliding_attention",
65
+ "sliding_attention",
66
+ "full_attention",
67
+ "sliding_attention",
68
+ "sliding_attention",
69
+ "sliding_attention",
70
+ "sliding_attention",
71
+ "sliding_attention",
72
+ "full_attention",
73
+ "sliding_attention",
74
+ "sliding_attention",
75
+ "sliding_attention",
76
+ "sliding_attention",
77
+ "sliding_attention",
78
+ "full_attention"
79
+ ],
80
+ "max_position_embeddings": 131072,
81
+ "model_type": "gemma3_text",
82
+ "num_attention_heads": 16,
83
+ "num_hidden_layers": 48,
84
+ "num_key_value_heads": 8,
85
+ "pad_token_id": 0,
86
+ "query_pre_attn_scalar": 256,
87
+ "rms_norm_eps": 1e-06,
88
+ "rope_parameters": {
89
+ "full_attention": {
90
+ "factor": 8.0,
91
+ "rope_theta": 1000000.0,
92
+ "rope_type": "linear"
93
+ },
94
+ "sliding_attention": {
95
+ "rope_theta": 10000.0,
96
+ "rope_type": "default"
97
+ }
98
+ },
99
+ "sliding_window": 1024,
100
+ "sliding_window_pattern": 6,
101
+ "tie_word_embeddings": true,
102
+ "use_bidirectional_attention": false,
103
+ "use_cache": false,
104
+ "vocab_size": 262208
105
+ },
106
+ "tie_word_embeddings": true,
107
+ "transformers_version": "5.9.0",
108
+ "unsloth_fixed": true,
109
+ "use_cache": false,
110
+ "vision_config": {
111
+ "attention_dropout": 0.0,
112
+ "dtype": "bfloat16",
113
+ "hidden_act": "gelu_pytorch_tanh",
114
+ "hidden_size": 1152,
115
+ "image_size": 896,
116
+ "intermediate_size": 4304,
117
+ "layer_norm_eps": 1e-06,
118
+ "model_type": "siglip_vision_model",
119
+ "num_attention_heads": 16,
120
+ "num_channels": 3,
121
+ "num_hidden_layers": 27,
122
+ "patch_size": 14,
123
+ "vision_use_head": false
124
+ }
125
+ }
smoke/20260810T011719Z/arms/control/adapter/debug.log ADDED
@@ -0,0 +1,635 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
0
  0%| | 0/2 [00:00<?, ?it/s]
1
  50%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 1/2 [00:08<00:08, 8.05s/it]
2
 
 
3
  50%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 1/2 [00:08<00:08, 8.05s/it]
4
 
 
 
5
 
 
 
 
 
1
+ [2026-08-10 01:25:29,793] [DEBUG] [axolotl.utils.config.log_gpu_memory_usage:127] [PID:1428] baseline 0.000GB ()
2
+ [2026-08-10 01:25:29,794] [INFO] [axolotl.cli.config.load_cfg:333] [PID:1428] config:
3
+ {
4
+ "activation_offloading": false,
5
+ "adapter": "lora",
6
+ "attn_implementation": "flash_attention_2",
7
+ "attn_needs_dtype_cast": true,
8
+ "attn_supports_packing": true,
9
+ "attn_uses_flash_lib": true,
10
+ "axolotl_config_path": "/workspace/python4-aft-20260810T011719Z-control/experiments/python4_aft_generalization/runs/20260810T011719Z/arms/control/train/axolotl.yaml",
11
+ "base_model": "/workspace/python4-aft-state/20260810T011719Z/control/parent/control/sft/end",
12
+ "base_model_config": "/workspace/python4-aft-state/20260810T011719Z/control/parent/control/sft/end",
13
+ "batch_size": 32,
14
+ "bf16": true,
15
+ "capabilities": {
16
+ "bf16": true,
17
+ "compute_capability": "sm_90",
18
+ "fp8": true,
19
+ "n_gpu": 1,
20
+ "n_node": 1,
21
+ "tf32": true
22
+ },
23
+ "chat_template": "gemma3",
24
+ "checkpoint_schedule": [
25
+ 2
26
+ ],
27
+ "context_parallel_size": 1,
28
+ "cosine_min_lr_ratio": 0.1,
29
+ "dataloader_num_workers": 1,
30
+ "dataloader_pin_memory": true,
31
+ "dataloader_prefetch_factor": 256,
32
+ "dataset_num_proc": 4,
33
+ "dataset_prepared_path": "/workspace/python4-aft-20260810T011719Z-control/experiments/python4_aft_generalization/runs/20260810T011719Z/arms/control/train/prepared",
34
+ "datasets": [
35
+ {
36
+ "chat_template": "tokenizer_default",
37
+ "field_messages": "messages",
38
+ "message_property_mappings": {
39
+ "content": "content",
40
+ "role": "role"
41
+ },
42
+ "path": "/workspace/python4-aft-20260810T011719Z-control/experiments/python4_aft_generalization/runs/20260810T011719Z/arms/control/smoke_aft.jsonl",
43
+ "trust_remote_code": false,
44
+ "type": "chat_template"
45
+ }
46
+ ],
47
+ "ddp": false,
48
+ "ddp_find_unused_parameters": true,
49
+ "device": "cuda:0",
50
+ "dion_rank_fraction": 1.0,
51
+ "dion_rank_multiple_of": 1,
52
+ "eaft_alpha": 1.0,
53
+ "eaft_k": 20,
54
+ "env_capabilities": {
55
+ "torch_version": "2.12.1"
56
+ },
57
+ "eot_tokens": [
58
+ "<end_of_turn>"
59
+ ],
60
+ "eval_batch_size": 4,
61
+ "eval_causal_lm_metrics": [
62
+ "sacrebleu",
63
+ "comet",
64
+ "ter",
65
+ "chrf"
66
+ ],
67
+ "eval_max_new_tokens": 128,
68
+ "eval_table_size": 0,
69
+ "experimental_skip_move_to_device": true,
70
+ "fp16": false,
71
+ "generate_samples": false,
72
+ "generation_do_sample": true,
73
+ "generation_max_new_tokens": 50,
74
+ "generation_prompt_ratio": 0.5,
75
+ "generation_temperature": 0.7,
76
+ "gradient_accumulation_steps": 8,
77
+ "gradient_checkpointing": true,
78
+ "gradient_checkpointing_kwargs": {
79
+ "use_reentrant": false
80
+ },
81
+ "include_tkps": true,
82
+ "is_multimodal": true,
83
+ "layer_offloading": false,
84
+ "learning_rate": 0.0001,
85
+ "liger_fused_linear_cross_entropy": true,
86
+ "liger_glu_activation": true,
87
+ "liger_rms_norm": true,
88
+ "liger_rope": true,
89
+ "lisa_layers_attribute": "model.layers",
90
+ "load_best_model_at_end": false,
91
+ "load_in_4bit": false,
92
+ "load_in_8bit": false,
93
+ "local_rank": 0,
94
+ "logging_steps": 1,
95
+ "lora_alpha": 128,
96
+ "lora_dropout": 0.0,
97
+ "lora_embedding_kernel": true,
98
+ "lora_mlp_kernel": true,
99
+ "lora_o_kernel": true,
100
+ "lora_qkv_kernel": true,
101
+ "lora_r": 64,
102
+ "lora_target_modules": [
103
+ "model.language_model.layers.0.self_attn.q_proj",
104
+ "model.language_model.layers.0.self_attn.k_proj",
105
+ "model.language_model.layers.0.self_attn.v_proj",
106
+ "model.language_model.layers.0.self_attn.o_proj",
107
+ "model.language_model.layers.0.mlp.gate_proj",
108
+ "model.language_model.layers.0.mlp.up_proj",
109
+ "model.language_model.layers.0.mlp.down_proj",
110
+ "model.language_model.layers.1.self_attn.q_proj",
111
+ "model.language_model.layers.1.self_attn.k_proj",
112
+ "model.language_model.layers.1.self_attn.v_proj",
113
+ "model.language_model.layers.1.self_attn.o_proj",
114
+ "model.language_model.layers.1.mlp.gate_proj",
115
+ "model.language_model.layers.1.mlp.up_proj",
116
+ "model.language_model.layers.1.mlp.down_proj",
117
+ "model.language_model.layers.2.self_attn.q_proj",
118
+ "model.language_model.layers.2.self_attn.k_proj",
119
+ "model.language_model.layers.2.self_attn.v_proj",
120
+ "model.language_model.layers.2.self_attn.o_proj",
121
+ "model.language_model.layers.2.mlp.gate_proj",
122
+ "model.language_model.layers.2.mlp.up_proj",
123
+ "model.language_model.layers.2.mlp.down_proj",
124
+ "model.language_model.layers.3.self_attn.q_proj",
125
+ "model.language_model.layers.3.self_attn.k_proj",
126
+ "model.language_model.layers.3.self_attn.v_proj",
127
+ "model.language_model.layers.3.self_attn.o_proj",
128
+ "model.language_model.layers.3.mlp.gate_proj",
129
+ "model.language_model.layers.3.mlp.up_proj",
130
+ "model.language_model.layers.3.mlp.down_proj",
131
+ "model.language_model.layers.4.self_attn.q_proj",
132
+ "model.language_model.layers.4.self_attn.k_proj",
133
+ "model.language_model.layers.4.self_attn.v_proj",
134
+ "model.language_model.layers.4.self_attn.o_proj",
135
+ "model.language_model.layers.4.mlp.gate_proj",
136
+ "model.language_model.layers.4.mlp.up_proj",
137
+ "model.language_model.layers.4.mlp.down_proj",
138
+ "model.language_model.layers.5.self_attn.q_proj",
139
+ "model.language_model.layers.5.self_attn.k_proj",
140
+ "model.language_model.layers.5.self_attn.v_proj",
141
+ "model.language_model.layers.5.self_attn.o_proj",
142
+ "model.language_model.layers.5.mlp.gate_proj",
143
+ "model.language_model.layers.5.mlp.up_proj",
144
+ "model.language_model.layers.5.mlp.down_proj",
145
+ "model.language_model.layers.6.self_attn.q_proj",
146
+ "model.language_model.layers.6.self_attn.k_proj",
147
+ "model.language_model.layers.6.self_attn.v_proj",
148
+ "model.language_model.layers.6.self_attn.o_proj",
149
+ "model.language_model.layers.6.mlp.gate_proj",
150
+ "model.language_model.layers.6.mlp.up_proj",
151
+ "model.language_model.layers.6.mlp.down_proj",
152
+ "model.language_model.layers.7.self_attn.q_proj",
153
+ "model.language_model.layers.7.self_attn.k_proj",
154
+ "model.language_model.layers.7.self_attn.v_proj",
155
+ "model.language_model.layers.7.self_attn.o_proj",
156
+ "model.language_model.layers.7.mlp.gate_proj",
157
+ "model.language_model.layers.7.mlp.up_proj",
158
+ "model.language_model.layers.7.mlp.down_proj",
159
+ "model.language_model.layers.8.self_attn.q_proj",
160
+ "model.language_model.layers.8.self_attn.k_proj",
161
+ "model.language_model.layers.8.self_attn.v_proj",
162
+ "model.language_model.layers.8.self_attn.o_proj",
163
+ "model.language_model.layers.8.mlp.gate_proj",
164
+ "model.language_model.layers.8.mlp.up_proj",
165
+ "model.language_model.layers.8.mlp.down_proj",
166
+ "model.language_model.layers.9.self_attn.q_proj",
167
+ "model.language_model.layers.9.self_attn.k_proj",
168
+ "model.language_model.layers.9.self_attn.v_proj",
169
+ "model.language_model.layers.9.self_attn.o_proj",
170
+ "model.language_model.layers.9.mlp.gate_proj",
171
+ "model.language_model.layers.9.mlp.up_proj",
172
+ "model.language_model.layers.9.mlp.down_proj",
173
+ "model.language_model.layers.10.self_attn.q_proj",
174
+ "model.language_model.layers.10.self_attn.k_proj",
175
+ "model.language_model.layers.10.self_attn.v_proj",
176
+ "model.language_model.layers.10.self_attn.o_proj",
177
+ "model.language_model.layers.10.mlp.gate_proj",
178
+ "model.language_model.layers.10.mlp.up_proj",
179
+ "model.language_model.layers.10.mlp.down_proj",
180
+ "model.language_model.layers.11.self_attn.q_proj",
181
+ "model.language_model.layers.11.self_attn.k_proj",
182
+ "model.language_model.layers.11.self_attn.v_proj",
183
+ "model.language_model.layers.11.self_attn.o_proj",
184
+ "model.language_model.layers.11.mlp.gate_proj",
185
+ "model.language_model.layers.11.mlp.up_proj",
186
+ "model.language_model.layers.11.mlp.down_proj",
187
+ "model.language_model.layers.12.self_attn.q_proj",
188
+ "model.language_model.layers.12.self_attn.k_proj",
189
+ "model.language_model.layers.12.self_attn.v_proj",
190
+ "model.language_model.layers.12.self_attn.o_proj",
191
+ "model.language_model.layers.12.mlp.gate_proj",
192
+ "model.language_model.layers.12.mlp.up_proj",
193
+ "model.language_model.layers.12.mlp.down_proj",
194
+ "model.language_model.layers.13.self_attn.q_proj",
195
+ "model.language_model.layers.13.self_attn.k_proj",
196
+ "model.language_model.layers.13.self_attn.v_proj",
197
+ "model.language_model.layers.13.self_attn.o_proj",
198
+ "model.language_model.layers.13.mlp.gate_proj",
199
+ "model.language_model.layers.13.mlp.up_proj",
200
+ "model.language_model.layers.13.mlp.down_proj",
201
+ "model.language_model.layers.14.self_attn.q_proj",
202
+ "model.language_model.layers.14.self_attn.k_proj",
203
+ "model.language_model.layers.14.self_attn.v_proj",
204
+ "model.language_model.layers.14.self_attn.o_proj",
205
+ "model.language_model.layers.14.mlp.gate_proj",
206
+ "model.language_model.layers.14.mlp.up_proj",
207
+ "model.language_model.layers.14.mlp.down_proj",
208
+ "model.language_model.layers.15.self_attn.q_proj",
209
+ "model.language_model.layers.15.self_attn.k_proj",
210
+ "model.language_model.layers.15.self_attn.v_proj",
211
+ "model.language_model.layers.15.self_attn.o_proj",
212
+ "model.language_model.layers.15.mlp.gate_proj",
213
+ "model.language_model.layers.15.mlp.up_proj",
214
+ "model.language_model.layers.15.mlp.down_proj",
215
+ "model.language_model.layers.16.self_attn.q_proj",
216
+ "model.language_model.layers.16.self_attn.k_proj",
217
+ "model.language_model.layers.16.self_attn.v_proj",
218
+ "model.language_model.layers.16.self_attn.o_proj",
219
+ "model.language_model.layers.16.mlp.gate_proj",
220
+ "model.language_model.layers.16.mlp.up_proj",
221
+ "model.language_model.layers.16.mlp.down_proj",
222
+ "model.language_model.layers.17.self_attn.q_proj",
223
+ "model.language_model.layers.17.self_attn.k_proj",
224
+ "model.language_model.layers.17.self_attn.v_proj",
225
+ "model.language_model.layers.17.self_attn.o_proj",
226
+ "model.language_model.layers.17.mlp.gate_proj",
227
+ "model.language_model.layers.17.mlp.up_proj",
228
+ "model.language_model.layers.17.mlp.down_proj",
229
+ "model.language_model.layers.18.self_attn.q_proj",
230
+ "model.language_model.layers.18.self_attn.k_proj",
231
+ "model.language_model.layers.18.self_attn.v_proj",
232
+ "model.language_model.layers.18.self_attn.o_proj",
233
+ "model.language_model.layers.18.mlp.gate_proj",
234
+ "model.language_model.layers.18.mlp.up_proj",
235
+ "model.language_model.layers.18.mlp.down_proj",
236
+ "model.language_model.layers.19.self_attn.q_proj",
237
+ "model.language_model.layers.19.self_attn.k_proj",
238
+ "model.language_model.layers.19.self_attn.v_proj",
239
+ "model.language_model.layers.19.self_attn.o_proj",
240
+ "model.language_model.layers.19.mlp.gate_proj",
241
+ "model.language_model.layers.19.mlp.up_proj",
242
+ "model.language_model.layers.19.mlp.down_proj",
243
+ "model.language_model.layers.20.self_attn.q_proj",
244
+ "model.language_model.layers.20.self_attn.k_proj",
245
+ "model.language_model.layers.20.self_attn.v_proj",
246
+ "model.language_model.layers.20.self_attn.o_proj",
247
+ "model.language_model.layers.20.mlp.gate_proj",
248
+ "model.language_model.layers.20.mlp.up_proj",
249
+ "model.language_model.layers.20.mlp.down_proj",
250
+ "model.language_model.layers.21.self_attn.q_proj",
251
+ "model.language_model.layers.21.self_attn.k_proj",
252
+ "model.language_model.layers.21.self_attn.v_proj",
253
+ "model.language_model.layers.21.self_attn.o_proj",
254
+ "model.language_model.layers.21.mlp.gate_proj",
255
+ "model.language_model.layers.21.mlp.up_proj",
256
+ "model.language_model.layers.21.mlp.down_proj",
257
+ "model.language_model.layers.22.self_attn.q_proj",
258
+ "model.language_model.layers.22.self_attn.k_proj",
259
+ "model.language_model.layers.22.self_attn.v_proj",
260
+ "model.language_model.layers.22.self_attn.o_proj",
261
+ "model.language_model.layers.22.mlp.gate_proj",
262
+ "model.language_model.layers.22.mlp.up_proj",
263
+ "model.language_model.layers.22.mlp.down_proj",
264
+ "model.language_model.layers.23.self_attn.q_proj",
265
+ "model.language_model.layers.23.self_attn.k_proj",
266
+ "model.language_model.layers.23.self_attn.v_proj",
267
+ "model.language_model.layers.23.self_attn.o_proj",
268
+ "model.language_model.layers.23.mlp.gate_proj",
269
+ "model.language_model.layers.23.mlp.up_proj",
270
+ "model.language_model.layers.23.mlp.down_proj",
271
+ "model.language_model.layers.24.self_attn.q_proj",
272
+ "model.language_model.layers.24.self_attn.k_proj",
273
+ "model.language_model.layers.24.self_attn.v_proj",
274
+ "model.language_model.layers.24.self_attn.o_proj",
275
+ "model.language_model.layers.24.mlp.gate_proj",
276
+ "model.language_model.layers.24.mlp.up_proj",
277
+ "model.language_model.layers.24.mlp.down_proj",
278
+ "model.language_model.layers.25.self_attn.q_proj",
279
+ "model.language_model.layers.25.self_attn.k_proj",
280
+ "model.language_model.layers.25.self_attn.v_proj",
281
+ "model.language_model.layers.25.self_attn.o_proj",
282
+ "model.language_model.layers.25.mlp.gate_proj",
283
+ "model.language_model.layers.25.mlp.up_proj",
284
+ "model.language_model.layers.25.mlp.down_proj",
285
+ "model.language_model.layers.26.self_attn.q_proj",
286
+ "model.language_model.layers.26.self_attn.k_proj",
287
+ "model.language_model.layers.26.self_attn.v_proj",
288
+ "model.language_model.layers.26.self_attn.o_proj",
289
+ "model.language_model.layers.26.mlp.gate_proj",
290
+ "model.language_model.layers.26.mlp.up_proj",
291
+ "model.language_model.layers.26.mlp.down_proj",
292
+ "model.language_model.layers.27.self_attn.q_proj",
293
+ "model.language_model.layers.27.self_attn.k_proj",
294
+ "model.language_model.layers.27.self_attn.v_proj",
295
+ "model.language_model.layers.27.self_attn.o_proj",
296
+ "model.language_model.layers.27.mlp.gate_proj",
297
+ "model.language_model.layers.27.mlp.up_proj",
298
+ "model.language_model.layers.27.mlp.down_proj",
299
+ "model.language_model.layers.28.self_attn.q_proj",
300
+ "model.language_model.layers.28.self_attn.k_proj",
301
+ "model.language_model.layers.28.self_attn.v_proj",
302
+ "model.language_model.layers.28.self_attn.o_proj",
303
+ "model.language_model.layers.28.mlp.gate_proj",
304
+ "model.language_model.layers.28.mlp.up_proj",
305
+ "model.language_model.layers.28.mlp.down_proj",
306
+ "model.language_model.layers.29.self_attn.q_proj",
307
+ "model.language_model.layers.29.self_attn.k_proj",
308
+ "model.language_model.layers.29.self_attn.v_proj",
309
+ "model.language_model.layers.29.self_attn.o_proj",
310
+ "model.language_model.layers.29.mlp.gate_proj",
311
+ "model.language_model.layers.29.mlp.up_proj",
312
+ "model.language_model.layers.29.mlp.down_proj",
313
+ "model.language_model.layers.30.self_attn.q_proj",
314
+ "model.language_model.layers.30.self_attn.k_proj",
315
+ "model.language_model.layers.30.self_attn.v_proj",
316
+ "model.language_model.layers.30.self_attn.o_proj",
317
+ "model.language_model.layers.30.mlp.gate_proj",
318
+ "model.language_model.layers.30.mlp.up_proj",
319
+ "model.language_model.layers.30.mlp.down_proj",
320
+ "model.language_model.layers.31.self_attn.q_proj",
321
+ "model.language_model.layers.31.self_attn.k_proj",
322
+ "model.language_model.layers.31.self_attn.v_proj",
323
+ "model.language_model.layers.31.self_attn.o_proj",
324
+ "model.language_model.layers.31.mlp.gate_proj",
325
+ "model.language_model.layers.31.mlp.up_proj",
326
+ "model.language_model.layers.31.mlp.down_proj",
327
+ "model.language_model.layers.32.self_attn.q_proj",
328
+ "model.language_model.layers.32.self_attn.k_proj",
329
+ "model.language_model.layers.32.self_attn.v_proj",
330
+ "model.language_model.layers.32.self_attn.o_proj",
331
+ "model.language_model.layers.32.mlp.gate_proj",
332
+ "model.language_model.layers.32.mlp.up_proj",
333
+ "model.language_model.layers.32.mlp.down_proj",
334
+ "model.language_model.layers.33.self_attn.q_proj",
335
+ "model.language_model.layers.33.self_attn.k_proj",
336
+ "model.language_model.layers.33.self_attn.v_proj",
337
+ "model.language_model.layers.33.self_attn.o_proj",
338
+ "model.language_model.layers.33.mlp.gate_proj",
339
+ "model.language_model.layers.33.mlp.up_proj",
340
+ "model.language_model.layers.33.mlp.down_proj",
341
+ "model.language_model.layers.34.self_attn.q_proj",
342
+ "model.language_model.layers.34.self_attn.k_proj",
343
+ "model.language_model.layers.34.self_attn.v_proj",
344
+ "model.language_model.layers.34.self_attn.o_proj",
345
+ "model.language_model.layers.34.mlp.gate_proj",
346
+ "model.language_model.layers.34.mlp.up_proj",
347
+ "model.language_model.layers.34.mlp.down_proj",
348
+ "model.language_model.layers.35.self_attn.q_proj",
349
+ "model.language_model.layers.35.self_attn.k_proj",
350
+ "model.language_model.layers.35.self_attn.v_proj",
351
+ "model.language_model.layers.35.self_attn.o_proj",
352
+ "model.language_model.layers.35.mlp.gate_proj",
353
+ "model.language_model.layers.35.mlp.up_proj",
354
+ "model.language_model.layers.35.mlp.down_proj",
355
+ "model.language_model.layers.36.self_attn.q_proj",
356
+ "model.language_model.layers.36.self_attn.k_proj",
357
+ "model.language_model.layers.36.self_attn.v_proj",
358
+ "model.language_model.layers.36.self_attn.o_proj",
359
+ "model.language_model.layers.36.mlp.gate_proj",
360
+ "model.language_model.layers.36.mlp.up_proj",
361
+ "model.language_model.layers.36.mlp.down_proj",
362
+ "model.language_model.layers.37.self_attn.q_proj",
363
+ "model.language_model.layers.37.self_attn.k_proj",
364
+ "model.language_model.layers.37.self_attn.v_proj",
365
+ "model.language_model.layers.37.self_attn.o_proj",
366
+ "model.language_model.layers.37.mlp.gate_proj",
367
+ "model.language_model.layers.37.mlp.up_proj",
368
+ "model.language_model.layers.37.mlp.down_proj",
369
+ "model.language_model.layers.38.self_attn.q_proj",
370
+ "model.language_model.layers.38.self_attn.k_proj",
371
+ "model.language_model.layers.38.self_attn.v_proj",
372
+ "model.language_model.layers.38.self_attn.o_proj",
373
+ "model.language_model.layers.38.mlp.gate_proj",
374
+ "model.language_model.layers.38.mlp.up_proj",
375
+ "model.language_model.layers.38.mlp.down_proj",
376
+ "model.language_model.layers.39.self_attn.q_proj",
377
+ "model.language_model.layers.39.self_attn.k_proj",
378
+ "model.language_model.layers.39.self_attn.v_proj",
379
+ "model.language_model.layers.39.self_attn.o_proj",
380
+ "model.language_model.layers.39.mlp.gate_proj",
381
+ "model.language_model.layers.39.mlp.up_proj",
382
+ "model.language_model.layers.39.mlp.down_proj",
383
+ "model.language_model.layers.40.self_attn.q_proj",
384
+ "model.language_model.layers.40.self_attn.k_proj",
385
+ "model.language_model.layers.40.self_attn.v_proj",
386
+ "model.language_model.layers.40.self_attn.o_proj",
387
+ "model.language_model.layers.40.mlp.gate_proj",
388
+ "model.language_model.layers.40.mlp.up_proj",
389
+ "model.language_model.layers.40.mlp.down_proj",
390
+ "model.language_model.layers.41.self_attn.q_proj",
391
+ "model.language_model.layers.41.self_attn.k_proj",
392
+ "model.language_model.layers.41.self_attn.v_proj",
393
+ "model.language_model.layers.41.self_attn.o_proj",
394
+ "model.language_model.layers.41.mlp.gate_proj",
395
+ "model.language_model.layers.41.mlp.up_proj",
396
+ "model.language_model.layers.41.mlp.down_proj",
397
+ "model.language_model.layers.42.self_attn.q_proj",
398
+ "model.language_model.layers.42.self_attn.k_proj",
399
+ "model.language_model.layers.42.self_attn.v_proj",
400
+ "model.language_model.layers.42.self_attn.o_proj",
401
+ "model.language_model.layers.42.mlp.gate_proj",
402
+ "model.language_model.layers.42.mlp.up_proj",
403
+ "model.language_model.layers.42.mlp.down_proj",
404
+ "model.language_model.layers.43.self_attn.q_proj",
405
+ "model.language_model.layers.43.self_attn.k_proj",
406
+ "model.language_model.layers.43.self_attn.v_proj",
407
+ "model.language_model.layers.43.self_attn.o_proj",
408
+ "model.language_model.layers.43.mlp.gate_proj",
409
+ "model.language_model.layers.43.mlp.up_proj",
410
+ "model.language_model.layers.43.mlp.down_proj",
411
+ "model.language_model.layers.44.self_attn.q_proj",
412
+ "model.language_model.layers.44.self_attn.k_proj",
413
+ "model.language_model.layers.44.self_attn.v_proj",
414
+ "model.language_model.layers.44.self_attn.o_proj",
415
+ "model.language_model.layers.44.mlp.gate_proj",
416
+ "model.language_model.layers.44.mlp.up_proj",
417
+ "model.language_model.layers.44.mlp.down_proj",
418
+ "model.language_model.layers.45.self_attn.q_proj",
419
+ "model.language_model.layers.45.self_attn.k_proj",
420
+ "model.language_model.layers.45.self_attn.v_proj",
421
+ "model.language_model.layers.45.self_attn.o_proj",
422
+ "model.language_model.layers.45.mlp.gate_proj",
423
+ "model.language_model.layers.45.mlp.up_proj",
424
+ "model.language_model.layers.45.mlp.down_proj",
425
+ "model.language_model.layers.46.self_attn.q_proj",
426
+ "model.language_model.layers.46.self_attn.k_proj",
427
+ "model.language_model.layers.46.self_attn.v_proj",
428
+ "model.language_model.layers.46.self_attn.o_proj",
429
+ "model.language_model.layers.46.mlp.gate_proj",
430
+ "model.language_model.layers.46.mlp.up_proj",
431
+ "model.language_model.layers.46.mlp.down_proj",
432
+ "model.language_model.layers.47.self_attn.q_proj",
433
+ "model.language_model.layers.47.self_attn.k_proj",
434
+ "model.language_model.layers.47.self_attn.v_proj",
435
+ "model.language_model.layers.47.self_attn.o_proj",
436
+ "model.language_model.layers.47.mlp.gate_proj",
437
+ "model.language_model.layers.47.mlp.up_proj",
438
+ "model.language_model.layers.47.mlp.down_proj"
439
+ ],
440
+ "loraplus_lr_embedding": 1e-06,
441
+ "lr_scheduler": "cosine",
442
+ "max_grad_norm": 1.0,
443
+ "mean_resizing_embeddings": false,
444
+ "merge_method": "memory_efficient",
445
+ "micro_batch_size": 4,
446
+ "model_config_type": "gemma3",
447
+ "model_config_type_text": "gemma3_text",
448
+ "num_epochs": 2.0,
449
+ "num_generation_samples": 3,
450
+ "optimizer": "adamw_torch_fused",
451
+ "otel_metrics_host": "localhost",
452
+ "otel_metrics_port": 8000,
453
+ "output_dir": "/workspace/python4-aft-20260810T011719Z-control/experiments/python4_aft_generalization/runs/20260810T011719Z/arms/control/train/checkpoints",
454
+ "pad_to_sequence_len": false,
455
+ "plugins": [
456
+ "axolotl.integrations.liger.LigerPlugin",
457
+ "scimt.train.axolotl_plugins.CheckpointSchedulePlugin"
458
+ ],
459
+ "pretrain_multipack_attn": true,
460
+ "processor_config": "/workspace/python4-aft-state/20260810T011719Z/control/parent/control/sft/end",
461
+ "profiler_steps_start": 0,
462
+ "qgalore_cos_threshold": 0.4,
463
+ "qgalore_gamma_proj": 2,
464
+ "qgalore_proj_bits": 4,
465
+ "qgalore_proj_group_size": 256,
466
+ "qgalore_proj_quant": true,
467
+ "qgalore_proj_type": "std",
468
+ "qgalore_queue_size": 5,
469
+ "qgalore_rank": 256,
470
+ "qgalore_scale": 0.25,
471
+ "qgalore_update_proj_gap": 200,
472
+ "qlora_sharded_model_loading": false,
473
+ "quantize_moe_experts": false,
474
+ "ray_num_workers": 1,
475
+ "relora_prune_method": "magnitude",
476
+ "resources_per_worker": {
477
+ "GPU": 1
478
+ },
479
+ "sample_packing": false,
480
+ "sample_packing_bin_size": 200,
481
+ "sample_packing_group_size": 100000,
482
+ "save_only_model": true,
483
+ "save_safetensors": true,
484
+ "save_strategy": "no",
485
+ "save_total_limit": 1,
486
+ "seed": 424242,
487
+ "sequence_len": 4096,
488
+ "shuffle_before_merging_datasets": false,
489
+ "shuffle_merged_datasets": true,
490
+ "skip_prepare_dataset": false,
491
+ "streaming_multipack_buffer_size": 10000,
492
+ "strict": false,
493
+ "tensor_parallel_size": 1,
494
+ "tf32": true,
495
+ "tiled_mlp_use_original_mlp": true,
496
+ "tokenizer_config": "/workspace/python4-aft-state/20260810T011719Z/control/parent/control/sft/end",
497
+ "tokenizer_save_jinja_files": true,
498
+ "torch_dtype": "torch.bfloat16",
499
+ "train_on_inputs": false,
500
+ "trl": {
501
+ "async_prefetch": false,
502
+ "log_completions": false,
503
+ "mask_truncated_completions": false,
504
+ "ref_model_mixup_alpha": 0.9,
505
+ "ref_model_sync_steps": 64,
506
+ "replay_buffer_size": 0,
507
+ "replay_recompute_logps": true,
508
+ "reroll_max_groups": 1,
509
+ "reroll_start_fraction": 1.0,
510
+ "reward_num_workers": 1,
511
+ "scale_rewards": true,
512
+ "skip_zero_advantage_batches": true,
513
+ "sync_ref_model": false,
514
+ "use_data_producer": false,
515
+ "use_vllm": false,
516
+ "vllm_lora_sync": false,
517
+ "vllm_server_host": "0.0.0.0",
518
+ "vllm_server_port": 8000
519
+ },
520
+ "trust_remote_code": false,
521
+ "use_otel_metrics": false,
522
+ "use_ray": false,
523
+ "val_set_size": 0.0,
524
+ "vllm": {
525
+ "device": "auto",
526
+ "dtype": "auto",
527
+ "gpu_memory_utilization": 0.9,
528
+ "host": "0.0.0.0",
529
+ "port": 8000
530
+ },
531
+ "warmup_ratio": 0.05,
532
+ "weight_decay": 0.01,
533
+ "world_size": 1
534
+ }
535
+ [2026-08-10 01:25:30,041] [DEBUG] [axolotl.loaders.utils.check_model_config:88] [PID:1428] Loaded image size: 896 from model config
536
+ [2026-08-10 01:25:31,410] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:311] [PID:1428] EOS: 1 / <eos>
537
+ [2026-08-10 01:25:31,411] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:312] [PID:1428] BOS: 2 / <bos>
538
+ [2026-08-10 01:25:31,411] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:313] [PID:1428] PAD: 0 / <pad>
539
+ [2026-08-10 01:25:31,411] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:314] [PID:1428] UNK: 3 / <unk>
540
+ [2026-08-10 01:25:31,412] [INFO] [axolotl.utils.data.shared.load_preprocessed_dataset:482] [PID:1428] Unable to find prepared dataset in /workspace/python4-aft-20260810T011719Z-control/experiments/python4_aft_generalization/runs/20260810T011719Z/arms/control/train/prepared/0a44fd9e07210b6aad1cc149dc58311a
541
+ [2026-08-10 01:25:31,412] [INFO] [axolotl.utils.data.sft._load_raw_datasets:320] [PID:1428] Loading raw datasets...
542
+ [2026-08-10 01:25:31,412] [WARNING] [axolotl.utils.data.sft._load_raw_datasets:322] [PID:1428] Processing datasets during training can lead to VRAM instability. Please pre-process your dataset using `axolotl preprocess path/to/config.yml`.
543
+
544
+ [2026-08-10 01:25:31,914] [INFO] [axolotl.utils.data.wrappers.get_dataset_wrapper:87] [PID:1428] Loading dataset: /workspace/python4-aft-20260810T011719Z-control/experiments/python4_aft_generalization/runs/20260810T011719Z/arms/control/smoke_aft.jsonl with base_type: chat_template and prompt_style: None
545
+ [2026-08-10 01:25:31,923] [INFO] [axolotl.prompt_strategies.chat_template.__call__:1209] [PID:1428] Using chat template:
546
+ ---
547
+ {{ bos_token }}
548
+ {%- if messages[0]['role'] == 'system' -%}
549
+ {%- if messages[0]['content'] is string -%}
550
+ {%- set first_user_prefix = messages[0]['content'] + '
551
+
552
+ ' -%}
553
+ {%- else -%}
554
+ {%- set first_user_prefix = messages[0]['content'][0]['text'] + '
555
+
556
+ ' -%}
557
+ {%- endif -%}
558
+ {%- set loop_messages = messages[1:] -%}
559
+ {%- else -%}
560
+ {%- set first_user_prefix = "" -%}
561
+ {%- set loop_messages = messages -%}
562
+ {%- endif -%}
563
+ {%- for message in loop_messages -%}
564
+ {%- if (message['role'] == 'user') != (loop.index0 % 2 == 0) -%}
565
+ {{ raise_exception("Conversation roles must alternate user/assistant/user/assistant/...") }}
566
+ {%- endif -%}
567
+ {%- if (message['role'] == 'assistant') -%}
568
+ {%- set role = "model" -%}
569
+ {%- else -%}
570
+ {%- set role = message['role'] -%}
571
+ {%- endif -%}
572
+ {{ '<start_of_turn>' + role + '
573
+ ' + (first_user_prefix if loop.first else "") }}
574
+ {%- if message['content'] is string -%}
575
+ {{ message['content'] | trim }}
576
+ {%- elif message['content'] is iterable -%}
577
+ {%- for item in message['content'] -%}
578
+ {%- if item['type'] == 'image' -%}
579
+ {{ '<start_of_image>' }}
580
+ {%- elif item['type'] == 'text' -%}
581
+ {{ item['text'] | trim }}
582
+ {%- endif -%}
583
+ {%- endfor -%}
584
+ {%- else -%}
585
+ {{ raise_exception("Invalid content type") }}
586
+ {%- endif -%}
587
+ {{ '<end_of_turn>
588
+ ' }}
589
+ {%- endfor -%}
590
+ {%- if add_generation_prompt -%}
591
+ {{'<start_of_turn>model
592
+ '}}
593
+ {%- endif -%}
594
+
595
+ ---
596
+
597
+ [2026-08-10 01:26:02,961] [INFO] [axolotl.utils.data.utils._log_dataset_stats:212] [PID:1428] min_input_len: 298
598
+ [2026-08-10 01:26:02,961] [INFO] [axolotl.utils.data.utils._log_dataset_stats:213] [PID:1428] max_input_len: 806
599
+
600
+
601
+ [2026-08-10 01:26:10,374] [DEBUG] [axolotl.utils.trainer.calculate_total_num_steps:420] [PID:1428] total_num_tokens: 15_624
602
+ [2026-08-10 01:26:10,375] [DEBUG] [axolotl.utils.trainer.calculate_total_num_steps:438] [PID:1428] `total_supervised_tokens: 3_683`
603
+ [2026-08-10 01:26:10,375] [DEBUG] [axolotl.utils.trainer.calculate_total_num_steps:521] [PID:1428] total_num_steps: 2
604
+ [2026-08-10 01:26:10,375] [INFO] [axolotl.utils.data.sft._prepare_standard_dataset:121] [PID:1428] Maximum number of steps set at 2
605
+ [2026-08-10 01:26:10,375] [DEBUG] [axolotl.train.setup_model_and_tokenizer:70] [PID:1428] loading tokenizer... /workspace/python4-aft-state/20260810T011719Z/control/parent/control/sft/end
606
+ [2026-08-10 01:26:11,941] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:311] [PID:1428] EOS: 1 / <eos>
607
+ [2026-08-10 01:26:11,941] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:312] [PID:1428] BOS: 2 / <bos>
608
+ [2026-08-10 01:26:11,941] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:313] [PID:1428] PAD: 0 / <pad>
609
+ [2026-08-10 01:26:11,941] [DEBUG] [axolotl.loaders.tokenizer.load_tokenizer:314] [PID:1428] UNK: 3 / <unk>
610
+ [2026-08-10 01:26:13,601] [DEBUG] [axolotl.train.setup_model_and_tokenizer:81] [PID:1428] Loading model
611
+ [2026-08-10 01:26:13,606] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:75] [PID:1428] Patched OptimState8bit for torch.compile compatibility
612
+ [2026-08-10 01:26:13,606] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:122] [PID:1428] Patched OptimState4bit for torch.compile compatibility
613
+ [2026-08-10 01:26:13,606] [DEBUG] [axolotl.monkeypatch.torchao_optim.patch_torchao_optim_state_8bit:154] [PID:1428] Patched OptimStateFp8 for torch.compile compatibility
614
+ [2026-08-10 01:26:13,611] [DEBUG] [axolotl.monkeypatch.transformers.trainer_loss_calc.patch_evaluation_loop:94] [PID:1428] Patched Trainer.evaluation_loop with nanmean loss calculation
615
+ [2026-08-10 01:26:13,612] [DEBUG] [axolotl.monkeypatch.transformers.trainer_loss_calc.patch_maybe_log_save_evaluate:148] [PID:1428] Patched Trainer._maybe_log_save_evaluate with nanmean loss calculation
616
+ [2026-08-10 01:26:13,662] [INFO] [axolotl.monkeypatch.attention.flash_attn_4.patch_flash_attn_4:52] [PID:1428] Flash Attention 4 is available for your GPU and offers faster training speeds. To enable: pip install flash-attn-4
617
+ [2026-08-10 01:26:15,049] [INFO] [axolotl.monkeypatch.lora_kernels.patch_self_attn_lora:304] [PID:1428] Patched attention class with LoRA optims: Gemma3Attention
618
+ [2026-08-10 01:26:15,319] [INFO] [axolotl.integrations.liger.plugin.pre_model_load:117] [PID:1428] Applying LIGER to gemma3 with kwargs: {'rope': True, 'cross_entropy': None, 'fused_linear_cross_entropy': True, 'rms_norm': True, 'layer_norm': None, 'geglu': True}
619
+
620
+ [2026-08-10 01:26:18,365] [INFO] [axolotl.loaders.model._configure_embedding_dtypes:433] [PID:1428] Converting modules to torch.bfloat16
621
+ [2026-08-10 01:26:19,561] [DEBUG] [axolotl.loaders.model.log_gpu_memory_usage:127] [PID:1428] Memory usage after model load 0.000GB ()
622
+ trainable params: 261,881,856 || all params: 12,449,206,896 || trainable%: 2.1036
623
+ [2026-08-10 01:26:21,513] [DEBUG] [axolotl.loaders.model.log_gpu_memory_usage:127] [PID:1428] after adapters 0.000GB ()
624
+ [2026-08-10 01:26:26,114] [INFO] [axolotl.train.save_initial_configs:450] [PID:1428] Pre-saving adapter config to /workspace/python4-aft-20260810T011719Z-control/experiments/python4_aft_generalization/runs/20260810T011719Z/arms/control/train/checkpoints...
625
+ [2026-08-10 01:26:26,115] [INFO] [axolotl.train.save_initial_configs:454] [PID:1428] Pre-saving tokenizer to /workspace/python4-aft-20260810T011719Z-control/experiments/python4_aft_generalization/runs/20260810T011719Z/arms/control/train/checkpoints...
626
+ [2026-08-10 01:26:26,420] [INFO] [axolotl.train.save_initial_configs:459] [PID:1428] Pre-saving model config to /workspace/python4-aft-20260810T011719Z-control/experiments/python4_aft_generalization/runs/20260810T011719Z/arms/control/train/checkpoints...
627
+ [2026-08-10 01:26:26,423] [INFO] [axolotl.train.save_initial_configs:463] [PID:1428] Pre-saving processor to /workspace/python4-aft-20260810T011719Z-control/experiments/python4_aft_generalization/runs/20260810T011719Z/arms/control/train/checkpoints...
628
+ [2026-08-10 01:26:26,689] [INFO] [axolotl.train.execute_training:226] [PID:1428] Starting trainer...
629
+
630
  0%| | 0/2 [00:00<?, ?it/s]
631
  50%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 1/2 [00:08<00:08, 8.05s/it]
632
 
633
+
634
  50%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 1/2 [00:08<00:08, 8.05s/it]
635
 
636
+
637
+
638
 
639
+
640
+ [2026-08-10 01:26:41,584] [INFO] [axolotl.train.save_trained_model:267] [PID:1428] Training completed! Saving trained model to /workspace/python4-aft-20260810T011719Z-control/experiments/python4_aft_generalization/runs/20260810T011719Z/arms/control/train/checkpoints.
641
+ [2026-08-10 01:26:42,175] [INFO] [axolotl.train.save_trained_model:388] [PID:1428] Model successfully saved to /workspace/python4-aft-20260810T011719Z-control/experiments/python4_aft_generalization/runs/20260810T011719Z/arms/control/train/checkpoints
smoke/20260810T011719Z/arms/control/adapter/processor_config.json ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "image_processor": {
3
+ "do_convert_rgb": null,
4
+ "do_normalize": true,
5
+ "do_rescale": true,
6
+ "do_resize": true,
7
+ "image_mean": [
8
+ 0.5,
9
+ 0.5,
10
+ 0.5
11
+ ],
12
+ "image_processor_type": "Gemma3ImageProcessor",
13
+ "image_seq_length": 256,
14
+ "image_std": [
15
+ 0.5,
16
+ 0.5,
17
+ 0.5
18
+ ],
19
+ "resample": 2,
20
+ "rescale_factor": 0.00392156862745098,
21
+ "size": {
22
+ "height": 896,
23
+ "width": 896
24
+ }
25
+ },
26
+ "image_seq_length": 256,
27
+ "processor_class": "Gemma3Processor"
28
+ }
smoke/20260810T011719Z/arms/control/adapter/tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:daab2354f8a74e70d70b4d1f804939b68a8c9624dd06cb7858e52dd8970e9726
3
+ size 33384567
smoke/20260810T011719Z/arms/control/adapter/tokenizer_config.json ADDED
@@ -0,0 +1,26 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "boi_token": "<start_of_image>",
4
+ "bos_token": "<bos>",
5
+ "clean_up_tokenization_spaces": false,
6
+ "eoi_token": "<end_of_image>",
7
+ "eos_token": "<eos>",
8
+ "image_token": "<image_soft_token>",
9
+ "is_local": true,
10
+ "local_files_only": false,
11
+ "mask_token": "<mask>",
12
+ "model_max_length": 131072,
13
+ "model_specific_special_tokens": {
14
+ "boi_token": "<start_of_image>",
15
+ "eoi_token": "<end_of_image>",
16
+ "image_token": "<image_soft_token>"
17
+ },
18
+ "pad_token": "<pad>",
19
+ "padding_side": "left",
20
+ "processor_class": "Gemma3Processor",
21
+ "sp_model_kwargs": null,
22
+ "spaces_between_special_tokens": false,
23
+ "tokenizer_class": "GemmaTokenizer",
24
+ "unk_token": "<unk>",
25
+ "use_default_system_prompt": false
26
+ }