diff --git a/.gitattributes b/.gitattributes
index a6344aac8c09253b3b630fb776ae94478aa0275b..1da1495d0e44a18a356820680f3cf850d368d2e2 100644
--- a/.gitattributes
+++ b/.gitattributes
@@ -33,3 +33,12 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
+qwen3-1.7b-teutonic-2e5/checkpoint-1000/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+qwen3-1.7b-teutonic-2e5/checkpoint-1485/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+qwen3-1.7b-teutonic-2e5/checkpoint-500/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+qwen3-1.7b-teutonic-2e5/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+qwen3-1.7b-teutonic-5e6/checkpoint-1000/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+qwen3-1.7b-teutonic-5e6/checkpoint-1500/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+qwen3-1.7b-teutonic-5e6/checkpoint-2000/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+qwen3-1.7b-teutonic-5e6/checkpoint-2475/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+qwen3-1.7b-teutonic-5e6/checkpoint-500/tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/README.md b/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..a503414d7c85e57a38b16572136a5a8bb102f5cb
--- /dev/null
+++ b/README.md
@@ -0,0 +1,58 @@
+---
+base_model: Qwen/Qwen3-1.7B
+library_name: transformers
+model_name: checkpoints
+tags:
+- generated_from_trainer
+- trl
+- sft
+licence: license
+---
+
+# Model Card for checkpoints
+
+This model is a fine-tuned version of [Qwen/Qwen3-1.7B](https://huggingface.co/Qwen/Qwen3-1.7B).
+It has been trained using [TRL](https://github.com/huggingface/trl).
+
+## Quick start
+
+```python
+from transformers import pipeline
+
+question = "If you had a time machine, but could only go to the past or the future once and never return, which would you choose and why?"
+generator = pipeline("text-generation", model="None", device_map="auto")
+output = generator([{"role": "user", "content": question}], max_new_tokens=128, return_full_text=False)[0]
+print(output["generated_text"])
+```
+
+## Training procedure
+
+
+
+
+
+This model was trained with SFT.
+
+### Framework versions
+
+- TRL: 1.14.0
+- Transformers: 5.17.0
+- Pytorch: 2.14.0
+- Datasets: 5.0.1
+- Tokenizers: 0.23.2
+
+## Citations
+
+
+
+Cite TRL as:
+
+```bibtex
+@software{vonwerra2020trl,
+ title = {{TRL: Transformers Reinforcement Learning}},
+ author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin},
+ license = {Apache-2.0},
+ url = {https://github.com/huggingface/trl},
+ year = {2020}
+}
+```
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-2e5/README.md b/qwen3-1.7b-teutonic-2e5/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..f8d3965b4a9dcebbc42d1cb24a520aeac449423b
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/README.md
@@ -0,0 +1,58 @@
+---
+base_model: Qwen/Qwen3-1.7B
+library_name: transformers
+model_name: qwen3-1.7b-teutonic
+tags:
+- generated_from_trainer
+- sft
+- trl
+licence: license
+---
+
+# Model Card for qwen3-1.7b-teutonic
+
+This model is a fine-tuned version of [Qwen/Qwen3-1.7B](https://huggingface.co/Qwen/Qwen3-1.7B).
+It has been trained using [TRL](https://github.com/huggingface/trl).
+
+## Quick start
+
+```python
+from transformers import pipeline
+
+question = "If you had a time machine, but could only go to the past or the future once and never return, which would you choose and why?"
+generator = pipeline("text-generation", model="None", device_map="auto")
+output = generator([{"role": "user", "content": question}], max_new_tokens=128, return_full_text=False)[0]
+print(output["generated_text"])
+```
+
+## Training procedure
+
+[
](https://wandb.ai/digitallibrary849-adobe/tiny-teutonic-sn3/runs/p68ygpe9)
+
+
+
+This model was trained with SFT.
+
+### Framework versions
+
+- TRL: 1.14.0
+- Transformers: 5.17.0
+- Pytorch: 2.14.0
+- Datasets: 5.0.1
+- Tokenizers: 0.23.2
+
+## Citations
+
+
+
+Cite TRL as:
+
+```bibtex
+@software{vonwerra2020trl,
+ title = {{TRL: Transformers Reinforcement Learning}},
+ author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin},
+ license = {Apache-2.0},
+ url = {https://github.com/huggingface/trl},
+ year = {2020}
+}
+```
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-2e5/chat_template.jinja b/qwen3-1.7b-teutonic-2e5/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..01be9b307daa2d425f7c168c9fb145a286e0afb4
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/chat_template.jinja
@@ -0,0 +1,89 @@
+{%- if tools %}
+ {{- '<|im_start|>system\n' }}
+ {%- if messages[0].role == 'system' %}
+ {{- messages[0].content + '\n\n' }}
+ {%- endif %}
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+{%- endfor %}
+{%- for message in messages %}
+ {%- if message.content is string %}
+ {%- set content = message.content %}
+ {%- else %}
+ {%- set content = '' %}
+ {%- endif %}
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {%- if loop.last or (not loop.last and reasoning_content) %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if (loop.first and content) or (not loop.first) %}
+ {{- '\n' }}
+ {%- endif %}
+ {%- if tool_call.function %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {{- '\n{"name": "' }}
+ {{- tool_call.name }}
+ {{- '", "arguments": ' }}
+ {%- if tool_call.arguments is string %}
+ {{- tool_call.arguments }}
+ {%- else %}
+ {{- tool_call.arguments | tojson }}
+ {%- endif %}
+ {{- '}\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/chat_template.jinja b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..01be9b307daa2d425f7c168c9fb145a286e0afb4
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/chat_template.jinja
@@ -0,0 +1,89 @@
+{%- if tools %}
+ {{- '<|im_start|>system\n' }}
+ {%- if messages[0].role == 'system' %}
+ {{- messages[0].content + '\n\n' }}
+ {%- endif %}
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+{%- endfor %}
+{%- for message in messages %}
+ {%- if message.content is string %}
+ {%- set content = message.content %}
+ {%- else %}
+ {%- set content = '' %}
+ {%- endif %}
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {%- if loop.last or (not loop.last and reasoning_content) %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if (loop.first and content) or (not loop.first) %}
+ {{- '\n' }}
+ {%- endif %}
+ {%- if tool_call.function %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {{- '\n{"name": "' }}
+ {{- tool_call.name }}
+ {{- '", "arguments": ' }}
+ {%- if tool_call.arguments is string %}
+ {{- tool_call.arguments }}
+ {%- else %}
+ {{- tool_call.arguments | tojson }}
+ {%- endif %}
+ {{- '}\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/config.json b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/config.json
new file mode 100644
index 0000000000000000000000000000000000000000..5d9cef07396baadff5390e4508eb33025967a029
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/config.json
@@ -0,0 +1,63 @@
+{
+ "architectures": [
+ "Qwen3ForCausalLM"
+ ],
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "bos_token_id": null,
+ "dtype": "bfloat16",
+ "eos_token_id": 151645,
+ "head_dim": 128,
+ "hidden_act": "silu",
+ "hidden_size": 2048,
+ "initializer_range": 0.02,
+ "intermediate_size": 6144,
+ "layer_types": [
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 40960,
+ "max_window_layers": 28,
+ "model_type": "qwen3",
+ "num_attention_heads": 16,
+ "num_hidden_layers": 28,
+ "num_key_value_heads": 8,
+ "pad_token_id": 151643,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 1000000,
+ "rope_type": "default"
+ },
+ "sliding_window": null,
+ "tie_word_embeddings": true,
+ "transformers_version": "5.17.0",
+ "use_cache": false,
+ "use_sliding_window": false,
+ "vocab_size": 151936
+}
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/generation_config.json b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/generation_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..e6941fe4b04f26113d6eef6255d005c4d7090bda
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/generation_config.json
@@ -0,0 +1,12 @@
+{
+ "do_sample": true,
+ "eos_token_id": [
+ 151645,
+ 151643
+ ],
+ "pad_token_id": 151643,
+ "temperature": 0.6,
+ "top_k": 20,
+ "top_p": 0.95,
+ "transformers_version": "5.17.0"
+}
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/global_step1000/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/global_step1000/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..cd89106459e84c169fdaa896734f96b7ce33f3e3
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/global_step1000/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:96cfd9e21801ef6218fbab21a5c0f8a89417a68b23f7f172cc103b7b9096465c
+size 10323466465
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/global_step1000/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/global_step1000/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..0032cf1c9344ee4129931242b4c746f02a823fd7
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/global_step1000/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8631f97305801b329e34c86ed9f95e0df053ebc887476664878777bae4a6655d
+size 10323469601
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/global_step1000/mp_rank_00_model_states.pt b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/global_step1000/mp_rank_00_model_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..8c5fc4812ba7b709230b32fe3a3bb690d9ccda34
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/global_step1000/mp_rank_00_model_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:6fdea8231d72131f1af5a5eeb83f486070f5229920fd247e7c86efb5e7c2da49
+size 3441239653
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/latest b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/latest
new file mode 100644
index 0000000000000000000000000000000000000000..e2d3435fb1acf8913e6bd6c51b01adfc69b11ac6
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/latest
@@ -0,0 +1 @@
+global_step1000
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/model.safetensors b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..00a4cd5d7131484cc092e3e4e7cc0dad8268209b
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:7a4034a382d3c7ce1b02a0e0d59a33235e272d8268672220ec4e5778d9d82f57
+size 4063515640
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/rng_state_0.pth b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/rng_state_0.pth
new file mode 100644
index 0000000000000000000000000000000000000000..6b0b60f9361dbf4c1a1ddbad81bb2c3bcac48e02
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/rng_state_0.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e1557eea53882574b3f18c13a4ba48b553f2cf8514c888f71896ffe922a42d70
+size 14917
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/rng_state_1.pth b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/rng_state_1.pth
new file mode 100644
index 0000000000000000000000000000000000000000..0d5432e6306f80173a86daf24553be9dcb3cbec6
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/rng_state_1.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ed239779e6c9f5466cc9b1bc2adf2c4f487688a6bf675c36513a13bc18b548da
+size 14917
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/scheduler.pt b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/scheduler.pt
new file mode 100644
index 0000000000000000000000000000000000000000..3487f82820b735c83fedd88fd7c280069599cadd
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/scheduler.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:08d162c3c2b666c2182c3e6d9eac8ea5b3fa1bb5f4607fd0a76b169eb562c178
+size 1465
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/tokenizer.json b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..c7afbed2efcdf019f88ab0572ec29d3bf595dfe2
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:be75606093db2094d7cd20f3c2f385c212750648bd6ea4fb2bf507a6a4c55506
+size 11422650
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/tokenizer_config.json b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..770e41d6c92519d525eede4cbcf3ba27f6425311
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/tokenizer_config.json
@@ -0,0 +1,30 @@
+{
+ "add_prefix_space": false,
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "is_local": false,
+ "local_files_only": false,
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/trainer_state.json b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..400c59c8538c94719ec9931952a304554f2922d0
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/trainer_state.json
@@ -0,0 +1,10144 @@
+{
+ "best_global_step": 400,
+ "best_metric": 1.5199862718582153,
+ "best_model_checkpoint": null,
+ "epoch": 2.0202020202020203,
+ "eval_steps": 100,
+ "global_step": 1000,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 0.8295683860778809,
+ "epoch": 0.00202020202020202,
+ "grad_norm": 10.885663032531738,
+ "learning_rate": 2e-05,
+ "loss": 1.5185801982879639,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 16384.0,
+ "step": 1
+ },
+ {
+ "entropy": 1.3341505527496338,
+ "epoch": 0.00404040404040404,
+ "grad_norm": 9.276060104370117,
+ "learning_rate": 1.9986531986531986e-05,
+ "loss": 2.0802578926086426,
+ "mean_token_accuracy": 0.5727283954620361,
+ "num_tokens": 32768.0,
+ "step": 2
+ },
+ {
+ "entropy": 1.159377932548523,
+ "epoch": 0.006060606060606061,
+ "grad_norm": 3.999565839767456,
+ "learning_rate": 1.9973063973063975e-05,
+ "loss": 1.4128143787384033,
+ "mean_token_accuracy": 0.6849657893180847,
+ "num_tokens": 49152.0,
+ "step": 3
+ },
+ {
+ "entropy": 1.504081130027771,
+ "epoch": 0.00808080808080808,
+ "grad_norm": 3.018310546875,
+ "learning_rate": 1.995959595959596e-05,
+ "loss": 1.5479036569595337,
+ "mean_token_accuracy": 0.647777259349823,
+ "num_tokens": 65536.0,
+ "step": 4
+ },
+ {
+ "entropy": 2.1211423873901367,
+ "epoch": 0.010101010101010102,
+ "grad_norm": 4.352237701416016,
+ "learning_rate": 1.9946127946127948e-05,
+ "loss": 1.7965757846832275,
+ "mean_token_accuracy": 0.5992916226387024,
+ "num_tokens": 81920.0,
+ "step": 5
+ },
+ {
+ "entropy": 1.6345494985580444,
+ "epoch": 0.012121212121212121,
+ "grad_norm": 3.2360711097717285,
+ "learning_rate": 1.9932659932659936e-05,
+ "loss": 1.4024577140808105,
+ "mean_token_accuracy": 0.6747679710388184,
+ "num_tokens": 98304.0,
+ "step": 6
+ },
+ {
+ "entropy": 2.105585813522339,
+ "epoch": 0.014141414141414142,
+ "grad_norm": 2.84971284866333,
+ "learning_rate": 1.991919191919192e-05,
+ "loss": 1.9915739297866821,
+ "mean_token_accuracy": 0.5882999300956726,
+ "num_tokens": 114688.0,
+ "step": 7
+ },
+ {
+ "entropy": 1.7230671644210815,
+ "epoch": 0.01616161616161616,
+ "grad_norm": 2.686546802520752,
+ "learning_rate": 1.990572390572391e-05,
+ "loss": 1.630468726158142,
+ "mean_token_accuracy": 0.6269540786743164,
+ "num_tokens": 131072.0,
+ "step": 8
+ },
+ {
+ "entropy": 2.048288106918335,
+ "epoch": 0.01818181818181818,
+ "grad_norm": 2.6931567192077637,
+ "learning_rate": 1.9892255892255894e-05,
+ "loss": 2.212648391723633,
+ "mean_token_accuracy": 0.5294333100318909,
+ "num_tokens": 147456.0,
+ "step": 9
+ },
+ {
+ "entropy": 1.3021576404571533,
+ "epoch": 0.020202020202020204,
+ "grad_norm": 2.5286052227020264,
+ "learning_rate": 1.9878787878787878e-05,
+ "loss": 1.4357099533081055,
+ "mean_token_accuracy": 0.6633487939834595,
+ "num_tokens": 163840.0,
+ "step": 10
+ },
+ {
+ "entropy": 1.6998594999313354,
+ "epoch": 0.022222222222222223,
+ "grad_norm": 2.673692226409912,
+ "learning_rate": 1.9865319865319866e-05,
+ "loss": 1.8616552352905273,
+ "mean_token_accuracy": 0.6129091382026672,
+ "num_tokens": 180224.0,
+ "step": 11
+ },
+ {
+ "entropy": 1.5349891185760498,
+ "epoch": 0.024242424242424242,
+ "grad_norm": 2.882964611053467,
+ "learning_rate": 1.9851851851851855e-05,
+ "loss": 1.7540476322174072,
+ "mean_token_accuracy": 0.6111993193626404,
+ "num_tokens": 196608.0,
+ "step": 12
+ },
+ {
+ "entropy": 1.4202098846435547,
+ "epoch": 0.026262626262626262,
+ "grad_norm": 2.3892722129821777,
+ "learning_rate": 1.983838383838384e-05,
+ "loss": 1.5638885498046875,
+ "mean_token_accuracy": 0.642892062664032,
+ "num_tokens": 212992.0,
+ "step": 13
+ },
+ {
+ "entropy": 1.462074875831604,
+ "epoch": 0.028282828282828285,
+ "grad_norm": 2.357353925704956,
+ "learning_rate": 1.9824915824915828e-05,
+ "loss": 1.5339899063110352,
+ "mean_token_accuracy": 0.643991231918335,
+ "num_tokens": 229376.0,
+ "step": 14
+ },
+ {
+ "entropy": 1.6386674642562866,
+ "epoch": 0.030303030303030304,
+ "grad_norm": 2.1600515842437744,
+ "learning_rate": 1.9811447811447812e-05,
+ "loss": 1.6242434978485107,
+ "mean_token_accuracy": 0.6472887396812439,
+ "num_tokens": 245760.0,
+ "step": 15
+ },
+ {
+ "entropy": 1.882306456565857,
+ "epoch": 0.03232323232323232,
+ "grad_norm": 2.478746175765991,
+ "learning_rate": 1.97979797979798e-05,
+ "loss": 1.83274245262146,
+ "mean_token_accuracy": 0.5993527173995972,
+ "num_tokens": 262144.0,
+ "step": 16
+ },
+ {
+ "entropy": 1.5836528539657593,
+ "epoch": 0.03434343434343434,
+ "grad_norm": 2.5016613006591797,
+ "learning_rate": 1.9784511784511785e-05,
+ "loss": 1.5364878177642822,
+ "mean_token_accuracy": 0.6441743969917297,
+ "num_tokens": 278528.0,
+ "step": 17
+ },
+ {
+ "entropy": 1.5695534944534302,
+ "epoch": 0.03636363636363636,
+ "grad_norm": 2.2971248626708984,
+ "learning_rate": 1.9771043771043774e-05,
+ "loss": 1.5179738998413086,
+ "mean_token_accuracy": 0.6437469720840454,
+ "num_tokens": 294912.0,
+ "step": 18
+ },
+ {
+ "entropy": 1.3835400342941284,
+ "epoch": 0.03838383838383838,
+ "grad_norm": 2.1497576236724854,
+ "learning_rate": 1.975757575757576e-05,
+ "loss": 1.3505406379699707,
+ "mean_token_accuracy": 0.6729970574378967,
+ "num_tokens": 311296.0,
+ "step": 19
+ },
+ {
+ "entropy": 1.4660464525222778,
+ "epoch": 0.04040404040404041,
+ "grad_norm": 2.048318862915039,
+ "learning_rate": 1.9744107744107747e-05,
+ "loss": 1.3898100852966309,
+ "mean_token_accuracy": 0.6654250025749207,
+ "num_tokens": 327680.0,
+ "step": 20
+ },
+ {
+ "entropy": 1.959633469581604,
+ "epoch": 0.04242424242424243,
+ "grad_norm": 2.2084245681762695,
+ "learning_rate": 1.973063973063973e-05,
+ "loss": 1.9230711460113525,
+ "mean_token_accuracy": 0.5726062655448914,
+ "num_tokens": 344064.0,
+ "step": 21
+ },
+ {
+ "entropy": 1.4872093200683594,
+ "epoch": 0.044444444444444446,
+ "grad_norm": 2.116982936859131,
+ "learning_rate": 1.971717171717172e-05,
+ "loss": 1.514385461807251,
+ "mean_token_accuracy": 0.6615168452262878,
+ "num_tokens": 360448.0,
+ "step": 22
+ },
+ {
+ "entropy": 1.845888614654541,
+ "epoch": 0.046464646464646465,
+ "grad_norm": 2.4377331733703613,
+ "learning_rate": 1.9703703703703704e-05,
+ "loss": 1.8750195503234863,
+ "mean_token_accuracy": 0.5962994694709778,
+ "num_tokens": 376832.0,
+ "step": 23
+ },
+ {
+ "entropy": 1.5549575090408325,
+ "epoch": 0.048484848484848485,
+ "grad_norm": 2.44534969329834,
+ "learning_rate": 1.9690235690235692e-05,
+ "loss": 1.627150058746338,
+ "mean_token_accuracy": 0.6215803623199463,
+ "num_tokens": 393216.0,
+ "step": 24
+ },
+ {
+ "entropy": 1.4516701698303223,
+ "epoch": 0.050505050505050504,
+ "grad_norm": 2.2948875427246094,
+ "learning_rate": 1.9676767676767677e-05,
+ "loss": 1.4912647008895874,
+ "mean_token_accuracy": 0.6431363224983215,
+ "num_tokens": 409600.0,
+ "step": 25
+ },
+ {
+ "entropy": 1.3493973016738892,
+ "epoch": 0.052525252525252523,
+ "grad_norm": 2.1061222553253174,
+ "learning_rate": 1.9663299663299665e-05,
+ "loss": 1.44138765335083,
+ "mean_token_accuracy": 0.6621885895729065,
+ "num_tokens": 425984.0,
+ "step": 26
+ },
+ {
+ "entropy": 1.7119438648223877,
+ "epoch": 0.05454545454545454,
+ "grad_norm": 2.5149970054626465,
+ "learning_rate": 1.9649831649831654e-05,
+ "loss": 1.776426076889038,
+ "mean_token_accuracy": 0.5944675207138062,
+ "num_tokens": 442368.0,
+ "step": 27
+ },
+ {
+ "entropy": 1.361685872077942,
+ "epoch": 0.05656565656565657,
+ "grad_norm": 2.343843460083008,
+ "learning_rate": 1.963636363636364e-05,
+ "loss": 1.404232144355774,
+ "mean_token_accuracy": 0.6639594435691833,
+ "num_tokens": 458752.0,
+ "step": 28
+ },
+ {
+ "entropy": 1.2213996648788452,
+ "epoch": 0.05858585858585859,
+ "grad_norm": 1.9002994298934937,
+ "learning_rate": 1.9622895622895623e-05,
+ "loss": 1.249969244003296,
+ "mean_token_accuracy": 0.6933927536010742,
+ "num_tokens": 475136.0,
+ "step": 29
+ },
+ {
+ "entropy": 1.7157055139541626,
+ "epoch": 0.06060606060606061,
+ "grad_norm": 2.21567702293396,
+ "learning_rate": 1.960942760942761e-05,
+ "loss": 1.7103240489959717,
+ "mean_token_accuracy": 0.6218856573104858,
+ "num_tokens": 491520.0,
+ "step": 30
+ },
+ {
+ "entropy": 1.8233915567398071,
+ "epoch": 0.06262626262626263,
+ "grad_norm": 2.0189297199249268,
+ "learning_rate": 1.9595959595959596e-05,
+ "loss": 1.820570707321167,
+ "mean_token_accuracy": 0.6126648783683777,
+ "num_tokens": 507904.0,
+ "step": 31
+ },
+ {
+ "entropy": 1.82878839969635,
+ "epoch": 0.06464646464646465,
+ "grad_norm": 2.556058883666992,
+ "learning_rate": 1.9582491582491584e-05,
+ "loss": 1.773336410522461,
+ "mean_token_accuracy": 0.5889716744422913,
+ "num_tokens": 524288.0,
+ "step": 32
+ },
+ {
+ "entropy": 1.4608416557312012,
+ "epoch": 0.06666666666666667,
+ "grad_norm": 2.0254712104797363,
+ "learning_rate": 1.956902356902357e-05,
+ "loss": 1.4261068105697632,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 540672.0,
+ "step": 33
+ },
+ {
+ "entropy": 1.4706993103027344,
+ "epoch": 0.06868686868686869,
+ "grad_norm": 2.1344153881073,
+ "learning_rate": 1.9555555555555557e-05,
+ "loss": 1.4610451459884644,
+ "mean_token_accuracy": 0.6472276449203491,
+ "num_tokens": 557056.0,
+ "step": 34
+ },
+ {
+ "entropy": 1.9629759788513184,
+ "epoch": 0.0707070707070707,
+ "grad_norm": 2.209073066711426,
+ "learning_rate": 1.9542087542087545e-05,
+ "loss": 1.9688678979873657,
+ "mean_token_accuracy": 0.5702857971191406,
+ "num_tokens": 573440.0,
+ "step": 35
+ },
+ {
+ "entropy": 1.5821412801742554,
+ "epoch": 0.07272727272727272,
+ "grad_norm": 1.9711852073669434,
+ "learning_rate": 1.952861952861953e-05,
+ "loss": 1.5614874362945557,
+ "mean_token_accuracy": 0.639167070388794,
+ "num_tokens": 589824.0,
+ "step": 36
+ },
+ {
+ "entropy": 1.4696686267852783,
+ "epoch": 0.07474747474747474,
+ "grad_norm": 2.07849383354187,
+ "learning_rate": 1.9515151515151515e-05,
+ "loss": 1.497229814529419,
+ "mean_token_accuracy": 0.6555324792861938,
+ "num_tokens": 606208.0,
+ "step": 37
+ },
+ {
+ "entropy": 1.481307864189148,
+ "epoch": 0.07676767676767676,
+ "grad_norm": 2.028839588165283,
+ "learning_rate": 1.9501683501683503e-05,
+ "loss": 1.495100975036621,
+ "mean_token_accuracy": 0.6472276449203491,
+ "num_tokens": 622592.0,
+ "step": 38
+ },
+ {
+ "entropy": 1.515073537826538,
+ "epoch": 0.07878787878787878,
+ "grad_norm": 2.2417402267456055,
+ "learning_rate": 1.9488215488215488e-05,
+ "loss": 1.6139262914657593,
+ "mean_token_accuracy": 0.6312286257743835,
+ "num_tokens": 638976.0,
+ "step": 39
+ },
+ {
+ "entropy": 1.9048941135406494,
+ "epoch": 0.08080808080808081,
+ "grad_norm": 2.232630968093872,
+ "learning_rate": 1.9474747474747476e-05,
+ "loss": 1.9573429822921753,
+ "mean_token_accuracy": 0.5796287059783936,
+ "num_tokens": 655360.0,
+ "step": 40
+ },
+ {
+ "entropy": 1.7393985986709595,
+ "epoch": 0.08282828282828283,
+ "grad_norm": 2.1077799797058105,
+ "learning_rate": 1.9461279461279464e-05,
+ "loss": 1.825897216796875,
+ "mean_token_accuracy": 0.5946506857872009,
+ "num_tokens": 671744.0,
+ "step": 41
+ },
+ {
+ "entropy": 1.6294668912887573,
+ "epoch": 0.08484848484848485,
+ "grad_norm": 2.299520492553711,
+ "learning_rate": 1.944781144781145e-05,
+ "loss": 1.6667912006378174,
+ "mean_token_accuracy": 0.6225574016571045,
+ "num_tokens": 688128.0,
+ "step": 42
+ },
+ {
+ "entropy": 1.4176290035247803,
+ "epoch": 0.08686868686868687,
+ "grad_norm": 1.9385138750076294,
+ "learning_rate": 1.9434343434343437e-05,
+ "loss": 1.422924280166626,
+ "mean_token_accuracy": 0.6719589829444885,
+ "num_tokens": 704512.0,
+ "step": 43
+ },
+ {
+ "entropy": 1.6570991277694702,
+ "epoch": 0.08888888888888889,
+ "grad_norm": 2.1650922298431396,
+ "learning_rate": 1.9420875420875422e-05,
+ "loss": 1.6351218223571777,
+ "mean_token_accuracy": 0.6342818737030029,
+ "num_tokens": 720896.0,
+ "step": 44
+ },
+ {
+ "entropy": 1.520472764968872,
+ "epoch": 0.09090909090909091,
+ "grad_norm": 2.116955280303955,
+ "learning_rate": 1.9407407407407407e-05,
+ "loss": 1.4788711071014404,
+ "mean_token_accuracy": 0.6557767391204834,
+ "num_tokens": 737280.0,
+ "step": 45
+ },
+ {
+ "entropy": 1.3090498447418213,
+ "epoch": 0.09292929292929293,
+ "grad_norm": 2.0493314266204834,
+ "learning_rate": 1.9393939393939395e-05,
+ "loss": 1.3372726440429688,
+ "mean_token_accuracy": 0.6762945652008057,
+ "num_tokens": 753664.0,
+ "step": 46
+ },
+ {
+ "entropy": 1.6449471712112427,
+ "epoch": 0.09494949494949495,
+ "grad_norm": 2.2450437545776367,
+ "learning_rate": 1.9380471380471383e-05,
+ "loss": 1.6683790683746338,
+ "mean_token_accuracy": 0.6266487836837769,
+ "num_tokens": 770048.0,
+ "step": 47
+ },
+ {
+ "entropy": 1.2516838312149048,
+ "epoch": 0.09696969696969697,
+ "grad_norm": 2.168203592300415,
+ "learning_rate": 1.9367003367003368e-05,
+ "loss": 1.2885866165161133,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 786432.0,
+ "step": 48
+ },
+ {
+ "entropy": 1.7858967781066895,
+ "epoch": 0.09898989898989899,
+ "grad_norm": 2.0490918159484863,
+ "learning_rate": 1.9353535353535356e-05,
+ "loss": 1.8125935792922974,
+ "mean_token_accuracy": 0.5957498550415039,
+ "num_tokens": 802816.0,
+ "step": 49
+ },
+ {
+ "entropy": 1.6833406686782837,
+ "epoch": 0.10101010101010101,
+ "grad_norm": 1.9622541666030884,
+ "learning_rate": 1.934006734006734e-05,
+ "loss": 1.715425729751587,
+ "mean_token_accuracy": 0.606008768081665,
+ "num_tokens": 819200.0,
+ "step": 50
+ },
+ {
+ "entropy": 1.4103842973709106,
+ "epoch": 0.10303030303030303,
+ "grad_norm": 2.015503406524658,
+ "learning_rate": 1.932659932659933e-05,
+ "loss": 1.4374600648880005,
+ "mean_token_accuracy": 0.6615168452262878,
+ "num_tokens": 835584.0,
+ "step": 51
+ },
+ {
+ "entropy": 1.6805938482284546,
+ "epoch": 0.10505050505050505,
+ "grad_norm": 2.139333963394165,
+ "learning_rate": 1.9313131313131314e-05,
+ "loss": 1.684693455696106,
+ "mean_token_accuracy": 0.6270151734352112,
+ "num_tokens": 851968.0,
+ "step": 52
+ },
+ {
+ "entropy": 1.770232915878296,
+ "epoch": 0.10707070707070707,
+ "grad_norm": 2.3331124782562256,
+ "learning_rate": 1.92996632996633e-05,
+ "loss": 1.781606674194336,
+ "mean_token_accuracy": 0.6006350517272949,
+ "num_tokens": 868352.0,
+ "step": 53
+ },
+ {
+ "entropy": 1.676267147064209,
+ "epoch": 0.10909090909090909,
+ "grad_norm": 2.1863765716552734,
+ "learning_rate": 1.9286195286195287e-05,
+ "loss": 1.6873016357421875,
+ "mean_token_accuracy": 0.6182828545570374,
+ "num_tokens": 884736.0,
+ "step": 54
+ },
+ {
+ "entropy": 1.3133333921432495,
+ "epoch": 0.1111111111111111,
+ "grad_norm": 2.455390691757202,
+ "learning_rate": 1.9272727272727275e-05,
+ "loss": 1.336955189704895,
+ "mean_token_accuracy": 0.682584285736084,
+ "num_tokens": 901120.0,
+ "step": 55
+ },
+ {
+ "entropy": 1.8064881563186646,
+ "epoch": 0.11313131313131314,
+ "grad_norm": 2.218869686126709,
+ "learning_rate": 1.925925925925926e-05,
+ "loss": 1.8163663148880005,
+ "mean_token_accuracy": 0.5947728157043457,
+ "num_tokens": 917504.0,
+ "step": 56
+ },
+ {
+ "entropy": 1.495352864265442,
+ "epoch": 0.11515151515151516,
+ "grad_norm": 2.040064573287964,
+ "learning_rate": 1.9245791245791248e-05,
+ "loss": 1.4638073444366455,
+ "mean_token_accuracy": 0.6512579321861267,
+ "num_tokens": 933888.0,
+ "step": 57
+ },
+ {
+ "entropy": 1.5757899284362793,
+ "epoch": 0.11717171717171718,
+ "grad_norm": 1.8449796438217163,
+ "learning_rate": 1.9232323232323233e-05,
+ "loss": 1.5526244640350342,
+ "mean_token_accuracy": 0.6346482634544373,
+ "num_tokens": 950272.0,
+ "step": 58
+ },
+ {
+ "entropy": 1.6834555864334106,
+ "epoch": 0.1191919191919192,
+ "grad_norm": 2.0705320835113525,
+ "learning_rate": 1.921885521885522e-05,
+ "loss": 1.753828763961792,
+ "mean_token_accuracy": 0.6237176060676575,
+ "num_tokens": 966656.0,
+ "step": 59
+ },
+ {
+ "entropy": 1.5231870412826538,
+ "epoch": 0.12121212121212122,
+ "grad_norm": 2.1398122310638428,
+ "learning_rate": 1.9205387205387206e-05,
+ "loss": 1.515265941619873,
+ "mean_token_accuracy": 0.6452125310897827,
+ "num_tokens": 983040.0,
+ "step": 60
+ },
+ {
+ "entropy": 1.6915754079818726,
+ "epoch": 0.12323232323232323,
+ "grad_norm": 2.179158926010132,
+ "learning_rate": 1.9191919191919194e-05,
+ "loss": 1.6949875354766846,
+ "mean_token_accuracy": 0.6109550595283508,
+ "num_tokens": 999424.0,
+ "step": 61
+ },
+ {
+ "entropy": 1.580087661743164,
+ "epoch": 0.12525252525252525,
+ "grad_norm": 2.8643219470977783,
+ "learning_rate": 1.9178451178451182e-05,
+ "loss": 1.6217050552368164,
+ "mean_token_accuracy": 0.6498534679412842,
+ "num_tokens": 1015808.0,
+ "step": 62
+ },
+ {
+ "entropy": 1.7331494092941284,
+ "epoch": 0.12727272727272726,
+ "grad_norm": 2.0613038539886475,
+ "learning_rate": 1.9164983164983167e-05,
+ "loss": 1.7527930736541748,
+ "mean_token_accuracy": 0.59513920545578,
+ "num_tokens": 1032192.0,
+ "step": 63
+ },
+ {
+ "entropy": 1.3311079740524292,
+ "epoch": 0.1292929292929293,
+ "grad_norm": 1.996009111404419,
+ "learning_rate": 1.9151515151515152e-05,
+ "loss": 1.3299833536148071,
+ "mean_token_accuracy": 0.6760503053665161,
+ "num_tokens": 1048576.0,
+ "step": 64
+ },
+ {
+ "entropy": 1.1875317096710205,
+ "epoch": 0.13131313131313133,
+ "grad_norm": 1.9458681344985962,
+ "learning_rate": 1.913804713804714e-05,
+ "loss": 1.1885290145874023,
+ "mean_token_accuracy": 0.6996213793754578,
+ "num_tokens": 1064960.0,
+ "step": 65
+ },
+ {
+ "entropy": 1.0825527906417847,
+ "epoch": 0.13333333333333333,
+ "grad_norm": 1.8164746761322021,
+ "learning_rate": 1.9124579124579125e-05,
+ "loss": 1.0918856859207153,
+ "mean_token_accuracy": 0.7477405667304993,
+ "num_tokens": 1081344.0,
+ "step": 66
+ },
+ {
+ "entropy": 1.5940357446670532,
+ "epoch": 0.13535353535353536,
+ "grad_norm": 1.9322525262832642,
+ "learning_rate": 1.9111111111111113e-05,
+ "loss": 1.6157622337341309,
+ "mean_token_accuracy": 0.6340376138687134,
+ "num_tokens": 1097728.0,
+ "step": 67
+ },
+ {
+ "entropy": 1.683976173400879,
+ "epoch": 0.13737373737373737,
+ "grad_norm": 2.1792430877685547,
+ "learning_rate": 1.9097643097643098e-05,
+ "loss": 1.7643585205078125,
+ "mean_token_accuracy": 0.5998412370681763,
+ "num_tokens": 1114112.0,
+ "step": 68
+ },
+ {
+ "entropy": 1.5753607749938965,
+ "epoch": 0.1393939393939394,
+ "grad_norm": 2.033538818359375,
+ "learning_rate": 1.9084175084175086e-05,
+ "loss": 1.628584861755371,
+ "mean_token_accuracy": 0.6401441097259521,
+ "num_tokens": 1130496.0,
+ "step": 69
+ },
+ {
+ "entropy": 1.4061329364776611,
+ "epoch": 0.1414141414141414,
+ "grad_norm": 1.9239107370376587,
+ "learning_rate": 1.9070707070707074e-05,
+ "loss": 1.4355204105377197,
+ "mean_token_accuracy": 0.6727527976036072,
+ "num_tokens": 1146880.0,
+ "step": 70
+ },
+ {
+ "entropy": 1.1722302436828613,
+ "epoch": 0.14343434343434344,
+ "grad_norm": 2.0911052227020264,
+ "learning_rate": 1.905723905723906e-05,
+ "loss": 1.2008472681045532,
+ "mean_token_accuracy": 0.7064606547355652,
+ "num_tokens": 1163264.0,
+ "step": 71
+ },
+ {
+ "entropy": 1.5291107892990112,
+ "epoch": 0.14545454545454545,
+ "grad_norm": 2.1054158210754395,
+ "learning_rate": 1.9043771043771044e-05,
+ "loss": 1.574873924255371,
+ "mean_token_accuracy": 0.6356253027915955,
+ "num_tokens": 1179648.0,
+ "step": 72
+ },
+ {
+ "entropy": 1.3679379224777222,
+ "epoch": 0.14747474747474748,
+ "grad_norm": 1.928666353225708,
+ "learning_rate": 1.9030303030303032e-05,
+ "loss": 1.3473236560821533,
+ "mean_token_accuracy": 0.679347813129425,
+ "num_tokens": 1196032.0,
+ "step": 73
+ },
+ {
+ "entropy": 1.7593064308166504,
+ "epoch": 0.1494949494949495,
+ "grad_norm": 2.3172972202301025,
+ "learning_rate": 1.9016835016835017e-05,
+ "loss": 1.7953016757965088,
+ "mean_token_accuracy": 0.6107107996940613,
+ "num_tokens": 1212416.0,
+ "step": 74
+ },
+ {
+ "entropy": 1.3841301202774048,
+ "epoch": 0.15151515151515152,
+ "grad_norm": 1.9938782453536987,
+ "learning_rate": 1.9003367003367005e-05,
+ "loss": 1.3923728466033936,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 1228800.0,
+ "step": 75
+ },
+ {
+ "entropy": 1.6030631065368652,
+ "epoch": 0.15353535353535352,
+ "grad_norm": 2.0514845848083496,
+ "learning_rate": 1.8989898989898993e-05,
+ "loss": 1.5902166366577148,
+ "mean_token_accuracy": 0.6376404762268066,
+ "num_tokens": 1245184.0,
+ "step": 76
+ },
+ {
+ "entropy": 1.5902619361877441,
+ "epoch": 0.15555555555555556,
+ "grad_norm": 2.115469217300415,
+ "learning_rate": 1.8976430976430978e-05,
+ "loss": 1.5841395854949951,
+ "mean_token_accuracy": 0.6361138224601746,
+ "num_tokens": 1261568.0,
+ "step": 77
+ },
+ {
+ "entropy": 1.7821043729782104,
+ "epoch": 0.15757575757575756,
+ "grad_norm": 2.008962869644165,
+ "learning_rate": 1.8962962962962966e-05,
+ "loss": 1.7826645374298096,
+ "mean_token_accuracy": 0.6053370833396912,
+ "num_tokens": 1277952.0,
+ "step": 78
+ },
+ {
+ "entropy": 1.833274006843567,
+ "epoch": 0.1595959595959596,
+ "grad_norm": 2.0258517265319824,
+ "learning_rate": 1.894949494949495e-05,
+ "loss": 1.8566474914550781,
+ "mean_token_accuracy": 0.5800561904907227,
+ "num_tokens": 1294336.0,
+ "step": 79
+ },
+ {
+ "entropy": 1.785520315170288,
+ "epoch": 0.16161616161616163,
+ "grad_norm": 2.0918498039245605,
+ "learning_rate": 1.8936026936026936e-05,
+ "loss": 1.775907278060913,
+ "mean_token_accuracy": 0.6063141226768494,
+ "num_tokens": 1310720.0,
+ "step": 80
+ },
+ {
+ "entropy": 1.9341778755187988,
+ "epoch": 0.16363636363636364,
+ "grad_norm": 2.0399975776672363,
+ "learning_rate": 1.8922558922558924e-05,
+ "loss": 1.9579840898513794,
+ "mean_token_accuracy": 0.5619809627532959,
+ "num_tokens": 1327104.0,
+ "step": 81
+ },
+ {
+ "entropy": 1.4945461750030518,
+ "epoch": 0.16565656565656567,
+ "grad_norm": 1.9975999593734741,
+ "learning_rate": 1.8909090909090912e-05,
+ "loss": 1.5436582565307617,
+ "mean_token_accuracy": 0.6423424482345581,
+ "num_tokens": 1343488.0,
+ "step": 82
+ },
+ {
+ "entropy": 1.6639432907104492,
+ "epoch": 0.16767676767676767,
+ "grad_norm": 2.0375208854675293,
+ "learning_rate": 1.8895622895622897e-05,
+ "loss": 1.679243564605713,
+ "mean_token_accuracy": 0.6226184368133545,
+ "num_tokens": 1359872.0,
+ "step": 83
+ },
+ {
+ "entropy": 1.4505668878555298,
+ "epoch": 0.1696969696969697,
+ "grad_norm": 1.8894681930541992,
+ "learning_rate": 1.8882154882154885e-05,
+ "loss": 1.4778342247009277,
+ "mean_token_accuracy": 0.6637151837348938,
+ "num_tokens": 1376256.0,
+ "step": 84
+ },
+ {
+ "entropy": 1.3845125436782837,
+ "epoch": 0.1717171717171717,
+ "grad_norm": 2.1110754013061523,
+ "learning_rate": 1.886868686868687e-05,
+ "loss": 1.4153435230255127,
+ "mean_token_accuracy": 0.6737298369407654,
+ "num_tokens": 1392640.0,
+ "step": 85
+ },
+ {
+ "entropy": 1.8785539865493774,
+ "epoch": 0.17373737373737375,
+ "grad_norm": 2.0894815921783447,
+ "learning_rate": 1.8855218855218858e-05,
+ "loss": 1.8658334016799927,
+ "mean_token_accuracy": 0.5846360325813293,
+ "num_tokens": 1409024.0,
+ "step": 86
+ },
+ {
+ "entropy": 1.6006972789764404,
+ "epoch": 0.17575757575757575,
+ "grad_norm": 2.088477849960327,
+ "learning_rate": 1.8841750841750843e-05,
+ "loss": 1.6257164478302002,
+ "mean_token_accuracy": 0.623900830745697,
+ "num_tokens": 1425408.0,
+ "step": 87
+ },
+ {
+ "entropy": 1.1098109483718872,
+ "epoch": 0.17777777777777778,
+ "grad_norm": 1.934228539466858,
+ "learning_rate": 1.8828282828282827e-05,
+ "loss": 1.0948461294174194,
+ "mean_token_accuracy": 0.7248412370681763,
+ "num_tokens": 1441792.0,
+ "step": 88
+ },
+ {
+ "entropy": 1.4807215929031372,
+ "epoch": 0.1797979797979798,
+ "grad_norm": 2.06062388420105,
+ "learning_rate": 1.8814814814814816e-05,
+ "loss": 1.5115268230438232,
+ "mean_token_accuracy": 0.6463117003440857,
+ "num_tokens": 1458176.0,
+ "step": 89
+ },
+ {
+ "entropy": 1.07956862449646,
+ "epoch": 0.18181818181818182,
+ "grad_norm": 1.8913685083389282,
+ "learning_rate": 1.8801346801346804e-05,
+ "loss": 1.0902754068374634,
+ "mean_token_accuracy": 0.7308256030082703,
+ "num_tokens": 1474560.0,
+ "step": 90
+ },
+ {
+ "entropy": 1.4571733474731445,
+ "epoch": 0.18383838383838383,
+ "grad_norm": 2.2199525833129883,
+ "learning_rate": 1.8787878787878792e-05,
+ "loss": 1.4686330556869507,
+ "mean_token_accuracy": 0.6566927433013916,
+ "num_tokens": 1490944.0,
+ "step": 91
+ },
+ {
+ "entropy": 1.4484740495681763,
+ "epoch": 0.18585858585858586,
+ "grad_norm": 2.0670580863952637,
+ "learning_rate": 1.8774410774410777e-05,
+ "loss": 1.4791338443756104,
+ "mean_token_accuracy": 0.6493649482727051,
+ "num_tokens": 1507328.0,
+ "step": 92
+ },
+ {
+ "entropy": 1.498313546180725,
+ "epoch": 0.18787878787878787,
+ "grad_norm": 2.024329423904419,
+ "learning_rate": 1.876094276094276e-05,
+ "loss": 1.4964686632156372,
+ "mean_token_accuracy": 0.6457620859146118,
+ "num_tokens": 1523712.0,
+ "step": 93
+ },
+ {
+ "entropy": 1.4806159734725952,
+ "epoch": 0.1898989898989899,
+ "grad_norm": 2.1369152069091797,
+ "learning_rate": 1.874747474747475e-05,
+ "loss": 1.4587206840515137,
+ "mean_token_accuracy": 0.6521739363670349,
+ "num_tokens": 1540096.0,
+ "step": 94
+ },
+ {
+ "entropy": 1.3746109008789062,
+ "epoch": 0.1919191919191919,
+ "grad_norm": 2.216958522796631,
+ "learning_rate": 1.8734006734006735e-05,
+ "loss": 1.3600832223892212,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 1556480.0,
+ "step": 95
+ },
+ {
+ "entropy": 1.3492207527160645,
+ "epoch": 0.19393939393939394,
+ "grad_norm": 2.093956708908081,
+ "learning_rate": 1.8720538720538723e-05,
+ "loss": 1.3867243528366089,
+ "mean_token_accuracy": 0.6625549793243408,
+ "num_tokens": 1572864.0,
+ "step": 96
+ },
+ {
+ "entropy": 1.560738205909729,
+ "epoch": 0.19595959595959597,
+ "grad_norm": 2.0691707134246826,
+ "learning_rate": 1.8707070707070707e-05,
+ "loss": 1.5875897407531738,
+ "mean_token_accuracy": 0.6345872282981873,
+ "num_tokens": 1589248.0,
+ "step": 97
+ },
+ {
+ "entropy": 1.46450674533844,
+ "epoch": 0.19797979797979798,
+ "grad_norm": 2.064547538757324,
+ "learning_rate": 1.8693602693602696e-05,
+ "loss": 1.4920742511749268,
+ "mean_token_accuracy": 0.6411822438240051,
+ "num_tokens": 1605632.0,
+ "step": 98
+ },
+ {
+ "entropy": 1.5433454513549805,
+ "epoch": 0.2,
+ "grad_norm": 2.014409303665161,
+ "learning_rate": 1.868013468013468e-05,
+ "loss": 1.5737671852111816,
+ "mean_token_accuracy": 0.6349536180496216,
+ "num_tokens": 1622016.0,
+ "step": 99
+ },
+ {
+ "entropy": 1.358772873878479,
+ "epoch": 0.20202020202020202,
+ "grad_norm": 1.9765456914901733,
+ "learning_rate": 1.866666666666667e-05,
+ "loss": 1.3583091497421265,
+ "mean_token_accuracy": 0.680446982383728,
+ "num_tokens": 1638400.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.20202020202020202,
+ "eval_entropy": 1.5664977690865916,
+ "eval_loss": 1.5804312229156494,
+ "eval_mean_token_accuracy": 0.63647972239602,
+ "eval_num_tokens": 1638400.0,
+ "eval_runtime": 44.1541,
+ "eval_samples_per_second": 22.421,
+ "eval_steps_per_second": 2.808,
+ "step": 100
+ },
+ {
+ "entropy": 1.5879693031311035,
+ "epoch": 0.20404040404040405,
+ "grad_norm": 1.8491015434265137,
+ "learning_rate": 1.8653198653198653e-05,
+ "loss": 1.5892077684402466,
+ "mean_token_accuracy": 0.6665852665901184,
+ "num_tokens": 1654784.0,
+ "step": 101
+ },
+ {
+ "entropy": 1.5789942741394043,
+ "epoch": 0.20606060606060606,
+ "grad_norm": 1.9096908569335938,
+ "learning_rate": 1.863973063973064e-05,
+ "loss": 1.594193458557129,
+ "mean_token_accuracy": 0.6293966770172119,
+ "num_tokens": 1671168.0,
+ "step": 102
+ },
+ {
+ "entropy": 1.5245429277420044,
+ "epoch": 0.2080808080808081,
+ "grad_norm": 1.986904501914978,
+ "learning_rate": 1.8626262626262626e-05,
+ "loss": 1.5463616847991943,
+ "mean_token_accuracy": 0.6354421377182007,
+ "num_tokens": 1687552.0,
+ "step": 103
+ },
+ {
+ "entropy": 2.015364408493042,
+ "epoch": 0.2101010101010101,
+ "grad_norm": 2.3297250270843506,
+ "learning_rate": 1.8612794612794615e-05,
+ "loss": 1.987194538116455,
+ "mean_token_accuracy": 0.5604543089866638,
+ "num_tokens": 1703936.0,
+ "step": 104
+ },
+ {
+ "entropy": 1.770432472229004,
+ "epoch": 0.21212121212121213,
+ "grad_norm": 2.3580551147460938,
+ "learning_rate": 1.8599326599326603e-05,
+ "loss": 1.7715529203414917,
+ "mean_token_accuracy": 0.5786516666412354,
+ "num_tokens": 1720320.0,
+ "step": 105
+ },
+ {
+ "entropy": 1.3456813097000122,
+ "epoch": 0.21414141414141413,
+ "grad_norm": 1.9782105684280396,
+ "learning_rate": 1.8585858585858588e-05,
+ "loss": 1.342590570449829,
+ "mean_token_accuracy": 0.6779433488845825,
+ "num_tokens": 1736704.0,
+ "step": 106
+ },
+ {
+ "entropy": 1.4614694118499756,
+ "epoch": 0.21616161616161617,
+ "grad_norm": 1.9486815929412842,
+ "learning_rate": 1.8572390572390572e-05,
+ "loss": 1.4493391513824463,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 1753088.0,
+ "step": 107
+ },
+ {
+ "entropy": 2.007932186126709,
+ "epoch": 0.21818181818181817,
+ "grad_norm": 2.0571465492248535,
+ "learning_rate": 1.855892255892256e-05,
+ "loss": 2.033851385116577,
+ "mean_token_accuracy": 0.5746213793754578,
+ "num_tokens": 1769472.0,
+ "step": 108
+ },
+ {
+ "entropy": 1.506022572517395,
+ "epoch": 0.2202020202020202,
+ "grad_norm": 1.9980531930923462,
+ "learning_rate": 1.8545454545454545e-05,
+ "loss": 1.5305016040802002,
+ "mean_token_accuracy": 0.6416096687316895,
+ "num_tokens": 1785856.0,
+ "step": 109
+ },
+ {
+ "entropy": 1.479506492614746,
+ "epoch": 0.2222222222222222,
+ "grad_norm": 2.411241292953491,
+ "learning_rate": 1.8531986531986533e-05,
+ "loss": 1.5501817464828491,
+ "mean_token_accuracy": 0.6364802122116089,
+ "num_tokens": 1802240.0,
+ "step": 110
+ },
+ {
+ "entropy": 1.7731081247329712,
+ "epoch": 0.22424242424242424,
+ "grad_norm": 2.1088449954986572,
+ "learning_rate": 1.851851851851852e-05,
+ "loss": 1.7582051753997803,
+ "mean_token_accuracy": 0.5985588431358337,
+ "num_tokens": 1818624.0,
+ "step": 111
+ },
+ {
+ "entropy": 1.7963190078735352,
+ "epoch": 0.22626262626262628,
+ "grad_norm": 2.180325508117676,
+ "learning_rate": 1.8505050505050506e-05,
+ "loss": 1.8436882495880127,
+ "mean_token_accuracy": 0.5850635170936584,
+ "num_tokens": 1835008.0,
+ "step": 112
+ },
+ {
+ "entropy": 1.513211727142334,
+ "epoch": 0.22828282828282828,
+ "grad_norm": 2.1563429832458496,
+ "learning_rate": 1.8491582491582495e-05,
+ "loss": 1.547263741493225,
+ "mean_token_accuracy": 0.6399609446525574,
+ "num_tokens": 1851392.0,
+ "step": 113
+ },
+ {
+ "entropy": 1.8904774188995361,
+ "epoch": 0.23030303030303031,
+ "grad_norm": 2.2191243171691895,
+ "learning_rate": 1.847811447811448e-05,
+ "loss": 1.9237418174743652,
+ "mean_token_accuracy": 0.5852466821670532,
+ "num_tokens": 1867776.0,
+ "step": 114
+ },
+ {
+ "entropy": 1.706113338470459,
+ "epoch": 0.23232323232323232,
+ "grad_norm": 2.1411335468292236,
+ "learning_rate": 1.8464646464646464e-05,
+ "loss": 1.7145740985870361,
+ "mean_token_accuracy": 0.6138861775398254,
+ "num_tokens": 1884160.0,
+ "step": 115
+ },
+ {
+ "entropy": 1.726441502571106,
+ "epoch": 0.23434343434343435,
+ "grad_norm": 2.212477922439575,
+ "learning_rate": 1.8451178451178452e-05,
+ "loss": 1.7427434921264648,
+ "mean_token_accuracy": 0.6087567210197449,
+ "num_tokens": 1900544.0,
+ "step": 116
+ },
+ {
+ "entropy": 1.49800443649292,
+ "epoch": 0.23636363636363636,
+ "grad_norm": 2.003248929977417,
+ "learning_rate": 1.8437710437710437e-05,
+ "loss": 1.4677059650421143,
+ "mean_token_accuracy": 0.6617000699043274,
+ "num_tokens": 1916928.0,
+ "step": 117
+ },
+ {
+ "entropy": 1.5079678297042847,
+ "epoch": 0.2383838383838384,
+ "grad_norm": 1.9702556133270264,
+ "learning_rate": 1.8424242424242425e-05,
+ "loss": 1.5194823741912842,
+ "mean_token_accuracy": 0.6593796014785767,
+ "num_tokens": 1933312.0,
+ "step": 118
+ },
+ {
+ "entropy": 1.760438323020935,
+ "epoch": 0.2404040404040404,
+ "grad_norm": 1.9484418630599976,
+ "learning_rate": 1.8410774410774414e-05,
+ "loss": 1.756869912147522,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 1949696.0,
+ "step": 119
+ },
+ {
+ "entropy": 1.3706170320510864,
+ "epoch": 0.24242424242424243,
+ "grad_norm": 2.078357458114624,
+ "learning_rate": 1.83973063973064e-05,
+ "loss": 1.3532414436340332,
+ "mean_token_accuracy": 0.6680508255958557,
+ "num_tokens": 1966080.0,
+ "step": 120
+ },
+ {
+ "entropy": 1.2994399070739746,
+ "epoch": 0.24444444444444444,
+ "grad_norm": 1.9178324937820435,
+ "learning_rate": 1.8383838383838387e-05,
+ "loss": 1.298889398574829,
+ "mean_token_accuracy": 0.6831949353218079,
+ "num_tokens": 1982464.0,
+ "step": 121
+ },
+ {
+ "entropy": 1.6806142330169678,
+ "epoch": 0.24646464646464647,
+ "grad_norm": 2.287158966064453,
+ "learning_rate": 1.837037037037037e-05,
+ "loss": 1.728592038154602,
+ "mean_token_accuracy": 0.6161455512046814,
+ "num_tokens": 1998848.0,
+ "step": 122
+ },
+ {
+ "entropy": 1.2894387245178223,
+ "epoch": 0.24848484848484848,
+ "grad_norm": 1.9998525381088257,
+ "learning_rate": 1.8356902356902356e-05,
+ "loss": 1.3326170444488525,
+ "mean_token_accuracy": 0.6693331599235535,
+ "num_tokens": 2015232.0,
+ "step": 123
+ },
+ {
+ "entropy": 1.5466209650039673,
+ "epoch": 0.2505050505050505,
+ "grad_norm": 1.8439521789550781,
+ "learning_rate": 1.8343434343434344e-05,
+ "loss": 1.5606887340545654,
+ "mean_token_accuracy": 0.6571201682090759,
+ "num_tokens": 2031616.0,
+ "step": 124
+ },
+ {
+ "entropy": 1.2692567110061646,
+ "epoch": 0.25252525252525254,
+ "grad_norm": 1.9568793773651123,
+ "learning_rate": 1.8329966329966332e-05,
+ "loss": 1.308868408203125,
+ "mean_token_accuracy": 0.6954689621925354,
+ "num_tokens": 2048000.0,
+ "step": 125
+ },
+ {
+ "entropy": 1.5780351161956787,
+ "epoch": 0.2545454545454545,
+ "grad_norm": 2.151250123977661,
+ "learning_rate": 1.831649831649832e-05,
+ "loss": 1.60304856300354,
+ "mean_token_accuracy": 0.6258549094200134,
+ "num_tokens": 2064384.0,
+ "step": 126
+ },
+ {
+ "entropy": 1.487567663192749,
+ "epoch": 0.25656565656565655,
+ "grad_norm": 1.9134294986724854,
+ "learning_rate": 1.8303030303030305e-05,
+ "loss": 1.514064073562622,
+ "mean_token_accuracy": 0.6348925232887268,
+ "num_tokens": 2080768.0,
+ "step": 127
+ },
+ {
+ "entropy": 1.6072919368743896,
+ "epoch": 0.2585858585858586,
+ "grad_norm": 2.119290351867676,
+ "learning_rate": 1.828956228956229e-05,
+ "loss": 1.6062684059143066,
+ "mean_token_accuracy": 0.6332437992095947,
+ "num_tokens": 2097152.0,
+ "step": 128
+ },
+ {
+ "entropy": 1.1168174743652344,
+ "epoch": 0.2606060606060606,
+ "grad_norm": 1.8520931005477905,
+ "learning_rate": 1.827609427609428e-05,
+ "loss": 1.1421526670455933,
+ "mean_token_accuracy": 0.7078651785850525,
+ "num_tokens": 2113536.0,
+ "step": 129
+ },
+ {
+ "entropy": 1.349792718887329,
+ "epoch": 0.26262626262626265,
+ "grad_norm": 1.8463630676269531,
+ "learning_rate": 1.8262626262626263e-05,
+ "loss": 1.3712577819824219,
+ "mean_token_accuracy": 0.6736077070236206,
+ "num_tokens": 2129920.0,
+ "step": 130
+ },
+ {
+ "entropy": 1.8531655073165894,
+ "epoch": 0.26464646464646463,
+ "grad_norm": 2.0503969192504883,
+ "learning_rate": 1.824915824915825e-05,
+ "loss": 1.8971941471099854,
+ "mean_token_accuracy": 0.5845749974250793,
+ "num_tokens": 2146304.0,
+ "step": 131
+ },
+ {
+ "entropy": 1.436646819114685,
+ "epoch": 0.26666666666666666,
+ "grad_norm": 1.8517117500305176,
+ "learning_rate": 1.8235690235690236e-05,
+ "loss": 1.4255880117416382,
+ "mean_token_accuracy": 0.6653639674186707,
+ "num_tokens": 2162688.0,
+ "step": 132
+ },
+ {
+ "entropy": 1.9219673871994019,
+ "epoch": 0.2686868686868687,
+ "grad_norm": 2.1424307823181152,
+ "learning_rate": 1.8222222222222224e-05,
+ "loss": 1.9088413715362549,
+ "mean_token_accuracy": 0.5868954658508301,
+ "num_tokens": 2179072.0,
+ "step": 133
+ },
+ {
+ "entropy": 1.4034194946289062,
+ "epoch": 0.27070707070707073,
+ "grad_norm": 1.9987515211105347,
+ "learning_rate": 1.8208754208754212e-05,
+ "loss": 1.3612333536148071,
+ "mean_token_accuracy": 0.6721421480178833,
+ "num_tokens": 2195456.0,
+ "step": 134
+ },
+ {
+ "entropy": 2.064425230026245,
+ "epoch": 0.2727272727272727,
+ "grad_norm": 2.0800976753234863,
+ "learning_rate": 1.8195286195286197e-05,
+ "loss": 2.0595853328704834,
+ "mean_token_accuracy": 0.5694919228553772,
+ "num_tokens": 2211840.0,
+ "step": 135
+ },
+ {
+ "entropy": 1.2883177995681763,
+ "epoch": 0.27474747474747474,
+ "grad_norm": 1.9042892456054688,
+ "learning_rate": 1.8181818181818182e-05,
+ "loss": 1.3220078945159912,
+ "mean_token_accuracy": 0.6805080771446228,
+ "num_tokens": 2228224.0,
+ "step": 136
+ },
+ {
+ "entropy": 1.101396918296814,
+ "epoch": 0.2767676767676768,
+ "grad_norm": 1.857073187828064,
+ "learning_rate": 1.816835016835017e-05,
+ "loss": 1.1156296730041504,
+ "mean_token_accuracy": 0.7214826345443726,
+ "num_tokens": 2244608.0,
+ "step": 137
+ },
+ {
+ "entropy": 1.376597285270691,
+ "epoch": 0.2787878787878788,
+ "grad_norm": 1.9103689193725586,
+ "learning_rate": 1.8154882154882155e-05,
+ "loss": 1.3915824890136719,
+ "mean_token_accuracy": 0.6824010610580444,
+ "num_tokens": 2260992.0,
+ "step": 138
+ },
+ {
+ "entropy": 1.4654942750930786,
+ "epoch": 0.2808080808080808,
+ "grad_norm": 1.9513856172561646,
+ "learning_rate": 1.8141414141414143e-05,
+ "loss": 1.5000076293945312,
+ "mean_token_accuracy": 0.6457620859146118,
+ "num_tokens": 2277376.0,
+ "step": 139
+ },
+ {
+ "entropy": 1.1999047994613647,
+ "epoch": 0.2828282828282828,
+ "grad_norm": 1.824987530708313,
+ "learning_rate": 1.812794612794613e-05,
+ "loss": 1.2217535972595215,
+ "mean_token_accuracy": 0.7034685015678406,
+ "num_tokens": 2293760.0,
+ "step": 140
+ },
+ {
+ "entropy": 1.2822942733764648,
+ "epoch": 0.28484848484848485,
+ "grad_norm": 2.0979108810424805,
+ "learning_rate": 1.8114478114478116e-05,
+ "loss": 1.309725046157837,
+ "mean_token_accuracy": 0.6855764389038086,
+ "num_tokens": 2310144.0,
+ "step": 141
+ },
+ {
+ "entropy": 1.5589981079101562,
+ "epoch": 0.2868686868686869,
+ "grad_norm": 2.030648708343506,
+ "learning_rate": 1.8101010101010104e-05,
+ "loss": 1.5918951034545898,
+ "mean_token_accuracy": 0.6286638975143433,
+ "num_tokens": 2326528.0,
+ "step": 142
+ },
+ {
+ "entropy": 1.5600453615188599,
+ "epoch": 0.28888888888888886,
+ "grad_norm": 2.023409605026245,
+ "learning_rate": 1.808754208754209e-05,
+ "loss": 1.5725011825561523,
+ "mean_token_accuracy": 0.6384342908859253,
+ "num_tokens": 2342912.0,
+ "step": 143
+ },
+ {
+ "entropy": 1.5066077709197998,
+ "epoch": 0.2909090909090909,
+ "grad_norm": 1.9963997602462769,
+ "learning_rate": 1.8074074074074074e-05,
+ "loss": 1.5066845417022705,
+ "mean_token_accuracy": 0.6474108695983887,
+ "num_tokens": 2359296.0,
+ "step": 144
+ },
+ {
+ "entropy": 1.8313122987747192,
+ "epoch": 0.29292929292929293,
+ "grad_norm": 2.0791213512420654,
+ "learning_rate": 1.8060606060606062e-05,
+ "loss": 1.8148126602172852,
+ "mean_token_accuracy": 0.5820102691650391,
+ "num_tokens": 2375680.0,
+ "step": 145
+ },
+ {
+ "entropy": 1.8828215599060059,
+ "epoch": 0.29494949494949496,
+ "grad_norm": 2.1346335411071777,
+ "learning_rate": 1.804713804713805e-05,
+ "loss": 1.905554175376892,
+ "mean_token_accuracy": 0.6041768193244934,
+ "num_tokens": 2392064.0,
+ "step": 146
+ },
+ {
+ "entropy": 1.1984127759933472,
+ "epoch": 0.296969696969697,
+ "grad_norm": 1.6585179567337036,
+ "learning_rate": 1.8033670033670035e-05,
+ "loss": 1.2255632877349854,
+ "mean_token_accuracy": 0.712506115436554,
+ "num_tokens": 2408448.0,
+ "step": 147
+ },
+ {
+ "entropy": 1.4248595237731934,
+ "epoch": 0.298989898989899,
+ "grad_norm": 2.468965530395508,
+ "learning_rate": 1.8020202020202023e-05,
+ "loss": 1.4362621307373047,
+ "mean_token_accuracy": 0.6464948654174805,
+ "num_tokens": 2424832.0,
+ "step": 148
+ },
+ {
+ "entropy": 1.7295368909835815,
+ "epoch": 0.301010101010101,
+ "grad_norm": 1.819359302520752,
+ "learning_rate": 1.8006734006734008e-05,
+ "loss": 1.7290053367614746,
+ "mean_token_accuracy": 0.6312897205352783,
+ "num_tokens": 2441216.0,
+ "step": 149
+ },
+ {
+ "entropy": 1.7334001064300537,
+ "epoch": 0.30303030303030304,
+ "grad_norm": 2.149543285369873,
+ "learning_rate": 1.7993265993265993e-05,
+ "loss": 1.7014907598495483,
+ "mean_token_accuracy": 0.5981314182281494,
+ "num_tokens": 2457600.0,
+ "step": 150
+ },
+ {
+ "entropy": 2.0550050735473633,
+ "epoch": 0.30505050505050507,
+ "grad_norm": 1.9880189895629883,
+ "learning_rate": 1.797979797979798e-05,
+ "loss": 2.001784324645996,
+ "mean_token_accuracy": 0.5552638173103333,
+ "num_tokens": 2473984.0,
+ "step": 151
+ },
+ {
+ "entropy": 1.5352036952972412,
+ "epoch": 0.30707070707070705,
+ "grad_norm": 2.031998634338379,
+ "learning_rate": 1.7966329966329966e-05,
+ "loss": 1.5262815952301025,
+ "mean_token_accuracy": 0.6328163146972656,
+ "num_tokens": 2490368.0,
+ "step": 152
+ },
+ {
+ "entropy": 1.4278677701950073,
+ "epoch": 0.3090909090909091,
+ "grad_norm": 2.101398229598999,
+ "learning_rate": 1.7952861952861954e-05,
+ "loss": 1.4288041591644287,
+ "mean_token_accuracy": 0.6647533178329468,
+ "num_tokens": 2506752.0,
+ "step": 153
+ },
+ {
+ "entropy": 1.7469983100891113,
+ "epoch": 0.3111111111111111,
+ "grad_norm": 2.0824313163757324,
+ "learning_rate": 1.7939393939393942e-05,
+ "loss": 1.770402193069458,
+ "mean_token_accuracy": 0.5997191071510315,
+ "num_tokens": 2523136.0,
+ "step": 154
+ },
+ {
+ "entropy": 1.6565595865249634,
+ "epoch": 0.31313131313131315,
+ "grad_norm": 2.0815961360931396,
+ "learning_rate": 1.7925925925925927e-05,
+ "loss": 1.7024259567260742,
+ "mean_token_accuracy": 0.6109550595283508,
+ "num_tokens": 2539520.0,
+ "step": 155
+ },
+ {
+ "entropy": 1.4104127883911133,
+ "epoch": 0.3151515151515151,
+ "grad_norm": 2.129694700241089,
+ "learning_rate": 1.7912457912457915e-05,
+ "loss": 1.4378812313079834,
+ "mean_token_accuracy": 0.6489985585212708,
+ "num_tokens": 2555904.0,
+ "step": 156
+ },
+ {
+ "entropy": 1.5129127502441406,
+ "epoch": 0.31717171717171716,
+ "grad_norm": 2.180267095565796,
+ "learning_rate": 1.78989898989899e-05,
+ "loss": 1.5564348697662354,
+ "mean_token_accuracy": 0.6327552795410156,
+ "num_tokens": 2572288.0,
+ "step": 157
+ },
+ {
+ "entropy": 1.5240321159362793,
+ "epoch": 0.3191919191919192,
+ "grad_norm": 1.968405842781067,
+ "learning_rate": 1.7885521885521885e-05,
+ "loss": 1.585756778717041,
+ "mean_token_accuracy": 0.629885196685791,
+ "num_tokens": 2588672.0,
+ "step": 158
+ },
+ {
+ "entropy": 1.3169562816619873,
+ "epoch": 0.3212121212121212,
+ "grad_norm": 2.0452873706817627,
+ "learning_rate": 1.7872053872053873e-05,
+ "loss": 1.3569687604904175,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 2605056.0,
+ "step": 159
+ },
+ {
+ "entropy": 1.3630796670913696,
+ "epoch": 0.32323232323232326,
+ "grad_norm": 1.9721522331237793,
+ "learning_rate": 1.785858585858586e-05,
+ "loss": 1.3965554237365723,
+ "mean_token_accuracy": 0.6626160144805908,
+ "num_tokens": 2621440.0,
+ "step": 160
+ },
+ {
+ "entropy": 1.178250789642334,
+ "epoch": 0.32525252525252524,
+ "grad_norm": 2.0231528282165527,
+ "learning_rate": 1.7845117845117846e-05,
+ "loss": 1.2126985788345337,
+ "mean_token_accuracy": 0.6977894306182861,
+ "num_tokens": 2637824.0,
+ "step": 161
+ },
+ {
+ "entropy": 1.8399475812911987,
+ "epoch": 0.32727272727272727,
+ "grad_norm": 2.0615484714508057,
+ "learning_rate": 1.7831649831649834e-05,
+ "loss": 1.868000864982605,
+ "mean_token_accuracy": 0.5822545289993286,
+ "num_tokens": 2654208.0,
+ "step": 162
+ },
+ {
+ "entropy": 1.6604139804840088,
+ "epoch": 0.3292929292929293,
+ "grad_norm": 1.9838379621505737,
+ "learning_rate": 1.781818181818182e-05,
+ "loss": 1.6677067279815674,
+ "mean_token_accuracy": 0.621275007724762,
+ "num_tokens": 2670592.0,
+ "step": 163
+ },
+ {
+ "entropy": 1.3761085271835327,
+ "epoch": 0.33131313131313134,
+ "grad_norm": 2.0093271732330322,
+ "learning_rate": 1.7804713804713807e-05,
+ "loss": 1.3829190731048584,
+ "mean_token_accuracy": 0.6655471324920654,
+ "num_tokens": 2686976.0,
+ "step": 164
+ },
+ {
+ "entropy": 1.578093409538269,
+ "epoch": 0.3333333333333333,
+ "grad_norm": 1.9710773229599,
+ "learning_rate": 1.7791245791245792e-05,
+ "loss": 1.560583472251892,
+ "mean_token_accuracy": 0.6344650983810425,
+ "num_tokens": 2703360.0,
+ "step": 165
+ },
+ {
+ "entropy": 1.0447157621383667,
+ "epoch": 0.33535353535353535,
+ "grad_norm": 1.68338942527771,
+ "learning_rate": 1.7777777777777777e-05,
+ "loss": 1.0116058588027954,
+ "mean_token_accuracy": 0.7449315786361694,
+ "num_tokens": 2719744.0,
+ "step": 166
+ },
+ {
+ "entropy": 1.3687469959259033,
+ "epoch": 0.3373737373737374,
+ "grad_norm": 2.062744617462158,
+ "learning_rate": 1.7764309764309765e-05,
+ "loss": 1.3179712295532227,
+ "mean_token_accuracy": 0.6761724352836609,
+ "num_tokens": 2736128.0,
+ "step": 167
+ },
+ {
+ "entropy": 1.8639556169509888,
+ "epoch": 0.3393939393939394,
+ "grad_norm": 2.041898250579834,
+ "learning_rate": 1.7750841750841753e-05,
+ "loss": 1.8531380891799927,
+ "mean_token_accuracy": 0.5920859575271606,
+ "num_tokens": 2752512.0,
+ "step": 168
+ },
+ {
+ "entropy": 1.6900824308395386,
+ "epoch": 0.3414141414141414,
+ "grad_norm": 1.9403504133224487,
+ "learning_rate": 1.773737373737374e-05,
+ "loss": 1.701782464981079,
+ "mean_token_accuracy": 0.6102222800254822,
+ "num_tokens": 2768896.0,
+ "step": 169
+ },
+ {
+ "entropy": 1.6202301979064941,
+ "epoch": 0.3434343434343434,
+ "grad_norm": 2.027329683303833,
+ "learning_rate": 1.7723905723905726e-05,
+ "loss": 1.6471121311187744,
+ "mean_token_accuracy": 0.6310454607009888,
+ "num_tokens": 2785280.0,
+ "step": 170
+ },
+ {
+ "entropy": 1.2701244354248047,
+ "epoch": 0.34545454545454546,
+ "grad_norm": 1.8625534772872925,
+ "learning_rate": 1.771043771043771e-05,
+ "loss": 1.291702151298523,
+ "mean_token_accuracy": 0.67659991979599,
+ "num_tokens": 2801664.0,
+ "step": 171
+ },
+ {
+ "entropy": 1.5759357213974,
+ "epoch": 0.3474747474747475,
+ "grad_norm": 1.945141077041626,
+ "learning_rate": 1.76969696969697e-05,
+ "loss": 1.6189839839935303,
+ "mean_token_accuracy": 0.6225574016571045,
+ "num_tokens": 2818048.0,
+ "step": 172
+ },
+ {
+ "entropy": 1.3319392204284668,
+ "epoch": 0.34949494949494947,
+ "grad_norm": 1.8485770225524902,
+ "learning_rate": 1.7683501683501684e-05,
+ "loss": 1.3553425073623657,
+ "mean_token_accuracy": 0.6759281754493713,
+ "num_tokens": 2834432.0,
+ "step": 173
+ },
+ {
+ "entropy": 1.3251745700836182,
+ "epoch": 0.3515151515151515,
+ "grad_norm": 2.0564401149749756,
+ "learning_rate": 1.7670033670033672e-05,
+ "loss": 1.359522819519043,
+ "mean_token_accuracy": 0.6678065657615662,
+ "num_tokens": 2850816.0,
+ "step": 174
+ },
+ {
+ "entropy": 1.2764136791229248,
+ "epoch": 0.35353535353535354,
+ "grad_norm": 2.1749041080474854,
+ "learning_rate": 1.765656565656566e-05,
+ "loss": 1.3260173797607422,
+ "mean_token_accuracy": 0.6710429787635803,
+ "num_tokens": 2867200.0,
+ "step": 175
+ },
+ {
+ "entropy": 1.6382335424423218,
+ "epoch": 0.35555555555555557,
+ "grad_norm": 1.923366904258728,
+ "learning_rate": 1.7643097643097645e-05,
+ "loss": 1.6868517398834229,
+ "mean_token_accuracy": 0.6268930435180664,
+ "num_tokens": 2883584.0,
+ "step": 176
+ },
+ {
+ "entropy": 1.2399169206619263,
+ "epoch": 0.3575757575757576,
+ "grad_norm": 1.795649766921997,
+ "learning_rate": 1.7629629629629633e-05,
+ "loss": 1.2266355752944946,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 2899968.0,
+ "step": 177
+ },
+ {
+ "entropy": 1.5761929750442505,
+ "epoch": 0.3595959595959596,
+ "grad_norm": 2.0536038875579834,
+ "learning_rate": 1.7616161616161618e-05,
+ "loss": 1.5698940753936768,
+ "mean_token_accuracy": 0.6263434290885925,
+ "num_tokens": 2916352.0,
+ "step": 178
+ },
+ {
+ "entropy": 1.3612396717071533,
+ "epoch": 0.3616161616161616,
+ "grad_norm": 2.003840684890747,
+ "learning_rate": 1.7602693602693603e-05,
+ "loss": 1.359879732131958,
+ "mean_token_accuracy": 0.6798974275588989,
+ "num_tokens": 2932736.0,
+ "step": 179
+ },
+ {
+ "entropy": 1.0548239946365356,
+ "epoch": 0.36363636363636365,
+ "grad_norm": 1.6967436075210571,
+ "learning_rate": 1.758922558922559e-05,
+ "loss": 1.040539264678955,
+ "mean_token_accuracy": 0.7433438897132874,
+ "num_tokens": 2949120.0,
+ "step": 180
+ },
+ {
+ "entropy": 1.16105055809021,
+ "epoch": 0.3656565656565657,
+ "grad_norm": 1.9793111085891724,
+ "learning_rate": 1.7575757575757576e-05,
+ "loss": 1.1532450914382935,
+ "mean_token_accuracy": 0.7135441899299622,
+ "num_tokens": 2965504.0,
+ "step": 181
+ },
+ {
+ "entropy": 1.4421862363815308,
+ "epoch": 0.36767676767676766,
+ "grad_norm": 1.8337509632110596,
+ "learning_rate": 1.7562289562289564e-05,
+ "loss": 1.419133186340332,
+ "mean_token_accuracy": 0.659807026386261,
+ "num_tokens": 2981888.0,
+ "step": 182
+ },
+ {
+ "entropy": 1.6186654567718506,
+ "epoch": 0.3696969696969697,
+ "grad_norm": 2.0585362911224365,
+ "learning_rate": 1.7548821548821552e-05,
+ "loss": 1.5880110263824463,
+ "mean_token_accuracy": 0.6322056651115417,
+ "num_tokens": 2998272.0,
+ "step": 183
+ },
+ {
+ "entropy": 1.76968252658844,
+ "epoch": 0.3717171717171717,
+ "grad_norm": 2.139742374420166,
+ "learning_rate": 1.7535353535353537e-05,
+ "loss": 1.797312617301941,
+ "mean_token_accuracy": 0.6096116304397583,
+ "num_tokens": 3014656.0,
+ "step": 184
+ },
+ {
+ "entropy": 1.0575193166732788,
+ "epoch": 0.37373737373737376,
+ "grad_norm": 1.8547794818878174,
+ "learning_rate": 1.7521885521885525e-05,
+ "loss": 1.0575863122940063,
+ "mean_token_accuracy": 0.7325354218482971,
+ "num_tokens": 3031040.0,
+ "step": 185
+ },
+ {
+ "entropy": 1.2937911748886108,
+ "epoch": 0.37575757575757573,
+ "grad_norm": 2.3985140323638916,
+ "learning_rate": 1.750841750841751e-05,
+ "loss": 1.3277016878128052,
+ "mean_token_accuracy": 0.6654860973358154,
+ "num_tokens": 3047424.0,
+ "step": 186
+ },
+ {
+ "entropy": 1.1829862594604492,
+ "epoch": 0.37777777777777777,
+ "grad_norm": 1.948241114616394,
+ "learning_rate": 1.7494949494949494e-05,
+ "loss": 1.2146751880645752,
+ "mean_token_accuracy": 0.6964460015296936,
+ "num_tokens": 3063808.0,
+ "step": 187
+ },
+ {
+ "entropy": 1.4858520030975342,
+ "epoch": 0.3797979797979798,
+ "grad_norm": 2.2712836265563965,
+ "learning_rate": 1.7481481481481483e-05,
+ "loss": 1.5523631572723389,
+ "mean_token_accuracy": 0.6392281651496887,
+ "num_tokens": 3080192.0,
+ "step": 188
+ },
+ {
+ "entropy": 1.7905362844467163,
+ "epoch": 0.38181818181818183,
+ "grad_norm": 1.890699863433838,
+ "learning_rate": 1.746801346801347e-05,
+ "loss": 1.8139519691467285,
+ "mean_token_accuracy": 0.6015510559082031,
+ "num_tokens": 3096576.0,
+ "step": 189
+ },
+ {
+ "entropy": 1.3264763355255127,
+ "epoch": 0.3838383838383838,
+ "grad_norm": 2.1567318439483643,
+ "learning_rate": 1.7454545454545456e-05,
+ "loss": 1.3780615329742432,
+ "mean_token_accuracy": 0.6636541485786438,
+ "num_tokens": 3112960.0,
+ "step": 190
+ },
+ {
+ "entropy": 1.9898782968521118,
+ "epoch": 0.38585858585858585,
+ "grad_norm": 2.008547306060791,
+ "learning_rate": 1.7441077441077444e-05,
+ "loss": 2.0208630561828613,
+ "mean_token_accuracy": 0.5498290061950684,
+ "num_tokens": 3129344.0,
+ "step": 191
+ },
+ {
+ "entropy": 1.2579785585403442,
+ "epoch": 0.3878787878787879,
+ "grad_norm": 1.921314001083374,
+ "learning_rate": 1.742760942760943e-05,
+ "loss": 1.271723985671997,
+ "mean_token_accuracy": 0.6882632970809937,
+ "num_tokens": 3145728.0,
+ "step": 192
+ },
+ {
+ "entropy": 1.3366814851760864,
+ "epoch": 0.3898989898989899,
+ "grad_norm": 1.9525961875915527,
+ "learning_rate": 1.7414141414141413e-05,
+ "loss": 1.3561700582504272,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 3162112.0,
+ "step": 193
+ },
+ {
+ "entropy": 1.5505253076553345,
+ "epoch": 0.39191919191919194,
+ "grad_norm": 2.044635057449341,
+ "learning_rate": 1.74006734006734e-05,
+ "loss": 1.5198928117752075,
+ "mean_token_accuracy": 0.6326331496238708,
+ "num_tokens": 3178496.0,
+ "step": 194
+ },
+ {
+ "entropy": 1.4198534488677979,
+ "epoch": 0.3939393939393939,
+ "grad_norm": 1.9955503940582275,
+ "learning_rate": 1.738720538720539e-05,
+ "loss": 1.4072260856628418,
+ "mean_token_accuracy": 0.6631045341491699,
+ "num_tokens": 3194880.0,
+ "step": 195
+ },
+ {
+ "entropy": 2.0099895000457764,
+ "epoch": 0.39595959595959596,
+ "grad_norm": 2.110247850418091,
+ "learning_rate": 1.7373737373737375e-05,
+ "loss": 2.0012335777282715,
+ "mean_token_accuracy": 0.5668661594390869,
+ "num_tokens": 3211264.0,
+ "step": 196
+ },
+ {
+ "entropy": 2.1619439125061035,
+ "epoch": 0.397979797979798,
+ "grad_norm": 2.0869383811950684,
+ "learning_rate": 1.7360269360269363e-05,
+ "loss": 2.1793670654296875,
+ "mean_token_accuracy": 0.5569125413894653,
+ "num_tokens": 3227648.0,
+ "step": 197
+ },
+ {
+ "entropy": 1.6383775472640991,
+ "epoch": 0.4,
+ "grad_norm": 1.7467572689056396,
+ "learning_rate": 1.7346801346801347e-05,
+ "loss": 1.656137228012085,
+ "mean_token_accuracy": 0.6395334601402283,
+ "num_tokens": 3244032.0,
+ "step": 198
+ },
+ {
+ "entropy": 1.5911450386047363,
+ "epoch": 0.402020202020202,
+ "grad_norm": 1.9362678527832031,
+ "learning_rate": 1.7333333333333336e-05,
+ "loss": 1.5865838527679443,
+ "mean_token_accuracy": 0.621275007724762,
+ "num_tokens": 3260416.0,
+ "step": 199
+ },
+ {
+ "entropy": 1.3983819484710693,
+ "epoch": 0.40404040404040403,
+ "grad_norm": 1.925863265991211,
+ "learning_rate": 1.731986531986532e-05,
+ "loss": 1.3835841417312622,
+ "mean_token_accuracy": 0.6618221998214722,
+ "num_tokens": 3276800.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.40404040404040403,
+ "eval_entropy": 1.5366105552642577,
+ "eval_loss": 1.5502140522003174,
+ "eval_mean_token_accuracy": 0.6411546406246,
+ "eval_num_tokens": 3276800.0,
+ "eval_runtime": 43.8218,
+ "eval_samples_per_second": 22.592,
+ "eval_steps_per_second": 2.83,
+ "step": 200
+ },
+ {
+ "entropy": 1.291393756866455,
+ "epoch": 0.40606060606060607,
+ "grad_norm": 1.9057531356811523,
+ "learning_rate": 1.7306397306397305e-05,
+ "loss": 1.2847933769226074,
+ "mean_token_accuracy": 0.6901563405990601,
+ "num_tokens": 3293184.0,
+ "step": 201
+ },
+ {
+ "entropy": 1.1511558294296265,
+ "epoch": 0.4080808080808081,
+ "grad_norm": 1.849436640739441,
+ "learning_rate": 1.7292929292929293e-05,
+ "loss": 1.1661030054092407,
+ "mean_token_accuracy": 0.7095139026641846,
+ "num_tokens": 3309568.0,
+ "step": 202
+ },
+ {
+ "entropy": 1.5591504573822021,
+ "epoch": 0.4101010101010101,
+ "grad_norm": 1.9354233741760254,
+ "learning_rate": 1.727946127946128e-05,
+ "loss": 1.6045410633087158,
+ "mean_token_accuracy": 0.6226795315742493,
+ "num_tokens": 3325952.0,
+ "step": 203
+ },
+ {
+ "entropy": 1.7634649276733398,
+ "epoch": 0.4121212121212121,
+ "grad_norm": 2.414632797241211,
+ "learning_rate": 1.726599326599327e-05,
+ "loss": 1.8021953105926514,
+ "mean_token_accuracy": 0.6099780201911926,
+ "num_tokens": 3342336.0,
+ "step": 204
+ },
+ {
+ "entropy": 1.6080671548843384,
+ "epoch": 0.41414141414141414,
+ "grad_norm": 1.9936028718948364,
+ "learning_rate": 1.7252525252525255e-05,
+ "loss": 1.630000352859497,
+ "mean_token_accuracy": 0.6256106495857239,
+ "num_tokens": 3358720.0,
+ "step": 205
+ },
+ {
+ "entropy": 1.6845343112945557,
+ "epoch": 0.4161616161616162,
+ "grad_norm": 1.9131947755813599,
+ "learning_rate": 1.723905723905724e-05,
+ "loss": 1.6912329196929932,
+ "mean_token_accuracy": 0.6263434290885925,
+ "num_tokens": 3375104.0,
+ "step": 206
+ },
+ {
+ "entropy": 1.5946446657180786,
+ "epoch": 0.41818181818181815,
+ "grad_norm": 2.0423905849456787,
+ "learning_rate": 1.7225589225589228e-05,
+ "loss": 1.647271752357483,
+ "mean_token_accuracy": 0.6296409368515015,
+ "num_tokens": 3391488.0,
+ "step": 207
+ },
+ {
+ "entropy": 1.3124741315841675,
+ "epoch": 0.4202020202020202,
+ "grad_norm": 1.8896982669830322,
+ "learning_rate": 1.7212121212121212e-05,
+ "loss": 1.3216124773025513,
+ "mean_token_accuracy": 0.687469482421875,
+ "num_tokens": 3407872.0,
+ "step": 208
+ },
+ {
+ "entropy": 1.3931281566619873,
+ "epoch": 0.4222222222222222,
+ "grad_norm": 1.7883074283599854,
+ "learning_rate": 1.71986531986532e-05,
+ "loss": 1.4264600276947021,
+ "mean_token_accuracy": 0.6568148732185364,
+ "num_tokens": 3424256.0,
+ "step": 209
+ },
+ {
+ "entropy": 1.1427687406539917,
+ "epoch": 0.42424242424242425,
+ "grad_norm": 1.9367003440856934,
+ "learning_rate": 1.7185185185185185e-05,
+ "loss": 1.1611723899841309,
+ "mean_token_accuracy": 0.7058500051498413,
+ "num_tokens": 3440640.0,
+ "step": 210
+ },
+ {
+ "entropy": 1.7226167917251587,
+ "epoch": 0.4262626262626263,
+ "grad_norm": 2.175487518310547,
+ "learning_rate": 1.7171717171717173e-05,
+ "loss": 1.7383192777633667,
+ "mean_token_accuracy": 0.6075964570045471,
+ "num_tokens": 3457024.0,
+ "step": 211
+ },
+ {
+ "entropy": 1.3780062198638916,
+ "epoch": 0.42828282828282827,
+ "grad_norm": 1.9817614555358887,
+ "learning_rate": 1.715824915824916e-05,
+ "loss": 1.3755927085876465,
+ "mean_token_accuracy": 0.6750732660293579,
+ "num_tokens": 3473408.0,
+ "step": 212
+ },
+ {
+ "entropy": 1.637842059135437,
+ "epoch": 0.4303030303030303,
+ "grad_norm": 2.2326242923736572,
+ "learning_rate": 1.7144781144781146e-05,
+ "loss": 1.635596752166748,
+ "mean_token_accuracy": 0.6110771894454956,
+ "num_tokens": 3489792.0,
+ "step": 213
+ },
+ {
+ "entropy": 1.9970118999481201,
+ "epoch": 0.43232323232323233,
+ "grad_norm": 2.1303606033325195,
+ "learning_rate": 1.713131313131313e-05,
+ "loss": 2.0099592208862305,
+ "mean_token_accuracy": 0.5781631469726562,
+ "num_tokens": 3506176.0,
+ "step": 214
+ },
+ {
+ "entropy": 1.4759869575500488,
+ "epoch": 0.43434343434343436,
+ "grad_norm": 2.043727397918701,
+ "learning_rate": 1.711784511784512e-05,
+ "loss": 1.4756600856781006,
+ "mean_token_accuracy": 0.6483879089355469,
+ "num_tokens": 3522560.0,
+ "step": 215
+ },
+ {
+ "entropy": 1.2833726406097412,
+ "epoch": 0.43636363636363634,
+ "grad_norm": 1.9260340929031372,
+ "learning_rate": 1.7104377104377104e-05,
+ "loss": 1.2887630462646484,
+ "mean_token_accuracy": 0.6900342106819153,
+ "num_tokens": 3538944.0,
+ "step": 216
+ },
+ {
+ "entropy": 1.3936302661895752,
+ "epoch": 0.4383838383838384,
+ "grad_norm": 1.8590774536132812,
+ "learning_rate": 1.7090909090909092e-05,
+ "loss": 1.3784823417663574,
+ "mean_token_accuracy": 0.6736077070236206,
+ "num_tokens": 3555328.0,
+ "step": 217
+ },
+ {
+ "entropy": 1.2413936853408813,
+ "epoch": 0.4404040404040404,
+ "grad_norm": 2.1111643314361572,
+ "learning_rate": 1.707744107744108e-05,
+ "loss": 1.2740635871887207,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 3571712.0,
+ "step": 218
+ },
+ {
+ "entropy": 1.4879416227340698,
+ "epoch": 0.44242424242424244,
+ "grad_norm": 2.127614736557007,
+ "learning_rate": 1.7063973063973065e-05,
+ "loss": 1.48406183719635,
+ "mean_token_accuracy": 0.649975597858429,
+ "num_tokens": 3588096.0,
+ "step": 219
+ },
+ {
+ "entropy": 1.4226471185684204,
+ "epoch": 0.4444444444444444,
+ "grad_norm": 2.164325475692749,
+ "learning_rate": 1.7050505050505054e-05,
+ "loss": 1.466269850730896,
+ "mean_token_accuracy": 0.6502808928489685,
+ "num_tokens": 3604480.0,
+ "step": 220
+ },
+ {
+ "entropy": 1.6183370351791382,
+ "epoch": 0.44646464646464645,
+ "grad_norm": 2.018846273422241,
+ "learning_rate": 1.7037037037037038e-05,
+ "loss": 1.6348307132720947,
+ "mean_token_accuracy": 0.627198338508606,
+ "num_tokens": 3620864.0,
+ "step": 221
+ },
+ {
+ "entropy": 1.6979204416275024,
+ "epoch": 0.4484848484848485,
+ "grad_norm": 2.1574854850769043,
+ "learning_rate": 1.7023569023569023e-05,
+ "loss": 1.7019602060317993,
+ "mean_token_accuracy": 0.6157181262969971,
+ "num_tokens": 3637248.0,
+ "step": 222
+ },
+ {
+ "entropy": 1.753490686416626,
+ "epoch": 0.4505050505050505,
+ "grad_norm": 2.0253705978393555,
+ "learning_rate": 1.701010101010101e-05,
+ "loss": 1.7466539144515991,
+ "mean_token_accuracy": 0.6008793115615845,
+ "num_tokens": 3653632.0,
+ "step": 223
+ },
+ {
+ "entropy": 1.717929720878601,
+ "epoch": 0.45252525252525255,
+ "grad_norm": 1.9840974807739258,
+ "learning_rate": 1.6996632996633e-05,
+ "loss": 1.703988790512085,
+ "mean_token_accuracy": 0.6099780201911926,
+ "num_tokens": 3670016.0,
+ "step": 224
+ },
+ {
+ "entropy": 1.377287745475769,
+ "epoch": 0.45454545454545453,
+ "grad_norm": 2.1027839183807373,
+ "learning_rate": 1.6983164983164984e-05,
+ "loss": 1.3902864456176758,
+ "mean_token_accuracy": 0.660906195640564,
+ "num_tokens": 3686400.0,
+ "step": 225
+ },
+ {
+ "entropy": 1.237000584602356,
+ "epoch": 0.45656565656565656,
+ "grad_norm": 1.9116249084472656,
+ "learning_rate": 1.6969696969696972e-05,
+ "loss": 1.221006155014038,
+ "mean_token_accuracy": 0.7045676708221436,
+ "num_tokens": 3702784.0,
+ "step": 226
+ },
+ {
+ "entropy": 1.4198882579803467,
+ "epoch": 0.4585858585858586,
+ "grad_norm": 2.099358558654785,
+ "learning_rate": 1.6956228956228957e-05,
+ "loss": 1.4211962223052979,
+ "mean_token_accuracy": 0.6549829244613647,
+ "num_tokens": 3719168.0,
+ "step": 227
+ },
+ {
+ "entropy": 1.4647245407104492,
+ "epoch": 0.46060606060606063,
+ "grad_norm": 1.8873655796051025,
+ "learning_rate": 1.6942760942760945e-05,
+ "loss": 1.4848006963729858,
+ "mean_token_accuracy": 0.6534562706947327,
+ "num_tokens": 3735552.0,
+ "step": 228
+ },
+ {
+ "entropy": 1.348371982574463,
+ "epoch": 0.4626262626262626,
+ "grad_norm": 2.0487565994262695,
+ "learning_rate": 1.692929292929293e-05,
+ "loss": 1.355329155921936,
+ "mean_token_accuracy": 0.6709208488464355,
+ "num_tokens": 3751936.0,
+ "step": 229
+ },
+ {
+ "entropy": 1.6201715469360352,
+ "epoch": 0.46464646464646464,
+ "grad_norm": 1.9640510082244873,
+ "learning_rate": 1.6915824915824915e-05,
+ "loss": 1.6176421642303467,
+ "mean_token_accuracy": 0.6221910119056702,
+ "num_tokens": 3768320.0,
+ "step": 230
+ },
+ {
+ "entropy": 1.461037039756775,
+ "epoch": 0.4666666666666667,
+ "grad_norm": 1.9843394756317139,
+ "learning_rate": 1.6902356902356903e-05,
+ "loss": 1.4502949714660645,
+ "mean_token_accuracy": 0.6463727355003357,
+ "num_tokens": 3784704.0,
+ "step": 231
+ },
+ {
+ "entropy": 1.4964231252670288,
+ "epoch": 0.4686868686868687,
+ "grad_norm": 2.0087051391601562,
+ "learning_rate": 1.688888888888889e-05,
+ "loss": 1.5107879638671875,
+ "mean_token_accuracy": 0.6536394953727722,
+ "num_tokens": 3801088.0,
+ "step": 232
+ },
+ {
+ "entropy": 1.3013520240783691,
+ "epoch": 0.4707070707070707,
+ "grad_norm": 2.1042368412017822,
+ "learning_rate": 1.6875420875420876e-05,
+ "loss": 1.312164306640625,
+ "mean_token_accuracy": 0.673363447189331,
+ "num_tokens": 3817472.0,
+ "step": 233
+ },
+ {
+ "entropy": 1.6242352724075317,
+ "epoch": 0.4727272727272727,
+ "grad_norm": 1.8541103601455688,
+ "learning_rate": 1.6861952861952864e-05,
+ "loss": 1.6327502727508545,
+ "mean_token_accuracy": 0.6376404762268066,
+ "num_tokens": 3833856.0,
+ "step": 234
+ },
+ {
+ "entropy": 1.4227592945098877,
+ "epoch": 0.47474747474747475,
+ "grad_norm": 1.8749339580535889,
+ "learning_rate": 1.684848484848485e-05,
+ "loss": 1.436142921447754,
+ "mean_token_accuracy": 0.6705544590950012,
+ "num_tokens": 3850240.0,
+ "step": 235
+ },
+ {
+ "entropy": 1.4807487726211548,
+ "epoch": 0.4767676767676768,
+ "grad_norm": 2.1475114822387695,
+ "learning_rate": 1.6835016835016837e-05,
+ "loss": 1.4670445919036865,
+ "mean_token_accuracy": 0.6385564208030701,
+ "num_tokens": 3866624.0,
+ "step": 236
+ },
+ {
+ "entropy": 2.0623066425323486,
+ "epoch": 0.47878787878787876,
+ "grad_norm": 2.1698546409606934,
+ "learning_rate": 1.6821548821548822e-05,
+ "loss": 2.08683180809021,
+ "mean_token_accuracy": 0.5531876087188721,
+ "num_tokens": 3883008.0,
+ "step": 237
+ },
+ {
+ "entropy": 1.6894460916519165,
+ "epoch": 0.4808080808080808,
+ "grad_norm": 2.158062219619751,
+ "learning_rate": 1.680808080808081e-05,
+ "loss": 1.7244186401367188,
+ "mean_token_accuracy": 0.6055813431739807,
+ "num_tokens": 3899392.0,
+ "step": 238
+ },
+ {
+ "entropy": 1.2741345167160034,
+ "epoch": 0.48282828282828283,
+ "grad_norm": 1.918306827545166,
+ "learning_rate": 1.67946127946128e-05,
+ "loss": 1.2937202453613281,
+ "mean_token_accuracy": 0.6878969073295593,
+ "num_tokens": 3915776.0,
+ "step": 239
+ },
+ {
+ "entropy": 1.556649088859558,
+ "epoch": 0.48484848484848486,
+ "grad_norm": 2.0560667514801025,
+ "learning_rate": 1.6781144781144783e-05,
+ "loss": 1.5751030445098877,
+ "mean_token_accuracy": 0.6324499249458313,
+ "num_tokens": 3932160.0,
+ "step": 240
+ },
+ {
+ "entropy": 1.7632875442504883,
+ "epoch": 0.4868686868686869,
+ "grad_norm": 1.8408738374710083,
+ "learning_rate": 1.6767676767676768e-05,
+ "loss": 1.7745842933654785,
+ "mean_token_accuracy": 0.6091231107711792,
+ "num_tokens": 3948544.0,
+ "step": 241
+ },
+ {
+ "entropy": 1.4793967008590698,
+ "epoch": 0.4888888888888889,
+ "grad_norm": 2.0134575366973877,
+ "learning_rate": 1.6754208754208756e-05,
+ "loss": 1.514477014541626,
+ "mean_token_accuracy": 0.6414875388145447,
+ "num_tokens": 3964928.0,
+ "step": 242
+ },
+ {
+ "entropy": 1.4762561321258545,
+ "epoch": 0.4909090909090909,
+ "grad_norm": 2.087501287460327,
+ "learning_rate": 1.674074074074074e-05,
+ "loss": 1.5195722579956055,
+ "mean_token_accuracy": 0.6289081573486328,
+ "num_tokens": 3981312.0,
+ "step": 243
+ },
+ {
+ "entropy": 1.6629496812820435,
+ "epoch": 0.49292929292929294,
+ "grad_norm": 1.7386047840118408,
+ "learning_rate": 1.672727272727273e-05,
+ "loss": 1.6932936906814575,
+ "mean_token_accuracy": 0.6289692521095276,
+ "num_tokens": 3997696.0,
+ "step": 244
+ },
+ {
+ "entropy": 1.4506888389587402,
+ "epoch": 0.494949494949495,
+ "grad_norm": 1.8268823623657227,
+ "learning_rate": 1.6713804713804714e-05,
+ "loss": 1.4257543087005615,
+ "mean_token_accuracy": 0.6678065657615662,
+ "num_tokens": 4014080.0,
+ "step": 245
+ },
+ {
+ "entropy": 1.6132714748382568,
+ "epoch": 0.49696969696969695,
+ "grad_norm": 2.168206214904785,
+ "learning_rate": 1.6700336700336702e-05,
+ "loss": 1.602414608001709,
+ "mean_token_accuracy": 0.6202979683876038,
+ "num_tokens": 4030464.0,
+ "step": 246
+ },
+ {
+ "entropy": 1.2860945463180542,
+ "epoch": 0.498989898989899,
+ "grad_norm": 1.830817699432373,
+ "learning_rate": 1.668686868686869e-05,
+ "loss": 1.284934163093567,
+ "mean_token_accuracy": 0.6854543089866638,
+ "num_tokens": 4046848.0,
+ "step": 247
+ },
+ {
+ "entropy": 1.4948641061782837,
+ "epoch": 0.501010101010101,
+ "grad_norm": 1.9775508642196655,
+ "learning_rate": 1.6673400673400675e-05,
+ "loss": 1.497206449508667,
+ "mean_token_accuracy": 0.6471055150032043,
+ "num_tokens": 4063232.0,
+ "step": 248
+ },
+ {
+ "entropy": 1.490235447883606,
+ "epoch": 0.503030303030303,
+ "grad_norm": 2.207184076309204,
+ "learning_rate": 1.665993265993266e-05,
+ "loss": 1.5091016292572021,
+ "mean_token_accuracy": 0.6482657790184021,
+ "num_tokens": 4079616.0,
+ "step": 249
+ },
+ {
+ "entropy": 1.5752832889556885,
+ "epoch": 0.5050505050505051,
+ "grad_norm": 2.0718111991882324,
+ "learning_rate": 1.6646464646464648e-05,
+ "loss": 1.576171875,
+ "mean_token_accuracy": 0.6375793814659119,
+ "num_tokens": 4096000.0,
+ "step": 250
+ },
+ {
+ "entropy": 1.3935530185699463,
+ "epoch": 0.5070707070707071,
+ "grad_norm": 1.9379569292068481,
+ "learning_rate": 1.6632996632996633e-05,
+ "loss": 1.4019020795822144,
+ "mean_token_accuracy": 0.6742794513702393,
+ "num_tokens": 4112384.0,
+ "step": 251
+ },
+ {
+ "entropy": 1.3622194528579712,
+ "epoch": 0.509090909090909,
+ "grad_norm": 1.9684133529663086,
+ "learning_rate": 1.661952861952862e-05,
+ "loss": 1.3581968545913696,
+ "mean_token_accuracy": 0.6631045341491699,
+ "num_tokens": 4128768.0,
+ "step": 252
+ },
+ {
+ "entropy": 2.1161346435546875,
+ "epoch": 0.5111111111111111,
+ "grad_norm": 1.9295378923416138,
+ "learning_rate": 1.660606060606061e-05,
+ "loss": 2.1316990852355957,
+ "mean_token_accuracy": 0.5643624663352966,
+ "num_tokens": 4145152.0,
+ "step": 253
+ },
+ {
+ "entropy": 1.4322566986083984,
+ "epoch": 0.5131313131313131,
+ "grad_norm": 2.0198557376861572,
+ "learning_rate": 1.6592592592592594e-05,
+ "loss": 1.4390883445739746,
+ "mean_token_accuracy": 0.6648143529891968,
+ "num_tokens": 4161536.0,
+ "step": 254
+ },
+ {
+ "entropy": 1.5892291069030762,
+ "epoch": 0.5151515151515151,
+ "grad_norm": 2.0127851963043213,
+ "learning_rate": 1.6579124579124582e-05,
+ "loss": 1.6437480449676514,
+ "mean_token_accuracy": 0.6223131418228149,
+ "num_tokens": 4177920.0,
+ "step": 255
+ },
+ {
+ "entropy": 1.445371150970459,
+ "epoch": 0.5171717171717172,
+ "grad_norm": 1.9758318662643433,
+ "learning_rate": 1.6565656565656567e-05,
+ "loss": 1.4749128818511963,
+ "mean_token_accuracy": 0.6457010507583618,
+ "num_tokens": 4194304.0,
+ "step": 256
+ },
+ {
+ "entropy": 1.5587478876113892,
+ "epoch": 0.5191919191919192,
+ "grad_norm": 1.918809413909912,
+ "learning_rate": 1.6552188552188552e-05,
+ "loss": 1.5739175081253052,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 4210688.0,
+ "step": 257
+ },
+ {
+ "entropy": 1.5112392902374268,
+ "epoch": 0.5212121212121212,
+ "grad_norm": 2.0176963806152344,
+ "learning_rate": 1.653872053872054e-05,
+ "loss": 1.5279680490493774,
+ "mean_token_accuracy": 0.640754759311676,
+ "num_tokens": 4227072.0,
+ "step": 258
+ },
+ {
+ "entropy": 1.4898114204406738,
+ "epoch": 0.5232323232323233,
+ "grad_norm": 2.0637850761413574,
+ "learning_rate": 1.6525252525252528e-05,
+ "loss": 1.5081419944763184,
+ "mean_token_accuracy": 0.6375183463096619,
+ "num_tokens": 4243456.0,
+ "step": 259
+ },
+ {
+ "entropy": 1.4768201112747192,
+ "epoch": 0.5252525252525253,
+ "grad_norm": 1.835053563117981,
+ "learning_rate": 1.6511784511784513e-05,
+ "loss": 1.494248390197754,
+ "mean_token_accuracy": 0.6496092081069946,
+ "num_tokens": 4259840.0,
+ "step": 260
+ },
+ {
+ "entropy": 1.655643105506897,
+ "epoch": 0.5272727272727272,
+ "grad_norm": 1.9655805826187134,
+ "learning_rate": 1.64983164983165e-05,
+ "loss": 1.6360158920288086,
+ "mean_token_accuracy": 0.6209086179733276,
+ "num_tokens": 4276224.0,
+ "step": 261
+ },
+ {
+ "entropy": 1.5621604919433594,
+ "epoch": 0.5292929292929293,
+ "grad_norm": 1.9304734468460083,
+ "learning_rate": 1.6484848484848486e-05,
+ "loss": 1.5850739479064941,
+ "mean_token_accuracy": 0.6422203183174133,
+ "num_tokens": 4292608.0,
+ "step": 262
+ },
+ {
+ "entropy": 1.592617392539978,
+ "epoch": 0.5313131313131313,
+ "grad_norm": 1.9590504169464111,
+ "learning_rate": 1.6471380471380474e-05,
+ "loss": 1.583874225616455,
+ "mean_token_accuracy": 0.6230459213256836,
+ "num_tokens": 4308992.0,
+ "step": 263
+ },
+ {
+ "entropy": 1.5268265008926392,
+ "epoch": 0.5333333333333333,
+ "grad_norm": 2.0704433917999268,
+ "learning_rate": 1.645791245791246e-05,
+ "loss": 1.5327314138412476,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 4325376.0,
+ "step": 264
+ },
+ {
+ "entropy": 1.1762311458587646,
+ "epoch": 0.5353535353535354,
+ "grad_norm": 2.0408453941345215,
+ "learning_rate": 1.6444444444444444e-05,
+ "loss": 1.1851191520690918,
+ "mean_token_accuracy": 0.7027967572212219,
+ "num_tokens": 4341760.0,
+ "step": 265
+ },
+ {
+ "entropy": 1.567710518836975,
+ "epoch": 0.5373737373737374,
+ "grad_norm": 1.8334625959396362,
+ "learning_rate": 1.6430976430976432e-05,
+ "loss": 1.564115047454834,
+ "mean_token_accuracy": 0.6340376138687134,
+ "num_tokens": 4358144.0,
+ "step": 266
+ },
+ {
+ "entropy": 1.2294297218322754,
+ "epoch": 0.5393939393939394,
+ "grad_norm": 3.5099127292633057,
+ "learning_rate": 1.641750841750842e-05,
+ "loss": 1.2887773513793945,
+ "mean_token_accuracy": 0.688629686832428,
+ "num_tokens": 4374528.0,
+ "step": 267
+ },
+ {
+ "entropy": 1.5130258798599243,
+ "epoch": 0.5414141414141415,
+ "grad_norm": 1.8295154571533203,
+ "learning_rate": 1.6404040404040405e-05,
+ "loss": 1.581455945968628,
+ "mean_token_accuracy": 0.639655590057373,
+ "num_tokens": 4390912.0,
+ "step": 268
+ },
+ {
+ "entropy": 1.6612389087677002,
+ "epoch": 0.5434343434343434,
+ "grad_norm": 2.1676483154296875,
+ "learning_rate": 1.6390572390572393e-05,
+ "loss": 1.6873081922531128,
+ "mean_token_accuracy": 0.6049095988273621,
+ "num_tokens": 4407296.0,
+ "step": 269
+ },
+ {
+ "entropy": 1.416680932044983,
+ "epoch": 0.5454545454545454,
+ "grad_norm": 2.044541358947754,
+ "learning_rate": 1.6377104377104378e-05,
+ "loss": 1.4432693719863892,
+ "mean_token_accuracy": 0.6580972075462341,
+ "num_tokens": 4423680.0,
+ "step": 270
+ },
+ {
+ "entropy": 1.6253215074539185,
+ "epoch": 0.5474747474747474,
+ "grad_norm": 2.1488161087036133,
+ "learning_rate": 1.6363636363636366e-05,
+ "loss": 1.6667883396148682,
+ "mean_token_accuracy": 0.6122373938560486,
+ "num_tokens": 4440064.0,
+ "step": 271
+ },
+ {
+ "entropy": 1.492803931236267,
+ "epoch": 0.5494949494949495,
+ "grad_norm": 2.0591108798980713,
+ "learning_rate": 1.635016835016835e-05,
+ "loss": 1.5023317337036133,
+ "mean_token_accuracy": 0.6420371532440186,
+ "num_tokens": 4456448.0,
+ "step": 272
+ },
+ {
+ "entropy": 1.5818493366241455,
+ "epoch": 0.5515151515151515,
+ "grad_norm": 1.9004875421524048,
+ "learning_rate": 1.633670033670034e-05,
+ "loss": 1.5762417316436768,
+ "mean_token_accuracy": 0.6375793814659119,
+ "num_tokens": 4472832.0,
+ "step": 273
+ },
+ {
+ "entropy": 1.2263695001602173,
+ "epoch": 0.5535353535353535,
+ "grad_norm": 1.8976677656173706,
+ "learning_rate": 1.6323232323232324e-05,
+ "loss": 1.2397428750991821,
+ "mean_token_accuracy": 0.70658278465271,
+ "num_tokens": 4489216.0,
+ "step": 274
+ },
+ {
+ "entropy": 1.370070219039917,
+ "epoch": 0.5555555555555556,
+ "grad_norm": 1.875389575958252,
+ "learning_rate": 1.6309764309764312e-05,
+ "loss": 1.3603096008300781,
+ "mean_token_accuracy": 0.6843551397323608,
+ "num_tokens": 4505600.0,
+ "step": 275
+ },
+ {
+ "entropy": 1.9219107627868652,
+ "epoch": 0.5575757575757576,
+ "grad_norm": 2.057508945465088,
+ "learning_rate": 1.6296296296296297e-05,
+ "loss": 1.9082988500595093,
+ "mean_token_accuracy": 0.5834758281707764,
+ "num_tokens": 4521984.0,
+ "step": 276
+ },
+ {
+ "entropy": 1.6965564489364624,
+ "epoch": 0.5595959595959596,
+ "grad_norm": 1.9217735528945923,
+ "learning_rate": 1.6282828282828285e-05,
+ "loss": 1.7024450302124023,
+ "mean_token_accuracy": 0.6050928235054016,
+ "num_tokens": 4538368.0,
+ "step": 277
+ },
+ {
+ "entropy": 1.7517896890640259,
+ "epoch": 0.5616161616161616,
+ "grad_norm": 2.029672145843506,
+ "learning_rate": 1.626936026936027e-05,
+ "loss": 1.7533857822418213,
+ "mean_token_accuracy": 0.5986199378967285,
+ "num_tokens": 4554752.0,
+ "step": 278
+ },
+ {
+ "entropy": 1.6086634397506714,
+ "epoch": 0.5636363636363636,
+ "grad_norm": 1.980076551437378,
+ "learning_rate": 1.6255892255892258e-05,
+ "loss": 1.5998293161392212,
+ "mean_token_accuracy": 0.6469223499298096,
+ "num_tokens": 4571136.0,
+ "step": 279
+ },
+ {
+ "entropy": 1.5670934915542603,
+ "epoch": 0.5656565656565656,
+ "grad_norm": 1.9693994522094727,
+ "learning_rate": 1.6242424242424243e-05,
+ "loss": 1.583737850189209,
+ "mean_token_accuracy": 0.6189545392990112,
+ "num_tokens": 4587520.0,
+ "step": 280
+ },
+ {
+ "entropy": 1.5290220975875854,
+ "epoch": 0.5676767676767677,
+ "grad_norm": 1.9464402198791504,
+ "learning_rate": 1.622895622895623e-05,
+ "loss": 1.523187518119812,
+ "mean_token_accuracy": 0.6289692521095276,
+ "num_tokens": 4603904.0,
+ "step": 281
+ },
+ {
+ "entropy": 1.2070591449737549,
+ "epoch": 0.5696969696969697,
+ "grad_norm": 2.1152102947235107,
+ "learning_rate": 1.621548821548822e-05,
+ "loss": 1.2107012271881104,
+ "mean_token_accuracy": 0.695652186870575,
+ "num_tokens": 4620288.0,
+ "step": 282
+ },
+ {
+ "entropy": 1.4039427042007446,
+ "epoch": 0.5717171717171717,
+ "grad_norm": 1.936285376548767,
+ "learning_rate": 1.6202020202020204e-05,
+ "loss": 1.425846815109253,
+ "mean_token_accuracy": 0.663593053817749,
+ "num_tokens": 4636672.0,
+ "step": 283
+ },
+ {
+ "entropy": 1.2910168170928955,
+ "epoch": 0.5737373737373738,
+ "grad_norm": 1.8882776498794556,
+ "learning_rate": 1.618855218855219e-05,
+ "loss": 1.3109780550003052,
+ "mean_token_accuracy": 0.6896067261695862,
+ "num_tokens": 4653056.0,
+ "step": 284
+ },
+ {
+ "entropy": 1.7089474201202393,
+ "epoch": 0.5757575757575758,
+ "grad_norm": 2.0113184452056885,
+ "learning_rate": 1.6175084175084177e-05,
+ "loss": 1.7272329330444336,
+ "mean_token_accuracy": 0.600024402141571,
+ "num_tokens": 4669440.0,
+ "step": 285
+ },
+ {
+ "entropy": 1.12257719039917,
+ "epoch": 0.5777777777777777,
+ "grad_norm": 2.0191409587860107,
+ "learning_rate": 1.616161616161616e-05,
+ "loss": 1.1193959712982178,
+ "mean_token_accuracy": 0.7199560403823853,
+ "num_tokens": 4685824.0,
+ "step": 286
+ },
+ {
+ "entropy": 1.2052935361862183,
+ "epoch": 0.5797979797979798,
+ "grad_norm": 1.9647032022476196,
+ "learning_rate": 1.614814814814815e-05,
+ "loss": 1.2192071676254272,
+ "mean_token_accuracy": 0.6977894306182861,
+ "num_tokens": 4702208.0,
+ "step": 287
+ },
+ {
+ "entropy": 1.5017658472061157,
+ "epoch": 0.5818181818181818,
+ "grad_norm": 2.0078749656677246,
+ "learning_rate": 1.6134680134680138e-05,
+ "loss": 1.5069187879562378,
+ "mean_token_accuracy": 0.6404494643211365,
+ "num_tokens": 4718592.0,
+ "step": 288
+ },
+ {
+ "entropy": 1.4429490566253662,
+ "epoch": 0.5838383838383838,
+ "grad_norm": 1.8666913509368896,
+ "learning_rate": 1.6121212121212123e-05,
+ "loss": 1.4498789310455322,
+ "mean_token_accuracy": 0.6577919125556946,
+ "num_tokens": 4734976.0,
+ "step": 289
+ },
+ {
+ "entropy": 1.216312050819397,
+ "epoch": 0.5858585858585859,
+ "grad_norm": 1.8042014837265015,
+ "learning_rate": 1.610774410774411e-05,
+ "loss": 1.2346259355545044,
+ "mean_token_accuracy": 0.7015144228935242,
+ "num_tokens": 4751360.0,
+ "step": 290
+ },
+ {
+ "entropy": 1.1411411762237549,
+ "epoch": 0.5878787878787879,
+ "grad_norm": 1.7743948698043823,
+ "learning_rate": 1.6094276094276096e-05,
+ "loss": 1.158776044845581,
+ "mean_token_accuracy": 0.7111626863479614,
+ "num_tokens": 4767744.0,
+ "step": 291
+ },
+ {
+ "entropy": 1.5691558122634888,
+ "epoch": 0.5898989898989899,
+ "grad_norm": 2.0790789127349854,
+ "learning_rate": 1.608080808080808e-05,
+ "loss": 1.5900537967681885,
+ "mean_token_accuracy": 0.6259770393371582,
+ "num_tokens": 4784128.0,
+ "step": 292
+ },
+ {
+ "entropy": 1.5600252151489258,
+ "epoch": 0.591919191919192,
+ "grad_norm": 1.8288682699203491,
+ "learning_rate": 1.606734006734007e-05,
+ "loss": 1.5642855167388916,
+ "mean_token_accuracy": 0.6497313380241394,
+ "num_tokens": 4800512.0,
+ "step": 293
+ },
+ {
+ "entropy": 1.316757082939148,
+ "epoch": 0.593939393939394,
+ "grad_norm": 2.051280975341797,
+ "learning_rate": 1.6053872053872053e-05,
+ "loss": 1.3361237049102783,
+ "mean_token_accuracy": 0.6642647981643677,
+ "num_tokens": 4816896.0,
+ "step": 294
+ },
+ {
+ "entropy": 1.4421989917755127,
+ "epoch": 0.5959595959595959,
+ "grad_norm": 2.257932662963867,
+ "learning_rate": 1.604040404040404e-05,
+ "loss": 1.4325928688049316,
+ "mean_token_accuracy": 0.6571201682090759,
+ "num_tokens": 4833280.0,
+ "step": 295
+ },
+ {
+ "entropy": 1.4986436367034912,
+ "epoch": 0.597979797979798,
+ "grad_norm": 2.0747647285461426,
+ "learning_rate": 1.602693602693603e-05,
+ "loss": 1.508068323135376,
+ "mean_token_accuracy": 0.6551050543785095,
+ "num_tokens": 4849664.0,
+ "step": 296
+ },
+ {
+ "entropy": 1.4758206605911255,
+ "epoch": 0.6,
+ "grad_norm": 1.874723196029663,
+ "learning_rate": 1.6013468013468014e-05,
+ "loss": 1.4831781387329102,
+ "mean_token_accuracy": 0.6479604244232178,
+ "num_tokens": 4866048.0,
+ "step": 297
+ },
+ {
+ "entropy": 1.8049858808517456,
+ "epoch": 0.602020202020202,
+ "grad_norm": 2.089683771133423,
+ "learning_rate": 1.6000000000000003e-05,
+ "loss": 1.8325893878936768,
+ "mean_token_accuracy": 0.5932462215423584,
+ "num_tokens": 4882432.0,
+ "step": 298
+ },
+ {
+ "entropy": 1.6346150636672974,
+ "epoch": 0.604040404040404,
+ "grad_norm": 1.9526349306106567,
+ "learning_rate": 1.5986531986531987e-05,
+ "loss": 1.6568968296051025,
+ "mean_token_accuracy": 0.6246336102485657,
+ "num_tokens": 4898816.0,
+ "step": 299
+ },
+ {
+ "entropy": 1.431725025177002,
+ "epoch": 0.6060606060606061,
+ "grad_norm": 2.109987497329712,
+ "learning_rate": 1.5973063973063972e-05,
+ "loss": 1.4448115825653076,
+ "mean_token_accuracy": 0.6481436491012573,
+ "num_tokens": 4915200.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.6060606060606061,
+ "eval_entropy": 1.524387352889584,
+ "eval_loss": 1.5324952602386475,
+ "eval_mean_token_accuracy": 0.6443250953189789,
+ "eval_num_tokens": 4915200.0,
+ "eval_runtime": 43.7714,
+ "eval_samples_per_second": 22.618,
+ "eval_steps_per_second": 2.833,
+ "step": 300
+ },
+ {
+ "entropy": 1.4816409349441528,
+ "epoch": 0.6080808080808081,
+ "grad_norm": 3.3732845783233643,
+ "learning_rate": 1.595959595959596e-05,
+ "loss": 1.4913065433502197,
+ "mean_token_accuracy": 0.658707857131958,
+ "num_tokens": 4931584.0,
+ "step": 301
+ },
+ {
+ "entropy": 1.4020944833755493,
+ "epoch": 0.6101010101010101,
+ "grad_norm": 2.1152141094207764,
+ "learning_rate": 1.594612794612795e-05,
+ "loss": 1.4000526666641235,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 4947968.0,
+ "step": 302
+ },
+ {
+ "entropy": 1.4965202808380127,
+ "epoch": 0.6121212121212121,
+ "grad_norm": 2.1385467052459717,
+ "learning_rate": 1.5932659932659933e-05,
+ "loss": 1.5221803188323975,
+ "mean_token_accuracy": 0.6567537784576416,
+ "num_tokens": 4964352.0,
+ "step": 303
+ },
+ {
+ "entropy": 1.4024577140808105,
+ "epoch": 0.6141414141414141,
+ "grad_norm": 1.9162694215774536,
+ "learning_rate": 1.591919191919192e-05,
+ "loss": 1.4050084352493286,
+ "mean_token_accuracy": 0.6670737862586975,
+ "num_tokens": 4980736.0,
+ "step": 304
+ },
+ {
+ "entropy": 1.430273413658142,
+ "epoch": 0.6161616161616161,
+ "grad_norm": 2.0312552452087402,
+ "learning_rate": 1.5905723905723906e-05,
+ "loss": 1.418628454208374,
+ "mean_token_accuracy": 0.6585857272148132,
+ "num_tokens": 4997120.0,
+ "step": 305
+ },
+ {
+ "entropy": 1.700549602508545,
+ "epoch": 0.6181818181818182,
+ "grad_norm": 2.080810546875,
+ "learning_rate": 1.5892255892255895e-05,
+ "loss": 1.740492820739746,
+ "mean_token_accuracy": 0.6042989492416382,
+ "num_tokens": 5013504.0,
+ "step": 306
+ },
+ {
+ "entropy": 1.6465320587158203,
+ "epoch": 0.6202020202020202,
+ "grad_norm": 1.8810964822769165,
+ "learning_rate": 1.587878787878788e-05,
+ "loss": 1.6414886713027954,
+ "mean_token_accuracy": 0.629824161529541,
+ "num_tokens": 5029888.0,
+ "step": 307
+ },
+ {
+ "entropy": 1.3717931509017944,
+ "epoch": 0.6222222222222222,
+ "grad_norm": 1.921536922454834,
+ "learning_rate": 1.5865319865319868e-05,
+ "loss": 1.3700361251831055,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 5046272.0,
+ "step": 308
+ },
+ {
+ "entropy": 1.4906446933746338,
+ "epoch": 0.6242424242424243,
+ "grad_norm": 2.1185555458068848,
+ "learning_rate": 1.5851851851851852e-05,
+ "loss": 1.4850339889526367,
+ "mean_token_accuracy": 0.6402662396430969,
+ "num_tokens": 5062656.0,
+ "step": 309
+ },
+ {
+ "entropy": 1.4417473077774048,
+ "epoch": 0.6262626262626263,
+ "grad_norm": 2.0196895599365234,
+ "learning_rate": 1.583838383838384e-05,
+ "loss": 1.4567816257476807,
+ "mean_token_accuracy": 0.6760503053665161,
+ "num_tokens": 5079040.0,
+ "step": 310
+ },
+ {
+ "entropy": 1.4662094116210938,
+ "epoch": 0.6282828282828283,
+ "grad_norm": 1.8859882354736328,
+ "learning_rate": 1.5824915824915825e-05,
+ "loss": 1.4870874881744385,
+ "mean_token_accuracy": 0.6618221998214722,
+ "num_tokens": 5095424.0,
+ "step": 311
+ },
+ {
+ "entropy": 1.8497077226638794,
+ "epoch": 0.6303030303030303,
+ "grad_norm": 1.974537968635559,
+ "learning_rate": 1.5811447811447813e-05,
+ "loss": 1.840538501739502,
+ "mean_token_accuracy": 0.589093804359436,
+ "num_tokens": 5111808.0,
+ "step": 312
+ },
+ {
+ "entropy": 1.4185130596160889,
+ "epoch": 0.6323232323232323,
+ "grad_norm": 1.8612359762191772,
+ "learning_rate": 1.5797979797979798e-05,
+ "loss": 1.4404246807098389,
+ "mean_token_accuracy": 0.664631187915802,
+ "num_tokens": 5128192.0,
+ "step": 313
+ },
+ {
+ "entropy": 1.8270463943481445,
+ "epoch": 0.6343434343434343,
+ "grad_norm": 2.1050970554351807,
+ "learning_rate": 1.5784511784511786e-05,
+ "loss": 1.8682940006256104,
+ "mean_token_accuracy": 0.5893380641937256,
+ "num_tokens": 5144576.0,
+ "step": 314
+ },
+ {
+ "entropy": 1.5919326543807983,
+ "epoch": 0.6363636363636364,
+ "grad_norm": 1.8464620113372803,
+ "learning_rate": 1.577104377104377e-05,
+ "loss": 1.6087713241577148,
+ "mean_token_accuracy": 0.6350146532058716,
+ "num_tokens": 5160960.0,
+ "step": 315
+ },
+ {
+ "entropy": 1.4776946306228638,
+ "epoch": 0.6383838383838384,
+ "grad_norm": 2.031834602355957,
+ "learning_rate": 1.575757575757576e-05,
+ "loss": 1.5114507675170898,
+ "mean_token_accuracy": 0.6498534679412842,
+ "num_tokens": 5177344.0,
+ "step": 316
+ },
+ {
+ "entropy": 1.3789927959442139,
+ "epoch": 0.6404040404040404,
+ "grad_norm": 1.8604289293289185,
+ "learning_rate": 1.5744107744107748e-05,
+ "loss": 1.3792052268981934,
+ "mean_token_accuracy": 0.6712262034416199,
+ "num_tokens": 5193728.0,
+ "step": 317
+ },
+ {
+ "entropy": 1.5859184265136719,
+ "epoch": 0.6424242424242425,
+ "grad_norm": 2.1134088039398193,
+ "learning_rate": 1.5730639730639732e-05,
+ "loss": 1.595099925994873,
+ "mean_token_accuracy": 0.6351367831230164,
+ "num_tokens": 5210112.0,
+ "step": 318
+ },
+ {
+ "entropy": 1.3681901693344116,
+ "epoch": 0.6444444444444445,
+ "grad_norm": 1.9200235605239868,
+ "learning_rate": 1.5717171717171717e-05,
+ "loss": 1.3700852394104004,
+ "mean_token_accuracy": 0.6671959161758423,
+ "num_tokens": 5226496.0,
+ "step": 319
+ },
+ {
+ "entropy": 1.594885230064392,
+ "epoch": 0.6464646464646465,
+ "grad_norm": 1.7683591842651367,
+ "learning_rate": 1.5703703703703705e-05,
+ "loss": 1.5906047821044922,
+ "mean_token_accuracy": 0.6350757479667664,
+ "num_tokens": 5242880.0,
+ "step": 320
+ },
+ {
+ "entropy": 1.240937352180481,
+ "epoch": 0.6484848484848484,
+ "grad_norm": 2.117145299911499,
+ "learning_rate": 1.569023569023569e-05,
+ "loss": 1.2188963890075684,
+ "mean_token_accuracy": 0.6958353519439697,
+ "num_tokens": 5259264.0,
+ "step": 321
+ },
+ {
+ "entropy": 1.244801640510559,
+ "epoch": 0.6505050505050505,
+ "grad_norm": 1.983111023902893,
+ "learning_rate": 1.5676767676767678e-05,
+ "loss": 1.246530294418335,
+ "mean_token_accuracy": 0.6966902613639832,
+ "num_tokens": 5275648.0,
+ "step": 322
+ },
+ {
+ "entropy": 1.5355960130691528,
+ "epoch": 0.6525252525252525,
+ "grad_norm": 2.126024007797241,
+ "learning_rate": 1.5663299663299666e-05,
+ "loss": 1.576147198677063,
+ "mean_token_accuracy": 0.6414265036582947,
+ "num_tokens": 5292032.0,
+ "step": 323
+ },
+ {
+ "entropy": 1.13125741481781,
+ "epoch": 0.6545454545454545,
+ "grad_norm": 1.8933371305465698,
+ "learning_rate": 1.564983164983165e-05,
+ "loss": 1.1167645454406738,
+ "mean_token_accuracy": 0.7080483436584473,
+ "num_tokens": 5308416.0,
+ "step": 324
+ },
+ {
+ "entropy": 1.6553086042404175,
+ "epoch": 0.6565656565656566,
+ "grad_norm": 1.9253427982330322,
+ "learning_rate": 1.563636363636364e-05,
+ "loss": 1.6746933460235596,
+ "mean_token_accuracy": 0.6138250827789307,
+ "num_tokens": 5324800.0,
+ "step": 325
+ },
+ {
+ "entropy": 1.7187142372131348,
+ "epoch": 0.6585858585858586,
+ "grad_norm": 1.8655303716659546,
+ "learning_rate": 1.5622895622895624e-05,
+ "loss": 1.7368483543395996,
+ "mean_token_accuracy": 0.6073521971702576,
+ "num_tokens": 5341184.0,
+ "step": 326
+ },
+ {
+ "entropy": 1.4150934219360352,
+ "epoch": 0.6606060606060606,
+ "grad_norm": 1.8396921157836914,
+ "learning_rate": 1.560942760942761e-05,
+ "loss": 1.450613260269165,
+ "mean_token_accuracy": 0.6628602743148804,
+ "num_tokens": 5357568.0,
+ "step": 327
+ },
+ {
+ "entropy": 1.6463909149169922,
+ "epoch": 0.6626262626262627,
+ "grad_norm": 2.0179622173309326,
+ "learning_rate": 1.5595959595959597e-05,
+ "loss": 1.6767137050628662,
+ "mean_token_accuracy": 0.6147410869598389,
+ "num_tokens": 5373952.0,
+ "step": 328
+ },
+ {
+ "entropy": 1.2962068319320679,
+ "epoch": 0.6646464646464646,
+ "grad_norm": 1.9322903156280518,
+ "learning_rate": 1.5582491582491582e-05,
+ "loss": 1.288381814956665,
+ "mean_token_accuracy": 0.6877137422561646,
+ "num_tokens": 5390336.0,
+ "step": 329
+ },
+ {
+ "entropy": 1.4675830602645874,
+ "epoch": 0.6666666666666666,
+ "grad_norm": 1.7735666036605835,
+ "learning_rate": 1.556902356902357e-05,
+ "loss": 1.4585455656051636,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 5406720.0,
+ "step": 330
+ },
+ {
+ "entropy": 1.55418062210083,
+ "epoch": 0.6686868686868687,
+ "grad_norm": 1.9255602359771729,
+ "learning_rate": 1.555555555555556e-05,
+ "loss": 1.6033880710601807,
+ "mean_token_accuracy": 0.6486321687698364,
+ "num_tokens": 5423104.0,
+ "step": 331
+ },
+ {
+ "entropy": 1.4288218021392822,
+ "epoch": 0.6707070707070707,
+ "grad_norm": 1.8075612783432007,
+ "learning_rate": 1.5542087542087543e-05,
+ "loss": 1.457895278930664,
+ "mean_token_accuracy": 0.6725085377693176,
+ "num_tokens": 5439488.0,
+ "step": 332
+ },
+ {
+ "entropy": 1.3419297933578491,
+ "epoch": 0.6727272727272727,
+ "grad_norm": 2.1730353832244873,
+ "learning_rate": 1.552861952861953e-05,
+ "loss": 1.3681403398513794,
+ "mean_token_accuracy": 0.6664020419120789,
+ "num_tokens": 5455872.0,
+ "step": 333
+ },
+ {
+ "entropy": 1.706923007965088,
+ "epoch": 0.6747474747474748,
+ "grad_norm": 1.9297505617141724,
+ "learning_rate": 1.5515151515151516e-05,
+ "loss": 1.7304211854934692,
+ "mean_token_accuracy": 0.6020395755767822,
+ "num_tokens": 5472256.0,
+ "step": 334
+ },
+ {
+ "entropy": 1.117404818534851,
+ "epoch": 0.6767676767676768,
+ "grad_norm": 1.7363555431365967,
+ "learning_rate": 1.55016835016835e-05,
+ "loss": 1.1002353429794312,
+ "mean_token_accuracy": 0.7285661697387695,
+ "num_tokens": 5488640.0,
+ "step": 335
+ },
+ {
+ "entropy": 1.409253478050232,
+ "epoch": 0.6787878787878788,
+ "grad_norm": 2.029304265975952,
+ "learning_rate": 1.548821548821549e-05,
+ "loss": 1.4001437425613403,
+ "mean_token_accuracy": 0.6604176759719849,
+ "num_tokens": 5505024.0,
+ "step": 336
+ },
+ {
+ "entropy": 1.0427494049072266,
+ "epoch": 0.6808080808080809,
+ "grad_norm": 2.0266847610473633,
+ "learning_rate": 1.5474747474747477e-05,
+ "loss": 1.0636063814163208,
+ "mean_token_accuracy": 0.7298485636711121,
+ "num_tokens": 5521408.0,
+ "step": 337
+ },
+ {
+ "entropy": 1.479506254196167,
+ "epoch": 0.6828282828282828,
+ "grad_norm": 1.937677264213562,
+ "learning_rate": 1.5461279461279462e-05,
+ "loss": 1.4711894989013672,
+ "mean_token_accuracy": 0.6436248421669006,
+ "num_tokens": 5537792.0,
+ "step": 338
+ },
+ {
+ "entropy": 1.636492371559143,
+ "epoch": 0.6848484848484848,
+ "grad_norm": 1.9746829271316528,
+ "learning_rate": 1.544781144781145e-05,
+ "loss": 1.638418436050415,
+ "mean_token_accuracy": 0.6204200983047485,
+ "num_tokens": 5554176.0,
+ "step": 339
+ },
+ {
+ "entropy": 1.6094971895217896,
+ "epoch": 0.6868686868686869,
+ "grad_norm": 1.998382806777954,
+ "learning_rate": 1.5434343434343435e-05,
+ "loss": 1.6025879383087158,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 5570560.0,
+ "step": 340
+ },
+ {
+ "entropy": 1.3113542795181274,
+ "epoch": 0.6888888888888889,
+ "grad_norm": 2.059739589691162,
+ "learning_rate": 1.5420875420875423e-05,
+ "loss": 1.32335364818573,
+ "mean_token_accuracy": 0.6776379942893982,
+ "num_tokens": 5586944.0,
+ "step": 341
+ },
+ {
+ "entropy": 1.3761622905731201,
+ "epoch": 0.6909090909090909,
+ "grad_norm": 1.9774043560028076,
+ "learning_rate": 1.5407407407407408e-05,
+ "loss": 1.3731458187103271,
+ "mean_token_accuracy": 0.681546151638031,
+ "num_tokens": 5603328.0,
+ "step": 342
+ },
+ {
+ "entropy": 1.3822734355926514,
+ "epoch": 0.692929292929293,
+ "grad_norm": 5.41459321975708,
+ "learning_rate": 1.5393939393939393e-05,
+ "loss": 1.4077341556549072,
+ "mean_token_accuracy": 0.6688446402549744,
+ "num_tokens": 5619712.0,
+ "step": 343
+ },
+ {
+ "entropy": 1.4885843992233276,
+ "epoch": 0.694949494949495,
+ "grad_norm": 1.9256173372268677,
+ "learning_rate": 1.538047138047138e-05,
+ "loss": 1.5017898082733154,
+ "mean_token_accuracy": 0.6411211490631104,
+ "num_tokens": 5636096.0,
+ "step": 344
+ },
+ {
+ "entropy": 1.4558689594268799,
+ "epoch": 0.696969696969697,
+ "grad_norm": 1.923056721687317,
+ "learning_rate": 1.536700336700337e-05,
+ "loss": 1.4409637451171875,
+ "mean_token_accuracy": 0.6607840657234192,
+ "num_tokens": 5652480.0,
+ "step": 345
+ },
+ {
+ "entropy": 1.3396257162094116,
+ "epoch": 0.6989898989898989,
+ "grad_norm": 1.9321191310882568,
+ "learning_rate": 1.5353535353535354e-05,
+ "loss": 1.3465441465377808,
+ "mean_token_accuracy": 0.6682339906692505,
+ "num_tokens": 5668864.0,
+ "step": 346
+ },
+ {
+ "entropy": 1.931525468826294,
+ "epoch": 0.701010101010101,
+ "grad_norm": 2.11252498626709,
+ "learning_rate": 1.5340067340067342e-05,
+ "loss": 1.947523832321167,
+ "mean_token_accuracy": 0.5751709938049316,
+ "num_tokens": 5685248.0,
+ "step": 347
+ },
+ {
+ "entropy": 1.4246045351028442,
+ "epoch": 0.703030303030303,
+ "grad_norm": 2.017690658569336,
+ "learning_rate": 1.5326599326599327e-05,
+ "loss": 1.431095004081726,
+ "mean_token_accuracy": 0.6621274948120117,
+ "num_tokens": 5701632.0,
+ "step": 348
+ },
+ {
+ "entropy": 1.2840481996536255,
+ "epoch": 0.705050505050505,
+ "grad_norm": 1.897916555404663,
+ "learning_rate": 1.5313131313131315e-05,
+ "loss": 1.2944300174713135,
+ "mean_token_accuracy": 0.7013311982154846,
+ "num_tokens": 5718016.0,
+ "step": 349
+ },
+ {
+ "entropy": 1.1308226585388184,
+ "epoch": 0.7070707070707071,
+ "grad_norm": 1.8326802253723145,
+ "learning_rate": 1.52996632996633e-05,
+ "loss": 1.1564277410507202,
+ "mean_token_accuracy": 0.714154839515686,
+ "num_tokens": 5734400.0,
+ "step": 350
+ },
+ {
+ "entropy": 1.4157475233078003,
+ "epoch": 0.7090909090909091,
+ "grad_norm": 1.9305709600448608,
+ "learning_rate": 1.5286195286195288e-05,
+ "loss": 1.421119213104248,
+ "mean_token_accuracy": 0.6651197075843811,
+ "num_tokens": 5750784.0,
+ "step": 351
+ },
+ {
+ "entropy": 1.353966474533081,
+ "epoch": 0.7111111111111111,
+ "grad_norm": 2.058542251586914,
+ "learning_rate": 1.5272727272727276e-05,
+ "loss": 1.3575413227081299,
+ "mean_token_accuracy": 0.6724475026130676,
+ "num_tokens": 5767168.0,
+ "step": 352
+ },
+ {
+ "entropy": 1.7946882247924805,
+ "epoch": 0.7131313131313132,
+ "grad_norm": 1.9397060871124268,
+ "learning_rate": 1.525925925925926e-05,
+ "loss": 1.7882269620895386,
+ "mean_token_accuracy": 0.6064972877502441,
+ "num_tokens": 5783552.0,
+ "step": 353
+ },
+ {
+ "entropy": 1.4986019134521484,
+ "epoch": 0.7151515151515152,
+ "grad_norm": 1.9084810018539429,
+ "learning_rate": 1.5245791245791246e-05,
+ "loss": 1.5188498497009277,
+ "mean_token_accuracy": 0.6610283255577087,
+ "num_tokens": 5799936.0,
+ "step": 354
+ },
+ {
+ "entropy": 1.9081071615219116,
+ "epoch": 0.7171717171717171,
+ "grad_norm": 2.1528689861297607,
+ "learning_rate": 1.5232323232323234e-05,
+ "loss": 1.8967041969299316,
+ "mean_token_accuracy": 0.5691255331039429,
+ "num_tokens": 5816320.0,
+ "step": 355
+ },
+ {
+ "entropy": 1.641337513923645,
+ "epoch": 0.7191919191919192,
+ "grad_norm": 1.9197942018508911,
+ "learning_rate": 1.521885521885522e-05,
+ "loss": 1.6193110942840576,
+ "mean_token_accuracy": 0.6286638975143433,
+ "num_tokens": 5832704.0,
+ "step": 356
+ },
+ {
+ "entropy": 1.348304271697998,
+ "epoch": 0.7212121212121212,
+ "grad_norm": 1.9729533195495605,
+ "learning_rate": 1.5205387205387207e-05,
+ "loss": 1.3781111240386963,
+ "mean_token_accuracy": 0.6654250025749207,
+ "num_tokens": 5849088.0,
+ "step": 357
+ },
+ {
+ "entropy": 1.5427544116973877,
+ "epoch": 0.7232323232323232,
+ "grad_norm": 2.0730769634246826,
+ "learning_rate": 1.5191919191919193e-05,
+ "loss": 1.5770654678344727,
+ "mean_token_accuracy": 0.6273815631866455,
+ "num_tokens": 5865472.0,
+ "step": 358
+ },
+ {
+ "entropy": 1.5560660362243652,
+ "epoch": 0.7252525252525253,
+ "grad_norm": 2.0436644554138184,
+ "learning_rate": 1.5178451178451178e-05,
+ "loss": 1.5465143918991089,
+ "mean_token_accuracy": 0.6335490942001343,
+ "num_tokens": 5881856.0,
+ "step": 359
+ },
+ {
+ "entropy": 1.5396223068237305,
+ "epoch": 0.7272727272727273,
+ "grad_norm": 1.9955254793167114,
+ "learning_rate": 1.5164983164983166e-05,
+ "loss": 1.5742223262786865,
+ "mean_token_accuracy": 0.6344650983810425,
+ "num_tokens": 5898240.0,
+ "step": 360
+ },
+ {
+ "entropy": 1.1664644479751587,
+ "epoch": 0.7292929292929293,
+ "grad_norm": 1.6942992210388184,
+ "learning_rate": 1.5151515151515153e-05,
+ "loss": 1.159040927886963,
+ "mean_token_accuracy": 0.7144601941108704,
+ "num_tokens": 5914624.0,
+ "step": 361
+ },
+ {
+ "entropy": 1.356544017791748,
+ "epoch": 0.7313131313131314,
+ "grad_norm": 1.890787124633789,
+ "learning_rate": 1.5138047138047138e-05,
+ "loss": 1.347895622253418,
+ "mean_token_accuracy": 0.6813629865646362,
+ "num_tokens": 5931008.0,
+ "step": 362
+ },
+ {
+ "entropy": 1.6837173700332642,
+ "epoch": 0.7333333333333333,
+ "grad_norm": 2.1780381202697754,
+ "learning_rate": 1.5124579124579126e-05,
+ "loss": 1.6997990608215332,
+ "mean_token_accuracy": 0.6098558902740479,
+ "num_tokens": 5947392.0,
+ "step": 363
+ },
+ {
+ "entropy": 1.1412957906723022,
+ "epoch": 0.7353535353535353,
+ "grad_norm": 1.801152229309082,
+ "learning_rate": 1.5111111111111112e-05,
+ "loss": 1.161649227142334,
+ "mean_token_accuracy": 0.705483615398407,
+ "num_tokens": 5963776.0,
+ "step": 364
+ },
+ {
+ "entropy": 1.2495859861373901,
+ "epoch": 0.7373737373737373,
+ "grad_norm": 1.8535690307617188,
+ "learning_rate": 1.50976430976431e-05,
+ "loss": 1.2595994472503662,
+ "mean_token_accuracy": 0.6926599740982056,
+ "num_tokens": 5980160.0,
+ "step": 365
+ },
+ {
+ "entropy": 1.8037965297698975,
+ "epoch": 0.7393939393939394,
+ "grad_norm": 2.0506303310394287,
+ "learning_rate": 1.5084175084175085e-05,
+ "loss": 1.8499953746795654,
+ "mean_token_accuracy": 0.5861626863479614,
+ "num_tokens": 5996544.0,
+ "step": 366
+ },
+ {
+ "entropy": 1.2877405881881714,
+ "epoch": 0.7414141414141414,
+ "grad_norm": 1.8159914016723633,
+ "learning_rate": 1.5070707070707072e-05,
+ "loss": 1.3165576457977295,
+ "mean_token_accuracy": 0.685271143913269,
+ "num_tokens": 6012928.0,
+ "step": 367
+ },
+ {
+ "entropy": 1.345953106880188,
+ "epoch": 0.7434343434343434,
+ "grad_norm": 2.003962516784668,
+ "learning_rate": 1.505723905723906e-05,
+ "loss": 1.3270621299743652,
+ "mean_token_accuracy": 0.6671348214149475,
+ "num_tokens": 6029312.0,
+ "step": 368
+ },
+ {
+ "entropy": 1.408361792564392,
+ "epoch": 0.7454545454545455,
+ "grad_norm": 1.9815948009490967,
+ "learning_rate": 1.5043771043771045e-05,
+ "loss": 1.4097518920898438,
+ "mean_token_accuracy": 0.652662456035614,
+ "num_tokens": 6045696.0,
+ "step": 369
+ },
+ {
+ "entropy": 1.4007829427719116,
+ "epoch": 0.7474747474747475,
+ "grad_norm": 1.928751826286316,
+ "learning_rate": 1.5030303030303031e-05,
+ "loss": 1.4142816066741943,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 6062080.0,
+ "step": 370
+ },
+ {
+ "entropy": 1.7548134326934814,
+ "epoch": 0.7494949494949495,
+ "grad_norm": 2.081939458847046,
+ "learning_rate": 1.5016835016835018e-05,
+ "loss": 1.792219877243042,
+ "mean_token_accuracy": 0.6044821739196777,
+ "num_tokens": 6078464.0,
+ "step": 371
+ },
+ {
+ "entropy": 1.6162793636322021,
+ "epoch": 0.7515151515151515,
+ "grad_norm": 1.8544763326644897,
+ "learning_rate": 1.5003367003367004e-05,
+ "loss": 1.650557041168213,
+ "mean_token_accuracy": 0.6289692521095276,
+ "num_tokens": 6094848.0,
+ "step": 372
+ },
+ {
+ "entropy": 1.6329439878463745,
+ "epoch": 0.7535353535353535,
+ "grad_norm": 1.8025282621383667,
+ "learning_rate": 1.4989898989898992e-05,
+ "loss": 1.6812629699707031,
+ "mean_token_accuracy": 0.6405104994773865,
+ "num_tokens": 6111232.0,
+ "step": 373
+ },
+ {
+ "entropy": 1.2201604843139648,
+ "epoch": 0.7555555555555555,
+ "grad_norm": 1.9814586639404297,
+ "learning_rate": 1.4976430976430977e-05,
+ "loss": 1.2086223363876343,
+ "mean_token_accuracy": 0.7020029425621033,
+ "num_tokens": 6127616.0,
+ "step": 374
+ },
+ {
+ "entropy": 1.8105695247650146,
+ "epoch": 0.7575757575757576,
+ "grad_norm": 2.0217790603637695,
+ "learning_rate": 1.4962962962962964e-05,
+ "loss": 1.8443559408187866,
+ "mean_token_accuracy": 0.5897654891014099,
+ "num_tokens": 6144000.0,
+ "step": 375
+ },
+ {
+ "entropy": 1.197646141052246,
+ "epoch": 0.7595959595959596,
+ "grad_norm": 1.9286304712295532,
+ "learning_rate": 1.4949494949494952e-05,
+ "loss": 1.2183899879455566,
+ "mean_token_accuracy": 0.6925989389419556,
+ "num_tokens": 6160384.0,
+ "step": 376
+ },
+ {
+ "entropy": 1.4825936555862427,
+ "epoch": 0.7616161616161616,
+ "grad_norm": 1.6694327592849731,
+ "learning_rate": 1.4936026936026937e-05,
+ "loss": 1.4815235137939453,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 6176768.0,
+ "step": 377
+ },
+ {
+ "entropy": 1.3497473001480103,
+ "epoch": 0.7636363636363637,
+ "grad_norm": 2.0366406440734863,
+ "learning_rate": 1.4922558922558923e-05,
+ "loss": 1.3637127876281738,
+ "mean_token_accuracy": 0.6690889000892639,
+ "num_tokens": 6193152.0,
+ "step": 378
+ },
+ {
+ "entropy": 1.314116358757019,
+ "epoch": 0.7656565656565657,
+ "grad_norm": 1.742874026298523,
+ "learning_rate": 1.4909090909090911e-05,
+ "loss": 1.300222396850586,
+ "mean_token_accuracy": 0.6977283954620361,
+ "num_tokens": 6209536.0,
+ "step": 379
+ },
+ {
+ "entropy": 1.4347912073135376,
+ "epoch": 0.7676767676767676,
+ "grad_norm": 1.9317418336868286,
+ "learning_rate": 1.4895622895622896e-05,
+ "loss": 1.429826021194458,
+ "mean_token_accuracy": 0.6650586128234863,
+ "num_tokens": 6225920.0,
+ "step": 380
+ },
+ {
+ "entropy": 1.448641061782837,
+ "epoch": 0.7696969696969697,
+ "grad_norm": 1.8417843580245972,
+ "learning_rate": 1.4882154882154884e-05,
+ "loss": 1.4439187049865723,
+ "mean_token_accuracy": 0.6615168452262878,
+ "num_tokens": 6242304.0,
+ "step": 381
+ },
+ {
+ "entropy": 1.2918578386306763,
+ "epoch": 0.7717171717171717,
+ "grad_norm": 1.8720030784606934,
+ "learning_rate": 1.486868686868687e-05,
+ "loss": 1.3158597946166992,
+ "mean_token_accuracy": 0.6865534782409668,
+ "num_tokens": 6258688.0,
+ "step": 382
+ },
+ {
+ "entropy": 1.5822116136550903,
+ "epoch": 0.7737373737373737,
+ "grad_norm": 1.9301713705062866,
+ "learning_rate": 1.4855218855218856e-05,
+ "loss": 1.6046046018600464,
+ "mean_token_accuracy": 0.6361138224601746,
+ "num_tokens": 6275072.0,
+ "step": 383
+ },
+ {
+ "entropy": 1.6837408542633057,
+ "epoch": 0.7757575757575758,
+ "grad_norm": 2.270636796951294,
+ "learning_rate": 1.4841750841750844e-05,
+ "loss": 1.7323150634765625,
+ "mean_token_accuracy": 0.6006350517272949,
+ "num_tokens": 6291456.0,
+ "step": 384
+ },
+ {
+ "entropy": 1.4837889671325684,
+ "epoch": 0.7777777777777778,
+ "grad_norm": 1.908146619796753,
+ "learning_rate": 1.482828282828283e-05,
+ "loss": 1.4938652515411377,
+ "mean_token_accuracy": 0.64667809009552,
+ "num_tokens": 6307840.0,
+ "step": 385
+ },
+ {
+ "entropy": 1.680192232131958,
+ "epoch": 0.7797979797979798,
+ "grad_norm": 2.2369024753570557,
+ "learning_rate": 1.4814814814814815e-05,
+ "loss": 1.692443609237671,
+ "mean_token_accuracy": 0.6279922127723694,
+ "num_tokens": 6324224.0,
+ "step": 386
+ },
+ {
+ "entropy": 1.686415195465088,
+ "epoch": 0.7818181818181819,
+ "grad_norm": 1.8252373933792114,
+ "learning_rate": 1.4801346801346803e-05,
+ "loss": 1.7022712230682373,
+ "mean_token_accuracy": 0.6302515864372253,
+ "num_tokens": 6340608.0,
+ "step": 387
+ },
+ {
+ "entropy": 1.6967185735702515,
+ "epoch": 0.7838383838383839,
+ "grad_norm": 2.102458953857422,
+ "learning_rate": 1.478787878787879e-05,
+ "loss": 1.6931922435760498,
+ "mean_token_accuracy": 0.6149853467941284,
+ "num_tokens": 6356992.0,
+ "step": 388
+ },
+ {
+ "entropy": 1.201438307762146,
+ "epoch": 0.7858585858585858,
+ "grad_norm": 1.8396239280700684,
+ "learning_rate": 1.4774410774410774e-05,
+ "loss": 1.2081820964813232,
+ "mean_token_accuracy": 0.6987664699554443,
+ "num_tokens": 6373376.0,
+ "step": 389
+ },
+ {
+ "entropy": 1.5559548139572144,
+ "epoch": 0.7878787878787878,
+ "grad_norm": 2.063498020172119,
+ "learning_rate": 1.4760942760942763e-05,
+ "loss": 1.545433759689331,
+ "mean_token_accuracy": 0.6267709136009216,
+ "num_tokens": 6389760.0,
+ "step": 390
+ },
+ {
+ "entropy": 1.7186503410339355,
+ "epoch": 0.7898989898989899,
+ "grad_norm": 2.0129787921905518,
+ "learning_rate": 1.4747474747474747e-05,
+ "loss": 1.717472791671753,
+ "mean_token_accuracy": 0.6540058851242065,
+ "num_tokens": 6406144.0,
+ "step": 391
+ },
+ {
+ "entropy": 1.643048882484436,
+ "epoch": 0.7919191919191919,
+ "grad_norm": 1.9443073272705078,
+ "learning_rate": 1.4734006734006736e-05,
+ "loss": 1.6441841125488281,
+ "mean_token_accuracy": 0.6458231806755066,
+ "num_tokens": 6422528.0,
+ "step": 392
+ },
+ {
+ "entropy": 1.3627581596374512,
+ "epoch": 0.793939393939394,
+ "grad_norm": 1.9852598905563354,
+ "learning_rate": 1.4720538720538722e-05,
+ "loss": 1.3558071851730347,
+ "mean_token_accuracy": 0.6720200181007385,
+ "num_tokens": 6438912.0,
+ "step": 393
+ },
+ {
+ "entropy": 0.8946540951728821,
+ "epoch": 0.795959595959596,
+ "grad_norm": 1.54441237449646,
+ "learning_rate": 1.4707070707070707e-05,
+ "loss": 0.8874151706695557,
+ "mean_token_accuracy": 0.7685027122497559,
+ "num_tokens": 6455296.0,
+ "step": 394
+ },
+ {
+ "entropy": 1.35861074924469,
+ "epoch": 0.797979797979798,
+ "grad_norm": 2.158553123474121,
+ "learning_rate": 1.4693602693602695e-05,
+ "loss": 1.4291828870773315,
+ "mean_token_accuracy": 0.6647533178329468,
+ "num_tokens": 6471680.0,
+ "step": 395
+ },
+ {
+ "entropy": 1.7047442197799683,
+ "epoch": 0.8,
+ "grad_norm": 2.1242175102233887,
+ "learning_rate": 1.4680134680134681e-05,
+ "loss": 1.7065966129302979,
+ "mean_token_accuracy": 0.6058256030082703,
+ "num_tokens": 6488064.0,
+ "step": 396
+ },
+ {
+ "entropy": 1.7153913974761963,
+ "epoch": 0.802020202020202,
+ "grad_norm": 1.9085419178009033,
+ "learning_rate": 1.4666666666666666e-05,
+ "loss": 1.7373592853546143,
+ "mean_token_accuracy": 0.6020395755767822,
+ "num_tokens": 6504448.0,
+ "step": 397
+ },
+ {
+ "entropy": 1.1062475442886353,
+ "epoch": 0.804040404040404,
+ "grad_norm": 1.9173986911773682,
+ "learning_rate": 1.4653198653198654e-05,
+ "loss": 1.0991405248641968,
+ "mean_token_accuracy": 0.7195896506309509,
+ "num_tokens": 6520832.0,
+ "step": 398
+ },
+ {
+ "entropy": 1.5717406272888184,
+ "epoch": 0.806060606060606,
+ "grad_norm": 2.0077219009399414,
+ "learning_rate": 1.4639730639730641e-05,
+ "loss": 1.595954418182373,
+ "mean_token_accuracy": 0.6270151734352112,
+ "num_tokens": 6537216.0,
+ "step": 399
+ },
+ {
+ "entropy": 1.3960795402526855,
+ "epoch": 0.8080808080808081,
+ "grad_norm": 2.2864415645599365,
+ "learning_rate": 1.4626262626262629e-05,
+ "loss": 1.416130781173706,
+ "mean_token_accuracy": 0.6631656289100647,
+ "num_tokens": 6553600.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.8080808080808081,
+ "eval_entropy": 1.510355769626556,
+ "eval_loss": 1.5199862718582153,
+ "eval_mean_token_accuracy": 0.6461201098657423,
+ "eval_num_tokens": 6553600.0,
+ "eval_runtime": 43.8634,
+ "eval_samples_per_second": 22.57,
+ "eval_steps_per_second": 2.827,
+ "step": 400
+ },
+ {
+ "entropy": 1.5662645101547241,
+ "epoch": 0.8101010101010101,
+ "grad_norm": 2.1806085109710693,
+ "learning_rate": 1.4612794612794614e-05,
+ "loss": 1.5763804912567139,
+ "mean_token_accuracy": 0.6330605745315552,
+ "num_tokens": 6569984.0,
+ "step": 401
+ },
+ {
+ "entropy": 1.4046087265014648,
+ "epoch": 0.8121212121212121,
+ "grad_norm": 1.9650650024414062,
+ "learning_rate": 1.45993265993266e-05,
+ "loss": 1.396510124206543,
+ "mean_token_accuracy": 0.6568148732185364,
+ "num_tokens": 6586368.0,
+ "step": 402
+ },
+ {
+ "entropy": 1.084455966949463,
+ "epoch": 0.8141414141414142,
+ "grad_norm": 1.926537275314331,
+ "learning_rate": 1.4585858585858587e-05,
+ "loss": 1.096333622932434,
+ "mean_token_accuracy": 0.7233145833015442,
+ "num_tokens": 6602752.0,
+ "step": 403
+ },
+ {
+ "entropy": 1.379700779914856,
+ "epoch": 0.8161616161616162,
+ "grad_norm": 1.957202672958374,
+ "learning_rate": 1.4572390572390573e-05,
+ "loss": 1.4035027027130127,
+ "mean_token_accuracy": 0.674462616443634,
+ "num_tokens": 6619136.0,
+ "step": 404
+ },
+ {
+ "entropy": 1.3775221109390259,
+ "epoch": 0.8181818181818182,
+ "grad_norm": 1.9095491170883179,
+ "learning_rate": 1.455892255892256e-05,
+ "loss": 1.3915553092956543,
+ "mean_token_accuracy": 0.6811187267303467,
+ "num_tokens": 6635520.0,
+ "step": 405
+ },
+ {
+ "entropy": 1.4745222330093384,
+ "epoch": 0.8202020202020202,
+ "grad_norm": 2.0017123222351074,
+ "learning_rate": 1.4545454545454546e-05,
+ "loss": 1.4845868349075317,
+ "mean_token_accuracy": 0.6557767391204834,
+ "num_tokens": 6651904.0,
+ "step": 406
+ },
+ {
+ "entropy": 1.5129855871200562,
+ "epoch": 0.8222222222222222,
+ "grad_norm": 2.127979040145874,
+ "learning_rate": 1.4531986531986533e-05,
+ "loss": 1.5081605911254883,
+ "mean_token_accuracy": 0.6425256729125977,
+ "num_tokens": 6668288.0,
+ "step": 407
+ },
+ {
+ "entropy": 1.1438099145889282,
+ "epoch": 0.8242424242424242,
+ "grad_norm": 1.7389986515045166,
+ "learning_rate": 1.4518518518518521e-05,
+ "loss": 1.1446681022644043,
+ "mean_token_accuracy": 0.7180629968643188,
+ "num_tokens": 6684672.0,
+ "step": 408
+ },
+ {
+ "entropy": 1.448157787322998,
+ "epoch": 0.8262626262626263,
+ "grad_norm": 1.8483424186706543,
+ "learning_rate": 1.4505050505050506e-05,
+ "loss": 1.4317030906677246,
+ "mean_token_accuracy": 0.6659746170043945,
+ "num_tokens": 6701056.0,
+ "step": 409
+ },
+ {
+ "entropy": 1.419940710067749,
+ "epoch": 0.8282828282828283,
+ "grad_norm": 1.961125135421753,
+ "learning_rate": 1.4491582491582492e-05,
+ "loss": 1.42207670211792,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 6717440.0,
+ "step": 410
+ },
+ {
+ "entropy": 1.5707522630691528,
+ "epoch": 0.8303030303030303,
+ "grad_norm": 2.0862255096435547,
+ "learning_rate": 1.447811447811448e-05,
+ "loss": 1.5721523761749268,
+ "mean_token_accuracy": 0.6305569410324097,
+ "num_tokens": 6733824.0,
+ "step": 411
+ },
+ {
+ "entropy": 1.4308481216430664,
+ "epoch": 0.8323232323232324,
+ "grad_norm": 2.1505820751190186,
+ "learning_rate": 1.4464646464646465e-05,
+ "loss": 1.4522666931152344,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 6750208.0,
+ "step": 412
+ },
+ {
+ "entropy": 1.7424806356430054,
+ "epoch": 0.8343434343434344,
+ "grad_norm": 2.1787710189819336,
+ "learning_rate": 1.4451178451178452e-05,
+ "loss": 1.7719662189483643,
+ "mean_token_accuracy": 0.5897654891014099,
+ "num_tokens": 6766592.0,
+ "step": 413
+ },
+ {
+ "entropy": 1.9777010679244995,
+ "epoch": 0.8363636363636363,
+ "grad_norm": 2.1178369522094727,
+ "learning_rate": 1.443771043771044e-05,
+ "loss": 1.9885730743408203,
+ "mean_token_accuracy": 0.5628358721733093,
+ "num_tokens": 6782976.0,
+ "step": 414
+ },
+ {
+ "entropy": 1.701235055923462,
+ "epoch": 0.8383838383838383,
+ "grad_norm": 1.9038937091827393,
+ "learning_rate": 1.4424242424242425e-05,
+ "loss": 1.6970818042755127,
+ "mean_token_accuracy": 0.6209086179733276,
+ "num_tokens": 6799360.0,
+ "step": 415
+ },
+ {
+ "entropy": 1.5118876695632935,
+ "epoch": 0.8404040404040404,
+ "grad_norm": 1.8924365043640137,
+ "learning_rate": 1.4410774410774413e-05,
+ "loss": 1.5288946628570557,
+ "mean_token_accuracy": 0.6480215191841125,
+ "num_tokens": 6815744.0,
+ "step": 416
+ },
+ {
+ "entropy": 1.5526877641677856,
+ "epoch": 0.8424242424242424,
+ "grad_norm": 2.109499216079712,
+ "learning_rate": 1.43973063973064e-05,
+ "loss": 1.5581820011138916,
+ "mean_token_accuracy": 0.6351978778839111,
+ "num_tokens": 6832128.0,
+ "step": 417
+ },
+ {
+ "entropy": 1.8132506608963013,
+ "epoch": 0.8444444444444444,
+ "grad_norm": 2.0389890670776367,
+ "learning_rate": 1.4383838383838384e-05,
+ "loss": 1.8378231525421143,
+ "mean_token_accuracy": 0.592391312122345,
+ "num_tokens": 6848512.0,
+ "step": 418
+ },
+ {
+ "entropy": 1.3766752481460571,
+ "epoch": 0.8464646464646465,
+ "grad_norm": 1.8586320877075195,
+ "learning_rate": 1.4370370370370372e-05,
+ "loss": 1.3741214275360107,
+ "mean_token_accuracy": 0.6796531677246094,
+ "num_tokens": 6864896.0,
+ "step": 419
+ },
+ {
+ "entropy": 1.1854407787322998,
+ "epoch": 0.8484848484848485,
+ "grad_norm": 1.875899314880371,
+ "learning_rate": 1.4356902356902359e-05,
+ "loss": 1.2393877506256104,
+ "mean_token_accuracy": 0.704323410987854,
+ "num_tokens": 6881280.0,
+ "step": 420
+ },
+ {
+ "entropy": 1.498558759689331,
+ "epoch": 0.8505050505050505,
+ "grad_norm": 1.898848295211792,
+ "learning_rate": 1.4343434343434344e-05,
+ "loss": 1.4963322877883911,
+ "mean_token_accuracy": 0.6542501449584961,
+ "num_tokens": 6897664.0,
+ "step": 421
+ },
+ {
+ "entropy": 1.5070384740829468,
+ "epoch": 0.8525252525252526,
+ "grad_norm": 2.095853090286255,
+ "learning_rate": 1.4329966329966332e-05,
+ "loss": 1.5026702880859375,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 6914048.0,
+ "step": 422
+ },
+ {
+ "entropy": 1.7848025560379028,
+ "epoch": 0.8545454545454545,
+ "grad_norm": 1.9265769720077515,
+ "learning_rate": 1.4316498316498317e-05,
+ "loss": 1.8066134452819824,
+ "mean_token_accuracy": 0.5936736464500427,
+ "num_tokens": 6930432.0,
+ "step": 423
+ },
+ {
+ "entropy": 1.4278018474578857,
+ "epoch": 0.8565656565656565,
+ "grad_norm": 1.900985836982727,
+ "learning_rate": 1.4303030303030305e-05,
+ "loss": 1.4045631885528564,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 6946816.0,
+ "step": 424
+ },
+ {
+ "entropy": 1.728216290473938,
+ "epoch": 0.8585858585858586,
+ "grad_norm": 1.952841877937317,
+ "learning_rate": 1.4289562289562291e-05,
+ "loss": 1.728804349899292,
+ "mean_token_accuracy": 0.613031268119812,
+ "num_tokens": 6963200.0,
+ "step": 425
+ },
+ {
+ "entropy": 1.6632241010665894,
+ "epoch": 0.8606060606060606,
+ "grad_norm": 2.187973737716675,
+ "learning_rate": 1.4276094276094276e-05,
+ "loss": 1.6703932285308838,
+ "mean_token_accuracy": 0.6150463819503784,
+ "num_tokens": 6979584.0,
+ "step": 426
+ },
+ {
+ "entropy": 1.761826992034912,
+ "epoch": 0.8626262626262626,
+ "grad_norm": 2.203636646270752,
+ "learning_rate": 1.4262626262626264e-05,
+ "loss": 1.727257490158081,
+ "mean_token_accuracy": 0.5861626863479614,
+ "num_tokens": 6995968.0,
+ "step": 427
+ },
+ {
+ "entropy": 1.4528838396072388,
+ "epoch": 0.8646464646464647,
+ "grad_norm": 1.7967053651809692,
+ "learning_rate": 1.424915824915825e-05,
+ "loss": 1.4786958694458008,
+ "mean_token_accuracy": 0.6589521169662476,
+ "num_tokens": 7012352.0,
+ "step": 428
+ },
+ {
+ "entropy": 1.2221835851669312,
+ "epoch": 0.8666666666666667,
+ "grad_norm": 1.8118345737457275,
+ "learning_rate": 1.4235690235690235e-05,
+ "loss": 1.247727632522583,
+ "mean_token_accuracy": 0.7024303674697876,
+ "num_tokens": 7028736.0,
+ "step": 429
+ },
+ {
+ "entropy": 1.5066863298416138,
+ "epoch": 0.8686868686868687,
+ "grad_norm": 1.8390358686447144,
+ "learning_rate": 1.4222222222222224e-05,
+ "loss": 1.5283207893371582,
+ "mean_token_accuracy": 0.6553493142127991,
+ "num_tokens": 7045120.0,
+ "step": 430
+ },
+ {
+ "entropy": 1.346379041671753,
+ "epoch": 0.8707070707070707,
+ "grad_norm": 2.070962905883789,
+ "learning_rate": 1.420875420875421e-05,
+ "loss": 1.386117935180664,
+ "mean_token_accuracy": 0.6690889000892639,
+ "num_tokens": 7061504.0,
+ "step": 431
+ },
+ {
+ "entropy": 1.8691747188568115,
+ "epoch": 0.8727272727272727,
+ "grad_norm": 1.7868962287902832,
+ "learning_rate": 1.4195286195286198e-05,
+ "loss": 1.9285637140274048,
+ "mean_token_accuracy": 0.5680874586105347,
+ "num_tokens": 7077888.0,
+ "step": 432
+ },
+ {
+ "entropy": 1.8500115871429443,
+ "epoch": 0.8747474747474747,
+ "grad_norm": 1.8853468894958496,
+ "learning_rate": 1.4181818181818183e-05,
+ "loss": 1.8733386993408203,
+ "mean_token_accuracy": 0.5956888198852539,
+ "num_tokens": 7094272.0,
+ "step": 433
+ },
+ {
+ "entropy": 1.3737305402755737,
+ "epoch": 0.8767676767676768,
+ "grad_norm": 1.8363661766052246,
+ "learning_rate": 1.416835016835017e-05,
+ "loss": 1.4020421504974365,
+ "mean_token_accuracy": 0.6723253726959229,
+ "num_tokens": 7110656.0,
+ "step": 434
+ },
+ {
+ "entropy": 1.5069265365600586,
+ "epoch": 0.8787878787878788,
+ "grad_norm": 2.1154301166534424,
+ "learning_rate": 1.4154882154882156e-05,
+ "loss": 1.5137630701065063,
+ "mean_token_accuracy": 0.628724992275238,
+ "num_tokens": 7127040.0,
+ "step": 435
+ },
+ {
+ "entropy": 1.6280715465545654,
+ "epoch": 0.8808080808080808,
+ "grad_norm": 1.9827117919921875,
+ "learning_rate": 1.4141414141414143e-05,
+ "loss": 1.6629055738449097,
+ "mean_token_accuracy": 0.6300684213638306,
+ "num_tokens": 7143424.0,
+ "step": 436
+ },
+ {
+ "entropy": 1.0767987966537476,
+ "epoch": 0.8828282828282829,
+ "grad_norm": 1.8503392934799194,
+ "learning_rate": 1.4127946127946129e-05,
+ "loss": 1.0964105129241943,
+ "mean_token_accuracy": 0.7118954658508301,
+ "num_tokens": 7159808.0,
+ "step": 437
+ },
+ {
+ "entropy": 1.6979929208755493,
+ "epoch": 0.8848484848484849,
+ "grad_norm": 2.114170551300049,
+ "learning_rate": 1.4114478114478116e-05,
+ "loss": 1.7339307069778442,
+ "mean_token_accuracy": 0.6071690320968628,
+ "num_tokens": 7176192.0,
+ "step": 438
+ },
+ {
+ "entropy": 1.840633511543274,
+ "epoch": 0.8868686868686869,
+ "grad_norm": 2.1661946773529053,
+ "learning_rate": 1.4101010101010102e-05,
+ "loss": 1.866344690322876,
+ "mean_token_accuracy": 0.5988031029701233,
+ "num_tokens": 7192576.0,
+ "step": 439
+ },
+ {
+ "entropy": 1.8278590440750122,
+ "epoch": 0.8888888888888888,
+ "grad_norm": 1.9278390407562256,
+ "learning_rate": 1.4087542087542087e-05,
+ "loss": 1.81584632396698,
+ "mean_token_accuracy": 0.5878114104270935,
+ "num_tokens": 7208960.0,
+ "step": 440
+ },
+ {
+ "entropy": 1.405017375946045,
+ "epoch": 0.8909090909090909,
+ "grad_norm": 1.9446384906768799,
+ "learning_rate": 1.4074074074074075e-05,
+ "loss": 1.4040675163269043,
+ "mean_token_accuracy": 0.6647533178329468,
+ "num_tokens": 7225344.0,
+ "step": 441
+ },
+ {
+ "entropy": 1.0967023372650146,
+ "epoch": 0.8929292929292929,
+ "grad_norm": 1.8880785703659058,
+ "learning_rate": 1.4060606060606061e-05,
+ "loss": 1.0798790454864502,
+ "mean_token_accuracy": 0.7167806625366211,
+ "num_tokens": 7241728.0,
+ "step": 442
+ },
+ {
+ "entropy": 1.6126327514648438,
+ "epoch": 0.8949494949494949,
+ "grad_norm": 2.2159016132354736,
+ "learning_rate": 1.404713804713805e-05,
+ "loss": 1.620417833328247,
+ "mean_token_accuracy": 0.6215192675590515,
+ "num_tokens": 7258112.0,
+ "step": 443
+ },
+ {
+ "entropy": 1.4352757930755615,
+ "epoch": 0.896969696969697,
+ "grad_norm": 2.070910692214966,
+ "learning_rate": 1.4033670033670034e-05,
+ "loss": 1.409663200378418,
+ "mean_token_accuracy": 0.658646821975708,
+ "num_tokens": 7274496.0,
+ "step": 444
+ },
+ {
+ "entropy": 1.350129246711731,
+ "epoch": 0.898989898989899,
+ "grad_norm": 1.8672778606414795,
+ "learning_rate": 1.4020202020202021e-05,
+ "loss": 1.3485581874847412,
+ "mean_token_accuracy": 0.6743404865264893,
+ "num_tokens": 7290880.0,
+ "step": 445
+ },
+ {
+ "entropy": 1.0900049209594727,
+ "epoch": 0.901010101010101,
+ "grad_norm": 1.8460185527801514,
+ "learning_rate": 1.4006734006734009e-05,
+ "loss": 1.074802279472351,
+ "mean_token_accuracy": 0.727161705493927,
+ "num_tokens": 7307264.0,
+ "step": 446
+ },
+ {
+ "entropy": 1.6430293321609497,
+ "epoch": 0.9030303030303031,
+ "grad_norm": 2.0190517902374268,
+ "learning_rate": 1.3993265993265994e-05,
+ "loss": 1.6505115032196045,
+ "mean_token_accuracy": 0.6073521971702576,
+ "num_tokens": 7323648.0,
+ "step": 447
+ },
+ {
+ "entropy": 1.465686559677124,
+ "epoch": 0.9050505050505051,
+ "grad_norm": 2.0139927864074707,
+ "learning_rate": 1.397979797979798e-05,
+ "loss": 1.480743408203125,
+ "mean_token_accuracy": 0.6593796014785767,
+ "num_tokens": 7340032.0,
+ "step": 448
+ },
+ {
+ "entropy": 2.152183771133423,
+ "epoch": 0.907070707070707,
+ "grad_norm": 2.2376039028167725,
+ "learning_rate": 1.3966329966329969e-05,
+ "loss": 2.117891788482666,
+ "mean_token_accuracy": 0.5404250025749207,
+ "num_tokens": 7356416.0,
+ "step": 449
+ },
+ {
+ "entropy": 1.6066724061965942,
+ "epoch": 0.9090909090909091,
+ "grad_norm": 1.895409107208252,
+ "learning_rate": 1.3952861952861953e-05,
+ "loss": 1.6247167587280273,
+ "mean_token_accuracy": 0.6281143426895142,
+ "num_tokens": 7372800.0,
+ "step": 450
+ },
+ {
+ "entropy": 1.7240369319915771,
+ "epoch": 0.9111111111111111,
+ "grad_norm": 1.9780583381652832,
+ "learning_rate": 1.3939393939393942e-05,
+ "loss": 1.7521916627883911,
+ "mean_token_accuracy": 0.6022838354110718,
+ "num_tokens": 7389184.0,
+ "step": 451
+ },
+ {
+ "entropy": 1.168492317199707,
+ "epoch": 0.9131313131313131,
+ "grad_norm": 1.676292896270752,
+ "learning_rate": 1.3925925925925928e-05,
+ "loss": 1.1678345203399658,
+ "mean_token_accuracy": 0.7136663198471069,
+ "num_tokens": 7405568.0,
+ "step": 452
+ },
+ {
+ "entropy": 1.4993922710418701,
+ "epoch": 0.9151515151515152,
+ "grad_norm": 2.051370620727539,
+ "learning_rate": 1.3912457912457913e-05,
+ "loss": 1.5273159742355347,
+ "mean_token_accuracy": 0.6378847360610962,
+ "num_tokens": 7421952.0,
+ "step": 453
+ },
+ {
+ "entropy": 1.3478108644485474,
+ "epoch": 0.9171717171717172,
+ "grad_norm": 1.9196240901947021,
+ "learning_rate": 1.3898989898989901e-05,
+ "loss": 1.3547455072402954,
+ "mean_token_accuracy": 0.666829526424408,
+ "num_tokens": 7438336.0,
+ "step": 454
+ },
+ {
+ "entropy": 1.1411141157150269,
+ "epoch": 0.9191919191919192,
+ "grad_norm": 1.9581170082092285,
+ "learning_rate": 1.3885521885521886e-05,
+ "loss": 1.1604664325714111,
+ "mean_token_accuracy": 0.7018197178840637,
+ "num_tokens": 7454720.0,
+ "step": 455
+ },
+ {
+ "entropy": 1.1814258098602295,
+ "epoch": 0.9212121212121213,
+ "grad_norm": 2.005451202392578,
+ "learning_rate": 1.3872053872053872e-05,
+ "loss": 1.1768745183944702,
+ "mean_token_accuracy": 0.7044455409049988,
+ "num_tokens": 7471104.0,
+ "step": 456
+ },
+ {
+ "entropy": 1.335093379020691,
+ "epoch": 0.9232323232323232,
+ "grad_norm": 1.928747534751892,
+ "learning_rate": 1.385858585858586e-05,
+ "loss": 1.3504598140716553,
+ "mean_token_accuracy": 0.6774548292160034,
+ "num_tokens": 7487488.0,
+ "step": 457
+ },
+ {
+ "entropy": 1.6866769790649414,
+ "epoch": 0.9252525252525252,
+ "grad_norm": 1.9078223705291748,
+ "learning_rate": 1.3845117845117845e-05,
+ "loss": 1.688689947128296,
+ "mean_token_accuracy": 0.6077796816825867,
+ "num_tokens": 7503872.0,
+ "step": 458
+ },
+ {
+ "entropy": 1.2842025756835938,
+ "epoch": 0.9272727272727272,
+ "grad_norm": 1.909472942352295,
+ "learning_rate": 1.3831649831649833e-05,
+ "loss": 1.3128941059112549,
+ "mean_token_accuracy": 0.6872252225875854,
+ "num_tokens": 7520256.0,
+ "step": 459
+ },
+ {
+ "entropy": 1.7797539234161377,
+ "epoch": 0.9292929292929293,
+ "grad_norm": 2.246411085128784,
+ "learning_rate": 1.381818181818182e-05,
+ "loss": 1.8016175031661987,
+ "mean_token_accuracy": 0.6049095988273621,
+ "num_tokens": 7536640.0,
+ "step": 460
+ },
+ {
+ "entropy": 1.3464831113815308,
+ "epoch": 0.9313131313131313,
+ "grad_norm": 1.9999858140945435,
+ "learning_rate": 1.3804713804713805e-05,
+ "loss": 1.3523657321929932,
+ "mean_token_accuracy": 0.6787371635437012,
+ "num_tokens": 7553024.0,
+ "step": 461
+ },
+ {
+ "entropy": 1.5901066064834595,
+ "epoch": 0.9333333333333333,
+ "grad_norm": 1.9632524251937866,
+ "learning_rate": 1.3791245791245793e-05,
+ "loss": 1.596254587173462,
+ "mean_token_accuracy": 0.6428309679031372,
+ "num_tokens": 7569408.0,
+ "step": 462
+ },
+ {
+ "entropy": 1.2511993646621704,
+ "epoch": 0.9353535353535354,
+ "grad_norm": 1.7678464651107788,
+ "learning_rate": 1.377777777777778e-05,
+ "loss": 1.254664659500122,
+ "mean_token_accuracy": 0.6981558203697205,
+ "num_tokens": 7585792.0,
+ "step": 463
+ },
+ {
+ "entropy": 1.546912431716919,
+ "epoch": 0.9373737373737374,
+ "grad_norm": 2.0353212356567383,
+ "learning_rate": 1.3764309764309764e-05,
+ "loss": 1.54923677444458,
+ "mean_token_accuracy": 0.6403273344039917,
+ "num_tokens": 7602176.0,
+ "step": 464
+ },
+ {
+ "entropy": 1.6535273790359497,
+ "epoch": 0.9393939393939394,
+ "grad_norm": 2.1584854125976562,
+ "learning_rate": 1.3750841750841752e-05,
+ "loss": 1.6464964151382446,
+ "mean_token_accuracy": 0.6218246221542358,
+ "num_tokens": 7618560.0,
+ "step": 465
+ },
+ {
+ "entropy": 1.1885185241699219,
+ "epoch": 0.9414141414141414,
+ "grad_norm": 1.8068963289260864,
+ "learning_rate": 1.3737373737373739e-05,
+ "loss": 1.1980109214782715,
+ "mean_token_accuracy": 0.6990718245506287,
+ "num_tokens": 7634944.0,
+ "step": 466
+ },
+ {
+ "entropy": 1.2306157350540161,
+ "epoch": 0.9434343434343434,
+ "grad_norm": 1.9044586420059204,
+ "learning_rate": 1.3723905723905725e-05,
+ "loss": 1.2291686534881592,
+ "mean_token_accuracy": 0.6996824741363525,
+ "num_tokens": 7651328.0,
+ "step": 467
+ },
+ {
+ "entropy": 1.2496092319488525,
+ "epoch": 0.9454545454545454,
+ "grad_norm": 1.7264868021011353,
+ "learning_rate": 1.3710437710437712e-05,
+ "loss": 1.2440049648284912,
+ "mean_token_accuracy": 0.6877137422561646,
+ "num_tokens": 7667712.0,
+ "step": 468
+ },
+ {
+ "entropy": 1.8231102228164673,
+ "epoch": 0.9474747474747475,
+ "grad_norm": 2.099104166030884,
+ "learning_rate": 1.3696969696969698e-05,
+ "loss": 1.84971284866333,
+ "mean_token_accuracy": 0.5869565010070801,
+ "num_tokens": 7684096.0,
+ "step": 469
+ },
+ {
+ "entropy": 1.537786841392517,
+ "epoch": 0.9494949494949495,
+ "grad_norm": 1.872962474822998,
+ "learning_rate": 1.3683501683501685e-05,
+ "loss": 1.5448193550109863,
+ "mean_token_accuracy": 0.6465559601783752,
+ "num_tokens": 7700480.0,
+ "step": 470
+ },
+ {
+ "entropy": 1.8270875215530396,
+ "epoch": 0.9515151515151515,
+ "grad_norm": 2.2747695446014404,
+ "learning_rate": 1.3670033670033671e-05,
+ "loss": 1.854095697402954,
+ "mean_token_accuracy": 0.5834758281707764,
+ "num_tokens": 7716864.0,
+ "step": 471
+ },
+ {
+ "entropy": 1.505604863166809,
+ "epoch": 0.9535353535353536,
+ "grad_norm": 1.9903687238693237,
+ "learning_rate": 1.3656565656565656e-05,
+ "loss": 1.5269451141357422,
+ "mean_token_accuracy": 0.6475940346717834,
+ "num_tokens": 7733248.0,
+ "step": 472
+ },
+ {
+ "entropy": 1.8228932619094849,
+ "epoch": 0.9555555555555556,
+ "grad_norm": 2.4003078937530518,
+ "learning_rate": 1.3643097643097644e-05,
+ "loss": 1.846016764640808,
+ "mean_token_accuracy": 0.5900097489356995,
+ "num_tokens": 7749632.0,
+ "step": 473
+ },
+ {
+ "entropy": 1.2786308526992798,
+ "epoch": 0.9575757575757575,
+ "grad_norm": 1.9355131387710571,
+ "learning_rate": 1.362962962962963e-05,
+ "loss": 1.3152062892913818,
+ "mean_token_accuracy": 0.6703712940216064,
+ "num_tokens": 7766016.0,
+ "step": 474
+ },
+ {
+ "entropy": 1.1032856702804565,
+ "epoch": 0.9595959595959596,
+ "grad_norm": 1.7720186710357666,
+ "learning_rate": 1.3616161616161619e-05,
+ "loss": 1.1242918968200684,
+ "mean_token_accuracy": 0.7250854969024658,
+ "num_tokens": 7782400.0,
+ "step": 475
+ },
+ {
+ "entropy": 1.5261021852493286,
+ "epoch": 0.9616161616161616,
+ "grad_norm": 1.8472843170166016,
+ "learning_rate": 1.3602693602693604e-05,
+ "loss": 1.54013991355896,
+ "mean_token_accuracy": 0.6471055150032043,
+ "num_tokens": 7798784.0,
+ "step": 476
+ },
+ {
+ "entropy": 0.9697252511978149,
+ "epoch": 0.9636363636363636,
+ "grad_norm": 1.8871296644210815,
+ "learning_rate": 1.358922558922559e-05,
+ "loss": 0.9874091148376465,
+ "mean_token_accuracy": 0.7430996298789978,
+ "num_tokens": 7815168.0,
+ "step": 477
+ },
+ {
+ "entropy": 1.6003227233886719,
+ "epoch": 0.9656565656565657,
+ "grad_norm": 2.371385097503662,
+ "learning_rate": 1.3575757575757578e-05,
+ "loss": 1.580587387084961,
+ "mean_token_accuracy": 0.6273815631866455,
+ "num_tokens": 7831552.0,
+ "step": 478
+ },
+ {
+ "entropy": 1.556900978088379,
+ "epoch": 0.9676767676767677,
+ "grad_norm": 1.839432954788208,
+ "learning_rate": 1.3562289562289563e-05,
+ "loss": 1.5154083967208862,
+ "mean_token_accuracy": 0.628724992275238,
+ "num_tokens": 7847936.0,
+ "step": 479
+ },
+ {
+ "entropy": 1.2394448518753052,
+ "epoch": 0.9696969696969697,
+ "grad_norm": 1.6638867855072021,
+ "learning_rate": 1.354882154882155e-05,
+ "loss": 1.2016921043395996,
+ "mean_token_accuracy": 0.6991939544677734,
+ "num_tokens": 7864320.0,
+ "step": 480
+ },
+ {
+ "entropy": 1.4200247526168823,
+ "epoch": 0.9717171717171718,
+ "grad_norm": 1.8742305040359497,
+ "learning_rate": 1.3535353535353538e-05,
+ "loss": 1.4267700910568237,
+ "mean_token_accuracy": 0.6604176759719849,
+ "num_tokens": 7880704.0,
+ "step": 481
+ },
+ {
+ "entropy": 2.0156707763671875,
+ "epoch": 0.9737373737373738,
+ "grad_norm": 2.1772451400756836,
+ "learning_rate": 1.3521885521885523e-05,
+ "loss": 2.0306758880615234,
+ "mean_token_accuracy": 0.5579506754875183,
+ "num_tokens": 7897088.0,
+ "step": 482
+ },
+ {
+ "entropy": 1.2802858352661133,
+ "epoch": 0.9757575757575757,
+ "grad_norm": 1.8951549530029297,
+ "learning_rate": 1.3508417508417509e-05,
+ "loss": 1.2761621475219727,
+ "mean_token_accuracy": 0.6825231909751892,
+ "num_tokens": 7913472.0,
+ "step": 483
+ },
+ {
+ "entropy": 1.3758989572525024,
+ "epoch": 0.9777777777777777,
+ "grad_norm": 1.8072963953018188,
+ "learning_rate": 1.3494949494949497e-05,
+ "loss": 1.3532235622406006,
+ "mean_token_accuracy": 0.6749511361122131,
+ "num_tokens": 7929856.0,
+ "step": 484
+ },
+ {
+ "entropy": 1.4488792419433594,
+ "epoch": 0.9797979797979798,
+ "grad_norm": 1.7842215299606323,
+ "learning_rate": 1.3481481481481482e-05,
+ "loss": 1.4513285160064697,
+ "mean_token_accuracy": 0.6539447903633118,
+ "num_tokens": 7946240.0,
+ "step": 485
+ },
+ {
+ "entropy": 1.2957613468170166,
+ "epoch": 0.9818181818181818,
+ "grad_norm": 1.8612068891525269,
+ "learning_rate": 1.346801346801347e-05,
+ "loss": 1.3016514778137207,
+ "mean_token_accuracy": 0.6848436594009399,
+ "num_tokens": 7962624.0,
+ "step": 486
+ },
+ {
+ "entropy": 1.4321255683898926,
+ "epoch": 0.9838383838383838,
+ "grad_norm": 1.7746661901474,
+ "learning_rate": 1.3454545454545455e-05,
+ "loss": 1.4230387210845947,
+ "mean_token_accuracy": 0.664692223072052,
+ "num_tokens": 7979008.0,
+ "step": 487
+ },
+ {
+ "entropy": 1.7615760564804077,
+ "epoch": 0.9858585858585859,
+ "grad_norm": 1.9986366033554077,
+ "learning_rate": 1.3441077441077441e-05,
+ "loss": 1.7871575355529785,
+ "mean_token_accuracy": 0.5994748473167419,
+ "num_tokens": 7995392.0,
+ "step": 488
+ },
+ {
+ "entropy": 1.349948763847351,
+ "epoch": 0.9878787878787879,
+ "grad_norm": 2.0217247009277344,
+ "learning_rate": 1.342760942760943e-05,
+ "loss": 1.352069616317749,
+ "mean_token_accuracy": 0.6762335300445557,
+ "num_tokens": 8011776.0,
+ "step": 489
+ },
+ {
+ "entropy": 1.6317073106765747,
+ "epoch": 0.98989898989899,
+ "grad_norm": 1.9479029178619385,
+ "learning_rate": 1.3414141414141414e-05,
+ "loss": 1.6507500410079956,
+ "mean_token_accuracy": 0.6186492443084717,
+ "num_tokens": 8028160.0,
+ "step": 490
+ },
+ {
+ "entropy": 2.0288875102996826,
+ "epoch": 0.9919191919191919,
+ "grad_norm": 2.1520888805389404,
+ "learning_rate": 1.3400673400673401e-05,
+ "loss": 2.06215500831604,
+ "mean_token_accuracy": 0.5530043840408325,
+ "num_tokens": 8044544.0,
+ "step": 491
+ },
+ {
+ "entropy": 1.8297137022018433,
+ "epoch": 0.9939393939393939,
+ "grad_norm": 1.949404001235962,
+ "learning_rate": 1.3387205387205389e-05,
+ "loss": 1.8859628438949585,
+ "mean_token_accuracy": 0.5876282453536987,
+ "num_tokens": 8060928.0,
+ "step": 492
+ },
+ {
+ "entropy": 1.587094783782959,
+ "epoch": 0.9959595959595959,
+ "grad_norm": 1.9205344915390015,
+ "learning_rate": 1.3373737373737374e-05,
+ "loss": 1.6053454875946045,
+ "mean_token_accuracy": 0.6257938742637634,
+ "num_tokens": 8077312.0,
+ "step": 493
+ },
+ {
+ "entropy": 1.6583648920059204,
+ "epoch": 0.997979797979798,
+ "grad_norm": 1.976946234703064,
+ "learning_rate": 1.3360269360269362e-05,
+ "loss": 1.6656805276870728,
+ "mean_token_accuracy": 0.6186492443084717,
+ "num_tokens": 8093696.0,
+ "step": 494
+ },
+ {
+ "entropy": 1.1685364246368408,
+ "epoch": 1.0,
+ "grad_norm": 1.8258967399597168,
+ "learning_rate": 1.3346801346801349e-05,
+ "loss": 1.165276288986206,
+ "mean_token_accuracy": 0.7082315683364868,
+ "num_tokens": 8110080.0,
+ "step": 495
+ },
+ {
+ "entropy": 1.1211013793945312,
+ "epoch": 1.002020202020202,
+ "grad_norm": 2.27962327003479,
+ "learning_rate": 1.3333333333333333e-05,
+ "loss": 0.9540231227874756,
+ "mean_token_accuracy": 0.747801661491394,
+ "num_tokens": 8126464.0,
+ "step": 496
+ },
+ {
+ "entropy": 1.370996356010437,
+ "epoch": 1.004040404040404,
+ "grad_norm": 2.3193519115448,
+ "learning_rate": 1.3319865319865321e-05,
+ "loss": 1.240065097808838,
+ "mean_token_accuracy": 0.6976062655448914,
+ "num_tokens": 8142848.0,
+ "step": 497
+ },
+ {
+ "entropy": 1.4673359394073486,
+ "epoch": 1.006060606060606,
+ "grad_norm": 2.071213483810425,
+ "learning_rate": 1.3306397306397308e-05,
+ "loss": 1.3351866006851196,
+ "mean_token_accuracy": 0.6921104192733765,
+ "num_tokens": 8159232.0,
+ "step": 498
+ },
+ {
+ "entropy": 1.1151381731033325,
+ "epoch": 1.0080808080808081,
+ "grad_norm": 2.1310431957244873,
+ "learning_rate": 1.3292929292929293e-05,
+ "loss": 1.0092531442642212,
+ "mean_token_accuracy": 0.7261846661567688,
+ "num_tokens": 8175616.0,
+ "step": 499
+ },
+ {
+ "entropy": 1.4734766483306885,
+ "epoch": 1.0101010101010102,
+ "grad_norm": 2.015787124633789,
+ "learning_rate": 1.3279461279461281e-05,
+ "loss": 1.3748562335968018,
+ "mean_token_accuracy": 0.6682339906692505,
+ "num_tokens": 8192000.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.0101010101010102,
+ "eval_entropy": 1.3614274196086391,
+ "eval_loss": 1.5201176404953003,
+ "eval_mean_token_accuracy": 0.647282806134993,
+ "eval_num_tokens": 8192000.0,
+ "eval_runtime": 43.8232,
+ "eval_samples_per_second": 22.591,
+ "eval_steps_per_second": 2.83,
+ "step": 500
+ },
+ {
+ "entropy": 1.3656656742095947,
+ "epoch": 1.0121212121212122,
+ "grad_norm": 2.102975845336914,
+ "learning_rate": 1.3265993265993267e-05,
+ "loss": 1.2834689617156982,
+ "mean_token_accuracy": 0.6831338405609131,
+ "num_tokens": 8208384.0,
+ "step": 501
+ },
+ {
+ "entropy": 1.0829076766967773,
+ "epoch": 1.0141414141414142,
+ "grad_norm": 1.8827977180480957,
+ "learning_rate": 1.3252525252525254e-05,
+ "loss": 1.070042610168457,
+ "mean_token_accuracy": 0.72007817029953,
+ "num_tokens": 8224768.0,
+ "step": 502
+ },
+ {
+ "entropy": 1.2298822402954102,
+ "epoch": 1.0161616161616163,
+ "grad_norm": 1.9913817644119263,
+ "learning_rate": 1.323905723905724e-05,
+ "loss": 1.2619516849517822,
+ "mean_token_accuracy": 0.7024303674697876,
+ "num_tokens": 8241152.0,
+ "step": 503
+ },
+ {
+ "entropy": 0.9216552972793579,
+ "epoch": 1.018181818181818,
+ "grad_norm": 1.8755308389663696,
+ "learning_rate": 1.3225589225589225e-05,
+ "loss": 0.9175798892974854,
+ "mean_token_accuracy": 0.7650830745697021,
+ "num_tokens": 8257536.0,
+ "step": 504
+ },
+ {
+ "entropy": 0.7169107794761658,
+ "epoch": 1.02020202020202,
+ "grad_norm": 2.100609064102173,
+ "learning_rate": 1.3212121212121213e-05,
+ "loss": 0.7609860897064209,
+ "mean_token_accuracy": 0.7913410067558289,
+ "num_tokens": 8273920.0,
+ "step": 505
+ },
+ {
+ "entropy": 1.5552464723587036,
+ "epoch": 1.0222222222222221,
+ "grad_norm": 2.5406126976013184,
+ "learning_rate": 1.31986531986532e-05,
+ "loss": 1.6440303325653076,
+ "mean_token_accuracy": 0.6193820238113403,
+ "num_tokens": 8290304.0,
+ "step": 506
+ },
+ {
+ "entropy": 0.9679869413375854,
+ "epoch": 1.0242424242424242,
+ "grad_norm": 2.2049074172973633,
+ "learning_rate": 1.3185185185185185e-05,
+ "loss": 1.0273747444152832,
+ "mean_token_accuracy": 0.729421079158783,
+ "num_tokens": 8306688.0,
+ "step": 507
+ },
+ {
+ "entropy": 1.5491999387741089,
+ "epoch": 1.0262626262626262,
+ "grad_norm": 2.2690296173095703,
+ "learning_rate": 1.3171717171717173e-05,
+ "loss": 1.6104233264923096,
+ "mean_token_accuracy": 0.6261602640151978,
+ "num_tokens": 8323072.0,
+ "step": 508
+ },
+ {
+ "entropy": 1.157227635383606,
+ "epoch": 1.0282828282828282,
+ "grad_norm": 2.5081140995025635,
+ "learning_rate": 1.315824915824916e-05,
+ "loss": 1.2283058166503906,
+ "mean_token_accuracy": 0.7013311982154846,
+ "num_tokens": 8339456.0,
+ "step": 509
+ },
+ {
+ "entropy": 1.2934587001800537,
+ "epoch": 1.0303030303030303,
+ "grad_norm": 2.0315630435943604,
+ "learning_rate": 1.3144781144781147e-05,
+ "loss": 1.313960075378418,
+ "mean_token_accuracy": 0.6683561205863953,
+ "num_tokens": 8355840.0,
+ "step": 510
+ },
+ {
+ "entropy": 1.058363437652588,
+ "epoch": 1.0323232323232323,
+ "grad_norm": 2.0326106548309326,
+ "learning_rate": 1.3131313131313132e-05,
+ "loss": 1.060279130935669,
+ "mean_token_accuracy": 0.7263678312301636,
+ "num_tokens": 8372224.0,
+ "step": 511
+ },
+ {
+ "entropy": 1.166068196296692,
+ "epoch": 1.0343434343434343,
+ "grad_norm": 1.9384857416152954,
+ "learning_rate": 1.3117845117845119e-05,
+ "loss": 1.1466734409332275,
+ "mean_token_accuracy": 0.7182462215423584,
+ "num_tokens": 8388608.0,
+ "step": 512
+ },
+ {
+ "entropy": 1.1295984983444214,
+ "epoch": 1.0363636363636364,
+ "grad_norm": 2.0500752925872803,
+ "learning_rate": 1.3104377104377107e-05,
+ "loss": 1.1119377613067627,
+ "mean_token_accuracy": 0.7249022722244263,
+ "num_tokens": 8404992.0,
+ "step": 513
+ },
+ {
+ "entropy": 1.2471498250961304,
+ "epoch": 1.0383838383838384,
+ "grad_norm": 2.057642698287964,
+ "learning_rate": 1.3090909090909092e-05,
+ "loss": 1.2348787784576416,
+ "mean_token_accuracy": 0.69840008020401,
+ "num_tokens": 8421376.0,
+ "step": 514
+ },
+ {
+ "entropy": 1.2146048545837402,
+ "epoch": 1.0404040404040404,
+ "grad_norm": 1.8724642992019653,
+ "learning_rate": 1.3077441077441078e-05,
+ "loss": 1.1992437839508057,
+ "mean_token_accuracy": 0.7179408669471741,
+ "num_tokens": 8437760.0,
+ "step": 515
+ },
+ {
+ "entropy": 1.119163990020752,
+ "epoch": 1.0424242424242425,
+ "grad_norm": 2.013307571411133,
+ "learning_rate": 1.3063973063973066e-05,
+ "loss": 1.0880366563796997,
+ "mean_token_accuracy": 0.7274059653282166,
+ "num_tokens": 8454144.0,
+ "step": 516
+ },
+ {
+ "entropy": 1.055690884590149,
+ "epoch": 1.0444444444444445,
+ "grad_norm": 2.9534032344818115,
+ "learning_rate": 1.3050505050505051e-05,
+ "loss": 1.0625638961791992,
+ "mean_token_accuracy": 0.7302759885787964,
+ "num_tokens": 8470528.0,
+ "step": 517
+ },
+ {
+ "entropy": 1.629905343055725,
+ "epoch": 1.0464646464646465,
+ "grad_norm": 1.9111285209655762,
+ "learning_rate": 1.303703703703704e-05,
+ "loss": 1.642975926399231,
+ "mean_token_accuracy": 0.638067901134491,
+ "num_tokens": 8486912.0,
+ "step": 518
+ },
+ {
+ "entropy": 1.2197786569595337,
+ "epoch": 1.0484848484848486,
+ "grad_norm": 2.0819573402404785,
+ "learning_rate": 1.3023569023569024e-05,
+ "loss": 1.178088903427124,
+ "mean_token_accuracy": 0.7040180563926697,
+ "num_tokens": 8503296.0,
+ "step": 519
+ },
+ {
+ "entropy": 1.4044541120529175,
+ "epoch": 1.0505050505050506,
+ "grad_norm": 9.860201835632324,
+ "learning_rate": 1.301010101010101e-05,
+ "loss": 1.6388373374938965,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 8519680.0,
+ "step": 520
+ },
+ {
+ "entropy": 0.9115698337554932,
+ "epoch": 1.0525252525252524,
+ "grad_norm": 2.1228489875793457,
+ "learning_rate": 1.2996632996632999e-05,
+ "loss": 0.8868257999420166,
+ "mean_token_accuracy": 0.7558622360229492,
+ "num_tokens": 8536064.0,
+ "step": 521
+ },
+ {
+ "entropy": 1.0348355770111084,
+ "epoch": 1.0545454545454545,
+ "grad_norm": 1.8459810018539429,
+ "learning_rate": 1.2983164983164984e-05,
+ "loss": 1.0149322748184204,
+ "mean_token_accuracy": 0.7421836853027344,
+ "num_tokens": 8552448.0,
+ "step": 522
+ },
+ {
+ "entropy": 1.0639865398406982,
+ "epoch": 1.0565656565656565,
+ "grad_norm": 2.0999417304992676,
+ "learning_rate": 1.296969696969697e-05,
+ "loss": 1.0582343339920044,
+ "mean_token_accuracy": 0.7242916226387024,
+ "num_tokens": 8568832.0,
+ "step": 523
+ },
+ {
+ "entropy": 1.2032114267349243,
+ "epoch": 1.0585858585858585,
+ "grad_norm": 2.0500640869140625,
+ "learning_rate": 1.2956228956228958e-05,
+ "loss": 1.2051773071289062,
+ "mean_token_accuracy": 0.7076819539070129,
+ "num_tokens": 8585216.0,
+ "step": 524
+ },
+ {
+ "entropy": 1.2425649166107178,
+ "epoch": 1.0606060606060606,
+ "grad_norm": 2.1104960441589355,
+ "learning_rate": 1.2942760942760943e-05,
+ "loss": 1.2576614618301392,
+ "mean_token_accuracy": 0.6907669901847839,
+ "num_tokens": 8601600.0,
+ "step": 525
+ },
+ {
+ "entropy": 1.2280266284942627,
+ "epoch": 1.0626262626262626,
+ "grad_norm": 2.0641212463378906,
+ "learning_rate": 1.2929292929292931e-05,
+ "loss": 1.2378020286560059,
+ "mean_token_accuracy": 0.6943697929382324,
+ "num_tokens": 8617984.0,
+ "step": 526
+ },
+ {
+ "entropy": 0.9312539100646973,
+ "epoch": 1.0646464646464646,
+ "grad_norm": 2.0006070137023926,
+ "learning_rate": 1.2915824915824918e-05,
+ "loss": 0.952136754989624,
+ "mean_token_accuracy": 0.7538471221923828,
+ "num_tokens": 8634368.0,
+ "step": 527
+ },
+ {
+ "entropy": 1.5708260536193848,
+ "epoch": 1.0666666666666667,
+ "grad_norm": 1.873006820678711,
+ "learning_rate": 1.2902356902356902e-05,
+ "loss": 1.5705666542053223,
+ "mean_token_accuracy": 0.6449071764945984,
+ "num_tokens": 8650752.0,
+ "step": 528
+ },
+ {
+ "entropy": 0.9064179062843323,
+ "epoch": 1.0686868686868687,
+ "grad_norm": 2.109816551208496,
+ "learning_rate": 1.288888888888889e-05,
+ "loss": 0.9165636301040649,
+ "mean_token_accuracy": 0.754824161529541,
+ "num_tokens": 8667136.0,
+ "step": 529
+ },
+ {
+ "entropy": 1.4197264909744263,
+ "epoch": 1.0707070707070707,
+ "grad_norm": 2.2213833332061768,
+ "learning_rate": 1.2875420875420877e-05,
+ "loss": 1.4330552816390991,
+ "mean_token_accuracy": 0.6589521169662476,
+ "num_tokens": 8683520.0,
+ "step": 530
+ },
+ {
+ "entropy": 1.3674145936965942,
+ "epoch": 1.0727272727272728,
+ "grad_norm": 2.2046334743499756,
+ "learning_rate": 1.2861952861952862e-05,
+ "loss": 1.3838258981704712,
+ "mean_token_accuracy": 0.6660356521606445,
+ "num_tokens": 8699904.0,
+ "step": 531
+ },
+ {
+ "entropy": 1.0396678447723389,
+ "epoch": 1.0747474747474748,
+ "grad_norm": 1.9246002435684204,
+ "learning_rate": 1.284848484848485e-05,
+ "loss": 1.0304534435272217,
+ "mean_token_accuracy": 0.7421836853027344,
+ "num_tokens": 8716288.0,
+ "step": 532
+ },
+ {
+ "entropy": 0.8541752696037292,
+ "epoch": 1.0767676767676768,
+ "grad_norm": 1.9644383192062378,
+ "learning_rate": 1.2835016835016837e-05,
+ "loss": 0.8437563180923462,
+ "mean_token_accuracy": 0.7683805823326111,
+ "num_tokens": 8732672.0,
+ "step": 533
+ },
+ {
+ "entropy": 0.962359607219696,
+ "epoch": 1.0787878787878789,
+ "grad_norm": 1.8767060041427612,
+ "learning_rate": 1.2821548821548821e-05,
+ "loss": 0.9354047775268555,
+ "mean_token_accuracy": 0.7493893504142761,
+ "num_tokens": 8749056.0,
+ "step": 534
+ },
+ {
+ "entropy": 1.1609500646591187,
+ "epoch": 1.0808080808080809,
+ "grad_norm": 2.316633939743042,
+ "learning_rate": 1.280808080808081e-05,
+ "loss": 1.1338696479797363,
+ "mean_token_accuracy": 0.7132388949394226,
+ "num_tokens": 8765440.0,
+ "step": 535
+ },
+ {
+ "entropy": 0.9635956883430481,
+ "epoch": 1.082828282828283,
+ "grad_norm": 1.8842763900756836,
+ "learning_rate": 1.2794612794612794e-05,
+ "loss": 0.9779557585716248,
+ "mean_token_accuracy": 0.7515876889228821,
+ "num_tokens": 8781824.0,
+ "step": 536
+ },
+ {
+ "entropy": 1.5283102989196777,
+ "epoch": 1.084848484848485,
+ "grad_norm": 2.2277283668518066,
+ "learning_rate": 1.2781144781144783e-05,
+ "loss": 1.5118470191955566,
+ "mean_token_accuracy": 0.6464338302612305,
+ "num_tokens": 8798208.0,
+ "step": 537
+ },
+ {
+ "entropy": 1.1301655769348145,
+ "epoch": 1.0868686868686868,
+ "grad_norm": 2.0282225608825684,
+ "learning_rate": 1.2767676767676769e-05,
+ "loss": 1.0959392786026,
+ "mean_token_accuracy": 0.7204445600509644,
+ "num_tokens": 8814592.0,
+ "step": 538
+ },
+ {
+ "entropy": 1.3107094764709473,
+ "epoch": 1.0888888888888888,
+ "grad_norm": 1.9527665376663208,
+ "learning_rate": 1.2754208754208754e-05,
+ "loss": 1.2717593908309937,
+ "mean_token_accuracy": 0.6916218996047974,
+ "num_tokens": 8830976.0,
+ "step": 539
+ },
+ {
+ "entropy": 1.3232251405715942,
+ "epoch": 1.0909090909090908,
+ "grad_norm": 2.134962320327759,
+ "learning_rate": 1.2740740740740742e-05,
+ "loss": 1.3589959144592285,
+ "mean_token_accuracy": 0.6701880693435669,
+ "num_tokens": 8847360.0,
+ "step": 540
+ },
+ {
+ "entropy": 1.5372718572616577,
+ "epoch": 1.0929292929292929,
+ "grad_norm": 1.8864489793777466,
+ "learning_rate": 1.2727272727272728e-05,
+ "loss": 1.5291733741760254,
+ "mean_token_accuracy": 0.6487542986869812,
+ "num_tokens": 8863744.0,
+ "step": 541
+ },
+ {
+ "entropy": 1.2037636041641235,
+ "epoch": 1.094949494949495,
+ "grad_norm": 1.8530166149139404,
+ "learning_rate": 1.2713804713804713e-05,
+ "loss": 1.1905983686447144,
+ "mean_token_accuracy": 0.6986443400382996,
+ "num_tokens": 8880128.0,
+ "step": 542
+ },
+ {
+ "entropy": 1.256689429283142,
+ "epoch": 1.096969696969697,
+ "grad_norm": 1.9364465475082397,
+ "learning_rate": 1.2700336700336701e-05,
+ "loss": 1.275427222251892,
+ "mean_token_accuracy": 0.689728856086731,
+ "num_tokens": 8896512.0,
+ "step": 543
+ },
+ {
+ "entropy": 1.154582142829895,
+ "epoch": 1.098989898989899,
+ "grad_norm": 2.097226619720459,
+ "learning_rate": 1.2686868686868688e-05,
+ "loss": 1.1638195514678955,
+ "mean_token_accuracy": 0.7220322489738464,
+ "num_tokens": 8912896.0,
+ "step": 544
+ },
+ {
+ "entropy": 1.3060903549194336,
+ "epoch": 1.101010101010101,
+ "grad_norm": 2.1401753425598145,
+ "learning_rate": 1.2673400673400676e-05,
+ "loss": 1.337110996246338,
+ "mean_token_accuracy": 0.6781876087188721,
+ "num_tokens": 8929280.0,
+ "step": 545
+ },
+ {
+ "entropy": 1.2550262212753296,
+ "epoch": 1.103030303030303,
+ "grad_norm": 1.8216264247894287,
+ "learning_rate": 1.2659932659932661e-05,
+ "loss": 1.2674927711486816,
+ "mean_token_accuracy": 0.6860649585723877,
+ "num_tokens": 8945664.0,
+ "step": 546
+ },
+ {
+ "entropy": 1.1487771272659302,
+ "epoch": 1.105050505050505,
+ "grad_norm": 1.8050950765609741,
+ "learning_rate": 1.2646464646464647e-05,
+ "loss": 1.1384658813476562,
+ "mean_token_accuracy": 0.734245240688324,
+ "num_tokens": 8962048.0,
+ "step": 547
+ },
+ {
+ "entropy": 1.2411508560180664,
+ "epoch": 1.107070707070707,
+ "grad_norm": 2.0532772541046143,
+ "learning_rate": 1.2632996632996634e-05,
+ "loss": 1.2501752376556396,
+ "mean_token_accuracy": 0.7154982686042786,
+ "num_tokens": 8978432.0,
+ "step": 548
+ },
+ {
+ "entropy": 1.383638620376587,
+ "epoch": 1.1090909090909091,
+ "grad_norm": 1.9422906637191772,
+ "learning_rate": 1.261952861952862e-05,
+ "loss": 1.4019615650177002,
+ "mean_token_accuracy": 0.677760124206543,
+ "num_tokens": 8994816.0,
+ "step": 549
+ },
+ {
+ "entropy": 1.302299976348877,
+ "epoch": 1.1111111111111112,
+ "grad_norm": 2.008962869644165,
+ "learning_rate": 1.2606060606060607e-05,
+ "loss": 1.2934541702270508,
+ "mean_token_accuracy": 0.7078040838241577,
+ "num_tokens": 9011200.0,
+ "step": 550
+ },
+ {
+ "entropy": 1.2423378229141235,
+ "epoch": 1.1131313131313132,
+ "grad_norm": 1.9461158514022827,
+ "learning_rate": 1.2592592592592593e-05,
+ "loss": 1.241358995437622,
+ "mean_token_accuracy": 0.7046898007392883,
+ "num_tokens": 9027584.0,
+ "step": 551
+ },
+ {
+ "entropy": 1.3034340143203735,
+ "epoch": 1.1151515151515152,
+ "grad_norm": 1.8627954721450806,
+ "learning_rate": 1.257912457912458e-05,
+ "loss": 1.3082997798919678,
+ "mean_token_accuracy": 0.6942476630210876,
+ "num_tokens": 9043968.0,
+ "step": 552
+ },
+ {
+ "entropy": 1.2468732595443726,
+ "epoch": 1.1171717171717173,
+ "grad_norm": 1.8033503293991089,
+ "learning_rate": 1.2565656565656568e-05,
+ "loss": 1.2398372888565063,
+ "mean_token_accuracy": 0.7059721350669861,
+ "num_tokens": 9060352.0,
+ "step": 553
+ },
+ {
+ "entropy": 1.3763928413391113,
+ "epoch": 1.1191919191919193,
+ "grad_norm": 2.109393358230591,
+ "learning_rate": 1.2552188552188553e-05,
+ "loss": 1.3908042907714844,
+ "mean_token_accuracy": 0.6643258333206177,
+ "num_tokens": 9076736.0,
+ "step": 554
+ },
+ {
+ "entropy": 1.0741946697235107,
+ "epoch": 1.121212121212121,
+ "grad_norm": 1.9498950242996216,
+ "learning_rate": 1.253872053872054e-05,
+ "loss": 1.0534818172454834,
+ "mean_token_accuracy": 0.7283830046653748,
+ "num_tokens": 9093120.0,
+ "step": 555
+ },
+ {
+ "entropy": 1.2464348077774048,
+ "epoch": 1.1232323232323231,
+ "grad_norm": 1.7962212562561035,
+ "learning_rate": 1.2525252525252527e-05,
+ "loss": 1.225571632385254,
+ "mean_token_accuracy": 0.695652186870575,
+ "num_tokens": 9109504.0,
+ "step": 556
+ },
+ {
+ "entropy": 1.1979366540908813,
+ "epoch": 1.1252525252525252,
+ "grad_norm": 2.0588653087615967,
+ "learning_rate": 1.2511784511784512e-05,
+ "loss": 1.1866135597229004,
+ "mean_token_accuracy": 0.705422580242157,
+ "num_tokens": 9125888.0,
+ "step": 557
+ },
+ {
+ "entropy": 0.9303950071334839,
+ "epoch": 1.1272727272727272,
+ "grad_norm": 1.8577561378479004,
+ "learning_rate": 1.2498316498316499e-05,
+ "loss": 0.9317413568496704,
+ "mean_token_accuracy": 0.7565950155258179,
+ "num_tokens": 9142272.0,
+ "step": 558
+ },
+ {
+ "entropy": 0.857255756855011,
+ "epoch": 1.1292929292929292,
+ "grad_norm": 1.8342596292495728,
+ "learning_rate": 1.2484848484848487e-05,
+ "loss": 0.8612891435623169,
+ "mean_token_accuracy": 0.7796775698661804,
+ "num_tokens": 9158656.0,
+ "step": 559
+ },
+ {
+ "entropy": 0.928502082824707,
+ "epoch": 1.1313131313131313,
+ "grad_norm": 1.9290180206298828,
+ "learning_rate": 1.2471380471380472e-05,
+ "loss": 0.9316297769546509,
+ "mean_token_accuracy": 0.7509160041809082,
+ "num_tokens": 9175040.0,
+ "step": 560
+ },
+ {
+ "entropy": 1.4019330739974976,
+ "epoch": 1.1333333333333333,
+ "grad_norm": 2.1189591884613037,
+ "learning_rate": 1.245791245791246e-05,
+ "loss": 1.3917508125305176,
+ "mean_token_accuracy": 0.6691499948501587,
+ "num_tokens": 9191424.0,
+ "step": 561
+ },
+ {
+ "entropy": 1.4660407304763794,
+ "epoch": 1.1353535353535353,
+ "grad_norm": 2.417506217956543,
+ "learning_rate": 1.2444444444444446e-05,
+ "loss": 1.4893054962158203,
+ "mean_token_accuracy": 0.6543111801147461,
+ "num_tokens": 9207808.0,
+ "step": 562
+ },
+ {
+ "entropy": 1.4580096006393433,
+ "epoch": 1.1373737373737374,
+ "grad_norm": 2.1689300537109375,
+ "learning_rate": 1.2430976430976431e-05,
+ "loss": 1.498686671257019,
+ "mean_token_accuracy": 0.6479604244232178,
+ "num_tokens": 9224192.0,
+ "step": 563
+ },
+ {
+ "entropy": 1.5781100988388062,
+ "epoch": 1.1393939393939394,
+ "grad_norm": 1.9947389364242554,
+ "learning_rate": 1.241750841750842e-05,
+ "loss": 1.604151725769043,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 9240576.0,
+ "step": 564
+ },
+ {
+ "entropy": 0.898691713809967,
+ "epoch": 1.1414141414141414,
+ "grad_norm": 2.0886003971099854,
+ "learning_rate": 1.2404040404040406e-05,
+ "loss": 0.9051169157028198,
+ "mean_token_accuracy": 0.7479848265647888,
+ "num_tokens": 9256960.0,
+ "step": 565
+ },
+ {
+ "entropy": 1.2837234735488892,
+ "epoch": 1.1434343434343435,
+ "grad_norm": 2.1896820068359375,
+ "learning_rate": 1.239057239057239e-05,
+ "loss": 1.2775177955627441,
+ "mean_token_accuracy": 0.6811187267303467,
+ "num_tokens": 9273344.0,
+ "step": 566
+ },
+ {
+ "entropy": 1.1134051084518433,
+ "epoch": 1.1454545454545455,
+ "grad_norm": 1.883119821548462,
+ "learning_rate": 1.2377104377104379e-05,
+ "loss": 1.1263504028320312,
+ "mean_token_accuracy": 0.7154982686042786,
+ "num_tokens": 9289728.0,
+ "step": 567
+ },
+ {
+ "entropy": 1.1212451457977295,
+ "epoch": 1.1474747474747475,
+ "grad_norm": 2.0665414333343506,
+ "learning_rate": 1.2363636363636364e-05,
+ "loss": 1.1123074293136597,
+ "mean_token_accuracy": 0.7117122411727905,
+ "num_tokens": 9306112.0,
+ "step": 568
+ },
+ {
+ "entropy": 1.1619912385940552,
+ "epoch": 1.1494949494949496,
+ "grad_norm": 1.986931562423706,
+ "learning_rate": 1.2350168350168352e-05,
+ "loss": 1.133022665977478,
+ "mean_token_accuracy": 0.7123839855194092,
+ "num_tokens": 9322496.0,
+ "step": 569
+ },
+ {
+ "entropy": 1.433761477470398,
+ "epoch": 1.1515151515151516,
+ "grad_norm": 1.8984476327896118,
+ "learning_rate": 1.2336700336700338e-05,
+ "loss": 1.434887170791626,
+ "mean_token_accuracy": 0.6634098887443542,
+ "num_tokens": 9338880.0,
+ "step": 570
+ },
+ {
+ "entropy": 1.2688939571380615,
+ "epoch": 1.1535353535353536,
+ "grad_norm": 1.9783724546432495,
+ "learning_rate": 1.2323232323232323e-05,
+ "loss": 1.2475486993789673,
+ "mean_token_accuracy": 0.7003541588783264,
+ "num_tokens": 9355264.0,
+ "step": 571
+ },
+ {
+ "entropy": 1.3158199787139893,
+ "epoch": 1.1555555555555554,
+ "grad_norm": 2.1993207931518555,
+ "learning_rate": 1.2309764309764311e-05,
+ "loss": 1.2641775608062744,
+ "mean_token_accuracy": 0.6900342106819153,
+ "num_tokens": 9371648.0,
+ "step": 572
+ },
+ {
+ "entropy": 1.5717110633850098,
+ "epoch": 1.1575757575757575,
+ "grad_norm": 2.0973942279815674,
+ "learning_rate": 1.2296296296296298e-05,
+ "loss": 1.5607821941375732,
+ "mean_token_accuracy": 0.6434416174888611,
+ "num_tokens": 9388032.0,
+ "step": 573
+ },
+ {
+ "entropy": 1.1339603662490845,
+ "epoch": 1.1595959595959595,
+ "grad_norm": 2.1611239910125732,
+ "learning_rate": 1.2282828282828282e-05,
+ "loss": 1.1485066413879395,
+ "mean_token_accuracy": 0.7079262137413025,
+ "num_tokens": 9404416.0,
+ "step": 574
+ },
+ {
+ "entropy": 0.7215157151222229,
+ "epoch": 1.1616161616161615,
+ "grad_norm": 1.7199064493179321,
+ "learning_rate": 1.226936026936027e-05,
+ "loss": 0.6996407508850098,
+ "mean_token_accuracy": 0.8110039234161377,
+ "num_tokens": 9420800.0,
+ "step": 575
+ },
+ {
+ "entropy": 1.207773208618164,
+ "epoch": 1.1636363636363636,
+ "grad_norm": 1.9363049268722534,
+ "learning_rate": 1.2255892255892257e-05,
+ "loss": 1.2100518941879272,
+ "mean_token_accuracy": 0.6953468322753906,
+ "num_tokens": 9437184.0,
+ "step": 576
+ },
+ {
+ "entropy": 1.1832739114761353,
+ "epoch": 1.1656565656565656,
+ "grad_norm": 1.9463727474212646,
+ "learning_rate": 1.2242424242424242e-05,
+ "loss": 1.1800014972686768,
+ "mean_token_accuracy": 0.7148265838623047,
+ "num_tokens": 9453568.0,
+ "step": 577
+ },
+ {
+ "entropy": 0.969874918460846,
+ "epoch": 1.1676767676767676,
+ "grad_norm": 1.9776639938354492,
+ "learning_rate": 1.222895622895623e-05,
+ "loss": 0.9835254549980164,
+ "mean_token_accuracy": 0.7401074767112732,
+ "num_tokens": 9469952.0,
+ "step": 578
+ },
+ {
+ "entropy": 1.2477227449417114,
+ "epoch": 1.1696969696969697,
+ "grad_norm": 2.054093599319458,
+ "learning_rate": 1.2215488215488217e-05,
+ "loss": 1.2632465362548828,
+ "mean_token_accuracy": 0.6811797618865967,
+ "num_tokens": 9486336.0,
+ "step": 579
+ },
+ {
+ "entropy": 1.3652271032333374,
+ "epoch": 1.1717171717171717,
+ "grad_norm": 2.033511161804199,
+ "learning_rate": 1.2202020202020203e-05,
+ "loss": 1.3719289302825928,
+ "mean_token_accuracy": 0.6808744668960571,
+ "num_tokens": 9502720.0,
+ "step": 580
+ },
+ {
+ "entropy": 1.0066897869110107,
+ "epoch": 1.1737373737373737,
+ "grad_norm": 1.906139612197876,
+ "learning_rate": 1.218855218855219e-05,
+ "loss": 1.0317155122756958,
+ "mean_token_accuracy": 0.7470688819885254,
+ "num_tokens": 9519104.0,
+ "step": 581
+ },
+ {
+ "entropy": 1.1423532962799072,
+ "epoch": 1.1757575757575758,
+ "grad_norm": 2.0951437950134277,
+ "learning_rate": 1.2175084175084176e-05,
+ "loss": 1.1328619718551636,
+ "mean_token_accuracy": 0.7098802924156189,
+ "num_tokens": 9535488.0,
+ "step": 582
+ },
+ {
+ "entropy": 0.9396458864212036,
+ "epoch": 1.1777777777777778,
+ "grad_norm": 2.001469373703003,
+ "learning_rate": 1.2161616161616162e-05,
+ "loss": 0.9508752822875977,
+ "mean_token_accuracy": 0.7453590631484985,
+ "num_tokens": 9551872.0,
+ "step": 583
+ },
+ {
+ "entropy": 1.2478508949279785,
+ "epoch": 1.1797979797979798,
+ "grad_norm": 2.1304337978363037,
+ "learning_rate": 1.2148148148148149e-05,
+ "loss": 1.2533063888549805,
+ "mean_token_accuracy": 0.6894235610961914,
+ "num_tokens": 9568256.0,
+ "step": 584
+ },
+ {
+ "entropy": 0.8429924249649048,
+ "epoch": 1.1818181818181819,
+ "grad_norm": 1.891184687614441,
+ "learning_rate": 1.2134680134680134e-05,
+ "loss": 0.8334753513336182,
+ "mean_token_accuracy": 0.7737542986869812,
+ "num_tokens": 9584640.0,
+ "step": 585
+ },
+ {
+ "entropy": 1.1487921476364136,
+ "epoch": 1.183838383838384,
+ "grad_norm": 2.100118637084961,
+ "learning_rate": 1.2121212121212122e-05,
+ "loss": 1.1393694877624512,
+ "mean_token_accuracy": 0.7046287059783936,
+ "num_tokens": 9601024.0,
+ "step": 586
+ },
+ {
+ "entropy": 1.406325101852417,
+ "epoch": 1.185858585858586,
+ "grad_norm": 2.0391998291015625,
+ "learning_rate": 1.2107744107744108e-05,
+ "loss": 1.395864725112915,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 9617408.0,
+ "step": 587
+ },
+ {
+ "entropy": 1.192980170249939,
+ "epoch": 1.187878787878788,
+ "grad_norm": 2.105341911315918,
+ "learning_rate": 1.2094276094276097e-05,
+ "loss": 1.2203993797302246,
+ "mean_token_accuracy": 0.6992549896240234,
+ "num_tokens": 9633792.0,
+ "step": 588
+ },
+ {
+ "entropy": 1.4770102500915527,
+ "epoch": 1.1898989898989898,
+ "grad_norm": 1.959194302558899,
+ "learning_rate": 1.2080808080808081e-05,
+ "loss": 1.4826602935791016,
+ "mean_token_accuracy": 0.6475329995155334,
+ "num_tokens": 9650176.0,
+ "step": 589
+ },
+ {
+ "entropy": 1.440915584564209,
+ "epoch": 1.1919191919191918,
+ "grad_norm": 2.2827632427215576,
+ "learning_rate": 1.2067340067340068e-05,
+ "loss": 1.4349164962768555,
+ "mean_token_accuracy": 0.6570591330528259,
+ "num_tokens": 9666560.0,
+ "step": 590
+ },
+ {
+ "entropy": 0.9503017067909241,
+ "epoch": 1.1939393939393939,
+ "grad_norm": 1.8947645425796509,
+ "learning_rate": 1.2053872053872056e-05,
+ "loss": 0.9562087655067444,
+ "mean_token_accuracy": 0.7511602640151978,
+ "num_tokens": 9682944.0,
+ "step": 591
+ },
+ {
+ "entropy": 0.935599148273468,
+ "epoch": 1.195959595959596,
+ "grad_norm": 1.8788244724273682,
+ "learning_rate": 1.2040404040404041e-05,
+ "loss": 0.9235643148422241,
+ "mean_token_accuracy": 0.7525647282600403,
+ "num_tokens": 9699328.0,
+ "step": 592
+ },
+ {
+ "entropy": 1.3421721458435059,
+ "epoch": 1.197979797979798,
+ "grad_norm": 2.038698673248291,
+ "learning_rate": 1.2026936026936027e-05,
+ "loss": 1.3459725379943848,
+ "mean_token_accuracy": 0.6803248524665833,
+ "num_tokens": 9715712.0,
+ "step": 593
+ },
+ {
+ "entropy": 1.4244537353515625,
+ "epoch": 1.2,
+ "grad_norm": 2.0669443607330322,
+ "learning_rate": 1.2013468013468016e-05,
+ "loss": 1.462540626525879,
+ "mean_token_accuracy": 0.6539447903633118,
+ "num_tokens": 9732096.0,
+ "step": 594
+ },
+ {
+ "entropy": 1.3264589309692383,
+ "epoch": 1.202020202020202,
+ "grad_norm": 2.2563624382019043,
+ "learning_rate": 1.2e-05,
+ "loss": 1.3387104272842407,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 9748480.0,
+ "step": 595
+ },
+ {
+ "entropy": 1.250544548034668,
+ "epoch": 1.204040404040404,
+ "grad_norm": 1.9611469507217407,
+ "learning_rate": 1.1986531986531988e-05,
+ "loss": 1.2569901943206787,
+ "mean_token_accuracy": 0.6947361826896667,
+ "num_tokens": 9764864.0,
+ "step": 596
+ },
+ {
+ "entropy": 1.3189572095870972,
+ "epoch": 1.206060606060606,
+ "grad_norm": 1.9136087894439697,
+ "learning_rate": 1.1973063973063975e-05,
+ "loss": 1.3251599073410034,
+ "mean_token_accuracy": 0.6856985688209534,
+ "num_tokens": 9781248.0,
+ "step": 597
+ },
+ {
+ "entropy": 1.1400903463363647,
+ "epoch": 1.208080808080808,
+ "grad_norm": 1.9812469482421875,
+ "learning_rate": 1.195959595959596e-05,
+ "loss": 1.1514993906021118,
+ "mean_token_accuracy": 0.7175744771957397,
+ "num_tokens": 9797632.0,
+ "step": 598
+ },
+ {
+ "entropy": 1.263106346130371,
+ "epoch": 1.2101010101010101,
+ "grad_norm": 2.1461827754974365,
+ "learning_rate": 1.1946127946127948e-05,
+ "loss": 1.2711405754089355,
+ "mean_token_accuracy": 0.6880801320075989,
+ "num_tokens": 9814016.0,
+ "step": 599
+ },
+ {
+ "entropy": 1.1541659832000732,
+ "epoch": 1.2121212121212122,
+ "grad_norm": 1.8964859247207642,
+ "learning_rate": 1.1932659932659933e-05,
+ "loss": 1.1726963520050049,
+ "mean_token_accuracy": 0.7143380641937256,
+ "num_tokens": 9830400.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.2121212121212122,
+ "eval_entropy": 1.3044754386909547,
+ "eval_loss": 1.5363746881484985,
+ "eval_mean_token_accuracy": 0.6458704312962871,
+ "eval_num_tokens": 9830400.0,
+ "eval_runtime": 43.9189,
+ "eval_samples_per_second": 22.542,
+ "eval_steps_per_second": 2.823,
+ "step": 600
+ },
+ {
+ "entropy": 1.4692459106445312,
+ "epoch": 1.2141414141414142,
+ "grad_norm": 1.9165432453155518,
+ "learning_rate": 1.191919191919192e-05,
+ "loss": 1.444916009902954,
+ "mean_token_accuracy": 0.6709208488464355,
+ "num_tokens": 9846784.0,
+ "step": 601
+ },
+ {
+ "entropy": 1.2140837907791138,
+ "epoch": 1.2161616161616162,
+ "grad_norm": 2.184677839279175,
+ "learning_rate": 1.1905723905723907e-05,
+ "loss": 1.1810932159423828,
+ "mean_token_accuracy": 0.7119565010070801,
+ "num_tokens": 9863168.0,
+ "step": 602
+ },
+ {
+ "entropy": 1.2266523838043213,
+ "epoch": 1.2181818181818183,
+ "grad_norm": 2.0835864543914795,
+ "learning_rate": 1.1892255892255892e-05,
+ "loss": 1.216700792312622,
+ "mean_token_accuracy": 0.702125072479248,
+ "num_tokens": 9879552.0,
+ "step": 603
+ },
+ {
+ "entropy": 1.153336524963379,
+ "epoch": 1.2202020202020203,
+ "grad_norm": 1.959340214729309,
+ "learning_rate": 1.187878787878788e-05,
+ "loss": 1.1497607231140137,
+ "mean_token_accuracy": 0.7254518866539001,
+ "num_tokens": 9895936.0,
+ "step": 604
+ },
+ {
+ "entropy": 1.1328232288360596,
+ "epoch": 1.2222222222222223,
+ "grad_norm": 2.165703773498535,
+ "learning_rate": 1.1865319865319867e-05,
+ "loss": 1.1248265504837036,
+ "mean_token_accuracy": 0.7068881392478943,
+ "num_tokens": 9912320.0,
+ "step": 605
+ },
+ {
+ "entropy": 1.0859829187393188,
+ "epoch": 1.2242424242424241,
+ "grad_norm": 2.0244224071502686,
+ "learning_rate": 1.1851851851851852e-05,
+ "loss": 1.0981967449188232,
+ "mean_token_accuracy": 0.717391312122345,
+ "num_tokens": 9928704.0,
+ "step": 606
+ },
+ {
+ "entropy": 0.9204480648040771,
+ "epoch": 1.2262626262626264,
+ "grad_norm": 1.7957704067230225,
+ "learning_rate": 1.183838383838384e-05,
+ "loss": 0.9045253992080688,
+ "mean_token_accuracy": 0.7639839053153992,
+ "num_tokens": 9945088.0,
+ "step": 607
+ },
+ {
+ "entropy": 1.1566129922866821,
+ "epoch": 1.2282828282828282,
+ "grad_norm": 2.0805907249450684,
+ "learning_rate": 1.1824915824915826e-05,
+ "loss": 1.1485098600387573,
+ "mean_token_accuracy": 0.7118343710899353,
+ "num_tokens": 9961472.0,
+ "step": 608
+ },
+ {
+ "entropy": 1.108127236366272,
+ "epoch": 1.2303030303030302,
+ "grad_norm": 1.977317214012146,
+ "learning_rate": 1.1811447811447811e-05,
+ "loss": 1.1131000518798828,
+ "mean_token_accuracy": 0.7167806625366211,
+ "num_tokens": 9977856.0,
+ "step": 609
+ },
+ {
+ "entropy": 0.8749650716781616,
+ "epoch": 1.2323232323232323,
+ "grad_norm": 2.009488344192505,
+ "learning_rate": 1.17979797979798e-05,
+ "loss": 0.9132063388824463,
+ "mean_token_accuracy": 0.7530532479286194,
+ "num_tokens": 9994240.0,
+ "step": 610
+ },
+ {
+ "entropy": 1.2267354726791382,
+ "epoch": 1.2343434343434343,
+ "grad_norm": 2.075202465057373,
+ "learning_rate": 1.1784511784511786e-05,
+ "loss": 1.2091751098632812,
+ "mean_token_accuracy": 0.70652174949646,
+ "num_tokens": 10010624.0,
+ "step": 611
+ },
+ {
+ "entropy": 1.3990167379379272,
+ "epoch": 1.2363636363636363,
+ "grad_norm": 2.2843780517578125,
+ "learning_rate": 1.1771043771043772e-05,
+ "loss": 1.3952152729034424,
+ "mean_token_accuracy": 0.6685393452644348,
+ "num_tokens": 10027008.0,
+ "step": 612
+ },
+ {
+ "entropy": 1.3222941160202026,
+ "epoch": 1.2383838383838384,
+ "grad_norm": 2.1916584968566895,
+ "learning_rate": 1.1757575757575759e-05,
+ "loss": 1.322625994682312,
+ "mean_token_accuracy": 0.6761114001274109,
+ "num_tokens": 10043392.0,
+ "step": 613
+ },
+ {
+ "entropy": 1.3163132667541504,
+ "epoch": 1.2404040404040404,
+ "grad_norm": 2.1066598892211914,
+ "learning_rate": 1.1744107744107745e-05,
+ "loss": 1.3350703716278076,
+ "mean_token_accuracy": 0.6811797618865967,
+ "num_tokens": 10059776.0,
+ "step": 614
+ },
+ {
+ "entropy": 1.3258253335952759,
+ "epoch": 1.2424242424242424,
+ "grad_norm": 2.16098952293396,
+ "learning_rate": 1.1730639730639732e-05,
+ "loss": 1.3305881023406982,
+ "mean_token_accuracy": 0.6830117106437683,
+ "num_tokens": 10076160.0,
+ "step": 615
+ },
+ {
+ "entropy": 0.9164132475852966,
+ "epoch": 1.2444444444444445,
+ "grad_norm": 1.950881838798523,
+ "learning_rate": 1.1717171717171718e-05,
+ "loss": 0.9203709959983826,
+ "mean_token_accuracy": 0.7569614052772522,
+ "num_tokens": 10092544.0,
+ "step": 616
+ },
+ {
+ "entropy": 1.1378085613250732,
+ "epoch": 1.2464646464646465,
+ "grad_norm": 1.99736487865448,
+ "learning_rate": 1.1703703703703703e-05,
+ "loss": 1.1409945487976074,
+ "mean_token_accuracy": 0.7130556702613831,
+ "num_tokens": 10108928.0,
+ "step": 617
+ },
+ {
+ "entropy": 1.010982871055603,
+ "epoch": 1.2484848484848485,
+ "grad_norm": 1.8678277730941772,
+ "learning_rate": 1.1690235690235691e-05,
+ "loss": 1.0040092468261719,
+ "mean_token_accuracy": 0.7382755279541016,
+ "num_tokens": 10125312.0,
+ "step": 618
+ },
+ {
+ "entropy": 1.3451189994812012,
+ "epoch": 1.2505050505050506,
+ "grad_norm": 2.1611146926879883,
+ "learning_rate": 1.1676767676767678e-05,
+ "loss": 1.3347704410552979,
+ "mean_token_accuracy": 0.6760503053665161,
+ "num_tokens": 10141696.0,
+ "step": 619
+ },
+ {
+ "entropy": 1.5893058776855469,
+ "epoch": 1.2525252525252526,
+ "grad_norm": 2.5862345695495605,
+ "learning_rate": 1.1663299663299666e-05,
+ "loss": 1.6102404594421387,
+ "mean_token_accuracy": 0.6231069564819336,
+ "num_tokens": 10158080.0,
+ "step": 620
+ },
+ {
+ "entropy": 1.4471327066421509,
+ "epoch": 1.2545454545454544,
+ "grad_norm": 1.8857513666152954,
+ "learning_rate": 1.164983164983165e-05,
+ "loss": 1.4646904468536377,
+ "mean_token_accuracy": 0.6591353416442871,
+ "num_tokens": 10174464.0,
+ "step": 621
+ },
+ {
+ "entropy": 1.1457897424697876,
+ "epoch": 1.2565656565656567,
+ "grad_norm": 1.9036853313446045,
+ "learning_rate": 1.1636363636363637e-05,
+ "loss": 1.136209487915039,
+ "mean_token_accuracy": 0.7179408669471741,
+ "num_tokens": 10190848.0,
+ "step": 622
+ },
+ {
+ "entropy": 1.3230067491531372,
+ "epoch": 1.2585858585858585,
+ "grad_norm": 1.969241738319397,
+ "learning_rate": 1.1622895622895625e-05,
+ "loss": 1.3203729391098022,
+ "mean_token_accuracy": 0.6909501552581787,
+ "num_tokens": 10207232.0,
+ "step": 623
+ },
+ {
+ "entropy": 0.9331954717636108,
+ "epoch": 1.2606060606060607,
+ "grad_norm": 1.8972336053848267,
+ "learning_rate": 1.160942760942761e-05,
+ "loss": 0.9346438050270081,
+ "mean_token_accuracy": 0.7507327795028687,
+ "num_tokens": 10223616.0,
+ "step": 624
+ },
+ {
+ "entropy": 1.0203893184661865,
+ "epoch": 1.2626262626262625,
+ "grad_norm": 1.9246903657913208,
+ "learning_rate": 1.1595959595959597e-05,
+ "loss": 1.0318937301635742,
+ "mean_token_accuracy": 0.7396799921989441,
+ "num_tokens": 10240000.0,
+ "step": 625
+ },
+ {
+ "entropy": 1.0469106435775757,
+ "epoch": 1.2646464646464646,
+ "grad_norm": 2.0860235691070557,
+ "learning_rate": 1.1582491582491585e-05,
+ "loss": 1.0661770105361938,
+ "mean_token_accuracy": 0.7215437293052673,
+ "num_tokens": 10256384.0,
+ "step": 626
+ },
+ {
+ "entropy": 0.9044442772865295,
+ "epoch": 1.2666666666666666,
+ "grad_norm": 1.922624111175537,
+ "learning_rate": 1.156902356902357e-05,
+ "loss": 0.8972492218017578,
+ "mean_token_accuracy": 0.7624572515487671,
+ "num_tokens": 10272768.0,
+ "step": 627
+ },
+ {
+ "entropy": 1.7082630395889282,
+ "epoch": 1.2686868686868686,
+ "grad_norm": 2.0335583686828613,
+ "learning_rate": 1.1555555555555556e-05,
+ "loss": 1.7194339036941528,
+ "mean_token_accuracy": 0.6278089880943298,
+ "num_tokens": 10289152.0,
+ "step": 628
+ },
+ {
+ "entropy": 1.1749809980392456,
+ "epoch": 1.2707070707070707,
+ "grad_norm": 2.3157317638397217,
+ "learning_rate": 1.1542087542087544e-05,
+ "loss": 1.1912015676498413,
+ "mean_token_accuracy": 0.6991939544677734,
+ "num_tokens": 10305536.0,
+ "step": 629
+ },
+ {
+ "entropy": 1.0230133533477783,
+ "epoch": 1.2727272727272727,
+ "grad_norm": 1.9861854314804077,
+ "learning_rate": 1.1528619528619529e-05,
+ "loss": 1.030585765838623,
+ "mean_token_accuracy": 0.7328407168388367,
+ "num_tokens": 10321920.0,
+ "step": 630
+ },
+ {
+ "entropy": 0.9128814935684204,
+ "epoch": 1.2747474747474747,
+ "grad_norm": 5.766819000244141,
+ "learning_rate": 1.1515151515151517e-05,
+ "loss": 0.9959099292755127,
+ "mean_token_accuracy": 0.7520151734352112,
+ "num_tokens": 10338304.0,
+ "step": 631
+ },
+ {
+ "entropy": 1.3987287282943726,
+ "epoch": 1.2767676767676768,
+ "grad_norm": 1.934733510017395,
+ "learning_rate": 1.1501683501683502e-05,
+ "loss": 1.3910452127456665,
+ "mean_token_accuracy": 0.675561785697937,
+ "num_tokens": 10354688.0,
+ "step": 632
+ },
+ {
+ "entropy": 1.7590066194534302,
+ "epoch": 1.2787878787878788,
+ "grad_norm": 2.003899574279785,
+ "learning_rate": 1.1488215488215488e-05,
+ "loss": 1.771543264389038,
+ "mean_token_accuracy": 0.6064972877502441,
+ "num_tokens": 10371072.0,
+ "step": 633
+ },
+ {
+ "entropy": 1.1135497093200684,
+ "epoch": 1.2808080808080808,
+ "grad_norm": 1.9084051847457886,
+ "learning_rate": 1.1474747474747477e-05,
+ "loss": 1.1299227476119995,
+ "mean_token_accuracy": 0.7198339104652405,
+ "num_tokens": 10387456.0,
+ "step": 634
+ },
+ {
+ "entropy": 1.4671945571899414,
+ "epoch": 1.2828282828282829,
+ "grad_norm": 1.9825108051300049,
+ "learning_rate": 1.1461279461279461e-05,
+ "loss": 1.486473560333252,
+ "mean_token_accuracy": 0.6673180460929871,
+ "num_tokens": 10403840.0,
+ "step": 635
+ },
+ {
+ "entropy": 1.2157530784606934,
+ "epoch": 1.284848484848485,
+ "grad_norm": 2.048701286315918,
+ "learning_rate": 1.1447811447811448e-05,
+ "loss": 1.196000099182129,
+ "mean_token_accuracy": 0.7078040838241577,
+ "num_tokens": 10420224.0,
+ "step": 636
+ },
+ {
+ "entropy": 0.8687402009963989,
+ "epoch": 1.286868686868687,
+ "grad_norm": 1.8956520557403564,
+ "learning_rate": 1.1434343434343436e-05,
+ "loss": 0.86002117395401,
+ "mean_token_accuracy": 0.7663654088973999,
+ "num_tokens": 10436608.0,
+ "step": 637
+ },
+ {
+ "entropy": 1.1118111610412598,
+ "epoch": 1.2888888888888888,
+ "grad_norm": 1.9835058450698853,
+ "learning_rate": 1.142087542087542e-05,
+ "loss": 1.1115164756774902,
+ "mean_token_accuracy": 0.7170859575271606,
+ "num_tokens": 10452992.0,
+ "step": 638
+ },
+ {
+ "entropy": 1.1080268621444702,
+ "epoch": 1.290909090909091,
+ "grad_norm": 1.9650659561157227,
+ "learning_rate": 1.1407407407407409e-05,
+ "loss": 1.0900099277496338,
+ "mean_token_accuracy": 0.7143990993499756,
+ "num_tokens": 10469376.0,
+ "step": 639
+ },
+ {
+ "entropy": 0.9909329414367676,
+ "epoch": 1.2929292929292928,
+ "grad_norm": 2.1029200553894043,
+ "learning_rate": 1.1393939393939395e-05,
+ "loss": 0.9947470426559448,
+ "mean_token_accuracy": 0.7403517365455627,
+ "num_tokens": 10485760.0,
+ "step": 640
+ },
+ {
+ "entropy": 1.1272226572036743,
+ "epoch": 1.294949494949495,
+ "grad_norm": 1.9888865947723389,
+ "learning_rate": 1.138047138047138e-05,
+ "loss": 1.1474848985671997,
+ "mean_token_accuracy": 0.7138495445251465,
+ "num_tokens": 10502144.0,
+ "step": 641
+ },
+ {
+ "entropy": 1.5329686403274536,
+ "epoch": 1.2969696969696969,
+ "grad_norm": 2.046448230743408,
+ "learning_rate": 1.1367003367003368e-05,
+ "loss": 1.556037425994873,
+ "mean_token_accuracy": 0.642953097820282,
+ "num_tokens": 10518528.0,
+ "step": 642
+ },
+ {
+ "entropy": 1.177565336227417,
+ "epoch": 1.298989898989899,
+ "grad_norm": 2.1602399349212646,
+ "learning_rate": 1.1353535353535355e-05,
+ "loss": 1.1836936473846436,
+ "mean_token_accuracy": 0.6971787810325623,
+ "num_tokens": 10534912.0,
+ "step": 643
+ },
+ {
+ "entropy": 0.8429449796676636,
+ "epoch": 1.301010101010101,
+ "grad_norm": 1.7227115631103516,
+ "learning_rate": 1.134006734006734e-05,
+ "loss": 0.8446363806724548,
+ "mean_token_accuracy": 0.7757083773612976,
+ "num_tokens": 10551296.0,
+ "step": 644
+ },
+ {
+ "entropy": 1.397851824760437,
+ "epoch": 1.303030303030303,
+ "grad_norm": 2.137099504470825,
+ "learning_rate": 1.1326599326599328e-05,
+ "loss": 1.3887293338775635,
+ "mean_token_accuracy": 0.6610283255577087,
+ "num_tokens": 10567680.0,
+ "step": 645
+ },
+ {
+ "entropy": 1.2101221084594727,
+ "epoch": 1.305050505050505,
+ "grad_norm": 2.073007583618164,
+ "learning_rate": 1.1313131313131314e-05,
+ "loss": 1.1941102743148804,
+ "mean_token_accuracy": 0.7100635170936584,
+ "num_tokens": 10584064.0,
+ "step": 646
+ },
+ {
+ "entropy": 1.626240849494934,
+ "epoch": 1.307070707070707,
+ "grad_norm": 2.073517084121704,
+ "learning_rate": 1.1299663299663301e-05,
+ "loss": 1.6281862258911133,
+ "mean_token_accuracy": 0.6289692521095276,
+ "num_tokens": 10600448.0,
+ "step": 647
+ },
+ {
+ "entropy": 1.0951712131500244,
+ "epoch": 1.309090909090909,
+ "grad_norm": 2.126551866531372,
+ "learning_rate": 1.1286195286195287e-05,
+ "loss": 1.105857014656067,
+ "mean_token_accuracy": 0.7147044539451599,
+ "num_tokens": 10616832.0,
+ "step": 648
+ },
+ {
+ "entropy": 1.2107304334640503,
+ "epoch": 1.3111111111111111,
+ "grad_norm": 2.067368507385254,
+ "learning_rate": 1.1272727272727272e-05,
+ "loss": 1.2249386310577393,
+ "mean_token_accuracy": 0.7076819539070129,
+ "num_tokens": 10633216.0,
+ "step": 649
+ },
+ {
+ "entropy": 1.4364724159240723,
+ "epoch": 1.3131313131313131,
+ "grad_norm": 1.9724938869476318,
+ "learning_rate": 1.125925925925926e-05,
+ "loss": 1.4194120168685913,
+ "mean_token_accuracy": 0.6655471324920654,
+ "num_tokens": 10649600.0,
+ "step": 650
+ },
+ {
+ "entropy": 0.9386561512947083,
+ "epoch": 1.3151515151515152,
+ "grad_norm": 1.9386829137802124,
+ "learning_rate": 1.1245791245791247e-05,
+ "loss": 0.9313067197799683,
+ "mean_token_accuracy": 0.7560454607009888,
+ "num_tokens": 10665984.0,
+ "step": 651
+ },
+ {
+ "entropy": 1.3809468746185303,
+ "epoch": 1.3171717171717172,
+ "grad_norm": 2.1187713146209717,
+ "learning_rate": 1.1232323232323232e-05,
+ "loss": 1.3900315761566162,
+ "mean_token_accuracy": 0.6675012111663818,
+ "num_tokens": 10682368.0,
+ "step": 652
+ },
+ {
+ "entropy": 1.1068683862686157,
+ "epoch": 1.3191919191919192,
+ "grad_norm": 1.9972929954528809,
+ "learning_rate": 1.121885521885522e-05,
+ "loss": 1.1015276908874512,
+ "mean_token_accuracy": 0.7225818037986755,
+ "num_tokens": 10698752.0,
+ "step": 653
+ },
+ {
+ "entropy": 0.8208921551704407,
+ "epoch": 1.3212121212121213,
+ "grad_norm": 1.9667426347732544,
+ "learning_rate": 1.1205387205387206e-05,
+ "loss": 0.8475431799888611,
+ "mean_token_accuracy": 0.773937463760376,
+ "num_tokens": 10715136.0,
+ "step": 654
+ },
+ {
+ "entropy": 1.2287651300430298,
+ "epoch": 1.3232323232323233,
+ "grad_norm": 2.038112163543701,
+ "learning_rate": 1.1191919191919194e-05,
+ "loss": 1.2165236473083496,
+ "mean_token_accuracy": 0.7084147334098816,
+ "num_tokens": 10731520.0,
+ "step": 655
+ },
+ {
+ "entropy": 1.3068023920059204,
+ "epoch": 1.3252525252525253,
+ "grad_norm": 2.001093626022339,
+ "learning_rate": 1.117845117845118e-05,
+ "loss": 1.3044464588165283,
+ "mean_token_accuracy": 0.6809965968132019,
+ "num_tokens": 10747904.0,
+ "step": 656
+ },
+ {
+ "entropy": 1.0627591609954834,
+ "epoch": 1.3272727272727272,
+ "grad_norm": 2.204498529434204,
+ "learning_rate": 1.1164983164983166e-05,
+ "loss": 1.07448410987854,
+ "mean_token_accuracy": 0.7211162447929382,
+ "num_tokens": 10764288.0,
+ "step": 657
+ },
+ {
+ "entropy": 1.1071605682373047,
+ "epoch": 1.3292929292929294,
+ "grad_norm": 2.2397496700286865,
+ "learning_rate": 1.1151515151515154e-05,
+ "loss": 1.1061029434204102,
+ "mean_token_accuracy": 0.7100635170936584,
+ "num_tokens": 10780672.0,
+ "step": 658
+ },
+ {
+ "entropy": 1.2299960851669312,
+ "epoch": 1.3313131313131312,
+ "grad_norm": 2.0838606357574463,
+ "learning_rate": 1.1138047138047139e-05,
+ "loss": 1.2077662944793701,
+ "mean_token_accuracy": 0.6886907815933228,
+ "num_tokens": 10797056.0,
+ "step": 659
+ },
+ {
+ "entropy": 1.2082552909851074,
+ "epoch": 1.3333333333333333,
+ "grad_norm": 2.0905637741088867,
+ "learning_rate": 1.1124579124579125e-05,
+ "loss": 1.2045608758926392,
+ "mean_token_accuracy": 0.6978505253791809,
+ "num_tokens": 10813440.0,
+ "step": 660
+ },
+ {
+ "entropy": 1.4011980295181274,
+ "epoch": 1.3353535353535353,
+ "grad_norm": 2.227360725402832,
+ "learning_rate": 1.1111111111111113e-05,
+ "loss": 1.4221925735473633,
+ "mean_token_accuracy": 0.6541890501976013,
+ "num_tokens": 10829824.0,
+ "step": 661
+ },
+ {
+ "entropy": 0.7984166145324707,
+ "epoch": 1.3373737373737373,
+ "grad_norm": 1.7253413200378418,
+ "learning_rate": 1.1097643097643098e-05,
+ "loss": 0.7818700671195984,
+ "mean_token_accuracy": 0.7938446402549744,
+ "num_tokens": 10846208.0,
+ "step": 662
+ },
+ {
+ "entropy": 1.0456970930099487,
+ "epoch": 1.3393939393939394,
+ "grad_norm": 2.098661422729492,
+ "learning_rate": 1.1084175084175086e-05,
+ "loss": 1.084232211112976,
+ "mean_token_accuracy": 0.735405445098877,
+ "num_tokens": 10862592.0,
+ "step": 663
+ },
+ {
+ "entropy": 1.1313530206680298,
+ "epoch": 1.3414141414141414,
+ "grad_norm": 1.8916199207305908,
+ "learning_rate": 1.1070707070707071e-05,
+ "loss": 1.1359466314315796,
+ "mean_token_accuracy": 0.7338177561759949,
+ "num_tokens": 10878976.0,
+ "step": 664
+ },
+ {
+ "entropy": 0.9603059887886047,
+ "epoch": 1.3434343434343434,
+ "grad_norm": 2.061540365219116,
+ "learning_rate": 1.1057239057239058e-05,
+ "loss": 0.9516211748123169,
+ "mean_token_accuracy": 0.7465803623199463,
+ "num_tokens": 10895360.0,
+ "step": 665
+ },
+ {
+ "entropy": 0.9865843057632446,
+ "epoch": 1.3454545454545455,
+ "grad_norm": 1.9756824970245361,
+ "learning_rate": 1.1043771043771046e-05,
+ "loss": 0.995586633682251,
+ "mean_token_accuracy": 0.7349780201911926,
+ "num_tokens": 10911744.0,
+ "step": 666
+ },
+ {
+ "entropy": 1.098454475402832,
+ "epoch": 1.3474747474747475,
+ "grad_norm": 1.936257243156433,
+ "learning_rate": 1.103030303030303e-05,
+ "loss": 1.0999541282653809,
+ "mean_token_accuracy": 0.7220322489738464,
+ "num_tokens": 10928128.0,
+ "step": 667
+ },
+ {
+ "entropy": 1.1791200637817383,
+ "epoch": 1.3494949494949495,
+ "grad_norm": 2.2319350242614746,
+ "learning_rate": 1.1016835016835017e-05,
+ "loss": 1.1725637912750244,
+ "mean_token_accuracy": 0.6991328597068787,
+ "num_tokens": 10944512.0,
+ "step": 668
+ },
+ {
+ "entropy": 1.2307621240615845,
+ "epoch": 1.3515151515151516,
+ "grad_norm": 1.9910095930099487,
+ "learning_rate": 1.1003367003367005e-05,
+ "loss": 1.2371525764465332,
+ "mean_token_accuracy": 0.6916218996047974,
+ "num_tokens": 10960896.0,
+ "step": 669
+ },
+ {
+ "entropy": 1.2578529119491577,
+ "epoch": 1.3535353535353536,
+ "grad_norm": 2.1415979862213135,
+ "learning_rate": 1.098989898989899e-05,
+ "loss": 1.2753688097000122,
+ "mean_token_accuracy": 0.6794699430465698,
+ "num_tokens": 10977280.0,
+ "step": 670
+ },
+ {
+ "entropy": 1.0493848323822021,
+ "epoch": 1.3555555555555556,
+ "grad_norm": 1.8233927488327026,
+ "learning_rate": 1.0976430976430978e-05,
+ "loss": 1.0482254028320312,
+ "mean_token_accuracy": 0.744076669216156,
+ "num_tokens": 10993664.0,
+ "step": 671
+ },
+ {
+ "entropy": 0.8162504434585571,
+ "epoch": 1.3575757575757577,
+ "grad_norm": 1.7477539777755737,
+ "learning_rate": 1.0962962962962965e-05,
+ "loss": 0.8021665811538696,
+ "mean_token_accuracy": 0.7877381443977356,
+ "num_tokens": 11010048.0,
+ "step": 672
+ },
+ {
+ "entropy": 1.5074793100357056,
+ "epoch": 1.3595959595959597,
+ "grad_norm": 2.096250057220459,
+ "learning_rate": 1.094949494949495e-05,
+ "loss": 1.4992775917053223,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 11026432.0,
+ "step": 673
+ },
+ {
+ "entropy": 0.866222620010376,
+ "epoch": 1.3616161616161615,
+ "grad_norm": 1.9504317045211792,
+ "learning_rate": 1.0936026936026938e-05,
+ "loss": 0.8860467672348022,
+ "mean_token_accuracy": 0.7655715942382812,
+ "num_tokens": 11042816.0,
+ "step": 674
+ },
+ {
+ "entropy": 1.0089516639709473,
+ "epoch": 1.3636363636363638,
+ "grad_norm": 2.218254566192627,
+ "learning_rate": 1.0922558922558924e-05,
+ "loss": 1.005429983139038,
+ "mean_token_accuracy": 0.7360160946846008,
+ "num_tokens": 11059200.0,
+ "step": 675
+ },
+ {
+ "entropy": 1.2176142930984497,
+ "epoch": 1.3656565656565656,
+ "grad_norm": 2.1257565021514893,
+ "learning_rate": 1.0909090909090909e-05,
+ "loss": 1.286620020866394,
+ "mean_token_accuracy": 0.7042012810707092,
+ "num_tokens": 11075584.0,
+ "step": 676
+ },
+ {
+ "entropy": 1.1085315942764282,
+ "epoch": 1.3676767676767676,
+ "grad_norm": 2.065206527709961,
+ "learning_rate": 1.0895622895622897e-05,
+ "loss": 1.1294854879379272,
+ "mean_token_accuracy": 0.7205055952072144,
+ "num_tokens": 11091968.0,
+ "step": 677
+ },
+ {
+ "entropy": 1.2821027040481567,
+ "epoch": 1.3696969696969696,
+ "grad_norm": 2.126866340637207,
+ "learning_rate": 1.0882154882154884e-05,
+ "loss": 1.2661428451538086,
+ "mean_token_accuracy": 0.6976673007011414,
+ "num_tokens": 11108352.0,
+ "step": 678
+ },
+ {
+ "entropy": 0.9285033941268921,
+ "epoch": 1.3717171717171717,
+ "grad_norm": 1.9017925262451172,
+ "learning_rate": 1.0868686868686868e-05,
+ "loss": 0.9141640663146973,
+ "mean_token_accuracy": 0.7670371532440186,
+ "num_tokens": 11124736.0,
+ "step": 679
+ },
+ {
+ "entropy": 0.7374900579452515,
+ "epoch": 1.3737373737373737,
+ "grad_norm": 1.645703911781311,
+ "learning_rate": 1.0855218855218857e-05,
+ "loss": 0.7550391554832458,
+ "mean_token_accuracy": 0.7958598136901855,
+ "num_tokens": 11141120.0,
+ "step": 680
+ },
+ {
+ "entropy": 1.2956714630126953,
+ "epoch": 1.3757575757575757,
+ "grad_norm": 1.9934611320495605,
+ "learning_rate": 1.0841750841750841e-05,
+ "loss": 1.318368673324585,
+ "mean_token_accuracy": 0.686370313167572,
+ "num_tokens": 11157504.0,
+ "step": 681
+ },
+ {
+ "entropy": 1.0948729515075684,
+ "epoch": 1.3777777777777778,
+ "grad_norm": 1.8784940242767334,
+ "learning_rate": 1.082828282828283e-05,
+ "loss": 1.0897748470306396,
+ "mean_token_accuracy": 0.7231314182281494,
+ "num_tokens": 11173888.0,
+ "step": 682
+ },
+ {
+ "entropy": 1.5263433456420898,
+ "epoch": 1.3797979797979798,
+ "grad_norm": 1.9812215566635132,
+ "learning_rate": 1.0814814814814816e-05,
+ "loss": 1.535595178604126,
+ "mean_token_accuracy": 0.6683561205863953,
+ "num_tokens": 11190272.0,
+ "step": 683
+ },
+ {
+ "entropy": 1.3359065055847168,
+ "epoch": 1.3818181818181818,
+ "grad_norm": 2.1247689723968506,
+ "learning_rate": 1.08013468013468e-05,
+ "loss": 1.3298604488372803,
+ "mean_token_accuracy": 0.6813629865646362,
+ "num_tokens": 11206656.0,
+ "step": 684
+ },
+ {
+ "entropy": 1.2030925750732422,
+ "epoch": 1.3838383838383839,
+ "grad_norm": 2.178311586380005,
+ "learning_rate": 1.0787878787878789e-05,
+ "loss": 1.1808526515960693,
+ "mean_token_accuracy": 0.7067660093307495,
+ "num_tokens": 11223040.0,
+ "step": 685
+ },
+ {
+ "entropy": 0.954181969165802,
+ "epoch": 1.385858585858586,
+ "grad_norm": 1.9475486278533936,
+ "learning_rate": 1.0774410774410775e-05,
+ "loss": 0.9589706063270569,
+ "mean_token_accuracy": 0.7527479529380798,
+ "num_tokens": 11239424.0,
+ "step": 686
+ },
+ {
+ "entropy": 1.310365080833435,
+ "epoch": 1.387878787878788,
+ "grad_norm": 2.1845083236694336,
+ "learning_rate": 1.076094276094276e-05,
+ "loss": 1.2851444482803345,
+ "mean_token_accuracy": 0.6789203882217407,
+ "num_tokens": 11255808.0,
+ "step": 687
+ },
+ {
+ "entropy": 1.1187219619750977,
+ "epoch": 1.38989898989899,
+ "grad_norm": 1.9923648834228516,
+ "learning_rate": 1.0747474747474748e-05,
+ "loss": 1.1112818717956543,
+ "mean_token_accuracy": 0.7198339104652405,
+ "num_tokens": 11272192.0,
+ "step": 688
+ },
+ {
+ "entropy": 1.1317063570022583,
+ "epoch": 1.391919191919192,
+ "grad_norm": 2.003026008605957,
+ "learning_rate": 1.0734006734006735e-05,
+ "loss": 1.1108404397964478,
+ "mean_token_accuracy": 0.7223986387252808,
+ "num_tokens": 11288576.0,
+ "step": 689
+ },
+ {
+ "entropy": 1.1476070880889893,
+ "epoch": 1.393939393939394,
+ "grad_norm": 2.190676689147949,
+ "learning_rate": 1.0720538720538723e-05,
+ "loss": 1.1344139575958252,
+ "mean_token_accuracy": 0.7170249223709106,
+ "num_tokens": 11304960.0,
+ "step": 690
+ },
+ {
+ "entropy": 0.8959853053092957,
+ "epoch": 1.3959595959595958,
+ "grad_norm": 2.078281879425049,
+ "learning_rate": 1.0707070707070708e-05,
+ "loss": 0.9233289361000061,
+ "mean_token_accuracy": 0.7490229606628418,
+ "num_tokens": 11321344.0,
+ "step": 691
+ },
+ {
+ "entropy": 0.8892031311988831,
+ "epoch": 1.397979797979798,
+ "grad_norm": 1.8343734741210938,
+ "learning_rate": 1.0693602693602694e-05,
+ "loss": 0.8952107429504395,
+ "mean_token_accuracy": 0.7662432789802551,
+ "num_tokens": 11337728.0,
+ "step": 692
+ },
+ {
+ "entropy": 1.0275429487228394,
+ "epoch": 1.4,
+ "grad_norm": 1.8822777271270752,
+ "learning_rate": 1.0680134680134683e-05,
+ "loss": 1.0251365900039673,
+ "mean_token_accuracy": 0.7409623861312866,
+ "num_tokens": 11354112.0,
+ "step": 693
+ },
+ {
+ "entropy": 1.2872905731201172,
+ "epoch": 1.402020202020202,
+ "grad_norm": 1.9260203838348389,
+ "learning_rate": 1.0666666666666667e-05,
+ "loss": 1.3024024963378906,
+ "mean_token_accuracy": 0.6938202381134033,
+ "num_tokens": 11370496.0,
+ "step": 694
+ },
+ {
+ "entropy": 1.0969563722610474,
+ "epoch": 1.404040404040404,
+ "grad_norm": 2.07882022857666,
+ "learning_rate": 1.0653198653198654e-05,
+ "loss": 1.086198091506958,
+ "mean_token_accuracy": 0.7195285558700562,
+ "num_tokens": 11386880.0,
+ "step": 695
+ },
+ {
+ "entropy": 1.4206339120864868,
+ "epoch": 1.406060606060606,
+ "grad_norm": 2.110828399658203,
+ "learning_rate": 1.063973063973064e-05,
+ "loss": 1.4270105361938477,
+ "mean_token_accuracy": 0.6843551397323608,
+ "num_tokens": 11403264.0,
+ "step": 696
+ },
+ {
+ "entropy": 1.3813765048980713,
+ "epoch": 1.408080808080808,
+ "grad_norm": 1.8829882144927979,
+ "learning_rate": 1.0626262626262627e-05,
+ "loss": 1.4026310443878174,
+ "mean_token_accuracy": 0.663593053817749,
+ "num_tokens": 11419648.0,
+ "step": 697
+ },
+ {
+ "entropy": 0.8580052256584167,
+ "epoch": 1.41010101010101,
+ "grad_norm": 2.0236165523529053,
+ "learning_rate": 1.0612794612794615e-05,
+ "loss": 0.8655292391777039,
+ "mean_token_accuracy": 0.7634953856468201,
+ "num_tokens": 11436032.0,
+ "step": 698
+ },
+ {
+ "entropy": 1.0694427490234375,
+ "epoch": 1.412121212121212,
+ "grad_norm": 1.8688758611679077,
+ "learning_rate": 1.05993265993266e-05,
+ "loss": 1.089691162109375,
+ "mean_token_accuracy": 0.7183072566986084,
+ "num_tokens": 11452416.0,
+ "step": 699
+ },
+ {
+ "entropy": 1.2054415941238403,
+ "epoch": 1.4141414141414141,
+ "grad_norm": 2.0692546367645264,
+ "learning_rate": 1.0585858585858586e-05,
+ "loss": 1.2053213119506836,
+ "mean_token_accuracy": 0.7134220600128174,
+ "num_tokens": 11468800.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.4141414141414141,
+ "eval_entropy": 1.2882747703021573,
+ "eval_loss": 1.535590410232544,
+ "eval_mean_token_accuracy": 0.6466120765093835,
+ "eval_num_tokens": 11468800.0,
+ "eval_runtime": 43.9264,
+ "eval_samples_per_second": 22.538,
+ "eval_steps_per_second": 2.823,
+ "step": 700
+ },
+ {
+ "entropy": 1.3370676040649414,
+ "epoch": 1.4161616161616162,
+ "grad_norm": 2.075853109359741,
+ "learning_rate": 1.0572390572390574e-05,
+ "loss": 1.3726792335510254,
+ "mean_token_accuracy": 0.6731802821159363,
+ "num_tokens": 11485184.0,
+ "step": 701
+ },
+ {
+ "entropy": 1.1095269918441772,
+ "epoch": 1.4181818181818182,
+ "grad_norm": 2.0868141651153564,
+ "learning_rate": 1.055892255892256e-05,
+ "loss": 1.124086856842041,
+ "mean_token_accuracy": 0.7162310481071472,
+ "num_tokens": 11501568.0,
+ "step": 702
+ },
+ {
+ "entropy": 1.1948339939117432,
+ "epoch": 1.4202020202020202,
+ "grad_norm": 2.091768741607666,
+ "learning_rate": 1.0545454545454546e-05,
+ "loss": 1.208143949508667,
+ "mean_token_accuracy": 0.7008426785469055,
+ "num_tokens": 11517952.0,
+ "step": 703
+ },
+ {
+ "entropy": 0.8022822141647339,
+ "epoch": 1.4222222222222223,
+ "grad_norm": 1.799911379814148,
+ "learning_rate": 1.0531986531986534e-05,
+ "loss": 0.7870017290115356,
+ "mean_token_accuracy": 0.789631187915802,
+ "num_tokens": 11534336.0,
+ "step": 704
+ },
+ {
+ "entropy": 1.0242470502853394,
+ "epoch": 1.4242424242424243,
+ "grad_norm": 1.8621245622634888,
+ "learning_rate": 1.0518518518518519e-05,
+ "loss": 1.031789779663086,
+ "mean_token_accuracy": 0.7375427484512329,
+ "num_tokens": 11550720.0,
+ "step": 705
+ },
+ {
+ "entropy": 0.9582471251487732,
+ "epoch": 1.4262626262626263,
+ "grad_norm": 2.0054924488067627,
+ "learning_rate": 1.0505050505050507e-05,
+ "loss": 0.9522819519042969,
+ "mean_token_accuracy": 0.739130437374115,
+ "num_tokens": 11567104.0,
+ "step": 706
+ },
+ {
+ "entropy": 1.172863483428955,
+ "epoch": 1.4282828282828284,
+ "grad_norm": 1.8495111465454102,
+ "learning_rate": 1.0491582491582493e-05,
+ "loss": 1.1783076524734497,
+ "mean_token_accuracy": 0.7132999300956726,
+ "num_tokens": 11583488.0,
+ "step": 707
+ },
+ {
+ "entropy": 1.2278543710708618,
+ "epoch": 1.4303030303030302,
+ "grad_norm": 2.095710277557373,
+ "learning_rate": 1.0478114478114478e-05,
+ "loss": 1.2355749607086182,
+ "mean_token_accuracy": 0.6905227303504944,
+ "num_tokens": 11599872.0,
+ "step": 708
+ },
+ {
+ "entropy": 0.9415866732597351,
+ "epoch": 1.4323232323232324,
+ "grad_norm": 1.9720549583435059,
+ "learning_rate": 1.0464646464646466e-05,
+ "loss": 0.9524072408676147,
+ "mean_token_accuracy": 0.7501221299171448,
+ "num_tokens": 11616256.0,
+ "step": 709
+ },
+ {
+ "entropy": 1.371761441230774,
+ "epoch": 1.4343434343434343,
+ "grad_norm": 2.2934458255767822,
+ "learning_rate": 1.0451178451178453e-05,
+ "loss": 1.3502682447433472,
+ "mean_token_accuracy": 0.665730357170105,
+ "num_tokens": 11632640.0,
+ "step": 710
+ },
+ {
+ "entropy": 1.1605411767959595,
+ "epoch": 1.4363636363636363,
+ "grad_norm": 1.978593349456787,
+ "learning_rate": 1.0437710437710438e-05,
+ "loss": 1.166311264038086,
+ "mean_token_accuracy": 0.6971177458763123,
+ "num_tokens": 11649024.0,
+ "step": 711
+ },
+ {
+ "entropy": 1.2717126607894897,
+ "epoch": 1.4383838383838383,
+ "grad_norm": 2.077765703201294,
+ "learning_rate": 1.0424242424242426e-05,
+ "loss": 1.2650127410888672,
+ "mean_token_accuracy": 0.6827064156532288,
+ "num_tokens": 11665408.0,
+ "step": 712
+ },
+ {
+ "entropy": 1.42205810546875,
+ "epoch": 1.4404040404040404,
+ "grad_norm": 2.152578592300415,
+ "learning_rate": 1.041077441077441e-05,
+ "loss": 1.4107255935668945,
+ "mean_token_accuracy": 0.6676233410835266,
+ "num_tokens": 11681792.0,
+ "step": 713
+ },
+ {
+ "entropy": 1.8077080249786377,
+ "epoch": 1.4424242424242424,
+ "grad_norm": 2.0739355087280273,
+ "learning_rate": 1.0397306397306399e-05,
+ "loss": 1.83225417137146,
+ "mean_token_accuracy": 0.6088177561759949,
+ "num_tokens": 11698176.0,
+ "step": 714
+ },
+ {
+ "entropy": 1.3185032606124878,
+ "epoch": 1.4444444444444444,
+ "grad_norm": 2.1207802295684814,
+ "learning_rate": 1.0383838383838385e-05,
+ "loss": 1.3216420412063599,
+ "mean_token_accuracy": 0.6762335300445557,
+ "num_tokens": 11714560.0,
+ "step": 715
+ },
+ {
+ "entropy": 1.1990821361541748,
+ "epoch": 1.4464646464646465,
+ "grad_norm": 1.9028881788253784,
+ "learning_rate": 1.037037037037037e-05,
+ "loss": 1.2123594284057617,
+ "mean_token_accuracy": 0.7231314182281494,
+ "num_tokens": 11730944.0,
+ "step": 716
+ },
+ {
+ "entropy": 1.1971170902252197,
+ "epoch": 1.4484848484848485,
+ "grad_norm": 2.071993827819824,
+ "learning_rate": 1.0356902356902358e-05,
+ "loss": 1.1753935813903809,
+ "mean_token_accuracy": 0.7173302173614502,
+ "num_tokens": 11747328.0,
+ "step": 717
+ },
+ {
+ "entropy": 1.16183602809906,
+ "epoch": 1.4505050505050505,
+ "grad_norm": 2.0574443340301514,
+ "learning_rate": 1.0343434343434345e-05,
+ "loss": 1.171074390411377,
+ "mean_token_accuracy": 0.7076819539070129,
+ "num_tokens": 11763712.0,
+ "step": 718
+ },
+ {
+ "entropy": 1.1637240648269653,
+ "epoch": 1.4525252525252526,
+ "grad_norm": 1.9361884593963623,
+ "learning_rate": 1.032996632996633e-05,
+ "loss": 1.1374025344848633,
+ "mean_token_accuracy": 0.7241694927215576,
+ "num_tokens": 11780096.0,
+ "step": 719
+ },
+ {
+ "entropy": 1.0883492231369019,
+ "epoch": 1.4545454545454546,
+ "grad_norm": 2.0204899311065674,
+ "learning_rate": 1.0316498316498318e-05,
+ "loss": 1.0666342973709106,
+ "mean_token_accuracy": 0.7216047644615173,
+ "num_tokens": 11796480.0,
+ "step": 720
+ },
+ {
+ "entropy": 1.3728728294372559,
+ "epoch": 1.4565656565656566,
+ "grad_norm": 1.8690729141235352,
+ "learning_rate": 1.0303030303030304e-05,
+ "loss": 1.3879103660583496,
+ "mean_token_accuracy": 0.6769052147865295,
+ "num_tokens": 11812864.0,
+ "step": 721
+ },
+ {
+ "entropy": 1.1204687356948853,
+ "epoch": 1.4585858585858587,
+ "grad_norm": 2.091113567352295,
+ "learning_rate": 1.0289562289562289e-05,
+ "loss": 1.1190675497055054,
+ "mean_token_accuracy": 0.7191621661186218,
+ "num_tokens": 11829248.0,
+ "step": 722
+ },
+ {
+ "entropy": 1.479430913925171,
+ "epoch": 1.4606060606060607,
+ "grad_norm": 2.194871187210083,
+ "learning_rate": 1.0276094276094277e-05,
+ "loss": 1.4967867136001587,
+ "mean_token_accuracy": 0.6475329995155334,
+ "num_tokens": 11845632.0,
+ "step": 723
+ },
+ {
+ "entropy": 1.083875060081482,
+ "epoch": 1.4626262626262627,
+ "grad_norm": 1.9257639646530151,
+ "learning_rate": 1.0262626262626264e-05,
+ "loss": 1.1053729057312012,
+ "mean_token_accuracy": 0.7168416976928711,
+ "num_tokens": 11862016.0,
+ "step": 724
+ },
+ {
+ "entropy": 1.074636697769165,
+ "epoch": 1.4646464646464645,
+ "grad_norm": 1.956766963005066,
+ "learning_rate": 1.024915824915825e-05,
+ "loss": 1.0775985717773438,
+ "mean_token_accuracy": 0.7348558902740479,
+ "num_tokens": 11878400.0,
+ "step": 725
+ },
+ {
+ "entropy": 1.1595367193222046,
+ "epoch": 1.4666666666666668,
+ "grad_norm": 2.0679080486297607,
+ "learning_rate": 1.0235690235690236e-05,
+ "loss": 1.1976954936981201,
+ "mean_token_accuracy": 0.7014533281326294,
+ "num_tokens": 11894784.0,
+ "step": 726
+ },
+ {
+ "entropy": 1.0546326637268066,
+ "epoch": 1.4686868686868686,
+ "grad_norm": 1.8939472436904907,
+ "learning_rate": 1.0222222222222223e-05,
+ "loss": 1.0483310222625732,
+ "mean_token_accuracy": 0.7339398860931396,
+ "num_tokens": 11911168.0,
+ "step": 727
+ },
+ {
+ "entropy": 1.3418383598327637,
+ "epoch": 1.4707070707070706,
+ "grad_norm": 2.239595413208008,
+ "learning_rate": 1.020875420875421e-05,
+ "loss": 1.35018789768219,
+ "mean_token_accuracy": 0.6685393452644348,
+ "num_tokens": 11927552.0,
+ "step": 728
+ },
+ {
+ "entropy": 0.9122293591499329,
+ "epoch": 1.4727272727272727,
+ "grad_norm": 2.1075761318206787,
+ "learning_rate": 1.0195286195286196e-05,
+ "loss": 0.9050356149673462,
+ "mean_token_accuracy": 0.7633121609687805,
+ "num_tokens": 11943936.0,
+ "step": 729
+ },
+ {
+ "entropy": 0.9527847766876221,
+ "epoch": 1.4747474747474747,
+ "grad_norm": 2.017185688018799,
+ "learning_rate": 1.0181818181818182e-05,
+ "loss": 0.9490136504173279,
+ "mean_token_accuracy": 0.7539081573486328,
+ "num_tokens": 11960320.0,
+ "step": 730
+ },
+ {
+ "entropy": 1.2855827808380127,
+ "epoch": 1.4767676767676767,
+ "grad_norm": 1.9821733236312866,
+ "learning_rate": 1.0168350168350169e-05,
+ "loss": 1.2902567386627197,
+ "mean_token_accuracy": 0.6854543089866638,
+ "num_tokens": 11976704.0,
+ "step": 731
+ },
+ {
+ "entropy": 1.143114686012268,
+ "epoch": 1.4787878787878788,
+ "grad_norm": 2.0281424522399902,
+ "learning_rate": 1.0154882154882155e-05,
+ "loss": 1.1373090744018555,
+ "mean_token_accuracy": 0.7071934342384338,
+ "num_tokens": 11993088.0,
+ "step": 732
+ },
+ {
+ "entropy": 1.1341931819915771,
+ "epoch": 1.4808080808080808,
+ "grad_norm": 2.075814723968506,
+ "learning_rate": 1.0141414141414144e-05,
+ "loss": 1.1449689865112305,
+ "mean_token_accuracy": 0.7180019617080688,
+ "num_tokens": 12009472.0,
+ "step": 733
+ },
+ {
+ "entropy": 0.9200477004051208,
+ "epoch": 1.4828282828282828,
+ "grad_norm": 1.7193031311035156,
+ "learning_rate": 1.0127946127946128e-05,
+ "loss": 0.9225804209709167,
+ "mean_token_accuracy": 0.7621519565582275,
+ "num_tokens": 12025856.0,
+ "step": 734
+ },
+ {
+ "entropy": 1.3266046047210693,
+ "epoch": 1.4848484848484849,
+ "grad_norm": 2.0543408393859863,
+ "learning_rate": 1.0114478114478115e-05,
+ "loss": 1.3158385753631592,
+ "mean_token_accuracy": 0.6758060455322266,
+ "num_tokens": 12042240.0,
+ "step": 735
+ },
+ {
+ "entropy": 1.2785359621047974,
+ "epoch": 1.486868686868687,
+ "grad_norm": 2.0174546241760254,
+ "learning_rate": 1.0101010101010103e-05,
+ "loss": 1.269796371459961,
+ "mean_token_accuracy": 0.7070102691650391,
+ "num_tokens": 12058624.0,
+ "step": 736
+ },
+ {
+ "entropy": 1.3418751955032349,
+ "epoch": 1.488888888888889,
+ "grad_norm": 2.0906383991241455,
+ "learning_rate": 1.0087542087542088e-05,
+ "loss": 1.35174560546875,
+ "mean_token_accuracy": 0.6758060455322266,
+ "num_tokens": 12075008.0,
+ "step": 737
+ },
+ {
+ "entropy": 1.266552448272705,
+ "epoch": 1.490909090909091,
+ "grad_norm": 1.7485158443450928,
+ "learning_rate": 1.0074074074074074e-05,
+ "loss": 1.2538254261016846,
+ "mean_token_accuracy": 0.7070713043212891,
+ "num_tokens": 12091392.0,
+ "step": 738
+ },
+ {
+ "entropy": 0.9562437534332275,
+ "epoch": 1.492929292929293,
+ "grad_norm": 1.9106290340423584,
+ "learning_rate": 1.0060606060606062e-05,
+ "loss": 0.938219428062439,
+ "mean_token_accuracy": 0.7383365631103516,
+ "num_tokens": 12107776.0,
+ "step": 739
+ },
+ {
+ "entropy": 1.3171569108963013,
+ "epoch": 1.494949494949495,
+ "grad_norm": 2.127641439437866,
+ "learning_rate": 1.0047138047138047e-05,
+ "loss": 1.3213756084442139,
+ "mean_token_accuracy": 0.6819125413894653,
+ "num_tokens": 12124160.0,
+ "step": 740
+ },
+ {
+ "entropy": 1.0634039640426636,
+ "epoch": 1.496969696969697,
+ "grad_norm": 2.0710532665252686,
+ "learning_rate": 1.0033670033670035e-05,
+ "loss": 1.0797393321990967,
+ "mean_token_accuracy": 0.7150708436965942,
+ "num_tokens": 12140544.0,
+ "step": 741
+ },
+ {
+ "entropy": 1.3235414028167725,
+ "epoch": 1.4989898989898989,
+ "grad_norm": 2.040738105773926,
+ "learning_rate": 1.0020202020202022e-05,
+ "loss": 1.3383063077926636,
+ "mean_token_accuracy": 0.6737298369407654,
+ "num_tokens": 12156928.0,
+ "step": 742
+ },
+ {
+ "entropy": 1.2156025171279907,
+ "epoch": 1.5010101010101011,
+ "grad_norm": 2.196033239364624,
+ "learning_rate": 1.0006734006734007e-05,
+ "loss": 1.2233551740646362,
+ "mean_token_accuracy": 0.7015144228935242,
+ "num_tokens": 12173312.0,
+ "step": 743
+ },
+ {
+ "entropy": 0.9380976557731628,
+ "epoch": 1.503030303030303,
+ "grad_norm": 1.951636791229248,
+ "learning_rate": 9.993265993265993e-06,
+ "loss": 0.9319983124732971,
+ "mean_token_accuracy": 0.7494503855705261,
+ "num_tokens": 12189696.0,
+ "step": 744
+ },
+ {
+ "entropy": 1.3272504806518555,
+ "epoch": 1.5050505050505052,
+ "grad_norm": 2.045417308807373,
+ "learning_rate": 9.97979797979798e-06,
+ "loss": 1.3266823291778564,
+ "mean_token_accuracy": 0.6848436594009399,
+ "num_tokens": 12206080.0,
+ "step": 745
+ },
+ {
+ "entropy": 0.955014705657959,
+ "epoch": 1.507070707070707,
+ "grad_norm": 1.7301888465881348,
+ "learning_rate": 9.966329966329968e-06,
+ "loss": 0.9721895456314087,
+ "mean_token_accuracy": 0.7561064958572388,
+ "num_tokens": 12222464.0,
+ "step": 746
+ },
+ {
+ "entropy": 1.0614056587219238,
+ "epoch": 1.509090909090909,
+ "grad_norm": 2.235422372817993,
+ "learning_rate": 9.952861952861954e-06,
+ "loss": 1.081586241722107,
+ "mean_token_accuracy": 0.7147044539451599,
+ "num_tokens": 12238848.0,
+ "step": 747
+ },
+ {
+ "entropy": 1.075492024421692,
+ "epoch": 1.511111111111111,
+ "grad_norm": 2.0352933406829834,
+ "learning_rate": 9.939393939393939e-06,
+ "loss": 1.083856463432312,
+ "mean_token_accuracy": 0.7148265838623047,
+ "num_tokens": 12255232.0,
+ "step": 748
+ },
+ {
+ "entropy": 1.1964384317398071,
+ "epoch": 1.513131313131313,
+ "grad_norm": 1.9096226692199707,
+ "learning_rate": 9.925925925925927e-06,
+ "loss": 1.1777125597000122,
+ "mean_token_accuracy": 0.7061553597450256,
+ "num_tokens": 12271616.0,
+ "step": 749
+ },
+ {
+ "entropy": 1.2923556566238403,
+ "epoch": 1.5151515151515151,
+ "grad_norm": 2.1002533435821533,
+ "learning_rate": 9.912457912457914e-06,
+ "loss": 1.2916597127914429,
+ "mean_token_accuracy": 0.6882632970809937,
+ "num_tokens": 12288000.0,
+ "step": 750
+ },
+ {
+ "entropy": 1.008608341217041,
+ "epoch": 1.5171717171717172,
+ "grad_norm": 2.1212828159332275,
+ "learning_rate": 9.8989898989899e-06,
+ "loss": 1.0104637145996094,
+ "mean_token_accuracy": 0.7343673706054688,
+ "num_tokens": 12304384.0,
+ "step": 751
+ },
+ {
+ "entropy": 1.550642967224121,
+ "epoch": 1.5191919191919192,
+ "grad_norm": 1.9693539142608643,
+ "learning_rate": 9.885521885521887e-06,
+ "loss": 1.5664982795715332,
+ "mean_token_accuracy": 0.6830728054046631,
+ "num_tokens": 12320768.0,
+ "step": 752
+ },
+ {
+ "entropy": 1.3540711402893066,
+ "epoch": 1.5212121212121212,
+ "grad_norm": 2.181079149246216,
+ "learning_rate": 9.872053872053873e-06,
+ "loss": 1.3578659296035767,
+ "mean_token_accuracy": 0.666829526424408,
+ "num_tokens": 12337152.0,
+ "step": 753
+ },
+ {
+ "entropy": 1.002195119857788,
+ "epoch": 1.5232323232323233,
+ "grad_norm": 2.051185369491577,
+ "learning_rate": 9.85858585858586e-06,
+ "loss": 0.9798580408096313,
+ "mean_token_accuracy": 0.7434660196304321,
+ "num_tokens": 12353536.0,
+ "step": 754
+ },
+ {
+ "entropy": 1.2805551290512085,
+ "epoch": 1.5252525252525253,
+ "grad_norm": 2.0427937507629395,
+ "learning_rate": 9.845117845117846e-06,
+ "loss": 1.2829053401947021,
+ "mean_token_accuracy": 0.6933317184448242,
+ "num_tokens": 12369920.0,
+ "step": 755
+ },
+ {
+ "entropy": 1.3517152070999146,
+ "epoch": 1.5272727272727273,
+ "grad_norm": 2.0065114498138428,
+ "learning_rate": 9.831649831649833e-06,
+ "loss": 1.3636512756347656,
+ "mean_token_accuracy": 0.6757450103759766,
+ "num_tokens": 12386304.0,
+ "step": 756
+ },
+ {
+ "entropy": 0.7547817826271057,
+ "epoch": 1.5292929292929291,
+ "grad_norm": 3.2289278507232666,
+ "learning_rate": 9.81818181818182e-06,
+ "loss": 0.7594918012619019,
+ "mean_token_accuracy": 0.7917684316635132,
+ "num_tokens": 12402688.0,
+ "step": 757
+ },
+ {
+ "entropy": 1.4882941246032715,
+ "epoch": 1.5313131313131314,
+ "grad_norm": 1.9724371433258057,
+ "learning_rate": 9.804713804713806e-06,
+ "loss": 1.4832470417022705,
+ "mean_token_accuracy": 0.6436858773231506,
+ "num_tokens": 12419072.0,
+ "step": 758
+ },
+ {
+ "entropy": 0.9879036545753479,
+ "epoch": 1.5333333333333332,
+ "grad_norm": 1.9205714464187622,
+ "learning_rate": 9.791245791245792e-06,
+ "loss": 0.9901232123374939,
+ "mean_token_accuracy": 0.7465192675590515,
+ "num_tokens": 12435456.0,
+ "step": 759
+ },
+ {
+ "entropy": 0.9692004919052124,
+ "epoch": 1.5353535353535355,
+ "grad_norm": 1.8762351274490356,
+ "learning_rate": 9.777777777777779e-06,
+ "loss": 0.9544116258621216,
+ "mean_token_accuracy": 0.7518319487571716,
+ "num_tokens": 12451840.0,
+ "step": 760
+ },
+ {
+ "entropy": 0.8084391951560974,
+ "epoch": 1.5373737373737373,
+ "grad_norm": 1.9590117931365967,
+ "learning_rate": 9.764309764309765e-06,
+ "loss": 0.8268290162086487,
+ "mean_token_accuracy": 0.7758305072784424,
+ "num_tokens": 12468224.0,
+ "step": 761
+ },
+ {
+ "entropy": 1.2048877477645874,
+ "epoch": 1.5393939393939395,
+ "grad_norm": 2.1473560333251953,
+ "learning_rate": 9.750841750841752e-06,
+ "loss": 1.1967238187789917,
+ "mean_token_accuracy": 0.7075598239898682,
+ "num_tokens": 12484608.0,
+ "step": 762
+ },
+ {
+ "entropy": 1.330485224723816,
+ "epoch": 1.5414141414141413,
+ "grad_norm": 2.0944108963012695,
+ "learning_rate": 9.737373737373738e-06,
+ "loss": 1.3377408981323242,
+ "mean_token_accuracy": 0.6920493245124817,
+ "num_tokens": 12500992.0,
+ "step": 763
+ },
+ {
+ "entropy": 0.994591474533081,
+ "epoch": 1.5434343434343434,
+ "grad_norm": 2.224015712738037,
+ "learning_rate": 9.723905723905725e-06,
+ "loss": 0.9741864204406738,
+ "mean_token_accuracy": 0.734306275844574,
+ "num_tokens": 12517376.0,
+ "step": 764
+ },
+ {
+ "entropy": 1.3140320777893066,
+ "epoch": 1.5454545454545454,
+ "grad_norm": 2.0910675525665283,
+ "learning_rate": 9.710437710437711e-06,
+ "loss": 1.3168857097625732,
+ "mean_token_accuracy": 0.6908280253410339,
+ "num_tokens": 12533760.0,
+ "step": 765
+ },
+ {
+ "entropy": 0.5885581374168396,
+ "epoch": 1.5474747474747474,
+ "grad_norm": 1.6729995012283325,
+ "learning_rate": 9.696969696969698e-06,
+ "loss": 0.587052583694458,
+ "mean_token_accuracy": 0.8340253829956055,
+ "num_tokens": 12550144.0,
+ "step": 766
+ },
+ {
+ "entropy": 1.1873608827590942,
+ "epoch": 1.5494949494949495,
+ "grad_norm": 2.0278220176696777,
+ "learning_rate": 9.683501683501684e-06,
+ "loss": 1.1988582611083984,
+ "mean_token_accuracy": 0.708109438419342,
+ "num_tokens": 12566528.0,
+ "step": 767
+ },
+ {
+ "entropy": 1.600446343421936,
+ "epoch": 1.5515151515151515,
+ "grad_norm": 2.1766979694366455,
+ "learning_rate": 9.67003367003367e-06,
+ "loss": 1.6514582633972168,
+ "mean_token_accuracy": 0.6134586930274963,
+ "num_tokens": 12582912.0,
+ "step": 768
+ },
+ {
+ "entropy": 1.3398208618164062,
+ "epoch": 1.5535353535353535,
+ "grad_norm": 2.3216426372528076,
+ "learning_rate": 9.656565656565657e-06,
+ "loss": 1.3702855110168457,
+ "mean_token_accuracy": 0.6650586128234863,
+ "num_tokens": 12599296.0,
+ "step": 769
+ },
+ {
+ "entropy": 1.061170220375061,
+ "epoch": 1.5555555555555556,
+ "grad_norm": 1.9703660011291504,
+ "learning_rate": 9.643097643097643e-06,
+ "loss": 1.0738681554794312,
+ "mean_token_accuracy": 0.7376648783683777,
+ "num_tokens": 12615680.0,
+ "step": 770
+ },
+ {
+ "entropy": 1.1564687490463257,
+ "epoch": 1.5575757575757576,
+ "grad_norm": 2.0951433181762695,
+ "learning_rate": 9.62962962962963e-06,
+ "loss": 1.1778810024261475,
+ "mean_token_accuracy": 0.7112237215042114,
+ "num_tokens": 12632064.0,
+ "step": 771
+ },
+ {
+ "entropy": 0.8667913675308228,
+ "epoch": 1.5595959595959596,
+ "grad_norm": 1.9066787958145142,
+ "learning_rate": 9.616161616161616e-06,
+ "loss": 0.8634734153747559,
+ "mean_token_accuracy": 0.769052267074585,
+ "num_tokens": 12648448.0,
+ "step": 772
+ },
+ {
+ "entropy": 1.20845627784729,
+ "epoch": 1.5616161616161617,
+ "grad_norm": 2.0367836952209473,
+ "learning_rate": 9.602693602693603e-06,
+ "loss": 1.2191519737243652,
+ "mean_token_accuracy": 0.69840008020401,
+ "num_tokens": 12664832.0,
+ "step": 773
+ },
+ {
+ "entropy": 1.3325128555297852,
+ "epoch": 1.5636363636363635,
+ "grad_norm": 2.000307083129883,
+ "learning_rate": 9.589225589225591e-06,
+ "loss": 1.3183135986328125,
+ "mean_token_accuracy": 0.6904006004333496,
+ "num_tokens": 12681216.0,
+ "step": 774
+ },
+ {
+ "entropy": 1.3372687101364136,
+ "epoch": 1.5656565656565657,
+ "grad_norm": 2.2447569370269775,
+ "learning_rate": 9.575757575757576e-06,
+ "loss": 1.3026032447814941,
+ "mean_token_accuracy": 0.6769663095474243,
+ "num_tokens": 12697600.0,
+ "step": 775
+ },
+ {
+ "entropy": 1.1477705240249634,
+ "epoch": 1.5676767676767676,
+ "grad_norm": 1.9308643341064453,
+ "learning_rate": 9.562289562289562e-06,
+ "loss": 1.1485618352890015,
+ "mean_token_accuracy": 0.7186126112937927,
+ "num_tokens": 12713984.0,
+ "step": 776
+ },
+ {
+ "entropy": 1.021490454673767,
+ "epoch": 1.5696969696969698,
+ "grad_norm": 1.9314731359481812,
+ "learning_rate": 9.548821548821549e-06,
+ "loss": 1.002140998840332,
+ "mean_token_accuracy": 0.735344409942627,
+ "num_tokens": 12730368.0,
+ "step": 777
+ },
+ {
+ "entropy": 1.1351706981658936,
+ "epoch": 1.5717171717171716,
+ "grad_norm": 1.9402823448181152,
+ "learning_rate": 9.535353535353537e-06,
+ "loss": 1.1265199184417725,
+ "mean_token_accuracy": 0.716292142868042,
+ "num_tokens": 12746752.0,
+ "step": 778
+ },
+ {
+ "entropy": 0.9608347415924072,
+ "epoch": 1.5737373737373739,
+ "grad_norm": 1.9762189388275146,
+ "learning_rate": 9.521885521885522e-06,
+ "loss": 0.9408327341079712,
+ "mean_token_accuracy": 0.7556179761886597,
+ "num_tokens": 12763136.0,
+ "step": 779
+ },
+ {
+ "entropy": 1.2921335697174072,
+ "epoch": 1.5757575757575757,
+ "grad_norm": 1.9008197784423828,
+ "learning_rate": 9.508417508417508e-06,
+ "loss": 1.298734426498413,
+ "mean_token_accuracy": 0.6901563405990601,
+ "num_tokens": 12779520.0,
+ "step": 780
+ },
+ {
+ "entropy": 1.1303656101226807,
+ "epoch": 1.5777777777777777,
+ "grad_norm": 2.368401527404785,
+ "learning_rate": 9.494949494949497e-06,
+ "loss": 1.1172974109649658,
+ "mean_token_accuracy": 0.7112848162651062,
+ "num_tokens": 12795904.0,
+ "step": 781
+ },
+ {
+ "entropy": 1.5801783800125122,
+ "epoch": 1.5797979797979798,
+ "grad_norm": 2.1036503314971924,
+ "learning_rate": 9.481481481481483e-06,
+ "loss": 1.5825071334838867,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 12812288.0,
+ "step": 782
+ },
+ {
+ "entropy": 1.1247191429138184,
+ "epoch": 1.5818181818181818,
+ "grad_norm": 2.0482163429260254,
+ "learning_rate": 9.468013468013468e-06,
+ "loss": 1.1644407510757446,
+ "mean_token_accuracy": 0.7239863276481628,
+ "num_tokens": 12828672.0,
+ "step": 783
+ },
+ {
+ "entropy": 1.6274546384811401,
+ "epoch": 1.5838383838383838,
+ "grad_norm": 2.075209379196167,
+ "learning_rate": 9.454545454545456e-06,
+ "loss": 1.6390056610107422,
+ "mean_token_accuracy": 0.6265266537666321,
+ "num_tokens": 12845056.0,
+ "step": 784
+ },
+ {
+ "entropy": 1.1876834630966187,
+ "epoch": 1.5858585858585859,
+ "grad_norm": 2.3457517623901367,
+ "learning_rate": 9.441077441077442e-06,
+ "loss": 1.229914903640747,
+ "mean_token_accuracy": 0.686431348323822,
+ "num_tokens": 12861440.0,
+ "step": 785
+ },
+ {
+ "entropy": 1.0943474769592285,
+ "epoch": 1.587878787878788,
+ "grad_norm": 2.2637226581573486,
+ "learning_rate": 9.427609427609429e-06,
+ "loss": 1.1246657371520996,
+ "mean_token_accuracy": 0.7178187370300293,
+ "num_tokens": 12877824.0,
+ "step": 786
+ },
+ {
+ "entropy": 1.1606156826019287,
+ "epoch": 1.58989898989899,
+ "grad_norm": 2.1095638275146484,
+ "learning_rate": 9.414141414141414e-06,
+ "loss": 1.146558403968811,
+ "mean_token_accuracy": 0.7142769694328308,
+ "num_tokens": 12894208.0,
+ "step": 787
+ },
+ {
+ "entropy": 0.7914054989814758,
+ "epoch": 1.591919191919192,
+ "grad_norm": 2.0504069328308105,
+ "learning_rate": 9.400673400673402e-06,
+ "loss": 0.7990944385528564,
+ "mean_token_accuracy": 0.7863947153091431,
+ "num_tokens": 12910592.0,
+ "step": 788
+ },
+ {
+ "entropy": 1.2664366960525513,
+ "epoch": 1.593939393939394,
+ "grad_norm": 2.174043893814087,
+ "learning_rate": 9.387205387205388e-06,
+ "loss": 1.263155221939087,
+ "mean_token_accuracy": 0.6905227303504944,
+ "num_tokens": 12926976.0,
+ "step": 789
+ },
+ {
+ "entropy": 1.6059703826904297,
+ "epoch": 1.595959595959596,
+ "grad_norm": 2.0089824199676514,
+ "learning_rate": 9.373737373737375e-06,
+ "loss": 1.628819465637207,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 12943360.0,
+ "step": 790
+ },
+ {
+ "entropy": 1.4796923398971558,
+ "epoch": 1.5979797979797978,
+ "grad_norm": 2.4513726234436035,
+ "learning_rate": 9.360269360269361e-06,
+ "loss": 1.5144509077072144,
+ "mean_token_accuracy": 0.6381289958953857,
+ "num_tokens": 12959744.0,
+ "step": 791
+ },
+ {
+ "entropy": 1.1704087257385254,
+ "epoch": 1.6,
+ "grad_norm": 2.079355478286743,
+ "learning_rate": 9.346801346801348e-06,
+ "loss": 1.1726913452148438,
+ "mean_token_accuracy": 0.709208607673645,
+ "num_tokens": 12976128.0,
+ "step": 792
+ },
+ {
+ "entropy": 1.2573802471160889,
+ "epoch": 1.602020202020202,
+ "grad_norm": 2.087904453277588,
+ "learning_rate": 9.333333333333334e-06,
+ "loss": 1.2652850151062012,
+ "mean_token_accuracy": 0.6868588328361511,
+ "num_tokens": 12992512.0,
+ "step": 793
+ },
+ {
+ "entropy": 1.5265566110610962,
+ "epoch": 1.6040404040404042,
+ "grad_norm": 2.1586968898773193,
+ "learning_rate": 9.31986531986532e-06,
+ "loss": 1.5234975814819336,
+ "mean_token_accuracy": 0.6436248421669006,
+ "num_tokens": 13008896.0,
+ "step": 794
+ },
+ {
+ "entropy": 1.2587038278579712,
+ "epoch": 1.606060606060606,
+ "grad_norm": 2.0685694217681885,
+ "learning_rate": 9.306397306397307e-06,
+ "loss": 1.2585840225219727,
+ "mean_token_accuracy": 0.6930874586105347,
+ "num_tokens": 13025280.0,
+ "step": 795
+ },
+ {
+ "entropy": 1.1857022047042847,
+ "epoch": 1.6080808080808082,
+ "grad_norm": 2.0476908683776855,
+ "learning_rate": 9.292929292929294e-06,
+ "loss": 1.2005798816680908,
+ "mean_token_accuracy": 0.693453848361969,
+ "num_tokens": 13041664.0,
+ "step": 796
+ },
+ {
+ "entropy": 1.5042216777801514,
+ "epoch": 1.61010101010101,
+ "grad_norm": 1.973929762840271,
+ "learning_rate": 9.27946127946128e-06,
+ "loss": 1.5095748901367188,
+ "mean_token_accuracy": 0.6579140424728394,
+ "num_tokens": 13058048.0,
+ "step": 797
+ },
+ {
+ "entropy": 1.5203564167022705,
+ "epoch": 1.612121212121212,
+ "grad_norm": 1.957383155822754,
+ "learning_rate": 9.265993265993267e-06,
+ "loss": 1.4991892576217651,
+ "mean_token_accuracy": 0.6539447903633118,
+ "num_tokens": 13074432.0,
+ "step": 798
+ },
+ {
+ "entropy": 1.3984291553497314,
+ "epoch": 1.614141414141414,
+ "grad_norm": 2.143216848373413,
+ "learning_rate": 9.252525252525253e-06,
+ "loss": 1.3863308429718018,
+ "mean_token_accuracy": 0.6649364829063416,
+ "num_tokens": 13090816.0,
+ "step": 799
+ },
+ {
+ "entropy": 1.662933111190796,
+ "epoch": 1.6161616161616161,
+ "grad_norm": 2.111069440841675,
+ "learning_rate": 9.23905723905724e-06,
+ "loss": 1.6813087463378906,
+ "mean_token_accuracy": 0.6262823939323425,
+ "num_tokens": 13107200.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.6161616161616161,
+ "eval_entropy": 1.3006088190501737,
+ "eval_loss": 1.5314096212387085,
+ "eval_mean_token_accuracy": 0.6469700956536878,
+ "eval_num_tokens": 13107200.0,
+ "eval_runtime": 43.8956,
+ "eval_samples_per_second": 22.554,
+ "eval_steps_per_second": 2.825,
+ "step": 800
+ },
+ {
+ "entropy": 1.709677815437317,
+ "epoch": 1.6181818181818182,
+ "grad_norm": 2.790998935699463,
+ "learning_rate": 9.225589225589226e-06,
+ "loss": 1.740628719329834,
+ "mean_token_accuracy": 0.6136419177055359,
+ "num_tokens": 13123584.0,
+ "step": 801
+ },
+ {
+ "entropy": 1.2373168468475342,
+ "epoch": 1.6202020202020202,
+ "grad_norm": 2.49934458732605,
+ "learning_rate": 9.212121212121213e-06,
+ "loss": 1.2430124282836914,
+ "mean_token_accuracy": 0.6856985688209534,
+ "num_tokens": 13139968.0,
+ "step": 802
+ },
+ {
+ "entropy": 1.4974594116210938,
+ "epoch": 1.6222222222222222,
+ "grad_norm": 2.015254259109497,
+ "learning_rate": 9.1986531986532e-06,
+ "loss": 1.5037147998809814,
+ "mean_token_accuracy": 0.6581583023071289,
+ "num_tokens": 13156352.0,
+ "step": 803
+ },
+ {
+ "entropy": 1.0019752979278564,
+ "epoch": 1.6242424242424243,
+ "grad_norm": 1.9795469045639038,
+ "learning_rate": 9.185185185185186e-06,
+ "loss": 1.0053883790969849,
+ "mean_token_accuracy": 0.7297264337539673,
+ "num_tokens": 13172736.0,
+ "step": 804
+ },
+ {
+ "entropy": 1.2690199613571167,
+ "epoch": 1.6262626262626263,
+ "grad_norm": 2.1013784408569336,
+ "learning_rate": 9.171717171717172e-06,
+ "loss": 1.2500054836273193,
+ "mean_token_accuracy": 0.6856985688209534,
+ "num_tokens": 13189120.0,
+ "step": 805
+ },
+ {
+ "entropy": 1.1282989978790283,
+ "epoch": 1.6282828282828283,
+ "grad_norm": 2.2034029960632324,
+ "learning_rate": 9.15824915824916e-06,
+ "loss": 1.1393691301345825,
+ "mean_token_accuracy": 0.7051783204078674,
+ "num_tokens": 13205504.0,
+ "step": 806
+ },
+ {
+ "entropy": 1.1744720935821533,
+ "epoch": 1.6303030303030304,
+ "grad_norm": 1.9687124490737915,
+ "learning_rate": 9.144781144781145e-06,
+ "loss": 1.1625237464904785,
+ "mean_token_accuracy": 0.7002931237220764,
+ "num_tokens": 13221888.0,
+ "step": 807
+ },
+ {
+ "entropy": 0.9849017858505249,
+ "epoch": 1.6323232323232322,
+ "grad_norm": 1.9646586179733276,
+ "learning_rate": 9.131313131313132e-06,
+ "loss": 0.9992689490318298,
+ "mean_token_accuracy": 0.7460307478904724,
+ "num_tokens": 13238272.0,
+ "step": 808
+ },
+ {
+ "entropy": 1.142819881439209,
+ "epoch": 1.6343434343434344,
+ "grad_norm": 1.975189208984375,
+ "learning_rate": 9.117845117845118e-06,
+ "loss": 1.1389580965042114,
+ "mean_token_accuracy": 0.710368812084198,
+ "num_tokens": 13254656.0,
+ "step": 809
+ },
+ {
+ "entropy": 1.1362377405166626,
+ "epoch": 1.6363636363636362,
+ "grad_norm": 2.0360374450683594,
+ "learning_rate": 9.104377104377106e-06,
+ "loss": 1.15363609790802,
+ "mean_token_accuracy": 0.7113458514213562,
+ "num_tokens": 13271040.0,
+ "step": 810
+ },
+ {
+ "entropy": 1.6209924221038818,
+ "epoch": 1.6383838383838385,
+ "grad_norm": 2.2165496349334717,
+ "learning_rate": 9.090909090909091e-06,
+ "loss": 1.637102484703064,
+ "mean_token_accuracy": 0.6318392753601074,
+ "num_tokens": 13287424.0,
+ "step": 811
+ },
+ {
+ "entropy": 1.050283432006836,
+ "epoch": 1.6404040404040403,
+ "grad_norm": 2.0473668575286865,
+ "learning_rate": 9.077441077441078e-06,
+ "loss": 1.0430940389633179,
+ "mean_token_accuracy": 0.7264899611473083,
+ "num_tokens": 13303808.0,
+ "step": 812
+ },
+ {
+ "entropy": 1.0707964897155762,
+ "epoch": 1.6424242424242426,
+ "grad_norm": 2.013641357421875,
+ "learning_rate": 9.063973063973066e-06,
+ "loss": 1.0929813385009766,
+ "mean_token_accuracy": 0.7231924533843994,
+ "num_tokens": 13320192.0,
+ "step": 813
+ },
+ {
+ "entropy": 0.8777739405632019,
+ "epoch": 1.6444444444444444,
+ "grad_norm": 1.815849781036377,
+ "learning_rate": 9.050505050505052e-06,
+ "loss": 0.868852972984314,
+ "mean_token_accuracy": 0.7692965269088745,
+ "num_tokens": 13336576.0,
+ "step": 814
+ },
+ {
+ "entropy": 1.1157307624816895,
+ "epoch": 1.6464646464646466,
+ "grad_norm": 2.1264355182647705,
+ "learning_rate": 9.037037037037037e-06,
+ "loss": 1.1249959468841553,
+ "mean_token_accuracy": 0.7153151035308838,
+ "num_tokens": 13352960.0,
+ "step": 815
+ },
+ {
+ "entropy": 1.348052740097046,
+ "epoch": 1.6484848484848484,
+ "grad_norm": 1.951642394065857,
+ "learning_rate": 9.023569023569025e-06,
+ "loss": 1.3196947574615479,
+ "mean_token_accuracy": 0.6911333799362183,
+ "num_tokens": 13369344.0,
+ "step": 816
+ },
+ {
+ "entropy": 1.2172725200653076,
+ "epoch": 1.6505050505050505,
+ "grad_norm": 2.2433671951293945,
+ "learning_rate": 9.010101010101012e-06,
+ "loss": 1.1833471059799194,
+ "mean_token_accuracy": 0.6938812732696533,
+ "num_tokens": 13385728.0,
+ "step": 817
+ },
+ {
+ "entropy": 1.5047324895858765,
+ "epoch": 1.6525252525252525,
+ "grad_norm": 2.015489101409912,
+ "learning_rate": 8.996632996632996e-06,
+ "loss": 1.48842453956604,
+ "mean_token_accuracy": 0.6552271842956543,
+ "num_tokens": 13402112.0,
+ "step": 818
+ },
+ {
+ "entropy": 1.3752695322036743,
+ "epoch": 1.6545454545454545,
+ "grad_norm": 2.024895191192627,
+ "learning_rate": 8.983164983164983e-06,
+ "loss": 1.3467098474502563,
+ "mean_token_accuracy": 0.681546151638031,
+ "num_tokens": 13418496.0,
+ "step": 819
+ },
+ {
+ "entropy": 1.1657299995422363,
+ "epoch": 1.6565656565656566,
+ "grad_norm": 2.4099085330963135,
+ "learning_rate": 8.969696969696971e-06,
+ "loss": 1.1612054109573364,
+ "mean_token_accuracy": 0.696140706539154,
+ "num_tokens": 13434880.0,
+ "step": 820
+ },
+ {
+ "entropy": 1.3764209747314453,
+ "epoch": 1.6585858585858586,
+ "grad_norm": 1.9971355199813843,
+ "learning_rate": 8.956228956228958e-06,
+ "loss": 1.3754298686981201,
+ "mean_token_accuracy": 0.6687836050987244,
+ "num_tokens": 13451264.0,
+ "step": 821
+ },
+ {
+ "entropy": 1.2135001420974731,
+ "epoch": 1.6606060606060606,
+ "grad_norm": 1.9414972066879272,
+ "learning_rate": 8.942760942760942e-06,
+ "loss": 1.2148737907409668,
+ "mean_token_accuracy": 0.7018808126449585,
+ "num_tokens": 13467648.0,
+ "step": 822
+ },
+ {
+ "entropy": 1.2993255853652954,
+ "epoch": 1.6626262626262627,
+ "grad_norm": 2.149869203567505,
+ "learning_rate": 8.92929292929293e-06,
+ "loss": 1.2947715520858765,
+ "mean_token_accuracy": 0.6836223602294922,
+ "num_tokens": 13484032.0,
+ "step": 823
+ },
+ {
+ "entropy": 1.2745556831359863,
+ "epoch": 1.6646464646464647,
+ "grad_norm": 2.1189515590667725,
+ "learning_rate": 8.915824915824917e-06,
+ "loss": 1.2992188930511475,
+ "mean_token_accuracy": 0.6871030926704407,
+ "num_tokens": 13500416.0,
+ "step": 824
+ },
+ {
+ "entropy": 1.1959195137023926,
+ "epoch": 1.6666666666666665,
+ "grad_norm": 2.2528860569000244,
+ "learning_rate": 8.902356902356904e-06,
+ "loss": 1.200485110282898,
+ "mean_token_accuracy": 0.6969956159591675,
+ "num_tokens": 13516800.0,
+ "step": 825
+ },
+ {
+ "entropy": 1.358959674835205,
+ "epoch": 1.6686868686868688,
+ "grad_norm": 2.0133697986602783,
+ "learning_rate": 8.888888888888888e-06,
+ "loss": 1.3683624267578125,
+ "mean_token_accuracy": 0.6767830848693848,
+ "num_tokens": 13533184.0,
+ "step": 826
+ },
+ {
+ "entropy": 1.4699946641921997,
+ "epoch": 1.6707070707070706,
+ "grad_norm": 1.9599978923797607,
+ "learning_rate": 8.875420875420876e-06,
+ "loss": 1.4912409782409668,
+ "mean_token_accuracy": 0.663593053817749,
+ "num_tokens": 13549568.0,
+ "step": 827
+ },
+ {
+ "entropy": 1.1315391063690186,
+ "epoch": 1.6727272727272728,
+ "grad_norm": 2.053920269012451,
+ "learning_rate": 8.861952861952863e-06,
+ "loss": 1.140032172203064,
+ "mean_token_accuracy": 0.7090864777565002,
+ "num_tokens": 13565952.0,
+ "step": 828
+ },
+ {
+ "entropy": 1.5379900932312012,
+ "epoch": 1.6747474747474747,
+ "grad_norm": 2.007784128189087,
+ "learning_rate": 8.84848484848485e-06,
+ "loss": 1.5630019903182983,
+ "mean_token_accuracy": 0.6397777199745178,
+ "num_tokens": 13582336.0,
+ "step": 829
+ },
+ {
+ "entropy": 1.241722822189331,
+ "epoch": 1.676767676767677,
+ "grad_norm": 2.060314416885376,
+ "learning_rate": 8.835016835016836e-06,
+ "loss": 1.24226975440979,
+ "mean_token_accuracy": 0.691316545009613,
+ "num_tokens": 13598720.0,
+ "step": 830
+ },
+ {
+ "entropy": 1.0310786962509155,
+ "epoch": 1.6787878787878787,
+ "grad_norm": 1.9201405048370361,
+ "learning_rate": 8.821548821548822e-06,
+ "loss": 1.0244829654693604,
+ "mean_token_accuracy": 0.7352222800254822,
+ "num_tokens": 13615104.0,
+ "step": 831
+ },
+ {
+ "entropy": 0.8319131731987,
+ "epoch": 1.680808080808081,
+ "grad_norm": 1.8874962329864502,
+ "learning_rate": 8.808080808080809e-06,
+ "loss": 0.8486998081207275,
+ "mean_token_accuracy": 0.7804714441299438,
+ "num_tokens": 13631488.0,
+ "step": 832
+ },
+ {
+ "entropy": 1.3878363370895386,
+ "epoch": 1.6828282828282828,
+ "grad_norm": 2.034135580062866,
+ "learning_rate": 8.794612794612795e-06,
+ "loss": 1.389417052268982,
+ "mean_token_accuracy": 0.6738519668579102,
+ "num_tokens": 13647872.0,
+ "step": 833
+ },
+ {
+ "entropy": 1.2692970037460327,
+ "epoch": 1.6848484848484848,
+ "grad_norm": 2.251734972000122,
+ "learning_rate": 8.781144781144782e-06,
+ "loss": 1.3026533126831055,
+ "mean_token_accuracy": 0.6725085377693176,
+ "num_tokens": 13664256.0,
+ "step": 834
+ },
+ {
+ "entropy": 1.030187726020813,
+ "epoch": 1.6868686868686869,
+ "grad_norm": 2.072669506072998,
+ "learning_rate": 8.767676767676768e-06,
+ "loss": 1.0316928625106812,
+ "mean_token_accuracy": 0.7219711542129517,
+ "num_tokens": 13680640.0,
+ "step": 835
+ },
+ {
+ "entropy": 0.9987007975578308,
+ "epoch": 1.6888888888888889,
+ "grad_norm": 1.9975026845932007,
+ "learning_rate": 8.754208754208755e-06,
+ "loss": 0.9982929229736328,
+ "mean_token_accuracy": 0.7407181262969971,
+ "num_tokens": 13697024.0,
+ "step": 836
+ },
+ {
+ "entropy": 1.335033655166626,
+ "epoch": 1.690909090909091,
+ "grad_norm": 2.9397995471954346,
+ "learning_rate": 8.740740740740741e-06,
+ "loss": 1.3791459798812866,
+ "mean_token_accuracy": 0.6587689518928528,
+ "num_tokens": 13713408.0,
+ "step": 837
+ },
+ {
+ "entropy": 1.064363718032837,
+ "epoch": 1.692929292929293,
+ "grad_norm": 1.859521508216858,
+ "learning_rate": 8.727272727272728e-06,
+ "loss": 1.0654652118682861,
+ "mean_token_accuracy": 0.7314362525939941,
+ "num_tokens": 13729792.0,
+ "step": 838
+ },
+ {
+ "entropy": 1.2016503810882568,
+ "epoch": 1.694949494949495,
+ "grad_norm": 1.9492405652999878,
+ "learning_rate": 8.713804713804714e-06,
+ "loss": 1.2206454277038574,
+ "mean_token_accuracy": 0.6963849663734436,
+ "num_tokens": 13746176.0,
+ "step": 839
+ },
+ {
+ "entropy": 1.0941510200500488,
+ "epoch": 1.696969696969697,
+ "grad_norm": 1.9697571992874146,
+ "learning_rate": 8.7003367003367e-06,
+ "loss": 1.0997231006622314,
+ "mean_token_accuracy": 0.7194675207138062,
+ "num_tokens": 13762560.0,
+ "step": 840
+ },
+ {
+ "entropy": 1.2805196046829224,
+ "epoch": 1.698989898989899,
+ "grad_norm": 2.183673620223999,
+ "learning_rate": 8.686868686868687e-06,
+ "loss": 1.2889196872711182,
+ "mean_token_accuracy": 0.6751953959465027,
+ "num_tokens": 13778944.0,
+ "step": 841
+ },
+ {
+ "entropy": 1.3549253940582275,
+ "epoch": 1.7010101010101009,
+ "grad_norm": 2.1223721504211426,
+ "learning_rate": 8.673400673400674e-06,
+ "loss": 1.351933240890503,
+ "mean_token_accuracy": 0.6756228804588318,
+ "num_tokens": 13795328.0,
+ "step": 842
+ },
+ {
+ "entropy": 1.333280324935913,
+ "epoch": 1.7030303030303031,
+ "grad_norm": 2.0345280170440674,
+ "learning_rate": 8.65993265993266e-06,
+ "loss": 1.3359044790267944,
+ "mean_token_accuracy": 0.6783707737922668,
+ "num_tokens": 13811712.0,
+ "step": 843
+ },
+ {
+ "entropy": 1.0658303499221802,
+ "epoch": 1.705050505050505,
+ "grad_norm": 1.926890254020691,
+ "learning_rate": 8.646464646464647e-06,
+ "loss": 1.0638974905014038,
+ "mean_token_accuracy": 0.7286272644996643,
+ "num_tokens": 13828096.0,
+ "step": 844
+ },
+ {
+ "entropy": 0.9549879431724548,
+ "epoch": 1.7070707070707072,
+ "grad_norm": 2.124664306640625,
+ "learning_rate": 8.632996632996635e-06,
+ "loss": 0.9564298987388611,
+ "mean_token_accuracy": 0.7528700828552246,
+ "num_tokens": 13844480.0,
+ "step": 845
+ },
+ {
+ "entropy": 1.6893866062164307,
+ "epoch": 1.709090909090909,
+ "grad_norm": 2.070680856704712,
+ "learning_rate": 8.61952861952862e-06,
+ "loss": 1.6929473876953125,
+ "mean_token_accuracy": 0.6165730357170105,
+ "num_tokens": 13860864.0,
+ "step": 846
+ },
+ {
+ "entropy": 0.8587391972541809,
+ "epoch": 1.7111111111111112,
+ "grad_norm": 1.9683139324188232,
+ "learning_rate": 8.606060606060606e-06,
+ "loss": 0.8467673659324646,
+ "mean_token_accuracy": 0.7707620859146118,
+ "num_tokens": 13877248.0,
+ "step": 847
+ },
+ {
+ "entropy": 1.6370538473129272,
+ "epoch": 1.713131313131313,
+ "grad_norm": 2.1608047485351562,
+ "learning_rate": 8.592592592592593e-06,
+ "loss": 1.6496617794036865,
+ "mean_token_accuracy": 0.6143136024475098,
+ "num_tokens": 13893632.0,
+ "step": 848
+ },
+ {
+ "entropy": 1.23484206199646,
+ "epoch": 1.7151515151515153,
+ "grad_norm": 2.0296223163604736,
+ "learning_rate": 8.57912457912458e-06,
+ "loss": 1.2227973937988281,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 13910016.0,
+ "step": 849
+ },
+ {
+ "entropy": 1.2687101364135742,
+ "epoch": 1.7171717171717171,
+ "grad_norm": 2.204806089401245,
+ "learning_rate": 8.565656565656566e-06,
+ "loss": 1.2694804668426514,
+ "mean_token_accuracy": 0.6865534782409668,
+ "num_tokens": 13926400.0,
+ "step": 850
+ },
+ {
+ "entropy": 1.2225878238677979,
+ "epoch": 1.7191919191919192,
+ "grad_norm": 2.1541168689727783,
+ "learning_rate": 8.552188552188552e-06,
+ "loss": 1.2527751922607422,
+ "mean_token_accuracy": 0.6800195574760437,
+ "num_tokens": 13942784.0,
+ "step": 851
+ },
+ {
+ "entropy": 1.2106293439865112,
+ "epoch": 1.7212121212121212,
+ "grad_norm": 2.0455424785614014,
+ "learning_rate": 8.53872053872054e-06,
+ "loss": 1.2005270719528198,
+ "mean_token_accuracy": 0.6949804425239563,
+ "num_tokens": 13959168.0,
+ "step": 852
+ },
+ {
+ "entropy": 1.169908046722412,
+ "epoch": 1.7232323232323232,
+ "grad_norm": 2.0055043697357178,
+ "learning_rate": 8.525252525252527e-06,
+ "loss": 1.1640398502349854,
+ "mean_token_accuracy": 0.7149487137794495,
+ "num_tokens": 13975552.0,
+ "step": 853
+ },
+ {
+ "entropy": 1.1458942890167236,
+ "epoch": 1.7252525252525253,
+ "grad_norm": 2.0365331172943115,
+ "learning_rate": 8.511784511784512e-06,
+ "loss": 1.1413549184799194,
+ "mean_token_accuracy": 0.7126282453536987,
+ "num_tokens": 13991936.0,
+ "step": 854
+ },
+ {
+ "entropy": 0.8760596513748169,
+ "epoch": 1.7272727272727273,
+ "grad_norm": 1.9858993291854858,
+ "learning_rate": 8.4983164983165e-06,
+ "loss": 0.8733371496200562,
+ "mean_token_accuracy": 0.760869562625885,
+ "num_tokens": 14008320.0,
+ "step": 855
+ },
+ {
+ "entropy": 1.3949522972106934,
+ "epoch": 1.7292929292929293,
+ "grad_norm": 2.6730244159698486,
+ "learning_rate": 8.484848484848486e-06,
+ "loss": 1.4128756523132324,
+ "mean_token_accuracy": 0.6792256832122803,
+ "num_tokens": 14024704.0,
+ "step": 856
+ },
+ {
+ "entropy": 1.4345626831054688,
+ "epoch": 1.7313131313131314,
+ "grad_norm": 1.9446519613265991,
+ "learning_rate": 8.471380471380473e-06,
+ "loss": 1.450282096862793,
+ "mean_token_accuracy": 0.664631187915802,
+ "num_tokens": 14041088.0,
+ "step": 857
+ },
+ {
+ "entropy": 1.1180377006530762,
+ "epoch": 1.7333333333333334,
+ "grad_norm": 2.051783323287964,
+ "learning_rate": 8.457912457912457e-06,
+ "loss": 1.1588772535324097,
+ "mean_token_accuracy": 0.7128114104270935,
+ "num_tokens": 14057472.0,
+ "step": 858
+ },
+ {
+ "entropy": 1.2605851888656616,
+ "epoch": 1.7353535353535352,
+ "grad_norm": 2.0577232837677,
+ "learning_rate": 8.444444444444446e-06,
+ "loss": 1.2173504829406738,
+ "mean_token_accuracy": 0.6938812732696533,
+ "num_tokens": 14073856.0,
+ "step": 859
+ },
+ {
+ "entropy": 1.2957148551940918,
+ "epoch": 1.7373737373737375,
+ "grad_norm": 2.14068603515625,
+ "learning_rate": 8.430976430976432e-06,
+ "loss": 1.301836609840393,
+ "mean_token_accuracy": 0.6832559704780579,
+ "num_tokens": 14090240.0,
+ "step": 860
+ },
+ {
+ "entropy": 0.9871225953102112,
+ "epoch": 1.7393939393939393,
+ "grad_norm": 1.9262301921844482,
+ "learning_rate": 8.417508417508419e-06,
+ "loss": 1.0081474781036377,
+ "mean_token_accuracy": 0.7432828545570374,
+ "num_tokens": 14106624.0,
+ "step": 861
+ },
+ {
+ "entropy": 1.2774608135223389,
+ "epoch": 1.7414141414141415,
+ "grad_norm": 1.8633641004562378,
+ "learning_rate": 8.404040404040405e-06,
+ "loss": 1.2942487001419067,
+ "mean_token_accuracy": 0.6910722851753235,
+ "num_tokens": 14123008.0,
+ "step": 862
+ },
+ {
+ "entropy": 1.3229460716247559,
+ "epoch": 1.7434343434343433,
+ "grad_norm": 2.1861679553985596,
+ "learning_rate": 8.390572390572392e-06,
+ "loss": 1.3244147300720215,
+ "mean_token_accuracy": 0.6719589829444885,
+ "num_tokens": 14139392.0,
+ "step": 863
+ },
+ {
+ "entropy": 1.306138277053833,
+ "epoch": 1.7454545454545456,
+ "grad_norm": 2.1364035606384277,
+ "learning_rate": 8.377104377104378e-06,
+ "loss": 1.3266233205795288,
+ "mean_token_accuracy": 0.6864924430847168,
+ "num_tokens": 14155776.0,
+ "step": 864
+ },
+ {
+ "entropy": 0.9926152229309082,
+ "epoch": 1.7474747474747474,
+ "grad_norm": 1.784975528717041,
+ "learning_rate": 8.363636363636365e-06,
+ "loss": 1.0243797302246094,
+ "mean_token_accuracy": 0.7546409368515015,
+ "num_tokens": 14172160.0,
+ "step": 865
+ },
+ {
+ "entropy": 1.7003151178359985,
+ "epoch": 1.7494949494949497,
+ "grad_norm": 2.081186056137085,
+ "learning_rate": 8.350168350168351e-06,
+ "loss": 1.699352502822876,
+ "mean_token_accuracy": 0.6183438897132874,
+ "num_tokens": 14188544.0,
+ "step": 866
+ },
+ {
+ "entropy": 1.7050426006317139,
+ "epoch": 1.7515151515151515,
+ "grad_norm": 1.8780465126037598,
+ "learning_rate": 8.336700336700338e-06,
+ "loss": 1.7067642211914062,
+ "mean_token_accuracy": 0.6159623861312866,
+ "num_tokens": 14204928.0,
+ "step": 867
+ },
+ {
+ "entropy": 1.0717660188674927,
+ "epoch": 1.7535353535353535,
+ "grad_norm": 2.0461418628692627,
+ "learning_rate": 8.323232323232324e-06,
+ "loss": 1.0874615907669067,
+ "mean_token_accuracy": 0.7315583825111389,
+ "num_tokens": 14221312.0,
+ "step": 868
+ },
+ {
+ "entropy": 1.3650007247924805,
+ "epoch": 1.7555555555555555,
+ "grad_norm": 1.9097316265106201,
+ "learning_rate": 8.30976430976431e-06,
+ "loss": 1.3483806848526,
+ "mean_token_accuracy": 0.6889350414276123,
+ "num_tokens": 14237696.0,
+ "step": 869
+ },
+ {
+ "entropy": 0.9856852293014526,
+ "epoch": 1.7575757575757576,
+ "grad_norm": 1.9712227582931519,
+ "learning_rate": 8.296296296296297e-06,
+ "loss": 0.975986897945404,
+ "mean_token_accuracy": 0.7417562007904053,
+ "num_tokens": 14254080.0,
+ "step": 870
+ },
+ {
+ "entropy": 0.8876434564590454,
+ "epoch": 1.7595959595959596,
+ "grad_norm": 1.8536908626556396,
+ "learning_rate": 8.282828282828283e-06,
+ "loss": 0.8868429660797119,
+ "mean_token_accuracy": 0.7714338302612305,
+ "num_tokens": 14270464.0,
+ "step": 871
+ },
+ {
+ "entropy": 0.7506260871887207,
+ "epoch": 1.7616161616161616,
+ "grad_norm": 1.7068337202072144,
+ "learning_rate": 8.26936026936027e-06,
+ "loss": 0.7422510385513306,
+ "mean_token_accuracy": 0.8030654788017273,
+ "num_tokens": 14286848.0,
+ "step": 872
+ },
+ {
+ "entropy": 1.726669192314148,
+ "epoch": 1.7636363636363637,
+ "grad_norm": 2.157275676727295,
+ "learning_rate": 8.255892255892256e-06,
+ "loss": 1.7225112915039062,
+ "mean_token_accuracy": 0.6207864880561829,
+ "num_tokens": 14303232.0,
+ "step": 873
+ },
+ {
+ "entropy": 0.8383756279945374,
+ "epoch": 1.7656565656565657,
+ "grad_norm": 1.8378020524978638,
+ "learning_rate": 8.242424242424243e-06,
+ "loss": 0.8363397717475891,
+ "mean_token_accuracy": 0.772838294506073,
+ "num_tokens": 14319616.0,
+ "step": 874
+ },
+ {
+ "entropy": 1.1146882772445679,
+ "epoch": 1.7676767676767677,
+ "grad_norm": 2.144796371459961,
+ "learning_rate": 8.22895622895623e-06,
+ "loss": 1.124634027481079,
+ "mean_token_accuracy": 0.711467981338501,
+ "num_tokens": 14336000.0,
+ "step": 875
+ },
+ {
+ "entropy": 1.4330589771270752,
+ "epoch": 1.7696969696969695,
+ "grad_norm": 2.268897533416748,
+ "learning_rate": 8.215488215488216e-06,
+ "loss": 1.4430513381958008,
+ "mean_token_accuracy": 0.6437469720840454,
+ "num_tokens": 14352384.0,
+ "step": 876
+ },
+ {
+ "entropy": 1.1955921649932861,
+ "epoch": 1.7717171717171718,
+ "grad_norm": 2.109701156616211,
+ "learning_rate": 8.202020202020202e-06,
+ "loss": 1.1778371334075928,
+ "mean_token_accuracy": 0.6951025724411011,
+ "num_tokens": 14368768.0,
+ "step": 877
+ },
+ {
+ "entropy": 1.0419657230377197,
+ "epoch": 1.7737373737373736,
+ "grad_norm": 2.002164840698242,
+ "learning_rate": 8.188552188552189e-06,
+ "loss": 1.0472073554992676,
+ "mean_token_accuracy": 0.7313751578330994,
+ "num_tokens": 14385152.0,
+ "step": 878
+ },
+ {
+ "entropy": 1.324011206626892,
+ "epoch": 1.7757575757575759,
+ "grad_norm": 2.233525514602661,
+ "learning_rate": 8.175084175084175e-06,
+ "loss": 1.3433442115783691,
+ "mean_token_accuracy": 0.666890561580658,
+ "num_tokens": 14401536.0,
+ "step": 879
+ },
+ {
+ "entropy": 1.0424224138259888,
+ "epoch": 1.7777777777777777,
+ "grad_norm": 1.8213649988174438,
+ "learning_rate": 8.161616161616162e-06,
+ "loss": 1.0525646209716797,
+ "mean_token_accuracy": 0.7383976578712463,
+ "num_tokens": 14417920.0,
+ "step": 880
+ },
+ {
+ "entropy": 1.3322721719741821,
+ "epoch": 1.77979797979798,
+ "grad_norm": 2.0028865337371826,
+ "learning_rate": 8.148148148148148e-06,
+ "loss": 1.356465458869934,
+ "mean_token_accuracy": 0.6836223602294922,
+ "num_tokens": 14434304.0,
+ "step": 881
+ },
+ {
+ "entropy": 1.2495578527450562,
+ "epoch": 1.7818181818181817,
+ "grad_norm": 2.021883249282837,
+ "learning_rate": 8.134680134680135e-06,
+ "loss": 1.2500100135803223,
+ "mean_token_accuracy": 0.7239863276481628,
+ "num_tokens": 14450688.0,
+ "step": 882
+ },
+ {
+ "entropy": 1.3212776184082031,
+ "epoch": 1.783838383838384,
+ "grad_norm": 1.932453989982605,
+ "learning_rate": 8.121212121212121e-06,
+ "loss": 1.3274552822113037,
+ "mean_token_accuracy": 0.6889350414276123,
+ "num_tokens": 14467072.0,
+ "step": 883
+ },
+ {
+ "entropy": 1.1536792516708374,
+ "epoch": 1.7858585858585858,
+ "grad_norm": 1.944832682609558,
+ "learning_rate": 8.10774410774411e-06,
+ "loss": 1.1310882568359375,
+ "mean_token_accuracy": 0.7239863276481628,
+ "num_tokens": 14483456.0,
+ "step": 884
+ },
+ {
+ "entropy": 1.335244059562683,
+ "epoch": 1.7878787878787878,
+ "grad_norm": 1.9081436395645142,
+ "learning_rate": 8.094276094276094e-06,
+ "loss": 1.3430235385894775,
+ "mean_token_accuracy": 0.6779433488845825,
+ "num_tokens": 14499840.0,
+ "step": 885
+ },
+ {
+ "entropy": 0.9776304364204407,
+ "epoch": 1.7898989898989899,
+ "grad_norm": 2.077418088912964,
+ "learning_rate": 8.08080808080808e-06,
+ "loss": 0.9834706783294678,
+ "mean_token_accuracy": 0.7418172955513,
+ "num_tokens": 14516224.0,
+ "step": 886
+ },
+ {
+ "entropy": 0.9367865920066833,
+ "epoch": 1.791919191919192,
+ "grad_norm": 1.9657868146896362,
+ "learning_rate": 8.067340067340069e-06,
+ "loss": 0.9443397521972656,
+ "mean_token_accuracy": 0.7449926733970642,
+ "num_tokens": 14532608.0,
+ "step": 887
+ },
+ {
+ "entropy": 1.352593183517456,
+ "epoch": 1.793939393939394,
+ "grad_norm": 2.039900779724121,
+ "learning_rate": 8.053872053872055e-06,
+ "loss": 1.3500186204910278,
+ "mean_token_accuracy": 0.6840498447418213,
+ "num_tokens": 14548992.0,
+ "step": 888
+ },
+ {
+ "entropy": 1.21983802318573,
+ "epoch": 1.795959595959596,
+ "grad_norm": 2.04494309425354,
+ "learning_rate": 8.04040404040404e-06,
+ "loss": 1.2253628969192505,
+ "mean_token_accuracy": 0.6975451707839966,
+ "num_tokens": 14565376.0,
+ "step": 889
+ },
+ {
+ "entropy": 1.1911543607711792,
+ "epoch": 1.797979797979798,
+ "grad_norm": 2.09802508354187,
+ "learning_rate": 8.026936026936027e-06,
+ "loss": 1.2186518907546997,
+ "mean_token_accuracy": 0.6941866278648376,
+ "num_tokens": 14581760.0,
+ "step": 890
+ },
+ {
+ "entropy": 1.2681410312652588,
+ "epoch": 1.8,
+ "grad_norm": 2.242945432662964,
+ "learning_rate": 8.013468013468015e-06,
+ "loss": 1.2717292308807373,
+ "mean_token_accuracy": 0.6806302070617676,
+ "num_tokens": 14598144.0,
+ "step": 891
+ },
+ {
+ "entropy": 1.0779279470443726,
+ "epoch": 1.802020202020202,
+ "grad_norm": 2.0271153450012207,
+ "learning_rate": 8.000000000000001e-06,
+ "loss": 1.070134162902832,
+ "mean_token_accuracy": 0.7261846661567688,
+ "num_tokens": 14614528.0,
+ "step": 892
+ },
+ {
+ "entropy": 1.9025505781173706,
+ "epoch": 1.8040404040404039,
+ "grad_norm": 2.221864938735962,
+ "learning_rate": 7.986531986531986e-06,
+ "loss": 1.9073364734649658,
+ "mean_token_accuracy": 0.5933683514595032,
+ "num_tokens": 14630912.0,
+ "step": 893
+ },
+ {
+ "entropy": 1.0104752779006958,
+ "epoch": 1.8060606060606061,
+ "grad_norm": 2.165552854537964,
+ "learning_rate": 7.973063973063974e-06,
+ "loss": 1.0037627220153809,
+ "mean_token_accuracy": 0.7404738664627075,
+ "num_tokens": 14647296.0,
+ "step": 894
+ },
+ {
+ "entropy": 1.5633832216262817,
+ "epoch": 1.808080808080808,
+ "grad_norm": 2.1008827686309814,
+ "learning_rate": 7.95959595959596e-06,
+ "loss": 1.5352282524108887,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 14663680.0,
+ "step": 895
+ },
+ {
+ "entropy": 1.080839991569519,
+ "epoch": 1.8101010101010102,
+ "grad_norm": 1.9256923198699951,
+ "learning_rate": 7.946127946127947e-06,
+ "loss": 1.0921295881271362,
+ "mean_token_accuracy": 0.7247801423072815,
+ "num_tokens": 14680064.0,
+ "step": 896
+ },
+ {
+ "entropy": 0.9788808226585388,
+ "epoch": 1.812121212121212,
+ "grad_norm": 1.9602711200714111,
+ "learning_rate": 7.932659932659934e-06,
+ "loss": 0.9705313444137573,
+ "mean_token_accuracy": 0.7442598938941956,
+ "num_tokens": 14696448.0,
+ "step": 897
+ },
+ {
+ "entropy": 1.1658309698104858,
+ "epoch": 1.8141414141414143,
+ "grad_norm": 1.8840819597244263,
+ "learning_rate": 7.91919191919192e-06,
+ "loss": 1.1346904039382935,
+ "mean_token_accuracy": 0.7229481935501099,
+ "num_tokens": 14712832.0,
+ "step": 898
+ },
+ {
+ "entropy": 0.8824312686920166,
+ "epoch": 1.816161616161616,
+ "grad_norm": 2.1427361965179443,
+ "learning_rate": 7.905723905723907e-06,
+ "loss": 0.9055237770080566,
+ "mean_token_accuracy": 0.759770393371582,
+ "num_tokens": 14729216.0,
+ "step": 899
+ },
+ {
+ "entropy": 1.0914777517318726,
+ "epoch": 1.8181818181818183,
+ "grad_norm": 2.282011032104492,
+ "learning_rate": 7.892255892255893e-06,
+ "loss": 1.101895809173584,
+ "mean_token_accuracy": 0.7096360325813293,
+ "num_tokens": 14745600.0,
+ "step": 900
+ },
+ {
+ "epoch": 1.8181818181818183,
+ "eval_entropy": 1.303592009890464,
+ "eval_loss": 1.5282857418060303,
+ "eval_mean_token_accuracy": 0.6474241422068688,
+ "eval_num_tokens": 14745600.0,
+ "eval_runtime": 43.8637,
+ "eval_samples_per_second": 22.57,
+ "eval_steps_per_second": 2.827,
+ "step": 900
+ },
+ {
+ "entropy": 1.4693570137023926,
+ "epoch": 1.8202020202020202,
+ "grad_norm": 2.0938942432403564,
+ "learning_rate": 7.87878787878788e-06,
+ "loss": 1.4499380588531494,
+ "mean_token_accuracy": 0.6446018815040588,
+ "num_tokens": 14761984.0,
+ "step": 901
+ },
+ {
+ "entropy": 1.0810022354125977,
+ "epoch": 1.8222222222222222,
+ "grad_norm": 2.0279886722564697,
+ "learning_rate": 7.865319865319866e-06,
+ "loss": 1.0581843852996826,
+ "mean_token_accuracy": 0.723375678062439,
+ "num_tokens": 14778368.0,
+ "step": 902
+ },
+ {
+ "entropy": 1.0680485963821411,
+ "epoch": 1.8242424242424242,
+ "grad_norm": 2.015047788619995,
+ "learning_rate": 7.851851851851853e-06,
+ "loss": 1.0612249374389648,
+ "mean_token_accuracy": 0.7264289259910583,
+ "num_tokens": 14794752.0,
+ "step": 903
+ },
+ {
+ "entropy": 0.981645941734314,
+ "epoch": 1.8262626262626263,
+ "grad_norm": 2.0122671127319336,
+ "learning_rate": 7.838383838383839e-06,
+ "loss": 0.9650060534477234,
+ "mean_token_accuracy": 0.7337567210197449,
+ "num_tokens": 14811136.0,
+ "step": 904
+ },
+ {
+ "entropy": 1.0827676057815552,
+ "epoch": 1.8282828282828283,
+ "grad_norm": 2.1086010932922363,
+ "learning_rate": 7.824915824915826e-06,
+ "loss": 1.097700595855713,
+ "mean_token_accuracy": 0.7087811231613159,
+ "num_tokens": 14827520.0,
+ "step": 905
+ },
+ {
+ "entropy": 0.9498234391212463,
+ "epoch": 1.8303030303030303,
+ "grad_norm": 1.9012964963912964,
+ "learning_rate": 7.811447811447812e-06,
+ "loss": 0.9704345464706421,
+ "mean_token_accuracy": 0.7472520470619202,
+ "num_tokens": 14843904.0,
+ "step": 906
+ },
+ {
+ "entropy": 0.8871595859527588,
+ "epoch": 1.8323232323232324,
+ "grad_norm": 1.9970269203186035,
+ "learning_rate": 7.797979797979799e-06,
+ "loss": 0.8876000642776489,
+ "mean_token_accuracy": 0.7578163146972656,
+ "num_tokens": 14860288.0,
+ "step": 907
+ },
+ {
+ "entropy": 1.1324913501739502,
+ "epoch": 1.8343434343434344,
+ "grad_norm": 2.1133675575256348,
+ "learning_rate": 7.784511784511785e-06,
+ "loss": 1.142140507698059,
+ "mean_token_accuracy": 0.7180629968643188,
+ "num_tokens": 14876672.0,
+ "step": 908
+ },
+ {
+ "entropy": 1.1514050960540771,
+ "epoch": 1.8363636363636364,
+ "grad_norm": 2.073002338409424,
+ "learning_rate": 7.771043771043772e-06,
+ "loss": 1.1670506000518799,
+ "mean_token_accuracy": 0.7009037733078003,
+ "num_tokens": 14893056.0,
+ "step": 909
+ },
+ {
+ "entropy": 1.17017662525177,
+ "epoch": 1.8383838383838382,
+ "grad_norm": 2.17962384223938,
+ "learning_rate": 7.757575757575758e-06,
+ "loss": 1.1800150871276855,
+ "mean_token_accuracy": 0.7028578519821167,
+ "num_tokens": 14909440.0,
+ "step": 910
+ },
+ {
+ "entropy": 0.9377864599227905,
+ "epoch": 1.8404040404040405,
+ "grad_norm": 2.2141757011413574,
+ "learning_rate": 7.744107744107745e-06,
+ "loss": 0.9712649583816528,
+ "mean_token_accuracy": 0.7405349016189575,
+ "num_tokens": 14925824.0,
+ "step": 911
+ },
+ {
+ "entropy": 1.2093497514724731,
+ "epoch": 1.8424242424242423,
+ "grad_norm": 2.0677497386932373,
+ "learning_rate": 7.730639730639731e-06,
+ "loss": 1.210886001586914,
+ "mean_token_accuracy": 0.7037737965583801,
+ "num_tokens": 14942208.0,
+ "step": 912
+ },
+ {
+ "entropy": 0.8966845273971558,
+ "epoch": 1.8444444444444446,
+ "grad_norm": 2.0689940452575684,
+ "learning_rate": 7.717171717171717e-06,
+ "loss": 0.9142885208129883,
+ "mean_token_accuracy": 0.7523815631866455,
+ "num_tokens": 14958592.0,
+ "step": 913
+ },
+ {
+ "entropy": 1.4647231101989746,
+ "epoch": 1.8464646464646464,
+ "grad_norm": 2.1815598011016846,
+ "learning_rate": 7.703703703703704e-06,
+ "loss": 1.4676027297973633,
+ "mean_token_accuracy": 0.6506472826004028,
+ "num_tokens": 14974976.0,
+ "step": 914
+ },
+ {
+ "entropy": 1.5831035375595093,
+ "epoch": 1.8484848484848486,
+ "grad_norm": 2.028407096862793,
+ "learning_rate": 7.69023569023569e-06,
+ "loss": 1.5933328866958618,
+ "mean_token_accuracy": 0.6368466019630432,
+ "num_tokens": 14991360.0,
+ "step": 915
+ },
+ {
+ "entropy": 1.3269871473312378,
+ "epoch": 1.8505050505050504,
+ "grad_norm": 2.173727035522461,
+ "learning_rate": 7.676767676767677e-06,
+ "loss": 1.3404830694198608,
+ "mean_token_accuracy": 0.6750122308731079,
+ "num_tokens": 15007744.0,
+ "step": 916
+ },
+ {
+ "entropy": 1.378677487373352,
+ "epoch": 1.8525252525252527,
+ "grad_norm": 2.0357983112335205,
+ "learning_rate": 7.663299663299663e-06,
+ "loss": 1.3752634525299072,
+ "mean_token_accuracy": 0.6711651086807251,
+ "num_tokens": 15024128.0,
+ "step": 917
+ },
+ {
+ "entropy": 1.5462778806686401,
+ "epoch": 1.8545454545454545,
+ "grad_norm": 1.9574400186538696,
+ "learning_rate": 7.64983164983165e-06,
+ "loss": 1.5374811887741089,
+ "mean_token_accuracy": 0.6375183463096619,
+ "num_tokens": 15040512.0,
+ "step": 918
+ },
+ {
+ "entropy": 1.2211424112319946,
+ "epoch": 1.8565656565656565,
+ "grad_norm": 2.0203700065612793,
+ "learning_rate": 7.636363636363638e-06,
+ "loss": 1.2375779151916504,
+ "mean_token_accuracy": 0.6878358721733093,
+ "num_tokens": 15056896.0,
+ "step": 919
+ },
+ {
+ "entropy": 1.493086338043213,
+ "epoch": 1.8585858585858586,
+ "grad_norm": 2.1047544479370117,
+ "learning_rate": 7.622895622895623e-06,
+ "loss": 1.471447229385376,
+ "mean_token_accuracy": 0.6543111801147461,
+ "num_tokens": 15073280.0,
+ "step": 920
+ },
+ {
+ "entropy": 1.351884126663208,
+ "epoch": 1.8606060606060606,
+ "grad_norm": 2.2803215980529785,
+ "learning_rate": 7.60942760942761e-06,
+ "loss": 1.3451658487319946,
+ "mean_token_accuracy": 0.6725696325302124,
+ "num_tokens": 15089664.0,
+ "step": 921
+ },
+ {
+ "entropy": 1.4343167543411255,
+ "epoch": 1.8626262626262626,
+ "grad_norm": 1.9821034669876099,
+ "learning_rate": 7.595959595959597e-06,
+ "loss": 1.4694747924804688,
+ "mean_token_accuracy": 0.6622496247291565,
+ "num_tokens": 15106048.0,
+ "step": 922
+ },
+ {
+ "entropy": 1.3977091312408447,
+ "epoch": 1.8646464646464647,
+ "grad_norm": 2.0600125789642334,
+ "learning_rate": 7.582491582491583e-06,
+ "loss": 1.4120681285858154,
+ "mean_token_accuracy": 0.6642037034034729,
+ "num_tokens": 15122432.0,
+ "step": 923
+ },
+ {
+ "entropy": 1.4182765483856201,
+ "epoch": 1.8666666666666667,
+ "grad_norm": 1.9010684490203857,
+ "learning_rate": 7.569023569023569e-06,
+ "loss": 1.4160431623458862,
+ "mean_token_accuracy": 0.6696995496749878,
+ "num_tokens": 15138816.0,
+ "step": 924
+ },
+ {
+ "entropy": 1.1520206928253174,
+ "epoch": 1.8686868686868687,
+ "grad_norm": 1.8414452075958252,
+ "learning_rate": 7.555555555555556e-06,
+ "loss": 1.154735803604126,
+ "mean_token_accuracy": 0.7159867882728577,
+ "num_tokens": 15155200.0,
+ "step": 925
+ },
+ {
+ "entropy": 0.8958664536476135,
+ "epoch": 1.8707070707070708,
+ "grad_norm": 1.82782781124115,
+ "learning_rate": 7.542087542087543e-06,
+ "loss": 0.8718663454055786,
+ "mean_token_accuracy": 0.7771739363670349,
+ "num_tokens": 15171584.0,
+ "step": 926
+ },
+ {
+ "entropy": 1.4068299531936646,
+ "epoch": 1.8727272727272726,
+ "grad_norm": 1.9482192993164062,
+ "learning_rate": 7.52861952861953e-06,
+ "loss": 1.3947927951812744,
+ "mean_token_accuracy": 0.6699438095092773,
+ "num_tokens": 15187968.0,
+ "step": 927
+ },
+ {
+ "entropy": 0.8980593085289001,
+ "epoch": 1.8747474747474748,
+ "grad_norm": 2.040997266769409,
+ "learning_rate": 7.515151515151516e-06,
+ "loss": 0.9092239141464233,
+ "mean_token_accuracy": 0.7550684213638306,
+ "num_tokens": 15204352.0,
+ "step": 928
+ },
+ {
+ "entropy": 1.2259284257888794,
+ "epoch": 1.8767676767676766,
+ "grad_norm": 2.1932485103607178,
+ "learning_rate": 7.501683501683502e-06,
+ "loss": 1.2324566841125488,
+ "mean_token_accuracy": 0.6918050646781921,
+ "num_tokens": 15220736.0,
+ "step": 929
+ },
+ {
+ "entropy": 1.3737105131149292,
+ "epoch": 1.878787878787879,
+ "grad_norm": 1.9829115867614746,
+ "learning_rate": 7.4882154882154886e-06,
+ "loss": 1.4132641553878784,
+ "mean_token_accuracy": 0.6854543089866638,
+ "num_tokens": 15237120.0,
+ "step": 930
+ },
+ {
+ "entropy": 1.1767487525939941,
+ "epoch": 1.8808080808080807,
+ "grad_norm": 2.279439926147461,
+ "learning_rate": 7.474747474747476e-06,
+ "loss": 1.1658971309661865,
+ "mean_token_accuracy": 0.711467981338501,
+ "num_tokens": 15253504.0,
+ "step": 931
+ },
+ {
+ "entropy": 1.0110876560211182,
+ "epoch": 1.882828282828283,
+ "grad_norm": 2.144711494445801,
+ "learning_rate": 7.4612794612794615e-06,
+ "loss": 1.0287975072860718,
+ "mean_token_accuracy": 0.7346726655960083,
+ "num_tokens": 15269888.0,
+ "step": 932
+ },
+ {
+ "entropy": 1.0826390981674194,
+ "epoch": 1.8848484848484848,
+ "grad_norm": 2.1858105659484863,
+ "learning_rate": 7.447811447811448e-06,
+ "loss": 1.1194939613342285,
+ "mean_token_accuracy": 0.7099413871765137,
+ "num_tokens": 15286272.0,
+ "step": 933
+ },
+ {
+ "entropy": 1.430822491645813,
+ "epoch": 1.886868686868687,
+ "grad_norm": 1.9496047496795654,
+ "learning_rate": 7.434343434343435e-06,
+ "loss": 1.452394723892212,
+ "mean_token_accuracy": 0.6591353416442871,
+ "num_tokens": 15302656.0,
+ "step": 934
+ },
+ {
+ "entropy": 0.9242729544639587,
+ "epoch": 1.8888888888888888,
+ "grad_norm": 2.1464316844940186,
+ "learning_rate": 7.420875420875422e-06,
+ "loss": 0.9562792778015137,
+ "mean_token_accuracy": 0.7407791614532471,
+ "num_tokens": 15319040.0,
+ "step": 935
+ },
+ {
+ "entropy": 1.5215003490447998,
+ "epoch": 1.8909090909090909,
+ "grad_norm": 2.105729818344116,
+ "learning_rate": 7.4074074074074075e-06,
+ "loss": 1.5162043571472168,
+ "mean_token_accuracy": 0.6430141925811768,
+ "num_tokens": 15335424.0,
+ "step": 936
+ },
+ {
+ "entropy": 1.1809922456741333,
+ "epoch": 1.892929292929293,
+ "grad_norm": 2.1825973987579346,
+ "learning_rate": 7.393939393939395e-06,
+ "loss": 1.192020058631897,
+ "mean_token_accuracy": 0.693453848361969,
+ "num_tokens": 15351808.0,
+ "step": 937
+ },
+ {
+ "entropy": 1.0707145929336548,
+ "epoch": 1.894949494949495,
+ "grad_norm": 2.033658027648926,
+ "learning_rate": 7.380471380471381e-06,
+ "loss": 1.0794811248779297,
+ "mean_token_accuracy": 0.7291157841682434,
+ "num_tokens": 15368192.0,
+ "step": 938
+ },
+ {
+ "entropy": 0.8133494257926941,
+ "epoch": 1.896969696969697,
+ "grad_norm": 1.9038894176483154,
+ "learning_rate": 7.367003367003368e-06,
+ "loss": 0.817105233669281,
+ "mean_token_accuracy": 0.785906195640564,
+ "num_tokens": 15384576.0,
+ "step": 939
+ },
+ {
+ "entropy": 1.1366889476776123,
+ "epoch": 1.898989898989899,
+ "grad_norm": 2.3373923301696777,
+ "learning_rate": 7.353535353535353e-06,
+ "loss": 1.1590774059295654,
+ "mean_token_accuracy": 0.7004152536392212,
+ "num_tokens": 15400960.0,
+ "step": 940
+ },
+ {
+ "entropy": 1.0165143013000488,
+ "epoch": 1.901010101010101,
+ "grad_norm": 1.8290495872497559,
+ "learning_rate": 7.340067340067341e-06,
+ "loss": 0.9955418109893799,
+ "mean_token_accuracy": 0.7454811930656433,
+ "num_tokens": 15417344.0,
+ "step": 941
+ },
+ {
+ "entropy": 1.536665916442871,
+ "epoch": 1.903030303030303,
+ "grad_norm": 2.2636616230010986,
+ "learning_rate": 7.326599326599327e-06,
+ "loss": 1.5516541004180908,
+ "mean_token_accuracy": 0.6290913820266724,
+ "num_tokens": 15433728.0,
+ "step": 942
+ },
+ {
+ "entropy": 1.0885748863220215,
+ "epoch": 1.905050505050505,
+ "grad_norm": 2.104462146759033,
+ "learning_rate": 7.3131313131313146e-06,
+ "loss": 1.096163272857666,
+ "mean_token_accuracy": 0.7129946351051331,
+ "num_tokens": 15450112.0,
+ "step": 943
+ },
+ {
+ "entropy": 1.0774754285812378,
+ "epoch": 1.907070707070707,
+ "grad_norm": 2.006735324859619,
+ "learning_rate": 7.2996632996633e-06,
+ "loss": 1.0466490983963013,
+ "mean_token_accuracy": 0.7385197877883911,
+ "num_tokens": 15466496.0,
+ "step": 944
+ },
+ {
+ "entropy": 1.3489689826965332,
+ "epoch": 1.9090909090909092,
+ "grad_norm": 2.148700714111328,
+ "learning_rate": 7.286195286195287e-06,
+ "loss": 1.317432165145874,
+ "mean_token_accuracy": 0.6951025724411011,
+ "num_tokens": 15482880.0,
+ "step": 945
+ },
+ {
+ "entropy": 0.957065999507904,
+ "epoch": 1.911111111111111,
+ "grad_norm": 2.118453025817871,
+ "learning_rate": 7.272727272727273e-06,
+ "loss": 0.9499804377555847,
+ "mean_token_accuracy": 0.7590376138687134,
+ "num_tokens": 15499264.0,
+ "step": 946
+ },
+ {
+ "entropy": 1.1132235527038574,
+ "epoch": 1.9131313131313132,
+ "grad_norm": 1.8254663944244385,
+ "learning_rate": 7.2592592592592605e-06,
+ "loss": 1.0975847244262695,
+ "mean_token_accuracy": 0.7224596738815308,
+ "num_tokens": 15515648.0,
+ "step": 947
+ },
+ {
+ "entropy": 1.1259424686431885,
+ "epoch": 1.915151515151515,
+ "grad_norm": 2.105797529220581,
+ "learning_rate": 7.245791245791246e-06,
+ "loss": 1.1171300411224365,
+ "mean_token_accuracy": 0.7150097489356995,
+ "num_tokens": 15532032.0,
+ "step": 948
+ },
+ {
+ "entropy": 1.3454829454421997,
+ "epoch": 1.9171717171717173,
+ "grad_norm": 2.2715842723846436,
+ "learning_rate": 7.232323232323233e-06,
+ "loss": 1.359604835510254,
+ "mean_token_accuracy": 0.6568759083747864,
+ "num_tokens": 15548416.0,
+ "step": 949
+ },
+ {
+ "entropy": 1.2873634099960327,
+ "epoch": 1.9191919191919191,
+ "grad_norm": 1.8735847473144531,
+ "learning_rate": 7.21885521885522e-06,
+ "loss": 1.2842814922332764,
+ "mean_token_accuracy": 0.6951025724411011,
+ "num_tokens": 15564800.0,
+ "step": 950
+ },
+ {
+ "entropy": 1.154240369796753,
+ "epoch": 1.9212121212121214,
+ "grad_norm": 1.9821181297302246,
+ "learning_rate": 7.2053872053872064e-06,
+ "loss": 1.1434863805770874,
+ "mean_token_accuracy": 0.7203834652900696,
+ "num_tokens": 15581184.0,
+ "step": 951
+ },
+ {
+ "entropy": 1.05129075050354,
+ "epoch": 1.9232323232323232,
+ "grad_norm": 1.990182638168335,
+ "learning_rate": 7.191919191919192e-06,
+ "loss": 1.0694432258605957,
+ "mean_token_accuracy": 0.734245240688324,
+ "num_tokens": 15597568.0,
+ "step": 952
+ },
+ {
+ "entropy": 1.0232638120651245,
+ "epoch": 1.9252525252525252,
+ "grad_norm": 2.017350673675537,
+ "learning_rate": 7.178451178451179e-06,
+ "loss": 1.0090606212615967,
+ "mean_token_accuracy": 0.7305202484130859,
+ "num_tokens": 15613952.0,
+ "step": 953
+ },
+ {
+ "entropy": 0.8146723508834839,
+ "epoch": 1.9272727272727272,
+ "grad_norm": 1.8920353651046753,
+ "learning_rate": 7.164983164983166e-06,
+ "loss": 0.8227875232696533,
+ "mean_token_accuracy": 0.778761625289917,
+ "num_tokens": 15630336.0,
+ "step": 954
+ },
+ {
+ "entropy": 0.6415520906448364,
+ "epoch": 1.9292929292929293,
+ "grad_norm": 1.7636535167694092,
+ "learning_rate": 7.151515151515152e-06,
+ "loss": 0.6381626725196838,
+ "mean_token_accuracy": 0.8171104192733765,
+ "num_tokens": 15646720.0,
+ "step": 955
+ },
+ {
+ "entropy": 1.4309028387069702,
+ "epoch": 1.9313131313131313,
+ "grad_norm": 1.8857070207595825,
+ "learning_rate": 7.138047138047138e-06,
+ "loss": 1.4779207706451416,
+ "mean_token_accuracy": 0.6556546092033386,
+ "num_tokens": 15663104.0,
+ "step": 956
+ },
+ {
+ "entropy": 1.1201391220092773,
+ "epoch": 1.9333333333333333,
+ "grad_norm": 1.833791732788086,
+ "learning_rate": 7.124579124579125e-06,
+ "loss": 1.0972872972488403,
+ "mean_token_accuracy": 0.7187347412109375,
+ "num_tokens": 15679488.0,
+ "step": 957
+ },
+ {
+ "entropy": 1.1922115087509155,
+ "epoch": 1.9353535353535354,
+ "grad_norm": 1.8989986181259155,
+ "learning_rate": 7.111111111111112e-06,
+ "loss": 1.2037092447280884,
+ "mean_token_accuracy": 0.7104299068450928,
+ "num_tokens": 15695872.0,
+ "step": 958
+ },
+ {
+ "entropy": 0.9312219023704529,
+ "epoch": 1.9373737373737374,
+ "grad_norm": 2.0068769454956055,
+ "learning_rate": 7.097643097643099e-06,
+ "loss": 0.9126096963882446,
+ "mean_token_accuracy": 0.7556790709495544,
+ "num_tokens": 15712256.0,
+ "step": 959
+ },
+ {
+ "entropy": 1.1126971244812012,
+ "epoch": 1.9393939393939394,
+ "grad_norm": 1.9915603399276733,
+ "learning_rate": 7.084175084175085e-06,
+ "loss": 1.1312336921691895,
+ "mean_token_accuracy": 0.7178187370300293,
+ "num_tokens": 15728640.0,
+ "step": 960
+ },
+ {
+ "entropy": 1.487212896347046,
+ "epoch": 1.9414141414141413,
+ "grad_norm": 2.068739414215088,
+ "learning_rate": 7.070707070707071e-06,
+ "loss": 1.4876431226730347,
+ "mean_token_accuracy": 0.6568759083747864,
+ "num_tokens": 15745024.0,
+ "step": 961
+ },
+ {
+ "entropy": 1.207465648651123,
+ "epoch": 1.9434343434343435,
+ "grad_norm": 1.9962066411972046,
+ "learning_rate": 7.057239057239058e-06,
+ "loss": 1.2003669738769531,
+ "mean_token_accuracy": 0.7024914622306824,
+ "num_tokens": 15761408.0,
+ "step": 962
+ },
+ {
+ "entropy": 1.7148067951202393,
+ "epoch": 1.9454545454545453,
+ "grad_norm": 2.3441736698150635,
+ "learning_rate": 7.043771043771043e-06,
+ "loss": 1.7310147285461426,
+ "mean_token_accuracy": 0.6288471221923828,
+ "num_tokens": 15777792.0,
+ "step": 963
+ },
+ {
+ "entropy": 1.3103407621383667,
+ "epoch": 1.9474747474747476,
+ "grad_norm": 1.915368676185608,
+ "learning_rate": 7.030303030303031e-06,
+ "loss": 1.3412322998046875,
+ "mean_token_accuracy": 0.6845383644104004,
+ "num_tokens": 15794176.0,
+ "step": 964
+ },
+ {
+ "entropy": 0.9835378527641296,
+ "epoch": 1.9494949494949494,
+ "grad_norm": 1.9611473083496094,
+ "learning_rate": 7.016835016835017e-06,
+ "loss": 0.9903290271759033,
+ "mean_token_accuracy": 0.7569003701210022,
+ "num_tokens": 15810560.0,
+ "step": 965
+ },
+ {
+ "entropy": 1.4645164012908936,
+ "epoch": 1.9515151515151516,
+ "grad_norm": 2.017500162124634,
+ "learning_rate": 7.0033670033670045e-06,
+ "loss": 1.4612789154052734,
+ "mean_token_accuracy": 0.6558378338813782,
+ "num_tokens": 15826944.0,
+ "step": 966
+ },
+ {
+ "entropy": 1.2586326599121094,
+ "epoch": 1.9535353535353535,
+ "grad_norm": 2.0969791412353516,
+ "learning_rate": 6.98989898989899e-06,
+ "loss": 1.224534273147583,
+ "mean_token_accuracy": 0.6958353519439697,
+ "num_tokens": 15843328.0,
+ "step": 967
+ },
+ {
+ "entropy": 0.8170226216316223,
+ "epoch": 1.9555555555555557,
+ "grad_norm": 1.9889802932739258,
+ "learning_rate": 6.976430976430977e-06,
+ "loss": 0.8214236497879028,
+ "mean_token_accuracy": 0.7777845859527588,
+ "num_tokens": 15859712.0,
+ "step": 968
+ },
+ {
+ "entropy": 0.8966978788375854,
+ "epoch": 1.9575757575757575,
+ "grad_norm": 1.8261324167251587,
+ "learning_rate": 6.962962962962964e-06,
+ "loss": 0.8880574107170105,
+ "mean_token_accuracy": 0.7681363224983215,
+ "num_tokens": 15876096.0,
+ "step": 969
+ },
+ {
+ "entropy": 1.4782947301864624,
+ "epoch": 1.9595959595959596,
+ "grad_norm": 2.2666432857513428,
+ "learning_rate": 6.9494949494949505e-06,
+ "loss": 1.5416191816329956,
+ "mean_token_accuracy": 0.6491206884384155,
+ "num_tokens": 15892480.0,
+ "step": 970
+ },
+ {
+ "entropy": 1.6055350303649902,
+ "epoch": 1.9616161616161616,
+ "grad_norm": 2.0585474967956543,
+ "learning_rate": 6.936026936026936e-06,
+ "loss": 1.627528190612793,
+ "mean_token_accuracy": 0.6376404762268066,
+ "num_tokens": 15908864.0,
+ "step": 971
+ },
+ {
+ "entropy": 1.092020869255066,
+ "epoch": 1.9636363636363636,
+ "grad_norm": 2.002554416656494,
+ "learning_rate": 6.922558922558923e-06,
+ "loss": 1.0792224407196045,
+ "mean_token_accuracy": 0.7230092883110046,
+ "num_tokens": 15925248.0,
+ "step": 972
+ },
+ {
+ "entropy": 0.7485284805297852,
+ "epoch": 1.9656565656565657,
+ "grad_norm": 1.9477611780166626,
+ "learning_rate": 6.90909090909091e-06,
+ "loss": 0.7471826076507568,
+ "mean_token_accuracy": 0.7961040735244751,
+ "num_tokens": 15941632.0,
+ "step": 973
+ },
+ {
+ "entropy": 1.3997598886489868,
+ "epoch": 1.9676767676767677,
+ "grad_norm": 2.1589887142181396,
+ "learning_rate": 6.895622895622896e-06,
+ "loss": 1.3947563171386719,
+ "mean_token_accuracy": 0.6626160144805908,
+ "num_tokens": 15958016.0,
+ "step": 974
+ },
+ {
+ "entropy": 1.2053040266036987,
+ "epoch": 1.9696969696969697,
+ "grad_norm": 2.1021888256073,
+ "learning_rate": 6.882154882154882e-06,
+ "loss": 1.2196800708770752,
+ "mean_token_accuracy": 0.6948583126068115,
+ "num_tokens": 15974400.0,
+ "step": 975
+ },
+ {
+ "entropy": 1.1462217569351196,
+ "epoch": 1.9717171717171718,
+ "grad_norm": 2.1295032501220703,
+ "learning_rate": 6.868686868686869e-06,
+ "loss": 1.1645277738571167,
+ "mean_token_accuracy": 0.717391312122345,
+ "num_tokens": 15990784.0,
+ "step": 976
+ },
+ {
+ "entropy": 0.9189468026161194,
+ "epoch": 1.9737373737373738,
+ "grad_norm": 1.9384510517120361,
+ "learning_rate": 6.855218855218856e-06,
+ "loss": 0.8912248015403748,
+ "mean_token_accuracy": 0.7561064958572388,
+ "num_tokens": 16007168.0,
+ "step": 977
+ },
+ {
+ "entropy": 1.2767856121063232,
+ "epoch": 1.9757575757575756,
+ "grad_norm": 2.086789608001709,
+ "learning_rate": 6.841750841750842e-06,
+ "loss": 1.2951477766036987,
+ "mean_token_accuracy": 0.6822178959846497,
+ "num_tokens": 16023552.0,
+ "step": 978
+ },
+ {
+ "entropy": 1.4691493511199951,
+ "epoch": 1.9777777777777779,
+ "grad_norm": 2.081007719039917,
+ "learning_rate": 6.828282828282828e-06,
+ "loss": 1.4899260997772217,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 16039936.0,
+ "step": 979
+ },
+ {
+ "entropy": 1.5689647197723389,
+ "epoch": 1.9797979797979797,
+ "grad_norm": 2.168604850769043,
+ "learning_rate": 6.814814814814815e-06,
+ "loss": 1.57144296169281,
+ "mean_token_accuracy": 0.6405715942382812,
+ "num_tokens": 16056320.0,
+ "step": 980
+ },
+ {
+ "entropy": 1.4429019689559937,
+ "epoch": 1.981818181818182,
+ "grad_norm": 1.9658228158950806,
+ "learning_rate": 6.801346801346802e-06,
+ "loss": 1.473623275756836,
+ "mean_token_accuracy": 0.6576697826385498,
+ "num_tokens": 16072704.0,
+ "step": 981
+ },
+ {
+ "entropy": 1.0032570362091064,
+ "epoch": 1.9838383838383837,
+ "grad_norm": 1.9377433061599731,
+ "learning_rate": 6.787878787878789e-06,
+ "loss": 0.9838194847106934,
+ "mean_token_accuracy": 0.7490839958190918,
+ "num_tokens": 16089088.0,
+ "step": 982
+ },
+ {
+ "entropy": 0.9308913946151733,
+ "epoch": 1.985858585858586,
+ "grad_norm": 1.9042673110961914,
+ "learning_rate": 6.774410774410775e-06,
+ "loss": 0.9097878932952881,
+ "mean_token_accuracy": 0.7631289958953857,
+ "num_tokens": 16105472.0,
+ "step": 983
+ },
+ {
+ "entropy": 1.0642609596252441,
+ "epoch": 1.9878787878787878,
+ "grad_norm": 2.1934077739715576,
+ "learning_rate": 6.760942760942761e-06,
+ "loss": 1.0470092296600342,
+ "mean_token_accuracy": 0.7263067960739136,
+ "num_tokens": 16121856.0,
+ "step": 984
+ },
+ {
+ "entropy": 1.2610602378845215,
+ "epoch": 1.98989898989899,
+ "grad_norm": 2.2924704551696777,
+ "learning_rate": 6.747474747474749e-06,
+ "loss": 1.246216058731079,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 16138240.0,
+ "step": 985
+ },
+ {
+ "entropy": 1.4189343452453613,
+ "epoch": 1.9919191919191919,
+ "grad_norm": 1.906319260597229,
+ "learning_rate": 6.734006734006735e-06,
+ "loss": 1.4098241329193115,
+ "mean_token_accuracy": 0.6734855771064758,
+ "num_tokens": 16154624.0,
+ "step": 986
+ },
+ {
+ "entropy": 1.339056134223938,
+ "epoch": 1.993939393939394,
+ "grad_norm": 2.034353733062744,
+ "learning_rate": 6.720538720538721e-06,
+ "loss": 1.3571393489837646,
+ "mean_token_accuracy": 0.678859293460846,
+ "num_tokens": 16171008.0,
+ "step": 987
+ },
+ {
+ "entropy": 1.057302474975586,
+ "epoch": 1.995959595959596,
+ "grad_norm": 2.1716647148132324,
+ "learning_rate": 6.707070707070707e-06,
+ "loss": 1.042845606803894,
+ "mean_token_accuracy": 0.7322300672531128,
+ "num_tokens": 16187392.0,
+ "step": 988
+ },
+ {
+ "entropy": 1.2057303190231323,
+ "epoch": 1.997979797979798,
+ "grad_norm": 1.9809064865112305,
+ "learning_rate": 6.6936026936026945e-06,
+ "loss": 1.2091717720031738,
+ "mean_token_accuracy": 0.7068270444869995,
+ "num_tokens": 16203776.0,
+ "step": 989
+ },
+ {
+ "entropy": 1.3678697347640991,
+ "epoch": 2.0,
+ "grad_norm": 2.1474292278289795,
+ "learning_rate": 6.680134680134681e-06,
+ "loss": 1.359403133392334,
+ "mean_token_accuracy": 0.6702491641044617,
+ "num_tokens": 16220160.0,
+ "step": 990
+ },
+ {
+ "entropy": 1.6815240383148193,
+ "epoch": 2.002020202020202,
+ "grad_norm": 2.209095001220703,
+ "learning_rate": 6.666666666666667e-06,
+ "loss": 1.5768096446990967,
+ "mean_token_accuracy": 0.6408768892288208,
+ "num_tokens": 16236544.0,
+ "step": 991
+ },
+ {
+ "entropy": 1.1142786741256714,
+ "epoch": 2.004040404040404,
+ "grad_norm": 2.8133344650268555,
+ "learning_rate": 6.653198653198654e-06,
+ "loss": 0.937615692615509,
+ "mean_token_accuracy": 0.7556179761886597,
+ "num_tokens": 16252928.0,
+ "step": 992
+ },
+ {
+ "entropy": 1.2004083395004272,
+ "epoch": 2.006060606060606,
+ "grad_norm": 2.753380060195923,
+ "learning_rate": 6.6397306397306405e-06,
+ "loss": 1.0454245805740356,
+ "mean_token_accuracy": 0.7423058152198792,
+ "num_tokens": 16269312.0,
+ "step": 993
+ },
+ {
+ "entropy": 0.9945010542869568,
+ "epoch": 2.008080808080808,
+ "grad_norm": 2.3262150287628174,
+ "learning_rate": 6.626262626262627e-06,
+ "loss": 0.8623301982879639,
+ "mean_token_accuracy": 0.7791890501976013,
+ "num_tokens": 16285696.0,
+ "step": 994
+ },
+ {
+ "entropy": 1.0330396890640259,
+ "epoch": 2.01010101010101,
+ "grad_norm": 2.3145525455474854,
+ "learning_rate": 6.612794612794613e-06,
+ "loss": 0.9156472682952881,
+ "mean_token_accuracy": 0.7564118504524231,
+ "num_tokens": 16302080.0,
+ "step": 995
+ },
+ {
+ "entropy": 1.109296202659607,
+ "epoch": 2.012121212121212,
+ "grad_norm": 1.9910767078399658,
+ "learning_rate": 6.5993265993266e-06,
+ "loss": 1.0271074771881104,
+ "mean_token_accuracy": 0.7449315786361694,
+ "num_tokens": 16318464.0,
+ "step": 996
+ },
+ {
+ "entropy": 1.3861018419265747,
+ "epoch": 2.014141414141414,
+ "grad_norm": 2.2054574489593506,
+ "learning_rate": 6.585858585858586e-06,
+ "loss": 1.3088997602462769,
+ "mean_token_accuracy": 0.6818515062332153,
+ "num_tokens": 16334848.0,
+ "step": 997
+ },
+ {
+ "entropy": 1.1170406341552734,
+ "epoch": 2.0161616161616163,
+ "grad_norm": 2.3239619731903076,
+ "learning_rate": 6.572390572390574e-06,
+ "loss": 1.036240577697754,
+ "mean_token_accuracy": 0.735405445098877,
+ "num_tokens": 16351232.0,
+ "step": 998
+ },
+ {
+ "entropy": 0.8306671977043152,
+ "epoch": 2.018181818181818,
+ "grad_norm": 1.844927430152893,
+ "learning_rate": 6.558922558922559e-06,
+ "loss": 0.7926205396652222,
+ "mean_token_accuracy": 0.790730357170105,
+ "num_tokens": 16367616.0,
+ "step": 999
+ },
+ {
+ "entropy": 1.0606129169464111,
+ "epoch": 2.0202020202020203,
+ "grad_norm": 1.884960412979126,
+ "learning_rate": 6.545454545454546e-06,
+ "loss": 1.0186505317687988,
+ "mean_token_accuracy": 0.7497557401657104,
+ "num_tokens": 16384000.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.0202020202020203,
+ "eval_entropy": 1.1442755407864047,
+ "eval_loss": 1.5800968408584595,
+ "eval_mean_token_accuracy": 0.6456370079709638,
+ "eval_num_tokens": 16384000.0,
+ "eval_runtime": 43.8308,
+ "eval_samples_per_second": 22.587,
+ "eval_steps_per_second": 2.829,
+ "step": 1000
+ }
+ ],
+ "logging_steps": 1,
+ "max_steps": 1485,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 3,
+ "save_steps": 500,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.38550645358592e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/training_args.bin b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/training_args.bin
new file mode 100644
index 0000000000000000000000000000000000000000..98c558883023185245bfac817f2ca585caa9d94f
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/training_args.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:2c573bdac95c796f8f7368ab9af6d35c5687f53373737ea965b8102d518df7cb
+size 7121
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/zero_to_fp32.py b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/zero_to_fp32.py
new file mode 100644
index 0000000000000000000000000000000000000000..3970548c400fd4361bd923b763db90e963ddaf8c
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/zero_to_fp32.py
@@ -0,0 +1,854 @@
+#!/usr/bin/env python
+
+# Copyright (c) Microsoft Corporation.
+# SPDX-License-Identifier: Apache-2.0
+
+# DeepSpeed Team
+
+# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets
+# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in
+# the future. Once extracted, the weights don't require DeepSpeed and can be used in any
+# application.
+#
+# example:
+# python zero_to_fp32.py . output_dir/
+# or
+# python zero_to_fp32.py . output_dir/ --safe_serialization
+
+import argparse
+import torch
+import glob
+import math
+import os
+import re
+import gc
+import json
+import numpy as np
+from tqdm import tqdm
+from collections import OrderedDict
+from dataclasses import dataclass
+
+# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with
+# DeepSpeed data structures it has to be available in the current python environment.
+from deepspeed.utils import logger
+from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS,
+ FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES,
+ FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS, AUTOEP_LAYERS_KEY,
+ AUTOEP_LAYERS_KEY_LEGACY, AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY,
+ AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT, PARAM_ALIGNMENT_PADDINGS)
+
+
+@dataclass
+class zero_model_state:
+ buffers: dict()
+ param_shapes: dict()
+ shared_params: list
+ ds_version: int
+ frozen_param_shapes: dict()
+ frozen_param_fragments: dict()
+
+
+debug = 0
+
+# load to cpu
+device = torch.device('cpu')
+
+OUTPUT_DTYPE_NAMES = {
+ 'float32': torch.float32,
+ 'fp32': torch.float32,
+ 'float16': torch.float16,
+ 'fp16': torch.float16,
+ 'bfloat16': torch.bfloat16,
+ 'bf16': torch.bfloat16,
+}
+
+
+def _resolve_output_dtype(dtype):
+ requested_dtype = dtype
+ if isinstance(dtype, str):
+ dtype_name = dtype[6:] if dtype.startswith('torch.') else dtype
+ dtype = OUTPUT_DTYPE_NAMES.get(dtype_name.lower())
+ if dtype not in set(OUTPUT_DTYPE_NAMES.values()):
+ supported = ', '.join(sorted(OUTPUT_DTYPE_NAMES))
+ raise ValueError(f"Unsupported output dtype {requested_dtype!r}. Choose one of: {supported}")
+ return dtype
+
+
+def atoi(text):
+ return int(text) if text.isdigit() else text
+
+
+def natural_keys(text):
+ '''
+ alist.sort(key=natural_keys) sorts in human order
+ http://nedbatchelder.com/blog/200712/human_sorting.html
+ (See Toothy's implementation in the comments)
+ '''
+ return [atoi(c) for c in re.split(r'(\d+)', text)]
+
+
+def get_model_state_file(checkpoint_dir, zero_stage):
+ if not os.path.isdir(checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist")
+
+ # there should be only one file
+ if zero_stage <= 2:
+ file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt")
+ elif zero_stage == 3:
+ file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt")
+
+ if not os.path.exists(file):
+ raise FileNotFoundError(f"can't find model states file at '{file}'")
+
+ return file
+
+
+def get_checkpoint_files(checkpoint_dir, glob_pattern):
+ # XXX: need to test that this simple glob rule works for multi-node setup too
+ ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys)
+
+ if len(ckpt_files) == 0:
+ raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'")
+
+ return ckpt_files
+
+
+def get_optim_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt")
+
+
+def get_model_state_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_model_states.pt")
+
+
+def _has_autoep_zero3_partitioned_metadata(state_dict):
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY)
+ if autoep_layers is None:
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY_LEGACY)
+ if not isinstance(autoep_layers, list):
+ return False
+ return any(
+ isinstance(entry, dict)
+ and entry.get(AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY) == AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT
+ for entry in autoep_layers)
+
+
+def _raise_if_autoep_zero3_partitioned_state(state_dict):
+ if _has_autoep_zero3_partitioned_metadata(state_dict):
+ raise NotImplementedError("zero_to_fp32 does not support AutoEP ZeRO-3 partition-native checkpoints. "
+ "AutoEP expert parameters are partitioned over expert replica groups, so "
+ "global data-parallel consolidation would produce incomplete expert tensors. "
+ "Use ds_to_universal.py for expert-aware conversion.")
+
+
+def _raise_if_autoep_zero3_partitioned_checkpoint(model_files):
+ for file in model_files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+
+def parse_model_states(files):
+ zero_model_states = []
+ for file in files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+ if BUFFER_NAMES not in state_dict:
+ raise ValueError(f"{file} is not a model state checkpoint")
+ buffer_names = state_dict[BUFFER_NAMES]
+ if debug:
+ print("Found buffers:", buffer_names)
+
+ # recover just the buffers while restoring them to fp32 if they were saved in fp16
+ buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names}
+ param_shapes = state_dict[PARAM_SHAPES]
+
+ # collect parameters that are included in param_shapes
+ param_names = []
+ for s in param_shapes:
+ for name in s.keys():
+ param_names.append(name)
+
+ # update with frozen parameters
+ frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None)
+ if frozen_param_shapes is not None:
+ if debug:
+ print(f"Found frozen_param_shapes: {frozen_param_shapes}")
+ param_names += list(frozen_param_shapes.keys())
+
+ # handle shared params
+ shared_params = [[k, v] for k, v in state_dict["shared_params"].items()]
+
+ ds_version = state_dict.get(DS_VERSION, None)
+
+ frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None)
+
+ z_model_state = zero_model_state(buffers=buffers,
+ param_shapes=param_shapes,
+ shared_params=shared_params,
+ ds_version=ds_version,
+ frozen_param_shapes=frozen_param_shapes,
+ frozen_param_fragments=frozen_param_fragments)
+ zero_model_states.append(z_model_state)
+
+ return zero_model_states
+
+
+def parse_optim_states(files, ds_checkpoint_dir):
+ total_files = len(files)
+ state_dicts = []
+ for f in tqdm(files, desc='Loading checkpoint shards'):
+ state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False)
+ # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights
+ # and also handle the case where it was already removed by another helper script
+ state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None)
+ state_dicts.append(state_dict)
+
+ if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]:
+ raise ValueError(f"{files[0]} is not a zero checkpoint")
+ zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE]
+ world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT]
+
+ # For ZeRO-2 each param group can have different partition_count as data parallelism for expert
+ # parameters can be different from data parallelism for non-expert parameters. So we can just
+ # use the max of the partition_count to get the dp world_size.
+
+ if type(world_size) is list:
+ world_size = max(world_size)
+
+ if world_size != total_files:
+ raise ValueError(
+ f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. "
+ "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes."
+ )
+
+ # the groups are named differently in each stage
+ if zero_stage <= 2:
+ fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS
+ elif zero_stage == 3:
+ fp32_groups_key = FP32_FLAT_GROUPS
+ else:
+ raise ValueError(f"unknown zero stage {zero_stage}")
+
+ fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))]
+ param_alignment_paddings = state_dicts[0][OPTIMIZER_STATE_DICT].get(PARAM_ALIGNMENT_PADDINGS)
+ return zero_stage, world_size, fp32_flat_groups, param_alignment_paddings
+
+
+def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters):
+ """
+ Returns fp32 state_dict reconstructed from ds checkpoint
+
+ Args:
+ - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are)
+
+ """
+ print(f"Processing zero checkpoint '{ds_checkpoint_dir}'")
+
+ # parse_model_states rejects AutoEP ZeRO-3 partition-native checkpoints
+ # before the expensive optimizer-shard load below.
+ model_files = get_model_state_files(ds_checkpoint_dir)
+ zero_model_states = parse_model_states(model_files)
+ print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}')
+
+ optim_files = get_optim_files(ds_checkpoint_dir)
+ zero_stage, world_size, fp32_flat_groups, param_alignment_paddings = parse_optim_states(
+ optim_files, ds_checkpoint_dir)
+ print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}")
+
+ if zero_stage <= 2:
+ return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters, param_alignment_paddings)
+ elif zero_stage == 3:
+ return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters)
+
+
+def _zero2_merge_frozen_params(state_dict, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ frozen_param_fragments = zero_model_states[0].frozen_param_fragments
+
+ if debug:
+ num_elem = sum(s.numel() for s in frozen_param_shapes.values())
+ print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in frozen_param_fragments.values()])
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ state_dict[name] = frozen_param_fragments[name]
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _has_callable(obj, fn):
+ attr = getattr(obj, fn, None)
+ return callable(attr)
+
+
+def _zero2_merge_trainable_params(state_dict,
+ world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ param_alignment_paddings=None):
+ param_shapes = zero_model_states[0].param_shapes
+
+ # Reconstruction protocol:
+ #
+ # XXX: document this
+
+ if debug:
+ for i in range(world_size):
+ for j in range(len(fp32_flat_groups[0])):
+ print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}")
+
+ # XXX: memory usage doubles here (zero2)
+ num_param_groups = len(fp32_flat_groups[0])
+ merged_single_partition_of_fp32_groups = []
+ for i in range(num_param_groups):
+ merged_partitions = [sd[i] for sd in fp32_flat_groups]
+ full_single_fp32_vector = torch.cat(merged_partitions, 0)
+ merged_single_partition_of_fp32_groups.append(full_single_fp32_vector)
+ avail_numel = sum(
+ [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups])
+
+ if debug:
+ wanted_params = sum([len(shapes) for shapes in param_shapes])
+ wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes])
+ # not asserting if there is a mismatch due to possible padding
+ print(f"Have {avail_numel} numels to process.")
+ print(f"Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ total_numel = 0
+ total_params = 0
+ for group_idx, (shapes,
+ full_single_fp32_vector) in enumerate(zip(param_shapes, merged_single_partition_of_fp32_groups)):
+ offset = 0
+ avail_numel = full_single_fp32_vector.numel()
+ group_alignment_paddings = None
+ if param_alignment_paddings is not None:
+ group_alignment_paddings = param_alignment_paddings[group_idx]
+ if len(group_alignment_paddings) != len(shapes):
+ raise ValueError(f"Expected {len(shapes)} parameter alignment paddings for group {group_idx}, "
+ f"but found {len(group_alignment_paddings)}")
+
+ for param_idx, (name, shape) in enumerate(shapes.items()):
+
+ unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape)
+ total_numel += unpartitioned_numel
+ total_params += 1
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+ state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape)
+ offset += unpartitioned_numel
+ if group_alignment_paddings is not None:
+ offset += group_alignment_paddings[param_idx]
+
+ # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and
+ # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex
+ # paddings performed in the code it's almost impossible to predict the exact numbers w/o the
+ # live optimizer object, so we are checking that the numbers are within the right range
+ align_to = 2 * world_size
+
+ def zero2_align(x):
+ return align_to * math.ceil(x / align_to)
+
+ if debug:
+ print(f"original offset={offset}, avail_numel={avail_numel}")
+
+ offset = zero2_align(offset)
+ avail_numel = zero2_align(avail_numel)
+
+ if debug:
+ print(f"aligned offset={offset}, avail_numel={avail_numel}")
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero2_checkpoint(world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ exclude_frozen_parameters,
+ param_alignment_paddings=None):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero2_merge_frozen_params(state_dict, zero_model_states)
+
+ _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states,
+ param_alignment_paddings)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def zero3_partitioned_param_info(unpartitioned_numel, world_size):
+ remainder = unpartitioned_numel % world_size
+ padding_numel = (world_size - remainder) if remainder else 0
+ partitioned_numel = math.ceil(unpartitioned_numel / world_size)
+ return partitioned_numel, padding_numel
+
+
+def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ if debug:
+ for i in range(world_size):
+ num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values())
+ print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in zero_model_states[0].frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states)
+ state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape)
+
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+class GatheredTensor:
+ """
+ A pseudo tensor that collects partitioned weights.
+ It is more memory efficient when there are multiple groups.
+ """
+
+ def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape):
+ self.flat_groups = flat_groups
+ self.flat_groups_offset = flat_groups_offset
+ self.offset = offset
+ self.partitioned_numel = partitioned_numel
+ self.shape = shape
+ self.dtype = self.flat_groups[0][0].dtype
+
+ def contiguous(self):
+ """
+ Merge partitioned weights from flat_groups into a single tensor.
+ """
+ end_idx = self.offset + self.partitioned_numel
+ world_size = len(self.flat_groups)
+ pad_flat_param_chunks = []
+
+ for rank_i in range(world_size):
+ # for each rank, we need to collect weights from related group/groups
+ flat_groups_at_rank_i = self.flat_groups[rank_i]
+ start_group_id = None
+ end_group_id = None
+ for group_id in range(len(self.flat_groups_offset)):
+ if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]:
+ start_group_id = group_id
+ if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]:
+ end_group_id = group_id
+ break
+ # collect weights from related group/groups
+ for group_id in range(start_group_id, end_group_id + 1):
+ flat_tensor = flat_groups_at_rank_i[group_id]
+ start_offset = self.offset - self.flat_groups_offset[group_id]
+ end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id]
+ pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset])
+
+ # collect weights from all ranks
+ pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0)
+ param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous()
+ return param
+
+
+def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states):
+ param_shapes = zero_model_states[0].param_shapes
+ avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size
+
+ # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each
+ # param, re-consolidating each param, while dealing with padding if any
+
+ # merge list of dicts, preserving order
+ param_shapes = {k: v for d in param_shapes for k, v in d.items()}
+
+ if debug:
+ for i in range(world_size):
+ print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}")
+
+ wanted_params = len(param_shapes)
+ wanted_numel = sum(shape.numel() for shape in param_shapes.values())
+ # not asserting if there is a mismatch due to possible padding
+ avail_numel = fp32_flat_groups[0].numel() * world_size
+ print(f"Trainable params: Have {avail_numel} numels to process.")
+ print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ offset = 0
+ total_numel = 0
+ total_params = 0
+ flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]]))
+ for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'):
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+ total_params += 1
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ # memory efficient tensor
+ tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape)
+ state_dict[name] = tensor
+ offset += partitioned_numel
+
+ offset *= world_size
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero3_merge_frozen_params(state_dict, world_size, zero_model_states)
+
+ _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def to_torch_tensor(state_dict, return_empty_tensor=False, dtype=None):
+ """
+ Convert state_dict of GatheredTensor to torch tensor
+ """
+ if dtype is not None:
+ dtype = _resolve_output_dtype(dtype)
+
+ torch_state_dict = {}
+ converted_tensors = {}
+ for name, tensor in state_dict.items():
+ tensor_id = id(tensor)
+ if tensor_id in converted_tensors: # shared tensors
+ shared_tensor = torch_state_dict[converted_tensors[tensor_id]]
+ torch_state_dict[name] = shared_tensor
+ else:
+ converted_tensors[tensor_id] = name
+ if return_empty_tensor:
+ torch_state_dict[name] = torch.empty(tensor.shape, dtype=dtype or tensor.dtype)
+ else:
+ contiguous_tensor = tensor.contiguous()
+ torch_state_dict[name] = contiguous_tensor.to(dtype=dtype) if dtype else contiguous_tensor
+ return torch_state_dict
+
+
+def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag=None,
+ exclude_frozen_parameters=False,
+ lazy_mode=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with
+ ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example
+ via a model hub.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient.
+ Convert the pesduo tensor to torch tensor by ``.contiguous()``
+
+ Returns:
+ - pytorch ``state_dict``
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ # do the training and checkpoint saving
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu
+ model = model.cpu() # move to cpu
+ model.load_state_dict(state_dict)
+ # submit to model hub or save the model to share with others
+
+ In this example the ``model`` will no longer be usable in the deepspeed context of the same
+ application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead.
+
+ Note: the above usage may not work if your application doesn't have sufficient free CPU memory.
+ You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with
+ the checkpoint. Or you can load state_dict in lazy mode ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu
+ for name, lazy_tensor in state_dict.item():
+ tensor = lazy_tensor.contiguous() # to cpu
+ print(name, tensor)
+ # del tensor to release memory if it no longer in use
+ """
+ if tag is None:
+ latest_path = os.path.join(checkpoint_dir, 'latest')
+ if os.path.isfile(latest_path):
+ with open(latest_path, 'r') as fd:
+ tag = fd.read().strip()
+ else:
+ raise ValueError(f"Unable to find 'latest' file at {latest_path}")
+
+ ds_checkpoint_dir = os.path.join(checkpoint_dir, tag)
+
+ if not os.path.isdir(ds_checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist")
+
+ state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters)
+ if lazy_mode:
+ return state_dict
+ else:
+ return to_torch_tensor(state_dict)
+
+
+def convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a consolidated ``state_dict`` file that can be
+ loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``output_dir``: directory for the PyTorch state_dict output files
+ - ``dtype``: output tensor dtype. Supports float32, float16, and bfloat16 as strings or torch dtypes.
+ - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB
+ - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ """
+
+ dtype = _resolve_output_dtype(dtype)
+
+ # Dependency pre-check
+ if safe_serialization:
+ try:
+ from safetensors.torch import save_file
+ except ImportError:
+ print('If you want to use `safe_serialization`, please `pip install safetensors`')
+ raise
+ if max_shard_size is not None:
+ try:
+ from huggingface_hub import split_torch_state_dict_into_shards
+ except ImportError:
+ print('If you want to use `max_shard_size`, please `pip install huggingface_hub`')
+ raise
+
+ # Convert zero checkpoint to state_dict
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag,
+ exclude_frozen_parameters,
+ lazy_mode=True)
+
+ # Shard the model if it is too big.
+ weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin"
+ if max_shard_size is not None:
+ filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors")
+ # an memory-efficient approach for sharding
+ empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True, dtype=dtype)
+ state_dict_split = split_torch_state_dict_into_shards(empty_state_dict,
+ filename_pattern=filename_pattern,
+ max_shard_size=max_shard_size)
+ else:
+ from collections import namedtuple
+ StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"])
+ state_dict_split = StateDictSplit(is_sharded=False,
+ filename_to_tensors={weights_name: list(state_dict.keys())})
+
+ # Save the model by shard
+ os.makedirs(output_dir, exist_ok=True)
+ filename_to_tensors = state_dict_split.filename_to_tensors.items()
+ for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"):
+ shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors}
+ shard_state_dict = to_torch_tensor(shard_state_dict, dtype=dtype)
+ output_path = os.path.join(output_dir, shard_file)
+ if safe_serialization:
+ save_file(shard_state_dict, output_path, metadata={"format": "pt"})
+ else:
+ torch.save(shard_state_dict, output_path)
+ # release the memory of current shard
+ for tensor_name in list(shard_state_dict.keys()):
+ del state_dict[tensor_name]
+ del shard_state_dict[tensor_name]
+ del shard_state_dict
+ gc.collect()
+
+ # Save index if sharded
+ if state_dict_split.is_sharded:
+ index = {
+ "metadata": state_dict_split.metadata,
+ "weight_map": state_dict_split.tensor_to_filename,
+ }
+ save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json"
+ save_index_file = os.path.join(output_dir, save_index_file)
+ with open(save_index_file, "w", encoding="utf-8") as f:
+ content = json.dumps(index, indent=2, sort_keys=True) + "\n"
+ f.write(content)
+
+
+def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir,
+ output_dir,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """Backward-compatible fp32 checkpoint conversion."""
+ return convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size=max_shard_size,
+ safe_serialization=safe_serialization,
+ tag=tag,
+ exclude_frozen_parameters=exclude_frozen_parameters)
+
+
+def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None):
+ """
+ 1. Put the provided model to cpu
+ 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict``
+ 3. Load it into the provided model
+
+ Args:
+ - ``model``: the model object to update
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+
+ Returns:
+ - ``model`: modified model
+
+ Make sure you have plenty of CPU memory available before you call this function. If you don't
+ have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it
+ conveniently placed for you in the checkpoint folder.
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint
+ model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir)
+ # submit to model hub or save the model to share with others
+
+ Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context
+ of the same application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ """
+ logger.info("Extracting fp32 weights")
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag)
+
+ logger.info("Overwriting model with fp32 weights")
+ model = model.cpu()
+ model.load_state_dict(state_dict, strict=False)
+
+ return model
+
+
+if __name__ == "__main__":
+ parser = argparse.ArgumentParser()
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir",
+ type=str,
+ help="directory to the pytorch fp32 state_dict output files"
+ "(e.g. path/checkpoint-12-output/)")
+ parser.add_argument(
+ "--max_shard_size",
+ type=str,
+ default="5GB",
+ help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size"
+ "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`"
+ "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances"
+ "without CPU OOM issues.")
+ parser.add_argument(
+ "--safe_serialization",
+ default=False,
+ action='store_true',
+ help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug")
+ args = parser.parse_args()
+
+ debug = args.debug
+
+ convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir,
+ args.output_dir,
+ max_shard_size=args.max_shard_size,
+ safe_serialization=args.safe_serialization,
+ tag=args.tag,
+ exclude_frozen_parameters=args.exclude_frozen_parameters)
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1000/zero_to_torch.py b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/zero_to_torch.py
new file mode 100644
index 0000000000000000000000000000000000000000..81312e252400d77f03cc1a88522f8f18ebe70ee7
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1000/zero_to_torch.py
@@ -0,0 +1,54 @@
+#!/usr/bin/env python
+
+# SPDX-License-Identifier: Apache-2.0
+# DeepSpeed Team
+
+import argparse
+
+if __package__:
+ from . import zero_to_fp32
+else:
+ import zero_to_fp32
+
+
+def main(args=None):
+ parser = argparse.ArgumentParser(
+ description="Convert a DeepSpeed ZeRO checkpoint to float32, float16, or bfloat16 PyTorch weights.")
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir", type=str, help="directory for the converted PyTorch state_dict files")
+ parser.add_argument("--dtype",
+ type=str,
+ choices=sorted(zero_to_fp32.OUTPUT_DTYPE_NAMES),
+ required=True,
+ help="output tensor dtype")
+ parser.add_argument("--max_shard_size",
+ type=str,
+ default="5GB",
+ help="maximum size of each checkpoint shard, such as 5GB or 500MB")
+ parser.add_argument("--safe_serialization",
+ default=False,
+ action='store_true',
+ help="save with safetensors instead of PyTorch pickle serialization")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier, e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug output")
+ parsed_args = parser.parse_args(args)
+
+ zero_to_fp32.debug = parsed_args.debug
+ zero_to_fp32.convert_zero_checkpoint_to_state_dict(parsed_args.checkpoint_dir,
+ parsed_args.output_dir,
+ dtype=parsed_args.dtype,
+ max_shard_size=parsed_args.max_shard_size,
+ safe_serialization=parsed_args.safe_serialization,
+ tag=parsed_args.tag,
+ exclude_frozen_parameters=parsed_args.exclude_frozen_parameters)
+
+
+if __name__ == "__main__":
+ main()
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/chat_template.jinja b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..01be9b307daa2d425f7c168c9fb145a286e0afb4
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/chat_template.jinja
@@ -0,0 +1,89 @@
+{%- if tools %}
+ {{- '<|im_start|>system\n' }}
+ {%- if messages[0].role == 'system' %}
+ {{- messages[0].content + '\n\n' }}
+ {%- endif %}
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+{%- endfor %}
+{%- for message in messages %}
+ {%- if message.content is string %}
+ {%- set content = message.content %}
+ {%- else %}
+ {%- set content = '' %}
+ {%- endif %}
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {%- if loop.last or (not loop.last and reasoning_content) %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if (loop.first and content) or (not loop.first) %}
+ {{- '\n' }}
+ {%- endif %}
+ {%- if tool_call.function %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {{- '\n{"name": "' }}
+ {{- tool_call.name }}
+ {{- '", "arguments": ' }}
+ {%- if tool_call.arguments is string %}
+ {{- tool_call.arguments }}
+ {%- else %}
+ {{- tool_call.arguments | tojson }}
+ {%- endif %}
+ {{- '}\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/config.json b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/config.json
new file mode 100644
index 0000000000000000000000000000000000000000..5d9cef07396baadff5390e4508eb33025967a029
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/config.json
@@ -0,0 +1,63 @@
+{
+ "architectures": [
+ "Qwen3ForCausalLM"
+ ],
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "bos_token_id": null,
+ "dtype": "bfloat16",
+ "eos_token_id": 151645,
+ "head_dim": 128,
+ "hidden_act": "silu",
+ "hidden_size": 2048,
+ "initializer_range": 0.02,
+ "intermediate_size": 6144,
+ "layer_types": [
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 40960,
+ "max_window_layers": 28,
+ "model_type": "qwen3",
+ "num_attention_heads": 16,
+ "num_hidden_layers": 28,
+ "num_key_value_heads": 8,
+ "pad_token_id": 151643,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 1000000,
+ "rope_type": "default"
+ },
+ "sliding_window": null,
+ "tie_word_embeddings": true,
+ "transformers_version": "5.17.0",
+ "use_cache": false,
+ "use_sliding_window": false,
+ "vocab_size": 151936
+}
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/generation_config.json b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/generation_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..e6941fe4b04f26113d6eef6255d005c4d7090bda
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/generation_config.json
@@ -0,0 +1,12 @@
+{
+ "do_sample": true,
+ "eos_token_id": [
+ 151645,
+ 151643
+ ],
+ "pad_token_id": 151643,
+ "temperature": 0.6,
+ "top_k": 20,
+ "top_p": 0.95,
+ "transformers_version": "5.17.0"
+}
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/global_step1485/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/global_step1485/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..809da4f60abb1d9acb3929306b031e2480982777
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/global_step1485/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8d310f5466bf901784c39740d2ba6dcabb6904e9280df6b5865f7360cc07f04e
+size 10323466465
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/global_step1485/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/global_step1485/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..74eb12e9db93a5cc269643adadf4e2aa5fd15267
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/global_step1485/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:eda7d5c3c134c7f2ad759957a202b8b021838ec2f20d5185dc1a52989a7d6ccd
+size 10323469601
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/global_step1485/mp_rank_00_model_states.pt b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/global_step1485/mp_rank_00_model_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..b98d09a6533fbc751cd09741b8c11f5b0e501b8e
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/global_step1485/mp_rank_00_model_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:a8fc309912ee1059d08a4b85263fc00dc1c46571b061b11e2eb9439979613e40
+size 3441239653
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/latest b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/latest
new file mode 100644
index 0000000000000000000000000000000000000000..fd99e82f9d7bc8b55f38e85ef5fb215628a602ae
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/latest
@@ -0,0 +1 @@
+global_step1485
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/model.safetensors b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..9b2666228db53911589c4cd2096c38c2c35ae728
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:5cdc018ad7b517ba5e4c7c4f00035390b4e85dec1fc68e477966614a72cda70c
+size 4063515640
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/rng_state_0.pth b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/rng_state_0.pth
new file mode 100644
index 0000000000000000000000000000000000000000..52579bb9bd83b7479b7cdb80fe3042c4577cd189
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/rng_state_0.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:b6d0c8203f86526d5059f583df0d5b1c246458bd95b5ae63a840d384d95e1811
+size 14917
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/rng_state_1.pth b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/rng_state_1.pth
new file mode 100644
index 0000000000000000000000000000000000000000..6f434945a684215579d53189338adf884fdb5335
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/rng_state_1.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:f13fc77f33fd9dd376569b0baf2c19ef17d863b26d8028118541e9f7a36ca898
+size 14917
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/scheduler.pt b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/scheduler.pt
new file mode 100644
index 0000000000000000000000000000000000000000..73fffb33c0d4f174edd508c067265127c6db6acc
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/scheduler.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:d0945608dfeb2871410bf8eb511453bb37137eb1373134300fb59491a6a0b399
+size 1465
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/tokenizer.json b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..c7afbed2efcdf019f88ab0572ec29d3bf595dfe2
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:be75606093db2094d7cd20f3c2f385c212750648bd6ea4fb2bf507a6a4c55506
+size 11422650
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/tokenizer_config.json b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..770e41d6c92519d525eede4cbcf3ba27f6425311
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/tokenizer_config.json
@@ -0,0 +1,30 @@
+{
+ "add_prefix_space": false,
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "is_local": false,
+ "local_files_only": false,
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/trainer_state.json b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..ea7c9cbeb8183667542e19f03ace901c6ae558ea
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/trainer_state.json
@@ -0,0 +1,15049 @@
+{
+ "best_global_step": 400,
+ "best_metric": 1.5199862718582153,
+ "best_model_checkpoint": null,
+ "epoch": 3.0,
+ "eval_steps": 100,
+ "global_step": 1485,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 0.8295683860778809,
+ "epoch": 0.00202020202020202,
+ "grad_norm": 10.885663032531738,
+ "learning_rate": 2e-05,
+ "loss": 1.5185801982879639,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 16384.0,
+ "step": 1
+ },
+ {
+ "entropy": 1.3341505527496338,
+ "epoch": 0.00404040404040404,
+ "grad_norm": 9.276060104370117,
+ "learning_rate": 1.9986531986531986e-05,
+ "loss": 2.0802578926086426,
+ "mean_token_accuracy": 0.5727283954620361,
+ "num_tokens": 32768.0,
+ "step": 2
+ },
+ {
+ "entropy": 1.159377932548523,
+ "epoch": 0.006060606060606061,
+ "grad_norm": 3.999565839767456,
+ "learning_rate": 1.9973063973063975e-05,
+ "loss": 1.4128143787384033,
+ "mean_token_accuracy": 0.6849657893180847,
+ "num_tokens": 49152.0,
+ "step": 3
+ },
+ {
+ "entropy": 1.504081130027771,
+ "epoch": 0.00808080808080808,
+ "grad_norm": 3.018310546875,
+ "learning_rate": 1.995959595959596e-05,
+ "loss": 1.5479036569595337,
+ "mean_token_accuracy": 0.647777259349823,
+ "num_tokens": 65536.0,
+ "step": 4
+ },
+ {
+ "entropy": 2.1211423873901367,
+ "epoch": 0.010101010101010102,
+ "grad_norm": 4.352237701416016,
+ "learning_rate": 1.9946127946127948e-05,
+ "loss": 1.7965757846832275,
+ "mean_token_accuracy": 0.5992916226387024,
+ "num_tokens": 81920.0,
+ "step": 5
+ },
+ {
+ "entropy": 1.6345494985580444,
+ "epoch": 0.012121212121212121,
+ "grad_norm": 3.2360711097717285,
+ "learning_rate": 1.9932659932659936e-05,
+ "loss": 1.4024577140808105,
+ "mean_token_accuracy": 0.6747679710388184,
+ "num_tokens": 98304.0,
+ "step": 6
+ },
+ {
+ "entropy": 2.105585813522339,
+ "epoch": 0.014141414141414142,
+ "grad_norm": 2.84971284866333,
+ "learning_rate": 1.991919191919192e-05,
+ "loss": 1.9915739297866821,
+ "mean_token_accuracy": 0.5882999300956726,
+ "num_tokens": 114688.0,
+ "step": 7
+ },
+ {
+ "entropy": 1.7230671644210815,
+ "epoch": 0.01616161616161616,
+ "grad_norm": 2.686546802520752,
+ "learning_rate": 1.990572390572391e-05,
+ "loss": 1.630468726158142,
+ "mean_token_accuracy": 0.6269540786743164,
+ "num_tokens": 131072.0,
+ "step": 8
+ },
+ {
+ "entropy": 2.048288106918335,
+ "epoch": 0.01818181818181818,
+ "grad_norm": 2.6931567192077637,
+ "learning_rate": 1.9892255892255894e-05,
+ "loss": 2.212648391723633,
+ "mean_token_accuracy": 0.5294333100318909,
+ "num_tokens": 147456.0,
+ "step": 9
+ },
+ {
+ "entropy": 1.3021576404571533,
+ "epoch": 0.020202020202020204,
+ "grad_norm": 2.5286052227020264,
+ "learning_rate": 1.9878787878787878e-05,
+ "loss": 1.4357099533081055,
+ "mean_token_accuracy": 0.6633487939834595,
+ "num_tokens": 163840.0,
+ "step": 10
+ },
+ {
+ "entropy": 1.6998594999313354,
+ "epoch": 0.022222222222222223,
+ "grad_norm": 2.673692226409912,
+ "learning_rate": 1.9865319865319866e-05,
+ "loss": 1.8616552352905273,
+ "mean_token_accuracy": 0.6129091382026672,
+ "num_tokens": 180224.0,
+ "step": 11
+ },
+ {
+ "entropy": 1.5349891185760498,
+ "epoch": 0.024242424242424242,
+ "grad_norm": 2.882964611053467,
+ "learning_rate": 1.9851851851851855e-05,
+ "loss": 1.7540476322174072,
+ "mean_token_accuracy": 0.6111993193626404,
+ "num_tokens": 196608.0,
+ "step": 12
+ },
+ {
+ "entropy": 1.4202098846435547,
+ "epoch": 0.026262626262626262,
+ "grad_norm": 2.3892722129821777,
+ "learning_rate": 1.983838383838384e-05,
+ "loss": 1.5638885498046875,
+ "mean_token_accuracy": 0.642892062664032,
+ "num_tokens": 212992.0,
+ "step": 13
+ },
+ {
+ "entropy": 1.462074875831604,
+ "epoch": 0.028282828282828285,
+ "grad_norm": 2.357353925704956,
+ "learning_rate": 1.9824915824915828e-05,
+ "loss": 1.5339899063110352,
+ "mean_token_accuracy": 0.643991231918335,
+ "num_tokens": 229376.0,
+ "step": 14
+ },
+ {
+ "entropy": 1.6386674642562866,
+ "epoch": 0.030303030303030304,
+ "grad_norm": 2.1600515842437744,
+ "learning_rate": 1.9811447811447812e-05,
+ "loss": 1.6242434978485107,
+ "mean_token_accuracy": 0.6472887396812439,
+ "num_tokens": 245760.0,
+ "step": 15
+ },
+ {
+ "entropy": 1.882306456565857,
+ "epoch": 0.03232323232323232,
+ "grad_norm": 2.478746175765991,
+ "learning_rate": 1.97979797979798e-05,
+ "loss": 1.83274245262146,
+ "mean_token_accuracy": 0.5993527173995972,
+ "num_tokens": 262144.0,
+ "step": 16
+ },
+ {
+ "entropy": 1.5836528539657593,
+ "epoch": 0.03434343434343434,
+ "grad_norm": 2.5016613006591797,
+ "learning_rate": 1.9784511784511785e-05,
+ "loss": 1.5364878177642822,
+ "mean_token_accuracy": 0.6441743969917297,
+ "num_tokens": 278528.0,
+ "step": 17
+ },
+ {
+ "entropy": 1.5695534944534302,
+ "epoch": 0.03636363636363636,
+ "grad_norm": 2.2971248626708984,
+ "learning_rate": 1.9771043771043774e-05,
+ "loss": 1.5179738998413086,
+ "mean_token_accuracy": 0.6437469720840454,
+ "num_tokens": 294912.0,
+ "step": 18
+ },
+ {
+ "entropy": 1.3835400342941284,
+ "epoch": 0.03838383838383838,
+ "grad_norm": 2.1497576236724854,
+ "learning_rate": 1.975757575757576e-05,
+ "loss": 1.3505406379699707,
+ "mean_token_accuracy": 0.6729970574378967,
+ "num_tokens": 311296.0,
+ "step": 19
+ },
+ {
+ "entropy": 1.4660464525222778,
+ "epoch": 0.04040404040404041,
+ "grad_norm": 2.048318862915039,
+ "learning_rate": 1.9744107744107747e-05,
+ "loss": 1.3898100852966309,
+ "mean_token_accuracy": 0.6654250025749207,
+ "num_tokens": 327680.0,
+ "step": 20
+ },
+ {
+ "entropy": 1.959633469581604,
+ "epoch": 0.04242424242424243,
+ "grad_norm": 2.2084245681762695,
+ "learning_rate": 1.973063973063973e-05,
+ "loss": 1.9230711460113525,
+ "mean_token_accuracy": 0.5726062655448914,
+ "num_tokens": 344064.0,
+ "step": 21
+ },
+ {
+ "entropy": 1.4872093200683594,
+ "epoch": 0.044444444444444446,
+ "grad_norm": 2.116982936859131,
+ "learning_rate": 1.971717171717172e-05,
+ "loss": 1.514385461807251,
+ "mean_token_accuracy": 0.6615168452262878,
+ "num_tokens": 360448.0,
+ "step": 22
+ },
+ {
+ "entropy": 1.845888614654541,
+ "epoch": 0.046464646464646465,
+ "grad_norm": 2.4377331733703613,
+ "learning_rate": 1.9703703703703704e-05,
+ "loss": 1.8750195503234863,
+ "mean_token_accuracy": 0.5962994694709778,
+ "num_tokens": 376832.0,
+ "step": 23
+ },
+ {
+ "entropy": 1.5549575090408325,
+ "epoch": 0.048484848484848485,
+ "grad_norm": 2.44534969329834,
+ "learning_rate": 1.9690235690235692e-05,
+ "loss": 1.627150058746338,
+ "mean_token_accuracy": 0.6215803623199463,
+ "num_tokens": 393216.0,
+ "step": 24
+ },
+ {
+ "entropy": 1.4516701698303223,
+ "epoch": 0.050505050505050504,
+ "grad_norm": 2.2948875427246094,
+ "learning_rate": 1.9676767676767677e-05,
+ "loss": 1.4912647008895874,
+ "mean_token_accuracy": 0.6431363224983215,
+ "num_tokens": 409600.0,
+ "step": 25
+ },
+ {
+ "entropy": 1.3493973016738892,
+ "epoch": 0.052525252525252523,
+ "grad_norm": 2.1061222553253174,
+ "learning_rate": 1.9663299663299665e-05,
+ "loss": 1.44138765335083,
+ "mean_token_accuracy": 0.6621885895729065,
+ "num_tokens": 425984.0,
+ "step": 26
+ },
+ {
+ "entropy": 1.7119438648223877,
+ "epoch": 0.05454545454545454,
+ "grad_norm": 2.5149970054626465,
+ "learning_rate": 1.9649831649831654e-05,
+ "loss": 1.776426076889038,
+ "mean_token_accuracy": 0.5944675207138062,
+ "num_tokens": 442368.0,
+ "step": 27
+ },
+ {
+ "entropy": 1.361685872077942,
+ "epoch": 0.05656565656565657,
+ "grad_norm": 2.343843460083008,
+ "learning_rate": 1.963636363636364e-05,
+ "loss": 1.404232144355774,
+ "mean_token_accuracy": 0.6639594435691833,
+ "num_tokens": 458752.0,
+ "step": 28
+ },
+ {
+ "entropy": 1.2213996648788452,
+ "epoch": 0.05858585858585859,
+ "grad_norm": 1.9002994298934937,
+ "learning_rate": 1.9622895622895623e-05,
+ "loss": 1.249969244003296,
+ "mean_token_accuracy": 0.6933927536010742,
+ "num_tokens": 475136.0,
+ "step": 29
+ },
+ {
+ "entropy": 1.7157055139541626,
+ "epoch": 0.06060606060606061,
+ "grad_norm": 2.21567702293396,
+ "learning_rate": 1.960942760942761e-05,
+ "loss": 1.7103240489959717,
+ "mean_token_accuracy": 0.6218856573104858,
+ "num_tokens": 491520.0,
+ "step": 30
+ },
+ {
+ "entropy": 1.8233915567398071,
+ "epoch": 0.06262626262626263,
+ "grad_norm": 2.0189297199249268,
+ "learning_rate": 1.9595959595959596e-05,
+ "loss": 1.820570707321167,
+ "mean_token_accuracy": 0.6126648783683777,
+ "num_tokens": 507904.0,
+ "step": 31
+ },
+ {
+ "entropy": 1.82878839969635,
+ "epoch": 0.06464646464646465,
+ "grad_norm": 2.556058883666992,
+ "learning_rate": 1.9582491582491584e-05,
+ "loss": 1.773336410522461,
+ "mean_token_accuracy": 0.5889716744422913,
+ "num_tokens": 524288.0,
+ "step": 32
+ },
+ {
+ "entropy": 1.4608416557312012,
+ "epoch": 0.06666666666666667,
+ "grad_norm": 2.0254712104797363,
+ "learning_rate": 1.956902356902357e-05,
+ "loss": 1.4261068105697632,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 540672.0,
+ "step": 33
+ },
+ {
+ "entropy": 1.4706993103027344,
+ "epoch": 0.06868686868686869,
+ "grad_norm": 2.1344153881073,
+ "learning_rate": 1.9555555555555557e-05,
+ "loss": 1.4610451459884644,
+ "mean_token_accuracy": 0.6472276449203491,
+ "num_tokens": 557056.0,
+ "step": 34
+ },
+ {
+ "entropy": 1.9629759788513184,
+ "epoch": 0.0707070707070707,
+ "grad_norm": 2.209073066711426,
+ "learning_rate": 1.9542087542087545e-05,
+ "loss": 1.9688678979873657,
+ "mean_token_accuracy": 0.5702857971191406,
+ "num_tokens": 573440.0,
+ "step": 35
+ },
+ {
+ "entropy": 1.5821412801742554,
+ "epoch": 0.07272727272727272,
+ "grad_norm": 1.9711852073669434,
+ "learning_rate": 1.952861952861953e-05,
+ "loss": 1.5614874362945557,
+ "mean_token_accuracy": 0.639167070388794,
+ "num_tokens": 589824.0,
+ "step": 36
+ },
+ {
+ "entropy": 1.4696686267852783,
+ "epoch": 0.07474747474747474,
+ "grad_norm": 2.07849383354187,
+ "learning_rate": 1.9515151515151515e-05,
+ "loss": 1.497229814529419,
+ "mean_token_accuracy": 0.6555324792861938,
+ "num_tokens": 606208.0,
+ "step": 37
+ },
+ {
+ "entropy": 1.481307864189148,
+ "epoch": 0.07676767676767676,
+ "grad_norm": 2.028839588165283,
+ "learning_rate": 1.9501683501683503e-05,
+ "loss": 1.495100975036621,
+ "mean_token_accuracy": 0.6472276449203491,
+ "num_tokens": 622592.0,
+ "step": 38
+ },
+ {
+ "entropy": 1.515073537826538,
+ "epoch": 0.07878787878787878,
+ "grad_norm": 2.2417402267456055,
+ "learning_rate": 1.9488215488215488e-05,
+ "loss": 1.6139262914657593,
+ "mean_token_accuracy": 0.6312286257743835,
+ "num_tokens": 638976.0,
+ "step": 39
+ },
+ {
+ "entropy": 1.9048941135406494,
+ "epoch": 0.08080808080808081,
+ "grad_norm": 2.232630968093872,
+ "learning_rate": 1.9474747474747476e-05,
+ "loss": 1.9573429822921753,
+ "mean_token_accuracy": 0.5796287059783936,
+ "num_tokens": 655360.0,
+ "step": 40
+ },
+ {
+ "entropy": 1.7393985986709595,
+ "epoch": 0.08282828282828283,
+ "grad_norm": 2.1077799797058105,
+ "learning_rate": 1.9461279461279464e-05,
+ "loss": 1.825897216796875,
+ "mean_token_accuracy": 0.5946506857872009,
+ "num_tokens": 671744.0,
+ "step": 41
+ },
+ {
+ "entropy": 1.6294668912887573,
+ "epoch": 0.08484848484848485,
+ "grad_norm": 2.299520492553711,
+ "learning_rate": 1.944781144781145e-05,
+ "loss": 1.6667912006378174,
+ "mean_token_accuracy": 0.6225574016571045,
+ "num_tokens": 688128.0,
+ "step": 42
+ },
+ {
+ "entropy": 1.4176290035247803,
+ "epoch": 0.08686868686868687,
+ "grad_norm": 1.9385138750076294,
+ "learning_rate": 1.9434343434343437e-05,
+ "loss": 1.422924280166626,
+ "mean_token_accuracy": 0.6719589829444885,
+ "num_tokens": 704512.0,
+ "step": 43
+ },
+ {
+ "entropy": 1.6570991277694702,
+ "epoch": 0.08888888888888889,
+ "grad_norm": 2.1650922298431396,
+ "learning_rate": 1.9420875420875422e-05,
+ "loss": 1.6351218223571777,
+ "mean_token_accuracy": 0.6342818737030029,
+ "num_tokens": 720896.0,
+ "step": 44
+ },
+ {
+ "entropy": 1.520472764968872,
+ "epoch": 0.09090909090909091,
+ "grad_norm": 2.116955280303955,
+ "learning_rate": 1.9407407407407407e-05,
+ "loss": 1.4788711071014404,
+ "mean_token_accuracy": 0.6557767391204834,
+ "num_tokens": 737280.0,
+ "step": 45
+ },
+ {
+ "entropy": 1.3090498447418213,
+ "epoch": 0.09292929292929293,
+ "grad_norm": 2.0493314266204834,
+ "learning_rate": 1.9393939393939395e-05,
+ "loss": 1.3372726440429688,
+ "mean_token_accuracy": 0.6762945652008057,
+ "num_tokens": 753664.0,
+ "step": 46
+ },
+ {
+ "entropy": 1.6449471712112427,
+ "epoch": 0.09494949494949495,
+ "grad_norm": 2.2450437545776367,
+ "learning_rate": 1.9380471380471383e-05,
+ "loss": 1.6683790683746338,
+ "mean_token_accuracy": 0.6266487836837769,
+ "num_tokens": 770048.0,
+ "step": 47
+ },
+ {
+ "entropy": 1.2516838312149048,
+ "epoch": 0.09696969696969697,
+ "grad_norm": 2.168203592300415,
+ "learning_rate": 1.9367003367003368e-05,
+ "loss": 1.2885866165161133,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 786432.0,
+ "step": 48
+ },
+ {
+ "entropy": 1.7858967781066895,
+ "epoch": 0.09898989898989899,
+ "grad_norm": 2.0490918159484863,
+ "learning_rate": 1.9353535353535356e-05,
+ "loss": 1.8125935792922974,
+ "mean_token_accuracy": 0.5957498550415039,
+ "num_tokens": 802816.0,
+ "step": 49
+ },
+ {
+ "entropy": 1.6833406686782837,
+ "epoch": 0.10101010101010101,
+ "grad_norm": 1.9622541666030884,
+ "learning_rate": 1.934006734006734e-05,
+ "loss": 1.715425729751587,
+ "mean_token_accuracy": 0.606008768081665,
+ "num_tokens": 819200.0,
+ "step": 50
+ },
+ {
+ "entropy": 1.4103842973709106,
+ "epoch": 0.10303030303030303,
+ "grad_norm": 2.015503406524658,
+ "learning_rate": 1.932659932659933e-05,
+ "loss": 1.4374600648880005,
+ "mean_token_accuracy": 0.6615168452262878,
+ "num_tokens": 835584.0,
+ "step": 51
+ },
+ {
+ "entropy": 1.6805938482284546,
+ "epoch": 0.10505050505050505,
+ "grad_norm": 2.139333963394165,
+ "learning_rate": 1.9313131313131314e-05,
+ "loss": 1.684693455696106,
+ "mean_token_accuracy": 0.6270151734352112,
+ "num_tokens": 851968.0,
+ "step": 52
+ },
+ {
+ "entropy": 1.770232915878296,
+ "epoch": 0.10707070707070707,
+ "grad_norm": 2.3331124782562256,
+ "learning_rate": 1.92996632996633e-05,
+ "loss": 1.781606674194336,
+ "mean_token_accuracy": 0.6006350517272949,
+ "num_tokens": 868352.0,
+ "step": 53
+ },
+ {
+ "entropy": 1.676267147064209,
+ "epoch": 0.10909090909090909,
+ "grad_norm": 2.1863765716552734,
+ "learning_rate": 1.9286195286195287e-05,
+ "loss": 1.6873016357421875,
+ "mean_token_accuracy": 0.6182828545570374,
+ "num_tokens": 884736.0,
+ "step": 54
+ },
+ {
+ "entropy": 1.3133333921432495,
+ "epoch": 0.1111111111111111,
+ "grad_norm": 2.455390691757202,
+ "learning_rate": 1.9272727272727275e-05,
+ "loss": 1.336955189704895,
+ "mean_token_accuracy": 0.682584285736084,
+ "num_tokens": 901120.0,
+ "step": 55
+ },
+ {
+ "entropy": 1.8064881563186646,
+ "epoch": 0.11313131313131314,
+ "grad_norm": 2.218869686126709,
+ "learning_rate": 1.925925925925926e-05,
+ "loss": 1.8163663148880005,
+ "mean_token_accuracy": 0.5947728157043457,
+ "num_tokens": 917504.0,
+ "step": 56
+ },
+ {
+ "entropy": 1.495352864265442,
+ "epoch": 0.11515151515151516,
+ "grad_norm": 2.040064573287964,
+ "learning_rate": 1.9245791245791248e-05,
+ "loss": 1.4638073444366455,
+ "mean_token_accuracy": 0.6512579321861267,
+ "num_tokens": 933888.0,
+ "step": 57
+ },
+ {
+ "entropy": 1.5757899284362793,
+ "epoch": 0.11717171717171718,
+ "grad_norm": 1.8449796438217163,
+ "learning_rate": 1.9232323232323233e-05,
+ "loss": 1.5526244640350342,
+ "mean_token_accuracy": 0.6346482634544373,
+ "num_tokens": 950272.0,
+ "step": 58
+ },
+ {
+ "entropy": 1.6834555864334106,
+ "epoch": 0.1191919191919192,
+ "grad_norm": 2.0705320835113525,
+ "learning_rate": 1.921885521885522e-05,
+ "loss": 1.753828763961792,
+ "mean_token_accuracy": 0.6237176060676575,
+ "num_tokens": 966656.0,
+ "step": 59
+ },
+ {
+ "entropy": 1.5231870412826538,
+ "epoch": 0.12121212121212122,
+ "grad_norm": 2.1398122310638428,
+ "learning_rate": 1.9205387205387206e-05,
+ "loss": 1.515265941619873,
+ "mean_token_accuracy": 0.6452125310897827,
+ "num_tokens": 983040.0,
+ "step": 60
+ },
+ {
+ "entropy": 1.6915754079818726,
+ "epoch": 0.12323232323232323,
+ "grad_norm": 2.179158926010132,
+ "learning_rate": 1.9191919191919194e-05,
+ "loss": 1.6949875354766846,
+ "mean_token_accuracy": 0.6109550595283508,
+ "num_tokens": 999424.0,
+ "step": 61
+ },
+ {
+ "entropy": 1.580087661743164,
+ "epoch": 0.12525252525252525,
+ "grad_norm": 2.8643219470977783,
+ "learning_rate": 1.9178451178451182e-05,
+ "loss": 1.6217050552368164,
+ "mean_token_accuracy": 0.6498534679412842,
+ "num_tokens": 1015808.0,
+ "step": 62
+ },
+ {
+ "entropy": 1.7331494092941284,
+ "epoch": 0.12727272727272726,
+ "grad_norm": 2.0613038539886475,
+ "learning_rate": 1.9164983164983167e-05,
+ "loss": 1.7527930736541748,
+ "mean_token_accuracy": 0.59513920545578,
+ "num_tokens": 1032192.0,
+ "step": 63
+ },
+ {
+ "entropy": 1.3311079740524292,
+ "epoch": 0.1292929292929293,
+ "grad_norm": 1.996009111404419,
+ "learning_rate": 1.9151515151515152e-05,
+ "loss": 1.3299833536148071,
+ "mean_token_accuracy": 0.6760503053665161,
+ "num_tokens": 1048576.0,
+ "step": 64
+ },
+ {
+ "entropy": 1.1875317096710205,
+ "epoch": 0.13131313131313133,
+ "grad_norm": 1.9458681344985962,
+ "learning_rate": 1.913804713804714e-05,
+ "loss": 1.1885290145874023,
+ "mean_token_accuracy": 0.6996213793754578,
+ "num_tokens": 1064960.0,
+ "step": 65
+ },
+ {
+ "entropy": 1.0825527906417847,
+ "epoch": 0.13333333333333333,
+ "grad_norm": 1.8164746761322021,
+ "learning_rate": 1.9124579124579125e-05,
+ "loss": 1.0918856859207153,
+ "mean_token_accuracy": 0.7477405667304993,
+ "num_tokens": 1081344.0,
+ "step": 66
+ },
+ {
+ "entropy": 1.5940357446670532,
+ "epoch": 0.13535353535353536,
+ "grad_norm": 1.9322525262832642,
+ "learning_rate": 1.9111111111111113e-05,
+ "loss": 1.6157622337341309,
+ "mean_token_accuracy": 0.6340376138687134,
+ "num_tokens": 1097728.0,
+ "step": 67
+ },
+ {
+ "entropy": 1.683976173400879,
+ "epoch": 0.13737373737373737,
+ "grad_norm": 2.1792430877685547,
+ "learning_rate": 1.9097643097643098e-05,
+ "loss": 1.7643585205078125,
+ "mean_token_accuracy": 0.5998412370681763,
+ "num_tokens": 1114112.0,
+ "step": 68
+ },
+ {
+ "entropy": 1.5753607749938965,
+ "epoch": 0.1393939393939394,
+ "grad_norm": 2.033538818359375,
+ "learning_rate": 1.9084175084175086e-05,
+ "loss": 1.628584861755371,
+ "mean_token_accuracy": 0.6401441097259521,
+ "num_tokens": 1130496.0,
+ "step": 69
+ },
+ {
+ "entropy": 1.4061329364776611,
+ "epoch": 0.1414141414141414,
+ "grad_norm": 1.9239107370376587,
+ "learning_rate": 1.9070707070707074e-05,
+ "loss": 1.4355204105377197,
+ "mean_token_accuracy": 0.6727527976036072,
+ "num_tokens": 1146880.0,
+ "step": 70
+ },
+ {
+ "entropy": 1.1722302436828613,
+ "epoch": 0.14343434343434344,
+ "grad_norm": 2.0911052227020264,
+ "learning_rate": 1.905723905723906e-05,
+ "loss": 1.2008472681045532,
+ "mean_token_accuracy": 0.7064606547355652,
+ "num_tokens": 1163264.0,
+ "step": 71
+ },
+ {
+ "entropy": 1.5291107892990112,
+ "epoch": 0.14545454545454545,
+ "grad_norm": 2.1054158210754395,
+ "learning_rate": 1.9043771043771044e-05,
+ "loss": 1.574873924255371,
+ "mean_token_accuracy": 0.6356253027915955,
+ "num_tokens": 1179648.0,
+ "step": 72
+ },
+ {
+ "entropy": 1.3679379224777222,
+ "epoch": 0.14747474747474748,
+ "grad_norm": 1.928666353225708,
+ "learning_rate": 1.9030303030303032e-05,
+ "loss": 1.3473236560821533,
+ "mean_token_accuracy": 0.679347813129425,
+ "num_tokens": 1196032.0,
+ "step": 73
+ },
+ {
+ "entropy": 1.7593064308166504,
+ "epoch": 0.1494949494949495,
+ "grad_norm": 2.3172972202301025,
+ "learning_rate": 1.9016835016835017e-05,
+ "loss": 1.7953016757965088,
+ "mean_token_accuracy": 0.6107107996940613,
+ "num_tokens": 1212416.0,
+ "step": 74
+ },
+ {
+ "entropy": 1.3841301202774048,
+ "epoch": 0.15151515151515152,
+ "grad_norm": 1.9938782453536987,
+ "learning_rate": 1.9003367003367005e-05,
+ "loss": 1.3923728466033936,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 1228800.0,
+ "step": 75
+ },
+ {
+ "entropy": 1.6030631065368652,
+ "epoch": 0.15353535353535352,
+ "grad_norm": 2.0514845848083496,
+ "learning_rate": 1.8989898989898993e-05,
+ "loss": 1.5902166366577148,
+ "mean_token_accuracy": 0.6376404762268066,
+ "num_tokens": 1245184.0,
+ "step": 76
+ },
+ {
+ "entropy": 1.5902619361877441,
+ "epoch": 0.15555555555555556,
+ "grad_norm": 2.115469217300415,
+ "learning_rate": 1.8976430976430978e-05,
+ "loss": 1.5841395854949951,
+ "mean_token_accuracy": 0.6361138224601746,
+ "num_tokens": 1261568.0,
+ "step": 77
+ },
+ {
+ "entropy": 1.7821043729782104,
+ "epoch": 0.15757575757575756,
+ "grad_norm": 2.008962869644165,
+ "learning_rate": 1.8962962962962966e-05,
+ "loss": 1.7826645374298096,
+ "mean_token_accuracy": 0.6053370833396912,
+ "num_tokens": 1277952.0,
+ "step": 78
+ },
+ {
+ "entropy": 1.833274006843567,
+ "epoch": 0.1595959595959596,
+ "grad_norm": 2.0258517265319824,
+ "learning_rate": 1.894949494949495e-05,
+ "loss": 1.8566474914550781,
+ "mean_token_accuracy": 0.5800561904907227,
+ "num_tokens": 1294336.0,
+ "step": 79
+ },
+ {
+ "entropy": 1.785520315170288,
+ "epoch": 0.16161616161616163,
+ "grad_norm": 2.0918498039245605,
+ "learning_rate": 1.8936026936026936e-05,
+ "loss": 1.775907278060913,
+ "mean_token_accuracy": 0.6063141226768494,
+ "num_tokens": 1310720.0,
+ "step": 80
+ },
+ {
+ "entropy": 1.9341778755187988,
+ "epoch": 0.16363636363636364,
+ "grad_norm": 2.0399975776672363,
+ "learning_rate": 1.8922558922558924e-05,
+ "loss": 1.9579840898513794,
+ "mean_token_accuracy": 0.5619809627532959,
+ "num_tokens": 1327104.0,
+ "step": 81
+ },
+ {
+ "entropy": 1.4945461750030518,
+ "epoch": 0.16565656565656567,
+ "grad_norm": 1.9975999593734741,
+ "learning_rate": 1.8909090909090912e-05,
+ "loss": 1.5436582565307617,
+ "mean_token_accuracy": 0.6423424482345581,
+ "num_tokens": 1343488.0,
+ "step": 82
+ },
+ {
+ "entropy": 1.6639432907104492,
+ "epoch": 0.16767676767676767,
+ "grad_norm": 2.0375208854675293,
+ "learning_rate": 1.8895622895622897e-05,
+ "loss": 1.679243564605713,
+ "mean_token_accuracy": 0.6226184368133545,
+ "num_tokens": 1359872.0,
+ "step": 83
+ },
+ {
+ "entropy": 1.4505668878555298,
+ "epoch": 0.1696969696969697,
+ "grad_norm": 1.8894681930541992,
+ "learning_rate": 1.8882154882154885e-05,
+ "loss": 1.4778342247009277,
+ "mean_token_accuracy": 0.6637151837348938,
+ "num_tokens": 1376256.0,
+ "step": 84
+ },
+ {
+ "entropy": 1.3845125436782837,
+ "epoch": 0.1717171717171717,
+ "grad_norm": 2.1110754013061523,
+ "learning_rate": 1.886868686868687e-05,
+ "loss": 1.4153435230255127,
+ "mean_token_accuracy": 0.6737298369407654,
+ "num_tokens": 1392640.0,
+ "step": 85
+ },
+ {
+ "entropy": 1.8785539865493774,
+ "epoch": 0.17373737373737375,
+ "grad_norm": 2.0894815921783447,
+ "learning_rate": 1.8855218855218858e-05,
+ "loss": 1.8658334016799927,
+ "mean_token_accuracy": 0.5846360325813293,
+ "num_tokens": 1409024.0,
+ "step": 86
+ },
+ {
+ "entropy": 1.6006972789764404,
+ "epoch": 0.17575757575757575,
+ "grad_norm": 2.088477849960327,
+ "learning_rate": 1.8841750841750843e-05,
+ "loss": 1.6257164478302002,
+ "mean_token_accuracy": 0.623900830745697,
+ "num_tokens": 1425408.0,
+ "step": 87
+ },
+ {
+ "entropy": 1.1098109483718872,
+ "epoch": 0.17777777777777778,
+ "grad_norm": 1.934228539466858,
+ "learning_rate": 1.8828282828282827e-05,
+ "loss": 1.0948461294174194,
+ "mean_token_accuracy": 0.7248412370681763,
+ "num_tokens": 1441792.0,
+ "step": 88
+ },
+ {
+ "entropy": 1.4807215929031372,
+ "epoch": 0.1797979797979798,
+ "grad_norm": 2.06062388420105,
+ "learning_rate": 1.8814814814814816e-05,
+ "loss": 1.5115268230438232,
+ "mean_token_accuracy": 0.6463117003440857,
+ "num_tokens": 1458176.0,
+ "step": 89
+ },
+ {
+ "entropy": 1.07956862449646,
+ "epoch": 0.18181818181818182,
+ "grad_norm": 1.8913685083389282,
+ "learning_rate": 1.8801346801346804e-05,
+ "loss": 1.0902754068374634,
+ "mean_token_accuracy": 0.7308256030082703,
+ "num_tokens": 1474560.0,
+ "step": 90
+ },
+ {
+ "entropy": 1.4571733474731445,
+ "epoch": 0.18383838383838383,
+ "grad_norm": 2.2199525833129883,
+ "learning_rate": 1.8787878787878792e-05,
+ "loss": 1.4686330556869507,
+ "mean_token_accuracy": 0.6566927433013916,
+ "num_tokens": 1490944.0,
+ "step": 91
+ },
+ {
+ "entropy": 1.4484740495681763,
+ "epoch": 0.18585858585858586,
+ "grad_norm": 2.0670580863952637,
+ "learning_rate": 1.8774410774410777e-05,
+ "loss": 1.4791338443756104,
+ "mean_token_accuracy": 0.6493649482727051,
+ "num_tokens": 1507328.0,
+ "step": 92
+ },
+ {
+ "entropy": 1.498313546180725,
+ "epoch": 0.18787878787878787,
+ "grad_norm": 2.024329423904419,
+ "learning_rate": 1.876094276094276e-05,
+ "loss": 1.4964686632156372,
+ "mean_token_accuracy": 0.6457620859146118,
+ "num_tokens": 1523712.0,
+ "step": 93
+ },
+ {
+ "entropy": 1.4806159734725952,
+ "epoch": 0.1898989898989899,
+ "grad_norm": 2.1369152069091797,
+ "learning_rate": 1.874747474747475e-05,
+ "loss": 1.4587206840515137,
+ "mean_token_accuracy": 0.6521739363670349,
+ "num_tokens": 1540096.0,
+ "step": 94
+ },
+ {
+ "entropy": 1.3746109008789062,
+ "epoch": 0.1919191919191919,
+ "grad_norm": 2.216958522796631,
+ "learning_rate": 1.8734006734006735e-05,
+ "loss": 1.3600832223892212,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 1556480.0,
+ "step": 95
+ },
+ {
+ "entropy": 1.3492207527160645,
+ "epoch": 0.19393939393939394,
+ "grad_norm": 2.093956708908081,
+ "learning_rate": 1.8720538720538723e-05,
+ "loss": 1.3867243528366089,
+ "mean_token_accuracy": 0.6625549793243408,
+ "num_tokens": 1572864.0,
+ "step": 96
+ },
+ {
+ "entropy": 1.560738205909729,
+ "epoch": 0.19595959595959597,
+ "grad_norm": 2.0691707134246826,
+ "learning_rate": 1.8707070707070707e-05,
+ "loss": 1.5875897407531738,
+ "mean_token_accuracy": 0.6345872282981873,
+ "num_tokens": 1589248.0,
+ "step": 97
+ },
+ {
+ "entropy": 1.46450674533844,
+ "epoch": 0.19797979797979798,
+ "grad_norm": 2.064547538757324,
+ "learning_rate": 1.8693602693602696e-05,
+ "loss": 1.4920742511749268,
+ "mean_token_accuracy": 0.6411822438240051,
+ "num_tokens": 1605632.0,
+ "step": 98
+ },
+ {
+ "entropy": 1.5433454513549805,
+ "epoch": 0.2,
+ "grad_norm": 2.014409303665161,
+ "learning_rate": 1.868013468013468e-05,
+ "loss": 1.5737671852111816,
+ "mean_token_accuracy": 0.6349536180496216,
+ "num_tokens": 1622016.0,
+ "step": 99
+ },
+ {
+ "entropy": 1.358772873878479,
+ "epoch": 0.20202020202020202,
+ "grad_norm": 1.9765456914901733,
+ "learning_rate": 1.866666666666667e-05,
+ "loss": 1.3583091497421265,
+ "mean_token_accuracy": 0.680446982383728,
+ "num_tokens": 1638400.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.20202020202020202,
+ "eval_entropy": 1.5664977690865916,
+ "eval_loss": 1.5804312229156494,
+ "eval_mean_token_accuracy": 0.63647972239602,
+ "eval_num_tokens": 1638400.0,
+ "eval_runtime": 44.1541,
+ "eval_samples_per_second": 22.421,
+ "eval_steps_per_second": 2.808,
+ "step": 100
+ },
+ {
+ "entropy": 1.5879693031311035,
+ "epoch": 0.20404040404040405,
+ "grad_norm": 1.8491015434265137,
+ "learning_rate": 1.8653198653198653e-05,
+ "loss": 1.5892077684402466,
+ "mean_token_accuracy": 0.6665852665901184,
+ "num_tokens": 1654784.0,
+ "step": 101
+ },
+ {
+ "entropy": 1.5789942741394043,
+ "epoch": 0.20606060606060606,
+ "grad_norm": 1.9096908569335938,
+ "learning_rate": 1.863973063973064e-05,
+ "loss": 1.594193458557129,
+ "mean_token_accuracy": 0.6293966770172119,
+ "num_tokens": 1671168.0,
+ "step": 102
+ },
+ {
+ "entropy": 1.5245429277420044,
+ "epoch": 0.2080808080808081,
+ "grad_norm": 1.986904501914978,
+ "learning_rate": 1.8626262626262626e-05,
+ "loss": 1.5463616847991943,
+ "mean_token_accuracy": 0.6354421377182007,
+ "num_tokens": 1687552.0,
+ "step": 103
+ },
+ {
+ "entropy": 2.015364408493042,
+ "epoch": 0.2101010101010101,
+ "grad_norm": 2.3297250270843506,
+ "learning_rate": 1.8612794612794615e-05,
+ "loss": 1.987194538116455,
+ "mean_token_accuracy": 0.5604543089866638,
+ "num_tokens": 1703936.0,
+ "step": 104
+ },
+ {
+ "entropy": 1.770432472229004,
+ "epoch": 0.21212121212121213,
+ "grad_norm": 2.3580551147460938,
+ "learning_rate": 1.8599326599326603e-05,
+ "loss": 1.7715529203414917,
+ "mean_token_accuracy": 0.5786516666412354,
+ "num_tokens": 1720320.0,
+ "step": 105
+ },
+ {
+ "entropy": 1.3456813097000122,
+ "epoch": 0.21414141414141413,
+ "grad_norm": 1.9782105684280396,
+ "learning_rate": 1.8585858585858588e-05,
+ "loss": 1.342590570449829,
+ "mean_token_accuracy": 0.6779433488845825,
+ "num_tokens": 1736704.0,
+ "step": 106
+ },
+ {
+ "entropy": 1.4614694118499756,
+ "epoch": 0.21616161616161617,
+ "grad_norm": 1.9486815929412842,
+ "learning_rate": 1.8572390572390572e-05,
+ "loss": 1.4493391513824463,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 1753088.0,
+ "step": 107
+ },
+ {
+ "entropy": 2.007932186126709,
+ "epoch": 0.21818181818181817,
+ "grad_norm": 2.0571465492248535,
+ "learning_rate": 1.855892255892256e-05,
+ "loss": 2.033851385116577,
+ "mean_token_accuracy": 0.5746213793754578,
+ "num_tokens": 1769472.0,
+ "step": 108
+ },
+ {
+ "entropy": 1.506022572517395,
+ "epoch": 0.2202020202020202,
+ "grad_norm": 1.9980531930923462,
+ "learning_rate": 1.8545454545454545e-05,
+ "loss": 1.5305016040802002,
+ "mean_token_accuracy": 0.6416096687316895,
+ "num_tokens": 1785856.0,
+ "step": 109
+ },
+ {
+ "entropy": 1.479506492614746,
+ "epoch": 0.2222222222222222,
+ "grad_norm": 2.411241292953491,
+ "learning_rate": 1.8531986531986533e-05,
+ "loss": 1.5501817464828491,
+ "mean_token_accuracy": 0.6364802122116089,
+ "num_tokens": 1802240.0,
+ "step": 110
+ },
+ {
+ "entropy": 1.7731081247329712,
+ "epoch": 0.22424242424242424,
+ "grad_norm": 2.1088449954986572,
+ "learning_rate": 1.851851851851852e-05,
+ "loss": 1.7582051753997803,
+ "mean_token_accuracy": 0.5985588431358337,
+ "num_tokens": 1818624.0,
+ "step": 111
+ },
+ {
+ "entropy": 1.7963190078735352,
+ "epoch": 0.22626262626262628,
+ "grad_norm": 2.180325508117676,
+ "learning_rate": 1.8505050505050506e-05,
+ "loss": 1.8436882495880127,
+ "mean_token_accuracy": 0.5850635170936584,
+ "num_tokens": 1835008.0,
+ "step": 112
+ },
+ {
+ "entropy": 1.513211727142334,
+ "epoch": 0.22828282828282828,
+ "grad_norm": 2.1563429832458496,
+ "learning_rate": 1.8491582491582495e-05,
+ "loss": 1.547263741493225,
+ "mean_token_accuracy": 0.6399609446525574,
+ "num_tokens": 1851392.0,
+ "step": 113
+ },
+ {
+ "entropy": 1.8904774188995361,
+ "epoch": 0.23030303030303031,
+ "grad_norm": 2.2191243171691895,
+ "learning_rate": 1.847811447811448e-05,
+ "loss": 1.9237418174743652,
+ "mean_token_accuracy": 0.5852466821670532,
+ "num_tokens": 1867776.0,
+ "step": 114
+ },
+ {
+ "entropy": 1.706113338470459,
+ "epoch": 0.23232323232323232,
+ "grad_norm": 2.1411335468292236,
+ "learning_rate": 1.8464646464646464e-05,
+ "loss": 1.7145740985870361,
+ "mean_token_accuracy": 0.6138861775398254,
+ "num_tokens": 1884160.0,
+ "step": 115
+ },
+ {
+ "entropy": 1.726441502571106,
+ "epoch": 0.23434343434343435,
+ "grad_norm": 2.212477922439575,
+ "learning_rate": 1.8451178451178452e-05,
+ "loss": 1.7427434921264648,
+ "mean_token_accuracy": 0.6087567210197449,
+ "num_tokens": 1900544.0,
+ "step": 116
+ },
+ {
+ "entropy": 1.49800443649292,
+ "epoch": 0.23636363636363636,
+ "grad_norm": 2.003248929977417,
+ "learning_rate": 1.8437710437710437e-05,
+ "loss": 1.4677059650421143,
+ "mean_token_accuracy": 0.6617000699043274,
+ "num_tokens": 1916928.0,
+ "step": 117
+ },
+ {
+ "entropy": 1.5079678297042847,
+ "epoch": 0.2383838383838384,
+ "grad_norm": 1.9702556133270264,
+ "learning_rate": 1.8424242424242425e-05,
+ "loss": 1.5194823741912842,
+ "mean_token_accuracy": 0.6593796014785767,
+ "num_tokens": 1933312.0,
+ "step": 118
+ },
+ {
+ "entropy": 1.760438323020935,
+ "epoch": 0.2404040404040404,
+ "grad_norm": 1.9484418630599976,
+ "learning_rate": 1.8410774410774414e-05,
+ "loss": 1.756869912147522,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 1949696.0,
+ "step": 119
+ },
+ {
+ "entropy": 1.3706170320510864,
+ "epoch": 0.24242424242424243,
+ "grad_norm": 2.078357458114624,
+ "learning_rate": 1.83973063973064e-05,
+ "loss": 1.3532414436340332,
+ "mean_token_accuracy": 0.6680508255958557,
+ "num_tokens": 1966080.0,
+ "step": 120
+ },
+ {
+ "entropy": 1.2994399070739746,
+ "epoch": 0.24444444444444444,
+ "grad_norm": 1.9178324937820435,
+ "learning_rate": 1.8383838383838387e-05,
+ "loss": 1.298889398574829,
+ "mean_token_accuracy": 0.6831949353218079,
+ "num_tokens": 1982464.0,
+ "step": 121
+ },
+ {
+ "entropy": 1.6806142330169678,
+ "epoch": 0.24646464646464647,
+ "grad_norm": 2.287158966064453,
+ "learning_rate": 1.837037037037037e-05,
+ "loss": 1.728592038154602,
+ "mean_token_accuracy": 0.6161455512046814,
+ "num_tokens": 1998848.0,
+ "step": 122
+ },
+ {
+ "entropy": 1.2894387245178223,
+ "epoch": 0.24848484848484848,
+ "grad_norm": 1.9998525381088257,
+ "learning_rate": 1.8356902356902356e-05,
+ "loss": 1.3326170444488525,
+ "mean_token_accuracy": 0.6693331599235535,
+ "num_tokens": 2015232.0,
+ "step": 123
+ },
+ {
+ "entropy": 1.5466209650039673,
+ "epoch": 0.2505050505050505,
+ "grad_norm": 1.8439521789550781,
+ "learning_rate": 1.8343434343434344e-05,
+ "loss": 1.5606887340545654,
+ "mean_token_accuracy": 0.6571201682090759,
+ "num_tokens": 2031616.0,
+ "step": 124
+ },
+ {
+ "entropy": 1.2692567110061646,
+ "epoch": 0.25252525252525254,
+ "grad_norm": 1.9568793773651123,
+ "learning_rate": 1.8329966329966332e-05,
+ "loss": 1.308868408203125,
+ "mean_token_accuracy": 0.6954689621925354,
+ "num_tokens": 2048000.0,
+ "step": 125
+ },
+ {
+ "entropy": 1.5780351161956787,
+ "epoch": 0.2545454545454545,
+ "grad_norm": 2.151250123977661,
+ "learning_rate": 1.831649831649832e-05,
+ "loss": 1.60304856300354,
+ "mean_token_accuracy": 0.6258549094200134,
+ "num_tokens": 2064384.0,
+ "step": 126
+ },
+ {
+ "entropy": 1.487567663192749,
+ "epoch": 0.25656565656565655,
+ "grad_norm": 1.9134294986724854,
+ "learning_rate": 1.8303030303030305e-05,
+ "loss": 1.514064073562622,
+ "mean_token_accuracy": 0.6348925232887268,
+ "num_tokens": 2080768.0,
+ "step": 127
+ },
+ {
+ "entropy": 1.6072919368743896,
+ "epoch": 0.2585858585858586,
+ "grad_norm": 2.119290351867676,
+ "learning_rate": 1.828956228956229e-05,
+ "loss": 1.6062684059143066,
+ "mean_token_accuracy": 0.6332437992095947,
+ "num_tokens": 2097152.0,
+ "step": 128
+ },
+ {
+ "entropy": 1.1168174743652344,
+ "epoch": 0.2606060606060606,
+ "grad_norm": 1.8520931005477905,
+ "learning_rate": 1.827609427609428e-05,
+ "loss": 1.1421526670455933,
+ "mean_token_accuracy": 0.7078651785850525,
+ "num_tokens": 2113536.0,
+ "step": 129
+ },
+ {
+ "entropy": 1.349792718887329,
+ "epoch": 0.26262626262626265,
+ "grad_norm": 1.8463630676269531,
+ "learning_rate": 1.8262626262626263e-05,
+ "loss": 1.3712577819824219,
+ "mean_token_accuracy": 0.6736077070236206,
+ "num_tokens": 2129920.0,
+ "step": 130
+ },
+ {
+ "entropy": 1.8531655073165894,
+ "epoch": 0.26464646464646463,
+ "grad_norm": 2.0503969192504883,
+ "learning_rate": 1.824915824915825e-05,
+ "loss": 1.8971941471099854,
+ "mean_token_accuracy": 0.5845749974250793,
+ "num_tokens": 2146304.0,
+ "step": 131
+ },
+ {
+ "entropy": 1.436646819114685,
+ "epoch": 0.26666666666666666,
+ "grad_norm": 1.8517117500305176,
+ "learning_rate": 1.8235690235690236e-05,
+ "loss": 1.4255880117416382,
+ "mean_token_accuracy": 0.6653639674186707,
+ "num_tokens": 2162688.0,
+ "step": 132
+ },
+ {
+ "entropy": 1.9219673871994019,
+ "epoch": 0.2686868686868687,
+ "grad_norm": 2.1424307823181152,
+ "learning_rate": 1.8222222222222224e-05,
+ "loss": 1.9088413715362549,
+ "mean_token_accuracy": 0.5868954658508301,
+ "num_tokens": 2179072.0,
+ "step": 133
+ },
+ {
+ "entropy": 1.4034194946289062,
+ "epoch": 0.27070707070707073,
+ "grad_norm": 1.9987515211105347,
+ "learning_rate": 1.8208754208754212e-05,
+ "loss": 1.3612333536148071,
+ "mean_token_accuracy": 0.6721421480178833,
+ "num_tokens": 2195456.0,
+ "step": 134
+ },
+ {
+ "entropy": 2.064425230026245,
+ "epoch": 0.2727272727272727,
+ "grad_norm": 2.0800976753234863,
+ "learning_rate": 1.8195286195286197e-05,
+ "loss": 2.0595853328704834,
+ "mean_token_accuracy": 0.5694919228553772,
+ "num_tokens": 2211840.0,
+ "step": 135
+ },
+ {
+ "entropy": 1.2883177995681763,
+ "epoch": 0.27474747474747474,
+ "grad_norm": 1.9042892456054688,
+ "learning_rate": 1.8181818181818182e-05,
+ "loss": 1.3220078945159912,
+ "mean_token_accuracy": 0.6805080771446228,
+ "num_tokens": 2228224.0,
+ "step": 136
+ },
+ {
+ "entropy": 1.101396918296814,
+ "epoch": 0.2767676767676768,
+ "grad_norm": 1.857073187828064,
+ "learning_rate": 1.816835016835017e-05,
+ "loss": 1.1156296730041504,
+ "mean_token_accuracy": 0.7214826345443726,
+ "num_tokens": 2244608.0,
+ "step": 137
+ },
+ {
+ "entropy": 1.376597285270691,
+ "epoch": 0.2787878787878788,
+ "grad_norm": 1.9103689193725586,
+ "learning_rate": 1.8154882154882155e-05,
+ "loss": 1.3915824890136719,
+ "mean_token_accuracy": 0.6824010610580444,
+ "num_tokens": 2260992.0,
+ "step": 138
+ },
+ {
+ "entropy": 1.4654942750930786,
+ "epoch": 0.2808080808080808,
+ "grad_norm": 1.9513856172561646,
+ "learning_rate": 1.8141414141414143e-05,
+ "loss": 1.5000076293945312,
+ "mean_token_accuracy": 0.6457620859146118,
+ "num_tokens": 2277376.0,
+ "step": 139
+ },
+ {
+ "entropy": 1.1999047994613647,
+ "epoch": 0.2828282828282828,
+ "grad_norm": 1.824987530708313,
+ "learning_rate": 1.812794612794613e-05,
+ "loss": 1.2217535972595215,
+ "mean_token_accuracy": 0.7034685015678406,
+ "num_tokens": 2293760.0,
+ "step": 140
+ },
+ {
+ "entropy": 1.2822942733764648,
+ "epoch": 0.28484848484848485,
+ "grad_norm": 2.0979108810424805,
+ "learning_rate": 1.8114478114478116e-05,
+ "loss": 1.309725046157837,
+ "mean_token_accuracy": 0.6855764389038086,
+ "num_tokens": 2310144.0,
+ "step": 141
+ },
+ {
+ "entropy": 1.5589981079101562,
+ "epoch": 0.2868686868686869,
+ "grad_norm": 2.030648708343506,
+ "learning_rate": 1.8101010101010104e-05,
+ "loss": 1.5918951034545898,
+ "mean_token_accuracy": 0.6286638975143433,
+ "num_tokens": 2326528.0,
+ "step": 142
+ },
+ {
+ "entropy": 1.5600453615188599,
+ "epoch": 0.28888888888888886,
+ "grad_norm": 2.023409605026245,
+ "learning_rate": 1.808754208754209e-05,
+ "loss": 1.5725011825561523,
+ "mean_token_accuracy": 0.6384342908859253,
+ "num_tokens": 2342912.0,
+ "step": 143
+ },
+ {
+ "entropy": 1.5066077709197998,
+ "epoch": 0.2909090909090909,
+ "grad_norm": 1.9963997602462769,
+ "learning_rate": 1.8074074074074074e-05,
+ "loss": 1.5066845417022705,
+ "mean_token_accuracy": 0.6474108695983887,
+ "num_tokens": 2359296.0,
+ "step": 144
+ },
+ {
+ "entropy": 1.8313122987747192,
+ "epoch": 0.29292929292929293,
+ "grad_norm": 2.0791213512420654,
+ "learning_rate": 1.8060606060606062e-05,
+ "loss": 1.8148126602172852,
+ "mean_token_accuracy": 0.5820102691650391,
+ "num_tokens": 2375680.0,
+ "step": 145
+ },
+ {
+ "entropy": 1.8828215599060059,
+ "epoch": 0.29494949494949496,
+ "grad_norm": 2.1346335411071777,
+ "learning_rate": 1.804713804713805e-05,
+ "loss": 1.905554175376892,
+ "mean_token_accuracy": 0.6041768193244934,
+ "num_tokens": 2392064.0,
+ "step": 146
+ },
+ {
+ "entropy": 1.1984127759933472,
+ "epoch": 0.296969696969697,
+ "grad_norm": 1.6585179567337036,
+ "learning_rate": 1.8033670033670035e-05,
+ "loss": 1.2255632877349854,
+ "mean_token_accuracy": 0.712506115436554,
+ "num_tokens": 2408448.0,
+ "step": 147
+ },
+ {
+ "entropy": 1.4248595237731934,
+ "epoch": 0.298989898989899,
+ "grad_norm": 2.468965530395508,
+ "learning_rate": 1.8020202020202023e-05,
+ "loss": 1.4362621307373047,
+ "mean_token_accuracy": 0.6464948654174805,
+ "num_tokens": 2424832.0,
+ "step": 148
+ },
+ {
+ "entropy": 1.7295368909835815,
+ "epoch": 0.301010101010101,
+ "grad_norm": 1.819359302520752,
+ "learning_rate": 1.8006734006734008e-05,
+ "loss": 1.7290053367614746,
+ "mean_token_accuracy": 0.6312897205352783,
+ "num_tokens": 2441216.0,
+ "step": 149
+ },
+ {
+ "entropy": 1.7334001064300537,
+ "epoch": 0.30303030303030304,
+ "grad_norm": 2.149543285369873,
+ "learning_rate": 1.7993265993265993e-05,
+ "loss": 1.7014907598495483,
+ "mean_token_accuracy": 0.5981314182281494,
+ "num_tokens": 2457600.0,
+ "step": 150
+ },
+ {
+ "entropy": 2.0550050735473633,
+ "epoch": 0.30505050505050507,
+ "grad_norm": 1.9880189895629883,
+ "learning_rate": 1.797979797979798e-05,
+ "loss": 2.001784324645996,
+ "mean_token_accuracy": 0.5552638173103333,
+ "num_tokens": 2473984.0,
+ "step": 151
+ },
+ {
+ "entropy": 1.5352036952972412,
+ "epoch": 0.30707070707070705,
+ "grad_norm": 2.031998634338379,
+ "learning_rate": 1.7966329966329966e-05,
+ "loss": 1.5262815952301025,
+ "mean_token_accuracy": 0.6328163146972656,
+ "num_tokens": 2490368.0,
+ "step": 152
+ },
+ {
+ "entropy": 1.4278677701950073,
+ "epoch": 0.3090909090909091,
+ "grad_norm": 2.101398229598999,
+ "learning_rate": 1.7952861952861954e-05,
+ "loss": 1.4288041591644287,
+ "mean_token_accuracy": 0.6647533178329468,
+ "num_tokens": 2506752.0,
+ "step": 153
+ },
+ {
+ "entropy": 1.7469983100891113,
+ "epoch": 0.3111111111111111,
+ "grad_norm": 2.0824313163757324,
+ "learning_rate": 1.7939393939393942e-05,
+ "loss": 1.770402193069458,
+ "mean_token_accuracy": 0.5997191071510315,
+ "num_tokens": 2523136.0,
+ "step": 154
+ },
+ {
+ "entropy": 1.6565595865249634,
+ "epoch": 0.31313131313131315,
+ "grad_norm": 2.0815961360931396,
+ "learning_rate": 1.7925925925925927e-05,
+ "loss": 1.7024259567260742,
+ "mean_token_accuracy": 0.6109550595283508,
+ "num_tokens": 2539520.0,
+ "step": 155
+ },
+ {
+ "entropy": 1.4104127883911133,
+ "epoch": 0.3151515151515151,
+ "grad_norm": 2.129694700241089,
+ "learning_rate": 1.7912457912457915e-05,
+ "loss": 1.4378812313079834,
+ "mean_token_accuracy": 0.6489985585212708,
+ "num_tokens": 2555904.0,
+ "step": 156
+ },
+ {
+ "entropy": 1.5129127502441406,
+ "epoch": 0.31717171717171716,
+ "grad_norm": 2.180267095565796,
+ "learning_rate": 1.78989898989899e-05,
+ "loss": 1.5564348697662354,
+ "mean_token_accuracy": 0.6327552795410156,
+ "num_tokens": 2572288.0,
+ "step": 157
+ },
+ {
+ "entropy": 1.5240321159362793,
+ "epoch": 0.3191919191919192,
+ "grad_norm": 1.968405842781067,
+ "learning_rate": 1.7885521885521885e-05,
+ "loss": 1.585756778717041,
+ "mean_token_accuracy": 0.629885196685791,
+ "num_tokens": 2588672.0,
+ "step": 158
+ },
+ {
+ "entropy": 1.3169562816619873,
+ "epoch": 0.3212121212121212,
+ "grad_norm": 2.0452873706817627,
+ "learning_rate": 1.7872053872053873e-05,
+ "loss": 1.3569687604904175,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 2605056.0,
+ "step": 159
+ },
+ {
+ "entropy": 1.3630796670913696,
+ "epoch": 0.32323232323232326,
+ "grad_norm": 1.9721522331237793,
+ "learning_rate": 1.785858585858586e-05,
+ "loss": 1.3965554237365723,
+ "mean_token_accuracy": 0.6626160144805908,
+ "num_tokens": 2621440.0,
+ "step": 160
+ },
+ {
+ "entropy": 1.178250789642334,
+ "epoch": 0.32525252525252524,
+ "grad_norm": 2.0231528282165527,
+ "learning_rate": 1.7845117845117846e-05,
+ "loss": 1.2126985788345337,
+ "mean_token_accuracy": 0.6977894306182861,
+ "num_tokens": 2637824.0,
+ "step": 161
+ },
+ {
+ "entropy": 1.8399475812911987,
+ "epoch": 0.32727272727272727,
+ "grad_norm": 2.0615484714508057,
+ "learning_rate": 1.7831649831649834e-05,
+ "loss": 1.868000864982605,
+ "mean_token_accuracy": 0.5822545289993286,
+ "num_tokens": 2654208.0,
+ "step": 162
+ },
+ {
+ "entropy": 1.6604139804840088,
+ "epoch": 0.3292929292929293,
+ "grad_norm": 1.9838379621505737,
+ "learning_rate": 1.781818181818182e-05,
+ "loss": 1.6677067279815674,
+ "mean_token_accuracy": 0.621275007724762,
+ "num_tokens": 2670592.0,
+ "step": 163
+ },
+ {
+ "entropy": 1.3761085271835327,
+ "epoch": 0.33131313131313134,
+ "grad_norm": 2.0093271732330322,
+ "learning_rate": 1.7804713804713807e-05,
+ "loss": 1.3829190731048584,
+ "mean_token_accuracy": 0.6655471324920654,
+ "num_tokens": 2686976.0,
+ "step": 164
+ },
+ {
+ "entropy": 1.578093409538269,
+ "epoch": 0.3333333333333333,
+ "grad_norm": 1.9710773229599,
+ "learning_rate": 1.7791245791245792e-05,
+ "loss": 1.560583472251892,
+ "mean_token_accuracy": 0.6344650983810425,
+ "num_tokens": 2703360.0,
+ "step": 165
+ },
+ {
+ "entropy": 1.0447157621383667,
+ "epoch": 0.33535353535353535,
+ "grad_norm": 1.68338942527771,
+ "learning_rate": 1.7777777777777777e-05,
+ "loss": 1.0116058588027954,
+ "mean_token_accuracy": 0.7449315786361694,
+ "num_tokens": 2719744.0,
+ "step": 166
+ },
+ {
+ "entropy": 1.3687469959259033,
+ "epoch": 0.3373737373737374,
+ "grad_norm": 2.062744617462158,
+ "learning_rate": 1.7764309764309765e-05,
+ "loss": 1.3179712295532227,
+ "mean_token_accuracy": 0.6761724352836609,
+ "num_tokens": 2736128.0,
+ "step": 167
+ },
+ {
+ "entropy": 1.8639556169509888,
+ "epoch": 0.3393939393939394,
+ "grad_norm": 2.041898250579834,
+ "learning_rate": 1.7750841750841753e-05,
+ "loss": 1.8531380891799927,
+ "mean_token_accuracy": 0.5920859575271606,
+ "num_tokens": 2752512.0,
+ "step": 168
+ },
+ {
+ "entropy": 1.6900824308395386,
+ "epoch": 0.3414141414141414,
+ "grad_norm": 1.9403504133224487,
+ "learning_rate": 1.773737373737374e-05,
+ "loss": 1.701782464981079,
+ "mean_token_accuracy": 0.6102222800254822,
+ "num_tokens": 2768896.0,
+ "step": 169
+ },
+ {
+ "entropy": 1.6202301979064941,
+ "epoch": 0.3434343434343434,
+ "grad_norm": 2.027329683303833,
+ "learning_rate": 1.7723905723905726e-05,
+ "loss": 1.6471121311187744,
+ "mean_token_accuracy": 0.6310454607009888,
+ "num_tokens": 2785280.0,
+ "step": 170
+ },
+ {
+ "entropy": 1.2701244354248047,
+ "epoch": 0.34545454545454546,
+ "grad_norm": 1.8625534772872925,
+ "learning_rate": 1.771043771043771e-05,
+ "loss": 1.291702151298523,
+ "mean_token_accuracy": 0.67659991979599,
+ "num_tokens": 2801664.0,
+ "step": 171
+ },
+ {
+ "entropy": 1.5759357213974,
+ "epoch": 0.3474747474747475,
+ "grad_norm": 1.945141077041626,
+ "learning_rate": 1.76969696969697e-05,
+ "loss": 1.6189839839935303,
+ "mean_token_accuracy": 0.6225574016571045,
+ "num_tokens": 2818048.0,
+ "step": 172
+ },
+ {
+ "entropy": 1.3319392204284668,
+ "epoch": 0.34949494949494947,
+ "grad_norm": 1.8485770225524902,
+ "learning_rate": 1.7683501683501684e-05,
+ "loss": 1.3553425073623657,
+ "mean_token_accuracy": 0.6759281754493713,
+ "num_tokens": 2834432.0,
+ "step": 173
+ },
+ {
+ "entropy": 1.3251745700836182,
+ "epoch": 0.3515151515151515,
+ "grad_norm": 2.0564401149749756,
+ "learning_rate": 1.7670033670033672e-05,
+ "loss": 1.359522819519043,
+ "mean_token_accuracy": 0.6678065657615662,
+ "num_tokens": 2850816.0,
+ "step": 174
+ },
+ {
+ "entropy": 1.2764136791229248,
+ "epoch": 0.35353535353535354,
+ "grad_norm": 2.1749041080474854,
+ "learning_rate": 1.765656565656566e-05,
+ "loss": 1.3260173797607422,
+ "mean_token_accuracy": 0.6710429787635803,
+ "num_tokens": 2867200.0,
+ "step": 175
+ },
+ {
+ "entropy": 1.6382335424423218,
+ "epoch": 0.35555555555555557,
+ "grad_norm": 1.923366904258728,
+ "learning_rate": 1.7643097643097645e-05,
+ "loss": 1.6868517398834229,
+ "mean_token_accuracy": 0.6268930435180664,
+ "num_tokens": 2883584.0,
+ "step": 176
+ },
+ {
+ "entropy": 1.2399169206619263,
+ "epoch": 0.3575757575757576,
+ "grad_norm": 1.795649766921997,
+ "learning_rate": 1.7629629629629633e-05,
+ "loss": 1.2266355752944946,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 2899968.0,
+ "step": 177
+ },
+ {
+ "entropy": 1.5761929750442505,
+ "epoch": 0.3595959595959596,
+ "grad_norm": 2.0536038875579834,
+ "learning_rate": 1.7616161616161618e-05,
+ "loss": 1.5698940753936768,
+ "mean_token_accuracy": 0.6263434290885925,
+ "num_tokens": 2916352.0,
+ "step": 178
+ },
+ {
+ "entropy": 1.3612396717071533,
+ "epoch": 0.3616161616161616,
+ "grad_norm": 2.003840684890747,
+ "learning_rate": 1.7602693602693603e-05,
+ "loss": 1.359879732131958,
+ "mean_token_accuracy": 0.6798974275588989,
+ "num_tokens": 2932736.0,
+ "step": 179
+ },
+ {
+ "entropy": 1.0548239946365356,
+ "epoch": 0.36363636363636365,
+ "grad_norm": 1.6967436075210571,
+ "learning_rate": 1.758922558922559e-05,
+ "loss": 1.040539264678955,
+ "mean_token_accuracy": 0.7433438897132874,
+ "num_tokens": 2949120.0,
+ "step": 180
+ },
+ {
+ "entropy": 1.16105055809021,
+ "epoch": 0.3656565656565657,
+ "grad_norm": 1.9793111085891724,
+ "learning_rate": 1.7575757575757576e-05,
+ "loss": 1.1532450914382935,
+ "mean_token_accuracy": 0.7135441899299622,
+ "num_tokens": 2965504.0,
+ "step": 181
+ },
+ {
+ "entropy": 1.4421862363815308,
+ "epoch": 0.36767676767676766,
+ "grad_norm": 1.8337509632110596,
+ "learning_rate": 1.7562289562289564e-05,
+ "loss": 1.419133186340332,
+ "mean_token_accuracy": 0.659807026386261,
+ "num_tokens": 2981888.0,
+ "step": 182
+ },
+ {
+ "entropy": 1.6186654567718506,
+ "epoch": 0.3696969696969697,
+ "grad_norm": 2.0585362911224365,
+ "learning_rate": 1.7548821548821552e-05,
+ "loss": 1.5880110263824463,
+ "mean_token_accuracy": 0.6322056651115417,
+ "num_tokens": 2998272.0,
+ "step": 183
+ },
+ {
+ "entropy": 1.76968252658844,
+ "epoch": 0.3717171717171717,
+ "grad_norm": 2.139742374420166,
+ "learning_rate": 1.7535353535353537e-05,
+ "loss": 1.797312617301941,
+ "mean_token_accuracy": 0.6096116304397583,
+ "num_tokens": 3014656.0,
+ "step": 184
+ },
+ {
+ "entropy": 1.0575193166732788,
+ "epoch": 0.37373737373737376,
+ "grad_norm": 1.8547794818878174,
+ "learning_rate": 1.7521885521885525e-05,
+ "loss": 1.0575863122940063,
+ "mean_token_accuracy": 0.7325354218482971,
+ "num_tokens": 3031040.0,
+ "step": 185
+ },
+ {
+ "entropy": 1.2937911748886108,
+ "epoch": 0.37575757575757573,
+ "grad_norm": 2.3985140323638916,
+ "learning_rate": 1.750841750841751e-05,
+ "loss": 1.3277016878128052,
+ "mean_token_accuracy": 0.6654860973358154,
+ "num_tokens": 3047424.0,
+ "step": 186
+ },
+ {
+ "entropy": 1.1829862594604492,
+ "epoch": 0.37777777777777777,
+ "grad_norm": 1.948241114616394,
+ "learning_rate": 1.7494949494949494e-05,
+ "loss": 1.2146751880645752,
+ "mean_token_accuracy": 0.6964460015296936,
+ "num_tokens": 3063808.0,
+ "step": 187
+ },
+ {
+ "entropy": 1.4858520030975342,
+ "epoch": 0.3797979797979798,
+ "grad_norm": 2.2712836265563965,
+ "learning_rate": 1.7481481481481483e-05,
+ "loss": 1.5523631572723389,
+ "mean_token_accuracy": 0.6392281651496887,
+ "num_tokens": 3080192.0,
+ "step": 188
+ },
+ {
+ "entropy": 1.7905362844467163,
+ "epoch": 0.38181818181818183,
+ "grad_norm": 1.890699863433838,
+ "learning_rate": 1.746801346801347e-05,
+ "loss": 1.8139519691467285,
+ "mean_token_accuracy": 0.6015510559082031,
+ "num_tokens": 3096576.0,
+ "step": 189
+ },
+ {
+ "entropy": 1.3264763355255127,
+ "epoch": 0.3838383838383838,
+ "grad_norm": 2.1567318439483643,
+ "learning_rate": 1.7454545454545456e-05,
+ "loss": 1.3780615329742432,
+ "mean_token_accuracy": 0.6636541485786438,
+ "num_tokens": 3112960.0,
+ "step": 190
+ },
+ {
+ "entropy": 1.9898782968521118,
+ "epoch": 0.38585858585858585,
+ "grad_norm": 2.008547306060791,
+ "learning_rate": 1.7441077441077444e-05,
+ "loss": 2.0208630561828613,
+ "mean_token_accuracy": 0.5498290061950684,
+ "num_tokens": 3129344.0,
+ "step": 191
+ },
+ {
+ "entropy": 1.2579785585403442,
+ "epoch": 0.3878787878787879,
+ "grad_norm": 1.921314001083374,
+ "learning_rate": 1.742760942760943e-05,
+ "loss": 1.271723985671997,
+ "mean_token_accuracy": 0.6882632970809937,
+ "num_tokens": 3145728.0,
+ "step": 192
+ },
+ {
+ "entropy": 1.3366814851760864,
+ "epoch": 0.3898989898989899,
+ "grad_norm": 1.9525961875915527,
+ "learning_rate": 1.7414141414141413e-05,
+ "loss": 1.3561700582504272,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 3162112.0,
+ "step": 193
+ },
+ {
+ "entropy": 1.5505253076553345,
+ "epoch": 0.39191919191919194,
+ "grad_norm": 2.044635057449341,
+ "learning_rate": 1.74006734006734e-05,
+ "loss": 1.5198928117752075,
+ "mean_token_accuracy": 0.6326331496238708,
+ "num_tokens": 3178496.0,
+ "step": 194
+ },
+ {
+ "entropy": 1.4198534488677979,
+ "epoch": 0.3939393939393939,
+ "grad_norm": 1.9955503940582275,
+ "learning_rate": 1.738720538720539e-05,
+ "loss": 1.4072260856628418,
+ "mean_token_accuracy": 0.6631045341491699,
+ "num_tokens": 3194880.0,
+ "step": 195
+ },
+ {
+ "entropy": 2.0099895000457764,
+ "epoch": 0.39595959595959596,
+ "grad_norm": 2.110247850418091,
+ "learning_rate": 1.7373737373737375e-05,
+ "loss": 2.0012335777282715,
+ "mean_token_accuracy": 0.5668661594390869,
+ "num_tokens": 3211264.0,
+ "step": 196
+ },
+ {
+ "entropy": 2.1619439125061035,
+ "epoch": 0.397979797979798,
+ "grad_norm": 2.0869383811950684,
+ "learning_rate": 1.7360269360269363e-05,
+ "loss": 2.1793670654296875,
+ "mean_token_accuracy": 0.5569125413894653,
+ "num_tokens": 3227648.0,
+ "step": 197
+ },
+ {
+ "entropy": 1.6383775472640991,
+ "epoch": 0.4,
+ "grad_norm": 1.7467572689056396,
+ "learning_rate": 1.7346801346801347e-05,
+ "loss": 1.656137228012085,
+ "mean_token_accuracy": 0.6395334601402283,
+ "num_tokens": 3244032.0,
+ "step": 198
+ },
+ {
+ "entropy": 1.5911450386047363,
+ "epoch": 0.402020202020202,
+ "grad_norm": 1.9362678527832031,
+ "learning_rate": 1.7333333333333336e-05,
+ "loss": 1.5865838527679443,
+ "mean_token_accuracy": 0.621275007724762,
+ "num_tokens": 3260416.0,
+ "step": 199
+ },
+ {
+ "entropy": 1.3983819484710693,
+ "epoch": 0.40404040404040403,
+ "grad_norm": 1.925863265991211,
+ "learning_rate": 1.731986531986532e-05,
+ "loss": 1.3835841417312622,
+ "mean_token_accuracy": 0.6618221998214722,
+ "num_tokens": 3276800.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.40404040404040403,
+ "eval_entropy": 1.5366105552642577,
+ "eval_loss": 1.5502140522003174,
+ "eval_mean_token_accuracy": 0.6411546406246,
+ "eval_num_tokens": 3276800.0,
+ "eval_runtime": 43.8218,
+ "eval_samples_per_second": 22.592,
+ "eval_steps_per_second": 2.83,
+ "step": 200
+ },
+ {
+ "entropy": 1.291393756866455,
+ "epoch": 0.40606060606060607,
+ "grad_norm": 1.9057531356811523,
+ "learning_rate": 1.7306397306397305e-05,
+ "loss": 1.2847933769226074,
+ "mean_token_accuracy": 0.6901563405990601,
+ "num_tokens": 3293184.0,
+ "step": 201
+ },
+ {
+ "entropy": 1.1511558294296265,
+ "epoch": 0.4080808080808081,
+ "grad_norm": 1.849436640739441,
+ "learning_rate": 1.7292929292929293e-05,
+ "loss": 1.1661030054092407,
+ "mean_token_accuracy": 0.7095139026641846,
+ "num_tokens": 3309568.0,
+ "step": 202
+ },
+ {
+ "entropy": 1.5591504573822021,
+ "epoch": 0.4101010101010101,
+ "grad_norm": 1.9354233741760254,
+ "learning_rate": 1.727946127946128e-05,
+ "loss": 1.6045410633087158,
+ "mean_token_accuracy": 0.6226795315742493,
+ "num_tokens": 3325952.0,
+ "step": 203
+ },
+ {
+ "entropy": 1.7634649276733398,
+ "epoch": 0.4121212121212121,
+ "grad_norm": 2.414632797241211,
+ "learning_rate": 1.726599326599327e-05,
+ "loss": 1.8021953105926514,
+ "mean_token_accuracy": 0.6099780201911926,
+ "num_tokens": 3342336.0,
+ "step": 204
+ },
+ {
+ "entropy": 1.6080671548843384,
+ "epoch": 0.41414141414141414,
+ "grad_norm": 1.9936028718948364,
+ "learning_rate": 1.7252525252525255e-05,
+ "loss": 1.630000352859497,
+ "mean_token_accuracy": 0.6256106495857239,
+ "num_tokens": 3358720.0,
+ "step": 205
+ },
+ {
+ "entropy": 1.6845343112945557,
+ "epoch": 0.4161616161616162,
+ "grad_norm": 1.9131947755813599,
+ "learning_rate": 1.723905723905724e-05,
+ "loss": 1.6912329196929932,
+ "mean_token_accuracy": 0.6263434290885925,
+ "num_tokens": 3375104.0,
+ "step": 206
+ },
+ {
+ "entropy": 1.5946446657180786,
+ "epoch": 0.41818181818181815,
+ "grad_norm": 2.0423905849456787,
+ "learning_rate": 1.7225589225589228e-05,
+ "loss": 1.647271752357483,
+ "mean_token_accuracy": 0.6296409368515015,
+ "num_tokens": 3391488.0,
+ "step": 207
+ },
+ {
+ "entropy": 1.3124741315841675,
+ "epoch": 0.4202020202020202,
+ "grad_norm": 1.8896982669830322,
+ "learning_rate": 1.7212121212121212e-05,
+ "loss": 1.3216124773025513,
+ "mean_token_accuracy": 0.687469482421875,
+ "num_tokens": 3407872.0,
+ "step": 208
+ },
+ {
+ "entropy": 1.3931281566619873,
+ "epoch": 0.4222222222222222,
+ "grad_norm": 1.7883074283599854,
+ "learning_rate": 1.71986531986532e-05,
+ "loss": 1.4264600276947021,
+ "mean_token_accuracy": 0.6568148732185364,
+ "num_tokens": 3424256.0,
+ "step": 209
+ },
+ {
+ "entropy": 1.1427687406539917,
+ "epoch": 0.42424242424242425,
+ "grad_norm": 1.9367003440856934,
+ "learning_rate": 1.7185185185185185e-05,
+ "loss": 1.1611723899841309,
+ "mean_token_accuracy": 0.7058500051498413,
+ "num_tokens": 3440640.0,
+ "step": 210
+ },
+ {
+ "entropy": 1.7226167917251587,
+ "epoch": 0.4262626262626263,
+ "grad_norm": 2.175487518310547,
+ "learning_rate": 1.7171717171717173e-05,
+ "loss": 1.7383192777633667,
+ "mean_token_accuracy": 0.6075964570045471,
+ "num_tokens": 3457024.0,
+ "step": 211
+ },
+ {
+ "entropy": 1.3780062198638916,
+ "epoch": 0.42828282828282827,
+ "grad_norm": 1.9817614555358887,
+ "learning_rate": 1.715824915824916e-05,
+ "loss": 1.3755927085876465,
+ "mean_token_accuracy": 0.6750732660293579,
+ "num_tokens": 3473408.0,
+ "step": 212
+ },
+ {
+ "entropy": 1.637842059135437,
+ "epoch": 0.4303030303030303,
+ "grad_norm": 2.2326242923736572,
+ "learning_rate": 1.7144781144781146e-05,
+ "loss": 1.635596752166748,
+ "mean_token_accuracy": 0.6110771894454956,
+ "num_tokens": 3489792.0,
+ "step": 213
+ },
+ {
+ "entropy": 1.9970118999481201,
+ "epoch": 0.43232323232323233,
+ "grad_norm": 2.1303606033325195,
+ "learning_rate": 1.713131313131313e-05,
+ "loss": 2.0099592208862305,
+ "mean_token_accuracy": 0.5781631469726562,
+ "num_tokens": 3506176.0,
+ "step": 214
+ },
+ {
+ "entropy": 1.4759869575500488,
+ "epoch": 0.43434343434343436,
+ "grad_norm": 2.043727397918701,
+ "learning_rate": 1.711784511784512e-05,
+ "loss": 1.4756600856781006,
+ "mean_token_accuracy": 0.6483879089355469,
+ "num_tokens": 3522560.0,
+ "step": 215
+ },
+ {
+ "entropy": 1.2833726406097412,
+ "epoch": 0.43636363636363634,
+ "grad_norm": 1.9260340929031372,
+ "learning_rate": 1.7104377104377104e-05,
+ "loss": 1.2887630462646484,
+ "mean_token_accuracy": 0.6900342106819153,
+ "num_tokens": 3538944.0,
+ "step": 216
+ },
+ {
+ "entropy": 1.3936302661895752,
+ "epoch": 0.4383838383838384,
+ "grad_norm": 1.8590774536132812,
+ "learning_rate": 1.7090909090909092e-05,
+ "loss": 1.3784823417663574,
+ "mean_token_accuracy": 0.6736077070236206,
+ "num_tokens": 3555328.0,
+ "step": 217
+ },
+ {
+ "entropy": 1.2413936853408813,
+ "epoch": 0.4404040404040404,
+ "grad_norm": 2.1111643314361572,
+ "learning_rate": 1.707744107744108e-05,
+ "loss": 1.2740635871887207,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 3571712.0,
+ "step": 218
+ },
+ {
+ "entropy": 1.4879416227340698,
+ "epoch": 0.44242424242424244,
+ "grad_norm": 2.127614736557007,
+ "learning_rate": 1.7063973063973065e-05,
+ "loss": 1.48406183719635,
+ "mean_token_accuracy": 0.649975597858429,
+ "num_tokens": 3588096.0,
+ "step": 219
+ },
+ {
+ "entropy": 1.4226471185684204,
+ "epoch": 0.4444444444444444,
+ "grad_norm": 2.164325475692749,
+ "learning_rate": 1.7050505050505054e-05,
+ "loss": 1.466269850730896,
+ "mean_token_accuracy": 0.6502808928489685,
+ "num_tokens": 3604480.0,
+ "step": 220
+ },
+ {
+ "entropy": 1.6183370351791382,
+ "epoch": 0.44646464646464645,
+ "grad_norm": 2.018846273422241,
+ "learning_rate": 1.7037037037037038e-05,
+ "loss": 1.6348307132720947,
+ "mean_token_accuracy": 0.627198338508606,
+ "num_tokens": 3620864.0,
+ "step": 221
+ },
+ {
+ "entropy": 1.6979204416275024,
+ "epoch": 0.4484848484848485,
+ "grad_norm": 2.1574854850769043,
+ "learning_rate": 1.7023569023569023e-05,
+ "loss": 1.7019602060317993,
+ "mean_token_accuracy": 0.6157181262969971,
+ "num_tokens": 3637248.0,
+ "step": 222
+ },
+ {
+ "entropy": 1.753490686416626,
+ "epoch": 0.4505050505050505,
+ "grad_norm": 2.0253705978393555,
+ "learning_rate": 1.701010101010101e-05,
+ "loss": 1.7466539144515991,
+ "mean_token_accuracy": 0.6008793115615845,
+ "num_tokens": 3653632.0,
+ "step": 223
+ },
+ {
+ "entropy": 1.717929720878601,
+ "epoch": 0.45252525252525255,
+ "grad_norm": 1.9840974807739258,
+ "learning_rate": 1.6996632996633e-05,
+ "loss": 1.703988790512085,
+ "mean_token_accuracy": 0.6099780201911926,
+ "num_tokens": 3670016.0,
+ "step": 224
+ },
+ {
+ "entropy": 1.377287745475769,
+ "epoch": 0.45454545454545453,
+ "grad_norm": 2.1027839183807373,
+ "learning_rate": 1.6983164983164984e-05,
+ "loss": 1.3902864456176758,
+ "mean_token_accuracy": 0.660906195640564,
+ "num_tokens": 3686400.0,
+ "step": 225
+ },
+ {
+ "entropy": 1.237000584602356,
+ "epoch": 0.45656565656565656,
+ "grad_norm": 1.9116249084472656,
+ "learning_rate": 1.6969696969696972e-05,
+ "loss": 1.221006155014038,
+ "mean_token_accuracy": 0.7045676708221436,
+ "num_tokens": 3702784.0,
+ "step": 226
+ },
+ {
+ "entropy": 1.4198882579803467,
+ "epoch": 0.4585858585858586,
+ "grad_norm": 2.099358558654785,
+ "learning_rate": 1.6956228956228957e-05,
+ "loss": 1.4211962223052979,
+ "mean_token_accuracy": 0.6549829244613647,
+ "num_tokens": 3719168.0,
+ "step": 227
+ },
+ {
+ "entropy": 1.4647245407104492,
+ "epoch": 0.46060606060606063,
+ "grad_norm": 1.8873655796051025,
+ "learning_rate": 1.6942760942760945e-05,
+ "loss": 1.4848006963729858,
+ "mean_token_accuracy": 0.6534562706947327,
+ "num_tokens": 3735552.0,
+ "step": 228
+ },
+ {
+ "entropy": 1.348371982574463,
+ "epoch": 0.4626262626262626,
+ "grad_norm": 2.0487565994262695,
+ "learning_rate": 1.692929292929293e-05,
+ "loss": 1.355329155921936,
+ "mean_token_accuracy": 0.6709208488464355,
+ "num_tokens": 3751936.0,
+ "step": 229
+ },
+ {
+ "entropy": 1.6201715469360352,
+ "epoch": 0.46464646464646464,
+ "grad_norm": 1.9640510082244873,
+ "learning_rate": 1.6915824915824915e-05,
+ "loss": 1.6176421642303467,
+ "mean_token_accuracy": 0.6221910119056702,
+ "num_tokens": 3768320.0,
+ "step": 230
+ },
+ {
+ "entropy": 1.461037039756775,
+ "epoch": 0.4666666666666667,
+ "grad_norm": 1.9843394756317139,
+ "learning_rate": 1.6902356902356903e-05,
+ "loss": 1.4502949714660645,
+ "mean_token_accuracy": 0.6463727355003357,
+ "num_tokens": 3784704.0,
+ "step": 231
+ },
+ {
+ "entropy": 1.4964231252670288,
+ "epoch": 0.4686868686868687,
+ "grad_norm": 2.0087051391601562,
+ "learning_rate": 1.688888888888889e-05,
+ "loss": 1.5107879638671875,
+ "mean_token_accuracy": 0.6536394953727722,
+ "num_tokens": 3801088.0,
+ "step": 232
+ },
+ {
+ "entropy": 1.3013520240783691,
+ "epoch": 0.4707070707070707,
+ "grad_norm": 2.1042368412017822,
+ "learning_rate": 1.6875420875420876e-05,
+ "loss": 1.312164306640625,
+ "mean_token_accuracy": 0.673363447189331,
+ "num_tokens": 3817472.0,
+ "step": 233
+ },
+ {
+ "entropy": 1.6242352724075317,
+ "epoch": 0.4727272727272727,
+ "grad_norm": 1.8541103601455688,
+ "learning_rate": 1.6861952861952864e-05,
+ "loss": 1.6327502727508545,
+ "mean_token_accuracy": 0.6376404762268066,
+ "num_tokens": 3833856.0,
+ "step": 234
+ },
+ {
+ "entropy": 1.4227592945098877,
+ "epoch": 0.47474747474747475,
+ "grad_norm": 1.8749339580535889,
+ "learning_rate": 1.684848484848485e-05,
+ "loss": 1.436142921447754,
+ "mean_token_accuracy": 0.6705544590950012,
+ "num_tokens": 3850240.0,
+ "step": 235
+ },
+ {
+ "entropy": 1.4807487726211548,
+ "epoch": 0.4767676767676768,
+ "grad_norm": 2.1475114822387695,
+ "learning_rate": 1.6835016835016837e-05,
+ "loss": 1.4670445919036865,
+ "mean_token_accuracy": 0.6385564208030701,
+ "num_tokens": 3866624.0,
+ "step": 236
+ },
+ {
+ "entropy": 2.0623066425323486,
+ "epoch": 0.47878787878787876,
+ "grad_norm": 2.1698546409606934,
+ "learning_rate": 1.6821548821548822e-05,
+ "loss": 2.08683180809021,
+ "mean_token_accuracy": 0.5531876087188721,
+ "num_tokens": 3883008.0,
+ "step": 237
+ },
+ {
+ "entropy": 1.6894460916519165,
+ "epoch": 0.4808080808080808,
+ "grad_norm": 2.158062219619751,
+ "learning_rate": 1.680808080808081e-05,
+ "loss": 1.7244186401367188,
+ "mean_token_accuracy": 0.6055813431739807,
+ "num_tokens": 3899392.0,
+ "step": 238
+ },
+ {
+ "entropy": 1.2741345167160034,
+ "epoch": 0.48282828282828283,
+ "grad_norm": 1.918306827545166,
+ "learning_rate": 1.67946127946128e-05,
+ "loss": 1.2937202453613281,
+ "mean_token_accuracy": 0.6878969073295593,
+ "num_tokens": 3915776.0,
+ "step": 239
+ },
+ {
+ "entropy": 1.556649088859558,
+ "epoch": 0.48484848484848486,
+ "grad_norm": 2.0560667514801025,
+ "learning_rate": 1.6781144781144783e-05,
+ "loss": 1.5751030445098877,
+ "mean_token_accuracy": 0.6324499249458313,
+ "num_tokens": 3932160.0,
+ "step": 240
+ },
+ {
+ "entropy": 1.7632875442504883,
+ "epoch": 0.4868686868686869,
+ "grad_norm": 1.8408738374710083,
+ "learning_rate": 1.6767676767676768e-05,
+ "loss": 1.7745842933654785,
+ "mean_token_accuracy": 0.6091231107711792,
+ "num_tokens": 3948544.0,
+ "step": 241
+ },
+ {
+ "entropy": 1.4793967008590698,
+ "epoch": 0.4888888888888889,
+ "grad_norm": 2.0134575366973877,
+ "learning_rate": 1.6754208754208756e-05,
+ "loss": 1.514477014541626,
+ "mean_token_accuracy": 0.6414875388145447,
+ "num_tokens": 3964928.0,
+ "step": 242
+ },
+ {
+ "entropy": 1.4762561321258545,
+ "epoch": 0.4909090909090909,
+ "grad_norm": 2.087501287460327,
+ "learning_rate": 1.674074074074074e-05,
+ "loss": 1.5195722579956055,
+ "mean_token_accuracy": 0.6289081573486328,
+ "num_tokens": 3981312.0,
+ "step": 243
+ },
+ {
+ "entropy": 1.6629496812820435,
+ "epoch": 0.49292929292929294,
+ "grad_norm": 1.7386047840118408,
+ "learning_rate": 1.672727272727273e-05,
+ "loss": 1.6932936906814575,
+ "mean_token_accuracy": 0.6289692521095276,
+ "num_tokens": 3997696.0,
+ "step": 244
+ },
+ {
+ "entropy": 1.4506888389587402,
+ "epoch": 0.494949494949495,
+ "grad_norm": 1.8268823623657227,
+ "learning_rate": 1.6713804713804714e-05,
+ "loss": 1.4257543087005615,
+ "mean_token_accuracy": 0.6678065657615662,
+ "num_tokens": 4014080.0,
+ "step": 245
+ },
+ {
+ "entropy": 1.6132714748382568,
+ "epoch": 0.49696969696969695,
+ "grad_norm": 2.168206214904785,
+ "learning_rate": 1.6700336700336702e-05,
+ "loss": 1.602414608001709,
+ "mean_token_accuracy": 0.6202979683876038,
+ "num_tokens": 4030464.0,
+ "step": 246
+ },
+ {
+ "entropy": 1.2860945463180542,
+ "epoch": 0.498989898989899,
+ "grad_norm": 1.830817699432373,
+ "learning_rate": 1.668686868686869e-05,
+ "loss": 1.284934163093567,
+ "mean_token_accuracy": 0.6854543089866638,
+ "num_tokens": 4046848.0,
+ "step": 247
+ },
+ {
+ "entropy": 1.4948641061782837,
+ "epoch": 0.501010101010101,
+ "grad_norm": 1.9775508642196655,
+ "learning_rate": 1.6673400673400675e-05,
+ "loss": 1.497206449508667,
+ "mean_token_accuracy": 0.6471055150032043,
+ "num_tokens": 4063232.0,
+ "step": 248
+ },
+ {
+ "entropy": 1.490235447883606,
+ "epoch": 0.503030303030303,
+ "grad_norm": 2.207184076309204,
+ "learning_rate": 1.665993265993266e-05,
+ "loss": 1.5091016292572021,
+ "mean_token_accuracy": 0.6482657790184021,
+ "num_tokens": 4079616.0,
+ "step": 249
+ },
+ {
+ "entropy": 1.5752832889556885,
+ "epoch": 0.5050505050505051,
+ "grad_norm": 2.0718111991882324,
+ "learning_rate": 1.6646464646464648e-05,
+ "loss": 1.576171875,
+ "mean_token_accuracy": 0.6375793814659119,
+ "num_tokens": 4096000.0,
+ "step": 250
+ },
+ {
+ "entropy": 1.3935530185699463,
+ "epoch": 0.5070707070707071,
+ "grad_norm": 1.9379569292068481,
+ "learning_rate": 1.6632996632996633e-05,
+ "loss": 1.4019020795822144,
+ "mean_token_accuracy": 0.6742794513702393,
+ "num_tokens": 4112384.0,
+ "step": 251
+ },
+ {
+ "entropy": 1.3622194528579712,
+ "epoch": 0.509090909090909,
+ "grad_norm": 1.9684133529663086,
+ "learning_rate": 1.661952861952862e-05,
+ "loss": 1.3581968545913696,
+ "mean_token_accuracy": 0.6631045341491699,
+ "num_tokens": 4128768.0,
+ "step": 252
+ },
+ {
+ "entropy": 2.1161346435546875,
+ "epoch": 0.5111111111111111,
+ "grad_norm": 1.9295378923416138,
+ "learning_rate": 1.660606060606061e-05,
+ "loss": 2.1316990852355957,
+ "mean_token_accuracy": 0.5643624663352966,
+ "num_tokens": 4145152.0,
+ "step": 253
+ },
+ {
+ "entropy": 1.4322566986083984,
+ "epoch": 0.5131313131313131,
+ "grad_norm": 2.0198557376861572,
+ "learning_rate": 1.6592592592592594e-05,
+ "loss": 1.4390883445739746,
+ "mean_token_accuracy": 0.6648143529891968,
+ "num_tokens": 4161536.0,
+ "step": 254
+ },
+ {
+ "entropy": 1.5892291069030762,
+ "epoch": 0.5151515151515151,
+ "grad_norm": 2.0127851963043213,
+ "learning_rate": 1.6579124579124582e-05,
+ "loss": 1.6437480449676514,
+ "mean_token_accuracy": 0.6223131418228149,
+ "num_tokens": 4177920.0,
+ "step": 255
+ },
+ {
+ "entropy": 1.445371150970459,
+ "epoch": 0.5171717171717172,
+ "grad_norm": 1.9758318662643433,
+ "learning_rate": 1.6565656565656567e-05,
+ "loss": 1.4749128818511963,
+ "mean_token_accuracy": 0.6457010507583618,
+ "num_tokens": 4194304.0,
+ "step": 256
+ },
+ {
+ "entropy": 1.5587478876113892,
+ "epoch": 0.5191919191919192,
+ "grad_norm": 1.918809413909912,
+ "learning_rate": 1.6552188552188552e-05,
+ "loss": 1.5739175081253052,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 4210688.0,
+ "step": 257
+ },
+ {
+ "entropy": 1.5112392902374268,
+ "epoch": 0.5212121212121212,
+ "grad_norm": 2.0176963806152344,
+ "learning_rate": 1.653872053872054e-05,
+ "loss": 1.5279680490493774,
+ "mean_token_accuracy": 0.640754759311676,
+ "num_tokens": 4227072.0,
+ "step": 258
+ },
+ {
+ "entropy": 1.4898114204406738,
+ "epoch": 0.5232323232323233,
+ "grad_norm": 2.0637850761413574,
+ "learning_rate": 1.6525252525252528e-05,
+ "loss": 1.5081419944763184,
+ "mean_token_accuracy": 0.6375183463096619,
+ "num_tokens": 4243456.0,
+ "step": 259
+ },
+ {
+ "entropy": 1.4768201112747192,
+ "epoch": 0.5252525252525253,
+ "grad_norm": 1.835053563117981,
+ "learning_rate": 1.6511784511784513e-05,
+ "loss": 1.494248390197754,
+ "mean_token_accuracy": 0.6496092081069946,
+ "num_tokens": 4259840.0,
+ "step": 260
+ },
+ {
+ "entropy": 1.655643105506897,
+ "epoch": 0.5272727272727272,
+ "grad_norm": 1.9655805826187134,
+ "learning_rate": 1.64983164983165e-05,
+ "loss": 1.6360158920288086,
+ "mean_token_accuracy": 0.6209086179733276,
+ "num_tokens": 4276224.0,
+ "step": 261
+ },
+ {
+ "entropy": 1.5621604919433594,
+ "epoch": 0.5292929292929293,
+ "grad_norm": 1.9304734468460083,
+ "learning_rate": 1.6484848484848486e-05,
+ "loss": 1.5850739479064941,
+ "mean_token_accuracy": 0.6422203183174133,
+ "num_tokens": 4292608.0,
+ "step": 262
+ },
+ {
+ "entropy": 1.592617392539978,
+ "epoch": 0.5313131313131313,
+ "grad_norm": 1.9590504169464111,
+ "learning_rate": 1.6471380471380474e-05,
+ "loss": 1.583874225616455,
+ "mean_token_accuracy": 0.6230459213256836,
+ "num_tokens": 4308992.0,
+ "step": 263
+ },
+ {
+ "entropy": 1.5268265008926392,
+ "epoch": 0.5333333333333333,
+ "grad_norm": 2.0704433917999268,
+ "learning_rate": 1.645791245791246e-05,
+ "loss": 1.5327314138412476,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 4325376.0,
+ "step": 264
+ },
+ {
+ "entropy": 1.1762311458587646,
+ "epoch": 0.5353535353535354,
+ "grad_norm": 2.0408453941345215,
+ "learning_rate": 1.6444444444444444e-05,
+ "loss": 1.1851191520690918,
+ "mean_token_accuracy": 0.7027967572212219,
+ "num_tokens": 4341760.0,
+ "step": 265
+ },
+ {
+ "entropy": 1.567710518836975,
+ "epoch": 0.5373737373737374,
+ "grad_norm": 1.8334625959396362,
+ "learning_rate": 1.6430976430976432e-05,
+ "loss": 1.564115047454834,
+ "mean_token_accuracy": 0.6340376138687134,
+ "num_tokens": 4358144.0,
+ "step": 266
+ },
+ {
+ "entropy": 1.2294297218322754,
+ "epoch": 0.5393939393939394,
+ "grad_norm": 3.5099127292633057,
+ "learning_rate": 1.641750841750842e-05,
+ "loss": 1.2887773513793945,
+ "mean_token_accuracy": 0.688629686832428,
+ "num_tokens": 4374528.0,
+ "step": 267
+ },
+ {
+ "entropy": 1.5130258798599243,
+ "epoch": 0.5414141414141415,
+ "grad_norm": 1.8295154571533203,
+ "learning_rate": 1.6404040404040405e-05,
+ "loss": 1.581455945968628,
+ "mean_token_accuracy": 0.639655590057373,
+ "num_tokens": 4390912.0,
+ "step": 268
+ },
+ {
+ "entropy": 1.6612389087677002,
+ "epoch": 0.5434343434343434,
+ "grad_norm": 2.1676483154296875,
+ "learning_rate": 1.6390572390572393e-05,
+ "loss": 1.6873081922531128,
+ "mean_token_accuracy": 0.6049095988273621,
+ "num_tokens": 4407296.0,
+ "step": 269
+ },
+ {
+ "entropy": 1.416680932044983,
+ "epoch": 0.5454545454545454,
+ "grad_norm": 2.044541358947754,
+ "learning_rate": 1.6377104377104378e-05,
+ "loss": 1.4432693719863892,
+ "mean_token_accuracy": 0.6580972075462341,
+ "num_tokens": 4423680.0,
+ "step": 270
+ },
+ {
+ "entropy": 1.6253215074539185,
+ "epoch": 0.5474747474747474,
+ "grad_norm": 2.1488161087036133,
+ "learning_rate": 1.6363636363636366e-05,
+ "loss": 1.6667883396148682,
+ "mean_token_accuracy": 0.6122373938560486,
+ "num_tokens": 4440064.0,
+ "step": 271
+ },
+ {
+ "entropy": 1.492803931236267,
+ "epoch": 0.5494949494949495,
+ "grad_norm": 2.0591108798980713,
+ "learning_rate": 1.635016835016835e-05,
+ "loss": 1.5023317337036133,
+ "mean_token_accuracy": 0.6420371532440186,
+ "num_tokens": 4456448.0,
+ "step": 272
+ },
+ {
+ "entropy": 1.5818493366241455,
+ "epoch": 0.5515151515151515,
+ "grad_norm": 1.9004875421524048,
+ "learning_rate": 1.633670033670034e-05,
+ "loss": 1.5762417316436768,
+ "mean_token_accuracy": 0.6375793814659119,
+ "num_tokens": 4472832.0,
+ "step": 273
+ },
+ {
+ "entropy": 1.2263695001602173,
+ "epoch": 0.5535353535353535,
+ "grad_norm": 1.8976677656173706,
+ "learning_rate": 1.6323232323232324e-05,
+ "loss": 1.2397428750991821,
+ "mean_token_accuracy": 0.70658278465271,
+ "num_tokens": 4489216.0,
+ "step": 274
+ },
+ {
+ "entropy": 1.370070219039917,
+ "epoch": 0.5555555555555556,
+ "grad_norm": 1.875389575958252,
+ "learning_rate": 1.6309764309764312e-05,
+ "loss": 1.3603096008300781,
+ "mean_token_accuracy": 0.6843551397323608,
+ "num_tokens": 4505600.0,
+ "step": 275
+ },
+ {
+ "entropy": 1.9219107627868652,
+ "epoch": 0.5575757575757576,
+ "grad_norm": 2.057508945465088,
+ "learning_rate": 1.6296296296296297e-05,
+ "loss": 1.9082988500595093,
+ "mean_token_accuracy": 0.5834758281707764,
+ "num_tokens": 4521984.0,
+ "step": 276
+ },
+ {
+ "entropy": 1.6965564489364624,
+ "epoch": 0.5595959595959596,
+ "grad_norm": 1.9217735528945923,
+ "learning_rate": 1.6282828282828285e-05,
+ "loss": 1.7024450302124023,
+ "mean_token_accuracy": 0.6050928235054016,
+ "num_tokens": 4538368.0,
+ "step": 277
+ },
+ {
+ "entropy": 1.7517896890640259,
+ "epoch": 0.5616161616161616,
+ "grad_norm": 2.029672145843506,
+ "learning_rate": 1.626936026936027e-05,
+ "loss": 1.7533857822418213,
+ "mean_token_accuracy": 0.5986199378967285,
+ "num_tokens": 4554752.0,
+ "step": 278
+ },
+ {
+ "entropy": 1.6086634397506714,
+ "epoch": 0.5636363636363636,
+ "grad_norm": 1.980076551437378,
+ "learning_rate": 1.6255892255892258e-05,
+ "loss": 1.5998293161392212,
+ "mean_token_accuracy": 0.6469223499298096,
+ "num_tokens": 4571136.0,
+ "step": 279
+ },
+ {
+ "entropy": 1.5670934915542603,
+ "epoch": 0.5656565656565656,
+ "grad_norm": 1.9693994522094727,
+ "learning_rate": 1.6242424242424243e-05,
+ "loss": 1.583737850189209,
+ "mean_token_accuracy": 0.6189545392990112,
+ "num_tokens": 4587520.0,
+ "step": 280
+ },
+ {
+ "entropy": 1.5290220975875854,
+ "epoch": 0.5676767676767677,
+ "grad_norm": 1.9464402198791504,
+ "learning_rate": 1.622895622895623e-05,
+ "loss": 1.523187518119812,
+ "mean_token_accuracy": 0.6289692521095276,
+ "num_tokens": 4603904.0,
+ "step": 281
+ },
+ {
+ "entropy": 1.2070591449737549,
+ "epoch": 0.5696969696969697,
+ "grad_norm": 2.1152102947235107,
+ "learning_rate": 1.621548821548822e-05,
+ "loss": 1.2107012271881104,
+ "mean_token_accuracy": 0.695652186870575,
+ "num_tokens": 4620288.0,
+ "step": 282
+ },
+ {
+ "entropy": 1.4039427042007446,
+ "epoch": 0.5717171717171717,
+ "grad_norm": 1.936285376548767,
+ "learning_rate": 1.6202020202020204e-05,
+ "loss": 1.425846815109253,
+ "mean_token_accuracy": 0.663593053817749,
+ "num_tokens": 4636672.0,
+ "step": 283
+ },
+ {
+ "entropy": 1.2910168170928955,
+ "epoch": 0.5737373737373738,
+ "grad_norm": 1.8882776498794556,
+ "learning_rate": 1.618855218855219e-05,
+ "loss": 1.3109780550003052,
+ "mean_token_accuracy": 0.6896067261695862,
+ "num_tokens": 4653056.0,
+ "step": 284
+ },
+ {
+ "entropy": 1.7089474201202393,
+ "epoch": 0.5757575757575758,
+ "grad_norm": 2.0113184452056885,
+ "learning_rate": 1.6175084175084177e-05,
+ "loss": 1.7272329330444336,
+ "mean_token_accuracy": 0.600024402141571,
+ "num_tokens": 4669440.0,
+ "step": 285
+ },
+ {
+ "entropy": 1.12257719039917,
+ "epoch": 0.5777777777777777,
+ "grad_norm": 2.0191409587860107,
+ "learning_rate": 1.616161616161616e-05,
+ "loss": 1.1193959712982178,
+ "mean_token_accuracy": 0.7199560403823853,
+ "num_tokens": 4685824.0,
+ "step": 286
+ },
+ {
+ "entropy": 1.2052935361862183,
+ "epoch": 0.5797979797979798,
+ "grad_norm": 1.9647032022476196,
+ "learning_rate": 1.614814814814815e-05,
+ "loss": 1.2192071676254272,
+ "mean_token_accuracy": 0.6977894306182861,
+ "num_tokens": 4702208.0,
+ "step": 287
+ },
+ {
+ "entropy": 1.5017658472061157,
+ "epoch": 0.5818181818181818,
+ "grad_norm": 2.0078749656677246,
+ "learning_rate": 1.6134680134680138e-05,
+ "loss": 1.5069187879562378,
+ "mean_token_accuracy": 0.6404494643211365,
+ "num_tokens": 4718592.0,
+ "step": 288
+ },
+ {
+ "entropy": 1.4429490566253662,
+ "epoch": 0.5838383838383838,
+ "grad_norm": 1.8666913509368896,
+ "learning_rate": 1.6121212121212123e-05,
+ "loss": 1.4498789310455322,
+ "mean_token_accuracy": 0.6577919125556946,
+ "num_tokens": 4734976.0,
+ "step": 289
+ },
+ {
+ "entropy": 1.216312050819397,
+ "epoch": 0.5858585858585859,
+ "grad_norm": 1.8042014837265015,
+ "learning_rate": 1.610774410774411e-05,
+ "loss": 1.2346259355545044,
+ "mean_token_accuracy": 0.7015144228935242,
+ "num_tokens": 4751360.0,
+ "step": 290
+ },
+ {
+ "entropy": 1.1411411762237549,
+ "epoch": 0.5878787878787879,
+ "grad_norm": 1.7743948698043823,
+ "learning_rate": 1.6094276094276096e-05,
+ "loss": 1.158776044845581,
+ "mean_token_accuracy": 0.7111626863479614,
+ "num_tokens": 4767744.0,
+ "step": 291
+ },
+ {
+ "entropy": 1.5691558122634888,
+ "epoch": 0.5898989898989899,
+ "grad_norm": 2.0790789127349854,
+ "learning_rate": 1.608080808080808e-05,
+ "loss": 1.5900537967681885,
+ "mean_token_accuracy": 0.6259770393371582,
+ "num_tokens": 4784128.0,
+ "step": 292
+ },
+ {
+ "entropy": 1.5600252151489258,
+ "epoch": 0.591919191919192,
+ "grad_norm": 1.8288682699203491,
+ "learning_rate": 1.606734006734007e-05,
+ "loss": 1.5642855167388916,
+ "mean_token_accuracy": 0.6497313380241394,
+ "num_tokens": 4800512.0,
+ "step": 293
+ },
+ {
+ "entropy": 1.316757082939148,
+ "epoch": 0.593939393939394,
+ "grad_norm": 2.051280975341797,
+ "learning_rate": 1.6053872053872053e-05,
+ "loss": 1.3361237049102783,
+ "mean_token_accuracy": 0.6642647981643677,
+ "num_tokens": 4816896.0,
+ "step": 294
+ },
+ {
+ "entropy": 1.4421989917755127,
+ "epoch": 0.5959595959595959,
+ "grad_norm": 2.257932662963867,
+ "learning_rate": 1.604040404040404e-05,
+ "loss": 1.4325928688049316,
+ "mean_token_accuracy": 0.6571201682090759,
+ "num_tokens": 4833280.0,
+ "step": 295
+ },
+ {
+ "entropy": 1.4986436367034912,
+ "epoch": 0.597979797979798,
+ "grad_norm": 2.0747647285461426,
+ "learning_rate": 1.602693602693603e-05,
+ "loss": 1.508068323135376,
+ "mean_token_accuracy": 0.6551050543785095,
+ "num_tokens": 4849664.0,
+ "step": 296
+ },
+ {
+ "entropy": 1.4758206605911255,
+ "epoch": 0.6,
+ "grad_norm": 1.874723196029663,
+ "learning_rate": 1.6013468013468014e-05,
+ "loss": 1.4831781387329102,
+ "mean_token_accuracy": 0.6479604244232178,
+ "num_tokens": 4866048.0,
+ "step": 297
+ },
+ {
+ "entropy": 1.8049858808517456,
+ "epoch": 0.602020202020202,
+ "grad_norm": 2.089683771133423,
+ "learning_rate": 1.6000000000000003e-05,
+ "loss": 1.8325893878936768,
+ "mean_token_accuracy": 0.5932462215423584,
+ "num_tokens": 4882432.0,
+ "step": 298
+ },
+ {
+ "entropy": 1.6346150636672974,
+ "epoch": 0.604040404040404,
+ "grad_norm": 1.9526349306106567,
+ "learning_rate": 1.5986531986531987e-05,
+ "loss": 1.6568968296051025,
+ "mean_token_accuracy": 0.6246336102485657,
+ "num_tokens": 4898816.0,
+ "step": 299
+ },
+ {
+ "entropy": 1.431725025177002,
+ "epoch": 0.6060606060606061,
+ "grad_norm": 2.109987497329712,
+ "learning_rate": 1.5973063973063972e-05,
+ "loss": 1.4448115825653076,
+ "mean_token_accuracy": 0.6481436491012573,
+ "num_tokens": 4915200.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.6060606060606061,
+ "eval_entropy": 1.524387352889584,
+ "eval_loss": 1.5324952602386475,
+ "eval_mean_token_accuracy": 0.6443250953189789,
+ "eval_num_tokens": 4915200.0,
+ "eval_runtime": 43.7714,
+ "eval_samples_per_second": 22.618,
+ "eval_steps_per_second": 2.833,
+ "step": 300
+ },
+ {
+ "entropy": 1.4816409349441528,
+ "epoch": 0.6080808080808081,
+ "grad_norm": 3.3732845783233643,
+ "learning_rate": 1.595959595959596e-05,
+ "loss": 1.4913065433502197,
+ "mean_token_accuracy": 0.658707857131958,
+ "num_tokens": 4931584.0,
+ "step": 301
+ },
+ {
+ "entropy": 1.4020944833755493,
+ "epoch": 0.6101010101010101,
+ "grad_norm": 2.1152141094207764,
+ "learning_rate": 1.594612794612795e-05,
+ "loss": 1.4000526666641235,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 4947968.0,
+ "step": 302
+ },
+ {
+ "entropy": 1.4965202808380127,
+ "epoch": 0.6121212121212121,
+ "grad_norm": 2.1385467052459717,
+ "learning_rate": 1.5932659932659933e-05,
+ "loss": 1.5221803188323975,
+ "mean_token_accuracy": 0.6567537784576416,
+ "num_tokens": 4964352.0,
+ "step": 303
+ },
+ {
+ "entropy": 1.4024577140808105,
+ "epoch": 0.6141414141414141,
+ "grad_norm": 1.9162694215774536,
+ "learning_rate": 1.591919191919192e-05,
+ "loss": 1.4050084352493286,
+ "mean_token_accuracy": 0.6670737862586975,
+ "num_tokens": 4980736.0,
+ "step": 304
+ },
+ {
+ "entropy": 1.430273413658142,
+ "epoch": 0.6161616161616161,
+ "grad_norm": 2.0312552452087402,
+ "learning_rate": 1.5905723905723906e-05,
+ "loss": 1.418628454208374,
+ "mean_token_accuracy": 0.6585857272148132,
+ "num_tokens": 4997120.0,
+ "step": 305
+ },
+ {
+ "entropy": 1.700549602508545,
+ "epoch": 0.6181818181818182,
+ "grad_norm": 2.080810546875,
+ "learning_rate": 1.5892255892255895e-05,
+ "loss": 1.740492820739746,
+ "mean_token_accuracy": 0.6042989492416382,
+ "num_tokens": 5013504.0,
+ "step": 306
+ },
+ {
+ "entropy": 1.6465320587158203,
+ "epoch": 0.6202020202020202,
+ "grad_norm": 1.8810964822769165,
+ "learning_rate": 1.587878787878788e-05,
+ "loss": 1.6414886713027954,
+ "mean_token_accuracy": 0.629824161529541,
+ "num_tokens": 5029888.0,
+ "step": 307
+ },
+ {
+ "entropy": 1.3717931509017944,
+ "epoch": 0.6222222222222222,
+ "grad_norm": 1.921536922454834,
+ "learning_rate": 1.5865319865319868e-05,
+ "loss": 1.3700361251831055,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 5046272.0,
+ "step": 308
+ },
+ {
+ "entropy": 1.4906446933746338,
+ "epoch": 0.6242424242424243,
+ "grad_norm": 2.1185555458068848,
+ "learning_rate": 1.5851851851851852e-05,
+ "loss": 1.4850339889526367,
+ "mean_token_accuracy": 0.6402662396430969,
+ "num_tokens": 5062656.0,
+ "step": 309
+ },
+ {
+ "entropy": 1.4417473077774048,
+ "epoch": 0.6262626262626263,
+ "grad_norm": 2.0196895599365234,
+ "learning_rate": 1.583838383838384e-05,
+ "loss": 1.4567816257476807,
+ "mean_token_accuracy": 0.6760503053665161,
+ "num_tokens": 5079040.0,
+ "step": 310
+ },
+ {
+ "entropy": 1.4662094116210938,
+ "epoch": 0.6282828282828283,
+ "grad_norm": 1.8859882354736328,
+ "learning_rate": 1.5824915824915825e-05,
+ "loss": 1.4870874881744385,
+ "mean_token_accuracy": 0.6618221998214722,
+ "num_tokens": 5095424.0,
+ "step": 311
+ },
+ {
+ "entropy": 1.8497077226638794,
+ "epoch": 0.6303030303030303,
+ "grad_norm": 1.974537968635559,
+ "learning_rate": 1.5811447811447813e-05,
+ "loss": 1.840538501739502,
+ "mean_token_accuracy": 0.589093804359436,
+ "num_tokens": 5111808.0,
+ "step": 312
+ },
+ {
+ "entropy": 1.4185130596160889,
+ "epoch": 0.6323232323232323,
+ "grad_norm": 1.8612359762191772,
+ "learning_rate": 1.5797979797979798e-05,
+ "loss": 1.4404246807098389,
+ "mean_token_accuracy": 0.664631187915802,
+ "num_tokens": 5128192.0,
+ "step": 313
+ },
+ {
+ "entropy": 1.8270463943481445,
+ "epoch": 0.6343434343434343,
+ "grad_norm": 2.1050970554351807,
+ "learning_rate": 1.5784511784511786e-05,
+ "loss": 1.8682940006256104,
+ "mean_token_accuracy": 0.5893380641937256,
+ "num_tokens": 5144576.0,
+ "step": 314
+ },
+ {
+ "entropy": 1.5919326543807983,
+ "epoch": 0.6363636363636364,
+ "grad_norm": 1.8464620113372803,
+ "learning_rate": 1.577104377104377e-05,
+ "loss": 1.6087713241577148,
+ "mean_token_accuracy": 0.6350146532058716,
+ "num_tokens": 5160960.0,
+ "step": 315
+ },
+ {
+ "entropy": 1.4776946306228638,
+ "epoch": 0.6383838383838384,
+ "grad_norm": 2.031834602355957,
+ "learning_rate": 1.575757575757576e-05,
+ "loss": 1.5114507675170898,
+ "mean_token_accuracy": 0.6498534679412842,
+ "num_tokens": 5177344.0,
+ "step": 316
+ },
+ {
+ "entropy": 1.3789927959442139,
+ "epoch": 0.6404040404040404,
+ "grad_norm": 1.8604289293289185,
+ "learning_rate": 1.5744107744107748e-05,
+ "loss": 1.3792052268981934,
+ "mean_token_accuracy": 0.6712262034416199,
+ "num_tokens": 5193728.0,
+ "step": 317
+ },
+ {
+ "entropy": 1.5859184265136719,
+ "epoch": 0.6424242424242425,
+ "grad_norm": 2.1134088039398193,
+ "learning_rate": 1.5730639730639732e-05,
+ "loss": 1.595099925994873,
+ "mean_token_accuracy": 0.6351367831230164,
+ "num_tokens": 5210112.0,
+ "step": 318
+ },
+ {
+ "entropy": 1.3681901693344116,
+ "epoch": 0.6444444444444445,
+ "grad_norm": 1.9200235605239868,
+ "learning_rate": 1.5717171717171717e-05,
+ "loss": 1.3700852394104004,
+ "mean_token_accuracy": 0.6671959161758423,
+ "num_tokens": 5226496.0,
+ "step": 319
+ },
+ {
+ "entropy": 1.594885230064392,
+ "epoch": 0.6464646464646465,
+ "grad_norm": 1.7683591842651367,
+ "learning_rate": 1.5703703703703705e-05,
+ "loss": 1.5906047821044922,
+ "mean_token_accuracy": 0.6350757479667664,
+ "num_tokens": 5242880.0,
+ "step": 320
+ },
+ {
+ "entropy": 1.240937352180481,
+ "epoch": 0.6484848484848484,
+ "grad_norm": 2.117145299911499,
+ "learning_rate": 1.569023569023569e-05,
+ "loss": 1.2188963890075684,
+ "mean_token_accuracy": 0.6958353519439697,
+ "num_tokens": 5259264.0,
+ "step": 321
+ },
+ {
+ "entropy": 1.244801640510559,
+ "epoch": 0.6505050505050505,
+ "grad_norm": 1.983111023902893,
+ "learning_rate": 1.5676767676767678e-05,
+ "loss": 1.246530294418335,
+ "mean_token_accuracy": 0.6966902613639832,
+ "num_tokens": 5275648.0,
+ "step": 322
+ },
+ {
+ "entropy": 1.5355960130691528,
+ "epoch": 0.6525252525252525,
+ "grad_norm": 2.126024007797241,
+ "learning_rate": 1.5663299663299666e-05,
+ "loss": 1.576147198677063,
+ "mean_token_accuracy": 0.6414265036582947,
+ "num_tokens": 5292032.0,
+ "step": 323
+ },
+ {
+ "entropy": 1.13125741481781,
+ "epoch": 0.6545454545454545,
+ "grad_norm": 1.8933371305465698,
+ "learning_rate": 1.564983164983165e-05,
+ "loss": 1.1167645454406738,
+ "mean_token_accuracy": 0.7080483436584473,
+ "num_tokens": 5308416.0,
+ "step": 324
+ },
+ {
+ "entropy": 1.6553086042404175,
+ "epoch": 0.6565656565656566,
+ "grad_norm": 1.9253427982330322,
+ "learning_rate": 1.563636363636364e-05,
+ "loss": 1.6746933460235596,
+ "mean_token_accuracy": 0.6138250827789307,
+ "num_tokens": 5324800.0,
+ "step": 325
+ },
+ {
+ "entropy": 1.7187142372131348,
+ "epoch": 0.6585858585858586,
+ "grad_norm": 1.8655303716659546,
+ "learning_rate": 1.5622895622895624e-05,
+ "loss": 1.7368483543395996,
+ "mean_token_accuracy": 0.6073521971702576,
+ "num_tokens": 5341184.0,
+ "step": 326
+ },
+ {
+ "entropy": 1.4150934219360352,
+ "epoch": 0.6606060606060606,
+ "grad_norm": 1.8396921157836914,
+ "learning_rate": 1.560942760942761e-05,
+ "loss": 1.450613260269165,
+ "mean_token_accuracy": 0.6628602743148804,
+ "num_tokens": 5357568.0,
+ "step": 327
+ },
+ {
+ "entropy": 1.6463909149169922,
+ "epoch": 0.6626262626262627,
+ "grad_norm": 2.0179622173309326,
+ "learning_rate": 1.5595959595959597e-05,
+ "loss": 1.6767137050628662,
+ "mean_token_accuracy": 0.6147410869598389,
+ "num_tokens": 5373952.0,
+ "step": 328
+ },
+ {
+ "entropy": 1.2962068319320679,
+ "epoch": 0.6646464646464646,
+ "grad_norm": 1.9322903156280518,
+ "learning_rate": 1.5582491582491582e-05,
+ "loss": 1.288381814956665,
+ "mean_token_accuracy": 0.6877137422561646,
+ "num_tokens": 5390336.0,
+ "step": 329
+ },
+ {
+ "entropy": 1.4675830602645874,
+ "epoch": 0.6666666666666666,
+ "grad_norm": 1.7735666036605835,
+ "learning_rate": 1.556902356902357e-05,
+ "loss": 1.4585455656051636,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 5406720.0,
+ "step": 330
+ },
+ {
+ "entropy": 1.55418062210083,
+ "epoch": 0.6686868686868687,
+ "grad_norm": 1.9255602359771729,
+ "learning_rate": 1.555555555555556e-05,
+ "loss": 1.6033880710601807,
+ "mean_token_accuracy": 0.6486321687698364,
+ "num_tokens": 5423104.0,
+ "step": 331
+ },
+ {
+ "entropy": 1.4288218021392822,
+ "epoch": 0.6707070707070707,
+ "grad_norm": 1.8075612783432007,
+ "learning_rate": 1.5542087542087543e-05,
+ "loss": 1.457895278930664,
+ "mean_token_accuracy": 0.6725085377693176,
+ "num_tokens": 5439488.0,
+ "step": 332
+ },
+ {
+ "entropy": 1.3419297933578491,
+ "epoch": 0.6727272727272727,
+ "grad_norm": 2.1730353832244873,
+ "learning_rate": 1.552861952861953e-05,
+ "loss": 1.3681403398513794,
+ "mean_token_accuracy": 0.6664020419120789,
+ "num_tokens": 5455872.0,
+ "step": 333
+ },
+ {
+ "entropy": 1.706923007965088,
+ "epoch": 0.6747474747474748,
+ "grad_norm": 1.9297505617141724,
+ "learning_rate": 1.5515151515151516e-05,
+ "loss": 1.7304211854934692,
+ "mean_token_accuracy": 0.6020395755767822,
+ "num_tokens": 5472256.0,
+ "step": 334
+ },
+ {
+ "entropy": 1.117404818534851,
+ "epoch": 0.6767676767676768,
+ "grad_norm": 1.7363555431365967,
+ "learning_rate": 1.55016835016835e-05,
+ "loss": 1.1002353429794312,
+ "mean_token_accuracy": 0.7285661697387695,
+ "num_tokens": 5488640.0,
+ "step": 335
+ },
+ {
+ "entropy": 1.409253478050232,
+ "epoch": 0.6787878787878788,
+ "grad_norm": 2.029304265975952,
+ "learning_rate": 1.548821548821549e-05,
+ "loss": 1.4001437425613403,
+ "mean_token_accuracy": 0.6604176759719849,
+ "num_tokens": 5505024.0,
+ "step": 336
+ },
+ {
+ "entropy": 1.0427494049072266,
+ "epoch": 0.6808080808080809,
+ "grad_norm": 2.0266847610473633,
+ "learning_rate": 1.5474747474747477e-05,
+ "loss": 1.0636063814163208,
+ "mean_token_accuracy": 0.7298485636711121,
+ "num_tokens": 5521408.0,
+ "step": 337
+ },
+ {
+ "entropy": 1.479506254196167,
+ "epoch": 0.6828282828282828,
+ "grad_norm": 1.937677264213562,
+ "learning_rate": 1.5461279461279462e-05,
+ "loss": 1.4711894989013672,
+ "mean_token_accuracy": 0.6436248421669006,
+ "num_tokens": 5537792.0,
+ "step": 338
+ },
+ {
+ "entropy": 1.636492371559143,
+ "epoch": 0.6848484848484848,
+ "grad_norm": 1.9746829271316528,
+ "learning_rate": 1.544781144781145e-05,
+ "loss": 1.638418436050415,
+ "mean_token_accuracy": 0.6204200983047485,
+ "num_tokens": 5554176.0,
+ "step": 339
+ },
+ {
+ "entropy": 1.6094971895217896,
+ "epoch": 0.6868686868686869,
+ "grad_norm": 1.998382806777954,
+ "learning_rate": 1.5434343434343435e-05,
+ "loss": 1.6025879383087158,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 5570560.0,
+ "step": 340
+ },
+ {
+ "entropy": 1.3113542795181274,
+ "epoch": 0.6888888888888889,
+ "grad_norm": 2.059739589691162,
+ "learning_rate": 1.5420875420875423e-05,
+ "loss": 1.32335364818573,
+ "mean_token_accuracy": 0.6776379942893982,
+ "num_tokens": 5586944.0,
+ "step": 341
+ },
+ {
+ "entropy": 1.3761622905731201,
+ "epoch": 0.6909090909090909,
+ "grad_norm": 1.9774043560028076,
+ "learning_rate": 1.5407407407407408e-05,
+ "loss": 1.3731458187103271,
+ "mean_token_accuracy": 0.681546151638031,
+ "num_tokens": 5603328.0,
+ "step": 342
+ },
+ {
+ "entropy": 1.3822734355926514,
+ "epoch": 0.692929292929293,
+ "grad_norm": 5.41459321975708,
+ "learning_rate": 1.5393939393939393e-05,
+ "loss": 1.4077341556549072,
+ "mean_token_accuracy": 0.6688446402549744,
+ "num_tokens": 5619712.0,
+ "step": 343
+ },
+ {
+ "entropy": 1.4885843992233276,
+ "epoch": 0.694949494949495,
+ "grad_norm": 1.9256173372268677,
+ "learning_rate": 1.538047138047138e-05,
+ "loss": 1.5017898082733154,
+ "mean_token_accuracy": 0.6411211490631104,
+ "num_tokens": 5636096.0,
+ "step": 344
+ },
+ {
+ "entropy": 1.4558689594268799,
+ "epoch": 0.696969696969697,
+ "grad_norm": 1.923056721687317,
+ "learning_rate": 1.536700336700337e-05,
+ "loss": 1.4409637451171875,
+ "mean_token_accuracy": 0.6607840657234192,
+ "num_tokens": 5652480.0,
+ "step": 345
+ },
+ {
+ "entropy": 1.3396257162094116,
+ "epoch": 0.6989898989898989,
+ "grad_norm": 1.9321191310882568,
+ "learning_rate": 1.5353535353535354e-05,
+ "loss": 1.3465441465377808,
+ "mean_token_accuracy": 0.6682339906692505,
+ "num_tokens": 5668864.0,
+ "step": 346
+ },
+ {
+ "entropy": 1.931525468826294,
+ "epoch": 0.701010101010101,
+ "grad_norm": 2.11252498626709,
+ "learning_rate": 1.5340067340067342e-05,
+ "loss": 1.947523832321167,
+ "mean_token_accuracy": 0.5751709938049316,
+ "num_tokens": 5685248.0,
+ "step": 347
+ },
+ {
+ "entropy": 1.4246045351028442,
+ "epoch": 0.703030303030303,
+ "grad_norm": 2.017690658569336,
+ "learning_rate": 1.5326599326599327e-05,
+ "loss": 1.431095004081726,
+ "mean_token_accuracy": 0.6621274948120117,
+ "num_tokens": 5701632.0,
+ "step": 348
+ },
+ {
+ "entropy": 1.2840481996536255,
+ "epoch": 0.705050505050505,
+ "grad_norm": 1.897916555404663,
+ "learning_rate": 1.5313131313131315e-05,
+ "loss": 1.2944300174713135,
+ "mean_token_accuracy": 0.7013311982154846,
+ "num_tokens": 5718016.0,
+ "step": 349
+ },
+ {
+ "entropy": 1.1308226585388184,
+ "epoch": 0.7070707070707071,
+ "grad_norm": 1.8326802253723145,
+ "learning_rate": 1.52996632996633e-05,
+ "loss": 1.1564277410507202,
+ "mean_token_accuracy": 0.714154839515686,
+ "num_tokens": 5734400.0,
+ "step": 350
+ },
+ {
+ "entropy": 1.4157475233078003,
+ "epoch": 0.7090909090909091,
+ "grad_norm": 1.9305709600448608,
+ "learning_rate": 1.5286195286195288e-05,
+ "loss": 1.421119213104248,
+ "mean_token_accuracy": 0.6651197075843811,
+ "num_tokens": 5750784.0,
+ "step": 351
+ },
+ {
+ "entropy": 1.353966474533081,
+ "epoch": 0.7111111111111111,
+ "grad_norm": 2.058542251586914,
+ "learning_rate": 1.5272727272727276e-05,
+ "loss": 1.3575413227081299,
+ "mean_token_accuracy": 0.6724475026130676,
+ "num_tokens": 5767168.0,
+ "step": 352
+ },
+ {
+ "entropy": 1.7946882247924805,
+ "epoch": 0.7131313131313132,
+ "grad_norm": 1.9397060871124268,
+ "learning_rate": 1.525925925925926e-05,
+ "loss": 1.7882269620895386,
+ "mean_token_accuracy": 0.6064972877502441,
+ "num_tokens": 5783552.0,
+ "step": 353
+ },
+ {
+ "entropy": 1.4986019134521484,
+ "epoch": 0.7151515151515152,
+ "grad_norm": 1.9084810018539429,
+ "learning_rate": 1.5245791245791246e-05,
+ "loss": 1.5188498497009277,
+ "mean_token_accuracy": 0.6610283255577087,
+ "num_tokens": 5799936.0,
+ "step": 354
+ },
+ {
+ "entropy": 1.9081071615219116,
+ "epoch": 0.7171717171717171,
+ "grad_norm": 2.1528689861297607,
+ "learning_rate": 1.5232323232323234e-05,
+ "loss": 1.8967041969299316,
+ "mean_token_accuracy": 0.5691255331039429,
+ "num_tokens": 5816320.0,
+ "step": 355
+ },
+ {
+ "entropy": 1.641337513923645,
+ "epoch": 0.7191919191919192,
+ "grad_norm": 1.9197942018508911,
+ "learning_rate": 1.521885521885522e-05,
+ "loss": 1.6193110942840576,
+ "mean_token_accuracy": 0.6286638975143433,
+ "num_tokens": 5832704.0,
+ "step": 356
+ },
+ {
+ "entropy": 1.348304271697998,
+ "epoch": 0.7212121212121212,
+ "grad_norm": 1.9729533195495605,
+ "learning_rate": 1.5205387205387207e-05,
+ "loss": 1.3781111240386963,
+ "mean_token_accuracy": 0.6654250025749207,
+ "num_tokens": 5849088.0,
+ "step": 357
+ },
+ {
+ "entropy": 1.5427544116973877,
+ "epoch": 0.7232323232323232,
+ "grad_norm": 2.0730769634246826,
+ "learning_rate": 1.5191919191919193e-05,
+ "loss": 1.5770654678344727,
+ "mean_token_accuracy": 0.6273815631866455,
+ "num_tokens": 5865472.0,
+ "step": 358
+ },
+ {
+ "entropy": 1.5560660362243652,
+ "epoch": 0.7252525252525253,
+ "grad_norm": 2.0436644554138184,
+ "learning_rate": 1.5178451178451178e-05,
+ "loss": 1.5465143918991089,
+ "mean_token_accuracy": 0.6335490942001343,
+ "num_tokens": 5881856.0,
+ "step": 359
+ },
+ {
+ "entropy": 1.5396223068237305,
+ "epoch": 0.7272727272727273,
+ "grad_norm": 1.9955254793167114,
+ "learning_rate": 1.5164983164983166e-05,
+ "loss": 1.5742223262786865,
+ "mean_token_accuracy": 0.6344650983810425,
+ "num_tokens": 5898240.0,
+ "step": 360
+ },
+ {
+ "entropy": 1.1664644479751587,
+ "epoch": 0.7292929292929293,
+ "grad_norm": 1.6942992210388184,
+ "learning_rate": 1.5151515151515153e-05,
+ "loss": 1.159040927886963,
+ "mean_token_accuracy": 0.7144601941108704,
+ "num_tokens": 5914624.0,
+ "step": 361
+ },
+ {
+ "entropy": 1.356544017791748,
+ "epoch": 0.7313131313131314,
+ "grad_norm": 1.890787124633789,
+ "learning_rate": 1.5138047138047138e-05,
+ "loss": 1.347895622253418,
+ "mean_token_accuracy": 0.6813629865646362,
+ "num_tokens": 5931008.0,
+ "step": 362
+ },
+ {
+ "entropy": 1.6837173700332642,
+ "epoch": 0.7333333333333333,
+ "grad_norm": 2.1780381202697754,
+ "learning_rate": 1.5124579124579126e-05,
+ "loss": 1.6997990608215332,
+ "mean_token_accuracy": 0.6098558902740479,
+ "num_tokens": 5947392.0,
+ "step": 363
+ },
+ {
+ "entropy": 1.1412957906723022,
+ "epoch": 0.7353535353535353,
+ "grad_norm": 1.801152229309082,
+ "learning_rate": 1.5111111111111112e-05,
+ "loss": 1.161649227142334,
+ "mean_token_accuracy": 0.705483615398407,
+ "num_tokens": 5963776.0,
+ "step": 364
+ },
+ {
+ "entropy": 1.2495859861373901,
+ "epoch": 0.7373737373737373,
+ "grad_norm": 1.8535690307617188,
+ "learning_rate": 1.50976430976431e-05,
+ "loss": 1.2595994472503662,
+ "mean_token_accuracy": 0.6926599740982056,
+ "num_tokens": 5980160.0,
+ "step": 365
+ },
+ {
+ "entropy": 1.8037965297698975,
+ "epoch": 0.7393939393939394,
+ "grad_norm": 2.0506303310394287,
+ "learning_rate": 1.5084175084175085e-05,
+ "loss": 1.8499953746795654,
+ "mean_token_accuracy": 0.5861626863479614,
+ "num_tokens": 5996544.0,
+ "step": 366
+ },
+ {
+ "entropy": 1.2877405881881714,
+ "epoch": 0.7414141414141414,
+ "grad_norm": 1.8159914016723633,
+ "learning_rate": 1.5070707070707072e-05,
+ "loss": 1.3165576457977295,
+ "mean_token_accuracy": 0.685271143913269,
+ "num_tokens": 6012928.0,
+ "step": 367
+ },
+ {
+ "entropy": 1.345953106880188,
+ "epoch": 0.7434343434343434,
+ "grad_norm": 2.003962516784668,
+ "learning_rate": 1.505723905723906e-05,
+ "loss": 1.3270621299743652,
+ "mean_token_accuracy": 0.6671348214149475,
+ "num_tokens": 6029312.0,
+ "step": 368
+ },
+ {
+ "entropy": 1.408361792564392,
+ "epoch": 0.7454545454545455,
+ "grad_norm": 1.9815948009490967,
+ "learning_rate": 1.5043771043771045e-05,
+ "loss": 1.4097518920898438,
+ "mean_token_accuracy": 0.652662456035614,
+ "num_tokens": 6045696.0,
+ "step": 369
+ },
+ {
+ "entropy": 1.4007829427719116,
+ "epoch": 0.7474747474747475,
+ "grad_norm": 1.928751826286316,
+ "learning_rate": 1.5030303030303031e-05,
+ "loss": 1.4142816066741943,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 6062080.0,
+ "step": 370
+ },
+ {
+ "entropy": 1.7548134326934814,
+ "epoch": 0.7494949494949495,
+ "grad_norm": 2.081939458847046,
+ "learning_rate": 1.5016835016835018e-05,
+ "loss": 1.792219877243042,
+ "mean_token_accuracy": 0.6044821739196777,
+ "num_tokens": 6078464.0,
+ "step": 371
+ },
+ {
+ "entropy": 1.6162793636322021,
+ "epoch": 0.7515151515151515,
+ "grad_norm": 1.8544763326644897,
+ "learning_rate": 1.5003367003367004e-05,
+ "loss": 1.650557041168213,
+ "mean_token_accuracy": 0.6289692521095276,
+ "num_tokens": 6094848.0,
+ "step": 372
+ },
+ {
+ "entropy": 1.6329439878463745,
+ "epoch": 0.7535353535353535,
+ "grad_norm": 1.8025282621383667,
+ "learning_rate": 1.4989898989898992e-05,
+ "loss": 1.6812629699707031,
+ "mean_token_accuracy": 0.6405104994773865,
+ "num_tokens": 6111232.0,
+ "step": 373
+ },
+ {
+ "entropy": 1.2201604843139648,
+ "epoch": 0.7555555555555555,
+ "grad_norm": 1.9814586639404297,
+ "learning_rate": 1.4976430976430977e-05,
+ "loss": 1.2086223363876343,
+ "mean_token_accuracy": 0.7020029425621033,
+ "num_tokens": 6127616.0,
+ "step": 374
+ },
+ {
+ "entropy": 1.8105695247650146,
+ "epoch": 0.7575757575757576,
+ "grad_norm": 2.0217790603637695,
+ "learning_rate": 1.4962962962962964e-05,
+ "loss": 1.8443559408187866,
+ "mean_token_accuracy": 0.5897654891014099,
+ "num_tokens": 6144000.0,
+ "step": 375
+ },
+ {
+ "entropy": 1.197646141052246,
+ "epoch": 0.7595959595959596,
+ "grad_norm": 1.9286304712295532,
+ "learning_rate": 1.4949494949494952e-05,
+ "loss": 1.2183899879455566,
+ "mean_token_accuracy": 0.6925989389419556,
+ "num_tokens": 6160384.0,
+ "step": 376
+ },
+ {
+ "entropy": 1.4825936555862427,
+ "epoch": 0.7616161616161616,
+ "grad_norm": 1.6694327592849731,
+ "learning_rate": 1.4936026936026937e-05,
+ "loss": 1.4815235137939453,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 6176768.0,
+ "step": 377
+ },
+ {
+ "entropy": 1.3497473001480103,
+ "epoch": 0.7636363636363637,
+ "grad_norm": 2.0366406440734863,
+ "learning_rate": 1.4922558922558923e-05,
+ "loss": 1.3637127876281738,
+ "mean_token_accuracy": 0.6690889000892639,
+ "num_tokens": 6193152.0,
+ "step": 378
+ },
+ {
+ "entropy": 1.314116358757019,
+ "epoch": 0.7656565656565657,
+ "grad_norm": 1.742874026298523,
+ "learning_rate": 1.4909090909090911e-05,
+ "loss": 1.300222396850586,
+ "mean_token_accuracy": 0.6977283954620361,
+ "num_tokens": 6209536.0,
+ "step": 379
+ },
+ {
+ "entropy": 1.4347912073135376,
+ "epoch": 0.7676767676767676,
+ "grad_norm": 1.9317418336868286,
+ "learning_rate": 1.4895622895622896e-05,
+ "loss": 1.429826021194458,
+ "mean_token_accuracy": 0.6650586128234863,
+ "num_tokens": 6225920.0,
+ "step": 380
+ },
+ {
+ "entropy": 1.448641061782837,
+ "epoch": 0.7696969696969697,
+ "grad_norm": 1.8417843580245972,
+ "learning_rate": 1.4882154882154884e-05,
+ "loss": 1.4439187049865723,
+ "mean_token_accuracy": 0.6615168452262878,
+ "num_tokens": 6242304.0,
+ "step": 381
+ },
+ {
+ "entropy": 1.2918578386306763,
+ "epoch": 0.7717171717171717,
+ "grad_norm": 1.8720030784606934,
+ "learning_rate": 1.486868686868687e-05,
+ "loss": 1.3158597946166992,
+ "mean_token_accuracy": 0.6865534782409668,
+ "num_tokens": 6258688.0,
+ "step": 382
+ },
+ {
+ "entropy": 1.5822116136550903,
+ "epoch": 0.7737373737373737,
+ "grad_norm": 1.9301713705062866,
+ "learning_rate": 1.4855218855218856e-05,
+ "loss": 1.6046046018600464,
+ "mean_token_accuracy": 0.6361138224601746,
+ "num_tokens": 6275072.0,
+ "step": 383
+ },
+ {
+ "entropy": 1.6837408542633057,
+ "epoch": 0.7757575757575758,
+ "grad_norm": 2.270636796951294,
+ "learning_rate": 1.4841750841750844e-05,
+ "loss": 1.7323150634765625,
+ "mean_token_accuracy": 0.6006350517272949,
+ "num_tokens": 6291456.0,
+ "step": 384
+ },
+ {
+ "entropy": 1.4837889671325684,
+ "epoch": 0.7777777777777778,
+ "grad_norm": 1.908146619796753,
+ "learning_rate": 1.482828282828283e-05,
+ "loss": 1.4938652515411377,
+ "mean_token_accuracy": 0.64667809009552,
+ "num_tokens": 6307840.0,
+ "step": 385
+ },
+ {
+ "entropy": 1.680192232131958,
+ "epoch": 0.7797979797979798,
+ "grad_norm": 2.2369024753570557,
+ "learning_rate": 1.4814814814814815e-05,
+ "loss": 1.692443609237671,
+ "mean_token_accuracy": 0.6279922127723694,
+ "num_tokens": 6324224.0,
+ "step": 386
+ },
+ {
+ "entropy": 1.686415195465088,
+ "epoch": 0.7818181818181819,
+ "grad_norm": 1.8252373933792114,
+ "learning_rate": 1.4801346801346803e-05,
+ "loss": 1.7022712230682373,
+ "mean_token_accuracy": 0.6302515864372253,
+ "num_tokens": 6340608.0,
+ "step": 387
+ },
+ {
+ "entropy": 1.6967185735702515,
+ "epoch": 0.7838383838383839,
+ "grad_norm": 2.102458953857422,
+ "learning_rate": 1.478787878787879e-05,
+ "loss": 1.6931922435760498,
+ "mean_token_accuracy": 0.6149853467941284,
+ "num_tokens": 6356992.0,
+ "step": 388
+ },
+ {
+ "entropy": 1.201438307762146,
+ "epoch": 0.7858585858585858,
+ "grad_norm": 1.8396239280700684,
+ "learning_rate": 1.4774410774410774e-05,
+ "loss": 1.2081820964813232,
+ "mean_token_accuracy": 0.6987664699554443,
+ "num_tokens": 6373376.0,
+ "step": 389
+ },
+ {
+ "entropy": 1.5559548139572144,
+ "epoch": 0.7878787878787878,
+ "grad_norm": 2.063498020172119,
+ "learning_rate": 1.4760942760942763e-05,
+ "loss": 1.545433759689331,
+ "mean_token_accuracy": 0.6267709136009216,
+ "num_tokens": 6389760.0,
+ "step": 390
+ },
+ {
+ "entropy": 1.7186503410339355,
+ "epoch": 0.7898989898989899,
+ "grad_norm": 2.0129787921905518,
+ "learning_rate": 1.4747474747474747e-05,
+ "loss": 1.717472791671753,
+ "mean_token_accuracy": 0.6540058851242065,
+ "num_tokens": 6406144.0,
+ "step": 391
+ },
+ {
+ "entropy": 1.643048882484436,
+ "epoch": 0.7919191919191919,
+ "grad_norm": 1.9443073272705078,
+ "learning_rate": 1.4734006734006736e-05,
+ "loss": 1.6441841125488281,
+ "mean_token_accuracy": 0.6458231806755066,
+ "num_tokens": 6422528.0,
+ "step": 392
+ },
+ {
+ "entropy": 1.3627581596374512,
+ "epoch": 0.793939393939394,
+ "grad_norm": 1.9852598905563354,
+ "learning_rate": 1.4720538720538722e-05,
+ "loss": 1.3558071851730347,
+ "mean_token_accuracy": 0.6720200181007385,
+ "num_tokens": 6438912.0,
+ "step": 393
+ },
+ {
+ "entropy": 0.8946540951728821,
+ "epoch": 0.795959595959596,
+ "grad_norm": 1.54441237449646,
+ "learning_rate": 1.4707070707070707e-05,
+ "loss": 0.8874151706695557,
+ "mean_token_accuracy": 0.7685027122497559,
+ "num_tokens": 6455296.0,
+ "step": 394
+ },
+ {
+ "entropy": 1.35861074924469,
+ "epoch": 0.797979797979798,
+ "grad_norm": 2.158553123474121,
+ "learning_rate": 1.4693602693602695e-05,
+ "loss": 1.4291828870773315,
+ "mean_token_accuracy": 0.6647533178329468,
+ "num_tokens": 6471680.0,
+ "step": 395
+ },
+ {
+ "entropy": 1.7047442197799683,
+ "epoch": 0.8,
+ "grad_norm": 2.1242175102233887,
+ "learning_rate": 1.4680134680134681e-05,
+ "loss": 1.7065966129302979,
+ "mean_token_accuracy": 0.6058256030082703,
+ "num_tokens": 6488064.0,
+ "step": 396
+ },
+ {
+ "entropy": 1.7153913974761963,
+ "epoch": 0.802020202020202,
+ "grad_norm": 1.9085419178009033,
+ "learning_rate": 1.4666666666666666e-05,
+ "loss": 1.7373592853546143,
+ "mean_token_accuracy": 0.6020395755767822,
+ "num_tokens": 6504448.0,
+ "step": 397
+ },
+ {
+ "entropy": 1.1062475442886353,
+ "epoch": 0.804040404040404,
+ "grad_norm": 1.9173986911773682,
+ "learning_rate": 1.4653198653198654e-05,
+ "loss": 1.0991405248641968,
+ "mean_token_accuracy": 0.7195896506309509,
+ "num_tokens": 6520832.0,
+ "step": 398
+ },
+ {
+ "entropy": 1.5717406272888184,
+ "epoch": 0.806060606060606,
+ "grad_norm": 2.0077219009399414,
+ "learning_rate": 1.4639730639730641e-05,
+ "loss": 1.595954418182373,
+ "mean_token_accuracy": 0.6270151734352112,
+ "num_tokens": 6537216.0,
+ "step": 399
+ },
+ {
+ "entropy": 1.3960795402526855,
+ "epoch": 0.8080808080808081,
+ "grad_norm": 2.2864415645599365,
+ "learning_rate": 1.4626262626262629e-05,
+ "loss": 1.416130781173706,
+ "mean_token_accuracy": 0.6631656289100647,
+ "num_tokens": 6553600.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.8080808080808081,
+ "eval_entropy": 1.510355769626556,
+ "eval_loss": 1.5199862718582153,
+ "eval_mean_token_accuracy": 0.6461201098657423,
+ "eval_num_tokens": 6553600.0,
+ "eval_runtime": 43.8634,
+ "eval_samples_per_second": 22.57,
+ "eval_steps_per_second": 2.827,
+ "step": 400
+ },
+ {
+ "entropy": 1.5662645101547241,
+ "epoch": 0.8101010101010101,
+ "grad_norm": 2.1806085109710693,
+ "learning_rate": 1.4612794612794614e-05,
+ "loss": 1.5763804912567139,
+ "mean_token_accuracy": 0.6330605745315552,
+ "num_tokens": 6569984.0,
+ "step": 401
+ },
+ {
+ "entropy": 1.4046087265014648,
+ "epoch": 0.8121212121212121,
+ "grad_norm": 1.9650650024414062,
+ "learning_rate": 1.45993265993266e-05,
+ "loss": 1.396510124206543,
+ "mean_token_accuracy": 0.6568148732185364,
+ "num_tokens": 6586368.0,
+ "step": 402
+ },
+ {
+ "entropy": 1.084455966949463,
+ "epoch": 0.8141414141414142,
+ "grad_norm": 1.926537275314331,
+ "learning_rate": 1.4585858585858587e-05,
+ "loss": 1.096333622932434,
+ "mean_token_accuracy": 0.7233145833015442,
+ "num_tokens": 6602752.0,
+ "step": 403
+ },
+ {
+ "entropy": 1.379700779914856,
+ "epoch": 0.8161616161616162,
+ "grad_norm": 1.957202672958374,
+ "learning_rate": 1.4572390572390573e-05,
+ "loss": 1.4035027027130127,
+ "mean_token_accuracy": 0.674462616443634,
+ "num_tokens": 6619136.0,
+ "step": 404
+ },
+ {
+ "entropy": 1.3775221109390259,
+ "epoch": 0.8181818181818182,
+ "grad_norm": 1.9095491170883179,
+ "learning_rate": 1.455892255892256e-05,
+ "loss": 1.3915553092956543,
+ "mean_token_accuracy": 0.6811187267303467,
+ "num_tokens": 6635520.0,
+ "step": 405
+ },
+ {
+ "entropy": 1.4745222330093384,
+ "epoch": 0.8202020202020202,
+ "grad_norm": 2.0017123222351074,
+ "learning_rate": 1.4545454545454546e-05,
+ "loss": 1.4845868349075317,
+ "mean_token_accuracy": 0.6557767391204834,
+ "num_tokens": 6651904.0,
+ "step": 406
+ },
+ {
+ "entropy": 1.5129855871200562,
+ "epoch": 0.8222222222222222,
+ "grad_norm": 2.127979040145874,
+ "learning_rate": 1.4531986531986533e-05,
+ "loss": 1.5081605911254883,
+ "mean_token_accuracy": 0.6425256729125977,
+ "num_tokens": 6668288.0,
+ "step": 407
+ },
+ {
+ "entropy": 1.1438099145889282,
+ "epoch": 0.8242424242424242,
+ "grad_norm": 1.7389986515045166,
+ "learning_rate": 1.4518518518518521e-05,
+ "loss": 1.1446681022644043,
+ "mean_token_accuracy": 0.7180629968643188,
+ "num_tokens": 6684672.0,
+ "step": 408
+ },
+ {
+ "entropy": 1.448157787322998,
+ "epoch": 0.8262626262626263,
+ "grad_norm": 1.8483424186706543,
+ "learning_rate": 1.4505050505050506e-05,
+ "loss": 1.4317030906677246,
+ "mean_token_accuracy": 0.6659746170043945,
+ "num_tokens": 6701056.0,
+ "step": 409
+ },
+ {
+ "entropy": 1.419940710067749,
+ "epoch": 0.8282828282828283,
+ "grad_norm": 1.961125135421753,
+ "learning_rate": 1.4491582491582492e-05,
+ "loss": 1.42207670211792,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 6717440.0,
+ "step": 410
+ },
+ {
+ "entropy": 1.5707522630691528,
+ "epoch": 0.8303030303030303,
+ "grad_norm": 2.0862255096435547,
+ "learning_rate": 1.447811447811448e-05,
+ "loss": 1.5721523761749268,
+ "mean_token_accuracy": 0.6305569410324097,
+ "num_tokens": 6733824.0,
+ "step": 411
+ },
+ {
+ "entropy": 1.4308481216430664,
+ "epoch": 0.8323232323232324,
+ "grad_norm": 2.1505820751190186,
+ "learning_rate": 1.4464646464646465e-05,
+ "loss": 1.4522666931152344,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 6750208.0,
+ "step": 412
+ },
+ {
+ "entropy": 1.7424806356430054,
+ "epoch": 0.8343434343434344,
+ "grad_norm": 2.1787710189819336,
+ "learning_rate": 1.4451178451178452e-05,
+ "loss": 1.7719662189483643,
+ "mean_token_accuracy": 0.5897654891014099,
+ "num_tokens": 6766592.0,
+ "step": 413
+ },
+ {
+ "entropy": 1.9777010679244995,
+ "epoch": 0.8363636363636363,
+ "grad_norm": 2.1178369522094727,
+ "learning_rate": 1.443771043771044e-05,
+ "loss": 1.9885730743408203,
+ "mean_token_accuracy": 0.5628358721733093,
+ "num_tokens": 6782976.0,
+ "step": 414
+ },
+ {
+ "entropy": 1.701235055923462,
+ "epoch": 0.8383838383838383,
+ "grad_norm": 1.9038937091827393,
+ "learning_rate": 1.4424242424242425e-05,
+ "loss": 1.6970818042755127,
+ "mean_token_accuracy": 0.6209086179733276,
+ "num_tokens": 6799360.0,
+ "step": 415
+ },
+ {
+ "entropy": 1.5118876695632935,
+ "epoch": 0.8404040404040404,
+ "grad_norm": 1.8924365043640137,
+ "learning_rate": 1.4410774410774413e-05,
+ "loss": 1.5288946628570557,
+ "mean_token_accuracy": 0.6480215191841125,
+ "num_tokens": 6815744.0,
+ "step": 416
+ },
+ {
+ "entropy": 1.5526877641677856,
+ "epoch": 0.8424242424242424,
+ "grad_norm": 2.109499216079712,
+ "learning_rate": 1.43973063973064e-05,
+ "loss": 1.5581820011138916,
+ "mean_token_accuracy": 0.6351978778839111,
+ "num_tokens": 6832128.0,
+ "step": 417
+ },
+ {
+ "entropy": 1.8132506608963013,
+ "epoch": 0.8444444444444444,
+ "grad_norm": 2.0389890670776367,
+ "learning_rate": 1.4383838383838384e-05,
+ "loss": 1.8378231525421143,
+ "mean_token_accuracy": 0.592391312122345,
+ "num_tokens": 6848512.0,
+ "step": 418
+ },
+ {
+ "entropy": 1.3766752481460571,
+ "epoch": 0.8464646464646465,
+ "grad_norm": 1.8586320877075195,
+ "learning_rate": 1.4370370370370372e-05,
+ "loss": 1.3741214275360107,
+ "mean_token_accuracy": 0.6796531677246094,
+ "num_tokens": 6864896.0,
+ "step": 419
+ },
+ {
+ "entropy": 1.1854407787322998,
+ "epoch": 0.8484848484848485,
+ "grad_norm": 1.875899314880371,
+ "learning_rate": 1.4356902356902359e-05,
+ "loss": 1.2393877506256104,
+ "mean_token_accuracy": 0.704323410987854,
+ "num_tokens": 6881280.0,
+ "step": 420
+ },
+ {
+ "entropy": 1.498558759689331,
+ "epoch": 0.8505050505050505,
+ "grad_norm": 1.898848295211792,
+ "learning_rate": 1.4343434343434344e-05,
+ "loss": 1.4963322877883911,
+ "mean_token_accuracy": 0.6542501449584961,
+ "num_tokens": 6897664.0,
+ "step": 421
+ },
+ {
+ "entropy": 1.5070384740829468,
+ "epoch": 0.8525252525252526,
+ "grad_norm": 2.095853090286255,
+ "learning_rate": 1.4329966329966332e-05,
+ "loss": 1.5026702880859375,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 6914048.0,
+ "step": 422
+ },
+ {
+ "entropy": 1.7848025560379028,
+ "epoch": 0.8545454545454545,
+ "grad_norm": 1.9265769720077515,
+ "learning_rate": 1.4316498316498317e-05,
+ "loss": 1.8066134452819824,
+ "mean_token_accuracy": 0.5936736464500427,
+ "num_tokens": 6930432.0,
+ "step": 423
+ },
+ {
+ "entropy": 1.4278018474578857,
+ "epoch": 0.8565656565656565,
+ "grad_norm": 1.900985836982727,
+ "learning_rate": 1.4303030303030305e-05,
+ "loss": 1.4045631885528564,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 6946816.0,
+ "step": 424
+ },
+ {
+ "entropy": 1.728216290473938,
+ "epoch": 0.8585858585858586,
+ "grad_norm": 1.952841877937317,
+ "learning_rate": 1.4289562289562291e-05,
+ "loss": 1.728804349899292,
+ "mean_token_accuracy": 0.613031268119812,
+ "num_tokens": 6963200.0,
+ "step": 425
+ },
+ {
+ "entropy": 1.6632241010665894,
+ "epoch": 0.8606060606060606,
+ "grad_norm": 2.187973737716675,
+ "learning_rate": 1.4276094276094276e-05,
+ "loss": 1.6703932285308838,
+ "mean_token_accuracy": 0.6150463819503784,
+ "num_tokens": 6979584.0,
+ "step": 426
+ },
+ {
+ "entropy": 1.761826992034912,
+ "epoch": 0.8626262626262626,
+ "grad_norm": 2.203636646270752,
+ "learning_rate": 1.4262626262626264e-05,
+ "loss": 1.727257490158081,
+ "mean_token_accuracy": 0.5861626863479614,
+ "num_tokens": 6995968.0,
+ "step": 427
+ },
+ {
+ "entropy": 1.4528838396072388,
+ "epoch": 0.8646464646464647,
+ "grad_norm": 1.7967053651809692,
+ "learning_rate": 1.424915824915825e-05,
+ "loss": 1.4786958694458008,
+ "mean_token_accuracy": 0.6589521169662476,
+ "num_tokens": 7012352.0,
+ "step": 428
+ },
+ {
+ "entropy": 1.2221835851669312,
+ "epoch": 0.8666666666666667,
+ "grad_norm": 1.8118345737457275,
+ "learning_rate": 1.4235690235690235e-05,
+ "loss": 1.247727632522583,
+ "mean_token_accuracy": 0.7024303674697876,
+ "num_tokens": 7028736.0,
+ "step": 429
+ },
+ {
+ "entropy": 1.5066863298416138,
+ "epoch": 0.8686868686868687,
+ "grad_norm": 1.8390358686447144,
+ "learning_rate": 1.4222222222222224e-05,
+ "loss": 1.5283207893371582,
+ "mean_token_accuracy": 0.6553493142127991,
+ "num_tokens": 7045120.0,
+ "step": 430
+ },
+ {
+ "entropy": 1.346379041671753,
+ "epoch": 0.8707070707070707,
+ "grad_norm": 2.070962905883789,
+ "learning_rate": 1.420875420875421e-05,
+ "loss": 1.386117935180664,
+ "mean_token_accuracy": 0.6690889000892639,
+ "num_tokens": 7061504.0,
+ "step": 431
+ },
+ {
+ "entropy": 1.8691747188568115,
+ "epoch": 0.8727272727272727,
+ "grad_norm": 1.7868962287902832,
+ "learning_rate": 1.4195286195286198e-05,
+ "loss": 1.9285637140274048,
+ "mean_token_accuracy": 0.5680874586105347,
+ "num_tokens": 7077888.0,
+ "step": 432
+ },
+ {
+ "entropy": 1.8500115871429443,
+ "epoch": 0.8747474747474747,
+ "grad_norm": 1.8853468894958496,
+ "learning_rate": 1.4181818181818183e-05,
+ "loss": 1.8733386993408203,
+ "mean_token_accuracy": 0.5956888198852539,
+ "num_tokens": 7094272.0,
+ "step": 433
+ },
+ {
+ "entropy": 1.3737305402755737,
+ "epoch": 0.8767676767676768,
+ "grad_norm": 1.8363661766052246,
+ "learning_rate": 1.416835016835017e-05,
+ "loss": 1.4020421504974365,
+ "mean_token_accuracy": 0.6723253726959229,
+ "num_tokens": 7110656.0,
+ "step": 434
+ },
+ {
+ "entropy": 1.5069265365600586,
+ "epoch": 0.8787878787878788,
+ "grad_norm": 2.1154301166534424,
+ "learning_rate": 1.4154882154882156e-05,
+ "loss": 1.5137630701065063,
+ "mean_token_accuracy": 0.628724992275238,
+ "num_tokens": 7127040.0,
+ "step": 435
+ },
+ {
+ "entropy": 1.6280715465545654,
+ "epoch": 0.8808080808080808,
+ "grad_norm": 1.9827117919921875,
+ "learning_rate": 1.4141414141414143e-05,
+ "loss": 1.6629055738449097,
+ "mean_token_accuracy": 0.6300684213638306,
+ "num_tokens": 7143424.0,
+ "step": 436
+ },
+ {
+ "entropy": 1.0767987966537476,
+ "epoch": 0.8828282828282829,
+ "grad_norm": 1.8503392934799194,
+ "learning_rate": 1.4127946127946129e-05,
+ "loss": 1.0964105129241943,
+ "mean_token_accuracy": 0.7118954658508301,
+ "num_tokens": 7159808.0,
+ "step": 437
+ },
+ {
+ "entropy": 1.6979929208755493,
+ "epoch": 0.8848484848484849,
+ "grad_norm": 2.114170551300049,
+ "learning_rate": 1.4114478114478116e-05,
+ "loss": 1.7339307069778442,
+ "mean_token_accuracy": 0.6071690320968628,
+ "num_tokens": 7176192.0,
+ "step": 438
+ },
+ {
+ "entropy": 1.840633511543274,
+ "epoch": 0.8868686868686869,
+ "grad_norm": 2.1661946773529053,
+ "learning_rate": 1.4101010101010102e-05,
+ "loss": 1.866344690322876,
+ "mean_token_accuracy": 0.5988031029701233,
+ "num_tokens": 7192576.0,
+ "step": 439
+ },
+ {
+ "entropy": 1.8278590440750122,
+ "epoch": 0.8888888888888888,
+ "grad_norm": 1.9278390407562256,
+ "learning_rate": 1.4087542087542087e-05,
+ "loss": 1.81584632396698,
+ "mean_token_accuracy": 0.5878114104270935,
+ "num_tokens": 7208960.0,
+ "step": 440
+ },
+ {
+ "entropy": 1.405017375946045,
+ "epoch": 0.8909090909090909,
+ "grad_norm": 1.9446384906768799,
+ "learning_rate": 1.4074074074074075e-05,
+ "loss": 1.4040675163269043,
+ "mean_token_accuracy": 0.6647533178329468,
+ "num_tokens": 7225344.0,
+ "step": 441
+ },
+ {
+ "entropy": 1.0967023372650146,
+ "epoch": 0.8929292929292929,
+ "grad_norm": 1.8880785703659058,
+ "learning_rate": 1.4060606060606061e-05,
+ "loss": 1.0798790454864502,
+ "mean_token_accuracy": 0.7167806625366211,
+ "num_tokens": 7241728.0,
+ "step": 442
+ },
+ {
+ "entropy": 1.6126327514648438,
+ "epoch": 0.8949494949494949,
+ "grad_norm": 2.2159016132354736,
+ "learning_rate": 1.404713804713805e-05,
+ "loss": 1.620417833328247,
+ "mean_token_accuracy": 0.6215192675590515,
+ "num_tokens": 7258112.0,
+ "step": 443
+ },
+ {
+ "entropy": 1.4352757930755615,
+ "epoch": 0.896969696969697,
+ "grad_norm": 2.070910692214966,
+ "learning_rate": 1.4033670033670034e-05,
+ "loss": 1.409663200378418,
+ "mean_token_accuracy": 0.658646821975708,
+ "num_tokens": 7274496.0,
+ "step": 444
+ },
+ {
+ "entropy": 1.350129246711731,
+ "epoch": 0.898989898989899,
+ "grad_norm": 1.8672778606414795,
+ "learning_rate": 1.4020202020202021e-05,
+ "loss": 1.3485581874847412,
+ "mean_token_accuracy": 0.6743404865264893,
+ "num_tokens": 7290880.0,
+ "step": 445
+ },
+ {
+ "entropy": 1.0900049209594727,
+ "epoch": 0.901010101010101,
+ "grad_norm": 1.8460185527801514,
+ "learning_rate": 1.4006734006734009e-05,
+ "loss": 1.074802279472351,
+ "mean_token_accuracy": 0.727161705493927,
+ "num_tokens": 7307264.0,
+ "step": 446
+ },
+ {
+ "entropy": 1.6430293321609497,
+ "epoch": 0.9030303030303031,
+ "grad_norm": 2.0190517902374268,
+ "learning_rate": 1.3993265993265994e-05,
+ "loss": 1.6505115032196045,
+ "mean_token_accuracy": 0.6073521971702576,
+ "num_tokens": 7323648.0,
+ "step": 447
+ },
+ {
+ "entropy": 1.465686559677124,
+ "epoch": 0.9050505050505051,
+ "grad_norm": 2.0139927864074707,
+ "learning_rate": 1.397979797979798e-05,
+ "loss": 1.480743408203125,
+ "mean_token_accuracy": 0.6593796014785767,
+ "num_tokens": 7340032.0,
+ "step": 448
+ },
+ {
+ "entropy": 2.152183771133423,
+ "epoch": 0.907070707070707,
+ "grad_norm": 2.2376039028167725,
+ "learning_rate": 1.3966329966329969e-05,
+ "loss": 2.117891788482666,
+ "mean_token_accuracy": 0.5404250025749207,
+ "num_tokens": 7356416.0,
+ "step": 449
+ },
+ {
+ "entropy": 1.6066724061965942,
+ "epoch": 0.9090909090909091,
+ "grad_norm": 1.895409107208252,
+ "learning_rate": 1.3952861952861953e-05,
+ "loss": 1.6247167587280273,
+ "mean_token_accuracy": 0.6281143426895142,
+ "num_tokens": 7372800.0,
+ "step": 450
+ },
+ {
+ "entropy": 1.7240369319915771,
+ "epoch": 0.9111111111111111,
+ "grad_norm": 1.9780583381652832,
+ "learning_rate": 1.3939393939393942e-05,
+ "loss": 1.7521916627883911,
+ "mean_token_accuracy": 0.6022838354110718,
+ "num_tokens": 7389184.0,
+ "step": 451
+ },
+ {
+ "entropy": 1.168492317199707,
+ "epoch": 0.9131313131313131,
+ "grad_norm": 1.676292896270752,
+ "learning_rate": 1.3925925925925928e-05,
+ "loss": 1.1678345203399658,
+ "mean_token_accuracy": 0.7136663198471069,
+ "num_tokens": 7405568.0,
+ "step": 452
+ },
+ {
+ "entropy": 1.4993922710418701,
+ "epoch": 0.9151515151515152,
+ "grad_norm": 2.051370620727539,
+ "learning_rate": 1.3912457912457913e-05,
+ "loss": 1.5273159742355347,
+ "mean_token_accuracy": 0.6378847360610962,
+ "num_tokens": 7421952.0,
+ "step": 453
+ },
+ {
+ "entropy": 1.3478108644485474,
+ "epoch": 0.9171717171717172,
+ "grad_norm": 1.9196240901947021,
+ "learning_rate": 1.3898989898989901e-05,
+ "loss": 1.3547455072402954,
+ "mean_token_accuracy": 0.666829526424408,
+ "num_tokens": 7438336.0,
+ "step": 454
+ },
+ {
+ "entropy": 1.1411141157150269,
+ "epoch": 0.9191919191919192,
+ "grad_norm": 1.9581170082092285,
+ "learning_rate": 1.3885521885521886e-05,
+ "loss": 1.1604664325714111,
+ "mean_token_accuracy": 0.7018197178840637,
+ "num_tokens": 7454720.0,
+ "step": 455
+ },
+ {
+ "entropy": 1.1814258098602295,
+ "epoch": 0.9212121212121213,
+ "grad_norm": 2.005451202392578,
+ "learning_rate": 1.3872053872053872e-05,
+ "loss": 1.1768745183944702,
+ "mean_token_accuracy": 0.7044455409049988,
+ "num_tokens": 7471104.0,
+ "step": 456
+ },
+ {
+ "entropy": 1.335093379020691,
+ "epoch": 0.9232323232323232,
+ "grad_norm": 1.928747534751892,
+ "learning_rate": 1.385858585858586e-05,
+ "loss": 1.3504598140716553,
+ "mean_token_accuracy": 0.6774548292160034,
+ "num_tokens": 7487488.0,
+ "step": 457
+ },
+ {
+ "entropy": 1.6866769790649414,
+ "epoch": 0.9252525252525252,
+ "grad_norm": 1.9078223705291748,
+ "learning_rate": 1.3845117845117845e-05,
+ "loss": 1.688689947128296,
+ "mean_token_accuracy": 0.6077796816825867,
+ "num_tokens": 7503872.0,
+ "step": 458
+ },
+ {
+ "entropy": 1.2842025756835938,
+ "epoch": 0.9272727272727272,
+ "grad_norm": 1.909472942352295,
+ "learning_rate": 1.3831649831649833e-05,
+ "loss": 1.3128941059112549,
+ "mean_token_accuracy": 0.6872252225875854,
+ "num_tokens": 7520256.0,
+ "step": 459
+ },
+ {
+ "entropy": 1.7797539234161377,
+ "epoch": 0.9292929292929293,
+ "grad_norm": 2.246411085128784,
+ "learning_rate": 1.381818181818182e-05,
+ "loss": 1.8016175031661987,
+ "mean_token_accuracy": 0.6049095988273621,
+ "num_tokens": 7536640.0,
+ "step": 460
+ },
+ {
+ "entropy": 1.3464831113815308,
+ "epoch": 0.9313131313131313,
+ "grad_norm": 1.9999858140945435,
+ "learning_rate": 1.3804713804713805e-05,
+ "loss": 1.3523657321929932,
+ "mean_token_accuracy": 0.6787371635437012,
+ "num_tokens": 7553024.0,
+ "step": 461
+ },
+ {
+ "entropy": 1.5901066064834595,
+ "epoch": 0.9333333333333333,
+ "grad_norm": 1.9632524251937866,
+ "learning_rate": 1.3791245791245793e-05,
+ "loss": 1.596254587173462,
+ "mean_token_accuracy": 0.6428309679031372,
+ "num_tokens": 7569408.0,
+ "step": 462
+ },
+ {
+ "entropy": 1.2511993646621704,
+ "epoch": 0.9353535353535354,
+ "grad_norm": 1.7678464651107788,
+ "learning_rate": 1.377777777777778e-05,
+ "loss": 1.254664659500122,
+ "mean_token_accuracy": 0.6981558203697205,
+ "num_tokens": 7585792.0,
+ "step": 463
+ },
+ {
+ "entropy": 1.546912431716919,
+ "epoch": 0.9373737373737374,
+ "grad_norm": 2.0353212356567383,
+ "learning_rate": 1.3764309764309764e-05,
+ "loss": 1.54923677444458,
+ "mean_token_accuracy": 0.6403273344039917,
+ "num_tokens": 7602176.0,
+ "step": 464
+ },
+ {
+ "entropy": 1.6535273790359497,
+ "epoch": 0.9393939393939394,
+ "grad_norm": 2.1584854125976562,
+ "learning_rate": 1.3750841750841752e-05,
+ "loss": 1.6464964151382446,
+ "mean_token_accuracy": 0.6218246221542358,
+ "num_tokens": 7618560.0,
+ "step": 465
+ },
+ {
+ "entropy": 1.1885185241699219,
+ "epoch": 0.9414141414141414,
+ "grad_norm": 1.8068963289260864,
+ "learning_rate": 1.3737373737373739e-05,
+ "loss": 1.1980109214782715,
+ "mean_token_accuracy": 0.6990718245506287,
+ "num_tokens": 7634944.0,
+ "step": 466
+ },
+ {
+ "entropy": 1.2306157350540161,
+ "epoch": 0.9434343434343434,
+ "grad_norm": 1.9044586420059204,
+ "learning_rate": 1.3723905723905725e-05,
+ "loss": 1.2291686534881592,
+ "mean_token_accuracy": 0.6996824741363525,
+ "num_tokens": 7651328.0,
+ "step": 467
+ },
+ {
+ "entropy": 1.2496092319488525,
+ "epoch": 0.9454545454545454,
+ "grad_norm": 1.7264868021011353,
+ "learning_rate": 1.3710437710437712e-05,
+ "loss": 1.2440049648284912,
+ "mean_token_accuracy": 0.6877137422561646,
+ "num_tokens": 7667712.0,
+ "step": 468
+ },
+ {
+ "entropy": 1.8231102228164673,
+ "epoch": 0.9474747474747475,
+ "grad_norm": 2.099104166030884,
+ "learning_rate": 1.3696969696969698e-05,
+ "loss": 1.84971284866333,
+ "mean_token_accuracy": 0.5869565010070801,
+ "num_tokens": 7684096.0,
+ "step": 469
+ },
+ {
+ "entropy": 1.537786841392517,
+ "epoch": 0.9494949494949495,
+ "grad_norm": 1.872962474822998,
+ "learning_rate": 1.3683501683501685e-05,
+ "loss": 1.5448193550109863,
+ "mean_token_accuracy": 0.6465559601783752,
+ "num_tokens": 7700480.0,
+ "step": 470
+ },
+ {
+ "entropy": 1.8270875215530396,
+ "epoch": 0.9515151515151515,
+ "grad_norm": 2.2747695446014404,
+ "learning_rate": 1.3670033670033671e-05,
+ "loss": 1.854095697402954,
+ "mean_token_accuracy": 0.5834758281707764,
+ "num_tokens": 7716864.0,
+ "step": 471
+ },
+ {
+ "entropy": 1.505604863166809,
+ "epoch": 0.9535353535353536,
+ "grad_norm": 1.9903687238693237,
+ "learning_rate": 1.3656565656565656e-05,
+ "loss": 1.5269451141357422,
+ "mean_token_accuracy": 0.6475940346717834,
+ "num_tokens": 7733248.0,
+ "step": 472
+ },
+ {
+ "entropy": 1.8228932619094849,
+ "epoch": 0.9555555555555556,
+ "grad_norm": 2.4003078937530518,
+ "learning_rate": 1.3643097643097644e-05,
+ "loss": 1.846016764640808,
+ "mean_token_accuracy": 0.5900097489356995,
+ "num_tokens": 7749632.0,
+ "step": 473
+ },
+ {
+ "entropy": 1.2786308526992798,
+ "epoch": 0.9575757575757575,
+ "grad_norm": 1.9355131387710571,
+ "learning_rate": 1.362962962962963e-05,
+ "loss": 1.3152062892913818,
+ "mean_token_accuracy": 0.6703712940216064,
+ "num_tokens": 7766016.0,
+ "step": 474
+ },
+ {
+ "entropy": 1.1032856702804565,
+ "epoch": 0.9595959595959596,
+ "grad_norm": 1.7720186710357666,
+ "learning_rate": 1.3616161616161619e-05,
+ "loss": 1.1242918968200684,
+ "mean_token_accuracy": 0.7250854969024658,
+ "num_tokens": 7782400.0,
+ "step": 475
+ },
+ {
+ "entropy": 1.5261021852493286,
+ "epoch": 0.9616161616161616,
+ "grad_norm": 1.8472843170166016,
+ "learning_rate": 1.3602693602693604e-05,
+ "loss": 1.54013991355896,
+ "mean_token_accuracy": 0.6471055150032043,
+ "num_tokens": 7798784.0,
+ "step": 476
+ },
+ {
+ "entropy": 0.9697252511978149,
+ "epoch": 0.9636363636363636,
+ "grad_norm": 1.8871296644210815,
+ "learning_rate": 1.358922558922559e-05,
+ "loss": 0.9874091148376465,
+ "mean_token_accuracy": 0.7430996298789978,
+ "num_tokens": 7815168.0,
+ "step": 477
+ },
+ {
+ "entropy": 1.6003227233886719,
+ "epoch": 0.9656565656565657,
+ "grad_norm": 2.371385097503662,
+ "learning_rate": 1.3575757575757578e-05,
+ "loss": 1.580587387084961,
+ "mean_token_accuracy": 0.6273815631866455,
+ "num_tokens": 7831552.0,
+ "step": 478
+ },
+ {
+ "entropy": 1.556900978088379,
+ "epoch": 0.9676767676767677,
+ "grad_norm": 1.839432954788208,
+ "learning_rate": 1.3562289562289563e-05,
+ "loss": 1.5154083967208862,
+ "mean_token_accuracy": 0.628724992275238,
+ "num_tokens": 7847936.0,
+ "step": 479
+ },
+ {
+ "entropy": 1.2394448518753052,
+ "epoch": 0.9696969696969697,
+ "grad_norm": 1.6638867855072021,
+ "learning_rate": 1.354882154882155e-05,
+ "loss": 1.2016921043395996,
+ "mean_token_accuracy": 0.6991939544677734,
+ "num_tokens": 7864320.0,
+ "step": 480
+ },
+ {
+ "entropy": 1.4200247526168823,
+ "epoch": 0.9717171717171718,
+ "grad_norm": 1.8742305040359497,
+ "learning_rate": 1.3535353535353538e-05,
+ "loss": 1.4267700910568237,
+ "mean_token_accuracy": 0.6604176759719849,
+ "num_tokens": 7880704.0,
+ "step": 481
+ },
+ {
+ "entropy": 2.0156707763671875,
+ "epoch": 0.9737373737373738,
+ "grad_norm": 2.1772451400756836,
+ "learning_rate": 1.3521885521885523e-05,
+ "loss": 2.0306758880615234,
+ "mean_token_accuracy": 0.5579506754875183,
+ "num_tokens": 7897088.0,
+ "step": 482
+ },
+ {
+ "entropy": 1.2802858352661133,
+ "epoch": 0.9757575757575757,
+ "grad_norm": 1.8951549530029297,
+ "learning_rate": 1.3508417508417509e-05,
+ "loss": 1.2761621475219727,
+ "mean_token_accuracy": 0.6825231909751892,
+ "num_tokens": 7913472.0,
+ "step": 483
+ },
+ {
+ "entropy": 1.3758989572525024,
+ "epoch": 0.9777777777777777,
+ "grad_norm": 1.8072963953018188,
+ "learning_rate": 1.3494949494949497e-05,
+ "loss": 1.3532235622406006,
+ "mean_token_accuracy": 0.6749511361122131,
+ "num_tokens": 7929856.0,
+ "step": 484
+ },
+ {
+ "entropy": 1.4488792419433594,
+ "epoch": 0.9797979797979798,
+ "grad_norm": 1.7842215299606323,
+ "learning_rate": 1.3481481481481482e-05,
+ "loss": 1.4513285160064697,
+ "mean_token_accuracy": 0.6539447903633118,
+ "num_tokens": 7946240.0,
+ "step": 485
+ },
+ {
+ "entropy": 1.2957613468170166,
+ "epoch": 0.9818181818181818,
+ "grad_norm": 1.8612068891525269,
+ "learning_rate": 1.346801346801347e-05,
+ "loss": 1.3016514778137207,
+ "mean_token_accuracy": 0.6848436594009399,
+ "num_tokens": 7962624.0,
+ "step": 486
+ },
+ {
+ "entropy": 1.4321255683898926,
+ "epoch": 0.9838383838383838,
+ "grad_norm": 1.7746661901474,
+ "learning_rate": 1.3454545454545455e-05,
+ "loss": 1.4230387210845947,
+ "mean_token_accuracy": 0.664692223072052,
+ "num_tokens": 7979008.0,
+ "step": 487
+ },
+ {
+ "entropy": 1.7615760564804077,
+ "epoch": 0.9858585858585859,
+ "grad_norm": 1.9986366033554077,
+ "learning_rate": 1.3441077441077441e-05,
+ "loss": 1.7871575355529785,
+ "mean_token_accuracy": 0.5994748473167419,
+ "num_tokens": 7995392.0,
+ "step": 488
+ },
+ {
+ "entropy": 1.349948763847351,
+ "epoch": 0.9878787878787879,
+ "grad_norm": 2.0217247009277344,
+ "learning_rate": 1.342760942760943e-05,
+ "loss": 1.352069616317749,
+ "mean_token_accuracy": 0.6762335300445557,
+ "num_tokens": 8011776.0,
+ "step": 489
+ },
+ {
+ "entropy": 1.6317073106765747,
+ "epoch": 0.98989898989899,
+ "grad_norm": 1.9479029178619385,
+ "learning_rate": 1.3414141414141414e-05,
+ "loss": 1.6507500410079956,
+ "mean_token_accuracy": 0.6186492443084717,
+ "num_tokens": 8028160.0,
+ "step": 490
+ },
+ {
+ "entropy": 2.0288875102996826,
+ "epoch": 0.9919191919191919,
+ "grad_norm": 2.1520888805389404,
+ "learning_rate": 1.3400673400673401e-05,
+ "loss": 2.06215500831604,
+ "mean_token_accuracy": 0.5530043840408325,
+ "num_tokens": 8044544.0,
+ "step": 491
+ },
+ {
+ "entropy": 1.8297137022018433,
+ "epoch": 0.9939393939393939,
+ "grad_norm": 1.949404001235962,
+ "learning_rate": 1.3387205387205389e-05,
+ "loss": 1.8859628438949585,
+ "mean_token_accuracy": 0.5876282453536987,
+ "num_tokens": 8060928.0,
+ "step": 492
+ },
+ {
+ "entropy": 1.587094783782959,
+ "epoch": 0.9959595959595959,
+ "grad_norm": 1.9205344915390015,
+ "learning_rate": 1.3373737373737374e-05,
+ "loss": 1.6053454875946045,
+ "mean_token_accuracy": 0.6257938742637634,
+ "num_tokens": 8077312.0,
+ "step": 493
+ },
+ {
+ "entropy": 1.6583648920059204,
+ "epoch": 0.997979797979798,
+ "grad_norm": 1.976946234703064,
+ "learning_rate": 1.3360269360269362e-05,
+ "loss": 1.6656805276870728,
+ "mean_token_accuracy": 0.6186492443084717,
+ "num_tokens": 8093696.0,
+ "step": 494
+ },
+ {
+ "entropy": 1.1685364246368408,
+ "epoch": 1.0,
+ "grad_norm": 1.8258967399597168,
+ "learning_rate": 1.3346801346801349e-05,
+ "loss": 1.165276288986206,
+ "mean_token_accuracy": 0.7082315683364868,
+ "num_tokens": 8110080.0,
+ "step": 495
+ },
+ {
+ "entropy": 1.1211013793945312,
+ "epoch": 1.002020202020202,
+ "grad_norm": 2.27962327003479,
+ "learning_rate": 1.3333333333333333e-05,
+ "loss": 0.9540231227874756,
+ "mean_token_accuracy": 0.747801661491394,
+ "num_tokens": 8126464.0,
+ "step": 496
+ },
+ {
+ "entropy": 1.370996356010437,
+ "epoch": 1.004040404040404,
+ "grad_norm": 2.3193519115448,
+ "learning_rate": 1.3319865319865321e-05,
+ "loss": 1.240065097808838,
+ "mean_token_accuracy": 0.6976062655448914,
+ "num_tokens": 8142848.0,
+ "step": 497
+ },
+ {
+ "entropy": 1.4673359394073486,
+ "epoch": 1.006060606060606,
+ "grad_norm": 2.071213483810425,
+ "learning_rate": 1.3306397306397308e-05,
+ "loss": 1.3351866006851196,
+ "mean_token_accuracy": 0.6921104192733765,
+ "num_tokens": 8159232.0,
+ "step": 498
+ },
+ {
+ "entropy": 1.1151381731033325,
+ "epoch": 1.0080808080808081,
+ "grad_norm": 2.1310431957244873,
+ "learning_rate": 1.3292929292929293e-05,
+ "loss": 1.0092531442642212,
+ "mean_token_accuracy": 0.7261846661567688,
+ "num_tokens": 8175616.0,
+ "step": 499
+ },
+ {
+ "entropy": 1.4734766483306885,
+ "epoch": 1.0101010101010102,
+ "grad_norm": 2.015787124633789,
+ "learning_rate": 1.3279461279461281e-05,
+ "loss": 1.3748562335968018,
+ "mean_token_accuracy": 0.6682339906692505,
+ "num_tokens": 8192000.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.0101010101010102,
+ "eval_entropy": 1.3614274196086391,
+ "eval_loss": 1.5201176404953003,
+ "eval_mean_token_accuracy": 0.647282806134993,
+ "eval_num_tokens": 8192000.0,
+ "eval_runtime": 43.8232,
+ "eval_samples_per_second": 22.591,
+ "eval_steps_per_second": 2.83,
+ "step": 500
+ },
+ {
+ "entropy": 1.3656656742095947,
+ "epoch": 1.0121212121212122,
+ "grad_norm": 2.102975845336914,
+ "learning_rate": 1.3265993265993267e-05,
+ "loss": 1.2834689617156982,
+ "mean_token_accuracy": 0.6831338405609131,
+ "num_tokens": 8208384.0,
+ "step": 501
+ },
+ {
+ "entropy": 1.0829076766967773,
+ "epoch": 1.0141414141414142,
+ "grad_norm": 1.8827977180480957,
+ "learning_rate": 1.3252525252525254e-05,
+ "loss": 1.070042610168457,
+ "mean_token_accuracy": 0.72007817029953,
+ "num_tokens": 8224768.0,
+ "step": 502
+ },
+ {
+ "entropy": 1.2298822402954102,
+ "epoch": 1.0161616161616163,
+ "grad_norm": 1.9913817644119263,
+ "learning_rate": 1.323905723905724e-05,
+ "loss": 1.2619516849517822,
+ "mean_token_accuracy": 0.7024303674697876,
+ "num_tokens": 8241152.0,
+ "step": 503
+ },
+ {
+ "entropy": 0.9216552972793579,
+ "epoch": 1.018181818181818,
+ "grad_norm": 1.8755308389663696,
+ "learning_rate": 1.3225589225589225e-05,
+ "loss": 0.9175798892974854,
+ "mean_token_accuracy": 0.7650830745697021,
+ "num_tokens": 8257536.0,
+ "step": 504
+ },
+ {
+ "entropy": 0.7169107794761658,
+ "epoch": 1.02020202020202,
+ "grad_norm": 2.100609064102173,
+ "learning_rate": 1.3212121212121213e-05,
+ "loss": 0.7609860897064209,
+ "mean_token_accuracy": 0.7913410067558289,
+ "num_tokens": 8273920.0,
+ "step": 505
+ },
+ {
+ "entropy": 1.5552464723587036,
+ "epoch": 1.0222222222222221,
+ "grad_norm": 2.5406126976013184,
+ "learning_rate": 1.31986531986532e-05,
+ "loss": 1.6440303325653076,
+ "mean_token_accuracy": 0.6193820238113403,
+ "num_tokens": 8290304.0,
+ "step": 506
+ },
+ {
+ "entropy": 0.9679869413375854,
+ "epoch": 1.0242424242424242,
+ "grad_norm": 2.2049074172973633,
+ "learning_rate": 1.3185185185185185e-05,
+ "loss": 1.0273747444152832,
+ "mean_token_accuracy": 0.729421079158783,
+ "num_tokens": 8306688.0,
+ "step": 507
+ },
+ {
+ "entropy": 1.5491999387741089,
+ "epoch": 1.0262626262626262,
+ "grad_norm": 2.2690296173095703,
+ "learning_rate": 1.3171717171717173e-05,
+ "loss": 1.6104233264923096,
+ "mean_token_accuracy": 0.6261602640151978,
+ "num_tokens": 8323072.0,
+ "step": 508
+ },
+ {
+ "entropy": 1.157227635383606,
+ "epoch": 1.0282828282828282,
+ "grad_norm": 2.5081140995025635,
+ "learning_rate": 1.315824915824916e-05,
+ "loss": 1.2283058166503906,
+ "mean_token_accuracy": 0.7013311982154846,
+ "num_tokens": 8339456.0,
+ "step": 509
+ },
+ {
+ "entropy": 1.2934587001800537,
+ "epoch": 1.0303030303030303,
+ "grad_norm": 2.0315630435943604,
+ "learning_rate": 1.3144781144781147e-05,
+ "loss": 1.313960075378418,
+ "mean_token_accuracy": 0.6683561205863953,
+ "num_tokens": 8355840.0,
+ "step": 510
+ },
+ {
+ "entropy": 1.058363437652588,
+ "epoch": 1.0323232323232323,
+ "grad_norm": 2.0326106548309326,
+ "learning_rate": 1.3131313131313132e-05,
+ "loss": 1.060279130935669,
+ "mean_token_accuracy": 0.7263678312301636,
+ "num_tokens": 8372224.0,
+ "step": 511
+ },
+ {
+ "entropy": 1.166068196296692,
+ "epoch": 1.0343434343434343,
+ "grad_norm": 1.9384857416152954,
+ "learning_rate": 1.3117845117845119e-05,
+ "loss": 1.1466734409332275,
+ "mean_token_accuracy": 0.7182462215423584,
+ "num_tokens": 8388608.0,
+ "step": 512
+ },
+ {
+ "entropy": 1.1295984983444214,
+ "epoch": 1.0363636363636364,
+ "grad_norm": 2.0500752925872803,
+ "learning_rate": 1.3104377104377107e-05,
+ "loss": 1.1119377613067627,
+ "mean_token_accuracy": 0.7249022722244263,
+ "num_tokens": 8404992.0,
+ "step": 513
+ },
+ {
+ "entropy": 1.2471498250961304,
+ "epoch": 1.0383838383838384,
+ "grad_norm": 2.057642698287964,
+ "learning_rate": 1.3090909090909092e-05,
+ "loss": 1.2348787784576416,
+ "mean_token_accuracy": 0.69840008020401,
+ "num_tokens": 8421376.0,
+ "step": 514
+ },
+ {
+ "entropy": 1.2146048545837402,
+ "epoch": 1.0404040404040404,
+ "grad_norm": 1.8724642992019653,
+ "learning_rate": 1.3077441077441078e-05,
+ "loss": 1.1992437839508057,
+ "mean_token_accuracy": 0.7179408669471741,
+ "num_tokens": 8437760.0,
+ "step": 515
+ },
+ {
+ "entropy": 1.119163990020752,
+ "epoch": 1.0424242424242425,
+ "grad_norm": 2.013307571411133,
+ "learning_rate": 1.3063973063973066e-05,
+ "loss": 1.0880366563796997,
+ "mean_token_accuracy": 0.7274059653282166,
+ "num_tokens": 8454144.0,
+ "step": 516
+ },
+ {
+ "entropy": 1.055690884590149,
+ "epoch": 1.0444444444444445,
+ "grad_norm": 2.9534032344818115,
+ "learning_rate": 1.3050505050505051e-05,
+ "loss": 1.0625638961791992,
+ "mean_token_accuracy": 0.7302759885787964,
+ "num_tokens": 8470528.0,
+ "step": 517
+ },
+ {
+ "entropy": 1.629905343055725,
+ "epoch": 1.0464646464646465,
+ "grad_norm": 1.9111285209655762,
+ "learning_rate": 1.303703703703704e-05,
+ "loss": 1.642975926399231,
+ "mean_token_accuracy": 0.638067901134491,
+ "num_tokens": 8486912.0,
+ "step": 518
+ },
+ {
+ "entropy": 1.2197786569595337,
+ "epoch": 1.0484848484848486,
+ "grad_norm": 2.0819573402404785,
+ "learning_rate": 1.3023569023569024e-05,
+ "loss": 1.178088903427124,
+ "mean_token_accuracy": 0.7040180563926697,
+ "num_tokens": 8503296.0,
+ "step": 519
+ },
+ {
+ "entropy": 1.4044541120529175,
+ "epoch": 1.0505050505050506,
+ "grad_norm": 9.860201835632324,
+ "learning_rate": 1.301010101010101e-05,
+ "loss": 1.6388373374938965,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 8519680.0,
+ "step": 520
+ },
+ {
+ "entropy": 0.9115698337554932,
+ "epoch": 1.0525252525252524,
+ "grad_norm": 2.1228489875793457,
+ "learning_rate": 1.2996632996632999e-05,
+ "loss": 0.8868257999420166,
+ "mean_token_accuracy": 0.7558622360229492,
+ "num_tokens": 8536064.0,
+ "step": 521
+ },
+ {
+ "entropy": 1.0348355770111084,
+ "epoch": 1.0545454545454545,
+ "grad_norm": 1.8459810018539429,
+ "learning_rate": 1.2983164983164984e-05,
+ "loss": 1.0149322748184204,
+ "mean_token_accuracy": 0.7421836853027344,
+ "num_tokens": 8552448.0,
+ "step": 522
+ },
+ {
+ "entropy": 1.0639865398406982,
+ "epoch": 1.0565656565656565,
+ "grad_norm": 2.0999417304992676,
+ "learning_rate": 1.296969696969697e-05,
+ "loss": 1.0582343339920044,
+ "mean_token_accuracy": 0.7242916226387024,
+ "num_tokens": 8568832.0,
+ "step": 523
+ },
+ {
+ "entropy": 1.2032114267349243,
+ "epoch": 1.0585858585858585,
+ "grad_norm": 2.0500640869140625,
+ "learning_rate": 1.2956228956228958e-05,
+ "loss": 1.2051773071289062,
+ "mean_token_accuracy": 0.7076819539070129,
+ "num_tokens": 8585216.0,
+ "step": 524
+ },
+ {
+ "entropy": 1.2425649166107178,
+ "epoch": 1.0606060606060606,
+ "grad_norm": 2.1104960441589355,
+ "learning_rate": 1.2942760942760943e-05,
+ "loss": 1.2576614618301392,
+ "mean_token_accuracy": 0.6907669901847839,
+ "num_tokens": 8601600.0,
+ "step": 525
+ },
+ {
+ "entropy": 1.2280266284942627,
+ "epoch": 1.0626262626262626,
+ "grad_norm": 2.0641212463378906,
+ "learning_rate": 1.2929292929292931e-05,
+ "loss": 1.2378020286560059,
+ "mean_token_accuracy": 0.6943697929382324,
+ "num_tokens": 8617984.0,
+ "step": 526
+ },
+ {
+ "entropy": 0.9312539100646973,
+ "epoch": 1.0646464646464646,
+ "grad_norm": 2.0006070137023926,
+ "learning_rate": 1.2915824915824918e-05,
+ "loss": 0.952136754989624,
+ "mean_token_accuracy": 0.7538471221923828,
+ "num_tokens": 8634368.0,
+ "step": 527
+ },
+ {
+ "entropy": 1.5708260536193848,
+ "epoch": 1.0666666666666667,
+ "grad_norm": 1.873006820678711,
+ "learning_rate": 1.2902356902356902e-05,
+ "loss": 1.5705666542053223,
+ "mean_token_accuracy": 0.6449071764945984,
+ "num_tokens": 8650752.0,
+ "step": 528
+ },
+ {
+ "entropy": 0.9064179062843323,
+ "epoch": 1.0686868686868687,
+ "grad_norm": 2.109816551208496,
+ "learning_rate": 1.288888888888889e-05,
+ "loss": 0.9165636301040649,
+ "mean_token_accuracy": 0.754824161529541,
+ "num_tokens": 8667136.0,
+ "step": 529
+ },
+ {
+ "entropy": 1.4197264909744263,
+ "epoch": 1.0707070707070707,
+ "grad_norm": 2.2213833332061768,
+ "learning_rate": 1.2875420875420877e-05,
+ "loss": 1.4330552816390991,
+ "mean_token_accuracy": 0.6589521169662476,
+ "num_tokens": 8683520.0,
+ "step": 530
+ },
+ {
+ "entropy": 1.3674145936965942,
+ "epoch": 1.0727272727272728,
+ "grad_norm": 2.2046334743499756,
+ "learning_rate": 1.2861952861952862e-05,
+ "loss": 1.3838258981704712,
+ "mean_token_accuracy": 0.6660356521606445,
+ "num_tokens": 8699904.0,
+ "step": 531
+ },
+ {
+ "entropy": 1.0396678447723389,
+ "epoch": 1.0747474747474748,
+ "grad_norm": 1.9246002435684204,
+ "learning_rate": 1.284848484848485e-05,
+ "loss": 1.0304534435272217,
+ "mean_token_accuracy": 0.7421836853027344,
+ "num_tokens": 8716288.0,
+ "step": 532
+ },
+ {
+ "entropy": 0.8541752696037292,
+ "epoch": 1.0767676767676768,
+ "grad_norm": 1.9644383192062378,
+ "learning_rate": 1.2835016835016837e-05,
+ "loss": 0.8437563180923462,
+ "mean_token_accuracy": 0.7683805823326111,
+ "num_tokens": 8732672.0,
+ "step": 533
+ },
+ {
+ "entropy": 0.962359607219696,
+ "epoch": 1.0787878787878789,
+ "grad_norm": 1.8767060041427612,
+ "learning_rate": 1.2821548821548821e-05,
+ "loss": 0.9354047775268555,
+ "mean_token_accuracy": 0.7493893504142761,
+ "num_tokens": 8749056.0,
+ "step": 534
+ },
+ {
+ "entropy": 1.1609500646591187,
+ "epoch": 1.0808080808080809,
+ "grad_norm": 2.316633939743042,
+ "learning_rate": 1.280808080808081e-05,
+ "loss": 1.1338696479797363,
+ "mean_token_accuracy": 0.7132388949394226,
+ "num_tokens": 8765440.0,
+ "step": 535
+ },
+ {
+ "entropy": 0.9635956883430481,
+ "epoch": 1.082828282828283,
+ "grad_norm": 1.8842763900756836,
+ "learning_rate": 1.2794612794612794e-05,
+ "loss": 0.9779557585716248,
+ "mean_token_accuracy": 0.7515876889228821,
+ "num_tokens": 8781824.0,
+ "step": 536
+ },
+ {
+ "entropy": 1.5283102989196777,
+ "epoch": 1.084848484848485,
+ "grad_norm": 2.2277283668518066,
+ "learning_rate": 1.2781144781144783e-05,
+ "loss": 1.5118470191955566,
+ "mean_token_accuracy": 0.6464338302612305,
+ "num_tokens": 8798208.0,
+ "step": 537
+ },
+ {
+ "entropy": 1.1301655769348145,
+ "epoch": 1.0868686868686868,
+ "grad_norm": 2.0282225608825684,
+ "learning_rate": 1.2767676767676769e-05,
+ "loss": 1.0959392786026,
+ "mean_token_accuracy": 0.7204445600509644,
+ "num_tokens": 8814592.0,
+ "step": 538
+ },
+ {
+ "entropy": 1.3107094764709473,
+ "epoch": 1.0888888888888888,
+ "grad_norm": 1.9527665376663208,
+ "learning_rate": 1.2754208754208754e-05,
+ "loss": 1.2717593908309937,
+ "mean_token_accuracy": 0.6916218996047974,
+ "num_tokens": 8830976.0,
+ "step": 539
+ },
+ {
+ "entropy": 1.3232251405715942,
+ "epoch": 1.0909090909090908,
+ "grad_norm": 2.134962320327759,
+ "learning_rate": 1.2740740740740742e-05,
+ "loss": 1.3589959144592285,
+ "mean_token_accuracy": 0.6701880693435669,
+ "num_tokens": 8847360.0,
+ "step": 540
+ },
+ {
+ "entropy": 1.5372718572616577,
+ "epoch": 1.0929292929292929,
+ "grad_norm": 1.8864489793777466,
+ "learning_rate": 1.2727272727272728e-05,
+ "loss": 1.5291733741760254,
+ "mean_token_accuracy": 0.6487542986869812,
+ "num_tokens": 8863744.0,
+ "step": 541
+ },
+ {
+ "entropy": 1.2037636041641235,
+ "epoch": 1.094949494949495,
+ "grad_norm": 1.8530166149139404,
+ "learning_rate": 1.2713804713804713e-05,
+ "loss": 1.1905983686447144,
+ "mean_token_accuracy": 0.6986443400382996,
+ "num_tokens": 8880128.0,
+ "step": 542
+ },
+ {
+ "entropy": 1.256689429283142,
+ "epoch": 1.096969696969697,
+ "grad_norm": 1.9364465475082397,
+ "learning_rate": 1.2700336700336701e-05,
+ "loss": 1.275427222251892,
+ "mean_token_accuracy": 0.689728856086731,
+ "num_tokens": 8896512.0,
+ "step": 543
+ },
+ {
+ "entropy": 1.154582142829895,
+ "epoch": 1.098989898989899,
+ "grad_norm": 2.097226619720459,
+ "learning_rate": 1.2686868686868688e-05,
+ "loss": 1.1638195514678955,
+ "mean_token_accuracy": 0.7220322489738464,
+ "num_tokens": 8912896.0,
+ "step": 544
+ },
+ {
+ "entropy": 1.3060903549194336,
+ "epoch": 1.101010101010101,
+ "grad_norm": 2.1401753425598145,
+ "learning_rate": 1.2673400673400676e-05,
+ "loss": 1.337110996246338,
+ "mean_token_accuracy": 0.6781876087188721,
+ "num_tokens": 8929280.0,
+ "step": 545
+ },
+ {
+ "entropy": 1.2550262212753296,
+ "epoch": 1.103030303030303,
+ "grad_norm": 1.8216264247894287,
+ "learning_rate": 1.2659932659932661e-05,
+ "loss": 1.2674927711486816,
+ "mean_token_accuracy": 0.6860649585723877,
+ "num_tokens": 8945664.0,
+ "step": 546
+ },
+ {
+ "entropy": 1.1487771272659302,
+ "epoch": 1.105050505050505,
+ "grad_norm": 1.8050950765609741,
+ "learning_rate": 1.2646464646464647e-05,
+ "loss": 1.1384658813476562,
+ "mean_token_accuracy": 0.734245240688324,
+ "num_tokens": 8962048.0,
+ "step": 547
+ },
+ {
+ "entropy": 1.2411508560180664,
+ "epoch": 1.107070707070707,
+ "grad_norm": 2.0532772541046143,
+ "learning_rate": 1.2632996632996634e-05,
+ "loss": 1.2501752376556396,
+ "mean_token_accuracy": 0.7154982686042786,
+ "num_tokens": 8978432.0,
+ "step": 548
+ },
+ {
+ "entropy": 1.383638620376587,
+ "epoch": 1.1090909090909091,
+ "grad_norm": 1.9422906637191772,
+ "learning_rate": 1.261952861952862e-05,
+ "loss": 1.4019615650177002,
+ "mean_token_accuracy": 0.677760124206543,
+ "num_tokens": 8994816.0,
+ "step": 549
+ },
+ {
+ "entropy": 1.302299976348877,
+ "epoch": 1.1111111111111112,
+ "grad_norm": 2.008962869644165,
+ "learning_rate": 1.2606060606060607e-05,
+ "loss": 1.2934541702270508,
+ "mean_token_accuracy": 0.7078040838241577,
+ "num_tokens": 9011200.0,
+ "step": 550
+ },
+ {
+ "entropy": 1.2423378229141235,
+ "epoch": 1.1131313131313132,
+ "grad_norm": 1.9461158514022827,
+ "learning_rate": 1.2592592592592593e-05,
+ "loss": 1.241358995437622,
+ "mean_token_accuracy": 0.7046898007392883,
+ "num_tokens": 9027584.0,
+ "step": 551
+ },
+ {
+ "entropy": 1.3034340143203735,
+ "epoch": 1.1151515151515152,
+ "grad_norm": 1.8627954721450806,
+ "learning_rate": 1.257912457912458e-05,
+ "loss": 1.3082997798919678,
+ "mean_token_accuracy": 0.6942476630210876,
+ "num_tokens": 9043968.0,
+ "step": 552
+ },
+ {
+ "entropy": 1.2468732595443726,
+ "epoch": 1.1171717171717173,
+ "grad_norm": 1.8033503293991089,
+ "learning_rate": 1.2565656565656568e-05,
+ "loss": 1.2398372888565063,
+ "mean_token_accuracy": 0.7059721350669861,
+ "num_tokens": 9060352.0,
+ "step": 553
+ },
+ {
+ "entropy": 1.3763928413391113,
+ "epoch": 1.1191919191919193,
+ "grad_norm": 2.109393358230591,
+ "learning_rate": 1.2552188552188553e-05,
+ "loss": 1.3908042907714844,
+ "mean_token_accuracy": 0.6643258333206177,
+ "num_tokens": 9076736.0,
+ "step": 554
+ },
+ {
+ "entropy": 1.0741946697235107,
+ "epoch": 1.121212121212121,
+ "grad_norm": 1.9498950242996216,
+ "learning_rate": 1.253872053872054e-05,
+ "loss": 1.0534818172454834,
+ "mean_token_accuracy": 0.7283830046653748,
+ "num_tokens": 9093120.0,
+ "step": 555
+ },
+ {
+ "entropy": 1.2464348077774048,
+ "epoch": 1.1232323232323231,
+ "grad_norm": 1.7962212562561035,
+ "learning_rate": 1.2525252525252527e-05,
+ "loss": 1.225571632385254,
+ "mean_token_accuracy": 0.695652186870575,
+ "num_tokens": 9109504.0,
+ "step": 556
+ },
+ {
+ "entropy": 1.1979366540908813,
+ "epoch": 1.1252525252525252,
+ "grad_norm": 2.0588653087615967,
+ "learning_rate": 1.2511784511784512e-05,
+ "loss": 1.1866135597229004,
+ "mean_token_accuracy": 0.705422580242157,
+ "num_tokens": 9125888.0,
+ "step": 557
+ },
+ {
+ "entropy": 0.9303950071334839,
+ "epoch": 1.1272727272727272,
+ "grad_norm": 1.8577561378479004,
+ "learning_rate": 1.2498316498316499e-05,
+ "loss": 0.9317413568496704,
+ "mean_token_accuracy": 0.7565950155258179,
+ "num_tokens": 9142272.0,
+ "step": 558
+ },
+ {
+ "entropy": 0.857255756855011,
+ "epoch": 1.1292929292929292,
+ "grad_norm": 1.8342596292495728,
+ "learning_rate": 1.2484848484848487e-05,
+ "loss": 0.8612891435623169,
+ "mean_token_accuracy": 0.7796775698661804,
+ "num_tokens": 9158656.0,
+ "step": 559
+ },
+ {
+ "entropy": 0.928502082824707,
+ "epoch": 1.1313131313131313,
+ "grad_norm": 1.9290180206298828,
+ "learning_rate": 1.2471380471380472e-05,
+ "loss": 0.9316297769546509,
+ "mean_token_accuracy": 0.7509160041809082,
+ "num_tokens": 9175040.0,
+ "step": 560
+ },
+ {
+ "entropy": 1.4019330739974976,
+ "epoch": 1.1333333333333333,
+ "grad_norm": 2.1189591884613037,
+ "learning_rate": 1.245791245791246e-05,
+ "loss": 1.3917508125305176,
+ "mean_token_accuracy": 0.6691499948501587,
+ "num_tokens": 9191424.0,
+ "step": 561
+ },
+ {
+ "entropy": 1.4660407304763794,
+ "epoch": 1.1353535353535353,
+ "grad_norm": 2.417506217956543,
+ "learning_rate": 1.2444444444444446e-05,
+ "loss": 1.4893054962158203,
+ "mean_token_accuracy": 0.6543111801147461,
+ "num_tokens": 9207808.0,
+ "step": 562
+ },
+ {
+ "entropy": 1.4580096006393433,
+ "epoch": 1.1373737373737374,
+ "grad_norm": 2.1689300537109375,
+ "learning_rate": 1.2430976430976431e-05,
+ "loss": 1.498686671257019,
+ "mean_token_accuracy": 0.6479604244232178,
+ "num_tokens": 9224192.0,
+ "step": 563
+ },
+ {
+ "entropy": 1.5781100988388062,
+ "epoch": 1.1393939393939394,
+ "grad_norm": 1.9947389364242554,
+ "learning_rate": 1.241750841750842e-05,
+ "loss": 1.604151725769043,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 9240576.0,
+ "step": 564
+ },
+ {
+ "entropy": 0.898691713809967,
+ "epoch": 1.1414141414141414,
+ "grad_norm": 2.0886003971099854,
+ "learning_rate": 1.2404040404040406e-05,
+ "loss": 0.9051169157028198,
+ "mean_token_accuracy": 0.7479848265647888,
+ "num_tokens": 9256960.0,
+ "step": 565
+ },
+ {
+ "entropy": 1.2837234735488892,
+ "epoch": 1.1434343434343435,
+ "grad_norm": 2.1896820068359375,
+ "learning_rate": 1.239057239057239e-05,
+ "loss": 1.2775177955627441,
+ "mean_token_accuracy": 0.6811187267303467,
+ "num_tokens": 9273344.0,
+ "step": 566
+ },
+ {
+ "entropy": 1.1134051084518433,
+ "epoch": 1.1454545454545455,
+ "grad_norm": 1.883119821548462,
+ "learning_rate": 1.2377104377104379e-05,
+ "loss": 1.1263504028320312,
+ "mean_token_accuracy": 0.7154982686042786,
+ "num_tokens": 9289728.0,
+ "step": 567
+ },
+ {
+ "entropy": 1.1212451457977295,
+ "epoch": 1.1474747474747475,
+ "grad_norm": 2.0665414333343506,
+ "learning_rate": 1.2363636363636364e-05,
+ "loss": 1.1123074293136597,
+ "mean_token_accuracy": 0.7117122411727905,
+ "num_tokens": 9306112.0,
+ "step": 568
+ },
+ {
+ "entropy": 1.1619912385940552,
+ "epoch": 1.1494949494949496,
+ "grad_norm": 1.986931562423706,
+ "learning_rate": 1.2350168350168352e-05,
+ "loss": 1.133022665977478,
+ "mean_token_accuracy": 0.7123839855194092,
+ "num_tokens": 9322496.0,
+ "step": 569
+ },
+ {
+ "entropy": 1.433761477470398,
+ "epoch": 1.1515151515151516,
+ "grad_norm": 1.8984476327896118,
+ "learning_rate": 1.2336700336700338e-05,
+ "loss": 1.434887170791626,
+ "mean_token_accuracy": 0.6634098887443542,
+ "num_tokens": 9338880.0,
+ "step": 570
+ },
+ {
+ "entropy": 1.2688939571380615,
+ "epoch": 1.1535353535353536,
+ "grad_norm": 1.9783724546432495,
+ "learning_rate": 1.2323232323232323e-05,
+ "loss": 1.2475486993789673,
+ "mean_token_accuracy": 0.7003541588783264,
+ "num_tokens": 9355264.0,
+ "step": 571
+ },
+ {
+ "entropy": 1.3158199787139893,
+ "epoch": 1.1555555555555554,
+ "grad_norm": 2.1993207931518555,
+ "learning_rate": 1.2309764309764311e-05,
+ "loss": 1.2641775608062744,
+ "mean_token_accuracy": 0.6900342106819153,
+ "num_tokens": 9371648.0,
+ "step": 572
+ },
+ {
+ "entropy": 1.5717110633850098,
+ "epoch": 1.1575757575757575,
+ "grad_norm": 2.0973942279815674,
+ "learning_rate": 1.2296296296296298e-05,
+ "loss": 1.5607821941375732,
+ "mean_token_accuracy": 0.6434416174888611,
+ "num_tokens": 9388032.0,
+ "step": 573
+ },
+ {
+ "entropy": 1.1339603662490845,
+ "epoch": 1.1595959595959595,
+ "grad_norm": 2.1611239910125732,
+ "learning_rate": 1.2282828282828282e-05,
+ "loss": 1.1485066413879395,
+ "mean_token_accuracy": 0.7079262137413025,
+ "num_tokens": 9404416.0,
+ "step": 574
+ },
+ {
+ "entropy": 0.7215157151222229,
+ "epoch": 1.1616161616161615,
+ "grad_norm": 1.7199064493179321,
+ "learning_rate": 1.226936026936027e-05,
+ "loss": 0.6996407508850098,
+ "mean_token_accuracy": 0.8110039234161377,
+ "num_tokens": 9420800.0,
+ "step": 575
+ },
+ {
+ "entropy": 1.207773208618164,
+ "epoch": 1.1636363636363636,
+ "grad_norm": 1.9363049268722534,
+ "learning_rate": 1.2255892255892257e-05,
+ "loss": 1.2100518941879272,
+ "mean_token_accuracy": 0.6953468322753906,
+ "num_tokens": 9437184.0,
+ "step": 576
+ },
+ {
+ "entropy": 1.1832739114761353,
+ "epoch": 1.1656565656565656,
+ "grad_norm": 1.9463727474212646,
+ "learning_rate": 1.2242424242424242e-05,
+ "loss": 1.1800014972686768,
+ "mean_token_accuracy": 0.7148265838623047,
+ "num_tokens": 9453568.0,
+ "step": 577
+ },
+ {
+ "entropy": 0.969874918460846,
+ "epoch": 1.1676767676767676,
+ "grad_norm": 1.9776639938354492,
+ "learning_rate": 1.222895622895623e-05,
+ "loss": 0.9835254549980164,
+ "mean_token_accuracy": 0.7401074767112732,
+ "num_tokens": 9469952.0,
+ "step": 578
+ },
+ {
+ "entropy": 1.2477227449417114,
+ "epoch": 1.1696969696969697,
+ "grad_norm": 2.054093599319458,
+ "learning_rate": 1.2215488215488217e-05,
+ "loss": 1.2632465362548828,
+ "mean_token_accuracy": 0.6811797618865967,
+ "num_tokens": 9486336.0,
+ "step": 579
+ },
+ {
+ "entropy": 1.3652271032333374,
+ "epoch": 1.1717171717171717,
+ "grad_norm": 2.033511161804199,
+ "learning_rate": 1.2202020202020203e-05,
+ "loss": 1.3719289302825928,
+ "mean_token_accuracy": 0.6808744668960571,
+ "num_tokens": 9502720.0,
+ "step": 580
+ },
+ {
+ "entropy": 1.0066897869110107,
+ "epoch": 1.1737373737373737,
+ "grad_norm": 1.906139612197876,
+ "learning_rate": 1.218855218855219e-05,
+ "loss": 1.0317155122756958,
+ "mean_token_accuracy": 0.7470688819885254,
+ "num_tokens": 9519104.0,
+ "step": 581
+ },
+ {
+ "entropy": 1.1423532962799072,
+ "epoch": 1.1757575757575758,
+ "grad_norm": 2.0951437950134277,
+ "learning_rate": 1.2175084175084176e-05,
+ "loss": 1.1328619718551636,
+ "mean_token_accuracy": 0.7098802924156189,
+ "num_tokens": 9535488.0,
+ "step": 582
+ },
+ {
+ "entropy": 0.9396458864212036,
+ "epoch": 1.1777777777777778,
+ "grad_norm": 2.001469373703003,
+ "learning_rate": 1.2161616161616162e-05,
+ "loss": 0.9508752822875977,
+ "mean_token_accuracy": 0.7453590631484985,
+ "num_tokens": 9551872.0,
+ "step": 583
+ },
+ {
+ "entropy": 1.2478508949279785,
+ "epoch": 1.1797979797979798,
+ "grad_norm": 2.1304337978363037,
+ "learning_rate": 1.2148148148148149e-05,
+ "loss": 1.2533063888549805,
+ "mean_token_accuracy": 0.6894235610961914,
+ "num_tokens": 9568256.0,
+ "step": 584
+ },
+ {
+ "entropy": 0.8429924249649048,
+ "epoch": 1.1818181818181819,
+ "grad_norm": 1.891184687614441,
+ "learning_rate": 1.2134680134680134e-05,
+ "loss": 0.8334753513336182,
+ "mean_token_accuracy": 0.7737542986869812,
+ "num_tokens": 9584640.0,
+ "step": 585
+ },
+ {
+ "entropy": 1.1487921476364136,
+ "epoch": 1.183838383838384,
+ "grad_norm": 2.100118637084961,
+ "learning_rate": 1.2121212121212122e-05,
+ "loss": 1.1393694877624512,
+ "mean_token_accuracy": 0.7046287059783936,
+ "num_tokens": 9601024.0,
+ "step": 586
+ },
+ {
+ "entropy": 1.406325101852417,
+ "epoch": 1.185858585858586,
+ "grad_norm": 2.0391998291015625,
+ "learning_rate": 1.2107744107744108e-05,
+ "loss": 1.395864725112915,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 9617408.0,
+ "step": 587
+ },
+ {
+ "entropy": 1.192980170249939,
+ "epoch": 1.187878787878788,
+ "grad_norm": 2.105341911315918,
+ "learning_rate": 1.2094276094276097e-05,
+ "loss": 1.2203993797302246,
+ "mean_token_accuracy": 0.6992549896240234,
+ "num_tokens": 9633792.0,
+ "step": 588
+ },
+ {
+ "entropy": 1.4770102500915527,
+ "epoch": 1.1898989898989898,
+ "grad_norm": 1.959194302558899,
+ "learning_rate": 1.2080808080808081e-05,
+ "loss": 1.4826602935791016,
+ "mean_token_accuracy": 0.6475329995155334,
+ "num_tokens": 9650176.0,
+ "step": 589
+ },
+ {
+ "entropy": 1.440915584564209,
+ "epoch": 1.1919191919191918,
+ "grad_norm": 2.2827632427215576,
+ "learning_rate": 1.2067340067340068e-05,
+ "loss": 1.4349164962768555,
+ "mean_token_accuracy": 0.6570591330528259,
+ "num_tokens": 9666560.0,
+ "step": 590
+ },
+ {
+ "entropy": 0.9503017067909241,
+ "epoch": 1.1939393939393939,
+ "grad_norm": 1.8947645425796509,
+ "learning_rate": 1.2053872053872056e-05,
+ "loss": 0.9562087655067444,
+ "mean_token_accuracy": 0.7511602640151978,
+ "num_tokens": 9682944.0,
+ "step": 591
+ },
+ {
+ "entropy": 0.935599148273468,
+ "epoch": 1.195959595959596,
+ "grad_norm": 1.8788244724273682,
+ "learning_rate": 1.2040404040404041e-05,
+ "loss": 0.9235643148422241,
+ "mean_token_accuracy": 0.7525647282600403,
+ "num_tokens": 9699328.0,
+ "step": 592
+ },
+ {
+ "entropy": 1.3421721458435059,
+ "epoch": 1.197979797979798,
+ "grad_norm": 2.038698673248291,
+ "learning_rate": 1.2026936026936027e-05,
+ "loss": 1.3459725379943848,
+ "mean_token_accuracy": 0.6803248524665833,
+ "num_tokens": 9715712.0,
+ "step": 593
+ },
+ {
+ "entropy": 1.4244537353515625,
+ "epoch": 1.2,
+ "grad_norm": 2.0669443607330322,
+ "learning_rate": 1.2013468013468016e-05,
+ "loss": 1.462540626525879,
+ "mean_token_accuracy": 0.6539447903633118,
+ "num_tokens": 9732096.0,
+ "step": 594
+ },
+ {
+ "entropy": 1.3264589309692383,
+ "epoch": 1.202020202020202,
+ "grad_norm": 2.2563624382019043,
+ "learning_rate": 1.2e-05,
+ "loss": 1.3387104272842407,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 9748480.0,
+ "step": 595
+ },
+ {
+ "entropy": 1.250544548034668,
+ "epoch": 1.204040404040404,
+ "grad_norm": 1.9611469507217407,
+ "learning_rate": 1.1986531986531988e-05,
+ "loss": 1.2569901943206787,
+ "mean_token_accuracy": 0.6947361826896667,
+ "num_tokens": 9764864.0,
+ "step": 596
+ },
+ {
+ "entropy": 1.3189572095870972,
+ "epoch": 1.206060606060606,
+ "grad_norm": 1.9136087894439697,
+ "learning_rate": 1.1973063973063975e-05,
+ "loss": 1.3251599073410034,
+ "mean_token_accuracy": 0.6856985688209534,
+ "num_tokens": 9781248.0,
+ "step": 597
+ },
+ {
+ "entropy": 1.1400903463363647,
+ "epoch": 1.208080808080808,
+ "grad_norm": 1.9812469482421875,
+ "learning_rate": 1.195959595959596e-05,
+ "loss": 1.1514993906021118,
+ "mean_token_accuracy": 0.7175744771957397,
+ "num_tokens": 9797632.0,
+ "step": 598
+ },
+ {
+ "entropy": 1.263106346130371,
+ "epoch": 1.2101010101010101,
+ "grad_norm": 2.1461827754974365,
+ "learning_rate": 1.1946127946127948e-05,
+ "loss": 1.2711405754089355,
+ "mean_token_accuracy": 0.6880801320075989,
+ "num_tokens": 9814016.0,
+ "step": 599
+ },
+ {
+ "entropy": 1.1541659832000732,
+ "epoch": 1.2121212121212122,
+ "grad_norm": 1.8964859247207642,
+ "learning_rate": 1.1932659932659933e-05,
+ "loss": 1.1726963520050049,
+ "mean_token_accuracy": 0.7143380641937256,
+ "num_tokens": 9830400.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.2121212121212122,
+ "eval_entropy": 1.3044754386909547,
+ "eval_loss": 1.5363746881484985,
+ "eval_mean_token_accuracy": 0.6458704312962871,
+ "eval_num_tokens": 9830400.0,
+ "eval_runtime": 43.9189,
+ "eval_samples_per_second": 22.542,
+ "eval_steps_per_second": 2.823,
+ "step": 600
+ },
+ {
+ "entropy": 1.4692459106445312,
+ "epoch": 1.2141414141414142,
+ "grad_norm": 1.9165432453155518,
+ "learning_rate": 1.191919191919192e-05,
+ "loss": 1.444916009902954,
+ "mean_token_accuracy": 0.6709208488464355,
+ "num_tokens": 9846784.0,
+ "step": 601
+ },
+ {
+ "entropy": 1.2140837907791138,
+ "epoch": 1.2161616161616162,
+ "grad_norm": 2.184677839279175,
+ "learning_rate": 1.1905723905723907e-05,
+ "loss": 1.1810932159423828,
+ "mean_token_accuracy": 0.7119565010070801,
+ "num_tokens": 9863168.0,
+ "step": 602
+ },
+ {
+ "entropy": 1.2266523838043213,
+ "epoch": 1.2181818181818183,
+ "grad_norm": 2.0835864543914795,
+ "learning_rate": 1.1892255892255892e-05,
+ "loss": 1.216700792312622,
+ "mean_token_accuracy": 0.702125072479248,
+ "num_tokens": 9879552.0,
+ "step": 603
+ },
+ {
+ "entropy": 1.153336524963379,
+ "epoch": 1.2202020202020203,
+ "grad_norm": 1.959340214729309,
+ "learning_rate": 1.187878787878788e-05,
+ "loss": 1.1497607231140137,
+ "mean_token_accuracy": 0.7254518866539001,
+ "num_tokens": 9895936.0,
+ "step": 604
+ },
+ {
+ "entropy": 1.1328232288360596,
+ "epoch": 1.2222222222222223,
+ "grad_norm": 2.165703773498535,
+ "learning_rate": 1.1865319865319867e-05,
+ "loss": 1.1248265504837036,
+ "mean_token_accuracy": 0.7068881392478943,
+ "num_tokens": 9912320.0,
+ "step": 605
+ },
+ {
+ "entropy": 1.0859829187393188,
+ "epoch": 1.2242424242424241,
+ "grad_norm": 2.0244224071502686,
+ "learning_rate": 1.1851851851851852e-05,
+ "loss": 1.0981967449188232,
+ "mean_token_accuracy": 0.717391312122345,
+ "num_tokens": 9928704.0,
+ "step": 606
+ },
+ {
+ "entropy": 0.9204480648040771,
+ "epoch": 1.2262626262626264,
+ "grad_norm": 1.7957704067230225,
+ "learning_rate": 1.183838383838384e-05,
+ "loss": 0.9045253992080688,
+ "mean_token_accuracy": 0.7639839053153992,
+ "num_tokens": 9945088.0,
+ "step": 607
+ },
+ {
+ "entropy": 1.1566129922866821,
+ "epoch": 1.2282828282828282,
+ "grad_norm": 2.0805907249450684,
+ "learning_rate": 1.1824915824915826e-05,
+ "loss": 1.1485098600387573,
+ "mean_token_accuracy": 0.7118343710899353,
+ "num_tokens": 9961472.0,
+ "step": 608
+ },
+ {
+ "entropy": 1.108127236366272,
+ "epoch": 1.2303030303030302,
+ "grad_norm": 1.977317214012146,
+ "learning_rate": 1.1811447811447811e-05,
+ "loss": 1.1131000518798828,
+ "mean_token_accuracy": 0.7167806625366211,
+ "num_tokens": 9977856.0,
+ "step": 609
+ },
+ {
+ "entropy": 0.8749650716781616,
+ "epoch": 1.2323232323232323,
+ "grad_norm": 2.009488344192505,
+ "learning_rate": 1.17979797979798e-05,
+ "loss": 0.9132063388824463,
+ "mean_token_accuracy": 0.7530532479286194,
+ "num_tokens": 9994240.0,
+ "step": 610
+ },
+ {
+ "entropy": 1.2267354726791382,
+ "epoch": 1.2343434343434343,
+ "grad_norm": 2.075202465057373,
+ "learning_rate": 1.1784511784511786e-05,
+ "loss": 1.2091751098632812,
+ "mean_token_accuracy": 0.70652174949646,
+ "num_tokens": 10010624.0,
+ "step": 611
+ },
+ {
+ "entropy": 1.3990167379379272,
+ "epoch": 1.2363636363636363,
+ "grad_norm": 2.2843780517578125,
+ "learning_rate": 1.1771043771043772e-05,
+ "loss": 1.3952152729034424,
+ "mean_token_accuracy": 0.6685393452644348,
+ "num_tokens": 10027008.0,
+ "step": 612
+ },
+ {
+ "entropy": 1.3222941160202026,
+ "epoch": 1.2383838383838384,
+ "grad_norm": 2.1916584968566895,
+ "learning_rate": 1.1757575757575759e-05,
+ "loss": 1.322625994682312,
+ "mean_token_accuracy": 0.6761114001274109,
+ "num_tokens": 10043392.0,
+ "step": 613
+ },
+ {
+ "entropy": 1.3163132667541504,
+ "epoch": 1.2404040404040404,
+ "grad_norm": 2.1066598892211914,
+ "learning_rate": 1.1744107744107745e-05,
+ "loss": 1.3350703716278076,
+ "mean_token_accuracy": 0.6811797618865967,
+ "num_tokens": 10059776.0,
+ "step": 614
+ },
+ {
+ "entropy": 1.3258253335952759,
+ "epoch": 1.2424242424242424,
+ "grad_norm": 2.16098952293396,
+ "learning_rate": 1.1730639730639732e-05,
+ "loss": 1.3305881023406982,
+ "mean_token_accuracy": 0.6830117106437683,
+ "num_tokens": 10076160.0,
+ "step": 615
+ },
+ {
+ "entropy": 0.9164132475852966,
+ "epoch": 1.2444444444444445,
+ "grad_norm": 1.950881838798523,
+ "learning_rate": 1.1717171717171718e-05,
+ "loss": 0.9203709959983826,
+ "mean_token_accuracy": 0.7569614052772522,
+ "num_tokens": 10092544.0,
+ "step": 616
+ },
+ {
+ "entropy": 1.1378085613250732,
+ "epoch": 1.2464646464646465,
+ "grad_norm": 1.99736487865448,
+ "learning_rate": 1.1703703703703703e-05,
+ "loss": 1.1409945487976074,
+ "mean_token_accuracy": 0.7130556702613831,
+ "num_tokens": 10108928.0,
+ "step": 617
+ },
+ {
+ "entropy": 1.010982871055603,
+ "epoch": 1.2484848484848485,
+ "grad_norm": 1.8678277730941772,
+ "learning_rate": 1.1690235690235691e-05,
+ "loss": 1.0040092468261719,
+ "mean_token_accuracy": 0.7382755279541016,
+ "num_tokens": 10125312.0,
+ "step": 618
+ },
+ {
+ "entropy": 1.3451189994812012,
+ "epoch": 1.2505050505050506,
+ "grad_norm": 2.1611146926879883,
+ "learning_rate": 1.1676767676767678e-05,
+ "loss": 1.3347704410552979,
+ "mean_token_accuracy": 0.6760503053665161,
+ "num_tokens": 10141696.0,
+ "step": 619
+ },
+ {
+ "entropy": 1.5893058776855469,
+ "epoch": 1.2525252525252526,
+ "grad_norm": 2.5862345695495605,
+ "learning_rate": 1.1663299663299666e-05,
+ "loss": 1.6102404594421387,
+ "mean_token_accuracy": 0.6231069564819336,
+ "num_tokens": 10158080.0,
+ "step": 620
+ },
+ {
+ "entropy": 1.4471327066421509,
+ "epoch": 1.2545454545454544,
+ "grad_norm": 1.8857513666152954,
+ "learning_rate": 1.164983164983165e-05,
+ "loss": 1.4646904468536377,
+ "mean_token_accuracy": 0.6591353416442871,
+ "num_tokens": 10174464.0,
+ "step": 621
+ },
+ {
+ "entropy": 1.1457897424697876,
+ "epoch": 1.2565656565656567,
+ "grad_norm": 1.9036853313446045,
+ "learning_rate": 1.1636363636363637e-05,
+ "loss": 1.136209487915039,
+ "mean_token_accuracy": 0.7179408669471741,
+ "num_tokens": 10190848.0,
+ "step": 622
+ },
+ {
+ "entropy": 1.3230067491531372,
+ "epoch": 1.2585858585858585,
+ "grad_norm": 1.969241738319397,
+ "learning_rate": 1.1622895622895625e-05,
+ "loss": 1.3203729391098022,
+ "mean_token_accuracy": 0.6909501552581787,
+ "num_tokens": 10207232.0,
+ "step": 623
+ },
+ {
+ "entropy": 0.9331954717636108,
+ "epoch": 1.2606060606060607,
+ "grad_norm": 1.8972336053848267,
+ "learning_rate": 1.160942760942761e-05,
+ "loss": 0.9346438050270081,
+ "mean_token_accuracy": 0.7507327795028687,
+ "num_tokens": 10223616.0,
+ "step": 624
+ },
+ {
+ "entropy": 1.0203893184661865,
+ "epoch": 1.2626262626262625,
+ "grad_norm": 1.9246903657913208,
+ "learning_rate": 1.1595959595959597e-05,
+ "loss": 1.0318937301635742,
+ "mean_token_accuracy": 0.7396799921989441,
+ "num_tokens": 10240000.0,
+ "step": 625
+ },
+ {
+ "entropy": 1.0469106435775757,
+ "epoch": 1.2646464646464646,
+ "grad_norm": 2.0860235691070557,
+ "learning_rate": 1.1582491582491585e-05,
+ "loss": 1.0661770105361938,
+ "mean_token_accuracy": 0.7215437293052673,
+ "num_tokens": 10256384.0,
+ "step": 626
+ },
+ {
+ "entropy": 0.9044442772865295,
+ "epoch": 1.2666666666666666,
+ "grad_norm": 1.922624111175537,
+ "learning_rate": 1.156902356902357e-05,
+ "loss": 0.8972492218017578,
+ "mean_token_accuracy": 0.7624572515487671,
+ "num_tokens": 10272768.0,
+ "step": 627
+ },
+ {
+ "entropy": 1.7082630395889282,
+ "epoch": 1.2686868686868686,
+ "grad_norm": 2.0335583686828613,
+ "learning_rate": 1.1555555555555556e-05,
+ "loss": 1.7194339036941528,
+ "mean_token_accuracy": 0.6278089880943298,
+ "num_tokens": 10289152.0,
+ "step": 628
+ },
+ {
+ "entropy": 1.1749809980392456,
+ "epoch": 1.2707070707070707,
+ "grad_norm": 2.3157317638397217,
+ "learning_rate": 1.1542087542087544e-05,
+ "loss": 1.1912015676498413,
+ "mean_token_accuracy": 0.6991939544677734,
+ "num_tokens": 10305536.0,
+ "step": 629
+ },
+ {
+ "entropy": 1.0230133533477783,
+ "epoch": 1.2727272727272727,
+ "grad_norm": 1.9861854314804077,
+ "learning_rate": 1.1528619528619529e-05,
+ "loss": 1.030585765838623,
+ "mean_token_accuracy": 0.7328407168388367,
+ "num_tokens": 10321920.0,
+ "step": 630
+ },
+ {
+ "entropy": 0.9128814935684204,
+ "epoch": 1.2747474747474747,
+ "grad_norm": 5.766819000244141,
+ "learning_rate": 1.1515151515151517e-05,
+ "loss": 0.9959099292755127,
+ "mean_token_accuracy": 0.7520151734352112,
+ "num_tokens": 10338304.0,
+ "step": 631
+ },
+ {
+ "entropy": 1.3987287282943726,
+ "epoch": 1.2767676767676768,
+ "grad_norm": 1.934733510017395,
+ "learning_rate": 1.1501683501683502e-05,
+ "loss": 1.3910452127456665,
+ "mean_token_accuracy": 0.675561785697937,
+ "num_tokens": 10354688.0,
+ "step": 632
+ },
+ {
+ "entropy": 1.7590066194534302,
+ "epoch": 1.2787878787878788,
+ "grad_norm": 2.003899574279785,
+ "learning_rate": 1.1488215488215488e-05,
+ "loss": 1.771543264389038,
+ "mean_token_accuracy": 0.6064972877502441,
+ "num_tokens": 10371072.0,
+ "step": 633
+ },
+ {
+ "entropy": 1.1135497093200684,
+ "epoch": 1.2808080808080808,
+ "grad_norm": 1.9084051847457886,
+ "learning_rate": 1.1474747474747477e-05,
+ "loss": 1.1299227476119995,
+ "mean_token_accuracy": 0.7198339104652405,
+ "num_tokens": 10387456.0,
+ "step": 634
+ },
+ {
+ "entropy": 1.4671945571899414,
+ "epoch": 1.2828282828282829,
+ "grad_norm": 1.9825108051300049,
+ "learning_rate": 1.1461279461279461e-05,
+ "loss": 1.486473560333252,
+ "mean_token_accuracy": 0.6673180460929871,
+ "num_tokens": 10403840.0,
+ "step": 635
+ },
+ {
+ "entropy": 1.2157530784606934,
+ "epoch": 1.284848484848485,
+ "grad_norm": 2.048701286315918,
+ "learning_rate": 1.1447811447811448e-05,
+ "loss": 1.196000099182129,
+ "mean_token_accuracy": 0.7078040838241577,
+ "num_tokens": 10420224.0,
+ "step": 636
+ },
+ {
+ "entropy": 0.8687402009963989,
+ "epoch": 1.286868686868687,
+ "grad_norm": 1.8956520557403564,
+ "learning_rate": 1.1434343434343436e-05,
+ "loss": 0.86002117395401,
+ "mean_token_accuracy": 0.7663654088973999,
+ "num_tokens": 10436608.0,
+ "step": 637
+ },
+ {
+ "entropy": 1.1118111610412598,
+ "epoch": 1.2888888888888888,
+ "grad_norm": 1.9835058450698853,
+ "learning_rate": 1.142087542087542e-05,
+ "loss": 1.1115164756774902,
+ "mean_token_accuracy": 0.7170859575271606,
+ "num_tokens": 10452992.0,
+ "step": 638
+ },
+ {
+ "entropy": 1.1080268621444702,
+ "epoch": 1.290909090909091,
+ "grad_norm": 1.9650659561157227,
+ "learning_rate": 1.1407407407407409e-05,
+ "loss": 1.0900099277496338,
+ "mean_token_accuracy": 0.7143990993499756,
+ "num_tokens": 10469376.0,
+ "step": 639
+ },
+ {
+ "entropy": 0.9909329414367676,
+ "epoch": 1.2929292929292928,
+ "grad_norm": 2.1029200553894043,
+ "learning_rate": 1.1393939393939395e-05,
+ "loss": 0.9947470426559448,
+ "mean_token_accuracy": 0.7403517365455627,
+ "num_tokens": 10485760.0,
+ "step": 640
+ },
+ {
+ "entropy": 1.1272226572036743,
+ "epoch": 1.294949494949495,
+ "grad_norm": 1.9888865947723389,
+ "learning_rate": 1.138047138047138e-05,
+ "loss": 1.1474848985671997,
+ "mean_token_accuracy": 0.7138495445251465,
+ "num_tokens": 10502144.0,
+ "step": 641
+ },
+ {
+ "entropy": 1.5329686403274536,
+ "epoch": 1.2969696969696969,
+ "grad_norm": 2.046448230743408,
+ "learning_rate": 1.1367003367003368e-05,
+ "loss": 1.556037425994873,
+ "mean_token_accuracy": 0.642953097820282,
+ "num_tokens": 10518528.0,
+ "step": 642
+ },
+ {
+ "entropy": 1.177565336227417,
+ "epoch": 1.298989898989899,
+ "grad_norm": 2.1602399349212646,
+ "learning_rate": 1.1353535353535355e-05,
+ "loss": 1.1836936473846436,
+ "mean_token_accuracy": 0.6971787810325623,
+ "num_tokens": 10534912.0,
+ "step": 643
+ },
+ {
+ "entropy": 0.8429449796676636,
+ "epoch": 1.301010101010101,
+ "grad_norm": 1.7227115631103516,
+ "learning_rate": 1.134006734006734e-05,
+ "loss": 0.8446363806724548,
+ "mean_token_accuracy": 0.7757083773612976,
+ "num_tokens": 10551296.0,
+ "step": 644
+ },
+ {
+ "entropy": 1.397851824760437,
+ "epoch": 1.303030303030303,
+ "grad_norm": 2.137099504470825,
+ "learning_rate": 1.1326599326599328e-05,
+ "loss": 1.3887293338775635,
+ "mean_token_accuracy": 0.6610283255577087,
+ "num_tokens": 10567680.0,
+ "step": 645
+ },
+ {
+ "entropy": 1.2101221084594727,
+ "epoch": 1.305050505050505,
+ "grad_norm": 2.073007583618164,
+ "learning_rate": 1.1313131313131314e-05,
+ "loss": 1.1941102743148804,
+ "mean_token_accuracy": 0.7100635170936584,
+ "num_tokens": 10584064.0,
+ "step": 646
+ },
+ {
+ "entropy": 1.626240849494934,
+ "epoch": 1.307070707070707,
+ "grad_norm": 2.073517084121704,
+ "learning_rate": 1.1299663299663301e-05,
+ "loss": 1.6281862258911133,
+ "mean_token_accuracy": 0.6289692521095276,
+ "num_tokens": 10600448.0,
+ "step": 647
+ },
+ {
+ "entropy": 1.0951712131500244,
+ "epoch": 1.309090909090909,
+ "grad_norm": 2.126551866531372,
+ "learning_rate": 1.1286195286195287e-05,
+ "loss": 1.105857014656067,
+ "mean_token_accuracy": 0.7147044539451599,
+ "num_tokens": 10616832.0,
+ "step": 648
+ },
+ {
+ "entropy": 1.2107304334640503,
+ "epoch": 1.3111111111111111,
+ "grad_norm": 2.067368507385254,
+ "learning_rate": 1.1272727272727272e-05,
+ "loss": 1.2249386310577393,
+ "mean_token_accuracy": 0.7076819539070129,
+ "num_tokens": 10633216.0,
+ "step": 649
+ },
+ {
+ "entropy": 1.4364724159240723,
+ "epoch": 1.3131313131313131,
+ "grad_norm": 1.9724938869476318,
+ "learning_rate": 1.125925925925926e-05,
+ "loss": 1.4194120168685913,
+ "mean_token_accuracy": 0.6655471324920654,
+ "num_tokens": 10649600.0,
+ "step": 650
+ },
+ {
+ "entropy": 0.9386561512947083,
+ "epoch": 1.3151515151515152,
+ "grad_norm": 1.9386829137802124,
+ "learning_rate": 1.1245791245791247e-05,
+ "loss": 0.9313067197799683,
+ "mean_token_accuracy": 0.7560454607009888,
+ "num_tokens": 10665984.0,
+ "step": 651
+ },
+ {
+ "entropy": 1.3809468746185303,
+ "epoch": 1.3171717171717172,
+ "grad_norm": 2.1187713146209717,
+ "learning_rate": 1.1232323232323232e-05,
+ "loss": 1.3900315761566162,
+ "mean_token_accuracy": 0.6675012111663818,
+ "num_tokens": 10682368.0,
+ "step": 652
+ },
+ {
+ "entropy": 1.1068683862686157,
+ "epoch": 1.3191919191919192,
+ "grad_norm": 1.9972929954528809,
+ "learning_rate": 1.121885521885522e-05,
+ "loss": 1.1015276908874512,
+ "mean_token_accuracy": 0.7225818037986755,
+ "num_tokens": 10698752.0,
+ "step": 653
+ },
+ {
+ "entropy": 0.8208921551704407,
+ "epoch": 1.3212121212121213,
+ "grad_norm": 1.9667426347732544,
+ "learning_rate": 1.1205387205387206e-05,
+ "loss": 0.8475431799888611,
+ "mean_token_accuracy": 0.773937463760376,
+ "num_tokens": 10715136.0,
+ "step": 654
+ },
+ {
+ "entropy": 1.2287651300430298,
+ "epoch": 1.3232323232323233,
+ "grad_norm": 2.038112163543701,
+ "learning_rate": 1.1191919191919194e-05,
+ "loss": 1.2165236473083496,
+ "mean_token_accuracy": 0.7084147334098816,
+ "num_tokens": 10731520.0,
+ "step": 655
+ },
+ {
+ "entropy": 1.3068023920059204,
+ "epoch": 1.3252525252525253,
+ "grad_norm": 2.001093626022339,
+ "learning_rate": 1.117845117845118e-05,
+ "loss": 1.3044464588165283,
+ "mean_token_accuracy": 0.6809965968132019,
+ "num_tokens": 10747904.0,
+ "step": 656
+ },
+ {
+ "entropy": 1.0627591609954834,
+ "epoch": 1.3272727272727272,
+ "grad_norm": 2.204498529434204,
+ "learning_rate": 1.1164983164983166e-05,
+ "loss": 1.07448410987854,
+ "mean_token_accuracy": 0.7211162447929382,
+ "num_tokens": 10764288.0,
+ "step": 657
+ },
+ {
+ "entropy": 1.1071605682373047,
+ "epoch": 1.3292929292929294,
+ "grad_norm": 2.2397496700286865,
+ "learning_rate": 1.1151515151515154e-05,
+ "loss": 1.1061029434204102,
+ "mean_token_accuracy": 0.7100635170936584,
+ "num_tokens": 10780672.0,
+ "step": 658
+ },
+ {
+ "entropy": 1.2299960851669312,
+ "epoch": 1.3313131313131312,
+ "grad_norm": 2.0838606357574463,
+ "learning_rate": 1.1138047138047139e-05,
+ "loss": 1.2077662944793701,
+ "mean_token_accuracy": 0.6886907815933228,
+ "num_tokens": 10797056.0,
+ "step": 659
+ },
+ {
+ "entropy": 1.2082552909851074,
+ "epoch": 1.3333333333333333,
+ "grad_norm": 2.0905637741088867,
+ "learning_rate": 1.1124579124579125e-05,
+ "loss": 1.2045608758926392,
+ "mean_token_accuracy": 0.6978505253791809,
+ "num_tokens": 10813440.0,
+ "step": 660
+ },
+ {
+ "entropy": 1.4011980295181274,
+ "epoch": 1.3353535353535353,
+ "grad_norm": 2.227360725402832,
+ "learning_rate": 1.1111111111111113e-05,
+ "loss": 1.4221925735473633,
+ "mean_token_accuracy": 0.6541890501976013,
+ "num_tokens": 10829824.0,
+ "step": 661
+ },
+ {
+ "entropy": 0.7984166145324707,
+ "epoch": 1.3373737373737373,
+ "grad_norm": 1.7253413200378418,
+ "learning_rate": 1.1097643097643098e-05,
+ "loss": 0.7818700671195984,
+ "mean_token_accuracy": 0.7938446402549744,
+ "num_tokens": 10846208.0,
+ "step": 662
+ },
+ {
+ "entropy": 1.0456970930099487,
+ "epoch": 1.3393939393939394,
+ "grad_norm": 2.098661422729492,
+ "learning_rate": 1.1084175084175086e-05,
+ "loss": 1.084232211112976,
+ "mean_token_accuracy": 0.735405445098877,
+ "num_tokens": 10862592.0,
+ "step": 663
+ },
+ {
+ "entropy": 1.1313530206680298,
+ "epoch": 1.3414141414141414,
+ "grad_norm": 1.8916199207305908,
+ "learning_rate": 1.1070707070707071e-05,
+ "loss": 1.1359466314315796,
+ "mean_token_accuracy": 0.7338177561759949,
+ "num_tokens": 10878976.0,
+ "step": 664
+ },
+ {
+ "entropy": 0.9603059887886047,
+ "epoch": 1.3434343434343434,
+ "grad_norm": 2.061540365219116,
+ "learning_rate": 1.1057239057239058e-05,
+ "loss": 0.9516211748123169,
+ "mean_token_accuracy": 0.7465803623199463,
+ "num_tokens": 10895360.0,
+ "step": 665
+ },
+ {
+ "entropy": 0.9865843057632446,
+ "epoch": 1.3454545454545455,
+ "grad_norm": 1.9756824970245361,
+ "learning_rate": 1.1043771043771046e-05,
+ "loss": 0.995586633682251,
+ "mean_token_accuracy": 0.7349780201911926,
+ "num_tokens": 10911744.0,
+ "step": 666
+ },
+ {
+ "entropy": 1.098454475402832,
+ "epoch": 1.3474747474747475,
+ "grad_norm": 1.936257243156433,
+ "learning_rate": 1.103030303030303e-05,
+ "loss": 1.0999541282653809,
+ "mean_token_accuracy": 0.7220322489738464,
+ "num_tokens": 10928128.0,
+ "step": 667
+ },
+ {
+ "entropy": 1.1791200637817383,
+ "epoch": 1.3494949494949495,
+ "grad_norm": 2.2319350242614746,
+ "learning_rate": 1.1016835016835017e-05,
+ "loss": 1.1725637912750244,
+ "mean_token_accuracy": 0.6991328597068787,
+ "num_tokens": 10944512.0,
+ "step": 668
+ },
+ {
+ "entropy": 1.2307621240615845,
+ "epoch": 1.3515151515151516,
+ "grad_norm": 1.9910095930099487,
+ "learning_rate": 1.1003367003367005e-05,
+ "loss": 1.2371525764465332,
+ "mean_token_accuracy": 0.6916218996047974,
+ "num_tokens": 10960896.0,
+ "step": 669
+ },
+ {
+ "entropy": 1.2578529119491577,
+ "epoch": 1.3535353535353536,
+ "grad_norm": 2.1415979862213135,
+ "learning_rate": 1.098989898989899e-05,
+ "loss": 1.2753688097000122,
+ "mean_token_accuracy": 0.6794699430465698,
+ "num_tokens": 10977280.0,
+ "step": 670
+ },
+ {
+ "entropy": 1.0493848323822021,
+ "epoch": 1.3555555555555556,
+ "grad_norm": 1.8233927488327026,
+ "learning_rate": 1.0976430976430978e-05,
+ "loss": 1.0482254028320312,
+ "mean_token_accuracy": 0.744076669216156,
+ "num_tokens": 10993664.0,
+ "step": 671
+ },
+ {
+ "entropy": 0.8162504434585571,
+ "epoch": 1.3575757575757577,
+ "grad_norm": 1.7477539777755737,
+ "learning_rate": 1.0962962962962965e-05,
+ "loss": 0.8021665811538696,
+ "mean_token_accuracy": 0.7877381443977356,
+ "num_tokens": 11010048.0,
+ "step": 672
+ },
+ {
+ "entropy": 1.5074793100357056,
+ "epoch": 1.3595959595959597,
+ "grad_norm": 2.096250057220459,
+ "learning_rate": 1.094949494949495e-05,
+ "loss": 1.4992775917053223,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 11026432.0,
+ "step": 673
+ },
+ {
+ "entropy": 0.866222620010376,
+ "epoch": 1.3616161616161615,
+ "grad_norm": 1.9504317045211792,
+ "learning_rate": 1.0936026936026938e-05,
+ "loss": 0.8860467672348022,
+ "mean_token_accuracy": 0.7655715942382812,
+ "num_tokens": 11042816.0,
+ "step": 674
+ },
+ {
+ "entropy": 1.0089516639709473,
+ "epoch": 1.3636363636363638,
+ "grad_norm": 2.218254566192627,
+ "learning_rate": 1.0922558922558924e-05,
+ "loss": 1.005429983139038,
+ "mean_token_accuracy": 0.7360160946846008,
+ "num_tokens": 11059200.0,
+ "step": 675
+ },
+ {
+ "entropy": 1.2176142930984497,
+ "epoch": 1.3656565656565656,
+ "grad_norm": 2.1257565021514893,
+ "learning_rate": 1.0909090909090909e-05,
+ "loss": 1.286620020866394,
+ "mean_token_accuracy": 0.7042012810707092,
+ "num_tokens": 11075584.0,
+ "step": 676
+ },
+ {
+ "entropy": 1.1085315942764282,
+ "epoch": 1.3676767676767676,
+ "grad_norm": 2.065206527709961,
+ "learning_rate": 1.0895622895622897e-05,
+ "loss": 1.1294854879379272,
+ "mean_token_accuracy": 0.7205055952072144,
+ "num_tokens": 11091968.0,
+ "step": 677
+ },
+ {
+ "entropy": 1.2821027040481567,
+ "epoch": 1.3696969696969696,
+ "grad_norm": 2.126866340637207,
+ "learning_rate": 1.0882154882154884e-05,
+ "loss": 1.2661428451538086,
+ "mean_token_accuracy": 0.6976673007011414,
+ "num_tokens": 11108352.0,
+ "step": 678
+ },
+ {
+ "entropy": 0.9285033941268921,
+ "epoch": 1.3717171717171717,
+ "grad_norm": 1.9017925262451172,
+ "learning_rate": 1.0868686868686868e-05,
+ "loss": 0.9141640663146973,
+ "mean_token_accuracy": 0.7670371532440186,
+ "num_tokens": 11124736.0,
+ "step": 679
+ },
+ {
+ "entropy": 0.7374900579452515,
+ "epoch": 1.3737373737373737,
+ "grad_norm": 1.645703911781311,
+ "learning_rate": 1.0855218855218857e-05,
+ "loss": 0.7550391554832458,
+ "mean_token_accuracy": 0.7958598136901855,
+ "num_tokens": 11141120.0,
+ "step": 680
+ },
+ {
+ "entropy": 1.2956714630126953,
+ "epoch": 1.3757575757575757,
+ "grad_norm": 1.9934611320495605,
+ "learning_rate": 1.0841750841750841e-05,
+ "loss": 1.318368673324585,
+ "mean_token_accuracy": 0.686370313167572,
+ "num_tokens": 11157504.0,
+ "step": 681
+ },
+ {
+ "entropy": 1.0948729515075684,
+ "epoch": 1.3777777777777778,
+ "grad_norm": 1.8784940242767334,
+ "learning_rate": 1.082828282828283e-05,
+ "loss": 1.0897748470306396,
+ "mean_token_accuracy": 0.7231314182281494,
+ "num_tokens": 11173888.0,
+ "step": 682
+ },
+ {
+ "entropy": 1.5263433456420898,
+ "epoch": 1.3797979797979798,
+ "grad_norm": 1.9812215566635132,
+ "learning_rate": 1.0814814814814816e-05,
+ "loss": 1.535595178604126,
+ "mean_token_accuracy": 0.6683561205863953,
+ "num_tokens": 11190272.0,
+ "step": 683
+ },
+ {
+ "entropy": 1.3359065055847168,
+ "epoch": 1.3818181818181818,
+ "grad_norm": 2.1247689723968506,
+ "learning_rate": 1.08013468013468e-05,
+ "loss": 1.3298604488372803,
+ "mean_token_accuracy": 0.6813629865646362,
+ "num_tokens": 11206656.0,
+ "step": 684
+ },
+ {
+ "entropy": 1.2030925750732422,
+ "epoch": 1.3838383838383839,
+ "grad_norm": 2.178311586380005,
+ "learning_rate": 1.0787878787878789e-05,
+ "loss": 1.1808526515960693,
+ "mean_token_accuracy": 0.7067660093307495,
+ "num_tokens": 11223040.0,
+ "step": 685
+ },
+ {
+ "entropy": 0.954181969165802,
+ "epoch": 1.385858585858586,
+ "grad_norm": 1.9475486278533936,
+ "learning_rate": 1.0774410774410775e-05,
+ "loss": 0.9589706063270569,
+ "mean_token_accuracy": 0.7527479529380798,
+ "num_tokens": 11239424.0,
+ "step": 686
+ },
+ {
+ "entropy": 1.310365080833435,
+ "epoch": 1.387878787878788,
+ "grad_norm": 2.1845083236694336,
+ "learning_rate": 1.076094276094276e-05,
+ "loss": 1.2851444482803345,
+ "mean_token_accuracy": 0.6789203882217407,
+ "num_tokens": 11255808.0,
+ "step": 687
+ },
+ {
+ "entropy": 1.1187219619750977,
+ "epoch": 1.38989898989899,
+ "grad_norm": 1.9923648834228516,
+ "learning_rate": 1.0747474747474748e-05,
+ "loss": 1.1112818717956543,
+ "mean_token_accuracy": 0.7198339104652405,
+ "num_tokens": 11272192.0,
+ "step": 688
+ },
+ {
+ "entropy": 1.1317063570022583,
+ "epoch": 1.391919191919192,
+ "grad_norm": 2.003026008605957,
+ "learning_rate": 1.0734006734006735e-05,
+ "loss": 1.1108404397964478,
+ "mean_token_accuracy": 0.7223986387252808,
+ "num_tokens": 11288576.0,
+ "step": 689
+ },
+ {
+ "entropy": 1.1476070880889893,
+ "epoch": 1.393939393939394,
+ "grad_norm": 2.190676689147949,
+ "learning_rate": 1.0720538720538723e-05,
+ "loss": 1.1344139575958252,
+ "mean_token_accuracy": 0.7170249223709106,
+ "num_tokens": 11304960.0,
+ "step": 690
+ },
+ {
+ "entropy": 0.8959853053092957,
+ "epoch": 1.3959595959595958,
+ "grad_norm": 2.078281879425049,
+ "learning_rate": 1.0707070707070708e-05,
+ "loss": 0.9233289361000061,
+ "mean_token_accuracy": 0.7490229606628418,
+ "num_tokens": 11321344.0,
+ "step": 691
+ },
+ {
+ "entropy": 0.8892031311988831,
+ "epoch": 1.397979797979798,
+ "grad_norm": 1.8343734741210938,
+ "learning_rate": 1.0693602693602694e-05,
+ "loss": 0.8952107429504395,
+ "mean_token_accuracy": 0.7662432789802551,
+ "num_tokens": 11337728.0,
+ "step": 692
+ },
+ {
+ "entropy": 1.0275429487228394,
+ "epoch": 1.4,
+ "grad_norm": 1.8822777271270752,
+ "learning_rate": 1.0680134680134683e-05,
+ "loss": 1.0251365900039673,
+ "mean_token_accuracy": 0.7409623861312866,
+ "num_tokens": 11354112.0,
+ "step": 693
+ },
+ {
+ "entropy": 1.2872905731201172,
+ "epoch": 1.402020202020202,
+ "grad_norm": 1.9260203838348389,
+ "learning_rate": 1.0666666666666667e-05,
+ "loss": 1.3024024963378906,
+ "mean_token_accuracy": 0.6938202381134033,
+ "num_tokens": 11370496.0,
+ "step": 694
+ },
+ {
+ "entropy": 1.0969563722610474,
+ "epoch": 1.404040404040404,
+ "grad_norm": 2.07882022857666,
+ "learning_rate": 1.0653198653198654e-05,
+ "loss": 1.086198091506958,
+ "mean_token_accuracy": 0.7195285558700562,
+ "num_tokens": 11386880.0,
+ "step": 695
+ },
+ {
+ "entropy": 1.4206339120864868,
+ "epoch": 1.406060606060606,
+ "grad_norm": 2.110828399658203,
+ "learning_rate": 1.063973063973064e-05,
+ "loss": 1.4270105361938477,
+ "mean_token_accuracy": 0.6843551397323608,
+ "num_tokens": 11403264.0,
+ "step": 696
+ },
+ {
+ "entropy": 1.3813765048980713,
+ "epoch": 1.408080808080808,
+ "grad_norm": 1.8829882144927979,
+ "learning_rate": 1.0626262626262627e-05,
+ "loss": 1.4026310443878174,
+ "mean_token_accuracy": 0.663593053817749,
+ "num_tokens": 11419648.0,
+ "step": 697
+ },
+ {
+ "entropy": 0.8580052256584167,
+ "epoch": 1.41010101010101,
+ "grad_norm": 2.0236165523529053,
+ "learning_rate": 1.0612794612794615e-05,
+ "loss": 0.8655292391777039,
+ "mean_token_accuracy": 0.7634953856468201,
+ "num_tokens": 11436032.0,
+ "step": 698
+ },
+ {
+ "entropy": 1.0694427490234375,
+ "epoch": 1.412121212121212,
+ "grad_norm": 1.8688758611679077,
+ "learning_rate": 1.05993265993266e-05,
+ "loss": 1.089691162109375,
+ "mean_token_accuracy": 0.7183072566986084,
+ "num_tokens": 11452416.0,
+ "step": 699
+ },
+ {
+ "entropy": 1.2054415941238403,
+ "epoch": 1.4141414141414141,
+ "grad_norm": 2.0692546367645264,
+ "learning_rate": 1.0585858585858586e-05,
+ "loss": 1.2053213119506836,
+ "mean_token_accuracy": 0.7134220600128174,
+ "num_tokens": 11468800.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.4141414141414141,
+ "eval_entropy": 1.2882747703021573,
+ "eval_loss": 1.535590410232544,
+ "eval_mean_token_accuracy": 0.6466120765093835,
+ "eval_num_tokens": 11468800.0,
+ "eval_runtime": 43.9264,
+ "eval_samples_per_second": 22.538,
+ "eval_steps_per_second": 2.823,
+ "step": 700
+ },
+ {
+ "entropy": 1.3370676040649414,
+ "epoch": 1.4161616161616162,
+ "grad_norm": 2.075853109359741,
+ "learning_rate": 1.0572390572390574e-05,
+ "loss": 1.3726792335510254,
+ "mean_token_accuracy": 0.6731802821159363,
+ "num_tokens": 11485184.0,
+ "step": 701
+ },
+ {
+ "entropy": 1.1095269918441772,
+ "epoch": 1.4181818181818182,
+ "grad_norm": 2.0868141651153564,
+ "learning_rate": 1.055892255892256e-05,
+ "loss": 1.124086856842041,
+ "mean_token_accuracy": 0.7162310481071472,
+ "num_tokens": 11501568.0,
+ "step": 702
+ },
+ {
+ "entropy": 1.1948339939117432,
+ "epoch": 1.4202020202020202,
+ "grad_norm": 2.091768741607666,
+ "learning_rate": 1.0545454545454546e-05,
+ "loss": 1.208143949508667,
+ "mean_token_accuracy": 0.7008426785469055,
+ "num_tokens": 11517952.0,
+ "step": 703
+ },
+ {
+ "entropy": 0.8022822141647339,
+ "epoch": 1.4222222222222223,
+ "grad_norm": 1.799911379814148,
+ "learning_rate": 1.0531986531986534e-05,
+ "loss": 0.7870017290115356,
+ "mean_token_accuracy": 0.789631187915802,
+ "num_tokens": 11534336.0,
+ "step": 704
+ },
+ {
+ "entropy": 1.0242470502853394,
+ "epoch": 1.4242424242424243,
+ "grad_norm": 1.8621245622634888,
+ "learning_rate": 1.0518518518518519e-05,
+ "loss": 1.031789779663086,
+ "mean_token_accuracy": 0.7375427484512329,
+ "num_tokens": 11550720.0,
+ "step": 705
+ },
+ {
+ "entropy": 0.9582471251487732,
+ "epoch": 1.4262626262626263,
+ "grad_norm": 2.0054924488067627,
+ "learning_rate": 1.0505050505050507e-05,
+ "loss": 0.9522819519042969,
+ "mean_token_accuracy": 0.739130437374115,
+ "num_tokens": 11567104.0,
+ "step": 706
+ },
+ {
+ "entropy": 1.172863483428955,
+ "epoch": 1.4282828282828284,
+ "grad_norm": 1.8495111465454102,
+ "learning_rate": 1.0491582491582493e-05,
+ "loss": 1.1783076524734497,
+ "mean_token_accuracy": 0.7132999300956726,
+ "num_tokens": 11583488.0,
+ "step": 707
+ },
+ {
+ "entropy": 1.2278543710708618,
+ "epoch": 1.4303030303030302,
+ "grad_norm": 2.095710277557373,
+ "learning_rate": 1.0478114478114478e-05,
+ "loss": 1.2355749607086182,
+ "mean_token_accuracy": 0.6905227303504944,
+ "num_tokens": 11599872.0,
+ "step": 708
+ },
+ {
+ "entropy": 0.9415866732597351,
+ "epoch": 1.4323232323232324,
+ "grad_norm": 1.9720549583435059,
+ "learning_rate": 1.0464646464646466e-05,
+ "loss": 0.9524072408676147,
+ "mean_token_accuracy": 0.7501221299171448,
+ "num_tokens": 11616256.0,
+ "step": 709
+ },
+ {
+ "entropy": 1.371761441230774,
+ "epoch": 1.4343434343434343,
+ "grad_norm": 2.2934458255767822,
+ "learning_rate": 1.0451178451178453e-05,
+ "loss": 1.3502682447433472,
+ "mean_token_accuracy": 0.665730357170105,
+ "num_tokens": 11632640.0,
+ "step": 710
+ },
+ {
+ "entropy": 1.1605411767959595,
+ "epoch": 1.4363636363636363,
+ "grad_norm": 1.978593349456787,
+ "learning_rate": 1.0437710437710438e-05,
+ "loss": 1.166311264038086,
+ "mean_token_accuracy": 0.6971177458763123,
+ "num_tokens": 11649024.0,
+ "step": 711
+ },
+ {
+ "entropy": 1.2717126607894897,
+ "epoch": 1.4383838383838383,
+ "grad_norm": 2.077765703201294,
+ "learning_rate": 1.0424242424242426e-05,
+ "loss": 1.2650127410888672,
+ "mean_token_accuracy": 0.6827064156532288,
+ "num_tokens": 11665408.0,
+ "step": 712
+ },
+ {
+ "entropy": 1.42205810546875,
+ "epoch": 1.4404040404040404,
+ "grad_norm": 2.152578592300415,
+ "learning_rate": 1.041077441077441e-05,
+ "loss": 1.4107255935668945,
+ "mean_token_accuracy": 0.6676233410835266,
+ "num_tokens": 11681792.0,
+ "step": 713
+ },
+ {
+ "entropy": 1.8077080249786377,
+ "epoch": 1.4424242424242424,
+ "grad_norm": 2.0739355087280273,
+ "learning_rate": 1.0397306397306399e-05,
+ "loss": 1.83225417137146,
+ "mean_token_accuracy": 0.6088177561759949,
+ "num_tokens": 11698176.0,
+ "step": 714
+ },
+ {
+ "entropy": 1.3185032606124878,
+ "epoch": 1.4444444444444444,
+ "grad_norm": 2.1207802295684814,
+ "learning_rate": 1.0383838383838385e-05,
+ "loss": 1.3216420412063599,
+ "mean_token_accuracy": 0.6762335300445557,
+ "num_tokens": 11714560.0,
+ "step": 715
+ },
+ {
+ "entropy": 1.1990821361541748,
+ "epoch": 1.4464646464646465,
+ "grad_norm": 1.9028881788253784,
+ "learning_rate": 1.037037037037037e-05,
+ "loss": 1.2123594284057617,
+ "mean_token_accuracy": 0.7231314182281494,
+ "num_tokens": 11730944.0,
+ "step": 716
+ },
+ {
+ "entropy": 1.1971170902252197,
+ "epoch": 1.4484848484848485,
+ "grad_norm": 2.071993827819824,
+ "learning_rate": 1.0356902356902358e-05,
+ "loss": 1.1753935813903809,
+ "mean_token_accuracy": 0.7173302173614502,
+ "num_tokens": 11747328.0,
+ "step": 717
+ },
+ {
+ "entropy": 1.16183602809906,
+ "epoch": 1.4505050505050505,
+ "grad_norm": 2.0574443340301514,
+ "learning_rate": 1.0343434343434345e-05,
+ "loss": 1.171074390411377,
+ "mean_token_accuracy": 0.7076819539070129,
+ "num_tokens": 11763712.0,
+ "step": 718
+ },
+ {
+ "entropy": 1.1637240648269653,
+ "epoch": 1.4525252525252526,
+ "grad_norm": 1.9361884593963623,
+ "learning_rate": 1.032996632996633e-05,
+ "loss": 1.1374025344848633,
+ "mean_token_accuracy": 0.7241694927215576,
+ "num_tokens": 11780096.0,
+ "step": 719
+ },
+ {
+ "entropy": 1.0883492231369019,
+ "epoch": 1.4545454545454546,
+ "grad_norm": 2.0204899311065674,
+ "learning_rate": 1.0316498316498318e-05,
+ "loss": 1.0666342973709106,
+ "mean_token_accuracy": 0.7216047644615173,
+ "num_tokens": 11796480.0,
+ "step": 720
+ },
+ {
+ "entropy": 1.3728728294372559,
+ "epoch": 1.4565656565656566,
+ "grad_norm": 1.8690729141235352,
+ "learning_rate": 1.0303030303030304e-05,
+ "loss": 1.3879103660583496,
+ "mean_token_accuracy": 0.6769052147865295,
+ "num_tokens": 11812864.0,
+ "step": 721
+ },
+ {
+ "entropy": 1.1204687356948853,
+ "epoch": 1.4585858585858587,
+ "grad_norm": 2.091113567352295,
+ "learning_rate": 1.0289562289562289e-05,
+ "loss": 1.1190675497055054,
+ "mean_token_accuracy": 0.7191621661186218,
+ "num_tokens": 11829248.0,
+ "step": 722
+ },
+ {
+ "entropy": 1.479430913925171,
+ "epoch": 1.4606060606060607,
+ "grad_norm": 2.194871187210083,
+ "learning_rate": 1.0276094276094277e-05,
+ "loss": 1.4967867136001587,
+ "mean_token_accuracy": 0.6475329995155334,
+ "num_tokens": 11845632.0,
+ "step": 723
+ },
+ {
+ "entropy": 1.083875060081482,
+ "epoch": 1.4626262626262627,
+ "grad_norm": 1.9257639646530151,
+ "learning_rate": 1.0262626262626264e-05,
+ "loss": 1.1053729057312012,
+ "mean_token_accuracy": 0.7168416976928711,
+ "num_tokens": 11862016.0,
+ "step": 724
+ },
+ {
+ "entropy": 1.074636697769165,
+ "epoch": 1.4646464646464645,
+ "grad_norm": 1.956766963005066,
+ "learning_rate": 1.024915824915825e-05,
+ "loss": 1.0775985717773438,
+ "mean_token_accuracy": 0.7348558902740479,
+ "num_tokens": 11878400.0,
+ "step": 725
+ },
+ {
+ "entropy": 1.1595367193222046,
+ "epoch": 1.4666666666666668,
+ "grad_norm": 2.0679080486297607,
+ "learning_rate": 1.0235690235690236e-05,
+ "loss": 1.1976954936981201,
+ "mean_token_accuracy": 0.7014533281326294,
+ "num_tokens": 11894784.0,
+ "step": 726
+ },
+ {
+ "entropy": 1.0546326637268066,
+ "epoch": 1.4686868686868686,
+ "grad_norm": 1.8939472436904907,
+ "learning_rate": 1.0222222222222223e-05,
+ "loss": 1.0483310222625732,
+ "mean_token_accuracy": 0.7339398860931396,
+ "num_tokens": 11911168.0,
+ "step": 727
+ },
+ {
+ "entropy": 1.3418383598327637,
+ "epoch": 1.4707070707070706,
+ "grad_norm": 2.239595413208008,
+ "learning_rate": 1.020875420875421e-05,
+ "loss": 1.35018789768219,
+ "mean_token_accuracy": 0.6685393452644348,
+ "num_tokens": 11927552.0,
+ "step": 728
+ },
+ {
+ "entropy": 0.9122293591499329,
+ "epoch": 1.4727272727272727,
+ "grad_norm": 2.1075761318206787,
+ "learning_rate": 1.0195286195286196e-05,
+ "loss": 0.9050356149673462,
+ "mean_token_accuracy": 0.7633121609687805,
+ "num_tokens": 11943936.0,
+ "step": 729
+ },
+ {
+ "entropy": 0.9527847766876221,
+ "epoch": 1.4747474747474747,
+ "grad_norm": 2.017185688018799,
+ "learning_rate": 1.0181818181818182e-05,
+ "loss": 0.9490136504173279,
+ "mean_token_accuracy": 0.7539081573486328,
+ "num_tokens": 11960320.0,
+ "step": 730
+ },
+ {
+ "entropy": 1.2855827808380127,
+ "epoch": 1.4767676767676767,
+ "grad_norm": 1.9821733236312866,
+ "learning_rate": 1.0168350168350169e-05,
+ "loss": 1.2902567386627197,
+ "mean_token_accuracy": 0.6854543089866638,
+ "num_tokens": 11976704.0,
+ "step": 731
+ },
+ {
+ "entropy": 1.143114686012268,
+ "epoch": 1.4787878787878788,
+ "grad_norm": 2.0281424522399902,
+ "learning_rate": 1.0154882154882155e-05,
+ "loss": 1.1373090744018555,
+ "mean_token_accuracy": 0.7071934342384338,
+ "num_tokens": 11993088.0,
+ "step": 732
+ },
+ {
+ "entropy": 1.1341931819915771,
+ "epoch": 1.4808080808080808,
+ "grad_norm": 2.075814723968506,
+ "learning_rate": 1.0141414141414144e-05,
+ "loss": 1.1449689865112305,
+ "mean_token_accuracy": 0.7180019617080688,
+ "num_tokens": 12009472.0,
+ "step": 733
+ },
+ {
+ "entropy": 0.9200477004051208,
+ "epoch": 1.4828282828282828,
+ "grad_norm": 1.7193031311035156,
+ "learning_rate": 1.0127946127946128e-05,
+ "loss": 0.9225804209709167,
+ "mean_token_accuracy": 0.7621519565582275,
+ "num_tokens": 12025856.0,
+ "step": 734
+ },
+ {
+ "entropy": 1.3266046047210693,
+ "epoch": 1.4848484848484849,
+ "grad_norm": 2.0543408393859863,
+ "learning_rate": 1.0114478114478115e-05,
+ "loss": 1.3158385753631592,
+ "mean_token_accuracy": 0.6758060455322266,
+ "num_tokens": 12042240.0,
+ "step": 735
+ },
+ {
+ "entropy": 1.2785359621047974,
+ "epoch": 1.486868686868687,
+ "grad_norm": 2.0174546241760254,
+ "learning_rate": 1.0101010101010103e-05,
+ "loss": 1.269796371459961,
+ "mean_token_accuracy": 0.7070102691650391,
+ "num_tokens": 12058624.0,
+ "step": 736
+ },
+ {
+ "entropy": 1.3418751955032349,
+ "epoch": 1.488888888888889,
+ "grad_norm": 2.0906383991241455,
+ "learning_rate": 1.0087542087542088e-05,
+ "loss": 1.35174560546875,
+ "mean_token_accuracy": 0.6758060455322266,
+ "num_tokens": 12075008.0,
+ "step": 737
+ },
+ {
+ "entropy": 1.266552448272705,
+ "epoch": 1.490909090909091,
+ "grad_norm": 1.7485158443450928,
+ "learning_rate": 1.0074074074074074e-05,
+ "loss": 1.2538254261016846,
+ "mean_token_accuracy": 0.7070713043212891,
+ "num_tokens": 12091392.0,
+ "step": 738
+ },
+ {
+ "entropy": 0.9562437534332275,
+ "epoch": 1.492929292929293,
+ "grad_norm": 1.9106290340423584,
+ "learning_rate": 1.0060606060606062e-05,
+ "loss": 0.938219428062439,
+ "mean_token_accuracy": 0.7383365631103516,
+ "num_tokens": 12107776.0,
+ "step": 739
+ },
+ {
+ "entropy": 1.3171569108963013,
+ "epoch": 1.494949494949495,
+ "grad_norm": 2.127641439437866,
+ "learning_rate": 1.0047138047138047e-05,
+ "loss": 1.3213756084442139,
+ "mean_token_accuracy": 0.6819125413894653,
+ "num_tokens": 12124160.0,
+ "step": 740
+ },
+ {
+ "entropy": 1.0634039640426636,
+ "epoch": 1.496969696969697,
+ "grad_norm": 2.0710532665252686,
+ "learning_rate": 1.0033670033670035e-05,
+ "loss": 1.0797393321990967,
+ "mean_token_accuracy": 0.7150708436965942,
+ "num_tokens": 12140544.0,
+ "step": 741
+ },
+ {
+ "entropy": 1.3235414028167725,
+ "epoch": 1.4989898989898989,
+ "grad_norm": 2.040738105773926,
+ "learning_rate": 1.0020202020202022e-05,
+ "loss": 1.3383063077926636,
+ "mean_token_accuracy": 0.6737298369407654,
+ "num_tokens": 12156928.0,
+ "step": 742
+ },
+ {
+ "entropy": 1.2156025171279907,
+ "epoch": 1.5010101010101011,
+ "grad_norm": 2.196033239364624,
+ "learning_rate": 1.0006734006734007e-05,
+ "loss": 1.2233551740646362,
+ "mean_token_accuracy": 0.7015144228935242,
+ "num_tokens": 12173312.0,
+ "step": 743
+ },
+ {
+ "entropy": 0.9380976557731628,
+ "epoch": 1.503030303030303,
+ "grad_norm": 1.951636791229248,
+ "learning_rate": 9.993265993265993e-06,
+ "loss": 0.9319983124732971,
+ "mean_token_accuracy": 0.7494503855705261,
+ "num_tokens": 12189696.0,
+ "step": 744
+ },
+ {
+ "entropy": 1.3272504806518555,
+ "epoch": 1.5050505050505052,
+ "grad_norm": 2.045417308807373,
+ "learning_rate": 9.97979797979798e-06,
+ "loss": 1.3266823291778564,
+ "mean_token_accuracy": 0.6848436594009399,
+ "num_tokens": 12206080.0,
+ "step": 745
+ },
+ {
+ "entropy": 0.955014705657959,
+ "epoch": 1.507070707070707,
+ "grad_norm": 1.7301888465881348,
+ "learning_rate": 9.966329966329968e-06,
+ "loss": 0.9721895456314087,
+ "mean_token_accuracy": 0.7561064958572388,
+ "num_tokens": 12222464.0,
+ "step": 746
+ },
+ {
+ "entropy": 1.0614056587219238,
+ "epoch": 1.509090909090909,
+ "grad_norm": 2.235422372817993,
+ "learning_rate": 9.952861952861954e-06,
+ "loss": 1.081586241722107,
+ "mean_token_accuracy": 0.7147044539451599,
+ "num_tokens": 12238848.0,
+ "step": 747
+ },
+ {
+ "entropy": 1.075492024421692,
+ "epoch": 1.511111111111111,
+ "grad_norm": 2.0352933406829834,
+ "learning_rate": 9.939393939393939e-06,
+ "loss": 1.083856463432312,
+ "mean_token_accuracy": 0.7148265838623047,
+ "num_tokens": 12255232.0,
+ "step": 748
+ },
+ {
+ "entropy": 1.1964384317398071,
+ "epoch": 1.513131313131313,
+ "grad_norm": 1.9096226692199707,
+ "learning_rate": 9.925925925925927e-06,
+ "loss": 1.1777125597000122,
+ "mean_token_accuracy": 0.7061553597450256,
+ "num_tokens": 12271616.0,
+ "step": 749
+ },
+ {
+ "entropy": 1.2923556566238403,
+ "epoch": 1.5151515151515151,
+ "grad_norm": 2.1002533435821533,
+ "learning_rate": 9.912457912457914e-06,
+ "loss": 1.2916597127914429,
+ "mean_token_accuracy": 0.6882632970809937,
+ "num_tokens": 12288000.0,
+ "step": 750
+ },
+ {
+ "entropy": 1.008608341217041,
+ "epoch": 1.5171717171717172,
+ "grad_norm": 2.1212828159332275,
+ "learning_rate": 9.8989898989899e-06,
+ "loss": 1.0104637145996094,
+ "mean_token_accuracy": 0.7343673706054688,
+ "num_tokens": 12304384.0,
+ "step": 751
+ },
+ {
+ "entropy": 1.550642967224121,
+ "epoch": 1.5191919191919192,
+ "grad_norm": 1.9693539142608643,
+ "learning_rate": 9.885521885521887e-06,
+ "loss": 1.5664982795715332,
+ "mean_token_accuracy": 0.6830728054046631,
+ "num_tokens": 12320768.0,
+ "step": 752
+ },
+ {
+ "entropy": 1.3540711402893066,
+ "epoch": 1.5212121212121212,
+ "grad_norm": 2.181079149246216,
+ "learning_rate": 9.872053872053873e-06,
+ "loss": 1.3578659296035767,
+ "mean_token_accuracy": 0.666829526424408,
+ "num_tokens": 12337152.0,
+ "step": 753
+ },
+ {
+ "entropy": 1.002195119857788,
+ "epoch": 1.5232323232323233,
+ "grad_norm": 2.051185369491577,
+ "learning_rate": 9.85858585858586e-06,
+ "loss": 0.9798580408096313,
+ "mean_token_accuracy": 0.7434660196304321,
+ "num_tokens": 12353536.0,
+ "step": 754
+ },
+ {
+ "entropy": 1.2805551290512085,
+ "epoch": 1.5252525252525253,
+ "grad_norm": 2.0427937507629395,
+ "learning_rate": 9.845117845117846e-06,
+ "loss": 1.2829053401947021,
+ "mean_token_accuracy": 0.6933317184448242,
+ "num_tokens": 12369920.0,
+ "step": 755
+ },
+ {
+ "entropy": 1.3517152070999146,
+ "epoch": 1.5272727272727273,
+ "grad_norm": 2.0065114498138428,
+ "learning_rate": 9.831649831649833e-06,
+ "loss": 1.3636512756347656,
+ "mean_token_accuracy": 0.6757450103759766,
+ "num_tokens": 12386304.0,
+ "step": 756
+ },
+ {
+ "entropy": 0.7547817826271057,
+ "epoch": 1.5292929292929291,
+ "grad_norm": 3.2289278507232666,
+ "learning_rate": 9.81818181818182e-06,
+ "loss": 0.7594918012619019,
+ "mean_token_accuracy": 0.7917684316635132,
+ "num_tokens": 12402688.0,
+ "step": 757
+ },
+ {
+ "entropy": 1.4882941246032715,
+ "epoch": 1.5313131313131314,
+ "grad_norm": 1.9724371433258057,
+ "learning_rate": 9.804713804713806e-06,
+ "loss": 1.4832470417022705,
+ "mean_token_accuracy": 0.6436858773231506,
+ "num_tokens": 12419072.0,
+ "step": 758
+ },
+ {
+ "entropy": 0.9879036545753479,
+ "epoch": 1.5333333333333332,
+ "grad_norm": 1.9205714464187622,
+ "learning_rate": 9.791245791245792e-06,
+ "loss": 0.9901232123374939,
+ "mean_token_accuracy": 0.7465192675590515,
+ "num_tokens": 12435456.0,
+ "step": 759
+ },
+ {
+ "entropy": 0.9692004919052124,
+ "epoch": 1.5353535353535355,
+ "grad_norm": 1.8762351274490356,
+ "learning_rate": 9.777777777777779e-06,
+ "loss": 0.9544116258621216,
+ "mean_token_accuracy": 0.7518319487571716,
+ "num_tokens": 12451840.0,
+ "step": 760
+ },
+ {
+ "entropy": 0.8084391951560974,
+ "epoch": 1.5373737373737373,
+ "grad_norm": 1.9590117931365967,
+ "learning_rate": 9.764309764309765e-06,
+ "loss": 0.8268290162086487,
+ "mean_token_accuracy": 0.7758305072784424,
+ "num_tokens": 12468224.0,
+ "step": 761
+ },
+ {
+ "entropy": 1.2048877477645874,
+ "epoch": 1.5393939393939395,
+ "grad_norm": 2.1473560333251953,
+ "learning_rate": 9.750841750841752e-06,
+ "loss": 1.1967238187789917,
+ "mean_token_accuracy": 0.7075598239898682,
+ "num_tokens": 12484608.0,
+ "step": 762
+ },
+ {
+ "entropy": 1.330485224723816,
+ "epoch": 1.5414141414141413,
+ "grad_norm": 2.0944108963012695,
+ "learning_rate": 9.737373737373738e-06,
+ "loss": 1.3377408981323242,
+ "mean_token_accuracy": 0.6920493245124817,
+ "num_tokens": 12500992.0,
+ "step": 763
+ },
+ {
+ "entropy": 0.994591474533081,
+ "epoch": 1.5434343434343434,
+ "grad_norm": 2.224015712738037,
+ "learning_rate": 9.723905723905725e-06,
+ "loss": 0.9741864204406738,
+ "mean_token_accuracy": 0.734306275844574,
+ "num_tokens": 12517376.0,
+ "step": 764
+ },
+ {
+ "entropy": 1.3140320777893066,
+ "epoch": 1.5454545454545454,
+ "grad_norm": 2.0910675525665283,
+ "learning_rate": 9.710437710437711e-06,
+ "loss": 1.3168857097625732,
+ "mean_token_accuracy": 0.6908280253410339,
+ "num_tokens": 12533760.0,
+ "step": 765
+ },
+ {
+ "entropy": 0.5885581374168396,
+ "epoch": 1.5474747474747474,
+ "grad_norm": 1.6729995012283325,
+ "learning_rate": 9.696969696969698e-06,
+ "loss": 0.587052583694458,
+ "mean_token_accuracy": 0.8340253829956055,
+ "num_tokens": 12550144.0,
+ "step": 766
+ },
+ {
+ "entropy": 1.1873608827590942,
+ "epoch": 1.5494949494949495,
+ "grad_norm": 2.0278220176696777,
+ "learning_rate": 9.683501683501684e-06,
+ "loss": 1.1988582611083984,
+ "mean_token_accuracy": 0.708109438419342,
+ "num_tokens": 12566528.0,
+ "step": 767
+ },
+ {
+ "entropy": 1.600446343421936,
+ "epoch": 1.5515151515151515,
+ "grad_norm": 2.1766979694366455,
+ "learning_rate": 9.67003367003367e-06,
+ "loss": 1.6514582633972168,
+ "mean_token_accuracy": 0.6134586930274963,
+ "num_tokens": 12582912.0,
+ "step": 768
+ },
+ {
+ "entropy": 1.3398208618164062,
+ "epoch": 1.5535353535353535,
+ "grad_norm": 2.3216426372528076,
+ "learning_rate": 9.656565656565657e-06,
+ "loss": 1.3702855110168457,
+ "mean_token_accuracy": 0.6650586128234863,
+ "num_tokens": 12599296.0,
+ "step": 769
+ },
+ {
+ "entropy": 1.061170220375061,
+ "epoch": 1.5555555555555556,
+ "grad_norm": 1.9703660011291504,
+ "learning_rate": 9.643097643097643e-06,
+ "loss": 1.0738681554794312,
+ "mean_token_accuracy": 0.7376648783683777,
+ "num_tokens": 12615680.0,
+ "step": 770
+ },
+ {
+ "entropy": 1.1564687490463257,
+ "epoch": 1.5575757575757576,
+ "grad_norm": 2.0951433181762695,
+ "learning_rate": 9.62962962962963e-06,
+ "loss": 1.1778810024261475,
+ "mean_token_accuracy": 0.7112237215042114,
+ "num_tokens": 12632064.0,
+ "step": 771
+ },
+ {
+ "entropy": 0.8667913675308228,
+ "epoch": 1.5595959595959596,
+ "grad_norm": 1.9066787958145142,
+ "learning_rate": 9.616161616161616e-06,
+ "loss": 0.8634734153747559,
+ "mean_token_accuracy": 0.769052267074585,
+ "num_tokens": 12648448.0,
+ "step": 772
+ },
+ {
+ "entropy": 1.20845627784729,
+ "epoch": 1.5616161616161617,
+ "grad_norm": 2.0367836952209473,
+ "learning_rate": 9.602693602693603e-06,
+ "loss": 1.2191519737243652,
+ "mean_token_accuracy": 0.69840008020401,
+ "num_tokens": 12664832.0,
+ "step": 773
+ },
+ {
+ "entropy": 1.3325128555297852,
+ "epoch": 1.5636363636363635,
+ "grad_norm": 2.000307083129883,
+ "learning_rate": 9.589225589225591e-06,
+ "loss": 1.3183135986328125,
+ "mean_token_accuracy": 0.6904006004333496,
+ "num_tokens": 12681216.0,
+ "step": 774
+ },
+ {
+ "entropy": 1.3372687101364136,
+ "epoch": 1.5656565656565657,
+ "grad_norm": 2.2447569370269775,
+ "learning_rate": 9.575757575757576e-06,
+ "loss": 1.3026032447814941,
+ "mean_token_accuracy": 0.6769663095474243,
+ "num_tokens": 12697600.0,
+ "step": 775
+ },
+ {
+ "entropy": 1.1477705240249634,
+ "epoch": 1.5676767676767676,
+ "grad_norm": 1.9308643341064453,
+ "learning_rate": 9.562289562289562e-06,
+ "loss": 1.1485618352890015,
+ "mean_token_accuracy": 0.7186126112937927,
+ "num_tokens": 12713984.0,
+ "step": 776
+ },
+ {
+ "entropy": 1.021490454673767,
+ "epoch": 1.5696969696969698,
+ "grad_norm": 1.9314731359481812,
+ "learning_rate": 9.548821548821549e-06,
+ "loss": 1.002140998840332,
+ "mean_token_accuracy": 0.735344409942627,
+ "num_tokens": 12730368.0,
+ "step": 777
+ },
+ {
+ "entropy": 1.1351706981658936,
+ "epoch": 1.5717171717171716,
+ "grad_norm": 1.9402823448181152,
+ "learning_rate": 9.535353535353537e-06,
+ "loss": 1.1265199184417725,
+ "mean_token_accuracy": 0.716292142868042,
+ "num_tokens": 12746752.0,
+ "step": 778
+ },
+ {
+ "entropy": 0.9608347415924072,
+ "epoch": 1.5737373737373739,
+ "grad_norm": 1.9762189388275146,
+ "learning_rate": 9.521885521885522e-06,
+ "loss": 0.9408327341079712,
+ "mean_token_accuracy": 0.7556179761886597,
+ "num_tokens": 12763136.0,
+ "step": 779
+ },
+ {
+ "entropy": 1.2921335697174072,
+ "epoch": 1.5757575757575757,
+ "grad_norm": 1.9008197784423828,
+ "learning_rate": 9.508417508417508e-06,
+ "loss": 1.298734426498413,
+ "mean_token_accuracy": 0.6901563405990601,
+ "num_tokens": 12779520.0,
+ "step": 780
+ },
+ {
+ "entropy": 1.1303656101226807,
+ "epoch": 1.5777777777777777,
+ "grad_norm": 2.368401527404785,
+ "learning_rate": 9.494949494949497e-06,
+ "loss": 1.1172974109649658,
+ "mean_token_accuracy": 0.7112848162651062,
+ "num_tokens": 12795904.0,
+ "step": 781
+ },
+ {
+ "entropy": 1.5801783800125122,
+ "epoch": 1.5797979797979798,
+ "grad_norm": 2.1036503314971924,
+ "learning_rate": 9.481481481481483e-06,
+ "loss": 1.5825071334838867,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 12812288.0,
+ "step": 782
+ },
+ {
+ "entropy": 1.1247191429138184,
+ "epoch": 1.5818181818181818,
+ "grad_norm": 2.0482163429260254,
+ "learning_rate": 9.468013468013468e-06,
+ "loss": 1.1644407510757446,
+ "mean_token_accuracy": 0.7239863276481628,
+ "num_tokens": 12828672.0,
+ "step": 783
+ },
+ {
+ "entropy": 1.6274546384811401,
+ "epoch": 1.5838383838383838,
+ "grad_norm": 2.075209379196167,
+ "learning_rate": 9.454545454545456e-06,
+ "loss": 1.6390056610107422,
+ "mean_token_accuracy": 0.6265266537666321,
+ "num_tokens": 12845056.0,
+ "step": 784
+ },
+ {
+ "entropy": 1.1876834630966187,
+ "epoch": 1.5858585858585859,
+ "grad_norm": 2.3457517623901367,
+ "learning_rate": 9.441077441077442e-06,
+ "loss": 1.229914903640747,
+ "mean_token_accuracy": 0.686431348323822,
+ "num_tokens": 12861440.0,
+ "step": 785
+ },
+ {
+ "entropy": 1.0943474769592285,
+ "epoch": 1.587878787878788,
+ "grad_norm": 2.2637226581573486,
+ "learning_rate": 9.427609427609429e-06,
+ "loss": 1.1246657371520996,
+ "mean_token_accuracy": 0.7178187370300293,
+ "num_tokens": 12877824.0,
+ "step": 786
+ },
+ {
+ "entropy": 1.1606156826019287,
+ "epoch": 1.58989898989899,
+ "grad_norm": 2.1095638275146484,
+ "learning_rate": 9.414141414141414e-06,
+ "loss": 1.146558403968811,
+ "mean_token_accuracy": 0.7142769694328308,
+ "num_tokens": 12894208.0,
+ "step": 787
+ },
+ {
+ "entropy": 0.7914054989814758,
+ "epoch": 1.591919191919192,
+ "grad_norm": 2.0504069328308105,
+ "learning_rate": 9.400673400673402e-06,
+ "loss": 0.7990944385528564,
+ "mean_token_accuracy": 0.7863947153091431,
+ "num_tokens": 12910592.0,
+ "step": 788
+ },
+ {
+ "entropy": 1.2664366960525513,
+ "epoch": 1.593939393939394,
+ "grad_norm": 2.174043893814087,
+ "learning_rate": 9.387205387205388e-06,
+ "loss": 1.263155221939087,
+ "mean_token_accuracy": 0.6905227303504944,
+ "num_tokens": 12926976.0,
+ "step": 789
+ },
+ {
+ "entropy": 1.6059703826904297,
+ "epoch": 1.595959595959596,
+ "grad_norm": 2.0089824199676514,
+ "learning_rate": 9.373737373737375e-06,
+ "loss": 1.628819465637207,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 12943360.0,
+ "step": 790
+ },
+ {
+ "entropy": 1.4796923398971558,
+ "epoch": 1.5979797979797978,
+ "grad_norm": 2.4513726234436035,
+ "learning_rate": 9.360269360269361e-06,
+ "loss": 1.5144509077072144,
+ "mean_token_accuracy": 0.6381289958953857,
+ "num_tokens": 12959744.0,
+ "step": 791
+ },
+ {
+ "entropy": 1.1704087257385254,
+ "epoch": 1.6,
+ "grad_norm": 2.079355478286743,
+ "learning_rate": 9.346801346801348e-06,
+ "loss": 1.1726913452148438,
+ "mean_token_accuracy": 0.709208607673645,
+ "num_tokens": 12976128.0,
+ "step": 792
+ },
+ {
+ "entropy": 1.2573802471160889,
+ "epoch": 1.602020202020202,
+ "grad_norm": 2.087904453277588,
+ "learning_rate": 9.333333333333334e-06,
+ "loss": 1.2652850151062012,
+ "mean_token_accuracy": 0.6868588328361511,
+ "num_tokens": 12992512.0,
+ "step": 793
+ },
+ {
+ "entropy": 1.5265566110610962,
+ "epoch": 1.6040404040404042,
+ "grad_norm": 2.1586968898773193,
+ "learning_rate": 9.31986531986532e-06,
+ "loss": 1.5234975814819336,
+ "mean_token_accuracy": 0.6436248421669006,
+ "num_tokens": 13008896.0,
+ "step": 794
+ },
+ {
+ "entropy": 1.2587038278579712,
+ "epoch": 1.606060606060606,
+ "grad_norm": 2.0685694217681885,
+ "learning_rate": 9.306397306397307e-06,
+ "loss": 1.2585840225219727,
+ "mean_token_accuracy": 0.6930874586105347,
+ "num_tokens": 13025280.0,
+ "step": 795
+ },
+ {
+ "entropy": 1.1857022047042847,
+ "epoch": 1.6080808080808082,
+ "grad_norm": 2.0476908683776855,
+ "learning_rate": 9.292929292929294e-06,
+ "loss": 1.2005798816680908,
+ "mean_token_accuracy": 0.693453848361969,
+ "num_tokens": 13041664.0,
+ "step": 796
+ },
+ {
+ "entropy": 1.5042216777801514,
+ "epoch": 1.61010101010101,
+ "grad_norm": 1.973929762840271,
+ "learning_rate": 9.27946127946128e-06,
+ "loss": 1.5095748901367188,
+ "mean_token_accuracy": 0.6579140424728394,
+ "num_tokens": 13058048.0,
+ "step": 797
+ },
+ {
+ "entropy": 1.5203564167022705,
+ "epoch": 1.612121212121212,
+ "grad_norm": 1.957383155822754,
+ "learning_rate": 9.265993265993267e-06,
+ "loss": 1.4991892576217651,
+ "mean_token_accuracy": 0.6539447903633118,
+ "num_tokens": 13074432.0,
+ "step": 798
+ },
+ {
+ "entropy": 1.3984291553497314,
+ "epoch": 1.614141414141414,
+ "grad_norm": 2.143216848373413,
+ "learning_rate": 9.252525252525253e-06,
+ "loss": 1.3863308429718018,
+ "mean_token_accuracy": 0.6649364829063416,
+ "num_tokens": 13090816.0,
+ "step": 799
+ },
+ {
+ "entropy": 1.662933111190796,
+ "epoch": 1.6161616161616161,
+ "grad_norm": 2.111069440841675,
+ "learning_rate": 9.23905723905724e-06,
+ "loss": 1.6813087463378906,
+ "mean_token_accuracy": 0.6262823939323425,
+ "num_tokens": 13107200.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.6161616161616161,
+ "eval_entropy": 1.3006088190501737,
+ "eval_loss": 1.5314096212387085,
+ "eval_mean_token_accuracy": 0.6469700956536878,
+ "eval_num_tokens": 13107200.0,
+ "eval_runtime": 43.8956,
+ "eval_samples_per_second": 22.554,
+ "eval_steps_per_second": 2.825,
+ "step": 800
+ },
+ {
+ "entropy": 1.709677815437317,
+ "epoch": 1.6181818181818182,
+ "grad_norm": 2.790998935699463,
+ "learning_rate": 9.225589225589226e-06,
+ "loss": 1.740628719329834,
+ "mean_token_accuracy": 0.6136419177055359,
+ "num_tokens": 13123584.0,
+ "step": 801
+ },
+ {
+ "entropy": 1.2373168468475342,
+ "epoch": 1.6202020202020202,
+ "grad_norm": 2.49934458732605,
+ "learning_rate": 9.212121212121213e-06,
+ "loss": 1.2430124282836914,
+ "mean_token_accuracy": 0.6856985688209534,
+ "num_tokens": 13139968.0,
+ "step": 802
+ },
+ {
+ "entropy": 1.4974594116210938,
+ "epoch": 1.6222222222222222,
+ "grad_norm": 2.015254259109497,
+ "learning_rate": 9.1986531986532e-06,
+ "loss": 1.5037147998809814,
+ "mean_token_accuracy": 0.6581583023071289,
+ "num_tokens": 13156352.0,
+ "step": 803
+ },
+ {
+ "entropy": 1.0019752979278564,
+ "epoch": 1.6242424242424243,
+ "grad_norm": 1.9795469045639038,
+ "learning_rate": 9.185185185185186e-06,
+ "loss": 1.0053883790969849,
+ "mean_token_accuracy": 0.7297264337539673,
+ "num_tokens": 13172736.0,
+ "step": 804
+ },
+ {
+ "entropy": 1.2690199613571167,
+ "epoch": 1.6262626262626263,
+ "grad_norm": 2.1013784408569336,
+ "learning_rate": 9.171717171717172e-06,
+ "loss": 1.2500054836273193,
+ "mean_token_accuracy": 0.6856985688209534,
+ "num_tokens": 13189120.0,
+ "step": 805
+ },
+ {
+ "entropy": 1.1282989978790283,
+ "epoch": 1.6282828282828283,
+ "grad_norm": 2.2034029960632324,
+ "learning_rate": 9.15824915824916e-06,
+ "loss": 1.1393691301345825,
+ "mean_token_accuracy": 0.7051783204078674,
+ "num_tokens": 13205504.0,
+ "step": 806
+ },
+ {
+ "entropy": 1.1744720935821533,
+ "epoch": 1.6303030303030304,
+ "grad_norm": 1.9687124490737915,
+ "learning_rate": 9.144781144781145e-06,
+ "loss": 1.1625237464904785,
+ "mean_token_accuracy": 0.7002931237220764,
+ "num_tokens": 13221888.0,
+ "step": 807
+ },
+ {
+ "entropy": 0.9849017858505249,
+ "epoch": 1.6323232323232322,
+ "grad_norm": 1.9646586179733276,
+ "learning_rate": 9.131313131313132e-06,
+ "loss": 0.9992689490318298,
+ "mean_token_accuracy": 0.7460307478904724,
+ "num_tokens": 13238272.0,
+ "step": 808
+ },
+ {
+ "entropy": 1.142819881439209,
+ "epoch": 1.6343434343434344,
+ "grad_norm": 1.975189208984375,
+ "learning_rate": 9.117845117845118e-06,
+ "loss": 1.1389580965042114,
+ "mean_token_accuracy": 0.710368812084198,
+ "num_tokens": 13254656.0,
+ "step": 809
+ },
+ {
+ "entropy": 1.1362377405166626,
+ "epoch": 1.6363636363636362,
+ "grad_norm": 2.0360374450683594,
+ "learning_rate": 9.104377104377106e-06,
+ "loss": 1.15363609790802,
+ "mean_token_accuracy": 0.7113458514213562,
+ "num_tokens": 13271040.0,
+ "step": 810
+ },
+ {
+ "entropy": 1.6209924221038818,
+ "epoch": 1.6383838383838385,
+ "grad_norm": 2.2165496349334717,
+ "learning_rate": 9.090909090909091e-06,
+ "loss": 1.637102484703064,
+ "mean_token_accuracy": 0.6318392753601074,
+ "num_tokens": 13287424.0,
+ "step": 811
+ },
+ {
+ "entropy": 1.050283432006836,
+ "epoch": 1.6404040404040403,
+ "grad_norm": 2.0473668575286865,
+ "learning_rate": 9.077441077441078e-06,
+ "loss": 1.0430940389633179,
+ "mean_token_accuracy": 0.7264899611473083,
+ "num_tokens": 13303808.0,
+ "step": 812
+ },
+ {
+ "entropy": 1.0707964897155762,
+ "epoch": 1.6424242424242426,
+ "grad_norm": 2.013641357421875,
+ "learning_rate": 9.063973063973066e-06,
+ "loss": 1.0929813385009766,
+ "mean_token_accuracy": 0.7231924533843994,
+ "num_tokens": 13320192.0,
+ "step": 813
+ },
+ {
+ "entropy": 0.8777739405632019,
+ "epoch": 1.6444444444444444,
+ "grad_norm": 1.815849781036377,
+ "learning_rate": 9.050505050505052e-06,
+ "loss": 0.868852972984314,
+ "mean_token_accuracy": 0.7692965269088745,
+ "num_tokens": 13336576.0,
+ "step": 814
+ },
+ {
+ "entropy": 1.1157307624816895,
+ "epoch": 1.6464646464646466,
+ "grad_norm": 2.1264355182647705,
+ "learning_rate": 9.037037037037037e-06,
+ "loss": 1.1249959468841553,
+ "mean_token_accuracy": 0.7153151035308838,
+ "num_tokens": 13352960.0,
+ "step": 815
+ },
+ {
+ "entropy": 1.348052740097046,
+ "epoch": 1.6484848484848484,
+ "grad_norm": 1.951642394065857,
+ "learning_rate": 9.023569023569025e-06,
+ "loss": 1.3196947574615479,
+ "mean_token_accuracy": 0.6911333799362183,
+ "num_tokens": 13369344.0,
+ "step": 816
+ },
+ {
+ "entropy": 1.2172725200653076,
+ "epoch": 1.6505050505050505,
+ "grad_norm": 2.2433671951293945,
+ "learning_rate": 9.010101010101012e-06,
+ "loss": 1.1833471059799194,
+ "mean_token_accuracy": 0.6938812732696533,
+ "num_tokens": 13385728.0,
+ "step": 817
+ },
+ {
+ "entropy": 1.5047324895858765,
+ "epoch": 1.6525252525252525,
+ "grad_norm": 2.015489101409912,
+ "learning_rate": 8.996632996632996e-06,
+ "loss": 1.48842453956604,
+ "mean_token_accuracy": 0.6552271842956543,
+ "num_tokens": 13402112.0,
+ "step": 818
+ },
+ {
+ "entropy": 1.3752695322036743,
+ "epoch": 1.6545454545454545,
+ "grad_norm": 2.024895191192627,
+ "learning_rate": 8.983164983164983e-06,
+ "loss": 1.3467098474502563,
+ "mean_token_accuracy": 0.681546151638031,
+ "num_tokens": 13418496.0,
+ "step": 819
+ },
+ {
+ "entropy": 1.1657299995422363,
+ "epoch": 1.6565656565656566,
+ "grad_norm": 2.4099085330963135,
+ "learning_rate": 8.969696969696971e-06,
+ "loss": 1.1612054109573364,
+ "mean_token_accuracy": 0.696140706539154,
+ "num_tokens": 13434880.0,
+ "step": 820
+ },
+ {
+ "entropy": 1.3764209747314453,
+ "epoch": 1.6585858585858586,
+ "grad_norm": 1.9971355199813843,
+ "learning_rate": 8.956228956228958e-06,
+ "loss": 1.3754298686981201,
+ "mean_token_accuracy": 0.6687836050987244,
+ "num_tokens": 13451264.0,
+ "step": 821
+ },
+ {
+ "entropy": 1.2135001420974731,
+ "epoch": 1.6606060606060606,
+ "grad_norm": 1.9414972066879272,
+ "learning_rate": 8.942760942760942e-06,
+ "loss": 1.2148737907409668,
+ "mean_token_accuracy": 0.7018808126449585,
+ "num_tokens": 13467648.0,
+ "step": 822
+ },
+ {
+ "entropy": 1.2993255853652954,
+ "epoch": 1.6626262626262627,
+ "grad_norm": 2.149869203567505,
+ "learning_rate": 8.92929292929293e-06,
+ "loss": 1.2947715520858765,
+ "mean_token_accuracy": 0.6836223602294922,
+ "num_tokens": 13484032.0,
+ "step": 823
+ },
+ {
+ "entropy": 1.2745556831359863,
+ "epoch": 1.6646464646464647,
+ "grad_norm": 2.1189515590667725,
+ "learning_rate": 8.915824915824917e-06,
+ "loss": 1.2992188930511475,
+ "mean_token_accuracy": 0.6871030926704407,
+ "num_tokens": 13500416.0,
+ "step": 824
+ },
+ {
+ "entropy": 1.1959195137023926,
+ "epoch": 1.6666666666666665,
+ "grad_norm": 2.2528860569000244,
+ "learning_rate": 8.902356902356904e-06,
+ "loss": 1.200485110282898,
+ "mean_token_accuracy": 0.6969956159591675,
+ "num_tokens": 13516800.0,
+ "step": 825
+ },
+ {
+ "entropy": 1.358959674835205,
+ "epoch": 1.6686868686868688,
+ "grad_norm": 2.0133697986602783,
+ "learning_rate": 8.888888888888888e-06,
+ "loss": 1.3683624267578125,
+ "mean_token_accuracy": 0.6767830848693848,
+ "num_tokens": 13533184.0,
+ "step": 826
+ },
+ {
+ "entropy": 1.4699946641921997,
+ "epoch": 1.6707070707070706,
+ "grad_norm": 1.9599978923797607,
+ "learning_rate": 8.875420875420876e-06,
+ "loss": 1.4912409782409668,
+ "mean_token_accuracy": 0.663593053817749,
+ "num_tokens": 13549568.0,
+ "step": 827
+ },
+ {
+ "entropy": 1.1315391063690186,
+ "epoch": 1.6727272727272728,
+ "grad_norm": 2.053920269012451,
+ "learning_rate": 8.861952861952863e-06,
+ "loss": 1.140032172203064,
+ "mean_token_accuracy": 0.7090864777565002,
+ "num_tokens": 13565952.0,
+ "step": 828
+ },
+ {
+ "entropy": 1.5379900932312012,
+ "epoch": 1.6747474747474747,
+ "grad_norm": 2.007784128189087,
+ "learning_rate": 8.84848484848485e-06,
+ "loss": 1.5630019903182983,
+ "mean_token_accuracy": 0.6397777199745178,
+ "num_tokens": 13582336.0,
+ "step": 829
+ },
+ {
+ "entropy": 1.241722822189331,
+ "epoch": 1.676767676767677,
+ "grad_norm": 2.060314416885376,
+ "learning_rate": 8.835016835016836e-06,
+ "loss": 1.24226975440979,
+ "mean_token_accuracy": 0.691316545009613,
+ "num_tokens": 13598720.0,
+ "step": 830
+ },
+ {
+ "entropy": 1.0310786962509155,
+ "epoch": 1.6787878787878787,
+ "grad_norm": 1.9201405048370361,
+ "learning_rate": 8.821548821548822e-06,
+ "loss": 1.0244829654693604,
+ "mean_token_accuracy": 0.7352222800254822,
+ "num_tokens": 13615104.0,
+ "step": 831
+ },
+ {
+ "entropy": 0.8319131731987,
+ "epoch": 1.680808080808081,
+ "grad_norm": 1.8874962329864502,
+ "learning_rate": 8.808080808080809e-06,
+ "loss": 0.8486998081207275,
+ "mean_token_accuracy": 0.7804714441299438,
+ "num_tokens": 13631488.0,
+ "step": 832
+ },
+ {
+ "entropy": 1.3878363370895386,
+ "epoch": 1.6828282828282828,
+ "grad_norm": 2.034135580062866,
+ "learning_rate": 8.794612794612795e-06,
+ "loss": 1.389417052268982,
+ "mean_token_accuracy": 0.6738519668579102,
+ "num_tokens": 13647872.0,
+ "step": 833
+ },
+ {
+ "entropy": 1.2692970037460327,
+ "epoch": 1.6848484848484848,
+ "grad_norm": 2.251734972000122,
+ "learning_rate": 8.781144781144782e-06,
+ "loss": 1.3026533126831055,
+ "mean_token_accuracy": 0.6725085377693176,
+ "num_tokens": 13664256.0,
+ "step": 834
+ },
+ {
+ "entropy": 1.030187726020813,
+ "epoch": 1.6868686868686869,
+ "grad_norm": 2.072669506072998,
+ "learning_rate": 8.767676767676768e-06,
+ "loss": 1.0316928625106812,
+ "mean_token_accuracy": 0.7219711542129517,
+ "num_tokens": 13680640.0,
+ "step": 835
+ },
+ {
+ "entropy": 0.9987007975578308,
+ "epoch": 1.6888888888888889,
+ "grad_norm": 1.9975026845932007,
+ "learning_rate": 8.754208754208755e-06,
+ "loss": 0.9982929229736328,
+ "mean_token_accuracy": 0.7407181262969971,
+ "num_tokens": 13697024.0,
+ "step": 836
+ },
+ {
+ "entropy": 1.335033655166626,
+ "epoch": 1.690909090909091,
+ "grad_norm": 2.9397995471954346,
+ "learning_rate": 8.740740740740741e-06,
+ "loss": 1.3791459798812866,
+ "mean_token_accuracy": 0.6587689518928528,
+ "num_tokens": 13713408.0,
+ "step": 837
+ },
+ {
+ "entropy": 1.064363718032837,
+ "epoch": 1.692929292929293,
+ "grad_norm": 1.859521508216858,
+ "learning_rate": 8.727272727272728e-06,
+ "loss": 1.0654652118682861,
+ "mean_token_accuracy": 0.7314362525939941,
+ "num_tokens": 13729792.0,
+ "step": 838
+ },
+ {
+ "entropy": 1.2016503810882568,
+ "epoch": 1.694949494949495,
+ "grad_norm": 1.9492405652999878,
+ "learning_rate": 8.713804713804714e-06,
+ "loss": 1.2206454277038574,
+ "mean_token_accuracy": 0.6963849663734436,
+ "num_tokens": 13746176.0,
+ "step": 839
+ },
+ {
+ "entropy": 1.0941510200500488,
+ "epoch": 1.696969696969697,
+ "grad_norm": 1.9697571992874146,
+ "learning_rate": 8.7003367003367e-06,
+ "loss": 1.0997231006622314,
+ "mean_token_accuracy": 0.7194675207138062,
+ "num_tokens": 13762560.0,
+ "step": 840
+ },
+ {
+ "entropy": 1.2805196046829224,
+ "epoch": 1.698989898989899,
+ "grad_norm": 2.183673620223999,
+ "learning_rate": 8.686868686868687e-06,
+ "loss": 1.2889196872711182,
+ "mean_token_accuracy": 0.6751953959465027,
+ "num_tokens": 13778944.0,
+ "step": 841
+ },
+ {
+ "entropy": 1.3549253940582275,
+ "epoch": 1.7010101010101009,
+ "grad_norm": 2.1223721504211426,
+ "learning_rate": 8.673400673400674e-06,
+ "loss": 1.351933240890503,
+ "mean_token_accuracy": 0.6756228804588318,
+ "num_tokens": 13795328.0,
+ "step": 842
+ },
+ {
+ "entropy": 1.333280324935913,
+ "epoch": 1.7030303030303031,
+ "grad_norm": 2.0345280170440674,
+ "learning_rate": 8.65993265993266e-06,
+ "loss": 1.3359044790267944,
+ "mean_token_accuracy": 0.6783707737922668,
+ "num_tokens": 13811712.0,
+ "step": 843
+ },
+ {
+ "entropy": 1.0658303499221802,
+ "epoch": 1.705050505050505,
+ "grad_norm": 1.926890254020691,
+ "learning_rate": 8.646464646464647e-06,
+ "loss": 1.0638974905014038,
+ "mean_token_accuracy": 0.7286272644996643,
+ "num_tokens": 13828096.0,
+ "step": 844
+ },
+ {
+ "entropy": 0.9549879431724548,
+ "epoch": 1.7070707070707072,
+ "grad_norm": 2.124664306640625,
+ "learning_rate": 8.632996632996635e-06,
+ "loss": 0.9564298987388611,
+ "mean_token_accuracy": 0.7528700828552246,
+ "num_tokens": 13844480.0,
+ "step": 845
+ },
+ {
+ "entropy": 1.6893866062164307,
+ "epoch": 1.709090909090909,
+ "grad_norm": 2.070680856704712,
+ "learning_rate": 8.61952861952862e-06,
+ "loss": 1.6929473876953125,
+ "mean_token_accuracy": 0.6165730357170105,
+ "num_tokens": 13860864.0,
+ "step": 846
+ },
+ {
+ "entropy": 0.8587391972541809,
+ "epoch": 1.7111111111111112,
+ "grad_norm": 1.9683139324188232,
+ "learning_rate": 8.606060606060606e-06,
+ "loss": 0.8467673659324646,
+ "mean_token_accuracy": 0.7707620859146118,
+ "num_tokens": 13877248.0,
+ "step": 847
+ },
+ {
+ "entropy": 1.6370538473129272,
+ "epoch": 1.713131313131313,
+ "grad_norm": 2.1608047485351562,
+ "learning_rate": 8.592592592592593e-06,
+ "loss": 1.6496617794036865,
+ "mean_token_accuracy": 0.6143136024475098,
+ "num_tokens": 13893632.0,
+ "step": 848
+ },
+ {
+ "entropy": 1.23484206199646,
+ "epoch": 1.7151515151515153,
+ "grad_norm": 2.0296223163604736,
+ "learning_rate": 8.57912457912458e-06,
+ "loss": 1.2227973937988281,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 13910016.0,
+ "step": 849
+ },
+ {
+ "entropy": 1.2687101364135742,
+ "epoch": 1.7171717171717171,
+ "grad_norm": 2.204806089401245,
+ "learning_rate": 8.565656565656566e-06,
+ "loss": 1.2694804668426514,
+ "mean_token_accuracy": 0.6865534782409668,
+ "num_tokens": 13926400.0,
+ "step": 850
+ },
+ {
+ "entropy": 1.2225878238677979,
+ "epoch": 1.7191919191919192,
+ "grad_norm": 2.1541168689727783,
+ "learning_rate": 8.552188552188552e-06,
+ "loss": 1.2527751922607422,
+ "mean_token_accuracy": 0.6800195574760437,
+ "num_tokens": 13942784.0,
+ "step": 851
+ },
+ {
+ "entropy": 1.2106293439865112,
+ "epoch": 1.7212121212121212,
+ "grad_norm": 2.0455424785614014,
+ "learning_rate": 8.53872053872054e-06,
+ "loss": 1.2005270719528198,
+ "mean_token_accuracy": 0.6949804425239563,
+ "num_tokens": 13959168.0,
+ "step": 852
+ },
+ {
+ "entropy": 1.169908046722412,
+ "epoch": 1.7232323232323232,
+ "grad_norm": 2.0055043697357178,
+ "learning_rate": 8.525252525252527e-06,
+ "loss": 1.1640398502349854,
+ "mean_token_accuracy": 0.7149487137794495,
+ "num_tokens": 13975552.0,
+ "step": 853
+ },
+ {
+ "entropy": 1.1458942890167236,
+ "epoch": 1.7252525252525253,
+ "grad_norm": 2.0365331172943115,
+ "learning_rate": 8.511784511784512e-06,
+ "loss": 1.1413549184799194,
+ "mean_token_accuracy": 0.7126282453536987,
+ "num_tokens": 13991936.0,
+ "step": 854
+ },
+ {
+ "entropy": 0.8760596513748169,
+ "epoch": 1.7272727272727273,
+ "grad_norm": 1.9858993291854858,
+ "learning_rate": 8.4983164983165e-06,
+ "loss": 0.8733371496200562,
+ "mean_token_accuracy": 0.760869562625885,
+ "num_tokens": 14008320.0,
+ "step": 855
+ },
+ {
+ "entropy": 1.3949522972106934,
+ "epoch": 1.7292929292929293,
+ "grad_norm": 2.6730244159698486,
+ "learning_rate": 8.484848484848486e-06,
+ "loss": 1.4128756523132324,
+ "mean_token_accuracy": 0.6792256832122803,
+ "num_tokens": 14024704.0,
+ "step": 856
+ },
+ {
+ "entropy": 1.4345626831054688,
+ "epoch": 1.7313131313131314,
+ "grad_norm": 1.9446519613265991,
+ "learning_rate": 8.471380471380473e-06,
+ "loss": 1.450282096862793,
+ "mean_token_accuracy": 0.664631187915802,
+ "num_tokens": 14041088.0,
+ "step": 857
+ },
+ {
+ "entropy": 1.1180377006530762,
+ "epoch": 1.7333333333333334,
+ "grad_norm": 2.051783323287964,
+ "learning_rate": 8.457912457912457e-06,
+ "loss": 1.1588772535324097,
+ "mean_token_accuracy": 0.7128114104270935,
+ "num_tokens": 14057472.0,
+ "step": 858
+ },
+ {
+ "entropy": 1.2605851888656616,
+ "epoch": 1.7353535353535352,
+ "grad_norm": 2.0577232837677,
+ "learning_rate": 8.444444444444446e-06,
+ "loss": 1.2173504829406738,
+ "mean_token_accuracy": 0.6938812732696533,
+ "num_tokens": 14073856.0,
+ "step": 859
+ },
+ {
+ "entropy": 1.2957148551940918,
+ "epoch": 1.7373737373737375,
+ "grad_norm": 2.14068603515625,
+ "learning_rate": 8.430976430976432e-06,
+ "loss": 1.301836609840393,
+ "mean_token_accuracy": 0.6832559704780579,
+ "num_tokens": 14090240.0,
+ "step": 860
+ },
+ {
+ "entropy": 0.9871225953102112,
+ "epoch": 1.7393939393939393,
+ "grad_norm": 1.9262301921844482,
+ "learning_rate": 8.417508417508419e-06,
+ "loss": 1.0081474781036377,
+ "mean_token_accuracy": 0.7432828545570374,
+ "num_tokens": 14106624.0,
+ "step": 861
+ },
+ {
+ "entropy": 1.2774608135223389,
+ "epoch": 1.7414141414141415,
+ "grad_norm": 1.8633641004562378,
+ "learning_rate": 8.404040404040405e-06,
+ "loss": 1.2942487001419067,
+ "mean_token_accuracy": 0.6910722851753235,
+ "num_tokens": 14123008.0,
+ "step": 862
+ },
+ {
+ "entropy": 1.3229460716247559,
+ "epoch": 1.7434343434343433,
+ "grad_norm": 2.1861679553985596,
+ "learning_rate": 8.390572390572392e-06,
+ "loss": 1.3244147300720215,
+ "mean_token_accuracy": 0.6719589829444885,
+ "num_tokens": 14139392.0,
+ "step": 863
+ },
+ {
+ "entropy": 1.306138277053833,
+ "epoch": 1.7454545454545456,
+ "grad_norm": 2.1364035606384277,
+ "learning_rate": 8.377104377104378e-06,
+ "loss": 1.3266233205795288,
+ "mean_token_accuracy": 0.6864924430847168,
+ "num_tokens": 14155776.0,
+ "step": 864
+ },
+ {
+ "entropy": 0.9926152229309082,
+ "epoch": 1.7474747474747474,
+ "grad_norm": 1.784975528717041,
+ "learning_rate": 8.363636363636365e-06,
+ "loss": 1.0243797302246094,
+ "mean_token_accuracy": 0.7546409368515015,
+ "num_tokens": 14172160.0,
+ "step": 865
+ },
+ {
+ "entropy": 1.7003151178359985,
+ "epoch": 1.7494949494949497,
+ "grad_norm": 2.081186056137085,
+ "learning_rate": 8.350168350168351e-06,
+ "loss": 1.699352502822876,
+ "mean_token_accuracy": 0.6183438897132874,
+ "num_tokens": 14188544.0,
+ "step": 866
+ },
+ {
+ "entropy": 1.7050426006317139,
+ "epoch": 1.7515151515151515,
+ "grad_norm": 1.8780465126037598,
+ "learning_rate": 8.336700336700338e-06,
+ "loss": 1.7067642211914062,
+ "mean_token_accuracy": 0.6159623861312866,
+ "num_tokens": 14204928.0,
+ "step": 867
+ },
+ {
+ "entropy": 1.0717660188674927,
+ "epoch": 1.7535353535353535,
+ "grad_norm": 2.0461418628692627,
+ "learning_rate": 8.323232323232324e-06,
+ "loss": 1.0874615907669067,
+ "mean_token_accuracy": 0.7315583825111389,
+ "num_tokens": 14221312.0,
+ "step": 868
+ },
+ {
+ "entropy": 1.3650007247924805,
+ "epoch": 1.7555555555555555,
+ "grad_norm": 1.9097316265106201,
+ "learning_rate": 8.30976430976431e-06,
+ "loss": 1.3483806848526,
+ "mean_token_accuracy": 0.6889350414276123,
+ "num_tokens": 14237696.0,
+ "step": 869
+ },
+ {
+ "entropy": 0.9856852293014526,
+ "epoch": 1.7575757575757576,
+ "grad_norm": 1.9712227582931519,
+ "learning_rate": 8.296296296296297e-06,
+ "loss": 0.975986897945404,
+ "mean_token_accuracy": 0.7417562007904053,
+ "num_tokens": 14254080.0,
+ "step": 870
+ },
+ {
+ "entropy": 0.8876434564590454,
+ "epoch": 1.7595959595959596,
+ "grad_norm": 1.8536908626556396,
+ "learning_rate": 8.282828282828283e-06,
+ "loss": 0.8868429660797119,
+ "mean_token_accuracy": 0.7714338302612305,
+ "num_tokens": 14270464.0,
+ "step": 871
+ },
+ {
+ "entropy": 0.7506260871887207,
+ "epoch": 1.7616161616161616,
+ "grad_norm": 1.7068337202072144,
+ "learning_rate": 8.26936026936027e-06,
+ "loss": 0.7422510385513306,
+ "mean_token_accuracy": 0.8030654788017273,
+ "num_tokens": 14286848.0,
+ "step": 872
+ },
+ {
+ "entropy": 1.726669192314148,
+ "epoch": 1.7636363636363637,
+ "grad_norm": 2.157275676727295,
+ "learning_rate": 8.255892255892256e-06,
+ "loss": 1.7225112915039062,
+ "mean_token_accuracy": 0.6207864880561829,
+ "num_tokens": 14303232.0,
+ "step": 873
+ },
+ {
+ "entropy": 0.8383756279945374,
+ "epoch": 1.7656565656565657,
+ "grad_norm": 1.8378020524978638,
+ "learning_rate": 8.242424242424243e-06,
+ "loss": 0.8363397717475891,
+ "mean_token_accuracy": 0.772838294506073,
+ "num_tokens": 14319616.0,
+ "step": 874
+ },
+ {
+ "entropy": 1.1146882772445679,
+ "epoch": 1.7676767676767677,
+ "grad_norm": 2.144796371459961,
+ "learning_rate": 8.22895622895623e-06,
+ "loss": 1.124634027481079,
+ "mean_token_accuracy": 0.711467981338501,
+ "num_tokens": 14336000.0,
+ "step": 875
+ },
+ {
+ "entropy": 1.4330589771270752,
+ "epoch": 1.7696969696969695,
+ "grad_norm": 2.268897533416748,
+ "learning_rate": 8.215488215488216e-06,
+ "loss": 1.4430513381958008,
+ "mean_token_accuracy": 0.6437469720840454,
+ "num_tokens": 14352384.0,
+ "step": 876
+ },
+ {
+ "entropy": 1.1955921649932861,
+ "epoch": 1.7717171717171718,
+ "grad_norm": 2.109701156616211,
+ "learning_rate": 8.202020202020202e-06,
+ "loss": 1.1778371334075928,
+ "mean_token_accuracy": 0.6951025724411011,
+ "num_tokens": 14368768.0,
+ "step": 877
+ },
+ {
+ "entropy": 1.0419657230377197,
+ "epoch": 1.7737373737373736,
+ "grad_norm": 2.002164840698242,
+ "learning_rate": 8.188552188552189e-06,
+ "loss": 1.0472073554992676,
+ "mean_token_accuracy": 0.7313751578330994,
+ "num_tokens": 14385152.0,
+ "step": 878
+ },
+ {
+ "entropy": 1.324011206626892,
+ "epoch": 1.7757575757575759,
+ "grad_norm": 2.233525514602661,
+ "learning_rate": 8.175084175084175e-06,
+ "loss": 1.3433442115783691,
+ "mean_token_accuracy": 0.666890561580658,
+ "num_tokens": 14401536.0,
+ "step": 879
+ },
+ {
+ "entropy": 1.0424224138259888,
+ "epoch": 1.7777777777777777,
+ "grad_norm": 1.8213649988174438,
+ "learning_rate": 8.161616161616162e-06,
+ "loss": 1.0525646209716797,
+ "mean_token_accuracy": 0.7383976578712463,
+ "num_tokens": 14417920.0,
+ "step": 880
+ },
+ {
+ "entropy": 1.3322721719741821,
+ "epoch": 1.77979797979798,
+ "grad_norm": 2.0028865337371826,
+ "learning_rate": 8.148148148148148e-06,
+ "loss": 1.356465458869934,
+ "mean_token_accuracy": 0.6836223602294922,
+ "num_tokens": 14434304.0,
+ "step": 881
+ },
+ {
+ "entropy": 1.2495578527450562,
+ "epoch": 1.7818181818181817,
+ "grad_norm": 2.021883249282837,
+ "learning_rate": 8.134680134680135e-06,
+ "loss": 1.2500100135803223,
+ "mean_token_accuracy": 0.7239863276481628,
+ "num_tokens": 14450688.0,
+ "step": 882
+ },
+ {
+ "entropy": 1.3212776184082031,
+ "epoch": 1.783838383838384,
+ "grad_norm": 1.932453989982605,
+ "learning_rate": 8.121212121212121e-06,
+ "loss": 1.3274552822113037,
+ "mean_token_accuracy": 0.6889350414276123,
+ "num_tokens": 14467072.0,
+ "step": 883
+ },
+ {
+ "entropy": 1.1536792516708374,
+ "epoch": 1.7858585858585858,
+ "grad_norm": 1.944832682609558,
+ "learning_rate": 8.10774410774411e-06,
+ "loss": 1.1310882568359375,
+ "mean_token_accuracy": 0.7239863276481628,
+ "num_tokens": 14483456.0,
+ "step": 884
+ },
+ {
+ "entropy": 1.335244059562683,
+ "epoch": 1.7878787878787878,
+ "grad_norm": 1.9081436395645142,
+ "learning_rate": 8.094276094276094e-06,
+ "loss": 1.3430235385894775,
+ "mean_token_accuracy": 0.6779433488845825,
+ "num_tokens": 14499840.0,
+ "step": 885
+ },
+ {
+ "entropy": 0.9776304364204407,
+ "epoch": 1.7898989898989899,
+ "grad_norm": 2.077418088912964,
+ "learning_rate": 8.08080808080808e-06,
+ "loss": 0.9834706783294678,
+ "mean_token_accuracy": 0.7418172955513,
+ "num_tokens": 14516224.0,
+ "step": 886
+ },
+ {
+ "entropy": 0.9367865920066833,
+ "epoch": 1.791919191919192,
+ "grad_norm": 1.9657868146896362,
+ "learning_rate": 8.067340067340069e-06,
+ "loss": 0.9443397521972656,
+ "mean_token_accuracy": 0.7449926733970642,
+ "num_tokens": 14532608.0,
+ "step": 887
+ },
+ {
+ "entropy": 1.352593183517456,
+ "epoch": 1.793939393939394,
+ "grad_norm": 2.039900779724121,
+ "learning_rate": 8.053872053872055e-06,
+ "loss": 1.3500186204910278,
+ "mean_token_accuracy": 0.6840498447418213,
+ "num_tokens": 14548992.0,
+ "step": 888
+ },
+ {
+ "entropy": 1.21983802318573,
+ "epoch": 1.795959595959596,
+ "grad_norm": 2.04494309425354,
+ "learning_rate": 8.04040404040404e-06,
+ "loss": 1.2253628969192505,
+ "mean_token_accuracy": 0.6975451707839966,
+ "num_tokens": 14565376.0,
+ "step": 889
+ },
+ {
+ "entropy": 1.1911543607711792,
+ "epoch": 1.797979797979798,
+ "grad_norm": 2.09802508354187,
+ "learning_rate": 8.026936026936027e-06,
+ "loss": 1.2186518907546997,
+ "mean_token_accuracy": 0.6941866278648376,
+ "num_tokens": 14581760.0,
+ "step": 890
+ },
+ {
+ "entropy": 1.2681410312652588,
+ "epoch": 1.8,
+ "grad_norm": 2.242945432662964,
+ "learning_rate": 8.013468013468015e-06,
+ "loss": 1.2717292308807373,
+ "mean_token_accuracy": 0.6806302070617676,
+ "num_tokens": 14598144.0,
+ "step": 891
+ },
+ {
+ "entropy": 1.0779279470443726,
+ "epoch": 1.802020202020202,
+ "grad_norm": 2.0271153450012207,
+ "learning_rate": 8.000000000000001e-06,
+ "loss": 1.070134162902832,
+ "mean_token_accuracy": 0.7261846661567688,
+ "num_tokens": 14614528.0,
+ "step": 892
+ },
+ {
+ "entropy": 1.9025505781173706,
+ "epoch": 1.8040404040404039,
+ "grad_norm": 2.221864938735962,
+ "learning_rate": 7.986531986531986e-06,
+ "loss": 1.9073364734649658,
+ "mean_token_accuracy": 0.5933683514595032,
+ "num_tokens": 14630912.0,
+ "step": 893
+ },
+ {
+ "entropy": 1.0104752779006958,
+ "epoch": 1.8060606060606061,
+ "grad_norm": 2.165552854537964,
+ "learning_rate": 7.973063973063974e-06,
+ "loss": 1.0037627220153809,
+ "mean_token_accuracy": 0.7404738664627075,
+ "num_tokens": 14647296.0,
+ "step": 894
+ },
+ {
+ "entropy": 1.5633832216262817,
+ "epoch": 1.808080808080808,
+ "grad_norm": 2.1008827686309814,
+ "learning_rate": 7.95959595959596e-06,
+ "loss": 1.5352282524108887,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 14663680.0,
+ "step": 895
+ },
+ {
+ "entropy": 1.080839991569519,
+ "epoch": 1.8101010101010102,
+ "grad_norm": 1.9256923198699951,
+ "learning_rate": 7.946127946127947e-06,
+ "loss": 1.0921295881271362,
+ "mean_token_accuracy": 0.7247801423072815,
+ "num_tokens": 14680064.0,
+ "step": 896
+ },
+ {
+ "entropy": 0.9788808226585388,
+ "epoch": 1.812121212121212,
+ "grad_norm": 1.9602711200714111,
+ "learning_rate": 7.932659932659934e-06,
+ "loss": 0.9705313444137573,
+ "mean_token_accuracy": 0.7442598938941956,
+ "num_tokens": 14696448.0,
+ "step": 897
+ },
+ {
+ "entropy": 1.1658309698104858,
+ "epoch": 1.8141414141414143,
+ "grad_norm": 1.8840819597244263,
+ "learning_rate": 7.91919191919192e-06,
+ "loss": 1.1346904039382935,
+ "mean_token_accuracy": 0.7229481935501099,
+ "num_tokens": 14712832.0,
+ "step": 898
+ },
+ {
+ "entropy": 0.8824312686920166,
+ "epoch": 1.816161616161616,
+ "grad_norm": 2.1427361965179443,
+ "learning_rate": 7.905723905723907e-06,
+ "loss": 0.9055237770080566,
+ "mean_token_accuracy": 0.759770393371582,
+ "num_tokens": 14729216.0,
+ "step": 899
+ },
+ {
+ "entropy": 1.0914777517318726,
+ "epoch": 1.8181818181818183,
+ "grad_norm": 2.282011032104492,
+ "learning_rate": 7.892255892255893e-06,
+ "loss": 1.101895809173584,
+ "mean_token_accuracy": 0.7096360325813293,
+ "num_tokens": 14745600.0,
+ "step": 900
+ },
+ {
+ "epoch": 1.8181818181818183,
+ "eval_entropy": 1.303592009890464,
+ "eval_loss": 1.5282857418060303,
+ "eval_mean_token_accuracy": 0.6474241422068688,
+ "eval_num_tokens": 14745600.0,
+ "eval_runtime": 43.8637,
+ "eval_samples_per_second": 22.57,
+ "eval_steps_per_second": 2.827,
+ "step": 900
+ },
+ {
+ "entropy": 1.4693570137023926,
+ "epoch": 1.8202020202020202,
+ "grad_norm": 2.0938942432403564,
+ "learning_rate": 7.87878787878788e-06,
+ "loss": 1.4499380588531494,
+ "mean_token_accuracy": 0.6446018815040588,
+ "num_tokens": 14761984.0,
+ "step": 901
+ },
+ {
+ "entropy": 1.0810022354125977,
+ "epoch": 1.8222222222222222,
+ "grad_norm": 2.0279886722564697,
+ "learning_rate": 7.865319865319866e-06,
+ "loss": 1.0581843852996826,
+ "mean_token_accuracy": 0.723375678062439,
+ "num_tokens": 14778368.0,
+ "step": 902
+ },
+ {
+ "entropy": 1.0680485963821411,
+ "epoch": 1.8242424242424242,
+ "grad_norm": 2.015047788619995,
+ "learning_rate": 7.851851851851853e-06,
+ "loss": 1.0612249374389648,
+ "mean_token_accuracy": 0.7264289259910583,
+ "num_tokens": 14794752.0,
+ "step": 903
+ },
+ {
+ "entropy": 0.981645941734314,
+ "epoch": 1.8262626262626263,
+ "grad_norm": 2.0122671127319336,
+ "learning_rate": 7.838383838383839e-06,
+ "loss": 0.9650060534477234,
+ "mean_token_accuracy": 0.7337567210197449,
+ "num_tokens": 14811136.0,
+ "step": 904
+ },
+ {
+ "entropy": 1.0827676057815552,
+ "epoch": 1.8282828282828283,
+ "grad_norm": 2.1086010932922363,
+ "learning_rate": 7.824915824915826e-06,
+ "loss": 1.097700595855713,
+ "mean_token_accuracy": 0.7087811231613159,
+ "num_tokens": 14827520.0,
+ "step": 905
+ },
+ {
+ "entropy": 0.9498234391212463,
+ "epoch": 1.8303030303030303,
+ "grad_norm": 1.9012964963912964,
+ "learning_rate": 7.811447811447812e-06,
+ "loss": 0.9704345464706421,
+ "mean_token_accuracy": 0.7472520470619202,
+ "num_tokens": 14843904.0,
+ "step": 906
+ },
+ {
+ "entropy": 0.8871595859527588,
+ "epoch": 1.8323232323232324,
+ "grad_norm": 1.9970269203186035,
+ "learning_rate": 7.797979797979799e-06,
+ "loss": 0.8876000642776489,
+ "mean_token_accuracy": 0.7578163146972656,
+ "num_tokens": 14860288.0,
+ "step": 907
+ },
+ {
+ "entropy": 1.1324913501739502,
+ "epoch": 1.8343434343434344,
+ "grad_norm": 2.1133675575256348,
+ "learning_rate": 7.784511784511785e-06,
+ "loss": 1.142140507698059,
+ "mean_token_accuracy": 0.7180629968643188,
+ "num_tokens": 14876672.0,
+ "step": 908
+ },
+ {
+ "entropy": 1.1514050960540771,
+ "epoch": 1.8363636363636364,
+ "grad_norm": 2.073002338409424,
+ "learning_rate": 7.771043771043772e-06,
+ "loss": 1.1670506000518799,
+ "mean_token_accuracy": 0.7009037733078003,
+ "num_tokens": 14893056.0,
+ "step": 909
+ },
+ {
+ "entropy": 1.17017662525177,
+ "epoch": 1.8383838383838382,
+ "grad_norm": 2.17962384223938,
+ "learning_rate": 7.757575757575758e-06,
+ "loss": 1.1800150871276855,
+ "mean_token_accuracy": 0.7028578519821167,
+ "num_tokens": 14909440.0,
+ "step": 910
+ },
+ {
+ "entropy": 0.9377864599227905,
+ "epoch": 1.8404040404040405,
+ "grad_norm": 2.2141757011413574,
+ "learning_rate": 7.744107744107745e-06,
+ "loss": 0.9712649583816528,
+ "mean_token_accuracy": 0.7405349016189575,
+ "num_tokens": 14925824.0,
+ "step": 911
+ },
+ {
+ "entropy": 1.2093497514724731,
+ "epoch": 1.8424242424242423,
+ "grad_norm": 2.0677497386932373,
+ "learning_rate": 7.730639730639731e-06,
+ "loss": 1.210886001586914,
+ "mean_token_accuracy": 0.7037737965583801,
+ "num_tokens": 14942208.0,
+ "step": 912
+ },
+ {
+ "entropy": 0.8966845273971558,
+ "epoch": 1.8444444444444446,
+ "grad_norm": 2.0689940452575684,
+ "learning_rate": 7.717171717171717e-06,
+ "loss": 0.9142885208129883,
+ "mean_token_accuracy": 0.7523815631866455,
+ "num_tokens": 14958592.0,
+ "step": 913
+ },
+ {
+ "entropy": 1.4647231101989746,
+ "epoch": 1.8464646464646464,
+ "grad_norm": 2.1815598011016846,
+ "learning_rate": 7.703703703703704e-06,
+ "loss": 1.4676027297973633,
+ "mean_token_accuracy": 0.6506472826004028,
+ "num_tokens": 14974976.0,
+ "step": 914
+ },
+ {
+ "entropy": 1.5831035375595093,
+ "epoch": 1.8484848484848486,
+ "grad_norm": 2.028407096862793,
+ "learning_rate": 7.69023569023569e-06,
+ "loss": 1.5933328866958618,
+ "mean_token_accuracy": 0.6368466019630432,
+ "num_tokens": 14991360.0,
+ "step": 915
+ },
+ {
+ "entropy": 1.3269871473312378,
+ "epoch": 1.8505050505050504,
+ "grad_norm": 2.173727035522461,
+ "learning_rate": 7.676767676767677e-06,
+ "loss": 1.3404830694198608,
+ "mean_token_accuracy": 0.6750122308731079,
+ "num_tokens": 15007744.0,
+ "step": 916
+ },
+ {
+ "entropy": 1.378677487373352,
+ "epoch": 1.8525252525252527,
+ "grad_norm": 2.0357983112335205,
+ "learning_rate": 7.663299663299663e-06,
+ "loss": 1.3752634525299072,
+ "mean_token_accuracy": 0.6711651086807251,
+ "num_tokens": 15024128.0,
+ "step": 917
+ },
+ {
+ "entropy": 1.5462778806686401,
+ "epoch": 1.8545454545454545,
+ "grad_norm": 1.9574400186538696,
+ "learning_rate": 7.64983164983165e-06,
+ "loss": 1.5374811887741089,
+ "mean_token_accuracy": 0.6375183463096619,
+ "num_tokens": 15040512.0,
+ "step": 918
+ },
+ {
+ "entropy": 1.2211424112319946,
+ "epoch": 1.8565656565656565,
+ "grad_norm": 2.0203700065612793,
+ "learning_rate": 7.636363636363638e-06,
+ "loss": 1.2375779151916504,
+ "mean_token_accuracy": 0.6878358721733093,
+ "num_tokens": 15056896.0,
+ "step": 919
+ },
+ {
+ "entropy": 1.493086338043213,
+ "epoch": 1.8585858585858586,
+ "grad_norm": 2.1047544479370117,
+ "learning_rate": 7.622895622895623e-06,
+ "loss": 1.471447229385376,
+ "mean_token_accuracy": 0.6543111801147461,
+ "num_tokens": 15073280.0,
+ "step": 920
+ },
+ {
+ "entropy": 1.351884126663208,
+ "epoch": 1.8606060606060606,
+ "grad_norm": 2.2803215980529785,
+ "learning_rate": 7.60942760942761e-06,
+ "loss": 1.3451658487319946,
+ "mean_token_accuracy": 0.6725696325302124,
+ "num_tokens": 15089664.0,
+ "step": 921
+ },
+ {
+ "entropy": 1.4343167543411255,
+ "epoch": 1.8626262626262626,
+ "grad_norm": 1.9821034669876099,
+ "learning_rate": 7.595959595959597e-06,
+ "loss": 1.4694747924804688,
+ "mean_token_accuracy": 0.6622496247291565,
+ "num_tokens": 15106048.0,
+ "step": 922
+ },
+ {
+ "entropy": 1.3977091312408447,
+ "epoch": 1.8646464646464647,
+ "grad_norm": 2.0600125789642334,
+ "learning_rate": 7.582491582491583e-06,
+ "loss": 1.4120681285858154,
+ "mean_token_accuracy": 0.6642037034034729,
+ "num_tokens": 15122432.0,
+ "step": 923
+ },
+ {
+ "entropy": 1.4182765483856201,
+ "epoch": 1.8666666666666667,
+ "grad_norm": 1.9010684490203857,
+ "learning_rate": 7.569023569023569e-06,
+ "loss": 1.4160431623458862,
+ "mean_token_accuracy": 0.6696995496749878,
+ "num_tokens": 15138816.0,
+ "step": 924
+ },
+ {
+ "entropy": 1.1520206928253174,
+ "epoch": 1.8686868686868687,
+ "grad_norm": 1.8414452075958252,
+ "learning_rate": 7.555555555555556e-06,
+ "loss": 1.154735803604126,
+ "mean_token_accuracy": 0.7159867882728577,
+ "num_tokens": 15155200.0,
+ "step": 925
+ },
+ {
+ "entropy": 0.8958664536476135,
+ "epoch": 1.8707070707070708,
+ "grad_norm": 1.82782781124115,
+ "learning_rate": 7.542087542087543e-06,
+ "loss": 0.8718663454055786,
+ "mean_token_accuracy": 0.7771739363670349,
+ "num_tokens": 15171584.0,
+ "step": 926
+ },
+ {
+ "entropy": 1.4068299531936646,
+ "epoch": 1.8727272727272726,
+ "grad_norm": 1.9482192993164062,
+ "learning_rate": 7.52861952861953e-06,
+ "loss": 1.3947927951812744,
+ "mean_token_accuracy": 0.6699438095092773,
+ "num_tokens": 15187968.0,
+ "step": 927
+ },
+ {
+ "entropy": 0.8980593085289001,
+ "epoch": 1.8747474747474748,
+ "grad_norm": 2.040997266769409,
+ "learning_rate": 7.515151515151516e-06,
+ "loss": 0.9092239141464233,
+ "mean_token_accuracy": 0.7550684213638306,
+ "num_tokens": 15204352.0,
+ "step": 928
+ },
+ {
+ "entropy": 1.2259284257888794,
+ "epoch": 1.8767676767676766,
+ "grad_norm": 2.1932485103607178,
+ "learning_rate": 7.501683501683502e-06,
+ "loss": 1.2324566841125488,
+ "mean_token_accuracy": 0.6918050646781921,
+ "num_tokens": 15220736.0,
+ "step": 929
+ },
+ {
+ "entropy": 1.3737105131149292,
+ "epoch": 1.878787878787879,
+ "grad_norm": 1.9829115867614746,
+ "learning_rate": 7.4882154882154886e-06,
+ "loss": 1.4132641553878784,
+ "mean_token_accuracy": 0.6854543089866638,
+ "num_tokens": 15237120.0,
+ "step": 930
+ },
+ {
+ "entropy": 1.1767487525939941,
+ "epoch": 1.8808080808080807,
+ "grad_norm": 2.279439926147461,
+ "learning_rate": 7.474747474747476e-06,
+ "loss": 1.1658971309661865,
+ "mean_token_accuracy": 0.711467981338501,
+ "num_tokens": 15253504.0,
+ "step": 931
+ },
+ {
+ "entropy": 1.0110876560211182,
+ "epoch": 1.882828282828283,
+ "grad_norm": 2.144711494445801,
+ "learning_rate": 7.4612794612794615e-06,
+ "loss": 1.0287975072860718,
+ "mean_token_accuracy": 0.7346726655960083,
+ "num_tokens": 15269888.0,
+ "step": 932
+ },
+ {
+ "entropy": 1.0826390981674194,
+ "epoch": 1.8848484848484848,
+ "grad_norm": 2.1858105659484863,
+ "learning_rate": 7.447811447811448e-06,
+ "loss": 1.1194939613342285,
+ "mean_token_accuracy": 0.7099413871765137,
+ "num_tokens": 15286272.0,
+ "step": 933
+ },
+ {
+ "entropy": 1.430822491645813,
+ "epoch": 1.886868686868687,
+ "grad_norm": 1.9496047496795654,
+ "learning_rate": 7.434343434343435e-06,
+ "loss": 1.452394723892212,
+ "mean_token_accuracy": 0.6591353416442871,
+ "num_tokens": 15302656.0,
+ "step": 934
+ },
+ {
+ "entropy": 0.9242729544639587,
+ "epoch": 1.8888888888888888,
+ "grad_norm": 2.1464316844940186,
+ "learning_rate": 7.420875420875422e-06,
+ "loss": 0.9562792778015137,
+ "mean_token_accuracy": 0.7407791614532471,
+ "num_tokens": 15319040.0,
+ "step": 935
+ },
+ {
+ "entropy": 1.5215003490447998,
+ "epoch": 1.8909090909090909,
+ "grad_norm": 2.105729818344116,
+ "learning_rate": 7.4074074074074075e-06,
+ "loss": 1.5162043571472168,
+ "mean_token_accuracy": 0.6430141925811768,
+ "num_tokens": 15335424.0,
+ "step": 936
+ },
+ {
+ "entropy": 1.1809922456741333,
+ "epoch": 1.892929292929293,
+ "grad_norm": 2.1825973987579346,
+ "learning_rate": 7.393939393939395e-06,
+ "loss": 1.192020058631897,
+ "mean_token_accuracy": 0.693453848361969,
+ "num_tokens": 15351808.0,
+ "step": 937
+ },
+ {
+ "entropy": 1.0707145929336548,
+ "epoch": 1.894949494949495,
+ "grad_norm": 2.033658027648926,
+ "learning_rate": 7.380471380471381e-06,
+ "loss": 1.0794811248779297,
+ "mean_token_accuracy": 0.7291157841682434,
+ "num_tokens": 15368192.0,
+ "step": 938
+ },
+ {
+ "entropy": 0.8133494257926941,
+ "epoch": 1.896969696969697,
+ "grad_norm": 1.9038894176483154,
+ "learning_rate": 7.367003367003368e-06,
+ "loss": 0.817105233669281,
+ "mean_token_accuracy": 0.785906195640564,
+ "num_tokens": 15384576.0,
+ "step": 939
+ },
+ {
+ "entropy": 1.1366889476776123,
+ "epoch": 1.898989898989899,
+ "grad_norm": 2.3373923301696777,
+ "learning_rate": 7.353535353535353e-06,
+ "loss": 1.1590774059295654,
+ "mean_token_accuracy": 0.7004152536392212,
+ "num_tokens": 15400960.0,
+ "step": 940
+ },
+ {
+ "entropy": 1.0165143013000488,
+ "epoch": 1.901010101010101,
+ "grad_norm": 1.8290495872497559,
+ "learning_rate": 7.340067340067341e-06,
+ "loss": 0.9955418109893799,
+ "mean_token_accuracy": 0.7454811930656433,
+ "num_tokens": 15417344.0,
+ "step": 941
+ },
+ {
+ "entropy": 1.536665916442871,
+ "epoch": 1.903030303030303,
+ "grad_norm": 2.2636616230010986,
+ "learning_rate": 7.326599326599327e-06,
+ "loss": 1.5516541004180908,
+ "mean_token_accuracy": 0.6290913820266724,
+ "num_tokens": 15433728.0,
+ "step": 942
+ },
+ {
+ "entropy": 1.0885748863220215,
+ "epoch": 1.905050505050505,
+ "grad_norm": 2.104462146759033,
+ "learning_rate": 7.3131313131313146e-06,
+ "loss": 1.096163272857666,
+ "mean_token_accuracy": 0.7129946351051331,
+ "num_tokens": 15450112.0,
+ "step": 943
+ },
+ {
+ "entropy": 1.0774754285812378,
+ "epoch": 1.907070707070707,
+ "grad_norm": 2.006735324859619,
+ "learning_rate": 7.2996632996633e-06,
+ "loss": 1.0466490983963013,
+ "mean_token_accuracy": 0.7385197877883911,
+ "num_tokens": 15466496.0,
+ "step": 944
+ },
+ {
+ "entropy": 1.3489689826965332,
+ "epoch": 1.9090909090909092,
+ "grad_norm": 2.148700714111328,
+ "learning_rate": 7.286195286195287e-06,
+ "loss": 1.317432165145874,
+ "mean_token_accuracy": 0.6951025724411011,
+ "num_tokens": 15482880.0,
+ "step": 945
+ },
+ {
+ "entropy": 0.957065999507904,
+ "epoch": 1.911111111111111,
+ "grad_norm": 2.118453025817871,
+ "learning_rate": 7.272727272727273e-06,
+ "loss": 0.9499804377555847,
+ "mean_token_accuracy": 0.7590376138687134,
+ "num_tokens": 15499264.0,
+ "step": 946
+ },
+ {
+ "entropy": 1.1132235527038574,
+ "epoch": 1.9131313131313132,
+ "grad_norm": 1.8254663944244385,
+ "learning_rate": 7.2592592592592605e-06,
+ "loss": 1.0975847244262695,
+ "mean_token_accuracy": 0.7224596738815308,
+ "num_tokens": 15515648.0,
+ "step": 947
+ },
+ {
+ "entropy": 1.1259424686431885,
+ "epoch": 1.915151515151515,
+ "grad_norm": 2.105797529220581,
+ "learning_rate": 7.245791245791246e-06,
+ "loss": 1.1171300411224365,
+ "mean_token_accuracy": 0.7150097489356995,
+ "num_tokens": 15532032.0,
+ "step": 948
+ },
+ {
+ "entropy": 1.3454829454421997,
+ "epoch": 1.9171717171717173,
+ "grad_norm": 2.2715842723846436,
+ "learning_rate": 7.232323232323233e-06,
+ "loss": 1.359604835510254,
+ "mean_token_accuracy": 0.6568759083747864,
+ "num_tokens": 15548416.0,
+ "step": 949
+ },
+ {
+ "entropy": 1.2873634099960327,
+ "epoch": 1.9191919191919191,
+ "grad_norm": 1.8735847473144531,
+ "learning_rate": 7.21885521885522e-06,
+ "loss": 1.2842814922332764,
+ "mean_token_accuracy": 0.6951025724411011,
+ "num_tokens": 15564800.0,
+ "step": 950
+ },
+ {
+ "entropy": 1.154240369796753,
+ "epoch": 1.9212121212121214,
+ "grad_norm": 1.9821181297302246,
+ "learning_rate": 7.2053872053872064e-06,
+ "loss": 1.1434863805770874,
+ "mean_token_accuracy": 0.7203834652900696,
+ "num_tokens": 15581184.0,
+ "step": 951
+ },
+ {
+ "entropy": 1.05129075050354,
+ "epoch": 1.9232323232323232,
+ "grad_norm": 1.990182638168335,
+ "learning_rate": 7.191919191919192e-06,
+ "loss": 1.0694432258605957,
+ "mean_token_accuracy": 0.734245240688324,
+ "num_tokens": 15597568.0,
+ "step": 952
+ },
+ {
+ "entropy": 1.0232638120651245,
+ "epoch": 1.9252525252525252,
+ "grad_norm": 2.017350673675537,
+ "learning_rate": 7.178451178451179e-06,
+ "loss": 1.0090606212615967,
+ "mean_token_accuracy": 0.7305202484130859,
+ "num_tokens": 15613952.0,
+ "step": 953
+ },
+ {
+ "entropy": 0.8146723508834839,
+ "epoch": 1.9272727272727272,
+ "grad_norm": 1.8920353651046753,
+ "learning_rate": 7.164983164983166e-06,
+ "loss": 0.8227875232696533,
+ "mean_token_accuracy": 0.778761625289917,
+ "num_tokens": 15630336.0,
+ "step": 954
+ },
+ {
+ "entropy": 0.6415520906448364,
+ "epoch": 1.9292929292929293,
+ "grad_norm": 1.7636535167694092,
+ "learning_rate": 7.151515151515152e-06,
+ "loss": 0.6381626725196838,
+ "mean_token_accuracy": 0.8171104192733765,
+ "num_tokens": 15646720.0,
+ "step": 955
+ },
+ {
+ "entropy": 1.4309028387069702,
+ "epoch": 1.9313131313131313,
+ "grad_norm": 1.8857070207595825,
+ "learning_rate": 7.138047138047138e-06,
+ "loss": 1.4779207706451416,
+ "mean_token_accuracy": 0.6556546092033386,
+ "num_tokens": 15663104.0,
+ "step": 956
+ },
+ {
+ "entropy": 1.1201391220092773,
+ "epoch": 1.9333333333333333,
+ "grad_norm": 1.833791732788086,
+ "learning_rate": 7.124579124579125e-06,
+ "loss": 1.0972872972488403,
+ "mean_token_accuracy": 0.7187347412109375,
+ "num_tokens": 15679488.0,
+ "step": 957
+ },
+ {
+ "entropy": 1.1922115087509155,
+ "epoch": 1.9353535353535354,
+ "grad_norm": 1.8989986181259155,
+ "learning_rate": 7.111111111111112e-06,
+ "loss": 1.2037092447280884,
+ "mean_token_accuracy": 0.7104299068450928,
+ "num_tokens": 15695872.0,
+ "step": 958
+ },
+ {
+ "entropy": 0.9312219023704529,
+ "epoch": 1.9373737373737374,
+ "grad_norm": 2.0068769454956055,
+ "learning_rate": 7.097643097643099e-06,
+ "loss": 0.9126096963882446,
+ "mean_token_accuracy": 0.7556790709495544,
+ "num_tokens": 15712256.0,
+ "step": 959
+ },
+ {
+ "entropy": 1.1126971244812012,
+ "epoch": 1.9393939393939394,
+ "grad_norm": 1.9915603399276733,
+ "learning_rate": 7.084175084175085e-06,
+ "loss": 1.1312336921691895,
+ "mean_token_accuracy": 0.7178187370300293,
+ "num_tokens": 15728640.0,
+ "step": 960
+ },
+ {
+ "entropy": 1.487212896347046,
+ "epoch": 1.9414141414141413,
+ "grad_norm": 2.068739414215088,
+ "learning_rate": 7.070707070707071e-06,
+ "loss": 1.4876431226730347,
+ "mean_token_accuracy": 0.6568759083747864,
+ "num_tokens": 15745024.0,
+ "step": 961
+ },
+ {
+ "entropy": 1.207465648651123,
+ "epoch": 1.9434343434343435,
+ "grad_norm": 1.9962066411972046,
+ "learning_rate": 7.057239057239058e-06,
+ "loss": 1.2003669738769531,
+ "mean_token_accuracy": 0.7024914622306824,
+ "num_tokens": 15761408.0,
+ "step": 962
+ },
+ {
+ "entropy": 1.7148067951202393,
+ "epoch": 1.9454545454545453,
+ "grad_norm": 2.3441736698150635,
+ "learning_rate": 7.043771043771043e-06,
+ "loss": 1.7310147285461426,
+ "mean_token_accuracy": 0.6288471221923828,
+ "num_tokens": 15777792.0,
+ "step": 963
+ },
+ {
+ "entropy": 1.3103407621383667,
+ "epoch": 1.9474747474747476,
+ "grad_norm": 1.915368676185608,
+ "learning_rate": 7.030303030303031e-06,
+ "loss": 1.3412322998046875,
+ "mean_token_accuracy": 0.6845383644104004,
+ "num_tokens": 15794176.0,
+ "step": 964
+ },
+ {
+ "entropy": 0.9835378527641296,
+ "epoch": 1.9494949494949494,
+ "grad_norm": 1.9611473083496094,
+ "learning_rate": 7.016835016835017e-06,
+ "loss": 0.9903290271759033,
+ "mean_token_accuracy": 0.7569003701210022,
+ "num_tokens": 15810560.0,
+ "step": 965
+ },
+ {
+ "entropy": 1.4645164012908936,
+ "epoch": 1.9515151515151516,
+ "grad_norm": 2.017500162124634,
+ "learning_rate": 7.0033670033670045e-06,
+ "loss": 1.4612789154052734,
+ "mean_token_accuracy": 0.6558378338813782,
+ "num_tokens": 15826944.0,
+ "step": 966
+ },
+ {
+ "entropy": 1.2586326599121094,
+ "epoch": 1.9535353535353535,
+ "grad_norm": 2.0969791412353516,
+ "learning_rate": 6.98989898989899e-06,
+ "loss": 1.224534273147583,
+ "mean_token_accuracy": 0.6958353519439697,
+ "num_tokens": 15843328.0,
+ "step": 967
+ },
+ {
+ "entropy": 0.8170226216316223,
+ "epoch": 1.9555555555555557,
+ "grad_norm": 1.9889802932739258,
+ "learning_rate": 6.976430976430977e-06,
+ "loss": 0.8214236497879028,
+ "mean_token_accuracy": 0.7777845859527588,
+ "num_tokens": 15859712.0,
+ "step": 968
+ },
+ {
+ "entropy": 0.8966978788375854,
+ "epoch": 1.9575757575757575,
+ "grad_norm": 1.8261324167251587,
+ "learning_rate": 6.962962962962964e-06,
+ "loss": 0.8880574107170105,
+ "mean_token_accuracy": 0.7681363224983215,
+ "num_tokens": 15876096.0,
+ "step": 969
+ },
+ {
+ "entropy": 1.4782947301864624,
+ "epoch": 1.9595959595959596,
+ "grad_norm": 2.2666432857513428,
+ "learning_rate": 6.9494949494949505e-06,
+ "loss": 1.5416191816329956,
+ "mean_token_accuracy": 0.6491206884384155,
+ "num_tokens": 15892480.0,
+ "step": 970
+ },
+ {
+ "entropy": 1.6055350303649902,
+ "epoch": 1.9616161616161616,
+ "grad_norm": 2.0585474967956543,
+ "learning_rate": 6.936026936026936e-06,
+ "loss": 1.627528190612793,
+ "mean_token_accuracy": 0.6376404762268066,
+ "num_tokens": 15908864.0,
+ "step": 971
+ },
+ {
+ "entropy": 1.092020869255066,
+ "epoch": 1.9636363636363636,
+ "grad_norm": 2.002554416656494,
+ "learning_rate": 6.922558922558923e-06,
+ "loss": 1.0792224407196045,
+ "mean_token_accuracy": 0.7230092883110046,
+ "num_tokens": 15925248.0,
+ "step": 972
+ },
+ {
+ "entropy": 0.7485284805297852,
+ "epoch": 1.9656565656565657,
+ "grad_norm": 1.9477611780166626,
+ "learning_rate": 6.90909090909091e-06,
+ "loss": 0.7471826076507568,
+ "mean_token_accuracy": 0.7961040735244751,
+ "num_tokens": 15941632.0,
+ "step": 973
+ },
+ {
+ "entropy": 1.3997598886489868,
+ "epoch": 1.9676767676767677,
+ "grad_norm": 2.1589887142181396,
+ "learning_rate": 6.895622895622896e-06,
+ "loss": 1.3947563171386719,
+ "mean_token_accuracy": 0.6626160144805908,
+ "num_tokens": 15958016.0,
+ "step": 974
+ },
+ {
+ "entropy": 1.2053040266036987,
+ "epoch": 1.9696969696969697,
+ "grad_norm": 2.1021888256073,
+ "learning_rate": 6.882154882154882e-06,
+ "loss": 1.2196800708770752,
+ "mean_token_accuracy": 0.6948583126068115,
+ "num_tokens": 15974400.0,
+ "step": 975
+ },
+ {
+ "entropy": 1.1462217569351196,
+ "epoch": 1.9717171717171718,
+ "grad_norm": 2.1295032501220703,
+ "learning_rate": 6.868686868686869e-06,
+ "loss": 1.1645277738571167,
+ "mean_token_accuracy": 0.717391312122345,
+ "num_tokens": 15990784.0,
+ "step": 976
+ },
+ {
+ "entropy": 0.9189468026161194,
+ "epoch": 1.9737373737373738,
+ "grad_norm": 1.9384510517120361,
+ "learning_rate": 6.855218855218856e-06,
+ "loss": 0.8912248015403748,
+ "mean_token_accuracy": 0.7561064958572388,
+ "num_tokens": 16007168.0,
+ "step": 977
+ },
+ {
+ "entropy": 1.2767856121063232,
+ "epoch": 1.9757575757575756,
+ "grad_norm": 2.086789608001709,
+ "learning_rate": 6.841750841750842e-06,
+ "loss": 1.2951477766036987,
+ "mean_token_accuracy": 0.6822178959846497,
+ "num_tokens": 16023552.0,
+ "step": 978
+ },
+ {
+ "entropy": 1.4691493511199951,
+ "epoch": 1.9777777777777779,
+ "grad_norm": 2.081007719039917,
+ "learning_rate": 6.828282828282828e-06,
+ "loss": 1.4899260997772217,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 16039936.0,
+ "step": 979
+ },
+ {
+ "entropy": 1.5689647197723389,
+ "epoch": 1.9797979797979797,
+ "grad_norm": 2.168604850769043,
+ "learning_rate": 6.814814814814815e-06,
+ "loss": 1.57144296169281,
+ "mean_token_accuracy": 0.6405715942382812,
+ "num_tokens": 16056320.0,
+ "step": 980
+ },
+ {
+ "entropy": 1.4429019689559937,
+ "epoch": 1.981818181818182,
+ "grad_norm": 1.9658228158950806,
+ "learning_rate": 6.801346801346802e-06,
+ "loss": 1.473623275756836,
+ "mean_token_accuracy": 0.6576697826385498,
+ "num_tokens": 16072704.0,
+ "step": 981
+ },
+ {
+ "entropy": 1.0032570362091064,
+ "epoch": 1.9838383838383837,
+ "grad_norm": 1.9377433061599731,
+ "learning_rate": 6.787878787878789e-06,
+ "loss": 0.9838194847106934,
+ "mean_token_accuracy": 0.7490839958190918,
+ "num_tokens": 16089088.0,
+ "step": 982
+ },
+ {
+ "entropy": 0.9308913946151733,
+ "epoch": 1.985858585858586,
+ "grad_norm": 1.9042673110961914,
+ "learning_rate": 6.774410774410775e-06,
+ "loss": 0.9097878932952881,
+ "mean_token_accuracy": 0.7631289958953857,
+ "num_tokens": 16105472.0,
+ "step": 983
+ },
+ {
+ "entropy": 1.0642609596252441,
+ "epoch": 1.9878787878787878,
+ "grad_norm": 2.1934077739715576,
+ "learning_rate": 6.760942760942761e-06,
+ "loss": 1.0470092296600342,
+ "mean_token_accuracy": 0.7263067960739136,
+ "num_tokens": 16121856.0,
+ "step": 984
+ },
+ {
+ "entropy": 1.2610602378845215,
+ "epoch": 1.98989898989899,
+ "grad_norm": 2.2924704551696777,
+ "learning_rate": 6.747474747474749e-06,
+ "loss": 1.246216058731079,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 16138240.0,
+ "step": 985
+ },
+ {
+ "entropy": 1.4189343452453613,
+ "epoch": 1.9919191919191919,
+ "grad_norm": 1.906319260597229,
+ "learning_rate": 6.734006734006735e-06,
+ "loss": 1.4098241329193115,
+ "mean_token_accuracy": 0.6734855771064758,
+ "num_tokens": 16154624.0,
+ "step": 986
+ },
+ {
+ "entropy": 1.339056134223938,
+ "epoch": 1.993939393939394,
+ "grad_norm": 2.034353733062744,
+ "learning_rate": 6.720538720538721e-06,
+ "loss": 1.3571393489837646,
+ "mean_token_accuracy": 0.678859293460846,
+ "num_tokens": 16171008.0,
+ "step": 987
+ },
+ {
+ "entropy": 1.057302474975586,
+ "epoch": 1.995959595959596,
+ "grad_norm": 2.1716647148132324,
+ "learning_rate": 6.707070707070707e-06,
+ "loss": 1.042845606803894,
+ "mean_token_accuracy": 0.7322300672531128,
+ "num_tokens": 16187392.0,
+ "step": 988
+ },
+ {
+ "entropy": 1.2057303190231323,
+ "epoch": 1.997979797979798,
+ "grad_norm": 1.9809064865112305,
+ "learning_rate": 6.6936026936026945e-06,
+ "loss": 1.2091717720031738,
+ "mean_token_accuracy": 0.7068270444869995,
+ "num_tokens": 16203776.0,
+ "step": 989
+ },
+ {
+ "entropy": 1.3678697347640991,
+ "epoch": 2.0,
+ "grad_norm": 2.1474292278289795,
+ "learning_rate": 6.680134680134681e-06,
+ "loss": 1.359403133392334,
+ "mean_token_accuracy": 0.6702491641044617,
+ "num_tokens": 16220160.0,
+ "step": 990
+ },
+ {
+ "entropy": 1.6815240383148193,
+ "epoch": 2.002020202020202,
+ "grad_norm": 2.209095001220703,
+ "learning_rate": 6.666666666666667e-06,
+ "loss": 1.5768096446990967,
+ "mean_token_accuracy": 0.6408768892288208,
+ "num_tokens": 16236544.0,
+ "step": 991
+ },
+ {
+ "entropy": 1.1142786741256714,
+ "epoch": 2.004040404040404,
+ "grad_norm": 2.8133344650268555,
+ "learning_rate": 6.653198653198654e-06,
+ "loss": 0.937615692615509,
+ "mean_token_accuracy": 0.7556179761886597,
+ "num_tokens": 16252928.0,
+ "step": 992
+ },
+ {
+ "entropy": 1.2004083395004272,
+ "epoch": 2.006060606060606,
+ "grad_norm": 2.753380060195923,
+ "learning_rate": 6.6397306397306405e-06,
+ "loss": 1.0454245805740356,
+ "mean_token_accuracy": 0.7423058152198792,
+ "num_tokens": 16269312.0,
+ "step": 993
+ },
+ {
+ "entropy": 0.9945010542869568,
+ "epoch": 2.008080808080808,
+ "grad_norm": 2.3262150287628174,
+ "learning_rate": 6.626262626262627e-06,
+ "loss": 0.8623301982879639,
+ "mean_token_accuracy": 0.7791890501976013,
+ "num_tokens": 16285696.0,
+ "step": 994
+ },
+ {
+ "entropy": 1.0330396890640259,
+ "epoch": 2.01010101010101,
+ "grad_norm": 2.3145525455474854,
+ "learning_rate": 6.612794612794613e-06,
+ "loss": 0.9156472682952881,
+ "mean_token_accuracy": 0.7564118504524231,
+ "num_tokens": 16302080.0,
+ "step": 995
+ },
+ {
+ "entropy": 1.109296202659607,
+ "epoch": 2.012121212121212,
+ "grad_norm": 1.9910767078399658,
+ "learning_rate": 6.5993265993266e-06,
+ "loss": 1.0271074771881104,
+ "mean_token_accuracy": 0.7449315786361694,
+ "num_tokens": 16318464.0,
+ "step": 996
+ },
+ {
+ "entropy": 1.3861018419265747,
+ "epoch": 2.014141414141414,
+ "grad_norm": 2.2054574489593506,
+ "learning_rate": 6.585858585858586e-06,
+ "loss": 1.3088997602462769,
+ "mean_token_accuracy": 0.6818515062332153,
+ "num_tokens": 16334848.0,
+ "step": 997
+ },
+ {
+ "entropy": 1.1170406341552734,
+ "epoch": 2.0161616161616163,
+ "grad_norm": 2.3239619731903076,
+ "learning_rate": 6.572390572390574e-06,
+ "loss": 1.036240577697754,
+ "mean_token_accuracy": 0.735405445098877,
+ "num_tokens": 16351232.0,
+ "step": 998
+ },
+ {
+ "entropy": 0.8306671977043152,
+ "epoch": 2.018181818181818,
+ "grad_norm": 1.844927430152893,
+ "learning_rate": 6.558922558922559e-06,
+ "loss": 0.7926205396652222,
+ "mean_token_accuracy": 0.790730357170105,
+ "num_tokens": 16367616.0,
+ "step": 999
+ },
+ {
+ "entropy": 1.0606129169464111,
+ "epoch": 2.0202020202020203,
+ "grad_norm": 1.884960412979126,
+ "learning_rate": 6.545454545454546e-06,
+ "loss": 1.0186505317687988,
+ "mean_token_accuracy": 0.7497557401657104,
+ "num_tokens": 16384000.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.0202020202020203,
+ "eval_entropy": 1.1442755407864047,
+ "eval_loss": 1.5800968408584595,
+ "eval_mean_token_accuracy": 0.6456370079709638,
+ "eval_num_tokens": 16384000.0,
+ "eval_runtime": 43.8308,
+ "eval_samples_per_second": 22.587,
+ "eval_steps_per_second": 2.829,
+ "step": 1000
+ },
+ {
+ "entropy": 1.1903036832809448,
+ "epoch": 2.022222222222222,
+ "grad_norm": 2.1258959770202637,
+ "learning_rate": 6.531986531986533e-06,
+ "loss": 1.1637260913848877,
+ "mean_token_accuracy": 0.7187347412109375,
+ "num_tokens": 16400384.0,
+ "step": 1001
+ },
+ {
+ "entropy": 0.6594457626342773,
+ "epoch": 2.0242424242424244,
+ "grad_norm": 1.934865951538086,
+ "learning_rate": 6.51851851851852e-06,
+ "loss": 0.6422234773635864,
+ "mean_token_accuracy": 0.8183317184448242,
+ "num_tokens": 16416768.0,
+ "step": 1002
+ },
+ {
+ "entropy": 1.4628888368606567,
+ "epoch": 2.026262626262626,
+ "grad_norm": 2.2606966495513916,
+ "learning_rate": 6.505050505050505e-06,
+ "loss": 1.4868237972259521,
+ "mean_token_accuracy": 0.6523571014404297,
+ "num_tokens": 16433152.0,
+ "step": 1003
+ },
+ {
+ "entropy": 0.7812108397483826,
+ "epoch": 2.0282828282828285,
+ "grad_norm": 2.222006320953369,
+ "learning_rate": 6.491582491582492e-06,
+ "loss": 0.7988066673278809,
+ "mean_token_accuracy": 0.7873717546463013,
+ "num_tokens": 16449536.0,
+ "step": 1004
+ },
+ {
+ "entropy": 0.8421438336372375,
+ "epoch": 2.0303030303030303,
+ "grad_norm": 2.264430284500122,
+ "learning_rate": 6.478114478114479e-06,
+ "loss": 0.8724686503410339,
+ "mean_token_accuracy": 0.7742428183555603,
+ "num_tokens": 16465920.0,
+ "step": 1005
+ },
+ {
+ "entropy": 0.8786948919296265,
+ "epoch": 2.0323232323232325,
+ "grad_norm": 2.0655956268310547,
+ "learning_rate": 6.464646464646466e-06,
+ "loss": 0.8711583614349365,
+ "mean_token_accuracy": 0.7763800621032715,
+ "num_tokens": 16482304.0,
+ "step": 1006
+ },
+ {
+ "entropy": 0.7819579839706421,
+ "epoch": 2.0343434343434343,
+ "grad_norm": 2.360408067703247,
+ "learning_rate": 6.451178451178451e-06,
+ "loss": 0.8174005150794983,
+ "mean_token_accuracy": 0.7810820937156677,
+ "num_tokens": 16498688.0,
+ "step": 1007
+ },
+ {
+ "entropy": 1.3011908531188965,
+ "epoch": 2.036363636363636,
+ "grad_norm": 2.417349338531494,
+ "learning_rate": 6.4377104377104386e-06,
+ "loss": 1.3457268476486206,
+ "mean_token_accuracy": 0.6885075569152832,
+ "num_tokens": 16515072.0,
+ "step": 1008
+ },
+ {
+ "entropy": 0.5790199041366577,
+ "epoch": 2.0383838383838384,
+ "grad_norm": 2.0773134231567383,
+ "learning_rate": 6.424242424242425e-06,
+ "loss": 0.5803444981575012,
+ "mean_token_accuracy": 0.8409257531166077,
+ "num_tokens": 16531456.0,
+ "step": 1009
+ },
+ {
+ "entropy": 1.3786348104476929,
+ "epoch": 2.04040404040404,
+ "grad_norm": 2.4630050659179688,
+ "learning_rate": 6.410774410774411e-06,
+ "loss": 1.413762092590332,
+ "mean_token_accuracy": 0.6840498447418213,
+ "num_tokens": 16547840.0,
+ "step": 1010
+ },
+ {
+ "entropy": 1.0889877080917358,
+ "epoch": 2.0424242424242425,
+ "grad_norm": 2.0827176570892334,
+ "learning_rate": 6.397306397306397e-06,
+ "loss": 1.1012202501296997,
+ "mean_token_accuracy": 0.7329018115997314,
+ "num_tokens": 16564224.0,
+ "step": 1011
+ },
+ {
+ "entropy": 1.1251029968261719,
+ "epoch": 2.0444444444444443,
+ "grad_norm": 2.2465784549713135,
+ "learning_rate": 6.3838383838383845e-06,
+ "loss": 1.1805188655853271,
+ "mean_token_accuracy": 0.7307034730911255,
+ "num_tokens": 16580608.0,
+ "step": 1012
+ },
+ {
+ "entropy": 1.0284773111343384,
+ "epoch": 2.0464646464646465,
+ "grad_norm": 2.208253860473633,
+ "learning_rate": 6.370370370370371e-06,
+ "loss": 1.0413470268249512,
+ "mean_token_accuracy": 0.7445651888847351,
+ "num_tokens": 16596992.0,
+ "step": 1013
+ },
+ {
+ "entropy": 0.9029683470726013,
+ "epoch": 2.0484848484848484,
+ "grad_norm": 2.5125656127929688,
+ "learning_rate": 6.356902356902357e-06,
+ "loss": 0.9083307981491089,
+ "mean_token_accuracy": 0.7583048343658447,
+ "num_tokens": 16613376.0,
+ "step": 1014
+ },
+ {
+ "entropy": 1.0634405612945557,
+ "epoch": 2.0505050505050506,
+ "grad_norm": 2.4080238342285156,
+ "learning_rate": 6.343434343434344e-06,
+ "loss": 1.0854010581970215,
+ "mean_token_accuracy": 0.7280166149139404,
+ "num_tokens": 16629760.0,
+ "step": 1015
+ },
+ {
+ "entropy": 1.095357894897461,
+ "epoch": 2.0525252525252524,
+ "grad_norm": 2.3696935176849365,
+ "learning_rate": 6.3299663299663304e-06,
+ "loss": 1.1008697748184204,
+ "mean_token_accuracy": 0.7330239415168762,
+ "num_tokens": 16646144.0,
+ "step": 1016
+ },
+ {
+ "entropy": 0.8473373651504517,
+ "epoch": 2.0545454545454547,
+ "grad_norm": 2.2760303020477295,
+ "learning_rate": 6.316498316498317e-06,
+ "loss": 0.8324838876724243,
+ "mean_token_accuracy": 0.7822422981262207,
+ "num_tokens": 16662528.0,
+ "step": 1017
+ },
+ {
+ "entropy": 1.4589424133300781,
+ "epoch": 2.0565656565656565,
+ "grad_norm": 2.2009267807006836,
+ "learning_rate": 6.303030303030303e-06,
+ "loss": 1.4676311016082764,
+ "mean_token_accuracy": 0.6726306676864624,
+ "num_tokens": 16678912.0,
+ "step": 1018
+ },
+ {
+ "entropy": 1.1835463047027588,
+ "epoch": 2.0585858585858587,
+ "grad_norm": 2.264815330505371,
+ "learning_rate": 6.28956228956229e-06,
+ "loss": 1.172943353652954,
+ "mean_token_accuracy": 0.7181851267814636,
+ "num_tokens": 16695296.0,
+ "step": 1019
+ },
+ {
+ "entropy": 1.0366170406341553,
+ "epoch": 2.0606060606060606,
+ "grad_norm": 2.040250539779663,
+ "learning_rate": 6.276094276094276e-06,
+ "loss": 1.0314842462539673,
+ "mean_token_accuracy": 0.745175838470459,
+ "num_tokens": 16711680.0,
+ "step": 1020
+ },
+ {
+ "entropy": 1.0229740142822266,
+ "epoch": 2.062626262626263,
+ "grad_norm": 2.3892908096313477,
+ "learning_rate": 6.262626262626264e-06,
+ "loss": 0.9976632595062256,
+ "mean_token_accuracy": 0.751099169254303,
+ "num_tokens": 16728064.0,
+ "step": 1021
+ },
+ {
+ "entropy": 1.0881341695785522,
+ "epoch": 2.0646464646464646,
+ "grad_norm": 2.459239959716797,
+ "learning_rate": 6.249158249158249e-06,
+ "loss": 1.0147933959960938,
+ "mean_token_accuracy": 0.7465803623199463,
+ "num_tokens": 16744448.0,
+ "step": 1022
+ },
+ {
+ "entropy": 1.3220701217651367,
+ "epoch": 2.066666666666667,
+ "grad_norm": 2.4171364307403564,
+ "learning_rate": 6.235690235690236e-06,
+ "loss": 1.3207433223724365,
+ "mean_token_accuracy": 0.7020029425621033,
+ "num_tokens": 16760832.0,
+ "step": 1023
+ },
+ {
+ "entropy": 1.1744258403778076,
+ "epoch": 2.0686868686868687,
+ "grad_norm": 2.1978869438171387,
+ "learning_rate": 6.222222222222223e-06,
+ "loss": 1.1690993309020996,
+ "mean_token_accuracy": 0.7153761386871338,
+ "num_tokens": 16777216.0,
+ "step": 1024
+ },
+ {
+ "entropy": 0.8706873059272766,
+ "epoch": 2.0707070707070705,
+ "grad_norm": 2.0721466541290283,
+ "learning_rate": 6.20875420875421e-06,
+ "loss": 0.8407986760139465,
+ "mean_token_accuracy": 0.7790669202804565,
+ "num_tokens": 16793600.0,
+ "step": 1025
+ },
+ {
+ "entropy": 0.7695729732513428,
+ "epoch": 2.0727272727272728,
+ "grad_norm": 2.096400737762451,
+ "learning_rate": 6.195286195286195e-06,
+ "loss": 0.7511329650878906,
+ "mean_token_accuracy": 0.8002564907073975,
+ "num_tokens": 16809984.0,
+ "step": 1026
+ },
+ {
+ "entropy": 0.9394605159759521,
+ "epoch": 2.0747474747474746,
+ "grad_norm": 2.1947765350341797,
+ "learning_rate": 6.181818181818182e-06,
+ "loss": 0.9365648627281189,
+ "mean_token_accuracy": 0.7574499249458313,
+ "num_tokens": 16826368.0,
+ "step": 1027
+ },
+ {
+ "entropy": 0.9941903352737427,
+ "epoch": 2.076767676767677,
+ "grad_norm": 2.017825126647949,
+ "learning_rate": 6.168350168350169e-06,
+ "loss": 0.9688439965248108,
+ "mean_token_accuracy": 0.7499389052391052,
+ "num_tokens": 16842752.0,
+ "step": 1028
+ },
+ {
+ "entropy": 0.6713882088661194,
+ "epoch": 2.0787878787878786,
+ "grad_norm": 2.025696277618408,
+ "learning_rate": 6.154882154882156e-06,
+ "loss": 0.6422317028045654,
+ "mean_token_accuracy": 0.8201636672019958,
+ "num_tokens": 16859136.0,
+ "step": 1029
+ },
+ {
+ "entropy": 1.0641586780548096,
+ "epoch": 2.080808080808081,
+ "grad_norm": 2.1687450408935547,
+ "learning_rate": 6.141414141414141e-06,
+ "loss": 1.055826187133789,
+ "mean_token_accuracy": 0.7419394254684448,
+ "num_tokens": 16875520.0,
+ "step": 1030
+ },
+ {
+ "entropy": 0.9837899804115295,
+ "epoch": 2.0828282828282827,
+ "grad_norm": 2.3160905838012695,
+ "learning_rate": 6.1279461279461286e-06,
+ "loss": 0.9732166528701782,
+ "mean_token_accuracy": 0.7443820238113403,
+ "num_tokens": 16891904.0,
+ "step": 1031
+ },
+ {
+ "entropy": 0.7756745219230652,
+ "epoch": 2.084848484848485,
+ "grad_norm": 2.1464638710021973,
+ "learning_rate": 6.114478114478115e-06,
+ "loss": 0.7793388366699219,
+ "mean_token_accuracy": 0.8052027225494385,
+ "num_tokens": 16908288.0,
+ "step": 1032
+ },
+ {
+ "entropy": 0.9195827841758728,
+ "epoch": 2.0868686868686868,
+ "grad_norm": 2.1330578327178955,
+ "learning_rate": 6.1010101010101015e-06,
+ "loss": 0.9061870574951172,
+ "mean_token_accuracy": 0.7676478028297424,
+ "num_tokens": 16924672.0,
+ "step": 1033
+ },
+ {
+ "entropy": 0.8372635245323181,
+ "epoch": 2.088888888888889,
+ "grad_norm": 1.9992423057556152,
+ "learning_rate": 6.087542087542088e-06,
+ "loss": 0.826106071472168,
+ "mean_token_accuracy": 0.7849902510643005,
+ "num_tokens": 16941056.0,
+ "step": 1034
+ },
+ {
+ "entropy": 0.8915544748306274,
+ "epoch": 2.090909090909091,
+ "grad_norm": 2.100963830947876,
+ "learning_rate": 6.0740740740740745e-06,
+ "loss": 0.8717142343521118,
+ "mean_token_accuracy": 0.7684416174888611,
+ "num_tokens": 16957440.0,
+ "step": 1035
+ },
+ {
+ "entropy": 1.1338574886322021,
+ "epoch": 2.092929292929293,
+ "grad_norm": 2.263211727142334,
+ "learning_rate": 6.060606060606061e-06,
+ "loss": 1.1237502098083496,
+ "mean_token_accuracy": 0.718490481376648,
+ "num_tokens": 16973824.0,
+ "step": 1036
+ },
+ {
+ "entropy": 0.8575322031974792,
+ "epoch": 2.094949494949495,
+ "grad_norm": 2.489158868789673,
+ "learning_rate": 6.047138047138048e-06,
+ "loss": 0.8411874771118164,
+ "mean_token_accuracy": 0.781020998954773,
+ "num_tokens": 16990208.0,
+ "step": 1037
+ },
+ {
+ "entropy": 0.9754064083099365,
+ "epoch": 2.096969696969697,
+ "grad_norm": 2.1259446144104004,
+ "learning_rate": 6.033670033670034e-06,
+ "loss": 0.9752705097198486,
+ "mean_token_accuracy": 0.7573277950286865,
+ "num_tokens": 17006592.0,
+ "step": 1038
+ },
+ {
+ "entropy": 0.830701470375061,
+ "epoch": 2.098989898989899,
+ "grad_norm": 2.162536859512329,
+ "learning_rate": 6.0202020202020204e-06,
+ "loss": 0.8512325882911682,
+ "mean_token_accuracy": 0.7818148732185364,
+ "num_tokens": 17022976.0,
+ "step": 1039
+ },
+ {
+ "entropy": 1.058897614479065,
+ "epoch": 2.101010101010101,
+ "grad_norm": 2.2364299297332764,
+ "learning_rate": 6.006734006734008e-06,
+ "loss": 1.0636553764343262,
+ "mean_token_accuracy": 0.7447484135627747,
+ "num_tokens": 17039360.0,
+ "step": 1040
+ },
+ {
+ "entropy": 0.8365826606750488,
+ "epoch": 2.103030303030303,
+ "grad_norm": 2.1749696731567383,
+ "learning_rate": 5.993265993265994e-06,
+ "loss": 0.8460502028465271,
+ "mean_token_accuracy": 0.7821201682090759,
+ "num_tokens": 17055744.0,
+ "step": 1041
+ },
+ {
+ "entropy": 0.7591535449028015,
+ "epoch": 2.105050505050505,
+ "grad_norm": 2.215092182159424,
+ "learning_rate": 5.97979797979798e-06,
+ "loss": 0.7658643126487732,
+ "mean_token_accuracy": 0.8003175258636475,
+ "num_tokens": 17072128.0,
+ "step": 1042
+ },
+ {
+ "entropy": 1.1817188262939453,
+ "epoch": 2.107070707070707,
+ "grad_norm": 2.094550371170044,
+ "learning_rate": 5.966329966329966e-06,
+ "loss": 1.183272361755371,
+ "mean_token_accuracy": 0.7251465320587158,
+ "num_tokens": 17088512.0,
+ "step": 1043
+ },
+ {
+ "entropy": 0.7743434309959412,
+ "epoch": 2.109090909090909,
+ "grad_norm": 1.9481000900268555,
+ "learning_rate": 5.952861952861954e-06,
+ "loss": 0.7503235936164856,
+ "mean_token_accuracy": 0.8009892702102661,
+ "num_tokens": 17104896.0,
+ "step": 1044
+ },
+ {
+ "entropy": 0.9779418110847473,
+ "epoch": 2.111111111111111,
+ "grad_norm": 10.17557430267334,
+ "learning_rate": 5.93939393939394e-06,
+ "loss": 1.1502952575683594,
+ "mean_token_accuracy": 0.7345505356788635,
+ "num_tokens": 17121280.0,
+ "step": 1045
+ },
+ {
+ "entropy": 0.7385470867156982,
+ "epoch": 2.113131313131313,
+ "grad_norm": 2.2240688800811768,
+ "learning_rate": 5.925925925925926e-06,
+ "loss": 0.7330628633499146,
+ "mean_token_accuracy": 0.7921959161758423,
+ "num_tokens": 17137664.0,
+ "step": 1046
+ },
+ {
+ "entropy": 1.0204321146011353,
+ "epoch": 2.1151515151515152,
+ "grad_norm": 2.159083843231201,
+ "learning_rate": 5.912457912457913e-06,
+ "loss": 1.0087707042694092,
+ "mean_token_accuracy": 0.7565950155258179,
+ "num_tokens": 17154048.0,
+ "step": 1047
+ },
+ {
+ "entropy": 1.3662269115447998,
+ "epoch": 2.117171717171717,
+ "grad_norm": 2.3070926666259766,
+ "learning_rate": 5.8989898989899e-06,
+ "loss": 1.3453154563903809,
+ "mean_token_accuracy": 0.6869198679924011,
+ "num_tokens": 17170432.0,
+ "step": 1048
+ },
+ {
+ "entropy": 1.2418196201324463,
+ "epoch": 2.1191919191919193,
+ "grad_norm": 2.257704734802246,
+ "learning_rate": 5.885521885521886e-06,
+ "loss": 1.2455103397369385,
+ "mean_token_accuracy": 0.709269642829895,
+ "num_tokens": 17186816.0,
+ "step": 1049
+ },
+ {
+ "entropy": 0.9079713821411133,
+ "epoch": 2.121212121212121,
+ "grad_norm": 2.195234537124634,
+ "learning_rate": 5.872053872053873e-06,
+ "loss": 0.8855721950531006,
+ "mean_token_accuracy": 0.7701514363288879,
+ "num_tokens": 17203200.0,
+ "step": 1050
+ },
+ {
+ "entropy": 0.975200891494751,
+ "epoch": 2.1232323232323234,
+ "grad_norm": 2.146843671798706,
+ "learning_rate": 5.858585858585859e-06,
+ "loss": 0.9658151865005493,
+ "mean_token_accuracy": 0.7715559601783752,
+ "num_tokens": 17219584.0,
+ "step": 1051
+ },
+ {
+ "entropy": 0.9608264565467834,
+ "epoch": 2.125252525252525,
+ "grad_norm": 2.330017566680908,
+ "learning_rate": 5.8451178451178456e-06,
+ "loss": 0.9278503656387329,
+ "mean_token_accuracy": 0.7578774094581604,
+ "num_tokens": 17235968.0,
+ "step": 1052
+ },
+ {
+ "entropy": 0.6266511082649231,
+ "epoch": 2.1272727272727274,
+ "grad_norm": 1.9988964796066284,
+ "learning_rate": 5.831649831649833e-06,
+ "loss": 0.6169615983963013,
+ "mean_token_accuracy": 0.8298729658126831,
+ "num_tokens": 17252352.0,
+ "step": 1053
+ },
+ {
+ "entropy": 1.2015810012817383,
+ "epoch": 2.1292929292929292,
+ "grad_norm": 2.2715466022491455,
+ "learning_rate": 5.8181818181818185e-06,
+ "loss": 1.1880292892456055,
+ "mean_token_accuracy": 0.7046898007392883,
+ "num_tokens": 17268736.0,
+ "step": 1054
+ },
+ {
+ "entropy": 1.107398271560669,
+ "epoch": 2.1313131313131315,
+ "grad_norm": 2.1081430912017822,
+ "learning_rate": 5.804713804713805e-06,
+ "loss": 1.1123331785202026,
+ "mean_token_accuracy": 0.7287493944168091,
+ "num_tokens": 17285120.0,
+ "step": 1055
+ },
+ {
+ "entropy": 0.7515788674354553,
+ "epoch": 2.1333333333333333,
+ "grad_norm": 2.2605152130126953,
+ "learning_rate": 5.791245791245792e-06,
+ "loss": 0.7696233987808228,
+ "mean_token_accuracy": 0.7863947153091431,
+ "num_tokens": 17301504.0,
+ "step": 1056
+ },
+ {
+ "entropy": 1.1765409708023071,
+ "epoch": 2.1353535353535356,
+ "grad_norm": 2.3561489582061768,
+ "learning_rate": 5.777777777777778e-06,
+ "loss": 1.1908636093139648,
+ "mean_token_accuracy": 0.7037127614021301,
+ "num_tokens": 17317888.0,
+ "step": 1057
+ },
+ {
+ "entropy": 1.3084092140197754,
+ "epoch": 2.1373737373737374,
+ "grad_norm": 2.1483852863311768,
+ "learning_rate": 5.7643097643097645e-06,
+ "loss": 1.2867857217788696,
+ "mean_token_accuracy": 0.7012090682983398,
+ "num_tokens": 17334272.0,
+ "step": 1058
+ },
+ {
+ "entropy": 1.241392731666565,
+ "epoch": 2.1393939393939396,
+ "grad_norm": 2.342715263366699,
+ "learning_rate": 5.750841750841751e-06,
+ "loss": 1.2093181610107422,
+ "mean_token_accuracy": 0.7300928235054016,
+ "num_tokens": 17350656.0,
+ "step": 1059
+ },
+ {
+ "entropy": 1.0139163732528687,
+ "epoch": 2.1414141414141414,
+ "grad_norm": 2.211137533187866,
+ "learning_rate": 5.737373737373738e-06,
+ "loss": 0.9826461672782898,
+ "mean_token_accuracy": 0.7470688819885254,
+ "num_tokens": 17367040.0,
+ "step": 1060
+ },
+ {
+ "entropy": 1.163819670677185,
+ "epoch": 2.1434343434343432,
+ "grad_norm": 2.1510820388793945,
+ "learning_rate": 5.723905723905724e-06,
+ "loss": 1.141978144645691,
+ "mean_token_accuracy": 0.7236199378967285,
+ "num_tokens": 17383424.0,
+ "step": 1061
+ },
+ {
+ "entropy": 1.2484748363494873,
+ "epoch": 2.1454545454545455,
+ "grad_norm": 2.096975088119507,
+ "learning_rate": 5.71043771043771e-06,
+ "loss": 1.2311407327651978,
+ "mean_token_accuracy": 0.697300910949707,
+ "num_tokens": 17399808.0,
+ "step": 1062
+ },
+ {
+ "entropy": 0.763225793838501,
+ "epoch": 2.1474747474747473,
+ "grad_norm": 2.2745585441589355,
+ "learning_rate": 5.696969696969698e-06,
+ "loss": 0.740476131439209,
+ "mean_token_accuracy": 0.797813892364502,
+ "num_tokens": 17416192.0,
+ "step": 1063
+ },
+ {
+ "entropy": 1.161580204963684,
+ "epoch": 2.1494949494949496,
+ "grad_norm": 2.205702543258667,
+ "learning_rate": 5.683501683501684e-06,
+ "loss": 1.1578772068023682,
+ "mean_token_accuracy": 0.7220322489738464,
+ "num_tokens": 17432576.0,
+ "step": 1064
+ },
+ {
+ "entropy": 1.3429193496704102,
+ "epoch": 2.1515151515151514,
+ "grad_norm": 2.1587917804718018,
+ "learning_rate": 5.67003367003367e-06,
+ "loss": 1.3394683599472046,
+ "mean_token_accuracy": 0.6847215294837952,
+ "num_tokens": 17448960.0,
+ "step": 1065
+ },
+ {
+ "entropy": 0.8381629586219788,
+ "epoch": 2.1535353535353536,
+ "grad_norm": 2.017162322998047,
+ "learning_rate": 5.656565656565657e-06,
+ "loss": 0.8215705156326294,
+ "mean_token_accuracy": 0.7872496247291565,
+ "num_tokens": 17465344.0,
+ "step": 1066
+ },
+ {
+ "entropy": 0.7657965421676636,
+ "epoch": 2.1555555555555554,
+ "grad_norm": 2.1969051361083984,
+ "learning_rate": 5.643097643097644e-06,
+ "loss": 0.778290867805481,
+ "mean_token_accuracy": 0.7841353416442871,
+ "num_tokens": 17481728.0,
+ "step": 1067
+ },
+ {
+ "entropy": 0.8711634874343872,
+ "epoch": 2.1575757575757577,
+ "grad_norm": 2.1608996391296387,
+ "learning_rate": 5.62962962962963e-06,
+ "loss": 0.8894504904747009,
+ "mean_token_accuracy": 0.7703956961631775,
+ "num_tokens": 17498112.0,
+ "step": 1068
+ },
+ {
+ "entropy": 1.127463698387146,
+ "epoch": 2.1595959595959595,
+ "grad_norm": 2.3153634071350098,
+ "learning_rate": 5.616161616161616e-06,
+ "loss": 1.1329922676086426,
+ "mean_token_accuracy": 0.7192232608795166,
+ "num_tokens": 17514496.0,
+ "step": 1069
+ },
+ {
+ "entropy": 0.8976262807846069,
+ "epoch": 2.1616161616161618,
+ "grad_norm": 2.4478628635406494,
+ "learning_rate": 5.602693602693603e-06,
+ "loss": 0.8956177830696106,
+ "mean_token_accuracy": 0.7629457712173462,
+ "num_tokens": 17530880.0,
+ "step": 1070
+ },
+ {
+ "entropy": 1.052526831626892,
+ "epoch": 2.1636363636363636,
+ "grad_norm": 2.4650626182556152,
+ "learning_rate": 5.58922558922559e-06,
+ "loss": 1.0365463495254517,
+ "mean_token_accuracy": 0.7423058152198792,
+ "num_tokens": 17547264.0,
+ "step": 1071
+ },
+ {
+ "entropy": 1.2520077228546143,
+ "epoch": 2.165656565656566,
+ "grad_norm": 2.1537535190582275,
+ "learning_rate": 5.575757575757577e-06,
+ "loss": 1.2596616744995117,
+ "mean_token_accuracy": 0.7003541588783264,
+ "num_tokens": 17563648.0,
+ "step": 1072
+ },
+ {
+ "entropy": 1.2266544103622437,
+ "epoch": 2.1676767676767676,
+ "grad_norm": 2.3401050567626953,
+ "learning_rate": 5.562289562289563e-06,
+ "loss": 1.2335799932479858,
+ "mean_token_accuracy": 0.6985222101211548,
+ "num_tokens": 17580032.0,
+ "step": 1073
+ },
+ {
+ "entropy": 0.9337752461433411,
+ "epoch": 2.16969696969697,
+ "grad_norm": 2.229626178741455,
+ "learning_rate": 5.548821548821549e-06,
+ "loss": 0.9321554899215698,
+ "mean_token_accuracy": 0.7583659291267395,
+ "num_tokens": 17596416.0,
+ "step": 1074
+ },
+ {
+ "entropy": 0.6643204689025879,
+ "epoch": 2.1717171717171717,
+ "grad_norm": 2.038248300552368,
+ "learning_rate": 5.5353535353535355e-06,
+ "loss": 0.6427558064460754,
+ "mean_token_accuracy": 0.8161944150924683,
+ "num_tokens": 17612800.0,
+ "step": 1075
+ },
+ {
+ "entropy": 0.9372988939285278,
+ "epoch": 2.1737373737373735,
+ "grad_norm": 2.398390293121338,
+ "learning_rate": 5.521885521885523e-06,
+ "loss": 0.9131875038146973,
+ "mean_token_accuracy": 0.7569003701210022,
+ "num_tokens": 17629184.0,
+ "step": 1076
+ },
+ {
+ "entropy": 1.3854912519454956,
+ "epoch": 2.175757575757576,
+ "grad_norm": 2.325932264328003,
+ "learning_rate": 5.5084175084175085e-06,
+ "loss": 1.3354313373565674,
+ "mean_token_accuracy": 0.6645700931549072,
+ "num_tokens": 17645568.0,
+ "step": 1077
+ },
+ {
+ "entropy": 0.9905093908309937,
+ "epoch": 2.1777777777777776,
+ "grad_norm": 2.303408622741699,
+ "learning_rate": 5.494949494949495e-06,
+ "loss": 0.9684986472129822,
+ "mean_token_accuracy": 0.7507327795028687,
+ "num_tokens": 17661952.0,
+ "step": 1078
+ },
+ {
+ "entropy": 1.1516029834747314,
+ "epoch": 2.17979797979798,
+ "grad_norm": 2.1588361263275146,
+ "learning_rate": 5.481481481481482e-06,
+ "loss": 1.1108394861221313,
+ "mean_token_accuracy": 0.7329018115997314,
+ "num_tokens": 17678336.0,
+ "step": 1079
+ },
+ {
+ "entropy": 1.1009210348129272,
+ "epoch": 2.1818181818181817,
+ "grad_norm": 2.294980764389038,
+ "learning_rate": 5.468013468013469e-06,
+ "loss": 1.0698065757751465,
+ "mean_token_accuracy": 0.7306423783302307,
+ "num_tokens": 17694720.0,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5653274655342102,
+ "epoch": 2.183838383838384,
+ "grad_norm": 1.7224467992782593,
+ "learning_rate": 5.4545454545454545e-06,
+ "loss": 0.5569928884506226,
+ "mean_token_accuracy": 0.8492305874824524,
+ "num_tokens": 17711104.0,
+ "step": 1081
+ },
+ {
+ "entropy": 0.7761416435241699,
+ "epoch": 2.1858585858585857,
+ "grad_norm": 2.062605142593384,
+ "learning_rate": 5.441077441077442e-06,
+ "loss": 0.7638991475105286,
+ "mean_token_accuracy": 0.8034929037094116,
+ "num_tokens": 17727488.0,
+ "step": 1082
+ },
+ {
+ "entropy": 0.7888216972351074,
+ "epoch": 2.187878787878788,
+ "grad_norm": 1.8905524015426636,
+ "learning_rate": 5.427609427609428e-06,
+ "loss": 0.7825406789779663,
+ "mean_token_accuracy": 0.7937225103378296,
+ "num_tokens": 17743872.0,
+ "step": 1083
+ },
+ {
+ "entropy": 0.9246746897697449,
+ "epoch": 2.18989898989899,
+ "grad_norm": 2.466188669204712,
+ "learning_rate": 5.414141414141415e-06,
+ "loss": 0.9468541145324707,
+ "mean_token_accuracy": 0.7498778700828552,
+ "num_tokens": 17760256.0,
+ "step": 1084
+ },
+ {
+ "entropy": 1.24199640750885,
+ "epoch": 2.191919191919192,
+ "grad_norm": 2.341604232788086,
+ "learning_rate": 5.4006734006734e-06,
+ "loss": 1.218245029449463,
+ "mean_token_accuracy": 0.7104299068450928,
+ "num_tokens": 17776640.0,
+ "step": 1085
+ },
+ {
+ "entropy": 1.120385766029358,
+ "epoch": 2.193939393939394,
+ "grad_norm": 2.2657902240753174,
+ "learning_rate": 5.387205387205388e-06,
+ "loss": 1.10544753074646,
+ "mean_token_accuracy": 0.7314362525939941,
+ "num_tokens": 17793024.0,
+ "step": 1086
+ },
+ {
+ "entropy": 1.1147528886795044,
+ "epoch": 2.195959595959596,
+ "grad_norm": 2.1902315616607666,
+ "learning_rate": 5.373737373737374e-06,
+ "loss": 1.121596097946167,
+ "mean_token_accuracy": 0.7246580123901367,
+ "num_tokens": 17809408.0,
+ "step": 1087
+ },
+ {
+ "entropy": 1.0283604860305786,
+ "epoch": 2.197979797979798,
+ "grad_norm": 2.2043023109436035,
+ "learning_rate": 5.3602693602693615e-06,
+ "loss": 1.0231928825378418,
+ "mean_token_accuracy": 0.7412676811218262,
+ "num_tokens": 17825792.0,
+ "step": 1088
+ },
+ {
+ "entropy": 0.7668783068656921,
+ "epoch": 2.2,
+ "grad_norm": 2.281240701675415,
+ "learning_rate": 5.346801346801347e-06,
+ "loss": 0.7641464471817017,
+ "mean_token_accuracy": 0.7999511361122131,
+ "num_tokens": 17842176.0,
+ "step": 1089
+ },
+ {
+ "entropy": 0.8896923065185547,
+ "epoch": 2.202020202020202,
+ "grad_norm": 2.1806983947753906,
+ "learning_rate": 5.333333333333334e-06,
+ "loss": 0.9093960523605347,
+ "mean_token_accuracy": 0.768991231918335,
+ "num_tokens": 17858560.0,
+ "step": 1090
+ },
+ {
+ "entropy": 0.7874066829681396,
+ "epoch": 2.2040404040404042,
+ "grad_norm": 2.2266900539398193,
+ "learning_rate": 5.31986531986532e-06,
+ "loss": 0.781766414642334,
+ "mean_token_accuracy": 0.784807026386261,
+ "num_tokens": 17874944.0,
+ "step": 1091
+ },
+ {
+ "entropy": 1.0619457960128784,
+ "epoch": 2.206060606060606,
+ "grad_norm": 2.4347457885742188,
+ "learning_rate": 5.3063973063973075e-06,
+ "loss": 1.1253571510314941,
+ "mean_token_accuracy": 0.7411455512046814,
+ "num_tokens": 17891328.0,
+ "step": 1092
+ },
+ {
+ "entropy": 0.8278951048851013,
+ "epoch": 2.2080808080808083,
+ "grad_norm": 2.1931722164154053,
+ "learning_rate": 5.292929292929293e-06,
+ "loss": 0.8328354358673096,
+ "mean_token_accuracy": 0.7835246920585632,
+ "num_tokens": 17907712.0,
+ "step": 1093
+ },
+ {
+ "entropy": 1.0070204734802246,
+ "epoch": 2.21010101010101,
+ "grad_norm": 2.1386632919311523,
+ "learning_rate": 5.27946127946128e-06,
+ "loss": 1.0087940692901611,
+ "mean_token_accuracy": 0.7423668503761292,
+ "num_tokens": 17924096.0,
+ "step": 1094
+ },
+ {
+ "entropy": 1.1913471221923828,
+ "epoch": 2.212121212121212,
+ "grad_norm": 2.0004987716674805,
+ "learning_rate": 5.265993265993267e-06,
+ "loss": 1.1983554363250732,
+ "mean_token_accuracy": 0.7126282453536987,
+ "num_tokens": 17940480.0,
+ "step": 1095
+ },
+ {
+ "entropy": 1.0097228288650513,
+ "epoch": 2.214141414141414,
+ "grad_norm": 2.0011065006256104,
+ "learning_rate": 5.252525252525253e-06,
+ "loss": 1.003847360610962,
+ "mean_token_accuracy": 0.7553126811981201,
+ "num_tokens": 17956864.0,
+ "step": 1096
+ },
+ {
+ "entropy": 0.7539495229721069,
+ "epoch": 2.216161616161616,
+ "grad_norm": 2.109707832336426,
+ "learning_rate": 5.239057239057239e-06,
+ "loss": 0.735792875289917,
+ "mean_token_accuracy": 0.8071568012237549,
+ "num_tokens": 17973248.0,
+ "step": 1097
+ },
+ {
+ "entropy": 1.2859326601028442,
+ "epoch": 2.2181818181818183,
+ "grad_norm": 2.2937707901000977,
+ "learning_rate": 5.225589225589226e-06,
+ "loss": 1.2867331504821777,
+ "mean_token_accuracy": 0.6965070962905884,
+ "num_tokens": 17989632.0,
+ "step": 1098
+ },
+ {
+ "entropy": 0.9745997190475464,
+ "epoch": 2.22020202020202,
+ "grad_norm": 2.4093194007873535,
+ "learning_rate": 5.212121212121213e-06,
+ "loss": 0.9495588541030884,
+ "mean_token_accuracy": 0.7793111801147461,
+ "num_tokens": 18006016.0,
+ "step": 1099
+ },
+ {
+ "entropy": 1.210206389427185,
+ "epoch": 2.2222222222222223,
+ "grad_norm": 2.307809352874756,
+ "learning_rate": 5.198653198653199e-06,
+ "loss": 1.190993070602417,
+ "mean_token_accuracy": 0.7073766589164734,
+ "num_tokens": 18022400.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.2222222222222223,
+ "eval_entropy": 1.1411552967563752,
+ "eval_loss": 1.6080615520477295,
+ "eval_mean_token_accuracy": 0.6425399270749861,
+ "eval_num_tokens": 18022400.0,
+ "eval_runtime": 43.7895,
+ "eval_samples_per_second": 22.608,
+ "eval_steps_per_second": 2.832,
+ "step": 1100
+ },
+ {
+ "entropy": 0.771600067615509,
+ "epoch": 2.224242424242424,
+ "grad_norm": 2.2073745727539062,
+ "learning_rate": 5.185185185185185e-06,
+ "loss": 0.7411383390426636,
+ "mean_token_accuracy": 0.8007450103759766,
+ "num_tokens": 18038784.0,
+ "step": 1101
+ },
+ {
+ "entropy": 0.8682986497879028,
+ "epoch": 2.2262626262626264,
+ "grad_norm": 2.036909580230713,
+ "learning_rate": 5.171717171717172e-06,
+ "loss": 0.8770009875297546,
+ "mean_token_accuracy": 0.7767464518547058,
+ "num_tokens": 18055168.0,
+ "step": 1102
+ },
+ {
+ "entropy": 1.0334750413894653,
+ "epoch": 2.228282828282828,
+ "grad_norm": 2.139882802963257,
+ "learning_rate": 5.158249158249159e-06,
+ "loss": 1.020939826965332,
+ "mean_token_accuracy": 0.7569614052772522,
+ "num_tokens": 18071552.0,
+ "step": 1103
+ },
+ {
+ "entropy": 1.24951171875,
+ "epoch": 2.2303030303030305,
+ "grad_norm": 2.2494804859161377,
+ "learning_rate": 5.1447811447811444e-06,
+ "loss": 1.2513877153396606,
+ "mean_token_accuracy": 0.7010259032249451,
+ "num_tokens": 18087936.0,
+ "step": 1104
+ },
+ {
+ "entropy": 0.8687318563461304,
+ "epoch": 2.2323232323232323,
+ "grad_norm": 2.346163511276245,
+ "learning_rate": 5.131313131313132e-06,
+ "loss": 0.856663167476654,
+ "mean_token_accuracy": 0.7724108695983887,
+ "num_tokens": 18104320.0,
+ "step": 1105
+ },
+ {
+ "entropy": 0.9489924311637878,
+ "epoch": 2.2343434343434345,
+ "grad_norm": 2.3031630516052246,
+ "learning_rate": 5.117845117845118e-06,
+ "loss": 0.9237314462661743,
+ "mean_token_accuracy": 0.7616023421287537,
+ "num_tokens": 18120704.0,
+ "step": 1106
+ },
+ {
+ "entropy": 0.7660726308822632,
+ "epoch": 2.2363636363636363,
+ "grad_norm": 2.0157992839813232,
+ "learning_rate": 5.104377104377105e-06,
+ "loss": 0.7505912184715271,
+ "mean_token_accuracy": 0.8021494746208191,
+ "num_tokens": 18137088.0,
+ "step": 1107
+ },
+ {
+ "entropy": 0.8646788597106934,
+ "epoch": 2.2383838383838386,
+ "grad_norm": 2.1639404296875,
+ "learning_rate": 5.090909090909091e-06,
+ "loss": 0.8640313148498535,
+ "mean_token_accuracy": 0.7763190269470215,
+ "num_tokens": 18153472.0,
+ "step": 1108
+ },
+ {
+ "entropy": 1.0876270532608032,
+ "epoch": 2.2404040404040404,
+ "grad_norm": 2.2591774463653564,
+ "learning_rate": 5.077441077441078e-06,
+ "loss": 1.0915470123291016,
+ "mean_token_accuracy": 0.7280776500701904,
+ "num_tokens": 18169856.0,
+ "step": 1109
+ },
+ {
+ "entropy": 0.8739895224571228,
+ "epoch": 2.242424242424242,
+ "grad_norm": 2.1637771129608154,
+ "learning_rate": 5.063973063973064e-06,
+ "loss": 0.8555219769477844,
+ "mean_token_accuracy": 0.7708231806755066,
+ "num_tokens": 18186240.0,
+ "step": 1110
+ },
+ {
+ "entropy": 1.0880624055862427,
+ "epoch": 2.2444444444444445,
+ "grad_norm": 2.145496129989624,
+ "learning_rate": 5.0505050505050515e-06,
+ "loss": 1.0848066806793213,
+ "mean_token_accuracy": 0.736993134021759,
+ "num_tokens": 18202624.0,
+ "step": 1111
+ },
+ {
+ "entropy": 1.0834776163101196,
+ "epoch": 2.2464646464646463,
+ "grad_norm": 2.387665033340454,
+ "learning_rate": 5.037037037037037e-06,
+ "loss": 1.0987672805786133,
+ "mean_token_accuracy": 0.7160478830337524,
+ "num_tokens": 18219008.0,
+ "step": 1112
+ },
+ {
+ "entropy": 0.928567111492157,
+ "epoch": 2.2484848484848485,
+ "grad_norm": 2.15563702583313,
+ "learning_rate": 5.023569023569024e-06,
+ "loss": 0.9242000579833984,
+ "mean_token_accuracy": 0.7684416174888611,
+ "num_tokens": 18235392.0,
+ "step": 1113
+ },
+ {
+ "entropy": 0.7360862493515015,
+ "epoch": 2.2505050505050503,
+ "grad_norm": 2.1846494674682617,
+ "learning_rate": 5.010101010101011e-06,
+ "loss": 0.7165976762771606,
+ "mean_token_accuracy": 0.7969589829444885,
+ "num_tokens": 18251776.0,
+ "step": 1114
+ },
+ {
+ "entropy": 0.8648936152458191,
+ "epoch": 2.2525252525252526,
+ "grad_norm": 2.4350926876068115,
+ "learning_rate": 4.996632996632997e-06,
+ "loss": 0.85498046875,
+ "mean_token_accuracy": 0.7721055150032043,
+ "num_tokens": 18268160.0,
+ "step": 1115
+ },
+ {
+ "entropy": 1.095477819442749,
+ "epoch": 2.2545454545454544,
+ "grad_norm": 2.1980817317962646,
+ "learning_rate": 4.983164983164984e-06,
+ "loss": 1.110865592956543,
+ "mean_token_accuracy": 0.7231314182281494,
+ "num_tokens": 18284544.0,
+ "step": 1116
+ },
+ {
+ "entropy": 0.9207680821418762,
+ "epoch": 2.2565656565656567,
+ "grad_norm": 2.0694732666015625,
+ "learning_rate": 4.9696969696969696e-06,
+ "loss": 0.8975710272789001,
+ "mean_token_accuracy": 0.7692965269088745,
+ "num_tokens": 18300928.0,
+ "step": 1117
+ },
+ {
+ "entropy": 1.0263354778289795,
+ "epoch": 2.2585858585858585,
+ "grad_norm": 2.0532844066619873,
+ "learning_rate": 4.956228956228957e-06,
+ "loss": 1.0378568172454834,
+ "mean_token_accuracy": 0.7442598938941956,
+ "num_tokens": 18317312.0,
+ "step": 1118
+ },
+ {
+ "entropy": 0.9276180267333984,
+ "epoch": 2.2606060606060607,
+ "grad_norm": 2.2308754920959473,
+ "learning_rate": 4.942760942760943e-06,
+ "loss": 0.8967354893684387,
+ "mean_token_accuracy": 0.7642892003059387,
+ "num_tokens": 18333696.0,
+ "step": 1119
+ },
+ {
+ "entropy": 1.5558041334152222,
+ "epoch": 2.2626262626262625,
+ "grad_norm": 2.5063514709472656,
+ "learning_rate": 4.92929292929293e-06,
+ "loss": 1.5838005542755127,
+ "mean_token_accuracy": 0.6414875388145447,
+ "num_tokens": 18350080.0,
+ "step": 1120
+ },
+ {
+ "entropy": 0.7984672784805298,
+ "epoch": 2.264646464646465,
+ "grad_norm": 2.019965887069702,
+ "learning_rate": 4.915824915824916e-06,
+ "loss": 0.796333909034729,
+ "mean_token_accuracy": 0.7834025621414185,
+ "num_tokens": 18366464.0,
+ "step": 1121
+ },
+ {
+ "entropy": 1.5188385248184204,
+ "epoch": 2.2666666666666666,
+ "grad_norm": 2.1626179218292236,
+ "learning_rate": 4.902356902356903e-06,
+ "loss": 1.4933388233184814,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 18382848.0,
+ "step": 1122
+ },
+ {
+ "entropy": 0.8135427832603455,
+ "epoch": 2.268686868686869,
+ "grad_norm": 2.1165366172790527,
+ "learning_rate": 4.888888888888889e-06,
+ "loss": 0.815280020236969,
+ "mean_token_accuracy": 0.7854787707328796,
+ "num_tokens": 18399232.0,
+ "step": 1123
+ },
+ {
+ "entropy": 1.0267316102981567,
+ "epoch": 2.2707070707070707,
+ "grad_norm": 2.315552234649658,
+ "learning_rate": 4.875420875420876e-06,
+ "loss": 1.021623969078064,
+ "mean_token_accuracy": 0.7460307478904724,
+ "num_tokens": 18415616.0,
+ "step": 1124
+ },
+ {
+ "entropy": 1.0322307348251343,
+ "epoch": 2.2727272727272725,
+ "grad_norm": 2.4442577362060547,
+ "learning_rate": 4.861952861952862e-06,
+ "loss": 1.0230128765106201,
+ "mean_token_accuracy": 0.7383365631103516,
+ "num_tokens": 18432000.0,
+ "step": 1125
+ },
+ {
+ "entropy": 0.7536509037017822,
+ "epoch": 2.2747474747474747,
+ "grad_norm": 2.087148666381836,
+ "learning_rate": 4.848484848484849e-06,
+ "loss": 0.7206662893295288,
+ "mean_token_accuracy": 0.8106375336647034,
+ "num_tokens": 18448384.0,
+ "step": 1126
+ },
+ {
+ "entropy": 1.132371425628662,
+ "epoch": 2.276767676767677,
+ "grad_norm": 2.144556999206543,
+ "learning_rate": 4.835016835016835e-06,
+ "loss": 1.1253585815429688,
+ "mean_token_accuracy": 0.7419394254684448,
+ "num_tokens": 18464768.0,
+ "step": 1127
+ },
+ {
+ "entropy": 0.6875131130218506,
+ "epoch": 2.278787878787879,
+ "grad_norm": 2.204012632369995,
+ "learning_rate": 4.821548821548822e-06,
+ "loss": 0.6672695875167847,
+ "mean_token_accuracy": 0.8155837655067444,
+ "num_tokens": 18481152.0,
+ "step": 1128
+ },
+ {
+ "entropy": 1.1031876802444458,
+ "epoch": 2.2808080808080806,
+ "grad_norm": 2.0218825340270996,
+ "learning_rate": 4.808080808080808e-06,
+ "loss": 1.106371521949768,
+ "mean_token_accuracy": 0.7319247722625732,
+ "num_tokens": 18497536.0,
+ "step": 1129
+ },
+ {
+ "entropy": 1.3797358274459839,
+ "epoch": 2.282828282828283,
+ "grad_norm": 2.2343342304229736,
+ "learning_rate": 4.7946127946127956e-06,
+ "loss": 1.3944905996322632,
+ "mean_token_accuracy": 0.689728856086731,
+ "num_tokens": 18513920.0,
+ "step": 1130
+ },
+ {
+ "entropy": 1.2295851707458496,
+ "epoch": 2.2848484848484847,
+ "grad_norm": 2.32977294921875,
+ "learning_rate": 4.781144781144781e-06,
+ "loss": 1.2050158977508545,
+ "mean_token_accuracy": 0.7108573317527771,
+ "num_tokens": 18530304.0,
+ "step": 1131
+ },
+ {
+ "entropy": 1.0025029182434082,
+ "epoch": 2.286868686868687,
+ "grad_norm": 2.275966167449951,
+ "learning_rate": 4.7676767676767685e-06,
+ "loss": 1.011232852935791,
+ "mean_token_accuracy": 0.7412066459655762,
+ "num_tokens": 18546688.0,
+ "step": 1132
+ },
+ {
+ "entropy": 1.2037127017974854,
+ "epoch": 2.2888888888888888,
+ "grad_norm": 2.317436933517456,
+ "learning_rate": 4.754208754208754e-06,
+ "loss": 1.2052998542785645,
+ "mean_token_accuracy": 0.7090864777565002,
+ "num_tokens": 18563072.0,
+ "step": 1133
+ },
+ {
+ "entropy": 0.9764331579208374,
+ "epoch": 2.290909090909091,
+ "grad_norm": 2.0774219036102295,
+ "learning_rate": 4.7407407407407415e-06,
+ "loss": 0.9488927125930786,
+ "mean_token_accuracy": 0.7618466019630432,
+ "num_tokens": 18579456.0,
+ "step": 1134
+ },
+ {
+ "entropy": 0.8998712301254272,
+ "epoch": 2.292929292929293,
+ "grad_norm": 1.9016351699829102,
+ "learning_rate": 4.727272727272728e-06,
+ "loss": 0.8935770988464355,
+ "mean_token_accuracy": 0.7713117003440857,
+ "num_tokens": 18595840.0,
+ "step": 1135
+ },
+ {
+ "entropy": 0.9964506030082703,
+ "epoch": 2.294949494949495,
+ "grad_norm": 2.2267792224884033,
+ "learning_rate": 4.7138047138047145e-06,
+ "loss": 0.9771631360054016,
+ "mean_token_accuracy": 0.7502442598342896,
+ "num_tokens": 18612224.0,
+ "step": 1136
+ },
+ {
+ "entropy": 1.2267141342163086,
+ "epoch": 2.296969696969697,
+ "grad_norm": 2.3059990406036377,
+ "learning_rate": 4.700336700336701e-06,
+ "loss": 1.2470276355743408,
+ "mean_token_accuracy": 0.7123228907585144,
+ "num_tokens": 18628608.0,
+ "step": 1137
+ },
+ {
+ "entropy": 0.9602224826812744,
+ "epoch": 2.298989898989899,
+ "grad_norm": 2.163684129714966,
+ "learning_rate": 4.6868686868686874e-06,
+ "loss": 0.9301580190658569,
+ "mean_token_accuracy": 0.7639839053153992,
+ "num_tokens": 18644992.0,
+ "step": 1138
+ },
+ {
+ "entropy": 0.9604593515396118,
+ "epoch": 2.301010101010101,
+ "grad_norm": 2.0252676010131836,
+ "learning_rate": 4.673400673400674e-06,
+ "loss": 0.9598495364189148,
+ "mean_token_accuracy": 0.7568392753601074,
+ "num_tokens": 18661376.0,
+ "step": 1139
+ },
+ {
+ "entropy": 0.8657703995704651,
+ "epoch": 2.303030303030303,
+ "grad_norm": 2.4980340003967285,
+ "learning_rate": 4.65993265993266e-06,
+ "loss": 0.8338019847869873,
+ "mean_token_accuracy": 0.7745481133460999,
+ "num_tokens": 18677760.0,
+ "step": 1140
+ },
+ {
+ "entropy": 1.0187418460845947,
+ "epoch": 2.305050505050505,
+ "grad_norm": 2.1227967739105225,
+ "learning_rate": 4.646464646464647e-06,
+ "loss": 1.0039290189743042,
+ "mean_token_accuracy": 0.7410845160484314,
+ "num_tokens": 18694144.0,
+ "step": 1141
+ },
+ {
+ "entropy": 1.2160016298294067,
+ "epoch": 2.3070707070707073,
+ "grad_norm": 2.737518310546875,
+ "learning_rate": 4.632996632996633e-06,
+ "loss": 1.2041016817092896,
+ "mean_token_accuracy": 0.708170473575592,
+ "num_tokens": 18710528.0,
+ "step": 1142
+ },
+ {
+ "entropy": 0.9344089031219482,
+ "epoch": 2.309090909090909,
+ "grad_norm": 2.058670997619629,
+ "learning_rate": 4.61952861952862e-06,
+ "loss": 0.929522693157196,
+ "mean_token_accuracy": 0.7677088379859924,
+ "num_tokens": 18726912.0,
+ "step": 1143
+ },
+ {
+ "entropy": 0.847671389579773,
+ "epoch": 2.311111111111111,
+ "grad_norm": 2.1489334106445312,
+ "learning_rate": 4.606060606060606e-06,
+ "loss": 0.8554779291152954,
+ "mean_token_accuracy": 0.7794333100318909,
+ "num_tokens": 18743296.0,
+ "step": 1144
+ },
+ {
+ "entropy": 1.2183470726013184,
+ "epoch": 2.313131313131313,
+ "grad_norm": 1.9973106384277344,
+ "learning_rate": 4.592592592592593e-06,
+ "loss": 1.2017948627471924,
+ "mean_token_accuracy": 0.7124450206756592,
+ "num_tokens": 18759680.0,
+ "step": 1145
+ },
+ {
+ "entropy": 1.049198031425476,
+ "epoch": 2.315151515151515,
+ "grad_norm": 2.236171245574951,
+ "learning_rate": 4.57912457912458e-06,
+ "loss": 1.0968973636627197,
+ "mean_token_accuracy": 0.7376648783683777,
+ "num_tokens": 18776064.0,
+ "step": 1146
+ },
+ {
+ "entropy": 0.8611926436424255,
+ "epoch": 2.317171717171717,
+ "grad_norm": 2.1956593990325928,
+ "learning_rate": 4.565656565656566e-06,
+ "loss": 0.8607693910598755,
+ "mean_token_accuracy": 0.7783952355384827,
+ "num_tokens": 18792448.0,
+ "step": 1147
+ },
+ {
+ "entropy": 1.338310956954956,
+ "epoch": 2.319191919191919,
+ "grad_norm": 2.431516647338867,
+ "learning_rate": 4.552188552188553e-06,
+ "loss": 1.3319693803787231,
+ "mean_token_accuracy": 0.6781876087188721,
+ "num_tokens": 18808832.0,
+ "step": 1148
+ },
+ {
+ "entropy": 0.7855240702629089,
+ "epoch": 2.3212121212121213,
+ "grad_norm": 2.083381175994873,
+ "learning_rate": 4.538720538720539e-06,
+ "loss": 0.7579916715621948,
+ "mean_token_accuracy": 0.7961651086807251,
+ "num_tokens": 18825216.0,
+ "step": 1149
+ },
+ {
+ "entropy": 0.9377650022506714,
+ "epoch": 2.323232323232323,
+ "grad_norm": 2.0583441257476807,
+ "learning_rate": 4.525252525252526e-06,
+ "loss": 0.9283360242843628,
+ "mean_token_accuracy": 0.7661822438240051,
+ "num_tokens": 18841600.0,
+ "step": 1150
+ },
+ {
+ "entropy": 0.6888769268989563,
+ "epoch": 2.3252525252525253,
+ "grad_norm": 1.8859190940856934,
+ "learning_rate": 4.5117845117845126e-06,
+ "loss": 0.6679004430770874,
+ "mean_token_accuracy": 0.8202857971191406,
+ "num_tokens": 18857984.0,
+ "step": 1151
+ },
+ {
+ "entropy": 1.2448687553405762,
+ "epoch": 2.327272727272727,
+ "grad_norm": 2.2379355430603027,
+ "learning_rate": 4.498316498316498e-06,
+ "loss": 1.2153626680374146,
+ "mean_token_accuracy": 0.714093804359436,
+ "num_tokens": 18874368.0,
+ "step": 1152
+ },
+ {
+ "entropy": 0.854434609413147,
+ "epoch": 2.3292929292929294,
+ "grad_norm": 2.21307635307312,
+ "learning_rate": 4.4848484848484855e-06,
+ "loss": 0.8640393018722534,
+ "mean_token_accuracy": 0.7816927433013916,
+ "num_tokens": 18890752.0,
+ "step": 1153
+ },
+ {
+ "entropy": 0.897014856338501,
+ "epoch": 2.3313131313131312,
+ "grad_norm": 2.0069496631622314,
+ "learning_rate": 4.471380471380471e-06,
+ "loss": 0.9055691361427307,
+ "mean_token_accuracy": 0.7672814130783081,
+ "num_tokens": 18907136.0,
+ "step": 1154
+ },
+ {
+ "entropy": 0.893920361995697,
+ "epoch": 2.3333333333333335,
+ "grad_norm": 2.1605043411254883,
+ "learning_rate": 4.4579124579124585e-06,
+ "loss": 0.8992359638214111,
+ "mean_token_accuracy": 0.7696629166603088,
+ "num_tokens": 18923520.0,
+ "step": 1155
+ },
+ {
+ "entropy": 0.9284574389457703,
+ "epoch": 2.3353535353535353,
+ "grad_norm": 2.1974165439605713,
+ "learning_rate": 4.444444444444444e-06,
+ "loss": 0.9108461141586304,
+ "mean_token_accuracy": 0.7683194875717163,
+ "num_tokens": 18939904.0,
+ "step": 1156
+ },
+ {
+ "entropy": 1.2936046123504639,
+ "epoch": 2.3373737373737375,
+ "grad_norm": 2.2567598819732666,
+ "learning_rate": 4.4309764309764315e-06,
+ "loss": 1.2691715955734253,
+ "mean_token_accuracy": 0.697300910949707,
+ "num_tokens": 18956288.0,
+ "step": 1157
+ },
+ {
+ "entropy": 0.7441157102584839,
+ "epoch": 2.3393939393939394,
+ "grad_norm": 2.111255168914795,
+ "learning_rate": 4.417508417508418e-06,
+ "loss": 0.725585401058197,
+ "mean_token_accuracy": 0.8006228804588318,
+ "num_tokens": 18972672.0,
+ "step": 1158
+ },
+ {
+ "entropy": 0.917363166809082,
+ "epoch": 2.341414141414141,
+ "grad_norm": 2.9000542163848877,
+ "learning_rate": 4.4040404040404044e-06,
+ "loss": 0.8813672661781311,
+ "mean_token_accuracy": 0.7703956961631775,
+ "num_tokens": 18989056.0,
+ "step": 1159
+ },
+ {
+ "entropy": 0.9396717548370361,
+ "epoch": 2.3434343434343434,
+ "grad_norm": 2.1208033561706543,
+ "learning_rate": 4.390572390572391e-06,
+ "loss": 0.9205979108810425,
+ "mean_token_accuracy": 0.7719223499298096,
+ "num_tokens": 19005440.0,
+ "step": 1160
+ },
+ {
+ "entropy": 0.9639775156974792,
+ "epoch": 2.3454545454545457,
+ "grad_norm": 2.179042339324951,
+ "learning_rate": 4.377104377104377e-06,
+ "loss": 0.9402551054954529,
+ "mean_token_accuracy": 0.7613580822944641,
+ "num_tokens": 19021824.0,
+ "step": 1161
+ },
+ {
+ "entropy": 0.9605804085731506,
+ "epoch": 2.3474747474747475,
+ "grad_norm": 2.201428174972534,
+ "learning_rate": 4.363636363636364e-06,
+ "loss": 0.9531458616256714,
+ "mean_token_accuracy": 0.7554348111152649,
+ "num_tokens": 19038208.0,
+ "step": 1162
+ },
+ {
+ "entropy": 1.2175929546356201,
+ "epoch": 2.3494949494949493,
+ "grad_norm": 2.3427727222442627,
+ "learning_rate": 4.35016835016835e-06,
+ "loss": 1.2165290117263794,
+ "mean_token_accuracy": 0.7007816433906555,
+ "num_tokens": 19054592.0,
+ "step": 1163
+ },
+ {
+ "entropy": 0.8713957667350769,
+ "epoch": 2.3515151515151516,
+ "grad_norm": 2.085918664932251,
+ "learning_rate": 4.336700336700337e-06,
+ "loss": 0.886815071105957,
+ "mean_token_accuracy": 0.7802882194519043,
+ "num_tokens": 19070976.0,
+ "step": 1164
+ },
+ {
+ "entropy": 1.2172973155975342,
+ "epoch": 2.3535353535353534,
+ "grad_norm": 2.2496557235717773,
+ "learning_rate": 4.323232323232323e-06,
+ "loss": 1.2305024862289429,
+ "mean_token_accuracy": 0.6992549896240234,
+ "num_tokens": 19087360.0,
+ "step": 1165
+ },
+ {
+ "entropy": 1.008517861366272,
+ "epoch": 2.3555555555555556,
+ "grad_norm": 2.1454458236694336,
+ "learning_rate": 4.30976430976431e-06,
+ "loss": 1.0096131563186646,
+ "mean_token_accuracy": 0.7481069564819336,
+ "num_tokens": 19103744.0,
+ "step": 1166
+ },
+ {
+ "entropy": 0.8316228985786438,
+ "epoch": 2.3575757575757574,
+ "grad_norm": 2.266805410385132,
+ "learning_rate": 4.296296296296296e-06,
+ "loss": 0.8300824165344238,
+ "mean_token_accuracy": 0.7838299870491028,
+ "num_tokens": 19120128.0,
+ "step": 1167
+ },
+ {
+ "entropy": 0.8297266364097595,
+ "epoch": 2.3595959595959597,
+ "grad_norm": 2.561913251876831,
+ "learning_rate": 4.282828282828283e-06,
+ "loss": 0.8217562437057495,
+ "mean_token_accuracy": 0.7908524870872498,
+ "num_tokens": 19136512.0,
+ "step": 1168
+ },
+ {
+ "entropy": 0.8838104009628296,
+ "epoch": 2.3616161616161615,
+ "grad_norm": 2.295294761657715,
+ "learning_rate": 4.26936026936027e-06,
+ "loss": 0.863752007484436,
+ "mean_token_accuracy": 0.7753419876098633,
+ "num_tokens": 19152896.0,
+ "step": 1169
+ },
+ {
+ "entropy": 0.9900280237197876,
+ "epoch": 2.3636363636363638,
+ "grad_norm": 2.200223684310913,
+ "learning_rate": 4.255892255892256e-06,
+ "loss": 0.9897500872612,
+ "mean_token_accuracy": 0.7403517365455627,
+ "num_tokens": 19169280.0,
+ "step": 1170
+ },
+ {
+ "entropy": 1.2343716621398926,
+ "epoch": 2.3656565656565656,
+ "grad_norm": 2.376347541809082,
+ "learning_rate": 4.242424242424243e-06,
+ "loss": 1.231675148010254,
+ "mean_token_accuracy": 0.7057889699935913,
+ "num_tokens": 19185664.0,
+ "step": 1171
+ },
+ {
+ "entropy": 1.1249511241912842,
+ "epoch": 2.367676767676768,
+ "grad_norm": 2.2998337745666504,
+ "learning_rate": 4.228956228956229e-06,
+ "loss": 1.149594783782959,
+ "mean_token_accuracy": 0.7239863276481628,
+ "num_tokens": 19202048.0,
+ "step": 1172
+ },
+ {
+ "entropy": 1.0526270866394043,
+ "epoch": 2.3696969696969696,
+ "grad_norm": 2.505650043487549,
+ "learning_rate": 4.215488215488216e-06,
+ "loss": 1.0455896854400635,
+ "mean_token_accuracy": 0.7277112603187561,
+ "num_tokens": 19218432.0,
+ "step": 1173
+ },
+ {
+ "entropy": 1.0050756931304932,
+ "epoch": 2.371717171717172,
+ "grad_norm": 2.0753841400146484,
+ "learning_rate": 4.2020202020202026e-06,
+ "loss": 1.0089832544326782,
+ "mean_token_accuracy": 0.7474963068962097,
+ "num_tokens": 19234816.0,
+ "step": 1174
+ },
+ {
+ "entropy": 0.9173234105110168,
+ "epoch": 2.3737373737373737,
+ "grad_norm": 2.2379953861236572,
+ "learning_rate": 4.188552188552189e-06,
+ "loss": 0.9265357255935669,
+ "mean_token_accuracy": 0.7507938742637634,
+ "num_tokens": 19251200.0,
+ "step": 1175
+ },
+ {
+ "entropy": 0.8770121932029724,
+ "epoch": 2.375757575757576,
+ "grad_norm": 2.1281018257141113,
+ "learning_rate": 4.1750841750841755e-06,
+ "loss": 0.8701684474945068,
+ "mean_token_accuracy": 0.7741817235946655,
+ "num_tokens": 19267584.0,
+ "step": 1176
+ },
+ {
+ "entropy": 1.0771297216415405,
+ "epoch": 2.3777777777777778,
+ "grad_norm": 2.2006096839904785,
+ "learning_rate": 4.161616161616162e-06,
+ "loss": 1.0650314092636108,
+ "mean_token_accuracy": 0.7375427484512329,
+ "num_tokens": 19283968.0,
+ "step": 1177
+ },
+ {
+ "entropy": 0.5856462717056274,
+ "epoch": 2.3797979797979796,
+ "grad_norm": 2.043875217437744,
+ "learning_rate": 4.1481481481481485e-06,
+ "loss": 0.5683187246322632,
+ "mean_token_accuracy": 0.8348192572593689,
+ "num_tokens": 19300352.0,
+ "step": 1178
+ },
+ {
+ "entropy": 1.08524751663208,
+ "epoch": 2.381818181818182,
+ "grad_norm": 2.29097318649292,
+ "learning_rate": 4.134680134680135e-06,
+ "loss": 1.0622766017913818,
+ "mean_token_accuracy": 0.7322300672531128,
+ "num_tokens": 19316736.0,
+ "step": 1179
+ },
+ {
+ "entropy": 0.79567551612854,
+ "epoch": 2.3838383838383836,
+ "grad_norm": 2.1101555824279785,
+ "learning_rate": 4.1212121212121215e-06,
+ "loss": 0.7737668752670288,
+ "mean_token_accuracy": 0.7987909317016602,
+ "num_tokens": 19333120.0,
+ "step": 1180
+ },
+ {
+ "entropy": 0.9077378511428833,
+ "epoch": 2.385858585858586,
+ "grad_norm": 2.337980270385742,
+ "learning_rate": 4.107744107744108e-06,
+ "loss": 0.916233479976654,
+ "mean_token_accuracy": 0.7699682712554932,
+ "num_tokens": 19349504.0,
+ "step": 1181
+ },
+ {
+ "entropy": 0.7796720862388611,
+ "epoch": 2.3878787878787877,
+ "grad_norm": 2.0968403816223145,
+ "learning_rate": 4.0942760942760944e-06,
+ "loss": 0.7493729591369629,
+ "mean_token_accuracy": 0.8128969073295593,
+ "num_tokens": 19365888.0,
+ "step": 1182
+ },
+ {
+ "entropy": 0.9127286076545715,
+ "epoch": 2.38989898989899,
+ "grad_norm": 2.166583299636841,
+ "learning_rate": 4.080808080808081e-06,
+ "loss": 0.8826674222946167,
+ "mean_token_accuracy": 0.7838910818099976,
+ "num_tokens": 19382272.0,
+ "step": 1183
+ },
+ {
+ "entropy": 0.794689953327179,
+ "epoch": 2.391919191919192,
+ "grad_norm": 2.130293607711792,
+ "learning_rate": 4.067340067340067e-06,
+ "loss": 0.7883949875831604,
+ "mean_token_accuracy": 0.7930508255958557,
+ "num_tokens": 19398656.0,
+ "step": 1184
+ },
+ {
+ "entropy": 1.2090318202972412,
+ "epoch": 2.393939393939394,
+ "grad_norm": 2.3772876262664795,
+ "learning_rate": 4.053872053872055e-06,
+ "loss": 1.2147963047027588,
+ "mean_token_accuracy": 0.7074987888336182,
+ "num_tokens": 19415040.0,
+ "step": 1185
+ },
+ {
+ "entropy": 0.7899874448776245,
+ "epoch": 2.395959595959596,
+ "grad_norm": 2.068220853805542,
+ "learning_rate": 4.04040404040404e-06,
+ "loss": 0.7576479315757751,
+ "mean_token_accuracy": 0.7963483333587646,
+ "num_tokens": 19431424.0,
+ "step": 1186
+ },
+ {
+ "entropy": 0.5590318441390991,
+ "epoch": 2.397979797979798,
+ "grad_norm": 1.9655200242996216,
+ "learning_rate": 4.026936026936028e-06,
+ "loss": 0.5567639470100403,
+ "mean_token_accuracy": 0.8367733359336853,
+ "num_tokens": 19447808.0,
+ "step": 1187
+ },
+ {
+ "entropy": 0.9547830820083618,
+ "epoch": 2.4,
+ "grad_norm": 2.336129665374756,
+ "learning_rate": 4.013468013468013e-06,
+ "loss": 0.9690505266189575,
+ "mean_token_accuracy": 0.7481069564819336,
+ "num_tokens": 19464192.0,
+ "step": 1188
+ },
+ {
+ "entropy": 0.6599025130271912,
+ "epoch": 2.402020202020202,
+ "grad_norm": 1.9412858486175537,
+ "learning_rate": 4.000000000000001e-06,
+ "loss": 0.6372359991073608,
+ "mean_token_accuracy": 0.830422580242157,
+ "num_tokens": 19480576.0,
+ "step": 1189
+ },
+ {
+ "entropy": 0.9671234488487244,
+ "epoch": 2.404040404040404,
+ "grad_norm": 2.207185983657837,
+ "learning_rate": 3.986531986531987e-06,
+ "loss": 0.9822558164596558,
+ "mean_token_accuracy": 0.7482290863990784,
+ "num_tokens": 19496960.0,
+ "step": 1190
+ },
+ {
+ "entropy": 1.2159186601638794,
+ "epoch": 2.4060606060606062,
+ "grad_norm": 2.3835642337799072,
+ "learning_rate": 3.973063973063974e-06,
+ "loss": 1.2127540111541748,
+ "mean_token_accuracy": 0.7027967572212219,
+ "num_tokens": 19513344.0,
+ "step": 1191
+ },
+ {
+ "entropy": 1.0063631534576416,
+ "epoch": 2.408080808080808,
+ "grad_norm": 2.313455581665039,
+ "learning_rate": 3.95959595959596e-06,
+ "loss": 0.9854291081428528,
+ "mean_token_accuracy": 0.7553126811981201,
+ "num_tokens": 19529728.0,
+ "step": 1192
+ },
+ {
+ "entropy": 1.0717129707336426,
+ "epoch": 2.41010101010101,
+ "grad_norm": 2.2523372173309326,
+ "learning_rate": 3.946127946127947e-06,
+ "loss": 1.0883088111877441,
+ "mean_token_accuracy": 0.723375678062439,
+ "num_tokens": 19546112.0,
+ "step": 1193
+ },
+ {
+ "entropy": 1.3942774534225464,
+ "epoch": 2.412121212121212,
+ "grad_norm": 2.4028871059417725,
+ "learning_rate": 3.932659932659933e-06,
+ "loss": 1.3809077739715576,
+ "mean_token_accuracy": 0.6759281754493713,
+ "num_tokens": 19562496.0,
+ "step": 1194
+ },
+ {
+ "entropy": 0.8493068218231201,
+ "epoch": 2.4141414141414144,
+ "grad_norm": 2.1721816062927246,
+ "learning_rate": 3.9191919191919196e-06,
+ "loss": 0.864505410194397,
+ "mean_token_accuracy": 0.7765021920204163,
+ "num_tokens": 19578880.0,
+ "step": 1195
+ },
+ {
+ "entropy": 1.2580974102020264,
+ "epoch": 2.416161616161616,
+ "grad_norm": 2.396101236343384,
+ "learning_rate": 3.905723905723906e-06,
+ "loss": 1.2584552764892578,
+ "mean_token_accuracy": 0.6950415372848511,
+ "num_tokens": 19595264.0,
+ "step": 1196
+ },
+ {
+ "entropy": 0.8060904741287231,
+ "epoch": 2.418181818181818,
+ "grad_norm": 2.046794891357422,
+ "learning_rate": 3.8922558922558925e-06,
+ "loss": 0.7814371585845947,
+ "mean_token_accuracy": 0.790791392326355,
+ "num_tokens": 19611648.0,
+ "step": 1197
+ },
+ {
+ "entropy": 1.2045812606811523,
+ "epoch": 2.4202020202020202,
+ "grad_norm": 2.247964382171631,
+ "learning_rate": 3.878787878787879e-06,
+ "loss": 1.2171180248260498,
+ "mean_token_accuracy": 0.7079873085021973,
+ "num_tokens": 19628032.0,
+ "step": 1198
+ },
+ {
+ "entropy": 1.1102302074432373,
+ "epoch": 2.422222222222222,
+ "grad_norm": 2.0978305339813232,
+ "learning_rate": 3.8653198653198655e-06,
+ "loss": 1.1046020984649658,
+ "mean_token_accuracy": 0.7316194176673889,
+ "num_tokens": 19644416.0,
+ "step": 1199
+ },
+ {
+ "entropy": 0.840056300163269,
+ "epoch": 2.4242424242424243,
+ "grad_norm": 2.221834659576416,
+ "learning_rate": 3.851851851851852e-06,
+ "loss": 0.8477578163146973,
+ "mean_token_accuracy": 0.7802882194519043,
+ "num_tokens": 19660800.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.4242424242424243,
+ "eval_entropy": 1.1394333051097008,
+ "eval_loss": 1.6056861877441406,
+ "eval_mean_token_accuracy": 0.6430166306034211,
+ "eval_num_tokens": 19660800.0,
+ "eval_runtime": 43.7916,
+ "eval_samples_per_second": 22.607,
+ "eval_steps_per_second": 2.832,
+ "step": 1200
+ },
+ {
+ "entropy": 1.2870543003082275,
+ "epoch": 2.426262626262626,
+ "grad_norm": 2.17335844039917,
+ "learning_rate": 3.8383838383838385e-06,
+ "loss": 1.3065149784088135,
+ "mean_token_accuracy": 0.6964460015296936,
+ "num_tokens": 19677184.0,
+ "step": 1201
+ },
+ {
+ "entropy": 0.9420839548110962,
+ "epoch": 2.4282828282828284,
+ "grad_norm": 2.2537472248077393,
+ "learning_rate": 3.824915824915825e-06,
+ "loss": 0.9395225644111633,
+ "mean_token_accuracy": 0.7506717443466187,
+ "num_tokens": 19693568.0,
+ "step": 1202
+ },
+ {
+ "entropy": 1.0070335865020752,
+ "epoch": 2.43030303030303,
+ "grad_norm": 2.161827802658081,
+ "learning_rate": 3.8114478114478114e-06,
+ "loss": 1.0133901834487915,
+ "mean_token_accuracy": 0.7372984886169434,
+ "num_tokens": 19709952.0,
+ "step": 1203
+ },
+ {
+ "entropy": 0.8056594729423523,
+ "epoch": 2.4323232323232324,
+ "grad_norm": 1.79896080493927,
+ "learning_rate": 3.7979797979797984e-06,
+ "loss": 0.7943062782287598,
+ "mean_token_accuracy": 0.7943331599235535,
+ "num_tokens": 19726336.0,
+ "step": 1204
+ },
+ {
+ "entropy": 0.9712687134742737,
+ "epoch": 2.4343434343434343,
+ "grad_norm": 1.9938912391662598,
+ "learning_rate": 3.7845117845117844e-06,
+ "loss": 0.9475370645523071,
+ "mean_token_accuracy": 0.7587323188781738,
+ "num_tokens": 19742720.0,
+ "step": 1205
+ },
+ {
+ "entropy": 0.8473865389823914,
+ "epoch": 2.4363636363636365,
+ "grad_norm": 2.0978620052337646,
+ "learning_rate": 3.7710437710437713e-06,
+ "loss": 0.8367564678192139,
+ "mean_token_accuracy": 0.7745481133460999,
+ "num_tokens": 19759104.0,
+ "step": 1206
+ },
+ {
+ "entropy": 0.723155677318573,
+ "epoch": 2.4383838383838383,
+ "grad_norm": 1.8043550252914429,
+ "learning_rate": 3.757575757575758e-06,
+ "loss": 0.7276782989501953,
+ "mean_token_accuracy": 0.8101490139961243,
+ "num_tokens": 19775488.0,
+ "step": 1207
+ },
+ {
+ "entropy": 0.7209433317184448,
+ "epoch": 2.4404040404040406,
+ "grad_norm": 2.128316640853882,
+ "learning_rate": 3.7441077441077443e-06,
+ "loss": 0.70832359790802,
+ "mean_token_accuracy": 0.8017220497131348,
+ "num_tokens": 19791872.0,
+ "step": 1208
+ },
+ {
+ "entropy": 0.7295323610305786,
+ "epoch": 2.4424242424242424,
+ "grad_norm": 2.045367956161499,
+ "learning_rate": 3.7306397306397308e-06,
+ "loss": 0.7077770233154297,
+ "mean_token_accuracy": 0.8126526474952698,
+ "num_tokens": 19808256.0,
+ "step": 1209
+ },
+ {
+ "entropy": 1.0979973077774048,
+ "epoch": 2.4444444444444446,
+ "grad_norm": 2.182023048400879,
+ "learning_rate": 3.7171717171717177e-06,
+ "loss": 1.0852105617523193,
+ "mean_token_accuracy": 0.7303370833396912,
+ "num_tokens": 19824640.0,
+ "step": 1210
+ },
+ {
+ "entropy": 0.9850945472717285,
+ "epoch": 2.4464646464646465,
+ "grad_norm": 2.065443277359009,
+ "learning_rate": 3.7037037037037037e-06,
+ "loss": 0.9809832572937012,
+ "mean_token_accuracy": 0.7525647282600403,
+ "num_tokens": 19841024.0,
+ "step": 1211
+ },
+ {
+ "entropy": 0.8987663388252258,
+ "epoch": 2.4484848484848483,
+ "grad_norm": 2.2341790199279785,
+ "learning_rate": 3.6902356902356906e-06,
+ "loss": 0.8896650671958923,
+ "mean_token_accuracy": 0.7669150233268738,
+ "num_tokens": 19857408.0,
+ "step": 1212
+ },
+ {
+ "entropy": 0.7914950847625732,
+ "epoch": 2.4505050505050505,
+ "grad_norm": 1.9684029817581177,
+ "learning_rate": 3.6767676767676767e-06,
+ "loss": 0.7796467542648315,
+ "mean_token_accuracy": 0.798363447189331,
+ "num_tokens": 19873792.0,
+ "step": 1213
+ },
+ {
+ "entropy": 1.0010449886322021,
+ "epoch": 2.4525252525252528,
+ "grad_norm": 2.1975135803222656,
+ "learning_rate": 3.6632996632996636e-06,
+ "loss": 0.9799243211746216,
+ "mean_token_accuracy": 0.7423668503761292,
+ "num_tokens": 19890176.0,
+ "step": 1214
+ },
+ {
+ "entropy": 1.0015712976455688,
+ "epoch": 2.4545454545454546,
+ "grad_norm": 2.1111021041870117,
+ "learning_rate": 3.64983164983165e-06,
+ "loss": 1.0013333559036255,
+ "mean_token_accuracy": 0.757083535194397,
+ "num_tokens": 19906560.0,
+ "step": 1215
+ },
+ {
+ "entropy": 0.6957159638404846,
+ "epoch": 2.4565656565656564,
+ "grad_norm": 2.203601598739624,
+ "learning_rate": 3.6363636363636366e-06,
+ "loss": 0.6890975832939148,
+ "mean_token_accuracy": 0.8097215294837952,
+ "num_tokens": 19922944.0,
+ "step": 1216
+ },
+ {
+ "entropy": 1.0398633480072021,
+ "epoch": 2.4585858585858587,
+ "grad_norm": 2.1206884384155273,
+ "learning_rate": 3.622895622895623e-06,
+ "loss": 1.020222544670105,
+ "mean_token_accuracy": 0.7437713742256165,
+ "num_tokens": 19939328.0,
+ "step": 1217
+ },
+ {
+ "entropy": 0.948898196220398,
+ "epoch": 2.4606060606060605,
+ "grad_norm": 2.16664981842041,
+ "learning_rate": 3.60942760942761e-06,
+ "loss": 0.9560619592666626,
+ "mean_token_accuracy": 0.7578774094581604,
+ "num_tokens": 19955712.0,
+ "step": 1218
+ },
+ {
+ "entropy": 0.7177059650421143,
+ "epoch": 2.4626262626262627,
+ "grad_norm": 2.0934417247772217,
+ "learning_rate": 3.595959595959596e-06,
+ "loss": 0.721766471862793,
+ "mean_token_accuracy": 0.7979970574378967,
+ "num_tokens": 19972096.0,
+ "step": 1219
+ },
+ {
+ "entropy": 0.8426720499992371,
+ "epoch": 2.4646464646464645,
+ "grad_norm": 2.2284491062164307,
+ "learning_rate": 3.582491582491583e-06,
+ "loss": 0.8461461067199707,
+ "mean_token_accuracy": 0.7724108695983887,
+ "num_tokens": 19988480.0,
+ "step": 1220
+ },
+ {
+ "entropy": 1.0814709663391113,
+ "epoch": 2.466666666666667,
+ "grad_norm": 2.1849255561828613,
+ "learning_rate": 3.569023569023569e-06,
+ "loss": 1.0583312511444092,
+ "mean_token_accuracy": 0.7375427484512329,
+ "num_tokens": 20004864.0,
+ "step": 1221
+ },
+ {
+ "entropy": 0.8736158609390259,
+ "epoch": 2.4686868686868686,
+ "grad_norm": 2.0398738384246826,
+ "learning_rate": 3.555555555555556e-06,
+ "loss": 0.8676871657371521,
+ "mean_token_accuracy": 0.7771128416061401,
+ "num_tokens": 20021248.0,
+ "step": 1222
+ },
+ {
+ "entropy": 0.7232694029808044,
+ "epoch": 2.470707070707071,
+ "grad_norm": 2.105766773223877,
+ "learning_rate": 3.5420875420875424e-06,
+ "loss": 0.7312887907028198,
+ "mean_token_accuracy": 0.8002564907073975,
+ "num_tokens": 20037632.0,
+ "step": 1223
+ },
+ {
+ "entropy": 1.284920334815979,
+ "epoch": 2.4727272727272727,
+ "grad_norm": 2.1596007347106934,
+ "learning_rate": 3.528619528619529e-06,
+ "loss": 1.2728421688079834,
+ "mean_token_accuracy": 0.6981558203697205,
+ "num_tokens": 20054016.0,
+ "step": 1224
+ },
+ {
+ "entropy": 0.7340924739837646,
+ "epoch": 2.474747474747475,
+ "grad_norm": 2.1284775733947754,
+ "learning_rate": 3.5151515151515154e-06,
+ "loss": 0.7263147234916687,
+ "mean_token_accuracy": 0.8036150336265564,
+ "num_tokens": 20070400.0,
+ "step": 1225
+ },
+ {
+ "entropy": 0.801537275314331,
+ "epoch": 2.4767676767676767,
+ "grad_norm": 2.0989158153533936,
+ "learning_rate": 3.5016835016835023e-06,
+ "loss": 0.7869283556938171,
+ "mean_token_accuracy": 0.7972642779350281,
+ "num_tokens": 20086784.0,
+ "step": 1226
+ },
+ {
+ "entropy": 1.1842774152755737,
+ "epoch": 2.4787878787878785,
+ "grad_norm": 2.1426236629486084,
+ "learning_rate": 3.4882154882154883e-06,
+ "loss": 1.1804194450378418,
+ "mean_token_accuracy": 0.7169027924537659,
+ "num_tokens": 20103168.0,
+ "step": 1227
+ },
+ {
+ "entropy": 1.2625954151153564,
+ "epoch": 2.480808080808081,
+ "grad_norm": 2.407891035079956,
+ "learning_rate": 3.4747474747474752e-06,
+ "loss": 1.2765004634857178,
+ "mean_token_accuracy": 0.6922935843467712,
+ "num_tokens": 20119552.0,
+ "step": 1228
+ },
+ {
+ "entropy": 1.5162423849105835,
+ "epoch": 2.482828282828283,
+ "grad_norm": 2.1844899654388428,
+ "learning_rate": 3.4612794612794613e-06,
+ "loss": 1.5104104280471802,
+ "mean_token_accuracy": 0.6639594435691833,
+ "num_tokens": 20135936.0,
+ "step": 1229
+ },
+ {
+ "entropy": 0.9084963798522949,
+ "epoch": 2.484848484848485,
+ "grad_norm": 1.9122270345687866,
+ "learning_rate": 3.447811447811448e-06,
+ "loss": 0.8792629241943359,
+ "mean_token_accuracy": 0.7750977277755737,
+ "num_tokens": 20152320.0,
+ "step": 1230
+ },
+ {
+ "entropy": 1.3305665254592896,
+ "epoch": 2.4868686868686867,
+ "grad_norm": 2.250115394592285,
+ "learning_rate": 3.4343434343434347e-06,
+ "loss": 1.3185248374938965,
+ "mean_token_accuracy": 0.6855154037475586,
+ "num_tokens": 20168704.0,
+ "step": 1231
+ },
+ {
+ "entropy": 0.8350923657417297,
+ "epoch": 2.488888888888889,
+ "grad_norm": 2.0859107971191406,
+ "learning_rate": 3.420875420875421e-06,
+ "loss": 0.8013065457344055,
+ "mean_token_accuracy": 0.7911577820777893,
+ "num_tokens": 20185088.0,
+ "step": 1232
+ },
+ {
+ "entropy": 0.9226766228675842,
+ "epoch": 2.4909090909090907,
+ "grad_norm": 2.030141830444336,
+ "learning_rate": 3.4074074074074077e-06,
+ "loss": 0.9243340492248535,
+ "mean_token_accuracy": 0.7738153338432312,
+ "num_tokens": 20201472.0,
+ "step": 1233
+ },
+ {
+ "entropy": 0.8571307063102722,
+ "epoch": 2.492929292929293,
+ "grad_norm": 2.40063738822937,
+ "learning_rate": 3.3939393939393946e-06,
+ "loss": 0.870561420917511,
+ "mean_token_accuracy": 0.7685027122497559,
+ "num_tokens": 20217856.0,
+ "step": 1234
+ },
+ {
+ "entropy": 0.9109510779380798,
+ "epoch": 2.494949494949495,
+ "grad_norm": 2.1137447357177734,
+ "learning_rate": 3.3804713804713806e-06,
+ "loss": 0.9193125367164612,
+ "mean_token_accuracy": 0.7685637474060059,
+ "num_tokens": 20234240.0,
+ "step": 1235
+ },
+ {
+ "entropy": 0.7725069522857666,
+ "epoch": 2.496969696969697,
+ "grad_norm": 2.1603705883026123,
+ "learning_rate": 3.3670033670033675e-06,
+ "loss": 0.7795518040657043,
+ "mean_token_accuracy": 0.7900586128234863,
+ "num_tokens": 20250624.0,
+ "step": 1236
+ },
+ {
+ "entropy": 1.1810798645019531,
+ "epoch": 2.498989898989899,
+ "grad_norm": 2.321040630340576,
+ "learning_rate": 3.3535353535353536e-06,
+ "loss": 1.197322130203247,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 20267008.0,
+ "step": 1237
+ },
+ {
+ "entropy": 0.9284457564353943,
+ "epoch": 2.501010101010101,
+ "grad_norm": 2.214848518371582,
+ "learning_rate": 3.3400673400673405e-06,
+ "loss": 0.915704071521759,
+ "mean_token_accuracy": 0.7593429684638977,
+ "num_tokens": 20283392.0,
+ "step": 1238
+ },
+ {
+ "entropy": 0.9151167273521423,
+ "epoch": 2.503030303030303,
+ "grad_norm": 2.2259461879730225,
+ "learning_rate": 3.326599326599327e-06,
+ "loss": 0.9136589169502258,
+ "mean_token_accuracy": 0.7659379839897156,
+ "num_tokens": 20299776.0,
+ "step": 1239
+ },
+ {
+ "entropy": 0.937813401222229,
+ "epoch": 2.505050505050505,
+ "grad_norm": 2.3099539279937744,
+ "learning_rate": 3.3131313131313135e-06,
+ "loss": 0.9328974485397339,
+ "mean_token_accuracy": 0.7614191770553589,
+ "num_tokens": 20316160.0,
+ "step": 1240
+ },
+ {
+ "entropy": 1.1104196310043335,
+ "epoch": 2.507070707070707,
+ "grad_norm": 2.3913068771362305,
+ "learning_rate": 3.2996632996633e-06,
+ "loss": 1.0788944959640503,
+ "mean_token_accuracy": 0.7301538586616516,
+ "num_tokens": 20332544.0,
+ "step": 1241
+ },
+ {
+ "entropy": 0.8833880424499512,
+ "epoch": 2.509090909090909,
+ "grad_norm": 2.261202573776245,
+ "learning_rate": 3.286195286195287e-06,
+ "loss": 0.8650795817375183,
+ "mean_token_accuracy": 0.7713727355003357,
+ "num_tokens": 20348928.0,
+ "step": 1242
+ },
+ {
+ "entropy": 1.2574468851089478,
+ "epoch": 2.511111111111111,
+ "grad_norm": 2.414250373840332,
+ "learning_rate": 3.272727272727273e-06,
+ "loss": 1.266160011291504,
+ "mean_token_accuracy": 0.699499249458313,
+ "num_tokens": 20365312.0,
+ "step": 1243
+ },
+ {
+ "entropy": 1.357008695602417,
+ "epoch": 2.5131313131313133,
+ "grad_norm": 2.264491558074951,
+ "learning_rate": 3.25925925925926e-06,
+ "loss": 1.351933240890503,
+ "mean_token_accuracy": 0.689728856086731,
+ "num_tokens": 20381696.0,
+ "step": 1244
+ },
+ {
+ "entropy": 1.2887134552001953,
+ "epoch": 2.515151515151515,
+ "grad_norm": 2.308107614517212,
+ "learning_rate": 3.245791245791246e-06,
+ "loss": 1.289101481437683,
+ "mean_token_accuracy": 0.6892403364181519,
+ "num_tokens": 20398080.0,
+ "step": 1245
+ },
+ {
+ "entropy": 1.3027681112289429,
+ "epoch": 2.517171717171717,
+ "grad_norm": 2.084804058074951,
+ "learning_rate": 3.232323232323233e-06,
+ "loss": 1.296428918838501,
+ "mean_token_accuracy": 0.6989496946334839,
+ "num_tokens": 20414464.0,
+ "step": 1246
+ },
+ {
+ "entropy": 0.9854085445404053,
+ "epoch": 2.519191919191919,
+ "grad_norm": 2.2956128120422363,
+ "learning_rate": 3.2188552188552193e-06,
+ "loss": 0.9593667387962341,
+ "mean_token_accuracy": 0.7523815631866455,
+ "num_tokens": 20430848.0,
+ "step": 1247
+ },
+ {
+ "entropy": 1.1462289094924927,
+ "epoch": 2.5212121212121215,
+ "grad_norm": 2.319286346435547,
+ "learning_rate": 3.2053872053872053e-06,
+ "loss": 1.10858154296875,
+ "mean_token_accuracy": 0.7219711542129517,
+ "num_tokens": 20447232.0,
+ "step": 1248
+ },
+ {
+ "entropy": 1.0656987428665161,
+ "epoch": 2.5232323232323233,
+ "grad_norm": 2.073442220687866,
+ "learning_rate": 3.1919191919191923e-06,
+ "loss": 1.0597574710845947,
+ "mean_token_accuracy": 0.7349780201911926,
+ "num_tokens": 20463616.0,
+ "step": 1249
+ },
+ {
+ "entropy": 0.7793754935264587,
+ "epoch": 2.525252525252525,
+ "grad_norm": 2.2514913082122803,
+ "learning_rate": 3.1784511784511783e-06,
+ "loss": 0.7521334886550903,
+ "mean_token_accuracy": 0.7914631366729736,
+ "num_tokens": 20480000.0,
+ "step": 1250
+ },
+ {
+ "entropy": 1.0033597946166992,
+ "epoch": 2.5272727272727273,
+ "grad_norm": 2.299437999725342,
+ "learning_rate": 3.1649831649831652e-06,
+ "loss": 0.9853575229644775,
+ "mean_token_accuracy": 0.7447484135627747,
+ "num_tokens": 20496384.0,
+ "step": 1251
+ },
+ {
+ "entropy": 0.9790856242179871,
+ "epoch": 2.529292929292929,
+ "grad_norm": 2.2850499153137207,
+ "learning_rate": 3.1515151515151517e-06,
+ "loss": 0.9773675799369812,
+ "mean_token_accuracy": 0.7410845160484314,
+ "num_tokens": 20512768.0,
+ "step": 1252
+ },
+ {
+ "entropy": 1.0001251697540283,
+ "epoch": 2.5313131313131314,
+ "grad_norm": 2.162883758544922,
+ "learning_rate": 3.138047138047138e-06,
+ "loss": 0.9708908796310425,
+ "mean_token_accuracy": 0.7595872282981873,
+ "num_tokens": 20529152.0,
+ "step": 1253
+ },
+ {
+ "entropy": 0.8198298215866089,
+ "epoch": 2.533333333333333,
+ "grad_norm": 2.288684129714966,
+ "learning_rate": 3.1245791245791247e-06,
+ "loss": 0.8112213015556335,
+ "mean_token_accuracy": 0.7818759083747864,
+ "num_tokens": 20545536.0,
+ "step": 1254
+ },
+ {
+ "entropy": 0.9083048701286316,
+ "epoch": 2.5353535353535355,
+ "grad_norm": 2.2135798931121826,
+ "learning_rate": 3.1111111111111116e-06,
+ "loss": 0.908804714679718,
+ "mean_token_accuracy": 0.7622740864753723,
+ "num_tokens": 20561920.0,
+ "step": 1255
+ },
+ {
+ "entropy": 0.795724093914032,
+ "epoch": 2.5373737373737373,
+ "grad_norm": 2.1689705848693848,
+ "learning_rate": 3.0976430976430976e-06,
+ "loss": 0.7923108339309692,
+ "mean_token_accuracy": 0.7879824042320251,
+ "num_tokens": 20578304.0,
+ "step": 1256
+ },
+ {
+ "entropy": 1.4591748714447021,
+ "epoch": 2.5393939393939395,
+ "grad_norm": 2.413419008255005,
+ "learning_rate": 3.0841750841750846e-06,
+ "loss": 1.4487470388412476,
+ "mean_token_accuracy": 0.6948583126068115,
+ "num_tokens": 20594688.0,
+ "step": 1257
+ },
+ {
+ "entropy": 1.0469496250152588,
+ "epoch": 2.5414141414141413,
+ "grad_norm": 2.2782540321350098,
+ "learning_rate": 3.0707070707070706e-06,
+ "loss": 1.0700496435165405,
+ "mean_token_accuracy": 0.7410234212875366,
+ "num_tokens": 20611072.0,
+ "step": 1258
+ },
+ {
+ "entropy": 1.1338191032409668,
+ "epoch": 2.5434343434343436,
+ "grad_norm": 2.370194911956787,
+ "learning_rate": 3.0572390572390575e-06,
+ "loss": 1.1157164573669434,
+ "mean_token_accuracy": 0.729421079158783,
+ "num_tokens": 20627456.0,
+ "step": 1259
+ },
+ {
+ "entropy": 1.2801309823989868,
+ "epoch": 2.5454545454545454,
+ "grad_norm": 2.21651291847229,
+ "learning_rate": 3.043771043771044e-06,
+ "loss": 1.2861847877502441,
+ "mean_token_accuracy": 0.6850268840789795,
+ "num_tokens": 20643840.0,
+ "step": 1260
+ },
+ {
+ "entropy": 1.2465205192565918,
+ "epoch": 2.5474747474747472,
+ "grad_norm": 2.319526433944702,
+ "learning_rate": 3.0303030303030305e-06,
+ "loss": 1.2388584613800049,
+ "mean_token_accuracy": 0.7073766589164734,
+ "num_tokens": 20660224.0,
+ "step": 1261
+ },
+ {
+ "entropy": 1.041487216949463,
+ "epoch": 2.5494949494949495,
+ "grad_norm": 2.3334708213806152,
+ "learning_rate": 3.016835016835017e-06,
+ "loss": 1.0760767459869385,
+ "mean_token_accuracy": 0.7376037836074829,
+ "num_tokens": 20676608.0,
+ "step": 1262
+ },
+ {
+ "entropy": 0.8173713684082031,
+ "epoch": 2.5515151515151517,
+ "grad_norm": 2.1104650497436523,
+ "learning_rate": 3.003367003367004e-06,
+ "loss": 0.8200893998146057,
+ "mean_token_accuracy": 0.7826697826385498,
+ "num_tokens": 20692992.0,
+ "step": 1263
+ },
+ {
+ "entropy": 1.083128809928894,
+ "epoch": 2.5535353535353535,
+ "grad_norm": 2.1319468021392822,
+ "learning_rate": 2.98989898989899e-06,
+ "loss": 1.077414631843567,
+ "mean_token_accuracy": 0.7382755279541016,
+ "num_tokens": 20709376.0,
+ "step": 1264
+ },
+ {
+ "entropy": 0.952279269695282,
+ "epoch": 2.5555555555555554,
+ "grad_norm": 2.261955499649048,
+ "learning_rate": 2.976430976430977e-06,
+ "loss": 0.9421428442001343,
+ "mean_token_accuracy": 0.7682584524154663,
+ "num_tokens": 20725760.0,
+ "step": 1265
+ },
+ {
+ "entropy": 1.4377425909042358,
+ "epoch": 2.5575757575757576,
+ "grad_norm": 2.4162697792053223,
+ "learning_rate": 2.962962962962963e-06,
+ "loss": 1.4387903213500977,
+ "mean_token_accuracy": 0.66841721534729,
+ "num_tokens": 20742144.0,
+ "step": 1266
+ },
+ {
+ "entropy": 1.3983595371246338,
+ "epoch": 2.55959595959596,
+ "grad_norm": 2.3733458518981934,
+ "learning_rate": 2.94949494949495e-06,
+ "loss": 1.407117486000061,
+ "mean_token_accuracy": 0.6690278649330139,
+ "num_tokens": 20758528.0,
+ "step": 1267
+ },
+ {
+ "entropy": 1.1543824672698975,
+ "epoch": 2.5616161616161617,
+ "grad_norm": 2.049203872680664,
+ "learning_rate": 2.9360269360269363e-06,
+ "loss": 1.1425888538360596,
+ "mean_token_accuracy": 0.716292142868042,
+ "num_tokens": 20774912.0,
+ "step": 1268
+ },
+ {
+ "entropy": 1.1245750188827515,
+ "epoch": 2.5636363636363635,
+ "grad_norm": 2.3909695148468018,
+ "learning_rate": 2.9225589225589228e-06,
+ "loss": 1.1087216138839722,
+ "mean_token_accuracy": 0.7255129218101501,
+ "num_tokens": 20791296.0,
+ "step": 1269
+ },
+ {
+ "entropy": 1.0142271518707275,
+ "epoch": 2.5656565656565657,
+ "grad_norm": 2.315854072570801,
+ "learning_rate": 2.9090909090909093e-06,
+ "loss": 1.0216941833496094,
+ "mean_token_accuracy": 0.7418172955513,
+ "num_tokens": 20807680.0,
+ "step": 1270
+ },
+ {
+ "entropy": 0.9911118149757385,
+ "epoch": 2.5676767676767676,
+ "grad_norm": 2.2109222412109375,
+ "learning_rate": 2.895622895622896e-06,
+ "loss": 0.96977698802948,
+ "mean_token_accuracy": 0.7437102794647217,
+ "num_tokens": 20824064.0,
+ "step": 1271
+ },
+ {
+ "entropy": 0.6949873566627502,
+ "epoch": 2.56969696969697,
+ "grad_norm": 2.1211202144622803,
+ "learning_rate": 2.8821548821548822e-06,
+ "loss": 0.6750927567481995,
+ "mean_token_accuracy": 0.8146067261695862,
+ "num_tokens": 20840448.0,
+ "step": 1272
+ },
+ {
+ "entropy": 0.7807356119155884,
+ "epoch": 2.5717171717171716,
+ "grad_norm": 2.1028854846954346,
+ "learning_rate": 2.868686868686869e-06,
+ "loss": 0.7759028673171997,
+ "mean_token_accuracy": 0.7914020419120789,
+ "num_tokens": 20856832.0,
+ "step": 1273
+ },
+ {
+ "entropy": 0.8176921010017395,
+ "epoch": 2.573737373737374,
+ "grad_norm": 1.9491738080978394,
+ "learning_rate": 2.855218855218855e-06,
+ "loss": 0.7880226969718933,
+ "mean_token_accuracy": 0.7891426682472229,
+ "num_tokens": 20873216.0,
+ "step": 1274
+ },
+ {
+ "entropy": 1.1993833780288696,
+ "epoch": 2.5757575757575757,
+ "grad_norm": 2.2878284454345703,
+ "learning_rate": 2.841750841750842e-06,
+ "loss": 1.2149043083190918,
+ "mean_token_accuracy": 0.6962628364562988,
+ "num_tokens": 20889600.0,
+ "step": 1275
+ },
+ {
+ "entropy": 1.2472699880599976,
+ "epoch": 2.5777777777777775,
+ "grad_norm": 2.1730587482452393,
+ "learning_rate": 2.8282828282828286e-06,
+ "loss": 1.2479032278060913,
+ "mean_token_accuracy": 0.6937591433525085,
+ "num_tokens": 20905984.0,
+ "step": 1276
+ },
+ {
+ "entropy": 0.9197280406951904,
+ "epoch": 2.5797979797979798,
+ "grad_norm": 1.955877423286438,
+ "learning_rate": 2.814814814814815e-06,
+ "loss": 0.896048903465271,
+ "mean_token_accuracy": 0.7733879089355469,
+ "num_tokens": 20922368.0,
+ "step": 1277
+ },
+ {
+ "entropy": 1.1877310276031494,
+ "epoch": 2.581818181818182,
+ "grad_norm": 2.2136073112487793,
+ "learning_rate": 2.8013468013468016e-06,
+ "loss": 1.178865909576416,
+ "mean_token_accuracy": 0.7047508358955383,
+ "num_tokens": 20938752.0,
+ "step": 1278
+ },
+ {
+ "entropy": 0.7793066501617432,
+ "epoch": 2.583838383838384,
+ "grad_norm": 2.0132107734680176,
+ "learning_rate": 2.7878787878787885e-06,
+ "loss": 0.7862892150878906,
+ "mean_token_accuracy": 0.7963483333587646,
+ "num_tokens": 20955136.0,
+ "step": 1279
+ },
+ {
+ "entropy": 1.2476853132247925,
+ "epoch": 2.5858585858585856,
+ "grad_norm": 2.3129923343658447,
+ "learning_rate": 2.7744107744107745e-06,
+ "loss": 1.2039775848388672,
+ "mean_token_accuracy": 0.7099413871765137,
+ "num_tokens": 20971520.0,
+ "step": 1280
+ },
+ {
+ "entropy": 1.042412281036377,
+ "epoch": 2.587878787878788,
+ "grad_norm": 2.2215702533721924,
+ "learning_rate": 2.7609427609427614e-06,
+ "loss": 1.051681399345398,
+ "mean_token_accuracy": 0.7425500750541687,
+ "num_tokens": 20987904.0,
+ "step": 1281
+ },
+ {
+ "entropy": 0.7061983346939087,
+ "epoch": 2.58989898989899,
+ "grad_norm": 2.0668582916259766,
+ "learning_rate": 2.7474747474747475e-06,
+ "loss": 0.7098591327667236,
+ "mean_token_accuracy": 0.8134465217590332,
+ "num_tokens": 21004288.0,
+ "step": 1282
+ },
+ {
+ "entropy": 0.8634867668151855,
+ "epoch": 2.591919191919192,
+ "grad_norm": 2.0467185974121094,
+ "learning_rate": 2.7340067340067344e-06,
+ "loss": 0.8574676513671875,
+ "mean_token_accuracy": 0.7678309679031372,
+ "num_tokens": 21020672.0,
+ "step": 1283
+ },
+ {
+ "entropy": 1.071445107460022,
+ "epoch": 2.5939393939393938,
+ "grad_norm": 2.4267988204956055,
+ "learning_rate": 2.720538720538721e-06,
+ "loss": 1.0452513694763184,
+ "mean_token_accuracy": 0.7368099689483643,
+ "num_tokens": 21037056.0,
+ "step": 1284
+ },
+ {
+ "entropy": 1.0232303142547607,
+ "epoch": 2.595959595959596,
+ "grad_norm": 2.244133234024048,
+ "learning_rate": 2.7070707070707074e-06,
+ "loss": 1.0210691690444946,
+ "mean_token_accuracy": 0.7452979683876038,
+ "num_tokens": 21053440.0,
+ "step": 1285
+ },
+ {
+ "entropy": 0.984527587890625,
+ "epoch": 2.597979797979798,
+ "grad_norm": 2.1976277828216553,
+ "learning_rate": 2.693602693602694e-06,
+ "loss": 0.9877492785453796,
+ "mean_token_accuracy": 0.7432217597961426,
+ "num_tokens": 21069824.0,
+ "step": 1286
+ },
+ {
+ "entropy": 1.0401315689086914,
+ "epoch": 2.6,
+ "grad_norm": 2.3494908809661865,
+ "learning_rate": 2.6801346801346808e-06,
+ "loss": 1.0381377935409546,
+ "mean_token_accuracy": 0.7385808229446411,
+ "num_tokens": 21086208.0,
+ "step": 1287
+ },
+ {
+ "entropy": 0.758490800857544,
+ "epoch": 2.602020202020202,
+ "grad_norm": 2.0141663551330566,
+ "learning_rate": 2.666666666666667e-06,
+ "loss": 0.7600662112236023,
+ "mean_token_accuracy": 0.8067293763160706,
+ "num_tokens": 21102592.0,
+ "step": 1288
+ },
+ {
+ "entropy": 1.1525641679763794,
+ "epoch": 2.604040404040404,
+ "grad_norm": 2.1283185482025146,
+ "learning_rate": 2.6531986531986537e-06,
+ "loss": 1.149183750152588,
+ "mean_token_accuracy": 0.7203224301338196,
+ "num_tokens": 21118976.0,
+ "step": 1289
+ },
+ {
+ "entropy": 1.0491526126861572,
+ "epoch": 2.606060606060606,
+ "grad_norm": 2.124562978744507,
+ "learning_rate": 2.63973063973064e-06,
+ "loss": 1.057656168937683,
+ "mean_token_accuracy": 0.7329628467559814,
+ "num_tokens": 21135360.0,
+ "step": 1290
+ },
+ {
+ "entropy": 0.9726903438568115,
+ "epoch": 2.608080808080808,
+ "grad_norm": 2.2004761695861816,
+ "learning_rate": 2.6262626262626267e-06,
+ "loss": 0.963001012802124,
+ "mean_token_accuracy": 0.7552515864372253,
+ "num_tokens": 21151744.0,
+ "step": 1291
+ },
+ {
+ "entropy": 0.7241232395172119,
+ "epoch": 2.61010101010101,
+ "grad_norm": 2.227318525314331,
+ "learning_rate": 2.612794612794613e-06,
+ "loss": 0.7039598226547241,
+ "mean_token_accuracy": 0.8026379942893982,
+ "num_tokens": 21168128.0,
+ "step": 1292
+ },
+ {
+ "entropy": 0.9619441628456116,
+ "epoch": 2.6121212121212123,
+ "grad_norm": 2.043938636779785,
+ "learning_rate": 2.5993265993265997e-06,
+ "loss": 0.9687198996543884,
+ "mean_token_accuracy": 0.7593429684638977,
+ "num_tokens": 21184512.0,
+ "step": 1293
+ },
+ {
+ "entropy": 0.7907335758209229,
+ "epoch": 2.614141414141414,
+ "grad_norm": 2.0104219913482666,
+ "learning_rate": 2.585858585858586e-06,
+ "loss": 0.7938915491104126,
+ "mean_token_accuracy": 0.7873717546463013,
+ "num_tokens": 21200896.0,
+ "step": 1294
+ },
+ {
+ "entropy": 1.2517071962356567,
+ "epoch": 2.616161616161616,
+ "grad_norm": 2.6553330421447754,
+ "learning_rate": 2.5723905723905722e-06,
+ "loss": 1.2589607238769531,
+ "mean_token_accuracy": 0.6866145730018616,
+ "num_tokens": 21217280.0,
+ "step": 1295
+ },
+ {
+ "entropy": 1.0896011590957642,
+ "epoch": 2.618181818181818,
+ "grad_norm": 2.0923056602478027,
+ "learning_rate": 2.558922558922559e-06,
+ "loss": 1.0726165771484375,
+ "mean_token_accuracy": 0.7360160946846008,
+ "num_tokens": 21233664.0,
+ "step": 1296
+ },
+ {
+ "entropy": 0.8060534596443176,
+ "epoch": 2.6202020202020204,
+ "grad_norm": 2.1754214763641357,
+ "learning_rate": 2.5454545454545456e-06,
+ "loss": 0.8015183210372925,
+ "mean_token_accuracy": 0.7854176759719849,
+ "num_tokens": 21250048.0,
+ "step": 1297
+ },
+ {
+ "entropy": 0.8480345606803894,
+ "epoch": 2.6222222222222222,
+ "grad_norm": 2.1952438354492188,
+ "learning_rate": 2.531986531986532e-06,
+ "loss": 0.8521784543991089,
+ "mean_token_accuracy": 0.7794333100318909,
+ "num_tokens": 21266432.0,
+ "step": 1298
+ },
+ {
+ "entropy": 0.9813645482063293,
+ "epoch": 2.624242424242424,
+ "grad_norm": 2.276472330093384,
+ "learning_rate": 2.5185185185185186e-06,
+ "loss": 0.9841573238372803,
+ "mean_token_accuracy": 0.7430996298789978,
+ "num_tokens": 21282816.0,
+ "step": 1299
+ },
+ {
+ "entropy": 1.0559581518173218,
+ "epoch": 2.6262626262626263,
+ "grad_norm": 2.1930594444274902,
+ "learning_rate": 2.5050505050505055e-06,
+ "loss": 1.0522143840789795,
+ "mean_token_accuracy": 0.7405349016189575,
+ "num_tokens": 21299200.0,
+ "step": 1300
+ },
+ {
+ "epoch": 2.6262626262626263,
+ "eval_entropy": 1.136087471919675,
+ "eval_loss": 1.609318733215332,
+ "eval_mean_token_accuracy": 0.6427743410871875,
+ "eval_num_tokens": 21299200.0,
+ "eval_runtime": 43.7802,
+ "eval_samples_per_second": 22.613,
+ "eval_steps_per_second": 2.832,
+ "step": 1300
+ },
+ {
+ "entropy": 1.1001769304275513,
+ "epoch": 2.6282828282828286,
+ "grad_norm": 2.3794357776641846,
+ "learning_rate": 2.491582491582492e-06,
+ "loss": 1.1209263801574707,
+ "mean_token_accuracy": 0.7210552096366882,
+ "num_tokens": 21315584.0,
+ "step": 1301
+ },
+ {
+ "entropy": 0.872175395488739,
+ "epoch": 2.6303030303030304,
+ "grad_norm": 1.983834147453308,
+ "learning_rate": 2.4781144781144785e-06,
+ "loss": 0.8659814596176147,
+ "mean_token_accuracy": 0.7824865579605103,
+ "num_tokens": 21331968.0,
+ "step": 1302
+ },
+ {
+ "entropy": 0.8773177266120911,
+ "epoch": 2.632323232323232,
+ "grad_norm": 2.2786073684692383,
+ "learning_rate": 2.464646464646465e-06,
+ "loss": 0.8917679786682129,
+ "mean_token_accuracy": 0.7721666097640991,
+ "num_tokens": 21348352.0,
+ "step": 1303
+ },
+ {
+ "entropy": 1.4344940185546875,
+ "epoch": 2.6343434343434344,
+ "grad_norm": 2.1941874027252197,
+ "learning_rate": 2.4511784511784514e-06,
+ "loss": 1.3934135437011719,
+ "mean_token_accuracy": 0.6698216795921326,
+ "num_tokens": 21364736.0,
+ "step": 1304
+ },
+ {
+ "entropy": 1.0237466096878052,
+ "epoch": 2.6363636363636362,
+ "grad_norm": 2.210641622543335,
+ "learning_rate": 2.437710437710438e-06,
+ "loss": 1.0018086433410645,
+ "mean_token_accuracy": 0.7518930435180664,
+ "num_tokens": 21381120.0,
+ "step": 1305
+ },
+ {
+ "entropy": 0.8996136784553528,
+ "epoch": 2.6383838383838385,
+ "grad_norm": 2.247093677520752,
+ "learning_rate": 2.4242424242424244e-06,
+ "loss": 0.9008244276046753,
+ "mean_token_accuracy": 0.7721055150032043,
+ "num_tokens": 21397504.0,
+ "step": 1306
+ },
+ {
+ "entropy": 0.6376256346702576,
+ "epoch": 2.6404040404040403,
+ "grad_norm": 2.0698840618133545,
+ "learning_rate": 2.410774410774411e-06,
+ "loss": 0.6202508211135864,
+ "mean_token_accuracy": 0.8296287059783936,
+ "num_tokens": 21413888.0,
+ "step": 1307
+ },
+ {
+ "entropy": 0.7812427282333374,
+ "epoch": 2.6424242424242426,
+ "grad_norm": 1.912300944328308,
+ "learning_rate": 2.3973063973063978e-06,
+ "loss": 0.7610887289047241,
+ "mean_token_accuracy": 0.8078895807266235,
+ "num_tokens": 21430272.0,
+ "step": 1308
+ },
+ {
+ "entropy": 0.8849145174026489,
+ "epoch": 2.6444444444444444,
+ "grad_norm": 2.355889320373535,
+ "learning_rate": 2.3838383838383843e-06,
+ "loss": 0.8553632497787476,
+ "mean_token_accuracy": 0.7741817235946655,
+ "num_tokens": 21446656.0,
+ "step": 1309
+ },
+ {
+ "entropy": 0.7890692353248596,
+ "epoch": 2.6464646464646466,
+ "grad_norm": 1.9500312805175781,
+ "learning_rate": 2.3703703703703707e-06,
+ "loss": 0.7833583950996399,
+ "mean_token_accuracy": 0.7951880693435669,
+ "num_tokens": 21463040.0,
+ "step": 1310
+ },
+ {
+ "entropy": 1.015820860862732,
+ "epoch": 2.6484848484848484,
+ "grad_norm": 2.1424720287323,
+ "learning_rate": 2.3569023569023572e-06,
+ "loss": 1.0118992328643799,
+ "mean_token_accuracy": 0.7511602640151978,
+ "num_tokens": 21479424.0,
+ "step": 1311
+ },
+ {
+ "entropy": 0.9689420461654663,
+ "epoch": 2.6505050505050507,
+ "grad_norm": 2.2687859535217285,
+ "learning_rate": 2.3434343434343437e-06,
+ "loss": 0.9623984694480896,
+ "mean_token_accuracy": 0.7540302872657776,
+ "num_tokens": 21495808.0,
+ "step": 1312
+ },
+ {
+ "entropy": 1.10232412815094,
+ "epoch": 2.6525252525252525,
+ "grad_norm": 2.1755430698394775,
+ "learning_rate": 2.32996632996633e-06,
+ "loss": 1.0716698169708252,
+ "mean_token_accuracy": 0.7326575517654419,
+ "num_tokens": 21512192.0,
+ "step": 1313
+ },
+ {
+ "entropy": 0.8814781904220581,
+ "epoch": 2.6545454545454543,
+ "grad_norm": 2.2704896926879883,
+ "learning_rate": 2.3164983164983167e-06,
+ "loss": 0.8600432872772217,
+ "mean_token_accuracy": 0.7757083773612976,
+ "num_tokens": 21528576.0,
+ "step": 1314
+ },
+ {
+ "entropy": 1.0163686275482178,
+ "epoch": 2.6565656565656566,
+ "grad_norm": 2.1807072162628174,
+ "learning_rate": 2.303030303030303e-06,
+ "loss": 1.015133261680603,
+ "mean_token_accuracy": 0.7492061257362366,
+ "num_tokens": 21544960.0,
+ "step": 1315
+ },
+ {
+ "entropy": 1.06844162940979,
+ "epoch": 2.658585858585859,
+ "grad_norm": 2.3641507625579834,
+ "learning_rate": 2.28956228956229e-06,
+ "loss": 1.04976487159729,
+ "mean_token_accuracy": 0.7343673706054688,
+ "num_tokens": 21561344.0,
+ "step": 1316
+ },
+ {
+ "entropy": 0.8728080987930298,
+ "epoch": 2.6606060606060606,
+ "grad_norm": 2.061201572418213,
+ "learning_rate": 2.2760942760942766e-06,
+ "loss": 0.8450087904930115,
+ "mean_token_accuracy": 0.7807157039642334,
+ "num_tokens": 21577728.0,
+ "step": 1317
+ },
+ {
+ "entropy": 0.8158561587333679,
+ "epoch": 2.6626262626262625,
+ "grad_norm": 2.0881152153015137,
+ "learning_rate": 2.262626262626263e-06,
+ "loss": 0.8148937821388245,
+ "mean_token_accuracy": 0.7823033928871155,
+ "num_tokens": 21594112.0,
+ "step": 1318
+ },
+ {
+ "entropy": 0.9075817465782166,
+ "epoch": 2.6646464646464647,
+ "grad_norm": 2.1599912643432617,
+ "learning_rate": 2.249158249158249e-06,
+ "loss": 0.9027103185653687,
+ "mean_token_accuracy": 0.7571446299552917,
+ "num_tokens": 21610496.0,
+ "step": 1319
+ },
+ {
+ "entropy": 1.037543773651123,
+ "epoch": 2.6666666666666665,
+ "grad_norm": 2.279888391494751,
+ "learning_rate": 2.2356902356902356e-06,
+ "loss": 1.0209299325942993,
+ "mean_token_accuracy": 0.7410845160484314,
+ "num_tokens": 21626880.0,
+ "step": 1320
+ },
+ {
+ "entropy": 0.8195902109146118,
+ "epoch": 2.6686868686868688,
+ "grad_norm": 1.9627693891525269,
+ "learning_rate": 2.222222222222222e-06,
+ "loss": 0.8038985133171082,
+ "mean_token_accuracy": 0.7953101992607117,
+ "num_tokens": 21643264.0,
+ "step": 1321
+ },
+ {
+ "entropy": 0.8495474457740784,
+ "epoch": 2.6707070707070706,
+ "grad_norm": 2.180691957473755,
+ "learning_rate": 2.208754208754209e-06,
+ "loss": 0.8287450075149536,
+ "mean_token_accuracy": 0.7793722748756409,
+ "num_tokens": 21659648.0,
+ "step": 1322
+ },
+ {
+ "entropy": 0.8658807873725891,
+ "epoch": 2.672727272727273,
+ "grad_norm": 2.2783005237579346,
+ "learning_rate": 2.1952861952861955e-06,
+ "loss": 0.8221741914749146,
+ "mean_token_accuracy": 0.7837689518928528,
+ "num_tokens": 21676032.0,
+ "step": 1323
+ },
+ {
+ "entropy": 1.3661859035491943,
+ "epoch": 2.6747474747474747,
+ "grad_norm": 2.3197426795959473,
+ "learning_rate": 2.181818181818182e-06,
+ "loss": 1.3951282501220703,
+ "mean_token_accuracy": 0.6698216795921326,
+ "num_tokens": 21692416.0,
+ "step": 1324
+ },
+ {
+ "entropy": 0.8162605166435242,
+ "epoch": 2.676767676767677,
+ "grad_norm": 2.2228052616119385,
+ "learning_rate": 2.1683501683501684e-06,
+ "loss": 0.8109195232391357,
+ "mean_token_accuracy": 0.7856619358062744,
+ "num_tokens": 21708800.0,
+ "step": 1325
+ },
+ {
+ "entropy": 0.686102032661438,
+ "epoch": 2.6787878787878787,
+ "grad_norm": 2.090847969055176,
+ "learning_rate": 2.154882154882155e-06,
+ "loss": 0.685897171497345,
+ "mean_token_accuracy": 0.8203468322753906,
+ "num_tokens": 21725184.0,
+ "step": 1326
+ },
+ {
+ "entropy": 0.7880700826644897,
+ "epoch": 2.680808080808081,
+ "grad_norm": 2.205867052078247,
+ "learning_rate": 2.1414141414141414e-06,
+ "loss": 0.7863162755966187,
+ "mean_token_accuracy": 0.7872496247291565,
+ "num_tokens": 21741568.0,
+ "step": 1327
+ },
+ {
+ "entropy": 1.1857227087020874,
+ "epoch": 2.682828282828283,
+ "grad_norm": 2.4101028442382812,
+ "learning_rate": 2.127946127946128e-06,
+ "loss": 1.186779499053955,
+ "mean_token_accuracy": 0.7098192572593689,
+ "num_tokens": 21757952.0,
+ "step": 1328
+ },
+ {
+ "entropy": 0.6934559345245361,
+ "epoch": 2.6848484848484846,
+ "grad_norm": 2.0098626613616943,
+ "learning_rate": 2.1144781144781144e-06,
+ "loss": 0.6930664777755737,
+ "mean_token_accuracy": 0.8147899508476257,
+ "num_tokens": 21774336.0,
+ "step": 1329
+ },
+ {
+ "entropy": 0.9050189256668091,
+ "epoch": 2.686868686868687,
+ "grad_norm": 2.298691987991333,
+ "learning_rate": 2.1010101010101013e-06,
+ "loss": 0.9015864133834839,
+ "mean_token_accuracy": 0.7663043737411499,
+ "num_tokens": 21790720.0,
+ "step": 1330
+ },
+ {
+ "entropy": 0.8668895959854126,
+ "epoch": 2.688888888888889,
+ "grad_norm": 2.20314359664917,
+ "learning_rate": 2.0875420875420878e-06,
+ "loss": 0.8361119627952576,
+ "mean_token_accuracy": 0.7816316485404968,
+ "num_tokens": 21807104.0,
+ "step": 1331
+ },
+ {
+ "entropy": 0.6271505951881409,
+ "epoch": 2.690909090909091,
+ "grad_norm": 2.095332622528076,
+ "learning_rate": 2.0740740740740742e-06,
+ "loss": 0.6370486617088318,
+ "mean_token_accuracy": 0.827186107635498,
+ "num_tokens": 21823488.0,
+ "step": 1332
+ },
+ {
+ "entropy": 0.9386110901832581,
+ "epoch": 2.6929292929292927,
+ "grad_norm": 2.3780136108398438,
+ "learning_rate": 2.0606060606060607e-06,
+ "loss": 0.9280458688735962,
+ "mean_token_accuracy": 0.7595872282981873,
+ "num_tokens": 21839872.0,
+ "step": 1333
+ },
+ {
+ "entropy": 0.6763703227043152,
+ "epoch": 2.694949494949495,
+ "grad_norm": 2.014997720718384,
+ "learning_rate": 2.0471380471380472e-06,
+ "loss": 0.6596795320510864,
+ "mean_token_accuracy": 0.8192476630210876,
+ "num_tokens": 21856256.0,
+ "step": 1334
+ },
+ {
+ "entropy": 0.9701617360115051,
+ "epoch": 2.6969696969696972,
+ "grad_norm": 2.1106598377227783,
+ "learning_rate": 2.0336700336700337e-06,
+ "loss": 0.9544191360473633,
+ "mean_token_accuracy": 0.7517098188400269,
+ "num_tokens": 21872640.0,
+ "step": 1335
+ },
+ {
+ "entropy": 1.0414639711380005,
+ "epoch": 2.698989898989899,
+ "grad_norm": 2.058302640914917,
+ "learning_rate": 2.02020202020202e-06,
+ "loss": 1.0318336486816406,
+ "mean_token_accuracy": 0.7472520470619202,
+ "num_tokens": 21889024.0,
+ "step": 1336
+ },
+ {
+ "entropy": 1.1898949146270752,
+ "epoch": 2.701010101010101,
+ "grad_norm": 2.3403096199035645,
+ "learning_rate": 2.0067340067340067e-06,
+ "loss": 1.1814141273498535,
+ "mean_token_accuracy": 0.7099413871765137,
+ "num_tokens": 21905408.0,
+ "step": 1337
+ },
+ {
+ "entropy": 0.7575987577438354,
+ "epoch": 2.703030303030303,
+ "grad_norm": 2.305110454559326,
+ "learning_rate": 1.9932659932659936e-06,
+ "loss": 0.7617212533950806,
+ "mean_token_accuracy": 0.79347825050354,
+ "num_tokens": 21921792.0,
+ "step": 1338
+ },
+ {
+ "entropy": 1.2738142013549805,
+ "epoch": 2.705050505050505,
+ "grad_norm": 2.1600685119628906,
+ "learning_rate": 1.97979797979798e-06,
+ "loss": 1.26939058303833,
+ "mean_token_accuracy": 0.7040180563926697,
+ "num_tokens": 21938176.0,
+ "step": 1339
+ },
+ {
+ "entropy": 1.20439612865448,
+ "epoch": 2.707070707070707,
+ "grad_norm": 2.13100528717041,
+ "learning_rate": 1.9663299663299665e-06,
+ "loss": 1.19621741771698,
+ "mean_token_accuracy": 0.7227039337158203,
+ "num_tokens": 21954560.0,
+ "step": 1340
+ },
+ {
+ "entropy": 0.8565170764923096,
+ "epoch": 2.709090909090909,
+ "grad_norm": 2.153420925140381,
+ "learning_rate": 1.952861952861953e-06,
+ "loss": 0.8627563714981079,
+ "mean_token_accuracy": 0.7792501449584961,
+ "num_tokens": 21970944.0,
+ "step": 1341
+ },
+ {
+ "entropy": 1.0674846172332764,
+ "epoch": 2.7111111111111112,
+ "grad_norm": 2.2488465309143066,
+ "learning_rate": 1.9393939393939395e-06,
+ "loss": 1.1025105714797974,
+ "mean_token_accuracy": 0.725024402141571,
+ "num_tokens": 21987328.0,
+ "step": 1342
+ },
+ {
+ "entropy": 1.098164677619934,
+ "epoch": 2.713131313131313,
+ "grad_norm": 1.880246639251709,
+ "learning_rate": 1.925925925925926e-06,
+ "loss": 1.093496322631836,
+ "mean_token_accuracy": 0.7441987991333008,
+ "num_tokens": 22003712.0,
+ "step": 1343
+ },
+ {
+ "entropy": 1.007258415222168,
+ "epoch": 2.7151515151515153,
+ "grad_norm": 2.064815044403076,
+ "learning_rate": 1.9124579124579125e-06,
+ "loss": 0.9783555865287781,
+ "mean_token_accuracy": 0.7542135119438171,
+ "num_tokens": 22020096.0,
+ "step": 1344
+ },
+ {
+ "entropy": 0.56569904088974,
+ "epoch": 2.717171717171717,
+ "grad_norm": 2.032102346420288,
+ "learning_rate": 1.8989898989898992e-06,
+ "loss": 0.5754306316375732,
+ "mean_token_accuracy": 0.8329873085021973,
+ "num_tokens": 22036480.0,
+ "step": 1345
+ },
+ {
+ "entropy": 1.2911049127578735,
+ "epoch": 2.7191919191919194,
+ "grad_norm": 2.148770570755005,
+ "learning_rate": 1.8855218855218857e-06,
+ "loss": 1.295262098312378,
+ "mean_token_accuracy": 0.6909501552581787,
+ "num_tokens": 22052864.0,
+ "step": 1346
+ },
+ {
+ "entropy": 1.0127439498901367,
+ "epoch": 2.721212121212121,
+ "grad_norm": 2.073178291320801,
+ "learning_rate": 1.8720538720538721e-06,
+ "loss": 1.026899814605713,
+ "mean_token_accuracy": 0.7647166848182678,
+ "num_tokens": 22069248.0,
+ "step": 1347
+ },
+ {
+ "entropy": 1.3102049827575684,
+ "epoch": 2.723232323232323,
+ "grad_norm": 3.1892120838165283,
+ "learning_rate": 1.8585858585858588e-06,
+ "loss": 1.3353972434997559,
+ "mean_token_accuracy": 0.6885075569152832,
+ "num_tokens": 22085632.0,
+ "step": 1348
+ },
+ {
+ "entropy": 1.234026551246643,
+ "epoch": 2.7252525252525253,
+ "grad_norm": 2.2144527435302734,
+ "learning_rate": 1.8451178451178453e-06,
+ "loss": 1.263453722000122,
+ "mean_token_accuracy": 0.7058500051498413,
+ "num_tokens": 22102016.0,
+ "step": 1349
+ },
+ {
+ "entropy": 0.8032963871955872,
+ "epoch": 2.7272727272727275,
+ "grad_norm": 2.0798792839050293,
+ "learning_rate": 1.8316498316498318e-06,
+ "loss": 0.7893553972244263,
+ "mean_token_accuracy": 0.7901807427406311,
+ "num_tokens": 22118400.0,
+ "step": 1350
+ },
+ {
+ "entropy": 0.8658150434494019,
+ "epoch": 2.7292929292929293,
+ "grad_norm": 2.3371081352233887,
+ "learning_rate": 1.8181818181818183e-06,
+ "loss": 0.8607960939407349,
+ "mean_token_accuracy": 0.765693724155426,
+ "num_tokens": 22134784.0,
+ "step": 1351
+ },
+ {
+ "entropy": 0.7587262988090515,
+ "epoch": 2.731313131313131,
+ "grad_norm": 2.0964932441711426,
+ "learning_rate": 1.804713804713805e-06,
+ "loss": 0.7469046711921692,
+ "mean_token_accuracy": 0.7841353416442871,
+ "num_tokens": 22151168.0,
+ "step": 1352
+ },
+ {
+ "entropy": 1.0758448839187622,
+ "epoch": 2.7333333333333334,
+ "grad_norm": 2.216097593307495,
+ "learning_rate": 1.7912457912457915e-06,
+ "loss": 1.0564570426940918,
+ "mean_token_accuracy": 0.7307645082473755,
+ "num_tokens": 22167552.0,
+ "step": 1353
+ },
+ {
+ "entropy": 0.6904771327972412,
+ "epoch": 2.735353535353535,
+ "grad_norm": 2.1575329303741455,
+ "learning_rate": 1.777777777777778e-06,
+ "loss": 0.694258451461792,
+ "mean_token_accuracy": 0.8085002303123474,
+ "num_tokens": 22183936.0,
+ "step": 1354
+ },
+ {
+ "entropy": 0.9386518001556396,
+ "epoch": 2.7373737373737375,
+ "grad_norm": 2.3370704650878906,
+ "learning_rate": 1.7643097643097644e-06,
+ "loss": 0.9242473840713501,
+ "mean_token_accuracy": 0.758671224117279,
+ "num_tokens": 22200320.0,
+ "step": 1355
+ },
+ {
+ "entropy": 1.350234866142273,
+ "epoch": 2.7393939393939393,
+ "grad_norm": 2.273244619369507,
+ "learning_rate": 1.7508417508417511e-06,
+ "loss": 1.3637861013412476,
+ "mean_token_accuracy": 0.7142769694328308,
+ "num_tokens": 22216704.0,
+ "step": 1356
+ },
+ {
+ "entropy": 0.9347048401832581,
+ "epoch": 2.7414141414141415,
+ "grad_norm": 2.2230279445648193,
+ "learning_rate": 1.7373737373737376e-06,
+ "loss": 0.9385714530944824,
+ "mean_token_accuracy": 0.7549462914466858,
+ "num_tokens": 22233088.0,
+ "step": 1357
+ },
+ {
+ "entropy": 0.8205846548080444,
+ "epoch": 2.7434343434343433,
+ "grad_norm": 2.119422435760498,
+ "learning_rate": 1.723905723905724e-06,
+ "loss": 0.8094472885131836,
+ "mean_token_accuracy": 0.7930508255958557,
+ "num_tokens": 22249472.0,
+ "step": 1358
+ },
+ {
+ "entropy": 1.3506226539611816,
+ "epoch": 2.7454545454545456,
+ "grad_norm": 2.1955182552337646,
+ "learning_rate": 1.7104377104377106e-06,
+ "loss": 1.34646475315094,
+ "mean_token_accuracy": 0.6719589829444885,
+ "num_tokens": 22265856.0,
+ "step": 1359
+ },
+ {
+ "entropy": 0.9343435168266296,
+ "epoch": 2.7474747474747474,
+ "grad_norm": 2.149738073348999,
+ "learning_rate": 1.6969696969696973e-06,
+ "loss": 0.9155716300010681,
+ "mean_token_accuracy": 0.7647777199745178,
+ "num_tokens": 22282240.0,
+ "step": 1360
+ },
+ {
+ "entropy": 1.245186448097229,
+ "epoch": 2.7494949494949497,
+ "grad_norm": 2.2064425945281982,
+ "learning_rate": 1.6835016835016838e-06,
+ "loss": 1.2376378774642944,
+ "mean_token_accuracy": 0.702125072479248,
+ "num_tokens": 22298624.0,
+ "step": 1361
+ },
+ {
+ "entropy": 0.794501781463623,
+ "epoch": 2.7515151515151515,
+ "grad_norm": 2.13567852973938,
+ "learning_rate": 1.6700336700336703e-06,
+ "loss": 0.7857789993286133,
+ "mean_token_accuracy": 0.7925012111663818,
+ "num_tokens": 22315008.0,
+ "step": 1362
+ },
+ {
+ "entropy": 0.7703561186790466,
+ "epoch": 2.7535353535353533,
+ "grad_norm": 2.251387596130371,
+ "learning_rate": 1.6565656565656567e-06,
+ "loss": 0.7742305397987366,
+ "mean_token_accuracy": 0.7852345108985901,
+ "num_tokens": 22331392.0,
+ "step": 1363
+ },
+ {
+ "entropy": 1.0444586277008057,
+ "epoch": 2.7555555555555555,
+ "grad_norm": 2.2355873584747314,
+ "learning_rate": 1.6430976430976434e-06,
+ "loss": 1.0516932010650635,
+ "mean_token_accuracy": 0.7522594332695007,
+ "num_tokens": 22347776.0,
+ "step": 1364
+ },
+ {
+ "entropy": 1.1597771644592285,
+ "epoch": 2.757575757575758,
+ "grad_norm": 2.19389009475708,
+ "learning_rate": 1.62962962962963e-06,
+ "loss": 1.1565136909484863,
+ "mean_token_accuracy": 0.7207498550415039,
+ "num_tokens": 22364160.0,
+ "step": 1365
+ },
+ {
+ "entropy": 1.2256853580474854,
+ "epoch": 2.7595959595959596,
+ "grad_norm": 2.273327350616455,
+ "learning_rate": 1.6161616161616164e-06,
+ "loss": 1.2160989046096802,
+ "mean_token_accuracy": 0.7077430486679077,
+ "num_tokens": 22380544.0,
+ "step": 1366
+ },
+ {
+ "entropy": 1.1024588346481323,
+ "epoch": 2.7616161616161614,
+ "grad_norm": 2.3130714893341064,
+ "learning_rate": 1.6026936026936027e-06,
+ "loss": 1.0891623497009277,
+ "mean_token_accuracy": 0.7457864880561829,
+ "num_tokens": 22396928.0,
+ "step": 1367
+ },
+ {
+ "entropy": 1.1749509572982788,
+ "epoch": 2.7636363636363637,
+ "grad_norm": 2.1840877532958984,
+ "learning_rate": 1.5892255892255892e-06,
+ "loss": 1.1486189365386963,
+ "mean_token_accuracy": 0.7224596738815308,
+ "num_tokens": 22413312.0,
+ "step": 1368
+ },
+ {
+ "entropy": 0.755344569683075,
+ "epoch": 2.765656565656566,
+ "grad_norm": 2.225905179977417,
+ "learning_rate": 1.5757575757575759e-06,
+ "loss": 0.7560299634933472,
+ "mean_token_accuracy": 0.8009281754493713,
+ "num_tokens": 22429696.0,
+ "step": 1369
+ },
+ {
+ "entropy": 1.11491858959198,
+ "epoch": 2.7676767676767677,
+ "grad_norm": 2.181978702545166,
+ "learning_rate": 1.5622895622895623e-06,
+ "loss": 1.082735300064087,
+ "mean_token_accuracy": 0.7393136024475098,
+ "num_tokens": 22446080.0,
+ "step": 1370
+ },
+ {
+ "entropy": 1.203733205795288,
+ "epoch": 2.7696969696969695,
+ "grad_norm": 2.1899125576019287,
+ "learning_rate": 1.5488215488215488e-06,
+ "loss": 1.2145953178405762,
+ "mean_token_accuracy": 0.7018197178840637,
+ "num_tokens": 22462464.0,
+ "step": 1371
+ },
+ {
+ "entropy": 1.042996883392334,
+ "epoch": 2.771717171717172,
+ "grad_norm": 2.1655640602111816,
+ "learning_rate": 1.5353535353535353e-06,
+ "loss": 1.0236766338348389,
+ "mean_token_accuracy": 0.7488397359848022,
+ "num_tokens": 22478848.0,
+ "step": 1372
+ },
+ {
+ "entropy": 0.9719638228416443,
+ "epoch": 2.7737373737373736,
+ "grad_norm": 2.123048782348633,
+ "learning_rate": 1.521885521885522e-06,
+ "loss": 0.9863395690917969,
+ "mean_token_accuracy": 0.748961865901947,
+ "num_tokens": 22495232.0,
+ "step": 1373
+ },
+ {
+ "entropy": 0.9668793082237244,
+ "epoch": 2.775757575757576,
+ "grad_norm": 2.0465495586395264,
+ "learning_rate": 1.5084175084175085e-06,
+ "loss": 0.9484689235687256,
+ "mean_token_accuracy": 0.761907696723938,
+ "num_tokens": 22511616.0,
+ "step": 1374
+ },
+ {
+ "entropy": 1.125752329826355,
+ "epoch": 2.7777777777777777,
+ "grad_norm": 2.090346336364746,
+ "learning_rate": 1.494949494949495e-06,
+ "loss": 1.1148427724838257,
+ "mean_token_accuracy": 0.7297874689102173,
+ "num_tokens": 22528000.0,
+ "step": 1375
+ },
+ {
+ "entropy": 0.9548814296722412,
+ "epoch": 2.77979797979798,
+ "grad_norm": 2.199824333190918,
+ "learning_rate": 1.4814814814814815e-06,
+ "loss": 0.9301331043243408,
+ "mean_token_accuracy": 0.7628236413002014,
+ "num_tokens": 22544384.0,
+ "step": 1376
+ },
+ {
+ "entropy": 1.0585272312164307,
+ "epoch": 2.7818181818181817,
+ "grad_norm": 2.337399482727051,
+ "learning_rate": 1.4680134680134681e-06,
+ "loss": 1.0728713274002075,
+ "mean_token_accuracy": 0.7237420678138733,
+ "num_tokens": 22560768.0,
+ "step": 1377
+ },
+ {
+ "entropy": 1.1996891498565674,
+ "epoch": 2.783838383838384,
+ "grad_norm": 2.465836763381958,
+ "learning_rate": 1.4545454545454546e-06,
+ "loss": 1.2366418838500977,
+ "mean_token_accuracy": 0.6919882893562317,
+ "num_tokens": 22577152.0,
+ "step": 1378
+ },
+ {
+ "entropy": 0.8297094702720642,
+ "epoch": 2.785858585858586,
+ "grad_norm": 2.303840398788452,
+ "learning_rate": 1.4410774410774411e-06,
+ "loss": 0.8407220840454102,
+ "mean_token_accuracy": 0.7727161645889282,
+ "num_tokens": 22593536.0,
+ "step": 1379
+ },
+ {
+ "entropy": 1.0284315347671509,
+ "epoch": 2.787878787878788,
+ "grad_norm": 2.5417709350585938,
+ "learning_rate": 1.4276094276094276e-06,
+ "loss": 1.0437777042388916,
+ "mean_token_accuracy": 0.738092303276062,
+ "num_tokens": 22609920.0,
+ "step": 1380
+ },
+ {
+ "entropy": 0.9829826951026917,
+ "epoch": 2.78989898989899,
+ "grad_norm": 2.1615004539489746,
+ "learning_rate": 1.4141414141414143e-06,
+ "loss": 0.9619671106338501,
+ "mean_token_accuracy": 0.7565339803695679,
+ "num_tokens": 22626304.0,
+ "step": 1381
+ },
+ {
+ "entropy": 0.6986419558525085,
+ "epoch": 2.7919191919191917,
+ "grad_norm": 2.059281349182129,
+ "learning_rate": 1.4006734006734008e-06,
+ "loss": 0.6810094714164734,
+ "mean_token_accuracy": 0.8127137422561646,
+ "num_tokens": 22642688.0,
+ "step": 1382
+ },
+ {
+ "entropy": 1.1219873428344727,
+ "epoch": 2.793939393939394,
+ "grad_norm": 4.745248794555664,
+ "learning_rate": 1.3872053872053873e-06,
+ "loss": 1.17073655128479,
+ "mean_token_accuracy": 0.7132999300956726,
+ "num_tokens": 22659072.0,
+ "step": 1383
+ },
+ {
+ "entropy": 1.0922656059265137,
+ "epoch": 2.795959595959596,
+ "grad_norm": 2.024942398071289,
+ "learning_rate": 1.3737373737373738e-06,
+ "loss": 1.088742971420288,
+ "mean_token_accuracy": 0.7467024922370911,
+ "num_tokens": 22675456.0,
+ "step": 1384
+ },
+ {
+ "entropy": 1.038475513458252,
+ "epoch": 2.797979797979798,
+ "grad_norm": 2.274622917175293,
+ "learning_rate": 1.3602693602693604e-06,
+ "loss": 1.0326749086380005,
+ "mean_token_accuracy": 0.7448094487190247,
+ "num_tokens": 22691840.0,
+ "step": 1385
+ },
+ {
+ "entropy": 0.9840977787971497,
+ "epoch": 2.8,
+ "grad_norm": 2.2080237865448,
+ "learning_rate": 1.346801346801347e-06,
+ "loss": 0.9834811687469482,
+ "mean_token_accuracy": 0.7443820238113403,
+ "num_tokens": 22708224.0,
+ "step": 1386
+ },
+ {
+ "entropy": 0.8895727396011353,
+ "epoch": 2.802020202020202,
+ "grad_norm": 1.9656678438186646,
+ "learning_rate": 1.3333333333333334e-06,
+ "loss": 0.868664562702179,
+ "mean_token_accuracy": 0.7685027122497559,
+ "num_tokens": 22724608.0,
+ "step": 1387
+ },
+ {
+ "entropy": 1.1341460943222046,
+ "epoch": 2.804040404040404,
+ "grad_norm": 2.34385347366333,
+ "learning_rate": 1.31986531986532e-06,
+ "loss": 1.1425552368164062,
+ "mean_token_accuracy": 0.718551516532898,
+ "num_tokens": 22740992.0,
+ "step": 1388
+ },
+ {
+ "entropy": 0.8935446739196777,
+ "epoch": 2.806060606060606,
+ "grad_norm": 2.0570411682128906,
+ "learning_rate": 1.3063973063973066e-06,
+ "loss": 0.8920376300811768,
+ "mean_token_accuracy": 0.7730825543403625,
+ "num_tokens": 22757376.0,
+ "step": 1389
+ },
+ {
+ "entropy": 0.8422355055809021,
+ "epoch": 2.808080808080808,
+ "grad_norm": 2.287170886993408,
+ "learning_rate": 1.292929292929293e-06,
+ "loss": 0.8516101837158203,
+ "mean_token_accuracy": 0.788532018661499,
+ "num_tokens": 22773760.0,
+ "step": 1390
+ },
+ {
+ "entropy": 0.9526816606521606,
+ "epoch": 2.81010101010101,
+ "grad_norm": 2.069354772567749,
+ "learning_rate": 1.2794612794612796e-06,
+ "loss": 0.9390783309936523,
+ "mean_token_accuracy": 0.7687469720840454,
+ "num_tokens": 22790144.0,
+ "step": 1391
+ },
+ {
+ "entropy": 1.3697867393493652,
+ "epoch": 2.812121212121212,
+ "grad_norm": 2.668720006942749,
+ "learning_rate": 1.265993265993266e-06,
+ "loss": 1.3849083185195923,
+ "mean_token_accuracy": 0.6784929037094116,
+ "num_tokens": 22806528.0,
+ "step": 1392
+ },
+ {
+ "entropy": 0.9275345802307129,
+ "epoch": 2.8141414141414143,
+ "grad_norm": 2.1365058422088623,
+ "learning_rate": 1.2525252525252527e-06,
+ "loss": 0.9283688068389893,
+ "mean_token_accuracy": 0.7622129917144775,
+ "num_tokens": 22822912.0,
+ "step": 1393
+ },
+ {
+ "entropy": 0.8800023198127747,
+ "epoch": 2.816161616161616,
+ "grad_norm": 2.3574256896972656,
+ "learning_rate": 1.2390572390572392e-06,
+ "loss": 0.8732290267944336,
+ "mean_token_accuracy": 0.7710674405097961,
+ "num_tokens": 22839296.0,
+ "step": 1394
+ },
+ {
+ "entropy": 1.4244937896728516,
+ "epoch": 2.8181818181818183,
+ "grad_norm": 2.1275830268859863,
+ "learning_rate": 1.2255892255892257e-06,
+ "loss": 1.3897889852523804,
+ "mean_token_accuracy": 0.6743404865264893,
+ "num_tokens": 22855680.0,
+ "step": 1395
+ },
+ {
+ "entropy": 1.0230107307434082,
+ "epoch": 2.82020202020202,
+ "grad_norm": 2.1384198665618896,
+ "learning_rate": 1.2121212121212122e-06,
+ "loss": 1.034029483795166,
+ "mean_token_accuracy": 0.7398632168769836,
+ "num_tokens": 22872064.0,
+ "step": 1396
+ },
+ {
+ "entropy": 0.7272607088088989,
+ "epoch": 2.822222222222222,
+ "grad_norm": 2.208526611328125,
+ "learning_rate": 1.1986531986531989e-06,
+ "loss": 0.71860671043396,
+ "mean_token_accuracy": 0.8063018918037415,
+ "num_tokens": 22888448.0,
+ "step": 1397
+ },
+ {
+ "entropy": 1.2365843057632446,
+ "epoch": 2.824242424242424,
+ "grad_norm": 2.191222667694092,
+ "learning_rate": 1.1851851851851854e-06,
+ "loss": 1.2230392694473267,
+ "mean_token_accuracy": 0.7057278752326965,
+ "num_tokens": 22904832.0,
+ "step": 1398
+ },
+ {
+ "entropy": 0.8831301331520081,
+ "epoch": 2.8262626262626265,
+ "grad_norm": 2.2478153705596924,
+ "learning_rate": 1.1717171717171719e-06,
+ "loss": 0.8597757816314697,
+ "mean_token_accuracy": 0.7766854166984558,
+ "num_tokens": 22921216.0,
+ "step": 1399
+ },
+ {
+ "entropy": 0.8236691951751709,
+ "epoch": 2.8282828282828283,
+ "grad_norm": 2.3858163356781006,
+ "learning_rate": 1.1582491582491583e-06,
+ "loss": 0.8266822099685669,
+ "mean_token_accuracy": 0.7748534679412842,
+ "num_tokens": 22937600.0,
+ "step": 1400
+ },
+ {
+ "epoch": 2.8282828282828283,
+ "eval_entropy": 1.1389604489649496,
+ "eval_loss": 1.6066142320632935,
+ "eval_mean_token_accuracy": 0.6432013021361443,
+ "eval_num_tokens": 22937600.0,
+ "eval_runtime": 43.792,
+ "eval_samples_per_second": 22.607,
+ "eval_steps_per_second": 2.832,
+ "step": 1400
+ },
+ {
+ "entropy": 0.8862301111221313,
+ "epoch": 2.83030303030303,
+ "grad_norm": 2.362920045852661,
+ "learning_rate": 1.144781144781145e-06,
+ "loss": 0.8503944277763367,
+ "mean_token_accuracy": 0.7711284756660461,
+ "num_tokens": 22953984.0,
+ "step": 1401
+ },
+ {
+ "entropy": 1.0803418159484863,
+ "epoch": 2.8323232323232324,
+ "grad_norm": 2.292283058166504,
+ "learning_rate": 1.1313131313131315e-06,
+ "loss": 1.0977113246917725,
+ "mean_token_accuracy": 0.7307645082473755,
+ "num_tokens": 22970368.0,
+ "step": 1402
+ },
+ {
+ "entropy": 1.593738079071045,
+ "epoch": 2.8343434343434346,
+ "grad_norm": 2.6801810264587402,
+ "learning_rate": 1.1178451178451178e-06,
+ "loss": 1.5267648696899414,
+ "mean_token_accuracy": 0.6606009006500244,
+ "num_tokens": 22986752.0,
+ "step": 1403
+ },
+ {
+ "entropy": 0.9804041981697083,
+ "epoch": 2.8363636363636364,
+ "grad_norm": 2.235811471939087,
+ "learning_rate": 1.1043771043771045e-06,
+ "loss": 0.9784083962440491,
+ "mean_token_accuracy": 0.752198338508606,
+ "num_tokens": 23003136.0,
+ "step": 1404
+ },
+ {
+ "entropy": 0.7044815421104431,
+ "epoch": 2.8383838383838382,
+ "grad_norm": 2.034780263900757,
+ "learning_rate": 1.090909090909091e-06,
+ "loss": 0.6678165197372437,
+ "mean_token_accuracy": 0.8119198679924011,
+ "num_tokens": 23019520.0,
+ "step": 1405
+ },
+ {
+ "entropy": 0.9826809167861938,
+ "epoch": 2.8404040404040405,
+ "grad_norm": 2.5305731296539307,
+ "learning_rate": 1.0774410774410775e-06,
+ "loss": 0.9591178894042969,
+ "mean_token_accuracy": 0.7456033229827881,
+ "num_tokens": 23035904.0,
+ "step": 1406
+ },
+ {
+ "entropy": 1.1601169109344482,
+ "epoch": 2.8424242424242423,
+ "grad_norm": 2.191697597503662,
+ "learning_rate": 1.063973063973064e-06,
+ "loss": 1.181044578552246,
+ "mean_token_accuracy": 0.7303370833396912,
+ "num_tokens": 23052288.0,
+ "step": 1407
+ },
+ {
+ "entropy": 0.6280582547187805,
+ "epoch": 2.8444444444444446,
+ "grad_norm": 2.06825590133667,
+ "learning_rate": 1.0505050505050506e-06,
+ "loss": 0.622545599937439,
+ "mean_token_accuracy": 0.8232169151306152,
+ "num_tokens": 23068672.0,
+ "step": 1408
+ },
+ {
+ "entropy": 0.9755560755729675,
+ "epoch": 2.8464646464646464,
+ "grad_norm": 2.2459638118743896,
+ "learning_rate": 1.0370370370370371e-06,
+ "loss": 0.9764548540115356,
+ "mean_token_accuracy": 0.7656326293945312,
+ "num_tokens": 23085056.0,
+ "step": 1409
+ },
+ {
+ "entropy": 1.4480527639389038,
+ "epoch": 2.8484848484848486,
+ "grad_norm": 2.12251615524292,
+ "learning_rate": 1.0235690235690236e-06,
+ "loss": 1.4220662117004395,
+ "mean_token_accuracy": 0.677760124206543,
+ "num_tokens": 23101440.0,
+ "step": 1410
+ },
+ {
+ "entropy": 0.7127546072006226,
+ "epoch": 2.8505050505050504,
+ "grad_norm": 2.2641944885253906,
+ "learning_rate": 1.01010101010101e-06,
+ "loss": 0.7147482633590698,
+ "mean_token_accuracy": 0.7989130616188049,
+ "num_tokens": 23117824.0,
+ "step": 1411
+ },
+ {
+ "entropy": 0.9932766556739807,
+ "epoch": 2.8525252525252527,
+ "grad_norm": 2.1933536529541016,
+ "learning_rate": 9.966329966329968e-07,
+ "loss": 0.977810263633728,
+ "mean_token_accuracy": 0.7449315786361694,
+ "num_tokens": 23134208.0,
+ "step": 1412
+ },
+ {
+ "entropy": 0.9120132327079773,
+ "epoch": 2.8545454545454545,
+ "grad_norm": 2.004495859146118,
+ "learning_rate": 9.831649831649833e-07,
+ "loss": 0.9141850471496582,
+ "mean_token_accuracy": 0.7762579321861267,
+ "num_tokens": 23150592.0,
+ "step": 1413
+ },
+ {
+ "entropy": 1.0467151403427124,
+ "epoch": 2.8565656565656568,
+ "grad_norm": 2.4027388095855713,
+ "learning_rate": 9.696969696969698e-07,
+ "loss": 1.0727280378341675,
+ "mean_token_accuracy": 0.7319247722625732,
+ "num_tokens": 23166976.0,
+ "step": 1414
+ },
+ {
+ "entropy": 1.058577299118042,
+ "epoch": 2.8585858585858586,
+ "grad_norm": 2.2488481998443604,
+ "learning_rate": 9.562289562289562e-07,
+ "loss": 1.0526621341705322,
+ "mean_token_accuracy": 0.7397410869598389,
+ "num_tokens": 23183360.0,
+ "step": 1415
+ },
+ {
+ "entropy": 1.078447937965393,
+ "epoch": 2.8606060606060604,
+ "grad_norm": 2.3252272605895996,
+ "learning_rate": 9.427609427609428e-07,
+ "loss": 1.0718753337860107,
+ "mean_token_accuracy": 0.7324743270874023,
+ "num_tokens": 23199744.0,
+ "step": 1416
+ },
+ {
+ "entropy": 1.008683681488037,
+ "epoch": 2.8626262626262626,
+ "grad_norm": 2.1366565227508545,
+ "learning_rate": 9.292929292929294e-07,
+ "loss": 1.0080740451812744,
+ "mean_token_accuracy": 0.7556790709495544,
+ "num_tokens": 23216128.0,
+ "step": 1417
+ },
+ {
+ "entropy": 1.3291339874267578,
+ "epoch": 2.864646464646465,
+ "grad_norm": 2.276232957839966,
+ "learning_rate": 9.158249158249159e-07,
+ "loss": 1.304205060005188,
+ "mean_token_accuracy": 0.6845993995666504,
+ "num_tokens": 23232512.0,
+ "step": 1418
+ },
+ {
+ "entropy": 1.0262223482131958,
+ "epoch": 2.8666666666666667,
+ "grad_norm": 2.078489303588867,
+ "learning_rate": 9.023569023569025e-07,
+ "loss": 1.007215142250061,
+ "mean_token_accuracy": 0.7423668503761292,
+ "num_tokens": 23248896.0,
+ "step": 1419
+ },
+ {
+ "entropy": 1.0474964380264282,
+ "epoch": 2.8686868686868685,
+ "grad_norm": 2.276054620742798,
+ "learning_rate": 8.88888888888889e-07,
+ "loss": 1.047877550125122,
+ "mean_token_accuracy": 0.7332682013511658,
+ "num_tokens": 23265280.0,
+ "step": 1420
+ },
+ {
+ "entropy": 0.8027759194374084,
+ "epoch": 2.8707070707070708,
+ "grad_norm": 2.192600727081299,
+ "learning_rate": 8.754208754208756e-07,
+ "loss": 0.7764748334884644,
+ "mean_token_accuracy": 0.7879213690757751,
+ "num_tokens": 23281664.0,
+ "step": 1421
+ },
+ {
+ "entropy": 0.661788284778595,
+ "epoch": 2.8727272727272726,
+ "grad_norm": 2.0137529373168945,
+ "learning_rate": 8.61952861952862e-07,
+ "loss": 0.6363742351531982,
+ "mean_token_accuracy": 0.8241939544677734,
+ "num_tokens": 23298048.0,
+ "step": 1422
+ },
+ {
+ "entropy": 1.087633728981018,
+ "epoch": 2.874747474747475,
+ "grad_norm": 2.175304651260376,
+ "learning_rate": 8.484848484848486e-07,
+ "loss": 1.0498201847076416,
+ "mean_token_accuracy": 0.7443209290504456,
+ "num_tokens": 23314432.0,
+ "step": 1423
+ },
+ {
+ "entropy": 0.9076523184776306,
+ "epoch": 2.8767676767676766,
+ "grad_norm": 2.026049852371216,
+ "learning_rate": 8.350168350168351e-07,
+ "loss": 0.8883987665176392,
+ "mean_token_accuracy": 0.7653883695602417,
+ "num_tokens": 23330816.0,
+ "step": 1424
+ },
+ {
+ "entropy": 0.8226358294487,
+ "epoch": 2.878787878787879,
+ "grad_norm": 2.2744534015655518,
+ "learning_rate": 8.215488215488217e-07,
+ "loss": 0.812698245048523,
+ "mean_token_accuracy": 0.7820591330528259,
+ "num_tokens": 23347200.0,
+ "step": 1425
+ },
+ {
+ "entropy": 1.0673551559448242,
+ "epoch": 2.8808080808080807,
+ "grad_norm": 2.0791378021240234,
+ "learning_rate": 8.080808080808082e-07,
+ "loss": 1.0502647161483765,
+ "mean_token_accuracy": 0.7533586025238037,
+ "num_tokens": 23363584.0,
+ "step": 1426
+ },
+ {
+ "entropy": 0.9955654144287109,
+ "epoch": 2.882828282828283,
+ "grad_norm": 2.1457395553588867,
+ "learning_rate": 7.946127946127946e-07,
+ "loss": 0.9881689548492432,
+ "mean_token_accuracy": 0.7527479529380798,
+ "num_tokens": 23379968.0,
+ "step": 1427
+ },
+ {
+ "entropy": 1.1520777940750122,
+ "epoch": 2.8848484848484848,
+ "grad_norm": 2.173024892807007,
+ "learning_rate": 7.811447811447812e-07,
+ "loss": 1.156259536743164,
+ "mean_token_accuracy": 0.7158646583557129,
+ "num_tokens": 23396352.0,
+ "step": 1428
+ },
+ {
+ "entropy": 1.0403298139572144,
+ "epoch": 2.886868686868687,
+ "grad_norm": 2.422877311706543,
+ "learning_rate": 7.676767676767677e-07,
+ "loss": 1.0122939348220825,
+ "mean_token_accuracy": 0.7454200983047485,
+ "num_tokens": 23412736.0,
+ "step": 1429
+ },
+ {
+ "entropy": 1.0343279838562012,
+ "epoch": 2.888888888888889,
+ "grad_norm": 2.0776565074920654,
+ "learning_rate": 7.542087542087542e-07,
+ "loss": 1.0315957069396973,
+ "mean_token_accuracy": 0.7367488741874695,
+ "num_tokens": 23429120.0,
+ "step": 1430
+ },
+ {
+ "entropy": 0.8493256568908691,
+ "epoch": 2.8909090909090907,
+ "grad_norm": 2.327897787094116,
+ "learning_rate": 7.407407407407407e-07,
+ "loss": 0.8583534955978394,
+ "mean_token_accuracy": 0.7767464518547058,
+ "num_tokens": 23445504.0,
+ "step": 1431
+ },
+ {
+ "entropy": 1.148512363433838,
+ "epoch": 2.892929292929293,
+ "grad_norm": 2.1868507862091064,
+ "learning_rate": 7.272727272727273e-07,
+ "loss": 1.1311705112457275,
+ "mean_token_accuracy": 0.7248412370681763,
+ "num_tokens": 23461888.0,
+ "step": 1432
+ },
+ {
+ "entropy": 1.1566276550292969,
+ "epoch": 2.894949494949495,
+ "grad_norm": 2.2865636348724365,
+ "learning_rate": 7.138047138047138e-07,
+ "loss": 1.1686909198760986,
+ "mean_token_accuracy": 0.7239863276481628,
+ "num_tokens": 23478272.0,
+ "step": 1433
+ },
+ {
+ "entropy": 1.0386736392974854,
+ "epoch": 2.896969696969697,
+ "grad_norm": 2.052959680557251,
+ "learning_rate": 7.003367003367004e-07,
+ "loss": 1.01320481300354,
+ "mean_token_accuracy": 0.7514655590057373,
+ "num_tokens": 23494656.0,
+ "step": 1434
+ },
+ {
+ "entropy": 1.1572645902633667,
+ "epoch": 2.898989898989899,
+ "grad_norm": 2.215139627456665,
+ "learning_rate": 6.868686868686869e-07,
+ "loss": 1.1418699026107788,
+ "mean_token_accuracy": 0.7198949456214905,
+ "num_tokens": 23511040.0,
+ "step": 1435
+ },
+ {
+ "entropy": 1.1387436389923096,
+ "epoch": 2.901010101010101,
+ "grad_norm": 2.5032405853271484,
+ "learning_rate": 6.734006734006735e-07,
+ "loss": 1.1193574666976929,
+ "mean_token_accuracy": 0.7191011309623718,
+ "num_tokens": 23527424.0,
+ "step": 1436
+ },
+ {
+ "entropy": 0.7306453585624695,
+ "epoch": 2.9030303030303033,
+ "grad_norm": 2.1751644611358643,
+ "learning_rate": 6.5993265993266e-07,
+ "loss": 0.710832417011261,
+ "mean_token_accuracy": 0.810332179069519,
+ "num_tokens": 23543808.0,
+ "step": 1437
+ },
+ {
+ "entropy": 0.751767635345459,
+ "epoch": 2.905050505050505,
+ "grad_norm": 2.215428590774536,
+ "learning_rate": 6.464646464646465e-07,
+ "loss": 0.7304487824440002,
+ "mean_token_accuracy": 0.8015388250350952,
+ "num_tokens": 23560192.0,
+ "step": 1438
+ },
+ {
+ "entropy": 1.0094949007034302,
+ "epoch": 2.907070707070707,
+ "grad_norm": 2.2883613109588623,
+ "learning_rate": 6.32996632996633e-07,
+ "loss": 1.0086544752120972,
+ "mean_token_accuracy": 0.7419394254684448,
+ "num_tokens": 23576576.0,
+ "step": 1439
+ },
+ {
+ "entropy": 0.5964215397834778,
+ "epoch": 2.909090909090909,
+ "grad_norm": 1.9728953838348389,
+ "learning_rate": 6.195286195286196e-07,
+ "loss": 0.5952176451683044,
+ "mean_token_accuracy": 0.8348802924156189,
+ "num_tokens": 23592960.0,
+ "step": 1440
+ },
+ {
+ "entropy": 0.6571753621101379,
+ "epoch": 2.911111111111111,
+ "grad_norm": 1.9908696413040161,
+ "learning_rate": 6.060606060606061e-07,
+ "loss": 0.6432311534881592,
+ "mean_token_accuracy": 0.8191866278648376,
+ "num_tokens": 23609344.0,
+ "step": 1441
+ },
+ {
+ "entropy": 0.6548683047294617,
+ "epoch": 2.9131313131313132,
+ "grad_norm": 2.1132285594940186,
+ "learning_rate": 5.925925925925927e-07,
+ "loss": 0.6500411033630371,
+ "mean_token_accuracy": 0.8267586827278137,
+ "num_tokens": 23625728.0,
+ "step": 1442
+ },
+ {
+ "entropy": 0.6230350732803345,
+ "epoch": 2.915151515151515,
+ "grad_norm": 1.970469355583191,
+ "learning_rate": 5.791245791245792e-07,
+ "loss": 0.6239666938781738,
+ "mean_token_accuracy": 0.8229726552963257,
+ "num_tokens": 23642112.0,
+ "step": 1443
+ },
+ {
+ "entropy": 0.7765372395515442,
+ "epoch": 2.9171717171717173,
+ "grad_norm": 2.221811532974243,
+ "learning_rate": 5.656565656565658e-07,
+ "loss": 0.7877421975135803,
+ "mean_token_accuracy": 0.7888984084129333,
+ "num_tokens": 23658496.0,
+ "step": 1444
+ },
+ {
+ "entropy": 0.7895376682281494,
+ "epoch": 2.919191919191919,
+ "grad_norm": 2.3417742252349854,
+ "learning_rate": 5.521885521885522e-07,
+ "loss": 0.7840774059295654,
+ "mean_token_accuracy": 0.7839521169662476,
+ "num_tokens": 23674880.0,
+ "step": 1445
+ },
+ {
+ "entropy": 0.9695510268211365,
+ "epoch": 2.9212121212121214,
+ "grad_norm": 2.0251240730285645,
+ "learning_rate": 5.387205387205387e-07,
+ "loss": 0.9858237504959106,
+ "mean_token_accuracy": 0.7494503855705261,
+ "num_tokens": 23691264.0,
+ "step": 1446
+ },
+ {
+ "entropy": 1.0403461456298828,
+ "epoch": 2.923232323232323,
+ "grad_norm": 2.1194682121276855,
+ "learning_rate": 5.252525252525253e-07,
+ "loss": 1.0414793491363525,
+ "mean_token_accuracy": 0.7365046143531799,
+ "num_tokens": 23707648.0,
+ "step": 1447
+ },
+ {
+ "entropy": 0.8436279296875,
+ "epoch": 2.9252525252525254,
+ "grad_norm": 2.288971424102783,
+ "learning_rate": 5.117845117845118e-07,
+ "loss": 0.8372863531112671,
+ "mean_token_accuracy": 0.7795554399490356,
+ "num_tokens": 23724032.0,
+ "step": 1448
+ },
+ {
+ "entropy": 1.2964613437652588,
+ "epoch": 2.9272727272727272,
+ "grad_norm": 2.3658535480499268,
+ "learning_rate": 4.983164983164984e-07,
+ "loss": 1.3105628490447998,
+ "mean_token_accuracy": 0.6841108798980713,
+ "num_tokens": 23740416.0,
+ "step": 1449
+ },
+ {
+ "entropy": 0.9370822310447693,
+ "epoch": 2.929292929292929,
+ "grad_norm": 2.259519100189209,
+ "learning_rate": 4.848484848484849e-07,
+ "loss": 0.913622260093689,
+ "mean_token_accuracy": 0.7578774094581604,
+ "num_tokens": 23756800.0,
+ "step": 1450
+ },
+ {
+ "entropy": 0.8995789885520935,
+ "epoch": 2.9313131313131313,
+ "grad_norm": 2.1428349018096924,
+ "learning_rate": 4.713804713804714e-07,
+ "loss": 0.894747257232666,
+ "mean_token_accuracy": 0.7653883695602417,
+ "num_tokens": 23773184.0,
+ "step": 1451
+ },
+ {
+ "entropy": 1.014516830444336,
+ "epoch": 2.9333333333333336,
+ "grad_norm": 2.1029326915740967,
+ "learning_rate": 4.5791245791245795e-07,
+ "loss": 0.9938762187957764,
+ "mean_token_accuracy": 0.751038134098053,
+ "num_tokens": 23789568.0,
+ "step": 1452
+ },
+ {
+ "entropy": 1.4249095916748047,
+ "epoch": 2.9353535353535354,
+ "grad_norm": 2.294334888458252,
+ "learning_rate": 4.444444444444445e-07,
+ "loss": 1.392219066619873,
+ "mean_token_accuracy": 0.663593053817749,
+ "num_tokens": 23805952.0,
+ "step": 1453
+ },
+ {
+ "entropy": 0.9197583794593811,
+ "epoch": 2.937373737373737,
+ "grad_norm": 2.3255887031555176,
+ "learning_rate": 4.30976430976431e-07,
+ "loss": 0.9103667140007019,
+ "mean_token_accuracy": 0.7593429684638977,
+ "num_tokens": 23822336.0,
+ "step": 1454
+ },
+ {
+ "entropy": 1.0247950553894043,
+ "epoch": 2.9393939393939394,
+ "grad_norm": 2.212773323059082,
+ "learning_rate": 4.1750841750841756e-07,
+ "loss": 1.0136611461639404,
+ "mean_token_accuracy": 0.7379091382026672,
+ "num_tokens": 23838720.0,
+ "step": 1455
+ },
+ {
+ "entropy": 0.8738380670547485,
+ "epoch": 2.9414141414141413,
+ "grad_norm": 2.332756280899048,
+ "learning_rate": 4.040404040404041e-07,
+ "loss": 0.8523008823394775,
+ "mean_token_accuracy": 0.7714948654174805,
+ "num_tokens": 23855104.0,
+ "step": 1456
+ },
+ {
+ "entropy": 0.9150345325469971,
+ "epoch": 2.9434343434343435,
+ "grad_norm": 2.202171564102173,
+ "learning_rate": 3.905723905723906e-07,
+ "loss": 0.9201558828353882,
+ "mean_token_accuracy": 0.7680752277374268,
+ "num_tokens": 23871488.0,
+ "step": 1457
+ },
+ {
+ "entropy": 0.9043408036231995,
+ "epoch": 2.9454545454545453,
+ "grad_norm": 2.40272855758667,
+ "learning_rate": 3.771043771043771e-07,
+ "loss": 0.868109941482544,
+ "mean_token_accuracy": 0.77167809009552,
+ "num_tokens": 23887872.0,
+ "step": 1458
+ },
+ {
+ "entropy": 0.8504953980445862,
+ "epoch": 2.9474747474747476,
+ "grad_norm": 2.1198537349700928,
+ "learning_rate": 3.6363636363636366e-07,
+ "loss": 0.8543665409088135,
+ "mean_token_accuracy": 0.7743649482727051,
+ "num_tokens": 23904256.0,
+ "step": 1459
+ },
+ {
+ "entropy": 1.1891556978225708,
+ "epoch": 2.9494949494949494,
+ "grad_norm": 2.2647321224212646,
+ "learning_rate": 3.501683501683502e-07,
+ "loss": 1.2097854614257812,
+ "mean_token_accuracy": 0.7138495445251465,
+ "num_tokens": 23920640.0,
+ "step": 1460
+ },
+ {
+ "entropy": 0.9867375493049622,
+ "epoch": 2.9515151515151516,
+ "grad_norm": 2.232421636581421,
+ "learning_rate": 3.3670033670033673e-07,
+ "loss": 0.979575514793396,
+ "mean_token_accuracy": 0.7459086179733276,
+ "num_tokens": 23937024.0,
+ "step": 1461
+ },
+ {
+ "entropy": 0.9686830639839172,
+ "epoch": 2.9535353535353535,
+ "grad_norm": 2.1404521465301514,
+ "learning_rate": 3.2323232323232327e-07,
+ "loss": 0.967602550983429,
+ "mean_token_accuracy": 0.7539692521095276,
+ "num_tokens": 23953408.0,
+ "step": 1462
+ },
+ {
+ "entropy": 0.7671990990638733,
+ "epoch": 2.9555555555555557,
+ "grad_norm": 2.133831262588501,
+ "learning_rate": 3.097643097643098e-07,
+ "loss": 0.7617117166519165,
+ "mean_token_accuracy": 0.8006228804588318,
+ "num_tokens": 23969792.0,
+ "step": 1463
+ },
+ {
+ "entropy": 1.2517712116241455,
+ "epoch": 2.9575757575757575,
+ "grad_norm": 8.452461242675781,
+ "learning_rate": 2.9629629629629634e-07,
+ "loss": 1.4012014865875244,
+ "mean_token_accuracy": 0.6907058954238892,
+ "num_tokens": 23986176.0,
+ "step": 1464
+ },
+ {
+ "entropy": 0.9953964948654175,
+ "epoch": 2.9595959595959593,
+ "grad_norm": 2.425787925720215,
+ "learning_rate": 2.828282828282829e-07,
+ "loss": 0.9884676933288574,
+ "mean_token_accuracy": 0.7476184368133545,
+ "num_tokens": 24002560.0,
+ "step": 1465
+ },
+ {
+ "entropy": 1.3182833194732666,
+ "epoch": 2.9616161616161616,
+ "grad_norm": 2.174762725830078,
+ "learning_rate": 2.6936026936026936e-07,
+ "loss": 1.3243706226348877,
+ "mean_token_accuracy": 0.6910722851753235,
+ "num_tokens": 24018944.0,
+ "step": 1466
+ },
+ {
+ "entropy": 0.8355759978294373,
+ "epoch": 2.963636363636364,
+ "grad_norm": 2.1497325897216797,
+ "learning_rate": 2.558922558922559e-07,
+ "loss": 0.8269426822662354,
+ "mean_token_accuracy": 0.7804714441299438,
+ "num_tokens": 24035328.0,
+ "step": 1467
+ },
+ {
+ "entropy": 1.119064450263977,
+ "epoch": 2.9656565656565657,
+ "grad_norm": 2.4803388118743896,
+ "learning_rate": 2.4242424242424244e-07,
+ "loss": 1.1198925971984863,
+ "mean_token_accuracy": 0.7159257531166077,
+ "num_tokens": 24051712.0,
+ "step": 1468
+ },
+ {
+ "entropy": 0.8541463017463684,
+ "epoch": 2.9676767676767675,
+ "grad_norm": 2.0393052101135254,
+ "learning_rate": 2.2895622895622898e-07,
+ "loss": 0.8403464555740356,
+ "mean_token_accuracy": 0.7884098887443542,
+ "num_tokens": 24068096.0,
+ "step": 1469
+ },
+ {
+ "entropy": 0.49429821968078613,
+ "epoch": 2.9696969696969697,
+ "grad_norm": 1.9169429540634155,
+ "learning_rate": 2.154882154882155e-07,
+ "loss": 0.4926488995552063,
+ "mean_token_accuracy": 0.8597337603569031,
+ "num_tokens": 24084480.0,
+ "step": 1470
+ },
+ {
+ "entropy": 1.157039999961853,
+ "epoch": 2.971717171717172,
+ "grad_norm": 2.274075508117676,
+ "learning_rate": 2.0202020202020205e-07,
+ "loss": 1.1713600158691406,
+ "mean_token_accuracy": 0.7217879891395569,
+ "num_tokens": 24100864.0,
+ "step": 1471
+ },
+ {
+ "entropy": 1.3693535327911377,
+ "epoch": 2.973737373737374,
+ "grad_norm": 2.233780860900879,
+ "learning_rate": 1.8855218855218856e-07,
+ "loss": 1.3571951389312744,
+ "mean_token_accuracy": 0.6933317184448242,
+ "num_tokens": 24117248.0,
+ "step": 1472
+ },
+ {
+ "entropy": 1.060738444328308,
+ "epoch": 2.9757575757575756,
+ "grad_norm": 2.376091480255127,
+ "learning_rate": 1.750841750841751e-07,
+ "loss": 1.0911407470703125,
+ "mean_token_accuracy": 0.7194064259529114,
+ "num_tokens": 24133632.0,
+ "step": 1473
+ },
+ {
+ "entropy": 1.0141303539276123,
+ "epoch": 2.977777777777778,
+ "grad_norm": 2.206777811050415,
+ "learning_rate": 1.6161616161616163e-07,
+ "loss": 1.0147366523742676,
+ "mean_token_accuracy": 0.7421225905418396,
+ "num_tokens": 24150016.0,
+ "step": 1474
+ },
+ {
+ "entropy": 1.094582438468933,
+ "epoch": 2.9797979797979797,
+ "grad_norm": 2.13834810256958,
+ "learning_rate": 1.4814814814814817e-07,
+ "loss": 1.0652586221694946,
+ "mean_token_accuracy": 0.7409012913703918,
+ "num_tokens": 24166400.0,
+ "step": 1475
+ },
+ {
+ "entropy": 0.9652472138404846,
+ "epoch": 2.981818181818182,
+ "grad_norm": 2.1181185245513916,
+ "learning_rate": 1.3468013468013468e-07,
+ "loss": 0.9842501282691956,
+ "mean_token_accuracy": 0.7498167753219604,
+ "num_tokens": 24182784.0,
+ "step": 1476
+ },
+ {
+ "entropy": 0.9012734293937683,
+ "epoch": 2.9838383838383837,
+ "grad_norm": 2.388531446456909,
+ "learning_rate": 1.2121212121212122e-07,
+ "loss": 0.9103577136993408,
+ "mean_token_accuracy": 0.7572667598724365,
+ "num_tokens": 24199168.0,
+ "step": 1477
+ },
+ {
+ "entropy": 1.0186536312103271,
+ "epoch": 2.985858585858586,
+ "grad_norm": 2.272202730178833,
+ "learning_rate": 1.0774410774410776e-07,
+ "loss": 0.9883908629417419,
+ "mean_token_accuracy": 0.7520151734352112,
+ "num_tokens": 24215552.0,
+ "step": 1478
+ },
+ {
+ "entropy": 1.0810787677764893,
+ "epoch": 2.987878787878788,
+ "grad_norm": 2.195042848587036,
+ "learning_rate": 9.427609427609428e-08,
+ "loss": 1.0988293886184692,
+ "mean_token_accuracy": 0.7214215993881226,
+ "num_tokens": 24231936.0,
+ "step": 1479
+ },
+ {
+ "entropy": 0.8350635170936584,
+ "epoch": 2.98989898989899,
+ "grad_norm": 1.9644523859024048,
+ "learning_rate": 8.080808080808082e-08,
+ "loss": 0.8452527523040771,
+ "mean_token_accuracy": 0.7926233410835266,
+ "num_tokens": 24248320.0,
+ "step": 1480
+ },
+ {
+ "entropy": 0.8076480627059937,
+ "epoch": 2.991919191919192,
+ "grad_norm": 2.1587746143341064,
+ "learning_rate": 6.734006734006734e-08,
+ "loss": 0.8024610280990601,
+ "mean_token_accuracy": 0.7873107194900513,
+ "num_tokens": 24264704.0,
+ "step": 1481
+ },
+ {
+ "entropy": 0.8234610557556152,
+ "epoch": 2.993939393939394,
+ "grad_norm": 2.1396384239196777,
+ "learning_rate": 5.387205387205388e-08,
+ "loss": 0.8239790201187134,
+ "mean_token_accuracy": 0.7902418375015259,
+ "num_tokens": 24281088.0,
+ "step": 1482
+ },
+ {
+ "entropy": 1.0003139972686768,
+ "epoch": 2.995959595959596,
+ "grad_norm": 2.406714677810669,
+ "learning_rate": 4.040404040404041e-08,
+ "loss": 0.9654958844184875,
+ "mean_token_accuracy": 0.7531143426895142,
+ "num_tokens": 24297472.0,
+ "step": 1483
+ },
+ {
+ "entropy": 1.1883150339126587,
+ "epoch": 2.9979797979797977,
+ "grad_norm": 2.3837242126464844,
+ "learning_rate": 2.693602693602694e-08,
+ "loss": 1.2012369632720947,
+ "mean_token_accuracy": 0.7122007608413696,
+ "num_tokens": 24313856.0,
+ "step": 1484
+ },
+ {
+ "entropy": 1.122470498085022,
+ "epoch": 3.0,
+ "grad_norm": 2.012483596801758,
+ "learning_rate": 1.346801346801347e-08,
+ "loss": 1.1389365196228027,
+ "mean_token_accuracy": 0.7195896506309509,
+ "num_tokens": 24330240.0,
+ "step": 1485
+ },
+ {
+ "epoch": 3.0,
+ "eval_entropy": 1.132785740879274,
+ "eval_loss": 1.6079809665679932,
+ "eval_mean_token_accuracy": 0.6431884972318527,
+ "eval_num_tokens": 24330240.0,
+ "eval_runtime": 43.8459,
+ "eval_samples_per_second": 22.579,
+ "eval_steps_per_second": 2.828,
+ "step": 1485
+ }
+ ],
+ "logging_steps": 1,
+ "max_steps": 1485,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 3,
+ "save_steps": 500,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": true
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.0574770835750912e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/training_args.bin b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/training_args.bin
new file mode 100644
index 0000000000000000000000000000000000000000..98c558883023185245bfac817f2ca585caa9d94f
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/training_args.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:2c573bdac95c796f8f7368ab9af6d35c5687f53373737ea965b8102d518df7cb
+size 7121
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/zero_to_fp32.py b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/zero_to_fp32.py
new file mode 100644
index 0000000000000000000000000000000000000000..3970548c400fd4361bd923b763db90e963ddaf8c
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/zero_to_fp32.py
@@ -0,0 +1,854 @@
+#!/usr/bin/env python
+
+# Copyright (c) Microsoft Corporation.
+# SPDX-License-Identifier: Apache-2.0
+
+# DeepSpeed Team
+
+# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets
+# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in
+# the future. Once extracted, the weights don't require DeepSpeed and can be used in any
+# application.
+#
+# example:
+# python zero_to_fp32.py . output_dir/
+# or
+# python zero_to_fp32.py . output_dir/ --safe_serialization
+
+import argparse
+import torch
+import glob
+import math
+import os
+import re
+import gc
+import json
+import numpy as np
+from tqdm import tqdm
+from collections import OrderedDict
+from dataclasses import dataclass
+
+# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with
+# DeepSpeed data structures it has to be available in the current python environment.
+from deepspeed.utils import logger
+from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS,
+ FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES,
+ FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS, AUTOEP_LAYERS_KEY,
+ AUTOEP_LAYERS_KEY_LEGACY, AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY,
+ AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT, PARAM_ALIGNMENT_PADDINGS)
+
+
+@dataclass
+class zero_model_state:
+ buffers: dict()
+ param_shapes: dict()
+ shared_params: list
+ ds_version: int
+ frozen_param_shapes: dict()
+ frozen_param_fragments: dict()
+
+
+debug = 0
+
+# load to cpu
+device = torch.device('cpu')
+
+OUTPUT_DTYPE_NAMES = {
+ 'float32': torch.float32,
+ 'fp32': torch.float32,
+ 'float16': torch.float16,
+ 'fp16': torch.float16,
+ 'bfloat16': torch.bfloat16,
+ 'bf16': torch.bfloat16,
+}
+
+
+def _resolve_output_dtype(dtype):
+ requested_dtype = dtype
+ if isinstance(dtype, str):
+ dtype_name = dtype[6:] if dtype.startswith('torch.') else dtype
+ dtype = OUTPUT_DTYPE_NAMES.get(dtype_name.lower())
+ if dtype not in set(OUTPUT_DTYPE_NAMES.values()):
+ supported = ', '.join(sorted(OUTPUT_DTYPE_NAMES))
+ raise ValueError(f"Unsupported output dtype {requested_dtype!r}. Choose one of: {supported}")
+ return dtype
+
+
+def atoi(text):
+ return int(text) if text.isdigit() else text
+
+
+def natural_keys(text):
+ '''
+ alist.sort(key=natural_keys) sorts in human order
+ http://nedbatchelder.com/blog/200712/human_sorting.html
+ (See Toothy's implementation in the comments)
+ '''
+ return [atoi(c) for c in re.split(r'(\d+)', text)]
+
+
+def get_model_state_file(checkpoint_dir, zero_stage):
+ if not os.path.isdir(checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist")
+
+ # there should be only one file
+ if zero_stage <= 2:
+ file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt")
+ elif zero_stage == 3:
+ file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt")
+
+ if not os.path.exists(file):
+ raise FileNotFoundError(f"can't find model states file at '{file}'")
+
+ return file
+
+
+def get_checkpoint_files(checkpoint_dir, glob_pattern):
+ # XXX: need to test that this simple glob rule works for multi-node setup too
+ ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys)
+
+ if len(ckpt_files) == 0:
+ raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'")
+
+ return ckpt_files
+
+
+def get_optim_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt")
+
+
+def get_model_state_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_model_states.pt")
+
+
+def _has_autoep_zero3_partitioned_metadata(state_dict):
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY)
+ if autoep_layers is None:
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY_LEGACY)
+ if not isinstance(autoep_layers, list):
+ return False
+ return any(
+ isinstance(entry, dict)
+ and entry.get(AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY) == AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT
+ for entry in autoep_layers)
+
+
+def _raise_if_autoep_zero3_partitioned_state(state_dict):
+ if _has_autoep_zero3_partitioned_metadata(state_dict):
+ raise NotImplementedError("zero_to_fp32 does not support AutoEP ZeRO-3 partition-native checkpoints. "
+ "AutoEP expert parameters are partitioned over expert replica groups, so "
+ "global data-parallel consolidation would produce incomplete expert tensors. "
+ "Use ds_to_universal.py for expert-aware conversion.")
+
+
+def _raise_if_autoep_zero3_partitioned_checkpoint(model_files):
+ for file in model_files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+
+def parse_model_states(files):
+ zero_model_states = []
+ for file in files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+ if BUFFER_NAMES not in state_dict:
+ raise ValueError(f"{file} is not a model state checkpoint")
+ buffer_names = state_dict[BUFFER_NAMES]
+ if debug:
+ print("Found buffers:", buffer_names)
+
+ # recover just the buffers while restoring them to fp32 if they were saved in fp16
+ buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names}
+ param_shapes = state_dict[PARAM_SHAPES]
+
+ # collect parameters that are included in param_shapes
+ param_names = []
+ for s in param_shapes:
+ for name in s.keys():
+ param_names.append(name)
+
+ # update with frozen parameters
+ frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None)
+ if frozen_param_shapes is not None:
+ if debug:
+ print(f"Found frozen_param_shapes: {frozen_param_shapes}")
+ param_names += list(frozen_param_shapes.keys())
+
+ # handle shared params
+ shared_params = [[k, v] for k, v in state_dict["shared_params"].items()]
+
+ ds_version = state_dict.get(DS_VERSION, None)
+
+ frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None)
+
+ z_model_state = zero_model_state(buffers=buffers,
+ param_shapes=param_shapes,
+ shared_params=shared_params,
+ ds_version=ds_version,
+ frozen_param_shapes=frozen_param_shapes,
+ frozen_param_fragments=frozen_param_fragments)
+ zero_model_states.append(z_model_state)
+
+ return zero_model_states
+
+
+def parse_optim_states(files, ds_checkpoint_dir):
+ total_files = len(files)
+ state_dicts = []
+ for f in tqdm(files, desc='Loading checkpoint shards'):
+ state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False)
+ # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights
+ # and also handle the case where it was already removed by another helper script
+ state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None)
+ state_dicts.append(state_dict)
+
+ if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]:
+ raise ValueError(f"{files[0]} is not a zero checkpoint")
+ zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE]
+ world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT]
+
+ # For ZeRO-2 each param group can have different partition_count as data parallelism for expert
+ # parameters can be different from data parallelism for non-expert parameters. So we can just
+ # use the max of the partition_count to get the dp world_size.
+
+ if type(world_size) is list:
+ world_size = max(world_size)
+
+ if world_size != total_files:
+ raise ValueError(
+ f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. "
+ "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes."
+ )
+
+ # the groups are named differently in each stage
+ if zero_stage <= 2:
+ fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS
+ elif zero_stage == 3:
+ fp32_groups_key = FP32_FLAT_GROUPS
+ else:
+ raise ValueError(f"unknown zero stage {zero_stage}")
+
+ fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))]
+ param_alignment_paddings = state_dicts[0][OPTIMIZER_STATE_DICT].get(PARAM_ALIGNMENT_PADDINGS)
+ return zero_stage, world_size, fp32_flat_groups, param_alignment_paddings
+
+
+def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters):
+ """
+ Returns fp32 state_dict reconstructed from ds checkpoint
+
+ Args:
+ - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are)
+
+ """
+ print(f"Processing zero checkpoint '{ds_checkpoint_dir}'")
+
+ # parse_model_states rejects AutoEP ZeRO-3 partition-native checkpoints
+ # before the expensive optimizer-shard load below.
+ model_files = get_model_state_files(ds_checkpoint_dir)
+ zero_model_states = parse_model_states(model_files)
+ print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}')
+
+ optim_files = get_optim_files(ds_checkpoint_dir)
+ zero_stage, world_size, fp32_flat_groups, param_alignment_paddings = parse_optim_states(
+ optim_files, ds_checkpoint_dir)
+ print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}")
+
+ if zero_stage <= 2:
+ return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters, param_alignment_paddings)
+ elif zero_stage == 3:
+ return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters)
+
+
+def _zero2_merge_frozen_params(state_dict, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ frozen_param_fragments = zero_model_states[0].frozen_param_fragments
+
+ if debug:
+ num_elem = sum(s.numel() for s in frozen_param_shapes.values())
+ print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in frozen_param_fragments.values()])
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ state_dict[name] = frozen_param_fragments[name]
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _has_callable(obj, fn):
+ attr = getattr(obj, fn, None)
+ return callable(attr)
+
+
+def _zero2_merge_trainable_params(state_dict,
+ world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ param_alignment_paddings=None):
+ param_shapes = zero_model_states[0].param_shapes
+
+ # Reconstruction protocol:
+ #
+ # XXX: document this
+
+ if debug:
+ for i in range(world_size):
+ for j in range(len(fp32_flat_groups[0])):
+ print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}")
+
+ # XXX: memory usage doubles here (zero2)
+ num_param_groups = len(fp32_flat_groups[0])
+ merged_single_partition_of_fp32_groups = []
+ for i in range(num_param_groups):
+ merged_partitions = [sd[i] for sd in fp32_flat_groups]
+ full_single_fp32_vector = torch.cat(merged_partitions, 0)
+ merged_single_partition_of_fp32_groups.append(full_single_fp32_vector)
+ avail_numel = sum(
+ [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups])
+
+ if debug:
+ wanted_params = sum([len(shapes) for shapes in param_shapes])
+ wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes])
+ # not asserting if there is a mismatch due to possible padding
+ print(f"Have {avail_numel} numels to process.")
+ print(f"Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ total_numel = 0
+ total_params = 0
+ for group_idx, (shapes,
+ full_single_fp32_vector) in enumerate(zip(param_shapes, merged_single_partition_of_fp32_groups)):
+ offset = 0
+ avail_numel = full_single_fp32_vector.numel()
+ group_alignment_paddings = None
+ if param_alignment_paddings is not None:
+ group_alignment_paddings = param_alignment_paddings[group_idx]
+ if len(group_alignment_paddings) != len(shapes):
+ raise ValueError(f"Expected {len(shapes)} parameter alignment paddings for group {group_idx}, "
+ f"but found {len(group_alignment_paddings)}")
+
+ for param_idx, (name, shape) in enumerate(shapes.items()):
+
+ unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape)
+ total_numel += unpartitioned_numel
+ total_params += 1
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+ state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape)
+ offset += unpartitioned_numel
+ if group_alignment_paddings is not None:
+ offset += group_alignment_paddings[param_idx]
+
+ # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and
+ # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex
+ # paddings performed in the code it's almost impossible to predict the exact numbers w/o the
+ # live optimizer object, so we are checking that the numbers are within the right range
+ align_to = 2 * world_size
+
+ def zero2_align(x):
+ return align_to * math.ceil(x / align_to)
+
+ if debug:
+ print(f"original offset={offset}, avail_numel={avail_numel}")
+
+ offset = zero2_align(offset)
+ avail_numel = zero2_align(avail_numel)
+
+ if debug:
+ print(f"aligned offset={offset}, avail_numel={avail_numel}")
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero2_checkpoint(world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ exclude_frozen_parameters,
+ param_alignment_paddings=None):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero2_merge_frozen_params(state_dict, zero_model_states)
+
+ _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states,
+ param_alignment_paddings)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def zero3_partitioned_param_info(unpartitioned_numel, world_size):
+ remainder = unpartitioned_numel % world_size
+ padding_numel = (world_size - remainder) if remainder else 0
+ partitioned_numel = math.ceil(unpartitioned_numel / world_size)
+ return partitioned_numel, padding_numel
+
+
+def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ if debug:
+ for i in range(world_size):
+ num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values())
+ print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in zero_model_states[0].frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states)
+ state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape)
+
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+class GatheredTensor:
+ """
+ A pseudo tensor that collects partitioned weights.
+ It is more memory efficient when there are multiple groups.
+ """
+
+ def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape):
+ self.flat_groups = flat_groups
+ self.flat_groups_offset = flat_groups_offset
+ self.offset = offset
+ self.partitioned_numel = partitioned_numel
+ self.shape = shape
+ self.dtype = self.flat_groups[0][0].dtype
+
+ def contiguous(self):
+ """
+ Merge partitioned weights from flat_groups into a single tensor.
+ """
+ end_idx = self.offset + self.partitioned_numel
+ world_size = len(self.flat_groups)
+ pad_flat_param_chunks = []
+
+ for rank_i in range(world_size):
+ # for each rank, we need to collect weights from related group/groups
+ flat_groups_at_rank_i = self.flat_groups[rank_i]
+ start_group_id = None
+ end_group_id = None
+ for group_id in range(len(self.flat_groups_offset)):
+ if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]:
+ start_group_id = group_id
+ if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]:
+ end_group_id = group_id
+ break
+ # collect weights from related group/groups
+ for group_id in range(start_group_id, end_group_id + 1):
+ flat_tensor = flat_groups_at_rank_i[group_id]
+ start_offset = self.offset - self.flat_groups_offset[group_id]
+ end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id]
+ pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset])
+
+ # collect weights from all ranks
+ pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0)
+ param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous()
+ return param
+
+
+def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states):
+ param_shapes = zero_model_states[0].param_shapes
+ avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size
+
+ # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each
+ # param, re-consolidating each param, while dealing with padding if any
+
+ # merge list of dicts, preserving order
+ param_shapes = {k: v for d in param_shapes for k, v in d.items()}
+
+ if debug:
+ for i in range(world_size):
+ print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}")
+
+ wanted_params = len(param_shapes)
+ wanted_numel = sum(shape.numel() for shape in param_shapes.values())
+ # not asserting if there is a mismatch due to possible padding
+ avail_numel = fp32_flat_groups[0].numel() * world_size
+ print(f"Trainable params: Have {avail_numel} numels to process.")
+ print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ offset = 0
+ total_numel = 0
+ total_params = 0
+ flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]]))
+ for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'):
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+ total_params += 1
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ # memory efficient tensor
+ tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape)
+ state_dict[name] = tensor
+ offset += partitioned_numel
+
+ offset *= world_size
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero3_merge_frozen_params(state_dict, world_size, zero_model_states)
+
+ _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def to_torch_tensor(state_dict, return_empty_tensor=False, dtype=None):
+ """
+ Convert state_dict of GatheredTensor to torch tensor
+ """
+ if dtype is not None:
+ dtype = _resolve_output_dtype(dtype)
+
+ torch_state_dict = {}
+ converted_tensors = {}
+ for name, tensor in state_dict.items():
+ tensor_id = id(tensor)
+ if tensor_id in converted_tensors: # shared tensors
+ shared_tensor = torch_state_dict[converted_tensors[tensor_id]]
+ torch_state_dict[name] = shared_tensor
+ else:
+ converted_tensors[tensor_id] = name
+ if return_empty_tensor:
+ torch_state_dict[name] = torch.empty(tensor.shape, dtype=dtype or tensor.dtype)
+ else:
+ contiguous_tensor = tensor.contiguous()
+ torch_state_dict[name] = contiguous_tensor.to(dtype=dtype) if dtype else contiguous_tensor
+ return torch_state_dict
+
+
+def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag=None,
+ exclude_frozen_parameters=False,
+ lazy_mode=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with
+ ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example
+ via a model hub.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient.
+ Convert the pesduo tensor to torch tensor by ``.contiguous()``
+
+ Returns:
+ - pytorch ``state_dict``
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ # do the training and checkpoint saving
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu
+ model = model.cpu() # move to cpu
+ model.load_state_dict(state_dict)
+ # submit to model hub or save the model to share with others
+
+ In this example the ``model`` will no longer be usable in the deepspeed context of the same
+ application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead.
+
+ Note: the above usage may not work if your application doesn't have sufficient free CPU memory.
+ You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with
+ the checkpoint. Or you can load state_dict in lazy mode ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu
+ for name, lazy_tensor in state_dict.item():
+ tensor = lazy_tensor.contiguous() # to cpu
+ print(name, tensor)
+ # del tensor to release memory if it no longer in use
+ """
+ if tag is None:
+ latest_path = os.path.join(checkpoint_dir, 'latest')
+ if os.path.isfile(latest_path):
+ with open(latest_path, 'r') as fd:
+ tag = fd.read().strip()
+ else:
+ raise ValueError(f"Unable to find 'latest' file at {latest_path}")
+
+ ds_checkpoint_dir = os.path.join(checkpoint_dir, tag)
+
+ if not os.path.isdir(ds_checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist")
+
+ state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters)
+ if lazy_mode:
+ return state_dict
+ else:
+ return to_torch_tensor(state_dict)
+
+
+def convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a consolidated ``state_dict`` file that can be
+ loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``output_dir``: directory for the PyTorch state_dict output files
+ - ``dtype``: output tensor dtype. Supports float32, float16, and bfloat16 as strings or torch dtypes.
+ - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB
+ - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ """
+
+ dtype = _resolve_output_dtype(dtype)
+
+ # Dependency pre-check
+ if safe_serialization:
+ try:
+ from safetensors.torch import save_file
+ except ImportError:
+ print('If you want to use `safe_serialization`, please `pip install safetensors`')
+ raise
+ if max_shard_size is not None:
+ try:
+ from huggingface_hub import split_torch_state_dict_into_shards
+ except ImportError:
+ print('If you want to use `max_shard_size`, please `pip install huggingface_hub`')
+ raise
+
+ # Convert zero checkpoint to state_dict
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag,
+ exclude_frozen_parameters,
+ lazy_mode=True)
+
+ # Shard the model if it is too big.
+ weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin"
+ if max_shard_size is not None:
+ filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors")
+ # an memory-efficient approach for sharding
+ empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True, dtype=dtype)
+ state_dict_split = split_torch_state_dict_into_shards(empty_state_dict,
+ filename_pattern=filename_pattern,
+ max_shard_size=max_shard_size)
+ else:
+ from collections import namedtuple
+ StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"])
+ state_dict_split = StateDictSplit(is_sharded=False,
+ filename_to_tensors={weights_name: list(state_dict.keys())})
+
+ # Save the model by shard
+ os.makedirs(output_dir, exist_ok=True)
+ filename_to_tensors = state_dict_split.filename_to_tensors.items()
+ for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"):
+ shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors}
+ shard_state_dict = to_torch_tensor(shard_state_dict, dtype=dtype)
+ output_path = os.path.join(output_dir, shard_file)
+ if safe_serialization:
+ save_file(shard_state_dict, output_path, metadata={"format": "pt"})
+ else:
+ torch.save(shard_state_dict, output_path)
+ # release the memory of current shard
+ for tensor_name in list(shard_state_dict.keys()):
+ del state_dict[tensor_name]
+ del shard_state_dict[tensor_name]
+ del shard_state_dict
+ gc.collect()
+
+ # Save index if sharded
+ if state_dict_split.is_sharded:
+ index = {
+ "metadata": state_dict_split.metadata,
+ "weight_map": state_dict_split.tensor_to_filename,
+ }
+ save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json"
+ save_index_file = os.path.join(output_dir, save_index_file)
+ with open(save_index_file, "w", encoding="utf-8") as f:
+ content = json.dumps(index, indent=2, sort_keys=True) + "\n"
+ f.write(content)
+
+
+def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir,
+ output_dir,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """Backward-compatible fp32 checkpoint conversion."""
+ return convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size=max_shard_size,
+ safe_serialization=safe_serialization,
+ tag=tag,
+ exclude_frozen_parameters=exclude_frozen_parameters)
+
+
+def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None):
+ """
+ 1. Put the provided model to cpu
+ 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict``
+ 3. Load it into the provided model
+
+ Args:
+ - ``model``: the model object to update
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+
+ Returns:
+ - ``model`: modified model
+
+ Make sure you have plenty of CPU memory available before you call this function. If you don't
+ have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it
+ conveniently placed for you in the checkpoint folder.
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint
+ model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir)
+ # submit to model hub or save the model to share with others
+
+ Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context
+ of the same application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ """
+ logger.info("Extracting fp32 weights")
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag)
+
+ logger.info("Overwriting model with fp32 weights")
+ model = model.cpu()
+ model.load_state_dict(state_dict, strict=False)
+
+ return model
+
+
+if __name__ == "__main__":
+ parser = argparse.ArgumentParser()
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir",
+ type=str,
+ help="directory to the pytorch fp32 state_dict output files"
+ "(e.g. path/checkpoint-12-output/)")
+ parser.add_argument(
+ "--max_shard_size",
+ type=str,
+ default="5GB",
+ help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size"
+ "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`"
+ "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances"
+ "without CPU OOM issues.")
+ parser.add_argument(
+ "--safe_serialization",
+ default=False,
+ action='store_true',
+ help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug")
+ args = parser.parse_args()
+
+ debug = args.debug
+
+ convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir,
+ args.output_dir,
+ max_shard_size=args.max_shard_size,
+ safe_serialization=args.safe_serialization,
+ tag=args.tag,
+ exclude_frozen_parameters=args.exclude_frozen_parameters)
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-1485/zero_to_torch.py b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/zero_to_torch.py
new file mode 100644
index 0000000000000000000000000000000000000000..81312e252400d77f03cc1a88522f8f18ebe70ee7
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-1485/zero_to_torch.py
@@ -0,0 +1,54 @@
+#!/usr/bin/env python
+
+# SPDX-License-Identifier: Apache-2.0
+# DeepSpeed Team
+
+import argparse
+
+if __package__:
+ from . import zero_to_fp32
+else:
+ import zero_to_fp32
+
+
+def main(args=None):
+ parser = argparse.ArgumentParser(
+ description="Convert a DeepSpeed ZeRO checkpoint to float32, float16, or bfloat16 PyTorch weights.")
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir", type=str, help="directory for the converted PyTorch state_dict files")
+ parser.add_argument("--dtype",
+ type=str,
+ choices=sorted(zero_to_fp32.OUTPUT_DTYPE_NAMES),
+ required=True,
+ help="output tensor dtype")
+ parser.add_argument("--max_shard_size",
+ type=str,
+ default="5GB",
+ help="maximum size of each checkpoint shard, such as 5GB or 500MB")
+ parser.add_argument("--safe_serialization",
+ default=False,
+ action='store_true',
+ help="save with safetensors instead of PyTorch pickle serialization")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier, e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug output")
+ parsed_args = parser.parse_args(args)
+
+ zero_to_fp32.debug = parsed_args.debug
+ zero_to_fp32.convert_zero_checkpoint_to_state_dict(parsed_args.checkpoint_dir,
+ parsed_args.output_dir,
+ dtype=parsed_args.dtype,
+ max_shard_size=parsed_args.max_shard_size,
+ safe_serialization=parsed_args.safe_serialization,
+ tag=parsed_args.tag,
+ exclude_frozen_parameters=parsed_args.exclude_frozen_parameters)
+
+
+if __name__ == "__main__":
+ main()
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/chat_template.jinja b/qwen3-1.7b-teutonic-2e5/checkpoint-500/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..01be9b307daa2d425f7c168c9fb145a286e0afb4
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/chat_template.jinja
@@ -0,0 +1,89 @@
+{%- if tools %}
+ {{- '<|im_start|>system\n' }}
+ {%- if messages[0].role == 'system' %}
+ {{- messages[0].content + '\n\n' }}
+ {%- endif %}
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+{%- endfor %}
+{%- for message in messages %}
+ {%- if message.content is string %}
+ {%- set content = message.content %}
+ {%- else %}
+ {%- set content = '' %}
+ {%- endif %}
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {%- if loop.last or (not loop.last and reasoning_content) %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if (loop.first and content) or (not loop.first) %}
+ {{- '\n' }}
+ {%- endif %}
+ {%- if tool_call.function %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {{- '\n{"name": "' }}
+ {{- tool_call.name }}
+ {{- '", "arguments": ' }}
+ {%- if tool_call.arguments is string %}
+ {{- tool_call.arguments }}
+ {%- else %}
+ {{- tool_call.arguments | tojson }}
+ {%- endif %}
+ {{- '}\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/config.json b/qwen3-1.7b-teutonic-2e5/checkpoint-500/config.json
new file mode 100644
index 0000000000000000000000000000000000000000..5d9cef07396baadff5390e4508eb33025967a029
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/config.json
@@ -0,0 +1,63 @@
+{
+ "architectures": [
+ "Qwen3ForCausalLM"
+ ],
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "bos_token_id": null,
+ "dtype": "bfloat16",
+ "eos_token_id": 151645,
+ "head_dim": 128,
+ "hidden_act": "silu",
+ "hidden_size": 2048,
+ "initializer_range": 0.02,
+ "intermediate_size": 6144,
+ "layer_types": [
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 40960,
+ "max_window_layers": 28,
+ "model_type": "qwen3",
+ "num_attention_heads": 16,
+ "num_hidden_layers": 28,
+ "num_key_value_heads": 8,
+ "pad_token_id": 151643,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 1000000,
+ "rope_type": "default"
+ },
+ "sliding_window": null,
+ "tie_word_embeddings": true,
+ "transformers_version": "5.17.0",
+ "use_cache": false,
+ "use_sliding_window": false,
+ "vocab_size": 151936
+}
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/generation_config.json b/qwen3-1.7b-teutonic-2e5/checkpoint-500/generation_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..e6941fe4b04f26113d6eef6255d005c4d7090bda
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/generation_config.json
@@ -0,0 +1,12 @@
+{
+ "do_sample": true,
+ "eos_token_id": [
+ 151645,
+ 151643
+ ],
+ "pad_token_id": 151643,
+ "temperature": 0.6,
+ "top_k": 20,
+ "top_p": 0.95,
+ "transformers_version": "5.17.0"
+}
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/global_step500/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-2e5/checkpoint-500/global_step500/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..81580ef63b233cd2e8c6659d7354b75fa7253257
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/global_step500/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:729d5481732775300f3678e55abd25181ac14249b2102bb960f3d12e0de8c1dd
+size 10323466465
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/global_step500/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-2e5/checkpoint-500/global_step500/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..48bdbe4cb43bdeb1dba841f0790f1c6e38b7c6e9
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/global_step500/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:42810e16642c209d4e06c04f15001786db4ee9f99a890dfd7da8da2ad0a68cc1
+size 10323469601
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/global_step500/mp_rank_00_model_states.pt b/qwen3-1.7b-teutonic-2e5/checkpoint-500/global_step500/mp_rank_00_model_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..3b1e5d5215246770a372fb9a56e2246f26125c47
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/global_step500/mp_rank_00_model_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8e3a2e69f57fd2c64c50cd6430722e31c6c0aa5e4bd3bae2ee2afd9aaefba424
+size 3441239653
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/latest b/qwen3-1.7b-teutonic-2e5/checkpoint-500/latest
new file mode 100644
index 0000000000000000000000000000000000000000..f0b47ce15fff9a01b2a416a473b2148085048a50
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/latest
@@ -0,0 +1 @@
+global_step500
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/model.safetensors b/qwen3-1.7b-teutonic-2e5/checkpoint-500/model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..74eed8deee7f42bfea72bf4166ecaa1f93311588
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:05699b742b2507f4eff84eafc1be8993c2ee2e467a5eaf97c9f506698cda6244
+size 4063515640
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/rng_state_0.pth b/qwen3-1.7b-teutonic-2e5/checkpoint-500/rng_state_0.pth
new file mode 100644
index 0000000000000000000000000000000000000000..4216f98cda667c0eec56821cfba089005aed1288
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/rng_state_0.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:958a6e27892fb703ed10a62b2ead762f94b60ec3bb4677c08b5468a57d8e339b
+size 14917
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/rng_state_1.pth b/qwen3-1.7b-teutonic-2e5/checkpoint-500/rng_state_1.pth
new file mode 100644
index 0000000000000000000000000000000000000000..1a1c44d1b25f44ae0e4d1fb6be15190c4defe223
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/rng_state_1.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:378c8813b6f7f592a17b751f070068187707a01baf668eb0520492c2223e28e8
+size 14917
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/scheduler.pt b/qwen3-1.7b-teutonic-2e5/checkpoint-500/scheduler.pt
new file mode 100644
index 0000000000000000000000000000000000000000..882f340b4d52889e5a393164c8fafd815dad9612
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/scheduler.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:de1d54e3a77abffcb08b973a58f94dc815bdaee26ce117745a3a339bb5263473
+size 1465
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/tokenizer.json b/qwen3-1.7b-teutonic-2e5/checkpoint-500/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..c7afbed2efcdf019f88ab0572ec29d3bf595dfe2
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:be75606093db2094d7cd20f3c2f385c212750648bd6ea4fb2bf507a6a4c55506
+size 11422650
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/tokenizer_config.json b/qwen3-1.7b-teutonic-2e5/checkpoint-500/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..770e41d6c92519d525eede4cbcf3ba27f6425311
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/tokenizer_config.json
@@ -0,0 +1,30 @@
+{
+ "add_prefix_space": false,
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "is_local": false,
+ "local_files_only": false,
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/trainer_state.json b/qwen3-1.7b-teutonic-2e5/checkpoint-500/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..e510d11d3f65389d124f92af1e87715f8bb1ef96
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/trainer_state.json
@@ -0,0 +1,5089 @@
+{
+ "best_global_step": 400,
+ "best_metric": 1.5199862718582153,
+ "best_model_checkpoint": null,
+ "epoch": 1.0101010101010102,
+ "eval_steps": 100,
+ "global_step": 500,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 0.8295683860778809,
+ "epoch": 0.00202020202020202,
+ "grad_norm": 10.885663032531738,
+ "learning_rate": 2e-05,
+ "loss": 1.5185801982879639,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 16384.0,
+ "step": 1
+ },
+ {
+ "entropy": 1.3341505527496338,
+ "epoch": 0.00404040404040404,
+ "grad_norm": 9.276060104370117,
+ "learning_rate": 1.9986531986531986e-05,
+ "loss": 2.0802578926086426,
+ "mean_token_accuracy": 0.5727283954620361,
+ "num_tokens": 32768.0,
+ "step": 2
+ },
+ {
+ "entropy": 1.159377932548523,
+ "epoch": 0.006060606060606061,
+ "grad_norm": 3.999565839767456,
+ "learning_rate": 1.9973063973063975e-05,
+ "loss": 1.4128143787384033,
+ "mean_token_accuracy": 0.6849657893180847,
+ "num_tokens": 49152.0,
+ "step": 3
+ },
+ {
+ "entropy": 1.504081130027771,
+ "epoch": 0.00808080808080808,
+ "grad_norm": 3.018310546875,
+ "learning_rate": 1.995959595959596e-05,
+ "loss": 1.5479036569595337,
+ "mean_token_accuracy": 0.647777259349823,
+ "num_tokens": 65536.0,
+ "step": 4
+ },
+ {
+ "entropy": 2.1211423873901367,
+ "epoch": 0.010101010101010102,
+ "grad_norm": 4.352237701416016,
+ "learning_rate": 1.9946127946127948e-05,
+ "loss": 1.7965757846832275,
+ "mean_token_accuracy": 0.5992916226387024,
+ "num_tokens": 81920.0,
+ "step": 5
+ },
+ {
+ "entropy": 1.6345494985580444,
+ "epoch": 0.012121212121212121,
+ "grad_norm": 3.2360711097717285,
+ "learning_rate": 1.9932659932659936e-05,
+ "loss": 1.4024577140808105,
+ "mean_token_accuracy": 0.6747679710388184,
+ "num_tokens": 98304.0,
+ "step": 6
+ },
+ {
+ "entropy": 2.105585813522339,
+ "epoch": 0.014141414141414142,
+ "grad_norm": 2.84971284866333,
+ "learning_rate": 1.991919191919192e-05,
+ "loss": 1.9915739297866821,
+ "mean_token_accuracy": 0.5882999300956726,
+ "num_tokens": 114688.0,
+ "step": 7
+ },
+ {
+ "entropy": 1.7230671644210815,
+ "epoch": 0.01616161616161616,
+ "grad_norm": 2.686546802520752,
+ "learning_rate": 1.990572390572391e-05,
+ "loss": 1.630468726158142,
+ "mean_token_accuracy": 0.6269540786743164,
+ "num_tokens": 131072.0,
+ "step": 8
+ },
+ {
+ "entropy": 2.048288106918335,
+ "epoch": 0.01818181818181818,
+ "grad_norm": 2.6931567192077637,
+ "learning_rate": 1.9892255892255894e-05,
+ "loss": 2.212648391723633,
+ "mean_token_accuracy": 0.5294333100318909,
+ "num_tokens": 147456.0,
+ "step": 9
+ },
+ {
+ "entropy": 1.3021576404571533,
+ "epoch": 0.020202020202020204,
+ "grad_norm": 2.5286052227020264,
+ "learning_rate": 1.9878787878787878e-05,
+ "loss": 1.4357099533081055,
+ "mean_token_accuracy": 0.6633487939834595,
+ "num_tokens": 163840.0,
+ "step": 10
+ },
+ {
+ "entropy": 1.6998594999313354,
+ "epoch": 0.022222222222222223,
+ "grad_norm": 2.673692226409912,
+ "learning_rate": 1.9865319865319866e-05,
+ "loss": 1.8616552352905273,
+ "mean_token_accuracy": 0.6129091382026672,
+ "num_tokens": 180224.0,
+ "step": 11
+ },
+ {
+ "entropy": 1.5349891185760498,
+ "epoch": 0.024242424242424242,
+ "grad_norm": 2.882964611053467,
+ "learning_rate": 1.9851851851851855e-05,
+ "loss": 1.7540476322174072,
+ "mean_token_accuracy": 0.6111993193626404,
+ "num_tokens": 196608.0,
+ "step": 12
+ },
+ {
+ "entropy": 1.4202098846435547,
+ "epoch": 0.026262626262626262,
+ "grad_norm": 2.3892722129821777,
+ "learning_rate": 1.983838383838384e-05,
+ "loss": 1.5638885498046875,
+ "mean_token_accuracy": 0.642892062664032,
+ "num_tokens": 212992.0,
+ "step": 13
+ },
+ {
+ "entropy": 1.462074875831604,
+ "epoch": 0.028282828282828285,
+ "grad_norm": 2.357353925704956,
+ "learning_rate": 1.9824915824915828e-05,
+ "loss": 1.5339899063110352,
+ "mean_token_accuracy": 0.643991231918335,
+ "num_tokens": 229376.0,
+ "step": 14
+ },
+ {
+ "entropy": 1.6386674642562866,
+ "epoch": 0.030303030303030304,
+ "grad_norm": 2.1600515842437744,
+ "learning_rate": 1.9811447811447812e-05,
+ "loss": 1.6242434978485107,
+ "mean_token_accuracy": 0.6472887396812439,
+ "num_tokens": 245760.0,
+ "step": 15
+ },
+ {
+ "entropy": 1.882306456565857,
+ "epoch": 0.03232323232323232,
+ "grad_norm": 2.478746175765991,
+ "learning_rate": 1.97979797979798e-05,
+ "loss": 1.83274245262146,
+ "mean_token_accuracy": 0.5993527173995972,
+ "num_tokens": 262144.0,
+ "step": 16
+ },
+ {
+ "entropy": 1.5836528539657593,
+ "epoch": 0.03434343434343434,
+ "grad_norm": 2.5016613006591797,
+ "learning_rate": 1.9784511784511785e-05,
+ "loss": 1.5364878177642822,
+ "mean_token_accuracy": 0.6441743969917297,
+ "num_tokens": 278528.0,
+ "step": 17
+ },
+ {
+ "entropy": 1.5695534944534302,
+ "epoch": 0.03636363636363636,
+ "grad_norm": 2.2971248626708984,
+ "learning_rate": 1.9771043771043774e-05,
+ "loss": 1.5179738998413086,
+ "mean_token_accuracy": 0.6437469720840454,
+ "num_tokens": 294912.0,
+ "step": 18
+ },
+ {
+ "entropy": 1.3835400342941284,
+ "epoch": 0.03838383838383838,
+ "grad_norm": 2.1497576236724854,
+ "learning_rate": 1.975757575757576e-05,
+ "loss": 1.3505406379699707,
+ "mean_token_accuracy": 0.6729970574378967,
+ "num_tokens": 311296.0,
+ "step": 19
+ },
+ {
+ "entropy": 1.4660464525222778,
+ "epoch": 0.04040404040404041,
+ "grad_norm": 2.048318862915039,
+ "learning_rate": 1.9744107744107747e-05,
+ "loss": 1.3898100852966309,
+ "mean_token_accuracy": 0.6654250025749207,
+ "num_tokens": 327680.0,
+ "step": 20
+ },
+ {
+ "entropy": 1.959633469581604,
+ "epoch": 0.04242424242424243,
+ "grad_norm": 2.2084245681762695,
+ "learning_rate": 1.973063973063973e-05,
+ "loss": 1.9230711460113525,
+ "mean_token_accuracy": 0.5726062655448914,
+ "num_tokens": 344064.0,
+ "step": 21
+ },
+ {
+ "entropy": 1.4872093200683594,
+ "epoch": 0.044444444444444446,
+ "grad_norm": 2.116982936859131,
+ "learning_rate": 1.971717171717172e-05,
+ "loss": 1.514385461807251,
+ "mean_token_accuracy": 0.6615168452262878,
+ "num_tokens": 360448.0,
+ "step": 22
+ },
+ {
+ "entropy": 1.845888614654541,
+ "epoch": 0.046464646464646465,
+ "grad_norm": 2.4377331733703613,
+ "learning_rate": 1.9703703703703704e-05,
+ "loss": 1.8750195503234863,
+ "mean_token_accuracy": 0.5962994694709778,
+ "num_tokens": 376832.0,
+ "step": 23
+ },
+ {
+ "entropy": 1.5549575090408325,
+ "epoch": 0.048484848484848485,
+ "grad_norm": 2.44534969329834,
+ "learning_rate": 1.9690235690235692e-05,
+ "loss": 1.627150058746338,
+ "mean_token_accuracy": 0.6215803623199463,
+ "num_tokens": 393216.0,
+ "step": 24
+ },
+ {
+ "entropy": 1.4516701698303223,
+ "epoch": 0.050505050505050504,
+ "grad_norm": 2.2948875427246094,
+ "learning_rate": 1.9676767676767677e-05,
+ "loss": 1.4912647008895874,
+ "mean_token_accuracy": 0.6431363224983215,
+ "num_tokens": 409600.0,
+ "step": 25
+ },
+ {
+ "entropy": 1.3493973016738892,
+ "epoch": 0.052525252525252523,
+ "grad_norm": 2.1061222553253174,
+ "learning_rate": 1.9663299663299665e-05,
+ "loss": 1.44138765335083,
+ "mean_token_accuracy": 0.6621885895729065,
+ "num_tokens": 425984.0,
+ "step": 26
+ },
+ {
+ "entropy": 1.7119438648223877,
+ "epoch": 0.05454545454545454,
+ "grad_norm": 2.5149970054626465,
+ "learning_rate": 1.9649831649831654e-05,
+ "loss": 1.776426076889038,
+ "mean_token_accuracy": 0.5944675207138062,
+ "num_tokens": 442368.0,
+ "step": 27
+ },
+ {
+ "entropy": 1.361685872077942,
+ "epoch": 0.05656565656565657,
+ "grad_norm": 2.343843460083008,
+ "learning_rate": 1.963636363636364e-05,
+ "loss": 1.404232144355774,
+ "mean_token_accuracy": 0.6639594435691833,
+ "num_tokens": 458752.0,
+ "step": 28
+ },
+ {
+ "entropy": 1.2213996648788452,
+ "epoch": 0.05858585858585859,
+ "grad_norm": 1.9002994298934937,
+ "learning_rate": 1.9622895622895623e-05,
+ "loss": 1.249969244003296,
+ "mean_token_accuracy": 0.6933927536010742,
+ "num_tokens": 475136.0,
+ "step": 29
+ },
+ {
+ "entropy": 1.7157055139541626,
+ "epoch": 0.06060606060606061,
+ "grad_norm": 2.21567702293396,
+ "learning_rate": 1.960942760942761e-05,
+ "loss": 1.7103240489959717,
+ "mean_token_accuracy": 0.6218856573104858,
+ "num_tokens": 491520.0,
+ "step": 30
+ },
+ {
+ "entropy": 1.8233915567398071,
+ "epoch": 0.06262626262626263,
+ "grad_norm": 2.0189297199249268,
+ "learning_rate": 1.9595959595959596e-05,
+ "loss": 1.820570707321167,
+ "mean_token_accuracy": 0.6126648783683777,
+ "num_tokens": 507904.0,
+ "step": 31
+ },
+ {
+ "entropy": 1.82878839969635,
+ "epoch": 0.06464646464646465,
+ "grad_norm": 2.556058883666992,
+ "learning_rate": 1.9582491582491584e-05,
+ "loss": 1.773336410522461,
+ "mean_token_accuracy": 0.5889716744422913,
+ "num_tokens": 524288.0,
+ "step": 32
+ },
+ {
+ "entropy": 1.4608416557312012,
+ "epoch": 0.06666666666666667,
+ "grad_norm": 2.0254712104797363,
+ "learning_rate": 1.956902356902357e-05,
+ "loss": 1.4261068105697632,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 540672.0,
+ "step": 33
+ },
+ {
+ "entropy": 1.4706993103027344,
+ "epoch": 0.06868686868686869,
+ "grad_norm": 2.1344153881073,
+ "learning_rate": 1.9555555555555557e-05,
+ "loss": 1.4610451459884644,
+ "mean_token_accuracy": 0.6472276449203491,
+ "num_tokens": 557056.0,
+ "step": 34
+ },
+ {
+ "entropy": 1.9629759788513184,
+ "epoch": 0.0707070707070707,
+ "grad_norm": 2.209073066711426,
+ "learning_rate": 1.9542087542087545e-05,
+ "loss": 1.9688678979873657,
+ "mean_token_accuracy": 0.5702857971191406,
+ "num_tokens": 573440.0,
+ "step": 35
+ },
+ {
+ "entropy": 1.5821412801742554,
+ "epoch": 0.07272727272727272,
+ "grad_norm": 1.9711852073669434,
+ "learning_rate": 1.952861952861953e-05,
+ "loss": 1.5614874362945557,
+ "mean_token_accuracy": 0.639167070388794,
+ "num_tokens": 589824.0,
+ "step": 36
+ },
+ {
+ "entropy": 1.4696686267852783,
+ "epoch": 0.07474747474747474,
+ "grad_norm": 2.07849383354187,
+ "learning_rate": 1.9515151515151515e-05,
+ "loss": 1.497229814529419,
+ "mean_token_accuracy": 0.6555324792861938,
+ "num_tokens": 606208.0,
+ "step": 37
+ },
+ {
+ "entropy": 1.481307864189148,
+ "epoch": 0.07676767676767676,
+ "grad_norm": 2.028839588165283,
+ "learning_rate": 1.9501683501683503e-05,
+ "loss": 1.495100975036621,
+ "mean_token_accuracy": 0.6472276449203491,
+ "num_tokens": 622592.0,
+ "step": 38
+ },
+ {
+ "entropy": 1.515073537826538,
+ "epoch": 0.07878787878787878,
+ "grad_norm": 2.2417402267456055,
+ "learning_rate": 1.9488215488215488e-05,
+ "loss": 1.6139262914657593,
+ "mean_token_accuracy": 0.6312286257743835,
+ "num_tokens": 638976.0,
+ "step": 39
+ },
+ {
+ "entropy": 1.9048941135406494,
+ "epoch": 0.08080808080808081,
+ "grad_norm": 2.232630968093872,
+ "learning_rate": 1.9474747474747476e-05,
+ "loss": 1.9573429822921753,
+ "mean_token_accuracy": 0.5796287059783936,
+ "num_tokens": 655360.0,
+ "step": 40
+ },
+ {
+ "entropy": 1.7393985986709595,
+ "epoch": 0.08282828282828283,
+ "grad_norm": 2.1077799797058105,
+ "learning_rate": 1.9461279461279464e-05,
+ "loss": 1.825897216796875,
+ "mean_token_accuracy": 0.5946506857872009,
+ "num_tokens": 671744.0,
+ "step": 41
+ },
+ {
+ "entropy": 1.6294668912887573,
+ "epoch": 0.08484848484848485,
+ "grad_norm": 2.299520492553711,
+ "learning_rate": 1.944781144781145e-05,
+ "loss": 1.6667912006378174,
+ "mean_token_accuracy": 0.6225574016571045,
+ "num_tokens": 688128.0,
+ "step": 42
+ },
+ {
+ "entropy": 1.4176290035247803,
+ "epoch": 0.08686868686868687,
+ "grad_norm": 1.9385138750076294,
+ "learning_rate": 1.9434343434343437e-05,
+ "loss": 1.422924280166626,
+ "mean_token_accuracy": 0.6719589829444885,
+ "num_tokens": 704512.0,
+ "step": 43
+ },
+ {
+ "entropy": 1.6570991277694702,
+ "epoch": 0.08888888888888889,
+ "grad_norm": 2.1650922298431396,
+ "learning_rate": 1.9420875420875422e-05,
+ "loss": 1.6351218223571777,
+ "mean_token_accuracy": 0.6342818737030029,
+ "num_tokens": 720896.0,
+ "step": 44
+ },
+ {
+ "entropy": 1.520472764968872,
+ "epoch": 0.09090909090909091,
+ "grad_norm": 2.116955280303955,
+ "learning_rate": 1.9407407407407407e-05,
+ "loss": 1.4788711071014404,
+ "mean_token_accuracy": 0.6557767391204834,
+ "num_tokens": 737280.0,
+ "step": 45
+ },
+ {
+ "entropy": 1.3090498447418213,
+ "epoch": 0.09292929292929293,
+ "grad_norm": 2.0493314266204834,
+ "learning_rate": 1.9393939393939395e-05,
+ "loss": 1.3372726440429688,
+ "mean_token_accuracy": 0.6762945652008057,
+ "num_tokens": 753664.0,
+ "step": 46
+ },
+ {
+ "entropy": 1.6449471712112427,
+ "epoch": 0.09494949494949495,
+ "grad_norm": 2.2450437545776367,
+ "learning_rate": 1.9380471380471383e-05,
+ "loss": 1.6683790683746338,
+ "mean_token_accuracy": 0.6266487836837769,
+ "num_tokens": 770048.0,
+ "step": 47
+ },
+ {
+ "entropy": 1.2516838312149048,
+ "epoch": 0.09696969696969697,
+ "grad_norm": 2.168203592300415,
+ "learning_rate": 1.9367003367003368e-05,
+ "loss": 1.2885866165161133,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 786432.0,
+ "step": 48
+ },
+ {
+ "entropy": 1.7858967781066895,
+ "epoch": 0.09898989898989899,
+ "grad_norm": 2.0490918159484863,
+ "learning_rate": 1.9353535353535356e-05,
+ "loss": 1.8125935792922974,
+ "mean_token_accuracy": 0.5957498550415039,
+ "num_tokens": 802816.0,
+ "step": 49
+ },
+ {
+ "entropy": 1.6833406686782837,
+ "epoch": 0.10101010101010101,
+ "grad_norm": 1.9622541666030884,
+ "learning_rate": 1.934006734006734e-05,
+ "loss": 1.715425729751587,
+ "mean_token_accuracy": 0.606008768081665,
+ "num_tokens": 819200.0,
+ "step": 50
+ },
+ {
+ "entropy": 1.4103842973709106,
+ "epoch": 0.10303030303030303,
+ "grad_norm": 2.015503406524658,
+ "learning_rate": 1.932659932659933e-05,
+ "loss": 1.4374600648880005,
+ "mean_token_accuracy": 0.6615168452262878,
+ "num_tokens": 835584.0,
+ "step": 51
+ },
+ {
+ "entropy": 1.6805938482284546,
+ "epoch": 0.10505050505050505,
+ "grad_norm": 2.139333963394165,
+ "learning_rate": 1.9313131313131314e-05,
+ "loss": 1.684693455696106,
+ "mean_token_accuracy": 0.6270151734352112,
+ "num_tokens": 851968.0,
+ "step": 52
+ },
+ {
+ "entropy": 1.770232915878296,
+ "epoch": 0.10707070707070707,
+ "grad_norm": 2.3331124782562256,
+ "learning_rate": 1.92996632996633e-05,
+ "loss": 1.781606674194336,
+ "mean_token_accuracy": 0.6006350517272949,
+ "num_tokens": 868352.0,
+ "step": 53
+ },
+ {
+ "entropy": 1.676267147064209,
+ "epoch": 0.10909090909090909,
+ "grad_norm": 2.1863765716552734,
+ "learning_rate": 1.9286195286195287e-05,
+ "loss": 1.6873016357421875,
+ "mean_token_accuracy": 0.6182828545570374,
+ "num_tokens": 884736.0,
+ "step": 54
+ },
+ {
+ "entropy": 1.3133333921432495,
+ "epoch": 0.1111111111111111,
+ "grad_norm": 2.455390691757202,
+ "learning_rate": 1.9272727272727275e-05,
+ "loss": 1.336955189704895,
+ "mean_token_accuracy": 0.682584285736084,
+ "num_tokens": 901120.0,
+ "step": 55
+ },
+ {
+ "entropy": 1.8064881563186646,
+ "epoch": 0.11313131313131314,
+ "grad_norm": 2.218869686126709,
+ "learning_rate": 1.925925925925926e-05,
+ "loss": 1.8163663148880005,
+ "mean_token_accuracy": 0.5947728157043457,
+ "num_tokens": 917504.0,
+ "step": 56
+ },
+ {
+ "entropy": 1.495352864265442,
+ "epoch": 0.11515151515151516,
+ "grad_norm": 2.040064573287964,
+ "learning_rate": 1.9245791245791248e-05,
+ "loss": 1.4638073444366455,
+ "mean_token_accuracy": 0.6512579321861267,
+ "num_tokens": 933888.0,
+ "step": 57
+ },
+ {
+ "entropy": 1.5757899284362793,
+ "epoch": 0.11717171717171718,
+ "grad_norm": 1.8449796438217163,
+ "learning_rate": 1.9232323232323233e-05,
+ "loss": 1.5526244640350342,
+ "mean_token_accuracy": 0.6346482634544373,
+ "num_tokens": 950272.0,
+ "step": 58
+ },
+ {
+ "entropy": 1.6834555864334106,
+ "epoch": 0.1191919191919192,
+ "grad_norm": 2.0705320835113525,
+ "learning_rate": 1.921885521885522e-05,
+ "loss": 1.753828763961792,
+ "mean_token_accuracy": 0.6237176060676575,
+ "num_tokens": 966656.0,
+ "step": 59
+ },
+ {
+ "entropy": 1.5231870412826538,
+ "epoch": 0.12121212121212122,
+ "grad_norm": 2.1398122310638428,
+ "learning_rate": 1.9205387205387206e-05,
+ "loss": 1.515265941619873,
+ "mean_token_accuracy": 0.6452125310897827,
+ "num_tokens": 983040.0,
+ "step": 60
+ },
+ {
+ "entropy": 1.6915754079818726,
+ "epoch": 0.12323232323232323,
+ "grad_norm": 2.179158926010132,
+ "learning_rate": 1.9191919191919194e-05,
+ "loss": 1.6949875354766846,
+ "mean_token_accuracy": 0.6109550595283508,
+ "num_tokens": 999424.0,
+ "step": 61
+ },
+ {
+ "entropy": 1.580087661743164,
+ "epoch": 0.12525252525252525,
+ "grad_norm": 2.8643219470977783,
+ "learning_rate": 1.9178451178451182e-05,
+ "loss": 1.6217050552368164,
+ "mean_token_accuracy": 0.6498534679412842,
+ "num_tokens": 1015808.0,
+ "step": 62
+ },
+ {
+ "entropy": 1.7331494092941284,
+ "epoch": 0.12727272727272726,
+ "grad_norm": 2.0613038539886475,
+ "learning_rate": 1.9164983164983167e-05,
+ "loss": 1.7527930736541748,
+ "mean_token_accuracy": 0.59513920545578,
+ "num_tokens": 1032192.0,
+ "step": 63
+ },
+ {
+ "entropy": 1.3311079740524292,
+ "epoch": 0.1292929292929293,
+ "grad_norm": 1.996009111404419,
+ "learning_rate": 1.9151515151515152e-05,
+ "loss": 1.3299833536148071,
+ "mean_token_accuracy": 0.6760503053665161,
+ "num_tokens": 1048576.0,
+ "step": 64
+ },
+ {
+ "entropy": 1.1875317096710205,
+ "epoch": 0.13131313131313133,
+ "grad_norm": 1.9458681344985962,
+ "learning_rate": 1.913804713804714e-05,
+ "loss": 1.1885290145874023,
+ "mean_token_accuracy": 0.6996213793754578,
+ "num_tokens": 1064960.0,
+ "step": 65
+ },
+ {
+ "entropy": 1.0825527906417847,
+ "epoch": 0.13333333333333333,
+ "grad_norm": 1.8164746761322021,
+ "learning_rate": 1.9124579124579125e-05,
+ "loss": 1.0918856859207153,
+ "mean_token_accuracy": 0.7477405667304993,
+ "num_tokens": 1081344.0,
+ "step": 66
+ },
+ {
+ "entropy": 1.5940357446670532,
+ "epoch": 0.13535353535353536,
+ "grad_norm": 1.9322525262832642,
+ "learning_rate": 1.9111111111111113e-05,
+ "loss": 1.6157622337341309,
+ "mean_token_accuracy": 0.6340376138687134,
+ "num_tokens": 1097728.0,
+ "step": 67
+ },
+ {
+ "entropy": 1.683976173400879,
+ "epoch": 0.13737373737373737,
+ "grad_norm": 2.1792430877685547,
+ "learning_rate": 1.9097643097643098e-05,
+ "loss": 1.7643585205078125,
+ "mean_token_accuracy": 0.5998412370681763,
+ "num_tokens": 1114112.0,
+ "step": 68
+ },
+ {
+ "entropy": 1.5753607749938965,
+ "epoch": 0.1393939393939394,
+ "grad_norm": 2.033538818359375,
+ "learning_rate": 1.9084175084175086e-05,
+ "loss": 1.628584861755371,
+ "mean_token_accuracy": 0.6401441097259521,
+ "num_tokens": 1130496.0,
+ "step": 69
+ },
+ {
+ "entropy": 1.4061329364776611,
+ "epoch": 0.1414141414141414,
+ "grad_norm": 1.9239107370376587,
+ "learning_rate": 1.9070707070707074e-05,
+ "loss": 1.4355204105377197,
+ "mean_token_accuracy": 0.6727527976036072,
+ "num_tokens": 1146880.0,
+ "step": 70
+ },
+ {
+ "entropy": 1.1722302436828613,
+ "epoch": 0.14343434343434344,
+ "grad_norm": 2.0911052227020264,
+ "learning_rate": 1.905723905723906e-05,
+ "loss": 1.2008472681045532,
+ "mean_token_accuracy": 0.7064606547355652,
+ "num_tokens": 1163264.0,
+ "step": 71
+ },
+ {
+ "entropy": 1.5291107892990112,
+ "epoch": 0.14545454545454545,
+ "grad_norm": 2.1054158210754395,
+ "learning_rate": 1.9043771043771044e-05,
+ "loss": 1.574873924255371,
+ "mean_token_accuracy": 0.6356253027915955,
+ "num_tokens": 1179648.0,
+ "step": 72
+ },
+ {
+ "entropy": 1.3679379224777222,
+ "epoch": 0.14747474747474748,
+ "grad_norm": 1.928666353225708,
+ "learning_rate": 1.9030303030303032e-05,
+ "loss": 1.3473236560821533,
+ "mean_token_accuracy": 0.679347813129425,
+ "num_tokens": 1196032.0,
+ "step": 73
+ },
+ {
+ "entropy": 1.7593064308166504,
+ "epoch": 0.1494949494949495,
+ "grad_norm": 2.3172972202301025,
+ "learning_rate": 1.9016835016835017e-05,
+ "loss": 1.7953016757965088,
+ "mean_token_accuracy": 0.6107107996940613,
+ "num_tokens": 1212416.0,
+ "step": 74
+ },
+ {
+ "entropy": 1.3841301202774048,
+ "epoch": 0.15151515151515152,
+ "grad_norm": 1.9938782453536987,
+ "learning_rate": 1.9003367003367005e-05,
+ "loss": 1.3923728466033936,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 1228800.0,
+ "step": 75
+ },
+ {
+ "entropy": 1.6030631065368652,
+ "epoch": 0.15353535353535352,
+ "grad_norm": 2.0514845848083496,
+ "learning_rate": 1.8989898989898993e-05,
+ "loss": 1.5902166366577148,
+ "mean_token_accuracy": 0.6376404762268066,
+ "num_tokens": 1245184.0,
+ "step": 76
+ },
+ {
+ "entropy": 1.5902619361877441,
+ "epoch": 0.15555555555555556,
+ "grad_norm": 2.115469217300415,
+ "learning_rate": 1.8976430976430978e-05,
+ "loss": 1.5841395854949951,
+ "mean_token_accuracy": 0.6361138224601746,
+ "num_tokens": 1261568.0,
+ "step": 77
+ },
+ {
+ "entropy": 1.7821043729782104,
+ "epoch": 0.15757575757575756,
+ "grad_norm": 2.008962869644165,
+ "learning_rate": 1.8962962962962966e-05,
+ "loss": 1.7826645374298096,
+ "mean_token_accuracy": 0.6053370833396912,
+ "num_tokens": 1277952.0,
+ "step": 78
+ },
+ {
+ "entropy": 1.833274006843567,
+ "epoch": 0.1595959595959596,
+ "grad_norm": 2.0258517265319824,
+ "learning_rate": 1.894949494949495e-05,
+ "loss": 1.8566474914550781,
+ "mean_token_accuracy": 0.5800561904907227,
+ "num_tokens": 1294336.0,
+ "step": 79
+ },
+ {
+ "entropy": 1.785520315170288,
+ "epoch": 0.16161616161616163,
+ "grad_norm": 2.0918498039245605,
+ "learning_rate": 1.8936026936026936e-05,
+ "loss": 1.775907278060913,
+ "mean_token_accuracy": 0.6063141226768494,
+ "num_tokens": 1310720.0,
+ "step": 80
+ },
+ {
+ "entropy": 1.9341778755187988,
+ "epoch": 0.16363636363636364,
+ "grad_norm": 2.0399975776672363,
+ "learning_rate": 1.8922558922558924e-05,
+ "loss": 1.9579840898513794,
+ "mean_token_accuracy": 0.5619809627532959,
+ "num_tokens": 1327104.0,
+ "step": 81
+ },
+ {
+ "entropy": 1.4945461750030518,
+ "epoch": 0.16565656565656567,
+ "grad_norm": 1.9975999593734741,
+ "learning_rate": 1.8909090909090912e-05,
+ "loss": 1.5436582565307617,
+ "mean_token_accuracy": 0.6423424482345581,
+ "num_tokens": 1343488.0,
+ "step": 82
+ },
+ {
+ "entropy": 1.6639432907104492,
+ "epoch": 0.16767676767676767,
+ "grad_norm": 2.0375208854675293,
+ "learning_rate": 1.8895622895622897e-05,
+ "loss": 1.679243564605713,
+ "mean_token_accuracy": 0.6226184368133545,
+ "num_tokens": 1359872.0,
+ "step": 83
+ },
+ {
+ "entropy": 1.4505668878555298,
+ "epoch": 0.1696969696969697,
+ "grad_norm": 1.8894681930541992,
+ "learning_rate": 1.8882154882154885e-05,
+ "loss": 1.4778342247009277,
+ "mean_token_accuracy": 0.6637151837348938,
+ "num_tokens": 1376256.0,
+ "step": 84
+ },
+ {
+ "entropy": 1.3845125436782837,
+ "epoch": 0.1717171717171717,
+ "grad_norm": 2.1110754013061523,
+ "learning_rate": 1.886868686868687e-05,
+ "loss": 1.4153435230255127,
+ "mean_token_accuracy": 0.6737298369407654,
+ "num_tokens": 1392640.0,
+ "step": 85
+ },
+ {
+ "entropy": 1.8785539865493774,
+ "epoch": 0.17373737373737375,
+ "grad_norm": 2.0894815921783447,
+ "learning_rate": 1.8855218855218858e-05,
+ "loss": 1.8658334016799927,
+ "mean_token_accuracy": 0.5846360325813293,
+ "num_tokens": 1409024.0,
+ "step": 86
+ },
+ {
+ "entropy": 1.6006972789764404,
+ "epoch": 0.17575757575757575,
+ "grad_norm": 2.088477849960327,
+ "learning_rate": 1.8841750841750843e-05,
+ "loss": 1.6257164478302002,
+ "mean_token_accuracy": 0.623900830745697,
+ "num_tokens": 1425408.0,
+ "step": 87
+ },
+ {
+ "entropy": 1.1098109483718872,
+ "epoch": 0.17777777777777778,
+ "grad_norm": 1.934228539466858,
+ "learning_rate": 1.8828282828282827e-05,
+ "loss": 1.0948461294174194,
+ "mean_token_accuracy": 0.7248412370681763,
+ "num_tokens": 1441792.0,
+ "step": 88
+ },
+ {
+ "entropy": 1.4807215929031372,
+ "epoch": 0.1797979797979798,
+ "grad_norm": 2.06062388420105,
+ "learning_rate": 1.8814814814814816e-05,
+ "loss": 1.5115268230438232,
+ "mean_token_accuracy": 0.6463117003440857,
+ "num_tokens": 1458176.0,
+ "step": 89
+ },
+ {
+ "entropy": 1.07956862449646,
+ "epoch": 0.18181818181818182,
+ "grad_norm": 1.8913685083389282,
+ "learning_rate": 1.8801346801346804e-05,
+ "loss": 1.0902754068374634,
+ "mean_token_accuracy": 0.7308256030082703,
+ "num_tokens": 1474560.0,
+ "step": 90
+ },
+ {
+ "entropy": 1.4571733474731445,
+ "epoch": 0.18383838383838383,
+ "grad_norm": 2.2199525833129883,
+ "learning_rate": 1.8787878787878792e-05,
+ "loss": 1.4686330556869507,
+ "mean_token_accuracy": 0.6566927433013916,
+ "num_tokens": 1490944.0,
+ "step": 91
+ },
+ {
+ "entropy": 1.4484740495681763,
+ "epoch": 0.18585858585858586,
+ "grad_norm": 2.0670580863952637,
+ "learning_rate": 1.8774410774410777e-05,
+ "loss": 1.4791338443756104,
+ "mean_token_accuracy": 0.6493649482727051,
+ "num_tokens": 1507328.0,
+ "step": 92
+ },
+ {
+ "entropy": 1.498313546180725,
+ "epoch": 0.18787878787878787,
+ "grad_norm": 2.024329423904419,
+ "learning_rate": 1.876094276094276e-05,
+ "loss": 1.4964686632156372,
+ "mean_token_accuracy": 0.6457620859146118,
+ "num_tokens": 1523712.0,
+ "step": 93
+ },
+ {
+ "entropy": 1.4806159734725952,
+ "epoch": 0.1898989898989899,
+ "grad_norm": 2.1369152069091797,
+ "learning_rate": 1.874747474747475e-05,
+ "loss": 1.4587206840515137,
+ "mean_token_accuracy": 0.6521739363670349,
+ "num_tokens": 1540096.0,
+ "step": 94
+ },
+ {
+ "entropy": 1.3746109008789062,
+ "epoch": 0.1919191919191919,
+ "grad_norm": 2.216958522796631,
+ "learning_rate": 1.8734006734006735e-05,
+ "loss": 1.3600832223892212,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 1556480.0,
+ "step": 95
+ },
+ {
+ "entropy": 1.3492207527160645,
+ "epoch": 0.19393939393939394,
+ "grad_norm": 2.093956708908081,
+ "learning_rate": 1.8720538720538723e-05,
+ "loss": 1.3867243528366089,
+ "mean_token_accuracy": 0.6625549793243408,
+ "num_tokens": 1572864.0,
+ "step": 96
+ },
+ {
+ "entropy": 1.560738205909729,
+ "epoch": 0.19595959595959597,
+ "grad_norm": 2.0691707134246826,
+ "learning_rate": 1.8707070707070707e-05,
+ "loss": 1.5875897407531738,
+ "mean_token_accuracy": 0.6345872282981873,
+ "num_tokens": 1589248.0,
+ "step": 97
+ },
+ {
+ "entropy": 1.46450674533844,
+ "epoch": 0.19797979797979798,
+ "grad_norm": 2.064547538757324,
+ "learning_rate": 1.8693602693602696e-05,
+ "loss": 1.4920742511749268,
+ "mean_token_accuracy": 0.6411822438240051,
+ "num_tokens": 1605632.0,
+ "step": 98
+ },
+ {
+ "entropy": 1.5433454513549805,
+ "epoch": 0.2,
+ "grad_norm": 2.014409303665161,
+ "learning_rate": 1.868013468013468e-05,
+ "loss": 1.5737671852111816,
+ "mean_token_accuracy": 0.6349536180496216,
+ "num_tokens": 1622016.0,
+ "step": 99
+ },
+ {
+ "entropy": 1.358772873878479,
+ "epoch": 0.20202020202020202,
+ "grad_norm": 1.9765456914901733,
+ "learning_rate": 1.866666666666667e-05,
+ "loss": 1.3583091497421265,
+ "mean_token_accuracy": 0.680446982383728,
+ "num_tokens": 1638400.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.20202020202020202,
+ "eval_entropy": 1.5664977690865916,
+ "eval_loss": 1.5804312229156494,
+ "eval_mean_token_accuracy": 0.63647972239602,
+ "eval_num_tokens": 1638400.0,
+ "eval_runtime": 44.1541,
+ "eval_samples_per_second": 22.421,
+ "eval_steps_per_second": 2.808,
+ "step": 100
+ },
+ {
+ "entropy": 1.5879693031311035,
+ "epoch": 0.20404040404040405,
+ "grad_norm": 1.8491015434265137,
+ "learning_rate": 1.8653198653198653e-05,
+ "loss": 1.5892077684402466,
+ "mean_token_accuracy": 0.6665852665901184,
+ "num_tokens": 1654784.0,
+ "step": 101
+ },
+ {
+ "entropy": 1.5789942741394043,
+ "epoch": 0.20606060606060606,
+ "grad_norm": 1.9096908569335938,
+ "learning_rate": 1.863973063973064e-05,
+ "loss": 1.594193458557129,
+ "mean_token_accuracy": 0.6293966770172119,
+ "num_tokens": 1671168.0,
+ "step": 102
+ },
+ {
+ "entropy": 1.5245429277420044,
+ "epoch": 0.2080808080808081,
+ "grad_norm": 1.986904501914978,
+ "learning_rate": 1.8626262626262626e-05,
+ "loss": 1.5463616847991943,
+ "mean_token_accuracy": 0.6354421377182007,
+ "num_tokens": 1687552.0,
+ "step": 103
+ },
+ {
+ "entropy": 2.015364408493042,
+ "epoch": 0.2101010101010101,
+ "grad_norm": 2.3297250270843506,
+ "learning_rate": 1.8612794612794615e-05,
+ "loss": 1.987194538116455,
+ "mean_token_accuracy": 0.5604543089866638,
+ "num_tokens": 1703936.0,
+ "step": 104
+ },
+ {
+ "entropy": 1.770432472229004,
+ "epoch": 0.21212121212121213,
+ "grad_norm": 2.3580551147460938,
+ "learning_rate": 1.8599326599326603e-05,
+ "loss": 1.7715529203414917,
+ "mean_token_accuracy": 0.5786516666412354,
+ "num_tokens": 1720320.0,
+ "step": 105
+ },
+ {
+ "entropy": 1.3456813097000122,
+ "epoch": 0.21414141414141413,
+ "grad_norm": 1.9782105684280396,
+ "learning_rate": 1.8585858585858588e-05,
+ "loss": 1.342590570449829,
+ "mean_token_accuracy": 0.6779433488845825,
+ "num_tokens": 1736704.0,
+ "step": 106
+ },
+ {
+ "entropy": 1.4614694118499756,
+ "epoch": 0.21616161616161617,
+ "grad_norm": 1.9486815929412842,
+ "learning_rate": 1.8572390572390572e-05,
+ "loss": 1.4493391513824463,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 1753088.0,
+ "step": 107
+ },
+ {
+ "entropy": 2.007932186126709,
+ "epoch": 0.21818181818181817,
+ "grad_norm": 2.0571465492248535,
+ "learning_rate": 1.855892255892256e-05,
+ "loss": 2.033851385116577,
+ "mean_token_accuracy": 0.5746213793754578,
+ "num_tokens": 1769472.0,
+ "step": 108
+ },
+ {
+ "entropy": 1.506022572517395,
+ "epoch": 0.2202020202020202,
+ "grad_norm": 1.9980531930923462,
+ "learning_rate": 1.8545454545454545e-05,
+ "loss": 1.5305016040802002,
+ "mean_token_accuracy": 0.6416096687316895,
+ "num_tokens": 1785856.0,
+ "step": 109
+ },
+ {
+ "entropy": 1.479506492614746,
+ "epoch": 0.2222222222222222,
+ "grad_norm": 2.411241292953491,
+ "learning_rate": 1.8531986531986533e-05,
+ "loss": 1.5501817464828491,
+ "mean_token_accuracy": 0.6364802122116089,
+ "num_tokens": 1802240.0,
+ "step": 110
+ },
+ {
+ "entropy": 1.7731081247329712,
+ "epoch": 0.22424242424242424,
+ "grad_norm": 2.1088449954986572,
+ "learning_rate": 1.851851851851852e-05,
+ "loss": 1.7582051753997803,
+ "mean_token_accuracy": 0.5985588431358337,
+ "num_tokens": 1818624.0,
+ "step": 111
+ },
+ {
+ "entropy": 1.7963190078735352,
+ "epoch": 0.22626262626262628,
+ "grad_norm": 2.180325508117676,
+ "learning_rate": 1.8505050505050506e-05,
+ "loss": 1.8436882495880127,
+ "mean_token_accuracy": 0.5850635170936584,
+ "num_tokens": 1835008.0,
+ "step": 112
+ },
+ {
+ "entropy": 1.513211727142334,
+ "epoch": 0.22828282828282828,
+ "grad_norm": 2.1563429832458496,
+ "learning_rate": 1.8491582491582495e-05,
+ "loss": 1.547263741493225,
+ "mean_token_accuracy": 0.6399609446525574,
+ "num_tokens": 1851392.0,
+ "step": 113
+ },
+ {
+ "entropy": 1.8904774188995361,
+ "epoch": 0.23030303030303031,
+ "grad_norm": 2.2191243171691895,
+ "learning_rate": 1.847811447811448e-05,
+ "loss": 1.9237418174743652,
+ "mean_token_accuracy": 0.5852466821670532,
+ "num_tokens": 1867776.0,
+ "step": 114
+ },
+ {
+ "entropy": 1.706113338470459,
+ "epoch": 0.23232323232323232,
+ "grad_norm": 2.1411335468292236,
+ "learning_rate": 1.8464646464646464e-05,
+ "loss": 1.7145740985870361,
+ "mean_token_accuracy": 0.6138861775398254,
+ "num_tokens": 1884160.0,
+ "step": 115
+ },
+ {
+ "entropy": 1.726441502571106,
+ "epoch": 0.23434343434343435,
+ "grad_norm": 2.212477922439575,
+ "learning_rate": 1.8451178451178452e-05,
+ "loss": 1.7427434921264648,
+ "mean_token_accuracy": 0.6087567210197449,
+ "num_tokens": 1900544.0,
+ "step": 116
+ },
+ {
+ "entropy": 1.49800443649292,
+ "epoch": 0.23636363636363636,
+ "grad_norm": 2.003248929977417,
+ "learning_rate": 1.8437710437710437e-05,
+ "loss": 1.4677059650421143,
+ "mean_token_accuracy": 0.6617000699043274,
+ "num_tokens": 1916928.0,
+ "step": 117
+ },
+ {
+ "entropy": 1.5079678297042847,
+ "epoch": 0.2383838383838384,
+ "grad_norm": 1.9702556133270264,
+ "learning_rate": 1.8424242424242425e-05,
+ "loss": 1.5194823741912842,
+ "mean_token_accuracy": 0.6593796014785767,
+ "num_tokens": 1933312.0,
+ "step": 118
+ },
+ {
+ "entropy": 1.760438323020935,
+ "epoch": 0.2404040404040404,
+ "grad_norm": 1.9484418630599976,
+ "learning_rate": 1.8410774410774414e-05,
+ "loss": 1.756869912147522,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 1949696.0,
+ "step": 119
+ },
+ {
+ "entropy": 1.3706170320510864,
+ "epoch": 0.24242424242424243,
+ "grad_norm": 2.078357458114624,
+ "learning_rate": 1.83973063973064e-05,
+ "loss": 1.3532414436340332,
+ "mean_token_accuracy": 0.6680508255958557,
+ "num_tokens": 1966080.0,
+ "step": 120
+ },
+ {
+ "entropy": 1.2994399070739746,
+ "epoch": 0.24444444444444444,
+ "grad_norm": 1.9178324937820435,
+ "learning_rate": 1.8383838383838387e-05,
+ "loss": 1.298889398574829,
+ "mean_token_accuracy": 0.6831949353218079,
+ "num_tokens": 1982464.0,
+ "step": 121
+ },
+ {
+ "entropy": 1.6806142330169678,
+ "epoch": 0.24646464646464647,
+ "grad_norm": 2.287158966064453,
+ "learning_rate": 1.837037037037037e-05,
+ "loss": 1.728592038154602,
+ "mean_token_accuracy": 0.6161455512046814,
+ "num_tokens": 1998848.0,
+ "step": 122
+ },
+ {
+ "entropy": 1.2894387245178223,
+ "epoch": 0.24848484848484848,
+ "grad_norm": 1.9998525381088257,
+ "learning_rate": 1.8356902356902356e-05,
+ "loss": 1.3326170444488525,
+ "mean_token_accuracy": 0.6693331599235535,
+ "num_tokens": 2015232.0,
+ "step": 123
+ },
+ {
+ "entropy": 1.5466209650039673,
+ "epoch": 0.2505050505050505,
+ "grad_norm": 1.8439521789550781,
+ "learning_rate": 1.8343434343434344e-05,
+ "loss": 1.5606887340545654,
+ "mean_token_accuracy": 0.6571201682090759,
+ "num_tokens": 2031616.0,
+ "step": 124
+ },
+ {
+ "entropy": 1.2692567110061646,
+ "epoch": 0.25252525252525254,
+ "grad_norm": 1.9568793773651123,
+ "learning_rate": 1.8329966329966332e-05,
+ "loss": 1.308868408203125,
+ "mean_token_accuracy": 0.6954689621925354,
+ "num_tokens": 2048000.0,
+ "step": 125
+ },
+ {
+ "entropy": 1.5780351161956787,
+ "epoch": 0.2545454545454545,
+ "grad_norm": 2.151250123977661,
+ "learning_rate": 1.831649831649832e-05,
+ "loss": 1.60304856300354,
+ "mean_token_accuracy": 0.6258549094200134,
+ "num_tokens": 2064384.0,
+ "step": 126
+ },
+ {
+ "entropy": 1.487567663192749,
+ "epoch": 0.25656565656565655,
+ "grad_norm": 1.9134294986724854,
+ "learning_rate": 1.8303030303030305e-05,
+ "loss": 1.514064073562622,
+ "mean_token_accuracy": 0.6348925232887268,
+ "num_tokens": 2080768.0,
+ "step": 127
+ },
+ {
+ "entropy": 1.6072919368743896,
+ "epoch": 0.2585858585858586,
+ "grad_norm": 2.119290351867676,
+ "learning_rate": 1.828956228956229e-05,
+ "loss": 1.6062684059143066,
+ "mean_token_accuracy": 0.6332437992095947,
+ "num_tokens": 2097152.0,
+ "step": 128
+ },
+ {
+ "entropy": 1.1168174743652344,
+ "epoch": 0.2606060606060606,
+ "grad_norm": 1.8520931005477905,
+ "learning_rate": 1.827609427609428e-05,
+ "loss": 1.1421526670455933,
+ "mean_token_accuracy": 0.7078651785850525,
+ "num_tokens": 2113536.0,
+ "step": 129
+ },
+ {
+ "entropy": 1.349792718887329,
+ "epoch": 0.26262626262626265,
+ "grad_norm": 1.8463630676269531,
+ "learning_rate": 1.8262626262626263e-05,
+ "loss": 1.3712577819824219,
+ "mean_token_accuracy": 0.6736077070236206,
+ "num_tokens": 2129920.0,
+ "step": 130
+ },
+ {
+ "entropy": 1.8531655073165894,
+ "epoch": 0.26464646464646463,
+ "grad_norm": 2.0503969192504883,
+ "learning_rate": 1.824915824915825e-05,
+ "loss": 1.8971941471099854,
+ "mean_token_accuracy": 0.5845749974250793,
+ "num_tokens": 2146304.0,
+ "step": 131
+ },
+ {
+ "entropy": 1.436646819114685,
+ "epoch": 0.26666666666666666,
+ "grad_norm": 1.8517117500305176,
+ "learning_rate": 1.8235690235690236e-05,
+ "loss": 1.4255880117416382,
+ "mean_token_accuracy": 0.6653639674186707,
+ "num_tokens": 2162688.0,
+ "step": 132
+ },
+ {
+ "entropy": 1.9219673871994019,
+ "epoch": 0.2686868686868687,
+ "grad_norm": 2.1424307823181152,
+ "learning_rate": 1.8222222222222224e-05,
+ "loss": 1.9088413715362549,
+ "mean_token_accuracy": 0.5868954658508301,
+ "num_tokens": 2179072.0,
+ "step": 133
+ },
+ {
+ "entropy": 1.4034194946289062,
+ "epoch": 0.27070707070707073,
+ "grad_norm": 1.9987515211105347,
+ "learning_rate": 1.8208754208754212e-05,
+ "loss": 1.3612333536148071,
+ "mean_token_accuracy": 0.6721421480178833,
+ "num_tokens": 2195456.0,
+ "step": 134
+ },
+ {
+ "entropy": 2.064425230026245,
+ "epoch": 0.2727272727272727,
+ "grad_norm": 2.0800976753234863,
+ "learning_rate": 1.8195286195286197e-05,
+ "loss": 2.0595853328704834,
+ "mean_token_accuracy": 0.5694919228553772,
+ "num_tokens": 2211840.0,
+ "step": 135
+ },
+ {
+ "entropy": 1.2883177995681763,
+ "epoch": 0.27474747474747474,
+ "grad_norm": 1.9042892456054688,
+ "learning_rate": 1.8181818181818182e-05,
+ "loss": 1.3220078945159912,
+ "mean_token_accuracy": 0.6805080771446228,
+ "num_tokens": 2228224.0,
+ "step": 136
+ },
+ {
+ "entropy": 1.101396918296814,
+ "epoch": 0.2767676767676768,
+ "grad_norm": 1.857073187828064,
+ "learning_rate": 1.816835016835017e-05,
+ "loss": 1.1156296730041504,
+ "mean_token_accuracy": 0.7214826345443726,
+ "num_tokens": 2244608.0,
+ "step": 137
+ },
+ {
+ "entropy": 1.376597285270691,
+ "epoch": 0.2787878787878788,
+ "grad_norm": 1.9103689193725586,
+ "learning_rate": 1.8154882154882155e-05,
+ "loss": 1.3915824890136719,
+ "mean_token_accuracy": 0.6824010610580444,
+ "num_tokens": 2260992.0,
+ "step": 138
+ },
+ {
+ "entropy": 1.4654942750930786,
+ "epoch": 0.2808080808080808,
+ "grad_norm": 1.9513856172561646,
+ "learning_rate": 1.8141414141414143e-05,
+ "loss": 1.5000076293945312,
+ "mean_token_accuracy": 0.6457620859146118,
+ "num_tokens": 2277376.0,
+ "step": 139
+ },
+ {
+ "entropy": 1.1999047994613647,
+ "epoch": 0.2828282828282828,
+ "grad_norm": 1.824987530708313,
+ "learning_rate": 1.812794612794613e-05,
+ "loss": 1.2217535972595215,
+ "mean_token_accuracy": 0.7034685015678406,
+ "num_tokens": 2293760.0,
+ "step": 140
+ },
+ {
+ "entropy": 1.2822942733764648,
+ "epoch": 0.28484848484848485,
+ "grad_norm": 2.0979108810424805,
+ "learning_rate": 1.8114478114478116e-05,
+ "loss": 1.309725046157837,
+ "mean_token_accuracy": 0.6855764389038086,
+ "num_tokens": 2310144.0,
+ "step": 141
+ },
+ {
+ "entropy": 1.5589981079101562,
+ "epoch": 0.2868686868686869,
+ "grad_norm": 2.030648708343506,
+ "learning_rate": 1.8101010101010104e-05,
+ "loss": 1.5918951034545898,
+ "mean_token_accuracy": 0.6286638975143433,
+ "num_tokens": 2326528.0,
+ "step": 142
+ },
+ {
+ "entropy": 1.5600453615188599,
+ "epoch": 0.28888888888888886,
+ "grad_norm": 2.023409605026245,
+ "learning_rate": 1.808754208754209e-05,
+ "loss": 1.5725011825561523,
+ "mean_token_accuracy": 0.6384342908859253,
+ "num_tokens": 2342912.0,
+ "step": 143
+ },
+ {
+ "entropy": 1.5066077709197998,
+ "epoch": 0.2909090909090909,
+ "grad_norm": 1.9963997602462769,
+ "learning_rate": 1.8074074074074074e-05,
+ "loss": 1.5066845417022705,
+ "mean_token_accuracy": 0.6474108695983887,
+ "num_tokens": 2359296.0,
+ "step": 144
+ },
+ {
+ "entropy": 1.8313122987747192,
+ "epoch": 0.29292929292929293,
+ "grad_norm": 2.0791213512420654,
+ "learning_rate": 1.8060606060606062e-05,
+ "loss": 1.8148126602172852,
+ "mean_token_accuracy": 0.5820102691650391,
+ "num_tokens": 2375680.0,
+ "step": 145
+ },
+ {
+ "entropy": 1.8828215599060059,
+ "epoch": 0.29494949494949496,
+ "grad_norm": 2.1346335411071777,
+ "learning_rate": 1.804713804713805e-05,
+ "loss": 1.905554175376892,
+ "mean_token_accuracy": 0.6041768193244934,
+ "num_tokens": 2392064.0,
+ "step": 146
+ },
+ {
+ "entropy": 1.1984127759933472,
+ "epoch": 0.296969696969697,
+ "grad_norm": 1.6585179567337036,
+ "learning_rate": 1.8033670033670035e-05,
+ "loss": 1.2255632877349854,
+ "mean_token_accuracy": 0.712506115436554,
+ "num_tokens": 2408448.0,
+ "step": 147
+ },
+ {
+ "entropy": 1.4248595237731934,
+ "epoch": 0.298989898989899,
+ "grad_norm": 2.468965530395508,
+ "learning_rate": 1.8020202020202023e-05,
+ "loss": 1.4362621307373047,
+ "mean_token_accuracy": 0.6464948654174805,
+ "num_tokens": 2424832.0,
+ "step": 148
+ },
+ {
+ "entropy": 1.7295368909835815,
+ "epoch": 0.301010101010101,
+ "grad_norm": 1.819359302520752,
+ "learning_rate": 1.8006734006734008e-05,
+ "loss": 1.7290053367614746,
+ "mean_token_accuracy": 0.6312897205352783,
+ "num_tokens": 2441216.0,
+ "step": 149
+ },
+ {
+ "entropy": 1.7334001064300537,
+ "epoch": 0.30303030303030304,
+ "grad_norm": 2.149543285369873,
+ "learning_rate": 1.7993265993265993e-05,
+ "loss": 1.7014907598495483,
+ "mean_token_accuracy": 0.5981314182281494,
+ "num_tokens": 2457600.0,
+ "step": 150
+ },
+ {
+ "entropy": 2.0550050735473633,
+ "epoch": 0.30505050505050507,
+ "grad_norm": 1.9880189895629883,
+ "learning_rate": 1.797979797979798e-05,
+ "loss": 2.001784324645996,
+ "mean_token_accuracy": 0.5552638173103333,
+ "num_tokens": 2473984.0,
+ "step": 151
+ },
+ {
+ "entropy": 1.5352036952972412,
+ "epoch": 0.30707070707070705,
+ "grad_norm": 2.031998634338379,
+ "learning_rate": 1.7966329966329966e-05,
+ "loss": 1.5262815952301025,
+ "mean_token_accuracy": 0.6328163146972656,
+ "num_tokens": 2490368.0,
+ "step": 152
+ },
+ {
+ "entropy": 1.4278677701950073,
+ "epoch": 0.3090909090909091,
+ "grad_norm": 2.101398229598999,
+ "learning_rate": 1.7952861952861954e-05,
+ "loss": 1.4288041591644287,
+ "mean_token_accuracy": 0.6647533178329468,
+ "num_tokens": 2506752.0,
+ "step": 153
+ },
+ {
+ "entropy": 1.7469983100891113,
+ "epoch": 0.3111111111111111,
+ "grad_norm": 2.0824313163757324,
+ "learning_rate": 1.7939393939393942e-05,
+ "loss": 1.770402193069458,
+ "mean_token_accuracy": 0.5997191071510315,
+ "num_tokens": 2523136.0,
+ "step": 154
+ },
+ {
+ "entropy": 1.6565595865249634,
+ "epoch": 0.31313131313131315,
+ "grad_norm": 2.0815961360931396,
+ "learning_rate": 1.7925925925925927e-05,
+ "loss": 1.7024259567260742,
+ "mean_token_accuracy": 0.6109550595283508,
+ "num_tokens": 2539520.0,
+ "step": 155
+ },
+ {
+ "entropy": 1.4104127883911133,
+ "epoch": 0.3151515151515151,
+ "grad_norm": 2.129694700241089,
+ "learning_rate": 1.7912457912457915e-05,
+ "loss": 1.4378812313079834,
+ "mean_token_accuracy": 0.6489985585212708,
+ "num_tokens": 2555904.0,
+ "step": 156
+ },
+ {
+ "entropy": 1.5129127502441406,
+ "epoch": 0.31717171717171716,
+ "grad_norm": 2.180267095565796,
+ "learning_rate": 1.78989898989899e-05,
+ "loss": 1.5564348697662354,
+ "mean_token_accuracy": 0.6327552795410156,
+ "num_tokens": 2572288.0,
+ "step": 157
+ },
+ {
+ "entropy": 1.5240321159362793,
+ "epoch": 0.3191919191919192,
+ "grad_norm": 1.968405842781067,
+ "learning_rate": 1.7885521885521885e-05,
+ "loss": 1.585756778717041,
+ "mean_token_accuracy": 0.629885196685791,
+ "num_tokens": 2588672.0,
+ "step": 158
+ },
+ {
+ "entropy": 1.3169562816619873,
+ "epoch": 0.3212121212121212,
+ "grad_norm": 2.0452873706817627,
+ "learning_rate": 1.7872053872053873e-05,
+ "loss": 1.3569687604904175,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 2605056.0,
+ "step": 159
+ },
+ {
+ "entropy": 1.3630796670913696,
+ "epoch": 0.32323232323232326,
+ "grad_norm": 1.9721522331237793,
+ "learning_rate": 1.785858585858586e-05,
+ "loss": 1.3965554237365723,
+ "mean_token_accuracy": 0.6626160144805908,
+ "num_tokens": 2621440.0,
+ "step": 160
+ },
+ {
+ "entropy": 1.178250789642334,
+ "epoch": 0.32525252525252524,
+ "grad_norm": 2.0231528282165527,
+ "learning_rate": 1.7845117845117846e-05,
+ "loss": 1.2126985788345337,
+ "mean_token_accuracy": 0.6977894306182861,
+ "num_tokens": 2637824.0,
+ "step": 161
+ },
+ {
+ "entropy": 1.8399475812911987,
+ "epoch": 0.32727272727272727,
+ "grad_norm": 2.0615484714508057,
+ "learning_rate": 1.7831649831649834e-05,
+ "loss": 1.868000864982605,
+ "mean_token_accuracy": 0.5822545289993286,
+ "num_tokens": 2654208.0,
+ "step": 162
+ },
+ {
+ "entropy": 1.6604139804840088,
+ "epoch": 0.3292929292929293,
+ "grad_norm": 1.9838379621505737,
+ "learning_rate": 1.781818181818182e-05,
+ "loss": 1.6677067279815674,
+ "mean_token_accuracy": 0.621275007724762,
+ "num_tokens": 2670592.0,
+ "step": 163
+ },
+ {
+ "entropy": 1.3761085271835327,
+ "epoch": 0.33131313131313134,
+ "grad_norm": 2.0093271732330322,
+ "learning_rate": 1.7804713804713807e-05,
+ "loss": 1.3829190731048584,
+ "mean_token_accuracy": 0.6655471324920654,
+ "num_tokens": 2686976.0,
+ "step": 164
+ },
+ {
+ "entropy": 1.578093409538269,
+ "epoch": 0.3333333333333333,
+ "grad_norm": 1.9710773229599,
+ "learning_rate": 1.7791245791245792e-05,
+ "loss": 1.560583472251892,
+ "mean_token_accuracy": 0.6344650983810425,
+ "num_tokens": 2703360.0,
+ "step": 165
+ },
+ {
+ "entropy": 1.0447157621383667,
+ "epoch": 0.33535353535353535,
+ "grad_norm": 1.68338942527771,
+ "learning_rate": 1.7777777777777777e-05,
+ "loss": 1.0116058588027954,
+ "mean_token_accuracy": 0.7449315786361694,
+ "num_tokens": 2719744.0,
+ "step": 166
+ },
+ {
+ "entropy": 1.3687469959259033,
+ "epoch": 0.3373737373737374,
+ "grad_norm": 2.062744617462158,
+ "learning_rate": 1.7764309764309765e-05,
+ "loss": 1.3179712295532227,
+ "mean_token_accuracy": 0.6761724352836609,
+ "num_tokens": 2736128.0,
+ "step": 167
+ },
+ {
+ "entropy": 1.8639556169509888,
+ "epoch": 0.3393939393939394,
+ "grad_norm": 2.041898250579834,
+ "learning_rate": 1.7750841750841753e-05,
+ "loss": 1.8531380891799927,
+ "mean_token_accuracy": 0.5920859575271606,
+ "num_tokens": 2752512.0,
+ "step": 168
+ },
+ {
+ "entropy": 1.6900824308395386,
+ "epoch": 0.3414141414141414,
+ "grad_norm": 1.9403504133224487,
+ "learning_rate": 1.773737373737374e-05,
+ "loss": 1.701782464981079,
+ "mean_token_accuracy": 0.6102222800254822,
+ "num_tokens": 2768896.0,
+ "step": 169
+ },
+ {
+ "entropy": 1.6202301979064941,
+ "epoch": 0.3434343434343434,
+ "grad_norm": 2.027329683303833,
+ "learning_rate": 1.7723905723905726e-05,
+ "loss": 1.6471121311187744,
+ "mean_token_accuracy": 0.6310454607009888,
+ "num_tokens": 2785280.0,
+ "step": 170
+ },
+ {
+ "entropy": 1.2701244354248047,
+ "epoch": 0.34545454545454546,
+ "grad_norm": 1.8625534772872925,
+ "learning_rate": 1.771043771043771e-05,
+ "loss": 1.291702151298523,
+ "mean_token_accuracy": 0.67659991979599,
+ "num_tokens": 2801664.0,
+ "step": 171
+ },
+ {
+ "entropy": 1.5759357213974,
+ "epoch": 0.3474747474747475,
+ "grad_norm": 1.945141077041626,
+ "learning_rate": 1.76969696969697e-05,
+ "loss": 1.6189839839935303,
+ "mean_token_accuracy": 0.6225574016571045,
+ "num_tokens": 2818048.0,
+ "step": 172
+ },
+ {
+ "entropy": 1.3319392204284668,
+ "epoch": 0.34949494949494947,
+ "grad_norm": 1.8485770225524902,
+ "learning_rate": 1.7683501683501684e-05,
+ "loss": 1.3553425073623657,
+ "mean_token_accuracy": 0.6759281754493713,
+ "num_tokens": 2834432.0,
+ "step": 173
+ },
+ {
+ "entropy": 1.3251745700836182,
+ "epoch": 0.3515151515151515,
+ "grad_norm": 2.0564401149749756,
+ "learning_rate": 1.7670033670033672e-05,
+ "loss": 1.359522819519043,
+ "mean_token_accuracy": 0.6678065657615662,
+ "num_tokens": 2850816.0,
+ "step": 174
+ },
+ {
+ "entropy": 1.2764136791229248,
+ "epoch": 0.35353535353535354,
+ "grad_norm": 2.1749041080474854,
+ "learning_rate": 1.765656565656566e-05,
+ "loss": 1.3260173797607422,
+ "mean_token_accuracy": 0.6710429787635803,
+ "num_tokens": 2867200.0,
+ "step": 175
+ },
+ {
+ "entropy": 1.6382335424423218,
+ "epoch": 0.35555555555555557,
+ "grad_norm": 1.923366904258728,
+ "learning_rate": 1.7643097643097645e-05,
+ "loss": 1.6868517398834229,
+ "mean_token_accuracy": 0.6268930435180664,
+ "num_tokens": 2883584.0,
+ "step": 176
+ },
+ {
+ "entropy": 1.2399169206619263,
+ "epoch": 0.3575757575757576,
+ "grad_norm": 1.795649766921997,
+ "learning_rate": 1.7629629629629633e-05,
+ "loss": 1.2266355752944946,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 2899968.0,
+ "step": 177
+ },
+ {
+ "entropy": 1.5761929750442505,
+ "epoch": 0.3595959595959596,
+ "grad_norm": 2.0536038875579834,
+ "learning_rate": 1.7616161616161618e-05,
+ "loss": 1.5698940753936768,
+ "mean_token_accuracy": 0.6263434290885925,
+ "num_tokens": 2916352.0,
+ "step": 178
+ },
+ {
+ "entropy": 1.3612396717071533,
+ "epoch": 0.3616161616161616,
+ "grad_norm": 2.003840684890747,
+ "learning_rate": 1.7602693602693603e-05,
+ "loss": 1.359879732131958,
+ "mean_token_accuracy": 0.6798974275588989,
+ "num_tokens": 2932736.0,
+ "step": 179
+ },
+ {
+ "entropy": 1.0548239946365356,
+ "epoch": 0.36363636363636365,
+ "grad_norm": 1.6967436075210571,
+ "learning_rate": 1.758922558922559e-05,
+ "loss": 1.040539264678955,
+ "mean_token_accuracy": 0.7433438897132874,
+ "num_tokens": 2949120.0,
+ "step": 180
+ },
+ {
+ "entropy": 1.16105055809021,
+ "epoch": 0.3656565656565657,
+ "grad_norm": 1.9793111085891724,
+ "learning_rate": 1.7575757575757576e-05,
+ "loss": 1.1532450914382935,
+ "mean_token_accuracy": 0.7135441899299622,
+ "num_tokens": 2965504.0,
+ "step": 181
+ },
+ {
+ "entropy": 1.4421862363815308,
+ "epoch": 0.36767676767676766,
+ "grad_norm": 1.8337509632110596,
+ "learning_rate": 1.7562289562289564e-05,
+ "loss": 1.419133186340332,
+ "mean_token_accuracy": 0.659807026386261,
+ "num_tokens": 2981888.0,
+ "step": 182
+ },
+ {
+ "entropy": 1.6186654567718506,
+ "epoch": 0.3696969696969697,
+ "grad_norm": 2.0585362911224365,
+ "learning_rate": 1.7548821548821552e-05,
+ "loss": 1.5880110263824463,
+ "mean_token_accuracy": 0.6322056651115417,
+ "num_tokens": 2998272.0,
+ "step": 183
+ },
+ {
+ "entropy": 1.76968252658844,
+ "epoch": 0.3717171717171717,
+ "grad_norm": 2.139742374420166,
+ "learning_rate": 1.7535353535353537e-05,
+ "loss": 1.797312617301941,
+ "mean_token_accuracy": 0.6096116304397583,
+ "num_tokens": 3014656.0,
+ "step": 184
+ },
+ {
+ "entropy": 1.0575193166732788,
+ "epoch": 0.37373737373737376,
+ "grad_norm": 1.8547794818878174,
+ "learning_rate": 1.7521885521885525e-05,
+ "loss": 1.0575863122940063,
+ "mean_token_accuracy": 0.7325354218482971,
+ "num_tokens": 3031040.0,
+ "step": 185
+ },
+ {
+ "entropy": 1.2937911748886108,
+ "epoch": 0.37575757575757573,
+ "grad_norm": 2.3985140323638916,
+ "learning_rate": 1.750841750841751e-05,
+ "loss": 1.3277016878128052,
+ "mean_token_accuracy": 0.6654860973358154,
+ "num_tokens": 3047424.0,
+ "step": 186
+ },
+ {
+ "entropy": 1.1829862594604492,
+ "epoch": 0.37777777777777777,
+ "grad_norm": 1.948241114616394,
+ "learning_rate": 1.7494949494949494e-05,
+ "loss": 1.2146751880645752,
+ "mean_token_accuracy": 0.6964460015296936,
+ "num_tokens": 3063808.0,
+ "step": 187
+ },
+ {
+ "entropy": 1.4858520030975342,
+ "epoch": 0.3797979797979798,
+ "grad_norm": 2.2712836265563965,
+ "learning_rate": 1.7481481481481483e-05,
+ "loss": 1.5523631572723389,
+ "mean_token_accuracy": 0.6392281651496887,
+ "num_tokens": 3080192.0,
+ "step": 188
+ },
+ {
+ "entropy": 1.7905362844467163,
+ "epoch": 0.38181818181818183,
+ "grad_norm": 1.890699863433838,
+ "learning_rate": 1.746801346801347e-05,
+ "loss": 1.8139519691467285,
+ "mean_token_accuracy": 0.6015510559082031,
+ "num_tokens": 3096576.0,
+ "step": 189
+ },
+ {
+ "entropy": 1.3264763355255127,
+ "epoch": 0.3838383838383838,
+ "grad_norm": 2.1567318439483643,
+ "learning_rate": 1.7454545454545456e-05,
+ "loss": 1.3780615329742432,
+ "mean_token_accuracy": 0.6636541485786438,
+ "num_tokens": 3112960.0,
+ "step": 190
+ },
+ {
+ "entropy": 1.9898782968521118,
+ "epoch": 0.38585858585858585,
+ "grad_norm": 2.008547306060791,
+ "learning_rate": 1.7441077441077444e-05,
+ "loss": 2.0208630561828613,
+ "mean_token_accuracy": 0.5498290061950684,
+ "num_tokens": 3129344.0,
+ "step": 191
+ },
+ {
+ "entropy": 1.2579785585403442,
+ "epoch": 0.3878787878787879,
+ "grad_norm": 1.921314001083374,
+ "learning_rate": 1.742760942760943e-05,
+ "loss": 1.271723985671997,
+ "mean_token_accuracy": 0.6882632970809937,
+ "num_tokens": 3145728.0,
+ "step": 192
+ },
+ {
+ "entropy": 1.3366814851760864,
+ "epoch": 0.3898989898989899,
+ "grad_norm": 1.9525961875915527,
+ "learning_rate": 1.7414141414141413e-05,
+ "loss": 1.3561700582504272,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 3162112.0,
+ "step": 193
+ },
+ {
+ "entropy": 1.5505253076553345,
+ "epoch": 0.39191919191919194,
+ "grad_norm": 2.044635057449341,
+ "learning_rate": 1.74006734006734e-05,
+ "loss": 1.5198928117752075,
+ "mean_token_accuracy": 0.6326331496238708,
+ "num_tokens": 3178496.0,
+ "step": 194
+ },
+ {
+ "entropy": 1.4198534488677979,
+ "epoch": 0.3939393939393939,
+ "grad_norm": 1.9955503940582275,
+ "learning_rate": 1.738720538720539e-05,
+ "loss": 1.4072260856628418,
+ "mean_token_accuracy": 0.6631045341491699,
+ "num_tokens": 3194880.0,
+ "step": 195
+ },
+ {
+ "entropy": 2.0099895000457764,
+ "epoch": 0.39595959595959596,
+ "grad_norm": 2.110247850418091,
+ "learning_rate": 1.7373737373737375e-05,
+ "loss": 2.0012335777282715,
+ "mean_token_accuracy": 0.5668661594390869,
+ "num_tokens": 3211264.0,
+ "step": 196
+ },
+ {
+ "entropy": 2.1619439125061035,
+ "epoch": 0.397979797979798,
+ "grad_norm": 2.0869383811950684,
+ "learning_rate": 1.7360269360269363e-05,
+ "loss": 2.1793670654296875,
+ "mean_token_accuracy": 0.5569125413894653,
+ "num_tokens": 3227648.0,
+ "step": 197
+ },
+ {
+ "entropy": 1.6383775472640991,
+ "epoch": 0.4,
+ "grad_norm": 1.7467572689056396,
+ "learning_rate": 1.7346801346801347e-05,
+ "loss": 1.656137228012085,
+ "mean_token_accuracy": 0.6395334601402283,
+ "num_tokens": 3244032.0,
+ "step": 198
+ },
+ {
+ "entropy": 1.5911450386047363,
+ "epoch": 0.402020202020202,
+ "grad_norm": 1.9362678527832031,
+ "learning_rate": 1.7333333333333336e-05,
+ "loss": 1.5865838527679443,
+ "mean_token_accuracy": 0.621275007724762,
+ "num_tokens": 3260416.0,
+ "step": 199
+ },
+ {
+ "entropy": 1.3983819484710693,
+ "epoch": 0.40404040404040403,
+ "grad_norm": 1.925863265991211,
+ "learning_rate": 1.731986531986532e-05,
+ "loss": 1.3835841417312622,
+ "mean_token_accuracy": 0.6618221998214722,
+ "num_tokens": 3276800.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.40404040404040403,
+ "eval_entropy": 1.5366105552642577,
+ "eval_loss": 1.5502140522003174,
+ "eval_mean_token_accuracy": 0.6411546406246,
+ "eval_num_tokens": 3276800.0,
+ "eval_runtime": 43.8218,
+ "eval_samples_per_second": 22.592,
+ "eval_steps_per_second": 2.83,
+ "step": 200
+ },
+ {
+ "entropy": 1.291393756866455,
+ "epoch": 0.40606060606060607,
+ "grad_norm": 1.9057531356811523,
+ "learning_rate": 1.7306397306397305e-05,
+ "loss": 1.2847933769226074,
+ "mean_token_accuracy": 0.6901563405990601,
+ "num_tokens": 3293184.0,
+ "step": 201
+ },
+ {
+ "entropy": 1.1511558294296265,
+ "epoch": 0.4080808080808081,
+ "grad_norm": 1.849436640739441,
+ "learning_rate": 1.7292929292929293e-05,
+ "loss": 1.1661030054092407,
+ "mean_token_accuracy": 0.7095139026641846,
+ "num_tokens": 3309568.0,
+ "step": 202
+ },
+ {
+ "entropy": 1.5591504573822021,
+ "epoch": 0.4101010101010101,
+ "grad_norm": 1.9354233741760254,
+ "learning_rate": 1.727946127946128e-05,
+ "loss": 1.6045410633087158,
+ "mean_token_accuracy": 0.6226795315742493,
+ "num_tokens": 3325952.0,
+ "step": 203
+ },
+ {
+ "entropy": 1.7634649276733398,
+ "epoch": 0.4121212121212121,
+ "grad_norm": 2.414632797241211,
+ "learning_rate": 1.726599326599327e-05,
+ "loss": 1.8021953105926514,
+ "mean_token_accuracy": 0.6099780201911926,
+ "num_tokens": 3342336.0,
+ "step": 204
+ },
+ {
+ "entropy": 1.6080671548843384,
+ "epoch": 0.41414141414141414,
+ "grad_norm": 1.9936028718948364,
+ "learning_rate": 1.7252525252525255e-05,
+ "loss": 1.630000352859497,
+ "mean_token_accuracy": 0.6256106495857239,
+ "num_tokens": 3358720.0,
+ "step": 205
+ },
+ {
+ "entropy": 1.6845343112945557,
+ "epoch": 0.4161616161616162,
+ "grad_norm": 1.9131947755813599,
+ "learning_rate": 1.723905723905724e-05,
+ "loss": 1.6912329196929932,
+ "mean_token_accuracy": 0.6263434290885925,
+ "num_tokens": 3375104.0,
+ "step": 206
+ },
+ {
+ "entropy": 1.5946446657180786,
+ "epoch": 0.41818181818181815,
+ "grad_norm": 2.0423905849456787,
+ "learning_rate": 1.7225589225589228e-05,
+ "loss": 1.647271752357483,
+ "mean_token_accuracy": 0.6296409368515015,
+ "num_tokens": 3391488.0,
+ "step": 207
+ },
+ {
+ "entropy": 1.3124741315841675,
+ "epoch": 0.4202020202020202,
+ "grad_norm": 1.8896982669830322,
+ "learning_rate": 1.7212121212121212e-05,
+ "loss": 1.3216124773025513,
+ "mean_token_accuracy": 0.687469482421875,
+ "num_tokens": 3407872.0,
+ "step": 208
+ },
+ {
+ "entropy": 1.3931281566619873,
+ "epoch": 0.4222222222222222,
+ "grad_norm": 1.7883074283599854,
+ "learning_rate": 1.71986531986532e-05,
+ "loss": 1.4264600276947021,
+ "mean_token_accuracy": 0.6568148732185364,
+ "num_tokens": 3424256.0,
+ "step": 209
+ },
+ {
+ "entropy": 1.1427687406539917,
+ "epoch": 0.42424242424242425,
+ "grad_norm": 1.9367003440856934,
+ "learning_rate": 1.7185185185185185e-05,
+ "loss": 1.1611723899841309,
+ "mean_token_accuracy": 0.7058500051498413,
+ "num_tokens": 3440640.0,
+ "step": 210
+ },
+ {
+ "entropy": 1.7226167917251587,
+ "epoch": 0.4262626262626263,
+ "grad_norm": 2.175487518310547,
+ "learning_rate": 1.7171717171717173e-05,
+ "loss": 1.7383192777633667,
+ "mean_token_accuracy": 0.6075964570045471,
+ "num_tokens": 3457024.0,
+ "step": 211
+ },
+ {
+ "entropy": 1.3780062198638916,
+ "epoch": 0.42828282828282827,
+ "grad_norm": 1.9817614555358887,
+ "learning_rate": 1.715824915824916e-05,
+ "loss": 1.3755927085876465,
+ "mean_token_accuracy": 0.6750732660293579,
+ "num_tokens": 3473408.0,
+ "step": 212
+ },
+ {
+ "entropy": 1.637842059135437,
+ "epoch": 0.4303030303030303,
+ "grad_norm": 2.2326242923736572,
+ "learning_rate": 1.7144781144781146e-05,
+ "loss": 1.635596752166748,
+ "mean_token_accuracy": 0.6110771894454956,
+ "num_tokens": 3489792.0,
+ "step": 213
+ },
+ {
+ "entropy": 1.9970118999481201,
+ "epoch": 0.43232323232323233,
+ "grad_norm": 2.1303606033325195,
+ "learning_rate": 1.713131313131313e-05,
+ "loss": 2.0099592208862305,
+ "mean_token_accuracy": 0.5781631469726562,
+ "num_tokens": 3506176.0,
+ "step": 214
+ },
+ {
+ "entropy": 1.4759869575500488,
+ "epoch": 0.43434343434343436,
+ "grad_norm": 2.043727397918701,
+ "learning_rate": 1.711784511784512e-05,
+ "loss": 1.4756600856781006,
+ "mean_token_accuracy": 0.6483879089355469,
+ "num_tokens": 3522560.0,
+ "step": 215
+ },
+ {
+ "entropy": 1.2833726406097412,
+ "epoch": 0.43636363636363634,
+ "grad_norm": 1.9260340929031372,
+ "learning_rate": 1.7104377104377104e-05,
+ "loss": 1.2887630462646484,
+ "mean_token_accuracy": 0.6900342106819153,
+ "num_tokens": 3538944.0,
+ "step": 216
+ },
+ {
+ "entropy": 1.3936302661895752,
+ "epoch": 0.4383838383838384,
+ "grad_norm": 1.8590774536132812,
+ "learning_rate": 1.7090909090909092e-05,
+ "loss": 1.3784823417663574,
+ "mean_token_accuracy": 0.6736077070236206,
+ "num_tokens": 3555328.0,
+ "step": 217
+ },
+ {
+ "entropy": 1.2413936853408813,
+ "epoch": 0.4404040404040404,
+ "grad_norm": 2.1111643314361572,
+ "learning_rate": 1.707744107744108e-05,
+ "loss": 1.2740635871887207,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 3571712.0,
+ "step": 218
+ },
+ {
+ "entropy": 1.4879416227340698,
+ "epoch": 0.44242424242424244,
+ "grad_norm": 2.127614736557007,
+ "learning_rate": 1.7063973063973065e-05,
+ "loss": 1.48406183719635,
+ "mean_token_accuracy": 0.649975597858429,
+ "num_tokens": 3588096.0,
+ "step": 219
+ },
+ {
+ "entropy": 1.4226471185684204,
+ "epoch": 0.4444444444444444,
+ "grad_norm": 2.164325475692749,
+ "learning_rate": 1.7050505050505054e-05,
+ "loss": 1.466269850730896,
+ "mean_token_accuracy": 0.6502808928489685,
+ "num_tokens": 3604480.0,
+ "step": 220
+ },
+ {
+ "entropy": 1.6183370351791382,
+ "epoch": 0.44646464646464645,
+ "grad_norm": 2.018846273422241,
+ "learning_rate": 1.7037037037037038e-05,
+ "loss": 1.6348307132720947,
+ "mean_token_accuracy": 0.627198338508606,
+ "num_tokens": 3620864.0,
+ "step": 221
+ },
+ {
+ "entropy": 1.6979204416275024,
+ "epoch": 0.4484848484848485,
+ "grad_norm": 2.1574854850769043,
+ "learning_rate": 1.7023569023569023e-05,
+ "loss": 1.7019602060317993,
+ "mean_token_accuracy": 0.6157181262969971,
+ "num_tokens": 3637248.0,
+ "step": 222
+ },
+ {
+ "entropy": 1.753490686416626,
+ "epoch": 0.4505050505050505,
+ "grad_norm": 2.0253705978393555,
+ "learning_rate": 1.701010101010101e-05,
+ "loss": 1.7466539144515991,
+ "mean_token_accuracy": 0.6008793115615845,
+ "num_tokens": 3653632.0,
+ "step": 223
+ },
+ {
+ "entropy": 1.717929720878601,
+ "epoch": 0.45252525252525255,
+ "grad_norm": 1.9840974807739258,
+ "learning_rate": 1.6996632996633e-05,
+ "loss": 1.703988790512085,
+ "mean_token_accuracy": 0.6099780201911926,
+ "num_tokens": 3670016.0,
+ "step": 224
+ },
+ {
+ "entropy": 1.377287745475769,
+ "epoch": 0.45454545454545453,
+ "grad_norm": 2.1027839183807373,
+ "learning_rate": 1.6983164983164984e-05,
+ "loss": 1.3902864456176758,
+ "mean_token_accuracy": 0.660906195640564,
+ "num_tokens": 3686400.0,
+ "step": 225
+ },
+ {
+ "entropy": 1.237000584602356,
+ "epoch": 0.45656565656565656,
+ "grad_norm": 1.9116249084472656,
+ "learning_rate": 1.6969696969696972e-05,
+ "loss": 1.221006155014038,
+ "mean_token_accuracy": 0.7045676708221436,
+ "num_tokens": 3702784.0,
+ "step": 226
+ },
+ {
+ "entropy": 1.4198882579803467,
+ "epoch": 0.4585858585858586,
+ "grad_norm": 2.099358558654785,
+ "learning_rate": 1.6956228956228957e-05,
+ "loss": 1.4211962223052979,
+ "mean_token_accuracy": 0.6549829244613647,
+ "num_tokens": 3719168.0,
+ "step": 227
+ },
+ {
+ "entropy": 1.4647245407104492,
+ "epoch": 0.46060606060606063,
+ "grad_norm": 1.8873655796051025,
+ "learning_rate": 1.6942760942760945e-05,
+ "loss": 1.4848006963729858,
+ "mean_token_accuracy": 0.6534562706947327,
+ "num_tokens": 3735552.0,
+ "step": 228
+ },
+ {
+ "entropy": 1.348371982574463,
+ "epoch": 0.4626262626262626,
+ "grad_norm": 2.0487565994262695,
+ "learning_rate": 1.692929292929293e-05,
+ "loss": 1.355329155921936,
+ "mean_token_accuracy": 0.6709208488464355,
+ "num_tokens": 3751936.0,
+ "step": 229
+ },
+ {
+ "entropy": 1.6201715469360352,
+ "epoch": 0.46464646464646464,
+ "grad_norm": 1.9640510082244873,
+ "learning_rate": 1.6915824915824915e-05,
+ "loss": 1.6176421642303467,
+ "mean_token_accuracy": 0.6221910119056702,
+ "num_tokens": 3768320.0,
+ "step": 230
+ },
+ {
+ "entropy": 1.461037039756775,
+ "epoch": 0.4666666666666667,
+ "grad_norm": 1.9843394756317139,
+ "learning_rate": 1.6902356902356903e-05,
+ "loss": 1.4502949714660645,
+ "mean_token_accuracy": 0.6463727355003357,
+ "num_tokens": 3784704.0,
+ "step": 231
+ },
+ {
+ "entropy": 1.4964231252670288,
+ "epoch": 0.4686868686868687,
+ "grad_norm": 2.0087051391601562,
+ "learning_rate": 1.688888888888889e-05,
+ "loss": 1.5107879638671875,
+ "mean_token_accuracy": 0.6536394953727722,
+ "num_tokens": 3801088.0,
+ "step": 232
+ },
+ {
+ "entropy": 1.3013520240783691,
+ "epoch": 0.4707070707070707,
+ "grad_norm": 2.1042368412017822,
+ "learning_rate": 1.6875420875420876e-05,
+ "loss": 1.312164306640625,
+ "mean_token_accuracy": 0.673363447189331,
+ "num_tokens": 3817472.0,
+ "step": 233
+ },
+ {
+ "entropy": 1.6242352724075317,
+ "epoch": 0.4727272727272727,
+ "grad_norm": 1.8541103601455688,
+ "learning_rate": 1.6861952861952864e-05,
+ "loss": 1.6327502727508545,
+ "mean_token_accuracy": 0.6376404762268066,
+ "num_tokens": 3833856.0,
+ "step": 234
+ },
+ {
+ "entropy": 1.4227592945098877,
+ "epoch": 0.47474747474747475,
+ "grad_norm": 1.8749339580535889,
+ "learning_rate": 1.684848484848485e-05,
+ "loss": 1.436142921447754,
+ "mean_token_accuracy": 0.6705544590950012,
+ "num_tokens": 3850240.0,
+ "step": 235
+ },
+ {
+ "entropy": 1.4807487726211548,
+ "epoch": 0.4767676767676768,
+ "grad_norm": 2.1475114822387695,
+ "learning_rate": 1.6835016835016837e-05,
+ "loss": 1.4670445919036865,
+ "mean_token_accuracy": 0.6385564208030701,
+ "num_tokens": 3866624.0,
+ "step": 236
+ },
+ {
+ "entropy": 2.0623066425323486,
+ "epoch": 0.47878787878787876,
+ "grad_norm": 2.1698546409606934,
+ "learning_rate": 1.6821548821548822e-05,
+ "loss": 2.08683180809021,
+ "mean_token_accuracy": 0.5531876087188721,
+ "num_tokens": 3883008.0,
+ "step": 237
+ },
+ {
+ "entropy": 1.6894460916519165,
+ "epoch": 0.4808080808080808,
+ "grad_norm": 2.158062219619751,
+ "learning_rate": 1.680808080808081e-05,
+ "loss": 1.7244186401367188,
+ "mean_token_accuracy": 0.6055813431739807,
+ "num_tokens": 3899392.0,
+ "step": 238
+ },
+ {
+ "entropy": 1.2741345167160034,
+ "epoch": 0.48282828282828283,
+ "grad_norm": 1.918306827545166,
+ "learning_rate": 1.67946127946128e-05,
+ "loss": 1.2937202453613281,
+ "mean_token_accuracy": 0.6878969073295593,
+ "num_tokens": 3915776.0,
+ "step": 239
+ },
+ {
+ "entropy": 1.556649088859558,
+ "epoch": 0.48484848484848486,
+ "grad_norm": 2.0560667514801025,
+ "learning_rate": 1.6781144781144783e-05,
+ "loss": 1.5751030445098877,
+ "mean_token_accuracy": 0.6324499249458313,
+ "num_tokens": 3932160.0,
+ "step": 240
+ },
+ {
+ "entropy": 1.7632875442504883,
+ "epoch": 0.4868686868686869,
+ "grad_norm": 1.8408738374710083,
+ "learning_rate": 1.6767676767676768e-05,
+ "loss": 1.7745842933654785,
+ "mean_token_accuracy": 0.6091231107711792,
+ "num_tokens": 3948544.0,
+ "step": 241
+ },
+ {
+ "entropy": 1.4793967008590698,
+ "epoch": 0.4888888888888889,
+ "grad_norm": 2.0134575366973877,
+ "learning_rate": 1.6754208754208756e-05,
+ "loss": 1.514477014541626,
+ "mean_token_accuracy": 0.6414875388145447,
+ "num_tokens": 3964928.0,
+ "step": 242
+ },
+ {
+ "entropy": 1.4762561321258545,
+ "epoch": 0.4909090909090909,
+ "grad_norm": 2.087501287460327,
+ "learning_rate": 1.674074074074074e-05,
+ "loss": 1.5195722579956055,
+ "mean_token_accuracy": 0.6289081573486328,
+ "num_tokens": 3981312.0,
+ "step": 243
+ },
+ {
+ "entropy": 1.6629496812820435,
+ "epoch": 0.49292929292929294,
+ "grad_norm": 1.7386047840118408,
+ "learning_rate": 1.672727272727273e-05,
+ "loss": 1.6932936906814575,
+ "mean_token_accuracy": 0.6289692521095276,
+ "num_tokens": 3997696.0,
+ "step": 244
+ },
+ {
+ "entropy": 1.4506888389587402,
+ "epoch": 0.494949494949495,
+ "grad_norm": 1.8268823623657227,
+ "learning_rate": 1.6713804713804714e-05,
+ "loss": 1.4257543087005615,
+ "mean_token_accuracy": 0.6678065657615662,
+ "num_tokens": 4014080.0,
+ "step": 245
+ },
+ {
+ "entropy": 1.6132714748382568,
+ "epoch": 0.49696969696969695,
+ "grad_norm": 2.168206214904785,
+ "learning_rate": 1.6700336700336702e-05,
+ "loss": 1.602414608001709,
+ "mean_token_accuracy": 0.6202979683876038,
+ "num_tokens": 4030464.0,
+ "step": 246
+ },
+ {
+ "entropy": 1.2860945463180542,
+ "epoch": 0.498989898989899,
+ "grad_norm": 1.830817699432373,
+ "learning_rate": 1.668686868686869e-05,
+ "loss": 1.284934163093567,
+ "mean_token_accuracy": 0.6854543089866638,
+ "num_tokens": 4046848.0,
+ "step": 247
+ },
+ {
+ "entropy": 1.4948641061782837,
+ "epoch": 0.501010101010101,
+ "grad_norm": 1.9775508642196655,
+ "learning_rate": 1.6673400673400675e-05,
+ "loss": 1.497206449508667,
+ "mean_token_accuracy": 0.6471055150032043,
+ "num_tokens": 4063232.0,
+ "step": 248
+ },
+ {
+ "entropy": 1.490235447883606,
+ "epoch": 0.503030303030303,
+ "grad_norm": 2.207184076309204,
+ "learning_rate": 1.665993265993266e-05,
+ "loss": 1.5091016292572021,
+ "mean_token_accuracy": 0.6482657790184021,
+ "num_tokens": 4079616.0,
+ "step": 249
+ },
+ {
+ "entropy": 1.5752832889556885,
+ "epoch": 0.5050505050505051,
+ "grad_norm": 2.0718111991882324,
+ "learning_rate": 1.6646464646464648e-05,
+ "loss": 1.576171875,
+ "mean_token_accuracy": 0.6375793814659119,
+ "num_tokens": 4096000.0,
+ "step": 250
+ },
+ {
+ "entropy": 1.3935530185699463,
+ "epoch": 0.5070707070707071,
+ "grad_norm": 1.9379569292068481,
+ "learning_rate": 1.6632996632996633e-05,
+ "loss": 1.4019020795822144,
+ "mean_token_accuracy": 0.6742794513702393,
+ "num_tokens": 4112384.0,
+ "step": 251
+ },
+ {
+ "entropy": 1.3622194528579712,
+ "epoch": 0.509090909090909,
+ "grad_norm": 1.9684133529663086,
+ "learning_rate": 1.661952861952862e-05,
+ "loss": 1.3581968545913696,
+ "mean_token_accuracy": 0.6631045341491699,
+ "num_tokens": 4128768.0,
+ "step": 252
+ },
+ {
+ "entropy": 2.1161346435546875,
+ "epoch": 0.5111111111111111,
+ "grad_norm": 1.9295378923416138,
+ "learning_rate": 1.660606060606061e-05,
+ "loss": 2.1316990852355957,
+ "mean_token_accuracy": 0.5643624663352966,
+ "num_tokens": 4145152.0,
+ "step": 253
+ },
+ {
+ "entropy": 1.4322566986083984,
+ "epoch": 0.5131313131313131,
+ "grad_norm": 2.0198557376861572,
+ "learning_rate": 1.6592592592592594e-05,
+ "loss": 1.4390883445739746,
+ "mean_token_accuracy": 0.6648143529891968,
+ "num_tokens": 4161536.0,
+ "step": 254
+ },
+ {
+ "entropy": 1.5892291069030762,
+ "epoch": 0.5151515151515151,
+ "grad_norm": 2.0127851963043213,
+ "learning_rate": 1.6579124579124582e-05,
+ "loss": 1.6437480449676514,
+ "mean_token_accuracy": 0.6223131418228149,
+ "num_tokens": 4177920.0,
+ "step": 255
+ },
+ {
+ "entropy": 1.445371150970459,
+ "epoch": 0.5171717171717172,
+ "grad_norm": 1.9758318662643433,
+ "learning_rate": 1.6565656565656567e-05,
+ "loss": 1.4749128818511963,
+ "mean_token_accuracy": 0.6457010507583618,
+ "num_tokens": 4194304.0,
+ "step": 256
+ },
+ {
+ "entropy": 1.5587478876113892,
+ "epoch": 0.5191919191919192,
+ "grad_norm": 1.918809413909912,
+ "learning_rate": 1.6552188552188552e-05,
+ "loss": 1.5739175081253052,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 4210688.0,
+ "step": 257
+ },
+ {
+ "entropy": 1.5112392902374268,
+ "epoch": 0.5212121212121212,
+ "grad_norm": 2.0176963806152344,
+ "learning_rate": 1.653872053872054e-05,
+ "loss": 1.5279680490493774,
+ "mean_token_accuracy": 0.640754759311676,
+ "num_tokens": 4227072.0,
+ "step": 258
+ },
+ {
+ "entropy": 1.4898114204406738,
+ "epoch": 0.5232323232323233,
+ "grad_norm": 2.0637850761413574,
+ "learning_rate": 1.6525252525252528e-05,
+ "loss": 1.5081419944763184,
+ "mean_token_accuracy": 0.6375183463096619,
+ "num_tokens": 4243456.0,
+ "step": 259
+ },
+ {
+ "entropy": 1.4768201112747192,
+ "epoch": 0.5252525252525253,
+ "grad_norm": 1.835053563117981,
+ "learning_rate": 1.6511784511784513e-05,
+ "loss": 1.494248390197754,
+ "mean_token_accuracy": 0.6496092081069946,
+ "num_tokens": 4259840.0,
+ "step": 260
+ },
+ {
+ "entropy": 1.655643105506897,
+ "epoch": 0.5272727272727272,
+ "grad_norm": 1.9655805826187134,
+ "learning_rate": 1.64983164983165e-05,
+ "loss": 1.6360158920288086,
+ "mean_token_accuracy": 0.6209086179733276,
+ "num_tokens": 4276224.0,
+ "step": 261
+ },
+ {
+ "entropy": 1.5621604919433594,
+ "epoch": 0.5292929292929293,
+ "grad_norm": 1.9304734468460083,
+ "learning_rate": 1.6484848484848486e-05,
+ "loss": 1.5850739479064941,
+ "mean_token_accuracy": 0.6422203183174133,
+ "num_tokens": 4292608.0,
+ "step": 262
+ },
+ {
+ "entropy": 1.592617392539978,
+ "epoch": 0.5313131313131313,
+ "grad_norm": 1.9590504169464111,
+ "learning_rate": 1.6471380471380474e-05,
+ "loss": 1.583874225616455,
+ "mean_token_accuracy": 0.6230459213256836,
+ "num_tokens": 4308992.0,
+ "step": 263
+ },
+ {
+ "entropy": 1.5268265008926392,
+ "epoch": 0.5333333333333333,
+ "grad_norm": 2.0704433917999268,
+ "learning_rate": 1.645791245791246e-05,
+ "loss": 1.5327314138412476,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 4325376.0,
+ "step": 264
+ },
+ {
+ "entropy": 1.1762311458587646,
+ "epoch": 0.5353535353535354,
+ "grad_norm": 2.0408453941345215,
+ "learning_rate": 1.6444444444444444e-05,
+ "loss": 1.1851191520690918,
+ "mean_token_accuracy": 0.7027967572212219,
+ "num_tokens": 4341760.0,
+ "step": 265
+ },
+ {
+ "entropy": 1.567710518836975,
+ "epoch": 0.5373737373737374,
+ "grad_norm": 1.8334625959396362,
+ "learning_rate": 1.6430976430976432e-05,
+ "loss": 1.564115047454834,
+ "mean_token_accuracy": 0.6340376138687134,
+ "num_tokens": 4358144.0,
+ "step": 266
+ },
+ {
+ "entropy": 1.2294297218322754,
+ "epoch": 0.5393939393939394,
+ "grad_norm": 3.5099127292633057,
+ "learning_rate": 1.641750841750842e-05,
+ "loss": 1.2887773513793945,
+ "mean_token_accuracy": 0.688629686832428,
+ "num_tokens": 4374528.0,
+ "step": 267
+ },
+ {
+ "entropy": 1.5130258798599243,
+ "epoch": 0.5414141414141415,
+ "grad_norm": 1.8295154571533203,
+ "learning_rate": 1.6404040404040405e-05,
+ "loss": 1.581455945968628,
+ "mean_token_accuracy": 0.639655590057373,
+ "num_tokens": 4390912.0,
+ "step": 268
+ },
+ {
+ "entropy": 1.6612389087677002,
+ "epoch": 0.5434343434343434,
+ "grad_norm": 2.1676483154296875,
+ "learning_rate": 1.6390572390572393e-05,
+ "loss": 1.6873081922531128,
+ "mean_token_accuracy": 0.6049095988273621,
+ "num_tokens": 4407296.0,
+ "step": 269
+ },
+ {
+ "entropy": 1.416680932044983,
+ "epoch": 0.5454545454545454,
+ "grad_norm": 2.044541358947754,
+ "learning_rate": 1.6377104377104378e-05,
+ "loss": 1.4432693719863892,
+ "mean_token_accuracy": 0.6580972075462341,
+ "num_tokens": 4423680.0,
+ "step": 270
+ },
+ {
+ "entropy": 1.6253215074539185,
+ "epoch": 0.5474747474747474,
+ "grad_norm": 2.1488161087036133,
+ "learning_rate": 1.6363636363636366e-05,
+ "loss": 1.6667883396148682,
+ "mean_token_accuracy": 0.6122373938560486,
+ "num_tokens": 4440064.0,
+ "step": 271
+ },
+ {
+ "entropy": 1.492803931236267,
+ "epoch": 0.5494949494949495,
+ "grad_norm": 2.0591108798980713,
+ "learning_rate": 1.635016835016835e-05,
+ "loss": 1.5023317337036133,
+ "mean_token_accuracy": 0.6420371532440186,
+ "num_tokens": 4456448.0,
+ "step": 272
+ },
+ {
+ "entropy": 1.5818493366241455,
+ "epoch": 0.5515151515151515,
+ "grad_norm": 1.9004875421524048,
+ "learning_rate": 1.633670033670034e-05,
+ "loss": 1.5762417316436768,
+ "mean_token_accuracy": 0.6375793814659119,
+ "num_tokens": 4472832.0,
+ "step": 273
+ },
+ {
+ "entropy": 1.2263695001602173,
+ "epoch": 0.5535353535353535,
+ "grad_norm": 1.8976677656173706,
+ "learning_rate": 1.6323232323232324e-05,
+ "loss": 1.2397428750991821,
+ "mean_token_accuracy": 0.70658278465271,
+ "num_tokens": 4489216.0,
+ "step": 274
+ },
+ {
+ "entropy": 1.370070219039917,
+ "epoch": 0.5555555555555556,
+ "grad_norm": 1.875389575958252,
+ "learning_rate": 1.6309764309764312e-05,
+ "loss": 1.3603096008300781,
+ "mean_token_accuracy": 0.6843551397323608,
+ "num_tokens": 4505600.0,
+ "step": 275
+ },
+ {
+ "entropy": 1.9219107627868652,
+ "epoch": 0.5575757575757576,
+ "grad_norm": 2.057508945465088,
+ "learning_rate": 1.6296296296296297e-05,
+ "loss": 1.9082988500595093,
+ "mean_token_accuracy": 0.5834758281707764,
+ "num_tokens": 4521984.0,
+ "step": 276
+ },
+ {
+ "entropy": 1.6965564489364624,
+ "epoch": 0.5595959595959596,
+ "grad_norm": 1.9217735528945923,
+ "learning_rate": 1.6282828282828285e-05,
+ "loss": 1.7024450302124023,
+ "mean_token_accuracy": 0.6050928235054016,
+ "num_tokens": 4538368.0,
+ "step": 277
+ },
+ {
+ "entropy": 1.7517896890640259,
+ "epoch": 0.5616161616161616,
+ "grad_norm": 2.029672145843506,
+ "learning_rate": 1.626936026936027e-05,
+ "loss": 1.7533857822418213,
+ "mean_token_accuracy": 0.5986199378967285,
+ "num_tokens": 4554752.0,
+ "step": 278
+ },
+ {
+ "entropy": 1.6086634397506714,
+ "epoch": 0.5636363636363636,
+ "grad_norm": 1.980076551437378,
+ "learning_rate": 1.6255892255892258e-05,
+ "loss": 1.5998293161392212,
+ "mean_token_accuracy": 0.6469223499298096,
+ "num_tokens": 4571136.0,
+ "step": 279
+ },
+ {
+ "entropy": 1.5670934915542603,
+ "epoch": 0.5656565656565656,
+ "grad_norm": 1.9693994522094727,
+ "learning_rate": 1.6242424242424243e-05,
+ "loss": 1.583737850189209,
+ "mean_token_accuracy": 0.6189545392990112,
+ "num_tokens": 4587520.0,
+ "step": 280
+ },
+ {
+ "entropy": 1.5290220975875854,
+ "epoch": 0.5676767676767677,
+ "grad_norm": 1.9464402198791504,
+ "learning_rate": 1.622895622895623e-05,
+ "loss": 1.523187518119812,
+ "mean_token_accuracy": 0.6289692521095276,
+ "num_tokens": 4603904.0,
+ "step": 281
+ },
+ {
+ "entropy": 1.2070591449737549,
+ "epoch": 0.5696969696969697,
+ "grad_norm": 2.1152102947235107,
+ "learning_rate": 1.621548821548822e-05,
+ "loss": 1.2107012271881104,
+ "mean_token_accuracy": 0.695652186870575,
+ "num_tokens": 4620288.0,
+ "step": 282
+ },
+ {
+ "entropy": 1.4039427042007446,
+ "epoch": 0.5717171717171717,
+ "grad_norm": 1.936285376548767,
+ "learning_rate": 1.6202020202020204e-05,
+ "loss": 1.425846815109253,
+ "mean_token_accuracy": 0.663593053817749,
+ "num_tokens": 4636672.0,
+ "step": 283
+ },
+ {
+ "entropy": 1.2910168170928955,
+ "epoch": 0.5737373737373738,
+ "grad_norm": 1.8882776498794556,
+ "learning_rate": 1.618855218855219e-05,
+ "loss": 1.3109780550003052,
+ "mean_token_accuracy": 0.6896067261695862,
+ "num_tokens": 4653056.0,
+ "step": 284
+ },
+ {
+ "entropy": 1.7089474201202393,
+ "epoch": 0.5757575757575758,
+ "grad_norm": 2.0113184452056885,
+ "learning_rate": 1.6175084175084177e-05,
+ "loss": 1.7272329330444336,
+ "mean_token_accuracy": 0.600024402141571,
+ "num_tokens": 4669440.0,
+ "step": 285
+ },
+ {
+ "entropy": 1.12257719039917,
+ "epoch": 0.5777777777777777,
+ "grad_norm": 2.0191409587860107,
+ "learning_rate": 1.616161616161616e-05,
+ "loss": 1.1193959712982178,
+ "mean_token_accuracy": 0.7199560403823853,
+ "num_tokens": 4685824.0,
+ "step": 286
+ },
+ {
+ "entropy": 1.2052935361862183,
+ "epoch": 0.5797979797979798,
+ "grad_norm": 1.9647032022476196,
+ "learning_rate": 1.614814814814815e-05,
+ "loss": 1.2192071676254272,
+ "mean_token_accuracy": 0.6977894306182861,
+ "num_tokens": 4702208.0,
+ "step": 287
+ },
+ {
+ "entropy": 1.5017658472061157,
+ "epoch": 0.5818181818181818,
+ "grad_norm": 2.0078749656677246,
+ "learning_rate": 1.6134680134680138e-05,
+ "loss": 1.5069187879562378,
+ "mean_token_accuracy": 0.6404494643211365,
+ "num_tokens": 4718592.0,
+ "step": 288
+ },
+ {
+ "entropy": 1.4429490566253662,
+ "epoch": 0.5838383838383838,
+ "grad_norm": 1.8666913509368896,
+ "learning_rate": 1.6121212121212123e-05,
+ "loss": 1.4498789310455322,
+ "mean_token_accuracy": 0.6577919125556946,
+ "num_tokens": 4734976.0,
+ "step": 289
+ },
+ {
+ "entropy": 1.216312050819397,
+ "epoch": 0.5858585858585859,
+ "grad_norm": 1.8042014837265015,
+ "learning_rate": 1.610774410774411e-05,
+ "loss": 1.2346259355545044,
+ "mean_token_accuracy": 0.7015144228935242,
+ "num_tokens": 4751360.0,
+ "step": 290
+ },
+ {
+ "entropy": 1.1411411762237549,
+ "epoch": 0.5878787878787879,
+ "grad_norm": 1.7743948698043823,
+ "learning_rate": 1.6094276094276096e-05,
+ "loss": 1.158776044845581,
+ "mean_token_accuracy": 0.7111626863479614,
+ "num_tokens": 4767744.0,
+ "step": 291
+ },
+ {
+ "entropy": 1.5691558122634888,
+ "epoch": 0.5898989898989899,
+ "grad_norm": 2.0790789127349854,
+ "learning_rate": 1.608080808080808e-05,
+ "loss": 1.5900537967681885,
+ "mean_token_accuracy": 0.6259770393371582,
+ "num_tokens": 4784128.0,
+ "step": 292
+ },
+ {
+ "entropy": 1.5600252151489258,
+ "epoch": 0.591919191919192,
+ "grad_norm": 1.8288682699203491,
+ "learning_rate": 1.606734006734007e-05,
+ "loss": 1.5642855167388916,
+ "mean_token_accuracy": 0.6497313380241394,
+ "num_tokens": 4800512.0,
+ "step": 293
+ },
+ {
+ "entropy": 1.316757082939148,
+ "epoch": 0.593939393939394,
+ "grad_norm": 2.051280975341797,
+ "learning_rate": 1.6053872053872053e-05,
+ "loss": 1.3361237049102783,
+ "mean_token_accuracy": 0.6642647981643677,
+ "num_tokens": 4816896.0,
+ "step": 294
+ },
+ {
+ "entropy": 1.4421989917755127,
+ "epoch": 0.5959595959595959,
+ "grad_norm": 2.257932662963867,
+ "learning_rate": 1.604040404040404e-05,
+ "loss": 1.4325928688049316,
+ "mean_token_accuracy": 0.6571201682090759,
+ "num_tokens": 4833280.0,
+ "step": 295
+ },
+ {
+ "entropy": 1.4986436367034912,
+ "epoch": 0.597979797979798,
+ "grad_norm": 2.0747647285461426,
+ "learning_rate": 1.602693602693603e-05,
+ "loss": 1.508068323135376,
+ "mean_token_accuracy": 0.6551050543785095,
+ "num_tokens": 4849664.0,
+ "step": 296
+ },
+ {
+ "entropy": 1.4758206605911255,
+ "epoch": 0.6,
+ "grad_norm": 1.874723196029663,
+ "learning_rate": 1.6013468013468014e-05,
+ "loss": 1.4831781387329102,
+ "mean_token_accuracy": 0.6479604244232178,
+ "num_tokens": 4866048.0,
+ "step": 297
+ },
+ {
+ "entropy": 1.8049858808517456,
+ "epoch": 0.602020202020202,
+ "grad_norm": 2.089683771133423,
+ "learning_rate": 1.6000000000000003e-05,
+ "loss": 1.8325893878936768,
+ "mean_token_accuracy": 0.5932462215423584,
+ "num_tokens": 4882432.0,
+ "step": 298
+ },
+ {
+ "entropy": 1.6346150636672974,
+ "epoch": 0.604040404040404,
+ "grad_norm": 1.9526349306106567,
+ "learning_rate": 1.5986531986531987e-05,
+ "loss": 1.6568968296051025,
+ "mean_token_accuracy": 0.6246336102485657,
+ "num_tokens": 4898816.0,
+ "step": 299
+ },
+ {
+ "entropy": 1.431725025177002,
+ "epoch": 0.6060606060606061,
+ "grad_norm": 2.109987497329712,
+ "learning_rate": 1.5973063973063972e-05,
+ "loss": 1.4448115825653076,
+ "mean_token_accuracy": 0.6481436491012573,
+ "num_tokens": 4915200.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.6060606060606061,
+ "eval_entropy": 1.524387352889584,
+ "eval_loss": 1.5324952602386475,
+ "eval_mean_token_accuracy": 0.6443250953189789,
+ "eval_num_tokens": 4915200.0,
+ "eval_runtime": 43.7714,
+ "eval_samples_per_second": 22.618,
+ "eval_steps_per_second": 2.833,
+ "step": 300
+ },
+ {
+ "entropy": 1.4816409349441528,
+ "epoch": 0.6080808080808081,
+ "grad_norm": 3.3732845783233643,
+ "learning_rate": 1.595959595959596e-05,
+ "loss": 1.4913065433502197,
+ "mean_token_accuracy": 0.658707857131958,
+ "num_tokens": 4931584.0,
+ "step": 301
+ },
+ {
+ "entropy": 1.4020944833755493,
+ "epoch": 0.6101010101010101,
+ "grad_norm": 2.1152141094207764,
+ "learning_rate": 1.594612794612795e-05,
+ "loss": 1.4000526666641235,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 4947968.0,
+ "step": 302
+ },
+ {
+ "entropy": 1.4965202808380127,
+ "epoch": 0.6121212121212121,
+ "grad_norm": 2.1385467052459717,
+ "learning_rate": 1.5932659932659933e-05,
+ "loss": 1.5221803188323975,
+ "mean_token_accuracy": 0.6567537784576416,
+ "num_tokens": 4964352.0,
+ "step": 303
+ },
+ {
+ "entropy": 1.4024577140808105,
+ "epoch": 0.6141414141414141,
+ "grad_norm": 1.9162694215774536,
+ "learning_rate": 1.591919191919192e-05,
+ "loss": 1.4050084352493286,
+ "mean_token_accuracy": 0.6670737862586975,
+ "num_tokens": 4980736.0,
+ "step": 304
+ },
+ {
+ "entropy": 1.430273413658142,
+ "epoch": 0.6161616161616161,
+ "grad_norm": 2.0312552452087402,
+ "learning_rate": 1.5905723905723906e-05,
+ "loss": 1.418628454208374,
+ "mean_token_accuracy": 0.6585857272148132,
+ "num_tokens": 4997120.0,
+ "step": 305
+ },
+ {
+ "entropy": 1.700549602508545,
+ "epoch": 0.6181818181818182,
+ "grad_norm": 2.080810546875,
+ "learning_rate": 1.5892255892255895e-05,
+ "loss": 1.740492820739746,
+ "mean_token_accuracy": 0.6042989492416382,
+ "num_tokens": 5013504.0,
+ "step": 306
+ },
+ {
+ "entropy": 1.6465320587158203,
+ "epoch": 0.6202020202020202,
+ "grad_norm": 1.8810964822769165,
+ "learning_rate": 1.587878787878788e-05,
+ "loss": 1.6414886713027954,
+ "mean_token_accuracy": 0.629824161529541,
+ "num_tokens": 5029888.0,
+ "step": 307
+ },
+ {
+ "entropy": 1.3717931509017944,
+ "epoch": 0.6222222222222222,
+ "grad_norm": 1.921536922454834,
+ "learning_rate": 1.5865319865319868e-05,
+ "loss": 1.3700361251831055,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 5046272.0,
+ "step": 308
+ },
+ {
+ "entropy": 1.4906446933746338,
+ "epoch": 0.6242424242424243,
+ "grad_norm": 2.1185555458068848,
+ "learning_rate": 1.5851851851851852e-05,
+ "loss": 1.4850339889526367,
+ "mean_token_accuracy": 0.6402662396430969,
+ "num_tokens": 5062656.0,
+ "step": 309
+ },
+ {
+ "entropy": 1.4417473077774048,
+ "epoch": 0.6262626262626263,
+ "grad_norm": 2.0196895599365234,
+ "learning_rate": 1.583838383838384e-05,
+ "loss": 1.4567816257476807,
+ "mean_token_accuracy": 0.6760503053665161,
+ "num_tokens": 5079040.0,
+ "step": 310
+ },
+ {
+ "entropy": 1.4662094116210938,
+ "epoch": 0.6282828282828283,
+ "grad_norm": 1.8859882354736328,
+ "learning_rate": 1.5824915824915825e-05,
+ "loss": 1.4870874881744385,
+ "mean_token_accuracy": 0.6618221998214722,
+ "num_tokens": 5095424.0,
+ "step": 311
+ },
+ {
+ "entropy": 1.8497077226638794,
+ "epoch": 0.6303030303030303,
+ "grad_norm": 1.974537968635559,
+ "learning_rate": 1.5811447811447813e-05,
+ "loss": 1.840538501739502,
+ "mean_token_accuracy": 0.589093804359436,
+ "num_tokens": 5111808.0,
+ "step": 312
+ },
+ {
+ "entropy": 1.4185130596160889,
+ "epoch": 0.6323232323232323,
+ "grad_norm": 1.8612359762191772,
+ "learning_rate": 1.5797979797979798e-05,
+ "loss": 1.4404246807098389,
+ "mean_token_accuracy": 0.664631187915802,
+ "num_tokens": 5128192.0,
+ "step": 313
+ },
+ {
+ "entropy": 1.8270463943481445,
+ "epoch": 0.6343434343434343,
+ "grad_norm": 2.1050970554351807,
+ "learning_rate": 1.5784511784511786e-05,
+ "loss": 1.8682940006256104,
+ "mean_token_accuracy": 0.5893380641937256,
+ "num_tokens": 5144576.0,
+ "step": 314
+ },
+ {
+ "entropy": 1.5919326543807983,
+ "epoch": 0.6363636363636364,
+ "grad_norm": 1.8464620113372803,
+ "learning_rate": 1.577104377104377e-05,
+ "loss": 1.6087713241577148,
+ "mean_token_accuracy": 0.6350146532058716,
+ "num_tokens": 5160960.0,
+ "step": 315
+ },
+ {
+ "entropy": 1.4776946306228638,
+ "epoch": 0.6383838383838384,
+ "grad_norm": 2.031834602355957,
+ "learning_rate": 1.575757575757576e-05,
+ "loss": 1.5114507675170898,
+ "mean_token_accuracy": 0.6498534679412842,
+ "num_tokens": 5177344.0,
+ "step": 316
+ },
+ {
+ "entropy": 1.3789927959442139,
+ "epoch": 0.6404040404040404,
+ "grad_norm": 1.8604289293289185,
+ "learning_rate": 1.5744107744107748e-05,
+ "loss": 1.3792052268981934,
+ "mean_token_accuracy": 0.6712262034416199,
+ "num_tokens": 5193728.0,
+ "step": 317
+ },
+ {
+ "entropy": 1.5859184265136719,
+ "epoch": 0.6424242424242425,
+ "grad_norm": 2.1134088039398193,
+ "learning_rate": 1.5730639730639732e-05,
+ "loss": 1.595099925994873,
+ "mean_token_accuracy": 0.6351367831230164,
+ "num_tokens": 5210112.0,
+ "step": 318
+ },
+ {
+ "entropy": 1.3681901693344116,
+ "epoch": 0.6444444444444445,
+ "grad_norm": 1.9200235605239868,
+ "learning_rate": 1.5717171717171717e-05,
+ "loss": 1.3700852394104004,
+ "mean_token_accuracy": 0.6671959161758423,
+ "num_tokens": 5226496.0,
+ "step": 319
+ },
+ {
+ "entropy": 1.594885230064392,
+ "epoch": 0.6464646464646465,
+ "grad_norm": 1.7683591842651367,
+ "learning_rate": 1.5703703703703705e-05,
+ "loss": 1.5906047821044922,
+ "mean_token_accuracy": 0.6350757479667664,
+ "num_tokens": 5242880.0,
+ "step": 320
+ },
+ {
+ "entropy": 1.240937352180481,
+ "epoch": 0.6484848484848484,
+ "grad_norm": 2.117145299911499,
+ "learning_rate": 1.569023569023569e-05,
+ "loss": 1.2188963890075684,
+ "mean_token_accuracy": 0.6958353519439697,
+ "num_tokens": 5259264.0,
+ "step": 321
+ },
+ {
+ "entropy": 1.244801640510559,
+ "epoch": 0.6505050505050505,
+ "grad_norm": 1.983111023902893,
+ "learning_rate": 1.5676767676767678e-05,
+ "loss": 1.246530294418335,
+ "mean_token_accuracy": 0.6966902613639832,
+ "num_tokens": 5275648.0,
+ "step": 322
+ },
+ {
+ "entropy": 1.5355960130691528,
+ "epoch": 0.6525252525252525,
+ "grad_norm": 2.126024007797241,
+ "learning_rate": 1.5663299663299666e-05,
+ "loss": 1.576147198677063,
+ "mean_token_accuracy": 0.6414265036582947,
+ "num_tokens": 5292032.0,
+ "step": 323
+ },
+ {
+ "entropy": 1.13125741481781,
+ "epoch": 0.6545454545454545,
+ "grad_norm": 1.8933371305465698,
+ "learning_rate": 1.564983164983165e-05,
+ "loss": 1.1167645454406738,
+ "mean_token_accuracy": 0.7080483436584473,
+ "num_tokens": 5308416.0,
+ "step": 324
+ },
+ {
+ "entropy": 1.6553086042404175,
+ "epoch": 0.6565656565656566,
+ "grad_norm": 1.9253427982330322,
+ "learning_rate": 1.563636363636364e-05,
+ "loss": 1.6746933460235596,
+ "mean_token_accuracy": 0.6138250827789307,
+ "num_tokens": 5324800.0,
+ "step": 325
+ },
+ {
+ "entropy": 1.7187142372131348,
+ "epoch": 0.6585858585858586,
+ "grad_norm": 1.8655303716659546,
+ "learning_rate": 1.5622895622895624e-05,
+ "loss": 1.7368483543395996,
+ "mean_token_accuracy": 0.6073521971702576,
+ "num_tokens": 5341184.0,
+ "step": 326
+ },
+ {
+ "entropy": 1.4150934219360352,
+ "epoch": 0.6606060606060606,
+ "grad_norm": 1.8396921157836914,
+ "learning_rate": 1.560942760942761e-05,
+ "loss": 1.450613260269165,
+ "mean_token_accuracy": 0.6628602743148804,
+ "num_tokens": 5357568.0,
+ "step": 327
+ },
+ {
+ "entropy": 1.6463909149169922,
+ "epoch": 0.6626262626262627,
+ "grad_norm": 2.0179622173309326,
+ "learning_rate": 1.5595959595959597e-05,
+ "loss": 1.6767137050628662,
+ "mean_token_accuracy": 0.6147410869598389,
+ "num_tokens": 5373952.0,
+ "step": 328
+ },
+ {
+ "entropy": 1.2962068319320679,
+ "epoch": 0.6646464646464646,
+ "grad_norm": 1.9322903156280518,
+ "learning_rate": 1.5582491582491582e-05,
+ "loss": 1.288381814956665,
+ "mean_token_accuracy": 0.6877137422561646,
+ "num_tokens": 5390336.0,
+ "step": 329
+ },
+ {
+ "entropy": 1.4675830602645874,
+ "epoch": 0.6666666666666666,
+ "grad_norm": 1.7735666036605835,
+ "learning_rate": 1.556902356902357e-05,
+ "loss": 1.4585455656051636,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 5406720.0,
+ "step": 330
+ },
+ {
+ "entropy": 1.55418062210083,
+ "epoch": 0.6686868686868687,
+ "grad_norm": 1.9255602359771729,
+ "learning_rate": 1.555555555555556e-05,
+ "loss": 1.6033880710601807,
+ "mean_token_accuracy": 0.6486321687698364,
+ "num_tokens": 5423104.0,
+ "step": 331
+ },
+ {
+ "entropy": 1.4288218021392822,
+ "epoch": 0.6707070707070707,
+ "grad_norm": 1.8075612783432007,
+ "learning_rate": 1.5542087542087543e-05,
+ "loss": 1.457895278930664,
+ "mean_token_accuracy": 0.6725085377693176,
+ "num_tokens": 5439488.0,
+ "step": 332
+ },
+ {
+ "entropy": 1.3419297933578491,
+ "epoch": 0.6727272727272727,
+ "grad_norm": 2.1730353832244873,
+ "learning_rate": 1.552861952861953e-05,
+ "loss": 1.3681403398513794,
+ "mean_token_accuracy": 0.6664020419120789,
+ "num_tokens": 5455872.0,
+ "step": 333
+ },
+ {
+ "entropy": 1.706923007965088,
+ "epoch": 0.6747474747474748,
+ "grad_norm": 1.9297505617141724,
+ "learning_rate": 1.5515151515151516e-05,
+ "loss": 1.7304211854934692,
+ "mean_token_accuracy": 0.6020395755767822,
+ "num_tokens": 5472256.0,
+ "step": 334
+ },
+ {
+ "entropy": 1.117404818534851,
+ "epoch": 0.6767676767676768,
+ "grad_norm": 1.7363555431365967,
+ "learning_rate": 1.55016835016835e-05,
+ "loss": 1.1002353429794312,
+ "mean_token_accuracy": 0.7285661697387695,
+ "num_tokens": 5488640.0,
+ "step": 335
+ },
+ {
+ "entropy": 1.409253478050232,
+ "epoch": 0.6787878787878788,
+ "grad_norm": 2.029304265975952,
+ "learning_rate": 1.548821548821549e-05,
+ "loss": 1.4001437425613403,
+ "mean_token_accuracy": 0.6604176759719849,
+ "num_tokens": 5505024.0,
+ "step": 336
+ },
+ {
+ "entropy": 1.0427494049072266,
+ "epoch": 0.6808080808080809,
+ "grad_norm": 2.0266847610473633,
+ "learning_rate": 1.5474747474747477e-05,
+ "loss": 1.0636063814163208,
+ "mean_token_accuracy": 0.7298485636711121,
+ "num_tokens": 5521408.0,
+ "step": 337
+ },
+ {
+ "entropy": 1.479506254196167,
+ "epoch": 0.6828282828282828,
+ "grad_norm": 1.937677264213562,
+ "learning_rate": 1.5461279461279462e-05,
+ "loss": 1.4711894989013672,
+ "mean_token_accuracy": 0.6436248421669006,
+ "num_tokens": 5537792.0,
+ "step": 338
+ },
+ {
+ "entropy": 1.636492371559143,
+ "epoch": 0.6848484848484848,
+ "grad_norm": 1.9746829271316528,
+ "learning_rate": 1.544781144781145e-05,
+ "loss": 1.638418436050415,
+ "mean_token_accuracy": 0.6204200983047485,
+ "num_tokens": 5554176.0,
+ "step": 339
+ },
+ {
+ "entropy": 1.6094971895217896,
+ "epoch": 0.6868686868686869,
+ "grad_norm": 1.998382806777954,
+ "learning_rate": 1.5434343434343435e-05,
+ "loss": 1.6025879383087158,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 5570560.0,
+ "step": 340
+ },
+ {
+ "entropy": 1.3113542795181274,
+ "epoch": 0.6888888888888889,
+ "grad_norm": 2.059739589691162,
+ "learning_rate": 1.5420875420875423e-05,
+ "loss": 1.32335364818573,
+ "mean_token_accuracy": 0.6776379942893982,
+ "num_tokens": 5586944.0,
+ "step": 341
+ },
+ {
+ "entropy": 1.3761622905731201,
+ "epoch": 0.6909090909090909,
+ "grad_norm": 1.9774043560028076,
+ "learning_rate": 1.5407407407407408e-05,
+ "loss": 1.3731458187103271,
+ "mean_token_accuracy": 0.681546151638031,
+ "num_tokens": 5603328.0,
+ "step": 342
+ },
+ {
+ "entropy": 1.3822734355926514,
+ "epoch": 0.692929292929293,
+ "grad_norm": 5.41459321975708,
+ "learning_rate": 1.5393939393939393e-05,
+ "loss": 1.4077341556549072,
+ "mean_token_accuracy": 0.6688446402549744,
+ "num_tokens": 5619712.0,
+ "step": 343
+ },
+ {
+ "entropy": 1.4885843992233276,
+ "epoch": 0.694949494949495,
+ "grad_norm": 1.9256173372268677,
+ "learning_rate": 1.538047138047138e-05,
+ "loss": 1.5017898082733154,
+ "mean_token_accuracy": 0.6411211490631104,
+ "num_tokens": 5636096.0,
+ "step": 344
+ },
+ {
+ "entropy": 1.4558689594268799,
+ "epoch": 0.696969696969697,
+ "grad_norm": 1.923056721687317,
+ "learning_rate": 1.536700336700337e-05,
+ "loss": 1.4409637451171875,
+ "mean_token_accuracy": 0.6607840657234192,
+ "num_tokens": 5652480.0,
+ "step": 345
+ },
+ {
+ "entropy": 1.3396257162094116,
+ "epoch": 0.6989898989898989,
+ "grad_norm": 1.9321191310882568,
+ "learning_rate": 1.5353535353535354e-05,
+ "loss": 1.3465441465377808,
+ "mean_token_accuracy": 0.6682339906692505,
+ "num_tokens": 5668864.0,
+ "step": 346
+ },
+ {
+ "entropy": 1.931525468826294,
+ "epoch": 0.701010101010101,
+ "grad_norm": 2.11252498626709,
+ "learning_rate": 1.5340067340067342e-05,
+ "loss": 1.947523832321167,
+ "mean_token_accuracy": 0.5751709938049316,
+ "num_tokens": 5685248.0,
+ "step": 347
+ },
+ {
+ "entropy": 1.4246045351028442,
+ "epoch": 0.703030303030303,
+ "grad_norm": 2.017690658569336,
+ "learning_rate": 1.5326599326599327e-05,
+ "loss": 1.431095004081726,
+ "mean_token_accuracy": 0.6621274948120117,
+ "num_tokens": 5701632.0,
+ "step": 348
+ },
+ {
+ "entropy": 1.2840481996536255,
+ "epoch": 0.705050505050505,
+ "grad_norm": 1.897916555404663,
+ "learning_rate": 1.5313131313131315e-05,
+ "loss": 1.2944300174713135,
+ "mean_token_accuracy": 0.7013311982154846,
+ "num_tokens": 5718016.0,
+ "step": 349
+ },
+ {
+ "entropy": 1.1308226585388184,
+ "epoch": 0.7070707070707071,
+ "grad_norm": 1.8326802253723145,
+ "learning_rate": 1.52996632996633e-05,
+ "loss": 1.1564277410507202,
+ "mean_token_accuracy": 0.714154839515686,
+ "num_tokens": 5734400.0,
+ "step": 350
+ },
+ {
+ "entropy": 1.4157475233078003,
+ "epoch": 0.7090909090909091,
+ "grad_norm": 1.9305709600448608,
+ "learning_rate": 1.5286195286195288e-05,
+ "loss": 1.421119213104248,
+ "mean_token_accuracy": 0.6651197075843811,
+ "num_tokens": 5750784.0,
+ "step": 351
+ },
+ {
+ "entropy": 1.353966474533081,
+ "epoch": 0.7111111111111111,
+ "grad_norm": 2.058542251586914,
+ "learning_rate": 1.5272727272727276e-05,
+ "loss": 1.3575413227081299,
+ "mean_token_accuracy": 0.6724475026130676,
+ "num_tokens": 5767168.0,
+ "step": 352
+ },
+ {
+ "entropy": 1.7946882247924805,
+ "epoch": 0.7131313131313132,
+ "grad_norm": 1.9397060871124268,
+ "learning_rate": 1.525925925925926e-05,
+ "loss": 1.7882269620895386,
+ "mean_token_accuracy": 0.6064972877502441,
+ "num_tokens": 5783552.0,
+ "step": 353
+ },
+ {
+ "entropy": 1.4986019134521484,
+ "epoch": 0.7151515151515152,
+ "grad_norm": 1.9084810018539429,
+ "learning_rate": 1.5245791245791246e-05,
+ "loss": 1.5188498497009277,
+ "mean_token_accuracy": 0.6610283255577087,
+ "num_tokens": 5799936.0,
+ "step": 354
+ },
+ {
+ "entropy": 1.9081071615219116,
+ "epoch": 0.7171717171717171,
+ "grad_norm": 2.1528689861297607,
+ "learning_rate": 1.5232323232323234e-05,
+ "loss": 1.8967041969299316,
+ "mean_token_accuracy": 0.5691255331039429,
+ "num_tokens": 5816320.0,
+ "step": 355
+ },
+ {
+ "entropy": 1.641337513923645,
+ "epoch": 0.7191919191919192,
+ "grad_norm": 1.9197942018508911,
+ "learning_rate": 1.521885521885522e-05,
+ "loss": 1.6193110942840576,
+ "mean_token_accuracy": 0.6286638975143433,
+ "num_tokens": 5832704.0,
+ "step": 356
+ },
+ {
+ "entropy": 1.348304271697998,
+ "epoch": 0.7212121212121212,
+ "grad_norm": 1.9729533195495605,
+ "learning_rate": 1.5205387205387207e-05,
+ "loss": 1.3781111240386963,
+ "mean_token_accuracy": 0.6654250025749207,
+ "num_tokens": 5849088.0,
+ "step": 357
+ },
+ {
+ "entropy": 1.5427544116973877,
+ "epoch": 0.7232323232323232,
+ "grad_norm": 2.0730769634246826,
+ "learning_rate": 1.5191919191919193e-05,
+ "loss": 1.5770654678344727,
+ "mean_token_accuracy": 0.6273815631866455,
+ "num_tokens": 5865472.0,
+ "step": 358
+ },
+ {
+ "entropy": 1.5560660362243652,
+ "epoch": 0.7252525252525253,
+ "grad_norm": 2.0436644554138184,
+ "learning_rate": 1.5178451178451178e-05,
+ "loss": 1.5465143918991089,
+ "mean_token_accuracy": 0.6335490942001343,
+ "num_tokens": 5881856.0,
+ "step": 359
+ },
+ {
+ "entropy": 1.5396223068237305,
+ "epoch": 0.7272727272727273,
+ "grad_norm": 1.9955254793167114,
+ "learning_rate": 1.5164983164983166e-05,
+ "loss": 1.5742223262786865,
+ "mean_token_accuracy": 0.6344650983810425,
+ "num_tokens": 5898240.0,
+ "step": 360
+ },
+ {
+ "entropy": 1.1664644479751587,
+ "epoch": 0.7292929292929293,
+ "grad_norm": 1.6942992210388184,
+ "learning_rate": 1.5151515151515153e-05,
+ "loss": 1.159040927886963,
+ "mean_token_accuracy": 0.7144601941108704,
+ "num_tokens": 5914624.0,
+ "step": 361
+ },
+ {
+ "entropy": 1.356544017791748,
+ "epoch": 0.7313131313131314,
+ "grad_norm": 1.890787124633789,
+ "learning_rate": 1.5138047138047138e-05,
+ "loss": 1.347895622253418,
+ "mean_token_accuracy": 0.6813629865646362,
+ "num_tokens": 5931008.0,
+ "step": 362
+ },
+ {
+ "entropy": 1.6837173700332642,
+ "epoch": 0.7333333333333333,
+ "grad_norm": 2.1780381202697754,
+ "learning_rate": 1.5124579124579126e-05,
+ "loss": 1.6997990608215332,
+ "mean_token_accuracy": 0.6098558902740479,
+ "num_tokens": 5947392.0,
+ "step": 363
+ },
+ {
+ "entropy": 1.1412957906723022,
+ "epoch": 0.7353535353535353,
+ "grad_norm": 1.801152229309082,
+ "learning_rate": 1.5111111111111112e-05,
+ "loss": 1.161649227142334,
+ "mean_token_accuracy": 0.705483615398407,
+ "num_tokens": 5963776.0,
+ "step": 364
+ },
+ {
+ "entropy": 1.2495859861373901,
+ "epoch": 0.7373737373737373,
+ "grad_norm": 1.8535690307617188,
+ "learning_rate": 1.50976430976431e-05,
+ "loss": 1.2595994472503662,
+ "mean_token_accuracy": 0.6926599740982056,
+ "num_tokens": 5980160.0,
+ "step": 365
+ },
+ {
+ "entropy": 1.8037965297698975,
+ "epoch": 0.7393939393939394,
+ "grad_norm": 2.0506303310394287,
+ "learning_rate": 1.5084175084175085e-05,
+ "loss": 1.8499953746795654,
+ "mean_token_accuracy": 0.5861626863479614,
+ "num_tokens": 5996544.0,
+ "step": 366
+ },
+ {
+ "entropy": 1.2877405881881714,
+ "epoch": 0.7414141414141414,
+ "grad_norm": 1.8159914016723633,
+ "learning_rate": 1.5070707070707072e-05,
+ "loss": 1.3165576457977295,
+ "mean_token_accuracy": 0.685271143913269,
+ "num_tokens": 6012928.0,
+ "step": 367
+ },
+ {
+ "entropy": 1.345953106880188,
+ "epoch": 0.7434343434343434,
+ "grad_norm": 2.003962516784668,
+ "learning_rate": 1.505723905723906e-05,
+ "loss": 1.3270621299743652,
+ "mean_token_accuracy": 0.6671348214149475,
+ "num_tokens": 6029312.0,
+ "step": 368
+ },
+ {
+ "entropy": 1.408361792564392,
+ "epoch": 0.7454545454545455,
+ "grad_norm": 1.9815948009490967,
+ "learning_rate": 1.5043771043771045e-05,
+ "loss": 1.4097518920898438,
+ "mean_token_accuracy": 0.652662456035614,
+ "num_tokens": 6045696.0,
+ "step": 369
+ },
+ {
+ "entropy": 1.4007829427719116,
+ "epoch": 0.7474747474747475,
+ "grad_norm": 1.928751826286316,
+ "learning_rate": 1.5030303030303031e-05,
+ "loss": 1.4142816066741943,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 6062080.0,
+ "step": 370
+ },
+ {
+ "entropy": 1.7548134326934814,
+ "epoch": 0.7494949494949495,
+ "grad_norm": 2.081939458847046,
+ "learning_rate": 1.5016835016835018e-05,
+ "loss": 1.792219877243042,
+ "mean_token_accuracy": 0.6044821739196777,
+ "num_tokens": 6078464.0,
+ "step": 371
+ },
+ {
+ "entropy": 1.6162793636322021,
+ "epoch": 0.7515151515151515,
+ "grad_norm": 1.8544763326644897,
+ "learning_rate": 1.5003367003367004e-05,
+ "loss": 1.650557041168213,
+ "mean_token_accuracy": 0.6289692521095276,
+ "num_tokens": 6094848.0,
+ "step": 372
+ },
+ {
+ "entropy": 1.6329439878463745,
+ "epoch": 0.7535353535353535,
+ "grad_norm": 1.8025282621383667,
+ "learning_rate": 1.4989898989898992e-05,
+ "loss": 1.6812629699707031,
+ "mean_token_accuracy": 0.6405104994773865,
+ "num_tokens": 6111232.0,
+ "step": 373
+ },
+ {
+ "entropy": 1.2201604843139648,
+ "epoch": 0.7555555555555555,
+ "grad_norm": 1.9814586639404297,
+ "learning_rate": 1.4976430976430977e-05,
+ "loss": 1.2086223363876343,
+ "mean_token_accuracy": 0.7020029425621033,
+ "num_tokens": 6127616.0,
+ "step": 374
+ },
+ {
+ "entropy": 1.8105695247650146,
+ "epoch": 0.7575757575757576,
+ "grad_norm": 2.0217790603637695,
+ "learning_rate": 1.4962962962962964e-05,
+ "loss": 1.8443559408187866,
+ "mean_token_accuracy": 0.5897654891014099,
+ "num_tokens": 6144000.0,
+ "step": 375
+ },
+ {
+ "entropy": 1.197646141052246,
+ "epoch": 0.7595959595959596,
+ "grad_norm": 1.9286304712295532,
+ "learning_rate": 1.4949494949494952e-05,
+ "loss": 1.2183899879455566,
+ "mean_token_accuracy": 0.6925989389419556,
+ "num_tokens": 6160384.0,
+ "step": 376
+ },
+ {
+ "entropy": 1.4825936555862427,
+ "epoch": 0.7616161616161616,
+ "grad_norm": 1.6694327592849731,
+ "learning_rate": 1.4936026936026937e-05,
+ "loss": 1.4815235137939453,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 6176768.0,
+ "step": 377
+ },
+ {
+ "entropy": 1.3497473001480103,
+ "epoch": 0.7636363636363637,
+ "grad_norm": 2.0366406440734863,
+ "learning_rate": 1.4922558922558923e-05,
+ "loss": 1.3637127876281738,
+ "mean_token_accuracy": 0.6690889000892639,
+ "num_tokens": 6193152.0,
+ "step": 378
+ },
+ {
+ "entropy": 1.314116358757019,
+ "epoch": 0.7656565656565657,
+ "grad_norm": 1.742874026298523,
+ "learning_rate": 1.4909090909090911e-05,
+ "loss": 1.300222396850586,
+ "mean_token_accuracy": 0.6977283954620361,
+ "num_tokens": 6209536.0,
+ "step": 379
+ },
+ {
+ "entropy": 1.4347912073135376,
+ "epoch": 0.7676767676767676,
+ "grad_norm": 1.9317418336868286,
+ "learning_rate": 1.4895622895622896e-05,
+ "loss": 1.429826021194458,
+ "mean_token_accuracy": 0.6650586128234863,
+ "num_tokens": 6225920.0,
+ "step": 380
+ },
+ {
+ "entropy": 1.448641061782837,
+ "epoch": 0.7696969696969697,
+ "grad_norm": 1.8417843580245972,
+ "learning_rate": 1.4882154882154884e-05,
+ "loss": 1.4439187049865723,
+ "mean_token_accuracy": 0.6615168452262878,
+ "num_tokens": 6242304.0,
+ "step": 381
+ },
+ {
+ "entropy": 1.2918578386306763,
+ "epoch": 0.7717171717171717,
+ "grad_norm": 1.8720030784606934,
+ "learning_rate": 1.486868686868687e-05,
+ "loss": 1.3158597946166992,
+ "mean_token_accuracy": 0.6865534782409668,
+ "num_tokens": 6258688.0,
+ "step": 382
+ },
+ {
+ "entropy": 1.5822116136550903,
+ "epoch": 0.7737373737373737,
+ "grad_norm": 1.9301713705062866,
+ "learning_rate": 1.4855218855218856e-05,
+ "loss": 1.6046046018600464,
+ "mean_token_accuracy": 0.6361138224601746,
+ "num_tokens": 6275072.0,
+ "step": 383
+ },
+ {
+ "entropy": 1.6837408542633057,
+ "epoch": 0.7757575757575758,
+ "grad_norm": 2.270636796951294,
+ "learning_rate": 1.4841750841750844e-05,
+ "loss": 1.7323150634765625,
+ "mean_token_accuracy": 0.6006350517272949,
+ "num_tokens": 6291456.0,
+ "step": 384
+ },
+ {
+ "entropy": 1.4837889671325684,
+ "epoch": 0.7777777777777778,
+ "grad_norm": 1.908146619796753,
+ "learning_rate": 1.482828282828283e-05,
+ "loss": 1.4938652515411377,
+ "mean_token_accuracy": 0.64667809009552,
+ "num_tokens": 6307840.0,
+ "step": 385
+ },
+ {
+ "entropy": 1.680192232131958,
+ "epoch": 0.7797979797979798,
+ "grad_norm": 2.2369024753570557,
+ "learning_rate": 1.4814814814814815e-05,
+ "loss": 1.692443609237671,
+ "mean_token_accuracy": 0.6279922127723694,
+ "num_tokens": 6324224.0,
+ "step": 386
+ },
+ {
+ "entropy": 1.686415195465088,
+ "epoch": 0.7818181818181819,
+ "grad_norm": 1.8252373933792114,
+ "learning_rate": 1.4801346801346803e-05,
+ "loss": 1.7022712230682373,
+ "mean_token_accuracy": 0.6302515864372253,
+ "num_tokens": 6340608.0,
+ "step": 387
+ },
+ {
+ "entropy": 1.6967185735702515,
+ "epoch": 0.7838383838383839,
+ "grad_norm": 2.102458953857422,
+ "learning_rate": 1.478787878787879e-05,
+ "loss": 1.6931922435760498,
+ "mean_token_accuracy": 0.6149853467941284,
+ "num_tokens": 6356992.0,
+ "step": 388
+ },
+ {
+ "entropy": 1.201438307762146,
+ "epoch": 0.7858585858585858,
+ "grad_norm": 1.8396239280700684,
+ "learning_rate": 1.4774410774410774e-05,
+ "loss": 1.2081820964813232,
+ "mean_token_accuracy": 0.6987664699554443,
+ "num_tokens": 6373376.0,
+ "step": 389
+ },
+ {
+ "entropy": 1.5559548139572144,
+ "epoch": 0.7878787878787878,
+ "grad_norm": 2.063498020172119,
+ "learning_rate": 1.4760942760942763e-05,
+ "loss": 1.545433759689331,
+ "mean_token_accuracy": 0.6267709136009216,
+ "num_tokens": 6389760.0,
+ "step": 390
+ },
+ {
+ "entropy": 1.7186503410339355,
+ "epoch": 0.7898989898989899,
+ "grad_norm": 2.0129787921905518,
+ "learning_rate": 1.4747474747474747e-05,
+ "loss": 1.717472791671753,
+ "mean_token_accuracy": 0.6540058851242065,
+ "num_tokens": 6406144.0,
+ "step": 391
+ },
+ {
+ "entropy": 1.643048882484436,
+ "epoch": 0.7919191919191919,
+ "grad_norm": 1.9443073272705078,
+ "learning_rate": 1.4734006734006736e-05,
+ "loss": 1.6441841125488281,
+ "mean_token_accuracy": 0.6458231806755066,
+ "num_tokens": 6422528.0,
+ "step": 392
+ },
+ {
+ "entropy": 1.3627581596374512,
+ "epoch": 0.793939393939394,
+ "grad_norm": 1.9852598905563354,
+ "learning_rate": 1.4720538720538722e-05,
+ "loss": 1.3558071851730347,
+ "mean_token_accuracy": 0.6720200181007385,
+ "num_tokens": 6438912.0,
+ "step": 393
+ },
+ {
+ "entropy": 0.8946540951728821,
+ "epoch": 0.795959595959596,
+ "grad_norm": 1.54441237449646,
+ "learning_rate": 1.4707070707070707e-05,
+ "loss": 0.8874151706695557,
+ "mean_token_accuracy": 0.7685027122497559,
+ "num_tokens": 6455296.0,
+ "step": 394
+ },
+ {
+ "entropy": 1.35861074924469,
+ "epoch": 0.797979797979798,
+ "grad_norm": 2.158553123474121,
+ "learning_rate": 1.4693602693602695e-05,
+ "loss": 1.4291828870773315,
+ "mean_token_accuracy": 0.6647533178329468,
+ "num_tokens": 6471680.0,
+ "step": 395
+ },
+ {
+ "entropy": 1.7047442197799683,
+ "epoch": 0.8,
+ "grad_norm": 2.1242175102233887,
+ "learning_rate": 1.4680134680134681e-05,
+ "loss": 1.7065966129302979,
+ "mean_token_accuracy": 0.6058256030082703,
+ "num_tokens": 6488064.0,
+ "step": 396
+ },
+ {
+ "entropy": 1.7153913974761963,
+ "epoch": 0.802020202020202,
+ "grad_norm": 1.9085419178009033,
+ "learning_rate": 1.4666666666666666e-05,
+ "loss": 1.7373592853546143,
+ "mean_token_accuracy": 0.6020395755767822,
+ "num_tokens": 6504448.0,
+ "step": 397
+ },
+ {
+ "entropy": 1.1062475442886353,
+ "epoch": 0.804040404040404,
+ "grad_norm": 1.9173986911773682,
+ "learning_rate": 1.4653198653198654e-05,
+ "loss": 1.0991405248641968,
+ "mean_token_accuracy": 0.7195896506309509,
+ "num_tokens": 6520832.0,
+ "step": 398
+ },
+ {
+ "entropy": 1.5717406272888184,
+ "epoch": 0.806060606060606,
+ "grad_norm": 2.0077219009399414,
+ "learning_rate": 1.4639730639730641e-05,
+ "loss": 1.595954418182373,
+ "mean_token_accuracy": 0.6270151734352112,
+ "num_tokens": 6537216.0,
+ "step": 399
+ },
+ {
+ "entropy": 1.3960795402526855,
+ "epoch": 0.8080808080808081,
+ "grad_norm": 2.2864415645599365,
+ "learning_rate": 1.4626262626262629e-05,
+ "loss": 1.416130781173706,
+ "mean_token_accuracy": 0.6631656289100647,
+ "num_tokens": 6553600.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.8080808080808081,
+ "eval_entropy": 1.510355769626556,
+ "eval_loss": 1.5199862718582153,
+ "eval_mean_token_accuracy": 0.6461201098657423,
+ "eval_num_tokens": 6553600.0,
+ "eval_runtime": 43.8634,
+ "eval_samples_per_second": 22.57,
+ "eval_steps_per_second": 2.827,
+ "step": 400
+ },
+ {
+ "entropy": 1.5662645101547241,
+ "epoch": 0.8101010101010101,
+ "grad_norm": 2.1806085109710693,
+ "learning_rate": 1.4612794612794614e-05,
+ "loss": 1.5763804912567139,
+ "mean_token_accuracy": 0.6330605745315552,
+ "num_tokens": 6569984.0,
+ "step": 401
+ },
+ {
+ "entropy": 1.4046087265014648,
+ "epoch": 0.8121212121212121,
+ "grad_norm": 1.9650650024414062,
+ "learning_rate": 1.45993265993266e-05,
+ "loss": 1.396510124206543,
+ "mean_token_accuracy": 0.6568148732185364,
+ "num_tokens": 6586368.0,
+ "step": 402
+ },
+ {
+ "entropy": 1.084455966949463,
+ "epoch": 0.8141414141414142,
+ "grad_norm": 1.926537275314331,
+ "learning_rate": 1.4585858585858587e-05,
+ "loss": 1.096333622932434,
+ "mean_token_accuracy": 0.7233145833015442,
+ "num_tokens": 6602752.0,
+ "step": 403
+ },
+ {
+ "entropy": 1.379700779914856,
+ "epoch": 0.8161616161616162,
+ "grad_norm": 1.957202672958374,
+ "learning_rate": 1.4572390572390573e-05,
+ "loss": 1.4035027027130127,
+ "mean_token_accuracy": 0.674462616443634,
+ "num_tokens": 6619136.0,
+ "step": 404
+ },
+ {
+ "entropy": 1.3775221109390259,
+ "epoch": 0.8181818181818182,
+ "grad_norm": 1.9095491170883179,
+ "learning_rate": 1.455892255892256e-05,
+ "loss": 1.3915553092956543,
+ "mean_token_accuracy": 0.6811187267303467,
+ "num_tokens": 6635520.0,
+ "step": 405
+ },
+ {
+ "entropy": 1.4745222330093384,
+ "epoch": 0.8202020202020202,
+ "grad_norm": 2.0017123222351074,
+ "learning_rate": 1.4545454545454546e-05,
+ "loss": 1.4845868349075317,
+ "mean_token_accuracy": 0.6557767391204834,
+ "num_tokens": 6651904.0,
+ "step": 406
+ },
+ {
+ "entropy": 1.5129855871200562,
+ "epoch": 0.8222222222222222,
+ "grad_norm": 2.127979040145874,
+ "learning_rate": 1.4531986531986533e-05,
+ "loss": 1.5081605911254883,
+ "mean_token_accuracy": 0.6425256729125977,
+ "num_tokens": 6668288.0,
+ "step": 407
+ },
+ {
+ "entropy": 1.1438099145889282,
+ "epoch": 0.8242424242424242,
+ "grad_norm": 1.7389986515045166,
+ "learning_rate": 1.4518518518518521e-05,
+ "loss": 1.1446681022644043,
+ "mean_token_accuracy": 0.7180629968643188,
+ "num_tokens": 6684672.0,
+ "step": 408
+ },
+ {
+ "entropy": 1.448157787322998,
+ "epoch": 0.8262626262626263,
+ "grad_norm": 1.8483424186706543,
+ "learning_rate": 1.4505050505050506e-05,
+ "loss": 1.4317030906677246,
+ "mean_token_accuracy": 0.6659746170043945,
+ "num_tokens": 6701056.0,
+ "step": 409
+ },
+ {
+ "entropy": 1.419940710067749,
+ "epoch": 0.8282828282828283,
+ "grad_norm": 1.961125135421753,
+ "learning_rate": 1.4491582491582492e-05,
+ "loss": 1.42207670211792,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 6717440.0,
+ "step": 410
+ },
+ {
+ "entropy": 1.5707522630691528,
+ "epoch": 0.8303030303030303,
+ "grad_norm": 2.0862255096435547,
+ "learning_rate": 1.447811447811448e-05,
+ "loss": 1.5721523761749268,
+ "mean_token_accuracy": 0.6305569410324097,
+ "num_tokens": 6733824.0,
+ "step": 411
+ },
+ {
+ "entropy": 1.4308481216430664,
+ "epoch": 0.8323232323232324,
+ "grad_norm": 2.1505820751190186,
+ "learning_rate": 1.4464646464646465e-05,
+ "loss": 1.4522666931152344,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 6750208.0,
+ "step": 412
+ },
+ {
+ "entropy": 1.7424806356430054,
+ "epoch": 0.8343434343434344,
+ "grad_norm": 2.1787710189819336,
+ "learning_rate": 1.4451178451178452e-05,
+ "loss": 1.7719662189483643,
+ "mean_token_accuracy": 0.5897654891014099,
+ "num_tokens": 6766592.0,
+ "step": 413
+ },
+ {
+ "entropy": 1.9777010679244995,
+ "epoch": 0.8363636363636363,
+ "grad_norm": 2.1178369522094727,
+ "learning_rate": 1.443771043771044e-05,
+ "loss": 1.9885730743408203,
+ "mean_token_accuracy": 0.5628358721733093,
+ "num_tokens": 6782976.0,
+ "step": 414
+ },
+ {
+ "entropy": 1.701235055923462,
+ "epoch": 0.8383838383838383,
+ "grad_norm": 1.9038937091827393,
+ "learning_rate": 1.4424242424242425e-05,
+ "loss": 1.6970818042755127,
+ "mean_token_accuracy": 0.6209086179733276,
+ "num_tokens": 6799360.0,
+ "step": 415
+ },
+ {
+ "entropy": 1.5118876695632935,
+ "epoch": 0.8404040404040404,
+ "grad_norm": 1.8924365043640137,
+ "learning_rate": 1.4410774410774413e-05,
+ "loss": 1.5288946628570557,
+ "mean_token_accuracy": 0.6480215191841125,
+ "num_tokens": 6815744.0,
+ "step": 416
+ },
+ {
+ "entropy": 1.5526877641677856,
+ "epoch": 0.8424242424242424,
+ "grad_norm": 2.109499216079712,
+ "learning_rate": 1.43973063973064e-05,
+ "loss": 1.5581820011138916,
+ "mean_token_accuracy": 0.6351978778839111,
+ "num_tokens": 6832128.0,
+ "step": 417
+ },
+ {
+ "entropy": 1.8132506608963013,
+ "epoch": 0.8444444444444444,
+ "grad_norm": 2.0389890670776367,
+ "learning_rate": 1.4383838383838384e-05,
+ "loss": 1.8378231525421143,
+ "mean_token_accuracy": 0.592391312122345,
+ "num_tokens": 6848512.0,
+ "step": 418
+ },
+ {
+ "entropy": 1.3766752481460571,
+ "epoch": 0.8464646464646465,
+ "grad_norm": 1.8586320877075195,
+ "learning_rate": 1.4370370370370372e-05,
+ "loss": 1.3741214275360107,
+ "mean_token_accuracy": 0.6796531677246094,
+ "num_tokens": 6864896.0,
+ "step": 419
+ },
+ {
+ "entropy": 1.1854407787322998,
+ "epoch": 0.8484848484848485,
+ "grad_norm": 1.875899314880371,
+ "learning_rate": 1.4356902356902359e-05,
+ "loss": 1.2393877506256104,
+ "mean_token_accuracy": 0.704323410987854,
+ "num_tokens": 6881280.0,
+ "step": 420
+ },
+ {
+ "entropy": 1.498558759689331,
+ "epoch": 0.8505050505050505,
+ "grad_norm": 1.898848295211792,
+ "learning_rate": 1.4343434343434344e-05,
+ "loss": 1.4963322877883911,
+ "mean_token_accuracy": 0.6542501449584961,
+ "num_tokens": 6897664.0,
+ "step": 421
+ },
+ {
+ "entropy": 1.5070384740829468,
+ "epoch": 0.8525252525252526,
+ "grad_norm": 2.095853090286255,
+ "learning_rate": 1.4329966329966332e-05,
+ "loss": 1.5026702880859375,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 6914048.0,
+ "step": 422
+ },
+ {
+ "entropy": 1.7848025560379028,
+ "epoch": 0.8545454545454545,
+ "grad_norm": 1.9265769720077515,
+ "learning_rate": 1.4316498316498317e-05,
+ "loss": 1.8066134452819824,
+ "mean_token_accuracy": 0.5936736464500427,
+ "num_tokens": 6930432.0,
+ "step": 423
+ },
+ {
+ "entropy": 1.4278018474578857,
+ "epoch": 0.8565656565656565,
+ "grad_norm": 1.900985836982727,
+ "learning_rate": 1.4303030303030305e-05,
+ "loss": 1.4045631885528564,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 6946816.0,
+ "step": 424
+ },
+ {
+ "entropy": 1.728216290473938,
+ "epoch": 0.8585858585858586,
+ "grad_norm": 1.952841877937317,
+ "learning_rate": 1.4289562289562291e-05,
+ "loss": 1.728804349899292,
+ "mean_token_accuracy": 0.613031268119812,
+ "num_tokens": 6963200.0,
+ "step": 425
+ },
+ {
+ "entropy": 1.6632241010665894,
+ "epoch": 0.8606060606060606,
+ "grad_norm": 2.187973737716675,
+ "learning_rate": 1.4276094276094276e-05,
+ "loss": 1.6703932285308838,
+ "mean_token_accuracy": 0.6150463819503784,
+ "num_tokens": 6979584.0,
+ "step": 426
+ },
+ {
+ "entropy": 1.761826992034912,
+ "epoch": 0.8626262626262626,
+ "grad_norm": 2.203636646270752,
+ "learning_rate": 1.4262626262626264e-05,
+ "loss": 1.727257490158081,
+ "mean_token_accuracy": 0.5861626863479614,
+ "num_tokens": 6995968.0,
+ "step": 427
+ },
+ {
+ "entropy": 1.4528838396072388,
+ "epoch": 0.8646464646464647,
+ "grad_norm": 1.7967053651809692,
+ "learning_rate": 1.424915824915825e-05,
+ "loss": 1.4786958694458008,
+ "mean_token_accuracy": 0.6589521169662476,
+ "num_tokens": 7012352.0,
+ "step": 428
+ },
+ {
+ "entropy": 1.2221835851669312,
+ "epoch": 0.8666666666666667,
+ "grad_norm": 1.8118345737457275,
+ "learning_rate": 1.4235690235690235e-05,
+ "loss": 1.247727632522583,
+ "mean_token_accuracy": 0.7024303674697876,
+ "num_tokens": 7028736.0,
+ "step": 429
+ },
+ {
+ "entropy": 1.5066863298416138,
+ "epoch": 0.8686868686868687,
+ "grad_norm": 1.8390358686447144,
+ "learning_rate": 1.4222222222222224e-05,
+ "loss": 1.5283207893371582,
+ "mean_token_accuracy": 0.6553493142127991,
+ "num_tokens": 7045120.0,
+ "step": 430
+ },
+ {
+ "entropy": 1.346379041671753,
+ "epoch": 0.8707070707070707,
+ "grad_norm": 2.070962905883789,
+ "learning_rate": 1.420875420875421e-05,
+ "loss": 1.386117935180664,
+ "mean_token_accuracy": 0.6690889000892639,
+ "num_tokens": 7061504.0,
+ "step": 431
+ },
+ {
+ "entropy": 1.8691747188568115,
+ "epoch": 0.8727272727272727,
+ "grad_norm": 1.7868962287902832,
+ "learning_rate": 1.4195286195286198e-05,
+ "loss": 1.9285637140274048,
+ "mean_token_accuracy": 0.5680874586105347,
+ "num_tokens": 7077888.0,
+ "step": 432
+ },
+ {
+ "entropy": 1.8500115871429443,
+ "epoch": 0.8747474747474747,
+ "grad_norm": 1.8853468894958496,
+ "learning_rate": 1.4181818181818183e-05,
+ "loss": 1.8733386993408203,
+ "mean_token_accuracy": 0.5956888198852539,
+ "num_tokens": 7094272.0,
+ "step": 433
+ },
+ {
+ "entropy": 1.3737305402755737,
+ "epoch": 0.8767676767676768,
+ "grad_norm": 1.8363661766052246,
+ "learning_rate": 1.416835016835017e-05,
+ "loss": 1.4020421504974365,
+ "mean_token_accuracy": 0.6723253726959229,
+ "num_tokens": 7110656.0,
+ "step": 434
+ },
+ {
+ "entropy": 1.5069265365600586,
+ "epoch": 0.8787878787878788,
+ "grad_norm": 2.1154301166534424,
+ "learning_rate": 1.4154882154882156e-05,
+ "loss": 1.5137630701065063,
+ "mean_token_accuracy": 0.628724992275238,
+ "num_tokens": 7127040.0,
+ "step": 435
+ },
+ {
+ "entropy": 1.6280715465545654,
+ "epoch": 0.8808080808080808,
+ "grad_norm": 1.9827117919921875,
+ "learning_rate": 1.4141414141414143e-05,
+ "loss": 1.6629055738449097,
+ "mean_token_accuracy": 0.6300684213638306,
+ "num_tokens": 7143424.0,
+ "step": 436
+ },
+ {
+ "entropy": 1.0767987966537476,
+ "epoch": 0.8828282828282829,
+ "grad_norm": 1.8503392934799194,
+ "learning_rate": 1.4127946127946129e-05,
+ "loss": 1.0964105129241943,
+ "mean_token_accuracy": 0.7118954658508301,
+ "num_tokens": 7159808.0,
+ "step": 437
+ },
+ {
+ "entropy": 1.6979929208755493,
+ "epoch": 0.8848484848484849,
+ "grad_norm": 2.114170551300049,
+ "learning_rate": 1.4114478114478116e-05,
+ "loss": 1.7339307069778442,
+ "mean_token_accuracy": 0.6071690320968628,
+ "num_tokens": 7176192.0,
+ "step": 438
+ },
+ {
+ "entropy": 1.840633511543274,
+ "epoch": 0.8868686868686869,
+ "grad_norm": 2.1661946773529053,
+ "learning_rate": 1.4101010101010102e-05,
+ "loss": 1.866344690322876,
+ "mean_token_accuracy": 0.5988031029701233,
+ "num_tokens": 7192576.0,
+ "step": 439
+ },
+ {
+ "entropy": 1.8278590440750122,
+ "epoch": 0.8888888888888888,
+ "grad_norm": 1.9278390407562256,
+ "learning_rate": 1.4087542087542087e-05,
+ "loss": 1.81584632396698,
+ "mean_token_accuracy": 0.5878114104270935,
+ "num_tokens": 7208960.0,
+ "step": 440
+ },
+ {
+ "entropy": 1.405017375946045,
+ "epoch": 0.8909090909090909,
+ "grad_norm": 1.9446384906768799,
+ "learning_rate": 1.4074074074074075e-05,
+ "loss": 1.4040675163269043,
+ "mean_token_accuracy": 0.6647533178329468,
+ "num_tokens": 7225344.0,
+ "step": 441
+ },
+ {
+ "entropy": 1.0967023372650146,
+ "epoch": 0.8929292929292929,
+ "grad_norm": 1.8880785703659058,
+ "learning_rate": 1.4060606060606061e-05,
+ "loss": 1.0798790454864502,
+ "mean_token_accuracy": 0.7167806625366211,
+ "num_tokens": 7241728.0,
+ "step": 442
+ },
+ {
+ "entropy": 1.6126327514648438,
+ "epoch": 0.8949494949494949,
+ "grad_norm": 2.2159016132354736,
+ "learning_rate": 1.404713804713805e-05,
+ "loss": 1.620417833328247,
+ "mean_token_accuracy": 0.6215192675590515,
+ "num_tokens": 7258112.0,
+ "step": 443
+ },
+ {
+ "entropy": 1.4352757930755615,
+ "epoch": 0.896969696969697,
+ "grad_norm": 2.070910692214966,
+ "learning_rate": 1.4033670033670034e-05,
+ "loss": 1.409663200378418,
+ "mean_token_accuracy": 0.658646821975708,
+ "num_tokens": 7274496.0,
+ "step": 444
+ },
+ {
+ "entropy": 1.350129246711731,
+ "epoch": 0.898989898989899,
+ "grad_norm": 1.8672778606414795,
+ "learning_rate": 1.4020202020202021e-05,
+ "loss": 1.3485581874847412,
+ "mean_token_accuracy": 0.6743404865264893,
+ "num_tokens": 7290880.0,
+ "step": 445
+ },
+ {
+ "entropy": 1.0900049209594727,
+ "epoch": 0.901010101010101,
+ "grad_norm": 1.8460185527801514,
+ "learning_rate": 1.4006734006734009e-05,
+ "loss": 1.074802279472351,
+ "mean_token_accuracy": 0.727161705493927,
+ "num_tokens": 7307264.0,
+ "step": 446
+ },
+ {
+ "entropy": 1.6430293321609497,
+ "epoch": 0.9030303030303031,
+ "grad_norm": 2.0190517902374268,
+ "learning_rate": 1.3993265993265994e-05,
+ "loss": 1.6505115032196045,
+ "mean_token_accuracy": 0.6073521971702576,
+ "num_tokens": 7323648.0,
+ "step": 447
+ },
+ {
+ "entropy": 1.465686559677124,
+ "epoch": 0.9050505050505051,
+ "grad_norm": 2.0139927864074707,
+ "learning_rate": 1.397979797979798e-05,
+ "loss": 1.480743408203125,
+ "mean_token_accuracy": 0.6593796014785767,
+ "num_tokens": 7340032.0,
+ "step": 448
+ },
+ {
+ "entropy": 2.152183771133423,
+ "epoch": 0.907070707070707,
+ "grad_norm": 2.2376039028167725,
+ "learning_rate": 1.3966329966329969e-05,
+ "loss": 2.117891788482666,
+ "mean_token_accuracy": 0.5404250025749207,
+ "num_tokens": 7356416.0,
+ "step": 449
+ },
+ {
+ "entropy": 1.6066724061965942,
+ "epoch": 0.9090909090909091,
+ "grad_norm": 1.895409107208252,
+ "learning_rate": 1.3952861952861953e-05,
+ "loss": 1.6247167587280273,
+ "mean_token_accuracy": 0.6281143426895142,
+ "num_tokens": 7372800.0,
+ "step": 450
+ },
+ {
+ "entropy": 1.7240369319915771,
+ "epoch": 0.9111111111111111,
+ "grad_norm": 1.9780583381652832,
+ "learning_rate": 1.3939393939393942e-05,
+ "loss": 1.7521916627883911,
+ "mean_token_accuracy": 0.6022838354110718,
+ "num_tokens": 7389184.0,
+ "step": 451
+ },
+ {
+ "entropy": 1.168492317199707,
+ "epoch": 0.9131313131313131,
+ "grad_norm": 1.676292896270752,
+ "learning_rate": 1.3925925925925928e-05,
+ "loss": 1.1678345203399658,
+ "mean_token_accuracy": 0.7136663198471069,
+ "num_tokens": 7405568.0,
+ "step": 452
+ },
+ {
+ "entropy": 1.4993922710418701,
+ "epoch": 0.9151515151515152,
+ "grad_norm": 2.051370620727539,
+ "learning_rate": 1.3912457912457913e-05,
+ "loss": 1.5273159742355347,
+ "mean_token_accuracy": 0.6378847360610962,
+ "num_tokens": 7421952.0,
+ "step": 453
+ },
+ {
+ "entropy": 1.3478108644485474,
+ "epoch": 0.9171717171717172,
+ "grad_norm": 1.9196240901947021,
+ "learning_rate": 1.3898989898989901e-05,
+ "loss": 1.3547455072402954,
+ "mean_token_accuracy": 0.666829526424408,
+ "num_tokens": 7438336.0,
+ "step": 454
+ },
+ {
+ "entropy": 1.1411141157150269,
+ "epoch": 0.9191919191919192,
+ "grad_norm": 1.9581170082092285,
+ "learning_rate": 1.3885521885521886e-05,
+ "loss": 1.1604664325714111,
+ "mean_token_accuracy": 0.7018197178840637,
+ "num_tokens": 7454720.0,
+ "step": 455
+ },
+ {
+ "entropy": 1.1814258098602295,
+ "epoch": 0.9212121212121213,
+ "grad_norm": 2.005451202392578,
+ "learning_rate": 1.3872053872053872e-05,
+ "loss": 1.1768745183944702,
+ "mean_token_accuracy": 0.7044455409049988,
+ "num_tokens": 7471104.0,
+ "step": 456
+ },
+ {
+ "entropy": 1.335093379020691,
+ "epoch": 0.9232323232323232,
+ "grad_norm": 1.928747534751892,
+ "learning_rate": 1.385858585858586e-05,
+ "loss": 1.3504598140716553,
+ "mean_token_accuracy": 0.6774548292160034,
+ "num_tokens": 7487488.0,
+ "step": 457
+ },
+ {
+ "entropy": 1.6866769790649414,
+ "epoch": 0.9252525252525252,
+ "grad_norm": 1.9078223705291748,
+ "learning_rate": 1.3845117845117845e-05,
+ "loss": 1.688689947128296,
+ "mean_token_accuracy": 0.6077796816825867,
+ "num_tokens": 7503872.0,
+ "step": 458
+ },
+ {
+ "entropy": 1.2842025756835938,
+ "epoch": 0.9272727272727272,
+ "grad_norm": 1.909472942352295,
+ "learning_rate": 1.3831649831649833e-05,
+ "loss": 1.3128941059112549,
+ "mean_token_accuracy": 0.6872252225875854,
+ "num_tokens": 7520256.0,
+ "step": 459
+ },
+ {
+ "entropy": 1.7797539234161377,
+ "epoch": 0.9292929292929293,
+ "grad_norm": 2.246411085128784,
+ "learning_rate": 1.381818181818182e-05,
+ "loss": 1.8016175031661987,
+ "mean_token_accuracy": 0.6049095988273621,
+ "num_tokens": 7536640.0,
+ "step": 460
+ },
+ {
+ "entropy": 1.3464831113815308,
+ "epoch": 0.9313131313131313,
+ "grad_norm": 1.9999858140945435,
+ "learning_rate": 1.3804713804713805e-05,
+ "loss": 1.3523657321929932,
+ "mean_token_accuracy": 0.6787371635437012,
+ "num_tokens": 7553024.0,
+ "step": 461
+ },
+ {
+ "entropy": 1.5901066064834595,
+ "epoch": 0.9333333333333333,
+ "grad_norm": 1.9632524251937866,
+ "learning_rate": 1.3791245791245793e-05,
+ "loss": 1.596254587173462,
+ "mean_token_accuracy": 0.6428309679031372,
+ "num_tokens": 7569408.0,
+ "step": 462
+ },
+ {
+ "entropy": 1.2511993646621704,
+ "epoch": 0.9353535353535354,
+ "grad_norm": 1.7678464651107788,
+ "learning_rate": 1.377777777777778e-05,
+ "loss": 1.254664659500122,
+ "mean_token_accuracy": 0.6981558203697205,
+ "num_tokens": 7585792.0,
+ "step": 463
+ },
+ {
+ "entropy": 1.546912431716919,
+ "epoch": 0.9373737373737374,
+ "grad_norm": 2.0353212356567383,
+ "learning_rate": 1.3764309764309764e-05,
+ "loss": 1.54923677444458,
+ "mean_token_accuracy": 0.6403273344039917,
+ "num_tokens": 7602176.0,
+ "step": 464
+ },
+ {
+ "entropy": 1.6535273790359497,
+ "epoch": 0.9393939393939394,
+ "grad_norm": 2.1584854125976562,
+ "learning_rate": 1.3750841750841752e-05,
+ "loss": 1.6464964151382446,
+ "mean_token_accuracy": 0.6218246221542358,
+ "num_tokens": 7618560.0,
+ "step": 465
+ },
+ {
+ "entropy": 1.1885185241699219,
+ "epoch": 0.9414141414141414,
+ "grad_norm": 1.8068963289260864,
+ "learning_rate": 1.3737373737373739e-05,
+ "loss": 1.1980109214782715,
+ "mean_token_accuracy": 0.6990718245506287,
+ "num_tokens": 7634944.0,
+ "step": 466
+ },
+ {
+ "entropy": 1.2306157350540161,
+ "epoch": 0.9434343434343434,
+ "grad_norm": 1.9044586420059204,
+ "learning_rate": 1.3723905723905725e-05,
+ "loss": 1.2291686534881592,
+ "mean_token_accuracy": 0.6996824741363525,
+ "num_tokens": 7651328.0,
+ "step": 467
+ },
+ {
+ "entropy": 1.2496092319488525,
+ "epoch": 0.9454545454545454,
+ "grad_norm": 1.7264868021011353,
+ "learning_rate": 1.3710437710437712e-05,
+ "loss": 1.2440049648284912,
+ "mean_token_accuracy": 0.6877137422561646,
+ "num_tokens": 7667712.0,
+ "step": 468
+ },
+ {
+ "entropy": 1.8231102228164673,
+ "epoch": 0.9474747474747475,
+ "grad_norm": 2.099104166030884,
+ "learning_rate": 1.3696969696969698e-05,
+ "loss": 1.84971284866333,
+ "mean_token_accuracy": 0.5869565010070801,
+ "num_tokens": 7684096.0,
+ "step": 469
+ },
+ {
+ "entropy": 1.537786841392517,
+ "epoch": 0.9494949494949495,
+ "grad_norm": 1.872962474822998,
+ "learning_rate": 1.3683501683501685e-05,
+ "loss": 1.5448193550109863,
+ "mean_token_accuracy": 0.6465559601783752,
+ "num_tokens": 7700480.0,
+ "step": 470
+ },
+ {
+ "entropy": 1.8270875215530396,
+ "epoch": 0.9515151515151515,
+ "grad_norm": 2.2747695446014404,
+ "learning_rate": 1.3670033670033671e-05,
+ "loss": 1.854095697402954,
+ "mean_token_accuracy": 0.5834758281707764,
+ "num_tokens": 7716864.0,
+ "step": 471
+ },
+ {
+ "entropy": 1.505604863166809,
+ "epoch": 0.9535353535353536,
+ "grad_norm": 1.9903687238693237,
+ "learning_rate": 1.3656565656565656e-05,
+ "loss": 1.5269451141357422,
+ "mean_token_accuracy": 0.6475940346717834,
+ "num_tokens": 7733248.0,
+ "step": 472
+ },
+ {
+ "entropy": 1.8228932619094849,
+ "epoch": 0.9555555555555556,
+ "grad_norm": 2.4003078937530518,
+ "learning_rate": 1.3643097643097644e-05,
+ "loss": 1.846016764640808,
+ "mean_token_accuracy": 0.5900097489356995,
+ "num_tokens": 7749632.0,
+ "step": 473
+ },
+ {
+ "entropy": 1.2786308526992798,
+ "epoch": 0.9575757575757575,
+ "grad_norm": 1.9355131387710571,
+ "learning_rate": 1.362962962962963e-05,
+ "loss": 1.3152062892913818,
+ "mean_token_accuracy": 0.6703712940216064,
+ "num_tokens": 7766016.0,
+ "step": 474
+ },
+ {
+ "entropy": 1.1032856702804565,
+ "epoch": 0.9595959595959596,
+ "grad_norm": 1.7720186710357666,
+ "learning_rate": 1.3616161616161619e-05,
+ "loss": 1.1242918968200684,
+ "mean_token_accuracy": 0.7250854969024658,
+ "num_tokens": 7782400.0,
+ "step": 475
+ },
+ {
+ "entropy": 1.5261021852493286,
+ "epoch": 0.9616161616161616,
+ "grad_norm": 1.8472843170166016,
+ "learning_rate": 1.3602693602693604e-05,
+ "loss": 1.54013991355896,
+ "mean_token_accuracy": 0.6471055150032043,
+ "num_tokens": 7798784.0,
+ "step": 476
+ },
+ {
+ "entropy": 0.9697252511978149,
+ "epoch": 0.9636363636363636,
+ "grad_norm": 1.8871296644210815,
+ "learning_rate": 1.358922558922559e-05,
+ "loss": 0.9874091148376465,
+ "mean_token_accuracy": 0.7430996298789978,
+ "num_tokens": 7815168.0,
+ "step": 477
+ },
+ {
+ "entropy": 1.6003227233886719,
+ "epoch": 0.9656565656565657,
+ "grad_norm": 2.371385097503662,
+ "learning_rate": 1.3575757575757578e-05,
+ "loss": 1.580587387084961,
+ "mean_token_accuracy": 0.6273815631866455,
+ "num_tokens": 7831552.0,
+ "step": 478
+ },
+ {
+ "entropy": 1.556900978088379,
+ "epoch": 0.9676767676767677,
+ "grad_norm": 1.839432954788208,
+ "learning_rate": 1.3562289562289563e-05,
+ "loss": 1.5154083967208862,
+ "mean_token_accuracy": 0.628724992275238,
+ "num_tokens": 7847936.0,
+ "step": 479
+ },
+ {
+ "entropy": 1.2394448518753052,
+ "epoch": 0.9696969696969697,
+ "grad_norm": 1.6638867855072021,
+ "learning_rate": 1.354882154882155e-05,
+ "loss": 1.2016921043395996,
+ "mean_token_accuracy": 0.6991939544677734,
+ "num_tokens": 7864320.0,
+ "step": 480
+ },
+ {
+ "entropy": 1.4200247526168823,
+ "epoch": 0.9717171717171718,
+ "grad_norm": 1.8742305040359497,
+ "learning_rate": 1.3535353535353538e-05,
+ "loss": 1.4267700910568237,
+ "mean_token_accuracy": 0.6604176759719849,
+ "num_tokens": 7880704.0,
+ "step": 481
+ },
+ {
+ "entropy": 2.0156707763671875,
+ "epoch": 0.9737373737373738,
+ "grad_norm": 2.1772451400756836,
+ "learning_rate": 1.3521885521885523e-05,
+ "loss": 2.0306758880615234,
+ "mean_token_accuracy": 0.5579506754875183,
+ "num_tokens": 7897088.0,
+ "step": 482
+ },
+ {
+ "entropy": 1.2802858352661133,
+ "epoch": 0.9757575757575757,
+ "grad_norm": 1.8951549530029297,
+ "learning_rate": 1.3508417508417509e-05,
+ "loss": 1.2761621475219727,
+ "mean_token_accuracy": 0.6825231909751892,
+ "num_tokens": 7913472.0,
+ "step": 483
+ },
+ {
+ "entropy": 1.3758989572525024,
+ "epoch": 0.9777777777777777,
+ "grad_norm": 1.8072963953018188,
+ "learning_rate": 1.3494949494949497e-05,
+ "loss": 1.3532235622406006,
+ "mean_token_accuracy": 0.6749511361122131,
+ "num_tokens": 7929856.0,
+ "step": 484
+ },
+ {
+ "entropy": 1.4488792419433594,
+ "epoch": 0.9797979797979798,
+ "grad_norm": 1.7842215299606323,
+ "learning_rate": 1.3481481481481482e-05,
+ "loss": 1.4513285160064697,
+ "mean_token_accuracy": 0.6539447903633118,
+ "num_tokens": 7946240.0,
+ "step": 485
+ },
+ {
+ "entropy": 1.2957613468170166,
+ "epoch": 0.9818181818181818,
+ "grad_norm": 1.8612068891525269,
+ "learning_rate": 1.346801346801347e-05,
+ "loss": 1.3016514778137207,
+ "mean_token_accuracy": 0.6848436594009399,
+ "num_tokens": 7962624.0,
+ "step": 486
+ },
+ {
+ "entropy": 1.4321255683898926,
+ "epoch": 0.9838383838383838,
+ "grad_norm": 1.7746661901474,
+ "learning_rate": 1.3454545454545455e-05,
+ "loss": 1.4230387210845947,
+ "mean_token_accuracy": 0.664692223072052,
+ "num_tokens": 7979008.0,
+ "step": 487
+ },
+ {
+ "entropy": 1.7615760564804077,
+ "epoch": 0.9858585858585859,
+ "grad_norm": 1.9986366033554077,
+ "learning_rate": 1.3441077441077441e-05,
+ "loss": 1.7871575355529785,
+ "mean_token_accuracy": 0.5994748473167419,
+ "num_tokens": 7995392.0,
+ "step": 488
+ },
+ {
+ "entropy": 1.349948763847351,
+ "epoch": 0.9878787878787879,
+ "grad_norm": 2.0217247009277344,
+ "learning_rate": 1.342760942760943e-05,
+ "loss": 1.352069616317749,
+ "mean_token_accuracy": 0.6762335300445557,
+ "num_tokens": 8011776.0,
+ "step": 489
+ },
+ {
+ "entropy": 1.6317073106765747,
+ "epoch": 0.98989898989899,
+ "grad_norm": 1.9479029178619385,
+ "learning_rate": 1.3414141414141414e-05,
+ "loss": 1.6507500410079956,
+ "mean_token_accuracy": 0.6186492443084717,
+ "num_tokens": 8028160.0,
+ "step": 490
+ },
+ {
+ "entropy": 2.0288875102996826,
+ "epoch": 0.9919191919191919,
+ "grad_norm": 2.1520888805389404,
+ "learning_rate": 1.3400673400673401e-05,
+ "loss": 2.06215500831604,
+ "mean_token_accuracy": 0.5530043840408325,
+ "num_tokens": 8044544.0,
+ "step": 491
+ },
+ {
+ "entropy": 1.8297137022018433,
+ "epoch": 0.9939393939393939,
+ "grad_norm": 1.949404001235962,
+ "learning_rate": 1.3387205387205389e-05,
+ "loss": 1.8859628438949585,
+ "mean_token_accuracy": 0.5876282453536987,
+ "num_tokens": 8060928.0,
+ "step": 492
+ },
+ {
+ "entropy": 1.587094783782959,
+ "epoch": 0.9959595959595959,
+ "grad_norm": 1.9205344915390015,
+ "learning_rate": 1.3373737373737374e-05,
+ "loss": 1.6053454875946045,
+ "mean_token_accuracy": 0.6257938742637634,
+ "num_tokens": 8077312.0,
+ "step": 493
+ },
+ {
+ "entropy": 1.6583648920059204,
+ "epoch": 0.997979797979798,
+ "grad_norm": 1.976946234703064,
+ "learning_rate": 1.3360269360269362e-05,
+ "loss": 1.6656805276870728,
+ "mean_token_accuracy": 0.6186492443084717,
+ "num_tokens": 8093696.0,
+ "step": 494
+ },
+ {
+ "entropy": 1.1685364246368408,
+ "epoch": 1.0,
+ "grad_norm": 1.8258967399597168,
+ "learning_rate": 1.3346801346801349e-05,
+ "loss": 1.165276288986206,
+ "mean_token_accuracy": 0.7082315683364868,
+ "num_tokens": 8110080.0,
+ "step": 495
+ },
+ {
+ "entropy": 1.1211013793945312,
+ "epoch": 1.002020202020202,
+ "grad_norm": 2.27962327003479,
+ "learning_rate": 1.3333333333333333e-05,
+ "loss": 0.9540231227874756,
+ "mean_token_accuracy": 0.747801661491394,
+ "num_tokens": 8126464.0,
+ "step": 496
+ },
+ {
+ "entropy": 1.370996356010437,
+ "epoch": 1.004040404040404,
+ "grad_norm": 2.3193519115448,
+ "learning_rate": 1.3319865319865321e-05,
+ "loss": 1.240065097808838,
+ "mean_token_accuracy": 0.6976062655448914,
+ "num_tokens": 8142848.0,
+ "step": 497
+ },
+ {
+ "entropy": 1.4673359394073486,
+ "epoch": 1.006060606060606,
+ "grad_norm": 2.071213483810425,
+ "learning_rate": 1.3306397306397308e-05,
+ "loss": 1.3351866006851196,
+ "mean_token_accuracy": 0.6921104192733765,
+ "num_tokens": 8159232.0,
+ "step": 498
+ },
+ {
+ "entropy": 1.1151381731033325,
+ "epoch": 1.0080808080808081,
+ "grad_norm": 2.1310431957244873,
+ "learning_rate": 1.3292929292929293e-05,
+ "loss": 1.0092531442642212,
+ "mean_token_accuracy": 0.7261846661567688,
+ "num_tokens": 8175616.0,
+ "step": 499
+ },
+ {
+ "entropy": 1.4734766483306885,
+ "epoch": 1.0101010101010102,
+ "grad_norm": 2.015787124633789,
+ "learning_rate": 1.3279461279461281e-05,
+ "loss": 1.3748562335968018,
+ "mean_token_accuracy": 0.6682339906692505,
+ "num_tokens": 8192000.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.0101010101010102,
+ "eval_entropy": 1.3614274196086391,
+ "eval_loss": 1.5201176404953003,
+ "eval_mean_token_accuracy": 0.647282806134993,
+ "eval_num_tokens": 8192000.0,
+ "eval_runtime": 43.8232,
+ "eval_samples_per_second": 22.591,
+ "eval_steps_per_second": 2.83,
+ "step": 500
+ }
+ ],
+ "logging_steps": 1,
+ "max_steps": 1485,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 3,
+ "save_steps": 500,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 6.9275322679296e+16,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/training_args.bin b/qwen3-1.7b-teutonic-2e5/checkpoint-500/training_args.bin
new file mode 100644
index 0000000000000000000000000000000000000000..98c558883023185245bfac817f2ca585caa9d94f
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/training_args.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:2c573bdac95c796f8f7368ab9af6d35c5687f53373737ea965b8102d518df7cb
+size 7121
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/zero_to_fp32.py b/qwen3-1.7b-teutonic-2e5/checkpoint-500/zero_to_fp32.py
new file mode 100644
index 0000000000000000000000000000000000000000..3970548c400fd4361bd923b763db90e963ddaf8c
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/zero_to_fp32.py
@@ -0,0 +1,854 @@
+#!/usr/bin/env python
+
+# Copyright (c) Microsoft Corporation.
+# SPDX-License-Identifier: Apache-2.0
+
+# DeepSpeed Team
+
+# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets
+# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in
+# the future. Once extracted, the weights don't require DeepSpeed and can be used in any
+# application.
+#
+# example:
+# python zero_to_fp32.py . output_dir/
+# or
+# python zero_to_fp32.py . output_dir/ --safe_serialization
+
+import argparse
+import torch
+import glob
+import math
+import os
+import re
+import gc
+import json
+import numpy as np
+from tqdm import tqdm
+from collections import OrderedDict
+from dataclasses import dataclass
+
+# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with
+# DeepSpeed data structures it has to be available in the current python environment.
+from deepspeed.utils import logger
+from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS,
+ FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES,
+ FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS, AUTOEP_LAYERS_KEY,
+ AUTOEP_LAYERS_KEY_LEGACY, AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY,
+ AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT, PARAM_ALIGNMENT_PADDINGS)
+
+
+@dataclass
+class zero_model_state:
+ buffers: dict()
+ param_shapes: dict()
+ shared_params: list
+ ds_version: int
+ frozen_param_shapes: dict()
+ frozen_param_fragments: dict()
+
+
+debug = 0
+
+# load to cpu
+device = torch.device('cpu')
+
+OUTPUT_DTYPE_NAMES = {
+ 'float32': torch.float32,
+ 'fp32': torch.float32,
+ 'float16': torch.float16,
+ 'fp16': torch.float16,
+ 'bfloat16': torch.bfloat16,
+ 'bf16': torch.bfloat16,
+}
+
+
+def _resolve_output_dtype(dtype):
+ requested_dtype = dtype
+ if isinstance(dtype, str):
+ dtype_name = dtype[6:] if dtype.startswith('torch.') else dtype
+ dtype = OUTPUT_DTYPE_NAMES.get(dtype_name.lower())
+ if dtype not in set(OUTPUT_DTYPE_NAMES.values()):
+ supported = ', '.join(sorted(OUTPUT_DTYPE_NAMES))
+ raise ValueError(f"Unsupported output dtype {requested_dtype!r}. Choose one of: {supported}")
+ return dtype
+
+
+def atoi(text):
+ return int(text) if text.isdigit() else text
+
+
+def natural_keys(text):
+ '''
+ alist.sort(key=natural_keys) sorts in human order
+ http://nedbatchelder.com/blog/200712/human_sorting.html
+ (See Toothy's implementation in the comments)
+ '''
+ return [atoi(c) for c in re.split(r'(\d+)', text)]
+
+
+def get_model_state_file(checkpoint_dir, zero_stage):
+ if not os.path.isdir(checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist")
+
+ # there should be only one file
+ if zero_stage <= 2:
+ file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt")
+ elif zero_stage == 3:
+ file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt")
+
+ if not os.path.exists(file):
+ raise FileNotFoundError(f"can't find model states file at '{file}'")
+
+ return file
+
+
+def get_checkpoint_files(checkpoint_dir, glob_pattern):
+ # XXX: need to test that this simple glob rule works for multi-node setup too
+ ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys)
+
+ if len(ckpt_files) == 0:
+ raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'")
+
+ return ckpt_files
+
+
+def get_optim_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt")
+
+
+def get_model_state_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_model_states.pt")
+
+
+def _has_autoep_zero3_partitioned_metadata(state_dict):
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY)
+ if autoep_layers is None:
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY_LEGACY)
+ if not isinstance(autoep_layers, list):
+ return False
+ return any(
+ isinstance(entry, dict)
+ and entry.get(AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY) == AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT
+ for entry in autoep_layers)
+
+
+def _raise_if_autoep_zero3_partitioned_state(state_dict):
+ if _has_autoep_zero3_partitioned_metadata(state_dict):
+ raise NotImplementedError("zero_to_fp32 does not support AutoEP ZeRO-3 partition-native checkpoints. "
+ "AutoEP expert parameters are partitioned over expert replica groups, so "
+ "global data-parallel consolidation would produce incomplete expert tensors. "
+ "Use ds_to_universal.py for expert-aware conversion.")
+
+
+def _raise_if_autoep_zero3_partitioned_checkpoint(model_files):
+ for file in model_files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+
+def parse_model_states(files):
+ zero_model_states = []
+ for file in files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+ if BUFFER_NAMES not in state_dict:
+ raise ValueError(f"{file} is not a model state checkpoint")
+ buffer_names = state_dict[BUFFER_NAMES]
+ if debug:
+ print("Found buffers:", buffer_names)
+
+ # recover just the buffers while restoring them to fp32 if they were saved in fp16
+ buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names}
+ param_shapes = state_dict[PARAM_SHAPES]
+
+ # collect parameters that are included in param_shapes
+ param_names = []
+ for s in param_shapes:
+ for name in s.keys():
+ param_names.append(name)
+
+ # update with frozen parameters
+ frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None)
+ if frozen_param_shapes is not None:
+ if debug:
+ print(f"Found frozen_param_shapes: {frozen_param_shapes}")
+ param_names += list(frozen_param_shapes.keys())
+
+ # handle shared params
+ shared_params = [[k, v] for k, v in state_dict["shared_params"].items()]
+
+ ds_version = state_dict.get(DS_VERSION, None)
+
+ frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None)
+
+ z_model_state = zero_model_state(buffers=buffers,
+ param_shapes=param_shapes,
+ shared_params=shared_params,
+ ds_version=ds_version,
+ frozen_param_shapes=frozen_param_shapes,
+ frozen_param_fragments=frozen_param_fragments)
+ zero_model_states.append(z_model_state)
+
+ return zero_model_states
+
+
+def parse_optim_states(files, ds_checkpoint_dir):
+ total_files = len(files)
+ state_dicts = []
+ for f in tqdm(files, desc='Loading checkpoint shards'):
+ state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False)
+ # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights
+ # and also handle the case where it was already removed by another helper script
+ state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None)
+ state_dicts.append(state_dict)
+
+ if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]:
+ raise ValueError(f"{files[0]} is not a zero checkpoint")
+ zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE]
+ world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT]
+
+ # For ZeRO-2 each param group can have different partition_count as data parallelism for expert
+ # parameters can be different from data parallelism for non-expert parameters. So we can just
+ # use the max of the partition_count to get the dp world_size.
+
+ if type(world_size) is list:
+ world_size = max(world_size)
+
+ if world_size != total_files:
+ raise ValueError(
+ f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. "
+ "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes."
+ )
+
+ # the groups are named differently in each stage
+ if zero_stage <= 2:
+ fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS
+ elif zero_stage == 3:
+ fp32_groups_key = FP32_FLAT_GROUPS
+ else:
+ raise ValueError(f"unknown zero stage {zero_stage}")
+
+ fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))]
+ param_alignment_paddings = state_dicts[0][OPTIMIZER_STATE_DICT].get(PARAM_ALIGNMENT_PADDINGS)
+ return zero_stage, world_size, fp32_flat_groups, param_alignment_paddings
+
+
+def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters):
+ """
+ Returns fp32 state_dict reconstructed from ds checkpoint
+
+ Args:
+ - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are)
+
+ """
+ print(f"Processing zero checkpoint '{ds_checkpoint_dir}'")
+
+ # parse_model_states rejects AutoEP ZeRO-3 partition-native checkpoints
+ # before the expensive optimizer-shard load below.
+ model_files = get_model_state_files(ds_checkpoint_dir)
+ zero_model_states = parse_model_states(model_files)
+ print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}')
+
+ optim_files = get_optim_files(ds_checkpoint_dir)
+ zero_stage, world_size, fp32_flat_groups, param_alignment_paddings = parse_optim_states(
+ optim_files, ds_checkpoint_dir)
+ print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}")
+
+ if zero_stage <= 2:
+ return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters, param_alignment_paddings)
+ elif zero_stage == 3:
+ return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters)
+
+
+def _zero2_merge_frozen_params(state_dict, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ frozen_param_fragments = zero_model_states[0].frozen_param_fragments
+
+ if debug:
+ num_elem = sum(s.numel() for s in frozen_param_shapes.values())
+ print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in frozen_param_fragments.values()])
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ state_dict[name] = frozen_param_fragments[name]
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _has_callable(obj, fn):
+ attr = getattr(obj, fn, None)
+ return callable(attr)
+
+
+def _zero2_merge_trainable_params(state_dict,
+ world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ param_alignment_paddings=None):
+ param_shapes = zero_model_states[0].param_shapes
+
+ # Reconstruction protocol:
+ #
+ # XXX: document this
+
+ if debug:
+ for i in range(world_size):
+ for j in range(len(fp32_flat_groups[0])):
+ print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}")
+
+ # XXX: memory usage doubles here (zero2)
+ num_param_groups = len(fp32_flat_groups[0])
+ merged_single_partition_of_fp32_groups = []
+ for i in range(num_param_groups):
+ merged_partitions = [sd[i] for sd in fp32_flat_groups]
+ full_single_fp32_vector = torch.cat(merged_partitions, 0)
+ merged_single_partition_of_fp32_groups.append(full_single_fp32_vector)
+ avail_numel = sum(
+ [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups])
+
+ if debug:
+ wanted_params = sum([len(shapes) for shapes in param_shapes])
+ wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes])
+ # not asserting if there is a mismatch due to possible padding
+ print(f"Have {avail_numel} numels to process.")
+ print(f"Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ total_numel = 0
+ total_params = 0
+ for group_idx, (shapes,
+ full_single_fp32_vector) in enumerate(zip(param_shapes, merged_single_partition_of_fp32_groups)):
+ offset = 0
+ avail_numel = full_single_fp32_vector.numel()
+ group_alignment_paddings = None
+ if param_alignment_paddings is not None:
+ group_alignment_paddings = param_alignment_paddings[group_idx]
+ if len(group_alignment_paddings) != len(shapes):
+ raise ValueError(f"Expected {len(shapes)} parameter alignment paddings for group {group_idx}, "
+ f"but found {len(group_alignment_paddings)}")
+
+ for param_idx, (name, shape) in enumerate(shapes.items()):
+
+ unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape)
+ total_numel += unpartitioned_numel
+ total_params += 1
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+ state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape)
+ offset += unpartitioned_numel
+ if group_alignment_paddings is not None:
+ offset += group_alignment_paddings[param_idx]
+
+ # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and
+ # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex
+ # paddings performed in the code it's almost impossible to predict the exact numbers w/o the
+ # live optimizer object, so we are checking that the numbers are within the right range
+ align_to = 2 * world_size
+
+ def zero2_align(x):
+ return align_to * math.ceil(x / align_to)
+
+ if debug:
+ print(f"original offset={offset}, avail_numel={avail_numel}")
+
+ offset = zero2_align(offset)
+ avail_numel = zero2_align(avail_numel)
+
+ if debug:
+ print(f"aligned offset={offset}, avail_numel={avail_numel}")
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero2_checkpoint(world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ exclude_frozen_parameters,
+ param_alignment_paddings=None):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero2_merge_frozen_params(state_dict, zero_model_states)
+
+ _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states,
+ param_alignment_paddings)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def zero3_partitioned_param_info(unpartitioned_numel, world_size):
+ remainder = unpartitioned_numel % world_size
+ padding_numel = (world_size - remainder) if remainder else 0
+ partitioned_numel = math.ceil(unpartitioned_numel / world_size)
+ return partitioned_numel, padding_numel
+
+
+def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ if debug:
+ for i in range(world_size):
+ num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values())
+ print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in zero_model_states[0].frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states)
+ state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape)
+
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+class GatheredTensor:
+ """
+ A pseudo tensor that collects partitioned weights.
+ It is more memory efficient when there are multiple groups.
+ """
+
+ def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape):
+ self.flat_groups = flat_groups
+ self.flat_groups_offset = flat_groups_offset
+ self.offset = offset
+ self.partitioned_numel = partitioned_numel
+ self.shape = shape
+ self.dtype = self.flat_groups[0][0].dtype
+
+ def contiguous(self):
+ """
+ Merge partitioned weights from flat_groups into a single tensor.
+ """
+ end_idx = self.offset + self.partitioned_numel
+ world_size = len(self.flat_groups)
+ pad_flat_param_chunks = []
+
+ for rank_i in range(world_size):
+ # for each rank, we need to collect weights from related group/groups
+ flat_groups_at_rank_i = self.flat_groups[rank_i]
+ start_group_id = None
+ end_group_id = None
+ for group_id in range(len(self.flat_groups_offset)):
+ if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]:
+ start_group_id = group_id
+ if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]:
+ end_group_id = group_id
+ break
+ # collect weights from related group/groups
+ for group_id in range(start_group_id, end_group_id + 1):
+ flat_tensor = flat_groups_at_rank_i[group_id]
+ start_offset = self.offset - self.flat_groups_offset[group_id]
+ end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id]
+ pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset])
+
+ # collect weights from all ranks
+ pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0)
+ param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous()
+ return param
+
+
+def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states):
+ param_shapes = zero_model_states[0].param_shapes
+ avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size
+
+ # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each
+ # param, re-consolidating each param, while dealing with padding if any
+
+ # merge list of dicts, preserving order
+ param_shapes = {k: v for d in param_shapes for k, v in d.items()}
+
+ if debug:
+ for i in range(world_size):
+ print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}")
+
+ wanted_params = len(param_shapes)
+ wanted_numel = sum(shape.numel() for shape in param_shapes.values())
+ # not asserting if there is a mismatch due to possible padding
+ avail_numel = fp32_flat_groups[0].numel() * world_size
+ print(f"Trainable params: Have {avail_numel} numels to process.")
+ print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ offset = 0
+ total_numel = 0
+ total_params = 0
+ flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]]))
+ for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'):
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+ total_params += 1
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ # memory efficient tensor
+ tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape)
+ state_dict[name] = tensor
+ offset += partitioned_numel
+
+ offset *= world_size
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero3_merge_frozen_params(state_dict, world_size, zero_model_states)
+
+ _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def to_torch_tensor(state_dict, return_empty_tensor=False, dtype=None):
+ """
+ Convert state_dict of GatheredTensor to torch tensor
+ """
+ if dtype is not None:
+ dtype = _resolve_output_dtype(dtype)
+
+ torch_state_dict = {}
+ converted_tensors = {}
+ for name, tensor in state_dict.items():
+ tensor_id = id(tensor)
+ if tensor_id in converted_tensors: # shared tensors
+ shared_tensor = torch_state_dict[converted_tensors[tensor_id]]
+ torch_state_dict[name] = shared_tensor
+ else:
+ converted_tensors[tensor_id] = name
+ if return_empty_tensor:
+ torch_state_dict[name] = torch.empty(tensor.shape, dtype=dtype or tensor.dtype)
+ else:
+ contiguous_tensor = tensor.contiguous()
+ torch_state_dict[name] = contiguous_tensor.to(dtype=dtype) if dtype else contiguous_tensor
+ return torch_state_dict
+
+
+def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag=None,
+ exclude_frozen_parameters=False,
+ lazy_mode=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with
+ ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example
+ via a model hub.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient.
+ Convert the pesduo tensor to torch tensor by ``.contiguous()``
+
+ Returns:
+ - pytorch ``state_dict``
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ # do the training and checkpoint saving
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu
+ model = model.cpu() # move to cpu
+ model.load_state_dict(state_dict)
+ # submit to model hub or save the model to share with others
+
+ In this example the ``model`` will no longer be usable in the deepspeed context of the same
+ application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead.
+
+ Note: the above usage may not work if your application doesn't have sufficient free CPU memory.
+ You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with
+ the checkpoint. Or you can load state_dict in lazy mode ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu
+ for name, lazy_tensor in state_dict.item():
+ tensor = lazy_tensor.contiguous() # to cpu
+ print(name, tensor)
+ # del tensor to release memory if it no longer in use
+ """
+ if tag is None:
+ latest_path = os.path.join(checkpoint_dir, 'latest')
+ if os.path.isfile(latest_path):
+ with open(latest_path, 'r') as fd:
+ tag = fd.read().strip()
+ else:
+ raise ValueError(f"Unable to find 'latest' file at {latest_path}")
+
+ ds_checkpoint_dir = os.path.join(checkpoint_dir, tag)
+
+ if not os.path.isdir(ds_checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist")
+
+ state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters)
+ if lazy_mode:
+ return state_dict
+ else:
+ return to_torch_tensor(state_dict)
+
+
+def convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a consolidated ``state_dict`` file that can be
+ loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``output_dir``: directory for the PyTorch state_dict output files
+ - ``dtype``: output tensor dtype. Supports float32, float16, and bfloat16 as strings or torch dtypes.
+ - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB
+ - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ """
+
+ dtype = _resolve_output_dtype(dtype)
+
+ # Dependency pre-check
+ if safe_serialization:
+ try:
+ from safetensors.torch import save_file
+ except ImportError:
+ print('If you want to use `safe_serialization`, please `pip install safetensors`')
+ raise
+ if max_shard_size is not None:
+ try:
+ from huggingface_hub import split_torch_state_dict_into_shards
+ except ImportError:
+ print('If you want to use `max_shard_size`, please `pip install huggingface_hub`')
+ raise
+
+ # Convert zero checkpoint to state_dict
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag,
+ exclude_frozen_parameters,
+ lazy_mode=True)
+
+ # Shard the model if it is too big.
+ weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin"
+ if max_shard_size is not None:
+ filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors")
+ # an memory-efficient approach for sharding
+ empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True, dtype=dtype)
+ state_dict_split = split_torch_state_dict_into_shards(empty_state_dict,
+ filename_pattern=filename_pattern,
+ max_shard_size=max_shard_size)
+ else:
+ from collections import namedtuple
+ StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"])
+ state_dict_split = StateDictSplit(is_sharded=False,
+ filename_to_tensors={weights_name: list(state_dict.keys())})
+
+ # Save the model by shard
+ os.makedirs(output_dir, exist_ok=True)
+ filename_to_tensors = state_dict_split.filename_to_tensors.items()
+ for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"):
+ shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors}
+ shard_state_dict = to_torch_tensor(shard_state_dict, dtype=dtype)
+ output_path = os.path.join(output_dir, shard_file)
+ if safe_serialization:
+ save_file(shard_state_dict, output_path, metadata={"format": "pt"})
+ else:
+ torch.save(shard_state_dict, output_path)
+ # release the memory of current shard
+ for tensor_name in list(shard_state_dict.keys()):
+ del state_dict[tensor_name]
+ del shard_state_dict[tensor_name]
+ del shard_state_dict
+ gc.collect()
+
+ # Save index if sharded
+ if state_dict_split.is_sharded:
+ index = {
+ "metadata": state_dict_split.metadata,
+ "weight_map": state_dict_split.tensor_to_filename,
+ }
+ save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json"
+ save_index_file = os.path.join(output_dir, save_index_file)
+ with open(save_index_file, "w", encoding="utf-8") as f:
+ content = json.dumps(index, indent=2, sort_keys=True) + "\n"
+ f.write(content)
+
+
+def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir,
+ output_dir,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """Backward-compatible fp32 checkpoint conversion."""
+ return convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size=max_shard_size,
+ safe_serialization=safe_serialization,
+ tag=tag,
+ exclude_frozen_parameters=exclude_frozen_parameters)
+
+
+def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None):
+ """
+ 1. Put the provided model to cpu
+ 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict``
+ 3. Load it into the provided model
+
+ Args:
+ - ``model``: the model object to update
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+
+ Returns:
+ - ``model`: modified model
+
+ Make sure you have plenty of CPU memory available before you call this function. If you don't
+ have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it
+ conveniently placed for you in the checkpoint folder.
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint
+ model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir)
+ # submit to model hub or save the model to share with others
+
+ Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context
+ of the same application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ """
+ logger.info("Extracting fp32 weights")
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag)
+
+ logger.info("Overwriting model with fp32 weights")
+ model = model.cpu()
+ model.load_state_dict(state_dict, strict=False)
+
+ return model
+
+
+if __name__ == "__main__":
+ parser = argparse.ArgumentParser()
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir",
+ type=str,
+ help="directory to the pytorch fp32 state_dict output files"
+ "(e.g. path/checkpoint-12-output/)")
+ parser.add_argument(
+ "--max_shard_size",
+ type=str,
+ default="5GB",
+ help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size"
+ "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`"
+ "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances"
+ "without CPU OOM issues.")
+ parser.add_argument(
+ "--safe_serialization",
+ default=False,
+ action='store_true',
+ help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug")
+ args = parser.parse_args()
+
+ debug = args.debug
+
+ convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir,
+ args.output_dir,
+ max_shard_size=args.max_shard_size,
+ safe_serialization=args.safe_serialization,
+ tag=args.tag,
+ exclude_frozen_parameters=args.exclude_frozen_parameters)
diff --git a/qwen3-1.7b-teutonic-2e5/checkpoint-500/zero_to_torch.py b/qwen3-1.7b-teutonic-2e5/checkpoint-500/zero_to_torch.py
new file mode 100644
index 0000000000000000000000000000000000000000..81312e252400d77f03cc1a88522f8f18ebe70ee7
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/checkpoint-500/zero_to_torch.py
@@ -0,0 +1,54 @@
+#!/usr/bin/env python
+
+# SPDX-License-Identifier: Apache-2.0
+# DeepSpeed Team
+
+import argparse
+
+if __package__:
+ from . import zero_to_fp32
+else:
+ import zero_to_fp32
+
+
+def main(args=None):
+ parser = argparse.ArgumentParser(
+ description="Convert a DeepSpeed ZeRO checkpoint to float32, float16, or bfloat16 PyTorch weights.")
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir", type=str, help="directory for the converted PyTorch state_dict files")
+ parser.add_argument("--dtype",
+ type=str,
+ choices=sorted(zero_to_fp32.OUTPUT_DTYPE_NAMES),
+ required=True,
+ help="output tensor dtype")
+ parser.add_argument("--max_shard_size",
+ type=str,
+ default="5GB",
+ help="maximum size of each checkpoint shard, such as 5GB or 500MB")
+ parser.add_argument("--safe_serialization",
+ default=False,
+ action='store_true',
+ help="save with safetensors instead of PyTorch pickle serialization")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier, e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug output")
+ parsed_args = parser.parse_args(args)
+
+ zero_to_fp32.debug = parsed_args.debug
+ zero_to_fp32.convert_zero_checkpoint_to_state_dict(parsed_args.checkpoint_dir,
+ parsed_args.output_dir,
+ dtype=parsed_args.dtype,
+ max_shard_size=parsed_args.max_shard_size,
+ safe_serialization=parsed_args.safe_serialization,
+ tag=parsed_args.tag,
+ exclude_frozen_parameters=parsed_args.exclude_frozen_parameters)
+
+
+if __name__ == "__main__":
+ main()
diff --git a/qwen3-1.7b-teutonic-2e5/config.json b/qwen3-1.7b-teutonic-2e5/config.json
new file mode 100644
index 0000000000000000000000000000000000000000..5d9cef07396baadff5390e4508eb33025967a029
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/config.json
@@ -0,0 +1,63 @@
+{
+ "architectures": [
+ "Qwen3ForCausalLM"
+ ],
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "bos_token_id": null,
+ "dtype": "bfloat16",
+ "eos_token_id": 151645,
+ "head_dim": 128,
+ "hidden_act": "silu",
+ "hidden_size": 2048,
+ "initializer_range": 0.02,
+ "intermediate_size": 6144,
+ "layer_types": [
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 40960,
+ "max_window_layers": 28,
+ "model_type": "qwen3",
+ "num_attention_heads": 16,
+ "num_hidden_layers": 28,
+ "num_key_value_heads": 8,
+ "pad_token_id": 151643,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 1000000,
+ "rope_type": "default"
+ },
+ "sliding_window": null,
+ "tie_word_embeddings": true,
+ "transformers_version": "5.17.0",
+ "use_cache": false,
+ "use_sliding_window": false,
+ "vocab_size": 151936
+}
diff --git a/qwen3-1.7b-teutonic-2e5/generation_config.json b/qwen3-1.7b-teutonic-2e5/generation_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..e6941fe4b04f26113d6eef6255d005c4d7090bda
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/generation_config.json
@@ -0,0 +1,12 @@
+{
+ "do_sample": true,
+ "eos_token_id": [
+ 151645,
+ 151643
+ ],
+ "pad_token_id": 151643,
+ "temperature": 0.6,
+ "top_k": 20,
+ "top_p": 0.95,
+ "transformers_version": "5.17.0"
+}
diff --git a/qwen3-1.7b-teutonic-2e5/model.safetensors b/qwen3-1.7b-teutonic-2e5/model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..9b2666228db53911589c4cd2096c38c2c35ae728
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:5cdc018ad7b517ba5e4c7c4f00035390b4e85dec1fc68e477966614a72cda70c
+size 4063515640
diff --git a/qwen3-1.7b-teutonic-2e5/tokenizer.json b/qwen3-1.7b-teutonic-2e5/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..c7afbed2efcdf019f88ab0572ec29d3bf595dfe2
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:be75606093db2094d7cd20f3c2f385c212750648bd6ea4fb2bf507a6a4c55506
+size 11422650
diff --git a/qwen3-1.7b-teutonic-2e5/tokenizer_config.json b/qwen3-1.7b-teutonic-2e5/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..770e41d6c92519d525eede4cbcf3ba27f6425311
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/tokenizer_config.json
@@ -0,0 +1,30 @@
+{
+ "add_prefix_space": false,
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "is_local": false,
+ "local_files_only": false,
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/qwen3-1.7b-teutonic-2e5/training_args.bin b/qwen3-1.7b-teutonic-2e5/training_args.bin
new file mode 100644
index 0000000000000000000000000000000000000000..98c558883023185245bfac817f2ca585caa9d94f
--- /dev/null
+++ b/qwen3-1.7b-teutonic-2e5/training_args.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:2c573bdac95c796f8f7368ab9af6d35c5687f53373737ea965b8102d518df7cb
+size 7121
diff --git a/qwen3-1.7b-teutonic-5e6/README.md b/qwen3-1.7b-teutonic-5e6/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..049e6330c65495599a6bd0129376c0e4bb70285d
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/README.md
@@ -0,0 +1,58 @@
+---
+base_model: Qwen/Qwen3-1.7B
+library_name: transformers
+model_name: qwen3-1.7b-teutonic-5e6
+tags:
+- generated_from_trainer
+- trl
+- sft
+licence: license
+---
+
+# Model Card for qwen3-1.7b-teutonic-5e6
+
+This model is a fine-tuned version of [Qwen/Qwen3-1.7B](https://huggingface.co/Qwen/Qwen3-1.7B).
+It has been trained using [TRL](https://github.com/huggingface/trl).
+
+## Quick start
+
+```python
+from transformers import pipeline
+
+question = "If you had a time machine, but could only go to the past or the future once and never return, which would you choose and why?"
+generator = pipeline("text-generation", model="None", device_map="auto")
+output = generator([{"role": "user", "content": question}], max_new_tokens=128, return_full_text=False)[0]
+print(output["generated_text"])
+```
+
+## Training procedure
+
+[
](https://wandb.ai/digitallibrary849-adobe/tiny-teutonic-sn3/runs/70d7lwio)
+
+
+
+This model was trained with SFT.
+
+### Framework versions
+
+- TRL: 1.14.0
+- Transformers: 5.17.0
+- Pytorch: 2.14.0
+- Datasets: 5.0.1
+- Tokenizers: 0.23.2
+
+## Citations
+
+
+
+Cite TRL as:
+
+```bibtex
+@software{vonwerra2020trl,
+ title = {{TRL: Transformers Reinforcement Learning}},
+ author = {von Werra, Leandro and Belkada, Younes and Tunstall, Lewis and Beeching, Edward and Thrush, Tristan and Lambert, Nathan and Huang, Shengyi and Rasul, Kashif and Gallouédec, Quentin},
+ license = {Apache-2.0},
+ url = {https://github.com/huggingface/trl},
+ year = {2020}
+}
+```
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/chat_template.jinja b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..01be9b307daa2d425f7c168c9fb145a286e0afb4
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/chat_template.jinja
@@ -0,0 +1,89 @@
+{%- if tools %}
+ {{- '<|im_start|>system\n' }}
+ {%- if messages[0].role == 'system' %}
+ {{- messages[0].content + '\n\n' }}
+ {%- endif %}
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+{%- endfor %}
+{%- for message in messages %}
+ {%- if message.content is string %}
+ {%- set content = message.content %}
+ {%- else %}
+ {%- set content = '' %}
+ {%- endif %}
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {%- if loop.last or (not loop.last and reasoning_content) %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if (loop.first and content) or (not loop.first) %}
+ {{- '\n' }}
+ {%- endif %}
+ {%- if tool_call.function %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {{- '\n{"name": "' }}
+ {{- tool_call.name }}
+ {{- '", "arguments": ' }}
+ {%- if tool_call.arguments is string %}
+ {{- tool_call.arguments }}
+ {%- else %}
+ {{- tool_call.arguments | tojson }}
+ {%- endif %}
+ {{- '}\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/config.json
new file mode 100644
index 0000000000000000000000000000000000000000..5d9cef07396baadff5390e4508eb33025967a029
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/config.json
@@ -0,0 +1,63 @@
+{
+ "architectures": [
+ "Qwen3ForCausalLM"
+ ],
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "bos_token_id": null,
+ "dtype": "bfloat16",
+ "eos_token_id": 151645,
+ "head_dim": 128,
+ "hidden_act": "silu",
+ "hidden_size": 2048,
+ "initializer_range": 0.02,
+ "intermediate_size": 6144,
+ "layer_types": [
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 40960,
+ "max_window_layers": 28,
+ "model_type": "qwen3",
+ "num_attention_heads": 16,
+ "num_hidden_layers": 28,
+ "num_key_value_heads": 8,
+ "pad_token_id": 151643,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 1000000,
+ "rope_type": "default"
+ },
+ "sliding_window": null,
+ "tie_word_embeddings": true,
+ "transformers_version": "5.17.0",
+ "use_cache": false,
+ "use_sliding_window": false,
+ "vocab_size": 151936
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/generation_config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/generation_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..e6941fe4b04f26113d6eef6255d005c4d7090bda
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/generation_config.json
@@ -0,0 +1,12 @@
+{
+ "do_sample": true,
+ "eos_token_id": [
+ 151645,
+ 151643
+ ],
+ "pad_token_id": 151643,
+ "temperature": 0.6,
+ "top_k": 20,
+ "top_p": 0.95,
+ "transformers_version": "5.17.0"
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/global_step1000/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/global_step1000/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..b6bdc16d21b0820cfac803813745f1fd70bd3dd5
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/global_step1000/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:c8a370f3e99985781f582f8b41979f9fb2f97d41e1aacb7f03a31f7cd78e752d
+size 10323466465
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/global_step1000/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/global_step1000/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..ea3d0e0691f656fe4f8c6179177b0d34e185fe10
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/global_step1000/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:16039ddb7318658adea232db5745823afa53d087fd4be4ac9994cf224c807c74
+size 10323469601
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/global_step1000/mp_rank_00_model_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/global_step1000/mp_rank_00_model_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..f4b2827711ab1aa283747f66268977cbe724e546
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/global_step1000/mp_rank_00_model_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:3f32f1006b04fdd13f53abf608168a5e5d22360ee55e8bd05fca00ada9c8ffd1
+size 3441239653
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/latest b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/latest
new file mode 100644
index 0000000000000000000000000000000000000000..e2d3435fb1acf8913e6bd6c51b01adfc69b11ac6
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/latest
@@ -0,0 +1 @@
+global_step1000
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/model.safetensors b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..270cca23599e7bb5dc06edf449356db5d39422f0
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:f2f35f184f0c01dfdf959680db354c78568f33701e69fc8a3fe596e3f07e5bb3
+size 4063515640
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/rng_state_0.pth b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/rng_state_0.pth
new file mode 100644
index 0000000000000000000000000000000000000000..725d3197bef5258977c915442fc51d4b4ea7a0e4
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/rng_state_0.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:fc2024de3977e14d8eb49138e464852d3139a95403b42712dff426b122dbd9a8
+size 14917
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/rng_state_1.pth b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/rng_state_1.pth
new file mode 100644
index 0000000000000000000000000000000000000000..51be189cbea3691d1ea86ad41ebb86675d39e2ab
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/rng_state_1.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:9f3ccf71b831b178a658a6e1b5e409218184e44f34db2ecfb332baac716953af
+size 14917
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/scheduler.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/scheduler.pt
new file mode 100644
index 0000000000000000000000000000000000000000..751fad2d2e6a75d120f9bb22b0601b725a62ee4a
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/scheduler.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:d6ffa1830cc30c9d315b1b2a0bbeac93f0e07a42e9742eaad163664d9c593061
+size 1465
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/tokenizer.json b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..c7afbed2efcdf019f88ab0572ec29d3bf595dfe2
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:be75606093db2094d7cd20f3c2f385c212750648bd6ea4fb2bf507a6a4c55506
+size 11422650
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/tokenizer_config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..770e41d6c92519d525eede4cbcf3ba27f6425311
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/tokenizer_config.json
@@ -0,0 +1,30 @@
+{
+ "add_prefix_space": false,
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "is_local": false,
+ "local_files_only": false,
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/trainer_state.json b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..eac30f84c823b21ebe46ad5e624789c45a60803e
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/trainer_state.json
@@ -0,0 +1,10254 @@
+{
+ "best_global_step": 950,
+ "best_metric": 1.5272752046585083,
+ "best_model_checkpoint": "./checkpoints/qwen3-1.7b-teutonic-5e6/checkpoint-500",
+ "epoch": 2.0202020202020203,
+ "eval_steps": 50,
+ "global_step": 1000,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 0.8295683860778809,
+ "epoch": 0.00202020202020202,
+ "grad_norm": 10.886772155761719,
+ "learning_rate": 5e-06,
+ "loss": 1.5185801982879639,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 16384.0,
+ "step": 1
+ },
+ {
+ "entropy": 1.1781222820281982,
+ "epoch": 0.00404040404040404,
+ "grad_norm": 13.80163288116455,
+ "learning_rate": 4.997979797979798e-06,
+ "loss": 2.18377685546875,
+ "mean_token_accuracy": 0.5700415372848511,
+ "num_tokens": 32768.0,
+ "step": 2
+ },
+ {
+ "entropy": 0.7972303032875061,
+ "epoch": 0.006060606060606061,
+ "grad_norm": 13.71261215209961,
+ "learning_rate": 4.995959595959596e-06,
+ "loss": 1.5810277462005615,
+ "mean_token_accuracy": 0.6782486438751221,
+ "num_tokens": 49152.0,
+ "step": 3
+ },
+ {
+ "entropy": 0.9709298610687256,
+ "epoch": 0.00808080808080808,
+ "grad_norm": 9.18797779083252,
+ "learning_rate": 4.993939393939394e-06,
+ "loss": 1.6923656463623047,
+ "mean_token_accuracy": 0.6447850465774536,
+ "num_tokens": 65536.0,
+ "step": 4
+ },
+ {
+ "entropy": 1.2161898612976074,
+ "epoch": 0.010101010101010102,
+ "grad_norm": 8.97508430480957,
+ "learning_rate": 4.991919191919192e-06,
+ "loss": 1.9361608028411865,
+ "mean_token_accuracy": 0.5922691822052002,
+ "num_tokens": 81920.0,
+ "step": 5
+ },
+ {
+ "entropy": 0.9950039982795715,
+ "epoch": 0.012121212121212121,
+ "grad_norm": 6.453213214874268,
+ "learning_rate": 4.98989898989899e-06,
+ "loss": 1.5012480020523071,
+ "mean_token_accuracy": 0.6671959161758423,
+ "num_tokens": 98304.0,
+ "step": 6
+ },
+ {
+ "entropy": 1.452682614326477,
+ "epoch": 0.014141414141414142,
+ "grad_norm": 8.50411605834961,
+ "learning_rate": 4.987878787878789e-06,
+ "loss": 2.1297783851623535,
+ "mean_token_accuracy": 0.5807889699935913,
+ "num_tokens": 114688.0,
+ "step": 7
+ },
+ {
+ "entropy": 1.4661014080047607,
+ "epoch": 0.01616161616161616,
+ "grad_norm": 4.290146827697754,
+ "learning_rate": 4.9858585858585865e-06,
+ "loss": 1.7391963005065918,
+ "mean_token_accuracy": 0.611993134021759,
+ "num_tokens": 131072.0,
+ "step": 8
+ },
+ {
+ "entropy": 1.9030903577804565,
+ "epoch": 0.01818181818181818,
+ "grad_norm": 4.503584384918213,
+ "learning_rate": 4.983838383838384e-06,
+ "loss": 2.283596992492676,
+ "mean_token_accuracy": 0.5261968970298767,
+ "num_tokens": 147456.0,
+ "step": 9
+ },
+ {
+ "entropy": 1.2784137725830078,
+ "epoch": 0.020202020202020204,
+ "grad_norm": 3.427410840988159,
+ "learning_rate": 4.981818181818182e-06,
+ "loss": 1.5032392740249634,
+ "mean_token_accuracy": 0.6578529477119446,
+ "num_tokens": 163840.0,
+ "step": 10
+ },
+ {
+ "entropy": 1.7487188577651978,
+ "epoch": 0.022222222222222223,
+ "grad_norm": 3.20536470413208,
+ "learning_rate": 4.97979797979798e-06,
+ "loss": 1.9184643030166626,
+ "mean_token_accuracy": 0.6093673706054688,
+ "num_tokens": 180224.0,
+ "step": 11
+ },
+ {
+ "entropy": 1.6585394144058228,
+ "epoch": 0.024242424242424242,
+ "grad_norm": 3.2463598251342773,
+ "learning_rate": 4.977777777777778e-06,
+ "loss": 1.8364639282226562,
+ "mean_token_accuracy": 0.6014899611473083,
+ "num_tokens": 196608.0,
+ "step": 12
+ },
+ {
+ "entropy": 1.4869519472122192,
+ "epoch": 0.026262626262626262,
+ "grad_norm": 2.8681719303131104,
+ "learning_rate": 4.975757575757576e-06,
+ "loss": 1.6356265544891357,
+ "mean_token_accuracy": 0.6361138224601746,
+ "num_tokens": 212992.0,
+ "step": 13
+ },
+ {
+ "entropy": 1.5179094076156616,
+ "epoch": 0.028282828282828285,
+ "grad_norm": 3.0470707416534424,
+ "learning_rate": 4.973737373737374e-06,
+ "loss": 1.6317660808563232,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 229376.0,
+ "step": 14
+ },
+ {
+ "entropy": 1.7384330034255981,
+ "epoch": 0.030303030303030304,
+ "grad_norm": 2.6149742603302,
+ "learning_rate": 4.971717171717172e-06,
+ "loss": 1.67923903465271,
+ "mean_token_accuracy": 0.6469223499298096,
+ "num_tokens": 245760.0,
+ "step": 15
+ },
+ {
+ "entropy": 2.108799457550049,
+ "epoch": 0.03232323232323232,
+ "grad_norm": 3.694795608520508,
+ "learning_rate": 4.9696969696969696e-06,
+ "loss": 1.9052371978759766,
+ "mean_token_accuracy": 0.5927577018737793,
+ "num_tokens": 262144.0,
+ "step": 16
+ },
+ {
+ "entropy": 1.7532848119735718,
+ "epoch": 0.03434343434343434,
+ "grad_norm": 3.1510567665100098,
+ "learning_rate": 4.9676767676767675e-06,
+ "loss": 1.6382691860198975,
+ "mean_token_accuracy": 0.6311675906181335,
+ "num_tokens": 278528.0,
+ "step": 17
+ },
+ {
+ "entropy": 1.723548412322998,
+ "epoch": 0.03636363636363636,
+ "grad_norm": 3.093825340270996,
+ "learning_rate": 4.965656565656566e-06,
+ "loss": 1.6039624214172363,
+ "mean_token_accuracy": 0.6313507556915283,
+ "num_tokens": 294912.0,
+ "step": 18
+ },
+ {
+ "entropy": 1.4790765047073364,
+ "epoch": 0.03838383838383838,
+ "grad_norm": 2.7150535583496094,
+ "learning_rate": 4.963636363636364e-06,
+ "loss": 1.4173667430877686,
+ "mean_token_accuracy": 0.6627381443977356,
+ "num_tokens": 311296.0,
+ "step": 19
+ },
+ {
+ "entropy": 1.5827536582946777,
+ "epoch": 0.04040404040404041,
+ "grad_norm": 2.610966444015503,
+ "learning_rate": 4.961616161616162e-06,
+ "loss": 1.4604644775390625,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 327680.0,
+ "step": 20
+ },
+ {
+ "entropy": 2.054673194885254,
+ "epoch": 0.04242424242424243,
+ "grad_norm": 2.612940788269043,
+ "learning_rate": 4.95959595959596e-06,
+ "loss": 1.962029218673706,
+ "mean_token_accuracy": 0.5719956159591675,
+ "num_tokens": 344064.0,
+ "step": 21
+ },
+ {
+ "entropy": 1.6684198379516602,
+ "epoch": 0.044444444444444446,
+ "grad_norm": 2.5426013469696045,
+ "learning_rate": 4.957575757575758e-06,
+ "loss": 1.591176986694336,
+ "mean_token_accuracy": 0.6519907116889954,
+ "num_tokens": 360448.0,
+ "step": 22
+ },
+ {
+ "entropy": 1.9070855379104614,
+ "epoch": 0.046464646464646465,
+ "grad_norm": 2.5853357315063477,
+ "learning_rate": 4.9555555555555565e-06,
+ "loss": 1.930276870727539,
+ "mean_token_accuracy": 0.5895823240280151,
+ "num_tokens": 376832.0,
+ "step": 23
+ },
+ {
+ "entropy": 1.716689109802246,
+ "epoch": 0.048484848484848485,
+ "grad_norm": 2.7608494758605957,
+ "learning_rate": 4.953535353535354e-06,
+ "loss": 1.739159345626831,
+ "mean_token_accuracy": 0.6028944849967957,
+ "num_tokens": 393216.0,
+ "step": 24
+ },
+ {
+ "entropy": 1.5666695833206177,
+ "epoch": 0.050505050505050504,
+ "grad_norm": 2.5973074436187744,
+ "learning_rate": 4.951515151515152e-06,
+ "loss": 1.6016302108764648,
+ "mean_token_accuracy": 0.626099169254303,
+ "num_tokens": 409600.0,
+ "step": 25
+ },
+ {
+ "entropy": 1.4267652034759521,
+ "epoch": 0.052525252525252523,
+ "grad_norm": 2.163451910018921,
+ "learning_rate": 4.94949494949495e-06,
+ "loss": 1.5093598365783691,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 425984.0,
+ "step": 26
+ },
+ {
+ "entropy": 1.8537150621414185,
+ "epoch": 0.05454545454545454,
+ "grad_norm": 2.6983258724212646,
+ "learning_rate": 4.947474747474748e-06,
+ "loss": 1.8831868171691895,
+ "mean_token_accuracy": 0.5802393555641174,
+ "num_tokens": 442368.0,
+ "step": 27
+ },
+ {
+ "entropy": 1.410015344619751,
+ "epoch": 0.05656565656565657,
+ "grad_norm": 2.4777796268463135,
+ "learning_rate": 4.945454545454546e-06,
+ "loss": 1.4835734367370605,
+ "mean_token_accuracy": 0.6519907116889954,
+ "num_tokens": 458752.0,
+ "step": 28
+ },
+ {
+ "entropy": 1.2399017810821533,
+ "epoch": 0.05858585858585859,
+ "grad_norm": 2.1676478385925293,
+ "learning_rate": 4.943434343434344e-06,
+ "loss": 1.330633282661438,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 475136.0,
+ "step": 29
+ },
+ {
+ "entropy": 1.6478898525238037,
+ "epoch": 0.06060606060606061,
+ "grad_norm": 2.5325536727905273,
+ "learning_rate": 4.941414141414142e-06,
+ "loss": 1.771777868270874,
+ "mean_token_accuracy": 0.6128480434417725,
+ "num_tokens": 491520.0,
+ "step": 30
+ },
+ {
+ "entropy": 1.7915360927581787,
+ "epoch": 0.06262626262626263,
+ "grad_norm": 2.2419557571411133,
+ "learning_rate": 4.93939393939394e-06,
+ "loss": 1.870645523071289,
+ "mean_token_accuracy": 0.6074743270874023,
+ "num_tokens": 507904.0,
+ "step": 31
+ },
+ {
+ "entropy": 1.7638899087905884,
+ "epoch": 0.06464646464646465,
+ "grad_norm": 2.8063058853149414,
+ "learning_rate": 4.937373737373738e-06,
+ "loss": 1.83987557888031,
+ "mean_token_accuracy": 0.5836589932441711,
+ "num_tokens": 524288.0,
+ "step": 32
+ },
+ {
+ "entropy": 1.4097516536712646,
+ "epoch": 0.06666666666666667,
+ "grad_norm": 2.1857714653015137,
+ "learning_rate": 4.935353535353536e-06,
+ "loss": 1.477668285369873,
+ "mean_token_accuracy": 0.6507083773612976,
+ "num_tokens": 540672.0,
+ "step": 33
+ },
+ {
+ "entropy": 1.4447426795959473,
+ "epoch": 0.06868686868686869,
+ "grad_norm": 2.3771870136260986,
+ "learning_rate": 4.933333333333334e-06,
+ "loss": 1.536318063735962,
+ "mean_token_accuracy": 0.6383732557296753,
+ "num_tokens": 557056.0,
+ "step": 34
+ },
+ {
+ "entropy": 1.9658164978027344,
+ "epoch": 0.0707070707070707,
+ "grad_norm": 2.4784936904907227,
+ "learning_rate": 4.931313131313132e-06,
+ "loss": 2.0565035343170166,
+ "mean_token_accuracy": 0.5581949353218079,
+ "num_tokens": 573440.0,
+ "step": 35
+ },
+ {
+ "entropy": 1.6045317649841309,
+ "epoch": 0.07272727272727272,
+ "grad_norm": 2.1128504276275635,
+ "learning_rate": 4.92929292929293e-06,
+ "loss": 1.6234952211380005,
+ "mean_token_accuracy": 0.6293356418609619,
+ "num_tokens": 589824.0,
+ "step": 36
+ },
+ {
+ "entropy": 1.5491269826889038,
+ "epoch": 0.07474747474747474,
+ "grad_norm": 2.1672937870025635,
+ "learning_rate": 4.927272727272728e-06,
+ "loss": 1.5809822082519531,
+ "mean_token_accuracy": 0.6419760584831238,
+ "num_tokens": 606208.0,
+ "step": 37
+ },
+ {
+ "entropy": 1.545534610748291,
+ "epoch": 0.07676767676767676,
+ "grad_norm": 2.2526934146881104,
+ "learning_rate": 4.925252525252526e-06,
+ "loss": 1.5707473754882812,
+ "mean_token_accuracy": 0.6344650983810425,
+ "num_tokens": 622592.0,
+ "step": 38
+ },
+ {
+ "entropy": 1.579596757888794,
+ "epoch": 0.07878787878787878,
+ "grad_norm": 2.3988492488861084,
+ "learning_rate": 4.9232323232323235e-06,
+ "loss": 1.6725983619689941,
+ "mean_token_accuracy": 0.6243282556533813,
+ "num_tokens": 638976.0,
+ "step": 39
+ },
+ {
+ "entropy": 2.0438785552978516,
+ "epoch": 0.08080808080808081,
+ "grad_norm": 2.3314359188079834,
+ "learning_rate": 4.9212121212121214e-06,
+ "loss": 2.0424888134002686,
+ "mean_token_accuracy": 0.570713222026825,
+ "num_tokens": 655360.0,
+ "step": 40
+ },
+ {
+ "entropy": 1.8690773248672485,
+ "epoch": 0.08282828282828283,
+ "grad_norm": 2.130401134490967,
+ "learning_rate": 4.919191919191919e-06,
+ "loss": 1.8796970844268799,
+ "mean_token_accuracy": 0.5882999300956726,
+ "num_tokens": 671744.0,
+ "step": 41
+ },
+ {
+ "entropy": 1.756626009941101,
+ "epoch": 0.08484848484848485,
+ "grad_norm": 2.342318534851074,
+ "learning_rate": 4.917171717171717e-06,
+ "loss": 1.71901535987854,
+ "mean_token_accuracy": 0.6173668503761292,
+ "num_tokens": 688128.0,
+ "step": 42
+ },
+ {
+ "entropy": 1.4642508029937744,
+ "epoch": 0.08686868686868687,
+ "grad_norm": 1.993338704109192,
+ "learning_rate": 4.915151515151516e-06,
+ "loss": 1.4660165309906006,
+ "mean_token_accuracy": 0.6687225103378296,
+ "num_tokens": 704512.0,
+ "step": 43
+ },
+ {
+ "entropy": 1.790807843208313,
+ "epoch": 0.08888888888888889,
+ "grad_norm": 2.3186943531036377,
+ "learning_rate": 4.913131313131314e-06,
+ "loss": 1.7102060317993164,
+ "mean_token_accuracy": 0.6238397359848022,
+ "num_tokens": 720896.0,
+ "step": 44
+ },
+ {
+ "entropy": 1.5970485210418701,
+ "epoch": 0.09090909090909091,
+ "grad_norm": 2.299307346343994,
+ "learning_rate": 4.911111111111112e-06,
+ "loss": 1.5170013904571533,
+ "mean_token_accuracy": 0.652662456035614,
+ "num_tokens": 737280.0,
+ "step": 45
+ },
+ {
+ "entropy": 1.3955466747283936,
+ "epoch": 0.09292929292929293,
+ "grad_norm": 2.171952962875366,
+ "learning_rate": 4.90909090909091e-06,
+ "loss": 1.4059661626815796,
+ "mean_token_accuracy": 0.6654250025749207,
+ "num_tokens": 753664.0,
+ "step": 46
+ },
+ {
+ "entropy": 1.7198575735092163,
+ "epoch": 0.09494949494949495,
+ "grad_norm": 2.385092258453369,
+ "learning_rate": 4.9070707070707075e-06,
+ "loss": 1.730346918106079,
+ "mean_token_accuracy": 0.6191987991333008,
+ "num_tokens": 770048.0,
+ "step": 47
+ },
+ {
+ "entropy": 1.3542555570602417,
+ "epoch": 0.09696969696969697,
+ "grad_norm": 2.1463189125061035,
+ "learning_rate": 4.905050505050505e-06,
+ "loss": 1.346085786819458,
+ "mean_token_accuracy": 0.680446982383728,
+ "num_tokens": 786432.0,
+ "step": 48
+ },
+ {
+ "entropy": 1.8084443807601929,
+ "epoch": 0.09898989898989899,
+ "grad_norm": 2.1505849361419678,
+ "learning_rate": 4.903030303030303e-06,
+ "loss": 1.847151756286621,
+ "mean_token_accuracy": 0.5926355719566345,
+ "num_tokens": 802816.0,
+ "step": 49
+ },
+ {
+ "entropy": 1.751160979270935,
+ "epoch": 0.10101010101010101,
+ "grad_norm": 2.1436259746551514,
+ "learning_rate": 4.901010101010101e-06,
+ "loss": 1.7802404165267944,
+ "mean_token_accuracy": 0.5996580123901367,
+ "num_tokens": 819200.0,
+ "step": 50
+ },
+ {
+ "epoch": 0.10101010101010101,
+ "eval_entropy": 1.6292865045609013,
+ "eval_loss": 1.6725393533706665,
+ "eval_mean_token_accuracy": 0.6230050469598463,
+ "eval_num_tokens": 819200.0,
+ "eval_runtime": 43.9148,
+ "eval_samples_per_second": 22.544,
+ "eval_steps_per_second": 2.824,
+ "step": 50
+ },
+ {
+ "entropy": 1.4428319931030273,
+ "epoch": 0.10303030303030303,
+ "grad_norm": 2.0954954624176025,
+ "learning_rate": 4.898989898989899e-06,
+ "loss": 1.4927232265472412,
+ "mean_token_accuracy": 0.6522349715232849,
+ "num_tokens": 835584.0,
+ "step": 51
+ },
+ {
+ "entropy": 1.7493115663528442,
+ "epoch": 0.10505050505050505,
+ "grad_norm": 2.300030469894409,
+ "learning_rate": 4.896969696969697e-06,
+ "loss": 1.737417221069336,
+ "mean_token_accuracy": 0.6213361024856567,
+ "num_tokens": 851968.0,
+ "step": 52
+ },
+ {
+ "entropy": 1.7801647186279297,
+ "epoch": 0.10707070707070707,
+ "grad_norm": 2.3947081565856934,
+ "learning_rate": 4.894949494949495e-06,
+ "loss": 1.8372564315795898,
+ "mean_token_accuracy": 0.5931240916252136,
+ "num_tokens": 868352.0,
+ "step": 53
+ },
+ {
+ "entropy": 1.6934887170791626,
+ "epoch": 0.10909090909090909,
+ "grad_norm": 2.1981089115142822,
+ "learning_rate": 4.8929292929292936e-06,
+ "loss": 1.734646201133728,
+ "mean_token_accuracy": 0.611932098865509,
+ "num_tokens": 884736.0,
+ "step": 54
+ },
+ {
+ "entropy": 1.3401941061019897,
+ "epoch": 0.1111111111111111,
+ "grad_norm": 2.193511724472046,
+ "learning_rate": 4.8909090909090914e-06,
+ "loss": 1.399888038635254,
+ "mean_token_accuracy": 0.6745847463607788,
+ "num_tokens": 901120.0,
+ "step": 55
+ },
+ {
+ "entropy": 1.8244661092758179,
+ "epoch": 0.11313131313131314,
+ "grad_norm": 2.4358489513397217,
+ "learning_rate": 4.888888888888889e-06,
+ "loss": 1.8716282844543457,
+ "mean_token_accuracy": 0.5867122411727905,
+ "num_tokens": 917504.0,
+ "step": 56
+ },
+ {
+ "entropy": 1.5019619464874268,
+ "epoch": 0.11515151515151516,
+ "grad_norm": 2.1135261058807373,
+ "learning_rate": 4.886868686868687e-06,
+ "loss": 1.523103952407837,
+ "mean_token_accuracy": 0.6414265036582947,
+ "num_tokens": 933888.0,
+ "step": 57
+ },
+ {
+ "entropy": 1.6132855415344238,
+ "epoch": 0.11717171717171718,
+ "grad_norm": 2.026301145553589,
+ "learning_rate": 4.884848484848485e-06,
+ "loss": 1.6233609914779663,
+ "mean_token_accuracy": 0.6279311180114746,
+ "num_tokens": 950272.0,
+ "step": 58
+ },
+ {
+ "entropy": 1.738538384437561,
+ "epoch": 0.1191919191919192,
+ "grad_norm": 2.1539394855499268,
+ "learning_rate": 4.882828282828283e-06,
+ "loss": 1.8147332668304443,
+ "mean_token_accuracy": 0.6124816536903381,
+ "num_tokens": 966656.0,
+ "step": 59
+ },
+ {
+ "entropy": 1.5533764362335205,
+ "epoch": 0.12121212121212122,
+ "grad_norm": 2.2603628635406494,
+ "learning_rate": 4.880808080808081e-06,
+ "loss": 1.562873125076294,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 983040.0,
+ "step": 60
+ },
+ {
+ "entropy": 1.722406268119812,
+ "epoch": 0.12323232323232323,
+ "grad_norm": 2.3630757331848145,
+ "learning_rate": 4.878787878787879e-06,
+ "loss": 1.7461689710617065,
+ "mean_token_accuracy": 0.6023448705673218,
+ "num_tokens": 999424.0,
+ "step": 61
+ },
+ {
+ "entropy": 1.6533517837524414,
+ "epoch": 0.12525252525252525,
+ "grad_norm": 2.2165415287017822,
+ "learning_rate": 4.876767676767677e-06,
+ "loss": 1.676560640335083,
+ "mean_token_accuracy": 0.6437469720840454,
+ "num_tokens": 1015808.0,
+ "step": 62
+ },
+ {
+ "entropy": 1.749995470046997,
+ "epoch": 0.12727272727272726,
+ "grad_norm": 2.1572678089141846,
+ "learning_rate": 4.8747474747474745e-06,
+ "loss": 1.784087896347046,
+ "mean_token_accuracy": 0.5884831547737122,
+ "num_tokens": 1032192.0,
+ "step": 63
+ },
+ {
+ "entropy": 1.442152738571167,
+ "epoch": 0.1292929292929293,
+ "grad_norm": 2.163490056991577,
+ "learning_rate": 4.872727272727273e-06,
+ "loss": 1.4307503700256348,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 1048576.0,
+ "step": 64
+ },
+ {
+ "entropy": 1.2657029628753662,
+ "epoch": 0.13131313131313133,
+ "grad_norm": 2.1225337982177734,
+ "learning_rate": 4.870707070707071e-06,
+ "loss": 1.2731966972351074,
+ "mean_token_accuracy": 0.688568651676178,
+ "num_tokens": 1064960.0,
+ "step": 65
+ },
+ {
+ "entropy": 1.1613880395889282,
+ "epoch": 0.13333333333333333,
+ "grad_norm": 1.9527196884155273,
+ "learning_rate": 4.868686868686869e-06,
+ "loss": 1.13922119140625,
+ "mean_token_accuracy": 0.7389472126960754,
+ "num_tokens": 1081344.0,
+ "step": 66
+ },
+ {
+ "entropy": 1.6936380863189697,
+ "epoch": 0.13535353535353536,
+ "grad_norm": 2.004284620285034,
+ "learning_rate": 4.866666666666667e-06,
+ "loss": 1.6982238292694092,
+ "mean_token_accuracy": 0.6191987991333008,
+ "num_tokens": 1097728.0,
+ "step": 67
+ },
+ {
+ "entropy": 1.750565528869629,
+ "epoch": 0.13737373737373737,
+ "grad_norm": 2.225955009460449,
+ "learning_rate": 4.864646464646466e-06,
+ "loss": 1.796521782875061,
+ "mean_token_accuracy": 0.5934293866157532,
+ "num_tokens": 1114112.0,
+ "step": 68
+ },
+ {
+ "entropy": 1.6608220338821411,
+ "epoch": 0.1393939393939394,
+ "grad_norm": 2.127035617828369,
+ "learning_rate": 4.8626262626262636e-06,
+ "loss": 1.6633095741271973,
+ "mean_token_accuracy": 0.6356253027915955,
+ "num_tokens": 1130496.0,
+ "step": 69
+ },
+ {
+ "entropy": 1.4848661422729492,
+ "epoch": 0.1414141414141414,
+ "grad_norm": 2.0338215827941895,
+ "learning_rate": 4.8606060606060615e-06,
+ "loss": 1.4789674282073975,
+ "mean_token_accuracy": 0.6680508255958557,
+ "num_tokens": 1146880.0,
+ "step": 70
+ },
+ {
+ "entropy": 1.2310466766357422,
+ "epoch": 0.14343434343434344,
+ "grad_norm": 2.105898141860962,
+ "learning_rate": 4.858585858585859e-06,
+ "loss": 1.2301937341690063,
+ "mean_token_accuracy": 0.7040791511535645,
+ "num_tokens": 1163264.0,
+ "step": 71
+ },
+ {
+ "entropy": 1.6310514211654663,
+ "epoch": 0.14545454545454545,
+ "grad_norm": 2.152125358581543,
+ "learning_rate": 4.856565656565657e-06,
+ "loss": 1.643636703491211,
+ "mean_token_accuracy": 0.6221299171447754,
+ "num_tokens": 1179648.0,
+ "step": 72
+ },
+ {
+ "entropy": 1.4747940301895142,
+ "epoch": 0.14747474747474748,
+ "grad_norm": 2.096461296081543,
+ "learning_rate": 4.854545454545455e-06,
+ "loss": 1.42953360080719,
+ "mean_token_accuracy": 0.6651807427406311,
+ "num_tokens": 1196032.0,
+ "step": 73
+ },
+ {
+ "entropy": 1.819259524345398,
+ "epoch": 0.1494949494949495,
+ "grad_norm": 2.2852063179016113,
+ "learning_rate": 4.852525252525253e-06,
+ "loss": 1.845325231552124,
+ "mean_token_accuracy": 0.6036272644996643,
+ "num_tokens": 1212416.0,
+ "step": 74
+ },
+ {
+ "entropy": 1.4233598709106445,
+ "epoch": 0.15151515151515152,
+ "grad_norm": 2.1157381534576416,
+ "learning_rate": 4.850505050505051e-06,
+ "loss": 1.4565438032150269,
+ "mean_token_accuracy": 0.6607230305671692,
+ "num_tokens": 1228800.0,
+ "step": 75
+ },
+ {
+ "entropy": 1.6441459655761719,
+ "epoch": 0.15353535353535352,
+ "grad_norm": 2.2092180252075195,
+ "learning_rate": 4.848484848484849e-06,
+ "loss": 1.6467639207839966,
+ "mean_token_accuracy": 0.6285417675971985,
+ "num_tokens": 1245184.0,
+ "step": 76
+ },
+ {
+ "entropy": 1.6124308109283447,
+ "epoch": 0.15555555555555556,
+ "grad_norm": 2.231876850128174,
+ "learning_rate": 4.846464646464647e-06,
+ "loss": 1.617384672164917,
+ "mean_token_accuracy": 0.6340987086296082,
+ "num_tokens": 1261568.0,
+ "step": 77
+ },
+ {
+ "entropy": 1.828405499458313,
+ "epoch": 0.15757575757575756,
+ "grad_norm": 2.1372313499450684,
+ "learning_rate": 4.8444444444444446e-06,
+ "loss": 1.8333203792572021,
+ "mean_token_accuracy": 0.5979481935501099,
+ "num_tokens": 1277952.0,
+ "step": 78
+ },
+ {
+ "entropy": 1.855564832687378,
+ "epoch": 0.1595959595959596,
+ "grad_norm": 2.1422762870788574,
+ "learning_rate": 4.842424242424243e-06,
+ "loss": 1.9133609533309937,
+ "mean_token_accuracy": 0.570652186870575,
+ "num_tokens": 1294336.0,
+ "step": 79
+ },
+ {
+ "entropy": 1.7908183336257935,
+ "epoch": 0.16161616161616163,
+ "grad_norm": 2.172368049621582,
+ "learning_rate": 4.840404040404041e-06,
+ "loss": 1.8109419345855713,
+ "mean_token_accuracy": 0.60332190990448,
+ "num_tokens": 1310720.0,
+ "step": 80
+ },
+ {
+ "entropy": 1.9537721872329712,
+ "epoch": 0.16363636363636364,
+ "grad_norm": 2.199505090713501,
+ "learning_rate": 4.838383838383839e-06,
+ "loss": 2.0001401901245117,
+ "mean_token_accuracy": 0.5585613250732422,
+ "num_tokens": 1327104.0,
+ "step": 81
+ },
+ {
+ "entropy": 1.5365772247314453,
+ "epoch": 0.16565656565656567,
+ "grad_norm": 2.0778913497924805,
+ "learning_rate": 4.836363636363637e-06,
+ "loss": 1.575089931488037,
+ "mean_token_accuracy": 0.6375183463096619,
+ "num_tokens": 1343488.0,
+ "step": 82
+ },
+ {
+ "entropy": 1.7177143096923828,
+ "epoch": 0.16767676767676767,
+ "grad_norm": 2.1010894775390625,
+ "learning_rate": 4.834343434343435e-06,
+ "loss": 1.7428388595581055,
+ "mean_token_accuracy": 0.6113824844360352,
+ "num_tokens": 1359872.0,
+ "step": 83
+ },
+ {
+ "entropy": 1.5080527067184448,
+ "epoch": 0.1696969696969697,
+ "grad_norm": 2.021969795227051,
+ "learning_rate": 4.832323232323233e-06,
+ "loss": 1.5361201763153076,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 1376256.0,
+ "step": 84
+ },
+ {
+ "entropy": 1.5042120218276978,
+ "epoch": 0.1717171717171717,
+ "grad_norm": 2.121314287185669,
+ "learning_rate": 4.830303030303031e-06,
+ "loss": 1.4912033081054688,
+ "mean_token_accuracy": 0.6621274948120117,
+ "num_tokens": 1392640.0,
+ "step": 85
+ },
+ {
+ "entropy": 1.9523948431015015,
+ "epoch": 0.17373737373737375,
+ "grad_norm": 2.1702609062194824,
+ "learning_rate": 4.8282828282828285e-06,
+ "loss": 1.9369449615478516,
+ "mean_token_accuracy": 0.5727283954620361,
+ "num_tokens": 1409024.0,
+ "step": 86
+ },
+ {
+ "entropy": 1.6174770593643188,
+ "epoch": 0.17575757575757575,
+ "grad_norm": 2.222412109375,
+ "learning_rate": 4.826262626262626e-06,
+ "loss": 1.6794973611831665,
+ "mean_token_accuracy": 0.6151685118675232,
+ "num_tokens": 1425408.0,
+ "step": 87
+ },
+ {
+ "entropy": 1.1480307579040527,
+ "epoch": 0.17777777777777778,
+ "grad_norm": 1.98936128616333,
+ "learning_rate": 4.824242424242424e-06,
+ "loss": 1.1324063539505005,
+ "mean_token_accuracy": 0.7193453907966614,
+ "num_tokens": 1441792.0,
+ "step": 88
+ },
+ {
+ "entropy": 1.5290263891220093,
+ "epoch": 0.1797979797979798,
+ "grad_norm": 2.098860263824463,
+ "learning_rate": 4.822222222222222e-06,
+ "loss": 1.556044340133667,
+ "mean_token_accuracy": 0.6415486335754395,
+ "num_tokens": 1458176.0,
+ "step": 89
+ },
+ {
+ "entropy": 1.1366127729415894,
+ "epoch": 0.18181818181818182,
+ "grad_norm": 1.9387420415878296,
+ "learning_rate": 4.820202020202021e-06,
+ "loss": 1.1635141372680664,
+ "mean_token_accuracy": 0.7168416976928711,
+ "num_tokens": 1474560.0,
+ "step": 90
+ },
+ {
+ "entropy": 1.5142875909805298,
+ "epoch": 0.18383838383838383,
+ "grad_norm": 2.259131908416748,
+ "learning_rate": 4.818181818181819e-06,
+ "loss": 1.5329954624176025,
+ "mean_token_accuracy": 0.6471666097640991,
+ "num_tokens": 1490944.0,
+ "step": 91
+ },
+ {
+ "entropy": 1.5197135210037231,
+ "epoch": 0.18585858585858586,
+ "grad_norm": 2.1230807304382324,
+ "learning_rate": 4.816161616161617e-06,
+ "loss": 1.541062593460083,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 1507328.0,
+ "step": 92
+ },
+ {
+ "entropy": 1.5469954013824463,
+ "epoch": 0.18787878787878787,
+ "grad_norm": 2.0568583011627197,
+ "learning_rate": 4.8141414141414146e-06,
+ "loss": 1.5564078092575073,
+ "mean_token_accuracy": 0.6384953856468201,
+ "num_tokens": 1523712.0,
+ "step": 93
+ },
+ {
+ "entropy": 1.5429692268371582,
+ "epoch": 0.1898989898989899,
+ "grad_norm": 2.200144052505493,
+ "learning_rate": 4.8121212121212125e-06,
+ "loss": 1.5292989015579224,
+ "mean_token_accuracy": 0.6373351216316223,
+ "num_tokens": 1540096.0,
+ "step": 94
+ },
+ {
+ "entropy": 1.4556076526641846,
+ "epoch": 0.1919191919191919,
+ "grad_norm": 2.250291585922241,
+ "learning_rate": 4.81010101010101e-06,
+ "loss": 1.426419734954834,
+ "mean_token_accuracy": 0.6604176759719849,
+ "num_tokens": 1556480.0,
+ "step": 95
+ },
+ {
+ "entropy": 1.4021440744400024,
+ "epoch": 0.19393939393939394,
+ "grad_norm": 2.287038803100586,
+ "learning_rate": 4.808080808080808e-06,
+ "loss": 1.4377000331878662,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 1572864.0,
+ "step": 96
+ },
+ {
+ "entropy": 1.658683180809021,
+ "epoch": 0.19595959595959597,
+ "grad_norm": 2.1817963123321533,
+ "learning_rate": 4.806060606060606e-06,
+ "loss": 1.6514620780944824,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 1589248.0,
+ "step": 97
+ },
+ {
+ "entropy": 1.5182844400405884,
+ "epoch": 0.19797979797979798,
+ "grad_norm": 2.144071340560913,
+ "learning_rate": 4.804040404040404e-06,
+ "loss": 1.5554628372192383,
+ "mean_token_accuracy": 0.6311064958572388,
+ "num_tokens": 1605632.0,
+ "step": 98
+ },
+ {
+ "entropy": 1.5997719764709473,
+ "epoch": 0.2,
+ "grad_norm": 2.0921664237976074,
+ "learning_rate": 4.802020202020202e-06,
+ "loss": 1.6185517311096191,
+ "mean_token_accuracy": 0.6286028623580933,
+ "num_tokens": 1622016.0,
+ "step": 99
+ },
+ {
+ "entropy": 1.4011279344558716,
+ "epoch": 0.20202020202020202,
+ "grad_norm": 2.2240700721740723,
+ "learning_rate": 4.800000000000001e-06,
+ "loss": 1.4112927913665771,
+ "mean_token_accuracy": 0.6696995496749878,
+ "num_tokens": 1638400.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.20202020202020202,
+ "eval_entropy": 1.606662715634992,
+ "eval_loss": 1.6283859014511108,
+ "eval_mean_token_accuracy": 0.6293055717983553,
+ "eval_num_tokens": 1638400.0,
+ "eval_runtime": 43.7782,
+ "eval_samples_per_second": 22.614,
+ "eval_steps_per_second": 2.832,
+ "step": 100
+ },
+ {
+ "entropy": 1.6743865013122559,
+ "epoch": 0.20404040404040405,
+ "grad_norm": 2.025153398513794,
+ "learning_rate": 4.7979797979797985e-06,
+ "loss": 1.6404725313186646,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 1654784.0,
+ "step": 101
+ },
+ {
+ "entropy": 1.6196308135986328,
+ "epoch": 0.20606060606060606,
+ "grad_norm": 2.037229299545288,
+ "learning_rate": 4.795959595959596e-06,
+ "loss": 1.647303581237793,
+ "mean_token_accuracy": 0.6203590631484985,
+ "num_tokens": 1671168.0,
+ "step": 102
+ },
+ {
+ "entropy": 1.5600125789642334,
+ "epoch": 0.2080808080808081,
+ "grad_norm": 2.144221782684326,
+ "learning_rate": 4.793939393939394e-06,
+ "loss": 1.6199731826782227,
+ "mean_token_accuracy": 0.6249389052391052,
+ "num_tokens": 1687552.0,
+ "step": 103
+ },
+ {
+ "entropy": 2.064497947692871,
+ "epoch": 0.2101010101010101,
+ "grad_norm": 2.3956470489501953,
+ "learning_rate": 4.791919191919192e-06,
+ "loss": 2.048987627029419,
+ "mean_token_accuracy": 0.5507450103759766,
+ "num_tokens": 1703936.0,
+ "step": 104
+ },
+ {
+ "entropy": 1.7934812307357788,
+ "epoch": 0.21212121212121213,
+ "grad_norm": 2.487302780151367,
+ "learning_rate": 4.78989898989899e-06,
+ "loss": 1.8285956382751465,
+ "mean_token_accuracy": 0.5749877691268921,
+ "num_tokens": 1720320.0,
+ "step": 105
+ },
+ {
+ "entropy": 1.365216851234436,
+ "epoch": 0.21414141414141413,
+ "grad_norm": 2.0714964866638184,
+ "learning_rate": 4.787878787878788e-06,
+ "loss": 1.3870220184326172,
+ "mean_token_accuracy": 0.6692721247673035,
+ "num_tokens": 1736704.0,
+ "step": 106
+ },
+ {
+ "entropy": 1.4983874559402466,
+ "epoch": 0.21616161616161617,
+ "grad_norm": 1.9995853900909424,
+ "learning_rate": 4.785858585858586e-06,
+ "loss": 1.4949266910552979,
+ "mean_token_accuracy": 0.6554103493690491,
+ "num_tokens": 1753088.0,
+ "step": 107
+ },
+ {
+ "entropy": 2.0503509044647217,
+ "epoch": 0.21818181818181817,
+ "grad_norm": 2.190884590148926,
+ "learning_rate": 4.783838383838385e-06,
+ "loss": 2.079286813735962,
+ "mean_token_accuracy": 0.5657669901847839,
+ "num_tokens": 1769472.0,
+ "step": 108
+ },
+ {
+ "entropy": 1.5557374954223633,
+ "epoch": 0.2202020202020202,
+ "grad_norm": 2.044100761413574,
+ "learning_rate": 4.7818181818181825e-06,
+ "loss": 1.5735318660736084,
+ "mean_token_accuracy": 0.6359916925430298,
+ "num_tokens": 1785856.0,
+ "step": 109
+ },
+ {
+ "entropy": 1.5567635297775269,
+ "epoch": 0.2222222222222222,
+ "grad_norm": 2.3714160919189453,
+ "learning_rate": 4.77979797979798e-06,
+ "loss": 1.6026921272277832,
+ "mean_token_accuracy": 0.6290302872657776,
+ "num_tokens": 1802240.0,
+ "step": 110
+ },
+ {
+ "entropy": 1.8457536697387695,
+ "epoch": 0.22424242424242424,
+ "grad_norm": 2.202939987182617,
+ "learning_rate": 4.777777777777778e-06,
+ "loss": 1.7986081838607788,
+ "mean_token_accuracy": 0.5952613353729248,
+ "num_tokens": 1818624.0,
+ "step": 111
+ },
+ {
+ "entropy": 1.8822020292282104,
+ "epoch": 0.22626262626262628,
+ "grad_norm": 2.2674992084503174,
+ "learning_rate": 4.775757575757576e-06,
+ "loss": 1.9095954895019531,
+ "mean_token_accuracy": 0.5769418478012085,
+ "num_tokens": 1835008.0,
+ "step": 112
+ },
+ {
+ "entropy": 1.5445998907089233,
+ "epoch": 0.22828282828282828,
+ "grad_norm": 2.2848100662231445,
+ "learning_rate": 4.773737373737374e-06,
+ "loss": 1.5832195281982422,
+ "mean_token_accuracy": 0.6337933540344238,
+ "num_tokens": 1851392.0,
+ "step": 113
+ },
+ {
+ "entropy": 1.934509515762329,
+ "epoch": 0.23030303030303031,
+ "grad_norm": 2.3585174083709717,
+ "learning_rate": 4.771717171717172e-06,
+ "loss": 1.9809319972991943,
+ "mean_token_accuracy": 0.5789570212364197,
+ "num_tokens": 1867776.0,
+ "step": 114
+ },
+ {
+ "entropy": 1.7354214191436768,
+ "epoch": 0.23232323232323232,
+ "grad_norm": 2.13913631439209,
+ "learning_rate": 4.769696969696971e-06,
+ "loss": 1.7527806758880615,
+ "mean_token_accuracy": 0.6061308979988098,
+ "num_tokens": 1884160.0,
+ "step": 115
+ },
+ {
+ "entropy": 1.7714784145355225,
+ "epoch": 0.23434343434343435,
+ "grad_norm": 1.9915403127670288,
+ "learning_rate": 4.7676767676767685e-06,
+ "loss": 1.8065431118011475,
+ "mean_token_accuracy": 0.5986199378967285,
+ "num_tokens": 1900544.0,
+ "step": 116
+ },
+ {
+ "entropy": 1.5272125005722046,
+ "epoch": 0.23636363636363636,
+ "grad_norm": 2.004565715789795,
+ "learning_rate": 4.765656565656566e-06,
+ "loss": 1.5074517726898193,
+ "mean_token_accuracy": 0.6601123809814453,
+ "num_tokens": 1916928.0,
+ "step": 117
+ },
+ {
+ "entropy": 1.5393218994140625,
+ "epoch": 0.2383838383838384,
+ "grad_norm": 2.018089532852173,
+ "learning_rate": 4.763636363636364e-06,
+ "loss": 1.5607573986053467,
+ "mean_token_accuracy": 0.6540058851242065,
+ "num_tokens": 1933312.0,
+ "step": 118
+ },
+ {
+ "entropy": 1.7827534675598145,
+ "epoch": 0.2404040404040404,
+ "grad_norm": 2.062368392944336,
+ "learning_rate": 4.761616161616162e-06,
+ "loss": 1.7844001054763794,
+ "mean_token_accuracy": 0.6187102794647217,
+ "num_tokens": 1949696.0,
+ "step": 119
+ },
+ {
+ "entropy": 1.416417121887207,
+ "epoch": 0.24242424242424243,
+ "grad_norm": 2.0980024337768555,
+ "learning_rate": 4.75959595959596e-06,
+ "loss": 1.4041050672531128,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 1966080.0,
+ "step": 120
+ },
+ {
+ "entropy": 1.3325153589248657,
+ "epoch": 0.24444444444444444,
+ "grad_norm": 1.9985002279281616,
+ "learning_rate": 4.757575757575758e-06,
+ "loss": 1.3197274208068848,
+ "mean_token_accuracy": 0.6806912422180176,
+ "num_tokens": 1982464.0,
+ "step": 121
+ },
+ {
+ "entropy": 1.7306798696517944,
+ "epoch": 0.24646464646464647,
+ "grad_norm": 2.2098441123962402,
+ "learning_rate": 4.755555555555556e-06,
+ "loss": 1.7595295906066895,
+ "mean_token_accuracy": 0.6110160946846008,
+ "num_tokens": 1998848.0,
+ "step": 122
+ },
+ {
+ "entropy": 1.3733264207839966,
+ "epoch": 0.24848484848484848,
+ "grad_norm": 1.9827327728271484,
+ "learning_rate": 4.753535353535354e-06,
+ "loss": 1.4026854038238525,
+ "mean_token_accuracy": 0.65486079454422,
+ "num_tokens": 2015232.0,
+ "step": 123
+ },
+ {
+ "entropy": 1.5910528898239136,
+ "epoch": 0.2505050505050505,
+ "grad_norm": 1.9615319967269897,
+ "learning_rate": 4.751515151515152e-06,
+ "loss": 1.6071114540100098,
+ "mean_token_accuracy": 0.648937463760376,
+ "num_tokens": 2031616.0,
+ "step": 124
+ },
+ {
+ "entropy": 1.3300938606262207,
+ "epoch": 0.25252525252525254,
+ "grad_norm": 1.9878504276275635,
+ "learning_rate": 4.7494949494949495e-06,
+ "loss": 1.3623383045196533,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 2048000.0,
+ "step": 125
+ },
+ {
+ "entropy": 1.6087368726730347,
+ "epoch": 0.2545454545454545,
+ "grad_norm": 2.264647960662842,
+ "learning_rate": 4.747474747474748e-06,
+ "loss": 1.634058952331543,
+ "mean_token_accuracy": 0.6211528778076172,
+ "num_tokens": 2064384.0,
+ "step": 126
+ },
+ {
+ "entropy": 1.536401391029358,
+ "epoch": 0.25656565656565655,
+ "grad_norm": 1.9561539888381958,
+ "learning_rate": 4.745454545454546e-06,
+ "loss": 1.5699501037597656,
+ "mean_token_accuracy": 0.6248167753219604,
+ "num_tokens": 2080768.0,
+ "step": 127
+ },
+ {
+ "entropy": 1.656266212463379,
+ "epoch": 0.2585858585858586,
+ "grad_norm": 2.1124353408813477,
+ "learning_rate": 4.743434343434344e-06,
+ "loss": 1.6612167358398438,
+ "mean_token_accuracy": 0.623900830745697,
+ "num_tokens": 2097152.0,
+ "step": 128
+ },
+ {
+ "entropy": 1.170629620552063,
+ "epoch": 0.2606060606060606,
+ "grad_norm": 1.917840600013733,
+ "learning_rate": 4.741414141414142e-06,
+ "loss": 1.1992300748825073,
+ "mean_token_accuracy": 0.6995603442192078,
+ "num_tokens": 2113536.0,
+ "step": 129
+ },
+ {
+ "entropy": 1.4126694202423096,
+ "epoch": 0.26262626262626265,
+ "grad_norm": 1.9041539430618286,
+ "learning_rate": 4.73939393939394e-06,
+ "loss": 1.4334447383880615,
+ "mean_token_accuracy": 0.6637151837348938,
+ "num_tokens": 2129920.0,
+ "step": 130
+ },
+ {
+ "entropy": 1.8490277528762817,
+ "epoch": 0.26464646464646463,
+ "grad_norm": 2.1440138816833496,
+ "learning_rate": 4.737373737373738e-06,
+ "loss": 1.9226353168487549,
+ "mean_token_accuracy": 0.5805447101593018,
+ "num_tokens": 2146304.0,
+ "step": 131
+ },
+ {
+ "entropy": 1.5000964403152466,
+ "epoch": 0.26666666666666666,
+ "grad_norm": 1.9615508317947388,
+ "learning_rate": 4.735353535353536e-06,
+ "loss": 1.495596170425415,
+ "mean_token_accuracy": 0.6542501449584961,
+ "num_tokens": 2162688.0,
+ "step": 132
+ },
+ {
+ "entropy": 1.9371142387390137,
+ "epoch": 0.2686868686868687,
+ "grad_norm": 2.202200412750244,
+ "learning_rate": 4.7333333333333335e-06,
+ "loss": 1.94151771068573,
+ "mean_token_accuracy": 0.5810332298278809,
+ "num_tokens": 2179072.0,
+ "step": 133
+ },
+ {
+ "entropy": 1.4535126686096191,
+ "epoch": 0.27070707070707073,
+ "grad_norm": 1.9804027080535889,
+ "learning_rate": 4.731313131313131e-06,
+ "loss": 1.4401545524597168,
+ "mean_token_accuracy": 0.6585246920585632,
+ "num_tokens": 2195456.0,
+ "step": 134
+ },
+ {
+ "entropy": 2.0871424674987793,
+ "epoch": 0.2727272727272727,
+ "grad_norm": 2.1417081356048584,
+ "learning_rate": 4.729292929292929e-06,
+ "loss": 2.117375373840332,
+ "mean_token_accuracy": 0.5600268840789795,
+ "num_tokens": 2211840.0,
+ "step": 135
+ },
+ {
+ "entropy": 1.2986469268798828,
+ "epoch": 0.27474747474747474,
+ "grad_norm": 2.0299136638641357,
+ "learning_rate": 4.727272727272728e-06,
+ "loss": 1.3631991147994995,
+ "mean_token_accuracy": 0.6750732660293579,
+ "num_tokens": 2228224.0,
+ "step": 136
+ },
+ {
+ "entropy": 1.163429617881775,
+ "epoch": 0.2767676767676768,
+ "grad_norm": 1.8368210792541504,
+ "learning_rate": 4.725252525252526e-06,
+ "loss": 1.1603795289993286,
+ "mean_token_accuracy": 0.7150708436965942,
+ "num_tokens": 2244608.0,
+ "step": 137
+ },
+ {
+ "entropy": 1.4301519393920898,
+ "epoch": 0.2787878787878788,
+ "grad_norm": 1.996767520904541,
+ "learning_rate": 4.723232323232324e-06,
+ "loss": 1.422170639038086,
+ "mean_token_accuracy": 0.6816682815551758,
+ "num_tokens": 2260992.0,
+ "step": 138
+ },
+ {
+ "entropy": 1.5160106420516968,
+ "epoch": 0.2808080808080808,
+ "grad_norm": 2.004770278930664,
+ "learning_rate": 4.721212121212122e-06,
+ "loss": 1.5385751724243164,
+ "mean_token_accuracy": 0.640693724155426,
+ "num_tokens": 2277376.0,
+ "step": 139
+ },
+ {
+ "entropy": 1.2483867406845093,
+ "epoch": 0.2828282828282828,
+ "grad_norm": 1.8488364219665527,
+ "learning_rate": 4.7191919191919195e-06,
+ "loss": 1.2563843727111816,
+ "mean_token_accuracy": 0.6998046040534973,
+ "num_tokens": 2293760.0,
+ "step": 140
+ },
+ {
+ "entropy": 1.3214129209518433,
+ "epoch": 0.28484848484848485,
+ "grad_norm": 2.1334660053253174,
+ "learning_rate": 4.717171717171717e-06,
+ "loss": 1.3392664194107056,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 2310144.0,
+ "step": 141
+ },
+ {
+ "entropy": 1.611849069595337,
+ "epoch": 0.2868686868686869,
+ "grad_norm": 2.0539803504943848,
+ "learning_rate": 4.715151515151515e-06,
+ "loss": 1.6335396766662598,
+ "mean_token_accuracy": 0.6235954761505127,
+ "num_tokens": 2326528.0,
+ "step": 142
+ },
+ {
+ "entropy": 1.5847896337509155,
+ "epoch": 0.28888888888888886,
+ "grad_norm": 2.1658759117126465,
+ "learning_rate": 4.713131313131313e-06,
+ "loss": 1.603764533996582,
+ "mean_token_accuracy": 0.633671224117279,
+ "num_tokens": 2342912.0,
+ "step": 143
+ },
+ {
+ "entropy": 1.5731406211853027,
+ "epoch": 0.2909090909090909,
+ "grad_norm": 2.0830390453338623,
+ "learning_rate": 4.711111111111111e-06,
+ "loss": 1.558933973312378,
+ "mean_token_accuracy": 0.6392892003059387,
+ "num_tokens": 2359296.0,
+ "step": 144
+ },
+ {
+ "entropy": 1.8901628255844116,
+ "epoch": 0.29292929292929293,
+ "grad_norm": 2.1436922550201416,
+ "learning_rate": 4.709090909090909e-06,
+ "loss": 1.878631353378296,
+ "mean_token_accuracy": 0.57333904504776,
+ "num_tokens": 2375680.0,
+ "step": 145
+ },
+ {
+ "entropy": 1.9344228506088257,
+ "epoch": 0.29494949494949496,
+ "grad_norm": 2.1245176792144775,
+ "learning_rate": 4.707070707070707e-06,
+ "loss": 1.9546704292297363,
+ "mean_token_accuracy": 0.5987420678138733,
+ "num_tokens": 2392064.0,
+ "step": 146
+ },
+ {
+ "entropy": 1.2455096244812012,
+ "epoch": 0.296969696969697,
+ "grad_norm": 1.896581768989563,
+ "learning_rate": 4.705050505050506e-06,
+ "loss": 1.2738728523254395,
+ "mean_token_accuracy": 0.7025524973869324,
+ "num_tokens": 2408448.0,
+ "step": 147
+ },
+ {
+ "entropy": 1.4235948324203491,
+ "epoch": 0.298989898989899,
+ "grad_norm": 2.522636890411377,
+ "learning_rate": 4.7030303030303035e-06,
+ "loss": 1.4524480104446411,
+ "mean_token_accuracy": 0.6441133618354797,
+ "num_tokens": 2424832.0,
+ "step": 148
+ },
+ {
+ "entropy": 1.764552116394043,
+ "epoch": 0.301010101010101,
+ "grad_norm": 2.0232255458831787,
+ "learning_rate": 4.701010101010101e-06,
+ "loss": 1.7811740636825562,
+ "mean_token_accuracy": 0.6229848265647888,
+ "num_tokens": 2441216.0,
+ "step": 149
+ },
+ {
+ "entropy": 1.74843168258667,
+ "epoch": 0.30303030303030304,
+ "grad_norm": 2.1589369773864746,
+ "learning_rate": 4.698989898989899e-06,
+ "loss": 1.7337679862976074,
+ "mean_token_accuracy": 0.5975207686424255,
+ "num_tokens": 2457600.0,
+ "step": 150
+ },
+ {
+ "epoch": 0.30303030303030304,
+ "eval_entropy": 1.6033287221385586,
+ "eval_loss": 1.6036633253097534,
+ "eval_mean_token_accuracy": 0.6329842450157288,
+ "eval_num_tokens": 2457600.0,
+ "eval_runtime": 43.7655,
+ "eval_samples_per_second": 22.621,
+ "eval_steps_per_second": 2.833,
+ "step": 150
+ },
+ {
+ "entropy": 2.0572290420532227,
+ "epoch": 0.30505050505050507,
+ "grad_norm": 2.0511579513549805,
+ "learning_rate": 4.696969696969698e-06,
+ "loss": 2.0196030139923096,
+ "mean_token_accuracy": 0.5519052147865295,
+ "num_tokens": 2473984.0,
+ "step": 151
+ },
+ {
+ "entropy": 1.5792397260665894,
+ "epoch": 0.30707070707070705,
+ "grad_norm": 2.048396587371826,
+ "learning_rate": 4.694949494949496e-06,
+ "loss": 1.575985074043274,
+ "mean_token_accuracy": 0.623961865901947,
+ "num_tokens": 2490368.0,
+ "step": 152
+ },
+ {
+ "entropy": 1.487528681755066,
+ "epoch": 0.3090909090909091,
+ "grad_norm": 2.1903791427612305,
+ "learning_rate": 4.692929292929294e-06,
+ "loss": 1.479973316192627,
+ "mean_token_accuracy": 0.6595017313957214,
+ "num_tokens": 2506752.0,
+ "step": 153
+ },
+ {
+ "entropy": 1.766797423362732,
+ "epoch": 0.3111111111111111,
+ "grad_norm": 2.1843011379241943,
+ "learning_rate": 4.690909090909092e-06,
+ "loss": 1.7993412017822266,
+ "mean_token_accuracy": 0.5965437293052673,
+ "num_tokens": 2523136.0,
+ "step": 154
+ },
+ {
+ "entropy": 1.7058254480361938,
+ "epoch": 0.31313131313131315,
+ "grad_norm": 2.204461097717285,
+ "learning_rate": 4.6888888888888895e-06,
+ "loss": 1.7346007823944092,
+ "mean_token_accuracy": 0.6077185869216919,
+ "num_tokens": 2539520.0,
+ "step": 155
+ },
+ {
+ "entropy": 1.4929591417312622,
+ "epoch": 0.3151515151515151,
+ "grad_norm": 2.1739237308502197,
+ "learning_rate": 4.6868686868686874e-06,
+ "loss": 1.4708621501922607,
+ "mean_token_accuracy": 0.6427088379859924,
+ "num_tokens": 2555904.0,
+ "step": 156
+ },
+ {
+ "entropy": 1.5797587633132935,
+ "epoch": 0.31717171717171716,
+ "grad_norm": 2.150561571121216,
+ "learning_rate": 4.684848484848485e-06,
+ "loss": 1.5921857357025146,
+ "mean_token_accuracy": 0.6262823939323425,
+ "num_tokens": 2572288.0,
+ "step": 157
+ },
+ {
+ "entropy": 1.6198230981826782,
+ "epoch": 0.3191919191919192,
+ "grad_norm": 2.061169385910034,
+ "learning_rate": 4.682828282828283e-06,
+ "loss": 1.6601009368896484,
+ "mean_token_accuracy": 0.619015634059906,
+ "num_tokens": 2588672.0,
+ "step": 158
+ },
+ {
+ "entropy": 1.4026126861572266,
+ "epoch": 0.3212121212121212,
+ "grad_norm": 2.066208839416504,
+ "learning_rate": 4.680808080808081e-06,
+ "loss": 1.4062483310699463,
+ "mean_token_accuracy": 0.6681729555130005,
+ "num_tokens": 2605056.0,
+ "step": 159
+ },
+ {
+ "entropy": 1.4608066082000732,
+ "epoch": 0.32323232323232326,
+ "grad_norm": 2.022627353668213,
+ "learning_rate": 4.678787878787879e-06,
+ "loss": 1.4644970893859863,
+ "mean_token_accuracy": 0.6533341407775879,
+ "num_tokens": 2621440.0,
+ "step": 160
+ },
+ {
+ "entropy": 1.222448468208313,
+ "epoch": 0.32525252525252524,
+ "grad_norm": 2.0399329662323,
+ "learning_rate": 4.676767676767677e-06,
+ "loss": 1.2547852993011475,
+ "mean_token_accuracy": 0.6925378441810608,
+ "num_tokens": 2637824.0,
+ "step": 161
+ },
+ {
+ "entropy": 1.8702255487442017,
+ "epoch": 0.32727272727272727,
+ "grad_norm": 2.177307367324829,
+ "learning_rate": 4.674747474747476e-06,
+ "loss": 1.9041712284088135,
+ "mean_token_accuracy": 0.5754152536392212,
+ "num_tokens": 2654208.0,
+ "step": 162
+ },
+ {
+ "entropy": 1.6861947774887085,
+ "epoch": 0.3292929292929293,
+ "grad_norm": 2.009544610977173,
+ "learning_rate": 4.6727272727272735e-06,
+ "loss": 1.7079355716705322,
+ "mean_token_accuracy": 0.615290641784668,
+ "num_tokens": 2670592.0,
+ "step": 163
+ },
+ {
+ "entropy": 1.3880327939987183,
+ "epoch": 0.33131313131313134,
+ "grad_norm": 2.16359543800354,
+ "learning_rate": 4.670707070707071e-06,
+ "loss": 1.4220571517944336,
+ "mean_token_accuracy": 0.6604787707328796,
+ "num_tokens": 2686976.0,
+ "step": 164
+ },
+ {
+ "entropy": 1.5760643482208252,
+ "epoch": 0.3333333333333333,
+ "grad_norm": 2.09773325920105,
+ "learning_rate": 4.668686868686869e-06,
+ "loss": 1.6036784648895264,
+ "mean_token_accuracy": 0.6267098188400269,
+ "num_tokens": 2703360.0,
+ "step": 165
+ },
+ {
+ "entropy": 1.078303575515747,
+ "epoch": 0.33535353535353535,
+ "grad_norm": 1.7760599851608276,
+ "learning_rate": 4.666666666666667e-06,
+ "loss": 1.0612695217132568,
+ "mean_token_accuracy": 0.7349169254302979,
+ "num_tokens": 2719744.0,
+ "step": 166
+ },
+ {
+ "entropy": 1.3722130060195923,
+ "epoch": 0.3373737373737374,
+ "grad_norm": 2.0816409587860107,
+ "learning_rate": 4.664646464646465e-06,
+ "loss": 1.3693504333496094,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 2736128.0,
+ "step": 167
+ },
+ {
+ "entropy": 1.8752760887145996,
+ "epoch": 0.3393939393939394,
+ "grad_norm": 2.1670358180999756,
+ "learning_rate": 4.662626262626263e-06,
+ "loss": 1.8874578475952148,
+ "mean_token_accuracy": 0.5881778001785278,
+ "num_tokens": 2752512.0,
+ "step": 168
+ },
+ {
+ "entropy": 1.7384581565856934,
+ "epoch": 0.3414141414141414,
+ "grad_norm": 2.0072429180145264,
+ "learning_rate": 4.660606060606061e-06,
+ "loss": 1.7491583824157715,
+ "mean_token_accuracy": 0.6041157841682434,
+ "num_tokens": 2768896.0,
+ "step": 169
+ },
+ {
+ "entropy": 1.6651691198349,
+ "epoch": 0.3434343434343434,
+ "grad_norm": 2.0812578201293945,
+ "learning_rate": 4.658585858585859e-06,
+ "loss": 1.6808438301086426,
+ "mean_token_accuracy": 0.6273204684257507,
+ "num_tokens": 2785280.0,
+ "step": 170
+ },
+ {
+ "entropy": 1.3426616191864014,
+ "epoch": 0.34545454545454546,
+ "grad_norm": 1.9108822345733643,
+ "learning_rate": 4.656565656565657e-06,
+ "loss": 1.3404264450073242,
+ "mean_token_accuracy": 0.6703101992607117,
+ "num_tokens": 2801664.0,
+ "step": 171
+ },
+ {
+ "entropy": 1.631722092628479,
+ "epoch": 0.3474747474747475,
+ "grad_norm": 2.07317852973938,
+ "learning_rate": 4.654545454545455e-06,
+ "loss": 1.6545813083648682,
+ "mean_token_accuracy": 0.6143136024475098,
+ "num_tokens": 2818048.0,
+ "step": 172
+ },
+ {
+ "entropy": 1.3678289651870728,
+ "epoch": 0.34949494949494947,
+ "grad_norm": 1.8517454862594604,
+ "learning_rate": 4.652525252525253e-06,
+ "loss": 1.3759769201278687,
+ "mean_token_accuracy": 0.6693942546844482,
+ "num_tokens": 2834432.0,
+ "step": 173
+ },
+ {
+ "entropy": 1.3927773237228394,
+ "epoch": 0.3515151515151515,
+ "grad_norm": 2.1304867267608643,
+ "learning_rate": 4.650505050505051e-06,
+ "loss": 1.4104211330413818,
+ "mean_token_accuracy": 0.6612725853919983,
+ "num_tokens": 2850816.0,
+ "step": 174
+ },
+ {
+ "entropy": 1.3352863788604736,
+ "epoch": 0.35353535353535354,
+ "grad_norm": 2.2788777351379395,
+ "learning_rate": 4.648484848484849e-06,
+ "loss": 1.3665719032287598,
+ "mean_token_accuracy": 0.6640205383300781,
+ "num_tokens": 2867200.0,
+ "step": 175
+ },
+ {
+ "entropy": 1.6800754070281982,
+ "epoch": 0.35555555555555557,
+ "grad_norm": 2.030787944793701,
+ "learning_rate": 4.646464646464647e-06,
+ "loss": 1.7239181995391846,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 2883584.0,
+ "step": 176
+ },
+ {
+ "entropy": 1.2852731943130493,
+ "epoch": 0.3575757575757576,
+ "grad_norm": 1.9148248434066772,
+ "learning_rate": 4.644444444444445e-06,
+ "loss": 1.2934880256652832,
+ "mean_token_accuracy": 0.6798363327980042,
+ "num_tokens": 2899968.0,
+ "step": 177
+ },
+ {
+ "entropy": 1.6366593837738037,
+ "epoch": 0.3595959595959596,
+ "grad_norm": 2.2264015674591064,
+ "learning_rate": 4.642424242424243e-06,
+ "loss": 1.632002592086792,
+ "mean_token_accuracy": 0.6180385947227478,
+ "num_tokens": 2916352.0,
+ "step": 178
+ },
+ {
+ "entropy": 1.3935565948486328,
+ "epoch": 0.3616161616161616,
+ "grad_norm": 2.0410475730895996,
+ "learning_rate": 4.6404040404040406e-06,
+ "loss": 1.407370686531067,
+ "mean_token_accuracy": 0.6722032427787781,
+ "num_tokens": 2932736.0,
+ "step": 179
+ },
+ {
+ "entropy": 1.0952510833740234,
+ "epoch": 0.36363636363636365,
+ "grad_norm": 1.937270164489746,
+ "learning_rate": 4.6383838383838384e-06,
+ "loss": 1.1101973056793213,
+ "mean_token_accuracy": 0.730947732925415,
+ "num_tokens": 2949120.0,
+ "step": 180
+ },
+ {
+ "entropy": 1.184926152229309,
+ "epoch": 0.3656565656565657,
+ "grad_norm": 1.9867528676986694,
+ "learning_rate": 4.636363636363636e-06,
+ "loss": 1.1932196617126465,
+ "mean_token_accuracy": 0.7085368633270264,
+ "num_tokens": 2965504.0,
+ "step": 181
+ },
+ {
+ "entropy": 1.4552072286605835,
+ "epoch": 0.36767676767676766,
+ "grad_norm": 1.9395766258239746,
+ "learning_rate": 4.634343434343434e-06,
+ "loss": 1.4559956789016724,
+ "mean_token_accuracy": 0.6534562706947327,
+ "num_tokens": 2981888.0,
+ "step": 182
+ },
+ {
+ "entropy": 1.6437443494796753,
+ "epoch": 0.3696969696969697,
+ "grad_norm": 2.1257567405700684,
+ "learning_rate": 4.632323232323233e-06,
+ "loss": 1.6260980367660522,
+ "mean_token_accuracy": 0.625,
+ "num_tokens": 2998272.0,
+ "step": 183
+ },
+ {
+ "entropy": 1.8264633417129517,
+ "epoch": 0.3717171717171717,
+ "grad_norm": 2.187041759490967,
+ "learning_rate": 4.630303030303031e-06,
+ "loss": 1.8431676626205444,
+ "mean_token_accuracy": 0.60332190990448,
+ "num_tokens": 3014656.0,
+ "step": 184
+ },
+ {
+ "entropy": 1.1121351718902588,
+ "epoch": 0.37373737373737376,
+ "grad_norm": 1.8460402488708496,
+ "learning_rate": 4.628282828282829e-06,
+ "loss": 1.1054425239562988,
+ "mean_token_accuracy": 0.7254518866539001,
+ "num_tokens": 3031040.0,
+ "step": 185
+ },
+ {
+ "entropy": 1.3531955480575562,
+ "epoch": 0.37575757575757573,
+ "grad_norm": 2.3463470935821533,
+ "learning_rate": 4.626262626262627e-06,
+ "loss": 1.359381914138794,
+ "mean_token_accuracy": 0.6610894203186035,
+ "num_tokens": 3047424.0,
+ "step": 186
+ },
+ {
+ "entropy": 1.2131577730178833,
+ "epoch": 0.37777777777777777,
+ "grad_norm": 1.9595171213150024,
+ "learning_rate": 4.6242424242424245e-06,
+ "loss": 1.2312005758285522,
+ "mean_token_accuracy": 0.6979115605354309,
+ "num_tokens": 3063808.0,
+ "step": 187
+ },
+ {
+ "entropy": 1.5441125631332397,
+ "epoch": 0.3797979797979798,
+ "grad_norm": 2.2971343994140625,
+ "learning_rate": 4.622222222222222e-06,
+ "loss": 1.5923339128494263,
+ "mean_token_accuracy": 0.6297020316123962,
+ "num_tokens": 3080192.0,
+ "step": 188
+ },
+ {
+ "entropy": 1.7998323440551758,
+ "epoch": 0.38181818181818183,
+ "grad_norm": 2.010552167892456,
+ "learning_rate": 4.62020202020202e-06,
+ "loss": 1.8257204294204712,
+ "mean_token_accuracy": 0.5997191071510315,
+ "num_tokens": 3096576.0,
+ "step": 189
+ },
+ {
+ "entropy": 1.389051914215088,
+ "epoch": 0.3838383838383838,
+ "grad_norm": 2.1183855533599854,
+ "learning_rate": 4.618181818181818e-06,
+ "loss": 1.431575059890747,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 3112960.0,
+ "step": 190
+ },
+ {
+ "entropy": 2.0066142082214355,
+ "epoch": 0.38585858585858585,
+ "grad_norm": 2.061399221420288,
+ "learning_rate": 4.616161616161616e-06,
+ "loss": 2.0477406978607178,
+ "mean_token_accuracy": 0.5454934239387512,
+ "num_tokens": 3129344.0,
+ "step": 191
+ },
+ {
+ "entropy": 1.3063198328018188,
+ "epoch": 0.3878787878787879,
+ "grad_norm": 1.9490301609039307,
+ "learning_rate": 4.614141414141414e-06,
+ "loss": 1.3293564319610596,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 3145728.0,
+ "step": 192
+ },
+ {
+ "entropy": 1.3636538982391357,
+ "epoch": 0.3898989898989899,
+ "grad_norm": 2.025458574295044,
+ "learning_rate": 4.612121212121212e-06,
+ "loss": 1.3736209869384766,
+ "mean_token_accuracy": 0.679286777973175,
+ "num_tokens": 3162112.0,
+ "step": 193
+ },
+ {
+ "entropy": 1.5669925212860107,
+ "epoch": 0.39191919191919194,
+ "grad_norm": 2.064033269882202,
+ "learning_rate": 4.6101010101010106e-06,
+ "loss": 1.5587083101272583,
+ "mean_token_accuracy": 0.6267709136009216,
+ "num_tokens": 3178496.0,
+ "step": 194
+ },
+ {
+ "entropy": 1.4489716291427612,
+ "epoch": 0.3939393939393939,
+ "grad_norm": 2.0174880027770996,
+ "learning_rate": 4.6080808080808085e-06,
+ "loss": 1.4331417083740234,
+ "mean_token_accuracy": 0.6571812629699707,
+ "num_tokens": 3194880.0,
+ "step": 195
+ },
+ {
+ "entropy": 2.026416778564453,
+ "epoch": 0.39595959595959596,
+ "grad_norm": 2.1820878982543945,
+ "learning_rate": 4.606060606060606e-06,
+ "loss": 2.029003143310547,
+ "mean_token_accuracy": 0.563568651676178,
+ "num_tokens": 3211264.0,
+ "step": 196
+ },
+ {
+ "entropy": 2.1844022274017334,
+ "epoch": 0.397979797979798,
+ "grad_norm": 2.175349473953247,
+ "learning_rate": 4.604040404040404e-06,
+ "loss": 2.2053825855255127,
+ "mean_token_accuracy": 0.5553248524665833,
+ "num_tokens": 3227648.0,
+ "step": 197
+ },
+ {
+ "entropy": 1.6750906705856323,
+ "epoch": 0.4,
+ "grad_norm": 1.8300689458847046,
+ "learning_rate": 4.602020202020203e-06,
+ "loss": 1.692289113998413,
+ "mean_token_accuracy": 0.6345261335372925,
+ "num_tokens": 3244032.0,
+ "step": 198
+ },
+ {
+ "entropy": 1.6192772388458252,
+ "epoch": 0.402020202020202,
+ "grad_norm": 1.9788341522216797,
+ "learning_rate": 4.600000000000001e-06,
+ "loss": 1.628842830657959,
+ "mean_token_accuracy": 0.615229606628418,
+ "num_tokens": 3260416.0,
+ "step": 199
+ },
+ {
+ "entropy": 1.444870948791504,
+ "epoch": 0.40404040404040403,
+ "grad_norm": 2.05141544342041,
+ "learning_rate": 4.597979797979799e-06,
+ "loss": 1.4365839958190918,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 3276800.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.40404040404040403,
+ "eval_entropy": 1.5766179907706477,
+ "eval_loss": 1.5878442525863647,
+ "eval_mean_token_accuracy": 0.6355829551335304,
+ "eval_num_tokens": 3276800.0,
+ "eval_runtime": 43.7272,
+ "eval_samples_per_second": 22.64,
+ "eval_steps_per_second": 2.836,
+ "step": 200
+ },
+ {
+ "entropy": 1.3354029655456543,
+ "epoch": 0.40606060606060607,
+ "grad_norm": 2.012895345687866,
+ "learning_rate": 4.595959595959597e-06,
+ "loss": 1.3289990425109863,
+ "mean_token_accuracy": 0.685271143913269,
+ "num_tokens": 3293184.0,
+ "step": 201
+ },
+ {
+ "entropy": 1.1990011930465698,
+ "epoch": 0.4080808080808081,
+ "grad_norm": 1.9462409019470215,
+ "learning_rate": 4.5939393939393945e-06,
+ "loss": 1.224869728088379,
+ "mean_token_accuracy": 0.6976673007011414,
+ "num_tokens": 3309568.0,
+ "step": 202
+ },
+ {
+ "entropy": 1.6442710161209106,
+ "epoch": 0.4101010101010101,
+ "grad_norm": 2.064532995223999,
+ "learning_rate": 4.591919191919192e-06,
+ "loss": 1.6800963878631592,
+ "mean_token_accuracy": 0.6111993193626404,
+ "num_tokens": 3325952.0,
+ "step": 203
+ },
+ {
+ "entropy": 1.8336306810379028,
+ "epoch": 0.4121212121212121,
+ "grad_norm": 2.478731393814087,
+ "learning_rate": 4.58989898989899e-06,
+ "loss": 1.8518702983856201,
+ "mean_token_accuracy": 0.6021006107330322,
+ "num_tokens": 3342336.0,
+ "step": 204
+ },
+ {
+ "entropy": 1.6767220497131348,
+ "epoch": 0.41414141414141414,
+ "grad_norm": 2.0676512718200684,
+ "learning_rate": 4.587878787878788e-06,
+ "loss": 1.674522042274475,
+ "mean_token_accuracy": 0.6178553700447083,
+ "num_tokens": 3358720.0,
+ "step": 205
+ },
+ {
+ "entropy": 1.7236497402191162,
+ "epoch": 0.4161616161616162,
+ "grad_norm": 2.057074785232544,
+ "learning_rate": 4.585858585858586e-06,
+ "loss": 1.725832462310791,
+ "mean_token_accuracy": 0.620114803314209,
+ "num_tokens": 3375104.0,
+ "step": 206
+ },
+ {
+ "entropy": 1.6493065357208252,
+ "epoch": 0.41818181818181815,
+ "grad_norm": 2.0946099758148193,
+ "learning_rate": 4.583838383838384e-06,
+ "loss": 1.6826295852661133,
+ "mean_token_accuracy": 0.6251221299171448,
+ "num_tokens": 3391488.0,
+ "step": 207
+ },
+ {
+ "entropy": 1.3565926551818848,
+ "epoch": 0.4202020202020202,
+ "grad_norm": 1.9611284732818604,
+ "learning_rate": 4.581818181818183e-06,
+ "loss": 1.346787452697754,
+ "mean_token_accuracy": 0.685332179069519,
+ "num_tokens": 3407872.0,
+ "step": 208
+ },
+ {
+ "entropy": 1.4401211738586426,
+ "epoch": 0.4222222222222222,
+ "grad_norm": 1.8614766597747803,
+ "learning_rate": 4.579797979797981e-06,
+ "loss": 1.4717891216278076,
+ "mean_token_accuracy": 0.650036633014679,
+ "num_tokens": 3424256.0,
+ "step": 209
+ },
+ {
+ "entropy": 1.194276213645935,
+ "epoch": 0.42424242424242425,
+ "grad_norm": 2.0625810623168945,
+ "learning_rate": 4.5777777777777785e-06,
+ "loss": 1.2106804847717285,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 3440640.0,
+ "step": 210
+ },
+ {
+ "entropy": 1.7622313499450684,
+ "epoch": 0.4262626262626263,
+ "grad_norm": 2.330610752105713,
+ "learning_rate": 4.575757575757576e-06,
+ "loss": 1.7872710227966309,
+ "mean_token_accuracy": 0.598436713218689,
+ "num_tokens": 3457024.0,
+ "step": 211
+ },
+ {
+ "entropy": 1.409427523612976,
+ "epoch": 0.42828282828282827,
+ "grad_norm": 2.0988259315490723,
+ "learning_rate": 4.573737373737374e-06,
+ "loss": 1.416553020477295,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 3473408.0,
+ "step": 212
+ },
+ {
+ "entropy": 1.6856107711791992,
+ "epoch": 0.4303030303030303,
+ "grad_norm": 2.341475009918213,
+ "learning_rate": 4.571717171717172e-06,
+ "loss": 1.692287802696228,
+ "mean_token_accuracy": 0.6024059653282166,
+ "num_tokens": 3489792.0,
+ "step": 213
+ },
+ {
+ "entropy": 1.997343897819519,
+ "epoch": 0.43232323232323233,
+ "grad_norm": 2.200498104095459,
+ "learning_rate": 4.56969696969697e-06,
+ "loss": 2.026289939880371,
+ "mean_token_accuracy": 0.5781631469726562,
+ "num_tokens": 3506176.0,
+ "step": 214
+ },
+ {
+ "entropy": 1.5175039768218994,
+ "epoch": 0.43434343434343436,
+ "grad_norm": 2.105257272720337,
+ "learning_rate": 4.567676767676768e-06,
+ "loss": 1.521841049194336,
+ "mean_token_accuracy": 0.6404494643211365,
+ "num_tokens": 3522560.0,
+ "step": 215
+ },
+ {
+ "entropy": 1.3616528511047363,
+ "epoch": 0.43636363636363634,
+ "grad_norm": 2.0035297870635986,
+ "learning_rate": 4.565656565656566e-06,
+ "loss": 1.3674360513687134,
+ "mean_token_accuracy": 0.6771494746208191,
+ "num_tokens": 3538944.0,
+ "step": 216
+ },
+ {
+ "entropy": 1.42499840259552,
+ "epoch": 0.4383838383838384,
+ "grad_norm": 1.9115629196166992,
+ "learning_rate": 4.563636363636364e-06,
+ "loss": 1.4129266738891602,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 3555328.0,
+ "step": 217
+ },
+ {
+ "entropy": 1.2844709157943726,
+ "epoch": 0.4404040404040404,
+ "grad_norm": 2.3313121795654297,
+ "learning_rate": 4.5616161616161616e-06,
+ "loss": 1.315006971359253,
+ "mean_token_accuracy": 0.681546151638031,
+ "num_tokens": 3571712.0,
+ "step": 218
+ },
+ {
+ "entropy": 1.5227075815200806,
+ "epoch": 0.44242424242424244,
+ "grad_norm": 2.1849124431610107,
+ "learning_rate": 4.55959595959596e-06,
+ "loss": 1.517989158630371,
+ "mean_token_accuracy": 0.6466169953346252,
+ "num_tokens": 3588096.0,
+ "step": 219
+ },
+ {
+ "entropy": 1.494642734527588,
+ "epoch": 0.4444444444444444,
+ "grad_norm": 2.3109116554260254,
+ "learning_rate": 4.557575757575758e-06,
+ "loss": 1.525421142578125,
+ "mean_token_accuracy": 0.6392281651496887,
+ "num_tokens": 3604480.0,
+ "step": 220
+ },
+ {
+ "entropy": 1.6428948640823364,
+ "epoch": 0.44646464646464645,
+ "grad_norm": 2.1182680130004883,
+ "learning_rate": 4.555555555555556e-06,
+ "loss": 1.6634926795959473,
+ "mean_token_accuracy": 0.6207864880561829,
+ "num_tokens": 3620864.0,
+ "step": 221
+ },
+ {
+ "entropy": 1.7323675155639648,
+ "epoch": 0.4484848484848485,
+ "grad_norm": 2.2620837688446045,
+ "learning_rate": 4.553535353535354e-06,
+ "loss": 1.7312631607055664,
+ "mean_token_accuracy": 0.6138250827789307,
+ "num_tokens": 3637248.0,
+ "step": 222
+ },
+ {
+ "entropy": 1.7863894701004028,
+ "epoch": 0.4505050505050505,
+ "grad_norm": 2.1416971683502197,
+ "learning_rate": 4.551515151515152e-06,
+ "loss": 1.799318552017212,
+ "mean_token_accuracy": 0.5906203985214233,
+ "num_tokens": 3653632.0,
+ "step": 223
+ },
+ {
+ "entropy": 1.7404330968856812,
+ "epoch": 0.45252525252525255,
+ "grad_norm": 2.0814504623413086,
+ "learning_rate": 4.54949494949495e-06,
+ "loss": 1.742197036743164,
+ "mean_token_accuracy": 0.6050317287445068,
+ "num_tokens": 3670016.0,
+ "step": 224
+ },
+ {
+ "entropy": 1.4387869834899902,
+ "epoch": 0.45454545454545453,
+ "grad_norm": 2.1386022567749023,
+ "learning_rate": 4.547474747474748e-06,
+ "loss": 1.4602317810058594,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 3686400.0,
+ "step": 225
+ },
+ {
+ "entropy": 1.2733348608016968,
+ "epoch": 0.45656565656565656,
+ "grad_norm": 2.02687668800354,
+ "learning_rate": 4.5454545454545455e-06,
+ "loss": 1.2683714628219604,
+ "mean_token_accuracy": 0.6966902613639832,
+ "num_tokens": 3702784.0,
+ "step": 226
+ },
+ {
+ "entropy": 1.4554595947265625,
+ "epoch": 0.4585858585858586,
+ "grad_norm": 2.169268846511841,
+ "learning_rate": 4.543434343434343e-06,
+ "loss": 1.4541833400726318,
+ "mean_token_accuracy": 0.6522960662841797,
+ "num_tokens": 3719168.0,
+ "step": 227
+ },
+ {
+ "entropy": 1.487573266029358,
+ "epoch": 0.46060606060606063,
+ "grad_norm": 1.9726165533065796,
+ "learning_rate": 4.541414141414141e-06,
+ "loss": 1.5024409294128418,
+ "mean_token_accuracy": 0.6509526371955872,
+ "num_tokens": 3735552.0,
+ "step": 228
+ },
+ {
+ "entropy": 1.3991138935089111,
+ "epoch": 0.4626262626262626,
+ "grad_norm": 2.0992283821105957,
+ "learning_rate": 4.539393939393939e-06,
+ "loss": 1.4016860723495483,
+ "mean_token_accuracy": 0.6639594435691833,
+ "num_tokens": 3751936.0,
+ "step": 229
+ },
+ {
+ "entropy": 1.6564134359359741,
+ "epoch": 0.46464646464646464,
+ "grad_norm": 2.047656297683716,
+ "learning_rate": 4.537373737373738e-06,
+ "loss": 1.6598721742630005,
+ "mean_token_accuracy": 0.6166951656341553,
+ "num_tokens": 3768320.0,
+ "step": 230
+ },
+ {
+ "entropy": 1.5165014266967773,
+ "epoch": 0.4666666666666667,
+ "grad_norm": 2.079996109008789,
+ "learning_rate": 4.535353535353536e-06,
+ "loss": 1.4980010986328125,
+ "mean_token_accuracy": 0.6370908617973328,
+ "num_tokens": 3784704.0,
+ "step": 231
+ },
+ {
+ "entropy": 1.5409225225448608,
+ "epoch": 0.4686868686868687,
+ "grad_norm": 2.0996923446655273,
+ "learning_rate": 4.533333333333334e-06,
+ "loss": 1.5504257678985596,
+ "mean_token_accuracy": 0.6465559601783752,
+ "num_tokens": 3801088.0,
+ "step": 232
+ },
+ {
+ "entropy": 1.3590043783187866,
+ "epoch": 0.4707070707070707,
+ "grad_norm": 2.14617919921875,
+ "learning_rate": 4.531313131313132e-06,
+ "loss": 1.3581812381744385,
+ "mean_token_accuracy": 0.6683561205863953,
+ "num_tokens": 3817472.0,
+ "step": 233
+ },
+ {
+ "entropy": 1.641785740852356,
+ "epoch": 0.4727272727272727,
+ "grad_norm": 1.9499926567077637,
+ "learning_rate": 4.5292929292929295e-06,
+ "loss": 1.6653470993041992,
+ "mean_token_accuracy": 0.6319614052772522,
+ "num_tokens": 3833856.0,
+ "step": 234
+ },
+ {
+ "entropy": 1.4700758457183838,
+ "epoch": 0.47474747474747475,
+ "grad_norm": 1.9411437511444092,
+ "learning_rate": 4.527272727272727e-06,
+ "loss": 1.4762463569641113,
+ "mean_token_accuracy": 0.6631656289100647,
+ "num_tokens": 3850240.0,
+ "step": 235
+ },
+ {
+ "entropy": 1.5418941974639893,
+ "epoch": 0.4767676767676768,
+ "grad_norm": 2.3191940784454346,
+ "learning_rate": 4.525252525252526e-06,
+ "loss": 1.5151214599609375,
+ "mean_token_accuracy": 0.6326331496238708,
+ "num_tokens": 3866624.0,
+ "step": 236
+ },
+ {
+ "entropy": 2.1102776527404785,
+ "epoch": 0.47878787878787876,
+ "grad_norm": 2.2287707328796387,
+ "learning_rate": 4.523232323232324e-06,
+ "loss": 2.106567859649658,
+ "mean_token_accuracy": 0.5506839156150818,
+ "num_tokens": 3883008.0,
+ "step": 237
+ },
+ {
+ "entropy": 1.7448827028274536,
+ "epoch": 0.4808080808080808,
+ "grad_norm": 2.2352893352508545,
+ "learning_rate": 4.521212121212122e-06,
+ "loss": 1.7495017051696777,
+ "mean_token_accuracy": 0.60326087474823,
+ "num_tokens": 3899392.0,
+ "step": 238
+ },
+ {
+ "entropy": 1.315240740776062,
+ "epoch": 0.48282828282828283,
+ "grad_norm": 1.9933631420135498,
+ "learning_rate": 4.51919191919192e-06,
+ "loss": 1.315302848815918,
+ "mean_token_accuracy": 0.686431348323822,
+ "num_tokens": 3915776.0,
+ "step": 239
+ },
+ {
+ "entropy": 1.5851637125015259,
+ "epoch": 0.48484848484848486,
+ "grad_norm": 2.153303623199463,
+ "learning_rate": 4.517171717171718e-06,
+ "loss": 1.5947662591934204,
+ "mean_token_accuracy": 0.6297020316123962,
+ "num_tokens": 3932160.0,
+ "step": 240
+ },
+ {
+ "entropy": 1.8050944805145264,
+ "epoch": 0.4868686868686869,
+ "grad_norm": 2.025022506713867,
+ "learning_rate": 4.5151515151515155e-06,
+ "loss": 1.8051010370254517,
+ "mean_token_accuracy": 0.6055202484130859,
+ "num_tokens": 3948544.0,
+ "step": 241
+ },
+ {
+ "entropy": 1.518296718597412,
+ "epoch": 0.4888888888888889,
+ "grad_norm": 2.1021833419799805,
+ "learning_rate": 4.513131313131313e-06,
+ "loss": 1.5396809577941895,
+ "mean_token_accuracy": 0.6359916925430298,
+ "num_tokens": 3964928.0,
+ "step": 242
+ },
+ {
+ "entropy": 1.518903136253357,
+ "epoch": 0.4909090909090909,
+ "grad_norm": 2.0960140228271484,
+ "learning_rate": 4.511111111111111e-06,
+ "loss": 1.5528055429458618,
+ "mean_token_accuracy": 0.6224963068962097,
+ "num_tokens": 3981312.0,
+ "step": 243
+ },
+ {
+ "entropy": 1.6960705518722534,
+ "epoch": 0.49292929292929294,
+ "grad_norm": 1.8580718040466309,
+ "learning_rate": 4.50909090909091e-06,
+ "loss": 1.7192862033843994,
+ "mean_token_accuracy": 0.6259770393371582,
+ "num_tokens": 3997696.0,
+ "step": 244
+ },
+ {
+ "entropy": 1.4633033275604248,
+ "epoch": 0.494949494949495,
+ "grad_norm": 1.8983049392700195,
+ "learning_rate": 4.507070707070708e-06,
+ "loss": 1.451701283454895,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 4014080.0,
+ "step": 245
+ },
+ {
+ "entropy": 1.6508095264434814,
+ "epoch": 0.49696969696969695,
+ "grad_norm": 2.298679828643799,
+ "learning_rate": 4.505050505050506e-06,
+ "loss": 1.6596897840499878,
+ "mean_token_accuracy": 0.6115046143531799,
+ "num_tokens": 4030464.0,
+ "step": 246
+ },
+ {
+ "entropy": 1.313779354095459,
+ "epoch": 0.498989898989899,
+ "grad_norm": 1.9894335269927979,
+ "learning_rate": 4.503030303030304e-06,
+ "loss": 1.3285409212112427,
+ "mean_token_accuracy": 0.6802027225494385,
+ "num_tokens": 4046848.0,
+ "step": 247
+ },
+ {
+ "entropy": 1.5139521360397339,
+ "epoch": 0.501010101010101,
+ "grad_norm": 2.028320789337158,
+ "learning_rate": 4.501010101010102e-06,
+ "loss": 1.5366487503051758,
+ "mean_token_accuracy": 0.6416707634925842,
+ "num_tokens": 4063232.0,
+ "step": 248
+ },
+ {
+ "entropy": 1.5277045965194702,
+ "epoch": 0.503030303030303,
+ "grad_norm": 2.3160979747772217,
+ "learning_rate": 4.4989898989898995e-06,
+ "loss": 1.5571036338806152,
+ "mean_token_accuracy": 0.6436858773231506,
+ "num_tokens": 4079616.0,
+ "step": 249
+ },
+ {
+ "entropy": 1.6084188222885132,
+ "epoch": 0.5050505050505051,
+ "grad_norm": 2.20550274848938,
+ "learning_rate": 4.496969696969697e-06,
+ "loss": 1.622127652168274,
+ "mean_token_accuracy": 0.6284196376800537,
+ "num_tokens": 4096000.0,
+ "step": 250
+ },
+ {
+ "epoch": 0.5050505050505051,
+ "eval_entropy": 1.5547234262189558,
+ "eval_loss": 1.5764786005020142,
+ "eval_mean_token_accuracy": 0.6375306306346771,
+ "eval_num_tokens": 4096000.0,
+ "eval_runtime": 43.7607,
+ "eval_samples_per_second": 22.623,
+ "eval_steps_per_second": 2.834,
+ "step": 250
+ },
+ {
+ "entropy": 1.4309135675430298,
+ "epoch": 0.5070707070707071,
+ "grad_norm": 2.080864906311035,
+ "learning_rate": 4.494949494949495e-06,
+ "loss": 1.4481091499328613,
+ "mean_token_accuracy": 0.6694552898406982,
+ "num_tokens": 4112384.0,
+ "step": 251
+ },
+ {
+ "entropy": 1.4067270755767822,
+ "epoch": 0.509090909090909,
+ "grad_norm": 2.036475419998169,
+ "learning_rate": 4.492929292929293e-06,
+ "loss": 1.4035298824310303,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 4128768.0,
+ "step": 252
+ },
+ {
+ "entropy": 2.1751608848571777,
+ "epoch": 0.5111111111111111,
+ "grad_norm": 1.953995943069458,
+ "learning_rate": 4.490909090909091e-06,
+ "loss": 2.1616692543029785,
+ "mean_token_accuracy": 0.5592941045761108,
+ "num_tokens": 4145152.0,
+ "step": 253
+ },
+ {
+ "entropy": 1.45353102684021,
+ "epoch": 0.5131313131313131,
+ "grad_norm": 2.084437370300293,
+ "learning_rate": 4.488888888888889e-06,
+ "loss": 1.4633586406707764,
+ "mean_token_accuracy": 0.6620664596557617,
+ "num_tokens": 4161536.0,
+ "step": 254
+ },
+ {
+ "entropy": 1.64310884475708,
+ "epoch": 0.5151515151515151,
+ "grad_norm": 2.0700111389160156,
+ "learning_rate": 4.486868686868688e-06,
+ "loss": 1.6868078708648682,
+ "mean_token_accuracy": 0.616328775882721,
+ "num_tokens": 4177920.0,
+ "step": 255
+ },
+ {
+ "entropy": 1.5113472938537598,
+ "epoch": 0.5171717171717172,
+ "grad_norm": 2.102180242538452,
+ "learning_rate": 4.4848484848484855e-06,
+ "loss": 1.5240120887756348,
+ "mean_token_accuracy": 0.638067901134491,
+ "num_tokens": 4194304.0,
+ "step": 256
+ },
+ {
+ "entropy": 1.5752851963043213,
+ "epoch": 0.5191919191919192,
+ "grad_norm": 2.026737689971924,
+ "learning_rate": 4.4828282828282834e-06,
+ "loss": 1.6041791439056396,
+ "mean_token_accuracy": 0.6275647282600403,
+ "num_tokens": 4210688.0,
+ "step": 257
+ },
+ {
+ "entropy": 1.548423171043396,
+ "epoch": 0.5212121212121212,
+ "grad_norm": 2.0578935146331787,
+ "learning_rate": 4.480808080808081e-06,
+ "loss": 1.563529372215271,
+ "mean_token_accuracy": 0.6348925232887268,
+ "num_tokens": 4227072.0,
+ "step": 258
+ },
+ {
+ "entropy": 1.5324457883834839,
+ "epoch": 0.5232323232323233,
+ "grad_norm": 2.216235637664795,
+ "learning_rate": 4.478787878787879e-06,
+ "loss": 1.5559678077697754,
+ "mean_token_accuracy": 0.6300073266029358,
+ "num_tokens": 4243456.0,
+ "step": 259
+ },
+ {
+ "entropy": 1.5275540351867676,
+ "epoch": 0.5252525252525253,
+ "grad_norm": 2.037306070327759,
+ "learning_rate": 4.476767676767677e-06,
+ "loss": 1.541567087173462,
+ "mean_token_accuracy": 0.6424035429954529,
+ "num_tokens": 4259840.0,
+ "step": 260
+ },
+ {
+ "entropy": 1.6842185258865356,
+ "epoch": 0.5272727272727272,
+ "grad_norm": 2.0241005420684814,
+ "learning_rate": 4.474747474747475e-06,
+ "loss": 1.6819056272506714,
+ "mean_token_accuracy": 0.6102222800254822,
+ "num_tokens": 4276224.0,
+ "step": 261
+ },
+ {
+ "entropy": 1.5656248331069946,
+ "epoch": 0.5292929292929293,
+ "grad_norm": 1.993054986000061,
+ "learning_rate": 4.472727272727273e-06,
+ "loss": 1.6132277250289917,
+ "mean_token_accuracy": 0.634709358215332,
+ "num_tokens": 4292608.0,
+ "step": 262
+ },
+ {
+ "entropy": 1.6354466676712036,
+ "epoch": 0.5313131313131313,
+ "grad_norm": 2.06508731842041,
+ "learning_rate": 4.470707070707071e-06,
+ "loss": 1.6475149393081665,
+ "mean_token_accuracy": 0.6121763586997986,
+ "num_tokens": 4308992.0,
+ "step": 263
+ },
+ {
+ "entropy": 1.5267232656478882,
+ "epoch": 0.5333333333333333,
+ "grad_norm": 2.1227569580078125,
+ "learning_rate": 4.468686868686869e-06,
+ "loss": 1.5468671321868896,
+ "mean_token_accuracy": 0.6365413069725037,
+ "num_tokens": 4325376.0,
+ "step": 264
+ },
+ {
+ "entropy": 1.2252761125564575,
+ "epoch": 0.5353535353535354,
+ "grad_norm": 2.0596134662628174,
+ "learning_rate": 4.4666666666666665e-06,
+ "loss": 1.2242389917373657,
+ "mean_token_accuracy": 0.6973620057106018,
+ "num_tokens": 4341760.0,
+ "step": 265
+ },
+ {
+ "entropy": 1.6007431745529175,
+ "epoch": 0.5373737373737374,
+ "grad_norm": 1.9341918230056763,
+ "learning_rate": 4.464646464646465e-06,
+ "loss": 1.5989094972610474,
+ "mean_token_accuracy": 0.6284196376800537,
+ "num_tokens": 4358144.0,
+ "step": 266
+ },
+ {
+ "entropy": 1.2708780765533447,
+ "epoch": 0.5393939393939394,
+ "grad_norm": 4.594091415405273,
+ "learning_rate": 4.462626262626263e-06,
+ "loss": 1.3484312295913696,
+ "mean_token_accuracy": 0.6790425181388855,
+ "num_tokens": 4374528.0,
+ "step": 267
+ },
+ {
+ "entropy": 1.5423723459243774,
+ "epoch": 0.5414141414141415,
+ "grad_norm": 1.933602213859558,
+ "learning_rate": 4.460606060606061e-06,
+ "loss": 1.594527244567871,
+ "mean_token_accuracy": 0.6386785507202148,
+ "num_tokens": 4390912.0,
+ "step": 268
+ },
+ {
+ "entropy": 1.7213952541351318,
+ "epoch": 0.5434343434343434,
+ "grad_norm": 2.195904016494751,
+ "learning_rate": 4.458585858585859e-06,
+ "loss": 1.724353551864624,
+ "mean_token_accuracy": 0.6008182764053345,
+ "num_tokens": 4407296.0,
+ "step": 269
+ },
+ {
+ "entropy": 1.4772557020187378,
+ "epoch": 0.5454545454545454,
+ "grad_norm": 2.0990796089172363,
+ "learning_rate": 4.456565656565657e-06,
+ "loss": 1.486825942993164,
+ "mean_token_accuracy": 0.6507083773612976,
+ "num_tokens": 4423680.0,
+ "step": 270
+ },
+ {
+ "entropy": 1.6876367330551147,
+ "epoch": 0.5474747474747474,
+ "grad_norm": 2.1944479942321777,
+ "learning_rate": 4.454545454545455e-06,
+ "loss": 1.71107816696167,
+ "mean_token_accuracy": 0.6027112603187561,
+ "num_tokens": 4440064.0,
+ "step": 271
+ },
+ {
+ "entropy": 1.5480726957321167,
+ "epoch": 0.5494949494949495,
+ "grad_norm": 2.1579341888427734,
+ "learning_rate": 4.452525252525253e-06,
+ "loss": 1.544647216796875,
+ "mean_token_accuracy": 0.6345261335372925,
+ "num_tokens": 4456448.0,
+ "step": 272
+ },
+ {
+ "entropy": 1.6161645650863647,
+ "epoch": 0.5515151515151515,
+ "grad_norm": 1.981154203414917,
+ "learning_rate": 4.4505050505050505e-06,
+ "loss": 1.6109068393707275,
+ "mean_token_accuracy": 0.6318392753601074,
+ "num_tokens": 4472832.0,
+ "step": 273
+ },
+ {
+ "entropy": 1.2576326131820679,
+ "epoch": 0.5535353535353535,
+ "grad_norm": 1.95668625831604,
+ "learning_rate": 4.448484848484848e-06,
+ "loss": 1.2614656686782837,
+ "mean_token_accuracy": 0.7025524973869324,
+ "num_tokens": 4489216.0,
+ "step": 274
+ },
+ {
+ "entropy": 1.405206561088562,
+ "epoch": 0.5555555555555556,
+ "grad_norm": 2.0302884578704834,
+ "learning_rate": 4.446464646464646e-06,
+ "loss": 1.416546106338501,
+ "mean_token_accuracy": 0.6753786206245422,
+ "num_tokens": 4505600.0,
+ "step": 275
+ },
+ {
+ "entropy": 1.9038625955581665,
+ "epoch": 0.5575757575757576,
+ "grad_norm": 2.06475567817688,
+ "learning_rate": 4.444444444444444e-06,
+ "loss": 1.9273614883422852,
+ "mean_token_accuracy": 0.5813996195793152,
+ "num_tokens": 4521984.0,
+ "step": 276
+ },
+ {
+ "entropy": 1.7208465337753296,
+ "epoch": 0.5595959595959596,
+ "grad_norm": 2.0136189460754395,
+ "learning_rate": 4.442424242424243e-06,
+ "loss": 1.7260158061981201,
+ "mean_token_accuracy": 0.6006350517272949,
+ "num_tokens": 4538368.0,
+ "step": 277
+ },
+ {
+ "entropy": 1.7570570707321167,
+ "epoch": 0.5616161616161616,
+ "grad_norm": 2.148594379425049,
+ "learning_rate": 4.440404040404041e-06,
+ "loss": 1.7799286842346191,
+ "mean_token_accuracy": 0.5943453907966614,
+ "num_tokens": 4554752.0,
+ "step": 278
+ },
+ {
+ "entropy": 1.6388157606124878,
+ "epoch": 0.5636363636363636,
+ "grad_norm": 2.1301987171173096,
+ "learning_rate": 4.438383838383839e-06,
+ "loss": 1.63419508934021,
+ "mean_token_accuracy": 0.6405715942382812,
+ "num_tokens": 4571136.0,
+ "step": 279
+ },
+ {
+ "entropy": 1.5902295112609863,
+ "epoch": 0.5656565656565656,
+ "grad_norm": 2.0526790618896484,
+ "learning_rate": 4.436363636363637e-06,
+ "loss": 1.6278276443481445,
+ "mean_token_accuracy": 0.615229606628418,
+ "num_tokens": 4587520.0,
+ "step": 280
+ },
+ {
+ "entropy": 1.5494027137756348,
+ "epoch": 0.5676767676767677,
+ "grad_norm": 1.9863859415054321,
+ "learning_rate": 4.434343434343435e-06,
+ "loss": 1.5622975826263428,
+ "mean_token_accuracy": 0.6261602640151978,
+ "num_tokens": 4603904.0,
+ "step": 281
+ },
+ {
+ "entropy": 1.2140685319900513,
+ "epoch": 0.5696969696969697,
+ "grad_norm": 2.4206902980804443,
+ "learning_rate": 4.432323232323233e-06,
+ "loss": 1.2389612197875977,
+ "mean_token_accuracy": 0.6943697929382324,
+ "num_tokens": 4620288.0,
+ "step": 282
+ },
+ {
+ "entropy": 1.4347270727157593,
+ "epoch": 0.5717171717171717,
+ "grad_norm": 2.0198237895965576,
+ "learning_rate": 4.430303030303031e-06,
+ "loss": 1.4648659229278564,
+ "mean_token_accuracy": 0.6573033928871155,
+ "num_tokens": 4636672.0,
+ "step": 283
+ },
+ {
+ "entropy": 1.3239331245422363,
+ "epoch": 0.5737373737373738,
+ "grad_norm": 1.9862704277038574,
+ "learning_rate": 4.428282828282829e-06,
+ "loss": 1.3520365953445435,
+ "mean_token_accuracy": 0.6852100491523743,
+ "num_tokens": 4653056.0,
+ "step": 284
+ },
+ {
+ "entropy": 1.7534631490707397,
+ "epoch": 0.5757575757575758,
+ "grad_norm": 2.0964176654815674,
+ "learning_rate": 4.426262626262627e-06,
+ "loss": 1.7659757137298584,
+ "mean_token_accuracy": 0.5975207686424255,
+ "num_tokens": 4669440.0,
+ "step": 285
+ },
+ {
+ "entropy": 1.1573433876037598,
+ "epoch": 0.5777777777777777,
+ "grad_norm": 2.0671567916870117,
+ "learning_rate": 4.424242424242425e-06,
+ "loss": 1.1479461193084717,
+ "mean_token_accuracy": 0.7143380641937256,
+ "num_tokens": 4685824.0,
+ "step": 286
+ },
+ {
+ "entropy": 1.2439504861831665,
+ "epoch": 0.5797979797979798,
+ "grad_norm": 2.0317327976226807,
+ "learning_rate": 4.422222222222223e-06,
+ "loss": 1.255782961845398,
+ "mean_token_accuracy": 0.691255509853363,
+ "num_tokens": 4702208.0,
+ "step": 287
+ },
+ {
+ "entropy": 1.5569473505020142,
+ "epoch": 0.5818181818181818,
+ "grad_norm": 2.0759670734405518,
+ "learning_rate": 4.4202020202020205e-06,
+ "loss": 1.5564974546432495,
+ "mean_token_accuracy": 0.6284807324409485,
+ "num_tokens": 4718592.0,
+ "step": 288
+ },
+ {
+ "entropy": 1.478676199913025,
+ "epoch": 0.5838383838383838,
+ "grad_norm": 1.9528205394744873,
+ "learning_rate": 4.418181818181818e-06,
+ "loss": 1.491654396057129,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 4734976.0,
+ "step": 289
+ },
+ {
+ "entropy": 1.2454503774642944,
+ "epoch": 0.5858585858585859,
+ "grad_norm": 1.9008079767227173,
+ "learning_rate": 4.416161616161616e-06,
+ "loss": 1.253904938697815,
+ "mean_token_accuracy": 0.6971787810325623,
+ "num_tokens": 4751360.0,
+ "step": 290
+ },
+ {
+ "entropy": 1.1740810871124268,
+ "epoch": 0.5878787878787879,
+ "grad_norm": 1.8888787031173706,
+ "learning_rate": 4.414141414141415e-06,
+ "loss": 1.195070505142212,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 4767744.0,
+ "step": 291
+ },
+ {
+ "entropy": 1.6064486503601074,
+ "epoch": 0.5898989898989899,
+ "grad_norm": 2.073559284210205,
+ "learning_rate": 4.412121212121213e-06,
+ "loss": 1.6180689334869385,
+ "mean_token_accuracy": 0.6242061257362366,
+ "num_tokens": 4784128.0,
+ "step": 292
+ },
+ {
+ "entropy": 1.6119383573532104,
+ "epoch": 0.591919191919192,
+ "grad_norm": 1.8773425817489624,
+ "learning_rate": 4.410101010101011e-06,
+ "loss": 1.5875662565231323,
+ "mean_token_accuracy": 0.647838294506073,
+ "num_tokens": 4800512.0,
+ "step": 293
+ },
+ {
+ "entropy": 1.392905592918396,
+ "epoch": 0.593939393939394,
+ "grad_norm": 2.1699368953704834,
+ "learning_rate": 4.408080808080809e-06,
+ "loss": 1.3949127197265625,
+ "mean_token_accuracy": 0.6538837552070618,
+ "num_tokens": 4816896.0,
+ "step": 294
+ },
+ {
+ "entropy": 1.5057002305984497,
+ "epoch": 0.5959595959595959,
+ "grad_norm": 2.2730712890625,
+ "learning_rate": 4.4060606060606066e-06,
+ "loss": 1.4755051136016846,
+ "mean_token_accuracy": 0.6498534679412842,
+ "num_tokens": 4833280.0,
+ "step": 295
+ },
+ {
+ "entropy": 1.5468902587890625,
+ "epoch": 0.597979797979798,
+ "grad_norm": 1.9911075830459595,
+ "learning_rate": 4.4040404040404044e-06,
+ "loss": 1.539963722229004,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 4849664.0,
+ "step": 296
+ },
+ {
+ "entropy": 1.5196901559829712,
+ "epoch": 0.6,
+ "grad_norm": 1.9859540462493896,
+ "learning_rate": 4.402020202020202e-06,
+ "loss": 1.523442029953003,
+ "mean_token_accuracy": 0.6417317986488342,
+ "num_tokens": 4866048.0,
+ "step": 297
+ },
+ {
+ "entropy": 1.8251866102218628,
+ "epoch": 0.602020202020202,
+ "grad_norm": 2.2566516399383545,
+ "learning_rate": 4.4e-06,
+ "loss": 1.8667771816253662,
+ "mean_token_accuracy": 0.5872007608413696,
+ "num_tokens": 4882432.0,
+ "step": 298
+ },
+ {
+ "entropy": 1.6816744804382324,
+ "epoch": 0.604040404040404,
+ "grad_norm": 2.0107715129852295,
+ "learning_rate": 4.397979797979798e-06,
+ "loss": 1.6907548904418945,
+ "mean_token_accuracy": 0.6176722049713135,
+ "num_tokens": 4898816.0,
+ "step": 299
+ },
+ {
+ "entropy": 1.4992223978042603,
+ "epoch": 0.6060606060606061,
+ "grad_norm": 2.1236329078674316,
+ "learning_rate": 4.395959595959596e-06,
+ "loss": 1.5015790462493896,
+ "mean_token_accuracy": 0.6372129917144775,
+ "num_tokens": 4915200.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.6060606060606061,
+ "eval_entropy": 1.5544315297757425,
+ "eval_loss": 1.5676765441894531,
+ "eval_mean_token_accuracy": 0.6389380799185845,
+ "eval_num_tokens": 4915200.0,
+ "eval_runtime": 43.7857,
+ "eval_samples_per_second": 22.61,
+ "eval_steps_per_second": 2.832,
+ "step": 300
+ },
+ {
+ "entropy": 1.518556833267212,
+ "epoch": 0.6080808080808081,
+ "grad_norm": 2.88371205329895,
+ "learning_rate": 4.393939393939394e-06,
+ "loss": 1.5310916900634766,
+ "mean_token_accuracy": 0.6551660895347595,
+ "num_tokens": 4931584.0,
+ "step": 301
+ },
+ {
+ "entropy": 1.4650386571884155,
+ "epoch": 0.6101010101010101,
+ "grad_norm": 2.1849780082702637,
+ "learning_rate": 4.391919191919193e-06,
+ "loss": 1.4405598640441895,
+ "mean_token_accuracy": 0.6531509757041931,
+ "num_tokens": 4947968.0,
+ "step": 302
+ },
+ {
+ "entropy": 1.5209505558013916,
+ "epoch": 0.6121212121212121,
+ "grad_norm": 2.1135010719299316,
+ "learning_rate": 4.3898989898989905e-06,
+ "loss": 1.5324647426605225,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 4964352.0,
+ "step": 303
+ },
+ {
+ "entropy": 1.448391318321228,
+ "epoch": 0.6141414141414141,
+ "grad_norm": 1.9959306716918945,
+ "learning_rate": 4.387878787878788e-06,
+ "loss": 1.4721965789794922,
+ "mean_token_accuracy": 0.6578529477119446,
+ "num_tokens": 4980736.0,
+ "step": 304
+ },
+ {
+ "entropy": 1.4609358310699463,
+ "epoch": 0.6161616161616161,
+ "grad_norm": 2.1308915615081787,
+ "learning_rate": 4.385858585858586e-06,
+ "loss": 1.4707520008087158,
+ "mean_token_accuracy": 0.6482046842575073,
+ "num_tokens": 4997120.0,
+ "step": 305
+ },
+ {
+ "entropy": 1.7125155925750732,
+ "epoch": 0.6181818181818182,
+ "grad_norm": 2.2170841693878174,
+ "learning_rate": 4.383838383838384e-06,
+ "loss": 1.7630269527435303,
+ "mean_token_accuracy": 0.5999022722244263,
+ "num_tokens": 5013504.0,
+ "step": 306
+ },
+ {
+ "entropy": 1.6740268468856812,
+ "epoch": 0.6202020202020202,
+ "grad_norm": 1.983644723892212,
+ "learning_rate": 4.381818181818182e-06,
+ "loss": 1.6849563121795654,
+ "mean_token_accuracy": 0.6237176060676575,
+ "num_tokens": 5029888.0,
+ "step": 307
+ },
+ {
+ "entropy": 1.3754971027374268,
+ "epoch": 0.6222222222222222,
+ "grad_norm": 2.005277395248413,
+ "learning_rate": 4.37979797979798e-06,
+ "loss": 1.385213851928711,
+ "mean_token_accuracy": 0.6638984084129333,
+ "num_tokens": 5046272.0,
+ "step": 308
+ },
+ {
+ "entropy": 1.5476733446121216,
+ "epoch": 0.6242424242424243,
+ "grad_norm": 2.4317610263824463,
+ "learning_rate": 4.377777777777778e-06,
+ "loss": 1.5417041778564453,
+ "mean_token_accuracy": 0.6323888897895813,
+ "num_tokens": 5062656.0,
+ "step": 309
+ },
+ {
+ "entropy": 1.4437031745910645,
+ "epoch": 0.6262626262626263,
+ "grad_norm": 2.1464109420776367,
+ "learning_rate": 4.375757575757576e-06,
+ "loss": 1.4704627990722656,
+ "mean_token_accuracy": 0.6772105693817139,
+ "num_tokens": 5079040.0,
+ "step": 310
+ },
+ {
+ "entropy": 1.4859641790390015,
+ "epoch": 0.6282828282828283,
+ "grad_norm": 2.0800492763519287,
+ "learning_rate": 4.373737373737374e-06,
+ "loss": 1.5072834491729736,
+ "mean_token_accuracy": 0.658707857131958,
+ "num_tokens": 5095424.0,
+ "step": 311
+ },
+ {
+ "entropy": 1.8733419179916382,
+ "epoch": 0.6303030303030303,
+ "grad_norm": 2.120965003967285,
+ "learning_rate": 4.3717171717171715e-06,
+ "loss": 1.8567254543304443,
+ "mean_token_accuracy": 0.5847581624984741,
+ "num_tokens": 5111808.0,
+ "step": 312
+ },
+ {
+ "entropy": 1.4578243494033813,
+ "epoch": 0.6323232323232323,
+ "grad_norm": 1.9577823877334595,
+ "learning_rate": 4.36969696969697e-06,
+ "loss": 1.4758052825927734,
+ "mean_token_accuracy": 0.6590742468833923,
+ "num_tokens": 5128192.0,
+ "step": 313
+ },
+ {
+ "entropy": 1.8680084943771362,
+ "epoch": 0.6343434343434343,
+ "grad_norm": 2.170994520187378,
+ "learning_rate": 4.367676767676768e-06,
+ "loss": 1.904400110244751,
+ "mean_token_accuracy": 0.5857962965965271,
+ "num_tokens": 5144576.0,
+ "step": 314
+ },
+ {
+ "entropy": 1.6488304138183594,
+ "epoch": 0.6363636363636364,
+ "grad_norm": 1.959490418434143,
+ "learning_rate": 4.365656565656566e-06,
+ "loss": 1.6570477485656738,
+ "mean_token_accuracy": 0.6257327795028687,
+ "num_tokens": 5160960.0,
+ "step": 315
+ },
+ {
+ "entropy": 1.5038025379180908,
+ "epoch": 0.6383838383838384,
+ "grad_norm": 2.072697401046753,
+ "learning_rate": 4.363636363636364e-06,
+ "loss": 1.5234860181808472,
+ "mean_token_accuracy": 0.6494259834289551,
+ "num_tokens": 5177344.0,
+ "step": 316
+ },
+ {
+ "entropy": 1.4154654741287231,
+ "epoch": 0.6404040404040404,
+ "grad_norm": 1.894587755203247,
+ "learning_rate": 4.361616161616162e-06,
+ "loss": 1.4131592512130737,
+ "mean_token_accuracy": 0.6667073965072632,
+ "num_tokens": 5193728.0,
+ "step": 317
+ },
+ {
+ "entropy": 1.5813250541687012,
+ "epoch": 0.6424242424242425,
+ "grad_norm": 2.4088737964630127,
+ "learning_rate": 4.35959595959596e-06,
+ "loss": 1.6236622333526611,
+ "mean_token_accuracy": 0.6313507556915283,
+ "num_tokens": 5210112.0,
+ "step": 318
+ },
+ {
+ "entropy": 1.4140045642852783,
+ "epoch": 0.6444444444444445,
+ "grad_norm": 1.991557240486145,
+ "learning_rate": 4.3575757575757576e-06,
+ "loss": 1.4242517948150635,
+ "mean_token_accuracy": 0.6569980382919312,
+ "num_tokens": 5226496.0,
+ "step": 319
+ },
+ {
+ "entropy": 1.615628957748413,
+ "epoch": 0.6464646464646465,
+ "grad_norm": 1.8819077014923096,
+ "learning_rate": 4.3555555555555555e-06,
+ "loss": 1.6331532001495361,
+ "mean_token_accuracy": 0.6299462914466858,
+ "num_tokens": 5242880.0,
+ "step": 320
+ },
+ {
+ "entropy": 1.3118394613265991,
+ "epoch": 0.6484848484848484,
+ "grad_norm": 2.0589284896850586,
+ "learning_rate": 4.353535353535353e-06,
+ "loss": 1.2880034446716309,
+ "mean_token_accuracy": 0.6842941045761108,
+ "num_tokens": 5259264.0,
+ "step": 321
+ },
+ {
+ "entropy": 1.2786612510681152,
+ "epoch": 0.6505050505050505,
+ "grad_norm": 2.033839225769043,
+ "learning_rate": 4.351515151515152e-06,
+ "loss": 1.2829055786132812,
+ "mean_token_accuracy": 0.6910112500190735,
+ "num_tokens": 5275648.0,
+ "step": 322
+ },
+ {
+ "entropy": 1.5632988214492798,
+ "epoch": 0.6525252525252525,
+ "grad_norm": 2.1970419883728027,
+ "learning_rate": 4.34949494949495e-06,
+ "loss": 1.5865097045898438,
+ "mean_token_accuracy": 0.642892062664032,
+ "num_tokens": 5292032.0,
+ "step": 323
+ },
+ {
+ "entropy": 1.1542725563049316,
+ "epoch": 0.6545454545454545,
+ "grad_norm": 1.9750654697418213,
+ "learning_rate": 4.347474747474748e-06,
+ "loss": 1.1401035785675049,
+ "mean_token_accuracy": 0.7061553597450256,
+ "num_tokens": 5308416.0,
+ "step": 324
+ },
+ {
+ "entropy": 1.6879942417144775,
+ "epoch": 0.6565656565656566,
+ "grad_norm": 2.0022354125976562,
+ "learning_rate": 4.345454545454546e-06,
+ "loss": 1.70950448513031,
+ "mean_token_accuracy": 0.6089398860931396,
+ "num_tokens": 5324800.0,
+ "step": 325
+ },
+ {
+ "entropy": 1.7589699029922485,
+ "epoch": 0.6585858585858586,
+ "grad_norm": 1.925520420074463,
+ "learning_rate": 4.343434343434344e-06,
+ "loss": 1.7749860286712646,
+ "mean_token_accuracy": 0.6015510559082031,
+ "num_tokens": 5341184.0,
+ "step": 326
+ },
+ {
+ "entropy": 1.4720325469970703,
+ "epoch": 0.6606060606060606,
+ "grad_norm": 1.9487124681472778,
+ "learning_rate": 4.341414141414142e-06,
+ "loss": 1.4983797073364258,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 5357568.0,
+ "step": 327
+ },
+ {
+ "entropy": 1.676164150238037,
+ "epoch": 0.6626262626262627,
+ "grad_norm": 2.13053035736084,
+ "learning_rate": 4.33939393939394e-06,
+ "loss": 1.699425458908081,
+ "mean_token_accuracy": 0.6100390553474426,
+ "num_tokens": 5373952.0,
+ "step": 328
+ },
+ {
+ "entropy": 1.3424437046051025,
+ "epoch": 0.6646464646464646,
+ "grad_norm": 2.0245954990386963,
+ "learning_rate": 4.337373737373738e-06,
+ "loss": 1.3393046855926514,
+ "mean_token_accuracy": 0.677760124206543,
+ "num_tokens": 5390336.0,
+ "step": 329
+ },
+ {
+ "entropy": 1.4926583766937256,
+ "epoch": 0.6666666666666666,
+ "grad_norm": 1.893343448638916,
+ "learning_rate": 4.335353535353536e-06,
+ "loss": 1.4779269695281982,
+ "mean_token_accuracy": 0.6713483333587646,
+ "num_tokens": 5406720.0,
+ "step": 330
+ },
+ {
+ "entropy": 1.5753449201583862,
+ "epoch": 0.6686868686868687,
+ "grad_norm": 2.051647424697876,
+ "learning_rate": 4.333333333333334e-06,
+ "loss": 1.622597336769104,
+ "mean_token_accuracy": 0.6436248421669006,
+ "num_tokens": 5423104.0,
+ "step": 331
+ },
+ {
+ "entropy": 1.4573988914489746,
+ "epoch": 0.6707070707070707,
+ "grad_norm": 1.8709567785263062,
+ "learning_rate": 4.331313131313132e-06,
+ "loss": 1.4902422428131104,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 5439488.0,
+ "step": 332
+ },
+ {
+ "entropy": 1.378867745399475,
+ "epoch": 0.6727272727272727,
+ "grad_norm": 2.235928773880005,
+ "learning_rate": 4.32929292929293e-06,
+ "loss": 1.4067103862762451,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 5455872.0,
+ "step": 333
+ },
+ {
+ "entropy": 1.7553350925445557,
+ "epoch": 0.6747474747474748,
+ "grad_norm": 2.0335066318511963,
+ "learning_rate": 4.327272727272728e-06,
+ "loss": 1.772943139076233,
+ "mean_token_accuracy": 0.5953834652900696,
+ "num_tokens": 5472256.0,
+ "step": 334
+ },
+ {
+ "entropy": 1.1587097644805908,
+ "epoch": 0.6767676767676768,
+ "grad_norm": 1.8764615058898926,
+ "learning_rate": 4.3252525252525255e-06,
+ "loss": 1.1396210193634033,
+ "mean_token_accuracy": 0.7197117805480957,
+ "num_tokens": 5488640.0,
+ "step": 335
+ },
+ {
+ "entropy": 1.4819872379302979,
+ "epoch": 0.6787878787878788,
+ "grad_norm": 2.0907511711120605,
+ "learning_rate": 4.323232323232323e-06,
+ "loss": 1.460550308227539,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 5505024.0,
+ "step": 336
+ },
+ {
+ "entropy": 1.0744472742080688,
+ "epoch": 0.6808080808080809,
+ "grad_norm": 2.227606773376465,
+ "learning_rate": 4.321212121212121e-06,
+ "loss": 1.0909301042556763,
+ "mean_token_accuracy": 0.7258182764053345,
+ "num_tokens": 5521408.0,
+ "step": 337
+ },
+ {
+ "entropy": 1.507999300956726,
+ "epoch": 0.6828282828282828,
+ "grad_norm": 2.0332415103912354,
+ "learning_rate": 4.31919191919192e-06,
+ "loss": 1.5173046588897705,
+ "mean_token_accuracy": 0.6374572515487671,
+ "num_tokens": 5537792.0,
+ "step": 338
+ },
+ {
+ "entropy": 1.6792720556259155,
+ "epoch": 0.6848484848484848,
+ "grad_norm": 2.0194997787475586,
+ "learning_rate": 4.317171717171718e-06,
+ "loss": 1.679445743560791,
+ "mean_token_accuracy": 0.6138250827789307,
+ "num_tokens": 5554176.0,
+ "step": 339
+ },
+ {
+ "entropy": 1.6470589637756348,
+ "epoch": 0.6868686868686869,
+ "grad_norm": 2.09116268157959,
+ "learning_rate": 4.315151515151516e-06,
+ "loss": 1.6386632919311523,
+ "mean_token_accuracy": 0.6146799921989441,
+ "num_tokens": 5570560.0,
+ "step": 340
+ },
+ {
+ "entropy": 1.3612488508224487,
+ "epoch": 0.6888888888888889,
+ "grad_norm": 2.1586217880249023,
+ "learning_rate": 4.313131313131314e-06,
+ "loss": 1.3698725700378418,
+ "mean_token_accuracy": 0.6696995496749878,
+ "num_tokens": 5586944.0,
+ "step": 341
+ },
+ {
+ "entropy": 1.400327205657959,
+ "epoch": 0.6909090909090909,
+ "grad_norm": 2.082094192504883,
+ "learning_rate": 4.3111111111111115e-06,
+ "loss": 1.396535873413086,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 5603328.0,
+ "step": 342
+ },
+ {
+ "entropy": 1.389290690422058,
+ "epoch": 0.692929292929293,
+ "grad_norm": 2.0780303478240967,
+ "learning_rate": 4.309090909090909e-06,
+ "loss": 1.4275782108306885,
+ "mean_token_accuracy": 0.6656082272529602,
+ "num_tokens": 5619712.0,
+ "step": 343
+ },
+ {
+ "entropy": 1.5133870840072632,
+ "epoch": 0.694949494949495,
+ "grad_norm": 1.9819531440734863,
+ "learning_rate": 4.307070707070707e-06,
+ "loss": 1.5309596061706543,
+ "mean_token_accuracy": 0.6373351216316223,
+ "num_tokens": 5636096.0,
+ "step": 344
+ },
+ {
+ "entropy": 1.483219861984253,
+ "epoch": 0.696969696969697,
+ "grad_norm": 1.9794325828552246,
+ "learning_rate": 4.305050505050505e-06,
+ "loss": 1.4693087339401245,
+ "mean_token_accuracy": 0.6550439596176147,
+ "num_tokens": 5652480.0,
+ "step": 345
+ },
+ {
+ "entropy": 1.381489634513855,
+ "epoch": 0.6989898989898989,
+ "grad_norm": 2.0637686252593994,
+ "learning_rate": 4.303030303030303e-06,
+ "loss": 1.3862476348876953,
+ "mean_token_accuracy": 0.6631045341491699,
+ "num_tokens": 5668864.0,
+ "step": 346
+ },
+ {
+ "entropy": 1.9860024452209473,
+ "epoch": 0.701010101010101,
+ "grad_norm": 2.1626803874969482,
+ "learning_rate": 4.301010101010101e-06,
+ "loss": 1.9815950393676758,
+ "mean_token_accuracy": 0.5698583126068115,
+ "num_tokens": 5685248.0,
+ "step": 347
+ },
+ {
+ "entropy": 1.5044004917144775,
+ "epoch": 0.703030303030303,
+ "grad_norm": 2.060976266860962,
+ "learning_rate": 4.298989898989899e-06,
+ "loss": 1.4937127828598022,
+ "mean_token_accuracy": 0.6524792313575745,
+ "num_tokens": 5701632.0,
+ "step": 348
+ },
+ {
+ "entropy": 1.3397772312164307,
+ "epoch": 0.705050505050505,
+ "grad_norm": 2.0162901878356934,
+ "learning_rate": 4.296969696969698e-06,
+ "loss": 1.3358572721481323,
+ "mean_token_accuracy": 0.6949804425239563,
+ "num_tokens": 5718016.0,
+ "step": 349
+ },
+ {
+ "entropy": 1.145772099494934,
+ "epoch": 0.7070707070707071,
+ "grad_norm": 2.097634792327881,
+ "learning_rate": 4.2949494949494955e-06,
+ "loss": 1.1833416223526,
+ "mean_token_accuracy": 0.7104909420013428,
+ "num_tokens": 5734400.0,
+ "step": 350
+ },
+ {
+ "epoch": 0.7070707070707071,
+ "eval_entropy": 1.5476290602837839,
+ "eval_loss": 1.5603480339050293,
+ "eval_mean_token_accuracy": 0.640111118555069,
+ "eval_num_tokens": 5734400.0,
+ "eval_runtime": 43.7844,
+ "eval_samples_per_second": 22.611,
+ "eval_steps_per_second": 2.832,
+ "step": 350
+ },
+ {
+ "entropy": 1.4311926364898682,
+ "epoch": 0.7090909090909091,
+ "grad_norm": 2.002321720123291,
+ "learning_rate": 4.292929292929293e-06,
+ "loss": 1.4534825086593628,
+ "mean_token_accuracy": 0.6614558100700378,
+ "num_tokens": 5750784.0,
+ "step": 351
+ },
+ {
+ "entropy": 1.3983922004699707,
+ "epoch": 0.7111111111111111,
+ "grad_norm": 2.1724867820739746,
+ "learning_rate": 4.290909090909091e-06,
+ "loss": 1.3969402313232422,
+ "mean_token_accuracy": 0.6652418375015259,
+ "num_tokens": 5767168.0,
+ "step": 352
+ },
+ {
+ "entropy": 1.8218920230865479,
+ "epoch": 0.7131313131313132,
+ "grad_norm": 2.1629281044006348,
+ "learning_rate": 4.288888888888889e-06,
+ "loss": 1.8196980953216553,
+ "mean_token_accuracy": 0.6027112603187561,
+ "num_tokens": 5783552.0,
+ "step": 353
+ },
+ {
+ "entropy": 1.5322320461273193,
+ "epoch": 0.7151515151515152,
+ "grad_norm": 1.8486647605895996,
+ "learning_rate": 4.286868686868687e-06,
+ "loss": 1.5504610538482666,
+ "mean_token_accuracy": 0.6533341407775879,
+ "num_tokens": 5799936.0,
+ "step": 354
+ },
+ {
+ "entropy": 1.935966968536377,
+ "epoch": 0.7171717171717171,
+ "grad_norm": 2.252814292907715,
+ "learning_rate": 4.284848484848485e-06,
+ "loss": 1.9300384521484375,
+ "mean_token_accuracy": 0.5656448602676392,
+ "num_tokens": 5816320.0,
+ "step": 355
+ },
+ {
+ "entropy": 1.6711398363113403,
+ "epoch": 0.7191919191919192,
+ "grad_norm": 2.023379325866699,
+ "learning_rate": 4.282828282828283e-06,
+ "loss": 1.6584455966949463,
+ "mean_token_accuracy": 0.6235954761505127,
+ "num_tokens": 5832704.0,
+ "step": 356
+ },
+ {
+ "entropy": 1.3922803401947021,
+ "epoch": 0.7212121212121212,
+ "grad_norm": 2.0487611293792725,
+ "learning_rate": 4.280808080808081e-06,
+ "loss": 1.4220250844955444,
+ "mean_token_accuracy": 0.6591963768005371,
+ "num_tokens": 5849088.0,
+ "step": 357
+ },
+ {
+ "entropy": 1.59521484375,
+ "epoch": 0.7232323232323232,
+ "grad_norm": 1.8598614931106567,
+ "learning_rate": 4.278787878787879e-06,
+ "loss": 1.5979329347610474,
+ "mean_token_accuracy": 0.6237176060676575,
+ "num_tokens": 5865472.0,
+ "step": 358
+ },
+ {
+ "entropy": 1.5810115337371826,
+ "epoch": 0.7252525252525253,
+ "grad_norm": 2.140115737915039,
+ "learning_rate": 4.276767676767677e-06,
+ "loss": 1.5774705410003662,
+ "mean_token_accuracy": 0.6274425983428955,
+ "num_tokens": 5881856.0,
+ "step": 359
+ },
+ {
+ "entropy": 1.5839109420776367,
+ "epoch": 0.7272727272727273,
+ "grad_norm": 2.0947749614715576,
+ "learning_rate": 4.274747474747475e-06,
+ "loss": 1.601511001586914,
+ "mean_token_accuracy": 0.630984365940094,
+ "num_tokens": 5898240.0,
+ "step": 360
+ },
+ {
+ "entropy": 1.195770263671875,
+ "epoch": 0.7292929292929293,
+ "grad_norm": 1.8740363121032715,
+ "learning_rate": 4.272727272727273e-06,
+ "loss": 1.195652961730957,
+ "mean_token_accuracy": 0.7077430486679077,
+ "num_tokens": 5914624.0,
+ "step": 361
+ },
+ {
+ "entropy": 1.375698208808899,
+ "epoch": 0.7313131313131314,
+ "grad_norm": 1.9580703973770142,
+ "learning_rate": 4.270707070707071e-06,
+ "loss": 1.3746864795684814,
+ "mean_token_accuracy": 0.6775158643722534,
+ "num_tokens": 5931008.0,
+ "step": 362
+ },
+ {
+ "entropy": 1.7259451150894165,
+ "epoch": 0.7333333333333333,
+ "grad_norm": 2.3127365112304688,
+ "learning_rate": 4.268686868686869e-06,
+ "loss": 1.745998501777649,
+ "mean_token_accuracy": 0.6040546894073486,
+ "num_tokens": 5947392.0,
+ "step": 363
+ },
+ {
+ "entropy": 1.209228754043579,
+ "epoch": 0.7353535353535353,
+ "grad_norm": 1.9004793167114258,
+ "learning_rate": 4.266666666666668e-06,
+ "loss": 1.232427716255188,
+ "mean_token_accuracy": 0.6925989389419556,
+ "num_tokens": 5963776.0,
+ "step": 364
+ },
+ {
+ "entropy": 1.2811263799667358,
+ "epoch": 0.7373737373737373,
+ "grad_norm": 1.9568246603012085,
+ "learning_rate": 4.2646464646464655e-06,
+ "loss": 1.291853427886963,
+ "mean_token_accuracy": 0.6884465217590332,
+ "num_tokens": 5980160.0,
+ "step": 365
+ },
+ {
+ "entropy": 1.843044638633728,
+ "epoch": 0.7393939393939394,
+ "grad_norm": 2.132735252380371,
+ "learning_rate": 4.262626262626263e-06,
+ "loss": 1.8818857669830322,
+ "mean_token_accuracy": 0.5785295367240906,
+ "num_tokens": 5996544.0,
+ "step": 366
+ },
+ {
+ "entropy": 1.3353440761566162,
+ "epoch": 0.7414141414141414,
+ "grad_norm": 1.8893013000488281,
+ "learning_rate": 4.260606060606061e-06,
+ "loss": 1.354011058807373,
+ "mean_token_accuracy": 0.6797752976417542,
+ "num_tokens": 6012928.0,
+ "step": 367
+ },
+ {
+ "entropy": 1.3889728784561157,
+ "epoch": 0.7434343434343434,
+ "grad_norm": 1.980757236480713,
+ "learning_rate": 4.258585858585859e-06,
+ "loss": 1.3671875,
+ "mean_token_accuracy": 0.6627381443977356,
+ "num_tokens": 6029312.0,
+ "step": 368
+ },
+ {
+ "entropy": 1.4605348110198975,
+ "epoch": 0.7454545454545455,
+ "grad_norm": 2.1033780574798584,
+ "learning_rate": 4.256565656565657e-06,
+ "loss": 1.455024003982544,
+ "mean_token_accuracy": 0.6451514363288879,
+ "num_tokens": 6045696.0,
+ "step": 369
+ },
+ {
+ "entropy": 1.4382058382034302,
+ "epoch": 0.7474747474747475,
+ "grad_norm": 2.1068074703216553,
+ "learning_rate": 4.254545454545455e-06,
+ "loss": 1.4422768354415894,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 6062080.0,
+ "step": 370
+ },
+ {
+ "entropy": 1.8046759366989136,
+ "epoch": 0.7494949494949495,
+ "grad_norm": 2.214466094970703,
+ "learning_rate": 4.252525252525253e-06,
+ "loss": 1.8247106075286865,
+ "mean_token_accuracy": 0.6003297567367554,
+ "num_tokens": 6078464.0,
+ "step": 371
+ },
+ {
+ "entropy": 1.671690583229065,
+ "epoch": 0.7515151515151515,
+ "grad_norm": 1.9790785312652588,
+ "learning_rate": 4.250505050505051e-06,
+ "loss": 1.6907753944396973,
+ "mean_token_accuracy": 0.6232290863990784,
+ "num_tokens": 6094848.0,
+ "step": 372
+ },
+ {
+ "entropy": 1.6881897449493408,
+ "epoch": 0.7535353535353535,
+ "grad_norm": 1.8638463020324707,
+ "learning_rate": 4.248484848484849e-06,
+ "loss": 1.7132716178894043,
+ "mean_token_accuracy": 0.6357474327087402,
+ "num_tokens": 6111232.0,
+ "step": 373
+ },
+ {
+ "entropy": 1.2555122375488281,
+ "epoch": 0.7555555555555555,
+ "grad_norm": 2.082378387451172,
+ "learning_rate": 4.246464646464647e-06,
+ "loss": 1.240688681602478,
+ "mean_token_accuracy": 0.6965070962905884,
+ "num_tokens": 6127616.0,
+ "step": 374
+ },
+ {
+ "entropy": 1.847135305404663,
+ "epoch": 0.7575757575757576,
+ "grad_norm": 2.142962694168091,
+ "learning_rate": 4.244444444444445e-06,
+ "loss": 1.8840911388397217,
+ "mean_token_accuracy": 0.5822545289993286,
+ "num_tokens": 6144000.0,
+ "step": 375
+ },
+ {
+ "entropy": 1.239328384399414,
+ "epoch": 0.7595959595959596,
+ "grad_norm": 2.0589468479156494,
+ "learning_rate": 4.242424242424243e-06,
+ "loss": 1.256324052810669,
+ "mean_token_accuracy": 0.6845383644104004,
+ "num_tokens": 6160384.0,
+ "step": 376
+ },
+ {
+ "entropy": 1.5047202110290527,
+ "epoch": 0.7616161616161616,
+ "grad_norm": 1.7951308488845825,
+ "learning_rate": 4.240404040404041e-06,
+ "loss": 1.5063304901123047,
+ "mean_token_accuracy": 0.6583414673805237,
+ "num_tokens": 6176768.0,
+ "step": 377
+ },
+ {
+ "entropy": 1.4072566032409668,
+ "epoch": 0.7636363636363637,
+ "grad_norm": 2.1670594215393066,
+ "learning_rate": 4.238383838383839e-06,
+ "loss": 1.4205389022827148,
+ "mean_token_accuracy": 0.658707857131958,
+ "num_tokens": 6193152.0,
+ "step": 378
+ },
+ {
+ "entropy": 1.3207885026931763,
+ "epoch": 0.7656565656565657,
+ "grad_norm": 1.9017083644866943,
+ "learning_rate": 4.236363636363637e-06,
+ "loss": 1.3169896602630615,
+ "mean_token_accuracy": 0.6954079270362854,
+ "num_tokens": 6209536.0,
+ "step": 379
+ },
+ {
+ "entropy": 1.4762436151504517,
+ "epoch": 0.7676767676767676,
+ "grad_norm": 2.0023069381713867,
+ "learning_rate": 4.234343434343435e-06,
+ "loss": 1.4725041389465332,
+ "mean_token_accuracy": 0.6620053648948669,
+ "num_tokens": 6225920.0,
+ "step": 380
+ },
+ {
+ "entropy": 1.4895304441452026,
+ "epoch": 0.7696969696969697,
+ "grad_norm": 1.9528017044067383,
+ "learning_rate": 4.2323232323232325e-06,
+ "loss": 1.49650239944458,
+ "mean_token_accuracy": 0.6508915424346924,
+ "num_tokens": 6242304.0,
+ "step": 381
+ },
+ {
+ "entropy": 1.3024516105651855,
+ "epoch": 0.7717171717171717,
+ "grad_norm": 1.9855588674545288,
+ "learning_rate": 4.2303030303030304e-06,
+ "loss": 1.34218168258667,
+ "mean_token_accuracy": 0.6838055849075317,
+ "num_tokens": 6258688.0,
+ "step": 382
+ },
+ {
+ "entropy": 1.6005626916885376,
+ "epoch": 0.7737373737373737,
+ "grad_norm": 2.028286933898926,
+ "learning_rate": 4.228282828282828e-06,
+ "loss": 1.6299283504486084,
+ "mean_token_accuracy": 0.6315950155258179,
+ "num_tokens": 6275072.0,
+ "step": 383
+ },
+ {
+ "entropy": 1.7050484418869019,
+ "epoch": 0.7757575757575758,
+ "grad_norm": 2.474047899246216,
+ "learning_rate": 4.226262626262626e-06,
+ "loss": 1.777151346206665,
+ "mean_token_accuracy": 0.5919027924537659,
+ "num_tokens": 6291456.0,
+ "step": 384
+ },
+ {
+ "entropy": 1.5014543533325195,
+ "epoch": 0.7777777777777778,
+ "grad_norm": 1.9866594076156616,
+ "learning_rate": 4.224242424242425e-06,
+ "loss": 1.5308949947357178,
+ "mean_token_accuracy": 0.639106035232544,
+ "num_tokens": 6307840.0,
+ "step": 385
+ },
+ {
+ "entropy": 1.6957359313964844,
+ "epoch": 0.7797979797979798,
+ "grad_norm": 2.229820966720581,
+ "learning_rate": 4.222222222222223e-06,
+ "loss": 1.728761911392212,
+ "mean_token_accuracy": 0.6242061257362366,
+ "num_tokens": 6324224.0,
+ "step": 386
+ },
+ {
+ "entropy": 1.6823521852493286,
+ "epoch": 0.7818181818181819,
+ "grad_norm": 2.033383369445801,
+ "learning_rate": 4.220202020202021e-06,
+ "loss": 1.7310154438018799,
+ "mean_token_accuracy": 0.6257938742637634,
+ "num_tokens": 6340608.0,
+ "step": 387
+ },
+ {
+ "entropy": 1.710307240486145,
+ "epoch": 0.7838383838383839,
+ "grad_norm": 2.061861038208008,
+ "learning_rate": 4.218181818181819e-06,
+ "loss": 1.7066943645477295,
+ "mean_token_accuracy": 0.6123595237731934,
+ "num_tokens": 6356992.0,
+ "step": 388
+ },
+ {
+ "entropy": 1.241638422012329,
+ "epoch": 0.7858585858585858,
+ "grad_norm": 1.9743852615356445,
+ "learning_rate": 4.2161616161616165e-06,
+ "loss": 1.2520272731781006,
+ "mean_token_accuracy": 0.692415714263916,
+ "num_tokens": 6373376.0,
+ "step": 389
+ },
+ {
+ "entropy": 1.5918776988983154,
+ "epoch": 0.7878787878787878,
+ "grad_norm": 2.156675100326538,
+ "learning_rate": 4.214141414141414e-06,
+ "loss": 1.6060255765914917,
+ "mean_token_accuracy": 0.6178553700447083,
+ "num_tokens": 6389760.0,
+ "step": 390
+ },
+ {
+ "entropy": 1.7307862043380737,
+ "epoch": 0.7898989898989899,
+ "grad_norm": 2.171247959136963,
+ "learning_rate": 4.212121212121212e-06,
+ "loss": 1.7327581644058228,
+ "mean_token_accuracy": 0.6502808928489685,
+ "num_tokens": 6406144.0,
+ "step": 391
+ },
+ {
+ "entropy": 1.6725553274154663,
+ "epoch": 0.7919191919191919,
+ "grad_norm": 2.020228624343872,
+ "learning_rate": 4.21010101010101e-06,
+ "loss": 1.6803646087646484,
+ "mean_token_accuracy": 0.6383732557296753,
+ "num_tokens": 6422528.0,
+ "step": 392
+ },
+ {
+ "entropy": 1.4120928049087524,
+ "epoch": 0.793939393939394,
+ "grad_norm": 1.9896639585494995,
+ "learning_rate": 4.208080808080808e-06,
+ "loss": 1.3974279165267944,
+ "mean_token_accuracy": 0.6661577820777893,
+ "num_tokens": 6438912.0,
+ "step": 393
+ },
+ {
+ "entropy": 0.933545708656311,
+ "epoch": 0.795959595959596,
+ "grad_norm": 1.6884223222732544,
+ "learning_rate": 4.206060606060606e-06,
+ "loss": 0.9287986755371094,
+ "mean_token_accuracy": 0.7636175155639648,
+ "num_tokens": 6455296.0,
+ "step": 394
+ },
+ {
+ "entropy": 1.419004201889038,
+ "epoch": 0.797979797979798,
+ "grad_norm": 2.2590551376342773,
+ "learning_rate": 4.204040404040405e-06,
+ "loss": 1.4652538299560547,
+ "mean_token_accuracy": 0.6589521169662476,
+ "num_tokens": 6471680.0,
+ "step": 395
+ },
+ {
+ "entropy": 1.750221610069275,
+ "epoch": 0.8,
+ "grad_norm": 2.195030450820923,
+ "learning_rate": 4.2020202020202026e-06,
+ "loss": 1.7328863143920898,
+ "mean_token_accuracy": 0.6008182764053345,
+ "num_tokens": 6488064.0,
+ "step": 396
+ },
+ {
+ "entropy": 1.7440015077590942,
+ "epoch": 0.802020202020202,
+ "grad_norm": 1.9833927154541016,
+ "learning_rate": 4.2000000000000004e-06,
+ "loss": 1.7617835998535156,
+ "mean_token_accuracy": 0.5992916226387024,
+ "num_tokens": 6504448.0,
+ "step": 397
+ },
+ {
+ "entropy": 1.1636452674865723,
+ "epoch": 0.804040404040404,
+ "grad_norm": 1.9506802558898926,
+ "learning_rate": 4.197979797979798e-06,
+ "loss": 1.1344032287597656,
+ "mean_token_accuracy": 0.7122618556022644,
+ "num_tokens": 6520832.0,
+ "step": 398
+ },
+ {
+ "entropy": 1.6173542737960815,
+ "epoch": 0.806060606060606,
+ "grad_norm": 2.0997231006622314,
+ "learning_rate": 4.195959595959596e-06,
+ "loss": 1.6303956508636475,
+ "mean_token_accuracy": 0.6215192675590515,
+ "num_tokens": 6537216.0,
+ "step": 399
+ },
+ {
+ "entropy": 1.4391542673110962,
+ "epoch": 0.8080808080808081,
+ "grad_norm": 2.356828212738037,
+ "learning_rate": 4.193939393939394e-06,
+ "loss": 1.4465923309326172,
+ "mean_token_accuracy": 0.6594406366348267,
+ "num_tokens": 6553600.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.8080808080808081,
+ "eval_entropy": 1.5504949785047961,
+ "eval_loss": 1.5544542074203491,
+ "eval_mean_token_accuracy": 0.6409837569921247,
+ "eval_num_tokens": 6553600.0,
+ "eval_runtime": 43.7986,
+ "eval_samples_per_second": 22.603,
+ "eval_steps_per_second": 2.831,
+ "step": 400
+ },
+ {
+ "entropy": 1.60548996925354,
+ "epoch": 0.8101010101010101,
+ "grad_norm": 2.1894404888153076,
+ "learning_rate": 4.191919191919192e-06,
+ "loss": 1.6116085052490234,
+ "mean_token_accuracy": 0.6276868581771851,
+ "num_tokens": 6569984.0,
+ "step": 401
+ },
+ {
+ "entropy": 1.436041235923767,
+ "epoch": 0.8121212121212121,
+ "grad_norm": 2.1180264949798584,
+ "learning_rate": 4.18989898989899e-06,
+ "loss": 1.4203698635101318,
+ "mean_token_accuracy": 0.6554714441299438,
+ "num_tokens": 6586368.0,
+ "step": 402
+ },
+ {
+ "entropy": 1.1348106861114502,
+ "epoch": 0.8141414141414142,
+ "grad_norm": 2.0420851707458496,
+ "learning_rate": 4.187878787878788e-06,
+ "loss": 1.1424527168273926,
+ "mean_token_accuracy": 0.7154372334480286,
+ "num_tokens": 6602752.0,
+ "step": 403
+ },
+ {
+ "entropy": 1.4039727449417114,
+ "epoch": 0.8161616161616162,
+ "grad_norm": 2.148340940475464,
+ "learning_rate": 4.185858585858586e-06,
+ "loss": 1.4246132373809814,
+ "mean_token_accuracy": 0.6723864078521729,
+ "num_tokens": 6619136.0,
+ "step": 404
+ },
+ {
+ "entropy": 1.4222626686096191,
+ "epoch": 0.8181818181818182,
+ "grad_norm": 1.9436827898025513,
+ "learning_rate": 4.1838383838383835e-06,
+ "loss": 1.4235990047454834,
+ "mean_token_accuracy": 0.6759281754493713,
+ "num_tokens": 6635520.0,
+ "step": 405
+ },
+ {
+ "entropy": 1.4771310091018677,
+ "epoch": 0.8202020202020202,
+ "grad_norm": 2.0953726768493652,
+ "learning_rate": 4.181818181818182e-06,
+ "loss": 1.501934289932251,
+ "mean_token_accuracy": 0.6535173654556274,
+ "num_tokens": 6651904.0,
+ "step": 406
+ },
+ {
+ "entropy": 1.526256799697876,
+ "epoch": 0.8222222222222222,
+ "grad_norm": 2.245994806289673,
+ "learning_rate": 4.17979797979798e-06,
+ "loss": 1.539383888244629,
+ "mean_token_accuracy": 0.6417317986488342,
+ "num_tokens": 6668288.0,
+ "step": 407
+ },
+ {
+ "entropy": 1.1716097593307495,
+ "epoch": 0.8242424242424242,
+ "grad_norm": 1.8283652067184448,
+ "learning_rate": 4.177777777777778e-06,
+ "loss": 1.1798359155654907,
+ "mean_token_accuracy": 0.7123839855194092,
+ "num_tokens": 6684672.0,
+ "step": 408
+ },
+ {
+ "entropy": 1.4581540822982788,
+ "epoch": 0.8262626262626263,
+ "grad_norm": 1.9325168132781982,
+ "learning_rate": 4.175757575757576e-06,
+ "loss": 1.4526585340499878,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 6701056.0,
+ "step": 409
+ },
+ {
+ "entropy": 1.4073102474212646,
+ "epoch": 0.8282828282828283,
+ "grad_norm": 2.1543467044830322,
+ "learning_rate": 4.173737373737375e-06,
+ "loss": 1.437713861465454,
+ "mean_token_accuracy": 0.6725696325302124,
+ "num_tokens": 6717440.0,
+ "step": 410
+ },
+ {
+ "entropy": 1.5970062017440796,
+ "epoch": 0.8303030303030303,
+ "grad_norm": 2.1714792251586914,
+ "learning_rate": 4.1717171717171726e-06,
+ "loss": 1.613295078277588,
+ "mean_token_accuracy": 0.6229848265647888,
+ "num_tokens": 6733824.0,
+ "step": 411
+ },
+ {
+ "entropy": 1.449837327003479,
+ "epoch": 0.8323232323232324,
+ "grad_norm": 2.2499871253967285,
+ "learning_rate": 4.1696969696969705e-06,
+ "loss": 1.489758014678955,
+ "mean_token_accuracy": 0.645639955997467,
+ "num_tokens": 6750208.0,
+ "step": 412
+ },
+ {
+ "entropy": 1.7696173191070557,
+ "epoch": 0.8343434343434344,
+ "grad_norm": 2.3637073040008545,
+ "learning_rate": 4.167676767676768e-06,
+ "loss": 1.8147599697113037,
+ "mean_token_accuracy": 0.5821323990821838,
+ "num_tokens": 6766592.0,
+ "step": 413
+ },
+ {
+ "entropy": 1.99376380443573,
+ "epoch": 0.8363636363636363,
+ "grad_norm": 2.265683174133301,
+ "learning_rate": 4.165656565656566e-06,
+ "loss": 2.009024143218994,
+ "mean_token_accuracy": 0.5591108798980713,
+ "num_tokens": 6782976.0,
+ "step": 414
+ },
+ {
+ "entropy": 1.7276980876922607,
+ "epoch": 0.8383838383838383,
+ "grad_norm": 1.9407477378845215,
+ "learning_rate": 4.163636363636364e-06,
+ "loss": 1.7130229473114014,
+ "mean_token_accuracy": 0.6202979683876038,
+ "num_tokens": 6799360.0,
+ "step": 415
+ },
+ {
+ "entropy": 1.5418223142623901,
+ "epoch": 0.8404040404040404,
+ "grad_norm": 1.9765743017196655,
+ "learning_rate": 4.161616161616162e-06,
+ "loss": 1.5627632141113281,
+ "mean_token_accuracy": 0.6433194875717163,
+ "num_tokens": 6815744.0,
+ "step": 416
+ },
+ {
+ "entropy": 1.6040345430374146,
+ "epoch": 0.8424242424242424,
+ "grad_norm": 2.1942877769470215,
+ "learning_rate": 4.15959595959596e-06,
+ "loss": 1.6044622659683228,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 6832128.0,
+ "step": 417
+ },
+ {
+ "entropy": 1.8461577892303467,
+ "epoch": 0.8444444444444444,
+ "grad_norm": 2.289196729660034,
+ "learning_rate": 4.157575757575758e-06,
+ "loss": 1.8679372072219849,
+ "mean_token_accuracy": 0.5887884497642517,
+ "num_tokens": 6848512.0,
+ "step": 418
+ },
+ {
+ "entropy": 1.4079350233078003,
+ "epoch": 0.8464646464646465,
+ "grad_norm": 1.9526047706604004,
+ "learning_rate": 4.155555555555556e-06,
+ "loss": 1.4145114421844482,
+ "mean_token_accuracy": 0.6731802821159363,
+ "num_tokens": 6864896.0,
+ "step": 419
+ },
+ {
+ "entropy": 1.1973973512649536,
+ "epoch": 0.8484848484848485,
+ "grad_norm": 2.0716679096221924,
+ "learning_rate": 4.1535353535353536e-06,
+ "loss": 1.260810136795044,
+ "mean_token_accuracy": 0.701697587966919,
+ "num_tokens": 6881280.0,
+ "step": 420
+ },
+ {
+ "entropy": 1.507702350616455,
+ "epoch": 0.8505050505050505,
+ "grad_norm": 2.0233314037323,
+ "learning_rate": 4.151515151515152e-06,
+ "loss": 1.513720154762268,
+ "mean_token_accuracy": 0.6497313380241394,
+ "num_tokens": 6897664.0,
+ "step": 421
+ },
+ {
+ "entropy": 1.54402756690979,
+ "epoch": 0.8525252525252526,
+ "grad_norm": 2.23366379737854,
+ "learning_rate": 4.14949494949495e-06,
+ "loss": 1.5434964895248413,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 6914048.0,
+ "step": 422
+ },
+ {
+ "entropy": 1.820296049118042,
+ "epoch": 0.8545454545454545,
+ "grad_norm": 2.066905975341797,
+ "learning_rate": 4.147474747474748e-06,
+ "loss": 1.8356924057006836,
+ "mean_token_accuracy": 0.5886663198471069,
+ "num_tokens": 6930432.0,
+ "step": 423
+ },
+ {
+ "entropy": 1.4747720956802368,
+ "epoch": 0.8565656565656565,
+ "grad_norm": 2.040022850036621,
+ "learning_rate": 4.145454545454546e-06,
+ "loss": 1.4495999813079834,
+ "mean_token_accuracy": 0.6532731056213379,
+ "num_tokens": 6946816.0,
+ "step": 424
+ },
+ {
+ "entropy": 1.7536696195602417,
+ "epoch": 0.8585858585858586,
+ "grad_norm": 2.0884320735931396,
+ "learning_rate": 4.143434343434344e-06,
+ "loss": 1.7520158290863037,
+ "mean_token_accuracy": 0.6083903312683105,
+ "num_tokens": 6963200.0,
+ "step": 425
+ },
+ {
+ "entropy": 1.715582251548767,
+ "epoch": 0.8606060606060606,
+ "grad_norm": 2.2991514205932617,
+ "learning_rate": 4.141414141414142e-06,
+ "loss": 1.7138090133666992,
+ "mean_token_accuracy": 0.607107937335968,
+ "num_tokens": 6979584.0,
+ "step": 426
+ },
+ {
+ "entropy": 1.8116382360458374,
+ "epoch": 0.8626262626262626,
+ "grad_norm": 2.289909839630127,
+ "learning_rate": 4.13939393939394e-06,
+ "loss": 1.7755894660949707,
+ "mean_token_accuracy": 0.5776746273040771,
+ "num_tokens": 6995968.0,
+ "step": 427
+ },
+ {
+ "entropy": 1.487213373184204,
+ "epoch": 0.8646464646464647,
+ "grad_norm": 1.8834803104400635,
+ "learning_rate": 4.1373737373737375e-06,
+ "loss": 1.511157751083374,
+ "mean_token_accuracy": 0.6546165347099304,
+ "num_tokens": 7012352.0,
+ "step": 428
+ },
+ {
+ "entropy": 1.2769891023635864,
+ "epoch": 0.8666666666666667,
+ "grad_norm": 1.892616629600525,
+ "learning_rate": 4.135353535353535e-06,
+ "loss": 1.2772598266601562,
+ "mean_token_accuracy": 0.6984611749649048,
+ "num_tokens": 7028736.0,
+ "step": 429
+ },
+ {
+ "entropy": 1.579519271850586,
+ "epoch": 0.8686868686868687,
+ "grad_norm": 1.9801563024520874,
+ "learning_rate": 4.133333333333333e-06,
+ "loss": 1.5647528171539307,
+ "mean_token_accuracy": 0.6482046842575073,
+ "num_tokens": 7045120.0,
+ "step": 430
+ },
+ {
+ "entropy": 1.407600998878479,
+ "epoch": 0.8707070707070707,
+ "grad_norm": 2.1737446784973145,
+ "learning_rate": 4.131313131313132e-06,
+ "loss": 1.4184494018554688,
+ "mean_token_accuracy": 0.6640815734863281,
+ "num_tokens": 7061504.0,
+ "step": 431
+ },
+ {
+ "entropy": 1.9118441343307495,
+ "epoch": 0.8727272727272727,
+ "grad_norm": 1.9541205167770386,
+ "learning_rate": 4.12929292929293e-06,
+ "loss": 1.9581422805786133,
+ "mean_token_accuracy": 0.564667820930481,
+ "num_tokens": 7077888.0,
+ "step": 432
+ },
+ {
+ "entropy": 1.925604224205017,
+ "epoch": 0.8747474747474747,
+ "grad_norm": 1.9696223735809326,
+ "learning_rate": 4.127272727272728e-06,
+ "loss": 1.9226163625717163,
+ "mean_token_accuracy": 0.5870786309242249,
+ "num_tokens": 7094272.0,
+ "step": 433
+ },
+ {
+ "entropy": 1.3994735479354858,
+ "epoch": 0.8767676767676768,
+ "grad_norm": 2.003532886505127,
+ "learning_rate": 4.125252525252526e-06,
+ "loss": 1.4291752576828003,
+ "mean_token_accuracy": 0.669516384601593,
+ "num_tokens": 7110656.0,
+ "step": 434
+ },
+ {
+ "entropy": 1.5550929307937622,
+ "epoch": 0.8787878787878788,
+ "grad_norm": 2.2658586502075195,
+ "learning_rate": 4.1232323232323236e-06,
+ "loss": 1.5533335208892822,
+ "mean_token_accuracy": 0.6242672204971313,
+ "num_tokens": 7127040.0,
+ "step": 435
+ },
+ {
+ "entropy": 1.6622785329818726,
+ "epoch": 0.8808080808080808,
+ "grad_norm": 2.0748393535614014,
+ "learning_rate": 4.1212121212121215e-06,
+ "loss": 1.700000524520874,
+ "mean_token_accuracy": 0.6221299171447754,
+ "num_tokens": 7143424.0,
+ "step": 436
+ },
+ {
+ "entropy": 1.1223996877670288,
+ "epoch": 0.8828282828282829,
+ "grad_norm": 2.0348756313323975,
+ "learning_rate": 4.119191919191919e-06,
+ "loss": 1.143293857574463,
+ "mean_token_accuracy": 0.7045676708221436,
+ "num_tokens": 7159808.0,
+ "step": 437
+ },
+ {
+ "entropy": 1.7156380414962769,
+ "epoch": 0.8848484848484849,
+ "grad_norm": 2.306549549102783,
+ "learning_rate": 4.117171717171717e-06,
+ "loss": 1.7625794410705566,
+ "mean_token_accuracy": 0.6049706935882568,
+ "num_tokens": 7176192.0,
+ "step": 438
+ },
+ {
+ "entropy": 1.8507202863693237,
+ "epoch": 0.8868686868686869,
+ "grad_norm": 2.2955853939056396,
+ "learning_rate": 4.115151515151515e-06,
+ "loss": 1.8923052549362183,
+ "mean_token_accuracy": 0.5938568711280823,
+ "num_tokens": 7192576.0,
+ "step": 439
+ },
+ {
+ "entropy": 1.813754916191101,
+ "epoch": 0.8888888888888888,
+ "grad_norm": 2.095700263977051,
+ "learning_rate": 4.113131313131313e-06,
+ "loss": 1.8375307321548462,
+ "mean_token_accuracy": 0.5848192572593689,
+ "num_tokens": 7208960.0,
+ "step": 440
+ },
+ {
+ "entropy": 1.4185007810592651,
+ "epoch": 0.8909090909090909,
+ "grad_norm": 2.118213176727295,
+ "learning_rate": 4.111111111111111e-06,
+ "loss": 1.4548171758651733,
+ "mean_token_accuracy": 0.657608687877655,
+ "num_tokens": 7225344.0,
+ "step": 441
+ },
+ {
+ "entropy": 1.1041690111160278,
+ "epoch": 0.8929292929292929,
+ "grad_norm": 1.9638988971710205,
+ "learning_rate": 4.10909090909091e-06,
+ "loss": 1.1232322454452515,
+ "mean_token_accuracy": 0.7068881392478943,
+ "num_tokens": 7241728.0,
+ "step": 442
+ },
+ {
+ "entropy": 1.6423180103302002,
+ "epoch": 0.8949494949494949,
+ "grad_norm": 2.32987117767334,
+ "learning_rate": 4.1070707070707075e-06,
+ "loss": 1.665462613105774,
+ "mean_token_accuracy": 0.6133365631103516,
+ "num_tokens": 7258112.0,
+ "step": 443
+ },
+ {
+ "entropy": 1.4778310060501099,
+ "epoch": 0.896969696969697,
+ "grad_norm": 2.1247661113739014,
+ "learning_rate": 4.105050505050505e-06,
+ "loss": 1.4554922580718994,
+ "mean_token_accuracy": 0.6474108695983887,
+ "num_tokens": 7274496.0,
+ "step": 444
+ },
+ {
+ "entropy": 1.3777755498886108,
+ "epoch": 0.898989898989899,
+ "grad_norm": 1.9243263006210327,
+ "learning_rate": 4.103030303030303e-06,
+ "loss": 1.3942883014678955,
+ "mean_token_accuracy": 0.6656692624092102,
+ "num_tokens": 7290880.0,
+ "step": 445
+ },
+ {
+ "entropy": 1.1036415100097656,
+ "epoch": 0.901010101010101,
+ "grad_norm": 1.9711178541183472,
+ "learning_rate": 4.101010101010101e-06,
+ "loss": 1.1070351600646973,
+ "mean_token_accuracy": 0.7213605046272278,
+ "num_tokens": 7307264.0,
+ "step": 446
+ },
+ {
+ "entropy": 1.695487380027771,
+ "epoch": 0.9030303030303031,
+ "grad_norm": 2.1113150119781494,
+ "learning_rate": 4.098989898989899e-06,
+ "loss": 1.6993653774261475,
+ "mean_token_accuracy": 0.5992305874824524,
+ "num_tokens": 7323648.0,
+ "step": 447
+ },
+ {
+ "entropy": 1.496254801750183,
+ "epoch": 0.9050505050505051,
+ "grad_norm": 2.072986602783203,
+ "learning_rate": 4.096969696969697e-06,
+ "loss": 1.5046567916870117,
+ "mean_token_accuracy": 0.6558378338813782,
+ "num_tokens": 7340032.0,
+ "step": 448
+ },
+ {
+ "entropy": 2.1845033168792725,
+ "epoch": 0.907070707070707,
+ "grad_norm": 2.3246262073516846,
+ "learning_rate": 4.094949494949495e-06,
+ "loss": 2.1508708000183105,
+ "mean_token_accuracy": 0.5376160144805908,
+ "num_tokens": 7356416.0,
+ "step": 449
+ },
+ {
+ "entropy": 1.6329164505004883,
+ "epoch": 0.9090909090909091,
+ "grad_norm": 1.997310757637024,
+ "learning_rate": 4.092929292929294e-06,
+ "loss": 1.6422264575958252,
+ "mean_token_accuracy": 0.6232290863990784,
+ "num_tokens": 7372800.0,
+ "step": 450
+ },
+ {
+ "epoch": 0.9090909090909091,
+ "eval_entropy": 1.5515337480652718,
+ "eval_loss": 1.5485161542892456,
+ "eval_mean_token_accuracy": 0.6417716929028111,
+ "eval_num_tokens": 7372800.0,
+ "eval_runtime": 43.7901,
+ "eval_samples_per_second": 22.608,
+ "eval_steps_per_second": 2.832,
+ "step": 450
+ },
+ {
+ "entropy": 1.7854291200637817,
+ "epoch": 0.9111111111111111,
+ "grad_norm": 2.0212173461914062,
+ "learning_rate": 4.0909090909090915e-06,
+ "loss": 1.7920666933059692,
+ "mean_token_accuracy": 0.5950170755386353,
+ "num_tokens": 7389184.0,
+ "step": 451
+ },
+ {
+ "entropy": 1.216304898262024,
+ "epoch": 0.9131313131313131,
+ "grad_norm": 1.8800705671310425,
+ "learning_rate": 4.088888888888889e-06,
+ "loss": 1.2014267444610596,
+ "mean_token_accuracy": 0.7076819539070129,
+ "num_tokens": 7405568.0,
+ "step": 452
+ },
+ {
+ "entropy": 1.5593703985214233,
+ "epoch": 0.9151515151515152,
+ "grad_norm": 2.101381301879883,
+ "learning_rate": 4.086868686868687e-06,
+ "loss": 1.559610366821289,
+ "mean_token_accuracy": 0.6337933540344238,
+ "num_tokens": 7421952.0,
+ "step": 453
+ },
+ {
+ "entropy": 1.4199841022491455,
+ "epoch": 0.9171717171717172,
+ "grad_norm": 2.0038692951202393,
+ "learning_rate": 4.084848484848485e-06,
+ "loss": 1.4040653705596924,
+ "mean_token_accuracy": 0.660845160484314,
+ "num_tokens": 7438336.0,
+ "step": 454
+ },
+ {
+ "entropy": 1.2010453939437866,
+ "epoch": 0.9191919191919192,
+ "grad_norm": 2.004110336303711,
+ "learning_rate": 4.082828282828283e-06,
+ "loss": 1.194115400314331,
+ "mean_token_accuracy": 0.6955910921096802,
+ "num_tokens": 7454720.0,
+ "step": 455
+ },
+ {
+ "entropy": 1.2295804023742676,
+ "epoch": 0.9212121212121213,
+ "grad_norm": 2.130387544631958,
+ "learning_rate": 4.080808080808081e-06,
+ "loss": 1.2125787734985352,
+ "mean_token_accuracy": 0.6993771195411682,
+ "num_tokens": 7471104.0,
+ "step": 456
+ },
+ {
+ "entropy": 1.3706485033035278,
+ "epoch": 0.9232323232323232,
+ "grad_norm": 2.1667706966400146,
+ "learning_rate": 4.07878787878788e-06,
+ "loss": 1.3886957168579102,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 7487488.0,
+ "step": 457
+ },
+ {
+ "entropy": 1.714059591293335,
+ "epoch": 0.9252525252525252,
+ "grad_norm": 2.0084264278411865,
+ "learning_rate": 4.0767676767676775e-06,
+ "loss": 1.724153757095337,
+ "mean_token_accuracy": 0.602161705493927,
+ "num_tokens": 7503872.0,
+ "step": 458
+ },
+ {
+ "entropy": 1.3170617818832397,
+ "epoch": 0.9272727272727272,
+ "grad_norm": 1.9923994541168213,
+ "learning_rate": 4.0747474747474754e-06,
+ "loss": 1.3518096208572388,
+ "mean_token_accuracy": 0.6801416873931885,
+ "num_tokens": 7520256.0,
+ "step": 459
+ },
+ {
+ "entropy": 1.7946380376815796,
+ "epoch": 0.9292929292929293,
+ "grad_norm": 2.3475260734558105,
+ "learning_rate": 4.072727272727273e-06,
+ "loss": 1.824514389038086,
+ "mean_token_accuracy": 0.6005740165710449,
+ "num_tokens": 7536640.0,
+ "step": 460
+ },
+ {
+ "entropy": 1.3695449829101562,
+ "epoch": 0.9313131313131313,
+ "grad_norm": 2.0983943939208984,
+ "learning_rate": 4.070707070707071e-06,
+ "loss": 1.3934273719787598,
+ "mean_token_accuracy": 0.6723253726959229,
+ "num_tokens": 7553024.0,
+ "step": 461
+ },
+ {
+ "entropy": 1.5890663862228394,
+ "epoch": 0.9333333333333333,
+ "grad_norm": 2.1465413570404053,
+ "learning_rate": 4.068686868686869e-06,
+ "loss": 1.611652135848999,
+ "mean_token_accuracy": 0.6408158540725708,
+ "num_tokens": 7569408.0,
+ "step": 462
+ },
+ {
+ "entropy": 1.2593727111816406,
+ "epoch": 0.9353535353535354,
+ "grad_norm": 1.7885241508483887,
+ "learning_rate": 4.066666666666667e-06,
+ "loss": 1.2781705856323242,
+ "mean_token_accuracy": 0.6946751475334167,
+ "num_tokens": 7585792.0,
+ "step": 463
+ },
+ {
+ "entropy": 1.5680429935455322,
+ "epoch": 0.9373737373737374,
+ "grad_norm": 2.1466636657714844,
+ "learning_rate": 4.064646464646465e-06,
+ "loss": 1.60218346118927,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 7602176.0,
+ "step": 464
+ },
+ {
+ "entropy": 1.681670069694519,
+ "epoch": 0.9393939393939394,
+ "grad_norm": 2.2211875915527344,
+ "learning_rate": 4.062626262626263e-06,
+ "loss": 1.6819908618927002,
+ "mean_token_accuracy": 0.6177943348884583,
+ "num_tokens": 7618560.0,
+ "step": 465
+ },
+ {
+ "entropy": 1.2239924669265747,
+ "epoch": 0.9414141414141414,
+ "grad_norm": 1.9997022151947021,
+ "learning_rate": 4.060606060606061e-06,
+ "loss": 1.2383348941802979,
+ "mean_token_accuracy": 0.6922325491905212,
+ "num_tokens": 7634944.0,
+ "step": 466
+ },
+ {
+ "entropy": 1.291772723197937,
+ "epoch": 0.9434343434343434,
+ "grad_norm": 2.0868117809295654,
+ "learning_rate": 4.058585858585859e-06,
+ "loss": 1.2879221439361572,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 7651328.0,
+ "step": 467
+ },
+ {
+ "entropy": 1.2860186100006104,
+ "epoch": 0.9454545454545454,
+ "grad_norm": 1.8586393594741821,
+ "learning_rate": 4.056565656565657e-06,
+ "loss": 1.2820203304290771,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 7667712.0,
+ "step": 468
+ },
+ {
+ "entropy": 1.860795259475708,
+ "epoch": 0.9474747474747475,
+ "grad_norm": 2.364405393600464,
+ "learning_rate": 4.054545454545455e-06,
+ "loss": 1.8880727291107178,
+ "mean_token_accuracy": 0.5821323990821838,
+ "num_tokens": 7684096.0,
+ "step": 469
+ },
+ {
+ "entropy": 1.6017589569091797,
+ "epoch": 0.9494949494949495,
+ "grad_norm": 2.023054599761963,
+ "learning_rate": 4.052525252525253e-06,
+ "loss": 1.5993852615356445,
+ "mean_token_accuracy": 0.6366634368896484,
+ "num_tokens": 7700480.0,
+ "step": 470
+ },
+ {
+ "entropy": 1.8498003482818604,
+ "epoch": 0.9515151515151515,
+ "grad_norm": 2.4474003314971924,
+ "learning_rate": 4.050505050505051e-06,
+ "loss": 1.868700623512268,
+ "mean_token_accuracy": 0.5826209187507629,
+ "num_tokens": 7716864.0,
+ "step": 471
+ },
+ {
+ "entropy": 1.5625540018081665,
+ "epoch": 0.9535353535353536,
+ "grad_norm": 2.1018362045288086,
+ "learning_rate": 4.048484848484849e-06,
+ "loss": 1.571077585220337,
+ "mean_token_accuracy": 0.6433805823326111,
+ "num_tokens": 7733248.0,
+ "step": 472
+ },
+ {
+ "entropy": 1.8534579277038574,
+ "epoch": 0.9555555555555556,
+ "grad_norm": 2.407588243484497,
+ "learning_rate": 4.046464646464647e-06,
+ "loss": 1.8789153099060059,
+ "mean_token_accuracy": 0.5859794616699219,
+ "num_tokens": 7749632.0,
+ "step": 473
+ },
+ {
+ "entropy": 1.3264559507369995,
+ "epoch": 0.9575757575757575,
+ "grad_norm": 2.007199764251709,
+ "learning_rate": 4.044444444444445e-06,
+ "loss": 1.3489338159561157,
+ "mean_token_accuracy": 0.6650586128234863,
+ "num_tokens": 7766016.0,
+ "step": 474
+ },
+ {
+ "entropy": 1.1361761093139648,
+ "epoch": 0.9595959595959596,
+ "grad_norm": 1.9226998090744019,
+ "learning_rate": 4.0424242424242425e-06,
+ "loss": 1.156738519668579,
+ "mean_token_accuracy": 0.7226428985595703,
+ "num_tokens": 7782400.0,
+ "step": 475
+ },
+ {
+ "entropy": 1.550872802734375,
+ "epoch": 0.9616161616161616,
+ "grad_norm": 2.0082473754882812,
+ "learning_rate": 4.04040404040404e-06,
+ "loss": 1.5657379627227783,
+ "mean_token_accuracy": 0.642953097820282,
+ "num_tokens": 7798784.0,
+ "step": 476
+ },
+ {
+ "entropy": 1.0122721195220947,
+ "epoch": 0.9636363636363636,
+ "grad_norm": 1.9946776628494263,
+ "learning_rate": 4.038383838383838e-06,
+ "loss": 1.0301119089126587,
+ "mean_token_accuracy": 0.7361993193626404,
+ "num_tokens": 7815168.0,
+ "step": 477
+ },
+ {
+ "entropy": 1.61614990234375,
+ "epoch": 0.9656565656565657,
+ "grad_norm": 2.5009427070617676,
+ "learning_rate": 4.036363636363637e-06,
+ "loss": 1.6194994449615479,
+ "mean_token_accuracy": 0.620175838470459,
+ "num_tokens": 7831552.0,
+ "step": 478
+ },
+ {
+ "entropy": 1.5723443031311035,
+ "epoch": 0.9676767676767677,
+ "grad_norm": 1.9101917743682861,
+ "learning_rate": 4.034343434343435e-06,
+ "loss": 1.5586073398590088,
+ "mean_token_accuracy": 0.6223741769790649,
+ "num_tokens": 7847936.0,
+ "step": 479
+ },
+ {
+ "entropy": 1.271834373474121,
+ "epoch": 0.9696969696969697,
+ "grad_norm": 1.768438458442688,
+ "learning_rate": 4.032323232323233e-06,
+ "loss": 1.2466087341308594,
+ "mean_token_accuracy": 0.692354679107666,
+ "num_tokens": 7864320.0,
+ "step": 480
+ },
+ {
+ "entropy": 1.4550020694732666,
+ "epoch": 0.9717171717171718,
+ "grad_norm": 1.9753917455673218,
+ "learning_rate": 4.030303030303031e-06,
+ "loss": 1.4689980745315552,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 7880704.0,
+ "step": 481
+ },
+ {
+ "entropy": 2.023750066757202,
+ "epoch": 0.9737373737373738,
+ "grad_norm": 2.3014674186706543,
+ "learning_rate": 4.0282828282828285e-06,
+ "loss": 2.0601019859313965,
+ "mean_token_accuracy": 0.5528212189674377,
+ "num_tokens": 7897088.0,
+ "step": 482
+ },
+ {
+ "entropy": 1.3225218057632446,
+ "epoch": 0.9757575757575757,
+ "grad_norm": 1.9937688112258911,
+ "learning_rate": 4.0262626262626264e-06,
+ "loss": 1.3186583518981934,
+ "mean_token_accuracy": 0.6751343607902527,
+ "num_tokens": 7913472.0,
+ "step": 483
+ },
+ {
+ "entropy": 1.4357911348342896,
+ "epoch": 0.9777777777777777,
+ "grad_norm": 1.9591492414474487,
+ "learning_rate": 4.024242424242424e-06,
+ "loss": 1.4157384634017944,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 7929856.0,
+ "step": 484
+ },
+ {
+ "entropy": 1.470274567604065,
+ "epoch": 0.9797979797979798,
+ "grad_norm": 1.9318779706954956,
+ "learning_rate": 4.022222222222222e-06,
+ "loss": 1.4754853248596191,
+ "mean_token_accuracy": 0.6497923731803894,
+ "num_tokens": 7946240.0,
+ "step": 485
+ },
+ {
+ "entropy": 1.345750331878662,
+ "epoch": 0.9818181818181818,
+ "grad_norm": 1.9079619646072388,
+ "learning_rate": 4.02020202020202e-06,
+ "loss": 1.336526870727539,
+ "mean_token_accuracy": 0.6800805926322937,
+ "num_tokens": 7962624.0,
+ "step": 486
+ },
+ {
+ "entropy": 1.4641839265823364,
+ "epoch": 0.9838383838383838,
+ "grad_norm": 1.8413265943527222,
+ "learning_rate": 4.018181818181818e-06,
+ "loss": 1.4556326866149902,
+ "mean_token_accuracy": 0.6591963768005371,
+ "num_tokens": 7979008.0,
+ "step": 487
+ },
+ {
+ "entropy": 1.7966911792755127,
+ "epoch": 0.9858585858585859,
+ "grad_norm": 2.138899564743042,
+ "learning_rate": 4.016161616161616e-06,
+ "loss": 1.822898507118225,
+ "mean_token_accuracy": 0.5959941148757935,
+ "num_tokens": 7995392.0,
+ "step": 488
+ },
+ {
+ "entropy": 1.4334503412246704,
+ "epoch": 0.9878787878787879,
+ "grad_norm": 2.206122636795044,
+ "learning_rate": 4.014141414141415e-06,
+ "loss": 1.4127681255340576,
+ "mean_token_accuracy": 0.6609672904014587,
+ "num_tokens": 8011776.0,
+ "step": 489
+ },
+ {
+ "entropy": 1.684112548828125,
+ "epoch": 0.98989898989899,
+ "grad_norm": 2.0637400150299072,
+ "learning_rate": 4.0121212121212125e-06,
+ "loss": 1.6790317296981812,
+ "mean_token_accuracy": 0.6159012913703918,
+ "num_tokens": 8028160.0,
+ "step": 490
+ },
+ {
+ "entropy": 2.0716898441314697,
+ "epoch": 0.9919191919191919,
+ "grad_norm": 3.3912627696990967,
+ "learning_rate": 4.01010101010101e-06,
+ "loss": 2.0814826488494873,
+ "mean_token_accuracy": 0.5522105693817139,
+ "num_tokens": 8044544.0,
+ "step": 491
+ },
+ {
+ "entropy": 1.8764609098434448,
+ "epoch": 0.9939393939393939,
+ "grad_norm": 2.00569748878479,
+ "learning_rate": 4.008080808080808e-06,
+ "loss": 1.9150068759918213,
+ "mean_token_accuracy": 0.5823766589164734,
+ "num_tokens": 8060928.0,
+ "step": 492
+ },
+ {
+ "entropy": 1.630242943763733,
+ "epoch": 0.9959595959595959,
+ "grad_norm": 2.0648858547210693,
+ "learning_rate": 4.006060606060607e-06,
+ "loss": 1.6354784965515137,
+ "mean_token_accuracy": 0.621213972568512,
+ "num_tokens": 8077312.0,
+ "step": 493
+ },
+ {
+ "entropy": 1.7174078226089478,
+ "epoch": 0.997979797979798,
+ "grad_norm": 2.1376583576202393,
+ "learning_rate": 4.004040404040405e-06,
+ "loss": 1.7092773914337158,
+ "mean_token_accuracy": 0.6129701733589172,
+ "num_tokens": 8093696.0,
+ "step": 494
+ },
+ {
+ "entropy": 1.2112717628479004,
+ "epoch": 1.0,
+ "grad_norm": 1.9164371490478516,
+ "learning_rate": 4.002020202020203e-06,
+ "loss": 1.2106354236602783,
+ "mean_token_accuracy": 0.7040180563926697,
+ "num_tokens": 8110080.0,
+ "step": 495
+ },
+ {
+ "entropy": 1.2168891429901123,
+ "epoch": 1.002020202020202,
+ "grad_norm": 1.9845075607299805,
+ "learning_rate": 4.000000000000001e-06,
+ "loss": 1.1398870944976807,
+ "mean_token_accuracy": 0.7053004503250122,
+ "num_tokens": 8126464.0,
+ "step": 496
+ },
+ {
+ "entropy": 1.4670923948287964,
+ "epoch": 1.004040404040404,
+ "grad_norm": 2.0864014625549316,
+ "learning_rate": 3.9979797979797986e-06,
+ "loss": 1.4241242408752441,
+ "mean_token_accuracy": 0.6605398058891296,
+ "num_tokens": 8142848.0,
+ "step": 497
+ },
+ {
+ "entropy": 1.560593843460083,
+ "epoch": 1.006060606060606,
+ "grad_norm": 1.8882137537002563,
+ "learning_rate": 3.9959595959595964e-06,
+ "loss": 1.5164835453033447,
+ "mean_token_accuracy": 0.6610894203186035,
+ "num_tokens": 8159232.0,
+ "step": 498
+ },
+ {
+ "entropy": 1.2573609352111816,
+ "epoch": 1.0080808080808081,
+ "grad_norm": 2.011486530303955,
+ "learning_rate": 3.993939393939394e-06,
+ "loss": 1.2119636535644531,
+ "mean_token_accuracy": 0.6832559704780579,
+ "num_tokens": 8175616.0,
+ "step": 499
+ },
+ {
+ "entropy": 1.6119122505187988,
+ "epoch": 1.0101010101010102,
+ "grad_norm": 2.0089032649993896,
+ "learning_rate": 3.991919191919192e-06,
+ "loss": 1.5869622230529785,
+ "mean_token_accuracy": 0.6301905512809753,
+ "num_tokens": 8192000.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.0101010101010102,
+ "eval_entropy": 1.4907484121860997,
+ "eval_loss": 1.5444872379302979,
+ "eval_mean_token_accuracy": 0.6426531960887294,
+ "eval_num_tokens": 8192000.0,
+ "eval_runtime": 43.729,
+ "eval_samples_per_second": 22.639,
+ "eval_steps_per_second": 2.836,
+ "step": 500
+ },
+ {
+ "entropy": 1.5645418167114258,
+ "epoch": 1.0121212121212122,
+ "grad_norm": 2.171133279800415,
+ "learning_rate": 3.98989898989899e-06,
+ "loss": 1.5252666473388672,
+ "mean_token_accuracy": 0.639594554901123,
+ "num_tokens": 8208384.0,
+ "step": 501
+ },
+ {
+ "entropy": 1.2985379695892334,
+ "epoch": 1.0141414141414142,
+ "grad_norm": 1.9075100421905518,
+ "learning_rate": 3.987878787878788e-06,
+ "loss": 1.2863168716430664,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 8224768.0,
+ "step": 502
+ },
+ {
+ "entropy": 1.4055086374282837,
+ "epoch": 1.0161616161616163,
+ "grad_norm": 1.8511557579040527,
+ "learning_rate": 3.985858585858587e-06,
+ "loss": 1.440205454826355,
+ "mean_token_accuracy": 0.6671348214149475,
+ "num_tokens": 8241152.0,
+ "step": 503
+ },
+ {
+ "entropy": 1.0818580389022827,
+ "epoch": 1.018181818181818,
+ "grad_norm": 1.8912067413330078,
+ "learning_rate": 3.983838383838385e-06,
+ "loss": 1.0614542961120605,
+ "mean_token_accuracy": 0.7345505356788635,
+ "num_tokens": 8257536.0,
+ "step": 504
+ },
+ {
+ "entropy": 0.9176992177963257,
+ "epoch": 1.02020202020202,
+ "grad_norm": 1.7737077474594116,
+ "learning_rate": 3.9818181818181825e-06,
+ "loss": 0.9281337261199951,
+ "mean_token_accuracy": 0.7594040036201477,
+ "num_tokens": 8273920.0,
+ "step": 505
+ },
+ {
+ "entropy": 1.8801840543746948,
+ "epoch": 1.0222222222222221,
+ "grad_norm": 2.191689968109131,
+ "learning_rate": 3.97979797979798e-06,
+ "loss": 1.9127342700958252,
+ "mean_token_accuracy": 0.5732169151306152,
+ "num_tokens": 8290304.0,
+ "step": 506
+ },
+ {
+ "entropy": 1.2336418628692627,
+ "epoch": 1.0242424242424242,
+ "grad_norm": 2.0369555950164795,
+ "learning_rate": 3.977777777777778e-06,
+ "loss": 1.2513363361358643,
+ "mean_token_accuracy": 0.6852100491523743,
+ "num_tokens": 8306688.0,
+ "step": 507
+ },
+ {
+ "entropy": 1.8379974365234375,
+ "epoch": 1.0262626262626262,
+ "grad_norm": 2.176361083984375,
+ "learning_rate": 3.975757575757576e-06,
+ "loss": 1.8472888469696045,
+ "mean_token_accuracy": 0.5863458514213562,
+ "num_tokens": 8323072.0,
+ "step": 508
+ },
+ {
+ "entropy": 1.4421337842941284,
+ "epoch": 1.0282828282828282,
+ "grad_norm": 2.305441379547119,
+ "learning_rate": 3.973737373737374e-06,
+ "loss": 1.4835591316223145,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 8339456.0,
+ "step": 509
+ },
+ {
+ "entropy": 1.535184621810913,
+ "epoch": 1.0303030303030303,
+ "grad_norm": 2.0329015254974365,
+ "learning_rate": 3.971717171717172e-06,
+ "loss": 1.547795057296753,
+ "mean_token_accuracy": 0.6268319487571716,
+ "num_tokens": 8355840.0,
+ "step": 510
+ },
+ {
+ "entropy": 1.295592188835144,
+ "epoch": 1.0323232323232323,
+ "grad_norm": 2.0321359634399414,
+ "learning_rate": 3.96969696969697e-06,
+ "loss": 1.2885974645614624,
+ "mean_token_accuracy": 0.681485116481781,
+ "num_tokens": 8372224.0,
+ "step": 511
+ },
+ {
+ "entropy": 1.345553994178772,
+ "epoch": 1.0343434343434343,
+ "grad_norm": 1.9151290655136108,
+ "learning_rate": 3.967676767676768e-06,
+ "loss": 1.3364320993423462,
+ "mean_token_accuracy": 0.6849657893180847,
+ "num_tokens": 8388608.0,
+ "step": 512
+ },
+ {
+ "entropy": 1.3150815963745117,
+ "epoch": 1.0363636363636364,
+ "grad_norm": 1.9379258155822754,
+ "learning_rate": 3.965656565656566e-06,
+ "loss": 1.317258596420288,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 8404992.0,
+ "step": 513
+ },
+ {
+ "entropy": 1.46832275390625,
+ "epoch": 1.0383838383838384,
+ "grad_norm": 2.1009161472320557,
+ "learning_rate": 3.963636363636364e-06,
+ "loss": 1.4794366359710693,
+ "mean_token_accuracy": 0.6513800621032715,
+ "num_tokens": 8421376.0,
+ "step": 514
+ },
+ {
+ "entropy": 1.389290452003479,
+ "epoch": 1.0404040404040404,
+ "grad_norm": 1.8813941478729248,
+ "learning_rate": 3.961616161616162e-06,
+ "loss": 1.3930776119232178,
+ "mean_token_accuracy": 0.6799584627151489,
+ "num_tokens": 8437760.0,
+ "step": 515
+ },
+ {
+ "entropy": 1.2919796705245972,
+ "epoch": 1.0424242424242425,
+ "grad_norm": 2.0765745639801025,
+ "learning_rate": 3.95959595959596e-06,
+ "loss": 1.2943801879882812,
+ "mean_token_accuracy": 0.6929653286933899,
+ "num_tokens": 8454144.0,
+ "step": 516
+ },
+ {
+ "entropy": 1.172440767288208,
+ "epoch": 1.0444444444444445,
+ "grad_norm": 2.126800298690796,
+ "learning_rate": 3.957575757575758e-06,
+ "loss": 1.1923961639404297,
+ "mean_token_accuracy": 0.7098192572593689,
+ "num_tokens": 8470528.0,
+ "step": 517
+ },
+ {
+ "entropy": 1.8239458799362183,
+ "epoch": 1.0464646464646465,
+ "grad_norm": 1.96744966506958,
+ "learning_rate": 3.955555555555556e-06,
+ "loss": 1.840916633605957,
+ "mean_token_accuracy": 0.6033830046653748,
+ "num_tokens": 8486912.0,
+ "step": 518
+ },
+ {
+ "entropy": 1.4117076396942139,
+ "epoch": 1.0484848484848486,
+ "grad_norm": 2.0560126304626465,
+ "learning_rate": 3.953535353535354e-06,
+ "loss": 1.421530842781067,
+ "mean_token_accuracy": 0.6581583023071289,
+ "num_tokens": 8503296.0,
+ "step": 519
+ },
+ {
+ "entropy": 1.7085175514221191,
+ "epoch": 1.0505050505050506,
+ "grad_norm": 2.1386539936065674,
+ "learning_rate": 3.951515151515152e-06,
+ "loss": 1.7334365844726562,
+ "mean_token_accuracy": 0.6282975077629089,
+ "num_tokens": 8519680.0,
+ "step": 520
+ },
+ {
+ "entropy": 1.0607928037643433,
+ "epoch": 1.0525252525252524,
+ "grad_norm": 1.981020212173462,
+ "learning_rate": 3.9494949494949496e-06,
+ "loss": 1.0639690160751343,
+ "mean_token_accuracy": 0.722337543964386,
+ "num_tokens": 8536064.0,
+ "step": 521
+ },
+ {
+ "entropy": 1.2227518558502197,
+ "epoch": 1.0545454545454545,
+ "grad_norm": 1.9116015434265137,
+ "learning_rate": 3.9474747474747474e-06,
+ "loss": 1.2139748334884644,
+ "mean_token_accuracy": 0.704384446144104,
+ "num_tokens": 8552448.0,
+ "step": 522
+ },
+ {
+ "entropy": 1.2655551433563232,
+ "epoch": 1.0565656565656565,
+ "grad_norm": 2.176706075668335,
+ "learning_rate": 3.945454545454545e-06,
+ "loss": 1.2869982719421387,
+ "mean_token_accuracy": 0.678798258304596,
+ "num_tokens": 8568832.0,
+ "step": 523
+ },
+ {
+ "entropy": 1.436476707458496,
+ "epoch": 1.0585858585858585,
+ "grad_norm": 2.034846544265747,
+ "learning_rate": 3.943434343434343e-06,
+ "loss": 1.431445837020874,
+ "mean_token_accuracy": 0.6650586128234863,
+ "num_tokens": 8585216.0,
+ "step": 524
+ },
+ {
+ "entropy": 1.4563549757003784,
+ "epoch": 1.0606060606060606,
+ "grad_norm": 2.0301241874694824,
+ "learning_rate": 3.941414141414142e-06,
+ "loss": 1.468353033065796,
+ "mean_token_accuracy": 0.6550439596176147,
+ "num_tokens": 8601600.0,
+ "step": 525
+ },
+ {
+ "entropy": 1.4636993408203125,
+ "epoch": 1.0626262626262626,
+ "grad_norm": 2.092679023742676,
+ "learning_rate": 3.93939393939394e-06,
+ "loss": 1.4488987922668457,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 8617984.0,
+ "step": 526
+ },
+ {
+ "entropy": 1.1217654943466187,
+ "epoch": 1.0646464646464646,
+ "grad_norm": 1.953627347946167,
+ "learning_rate": 3.937373737373738e-06,
+ "loss": 1.1403257846832275,
+ "mean_token_accuracy": 0.7172080874443054,
+ "num_tokens": 8634368.0,
+ "step": 527
+ },
+ {
+ "entropy": 1.7785910367965698,
+ "epoch": 1.0666666666666667,
+ "grad_norm": 1.8496789932250977,
+ "learning_rate": 3.935353535353536e-06,
+ "loss": 1.7961615324020386,
+ "mean_token_accuracy": 0.6036272644996643,
+ "num_tokens": 8650752.0,
+ "step": 528
+ },
+ {
+ "entropy": 1.0998575687408447,
+ "epoch": 1.0686868686868687,
+ "grad_norm": 1.8732962608337402,
+ "learning_rate": 3.9333333333333335e-06,
+ "loss": 1.0960031747817993,
+ "mean_token_accuracy": 0.7223986387252808,
+ "num_tokens": 8667136.0,
+ "step": 529
+ },
+ {
+ "entropy": 1.6707724332809448,
+ "epoch": 1.0707070707070707,
+ "grad_norm": 2.220453977584839,
+ "learning_rate": 3.931313131313131e-06,
+ "loss": 1.6837453842163086,
+ "mean_token_accuracy": 0.6148021221160889,
+ "num_tokens": 8683520.0,
+ "step": 530
+ },
+ {
+ "entropy": 1.6108022928237915,
+ "epoch": 1.0727272727272728,
+ "grad_norm": 2.2464118003845215,
+ "learning_rate": 3.929292929292929e-06,
+ "loss": 1.633517861366272,
+ "mean_token_accuracy": 0.6195651888847351,
+ "num_tokens": 8699904.0,
+ "step": 531
+ },
+ {
+ "entropy": 1.1888173818588257,
+ "epoch": 1.0747474747474748,
+ "grad_norm": 1.8803986310958862,
+ "learning_rate": 3.927272727272727e-06,
+ "loss": 1.1904420852661133,
+ "mean_token_accuracy": 0.7134220600128174,
+ "num_tokens": 8716288.0,
+ "step": 532
+ },
+ {
+ "entropy": 1.0656445026397705,
+ "epoch": 1.0767676767676768,
+ "grad_norm": 2.038243532180786,
+ "learning_rate": 3.925252525252525e-06,
+ "loss": 1.0505216121673584,
+ "mean_token_accuracy": 0.7284440398216248,
+ "num_tokens": 8732672.0,
+ "step": 533
+ },
+ {
+ "entropy": 1.1473655700683594,
+ "epoch": 1.0787878787878789,
+ "grad_norm": 1.981107234954834,
+ "learning_rate": 3.923232323232323e-06,
+ "loss": 1.136179804801941,
+ "mean_token_accuracy": 0.7085368633270264,
+ "num_tokens": 8749056.0,
+ "step": 534
+ },
+ {
+ "entropy": 1.340027928352356,
+ "epoch": 1.0808080808080809,
+ "grad_norm": 2.2797436714172363,
+ "learning_rate": 3.921212121212122e-06,
+ "loss": 1.334214210510254,
+ "mean_token_accuracy": 0.6749511361122131,
+ "num_tokens": 8765440.0,
+ "step": 535
+ },
+ {
+ "entropy": 1.1464864015579224,
+ "epoch": 1.082828282828283,
+ "grad_norm": 1.9428092241287231,
+ "learning_rate": 3.9191919191919196e-06,
+ "loss": 1.1649314165115356,
+ "mean_token_accuracy": 0.72013920545578,
+ "num_tokens": 8781824.0,
+ "step": 536
+ },
+ {
+ "entropy": 1.784925103187561,
+ "epoch": 1.084848484848485,
+ "grad_norm": 2.157468795776367,
+ "learning_rate": 3.9171717171717175e-06,
+ "loss": 1.7725508213043213,
+ "mean_token_accuracy": 0.6014899611473083,
+ "num_tokens": 8798208.0,
+ "step": 537
+ },
+ {
+ "entropy": 1.362166166305542,
+ "epoch": 1.0868686868686868,
+ "grad_norm": 2.109646797180176,
+ "learning_rate": 3.915151515151515e-06,
+ "loss": 1.331969976425171,
+ "mean_token_accuracy": 0.6720200181007385,
+ "num_tokens": 8814592.0,
+ "step": 538
+ },
+ {
+ "entropy": 1.5614176988601685,
+ "epoch": 1.0888888888888888,
+ "grad_norm": 2.1047098636627197,
+ "learning_rate": 3.913131313131314e-06,
+ "loss": 1.534292459487915,
+ "mean_token_accuracy": 0.6446629166603088,
+ "num_tokens": 8830976.0,
+ "step": 539
+ },
+ {
+ "entropy": 1.5551490783691406,
+ "epoch": 1.0909090909090908,
+ "grad_norm": 2.10304594039917,
+ "learning_rate": 3.911111111111112e-06,
+ "loss": 1.5706363916397095,
+ "mean_token_accuracy": 0.6322056651115417,
+ "num_tokens": 8847360.0,
+ "step": 540
+ },
+ {
+ "entropy": 1.7433172464370728,
+ "epoch": 1.0929292929292929,
+ "grad_norm": 1.8621257543563843,
+ "learning_rate": 3.90909090909091e-06,
+ "loss": 1.7367552518844604,
+ "mean_token_accuracy": 0.6162066459655762,
+ "num_tokens": 8863744.0,
+ "step": 541
+ },
+ {
+ "entropy": 1.4073128700256348,
+ "epoch": 1.094949494949495,
+ "grad_norm": 1.939588189125061,
+ "learning_rate": 3.907070707070708e-06,
+ "loss": 1.3844857215881348,
+ "mean_token_accuracy": 0.6634709239006042,
+ "num_tokens": 8880128.0,
+ "step": 542
+ },
+ {
+ "entropy": 1.479836344718933,
+ "epoch": 1.096969696969697,
+ "grad_norm": 2.06921648979187,
+ "learning_rate": 3.905050505050506e-06,
+ "loss": 1.4933744668960571,
+ "mean_token_accuracy": 0.6510136723518372,
+ "num_tokens": 8896512.0,
+ "step": 543
+ },
+ {
+ "entropy": 1.3934576511383057,
+ "epoch": 1.098989898989899,
+ "grad_norm": 2.0697920322418213,
+ "learning_rate": 3.9030303030303035e-06,
+ "loss": 1.3886666297912598,
+ "mean_token_accuracy": 0.6775158643722534,
+ "num_tokens": 8912896.0,
+ "step": 544
+ },
+ {
+ "entropy": 1.5223709344863892,
+ "epoch": 1.101010101010101,
+ "grad_norm": 2.1627066135406494,
+ "learning_rate": 3.901010101010101e-06,
+ "loss": 1.5601061582565308,
+ "mean_token_accuracy": 0.6392892003059387,
+ "num_tokens": 8929280.0,
+ "step": 545
+ },
+ {
+ "entropy": 1.4462933540344238,
+ "epoch": 1.103030303030303,
+ "grad_norm": 1.9871046543121338,
+ "learning_rate": 3.898989898989899e-06,
+ "loss": 1.463792085647583,
+ "mean_token_accuracy": 0.6518075466156006,
+ "num_tokens": 8945664.0,
+ "step": 546
+ },
+ {
+ "entropy": 1.325921654701233,
+ "epoch": 1.105050505050505,
+ "grad_norm": 1.9081087112426758,
+ "learning_rate": 3.896969696969697e-06,
+ "loss": 1.3303362131118774,
+ "mean_token_accuracy": 0.7009648084640503,
+ "num_tokens": 8962048.0,
+ "step": 547
+ },
+ {
+ "entropy": 1.415048360824585,
+ "epoch": 1.107070707070707,
+ "grad_norm": 2.3306756019592285,
+ "learning_rate": 3.894949494949495e-06,
+ "loss": 1.4139145612716675,
+ "mean_token_accuracy": 0.6849047541618347,
+ "num_tokens": 8978432.0,
+ "step": 548
+ },
+ {
+ "entropy": 1.5863295793533325,
+ "epoch": 1.1090909090909091,
+ "grad_norm": 1.993159294128418,
+ "learning_rate": 3.892929292929293e-06,
+ "loss": 1.6010534763336182,
+ "mean_token_accuracy": 0.6424035429954529,
+ "num_tokens": 8994816.0,
+ "step": 549
+ },
+ {
+ "entropy": 1.5526721477508545,
+ "epoch": 1.1111111111111112,
+ "grad_norm": 2.0528876781463623,
+ "learning_rate": 3.890909090909092e-06,
+ "loss": 1.5465538501739502,
+ "mean_token_accuracy": 0.659807026386261,
+ "num_tokens": 9011200.0,
+ "step": 550
+ },
+ {
+ "epoch": 1.1111111111111112,
+ "eval_entropy": 1.4479231247978825,
+ "eval_loss": 1.5459802150726318,
+ "eval_mean_token_accuracy": 0.6425906530311031,
+ "eval_num_tokens": 9011200.0,
+ "eval_runtime": 43.7828,
+ "eval_samples_per_second": 22.612,
+ "eval_steps_per_second": 2.832,
+ "step": 550
+ },
+ {
+ "entropy": 1.4322376251220703,
+ "epoch": 1.1131313131313132,
+ "grad_norm": 1.933549404144287,
+ "learning_rate": 3.88888888888889e-06,
+ "loss": 1.4371025562286377,
+ "mean_token_accuracy": 0.670676589012146,
+ "num_tokens": 9027584.0,
+ "step": 551
+ },
+ {
+ "entropy": 1.5050671100616455,
+ "epoch": 1.1151515151515152,
+ "grad_norm": 1.9736099243164062,
+ "learning_rate": 3.8868686868686875e-06,
+ "loss": 1.5362370014190674,
+ "mean_token_accuracy": 0.651624321937561,
+ "num_tokens": 9043968.0,
+ "step": 552
+ },
+ {
+ "entropy": 1.4335887432098389,
+ "epoch": 1.1171717171717173,
+ "grad_norm": 1.8896421194076538,
+ "learning_rate": 3.884848484848485e-06,
+ "loss": 1.4439888000488281,
+ "mean_token_accuracy": 0.670615553855896,
+ "num_tokens": 9060352.0,
+ "step": 553
+ },
+ {
+ "entropy": 1.5979355573654175,
+ "epoch": 1.1191919191919193,
+ "grad_norm": 2.1710526943206787,
+ "learning_rate": 3.882828282828283e-06,
+ "loss": 1.629098653793335,
+ "mean_token_accuracy": 0.6226184368133545,
+ "num_tokens": 9076736.0,
+ "step": 554
+ },
+ {
+ "entropy": 1.2901698350906372,
+ "epoch": 1.121212121212121,
+ "grad_norm": 2.129443407058716,
+ "learning_rate": 3.880808080808081e-06,
+ "loss": 1.2824913263320923,
+ "mean_token_accuracy": 0.6816682815551758,
+ "num_tokens": 9093120.0,
+ "step": 555
+ },
+ {
+ "entropy": 1.403212308883667,
+ "epoch": 1.1232323232323231,
+ "grad_norm": 1.883240818977356,
+ "learning_rate": 3.878787878787879e-06,
+ "loss": 1.3960213661193848,
+ "mean_token_accuracy": 0.6651197075843811,
+ "num_tokens": 9109504.0,
+ "step": 556
+ },
+ {
+ "entropy": 1.3959479331970215,
+ "epoch": 1.1252525252525252,
+ "grad_norm": 2.1145691871643066,
+ "learning_rate": 3.876767676767677e-06,
+ "loss": 1.4046590328216553,
+ "mean_token_accuracy": 0.6607230305671692,
+ "num_tokens": 9125888.0,
+ "step": 557
+ },
+ {
+ "entropy": 1.0899873971939087,
+ "epoch": 1.1272727272727272,
+ "grad_norm": 1.8862192630767822,
+ "learning_rate": 3.874747474747475e-06,
+ "loss": 1.0965509414672852,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 9142272.0,
+ "step": 558
+ },
+ {
+ "entropy": 1.0380184650421143,
+ "epoch": 1.1292929292929292,
+ "grad_norm": 1.946702241897583,
+ "learning_rate": 3.872727272727273e-06,
+ "loss": 1.0539875030517578,
+ "mean_token_accuracy": 0.7423058152198792,
+ "num_tokens": 9158656.0,
+ "step": 559
+ },
+ {
+ "entropy": 1.1173628568649292,
+ "epoch": 1.1313131313131313,
+ "grad_norm": 2.002847909927368,
+ "learning_rate": 3.8707070707070706e-06,
+ "loss": 1.128816843032837,
+ "mean_token_accuracy": 0.7112848162651062,
+ "num_tokens": 9175040.0,
+ "step": 560
+ },
+ {
+ "entropy": 1.6536206007003784,
+ "epoch": 1.1333333333333333,
+ "grad_norm": 2.212761640548706,
+ "learning_rate": 3.868686868686869e-06,
+ "loss": 1.6286437511444092,
+ "mean_token_accuracy": 0.6277479529380798,
+ "num_tokens": 9191424.0,
+ "step": 561
+ },
+ {
+ "entropy": 1.7187970876693726,
+ "epoch": 1.1353535353535353,
+ "grad_norm": 2.207310199737549,
+ "learning_rate": 3.866666666666667e-06,
+ "loss": 1.7072829008102417,
+ "mean_token_accuracy": 0.6180996298789978,
+ "num_tokens": 9207808.0,
+ "step": 562
+ },
+ {
+ "entropy": 1.7057682275772095,
+ "epoch": 1.1373737373737374,
+ "grad_norm": 2.1582961082458496,
+ "learning_rate": 3.864646464646465e-06,
+ "loss": 1.7216498851776123,
+ "mean_token_accuracy": 0.6105886697769165,
+ "num_tokens": 9224192.0,
+ "step": 563
+ },
+ {
+ "entropy": 1.8016951084136963,
+ "epoch": 1.1393939393939394,
+ "grad_norm": 2.035249948501587,
+ "learning_rate": 3.862626262626263e-06,
+ "loss": 1.8101240396499634,
+ "mean_token_accuracy": 0.6199315786361694,
+ "num_tokens": 9240576.0,
+ "step": 564
+ },
+ {
+ "entropy": 1.094889760017395,
+ "epoch": 1.1414141414141414,
+ "grad_norm": 2.119861364364624,
+ "learning_rate": 3.860606060606061e-06,
+ "loss": 1.0990344285964966,
+ "mean_token_accuracy": 0.7071323990821838,
+ "num_tokens": 9256960.0,
+ "step": 565
+ },
+ {
+ "entropy": 1.537480115890503,
+ "epoch": 1.1434343434343435,
+ "grad_norm": 2.167386770248413,
+ "learning_rate": 3.858585858585859e-06,
+ "loss": 1.5262541770935059,
+ "mean_token_accuracy": 0.6343429684638977,
+ "num_tokens": 9273344.0,
+ "step": 566
+ },
+ {
+ "entropy": 1.2940728664398193,
+ "epoch": 1.1454545454545455,
+ "grad_norm": 1.941097617149353,
+ "learning_rate": 3.856565656565657e-06,
+ "loss": 1.3145123720169067,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 9289728.0,
+ "step": 567
+ },
+ {
+ "entropy": 1.3154000043869019,
+ "epoch": 1.1474747474747475,
+ "grad_norm": 2.088576078414917,
+ "learning_rate": 3.8545454545454545e-06,
+ "loss": 1.3154902458190918,
+ "mean_token_accuracy": 0.6703101992607117,
+ "num_tokens": 9306112.0,
+ "step": 568
+ },
+ {
+ "entropy": 1.3576427698135376,
+ "epoch": 1.1494949494949496,
+ "grad_norm": 1.9895246028900146,
+ "learning_rate": 3.852525252525252e-06,
+ "loss": 1.3295378684997559,
+ "mean_token_accuracy": 0.6762335300445557,
+ "num_tokens": 9322496.0,
+ "step": 569
+ },
+ {
+ "entropy": 1.6067878007888794,
+ "epoch": 1.1515151515151516,
+ "grad_norm": 2.021191358566284,
+ "learning_rate": 3.85050505050505e-06,
+ "loss": 1.6273870468139648,
+ "mean_token_accuracy": 0.6329995393753052,
+ "num_tokens": 9338880.0,
+ "step": 570
+ },
+ {
+ "entropy": 1.4831246137619019,
+ "epoch": 1.1535353535353536,
+ "grad_norm": 2.114612340927124,
+ "learning_rate": 3.848484848484848e-06,
+ "loss": 1.4925904273986816,
+ "mean_token_accuracy": 0.6566316485404968,
+ "num_tokens": 9355264.0,
+ "step": 571
+ },
+ {
+ "entropy": 1.4476258754730225,
+ "epoch": 1.1555555555555554,
+ "grad_norm": 2.3435230255126953,
+ "learning_rate": 3.846464646464647e-06,
+ "loss": 1.438629388809204,
+ "mean_token_accuracy": 0.656020998954773,
+ "num_tokens": 9371648.0,
+ "step": 572
+ },
+ {
+ "entropy": 1.7930315732955933,
+ "epoch": 1.1575757575757575,
+ "grad_norm": 2.1700010299682617,
+ "learning_rate": 3.844444444444445e-06,
+ "loss": 1.786928653717041,
+ "mean_token_accuracy": 0.6028333902359009,
+ "num_tokens": 9388032.0,
+ "step": 573
+ },
+ {
+ "entropy": 1.3800512552261353,
+ "epoch": 1.1595959595959595,
+ "grad_norm": 2.2036688327789307,
+ "learning_rate": 3.842424242424243e-06,
+ "loss": 1.3767224550247192,
+ "mean_token_accuracy": 0.6692110300064087,
+ "num_tokens": 9404416.0,
+ "step": 574
+ },
+ {
+ "entropy": 0.8562329411506653,
+ "epoch": 1.1616161616161615,
+ "grad_norm": 1.765388011932373,
+ "learning_rate": 3.840404040404041e-06,
+ "loss": 0.8366047143936157,
+ "mean_token_accuracy": 0.783707857131958,
+ "num_tokens": 9420800.0,
+ "step": 575
+ },
+ {
+ "entropy": 1.4267486333847046,
+ "epoch": 1.1636363636363636,
+ "grad_norm": 2.0768239498138428,
+ "learning_rate": 3.8383838383838385e-06,
+ "loss": 1.4165449142456055,
+ "mean_token_accuracy": 0.656020998954773,
+ "num_tokens": 9437184.0,
+ "step": 576
+ },
+ {
+ "entropy": 1.4123388528823853,
+ "epoch": 1.1656565656565656,
+ "grad_norm": 2.028716802597046,
+ "learning_rate": 3.836363636363636e-06,
+ "loss": 1.420403003692627,
+ "mean_token_accuracy": 0.6729360222816467,
+ "num_tokens": 9453568.0,
+ "step": 577
+ },
+ {
+ "entropy": 1.1549286842346191,
+ "epoch": 1.1676767676767676,
+ "grad_norm": 2.1142919063568115,
+ "learning_rate": 3.834343434343435e-06,
+ "loss": 1.1487064361572266,
+ "mean_token_accuracy": 0.7040180563926697,
+ "num_tokens": 9469952.0,
+ "step": 578
+ },
+ {
+ "entropy": 1.4779953956604004,
+ "epoch": 1.1696969696969697,
+ "grad_norm": 2.166046142578125,
+ "learning_rate": 3.832323232323233e-06,
+ "loss": 1.4788683652877808,
+ "mean_token_accuracy": 0.6436858773231506,
+ "num_tokens": 9486336.0,
+ "step": 579
+ },
+ {
+ "entropy": 1.568039059638977,
+ "epoch": 1.1717171717171717,
+ "grad_norm": 2.067704200744629,
+ "learning_rate": 3.830303030303031e-06,
+ "loss": 1.5830929279327393,
+ "mean_token_accuracy": 0.6461895704269409,
+ "num_tokens": 9502720.0,
+ "step": 580
+ },
+ {
+ "entropy": 1.1785298585891724,
+ "epoch": 1.1737373737373737,
+ "grad_norm": 1.9789953231811523,
+ "learning_rate": 3.828282828282829e-06,
+ "loss": 1.2083481550216675,
+ "mean_token_accuracy": 0.7120786309242249,
+ "num_tokens": 9519104.0,
+ "step": 581
+ },
+ {
+ "entropy": 1.3783847093582153,
+ "epoch": 1.1757575757575758,
+ "grad_norm": 2.1503992080688477,
+ "learning_rate": 3.826262626262627e-06,
+ "loss": 1.3721052408218384,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 9535488.0,
+ "step": 582
+ },
+ {
+ "entropy": 1.120093584060669,
+ "epoch": 1.1777777777777778,
+ "grad_norm": 1.9822942018508911,
+ "learning_rate": 3.8242424242424245e-06,
+ "loss": 1.1215628385543823,
+ "mean_token_accuracy": 0.7122618556022644,
+ "num_tokens": 9551872.0,
+ "step": 583
+ },
+ {
+ "entropy": 1.4621506929397583,
+ "epoch": 1.1797979797979798,
+ "grad_norm": 2.159489631652832,
+ "learning_rate": 3.8222222222222224e-06,
+ "loss": 1.4614722728729248,
+ "mean_token_accuracy": 0.6535173654556274,
+ "num_tokens": 9568256.0,
+ "step": 584
+ },
+ {
+ "entropy": 1.015797734260559,
+ "epoch": 1.1818181818181819,
+ "grad_norm": 1.846848726272583,
+ "learning_rate": 3.82020202020202e-06,
+ "loss": 1.0082862377166748,
+ "mean_token_accuracy": 0.7394968271255493,
+ "num_tokens": 9584640.0,
+ "step": 585
+ },
+ {
+ "entropy": 1.364890217781067,
+ "epoch": 1.183838383838384,
+ "grad_norm": 2.175546646118164,
+ "learning_rate": 3.818181818181819e-06,
+ "loss": 1.3496818542480469,
+ "mean_token_accuracy": 0.6665241718292236,
+ "num_tokens": 9601024.0,
+ "step": 586
+ },
+ {
+ "entropy": 1.6056870222091675,
+ "epoch": 1.185858585858586,
+ "grad_norm": 2.1069748401641846,
+ "learning_rate": 3.816161616161617e-06,
+ "loss": 1.6048622131347656,
+ "mean_token_accuracy": 0.642892062664032,
+ "num_tokens": 9617408.0,
+ "step": 587
+ },
+ {
+ "entropy": 1.415107250213623,
+ "epoch": 1.187878787878788,
+ "grad_norm": 2.184544324874878,
+ "learning_rate": 3.8141414141414144e-06,
+ "loss": 1.4305826425552368,
+ "mean_token_accuracy": 0.6619443297386169,
+ "num_tokens": 9633792.0,
+ "step": 588
+ },
+ {
+ "entropy": 1.6554296016693115,
+ "epoch": 1.1898989898989898,
+ "grad_norm": 2.109793186187744,
+ "learning_rate": 3.8121212121212127e-06,
+ "loss": 1.6850776672363281,
+ "mean_token_accuracy": 0.6116267442703247,
+ "num_tokens": 9650176.0,
+ "step": 589
+ },
+ {
+ "entropy": 1.681472659111023,
+ "epoch": 1.1919191919191918,
+ "grad_norm": 2.3179714679718018,
+ "learning_rate": 3.8101010101010106e-06,
+ "loss": 1.699328064918518,
+ "mean_token_accuracy": 0.6105275750160217,
+ "num_tokens": 9666560.0,
+ "step": 590
+ },
+ {
+ "entropy": 1.113366961479187,
+ "epoch": 1.1939393939393939,
+ "grad_norm": 1.9885324239730835,
+ "learning_rate": 3.8080808080808085e-06,
+ "loss": 1.1357836723327637,
+ "mean_token_accuracy": 0.7157425284385681,
+ "num_tokens": 9682944.0,
+ "step": 591
+ },
+ {
+ "entropy": 1.1010088920593262,
+ "epoch": 1.195959595959596,
+ "grad_norm": 1.9745922088623047,
+ "learning_rate": 3.8060606060606064e-06,
+ "loss": 1.094293475151062,
+ "mean_token_accuracy": 0.7214215993881226,
+ "num_tokens": 9699328.0,
+ "step": 592
+ },
+ {
+ "entropy": 1.562911033630371,
+ "epoch": 1.197979797979798,
+ "grad_norm": 2.0526134967803955,
+ "learning_rate": 3.8040404040404043e-06,
+ "loss": 1.5747783184051514,
+ "mean_token_accuracy": 0.6342818737030029,
+ "num_tokens": 9715712.0,
+ "step": 593
+ },
+ {
+ "entropy": 1.6541608572006226,
+ "epoch": 1.2,
+ "grad_norm": 2.1268227100372314,
+ "learning_rate": 3.8020202020202026e-06,
+ "loss": 1.696983814239502,
+ "mean_token_accuracy": 0.6127259135246277,
+ "num_tokens": 9732096.0,
+ "step": 594
+ },
+ {
+ "entropy": 1.5259482860565186,
+ "epoch": 1.202020202020202,
+ "grad_norm": 2.240692377090454,
+ "learning_rate": 3.8000000000000005e-06,
+ "loss": 1.5582221746444702,
+ "mean_token_accuracy": 0.644052267074585,
+ "num_tokens": 9748480.0,
+ "step": 595
+ },
+ {
+ "entropy": 1.455372929573059,
+ "epoch": 1.204040404040404,
+ "grad_norm": 2.0934698581695557,
+ "learning_rate": 3.7979797979797984e-06,
+ "loss": 1.464172124862671,
+ "mean_token_accuracy": 0.6555935740470886,
+ "num_tokens": 9764864.0,
+ "step": 596
+ },
+ {
+ "entropy": 1.5074836015701294,
+ "epoch": 1.206060606060606,
+ "grad_norm": 1.9779568910598755,
+ "learning_rate": 3.7959595959595962e-06,
+ "loss": 1.5280466079711914,
+ "mean_token_accuracy": 0.6460063457489014,
+ "num_tokens": 9781248.0,
+ "step": 597
+ },
+ {
+ "entropy": 1.3286548852920532,
+ "epoch": 1.208080808080808,
+ "grad_norm": 1.9357717037200928,
+ "learning_rate": 3.793939393939394e-06,
+ "loss": 1.3448848724365234,
+ "mean_token_accuracy": 0.6816072463989258,
+ "num_tokens": 9797632.0,
+ "step": 598
+ },
+ {
+ "entropy": 1.5161375999450684,
+ "epoch": 1.2101010101010101,
+ "grad_norm": 2.224217414855957,
+ "learning_rate": 3.791919191919192e-06,
+ "loss": 1.5168235301971436,
+ "mean_token_accuracy": 0.6453346610069275,
+ "num_tokens": 9814016.0,
+ "step": 599
+ },
+ {
+ "entropy": 1.3337587118148804,
+ "epoch": 1.2121212121212122,
+ "grad_norm": 1.9308290481567383,
+ "learning_rate": 3.7898989898989903e-06,
+ "loss": 1.3429791927337646,
+ "mean_token_accuracy": 0.6827064156532288,
+ "num_tokens": 9830400.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.2121212121212122,
+ "eval_entropy": 1.4592116455877981,
+ "eval_loss": 1.5424447059631348,
+ "eval_mean_token_accuracy": 0.6431668299821115,
+ "eval_num_tokens": 9830400.0,
+ "eval_runtime": 43.8289,
+ "eval_samples_per_second": 22.588,
+ "eval_steps_per_second": 2.829,
+ "step": 600
+ },
+ {
+ "entropy": 1.6697322130203247,
+ "epoch": 1.2141414141414142,
+ "grad_norm": 1.9462894201278687,
+ "learning_rate": 3.7878787878787882e-06,
+ "loss": 1.6434354782104492,
+ "mean_token_accuracy": 0.635808527469635,
+ "num_tokens": 9846784.0,
+ "step": 601
+ },
+ {
+ "entropy": 1.427184820175171,
+ "epoch": 1.2161616161616162,
+ "grad_norm": 2.196017026901245,
+ "learning_rate": 3.785858585858586e-06,
+ "loss": 1.4024749994277954,
+ "mean_token_accuracy": 0.6720200181007385,
+ "num_tokens": 9863168.0,
+ "step": 602
+ },
+ {
+ "entropy": 1.4623222351074219,
+ "epoch": 1.2181818181818183,
+ "grad_norm": 2.160585403442383,
+ "learning_rate": 3.783838383838384e-06,
+ "loss": 1.4455416202545166,
+ "mean_token_accuracy": 0.6557767391204834,
+ "num_tokens": 9879552.0,
+ "step": 603
+ },
+ {
+ "entropy": 1.348331093788147,
+ "epoch": 1.2202020202020203,
+ "grad_norm": 2.079458713531494,
+ "learning_rate": 3.781818181818182e-06,
+ "loss": 1.3672473430633545,
+ "mean_token_accuracy": 0.6834391951560974,
+ "num_tokens": 9895936.0,
+ "step": 604
+ },
+ {
+ "entropy": 1.362277865409851,
+ "epoch": 1.2222222222222223,
+ "grad_norm": 2.10718035697937,
+ "learning_rate": 3.77979797979798e-06,
+ "loss": 1.3567216396331787,
+ "mean_token_accuracy": 0.6659135222434998,
+ "num_tokens": 9912320.0,
+ "step": 605
+ },
+ {
+ "entropy": 1.2743226289749146,
+ "epoch": 1.2242424242424241,
+ "grad_norm": 2.116549491882324,
+ "learning_rate": 3.777777777777778e-06,
+ "loss": 1.303470253944397,
+ "mean_token_accuracy": 0.6791035532951355,
+ "num_tokens": 9928704.0,
+ "step": 606
+ },
+ {
+ "entropy": 1.079649567604065,
+ "epoch": 1.2262626262626264,
+ "grad_norm": 1.8429855108261108,
+ "learning_rate": 3.775757575757576e-06,
+ "loss": 1.0616915225982666,
+ "mean_token_accuracy": 0.7321690320968628,
+ "num_tokens": 9945088.0,
+ "step": 607
+ },
+ {
+ "entropy": 1.363136649131775,
+ "epoch": 1.2282828282828282,
+ "grad_norm": 2.171295166015625,
+ "learning_rate": 3.773737373737374e-06,
+ "loss": 1.3525331020355225,
+ "mean_token_accuracy": 0.6732413172721863,
+ "num_tokens": 9961472.0,
+ "step": 608
+ },
+ {
+ "entropy": 1.324924349784851,
+ "epoch": 1.2303030303030302,
+ "grad_norm": 2.0872693061828613,
+ "learning_rate": 3.7717171717171717e-06,
+ "loss": 1.3282644748687744,
+ "mean_token_accuracy": 0.674462616443634,
+ "num_tokens": 9977856.0,
+ "step": 609
+ },
+ {
+ "entropy": 1.0672967433929443,
+ "epoch": 1.2323232323232323,
+ "grad_norm": 2.0819947719573975,
+ "learning_rate": 3.76969696969697e-06,
+ "loss": 1.0929367542266846,
+ "mean_token_accuracy": 0.715254008769989,
+ "num_tokens": 9994240.0,
+ "step": 610
+ },
+ {
+ "entropy": 1.4465869665145874,
+ "epoch": 1.2343434343434343,
+ "grad_norm": 2.1786868572235107,
+ "learning_rate": 3.767676767676768e-06,
+ "loss": 1.436307668685913,
+ "mean_token_accuracy": 0.6642037034034729,
+ "num_tokens": 10010624.0,
+ "step": 611
+ },
+ {
+ "entropy": 1.6424144506454468,
+ "epoch": 1.2363636363636363,
+ "grad_norm": 2.2582032680511475,
+ "learning_rate": 3.765656565656566e-06,
+ "loss": 1.6621832847595215,
+ "mean_token_accuracy": 0.6218246221542358,
+ "num_tokens": 10027008.0,
+ "step": 612
+ },
+ {
+ "entropy": 1.546712875366211,
+ "epoch": 1.2383838383838384,
+ "grad_norm": 2.1685879230499268,
+ "learning_rate": 3.7636363636363637e-06,
+ "loss": 1.5617464780807495,
+ "mean_token_accuracy": 0.6325110197067261,
+ "num_tokens": 10043392.0,
+ "step": 613
+ },
+ {
+ "entropy": 1.5758557319641113,
+ "epoch": 1.2404040404040404,
+ "grad_norm": 2.0911128520965576,
+ "learning_rate": 3.7616161616161616e-06,
+ "loss": 1.5830271244049072,
+ "mean_token_accuracy": 0.6349536180496216,
+ "num_tokens": 10059776.0,
+ "step": 614
+ },
+ {
+ "entropy": 1.5223995447158813,
+ "epoch": 1.2424242424242424,
+ "grad_norm": 2.0333359241485596,
+ "learning_rate": 3.7595959595959595e-06,
+ "loss": 1.5132982730865479,
+ "mean_token_accuracy": 0.6518075466156006,
+ "num_tokens": 10076160.0,
+ "step": 615
+ },
+ {
+ "entropy": 1.0950185060501099,
+ "epoch": 1.2444444444444445,
+ "grad_norm": 2.0048129558563232,
+ "learning_rate": 3.757575757575758e-06,
+ "loss": 1.0901896953582764,
+ "mean_token_accuracy": 0.723375678062439,
+ "num_tokens": 10092544.0,
+ "step": 616
+ },
+ {
+ "entropy": 1.340641736984253,
+ "epoch": 1.2464646464646465,
+ "grad_norm": 2.079256534576416,
+ "learning_rate": 3.7555555555555557e-06,
+ "loss": 1.3583415746688843,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 10108928.0,
+ "step": 617
+ },
+ {
+ "entropy": 1.1836222410202026,
+ "epoch": 1.2484848484848485,
+ "grad_norm": 1.9266347885131836,
+ "learning_rate": 3.7535353535353536e-06,
+ "loss": 1.171565294265747,
+ "mean_token_accuracy": 0.7046287059783936,
+ "num_tokens": 10125312.0,
+ "step": 618
+ },
+ {
+ "entropy": 1.6007641553878784,
+ "epoch": 1.2505050505050506,
+ "grad_norm": 2.25252103805542,
+ "learning_rate": 3.7515151515151515e-06,
+ "loss": 1.5955660343170166,
+ "mean_token_accuracy": 0.6306790709495544,
+ "num_tokens": 10141696.0,
+ "step": 619
+ },
+ {
+ "entropy": 1.8159959316253662,
+ "epoch": 1.2525252525252526,
+ "grad_norm": 2.255959987640381,
+ "learning_rate": 3.74949494949495e-06,
+ "loss": 1.8223116397857666,
+ "mean_token_accuracy": 0.5867122411727905,
+ "num_tokens": 10158080.0,
+ "step": 620
+ },
+ {
+ "entropy": 1.6469950675964355,
+ "epoch": 1.2545454545454544,
+ "grad_norm": 1.9183777570724487,
+ "learning_rate": 3.747474747474748e-06,
+ "loss": 1.6623587608337402,
+ "mean_token_accuracy": 0.6283586025238037,
+ "num_tokens": 10174464.0,
+ "step": 621
+ },
+ {
+ "entropy": 1.3507136106491089,
+ "epoch": 1.2565656565656567,
+ "grad_norm": 1.9393805265426636,
+ "learning_rate": 3.745454545454546e-06,
+ "loss": 1.3371413946151733,
+ "mean_token_accuracy": 0.6808744668960571,
+ "num_tokens": 10190848.0,
+ "step": 622
+ },
+ {
+ "entropy": 1.5176761150360107,
+ "epoch": 1.2585858585858585,
+ "grad_norm": 2.0721757411956787,
+ "learning_rate": 3.743434343434344e-06,
+ "loss": 1.5010406970977783,
+ "mean_token_accuracy": 0.6603566408157349,
+ "num_tokens": 10207232.0,
+ "step": 623
+ },
+ {
+ "entropy": 1.1409586668014526,
+ "epoch": 1.2606060606060607,
+ "grad_norm": 1.90805983543396,
+ "learning_rate": 3.7414141414141418e-06,
+ "loss": 1.1339551210403442,
+ "mean_token_accuracy": 0.7151318788528442,
+ "num_tokens": 10223616.0,
+ "step": 624
+ },
+ {
+ "entropy": 1.2258127927780151,
+ "epoch": 1.2626262626262625,
+ "grad_norm": 1.9276432991027832,
+ "learning_rate": 3.73939393939394e-06,
+ "loss": 1.2232249975204468,
+ "mean_token_accuracy": 0.7053614854812622,
+ "num_tokens": 10240000.0,
+ "step": 625
+ },
+ {
+ "entropy": 1.236358642578125,
+ "epoch": 1.2646464646464646,
+ "grad_norm": 2.0792832374572754,
+ "learning_rate": 3.737373737373738e-06,
+ "loss": 1.2570738792419434,
+ "mean_token_accuracy": 0.6869809627532959,
+ "num_tokens": 10256384.0,
+ "step": 626
+ },
+ {
+ "entropy": 1.0995185375213623,
+ "epoch": 1.2666666666666666,
+ "grad_norm": 2.035024881362915,
+ "learning_rate": 3.735353535353536e-06,
+ "loss": 1.10158109664917,
+ "mean_token_accuracy": 0.7248412370681763,
+ "num_tokens": 10272768.0,
+ "step": 627
+ },
+ {
+ "entropy": 1.8980706930160522,
+ "epoch": 1.2686868686868686,
+ "grad_norm": 2.040414333343506,
+ "learning_rate": 3.7333333333333337e-06,
+ "loss": 1.9260807037353516,
+ "mean_token_accuracy": 0.5953834652900696,
+ "num_tokens": 10289152.0,
+ "step": 628
+ },
+ {
+ "entropy": 1.4265168905258179,
+ "epoch": 1.2707070707070707,
+ "grad_norm": 2.418179750442505,
+ "learning_rate": 3.7313131313131316e-06,
+ "loss": 1.4415385723114014,
+ "mean_token_accuracy": 0.6535784006118774,
+ "num_tokens": 10305536.0,
+ "step": 629
+ },
+ {
+ "entropy": 1.217471957206726,
+ "epoch": 1.2727272727272727,
+ "grad_norm": 2.072441577911377,
+ "learning_rate": 3.72929292929293e-06,
+ "loss": 1.2361960411071777,
+ "mean_token_accuracy": 0.6947972774505615,
+ "num_tokens": 10321920.0,
+ "step": 630
+ },
+ {
+ "entropy": 1.0714137554168701,
+ "epoch": 1.2747474747474747,
+ "grad_norm": 3.0428647994995117,
+ "learning_rate": 3.727272727272728e-06,
+ "loss": 1.112711787223816,
+ "mean_token_accuracy": 0.7243527173995972,
+ "num_tokens": 10338304.0,
+ "step": 631
+ },
+ {
+ "entropy": 1.5873851776123047,
+ "epoch": 1.2767676767676768,
+ "grad_norm": 1.945098638534546,
+ "learning_rate": 3.7252525252525257e-06,
+ "loss": 1.595362663269043,
+ "mean_token_accuracy": 0.639594554901123,
+ "num_tokens": 10354688.0,
+ "step": 632
+ },
+ {
+ "entropy": 1.9688408374786377,
+ "epoch": 1.2787878787878788,
+ "grad_norm": 2.0450353622436523,
+ "learning_rate": 3.7232323232323236e-06,
+ "loss": 1.9989259243011475,
+ "mean_token_accuracy": 0.5685759782791138,
+ "num_tokens": 10371072.0,
+ "step": 633
+ },
+ {
+ "entropy": 1.2927459478378296,
+ "epoch": 1.2808080808080808,
+ "grad_norm": 1.959108591079712,
+ "learning_rate": 3.7212121212121215e-06,
+ "loss": 1.3025646209716797,
+ "mean_token_accuracy": 0.6853932738304138,
+ "num_tokens": 10387456.0,
+ "step": 634
+ },
+ {
+ "entropy": 1.6645994186401367,
+ "epoch": 1.2828282828282829,
+ "grad_norm": 2.041923999786377,
+ "learning_rate": 3.7191919191919194e-06,
+ "loss": 1.6959854364395142,
+ "mean_token_accuracy": 0.6319003701210022,
+ "num_tokens": 10403840.0,
+ "step": 635
+ },
+ {
+ "entropy": 1.401423692703247,
+ "epoch": 1.284848484848485,
+ "grad_norm": 2.040456533432007,
+ "learning_rate": 3.7171717171717177e-06,
+ "loss": 1.3859784603118896,
+ "mean_token_accuracy": 0.6740962266921997,
+ "num_tokens": 10420224.0,
+ "step": 636
+ },
+ {
+ "entropy": 1.0597256422042847,
+ "epoch": 1.286868686868687,
+ "grad_norm": 2.053690195083618,
+ "learning_rate": 3.7151515151515156e-06,
+ "loss": 1.052672266960144,
+ "mean_token_accuracy": 0.7290546894073486,
+ "num_tokens": 10436608.0,
+ "step": 637
+ },
+ {
+ "entropy": 1.280874252319336,
+ "epoch": 1.2888888888888888,
+ "grad_norm": 2.0566959381103516,
+ "learning_rate": 3.7131313131313135e-06,
+ "loss": 1.2883412837982178,
+ "mean_token_accuracy": 0.6822178959846497,
+ "num_tokens": 10452992.0,
+ "step": 638
+ },
+ {
+ "entropy": 1.299896240234375,
+ "epoch": 1.290909090909091,
+ "grad_norm": 1.8896070718765259,
+ "learning_rate": 3.7111111111111113e-06,
+ "loss": 1.3038103580474854,
+ "mean_token_accuracy": 0.6712872385978699,
+ "num_tokens": 10469376.0,
+ "step": 639
+ },
+ {
+ "entropy": 1.1713769435882568,
+ "epoch": 1.2929292929292928,
+ "grad_norm": 2.1309149265289307,
+ "learning_rate": 3.7090909090909092e-06,
+ "loss": 1.1899120807647705,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 10485760.0,
+ "step": 640
+ },
+ {
+ "entropy": 1.3056974411010742,
+ "epoch": 1.294949494949495,
+ "grad_norm": 1.9990391731262207,
+ "learning_rate": 3.7070707070707075e-06,
+ "loss": 1.3287105560302734,
+ "mean_token_accuracy": 0.6773326992988586,
+ "num_tokens": 10502144.0,
+ "step": 641
+ },
+ {
+ "entropy": 1.7352585792541504,
+ "epoch": 1.2969696969696969,
+ "grad_norm": 2.100043535232544,
+ "learning_rate": 3.7050505050505054e-06,
+ "loss": 1.7806944847106934,
+ "mean_token_accuracy": 0.60332190990448,
+ "num_tokens": 10518528.0,
+ "step": 642
+ },
+ {
+ "entropy": 1.3748377561569214,
+ "epoch": 1.298989898989899,
+ "grad_norm": 2.1280689239501953,
+ "learning_rate": 3.7030303030303033e-06,
+ "loss": 1.379891037940979,
+ "mean_token_accuracy": 0.6617611050605774,
+ "num_tokens": 10534912.0,
+ "step": 643
+ },
+ {
+ "entropy": 0.9991571307182312,
+ "epoch": 1.301010101010101,
+ "grad_norm": 1.7343134880065918,
+ "learning_rate": 3.701010101010101e-06,
+ "loss": 1.0082780122756958,
+ "mean_token_accuracy": 0.740229606628418,
+ "num_tokens": 10551296.0,
+ "step": 644
+ },
+ {
+ "entropy": 1.6313605308532715,
+ "epoch": 1.303030303030303,
+ "grad_norm": 2.216167449951172,
+ "learning_rate": 3.698989898989899e-06,
+ "loss": 1.6183781623840332,
+ "mean_token_accuracy": 0.6164509057998657,
+ "num_tokens": 10567680.0,
+ "step": 645
+ },
+ {
+ "entropy": 1.4174962043762207,
+ "epoch": 1.305050505050505,
+ "grad_norm": 2.0921854972839355,
+ "learning_rate": 3.6969696969696974e-06,
+ "loss": 1.4087945222854614,
+ "mean_token_accuracy": 0.6705544590950012,
+ "num_tokens": 10584064.0,
+ "step": 646
+ },
+ {
+ "entropy": 1.8302873373031616,
+ "epoch": 1.307070707070707,
+ "grad_norm": 2.0742204189300537,
+ "learning_rate": 3.6949494949494953e-06,
+ "loss": 1.8456642627716064,
+ "mean_token_accuracy": 0.5914142727851868,
+ "num_tokens": 10600448.0,
+ "step": 647
+ },
+ {
+ "entropy": 1.29628324508667,
+ "epoch": 1.309090909090909,
+ "grad_norm": 2.1446709632873535,
+ "learning_rate": 3.692929292929293e-06,
+ "loss": 1.3066375255584717,
+ "mean_token_accuracy": 0.6798363327980042,
+ "num_tokens": 10616832.0,
+ "step": 648
+ },
+ {
+ "entropy": 1.396378993988037,
+ "epoch": 1.3111111111111111,
+ "grad_norm": 1.9578899145126343,
+ "learning_rate": 3.690909090909091e-06,
+ "loss": 1.3943686485290527,
+ "mean_token_accuracy": 0.6772105693817139,
+ "num_tokens": 10633216.0,
+ "step": 649
+ },
+ {
+ "entropy": 1.6457722187042236,
+ "epoch": 1.3131313131313131,
+ "grad_norm": 1.9999926090240479,
+ "learning_rate": 3.688888888888889e-06,
+ "loss": 1.6266872882843018,
+ "mean_token_accuracy": 0.630923330783844,
+ "num_tokens": 10649600.0,
+ "step": 650
+ },
+ {
+ "epoch": 1.3131313131313131,
+ "eval_entropy": 1.456459879875183,
+ "eval_loss": 1.539737582206726,
+ "eval_mean_token_accuracy": 0.643713459853203,
+ "eval_num_tokens": 10649600.0,
+ "eval_runtime": 43.7637,
+ "eval_samples_per_second": 22.621,
+ "eval_steps_per_second": 2.833,
+ "step": 650
+ },
+ {
+ "entropy": 1.1152859926223755,
+ "epoch": 1.3151515151515152,
+ "grad_norm": 2.9232723712921143,
+ "learning_rate": 3.686868686868687e-06,
+ "loss": 1.099653959274292,
+ "mean_token_accuracy": 0.7227039337158203,
+ "num_tokens": 10665984.0,
+ "step": 651
+ },
+ {
+ "entropy": 1.6141386032104492,
+ "epoch": 1.3171717171717172,
+ "grad_norm": 2.1557929515838623,
+ "learning_rate": 3.684848484848485e-06,
+ "loss": 1.6156055927276611,
+ "mean_token_accuracy": 0.6288471221923828,
+ "num_tokens": 10682368.0,
+ "step": 652
+ },
+ {
+ "entropy": 1.282158374786377,
+ "epoch": 1.3191919191919192,
+ "grad_norm": 2.061983346939087,
+ "learning_rate": 3.682828282828283e-06,
+ "loss": 1.2867733240127563,
+ "mean_token_accuracy": 0.6869198679924011,
+ "num_tokens": 10698752.0,
+ "step": 653
+ },
+ {
+ "entropy": 0.9986366033554077,
+ "epoch": 1.3212121212121213,
+ "grad_norm": 2.0446274280548096,
+ "learning_rate": 3.680808080808081e-06,
+ "loss": 1.019629716873169,
+ "mean_token_accuracy": 0.7427943348884583,
+ "num_tokens": 10715136.0,
+ "step": 654
+ },
+ {
+ "entropy": 1.4256011247634888,
+ "epoch": 1.3232323232323233,
+ "grad_norm": 2.1024749279022217,
+ "learning_rate": 3.678787878787879e-06,
+ "loss": 1.4269766807556152,
+ "mean_token_accuracy": 0.6674401760101318,
+ "num_tokens": 10731520.0,
+ "step": 655
+ },
+ {
+ "entropy": 1.4913274049758911,
+ "epoch": 1.3252525252525253,
+ "grad_norm": 2.068432569503784,
+ "learning_rate": 3.6767676767676767e-06,
+ "loss": 1.4930779933929443,
+ "mean_token_accuracy": 0.6474719047546387,
+ "num_tokens": 10747904.0,
+ "step": 656
+ },
+ {
+ "entropy": 1.2957285642623901,
+ "epoch": 1.3272727272727272,
+ "grad_norm": 2.2480008602142334,
+ "learning_rate": 3.674747474747475e-06,
+ "loss": 1.3001320362091064,
+ "mean_token_accuracy": 0.679286777973175,
+ "num_tokens": 10764288.0,
+ "step": 657
+ },
+ {
+ "entropy": 1.328946828842163,
+ "epoch": 1.3292929292929294,
+ "grad_norm": 2.311176300048828,
+ "learning_rate": 3.672727272727273e-06,
+ "loss": 1.3286024332046509,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 10780672.0,
+ "step": 658
+ },
+ {
+ "entropy": 1.458139419555664,
+ "epoch": 1.3313131313131312,
+ "grad_norm": 2.1967899799346924,
+ "learning_rate": 3.670707070707071e-06,
+ "loss": 1.4384279251098633,
+ "mean_token_accuracy": 0.6435637474060059,
+ "num_tokens": 10797056.0,
+ "step": 659
+ },
+ {
+ "entropy": 1.43666672706604,
+ "epoch": 1.3333333333333333,
+ "grad_norm": 2.163083076477051,
+ "learning_rate": 3.6686868686868687e-06,
+ "loss": 1.4396371841430664,
+ "mean_token_accuracy": 0.6531509757041931,
+ "num_tokens": 10813440.0,
+ "step": 660
+ },
+ {
+ "entropy": 1.6210501194000244,
+ "epoch": 1.3353535353535353,
+ "grad_norm": 2.3601770401000977,
+ "learning_rate": 3.6666666666666666e-06,
+ "loss": 1.6370227336883545,
+ "mean_token_accuracy": 0.6149242520332336,
+ "num_tokens": 10829824.0,
+ "step": 661
+ },
+ {
+ "entropy": 0.9602832794189453,
+ "epoch": 1.3373737373737373,
+ "grad_norm": 1.8452314138412476,
+ "learning_rate": 3.664646464646465e-06,
+ "loss": 0.9445997476577759,
+ "mean_token_accuracy": 0.759709358215332,
+ "num_tokens": 10846208.0,
+ "step": 662
+ },
+ {
+ "entropy": 1.2215200662612915,
+ "epoch": 1.3393939393939394,
+ "grad_norm": 2.019989252090454,
+ "learning_rate": 3.662626262626263e-06,
+ "loss": 1.2451637983322144,
+ "mean_token_accuracy": 0.7051172256469727,
+ "num_tokens": 10862592.0,
+ "step": 663
+ },
+ {
+ "entropy": 1.3253310918807983,
+ "epoch": 1.3414141414141414,
+ "grad_norm": 1.9700425863265991,
+ "learning_rate": 3.660606060606061e-06,
+ "loss": 1.3407385349273682,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 10878976.0,
+ "step": 664
+ },
+ {
+ "entropy": 1.1397737264633179,
+ "epoch": 1.3434343434343434,
+ "grad_norm": 2.1194040775299072,
+ "learning_rate": 3.658585858585859e-06,
+ "loss": 1.1545679569244385,
+ "mean_token_accuracy": 0.7071323990821838,
+ "num_tokens": 10895360.0,
+ "step": 665
+ },
+ {
+ "entropy": 1.1714493036270142,
+ "epoch": 1.3454545454545455,
+ "grad_norm": 2.078051805496216,
+ "learning_rate": 3.6565656565656573e-06,
+ "loss": 1.1751537322998047,
+ "mean_token_accuracy": 0.6963238716125488,
+ "num_tokens": 10911744.0,
+ "step": 666
+ },
+ {
+ "entropy": 1.2954860925674438,
+ "epoch": 1.3474747474747475,
+ "grad_norm": 1.9348593950271606,
+ "learning_rate": 3.654545454545455e-06,
+ "loss": 1.2961801290512085,
+ "mean_token_accuracy": 0.6831338405609131,
+ "num_tokens": 10928128.0,
+ "step": 667
+ },
+ {
+ "entropy": 1.401628851890564,
+ "epoch": 1.3494949494949495,
+ "grad_norm": 2.1757614612579346,
+ "learning_rate": 3.652525252525253e-06,
+ "loss": 1.4025013446807861,
+ "mean_token_accuracy": 0.6590132117271423,
+ "num_tokens": 10944512.0,
+ "step": 668
+ },
+ {
+ "entropy": 1.4164557456970215,
+ "epoch": 1.3515151515151516,
+ "grad_norm": 2.0192055702209473,
+ "learning_rate": 3.650505050505051e-06,
+ "loss": 1.43379545211792,
+ "mean_token_accuracy": 0.6554714441299438,
+ "num_tokens": 10960896.0,
+ "step": 669
+ },
+ {
+ "entropy": 1.4888815879821777,
+ "epoch": 1.3535353535353536,
+ "grad_norm": 2.2166643142700195,
+ "learning_rate": 3.648484848484849e-06,
+ "loss": 1.494372844696045,
+ "mean_token_accuracy": 0.6402052044868469,
+ "num_tokens": 10977280.0,
+ "step": 670
+ },
+ {
+ "entropy": 1.215625286102295,
+ "epoch": 1.3555555555555556,
+ "grad_norm": 1.8059836626052856,
+ "learning_rate": 3.6464646464646467e-06,
+ "loss": 1.2074902057647705,
+ "mean_token_accuracy": 0.7123228907585144,
+ "num_tokens": 10993664.0,
+ "step": 671
+ },
+ {
+ "entropy": 0.9577685594558716,
+ "epoch": 1.3575757575757577,
+ "grad_norm": 1.8803631067276,
+ "learning_rate": 3.644444444444445e-06,
+ "loss": 0.956764817237854,
+ "mean_token_accuracy": 0.759709358215332,
+ "num_tokens": 11010048.0,
+ "step": 672
+ },
+ {
+ "entropy": 1.7215807437896729,
+ "epoch": 1.3595959595959597,
+ "grad_norm": 2.1421561241149902,
+ "learning_rate": 3.642424242424243e-06,
+ "loss": 1.7220706939697266,
+ "mean_token_accuracy": 0.6187102794647217,
+ "num_tokens": 11026432.0,
+ "step": 673
+ },
+ {
+ "entropy": 1.057277798652649,
+ "epoch": 1.3616161616161615,
+ "grad_norm": 1.9014254808425903,
+ "learning_rate": 3.640404040404041e-06,
+ "loss": 1.0582892894744873,
+ "mean_token_accuracy": 0.7327185869216919,
+ "num_tokens": 11042816.0,
+ "step": 674
+ },
+ {
+ "entropy": 1.220097541809082,
+ "epoch": 1.3636363636363638,
+ "grad_norm": 2.1406402587890625,
+ "learning_rate": 3.6383838383838387e-06,
+ "loss": 1.2152808904647827,
+ "mean_token_accuracy": 0.6976673007011414,
+ "num_tokens": 11059200.0,
+ "step": 675
+ },
+ {
+ "entropy": 1.4171489477157593,
+ "epoch": 1.3656565656565656,
+ "grad_norm": 2.1809890270233154,
+ "learning_rate": 3.6363636363636366e-06,
+ "loss": 1.4846035242080688,
+ "mean_token_accuracy": 0.6681118607521057,
+ "num_tokens": 11075584.0,
+ "step": 676
+ },
+ {
+ "entropy": 1.2915124893188477,
+ "epoch": 1.3676767676767676,
+ "grad_norm": 2.0533218383789062,
+ "learning_rate": 3.634343434343435e-06,
+ "loss": 1.3094089031219482,
+ "mean_token_accuracy": 0.6841719746589661,
+ "num_tokens": 11091968.0,
+ "step": 677
+ },
+ {
+ "entropy": 1.4717603921890259,
+ "epoch": 1.3696969696969696,
+ "grad_norm": 2.125450849533081,
+ "learning_rate": 3.6323232323232328e-06,
+ "loss": 1.479896903038025,
+ "mean_token_accuracy": 0.6601734161376953,
+ "num_tokens": 11108352.0,
+ "step": 678
+ },
+ {
+ "entropy": 1.0841981172561646,
+ "epoch": 1.3717171717171717,
+ "grad_norm": 1.936905026435852,
+ "learning_rate": 3.6303030303030307e-06,
+ "loss": 1.0895963907241821,
+ "mean_token_accuracy": 0.7307645082473755,
+ "num_tokens": 11124736.0,
+ "step": 679
+ },
+ {
+ "entropy": 0.85239177942276,
+ "epoch": 1.3737373737373737,
+ "grad_norm": 1.7117112874984741,
+ "learning_rate": 3.6282828282828286e-06,
+ "loss": 0.8716775178909302,
+ "mean_token_accuracy": 0.7721666097640991,
+ "num_tokens": 11141120.0,
+ "step": 680
+ },
+ {
+ "entropy": 1.4737738370895386,
+ "epoch": 1.3757575757575757,
+ "grad_norm": 2.0140671730041504,
+ "learning_rate": 3.6262626262626264e-06,
+ "loss": 1.5029723644256592,
+ "mean_token_accuracy": 0.653822660446167,
+ "num_tokens": 11157504.0,
+ "step": 681
+ },
+ {
+ "entropy": 1.260698914527893,
+ "epoch": 1.3777777777777778,
+ "grad_norm": 1.9868851900100708,
+ "learning_rate": 3.6242424242424248e-06,
+ "loss": 1.256290316581726,
+ "mean_token_accuracy": 0.6891182065010071,
+ "num_tokens": 11173888.0,
+ "step": 682
+ },
+ {
+ "entropy": 1.7418453693389893,
+ "epoch": 1.3797979797979798,
+ "grad_norm": 2.0905439853668213,
+ "learning_rate": 3.6222222222222226e-06,
+ "loss": 1.7568984031677246,
+ "mean_token_accuracy": 0.6291524171829224,
+ "num_tokens": 11190272.0,
+ "step": 683
+ },
+ {
+ "entropy": 1.5552523136138916,
+ "epoch": 1.3818181818181818,
+ "grad_norm": 2.2071683406829834,
+ "learning_rate": 3.6202020202020205e-06,
+ "loss": 1.555542230606079,
+ "mean_token_accuracy": 0.6403883695602417,
+ "num_tokens": 11206656.0,
+ "step": 684
+ },
+ {
+ "entropy": 1.4404902458190918,
+ "epoch": 1.3838383838383839,
+ "grad_norm": 2.276245594024658,
+ "learning_rate": 3.6181818181818184e-06,
+ "loss": 1.4155148267745972,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 11223040.0,
+ "step": 685
+ },
+ {
+ "entropy": 1.1282018423080444,
+ "epoch": 1.385858585858586,
+ "grad_norm": 1.9824057817459106,
+ "learning_rate": 3.6161616161616163e-06,
+ "loss": 1.099952220916748,
+ "mean_token_accuracy": 0.7234978079795837,
+ "num_tokens": 11239424.0,
+ "step": 686
+ },
+ {
+ "entropy": 1.5559885501861572,
+ "epoch": 1.387878787878788,
+ "grad_norm": 2.243121862411499,
+ "learning_rate": 3.614141414141414e-06,
+ "loss": 1.520850658416748,
+ "mean_token_accuracy": 0.6340987086296082,
+ "num_tokens": 11255808.0,
+ "step": 687
+ },
+ {
+ "entropy": 1.322407841682434,
+ "epoch": 1.38989898989899,
+ "grad_norm": 2.049233913421631,
+ "learning_rate": 3.6121212121212125e-06,
+ "loss": 1.322263479232788,
+ "mean_token_accuracy": 0.6778212189674377,
+ "num_tokens": 11272192.0,
+ "step": 688
+ },
+ {
+ "entropy": 1.3112859725952148,
+ "epoch": 1.391919191919192,
+ "grad_norm": 2.0666465759277344,
+ "learning_rate": 3.6101010101010104e-06,
+ "loss": 1.3103243112564087,
+ "mean_token_accuracy": 0.6828285455703735,
+ "num_tokens": 11288576.0,
+ "step": 689
+ },
+ {
+ "entropy": 1.3321104049682617,
+ "epoch": 1.393939393939394,
+ "grad_norm": 2.5464279651641846,
+ "learning_rate": 3.6080808080808083e-06,
+ "loss": 1.3247697353363037,
+ "mean_token_accuracy": 0.6785539984703064,
+ "num_tokens": 11304960.0,
+ "step": 690
+ },
+ {
+ "entropy": 1.0779680013656616,
+ "epoch": 1.3959595959595958,
+ "grad_norm": 2.1386117935180664,
+ "learning_rate": 3.606060606060606e-06,
+ "loss": 1.0994013547897339,
+ "mean_token_accuracy": 0.7129946351051331,
+ "num_tokens": 11321344.0,
+ "step": 691
+ },
+ {
+ "entropy": 1.0701864957809448,
+ "epoch": 1.397979797979798,
+ "grad_norm": 1.9387527704238892,
+ "learning_rate": 3.604040404040404e-06,
+ "loss": 1.0633184909820557,
+ "mean_token_accuracy": 0.7378480434417725,
+ "num_tokens": 11337728.0,
+ "step": 692
+ },
+ {
+ "entropy": 1.2258752584457397,
+ "epoch": 1.4,
+ "grad_norm": 2.0486111640930176,
+ "learning_rate": 3.6020202020202024e-06,
+ "loss": 1.2098207473754883,
+ "mean_token_accuracy": 0.6999877691268921,
+ "num_tokens": 11354112.0,
+ "step": 693
+ },
+ {
+ "entropy": 1.4652774333953857,
+ "epoch": 1.402020202020202,
+ "grad_norm": 2.043079376220703,
+ "learning_rate": 3.6000000000000003e-06,
+ "loss": 1.4780974388122559,
+ "mean_token_accuracy": 0.6681729555130005,
+ "num_tokens": 11370496.0,
+ "step": 694
+ },
+ {
+ "entropy": 1.3215711116790771,
+ "epoch": 1.404040404040404,
+ "grad_norm": 2.1327438354492188,
+ "learning_rate": 3.597979797979798e-06,
+ "loss": 1.3116662502288818,
+ "mean_token_accuracy": 0.6757450103759766,
+ "num_tokens": 11386880.0,
+ "step": 695
+ },
+ {
+ "entropy": 1.624266266822815,
+ "epoch": 1.406060606060606,
+ "grad_norm": 2.114398717880249,
+ "learning_rate": 3.595959595959596e-06,
+ "loss": 1.628610372543335,
+ "mean_token_accuracy": 0.6487542986869812,
+ "num_tokens": 11403264.0,
+ "step": 696
+ },
+ {
+ "entropy": 1.6059489250183105,
+ "epoch": 1.408080808080808,
+ "grad_norm": 1.952991008758545,
+ "learning_rate": 3.593939393939394e-06,
+ "loss": 1.6145906448364258,
+ "mean_token_accuracy": 0.6257938742637634,
+ "num_tokens": 11419648.0,
+ "step": 697
+ },
+ {
+ "entropy": 1.0662391185760498,
+ "epoch": 1.41010101010101,
+ "grad_norm": 2.0804851055145264,
+ "learning_rate": 3.5919191919191922e-06,
+ "loss": 1.0772000551223755,
+ "mean_token_accuracy": 0.7187347412109375,
+ "num_tokens": 11436032.0,
+ "step": 698
+ },
+ {
+ "entropy": 1.221283197402954,
+ "epoch": 1.412121212121212,
+ "grad_norm": 1.9502744674682617,
+ "learning_rate": 3.58989898989899e-06,
+ "loss": 1.2352337837219238,
+ "mean_token_accuracy": 0.6918050646781921,
+ "num_tokens": 11452416.0,
+ "step": 699
+ },
+ {
+ "entropy": 1.4205158948898315,
+ "epoch": 1.4141414141414141,
+ "grad_norm": 2.2222518920898438,
+ "learning_rate": 3.587878787878788e-06,
+ "loss": 1.451093077659607,
+ "mean_token_accuracy": 0.6648754477500916,
+ "num_tokens": 11468800.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.4141414141414141,
+ "eval_entropy": 1.4370074204860195,
+ "eval_loss": 1.5383458137512207,
+ "eval_mean_token_accuracy": 0.6441497793120723,
+ "eval_num_tokens": 11468800.0,
+ "eval_runtime": 43.744,
+ "eval_samples_per_second": 22.632,
+ "eval_steps_per_second": 2.835,
+ "step": 700
+ },
+ {
+ "entropy": 1.5432499647140503,
+ "epoch": 1.4161616161616162,
+ "grad_norm": 2.084463596343994,
+ "learning_rate": 3.585858585858586e-06,
+ "loss": 1.5958356857299805,
+ "mean_token_accuracy": 0.6377015113830566,
+ "num_tokens": 11485184.0,
+ "step": 701
+ },
+ {
+ "entropy": 1.297119379043579,
+ "epoch": 1.4181818181818182,
+ "grad_norm": 2.1996524333953857,
+ "learning_rate": 3.5838383838383838e-06,
+ "loss": 1.3346054553985596,
+ "mean_token_accuracy": 0.6801416873931885,
+ "num_tokens": 11501568.0,
+ "step": 702
+ },
+ {
+ "entropy": 1.3905766010284424,
+ "epoch": 1.4202020202020202,
+ "grad_norm": 2.1683545112609863,
+ "learning_rate": 3.5818181818181817e-06,
+ "loss": 1.40826416015625,
+ "mean_token_accuracy": 0.6653639674186707,
+ "num_tokens": 11517952.0,
+ "step": 703
+ },
+ {
+ "entropy": 0.9598695635795593,
+ "epoch": 1.4222222222222223,
+ "grad_norm": 1.9240537881851196,
+ "learning_rate": 3.57979797979798e-06,
+ "loss": 0.9487459659576416,
+ "mean_token_accuracy": 0.7556179761886597,
+ "num_tokens": 11534336.0,
+ "step": 704
+ },
+ {
+ "entropy": 1.2008687257766724,
+ "epoch": 1.4242424242424243,
+ "grad_norm": 1.9687083959579468,
+ "learning_rate": 3.577777777777778e-06,
+ "loss": 1.2234617471694946,
+ "mean_token_accuracy": 0.6982779502868652,
+ "num_tokens": 11550720.0,
+ "step": 705
+ },
+ {
+ "entropy": 1.1168856620788574,
+ "epoch": 1.4262626262626263,
+ "grad_norm": 2.1796388626098633,
+ "learning_rate": 3.575757575757576e-06,
+ "loss": 1.1320589780807495,
+ "mean_token_accuracy": 0.7057889699935913,
+ "num_tokens": 11567104.0,
+ "step": 706
+ },
+ {
+ "entropy": 1.3408682346343994,
+ "epoch": 1.4282828282828284,
+ "grad_norm": 1.9048689603805542,
+ "learning_rate": 3.573737373737374e-06,
+ "loss": 1.3476686477661133,
+ "mean_token_accuracy": 0.6839887499809265,
+ "num_tokens": 11583488.0,
+ "step": 707
+ },
+ {
+ "entropy": 1.4392427206039429,
+ "epoch": 1.4303030303030302,
+ "grad_norm": 2.183016777038574,
+ "learning_rate": 3.5717171717171724e-06,
+ "loss": 1.4443378448486328,
+ "mean_token_accuracy": 0.6546775698661804,
+ "num_tokens": 11599872.0,
+ "step": 708
+ },
+ {
+ "entropy": 1.1428641080856323,
+ "epoch": 1.4323232323232324,
+ "grad_norm": 2.0477187633514404,
+ "learning_rate": 3.5696969696969703e-06,
+ "loss": 1.1438124179840088,
+ "mean_token_accuracy": 0.7126282453536987,
+ "num_tokens": 11616256.0,
+ "step": 709
+ },
+ {
+ "entropy": 1.6266967058181763,
+ "epoch": 1.4343434343434343,
+ "grad_norm": 2.322098731994629,
+ "learning_rate": 3.567676767676768e-06,
+ "loss": 1.6161916255950928,
+ "mean_token_accuracy": 0.6202979683876038,
+ "num_tokens": 11632640.0,
+ "step": 710
+ },
+ {
+ "entropy": 1.349686622619629,
+ "epoch": 1.4363636363636363,
+ "grad_norm": 2.021871328353882,
+ "learning_rate": 3.565656565656566e-06,
+ "loss": 1.3713490962982178,
+ "mean_token_accuracy": 0.6596238613128662,
+ "num_tokens": 11649024.0,
+ "step": 711
+ },
+ {
+ "entropy": 1.4476866722106934,
+ "epoch": 1.4383838383838383,
+ "grad_norm": 2.194718837738037,
+ "learning_rate": 3.563636363636364e-06,
+ "loss": 1.4593651294708252,
+ "mean_token_accuracy": 0.6476551294326782,
+ "num_tokens": 11665408.0,
+ "step": 712
+ },
+ {
+ "entropy": 1.625157356262207,
+ "epoch": 1.4404040404040404,
+ "grad_norm": 2.0966169834136963,
+ "learning_rate": 3.5616161616161622e-06,
+ "loss": 1.6374845504760742,
+ "mean_token_accuracy": 0.6293356418609619,
+ "num_tokens": 11681792.0,
+ "step": 713
+ },
+ {
+ "entropy": 1.985729455947876,
+ "epoch": 1.4424242424242424,
+ "grad_norm": 2.129556655883789,
+ "learning_rate": 3.55959595959596e-06,
+ "loss": 2.0454561710357666,
+ "mean_token_accuracy": 0.5728505253791809,
+ "num_tokens": 11698176.0,
+ "step": 714
+ },
+ {
+ "entropy": 1.546321153640747,
+ "epoch": 1.4444444444444444,
+ "grad_norm": 2.1565628051757812,
+ "learning_rate": 3.557575757575758e-06,
+ "loss": 1.5467555522918701,
+ "mean_token_accuracy": 0.6351978778839111,
+ "num_tokens": 11714560.0,
+ "step": 715
+ },
+ {
+ "entropy": 1.3690776824951172,
+ "epoch": 1.4464646464646465,
+ "grad_norm": 2.206984519958496,
+ "learning_rate": 3.555555555555556e-06,
+ "loss": 1.3877894878387451,
+ "mean_token_accuracy": 0.6911333799362183,
+ "num_tokens": 11730944.0,
+ "step": 716
+ },
+ {
+ "entropy": 1.3643333911895752,
+ "epoch": 1.4484848484848485,
+ "grad_norm": 2.0049662590026855,
+ "learning_rate": 3.553535353535354e-06,
+ "loss": 1.364513635635376,
+ "mean_token_accuracy": 0.6781876087188721,
+ "num_tokens": 11747328.0,
+ "step": 717
+ },
+ {
+ "entropy": 1.337018370628357,
+ "epoch": 1.4505050505050505,
+ "grad_norm": 2.0919127464294434,
+ "learning_rate": 3.551515151515152e-06,
+ "loss": 1.3578065633773804,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 11763712.0,
+ "step": 718
+ },
+ {
+ "entropy": 1.3421508073806763,
+ "epoch": 1.4525252525252526,
+ "grad_norm": 2.0651159286499023,
+ "learning_rate": 3.54949494949495e-06,
+ "loss": 1.33928382396698,
+ "mean_token_accuracy": 0.6866145730018616,
+ "num_tokens": 11780096.0,
+ "step": 719
+ },
+ {
+ "entropy": 1.2841005325317383,
+ "epoch": 1.4545454545454546,
+ "grad_norm": 2.124370813369751,
+ "learning_rate": 3.547474747474748e-06,
+ "loss": 1.258314609527588,
+ "mean_token_accuracy": 0.6806302070617676,
+ "num_tokens": 11796480.0,
+ "step": 720
+ },
+ {
+ "entropy": 1.56289803981781,
+ "epoch": 1.4565656565656566,
+ "grad_norm": 1.9271100759506226,
+ "learning_rate": 3.5454545454545458e-06,
+ "loss": 1.5867946147918701,
+ "mean_token_accuracy": 0.6430752277374268,
+ "num_tokens": 11812864.0,
+ "step": 721
+ },
+ {
+ "entropy": 1.3374838829040527,
+ "epoch": 1.4585858585858587,
+ "grad_norm": 2.1113364696502686,
+ "learning_rate": 3.5434343434343437e-06,
+ "loss": 1.327169418334961,
+ "mean_token_accuracy": 0.6806912422180176,
+ "num_tokens": 11829248.0,
+ "step": 722
+ },
+ {
+ "entropy": 1.7233415842056274,
+ "epoch": 1.4606060606060607,
+ "grad_norm": 2.1862399578094482,
+ "learning_rate": 3.5414141414141416e-06,
+ "loss": 1.7290821075439453,
+ "mean_token_accuracy": 0.6056423783302307,
+ "num_tokens": 11845632.0,
+ "step": 723
+ },
+ {
+ "entropy": 1.28484046459198,
+ "epoch": 1.4626262626262627,
+ "grad_norm": 2.0059030055999756,
+ "learning_rate": 3.53939393939394e-06,
+ "loss": 1.2958555221557617,
+ "mean_token_accuracy": 0.6774548292160034,
+ "num_tokens": 11862016.0,
+ "step": 724
+ },
+ {
+ "entropy": 1.2592295408248901,
+ "epoch": 1.4646464646464645,
+ "grad_norm": 1.9422065019607544,
+ "learning_rate": 3.5373737373737378e-06,
+ "loss": 1.2501411437988281,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 11878400.0,
+ "step": 725
+ },
+ {
+ "entropy": 1.3708571195602417,
+ "epoch": 1.4666666666666668,
+ "grad_norm": 2.164499044418335,
+ "learning_rate": 3.5353535353535356e-06,
+ "loss": 1.3901662826538086,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 11894784.0,
+ "step": 726
+ },
+ {
+ "entropy": 1.239045262336731,
+ "epoch": 1.4686868686868686,
+ "grad_norm": 1.9581060409545898,
+ "learning_rate": 3.5333333333333335e-06,
+ "loss": 1.2436164617538452,
+ "mean_token_accuracy": 0.6939423680305481,
+ "num_tokens": 11911168.0,
+ "step": 727
+ },
+ {
+ "entropy": 1.5965995788574219,
+ "epoch": 1.4707070707070706,
+ "grad_norm": 2.343669891357422,
+ "learning_rate": 3.5313131313131314e-06,
+ "loss": 1.5918347835540771,
+ "mean_token_accuracy": 0.6274425983428955,
+ "num_tokens": 11927552.0,
+ "step": 728
+ },
+ {
+ "entropy": 1.1196811199188232,
+ "epoch": 1.4727272727272727,
+ "grad_norm": 2.181840181350708,
+ "learning_rate": 3.5292929292929297e-06,
+ "loss": 1.1142621040344238,
+ "mean_token_accuracy": 0.7192842960357666,
+ "num_tokens": 11943936.0,
+ "step": 729
+ },
+ {
+ "entropy": 1.129361629486084,
+ "epoch": 1.4747474747474747,
+ "grad_norm": 2.065730571746826,
+ "learning_rate": 3.5272727272727276e-06,
+ "loss": 1.143613576889038,
+ "mean_token_accuracy": 0.7145212292671204,
+ "num_tokens": 11960320.0,
+ "step": 730
+ },
+ {
+ "entropy": 1.4940218925476074,
+ "epoch": 1.4767676767676767,
+ "grad_norm": 2.083453893661499,
+ "learning_rate": 3.5252525252525255e-06,
+ "loss": 1.4957321882247925,
+ "mean_token_accuracy": 0.6481436491012573,
+ "num_tokens": 11976704.0,
+ "step": 731
+ },
+ {
+ "entropy": 1.3427786827087402,
+ "epoch": 1.4787878787878788,
+ "grad_norm": 2.0897183418273926,
+ "learning_rate": 3.5232323232323234e-06,
+ "loss": 1.354066014289856,
+ "mean_token_accuracy": 0.6660356521606445,
+ "num_tokens": 11993088.0,
+ "step": 732
+ },
+ {
+ "entropy": 1.3300065994262695,
+ "epoch": 1.4808080808080808,
+ "grad_norm": 2.0537912845611572,
+ "learning_rate": 3.5212121212121213e-06,
+ "loss": 1.3332751989364624,
+ "mean_token_accuracy": 0.6817293763160706,
+ "num_tokens": 12009472.0,
+ "step": 733
+ },
+ {
+ "entropy": 1.0657827854156494,
+ "epoch": 1.4828282828282828,
+ "grad_norm": 1.9099130630493164,
+ "learning_rate": 3.5191919191919196e-06,
+ "loss": 1.067232608795166,
+ "mean_token_accuracy": 0.734245240688324,
+ "num_tokens": 12025856.0,
+ "step": 734
+ },
+ {
+ "entropy": 1.5265862941741943,
+ "epoch": 1.4848484848484849,
+ "grad_norm": 2.100236177444458,
+ "learning_rate": 3.5171717171717175e-06,
+ "loss": 1.5169599056243896,
+ "mean_token_accuracy": 0.6382511258125305,
+ "num_tokens": 12042240.0,
+ "step": 735
+ },
+ {
+ "entropy": 1.4428536891937256,
+ "epoch": 1.486868686868687,
+ "grad_norm": 1.9902187585830688,
+ "learning_rate": 3.5151515151515154e-06,
+ "loss": 1.4398434162139893,
+ "mean_token_accuracy": 0.675500750541687,
+ "num_tokens": 12058624.0,
+ "step": 736
+ },
+ {
+ "entropy": 1.528032660484314,
+ "epoch": 1.488888888888889,
+ "grad_norm": 2.043238878250122,
+ "learning_rate": 3.5131313131313133e-06,
+ "loss": 1.5280101299285889,
+ "mean_token_accuracy": 0.6431363224983215,
+ "num_tokens": 12075008.0,
+ "step": 737
+ },
+ {
+ "entropy": 1.4250329732894897,
+ "epoch": 1.490909090909091,
+ "grad_norm": 1.791640281677246,
+ "learning_rate": 3.511111111111111e-06,
+ "loss": 1.426466464996338,
+ "mean_token_accuracy": 0.6765388250350952,
+ "num_tokens": 12091392.0,
+ "step": 738
+ },
+ {
+ "entropy": 1.1264820098876953,
+ "epoch": 1.492929292929293,
+ "grad_norm": 2.0549607276916504,
+ "learning_rate": 3.509090909090909e-06,
+ "loss": 1.1271553039550781,
+ "mean_token_accuracy": 0.6996213793754578,
+ "num_tokens": 12107776.0,
+ "step": 739
+ },
+ {
+ "entropy": 1.538375735282898,
+ "epoch": 1.494949494949495,
+ "grad_norm": 2.22322940826416,
+ "learning_rate": 3.5070707070707073e-06,
+ "loss": 1.5588887929916382,
+ "mean_token_accuracy": 0.6384953856468201,
+ "num_tokens": 12124160.0,
+ "step": 740
+ },
+ {
+ "entropy": 1.2698255777359009,
+ "epoch": 1.496969696969697,
+ "grad_norm": 2.17710542678833,
+ "learning_rate": 3.5050505050505052e-06,
+ "loss": 1.29567289352417,
+ "mean_token_accuracy": 0.6762945652008057,
+ "num_tokens": 12140544.0,
+ "step": 741
+ },
+ {
+ "entropy": 1.523453950881958,
+ "epoch": 1.4989898989898989,
+ "grad_norm": 2.0350148677825928,
+ "learning_rate": 3.503030303030303e-06,
+ "loss": 1.5341038703918457,
+ "mean_token_accuracy": 0.6367855668067932,
+ "num_tokens": 12156928.0,
+ "step": 742
+ },
+ {
+ "entropy": 1.4250539541244507,
+ "epoch": 1.5010101010101011,
+ "grad_norm": 2.1306707859039307,
+ "learning_rate": 3.501010101010101e-06,
+ "loss": 1.4353611469268799,
+ "mean_token_accuracy": 0.6626160144805908,
+ "num_tokens": 12173312.0,
+ "step": 743
+ },
+ {
+ "entropy": 1.1440296173095703,
+ "epoch": 1.503030303030303,
+ "grad_norm": 2.053969383239746,
+ "learning_rate": 3.498989898989899e-06,
+ "loss": 1.1151821613311768,
+ "mean_token_accuracy": 0.7080483436584473,
+ "num_tokens": 12189696.0,
+ "step": 744
+ },
+ {
+ "entropy": 1.5290073156356812,
+ "epoch": 1.5050505050505052,
+ "grad_norm": 2.0550003051757812,
+ "learning_rate": 3.496969696969697e-06,
+ "loss": 1.5260624885559082,
+ "mean_token_accuracy": 0.6493038535118103,
+ "num_tokens": 12206080.0,
+ "step": 745
+ },
+ {
+ "entropy": 1.1096605062484741,
+ "epoch": 1.507070707070707,
+ "grad_norm": 1.8131766319274902,
+ "learning_rate": 3.494949494949495e-06,
+ "loss": 1.1221846342086792,
+ "mean_token_accuracy": 0.7263678312301636,
+ "num_tokens": 12222464.0,
+ "step": 746
+ },
+ {
+ "entropy": 1.282676339149475,
+ "epoch": 1.509090909090909,
+ "grad_norm": 2.3051960468292236,
+ "learning_rate": 3.492929292929293e-06,
+ "loss": 1.2863187789916992,
+ "mean_token_accuracy": 0.6765388250350952,
+ "num_tokens": 12238848.0,
+ "step": 747
+ },
+ {
+ "entropy": 1.2971303462982178,
+ "epoch": 1.511111111111111,
+ "grad_norm": 2.0721139907836914,
+ "learning_rate": 3.4909090909090913e-06,
+ "loss": 1.3010127544403076,
+ "mean_token_accuracy": 0.6753175258636475,
+ "num_tokens": 12255232.0,
+ "step": 748
+ },
+ {
+ "entropy": 1.3711751699447632,
+ "epoch": 1.513131313131313,
+ "grad_norm": 1.9657210111618042,
+ "learning_rate": 3.4888888888888896e-06,
+ "loss": 1.3703930377960205,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 12271616.0,
+ "step": 749
+ },
+ {
+ "entropy": 1.512154459953308,
+ "epoch": 1.5151515151515151,
+ "grad_norm": 2.214172124862671,
+ "learning_rate": 3.4868686868686875e-06,
+ "loss": 1.5243256092071533,
+ "mean_token_accuracy": 0.6485100388526917,
+ "num_tokens": 12288000.0,
+ "step": 750
+ },
+ {
+ "epoch": 1.5151515151515151,
+ "eval_entropy": 1.4458443743567313,
+ "eval_loss": 1.535510540008545,
+ "eval_mean_token_accuracy": 0.6444821915318889,
+ "eval_num_tokens": 12288000.0,
+ "eval_runtime": 43.8043,
+ "eval_samples_per_second": 22.601,
+ "eval_steps_per_second": 2.831,
+ "step": 750
+ },
+ {
+ "entropy": 1.2052820920944214,
+ "epoch": 1.5171717171717172,
+ "grad_norm": 2.104870319366455,
+ "learning_rate": 3.4848484848484854e-06,
+ "loss": 1.2207554578781128,
+ "mean_token_accuracy": 0.695713222026825,
+ "num_tokens": 12304384.0,
+ "step": 751
+ },
+ {
+ "entropy": 1.732282280921936,
+ "epoch": 1.5191919191919192,
+ "grad_norm": 2.101760149002075,
+ "learning_rate": 3.4828282828282833e-06,
+ "loss": 1.7461241483688354,
+ "mean_token_accuracy": 0.6505251526832581,
+ "num_tokens": 12320768.0,
+ "step": 752
+ },
+ {
+ "entropy": 1.5805878639221191,
+ "epoch": 1.5212121212121212,
+ "grad_norm": 2.139244318008423,
+ "learning_rate": 3.480808080808081e-06,
+ "loss": 1.5813164710998535,
+ "mean_token_accuracy": 0.6281143426895142,
+ "num_tokens": 12337152.0,
+ "step": 753
+ },
+ {
+ "entropy": 1.1882269382476807,
+ "epoch": 1.5232323232323233,
+ "grad_norm": 2.187206745147705,
+ "learning_rate": 3.4787878787878795e-06,
+ "loss": 1.1732902526855469,
+ "mean_token_accuracy": 0.7063385248184204,
+ "num_tokens": 12353536.0,
+ "step": 754
+ },
+ {
+ "entropy": 1.4743424654006958,
+ "epoch": 1.5252525252525253,
+ "grad_norm": 2.12687349319458,
+ "learning_rate": 3.4767676767676774e-06,
+ "loss": 1.4681663513183594,
+ "mean_token_accuracy": 0.6558378338813782,
+ "num_tokens": 12369920.0,
+ "step": 755
+ },
+ {
+ "entropy": 1.5533041954040527,
+ "epoch": 1.5272727272727273,
+ "grad_norm": 2.1306610107421875,
+ "learning_rate": 3.4747474747474752e-06,
+ "loss": 1.5599431991577148,
+ "mean_token_accuracy": 0.6399609446525574,
+ "num_tokens": 12386304.0,
+ "step": 756
+ },
+ {
+ "entropy": 0.8933209180831909,
+ "epoch": 1.5292929292929291,
+ "grad_norm": 2.425602912902832,
+ "learning_rate": 3.472727272727273e-06,
+ "loss": 0.8840203285217285,
+ "mean_token_accuracy": 0.7638006806373596,
+ "num_tokens": 12402688.0,
+ "step": 757
+ },
+ {
+ "entropy": 1.6764189004898071,
+ "epoch": 1.5313131313131314,
+ "grad_norm": 2.0684356689453125,
+ "learning_rate": 3.470707070707071e-06,
+ "loss": 1.6948609352111816,
+ "mean_token_accuracy": 0.6087567210197449,
+ "num_tokens": 12419072.0,
+ "step": 758
+ },
+ {
+ "entropy": 1.1875263452529907,
+ "epoch": 1.5333333333333332,
+ "grad_norm": 2.0625953674316406,
+ "learning_rate": 3.468686868686869e-06,
+ "loss": 1.1840041875839233,
+ "mean_token_accuracy": 0.7067660093307495,
+ "num_tokens": 12435456.0,
+ "step": 759
+ },
+ {
+ "entropy": 1.1589192152023315,
+ "epoch": 1.5353535353535355,
+ "grad_norm": 1.9212846755981445,
+ "learning_rate": 3.4666666666666672e-06,
+ "loss": 1.1537678241729736,
+ "mean_token_accuracy": 0.7107962965965271,
+ "num_tokens": 12451840.0,
+ "step": 760
+ },
+ {
+ "entropy": 0.9687032699584961,
+ "epoch": 1.5373737373737373,
+ "grad_norm": 1.9402192831039429,
+ "learning_rate": 3.464646464646465e-06,
+ "loss": 0.9954442977905273,
+ "mean_token_accuracy": 0.7412676811218262,
+ "num_tokens": 12468224.0,
+ "step": 761
+ },
+ {
+ "entropy": 1.4129019975662231,
+ "epoch": 1.5393939393939395,
+ "grad_norm": 2.0903310775756836,
+ "learning_rate": 3.462626262626263e-06,
+ "loss": 1.4131944179534912,
+ "mean_token_accuracy": 0.6676844358444214,
+ "num_tokens": 12484608.0,
+ "step": 762
+ },
+ {
+ "entropy": 1.5170351266860962,
+ "epoch": 1.5414141414141413,
+ "grad_norm": 2.12807035446167,
+ "learning_rate": 3.460606060606061e-06,
+ "loss": 1.5342246294021606,
+ "mean_token_accuracy": 0.6621885895729065,
+ "num_tokens": 12500992.0,
+ "step": 763
+ },
+ {
+ "entropy": 1.1815718412399292,
+ "epoch": 1.5434343434343434,
+ "grad_norm": 2.2491719722747803,
+ "learning_rate": 3.4585858585858588e-06,
+ "loss": 1.1669261455535889,
+ "mean_token_accuracy": 0.694614052772522,
+ "num_tokens": 12517376.0,
+ "step": 764
+ },
+ {
+ "entropy": 1.547598958015442,
+ "epoch": 1.5454545454545454,
+ "grad_norm": 2.136096954345703,
+ "learning_rate": 3.456565656565657e-06,
+ "loss": 1.5515470504760742,
+ "mean_token_accuracy": 0.648876428604126,
+ "num_tokens": 12533760.0,
+ "step": 765
+ },
+ {
+ "entropy": 0.7156143188476562,
+ "epoch": 1.5474747474747474,
+ "grad_norm": 1.8139498233795166,
+ "learning_rate": 3.454545454545455e-06,
+ "loss": 0.7052675485610962,
+ "mean_token_accuracy": 0.8103932738304138,
+ "num_tokens": 12550144.0,
+ "step": 766
+ },
+ {
+ "entropy": 1.400156855583191,
+ "epoch": 1.5494949494949495,
+ "grad_norm": 2.14924693107605,
+ "learning_rate": 3.452525252525253e-06,
+ "loss": 1.4047740697860718,
+ "mean_token_accuracy": 0.6719589829444885,
+ "num_tokens": 12566528.0,
+ "step": 767
+ },
+ {
+ "entropy": 1.8254657983779907,
+ "epoch": 1.5515151515151515,
+ "grad_norm": 2.1882269382476807,
+ "learning_rate": 3.4505050505050507e-06,
+ "loss": 1.8615440130233765,
+ "mean_token_accuracy": 0.5776746273040771,
+ "num_tokens": 12582912.0,
+ "step": 768
+ },
+ {
+ "entropy": 1.5947710275650024,
+ "epoch": 1.5535353535353535,
+ "grad_norm": 2.3221426010131836,
+ "learning_rate": 3.4484848484848486e-06,
+ "loss": 1.6178712844848633,
+ "mean_token_accuracy": 0.6210918426513672,
+ "num_tokens": 12599296.0,
+ "step": 769
+ },
+ {
+ "entropy": 1.2678714990615845,
+ "epoch": 1.5555555555555556,
+ "grad_norm": 1.970064640045166,
+ "learning_rate": 3.446464646464647e-06,
+ "loss": 1.2646088600158691,
+ "mean_token_accuracy": 0.6990107297897339,
+ "num_tokens": 12615680.0,
+ "step": 770
+ },
+ {
+ "entropy": 1.3723604679107666,
+ "epoch": 1.5575757575757576,
+ "grad_norm": 2.171534776687622,
+ "learning_rate": 3.444444444444445e-06,
+ "loss": 1.3890197277069092,
+ "mean_token_accuracy": 0.6709819436073303,
+ "num_tokens": 12632064.0,
+ "step": 771
+ },
+ {
+ "entropy": 1.0273096561431885,
+ "epoch": 1.5595959595959596,
+ "grad_norm": 2.072798490524292,
+ "learning_rate": 3.4424242424242427e-06,
+ "loss": 1.029193639755249,
+ "mean_token_accuracy": 0.7348558902740479,
+ "num_tokens": 12648448.0,
+ "step": 772
+ },
+ {
+ "entropy": 1.4004037380218506,
+ "epoch": 1.5616161616161617,
+ "grad_norm": 2.111480474472046,
+ "learning_rate": 3.4404040404040406e-06,
+ "loss": 1.4213340282440186,
+ "mean_token_accuracy": 0.660906195640564,
+ "num_tokens": 12664832.0,
+ "step": 773
+ },
+ {
+ "entropy": 1.533424735069275,
+ "epoch": 1.5636363636363635,
+ "grad_norm": 2.0949435234069824,
+ "learning_rate": 3.4383838383838385e-06,
+ "loss": 1.5259253978729248,
+ "mean_token_accuracy": 0.6544333100318909,
+ "num_tokens": 12681216.0,
+ "step": 774
+ },
+ {
+ "entropy": 1.5620275735855103,
+ "epoch": 1.5656565656565657,
+ "grad_norm": 2.339731454849243,
+ "learning_rate": 3.4363636363636364e-06,
+ "loss": 1.5596071481704712,
+ "mean_token_accuracy": 0.6290302872657776,
+ "num_tokens": 12697600.0,
+ "step": 775
+ },
+ {
+ "entropy": 1.3272082805633545,
+ "epoch": 1.5676767676767676,
+ "grad_norm": 2.0871188640594482,
+ "learning_rate": 3.4343434343434347e-06,
+ "loss": 1.3413164615631104,
+ "mean_token_accuracy": 0.6809965968132019,
+ "num_tokens": 12713984.0,
+ "step": 776
+ },
+ {
+ "entropy": 1.202813982963562,
+ "epoch": 1.5696969696969698,
+ "grad_norm": 2.0538578033447266,
+ "learning_rate": 3.4323232323232326e-06,
+ "loss": 1.1947424411773682,
+ "mean_token_accuracy": 0.6969956159591675,
+ "num_tokens": 12730368.0,
+ "step": 777
+ },
+ {
+ "entropy": 1.3332773447036743,
+ "epoch": 1.5717171717171716,
+ "grad_norm": 1.9941202402114868,
+ "learning_rate": 3.4303030303030305e-06,
+ "loss": 1.3345956802368164,
+ "mean_token_accuracy": 0.6761724352836609,
+ "num_tokens": 12746752.0,
+ "step": 778
+ },
+ {
+ "entropy": 1.1724364757537842,
+ "epoch": 1.5737373737373739,
+ "grad_norm": 2.213365316390991,
+ "learning_rate": 3.4282828282828284e-06,
+ "loss": 1.1479787826538086,
+ "mean_token_accuracy": 0.7132999300956726,
+ "num_tokens": 12763136.0,
+ "step": 779
+ },
+ {
+ "entropy": 1.4718358516693115,
+ "epoch": 1.5757575757575757,
+ "grad_norm": 1.9743510484695435,
+ "learning_rate": 3.4262626262626262e-06,
+ "loss": 1.4844720363616943,
+ "mean_token_accuracy": 0.656448483467102,
+ "num_tokens": 12779520.0,
+ "step": 780
+ },
+ {
+ "entropy": 1.362882375717163,
+ "epoch": 1.5777777777777777,
+ "grad_norm": 2.370483875274658,
+ "learning_rate": 3.4242424242424246e-06,
+ "loss": 1.350801706314087,
+ "mean_token_accuracy": 0.6707376837730408,
+ "num_tokens": 12795904.0,
+ "step": 781
+ },
+ {
+ "entropy": 1.8302308320999146,
+ "epoch": 1.5797979797979798,
+ "grad_norm": 2.19045090675354,
+ "learning_rate": 3.4222222222222224e-06,
+ "loss": 1.8371320962905884,
+ "mean_token_accuracy": 0.5929408669471741,
+ "num_tokens": 12812288.0,
+ "step": 782
+ },
+ {
+ "entropy": 1.3435529470443726,
+ "epoch": 1.5818181818181818,
+ "grad_norm": 2.1254351139068604,
+ "learning_rate": 3.4202020202020203e-06,
+ "loss": 1.3621928691864014,
+ "mean_token_accuracy": 0.6867367029190063,
+ "num_tokens": 12828672.0,
+ "step": 783
+ },
+ {
+ "entropy": 1.8402602672576904,
+ "epoch": 1.5838383838383838,
+ "grad_norm": 2.123666524887085,
+ "learning_rate": 3.4181818181818182e-06,
+ "loss": 1.8564848899841309,
+ "mean_token_accuracy": 0.5871397256851196,
+ "num_tokens": 12845056.0,
+ "step": 784
+ },
+ {
+ "entropy": 1.441917896270752,
+ "epoch": 1.5858585858585859,
+ "grad_norm": 2.3286895751953125,
+ "learning_rate": 3.416161616161616e-06,
+ "loss": 1.4724184274673462,
+ "mean_token_accuracy": 0.6438080072402954,
+ "num_tokens": 12861440.0,
+ "step": 785
+ },
+ {
+ "entropy": 1.3071452379226685,
+ "epoch": 1.587878787878788,
+ "grad_norm": 2.149143934249878,
+ "learning_rate": 3.414141414141414e-06,
+ "loss": 1.331390142440796,
+ "mean_token_accuracy": 0.679347813129425,
+ "num_tokens": 12877824.0,
+ "step": 786
+ },
+ {
+ "entropy": 1.3547145128250122,
+ "epoch": 1.58989898989899,
+ "grad_norm": 2.2531180381774902,
+ "learning_rate": 3.4121212121212123e-06,
+ "loss": 1.361851453781128,
+ "mean_token_accuracy": 0.6767830848693848,
+ "num_tokens": 12894208.0,
+ "step": 787
+ },
+ {
+ "entropy": 0.9811291098594666,
+ "epoch": 1.591919191919192,
+ "grad_norm": 2.1053760051727295,
+ "learning_rate": 3.41010101010101e-06,
+ "loss": 0.9885507822036743,
+ "mean_token_accuracy": 0.7480459213256836,
+ "num_tokens": 12910592.0,
+ "step": 788
+ },
+ {
+ "entropy": 1.4940402507781982,
+ "epoch": 1.593939393939394,
+ "grad_norm": 2.240074634552002,
+ "learning_rate": 3.408080808080808e-06,
+ "loss": 1.5014076232910156,
+ "mean_token_accuracy": 0.6441743969917297,
+ "num_tokens": 12926976.0,
+ "step": 789
+ },
+ {
+ "entropy": 1.8134219646453857,
+ "epoch": 1.595959595959596,
+ "grad_norm": 2.040239095687866,
+ "learning_rate": 3.406060606060606e-06,
+ "loss": 1.8437519073486328,
+ "mean_token_accuracy": 0.5904372334480286,
+ "num_tokens": 12943360.0,
+ "step": 790
+ },
+ {
+ "entropy": 1.7233681678771973,
+ "epoch": 1.5979797979797978,
+ "grad_norm": 2.381786823272705,
+ "learning_rate": 3.4040404040404047e-06,
+ "loss": 1.7328217029571533,
+ "mean_token_accuracy": 0.6004518866539001,
+ "num_tokens": 12959744.0,
+ "step": 791
+ },
+ {
+ "entropy": 1.3966271877288818,
+ "epoch": 1.6,
+ "grad_norm": 2.17006778717041,
+ "learning_rate": 3.4020202020202026e-06,
+ "loss": 1.4065337181091309,
+ "mean_token_accuracy": 0.6629824042320251,
+ "num_tokens": 12976128.0,
+ "step": 792
+ },
+ {
+ "entropy": 1.5002557039260864,
+ "epoch": 1.602020202020202,
+ "grad_norm": 2.558037281036377,
+ "learning_rate": 3.4000000000000005e-06,
+ "loss": 1.4841307401657104,
+ "mean_token_accuracy": 0.647838294506073,
+ "num_tokens": 12992512.0,
+ "step": 793
+ },
+ {
+ "entropy": 1.7432687282562256,
+ "epoch": 1.6040404040404042,
+ "grad_norm": 2.134734630584717,
+ "learning_rate": 3.3979797979797984e-06,
+ "loss": 1.7539207935333252,
+ "mean_token_accuracy": 0.6028333902359009,
+ "num_tokens": 13008896.0,
+ "step": 794
+ },
+ {
+ "entropy": 1.4490517377853394,
+ "epoch": 1.606060606060606,
+ "grad_norm": 2.1590232849121094,
+ "learning_rate": 3.3959595959595963e-06,
+ "loss": 1.468411922454834,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 13025280.0,
+ "step": 795
+ },
+ {
+ "entropy": 1.3823497295379639,
+ "epoch": 1.6080808080808082,
+ "grad_norm": 2.1508285999298096,
+ "learning_rate": 3.3939393939393946e-06,
+ "loss": 1.4011330604553223,
+ "mean_token_accuracy": 0.6530898809432983,
+ "num_tokens": 13041664.0,
+ "step": 796
+ },
+ {
+ "entropy": 1.6982436180114746,
+ "epoch": 1.61010101010101,
+ "grad_norm": 2.077131986618042,
+ "learning_rate": 3.3919191919191925e-06,
+ "loss": 1.727889060974121,
+ "mean_token_accuracy": 0.6232290863990784,
+ "num_tokens": 13058048.0,
+ "step": 797
+ },
+ {
+ "entropy": 1.7268915176391602,
+ "epoch": 1.612121212121212,
+ "grad_norm": 2.0703542232513428,
+ "learning_rate": 3.3898989898989903e-06,
+ "loss": 1.7333730459213257,
+ "mean_token_accuracy": 0.6110160946846008,
+ "num_tokens": 13074432.0,
+ "step": 798
+ },
+ {
+ "entropy": 1.6253595352172852,
+ "epoch": 1.614141414141414,
+ "grad_norm": 2.241154432296753,
+ "learning_rate": 3.3878787878787882e-06,
+ "loss": 1.6275582313537598,
+ "mean_token_accuracy": 0.6198094487190247,
+ "num_tokens": 13090816.0,
+ "step": 799
+ },
+ {
+ "entropy": 1.8784692287445068,
+ "epoch": 1.6161616161616161,
+ "grad_norm": 2.505871057510376,
+ "learning_rate": 3.385858585858586e-06,
+ "loss": 1.8784008026123047,
+ "mean_token_accuracy": 0.5944064259529114,
+ "num_tokens": 13107200.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.6161616161616161,
+ "eval_entropy": 1.4455043437980837,
+ "eval_loss": 1.5330992937088013,
+ "eval_mean_token_accuracy": 0.6448845310557273,
+ "eval_num_tokens": 13107200.0,
+ "eval_runtime": 43.766,
+ "eval_samples_per_second": 22.62,
+ "eval_steps_per_second": 2.833,
+ "step": 800
+ },
+ {
+ "entropy": 1.921440601348877,
+ "epoch": 1.6181818181818182,
+ "grad_norm": 2.1760783195495605,
+ "learning_rate": 3.3838383838383844e-06,
+ "loss": 1.9410110712051392,
+ "mean_token_accuracy": 0.5776746273040771,
+ "num_tokens": 13123584.0,
+ "step": 801
+ },
+ {
+ "entropy": 1.4233160018920898,
+ "epoch": 1.6202020202020202,
+ "grad_norm": 2.2687666416168213,
+ "learning_rate": 3.3818181818181823e-06,
+ "loss": 1.4465446472167969,
+ "mean_token_accuracy": 0.6488153338432312,
+ "num_tokens": 13139968.0,
+ "step": 802
+ },
+ {
+ "entropy": 1.697847843170166,
+ "epoch": 1.6222222222222222,
+ "grad_norm": 2.0649187564849854,
+ "learning_rate": 3.37979797979798e-06,
+ "loss": 1.7235385179519653,
+ "mean_token_accuracy": 0.6196262836456299,
+ "num_tokens": 13156352.0,
+ "step": 803
+ },
+ {
+ "entropy": 1.2027701139450073,
+ "epoch": 1.6242424242424243,
+ "grad_norm": 2.0115890502929688,
+ "learning_rate": 3.377777777777778e-06,
+ "loss": 1.1890676021575928,
+ "mean_token_accuracy": 0.6928431987762451,
+ "num_tokens": 13172736.0,
+ "step": 804
+ },
+ {
+ "entropy": 1.4847105741500854,
+ "epoch": 1.6262626262626263,
+ "grad_norm": 2.145098924636841,
+ "learning_rate": 3.375757575757576e-06,
+ "loss": 1.4817116260528564,
+ "mean_token_accuracy": 0.6415486335754395,
+ "num_tokens": 13189120.0,
+ "step": 805
+ },
+ {
+ "entropy": 1.3548893928527832,
+ "epoch": 1.6282828282828283,
+ "grad_norm": 2.3037521839141846,
+ "learning_rate": 3.3737373737373743e-06,
+ "loss": 1.3433952331542969,
+ "mean_token_accuracy": 0.6681729555130005,
+ "num_tokens": 13205504.0,
+ "step": 806
+ },
+ {
+ "entropy": 1.375793218612671,
+ "epoch": 1.6303030303030304,
+ "grad_norm": 2.0814852714538574,
+ "learning_rate": 3.371717171717172e-06,
+ "loss": 1.3506405353546143,
+ "mean_token_accuracy": 0.6634098887443542,
+ "num_tokens": 13221888.0,
+ "step": 807
+ },
+ {
+ "entropy": 1.1417323350906372,
+ "epoch": 1.6323232323232322,
+ "grad_norm": 2.0166866779327393,
+ "learning_rate": 3.36969696969697e-06,
+ "loss": 1.1731860637664795,
+ "mean_token_accuracy": 0.7123839855194092,
+ "num_tokens": 13238272.0,
+ "step": 808
+ },
+ {
+ "entropy": 1.3159022331237793,
+ "epoch": 1.6343434343434344,
+ "grad_norm": 1.9626281261444092,
+ "learning_rate": 3.367676767676768e-06,
+ "loss": 1.3286499977111816,
+ "mean_token_accuracy": 0.675561785697937,
+ "num_tokens": 13254656.0,
+ "step": 809
+ },
+ {
+ "entropy": 1.325775384902954,
+ "epoch": 1.6363636363636362,
+ "grad_norm": 2.1239242553710938,
+ "learning_rate": 3.365656565656566e-06,
+ "loss": 1.345514178276062,
+ "mean_token_accuracy": 0.6780043840408325,
+ "num_tokens": 13271040.0,
+ "step": 810
+ },
+ {
+ "entropy": 1.8307870626449585,
+ "epoch": 1.6383838383838385,
+ "grad_norm": 2.208296298980713,
+ "learning_rate": 3.3636363636363637e-06,
+ "loss": 1.8402234315872192,
+ "mean_token_accuracy": 0.5958719849586487,
+ "num_tokens": 13287424.0,
+ "step": 811
+ },
+ {
+ "entropy": 1.2596150636672974,
+ "epoch": 1.6404040404040403,
+ "grad_norm": 2.0936427116394043,
+ "learning_rate": 3.361616161616162e-06,
+ "loss": 1.2552804946899414,
+ "mean_token_accuracy": 0.6874083876609802,
+ "num_tokens": 13303808.0,
+ "step": 812
+ },
+ {
+ "entropy": 1.2575111389160156,
+ "epoch": 1.6424242424242426,
+ "grad_norm": 2.0232772827148438,
+ "learning_rate": 3.35959595959596e-06,
+ "loss": 1.2805989980697632,
+ "mean_token_accuracy": 0.6916829347610474,
+ "num_tokens": 13320192.0,
+ "step": 813
+ },
+ {
+ "entropy": 1.0270155668258667,
+ "epoch": 1.6444444444444444,
+ "grad_norm": 1.9090715646743774,
+ "learning_rate": 3.357575757575758e-06,
+ "loss": 1.0277824401855469,
+ "mean_token_accuracy": 0.7379091382026672,
+ "num_tokens": 13336576.0,
+ "step": 814
+ },
+ {
+ "entropy": 1.2992243766784668,
+ "epoch": 1.6464646464646466,
+ "grad_norm": 2.1718814373016357,
+ "learning_rate": 3.3555555555555557e-06,
+ "loss": 1.3278638124465942,
+ "mean_token_accuracy": 0.6764777898788452,
+ "num_tokens": 13352960.0,
+ "step": 815
+ },
+ {
+ "entropy": 1.5365362167358398,
+ "epoch": 1.6484848484848484,
+ "grad_norm": 2.0298495292663574,
+ "learning_rate": 3.3535353535353536e-06,
+ "loss": 1.5257508754730225,
+ "mean_token_accuracy": 0.6511358022689819,
+ "num_tokens": 13369344.0,
+ "step": 816
+ },
+ {
+ "entropy": 1.4384456872940063,
+ "epoch": 1.6505050505050505,
+ "grad_norm": 2.375277042388916,
+ "learning_rate": 3.351515151515152e-06,
+ "loss": 1.4287049770355225,
+ "mean_token_accuracy": 0.645639955997467,
+ "num_tokens": 13385728.0,
+ "step": 817
+ },
+ {
+ "entropy": 1.7104265689849854,
+ "epoch": 1.6525252525252525,
+ "grad_norm": 2.052535057067871,
+ "learning_rate": 3.34949494949495e-06,
+ "loss": 1.6971676349639893,
+ "mean_token_accuracy": 0.6159623861312866,
+ "num_tokens": 13402112.0,
+ "step": 818
+ },
+ {
+ "entropy": 1.5908539295196533,
+ "epoch": 1.6545454545454545,
+ "grad_norm": 2.047088861465454,
+ "learning_rate": 3.3474747474747477e-06,
+ "loss": 1.5640246868133545,
+ "mean_token_accuracy": 0.640754759311676,
+ "num_tokens": 13418496.0,
+ "step": 819
+ },
+ {
+ "entropy": 1.3660207986831665,
+ "epoch": 1.6565656565656566,
+ "grad_norm": 2.2711079120635986,
+ "learning_rate": 3.3454545454545456e-06,
+ "loss": 1.3601036071777344,
+ "mean_token_accuracy": 0.6577919125556946,
+ "num_tokens": 13434880.0,
+ "step": 820
+ },
+ {
+ "entropy": 1.5897634029388428,
+ "epoch": 1.6585858585858586,
+ "grad_norm": 2.0869712829589844,
+ "learning_rate": 3.3434343434343435e-06,
+ "loss": 1.5801420211791992,
+ "mean_token_accuracy": 0.6312897205352783,
+ "num_tokens": 13451264.0,
+ "step": 821
+ },
+ {
+ "entropy": 1.428406834602356,
+ "epoch": 1.6606060606060606,
+ "grad_norm": 2.049370765686035,
+ "learning_rate": 3.3414141414141413e-06,
+ "loss": 1.4145596027374268,
+ "mean_token_accuracy": 0.6649975776672363,
+ "num_tokens": 13467648.0,
+ "step": 822
+ },
+ {
+ "entropy": 1.5026675462722778,
+ "epoch": 1.6626262626262627,
+ "grad_norm": 2.157031297683716,
+ "learning_rate": 3.3393939393939397e-06,
+ "loss": 1.4902830123901367,
+ "mean_token_accuracy": 0.6524181962013245,
+ "num_tokens": 13484032.0,
+ "step": 823
+ },
+ {
+ "entropy": 1.4907052516937256,
+ "epoch": 1.6646464646464647,
+ "grad_norm": 2.1476478576660156,
+ "learning_rate": 3.3373737373737375e-06,
+ "loss": 1.5102436542510986,
+ "mean_token_accuracy": 0.6485100388526917,
+ "num_tokens": 13500416.0,
+ "step": 824
+ },
+ {
+ "entropy": 1.4277782440185547,
+ "epoch": 1.6666666666666665,
+ "grad_norm": 2.2880661487579346,
+ "learning_rate": 3.3353535353535354e-06,
+ "loss": 1.4358019828796387,
+ "mean_token_accuracy": 0.6522960662841797,
+ "num_tokens": 13516800.0,
+ "step": 825
+ },
+ {
+ "entropy": 1.5560128688812256,
+ "epoch": 1.6686868686868688,
+ "grad_norm": 2.048403024673462,
+ "learning_rate": 3.3333333333333333e-06,
+ "loss": 1.5472501516342163,
+ "mean_token_accuracy": 0.6488153338432312,
+ "num_tokens": 13533184.0,
+ "step": 826
+ },
+ {
+ "entropy": 1.665900707244873,
+ "epoch": 1.6707070707070706,
+ "grad_norm": 2.0828492641448975,
+ "learning_rate": 3.331313131313131e-06,
+ "loss": 1.6905372142791748,
+ "mean_token_accuracy": 0.629885196685791,
+ "num_tokens": 13549568.0,
+ "step": 827
+ },
+ {
+ "entropy": 1.3484426736831665,
+ "epoch": 1.6727272727272728,
+ "grad_norm": 2.1873531341552734,
+ "learning_rate": 3.3292929292929295e-06,
+ "loss": 1.3510258197784424,
+ "mean_token_accuracy": 0.6721421480178833,
+ "num_tokens": 13565952.0,
+ "step": 828
+ },
+ {
+ "entropy": 1.7577860355377197,
+ "epoch": 1.6747474747474747,
+ "grad_norm": 2.0467135906219482,
+ "learning_rate": 3.3272727272727274e-06,
+ "loss": 1.7791969776153564,
+ "mean_token_accuracy": 0.6028944849967957,
+ "num_tokens": 13582336.0,
+ "step": 829
+ },
+ {
+ "entropy": 1.4549124240875244,
+ "epoch": 1.676767676767677,
+ "grad_norm": 2.2004988193511963,
+ "learning_rate": 3.3252525252525253e-06,
+ "loss": 1.4512457847595215,
+ "mean_token_accuracy": 0.6521128416061401,
+ "num_tokens": 13598720.0,
+ "step": 830
+ },
+ {
+ "entropy": 1.2226758003234863,
+ "epoch": 1.6787878787878787,
+ "grad_norm": 2.0866682529449463,
+ "learning_rate": 3.323232323232323e-06,
+ "loss": 1.226635456085205,
+ "mean_token_accuracy": 0.6969345211982727,
+ "num_tokens": 13615104.0,
+ "step": 831
+ },
+ {
+ "entropy": 0.9826563000679016,
+ "epoch": 1.680808080808081,
+ "grad_norm": 1.9865771532058716,
+ "learning_rate": 3.321212121212121e-06,
+ "loss": 1.009648323059082,
+ "mean_token_accuracy": 0.7507327795028687,
+ "num_tokens": 13631488.0,
+ "step": 832
+ },
+ {
+ "entropy": 1.620038390159607,
+ "epoch": 1.6828282828282828,
+ "grad_norm": 2.1745760440826416,
+ "learning_rate": 3.3191919191919194e-06,
+ "loss": 1.615234136581421,
+ "mean_token_accuracy": 0.6305569410324097,
+ "num_tokens": 13647872.0,
+ "step": 833
+ },
+ {
+ "entropy": 1.4803876876831055,
+ "epoch": 1.6848484848484848,
+ "grad_norm": 2.328029155731201,
+ "learning_rate": 3.3171717171717177e-06,
+ "loss": 1.509049892425537,
+ "mean_token_accuracy": 0.6353810429573059,
+ "num_tokens": 13664256.0,
+ "step": 834
+ },
+ {
+ "entropy": 1.2290453910827637,
+ "epoch": 1.6868686868686869,
+ "grad_norm": 2.1777281761169434,
+ "learning_rate": 3.3151515151515156e-06,
+ "loss": 1.222726583480835,
+ "mean_token_accuracy": 0.6842330098152161,
+ "num_tokens": 13680640.0,
+ "step": 835
+ },
+ {
+ "entropy": 1.1965430974960327,
+ "epoch": 1.6888888888888889,
+ "grad_norm": 2.211397886276245,
+ "learning_rate": 3.3131313131313135e-06,
+ "loss": 1.2027852535247803,
+ "mean_token_accuracy": 0.7028578519821167,
+ "num_tokens": 13697024.0,
+ "step": 836
+ },
+ {
+ "entropy": 1.5326080322265625,
+ "epoch": 1.690909090909091,
+ "grad_norm": 2.8396589756011963,
+ "learning_rate": 3.3111111111111118e-06,
+ "loss": 1.5819613933563232,
+ "mean_token_accuracy": 0.625,
+ "num_tokens": 13713408.0,
+ "step": 837
+ },
+ {
+ "entropy": 1.2514865398406982,
+ "epoch": 1.692929292929293,
+ "grad_norm": 1.923771858215332,
+ "learning_rate": 3.3090909090909097e-06,
+ "loss": 1.2518126964569092,
+ "mean_token_accuracy": 0.6955300569534302,
+ "num_tokens": 13729792.0,
+ "step": 838
+ },
+ {
+ "entropy": 1.3717304468154907,
+ "epoch": 1.694949494949495,
+ "grad_norm": 2.0393056869506836,
+ "learning_rate": 3.3070707070707076e-06,
+ "loss": 1.400814175605774,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 13746176.0,
+ "step": 839
+ },
+ {
+ "entropy": 1.2871394157409668,
+ "epoch": 1.696969696969697,
+ "grad_norm": 2.114823579788208,
+ "learning_rate": 3.3050505050505054e-06,
+ "loss": 1.302154541015625,
+ "mean_token_accuracy": 0.6790425181388855,
+ "num_tokens": 13762560.0,
+ "step": 840
+ },
+ {
+ "entropy": 1.518404483795166,
+ "epoch": 1.698989898989899,
+ "grad_norm": 2.186727523803711,
+ "learning_rate": 3.3030303030303033e-06,
+ "loss": 1.5067068338394165,
+ "mean_token_accuracy": 0.638006865978241,
+ "num_tokens": 13778944.0,
+ "step": 841
+ },
+ {
+ "entropy": 1.5698254108428955,
+ "epoch": 1.7010101010101009,
+ "grad_norm": 2.159721851348877,
+ "learning_rate": 3.3010101010101016e-06,
+ "loss": 1.5568101406097412,
+ "mean_token_accuracy": 0.6398998498916626,
+ "num_tokens": 13795328.0,
+ "step": 842
+ },
+ {
+ "entropy": 1.5159670114517212,
+ "epoch": 1.7030303030303031,
+ "grad_norm": 2.0655386447906494,
+ "learning_rate": 3.2989898989898995e-06,
+ "loss": 1.5152846574783325,
+ "mean_token_accuracy": 0.6441133618354797,
+ "num_tokens": 13811712.0,
+ "step": 843
+ },
+ {
+ "entropy": 1.231048822402954,
+ "epoch": 1.705050505050505,
+ "grad_norm": 1.99764084815979,
+ "learning_rate": 3.2969696969696974e-06,
+ "loss": 1.2419885396957397,
+ "mean_token_accuracy": 0.6936370134353638,
+ "num_tokens": 13828096.0,
+ "step": 844
+ },
+ {
+ "entropy": 1.1431403160095215,
+ "epoch": 1.7070707070707072,
+ "grad_norm": 2.0046544075012207,
+ "learning_rate": 3.2949494949494953e-06,
+ "loss": 1.147315502166748,
+ "mean_token_accuracy": 0.7155593633651733,
+ "num_tokens": 13844480.0,
+ "step": 845
+ },
+ {
+ "entropy": 1.903164267539978,
+ "epoch": 1.709090909090909,
+ "grad_norm": 2.068286418914795,
+ "learning_rate": 3.292929292929293e-06,
+ "loss": 1.9086098670959473,
+ "mean_token_accuracy": 0.5785295367240906,
+ "num_tokens": 13860864.0,
+ "step": 846
+ },
+ {
+ "entropy": 1.028931736946106,
+ "epoch": 1.7111111111111112,
+ "grad_norm": 2.008197546005249,
+ "learning_rate": 3.290909090909091e-06,
+ "loss": 1.0251559019088745,
+ "mean_token_accuracy": 0.7308866381645203,
+ "num_tokens": 13877248.0,
+ "step": 847
+ },
+ {
+ "entropy": 1.8438282012939453,
+ "epoch": 1.713131313131313,
+ "grad_norm": 2.180811882019043,
+ "learning_rate": 3.2888888888888894e-06,
+ "loss": 1.8572561740875244,
+ "mean_token_accuracy": 0.5788959264755249,
+ "num_tokens": 13893632.0,
+ "step": 848
+ },
+ {
+ "entropy": 1.437190294265747,
+ "epoch": 1.7151515151515153,
+ "grad_norm": 2.1013762950897217,
+ "learning_rate": 3.2868686868686873e-06,
+ "loss": 1.4337413311004639,
+ "mean_token_accuracy": 0.6489985585212708,
+ "num_tokens": 13910016.0,
+ "step": 849
+ },
+ {
+ "entropy": 1.482985496520996,
+ "epoch": 1.7171717171717171,
+ "grad_norm": 2.290910243988037,
+ "learning_rate": 3.284848484848485e-06,
+ "loss": 1.4959741830825806,
+ "mean_token_accuracy": 0.6447850465774536,
+ "num_tokens": 13926400.0,
+ "step": 850
+ },
+ {
+ "epoch": 1.7171717171717171,
+ "eval_entropy": 1.447427170411233,
+ "eval_loss": 1.5309957265853882,
+ "eval_mean_token_accuracy": 0.6452888370521607,
+ "eval_num_tokens": 13926400.0,
+ "eval_runtime": 43.7619,
+ "eval_samples_per_second": 22.622,
+ "eval_steps_per_second": 2.834,
+ "step": 850
+ },
+ {
+ "entropy": 1.4470106363296509,
+ "epoch": 1.7191919191919192,
+ "grad_norm": 2.2015624046325684,
+ "learning_rate": 3.282828282828283e-06,
+ "loss": 1.462576150894165,
+ "mean_token_accuracy": 0.643991231918335,
+ "num_tokens": 13942784.0,
+ "step": 851
+ },
+ {
+ "entropy": 1.4063832759857178,
+ "epoch": 1.7212121212121212,
+ "grad_norm": 2.1743109226226807,
+ "learning_rate": 3.280808080808081e-06,
+ "loss": 1.402491569519043,
+ "mean_token_accuracy": 0.6533952355384827,
+ "num_tokens": 13959168.0,
+ "step": 852
+ },
+ {
+ "entropy": 1.3735251426696777,
+ "epoch": 1.7232323232323232,
+ "grad_norm": 2.1350960731506348,
+ "learning_rate": 3.2787878787878793e-06,
+ "loss": 1.383405327796936,
+ "mean_token_accuracy": 0.6767830848693848,
+ "num_tokens": 13975552.0,
+ "step": 853
+ },
+ {
+ "entropy": 1.359702229499817,
+ "epoch": 1.7252525252525253,
+ "grad_norm": 2.1547393798828125,
+ "learning_rate": 3.276767676767677e-06,
+ "loss": 1.3454554080963135,
+ "mean_token_accuracy": 0.6712262034416199,
+ "num_tokens": 13991936.0,
+ "step": 854
+ },
+ {
+ "entropy": 1.0641778707504272,
+ "epoch": 1.7272727272727273,
+ "grad_norm": 2.0301826000213623,
+ "learning_rate": 3.274747474747475e-06,
+ "loss": 1.0626115798950195,
+ "mean_token_accuracy": 0.7188568711280823,
+ "num_tokens": 14008320.0,
+ "step": 855
+ },
+ {
+ "entropy": 1.598792552947998,
+ "epoch": 1.7292929292929293,
+ "grad_norm": 2.3324217796325684,
+ "learning_rate": 3.272727272727273e-06,
+ "loss": 1.6028941869735718,
+ "mean_token_accuracy": 0.6462506055831909,
+ "num_tokens": 14024704.0,
+ "step": 856
+ },
+ {
+ "entropy": 1.6304137706756592,
+ "epoch": 1.7313131313131314,
+ "grad_norm": 1.9968358278274536,
+ "learning_rate": 3.270707070707071e-06,
+ "loss": 1.6449415683746338,
+ "mean_token_accuracy": 0.6322056651115417,
+ "num_tokens": 14041088.0,
+ "step": 857
+ },
+ {
+ "entropy": 1.3219174146652222,
+ "epoch": 1.7333333333333334,
+ "grad_norm": 2.059927225112915,
+ "learning_rate": 3.2686868686868687e-06,
+ "loss": 1.3487168550491333,
+ "mean_token_accuracy": 0.6769052147865295,
+ "num_tokens": 14057472.0,
+ "step": 858
+ },
+ {
+ "entropy": 1.4645651578903198,
+ "epoch": 1.7353535353535352,
+ "grad_norm": 2.068962812423706,
+ "learning_rate": 3.266666666666667e-06,
+ "loss": 1.4480202198028564,
+ "mean_token_accuracy": 0.6521128416061401,
+ "num_tokens": 14073856.0,
+ "step": 859
+ },
+ {
+ "entropy": 1.5005300045013428,
+ "epoch": 1.7373737373737375,
+ "grad_norm": 2.228736162185669,
+ "learning_rate": 3.264646464646465e-06,
+ "loss": 1.5110201835632324,
+ "mean_token_accuracy": 0.6482657790184021,
+ "num_tokens": 14090240.0,
+ "step": 860
+ },
+ {
+ "entropy": 1.1641852855682373,
+ "epoch": 1.7393939393939393,
+ "grad_norm": 2.0611488819122314,
+ "learning_rate": 3.262626262626263e-06,
+ "loss": 1.1905086040496826,
+ "mean_token_accuracy": 0.7104909420013428,
+ "num_tokens": 14106624.0,
+ "step": 861
+ },
+ {
+ "entropy": 1.4315950870513916,
+ "epoch": 1.7414141414141415,
+ "grad_norm": 1.9914237260818481,
+ "learning_rate": 3.2606060606060607e-06,
+ "loss": 1.467012882232666,
+ "mean_token_accuracy": 0.657608687877655,
+ "num_tokens": 14123008.0,
+ "step": 862
+ },
+ {
+ "entropy": 1.5196973085403442,
+ "epoch": 1.7434343434343433,
+ "grad_norm": 2.3258447647094727,
+ "learning_rate": 3.2585858585858586e-06,
+ "loss": 1.5382301807403564,
+ "mean_token_accuracy": 0.6370298266410828,
+ "num_tokens": 14139392.0,
+ "step": 863
+ },
+ {
+ "entropy": 1.5098228454589844,
+ "epoch": 1.7454545454545456,
+ "grad_norm": 2.146327495574951,
+ "learning_rate": 3.256565656565657e-06,
+ "loss": 1.540649652481079,
+ "mean_token_accuracy": 0.6439301371574402,
+ "num_tokens": 14155776.0,
+ "step": 864
+ },
+ {
+ "entropy": 1.128011703491211,
+ "epoch": 1.7474747474747474,
+ "grad_norm": 1.967443823814392,
+ "learning_rate": 3.2545454545454548e-06,
+ "loss": 1.1707985401153564,
+ "mean_token_accuracy": 0.7298485636711121,
+ "num_tokens": 14172160.0,
+ "step": 865
+ },
+ {
+ "entropy": 1.9117931127548218,
+ "epoch": 1.7494949494949497,
+ "grad_norm": 2.097781181335449,
+ "learning_rate": 3.2525252525252527e-06,
+ "loss": 1.9291374683380127,
+ "mean_token_accuracy": 0.580483615398407,
+ "num_tokens": 14188544.0,
+ "step": 866
+ },
+ {
+ "entropy": 1.9053187370300293,
+ "epoch": 1.7515151515151515,
+ "grad_norm": 1.9865039587020874,
+ "learning_rate": 3.2505050505050505e-06,
+ "loss": 1.932790756225586,
+ "mean_token_accuracy": 0.5770639777183533,
+ "num_tokens": 14204928.0,
+ "step": 867
+ },
+ {
+ "entropy": 1.2647870779037476,
+ "epoch": 1.7535353535353535,
+ "grad_norm": 2.099891185760498,
+ "learning_rate": 3.2484848484848484e-06,
+ "loss": 1.281562328338623,
+ "mean_token_accuracy": 0.6938812732696533,
+ "num_tokens": 14221312.0,
+ "step": 868
+ },
+ {
+ "entropy": 1.5446428060531616,
+ "epoch": 1.7555555555555555,
+ "grad_norm": 1.9044189453125,
+ "learning_rate": 3.2464646464646467e-06,
+ "loss": 1.5440425872802734,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 14237696.0,
+ "step": 869
+ },
+ {
+ "entropy": 1.179898977279663,
+ "epoch": 1.7575757575757576,
+ "grad_norm": 2.0257933139801025,
+ "learning_rate": 3.2444444444444446e-06,
+ "loss": 1.1607933044433594,
+ "mean_token_accuracy": 0.7053614854812622,
+ "num_tokens": 14254080.0,
+ "step": 870
+ },
+ {
+ "entropy": 1.0462855100631714,
+ "epoch": 1.7595959595959596,
+ "grad_norm": 1.8995661735534668,
+ "learning_rate": 3.2424242424242425e-06,
+ "loss": 1.0395057201385498,
+ "mean_token_accuracy": 0.7405959963798523,
+ "num_tokens": 14270464.0,
+ "step": 871
+ },
+ {
+ "entropy": 0.8866081833839417,
+ "epoch": 1.7616161616161616,
+ "grad_norm": 1.7807546854019165,
+ "learning_rate": 3.2404040404040404e-06,
+ "loss": 0.8795047998428345,
+ "mean_token_accuracy": 0.7721666097640991,
+ "num_tokens": 14286848.0,
+ "step": 872
+ },
+ {
+ "entropy": 1.9576365947723389,
+ "epoch": 1.7636363636363637,
+ "grad_norm": 2.1867618560791016,
+ "learning_rate": 3.2383838383838383e-06,
+ "loss": 1.9605103731155396,
+ "mean_token_accuracy": 0.5809110999107361,
+ "num_tokens": 14303232.0,
+ "step": 873
+ },
+ {
+ "entropy": 1.010751485824585,
+ "epoch": 1.7656565656565657,
+ "grad_norm": 1.9643300771713257,
+ "learning_rate": 3.236363636363636e-06,
+ "loss": 0.9990894794464111,
+ "mean_token_accuracy": 0.7386419177055359,
+ "num_tokens": 14319616.0,
+ "step": 874
+ },
+ {
+ "entropy": 1.3587232828140259,
+ "epoch": 1.7676767676767677,
+ "grad_norm": 2.2632040977478027,
+ "learning_rate": 3.2343434343434345e-06,
+ "loss": 1.3631021976470947,
+ "mean_token_accuracy": 0.665791392326355,
+ "num_tokens": 14336000.0,
+ "step": 875
+ },
+ {
+ "entropy": 1.6577962636947632,
+ "epoch": 1.7696969696969695,
+ "grad_norm": 2.3661980628967285,
+ "learning_rate": 3.232323232323233e-06,
+ "loss": 1.6802719831466675,
+ "mean_token_accuracy": 0.6024059653282166,
+ "num_tokens": 14352384.0,
+ "step": 876
+ },
+ {
+ "entropy": 1.4332902431488037,
+ "epoch": 1.7717171717171718,
+ "grad_norm": 2.2296342849731445,
+ "learning_rate": 3.2303030303030307e-06,
+ "loss": 1.4129014015197754,
+ "mean_token_accuracy": 0.6511358022689819,
+ "num_tokens": 14368768.0,
+ "step": 877
+ },
+ {
+ "entropy": 1.2260215282440186,
+ "epoch": 1.7737373737373736,
+ "grad_norm": 2.0659983158111572,
+ "learning_rate": 3.228282828282829e-06,
+ "loss": 1.2417192459106445,
+ "mean_token_accuracy": 0.693514883518219,
+ "num_tokens": 14385152.0,
+ "step": 878
+ },
+ {
+ "entropy": 1.5402687788009644,
+ "epoch": 1.7757575757575759,
+ "grad_norm": 2.2024054527282715,
+ "learning_rate": 3.226262626262627e-06,
+ "loss": 1.5535321235656738,
+ "mean_token_accuracy": 0.6331827044487,
+ "num_tokens": 14401536.0,
+ "step": 879
+ },
+ {
+ "entropy": 1.2205268144607544,
+ "epoch": 1.7777777777777777,
+ "grad_norm": 2.0056662559509277,
+ "learning_rate": 3.2242424242424248e-06,
+ "loss": 1.2244641780853271,
+ "mean_token_accuracy": 0.7037127614021301,
+ "num_tokens": 14417920.0,
+ "step": 880
+ },
+ {
+ "entropy": 1.542244791984558,
+ "epoch": 1.77979797979798,
+ "grad_norm": 2.0935254096984863,
+ "learning_rate": 3.2222222222222227e-06,
+ "loss": 1.5638453960418701,
+ "mean_token_accuracy": 0.648937463760376,
+ "num_tokens": 14434304.0,
+ "step": 881
+ },
+ {
+ "entropy": 1.4249905347824097,
+ "epoch": 1.7818181818181817,
+ "grad_norm": 1.9853826761245728,
+ "learning_rate": 3.2202020202020206e-06,
+ "loss": 1.4453399181365967,
+ "mean_token_accuracy": 0.6869809627532959,
+ "num_tokens": 14450688.0,
+ "step": 882
+ },
+ {
+ "entropy": 1.4777165651321411,
+ "epoch": 1.783838383838384,
+ "grad_norm": 2.064542055130005,
+ "learning_rate": 3.2181818181818184e-06,
+ "loss": 1.4756921529769897,
+ "mean_token_accuracy": 0.6640205383300781,
+ "num_tokens": 14467072.0,
+ "step": 883
+ },
+ {
+ "entropy": 1.3442282676696777,
+ "epoch": 1.7858585858585858,
+ "grad_norm": 2.043712854385376,
+ "learning_rate": 3.2161616161616168e-06,
+ "loss": 1.3412827253341675,
+ "mean_token_accuracy": 0.6821568012237549,
+ "num_tokens": 14483456.0,
+ "step": 884
+ },
+ {
+ "entropy": 1.5201579332351685,
+ "epoch": 1.7878787878787878,
+ "grad_norm": 2.060661792755127,
+ "learning_rate": 3.2141414141414146e-06,
+ "loss": 1.5367834568023682,
+ "mean_token_accuracy": 0.6442354917526245,
+ "num_tokens": 14499840.0,
+ "step": 885
+ },
+ {
+ "entropy": 1.1536649465560913,
+ "epoch": 1.7898989898989899,
+ "grad_norm": 2.1190037727355957,
+ "learning_rate": 3.2121212121212125e-06,
+ "loss": 1.1588165760040283,
+ "mean_token_accuracy": 0.7039570212364197,
+ "num_tokens": 14516224.0,
+ "step": 886
+ },
+ {
+ "entropy": 1.109966516494751,
+ "epoch": 1.791919191919192,
+ "grad_norm": 2.0320141315460205,
+ "learning_rate": 3.2101010101010104e-06,
+ "loss": 1.1113003492355347,
+ "mean_token_accuracy": 0.7123228907585144,
+ "num_tokens": 14532608.0,
+ "step": 887
+ },
+ {
+ "entropy": 1.5709099769592285,
+ "epoch": 1.793939393939394,
+ "grad_norm": 2.0467336177825928,
+ "learning_rate": 3.2080808080808083e-06,
+ "loss": 1.5823577642440796,
+ "mean_token_accuracy": 0.6404494643211365,
+ "num_tokens": 14548992.0,
+ "step": 888
+ },
+ {
+ "entropy": 1.4305545091629028,
+ "epoch": 1.795959595959596,
+ "grad_norm": 2.0764269828796387,
+ "learning_rate": 3.2060606060606066e-06,
+ "loss": 1.438415765762329,
+ "mean_token_accuracy": 0.6574255228042603,
+ "num_tokens": 14565376.0,
+ "step": 889
+ },
+ {
+ "entropy": 1.3523615598678589,
+ "epoch": 1.797979797979798,
+ "grad_norm": 2.167036294937134,
+ "learning_rate": 3.2040404040404045e-06,
+ "loss": 1.3782477378845215,
+ "mean_token_accuracy": 0.6645090579986572,
+ "num_tokens": 14581760.0,
+ "step": 890
+ },
+ {
+ "entropy": 1.491297721862793,
+ "epoch": 1.8,
+ "grad_norm": 2.3090412616729736,
+ "learning_rate": 3.2020202020202024e-06,
+ "loss": 1.4965641498565674,
+ "mean_token_accuracy": 0.636907696723938,
+ "num_tokens": 14598144.0,
+ "step": 891
+ },
+ {
+ "entropy": 1.2584501504898071,
+ "epoch": 1.802020202020202,
+ "grad_norm": 2.1699554920196533,
+ "learning_rate": 3.2000000000000003e-06,
+ "loss": 1.2622835636138916,
+ "mean_token_accuracy": 0.6901563405990601,
+ "num_tokens": 14614528.0,
+ "step": 892
+ },
+ {
+ "entropy": 2.149350643157959,
+ "epoch": 1.8040404040404039,
+ "grad_norm": 2.2669718265533447,
+ "learning_rate": 3.197979797979798e-06,
+ "loss": 2.167891263961792,
+ "mean_token_accuracy": 0.5497679710388184,
+ "num_tokens": 14630912.0,
+ "step": 893
+ },
+ {
+ "entropy": 1.1999561786651611,
+ "epoch": 1.8060606060606061,
+ "grad_norm": 2.163228988647461,
+ "learning_rate": 3.195959595959596e-06,
+ "loss": 1.2024329900741577,
+ "mean_token_accuracy": 0.7035906314849854,
+ "num_tokens": 14647296.0,
+ "step": 894
+ },
+ {
+ "entropy": 1.770652413368225,
+ "epoch": 1.808080808080808,
+ "grad_norm": 2.1631994247436523,
+ "learning_rate": 3.1939393939393944e-06,
+ "loss": 1.7568567991256714,
+ "mean_token_accuracy": 0.6030776500701904,
+ "num_tokens": 14663680.0,
+ "step": 895
+ },
+ {
+ "entropy": 1.2487529516220093,
+ "epoch": 1.8101010101010102,
+ "grad_norm": 1.987622857093811,
+ "learning_rate": 3.1919191919191923e-06,
+ "loss": 1.255242109298706,
+ "mean_token_accuracy": 0.6929042339324951,
+ "num_tokens": 14680064.0,
+ "step": 896
+ },
+ {
+ "entropy": 1.138524055480957,
+ "epoch": 1.812121212121212,
+ "grad_norm": 2.0367984771728516,
+ "learning_rate": 3.18989898989899e-06,
+ "loss": 1.1514946222305298,
+ "mean_token_accuracy": 0.7093917727470398,
+ "num_tokens": 14696448.0,
+ "step": 897
+ },
+ {
+ "entropy": 1.3337515592575073,
+ "epoch": 1.8141414141414143,
+ "grad_norm": 1.9483140707015991,
+ "learning_rate": 3.187878787878788e-06,
+ "loss": 1.3251439332962036,
+ "mean_token_accuracy": 0.6861260533332825,
+ "num_tokens": 14712832.0,
+ "step": 898
+ },
+ {
+ "entropy": 1.047120451927185,
+ "epoch": 1.816161616161616,
+ "grad_norm": 2.0481390953063965,
+ "learning_rate": 3.185858585858586e-06,
+ "loss": 1.071772575378418,
+ "mean_token_accuracy": 0.7275891304016113,
+ "num_tokens": 14729216.0,
+ "step": 899
+ },
+ {
+ "entropy": 1.3311363458633423,
+ "epoch": 1.8181818181818183,
+ "grad_norm": 2.3203413486480713,
+ "learning_rate": 3.1838383838383842e-06,
+ "loss": 1.334134817123413,
+ "mean_token_accuracy": 0.6643869280815125,
+ "num_tokens": 14745600.0,
+ "step": 900
+ },
+ {
+ "epoch": 1.8181818181818183,
+ "eval_entropy": 1.4476436400605786,
+ "eval_loss": 1.5290467739105225,
+ "eval_mean_token_accuracy": 0.6456143543604882,
+ "eval_num_tokens": 14745600.0,
+ "eval_runtime": 43.8113,
+ "eval_samples_per_second": 22.597,
+ "eval_steps_per_second": 2.83,
+ "step": 900
+ },
+ {
+ "entropy": 1.6842114925384521,
+ "epoch": 1.8202020202020202,
+ "grad_norm": 2.1709823608398438,
+ "learning_rate": 3.181818181818182e-06,
+ "loss": 1.6816682815551758,
+ "mean_token_accuracy": 0.6033830046653748,
+ "num_tokens": 14761984.0,
+ "step": 901
+ },
+ {
+ "entropy": 1.2661798000335693,
+ "epoch": 1.8222222222222222,
+ "grad_norm": 2.113783836364746,
+ "learning_rate": 3.17979797979798e-06,
+ "loss": 1.249183177947998,
+ "mean_token_accuracy": 0.6865534782409668,
+ "num_tokens": 14778368.0,
+ "step": 902
+ },
+ {
+ "entropy": 1.2666339874267578,
+ "epoch": 1.8242424242424242,
+ "grad_norm": 2.0210978984832764,
+ "learning_rate": 3.177777777777778e-06,
+ "loss": 1.2548515796661377,
+ "mean_token_accuracy": 0.686431348323822,
+ "num_tokens": 14794752.0,
+ "step": 903
+ },
+ {
+ "entropy": 1.1660066843032837,
+ "epoch": 1.8262626262626263,
+ "grad_norm": 2.0998034477233887,
+ "learning_rate": 3.1757575757575758e-06,
+ "loss": 1.1654324531555176,
+ "mean_token_accuracy": 0.695713222026825,
+ "num_tokens": 14811136.0,
+ "step": 904
+ },
+ {
+ "entropy": 1.2902735471725464,
+ "epoch": 1.8282828282828283,
+ "grad_norm": 2.1510303020477295,
+ "learning_rate": 3.173737373737374e-06,
+ "loss": 1.2879812717437744,
+ "mean_token_accuracy": 0.6693942546844482,
+ "num_tokens": 14827520.0,
+ "step": 905
+ },
+ {
+ "entropy": 1.1441799402236938,
+ "epoch": 1.8303030303030303,
+ "grad_norm": 1.989449143409729,
+ "learning_rate": 3.171717171717172e-06,
+ "loss": 1.1552281379699707,
+ "mean_token_accuracy": 0.7127503752708435,
+ "num_tokens": 14843904.0,
+ "step": 906
+ },
+ {
+ "entropy": 1.08464515209198,
+ "epoch": 1.8323232323232324,
+ "grad_norm": 2.094696044921875,
+ "learning_rate": 3.16969696969697e-06,
+ "loss": 1.0758531093597412,
+ "mean_token_accuracy": 0.7164142727851868,
+ "num_tokens": 14860288.0,
+ "step": 907
+ },
+ {
+ "entropy": 1.3847618103027344,
+ "epoch": 1.8343434343434344,
+ "grad_norm": 2.207976818084717,
+ "learning_rate": 3.1676767676767678e-06,
+ "loss": 1.3722931146621704,
+ "mean_token_accuracy": 0.6741573214530945,
+ "num_tokens": 14876672.0,
+ "step": 908
+ },
+ {
+ "entropy": 1.3558534383773804,
+ "epoch": 1.8363636363636364,
+ "grad_norm": 2.166674852371216,
+ "learning_rate": 3.1656565656565656e-06,
+ "loss": 1.3612618446350098,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 14893056.0,
+ "step": 909
+ },
+ {
+ "entropy": 1.4160822629928589,
+ "epoch": 1.8383838383838382,
+ "grad_norm": 2.2242727279663086,
+ "learning_rate": 3.1636363636363635e-06,
+ "loss": 1.408278226852417,
+ "mean_token_accuracy": 0.6634098887443542,
+ "num_tokens": 14909440.0,
+ "step": 910
+ },
+ {
+ "entropy": 1.1337573528289795,
+ "epoch": 1.8404040404040405,
+ "grad_norm": 2.1882550716400146,
+ "learning_rate": 3.161616161616162e-06,
+ "loss": 1.1503205299377441,
+ "mean_token_accuracy": 0.7059721350669861,
+ "num_tokens": 14925824.0,
+ "step": 911
+ },
+ {
+ "entropy": 1.4373403787612915,
+ "epoch": 1.8424242424242423,
+ "grad_norm": 2.1595654487609863,
+ "learning_rate": 3.1595959595959597e-06,
+ "loss": 1.4344165325164795,
+ "mean_token_accuracy": 0.6599902510643005,
+ "num_tokens": 14942208.0,
+ "step": 912
+ },
+ {
+ "entropy": 1.0798827409744263,
+ "epoch": 1.8444444444444446,
+ "grad_norm": 2.101088047027588,
+ "learning_rate": 3.1575757575757576e-06,
+ "loss": 1.0873513221740723,
+ "mean_token_accuracy": 0.7169027924537659,
+ "num_tokens": 14958592.0,
+ "step": 913
+ },
+ {
+ "entropy": 1.7024599313735962,
+ "epoch": 1.8464646464646464,
+ "grad_norm": 2.291907548904419,
+ "learning_rate": 3.1555555555555555e-06,
+ "loss": 1.7014999389648438,
+ "mean_token_accuracy": 0.6105275750160217,
+ "num_tokens": 14974976.0,
+ "step": 914
+ },
+ {
+ "entropy": 1.7765953540802002,
+ "epoch": 1.8484848484848486,
+ "grad_norm": 2.1465439796447754,
+ "learning_rate": 3.1535353535353534e-06,
+ "loss": 1.788269281387329,
+ "mean_token_accuracy": 0.6066194176673889,
+ "num_tokens": 14991360.0,
+ "step": 915
+ },
+ {
+ "entropy": 1.5223884582519531,
+ "epoch": 1.8505050505050504,
+ "grad_norm": 2.313291549682617,
+ "learning_rate": 3.1515151515151517e-06,
+ "loss": 1.55397367477417,
+ "mean_token_accuracy": 0.6377626061439514,
+ "num_tokens": 15007744.0,
+ "step": 916
+ },
+ {
+ "entropy": 1.5820955038070679,
+ "epoch": 1.8525252525252527,
+ "grad_norm": 2.094886541366577,
+ "learning_rate": 3.1494949494949496e-06,
+ "loss": 1.58372962474823,
+ "mean_token_accuracy": 0.6339154839515686,
+ "num_tokens": 15024128.0,
+ "step": 917
+ },
+ {
+ "entropy": 1.7399076223373413,
+ "epoch": 1.8545454545454545,
+ "grad_norm": 2.0311105251312256,
+ "learning_rate": 3.1474747474747475e-06,
+ "loss": 1.7362079620361328,
+ "mean_token_accuracy": 0.604421079158783,
+ "num_tokens": 15040512.0,
+ "step": 918
+ },
+ {
+ "entropy": 1.4311537742614746,
+ "epoch": 1.8565656565656565,
+ "grad_norm": 2.13740873336792,
+ "learning_rate": 3.145454545454546e-06,
+ "loss": 1.4574000835418701,
+ "mean_token_accuracy": 0.648876428604126,
+ "num_tokens": 15056896.0,
+ "step": 919
+ },
+ {
+ "entropy": 1.6997709274291992,
+ "epoch": 1.8585858585858586,
+ "grad_norm": 2.1604959964752197,
+ "learning_rate": 3.143434343434344e-06,
+ "loss": 1.694093942642212,
+ "mean_token_accuracy": 0.6144357323646545,
+ "num_tokens": 15073280.0,
+ "step": 920
+ },
+ {
+ "entropy": 1.5796921253204346,
+ "epoch": 1.8606060606060606,
+ "grad_norm": 2.3852932453155518,
+ "learning_rate": 3.141414141414142e-06,
+ "loss": 1.5799579620361328,
+ "mean_token_accuracy": 0.6322667598724365,
+ "num_tokens": 15089664.0,
+ "step": 921
+ },
+ {
+ "entropy": 1.6185977458953857,
+ "epoch": 1.8626262626262626,
+ "grad_norm": 2.0631208419799805,
+ "learning_rate": 3.13939393939394e-06,
+ "loss": 1.6541715860366821,
+ "mean_token_accuracy": 0.632083535194397,
+ "num_tokens": 15106048.0,
+ "step": 922
+ },
+ {
+ "entropy": 1.5872372388839722,
+ "epoch": 1.8646464646464647,
+ "grad_norm": 2.154554843902588,
+ "learning_rate": 3.1373737373737378e-06,
+ "loss": 1.5946767330169678,
+ "mean_token_accuracy": 0.6294577717781067,
+ "num_tokens": 15122432.0,
+ "step": 923
+ },
+ {
+ "entropy": 1.6059986352920532,
+ "epoch": 1.8666666666666667,
+ "grad_norm": 1.9893742799758911,
+ "learning_rate": 3.1353535353535357e-06,
+ "loss": 1.6153039932250977,
+ "mean_token_accuracy": 0.6373962163925171,
+ "num_tokens": 15138816.0,
+ "step": 924
+ },
+ {
+ "entropy": 1.3143881559371948,
+ "epoch": 1.8686868686868687,
+ "grad_norm": 1.8989832401275635,
+ "learning_rate": 3.133333333333334e-06,
+ "loss": 1.3332319259643555,
+ "mean_token_accuracy": 0.6842330098152161,
+ "num_tokens": 15155200.0,
+ "step": 925
+ },
+ {
+ "entropy": 1.0474469661712646,
+ "epoch": 1.8707070707070708,
+ "grad_norm": 1.9129916429519653,
+ "learning_rate": 3.131313131313132e-06,
+ "loss": 1.0238264799118042,
+ "mean_token_accuracy": 0.7459697127342224,
+ "num_tokens": 15171584.0,
+ "step": 926
+ },
+ {
+ "entropy": 1.581508994102478,
+ "epoch": 1.8727272727272726,
+ "grad_norm": 2.0047285556793213,
+ "learning_rate": 3.1292929292929297e-06,
+ "loss": 1.6087100505828857,
+ "mean_token_accuracy": 0.6282364726066589,
+ "num_tokens": 15187968.0,
+ "step": 927
+ },
+ {
+ "entropy": 1.0985661745071411,
+ "epoch": 1.8747474747474748,
+ "grad_norm": 2.1207540035247803,
+ "learning_rate": 3.1272727272727276e-06,
+ "loss": 1.1158297061920166,
+ "mean_token_accuracy": 0.7111626863479614,
+ "num_tokens": 15204352.0,
+ "step": 928
+ },
+ {
+ "entropy": 1.4591490030288696,
+ "epoch": 1.8767676767676766,
+ "grad_norm": 2.2879691123962402,
+ "learning_rate": 3.1252525252525255e-06,
+ "loss": 1.4775316715240479,
+ "mean_token_accuracy": 0.6477161645889282,
+ "num_tokens": 15220736.0,
+ "step": 929
+ },
+ {
+ "entropy": 1.5469937324523926,
+ "epoch": 1.878787878787879,
+ "grad_norm": 2.0972726345062256,
+ "learning_rate": 3.1232323232323234e-06,
+ "loss": 1.5949021577835083,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 15237120.0,
+ "step": 930
+ },
+ {
+ "entropy": 1.363472819328308,
+ "epoch": 1.8808080808080807,
+ "grad_norm": 2.149606943130493,
+ "learning_rate": 3.1212121212121217e-06,
+ "loss": 1.358612298965454,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 15253504.0,
+ "step": 931
+ },
+ {
+ "entropy": 1.189648985862732,
+ "epoch": 1.882828282828283,
+ "grad_norm": 2.2575035095214844,
+ "learning_rate": 3.1191919191919196e-06,
+ "loss": 1.209303379058838,
+ "mean_token_accuracy": 0.7002320289611816,
+ "num_tokens": 15269888.0,
+ "step": 932
+ },
+ {
+ "entropy": 1.3054684400558472,
+ "epoch": 1.8848484848484848,
+ "grad_norm": 2.243915319442749,
+ "learning_rate": 3.1171717171717175e-06,
+ "loss": 1.333367109298706,
+ "mean_token_accuracy": 0.6703712940216064,
+ "num_tokens": 15286272.0,
+ "step": 933
+ },
+ {
+ "entropy": 1.6298167705535889,
+ "epoch": 1.886868686868687,
+ "grad_norm": 1.9654396772384644,
+ "learning_rate": 3.1151515151515154e-06,
+ "loss": 1.6496453285217285,
+ "mean_token_accuracy": 0.6248778700828552,
+ "num_tokens": 15302656.0,
+ "step": 934
+ },
+ {
+ "entropy": 1.1228219270706177,
+ "epoch": 1.8888888888888888,
+ "grad_norm": 2.2492377758026123,
+ "learning_rate": 3.1131313131313133e-06,
+ "loss": 1.1560063362121582,
+ "mean_token_accuracy": 0.699499249458313,
+ "num_tokens": 15319040.0,
+ "step": 935
+ },
+ {
+ "entropy": 1.7481759786605835,
+ "epoch": 1.8909090909090909,
+ "grad_norm": 2.1635665893554688,
+ "learning_rate": 3.1111111111111116e-06,
+ "loss": 1.737868070602417,
+ "mean_token_accuracy": 0.6030776500701904,
+ "num_tokens": 15335424.0,
+ "step": 936
+ },
+ {
+ "entropy": 1.3964993953704834,
+ "epoch": 1.892929292929293,
+ "grad_norm": 2.262946367263794,
+ "learning_rate": 3.1090909090909095e-06,
+ "loss": 1.3927817344665527,
+ "mean_token_accuracy": 0.6546775698661804,
+ "num_tokens": 15351808.0,
+ "step": 937
+ },
+ {
+ "entropy": 1.2503907680511475,
+ "epoch": 1.894949494949495,
+ "grad_norm": 1.9837188720703125,
+ "learning_rate": 3.1070707070707074e-06,
+ "loss": 1.2529189586639404,
+ "mean_token_accuracy": 0.6965681314468384,
+ "num_tokens": 15368192.0,
+ "step": 938
+ },
+ {
+ "entropy": 0.9774144291877747,
+ "epoch": 1.896969696969697,
+ "grad_norm": 1.9201257228851318,
+ "learning_rate": 3.1050505050505052e-06,
+ "loss": 0.9864459037780762,
+ "mean_token_accuracy": 0.7534807324409485,
+ "num_tokens": 15384576.0,
+ "step": 939
+ },
+ {
+ "entropy": 1.4065781831741333,
+ "epoch": 1.898989898989899,
+ "grad_norm": 2.357865571975708,
+ "learning_rate": 3.103030303030303e-06,
+ "loss": 1.428115725517273,
+ "mean_token_accuracy": 0.6493649482727051,
+ "num_tokens": 15400960.0,
+ "step": 940
+ },
+ {
+ "entropy": 1.1632903814315796,
+ "epoch": 1.901010101010101,
+ "grad_norm": 1.8824918270111084,
+ "learning_rate": 3.1010101010101014e-06,
+ "loss": 1.1478252410888672,
+ "mean_token_accuracy": 0.7158036231994629,
+ "num_tokens": 15417344.0,
+ "step": 941
+ },
+ {
+ "entropy": 1.7470908164978027,
+ "epoch": 1.903030303030303,
+ "grad_norm": 2.2958669662475586,
+ "learning_rate": 3.0989898989898993e-06,
+ "loss": 1.7697877883911133,
+ "mean_token_accuracy": 0.5892769694328308,
+ "num_tokens": 15433728.0,
+ "step": 942
+ },
+ {
+ "entropy": 1.2897151708602905,
+ "epoch": 1.905050505050505,
+ "grad_norm": 2.155731439590454,
+ "learning_rate": 3.0969696969696972e-06,
+ "loss": 1.2971919775009155,
+ "mean_token_accuracy": 0.6731802821159363,
+ "num_tokens": 15450112.0,
+ "step": 943
+ },
+ {
+ "entropy": 1.2687026262283325,
+ "epoch": 1.907070707070707,
+ "grad_norm": 2.0896284580230713,
+ "learning_rate": 3.094949494949495e-06,
+ "loss": 1.2423906326293945,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 15466496.0,
+ "step": 944
+ },
+ {
+ "entropy": 1.5710495710372925,
+ "epoch": 1.9090909090909092,
+ "grad_norm": 2.200758457183838,
+ "learning_rate": 3.092929292929293e-06,
+ "loss": 1.5329574346542358,
+ "mean_token_accuracy": 0.6560820937156677,
+ "num_tokens": 15482880.0,
+ "step": 945
+ },
+ {
+ "entropy": 1.1555253267288208,
+ "epoch": 1.911111111111111,
+ "grad_norm": 2.278230905532837,
+ "learning_rate": 3.090909090909091e-06,
+ "loss": 1.1469731330871582,
+ "mean_token_accuracy": 0.7220932841300964,
+ "num_tokens": 15499264.0,
+ "step": 946
+ },
+ {
+ "entropy": 1.2870018482208252,
+ "epoch": 1.9131313131313132,
+ "grad_norm": 1.8973854780197144,
+ "learning_rate": 3.088888888888889e-06,
+ "loss": 1.2787907123565674,
+ "mean_token_accuracy": 0.6885075569152832,
+ "num_tokens": 15515648.0,
+ "step": 947
+ },
+ {
+ "entropy": 1.324872612953186,
+ "epoch": 1.915151515151515,
+ "grad_norm": 2.1889214515686035,
+ "learning_rate": 3.086868686868687e-06,
+ "loss": 1.3286981582641602,
+ "mean_token_accuracy": 0.6743404865264893,
+ "num_tokens": 15532032.0,
+ "step": 948
+ },
+ {
+ "entropy": 1.5601656436920166,
+ "epoch": 1.9171717171717173,
+ "grad_norm": 2.304993152618408,
+ "learning_rate": 3.084848484848485e-06,
+ "loss": 1.5766493082046509,
+ "mean_token_accuracy": 0.6172447204589844,
+ "num_tokens": 15548416.0,
+ "step": 949
+ },
+ {
+ "entropy": 1.4633477926254272,
+ "epoch": 1.9191919191919191,
+ "grad_norm": 1.9083963632583618,
+ "learning_rate": 3.082828282828283e-06,
+ "loss": 1.4554777145385742,
+ "mean_token_accuracy": 0.6667073965072632,
+ "num_tokens": 15564800.0,
+ "step": 950
+ },
+ {
+ "epoch": 1.9191919191919191,
+ "eval_entropy": 1.4443931824737979,
+ "eval_loss": 1.5272752046585083,
+ "eval_mean_token_accuracy": 0.6459201723337173,
+ "eval_num_tokens": 15564800.0,
+ "eval_runtime": 43.7243,
+ "eval_samples_per_second": 22.642,
+ "eval_steps_per_second": 2.836,
+ "step": 950
+ },
+ {
+ "entropy": 1.3350679874420166,
+ "epoch": 1.9212121212121214,
+ "grad_norm": 2.139172315597534,
+ "learning_rate": 3.0808080808080807e-06,
+ "loss": 1.3285927772521973,
+ "mean_token_accuracy": 0.6833781003952026,
+ "num_tokens": 15581184.0,
+ "step": 951
+ },
+ {
+ "entropy": 1.2373814582824707,
+ "epoch": 1.9232323232323232,
+ "grad_norm": 2.1068115234375,
+ "learning_rate": 3.078787878787879e-06,
+ "loss": 1.2527921199798584,
+ "mean_token_accuracy": 0.6969345211982727,
+ "num_tokens": 15597568.0,
+ "step": 952
+ },
+ {
+ "entropy": 1.2182631492614746,
+ "epoch": 1.9252525252525252,
+ "grad_norm": 2.1326634883880615,
+ "learning_rate": 3.076767676767677e-06,
+ "loss": 1.2174904346466064,
+ "mean_token_accuracy": 0.6905227303504944,
+ "num_tokens": 15613952.0,
+ "step": 953
+ },
+ {
+ "entropy": 0.9768888354301453,
+ "epoch": 1.9272727272727272,
+ "grad_norm": 1.9833085536956787,
+ "learning_rate": 3.074747474747475e-06,
+ "loss": 0.9956569671630859,
+ "mean_token_accuracy": 0.7401685118675232,
+ "num_tokens": 15630336.0,
+ "step": 954
+ },
+ {
+ "entropy": 0.7818430066108704,
+ "epoch": 1.9292929292929293,
+ "grad_norm": 1.9219205379486084,
+ "learning_rate": 3.0727272727272727e-06,
+ "loss": 0.7922182083129883,
+ "mean_token_accuracy": 0.7827919125556946,
+ "num_tokens": 15646720.0,
+ "step": 955
+ },
+ {
+ "entropy": 1.6172020435333252,
+ "epoch": 1.9313131313131313,
+ "grad_norm": 1.9390695095062256,
+ "learning_rate": 3.0707070707070706e-06,
+ "loss": 1.6629729270935059,
+ "mean_token_accuracy": 0.6192598938941956,
+ "num_tokens": 15663104.0,
+ "step": 956
+ },
+ {
+ "entropy": 1.291207194328308,
+ "epoch": 1.9333333333333333,
+ "grad_norm": 1.9242857694625854,
+ "learning_rate": 3.068686868686869e-06,
+ "loss": 1.2721552848815918,
+ "mean_token_accuracy": 0.6867367029190063,
+ "num_tokens": 15679488.0,
+ "step": 957
+ },
+ {
+ "entropy": 1.3730298280715942,
+ "epoch": 1.9353535353535354,
+ "grad_norm": 1.9483041763305664,
+ "learning_rate": 3.066666666666667e-06,
+ "loss": 1.3835055828094482,
+ "mean_token_accuracy": 0.6745237112045288,
+ "num_tokens": 15695872.0,
+ "step": 958
+ },
+ {
+ "entropy": 1.1266423463821411,
+ "epoch": 1.9373737373737374,
+ "grad_norm": 2.1663992404937744,
+ "learning_rate": 3.0646464646464647e-06,
+ "loss": 1.1091173887252808,
+ "mean_token_accuracy": 0.7151318788528442,
+ "num_tokens": 15712256.0,
+ "step": 959
+ },
+ {
+ "entropy": 1.298812747001648,
+ "epoch": 1.9393939393939394,
+ "grad_norm": 2.0564448833465576,
+ "learning_rate": 3.0626262626262626e-06,
+ "loss": 1.3167932033538818,
+ "mean_token_accuracy": 0.6812408566474915,
+ "num_tokens": 15728640.0,
+ "step": 960
+ },
+ {
+ "entropy": 1.7007938623428345,
+ "epoch": 1.9414141414141413,
+ "grad_norm": 2.1043670177459717,
+ "learning_rate": 3.0606060606060605e-06,
+ "loss": 1.6956250667572021,
+ "mean_token_accuracy": 0.6194430589675903,
+ "num_tokens": 15745024.0,
+ "step": 961
+ },
+ {
+ "entropy": 1.408955693244934,
+ "epoch": 1.9434343434343435,
+ "grad_norm": 2.0432121753692627,
+ "learning_rate": 3.058585858585859e-06,
+ "loss": 1.3905062675476074,
+ "mean_token_accuracy": 0.6662799119949341,
+ "num_tokens": 15761408.0,
+ "step": 962
+ },
+ {
+ "entropy": 1.938867211341858,
+ "epoch": 1.9454545454545453,
+ "grad_norm": 2.3359744548797607,
+ "learning_rate": 3.056565656565657e-06,
+ "loss": 1.9670305252075195,
+ "mean_token_accuracy": 0.5845139026641846,
+ "num_tokens": 15777792.0,
+ "step": 963
+ },
+ {
+ "entropy": 1.5049448013305664,
+ "epoch": 1.9474747474747476,
+ "grad_norm": 2.1907997131347656,
+ "learning_rate": 3.054545454545455e-06,
+ "loss": 1.534651756286621,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 15794176.0,
+ "step": 964
+ },
+ {
+ "entropy": 1.1916700601577759,
+ "epoch": 1.9494949494949494,
+ "grad_norm": 2.098696231842041,
+ "learning_rate": 3.052525252525253e-06,
+ "loss": 1.191361904144287,
+ "mean_token_accuracy": 0.715192973613739,
+ "num_tokens": 15810560.0,
+ "step": 965
+ },
+ {
+ "entropy": 1.6707743406295776,
+ "epoch": 1.9515151515151516,
+ "grad_norm": 2.106846570968628,
+ "learning_rate": 3.0505050505050508e-06,
+ "loss": 1.6789159774780273,
+ "mean_token_accuracy": 0.6133365631103516,
+ "num_tokens": 15826944.0,
+ "step": 966
+ },
+ {
+ "entropy": 1.4679991006851196,
+ "epoch": 1.9535353535353535,
+ "grad_norm": 2.1568050384521484,
+ "learning_rate": 3.048484848484849e-06,
+ "loss": 1.4427556991577148,
+ "mean_token_accuracy": 0.6526013612747192,
+ "num_tokens": 15843328.0,
+ "step": 967
+ },
+ {
+ "entropy": 0.9881705641746521,
+ "epoch": 1.9555555555555557,
+ "grad_norm": 2.029680013656616,
+ "learning_rate": 3.046464646464647e-06,
+ "loss": 0.9961811304092407,
+ "mean_token_accuracy": 0.7408402562141418,
+ "num_tokens": 15859712.0,
+ "step": 968
+ },
+ {
+ "entropy": 1.0721628665924072,
+ "epoch": 1.9575757575757575,
+ "grad_norm": 1.9763140678405762,
+ "learning_rate": 3.044444444444445e-06,
+ "loss": 1.067029356956482,
+ "mean_token_accuracy": 0.733146071434021,
+ "num_tokens": 15876096.0,
+ "step": 969
+ },
+ {
+ "entropy": 1.7053834199905396,
+ "epoch": 1.9595959595959596,
+ "grad_norm": 2.3659849166870117,
+ "learning_rate": 3.0424242424242427e-06,
+ "loss": 1.7629203796386719,
+ "mean_token_accuracy": 0.6105275750160217,
+ "num_tokens": 15892480.0,
+ "step": 970
+ },
+ {
+ "entropy": 1.8083471059799194,
+ "epoch": 1.9616161616161616,
+ "grad_norm": 2.081869602203369,
+ "learning_rate": 3.0404040404040406e-06,
+ "loss": 1.8430367708206177,
+ "mean_token_accuracy": 0.6009404063224792,
+ "num_tokens": 15908864.0,
+ "step": 971
+ },
+ {
+ "entropy": 1.2576755285263062,
+ "epoch": 1.9636363636363636,
+ "grad_norm": 2.128230571746826,
+ "learning_rate": 3.038383838383839e-06,
+ "loss": 1.2493822574615479,
+ "mean_token_accuracy": 0.6913776397705078,
+ "num_tokens": 15925248.0,
+ "step": 972
+ },
+ {
+ "entropy": 0.8995128273963928,
+ "epoch": 1.9656565656565657,
+ "grad_norm": 2.0216031074523926,
+ "learning_rate": 3.036363636363637e-06,
+ "loss": 0.9069615602493286,
+ "mean_token_accuracy": 0.7620908617973328,
+ "num_tokens": 15941632.0,
+ "step": 973
+ },
+ {
+ "entropy": 1.615832805633545,
+ "epoch": 1.9676767676767677,
+ "grad_norm": 2.26552152633667,
+ "learning_rate": 3.0343434343434347e-06,
+ "loss": 1.6284873485565186,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 15958016.0,
+ "step": 974
+ },
+ {
+ "entropy": 1.404674768447876,
+ "epoch": 1.9696969696969697,
+ "grad_norm": 2.1790690422058105,
+ "learning_rate": 3.0323232323232326e-06,
+ "loss": 1.4130914211273193,
+ "mean_token_accuracy": 0.6594406366348267,
+ "num_tokens": 15974400.0,
+ "step": 975
+ },
+ {
+ "entropy": 1.3440049886703491,
+ "epoch": 1.9717171717171718,
+ "grad_norm": 2.121338367462158,
+ "learning_rate": 3.0303030303030305e-06,
+ "loss": 1.3652238845825195,
+ "mean_token_accuracy": 0.6794699430465698,
+ "num_tokens": 15990784.0,
+ "step": 976
+ },
+ {
+ "entropy": 1.0894689559936523,
+ "epoch": 1.9737373737373738,
+ "grad_norm": 2.0155327320098877,
+ "learning_rate": 3.028282828282829e-06,
+ "loss": 1.0642526149749756,
+ "mean_token_accuracy": 0.7223986387252808,
+ "num_tokens": 16007168.0,
+ "step": 977
+ },
+ {
+ "entropy": 1.469588041305542,
+ "epoch": 1.9757575757575756,
+ "grad_norm": 2.2047550678253174,
+ "learning_rate": 3.0262626262626267e-06,
+ "loss": 1.498295545578003,
+ "mean_token_accuracy": 0.6441133618354797,
+ "num_tokens": 16023552.0,
+ "step": 978
+ },
+ {
+ "entropy": 1.6617093086242676,
+ "epoch": 1.9777777777777779,
+ "grad_norm": 1.9770722389221191,
+ "learning_rate": 3.0242424242424246e-06,
+ "loss": 1.6753556728363037,
+ "mean_token_accuracy": 0.6284807324409485,
+ "num_tokens": 16039936.0,
+ "step": 979
+ },
+ {
+ "entropy": 1.8029206991195679,
+ "epoch": 1.9797979797979797,
+ "grad_norm": 2.2365968227386475,
+ "learning_rate": 3.0222222222222225e-06,
+ "loss": 1.7957369089126587,
+ "mean_token_accuracy": 0.601062536239624,
+ "num_tokens": 16056320.0,
+ "step": 980
+ },
+ {
+ "entropy": 1.6331384181976318,
+ "epoch": 1.981818181818182,
+ "grad_norm": 2.0565884113311768,
+ "learning_rate": 3.0202020202020203e-06,
+ "loss": 1.673048973083496,
+ "mean_token_accuracy": 0.6203590631484985,
+ "num_tokens": 16072704.0,
+ "step": 981
+ },
+ {
+ "entropy": 1.1730273962020874,
+ "epoch": 1.9838383838383837,
+ "grad_norm": 2.0347228050231934,
+ "learning_rate": 3.0181818181818182e-06,
+ "loss": 1.1709872484207153,
+ "mean_token_accuracy": 0.7086589932441711,
+ "num_tokens": 16089088.0,
+ "step": 982
+ },
+ {
+ "entropy": 1.1109111309051514,
+ "epoch": 1.985858585858586,
+ "grad_norm": 1.9992051124572754,
+ "learning_rate": 3.0161616161616165e-06,
+ "loss": 1.097399353981018,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 16105472.0,
+ "step": 983
+ },
+ {
+ "entropy": 1.2580686807632446,
+ "epoch": 1.9878787878787878,
+ "grad_norm": 2.1748640537261963,
+ "learning_rate": 3.0141414141414144e-06,
+ "loss": 1.2503113746643066,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 16121856.0,
+ "step": 984
+ },
+ {
+ "entropy": 1.4884002208709717,
+ "epoch": 1.98989898989899,
+ "grad_norm": 2.3283042907714844,
+ "learning_rate": 3.0121212121212123e-06,
+ "loss": 1.4856922626495361,
+ "mean_token_accuracy": 0.6461895704269409,
+ "num_tokens": 16138240.0,
+ "step": 985
+ },
+ {
+ "entropy": 1.6224603652954102,
+ "epoch": 1.9919191919191919,
+ "grad_norm": 2.0596823692321777,
+ "learning_rate": 3.0101010101010102e-06,
+ "loss": 1.6202584505081177,
+ "mean_token_accuracy": 0.6388617753982544,
+ "num_tokens": 16154624.0,
+ "step": 986
+ },
+ {
+ "entropy": 1.559553623199463,
+ "epoch": 1.993939393939394,
+ "grad_norm": 2.100667953491211,
+ "learning_rate": 3.008080808080808e-06,
+ "loss": 1.5781179666519165,
+ "mean_token_accuracy": 0.6409379839897156,
+ "num_tokens": 16171008.0,
+ "step": 987
+ },
+ {
+ "entropy": 1.299710750579834,
+ "epoch": 1.995959595959596,
+ "grad_norm": 2.2846767902374268,
+ "learning_rate": 3.0060606060606064e-06,
+ "loss": 1.2758262157440186,
+ "mean_token_accuracy": 0.6882632970809937,
+ "num_tokens": 16187392.0,
+ "step": 988
+ },
+ {
+ "entropy": 1.3966935873031616,
+ "epoch": 1.997979797979798,
+ "grad_norm": 2.1244044303894043,
+ "learning_rate": 3.0040404040404043e-06,
+ "loss": 1.420769214630127,
+ "mean_token_accuracy": 0.6670737862586975,
+ "num_tokens": 16203776.0,
+ "step": 989
+ },
+ {
+ "entropy": 1.5851658582687378,
+ "epoch": 2.0,
+ "grad_norm": 2.277179002761841,
+ "learning_rate": 3.002020202020202e-06,
+ "loss": 1.5963382720947266,
+ "mean_token_accuracy": 0.6276868581771851,
+ "num_tokens": 16220160.0,
+ "step": 990
+ },
+ {
+ "entropy": 1.9146819114685059,
+ "epoch": 2.002020202020202,
+ "grad_norm": 2.0008981227874756,
+ "learning_rate": 3e-06,
+ "loss": 1.8820562362670898,
+ "mean_token_accuracy": 0.5895212292671204,
+ "num_tokens": 16236544.0,
+ "step": 991
+ },
+ {
+ "entropy": 1.3451478481292725,
+ "epoch": 2.004040404040404,
+ "grad_norm": 2.236388921737671,
+ "learning_rate": 2.997979797979798e-06,
+ "loss": 1.2709381580352783,
+ "mean_token_accuracy": 0.6848436594009399,
+ "num_tokens": 16252928.0,
+ "step": 992
+ },
+ {
+ "entropy": 1.4454528093338013,
+ "epoch": 2.006060606060606,
+ "grad_norm": 2.220324754714966,
+ "learning_rate": 2.9959595959595963e-06,
+ "loss": 1.387961506843567,
+ "mean_token_accuracy": 0.6642647981643677,
+ "num_tokens": 16269312.0,
+ "step": 993
+ },
+ {
+ "entropy": 1.2083219289779663,
+ "epoch": 2.008080808080808,
+ "grad_norm": 2.092430830001831,
+ "learning_rate": 2.993939393939394e-06,
+ "loss": 1.1450953483581543,
+ "mean_token_accuracy": 0.7159257531166077,
+ "num_tokens": 16285696.0,
+ "step": 994
+ },
+ {
+ "entropy": 1.3030426502227783,
+ "epoch": 2.01010101010101,
+ "grad_norm": 2.0722665786743164,
+ "learning_rate": 2.991919191919192e-06,
+ "loss": 1.2463462352752686,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 16302080.0,
+ "step": 995
+ },
+ {
+ "entropy": 1.3418742418289185,
+ "epoch": 2.012121212121212,
+ "grad_norm": 1.9004424810409546,
+ "learning_rate": 2.98989898989899e-06,
+ "loss": 1.3043954372406006,
+ "mean_token_accuracy": 0.6850268840789795,
+ "num_tokens": 16318464.0,
+ "step": 996
+ },
+ {
+ "entropy": 1.6736825704574585,
+ "epoch": 2.014141414141414,
+ "grad_norm": 2.132983446121216,
+ "learning_rate": 2.987878787878788e-06,
+ "loss": 1.631580114364624,
+ "mean_token_accuracy": 0.619076669216156,
+ "num_tokens": 16334848.0,
+ "step": 997
+ },
+ {
+ "entropy": 1.435375690460205,
+ "epoch": 2.0161616161616163,
+ "grad_norm": 2.2508206367492676,
+ "learning_rate": 2.9858585858585857e-06,
+ "loss": 1.3867809772491455,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 16351232.0,
+ "step": 998
+ },
+ {
+ "entropy": 1.050812005996704,
+ "epoch": 2.018181818181818,
+ "grad_norm": 1.878668189048767,
+ "learning_rate": 2.983838383838384e-06,
+ "loss": 1.0428903102874756,
+ "mean_token_accuracy": 0.7329018115997314,
+ "num_tokens": 16367616.0,
+ "step": 999
+ },
+ {
+ "entropy": 1.325859546661377,
+ "epoch": 2.0202020202020203,
+ "grad_norm": 1.8450349569320679,
+ "learning_rate": 2.981818181818182e-06,
+ "loss": 1.302099347114563,
+ "mean_token_accuracy": 0.6926599740982056,
+ "num_tokens": 16384000.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.0202020202020203,
+ "eval_entropy": 1.3899660999736478,
+ "eval_loss": 1.5310550928115845,
+ "eval_mean_token_accuracy": 0.6458596015168775,
+ "eval_num_tokens": 16384000.0,
+ "eval_runtime": 43.8845,
+ "eval_samples_per_second": 22.559,
+ "eval_steps_per_second": 2.826,
+ "step": 1000
+ }
+ ],
+ "logging_steps": 1,
+ "max_steps": 2475,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 5,
+ "save_steps": 500,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.38550645358592e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/training_args.bin b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/training_args.bin
new file mode 100644
index 0000000000000000000000000000000000000000..37649d4bae96a1df88666daf20b4e5b6e092d976
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/training_args.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:58bbcabfe99a1cf24f2e76aab66b507c2b720d9271dc9f17c8208d741a9c3a65
+size 7121
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/zero_to_fp32.py b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/zero_to_fp32.py
new file mode 100644
index 0000000000000000000000000000000000000000..3970548c400fd4361bd923b763db90e963ddaf8c
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/zero_to_fp32.py
@@ -0,0 +1,854 @@
+#!/usr/bin/env python
+
+# Copyright (c) Microsoft Corporation.
+# SPDX-License-Identifier: Apache-2.0
+
+# DeepSpeed Team
+
+# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets
+# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in
+# the future. Once extracted, the weights don't require DeepSpeed and can be used in any
+# application.
+#
+# example:
+# python zero_to_fp32.py . output_dir/
+# or
+# python zero_to_fp32.py . output_dir/ --safe_serialization
+
+import argparse
+import torch
+import glob
+import math
+import os
+import re
+import gc
+import json
+import numpy as np
+from tqdm import tqdm
+from collections import OrderedDict
+from dataclasses import dataclass
+
+# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with
+# DeepSpeed data structures it has to be available in the current python environment.
+from deepspeed.utils import logger
+from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS,
+ FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES,
+ FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS, AUTOEP_LAYERS_KEY,
+ AUTOEP_LAYERS_KEY_LEGACY, AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY,
+ AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT, PARAM_ALIGNMENT_PADDINGS)
+
+
+@dataclass
+class zero_model_state:
+ buffers: dict()
+ param_shapes: dict()
+ shared_params: list
+ ds_version: int
+ frozen_param_shapes: dict()
+ frozen_param_fragments: dict()
+
+
+debug = 0
+
+# load to cpu
+device = torch.device('cpu')
+
+OUTPUT_DTYPE_NAMES = {
+ 'float32': torch.float32,
+ 'fp32': torch.float32,
+ 'float16': torch.float16,
+ 'fp16': torch.float16,
+ 'bfloat16': torch.bfloat16,
+ 'bf16': torch.bfloat16,
+}
+
+
+def _resolve_output_dtype(dtype):
+ requested_dtype = dtype
+ if isinstance(dtype, str):
+ dtype_name = dtype[6:] if dtype.startswith('torch.') else dtype
+ dtype = OUTPUT_DTYPE_NAMES.get(dtype_name.lower())
+ if dtype not in set(OUTPUT_DTYPE_NAMES.values()):
+ supported = ', '.join(sorted(OUTPUT_DTYPE_NAMES))
+ raise ValueError(f"Unsupported output dtype {requested_dtype!r}. Choose one of: {supported}")
+ return dtype
+
+
+def atoi(text):
+ return int(text) if text.isdigit() else text
+
+
+def natural_keys(text):
+ '''
+ alist.sort(key=natural_keys) sorts in human order
+ http://nedbatchelder.com/blog/200712/human_sorting.html
+ (See Toothy's implementation in the comments)
+ '''
+ return [atoi(c) for c in re.split(r'(\d+)', text)]
+
+
+def get_model_state_file(checkpoint_dir, zero_stage):
+ if not os.path.isdir(checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist")
+
+ # there should be only one file
+ if zero_stage <= 2:
+ file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt")
+ elif zero_stage == 3:
+ file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt")
+
+ if not os.path.exists(file):
+ raise FileNotFoundError(f"can't find model states file at '{file}'")
+
+ return file
+
+
+def get_checkpoint_files(checkpoint_dir, glob_pattern):
+ # XXX: need to test that this simple glob rule works for multi-node setup too
+ ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys)
+
+ if len(ckpt_files) == 0:
+ raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'")
+
+ return ckpt_files
+
+
+def get_optim_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt")
+
+
+def get_model_state_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_model_states.pt")
+
+
+def _has_autoep_zero3_partitioned_metadata(state_dict):
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY)
+ if autoep_layers is None:
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY_LEGACY)
+ if not isinstance(autoep_layers, list):
+ return False
+ return any(
+ isinstance(entry, dict)
+ and entry.get(AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY) == AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT
+ for entry in autoep_layers)
+
+
+def _raise_if_autoep_zero3_partitioned_state(state_dict):
+ if _has_autoep_zero3_partitioned_metadata(state_dict):
+ raise NotImplementedError("zero_to_fp32 does not support AutoEP ZeRO-3 partition-native checkpoints. "
+ "AutoEP expert parameters are partitioned over expert replica groups, so "
+ "global data-parallel consolidation would produce incomplete expert tensors. "
+ "Use ds_to_universal.py for expert-aware conversion.")
+
+
+def _raise_if_autoep_zero3_partitioned_checkpoint(model_files):
+ for file in model_files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+
+def parse_model_states(files):
+ zero_model_states = []
+ for file in files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+ if BUFFER_NAMES not in state_dict:
+ raise ValueError(f"{file} is not a model state checkpoint")
+ buffer_names = state_dict[BUFFER_NAMES]
+ if debug:
+ print("Found buffers:", buffer_names)
+
+ # recover just the buffers while restoring them to fp32 if they were saved in fp16
+ buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names}
+ param_shapes = state_dict[PARAM_SHAPES]
+
+ # collect parameters that are included in param_shapes
+ param_names = []
+ for s in param_shapes:
+ for name in s.keys():
+ param_names.append(name)
+
+ # update with frozen parameters
+ frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None)
+ if frozen_param_shapes is not None:
+ if debug:
+ print(f"Found frozen_param_shapes: {frozen_param_shapes}")
+ param_names += list(frozen_param_shapes.keys())
+
+ # handle shared params
+ shared_params = [[k, v] for k, v in state_dict["shared_params"].items()]
+
+ ds_version = state_dict.get(DS_VERSION, None)
+
+ frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None)
+
+ z_model_state = zero_model_state(buffers=buffers,
+ param_shapes=param_shapes,
+ shared_params=shared_params,
+ ds_version=ds_version,
+ frozen_param_shapes=frozen_param_shapes,
+ frozen_param_fragments=frozen_param_fragments)
+ zero_model_states.append(z_model_state)
+
+ return zero_model_states
+
+
+def parse_optim_states(files, ds_checkpoint_dir):
+ total_files = len(files)
+ state_dicts = []
+ for f in tqdm(files, desc='Loading checkpoint shards'):
+ state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False)
+ # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights
+ # and also handle the case where it was already removed by another helper script
+ state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None)
+ state_dicts.append(state_dict)
+
+ if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]:
+ raise ValueError(f"{files[0]} is not a zero checkpoint")
+ zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE]
+ world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT]
+
+ # For ZeRO-2 each param group can have different partition_count as data parallelism for expert
+ # parameters can be different from data parallelism for non-expert parameters. So we can just
+ # use the max of the partition_count to get the dp world_size.
+
+ if type(world_size) is list:
+ world_size = max(world_size)
+
+ if world_size != total_files:
+ raise ValueError(
+ f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. "
+ "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes."
+ )
+
+ # the groups are named differently in each stage
+ if zero_stage <= 2:
+ fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS
+ elif zero_stage == 3:
+ fp32_groups_key = FP32_FLAT_GROUPS
+ else:
+ raise ValueError(f"unknown zero stage {zero_stage}")
+
+ fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))]
+ param_alignment_paddings = state_dicts[0][OPTIMIZER_STATE_DICT].get(PARAM_ALIGNMENT_PADDINGS)
+ return zero_stage, world_size, fp32_flat_groups, param_alignment_paddings
+
+
+def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters):
+ """
+ Returns fp32 state_dict reconstructed from ds checkpoint
+
+ Args:
+ - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are)
+
+ """
+ print(f"Processing zero checkpoint '{ds_checkpoint_dir}'")
+
+ # parse_model_states rejects AutoEP ZeRO-3 partition-native checkpoints
+ # before the expensive optimizer-shard load below.
+ model_files = get_model_state_files(ds_checkpoint_dir)
+ zero_model_states = parse_model_states(model_files)
+ print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}')
+
+ optim_files = get_optim_files(ds_checkpoint_dir)
+ zero_stage, world_size, fp32_flat_groups, param_alignment_paddings = parse_optim_states(
+ optim_files, ds_checkpoint_dir)
+ print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}")
+
+ if zero_stage <= 2:
+ return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters, param_alignment_paddings)
+ elif zero_stage == 3:
+ return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters)
+
+
+def _zero2_merge_frozen_params(state_dict, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ frozen_param_fragments = zero_model_states[0].frozen_param_fragments
+
+ if debug:
+ num_elem = sum(s.numel() for s in frozen_param_shapes.values())
+ print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in frozen_param_fragments.values()])
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ state_dict[name] = frozen_param_fragments[name]
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _has_callable(obj, fn):
+ attr = getattr(obj, fn, None)
+ return callable(attr)
+
+
+def _zero2_merge_trainable_params(state_dict,
+ world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ param_alignment_paddings=None):
+ param_shapes = zero_model_states[0].param_shapes
+
+ # Reconstruction protocol:
+ #
+ # XXX: document this
+
+ if debug:
+ for i in range(world_size):
+ for j in range(len(fp32_flat_groups[0])):
+ print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}")
+
+ # XXX: memory usage doubles here (zero2)
+ num_param_groups = len(fp32_flat_groups[0])
+ merged_single_partition_of_fp32_groups = []
+ for i in range(num_param_groups):
+ merged_partitions = [sd[i] for sd in fp32_flat_groups]
+ full_single_fp32_vector = torch.cat(merged_partitions, 0)
+ merged_single_partition_of_fp32_groups.append(full_single_fp32_vector)
+ avail_numel = sum(
+ [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups])
+
+ if debug:
+ wanted_params = sum([len(shapes) for shapes in param_shapes])
+ wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes])
+ # not asserting if there is a mismatch due to possible padding
+ print(f"Have {avail_numel} numels to process.")
+ print(f"Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ total_numel = 0
+ total_params = 0
+ for group_idx, (shapes,
+ full_single_fp32_vector) in enumerate(zip(param_shapes, merged_single_partition_of_fp32_groups)):
+ offset = 0
+ avail_numel = full_single_fp32_vector.numel()
+ group_alignment_paddings = None
+ if param_alignment_paddings is not None:
+ group_alignment_paddings = param_alignment_paddings[group_idx]
+ if len(group_alignment_paddings) != len(shapes):
+ raise ValueError(f"Expected {len(shapes)} parameter alignment paddings for group {group_idx}, "
+ f"but found {len(group_alignment_paddings)}")
+
+ for param_idx, (name, shape) in enumerate(shapes.items()):
+
+ unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape)
+ total_numel += unpartitioned_numel
+ total_params += 1
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+ state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape)
+ offset += unpartitioned_numel
+ if group_alignment_paddings is not None:
+ offset += group_alignment_paddings[param_idx]
+
+ # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and
+ # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex
+ # paddings performed in the code it's almost impossible to predict the exact numbers w/o the
+ # live optimizer object, so we are checking that the numbers are within the right range
+ align_to = 2 * world_size
+
+ def zero2_align(x):
+ return align_to * math.ceil(x / align_to)
+
+ if debug:
+ print(f"original offset={offset}, avail_numel={avail_numel}")
+
+ offset = zero2_align(offset)
+ avail_numel = zero2_align(avail_numel)
+
+ if debug:
+ print(f"aligned offset={offset}, avail_numel={avail_numel}")
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero2_checkpoint(world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ exclude_frozen_parameters,
+ param_alignment_paddings=None):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero2_merge_frozen_params(state_dict, zero_model_states)
+
+ _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states,
+ param_alignment_paddings)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def zero3_partitioned_param_info(unpartitioned_numel, world_size):
+ remainder = unpartitioned_numel % world_size
+ padding_numel = (world_size - remainder) if remainder else 0
+ partitioned_numel = math.ceil(unpartitioned_numel / world_size)
+ return partitioned_numel, padding_numel
+
+
+def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ if debug:
+ for i in range(world_size):
+ num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values())
+ print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in zero_model_states[0].frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states)
+ state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape)
+
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+class GatheredTensor:
+ """
+ A pseudo tensor that collects partitioned weights.
+ It is more memory efficient when there are multiple groups.
+ """
+
+ def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape):
+ self.flat_groups = flat_groups
+ self.flat_groups_offset = flat_groups_offset
+ self.offset = offset
+ self.partitioned_numel = partitioned_numel
+ self.shape = shape
+ self.dtype = self.flat_groups[0][0].dtype
+
+ def contiguous(self):
+ """
+ Merge partitioned weights from flat_groups into a single tensor.
+ """
+ end_idx = self.offset + self.partitioned_numel
+ world_size = len(self.flat_groups)
+ pad_flat_param_chunks = []
+
+ for rank_i in range(world_size):
+ # for each rank, we need to collect weights from related group/groups
+ flat_groups_at_rank_i = self.flat_groups[rank_i]
+ start_group_id = None
+ end_group_id = None
+ for group_id in range(len(self.flat_groups_offset)):
+ if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]:
+ start_group_id = group_id
+ if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]:
+ end_group_id = group_id
+ break
+ # collect weights from related group/groups
+ for group_id in range(start_group_id, end_group_id + 1):
+ flat_tensor = flat_groups_at_rank_i[group_id]
+ start_offset = self.offset - self.flat_groups_offset[group_id]
+ end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id]
+ pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset])
+
+ # collect weights from all ranks
+ pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0)
+ param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous()
+ return param
+
+
+def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states):
+ param_shapes = zero_model_states[0].param_shapes
+ avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size
+
+ # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each
+ # param, re-consolidating each param, while dealing with padding if any
+
+ # merge list of dicts, preserving order
+ param_shapes = {k: v for d in param_shapes for k, v in d.items()}
+
+ if debug:
+ for i in range(world_size):
+ print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}")
+
+ wanted_params = len(param_shapes)
+ wanted_numel = sum(shape.numel() for shape in param_shapes.values())
+ # not asserting if there is a mismatch due to possible padding
+ avail_numel = fp32_flat_groups[0].numel() * world_size
+ print(f"Trainable params: Have {avail_numel} numels to process.")
+ print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ offset = 0
+ total_numel = 0
+ total_params = 0
+ flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]]))
+ for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'):
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+ total_params += 1
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ # memory efficient tensor
+ tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape)
+ state_dict[name] = tensor
+ offset += partitioned_numel
+
+ offset *= world_size
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero3_merge_frozen_params(state_dict, world_size, zero_model_states)
+
+ _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def to_torch_tensor(state_dict, return_empty_tensor=False, dtype=None):
+ """
+ Convert state_dict of GatheredTensor to torch tensor
+ """
+ if dtype is not None:
+ dtype = _resolve_output_dtype(dtype)
+
+ torch_state_dict = {}
+ converted_tensors = {}
+ for name, tensor in state_dict.items():
+ tensor_id = id(tensor)
+ if tensor_id in converted_tensors: # shared tensors
+ shared_tensor = torch_state_dict[converted_tensors[tensor_id]]
+ torch_state_dict[name] = shared_tensor
+ else:
+ converted_tensors[tensor_id] = name
+ if return_empty_tensor:
+ torch_state_dict[name] = torch.empty(tensor.shape, dtype=dtype or tensor.dtype)
+ else:
+ contiguous_tensor = tensor.contiguous()
+ torch_state_dict[name] = contiguous_tensor.to(dtype=dtype) if dtype else contiguous_tensor
+ return torch_state_dict
+
+
+def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag=None,
+ exclude_frozen_parameters=False,
+ lazy_mode=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with
+ ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example
+ via a model hub.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient.
+ Convert the pesduo tensor to torch tensor by ``.contiguous()``
+
+ Returns:
+ - pytorch ``state_dict``
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ # do the training and checkpoint saving
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu
+ model = model.cpu() # move to cpu
+ model.load_state_dict(state_dict)
+ # submit to model hub or save the model to share with others
+
+ In this example the ``model`` will no longer be usable in the deepspeed context of the same
+ application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead.
+
+ Note: the above usage may not work if your application doesn't have sufficient free CPU memory.
+ You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with
+ the checkpoint. Or you can load state_dict in lazy mode ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu
+ for name, lazy_tensor in state_dict.item():
+ tensor = lazy_tensor.contiguous() # to cpu
+ print(name, tensor)
+ # del tensor to release memory if it no longer in use
+ """
+ if tag is None:
+ latest_path = os.path.join(checkpoint_dir, 'latest')
+ if os.path.isfile(latest_path):
+ with open(latest_path, 'r') as fd:
+ tag = fd.read().strip()
+ else:
+ raise ValueError(f"Unable to find 'latest' file at {latest_path}")
+
+ ds_checkpoint_dir = os.path.join(checkpoint_dir, tag)
+
+ if not os.path.isdir(ds_checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist")
+
+ state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters)
+ if lazy_mode:
+ return state_dict
+ else:
+ return to_torch_tensor(state_dict)
+
+
+def convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a consolidated ``state_dict`` file that can be
+ loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``output_dir``: directory for the PyTorch state_dict output files
+ - ``dtype``: output tensor dtype. Supports float32, float16, and bfloat16 as strings or torch dtypes.
+ - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB
+ - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ """
+
+ dtype = _resolve_output_dtype(dtype)
+
+ # Dependency pre-check
+ if safe_serialization:
+ try:
+ from safetensors.torch import save_file
+ except ImportError:
+ print('If you want to use `safe_serialization`, please `pip install safetensors`')
+ raise
+ if max_shard_size is not None:
+ try:
+ from huggingface_hub import split_torch_state_dict_into_shards
+ except ImportError:
+ print('If you want to use `max_shard_size`, please `pip install huggingface_hub`')
+ raise
+
+ # Convert zero checkpoint to state_dict
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag,
+ exclude_frozen_parameters,
+ lazy_mode=True)
+
+ # Shard the model if it is too big.
+ weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin"
+ if max_shard_size is not None:
+ filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors")
+ # an memory-efficient approach for sharding
+ empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True, dtype=dtype)
+ state_dict_split = split_torch_state_dict_into_shards(empty_state_dict,
+ filename_pattern=filename_pattern,
+ max_shard_size=max_shard_size)
+ else:
+ from collections import namedtuple
+ StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"])
+ state_dict_split = StateDictSplit(is_sharded=False,
+ filename_to_tensors={weights_name: list(state_dict.keys())})
+
+ # Save the model by shard
+ os.makedirs(output_dir, exist_ok=True)
+ filename_to_tensors = state_dict_split.filename_to_tensors.items()
+ for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"):
+ shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors}
+ shard_state_dict = to_torch_tensor(shard_state_dict, dtype=dtype)
+ output_path = os.path.join(output_dir, shard_file)
+ if safe_serialization:
+ save_file(shard_state_dict, output_path, metadata={"format": "pt"})
+ else:
+ torch.save(shard_state_dict, output_path)
+ # release the memory of current shard
+ for tensor_name in list(shard_state_dict.keys()):
+ del state_dict[tensor_name]
+ del shard_state_dict[tensor_name]
+ del shard_state_dict
+ gc.collect()
+
+ # Save index if sharded
+ if state_dict_split.is_sharded:
+ index = {
+ "metadata": state_dict_split.metadata,
+ "weight_map": state_dict_split.tensor_to_filename,
+ }
+ save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json"
+ save_index_file = os.path.join(output_dir, save_index_file)
+ with open(save_index_file, "w", encoding="utf-8") as f:
+ content = json.dumps(index, indent=2, sort_keys=True) + "\n"
+ f.write(content)
+
+
+def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir,
+ output_dir,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """Backward-compatible fp32 checkpoint conversion."""
+ return convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size=max_shard_size,
+ safe_serialization=safe_serialization,
+ tag=tag,
+ exclude_frozen_parameters=exclude_frozen_parameters)
+
+
+def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None):
+ """
+ 1. Put the provided model to cpu
+ 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict``
+ 3. Load it into the provided model
+
+ Args:
+ - ``model``: the model object to update
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+
+ Returns:
+ - ``model`: modified model
+
+ Make sure you have plenty of CPU memory available before you call this function. If you don't
+ have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it
+ conveniently placed for you in the checkpoint folder.
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint
+ model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir)
+ # submit to model hub or save the model to share with others
+
+ Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context
+ of the same application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ """
+ logger.info("Extracting fp32 weights")
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag)
+
+ logger.info("Overwriting model with fp32 weights")
+ model = model.cpu()
+ model.load_state_dict(state_dict, strict=False)
+
+ return model
+
+
+if __name__ == "__main__":
+ parser = argparse.ArgumentParser()
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir",
+ type=str,
+ help="directory to the pytorch fp32 state_dict output files"
+ "(e.g. path/checkpoint-12-output/)")
+ parser.add_argument(
+ "--max_shard_size",
+ type=str,
+ default="5GB",
+ help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size"
+ "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`"
+ "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances"
+ "without CPU OOM issues.")
+ parser.add_argument(
+ "--safe_serialization",
+ default=False,
+ action='store_true',
+ help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug")
+ args = parser.parse_args()
+
+ debug = args.debug
+
+ convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir,
+ args.output_dir,
+ max_shard_size=args.max_shard_size,
+ safe_serialization=args.safe_serialization,
+ tag=args.tag,
+ exclude_frozen_parameters=args.exclude_frozen_parameters)
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1000/zero_to_torch.py b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/zero_to_torch.py
new file mode 100644
index 0000000000000000000000000000000000000000..81312e252400d77f03cc1a88522f8f18ebe70ee7
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1000/zero_to_torch.py
@@ -0,0 +1,54 @@
+#!/usr/bin/env python
+
+# SPDX-License-Identifier: Apache-2.0
+# DeepSpeed Team
+
+import argparse
+
+if __package__:
+ from . import zero_to_fp32
+else:
+ import zero_to_fp32
+
+
+def main(args=None):
+ parser = argparse.ArgumentParser(
+ description="Convert a DeepSpeed ZeRO checkpoint to float32, float16, or bfloat16 PyTorch weights.")
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir", type=str, help="directory for the converted PyTorch state_dict files")
+ parser.add_argument("--dtype",
+ type=str,
+ choices=sorted(zero_to_fp32.OUTPUT_DTYPE_NAMES),
+ required=True,
+ help="output tensor dtype")
+ parser.add_argument("--max_shard_size",
+ type=str,
+ default="5GB",
+ help="maximum size of each checkpoint shard, such as 5GB or 500MB")
+ parser.add_argument("--safe_serialization",
+ default=False,
+ action='store_true',
+ help="save with safetensors instead of PyTorch pickle serialization")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier, e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug output")
+ parsed_args = parser.parse_args(args)
+
+ zero_to_fp32.debug = parsed_args.debug
+ zero_to_fp32.convert_zero_checkpoint_to_state_dict(parsed_args.checkpoint_dir,
+ parsed_args.output_dir,
+ dtype=parsed_args.dtype,
+ max_shard_size=parsed_args.max_shard_size,
+ safe_serialization=parsed_args.safe_serialization,
+ tag=parsed_args.tag,
+ exclude_frozen_parameters=parsed_args.exclude_frozen_parameters)
+
+
+if __name__ == "__main__":
+ main()
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/chat_template.jinja b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..01be9b307daa2d425f7c168c9fb145a286e0afb4
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/chat_template.jinja
@@ -0,0 +1,89 @@
+{%- if tools %}
+ {{- '<|im_start|>system\n' }}
+ {%- if messages[0].role == 'system' %}
+ {{- messages[0].content + '\n\n' }}
+ {%- endif %}
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+{%- endfor %}
+{%- for message in messages %}
+ {%- if message.content is string %}
+ {%- set content = message.content %}
+ {%- else %}
+ {%- set content = '' %}
+ {%- endif %}
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {%- if loop.last or (not loop.last and reasoning_content) %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if (loop.first and content) or (not loop.first) %}
+ {{- '\n' }}
+ {%- endif %}
+ {%- if tool_call.function %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {{- '\n{"name": "' }}
+ {{- tool_call.name }}
+ {{- '", "arguments": ' }}
+ {%- if tool_call.arguments is string %}
+ {{- tool_call.arguments }}
+ {%- else %}
+ {{- tool_call.arguments | tojson }}
+ {%- endif %}
+ {{- '}\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/config.json
new file mode 100644
index 0000000000000000000000000000000000000000..5d9cef07396baadff5390e4508eb33025967a029
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/config.json
@@ -0,0 +1,63 @@
+{
+ "architectures": [
+ "Qwen3ForCausalLM"
+ ],
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "bos_token_id": null,
+ "dtype": "bfloat16",
+ "eos_token_id": 151645,
+ "head_dim": 128,
+ "hidden_act": "silu",
+ "hidden_size": 2048,
+ "initializer_range": 0.02,
+ "intermediate_size": 6144,
+ "layer_types": [
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 40960,
+ "max_window_layers": 28,
+ "model_type": "qwen3",
+ "num_attention_heads": 16,
+ "num_hidden_layers": 28,
+ "num_key_value_heads": 8,
+ "pad_token_id": 151643,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 1000000,
+ "rope_type": "default"
+ },
+ "sliding_window": null,
+ "tie_word_embeddings": true,
+ "transformers_version": "5.17.0",
+ "use_cache": false,
+ "use_sliding_window": false,
+ "vocab_size": 151936
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/generation_config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/generation_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..e6941fe4b04f26113d6eef6255d005c4d7090bda
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/generation_config.json
@@ -0,0 +1,12 @@
+{
+ "do_sample": true,
+ "eos_token_id": [
+ 151645,
+ 151643
+ ],
+ "pad_token_id": 151643,
+ "temperature": 0.6,
+ "top_k": 20,
+ "top_p": 0.95,
+ "transformers_version": "5.17.0"
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/global_step1500/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/global_step1500/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..45a0eb383aad786eb5d7a821b9001b27077695e2
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/global_step1500/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:d5077930dfb821ac5bc488ed9247c90a00d51842213c669f29520242479685bc
+size 10323466465
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/global_step1500/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/global_step1500/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..178177a1a20fd51b6eee1986ac67dacb7d761e96
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/global_step1500/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:6f90b6cb6f7fdcf8772c092842627541743e4bc83174c27ba4c87c65cac672b9
+size 10323469601
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/global_step1500/mp_rank_00_model_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/global_step1500/mp_rank_00_model_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..51f16515475f795806e72bcec24f54fdbce8222e
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/global_step1500/mp_rank_00_model_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:523ec813c393fd3f84897681df01c102a4d3a66fc72527bf1d35c3a922771077
+size 3441239653
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/latest b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/latest
new file mode 100644
index 0000000000000000000000000000000000000000..c56ff7708f44fb7928fea2f70d6d7342ce0d5b67
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/latest
@@ -0,0 +1 @@
+global_step1500
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/model.safetensors b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..a2f04bfe78a5dc92beab6864ba55a934bf32971c
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:a9175b75d3713c74280504d975bccb5374f789063c1ddf46bea2f3c0543006f0
+size 4063515640
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/rng_state_0.pth b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/rng_state_0.pth
new file mode 100644
index 0000000000000000000000000000000000000000..d16a29846bf1c6a082460f85cb978e35b206c0de
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/rng_state_0.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:27a469d99b2f16f69a43f163d81133ab2eca2b9bce1eb579887f4eaf6efaa9da
+size 14917
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/rng_state_1.pth b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/rng_state_1.pth
new file mode 100644
index 0000000000000000000000000000000000000000..5571d4000197098fd8379a6cd2fdd0eab372c18f
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/rng_state_1.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:fdf02b0060e448a3cb44dfd5a4ab2653449e45bbc811b8f72f63d96c164d8054
+size 14917
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/scheduler.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/scheduler.pt
new file mode 100644
index 0000000000000000000000000000000000000000..e0a6820cffa14a33c2a0689e24a0fca9059341c2
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/scheduler.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:335ffb4d9b33a883d23d5c0d0aaee61492fba1956a2a4256ce15e6ef24d2782f
+size 1465
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/tokenizer.json b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..c7afbed2efcdf019f88ab0572ec29d3bf595dfe2
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:be75606093db2094d7cd20f3c2f385c212750648bd6ea4fb2bf507a6a4c55506
+size 11422650
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/tokenizer_config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..770e41d6c92519d525eede4cbcf3ba27f6425311
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/tokenizer_config.json
@@ -0,0 +1,30 @@
+{
+ "add_prefix_space": false,
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "is_local": false,
+ "local_files_only": false,
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/trainer_state.json b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..795344881c0c7b55cb0af2012bc236022d4dd27e
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/trainer_state.json
@@ -0,0 +1,15364 @@
+{
+ "best_global_step": 950,
+ "best_metric": 1.5272752046585083,
+ "best_model_checkpoint": "./checkpoints/qwen3-1.7b-teutonic-5e6/checkpoint-500",
+ "epoch": 3.0303030303030303,
+ "eval_steps": 50,
+ "global_step": 1500,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 0.8295683860778809,
+ "epoch": 0.00202020202020202,
+ "grad_norm": 10.886772155761719,
+ "learning_rate": 5e-06,
+ "loss": 1.5185801982879639,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 16384.0,
+ "step": 1
+ },
+ {
+ "entropy": 1.1781222820281982,
+ "epoch": 0.00404040404040404,
+ "grad_norm": 13.80163288116455,
+ "learning_rate": 4.997979797979798e-06,
+ "loss": 2.18377685546875,
+ "mean_token_accuracy": 0.5700415372848511,
+ "num_tokens": 32768.0,
+ "step": 2
+ },
+ {
+ "entropy": 0.7972303032875061,
+ "epoch": 0.006060606060606061,
+ "grad_norm": 13.71261215209961,
+ "learning_rate": 4.995959595959596e-06,
+ "loss": 1.5810277462005615,
+ "mean_token_accuracy": 0.6782486438751221,
+ "num_tokens": 49152.0,
+ "step": 3
+ },
+ {
+ "entropy": 0.9709298610687256,
+ "epoch": 0.00808080808080808,
+ "grad_norm": 9.18797779083252,
+ "learning_rate": 4.993939393939394e-06,
+ "loss": 1.6923656463623047,
+ "mean_token_accuracy": 0.6447850465774536,
+ "num_tokens": 65536.0,
+ "step": 4
+ },
+ {
+ "entropy": 1.2161898612976074,
+ "epoch": 0.010101010101010102,
+ "grad_norm": 8.97508430480957,
+ "learning_rate": 4.991919191919192e-06,
+ "loss": 1.9361608028411865,
+ "mean_token_accuracy": 0.5922691822052002,
+ "num_tokens": 81920.0,
+ "step": 5
+ },
+ {
+ "entropy": 0.9950039982795715,
+ "epoch": 0.012121212121212121,
+ "grad_norm": 6.453213214874268,
+ "learning_rate": 4.98989898989899e-06,
+ "loss": 1.5012480020523071,
+ "mean_token_accuracy": 0.6671959161758423,
+ "num_tokens": 98304.0,
+ "step": 6
+ },
+ {
+ "entropy": 1.452682614326477,
+ "epoch": 0.014141414141414142,
+ "grad_norm": 8.50411605834961,
+ "learning_rate": 4.987878787878789e-06,
+ "loss": 2.1297783851623535,
+ "mean_token_accuracy": 0.5807889699935913,
+ "num_tokens": 114688.0,
+ "step": 7
+ },
+ {
+ "entropy": 1.4661014080047607,
+ "epoch": 0.01616161616161616,
+ "grad_norm": 4.290146827697754,
+ "learning_rate": 4.9858585858585865e-06,
+ "loss": 1.7391963005065918,
+ "mean_token_accuracy": 0.611993134021759,
+ "num_tokens": 131072.0,
+ "step": 8
+ },
+ {
+ "entropy": 1.9030903577804565,
+ "epoch": 0.01818181818181818,
+ "grad_norm": 4.503584384918213,
+ "learning_rate": 4.983838383838384e-06,
+ "loss": 2.283596992492676,
+ "mean_token_accuracy": 0.5261968970298767,
+ "num_tokens": 147456.0,
+ "step": 9
+ },
+ {
+ "entropy": 1.2784137725830078,
+ "epoch": 0.020202020202020204,
+ "grad_norm": 3.427410840988159,
+ "learning_rate": 4.981818181818182e-06,
+ "loss": 1.5032392740249634,
+ "mean_token_accuracy": 0.6578529477119446,
+ "num_tokens": 163840.0,
+ "step": 10
+ },
+ {
+ "entropy": 1.7487188577651978,
+ "epoch": 0.022222222222222223,
+ "grad_norm": 3.20536470413208,
+ "learning_rate": 4.97979797979798e-06,
+ "loss": 1.9184643030166626,
+ "mean_token_accuracy": 0.6093673706054688,
+ "num_tokens": 180224.0,
+ "step": 11
+ },
+ {
+ "entropy": 1.6585394144058228,
+ "epoch": 0.024242424242424242,
+ "grad_norm": 3.2463598251342773,
+ "learning_rate": 4.977777777777778e-06,
+ "loss": 1.8364639282226562,
+ "mean_token_accuracy": 0.6014899611473083,
+ "num_tokens": 196608.0,
+ "step": 12
+ },
+ {
+ "entropy": 1.4869519472122192,
+ "epoch": 0.026262626262626262,
+ "grad_norm": 2.8681719303131104,
+ "learning_rate": 4.975757575757576e-06,
+ "loss": 1.6356265544891357,
+ "mean_token_accuracy": 0.6361138224601746,
+ "num_tokens": 212992.0,
+ "step": 13
+ },
+ {
+ "entropy": 1.5179094076156616,
+ "epoch": 0.028282828282828285,
+ "grad_norm": 3.0470707416534424,
+ "learning_rate": 4.973737373737374e-06,
+ "loss": 1.6317660808563232,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 229376.0,
+ "step": 14
+ },
+ {
+ "entropy": 1.7384330034255981,
+ "epoch": 0.030303030303030304,
+ "grad_norm": 2.6149742603302,
+ "learning_rate": 4.971717171717172e-06,
+ "loss": 1.67923903465271,
+ "mean_token_accuracy": 0.6469223499298096,
+ "num_tokens": 245760.0,
+ "step": 15
+ },
+ {
+ "entropy": 2.108799457550049,
+ "epoch": 0.03232323232323232,
+ "grad_norm": 3.694795608520508,
+ "learning_rate": 4.9696969696969696e-06,
+ "loss": 1.9052371978759766,
+ "mean_token_accuracy": 0.5927577018737793,
+ "num_tokens": 262144.0,
+ "step": 16
+ },
+ {
+ "entropy": 1.7532848119735718,
+ "epoch": 0.03434343434343434,
+ "grad_norm": 3.1510567665100098,
+ "learning_rate": 4.9676767676767675e-06,
+ "loss": 1.6382691860198975,
+ "mean_token_accuracy": 0.6311675906181335,
+ "num_tokens": 278528.0,
+ "step": 17
+ },
+ {
+ "entropy": 1.723548412322998,
+ "epoch": 0.03636363636363636,
+ "grad_norm": 3.093825340270996,
+ "learning_rate": 4.965656565656566e-06,
+ "loss": 1.6039624214172363,
+ "mean_token_accuracy": 0.6313507556915283,
+ "num_tokens": 294912.0,
+ "step": 18
+ },
+ {
+ "entropy": 1.4790765047073364,
+ "epoch": 0.03838383838383838,
+ "grad_norm": 2.7150535583496094,
+ "learning_rate": 4.963636363636364e-06,
+ "loss": 1.4173667430877686,
+ "mean_token_accuracy": 0.6627381443977356,
+ "num_tokens": 311296.0,
+ "step": 19
+ },
+ {
+ "entropy": 1.5827536582946777,
+ "epoch": 0.04040404040404041,
+ "grad_norm": 2.610966444015503,
+ "learning_rate": 4.961616161616162e-06,
+ "loss": 1.4604644775390625,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 327680.0,
+ "step": 20
+ },
+ {
+ "entropy": 2.054673194885254,
+ "epoch": 0.04242424242424243,
+ "grad_norm": 2.612940788269043,
+ "learning_rate": 4.95959595959596e-06,
+ "loss": 1.962029218673706,
+ "mean_token_accuracy": 0.5719956159591675,
+ "num_tokens": 344064.0,
+ "step": 21
+ },
+ {
+ "entropy": 1.6684198379516602,
+ "epoch": 0.044444444444444446,
+ "grad_norm": 2.5426013469696045,
+ "learning_rate": 4.957575757575758e-06,
+ "loss": 1.591176986694336,
+ "mean_token_accuracy": 0.6519907116889954,
+ "num_tokens": 360448.0,
+ "step": 22
+ },
+ {
+ "entropy": 1.9070855379104614,
+ "epoch": 0.046464646464646465,
+ "grad_norm": 2.5853357315063477,
+ "learning_rate": 4.9555555555555565e-06,
+ "loss": 1.930276870727539,
+ "mean_token_accuracy": 0.5895823240280151,
+ "num_tokens": 376832.0,
+ "step": 23
+ },
+ {
+ "entropy": 1.716689109802246,
+ "epoch": 0.048484848484848485,
+ "grad_norm": 2.7608494758605957,
+ "learning_rate": 4.953535353535354e-06,
+ "loss": 1.739159345626831,
+ "mean_token_accuracy": 0.6028944849967957,
+ "num_tokens": 393216.0,
+ "step": 24
+ },
+ {
+ "entropy": 1.5666695833206177,
+ "epoch": 0.050505050505050504,
+ "grad_norm": 2.5973074436187744,
+ "learning_rate": 4.951515151515152e-06,
+ "loss": 1.6016302108764648,
+ "mean_token_accuracy": 0.626099169254303,
+ "num_tokens": 409600.0,
+ "step": 25
+ },
+ {
+ "entropy": 1.4267652034759521,
+ "epoch": 0.052525252525252523,
+ "grad_norm": 2.163451910018921,
+ "learning_rate": 4.94949494949495e-06,
+ "loss": 1.5093598365783691,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 425984.0,
+ "step": 26
+ },
+ {
+ "entropy": 1.8537150621414185,
+ "epoch": 0.05454545454545454,
+ "grad_norm": 2.6983258724212646,
+ "learning_rate": 4.947474747474748e-06,
+ "loss": 1.8831868171691895,
+ "mean_token_accuracy": 0.5802393555641174,
+ "num_tokens": 442368.0,
+ "step": 27
+ },
+ {
+ "entropy": 1.410015344619751,
+ "epoch": 0.05656565656565657,
+ "grad_norm": 2.4777796268463135,
+ "learning_rate": 4.945454545454546e-06,
+ "loss": 1.4835734367370605,
+ "mean_token_accuracy": 0.6519907116889954,
+ "num_tokens": 458752.0,
+ "step": 28
+ },
+ {
+ "entropy": 1.2399017810821533,
+ "epoch": 0.05858585858585859,
+ "grad_norm": 2.1676478385925293,
+ "learning_rate": 4.943434343434344e-06,
+ "loss": 1.330633282661438,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 475136.0,
+ "step": 29
+ },
+ {
+ "entropy": 1.6478898525238037,
+ "epoch": 0.06060606060606061,
+ "grad_norm": 2.5325536727905273,
+ "learning_rate": 4.941414141414142e-06,
+ "loss": 1.771777868270874,
+ "mean_token_accuracy": 0.6128480434417725,
+ "num_tokens": 491520.0,
+ "step": 30
+ },
+ {
+ "entropy": 1.7915360927581787,
+ "epoch": 0.06262626262626263,
+ "grad_norm": 2.2419557571411133,
+ "learning_rate": 4.93939393939394e-06,
+ "loss": 1.870645523071289,
+ "mean_token_accuracy": 0.6074743270874023,
+ "num_tokens": 507904.0,
+ "step": 31
+ },
+ {
+ "entropy": 1.7638899087905884,
+ "epoch": 0.06464646464646465,
+ "grad_norm": 2.8063058853149414,
+ "learning_rate": 4.937373737373738e-06,
+ "loss": 1.83987557888031,
+ "mean_token_accuracy": 0.5836589932441711,
+ "num_tokens": 524288.0,
+ "step": 32
+ },
+ {
+ "entropy": 1.4097516536712646,
+ "epoch": 0.06666666666666667,
+ "grad_norm": 2.1857714653015137,
+ "learning_rate": 4.935353535353536e-06,
+ "loss": 1.477668285369873,
+ "mean_token_accuracy": 0.6507083773612976,
+ "num_tokens": 540672.0,
+ "step": 33
+ },
+ {
+ "entropy": 1.4447426795959473,
+ "epoch": 0.06868686868686869,
+ "grad_norm": 2.3771870136260986,
+ "learning_rate": 4.933333333333334e-06,
+ "loss": 1.536318063735962,
+ "mean_token_accuracy": 0.6383732557296753,
+ "num_tokens": 557056.0,
+ "step": 34
+ },
+ {
+ "entropy": 1.9658164978027344,
+ "epoch": 0.0707070707070707,
+ "grad_norm": 2.4784936904907227,
+ "learning_rate": 4.931313131313132e-06,
+ "loss": 2.0565035343170166,
+ "mean_token_accuracy": 0.5581949353218079,
+ "num_tokens": 573440.0,
+ "step": 35
+ },
+ {
+ "entropy": 1.6045317649841309,
+ "epoch": 0.07272727272727272,
+ "grad_norm": 2.1128504276275635,
+ "learning_rate": 4.92929292929293e-06,
+ "loss": 1.6234952211380005,
+ "mean_token_accuracy": 0.6293356418609619,
+ "num_tokens": 589824.0,
+ "step": 36
+ },
+ {
+ "entropy": 1.5491269826889038,
+ "epoch": 0.07474747474747474,
+ "grad_norm": 2.1672937870025635,
+ "learning_rate": 4.927272727272728e-06,
+ "loss": 1.5809822082519531,
+ "mean_token_accuracy": 0.6419760584831238,
+ "num_tokens": 606208.0,
+ "step": 37
+ },
+ {
+ "entropy": 1.545534610748291,
+ "epoch": 0.07676767676767676,
+ "grad_norm": 2.2526934146881104,
+ "learning_rate": 4.925252525252526e-06,
+ "loss": 1.5707473754882812,
+ "mean_token_accuracy": 0.6344650983810425,
+ "num_tokens": 622592.0,
+ "step": 38
+ },
+ {
+ "entropy": 1.579596757888794,
+ "epoch": 0.07878787878787878,
+ "grad_norm": 2.3988492488861084,
+ "learning_rate": 4.9232323232323235e-06,
+ "loss": 1.6725983619689941,
+ "mean_token_accuracy": 0.6243282556533813,
+ "num_tokens": 638976.0,
+ "step": 39
+ },
+ {
+ "entropy": 2.0438785552978516,
+ "epoch": 0.08080808080808081,
+ "grad_norm": 2.3314359188079834,
+ "learning_rate": 4.9212121212121214e-06,
+ "loss": 2.0424888134002686,
+ "mean_token_accuracy": 0.570713222026825,
+ "num_tokens": 655360.0,
+ "step": 40
+ },
+ {
+ "entropy": 1.8690773248672485,
+ "epoch": 0.08282828282828283,
+ "grad_norm": 2.130401134490967,
+ "learning_rate": 4.919191919191919e-06,
+ "loss": 1.8796970844268799,
+ "mean_token_accuracy": 0.5882999300956726,
+ "num_tokens": 671744.0,
+ "step": 41
+ },
+ {
+ "entropy": 1.756626009941101,
+ "epoch": 0.08484848484848485,
+ "grad_norm": 2.342318534851074,
+ "learning_rate": 4.917171717171717e-06,
+ "loss": 1.71901535987854,
+ "mean_token_accuracy": 0.6173668503761292,
+ "num_tokens": 688128.0,
+ "step": 42
+ },
+ {
+ "entropy": 1.4642508029937744,
+ "epoch": 0.08686868686868687,
+ "grad_norm": 1.993338704109192,
+ "learning_rate": 4.915151515151516e-06,
+ "loss": 1.4660165309906006,
+ "mean_token_accuracy": 0.6687225103378296,
+ "num_tokens": 704512.0,
+ "step": 43
+ },
+ {
+ "entropy": 1.790807843208313,
+ "epoch": 0.08888888888888889,
+ "grad_norm": 2.3186943531036377,
+ "learning_rate": 4.913131313131314e-06,
+ "loss": 1.7102060317993164,
+ "mean_token_accuracy": 0.6238397359848022,
+ "num_tokens": 720896.0,
+ "step": 44
+ },
+ {
+ "entropy": 1.5970485210418701,
+ "epoch": 0.09090909090909091,
+ "grad_norm": 2.299307346343994,
+ "learning_rate": 4.911111111111112e-06,
+ "loss": 1.5170013904571533,
+ "mean_token_accuracy": 0.652662456035614,
+ "num_tokens": 737280.0,
+ "step": 45
+ },
+ {
+ "entropy": 1.3955466747283936,
+ "epoch": 0.09292929292929293,
+ "grad_norm": 2.171952962875366,
+ "learning_rate": 4.90909090909091e-06,
+ "loss": 1.4059661626815796,
+ "mean_token_accuracy": 0.6654250025749207,
+ "num_tokens": 753664.0,
+ "step": 46
+ },
+ {
+ "entropy": 1.7198575735092163,
+ "epoch": 0.09494949494949495,
+ "grad_norm": 2.385092258453369,
+ "learning_rate": 4.9070707070707075e-06,
+ "loss": 1.730346918106079,
+ "mean_token_accuracy": 0.6191987991333008,
+ "num_tokens": 770048.0,
+ "step": 47
+ },
+ {
+ "entropy": 1.3542555570602417,
+ "epoch": 0.09696969696969697,
+ "grad_norm": 2.1463189125061035,
+ "learning_rate": 4.905050505050505e-06,
+ "loss": 1.346085786819458,
+ "mean_token_accuracy": 0.680446982383728,
+ "num_tokens": 786432.0,
+ "step": 48
+ },
+ {
+ "entropy": 1.8084443807601929,
+ "epoch": 0.09898989898989899,
+ "grad_norm": 2.1505849361419678,
+ "learning_rate": 4.903030303030303e-06,
+ "loss": 1.847151756286621,
+ "mean_token_accuracy": 0.5926355719566345,
+ "num_tokens": 802816.0,
+ "step": 49
+ },
+ {
+ "entropy": 1.751160979270935,
+ "epoch": 0.10101010101010101,
+ "grad_norm": 2.1436259746551514,
+ "learning_rate": 4.901010101010101e-06,
+ "loss": 1.7802404165267944,
+ "mean_token_accuracy": 0.5996580123901367,
+ "num_tokens": 819200.0,
+ "step": 50
+ },
+ {
+ "epoch": 0.10101010101010101,
+ "eval_entropy": 1.6292865045609013,
+ "eval_loss": 1.6725393533706665,
+ "eval_mean_token_accuracy": 0.6230050469598463,
+ "eval_num_tokens": 819200.0,
+ "eval_runtime": 43.9148,
+ "eval_samples_per_second": 22.544,
+ "eval_steps_per_second": 2.824,
+ "step": 50
+ },
+ {
+ "entropy": 1.4428319931030273,
+ "epoch": 0.10303030303030303,
+ "grad_norm": 2.0954954624176025,
+ "learning_rate": 4.898989898989899e-06,
+ "loss": 1.4927232265472412,
+ "mean_token_accuracy": 0.6522349715232849,
+ "num_tokens": 835584.0,
+ "step": 51
+ },
+ {
+ "entropy": 1.7493115663528442,
+ "epoch": 0.10505050505050505,
+ "grad_norm": 2.300030469894409,
+ "learning_rate": 4.896969696969697e-06,
+ "loss": 1.737417221069336,
+ "mean_token_accuracy": 0.6213361024856567,
+ "num_tokens": 851968.0,
+ "step": 52
+ },
+ {
+ "entropy": 1.7801647186279297,
+ "epoch": 0.10707070707070707,
+ "grad_norm": 2.3947081565856934,
+ "learning_rate": 4.894949494949495e-06,
+ "loss": 1.8372564315795898,
+ "mean_token_accuracy": 0.5931240916252136,
+ "num_tokens": 868352.0,
+ "step": 53
+ },
+ {
+ "entropy": 1.6934887170791626,
+ "epoch": 0.10909090909090909,
+ "grad_norm": 2.1981089115142822,
+ "learning_rate": 4.8929292929292936e-06,
+ "loss": 1.734646201133728,
+ "mean_token_accuracy": 0.611932098865509,
+ "num_tokens": 884736.0,
+ "step": 54
+ },
+ {
+ "entropy": 1.3401941061019897,
+ "epoch": 0.1111111111111111,
+ "grad_norm": 2.193511724472046,
+ "learning_rate": 4.8909090909090914e-06,
+ "loss": 1.399888038635254,
+ "mean_token_accuracy": 0.6745847463607788,
+ "num_tokens": 901120.0,
+ "step": 55
+ },
+ {
+ "entropy": 1.8244661092758179,
+ "epoch": 0.11313131313131314,
+ "grad_norm": 2.4358489513397217,
+ "learning_rate": 4.888888888888889e-06,
+ "loss": 1.8716282844543457,
+ "mean_token_accuracy": 0.5867122411727905,
+ "num_tokens": 917504.0,
+ "step": 56
+ },
+ {
+ "entropy": 1.5019619464874268,
+ "epoch": 0.11515151515151516,
+ "grad_norm": 2.1135261058807373,
+ "learning_rate": 4.886868686868687e-06,
+ "loss": 1.523103952407837,
+ "mean_token_accuracy": 0.6414265036582947,
+ "num_tokens": 933888.0,
+ "step": 57
+ },
+ {
+ "entropy": 1.6132855415344238,
+ "epoch": 0.11717171717171718,
+ "grad_norm": 2.026301145553589,
+ "learning_rate": 4.884848484848485e-06,
+ "loss": 1.6233609914779663,
+ "mean_token_accuracy": 0.6279311180114746,
+ "num_tokens": 950272.0,
+ "step": 58
+ },
+ {
+ "entropy": 1.738538384437561,
+ "epoch": 0.1191919191919192,
+ "grad_norm": 2.1539394855499268,
+ "learning_rate": 4.882828282828283e-06,
+ "loss": 1.8147332668304443,
+ "mean_token_accuracy": 0.6124816536903381,
+ "num_tokens": 966656.0,
+ "step": 59
+ },
+ {
+ "entropy": 1.5533764362335205,
+ "epoch": 0.12121212121212122,
+ "grad_norm": 2.2603628635406494,
+ "learning_rate": 4.880808080808081e-06,
+ "loss": 1.562873125076294,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 983040.0,
+ "step": 60
+ },
+ {
+ "entropy": 1.722406268119812,
+ "epoch": 0.12323232323232323,
+ "grad_norm": 2.3630757331848145,
+ "learning_rate": 4.878787878787879e-06,
+ "loss": 1.7461689710617065,
+ "mean_token_accuracy": 0.6023448705673218,
+ "num_tokens": 999424.0,
+ "step": 61
+ },
+ {
+ "entropy": 1.6533517837524414,
+ "epoch": 0.12525252525252525,
+ "grad_norm": 2.2165415287017822,
+ "learning_rate": 4.876767676767677e-06,
+ "loss": 1.676560640335083,
+ "mean_token_accuracy": 0.6437469720840454,
+ "num_tokens": 1015808.0,
+ "step": 62
+ },
+ {
+ "entropy": 1.749995470046997,
+ "epoch": 0.12727272727272726,
+ "grad_norm": 2.1572678089141846,
+ "learning_rate": 4.8747474747474745e-06,
+ "loss": 1.784087896347046,
+ "mean_token_accuracy": 0.5884831547737122,
+ "num_tokens": 1032192.0,
+ "step": 63
+ },
+ {
+ "entropy": 1.442152738571167,
+ "epoch": 0.1292929292929293,
+ "grad_norm": 2.163490056991577,
+ "learning_rate": 4.872727272727273e-06,
+ "loss": 1.4307503700256348,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 1048576.0,
+ "step": 64
+ },
+ {
+ "entropy": 1.2657029628753662,
+ "epoch": 0.13131313131313133,
+ "grad_norm": 2.1225337982177734,
+ "learning_rate": 4.870707070707071e-06,
+ "loss": 1.2731966972351074,
+ "mean_token_accuracy": 0.688568651676178,
+ "num_tokens": 1064960.0,
+ "step": 65
+ },
+ {
+ "entropy": 1.1613880395889282,
+ "epoch": 0.13333333333333333,
+ "grad_norm": 1.9527196884155273,
+ "learning_rate": 4.868686868686869e-06,
+ "loss": 1.13922119140625,
+ "mean_token_accuracy": 0.7389472126960754,
+ "num_tokens": 1081344.0,
+ "step": 66
+ },
+ {
+ "entropy": 1.6936380863189697,
+ "epoch": 0.13535353535353536,
+ "grad_norm": 2.004284620285034,
+ "learning_rate": 4.866666666666667e-06,
+ "loss": 1.6982238292694092,
+ "mean_token_accuracy": 0.6191987991333008,
+ "num_tokens": 1097728.0,
+ "step": 67
+ },
+ {
+ "entropy": 1.750565528869629,
+ "epoch": 0.13737373737373737,
+ "grad_norm": 2.225955009460449,
+ "learning_rate": 4.864646464646466e-06,
+ "loss": 1.796521782875061,
+ "mean_token_accuracy": 0.5934293866157532,
+ "num_tokens": 1114112.0,
+ "step": 68
+ },
+ {
+ "entropy": 1.6608220338821411,
+ "epoch": 0.1393939393939394,
+ "grad_norm": 2.127035617828369,
+ "learning_rate": 4.8626262626262636e-06,
+ "loss": 1.6633095741271973,
+ "mean_token_accuracy": 0.6356253027915955,
+ "num_tokens": 1130496.0,
+ "step": 69
+ },
+ {
+ "entropy": 1.4848661422729492,
+ "epoch": 0.1414141414141414,
+ "grad_norm": 2.0338215827941895,
+ "learning_rate": 4.8606060606060615e-06,
+ "loss": 1.4789674282073975,
+ "mean_token_accuracy": 0.6680508255958557,
+ "num_tokens": 1146880.0,
+ "step": 70
+ },
+ {
+ "entropy": 1.2310466766357422,
+ "epoch": 0.14343434343434344,
+ "grad_norm": 2.105898141860962,
+ "learning_rate": 4.858585858585859e-06,
+ "loss": 1.2301937341690063,
+ "mean_token_accuracy": 0.7040791511535645,
+ "num_tokens": 1163264.0,
+ "step": 71
+ },
+ {
+ "entropy": 1.6310514211654663,
+ "epoch": 0.14545454545454545,
+ "grad_norm": 2.152125358581543,
+ "learning_rate": 4.856565656565657e-06,
+ "loss": 1.643636703491211,
+ "mean_token_accuracy": 0.6221299171447754,
+ "num_tokens": 1179648.0,
+ "step": 72
+ },
+ {
+ "entropy": 1.4747940301895142,
+ "epoch": 0.14747474747474748,
+ "grad_norm": 2.096461296081543,
+ "learning_rate": 4.854545454545455e-06,
+ "loss": 1.42953360080719,
+ "mean_token_accuracy": 0.6651807427406311,
+ "num_tokens": 1196032.0,
+ "step": 73
+ },
+ {
+ "entropy": 1.819259524345398,
+ "epoch": 0.1494949494949495,
+ "grad_norm": 2.2852063179016113,
+ "learning_rate": 4.852525252525253e-06,
+ "loss": 1.845325231552124,
+ "mean_token_accuracy": 0.6036272644996643,
+ "num_tokens": 1212416.0,
+ "step": 74
+ },
+ {
+ "entropy": 1.4233598709106445,
+ "epoch": 0.15151515151515152,
+ "grad_norm": 2.1157381534576416,
+ "learning_rate": 4.850505050505051e-06,
+ "loss": 1.4565438032150269,
+ "mean_token_accuracy": 0.6607230305671692,
+ "num_tokens": 1228800.0,
+ "step": 75
+ },
+ {
+ "entropy": 1.6441459655761719,
+ "epoch": 0.15353535353535352,
+ "grad_norm": 2.2092180252075195,
+ "learning_rate": 4.848484848484849e-06,
+ "loss": 1.6467639207839966,
+ "mean_token_accuracy": 0.6285417675971985,
+ "num_tokens": 1245184.0,
+ "step": 76
+ },
+ {
+ "entropy": 1.6124308109283447,
+ "epoch": 0.15555555555555556,
+ "grad_norm": 2.231876850128174,
+ "learning_rate": 4.846464646464647e-06,
+ "loss": 1.617384672164917,
+ "mean_token_accuracy": 0.6340987086296082,
+ "num_tokens": 1261568.0,
+ "step": 77
+ },
+ {
+ "entropy": 1.828405499458313,
+ "epoch": 0.15757575757575756,
+ "grad_norm": 2.1372313499450684,
+ "learning_rate": 4.8444444444444446e-06,
+ "loss": 1.8333203792572021,
+ "mean_token_accuracy": 0.5979481935501099,
+ "num_tokens": 1277952.0,
+ "step": 78
+ },
+ {
+ "entropy": 1.855564832687378,
+ "epoch": 0.1595959595959596,
+ "grad_norm": 2.1422762870788574,
+ "learning_rate": 4.842424242424243e-06,
+ "loss": 1.9133609533309937,
+ "mean_token_accuracy": 0.570652186870575,
+ "num_tokens": 1294336.0,
+ "step": 79
+ },
+ {
+ "entropy": 1.7908183336257935,
+ "epoch": 0.16161616161616163,
+ "grad_norm": 2.172368049621582,
+ "learning_rate": 4.840404040404041e-06,
+ "loss": 1.8109419345855713,
+ "mean_token_accuracy": 0.60332190990448,
+ "num_tokens": 1310720.0,
+ "step": 80
+ },
+ {
+ "entropy": 1.9537721872329712,
+ "epoch": 0.16363636363636364,
+ "grad_norm": 2.199505090713501,
+ "learning_rate": 4.838383838383839e-06,
+ "loss": 2.0001401901245117,
+ "mean_token_accuracy": 0.5585613250732422,
+ "num_tokens": 1327104.0,
+ "step": 81
+ },
+ {
+ "entropy": 1.5365772247314453,
+ "epoch": 0.16565656565656567,
+ "grad_norm": 2.0778913497924805,
+ "learning_rate": 4.836363636363637e-06,
+ "loss": 1.575089931488037,
+ "mean_token_accuracy": 0.6375183463096619,
+ "num_tokens": 1343488.0,
+ "step": 82
+ },
+ {
+ "entropy": 1.7177143096923828,
+ "epoch": 0.16767676767676767,
+ "grad_norm": 2.1010894775390625,
+ "learning_rate": 4.834343434343435e-06,
+ "loss": 1.7428388595581055,
+ "mean_token_accuracy": 0.6113824844360352,
+ "num_tokens": 1359872.0,
+ "step": 83
+ },
+ {
+ "entropy": 1.5080527067184448,
+ "epoch": 0.1696969696969697,
+ "grad_norm": 2.021969795227051,
+ "learning_rate": 4.832323232323233e-06,
+ "loss": 1.5361201763153076,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 1376256.0,
+ "step": 84
+ },
+ {
+ "entropy": 1.5042120218276978,
+ "epoch": 0.1717171717171717,
+ "grad_norm": 2.121314287185669,
+ "learning_rate": 4.830303030303031e-06,
+ "loss": 1.4912033081054688,
+ "mean_token_accuracy": 0.6621274948120117,
+ "num_tokens": 1392640.0,
+ "step": 85
+ },
+ {
+ "entropy": 1.9523948431015015,
+ "epoch": 0.17373737373737375,
+ "grad_norm": 2.1702609062194824,
+ "learning_rate": 4.8282828282828285e-06,
+ "loss": 1.9369449615478516,
+ "mean_token_accuracy": 0.5727283954620361,
+ "num_tokens": 1409024.0,
+ "step": 86
+ },
+ {
+ "entropy": 1.6174770593643188,
+ "epoch": 0.17575757575757575,
+ "grad_norm": 2.222412109375,
+ "learning_rate": 4.826262626262626e-06,
+ "loss": 1.6794973611831665,
+ "mean_token_accuracy": 0.6151685118675232,
+ "num_tokens": 1425408.0,
+ "step": 87
+ },
+ {
+ "entropy": 1.1480307579040527,
+ "epoch": 0.17777777777777778,
+ "grad_norm": 1.98936128616333,
+ "learning_rate": 4.824242424242424e-06,
+ "loss": 1.1324063539505005,
+ "mean_token_accuracy": 0.7193453907966614,
+ "num_tokens": 1441792.0,
+ "step": 88
+ },
+ {
+ "entropy": 1.5290263891220093,
+ "epoch": 0.1797979797979798,
+ "grad_norm": 2.098860263824463,
+ "learning_rate": 4.822222222222222e-06,
+ "loss": 1.556044340133667,
+ "mean_token_accuracy": 0.6415486335754395,
+ "num_tokens": 1458176.0,
+ "step": 89
+ },
+ {
+ "entropy": 1.1366127729415894,
+ "epoch": 0.18181818181818182,
+ "grad_norm": 1.9387420415878296,
+ "learning_rate": 4.820202020202021e-06,
+ "loss": 1.1635141372680664,
+ "mean_token_accuracy": 0.7168416976928711,
+ "num_tokens": 1474560.0,
+ "step": 90
+ },
+ {
+ "entropy": 1.5142875909805298,
+ "epoch": 0.18383838383838383,
+ "grad_norm": 2.259131908416748,
+ "learning_rate": 4.818181818181819e-06,
+ "loss": 1.5329954624176025,
+ "mean_token_accuracy": 0.6471666097640991,
+ "num_tokens": 1490944.0,
+ "step": 91
+ },
+ {
+ "entropy": 1.5197135210037231,
+ "epoch": 0.18585858585858586,
+ "grad_norm": 2.1230807304382324,
+ "learning_rate": 4.816161616161617e-06,
+ "loss": 1.541062593460083,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 1507328.0,
+ "step": 92
+ },
+ {
+ "entropy": 1.5469954013824463,
+ "epoch": 0.18787878787878787,
+ "grad_norm": 2.0568583011627197,
+ "learning_rate": 4.8141414141414146e-06,
+ "loss": 1.5564078092575073,
+ "mean_token_accuracy": 0.6384953856468201,
+ "num_tokens": 1523712.0,
+ "step": 93
+ },
+ {
+ "entropy": 1.5429692268371582,
+ "epoch": 0.1898989898989899,
+ "grad_norm": 2.200144052505493,
+ "learning_rate": 4.8121212121212125e-06,
+ "loss": 1.5292989015579224,
+ "mean_token_accuracy": 0.6373351216316223,
+ "num_tokens": 1540096.0,
+ "step": 94
+ },
+ {
+ "entropy": 1.4556076526641846,
+ "epoch": 0.1919191919191919,
+ "grad_norm": 2.250291585922241,
+ "learning_rate": 4.81010101010101e-06,
+ "loss": 1.426419734954834,
+ "mean_token_accuracy": 0.6604176759719849,
+ "num_tokens": 1556480.0,
+ "step": 95
+ },
+ {
+ "entropy": 1.4021440744400024,
+ "epoch": 0.19393939393939394,
+ "grad_norm": 2.287038803100586,
+ "learning_rate": 4.808080808080808e-06,
+ "loss": 1.4377000331878662,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 1572864.0,
+ "step": 96
+ },
+ {
+ "entropy": 1.658683180809021,
+ "epoch": 0.19595959595959597,
+ "grad_norm": 2.1817963123321533,
+ "learning_rate": 4.806060606060606e-06,
+ "loss": 1.6514620780944824,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 1589248.0,
+ "step": 97
+ },
+ {
+ "entropy": 1.5182844400405884,
+ "epoch": 0.19797979797979798,
+ "grad_norm": 2.144071340560913,
+ "learning_rate": 4.804040404040404e-06,
+ "loss": 1.5554628372192383,
+ "mean_token_accuracy": 0.6311064958572388,
+ "num_tokens": 1605632.0,
+ "step": 98
+ },
+ {
+ "entropy": 1.5997719764709473,
+ "epoch": 0.2,
+ "grad_norm": 2.0921664237976074,
+ "learning_rate": 4.802020202020202e-06,
+ "loss": 1.6185517311096191,
+ "mean_token_accuracy": 0.6286028623580933,
+ "num_tokens": 1622016.0,
+ "step": 99
+ },
+ {
+ "entropy": 1.4011279344558716,
+ "epoch": 0.20202020202020202,
+ "grad_norm": 2.2240700721740723,
+ "learning_rate": 4.800000000000001e-06,
+ "loss": 1.4112927913665771,
+ "mean_token_accuracy": 0.6696995496749878,
+ "num_tokens": 1638400.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.20202020202020202,
+ "eval_entropy": 1.606662715634992,
+ "eval_loss": 1.6283859014511108,
+ "eval_mean_token_accuracy": 0.6293055717983553,
+ "eval_num_tokens": 1638400.0,
+ "eval_runtime": 43.7782,
+ "eval_samples_per_second": 22.614,
+ "eval_steps_per_second": 2.832,
+ "step": 100
+ },
+ {
+ "entropy": 1.6743865013122559,
+ "epoch": 0.20404040404040405,
+ "grad_norm": 2.025153398513794,
+ "learning_rate": 4.7979797979797985e-06,
+ "loss": 1.6404725313186646,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 1654784.0,
+ "step": 101
+ },
+ {
+ "entropy": 1.6196308135986328,
+ "epoch": 0.20606060606060606,
+ "grad_norm": 2.037229299545288,
+ "learning_rate": 4.795959595959596e-06,
+ "loss": 1.647303581237793,
+ "mean_token_accuracy": 0.6203590631484985,
+ "num_tokens": 1671168.0,
+ "step": 102
+ },
+ {
+ "entropy": 1.5600125789642334,
+ "epoch": 0.2080808080808081,
+ "grad_norm": 2.144221782684326,
+ "learning_rate": 4.793939393939394e-06,
+ "loss": 1.6199731826782227,
+ "mean_token_accuracy": 0.6249389052391052,
+ "num_tokens": 1687552.0,
+ "step": 103
+ },
+ {
+ "entropy": 2.064497947692871,
+ "epoch": 0.2101010101010101,
+ "grad_norm": 2.3956470489501953,
+ "learning_rate": 4.791919191919192e-06,
+ "loss": 2.048987627029419,
+ "mean_token_accuracy": 0.5507450103759766,
+ "num_tokens": 1703936.0,
+ "step": 104
+ },
+ {
+ "entropy": 1.7934812307357788,
+ "epoch": 0.21212121212121213,
+ "grad_norm": 2.487302780151367,
+ "learning_rate": 4.78989898989899e-06,
+ "loss": 1.8285956382751465,
+ "mean_token_accuracy": 0.5749877691268921,
+ "num_tokens": 1720320.0,
+ "step": 105
+ },
+ {
+ "entropy": 1.365216851234436,
+ "epoch": 0.21414141414141413,
+ "grad_norm": 2.0714964866638184,
+ "learning_rate": 4.787878787878788e-06,
+ "loss": 1.3870220184326172,
+ "mean_token_accuracy": 0.6692721247673035,
+ "num_tokens": 1736704.0,
+ "step": 106
+ },
+ {
+ "entropy": 1.4983874559402466,
+ "epoch": 0.21616161616161617,
+ "grad_norm": 1.9995853900909424,
+ "learning_rate": 4.785858585858586e-06,
+ "loss": 1.4949266910552979,
+ "mean_token_accuracy": 0.6554103493690491,
+ "num_tokens": 1753088.0,
+ "step": 107
+ },
+ {
+ "entropy": 2.0503509044647217,
+ "epoch": 0.21818181818181817,
+ "grad_norm": 2.190884590148926,
+ "learning_rate": 4.783838383838385e-06,
+ "loss": 2.079286813735962,
+ "mean_token_accuracy": 0.5657669901847839,
+ "num_tokens": 1769472.0,
+ "step": 108
+ },
+ {
+ "entropy": 1.5557374954223633,
+ "epoch": 0.2202020202020202,
+ "grad_norm": 2.044100761413574,
+ "learning_rate": 4.7818181818181825e-06,
+ "loss": 1.5735318660736084,
+ "mean_token_accuracy": 0.6359916925430298,
+ "num_tokens": 1785856.0,
+ "step": 109
+ },
+ {
+ "entropy": 1.5567635297775269,
+ "epoch": 0.2222222222222222,
+ "grad_norm": 2.3714160919189453,
+ "learning_rate": 4.77979797979798e-06,
+ "loss": 1.6026921272277832,
+ "mean_token_accuracy": 0.6290302872657776,
+ "num_tokens": 1802240.0,
+ "step": 110
+ },
+ {
+ "entropy": 1.8457536697387695,
+ "epoch": 0.22424242424242424,
+ "grad_norm": 2.202939987182617,
+ "learning_rate": 4.777777777777778e-06,
+ "loss": 1.7986081838607788,
+ "mean_token_accuracy": 0.5952613353729248,
+ "num_tokens": 1818624.0,
+ "step": 111
+ },
+ {
+ "entropy": 1.8822020292282104,
+ "epoch": 0.22626262626262628,
+ "grad_norm": 2.2674992084503174,
+ "learning_rate": 4.775757575757576e-06,
+ "loss": 1.9095954895019531,
+ "mean_token_accuracy": 0.5769418478012085,
+ "num_tokens": 1835008.0,
+ "step": 112
+ },
+ {
+ "entropy": 1.5445998907089233,
+ "epoch": 0.22828282828282828,
+ "grad_norm": 2.2848100662231445,
+ "learning_rate": 4.773737373737374e-06,
+ "loss": 1.5832195281982422,
+ "mean_token_accuracy": 0.6337933540344238,
+ "num_tokens": 1851392.0,
+ "step": 113
+ },
+ {
+ "entropy": 1.934509515762329,
+ "epoch": 0.23030303030303031,
+ "grad_norm": 2.3585174083709717,
+ "learning_rate": 4.771717171717172e-06,
+ "loss": 1.9809319972991943,
+ "mean_token_accuracy": 0.5789570212364197,
+ "num_tokens": 1867776.0,
+ "step": 114
+ },
+ {
+ "entropy": 1.7354214191436768,
+ "epoch": 0.23232323232323232,
+ "grad_norm": 2.13913631439209,
+ "learning_rate": 4.769696969696971e-06,
+ "loss": 1.7527806758880615,
+ "mean_token_accuracy": 0.6061308979988098,
+ "num_tokens": 1884160.0,
+ "step": 115
+ },
+ {
+ "entropy": 1.7714784145355225,
+ "epoch": 0.23434343434343435,
+ "grad_norm": 1.9915403127670288,
+ "learning_rate": 4.7676767676767685e-06,
+ "loss": 1.8065431118011475,
+ "mean_token_accuracy": 0.5986199378967285,
+ "num_tokens": 1900544.0,
+ "step": 116
+ },
+ {
+ "entropy": 1.5272125005722046,
+ "epoch": 0.23636363636363636,
+ "grad_norm": 2.004565715789795,
+ "learning_rate": 4.765656565656566e-06,
+ "loss": 1.5074517726898193,
+ "mean_token_accuracy": 0.6601123809814453,
+ "num_tokens": 1916928.0,
+ "step": 117
+ },
+ {
+ "entropy": 1.5393218994140625,
+ "epoch": 0.2383838383838384,
+ "grad_norm": 2.018089532852173,
+ "learning_rate": 4.763636363636364e-06,
+ "loss": 1.5607573986053467,
+ "mean_token_accuracy": 0.6540058851242065,
+ "num_tokens": 1933312.0,
+ "step": 118
+ },
+ {
+ "entropy": 1.7827534675598145,
+ "epoch": 0.2404040404040404,
+ "grad_norm": 2.062368392944336,
+ "learning_rate": 4.761616161616162e-06,
+ "loss": 1.7844001054763794,
+ "mean_token_accuracy": 0.6187102794647217,
+ "num_tokens": 1949696.0,
+ "step": 119
+ },
+ {
+ "entropy": 1.416417121887207,
+ "epoch": 0.24242424242424243,
+ "grad_norm": 2.0980024337768555,
+ "learning_rate": 4.75959595959596e-06,
+ "loss": 1.4041050672531128,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 1966080.0,
+ "step": 120
+ },
+ {
+ "entropy": 1.3325153589248657,
+ "epoch": 0.24444444444444444,
+ "grad_norm": 1.9985002279281616,
+ "learning_rate": 4.757575757575758e-06,
+ "loss": 1.3197274208068848,
+ "mean_token_accuracy": 0.6806912422180176,
+ "num_tokens": 1982464.0,
+ "step": 121
+ },
+ {
+ "entropy": 1.7306798696517944,
+ "epoch": 0.24646464646464647,
+ "grad_norm": 2.2098441123962402,
+ "learning_rate": 4.755555555555556e-06,
+ "loss": 1.7595295906066895,
+ "mean_token_accuracy": 0.6110160946846008,
+ "num_tokens": 1998848.0,
+ "step": 122
+ },
+ {
+ "entropy": 1.3733264207839966,
+ "epoch": 0.24848484848484848,
+ "grad_norm": 1.9827327728271484,
+ "learning_rate": 4.753535353535354e-06,
+ "loss": 1.4026854038238525,
+ "mean_token_accuracy": 0.65486079454422,
+ "num_tokens": 2015232.0,
+ "step": 123
+ },
+ {
+ "entropy": 1.5910528898239136,
+ "epoch": 0.2505050505050505,
+ "grad_norm": 1.9615319967269897,
+ "learning_rate": 4.751515151515152e-06,
+ "loss": 1.6071114540100098,
+ "mean_token_accuracy": 0.648937463760376,
+ "num_tokens": 2031616.0,
+ "step": 124
+ },
+ {
+ "entropy": 1.3300938606262207,
+ "epoch": 0.25252525252525254,
+ "grad_norm": 1.9878504276275635,
+ "learning_rate": 4.7494949494949495e-06,
+ "loss": 1.3623383045196533,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 2048000.0,
+ "step": 125
+ },
+ {
+ "entropy": 1.6087368726730347,
+ "epoch": 0.2545454545454545,
+ "grad_norm": 2.264647960662842,
+ "learning_rate": 4.747474747474748e-06,
+ "loss": 1.634058952331543,
+ "mean_token_accuracy": 0.6211528778076172,
+ "num_tokens": 2064384.0,
+ "step": 126
+ },
+ {
+ "entropy": 1.536401391029358,
+ "epoch": 0.25656565656565655,
+ "grad_norm": 1.9561539888381958,
+ "learning_rate": 4.745454545454546e-06,
+ "loss": 1.5699501037597656,
+ "mean_token_accuracy": 0.6248167753219604,
+ "num_tokens": 2080768.0,
+ "step": 127
+ },
+ {
+ "entropy": 1.656266212463379,
+ "epoch": 0.2585858585858586,
+ "grad_norm": 2.1124353408813477,
+ "learning_rate": 4.743434343434344e-06,
+ "loss": 1.6612167358398438,
+ "mean_token_accuracy": 0.623900830745697,
+ "num_tokens": 2097152.0,
+ "step": 128
+ },
+ {
+ "entropy": 1.170629620552063,
+ "epoch": 0.2606060606060606,
+ "grad_norm": 1.917840600013733,
+ "learning_rate": 4.741414141414142e-06,
+ "loss": 1.1992300748825073,
+ "mean_token_accuracy": 0.6995603442192078,
+ "num_tokens": 2113536.0,
+ "step": 129
+ },
+ {
+ "entropy": 1.4126694202423096,
+ "epoch": 0.26262626262626265,
+ "grad_norm": 1.9041539430618286,
+ "learning_rate": 4.73939393939394e-06,
+ "loss": 1.4334447383880615,
+ "mean_token_accuracy": 0.6637151837348938,
+ "num_tokens": 2129920.0,
+ "step": 130
+ },
+ {
+ "entropy": 1.8490277528762817,
+ "epoch": 0.26464646464646463,
+ "grad_norm": 2.1440138816833496,
+ "learning_rate": 4.737373737373738e-06,
+ "loss": 1.9226353168487549,
+ "mean_token_accuracy": 0.5805447101593018,
+ "num_tokens": 2146304.0,
+ "step": 131
+ },
+ {
+ "entropy": 1.5000964403152466,
+ "epoch": 0.26666666666666666,
+ "grad_norm": 1.9615508317947388,
+ "learning_rate": 4.735353535353536e-06,
+ "loss": 1.495596170425415,
+ "mean_token_accuracy": 0.6542501449584961,
+ "num_tokens": 2162688.0,
+ "step": 132
+ },
+ {
+ "entropy": 1.9371142387390137,
+ "epoch": 0.2686868686868687,
+ "grad_norm": 2.202200412750244,
+ "learning_rate": 4.7333333333333335e-06,
+ "loss": 1.94151771068573,
+ "mean_token_accuracy": 0.5810332298278809,
+ "num_tokens": 2179072.0,
+ "step": 133
+ },
+ {
+ "entropy": 1.4535126686096191,
+ "epoch": 0.27070707070707073,
+ "grad_norm": 1.9804027080535889,
+ "learning_rate": 4.731313131313131e-06,
+ "loss": 1.4401545524597168,
+ "mean_token_accuracy": 0.6585246920585632,
+ "num_tokens": 2195456.0,
+ "step": 134
+ },
+ {
+ "entropy": 2.0871424674987793,
+ "epoch": 0.2727272727272727,
+ "grad_norm": 2.1417081356048584,
+ "learning_rate": 4.729292929292929e-06,
+ "loss": 2.117375373840332,
+ "mean_token_accuracy": 0.5600268840789795,
+ "num_tokens": 2211840.0,
+ "step": 135
+ },
+ {
+ "entropy": 1.2986469268798828,
+ "epoch": 0.27474747474747474,
+ "grad_norm": 2.0299136638641357,
+ "learning_rate": 4.727272727272728e-06,
+ "loss": 1.3631991147994995,
+ "mean_token_accuracy": 0.6750732660293579,
+ "num_tokens": 2228224.0,
+ "step": 136
+ },
+ {
+ "entropy": 1.163429617881775,
+ "epoch": 0.2767676767676768,
+ "grad_norm": 1.8368210792541504,
+ "learning_rate": 4.725252525252526e-06,
+ "loss": 1.1603795289993286,
+ "mean_token_accuracy": 0.7150708436965942,
+ "num_tokens": 2244608.0,
+ "step": 137
+ },
+ {
+ "entropy": 1.4301519393920898,
+ "epoch": 0.2787878787878788,
+ "grad_norm": 1.996767520904541,
+ "learning_rate": 4.723232323232324e-06,
+ "loss": 1.422170639038086,
+ "mean_token_accuracy": 0.6816682815551758,
+ "num_tokens": 2260992.0,
+ "step": 138
+ },
+ {
+ "entropy": 1.5160106420516968,
+ "epoch": 0.2808080808080808,
+ "grad_norm": 2.004770278930664,
+ "learning_rate": 4.721212121212122e-06,
+ "loss": 1.5385751724243164,
+ "mean_token_accuracy": 0.640693724155426,
+ "num_tokens": 2277376.0,
+ "step": 139
+ },
+ {
+ "entropy": 1.2483867406845093,
+ "epoch": 0.2828282828282828,
+ "grad_norm": 1.8488364219665527,
+ "learning_rate": 4.7191919191919195e-06,
+ "loss": 1.2563843727111816,
+ "mean_token_accuracy": 0.6998046040534973,
+ "num_tokens": 2293760.0,
+ "step": 140
+ },
+ {
+ "entropy": 1.3214129209518433,
+ "epoch": 0.28484848484848485,
+ "grad_norm": 2.1334660053253174,
+ "learning_rate": 4.717171717171717e-06,
+ "loss": 1.3392664194107056,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 2310144.0,
+ "step": 141
+ },
+ {
+ "entropy": 1.611849069595337,
+ "epoch": 0.2868686868686869,
+ "grad_norm": 2.0539803504943848,
+ "learning_rate": 4.715151515151515e-06,
+ "loss": 1.6335396766662598,
+ "mean_token_accuracy": 0.6235954761505127,
+ "num_tokens": 2326528.0,
+ "step": 142
+ },
+ {
+ "entropy": 1.5847896337509155,
+ "epoch": 0.28888888888888886,
+ "grad_norm": 2.1658759117126465,
+ "learning_rate": 4.713131313131313e-06,
+ "loss": 1.603764533996582,
+ "mean_token_accuracy": 0.633671224117279,
+ "num_tokens": 2342912.0,
+ "step": 143
+ },
+ {
+ "entropy": 1.5731406211853027,
+ "epoch": 0.2909090909090909,
+ "grad_norm": 2.0830390453338623,
+ "learning_rate": 4.711111111111111e-06,
+ "loss": 1.558933973312378,
+ "mean_token_accuracy": 0.6392892003059387,
+ "num_tokens": 2359296.0,
+ "step": 144
+ },
+ {
+ "entropy": 1.8901628255844116,
+ "epoch": 0.29292929292929293,
+ "grad_norm": 2.1436922550201416,
+ "learning_rate": 4.709090909090909e-06,
+ "loss": 1.878631353378296,
+ "mean_token_accuracy": 0.57333904504776,
+ "num_tokens": 2375680.0,
+ "step": 145
+ },
+ {
+ "entropy": 1.9344228506088257,
+ "epoch": 0.29494949494949496,
+ "grad_norm": 2.1245176792144775,
+ "learning_rate": 4.707070707070707e-06,
+ "loss": 1.9546704292297363,
+ "mean_token_accuracy": 0.5987420678138733,
+ "num_tokens": 2392064.0,
+ "step": 146
+ },
+ {
+ "entropy": 1.2455096244812012,
+ "epoch": 0.296969696969697,
+ "grad_norm": 1.896581768989563,
+ "learning_rate": 4.705050505050506e-06,
+ "loss": 1.2738728523254395,
+ "mean_token_accuracy": 0.7025524973869324,
+ "num_tokens": 2408448.0,
+ "step": 147
+ },
+ {
+ "entropy": 1.4235948324203491,
+ "epoch": 0.298989898989899,
+ "grad_norm": 2.522636890411377,
+ "learning_rate": 4.7030303030303035e-06,
+ "loss": 1.4524480104446411,
+ "mean_token_accuracy": 0.6441133618354797,
+ "num_tokens": 2424832.0,
+ "step": 148
+ },
+ {
+ "entropy": 1.764552116394043,
+ "epoch": 0.301010101010101,
+ "grad_norm": 2.0232255458831787,
+ "learning_rate": 4.701010101010101e-06,
+ "loss": 1.7811740636825562,
+ "mean_token_accuracy": 0.6229848265647888,
+ "num_tokens": 2441216.0,
+ "step": 149
+ },
+ {
+ "entropy": 1.74843168258667,
+ "epoch": 0.30303030303030304,
+ "grad_norm": 2.1589369773864746,
+ "learning_rate": 4.698989898989899e-06,
+ "loss": 1.7337679862976074,
+ "mean_token_accuracy": 0.5975207686424255,
+ "num_tokens": 2457600.0,
+ "step": 150
+ },
+ {
+ "epoch": 0.30303030303030304,
+ "eval_entropy": 1.6033287221385586,
+ "eval_loss": 1.6036633253097534,
+ "eval_mean_token_accuracy": 0.6329842450157288,
+ "eval_num_tokens": 2457600.0,
+ "eval_runtime": 43.7655,
+ "eval_samples_per_second": 22.621,
+ "eval_steps_per_second": 2.833,
+ "step": 150
+ },
+ {
+ "entropy": 2.0572290420532227,
+ "epoch": 0.30505050505050507,
+ "grad_norm": 2.0511579513549805,
+ "learning_rate": 4.696969696969698e-06,
+ "loss": 2.0196030139923096,
+ "mean_token_accuracy": 0.5519052147865295,
+ "num_tokens": 2473984.0,
+ "step": 151
+ },
+ {
+ "entropy": 1.5792397260665894,
+ "epoch": 0.30707070707070705,
+ "grad_norm": 2.048396587371826,
+ "learning_rate": 4.694949494949496e-06,
+ "loss": 1.575985074043274,
+ "mean_token_accuracy": 0.623961865901947,
+ "num_tokens": 2490368.0,
+ "step": 152
+ },
+ {
+ "entropy": 1.487528681755066,
+ "epoch": 0.3090909090909091,
+ "grad_norm": 2.1903791427612305,
+ "learning_rate": 4.692929292929294e-06,
+ "loss": 1.479973316192627,
+ "mean_token_accuracy": 0.6595017313957214,
+ "num_tokens": 2506752.0,
+ "step": 153
+ },
+ {
+ "entropy": 1.766797423362732,
+ "epoch": 0.3111111111111111,
+ "grad_norm": 2.1843011379241943,
+ "learning_rate": 4.690909090909092e-06,
+ "loss": 1.7993412017822266,
+ "mean_token_accuracy": 0.5965437293052673,
+ "num_tokens": 2523136.0,
+ "step": 154
+ },
+ {
+ "entropy": 1.7058254480361938,
+ "epoch": 0.31313131313131315,
+ "grad_norm": 2.204461097717285,
+ "learning_rate": 4.6888888888888895e-06,
+ "loss": 1.7346007823944092,
+ "mean_token_accuracy": 0.6077185869216919,
+ "num_tokens": 2539520.0,
+ "step": 155
+ },
+ {
+ "entropy": 1.4929591417312622,
+ "epoch": 0.3151515151515151,
+ "grad_norm": 2.1739237308502197,
+ "learning_rate": 4.6868686868686874e-06,
+ "loss": 1.4708621501922607,
+ "mean_token_accuracy": 0.6427088379859924,
+ "num_tokens": 2555904.0,
+ "step": 156
+ },
+ {
+ "entropy": 1.5797587633132935,
+ "epoch": 0.31717171717171716,
+ "grad_norm": 2.150561571121216,
+ "learning_rate": 4.684848484848485e-06,
+ "loss": 1.5921857357025146,
+ "mean_token_accuracy": 0.6262823939323425,
+ "num_tokens": 2572288.0,
+ "step": 157
+ },
+ {
+ "entropy": 1.6198230981826782,
+ "epoch": 0.3191919191919192,
+ "grad_norm": 2.061169385910034,
+ "learning_rate": 4.682828282828283e-06,
+ "loss": 1.6601009368896484,
+ "mean_token_accuracy": 0.619015634059906,
+ "num_tokens": 2588672.0,
+ "step": 158
+ },
+ {
+ "entropy": 1.4026126861572266,
+ "epoch": 0.3212121212121212,
+ "grad_norm": 2.066208839416504,
+ "learning_rate": 4.680808080808081e-06,
+ "loss": 1.4062483310699463,
+ "mean_token_accuracy": 0.6681729555130005,
+ "num_tokens": 2605056.0,
+ "step": 159
+ },
+ {
+ "entropy": 1.4608066082000732,
+ "epoch": 0.32323232323232326,
+ "grad_norm": 2.022627353668213,
+ "learning_rate": 4.678787878787879e-06,
+ "loss": 1.4644970893859863,
+ "mean_token_accuracy": 0.6533341407775879,
+ "num_tokens": 2621440.0,
+ "step": 160
+ },
+ {
+ "entropy": 1.222448468208313,
+ "epoch": 0.32525252525252524,
+ "grad_norm": 2.0399329662323,
+ "learning_rate": 4.676767676767677e-06,
+ "loss": 1.2547852993011475,
+ "mean_token_accuracy": 0.6925378441810608,
+ "num_tokens": 2637824.0,
+ "step": 161
+ },
+ {
+ "entropy": 1.8702255487442017,
+ "epoch": 0.32727272727272727,
+ "grad_norm": 2.177307367324829,
+ "learning_rate": 4.674747474747476e-06,
+ "loss": 1.9041712284088135,
+ "mean_token_accuracy": 0.5754152536392212,
+ "num_tokens": 2654208.0,
+ "step": 162
+ },
+ {
+ "entropy": 1.6861947774887085,
+ "epoch": 0.3292929292929293,
+ "grad_norm": 2.009544610977173,
+ "learning_rate": 4.6727272727272735e-06,
+ "loss": 1.7079355716705322,
+ "mean_token_accuracy": 0.615290641784668,
+ "num_tokens": 2670592.0,
+ "step": 163
+ },
+ {
+ "entropy": 1.3880327939987183,
+ "epoch": 0.33131313131313134,
+ "grad_norm": 2.16359543800354,
+ "learning_rate": 4.670707070707071e-06,
+ "loss": 1.4220571517944336,
+ "mean_token_accuracy": 0.6604787707328796,
+ "num_tokens": 2686976.0,
+ "step": 164
+ },
+ {
+ "entropy": 1.5760643482208252,
+ "epoch": 0.3333333333333333,
+ "grad_norm": 2.09773325920105,
+ "learning_rate": 4.668686868686869e-06,
+ "loss": 1.6036784648895264,
+ "mean_token_accuracy": 0.6267098188400269,
+ "num_tokens": 2703360.0,
+ "step": 165
+ },
+ {
+ "entropy": 1.078303575515747,
+ "epoch": 0.33535353535353535,
+ "grad_norm": 1.7760599851608276,
+ "learning_rate": 4.666666666666667e-06,
+ "loss": 1.0612695217132568,
+ "mean_token_accuracy": 0.7349169254302979,
+ "num_tokens": 2719744.0,
+ "step": 166
+ },
+ {
+ "entropy": 1.3722130060195923,
+ "epoch": 0.3373737373737374,
+ "grad_norm": 2.0816409587860107,
+ "learning_rate": 4.664646464646465e-06,
+ "loss": 1.3693504333496094,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 2736128.0,
+ "step": 167
+ },
+ {
+ "entropy": 1.8752760887145996,
+ "epoch": 0.3393939393939394,
+ "grad_norm": 2.1670358180999756,
+ "learning_rate": 4.662626262626263e-06,
+ "loss": 1.8874578475952148,
+ "mean_token_accuracy": 0.5881778001785278,
+ "num_tokens": 2752512.0,
+ "step": 168
+ },
+ {
+ "entropy": 1.7384581565856934,
+ "epoch": 0.3414141414141414,
+ "grad_norm": 2.0072429180145264,
+ "learning_rate": 4.660606060606061e-06,
+ "loss": 1.7491583824157715,
+ "mean_token_accuracy": 0.6041157841682434,
+ "num_tokens": 2768896.0,
+ "step": 169
+ },
+ {
+ "entropy": 1.6651691198349,
+ "epoch": 0.3434343434343434,
+ "grad_norm": 2.0812578201293945,
+ "learning_rate": 4.658585858585859e-06,
+ "loss": 1.6808438301086426,
+ "mean_token_accuracy": 0.6273204684257507,
+ "num_tokens": 2785280.0,
+ "step": 170
+ },
+ {
+ "entropy": 1.3426616191864014,
+ "epoch": 0.34545454545454546,
+ "grad_norm": 1.9108822345733643,
+ "learning_rate": 4.656565656565657e-06,
+ "loss": 1.3404264450073242,
+ "mean_token_accuracy": 0.6703101992607117,
+ "num_tokens": 2801664.0,
+ "step": 171
+ },
+ {
+ "entropy": 1.631722092628479,
+ "epoch": 0.3474747474747475,
+ "grad_norm": 2.07317852973938,
+ "learning_rate": 4.654545454545455e-06,
+ "loss": 1.6545813083648682,
+ "mean_token_accuracy": 0.6143136024475098,
+ "num_tokens": 2818048.0,
+ "step": 172
+ },
+ {
+ "entropy": 1.3678289651870728,
+ "epoch": 0.34949494949494947,
+ "grad_norm": 1.8517454862594604,
+ "learning_rate": 4.652525252525253e-06,
+ "loss": 1.3759769201278687,
+ "mean_token_accuracy": 0.6693942546844482,
+ "num_tokens": 2834432.0,
+ "step": 173
+ },
+ {
+ "entropy": 1.3927773237228394,
+ "epoch": 0.3515151515151515,
+ "grad_norm": 2.1304867267608643,
+ "learning_rate": 4.650505050505051e-06,
+ "loss": 1.4104211330413818,
+ "mean_token_accuracy": 0.6612725853919983,
+ "num_tokens": 2850816.0,
+ "step": 174
+ },
+ {
+ "entropy": 1.3352863788604736,
+ "epoch": 0.35353535353535354,
+ "grad_norm": 2.2788777351379395,
+ "learning_rate": 4.648484848484849e-06,
+ "loss": 1.3665719032287598,
+ "mean_token_accuracy": 0.6640205383300781,
+ "num_tokens": 2867200.0,
+ "step": 175
+ },
+ {
+ "entropy": 1.6800754070281982,
+ "epoch": 0.35555555555555557,
+ "grad_norm": 2.030787944793701,
+ "learning_rate": 4.646464646464647e-06,
+ "loss": 1.7239181995391846,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 2883584.0,
+ "step": 176
+ },
+ {
+ "entropy": 1.2852731943130493,
+ "epoch": 0.3575757575757576,
+ "grad_norm": 1.9148248434066772,
+ "learning_rate": 4.644444444444445e-06,
+ "loss": 1.2934880256652832,
+ "mean_token_accuracy": 0.6798363327980042,
+ "num_tokens": 2899968.0,
+ "step": 177
+ },
+ {
+ "entropy": 1.6366593837738037,
+ "epoch": 0.3595959595959596,
+ "grad_norm": 2.2264015674591064,
+ "learning_rate": 4.642424242424243e-06,
+ "loss": 1.632002592086792,
+ "mean_token_accuracy": 0.6180385947227478,
+ "num_tokens": 2916352.0,
+ "step": 178
+ },
+ {
+ "entropy": 1.3935565948486328,
+ "epoch": 0.3616161616161616,
+ "grad_norm": 2.0410475730895996,
+ "learning_rate": 4.6404040404040406e-06,
+ "loss": 1.407370686531067,
+ "mean_token_accuracy": 0.6722032427787781,
+ "num_tokens": 2932736.0,
+ "step": 179
+ },
+ {
+ "entropy": 1.0952510833740234,
+ "epoch": 0.36363636363636365,
+ "grad_norm": 1.937270164489746,
+ "learning_rate": 4.6383838383838384e-06,
+ "loss": 1.1101973056793213,
+ "mean_token_accuracy": 0.730947732925415,
+ "num_tokens": 2949120.0,
+ "step": 180
+ },
+ {
+ "entropy": 1.184926152229309,
+ "epoch": 0.3656565656565657,
+ "grad_norm": 1.9867528676986694,
+ "learning_rate": 4.636363636363636e-06,
+ "loss": 1.1932196617126465,
+ "mean_token_accuracy": 0.7085368633270264,
+ "num_tokens": 2965504.0,
+ "step": 181
+ },
+ {
+ "entropy": 1.4552072286605835,
+ "epoch": 0.36767676767676766,
+ "grad_norm": 1.9395766258239746,
+ "learning_rate": 4.634343434343434e-06,
+ "loss": 1.4559956789016724,
+ "mean_token_accuracy": 0.6534562706947327,
+ "num_tokens": 2981888.0,
+ "step": 182
+ },
+ {
+ "entropy": 1.6437443494796753,
+ "epoch": 0.3696969696969697,
+ "grad_norm": 2.1257567405700684,
+ "learning_rate": 4.632323232323233e-06,
+ "loss": 1.6260980367660522,
+ "mean_token_accuracy": 0.625,
+ "num_tokens": 2998272.0,
+ "step": 183
+ },
+ {
+ "entropy": 1.8264633417129517,
+ "epoch": 0.3717171717171717,
+ "grad_norm": 2.187041759490967,
+ "learning_rate": 4.630303030303031e-06,
+ "loss": 1.8431676626205444,
+ "mean_token_accuracy": 0.60332190990448,
+ "num_tokens": 3014656.0,
+ "step": 184
+ },
+ {
+ "entropy": 1.1121351718902588,
+ "epoch": 0.37373737373737376,
+ "grad_norm": 1.8460402488708496,
+ "learning_rate": 4.628282828282829e-06,
+ "loss": 1.1054425239562988,
+ "mean_token_accuracy": 0.7254518866539001,
+ "num_tokens": 3031040.0,
+ "step": 185
+ },
+ {
+ "entropy": 1.3531955480575562,
+ "epoch": 0.37575757575757573,
+ "grad_norm": 2.3463470935821533,
+ "learning_rate": 4.626262626262627e-06,
+ "loss": 1.359381914138794,
+ "mean_token_accuracy": 0.6610894203186035,
+ "num_tokens": 3047424.0,
+ "step": 186
+ },
+ {
+ "entropy": 1.2131577730178833,
+ "epoch": 0.37777777777777777,
+ "grad_norm": 1.9595171213150024,
+ "learning_rate": 4.6242424242424245e-06,
+ "loss": 1.2312005758285522,
+ "mean_token_accuracy": 0.6979115605354309,
+ "num_tokens": 3063808.0,
+ "step": 187
+ },
+ {
+ "entropy": 1.5441125631332397,
+ "epoch": 0.3797979797979798,
+ "grad_norm": 2.2971343994140625,
+ "learning_rate": 4.622222222222222e-06,
+ "loss": 1.5923339128494263,
+ "mean_token_accuracy": 0.6297020316123962,
+ "num_tokens": 3080192.0,
+ "step": 188
+ },
+ {
+ "entropy": 1.7998323440551758,
+ "epoch": 0.38181818181818183,
+ "grad_norm": 2.010552167892456,
+ "learning_rate": 4.62020202020202e-06,
+ "loss": 1.8257204294204712,
+ "mean_token_accuracy": 0.5997191071510315,
+ "num_tokens": 3096576.0,
+ "step": 189
+ },
+ {
+ "entropy": 1.389051914215088,
+ "epoch": 0.3838383838383838,
+ "grad_norm": 2.1183855533599854,
+ "learning_rate": 4.618181818181818e-06,
+ "loss": 1.431575059890747,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 3112960.0,
+ "step": 190
+ },
+ {
+ "entropy": 2.0066142082214355,
+ "epoch": 0.38585858585858585,
+ "grad_norm": 2.061399221420288,
+ "learning_rate": 4.616161616161616e-06,
+ "loss": 2.0477406978607178,
+ "mean_token_accuracy": 0.5454934239387512,
+ "num_tokens": 3129344.0,
+ "step": 191
+ },
+ {
+ "entropy": 1.3063198328018188,
+ "epoch": 0.3878787878787879,
+ "grad_norm": 1.9490301609039307,
+ "learning_rate": 4.614141414141414e-06,
+ "loss": 1.3293564319610596,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 3145728.0,
+ "step": 192
+ },
+ {
+ "entropy": 1.3636538982391357,
+ "epoch": 0.3898989898989899,
+ "grad_norm": 2.025458574295044,
+ "learning_rate": 4.612121212121212e-06,
+ "loss": 1.3736209869384766,
+ "mean_token_accuracy": 0.679286777973175,
+ "num_tokens": 3162112.0,
+ "step": 193
+ },
+ {
+ "entropy": 1.5669925212860107,
+ "epoch": 0.39191919191919194,
+ "grad_norm": 2.064033269882202,
+ "learning_rate": 4.6101010101010106e-06,
+ "loss": 1.5587083101272583,
+ "mean_token_accuracy": 0.6267709136009216,
+ "num_tokens": 3178496.0,
+ "step": 194
+ },
+ {
+ "entropy": 1.4489716291427612,
+ "epoch": 0.3939393939393939,
+ "grad_norm": 2.0174880027770996,
+ "learning_rate": 4.6080808080808085e-06,
+ "loss": 1.4331417083740234,
+ "mean_token_accuracy": 0.6571812629699707,
+ "num_tokens": 3194880.0,
+ "step": 195
+ },
+ {
+ "entropy": 2.026416778564453,
+ "epoch": 0.39595959595959596,
+ "grad_norm": 2.1820878982543945,
+ "learning_rate": 4.606060606060606e-06,
+ "loss": 2.029003143310547,
+ "mean_token_accuracy": 0.563568651676178,
+ "num_tokens": 3211264.0,
+ "step": 196
+ },
+ {
+ "entropy": 2.1844022274017334,
+ "epoch": 0.397979797979798,
+ "grad_norm": 2.175349473953247,
+ "learning_rate": 4.604040404040404e-06,
+ "loss": 2.2053825855255127,
+ "mean_token_accuracy": 0.5553248524665833,
+ "num_tokens": 3227648.0,
+ "step": 197
+ },
+ {
+ "entropy": 1.6750906705856323,
+ "epoch": 0.4,
+ "grad_norm": 1.8300689458847046,
+ "learning_rate": 4.602020202020203e-06,
+ "loss": 1.692289113998413,
+ "mean_token_accuracy": 0.6345261335372925,
+ "num_tokens": 3244032.0,
+ "step": 198
+ },
+ {
+ "entropy": 1.6192772388458252,
+ "epoch": 0.402020202020202,
+ "grad_norm": 1.9788341522216797,
+ "learning_rate": 4.600000000000001e-06,
+ "loss": 1.628842830657959,
+ "mean_token_accuracy": 0.615229606628418,
+ "num_tokens": 3260416.0,
+ "step": 199
+ },
+ {
+ "entropy": 1.444870948791504,
+ "epoch": 0.40404040404040403,
+ "grad_norm": 2.05141544342041,
+ "learning_rate": 4.597979797979799e-06,
+ "loss": 1.4365839958190918,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 3276800.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.40404040404040403,
+ "eval_entropy": 1.5766179907706477,
+ "eval_loss": 1.5878442525863647,
+ "eval_mean_token_accuracy": 0.6355829551335304,
+ "eval_num_tokens": 3276800.0,
+ "eval_runtime": 43.7272,
+ "eval_samples_per_second": 22.64,
+ "eval_steps_per_second": 2.836,
+ "step": 200
+ },
+ {
+ "entropy": 1.3354029655456543,
+ "epoch": 0.40606060606060607,
+ "grad_norm": 2.012895345687866,
+ "learning_rate": 4.595959595959597e-06,
+ "loss": 1.3289990425109863,
+ "mean_token_accuracy": 0.685271143913269,
+ "num_tokens": 3293184.0,
+ "step": 201
+ },
+ {
+ "entropy": 1.1990011930465698,
+ "epoch": 0.4080808080808081,
+ "grad_norm": 1.9462409019470215,
+ "learning_rate": 4.5939393939393945e-06,
+ "loss": 1.224869728088379,
+ "mean_token_accuracy": 0.6976673007011414,
+ "num_tokens": 3309568.0,
+ "step": 202
+ },
+ {
+ "entropy": 1.6442710161209106,
+ "epoch": 0.4101010101010101,
+ "grad_norm": 2.064532995223999,
+ "learning_rate": 4.591919191919192e-06,
+ "loss": 1.6800963878631592,
+ "mean_token_accuracy": 0.6111993193626404,
+ "num_tokens": 3325952.0,
+ "step": 203
+ },
+ {
+ "entropy": 1.8336306810379028,
+ "epoch": 0.4121212121212121,
+ "grad_norm": 2.478731393814087,
+ "learning_rate": 4.58989898989899e-06,
+ "loss": 1.8518702983856201,
+ "mean_token_accuracy": 0.6021006107330322,
+ "num_tokens": 3342336.0,
+ "step": 204
+ },
+ {
+ "entropy": 1.6767220497131348,
+ "epoch": 0.41414141414141414,
+ "grad_norm": 2.0676512718200684,
+ "learning_rate": 4.587878787878788e-06,
+ "loss": 1.674522042274475,
+ "mean_token_accuracy": 0.6178553700447083,
+ "num_tokens": 3358720.0,
+ "step": 205
+ },
+ {
+ "entropy": 1.7236497402191162,
+ "epoch": 0.4161616161616162,
+ "grad_norm": 2.057074785232544,
+ "learning_rate": 4.585858585858586e-06,
+ "loss": 1.725832462310791,
+ "mean_token_accuracy": 0.620114803314209,
+ "num_tokens": 3375104.0,
+ "step": 206
+ },
+ {
+ "entropy": 1.6493065357208252,
+ "epoch": 0.41818181818181815,
+ "grad_norm": 2.0946099758148193,
+ "learning_rate": 4.583838383838384e-06,
+ "loss": 1.6826295852661133,
+ "mean_token_accuracy": 0.6251221299171448,
+ "num_tokens": 3391488.0,
+ "step": 207
+ },
+ {
+ "entropy": 1.3565926551818848,
+ "epoch": 0.4202020202020202,
+ "grad_norm": 1.9611284732818604,
+ "learning_rate": 4.581818181818183e-06,
+ "loss": 1.346787452697754,
+ "mean_token_accuracy": 0.685332179069519,
+ "num_tokens": 3407872.0,
+ "step": 208
+ },
+ {
+ "entropy": 1.4401211738586426,
+ "epoch": 0.4222222222222222,
+ "grad_norm": 1.8614766597747803,
+ "learning_rate": 4.579797979797981e-06,
+ "loss": 1.4717891216278076,
+ "mean_token_accuracy": 0.650036633014679,
+ "num_tokens": 3424256.0,
+ "step": 209
+ },
+ {
+ "entropy": 1.194276213645935,
+ "epoch": 0.42424242424242425,
+ "grad_norm": 2.0625810623168945,
+ "learning_rate": 4.5777777777777785e-06,
+ "loss": 1.2106804847717285,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 3440640.0,
+ "step": 210
+ },
+ {
+ "entropy": 1.7622313499450684,
+ "epoch": 0.4262626262626263,
+ "grad_norm": 2.330610752105713,
+ "learning_rate": 4.575757575757576e-06,
+ "loss": 1.7872710227966309,
+ "mean_token_accuracy": 0.598436713218689,
+ "num_tokens": 3457024.0,
+ "step": 211
+ },
+ {
+ "entropy": 1.409427523612976,
+ "epoch": 0.42828282828282827,
+ "grad_norm": 2.0988259315490723,
+ "learning_rate": 4.573737373737374e-06,
+ "loss": 1.416553020477295,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 3473408.0,
+ "step": 212
+ },
+ {
+ "entropy": 1.6856107711791992,
+ "epoch": 0.4303030303030303,
+ "grad_norm": 2.341475009918213,
+ "learning_rate": 4.571717171717172e-06,
+ "loss": 1.692287802696228,
+ "mean_token_accuracy": 0.6024059653282166,
+ "num_tokens": 3489792.0,
+ "step": 213
+ },
+ {
+ "entropy": 1.997343897819519,
+ "epoch": 0.43232323232323233,
+ "grad_norm": 2.200498104095459,
+ "learning_rate": 4.56969696969697e-06,
+ "loss": 2.026289939880371,
+ "mean_token_accuracy": 0.5781631469726562,
+ "num_tokens": 3506176.0,
+ "step": 214
+ },
+ {
+ "entropy": 1.5175039768218994,
+ "epoch": 0.43434343434343436,
+ "grad_norm": 2.105257272720337,
+ "learning_rate": 4.567676767676768e-06,
+ "loss": 1.521841049194336,
+ "mean_token_accuracy": 0.6404494643211365,
+ "num_tokens": 3522560.0,
+ "step": 215
+ },
+ {
+ "entropy": 1.3616528511047363,
+ "epoch": 0.43636363636363634,
+ "grad_norm": 2.0035297870635986,
+ "learning_rate": 4.565656565656566e-06,
+ "loss": 1.3674360513687134,
+ "mean_token_accuracy": 0.6771494746208191,
+ "num_tokens": 3538944.0,
+ "step": 216
+ },
+ {
+ "entropy": 1.42499840259552,
+ "epoch": 0.4383838383838384,
+ "grad_norm": 1.9115629196166992,
+ "learning_rate": 4.563636363636364e-06,
+ "loss": 1.4129266738891602,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 3555328.0,
+ "step": 217
+ },
+ {
+ "entropy": 1.2844709157943726,
+ "epoch": 0.4404040404040404,
+ "grad_norm": 2.3313121795654297,
+ "learning_rate": 4.5616161616161616e-06,
+ "loss": 1.315006971359253,
+ "mean_token_accuracy": 0.681546151638031,
+ "num_tokens": 3571712.0,
+ "step": 218
+ },
+ {
+ "entropy": 1.5227075815200806,
+ "epoch": 0.44242424242424244,
+ "grad_norm": 2.1849124431610107,
+ "learning_rate": 4.55959595959596e-06,
+ "loss": 1.517989158630371,
+ "mean_token_accuracy": 0.6466169953346252,
+ "num_tokens": 3588096.0,
+ "step": 219
+ },
+ {
+ "entropy": 1.494642734527588,
+ "epoch": 0.4444444444444444,
+ "grad_norm": 2.3109116554260254,
+ "learning_rate": 4.557575757575758e-06,
+ "loss": 1.525421142578125,
+ "mean_token_accuracy": 0.6392281651496887,
+ "num_tokens": 3604480.0,
+ "step": 220
+ },
+ {
+ "entropy": 1.6428948640823364,
+ "epoch": 0.44646464646464645,
+ "grad_norm": 2.1182680130004883,
+ "learning_rate": 4.555555555555556e-06,
+ "loss": 1.6634926795959473,
+ "mean_token_accuracy": 0.6207864880561829,
+ "num_tokens": 3620864.0,
+ "step": 221
+ },
+ {
+ "entropy": 1.7323675155639648,
+ "epoch": 0.4484848484848485,
+ "grad_norm": 2.2620837688446045,
+ "learning_rate": 4.553535353535354e-06,
+ "loss": 1.7312631607055664,
+ "mean_token_accuracy": 0.6138250827789307,
+ "num_tokens": 3637248.0,
+ "step": 222
+ },
+ {
+ "entropy": 1.7863894701004028,
+ "epoch": 0.4505050505050505,
+ "grad_norm": 2.1416971683502197,
+ "learning_rate": 4.551515151515152e-06,
+ "loss": 1.799318552017212,
+ "mean_token_accuracy": 0.5906203985214233,
+ "num_tokens": 3653632.0,
+ "step": 223
+ },
+ {
+ "entropy": 1.7404330968856812,
+ "epoch": 0.45252525252525255,
+ "grad_norm": 2.0814504623413086,
+ "learning_rate": 4.54949494949495e-06,
+ "loss": 1.742197036743164,
+ "mean_token_accuracy": 0.6050317287445068,
+ "num_tokens": 3670016.0,
+ "step": 224
+ },
+ {
+ "entropy": 1.4387869834899902,
+ "epoch": 0.45454545454545453,
+ "grad_norm": 2.1386022567749023,
+ "learning_rate": 4.547474747474748e-06,
+ "loss": 1.4602317810058594,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 3686400.0,
+ "step": 225
+ },
+ {
+ "entropy": 1.2733348608016968,
+ "epoch": 0.45656565656565656,
+ "grad_norm": 2.02687668800354,
+ "learning_rate": 4.5454545454545455e-06,
+ "loss": 1.2683714628219604,
+ "mean_token_accuracy": 0.6966902613639832,
+ "num_tokens": 3702784.0,
+ "step": 226
+ },
+ {
+ "entropy": 1.4554595947265625,
+ "epoch": 0.4585858585858586,
+ "grad_norm": 2.169268846511841,
+ "learning_rate": 4.543434343434343e-06,
+ "loss": 1.4541833400726318,
+ "mean_token_accuracy": 0.6522960662841797,
+ "num_tokens": 3719168.0,
+ "step": 227
+ },
+ {
+ "entropy": 1.487573266029358,
+ "epoch": 0.46060606060606063,
+ "grad_norm": 1.9726165533065796,
+ "learning_rate": 4.541414141414141e-06,
+ "loss": 1.5024409294128418,
+ "mean_token_accuracy": 0.6509526371955872,
+ "num_tokens": 3735552.0,
+ "step": 228
+ },
+ {
+ "entropy": 1.3991138935089111,
+ "epoch": 0.4626262626262626,
+ "grad_norm": 2.0992283821105957,
+ "learning_rate": 4.539393939393939e-06,
+ "loss": 1.4016860723495483,
+ "mean_token_accuracy": 0.6639594435691833,
+ "num_tokens": 3751936.0,
+ "step": 229
+ },
+ {
+ "entropy": 1.6564134359359741,
+ "epoch": 0.46464646464646464,
+ "grad_norm": 2.047656297683716,
+ "learning_rate": 4.537373737373738e-06,
+ "loss": 1.6598721742630005,
+ "mean_token_accuracy": 0.6166951656341553,
+ "num_tokens": 3768320.0,
+ "step": 230
+ },
+ {
+ "entropy": 1.5165014266967773,
+ "epoch": 0.4666666666666667,
+ "grad_norm": 2.079996109008789,
+ "learning_rate": 4.535353535353536e-06,
+ "loss": 1.4980010986328125,
+ "mean_token_accuracy": 0.6370908617973328,
+ "num_tokens": 3784704.0,
+ "step": 231
+ },
+ {
+ "entropy": 1.5409225225448608,
+ "epoch": 0.4686868686868687,
+ "grad_norm": 2.0996923446655273,
+ "learning_rate": 4.533333333333334e-06,
+ "loss": 1.5504257678985596,
+ "mean_token_accuracy": 0.6465559601783752,
+ "num_tokens": 3801088.0,
+ "step": 232
+ },
+ {
+ "entropy": 1.3590043783187866,
+ "epoch": 0.4707070707070707,
+ "grad_norm": 2.14617919921875,
+ "learning_rate": 4.531313131313132e-06,
+ "loss": 1.3581812381744385,
+ "mean_token_accuracy": 0.6683561205863953,
+ "num_tokens": 3817472.0,
+ "step": 233
+ },
+ {
+ "entropy": 1.641785740852356,
+ "epoch": 0.4727272727272727,
+ "grad_norm": 1.9499926567077637,
+ "learning_rate": 4.5292929292929295e-06,
+ "loss": 1.6653470993041992,
+ "mean_token_accuracy": 0.6319614052772522,
+ "num_tokens": 3833856.0,
+ "step": 234
+ },
+ {
+ "entropy": 1.4700758457183838,
+ "epoch": 0.47474747474747475,
+ "grad_norm": 1.9411437511444092,
+ "learning_rate": 4.527272727272727e-06,
+ "loss": 1.4762463569641113,
+ "mean_token_accuracy": 0.6631656289100647,
+ "num_tokens": 3850240.0,
+ "step": 235
+ },
+ {
+ "entropy": 1.5418941974639893,
+ "epoch": 0.4767676767676768,
+ "grad_norm": 2.3191940784454346,
+ "learning_rate": 4.525252525252526e-06,
+ "loss": 1.5151214599609375,
+ "mean_token_accuracy": 0.6326331496238708,
+ "num_tokens": 3866624.0,
+ "step": 236
+ },
+ {
+ "entropy": 2.1102776527404785,
+ "epoch": 0.47878787878787876,
+ "grad_norm": 2.2287707328796387,
+ "learning_rate": 4.523232323232324e-06,
+ "loss": 2.106567859649658,
+ "mean_token_accuracy": 0.5506839156150818,
+ "num_tokens": 3883008.0,
+ "step": 237
+ },
+ {
+ "entropy": 1.7448827028274536,
+ "epoch": 0.4808080808080808,
+ "grad_norm": 2.2352893352508545,
+ "learning_rate": 4.521212121212122e-06,
+ "loss": 1.7495017051696777,
+ "mean_token_accuracy": 0.60326087474823,
+ "num_tokens": 3899392.0,
+ "step": 238
+ },
+ {
+ "entropy": 1.315240740776062,
+ "epoch": 0.48282828282828283,
+ "grad_norm": 1.9933631420135498,
+ "learning_rate": 4.51919191919192e-06,
+ "loss": 1.315302848815918,
+ "mean_token_accuracy": 0.686431348323822,
+ "num_tokens": 3915776.0,
+ "step": 239
+ },
+ {
+ "entropy": 1.5851637125015259,
+ "epoch": 0.48484848484848486,
+ "grad_norm": 2.153303623199463,
+ "learning_rate": 4.517171717171718e-06,
+ "loss": 1.5947662591934204,
+ "mean_token_accuracy": 0.6297020316123962,
+ "num_tokens": 3932160.0,
+ "step": 240
+ },
+ {
+ "entropy": 1.8050944805145264,
+ "epoch": 0.4868686868686869,
+ "grad_norm": 2.025022506713867,
+ "learning_rate": 4.5151515151515155e-06,
+ "loss": 1.8051010370254517,
+ "mean_token_accuracy": 0.6055202484130859,
+ "num_tokens": 3948544.0,
+ "step": 241
+ },
+ {
+ "entropy": 1.518296718597412,
+ "epoch": 0.4888888888888889,
+ "grad_norm": 2.1021833419799805,
+ "learning_rate": 4.513131313131313e-06,
+ "loss": 1.5396809577941895,
+ "mean_token_accuracy": 0.6359916925430298,
+ "num_tokens": 3964928.0,
+ "step": 242
+ },
+ {
+ "entropy": 1.518903136253357,
+ "epoch": 0.4909090909090909,
+ "grad_norm": 2.0960140228271484,
+ "learning_rate": 4.511111111111111e-06,
+ "loss": 1.5528055429458618,
+ "mean_token_accuracy": 0.6224963068962097,
+ "num_tokens": 3981312.0,
+ "step": 243
+ },
+ {
+ "entropy": 1.6960705518722534,
+ "epoch": 0.49292929292929294,
+ "grad_norm": 1.8580718040466309,
+ "learning_rate": 4.50909090909091e-06,
+ "loss": 1.7192862033843994,
+ "mean_token_accuracy": 0.6259770393371582,
+ "num_tokens": 3997696.0,
+ "step": 244
+ },
+ {
+ "entropy": 1.4633033275604248,
+ "epoch": 0.494949494949495,
+ "grad_norm": 1.8983049392700195,
+ "learning_rate": 4.507070707070708e-06,
+ "loss": 1.451701283454895,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 4014080.0,
+ "step": 245
+ },
+ {
+ "entropy": 1.6508095264434814,
+ "epoch": 0.49696969696969695,
+ "grad_norm": 2.298679828643799,
+ "learning_rate": 4.505050505050506e-06,
+ "loss": 1.6596897840499878,
+ "mean_token_accuracy": 0.6115046143531799,
+ "num_tokens": 4030464.0,
+ "step": 246
+ },
+ {
+ "entropy": 1.313779354095459,
+ "epoch": 0.498989898989899,
+ "grad_norm": 1.9894335269927979,
+ "learning_rate": 4.503030303030304e-06,
+ "loss": 1.3285409212112427,
+ "mean_token_accuracy": 0.6802027225494385,
+ "num_tokens": 4046848.0,
+ "step": 247
+ },
+ {
+ "entropy": 1.5139521360397339,
+ "epoch": 0.501010101010101,
+ "grad_norm": 2.028320789337158,
+ "learning_rate": 4.501010101010102e-06,
+ "loss": 1.5366487503051758,
+ "mean_token_accuracy": 0.6416707634925842,
+ "num_tokens": 4063232.0,
+ "step": 248
+ },
+ {
+ "entropy": 1.5277045965194702,
+ "epoch": 0.503030303030303,
+ "grad_norm": 2.3160979747772217,
+ "learning_rate": 4.4989898989898995e-06,
+ "loss": 1.5571036338806152,
+ "mean_token_accuracy": 0.6436858773231506,
+ "num_tokens": 4079616.0,
+ "step": 249
+ },
+ {
+ "entropy": 1.6084188222885132,
+ "epoch": 0.5050505050505051,
+ "grad_norm": 2.20550274848938,
+ "learning_rate": 4.496969696969697e-06,
+ "loss": 1.622127652168274,
+ "mean_token_accuracy": 0.6284196376800537,
+ "num_tokens": 4096000.0,
+ "step": 250
+ },
+ {
+ "epoch": 0.5050505050505051,
+ "eval_entropy": 1.5547234262189558,
+ "eval_loss": 1.5764786005020142,
+ "eval_mean_token_accuracy": 0.6375306306346771,
+ "eval_num_tokens": 4096000.0,
+ "eval_runtime": 43.7607,
+ "eval_samples_per_second": 22.623,
+ "eval_steps_per_second": 2.834,
+ "step": 250
+ },
+ {
+ "entropy": 1.4309135675430298,
+ "epoch": 0.5070707070707071,
+ "grad_norm": 2.080864906311035,
+ "learning_rate": 4.494949494949495e-06,
+ "loss": 1.4481091499328613,
+ "mean_token_accuracy": 0.6694552898406982,
+ "num_tokens": 4112384.0,
+ "step": 251
+ },
+ {
+ "entropy": 1.4067270755767822,
+ "epoch": 0.509090909090909,
+ "grad_norm": 2.036475419998169,
+ "learning_rate": 4.492929292929293e-06,
+ "loss": 1.4035298824310303,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 4128768.0,
+ "step": 252
+ },
+ {
+ "entropy": 2.1751608848571777,
+ "epoch": 0.5111111111111111,
+ "grad_norm": 1.953995943069458,
+ "learning_rate": 4.490909090909091e-06,
+ "loss": 2.1616692543029785,
+ "mean_token_accuracy": 0.5592941045761108,
+ "num_tokens": 4145152.0,
+ "step": 253
+ },
+ {
+ "entropy": 1.45353102684021,
+ "epoch": 0.5131313131313131,
+ "grad_norm": 2.084437370300293,
+ "learning_rate": 4.488888888888889e-06,
+ "loss": 1.4633586406707764,
+ "mean_token_accuracy": 0.6620664596557617,
+ "num_tokens": 4161536.0,
+ "step": 254
+ },
+ {
+ "entropy": 1.64310884475708,
+ "epoch": 0.5151515151515151,
+ "grad_norm": 2.0700111389160156,
+ "learning_rate": 4.486868686868688e-06,
+ "loss": 1.6868078708648682,
+ "mean_token_accuracy": 0.616328775882721,
+ "num_tokens": 4177920.0,
+ "step": 255
+ },
+ {
+ "entropy": 1.5113472938537598,
+ "epoch": 0.5171717171717172,
+ "grad_norm": 2.102180242538452,
+ "learning_rate": 4.4848484848484855e-06,
+ "loss": 1.5240120887756348,
+ "mean_token_accuracy": 0.638067901134491,
+ "num_tokens": 4194304.0,
+ "step": 256
+ },
+ {
+ "entropy": 1.5752851963043213,
+ "epoch": 0.5191919191919192,
+ "grad_norm": 2.026737689971924,
+ "learning_rate": 4.4828282828282834e-06,
+ "loss": 1.6041791439056396,
+ "mean_token_accuracy": 0.6275647282600403,
+ "num_tokens": 4210688.0,
+ "step": 257
+ },
+ {
+ "entropy": 1.548423171043396,
+ "epoch": 0.5212121212121212,
+ "grad_norm": 2.0578935146331787,
+ "learning_rate": 4.480808080808081e-06,
+ "loss": 1.563529372215271,
+ "mean_token_accuracy": 0.6348925232887268,
+ "num_tokens": 4227072.0,
+ "step": 258
+ },
+ {
+ "entropy": 1.5324457883834839,
+ "epoch": 0.5232323232323233,
+ "grad_norm": 2.216235637664795,
+ "learning_rate": 4.478787878787879e-06,
+ "loss": 1.5559678077697754,
+ "mean_token_accuracy": 0.6300073266029358,
+ "num_tokens": 4243456.0,
+ "step": 259
+ },
+ {
+ "entropy": 1.5275540351867676,
+ "epoch": 0.5252525252525253,
+ "grad_norm": 2.037306070327759,
+ "learning_rate": 4.476767676767677e-06,
+ "loss": 1.541567087173462,
+ "mean_token_accuracy": 0.6424035429954529,
+ "num_tokens": 4259840.0,
+ "step": 260
+ },
+ {
+ "entropy": 1.6842185258865356,
+ "epoch": 0.5272727272727272,
+ "grad_norm": 2.0241005420684814,
+ "learning_rate": 4.474747474747475e-06,
+ "loss": 1.6819056272506714,
+ "mean_token_accuracy": 0.6102222800254822,
+ "num_tokens": 4276224.0,
+ "step": 261
+ },
+ {
+ "entropy": 1.5656248331069946,
+ "epoch": 0.5292929292929293,
+ "grad_norm": 1.993054986000061,
+ "learning_rate": 4.472727272727273e-06,
+ "loss": 1.6132277250289917,
+ "mean_token_accuracy": 0.634709358215332,
+ "num_tokens": 4292608.0,
+ "step": 262
+ },
+ {
+ "entropy": 1.6354466676712036,
+ "epoch": 0.5313131313131313,
+ "grad_norm": 2.06508731842041,
+ "learning_rate": 4.470707070707071e-06,
+ "loss": 1.6475149393081665,
+ "mean_token_accuracy": 0.6121763586997986,
+ "num_tokens": 4308992.0,
+ "step": 263
+ },
+ {
+ "entropy": 1.5267232656478882,
+ "epoch": 0.5333333333333333,
+ "grad_norm": 2.1227569580078125,
+ "learning_rate": 4.468686868686869e-06,
+ "loss": 1.5468671321868896,
+ "mean_token_accuracy": 0.6365413069725037,
+ "num_tokens": 4325376.0,
+ "step": 264
+ },
+ {
+ "entropy": 1.2252761125564575,
+ "epoch": 0.5353535353535354,
+ "grad_norm": 2.0596134662628174,
+ "learning_rate": 4.4666666666666665e-06,
+ "loss": 1.2242389917373657,
+ "mean_token_accuracy": 0.6973620057106018,
+ "num_tokens": 4341760.0,
+ "step": 265
+ },
+ {
+ "entropy": 1.6007431745529175,
+ "epoch": 0.5373737373737374,
+ "grad_norm": 1.9341918230056763,
+ "learning_rate": 4.464646464646465e-06,
+ "loss": 1.5989094972610474,
+ "mean_token_accuracy": 0.6284196376800537,
+ "num_tokens": 4358144.0,
+ "step": 266
+ },
+ {
+ "entropy": 1.2708780765533447,
+ "epoch": 0.5393939393939394,
+ "grad_norm": 4.594091415405273,
+ "learning_rate": 4.462626262626263e-06,
+ "loss": 1.3484312295913696,
+ "mean_token_accuracy": 0.6790425181388855,
+ "num_tokens": 4374528.0,
+ "step": 267
+ },
+ {
+ "entropy": 1.5423723459243774,
+ "epoch": 0.5414141414141415,
+ "grad_norm": 1.933602213859558,
+ "learning_rate": 4.460606060606061e-06,
+ "loss": 1.594527244567871,
+ "mean_token_accuracy": 0.6386785507202148,
+ "num_tokens": 4390912.0,
+ "step": 268
+ },
+ {
+ "entropy": 1.7213952541351318,
+ "epoch": 0.5434343434343434,
+ "grad_norm": 2.195904016494751,
+ "learning_rate": 4.458585858585859e-06,
+ "loss": 1.724353551864624,
+ "mean_token_accuracy": 0.6008182764053345,
+ "num_tokens": 4407296.0,
+ "step": 269
+ },
+ {
+ "entropy": 1.4772557020187378,
+ "epoch": 0.5454545454545454,
+ "grad_norm": 2.0990796089172363,
+ "learning_rate": 4.456565656565657e-06,
+ "loss": 1.486825942993164,
+ "mean_token_accuracy": 0.6507083773612976,
+ "num_tokens": 4423680.0,
+ "step": 270
+ },
+ {
+ "entropy": 1.6876367330551147,
+ "epoch": 0.5474747474747474,
+ "grad_norm": 2.1944479942321777,
+ "learning_rate": 4.454545454545455e-06,
+ "loss": 1.71107816696167,
+ "mean_token_accuracy": 0.6027112603187561,
+ "num_tokens": 4440064.0,
+ "step": 271
+ },
+ {
+ "entropy": 1.5480726957321167,
+ "epoch": 0.5494949494949495,
+ "grad_norm": 2.1579341888427734,
+ "learning_rate": 4.452525252525253e-06,
+ "loss": 1.544647216796875,
+ "mean_token_accuracy": 0.6345261335372925,
+ "num_tokens": 4456448.0,
+ "step": 272
+ },
+ {
+ "entropy": 1.6161645650863647,
+ "epoch": 0.5515151515151515,
+ "grad_norm": 1.981154203414917,
+ "learning_rate": 4.4505050505050505e-06,
+ "loss": 1.6109068393707275,
+ "mean_token_accuracy": 0.6318392753601074,
+ "num_tokens": 4472832.0,
+ "step": 273
+ },
+ {
+ "entropy": 1.2576326131820679,
+ "epoch": 0.5535353535353535,
+ "grad_norm": 1.95668625831604,
+ "learning_rate": 4.448484848484848e-06,
+ "loss": 1.2614656686782837,
+ "mean_token_accuracy": 0.7025524973869324,
+ "num_tokens": 4489216.0,
+ "step": 274
+ },
+ {
+ "entropy": 1.405206561088562,
+ "epoch": 0.5555555555555556,
+ "grad_norm": 2.0302884578704834,
+ "learning_rate": 4.446464646464646e-06,
+ "loss": 1.416546106338501,
+ "mean_token_accuracy": 0.6753786206245422,
+ "num_tokens": 4505600.0,
+ "step": 275
+ },
+ {
+ "entropy": 1.9038625955581665,
+ "epoch": 0.5575757575757576,
+ "grad_norm": 2.06475567817688,
+ "learning_rate": 4.444444444444444e-06,
+ "loss": 1.9273614883422852,
+ "mean_token_accuracy": 0.5813996195793152,
+ "num_tokens": 4521984.0,
+ "step": 276
+ },
+ {
+ "entropy": 1.7208465337753296,
+ "epoch": 0.5595959595959596,
+ "grad_norm": 2.0136189460754395,
+ "learning_rate": 4.442424242424243e-06,
+ "loss": 1.7260158061981201,
+ "mean_token_accuracy": 0.6006350517272949,
+ "num_tokens": 4538368.0,
+ "step": 277
+ },
+ {
+ "entropy": 1.7570570707321167,
+ "epoch": 0.5616161616161616,
+ "grad_norm": 2.148594379425049,
+ "learning_rate": 4.440404040404041e-06,
+ "loss": 1.7799286842346191,
+ "mean_token_accuracy": 0.5943453907966614,
+ "num_tokens": 4554752.0,
+ "step": 278
+ },
+ {
+ "entropy": 1.6388157606124878,
+ "epoch": 0.5636363636363636,
+ "grad_norm": 2.1301987171173096,
+ "learning_rate": 4.438383838383839e-06,
+ "loss": 1.63419508934021,
+ "mean_token_accuracy": 0.6405715942382812,
+ "num_tokens": 4571136.0,
+ "step": 279
+ },
+ {
+ "entropy": 1.5902295112609863,
+ "epoch": 0.5656565656565656,
+ "grad_norm": 2.0526790618896484,
+ "learning_rate": 4.436363636363637e-06,
+ "loss": 1.6278276443481445,
+ "mean_token_accuracy": 0.615229606628418,
+ "num_tokens": 4587520.0,
+ "step": 280
+ },
+ {
+ "entropy": 1.5494027137756348,
+ "epoch": 0.5676767676767677,
+ "grad_norm": 1.9863859415054321,
+ "learning_rate": 4.434343434343435e-06,
+ "loss": 1.5622975826263428,
+ "mean_token_accuracy": 0.6261602640151978,
+ "num_tokens": 4603904.0,
+ "step": 281
+ },
+ {
+ "entropy": 1.2140685319900513,
+ "epoch": 0.5696969696969697,
+ "grad_norm": 2.4206902980804443,
+ "learning_rate": 4.432323232323233e-06,
+ "loss": 1.2389612197875977,
+ "mean_token_accuracy": 0.6943697929382324,
+ "num_tokens": 4620288.0,
+ "step": 282
+ },
+ {
+ "entropy": 1.4347270727157593,
+ "epoch": 0.5717171717171717,
+ "grad_norm": 2.0198237895965576,
+ "learning_rate": 4.430303030303031e-06,
+ "loss": 1.4648659229278564,
+ "mean_token_accuracy": 0.6573033928871155,
+ "num_tokens": 4636672.0,
+ "step": 283
+ },
+ {
+ "entropy": 1.3239331245422363,
+ "epoch": 0.5737373737373738,
+ "grad_norm": 1.9862704277038574,
+ "learning_rate": 4.428282828282829e-06,
+ "loss": 1.3520365953445435,
+ "mean_token_accuracy": 0.6852100491523743,
+ "num_tokens": 4653056.0,
+ "step": 284
+ },
+ {
+ "entropy": 1.7534631490707397,
+ "epoch": 0.5757575757575758,
+ "grad_norm": 2.0964176654815674,
+ "learning_rate": 4.426262626262627e-06,
+ "loss": 1.7659757137298584,
+ "mean_token_accuracy": 0.5975207686424255,
+ "num_tokens": 4669440.0,
+ "step": 285
+ },
+ {
+ "entropy": 1.1573433876037598,
+ "epoch": 0.5777777777777777,
+ "grad_norm": 2.0671567916870117,
+ "learning_rate": 4.424242424242425e-06,
+ "loss": 1.1479461193084717,
+ "mean_token_accuracy": 0.7143380641937256,
+ "num_tokens": 4685824.0,
+ "step": 286
+ },
+ {
+ "entropy": 1.2439504861831665,
+ "epoch": 0.5797979797979798,
+ "grad_norm": 2.0317327976226807,
+ "learning_rate": 4.422222222222223e-06,
+ "loss": 1.255782961845398,
+ "mean_token_accuracy": 0.691255509853363,
+ "num_tokens": 4702208.0,
+ "step": 287
+ },
+ {
+ "entropy": 1.5569473505020142,
+ "epoch": 0.5818181818181818,
+ "grad_norm": 2.0759670734405518,
+ "learning_rate": 4.4202020202020205e-06,
+ "loss": 1.5564974546432495,
+ "mean_token_accuracy": 0.6284807324409485,
+ "num_tokens": 4718592.0,
+ "step": 288
+ },
+ {
+ "entropy": 1.478676199913025,
+ "epoch": 0.5838383838383838,
+ "grad_norm": 1.9528205394744873,
+ "learning_rate": 4.418181818181818e-06,
+ "loss": 1.491654396057129,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 4734976.0,
+ "step": 289
+ },
+ {
+ "entropy": 1.2454503774642944,
+ "epoch": 0.5858585858585859,
+ "grad_norm": 1.9008079767227173,
+ "learning_rate": 4.416161616161616e-06,
+ "loss": 1.253904938697815,
+ "mean_token_accuracy": 0.6971787810325623,
+ "num_tokens": 4751360.0,
+ "step": 290
+ },
+ {
+ "entropy": 1.1740810871124268,
+ "epoch": 0.5878787878787879,
+ "grad_norm": 1.8888787031173706,
+ "learning_rate": 4.414141414141415e-06,
+ "loss": 1.195070505142212,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 4767744.0,
+ "step": 291
+ },
+ {
+ "entropy": 1.6064486503601074,
+ "epoch": 0.5898989898989899,
+ "grad_norm": 2.073559284210205,
+ "learning_rate": 4.412121212121213e-06,
+ "loss": 1.6180689334869385,
+ "mean_token_accuracy": 0.6242061257362366,
+ "num_tokens": 4784128.0,
+ "step": 292
+ },
+ {
+ "entropy": 1.6119383573532104,
+ "epoch": 0.591919191919192,
+ "grad_norm": 1.8773425817489624,
+ "learning_rate": 4.410101010101011e-06,
+ "loss": 1.5875662565231323,
+ "mean_token_accuracy": 0.647838294506073,
+ "num_tokens": 4800512.0,
+ "step": 293
+ },
+ {
+ "entropy": 1.392905592918396,
+ "epoch": 0.593939393939394,
+ "grad_norm": 2.1699368953704834,
+ "learning_rate": 4.408080808080809e-06,
+ "loss": 1.3949127197265625,
+ "mean_token_accuracy": 0.6538837552070618,
+ "num_tokens": 4816896.0,
+ "step": 294
+ },
+ {
+ "entropy": 1.5057002305984497,
+ "epoch": 0.5959595959595959,
+ "grad_norm": 2.2730712890625,
+ "learning_rate": 4.4060606060606066e-06,
+ "loss": 1.4755051136016846,
+ "mean_token_accuracy": 0.6498534679412842,
+ "num_tokens": 4833280.0,
+ "step": 295
+ },
+ {
+ "entropy": 1.5468902587890625,
+ "epoch": 0.597979797979798,
+ "grad_norm": 1.9911075830459595,
+ "learning_rate": 4.4040404040404044e-06,
+ "loss": 1.539963722229004,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 4849664.0,
+ "step": 296
+ },
+ {
+ "entropy": 1.5196901559829712,
+ "epoch": 0.6,
+ "grad_norm": 1.9859540462493896,
+ "learning_rate": 4.402020202020202e-06,
+ "loss": 1.523442029953003,
+ "mean_token_accuracy": 0.6417317986488342,
+ "num_tokens": 4866048.0,
+ "step": 297
+ },
+ {
+ "entropy": 1.8251866102218628,
+ "epoch": 0.602020202020202,
+ "grad_norm": 2.2566516399383545,
+ "learning_rate": 4.4e-06,
+ "loss": 1.8667771816253662,
+ "mean_token_accuracy": 0.5872007608413696,
+ "num_tokens": 4882432.0,
+ "step": 298
+ },
+ {
+ "entropy": 1.6816744804382324,
+ "epoch": 0.604040404040404,
+ "grad_norm": 2.0107715129852295,
+ "learning_rate": 4.397979797979798e-06,
+ "loss": 1.6907548904418945,
+ "mean_token_accuracy": 0.6176722049713135,
+ "num_tokens": 4898816.0,
+ "step": 299
+ },
+ {
+ "entropy": 1.4992223978042603,
+ "epoch": 0.6060606060606061,
+ "grad_norm": 2.1236329078674316,
+ "learning_rate": 4.395959595959596e-06,
+ "loss": 1.5015790462493896,
+ "mean_token_accuracy": 0.6372129917144775,
+ "num_tokens": 4915200.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.6060606060606061,
+ "eval_entropy": 1.5544315297757425,
+ "eval_loss": 1.5676765441894531,
+ "eval_mean_token_accuracy": 0.6389380799185845,
+ "eval_num_tokens": 4915200.0,
+ "eval_runtime": 43.7857,
+ "eval_samples_per_second": 22.61,
+ "eval_steps_per_second": 2.832,
+ "step": 300
+ },
+ {
+ "entropy": 1.518556833267212,
+ "epoch": 0.6080808080808081,
+ "grad_norm": 2.88371205329895,
+ "learning_rate": 4.393939393939394e-06,
+ "loss": 1.5310916900634766,
+ "mean_token_accuracy": 0.6551660895347595,
+ "num_tokens": 4931584.0,
+ "step": 301
+ },
+ {
+ "entropy": 1.4650386571884155,
+ "epoch": 0.6101010101010101,
+ "grad_norm": 2.1849780082702637,
+ "learning_rate": 4.391919191919193e-06,
+ "loss": 1.4405598640441895,
+ "mean_token_accuracy": 0.6531509757041931,
+ "num_tokens": 4947968.0,
+ "step": 302
+ },
+ {
+ "entropy": 1.5209505558013916,
+ "epoch": 0.6121212121212121,
+ "grad_norm": 2.1135010719299316,
+ "learning_rate": 4.3898989898989905e-06,
+ "loss": 1.5324647426605225,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 4964352.0,
+ "step": 303
+ },
+ {
+ "entropy": 1.448391318321228,
+ "epoch": 0.6141414141414141,
+ "grad_norm": 1.9959306716918945,
+ "learning_rate": 4.387878787878788e-06,
+ "loss": 1.4721965789794922,
+ "mean_token_accuracy": 0.6578529477119446,
+ "num_tokens": 4980736.0,
+ "step": 304
+ },
+ {
+ "entropy": 1.4609358310699463,
+ "epoch": 0.6161616161616161,
+ "grad_norm": 2.1308915615081787,
+ "learning_rate": 4.385858585858586e-06,
+ "loss": 1.4707520008087158,
+ "mean_token_accuracy": 0.6482046842575073,
+ "num_tokens": 4997120.0,
+ "step": 305
+ },
+ {
+ "entropy": 1.7125155925750732,
+ "epoch": 0.6181818181818182,
+ "grad_norm": 2.2170841693878174,
+ "learning_rate": 4.383838383838384e-06,
+ "loss": 1.7630269527435303,
+ "mean_token_accuracy": 0.5999022722244263,
+ "num_tokens": 5013504.0,
+ "step": 306
+ },
+ {
+ "entropy": 1.6740268468856812,
+ "epoch": 0.6202020202020202,
+ "grad_norm": 1.983644723892212,
+ "learning_rate": 4.381818181818182e-06,
+ "loss": 1.6849563121795654,
+ "mean_token_accuracy": 0.6237176060676575,
+ "num_tokens": 5029888.0,
+ "step": 307
+ },
+ {
+ "entropy": 1.3754971027374268,
+ "epoch": 0.6222222222222222,
+ "grad_norm": 2.005277395248413,
+ "learning_rate": 4.37979797979798e-06,
+ "loss": 1.385213851928711,
+ "mean_token_accuracy": 0.6638984084129333,
+ "num_tokens": 5046272.0,
+ "step": 308
+ },
+ {
+ "entropy": 1.5476733446121216,
+ "epoch": 0.6242424242424243,
+ "grad_norm": 2.4317610263824463,
+ "learning_rate": 4.377777777777778e-06,
+ "loss": 1.5417041778564453,
+ "mean_token_accuracy": 0.6323888897895813,
+ "num_tokens": 5062656.0,
+ "step": 309
+ },
+ {
+ "entropy": 1.4437031745910645,
+ "epoch": 0.6262626262626263,
+ "grad_norm": 2.1464109420776367,
+ "learning_rate": 4.375757575757576e-06,
+ "loss": 1.4704627990722656,
+ "mean_token_accuracy": 0.6772105693817139,
+ "num_tokens": 5079040.0,
+ "step": 310
+ },
+ {
+ "entropy": 1.4859641790390015,
+ "epoch": 0.6282828282828283,
+ "grad_norm": 2.0800492763519287,
+ "learning_rate": 4.373737373737374e-06,
+ "loss": 1.5072834491729736,
+ "mean_token_accuracy": 0.658707857131958,
+ "num_tokens": 5095424.0,
+ "step": 311
+ },
+ {
+ "entropy": 1.8733419179916382,
+ "epoch": 0.6303030303030303,
+ "grad_norm": 2.120965003967285,
+ "learning_rate": 4.3717171717171715e-06,
+ "loss": 1.8567254543304443,
+ "mean_token_accuracy": 0.5847581624984741,
+ "num_tokens": 5111808.0,
+ "step": 312
+ },
+ {
+ "entropy": 1.4578243494033813,
+ "epoch": 0.6323232323232323,
+ "grad_norm": 1.9577823877334595,
+ "learning_rate": 4.36969696969697e-06,
+ "loss": 1.4758052825927734,
+ "mean_token_accuracy": 0.6590742468833923,
+ "num_tokens": 5128192.0,
+ "step": 313
+ },
+ {
+ "entropy": 1.8680084943771362,
+ "epoch": 0.6343434343434343,
+ "grad_norm": 2.170994520187378,
+ "learning_rate": 4.367676767676768e-06,
+ "loss": 1.904400110244751,
+ "mean_token_accuracy": 0.5857962965965271,
+ "num_tokens": 5144576.0,
+ "step": 314
+ },
+ {
+ "entropy": 1.6488304138183594,
+ "epoch": 0.6363636363636364,
+ "grad_norm": 1.959490418434143,
+ "learning_rate": 4.365656565656566e-06,
+ "loss": 1.6570477485656738,
+ "mean_token_accuracy": 0.6257327795028687,
+ "num_tokens": 5160960.0,
+ "step": 315
+ },
+ {
+ "entropy": 1.5038025379180908,
+ "epoch": 0.6383838383838384,
+ "grad_norm": 2.072697401046753,
+ "learning_rate": 4.363636363636364e-06,
+ "loss": 1.5234860181808472,
+ "mean_token_accuracy": 0.6494259834289551,
+ "num_tokens": 5177344.0,
+ "step": 316
+ },
+ {
+ "entropy": 1.4154654741287231,
+ "epoch": 0.6404040404040404,
+ "grad_norm": 1.894587755203247,
+ "learning_rate": 4.361616161616162e-06,
+ "loss": 1.4131592512130737,
+ "mean_token_accuracy": 0.6667073965072632,
+ "num_tokens": 5193728.0,
+ "step": 317
+ },
+ {
+ "entropy": 1.5813250541687012,
+ "epoch": 0.6424242424242425,
+ "grad_norm": 2.4088737964630127,
+ "learning_rate": 4.35959595959596e-06,
+ "loss": 1.6236622333526611,
+ "mean_token_accuracy": 0.6313507556915283,
+ "num_tokens": 5210112.0,
+ "step": 318
+ },
+ {
+ "entropy": 1.4140045642852783,
+ "epoch": 0.6444444444444445,
+ "grad_norm": 1.991557240486145,
+ "learning_rate": 4.3575757575757576e-06,
+ "loss": 1.4242517948150635,
+ "mean_token_accuracy": 0.6569980382919312,
+ "num_tokens": 5226496.0,
+ "step": 319
+ },
+ {
+ "entropy": 1.615628957748413,
+ "epoch": 0.6464646464646465,
+ "grad_norm": 1.8819077014923096,
+ "learning_rate": 4.3555555555555555e-06,
+ "loss": 1.6331532001495361,
+ "mean_token_accuracy": 0.6299462914466858,
+ "num_tokens": 5242880.0,
+ "step": 320
+ },
+ {
+ "entropy": 1.3118394613265991,
+ "epoch": 0.6484848484848484,
+ "grad_norm": 2.0589284896850586,
+ "learning_rate": 4.353535353535353e-06,
+ "loss": 1.2880034446716309,
+ "mean_token_accuracy": 0.6842941045761108,
+ "num_tokens": 5259264.0,
+ "step": 321
+ },
+ {
+ "entropy": 1.2786612510681152,
+ "epoch": 0.6505050505050505,
+ "grad_norm": 2.033839225769043,
+ "learning_rate": 4.351515151515152e-06,
+ "loss": 1.2829055786132812,
+ "mean_token_accuracy": 0.6910112500190735,
+ "num_tokens": 5275648.0,
+ "step": 322
+ },
+ {
+ "entropy": 1.5632988214492798,
+ "epoch": 0.6525252525252525,
+ "grad_norm": 2.1970419883728027,
+ "learning_rate": 4.34949494949495e-06,
+ "loss": 1.5865097045898438,
+ "mean_token_accuracy": 0.642892062664032,
+ "num_tokens": 5292032.0,
+ "step": 323
+ },
+ {
+ "entropy": 1.1542725563049316,
+ "epoch": 0.6545454545454545,
+ "grad_norm": 1.9750654697418213,
+ "learning_rate": 4.347474747474748e-06,
+ "loss": 1.1401035785675049,
+ "mean_token_accuracy": 0.7061553597450256,
+ "num_tokens": 5308416.0,
+ "step": 324
+ },
+ {
+ "entropy": 1.6879942417144775,
+ "epoch": 0.6565656565656566,
+ "grad_norm": 2.0022354125976562,
+ "learning_rate": 4.345454545454546e-06,
+ "loss": 1.70950448513031,
+ "mean_token_accuracy": 0.6089398860931396,
+ "num_tokens": 5324800.0,
+ "step": 325
+ },
+ {
+ "entropy": 1.7589699029922485,
+ "epoch": 0.6585858585858586,
+ "grad_norm": 1.925520420074463,
+ "learning_rate": 4.343434343434344e-06,
+ "loss": 1.7749860286712646,
+ "mean_token_accuracy": 0.6015510559082031,
+ "num_tokens": 5341184.0,
+ "step": 326
+ },
+ {
+ "entropy": 1.4720325469970703,
+ "epoch": 0.6606060606060606,
+ "grad_norm": 1.9487124681472778,
+ "learning_rate": 4.341414141414142e-06,
+ "loss": 1.4983797073364258,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 5357568.0,
+ "step": 327
+ },
+ {
+ "entropy": 1.676164150238037,
+ "epoch": 0.6626262626262627,
+ "grad_norm": 2.13053035736084,
+ "learning_rate": 4.33939393939394e-06,
+ "loss": 1.699425458908081,
+ "mean_token_accuracy": 0.6100390553474426,
+ "num_tokens": 5373952.0,
+ "step": 328
+ },
+ {
+ "entropy": 1.3424437046051025,
+ "epoch": 0.6646464646464646,
+ "grad_norm": 2.0245954990386963,
+ "learning_rate": 4.337373737373738e-06,
+ "loss": 1.3393046855926514,
+ "mean_token_accuracy": 0.677760124206543,
+ "num_tokens": 5390336.0,
+ "step": 329
+ },
+ {
+ "entropy": 1.4926583766937256,
+ "epoch": 0.6666666666666666,
+ "grad_norm": 1.893343448638916,
+ "learning_rate": 4.335353535353536e-06,
+ "loss": 1.4779269695281982,
+ "mean_token_accuracy": 0.6713483333587646,
+ "num_tokens": 5406720.0,
+ "step": 330
+ },
+ {
+ "entropy": 1.5753449201583862,
+ "epoch": 0.6686868686868687,
+ "grad_norm": 2.051647424697876,
+ "learning_rate": 4.333333333333334e-06,
+ "loss": 1.622597336769104,
+ "mean_token_accuracy": 0.6436248421669006,
+ "num_tokens": 5423104.0,
+ "step": 331
+ },
+ {
+ "entropy": 1.4573988914489746,
+ "epoch": 0.6707070707070707,
+ "grad_norm": 1.8709567785263062,
+ "learning_rate": 4.331313131313132e-06,
+ "loss": 1.4902422428131104,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 5439488.0,
+ "step": 332
+ },
+ {
+ "entropy": 1.378867745399475,
+ "epoch": 0.6727272727272727,
+ "grad_norm": 2.235928773880005,
+ "learning_rate": 4.32929292929293e-06,
+ "loss": 1.4067103862762451,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 5455872.0,
+ "step": 333
+ },
+ {
+ "entropy": 1.7553350925445557,
+ "epoch": 0.6747474747474748,
+ "grad_norm": 2.0335066318511963,
+ "learning_rate": 4.327272727272728e-06,
+ "loss": 1.772943139076233,
+ "mean_token_accuracy": 0.5953834652900696,
+ "num_tokens": 5472256.0,
+ "step": 334
+ },
+ {
+ "entropy": 1.1587097644805908,
+ "epoch": 0.6767676767676768,
+ "grad_norm": 1.8764615058898926,
+ "learning_rate": 4.3252525252525255e-06,
+ "loss": 1.1396210193634033,
+ "mean_token_accuracy": 0.7197117805480957,
+ "num_tokens": 5488640.0,
+ "step": 335
+ },
+ {
+ "entropy": 1.4819872379302979,
+ "epoch": 0.6787878787878788,
+ "grad_norm": 2.0907511711120605,
+ "learning_rate": 4.323232323232323e-06,
+ "loss": 1.460550308227539,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 5505024.0,
+ "step": 336
+ },
+ {
+ "entropy": 1.0744472742080688,
+ "epoch": 0.6808080808080809,
+ "grad_norm": 2.227606773376465,
+ "learning_rate": 4.321212121212121e-06,
+ "loss": 1.0909301042556763,
+ "mean_token_accuracy": 0.7258182764053345,
+ "num_tokens": 5521408.0,
+ "step": 337
+ },
+ {
+ "entropy": 1.507999300956726,
+ "epoch": 0.6828282828282828,
+ "grad_norm": 2.0332415103912354,
+ "learning_rate": 4.31919191919192e-06,
+ "loss": 1.5173046588897705,
+ "mean_token_accuracy": 0.6374572515487671,
+ "num_tokens": 5537792.0,
+ "step": 338
+ },
+ {
+ "entropy": 1.6792720556259155,
+ "epoch": 0.6848484848484848,
+ "grad_norm": 2.0194997787475586,
+ "learning_rate": 4.317171717171718e-06,
+ "loss": 1.679445743560791,
+ "mean_token_accuracy": 0.6138250827789307,
+ "num_tokens": 5554176.0,
+ "step": 339
+ },
+ {
+ "entropy": 1.6470589637756348,
+ "epoch": 0.6868686868686869,
+ "grad_norm": 2.09116268157959,
+ "learning_rate": 4.315151515151516e-06,
+ "loss": 1.6386632919311523,
+ "mean_token_accuracy": 0.6146799921989441,
+ "num_tokens": 5570560.0,
+ "step": 340
+ },
+ {
+ "entropy": 1.3612488508224487,
+ "epoch": 0.6888888888888889,
+ "grad_norm": 2.1586217880249023,
+ "learning_rate": 4.313131313131314e-06,
+ "loss": 1.3698725700378418,
+ "mean_token_accuracy": 0.6696995496749878,
+ "num_tokens": 5586944.0,
+ "step": 341
+ },
+ {
+ "entropy": 1.400327205657959,
+ "epoch": 0.6909090909090909,
+ "grad_norm": 2.082094192504883,
+ "learning_rate": 4.3111111111111115e-06,
+ "loss": 1.396535873413086,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 5603328.0,
+ "step": 342
+ },
+ {
+ "entropy": 1.389290690422058,
+ "epoch": 0.692929292929293,
+ "grad_norm": 2.0780303478240967,
+ "learning_rate": 4.309090909090909e-06,
+ "loss": 1.4275782108306885,
+ "mean_token_accuracy": 0.6656082272529602,
+ "num_tokens": 5619712.0,
+ "step": 343
+ },
+ {
+ "entropy": 1.5133870840072632,
+ "epoch": 0.694949494949495,
+ "grad_norm": 1.9819531440734863,
+ "learning_rate": 4.307070707070707e-06,
+ "loss": 1.5309596061706543,
+ "mean_token_accuracy": 0.6373351216316223,
+ "num_tokens": 5636096.0,
+ "step": 344
+ },
+ {
+ "entropy": 1.483219861984253,
+ "epoch": 0.696969696969697,
+ "grad_norm": 1.9794325828552246,
+ "learning_rate": 4.305050505050505e-06,
+ "loss": 1.4693087339401245,
+ "mean_token_accuracy": 0.6550439596176147,
+ "num_tokens": 5652480.0,
+ "step": 345
+ },
+ {
+ "entropy": 1.381489634513855,
+ "epoch": 0.6989898989898989,
+ "grad_norm": 2.0637686252593994,
+ "learning_rate": 4.303030303030303e-06,
+ "loss": 1.3862476348876953,
+ "mean_token_accuracy": 0.6631045341491699,
+ "num_tokens": 5668864.0,
+ "step": 346
+ },
+ {
+ "entropy": 1.9860024452209473,
+ "epoch": 0.701010101010101,
+ "grad_norm": 2.1626803874969482,
+ "learning_rate": 4.301010101010101e-06,
+ "loss": 1.9815950393676758,
+ "mean_token_accuracy": 0.5698583126068115,
+ "num_tokens": 5685248.0,
+ "step": 347
+ },
+ {
+ "entropy": 1.5044004917144775,
+ "epoch": 0.703030303030303,
+ "grad_norm": 2.060976266860962,
+ "learning_rate": 4.298989898989899e-06,
+ "loss": 1.4937127828598022,
+ "mean_token_accuracy": 0.6524792313575745,
+ "num_tokens": 5701632.0,
+ "step": 348
+ },
+ {
+ "entropy": 1.3397772312164307,
+ "epoch": 0.705050505050505,
+ "grad_norm": 2.0162901878356934,
+ "learning_rate": 4.296969696969698e-06,
+ "loss": 1.3358572721481323,
+ "mean_token_accuracy": 0.6949804425239563,
+ "num_tokens": 5718016.0,
+ "step": 349
+ },
+ {
+ "entropy": 1.145772099494934,
+ "epoch": 0.7070707070707071,
+ "grad_norm": 2.097634792327881,
+ "learning_rate": 4.2949494949494955e-06,
+ "loss": 1.1833416223526,
+ "mean_token_accuracy": 0.7104909420013428,
+ "num_tokens": 5734400.0,
+ "step": 350
+ },
+ {
+ "epoch": 0.7070707070707071,
+ "eval_entropy": 1.5476290602837839,
+ "eval_loss": 1.5603480339050293,
+ "eval_mean_token_accuracy": 0.640111118555069,
+ "eval_num_tokens": 5734400.0,
+ "eval_runtime": 43.7844,
+ "eval_samples_per_second": 22.611,
+ "eval_steps_per_second": 2.832,
+ "step": 350
+ },
+ {
+ "entropy": 1.4311926364898682,
+ "epoch": 0.7090909090909091,
+ "grad_norm": 2.002321720123291,
+ "learning_rate": 4.292929292929293e-06,
+ "loss": 1.4534825086593628,
+ "mean_token_accuracy": 0.6614558100700378,
+ "num_tokens": 5750784.0,
+ "step": 351
+ },
+ {
+ "entropy": 1.3983922004699707,
+ "epoch": 0.7111111111111111,
+ "grad_norm": 2.1724867820739746,
+ "learning_rate": 4.290909090909091e-06,
+ "loss": 1.3969402313232422,
+ "mean_token_accuracy": 0.6652418375015259,
+ "num_tokens": 5767168.0,
+ "step": 352
+ },
+ {
+ "entropy": 1.8218920230865479,
+ "epoch": 0.7131313131313132,
+ "grad_norm": 2.1629281044006348,
+ "learning_rate": 4.288888888888889e-06,
+ "loss": 1.8196980953216553,
+ "mean_token_accuracy": 0.6027112603187561,
+ "num_tokens": 5783552.0,
+ "step": 353
+ },
+ {
+ "entropy": 1.5322320461273193,
+ "epoch": 0.7151515151515152,
+ "grad_norm": 1.8486647605895996,
+ "learning_rate": 4.286868686868687e-06,
+ "loss": 1.5504610538482666,
+ "mean_token_accuracy": 0.6533341407775879,
+ "num_tokens": 5799936.0,
+ "step": 354
+ },
+ {
+ "entropy": 1.935966968536377,
+ "epoch": 0.7171717171717171,
+ "grad_norm": 2.252814292907715,
+ "learning_rate": 4.284848484848485e-06,
+ "loss": 1.9300384521484375,
+ "mean_token_accuracy": 0.5656448602676392,
+ "num_tokens": 5816320.0,
+ "step": 355
+ },
+ {
+ "entropy": 1.6711398363113403,
+ "epoch": 0.7191919191919192,
+ "grad_norm": 2.023379325866699,
+ "learning_rate": 4.282828282828283e-06,
+ "loss": 1.6584455966949463,
+ "mean_token_accuracy": 0.6235954761505127,
+ "num_tokens": 5832704.0,
+ "step": 356
+ },
+ {
+ "entropy": 1.3922803401947021,
+ "epoch": 0.7212121212121212,
+ "grad_norm": 2.0487611293792725,
+ "learning_rate": 4.280808080808081e-06,
+ "loss": 1.4220250844955444,
+ "mean_token_accuracy": 0.6591963768005371,
+ "num_tokens": 5849088.0,
+ "step": 357
+ },
+ {
+ "entropy": 1.59521484375,
+ "epoch": 0.7232323232323232,
+ "grad_norm": 1.8598614931106567,
+ "learning_rate": 4.278787878787879e-06,
+ "loss": 1.5979329347610474,
+ "mean_token_accuracy": 0.6237176060676575,
+ "num_tokens": 5865472.0,
+ "step": 358
+ },
+ {
+ "entropy": 1.5810115337371826,
+ "epoch": 0.7252525252525253,
+ "grad_norm": 2.140115737915039,
+ "learning_rate": 4.276767676767677e-06,
+ "loss": 1.5774705410003662,
+ "mean_token_accuracy": 0.6274425983428955,
+ "num_tokens": 5881856.0,
+ "step": 359
+ },
+ {
+ "entropy": 1.5839109420776367,
+ "epoch": 0.7272727272727273,
+ "grad_norm": 2.0947749614715576,
+ "learning_rate": 4.274747474747475e-06,
+ "loss": 1.601511001586914,
+ "mean_token_accuracy": 0.630984365940094,
+ "num_tokens": 5898240.0,
+ "step": 360
+ },
+ {
+ "entropy": 1.195770263671875,
+ "epoch": 0.7292929292929293,
+ "grad_norm": 1.8740363121032715,
+ "learning_rate": 4.272727272727273e-06,
+ "loss": 1.195652961730957,
+ "mean_token_accuracy": 0.7077430486679077,
+ "num_tokens": 5914624.0,
+ "step": 361
+ },
+ {
+ "entropy": 1.375698208808899,
+ "epoch": 0.7313131313131314,
+ "grad_norm": 1.9580703973770142,
+ "learning_rate": 4.270707070707071e-06,
+ "loss": 1.3746864795684814,
+ "mean_token_accuracy": 0.6775158643722534,
+ "num_tokens": 5931008.0,
+ "step": 362
+ },
+ {
+ "entropy": 1.7259451150894165,
+ "epoch": 0.7333333333333333,
+ "grad_norm": 2.3127365112304688,
+ "learning_rate": 4.268686868686869e-06,
+ "loss": 1.745998501777649,
+ "mean_token_accuracy": 0.6040546894073486,
+ "num_tokens": 5947392.0,
+ "step": 363
+ },
+ {
+ "entropy": 1.209228754043579,
+ "epoch": 0.7353535353535353,
+ "grad_norm": 1.9004793167114258,
+ "learning_rate": 4.266666666666668e-06,
+ "loss": 1.232427716255188,
+ "mean_token_accuracy": 0.6925989389419556,
+ "num_tokens": 5963776.0,
+ "step": 364
+ },
+ {
+ "entropy": 1.2811263799667358,
+ "epoch": 0.7373737373737373,
+ "grad_norm": 1.9568246603012085,
+ "learning_rate": 4.2646464646464655e-06,
+ "loss": 1.291853427886963,
+ "mean_token_accuracy": 0.6884465217590332,
+ "num_tokens": 5980160.0,
+ "step": 365
+ },
+ {
+ "entropy": 1.843044638633728,
+ "epoch": 0.7393939393939394,
+ "grad_norm": 2.132735252380371,
+ "learning_rate": 4.262626262626263e-06,
+ "loss": 1.8818857669830322,
+ "mean_token_accuracy": 0.5785295367240906,
+ "num_tokens": 5996544.0,
+ "step": 366
+ },
+ {
+ "entropy": 1.3353440761566162,
+ "epoch": 0.7414141414141414,
+ "grad_norm": 1.8893013000488281,
+ "learning_rate": 4.260606060606061e-06,
+ "loss": 1.354011058807373,
+ "mean_token_accuracy": 0.6797752976417542,
+ "num_tokens": 6012928.0,
+ "step": 367
+ },
+ {
+ "entropy": 1.3889728784561157,
+ "epoch": 0.7434343434343434,
+ "grad_norm": 1.980757236480713,
+ "learning_rate": 4.258585858585859e-06,
+ "loss": 1.3671875,
+ "mean_token_accuracy": 0.6627381443977356,
+ "num_tokens": 6029312.0,
+ "step": 368
+ },
+ {
+ "entropy": 1.4605348110198975,
+ "epoch": 0.7454545454545455,
+ "grad_norm": 2.1033780574798584,
+ "learning_rate": 4.256565656565657e-06,
+ "loss": 1.455024003982544,
+ "mean_token_accuracy": 0.6451514363288879,
+ "num_tokens": 6045696.0,
+ "step": 369
+ },
+ {
+ "entropy": 1.4382058382034302,
+ "epoch": 0.7474747474747475,
+ "grad_norm": 2.1068074703216553,
+ "learning_rate": 4.254545454545455e-06,
+ "loss": 1.4422768354415894,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 6062080.0,
+ "step": 370
+ },
+ {
+ "entropy": 1.8046759366989136,
+ "epoch": 0.7494949494949495,
+ "grad_norm": 2.214466094970703,
+ "learning_rate": 4.252525252525253e-06,
+ "loss": 1.8247106075286865,
+ "mean_token_accuracy": 0.6003297567367554,
+ "num_tokens": 6078464.0,
+ "step": 371
+ },
+ {
+ "entropy": 1.671690583229065,
+ "epoch": 0.7515151515151515,
+ "grad_norm": 1.9790785312652588,
+ "learning_rate": 4.250505050505051e-06,
+ "loss": 1.6907753944396973,
+ "mean_token_accuracy": 0.6232290863990784,
+ "num_tokens": 6094848.0,
+ "step": 372
+ },
+ {
+ "entropy": 1.6881897449493408,
+ "epoch": 0.7535353535353535,
+ "grad_norm": 1.8638463020324707,
+ "learning_rate": 4.248484848484849e-06,
+ "loss": 1.7132716178894043,
+ "mean_token_accuracy": 0.6357474327087402,
+ "num_tokens": 6111232.0,
+ "step": 373
+ },
+ {
+ "entropy": 1.2555122375488281,
+ "epoch": 0.7555555555555555,
+ "grad_norm": 2.082378387451172,
+ "learning_rate": 4.246464646464647e-06,
+ "loss": 1.240688681602478,
+ "mean_token_accuracy": 0.6965070962905884,
+ "num_tokens": 6127616.0,
+ "step": 374
+ },
+ {
+ "entropy": 1.847135305404663,
+ "epoch": 0.7575757575757576,
+ "grad_norm": 2.142962694168091,
+ "learning_rate": 4.244444444444445e-06,
+ "loss": 1.8840911388397217,
+ "mean_token_accuracy": 0.5822545289993286,
+ "num_tokens": 6144000.0,
+ "step": 375
+ },
+ {
+ "entropy": 1.239328384399414,
+ "epoch": 0.7595959595959596,
+ "grad_norm": 2.0589468479156494,
+ "learning_rate": 4.242424242424243e-06,
+ "loss": 1.256324052810669,
+ "mean_token_accuracy": 0.6845383644104004,
+ "num_tokens": 6160384.0,
+ "step": 376
+ },
+ {
+ "entropy": 1.5047202110290527,
+ "epoch": 0.7616161616161616,
+ "grad_norm": 1.7951308488845825,
+ "learning_rate": 4.240404040404041e-06,
+ "loss": 1.5063304901123047,
+ "mean_token_accuracy": 0.6583414673805237,
+ "num_tokens": 6176768.0,
+ "step": 377
+ },
+ {
+ "entropy": 1.4072566032409668,
+ "epoch": 0.7636363636363637,
+ "grad_norm": 2.1670594215393066,
+ "learning_rate": 4.238383838383839e-06,
+ "loss": 1.4205389022827148,
+ "mean_token_accuracy": 0.658707857131958,
+ "num_tokens": 6193152.0,
+ "step": 378
+ },
+ {
+ "entropy": 1.3207885026931763,
+ "epoch": 0.7656565656565657,
+ "grad_norm": 1.9017083644866943,
+ "learning_rate": 4.236363636363637e-06,
+ "loss": 1.3169896602630615,
+ "mean_token_accuracy": 0.6954079270362854,
+ "num_tokens": 6209536.0,
+ "step": 379
+ },
+ {
+ "entropy": 1.4762436151504517,
+ "epoch": 0.7676767676767676,
+ "grad_norm": 2.0023069381713867,
+ "learning_rate": 4.234343434343435e-06,
+ "loss": 1.4725041389465332,
+ "mean_token_accuracy": 0.6620053648948669,
+ "num_tokens": 6225920.0,
+ "step": 380
+ },
+ {
+ "entropy": 1.4895304441452026,
+ "epoch": 0.7696969696969697,
+ "grad_norm": 1.9528017044067383,
+ "learning_rate": 4.2323232323232325e-06,
+ "loss": 1.49650239944458,
+ "mean_token_accuracy": 0.6508915424346924,
+ "num_tokens": 6242304.0,
+ "step": 381
+ },
+ {
+ "entropy": 1.3024516105651855,
+ "epoch": 0.7717171717171717,
+ "grad_norm": 1.9855588674545288,
+ "learning_rate": 4.2303030303030304e-06,
+ "loss": 1.34218168258667,
+ "mean_token_accuracy": 0.6838055849075317,
+ "num_tokens": 6258688.0,
+ "step": 382
+ },
+ {
+ "entropy": 1.6005626916885376,
+ "epoch": 0.7737373737373737,
+ "grad_norm": 2.028286933898926,
+ "learning_rate": 4.228282828282828e-06,
+ "loss": 1.6299283504486084,
+ "mean_token_accuracy": 0.6315950155258179,
+ "num_tokens": 6275072.0,
+ "step": 383
+ },
+ {
+ "entropy": 1.7050484418869019,
+ "epoch": 0.7757575757575758,
+ "grad_norm": 2.474047899246216,
+ "learning_rate": 4.226262626262626e-06,
+ "loss": 1.777151346206665,
+ "mean_token_accuracy": 0.5919027924537659,
+ "num_tokens": 6291456.0,
+ "step": 384
+ },
+ {
+ "entropy": 1.5014543533325195,
+ "epoch": 0.7777777777777778,
+ "grad_norm": 1.9866594076156616,
+ "learning_rate": 4.224242424242425e-06,
+ "loss": 1.5308949947357178,
+ "mean_token_accuracy": 0.639106035232544,
+ "num_tokens": 6307840.0,
+ "step": 385
+ },
+ {
+ "entropy": 1.6957359313964844,
+ "epoch": 0.7797979797979798,
+ "grad_norm": 2.229820966720581,
+ "learning_rate": 4.222222222222223e-06,
+ "loss": 1.728761911392212,
+ "mean_token_accuracy": 0.6242061257362366,
+ "num_tokens": 6324224.0,
+ "step": 386
+ },
+ {
+ "entropy": 1.6823521852493286,
+ "epoch": 0.7818181818181819,
+ "grad_norm": 2.033383369445801,
+ "learning_rate": 4.220202020202021e-06,
+ "loss": 1.7310154438018799,
+ "mean_token_accuracy": 0.6257938742637634,
+ "num_tokens": 6340608.0,
+ "step": 387
+ },
+ {
+ "entropy": 1.710307240486145,
+ "epoch": 0.7838383838383839,
+ "grad_norm": 2.061861038208008,
+ "learning_rate": 4.218181818181819e-06,
+ "loss": 1.7066943645477295,
+ "mean_token_accuracy": 0.6123595237731934,
+ "num_tokens": 6356992.0,
+ "step": 388
+ },
+ {
+ "entropy": 1.241638422012329,
+ "epoch": 0.7858585858585858,
+ "grad_norm": 1.9743852615356445,
+ "learning_rate": 4.2161616161616165e-06,
+ "loss": 1.2520272731781006,
+ "mean_token_accuracy": 0.692415714263916,
+ "num_tokens": 6373376.0,
+ "step": 389
+ },
+ {
+ "entropy": 1.5918776988983154,
+ "epoch": 0.7878787878787878,
+ "grad_norm": 2.156675100326538,
+ "learning_rate": 4.214141414141414e-06,
+ "loss": 1.6060255765914917,
+ "mean_token_accuracy": 0.6178553700447083,
+ "num_tokens": 6389760.0,
+ "step": 390
+ },
+ {
+ "entropy": 1.7307862043380737,
+ "epoch": 0.7898989898989899,
+ "grad_norm": 2.171247959136963,
+ "learning_rate": 4.212121212121212e-06,
+ "loss": 1.7327581644058228,
+ "mean_token_accuracy": 0.6502808928489685,
+ "num_tokens": 6406144.0,
+ "step": 391
+ },
+ {
+ "entropy": 1.6725553274154663,
+ "epoch": 0.7919191919191919,
+ "grad_norm": 2.020228624343872,
+ "learning_rate": 4.21010101010101e-06,
+ "loss": 1.6803646087646484,
+ "mean_token_accuracy": 0.6383732557296753,
+ "num_tokens": 6422528.0,
+ "step": 392
+ },
+ {
+ "entropy": 1.4120928049087524,
+ "epoch": 0.793939393939394,
+ "grad_norm": 1.9896639585494995,
+ "learning_rate": 4.208080808080808e-06,
+ "loss": 1.3974279165267944,
+ "mean_token_accuracy": 0.6661577820777893,
+ "num_tokens": 6438912.0,
+ "step": 393
+ },
+ {
+ "entropy": 0.933545708656311,
+ "epoch": 0.795959595959596,
+ "grad_norm": 1.6884223222732544,
+ "learning_rate": 4.206060606060606e-06,
+ "loss": 0.9287986755371094,
+ "mean_token_accuracy": 0.7636175155639648,
+ "num_tokens": 6455296.0,
+ "step": 394
+ },
+ {
+ "entropy": 1.419004201889038,
+ "epoch": 0.797979797979798,
+ "grad_norm": 2.2590551376342773,
+ "learning_rate": 4.204040404040405e-06,
+ "loss": 1.4652538299560547,
+ "mean_token_accuracy": 0.6589521169662476,
+ "num_tokens": 6471680.0,
+ "step": 395
+ },
+ {
+ "entropy": 1.750221610069275,
+ "epoch": 0.8,
+ "grad_norm": 2.195030450820923,
+ "learning_rate": 4.2020202020202026e-06,
+ "loss": 1.7328863143920898,
+ "mean_token_accuracy": 0.6008182764053345,
+ "num_tokens": 6488064.0,
+ "step": 396
+ },
+ {
+ "entropy": 1.7440015077590942,
+ "epoch": 0.802020202020202,
+ "grad_norm": 1.9833927154541016,
+ "learning_rate": 4.2000000000000004e-06,
+ "loss": 1.7617835998535156,
+ "mean_token_accuracy": 0.5992916226387024,
+ "num_tokens": 6504448.0,
+ "step": 397
+ },
+ {
+ "entropy": 1.1636452674865723,
+ "epoch": 0.804040404040404,
+ "grad_norm": 1.9506802558898926,
+ "learning_rate": 4.197979797979798e-06,
+ "loss": 1.1344032287597656,
+ "mean_token_accuracy": 0.7122618556022644,
+ "num_tokens": 6520832.0,
+ "step": 398
+ },
+ {
+ "entropy": 1.6173542737960815,
+ "epoch": 0.806060606060606,
+ "grad_norm": 2.0997231006622314,
+ "learning_rate": 4.195959595959596e-06,
+ "loss": 1.6303956508636475,
+ "mean_token_accuracy": 0.6215192675590515,
+ "num_tokens": 6537216.0,
+ "step": 399
+ },
+ {
+ "entropy": 1.4391542673110962,
+ "epoch": 0.8080808080808081,
+ "grad_norm": 2.356828212738037,
+ "learning_rate": 4.193939393939394e-06,
+ "loss": 1.4465923309326172,
+ "mean_token_accuracy": 0.6594406366348267,
+ "num_tokens": 6553600.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.8080808080808081,
+ "eval_entropy": 1.5504949785047961,
+ "eval_loss": 1.5544542074203491,
+ "eval_mean_token_accuracy": 0.6409837569921247,
+ "eval_num_tokens": 6553600.0,
+ "eval_runtime": 43.7986,
+ "eval_samples_per_second": 22.603,
+ "eval_steps_per_second": 2.831,
+ "step": 400
+ },
+ {
+ "entropy": 1.60548996925354,
+ "epoch": 0.8101010101010101,
+ "grad_norm": 2.1894404888153076,
+ "learning_rate": 4.191919191919192e-06,
+ "loss": 1.6116085052490234,
+ "mean_token_accuracy": 0.6276868581771851,
+ "num_tokens": 6569984.0,
+ "step": 401
+ },
+ {
+ "entropy": 1.436041235923767,
+ "epoch": 0.8121212121212121,
+ "grad_norm": 2.1180264949798584,
+ "learning_rate": 4.18989898989899e-06,
+ "loss": 1.4203698635101318,
+ "mean_token_accuracy": 0.6554714441299438,
+ "num_tokens": 6586368.0,
+ "step": 402
+ },
+ {
+ "entropy": 1.1348106861114502,
+ "epoch": 0.8141414141414142,
+ "grad_norm": 2.0420851707458496,
+ "learning_rate": 4.187878787878788e-06,
+ "loss": 1.1424527168273926,
+ "mean_token_accuracy": 0.7154372334480286,
+ "num_tokens": 6602752.0,
+ "step": 403
+ },
+ {
+ "entropy": 1.4039727449417114,
+ "epoch": 0.8161616161616162,
+ "grad_norm": 2.148340940475464,
+ "learning_rate": 4.185858585858586e-06,
+ "loss": 1.4246132373809814,
+ "mean_token_accuracy": 0.6723864078521729,
+ "num_tokens": 6619136.0,
+ "step": 404
+ },
+ {
+ "entropy": 1.4222626686096191,
+ "epoch": 0.8181818181818182,
+ "grad_norm": 1.9436827898025513,
+ "learning_rate": 4.1838383838383835e-06,
+ "loss": 1.4235990047454834,
+ "mean_token_accuracy": 0.6759281754493713,
+ "num_tokens": 6635520.0,
+ "step": 405
+ },
+ {
+ "entropy": 1.4771310091018677,
+ "epoch": 0.8202020202020202,
+ "grad_norm": 2.0953726768493652,
+ "learning_rate": 4.181818181818182e-06,
+ "loss": 1.501934289932251,
+ "mean_token_accuracy": 0.6535173654556274,
+ "num_tokens": 6651904.0,
+ "step": 406
+ },
+ {
+ "entropy": 1.526256799697876,
+ "epoch": 0.8222222222222222,
+ "grad_norm": 2.245994806289673,
+ "learning_rate": 4.17979797979798e-06,
+ "loss": 1.539383888244629,
+ "mean_token_accuracy": 0.6417317986488342,
+ "num_tokens": 6668288.0,
+ "step": 407
+ },
+ {
+ "entropy": 1.1716097593307495,
+ "epoch": 0.8242424242424242,
+ "grad_norm": 1.8283652067184448,
+ "learning_rate": 4.177777777777778e-06,
+ "loss": 1.1798359155654907,
+ "mean_token_accuracy": 0.7123839855194092,
+ "num_tokens": 6684672.0,
+ "step": 408
+ },
+ {
+ "entropy": 1.4581540822982788,
+ "epoch": 0.8262626262626263,
+ "grad_norm": 1.9325168132781982,
+ "learning_rate": 4.175757575757576e-06,
+ "loss": 1.4526585340499878,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 6701056.0,
+ "step": 409
+ },
+ {
+ "entropy": 1.4073102474212646,
+ "epoch": 0.8282828282828283,
+ "grad_norm": 2.1543467044830322,
+ "learning_rate": 4.173737373737375e-06,
+ "loss": 1.437713861465454,
+ "mean_token_accuracy": 0.6725696325302124,
+ "num_tokens": 6717440.0,
+ "step": 410
+ },
+ {
+ "entropy": 1.5970062017440796,
+ "epoch": 0.8303030303030303,
+ "grad_norm": 2.1714792251586914,
+ "learning_rate": 4.1717171717171726e-06,
+ "loss": 1.613295078277588,
+ "mean_token_accuracy": 0.6229848265647888,
+ "num_tokens": 6733824.0,
+ "step": 411
+ },
+ {
+ "entropy": 1.449837327003479,
+ "epoch": 0.8323232323232324,
+ "grad_norm": 2.2499871253967285,
+ "learning_rate": 4.1696969696969705e-06,
+ "loss": 1.489758014678955,
+ "mean_token_accuracy": 0.645639955997467,
+ "num_tokens": 6750208.0,
+ "step": 412
+ },
+ {
+ "entropy": 1.7696173191070557,
+ "epoch": 0.8343434343434344,
+ "grad_norm": 2.3637073040008545,
+ "learning_rate": 4.167676767676768e-06,
+ "loss": 1.8147599697113037,
+ "mean_token_accuracy": 0.5821323990821838,
+ "num_tokens": 6766592.0,
+ "step": 413
+ },
+ {
+ "entropy": 1.99376380443573,
+ "epoch": 0.8363636363636363,
+ "grad_norm": 2.265683174133301,
+ "learning_rate": 4.165656565656566e-06,
+ "loss": 2.009024143218994,
+ "mean_token_accuracy": 0.5591108798980713,
+ "num_tokens": 6782976.0,
+ "step": 414
+ },
+ {
+ "entropy": 1.7276980876922607,
+ "epoch": 0.8383838383838383,
+ "grad_norm": 1.9407477378845215,
+ "learning_rate": 4.163636363636364e-06,
+ "loss": 1.7130229473114014,
+ "mean_token_accuracy": 0.6202979683876038,
+ "num_tokens": 6799360.0,
+ "step": 415
+ },
+ {
+ "entropy": 1.5418223142623901,
+ "epoch": 0.8404040404040404,
+ "grad_norm": 1.9765743017196655,
+ "learning_rate": 4.161616161616162e-06,
+ "loss": 1.5627632141113281,
+ "mean_token_accuracy": 0.6433194875717163,
+ "num_tokens": 6815744.0,
+ "step": 416
+ },
+ {
+ "entropy": 1.6040345430374146,
+ "epoch": 0.8424242424242424,
+ "grad_norm": 2.1942877769470215,
+ "learning_rate": 4.15959595959596e-06,
+ "loss": 1.6044622659683228,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 6832128.0,
+ "step": 417
+ },
+ {
+ "entropy": 1.8461577892303467,
+ "epoch": 0.8444444444444444,
+ "grad_norm": 2.289196729660034,
+ "learning_rate": 4.157575757575758e-06,
+ "loss": 1.8679372072219849,
+ "mean_token_accuracy": 0.5887884497642517,
+ "num_tokens": 6848512.0,
+ "step": 418
+ },
+ {
+ "entropy": 1.4079350233078003,
+ "epoch": 0.8464646464646465,
+ "grad_norm": 1.9526047706604004,
+ "learning_rate": 4.155555555555556e-06,
+ "loss": 1.4145114421844482,
+ "mean_token_accuracy": 0.6731802821159363,
+ "num_tokens": 6864896.0,
+ "step": 419
+ },
+ {
+ "entropy": 1.1973973512649536,
+ "epoch": 0.8484848484848485,
+ "grad_norm": 2.0716679096221924,
+ "learning_rate": 4.1535353535353536e-06,
+ "loss": 1.260810136795044,
+ "mean_token_accuracy": 0.701697587966919,
+ "num_tokens": 6881280.0,
+ "step": 420
+ },
+ {
+ "entropy": 1.507702350616455,
+ "epoch": 0.8505050505050505,
+ "grad_norm": 2.0233314037323,
+ "learning_rate": 4.151515151515152e-06,
+ "loss": 1.513720154762268,
+ "mean_token_accuracy": 0.6497313380241394,
+ "num_tokens": 6897664.0,
+ "step": 421
+ },
+ {
+ "entropy": 1.54402756690979,
+ "epoch": 0.8525252525252526,
+ "grad_norm": 2.23366379737854,
+ "learning_rate": 4.14949494949495e-06,
+ "loss": 1.5434964895248413,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 6914048.0,
+ "step": 422
+ },
+ {
+ "entropy": 1.820296049118042,
+ "epoch": 0.8545454545454545,
+ "grad_norm": 2.066905975341797,
+ "learning_rate": 4.147474747474748e-06,
+ "loss": 1.8356924057006836,
+ "mean_token_accuracy": 0.5886663198471069,
+ "num_tokens": 6930432.0,
+ "step": 423
+ },
+ {
+ "entropy": 1.4747720956802368,
+ "epoch": 0.8565656565656565,
+ "grad_norm": 2.040022850036621,
+ "learning_rate": 4.145454545454546e-06,
+ "loss": 1.4495999813079834,
+ "mean_token_accuracy": 0.6532731056213379,
+ "num_tokens": 6946816.0,
+ "step": 424
+ },
+ {
+ "entropy": 1.7536696195602417,
+ "epoch": 0.8585858585858586,
+ "grad_norm": 2.0884320735931396,
+ "learning_rate": 4.143434343434344e-06,
+ "loss": 1.7520158290863037,
+ "mean_token_accuracy": 0.6083903312683105,
+ "num_tokens": 6963200.0,
+ "step": 425
+ },
+ {
+ "entropy": 1.715582251548767,
+ "epoch": 0.8606060606060606,
+ "grad_norm": 2.2991514205932617,
+ "learning_rate": 4.141414141414142e-06,
+ "loss": 1.7138090133666992,
+ "mean_token_accuracy": 0.607107937335968,
+ "num_tokens": 6979584.0,
+ "step": 426
+ },
+ {
+ "entropy": 1.8116382360458374,
+ "epoch": 0.8626262626262626,
+ "grad_norm": 2.289909839630127,
+ "learning_rate": 4.13939393939394e-06,
+ "loss": 1.7755894660949707,
+ "mean_token_accuracy": 0.5776746273040771,
+ "num_tokens": 6995968.0,
+ "step": 427
+ },
+ {
+ "entropy": 1.487213373184204,
+ "epoch": 0.8646464646464647,
+ "grad_norm": 1.8834803104400635,
+ "learning_rate": 4.1373737373737375e-06,
+ "loss": 1.511157751083374,
+ "mean_token_accuracy": 0.6546165347099304,
+ "num_tokens": 7012352.0,
+ "step": 428
+ },
+ {
+ "entropy": 1.2769891023635864,
+ "epoch": 0.8666666666666667,
+ "grad_norm": 1.892616629600525,
+ "learning_rate": 4.135353535353535e-06,
+ "loss": 1.2772598266601562,
+ "mean_token_accuracy": 0.6984611749649048,
+ "num_tokens": 7028736.0,
+ "step": 429
+ },
+ {
+ "entropy": 1.579519271850586,
+ "epoch": 0.8686868686868687,
+ "grad_norm": 1.9801563024520874,
+ "learning_rate": 4.133333333333333e-06,
+ "loss": 1.5647528171539307,
+ "mean_token_accuracy": 0.6482046842575073,
+ "num_tokens": 7045120.0,
+ "step": 430
+ },
+ {
+ "entropy": 1.407600998878479,
+ "epoch": 0.8707070707070707,
+ "grad_norm": 2.1737446784973145,
+ "learning_rate": 4.131313131313132e-06,
+ "loss": 1.4184494018554688,
+ "mean_token_accuracy": 0.6640815734863281,
+ "num_tokens": 7061504.0,
+ "step": 431
+ },
+ {
+ "entropy": 1.9118441343307495,
+ "epoch": 0.8727272727272727,
+ "grad_norm": 1.9541205167770386,
+ "learning_rate": 4.12929292929293e-06,
+ "loss": 1.9581422805786133,
+ "mean_token_accuracy": 0.564667820930481,
+ "num_tokens": 7077888.0,
+ "step": 432
+ },
+ {
+ "entropy": 1.925604224205017,
+ "epoch": 0.8747474747474747,
+ "grad_norm": 1.9696223735809326,
+ "learning_rate": 4.127272727272728e-06,
+ "loss": 1.9226163625717163,
+ "mean_token_accuracy": 0.5870786309242249,
+ "num_tokens": 7094272.0,
+ "step": 433
+ },
+ {
+ "entropy": 1.3994735479354858,
+ "epoch": 0.8767676767676768,
+ "grad_norm": 2.003532886505127,
+ "learning_rate": 4.125252525252526e-06,
+ "loss": 1.4291752576828003,
+ "mean_token_accuracy": 0.669516384601593,
+ "num_tokens": 7110656.0,
+ "step": 434
+ },
+ {
+ "entropy": 1.5550929307937622,
+ "epoch": 0.8787878787878788,
+ "grad_norm": 2.2658586502075195,
+ "learning_rate": 4.1232323232323236e-06,
+ "loss": 1.5533335208892822,
+ "mean_token_accuracy": 0.6242672204971313,
+ "num_tokens": 7127040.0,
+ "step": 435
+ },
+ {
+ "entropy": 1.6622785329818726,
+ "epoch": 0.8808080808080808,
+ "grad_norm": 2.0748393535614014,
+ "learning_rate": 4.1212121212121215e-06,
+ "loss": 1.700000524520874,
+ "mean_token_accuracy": 0.6221299171447754,
+ "num_tokens": 7143424.0,
+ "step": 436
+ },
+ {
+ "entropy": 1.1223996877670288,
+ "epoch": 0.8828282828282829,
+ "grad_norm": 2.0348756313323975,
+ "learning_rate": 4.119191919191919e-06,
+ "loss": 1.143293857574463,
+ "mean_token_accuracy": 0.7045676708221436,
+ "num_tokens": 7159808.0,
+ "step": 437
+ },
+ {
+ "entropy": 1.7156380414962769,
+ "epoch": 0.8848484848484849,
+ "grad_norm": 2.306549549102783,
+ "learning_rate": 4.117171717171717e-06,
+ "loss": 1.7625794410705566,
+ "mean_token_accuracy": 0.6049706935882568,
+ "num_tokens": 7176192.0,
+ "step": 438
+ },
+ {
+ "entropy": 1.8507202863693237,
+ "epoch": 0.8868686868686869,
+ "grad_norm": 2.2955853939056396,
+ "learning_rate": 4.115151515151515e-06,
+ "loss": 1.8923052549362183,
+ "mean_token_accuracy": 0.5938568711280823,
+ "num_tokens": 7192576.0,
+ "step": 439
+ },
+ {
+ "entropy": 1.813754916191101,
+ "epoch": 0.8888888888888888,
+ "grad_norm": 2.095700263977051,
+ "learning_rate": 4.113131313131313e-06,
+ "loss": 1.8375307321548462,
+ "mean_token_accuracy": 0.5848192572593689,
+ "num_tokens": 7208960.0,
+ "step": 440
+ },
+ {
+ "entropy": 1.4185007810592651,
+ "epoch": 0.8909090909090909,
+ "grad_norm": 2.118213176727295,
+ "learning_rate": 4.111111111111111e-06,
+ "loss": 1.4548171758651733,
+ "mean_token_accuracy": 0.657608687877655,
+ "num_tokens": 7225344.0,
+ "step": 441
+ },
+ {
+ "entropy": 1.1041690111160278,
+ "epoch": 0.8929292929292929,
+ "grad_norm": 1.9638988971710205,
+ "learning_rate": 4.10909090909091e-06,
+ "loss": 1.1232322454452515,
+ "mean_token_accuracy": 0.7068881392478943,
+ "num_tokens": 7241728.0,
+ "step": 442
+ },
+ {
+ "entropy": 1.6423180103302002,
+ "epoch": 0.8949494949494949,
+ "grad_norm": 2.32987117767334,
+ "learning_rate": 4.1070707070707075e-06,
+ "loss": 1.665462613105774,
+ "mean_token_accuracy": 0.6133365631103516,
+ "num_tokens": 7258112.0,
+ "step": 443
+ },
+ {
+ "entropy": 1.4778310060501099,
+ "epoch": 0.896969696969697,
+ "grad_norm": 2.1247661113739014,
+ "learning_rate": 4.105050505050505e-06,
+ "loss": 1.4554922580718994,
+ "mean_token_accuracy": 0.6474108695983887,
+ "num_tokens": 7274496.0,
+ "step": 444
+ },
+ {
+ "entropy": 1.3777755498886108,
+ "epoch": 0.898989898989899,
+ "grad_norm": 1.9243263006210327,
+ "learning_rate": 4.103030303030303e-06,
+ "loss": 1.3942883014678955,
+ "mean_token_accuracy": 0.6656692624092102,
+ "num_tokens": 7290880.0,
+ "step": 445
+ },
+ {
+ "entropy": 1.1036415100097656,
+ "epoch": 0.901010101010101,
+ "grad_norm": 1.9711178541183472,
+ "learning_rate": 4.101010101010101e-06,
+ "loss": 1.1070351600646973,
+ "mean_token_accuracy": 0.7213605046272278,
+ "num_tokens": 7307264.0,
+ "step": 446
+ },
+ {
+ "entropy": 1.695487380027771,
+ "epoch": 0.9030303030303031,
+ "grad_norm": 2.1113150119781494,
+ "learning_rate": 4.098989898989899e-06,
+ "loss": 1.6993653774261475,
+ "mean_token_accuracy": 0.5992305874824524,
+ "num_tokens": 7323648.0,
+ "step": 447
+ },
+ {
+ "entropy": 1.496254801750183,
+ "epoch": 0.9050505050505051,
+ "grad_norm": 2.072986602783203,
+ "learning_rate": 4.096969696969697e-06,
+ "loss": 1.5046567916870117,
+ "mean_token_accuracy": 0.6558378338813782,
+ "num_tokens": 7340032.0,
+ "step": 448
+ },
+ {
+ "entropy": 2.1845033168792725,
+ "epoch": 0.907070707070707,
+ "grad_norm": 2.3246262073516846,
+ "learning_rate": 4.094949494949495e-06,
+ "loss": 2.1508708000183105,
+ "mean_token_accuracy": 0.5376160144805908,
+ "num_tokens": 7356416.0,
+ "step": 449
+ },
+ {
+ "entropy": 1.6329164505004883,
+ "epoch": 0.9090909090909091,
+ "grad_norm": 1.997310757637024,
+ "learning_rate": 4.092929292929294e-06,
+ "loss": 1.6422264575958252,
+ "mean_token_accuracy": 0.6232290863990784,
+ "num_tokens": 7372800.0,
+ "step": 450
+ },
+ {
+ "epoch": 0.9090909090909091,
+ "eval_entropy": 1.5515337480652718,
+ "eval_loss": 1.5485161542892456,
+ "eval_mean_token_accuracy": 0.6417716929028111,
+ "eval_num_tokens": 7372800.0,
+ "eval_runtime": 43.7901,
+ "eval_samples_per_second": 22.608,
+ "eval_steps_per_second": 2.832,
+ "step": 450
+ },
+ {
+ "entropy": 1.7854291200637817,
+ "epoch": 0.9111111111111111,
+ "grad_norm": 2.0212173461914062,
+ "learning_rate": 4.0909090909090915e-06,
+ "loss": 1.7920666933059692,
+ "mean_token_accuracy": 0.5950170755386353,
+ "num_tokens": 7389184.0,
+ "step": 451
+ },
+ {
+ "entropy": 1.216304898262024,
+ "epoch": 0.9131313131313131,
+ "grad_norm": 1.8800705671310425,
+ "learning_rate": 4.088888888888889e-06,
+ "loss": 1.2014267444610596,
+ "mean_token_accuracy": 0.7076819539070129,
+ "num_tokens": 7405568.0,
+ "step": 452
+ },
+ {
+ "entropy": 1.5593703985214233,
+ "epoch": 0.9151515151515152,
+ "grad_norm": 2.101381301879883,
+ "learning_rate": 4.086868686868687e-06,
+ "loss": 1.559610366821289,
+ "mean_token_accuracy": 0.6337933540344238,
+ "num_tokens": 7421952.0,
+ "step": 453
+ },
+ {
+ "entropy": 1.4199841022491455,
+ "epoch": 0.9171717171717172,
+ "grad_norm": 2.0038692951202393,
+ "learning_rate": 4.084848484848485e-06,
+ "loss": 1.4040653705596924,
+ "mean_token_accuracy": 0.660845160484314,
+ "num_tokens": 7438336.0,
+ "step": 454
+ },
+ {
+ "entropy": 1.2010453939437866,
+ "epoch": 0.9191919191919192,
+ "grad_norm": 2.004110336303711,
+ "learning_rate": 4.082828282828283e-06,
+ "loss": 1.194115400314331,
+ "mean_token_accuracy": 0.6955910921096802,
+ "num_tokens": 7454720.0,
+ "step": 455
+ },
+ {
+ "entropy": 1.2295804023742676,
+ "epoch": 0.9212121212121213,
+ "grad_norm": 2.130387544631958,
+ "learning_rate": 4.080808080808081e-06,
+ "loss": 1.2125787734985352,
+ "mean_token_accuracy": 0.6993771195411682,
+ "num_tokens": 7471104.0,
+ "step": 456
+ },
+ {
+ "entropy": 1.3706485033035278,
+ "epoch": 0.9232323232323232,
+ "grad_norm": 2.1667706966400146,
+ "learning_rate": 4.07878787878788e-06,
+ "loss": 1.3886957168579102,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 7487488.0,
+ "step": 457
+ },
+ {
+ "entropy": 1.714059591293335,
+ "epoch": 0.9252525252525252,
+ "grad_norm": 2.0084264278411865,
+ "learning_rate": 4.0767676767676775e-06,
+ "loss": 1.724153757095337,
+ "mean_token_accuracy": 0.602161705493927,
+ "num_tokens": 7503872.0,
+ "step": 458
+ },
+ {
+ "entropy": 1.3170617818832397,
+ "epoch": 0.9272727272727272,
+ "grad_norm": 1.9923994541168213,
+ "learning_rate": 4.0747474747474754e-06,
+ "loss": 1.3518096208572388,
+ "mean_token_accuracy": 0.6801416873931885,
+ "num_tokens": 7520256.0,
+ "step": 459
+ },
+ {
+ "entropy": 1.7946380376815796,
+ "epoch": 0.9292929292929293,
+ "grad_norm": 2.3475260734558105,
+ "learning_rate": 4.072727272727273e-06,
+ "loss": 1.824514389038086,
+ "mean_token_accuracy": 0.6005740165710449,
+ "num_tokens": 7536640.0,
+ "step": 460
+ },
+ {
+ "entropy": 1.3695449829101562,
+ "epoch": 0.9313131313131313,
+ "grad_norm": 2.0983943939208984,
+ "learning_rate": 4.070707070707071e-06,
+ "loss": 1.3934273719787598,
+ "mean_token_accuracy": 0.6723253726959229,
+ "num_tokens": 7553024.0,
+ "step": 461
+ },
+ {
+ "entropy": 1.5890663862228394,
+ "epoch": 0.9333333333333333,
+ "grad_norm": 2.1465413570404053,
+ "learning_rate": 4.068686868686869e-06,
+ "loss": 1.611652135848999,
+ "mean_token_accuracy": 0.6408158540725708,
+ "num_tokens": 7569408.0,
+ "step": 462
+ },
+ {
+ "entropy": 1.2593727111816406,
+ "epoch": 0.9353535353535354,
+ "grad_norm": 1.7885241508483887,
+ "learning_rate": 4.066666666666667e-06,
+ "loss": 1.2781705856323242,
+ "mean_token_accuracy": 0.6946751475334167,
+ "num_tokens": 7585792.0,
+ "step": 463
+ },
+ {
+ "entropy": 1.5680429935455322,
+ "epoch": 0.9373737373737374,
+ "grad_norm": 2.1466636657714844,
+ "learning_rate": 4.064646464646465e-06,
+ "loss": 1.60218346118927,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 7602176.0,
+ "step": 464
+ },
+ {
+ "entropy": 1.681670069694519,
+ "epoch": 0.9393939393939394,
+ "grad_norm": 2.2211875915527344,
+ "learning_rate": 4.062626262626263e-06,
+ "loss": 1.6819908618927002,
+ "mean_token_accuracy": 0.6177943348884583,
+ "num_tokens": 7618560.0,
+ "step": 465
+ },
+ {
+ "entropy": 1.2239924669265747,
+ "epoch": 0.9414141414141414,
+ "grad_norm": 1.9997022151947021,
+ "learning_rate": 4.060606060606061e-06,
+ "loss": 1.2383348941802979,
+ "mean_token_accuracy": 0.6922325491905212,
+ "num_tokens": 7634944.0,
+ "step": 466
+ },
+ {
+ "entropy": 1.291772723197937,
+ "epoch": 0.9434343434343434,
+ "grad_norm": 2.0868117809295654,
+ "learning_rate": 4.058585858585859e-06,
+ "loss": 1.2879221439361572,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 7651328.0,
+ "step": 467
+ },
+ {
+ "entropy": 1.2860186100006104,
+ "epoch": 0.9454545454545454,
+ "grad_norm": 1.8586393594741821,
+ "learning_rate": 4.056565656565657e-06,
+ "loss": 1.2820203304290771,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 7667712.0,
+ "step": 468
+ },
+ {
+ "entropy": 1.860795259475708,
+ "epoch": 0.9474747474747475,
+ "grad_norm": 2.364405393600464,
+ "learning_rate": 4.054545454545455e-06,
+ "loss": 1.8880727291107178,
+ "mean_token_accuracy": 0.5821323990821838,
+ "num_tokens": 7684096.0,
+ "step": 469
+ },
+ {
+ "entropy": 1.6017589569091797,
+ "epoch": 0.9494949494949495,
+ "grad_norm": 2.023054599761963,
+ "learning_rate": 4.052525252525253e-06,
+ "loss": 1.5993852615356445,
+ "mean_token_accuracy": 0.6366634368896484,
+ "num_tokens": 7700480.0,
+ "step": 470
+ },
+ {
+ "entropy": 1.8498003482818604,
+ "epoch": 0.9515151515151515,
+ "grad_norm": 2.4474003314971924,
+ "learning_rate": 4.050505050505051e-06,
+ "loss": 1.868700623512268,
+ "mean_token_accuracy": 0.5826209187507629,
+ "num_tokens": 7716864.0,
+ "step": 471
+ },
+ {
+ "entropy": 1.5625540018081665,
+ "epoch": 0.9535353535353536,
+ "grad_norm": 2.1018362045288086,
+ "learning_rate": 4.048484848484849e-06,
+ "loss": 1.571077585220337,
+ "mean_token_accuracy": 0.6433805823326111,
+ "num_tokens": 7733248.0,
+ "step": 472
+ },
+ {
+ "entropy": 1.8534579277038574,
+ "epoch": 0.9555555555555556,
+ "grad_norm": 2.407588243484497,
+ "learning_rate": 4.046464646464647e-06,
+ "loss": 1.8789153099060059,
+ "mean_token_accuracy": 0.5859794616699219,
+ "num_tokens": 7749632.0,
+ "step": 473
+ },
+ {
+ "entropy": 1.3264559507369995,
+ "epoch": 0.9575757575757575,
+ "grad_norm": 2.007199764251709,
+ "learning_rate": 4.044444444444445e-06,
+ "loss": 1.3489338159561157,
+ "mean_token_accuracy": 0.6650586128234863,
+ "num_tokens": 7766016.0,
+ "step": 474
+ },
+ {
+ "entropy": 1.1361761093139648,
+ "epoch": 0.9595959595959596,
+ "grad_norm": 1.9226998090744019,
+ "learning_rate": 4.0424242424242425e-06,
+ "loss": 1.156738519668579,
+ "mean_token_accuracy": 0.7226428985595703,
+ "num_tokens": 7782400.0,
+ "step": 475
+ },
+ {
+ "entropy": 1.550872802734375,
+ "epoch": 0.9616161616161616,
+ "grad_norm": 2.0082473754882812,
+ "learning_rate": 4.04040404040404e-06,
+ "loss": 1.5657379627227783,
+ "mean_token_accuracy": 0.642953097820282,
+ "num_tokens": 7798784.0,
+ "step": 476
+ },
+ {
+ "entropy": 1.0122721195220947,
+ "epoch": 0.9636363636363636,
+ "grad_norm": 1.9946776628494263,
+ "learning_rate": 4.038383838383838e-06,
+ "loss": 1.0301119089126587,
+ "mean_token_accuracy": 0.7361993193626404,
+ "num_tokens": 7815168.0,
+ "step": 477
+ },
+ {
+ "entropy": 1.61614990234375,
+ "epoch": 0.9656565656565657,
+ "grad_norm": 2.5009427070617676,
+ "learning_rate": 4.036363636363637e-06,
+ "loss": 1.6194994449615479,
+ "mean_token_accuracy": 0.620175838470459,
+ "num_tokens": 7831552.0,
+ "step": 478
+ },
+ {
+ "entropy": 1.5723443031311035,
+ "epoch": 0.9676767676767677,
+ "grad_norm": 1.9101917743682861,
+ "learning_rate": 4.034343434343435e-06,
+ "loss": 1.5586073398590088,
+ "mean_token_accuracy": 0.6223741769790649,
+ "num_tokens": 7847936.0,
+ "step": 479
+ },
+ {
+ "entropy": 1.271834373474121,
+ "epoch": 0.9696969696969697,
+ "grad_norm": 1.768438458442688,
+ "learning_rate": 4.032323232323233e-06,
+ "loss": 1.2466087341308594,
+ "mean_token_accuracy": 0.692354679107666,
+ "num_tokens": 7864320.0,
+ "step": 480
+ },
+ {
+ "entropy": 1.4550020694732666,
+ "epoch": 0.9717171717171718,
+ "grad_norm": 1.9753917455673218,
+ "learning_rate": 4.030303030303031e-06,
+ "loss": 1.4689980745315552,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 7880704.0,
+ "step": 481
+ },
+ {
+ "entropy": 2.023750066757202,
+ "epoch": 0.9737373737373738,
+ "grad_norm": 2.3014674186706543,
+ "learning_rate": 4.0282828282828285e-06,
+ "loss": 2.0601019859313965,
+ "mean_token_accuracy": 0.5528212189674377,
+ "num_tokens": 7897088.0,
+ "step": 482
+ },
+ {
+ "entropy": 1.3225218057632446,
+ "epoch": 0.9757575757575757,
+ "grad_norm": 1.9937688112258911,
+ "learning_rate": 4.0262626262626264e-06,
+ "loss": 1.3186583518981934,
+ "mean_token_accuracy": 0.6751343607902527,
+ "num_tokens": 7913472.0,
+ "step": 483
+ },
+ {
+ "entropy": 1.4357911348342896,
+ "epoch": 0.9777777777777777,
+ "grad_norm": 1.9591492414474487,
+ "learning_rate": 4.024242424242424e-06,
+ "loss": 1.4157384634017944,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 7929856.0,
+ "step": 484
+ },
+ {
+ "entropy": 1.470274567604065,
+ "epoch": 0.9797979797979798,
+ "grad_norm": 1.9318779706954956,
+ "learning_rate": 4.022222222222222e-06,
+ "loss": 1.4754853248596191,
+ "mean_token_accuracy": 0.6497923731803894,
+ "num_tokens": 7946240.0,
+ "step": 485
+ },
+ {
+ "entropy": 1.345750331878662,
+ "epoch": 0.9818181818181818,
+ "grad_norm": 1.9079619646072388,
+ "learning_rate": 4.02020202020202e-06,
+ "loss": 1.336526870727539,
+ "mean_token_accuracy": 0.6800805926322937,
+ "num_tokens": 7962624.0,
+ "step": 486
+ },
+ {
+ "entropy": 1.4641839265823364,
+ "epoch": 0.9838383838383838,
+ "grad_norm": 1.8413265943527222,
+ "learning_rate": 4.018181818181818e-06,
+ "loss": 1.4556326866149902,
+ "mean_token_accuracy": 0.6591963768005371,
+ "num_tokens": 7979008.0,
+ "step": 487
+ },
+ {
+ "entropy": 1.7966911792755127,
+ "epoch": 0.9858585858585859,
+ "grad_norm": 2.138899564743042,
+ "learning_rate": 4.016161616161616e-06,
+ "loss": 1.822898507118225,
+ "mean_token_accuracy": 0.5959941148757935,
+ "num_tokens": 7995392.0,
+ "step": 488
+ },
+ {
+ "entropy": 1.4334503412246704,
+ "epoch": 0.9878787878787879,
+ "grad_norm": 2.206122636795044,
+ "learning_rate": 4.014141414141415e-06,
+ "loss": 1.4127681255340576,
+ "mean_token_accuracy": 0.6609672904014587,
+ "num_tokens": 8011776.0,
+ "step": 489
+ },
+ {
+ "entropy": 1.684112548828125,
+ "epoch": 0.98989898989899,
+ "grad_norm": 2.0637400150299072,
+ "learning_rate": 4.0121212121212125e-06,
+ "loss": 1.6790317296981812,
+ "mean_token_accuracy": 0.6159012913703918,
+ "num_tokens": 8028160.0,
+ "step": 490
+ },
+ {
+ "entropy": 2.0716898441314697,
+ "epoch": 0.9919191919191919,
+ "grad_norm": 3.3912627696990967,
+ "learning_rate": 4.01010101010101e-06,
+ "loss": 2.0814826488494873,
+ "mean_token_accuracy": 0.5522105693817139,
+ "num_tokens": 8044544.0,
+ "step": 491
+ },
+ {
+ "entropy": 1.8764609098434448,
+ "epoch": 0.9939393939393939,
+ "grad_norm": 2.00569748878479,
+ "learning_rate": 4.008080808080808e-06,
+ "loss": 1.9150068759918213,
+ "mean_token_accuracy": 0.5823766589164734,
+ "num_tokens": 8060928.0,
+ "step": 492
+ },
+ {
+ "entropy": 1.630242943763733,
+ "epoch": 0.9959595959595959,
+ "grad_norm": 2.0648858547210693,
+ "learning_rate": 4.006060606060607e-06,
+ "loss": 1.6354784965515137,
+ "mean_token_accuracy": 0.621213972568512,
+ "num_tokens": 8077312.0,
+ "step": 493
+ },
+ {
+ "entropy": 1.7174078226089478,
+ "epoch": 0.997979797979798,
+ "grad_norm": 2.1376583576202393,
+ "learning_rate": 4.004040404040405e-06,
+ "loss": 1.7092773914337158,
+ "mean_token_accuracy": 0.6129701733589172,
+ "num_tokens": 8093696.0,
+ "step": 494
+ },
+ {
+ "entropy": 1.2112717628479004,
+ "epoch": 1.0,
+ "grad_norm": 1.9164371490478516,
+ "learning_rate": 4.002020202020203e-06,
+ "loss": 1.2106354236602783,
+ "mean_token_accuracy": 0.7040180563926697,
+ "num_tokens": 8110080.0,
+ "step": 495
+ },
+ {
+ "entropy": 1.2168891429901123,
+ "epoch": 1.002020202020202,
+ "grad_norm": 1.9845075607299805,
+ "learning_rate": 4.000000000000001e-06,
+ "loss": 1.1398870944976807,
+ "mean_token_accuracy": 0.7053004503250122,
+ "num_tokens": 8126464.0,
+ "step": 496
+ },
+ {
+ "entropy": 1.4670923948287964,
+ "epoch": 1.004040404040404,
+ "grad_norm": 2.0864014625549316,
+ "learning_rate": 3.9979797979797986e-06,
+ "loss": 1.4241242408752441,
+ "mean_token_accuracy": 0.6605398058891296,
+ "num_tokens": 8142848.0,
+ "step": 497
+ },
+ {
+ "entropy": 1.560593843460083,
+ "epoch": 1.006060606060606,
+ "grad_norm": 1.8882137537002563,
+ "learning_rate": 3.9959595959595964e-06,
+ "loss": 1.5164835453033447,
+ "mean_token_accuracy": 0.6610894203186035,
+ "num_tokens": 8159232.0,
+ "step": 498
+ },
+ {
+ "entropy": 1.2573609352111816,
+ "epoch": 1.0080808080808081,
+ "grad_norm": 2.011486530303955,
+ "learning_rate": 3.993939393939394e-06,
+ "loss": 1.2119636535644531,
+ "mean_token_accuracy": 0.6832559704780579,
+ "num_tokens": 8175616.0,
+ "step": 499
+ },
+ {
+ "entropy": 1.6119122505187988,
+ "epoch": 1.0101010101010102,
+ "grad_norm": 2.0089032649993896,
+ "learning_rate": 3.991919191919192e-06,
+ "loss": 1.5869622230529785,
+ "mean_token_accuracy": 0.6301905512809753,
+ "num_tokens": 8192000.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.0101010101010102,
+ "eval_entropy": 1.4907484121860997,
+ "eval_loss": 1.5444872379302979,
+ "eval_mean_token_accuracy": 0.6426531960887294,
+ "eval_num_tokens": 8192000.0,
+ "eval_runtime": 43.729,
+ "eval_samples_per_second": 22.639,
+ "eval_steps_per_second": 2.836,
+ "step": 500
+ },
+ {
+ "entropy": 1.5645418167114258,
+ "epoch": 1.0121212121212122,
+ "grad_norm": 2.171133279800415,
+ "learning_rate": 3.98989898989899e-06,
+ "loss": 1.5252666473388672,
+ "mean_token_accuracy": 0.639594554901123,
+ "num_tokens": 8208384.0,
+ "step": 501
+ },
+ {
+ "entropy": 1.2985379695892334,
+ "epoch": 1.0141414141414142,
+ "grad_norm": 1.9075100421905518,
+ "learning_rate": 3.987878787878788e-06,
+ "loss": 1.2863168716430664,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 8224768.0,
+ "step": 502
+ },
+ {
+ "entropy": 1.4055086374282837,
+ "epoch": 1.0161616161616163,
+ "grad_norm": 1.8511557579040527,
+ "learning_rate": 3.985858585858587e-06,
+ "loss": 1.440205454826355,
+ "mean_token_accuracy": 0.6671348214149475,
+ "num_tokens": 8241152.0,
+ "step": 503
+ },
+ {
+ "entropy": 1.0818580389022827,
+ "epoch": 1.018181818181818,
+ "grad_norm": 1.8912067413330078,
+ "learning_rate": 3.983838383838385e-06,
+ "loss": 1.0614542961120605,
+ "mean_token_accuracy": 0.7345505356788635,
+ "num_tokens": 8257536.0,
+ "step": 504
+ },
+ {
+ "entropy": 0.9176992177963257,
+ "epoch": 1.02020202020202,
+ "grad_norm": 1.7737077474594116,
+ "learning_rate": 3.9818181818181825e-06,
+ "loss": 0.9281337261199951,
+ "mean_token_accuracy": 0.7594040036201477,
+ "num_tokens": 8273920.0,
+ "step": 505
+ },
+ {
+ "entropy": 1.8801840543746948,
+ "epoch": 1.0222222222222221,
+ "grad_norm": 2.191689968109131,
+ "learning_rate": 3.97979797979798e-06,
+ "loss": 1.9127342700958252,
+ "mean_token_accuracy": 0.5732169151306152,
+ "num_tokens": 8290304.0,
+ "step": 506
+ },
+ {
+ "entropy": 1.2336418628692627,
+ "epoch": 1.0242424242424242,
+ "grad_norm": 2.0369555950164795,
+ "learning_rate": 3.977777777777778e-06,
+ "loss": 1.2513363361358643,
+ "mean_token_accuracy": 0.6852100491523743,
+ "num_tokens": 8306688.0,
+ "step": 507
+ },
+ {
+ "entropy": 1.8379974365234375,
+ "epoch": 1.0262626262626262,
+ "grad_norm": 2.176361083984375,
+ "learning_rate": 3.975757575757576e-06,
+ "loss": 1.8472888469696045,
+ "mean_token_accuracy": 0.5863458514213562,
+ "num_tokens": 8323072.0,
+ "step": 508
+ },
+ {
+ "entropy": 1.4421337842941284,
+ "epoch": 1.0282828282828282,
+ "grad_norm": 2.305441379547119,
+ "learning_rate": 3.973737373737374e-06,
+ "loss": 1.4835591316223145,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 8339456.0,
+ "step": 509
+ },
+ {
+ "entropy": 1.535184621810913,
+ "epoch": 1.0303030303030303,
+ "grad_norm": 2.0329015254974365,
+ "learning_rate": 3.971717171717172e-06,
+ "loss": 1.547795057296753,
+ "mean_token_accuracy": 0.6268319487571716,
+ "num_tokens": 8355840.0,
+ "step": 510
+ },
+ {
+ "entropy": 1.295592188835144,
+ "epoch": 1.0323232323232323,
+ "grad_norm": 2.0321359634399414,
+ "learning_rate": 3.96969696969697e-06,
+ "loss": 1.2885974645614624,
+ "mean_token_accuracy": 0.681485116481781,
+ "num_tokens": 8372224.0,
+ "step": 511
+ },
+ {
+ "entropy": 1.345553994178772,
+ "epoch": 1.0343434343434343,
+ "grad_norm": 1.9151290655136108,
+ "learning_rate": 3.967676767676768e-06,
+ "loss": 1.3364320993423462,
+ "mean_token_accuracy": 0.6849657893180847,
+ "num_tokens": 8388608.0,
+ "step": 512
+ },
+ {
+ "entropy": 1.3150815963745117,
+ "epoch": 1.0363636363636364,
+ "grad_norm": 1.9379258155822754,
+ "learning_rate": 3.965656565656566e-06,
+ "loss": 1.317258596420288,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 8404992.0,
+ "step": 513
+ },
+ {
+ "entropy": 1.46832275390625,
+ "epoch": 1.0383838383838384,
+ "grad_norm": 2.1009161472320557,
+ "learning_rate": 3.963636363636364e-06,
+ "loss": 1.4794366359710693,
+ "mean_token_accuracy": 0.6513800621032715,
+ "num_tokens": 8421376.0,
+ "step": 514
+ },
+ {
+ "entropy": 1.389290452003479,
+ "epoch": 1.0404040404040404,
+ "grad_norm": 1.8813941478729248,
+ "learning_rate": 3.961616161616162e-06,
+ "loss": 1.3930776119232178,
+ "mean_token_accuracy": 0.6799584627151489,
+ "num_tokens": 8437760.0,
+ "step": 515
+ },
+ {
+ "entropy": 1.2919796705245972,
+ "epoch": 1.0424242424242425,
+ "grad_norm": 2.0765745639801025,
+ "learning_rate": 3.95959595959596e-06,
+ "loss": 1.2943801879882812,
+ "mean_token_accuracy": 0.6929653286933899,
+ "num_tokens": 8454144.0,
+ "step": 516
+ },
+ {
+ "entropy": 1.172440767288208,
+ "epoch": 1.0444444444444445,
+ "grad_norm": 2.126800298690796,
+ "learning_rate": 3.957575757575758e-06,
+ "loss": 1.1923961639404297,
+ "mean_token_accuracy": 0.7098192572593689,
+ "num_tokens": 8470528.0,
+ "step": 517
+ },
+ {
+ "entropy": 1.8239458799362183,
+ "epoch": 1.0464646464646465,
+ "grad_norm": 1.96744966506958,
+ "learning_rate": 3.955555555555556e-06,
+ "loss": 1.840916633605957,
+ "mean_token_accuracy": 0.6033830046653748,
+ "num_tokens": 8486912.0,
+ "step": 518
+ },
+ {
+ "entropy": 1.4117076396942139,
+ "epoch": 1.0484848484848486,
+ "grad_norm": 2.0560126304626465,
+ "learning_rate": 3.953535353535354e-06,
+ "loss": 1.421530842781067,
+ "mean_token_accuracy": 0.6581583023071289,
+ "num_tokens": 8503296.0,
+ "step": 519
+ },
+ {
+ "entropy": 1.7085175514221191,
+ "epoch": 1.0505050505050506,
+ "grad_norm": 2.1386539936065674,
+ "learning_rate": 3.951515151515152e-06,
+ "loss": 1.7334365844726562,
+ "mean_token_accuracy": 0.6282975077629089,
+ "num_tokens": 8519680.0,
+ "step": 520
+ },
+ {
+ "entropy": 1.0607928037643433,
+ "epoch": 1.0525252525252524,
+ "grad_norm": 1.981020212173462,
+ "learning_rate": 3.9494949494949496e-06,
+ "loss": 1.0639690160751343,
+ "mean_token_accuracy": 0.722337543964386,
+ "num_tokens": 8536064.0,
+ "step": 521
+ },
+ {
+ "entropy": 1.2227518558502197,
+ "epoch": 1.0545454545454545,
+ "grad_norm": 1.9116015434265137,
+ "learning_rate": 3.9474747474747474e-06,
+ "loss": 1.2139748334884644,
+ "mean_token_accuracy": 0.704384446144104,
+ "num_tokens": 8552448.0,
+ "step": 522
+ },
+ {
+ "entropy": 1.2655551433563232,
+ "epoch": 1.0565656565656565,
+ "grad_norm": 2.176706075668335,
+ "learning_rate": 3.945454545454545e-06,
+ "loss": 1.2869982719421387,
+ "mean_token_accuracy": 0.678798258304596,
+ "num_tokens": 8568832.0,
+ "step": 523
+ },
+ {
+ "entropy": 1.436476707458496,
+ "epoch": 1.0585858585858585,
+ "grad_norm": 2.034846544265747,
+ "learning_rate": 3.943434343434343e-06,
+ "loss": 1.431445837020874,
+ "mean_token_accuracy": 0.6650586128234863,
+ "num_tokens": 8585216.0,
+ "step": 524
+ },
+ {
+ "entropy": 1.4563549757003784,
+ "epoch": 1.0606060606060606,
+ "grad_norm": 2.0301241874694824,
+ "learning_rate": 3.941414141414142e-06,
+ "loss": 1.468353033065796,
+ "mean_token_accuracy": 0.6550439596176147,
+ "num_tokens": 8601600.0,
+ "step": 525
+ },
+ {
+ "entropy": 1.4636993408203125,
+ "epoch": 1.0626262626262626,
+ "grad_norm": 2.092679023742676,
+ "learning_rate": 3.93939393939394e-06,
+ "loss": 1.4488987922668457,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 8617984.0,
+ "step": 526
+ },
+ {
+ "entropy": 1.1217654943466187,
+ "epoch": 1.0646464646464646,
+ "grad_norm": 1.953627347946167,
+ "learning_rate": 3.937373737373738e-06,
+ "loss": 1.1403257846832275,
+ "mean_token_accuracy": 0.7172080874443054,
+ "num_tokens": 8634368.0,
+ "step": 527
+ },
+ {
+ "entropy": 1.7785910367965698,
+ "epoch": 1.0666666666666667,
+ "grad_norm": 1.8496789932250977,
+ "learning_rate": 3.935353535353536e-06,
+ "loss": 1.7961615324020386,
+ "mean_token_accuracy": 0.6036272644996643,
+ "num_tokens": 8650752.0,
+ "step": 528
+ },
+ {
+ "entropy": 1.0998575687408447,
+ "epoch": 1.0686868686868687,
+ "grad_norm": 1.8732962608337402,
+ "learning_rate": 3.9333333333333335e-06,
+ "loss": 1.0960031747817993,
+ "mean_token_accuracy": 0.7223986387252808,
+ "num_tokens": 8667136.0,
+ "step": 529
+ },
+ {
+ "entropy": 1.6707724332809448,
+ "epoch": 1.0707070707070707,
+ "grad_norm": 2.220453977584839,
+ "learning_rate": 3.931313131313131e-06,
+ "loss": 1.6837453842163086,
+ "mean_token_accuracy": 0.6148021221160889,
+ "num_tokens": 8683520.0,
+ "step": 530
+ },
+ {
+ "entropy": 1.6108022928237915,
+ "epoch": 1.0727272727272728,
+ "grad_norm": 2.2464118003845215,
+ "learning_rate": 3.929292929292929e-06,
+ "loss": 1.633517861366272,
+ "mean_token_accuracy": 0.6195651888847351,
+ "num_tokens": 8699904.0,
+ "step": 531
+ },
+ {
+ "entropy": 1.1888173818588257,
+ "epoch": 1.0747474747474748,
+ "grad_norm": 1.8803986310958862,
+ "learning_rate": 3.927272727272727e-06,
+ "loss": 1.1904420852661133,
+ "mean_token_accuracy": 0.7134220600128174,
+ "num_tokens": 8716288.0,
+ "step": 532
+ },
+ {
+ "entropy": 1.0656445026397705,
+ "epoch": 1.0767676767676768,
+ "grad_norm": 2.038243532180786,
+ "learning_rate": 3.925252525252525e-06,
+ "loss": 1.0505216121673584,
+ "mean_token_accuracy": 0.7284440398216248,
+ "num_tokens": 8732672.0,
+ "step": 533
+ },
+ {
+ "entropy": 1.1473655700683594,
+ "epoch": 1.0787878787878789,
+ "grad_norm": 1.981107234954834,
+ "learning_rate": 3.923232323232323e-06,
+ "loss": 1.136179804801941,
+ "mean_token_accuracy": 0.7085368633270264,
+ "num_tokens": 8749056.0,
+ "step": 534
+ },
+ {
+ "entropy": 1.340027928352356,
+ "epoch": 1.0808080808080809,
+ "grad_norm": 2.2797436714172363,
+ "learning_rate": 3.921212121212122e-06,
+ "loss": 1.334214210510254,
+ "mean_token_accuracy": 0.6749511361122131,
+ "num_tokens": 8765440.0,
+ "step": 535
+ },
+ {
+ "entropy": 1.1464864015579224,
+ "epoch": 1.082828282828283,
+ "grad_norm": 1.9428092241287231,
+ "learning_rate": 3.9191919191919196e-06,
+ "loss": 1.1649314165115356,
+ "mean_token_accuracy": 0.72013920545578,
+ "num_tokens": 8781824.0,
+ "step": 536
+ },
+ {
+ "entropy": 1.784925103187561,
+ "epoch": 1.084848484848485,
+ "grad_norm": 2.157468795776367,
+ "learning_rate": 3.9171717171717175e-06,
+ "loss": 1.7725508213043213,
+ "mean_token_accuracy": 0.6014899611473083,
+ "num_tokens": 8798208.0,
+ "step": 537
+ },
+ {
+ "entropy": 1.362166166305542,
+ "epoch": 1.0868686868686868,
+ "grad_norm": 2.109646797180176,
+ "learning_rate": 3.915151515151515e-06,
+ "loss": 1.331969976425171,
+ "mean_token_accuracy": 0.6720200181007385,
+ "num_tokens": 8814592.0,
+ "step": 538
+ },
+ {
+ "entropy": 1.5614176988601685,
+ "epoch": 1.0888888888888888,
+ "grad_norm": 2.1047098636627197,
+ "learning_rate": 3.913131313131314e-06,
+ "loss": 1.534292459487915,
+ "mean_token_accuracy": 0.6446629166603088,
+ "num_tokens": 8830976.0,
+ "step": 539
+ },
+ {
+ "entropy": 1.5551490783691406,
+ "epoch": 1.0909090909090908,
+ "grad_norm": 2.10304594039917,
+ "learning_rate": 3.911111111111112e-06,
+ "loss": 1.5706363916397095,
+ "mean_token_accuracy": 0.6322056651115417,
+ "num_tokens": 8847360.0,
+ "step": 540
+ },
+ {
+ "entropy": 1.7433172464370728,
+ "epoch": 1.0929292929292929,
+ "grad_norm": 1.8621257543563843,
+ "learning_rate": 3.90909090909091e-06,
+ "loss": 1.7367552518844604,
+ "mean_token_accuracy": 0.6162066459655762,
+ "num_tokens": 8863744.0,
+ "step": 541
+ },
+ {
+ "entropy": 1.4073128700256348,
+ "epoch": 1.094949494949495,
+ "grad_norm": 1.939588189125061,
+ "learning_rate": 3.907070707070708e-06,
+ "loss": 1.3844857215881348,
+ "mean_token_accuracy": 0.6634709239006042,
+ "num_tokens": 8880128.0,
+ "step": 542
+ },
+ {
+ "entropy": 1.479836344718933,
+ "epoch": 1.096969696969697,
+ "grad_norm": 2.06921648979187,
+ "learning_rate": 3.905050505050506e-06,
+ "loss": 1.4933744668960571,
+ "mean_token_accuracy": 0.6510136723518372,
+ "num_tokens": 8896512.0,
+ "step": 543
+ },
+ {
+ "entropy": 1.3934576511383057,
+ "epoch": 1.098989898989899,
+ "grad_norm": 2.0697920322418213,
+ "learning_rate": 3.9030303030303035e-06,
+ "loss": 1.3886666297912598,
+ "mean_token_accuracy": 0.6775158643722534,
+ "num_tokens": 8912896.0,
+ "step": 544
+ },
+ {
+ "entropy": 1.5223709344863892,
+ "epoch": 1.101010101010101,
+ "grad_norm": 2.1627066135406494,
+ "learning_rate": 3.901010101010101e-06,
+ "loss": 1.5601061582565308,
+ "mean_token_accuracy": 0.6392892003059387,
+ "num_tokens": 8929280.0,
+ "step": 545
+ },
+ {
+ "entropy": 1.4462933540344238,
+ "epoch": 1.103030303030303,
+ "grad_norm": 1.9871046543121338,
+ "learning_rate": 3.898989898989899e-06,
+ "loss": 1.463792085647583,
+ "mean_token_accuracy": 0.6518075466156006,
+ "num_tokens": 8945664.0,
+ "step": 546
+ },
+ {
+ "entropy": 1.325921654701233,
+ "epoch": 1.105050505050505,
+ "grad_norm": 1.9081087112426758,
+ "learning_rate": 3.896969696969697e-06,
+ "loss": 1.3303362131118774,
+ "mean_token_accuracy": 0.7009648084640503,
+ "num_tokens": 8962048.0,
+ "step": 547
+ },
+ {
+ "entropy": 1.415048360824585,
+ "epoch": 1.107070707070707,
+ "grad_norm": 2.3306756019592285,
+ "learning_rate": 3.894949494949495e-06,
+ "loss": 1.4139145612716675,
+ "mean_token_accuracy": 0.6849047541618347,
+ "num_tokens": 8978432.0,
+ "step": 548
+ },
+ {
+ "entropy": 1.5863295793533325,
+ "epoch": 1.1090909090909091,
+ "grad_norm": 1.993159294128418,
+ "learning_rate": 3.892929292929293e-06,
+ "loss": 1.6010534763336182,
+ "mean_token_accuracy": 0.6424035429954529,
+ "num_tokens": 8994816.0,
+ "step": 549
+ },
+ {
+ "entropy": 1.5526721477508545,
+ "epoch": 1.1111111111111112,
+ "grad_norm": 2.0528876781463623,
+ "learning_rate": 3.890909090909092e-06,
+ "loss": 1.5465538501739502,
+ "mean_token_accuracy": 0.659807026386261,
+ "num_tokens": 9011200.0,
+ "step": 550
+ },
+ {
+ "epoch": 1.1111111111111112,
+ "eval_entropy": 1.4479231247978825,
+ "eval_loss": 1.5459802150726318,
+ "eval_mean_token_accuracy": 0.6425906530311031,
+ "eval_num_tokens": 9011200.0,
+ "eval_runtime": 43.7828,
+ "eval_samples_per_second": 22.612,
+ "eval_steps_per_second": 2.832,
+ "step": 550
+ },
+ {
+ "entropy": 1.4322376251220703,
+ "epoch": 1.1131313131313132,
+ "grad_norm": 1.933549404144287,
+ "learning_rate": 3.88888888888889e-06,
+ "loss": 1.4371025562286377,
+ "mean_token_accuracy": 0.670676589012146,
+ "num_tokens": 9027584.0,
+ "step": 551
+ },
+ {
+ "entropy": 1.5050671100616455,
+ "epoch": 1.1151515151515152,
+ "grad_norm": 1.9736099243164062,
+ "learning_rate": 3.8868686868686875e-06,
+ "loss": 1.5362370014190674,
+ "mean_token_accuracy": 0.651624321937561,
+ "num_tokens": 9043968.0,
+ "step": 552
+ },
+ {
+ "entropy": 1.4335887432098389,
+ "epoch": 1.1171717171717173,
+ "grad_norm": 1.8896421194076538,
+ "learning_rate": 3.884848484848485e-06,
+ "loss": 1.4439888000488281,
+ "mean_token_accuracy": 0.670615553855896,
+ "num_tokens": 9060352.0,
+ "step": 553
+ },
+ {
+ "entropy": 1.5979355573654175,
+ "epoch": 1.1191919191919193,
+ "grad_norm": 2.1710526943206787,
+ "learning_rate": 3.882828282828283e-06,
+ "loss": 1.629098653793335,
+ "mean_token_accuracy": 0.6226184368133545,
+ "num_tokens": 9076736.0,
+ "step": 554
+ },
+ {
+ "entropy": 1.2901698350906372,
+ "epoch": 1.121212121212121,
+ "grad_norm": 2.129443407058716,
+ "learning_rate": 3.880808080808081e-06,
+ "loss": 1.2824913263320923,
+ "mean_token_accuracy": 0.6816682815551758,
+ "num_tokens": 9093120.0,
+ "step": 555
+ },
+ {
+ "entropy": 1.403212308883667,
+ "epoch": 1.1232323232323231,
+ "grad_norm": 1.883240818977356,
+ "learning_rate": 3.878787878787879e-06,
+ "loss": 1.3960213661193848,
+ "mean_token_accuracy": 0.6651197075843811,
+ "num_tokens": 9109504.0,
+ "step": 556
+ },
+ {
+ "entropy": 1.3959479331970215,
+ "epoch": 1.1252525252525252,
+ "grad_norm": 2.1145691871643066,
+ "learning_rate": 3.876767676767677e-06,
+ "loss": 1.4046590328216553,
+ "mean_token_accuracy": 0.6607230305671692,
+ "num_tokens": 9125888.0,
+ "step": 557
+ },
+ {
+ "entropy": 1.0899873971939087,
+ "epoch": 1.1272727272727272,
+ "grad_norm": 1.8862192630767822,
+ "learning_rate": 3.874747474747475e-06,
+ "loss": 1.0965509414672852,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 9142272.0,
+ "step": 558
+ },
+ {
+ "entropy": 1.0380184650421143,
+ "epoch": 1.1292929292929292,
+ "grad_norm": 1.946702241897583,
+ "learning_rate": 3.872727272727273e-06,
+ "loss": 1.0539875030517578,
+ "mean_token_accuracy": 0.7423058152198792,
+ "num_tokens": 9158656.0,
+ "step": 559
+ },
+ {
+ "entropy": 1.1173628568649292,
+ "epoch": 1.1313131313131313,
+ "grad_norm": 2.002847909927368,
+ "learning_rate": 3.8707070707070706e-06,
+ "loss": 1.128816843032837,
+ "mean_token_accuracy": 0.7112848162651062,
+ "num_tokens": 9175040.0,
+ "step": 560
+ },
+ {
+ "entropy": 1.6536206007003784,
+ "epoch": 1.1333333333333333,
+ "grad_norm": 2.212761640548706,
+ "learning_rate": 3.868686868686869e-06,
+ "loss": 1.6286437511444092,
+ "mean_token_accuracy": 0.6277479529380798,
+ "num_tokens": 9191424.0,
+ "step": 561
+ },
+ {
+ "entropy": 1.7187970876693726,
+ "epoch": 1.1353535353535353,
+ "grad_norm": 2.207310199737549,
+ "learning_rate": 3.866666666666667e-06,
+ "loss": 1.7072829008102417,
+ "mean_token_accuracy": 0.6180996298789978,
+ "num_tokens": 9207808.0,
+ "step": 562
+ },
+ {
+ "entropy": 1.7057682275772095,
+ "epoch": 1.1373737373737374,
+ "grad_norm": 2.1582961082458496,
+ "learning_rate": 3.864646464646465e-06,
+ "loss": 1.7216498851776123,
+ "mean_token_accuracy": 0.6105886697769165,
+ "num_tokens": 9224192.0,
+ "step": 563
+ },
+ {
+ "entropy": 1.8016951084136963,
+ "epoch": 1.1393939393939394,
+ "grad_norm": 2.035249948501587,
+ "learning_rate": 3.862626262626263e-06,
+ "loss": 1.8101240396499634,
+ "mean_token_accuracy": 0.6199315786361694,
+ "num_tokens": 9240576.0,
+ "step": 564
+ },
+ {
+ "entropy": 1.094889760017395,
+ "epoch": 1.1414141414141414,
+ "grad_norm": 2.119861364364624,
+ "learning_rate": 3.860606060606061e-06,
+ "loss": 1.0990344285964966,
+ "mean_token_accuracy": 0.7071323990821838,
+ "num_tokens": 9256960.0,
+ "step": 565
+ },
+ {
+ "entropy": 1.537480115890503,
+ "epoch": 1.1434343434343435,
+ "grad_norm": 2.167386770248413,
+ "learning_rate": 3.858585858585859e-06,
+ "loss": 1.5262541770935059,
+ "mean_token_accuracy": 0.6343429684638977,
+ "num_tokens": 9273344.0,
+ "step": 566
+ },
+ {
+ "entropy": 1.2940728664398193,
+ "epoch": 1.1454545454545455,
+ "grad_norm": 1.941097617149353,
+ "learning_rate": 3.856565656565657e-06,
+ "loss": 1.3145123720169067,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 9289728.0,
+ "step": 567
+ },
+ {
+ "entropy": 1.3154000043869019,
+ "epoch": 1.1474747474747475,
+ "grad_norm": 2.088576078414917,
+ "learning_rate": 3.8545454545454545e-06,
+ "loss": 1.3154902458190918,
+ "mean_token_accuracy": 0.6703101992607117,
+ "num_tokens": 9306112.0,
+ "step": 568
+ },
+ {
+ "entropy": 1.3576427698135376,
+ "epoch": 1.1494949494949496,
+ "grad_norm": 1.9895246028900146,
+ "learning_rate": 3.852525252525252e-06,
+ "loss": 1.3295378684997559,
+ "mean_token_accuracy": 0.6762335300445557,
+ "num_tokens": 9322496.0,
+ "step": 569
+ },
+ {
+ "entropy": 1.6067878007888794,
+ "epoch": 1.1515151515151516,
+ "grad_norm": 2.021191358566284,
+ "learning_rate": 3.85050505050505e-06,
+ "loss": 1.6273870468139648,
+ "mean_token_accuracy": 0.6329995393753052,
+ "num_tokens": 9338880.0,
+ "step": 570
+ },
+ {
+ "entropy": 1.4831246137619019,
+ "epoch": 1.1535353535353536,
+ "grad_norm": 2.114612340927124,
+ "learning_rate": 3.848484848484848e-06,
+ "loss": 1.4925904273986816,
+ "mean_token_accuracy": 0.6566316485404968,
+ "num_tokens": 9355264.0,
+ "step": 571
+ },
+ {
+ "entropy": 1.4476258754730225,
+ "epoch": 1.1555555555555554,
+ "grad_norm": 2.3435230255126953,
+ "learning_rate": 3.846464646464647e-06,
+ "loss": 1.438629388809204,
+ "mean_token_accuracy": 0.656020998954773,
+ "num_tokens": 9371648.0,
+ "step": 572
+ },
+ {
+ "entropy": 1.7930315732955933,
+ "epoch": 1.1575757575757575,
+ "grad_norm": 2.1700010299682617,
+ "learning_rate": 3.844444444444445e-06,
+ "loss": 1.786928653717041,
+ "mean_token_accuracy": 0.6028333902359009,
+ "num_tokens": 9388032.0,
+ "step": 573
+ },
+ {
+ "entropy": 1.3800512552261353,
+ "epoch": 1.1595959595959595,
+ "grad_norm": 2.2036688327789307,
+ "learning_rate": 3.842424242424243e-06,
+ "loss": 1.3767224550247192,
+ "mean_token_accuracy": 0.6692110300064087,
+ "num_tokens": 9404416.0,
+ "step": 574
+ },
+ {
+ "entropy": 0.8562329411506653,
+ "epoch": 1.1616161616161615,
+ "grad_norm": 1.765388011932373,
+ "learning_rate": 3.840404040404041e-06,
+ "loss": 0.8366047143936157,
+ "mean_token_accuracy": 0.783707857131958,
+ "num_tokens": 9420800.0,
+ "step": 575
+ },
+ {
+ "entropy": 1.4267486333847046,
+ "epoch": 1.1636363636363636,
+ "grad_norm": 2.0768239498138428,
+ "learning_rate": 3.8383838383838385e-06,
+ "loss": 1.4165449142456055,
+ "mean_token_accuracy": 0.656020998954773,
+ "num_tokens": 9437184.0,
+ "step": 576
+ },
+ {
+ "entropy": 1.4123388528823853,
+ "epoch": 1.1656565656565656,
+ "grad_norm": 2.028716802597046,
+ "learning_rate": 3.836363636363636e-06,
+ "loss": 1.420403003692627,
+ "mean_token_accuracy": 0.6729360222816467,
+ "num_tokens": 9453568.0,
+ "step": 577
+ },
+ {
+ "entropy": 1.1549286842346191,
+ "epoch": 1.1676767676767676,
+ "grad_norm": 2.1142919063568115,
+ "learning_rate": 3.834343434343435e-06,
+ "loss": 1.1487064361572266,
+ "mean_token_accuracy": 0.7040180563926697,
+ "num_tokens": 9469952.0,
+ "step": 578
+ },
+ {
+ "entropy": 1.4779953956604004,
+ "epoch": 1.1696969696969697,
+ "grad_norm": 2.166046142578125,
+ "learning_rate": 3.832323232323233e-06,
+ "loss": 1.4788683652877808,
+ "mean_token_accuracy": 0.6436858773231506,
+ "num_tokens": 9486336.0,
+ "step": 579
+ },
+ {
+ "entropy": 1.568039059638977,
+ "epoch": 1.1717171717171717,
+ "grad_norm": 2.067704200744629,
+ "learning_rate": 3.830303030303031e-06,
+ "loss": 1.5830929279327393,
+ "mean_token_accuracy": 0.6461895704269409,
+ "num_tokens": 9502720.0,
+ "step": 580
+ },
+ {
+ "entropy": 1.1785298585891724,
+ "epoch": 1.1737373737373737,
+ "grad_norm": 1.9789953231811523,
+ "learning_rate": 3.828282828282829e-06,
+ "loss": 1.2083481550216675,
+ "mean_token_accuracy": 0.7120786309242249,
+ "num_tokens": 9519104.0,
+ "step": 581
+ },
+ {
+ "entropy": 1.3783847093582153,
+ "epoch": 1.1757575757575758,
+ "grad_norm": 2.1503992080688477,
+ "learning_rate": 3.826262626262627e-06,
+ "loss": 1.3721052408218384,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 9535488.0,
+ "step": 582
+ },
+ {
+ "entropy": 1.120093584060669,
+ "epoch": 1.1777777777777778,
+ "grad_norm": 1.9822942018508911,
+ "learning_rate": 3.8242424242424245e-06,
+ "loss": 1.1215628385543823,
+ "mean_token_accuracy": 0.7122618556022644,
+ "num_tokens": 9551872.0,
+ "step": 583
+ },
+ {
+ "entropy": 1.4621506929397583,
+ "epoch": 1.1797979797979798,
+ "grad_norm": 2.159489631652832,
+ "learning_rate": 3.8222222222222224e-06,
+ "loss": 1.4614722728729248,
+ "mean_token_accuracy": 0.6535173654556274,
+ "num_tokens": 9568256.0,
+ "step": 584
+ },
+ {
+ "entropy": 1.015797734260559,
+ "epoch": 1.1818181818181819,
+ "grad_norm": 1.846848726272583,
+ "learning_rate": 3.82020202020202e-06,
+ "loss": 1.0082862377166748,
+ "mean_token_accuracy": 0.7394968271255493,
+ "num_tokens": 9584640.0,
+ "step": 585
+ },
+ {
+ "entropy": 1.364890217781067,
+ "epoch": 1.183838383838384,
+ "grad_norm": 2.175546646118164,
+ "learning_rate": 3.818181818181819e-06,
+ "loss": 1.3496818542480469,
+ "mean_token_accuracy": 0.6665241718292236,
+ "num_tokens": 9601024.0,
+ "step": 586
+ },
+ {
+ "entropy": 1.6056870222091675,
+ "epoch": 1.185858585858586,
+ "grad_norm": 2.1069748401641846,
+ "learning_rate": 3.816161616161617e-06,
+ "loss": 1.6048622131347656,
+ "mean_token_accuracy": 0.642892062664032,
+ "num_tokens": 9617408.0,
+ "step": 587
+ },
+ {
+ "entropy": 1.415107250213623,
+ "epoch": 1.187878787878788,
+ "grad_norm": 2.184544324874878,
+ "learning_rate": 3.8141414141414144e-06,
+ "loss": 1.4305826425552368,
+ "mean_token_accuracy": 0.6619443297386169,
+ "num_tokens": 9633792.0,
+ "step": 588
+ },
+ {
+ "entropy": 1.6554296016693115,
+ "epoch": 1.1898989898989898,
+ "grad_norm": 2.109793186187744,
+ "learning_rate": 3.8121212121212127e-06,
+ "loss": 1.6850776672363281,
+ "mean_token_accuracy": 0.6116267442703247,
+ "num_tokens": 9650176.0,
+ "step": 589
+ },
+ {
+ "entropy": 1.681472659111023,
+ "epoch": 1.1919191919191918,
+ "grad_norm": 2.3179714679718018,
+ "learning_rate": 3.8101010101010106e-06,
+ "loss": 1.699328064918518,
+ "mean_token_accuracy": 0.6105275750160217,
+ "num_tokens": 9666560.0,
+ "step": 590
+ },
+ {
+ "entropy": 1.113366961479187,
+ "epoch": 1.1939393939393939,
+ "grad_norm": 1.9885324239730835,
+ "learning_rate": 3.8080808080808085e-06,
+ "loss": 1.1357836723327637,
+ "mean_token_accuracy": 0.7157425284385681,
+ "num_tokens": 9682944.0,
+ "step": 591
+ },
+ {
+ "entropy": 1.1010088920593262,
+ "epoch": 1.195959595959596,
+ "grad_norm": 1.9745922088623047,
+ "learning_rate": 3.8060606060606064e-06,
+ "loss": 1.094293475151062,
+ "mean_token_accuracy": 0.7214215993881226,
+ "num_tokens": 9699328.0,
+ "step": 592
+ },
+ {
+ "entropy": 1.562911033630371,
+ "epoch": 1.197979797979798,
+ "grad_norm": 2.0526134967803955,
+ "learning_rate": 3.8040404040404043e-06,
+ "loss": 1.5747783184051514,
+ "mean_token_accuracy": 0.6342818737030029,
+ "num_tokens": 9715712.0,
+ "step": 593
+ },
+ {
+ "entropy": 1.6541608572006226,
+ "epoch": 1.2,
+ "grad_norm": 2.1268227100372314,
+ "learning_rate": 3.8020202020202026e-06,
+ "loss": 1.696983814239502,
+ "mean_token_accuracy": 0.6127259135246277,
+ "num_tokens": 9732096.0,
+ "step": 594
+ },
+ {
+ "entropy": 1.5259482860565186,
+ "epoch": 1.202020202020202,
+ "grad_norm": 2.240692377090454,
+ "learning_rate": 3.8000000000000005e-06,
+ "loss": 1.5582221746444702,
+ "mean_token_accuracy": 0.644052267074585,
+ "num_tokens": 9748480.0,
+ "step": 595
+ },
+ {
+ "entropy": 1.455372929573059,
+ "epoch": 1.204040404040404,
+ "grad_norm": 2.0934698581695557,
+ "learning_rate": 3.7979797979797984e-06,
+ "loss": 1.464172124862671,
+ "mean_token_accuracy": 0.6555935740470886,
+ "num_tokens": 9764864.0,
+ "step": 596
+ },
+ {
+ "entropy": 1.5074836015701294,
+ "epoch": 1.206060606060606,
+ "grad_norm": 1.9779568910598755,
+ "learning_rate": 3.7959595959595962e-06,
+ "loss": 1.5280466079711914,
+ "mean_token_accuracy": 0.6460063457489014,
+ "num_tokens": 9781248.0,
+ "step": 597
+ },
+ {
+ "entropy": 1.3286548852920532,
+ "epoch": 1.208080808080808,
+ "grad_norm": 1.9357717037200928,
+ "learning_rate": 3.793939393939394e-06,
+ "loss": 1.3448848724365234,
+ "mean_token_accuracy": 0.6816072463989258,
+ "num_tokens": 9797632.0,
+ "step": 598
+ },
+ {
+ "entropy": 1.5161375999450684,
+ "epoch": 1.2101010101010101,
+ "grad_norm": 2.224217414855957,
+ "learning_rate": 3.791919191919192e-06,
+ "loss": 1.5168235301971436,
+ "mean_token_accuracy": 0.6453346610069275,
+ "num_tokens": 9814016.0,
+ "step": 599
+ },
+ {
+ "entropy": 1.3337587118148804,
+ "epoch": 1.2121212121212122,
+ "grad_norm": 1.9308290481567383,
+ "learning_rate": 3.7898989898989903e-06,
+ "loss": 1.3429791927337646,
+ "mean_token_accuracy": 0.6827064156532288,
+ "num_tokens": 9830400.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.2121212121212122,
+ "eval_entropy": 1.4592116455877981,
+ "eval_loss": 1.5424447059631348,
+ "eval_mean_token_accuracy": 0.6431668299821115,
+ "eval_num_tokens": 9830400.0,
+ "eval_runtime": 43.8289,
+ "eval_samples_per_second": 22.588,
+ "eval_steps_per_second": 2.829,
+ "step": 600
+ },
+ {
+ "entropy": 1.6697322130203247,
+ "epoch": 1.2141414141414142,
+ "grad_norm": 1.9462894201278687,
+ "learning_rate": 3.7878787878787882e-06,
+ "loss": 1.6434354782104492,
+ "mean_token_accuracy": 0.635808527469635,
+ "num_tokens": 9846784.0,
+ "step": 601
+ },
+ {
+ "entropy": 1.427184820175171,
+ "epoch": 1.2161616161616162,
+ "grad_norm": 2.196017026901245,
+ "learning_rate": 3.785858585858586e-06,
+ "loss": 1.4024749994277954,
+ "mean_token_accuracy": 0.6720200181007385,
+ "num_tokens": 9863168.0,
+ "step": 602
+ },
+ {
+ "entropy": 1.4623222351074219,
+ "epoch": 1.2181818181818183,
+ "grad_norm": 2.160585403442383,
+ "learning_rate": 3.783838383838384e-06,
+ "loss": 1.4455416202545166,
+ "mean_token_accuracy": 0.6557767391204834,
+ "num_tokens": 9879552.0,
+ "step": 603
+ },
+ {
+ "entropy": 1.348331093788147,
+ "epoch": 1.2202020202020203,
+ "grad_norm": 2.079458713531494,
+ "learning_rate": 3.781818181818182e-06,
+ "loss": 1.3672473430633545,
+ "mean_token_accuracy": 0.6834391951560974,
+ "num_tokens": 9895936.0,
+ "step": 604
+ },
+ {
+ "entropy": 1.362277865409851,
+ "epoch": 1.2222222222222223,
+ "grad_norm": 2.10718035697937,
+ "learning_rate": 3.77979797979798e-06,
+ "loss": 1.3567216396331787,
+ "mean_token_accuracy": 0.6659135222434998,
+ "num_tokens": 9912320.0,
+ "step": 605
+ },
+ {
+ "entropy": 1.2743226289749146,
+ "epoch": 1.2242424242424241,
+ "grad_norm": 2.116549491882324,
+ "learning_rate": 3.777777777777778e-06,
+ "loss": 1.303470253944397,
+ "mean_token_accuracy": 0.6791035532951355,
+ "num_tokens": 9928704.0,
+ "step": 606
+ },
+ {
+ "entropy": 1.079649567604065,
+ "epoch": 1.2262626262626264,
+ "grad_norm": 1.8429855108261108,
+ "learning_rate": 3.775757575757576e-06,
+ "loss": 1.0616915225982666,
+ "mean_token_accuracy": 0.7321690320968628,
+ "num_tokens": 9945088.0,
+ "step": 607
+ },
+ {
+ "entropy": 1.363136649131775,
+ "epoch": 1.2282828282828282,
+ "grad_norm": 2.171295166015625,
+ "learning_rate": 3.773737373737374e-06,
+ "loss": 1.3525331020355225,
+ "mean_token_accuracy": 0.6732413172721863,
+ "num_tokens": 9961472.0,
+ "step": 608
+ },
+ {
+ "entropy": 1.324924349784851,
+ "epoch": 1.2303030303030302,
+ "grad_norm": 2.0872693061828613,
+ "learning_rate": 3.7717171717171717e-06,
+ "loss": 1.3282644748687744,
+ "mean_token_accuracy": 0.674462616443634,
+ "num_tokens": 9977856.0,
+ "step": 609
+ },
+ {
+ "entropy": 1.0672967433929443,
+ "epoch": 1.2323232323232323,
+ "grad_norm": 2.0819947719573975,
+ "learning_rate": 3.76969696969697e-06,
+ "loss": 1.0929367542266846,
+ "mean_token_accuracy": 0.715254008769989,
+ "num_tokens": 9994240.0,
+ "step": 610
+ },
+ {
+ "entropy": 1.4465869665145874,
+ "epoch": 1.2343434343434343,
+ "grad_norm": 2.1786868572235107,
+ "learning_rate": 3.767676767676768e-06,
+ "loss": 1.436307668685913,
+ "mean_token_accuracy": 0.6642037034034729,
+ "num_tokens": 10010624.0,
+ "step": 611
+ },
+ {
+ "entropy": 1.6424144506454468,
+ "epoch": 1.2363636363636363,
+ "grad_norm": 2.2582032680511475,
+ "learning_rate": 3.765656565656566e-06,
+ "loss": 1.6621832847595215,
+ "mean_token_accuracy": 0.6218246221542358,
+ "num_tokens": 10027008.0,
+ "step": 612
+ },
+ {
+ "entropy": 1.546712875366211,
+ "epoch": 1.2383838383838384,
+ "grad_norm": 2.1685879230499268,
+ "learning_rate": 3.7636363636363637e-06,
+ "loss": 1.5617464780807495,
+ "mean_token_accuracy": 0.6325110197067261,
+ "num_tokens": 10043392.0,
+ "step": 613
+ },
+ {
+ "entropy": 1.5758557319641113,
+ "epoch": 1.2404040404040404,
+ "grad_norm": 2.0911128520965576,
+ "learning_rate": 3.7616161616161616e-06,
+ "loss": 1.5830271244049072,
+ "mean_token_accuracy": 0.6349536180496216,
+ "num_tokens": 10059776.0,
+ "step": 614
+ },
+ {
+ "entropy": 1.5223995447158813,
+ "epoch": 1.2424242424242424,
+ "grad_norm": 2.0333359241485596,
+ "learning_rate": 3.7595959595959595e-06,
+ "loss": 1.5132982730865479,
+ "mean_token_accuracy": 0.6518075466156006,
+ "num_tokens": 10076160.0,
+ "step": 615
+ },
+ {
+ "entropy": 1.0950185060501099,
+ "epoch": 1.2444444444444445,
+ "grad_norm": 2.0048129558563232,
+ "learning_rate": 3.757575757575758e-06,
+ "loss": 1.0901896953582764,
+ "mean_token_accuracy": 0.723375678062439,
+ "num_tokens": 10092544.0,
+ "step": 616
+ },
+ {
+ "entropy": 1.340641736984253,
+ "epoch": 1.2464646464646465,
+ "grad_norm": 2.079256534576416,
+ "learning_rate": 3.7555555555555557e-06,
+ "loss": 1.3583415746688843,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 10108928.0,
+ "step": 617
+ },
+ {
+ "entropy": 1.1836222410202026,
+ "epoch": 1.2484848484848485,
+ "grad_norm": 1.9266347885131836,
+ "learning_rate": 3.7535353535353536e-06,
+ "loss": 1.171565294265747,
+ "mean_token_accuracy": 0.7046287059783936,
+ "num_tokens": 10125312.0,
+ "step": 618
+ },
+ {
+ "entropy": 1.6007641553878784,
+ "epoch": 1.2505050505050506,
+ "grad_norm": 2.25252103805542,
+ "learning_rate": 3.7515151515151515e-06,
+ "loss": 1.5955660343170166,
+ "mean_token_accuracy": 0.6306790709495544,
+ "num_tokens": 10141696.0,
+ "step": 619
+ },
+ {
+ "entropy": 1.8159959316253662,
+ "epoch": 1.2525252525252526,
+ "grad_norm": 2.255959987640381,
+ "learning_rate": 3.74949494949495e-06,
+ "loss": 1.8223116397857666,
+ "mean_token_accuracy": 0.5867122411727905,
+ "num_tokens": 10158080.0,
+ "step": 620
+ },
+ {
+ "entropy": 1.6469950675964355,
+ "epoch": 1.2545454545454544,
+ "grad_norm": 1.9183777570724487,
+ "learning_rate": 3.747474747474748e-06,
+ "loss": 1.6623587608337402,
+ "mean_token_accuracy": 0.6283586025238037,
+ "num_tokens": 10174464.0,
+ "step": 621
+ },
+ {
+ "entropy": 1.3507136106491089,
+ "epoch": 1.2565656565656567,
+ "grad_norm": 1.9393805265426636,
+ "learning_rate": 3.745454545454546e-06,
+ "loss": 1.3371413946151733,
+ "mean_token_accuracy": 0.6808744668960571,
+ "num_tokens": 10190848.0,
+ "step": 622
+ },
+ {
+ "entropy": 1.5176761150360107,
+ "epoch": 1.2585858585858585,
+ "grad_norm": 2.0721757411956787,
+ "learning_rate": 3.743434343434344e-06,
+ "loss": 1.5010406970977783,
+ "mean_token_accuracy": 0.6603566408157349,
+ "num_tokens": 10207232.0,
+ "step": 623
+ },
+ {
+ "entropy": 1.1409586668014526,
+ "epoch": 1.2606060606060607,
+ "grad_norm": 1.90805983543396,
+ "learning_rate": 3.7414141414141418e-06,
+ "loss": 1.1339551210403442,
+ "mean_token_accuracy": 0.7151318788528442,
+ "num_tokens": 10223616.0,
+ "step": 624
+ },
+ {
+ "entropy": 1.2258127927780151,
+ "epoch": 1.2626262626262625,
+ "grad_norm": 1.9276432991027832,
+ "learning_rate": 3.73939393939394e-06,
+ "loss": 1.2232249975204468,
+ "mean_token_accuracy": 0.7053614854812622,
+ "num_tokens": 10240000.0,
+ "step": 625
+ },
+ {
+ "entropy": 1.236358642578125,
+ "epoch": 1.2646464646464646,
+ "grad_norm": 2.0792832374572754,
+ "learning_rate": 3.737373737373738e-06,
+ "loss": 1.2570738792419434,
+ "mean_token_accuracy": 0.6869809627532959,
+ "num_tokens": 10256384.0,
+ "step": 626
+ },
+ {
+ "entropy": 1.0995185375213623,
+ "epoch": 1.2666666666666666,
+ "grad_norm": 2.035024881362915,
+ "learning_rate": 3.735353535353536e-06,
+ "loss": 1.10158109664917,
+ "mean_token_accuracy": 0.7248412370681763,
+ "num_tokens": 10272768.0,
+ "step": 627
+ },
+ {
+ "entropy": 1.8980706930160522,
+ "epoch": 1.2686868686868686,
+ "grad_norm": 2.040414333343506,
+ "learning_rate": 3.7333333333333337e-06,
+ "loss": 1.9260807037353516,
+ "mean_token_accuracy": 0.5953834652900696,
+ "num_tokens": 10289152.0,
+ "step": 628
+ },
+ {
+ "entropy": 1.4265168905258179,
+ "epoch": 1.2707070707070707,
+ "grad_norm": 2.418179750442505,
+ "learning_rate": 3.7313131313131316e-06,
+ "loss": 1.4415385723114014,
+ "mean_token_accuracy": 0.6535784006118774,
+ "num_tokens": 10305536.0,
+ "step": 629
+ },
+ {
+ "entropy": 1.217471957206726,
+ "epoch": 1.2727272727272727,
+ "grad_norm": 2.072441577911377,
+ "learning_rate": 3.72929292929293e-06,
+ "loss": 1.2361960411071777,
+ "mean_token_accuracy": 0.6947972774505615,
+ "num_tokens": 10321920.0,
+ "step": 630
+ },
+ {
+ "entropy": 1.0714137554168701,
+ "epoch": 1.2747474747474747,
+ "grad_norm": 3.0428647994995117,
+ "learning_rate": 3.727272727272728e-06,
+ "loss": 1.112711787223816,
+ "mean_token_accuracy": 0.7243527173995972,
+ "num_tokens": 10338304.0,
+ "step": 631
+ },
+ {
+ "entropy": 1.5873851776123047,
+ "epoch": 1.2767676767676768,
+ "grad_norm": 1.945098638534546,
+ "learning_rate": 3.7252525252525257e-06,
+ "loss": 1.595362663269043,
+ "mean_token_accuracy": 0.639594554901123,
+ "num_tokens": 10354688.0,
+ "step": 632
+ },
+ {
+ "entropy": 1.9688408374786377,
+ "epoch": 1.2787878787878788,
+ "grad_norm": 2.0450353622436523,
+ "learning_rate": 3.7232323232323236e-06,
+ "loss": 1.9989259243011475,
+ "mean_token_accuracy": 0.5685759782791138,
+ "num_tokens": 10371072.0,
+ "step": 633
+ },
+ {
+ "entropy": 1.2927459478378296,
+ "epoch": 1.2808080808080808,
+ "grad_norm": 1.959108591079712,
+ "learning_rate": 3.7212121212121215e-06,
+ "loss": 1.3025646209716797,
+ "mean_token_accuracy": 0.6853932738304138,
+ "num_tokens": 10387456.0,
+ "step": 634
+ },
+ {
+ "entropy": 1.6645994186401367,
+ "epoch": 1.2828282828282829,
+ "grad_norm": 2.041923999786377,
+ "learning_rate": 3.7191919191919194e-06,
+ "loss": 1.6959854364395142,
+ "mean_token_accuracy": 0.6319003701210022,
+ "num_tokens": 10403840.0,
+ "step": 635
+ },
+ {
+ "entropy": 1.401423692703247,
+ "epoch": 1.284848484848485,
+ "grad_norm": 2.040456533432007,
+ "learning_rate": 3.7171717171717177e-06,
+ "loss": 1.3859784603118896,
+ "mean_token_accuracy": 0.6740962266921997,
+ "num_tokens": 10420224.0,
+ "step": 636
+ },
+ {
+ "entropy": 1.0597256422042847,
+ "epoch": 1.286868686868687,
+ "grad_norm": 2.053690195083618,
+ "learning_rate": 3.7151515151515156e-06,
+ "loss": 1.052672266960144,
+ "mean_token_accuracy": 0.7290546894073486,
+ "num_tokens": 10436608.0,
+ "step": 637
+ },
+ {
+ "entropy": 1.280874252319336,
+ "epoch": 1.2888888888888888,
+ "grad_norm": 2.0566959381103516,
+ "learning_rate": 3.7131313131313135e-06,
+ "loss": 1.2883412837982178,
+ "mean_token_accuracy": 0.6822178959846497,
+ "num_tokens": 10452992.0,
+ "step": 638
+ },
+ {
+ "entropy": 1.299896240234375,
+ "epoch": 1.290909090909091,
+ "grad_norm": 1.8896070718765259,
+ "learning_rate": 3.7111111111111113e-06,
+ "loss": 1.3038103580474854,
+ "mean_token_accuracy": 0.6712872385978699,
+ "num_tokens": 10469376.0,
+ "step": 639
+ },
+ {
+ "entropy": 1.1713769435882568,
+ "epoch": 1.2929292929292928,
+ "grad_norm": 2.1309149265289307,
+ "learning_rate": 3.7090909090909092e-06,
+ "loss": 1.1899120807647705,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 10485760.0,
+ "step": 640
+ },
+ {
+ "entropy": 1.3056974411010742,
+ "epoch": 1.294949494949495,
+ "grad_norm": 1.9990391731262207,
+ "learning_rate": 3.7070707070707075e-06,
+ "loss": 1.3287105560302734,
+ "mean_token_accuracy": 0.6773326992988586,
+ "num_tokens": 10502144.0,
+ "step": 641
+ },
+ {
+ "entropy": 1.7352585792541504,
+ "epoch": 1.2969696969696969,
+ "grad_norm": 2.100043535232544,
+ "learning_rate": 3.7050505050505054e-06,
+ "loss": 1.7806944847106934,
+ "mean_token_accuracy": 0.60332190990448,
+ "num_tokens": 10518528.0,
+ "step": 642
+ },
+ {
+ "entropy": 1.3748377561569214,
+ "epoch": 1.298989898989899,
+ "grad_norm": 2.1280689239501953,
+ "learning_rate": 3.7030303030303033e-06,
+ "loss": 1.379891037940979,
+ "mean_token_accuracy": 0.6617611050605774,
+ "num_tokens": 10534912.0,
+ "step": 643
+ },
+ {
+ "entropy": 0.9991571307182312,
+ "epoch": 1.301010101010101,
+ "grad_norm": 1.7343134880065918,
+ "learning_rate": 3.701010101010101e-06,
+ "loss": 1.0082780122756958,
+ "mean_token_accuracy": 0.740229606628418,
+ "num_tokens": 10551296.0,
+ "step": 644
+ },
+ {
+ "entropy": 1.6313605308532715,
+ "epoch": 1.303030303030303,
+ "grad_norm": 2.216167449951172,
+ "learning_rate": 3.698989898989899e-06,
+ "loss": 1.6183781623840332,
+ "mean_token_accuracy": 0.6164509057998657,
+ "num_tokens": 10567680.0,
+ "step": 645
+ },
+ {
+ "entropy": 1.4174962043762207,
+ "epoch": 1.305050505050505,
+ "grad_norm": 2.0921854972839355,
+ "learning_rate": 3.6969696969696974e-06,
+ "loss": 1.4087945222854614,
+ "mean_token_accuracy": 0.6705544590950012,
+ "num_tokens": 10584064.0,
+ "step": 646
+ },
+ {
+ "entropy": 1.8302873373031616,
+ "epoch": 1.307070707070707,
+ "grad_norm": 2.0742204189300537,
+ "learning_rate": 3.6949494949494953e-06,
+ "loss": 1.8456642627716064,
+ "mean_token_accuracy": 0.5914142727851868,
+ "num_tokens": 10600448.0,
+ "step": 647
+ },
+ {
+ "entropy": 1.29628324508667,
+ "epoch": 1.309090909090909,
+ "grad_norm": 2.1446709632873535,
+ "learning_rate": 3.692929292929293e-06,
+ "loss": 1.3066375255584717,
+ "mean_token_accuracy": 0.6798363327980042,
+ "num_tokens": 10616832.0,
+ "step": 648
+ },
+ {
+ "entropy": 1.396378993988037,
+ "epoch": 1.3111111111111111,
+ "grad_norm": 1.9578899145126343,
+ "learning_rate": 3.690909090909091e-06,
+ "loss": 1.3943686485290527,
+ "mean_token_accuracy": 0.6772105693817139,
+ "num_tokens": 10633216.0,
+ "step": 649
+ },
+ {
+ "entropy": 1.6457722187042236,
+ "epoch": 1.3131313131313131,
+ "grad_norm": 1.9999926090240479,
+ "learning_rate": 3.688888888888889e-06,
+ "loss": 1.6266872882843018,
+ "mean_token_accuracy": 0.630923330783844,
+ "num_tokens": 10649600.0,
+ "step": 650
+ },
+ {
+ "epoch": 1.3131313131313131,
+ "eval_entropy": 1.456459879875183,
+ "eval_loss": 1.539737582206726,
+ "eval_mean_token_accuracy": 0.643713459853203,
+ "eval_num_tokens": 10649600.0,
+ "eval_runtime": 43.7637,
+ "eval_samples_per_second": 22.621,
+ "eval_steps_per_second": 2.833,
+ "step": 650
+ },
+ {
+ "entropy": 1.1152859926223755,
+ "epoch": 1.3151515151515152,
+ "grad_norm": 2.9232723712921143,
+ "learning_rate": 3.686868686868687e-06,
+ "loss": 1.099653959274292,
+ "mean_token_accuracy": 0.7227039337158203,
+ "num_tokens": 10665984.0,
+ "step": 651
+ },
+ {
+ "entropy": 1.6141386032104492,
+ "epoch": 1.3171717171717172,
+ "grad_norm": 2.1557929515838623,
+ "learning_rate": 3.684848484848485e-06,
+ "loss": 1.6156055927276611,
+ "mean_token_accuracy": 0.6288471221923828,
+ "num_tokens": 10682368.0,
+ "step": 652
+ },
+ {
+ "entropy": 1.282158374786377,
+ "epoch": 1.3191919191919192,
+ "grad_norm": 2.061983346939087,
+ "learning_rate": 3.682828282828283e-06,
+ "loss": 1.2867733240127563,
+ "mean_token_accuracy": 0.6869198679924011,
+ "num_tokens": 10698752.0,
+ "step": 653
+ },
+ {
+ "entropy": 0.9986366033554077,
+ "epoch": 1.3212121212121213,
+ "grad_norm": 2.0446274280548096,
+ "learning_rate": 3.680808080808081e-06,
+ "loss": 1.019629716873169,
+ "mean_token_accuracy": 0.7427943348884583,
+ "num_tokens": 10715136.0,
+ "step": 654
+ },
+ {
+ "entropy": 1.4256011247634888,
+ "epoch": 1.3232323232323233,
+ "grad_norm": 2.1024749279022217,
+ "learning_rate": 3.678787878787879e-06,
+ "loss": 1.4269766807556152,
+ "mean_token_accuracy": 0.6674401760101318,
+ "num_tokens": 10731520.0,
+ "step": 655
+ },
+ {
+ "entropy": 1.4913274049758911,
+ "epoch": 1.3252525252525253,
+ "grad_norm": 2.068432569503784,
+ "learning_rate": 3.6767676767676767e-06,
+ "loss": 1.4930779933929443,
+ "mean_token_accuracy": 0.6474719047546387,
+ "num_tokens": 10747904.0,
+ "step": 656
+ },
+ {
+ "entropy": 1.2957285642623901,
+ "epoch": 1.3272727272727272,
+ "grad_norm": 2.2480008602142334,
+ "learning_rate": 3.674747474747475e-06,
+ "loss": 1.3001320362091064,
+ "mean_token_accuracy": 0.679286777973175,
+ "num_tokens": 10764288.0,
+ "step": 657
+ },
+ {
+ "entropy": 1.328946828842163,
+ "epoch": 1.3292929292929294,
+ "grad_norm": 2.311176300048828,
+ "learning_rate": 3.672727272727273e-06,
+ "loss": 1.3286024332046509,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 10780672.0,
+ "step": 658
+ },
+ {
+ "entropy": 1.458139419555664,
+ "epoch": 1.3313131313131312,
+ "grad_norm": 2.1967899799346924,
+ "learning_rate": 3.670707070707071e-06,
+ "loss": 1.4384279251098633,
+ "mean_token_accuracy": 0.6435637474060059,
+ "num_tokens": 10797056.0,
+ "step": 659
+ },
+ {
+ "entropy": 1.43666672706604,
+ "epoch": 1.3333333333333333,
+ "grad_norm": 2.163083076477051,
+ "learning_rate": 3.6686868686868687e-06,
+ "loss": 1.4396371841430664,
+ "mean_token_accuracy": 0.6531509757041931,
+ "num_tokens": 10813440.0,
+ "step": 660
+ },
+ {
+ "entropy": 1.6210501194000244,
+ "epoch": 1.3353535353535353,
+ "grad_norm": 2.3601770401000977,
+ "learning_rate": 3.6666666666666666e-06,
+ "loss": 1.6370227336883545,
+ "mean_token_accuracy": 0.6149242520332336,
+ "num_tokens": 10829824.0,
+ "step": 661
+ },
+ {
+ "entropy": 0.9602832794189453,
+ "epoch": 1.3373737373737373,
+ "grad_norm": 1.8452314138412476,
+ "learning_rate": 3.664646464646465e-06,
+ "loss": 0.9445997476577759,
+ "mean_token_accuracy": 0.759709358215332,
+ "num_tokens": 10846208.0,
+ "step": 662
+ },
+ {
+ "entropy": 1.2215200662612915,
+ "epoch": 1.3393939393939394,
+ "grad_norm": 2.019989252090454,
+ "learning_rate": 3.662626262626263e-06,
+ "loss": 1.2451637983322144,
+ "mean_token_accuracy": 0.7051172256469727,
+ "num_tokens": 10862592.0,
+ "step": 663
+ },
+ {
+ "entropy": 1.3253310918807983,
+ "epoch": 1.3414141414141414,
+ "grad_norm": 1.9700425863265991,
+ "learning_rate": 3.660606060606061e-06,
+ "loss": 1.3407385349273682,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 10878976.0,
+ "step": 664
+ },
+ {
+ "entropy": 1.1397737264633179,
+ "epoch": 1.3434343434343434,
+ "grad_norm": 2.1194040775299072,
+ "learning_rate": 3.658585858585859e-06,
+ "loss": 1.1545679569244385,
+ "mean_token_accuracy": 0.7071323990821838,
+ "num_tokens": 10895360.0,
+ "step": 665
+ },
+ {
+ "entropy": 1.1714493036270142,
+ "epoch": 1.3454545454545455,
+ "grad_norm": 2.078051805496216,
+ "learning_rate": 3.6565656565656573e-06,
+ "loss": 1.1751537322998047,
+ "mean_token_accuracy": 0.6963238716125488,
+ "num_tokens": 10911744.0,
+ "step": 666
+ },
+ {
+ "entropy": 1.2954860925674438,
+ "epoch": 1.3474747474747475,
+ "grad_norm": 1.9348593950271606,
+ "learning_rate": 3.654545454545455e-06,
+ "loss": 1.2961801290512085,
+ "mean_token_accuracy": 0.6831338405609131,
+ "num_tokens": 10928128.0,
+ "step": 667
+ },
+ {
+ "entropy": 1.401628851890564,
+ "epoch": 1.3494949494949495,
+ "grad_norm": 2.1757614612579346,
+ "learning_rate": 3.652525252525253e-06,
+ "loss": 1.4025013446807861,
+ "mean_token_accuracy": 0.6590132117271423,
+ "num_tokens": 10944512.0,
+ "step": 668
+ },
+ {
+ "entropy": 1.4164557456970215,
+ "epoch": 1.3515151515151516,
+ "grad_norm": 2.0192055702209473,
+ "learning_rate": 3.650505050505051e-06,
+ "loss": 1.43379545211792,
+ "mean_token_accuracy": 0.6554714441299438,
+ "num_tokens": 10960896.0,
+ "step": 669
+ },
+ {
+ "entropy": 1.4888815879821777,
+ "epoch": 1.3535353535353536,
+ "grad_norm": 2.2166643142700195,
+ "learning_rate": 3.648484848484849e-06,
+ "loss": 1.494372844696045,
+ "mean_token_accuracy": 0.6402052044868469,
+ "num_tokens": 10977280.0,
+ "step": 670
+ },
+ {
+ "entropy": 1.215625286102295,
+ "epoch": 1.3555555555555556,
+ "grad_norm": 1.8059836626052856,
+ "learning_rate": 3.6464646464646467e-06,
+ "loss": 1.2074902057647705,
+ "mean_token_accuracy": 0.7123228907585144,
+ "num_tokens": 10993664.0,
+ "step": 671
+ },
+ {
+ "entropy": 0.9577685594558716,
+ "epoch": 1.3575757575757577,
+ "grad_norm": 1.8803631067276,
+ "learning_rate": 3.644444444444445e-06,
+ "loss": 0.956764817237854,
+ "mean_token_accuracy": 0.759709358215332,
+ "num_tokens": 11010048.0,
+ "step": 672
+ },
+ {
+ "entropy": 1.7215807437896729,
+ "epoch": 1.3595959595959597,
+ "grad_norm": 2.1421561241149902,
+ "learning_rate": 3.642424242424243e-06,
+ "loss": 1.7220706939697266,
+ "mean_token_accuracy": 0.6187102794647217,
+ "num_tokens": 11026432.0,
+ "step": 673
+ },
+ {
+ "entropy": 1.057277798652649,
+ "epoch": 1.3616161616161615,
+ "grad_norm": 1.9014254808425903,
+ "learning_rate": 3.640404040404041e-06,
+ "loss": 1.0582892894744873,
+ "mean_token_accuracy": 0.7327185869216919,
+ "num_tokens": 11042816.0,
+ "step": 674
+ },
+ {
+ "entropy": 1.220097541809082,
+ "epoch": 1.3636363636363638,
+ "grad_norm": 2.1406402587890625,
+ "learning_rate": 3.6383838383838387e-06,
+ "loss": 1.2152808904647827,
+ "mean_token_accuracy": 0.6976673007011414,
+ "num_tokens": 11059200.0,
+ "step": 675
+ },
+ {
+ "entropy": 1.4171489477157593,
+ "epoch": 1.3656565656565656,
+ "grad_norm": 2.1809890270233154,
+ "learning_rate": 3.6363636363636366e-06,
+ "loss": 1.4846035242080688,
+ "mean_token_accuracy": 0.6681118607521057,
+ "num_tokens": 11075584.0,
+ "step": 676
+ },
+ {
+ "entropy": 1.2915124893188477,
+ "epoch": 1.3676767676767676,
+ "grad_norm": 2.0533218383789062,
+ "learning_rate": 3.634343434343435e-06,
+ "loss": 1.3094089031219482,
+ "mean_token_accuracy": 0.6841719746589661,
+ "num_tokens": 11091968.0,
+ "step": 677
+ },
+ {
+ "entropy": 1.4717603921890259,
+ "epoch": 1.3696969696969696,
+ "grad_norm": 2.125450849533081,
+ "learning_rate": 3.6323232323232328e-06,
+ "loss": 1.479896903038025,
+ "mean_token_accuracy": 0.6601734161376953,
+ "num_tokens": 11108352.0,
+ "step": 678
+ },
+ {
+ "entropy": 1.0841981172561646,
+ "epoch": 1.3717171717171717,
+ "grad_norm": 1.936905026435852,
+ "learning_rate": 3.6303030303030307e-06,
+ "loss": 1.0895963907241821,
+ "mean_token_accuracy": 0.7307645082473755,
+ "num_tokens": 11124736.0,
+ "step": 679
+ },
+ {
+ "entropy": 0.85239177942276,
+ "epoch": 1.3737373737373737,
+ "grad_norm": 1.7117112874984741,
+ "learning_rate": 3.6282828282828286e-06,
+ "loss": 0.8716775178909302,
+ "mean_token_accuracy": 0.7721666097640991,
+ "num_tokens": 11141120.0,
+ "step": 680
+ },
+ {
+ "entropy": 1.4737738370895386,
+ "epoch": 1.3757575757575757,
+ "grad_norm": 2.0140671730041504,
+ "learning_rate": 3.6262626262626264e-06,
+ "loss": 1.5029723644256592,
+ "mean_token_accuracy": 0.653822660446167,
+ "num_tokens": 11157504.0,
+ "step": 681
+ },
+ {
+ "entropy": 1.260698914527893,
+ "epoch": 1.3777777777777778,
+ "grad_norm": 1.9868851900100708,
+ "learning_rate": 3.6242424242424248e-06,
+ "loss": 1.256290316581726,
+ "mean_token_accuracy": 0.6891182065010071,
+ "num_tokens": 11173888.0,
+ "step": 682
+ },
+ {
+ "entropy": 1.7418453693389893,
+ "epoch": 1.3797979797979798,
+ "grad_norm": 2.0905439853668213,
+ "learning_rate": 3.6222222222222226e-06,
+ "loss": 1.7568984031677246,
+ "mean_token_accuracy": 0.6291524171829224,
+ "num_tokens": 11190272.0,
+ "step": 683
+ },
+ {
+ "entropy": 1.5552523136138916,
+ "epoch": 1.3818181818181818,
+ "grad_norm": 2.2071683406829834,
+ "learning_rate": 3.6202020202020205e-06,
+ "loss": 1.555542230606079,
+ "mean_token_accuracy": 0.6403883695602417,
+ "num_tokens": 11206656.0,
+ "step": 684
+ },
+ {
+ "entropy": 1.4404902458190918,
+ "epoch": 1.3838383838383839,
+ "grad_norm": 2.276245594024658,
+ "learning_rate": 3.6181818181818184e-06,
+ "loss": 1.4155148267745972,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 11223040.0,
+ "step": 685
+ },
+ {
+ "entropy": 1.1282018423080444,
+ "epoch": 1.385858585858586,
+ "grad_norm": 1.9824057817459106,
+ "learning_rate": 3.6161616161616163e-06,
+ "loss": 1.099952220916748,
+ "mean_token_accuracy": 0.7234978079795837,
+ "num_tokens": 11239424.0,
+ "step": 686
+ },
+ {
+ "entropy": 1.5559885501861572,
+ "epoch": 1.387878787878788,
+ "grad_norm": 2.243121862411499,
+ "learning_rate": 3.614141414141414e-06,
+ "loss": 1.520850658416748,
+ "mean_token_accuracy": 0.6340987086296082,
+ "num_tokens": 11255808.0,
+ "step": 687
+ },
+ {
+ "entropy": 1.322407841682434,
+ "epoch": 1.38989898989899,
+ "grad_norm": 2.049233913421631,
+ "learning_rate": 3.6121212121212125e-06,
+ "loss": 1.322263479232788,
+ "mean_token_accuracy": 0.6778212189674377,
+ "num_tokens": 11272192.0,
+ "step": 688
+ },
+ {
+ "entropy": 1.3112859725952148,
+ "epoch": 1.391919191919192,
+ "grad_norm": 2.0666465759277344,
+ "learning_rate": 3.6101010101010104e-06,
+ "loss": 1.3103243112564087,
+ "mean_token_accuracy": 0.6828285455703735,
+ "num_tokens": 11288576.0,
+ "step": 689
+ },
+ {
+ "entropy": 1.3321104049682617,
+ "epoch": 1.393939393939394,
+ "grad_norm": 2.5464279651641846,
+ "learning_rate": 3.6080808080808083e-06,
+ "loss": 1.3247697353363037,
+ "mean_token_accuracy": 0.6785539984703064,
+ "num_tokens": 11304960.0,
+ "step": 690
+ },
+ {
+ "entropy": 1.0779680013656616,
+ "epoch": 1.3959595959595958,
+ "grad_norm": 2.1386117935180664,
+ "learning_rate": 3.606060606060606e-06,
+ "loss": 1.0994013547897339,
+ "mean_token_accuracy": 0.7129946351051331,
+ "num_tokens": 11321344.0,
+ "step": 691
+ },
+ {
+ "entropy": 1.0701864957809448,
+ "epoch": 1.397979797979798,
+ "grad_norm": 1.9387527704238892,
+ "learning_rate": 3.604040404040404e-06,
+ "loss": 1.0633184909820557,
+ "mean_token_accuracy": 0.7378480434417725,
+ "num_tokens": 11337728.0,
+ "step": 692
+ },
+ {
+ "entropy": 1.2258752584457397,
+ "epoch": 1.4,
+ "grad_norm": 2.0486111640930176,
+ "learning_rate": 3.6020202020202024e-06,
+ "loss": 1.2098207473754883,
+ "mean_token_accuracy": 0.6999877691268921,
+ "num_tokens": 11354112.0,
+ "step": 693
+ },
+ {
+ "entropy": 1.4652774333953857,
+ "epoch": 1.402020202020202,
+ "grad_norm": 2.043079376220703,
+ "learning_rate": 3.6000000000000003e-06,
+ "loss": 1.4780974388122559,
+ "mean_token_accuracy": 0.6681729555130005,
+ "num_tokens": 11370496.0,
+ "step": 694
+ },
+ {
+ "entropy": 1.3215711116790771,
+ "epoch": 1.404040404040404,
+ "grad_norm": 2.1327438354492188,
+ "learning_rate": 3.597979797979798e-06,
+ "loss": 1.3116662502288818,
+ "mean_token_accuracy": 0.6757450103759766,
+ "num_tokens": 11386880.0,
+ "step": 695
+ },
+ {
+ "entropy": 1.624266266822815,
+ "epoch": 1.406060606060606,
+ "grad_norm": 2.114398717880249,
+ "learning_rate": 3.595959595959596e-06,
+ "loss": 1.628610372543335,
+ "mean_token_accuracy": 0.6487542986869812,
+ "num_tokens": 11403264.0,
+ "step": 696
+ },
+ {
+ "entropy": 1.6059489250183105,
+ "epoch": 1.408080808080808,
+ "grad_norm": 1.952991008758545,
+ "learning_rate": 3.593939393939394e-06,
+ "loss": 1.6145906448364258,
+ "mean_token_accuracy": 0.6257938742637634,
+ "num_tokens": 11419648.0,
+ "step": 697
+ },
+ {
+ "entropy": 1.0662391185760498,
+ "epoch": 1.41010101010101,
+ "grad_norm": 2.0804851055145264,
+ "learning_rate": 3.5919191919191922e-06,
+ "loss": 1.0772000551223755,
+ "mean_token_accuracy": 0.7187347412109375,
+ "num_tokens": 11436032.0,
+ "step": 698
+ },
+ {
+ "entropy": 1.221283197402954,
+ "epoch": 1.412121212121212,
+ "grad_norm": 1.9502744674682617,
+ "learning_rate": 3.58989898989899e-06,
+ "loss": 1.2352337837219238,
+ "mean_token_accuracy": 0.6918050646781921,
+ "num_tokens": 11452416.0,
+ "step": 699
+ },
+ {
+ "entropy": 1.4205158948898315,
+ "epoch": 1.4141414141414141,
+ "grad_norm": 2.2222518920898438,
+ "learning_rate": 3.587878787878788e-06,
+ "loss": 1.451093077659607,
+ "mean_token_accuracy": 0.6648754477500916,
+ "num_tokens": 11468800.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.4141414141414141,
+ "eval_entropy": 1.4370074204860195,
+ "eval_loss": 1.5383458137512207,
+ "eval_mean_token_accuracy": 0.6441497793120723,
+ "eval_num_tokens": 11468800.0,
+ "eval_runtime": 43.744,
+ "eval_samples_per_second": 22.632,
+ "eval_steps_per_second": 2.835,
+ "step": 700
+ },
+ {
+ "entropy": 1.5432499647140503,
+ "epoch": 1.4161616161616162,
+ "grad_norm": 2.084463596343994,
+ "learning_rate": 3.585858585858586e-06,
+ "loss": 1.5958356857299805,
+ "mean_token_accuracy": 0.6377015113830566,
+ "num_tokens": 11485184.0,
+ "step": 701
+ },
+ {
+ "entropy": 1.297119379043579,
+ "epoch": 1.4181818181818182,
+ "grad_norm": 2.1996524333953857,
+ "learning_rate": 3.5838383838383838e-06,
+ "loss": 1.3346054553985596,
+ "mean_token_accuracy": 0.6801416873931885,
+ "num_tokens": 11501568.0,
+ "step": 702
+ },
+ {
+ "entropy": 1.3905766010284424,
+ "epoch": 1.4202020202020202,
+ "grad_norm": 2.1683545112609863,
+ "learning_rate": 3.5818181818181817e-06,
+ "loss": 1.40826416015625,
+ "mean_token_accuracy": 0.6653639674186707,
+ "num_tokens": 11517952.0,
+ "step": 703
+ },
+ {
+ "entropy": 0.9598695635795593,
+ "epoch": 1.4222222222222223,
+ "grad_norm": 1.9240537881851196,
+ "learning_rate": 3.57979797979798e-06,
+ "loss": 0.9487459659576416,
+ "mean_token_accuracy": 0.7556179761886597,
+ "num_tokens": 11534336.0,
+ "step": 704
+ },
+ {
+ "entropy": 1.2008687257766724,
+ "epoch": 1.4242424242424243,
+ "grad_norm": 1.9687083959579468,
+ "learning_rate": 3.577777777777778e-06,
+ "loss": 1.2234617471694946,
+ "mean_token_accuracy": 0.6982779502868652,
+ "num_tokens": 11550720.0,
+ "step": 705
+ },
+ {
+ "entropy": 1.1168856620788574,
+ "epoch": 1.4262626262626263,
+ "grad_norm": 2.1796388626098633,
+ "learning_rate": 3.575757575757576e-06,
+ "loss": 1.1320589780807495,
+ "mean_token_accuracy": 0.7057889699935913,
+ "num_tokens": 11567104.0,
+ "step": 706
+ },
+ {
+ "entropy": 1.3408682346343994,
+ "epoch": 1.4282828282828284,
+ "grad_norm": 1.9048689603805542,
+ "learning_rate": 3.573737373737374e-06,
+ "loss": 1.3476686477661133,
+ "mean_token_accuracy": 0.6839887499809265,
+ "num_tokens": 11583488.0,
+ "step": 707
+ },
+ {
+ "entropy": 1.4392427206039429,
+ "epoch": 1.4303030303030302,
+ "grad_norm": 2.183016777038574,
+ "learning_rate": 3.5717171717171724e-06,
+ "loss": 1.4443378448486328,
+ "mean_token_accuracy": 0.6546775698661804,
+ "num_tokens": 11599872.0,
+ "step": 708
+ },
+ {
+ "entropy": 1.1428641080856323,
+ "epoch": 1.4323232323232324,
+ "grad_norm": 2.0477187633514404,
+ "learning_rate": 3.5696969696969703e-06,
+ "loss": 1.1438124179840088,
+ "mean_token_accuracy": 0.7126282453536987,
+ "num_tokens": 11616256.0,
+ "step": 709
+ },
+ {
+ "entropy": 1.6266967058181763,
+ "epoch": 1.4343434343434343,
+ "grad_norm": 2.322098731994629,
+ "learning_rate": 3.567676767676768e-06,
+ "loss": 1.6161916255950928,
+ "mean_token_accuracy": 0.6202979683876038,
+ "num_tokens": 11632640.0,
+ "step": 710
+ },
+ {
+ "entropy": 1.349686622619629,
+ "epoch": 1.4363636363636363,
+ "grad_norm": 2.021871328353882,
+ "learning_rate": 3.565656565656566e-06,
+ "loss": 1.3713490962982178,
+ "mean_token_accuracy": 0.6596238613128662,
+ "num_tokens": 11649024.0,
+ "step": 711
+ },
+ {
+ "entropy": 1.4476866722106934,
+ "epoch": 1.4383838383838383,
+ "grad_norm": 2.194718837738037,
+ "learning_rate": 3.563636363636364e-06,
+ "loss": 1.4593651294708252,
+ "mean_token_accuracy": 0.6476551294326782,
+ "num_tokens": 11665408.0,
+ "step": 712
+ },
+ {
+ "entropy": 1.625157356262207,
+ "epoch": 1.4404040404040404,
+ "grad_norm": 2.0966169834136963,
+ "learning_rate": 3.5616161616161622e-06,
+ "loss": 1.6374845504760742,
+ "mean_token_accuracy": 0.6293356418609619,
+ "num_tokens": 11681792.0,
+ "step": 713
+ },
+ {
+ "entropy": 1.985729455947876,
+ "epoch": 1.4424242424242424,
+ "grad_norm": 2.129556655883789,
+ "learning_rate": 3.55959595959596e-06,
+ "loss": 2.0454561710357666,
+ "mean_token_accuracy": 0.5728505253791809,
+ "num_tokens": 11698176.0,
+ "step": 714
+ },
+ {
+ "entropy": 1.546321153640747,
+ "epoch": 1.4444444444444444,
+ "grad_norm": 2.1565628051757812,
+ "learning_rate": 3.557575757575758e-06,
+ "loss": 1.5467555522918701,
+ "mean_token_accuracy": 0.6351978778839111,
+ "num_tokens": 11714560.0,
+ "step": 715
+ },
+ {
+ "entropy": 1.3690776824951172,
+ "epoch": 1.4464646464646465,
+ "grad_norm": 2.206984519958496,
+ "learning_rate": 3.555555555555556e-06,
+ "loss": 1.3877894878387451,
+ "mean_token_accuracy": 0.6911333799362183,
+ "num_tokens": 11730944.0,
+ "step": 716
+ },
+ {
+ "entropy": 1.3643333911895752,
+ "epoch": 1.4484848484848485,
+ "grad_norm": 2.0049662590026855,
+ "learning_rate": 3.553535353535354e-06,
+ "loss": 1.364513635635376,
+ "mean_token_accuracy": 0.6781876087188721,
+ "num_tokens": 11747328.0,
+ "step": 717
+ },
+ {
+ "entropy": 1.337018370628357,
+ "epoch": 1.4505050505050505,
+ "grad_norm": 2.0919127464294434,
+ "learning_rate": 3.551515151515152e-06,
+ "loss": 1.3578065633773804,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 11763712.0,
+ "step": 718
+ },
+ {
+ "entropy": 1.3421508073806763,
+ "epoch": 1.4525252525252526,
+ "grad_norm": 2.0651159286499023,
+ "learning_rate": 3.54949494949495e-06,
+ "loss": 1.33928382396698,
+ "mean_token_accuracy": 0.6866145730018616,
+ "num_tokens": 11780096.0,
+ "step": 719
+ },
+ {
+ "entropy": 1.2841005325317383,
+ "epoch": 1.4545454545454546,
+ "grad_norm": 2.124370813369751,
+ "learning_rate": 3.547474747474748e-06,
+ "loss": 1.258314609527588,
+ "mean_token_accuracy": 0.6806302070617676,
+ "num_tokens": 11796480.0,
+ "step": 720
+ },
+ {
+ "entropy": 1.56289803981781,
+ "epoch": 1.4565656565656566,
+ "grad_norm": 1.9271100759506226,
+ "learning_rate": 3.5454545454545458e-06,
+ "loss": 1.5867946147918701,
+ "mean_token_accuracy": 0.6430752277374268,
+ "num_tokens": 11812864.0,
+ "step": 721
+ },
+ {
+ "entropy": 1.3374838829040527,
+ "epoch": 1.4585858585858587,
+ "grad_norm": 2.1113364696502686,
+ "learning_rate": 3.5434343434343437e-06,
+ "loss": 1.327169418334961,
+ "mean_token_accuracy": 0.6806912422180176,
+ "num_tokens": 11829248.0,
+ "step": 722
+ },
+ {
+ "entropy": 1.7233415842056274,
+ "epoch": 1.4606060606060607,
+ "grad_norm": 2.1862399578094482,
+ "learning_rate": 3.5414141414141416e-06,
+ "loss": 1.7290821075439453,
+ "mean_token_accuracy": 0.6056423783302307,
+ "num_tokens": 11845632.0,
+ "step": 723
+ },
+ {
+ "entropy": 1.28484046459198,
+ "epoch": 1.4626262626262627,
+ "grad_norm": 2.0059030055999756,
+ "learning_rate": 3.53939393939394e-06,
+ "loss": 1.2958555221557617,
+ "mean_token_accuracy": 0.6774548292160034,
+ "num_tokens": 11862016.0,
+ "step": 724
+ },
+ {
+ "entropy": 1.2592295408248901,
+ "epoch": 1.4646464646464645,
+ "grad_norm": 1.9422065019607544,
+ "learning_rate": 3.5373737373737378e-06,
+ "loss": 1.2501411437988281,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 11878400.0,
+ "step": 725
+ },
+ {
+ "entropy": 1.3708571195602417,
+ "epoch": 1.4666666666666668,
+ "grad_norm": 2.164499044418335,
+ "learning_rate": 3.5353535353535356e-06,
+ "loss": 1.3901662826538086,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 11894784.0,
+ "step": 726
+ },
+ {
+ "entropy": 1.239045262336731,
+ "epoch": 1.4686868686868686,
+ "grad_norm": 1.9581060409545898,
+ "learning_rate": 3.5333333333333335e-06,
+ "loss": 1.2436164617538452,
+ "mean_token_accuracy": 0.6939423680305481,
+ "num_tokens": 11911168.0,
+ "step": 727
+ },
+ {
+ "entropy": 1.5965995788574219,
+ "epoch": 1.4707070707070706,
+ "grad_norm": 2.343669891357422,
+ "learning_rate": 3.5313131313131314e-06,
+ "loss": 1.5918347835540771,
+ "mean_token_accuracy": 0.6274425983428955,
+ "num_tokens": 11927552.0,
+ "step": 728
+ },
+ {
+ "entropy": 1.1196811199188232,
+ "epoch": 1.4727272727272727,
+ "grad_norm": 2.181840181350708,
+ "learning_rate": 3.5292929292929297e-06,
+ "loss": 1.1142621040344238,
+ "mean_token_accuracy": 0.7192842960357666,
+ "num_tokens": 11943936.0,
+ "step": 729
+ },
+ {
+ "entropy": 1.129361629486084,
+ "epoch": 1.4747474747474747,
+ "grad_norm": 2.065730571746826,
+ "learning_rate": 3.5272727272727276e-06,
+ "loss": 1.143613576889038,
+ "mean_token_accuracy": 0.7145212292671204,
+ "num_tokens": 11960320.0,
+ "step": 730
+ },
+ {
+ "entropy": 1.4940218925476074,
+ "epoch": 1.4767676767676767,
+ "grad_norm": 2.083453893661499,
+ "learning_rate": 3.5252525252525255e-06,
+ "loss": 1.4957321882247925,
+ "mean_token_accuracy": 0.6481436491012573,
+ "num_tokens": 11976704.0,
+ "step": 731
+ },
+ {
+ "entropy": 1.3427786827087402,
+ "epoch": 1.4787878787878788,
+ "grad_norm": 2.0897183418273926,
+ "learning_rate": 3.5232323232323234e-06,
+ "loss": 1.354066014289856,
+ "mean_token_accuracy": 0.6660356521606445,
+ "num_tokens": 11993088.0,
+ "step": 732
+ },
+ {
+ "entropy": 1.3300065994262695,
+ "epoch": 1.4808080808080808,
+ "grad_norm": 2.0537912845611572,
+ "learning_rate": 3.5212121212121213e-06,
+ "loss": 1.3332751989364624,
+ "mean_token_accuracy": 0.6817293763160706,
+ "num_tokens": 12009472.0,
+ "step": 733
+ },
+ {
+ "entropy": 1.0657827854156494,
+ "epoch": 1.4828282828282828,
+ "grad_norm": 1.9099130630493164,
+ "learning_rate": 3.5191919191919196e-06,
+ "loss": 1.067232608795166,
+ "mean_token_accuracy": 0.734245240688324,
+ "num_tokens": 12025856.0,
+ "step": 734
+ },
+ {
+ "entropy": 1.5265862941741943,
+ "epoch": 1.4848484848484849,
+ "grad_norm": 2.100236177444458,
+ "learning_rate": 3.5171717171717175e-06,
+ "loss": 1.5169599056243896,
+ "mean_token_accuracy": 0.6382511258125305,
+ "num_tokens": 12042240.0,
+ "step": 735
+ },
+ {
+ "entropy": 1.4428536891937256,
+ "epoch": 1.486868686868687,
+ "grad_norm": 1.9902187585830688,
+ "learning_rate": 3.5151515151515154e-06,
+ "loss": 1.4398434162139893,
+ "mean_token_accuracy": 0.675500750541687,
+ "num_tokens": 12058624.0,
+ "step": 736
+ },
+ {
+ "entropy": 1.528032660484314,
+ "epoch": 1.488888888888889,
+ "grad_norm": 2.043238878250122,
+ "learning_rate": 3.5131313131313133e-06,
+ "loss": 1.5280101299285889,
+ "mean_token_accuracy": 0.6431363224983215,
+ "num_tokens": 12075008.0,
+ "step": 737
+ },
+ {
+ "entropy": 1.4250329732894897,
+ "epoch": 1.490909090909091,
+ "grad_norm": 1.791640281677246,
+ "learning_rate": 3.511111111111111e-06,
+ "loss": 1.426466464996338,
+ "mean_token_accuracy": 0.6765388250350952,
+ "num_tokens": 12091392.0,
+ "step": 738
+ },
+ {
+ "entropy": 1.1264820098876953,
+ "epoch": 1.492929292929293,
+ "grad_norm": 2.0549607276916504,
+ "learning_rate": 3.509090909090909e-06,
+ "loss": 1.1271553039550781,
+ "mean_token_accuracy": 0.6996213793754578,
+ "num_tokens": 12107776.0,
+ "step": 739
+ },
+ {
+ "entropy": 1.538375735282898,
+ "epoch": 1.494949494949495,
+ "grad_norm": 2.22322940826416,
+ "learning_rate": 3.5070707070707073e-06,
+ "loss": 1.5588887929916382,
+ "mean_token_accuracy": 0.6384953856468201,
+ "num_tokens": 12124160.0,
+ "step": 740
+ },
+ {
+ "entropy": 1.2698255777359009,
+ "epoch": 1.496969696969697,
+ "grad_norm": 2.17710542678833,
+ "learning_rate": 3.5050505050505052e-06,
+ "loss": 1.29567289352417,
+ "mean_token_accuracy": 0.6762945652008057,
+ "num_tokens": 12140544.0,
+ "step": 741
+ },
+ {
+ "entropy": 1.523453950881958,
+ "epoch": 1.4989898989898989,
+ "grad_norm": 2.0350148677825928,
+ "learning_rate": 3.503030303030303e-06,
+ "loss": 1.5341038703918457,
+ "mean_token_accuracy": 0.6367855668067932,
+ "num_tokens": 12156928.0,
+ "step": 742
+ },
+ {
+ "entropy": 1.4250539541244507,
+ "epoch": 1.5010101010101011,
+ "grad_norm": 2.1306707859039307,
+ "learning_rate": 3.501010101010101e-06,
+ "loss": 1.4353611469268799,
+ "mean_token_accuracy": 0.6626160144805908,
+ "num_tokens": 12173312.0,
+ "step": 743
+ },
+ {
+ "entropy": 1.1440296173095703,
+ "epoch": 1.503030303030303,
+ "grad_norm": 2.053969383239746,
+ "learning_rate": 3.498989898989899e-06,
+ "loss": 1.1151821613311768,
+ "mean_token_accuracy": 0.7080483436584473,
+ "num_tokens": 12189696.0,
+ "step": 744
+ },
+ {
+ "entropy": 1.5290073156356812,
+ "epoch": 1.5050505050505052,
+ "grad_norm": 2.0550003051757812,
+ "learning_rate": 3.496969696969697e-06,
+ "loss": 1.5260624885559082,
+ "mean_token_accuracy": 0.6493038535118103,
+ "num_tokens": 12206080.0,
+ "step": 745
+ },
+ {
+ "entropy": 1.1096605062484741,
+ "epoch": 1.507070707070707,
+ "grad_norm": 1.8131766319274902,
+ "learning_rate": 3.494949494949495e-06,
+ "loss": 1.1221846342086792,
+ "mean_token_accuracy": 0.7263678312301636,
+ "num_tokens": 12222464.0,
+ "step": 746
+ },
+ {
+ "entropy": 1.282676339149475,
+ "epoch": 1.509090909090909,
+ "grad_norm": 2.3051960468292236,
+ "learning_rate": 3.492929292929293e-06,
+ "loss": 1.2863187789916992,
+ "mean_token_accuracy": 0.6765388250350952,
+ "num_tokens": 12238848.0,
+ "step": 747
+ },
+ {
+ "entropy": 1.2971303462982178,
+ "epoch": 1.511111111111111,
+ "grad_norm": 2.0721139907836914,
+ "learning_rate": 3.4909090909090913e-06,
+ "loss": 1.3010127544403076,
+ "mean_token_accuracy": 0.6753175258636475,
+ "num_tokens": 12255232.0,
+ "step": 748
+ },
+ {
+ "entropy": 1.3711751699447632,
+ "epoch": 1.513131313131313,
+ "grad_norm": 1.9657210111618042,
+ "learning_rate": 3.4888888888888896e-06,
+ "loss": 1.3703930377960205,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 12271616.0,
+ "step": 749
+ },
+ {
+ "entropy": 1.512154459953308,
+ "epoch": 1.5151515151515151,
+ "grad_norm": 2.214172124862671,
+ "learning_rate": 3.4868686868686875e-06,
+ "loss": 1.5243256092071533,
+ "mean_token_accuracy": 0.6485100388526917,
+ "num_tokens": 12288000.0,
+ "step": 750
+ },
+ {
+ "epoch": 1.5151515151515151,
+ "eval_entropy": 1.4458443743567313,
+ "eval_loss": 1.535510540008545,
+ "eval_mean_token_accuracy": 0.6444821915318889,
+ "eval_num_tokens": 12288000.0,
+ "eval_runtime": 43.8043,
+ "eval_samples_per_second": 22.601,
+ "eval_steps_per_second": 2.831,
+ "step": 750
+ },
+ {
+ "entropy": 1.2052820920944214,
+ "epoch": 1.5171717171717172,
+ "grad_norm": 2.104870319366455,
+ "learning_rate": 3.4848484848484854e-06,
+ "loss": 1.2207554578781128,
+ "mean_token_accuracy": 0.695713222026825,
+ "num_tokens": 12304384.0,
+ "step": 751
+ },
+ {
+ "entropy": 1.732282280921936,
+ "epoch": 1.5191919191919192,
+ "grad_norm": 2.101760149002075,
+ "learning_rate": 3.4828282828282833e-06,
+ "loss": 1.7461241483688354,
+ "mean_token_accuracy": 0.6505251526832581,
+ "num_tokens": 12320768.0,
+ "step": 752
+ },
+ {
+ "entropy": 1.5805878639221191,
+ "epoch": 1.5212121212121212,
+ "grad_norm": 2.139244318008423,
+ "learning_rate": 3.480808080808081e-06,
+ "loss": 1.5813164710998535,
+ "mean_token_accuracy": 0.6281143426895142,
+ "num_tokens": 12337152.0,
+ "step": 753
+ },
+ {
+ "entropy": 1.1882269382476807,
+ "epoch": 1.5232323232323233,
+ "grad_norm": 2.187206745147705,
+ "learning_rate": 3.4787878787878795e-06,
+ "loss": 1.1732902526855469,
+ "mean_token_accuracy": 0.7063385248184204,
+ "num_tokens": 12353536.0,
+ "step": 754
+ },
+ {
+ "entropy": 1.4743424654006958,
+ "epoch": 1.5252525252525253,
+ "grad_norm": 2.12687349319458,
+ "learning_rate": 3.4767676767676774e-06,
+ "loss": 1.4681663513183594,
+ "mean_token_accuracy": 0.6558378338813782,
+ "num_tokens": 12369920.0,
+ "step": 755
+ },
+ {
+ "entropy": 1.5533041954040527,
+ "epoch": 1.5272727272727273,
+ "grad_norm": 2.1306610107421875,
+ "learning_rate": 3.4747474747474752e-06,
+ "loss": 1.5599431991577148,
+ "mean_token_accuracy": 0.6399609446525574,
+ "num_tokens": 12386304.0,
+ "step": 756
+ },
+ {
+ "entropy": 0.8933209180831909,
+ "epoch": 1.5292929292929291,
+ "grad_norm": 2.425602912902832,
+ "learning_rate": 3.472727272727273e-06,
+ "loss": 0.8840203285217285,
+ "mean_token_accuracy": 0.7638006806373596,
+ "num_tokens": 12402688.0,
+ "step": 757
+ },
+ {
+ "entropy": 1.6764189004898071,
+ "epoch": 1.5313131313131314,
+ "grad_norm": 2.0684356689453125,
+ "learning_rate": 3.470707070707071e-06,
+ "loss": 1.6948609352111816,
+ "mean_token_accuracy": 0.6087567210197449,
+ "num_tokens": 12419072.0,
+ "step": 758
+ },
+ {
+ "entropy": 1.1875263452529907,
+ "epoch": 1.5333333333333332,
+ "grad_norm": 2.0625953674316406,
+ "learning_rate": 3.468686868686869e-06,
+ "loss": 1.1840041875839233,
+ "mean_token_accuracy": 0.7067660093307495,
+ "num_tokens": 12435456.0,
+ "step": 759
+ },
+ {
+ "entropy": 1.1589192152023315,
+ "epoch": 1.5353535353535355,
+ "grad_norm": 1.9212846755981445,
+ "learning_rate": 3.4666666666666672e-06,
+ "loss": 1.1537678241729736,
+ "mean_token_accuracy": 0.7107962965965271,
+ "num_tokens": 12451840.0,
+ "step": 760
+ },
+ {
+ "entropy": 0.9687032699584961,
+ "epoch": 1.5373737373737373,
+ "grad_norm": 1.9402192831039429,
+ "learning_rate": 3.464646464646465e-06,
+ "loss": 0.9954442977905273,
+ "mean_token_accuracy": 0.7412676811218262,
+ "num_tokens": 12468224.0,
+ "step": 761
+ },
+ {
+ "entropy": 1.4129019975662231,
+ "epoch": 1.5393939393939395,
+ "grad_norm": 2.0903310775756836,
+ "learning_rate": 3.462626262626263e-06,
+ "loss": 1.4131944179534912,
+ "mean_token_accuracy": 0.6676844358444214,
+ "num_tokens": 12484608.0,
+ "step": 762
+ },
+ {
+ "entropy": 1.5170351266860962,
+ "epoch": 1.5414141414141413,
+ "grad_norm": 2.12807035446167,
+ "learning_rate": 3.460606060606061e-06,
+ "loss": 1.5342246294021606,
+ "mean_token_accuracy": 0.6621885895729065,
+ "num_tokens": 12500992.0,
+ "step": 763
+ },
+ {
+ "entropy": 1.1815718412399292,
+ "epoch": 1.5434343434343434,
+ "grad_norm": 2.2491719722747803,
+ "learning_rate": 3.4585858585858588e-06,
+ "loss": 1.1669261455535889,
+ "mean_token_accuracy": 0.694614052772522,
+ "num_tokens": 12517376.0,
+ "step": 764
+ },
+ {
+ "entropy": 1.547598958015442,
+ "epoch": 1.5454545454545454,
+ "grad_norm": 2.136096954345703,
+ "learning_rate": 3.456565656565657e-06,
+ "loss": 1.5515470504760742,
+ "mean_token_accuracy": 0.648876428604126,
+ "num_tokens": 12533760.0,
+ "step": 765
+ },
+ {
+ "entropy": 0.7156143188476562,
+ "epoch": 1.5474747474747474,
+ "grad_norm": 1.8139498233795166,
+ "learning_rate": 3.454545454545455e-06,
+ "loss": 0.7052675485610962,
+ "mean_token_accuracy": 0.8103932738304138,
+ "num_tokens": 12550144.0,
+ "step": 766
+ },
+ {
+ "entropy": 1.400156855583191,
+ "epoch": 1.5494949494949495,
+ "grad_norm": 2.14924693107605,
+ "learning_rate": 3.452525252525253e-06,
+ "loss": 1.4047740697860718,
+ "mean_token_accuracy": 0.6719589829444885,
+ "num_tokens": 12566528.0,
+ "step": 767
+ },
+ {
+ "entropy": 1.8254657983779907,
+ "epoch": 1.5515151515151515,
+ "grad_norm": 2.1882269382476807,
+ "learning_rate": 3.4505050505050507e-06,
+ "loss": 1.8615440130233765,
+ "mean_token_accuracy": 0.5776746273040771,
+ "num_tokens": 12582912.0,
+ "step": 768
+ },
+ {
+ "entropy": 1.5947710275650024,
+ "epoch": 1.5535353535353535,
+ "grad_norm": 2.3221426010131836,
+ "learning_rate": 3.4484848484848486e-06,
+ "loss": 1.6178712844848633,
+ "mean_token_accuracy": 0.6210918426513672,
+ "num_tokens": 12599296.0,
+ "step": 769
+ },
+ {
+ "entropy": 1.2678714990615845,
+ "epoch": 1.5555555555555556,
+ "grad_norm": 1.970064640045166,
+ "learning_rate": 3.446464646464647e-06,
+ "loss": 1.2646088600158691,
+ "mean_token_accuracy": 0.6990107297897339,
+ "num_tokens": 12615680.0,
+ "step": 770
+ },
+ {
+ "entropy": 1.3723604679107666,
+ "epoch": 1.5575757575757576,
+ "grad_norm": 2.171534776687622,
+ "learning_rate": 3.444444444444445e-06,
+ "loss": 1.3890197277069092,
+ "mean_token_accuracy": 0.6709819436073303,
+ "num_tokens": 12632064.0,
+ "step": 771
+ },
+ {
+ "entropy": 1.0273096561431885,
+ "epoch": 1.5595959595959596,
+ "grad_norm": 2.072798490524292,
+ "learning_rate": 3.4424242424242427e-06,
+ "loss": 1.029193639755249,
+ "mean_token_accuracy": 0.7348558902740479,
+ "num_tokens": 12648448.0,
+ "step": 772
+ },
+ {
+ "entropy": 1.4004037380218506,
+ "epoch": 1.5616161616161617,
+ "grad_norm": 2.111480474472046,
+ "learning_rate": 3.4404040404040406e-06,
+ "loss": 1.4213340282440186,
+ "mean_token_accuracy": 0.660906195640564,
+ "num_tokens": 12664832.0,
+ "step": 773
+ },
+ {
+ "entropy": 1.533424735069275,
+ "epoch": 1.5636363636363635,
+ "grad_norm": 2.0949435234069824,
+ "learning_rate": 3.4383838383838385e-06,
+ "loss": 1.5259253978729248,
+ "mean_token_accuracy": 0.6544333100318909,
+ "num_tokens": 12681216.0,
+ "step": 774
+ },
+ {
+ "entropy": 1.5620275735855103,
+ "epoch": 1.5656565656565657,
+ "grad_norm": 2.339731454849243,
+ "learning_rate": 3.4363636363636364e-06,
+ "loss": 1.5596071481704712,
+ "mean_token_accuracy": 0.6290302872657776,
+ "num_tokens": 12697600.0,
+ "step": 775
+ },
+ {
+ "entropy": 1.3272082805633545,
+ "epoch": 1.5676767676767676,
+ "grad_norm": 2.0871188640594482,
+ "learning_rate": 3.4343434343434347e-06,
+ "loss": 1.3413164615631104,
+ "mean_token_accuracy": 0.6809965968132019,
+ "num_tokens": 12713984.0,
+ "step": 776
+ },
+ {
+ "entropy": 1.202813982963562,
+ "epoch": 1.5696969696969698,
+ "grad_norm": 2.0538578033447266,
+ "learning_rate": 3.4323232323232326e-06,
+ "loss": 1.1947424411773682,
+ "mean_token_accuracy": 0.6969956159591675,
+ "num_tokens": 12730368.0,
+ "step": 777
+ },
+ {
+ "entropy": 1.3332773447036743,
+ "epoch": 1.5717171717171716,
+ "grad_norm": 1.9941202402114868,
+ "learning_rate": 3.4303030303030305e-06,
+ "loss": 1.3345956802368164,
+ "mean_token_accuracy": 0.6761724352836609,
+ "num_tokens": 12746752.0,
+ "step": 778
+ },
+ {
+ "entropy": 1.1724364757537842,
+ "epoch": 1.5737373737373739,
+ "grad_norm": 2.213365316390991,
+ "learning_rate": 3.4282828282828284e-06,
+ "loss": 1.1479787826538086,
+ "mean_token_accuracy": 0.7132999300956726,
+ "num_tokens": 12763136.0,
+ "step": 779
+ },
+ {
+ "entropy": 1.4718358516693115,
+ "epoch": 1.5757575757575757,
+ "grad_norm": 1.9743510484695435,
+ "learning_rate": 3.4262626262626262e-06,
+ "loss": 1.4844720363616943,
+ "mean_token_accuracy": 0.656448483467102,
+ "num_tokens": 12779520.0,
+ "step": 780
+ },
+ {
+ "entropy": 1.362882375717163,
+ "epoch": 1.5777777777777777,
+ "grad_norm": 2.370483875274658,
+ "learning_rate": 3.4242424242424246e-06,
+ "loss": 1.350801706314087,
+ "mean_token_accuracy": 0.6707376837730408,
+ "num_tokens": 12795904.0,
+ "step": 781
+ },
+ {
+ "entropy": 1.8302308320999146,
+ "epoch": 1.5797979797979798,
+ "grad_norm": 2.19045090675354,
+ "learning_rate": 3.4222222222222224e-06,
+ "loss": 1.8371320962905884,
+ "mean_token_accuracy": 0.5929408669471741,
+ "num_tokens": 12812288.0,
+ "step": 782
+ },
+ {
+ "entropy": 1.3435529470443726,
+ "epoch": 1.5818181818181818,
+ "grad_norm": 2.1254351139068604,
+ "learning_rate": 3.4202020202020203e-06,
+ "loss": 1.3621928691864014,
+ "mean_token_accuracy": 0.6867367029190063,
+ "num_tokens": 12828672.0,
+ "step": 783
+ },
+ {
+ "entropy": 1.8402602672576904,
+ "epoch": 1.5838383838383838,
+ "grad_norm": 2.123666524887085,
+ "learning_rate": 3.4181818181818182e-06,
+ "loss": 1.8564848899841309,
+ "mean_token_accuracy": 0.5871397256851196,
+ "num_tokens": 12845056.0,
+ "step": 784
+ },
+ {
+ "entropy": 1.441917896270752,
+ "epoch": 1.5858585858585859,
+ "grad_norm": 2.3286895751953125,
+ "learning_rate": 3.416161616161616e-06,
+ "loss": 1.4724184274673462,
+ "mean_token_accuracy": 0.6438080072402954,
+ "num_tokens": 12861440.0,
+ "step": 785
+ },
+ {
+ "entropy": 1.3071452379226685,
+ "epoch": 1.587878787878788,
+ "grad_norm": 2.149143934249878,
+ "learning_rate": 3.414141414141414e-06,
+ "loss": 1.331390142440796,
+ "mean_token_accuracy": 0.679347813129425,
+ "num_tokens": 12877824.0,
+ "step": 786
+ },
+ {
+ "entropy": 1.3547145128250122,
+ "epoch": 1.58989898989899,
+ "grad_norm": 2.2531180381774902,
+ "learning_rate": 3.4121212121212123e-06,
+ "loss": 1.361851453781128,
+ "mean_token_accuracy": 0.6767830848693848,
+ "num_tokens": 12894208.0,
+ "step": 787
+ },
+ {
+ "entropy": 0.9811291098594666,
+ "epoch": 1.591919191919192,
+ "grad_norm": 2.1053760051727295,
+ "learning_rate": 3.41010101010101e-06,
+ "loss": 0.9885507822036743,
+ "mean_token_accuracy": 0.7480459213256836,
+ "num_tokens": 12910592.0,
+ "step": 788
+ },
+ {
+ "entropy": 1.4940402507781982,
+ "epoch": 1.593939393939394,
+ "grad_norm": 2.240074634552002,
+ "learning_rate": 3.408080808080808e-06,
+ "loss": 1.5014076232910156,
+ "mean_token_accuracy": 0.6441743969917297,
+ "num_tokens": 12926976.0,
+ "step": 789
+ },
+ {
+ "entropy": 1.8134219646453857,
+ "epoch": 1.595959595959596,
+ "grad_norm": 2.040239095687866,
+ "learning_rate": 3.406060606060606e-06,
+ "loss": 1.8437519073486328,
+ "mean_token_accuracy": 0.5904372334480286,
+ "num_tokens": 12943360.0,
+ "step": 790
+ },
+ {
+ "entropy": 1.7233681678771973,
+ "epoch": 1.5979797979797978,
+ "grad_norm": 2.381786823272705,
+ "learning_rate": 3.4040404040404047e-06,
+ "loss": 1.7328217029571533,
+ "mean_token_accuracy": 0.6004518866539001,
+ "num_tokens": 12959744.0,
+ "step": 791
+ },
+ {
+ "entropy": 1.3966271877288818,
+ "epoch": 1.6,
+ "grad_norm": 2.17006778717041,
+ "learning_rate": 3.4020202020202026e-06,
+ "loss": 1.4065337181091309,
+ "mean_token_accuracy": 0.6629824042320251,
+ "num_tokens": 12976128.0,
+ "step": 792
+ },
+ {
+ "entropy": 1.5002557039260864,
+ "epoch": 1.602020202020202,
+ "grad_norm": 2.558037281036377,
+ "learning_rate": 3.4000000000000005e-06,
+ "loss": 1.4841307401657104,
+ "mean_token_accuracy": 0.647838294506073,
+ "num_tokens": 12992512.0,
+ "step": 793
+ },
+ {
+ "entropy": 1.7432687282562256,
+ "epoch": 1.6040404040404042,
+ "grad_norm": 2.134734630584717,
+ "learning_rate": 3.3979797979797984e-06,
+ "loss": 1.7539207935333252,
+ "mean_token_accuracy": 0.6028333902359009,
+ "num_tokens": 13008896.0,
+ "step": 794
+ },
+ {
+ "entropy": 1.4490517377853394,
+ "epoch": 1.606060606060606,
+ "grad_norm": 2.1590232849121094,
+ "learning_rate": 3.3959595959595963e-06,
+ "loss": 1.468411922454834,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 13025280.0,
+ "step": 795
+ },
+ {
+ "entropy": 1.3823497295379639,
+ "epoch": 1.6080808080808082,
+ "grad_norm": 2.1508285999298096,
+ "learning_rate": 3.3939393939393946e-06,
+ "loss": 1.4011330604553223,
+ "mean_token_accuracy": 0.6530898809432983,
+ "num_tokens": 13041664.0,
+ "step": 796
+ },
+ {
+ "entropy": 1.6982436180114746,
+ "epoch": 1.61010101010101,
+ "grad_norm": 2.077131986618042,
+ "learning_rate": 3.3919191919191925e-06,
+ "loss": 1.727889060974121,
+ "mean_token_accuracy": 0.6232290863990784,
+ "num_tokens": 13058048.0,
+ "step": 797
+ },
+ {
+ "entropy": 1.7268915176391602,
+ "epoch": 1.612121212121212,
+ "grad_norm": 2.0703542232513428,
+ "learning_rate": 3.3898989898989903e-06,
+ "loss": 1.7333730459213257,
+ "mean_token_accuracy": 0.6110160946846008,
+ "num_tokens": 13074432.0,
+ "step": 798
+ },
+ {
+ "entropy": 1.6253595352172852,
+ "epoch": 1.614141414141414,
+ "grad_norm": 2.241154432296753,
+ "learning_rate": 3.3878787878787882e-06,
+ "loss": 1.6275582313537598,
+ "mean_token_accuracy": 0.6198094487190247,
+ "num_tokens": 13090816.0,
+ "step": 799
+ },
+ {
+ "entropy": 1.8784692287445068,
+ "epoch": 1.6161616161616161,
+ "grad_norm": 2.505871057510376,
+ "learning_rate": 3.385858585858586e-06,
+ "loss": 1.8784008026123047,
+ "mean_token_accuracy": 0.5944064259529114,
+ "num_tokens": 13107200.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.6161616161616161,
+ "eval_entropy": 1.4455043437980837,
+ "eval_loss": 1.5330992937088013,
+ "eval_mean_token_accuracy": 0.6448845310557273,
+ "eval_num_tokens": 13107200.0,
+ "eval_runtime": 43.766,
+ "eval_samples_per_second": 22.62,
+ "eval_steps_per_second": 2.833,
+ "step": 800
+ },
+ {
+ "entropy": 1.921440601348877,
+ "epoch": 1.6181818181818182,
+ "grad_norm": 2.1760783195495605,
+ "learning_rate": 3.3838383838383844e-06,
+ "loss": 1.9410110712051392,
+ "mean_token_accuracy": 0.5776746273040771,
+ "num_tokens": 13123584.0,
+ "step": 801
+ },
+ {
+ "entropy": 1.4233160018920898,
+ "epoch": 1.6202020202020202,
+ "grad_norm": 2.2687666416168213,
+ "learning_rate": 3.3818181818181823e-06,
+ "loss": 1.4465446472167969,
+ "mean_token_accuracy": 0.6488153338432312,
+ "num_tokens": 13139968.0,
+ "step": 802
+ },
+ {
+ "entropy": 1.697847843170166,
+ "epoch": 1.6222222222222222,
+ "grad_norm": 2.0649187564849854,
+ "learning_rate": 3.37979797979798e-06,
+ "loss": 1.7235385179519653,
+ "mean_token_accuracy": 0.6196262836456299,
+ "num_tokens": 13156352.0,
+ "step": 803
+ },
+ {
+ "entropy": 1.2027701139450073,
+ "epoch": 1.6242424242424243,
+ "grad_norm": 2.0115890502929688,
+ "learning_rate": 3.377777777777778e-06,
+ "loss": 1.1890676021575928,
+ "mean_token_accuracy": 0.6928431987762451,
+ "num_tokens": 13172736.0,
+ "step": 804
+ },
+ {
+ "entropy": 1.4847105741500854,
+ "epoch": 1.6262626262626263,
+ "grad_norm": 2.145098924636841,
+ "learning_rate": 3.375757575757576e-06,
+ "loss": 1.4817116260528564,
+ "mean_token_accuracy": 0.6415486335754395,
+ "num_tokens": 13189120.0,
+ "step": 805
+ },
+ {
+ "entropy": 1.3548893928527832,
+ "epoch": 1.6282828282828283,
+ "grad_norm": 2.3037521839141846,
+ "learning_rate": 3.3737373737373743e-06,
+ "loss": 1.3433952331542969,
+ "mean_token_accuracy": 0.6681729555130005,
+ "num_tokens": 13205504.0,
+ "step": 806
+ },
+ {
+ "entropy": 1.375793218612671,
+ "epoch": 1.6303030303030304,
+ "grad_norm": 2.0814852714538574,
+ "learning_rate": 3.371717171717172e-06,
+ "loss": 1.3506405353546143,
+ "mean_token_accuracy": 0.6634098887443542,
+ "num_tokens": 13221888.0,
+ "step": 807
+ },
+ {
+ "entropy": 1.1417323350906372,
+ "epoch": 1.6323232323232322,
+ "grad_norm": 2.0166866779327393,
+ "learning_rate": 3.36969696969697e-06,
+ "loss": 1.1731860637664795,
+ "mean_token_accuracy": 0.7123839855194092,
+ "num_tokens": 13238272.0,
+ "step": 808
+ },
+ {
+ "entropy": 1.3159022331237793,
+ "epoch": 1.6343434343434344,
+ "grad_norm": 1.9626281261444092,
+ "learning_rate": 3.367676767676768e-06,
+ "loss": 1.3286499977111816,
+ "mean_token_accuracy": 0.675561785697937,
+ "num_tokens": 13254656.0,
+ "step": 809
+ },
+ {
+ "entropy": 1.325775384902954,
+ "epoch": 1.6363636363636362,
+ "grad_norm": 2.1239242553710938,
+ "learning_rate": 3.365656565656566e-06,
+ "loss": 1.345514178276062,
+ "mean_token_accuracy": 0.6780043840408325,
+ "num_tokens": 13271040.0,
+ "step": 810
+ },
+ {
+ "entropy": 1.8307870626449585,
+ "epoch": 1.6383838383838385,
+ "grad_norm": 2.208296298980713,
+ "learning_rate": 3.3636363636363637e-06,
+ "loss": 1.8402234315872192,
+ "mean_token_accuracy": 0.5958719849586487,
+ "num_tokens": 13287424.0,
+ "step": 811
+ },
+ {
+ "entropy": 1.2596150636672974,
+ "epoch": 1.6404040404040403,
+ "grad_norm": 2.0936427116394043,
+ "learning_rate": 3.361616161616162e-06,
+ "loss": 1.2552804946899414,
+ "mean_token_accuracy": 0.6874083876609802,
+ "num_tokens": 13303808.0,
+ "step": 812
+ },
+ {
+ "entropy": 1.2575111389160156,
+ "epoch": 1.6424242424242426,
+ "grad_norm": 2.0232772827148438,
+ "learning_rate": 3.35959595959596e-06,
+ "loss": 1.2805989980697632,
+ "mean_token_accuracy": 0.6916829347610474,
+ "num_tokens": 13320192.0,
+ "step": 813
+ },
+ {
+ "entropy": 1.0270155668258667,
+ "epoch": 1.6444444444444444,
+ "grad_norm": 1.9090715646743774,
+ "learning_rate": 3.357575757575758e-06,
+ "loss": 1.0277824401855469,
+ "mean_token_accuracy": 0.7379091382026672,
+ "num_tokens": 13336576.0,
+ "step": 814
+ },
+ {
+ "entropy": 1.2992243766784668,
+ "epoch": 1.6464646464646466,
+ "grad_norm": 2.1718814373016357,
+ "learning_rate": 3.3555555555555557e-06,
+ "loss": 1.3278638124465942,
+ "mean_token_accuracy": 0.6764777898788452,
+ "num_tokens": 13352960.0,
+ "step": 815
+ },
+ {
+ "entropy": 1.5365362167358398,
+ "epoch": 1.6484848484848484,
+ "grad_norm": 2.0298495292663574,
+ "learning_rate": 3.3535353535353536e-06,
+ "loss": 1.5257508754730225,
+ "mean_token_accuracy": 0.6511358022689819,
+ "num_tokens": 13369344.0,
+ "step": 816
+ },
+ {
+ "entropy": 1.4384456872940063,
+ "epoch": 1.6505050505050505,
+ "grad_norm": 2.375277042388916,
+ "learning_rate": 3.351515151515152e-06,
+ "loss": 1.4287049770355225,
+ "mean_token_accuracy": 0.645639955997467,
+ "num_tokens": 13385728.0,
+ "step": 817
+ },
+ {
+ "entropy": 1.7104265689849854,
+ "epoch": 1.6525252525252525,
+ "grad_norm": 2.052535057067871,
+ "learning_rate": 3.34949494949495e-06,
+ "loss": 1.6971676349639893,
+ "mean_token_accuracy": 0.6159623861312866,
+ "num_tokens": 13402112.0,
+ "step": 818
+ },
+ {
+ "entropy": 1.5908539295196533,
+ "epoch": 1.6545454545454545,
+ "grad_norm": 2.047088861465454,
+ "learning_rate": 3.3474747474747477e-06,
+ "loss": 1.5640246868133545,
+ "mean_token_accuracy": 0.640754759311676,
+ "num_tokens": 13418496.0,
+ "step": 819
+ },
+ {
+ "entropy": 1.3660207986831665,
+ "epoch": 1.6565656565656566,
+ "grad_norm": 2.2711079120635986,
+ "learning_rate": 3.3454545454545456e-06,
+ "loss": 1.3601036071777344,
+ "mean_token_accuracy": 0.6577919125556946,
+ "num_tokens": 13434880.0,
+ "step": 820
+ },
+ {
+ "entropy": 1.5897634029388428,
+ "epoch": 1.6585858585858586,
+ "grad_norm": 2.0869712829589844,
+ "learning_rate": 3.3434343434343435e-06,
+ "loss": 1.5801420211791992,
+ "mean_token_accuracy": 0.6312897205352783,
+ "num_tokens": 13451264.0,
+ "step": 821
+ },
+ {
+ "entropy": 1.428406834602356,
+ "epoch": 1.6606060606060606,
+ "grad_norm": 2.049370765686035,
+ "learning_rate": 3.3414141414141413e-06,
+ "loss": 1.4145596027374268,
+ "mean_token_accuracy": 0.6649975776672363,
+ "num_tokens": 13467648.0,
+ "step": 822
+ },
+ {
+ "entropy": 1.5026675462722778,
+ "epoch": 1.6626262626262627,
+ "grad_norm": 2.157031297683716,
+ "learning_rate": 3.3393939393939397e-06,
+ "loss": 1.4902830123901367,
+ "mean_token_accuracy": 0.6524181962013245,
+ "num_tokens": 13484032.0,
+ "step": 823
+ },
+ {
+ "entropy": 1.4907052516937256,
+ "epoch": 1.6646464646464647,
+ "grad_norm": 2.1476478576660156,
+ "learning_rate": 3.3373737373737375e-06,
+ "loss": 1.5102436542510986,
+ "mean_token_accuracy": 0.6485100388526917,
+ "num_tokens": 13500416.0,
+ "step": 824
+ },
+ {
+ "entropy": 1.4277782440185547,
+ "epoch": 1.6666666666666665,
+ "grad_norm": 2.2880661487579346,
+ "learning_rate": 3.3353535353535354e-06,
+ "loss": 1.4358019828796387,
+ "mean_token_accuracy": 0.6522960662841797,
+ "num_tokens": 13516800.0,
+ "step": 825
+ },
+ {
+ "entropy": 1.5560128688812256,
+ "epoch": 1.6686868686868688,
+ "grad_norm": 2.048403024673462,
+ "learning_rate": 3.3333333333333333e-06,
+ "loss": 1.5472501516342163,
+ "mean_token_accuracy": 0.6488153338432312,
+ "num_tokens": 13533184.0,
+ "step": 826
+ },
+ {
+ "entropy": 1.665900707244873,
+ "epoch": 1.6707070707070706,
+ "grad_norm": 2.0828492641448975,
+ "learning_rate": 3.331313131313131e-06,
+ "loss": 1.6905372142791748,
+ "mean_token_accuracy": 0.629885196685791,
+ "num_tokens": 13549568.0,
+ "step": 827
+ },
+ {
+ "entropy": 1.3484426736831665,
+ "epoch": 1.6727272727272728,
+ "grad_norm": 2.1873531341552734,
+ "learning_rate": 3.3292929292929295e-06,
+ "loss": 1.3510258197784424,
+ "mean_token_accuracy": 0.6721421480178833,
+ "num_tokens": 13565952.0,
+ "step": 828
+ },
+ {
+ "entropy": 1.7577860355377197,
+ "epoch": 1.6747474747474747,
+ "grad_norm": 2.0467135906219482,
+ "learning_rate": 3.3272727272727274e-06,
+ "loss": 1.7791969776153564,
+ "mean_token_accuracy": 0.6028944849967957,
+ "num_tokens": 13582336.0,
+ "step": 829
+ },
+ {
+ "entropy": 1.4549124240875244,
+ "epoch": 1.676767676767677,
+ "grad_norm": 2.2004988193511963,
+ "learning_rate": 3.3252525252525253e-06,
+ "loss": 1.4512457847595215,
+ "mean_token_accuracy": 0.6521128416061401,
+ "num_tokens": 13598720.0,
+ "step": 830
+ },
+ {
+ "entropy": 1.2226758003234863,
+ "epoch": 1.6787878787878787,
+ "grad_norm": 2.0866682529449463,
+ "learning_rate": 3.323232323232323e-06,
+ "loss": 1.226635456085205,
+ "mean_token_accuracy": 0.6969345211982727,
+ "num_tokens": 13615104.0,
+ "step": 831
+ },
+ {
+ "entropy": 0.9826563000679016,
+ "epoch": 1.680808080808081,
+ "grad_norm": 1.9865771532058716,
+ "learning_rate": 3.321212121212121e-06,
+ "loss": 1.009648323059082,
+ "mean_token_accuracy": 0.7507327795028687,
+ "num_tokens": 13631488.0,
+ "step": 832
+ },
+ {
+ "entropy": 1.620038390159607,
+ "epoch": 1.6828282828282828,
+ "grad_norm": 2.1745760440826416,
+ "learning_rate": 3.3191919191919194e-06,
+ "loss": 1.615234136581421,
+ "mean_token_accuracy": 0.6305569410324097,
+ "num_tokens": 13647872.0,
+ "step": 833
+ },
+ {
+ "entropy": 1.4803876876831055,
+ "epoch": 1.6848484848484848,
+ "grad_norm": 2.328029155731201,
+ "learning_rate": 3.3171717171717177e-06,
+ "loss": 1.509049892425537,
+ "mean_token_accuracy": 0.6353810429573059,
+ "num_tokens": 13664256.0,
+ "step": 834
+ },
+ {
+ "entropy": 1.2290453910827637,
+ "epoch": 1.6868686868686869,
+ "grad_norm": 2.1777281761169434,
+ "learning_rate": 3.3151515151515156e-06,
+ "loss": 1.222726583480835,
+ "mean_token_accuracy": 0.6842330098152161,
+ "num_tokens": 13680640.0,
+ "step": 835
+ },
+ {
+ "entropy": 1.1965430974960327,
+ "epoch": 1.6888888888888889,
+ "grad_norm": 2.211397886276245,
+ "learning_rate": 3.3131313131313135e-06,
+ "loss": 1.2027852535247803,
+ "mean_token_accuracy": 0.7028578519821167,
+ "num_tokens": 13697024.0,
+ "step": 836
+ },
+ {
+ "entropy": 1.5326080322265625,
+ "epoch": 1.690909090909091,
+ "grad_norm": 2.8396589756011963,
+ "learning_rate": 3.3111111111111118e-06,
+ "loss": 1.5819613933563232,
+ "mean_token_accuracy": 0.625,
+ "num_tokens": 13713408.0,
+ "step": 837
+ },
+ {
+ "entropy": 1.2514865398406982,
+ "epoch": 1.692929292929293,
+ "grad_norm": 1.923771858215332,
+ "learning_rate": 3.3090909090909097e-06,
+ "loss": 1.2518126964569092,
+ "mean_token_accuracy": 0.6955300569534302,
+ "num_tokens": 13729792.0,
+ "step": 838
+ },
+ {
+ "entropy": 1.3717304468154907,
+ "epoch": 1.694949494949495,
+ "grad_norm": 2.0393056869506836,
+ "learning_rate": 3.3070707070707076e-06,
+ "loss": 1.400814175605774,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 13746176.0,
+ "step": 839
+ },
+ {
+ "entropy": 1.2871394157409668,
+ "epoch": 1.696969696969697,
+ "grad_norm": 2.114823579788208,
+ "learning_rate": 3.3050505050505054e-06,
+ "loss": 1.302154541015625,
+ "mean_token_accuracy": 0.6790425181388855,
+ "num_tokens": 13762560.0,
+ "step": 840
+ },
+ {
+ "entropy": 1.518404483795166,
+ "epoch": 1.698989898989899,
+ "grad_norm": 2.186727523803711,
+ "learning_rate": 3.3030303030303033e-06,
+ "loss": 1.5067068338394165,
+ "mean_token_accuracy": 0.638006865978241,
+ "num_tokens": 13778944.0,
+ "step": 841
+ },
+ {
+ "entropy": 1.5698254108428955,
+ "epoch": 1.7010101010101009,
+ "grad_norm": 2.159721851348877,
+ "learning_rate": 3.3010101010101016e-06,
+ "loss": 1.5568101406097412,
+ "mean_token_accuracy": 0.6398998498916626,
+ "num_tokens": 13795328.0,
+ "step": 842
+ },
+ {
+ "entropy": 1.5159670114517212,
+ "epoch": 1.7030303030303031,
+ "grad_norm": 2.0655386447906494,
+ "learning_rate": 3.2989898989898995e-06,
+ "loss": 1.5152846574783325,
+ "mean_token_accuracy": 0.6441133618354797,
+ "num_tokens": 13811712.0,
+ "step": 843
+ },
+ {
+ "entropy": 1.231048822402954,
+ "epoch": 1.705050505050505,
+ "grad_norm": 1.99764084815979,
+ "learning_rate": 3.2969696969696974e-06,
+ "loss": 1.2419885396957397,
+ "mean_token_accuracy": 0.6936370134353638,
+ "num_tokens": 13828096.0,
+ "step": 844
+ },
+ {
+ "entropy": 1.1431403160095215,
+ "epoch": 1.7070707070707072,
+ "grad_norm": 2.0046544075012207,
+ "learning_rate": 3.2949494949494953e-06,
+ "loss": 1.147315502166748,
+ "mean_token_accuracy": 0.7155593633651733,
+ "num_tokens": 13844480.0,
+ "step": 845
+ },
+ {
+ "entropy": 1.903164267539978,
+ "epoch": 1.709090909090909,
+ "grad_norm": 2.068286418914795,
+ "learning_rate": 3.292929292929293e-06,
+ "loss": 1.9086098670959473,
+ "mean_token_accuracy": 0.5785295367240906,
+ "num_tokens": 13860864.0,
+ "step": 846
+ },
+ {
+ "entropy": 1.028931736946106,
+ "epoch": 1.7111111111111112,
+ "grad_norm": 2.008197546005249,
+ "learning_rate": 3.290909090909091e-06,
+ "loss": 1.0251559019088745,
+ "mean_token_accuracy": 0.7308866381645203,
+ "num_tokens": 13877248.0,
+ "step": 847
+ },
+ {
+ "entropy": 1.8438282012939453,
+ "epoch": 1.713131313131313,
+ "grad_norm": 2.180811882019043,
+ "learning_rate": 3.2888888888888894e-06,
+ "loss": 1.8572561740875244,
+ "mean_token_accuracy": 0.5788959264755249,
+ "num_tokens": 13893632.0,
+ "step": 848
+ },
+ {
+ "entropy": 1.437190294265747,
+ "epoch": 1.7151515151515153,
+ "grad_norm": 2.1013762950897217,
+ "learning_rate": 3.2868686868686873e-06,
+ "loss": 1.4337413311004639,
+ "mean_token_accuracy": 0.6489985585212708,
+ "num_tokens": 13910016.0,
+ "step": 849
+ },
+ {
+ "entropy": 1.482985496520996,
+ "epoch": 1.7171717171717171,
+ "grad_norm": 2.290910243988037,
+ "learning_rate": 3.284848484848485e-06,
+ "loss": 1.4959741830825806,
+ "mean_token_accuracy": 0.6447850465774536,
+ "num_tokens": 13926400.0,
+ "step": 850
+ },
+ {
+ "epoch": 1.7171717171717171,
+ "eval_entropy": 1.447427170411233,
+ "eval_loss": 1.5309957265853882,
+ "eval_mean_token_accuracy": 0.6452888370521607,
+ "eval_num_tokens": 13926400.0,
+ "eval_runtime": 43.7619,
+ "eval_samples_per_second": 22.622,
+ "eval_steps_per_second": 2.834,
+ "step": 850
+ },
+ {
+ "entropy": 1.4470106363296509,
+ "epoch": 1.7191919191919192,
+ "grad_norm": 2.2015624046325684,
+ "learning_rate": 3.282828282828283e-06,
+ "loss": 1.462576150894165,
+ "mean_token_accuracy": 0.643991231918335,
+ "num_tokens": 13942784.0,
+ "step": 851
+ },
+ {
+ "entropy": 1.4063832759857178,
+ "epoch": 1.7212121212121212,
+ "grad_norm": 2.1743109226226807,
+ "learning_rate": 3.280808080808081e-06,
+ "loss": 1.402491569519043,
+ "mean_token_accuracy": 0.6533952355384827,
+ "num_tokens": 13959168.0,
+ "step": 852
+ },
+ {
+ "entropy": 1.3735251426696777,
+ "epoch": 1.7232323232323232,
+ "grad_norm": 2.1350960731506348,
+ "learning_rate": 3.2787878787878793e-06,
+ "loss": 1.383405327796936,
+ "mean_token_accuracy": 0.6767830848693848,
+ "num_tokens": 13975552.0,
+ "step": 853
+ },
+ {
+ "entropy": 1.359702229499817,
+ "epoch": 1.7252525252525253,
+ "grad_norm": 2.1547393798828125,
+ "learning_rate": 3.276767676767677e-06,
+ "loss": 1.3454554080963135,
+ "mean_token_accuracy": 0.6712262034416199,
+ "num_tokens": 13991936.0,
+ "step": 854
+ },
+ {
+ "entropy": 1.0641778707504272,
+ "epoch": 1.7272727272727273,
+ "grad_norm": 2.0301826000213623,
+ "learning_rate": 3.274747474747475e-06,
+ "loss": 1.0626115798950195,
+ "mean_token_accuracy": 0.7188568711280823,
+ "num_tokens": 14008320.0,
+ "step": 855
+ },
+ {
+ "entropy": 1.598792552947998,
+ "epoch": 1.7292929292929293,
+ "grad_norm": 2.3324217796325684,
+ "learning_rate": 3.272727272727273e-06,
+ "loss": 1.6028941869735718,
+ "mean_token_accuracy": 0.6462506055831909,
+ "num_tokens": 14024704.0,
+ "step": 856
+ },
+ {
+ "entropy": 1.6304137706756592,
+ "epoch": 1.7313131313131314,
+ "grad_norm": 1.9968358278274536,
+ "learning_rate": 3.270707070707071e-06,
+ "loss": 1.6449415683746338,
+ "mean_token_accuracy": 0.6322056651115417,
+ "num_tokens": 14041088.0,
+ "step": 857
+ },
+ {
+ "entropy": 1.3219174146652222,
+ "epoch": 1.7333333333333334,
+ "grad_norm": 2.059927225112915,
+ "learning_rate": 3.2686868686868687e-06,
+ "loss": 1.3487168550491333,
+ "mean_token_accuracy": 0.6769052147865295,
+ "num_tokens": 14057472.0,
+ "step": 858
+ },
+ {
+ "entropy": 1.4645651578903198,
+ "epoch": 1.7353535353535352,
+ "grad_norm": 2.068962812423706,
+ "learning_rate": 3.266666666666667e-06,
+ "loss": 1.4480202198028564,
+ "mean_token_accuracy": 0.6521128416061401,
+ "num_tokens": 14073856.0,
+ "step": 859
+ },
+ {
+ "entropy": 1.5005300045013428,
+ "epoch": 1.7373737373737375,
+ "grad_norm": 2.228736162185669,
+ "learning_rate": 3.264646464646465e-06,
+ "loss": 1.5110201835632324,
+ "mean_token_accuracy": 0.6482657790184021,
+ "num_tokens": 14090240.0,
+ "step": 860
+ },
+ {
+ "entropy": 1.1641852855682373,
+ "epoch": 1.7393939393939393,
+ "grad_norm": 2.0611488819122314,
+ "learning_rate": 3.262626262626263e-06,
+ "loss": 1.1905086040496826,
+ "mean_token_accuracy": 0.7104909420013428,
+ "num_tokens": 14106624.0,
+ "step": 861
+ },
+ {
+ "entropy": 1.4315950870513916,
+ "epoch": 1.7414141414141415,
+ "grad_norm": 1.9914237260818481,
+ "learning_rate": 3.2606060606060607e-06,
+ "loss": 1.467012882232666,
+ "mean_token_accuracy": 0.657608687877655,
+ "num_tokens": 14123008.0,
+ "step": 862
+ },
+ {
+ "entropy": 1.5196973085403442,
+ "epoch": 1.7434343434343433,
+ "grad_norm": 2.3258447647094727,
+ "learning_rate": 3.2585858585858586e-06,
+ "loss": 1.5382301807403564,
+ "mean_token_accuracy": 0.6370298266410828,
+ "num_tokens": 14139392.0,
+ "step": 863
+ },
+ {
+ "entropy": 1.5098228454589844,
+ "epoch": 1.7454545454545456,
+ "grad_norm": 2.146327495574951,
+ "learning_rate": 3.256565656565657e-06,
+ "loss": 1.540649652481079,
+ "mean_token_accuracy": 0.6439301371574402,
+ "num_tokens": 14155776.0,
+ "step": 864
+ },
+ {
+ "entropy": 1.128011703491211,
+ "epoch": 1.7474747474747474,
+ "grad_norm": 1.967443823814392,
+ "learning_rate": 3.2545454545454548e-06,
+ "loss": 1.1707985401153564,
+ "mean_token_accuracy": 0.7298485636711121,
+ "num_tokens": 14172160.0,
+ "step": 865
+ },
+ {
+ "entropy": 1.9117931127548218,
+ "epoch": 1.7494949494949497,
+ "grad_norm": 2.097781181335449,
+ "learning_rate": 3.2525252525252527e-06,
+ "loss": 1.9291374683380127,
+ "mean_token_accuracy": 0.580483615398407,
+ "num_tokens": 14188544.0,
+ "step": 866
+ },
+ {
+ "entropy": 1.9053187370300293,
+ "epoch": 1.7515151515151515,
+ "grad_norm": 1.9865039587020874,
+ "learning_rate": 3.2505050505050505e-06,
+ "loss": 1.932790756225586,
+ "mean_token_accuracy": 0.5770639777183533,
+ "num_tokens": 14204928.0,
+ "step": 867
+ },
+ {
+ "entropy": 1.2647870779037476,
+ "epoch": 1.7535353535353535,
+ "grad_norm": 2.099891185760498,
+ "learning_rate": 3.2484848484848484e-06,
+ "loss": 1.281562328338623,
+ "mean_token_accuracy": 0.6938812732696533,
+ "num_tokens": 14221312.0,
+ "step": 868
+ },
+ {
+ "entropy": 1.5446428060531616,
+ "epoch": 1.7555555555555555,
+ "grad_norm": 1.9044189453125,
+ "learning_rate": 3.2464646464646467e-06,
+ "loss": 1.5440425872802734,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 14237696.0,
+ "step": 869
+ },
+ {
+ "entropy": 1.179898977279663,
+ "epoch": 1.7575757575757576,
+ "grad_norm": 2.0257933139801025,
+ "learning_rate": 3.2444444444444446e-06,
+ "loss": 1.1607933044433594,
+ "mean_token_accuracy": 0.7053614854812622,
+ "num_tokens": 14254080.0,
+ "step": 870
+ },
+ {
+ "entropy": 1.0462855100631714,
+ "epoch": 1.7595959595959596,
+ "grad_norm": 1.8995661735534668,
+ "learning_rate": 3.2424242424242425e-06,
+ "loss": 1.0395057201385498,
+ "mean_token_accuracy": 0.7405959963798523,
+ "num_tokens": 14270464.0,
+ "step": 871
+ },
+ {
+ "entropy": 0.8866081833839417,
+ "epoch": 1.7616161616161616,
+ "grad_norm": 1.7807546854019165,
+ "learning_rate": 3.2404040404040404e-06,
+ "loss": 0.8795047998428345,
+ "mean_token_accuracy": 0.7721666097640991,
+ "num_tokens": 14286848.0,
+ "step": 872
+ },
+ {
+ "entropy": 1.9576365947723389,
+ "epoch": 1.7636363636363637,
+ "grad_norm": 2.1867618560791016,
+ "learning_rate": 3.2383838383838383e-06,
+ "loss": 1.9605103731155396,
+ "mean_token_accuracy": 0.5809110999107361,
+ "num_tokens": 14303232.0,
+ "step": 873
+ },
+ {
+ "entropy": 1.010751485824585,
+ "epoch": 1.7656565656565657,
+ "grad_norm": 1.9643300771713257,
+ "learning_rate": 3.236363636363636e-06,
+ "loss": 0.9990894794464111,
+ "mean_token_accuracy": 0.7386419177055359,
+ "num_tokens": 14319616.0,
+ "step": 874
+ },
+ {
+ "entropy": 1.3587232828140259,
+ "epoch": 1.7676767676767677,
+ "grad_norm": 2.2632040977478027,
+ "learning_rate": 3.2343434343434345e-06,
+ "loss": 1.3631021976470947,
+ "mean_token_accuracy": 0.665791392326355,
+ "num_tokens": 14336000.0,
+ "step": 875
+ },
+ {
+ "entropy": 1.6577962636947632,
+ "epoch": 1.7696969696969695,
+ "grad_norm": 2.3661980628967285,
+ "learning_rate": 3.232323232323233e-06,
+ "loss": 1.6802719831466675,
+ "mean_token_accuracy": 0.6024059653282166,
+ "num_tokens": 14352384.0,
+ "step": 876
+ },
+ {
+ "entropy": 1.4332902431488037,
+ "epoch": 1.7717171717171718,
+ "grad_norm": 2.2296342849731445,
+ "learning_rate": 3.2303030303030307e-06,
+ "loss": 1.4129014015197754,
+ "mean_token_accuracy": 0.6511358022689819,
+ "num_tokens": 14368768.0,
+ "step": 877
+ },
+ {
+ "entropy": 1.2260215282440186,
+ "epoch": 1.7737373737373736,
+ "grad_norm": 2.0659983158111572,
+ "learning_rate": 3.228282828282829e-06,
+ "loss": 1.2417192459106445,
+ "mean_token_accuracy": 0.693514883518219,
+ "num_tokens": 14385152.0,
+ "step": 878
+ },
+ {
+ "entropy": 1.5402687788009644,
+ "epoch": 1.7757575757575759,
+ "grad_norm": 2.2024054527282715,
+ "learning_rate": 3.226262626262627e-06,
+ "loss": 1.5535321235656738,
+ "mean_token_accuracy": 0.6331827044487,
+ "num_tokens": 14401536.0,
+ "step": 879
+ },
+ {
+ "entropy": 1.2205268144607544,
+ "epoch": 1.7777777777777777,
+ "grad_norm": 2.0056662559509277,
+ "learning_rate": 3.2242424242424248e-06,
+ "loss": 1.2244641780853271,
+ "mean_token_accuracy": 0.7037127614021301,
+ "num_tokens": 14417920.0,
+ "step": 880
+ },
+ {
+ "entropy": 1.542244791984558,
+ "epoch": 1.77979797979798,
+ "grad_norm": 2.0935254096984863,
+ "learning_rate": 3.2222222222222227e-06,
+ "loss": 1.5638453960418701,
+ "mean_token_accuracy": 0.648937463760376,
+ "num_tokens": 14434304.0,
+ "step": 881
+ },
+ {
+ "entropy": 1.4249905347824097,
+ "epoch": 1.7818181818181817,
+ "grad_norm": 1.9853826761245728,
+ "learning_rate": 3.2202020202020206e-06,
+ "loss": 1.4453399181365967,
+ "mean_token_accuracy": 0.6869809627532959,
+ "num_tokens": 14450688.0,
+ "step": 882
+ },
+ {
+ "entropy": 1.4777165651321411,
+ "epoch": 1.783838383838384,
+ "grad_norm": 2.064542055130005,
+ "learning_rate": 3.2181818181818184e-06,
+ "loss": 1.4756921529769897,
+ "mean_token_accuracy": 0.6640205383300781,
+ "num_tokens": 14467072.0,
+ "step": 883
+ },
+ {
+ "entropy": 1.3442282676696777,
+ "epoch": 1.7858585858585858,
+ "grad_norm": 2.043712854385376,
+ "learning_rate": 3.2161616161616168e-06,
+ "loss": 1.3412827253341675,
+ "mean_token_accuracy": 0.6821568012237549,
+ "num_tokens": 14483456.0,
+ "step": 884
+ },
+ {
+ "entropy": 1.5201579332351685,
+ "epoch": 1.7878787878787878,
+ "grad_norm": 2.060661792755127,
+ "learning_rate": 3.2141414141414146e-06,
+ "loss": 1.5367834568023682,
+ "mean_token_accuracy": 0.6442354917526245,
+ "num_tokens": 14499840.0,
+ "step": 885
+ },
+ {
+ "entropy": 1.1536649465560913,
+ "epoch": 1.7898989898989899,
+ "grad_norm": 2.1190037727355957,
+ "learning_rate": 3.2121212121212125e-06,
+ "loss": 1.1588165760040283,
+ "mean_token_accuracy": 0.7039570212364197,
+ "num_tokens": 14516224.0,
+ "step": 886
+ },
+ {
+ "entropy": 1.109966516494751,
+ "epoch": 1.791919191919192,
+ "grad_norm": 2.0320141315460205,
+ "learning_rate": 3.2101010101010104e-06,
+ "loss": 1.1113003492355347,
+ "mean_token_accuracy": 0.7123228907585144,
+ "num_tokens": 14532608.0,
+ "step": 887
+ },
+ {
+ "entropy": 1.5709099769592285,
+ "epoch": 1.793939393939394,
+ "grad_norm": 2.0467336177825928,
+ "learning_rate": 3.2080808080808083e-06,
+ "loss": 1.5823577642440796,
+ "mean_token_accuracy": 0.6404494643211365,
+ "num_tokens": 14548992.0,
+ "step": 888
+ },
+ {
+ "entropy": 1.4305545091629028,
+ "epoch": 1.795959595959596,
+ "grad_norm": 2.0764269828796387,
+ "learning_rate": 3.2060606060606066e-06,
+ "loss": 1.438415765762329,
+ "mean_token_accuracy": 0.6574255228042603,
+ "num_tokens": 14565376.0,
+ "step": 889
+ },
+ {
+ "entropy": 1.3523615598678589,
+ "epoch": 1.797979797979798,
+ "grad_norm": 2.167036294937134,
+ "learning_rate": 3.2040404040404045e-06,
+ "loss": 1.3782477378845215,
+ "mean_token_accuracy": 0.6645090579986572,
+ "num_tokens": 14581760.0,
+ "step": 890
+ },
+ {
+ "entropy": 1.491297721862793,
+ "epoch": 1.8,
+ "grad_norm": 2.3090412616729736,
+ "learning_rate": 3.2020202020202024e-06,
+ "loss": 1.4965641498565674,
+ "mean_token_accuracy": 0.636907696723938,
+ "num_tokens": 14598144.0,
+ "step": 891
+ },
+ {
+ "entropy": 1.2584501504898071,
+ "epoch": 1.802020202020202,
+ "grad_norm": 2.1699554920196533,
+ "learning_rate": 3.2000000000000003e-06,
+ "loss": 1.2622835636138916,
+ "mean_token_accuracy": 0.6901563405990601,
+ "num_tokens": 14614528.0,
+ "step": 892
+ },
+ {
+ "entropy": 2.149350643157959,
+ "epoch": 1.8040404040404039,
+ "grad_norm": 2.2669718265533447,
+ "learning_rate": 3.197979797979798e-06,
+ "loss": 2.167891263961792,
+ "mean_token_accuracy": 0.5497679710388184,
+ "num_tokens": 14630912.0,
+ "step": 893
+ },
+ {
+ "entropy": 1.1999561786651611,
+ "epoch": 1.8060606060606061,
+ "grad_norm": 2.163228988647461,
+ "learning_rate": 3.195959595959596e-06,
+ "loss": 1.2024329900741577,
+ "mean_token_accuracy": 0.7035906314849854,
+ "num_tokens": 14647296.0,
+ "step": 894
+ },
+ {
+ "entropy": 1.770652413368225,
+ "epoch": 1.808080808080808,
+ "grad_norm": 2.1631994247436523,
+ "learning_rate": 3.1939393939393944e-06,
+ "loss": 1.7568567991256714,
+ "mean_token_accuracy": 0.6030776500701904,
+ "num_tokens": 14663680.0,
+ "step": 895
+ },
+ {
+ "entropy": 1.2487529516220093,
+ "epoch": 1.8101010101010102,
+ "grad_norm": 1.987622857093811,
+ "learning_rate": 3.1919191919191923e-06,
+ "loss": 1.255242109298706,
+ "mean_token_accuracy": 0.6929042339324951,
+ "num_tokens": 14680064.0,
+ "step": 896
+ },
+ {
+ "entropy": 1.138524055480957,
+ "epoch": 1.812121212121212,
+ "grad_norm": 2.0367984771728516,
+ "learning_rate": 3.18989898989899e-06,
+ "loss": 1.1514946222305298,
+ "mean_token_accuracy": 0.7093917727470398,
+ "num_tokens": 14696448.0,
+ "step": 897
+ },
+ {
+ "entropy": 1.3337515592575073,
+ "epoch": 1.8141414141414143,
+ "grad_norm": 1.9483140707015991,
+ "learning_rate": 3.187878787878788e-06,
+ "loss": 1.3251439332962036,
+ "mean_token_accuracy": 0.6861260533332825,
+ "num_tokens": 14712832.0,
+ "step": 898
+ },
+ {
+ "entropy": 1.047120451927185,
+ "epoch": 1.816161616161616,
+ "grad_norm": 2.0481390953063965,
+ "learning_rate": 3.185858585858586e-06,
+ "loss": 1.071772575378418,
+ "mean_token_accuracy": 0.7275891304016113,
+ "num_tokens": 14729216.0,
+ "step": 899
+ },
+ {
+ "entropy": 1.3311363458633423,
+ "epoch": 1.8181818181818183,
+ "grad_norm": 2.3203413486480713,
+ "learning_rate": 3.1838383838383842e-06,
+ "loss": 1.334134817123413,
+ "mean_token_accuracy": 0.6643869280815125,
+ "num_tokens": 14745600.0,
+ "step": 900
+ },
+ {
+ "epoch": 1.8181818181818183,
+ "eval_entropy": 1.4476436400605786,
+ "eval_loss": 1.5290467739105225,
+ "eval_mean_token_accuracy": 0.6456143543604882,
+ "eval_num_tokens": 14745600.0,
+ "eval_runtime": 43.8113,
+ "eval_samples_per_second": 22.597,
+ "eval_steps_per_second": 2.83,
+ "step": 900
+ },
+ {
+ "entropy": 1.6842114925384521,
+ "epoch": 1.8202020202020202,
+ "grad_norm": 2.1709823608398438,
+ "learning_rate": 3.181818181818182e-06,
+ "loss": 1.6816682815551758,
+ "mean_token_accuracy": 0.6033830046653748,
+ "num_tokens": 14761984.0,
+ "step": 901
+ },
+ {
+ "entropy": 1.2661798000335693,
+ "epoch": 1.8222222222222222,
+ "grad_norm": 2.113783836364746,
+ "learning_rate": 3.17979797979798e-06,
+ "loss": 1.249183177947998,
+ "mean_token_accuracy": 0.6865534782409668,
+ "num_tokens": 14778368.0,
+ "step": 902
+ },
+ {
+ "entropy": 1.2666339874267578,
+ "epoch": 1.8242424242424242,
+ "grad_norm": 2.0210978984832764,
+ "learning_rate": 3.177777777777778e-06,
+ "loss": 1.2548515796661377,
+ "mean_token_accuracy": 0.686431348323822,
+ "num_tokens": 14794752.0,
+ "step": 903
+ },
+ {
+ "entropy": 1.1660066843032837,
+ "epoch": 1.8262626262626263,
+ "grad_norm": 2.0998034477233887,
+ "learning_rate": 3.1757575757575758e-06,
+ "loss": 1.1654324531555176,
+ "mean_token_accuracy": 0.695713222026825,
+ "num_tokens": 14811136.0,
+ "step": 904
+ },
+ {
+ "entropy": 1.2902735471725464,
+ "epoch": 1.8282828282828283,
+ "grad_norm": 2.1510303020477295,
+ "learning_rate": 3.173737373737374e-06,
+ "loss": 1.2879812717437744,
+ "mean_token_accuracy": 0.6693942546844482,
+ "num_tokens": 14827520.0,
+ "step": 905
+ },
+ {
+ "entropy": 1.1441799402236938,
+ "epoch": 1.8303030303030303,
+ "grad_norm": 1.989449143409729,
+ "learning_rate": 3.171717171717172e-06,
+ "loss": 1.1552281379699707,
+ "mean_token_accuracy": 0.7127503752708435,
+ "num_tokens": 14843904.0,
+ "step": 906
+ },
+ {
+ "entropy": 1.08464515209198,
+ "epoch": 1.8323232323232324,
+ "grad_norm": 2.094696044921875,
+ "learning_rate": 3.16969696969697e-06,
+ "loss": 1.0758531093597412,
+ "mean_token_accuracy": 0.7164142727851868,
+ "num_tokens": 14860288.0,
+ "step": 907
+ },
+ {
+ "entropy": 1.3847618103027344,
+ "epoch": 1.8343434343434344,
+ "grad_norm": 2.207976818084717,
+ "learning_rate": 3.1676767676767678e-06,
+ "loss": 1.3722931146621704,
+ "mean_token_accuracy": 0.6741573214530945,
+ "num_tokens": 14876672.0,
+ "step": 908
+ },
+ {
+ "entropy": 1.3558534383773804,
+ "epoch": 1.8363636363636364,
+ "grad_norm": 2.166674852371216,
+ "learning_rate": 3.1656565656565656e-06,
+ "loss": 1.3612618446350098,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 14893056.0,
+ "step": 909
+ },
+ {
+ "entropy": 1.4160822629928589,
+ "epoch": 1.8383838383838382,
+ "grad_norm": 2.2242727279663086,
+ "learning_rate": 3.1636363636363635e-06,
+ "loss": 1.408278226852417,
+ "mean_token_accuracy": 0.6634098887443542,
+ "num_tokens": 14909440.0,
+ "step": 910
+ },
+ {
+ "entropy": 1.1337573528289795,
+ "epoch": 1.8404040404040405,
+ "grad_norm": 2.1882550716400146,
+ "learning_rate": 3.161616161616162e-06,
+ "loss": 1.1503205299377441,
+ "mean_token_accuracy": 0.7059721350669861,
+ "num_tokens": 14925824.0,
+ "step": 911
+ },
+ {
+ "entropy": 1.4373403787612915,
+ "epoch": 1.8424242424242423,
+ "grad_norm": 2.1595654487609863,
+ "learning_rate": 3.1595959595959597e-06,
+ "loss": 1.4344165325164795,
+ "mean_token_accuracy": 0.6599902510643005,
+ "num_tokens": 14942208.0,
+ "step": 912
+ },
+ {
+ "entropy": 1.0798827409744263,
+ "epoch": 1.8444444444444446,
+ "grad_norm": 2.101088047027588,
+ "learning_rate": 3.1575757575757576e-06,
+ "loss": 1.0873513221740723,
+ "mean_token_accuracy": 0.7169027924537659,
+ "num_tokens": 14958592.0,
+ "step": 913
+ },
+ {
+ "entropy": 1.7024599313735962,
+ "epoch": 1.8464646464646464,
+ "grad_norm": 2.291907548904419,
+ "learning_rate": 3.1555555555555555e-06,
+ "loss": 1.7014999389648438,
+ "mean_token_accuracy": 0.6105275750160217,
+ "num_tokens": 14974976.0,
+ "step": 914
+ },
+ {
+ "entropy": 1.7765953540802002,
+ "epoch": 1.8484848484848486,
+ "grad_norm": 2.1465439796447754,
+ "learning_rate": 3.1535353535353534e-06,
+ "loss": 1.788269281387329,
+ "mean_token_accuracy": 0.6066194176673889,
+ "num_tokens": 14991360.0,
+ "step": 915
+ },
+ {
+ "entropy": 1.5223884582519531,
+ "epoch": 1.8505050505050504,
+ "grad_norm": 2.313291549682617,
+ "learning_rate": 3.1515151515151517e-06,
+ "loss": 1.55397367477417,
+ "mean_token_accuracy": 0.6377626061439514,
+ "num_tokens": 15007744.0,
+ "step": 916
+ },
+ {
+ "entropy": 1.5820955038070679,
+ "epoch": 1.8525252525252527,
+ "grad_norm": 2.094886541366577,
+ "learning_rate": 3.1494949494949496e-06,
+ "loss": 1.58372962474823,
+ "mean_token_accuracy": 0.6339154839515686,
+ "num_tokens": 15024128.0,
+ "step": 917
+ },
+ {
+ "entropy": 1.7399076223373413,
+ "epoch": 1.8545454545454545,
+ "grad_norm": 2.0311105251312256,
+ "learning_rate": 3.1474747474747475e-06,
+ "loss": 1.7362079620361328,
+ "mean_token_accuracy": 0.604421079158783,
+ "num_tokens": 15040512.0,
+ "step": 918
+ },
+ {
+ "entropy": 1.4311537742614746,
+ "epoch": 1.8565656565656565,
+ "grad_norm": 2.13740873336792,
+ "learning_rate": 3.145454545454546e-06,
+ "loss": 1.4574000835418701,
+ "mean_token_accuracy": 0.648876428604126,
+ "num_tokens": 15056896.0,
+ "step": 919
+ },
+ {
+ "entropy": 1.6997709274291992,
+ "epoch": 1.8585858585858586,
+ "grad_norm": 2.1604959964752197,
+ "learning_rate": 3.143434343434344e-06,
+ "loss": 1.694093942642212,
+ "mean_token_accuracy": 0.6144357323646545,
+ "num_tokens": 15073280.0,
+ "step": 920
+ },
+ {
+ "entropy": 1.5796921253204346,
+ "epoch": 1.8606060606060606,
+ "grad_norm": 2.3852932453155518,
+ "learning_rate": 3.141414141414142e-06,
+ "loss": 1.5799579620361328,
+ "mean_token_accuracy": 0.6322667598724365,
+ "num_tokens": 15089664.0,
+ "step": 921
+ },
+ {
+ "entropy": 1.6185977458953857,
+ "epoch": 1.8626262626262626,
+ "grad_norm": 2.0631208419799805,
+ "learning_rate": 3.13939393939394e-06,
+ "loss": 1.6541715860366821,
+ "mean_token_accuracy": 0.632083535194397,
+ "num_tokens": 15106048.0,
+ "step": 922
+ },
+ {
+ "entropy": 1.5872372388839722,
+ "epoch": 1.8646464646464647,
+ "grad_norm": 2.154554843902588,
+ "learning_rate": 3.1373737373737378e-06,
+ "loss": 1.5946767330169678,
+ "mean_token_accuracy": 0.6294577717781067,
+ "num_tokens": 15122432.0,
+ "step": 923
+ },
+ {
+ "entropy": 1.6059986352920532,
+ "epoch": 1.8666666666666667,
+ "grad_norm": 1.9893742799758911,
+ "learning_rate": 3.1353535353535357e-06,
+ "loss": 1.6153039932250977,
+ "mean_token_accuracy": 0.6373962163925171,
+ "num_tokens": 15138816.0,
+ "step": 924
+ },
+ {
+ "entropy": 1.3143881559371948,
+ "epoch": 1.8686868686868687,
+ "grad_norm": 1.8989832401275635,
+ "learning_rate": 3.133333333333334e-06,
+ "loss": 1.3332319259643555,
+ "mean_token_accuracy": 0.6842330098152161,
+ "num_tokens": 15155200.0,
+ "step": 925
+ },
+ {
+ "entropy": 1.0474469661712646,
+ "epoch": 1.8707070707070708,
+ "grad_norm": 1.9129916429519653,
+ "learning_rate": 3.131313131313132e-06,
+ "loss": 1.0238264799118042,
+ "mean_token_accuracy": 0.7459697127342224,
+ "num_tokens": 15171584.0,
+ "step": 926
+ },
+ {
+ "entropy": 1.581508994102478,
+ "epoch": 1.8727272727272726,
+ "grad_norm": 2.0047285556793213,
+ "learning_rate": 3.1292929292929297e-06,
+ "loss": 1.6087100505828857,
+ "mean_token_accuracy": 0.6282364726066589,
+ "num_tokens": 15187968.0,
+ "step": 927
+ },
+ {
+ "entropy": 1.0985661745071411,
+ "epoch": 1.8747474747474748,
+ "grad_norm": 2.1207540035247803,
+ "learning_rate": 3.1272727272727276e-06,
+ "loss": 1.1158297061920166,
+ "mean_token_accuracy": 0.7111626863479614,
+ "num_tokens": 15204352.0,
+ "step": 928
+ },
+ {
+ "entropy": 1.4591490030288696,
+ "epoch": 1.8767676767676766,
+ "grad_norm": 2.2879691123962402,
+ "learning_rate": 3.1252525252525255e-06,
+ "loss": 1.4775316715240479,
+ "mean_token_accuracy": 0.6477161645889282,
+ "num_tokens": 15220736.0,
+ "step": 929
+ },
+ {
+ "entropy": 1.5469937324523926,
+ "epoch": 1.878787878787879,
+ "grad_norm": 2.0972726345062256,
+ "learning_rate": 3.1232323232323234e-06,
+ "loss": 1.5949021577835083,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 15237120.0,
+ "step": 930
+ },
+ {
+ "entropy": 1.363472819328308,
+ "epoch": 1.8808080808080807,
+ "grad_norm": 2.149606943130493,
+ "learning_rate": 3.1212121212121217e-06,
+ "loss": 1.358612298965454,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 15253504.0,
+ "step": 931
+ },
+ {
+ "entropy": 1.189648985862732,
+ "epoch": 1.882828282828283,
+ "grad_norm": 2.2575035095214844,
+ "learning_rate": 3.1191919191919196e-06,
+ "loss": 1.209303379058838,
+ "mean_token_accuracy": 0.7002320289611816,
+ "num_tokens": 15269888.0,
+ "step": 932
+ },
+ {
+ "entropy": 1.3054684400558472,
+ "epoch": 1.8848484848484848,
+ "grad_norm": 2.243915319442749,
+ "learning_rate": 3.1171717171717175e-06,
+ "loss": 1.333367109298706,
+ "mean_token_accuracy": 0.6703712940216064,
+ "num_tokens": 15286272.0,
+ "step": 933
+ },
+ {
+ "entropy": 1.6298167705535889,
+ "epoch": 1.886868686868687,
+ "grad_norm": 1.9654396772384644,
+ "learning_rate": 3.1151515151515154e-06,
+ "loss": 1.6496453285217285,
+ "mean_token_accuracy": 0.6248778700828552,
+ "num_tokens": 15302656.0,
+ "step": 934
+ },
+ {
+ "entropy": 1.1228219270706177,
+ "epoch": 1.8888888888888888,
+ "grad_norm": 2.2492377758026123,
+ "learning_rate": 3.1131313131313133e-06,
+ "loss": 1.1560063362121582,
+ "mean_token_accuracy": 0.699499249458313,
+ "num_tokens": 15319040.0,
+ "step": 935
+ },
+ {
+ "entropy": 1.7481759786605835,
+ "epoch": 1.8909090909090909,
+ "grad_norm": 2.1635665893554688,
+ "learning_rate": 3.1111111111111116e-06,
+ "loss": 1.737868070602417,
+ "mean_token_accuracy": 0.6030776500701904,
+ "num_tokens": 15335424.0,
+ "step": 936
+ },
+ {
+ "entropy": 1.3964993953704834,
+ "epoch": 1.892929292929293,
+ "grad_norm": 2.262946367263794,
+ "learning_rate": 3.1090909090909095e-06,
+ "loss": 1.3927817344665527,
+ "mean_token_accuracy": 0.6546775698661804,
+ "num_tokens": 15351808.0,
+ "step": 937
+ },
+ {
+ "entropy": 1.2503907680511475,
+ "epoch": 1.894949494949495,
+ "grad_norm": 1.9837188720703125,
+ "learning_rate": 3.1070707070707074e-06,
+ "loss": 1.2529189586639404,
+ "mean_token_accuracy": 0.6965681314468384,
+ "num_tokens": 15368192.0,
+ "step": 938
+ },
+ {
+ "entropy": 0.9774144291877747,
+ "epoch": 1.896969696969697,
+ "grad_norm": 1.9201257228851318,
+ "learning_rate": 3.1050505050505052e-06,
+ "loss": 0.9864459037780762,
+ "mean_token_accuracy": 0.7534807324409485,
+ "num_tokens": 15384576.0,
+ "step": 939
+ },
+ {
+ "entropy": 1.4065781831741333,
+ "epoch": 1.898989898989899,
+ "grad_norm": 2.357865571975708,
+ "learning_rate": 3.103030303030303e-06,
+ "loss": 1.428115725517273,
+ "mean_token_accuracy": 0.6493649482727051,
+ "num_tokens": 15400960.0,
+ "step": 940
+ },
+ {
+ "entropy": 1.1632903814315796,
+ "epoch": 1.901010101010101,
+ "grad_norm": 1.8824918270111084,
+ "learning_rate": 3.1010101010101014e-06,
+ "loss": 1.1478252410888672,
+ "mean_token_accuracy": 0.7158036231994629,
+ "num_tokens": 15417344.0,
+ "step": 941
+ },
+ {
+ "entropy": 1.7470908164978027,
+ "epoch": 1.903030303030303,
+ "grad_norm": 2.2958669662475586,
+ "learning_rate": 3.0989898989898993e-06,
+ "loss": 1.7697877883911133,
+ "mean_token_accuracy": 0.5892769694328308,
+ "num_tokens": 15433728.0,
+ "step": 942
+ },
+ {
+ "entropy": 1.2897151708602905,
+ "epoch": 1.905050505050505,
+ "grad_norm": 2.155731439590454,
+ "learning_rate": 3.0969696969696972e-06,
+ "loss": 1.2971919775009155,
+ "mean_token_accuracy": 0.6731802821159363,
+ "num_tokens": 15450112.0,
+ "step": 943
+ },
+ {
+ "entropy": 1.2687026262283325,
+ "epoch": 1.907070707070707,
+ "grad_norm": 2.0896284580230713,
+ "learning_rate": 3.094949494949495e-06,
+ "loss": 1.2423906326293945,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 15466496.0,
+ "step": 944
+ },
+ {
+ "entropy": 1.5710495710372925,
+ "epoch": 1.9090909090909092,
+ "grad_norm": 2.200758457183838,
+ "learning_rate": 3.092929292929293e-06,
+ "loss": 1.5329574346542358,
+ "mean_token_accuracy": 0.6560820937156677,
+ "num_tokens": 15482880.0,
+ "step": 945
+ },
+ {
+ "entropy": 1.1555253267288208,
+ "epoch": 1.911111111111111,
+ "grad_norm": 2.278230905532837,
+ "learning_rate": 3.090909090909091e-06,
+ "loss": 1.1469731330871582,
+ "mean_token_accuracy": 0.7220932841300964,
+ "num_tokens": 15499264.0,
+ "step": 946
+ },
+ {
+ "entropy": 1.2870018482208252,
+ "epoch": 1.9131313131313132,
+ "grad_norm": 1.8973854780197144,
+ "learning_rate": 3.088888888888889e-06,
+ "loss": 1.2787907123565674,
+ "mean_token_accuracy": 0.6885075569152832,
+ "num_tokens": 15515648.0,
+ "step": 947
+ },
+ {
+ "entropy": 1.324872612953186,
+ "epoch": 1.915151515151515,
+ "grad_norm": 2.1889214515686035,
+ "learning_rate": 3.086868686868687e-06,
+ "loss": 1.3286981582641602,
+ "mean_token_accuracy": 0.6743404865264893,
+ "num_tokens": 15532032.0,
+ "step": 948
+ },
+ {
+ "entropy": 1.5601656436920166,
+ "epoch": 1.9171717171717173,
+ "grad_norm": 2.304993152618408,
+ "learning_rate": 3.084848484848485e-06,
+ "loss": 1.5766493082046509,
+ "mean_token_accuracy": 0.6172447204589844,
+ "num_tokens": 15548416.0,
+ "step": 949
+ },
+ {
+ "entropy": 1.4633477926254272,
+ "epoch": 1.9191919191919191,
+ "grad_norm": 1.9083963632583618,
+ "learning_rate": 3.082828282828283e-06,
+ "loss": 1.4554777145385742,
+ "mean_token_accuracy": 0.6667073965072632,
+ "num_tokens": 15564800.0,
+ "step": 950
+ },
+ {
+ "epoch": 1.9191919191919191,
+ "eval_entropy": 1.4443931824737979,
+ "eval_loss": 1.5272752046585083,
+ "eval_mean_token_accuracy": 0.6459201723337173,
+ "eval_num_tokens": 15564800.0,
+ "eval_runtime": 43.7243,
+ "eval_samples_per_second": 22.642,
+ "eval_steps_per_second": 2.836,
+ "step": 950
+ },
+ {
+ "entropy": 1.3350679874420166,
+ "epoch": 1.9212121212121214,
+ "grad_norm": 2.139172315597534,
+ "learning_rate": 3.0808080808080807e-06,
+ "loss": 1.3285927772521973,
+ "mean_token_accuracy": 0.6833781003952026,
+ "num_tokens": 15581184.0,
+ "step": 951
+ },
+ {
+ "entropy": 1.2373814582824707,
+ "epoch": 1.9232323232323232,
+ "grad_norm": 2.1068115234375,
+ "learning_rate": 3.078787878787879e-06,
+ "loss": 1.2527921199798584,
+ "mean_token_accuracy": 0.6969345211982727,
+ "num_tokens": 15597568.0,
+ "step": 952
+ },
+ {
+ "entropy": 1.2182631492614746,
+ "epoch": 1.9252525252525252,
+ "grad_norm": 2.1326634883880615,
+ "learning_rate": 3.076767676767677e-06,
+ "loss": 1.2174904346466064,
+ "mean_token_accuracy": 0.6905227303504944,
+ "num_tokens": 15613952.0,
+ "step": 953
+ },
+ {
+ "entropy": 0.9768888354301453,
+ "epoch": 1.9272727272727272,
+ "grad_norm": 1.9833085536956787,
+ "learning_rate": 3.074747474747475e-06,
+ "loss": 0.9956569671630859,
+ "mean_token_accuracy": 0.7401685118675232,
+ "num_tokens": 15630336.0,
+ "step": 954
+ },
+ {
+ "entropy": 0.7818430066108704,
+ "epoch": 1.9292929292929293,
+ "grad_norm": 1.9219205379486084,
+ "learning_rate": 3.0727272727272727e-06,
+ "loss": 0.7922182083129883,
+ "mean_token_accuracy": 0.7827919125556946,
+ "num_tokens": 15646720.0,
+ "step": 955
+ },
+ {
+ "entropy": 1.6172020435333252,
+ "epoch": 1.9313131313131313,
+ "grad_norm": 1.9390695095062256,
+ "learning_rate": 3.0707070707070706e-06,
+ "loss": 1.6629729270935059,
+ "mean_token_accuracy": 0.6192598938941956,
+ "num_tokens": 15663104.0,
+ "step": 956
+ },
+ {
+ "entropy": 1.291207194328308,
+ "epoch": 1.9333333333333333,
+ "grad_norm": 1.9242857694625854,
+ "learning_rate": 3.068686868686869e-06,
+ "loss": 1.2721552848815918,
+ "mean_token_accuracy": 0.6867367029190063,
+ "num_tokens": 15679488.0,
+ "step": 957
+ },
+ {
+ "entropy": 1.3730298280715942,
+ "epoch": 1.9353535353535354,
+ "grad_norm": 1.9483041763305664,
+ "learning_rate": 3.066666666666667e-06,
+ "loss": 1.3835055828094482,
+ "mean_token_accuracy": 0.6745237112045288,
+ "num_tokens": 15695872.0,
+ "step": 958
+ },
+ {
+ "entropy": 1.1266423463821411,
+ "epoch": 1.9373737373737374,
+ "grad_norm": 2.1663992404937744,
+ "learning_rate": 3.0646464646464647e-06,
+ "loss": 1.1091173887252808,
+ "mean_token_accuracy": 0.7151318788528442,
+ "num_tokens": 15712256.0,
+ "step": 959
+ },
+ {
+ "entropy": 1.298812747001648,
+ "epoch": 1.9393939393939394,
+ "grad_norm": 2.0564448833465576,
+ "learning_rate": 3.0626262626262626e-06,
+ "loss": 1.3167932033538818,
+ "mean_token_accuracy": 0.6812408566474915,
+ "num_tokens": 15728640.0,
+ "step": 960
+ },
+ {
+ "entropy": 1.7007938623428345,
+ "epoch": 1.9414141414141413,
+ "grad_norm": 2.1043670177459717,
+ "learning_rate": 3.0606060606060605e-06,
+ "loss": 1.6956250667572021,
+ "mean_token_accuracy": 0.6194430589675903,
+ "num_tokens": 15745024.0,
+ "step": 961
+ },
+ {
+ "entropy": 1.408955693244934,
+ "epoch": 1.9434343434343435,
+ "grad_norm": 2.0432121753692627,
+ "learning_rate": 3.058585858585859e-06,
+ "loss": 1.3905062675476074,
+ "mean_token_accuracy": 0.6662799119949341,
+ "num_tokens": 15761408.0,
+ "step": 962
+ },
+ {
+ "entropy": 1.938867211341858,
+ "epoch": 1.9454545454545453,
+ "grad_norm": 2.3359744548797607,
+ "learning_rate": 3.056565656565657e-06,
+ "loss": 1.9670305252075195,
+ "mean_token_accuracy": 0.5845139026641846,
+ "num_tokens": 15777792.0,
+ "step": 963
+ },
+ {
+ "entropy": 1.5049448013305664,
+ "epoch": 1.9474747474747476,
+ "grad_norm": 2.1907997131347656,
+ "learning_rate": 3.054545454545455e-06,
+ "loss": 1.534651756286621,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 15794176.0,
+ "step": 964
+ },
+ {
+ "entropy": 1.1916700601577759,
+ "epoch": 1.9494949494949494,
+ "grad_norm": 2.098696231842041,
+ "learning_rate": 3.052525252525253e-06,
+ "loss": 1.191361904144287,
+ "mean_token_accuracy": 0.715192973613739,
+ "num_tokens": 15810560.0,
+ "step": 965
+ },
+ {
+ "entropy": 1.6707743406295776,
+ "epoch": 1.9515151515151516,
+ "grad_norm": 2.106846570968628,
+ "learning_rate": 3.0505050505050508e-06,
+ "loss": 1.6789159774780273,
+ "mean_token_accuracy": 0.6133365631103516,
+ "num_tokens": 15826944.0,
+ "step": 966
+ },
+ {
+ "entropy": 1.4679991006851196,
+ "epoch": 1.9535353535353535,
+ "grad_norm": 2.1568050384521484,
+ "learning_rate": 3.048484848484849e-06,
+ "loss": 1.4427556991577148,
+ "mean_token_accuracy": 0.6526013612747192,
+ "num_tokens": 15843328.0,
+ "step": 967
+ },
+ {
+ "entropy": 0.9881705641746521,
+ "epoch": 1.9555555555555557,
+ "grad_norm": 2.029680013656616,
+ "learning_rate": 3.046464646464647e-06,
+ "loss": 0.9961811304092407,
+ "mean_token_accuracy": 0.7408402562141418,
+ "num_tokens": 15859712.0,
+ "step": 968
+ },
+ {
+ "entropy": 1.0721628665924072,
+ "epoch": 1.9575757575757575,
+ "grad_norm": 1.9763140678405762,
+ "learning_rate": 3.044444444444445e-06,
+ "loss": 1.067029356956482,
+ "mean_token_accuracy": 0.733146071434021,
+ "num_tokens": 15876096.0,
+ "step": 969
+ },
+ {
+ "entropy": 1.7053834199905396,
+ "epoch": 1.9595959595959596,
+ "grad_norm": 2.3659849166870117,
+ "learning_rate": 3.0424242424242427e-06,
+ "loss": 1.7629203796386719,
+ "mean_token_accuracy": 0.6105275750160217,
+ "num_tokens": 15892480.0,
+ "step": 970
+ },
+ {
+ "entropy": 1.8083471059799194,
+ "epoch": 1.9616161616161616,
+ "grad_norm": 2.081869602203369,
+ "learning_rate": 3.0404040404040406e-06,
+ "loss": 1.8430367708206177,
+ "mean_token_accuracy": 0.6009404063224792,
+ "num_tokens": 15908864.0,
+ "step": 971
+ },
+ {
+ "entropy": 1.2576755285263062,
+ "epoch": 1.9636363636363636,
+ "grad_norm": 2.128230571746826,
+ "learning_rate": 3.038383838383839e-06,
+ "loss": 1.2493822574615479,
+ "mean_token_accuracy": 0.6913776397705078,
+ "num_tokens": 15925248.0,
+ "step": 972
+ },
+ {
+ "entropy": 0.8995128273963928,
+ "epoch": 1.9656565656565657,
+ "grad_norm": 2.0216031074523926,
+ "learning_rate": 3.036363636363637e-06,
+ "loss": 0.9069615602493286,
+ "mean_token_accuracy": 0.7620908617973328,
+ "num_tokens": 15941632.0,
+ "step": 973
+ },
+ {
+ "entropy": 1.615832805633545,
+ "epoch": 1.9676767676767677,
+ "grad_norm": 2.26552152633667,
+ "learning_rate": 3.0343434343434347e-06,
+ "loss": 1.6284873485565186,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 15958016.0,
+ "step": 974
+ },
+ {
+ "entropy": 1.404674768447876,
+ "epoch": 1.9696969696969697,
+ "grad_norm": 2.1790690422058105,
+ "learning_rate": 3.0323232323232326e-06,
+ "loss": 1.4130914211273193,
+ "mean_token_accuracy": 0.6594406366348267,
+ "num_tokens": 15974400.0,
+ "step": 975
+ },
+ {
+ "entropy": 1.3440049886703491,
+ "epoch": 1.9717171717171718,
+ "grad_norm": 2.121338367462158,
+ "learning_rate": 3.0303030303030305e-06,
+ "loss": 1.3652238845825195,
+ "mean_token_accuracy": 0.6794699430465698,
+ "num_tokens": 15990784.0,
+ "step": 976
+ },
+ {
+ "entropy": 1.0894689559936523,
+ "epoch": 1.9737373737373738,
+ "grad_norm": 2.0155327320098877,
+ "learning_rate": 3.028282828282829e-06,
+ "loss": 1.0642526149749756,
+ "mean_token_accuracy": 0.7223986387252808,
+ "num_tokens": 16007168.0,
+ "step": 977
+ },
+ {
+ "entropy": 1.469588041305542,
+ "epoch": 1.9757575757575756,
+ "grad_norm": 2.2047550678253174,
+ "learning_rate": 3.0262626262626267e-06,
+ "loss": 1.498295545578003,
+ "mean_token_accuracy": 0.6441133618354797,
+ "num_tokens": 16023552.0,
+ "step": 978
+ },
+ {
+ "entropy": 1.6617093086242676,
+ "epoch": 1.9777777777777779,
+ "grad_norm": 1.9770722389221191,
+ "learning_rate": 3.0242424242424246e-06,
+ "loss": 1.6753556728363037,
+ "mean_token_accuracy": 0.6284807324409485,
+ "num_tokens": 16039936.0,
+ "step": 979
+ },
+ {
+ "entropy": 1.8029206991195679,
+ "epoch": 1.9797979797979797,
+ "grad_norm": 2.2365968227386475,
+ "learning_rate": 3.0222222222222225e-06,
+ "loss": 1.7957369089126587,
+ "mean_token_accuracy": 0.601062536239624,
+ "num_tokens": 16056320.0,
+ "step": 980
+ },
+ {
+ "entropy": 1.6331384181976318,
+ "epoch": 1.981818181818182,
+ "grad_norm": 2.0565884113311768,
+ "learning_rate": 3.0202020202020203e-06,
+ "loss": 1.673048973083496,
+ "mean_token_accuracy": 0.6203590631484985,
+ "num_tokens": 16072704.0,
+ "step": 981
+ },
+ {
+ "entropy": 1.1730273962020874,
+ "epoch": 1.9838383838383837,
+ "grad_norm": 2.0347228050231934,
+ "learning_rate": 3.0181818181818182e-06,
+ "loss": 1.1709872484207153,
+ "mean_token_accuracy": 0.7086589932441711,
+ "num_tokens": 16089088.0,
+ "step": 982
+ },
+ {
+ "entropy": 1.1109111309051514,
+ "epoch": 1.985858585858586,
+ "grad_norm": 1.9992051124572754,
+ "learning_rate": 3.0161616161616165e-06,
+ "loss": 1.097399353981018,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 16105472.0,
+ "step": 983
+ },
+ {
+ "entropy": 1.2580686807632446,
+ "epoch": 1.9878787878787878,
+ "grad_norm": 2.1748640537261963,
+ "learning_rate": 3.0141414141414144e-06,
+ "loss": 1.2503113746643066,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 16121856.0,
+ "step": 984
+ },
+ {
+ "entropy": 1.4884002208709717,
+ "epoch": 1.98989898989899,
+ "grad_norm": 2.3283042907714844,
+ "learning_rate": 3.0121212121212123e-06,
+ "loss": 1.4856922626495361,
+ "mean_token_accuracy": 0.6461895704269409,
+ "num_tokens": 16138240.0,
+ "step": 985
+ },
+ {
+ "entropy": 1.6224603652954102,
+ "epoch": 1.9919191919191919,
+ "grad_norm": 2.0596823692321777,
+ "learning_rate": 3.0101010101010102e-06,
+ "loss": 1.6202584505081177,
+ "mean_token_accuracy": 0.6388617753982544,
+ "num_tokens": 16154624.0,
+ "step": 986
+ },
+ {
+ "entropy": 1.559553623199463,
+ "epoch": 1.993939393939394,
+ "grad_norm": 2.100667953491211,
+ "learning_rate": 3.008080808080808e-06,
+ "loss": 1.5781179666519165,
+ "mean_token_accuracy": 0.6409379839897156,
+ "num_tokens": 16171008.0,
+ "step": 987
+ },
+ {
+ "entropy": 1.299710750579834,
+ "epoch": 1.995959595959596,
+ "grad_norm": 2.2846767902374268,
+ "learning_rate": 3.0060606060606064e-06,
+ "loss": 1.2758262157440186,
+ "mean_token_accuracy": 0.6882632970809937,
+ "num_tokens": 16187392.0,
+ "step": 988
+ },
+ {
+ "entropy": 1.3966935873031616,
+ "epoch": 1.997979797979798,
+ "grad_norm": 2.1244044303894043,
+ "learning_rate": 3.0040404040404043e-06,
+ "loss": 1.420769214630127,
+ "mean_token_accuracy": 0.6670737862586975,
+ "num_tokens": 16203776.0,
+ "step": 989
+ },
+ {
+ "entropy": 1.5851658582687378,
+ "epoch": 2.0,
+ "grad_norm": 2.277179002761841,
+ "learning_rate": 3.002020202020202e-06,
+ "loss": 1.5963382720947266,
+ "mean_token_accuracy": 0.6276868581771851,
+ "num_tokens": 16220160.0,
+ "step": 990
+ },
+ {
+ "entropy": 1.9146819114685059,
+ "epoch": 2.002020202020202,
+ "grad_norm": 2.0008981227874756,
+ "learning_rate": 3e-06,
+ "loss": 1.8820562362670898,
+ "mean_token_accuracy": 0.5895212292671204,
+ "num_tokens": 16236544.0,
+ "step": 991
+ },
+ {
+ "entropy": 1.3451478481292725,
+ "epoch": 2.004040404040404,
+ "grad_norm": 2.236388921737671,
+ "learning_rate": 2.997979797979798e-06,
+ "loss": 1.2709381580352783,
+ "mean_token_accuracy": 0.6848436594009399,
+ "num_tokens": 16252928.0,
+ "step": 992
+ },
+ {
+ "entropy": 1.4454528093338013,
+ "epoch": 2.006060606060606,
+ "grad_norm": 2.220324754714966,
+ "learning_rate": 2.9959595959595963e-06,
+ "loss": 1.387961506843567,
+ "mean_token_accuracy": 0.6642647981643677,
+ "num_tokens": 16269312.0,
+ "step": 993
+ },
+ {
+ "entropy": 1.2083219289779663,
+ "epoch": 2.008080808080808,
+ "grad_norm": 2.092430830001831,
+ "learning_rate": 2.993939393939394e-06,
+ "loss": 1.1450953483581543,
+ "mean_token_accuracy": 0.7159257531166077,
+ "num_tokens": 16285696.0,
+ "step": 994
+ },
+ {
+ "entropy": 1.3030426502227783,
+ "epoch": 2.01010101010101,
+ "grad_norm": 2.0722665786743164,
+ "learning_rate": 2.991919191919192e-06,
+ "loss": 1.2463462352752686,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 16302080.0,
+ "step": 995
+ },
+ {
+ "entropy": 1.3418742418289185,
+ "epoch": 2.012121212121212,
+ "grad_norm": 1.9004424810409546,
+ "learning_rate": 2.98989898989899e-06,
+ "loss": 1.3043954372406006,
+ "mean_token_accuracy": 0.6850268840789795,
+ "num_tokens": 16318464.0,
+ "step": 996
+ },
+ {
+ "entropy": 1.6736825704574585,
+ "epoch": 2.014141414141414,
+ "grad_norm": 2.132983446121216,
+ "learning_rate": 2.987878787878788e-06,
+ "loss": 1.631580114364624,
+ "mean_token_accuracy": 0.619076669216156,
+ "num_tokens": 16334848.0,
+ "step": 997
+ },
+ {
+ "entropy": 1.435375690460205,
+ "epoch": 2.0161616161616163,
+ "grad_norm": 2.2508206367492676,
+ "learning_rate": 2.9858585858585857e-06,
+ "loss": 1.3867809772491455,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 16351232.0,
+ "step": 998
+ },
+ {
+ "entropy": 1.050812005996704,
+ "epoch": 2.018181818181818,
+ "grad_norm": 1.878668189048767,
+ "learning_rate": 2.983838383838384e-06,
+ "loss": 1.0428903102874756,
+ "mean_token_accuracy": 0.7329018115997314,
+ "num_tokens": 16367616.0,
+ "step": 999
+ },
+ {
+ "entropy": 1.325859546661377,
+ "epoch": 2.0202020202020203,
+ "grad_norm": 1.8450349569320679,
+ "learning_rate": 2.981818181818182e-06,
+ "loss": 1.302099347114563,
+ "mean_token_accuracy": 0.6926599740982056,
+ "num_tokens": 16384000.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.0202020202020203,
+ "eval_entropy": 1.3899660999736478,
+ "eval_loss": 1.5310550928115845,
+ "eval_mean_token_accuracy": 0.6458596015168775,
+ "eval_num_tokens": 16384000.0,
+ "eval_runtime": 43.8845,
+ "eval_samples_per_second": 22.559,
+ "eval_steps_per_second": 2.826,
+ "step": 1000
+ },
+ {
+ "entropy": 1.5226235389709473,
+ "epoch": 2.022222222222222,
+ "grad_norm": 2.0676803588867188,
+ "learning_rate": 2.97979797979798e-06,
+ "loss": 1.4971344470977783,
+ "mean_token_accuracy": 0.6517464518547058,
+ "num_tokens": 16400384.0,
+ "step": 1001
+ },
+ {
+ "entropy": 0.9506940841674805,
+ "epoch": 2.0242424242424244,
+ "grad_norm": 1.972718596458435,
+ "learning_rate": 2.9777777777777777e-06,
+ "loss": 0.9229776859283447,
+ "mean_token_accuracy": 0.7554958462715149,
+ "num_tokens": 16416768.0,
+ "step": 1002
+ },
+ {
+ "entropy": 1.8095428943634033,
+ "epoch": 2.026262626262626,
+ "grad_norm": 2.119502305984497,
+ "learning_rate": 2.9757575757575756e-06,
+ "loss": 1.8333206176757812,
+ "mean_token_accuracy": 0.5888495445251465,
+ "num_tokens": 16433152.0,
+ "step": 1003
+ },
+ {
+ "entropy": 1.110617756843567,
+ "epoch": 2.0282828282828285,
+ "grad_norm": 2.1480863094329834,
+ "learning_rate": 2.9737373737373743e-06,
+ "loss": 1.0999674797058105,
+ "mean_token_accuracy": 0.7213605046272278,
+ "num_tokens": 16449536.0,
+ "step": 1004
+ },
+ {
+ "entropy": 1.1889066696166992,
+ "epoch": 2.0303030303030303,
+ "grad_norm": 2.1086478233337402,
+ "learning_rate": 2.971717171717172e-06,
+ "loss": 1.2093305587768555,
+ "mean_token_accuracy": 0.7071323990821838,
+ "num_tokens": 16465920.0,
+ "step": 1005
+ },
+ {
+ "entropy": 1.2134279012680054,
+ "epoch": 2.0323232323232325,
+ "grad_norm": 2.020108461380005,
+ "learning_rate": 2.96969696969697e-06,
+ "loss": 1.2015900611877441,
+ "mean_token_accuracy": 0.7037127614021301,
+ "num_tokens": 16482304.0,
+ "step": 1006
+ },
+ {
+ "entropy": 1.1034245491027832,
+ "epoch": 2.0343434343434343,
+ "grad_norm": 2.1722943782806396,
+ "learning_rate": 2.967676767676768e-06,
+ "loss": 1.1243445873260498,
+ "mean_token_accuracy": 0.7051172256469727,
+ "num_tokens": 16498688.0,
+ "step": 1007
+ },
+ {
+ "entropy": 1.6888902187347412,
+ "epoch": 2.036363636363636,
+ "grad_norm": 2.1574206352233887,
+ "learning_rate": 2.9656565656565663e-06,
+ "loss": 1.7164931297302246,
+ "mean_token_accuracy": 0.6174889802932739,
+ "num_tokens": 16515072.0,
+ "step": 1008
+ },
+ {
+ "entropy": 0.8055605292320251,
+ "epoch": 2.0383838383838384,
+ "grad_norm": 1.8896156549453735,
+ "learning_rate": 2.963636363636364e-06,
+ "loss": 0.7961650490760803,
+ "mean_token_accuracy": 0.7895700931549072,
+ "num_tokens": 16531456.0,
+ "step": 1009
+ },
+ {
+ "entropy": 1.7698009014129639,
+ "epoch": 2.04040404040404,
+ "grad_norm": 2.1700897216796875,
+ "learning_rate": 2.961616161616162e-06,
+ "loss": 1.7871267795562744,
+ "mean_token_accuracy": 0.6139472126960754,
+ "num_tokens": 16547840.0,
+ "step": 1010
+ },
+ {
+ "entropy": 1.414292335510254,
+ "epoch": 2.0424242424242425,
+ "grad_norm": 2.0185277462005615,
+ "learning_rate": 2.95959595959596e-06,
+ "loss": 1.4295077323913574,
+ "mean_token_accuracy": 0.6670126914978027,
+ "num_tokens": 16564224.0,
+ "step": 1011
+ },
+ {
+ "entropy": 1.4013340473175049,
+ "epoch": 2.0444444444444443,
+ "grad_norm": 2.1133840084075928,
+ "learning_rate": 2.957575757575758e-06,
+ "loss": 1.4482200145721436,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 16580608.0,
+ "step": 1012
+ },
+ {
+ "entropy": 1.342740774154663,
+ "epoch": 2.0464646464646465,
+ "grad_norm": 2.0520355701446533,
+ "learning_rate": 2.955555555555556e-06,
+ "loss": 1.3550419807434082,
+ "mean_token_accuracy": 0.6850879192352295,
+ "num_tokens": 16596992.0,
+ "step": 1013
+ },
+ {
+ "entropy": 1.2301024198532104,
+ "epoch": 2.0484848484848484,
+ "grad_norm": 2.1948137283325195,
+ "learning_rate": 2.953535353535354e-06,
+ "loss": 1.243154525756836,
+ "mean_token_accuracy": 0.6838055849075317,
+ "num_tokens": 16613376.0,
+ "step": 1014
+ },
+ {
+ "entropy": 1.3916606903076172,
+ "epoch": 2.0505050505050506,
+ "grad_norm": 2.241595506668091,
+ "learning_rate": 2.951515151515152e-06,
+ "loss": 1.4011318683624268,
+ "mean_token_accuracy": 0.664631187915802,
+ "num_tokens": 16629760.0,
+ "step": 1015
+ },
+ {
+ "entropy": 1.4715481996536255,
+ "epoch": 2.0525252525252524,
+ "grad_norm": 2.224256753921509,
+ "learning_rate": 2.94949494949495e-06,
+ "loss": 1.5011882781982422,
+ "mean_token_accuracy": 0.6493038535118103,
+ "num_tokens": 16646144.0,
+ "step": 1016
+ },
+ {
+ "entropy": 1.1261032819747925,
+ "epoch": 2.0545454545454547,
+ "grad_norm": 2.2784500122070312,
+ "learning_rate": 2.9474747474747477e-06,
+ "loss": 1.1250882148742676,
+ "mean_token_accuracy": 0.7178798317909241,
+ "num_tokens": 16662528.0,
+ "step": 1017
+ },
+ {
+ "entropy": 1.782008171081543,
+ "epoch": 2.0565656565656565,
+ "grad_norm": 2.1711416244506836,
+ "learning_rate": 2.9454545454545456e-06,
+ "loss": 1.8037612438201904,
+ "mean_token_accuracy": 0.6113824844360352,
+ "num_tokens": 16678912.0,
+ "step": 1018
+ },
+ {
+ "entropy": 1.521897315979004,
+ "epoch": 2.0585858585858587,
+ "grad_norm": 2.1903202533721924,
+ "learning_rate": 2.943434343434344e-06,
+ "loss": 1.5377610921859741,
+ "mean_token_accuracy": 0.642953097820282,
+ "num_tokens": 16695296.0,
+ "step": 1019
+ },
+ {
+ "entropy": 1.3112438917160034,
+ "epoch": 2.0606060606060606,
+ "grad_norm": 2.0299105644226074,
+ "learning_rate": 2.941414141414142e-06,
+ "loss": 1.3218681812286377,
+ "mean_token_accuracy": 0.6842941045761108,
+ "num_tokens": 16711680.0,
+ "step": 1020
+ },
+ {
+ "entropy": 1.3634895086288452,
+ "epoch": 2.062626262626263,
+ "grad_norm": 2.2818808555603027,
+ "learning_rate": 2.9393939393939397e-06,
+ "loss": 1.3611259460449219,
+ "mean_token_accuracy": 0.6758060455322266,
+ "num_tokens": 16728064.0,
+ "step": 1021
+ },
+ {
+ "entropy": 1.361467957496643,
+ "epoch": 2.0646464646464646,
+ "grad_norm": 2.290698289871216,
+ "learning_rate": 2.9373737373737376e-06,
+ "loss": 1.3082963228225708,
+ "mean_token_accuracy": 0.6809965968132019,
+ "num_tokens": 16744448.0,
+ "step": 1022
+ },
+ {
+ "entropy": 1.633399486541748,
+ "epoch": 2.066666666666667,
+ "grad_norm": 2.1775712966918945,
+ "learning_rate": 2.9353535353535355e-06,
+ "loss": 1.6423053741455078,
+ "mean_token_accuracy": 0.639655590057373,
+ "num_tokens": 16760832.0,
+ "step": 1023
+ },
+ {
+ "entropy": 1.4717872142791748,
+ "epoch": 2.0686868686868687,
+ "grad_norm": 2.2070701122283936,
+ "learning_rate": 2.9333333333333338e-06,
+ "loss": 1.508943796157837,
+ "mean_token_accuracy": 0.6469223499298096,
+ "num_tokens": 16777216.0,
+ "step": 1024
+ },
+ {
+ "entropy": 1.1494653224945068,
+ "epoch": 2.0707070707070705,
+ "grad_norm": 2.0239098072052,
+ "learning_rate": 2.9313131313131317e-06,
+ "loss": 1.1367695331573486,
+ "mean_token_accuracy": 0.7148265838623047,
+ "num_tokens": 16793600.0,
+ "step": 1025
+ },
+ {
+ "entropy": 1.0235252380371094,
+ "epoch": 2.0727272727272728,
+ "grad_norm": 2.071176052093506,
+ "learning_rate": 2.9292929292929295e-06,
+ "loss": 1.0369395017623901,
+ "mean_token_accuracy": 0.7396799921989441,
+ "num_tokens": 16809984.0,
+ "step": 1026
+ },
+ {
+ "entropy": 1.2325578927993774,
+ "epoch": 2.0747474747474746,
+ "grad_norm": 2.212671995162964,
+ "learning_rate": 2.9272727272727274e-06,
+ "loss": 1.2429314851760864,
+ "mean_token_accuracy": 0.688568651676178,
+ "num_tokens": 16826368.0,
+ "step": 1027
+ },
+ {
+ "entropy": 1.2879300117492676,
+ "epoch": 2.076767676767677,
+ "grad_norm": 2.0366690158843994,
+ "learning_rate": 2.9252525252525253e-06,
+ "loss": 1.2931241989135742,
+ "mean_token_accuracy": 0.6813018918037415,
+ "num_tokens": 16842752.0,
+ "step": 1028
+ },
+ {
+ "entropy": 0.9473312497138977,
+ "epoch": 2.0787878787878786,
+ "grad_norm": 2.0870468616485596,
+ "learning_rate": 2.9232323232323236e-06,
+ "loss": 0.9292516708374023,
+ "mean_token_accuracy": 0.7525036931037903,
+ "num_tokens": 16859136.0,
+ "step": 1029
+ },
+ {
+ "entropy": 1.3882765769958496,
+ "epoch": 2.080808080808081,
+ "grad_norm": 2.1285617351531982,
+ "learning_rate": 2.9212121212121215e-06,
+ "loss": 1.3798363208770752,
+ "mean_token_accuracy": 0.6768441796302795,
+ "num_tokens": 16875520.0,
+ "step": 1030
+ },
+ {
+ "entropy": 1.3588547706604004,
+ "epoch": 2.0828282828282827,
+ "grad_norm": 2.2275242805480957,
+ "learning_rate": 2.9191919191919194e-06,
+ "loss": 1.3538521528244019,
+ "mean_token_accuracy": 0.6615168452262878,
+ "num_tokens": 16891904.0,
+ "step": 1031
+ },
+ {
+ "entropy": 1.0415440797805786,
+ "epoch": 2.084848484848485,
+ "grad_norm": 2.2782297134399414,
+ "learning_rate": 2.9171717171717173e-06,
+ "loss": 1.03328537940979,
+ "mean_token_accuracy": 0.7577552795410156,
+ "num_tokens": 16908288.0,
+ "step": 1032
+ },
+ {
+ "entropy": 1.241741418838501,
+ "epoch": 2.0868686868686868,
+ "grad_norm": 2.141939163208008,
+ "learning_rate": 2.915151515151515e-06,
+ "loss": 1.2248635292053223,
+ "mean_token_accuracy": 0.6950415372848511,
+ "num_tokens": 16924672.0,
+ "step": 1033
+ },
+ {
+ "entropy": 1.1192725896835327,
+ "epoch": 2.088888888888889,
+ "grad_norm": 1.9980862140655518,
+ "learning_rate": 2.913131313131313e-06,
+ "loss": 1.1176412105560303,
+ "mean_token_accuracy": 0.7272838354110718,
+ "num_tokens": 16941056.0,
+ "step": 1034
+ },
+ {
+ "entropy": 1.1871322393417358,
+ "epoch": 2.090909090909091,
+ "grad_norm": 2.1212220191955566,
+ "learning_rate": 2.9111111111111114e-06,
+ "loss": 1.1670379638671875,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 16957440.0,
+ "step": 1035
+ },
+ {
+ "entropy": 1.5194982290267944,
+ "epoch": 2.092929292929293,
+ "grad_norm": 2.2593677043914795,
+ "learning_rate": 2.9090909090909093e-06,
+ "loss": 1.50520920753479,
+ "mean_token_accuracy": 0.6475940346717834,
+ "num_tokens": 16973824.0,
+ "step": 1036
+ },
+ {
+ "entropy": 1.212785243988037,
+ "epoch": 2.094949494949495,
+ "grad_norm": 2.221132278442383,
+ "learning_rate": 2.907070707070707e-06,
+ "loss": 1.206315040588379,
+ "mean_token_accuracy": 0.7046898007392883,
+ "num_tokens": 16990208.0,
+ "step": 1037
+ },
+ {
+ "entropy": 1.2913068532943726,
+ "epoch": 2.096969696969697,
+ "grad_norm": 2.0525012016296387,
+ "learning_rate": 2.905050505050505e-06,
+ "loss": 1.2987749576568604,
+ "mean_token_accuracy": 0.6894235610961914,
+ "num_tokens": 17006592.0,
+ "step": 1038
+ },
+ {
+ "entropy": 1.139485239982605,
+ "epoch": 2.098989898989899,
+ "grad_norm": 2.093764543533325,
+ "learning_rate": 2.903030303030303e-06,
+ "loss": 1.1460036039352417,
+ "mean_token_accuracy": 0.7205055952072144,
+ "num_tokens": 17022976.0,
+ "step": 1039
+ },
+ {
+ "entropy": 1.3781968355178833,
+ "epoch": 2.101010101010101,
+ "grad_norm": 2.095311164855957,
+ "learning_rate": 2.9010101010101012e-06,
+ "loss": 1.3901969194412231,
+ "mean_token_accuracy": 0.679286777973175,
+ "num_tokens": 17039360.0,
+ "step": 1040
+ },
+ {
+ "entropy": 1.1370116472244263,
+ "epoch": 2.103030303030303,
+ "grad_norm": 2.139094352722168,
+ "learning_rate": 2.898989898989899e-06,
+ "loss": 1.1491400003433228,
+ "mean_token_accuracy": 0.72007817029953,
+ "num_tokens": 17055744.0,
+ "step": 1041
+ },
+ {
+ "entropy": 1.0845732688903809,
+ "epoch": 2.105050505050505,
+ "grad_norm": 2.180278778076172,
+ "learning_rate": 2.896969696969697e-06,
+ "loss": 1.0764763355255127,
+ "mean_token_accuracy": 0.7365657091140747,
+ "num_tokens": 17072128.0,
+ "step": 1042
+ },
+ {
+ "entropy": 1.4869064092636108,
+ "epoch": 2.107070707070707,
+ "grad_norm": 2.053727388381958,
+ "learning_rate": 2.894949494949495e-06,
+ "loss": 1.4862562417984009,
+ "mean_token_accuracy": 0.6643258333206177,
+ "num_tokens": 17088512.0,
+ "step": 1043
+ },
+ {
+ "entropy": 1.048888921737671,
+ "epoch": 2.109090909090909,
+ "grad_norm": 2.1302237510681152,
+ "learning_rate": 2.892929292929293e-06,
+ "loss": 1.0331683158874512,
+ "mean_token_accuracy": 0.7388250827789307,
+ "num_tokens": 17104896.0,
+ "step": 1044
+ },
+ {
+ "entropy": 1.2839856147766113,
+ "epoch": 2.111111111111111,
+ "grad_norm": 2.8510677814483643,
+ "learning_rate": 2.8909090909090907e-06,
+ "loss": 1.3016979694366455,
+ "mean_token_accuracy": 0.6904616355895996,
+ "num_tokens": 17121280.0,
+ "step": 1045
+ },
+ {
+ "entropy": 1.050045371055603,
+ "epoch": 2.113131313131313,
+ "grad_norm": 2.2457358837127686,
+ "learning_rate": 2.888888888888889e-06,
+ "loss": 1.0580981969833374,
+ "mean_token_accuracy": 0.7221543788909912,
+ "num_tokens": 17137664.0,
+ "step": 1046
+ },
+ {
+ "entropy": 1.3087437152862549,
+ "epoch": 2.1151515151515152,
+ "grad_norm": 2.0929996967315674,
+ "learning_rate": 2.8868686868686873e-06,
+ "loss": 1.2914986610412598,
+ "mean_token_accuracy": 0.6939423680305481,
+ "num_tokens": 17154048.0,
+ "step": 1047
+ },
+ {
+ "entropy": 1.7247086763381958,
+ "epoch": 2.117171717171717,
+ "grad_norm": 2.2230091094970703,
+ "learning_rate": 2.884848484848485e-06,
+ "loss": 1.7394956350326538,
+ "mean_token_accuracy": 0.6131533980369568,
+ "num_tokens": 17170432.0,
+ "step": 1048
+ },
+ {
+ "entropy": 1.5816357135772705,
+ "epoch": 2.1191919191919193,
+ "grad_norm": 2.196422576904297,
+ "learning_rate": 2.8828282828282835e-06,
+ "loss": 1.6226823329925537,
+ "mean_token_accuracy": 0.6375183463096619,
+ "num_tokens": 17186816.0,
+ "step": 1049
+ },
+ {
+ "entropy": 1.2316261529922485,
+ "epoch": 2.121212121212121,
+ "grad_norm": 2.173909902572632,
+ "learning_rate": 2.8808080808080814e-06,
+ "loss": 1.2228440046310425,
+ "mean_token_accuracy": 0.6940034031867981,
+ "num_tokens": 17203200.0,
+ "step": 1050
+ },
+ {
+ "epoch": 2.121212121212121,
+ "eval_entropy": 1.3722701356295617,
+ "eval_loss": 1.5385833978652954,
+ "eval_mean_token_accuracy": 0.6450051809510877,
+ "eval_num_tokens": 17203200.0,
+ "eval_runtime": 43.9186,
+ "eval_samples_per_second": 22.542,
+ "eval_steps_per_second": 2.823,
+ "step": 1050
+ },
+ {
+ "entropy": 1.3023537397384644,
+ "epoch": 2.1232323232323234,
+ "grad_norm": 2.1490018367767334,
+ "learning_rate": 2.8787878787878793e-06,
+ "loss": 1.284008264541626,
+ "mean_token_accuracy": 0.7057278752326965,
+ "num_tokens": 17219584.0,
+ "step": 1051
+ },
+ {
+ "entropy": 1.3198270797729492,
+ "epoch": 2.125252525252525,
+ "grad_norm": 2.582298994064331,
+ "learning_rate": 2.876767676767677e-06,
+ "loss": 1.3185001611709595,
+ "mean_token_accuracy": 0.6772105693817139,
+ "num_tokens": 17235968.0,
+ "step": 1052
+ },
+ {
+ "entropy": 0.8889825940132141,
+ "epoch": 2.1272727272727274,
+ "grad_norm": 2.0617194175720215,
+ "learning_rate": 2.874747474747475e-06,
+ "loss": 0.889773964881897,
+ "mean_token_accuracy": 0.767892062664032,
+ "num_tokens": 17252352.0,
+ "step": 1053
+ },
+ {
+ "entropy": 1.5485399961471558,
+ "epoch": 2.1292929292929292,
+ "grad_norm": 2.2752370834350586,
+ "learning_rate": 2.872727272727273e-06,
+ "loss": 1.5542051792144775,
+ "mean_token_accuracy": 0.6397166848182678,
+ "num_tokens": 17268736.0,
+ "step": 1054
+ },
+ {
+ "entropy": 1.3949565887451172,
+ "epoch": 2.1313131313131315,
+ "grad_norm": 2.0112996101379395,
+ "learning_rate": 2.8707070707070713e-06,
+ "loss": 1.4111721515655518,
+ "mean_token_accuracy": 0.6659746170043945,
+ "num_tokens": 17285120.0,
+ "step": 1055
+ },
+ {
+ "entropy": 1.0529720783233643,
+ "epoch": 2.1333333333333333,
+ "grad_norm": 2.2219948768615723,
+ "learning_rate": 2.868686868686869e-06,
+ "loss": 1.0484942197799683,
+ "mean_token_accuracy": 0.7224596738815308,
+ "num_tokens": 17301504.0,
+ "step": 1056
+ },
+ {
+ "entropy": 1.5362433195114136,
+ "epoch": 2.1353535353535356,
+ "grad_norm": 2.4097044467926025,
+ "learning_rate": 2.866666666666667e-06,
+ "loss": 1.5809426307678223,
+ "mean_token_accuracy": 0.6266487836837769,
+ "num_tokens": 17317888.0,
+ "step": 1057
+ },
+ {
+ "entropy": 1.6682685613632202,
+ "epoch": 2.1373737373737374,
+ "grad_norm": 2.121086359024048,
+ "learning_rate": 2.864646464646465e-06,
+ "loss": 1.6636815071105957,
+ "mean_token_accuracy": 0.6317782402038574,
+ "num_tokens": 17334272.0,
+ "step": 1058
+ },
+ {
+ "entropy": 1.5480221509933472,
+ "epoch": 2.1393939393939396,
+ "grad_norm": 2.2226176261901855,
+ "learning_rate": 2.862626262626263e-06,
+ "loss": 1.535983681678772,
+ "mean_token_accuracy": 0.6623717546463013,
+ "num_tokens": 17350656.0,
+ "step": 1059
+ },
+ {
+ "entropy": 1.3323101997375488,
+ "epoch": 2.1414141414141414,
+ "grad_norm": 2.2644572257995605,
+ "learning_rate": 2.860606060606061e-06,
+ "loss": 1.3316677808761597,
+ "mean_token_accuracy": 0.6741573214530945,
+ "num_tokens": 17367040.0,
+ "step": 1060
+ },
+ {
+ "entropy": 1.5107028484344482,
+ "epoch": 2.1434343434343432,
+ "grad_norm": 2.1291613578796387,
+ "learning_rate": 2.858585858585859e-06,
+ "loss": 1.4996232986450195,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 17383424.0,
+ "step": 1061
+ },
+ {
+ "entropy": 1.5927387475967407,
+ "epoch": 2.1454545454545455,
+ "grad_norm": 2.1977617740631104,
+ "learning_rate": 2.856565656565657e-06,
+ "loss": 1.582688331604004,
+ "mean_token_accuracy": 0.6306790709495544,
+ "num_tokens": 17399808.0,
+ "step": 1062
+ },
+ {
+ "entropy": 1.0717219114303589,
+ "epoch": 2.1474747474747473,
+ "grad_norm": 2.2494494915008545,
+ "learning_rate": 2.8545454545454548e-06,
+ "loss": 1.0780384540557861,
+ "mean_token_accuracy": 0.7214826345443726,
+ "num_tokens": 17416192.0,
+ "step": 1063
+ },
+ {
+ "entropy": 1.484608769416809,
+ "epoch": 2.1494949494949496,
+ "grad_norm": 2.20664644241333,
+ "learning_rate": 2.8525252525252527e-06,
+ "loss": 1.5074207782745361,
+ "mean_token_accuracy": 0.6502808928489685,
+ "num_tokens": 17432576.0,
+ "step": 1064
+ },
+ {
+ "entropy": 1.6607396602630615,
+ "epoch": 2.1515151515151514,
+ "grad_norm": 2.123538017272949,
+ "learning_rate": 2.850505050505051e-06,
+ "loss": 1.659307837486267,
+ "mean_token_accuracy": 0.619076669216156,
+ "num_tokens": 17448960.0,
+ "step": 1065
+ },
+ {
+ "entropy": 1.1195216178894043,
+ "epoch": 2.1535353535353536,
+ "grad_norm": 2.037261486053467,
+ "learning_rate": 2.848484848484849e-06,
+ "loss": 1.127397894859314,
+ "mean_token_accuracy": 0.7209330797195435,
+ "num_tokens": 17465344.0,
+ "step": 1066
+ },
+ {
+ "entropy": 1.0512653589248657,
+ "epoch": 2.1555555555555554,
+ "grad_norm": 2.209764003753662,
+ "learning_rate": 2.8464646464646468e-06,
+ "loss": 1.073946475982666,
+ "mean_token_accuracy": 0.717391312122345,
+ "num_tokens": 17481728.0,
+ "step": 1067
+ },
+ {
+ "entropy": 1.131946325302124,
+ "epoch": 2.1575757575757577,
+ "grad_norm": 1.9188926219940186,
+ "learning_rate": 2.8444444444444446e-06,
+ "loss": 1.11629056930542,
+ "mean_token_accuracy": 0.7220322489738464,
+ "num_tokens": 17498112.0,
+ "step": 1068
+ },
+ {
+ "entropy": 1.4745967388153076,
+ "epoch": 2.1595959595959595,
+ "grad_norm": 2.285099983215332,
+ "learning_rate": 2.8424242424242425e-06,
+ "loss": 1.4795483350753784,
+ "mean_token_accuracy": 0.6466169953346252,
+ "num_tokens": 17514496.0,
+ "step": 1069
+ },
+ {
+ "entropy": 1.2614645957946777,
+ "epoch": 2.1616161616161618,
+ "grad_norm": 2.4019627571105957,
+ "learning_rate": 2.8404040404040404e-06,
+ "loss": 1.2659732103347778,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 17530880.0,
+ "step": 1070
+ },
+ {
+ "entropy": 1.4247770309448242,
+ "epoch": 2.1636363636363636,
+ "grad_norm": 2.350632905960083,
+ "learning_rate": 2.8383838383838387e-06,
+ "loss": 1.415325403213501,
+ "mean_token_accuracy": 0.6655471324920654,
+ "num_tokens": 17547264.0,
+ "step": 1071
+ },
+ {
+ "entropy": 1.5746078491210938,
+ "epoch": 2.165656565656566,
+ "grad_norm": 2.18448543548584,
+ "learning_rate": 2.8363636363636366e-06,
+ "loss": 1.6022642850875854,
+ "mean_token_accuracy": 0.6324499249458313,
+ "num_tokens": 17563648.0,
+ "step": 1072
+ },
+ {
+ "entropy": 1.5869743824005127,
+ "epoch": 2.1676767676767676,
+ "grad_norm": 2.3553452491760254,
+ "learning_rate": 2.8343434343434345e-06,
+ "loss": 1.6163790225982666,
+ "mean_token_accuracy": 0.6199926733970642,
+ "num_tokens": 17580032.0,
+ "step": 1073
+ },
+ {
+ "entropy": 1.2412667274475098,
+ "epoch": 2.16969696969697,
+ "grad_norm": 2.209017038345337,
+ "learning_rate": 2.8323232323232324e-06,
+ "loss": 1.2491700649261475,
+ "mean_token_accuracy": 0.6911333799362183,
+ "num_tokens": 17596416.0,
+ "step": 1074
+ },
+ {
+ "entropy": 0.9127920866012573,
+ "epoch": 2.1717171717171717,
+ "grad_norm": 1.9761381149291992,
+ "learning_rate": 2.8303030303030303e-06,
+ "loss": 0.8961890339851379,
+ "mean_token_accuracy": 0.7523815631866455,
+ "num_tokens": 17612800.0,
+ "step": 1075
+ },
+ {
+ "entropy": 1.2798824310302734,
+ "epoch": 2.1737373737373735,
+ "grad_norm": 2.397031784057617,
+ "learning_rate": 2.8282828282828286e-06,
+ "loss": 1.286920189857483,
+ "mean_token_accuracy": 0.6805080771446228,
+ "num_tokens": 17629184.0,
+ "step": 1076
+ },
+ {
+ "entropy": 1.7863305807113647,
+ "epoch": 2.175757575757576,
+ "grad_norm": 2.2798852920532227,
+ "learning_rate": 2.8262626262626265e-06,
+ "loss": 1.7654080390930176,
+ "mean_token_accuracy": 0.5806057453155518,
+ "num_tokens": 17645568.0,
+ "step": 1077
+ },
+ {
+ "entropy": 1.327653408050537,
+ "epoch": 2.1777777777777776,
+ "grad_norm": 2.3473095893859863,
+ "learning_rate": 2.8242424242424244e-06,
+ "loss": 1.3175032138824463,
+ "mean_token_accuracy": 0.6750732660293579,
+ "num_tokens": 17661952.0,
+ "step": 1078
+ },
+ {
+ "entropy": 1.4917371273040771,
+ "epoch": 2.17979797979798,
+ "grad_norm": 2.181729793548584,
+ "learning_rate": 2.8222222222222223e-06,
+ "loss": 1.4738472700119019,
+ "mean_token_accuracy": 0.6619443297386169,
+ "num_tokens": 17678336.0,
+ "step": 1079
+ },
+ {
+ "entropy": 1.4644533395767212,
+ "epoch": 2.1818181818181817,
+ "grad_norm": 2.2558112144470215,
+ "learning_rate": 2.82020202020202e-06,
+ "loss": 1.4563480615615845,
+ "mean_token_accuracy": 0.6484489440917969,
+ "num_tokens": 17694720.0,
+ "step": 1080
+ },
+ {
+ "entropy": 0.7626141905784607,
+ "epoch": 2.183838383838384,
+ "grad_norm": 1.8687561750411987,
+ "learning_rate": 2.818181818181818e-06,
+ "loss": 0.7718763947486877,
+ "mean_token_accuracy": 0.7982413172721863,
+ "num_tokens": 17711104.0,
+ "step": 1081
+ },
+ {
+ "entropy": 1.0613173246383667,
+ "epoch": 2.1858585858585857,
+ "grad_norm": 2.072643995285034,
+ "learning_rate": 2.8161616161616163e-06,
+ "loss": 1.0554629564285278,
+ "mean_token_accuracy": 0.734306275844574,
+ "num_tokens": 17727488.0,
+ "step": 1082
+ },
+ {
+ "entropy": 1.0348066091537476,
+ "epoch": 2.187878787878788,
+ "grad_norm": 1.8455089330673218,
+ "learning_rate": 2.8141414141414142e-06,
+ "loss": 1.0231983661651611,
+ "mean_token_accuracy": 0.7382755279541016,
+ "num_tokens": 17743872.0,
+ "step": 1083
+ },
+ {
+ "entropy": 1.271000862121582,
+ "epoch": 2.18989898989899,
+ "grad_norm": 2.3292477130889893,
+ "learning_rate": 2.812121212121212e-06,
+ "loss": 1.2822595834732056,
+ "mean_token_accuracy": 0.6816682815551758,
+ "num_tokens": 17760256.0,
+ "step": 1084
+ },
+ {
+ "entropy": 1.62147855758667,
+ "epoch": 2.191919191919192,
+ "grad_norm": 2.3269946575164795,
+ "learning_rate": 2.81010101010101e-06,
+ "loss": 1.6017215251922607,
+ "mean_token_accuracy": 0.635808527469635,
+ "num_tokens": 17776640.0,
+ "step": 1085
+ },
+ {
+ "entropy": 1.4834544658660889,
+ "epoch": 2.193939393939394,
+ "grad_norm": 2.223590135574341,
+ "learning_rate": 2.808080808080808e-06,
+ "loss": 1.496992826461792,
+ "mean_token_accuracy": 0.6494870781898499,
+ "num_tokens": 17793024.0,
+ "step": 1086
+ },
+ {
+ "entropy": 1.4784536361694336,
+ "epoch": 2.195959595959596,
+ "grad_norm": 2.169416666030884,
+ "learning_rate": 2.806060606060606e-06,
+ "loss": 1.4766731262207031,
+ "mean_token_accuracy": 0.6543722748756409,
+ "num_tokens": 17809408.0,
+ "step": 1087
+ },
+ {
+ "entropy": 1.3650349378585815,
+ "epoch": 2.197979797979798,
+ "grad_norm": 2.1369845867156982,
+ "learning_rate": 2.804040404040404e-06,
+ "loss": 1.3475263118743896,
+ "mean_token_accuracy": 0.6712262034416199,
+ "num_tokens": 17825792.0,
+ "step": 1088
+ },
+ {
+ "entropy": 1.052316665649414,
+ "epoch": 2.2,
+ "grad_norm": 2.3176774978637695,
+ "learning_rate": 2.802020202020202e-06,
+ "loss": 1.056478500366211,
+ "mean_token_accuracy": 0.7374206185340881,
+ "num_tokens": 17842176.0,
+ "step": 1089
+ },
+ {
+ "entropy": 1.1928741931915283,
+ "epoch": 2.202020202020202,
+ "grad_norm": 2.2518808841705322,
+ "learning_rate": 2.8000000000000003e-06,
+ "loss": 1.2238969802856445,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 17858560.0,
+ "step": 1090
+ },
+ {
+ "entropy": 1.135977864265442,
+ "epoch": 2.2040404040404042,
+ "grad_norm": 2.2688262462615967,
+ "learning_rate": 2.7979797979797986e-06,
+ "loss": 1.1330978870391846,
+ "mean_token_accuracy": 0.7053004503250122,
+ "num_tokens": 17874944.0,
+ "step": 1091
+ },
+ {
+ "entropy": 1.3542495965957642,
+ "epoch": 2.206060606060606,
+ "grad_norm": 2.1078014373779297,
+ "learning_rate": 2.7959595959595965e-06,
+ "loss": 1.3983874320983887,
+ "mean_token_accuracy": 0.6840498447418213,
+ "num_tokens": 17891328.0,
+ "step": 1092
+ },
+ {
+ "entropy": 1.1861188411712646,
+ "epoch": 2.2080808080808083,
+ "grad_norm": 2.348931312561035,
+ "learning_rate": 2.7939393939393944e-06,
+ "loss": 1.1982170343399048,
+ "mean_token_accuracy": 0.7014533281326294,
+ "num_tokens": 17907712.0,
+ "step": 1093
+ },
+ {
+ "entropy": 1.2858752012252808,
+ "epoch": 2.21010101010101,
+ "grad_norm": 2.1746175289154053,
+ "learning_rate": 2.7919191919191923e-06,
+ "loss": 1.302664041519165,
+ "mean_token_accuracy": 0.6818515062332153,
+ "num_tokens": 17924096.0,
+ "step": 1094
+ },
+ {
+ "entropy": 1.4817839860916138,
+ "epoch": 2.212121212121212,
+ "grad_norm": 1.9842815399169922,
+ "learning_rate": 2.78989898989899e-06,
+ "loss": 1.5031331777572632,
+ "mean_token_accuracy": 0.6546165347099304,
+ "num_tokens": 17940480.0,
+ "step": 1095
+ },
+ {
+ "entropy": 1.2977368831634521,
+ "epoch": 2.214141414141414,
+ "grad_norm": 2.0394232273101807,
+ "learning_rate": 2.7878787878787885e-06,
+ "loss": 1.3185319900512695,
+ "mean_token_accuracy": 0.6885075569152832,
+ "num_tokens": 17956864.0,
+ "step": 1096
+ },
+ {
+ "entropy": 1.010884404182434,
+ "epoch": 2.216161616161616,
+ "grad_norm": 2.1113393306732178,
+ "learning_rate": 2.7858585858585864e-06,
+ "loss": 1.0239849090576172,
+ "mean_token_accuracy": 0.7426111102104187,
+ "num_tokens": 17973248.0,
+ "step": 1097
+ },
+ {
+ "entropy": 1.6405178308486938,
+ "epoch": 2.2181818181818183,
+ "grad_norm": 2.220865249633789,
+ "learning_rate": 2.7838383838383842e-06,
+ "loss": 1.660733938217163,
+ "mean_token_accuracy": 0.6250610947608948,
+ "num_tokens": 17989632.0,
+ "step": 1098
+ },
+ {
+ "entropy": 1.2822861671447754,
+ "epoch": 2.22020202020202,
+ "grad_norm": 2.1409878730773926,
+ "learning_rate": 2.781818181818182e-06,
+ "loss": 1.2675114870071411,
+ "mean_token_accuracy": 0.7099413871765137,
+ "num_tokens": 18006016.0,
+ "step": 1099
+ },
+ {
+ "entropy": 1.5835071802139282,
+ "epoch": 2.2222222222222223,
+ "grad_norm": 2.32753586769104,
+ "learning_rate": 2.77979797979798e-06,
+ "loss": 1.585759162902832,
+ "mean_token_accuracy": 0.6321446299552917,
+ "num_tokens": 18022400.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.2222222222222223,
+ "eval_entropy": 1.3726552551792515,
+ "eval_loss": 1.5380089282989502,
+ "eval_mean_token_accuracy": 0.645188374384757,
+ "eval_num_tokens": 18022400.0,
+ "eval_runtime": 43.7591,
+ "eval_samples_per_second": 22.624,
+ "eval_steps_per_second": 2.834,
+ "step": 1100
+ },
+ {
+ "entropy": 1.0727043151855469,
+ "epoch": 2.224242424242424,
+ "grad_norm": 2.2024266719818115,
+ "learning_rate": 2.7777777777777783e-06,
+ "loss": 1.066201090812683,
+ "mean_token_accuracy": 0.7272838354110718,
+ "num_tokens": 18038784.0,
+ "step": 1101
+ },
+ {
+ "entropy": 1.1188048124313354,
+ "epoch": 2.2262626262626264,
+ "grad_norm": 2.032862663269043,
+ "learning_rate": 2.7757575757575762e-06,
+ "loss": 1.1292006969451904,
+ "mean_token_accuracy": 0.7198949456214905,
+ "num_tokens": 18055168.0,
+ "step": 1102
+ },
+ {
+ "entropy": 1.3658474683761597,
+ "epoch": 2.228282828282828,
+ "grad_norm": 2.081120491027832,
+ "learning_rate": 2.773737373737374e-06,
+ "loss": 1.3503609895706177,
+ "mean_token_accuracy": 0.6908280253410339,
+ "num_tokens": 18071552.0,
+ "step": 1103
+ },
+ {
+ "entropy": 1.5833252668380737,
+ "epoch": 2.2303030303030305,
+ "grad_norm": 2.174055576324463,
+ "learning_rate": 2.771717171717172e-06,
+ "loss": 1.5991246700286865,
+ "mean_token_accuracy": 0.6322056651115417,
+ "num_tokens": 18087936.0,
+ "step": 1104
+ },
+ {
+ "entropy": 1.2178122997283936,
+ "epoch": 2.2323232323232323,
+ "grad_norm": 2.328620195388794,
+ "learning_rate": 2.76969696969697e-06,
+ "loss": 1.2162861824035645,
+ "mean_token_accuracy": 0.6916218996047974,
+ "num_tokens": 18104320.0,
+ "step": 1105
+ },
+ {
+ "entropy": 1.2894606590270996,
+ "epoch": 2.2343434343434345,
+ "grad_norm": 2.236239433288574,
+ "learning_rate": 2.7676767676767678e-06,
+ "loss": 1.2695279121398926,
+ "mean_token_accuracy": 0.689728856086731,
+ "num_tokens": 18120704.0,
+ "step": 1106
+ },
+ {
+ "entropy": 1.0141552686691284,
+ "epoch": 2.2363636363636363,
+ "grad_norm": 2.000847339630127,
+ "learning_rate": 2.765656565656566e-06,
+ "loss": 1.0147396326065063,
+ "mean_token_accuracy": 0.7469467520713806,
+ "num_tokens": 18137088.0,
+ "step": 1107
+ },
+ {
+ "entropy": 1.150480031967163,
+ "epoch": 2.2383838383838386,
+ "grad_norm": 2.15156888961792,
+ "learning_rate": 2.763636363636364e-06,
+ "loss": 1.1593115329742432,
+ "mean_token_accuracy": 0.7129335403442383,
+ "num_tokens": 18153472.0,
+ "step": 1108
+ },
+ {
+ "entropy": 1.4387518167495728,
+ "epoch": 2.2404040404040404,
+ "grad_norm": 2.3262319564819336,
+ "learning_rate": 2.761616161616162e-06,
+ "loss": 1.4393596649169922,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 18169856.0,
+ "step": 1109
+ },
+ {
+ "entropy": 1.205459475517273,
+ "epoch": 2.242424242424242,
+ "grad_norm": 2.223987579345703,
+ "learning_rate": 2.7595959595959597e-06,
+ "loss": 1.1871377229690552,
+ "mean_token_accuracy": 0.7018197178840637,
+ "num_tokens": 18186240.0,
+ "step": 1110
+ },
+ {
+ "entropy": 1.428817868232727,
+ "epoch": 2.2444444444444445,
+ "grad_norm": 2.091627836227417,
+ "learning_rate": 2.7575757575757576e-06,
+ "loss": 1.4262187480926514,
+ "mean_token_accuracy": 0.6708598136901855,
+ "num_tokens": 18202624.0,
+ "step": 1111
+ },
+ {
+ "entropy": 1.420682668685913,
+ "epoch": 2.2464646464646463,
+ "grad_norm": 2.30232310295105,
+ "learning_rate": 2.755555555555556e-06,
+ "loss": 1.439821720123291,
+ "mean_token_accuracy": 0.6508305072784424,
+ "num_tokens": 18219008.0,
+ "step": 1112
+ },
+ {
+ "entropy": 1.2365189790725708,
+ "epoch": 2.2484848484848485,
+ "grad_norm": 2.1747143268585205,
+ "learning_rate": 2.753535353535354e-06,
+ "loss": 1.2286595106124878,
+ "mean_token_accuracy": 0.7011480331420898,
+ "num_tokens": 18235392.0,
+ "step": 1113
+ },
+ {
+ "entropy": 1.0271798372268677,
+ "epoch": 2.2505050505050503,
+ "grad_norm": 2.1767842769622803,
+ "learning_rate": 2.7515151515151517e-06,
+ "loss": 1.018047571182251,
+ "mean_token_accuracy": 0.7297264337539673,
+ "num_tokens": 18251776.0,
+ "step": 1114
+ },
+ {
+ "entropy": 1.229053258895874,
+ "epoch": 2.2525252525252526,
+ "grad_norm": 2.390345811843872,
+ "learning_rate": 2.7494949494949496e-06,
+ "loss": 1.250126838684082,
+ "mean_token_accuracy": 0.6869809627532959,
+ "num_tokens": 18268160.0,
+ "step": 1115
+ },
+ {
+ "entropy": 1.4062843322753906,
+ "epoch": 2.2545454545454544,
+ "grad_norm": 2.220144271850586,
+ "learning_rate": 2.7474747474747475e-06,
+ "loss": 1.4262535572052002,
+ "mean_token_accuracy": 0.6592574715614319,
+ "num_tokens": 18284544.0,
+ "step": 1116
+ },
+ {
+ "entropy": 1.1991937160491943,
+ "epoch": 2.2565656565656567,
+ "grad_norm": 1.9910556077957153,
+ "learning_rate": 2.7454545454545454e-06,
+ "loss": 1.1869618892669678,
+ "mean_token_accuracy": 0.7049340605735779,
+ "num_tokens": 18300928.0,
+ "step": 1117
+ },
+ {
+ "entropy": 1.3147934675216675,
+ "epoch": 2.2585858585858585,
+ "grad_norm": 2.033942222595215,
+ "learning_rate": 2.7434343434343437e-06,
+ "loss": 1.3236720561981201,
+ "mean_token_accuracy": 0.6854543089866638,
+ "num_tokens": 18317312.0,
+ "step": 1118
+ },
+ {
+ "entropy": 1.2828413248062134,
+ "epoch": 2.2606060606060607,
+ "grad_norm": 2.2729172706604004,
+ "learning_rate": 2.7414141414141416e-06,
+ "loss": 1.2601265907287598,
+ "mean_token_accuracy": 0.6866145730018616,
+ "num_tokens": 18333696.0,
+ "step": 1119
+ },
+ {
+ "entropy": 1.9708930253982544,
+ "epoch": 2.2626262626262625,
+ "grad_norm": 2.4053614139556885,
+ "learning_rate": 2.7393939393939395e-06,
+ "loss": 1.9953765869140625,
+ "mean_token_accuracy": 0.5719345211982727,
+ "num_tokens": 18350080.0,
+ "step": 1120
+ },
+ {
+ "entropy": 1.071018099784851,
+ "epoch": 2.264646464646465,
+ "grad_norm": 2.0399091243743896,
+ "learning_rate": 2.7373737373737374e-06,
+ "loss": 1.0672862529754639,
+ "mean_token_accuracy": 0.72007817029953,
+ "num_tokens": 18366464.0,
+ "step": 1121
+ },
+ {
+ "entropy": 1.8741599321365356,
+ "epoch": 2.2666666666666666,
+ "grad_norm": 2.0918753147125244,
+ "learning_rate": 2.7353535353535353e-06,
+ "loss": 1.8604744672775269,
+ "mean_token_accuracy": 0.598436713218689,
+ "num_tokens": 18382848.0,
+ "step": 1122
+ },
+ {
+ "entropy": 1.0931968688964844,
+ "epoch": 2.268686868686869,
+ "grad_norm": 2.161102294921875,
+ "learning_rate": 2.7333333333333336e-06,
+ "loss": 1.1152517795562744,
+ "mean_token_accuracy": 0.7209330797195435,
+ "num_tokens": 18399232.0,
+ "step": 1123
+ },
+ {
+ "entropy": 1.3318616151809692,
+ "epoch": 2.2707070707070707,
+ "grad_norm": 2.200199842453003,
+ "learning_rate": 2.7313131313131315e-06,
+ "loss": 1.3456424474716187,
+ "mean_token_accuracy": 0.6789203882217407,
+ "num_tokens": 18415616.0,
+ "step": 1124
+ },
+ {
+ "entropy": 1.3777986764907837,
+ "epoch": 2.2727272727272725,
+ "grad_norm": 2.328887701034546,
+ "learning_rate": 2.7292929292929293e-06,
+ "loss": 1.3955169916152954,
+ "mean_token_accuracy": 0.6679897308349609,
+ "num_tokens": 18432000.0,
+ "step": 1125
+ },
+ {
+ "entropy": 1.0748711824417114,
+ "epoch": 2.2747474747474747,
+ "grad_norm": 2.151282787322998,
+ "learning_rate": 2.7272727272727272e-06,
+ "loss": 1.0380895137786865,
+ "mean_token_accuracy": 0.736932098865509,
+ "num_tokens": 18448384.0,
+ "step": 1126
+ },
+ {
+ "entropy": 1.4420548677444458,
+ "epoch": 2.276767676767677,
+ "grad_norm": 2.133190870285034,
+ "learning_rate": 2.725252525252525e-06,
+ "loss": 1.4465012550354004,
+ "mean_token_accuracy": 0.6784929037094116,
+ "num_tokens": 18464768.0,
+ "step": 1127
+ },
+ {
+ "entropy": 0.9478949904441833,
+ "epoch": 2.278787878787879,
+ "grad_norm": 2.0902628898620605,
+ "learning_rate": 2.7232323232323234e-06,
+ "loss": 0.9504396915435791,
+ "mean_token_accuracy": 0.7458475828170776,
+ "num_tokens": 18481152.0,
+ "step": 1128
+ },
+ {
+ "entropy": 1.367720127105713,
+ "epoch": 2.2808080808080806,
+ "grad_norm": 2.0413167476654053,
+ "learning_rate": 2.7212121212121213e-06,
+ "loss": 1.3884644508361816,
+ "mean_token_accuracy": 0.6762945652008057,
+ "num_tokens": 18497536.0,
+ "step": 1129
+ },
+ {
+ "entropy": 1.6931284666061401,
+ "epoch": 2.282828282828283,
+ "grad_norm": 2.188426971435547,
+ "learning_rate": 2.719191919191919e-06,
+ "loss": 1.7233154773712158,
+ "mean_token_accuracy": 0.6323277950286865,
+ "num_tokens": 18513920.0,
+ "step": 1130
+ },
+ {
+ "entropy": 1.563072681427002,
+ "epoch": 2.2848484848484847,
+ "grad_norm": 2.241102695465088,
+ "learning_rate": 2.717171717171717e-06,
+ "loss": 1.5677220821380615,
+ "mean_token_accuracy": 0.640693724155426,
+ "num_tokens": 18530304.0,
+ "step": 1131
+ },
+ {
+ "entropy": 1.3332083225250244,
+ "epoch": 2.286868686868687,
+ "grad_norm": 2.209522008895874,
+ "learning_rate": 2.715151515151516e-06,
+ "loss": 1.337693452835083,
+ "mean_token_accuracy": 0.6715925931930542,
+ "num_tokens": 18546688.0,
+ "step": 1132
+ },
+ {
+ "entropy": 1.5389035940170288,
+ "epoch": 2.2888888888888888,
+ "grad_norm": 2.212047815322876,
+ "learning_rate": 2.7131313131313137e-06,
+ "loss": 1.52158784866333,
+ "mean_token_accuracy": 0.6447850465774536,
+ "num_tokens": 18563072.0,
+ "step": 1133
+ },
+ {
+ "entropy": 1.2687056064605713,
+ "epoch": 2.290909090909091,
+ "grad_norm": 2.1673405170440674,
+ "learning_rate": 2.7111111111111116e-06,
+ "loss": 1.2689636945724487,
+ "mean_token_accuracy": 0.6911333799362183,
+ "num_tokens": 18579456.0,
+ "step": 1134
+ },
+ {
+ "entropy": 1.1464369297027588,
+ "epoch": 2.292929292929293,
+ "grad_norm": 1.9283273220062256,
+ "learning_rate": 2.7090909090909095e-06,
+ "loss": 1.1613389253616333,
+ "mean_token_accuracy": 0.7145212292671204,
+ "num_tokens": 18595840.0,
+ "step": 1135
+ },
+ {
+ "entropy": 1.327767252922058,
+ "epoch": 2.294949494949495,
+ "grad_norm": 2.2193424701690674,
+ "learning_rate": 2.7070707070707074e-06,
+ "loss": 1.3209152221679688,
+ "mean_token_accuracy": 0.6740962266921997,
+ "num_tokens": 18612224.0,
+ "step": 1136
+ },
+ {
+ "entropy": 1.5820066928863525,
+ "epoch": 2.296969696969697,
+ "grad_norm": 2.2020492553710938,
+ "learning_rate": 2.7050505050505057e-06,
+ "loss": 1.603272795677185,
+ "mean_token_accuracy": 0.6400830745697021,
+ "num_tokens": 18628608.0,
+ "step": 1137
+ },
+ {
+ "entropy": 1.279178500175476,
+ "epoch": 2.298989898989899,
+ "grad_norm": 2.1509714126586914,
+ "learning_rate": 2.7030303030303036e-06,
+ "loss": 1.2742427587509155,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 18644992.0,
+ "step": 1138
+ },
+ {
+ "entropy": 1.2199708223342896,
+ "epoch": 2.301010101010101,
+ "grad_norm": 2.0223684310913086,
+ "learning_rate": 2.7010101010101015e-06,
+ "loss": 1.2254796028137207,
+ "mean_token_accuracy": 0.6971787810325623,
+ "num_tokens": 18661376.0,
+ "step": 1139
+ },
+ {
+ "entropy": 1.1640081405639648,
+ "epoch": 2.303030303030303,
+ "grad_norm": 2.1907923221588135,
+ "learning_rate": 2.6989898989898994e-06,
+ "loss": 1.170613408088684,
+ "mean_token_accuracy": 0.6979726552963257,
+ "num_tokens": 18677760.0,
+ "step": 1140
+ },
+ {
+ "entropy": 1.3213385343551636,
+ "epoch": 2.305050505050505,
+ "grad_norm": 2.170276641845703,
+ "learning_rate": 2.6969696969696972e-06,
+ "loss": 1.3338474035263062,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 18694144.0,
+ "step": 1141
+ },
+ {
+ "entropy": 1.6036078929901123,
+ "epoch": 2.3070707070707073,
+ "grad_norm": 2.3499386310577393,
+ "learning_rate": 2.694949494949495e-06,
+ "loss": 1.5859179496765137,
+ "mean_token_accuracy": 0.6349536180496216,
+ "num_tokens": 18710528.0,
+ "step": 1142
+ },
+ {
+ "entropy": 1.2171586751937866,
+ "epoch": 2.309090909090909,
+ "grad_norm": 2.0380377769470215,
+ "learning_rate": 2.6929292929292934e-06,
+ "loss": 1.2191288471221924,
+ "mean_token_accuracy": 0.7063385248184204,
+ "num_tokens": 18726912.0,
+ "step": 1143
+ },
+ {
+ "entropy": 1.165902018547058,
+ "epoch": 2.311111111111111,
+ "grad_norm": 2.077310085296631,
+ "learning_rate": 2.6909090909090913e-06,
+ "loss": 1.1728768348693848,
+ "mean_token_accuracy": 0.7075598239898682,
+ "num_tokens": 18743296.0,
+ "step": 1144
+ },
+ {
+ "entropy": 1.5172539949417114,
+ "epoch": 2.313131313131313,
+ "grad_norm": 2.0132439136505127,
+ "learning_rate": 2.6888888888888892e-06,
+ "loss": 1.5073471069335938,
+ "mean_token_accuracy": 0.6546775698661804,
+ "num_tokens": 18759680.0,
+ "step": 1145
+ },
+ {
+ "entropy": 1.3588616847991943,
+ "epoch": 2.315151515151515,
+ "grad_norm": 2.1851465702056885,
+ "learning_rate": 2.686868686868687e-06,
+ "loss": 1.4111744165420532,
+ "mean_token_accuracy": 0.6750732660293579,
+ "num_tokens": 18776064.0,
+ "step": 1146
+ },
+ {
+ "entropy": 1.1948320865631104,
+ "epoch": 2.317171717171717,
+ "grad_norm": 2.1817259788513184,
+ "learning_rate": 2.684848484848485e-06,
+ "loss": 1.188377857208252,
+ "mean_token_accuracy": 0.7122007608413696,
+ "num_tokens": 18792448.0,
+ "step": 1147
+ },
+ {
+ "entropy": 1.7049702405929565,
+ "epoch": 2.319191919191919,
+ "grad_norm": 2.309352159500122,
+ "learning_rate": 2.6828282828282833e-06,
+ "loss": 1.6966536045074463,
+ "mean_token_accuracy": 0.6052759885787964,
+ "num_tokens": 18808832.0,
+ "step": 1148
+ },
+ {
+ "entropy": 1.0853440761566162,
+ "epoch": 2.3212121212121213,
+ "grad_norm": 2.1501059532165527,
+ "learning_rate": 2.680808080808081e-06,
+ "loss": 1.0747997760772705,
+ "mean_token_accuracy": 0.7195896506309509,
+ "num_tokens": 18825216.0,
+ "step": 1149
+ },
+ {
+ "entropy": 1.209170937538147,
+ "epoch": 2.323232323232323,
+ "grad_norm": 2.105555772781372,
+ "learning_rate": 2.678787878787879e-06,
+ "loss": 1.2055076360702515,
+ "mean_token_accuracy": 0.7062774896621704,
+ "num_tokens": 18841600.0,
+ "step": 1150
+ },
+ {
+ "epoch": 2.323232323232323,
+ "eval_entropy": 1.3799022854335847,
+ "eval_loss": 1.5365934371948242,
+ "eval_mean_token_accuracy": 0.6452573234996488,
+ "eval_num_tokens": 18841600.0,
+ "eval_runtime": 43.7362,
+ "eval_samples_per_second": 22.636,
+ "eval_steps_per_second": 2.835,
+ "step": 1150
+ },
+ {
+ "entropy": 0.9533048868179321,
+ "epoch": 2.3252525252525253,
+ "grad_norm": 1.9681413173675537,
+ "learning_rate": 2.676767676767677e-06,
+ "loss": 0.9284776449203491,
+ "mean_token_accuracy": 0.7609916925430298,
+ "num_tokens": 18857984.0,
+ "step": 1151
+ },
+ {
+ "entropy": 1.575872778892517,
+ "epoch": 2.327272727272727,
+ "grad_norm": 2.15085768699646,
+ "learning_rate": 2.674747474747475e-06,
+ "loss": 1.5716705322265625,
+ "mean_token_accuracy": 0.6415486335754395,
+ "num_tokens": 18874368.0,
+ "step": 1152
+ },
+ {
+ "entropy": 1.1680493354797363,
+ "epoch": 2.3292929292929294,
+ "grad_norm": 2.189589023590088,
+ "learning_rate": 2.6727272727272727e-06,
+ "loss": 1.1651779413223267,
+ "mean_token_accuracy": 0.7156203985214233,
+ "num_tokens": 18890752.0,
+ "step": 1153
+ },
+ {
+ "entropy": 1.1636664867401123,
+ "epoch": 2.3313131313131312,
+ "grad_norm": 1.9992915391921997,
+ "learning_rate": 2.670707070707071e-06,
+ "loss": 1.1650042533874512,
+ "mean_token_accuracy": 0.7116512060165405,
+ "num_tokens": 18907136.0,
+ "step": 1154
+ },
+ {
+ "entropy": 1.205094337463379,
+ "epoch": 2.3333333333333335,
+ "grad_norm": 2.070323944091797,
+ "learning_rate": 2.668686868686869e-06,
+ "loss": 1.2071596384048462,
+ "mean_token_accuracy": 0.7018197178840637,
+ "num_tokens": 18923520.0,
+ "step": 1155
+ },
+ {
+ "entropy": 1.2256643772125244,
+ "epoch": 2.3353535353535353,
+ "grad_norm": 2.144339084625244,
+ "learning_rate": 2.666666666666667e-06,
+ "loss": 1.2168457508087158,
+ "mean_token_accuracy": 0.7010869383811951,
+ "num_tokens": 18939904.0,
+ "step": 1156
+ },
+ {
+ "entropy": 1.631039023399353,
+ "epoch": 2.3373737373737375,
+ "grad_norm": 2.2886807918548584,
+ "learning_rate": 2.6646464646464647e-06,
+ "loss": 1.6534450054168701,
+ "mean_token_accuracy": 0.6248778700828552,
+ "num_tokens": 18956288.0,
+ "step": 1157
+ },
+ {
+ "entropy": 1.0360562801361084,
+ "epoch": 2.3393939393939394,
+ "grad_norm": 2.137491226196289,
+ "learning_rate": 2.6626262626262626e-06,
+ "loss": 1.0167723894119263,
+ "mean_token_accuracy": 0.7330239415168762,
+ "num_tokens": 18972672.0,
+ "step": 1158
+ },
+ {
+ "entropy": 1.2292720079421997,
+ "epoch": 2.341414141414141,
+ "grad_norm": 3.1518330574035645,
+ "learning_rate": 2.660606060606061e-06,
+ "loss": 1.2180495262145996,
+ "mean_token_accuracy": 0.6957743167877197,
+ "num_tokens": 18989056.0,
+ "step": 1159
+ },
+ {
+ "entropy": 1.2210739850997925,
+ "epoch": 2.3434343434343434,
+ "grad_norm": 2.1314170360565186,
+ "learning_rate": 2.658585858585859e-06,
+ "loss": 1.2399296760559082,
+ "mean_token_accuracy": 0.7047508358955383,
+ "num_tokens": 19005440.0,
+ "step": 1160
+ },
+ {
+ "entropy": 1.2762846946716309,
+ "epoch": 2.3454545454545457,
+ "grad_norm": 2.1767046451568604,
+ "learning_rate": 2.6565656565656567e-06,
+ "loss": 1.2640776634216309,
+ "mean_token_accuracy": 0.6954079270362854,
+ "num_tokens": 19021824.0,
+ "step": 1161
+ },
+ {
+ "entropy": 1.271180272102356,
+ "epoch": 2.3474747474747475,
+ "grad_norm": 2.121891975402832,
+ "learning_rate": 2.6545454545454546e-06,
+ "loss": 1.2666800022125244,
+ "mean_token_accuracy": 0.6880801320075989,
+ "num_tokens": 19038208.0,
+ "step": 1162
+ },
+ {
+ "entropy": 1.5604509115219116,
+ "epoch": 2.3494949494949493,
+ "grad_norm": 2.320765495300293,
+ "learning_rate": 2.6525252525252525e-06,
+ "loss": 1.5687410831451416,
+ "mean_token_accuracy": 0.627198338508606,
+ "num_tokens": 19054592.0,
+ "step": 1163
+ },
+ {
+ "entropy": 1.1606905460357666,
+ "epoch": 2.3515151515151516,
+ "grad_norm": 2.1167874336242676,
+ "learning_rate": 2.6505050505050508e-06,
+ "loss": 1.1879122257232666,
+ "mean_token_accuracy": 0.7130556702613831,
+ "num_tokens": 19070976.0,
+ "step": 1164
+ },
+ {
+ "entropy": 1.5421797037124634,
+ "epoch": 2.3535353535353534,
+ "grad_norm": 2.144657850265503,
+ "learning_rate": 2.6484848484848487e-06,
+ "loss": 1.5562596321105957,
+ "mean_token_accuracy": 0.6350146532058716,
+ "num_tokens": 19087360.0,
+ "step": 1165
+ },
+ {
+ "entropy": 1.2803337574005127,
+ "epoch": 2.3555555555555556,
+ "grad_norm": 2.0440914630889893,
+ "learning_rate": 2.6464646464646466e-06,
+ "loss": 1.3008983135223389,
+ "mean_token_accuracy": 0.6868588328361511,
+ "num_tokens": 19103744.0,
+ "step": 1166
+ },
+ {
+ "entropy": 1.1863176822662354,
+ "epoch": 2.3575757575757574,
+ "grad_norm": 2.231771469116211,
+ "learning_rate": 2.6444444444444444e-06,
+ "loss": 1.1863257884979248,
+ "mean_token_accuracy": 0.7069491744041443,
+ "num_tokens": 19120128.0,
+ "step": 1167
+ },
+ {
+ "entropy": 1.1186378002166748,
+ "epoch": 2.3595959595959597,
+ "grad_norm": 2.0704708099365234,
+ "learning_rate": 2.6424242424242423e-06,
+ "loss": 1.1196620464324951,
+ "mean_token_accuracy": 0.726062536239624,
+ "num_tokens": 19136512.0,
+ "step": 1168
+ },
+ {
+ "entropy": 1.2110928297042847,
+ "epoch": 2.3616161616161615,
+ "grad_norm": 2.251551866531372,
+ "learning_rate": 2.6404040404040402e-06,
+ "loss": 1.2020606994628906,
+ "mean_token_accuracy": 0.7058500051498413,
+ "num_tokens": 19152896.0,
+ "step": 1169
+ },
+ {
+ "entropy": 1.302309513092041,
+ "epoch": 2.3636363636363638,
+ "grad_norm": 2.171961545944214,
+ "learning_rate": 2.6383838383838385e-06,
+ "loss": 1.3029515743255615,
+ "mean_token_accuracy": 0.673363447189331,
+ "num_tokens": 19169280.0,
+ "step": 1170
+ },
+ {
+ "entropy": 1.6036607027053833,
+ "epoch": 2.3656565656565656,
+ "grad_norm": 2.336979627609253,
+ "learning_rate": 2.6363636363636364e-06,
+ "loss": 1.6076864004135132,
+ "mean_token_accuracy": 0.630984365940094,
+ "num_tokens": 19185664.0,
+ "step": 1171
+ },
+ {
+ "entropy": 1.431620478630066,
+ "epoch": 2.367676767676768,
+ "grad_norm": 2.115891218185425,
+ "learning_rate": 2.6343434343434343e-06,
+ "loss": 1.4436556100845337,
+ "mean_token_accuracy": 0.6623717546463013,
+ "num_tokens": 19202048.0,
+ "step": 1172
+ },
+ {
+ "entropy": 1.4537419080734253,
+ "epoch": 2.3696969696969696,
+ "grad_norm": 2.497891664505005,
+ "learning_rate": 2.632323232323232e-06,
+ "loss": 1.48027503490448,
+ "mean_token_accuracy": 0.6352589130401611,
+ "num_tokens": 19218432.0,
+ "step": 1173
+ },
+ {
+ "entropy": 1.292363166809082,
+ "epoch": 2.371717171717172,
+ "grad_norm": 2.0235633850097656,
+ "learning_rate": 2.63030303030303e-06,
+ "loss": 1.3111207485198975,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 19234816.0,
+ "step": 1174
+ },
+ {
+ "entropy": 1.2336944341659546,
+ "epoch": 2.3737373737373737,
+ "grad_norm": 2.342643976211548,
+ "learning_rate": 2.628282828282829e-06,
+ "loss": 1.2427266836166382,
+ "mean_token_accuracy": 0.6844772696495056,
+ "num_tokens": 19251200.0,
+ "step": 1175
+ },
+ {
+ "entropy": 1.166039228439331,
+ "epoch": 2.375757575757576,
+ "grad_norm": 2.157937526702881,
+ "learning_rate": 2.6262626262626267e-06,
+ "loss": 1.167286992073059,
+ "mean_token_accuracy": 0.7115290760993958,
+ "num_tokens": 19267584.0,
+ "step": 1176
+ },
+ {
+ "entropy": 1.3824102878570557,
+ "epoch": 2.3777777777777778,
+ "grad_norm": 2.2874608039855957,
+ "learning_rate": 2.6242424242424246e-06,
+ "loss": 1.404619574546814,
+ "mean_token_accuracy": 0.6707376837730408,
+ "num_tokens": 19283968.0,
+ "step": 1177
+ },
+ {
+ "entropy": 0.8266427516937256,
+ "epoch": 2.3797979797979796,
+ "grad_norm": 2.098217010498047,
+ "learning_rate": 2.6222222222222225e-06,
+ "loss": 0.821276068687439,
+ "mean_token_accuracy": 0.7726551294326782,
+ "num_tokens": 19300352.0,
+ "step": 1178
+ },
+ {
+ "entropy": 1.4335079193115234,
+ "epoch": 2.381818181818182,
+ "grad_norm": 2.3051438331604004,
+ "learning_rate": 2.620202020202021e-06,
+ "loss": 1.437370777130127,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 19316736.0,
+ "step": 1179
+ },
+ {
+ "entropy": 1.0816318988800049,
+ "epoch": 2.3838383838383836,
+ "grad_norm": 2.0723016262054443,
+ "learning_rate": 2.6181818181818187e-06,
+ "loss": 1.0697057247161865,
+ "mean_token_accuracy": 0.7304592132568359,
+ "num_tokens": 19333120.0,
+ "step": 1180
+ },
+ {
+ "entropy": 1.2515255212783813,
+ "epoch": 2.385858585858586,
+ "grad_norm": 2.32125186920166,
+ "learning_rate": 2.6161616161616166e-06,
+ "loss": 1.256905198097229,
+ "mean_token_accuracy": 0.697300910949707,
+ "num_tokens": 19349504.0,
+ "step": 1181
+ },
+ {
+ "entropy": 1.0271868705749512,
+ "epoch": 2.3878787878787877,
+ "grad_norm": 2.0145103931427,
+ "learning_rate": 2.6141414141414145e-06,
+ "loss": 1.0158754587173462,
+ "mean_token_accuracy": 0.7518930435180664,
+ "num_tokens": 19365888.0,
+ "step": 1182
+ },
+ {
+ "entropy": 1.2139984369277954,
+ "epoch": 2.38989898989899,
+ "grad_norm": 2.1393911838531494,
+ "learning_rate": 2.6121212121212123e-06,
+ "loss": 1.2150651216506958,
+ "mean_token_accuracy": 0.7135441899299622,
+ "num_tokens": 19382272.0,
+ "step": 1183
+ },
+ {
+ "entropy": 1.076101303100586,
+ "epoch": 2.391919191919192,
+ "grad_norm": 2.1664907932281494,
+ "learning_rate": 2.6101010101010107e-06,
+ "loss": 1.0744431018829346,
+ "mean_token_accuracy": 0.7267953157424927,
+ "num_tokens": 19398656.0,
+ "step": 1184
+ },
+ {
+ "entropy": 1.5176570415496826,
+ "epoch": 2.393939393939394,
+ "grad_norm": 2.0756311416625977,
+ "learning_rate": 2.6080808080808085e-06,
+ "loss": 1.5209624767303467,
+ "mean_token_accuracy": 0.647777259349823,
+ "num_tokens": 19415040.0,
+ "step": 1185
+ },
+ {
+ "entropy": 1.0946495532989502,
+ "epoch": 2.395959595959596,
+ "grad_norm": 2.0545496940612793,
+ "learning_rate": 2.6060606060606064e-06,
+ "loss": 1.0858100652694702,
+ "mean_token_accuracy": 0.7226428985595703,
+ "num_tokens": 19431424.0,
+ "step": 1186
+ },
+ {
+ "entropy": 0.7713431715965271,
+ "epoch": 2.397979797979798,
+ "grad_norm": 2.0606112480163574,
+ "learning_rate": 2.6040404040404043e-06,
+ "loss": 0.7782045006752014,
+ "mean_token_accuracy": 0.7804103493690491,
+ "num_tokens": 19447808.0,
+ "step": 1187
+ },
+ {
+ "entropy": 1.2803305387496948,
+ "epoch": 2.4,
+ "grad_norm": 2.2125155925750732,
+ "learning_rate": 2.602020202020202e-06,
+ "loss": 1.2971004247665405,
+ "mean_token_accuracy": 0.6787371635437012,
+ "num_tokens": 19464192.0,
+ "step": 1188
+ },
+ {
+ "entropy": 0.9156424403190613,
+ "epoch": 2.402020202020202,
+ "grad_norm": 2.032531499862671,
+ "learning_rate": 2.6e-06,
+ "loss": 0.9119267463684082,
+ "mean_token_accuracy": 0.7627015113830566,
+ "num_tokens": 19480576.0,
+ "step": 1189
+ },
+ {
+ "entropy": 1.2698813676834106,
+ "epoch": 2.404040404040404,
+ "grad_norm": 2.2204320430755615,
+ "learning_rate": 2.5979797979797984e-06,
+ "loss": 1.2934629917144775,
+ "mean_token_accuracy": 0.682584285736084,
+ "num_tokens": 19496960.0,
+ "step": 1190
+ },
+ {
+ "entropy": 1.5677871704101562,
+ "epoch": 2.4060606060606062,
+ "grad_norm": 2.229994773864746,
+ "learning_rate": 2.5959595959595963e-06,
+ "loss": 1.591191053390503,
+ "mean_token_accuracy": 0.6297020316123962,
+ "num_tokens": 19513344.0,
+ "step": 1191
+ },
+ {
+ "entropy": 1.3057011365890503,
+ "epoch": 2.408080808080808,
+ "grad_norm": 2.4158618450164795,
+ "learning_rate": 2.593939393939394e-06,
+ "loss": 1.2989580631256104,
+ "mean_token_accuracy": 0.689728856086731,
+ "num_tokens": 19529728.0,
+ "step": 1192
+ },
+ {
+ "entropy": 1.3805862665176392,
+ "epoch": 2.41010101010101,
+ "grad_norm": 2.2611825466156006,
+ "learning_rate": 2.591919191919192e-06,
+ "loss": 1.385383129119873,
+ "mean_token_accuracy": 0.6634709239006042,
+ "num_tokens": 19546112.0,
+ "step": 1193
+ },
+ {
+ "entropy": 1.8123539686203003,
+ "epoch": 2.412121212121212,
+ "grad_norm": 2.3038923740386963,
+ "learning_rate": 2.58989898989899e-06,
+ "loss": 1.80764901638031,
+ "mean_token_accuracy": 0.5925744771957397,
+ "num_tokens": 19562496.0,
+ "step": 1194
+ },
+ {
+ "entropy": 1.1476300954818726,
+ "epoch": 2.4141414141414144,
+ "grad_norm": 2.2417445182800293,
+ "learning_rate": 2.5878787878787883e-06,
+ "loss": 1.1802024841308594,
+ "mean_token_accuracy": 0.7130556702613831,
+ "num_tokens": 19578880.0,
+ "step": 1195
+ },
+ {
+ "entropy": 1.6678205728530884,
+ "epoch": 2.416161616161616,
+ "grad_norm": 2.399136781692505,
+ "learning_rate": 2.585858585858586e-06,
+ "loss": 1.6780188083648682,
+ "mean_token_accuracy": 0.6161455512046814,
+ "num_tokens": 19595264.0,
+ "step": 1196
+ },
+ {
+ "entropy": 1.053451418876648,
+ "epoch": 2.418181818181818,
+ "grad_norm": 1.9980698823928833,
+ "learning_rate": 2.583838383838384e-06,
+ "loss": 1.0241587162017822,
+ "mean_token_accuracy": 0.7372984886169434,
+ "num_tokens": 19611648.0,
+ "step": 1197
+ },
+ {
+ "entropy": 1.5389430522918701,
+ "epoch": 2.4202020202020202,
+ "grad_norm": 2.171046733856201,
+ "learning_rate": 2.581818181818182e-06,
+ "loss": 1.5499310493469238,
+ "mean_token_accuracy": 0.6422203183174133,
+ "num_tokens": 19628032.0,
+ "step": 1198
+ },
+ {
+ "entropy": 1.4151558876037598,
+ "epoch": 2.422222222222222,
+ "grad_norm": 2.185184955596924,
+ "learning_rate": 2.57979797979798e-06,
+ "loss": 1.4296989440917969,
+ "mean_token_accuracy": 0.663593053817749,
+ "num_tokens": 19644416.0,
+ "step": 1199
+ },
+ {
+ "entropy": 1.1455156803131104,
+ "epoch": 2.4242424242424243,
+ "grad_norm": 2.224477767944336,
+ "learning_rate": 2.577777777777778e-06,
+ "loss": 1.1682045459747314,
+ "mean_token_accuracy": 0.7084147334098816,
+ "num_tokens": 19660800.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.4242424242424243,
+ "eval_entropy": 1.3761802339746105,
+ "eval_loss": 1.53595769405365,
+ "eval_mean_token_accuracy": 0.6453439944213436,
+ "eval_num_tokens": 19660800.0,
+ "eval_runtime": 43.8176,
+ "eval_samples_per_second": 22.594,
+ "eval_steps_per_second": 2.83,
+ "step": 1200
+ },
+ {
+ "entropy": 1.6039199829101562,
+ "epoch": 2.426262626262626,
+ "grad_norm": 2.122072696685791,
+ "learning_rate": 2.575757575757576e-06,
+ "loss": 1.625109314918518,
+ "mean_token_accuracy": 0.6306179761886597,
+ "num_tokens": 19677184.0,
+ "step": 1201
+ },
+ {
+ "entropy": 1.2364906072616577,
+ "epoch": 2.4282828282828284,
+ "grad_norm": 2.175671339035034,
+ "learning_rate": 2.573737373737374e-06,
+ "loss": 1.2398111820220947,
+ "mean_token_accuracy": 0.6886907815933228,
+ "num_tokens": 19693568.0,
+ "step": 1202
+ },
+ {
+ "entropy": 1.2937804460525513,
+ "epoch": 2.43030303030303,
+ "grad_norm": 2.1206040382385254,
+ "learning_rate": 2.571717171717172e-06,
+ "loss": 1.3073123693466187,
+ "mean_token_accuracy": 0.6762945652008057,
+ "num_tokens": 19709952.0,
+ "step": 1203
+ },
+ {
+ "entropy": 1.0239282846450806,
+ "epoch": 2.4323232323232324,
+ "grad_norm": 1.863510012626648,
+ "learning_rate": 2.5696969696969697e-06,
+ "loss": 1.015241026878357,
+ "mean_token_accuracy": 0.7452369332313538,
+ "num_tokens": 19726336.0,
+ "step": 1204
+ },
+ {
+ "entropy": 1.2327015399932861,
+ "epoch": 2.4343434343434343,
+ "grad_norm": 1.968019962310791,
+ "learning_rate": 2.5676767676767676e-06,
+ "loss": 1.2275054454803467,
+ "mean_token_accuracy": 0.6974841356277466,
+ "num_tokens": 19742720.0,
+ "step": 1205
+ },
+ {
+ "entropy": 1.130920171737671,
+ "epoch": 2.4363636363636365,
+ "grad_norm": 2.096205949783325,
+ "learning_rate": 2.565656565656566e-06,
+ "loss": 1.1229937076568604,
+ "mean_token_accuracy": 0.7102466821670532,
+ "num_tokens": 19759104.0,
+ "step": 1206
+ },
+ {
+ "entropy": 0.9204118251800537,
+ "epoch": 2.4383838383838383,
+ "grad_norm": 1.7956496477127075,
+ "learning_rate": 2.5636363636363638e-06,
+ "loss": 0.9276518821716309,
+ "mean_token_accuracy": 0.7644113302230835,
+ "num_tokens": 19775488.0,
+ "step": 1207
+ },
+ {
+ "entropy": 0.9552480578422546,
+ "epoch": 2.4404040404040406,
+ "grad_norm": 2.0838167667388916,
+ "learning_rate": 2.5616161616161617e-06,
+ "loss": 0.9676632881164551,
+ "mean_token_accuracy": 0.7421225905418396,
+ "num_tokens": 19791872.0,
+ "step": 1208
+ },
+ {
+ "entropy": 1.0109010934829712,
+ "epoch": 2.4424242424242424,
+ "grad_norm": 2.1739392280578613,
+ "learning_rate": 2.5595959595959595e-06,
+ "loss": 1.0201005935668945,
+ "mean_token_accuracy": 0.7366267442703247,
+ "num_tokens": 19808256.0,
+ "step": 1209
+ },
+ {
+ "entropy": 1.4037907123565674,
+ "epoch": 2.4444444444444446,
+ "grad_norm": 2.151865005493164,
+ "learning_rate": 2.5575757575757574e-06,
+ "loss": 1.4110395908355713,
+ "mean_token_accuracy": 0.6682339906692505,
+ "num_tokens": 19824640.0,
+ "step": 1210
+ },
+ {
+ "entropy": 1.2449947595596313,
+ "epoch": 2.4464646464646465,
+ "grad_norm": 2.065934896469116,
+ "learning_rate": 2.5555555555555557e-06,
+ "loss": 1.2521324157714844,
+ "mean_token_accuracy": 0.6952247023582458,
+ "num_tokens": 19841024.0,
+ "step": 1211
+ },
+ {
+ "entropy": 1.2075072526931763,
+ "epoch": 2.4484848484848483,
+ "grad_norm": 2.197885274887085,
+ "learning_rate": 2.5535353535353536e-06,
+ "loss": 1.2041654586791992,
+ "mean_token_accuracy": 0.69840008020401,
+ "num_tokens": 19857408.0,
+ "step": 1212
+ },
+ {
+ "entropy": 1.0454095602035522,
+ "epoch": 2.4505050505050505,
+ "grad_norm": 2.0778188705444336,
+ "learning_rate": 2.5515151515151515e-06,
+ "loss": 1.0392906665802002,
+ "mean_token_accuracy": 0.74187833070755,
+ "num_tokens": 19873792.0,
+ "step": 1213
+ },
+ {
+ "entropy": 1.3138911724090576,
+ "epoch": 2.4525252525252528,
+ "grad_norm": 2.1871910095214844,
+ "learning_rate": 2.5494949494949494e-06,
+ "loss": 1.317048192024231,
+ "mean_token_accuracy": 0.6720811128616333,
+ "num_tokens": 19890176.0,
+ "step": 1214
+ },
+ {
+ "entropy": 1.263680338859558,
+ "epoch": 2.4545454545454546,
+ "grad_norm": 2.129873752593994,
+ "learning_rate": 2.5474747474747473e-06,
+ "loss": 1.277045726776123,
+ "mean_token_accuracy": 0.7011480331420898,
+ "num_tokens": 19906560.0,
+ "step": 1215
+ },
+ {
+ "entropy": 0.9653311967849731,
+ "epoch": 2.4565656565656564,
+ "grad_norm": 2.1161508560180664,
+ "learning_rate": 2.5454545454545456e-06,
+ "loss": 0.9699352979660034,
+ "mean_token_accuracy": 0.7437713742256165,
+ "num_tokens": 19922944.0,
+ "step": 1216
+ },
+ {
+ "entropy": 1.350392460823059,
+ "epoch": 2.4585858585858587,
+ "grad_norm": 2.0958914756774902,
+ "learning_rate": 2.5434343434343435e-06,
+ "loss": 1.3442802429199219,
+ "mean_token_accuracy": 0.6768441796302795,
+ "num_tokens": 19939328.0,
+ "step": 1217
+ },
+ {
+ "entropy": 1.2484683990478516,
+ "epoch": 2.4606060606060605,
+ "grad_norm": 2.191668748855591,
+ "learning_rate": 2.541414141414142e-06,
+ "loss": 1.2663497924804688,
+ "mean_token_accuracy": 0.6958964467048645,
+ "num_tokens": 19955712.0,
+ "step": 1218
+ },
+ {
+ "entropy": 0.9751343131065369,
+ "epoch": 2.4626262626262627,
+ "grad_norm": 2.0976815223693848,
+ "learning_rate": 2.5393939393939397e-06,
+ "loss": 0.9734562635421753,
+ "mean_token_accuracy": 0.7372373938560486,
+ "num_tokens": 19972096.0,
+ "step": 1219
+ },
+ {
+ "entropy": 1.1655267477035522,
+ "epoch": 2.4646464646464645,
+ "grad_norm": 2.3504767417907715,
+ "learning_rate": 2.537373737373738e-06,
+ "loss": 1.1775636672973633,
+ "mean_token_accuracy": 0.7023082375526428,
+ "num_tokens": 19988480.0,
+ "step": 1220
+ },
+ {
+ "entropy": 1.3543325662612915,
+ "epoch": 2.466666666666667,
+ "grad_norm": 2.038313627243042,
+ "learning_rate": 2.535353535353536e-06,
+ "loss": 1.3447773456573486,
+ "mean_token_accuracy": 0.6779433488845825,
+ "num_tokens": 20004864.0,
+ "step": 1221
+ },
+ {
+ "entropy": 1.1814380884170532,
+ "epoch": 2.4686868686868686,
+ "grad_norm": 2.186947822570801,
+ "learning_rate": 2.5333333333333338e-06,
+ "loss": 1.186347246170044,
+ "mean_token_accuracy": 0.7064606547355652,
+ "num_tokens": 20021248.0,
+ "step": 1222
+ },
+ {
+ "entropy": 0.9775183796882629,
+ "epoch": 2.470707070707071,
+ "grad_norm": 2.144923210144043,
+ "learning_rate": 2.5313131313131317e-06,
+ "loss": 1.0010652542114258,
+ "mean_token_accuracy": 0.7385808229446411,
+ "num_tokens": 20037632.0,
+ "step": 1223
+ },
+ {
+ "entropy": 1.6076546907424927,
+ "epoch": 2.4727272727272727,
+ "grad_norm": 2.1664817333221436,
+ "learning_rate": 2.5292929292929296e-06,
+ "loss": 1.618837594985962,
+ "mean_token_accuracy": 0.6297630667686462,
+ "num_tokens": 20054016.0,
+ "step": 1224
+ },
+ {
+ "entropy": 1.0457805395126343,
+ "epoch": 2.474747474747475,
+ "grad_norm": 2.154000997543335,
+ "learning_rate": 2.5272727272727274e-06,
+ "loss": 1.0406007766723633,
+ "mean_token_accuracy": 0.7322911620140076,
+ "num_tokens": 20070400.0,
+ "step": 1225
+ },
+ {
+ "entropy": 1.065863847732544,
+ "epoch": 2.4767676767676767,
+ "grad_norm": 2.062626361846924,
+ "learning_rate": 2.5252525252525258e-06,
+ "loss": 1.0432696342468262,
+ "mean_token_accuracy": 0.7371152639389038,
+ "num_tokens": 20086784.0,
+ "step": 1226
+ },
+ {
+ "entropy": 1.5166304111480713,
+ "epoch": 2.4787878787878785,
+ "grad_norm": 2.089587926864624,
+ "learning_rate": 2.5232323232323236e-06,
+ "loss": 1.5205962657928467,
+ "mean_token_accuracy": 0.653822660446167,
+ "num_tokens": 20103168.0,
+ "step": 1227
+ },
+ {
+ "entropy": 1.5969332456588745,
+ "epoch": 2.480808080808081,
+ "grad_norm": 2.297184705734253,
+ "learning_rate": 2.5212121212121215e-06,
+ "loss": 1.611903190612793,
+ "mean_token_accuracy": 0.6246336102485657,
+ "num_tokens": 20119552.0,
+ "step": 1228
+ },
+ {
+ "entropy": 1.8385323286056519,
+ "epoch": 2.482828282828283,
+ "grad_norm": 2.0568299293518066,
+ "learning_rate": 2.5191919191919194e-06,
+ "loss": 1.848689079284668,
+ "mean_token_accuracy": 0.6079018115997314,
+ "num_tokens": 20135936.0,
+ "step": 1229
+ },
+ {
+ "entropy": 1.1586394309997559,
+ "epoch": 2.484848484848485,
+ "grad_norm": 1.91037917137146,
+ "learning_rate": 2.5171717171717173e-06,
+ "loss": 1.1482139825820923,
+ "mean_token_accuracy": 0.7165364027023315,
+ "num_tokens": 20152320.0,
+ "step": 1230
+ },
+ {
+ "entropy": 1.6905426979064941,
+ "epoch": 2.4868686868686867,
+ "grad_norm": 2.2317121028900146,
+ "learning_rate": 2.5151515151515156e-06,
+ "loss": 1.7028450965881348,
+ "mean_token_accuracy": 0.6125427484512329,
+ "num_tokens": 20168704.0,
+ "step": 1231
+ },
+ {
+ "entropy": 1.1329548358917236,
+ "epoch": 2.488888888888889,
+ "grad_norm": 2.112380027770996,
+ "learning_rate": 2.5131313131313135e-06,
+ "loss": 1.120601773262024,
+ "mean_token_accuracy": 0.7181240916252136,
+ "num_tokens": 20185088.0,
+ "step": 1232
+ },
+ {
+ "entropy": 1.2013109922409058,
+ "epoch": 2.4909090909090907,
+ "grad_norm": 2.087054491043091,
+ "learning_rate": 2.5111111111111114e-06,
+ "loss": 1.2169899940490723,
+ "mean_token_accuracy": 0.7089032530784607,
+ "num_tokens": 20201472.0,
+ "step": 1233
+ },
+ {
+ "entropy": 1.187458872795105,
+ "epoch": 2.492929292929293,
+ "grad_norm": 2.431793689727783,
+ "learning_rate": 2.5090909090909093e-06,
+ "loss": 1.2183618545532227,
+ "mean_token_accuracy": 0.6925378441810608,
+ "num_tokens": 20217856.0,
+ "step": 1234
+ },
+ {
+ "entropy": 1.2123541831970215,
+ "epoch": 2.494949494949495,
+ "grad_norm": 2.1715121269226074,
+ "learning_rate": 2.507070707070707e-06,
+ "loss": 1.2254973649978638,
+ "mean_token_accuracy": 0.703285276889801,
+ "num_tokens": 20234240.0,
+ "step": 1235
+ },
+ {
+ "entropy": 1.0582001209259033,
+ "epoch": 2.496969696969697,
+ "grad_norm": 2.222578763961792,
+ "learning_rate": 2.5050505050505055e-06,
+ "loss": 1.061441421508789,
+ "mean_token_accuracy": 0.7247191071510315,
+ "num_tokens": 20250624.0,
+ "step": 1236
+ },
+ {
+ "entropy": 1.5102840662002563,
+ "epoch": 2.498989898989899,
+ "grad_norm": 2.27860951423645,
+ "learning_rate": 2.5030303030303034e-06,
+ "loss": 1.519880771636963,
+ "mean_token_accuracy": 0.6581583023071289,
+ "num_tokens": 20267008.0,
+ "step": 1237
+ },
+ {
+ "entropy": 1.222317099571228,
+ "epoch": 2.501010101010101,
+ "grad_norm": 2.182908773422241,
+ "learning_rate": 2.5010101010101013e-06,
+ "loss": 1.2382556200027466,
+ "mean_token_accuracy": 0.6908891201019287,
+ "num_tokens": 20283392.0,
+ "step": 1238
+ },
+ {
+ "entropy": 1.252193570137024,
+ "epoch": 2.503030303030303,
+ "grad_norm": 2.2065556049346924,
+ "learning_rate": 2.498989898989899e-06,
+ "loss": 1.2510521411895752,
+ "mean_token_accuracy": 0.6914386749267578,
+ "num_tokens": 20299776.0,
+ "step": 1239
+ },
+ {
+ "entropy": 1.2909793853759766,
+ "epoch": 2.505050505050505,
+ "grad_norm": 2.374338150024414,
+ "learning_rate": 2.496969696969697e-06,
+ "loss": 1.3144972324371338,
+ "mean_token_accuracy": 0.6847215294837952,
+ "num_tokens": 20316160.0,
+ "step": 1240
+ },
+ {
+ "entropy": 1.5218966007232666,
+ "epoch": 2.507070707070707,
+ "grad_norm": 2.3914759159088135,
+ "learning_rate": 2.494949494949495e-06,
+ "loss": 1.5194602012634277,
+ "mean_token_accuracy": 0.6398998498916626,
+ "num_tokens": 20332544.0,
+ "step": 1241
+ },
+ {
+ "entropy": 1.2130569219589233,
+ "epoch": 2.509090909090909,
+ "grad_norm": 2.2857706546783447,
+ "learning_rate": 2.4929292929292932e-06,
+ "loss": 1.2035828828811646,
+ "mean_token_accuracy": 0.6977283954620361,
+ "num_tokens": 20348928.0,
+ "step": 1242
+ },
+ {
+ "entropy": 1.623070478439331,
+ "epoch": 2.511111111111111,
+ "grad_norm": 2.3757028579711914,
+ "learning_rate": 2.490909090909091e-06,
+ "loss": 1.654674768447876,
+ "mean_token_accuracy": 0.6242061257362366,
+ "num_tokens": 20365312.0,
+ "step": 1243
+ },
+ {
+ "entropy": 1.6762864589691162,
+ "epoch": 2.5131313131313133,
+ "grad_norm": 2.239466667175293,
+ "learning_rate": 2.488888888888889e-06,
+ "loss": 1.6712524890899658,
+ "mean_token_accuracy": 0.6280532479286194,
+ "num_tokens": 20381696.0,
+ "step": 1244
+ },
+ {
+ "entropy": 1.6754344701766968,
+ "epoch": 2.515151515151515,
+ "grad_norm": 2.2599003314971924,
+ "learning_rate": 2.486868686868687e-06,
+ "loss": 1.6697289943695068,
+ "mean_token_accuracy": 0.6158402562141418,
+ "num_tokens": 20398080.0,
+ "step": 1245
+ },
+ {
+ "entropy": 1.6282587051391602,
+ "epoch": 2.517171717171717,
+ "grad_norm": 2.0555050373077393,
+ "learning_rate": 2.4848484848484848e-06,
+ "loss": 1.6177103519439697,
+ "mean_token_accuracy": 0.63312166929245,
+ "num_tokens": 20414464.0,
+ "step": 1246
+ },
+ {
+ "entropy": 1.3457770347595215,
+ "epoch": 2.519191919191919,
+ "grad_norm": 2.3396496772766113,
+ "learning_rate": 2.482828282828283e-06,
+ "loss": 1.3288640975952148,
+ "mean_token_accuracy": 0.6720811128616333,
+ "num_tokens": 20430848.0,
+ "step": 1247
+ },
+ {
+ "entropy": 1.5269931554794312,
+ "epoch": 2.5212121212121215,
+ "grad_norm": 2.303053617477417,
+ "learning_rate": 2.480808080808081e-06,
+ "loss": 1.4953217506408691,
+ "mean_token_accuracy": 0.639167070388794,
+ "num_tokens": 20447232.0,
+ "step": 1248
+ },
+ {
+ "entropy": 1.3399546146392822,
+ "epoch": 2.5232323232323233,
+ "grad_norm": 2.3238017559051514,
+ "learning_rate": 2.478787878787879e-06,
+ "loss": 1.337552547454834,
+ "mean_token_accuracy": 0.6790425181388855,
+ "num_tokens": 20463616.0,
+ "step": 1249
+ },
+ {
+ "entropy": 1.0954687595367432,
+ "epoch": 2.525252525252525,
+ "grad_norm": 2.2266361713409424,
+ "learning_rate": 2.476767676767677e-06,
+ "loss": 1.074552297592163,
+ "mean_token_accuracy": 0.7192232608795166,
+ "num_tokens": 20480000.0,
+ "step": 1250
+ },
+ {
+ "epoch": 2.525252525252525,
+ "eval_entropy": 1.375552624464035,
+ "eval_loss": 1.5356626510620117,
+ "eval_mean_token_accuracy": 0.6455749580937047,
+ "eval_num_tokens": 20480000.0,
+ "eval_runtime": 43.8024,
+ "eval_samples_per_second": 22.602,
+ "eval_steps_per_second": 2.831,
+ "step": 1250
+ },
+ {
+ "entropy": 1.329379916191101,
+ "epoch": 2.5272727272727273,
+ "grad_norm": 2.288421392440796,
+ "learning_rate": 2.474747474747475e-06,
+ "loss": 1.3166120052337646,
+ "mean_token_accuracy": 0.6743404865264893,
+ "num_tokens": 20496384.0,
+ "step": 1251
+ },
+ {
+ "entropy": 1.3155947923660278,
+ "epoch": 2.529292929292929,
+ "grad_norm": 2.2791004180908203,
+ "learning_rate": 2.472727272727273e-06,
+ "loss": 1.3281152248382568,
+ "mean_token_accuracy": 0.6623717546463013,
+ "num_tokens": 20512768.0,
+ "step": 1252
+ },
+ {
+ "entropy": 1.2875827550888062,
+ "epoch": 2.5313131313131314,
+ "grad_norm": 2.193981409072876,
+ "learning_rate": 2.470707070707071e-06,
+ "loss": 1.280174732208252,
+ "mean_token_accuracy": 0.6996824741363525,
+ "num_tokens": 20529152.0,
+ "step": 1253
+ },
+ {
+ "entropy": 1.1551588773727417,
+ "epoch": 2.533333333333333,
+ "grad_norm": 2.297534942626953,
+ "learning_rate": 2.468686868686869e-06,
+ "loss": 1.1548980474472046,
+ "mean_token_accuracy": 0.7089643478393555,
+ "num_tokens": 20545536.0,
+ "step": 1254
+ },
+ {
+ "entropy": 1.1836578845977783,
+ "epoch": 2.5353535353535355,
+ "grad_norm": 2.1724929809570312,
+ "learning_rate": 2.466666666666667e-06,
+ "loss": 1.1787464618682861,
+ "mean_token_accuracy": 0.705422580242157,
+ "num_tokens": 20561920.0,
+ "step": 1255
+ },
+ {
+ "entropy": 1.0938197374343872,
+ "epoch": 2.5373737373737373,
+ "grad_norm": 2.247507095336914,
+ "learning_rate": 2.464646464646465e-06,
+ "loss": 1.0977723598480225,
+ "mean_token_accuracy": 0.7205055952072144,
+ "num_tokens": 20578304.0,
+ "step": 1256
+ },
+ {
+ "entropy": 1.790277361869812,
+ "epoch": 2.5393939393939395,
+ "grad_norm": 2.314159631729126,
+ "learning_rate": 2.462626262626263e-06,
+ "loss": 1.792272925376892,
+ "mean_token_accuracy": 0.6231069564819336,
+ "num_tokens": 20594688.0,
+ "step": 1257
+ },
+ {
+ "entropy": 1.385352611541748,
+ "epoch": 2.5414141414141413,
+ "grad_norm": 2.2065250873565674,
+ "learning_rate": 2.4606060606060607e-06,
+ "loss": 1.4161381721496582,
+ "mean_token_accuracy": 0.673363447189331,
+ "num_tokens": 20611072.0,
+ "step": 1258
+ },
+ {
+ "entropy": 1.5186140537261963,
+ "epoch": 2.5434343434343436,
+ "grad_norm": 2.277163028717041,
+ "learning_rate": 2.4585858585858586e-06,
+ "loss": 1.5157082080841064,
+ "mean_token_accuracy": 0.6420371532440186,
+ "num_tokens": 20627456.0,
+ "step": 1259
+ },
+ {
+ "entropy": 1.6179429292678833,
+ "epoch": 2.5454545454545454,
+ "grad_norm": 2.1880221366882324,
+ "learning_rate": 2.456565656565657e-06,
+ "loss": 1.6365107297897339,
+ "mean_token_accuracy": 0.6164509057998657,
+ "num_tokens": 20643840.0,
+ "step": 1260
+ },
+ {
+ "entropy": 1.5839602947235107,
+ "epoch": 2.5474747474747472,
+ "grad_norm": 2.3658924102783203,
+ "learning_rate": 2.454545454545455e-06,
+ "loss": 1.593346118927002,
+ "mean_token_accuracy": 0.6339765787124634,
+ "num_tokens": 20660224.0,
+ "step": 1261
+ },
+ {
+ "entropy": 1.3825792074203491,
+ "epoch": 2.5494949494949495,
+ "grad_norm": 2.3293564319610596,
+ "learning_rate": 2.4525252525252527e-06,
+ "loss": 1.44181489944458,
+ "mean_token_accuracy": 0.6660356521606445,
+ "num_tokens": 20676608.0,
+ "step": 1262
+ },
+ {
+ "entropy": 1.0796198844909668,
+ "epoch": 2.5515151515151517,
+ "grad_norm": 2.1055870056152344,
+ "learning_rate": 2.4505050505050506e-06,
+ "loss": 1.0861892700195312,
+ "mean_token_accuracy": 0.7263067960739136,
+ "num_tokens": 20692992.0,
+ "step": 1263
+ },
+ {
+ "entropy": 1.4059629440307617,
+ "epoch": 2.5535353535353535,
+ "grad_norm": 2.137063980102539,
+ "learning_rate": 2.4484848484848485e-06,
+ "loss": 1.4127235412597656,
+ "mean_token_accuracy": 0.6654250025749207,
+ "num_tokens": 20709376.0,
+ "step": 1264
+ },
+ {
+ "entropy": 1.2902467250823975,
+ "epoch": 2.5555555555555554,
+ "grad_norm": 2.175401210784912,
+ "learning_rate": 2.4464646464646468e-06,
+ "loss": 1.2854642868041992,
+ "mean_token_accuracy": 0.6966292262077332,
+ "num_tokens": 20725760.0,
+ "step": 1265
+ },
+ {
+ "entropy": 1.7958943843841553,
+ "epoch": 2.5575757575757576,
+ "grad_norm": 2.3500523567199707,
+ "learning_rate": 2.4444444444444447e-06,
+ "loss": 1.811906337738037,
+ "mean_token_accuracy": 0.5961162447929382,
+ "num_tokens": 20742144.0,
+ "step": 1266
+ },
+ {
+ "entropy": 1.7406131029129028,
+ "epoch": 2.55959595959596,
+ "grad_norm": 2.3911163806915283,
+ "learning_rate": 2.4424242424242426e-06,
+ "loss": 1.7608356475830078,
+ "mean_token_accuracy": 0.6002076268196106,
+ "num_tokens": 20758528.0,
+ "step": 1267
+ },
+ {
+ "entropy": 1.440137267112732,
+ "epoch": 2.5616161616161617,
+ "grad_norm": 2.057145833969116,
+ "learning_rate": 2.4404040404040404e-06,
+ "loss": 1.4450485706329346,
+ "mean_token_accuracy": 0.6570591330528259,
+ "num_tokens": 20774912.0,
+ "step": 1268
+ },
+ {
+ "entropy": 1.510685682296753,
+ "epoch": 2.5636363636363635,
+ "grad_norm": 2.379920244216919,
+ "learning_rate": 2.4383838383838383e-06,
+ "loss": 1.5113954544067383,
+ "mean_token_accuracy": 0.6450293064117432,
+ "num_tokens": 20791296.0,
+ "step": 1269
+ },
+ {
+ "entropy": 1.3595963716506958,
+ "epoch": 2.5656565656565657,
+ "grad_norm": 2.226229190826416,
+ "learning_rate": 2.4363636363636366e-06,
+ "loss": 1.3598928451538086,
+ "mean_token_accuracy": 0.6723864078521729,
+ "num_tokens": 20807680.0,
+ "step": 1270
+ },
+ {
+ "entropy": 1.3053373098373413,
+ "epoch": 2.5676767676767676,
+ "grad_norm": 2.181692361831665,
+ "learning_rate": 2.4343434343434345e-06,
+ "loss": 1.283501148223877,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 20824064.0,
+ "step": 1271
+ },
+ {
+ "entropy": 0.9631388187408447,
+ "epoch": 2.56969696969697,
+ "grad_norm": 2.083442449569702,
+ "learning_rate": 2.432323232323233e-06,
+ "loss": 0.9463216066360474,
+ "mean_token_accuracy": 0.7476184368133545,
+ "num_tokens": 20840448.0,
+ "step": 1272
+ },
+ {
+ "entropy": 1.0792899131774902,
+ "epoch": 2.5717171717171716,
+ "grad_norm": 2.204257011413574,
+ "learning_rate": 2.4303030303030307e-06,
+ "loss": 1.0787214040756226,
+ "mean_token_accuracy": 0.7241694927215576,
+ "num_tokens": 20856832.0,
+ "step": 1273
+ },
+ {
+ "entropy": 1.0843226909637451,
+ "epoch": 2.573737373737374,
+ "grad_norm": 2.0145976543426514,
+ "learning_rate": 2.4282828282828286e-06,
+ "loss": 1.0722554922103882,
+ "mean_token_accuracy": 0.7263678312301636,
+ "num_tokens": 20873216.0,
+ "step": 1274
+ },
+ {
+ "entropy": 1.5040221214294434,
+ "epoch": 2.5757575757575757,
+ "grad_norm": 2.3076000213623047,
+ "learning_rate": 2.4262626262626265e-06,
+ "loss": 1.5152506828308105,
+ "mean_token_accuracy": 0.6420371532440186,
+ "num_tokens": 20889600.0,
+ "step": 1275
+ },
+ {
+ "entropy": 1.5882561206817627,
+ "epoch": 2.5777777777777775,
+ "grad_norm": 2.093400716781616,
+ "learning_rate": 2.4242424242424244e-06,
+ "loss": 1.5827500820159912,
+ "mean_token_accuracy": 0.6293356418609619,
+ "num_tokens": 20905984.0,
+ "step": 1276
+ },
+ {
+ "entropy": 1.1761770248413086,
+ "epoch": 2.5797979797979798,
+ "grad_norm": 1.9723676443099976,
+ "learning_rate": 2.4222222222222223e-06,
+ "loss": 1.1729084253311157,
+ "mean_token_accuracy": 0.7160478830337524,
+ "num_tokens": 20922368.0,
+ "step": 1277
+ },
+ {
+ "entropy": 1.5020796060562134,
+ "epoch": 2.581818181818182,
+ "grad_norm": 2.198739767074585,
+ "learning_rate": 2.4202020202020206e-06,
+ "loss": 1.5012025833129883,
+ "mean_token_accuracy": 0.6408768892288208,
+ "num_tokens": 20938752.0,
+ "step": 1278
+ },
+ {
+ "entropy": 1.0234061479568481,
+ "epoch": 2.583838383838384,
+ "grad_norm": 2.0784571170806885,
+ "learning_rate": 2.4181818181818185e-06,
+ "loss": 1.0343588590621948,
+ "mean_token_accuracy": 0.7372984886169434,
+ "num_tokens": 20955136.0,
+ "step": 1279
+ },
+ {
+ "entropy": 1.6372766494750977,
+ "epoch": 2.5858585858585856,
+ "grad_norm": 2.339104652404785,
+ "learning_rate": 2.4161616161616164e-06,
+ "loss": 1.6200227737426758,
+ "mean_token_accuracy": 0.6249389052391052,
+ "num_tokens": 20971520.0,
+ "step": 1280
+ },
+ {
+ "entropy": 1.3991668224334717,
+ "epoch": 2.587878787878788,
+ "grad_norm": 2.33329439163208,
+ "learning_rate": 2.4141414141414143e-06,
+ "loss": 1.434525489807129,
+ "mean_token_accuracy": 0.6656692624092102,
+ "num_tokens": 20987904.0,
+ "step": 1281
+ },
+ {
+ "entropy": 0.9680843949317932,
+ "epoch": 2.58989898989899,
+ "grad_norm": 2.0454914569854736,
+ "learning_rate": 2.412121212121212e-06,
+ "loss": 0.9875590801239014,
+ "mean_token_accuracy": 0.7512823939323425,
+ "num_tokens": 21004288.0,
+ "step": 1282
+ },
+ {
+ "entropy": 1.1564005613327026,
+ "epoch": 2.591919191919192,
+ "grad_norm": 2.0994997024536133,
+ "learning_rate": 2.4101010101010105e-06,
+ "loss": 1.1473734378814697,
+ "mean_token_accuracy": 0.709208607673645,
+ "num_tokens": 21020672.0,
+ "step": 1283
+ },
+ {
+ "entropy": 1.435438871383667,
+ "epoch": 2.5939393939393938,
+ "grad_norm": 2.369999408721924,
+ "learning_rate": 2.4080808080808083e-06,
+ "loss": 1.4502406120300293,
+ "mean_token_accuracy": 0.6505251526832581,
+ "num_tokens": 21037056.0,
+ "step": 1284
+ },
+ {
+ "entropy": 1.358853816986084,
+ "epoch": 2.595959595959596,
+ "grad_norm": 4.034506320953369,
+ "learning_rate": 2.4060606060606062e-06,
+ "loss": 1.3811532258987427,
+ "mean_token_accuracy": 0.6720200181007385,
+ "num_tokens": 21053440.0,
+ "step": 1285
+ },
+ {
+ "entropy": 1.2741261720657349,
+ "epoch": 2.597979797979798,
+ "grad_norm": 2.231471061706543,
+ "learning_rate": 2.404040404040404e-06,
+ "loss": 1.2811863422393799,
+ "mean_token_accuracy": 0.6806302070617676,
+ "num_tokens": 21069824.0,
+ "step": 1286
+ },
+ {
+ "entropy": 1.3789101839065552,
+ "epoch": 2.6,
+ "grad_norm": 2.287457227706909,
+ "learning_rate": 2.402020202020202e-06,
+ "loss": 1.389050006866455,
+ "mean_token_accuracy": 0.6687836050987244,
+ "num_tokens": 21086208.0,
+ "step": 1287
+ },
+ {
+ "entropy": 1.0021989345550537,
+ "epoch": 2.602020202020202,
+ "grad_norm": 1.9996925592422485,
+ "learning_rate": 2.4000000000000003e-06,
+ "loss": 1.028086543083191,
+ "mean_token_accuracy": 0.7479237914085388,
+ "num_tokens": 21102592.0,
+ "step": 1288
+ },
+ {
+ "entropy": 1.4363199472427368,
+ "epoch": 2.604040404040404,
+ "grad_norm": 2.203239917755127,
+ "learning_rate": 2.397979797979798e-06,
+ "loss": 1.4645861387252808,
+ "mean_token_accuracy": 0.6590132117271423,
+ "num_tokens": 21118976.0,
+ "step": 1289
+ },
+ {
+ "entropy": 1.307484745979309,
+ "epoch": 2.606060606060606,
+ "grad_norm": 1.9925199747085571,
+ "learning_rate": 2.395959595959596e-06,
+ "loss": 1.3217129707336426,
+ "mean_token_accuracy": 0.6787371635437012,
+ "num_tokens": 21135360.0,
+ "step": 1290
+ },
+ {
+ "entropy": 1.2430635690689087,
+ "epoch": 2.608080808080808,
+ "grad_norm": 2.1385529041290283,
+ "learning_rate": 2.393939393939394e-06,
+ "loss": 1.238807201385498,
+ "mean_token_accuracy": 0.6949804425239563,
+ "num_tokens": 21151744.0,
+ "step": 1291
+ },
+ {
+ "entropy": 1.0351316928863525,
+ "epoch": 2.61010101010101,
+ "grad_norm": 2.2897744178771973,
+ "learning_rate": 2.3919191919191923e-06,
+ "loss": 1.032408595085144,
+ "mean_token_accuracy": 0.7267953157424927,
+ "num_tokens": 21168128.0,
+ "step": 1292
+ },
+ {
+ "entropy": 1.2167868614196777,
+ "epoch": 2.6121212121212123,
+ "grad_norm": 2.021771192550659,
+ "learning_rate": 2.38989898989899e-06,
+ "loss": 1.223731279373169,
+ "mean_token_accuracy": 0.7067049145698547,
+ "num_tokens": 21184512.0,
+ "step": 1293
+ },
+ {
+ "entropy": 1.0386477708816528,
+ "epoch": 2.614141414141414,
+ "grad_norm": 2.048285722732544,
+ "learning_rate": 2.387878787878788e-06,
+ "loss": 1.0437978506088257,
+ "mean_token_accuracy": 0.7332682013511658,
+ "num_tokens": 21200896.0,
+ "step": 1294
+ },
+ {
+ "entropy": 1.5832154750823975,
+ "epoch": 2.616161616161616,
+ "grad_norm": 2.214010715484619,
+ "learning_rate": 2.385858585858586e-06,
+ "loss": 1.5869958400726318,
+ "mean_token_accuracy": 0.6240839958190918,
+ "num_tokens": 21217280.0,
+ "step": 1295
+ },
+ {
+ "entropy": 1.4032398462295532,
+ "epoch": 2.618181818181818,
+ "grad_norm": 2.069399833679199,
+ "learning_rate": 2.3838383838383843e-06,
+ "loss": 1.40470290184021,
+ "mean_token_accuracy": 0.6671348214149475,
+ "num_tokens": 21233664.0,
+ "step": 1296
+ },
+ {
+ "entropy": 1.1057566404342651,
+ "epoch": 2.6202020202020204,
+ "grad_norm": 2.090847969055176,
+ "learning_rate": 2.381818181818182e-06,
+ "loss": 1.099064826965332,
+ "mean_token_accuracy": 0.7186736464500427,
+ "num_tokens": 21250048.0,
+ "step": 1297
+ },
+ {
+ "entropy": 1.1217924356460571,
+ "epoch": 2.6222222222222222,
+ "grad_norm": 2.2802088260650635,
+ "learning_rate": 2.37979797979798e-06,
+ "loss": 1.1425195932388306,
+ "mean_token_accuracy": 0.717452347278595,
+ "num_tokens": 21266432.0,
+ "step": 1298
+ },
+ {
+ "entropy": 1.3103245496749878,
+ "epoch": 2.624242424242424,
+ "grad_norm": 2.2961838245391846,
+ "learning_rate": 2.377777777777778e-06,
+ "loss": 1.325084924697876,
+ "mean_token_accuracy": 0.6704323291778564,
+ "num_tokens": 21282816.0,
+ "step": 1299
+ },
+ {
+ "entropy": 1.397556185722351,
+ "epoch": 2.6262626262626263,
+ "grad_norm": 2.14385986328125,
+ "learning_rate": 2.375757575757576e-06,
+ "loss": 1.3891851902008057,
+ "mean_token_accuracy": 0.6722642779350281,
+ "num_tokens": 21299200.0,
+ "step": 1300
+ },
+ {
+ "epoch": 2.6262626262626263,
+ "eval_entropy": 1.377457697064646,
+ "eval_loss": 1.5343767404556274,
+ "eval_mean_token_accuracy": 0.6456591679203895,
+ "eval_num_tokens": 21299200.0,
+ "eval_runtime": 43.8661,
+ "eval_samples_per_second": 22.569,
+ "eval_steps_per_second": 2.827,
+ "step": 1300
+ },
+ {
+ "entropy": 1.4542138576507568,
+ "epoch": 2.6282828282828286,
+ "grad_norm": 2.2326884269714355,
+ "learning_rate": 2.373737373737374e-06,
+ "loss": 1.459869384765625,
+ "mean_token_accuracy": 0.6545554399490356,
+ "num_tokens": 21315584.0,
+ "step": 1301
+ },
+ {
+ "entropy": 1.144904613494873,
+ "epoch": 2.6303030303030304,
+ "grad_norm": 2.0662593841552734,
+ "learning_rate": 2.371717171717172e-06,
+ "loss": 1.151012897491455,
+ "mean_token_accuracy": 0.7232535481452942,
+ "num_tokens": 21331968.0,
+ "step": 1302
+ },
+ {
+ "entropy": 1.2142722606658936,
+ "epoch": 2.632323232323232,
+ "grad_norm": 2.206763982772827,
+ "learning_rate": 2.36969696969697e-06,
+ "loss": 1.2040069103240967,
+ "mean_token_accuracy": 0.7002320289611816,
+ "num_tokens": 21348352.0,
+ "step": 1303
+ },
+ {
+ "entropy": 1.7695715427398682,
+ "epoch": 2.6343434343434344,
+ "grad_norm": 2.1346793174743652,
+ "learning_rate": 2.367676767676768e-06,
+ "loss": 1.7356187105178833,
+ "mean_token_accuracy": 0.6051538586616516,
+ "num_tokens": 21364736.0,
+ "step": 1304
+ },
+ {
+ "entropy": 1.351786494255066,
+ "epoch": 2.6363636363636362,
+ "grad_norm": 2.291290283203125,
+ "learning_rate": 2.3656565656565657e-06,
+ "loss": 1.3471777439117432,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 21381120.0,
+ "step": 1305
+ },
+ {
+ "entropy": 1.202124834060669,
+ "epoch": 2.6383838383838385,
+ "grad_norm": 2.1541965007781982,
+ "learning_rate": 2.363636363636364e-06,
+ "loss": 1.2085479497909546,
+ "mean_token_accuracy": 0.7031631469726562,
+ "num_tokens": 21397504.0,
+ "step": 1306
+ },
+ {
+ "entropy": 0.9269154667854309,
+ "epoch": 2.6404040404040403,
+ "grad_norm": 2.1681666374206543,
+ "learning_rate": 2.361616161616162e-06,
+ "loss": 0.9319549798965454,
+ "mean_token_accuracy": 0.7553126811981201,
+ "num_tokens": 21413888.0,
+ "step": 1307
+ },
+ {
+ "entropy": 1.0244951248168945,
+ "epoch": 2.6424242424242426,
+ "grad_norm": 1.9392226934432983,
+ "learning_rate": 2.3595959595959598e-06,
+ "loss": 0.9993175268173218,
+ "mean_token_accuracy": 0.7588544487953186,
+ "num_tokens": 21430272.0,
+ "step": 1308
+ },
+ {
+ "entropy": 1.256042718887329,
+ "epoch": 2.6444444444444444,
+ "grad_norm": 2.346327304840088,
+ "learning_rate": 2.3575757575757577e-06,
+ "loss": 1.2512779235839844,
+ "mean_token_accuracy": 0.6858206987380981,
+ "num_tokens": 21446656.0,
+ "step": 1309
+ },
+ {
+ "entropy": 1.0318644046783447,
+ "epoch": 2.6464646464646466,
+ "grad_norm": 1.988356113433838,
+ "learning_rate": 2.3555555555555555e-06,
+ "loss": 1.0428593158721924,
+ "mean_token_accuracy": 0.7383365631103516,
+ "num_tokens": 21463040.0,
+ "step": 1310
+ },
+ {
+ "entropy": 1.3145314455032349,
+ "epoch": 2.6484848484848484,
+ "grad_norm": 2.1777143478393555,
+ "learning_rate": 2.3535353535353534e-06,
+ "loss": 1.3207441568374634,
+ "mean_token_accuracy": 0.6881411671638489,
+ "num_tokens": 21479424.0,
+ "step": 1311
+ },
+ {
+ "entropy": 1.2858450412750244,
+ "epoch": 2.6505050505050507,
+ "grad_norm": 2.2654671669006348,
+ "learning_rate": 2.3515151515151517e-06,
+ "loss": 1.2940181493759155,
+ "mean_token_accuracy": 0.6831338405609131,
+ "num_tokens": 21495808.0,
+ "step": 1312
+ },
+ {
+ "entropy": 1.4315612316131592,
+ "epoch": 2.6525252525252525,
+ "grad_norm": 2.140456438064575,
+ "learning_rate": 2.3494949494949496e-06,
+ "loss": 1.4298607110977173,
+ "mean_token_accuracy": 0.6585246920585632,
+ "num_tokens": 21512192.0,
+ "step": 1313
+ },
+ {
+ "entropy": 1.2628042697906494,
+ "epoch": 2.6545454545454543,
+ "grad_norm": 2.387079954147339,
+ "learning_rate": 2.347474747474748e-06,
+ "loss": 1.2526830434799194,
+ "mean_token_accuracy": 0.6882632970809937,
+ "num_tokens": 21528576.0,
+ "step": 1314
+ },
+ {
+ "entropy": 1.3501923084259033,
+ "epoch": 2.6565656565656566,
+ "grad_norm": 2.17873215675354,
+ "learning_rate": 2.345454545454546e-06,
+ "loss": 1.3459683656692505,
+ "mean_token_accuracy": 0.6783707737922668,
+ "num_tokens": 21544960.0,
+ "step": 1315
+ },
+ {
+ "entropy": 1.4369540214538574,
+ "epoch": 2.658585858585859,
+ "grad_norm": 2.335825204849243,
+ "learning_rate": 2.3434343434343437e-06,
+ "loss": 1.4296600818634033,
+ "mean_token_accuracy": 0.6534562706947327,
+ "num_tokens": 21561344.0,
+ "step": 1316
+ },
+ {
+ "entropy": 1.1612765789031982,
+ "epoch": 2.6606060606060606,
+ "grad_norm": 2.194164276123047,
+ "learning_rate": 2.3414141414141416e-06,
+ "loss": 1.1527385711669922,
+ "mean_token_accuracy": 0.7140327095985413,
+ "num_tokens": 21577728.0,
+ "step": 1317
+ },
+ {
+ "entropy": 1.0844523906707764,
+ "epoch": 2.6626262626262625,
+ "grad_norm": 2.1018459796905518,
+ "learning_rate": 2.3393939393939395e-06,
+ "loss": 1.0732126235961914,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 21594112.0,
+ "step": 1318
+ },
+ {
+ "entropy": 1.1760655641555786,
+ "epoch": 2.6646464646464647,
+ "grad_norm": 2.1674582958221436,
+ "learning_rate": 2.337373737373738e-06,
+ "loss": 1.1928012371063232,
+ "mean_token_accuracy": 0.693453848361969,
+ "num_tokens": 21610496.0,
+ "step": 1319
+ },
+ {
+ "entropy": 1.3627854585647583,
+ "epoch": 2.6666666666666665,
+ "grad_norm": 2.2469325065612793,
+ "learning_rate": 2.3353535353535357e-06,
+ "loss": 1.375096321105957,
+ "mean_token_accuracy": 0.6670737862586975,
+ "num_tokens": 21626880.0,
+ "step": 1320
+ },
+ {
+ "entropy": 1.0562385320663452,
+ "epoch": 2.6686868686868688,
+ "grad_norm": 2.3479180335998535,
+ "learning_rate": 2.3333333333333336e-06,
+ "loss": 1.0513578653335571,
+ "mean_token_accuracy": 0.7401685118675232,
+ "num_tokens": 21643264.0,
+ "step": 1321
+ },
+ {
+ "entropy": 1.1622484922409058,
+ "epoch": 2.6707070707070706,
+ "grad_norm": 2.218021869659424,
+ "learning_rate": 2.3313131313131315e-06,
+ "loss": 1.172579288482666,
+ "mean_token_accuracy": 0.7042623162269592,
+ "num_tokens": 21659648.0,
+ "step": 1322
+ },
+ {
+ "entropy": 1.2139835357666016,
+ "epoch": 2.672727272727273,
+ "grad_norm": 2.2875492572784424,
+ "learning_rate": 2.3292929292929294e-06,
+ "loss": 1.2015337944030762,
+ "mean_token_accuracy": 0.7027357220649719,
+ "num_tokens": 21676032.0,
+ "step": 1323
+ },
+ {
+ "entropy": 1.7094130516052246,
+ "epoch": 2.6747474747474747,
+ "grad_norm": 2.2344024181365967,
+ "learning_rate": 2.3272727272727277e-06,
+ "loss": 1.7565287351608276,
+ "mean_token_accuracy": 0.6025891304016113,
+ "num_tokens": 21692416.0,
+ "step": 1324
+ },
+ {
+ "entropy": 1.1033966541290283,
+ "epoch": 2.676767676767677,
+ "grad_norm": 2.2697556018829346,
+ "learning_rate": 2.3252525252525256e-06,
+ "loss": 1.1173789501190186,
+ "mean_token_accuracy": 0.7180629968643188,
+ "num_tokens": 21708800.0,
+ "step": 1325
+ },
+ {
+ "entropy": 0.9456706643104553,
+ "epoch": 2.6787878787878787,
+ "grad_norm": 2.1194941997528076,
+ "learning_rate": 2.3232323232323234e-06,
+ "loss": 0.9613161087036133,
+ "mean_token_accuracy": 0.7573277950286865,
+ "num_tokens": 21725184.0,
+ "step": 1326
+ },
+ {
+ "entropy": 1.098917841911316,
+ "epoch": 2.680808080808081,
+ "grad_norm": 2.2719058990478516,
+ "learning_rate": 2.3212121212121213e-06,
+ "loss": 1.116957664489746,
+ "mean_token_accuracy": 0.709269642829895,
+ "num_tokens": 21741568.0,
+ "step": 1327
+ },
+ {
+ "entropy": 1.5637823343276978,
+ "epoch": 2.682828282828283,
+ "grad_norm": 2.257596731185913,
+ "learning_rate": 2.3191919191919192e-06,
+ "loss": 1.5726745128631592,
+ "mean_token_accuracy": 0.6359306573867798,
+ "num_tokens": 21757952.0,
+ "step": 1328
+ },
+ {
+ "entropy": 0.9321528673171997,
+ "epoch": 2.6848484848484846,
+ "grad_norm": 2.0641798973083496,
+ "learning_rate": 2.317171717171717e-06,
+ "loss": 0.9297301769256592,
+ "mean_token_accuracy": 0.7602589130401611,
+ "num_tokens": 21774336.0,
+ "step": 1329
+ },
+ {
+ "entropy": 1.2314496040344238,
+ "epoch": 2.686868686868687,
+ "grad_norm": 2.143329620361328,
+ "learning_rate": 2.3151515151515154e-06,
+ "loss": 1.2292556762695312,
+ "mean_token_accuracy": 0.6940034031867981,
+ "num_tokens": 21790720.0,
+ "step": 1330
+ },
+ {
+ "entropy": 1.195270299911499,
+ "epoch": 2.688888888888889,
+ "grad_norm": 2.291335105895996,
+ "learning_rate": 2.3131313131313133e-06,
+ "loss": 1.1904417276382446,
+ "mean_token_accuracy": 0.7023082375526428,
+ "num_tokens": 21807104.0,
+ "step": 1331
+ },
+ {
+ "entropy": 0.8783636093139648,
+ "epoch": 2.690909090909091,
+ "grad_norm": 2.069147825241089,
+ "learning_rate": 2.311111111111111e-06,
+ "loss": 0.8936513066291809,
+ "mean_token_accuracy": 0.7703346610069275,
+ "num_tokens": 21823488.0,
+ "step": 1332
+ },
+ {
+ "entropy": 1.3100625276565552,
+ "epoch": 2.6929292929292927,
+ "grad_norm": 2.396043300628662,
+ "learning_rate": 2.309090909090909e-06,
+ "loss": 1.3054237365722656,
+ "mean_token_accuracy": 0.6758671402931213,
+ "num_tokens": 21839872.0,
+ "step": 1333
+ },
+ {
+ "entropy": 0.9413285255432129,
+ "epoch": 2.694949494949495,
+ "grad_norm": 2.0738699436187744,
+ "learning_rate": 2.307070707070707e-06,
+ "loss": 0.9171029329299927,
+ "mean_token_accuracy": 0.7571446299552917,
+ "num_tokens": 21856256.0,
+ "step": 1334
+ },
+ {
+ "entropy": 1.268250584602356,
+ "epoch": 2.6969696969696972,
+ "grad_norm": 2.0988986492156982,
+ "learning_rate": 2.3050505050505053e-06,
+ "loss": 1.257792353630066,
+ "mean_token_accuracy": 0.6866145730018616,
+ "num_tokens": 21872640.0,
+ "step": 1335
+ },
+ {
+ "entropy": 1.3402502536773682,
+ "epoch": 2.698989898989899,
+ "grad_norm": 2.08109712600708,
+ "learning_rate": 2.303030303030303e-06,
+ "loss": 1.3316476345062256,
+ "mean_token_accuracy": 0.6869198679924011,
+ "num_tokens": 21889024.0,
+ "step": 1336
+ },
+ {
+ "entropy": 1.5612709522247314,
+ "epoch": 2.701010101010101,
+ "grad_norm": 2.2410786151885986,
+ "learning_rate": 2.3010101010101015e-06,
+ "loss": 1.5604108572006226,
+ "mean_token_accuracy": 0.6339765787124634,
+ "num_tokens": 21905408.0,
+ "step": 1337
+ },
+ {
+ "entropy": 1.0962555408477783,
+ "epoch": 2.703030303030303,
+ "grad_norm": 2.289069890975952,
+ "learning_rate": 2.2989898989898994e-06,
+ "loss": 1.1016948223114014,
+ "mean_token_accuracy": 0.714093804359436,
+ "num_tokens": 21921792.0,
+ "step": 1338
+ },
+ {
+ "entropy": 1.600198745727539,
+ "epoch": 2.705050505050505,
+ "grad_norm": 2.152244806289673,
+ "learning_rate": 2.2969696969696973e-06,
+ "loss": 1.608877420425415,
+ "mean_token_accuracy": 0.6394724249839783,
+ "num_tokens": 21938176.0,
+ "step": 1339
+ },
+ {
+ "entropy": 1.4823815822601318,
+ "epoch": 2.707070707070707,
+ "grad_norm": 2.142822742462158,
+ "learning_rate": 2.294949494949495e-06,
+ "loss": 1.4775569438934326,
+ "mean_token_accuracy": 0.6656082272529602,
+ "num_tokens": 21954560.0,
+ "step": 1340
+ },
+ {
+ "entropy": 1.1100481748580933,
+ "epoch": 2.709090909090909,
+ "grad_norm": 2.271402597427368,
+ "learning_rate": 2.292929292929293e-06,
+ "loss": 1.1097328662872314,
+ "mean_token_accuracy": 0.7238031029701233,
+ "num_tokens": 21970944.0,
+ "step": 1341
+ },
+ {
+ "entropy": 1.3482670783996582,
+ "epoch": 2.7111111111111112,
+ "grad_norm": 2.136296510696411,
+ "learning_rate": 2.2909090909090913e-06,
+ "loss": 1.3715920448303223,
+ "mean_token_accuracy": 0.670615553855896,
+ "num_tokens": 21987328.0,
+ "step": 1342
+ },
+ {
+ "entropy": 1.3454313278198242,
+ "epoch": 2.713131313131313,
+ "grad_norm": 1.8919764757156372,
+ "learning_rate": 2.2888888888888892e-06,
+ "loss": 1.3545129299163818,
+ "mean_token_accuracy": 0.6950415372848511,
+ "num_tokens": 22003712.0,
+ "step": 1343
+ },
+ {
+ "entropy": 1.314072847366333,
+ "epoch": 2.7151515151515153,
+ "grad_norm": 2.0495684146881104,
+ "learning_rate": 2.286868686868687e-06,
+ "loss": 1.3117344379425049,
+ "mean_token_accuracy": 0.6800195574760437,
+ "num_tokens": 22020096.0,
+ "step": 1344
+ },
+ {
+ "entropy": 0.7977169156074524,
+ "epoch": 2.717171717171717,
+ "grad_norm": 2.050006866455078,
+ "learning_rate": 2.284848484848485e-06,
+ "loss": 0.7982609868049622,
+ "mean_token_accuracy": 0.7774181962013245,
+ "num_tokens": 22036480.0,
+ "step": 1345
+ },
+ {
+ "entropy": 1.6121824979782104,
+ "epoch": 2.7191919191919194,
+ "grad_norm": 2.1058602333068848,
+ "learning_rate": 2.282828282828283e-06,
+ "loss": 1.6340572834014893,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 22052864.0,
+ "step": 1346
+ },
+ {
+ "entropy": 1.2698943614959717,
+ "epoch": 2.721212121212121,
+ "grad_norm": 1.9856007099151611,
+ "learning_rate": 2.2808080808080808e-06,
+ "loss": 1.2857555150985718,
+ "mean_token_accuracy": 0.7088422179222107,
+ "num_tokens": 22069248.0,
+ "step": 1347
+ },
+ {
+ "entropy": 1.6614608764648438,
+ "epoch": 2.723232323232323,
+ "grad_norm": 2.1818666458129883,
+ "learning_rate": 2.278787878787879e-06,
+ "loss": 1.6615056991577148,
+ "mean_token_accuracy": 0.6217635273933411,
+ "num_tokens": 22085632.0,
+ "step": 1348
+ },
+ {
+ "entropy": 1.542864203453064,
+ "epoch": 2.7252525252525253,
+ "grad_norm": 2.1022093296051025,
+ "learning_rate": 2.276767676767677e-06,
+ "loss": 1.5696978569030762,
+ "mean_token_accuracy": 0.6462506055831909,
+ "num_tokens": 22102016.0,
+ "step": 1349
+ },
+ {
+ "entropy": 1.0613912343978882,
+ "epoch": 2.7272727272727275,
+ "grad_norm": 2.213463068008423,
+ "learning_rate": 2.274747474747475e-06,
+ "loss": 1.0789921283721924,
+ "mean_token_accuracy": 0.7288104295730591,
+ "num_tokens": 22118400.0,
+ "step": 1350
+ },
+ {
+ "epoch": 2.7272727272727275,
+ "eval_entropy": 1.362602738603469,
+ "eval_loss": 1.5345665216445923,
+ "eval_mean_token_accuracy": 0.6458812678052533,
+ "eval_num_tokens": 22118400.0,
+ "eval_runtime": 43.734,
+ "eval_samples_per_second": 22.637,
+ "eval_steps_per_second": 2.835,
+ "step": 1350
+ },
+ {
+ "entropy": 1.175439715385437,
+ "epoch": 2.7292929292929293,
+ "grad_norm": 2.3636603355407715,
+ "learning_rate": 2.2727272727272728e-06,
+ "loss": 1.2032190561294556,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 22134784.0,
+ "step": 1351
+ },
+ {
+ "entropy": 1.056649923324585,
+ "epoch": 2.731313131313131,
+ "grad_norm": 2.111971139907837,
+ "learning_rate": 2.2707070707070706e-06,
+ "loss": 1.0646127462387085,
+ "mean_token_accuracy": 0.7132999300956726,
+ "num_tokens": 22151168.0,
+ "step": 1352
+ },
+ {
+ "entropy": 1.401559591293335,
+ "epoch": 2.7333333333333334,
+ "grad_norm": 2.269573211669922,
+ "learning_rate": 2.268686868686869e-06,
+ "loss": 1.405207633972168,
+ "mean_token_accuracy": 0.6612115502357483,
+ "num_tokens": 22167552.0,
+ "step": 1353
+ },
+ {
+ "entropy": 0.9708455204963684,
+ "epoch": 2.735353535353535,
+ "grad_norm": 2.3020989894866943,
+ "learning_rate": 2.266666666666667e-06,
+ "loss": 0.9864540100097656,
+ "mean_token_accuracy": 0.7361993193626404,
+ "num_tokens": 22183936.0,
+ "step": 1354
+ },
+ {
+ "entropy": 1.2840858697891235,
+ "epoch": 2.7373737373737375,
+ "grad_norm": 2.4489457607269287,
+ "learning_rate": 2.2646464646464647e-06,
+ "loss": 1.2992041110992432,
+ "mean_token_accuracy": 0.6783097386360168,
+ "num_tokens": 22200320.0,
+ "step": 1355
+ },
+ {
+ "entropy": 1.6704803705215454,
+ "epoch": 2.7393939393939393,
+ "grad_norm": 2.213287591934204,
+ "learning_rate": 2.262626262626263e-06,
+ "loss": 1.7022172212600708,
+ "mean_token_accuracy": 0.6433194875717163,
+ "num_tokens": 22216704.0,
+ "step": 1356
+ },
+ {
+ "entropy": 1.2570815086364746,
+ "epoch": 2.7414141414141415,
+ "grad_norm": 2.250062942504883,
+ "learning_rate": 2.260606060606061e-06,
+ "loss": 1.2799533605575562,
+ "mean_token_accuracy": 0.6823400259017944,
+ "num_tokens": 22233088.0,
+ "step": 1357
+ },
+ {
+ "entropy": 1.0966694355010986,
+ "epoch": 2.7434343434343433,
+ "grad_norm": 2.24507212638855,
+ "learning_rate": 2.258585858585859e-06,
+ "loss": 1.0954806804656982,
+ "mean_token_accuracy": 0.7264289259910583,
+ "num_tokens": 22249472.0,
+ "step": 1358
+ },
+ {
+ "entropy": 1.6675825119018555,
+ "epoch": 2.7454545454545456,
+ "grad_norm": 2.1572930812835693,
+ "learning_rate": 2.2565656565656567e-06,
+ "loss": 1.6607719659805298,
+ "mean_token_accuracy": 0.6113214492797852,
+ "num_tokens": 22265856.0,
+ "step": 1359
+ },
+ {
+ "entropy": 1.247696042060852,
+ "epoch": 2.7474747474747474,
+ "grad_norm": 2.105797290802002,
+ "learning_rate": 2.254545454545455e-06,
+ "loss": 1.2314106225967407,
+ "mean_token_accuracy": 0.6982169151306152,
+ "num_tokens": 22282240.0,
+ "step": 1360
+ },
+ {
+ "entropy": 1.6081417798995972,
+ "epoch": 2.7494949494949497,
+ "grad_norm": 2.1624395847320557,
+ "learning_rate": 2.252525252525253e-06,
+ "loss": 1.6011556386947632,
+ "mean_token_accuracy": 0.6282364726066589,
+ "num_tokens": 22298624.0,
+ "step": 1361
+ },
+ {
+ "entropy": 1.1124155521392822,
+ "epoch": 2.7515151515151515,
+ "grad_norm": 2.141758918762207,
+ "learning_rate": 2.250505050505051e-06,
+ "loss": 1.1052089929580688,
+ "mean_token_accuracy": 0.7202003002166748,
+ "num_tokens": 22315008.0,
+ "step": 1362
+ },
+ {
+ "entropy": 1.093716025352478,
+ "epoch": 2.7535353535353533,
+ "grad_norm": 2.2610108852386475,
+ "learning_rate": 2.2484848484848487e-06,
+ "loss": 1.095299482345581,
+ "mean_token_accuracy": 0.714154839515686,
+ "num_tokens": 22331392.0,
+ "step": 1363
+ },
+ {
+ "entropy": 1.353977918624878,
+ "epoch": 2.7555555555555555,
+ "grad_norm": 2.171783447265625,
+ "learning_rate": 2.2464646464646466e-06,
+ "loss": 1.3497436046600342,
+ "mean_token_accuracy": 0.6914386749267578,
+ "num_tokens": 22347776.0,
+ "step": 1364
+ },
+ {
+ "entropy": 1.4595965147018433,
+ "epoch": 2.757575757575758,
+ "grad_norm": 2.2337677478790283,
+ "learning_rate": 2.2444444444444445e-06,
+ "loss": 1.4730737209320068,
+ "mean_token_accuracy": 0.6578529477119446,
+ "num_tokens": 22364160.0,
+ "step": 1365
+ },
+ {
+ "entropy": 1.5668566226959229,
+ "epoch": 2.7595959595959596,
+ "grad_norm": 2.2195982933044434,
+ "learning_rate": 2.2424242424242428e-06,
+ "loss": 1.5661592483520508,
+ "mean_token_accuracy": 0.6397166848182678,
+ "num_tokens": 22380544.0,
+ "step": 1366
+ },
+ {
+ "entropy": 1.4419786930084229,
+ "epoch": 2.7616161616161614,
+ "grad_norm": 2.202221393585205,
+ "learning_rate": 2.2404040404040407e-06,
+ "loss": 1.4466135501861572,
+ "mean_token_accuracy": 0.6698827743530273,
+ "num_tokens": 22396928.0,
+ "step": 1367
+ },
+ {
+ "entropy": 1.43394136428833,
+ "epoch": 2.7636363636363637,
+ "grad_norm": 2.1969001293182373,
+ "learning_rate": 2.2383838383838385e-06,
+ "loss": 1.433483362197876,
+ "mean_token_accuracy": 0.6655471324920654,
+ "num_tokens": 22413312.0,
+ "step": 1368
+ },
+ {
+ "entropy": 1.048527717590332,
+ "epoch": 2.765656565656566,
+ "grad_norm": 2.142869472503662,
+ "learning_rate": 2.2363636363636364e-06,
+ "loss": 1.0373283624649048,
+ "mean_token_accuracy": 0.7396189570426941,
+ "num_tokens": 22429696.0,
+ "step": 1369
+ },
+ {
+ "entropy": 1.4282819032669067,
+ "epoch": 2.7676767676767677,
+ "grad_norm": 2.1550097465515137,
+ "learning_rate": 2.2343434343434343e-06,
+ "loss": 1.419884443283081,
+ "mean_token_accuracy": 0.6712262034416199,
+ "num_tokens": 22446080.0,
+ "step": 1370
+ },
+ {
+ "entropy": 1.5361018180847168,
+ "epoch": 2.7696969696969695,
+ "grad_norm": 2.1175451278686523,
+ "learning_rate": 2.2323232323232326e-06,
+ "loss": 1.5433859825134277,
+ "mean_token_accuracy": 0.636907696723938,
+ "num_tokens": 22462464.0,
+ "step": 1371
+ },
+ {
+ "entropy": 1.326242208480835,
+ "epoch": 2.771717171717172,
+ "grad_norm": 2.084632635116577,
+ "learning_rate": 2.2303030303030305e-06,
+ "loss": 1.3364207744598389,
+ "mean_token_accuracy": 0.6809965968132019,
+ "num_tokens": 22478848.0,
+ "step": 1372
+ },
+ {
+ "entropy": 1.255878210067749,
+ "epoch": 2.7737373737373736,
+ "grad_norm": 2.142777919769287,
+ "learning_rate": 2.2282828282828284e-06,
+ "loss": 1.264795184135437,
+ "mean_token_accuracy": 0.6875916123390198,
+ "num_tokens": 22495232.0,
+ "step": 1373
+ },
+ {
+ "entropy": 1.2916159629821777,
+ "epoch": 2.775757575757576,
+ "grad_norm": 2.115644693374634,
+ "learning_rate": 2.2262626262626263e-06,
+ "loss": 1.2945363521575928,
+ "mean_token_accuracy": 0.6895456910133362,
+ "num_tokens": 22511616.0,
+ "step": 1374
+ },
+ {
+ "entropy": 1.4490385055541992,
+ "epoch": 2.7777777777777777,
+ "grad_norm": 2.2078094482421875,
+ "learning_rate": 2.224242424242424e-06,
+ "loss": 1.4401804208755493,
+ "mean_token_accuracy": 0.6637151837348938,
+ "num_tokens": 22528000.0,
+ "step": 1375
+ },
+ {
+ "entropy": 1.2710940837860107,
+ "epoch": 2.77979797979798,
+ "grad_norm": 2.1877286434173584,
+ "learning_rate": 2.222222222222222e-06,
+ "loss": 1.2672982215881348,
+ "mean_token_accuracy": 0.6958353519439697,
+ "num_tokens": 22544384.0,
+ "step": 1376
+ },
+ {
+ "entropy": 1.3981144428253174,
+ "epoch": 2.7818181818181817,
+ "grad_norm": 2.2816240787506104,
+ "learning_rate": 2.2202020202020204e-06,
+ "loss": 1.4073718786239624,
+ "mean_token_accuracy": 0.6583414673805237,
+ "num_tokens": 22560768.0,
+ "step": 1377
+ },
+ {
+ "entropy": 1.541896104812622,
+ "epoch": 2.783838383838384,
+ "grad_norm": 2.3664891719818115,
+ "learning_rate": 2.2181818181818187e-06,
+ "loss": 1.5782896280288696,
+ "mean_token_accuracy": 0.6264045238494873,
+ "num_tokens": 22577152.0,
+ "step": 1378
+ },
+ {
+ "entropy": 1.1470069885253906,
+ "epoch": 2.785858585858586,
+ "grad_norm": 2.334867000579834,
+ "learning_rate": 2.2161616161616166e-06,
+ "loss": 1.1734097003936768,
+ "mean_token_accuracy": 0.6981558203697205,
+ "num_tokens": 22593536.0,
+ "step": 1379
+ },
+ {
+ "entropy": 1.3938566446304321,
+ "epoch": 2.787878787878788,
+ "grad_norm": 2.493093967437744,
+ "learning_rate": 2.2141414141414145e-06,
+ "loss": 1.4161372184753418,
+ "mean_token_accuracy": 0.6610283255577087,
+ "num_tokens": 22609920.0,
+ "step": 1380
+ },
+ {
+ "entropy": 1.2948062419891357,
+ "epoch": 2.78989898989899,
+ "grad_norm": 2.227708578109741,
+ "learning_rate": 2.2121212121212124e-06,
+ "loss": 1.3157434463500977,
+ "mean_token_accuracy": 0.6835002303123474,
+ "num_tokens": 22626304.0,
+ "step": 1381
+ },
+ {
+ "entropy": 0.9506068229675293,
+ "epoch": 2.7919191919191917,
+ "grad_norm": 2.1482889652252197,
+ "learning_rate": 2.2101010101010102e-06,
+ "loss": 0.950823187828064,
+ "mean_token_accuracy": 0.7500610947608948,
+ "num_tokens": 22642688.0,
+ "step": 1382
+ },
+ {
+ "entropy": 1.4429880380630493,
+ "epoch": 2.793939393939394,
+ "grad_norm": 2.8189656734466553,
+ "learning_rate": 2.208080808080808e-06,
+ "loss": 1.4801222085952759,
+ "mean_token_accuracy": 0.6469223499298096,
+ "num_tokens": 22659072.0,
+ "step": 1383
+ },
+ {
+ "entropy": 1.3517380952835083,
+ "epoch": 2.795959595959596,
+ "grad_norm": 2.047236442565918,
+ "learning_rate": 2.2060606060606064e-06,
+ "loss": 1.3715345859527588,
+ "mean_token_accuracy": 0.6921714544296265,
+ "num_tokens": 22675456.0,
+ "step": 1384
+ },
+ {
+ "entropy": 1.3647958040237427,
+ "epoch": 2.797979797979798,
+ "grad_norm": 2.296548366546631,
+ "learning_rate": 2.2040404040404043e-06,
+ "loss": 1.3669397830963135,
+ "mean_token_accuracy": 0.6769663095474243,
+ "num_tokens": 22691840.0,
+ "step": 1385
+ },
+ {
+ "entropy": 1.2830337285995483,
+ "epoch": 2.8,
+ "grad_norm": 2.222038745880127,
+ "learning_rate": 2.2020202020202022e-06,
+ "loss": 1.2938398122787476,
+ "mean_token_accuracy": 0.6786150336265564,
+ "num_tokens": 22708224.0,
+ "step": 1386
+ },
+ {
+ "entropy": 1.1581721305847168,
+ "epoch": 2.802020202020202,
+ "grad_norm": 1.9979426860809326,
+ "learning_rate": 2.2e-06,
+ "loss": 1.1363141536712646,
+ "mean_token_accuracy": 0.7106130719184875,
+ "num_tokens": 22724608.0,
+ "step": 1387
+ },
+ {
+ "entropy": 1.4855602979660034,
+ "epoch": 2.804040404040404,
+ "grad_norm": 2.2763257026672363,
+ "learning_rate": 2.197979797979798e-06,
+ "loss": 1.5020172595977783,
+ "mean_token_accuracy": 0.6478993892669678,
+ "num_tokens": 22740992.0,
+ "step": 1388
+ },
+ {
+ "entropy": 1.1942899227142334,
+ "epoch": 2.806060606060606,
+ "grad_norm": 2.1685962677001953,
+ "learning_rate": 2.1959595959595963e-06,
+ "loss": 1.188063621520996,
+ "mean_token_accuracy": 0.705483615398407,
+ "num_tokens": 22757376.0,
+ "step": 1389
+ },
+ {
+ "entropy": 1.1369596719741821,
+ "epoch": 2.808080808080808,
+ "grad_norm": 2.1820614337921143,
+ "learning_rate": 2.193939393939394e-06,
+ "loss": 1.1348206996917725,
+ "mean_token_accuracy": 0.7253297567367554,
+ "num_tokens": 22773760.0,
+ "step": 1390
+ },
+ {
+ "entropy": 1.2539693117141724,
+ "epoch": 2.81010101010101,
+ "grad_norm": 2.0384390354156494,
+ "learning_rate": 2.191919191919192e-06,
+ "loss": 1.250205636024475,
+ "mean_token_accuracy": 0.6993771195411682,
+ "num_tokens": 22790144.0,
+ "step": 1391
+ },
+ {
+ "entropy": 1.7445363998413086,
+ "epoch": 2.812121212121212,
+ "grad_norm": 2.55062198638916,
+ "learning_rate": 2.18989898989899e-06,
+ "loss": 1.7788689136505127,
+ "mean_token_accuracy": 0.607107937335968,
+ "num_tokens": 22806528.0,
+ "step": 1392
+ },
+ {
+ "entropy": 1.2282429933547974,
+ "epoch": 2.8141414141414143,
+ "grad_norm": 2.1791000366210938,
+ "learning_rate": 2.187878787878788e-06,
+ "loss": 1.2460708618164062,
+ "mean_token_accuracy": 0.697239875793457,
+ "num_tokens": 22822912.0,
+ "step": 1393
+ },
+ {
+ "entropy": 1.2007265090942383,
+ "epoch": 2.816161616161616,
+ "grad_norm": 2.4067599773406982,
+ "learning_rate": 2.1858585858585858e-06,
+ "loss": 1.2013460397720337,
+ "mean_token_accuracy": 0.6963238716125488,
+ "num_tokens": 22839296.0,
+ "step": 1394
+ },
+ {
+ "entropy": 1.7315549850463867,
+ "epoch": 2.8181818181818183,
+ "grad_norm": 2.15682053565979,
+ "learning_rate": 2.183838383838384e-06,
+ "loss": 1.6833488941192627,
+ "mean_token_accuracy": 0.6170004606246948,
+ "num_tokens": 22855680.0,
+ "step": 1395
+ },
+ {
+ "entropy": 1.325459599494934,
+ "epoch": 2.82020202020202,
+ "grad_norm": 2.0464699268341064,
+ "learning_rate": 2.181818181818182e-06,
+ "loss": 1.3265891075134277,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 22872064.0,
+ "step": 1396
+ },
+ {
+ "entropy": 1.0391966104507446,
+ "epoch": 2.822222222222222,
+ "grad_norm": 2.3595499992370605,
+ "learning_rate": 2.17979797979798e-06,
+ "loss": 1.0515706539154053,
+ "mean_token_accuracy": 0.7299706935882568,
+ "num_tokens": 22888448.0,
+ "step": 1397
+ },
+ {
+ "entropy": 1.5484130382537842,
+ "epoch": 2.824242424242424,
+ "grad_norm": 2.24381422996521,
+ "learning_rate": 2.1777777777777777e-06,
+ "loss": 1.5656720399856567,
+ "mean_token_accuracy": 0.6390449404716492,
+ "num_tokens": 22904832.0,
+ "step": 1398
+ },
+ {
+ "entropy": 1.2196807861328125,
+ "epoch": 2.8262626262626265,
+ "grad_norm": 2.3043432235717773,
+ "learning_rate": 2.175757575757576e-06,
+ "loss": 1.2172417640686035,
+ "mean_token_accuracy": 0.6985833048820496,
+ "num_tokens": 22921216.0,
+ "step": 1399
+ },
+ {
+ "entropy": 1.171323537826538,
+ "epoch": 2.8282828282828283,
+ "grad_norm": 2.34149169921875,
+ "learning_rate": 2.173737373737374e-06,
+ "loss": 1.1752846240997314,
+ "mean_token_accuracy": 0.6979726552963257,
+ "num_tokens": 22937600.0,
+ "step": 1400
+ },
+ {
+ "epoch": 2.8282828282828283,
+ "eval_entropy": 1.3776377598124165,
+ "eval_loss": 1.533128261566162,
+ "eval_mean_token_accuracy": 0.645915245336871,
+ "eval_num_tokens": 22937600.0,
+ "eval_runtime": 43.7952,
+ "eval_samples_per_second": 22.605,
+ "eval_steps_per_second": 2.831,
+ "step": 1400
+ },
+ {
+ "entropy": 1.2173237800598145,
+ "epoch": 2.83030303030303,
+ "grad_norm": 2.245490789413452,
+ "learning_rate": 2.171717171717172e-06,
+ "loss": 1.1928956508636475,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 22953984.0,
+ "step": 1401
+ },
+ {
+ "entropy": 1.4213385581970215,
+ "epoch": 2.8323232323232324,
+ "grad_norm": 2.192051649093628,
+ "learning_rate": 2.16969696969697e-06,
+ "loss": 1.4340262413024902,
+ "mean_token_accuracy": 0.6622496247291565,
+ "num_tokens": 22970368.0,
+ "step": 1402
+ },
+ {
+ "entropy": 1.922193169593811,
+ "epoch": 2.8343434343434346,
+ "grad_norm": 2.0441250801086426,
+ "learning_rate": 2.167676767676768e-06,
+ "loss": 1.9164612293243408,
+ "mean_token_accuracy": 0.5942232608795166,
+ "num_tokens": 22986752.0,
+ "step": 1403
+ },
+ {
+ "entropy": 1.3124938011169434,
+ "epoch": 2.8363636363636364,
+ "grad_norm": 2.245614528656006,
+ "learning_rate": 2.165656565656566e-06,
+ "loss": 1.3055529594421387,
+ "mean_token_accuracy": 0.680385947227478,
+ "num_tokens": 23003136.0,
+ "step": 1404
+ },
+ {
+ "entropy": 0.9893879294395447,
+ "epoch": 2.8383838383838382,
+ "grad_norm": 2.1041340827941895,
+ "learning_rate": 2.163636363636364e-06,
+ "loss": 0.9646933078765869,
+ "mean_token_accuracy": 0.7441377639770508,
+ "num_tokens": 23019520.0,
+ "step": 1405
+ },
+ {
+ "entropy": 1.4011882543563843,
+ "epoch": 2.8404040404040405,
+ "grad_norm": 2.5371105670928955,
+ "learning_rate": 2.1616161616161617e-06,
+ "loss": 1.381878137588501,
+ "mean_token_accuracy": 0.6522960662841797,
+ "num_tokens": 23035904.0,
+ "step": 1406
+ },
+ {
+ "entropy": 1.4563852548599243,
+ "epoch": 2.8424242424242423,
+ "grad_norm": 2.1308720111846924,
+ "learning_rate": 2.15959595959596e-06,
+ "loss": 1.4763004779815674,
+ "mean_token_accuracy": 0.6792256832122803,
+ "num_tokens": 23052288.0,
+ "step": 1407
+ },
+ {
+ "entropy": 0.8676514625549316,
+ "epoch": 2.8444444444444446,
+ "grad_norm": 2.016085147857666,
+ "learning_rate": 2.157575757575758e-06,
+ "loss": 0.8672611713409424,
+ "mean_token_accuracy": 0.7660601139068604,
+ "num_tokens": 23068672.0,
+ "step": 1408
+ },
+ {
+ "entropy": 1.2011700868606567,
+ "epoch": 2.8464646464646464,
+ "grad_norm": 2.1641454696655273,
+ "learning_rate": 2.1555555555555558e-06,
+ "loss": 1.2113897800445557,
+ "mean_token_accuracy": 0.7180019617080688,
+ "num_tokens": 23085056.0,
+ "step": 1409
+ },
+ {
+ "entropy": 1.7813633680343628,
+ "epoch": 2.8484848484848486,
+ "grad_norm": 2.1768839359283447,
+ "learning_rate": 2.1535353535353537e-06,
+ "loss": 1.7897224426269531,
+ "mean_token_accuracy": 0.6129701733589172,
+ "num_tokens": 23101440.0,
+ "step": 1410
+ },
+ {
+ "entropy": 1.0219851732254028,
+ "epoch": 2.8505050505050504,
+ "grad_norm": 2.299229145050049,
+ "learning_rate": 2.1515151515151515e-06,
+ "loss": 1.0073617696762085,
+ "mean_token_accuracy": 0.7240473628044128,
+ "num_tokens": 23117824.0,
+ "step": 1411
+ },
+ {
+ "entropy": 1.3342534303665161,
+ "epoch": 2.8525252525252527,
+ "grad_norm": 2.165161371231079,
+ "learning_rate": 2.1494949494949494e-06,
+ "loss": 1.3219788074493408,
+ "mean_token_accuracy": 0.6764777898788452,
+ "num_tokens": 23134208.0,
+ "step": 1412
+ },
+ {
+ "entropy": 1.1618846654891968,
+ "epoch": 2.8545454545454545,
+ "grad_norm": 2.1276957988739014,
+ "learning_rate": 2.1474747474747477e-06,
+ "loss": 1.1667187213897705,
+ "mean_token_accuracy": 0.7214215993881226,
+ "num_tokens": 23150592.0,
+ "step": 1413
+ },
+ {
+ "entropy": 1.3673025369644165,
+ "epoch": 2.8565656565656568,
+ "grad_norm": 2.249702215194702,
+ "learning_rate": 2.1454545454545456e-06,
+ "loss": 1.380744218826294,
+ "mean_token_accuracy": 0.6656082272529602,
+ "num_tokens": 23166976.0,
+ "step": 1414
+ },
+ {
+ "entropy": 1.4118674993515015,
+ "epoch": 2.8585858585858586,
+ "grad_norm": 2.1488327980041504,
+ "learning_rate": 2.1434343434343435e-06,
+ "loss": 1.4007214307785034,
+ "mean_token_accuracy": 0.6663410067558289,
+ "num_tokens": 23183360.0,
+ "step": 1415
+ },
+ {
+ "entropy": 1.4398424625396729,
+ "epoch": 2.8606060606060604,
+ "grad_norm": 2.2609732151031494,
+ "learning_rate": 2.1414141414141414e-06,
+ "loss": 1.4657073020935059,
+ "mean_token_accuracy": 0.6483268141746521,
+ "num_tokens": 23199744.0,
+ "step": 1416
+ },
+ {
+ "entropy": 1.2922199964523315,
+ "epoch": 2.8626262626262626,
+ "grad_norm": 2.1911425590515137,
+ "learning_rate": 2.1393939393939393e-06,
+ "loss": 1.3118690252304077,
+ "mean_token_accuracy": 0.6951025724411011,
+ "num_tokens": 23216128.0,
+ "step": 1417
+ },
+ {
+ "entropy": 1.6888933181762695,
+ "epoch": 2.864646464646465,
+ "grad_norm": 2.2805919647216797,
+ "learning_rate": 2.1373737373737376e-06,
+ "loss": 1.6726739406585693,
+ "mean_token_accuracy": 0.6136419177055359,
+ "num_tokens": 23232512.0,
+ "step": 1418
+ },
+ {
+ "entropy": 1.289890170097351,
+ "epoch": 2.8666666666666667,
+ "grad_norm": 2.092263698577881,
+ "learning_rate": 2.1353535353535355e-06,
+ "loss": 1.2876317501068115,
+ "mean_token_accuracy": 0.6835613250732422,
+ "num_tokens": 23248896.0,
+ "step": 1419
+ },
+ {
+ "entropy": 1.361393690109253,
+ "epoch": 2.8686868686868685,
+ "grad_norm": 2.1863481998443604,
+ "learning_rate": 2.133333333333334e-06,
+ "loss": 1.3719209432601929,
+ "mean_token_accuracy": 0.663532018661499,
+ "num_tokens": 23265280.0,
+ "step": 1420
+ },
+ {
+ "entropy": 1.1187894344329834,
+ "epoch": 2.8707070707070708,
+ "grad_norm": 2.256434679031372,
+ "learning_rate": 2.1313131313131317e-06,
+ "loss": 1.1177198886871338,
+ "mean_token_accuracy": 0.7082926034927368,
+ "num_tokens": 23281664.0,
+ "step": 1421
+ },
+ {
+ "entropy": 0.8779795169830322,
+ "epoch": 2.8727272727272726,
+ "grad_norm": 2.095226526260376,
+ "learning_rate": 2.1292929292929296e-06,
+ "loss": 0.8675153851509094,
+ "mean_token_accuracy": 0.7647777199745178,
+ "num_tokens": 23298048.0,
+ "step": 1422
+ },
+ {
+ "entropy": 1.458146095275879,
+ "epoch": 2.874747474747475,
+ "grad_norm": 2.225179433822632,
+ "learning_rate": 2.1272727272727275e-06,
+ "loss": 1.4488263130187988,
+ "mean_token_accuracy": 0.6640205383300781,
+ "num_tokens": 23314432.0,
+ "step": 1423
+ },
+ {
+ "entropy": 1.187269926071167,
+ "epoch": 2.8767676767676766,
+ "grad_norm": 2.023710250854492,
+ "learning_rate": 2.1252525252525254e-06,
+ "loss": 1.182060718536377,
+ "mean_token_accuracy": 0.7017586827278137,
+ "num_tokens": 23330816.0,
+ "step": 1424
+ },
+ {
+ "entropy": 1.1446877717971802,
+ "epoch": 2.878787878787879,
+ "grad_norm": 2.301314115524292,
+ "learning_rate": 2.1232323232323237e-06,
+ "loss": 1.1507803201675415,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 23347200.0,
+ "step": 1425
+ },
+ {
+ "entropy": 1.3453346490859985,
+ "epoch": 2.8808080808080807,
+ "grad_norm": 2.0338571071624756,
+ "learning_rate": 2.1212121212121216e-06,
+ "loss": 1.345799207687378,
+ "mean_token_accuracy": 0.6966292262077332,
+ "num_tokens": 23363584.0,
+ "step": 1426
+ },
+ {
+ "entropy": 1.2638238668441772,
+ "epoch": 2.882828282828283,
+ "grad_norm": 2.1575632095336914,
+ "learning_rate": 2.1191919191919194e-06,
+ "loss": 1.2882521152496338,
+ "mean_token_accuracy": 0.6901563405990601,
+ "num_tokens": 23379968.0,
+ "step": 1427
+ },
+ {
+ "entropy": 1.4490493535995483,
+ "epoch": 2.8848484848484848,
+ "grad_norm": 2.1735994815826416,
+ "learning_rate": 2.1171717171717173e-06,
+ "loss": 1.455702781677246,
+ "mean_token_accuracy": 0.6538837552070618,
+ "num_tokens": 23396352.0,
+ "step": 1428
+ },
+ {
+ "entropy": 1.3873618841171265,
+ "epoch": 2.886868686868687,
+ "grad_norm": 2.3870506286621094,
+ "learning_rate": 2.1151515151515152e-06,
+ "loss": 1.3657323122024536,
+ "mean_token_accuracy": 0.6692110300064087,
+ "num_tokens": 23412736.0,
+ "step": 1429
+ },
+ {
+ "entropy": 1.298308253288269,
+ "epoch": 2.888888888888889,
+ "grad_norm": 2.079481363296509,
+ "learning_rate": 2.113131313131313e-06,
+ "loss": 1.30775785446167,
+ "mean_token_accuracy": 0.6834391951560974,
+ "num_tokens": 23429120.0,
+ "step": 1430
+ },
+ {
+ "entropy": 1.1544564962387085,
+ "epoch": 2.8909090909090907,
+ "grad_norm": 2.2400357723236084,
+ "learning_rate": 2.1111111111111114e-06,
+ "loss": 1.17466139793396,
+ "mean_token_accuracy": 0.7093307375907898,
+ "num_tokens": 23445504.0,
+ "step": 1431
+ },
+ {
+ "entropy": 1.4711883068084717,
+ "epoch": 2.892929292929293,
+ "grad_norm": 2.1779074668884277,
+ "learning_rate": 2.1090909090909093e-06,
+ "loss": 1.4626137018203735,
+ "mean_token_accuracy": 0.6602955460548401,
+ "num_tokens": 23461888.0,
+ "step": 1432
+ },
+ {
+ "entropy": 1.4876407384872437,
+ "epoch": 2.894949494949495,
+ "grad_norm": 2.278554677963257,
+ "learning_rate": 2.107070707070707e-06,
+ "loss": 1.5031921863555908,
+ "mean_token_accuracy": 0.6570591330528259,
+ "num_tokens": 23478272.0,
+ "step": 1433
+ },
+ {
+ "entropy": 1.328355073928833,
+ "epoch": 2.896969696969697,
+ "grad_norm": 2.034842014312744,
+ "learning_rate": 2.105050505050505e-06,
+ "loss": 1.3163859844207764,
+ "mean_token_accuracy": 0.6878358721733093,
+ "num_tokens": 23494656.0,
+ "step": 1434
+ },
+ {
+ "entropy": 1.487100601196289,
+ "epoch": 2.898989898989899,
+ "grad_norm": 2.1980724334716797,
+ "learning_rate": 2.103030303030303e-06,
+ "loss": 1.4886071681976318,
+ "mean_token_accuracy": 0.6521739363670349,
+ "num_tokens": 23511040.0,
+ "step": 1435
+ },
+ {
+ "entropy": 1.4826854467391968,
+ "epoch": 2.901010101010101,
+ "grad_norm": 2.5214874744415283,
+ "learning_rate": 2.1010101010101013e-06,
+ "loss": 1.4610626697540283,
+ "mean_token_accuracy": 0.6503419876098633,
+ "num_tokens": 23527424.0,
+ "step": 1436
+ },
+ {
+ "entropy": 1.00849187374115,
+ "epoch": 2.9030303030303033,
+ "grad_norm": 2.1452033519744873,
+ "learning_rate": 2.098989898989899e-06,
+ "loss": 0.9949107766151428,
+ "mean_token_accuracy": 0.7457864880561829,
+ "num_tokens": 23543808.0,
+ "step": 1437
+ },
+ {
+ "entropy": 1.0621757507324219,
+ "epoch": 2.905050505050505,
+ "grad_norm": 2.1871836185455322,
+ "learning_rate": 2.096969696969697e-06,
+ "loss": 1.0466980934143066,
+ "mean_token_accuracy": 0.7275280952453613,
+ "num_tokens": 23560192.0,
+ "step": 1438
+ },
+ {
+ "entropy": 1.3413732051849365,
+ "epoch": 2.907070707070707,
+ "grad_norm": 2.2954704761505127,
+ "learning_rate": 2.094949494949495e-06,
+ "loss": 1.3602681159973145,
+ "mean_token_accuracy": 0.6686003804206848,
+ "num_tokens": 23576576.0,
+ "step": 1439
+ },
+ {
+ "entropy": 0.8138323426246643,
+ "epoch": 2.909090909090909,
+ "grad_norm": 1.9476791620254517,
+ "learning_rate": 2.092929292929293e-06,
+ "loss": 0.8208089470863342,
+ "mean_token_accuracy": 0.7796775698661804,
+ "num_tokens": 23592960.0,
+ "step": 1440
+ },
+ {
+ "entropy": 0.9035854339599609,
+ "epoch": 2.911111111111111,
+ "grad_norm": 1.9753291606903076,
+ "learning_rate": 2.090909090909091e-06,
+ "loss": 0.8889603614807129,
+ "mean_token_accuracy": 0.7610527873039246,
+ "num_tokens": 23609344.0,
+ "step": 1441
+ },
+ {
+ "entropy": 0.9301351308822632,
+ "epoch": 2.9131313131313132,
+ "grad_norm": 2.244597911834717,
+ "learning_rate": 2.088888888888889e-06,
+ "loss": 0.9369313716888428,
+ "mean_token_accuracy": 0.7603810429573059,
+ "num_tokens": 23625728.0,
+ "step": 1442
+ },
+ {
+ "entropy": 0.8740416765213013,
+ "epoch": 2.915151515151515,
+ "grad_norm": 2.0207667350769043,
+ "learning_rate": 2.0868686868686873e-06,
+ "loss": 0.8751406073570251,
+ "mean_token_accuracy": 0.7634342908859253,
+ "num_tokens": 23642112.0,
+ "step": 1443
+ },
+ {
+ "entropy": 1.044225811958313,
+ "epoch": 2.9171717171717173,
+ "grad_norm": 2.8100409507751465,
+ "learning_rate": 2.0848484848484852e-06,
+ "loss": 1.0568115711212158,
+ "mean_token_accuracy": 0.7291157841682434,
+ "num_tokens": 23658496.0,
+ "step": 1444
+ },
+ {
+ "entropy": 1.1093257665634155,
+ "epoch": 2.919191919191919,
+ "grad_norm": 2.2957236766815186,
+ "learning_rate": 2.082828282828283e-06,
+ "loss": 1.1235377788543701,
+ "mean_token_accuracy": 0.7108573317527771,
+ "num_tokens": 23674880.0,
+ "step": 1445
+ },
+ {
+ "entropy": 1.2211518287658691,
+ "epoch": 2.9212121212121214,
+ "grad_norm": 2.022287130355835,
+ "learning_rate": 2.080808080808081e-06,
+ "loss": 1.241473913192749,
+ "mean_token_accuracy": 0.7020029425621033,
+ "num_tokens": 23691264.0,
+ "step": 1446
+ },
+ {
+ "entropy": 1.3636398315429688,
+ "epoch": 2.923232323232323,
+ "grad_norm": 2.1484291553497314,
+ "learning_rate": 2.078787878787879e-06,
+ "loss": 1.3876409530639648,
+ "mean_token_accuracy": 0.6714093685150146,
+ "num_tokens": 23707648.0,
+ "step": 1447
+ },
+ {
+ "entropy": 1.1615006923675537,
+ "epoch": 2.9252525252525254,
+ "grad_norm": 2.775181293487549,
+ "learning_rate": 2.0767676767676768e-06,
+ "loss": 1.1792278289794922,
+ "mean_token_accuracy": 0.7070102691650391,
+ "num_tokens": 23724032.0,
+ "step": 1448
+ },
+ {
+ "entropy": 1.6308530569076538,
+ "epoch": 2.9272727272727272,
+ "grad_norm": 2.3813729286193848,
+ "learning_rate": 2.074747474747475e-06,
+ "loss": 1.6642422676086426,
+ "mean_token_accuracy": 0.6171225905418396,
+ "num_tokens": 23740416.0,
+ "step": 1449
+ },
+ {
+ "entropy": 1.2764222621917725,
+ "epoch": 2.929292929292929,
+ "grad_norm": 2.234309196472168,
+ "learning_rate": 2.072727272727273e-06,
+ "loss": 1.2756493091583252,
+ "mean_token_accuracy": 0.6824010610580444,
+ "num_tokens": 23756800.0,
+ "step": 1450
+ },
+ {
+ "epoch": 2.929292929292929,
+ "eval_entropy": 1.366065975639128,
+ "eval_loss": 1.5328131914138794,
+ "eval_mean_token_accuracy": 0.6461491642459747,
+ "eval_num_tokens": 23756800.0,
+ "eval_runtime": 43.8548,
+ "eval_samples_per_second": 22.574,
+ "eval_steps_per_second": 2.828,
+ "step": 1450
+ },
+ {
+ "entropy": 1.178619623184204,
+ "epoch": 2.9313131313131313,
+ "grad_norm": 2.0946547985076904,
+ "learning_rate": 2.070707070707071e-06,
+ "loss": 1.1751608848571777,
+ "mean_token_accuracy": 0.704384446144104,
+ "num_tokens": 23773184.0,
+ "step": 1451
+ },
+ {
+ "entropy": 1.319455862045288,
+ "epoch": 2.9333333333333336,
+ "grad_norm": 2.1925816535949707,
+ "learning_rate": 2.0686868686868688e-06,
+ "loss": 1.3229246139526367,
+ "mean_token_accuracy": 0.6867977380752563,
+ "num_tokens": 23789568.0,
+ "step": 1452
+ },
+ {
+ "entropy": 1.787271499633789,
+ "epoch": 2.9353535353535354,
+ "grad_norm": 2.374494791030884,
+ "learning_rate": 2.0666666666666666e-06,
+ "loss": 1.7788429260253906,
+ "mean_token_accuracy": 0.589154839515686,
+ "num_tokens": 23805952.0,
+ "step": 1453
+ },
+ {
+ "entropy": 1.25193452835083,
+ "epoch": 2.937373737373737,
+ "grad_norm": 2.3499720096588135,
+ "learning_rate": 2.064646464646465e-06,
+ "loss": 1.2651758193969727,
+ "mean_token_accuracy": 0.6863092184066772,
+ "num_tokens": 23822336.0,
+ "step": 1454
+ },
+ {
+ "entropy": 1.355589747428894,
+ "epoch": 2.9393939393939394,
+ "grad_norm": 2.228123426437378,
+ "learning_rate": 2.062626262626263e-06,
+ "loss": 1.3623197078704834,
+ "mean_token_accuracy": 0.6623717546463013,
+ "num_tokens": 23838720.0,
+ "step": 1455
+ },
+ {
+ "entropy": 1.2293426990509033,
+ "epoch": 2.9414141414141413,
+ "grad_norm": 2.4237186908721924,
+ "learning_rate": 2.0606060606060607e-06,
+ "loss": 1.2226693630218506,
+ "mean_token_accuracy": 0.6903395056724548,
+ "num_tokens": 23855104.0,
+ "step": 1456
+ },
+ {
+ "entropy": 1.2312723398208618,
+ "epoch": 2.9434343434343435,
+ "grad_norm": 2.2350525856018066,
+ "learning_rate": 2.0585858585858586e-06,
+ "loss": 1.235978364944458,
+ "mean_token_accuracy": 0.696201741695404,
+ "num_tokens": 23871488.0,
+ "step": 1457
+ },
+ {
+ "entropy": 1.2731300592422485,
+ "epoch": 2.9454545454545453,
+ "grad_norm": 2.488929033279419,
+ "learning_rate": 2.0565656565656565e-06,
+ "loss": 1.2763257026672363,
+ "mean_token_accuracy": 0.6765388250350952,
+ "num_tokens": 23887872.0,
+ "step": 1458
+ },
+ {
+ "entropy": 1.1283669471740723,
+ "epoch": 2.9474747474747476,
+ "grad_norm": 2.116241693496704,
+ "learning_rate": 2.054545454545455e-06,
+ "loss": 1.1279038190841675,
+ "mean_token_accuracy": 0.7123228907585144,
+ "num_tokens": 23904256.0,
+ "step": 1459
+ },
+ {
+ "entropy": 1.4969894886016846,
+ "epoch": 2.9494949494949494,
+ "grad_norm": 2.17519474029541,
+ "learning_rate": 2.0525252525252527e-06,
+ "loss": 1.5177810192108154,
+ "mean_token_accuracy": 0.6544333100318909,
+ "num_tokens": 23920640.0,
+ "step": 1460
+ },
+ {
+ "entropy": 1.3133295774459839,
+ "epoch": 2.9515151515151516,
+ "grad_norm": 2.149486780166626,
+ "learning_rate": 2.0505050505050506e-06,
+ "loss": 1.2985190153121948,
+ "mean_token_accuracy": 0.6745237112045288,
+ "num_tokens": 23937024.0,
+ "step": 1461
+ },
+ {
+ "entropy": 1.2777348756790161,
+ "epoch": 2.9535353535353535,
+ "grad_norm": 2.124922752380371,
+ "learning_rate": 2.0484848484848485e-06,
+ "loss": 1.2731128931045532,
+ "mean_token_accuracy": 0.692415714263916,
+ "num_tokens": 23953408.0,
+ "step": 1462
+ },
+ {
+ "entropy": 1.0544995069503784,
+ "epoch": 2.9555555555555557,
+ "grad_norm": 2.177363872528076,
+ "learning_rate": 2.046464646464647e-06,
+ "loss": 1.0588994026184082,
+ "mean_token_accuracy": 0.7378480434417725,
+ "num_tokens": 23969792.0,
+ "step": 1463
+ },
+ {
+ "entropy": 1.441129446029663,
+ "epoch": 2.9575757575757575,
+ "grad_norm": 2.5355494022369385,
+ "learning_rate": 2.0444444444444447e-06,
+ "loss": 1.4684169292449951,
+ "mean_token_accuracy": 0.6495481133460999,
+ "num_tokens": 23986176.0,
+ "step": 1464
+ },
+ {
+ "entropy": 1.3359375,
+ "epoch": 2.9595959595959593,
+ "grad_norm": 2.309727191925049,
+ "learning_rate": 2.0424242424242426e-06,
+ "loss": 1.339503288269043,
+ "mean_token_accuracy": 0.6707376837730408,
+ "num_tokens": 24002560.0,
+ "step": 1465
+ },
+ {
+ "entropy": 1.5922675132751465,
+ "epoch": 2.9616161616161616,
+ "grad_norm": 2.191904067993164,
+ "learning_rate": 2.0404040404040405e-06,
+ "loss": 1.613649845123291,
+ "mean_token_accuracy": 0.635869562625885,
+ "num_tokens": 24018944.0,
+ "step": 1466
+ },
+ {
+ "entropy": 1.152869701385498,
+ "epoch": 2.963636363636364,
+ "grad_norm": 2.1656837463378906,
+ "learning_rate": 2.0383838383838388e-06,
+ "loss": 1.1791510581970215,
+ "mean_token_accuracy": 0.7013311982154846,
+ "num_tokens": 24035328.0,
+ "step": 1467
+ },
+ {
+ "entropy": 1.491494059562683,
+ "epoch": 2.9656565656565657,
+ "grad_norm": 2.397916555404663,
+ "learning_rate": 2.0363636363636367e-06,
+ "loss": 1.4803133010864258,
+ "mean_token_accuracy": 0.6395334601402283,
+ "num_tokens": 24051712.0,
+ "step": 1468
+ },
+ {
+ "entropy": 1.165432095527649,
+ "epoch": 2.9676767676767675,
+ "grad_norm": 2.0728659629821777,
+ "learning_rate": 2.0343434343434345e-06,
+ "loss": 1.1676859855651855,
+ "mean_token_accuracy": 0.7170249223709106,
+ "num_tokens": 24068096.0,
+ "step": 1469
+ },
+ {
+ "entropy": 0.7055315971374512,
+ "epoch": 2.9696969696969697,
+ "grad_norm": 1.949097752571106,
+ "learning_rate": 2.0323232323232324e-06,
+ "loss": 0.7094426155090332,
+ "mean_token_accuracy": 0.8047752976417542,
+ "num_tokens": 24084480.0,
+ "step": 1470
+ },
+ {
+ "entropy": 1.5079377889633179,
+ "epoch": 2.971717171717172,
+ "grad_norm": 2.282525062561035,
+ "learning_rate": 2.0303030303030303e-06,
+ "loss": 1.5309293270111084,
+ "mean_token_accuracy": 0.65486079454422,
+ "num_tokens": 24100864.0,
+ "step": 1471
+ },
+ {
+ "entropy": 1.6969871520996094,
+ "epoch": 2.973737373737374,
+ "grad_norm": 2.2211408615112305,
+ "learning_rate": 2.0282828282828286e-06,
+ "loss": 1.6919132471084595,
+ "mean_token_accuracy": 0.6259770393371582,
+ "num_tokens": 24117248.0,
+ "step": 1472
+ },
+ {
+ "entropy": 1.3981496095657349,
+ "epoch": 2.9757575757575756,
+ "grad_norm": 2.27559232711792,
+ "learning_rate": 2.0262626262626265e-06,
+ "loss": 1.4188807010650635,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 24133632.0,
+ "step": 1473
+ },
+ {
+ "entropy": 1.2966978549957275,
+ "epoch": 2.977777777777778,
+ "grad_norm": 2.2315874099731445,
+ "learning_rate": 2.0242424242424244e-06,
+ "loss": 1.3034720420837402,
+ "mean_token_accuracy": 0.6849047541618347,
+ "num_tokens": 24150016.0,
+ "step": 1474
+ },
+ {
+ "entropy": 1.4312105178833008,
+ "epoch": 2.9797979797979797,
+ "grad_norm": 2.3630731105804443,
+ "learning_rate": 2.0222222222222223e-06,
+ "loss": 1.412591814994812,
+ "mean_token_accuracy": 0.6673180460929871,
+ "num_tokens": 24166400.0,
+ "step": 1475
+ },
+ {
+ "entropy": 1.246411681175232,
+ "epoch": 2.981818181818182,
+ "grad_norm": 2.101142644882202,
+ "learning_rate": 2.02020202020202e-06,
+ "loss": 1.2674810886383057,
+ "mean_token_accuracy": 0.691255509853363,
+ "num_tokens": 24182784.0,
+ "step": 1476
+ },
+ {
+ "entropy": 1.2367678880691528,
+ "epoch": 2.9838383838383837,
+ "grad_norm": 2.3414289951324463,
+ "learning_rate": 2.0181818181818185e-06,
+ "loss": 1.254493236541748,
+ "mean_token_accuracy": 0.6811797618865967,
+ "num_tokens": 24199168.0,
+ "step": 1477
+ },
+ {
+ "entropy": 1.3566304445266724,
+ "epoch": 2.985858585858586,
+ "grad_norm": 2.3050434589385986,
+ "learning_rate": 2.0161616161616164e-06,
+ "loss": 1.3336361646652222,
+ "mean_token_accuracy": 0.6761724352836609,
+ "num_tokens": 24215552.0,
+ "step": 1478
+ },
+ {
+ "entropy": 1.3928223848342896,
+ "epoch": 2.987878787878788,
+ "grad_norm": 2.2100086212158203,
+ "learning_rate": 2.0141414141414143e-06,
+ "loss": 1.4050222635269165,
+ "mean_token_accuracy": 0.6573033928871155,
+ "num_tokens": 24231936.0,
+ "step": 1479
+ },
+ {
+ "entropy": 1.067913293838501,
+ "epoch": 2.98989898989899,
+ "grad_norm": 2.0196874141693115,
+ "learning_rate": 2.012121212121212e-06,
+ "loss": 1.0836842060089111,
+ "mean_token_accuracy": 0.7427943348884583,
+ "num_tokens": 24248320.0,
+ "step": 1480
+ },
+ {
+ "entropy": 1.077475905418396,
+ "epoch": 2.991919191919192,
+ "grad_norm": 2.117917776107788,
+ "learning_rate": 2.01010101010101e-06,
+ "loss": 1.0825674533843994,
+ "mean_token_accuracy": 0.7288104295730591,
+ "num_tokens": 24264704.0,
+ "step": 1481
+ },
+ {
+ "entropy": 1.092706561088562,
+ "epoch": 2.993939393939394,
+ "grad_norm": 2.143916130065918,
+ "learning_rate": 2.008080808080808e-06,
+ "loss": 1.1073365211486816,
+ "mean_token_accuracy": 0.7271006107330322,
+ "num_tokens": 24281088.0,
+ "step": 1482
+ },
+ {
+ "entropy": 1.3734595775604248,
+ "epoch": 2.995959595959596,
+ "grad_norm": 2.3651299476623535,
+ "learning_rate": 2.0060606060606062e-06,
+ "loss": 1.3319274187088013,
+ "mean_token_accuracy": 0.6729360222816467,
+ "num_tokens": 24297472.0,
+ "step": 1483
+ },
+ {
+ "entropy": 1.5602202415466309,
+ "epoch": 2.9979797979797977,
+ "grad_norm": 2.4872968196868896,
+ "learning_rate": 2.004040404040404e-06,
+ "loss": 1.5969634056091309,
+ "mean_token_accuracy": 0.6352589130401611,
+ "num_tokens": 24313856.0,
+ "step": 1484
+ },
+ {
+ "entropy": 1.4174549579620361,
+ "epoch": 3.0,
+ "grad_norm": 2.1410610675811768,
+ "learning_rate": 2.0020202020202024e-06,
+ "loss": 1.4155133962631226,
+ "mean_token_accuracy": 0.6683561205863953,
+ "num_tokens": 24330240.0,
+ "step": 1485
+ },
+ {
+ "entropy": 1.5710192918777466,
+ "epoch": 3.002020202020202,
+ "grad_norm": 2.1068179607391357,
+ "learning_rate": 2.0000000000000003e-06,
+ "loss": 1.5049738883972168,
+ "mean_token_accuracy": 0.6563873887062073,
+ "num_tokens": 24346624.0,
+ "step": 1486
+ },
+ {
+ "entropy": 1.2311826944351196,
+ "epoch": 3.004040404040404,
+ "grad_norm": 2.238032579421997,
+ "learning_rate": 1.9979797979797982e-06,
+ "loss": 1.1740195751190186,
+ "mean_token_accuracy": 0.7018197178840637,
+ "num_tokens": 24363008.0,
+ "step": 1487
+ },
+ {
+ "entropy": 1.0681109428405762,
+ "epoch": 3.006060606060606,
+ "grad_norm": 2.0808138847351074,
+ "learning_rate": 1.995959595959596e-06,
+ "loss": 1.0269291400909424,
+ "mean_token_accuracy": 0.739130437374115,
+ "num_tokens": 24379392.0,
+ "step": 1488
+ },
+ {
+ "entropy": 1.2553848028182983,
+ "epoch": 3.008080808080808,
+ "grad_norm": 2.155320644378662,
+ "learning_rate": 1.993939393939394e-06,
+ "loss": 1.209822654724121,
+ "mean_token_accuracy": 0.7072545289993286,
+ "num_tokens": 24395776.0,
+ "step": 1489
+ },
+ {
+ "entropy": 1.5376615524291992,
+ "epoch": 3.01010101010101,
+ "grad_norm": 2.376460075378418,
+ "learning_rate": 1.9919191919191923e-06,
+ "loss": 1.485018014907837,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 24412160.0,
+ "step": 1490
+ },
+ {
+ "entropy": 1.0649843215942383,
+ "epoch": 3.012121212121212,
+ "grad_norm": 2.1056692600250244,
+ "learning_rate": 1.98989898989899e-06,
+ "loss": 1.037630558013916,
+ "mean_token_accuracy": 0.7341841459274292,
+ "num_tokens": 24428544.0,
+ "step": 1491
+ },
+ {
+ "entropy": 1.3711966276168823,
+ "epoch": 3.014141414141414,
+ "grad_norm": 2.238981008529663,
+ "learning_rate": 1.987878787878788e-06,
+ "loss": 1.3336507081985474,
+ "mean_token_accuracy": 0.6914386749267578,
+ "num_tokens": 24444928.0,
+ "step": 1492
+ },
+ {
+ "entropy": 1.3955618143081665,
+ "epoch": 3.0161616161616163,
+ "grad_norm": 2.183464765548706,
+ "learning_rate": 1.985858585858586e-06,
+ "loss": 1.3517842292785645,
+ "mean_token_accuracy": 0.6735466718673706,
+ "num_tokens": 24461312.0,
+ "step": 1493
+ },
+ {
+ "entropy": 1.0063103437423706,
+ "epoch": 3.018181818181818,
+ "grad_norm": 2.1911609172821045,
+ "learning_rate": 1.983838383838384e-06,
+ "loss": 0.9973118305206299,
+ "mean_token_accuracy": 0.7280166149139404,
+ "num_tokens": 24477696.0,
+ "step": 1494
+ },
+ {
+ "entropy": 1.3080904483795166,
+ "epoch": 3.0202020202020203,
+ "grad_norm": 2.1129884719848633,
+ "learning_rate": 1.981818181818182e-06,
+ "loss": 1.2758756875991821,
+ "mean_token_accuracy": 0.7027357220649719,
+ "num_tokens": 24494080.0,
+ "step": 1495
+ },
+ {
+ "entropy": 1.5414087772369385,
+ "epoch": 3.022222222222222,
+ "grad_norm": 2.1628341674804688,
+ "learning_rate": 1.97979797979798e-06,
+ "loss": 1.527054786682129,
+ "mean_token_accuracy": 0.6569370031356812,
+ "num_tokens": 24510464.0,
+ "step": 1496
+ },
+ {
+ "entropy": 1.44732666015625,
+ "epoch": 3.0242424242424244,
+ "grad_norm": 2.2525594234466553,
+ "learning_rate": 1.977777777777778e-06,
+ "loss": 1.3968576192855835,
+ "mean_token_accuracy": 0.6604787707328796,
+ "num_tokens": 24526848.0,
+ "step": 1497
+ },
+ {
+ "entropy": 1.522241234779358,
+ "epoch": 3.026262626262626,
+ "grad_norm": 2.1826529502868652,
+ "learning_rate": 1.975757575757576e-06,
+ "loss": 1.529256820678711,
+ "mean_token_accuracy": 0.6493649482727051,
+ "num_tokens": 24543232.0,
+ "step": 1498
+ },
+ {
+ "entropy": 0.8186452984809875,
+ "epoch": 3.0282828282828285,
+ "grad_norm": 2.1004087924957275,
+ "learning_rate": 1.9737373737373737e-06,
+ "loss": 0.8136417865753174,
+ "mean_token_accuracy": 0.7819370031356812,
+ "num_tokens": 24559616.0,
+ "step": 1499
+ },
+ {
+ "entropy": 1.2122654914855957,
+ "epoch": 3.0303030303030303,
+ "grad_norm": 2.4567720890045166,
+ "learning_rate": 1.9717171717171716e-06,
+ "loss": 1.236933946609497,
+ "mean_token_accuracy": 0.6828895807266235,
+ "num_tokens": 24576000.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.0303030303030303,
+ "eval_entropy": 1.3221501962792488,
+ "eval_loss": 1.5418624877929688,
+ "eval_mean_token_accuracy": 0.6455981039231823,
+ "eval_num_tokens": 24576000.0,
+ "eval_runtime": 43.8085,
+ "eval_samples_per_second": 22.598,
+ "eval_steps_per_second": 2.831,
+ "step": 1500
+ }
+ ],
+ "logging_steps": 1,
+ "max_steps": 2475,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 5,
+ "save_steps": 500,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.07825968037888e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/training_args.bin b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/training_args.bin
new file mode 100644
index 0000000000000000000000000000000000000000..37649d4bae96a1df88666daf20b4e5b6e092d976
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/training_args.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:58bbcabfe99a1cf24f2e76aab66b507c2b720d9271dc9f17c8208d741a9c3a65
+size 7121
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/zero_to_fp32.py b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/zero_to_fp32.py
new file mode 100644
index 0000000000000000000000000000000000000000..3970548c400fd4361bd923b763db90e963ddaf8c
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/zero_to_fp32.py
@@ -0,0 +1,854 @@
+#!/usr/bin/env python
+
+# Copyright (c) Microsoft Corporation.
+# SPDX-License-Identifier: Apache-2.0
+
+# DeepSpeed Team
+
+# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets
+# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in
+# the future. Once extracted, the weights don't require DeepSpeed and can be used in any
+# application.
+#
+# example:
+# python zero_to_fp32.py . output_dir/
+# or
+# python zero_to_fp32.py . output_dir/ --safe_serialization
+
+import argparse
+import torch
+import glob
+import math
+import os
+import re
+import gc
+import json
+import numpy as np
+from tqdm import tqdm
+from collections import OrderedDict
+from dataclasses import dataclass
+
+# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with
+# DeepSpeed data structures it has to be available in the current python environment.
+from deepspeed.utils import logger
+from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS,
+ FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES,
+ FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS, AUTOEP_LAYERS_KEY,
+ AUTOEP_LAYERS_KEY_LEGACY, AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY,
+ AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT, PARAM_ALIGNMENT_PADDINGS)
+
+
+@dataclass
+class zero_model_state:
+ buffers: dict()
+ param_shapes: dict()
+ shared_params: list
+ ds_version: int
+ frozen_param_shapes: dict()
+ frozen_param_fragments: dict()
+
+
+debug = 0
+
+# load to cpu
+device = torch.device('cpu')
+
+OUTPUT_DTYPE_NAMES = {
+ 'float32': torch.float32,
+ 'fp32': torch.float32,
+ 'float16': torch.float16,
+ 'fp16': torch.float16,
+ 'bfloat16': torch.bfloat16,
+ 'bf16': torch.bfloat16,
+}
+
+
+def _resolve_output_dtype(dtype):
+ requested_dtype = dtype
+ if isinstance(dtype, str):
+ dtype_name = dtype[6:] if dtype.startswith('torch.') else dtype
+ dtype = OUTPUT_DTYPE_NAMES.get(dtype_name.lower())
+ if dtype not in set(OUTPUT_DTYPE_NAMES.values()):
+ supported = ', '.join(sorted(OUTPUT_DTYPE_NAMES))
+ raise ValueError(f"Unsupported output dtype {requested_dtype!r}. Choose one of: {supported}")
+ return dtype
+
+
+def atoi(text):
+ return int(text) if text.isdigit() else text
+
+
+def natural_keys(text):
+ '''
+ alist.sort(key=natural_keys) sorts in human order
+ http://nedbatchelder.com/blog/200712/human_sorting.html
+ (See Toothy's implementation in the comments)
+ '''
+ return [atoi(c) for c in re.split(r'(\d+)', text)]
+
+
+def get_model_state_file(checkpoint_dir, zero_stage):
+ if not os.path.isdir(checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist")
+
+ # there should be only one file
+ if zero_stage <= 2:
+ file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt")
+ elif zero_stage == 3:
+ file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt")
+
+ if not os.path.exists(file):
+ raise FileNotFoundError(f"can't find model states file at '{file}'")
+
+ return file
+
+
+def get_checkpoint_files(checkpoint_dir, glob_pattern):
+ # XXX: need to test that this simple glob rule works for multi-node setup too
+ ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys)
+
+ if len(ckpt_files) == 0:
+ raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'")
+
+ return ckpt_files
+
+
+def get_optim_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt")
+
+
+def get_model_state_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_model_states.pt")
+
+
+def _has_autoep_zero3_partitioned_metadata(state_dict):
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY)
+ if autoep_layers is None:
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY_LEGACY)
+ if not isinstance(autoep_layers, list):
+ return False
+ return any(
+ isinstance(entry, dict)
+ and entry.get(AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY) == AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT
+ for entry in autoep_layers)
+
+
+def _raise_if_autoep_zero3_partitioned_state(state_dict):
+ if _has_autoep_zero3_partitioned_metadata(state_dict):
+ raise NotImplementedError("zero_to_fp32 does not support AutoEP ZeRO-3 partition-native checkpoints. "
+ "AutoEP expert parameters are partitioned over expert replica groups, so "
+ "global data-parallel consolidation would produce incomplete expert tensors. "
+ "Use ds_to_universal.py for expert-aware conversion.")
+
+
+def _raise_if_autoep_zero3_partitioned_checkpoint(model_files):
+ for file in model_files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+
+def parse_model_states(files):
+ zero_model_states = []
+ for file in files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+ if BUFFER_NAMES not in state_dict:
+ raise ValueError(f"{file} is not a model state checkpoint")
+ buffer_names = state_dict[BUFFER_NAMES]
+ if debug:
+ print("Found buffers:", buffer_names)
+
+ # recover just the buffers while restoring them to fp32 if they were saved in fp16
+ buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names}
+ param_shapes = state_dict[PARAM_SHAPES]
+
+ # collect parameters that are included in param_shapes
+ param_names = []
+ for s in param_shapes:
+ for name in s.keys():
+ param_names.append(name)
+
+ # update with frozen parameters
+ frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None)
+ if frozen_param_shapes is not None:
+ if debug:
+ print(f"Found frozen_param_shapes: {frozen_param_shapes}")
+ param_names += list(frozen_param_shapes.keys())
+
+ # handle shared params
+ shared_params = [[k, v] for k, v in state_dict["shared_params"].items()]
+
+ ds_version = state_dict.get(DS_VERSION, None)
+
+ frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None)
+
+ z_model_state = zero_model_state(buffers=buffers,
+ param_shapes=param_shapes,
+ shared_params=shared_params,
+ ds_version=ds_version,
+ frozen_param_shapes=frozen_param_shapes,
+ frozen_param_fragments=frozen_param_fragments)
+ zero_model_states.append(z_model_state)
+
+ return zero_model_states
+
+
+def parse_optim_states(files, ds_checkpoint_dir):
+ total_files = len(files)
+ state_dicts = []
+ for f in tqdm(files, desc='Loading checkpoint shards'):
+ state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False)
+ # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights
+ # and also handle the case where it was already removed by another helper script
+ state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None)
+ state_dicts.append(state_dict)
+
+ if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]:
+ raise ValueError(f"{files[0]} is not a zero checkpoint")
+ zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE]
+ world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT]
+
+ # For ZeRO-2 each param group can have different partition_count as data parallelism for expert
+ # parameters can be different from data parallelism for non-expert parameters. So we can just
+ # use the max of the partition_count to get the dp world_size.
+
+ if type(world_size) is list:
+ world_size = max(world_size)
+
+ if world_size != total_files:
+ raise ValueError(
+ f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. "
+ "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes."
+ )
+
+ # the groups are named differently in each stage
+ if zero_stage <= 2:
+ fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS
+ elif zero_stage == 3:
+ fp32_groups_key = FP32_FLAT_GROUPS
+ else:
+ raise ValueError(f"unknown zero stage {zero_stage}")
+
+ fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))]
+ param_alignment_paddings = state_dicts[0][OPTIMIZER_STATE_DICT].get(PARAM_ALIGNMENT_PADDINGS)
+ return zero_stage, world_size, fp32_flat_groups, param_alignment_paddings
+
+
+def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters):
+ """
+ Returns fp32 state_dict reconstructed from ds checkpoint
+
+ Args:
+ - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are)
+
+ """
+ print(f"Processing zero checkpoint '{ds_checkpoint_dir}'")
+
+ # parse_model_states rejects AutoEP ZeRO-3 partition-native checkpoints
+ # before the expensive optimizer-shard load below.
+ model_files = get_model_state_files(ds_checkpoint_dir)
+ zero_model_states = parse_model_states(model_files)
+ print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}')
+
+ optim_files = get_optim_files(ds_checkpoint_dir)
+ zero_stage, world_size, fp32_flat_groups, param_alignment_paddings = parse_optim_states(
+ optim_files, ds_checkpoint_dir)
+ print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}")
+
+ if zero_stage <= 2:
+ return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters, param_alignment_paddings)
+ elif zero_stage == 3:
+ return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters)
+
+
+def _zero2_merge_frozen_params(state_dict, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ frozen_param_fragments = zero_model_states[0].frozen_param_fragments
+
+ if debug:
+ num_elem = sum(s.numel() for s in frozen_param_shapes.values())
+ print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in frozen_param_fragments.values()])
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ state_dict[name] = frozen_param_fragments[name]
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _has_callable(obj, fn):
+ attr = getattr(obj, fn, None)
+ return callable(attr)
+
+
+def _zero2_merge_trainable_params(state_dict,
+ world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ param_alignment_paddings=None):
+ param_shapes = zero_model_states[0].param_shapes
+
+ # Reconstruction protocol:
+ #
+ # XXX: document this
+
+ if debug:
+ for i in range(world_size):
+ for j in range(len(fp32_flat_groups[0])):
+ print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}")
+
+ # XXX: memory usage doubles here (zero2)
+ num_param_groups = len(fp32_flat_groups[0])
+ merged_single_partition_of_fp32_groups = []
+ for i in range(num_param_groups):
+ merged_partitions = [sd[i] for sd in fp32_flat_groups]
+ full_single_fp32_vector = torch.cat(merged_partitions, 0)
+ merged_single_partition_of_fp32_groups.append(full_single_fp32_vector)
+ avail_numel = sum(
+ [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups])
+
+ if debug:
+ wanted_params = sum([len(shapes) for shapes in param_shapes])
+ wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes])
+ # not asserting if there is a mismatch due to possible padding
+ print(f"Have {avail_numel} numels to process.")
+ print(f"Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ total_numel = 0
+ total_params = 0
+ for group_idx, (shapes,
+ full_single_fp32_vector) in enumerate(zip(param_shapes, merged_single_partition_of_fp32_groups)):
+ offset = 0
+ avail_numel = full_single_fp32_vector.numel()
+ group_alignment_paddings = None
+ if param_alignment_paddings is not None:
+ group_alignment_paddings = param_alignment_paddings[group_idx]
+ if len(group_alignment_paddings) != len(shapes):
+ raise ValueError(f"Expected {len(shapes)} parameter alignment paddings for group {group_idx}, "
+ f"but found {len(group_alignment_paddings)}")
+
+ for param_idx, (name, shape) in enumerate(shapes.items()):
+
+ unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape)
+ total_numel += unpartitioned_numel
+ total_params += 1
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+ state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape)
+ offset += unpartitioned_numel
+ if group_alignment_paddings is not None:
+ offset += group_alignment_paddings[param_idx]
+
+ # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and
+ # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex
+ # paddings performed in the code it's almost impossible to predict the exact numbers w/o the
+ # live optimizer object, so we are checking that the numbers are within the right range
+ align_to = 2 * world_size
+
+ def zero2_align(x):
+ return align_to * math.ceil(x / align_to)
+
+ if debug:
+ print(f"original offset={offset}, avail_numel={avail_numel}")
+
+ offset = zero2_align(offset)
+ avail_numel = zero2_align(avail_numel)
+
+ if debug:
+ print(f"aligned offset={offset}, avail_numel={avail_numel}")
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero2_checkpoint(world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ exclude_frozen_parameters,
+ param_alignment_paddings=None):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero2_merge_frozen_params(state_dict, zero_model_states)
+
+ _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states,
+ param_alignment_paddings)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def zero3_partitioned_param_info(unpartitioned_numel, world_size):
+ remainder = unpartitioned_numel % world_size
+ padding_numel = (world_size - remainder) if remainder else 0
+ partitioned_numel = math.ceil(unpartitioned_numel / world_size)
+ return partitioned_numel, padding_numel
+
+
+def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ if debug:
+ for i in range(world_size):
+ num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values())
+ print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in zero_model_states[0].frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states)
+ state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape)
+
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+class GatheredTensor:
+ """
+ A pseudo tensor that collects partitioned weights.
+ It is more memory efficient when there are multiple groups.
+ """
+
+ def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape):
+ self.flat_groups = flat_groups
+ self.flat_groups_offset = flat_groups_offset
+ self.offset = offset
+ self.partitioned_numel = partitioned_numel
+ self.shape = shape
+ self.dtype = self.flat_groups[0][0].dtype
+
+ def contiguous(self):
+ """
+ Merge partitioned weights from flat_groups into a single tensor.
+ """
+ end_idx = self.offset + self.partitioned_numel
+ world_size = len(self.flat_groups)
+ pad_flat_param_chunks = []
+
+ for rank_i in range(world_size):
+ # for each rank, we need to collect weights from related group/groups
+ flat_groups_at_rank_i = self.flat_groups[rank_i]
+ start_group_id = None
+ end_group_id = None
+ for group_id in range(len(self.flat_groups_offset)):
+ if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]:
+ start_group_id = group_id
+ if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]:
+ end_group_id = group_id
+ break
+ # collect weights from related group/groups
+ for group_id in range(start_group_id, end_group_id + 1):
+ flat_tensor = flat_groups_at_rank_i[group_id]
+ start_offset = self.offset - self.flat_groups_offset[group_id]
+ end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id]
+ pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset])
+
+ # collect weights from all ranks
+ pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0)
+ param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous()
+ return param
+
+
+def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states):
+ param_shapes = zero_model_states[0].param_shapes
+ avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size
+
+ # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each
+ # param, re-consolidating each param, while dealing with padding if any
+
+ # merge list of dicts, preserving order
+ param_shapes = {k: v for d in param_shapes for k, v in d.items()}
+
+ if debug:
+ for i in range(world_size):
+ print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}")
+
+ wanted_params = len(param_shapes)
+ wanted_numel = sum(shape.numel() for shape in param_shapes.values())
+ # not asserting if there is a mismatch due to possible padding
+ avail_numel = fp32_flat_groups[0].numel() * world_size
+ print(f"Trainable params: Have {avail_numel} numels to process.")
+ print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ offset = 0
+ total_numel = 0
+ total_params = 0
+ flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]]))
+ for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'):
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+ total_params += 1
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ # memory efficient tensor
+ tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape)
+ state_dict[name] = tensor
+ offset += partitioned_numel
+
+ offset *= world_size
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero3_merge_frozen_params(state_dict, world_size, zero_model_states)
+
+ _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def to_torch_tensor(state_dict, return_empty_tensor=False, dtype=None):
+ """
+ Convert state_dict of GatheredTensor to torch tensor
+ """
+ if dtype is not None:
+ dtype = _resolve_output_dtype(dtype)
+
+ torch_state_dict = {}
+ converted_tensors = {}
+ for name, tensor in state_dict.items():
+ tensor_id = id(tensor)
+ if tensor_id in converted_tensors: # shared tensors
+ shared_tensor = torch_state_dict[converted_tensors[tensor_id]]
+ torch_state_dict[name] = shared_tensor
+ else:
+ converted_tensors[tensor_id] = name
+ if return_empty_tensor:
+ torch_state_dict[name] = torch.empty(tensor.shape, dtype=dtype or tensor.dtype)
+ else:
+ contiguous_tensor = tensor.contiguous()
+ torch_state_dict[name] = contiguous_tensor.to(dtype=dtype) if dtype else contiguous_tensor
+ return torch_state_dict
+
+
+def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag=None,
+ exclude_frozen_parameters=False,
+ lazy_mode=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with
+ ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example
+ via a model hub.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient.
+ Convert the pesduo tensor to torch tensor by ``.contiguous()``
+
+ Returns:
+ - pytorch ``state_dict``
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ # do the training and checkpoint saving
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu
+ model = model.cpu() # move to cpu
+ model.load_state_dict(state_dict)
+ # submit to model hub or save the model to share with others
+
+ In this example the ``model`` will no longer be usable in the deepspeed context of the same
+ application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead.
+
+ Note: the above usage may not work if your application doesn't have sufficient free CPU memory.
+ You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with
+ the checkpoint. Or you can load state_dict in lazy mode ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu
+ for name, lazy_tensor in state_dict.item():
+ tensor = lazy_tensor.contiguous() # to cpu
+ print(name, tensor)
+ # del tensor to release memory if it no longer in use
+ """
+ if tag is None:
+ latest_path = os.path.join(checkpoint_dir, 'latest')
+ if os.path.isfile(latest_path):
+ with open(latest_path, 'r') as fd:
+ tag = fd.read().strip()
+ else:
+ raise ValueError(f"Unable to find 'latest' file at {latest_path}")
+
+ ds_checkpoint_dir = os.path.join(checkpoint_dir, tag)
+
+ if not os.path.isdir(ds_checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist")
+
+ state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters)
+ if lazy_mode:
+ return state_dict
+ else:
+ return to_torch_tensor(state_dict)
+
+
+def convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a consolidated ``state_dict`` file that can be
+ loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``output_dir``: directory for the PyTorch state_dict output files
+ - ``dtype``: output tensor dtype. Supports float32, float16, and bfloat16 as strings or torch dtypes.
+ - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB
+ - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ """
+
+ dtype = _resolve_output_dtype(dtype)
+
+ # Dependency pre-check
+ if safe_serialization:
+ try:
+ from safetensors.torch import save_file
+ except ImportError:
+ print('If you want to use `safe_serialization`, please `pip install safetensors`')
+ raise
+ if max_shard_size is not None:
+ try:
+ from huggingface_hub import split_torch_state_dict_into_shards
+ except ImportError:
+ print('If you want to use `max_shard_size`, please `pip install huggingface_hub`')
+ raise
+
+ # Convert zero checkpoint to state_dict
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag,
+ exclude_frozen_parameters,
+ lazy_mode=True)
+
+ # Shard the model if it is too big.
+ weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin"
+ if max_shard_size is not None:
+ filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors")
+ # an memory-efficient approach for sharding
+ empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True, dtype=dtype)
+ state_dict_split = split_torch_state_dict_into_shards(empty_state_dict,
+ filename_pattern=filename_pattern,
+ max_shard_size=max_shard_size)
+ else:
+ from collections import namedtuple
+ StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"])
+ state_dict_split = StateDictSplit(is_sharded=False,
+ filename_to_tensors={weights_name: list(state_dict.keys())})
+
+ # Save the model by shard
+ os.makedirs(output_dir, exist_ok=True)
+ filename_to_tensors = state_dict_split.filename_to_tensors.items()
+ for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"):
+ shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors}
+ shard_state_dict = to_torch_tensor(shard_state_dict, dtype=dtype)
+ output_path = os.path.join(output_dir, shard_file)
+ if safe_serialization:
+ save_file(shard_state_dict, output_path, metadata={"format": "pt"})
+ else:
+ torch.save(shard_state_dict, output_path)
+ # release the memory of current shard
+ for tensor_name in list(shard_state_dict.keys()):
+ del state_dict[tensor_name]
+ del shard_state_dict[tensor_name]
+ del shard_state_dict
+ gc.collect()
+
+ # Save index if sharded
+ if state_dict_split.is_sharded:
+ index = {
+ "metadata": state_dict_split.metadata,
+ "weight_map": state_dict_split.tensor_to_filename,
+ }
+ save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json"
+ save_index_file = os.path.join(output_dir, save_index_file)
+ with open(save_index_file, "w", encoding="utf-8") as f:
+ content = json.dumps(index, indent=2, sort_keys=True) + "\n"
+ f.write(content)
+
+
+def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir,
+ output_dir,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """Backward-compatible fp32 checkpoint conversion."""
+ return convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size=max_shard_size,
+ safe_serialization=safe_serialization,
+ tag=tag,
+ exclude_frozen_parameters=exclude_frozen_parameters)
+
+
+def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None):
+ """
+ 1. Put the provided model to cpu
+ 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict``
+ 3. Load it into the provided model
+
+ Args:
+ - ``model``: the model object to update
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+
+ Returns:
+ - ``model`: modified model
+
+ Make sure you have plenty of CPU memory available before you call this function. If you don't
+ have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it
+ conveniently placed for you in the checkpoint folder.
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint
+ model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir)
+ # submit to model hub or save the model to share with others
+
+ Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context
+ of the same application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ """
+ logger.info("Extracting fp32 weights")
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag)
+
+ logger.info("Overwriting model with fp32 weights")
+ model = model.cpu()
+ model.load_state_dict(state_dict, strict=False)
+
+ return model
+
+
+if __name__ == "__main__":
+ parser = argparse.ArgumentParser()
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir",
+ type=str,
+ help="directory to the pytorch fp32 state_dict output files"
+ "(e.g. path/checkpoint-12-output/)")
+ parser.add_argument(
+ "--max_shard_size",
+ type=str,
+ default="5GB",
+ help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size"
+ "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`"
+ "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances"
+ "without CPU OOM issues.")
+ parser.add_argument(
+ "--safe_serialization",
+ default=False,
+ action='store_true',
+ help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug")
+ args = parser.parse_args()
+
+ debug = args.debug
+
+ convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir,
+ args.output_dir,
+ max_shard_size=args.max_shard_size,
+ safe_serialization=args.safe_serialization,
+ tag=args.tag,
+ exclude_frozen_parameters=args.exclude_frozen_parameters)
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-1500/zero_to_torch.py b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/zero_to_torch.py
new file mode 100644
index 0000000000000000000000000000000000000000..81312e252400d77f03cc1a88522f8f18ebe70ee7
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-1500/zero_to_torch.py
@@ -0,0 +1,54 @@
+#!/usr/bin/env python
+
+# SPDX-License-Identifier: Apache-2.0
+# DeepSpeed Team
+
+import argparse
+
+if __package__:
+ from . import zero_to_fp32
+else:
+ import zero_to_fp32
+
+
+def main(args=None):
+ parser = argparse.ArgumentParser(
+ description="Convert a DeepSpeed ZeRO checkpoint to float32, float16, or bfloat16 PyTorch weights.")
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir", type=str, help="directory for the converted PyTorch state_dict files")
+ parser.add_argument("--dtype",
+ type=str,
+ choices=sorted(zero_to_fp32.OUTPUT_DTYPE_NAMES),
+ required=True,
+ help="output tensor dtype")
+ parser.add_argument("--max_shard_size",
+ type=str,
+ default="5GB",
+ help="maximum size of each checkpoint shard, such as 5GB or 500MB")
+ parser.add_argument("--safe_serialization",
+ default=False,
+ action='store_true',
+ help="save with safetensors instead of PyTorch pickle serialization")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier, e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug output")
+ parsed_args = parser.parse_args(args)
+
+ zero_to_fp32.debug = parsed_args.debug
+ zero_to_fp32.convert_zero_checkpoint_to_state_dict(parsed_args.checkpoint_dir,
+ parsed_args.output_dir,
+ dtype=parsed_args.dtype,
+ max_shard_size=parsed_args.max_shard_size,
+ safe_serialization=parsed_args.safe_serialization,
+ tag=parsed_args.tag,
+ exclude_frozen_parameters=parsed_args.exclude_frozen_parameters)
+
+
+if __name__ == "__main__":
+ main()
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/chat_template.jinja b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..01be9b307daa2d425f7c168c9fb145a286e0afb4
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/chat_template.jinja
@@ -0,0 +1,89 @@
+{%- if tools %}
+ {{- '<|im_start|>system\n' }}
+ {%- if messages[0].role == 'system' %}
+ {{- messages[0].content + '\n\n' }}
+ {%- endif %}
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+{%- endfor %}
+{%- for message in messages %}
+ {%- if message.content is string %}
+ {%- set content = message.content %}
+ {%- else %}
+ {%- set content = '' %}
+ {%- endif %}
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {%- if loop.last or (not loop.last and reasoning_content) %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if (loop.first and content) or (not loop.first) %}
+ {{- '\n' }}
+ {%- endif %}
+ {%- if tool_call.function %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {{- '\n{"name": "' }}
+ {{- tool_call.name }}
+ {{- '", "arguments": ' }}
+ {%- if tool_call.arguments is string %}
+ {{- tool_call.arguments }}
+ {%- else %}
+ {{- tool_call.arguments | tojson }}
+ {%- endif %}
+ {{- '}\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/config.json
new file mode 100644
index 0000000000000000000000000000000000000000..5d9cef07396baadff5390e4508eb33025967a029
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/config.json
@@ -0,0 +1,63 @@
+{
+ "architectures": [
+ "Qwen3ForCausalLM"
+ ],
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "bos_token_id": null,
+ "dtype": "bfloat16",
+ "eos_token_id": 151645,
+ "head_dim": 128,
+ "hidden_act": "silu",
+ "hidden_size": 2048,
+ "initializer_range": 0.02,
+ "intermediate_size": 6144,
+ "layer_types": [
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 40960,
+ "max_window_layers": 28,
+ "model_type": "qwen3",
+ "num_attention_heads": 16,
+ "num_hidden_layers": 28,
+ "num_key_value_heads": 8,
+ "pad_token_id": 151643,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 1000000,
+ "rope_type": "default"
+ },
+ "sliding_window": null,
+ "tie_word_embeddings": true,
+ "transformers_version": "5.17.0",
+ "use_cache": false,
+ "use_sliding_window": false,
+ "vocab_size": 151936
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/generation_config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/generation_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..e6941fe4b04f26113d6eef6255d005c4d7090bda
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/generation_config.json
@@ -0,0 +1,12 @@
+{
+ "do_sample": true,
+ "eos_token_id": [
+ 151645,
+ 151643
+ ],
+ "pad_token_id": 151643,
+ "temperature": 0.6,
+ "top_k": 20,
+ "top_p": 0.95,
+ "transformers_version": "5.17.0"
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/global_step2000/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/global_step2000/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..834cd976d9e71cf7b099bd0efa63507b555ac495
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/global_step2000/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:a0d779bffcda80802a00b348c93b525e847aeccc7cbcafda7ed86b1a88ec1069
+size 10323466465
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/global_step2000/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/global_step2000/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..dd7215effa406a87d884bd3af9b0f85b7c43b90d
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/global_step2000/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:daecf4566e66c88fcd309ce3aba5da089ab37abdc6891f3b6ba8d8df0d48ba8f
+size 10323469601
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/global_step2000/mp_rank_00_model_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/global_step2000/mp_rank_00_model_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..dc74033440963f3e77ac017a965f3a45030b0f28
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/global_step2000/mp_rank_00_model_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:45c09d755ed01b0ea4fe35f32b10bd63db0e8086769ac84fd5049bdba762a059
+size 3441239653
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/latest b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/latest
new file mode 100644
index 0000000000000000000000000000000000000000..2a79fdc19587e6bc9de060e90633f3a151b04516
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/latest
@@ -0,0 +1 @@
+global_step2000
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/model.safetensors b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..eb107f5e76a61c6ec0ddd81a8c5648813cb3aedb
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e9ad2ae2eccd2d25725cbab98630d5cf046772ec49e9ae29babb873050effdd0
+size 4063515640
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/rng_state_0.pth b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/rng_state_0.pth
new file mode 100644
index 0000000000000000000000000000000000000000..04513840b62d3e018ff37182c0f54f8ed73c4e0a
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/rng_state_0.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:65b696b81e6048057ec73ebbecce9e099e8e7e9def2b9e40427c243c14361122
+size 14917
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/rng_state_1.pth b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/rng_state_1.pth
new file mode 100644
index 0000000000000000000000000000000000000000..6688ff31bee1ef557de16309352a444d38022bdd
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/rng_state_1.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:d593efd097dd20c875d98b61c5076e822e2b0d0f0d46d6585d7cf1ad3dce6064
+size 14917
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/scheduler.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/scheduler.pt
new file mode 100644
index 0000000000000000000000000000000000000000..2467ac2cfd96c61f28a002b407da7209db76d322
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/scheduler.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:20171101247c2634d0eeb994a96067416f05cf852a206d8c12e9dfa66c1485fe
+size 1465
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/tokenizer.json b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..c7afbed2efcdf019f88ab0572ec29d3bf595dfe2
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:be75606093db2094d7cd20f3c2f385c212750648bd6ea4fb2bf507a6a4c55506
+size 11422650
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/tokenizer_config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..770e41d6c92519d525eede4cbcf3ba27f6425311
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/tokenizer_config.json
@@ -0,0 +1,30 @@
+{
+ "add_prefix_space": false,
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "is_local": false,
+ "local_files_only": false,
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/trainer_state.json b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..1ac7d399edb6edefe641329287dff76d57f4441a
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/trainer_state.json
@@ -0,0 +1,20474 @@
+{
+ "best_global_step": 950,
+ "best_metric": 1.5272752046585083,
+ "best_model_checkpoint": "./checkpoints/qwen3-1.7b-teutonic-5e6/checkpoint-500",
+ "epoch": 4.040404040404041,
+ "eval_steps": 50,
+ "global_step": 2000,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 0.8295683860778809,
+ "epoch": 0.00202020202020202,
+ "grad_norm": 10.886772155761719,
+ "learning_rate": 5e-06,
+ "loss": 1.5185801982879639,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 16384.0,
+ "step": 1
+ },
+ {
+ "entropy": 1.1781222820281982,
+ "epoch": 0.00404040404040404,
+ "grad_norm": 13.80163288116455,
+ "learning_rate": 4.997979797979798e-06,
+ "loss": 2.18377685546875,
+ "mean_token_accuracy": 0.5700415372848511,
+ "num_tokens": 32768.0,
+ "step": 2
+ },
+ {
+ "entropy": 0.7972303032875061,
+ "epoch": 0.006060606060606061,
+ "grad_norm": 13.71261215209961,
+ "learning_rate": 4.995959595959596e-06,
+ "loss": 1.5810277462005615,
+ "mean_token_accuracy": 0.6782486438751221,
+ "num_tokens": 49152.0,
+ "step": 3
+ },
+ {
+ "entropy": 0.9709298610687256,
+ "epoch": 0.00808080808080808,
+ "grad_norm": 9.18797779083252,
+ "learning_rate": 4.993939393939394e-06,
+ "loss": 1.6923656463623047,
+ "mean_token_accuracy": 0.6447850465774536,
+ "num_tokens": 65536.0,
+ "step": 4
+ },
+ {
+ "entropy": 1.2161898612976074,
+ "epoch": 0.010101010101010102,
+ "grad_norm": 8.97508430480957,
+ "learning_rate": 4.991919191919192e-06,
+ "loss": 1.9361608028411865,
+ "mean_token_accuracy": 0.5922691822052002,
+ "num_tokens": 81920.0,
+ "step": 5
+ },
+ {
+ "entropy": 0.9950039982795715,
+ "epoch": 0.012121212121212121,
+ "grad_norm": 6.453213214874268,
+ "learning_rate": 4.98989898989899e-06,
+ "loss": 1.5012480020523071,
+ "mean_token_accuracy": 0.6671959161758423,
+ "num_tokens": 98304.0,
+ "step": 6
+ },
+ {
+ "entropy": 1.452682614326477,
+ "epoch": 0.014141414141414142,
+ "grad_norm": 8.50411605834961,
+ "learning_rate": 4.987878787878789e-06,
+ "loss": 2.1297783851623535,
+ "mean_token_accuracy": 0.5807889699935913,
+ "num_tokens": 114688.0,
+ "step": 7
+ },
+ {
+ "entropy": 1.4661014080047607,
+ "epoch": 0.01616161616161616,
+ "grad_norm": 4.290146827697754,
+ "learning_rate": 4.9858585858585865e-06,
+ "loss": 1.7391963005065918,
+ "mean_token_accuracy": 0.611993134021759,
+ "num_tokens": 131072.0,
+ "step": 8
+ },
+ {
+ "entropy": 1.9030903577804565,
+ "epoch": 0.01818181818181818,
+ "grad_norm": 4.503584384918213,
+ "learning_rate": 4.983838383838384e-06,
+ "loss": 2.283596992492676,
+ "mean_token_accuracy": 0.5261968970298767,
+ "num_tokens": 147456.0,
+ "step": 9
+ },
+ {
+ "entropy": 1.2784137725830078,
+ "epoch": 0.020202020202020204,
+ "grad_norm": 3.427410840988159,
+ "learning_rate": 4.981818181818182e-06,
+ "loss": 1.5032392740249634,
+ "mean_token_accuracy": 0.6578529477119446,
+ "num_tokens": 163840.0,
+ "step": 10
+ },
+ {
+ "entropy": 1.7487188577651978,
+ "epoch": 0.022222222222222223,
+ "grad_norm": 3.20536470413208,
+ "learning_rate": 4.97979797979798e-06,
+ "loss": 1.9184643030166626,
+ "mean_token_accuracy": 0.6093673706054688,
+ "num_tokens": 180224.0,
+ "step": 11
+ },
+ {
+ "entropy": 1.6585394144058228,
+ "epoch": 0.024242424242424242,
+ "grad_norm": 3.2463598251342773,
+ "learning_rate": 4.977777777777778e-06,
+ "loss": 1.8364639282226562,
+ "mean_token_accuracy": 0.6014899611473083,
+ "num_tokens": 196608.0,
+ "step": 12
+ },
+ {
+ "entropy": 1.4869519472122192,
+ "epoch": 0.026262626262626262,
+ "grad_norm": 2.8681719303131104,
+ "learning_rate": 4.975757575757576e-06,
+ "loss": 1.6356265544891357,
+ "mean_token_accuracy": 0.6361138224601746,
+ "num_tokens": 212992.0,
+ "step": 13
+ },
+ {
+ "entropy": 1.5179094076156616,
+ "epoch": 0.028282828282828285,
+ "grad_norm": 3.0470707416534424,
+ "learning_rate": 4.973737373737374e-06,
+ "loss": 1.6317660808563232,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 229376.0,
+ "step": 14
+ },
+ {
+ "entropy": 1.7384330034255981,
+ "epoch": 0.030303030303030304,
+ "grad_norm": 2.6149742603302,
+ "learning_rate": 4.971717171717172e-06,
+ "loss": 1.67923903465271,
+ "mean_token_accuracy": 0.6469223499298096,
+ "num_tokens": 245760.0,
+ "step": 15
+ },
+ {
+ "entropy": 2.108799457550049,
+ "epoch": 0.03232323232323232,
+ "grad_norm": 3.694795608520508,
+ "learning_rate": 4.9696969696969696e-06,
+ "loss": 1.9052371978759766,
+ "mean_token_accuracy": 0.5927577018737793,
+ "num_tokens": 262144.0,
+ "step": 16
+ },
+ {
+ "entropy": 1.7532848119735718,
+ "epoch": 0.03434343434343434,
+ "grad_norm": 3.1510567665100098,
+ "learning_rate": 4.9676767676767675e-06,
+ "loss": 1.6382691860198975,
+ "mean_token_accuracy": 0.6311675906181335,
+ "num_tokens": 278528.0,
+ "step": 17
+ },
+ {
+ "entropy": 1.723548412322998,
+ "epoch": 0.03636363636363636,
+ "grad_norm": 3.093825340270996,
+ "learning_rate": 4.965656565656566e-06,
+ "loss": 1.6039624214172363,
+ "mean_token_accuracy": 0.6313507556915283,
+ "num_tokens": 294912.0,
+ "step": 18
+ },
+ {
+ "entropy": 1.4790765047073364,
+ "epoch": 0.03838383838383838,
+ "grad_norm": 2.7150535583496094,
+ "learning_rate": 4.963636363636364e-06,
+ "loss": 1.4173667430877686,
+ "mean_token_accuracy": 0.6627381443977356,
+ "num_tokens": 311296.0,
+ "step": 19
+ },
+ {
+ "entropy": 1.5827536582946777,
+ "epoch": 0.04040404040404041,
+ "grad_norm": 2.610966444015503,
+ "learning_rate": 4.961616161616162e-06,
+ "loss": 1.4604644775390625,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 327680.0,
+ "step": 20
+ },
+ {
+ "entropy": 2.054673194885254,
+ "epoch": 0.04242424242424243,
+ "grad_norm": 2.612940788269043,
+ "learning_rate": 4.95959595959596e-06,
+ "loss": 1.962029218673706,
+ "mean_token_accuracy": 0.5719956159591675,
+ "num_tokens": 344064.0,
+ "step": 21
+ },
+ {
+ "entropy": 1.6684198379516602,
+ "epoch": 0.044444444444444446,
+ "grad_norm": 2.5426013469696045,
+ "learning_rate": 4.957575757575758e-06,
+ "loss": 1.591176986694336,
+ "mean_token_accuracy": 0.6519907116889954,
+ "num_tokens": 360448.0,
+ "step": 22
+ },
+ {
+ "entropy": 1.9070855379104614,
+ "epoch": 0.046464646464646465,
+ "grad_norm": 2.5853357315063477,
+ "learning_rate": 4.9555555555555565e-06,
+ "loss": 1.930276870727539,
+ "mean_token_accuracy": 0.5895823240280151,
+ "num_tokens": 376832.0,
+ "step": 23
+ },
+ {
+ "entropy": 1.716689109802246,
+ "epoch": 0.048484848484848485,
+ "grad_norm": 2.7608494758605957,
+ "learning_rate": 4.953535353535354e-06,
+ "loss": 1.739159345626831,
+ "mean_token_accuracy": 0.6028944849967957,
+ "num_tokens": 393216.0,
+ "step": 24
+ },
+ {
+ "entropy": 1.5666695833206177,
+ "epoch": 0.050505050505050504,
+ "grad_norm": 2.5973074436187744,
+ "learning_rate": 4.951515151515152e-06,
+ "loss": 1.6016302108764648,
+ "mean_token_accuracy": 0.626099169254303,
+ "num_tokens": 409600.0,
+ "step": 25
+ },
+ {
+ "entropy": 1.4267652034759521,
+ "epoch": 0.052525252525252523,
+ "grad_norm": 2.163451910018921,
+ "learning_rate": 4.94949494949495e-06,
+ "loss": 1.5093598365783691,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 425984.0,
+ "step": 26
+ },
+ {
+ "entropy": 1.8537150621414185,
+ "epoch": 0.05454545454545454,
+ "grad_norm": 2.6983258724212646,
+ "learning_rate": 4.947474747474748e-06,
+ "loss": 1.8831868171691895,
+ "mean_token_accuracy": 0.5802393555641174,
+ "num_tokens": 442368.0,
+ "step": 27
+ },
+ {
+ "entropy": 1.410015344619751,
+ "epoch": 0.05656565656565657,
+ "grad_norm": 2.4777796268463135,
+ "learning_rate": 4.945454545454546e-06,
+ "loss": 1.4835734367370605,
+ "mean_token_accuracy": 0.6519907116889954,
+ "num_tokens": 458752.0,
+ "step": 28
+ },
+ {
+ "entropy": 1.2399017810821533,
+ "epoch": 0.05858585858585859,
+ "grad_norm": 2.1676478385925293,
+ "learning_rate": 4.943434343434344e-06,
+ "loss": 1.330633282661438,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 475136.0,
+ "step": 29
+ },
+ {
+ "entropy": 1.6478898525238037,
+ "epoch": 0.06060606060606061,
+ "grad_norm": 2.5325536727905273,
+ "learning_rate": 4.941414141414142e-06,
+ "loss": 1.771777868270874,
+ "mean_token_accuracy": 0.6128480434417725,
+ "num_tokens": 491520.0,
+ "step": 30
+ },
+ {
+ "entropy": 1.7915360927581787,
+ "epoch": 0.06262626262626263,
+ "grad_norm": 2.2419557571411133,
+ "learning_rate": 4.93939393939394e-06,
+ "loss": 1.870645523071289,
+ "mean_token_accuracy": 0.6074743270874023,
+ "num_tokens": 507904.0,
+ "step": 31
+ },
+ {
+ "entropy": 1.7638899087905884,
+ "epoch": 0.06464646464646465,
+ "grad_norm": 2.8063058853149414,
+ "learning_rate": 4.937373737373738e-06,
+ "loss": 1.83987557888031,
+ "mean_token_accuracy": 0.5836589932441711,
+ "num_tokens": 524288.0,
+ "step": 32
+ },
+ {
+ "entropy": 1.4097516536712646,
+ "epoch": 0.06666666666666667,
+ "grad_norm": 2.1857714653015137,
+ "learning_rate": 4.935353535353536e-06,
+ "loss": 1.477668285369873,
+ "mean_token_accuracy": 0.6507083773612976,
+ "num_tokens": 540672.0,
+ "step": 33
+ },
+ {
+ "entropy": 1.4447426795959473,
+ "epoch": 0.06868686868686869,
+ "grad_norm": 2.3771870136260986,
+ "learning_rate": 4.933333333333334e-06,
+ "loss": 1.536318063735962,
+ "mean_token_accuracy": 0.6383732557296753,
+ "num_tokens": 557056.0,
+ "step": 34
+ },
+ {
+ "entropy": 1.9658164978027344,
+ "epoch": 0.0707070707070707,
+ "grad_norm": 2.4784936904907227,
+ "learning_rate": 4.931313131313132e-06,
+ "loss": 2.0565035343170166,
+ "mean_token_accuracy": 0.5581949353218079,
+ "num_tokens": 573440.0,
+ "step": 35
+ },
+ {
+ "entropy": 1.6045317649841309,
+ "epoch": 0.07272727272727272,
+ "grad_norm": 2.1128504276275635,
+ "learning_rate": 4.92929292929293e-06,
+ "loss": 1.6234952211380005,
+ "mean_token_accuracy": 0.6293356418609619,
+ "num_tokens": 589824.0,
+ "step": 36
+ },
+ {
+ "entropy": 1.5491269826889038,
+ "epoch": 0.07474747474747474,
+ "grad_norm": 2.1672937870025635,
+ "learning_rate": 4.927272727272728e-06,
+ "loss": 1.5809822082519531,
+ "mean_token_accuracy": 0.6419760584831238,
+ "num_tokens": 606208.0,
+ "step": 37
+ },
+ {
+ "entropy": 1.545534610748291,
+ "epoch": 0.07676767676767676,
+ "grad_norm": 2.2526934146881104,
+ "learning_rate": 4.925252525252526e-06,
+ "loss": 1.5707473754882812,
+ "mean_token_accuracy": 0.6344650983810425,
+ "num_tokens": 622592.0,
+ "step": 38
+ },
+ {
+ "entropy": 1.579596757888794,
+ "epoch": 0.07878787878787878,
+ "grad_norm": 2.3988492488861084,
+ "learning_rate": 4.9232323232323235e-06,
+ "loss": 1.6725983619689941,
+ "mean_token_accuracy": 0.6243282556533813,
+ "num_tokens": 638976.0,
+ "step": 39
+ },
+ {
+ "entropy": 2.0438785552978516,
+ "epoch": 0.08080808080808081,
+ "grad_norm": 2.3314359188079834,
+ "learning_rate": 4.9212121212121214e-06,
+ "loss": 2.0424888134002686,
+ "mean_token_accuracy": 0.570713222026825,
+ "num_tokens": 655360.0,
+ "step": 40
+ },
+ {
+ "entropy": 1.8690773248672485,
+ "epoch": 0.08282828282828283,
+ "grad_norm": 2.130401134490967,
+ "learning_rate": 4.919191919191919e-06,
+ "loss": 1.8796970844268799,
+ "mean_token_accuracy": 0.5882999300956726,
+ "num_tokens": 671744.0,
+ "step": 41
+ },
+ {
+ "entropy": 1.756626009941101,
+ "epoch": 0.08484848484848485,
+ "grad_norm": 2.342318534851074,
+ "learning_rate": 4.917171717171717e-06,
+ "loss": 1.71901535987854,
+ "mean_token_accuracy": 0.6173668503761292,
+ "num_tokens": 688128.0,
+ "step": 42
+ },
+ {
+ "entropy": 1.4642508029937744,
+ "epoch": 0.08686868686868687,
+ "grad_norm": 1.993338704109192,
+ "learning_rate": 4.915151515151516e-06,
+ "loss": 1.4660165309906006,
+ "mean_token_accuracy": 0.6687225103378296,
+ "num_tokens": 704512.0,
+ "step": 43
+ },
+ {
+ "entropy": 1.790807843208313,
+ "epoch": 0.08888888888888889,
+ "grad_norm": 2.3186943531036377,
+ "learning_rate": 4.913131313131314e-06,
+ "loss": 1.7102060317993164,
+ "mean_token_accuracy": 0.6238397359848022,
+ "num_tokens": 720896.0,
+ "step": 44
+ },
+ {
+ "entropy": 1.5970485210418701,
+ "epoch": 0.09090909090909091,
+ "grad_norm": 2.299307346343994,
+ "learning_rate": 4.911111111111112e-06,
+ "loss": 1.5170013904571533,
+ "mean_token_accuracy": 0.652662456035614,
+ "num_tokens": 737280.0,
+ "step": 45
+ },
+ {
+ "entropy": 1.3955466747283936,
+ "epoch": 0.09292929292929293,
+ "grad_norm": 2.171952962875366,
+ "learning_rate": 4.90909090909091e-06,
+ "loss": 1.4059661626815796,
+ "mean_token_accuracy": 0.6654250025749207,
+ "num_tokens": 753664.0,
+ "step": 46
+ },
+ {
+ "entropy": 1.7198575735092163,
+ "epoch": 0.09494949494949495,
+ "grad_norm": 2.385092258453369,
+ "learning_rate": 4.9070707070707075e-06,
+ "loss": 1.730346918106079,
+ "mean_token_accuracy": 0.6191987991333008,
+ "num_tokens": 770048.0,
+ "step": 47
+ },
+ {
+ "entropy": 1.3542555570602417,
+ "epoch": 0.09696969696969697,
+ "grad_norm": 2.1463189125061035,
+ "learning_rate": 4.905050505050505e-06,
+ "loss": 1.346085786819458,
+ "mean_token_accuracy": 0.680446982383728,
+ "num_tokens": 786432.0,
+ "step": 48
+ },
+ {
+ "entropy": 1.8084443807601929,
+ "epoch": 0.09898989898989899,
+ "grad_norm": 2.1505849361419678,
+ "learning_rate": 4.903030303030303e-06,
+ "loss": 1.847151756286621,
+ "mean_token_accuracy": 0.5926355719566345,
+ "num_tokens": 802816.0,
+ "step": 49
+ },
+ {
+ "entropy": 1.751160979270935,
+ "epoch": 0.10101010101010101,
+ "grad_norm": 2.1436259746551514,
+ "learning_rate": 4.901010101010101e-06,
+ "loss": 1.7802404165267944,
+ "mean_token_accuracy": 0.5996580123901367,
+ "num_tokens": 819200.0,
+ "step": 50
+ },
+ {
+ "epoch": 0.10101010101010101,
+ "eval_entropy": 1.6292865045609013,
+ "eval_loss": 1.6725393533706665,
+ "eval_mean_token_accuracy": 0.6230050469598463,
+ "eval_num_tokens": 819200.0,
+ "eval_runtime": 43.9148,
+ "eval_samples_per_second": 22.544,
+ "eval_steps_per_second": 2.824,
+ "step": 50
+ },
+ {
+ "entropy": 1.4428319931030273,
+ "epoch": 0.10303030303030303,
+ "grad_norm": 2.0954954624176025,
+ "learning_rate": 4.898989898989899e-06,
+ "loss": 1.4927232265472412,
+ "mean_token_accuracy": 0.6522349715232849,
+ "num_tokens": 835584.0,
+ "step": 51
+ },
+ {
+ "entropy": 1.7493115663528442,
+ "epoch": 0.10505050505050505,
+ "grad_norm": 2.300030469894409,
+ "learning_rate": 4.896969696969697e-06,
+ "loss": 1.737417221069336,
+ "mean_token_accuracy": 0.6213361024856567,
+ "num_tokens": 851968.0,
+ "step": 52
+ },
+ {
+ "entropy": 1.7801647186279297,
+ "epoch": 0.10707070707070707,
+ "grad_norm": 2.3947081565856934,
+ "learning_rate": 4.894949494949495e-06,
+ "loss": 1.8372564315795898,
+ "mean_token_accuracy": 0.5931240916252136,
+ "num_tokens": 868352.0,
+ "step": 53
+ },
+ {
+ "entropy": 1.6934887170791626,
+ "epoch": 0.10909090909090909,
+ "grad_norm": 2.1981089115142822,
+ "learning_rate": 4.8929292929292936e-06,
+ "loss": 1.734646201133728,
+ "mean_token_accuracy": 0.611932098865509,
+ "num_tokens": 884736.0,
+ "step": 54
+ },
+ {
+ "entropy": 1.3401941061019897,
+ "epoch": 0.1111111111111111,
+ "grad_norm": 2.193511724472046,
+ "learning_rate": 4.8909090909090914e-06,
+ "loss": 1.399888038635254,
+ "mean_token_accuracy": 0.6745847463607788,
+ "num_tokens": 901120.0,
+ "step": 55
+ },
+ {
+ "entropy": 1.8244661092758179,
+ "epoch": 0.11313131313131314,
+ "grad_norm": 2.4358489513397217,
+ "learning_rate": 4.888888888888889e-06,
+ "loss": 1.8716282844543457,
+ "mean_token_accuracy": 0.5867122411727905,
+ "num_tokens": 917504.0,
+ "step": 56
+ },
+ {
+ "entropy": 1.5019619464874268,
+ "epoch": 0.11515151515151516,
+ "grad_norm": 2.1135261058807373,
+ "learning_rate": 4.886868686868687e-06,
+ "loss": 1.523103952407837,
+ "mean_token_accuracy": 0.6414265036582947,
+ "num_tokens": 933888.0,
+ "step": 57
+ },
+ {
+ "entropy": 1.6132855415344238,
+ "epoch": 0.11717171717171718,
+ "grad_norm": 2.026301145553589,
+ "learning_rate": 4.884848484848485e-06,
+ "loss": 1.6233609914779663,
+ "mean_token_accuracy": 0.6279311180114746,
+ "num_tokens": 950272.0,
+ "step": 58
+ },
+ {
+ "entropy": 1.738538384437561,
+ "epoch": 0.1191919191919192,
+ "grad_norm": 2.1539394855499268,
+ "learning_rate": 4.882828282828283e-06,
+ "loss": 1.8147332668304443,
+ "mean_token_accuracy": 0.6124816536903381,
+ "num_tokens": 966656.0,
+ "step": 59
+ },
+ {
+ "entropy": 1.5533764362335205,
+ "epoch": 0.12121212121212122,
+ "grad_norm": 2.2603628635406494,
+ "learning_rate": 4.880808080808081e-06,
+ "loss": 1.562873125076294,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 983040.0,
+ "step": 60
+ },
+ {
+ "entropy": 1.722406268119812,
+ "epoch": 0.12323232323232323,
+ "grad_norm": 2.3630757331848145,
+ "learning_rate": 4.878787878787879e-06,
+ "loss": 1.7461689710617065,
+ "mean_token_accuracy": 0.6023448705673218,
+ "num_tokens": 999424.0,
+ "step": 61
+ },
+ {
+ "entropy": 1.6533517837524414,
+ "epoch": 0.12525252525252525,
+ "grad_norm": 2.2165415287017822,
+ "learning_rate": 4.876767676767677e-06,
+ "loss": 1.676560640335083,
+ "mean_token_accuracy": 0.6437469720840454,
+ "num_tokens": 1015808.0,
+ "step": 62
+ },
+ {
+ "entropy": 1.749995470046997,
+ "epoch": 0.12727272727272726,
+ "grad_norm": 2.1572678089141846,
+ "learning_rate": 4.8747474747474745e-06,
+ "loss": 1.784087896347046,
+ "mean_token_accuracy": 0.5884831547737122,
+ "num_tokens": 1032192.0,
+ "step": 63
+ },
+ {
+ "entropy": 1.442152738571167,
+ "epoch": 0.1292929292929293,
+ "grad_norm": 2.163490056991577,
+ "learning_rate": 4.872727272727273e-06,
+ "loss": 1.4307503700256348,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 1048576.0,
+ "step": 64
+ },
+ {
+ "entropy": 1.2657029628753662,
+ "epoch": 0.13131313131313133,
+ "grad_norm": 2.1225337982177734,
+ "learning_rate": 4.870707070707071e-06,
+ "loss": 1.2731966972351074,
+ "mean_token_accuracy": 0.688568651676178,
+ "num_tokens": 1064960.0,
+ "step": 65
+ },
+ {
+ "entropy": 1.1613880395889282,
+ "epoch": 0.13333333333333333,
+ "grad_norm": 1.9527196884155273,
+ "learning_rate": 4.868686868686869e-06,
+ "loss": 1.13922119140625,
+ "mean_token_accuracy": 0.7389472126960754,
+ "num_tokens": 1081344.0,
+ "step": 66
+ },
+ {
+ "entropy": 1.6936380863189697,
+ "epoch": 0.13535353535353536,
+ "grad_norm": 2.004284620285034,
+ "learning_rate": 4.866666666666667e-06,
+ "loss": 1.6982238292694092,
+ "mean_token_accuracy": 0.6191987991333008,
+ "num_tokens": 1097728.0,
+ "step": 67
+ },
+ {
+ "entropy": 1.750565528869629,
+ "epoch": 0.13737373737373737,
+ "grad_norm": 2.225955009460449,
+ "learning_rate": 4.864646464646466e-06,
+ "loss": 1.796521782875061,
+ "mean_token_accuracy": 0.5934293866157532,
+ "num_tokens": 1114112.0,
+ "step": 68
+ },
+ {
+ "entropy": 1.6608220338821411,
+ "epoch": 0.1393939393939394,
+ "grad_norm": 2.127035617828369,
+ "learning_rate": 4.8626262626262636e-06,
+ "loss": 1.6633095741271973,
+ "mean_token_accuracy": 0.6356253027915955,
+ "num_tokens": 1130496.0,
+ "step": 69
+ },
+ {
+ "entropy": 1.4848661422729492,
+ "epoch": 0.1414141414141414,
+ "grad_norm": 2.0338215827941895,
+ "learning_rate": 4.8606060606060615e-06,
+ "loss": 1.4789674282073975,
+ "mean_token_accuracy": 0.6680508255958557,
+ "num_tokens": 1146880.0,
+ "step": 70
+ },
+ {
+ "entropy": 1.2310466766357422,
+ "epoch": 0.14343434343434344,
+ "grad_norm": 2.105898141860962,
+ "learning_rate": 4.858585858585859e-06,
+ "loss": 1.2301937341690063,
+ "mean_token_accuracy": 0.7040791511535645,
+ "num_tokens": 1163264.0,
+ "step": 71
+ },
+ {
+ "entropy": 1.6310514211654663,
+ "epoch": 0.14545454545454545,
+ "grad_norm": 2.152125358581543,
+ "learning_rate": 4.856565656565657e-06,
+ "loss": 1.643636703491211,
+ "mean_token_accuracy": 0.6221299171447754,
+ "num_tokens": 1179648.0,
+ "step": 72
+ },
+ {
+ "entropy": 1.4747940301895142,
+ "epoch": 0.14747474747474748,
+ "grad_norm": 2.096461296081543,
+ "learning_rate": 4.854545454545455e-06,
+ "loss": 1.42953360080719,
+ "mean_token_accuracy": 0.6651807427406311,
+ "num_tokens": 1196032.0,
+ "step": 73
+ },
+ {
+ "entropy": 1.819259524345398,
+ "epoch": 0.1494949494949495,
+ "grad_norm": 2.2852063179016113,
+ "learning_rate": 4.852525252525253e-06,
+ "loss": 1.845325231552124,
+ "mean_token_accuracy": 0.6036272644996643,
+ "num_tokens": 1212416.0,
+ "step": 74
+ },
+ {
+ "entropy": 1.4233598709106445,
+ "epoch": 0.15151515151515152,
+ "grad_norm": 2.1157381534576416,
+ "learning_rate": 4.850505050505051e-06,
+ "loss": 1.4565438032150269,
+ "mean_token_accuracy": 0.6607230305671692,
+ "num_tokens": 1228800.0,
+ "step": 75
+ },
+ {
+ "entropy": 1.6441459655761719,
+ "epoch": 0.15353535353535352,
+ "grad_norm": 2.2092180252075195,
+ "learning_rate": 4.848484848484849e-06,
+ "loss": 1.6467639207839966,
+ "mean_token_accuracy": 0.6285417675971985,
+ "num_tokens": 1245184.0,
+ "step": 76
+ },
+ {
+ "entropy": 1.6124308109283447,
+ "epoch": 0.15555555555555556,
+ "grad_norm": 2.231876850128174,
+ "learning_rate": 4.846464646464647e-06,
+ "loss": 1.617384672164917,
+ "mean_token_accuracy": 0.6340987086296082,
+ "num_tokens": 1261568.0,
+ "step": 77
+ },
+ {
+ "entropy": 1.828405499458313,
+ "epoch": 0.15757575757575756,
+ "grad_norm": 2.1372313499450684,
+ "learning_rate": 4.8444444444444446e-06,
+ "loss": 1.8333203792572021,
+ "mean_token_accuracy": 0.5979481935501099,
+ "num_tokens": 1277952.0,
+ "step": 78
+ },
+ {
+ "entropy": 1.855564832687378,
+ "epoch": 0.1595959595959596,
+ "grad_norm": 2.1422762870788574,
+ "learning_rate": 4.842424242424243e-06,
+ "loss": 1.9133609533309937,
+ "mean_token_accuracy": 0.570652186870575,
+ "num_tokens": 1294336.0,
+ "step": 79
+ },
+ {
+ "entropy": 1.7908183336257935,
+ "epoch": 0.16161616161616163,
+ "grad_norm": 2.172368049621582,
+ "learning_rate": 4.840404040404041e-06,
+ "loss": 1.8109419345855713,
+ "mean_token_accuracy": 0.60332190990448,
+ "num_tokens": 1310720.0,
+ "step": 80
+ },
+ {
+ "entropy": 1.9537721872329712,
+ "epoch": 0.16363636363636364,
+ "grad_norm": 2.199505090713501,
+ "learning_rate": 4.838383838383839e-06,
+ "loss": 2.0001401901245117,
+ "mean_token_accuracy": 0.5585613250732422,
+ "num_tokens": 1327104.0,
+ "step": 81
+ },
+ {
+ "entropy": 1.5365772247314453,
+ "epoch": 0.16565656565656567,
+ "grad_norm": 2.0778913497924805,
+ "learning_rate": 4.836363636363637e-06,
+ "loss": 1.575089931488037,
+ "mean_token_accuracy": 0.6375183463096619,
+ "num_tokens": 1343488.0,
+ "step": 82
+ },
+ {
+ "entropy": 1.7177143096923828,
+ "epoch": 0.16767676767676767,
+ "grad_norm": 2.1010894775390625,
+ "learning_rate": 4.834343434343435e-06,
+ "loss": 1.7428388595581055,
+ "mean_token_accuracy": 0.6113824844360352,
+ "num_tokens": 1359872.0,
+ "step": 83
+ },
+ {
+ "entropy": 1.5080527067184448,
+ "epoch": 0.1696969696969697,
+ "grad_norm": 2.021969795227051,
+ "learning_rate": 4.832323232323233e-06,
+ "loss": 1.5361201763153076,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 1376256.0,
+ "step": 84
+ },
+ {
+ "entropy": 1.5042120218276978,
+ "epoch": 0.1717171717171717,
+ "grad_norm": 2.121314287185669,
+ "learning_rate": 4.830303030303031e-06,
+ "loss": 1.4912033081054688,
+ "mean_token_accuracy": 0.6621274948120117,
+ "num_tokens": 1392640.0,
+ "step": 85
+ },
+ {
+ "entropy": 1.9523948431015015,
+ "epoch": 0.17373737373737375,
+ "grad_norm": 2.1702609062194824,
+ "learning_rate": 4.8282828282828285e-06,
+ "loss": 1.9369449615478516,
+ "mean_token_accuracy": 0.5727283954620361,
+ "num_tokens": 1409024.0,
+ "step": 86
+ },
+ {
+ "entropy": 1.6174770593643188,
+ "epoch": 0.17575757575757575,
+ "grad_norm": 2.222412109375,
+ "learning_rate": 4.826262626262626e-06,
+ "loss": 1.6794973611831665,
+ "mean_token_accuracy": 0.6151685118675232,
+ "num_tokens": 1425408.0,
+ "step": 87
+ },
+ {
+ "entropy": 1.1480307579040527,
+ "epoch": 0.17777777777777778,
+ "grad_norm": 1.98936128616333,
+ "learning_rate": 4.824242424242424e-06,
+ "loss": 1.1324063539505005,
+ "mean_token_accuracy": 0.7193453907966614,
+ "num_tokens": 1441792.0,
+ "step": 88
+ },
+ {
+ "entropy": 1.5290263891220093,
+ "epoch": 0.1797979797979798,
+ "grad_norm": 2.098860263824463,
+ "learning_rate": 4.822222222222222e-06,
+ "loss": 1.556044340133667,
+ "mean_token_accuracy": 0.6415486335754395,
+ "num_tokens": 1458176.0,
+ "step": 89
+ },
+ {
+ "entropy": 1.1366127729415894,
+ "epoch": 0.18181818181818182,
+ "grad_norm": 1.9387420415878296,
+ "learning_rate": 4.820202020202021e-06,
+ "loss": 1.1635141372680664,
+ "mean_token_accuracy": 0.7168416976928711,
+ "num_tokens": 1474560.0,
+ "step": 90
+ },
+ {
+ "entropy": 1.5142875909805298,
+ "epoch": 0.18383838383838383,
+ "grad_norm": 2.259131908416748,
+ "learning_rate": 4.818181818181819e-06,
+ "loss": 1.5329954624176025,
+ "mean_token_accuracy": 0.6471666097640991,
+ "num_tokens": 1490944.0,
+ "step": 91
+ },
+ {
+ "entropy": 1.5197135210037231,
+ "epoch": 0.18585858585858586,
+ "grad_norm": 2.1230807304382324,
+ "learning_rate": 4.816161616161617e-06,
+ "loss": 1.541062593460083,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 1507328.0,
+ "step": 92
+ },
+ {
+ "entropy": 1.5469954013824463,
+ "epoch": 0.18787878787878787,
+ "grad_norm": 2.0568583011627197,
+ "learning_rate": 4.8141414141414146e-06,
+ "loss": 1.5564078092575073,
+ "mean_token_accuracy": 0.6384953856468201,
+ "num_tokens": 1523712.0,
+ "step": 93
+ },
+ {
+ "entropy": 1.5429692268371582,
+ "epoch": 0.1898989898989899,
+ "grad_norm": 2.200144052505493,
+ "learning_rate": 4.8121212121212125e-06,
+ "loss": 1.5292989015579224,
+ "mean_token_accuracy": 0.6373351216316223,
+ "num_tokens": 1540096.0,
+ "step": 94
+ },
+ {
+ "entropy": 1.4556076526641846,
+ "epoch": 0.1919191919191919,
+ "grad_norm": 2.250291585922241,
+ "learning_rate": 4.81010101010101e-06,
+ "loss": 1.426419734954834,
+ "mean_token_accuracy": 0.6604176759719849,
+ "num_tokens": 1556480.0,
+ "step": 95
+ },
+ {
+ "entropy": 1.4021440744400024,
+ "epoch": 0.19393939393939394,
+ "grad_norm": 2.287038803100586,
+ "learning_rate": 4.808080808080808e-06,
+ "loss": 1.4377000331878662,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 1572864.0,
+ "step": 96
+ },
+ {
+ "entropy": 1.658683180809021,
+ "epoch": 0.19595959595959597,
+ "grad_norm": 2.1817963123321533,
+ "learning_rate": 4.806060606060606e-06,
+ "loss": 1.6514620780944824,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 1589248.0,
+ "step": 97
+ },
+ {
+ "entropy": 1.5182844400405884,
+ "epoch": 0.19797979797979798,
+ "grad_norm": 2.144071340560913,
+ "learning_rate": 4.804040404040404e-06,
+ "loss": 1.5554628372192383,
+ "mean_token_accuracy": 0.6311064958572388,
+ "num_tokens": 1605632.0,
+ "step": 98
+ },
+ {
+ "entropy": 1.5997719764709473,
+ "epoch": 0.2,
+ "grad_norm": 2.0921664237976074,
+ "learning_rate": 4.802020202020202e-06,
+ "loss": 1.6185517311096191,
+ "mean_token_accuracy": 0.6286028623580933,
+ "num_tokens": 1622016.0,
+ "step": 99
+ },
+ {
+ "entropy": 1.4011279344558716,
+ "epoch": 0.20202020202020202,
+ "grad_norm": 2.2240700721740723,
+ "learning_rate": 4.800000000000001e-06,
+ "loss": 1.4112927913665771,
+ "mean_token_accuracy": 0.6696995496749878,
+ "num_tokens": 1638400.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.20202020202020202,
+ "eval_entropy": 1.606662715634992,
+ "eval_loss": 1.6283859014511108,
+ "eval_mean_token_accuracy": 0.6293055717983553,
+ "eval_num_tokens": 1638400.0,
+ "eval_runtime": 43.7782,
+ "eval_samples_per_second": 22.614,
+ "eval_steps_per_second": 2.832,
+ "step": 100
+ },
+ {
+ "entropy": 1.6743865013122559,
+ "epoch": 0.20404040404040405,
+ "grad_norm": 2.025153398513794,
+ "learning_rate": 4.7979797979797985e-06,
+ "loss": 1.6404725313186646,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 1654784.0,
+ "step": 101
+ },
+ {
+ "entropy": 1.6196308135986328,
+ "epoch": 0.20606060606060606,
+ "grad_norm": 2.037229299545288,
+ "learning_rate": 4.795959595959596e-06,
+ "loss": 1.647303581237793,
+ "mean_token_accuracy": 0.6203590631484985,
+ "num_tokens": 1671168.0,
+ "step": 102
+ },
+ {
+ "entropy": 1.5600125789642334,
+ "epoch": 0.2080808080808081,
+ "grad_norm": 2.144221782684326,
+ "learning_rate": 4.793939393939394e-06,
+ "loss": 1.6199731826782227,
+ "mean_token_accuracy": 0.6249389052391052,
+ "num_tokens": 1687552.0,
+ "step": 103
+ },
+ {
+ "entropy": 2.064497947692871,
+ "epoch": 0.2101010101010101,
+ "grad_norm": 2.3956470489501953,
+ "learning_rate": 4.791919191919192e-06,
+ "loss": 2.048987627029419,
+ "mean_token_accuracy": 0.5507450103759766,
+ "num_tokens": 1703936.0,
+ "step": 104
+ },
+ {
+ "entropy": 1.7934812307357788,
+ "epoch": 0.21212121212121213,
+ "grad_norm": 2.487302780151367,
+ "learning_rate": 4.78989898989899e-06,
+ "loss": 1.8285956382751465,
+ "mean_token_accuracy": 0.5749877691268921,
+ "num_tokens": 1720320.0,
+ "step": 105
+ },
+ {
+ "entropy": 1.365216851234436,
+ "epoch": 0.21414141414141413,
+ "grad_norm": 2.0714964866638184,
+ "learning_rate": 4.787878787878788e-06,
+ "loss": 1.3870220184326172,
+ "mean_token_accuracy": 0.6692721247673035,
+ "num_tokens": 1736704.0,
+ "step": 106
+ },
+ {
+ "entropy": 1.4983874559402466,
+ "epoch": 0.21616161616161617,
+ "grad_norm": 1.9995853900909424,
+ "learning_rate": 4.785858585858586e-06,
+ "loss": 1.4949266910552979,
+ "mean_token_accuracy": 0.6554103493690491,
+ "num_tokens": 1753088.0,
+ "step": 107
+ },
+ {
+ "entropy": 2.0503509044647217,
+ "epoch": 0.21818181818181817,
+ "grad_norm": 2.190884590148926,
+ "learning_rate": 4.783838383838385e-06,
+ "loss": 2.079286813735962,
+ "mean_token_accuracy": 0.5657669901847839,
+ "num_tokens": 1769472.0,
+ "step": 108
+ },
+ {
+ "entropy": 1.5557374954223633,
+ "epoch": 0.2202020202020202,
+ "grad_norm": 2.044100761413574,
+ "learning_rate": 4.7818181818181825e-06,
+ "loss": 1.5735318660736084,
+ "mean_token_accuracy": 0.6359916925430298,
+ "num_tokens": 1785856.0,
+ "step": 109
+ },
+ {
+ "entropy": 1.5567635297775269,
+ "epoch": 0.2222222222222222,
+ "grad_norm": 2.3714160919189453,
+ "learning_rate": 4.77979797979798e-06,
+ "loss": 1.6026921272277832,
+ "mean_token_accuracy": 0.6290302872657776,
+ "num_tokens": 1802240.0,
+ "step": 110
+ },
+ {
+ "entropy": 1.8457536697387695,
+ "epoch": 0.22424242424242424,
+ "grad_norm": 2.202939987182617,
+ "learning_rate": 4.777777777777778e-06,
+ "loss": 1.7986081838607788,
+ "mean_token_accuracy": 0.5952613353729248,
+ "num_tokens": 1818624.0,
+ "step": 111
+ },
+ {
+ "entropy": 1.8822020292282104,
+ "epoch": 0.22626262626262628,
+ "grad_norm": 2.2674992084503174,
+ "learning_rate": 4.775757575757576e-06,
+ "loss": 1.9095954895019531,
+ "mean_token_accuracy": 0.5769418478012085,
+ "num_tokens": 1835008.0,
+ "step": 112
+ },
+ {
+ "entropy": 1.5445998907089233,
+ "epoch": 0.22828282828282828,
+ "grad_norm": 2.2848100662231445,
+ "learning_rate": 4.773737373737374e-06,
+ "loss": 1.5832195281982422,
+ "mean_token_accuracy": 0.6337933540344238,
+ "num_tokens": 1851392.0,
+ "step": 113
+ },
+ {
+ "entropy": 1.934509515762329,
+ "epoch": 0.23030303030303031,
+ "grad_norm": 2.3585174083709717,
+ "learning_rate": 4.771717171717172e-06,
+ "loss": 1.9809319972991943,
+ "mean_token_accuracy": 0.5789570212364197,
+ "num_tokens": 1867776.0,
+ "step": 114
+ },
+ {
+ "entropy": 1.7354214191436768,
+ "epoch": 0.23232323232323232,
+ "grad_norm": 2.13913631439209,
+ "learning_rate": 4.769696969696971e-06,
+ "loss": 1.7527806758880615,
+ "mean_token_accuracy": 0.6061308979988098,
+ "num_tokens": 1884160.0,
+ "step": 115
+ },
+ {
+ "entropy": 1.7714784145355225,
+ "epoch": 0.23434343434343435,
+ "grad_norm": 1.9915403127670288,
+ "learning_rate": 4.7676767676767685e-06,
+ "loss": 1.8065431118011475,
+ "mean_token_accuracy": 0.5986199378967285,
+ "num_tokens": 1900544.0,
+ "step": 116
+ },
+ {
+ "entropy": 1.5272125005722046,
+ "epoch": 0.23636363636363636,
+ "grad_norm": 2.004565715789795,
+ "learning_rate": 4.765656565656566e-06,
+ "loss": 1.5074517726898193,
+ "mean_token_accuracy": 0.6601123809814453,
+ "num_tokens": 1916928.0,
+ "step": 117
+ },
+ {
+ "entropy": 1.5393218994140625,
+ "epoch": 0.2383838383838384,
+ "grad_norm": 2.018089532852173,
+ "learning_rate": 4.763636363636364e-06,
+ "loss": 1.5607573986053467,
+ "mean_token_accuracy": 0.6540058851242065,
+ "num_tokens": 1933312.0,
+ "step": 118
+ },
+ {
+ "entropy": 1.7827534675598145,
+ "epoch": 0.2404040404040404,
+ "grad_norm": 2.062368392944336,
+ "learning_rate": 4.761616161616162e-06,
+ "loss": 1.7844001054763794,
+ "mean_token_accuracy": 0.6187102794647217,
+ "num_tokens": 1949696.0,
+ "step": 119
+ },
+ {
+ "entropy": 1.416417121887207,
+ "epoch": 0.24242424242424243,
+ "grad_norm": 2.0980024337768555,
+ "learning_rate": 4.75959595959596e-06,
+ "loss": 1.4041050672531128,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 1966080.0,
+ "step": 120
+ },
+ {
+ "entropy": 1.3325153589248657,
+ "epoch": 0.24444444444444444,
+ "grad_norm": 1.9985002279281616,
+ "learning_rate": 4.757575757575758e-06,
+ "loss": 1.3197274208068848,
+ "mean_token_accuracy": 0.6806912422180176,
+ "num_tokens": 1982464.0,
+ "step": 121
+ },
+ {
+ "entropy": 1.7306798696517944,
+ "epoch": 0.24646464646464647,
+ "grad_norm": 2.2098441123962402,
+ "learning_rate": 4.755555555555556e-06,
+ "loss": 1.7595295906066895,
+ "mean_token_accuracy": 0.6110160946846008,
+ "num_tokens": 1998848.0,
+ "step": 122
+ },
+ {
+ "entropy": 1.3733264207839966,
+ "epoch": 0.24848484848484848,
+ "grad_norm": 1.9827327728271484,
+ "learning_rate": 4.753535353535354e-06,
+ "loss": 1.4026854038238525,
+ "mean_token_accuracy": 0.65486079454422,
+ "num_tokens": 2015232.0,
+ "step": 123
+ },
+ {
+ "entropy": 1.5910528898239136,
+ "epoch": 0.2505050505050505,
+ "grad_norm": 1.9615319967269897,
+ "learning_rate": 4.751515151515152e-06,
+ "loss": 1.6071114540100098,
+ "mean_token_accuracy": 0.648937463760376,
+ "num_tokens": 2031616.0,
+ "step": 124
+ },
+ {
+ "entropy": 1.3300938606262207,
+ "epoch": 0.25252525252525254,
+ "grad_norm": 1.9878504276275635,
+ "learning_rate": 4.7494949494949495e-06,
+ "loss": 1.3623383045196533,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 2048000.0,
+ "step": 125
+ },
+ {
+ "entropy": 1.6087368726730347,
+ "epoch": 0.2545454545454545,
+ "grad_norm": 2.264647960662842,
+ "learning_rate": 4.747474747474748e-06,
+ "loss": 1.634058952331543,
+ "mean_token_accuracy": 0.6211528778076172,
+ "num_tokens": 2064384.0,
+ "step": 126
+ },
+ {
+ "entropy": 1.536401391029358,
+ "epoch": 0.25656565656565655,
+ "grad_norm": 1.9561539888381958,
+ "learning_rate": 4.745454545454546e-06,
+ "loss": 1.5699501037597656,
+ "mean_token_accuracy": 0.6248167753219604,
+ "num_tokens": 2080768.0,
+ "step": 127
+ },
+ {
+ "entropy": 1.656266212463379,
+ "epoch": 0.2585858585858586,
+ "grad_norm": 2.1124353408813477,
+ "learning_rate": 4.743434343434344e-06,
+ "loss": 1.6612167358398438,
+ "mean_token_accuracy": 0.623900830745697,
+ "num_tokens": 2097152.0,
+ "step": 128
+ },
+ {
+ "entropy": 1.170629620552063,
+ "epoch": 0.2606060606060606,
+ "grad_norm": 1.917840600013733,
+ "learning_rate": 4.741414141414142e-06,
+ "loss": 1.1992300748825073,
+ "mean_token_accuracy": 0.6995603442192078,
+ "num_tokens": 2113536.0,
+ "step": 129
+ },
+ {
+ "entropy": 1.4126694202423096,
+ "epoch": 0.26262626262626265,
+ "grad_norm": 1.9041539430618286,
+ "learning_rate": 4.73939393939394e-06,
+ "loss": 1.4334447383880615,
+ "mean_token_accuracy": 0.6637151837348938,
+ "num_tokens": 2129920.0,
+ "step": 130
+ },
+ {
+ "entropy": 1.8490277528762817,
+ "epoch": 0.26464646464646463,
+ "grad_norm": 2.1440138816833496,
+ "learning_rate": 4.737373737373738e-06,
+ "loss": 1.9226353168487549,
+ "mean_token_accuracy": 0.5805447101593018,
+ "num_tokens": 2146304.0,
+ "step": 131
+ },
+ {
+ "entropy": 1.5000964403152466,
+ "epoch": 0.26666666666666666,
+ "grad_norm": 1.9615508317947388,
+ "learning_rate": 4.735353535353536e-06,
+ "loss": 1.495596170425415,
+ "mean_token_accuracy": 0.6542501449584961,
+ "num_tokens": 2162688.0,
+ "step": 132
+ },
+ {
+ "entropy": 1.9371142387390137,
+ "epoch": 0.2686868686868687,
+ "grad_norm": 2.202200412750244,
+ "learning_rate": 4.7333333333333335e-06,
+ "loss": 1.94151771068573,
+ "mean_token_accuracy": 0.5810332298278809,
+ "num_tokens": 2179072.0,
+ "step": 133
+ },
+ {
+ "entropy": 1.4535126686096191,
+ "epoch": 0.27070707070707073,
+ "grad_norm": 1.9804027080535889,
+ "learning_rate": 4.731313131313131e-06,
+ "loss": 1.4401545524597168,
+ "mean_token_accuracy": 0.6585246920585632,
+ "num_tokens": 2195456.0,
+ "step": 134
+ },
+ {
+ "entropy": 2.0871424674987793,
+ "epoch": 0.2727272727272727,
+ "grad_norm": 2.1417081356048584,
+ "learning_rate": 4.729292929292929e-06,
+ "loss": 2.117375373840332,
+ "mean_token_accuracy": 0.5600268840789795,
+ "num_tokens": 2211840.0,
+ "step": 135
+ },
+ {
+ "entropy": 1.2986469268798828,
+ "epoch": 0.27474747474747474,
+ "grad_norm": 2.0299136638641357,
+ "learning_rate": 4.727272727272728e-06,
+ "loss": 1.3631991147994995,
+ "mean_token_accuracy": 0.6750732660293579,
+ "num_tokens": 2228224.0,
+ "step": 136
+ },
+ {
+ "entropy": 1.163429617881775,
+ "epoch": 0.2767676767676768,
+ "grad_norm": 1.8368210792541504,
+ "learning_rate": 4.725252525252526e-06,
+ "loss": 1.1603795289993286,
+ "mean_token_accuracy": 0.7150708436965942,
+ "num_tokens": 2244608.0,
+ "step": 137
+ },
+ {
+ "entropy": 1.4301519393920898,
+ "epoch": 0.2787878787878788,
+ "grad_norm": 1.996767520904541,
+ "learning_rate": 4.723232323232324e-06,
+ "loss": 1.422170639038086,
+ "mean_token_accuracy": 0.6816682815551758,
+ "num_tokens": 2260992.0,
+ "step": 138
+ },
+ {
+ "entropy": 1.5160106420516968,
+ "epoch": 0.2808080808080808,
+ "grad_norm": 2.004770278930664,
+ "learning_rate": 4.721212121212122e-06,
+ "loss": 1.5385751724243164,
+ "mean_token_accuracy": 0.640693724155426,
+ "num_tokens": 2277376.0,
+ "step": 139
+ },
+ {
+ "entropy": 1.2483867406845093,
+ "epoch": 0.2828282828282828,
+ "grad_norm": 1.8488364219665527,
+ "learning_rate": 4.7191919191919195e-06,
+ "loss": 1.2563843727111816,
+ "mean_token_accuracy": 0.6998046040534973,
+ "num_tokens": 2293760.0,
+ "step": 140
+ },
+ {
+ "entropy": 1.3214129209518433,
+ "epoch": 0.28484848484848485,
+ "grad_norm": 2.1334660053253174,
+ "learning_rate": 4.717171717171717e-06,
+ "loss": 1.3392664194107056,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 2310144.0,
+ "step": 141
+ },
+ {
+ "entropy": 1.611849069595337,
+ "epoch": 0.2868686868686869,
+ "grad_norm": 2.0539803504943848,
+ "learning_rate": 4.715151515151515e-06,
+ "loss": 1.6335396766662598,
+ "mean_token_accuracy": 0.6235954761505127,
+ "num_tokens": 2326528.0,
+ "step": 142
+ },
+ {
+ "entropy": 1.5847896337509155,
+ "epoch": 0.28888888888888886,
+ "grad_norm": 2.1658759117126465,
+ "learning_rate": 4.713131313131313e-06,
+ "loss": 1.603764533996582,
+ "mean_token_accuracy": 0.633671224117279,
+ "num_tokens": 2342912.0,
+ "step": 143
+ },
+ {
+ "entropy": 1.5731406211853027,
+ "epoch": 0.2909090909090909,
+ "grad_norm": 2.0830390453338623,
+ "learning_rate": 4.711111111111111e-06,
+ "loss": 1.558933973312378,
+ "mean_token_accuracy": 0.6392892003059387,
+ "num_tokens": 2359296.0,
+ "step": 144
+ },
+ {
+ "entropy": 1.8901628255844116,
+ "epoch": 0.29292929292929293,
+ "grad_norm": 2.1436922550201416,
+ "learning_rate": 4.709090909090909e-06,
+ "loss": 1.878631353378296,
+ "mean_token_accuracy": 0.57333904504776,
+ "num_tokens": 2375680.0,
+ "step": 145
+ },
+ {
+ "entropy": 1.9344228506088257,
+ "epoch": 0.29494949494949496,
+ "grad_norm": 2.1245176792144775,
+ "learning_rate": 4.707070707070707e-06,
+ "loss": 1.9546704292297363,
+ "mean_token_accuracy": 0.5987420678138733,
+ "num_tokens": 2392064.0,
+ "step": 146
+ },
+ {
+ "entropy": 1.2455096244812012,
+ "epoch": 0.296969696969697,
+ "grad_norm": 1.896581768989563,
+ "learning_rate": 4.705050505050506e-06,
+ "loss": 1.2738728523254395,
+ "mean_token_accuracy": 0.7025524973869324,
+ "num_tokens": 2408448.0,
+ "step": 147
+ },
+ {
+ "entropy": 1.4235948324203491,
+ "epoch": 0.298989898989899,
+ "grad_norm": 2.522636890411377,
+ "learning_rate": 4.7030303030303035e-06,
+ "loss": 1.4524480104446411,
+ "mean_token_accuracy": 0.6441133618354797,
+ "num_tokens": 2424832.0,
+ "step": 148
+ },
+ {
+ "entropy": 1.764552116394043,
+ "epoch": 0.301010101010101,
+ "grad_norm": 2.0232255458831787,
+ "learning_rate": 4.701010101010101e-06,
+ "loss": 1.7811740636825562,
+ "mean_token_accuracy": 0.6229848265647888,
+ "num_tokens": 2441216.0,
+ "step": 149
+ },
+ {
+ "entropy": 1.74843168258667,
+ "epoch": 0.30303030303030304,
+ "grad_norm": 2.1589369773864746,
+ "learning_rate": 4.698989898989899e-06,
+ "loss": 1.7337679862976074,
+ "mean_token_accuracy": 0.5975207686424255,
+ "num_tokens": 2457600.0,
+ "step": 150
+ },
+ {
+ "epoch": 0.30303030303030304,
+ "eval_entropy": 1.6033287221385586,
+ "eval_loss": 1.6036633253097534,
+ "eval_mean_token_accuracy": 0.6329842450157288,
+ "eval_num_tokens": 2457600.0,
+ "eval_runtime": 43.7655,
+ "eval_samples_per_second": 22.621,
+ "eval_steps_per_second": 2.833,
+ "step": 150
+ },
+ {
+ "entropy": 2.0572290420532227,
+ "epoch": 0.30505050505050507,
+ "grad_norm": 2.0511579513549805,
+ "learning_rate": 4.696969696969698e-06,
+ "loss": 2.0196030139923096,
+ "mean_token_accuracy": 0.5519052147865295,
+ "num_tokens": 2473984.0,
+ "step": 151
+ },
+ {
+ "entropy": 1.5792397260665894,
+ "epoch": 0.30707070707070705,
+ "grad_norm": 2.048396587371826,
+ "learning_rate": 4.694949494949496e-06,
+ "loss": 1.575985074043274,
+ "mean_token_accuracy": 0.623961865901947,
+ "num_tokens": 2490368.0,
+ "step": 152
+ },
+ {
+ "entropy": 1.487528681755066,
+ "epoch": 0.3090909090909091,
+ "grad_norm": 2.1903791427612305,
+ "learning_rate": 4.692929292929294e-06,
+ "loss": 1.479973316192627,
+ "mean_token_accuracy": 0.6595017313957214,
+ "num_tokens": 2506752.0,
+ "step": 153
+ },
+ {
+ "entropy": 1.766797423362732,
+ "epoch": 0.3111111111111111,
+ "grad_norm": 2.1843011379241943,
+ "learning_rate": 4.690909090909092e-06,
+ "loss": 1.7993412017822266,
+ "mean_token_accuracy": 0.5965437293052673,
+ "num_tokens": 2523136.0,
+ "step": 154
+ },
+ {
+ "entropy": 1.7058254480361938,
+ "epoch": 0.31313131313131315,
+ "grad_norm": 2.204461097717285,
+ "learning_rate": 4.6888888888888895e-06,
+ "loss": 1.7346007823944092,
+ "mean_token_accuracy": 0.6077185869216919,
+ "num_tokens": 2539520.0,
+ "step": 155
+ },
+ {
+ "entropy": 1.4929591417312622,
+ "epoch": 0.3151515151515151,
+ "grad_norm": 2.1739237308502197,
+ "learning_rate": 4.6868686868686874e-06,
+ "loss": 1.4708621501922607,
+ "mean_token_accuracy": 0.6427088379859924,
+ "num_tokens": 2555904.0,
+ "step": 156
+ },
+ {
+ "entropy": 1.5797587633132935,
+ "epoch": 0.31717171717171716,
+ "grad_norm": 2.150561571121216,
+ "learning_rate": 4.684848484848485e-06,
+ "loss": 1.5921857357025146,
+ "mean_token_accuracy": 0.6262823939323425,
+ "num_tokens": 2572288.0,
+ "step": 157
+ },
+ {
+ "entropy": 1.6198230981826782,
+ "epoch": 0.3191919191919192,
+ "grad_norm": 2.061169385910034,
+ "learning_rate": 4.682828282828283e-06,
+ "loss": 1.6601009368896484,
+ "mean_token_accuracy": 0.619015634059906,
+ "num_tokens": 2588672.0,
+ "step": 158
+ },
+ {
+ "entropy": 1.4026126861572266,
+ "epoch": 0.3212121212121212,
+ "grad_norm": 2.066208839416504,
+ "learning_rate": 4.680808080808081e-06,
+ "loss": 1.4062483310699463,
+ "mean_token_accuracy": 0.6681729555130005,
+ "num_tokens": 2605056.0,
+ "step": 159
+ },
+ {
+ "entropy": 1.4608066082000732,
+ "epoch": 0.32323232323232326,
+ "grad_norm": 2.022627353668213,
+ "learning_rate": 4.678787878787879e-06,
+ "loss": 1.4644970893859863,
+ "mean_token_accuracy": 0.6533341407775879,
+ "num_tokens": 2621440.0,
+ "step": 160
+ },
+ {
+ "entropy": 1.222448468208313,
+ "epoch": 0.32525252525252524,
+ "grad_norm": 2.0399329662323,
+ "learning_rate": 4.676767676767677e-06,
+ "loss": 1.2547852993011475,
+ "mean_token_accuracy": 0.6925378441810608,
+ "num_tokens": 2637824.0,
+ "step": 161
+ },
+ {
+ "entropy": 1.8702255487442017,
+ "epoch": 0.32727272727272727,
+ "grad_norm": 2.177307367324829,
+ "learning_rate": 4.674747474747476e-06,
+ "loss": 1.9041712284088135,
+ "mean_token_accuracy": 0.5754152536392212,
+ "num_tokens": 2654208.0,
+ "step": 162
+ },
+ {
+ "entropy": 1.6861947774887085,
+ "epoch": 0.3292929292929293,
+ "grad_norm": 2.009544610977173,
+ "learning_rate": 4.6727272727272735e-06,
+ "loss": 1.7079355716705322,
+ "mean_token_accuracy": 0.615290641784668,
+ "num_tokens": 2670592.0,
+ "step": 163
+ },
+ {
+ "entropy": 1.3880327939987183,
+ "epoch": 0.33131313131313134,
+ "grad_norm": 2.16359543800354,
+ "learning_rate": 4.670707070707071e-06,
+ "loss": 1.4220571517944336,
+ "mean_token_accuracy": 0.6604787707328796,
+ "num_tokens": 2686976.0,
+ "step": 164
+ },
+ {
+ "entropy": 1.5760643482208252,
+ "epoch": 0.3333333333333333,
+ "grad_norm": 2.09773325920105,
+ "learning_rate": 4.668686868686869e-06,
+ "loss": 1.6036784648895264,
+ "mean_token_accuracy": 0.6267098188400269,
+ "num_tokens": 2703360.0,
+ "step": 165
+ },
+ {
+ "entropy": 1.078303575515747,
+ "epoch": 0.33535353535353535,
+ "grad_norm": 1.7760599851608276,
+ "learning_rate": 4.666666666666667e-06,
+ "loss": 1.0612695217132568,
+ "mean_token_accuracy": 0.7349169254302979,
+ "num_tokens": 2719744.0,
+ "step": 166
+ },
+ {
+ "entropy": 1.3722130060195923,
+ "epoch": 0.3373737373737374,
+ "grad_norm": 2.0816409587860107,
+ "learning_rate": 4.664646464646465e-06,
+ "loss": 1.3693504333496094,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 2736128.0,
+ "step": 167
+ },
+ {
+ "entropy": 1.8752760887145996,
+ "epoch": 0.3393939393939394,
+ "grad_norm": 2.1670358180999756,
+ "learning_rate": 4.662626262626263e-06,
+ "loss": 1.8874578475952148,
+ "mean_token_accuracy": 0.5881778001785278,
+ "num_tokens": 2752512.0,
+ "step": 168
+ },
+ {
+ "entropy": 1.7384581565856934,
+ "epoch": 0.3414141414141414,
+ "grad_norm": 2.0072429180145264,
+ "learning_rate": 4.660606060606061e-06,
+ "loss": 1.7491583824157715,
+ "mean_token_accuracy": 0.6041157841682434,
+ "num_tokens": 2768896.0,
+ "step": 169
+ },
+ {
+ "entropy": 1.6651691198349,
+ "epoch": 0.3434343434343434,
+ "grad_norm": 2.0812578201293945,
+ "learning_rate": 4.658585858585859e-06,
+ "loss": 1.6808438301086426,
+ "mean_token_accuracy": 0.6273204684257507,
+ "num_tokens": 2785280.0,
+ "step": 170
+ },
+ {
+ "entropy": 1.3426616191864014,
+ "epoch": 0.34545454545454546,
+ "grad_norm": 1.9108822345733643,
+ "learning_rate": 4.656565656565657e-06,
+ "loss": 1.3404264450073242,
+ "mean_token_accuracy": 0.6703101992607117,
+ "num_tokens": 2801664.0,
+ "step": 171
+ },
+ {
+ "entropy": 1.631722092628479,
+ "epoch": 0.3474747474747475,
+ "grad_norm": 2.07317852973938,
+ "learning_rate": 4.654545454545455e-06,
+ "loss": 1.6545813083648682,
+ "mean_token_accuracy": 0.6143136024475098,
+ "num_tokens": 2818048.0,
+ "step": 172
+ },
+ {
+ "entropy": 1.3678289651870728,
+ "epoch": 0.34949494949494947,
+ "grad_norm": 1.8517454862594604,
+ "learning_rate": 4.652525252525253e-06,
+ "loss": 1.3759769201278687,
+ "mean_token_accuracy": 0.6693942546844482,
+ "num_tokens": 2834432.0,
+ "step": 173
+ },
+ {
+ "entropy": 1.3927773237228394,
+ "epoch": 0.3515151515151515,
+ "grad_norm": 2.1304867267608643,
+ "learning_rate": 4.650505050505051e-06,
+ "loss": 1.4104211330413818,
+ "mean_token_accuracy": 0.6612725853919983,
+ "num_tokens": 2850816.0,
+ "step": 174
+ },
+ {
+ "entropy": 1.3352863788604736,
+ "epoch": 0.35353535353535354,
+ "grad_norm": 2.2788777351379395,
+ "learning_rate": 4.648484848484849e-06,
+ "loss": 1.3665719032287598,
+ "mean_token_accuracy": 0.6640205383300781,
+ "num_tokens": 2867200.0,
+ "step": 175
+ },
+ {
+ "entropy": 1.6800754070281982,
+ "epoch": 0.35555555555555557,
+ "grad_norm": 2.030787944793701,
+ "learning_rate": 4.646464646464647e-06,
+ "loss": 1.7239181995391846,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 2883584.0,
+ "step": 176
+ },
+ {
+ "entropy": 1.2852731943130493,
+ "epoch": 0.3575757575757576,
+ "grad_norm": 1.9148248434066772,
+ "learning_rate": 4.644444444444445e-06,
+ "loss": 1.2934880256652832,
+ "mean_token_accuracy": 0.6798363327980042,
+ "num_tokens": 2899968.0,
+ "step": 177
+ },
+ {
+ "entropy": 1.6366593837738037,
+ "epoch": 0.3595959595959596,
+ "grad_norm": 2.2264015674591064,
+ "learning_rate": 4.642424242424243e-06,
+ "loss": 1.632002592086792,
+ "mean_token_accuracy": 0.6180385947227478,
+ "num_tokens": 2916352.0,
+ "step": 178
+ },
+ {
+ "entropy": 1.3935565948486328,
+ "epoch": 0.3616161616161616,
+ "grad_norm": 2.0410475730895996,
+ "learning_rate": 4.6404040404040406e-06,
+ "loss": 1.407370686531067,
+ "mean_token_accuracy": 0.6722032427787781,
+ "num_tokens": 2932736.0,
+ "step": 179
+ },
+ {
+ "entropy": 1.0952510833740234,
+ "epoch": 0.36363636363636365,
+ "grad_norm": 1.937270164489746,
+ "learning_rate": 4.6383838383838384e-06,
+ "loss": 1.1101973056793213,
+ "mean_token_accuracy": 0.730947732925415,
+ "num_tokens": 2949120.0,
+ "step": 180
+ },
+ {
+ "entropy": 1.184926152229309,
+ "epoch": 0.3656565656565657,
+ "grad_norm": 1.9867528676986694,
+ "learning_rate": 4.636363636363636e-06,
+ "loss": 1.1932196617126465,
+ "mean_token_accuracy": 0.7085368633270264,
+ "num_tokens": 2965504.0,
+ "step": 181
+ },
+ {
+ "entropy": 1.4552072286605835,
+ "epoch": 0.36767676767676766,
+ "grad_norm": 1.9395766258239746,
+ "learning_rate": 4.634343434343434e-06,
+ "loss": 1.4559956789016724,
+ "mean_token_accuracy": 0.6534562706947327,
+ "num_tokens": 2981888.0,
+ "step": 182
+ },
+ {
+ "entropy": 1.6437443494796753,
+ "epoch": 0.3696969696969697,
+ "grad_norm": 2.1257567405700684,
+ "learning_rate": 4.632323232323233e-06,
+ "loss": 1.6260980367660522,
+ "mean_token_accuracy": 0.625,
+ "num_tokens": 2998272.0,
+ "step": 183
+ },
+ {
+ "entropy": 1.8264633417129517,
+ "epoch": 0.3717171717171717,
+ "grad_norm": 2.187041759490967,
+ "learning_rate": 4.630303030303031e-06,
+ "loss": 1.8431676626205444,
+ "mean_token_accuracy": 0.60332190990448,
+ "num_tokens": 3014656.0,
+ "step": 184
+ },
+ {
+ "entropy": 1.1121351718902588,
+ "epoch": 0.37373737373737376,
+ "grad_norm": 1.8460402488708496,
+ "learning_rate": 4.628282828282829e-06,
+ "loss": 1.1054425239562988,
+ "mean_token_accuracy": 0.7254518866539001,
+ "num_tokens": 3031040.0,
+ "step": 185
+ },
+ {
+ "entropy": 1.3531955480575562,
+ "epoch": 0.37575757575757573,
+ "grad_norm": 2.3463470935821533,
+ "learning_rate": 4.626262626262627e-06,
+ "loss": 1.359381914138794,
+ "mean_token_accuracy": 0.6610894203186035,
+ "num_tokens": 3047424.0,
+ "step": 186
+ },
+ {
+ "entropy": 1.2131577730178833,
+ "epoch": 0.37777777777777777,
+ "grad_norm": 1.9595171213150024,
+ "learning_rate": 4.6242424242424245e-06,
+ "loss": 1.2312005758285522,
+ "mean_token_accuracy": 0.6979115605354309,
+ "num_tokens": 3063808.0,
+ "step": 187
+ },
+ {
+ "entropy": 1.5441125631332397,
+ "epoch": 0.3797979797979798,
+ "grad_norm": 2.2971343994140625,
+ "learning_rate": 4.622222222222222e-06,
+ "loss": 1.5923339128494263,
+ "mean_token_accuracy": 0.6297020316123962,
+ "num_tokens": 3080192.0,
+ "step": 188
+ },
+ {
+ "entropy": 1.7998323440551758,
+ "epoch": 0.38181818181818183,
+ "grad_norm": 2.010552167892456,
+ "learning_rate": 4.62020202020202e-06,
+ "loss": 1.8257204294204712,
+ "mean_token_accuracy": 0.5997191071510315,
+ "num_tokens": 3096576.0,
+ "step": 189
+ },
+ {
+ "entropy": 1.389051914215088,
+ "epoch": 0.3838383838383838,
+ "grad_norm": 2.1183855533599854,
+ "learning_rate": 4.618181818181818e-06,
+ "loss": 1.431575059890747,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 3112960.0,
+ "step": 190
+ },
+ {
+ "entropy": 2.0066142082214355,
+ "epoch": 0.38585858585858585,
+ "grad_norm": 2.061399221420288,
+ "learning_rate": 4.616161616161616e-06,
+ "loss": 2.0477406978607178,
+ "mean_token_accuracy": 0.5454934239387512,
+ "num_tokens": 3129344.0,
+ "step": 191
+ },
+ {
+ "entropy": 1.3063198328018188,
+ "epoch": 0.3878787878787879,
+ "grad_norm": 1.9490301609039307,
+ "learning_rate": 4.614141414141414e-06,
+ "loss": 1.3293564319610596,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 3145728.0,
+ "step": 192
+ },
+ {
+ "entropy": 1.3636538982391357,
+ "epoch": 0.3898989898989899,
+ "grad_norm": 2.025458574295044,
+ "learning_rate": 4.612121212121212e-06,
+ "loss": 1.3736209869384766,
+ "mean_token_accuracy": 0.679286777973175,
+ "num_tokens": 3162112.0,
+ "step": 193
+ },
+ {
+ "entropy": 1.5669925212860107,
+ "epoch": 0.39191919191919194,
+ "grad_norm": 2.064033269882202,
+ "learning_rate": 4.6101010101010106e-06,
+ "loss": 1.5587083101272583,
+ "mean_token_accuracy": 0.6267709136009216,
+ "num_tokens": 3178496.0,
+ "step": 194
+ },
+ {
+ "entropy": 1.4489716291427612,
+ "epoch": 0.3939393939393939,
+ "grad_norm": 2.0174880027770996,
+ "learning_rate": 4.6080808080808085e-06,
+ "loss": 1.4331417083740234,
+ "mean_token_accuracy": 0.6571812629699707,
+ "num_tokens": 3194880.0,
+ "step": 195
+ },
+ {
+ "entropy": 2.026416778564453,
+ "epoch": 0.39595959595959596,
+ "grad_norm": 2.1820878982543945,
+ "learning_rate": 4.606060606060606e-06,
+ "loss": 2.029003143310547,
+ "mean_token_accuracy": 0.563568651676178,
+ "num_tokens": 3211264.0,
+ "step": 196
+ },
+ {
+ "entropy": 2.1844022274017334,
+ "epoch": 0.397979797979798,
+ "grad_norm": 2.175349473953247,
+ "learning_rate": 4.604040404040404e-06,
+ "loss": 2.2053825855255127,
+ "mean_token_accuracy": 0.5553248524665833,
+ "num_tokens": 3227648.0,
+ "step": 197
+ },
+ {
+ "entropy": 1.6750906705856323,
+ "epoch": 0.4,
+ "grad_norm": 1.8300689458847046,
+ "learning_rate": 4.602020202020203e-06,
+ "loss": 1.692289113998413,
+ "mean_token_accuracy": 0.6345261335372925,
+ "num_tokens": 3244032.0,
+ "step": 198
+ },
+ {
+ "entropy": 1.6192772388458252,
+ "epoch": 0.402020202020202,
+ "grad_norm": 1.9788341522216797,
+ "learning_rate": 4.600000000000001e-06,
+ "loss": 1.628842830657959,
+ "mean_token_accuracy": 0.615229606628418,
+ "num_tokens": 3260416.0,
+ "step": 199
+ },
+ {
+ "entropy": 1.444870948791504,
+ "epoch": 0.40404040404040403,
+ "grad_norm": 2.05141544342041,
+ "learning_rate": 4.597979797979799e-06,
+ "loss": 1.4365839958190918,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 3276800.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.40404040404040403,
+ "eval_entropy": 1.5766179907706477,
+ "eval_loss": 1.5878442525863647,
+ "eval_mean_token_accuracy": 0.6355829551335304,
+ "eval_num_tokens": 3276800.0,
+ "eval_runtime": 43.7272,
+ "eval_samples_per_second": 22.64,
+ "eval_steps_per_second": 2.836,
+ "step": 200
+ },
+ {
+ "entropy": 1.3354029655456543,
+ "epoch": 0.40606060606060607,
+ "grad_norm": 2.012895345687866,
+ "learning_rate": 4.595959595959597e-06,
+ "loss": 1.3289990425109863,
+ "mean_token_accuracy": 0.685271143913269,
+ "num_tokens": 3293184.0,
+ "step": 201
+ },
+ {
+ "entropy": 1.1990011930465698,
+ "epoch": 0.4080808080808081,
+ "grad_norm": 1.9462409019470215,
+ "learning_rate": 4.5939393939393945e-06,
+ "loss": 1.224869728088379,
+ "mean_token_accuracy": 0.6976673007011414,
+ "num_tokens": 3309568.0,
+ "step": 202
+ },
+ {
+ "entropy": 1.6442710161209106,
+ "epoch": 0.4101010101010101,
+ "grad_norm": 2.064532995223999,
+ "learning_rate": 4.591919191919192e-06,
+ "loss": 1.6800963878631592,
+ "mean_token_accuracy": 0.6111993193626404,
+ "num_tokens": 3325952.0,
+ "step": 203
+ },
+ {
+ "entropy": 1.8336306810379028,
+ "epoch": 0.4121212121212121,
+ "grad_norm": 2.478731393814087,
+ "learning_rate": 4.58989898989899e-06,
+ "loss": 1.8518702983856201,
+ "mean_token_accuracy": 0.6021006107330322,
+ "num_tokens": 3342336.0,
+ "step": 204
+ },
+ {
+ "entropy": 1.6767220497131348,
+ "epoch": 0.41414141414141414,
+ "grad_norm": 2.0676512718200684,
+ "learning_rate": 4.587878787878788e-06,
+ "loss": 1.674522042274475,
+ "mean_token_accuracy": 0.6178553700447083,
+ "num_tokens": 3358720.0,
+ "step": 205
+ },
+ {
+ "entropy": 1.7236497402191162,
+ "epoch": 0.4161616161616162,
+ "grad_norm": 2.057074785232544,
+ "learning_rate": 4.585858585858586e-06,
+ "loss": 1.725832462310791,
+ "mean_token_accuracy": 0.620114803314209,
+ "num_tokens": 3375104.0,
+ "step": 206
+ },
+ {
+ "entropy": 1.6493065357208252,
+ "epoch": 0.41818181818181815,
+ "grad_norm": 2.0946099758148193,
+ "learning_rate": 4.583838383838384e-06,
+ "loss": 1.6826295852661133,
+ "mean_token_accuracy": 0.6251221299171448,
+ "num_tokens": 3391488.0,
+ "step": 207
+ },
+ {
+ "entropy": 1.3565926551818848,
+ "epoch": 0.4202020202020202,
+ "grad_norm": 1.9611284732818604,
+ "learning_rate": 4.581818181818183e-06,
+ "loss": 1.346787452697754,
+ "mean_token_accuracy": 0.685332179069519,
+ "num_tokens": 3407872.0,
+ "step": 208
+ },
+ {
+ "entropy": 1.4401211738586426,
+ "epoch": 0.4222222222222222,
+ "grad_norm": 1.8614766597747803,
+ "learning_rate": 4.579797979797981e-06,
+ "loss": 1.4717891216278076,
+ "mean_token_accuracy": 0.650036633014679,
+ "num_tokens": 3424256.0,
+ "step": 209
+ },
+ {
+ "entropy": 1.194276213645935,
+ "epoch": 0.42424242424242425,
+ "grad_norm": 2.0625810623168945,
+ "learning_rate": 4.5777777777777785e-06,
+ "loss": 1.2106804847717285,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 3440640.0,
+ "step": 210
+ },
+ {
+ "entropy": 1.7622313499450684,
+ "epoch": 0.4262626262626263,
+ "grad_norm": 2.330610752105713,
+ "learning_rate": 4.575757575757576e-06,
+ "loss": 1.7872710227966309,
+ "mean_token_accuracy": 0.598436713218689,
+ "num_tokens": 3457024.0,
+ "step": 211
+ },
+ {
+ "entropy": 1.409427523612976,
+ "epoch": 0.42828282828282827,
+ "grad_norm": 2.0988259315490723,
+ "learning_rate": 4.573737373737374e-06,
+ "loss": 1.416553020477295,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 3473408.0,
+ "step": 212
+ },
+ {
+ "entropy": 1.6856107711791992,
+ "epoch": 0.4303030303030303,
+ "grad_norm": 2.341475009918213,
+ "learning_rate": 4.571717171717172e-06,
+ "loss": 1.692287802696228,
+ "mean_token_accuracy": 0.6024059653282166,
+ "num_tokens": 3489792.0,
+ "step": 213
+ },
+ {
+ "entropy": 1.997343897819519,
+ "epoch": 0.43232323232323233,
+ "grad_norm": 2.200498104095459,
+ "learning_rate": 4.56969696969697e-06,
+ "loss": 2.026289939880371,
+ "mean_token_accuracy": 0.5781631469726562,
+ "num_tokens": 3506176.0,
+ "step": 214
+ },
+ {
+ "entropy": 1.5175039768218994,
+ "epoch": 0.43434343434343436,
+ "grad_norm": 2.105257272720337,
+ "learning_rate": 4.567676767676768e-06,
+ "loss": 1.521841049194336,
+ "mean_token_accuracy": 0.6404494643211365,
+ "num_tokens": 3522560.0,
+ "step": 215
+ },
+ {
+ "entropy": 1.3616528511047363,
+ "epoch": 0.43636363636363634,
+ "grad_norm": 2.0035297870635986,
+ "learning_rate": 4.565656565656566e-06,
+ "loss": 1.3674360513687134,
+ "mean_token_accuracy": 0.6771494746208191,
+ "num_tokens": 3538944.0,
+ "step": 216
+ },
+ {
+ "entropy": 1.42499840259552,
+ "epoch": 0.4383838383838384,
+ "grad_norm": 1.9115629196166992,
+ "learning_rate": 4.563636363636364e-06,
+ "loss": 1.4129266738891602,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 3555328.0,
+ "step": 217
+ },
+ {
+ "entropy": 1.2844709157943726,
+ "epoch": 0.4404040404040404,
+ "grad_norm": 2.3313121795654297,
+ "learning_rate": 4.5616161616161616e-06,
+ "loss": 1.315006971359253,
+ "mean_token_accuracy": 0.681546151638031,
+ "num_tokens": 3571712.0,
+ "step": 218
+ },
+ {
+ "entropy": 1.5227075815200806,
+ "epoch": 0.44242424242424244,
+ "grad_norm": 2.1849124431610107,
+ "learning_rate": 4.55959595959596e-06,
+ "loss": 1.517989158630371,
+ "mean_token_accuracy": 0.6466169953346252,
+ "num_tokens": 3588096.0,
+ "step": 219
+ },
+ {
+ "entropy": 1.494642734527588,
+ "epoch": 0.4444444444444444,
+ "grad_norm": 2.3109116554260254,
+ "learning_rate": 4.557575757575758e-06,
+ "loss": 1.525421142578125,
+ "mean_token_accuracy": 0.6392281651496887,
+ "num_tokens": 3604480.0,
+ "step": 220
+ },
+ {
+ "entropy": 1.6428948640823364,
+ "epoch": 0.44646464646464645,
+ "grad_norm": 2.1182680130004883,
+ "learning_rate": 4.555555555555556e-06,
+ "loss": 1.6634926795959473,
+ "mean_token_accuracy": 0.6207864880561829,
+ "num_tokens": 3620864.0,
+ "step": 221
+ },
+ {
+ "entropy": 1.7323675155639648,
+ "epoch": 0.4484848484848485,
+ "grad_norm": 2.2620837688446045,
+ "learning_rate": 4.553535353535354e-06,
+ "loss": 1.7312631607055664,
+ "mean_token_accuracy": 0.6138250827789307,
+ "num_tokens": 3637248.0,
+ "step": 222
+ },
+ {
+ "entropy": 1.7863894701004028,
+ "epoch": 0.4505050505050505,
+ "grad_norm": 2.1416971683502197,
+ "learning_rate": 4.551515151515152e-06,
+ "loss": 1.799318552017212,
+ "mean_token_accuracy": 0.5906203985214233,
+ "num_tokens": 3653632.0,
+ "step": 223
+ },
+ {
+ "entropy": 1.7404330968856812,
+ "epoch": 0.45252525252525255,
+ "grad_norm": 2.0814504623413086,
+ "learning_rate": 4.54949494949495e-06,
+ "loss": 1.742197036743164,
+ "mean_token_accuracy": 0.6050317287445068,
+ "num_tokens": 3670016.0,
+ "step": 224
+ },
+ {
+ "entropy": 1.4387869834899902,
+ "epoch": 0.45454545454545453,
+ "grad_norm": 2.1386022567749023,
+ "learning_rate": 4.547474747474748e-06,
+ "loss": 1.4602317810058594,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 3686400.0,
+ "step": 225
+ },
+ {
+ "entropy": 1.2733348608016968,
+ "epoch": 0.45656565656565656,
+ "grad_norm": 2.02687668800354,
+ "learning_rate": 4.5454545454545455e-06,
+ "loss": 1.2683714628219604,
+ "mean_token_accuracy": 0.6966902613639832,
+ "num_tokens": 3702784.0,
+ "step": 226
+ },
+ {
+ "entropy": 1.4554595947265625,
+ "epoch": 0.4585858585858586,
+ "grad_norm": 2.169268846511841,
+ "learning_rate": 4.543434343434343e-06,
+ "loss": 1.4541833400726318,
+ "mean_token_accuracy": 0.6522960662841797,
+ "num_tokens": 3719168.0,
+ "step": 227
+ },
+ {
+ "entropy": 1.487573266029358,
+ "epoch": 0.46060606060606063,
+ "grad_norm": 1.9726165533065796,
+ "learning_rate": 4.541414141414141e-06,
+ "loss": 1.5024409294128418,
+ "mean_token_accuracy": 0.6509526371955872,
+ "num_tokens": 3735552.0,
+ "step": 228
+ },
+ {
+ "entropy": 1.3991138935089111,
+ "epoch": 0.4626262626262626,
+ "grad_norm": 2.0992283821105957,
+ "learning_rate": 4.539393939393939e-06,
+ "loss": 1.4016860723495483,
+ "mean_token_accuracy": 0.6639594435691833,
+ "num_tokens": 3751936.0,
+ "step": 229
+ },
+ {
+ "entropy": 1.6564134359359741,
+ "epoch": 0.46464646464646464,
+ "grad_norm": 2.047656297683716,
+ "learning_rate": 4.537373737373738e-06,
+ "loss": 1.6598721742630005,
+ "mean_token_accuracy": 0.6166951656341553,
+ "num_tokens": 3768320.0,
+ "step": 230
+ },
+ {
+ "entropy": 1.5165014266967773,
+ "epoch": 0.4666666666666667,
+ "grad_norm": 2.079996109008789,
+ "learning_rate": 4.535353535353536e-06,
+ "loss": 1.4980010986328125,
+ "mean_token_accuracy": 0.6370908617973328,
+ "num_tokens": 3784704.0,
+ "step": 231
+ },
+ {
+ "entropy": 1.5409225225448608,
+ "epoch": 0.4686868686868687,
+ "grad_norm": 2.0996923446655273,
+ "learning_rate": 4.533333333333334e-06,
+ "loss": 1.5504257678985596,
+ "mean_token_accuracy": 0.6465559601783752,
+ "num_tokens": 3801088.0,
+ "step": 232
+ },
+ {
+ "entropy": 1.3590043783187866,
+ "epoch": 0.4707070707070707,
+ "grad_norm": 2.14617919921875,
+ "learning_rate": 4.531313131313132e-06,
+ "loss": 1.3581812381744385,
+ "mean_token_accuracy": 0.6683561205863953,
+ "num_tokens": 3817472.0,
+ "step": 233
+ },
+ {
+ "entropy": 1.641785740852356,
+ "epoch": 0.4727272727272727,
+ "grad_norm": 1.9499926567077637,
+ "learning_rate": 4.5292929292929295e-06,
+ "loss": 1.6653470993041992,
+ "mean_token_accuracy": 0.6319614052772522,
+ "num_tokens": 3833856.0,
+ "step": 234
+ },
+ {
+ "entropy": 1.4700758457183838,
+ "epoch": 0.47474747474747475,
+ "grad_norm": 1.9411437511444092,
+ "learning_rate": 4.527272727272727e-06,
+ "loss": 1.4762463569641113,
+ "mean_token_accuracy": 0.6631656289100647,
+ "num_tokens": 3850240.0,
+ "step": 235
+ },
+ {
+ "entropy": 1.5418941974639893,
+ "epoch": 0.4767676767676768,
+ "grad_norm": 2.3191940784454346,
+ "learning_rate": 4.525252525252526e-06,
+ "loss": 1.5151214599609375,
+ "mean_token_accuracy": 0.6326331496238708,
+ "num_tokens": 3866624.0,
+ "step": 236
+ },
+ {
+ "entropy": 2.1102776527404785,
+ "epoch": 0.47878787878787876,
+ "grad_norm": 2.2287707328796387,
+ "learning_rate": 4.523232323232324e-06,
+ "loss": 2.106567859649658,
+ "mean_token_accuracy": 0.5506839156150818,
+ "num_tokens": 3883008.0,
+ "step": 237
+ },
+ {
+ "entropy": 1.7448827028274536,
+ "epoch": 0.4808080808080808,
+ "grad_norm": 2.2352893352508545,
+ "learning_rate": 4.521212121212122e-06,
+ "loss": 1.7495017051696777,
+ "mean_token_accuracy": 0.60326087474823,
+ "num_tokens": 3899392.0,
+ "step": 238
+ },
+ {
+ "entropy": 1.315240740776062,
+ "epoch": 0.48282828282828283,
+ "grad_norm": 1.9933631420135498,
+ "learning_rate": 4.51919191919192e-06,
+ "loss": 1.315302848815918,
+ "mean_token_accuracy": 0.686431348323822,
+ "num_tokens": 3915776.0,
+ "step": 239
+ },
+ {
+ "entropy": 1.5851637125015259,
+ "epoch": 0.48484848484848486,
+ "grad_norm": 2.153303623199463,
+ "learning_rate": 4.517171717171718e-06,
+ "loss": 1.5947662591934204,
+ "mean_token_accuracy": 0.6297020316123962,
+ "num_tokens": 3932160.0,
+ "step": 240
+ },
+ {
+ "entropy": 1.8050944805145264,
+ "epoch": 0.4868686868686869,
+ "grad_norm": 2.025022506713867,
+ "learning_rate": 4.5151515151515155e-06,
+ "loss": 1.8051010370254517,
+ "mean_token_accuracy": 0.6055202484130859,
+ "num_tokens": 3948544.0,
+ "step": 241
+ },
+ {
+ "entropy": 1.518296718597412,
+ "epoch": 0.4888888888888889,
+ "grad_norm": 2.1021833419799805,
+ "learning_rate": 4.513131313131313e-06,
+ "loss": 1.5396809577941895,
+ "mean_token_accuracy": 0.6359916925430298,
+ "num_tokens": 3964928.0,
+ "step": 242
+ },
+ {
+ "entropy": 1.518903136253357,
+ "epoch": 0.4909090909090909,
+ "grad_norm": 2.0960140228271484,
+ "learning_rate": 4.511111111111111e-06,
+ "loss": 1.5528055429458618,
+ "mean_token_accuracy": 0.6224963068962097,
+ "num_tokens": 3981312.0,
+ "step": 243
+ },
+ {
+ "entropy": 1.6960705518722534,
+ "epoch": 0.49292929292929294,
+ "grad_norm": 1.8580718040466309,
+ "learning_rate": 4.50909090909091e-06,
+ "loss": 1.7192862033843994,
+ "mean_token_accuracy": 0.6259770393371582,
+ "num_tokens": 3997696.0,
+ "step": 244
+ },
+ {
+ "entropy": 1.4633033275604248,
+ "epoch": 0.494949494949495,
+ "grad_norm": 1.8983049392700195,
+ "learning_rate": 4.507070707070708e-06,
+ "loss": 1.451701283454895,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 4014080.0,
+ "step": 245
+ },
+ {
+ "entropy": 1.6508095264434814,
+ "epoch": 0.49696969696969695,
+ "grad_norm": 2.298679828643799,
+ "learning_rate": 4.505050505050506e-06,
+ "loss": 1.6596897840499878,
+ "mean_token_accuracy": 0.6115046143531799,
+ "num_tokens": 4030464.0,
+ "step": 246
+ },
+ {
+ "entropy": 1.313779354095459,
+ "epoch": 0.498989898989899,
+ "grad_norm": 1.9894335269927979,
+ "learning_rate": 4.503030303030304e-06,
+ "loss": 1.3285409212112427,
+ "mean_token_accuracy": 0.6802027225494385,
+ "num_tokens": 4046848.0,
+ "step": 247
+ },
+ {
+ "entropy": 1.5139521360397339,
+ "epoch": 0.501010101010101,
+ "grad_norm": 2.028320789337158,
+ "learning_rate": 4.501010101010102e-06,
+ "loss": 1.5366487503051758,
+ "mean_token_accuracy": 0.6416707634925842,
+ "num_tokens": 4063232.0,
+ "step": 248
+ },
+ {
+ "entropy": 1.5277045965194702,
+ "epoch": 0.503030303030303,
+ "grad_norm": 2.3160979747772217,
+ "learning_rate": 4.4989898989898995e-06,
+ "loss": 1.5571036338806152,
+ "mean_token_accuracy": 0.6436858773231506,
+ "num_tokens": 4079616.0,
+ "step": 249
+ },
+ {
+ "entropy": 1.6084188222885132,
+ "epoch": 0.5050505050505051,
+ "grad_norm": 2.20550274848938,
+ "learning_rate": 4.496969696969697e-06,
+ "loss": 1.622127652168274,
+ "mean_token_accuracy": 0.6284196376800537,
+ "num_tokens": 4096000.0,
+ "step": 250
+ },
+ {
+ "epoch": 0.5050505050505051,
+ "eval_entropy": 1.5547234262189558,
+ "eval_loss": 1.5764786005020142,
+ "eval_mean_token_accuracy": 0.6375306306346771,
+ "eval_num_tokens": 4096000.0,
+ "eval_runtime": 43.7607,
+ "eval_samples_per_second": 22.623,
+ "eval_steps_per_second": 2.834,
+ "step": 250
+ },
+ {
+ "entropy": 1.4309135675430298,
+ "epoch": 0.5070707070707071,
+ "grad_norm": 2.080864906311035,
+ "learning_rate": 4.494949494949495e-06,
+ "loss": 1.4481091499328613,
+ "mean_token_accuracy": 0.6694552898406982,
+ "num_tokens": 4112384.0,
+ "step": 251
+ },
+ {
+ "entropy": 1.4067270755767822,
+ "epoch": 0.509090909090909,
+ "grad_norm": 2.036475419998169,
+ "learning_rate": 4.492929292929293e-06,
+ "loss": 1.4035298824310303,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 4128768.0,
+ "step": 252
+ },
+ {
+ "entropy": 2.1751608848571777,
+ "epoch": 0.5111111111111111,
+ "grad_norm": 1.953995943069458,
+ "learning_rate": 4.490909090909091e-06,
+ "loss": 2.1616692543029785,
+ "mean_token_accuracy": 0.5592941045761108,
+ "num_tokens": 4145152.0,
+ "step": 253
+ },
+ {
+ "entropy": 1.45353102684021,
+ "epoch": 0.5131313131313131,
+ "grad_norm": 2.084437370300293,
+ "learning_rate": 4.488888888888889e-06,
+ "loss": 1.4633586406707764,
+ "mean_token_accuracy": 0.6620664596557617,
+ "num_tokens": 4161536.0,
+ "step": 254
+ },
+ {
+ "entropy": 1.64310884475708,
+ "epoch": 0.5151515151515151,
+ "grad_norm": 2.0700111389160156,
+ "learning_rate": 4.486868686868688e-06,
+ "loss": 1.6868078708648682,
+ "mean_token_accuracy": 0.616328775882721,
+ "num_tokens": 4177920.0,
+ "step": 255
+ },
+ {
+ "entropy": 1.5113472938537598,
+ "epoch": 0.5171717171717172,
+ "grad_norm": 2.102180242538452,
+ "learning_rate": 4.4848484848484855e-06,
+ "loss": 1.5240120887756348,
+ "mean_token_accuracy": 0.638067901134491,
+ "num_tokens": 4194304.0,
+ "step": 256
+ },
+ {
+ "entropy": 1.5752851963043213,
+ "epoch": 0.5191919191919192,
+ "grad_norm": 2.026737689971924,
+ "learning_rate": 4.4828282828282834e-06,
+ "loss": 1.6041791439056396,
+ "mean_token_accuracy": 0.6275647282600403,
+ "num_tokens": 4210688.0,
+ "step": 257
+ },
+ {
+ "entropy": 1.548423171043396,
+ "epoch": 0.5212121212121212,
+ "grad_norm": 2.0578935146331787,
+ "learning_rate": 4.480808080808081e-06,
+ "loss": 1.563529372215271,
+ "mean_token_accuracy": 0.6348925232887268,
+ "num_tokens": 4227072.0,
+ "step": 258
+ },
+ {
+ "entropy": 1.5324457883834839,
+ "epoch": 0.5232323232323233,
+ "grad_norm": 2.216235637664795,
+ "learning_rate": 4.478787878787879e-06,
+ "loss": 1.5559678077697754,
+ "mean_token_accuracy": 0.6300073266029358,
+ "num_tokens": 4243456.0,
+ "step": 259
+ },
+ {
+ "entropy": 1.5275540351867676,
+ "epoch": 0.5252525252525253,
+ "grad_norm": 2.037306070327759,
+ "learning_rate": 4.476767676767677e-06,
+ "loss": 1.541567087173462,
+ "mean_token_accuracy": 0.6424035429954529,
+ "num_tokens": 4259840.0,
+ "step": 260
+ },
+ {
+ "entropy": 1.6842185258865356,
+ "epoch": 0.5272727272727272,
+ "grad_norm": 2.0241005420684814,
+ "learning_rate": 4.474747474747475e-06,
+ "loss": 1.6819056272506714,
+ "mean_token_accuracy": 0.6102222800254822,
+ "num_tokens": 4276224.0,
+ "step": 261
+ },
+ {
+ "entropy": 1.5656248331069946,
+ "epoch": 0.5292929292929293,
+ "grad_norm": 1.993054986000061,
+ "learning_rate": 4.472727272727273e-06,
+ "loss": 1.6132277250289917,
+ "mean_token_accuracy": 0.634709358215332,
+ "num_tokens": 4292608.0,
+ "step": 262
+ },
+ {
+ "entropy": 1.6354466676712036,
+ "epoch": 0.5313131313131313,
+ "grad_norm": 2.06508731842041,
+ "learning_rate": 4.470707070707071e-06,
+ "loss": 1.6475149393081665,
+ "mean_token_accuracy": 0.6121763586997986,
+ "num_tokens": 4308992.0,
+ "step": 263
+ },
+ {
+ "entropy": 1.5267232656478882,
+ "epoch": 0.5333333333333333,
+ "grad_norm": 2.1227569580078125,
+ "learning_rate": 4.468686868686869e-06,
+ "loss": 1.5468671321868896,
+ "mean_token_accuracy": 0.6365413069725037,
+ "num_tokens": 4325376.0,
+ "step": 264
+ },
+ {
+ "entropy": 1.2252761125564575,
+ "epoch": 0.5353535353535354,
+ "grad_norm": 2.0596134662628174,
+ "learning_rate": 4.4666666666666665e-06,
+ "loss": 1.2242389917373657,
+ "mean_token_accuracy": 0.6973620057106018,
+ "num_tokens": 4341760.0,
+ "step": 265
+ },
+ {
+ "entropy": 1.6007431745529175,
+ "epoch": 0.5373737373737374,
+ "grad_norm": 1.9341918230056763,
+ "learning_rate": 4.464646464646465e-06,
+ "loss": 1.5989094972610474,
+ "mean_token_accuracy": 0.6284196376800537,
+ "num_tokens": 4358144.0,
+ "step": 266
+ },
+ {
+ "entropy": 1.2708780765533447,
+ "epoch": 0.5393939393939394,
+ "grad_norm": 4.594091415405273,
+ "learning_rate": 4.462626262626263e-06,
+ "loss": 1.3484312295913696,
+ "mean_token_accuracy": 0.6790425181388855,
+ "num_tokens": 4374528.0,
+ "step": 267
+ },
+ {
+ "entropy": 1.5423723459243774,
+ "epoch": 0.5414141414141415,
+ "grad_norm": 1.933602213859558,
+ "learning_rate": 4.460606060606061e-06,
+ "loss": 1.594527244567871,
+ "mean_token_accuracy": 0.6386785507202148,
+ "num_tokens": 4390912.0,
+ "step": 268
+ },
+ {
+ "entropy": 1.7213952541351318,
+ "epoch": 0.5434343434343434,
+ "grad_norm": 2.195904016494751,
+ "learning_rate": 4.458585858585859e-06,
+ "loss": 1.724353551864624,
+ "mean_token_accuracy": 0.6008182764053345,
+ "num_tokens": 4407296.0,
+ "step": 269
+ },
+ {
+ "entropy": 1.4772557020187378,
+ "epoch": 0.5454545454545454,
+ "grad_norm": 2.0990796089172363,
+ "learning_rate": 4.456565656565657e-06,
+ "loss": 1.486825942993164,
+ "mean_token_accuracy": 0.6507083773612976,
+ "num_tokens": 4423680.0,
+ "step": 270
+ },
+ {
+ "entropy": 1.6876367330551147,
+ "epoch": 0.5474747474747474,
+ "grad_norm": 2.1944479942321777,
+ "learning_rate": 4.454545454545455e-06,
+ "loss": 1.71107816696167,
+ "mean_token_accuracy": 0.6027112603187561,
+ "num_tokens": 4440064.0,
+ "step": 271
+ },
+ {
+ "entropy": 1.5480726957321167,
+ "epoch": 0.5494949494949495,
+ "grad_norm": 2.1579341888427734,
+ "learning_rate": 4.452525252525253e-06,
+ "loss": 1.544647216796875,
+ "mean_token_accuracy": 0.6345261335372925,
+ "num_tokens": 4456448.0,
+ "step": 272
+ },
+ {
+ "entropy": 1.6161645650863647,
+ "epoch": 0.5515151515151515,
+ "grad_norm": 1.981154203414917,
+ "learning_rate": 4.4505050505050505e-06,
+ "loss": 1.6109068393707275,
+ "mean_token_accuracy": 0.6318392753601074,
+ "num_tokens": 4472832.0,
+ "step": 273
+ },
+ {
+ "entropy": 1.2576326131820679,
+ "epoch": 0.5535353535353535,
+ "grad_norm": 1.95668625831604,
+ "learning_rate": 4.448484848484848e-06,
+ "loss": 1.2614656686782837,
+ "mean_token_accuracy": 0.7025524973869324,
+ "num_tokens": 4489216.0,
+ "step": 274
+ },
+ {
+ "entropy": 1.405206561088562,
+ "epoch": 0.5555555555555556,
+ "grad_norm": 2.0302884578704834,
+ "learning_rate": 4.446464646464646e-06,
+ "loss": 1.416546106338501,
+ "mean_token_accuracy": 0.6753786206245422,
+ "num_tokens": 4505600.0,
+ "step": 275
+ },
+ {
+ "entropy": 1.9038625955581665,
+ "epoch": 0.5575757575757576,
+ "grad_norm": 2.06475567817688,
+ "learning_rate": 4.444444444444444e-06,
+ "loss": 1.9273614883422852,
+ "mean_token_accuracy": 0.5813996195793152,
+ "num_tokens": 4521984.0,
+ "step": 276
+ },
+ {
+ "entropy": 1.7208465337753296,
+ "epoch": 0.5595959595959596,
+ "grad_norm": 2.0136189460754395,
+ "learning_rate": 4.442424242424243e-06,
+ "loss": 1.7260158061981201,
+ "mean_token_accuracy": 0.6006350517272949,
+ "num_tokens": 4538368.0,
+ "step": 277
+ },
+ {
+ "entropy": 1.7570570707321167,
+ "epoch": 0.5616161616161616,
+ "grad_norm": 2.148594379425049,
+ "learning_rate": 4.440404040404041e-06,
+ "loss": 1.7799286842346191,
+ "mean_token_accuracy": 0.5943453907966614,
+ "num_tokens": 4554752.0,
+ "step": 278
+ },
+ {
+ "entropy": 1.6388157606124878,
+ "epoch": 0.5636363636363636,
+ "grad_norm": 2.1301987171173096,
+ "learning_rate": 4.438383838383839e-06,
+ "loss": 1.63419508934021,
+ "mean_token_accuracy": 0.6405715942382812,
+ "num_tokens": 4571136.0,
+ "step": 279
+ },
+ {
+ "entropy": 1.5902295112609863,
+ "epoch": 0.5656565656565656,
+ "grad_norm": 2.0526790618896484,
+ "learning_rate": 4.436363636363637e-06,
+ "loss": 1.6278276443481445,
+ "mean_token_accuracy": 0.615229606628418,
+ "num_tokens": 4587520.0,
+ "step": 280
+ },
+ {
+ "entropy": 1.5494027137756348,
+ "epoch": 0.5676767676767677,
+ "grad_norm": 1.9863859415054321,
+ "learning_rate": 4.434343434343435e-06,
+ "loss": 1.5622975826263428,
+ "mean_token_accuracy": 0.6261602640151978,
+ "num_tokens": 4603904.0,
+ "step": 281
+ },
+ {
+ "entropy": 1.2140685319900513,
+ "epoch": 0.5696969696969697,
+ "grad_norm": 2.4206902980804443,
+ "learning_rate": 4.432323232323233e-06,
+ "loss": 1.2389612197875977,
+ "mean_token_accuracy": 0.6943697929382324,
+ "num_tokens": 4620288.0,
+ "step": 282
+ },
+ {
+ "entropy": 1.4347270727157593,
+ "epoch": 0.5717171717171717,
+ "grad_norm": 2.0198237895965576,
+ "learning_rate": 4.430303030303031e-06,
+ "loss": 1.4648659229278564,
+ "mean_token_accuracy": 0.6573033928871155,
+ "num_tokens": 4636672.0,
+ "step": 283
+ },
+ {
+ "entropy": 1.3239331245422363,
+ "epoch": 0.5737373737373738,
+ "grad_norm": 1.9862704277038574,
+ "learning_rate": 4.428282828282829e-06,
+ "loss": 1.3520365953445435,
+ "mean_token_accuracy": 0.6852100491523743,
+ "num_tokens": 4653056.0,
+ "step": 284
+ },
+ {
+ "entropy": 1.7534631490707397,
+ "epoch": 0.5757575757575758,
+ "grad_norm": 2.0964176654815674,
+ "learning_rate": 4.426262626262627e-06,
+ "loss": 1.7659757137298584,
+ "mean_token_accuracy": 0.5975207686424255,
+ "num_tokens": 4669440.0,
+ "step": 285
+ },
+ {
+ "entropy": 1.1573433876037598,
+ "epoch": 0.5777777777777777,
+ "grad_norm": 2.0671567916870117,
+ "learning_rate": 4.424242424242425e-06,
+ "loss": 1.1479461193084717,
+ "mean_token_accuracy": 0.7143380641937256,
+ "num_tokens": 4685824.0,
+ "step": 286
+ },
+ {
+ "entropy": 1.2439504861831665,
+ "epoch": 0.5797979797979798,
+ "grad_norm": 2.0317327976226807,
+ "learning_rate": 4.422222222222223e-06,
+ "loss": 1.255782961845398,
+ "mean_token_accuracy": 0.691255509853363,
+ "num_tokens": 4702208.0,
+ "step": 287
+ },
+ {
+ "entropy": 1.5569473505020142,
+ "epoch": 0.5818181818181818,
+ "grad_norm": 2.0759670734405518,
+ "learning_rate": 4.4202020202020205e-06,
+ "loss": 1.5564974546432495,
+ "mean_token_accuracy": 0.6284807324409485,
+ "num_tokens": 4718592.0,
+ "step": 288
+ },
+ {
+ "entropy": 1.478676199913025,
+ "epoch": 0.5838383838383838,
+ "grad_norm": 1.9528205394744873,
+ "learning_rate": 4.418181818181818e-06,
+ "loss": 1.491654396057129,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 4734976.0,
+ "step": 289
+ },
+ {
+ "entropy": 1.2454503774642944,
+ "epoch": 0.5858585858585859,
+ "grad_norm": 1.9008079767227173,
+ "learning_rate": 4.416161616161616e-06,
+ "loss": 1.253904938697815,
+ "mean_token_accuracy": 0.6971787810325623,
+ "num_tokens": 4751360.0,
+ "step": 290
+ },
+ {
+ "entropy": 1.1740810871124268,
+ "epoch": 0.5878787878787879,
+ "grad_norm": 1.8888787031173706,
+ "learning_rate": 4.414141414141415e-06,
+ "loss": 1.195070505142212,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 4767744.0,
+ "step": 291
+ },
+ {
+ "entropy": 1.6064486503601074,
+ "epoch": 0.5898989898989899,
+ "grad_norm": 2.073559284210205,
+ "learning_rate": 4.412121212121213e-06,
+ "loss": 1.6180689334869385,
+ "mean_token_accuracy": 0.6242061257362366,
+ "num_tokens": 4784128.0,
+ "step": 292
+ },
+ {
+ "entropy": 1.6119383573532104,
+ "epoch": 0.591919191919192,
+ "grad_norm": 1.8773425817489624,
+ "learning_rate": 4.410101010101011e-06,
+ "loss": 1.5875662565231323,
+ "mean_token_accuracy": 0.647838294506073,
+ "num_tokens": 4800512.0,
+ "step": 293
+ },
+ {
+ "entropy": 1.392905592918396,
+ "epoch": 0.593939393939394,
+ "grad_norm": 2.1699368953704834,
+ "learning_rate": 4.408080808080809e-06,
+ "loss": 1.3949127197265625,
+ "mean_token_accuracy": 0.6538837552070618,
+ "num_tokens": 4816896.0,
+ "step": 294
+ },
+ {
+ "entropy": 1.5057002305984497,
+ "epoch": 0.5959595959595959,
+ "grad_norm": 2.2730712890625,
+ "learning_rate": 4.4060606060606066e-06,
+ "loss": 1.4755051136016846,
+ "mean_token_accuracy": 0.6498534679412842,
+ "num_tokens": 4833280.0,
+ "step": 295
+ },
+ {
+ "entropy": 1.5468902587890625,
+ "epoch": 0.597979797979798,
+ "grad_norm": 1.9911075830459595,
+ "learning_rate": 4.4040404040404044e-06,
+ "loss": 1.539963722229004,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 4849664.0,
+ "step": 296
+ },
+ {
+ "entropy": 1.5196901559829712,
+ "epoch": 0.6,
+ "grad_norm": 1.9859540462493896,
+ "learning_rate": 4.402020202020202e-06,
+ "loss": 1.523442029953003,
+ "mean_token_accuracy": 0.6417317986488342,
+ "num_tokens": 4866048.0,
+ "step": 297
+ },
+ {
+ "entropy": 1.8251866102218628,
+ "epoch": 0.602020202020202,
+ "grad_norm": 2.2566516399383545,
+ "learning_rate": 4.4e-06,
+ "loss": 1.8667771816253662,
+ "mean_token_accuracy": 0.5872007608413696,
+ "num_tokens": 4882432.0,
+ "step": 298
+ },
+ {
+ "entropy": 1.6816744804382324,
+ "epoch": 0.604040404040404,
+ "grad_norm": 2.0107715129852295,
+ "learning_rate": 4.397979797979798e-06,
+ "loss": 1.6907548904418945,
+ "mean_token_accuracy": 0.6176722049713135,
+ "num_tokens": 4898816.0,
+ "step": 299
+ },
+ {
+ "entropy": 1.4992223978042603,
+ "epoch": 0.6060606060606061,
+ "grad_norm": 2.1236329078674316,
+ "learning_rate": 4.395959595959596e-06,
+ "loss": 1.5015790462493896,
+ "mean_token_accuracy": 0.6372129917144775,
+ "num_tokens": 4915200.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.6060606060606061,
+ "eval_entropy": 1.5544315297757425,
+ "eval_loss": 1.5676765441894531,
+ "eval_mean_token_accuracy": 0.6389380799185845,
+ "eval_num_tokens": 4915200.0,
+ "eval_runtime": 43.7857,
+ "eval_samples_per_second": 22.61,
+ "eval_steps_per_second": 2.832,
+ "step": 300
+ },
+ {
+ "entropy": 1.518556833267212,
+ "epoch": 0.6080808080808081,
+ "grad_norm": 2.88371205329895,
+ "learning_rate": 4.393939393939394e-06,
+ "loss": 1.5310916900634766,
+ "mean_token_accuracy": 0.6551660895347595,
+ "num_tokens": 4931584.0,
+ "step": 301
+ },
+ {
+ "entropy": 1.4650386571884155,
+ "epoch": 0.6101010101010101,
+ "grad_norm": 2.1849780082702637,
+ "learning_rate": 4.391919191919193e-06,
+ "loss": 1.4405598640441895,
+ "mean_token_accuracy": 0.6531509757041931,
+ "num_tokens": 4947968.0,
+ "step": 302
+ },
+ {
+ "entropy": 1.5209505558013916,
+ "epoch": 0.6121212121212121,
+ "grad_norm": 2.1135010719299316,
+ "learning_rate": 4.3898989898989905e-06,
+ "loss": 1.5324647426605225,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 4964352.0,
+ "step": 303
+ },
+ {
+ "entropy": 1.448391318321228,
+ "epoch": 0.6141414141414141,
+ "grad_norm": 1.9959306716918945,
+ "learning_rate": 4.387878787878788e-06,
+ "loss": 1.4721965789794922,
+ "mean_token_accuracy": 0.6578529477119446,
+ "num_tokens": 4980736.0,
+ "step": 304
+ },
+ {
+ "entropy": 1.4609358310699463,
+ "epoch": 0.6161616161616161,
+ "grad_norm": 2.1308915615081787,
+ "learning_rate": 4.385858585858586e-06,
+ "loss": 1.4707520008087158,
+ "mean_token_accuracy": 0.6482046842575073,
+ "num_tokens": 4997120.0,
+ "step": 305
+ },
+ {
+ "entropy": 1.7125155925750732,
+ "epoch": 0.6181818181818182,
+ "grad_norm": 2.2170841693878174,
+ "learning_rate": 4.383838383838384e-06,
+ "loss": 1.7630269527435303,
+ "mean_token_accuracy": 0.5999022722244263,
+ "num_tokens": 5013504.0,
+ "step": 306
+ },
+ {
+ "entropy": 1.6740268468856812,
+ "epoch": 0.6202020202020202,
+ "grad_norm": 1.983644723892212,
+ "learning_rate": 4.381818181818182e-06,
+ "loss": 1.6849563121795654,
+ "mean_token_accuracy": 0.6237176060676575,
+ "num_tokens": 5029888.0,
+ "step": 307
+ },
+ {
+ "entropy": 1.3754971027374268,
+ "epoch": 0.6222222222222222,
+ "grad_norm": 2.005277395248413,
+ "learning_rate": 4.37979797979798e-06,
+ "loss": 1.385213851928711,
+ "mean_token_accuracy": 0.6638984084129333,
+ "num_tokens": 5046272.0,
+ "step": 308
+ },
+ {
+ "entropy": 1.5476733446121216,
+ "epoch": 0.6242424242424243,
+ "grad_norm": 2.4317610263824463,
+ "learning_rate": 4.377777777777778e-06,
+ "loss": 1.5417041778564453,
+ "mean_token_accuracy": 0.6323888897895813,
+ "num_tokens": 5062656.0,
+ "step": 309
+ },
+ {
+ "entropy": 1.4437031745910645,
+ "epoch": 0.6262626262626263,
+ "grad_norm": 2.1464109420776367,
+ "learning_rate": 4.375757575757576e-06,
+ "loss": 1.4704627990722656,
+ "mean_token_accuracy": 0.6772105693817139,
+ "num_tokens": 5079040.0,
+ "step": 310
+ },
+ {
+ "entropy": 1.4859641790390015,
+ "epoch": 0.6282828282828283,
+ "grad_norm": 2.0800492763519287,
+ "learning_rate": 4.373737373737374e-06,
+ "loss": 1.5072834491729736,
+ "mean_token_accuracy": 0.658707857131958,
+ "num_tokens": 5095424.0,
+ "step": 311
+ },
+ {
+ "entropy": 1.8733419179916382,
+ "epoch": 0.6303030303030303,
+ "grad_norm": 2.120965003967285,
+ "learning_rate": 4.3717171717171715e-06,
+ "loss": 1.8567254543304443,
+ "mean_token_accuracy": 0.5847581624984741,
+ "num_tokens": 5111808.0,
+ "step": 312
+ },
+ {
+ "entropy": 1.4578243494033813,
+ "epoch": 0.6323232323232323,
+ "grad_norm": 1.9577823877334595,
+ "learning_rate": 4.36969696969697e-06,
+ "loss": 1.4758052825927734,
+ "mean_token_accuracy": 0.6590742468833923,
+ "num_tokens": 5128192.0,
+ "step": 313
+ },
+ {
+ "entropy": 1.8680084943771362,
+ "epoch": 0.6343434343434343,
+ "grad_norm": 2.170994520187378,
+ "learning_rate": 4.367676767676768e-06,
+ "loss": 1.904400110244751,
+ "mean_token_accuracy": 0.5857962965965271,
+ "num_tokens": 5144576.0,
+ "step": 314
+ },
+ {
+ "entropy": 1.6488304138183594,
+ "epoch": 0.6363636363636364,
+ "grad_norm": 1.959490418434143,
+ "learning_rate": 4.365656565656566e-06,
+ "loss": 1.6570477485656738,
+ "mean_token_accuracy": 0.6257327795028687,
+ "num_tokens": 5160960.0,
+ "step": 315
+ },
+ {
+ "entropy": 1.5038025379180908,
+ "epoch": 0.6383838383838384,
+ "grad_norm": 2.072697401046753,
+ "learning_rate": 4.363636363636364e-06,
+ "loss": 1.5234860181808472,
+ "mean_token_accuracy": 0.6494259834289551,
+ "num_tokens": 5177344.0,
+ "step": 316
+ },
+ {
+ "entropy": 1.4154654741287231,
+ "epoch": 0.6404040404040404,
+ "grad_norm": 1.894587755203247,
+ "learning_rate": 4.361616161616162e-06,
+ "loss": 1.4131592512130737,
+ "mean_token_accuracy": 0.6667073965072632,
+ "num_tokens": 5193728.0,
+ "step": 317
+ },
+ {
+ "entropy": 1.5813250541687012,
+ "epoch": 0.6424242424242425,
+ "grad_norm": 2.4088737964630127,
+ "learning_rate": 4.35959595959596e-06,
+ "loss": 1.6236622333526611,
+ "mean_token_accuracy": 0.6313507556915283,
+ "num_tokens": 5210112.0,
+ "step": 318
+ },
+ {
+ "entropy": 1.4140045642852783,
+ "epoch": 0.6444444444444445,
+ "grad_norm": 1.991557240486145,
+ "learning_rate": 4.3575757575757576e-06,
+ "loss": 1.4242517948150635,
+ "mean_token_accuracy": 0.6569980382919312,
+ "num_tokens": 5226496.0,
+ "step": 319
+ },
+ {
+ "entropy": 1.615628957748413,
+ "epoch": 0.6464646464646465,
+ "grad_norm": 1.8819077014923096,
+ "learning_rate": 4.3555555555555555e-06,
+ "loss": 1.6331532001495361,
+ "mean_token_accuracy": 0.6299462914466858,
+ "num_tokens": 5242880.0,
+ "step": 320
+ },
+ {
+ "entropy": 1.3118394613265991,
+ "epoch": 0.6484848484848484,
+ "grad_norm": 2.0589284896850586,
+ "learning_rate": 4.353535353535353e-06,
+ "loss": 1.2880034446716309,
+ "mean_token_accuracy": 0.6842941045761108,
+ "num_tokens": 5259264.0,
+ "step": 321
+ },
+ {
+ "entropy": 1.2786612510681152,
+ "epoch": 0.6505050505050505,
+ "grad_norm": 2.033839225769043,
+ "learning_rate": 4.351515151515152e-06,
+ "loss": 1.2829055786132812,
+ "mean_token_accuracy": 0.6910112500190735,
+ "num_tokens": 5275648.0,
+ "step": 322
+ },
+ {
+ "entropy": 1.5632988214492798,
+ "epoch": 0.6525252525252525,
+ "grad_norm": 2.1970419883728027,
+ "learning_rate": 4.34949494949495e-06,
+ "loss": 1.5865097045898438,
+ "mean_token_accuracy": 0.642892062664032,
+ "num_tokens": 5292032.0,
+ "step": 323
+ },
+ {
+ "entropy": 1.1542725563049316,
+ "epoch": 0.6545454545454545,
+ "grad_norm": 1.9750654697418213,
+ "learning_rate": 4.347474747474748e-06,
+ "loss": 1.1401035785675049,
+ "mean_token_accuracy": 0.7061553597450256,
+ "num_tokens": 5308416.0,
+ "step": 324
+ },
+ {
+ "entropy": 1.6879942417144775,
+ "epoch": 0.6565656565656566,
+ "grad_norm": 2.0022354125976562,
+ "learning_rate": 4.345454545454546e-06,
+ "loss": 1.70950448513031,
+ "mean_token_accuracy": 0.6089398860931396,
+ "num_tokens": 5324800.0,
+ "step": 325
+ },
+ {
+ "entropy": 1.7589699029922485,
+ "epoch": 0.6585858585858586,
+ "grad_norm": 1.925520420074463,
+ "learning_rate": 4.343434343434344e-06,
+ "loss": 1.7749860286712646,
+ "mean_token_accuracy": 0.6015510559082031,
+ "num_tokens": 5341184.0,
+ "step": 326
+ },
+ {
+ "entropy": 1.4720325469970703,
+ "epoch": 0.6606060606060606,
+ "grad_norm": 1.9487124681472778,
+ "learning_rate": 4.341414141414142e-06,
+ "loss": 1.4983797073364258,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 5357568.0,
+ "step": 327
+ },
+ {
+ "entropy": 1.676164150238037,
+ "epoch": 0.6626262626262627,
+ "grad_norm": 2.13053035736084,
+ "learning_rate": 4.33939393939394e-06,
+ "loss": 1.699425458908081,
+ "mean_token_accuracy": 0.6100390553474426,
+ "num_tokens": 5373952.0,
+ "step": 328
+ },
+ {
+ "entropy": 1.3424437046051025,
+ "epoch": 0.6646464646464646,
+ "grad_norm": 2.0245954990386963,
+ "learning_rate": 4.337373737373738e-06,
+ "loss": 1.3393046855926514,
+ "mean_token_accuracy": 0.677760124206543,
+ "num_tokens": 5390336.0,
+ "step": 329
+ },
+ {
+ "entropy": 1.4926583766937256,
+ "epoch": 0.6666666666666666,
+ "grad_norm": 1.893343448638916,
+ "learning_rate": 4.335353535353536e-06,
+ "loss": 1.4779269695281982,
+ "mean_token_accuracy": 0.6713483333587646,
+ "num_tokens": 5406720.0,
+ "step": 330
+ },
+ {
+ "entropy": 1.5753449201583862,
+ "epoch": 0.6686868686868687,
+ "grad_norm": 2.051647424697876,
+ "learning_rate": 4.333333333333334e-06,
+ "loss": 1.622597336769104,
+ "mean_token_accuracy": 0.6436248421669006,
+ "num_tokens": 5423104.0,
+ "step": 331
+ },
+ {
+ "entropy": 1.4573988914489746,
+ "epoch": 0.6707070707070707,
+ "grad_norm": 1.8709567785263062,
+ "learning_rate": 4.331313131313132e-06,
+ "loss": 1.4902422428131104,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 5439488.0,
+ "step": 332
+ },
+ {
+ "entropy": 1.378867745399475,
+ "epoch": 0.6727272727272727,
+ "grad_norm": 2.235928773880005,
+ "learning_rate": 4.32929292929293e-06,
+ "loss": 1.4067103862762451,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 5455872.0,
+ "step": 333
+ },
+ {
+ "entropy": 1.7553350925445557,
+ "epoch": 0.6747474747474748,
+ "grad_norm": 2.0335066318511963,
+ "learning_rate": 4.327272727272728e-06,
+ "loss": 1.772943139076233,
+ "mean_token_accuracy": 0.5953834652900696,
+ "num_tokens": 5472256.0,
+ "step": 334
+ },
+ {
+ "entropy": 1.1587097644805908,
+ "epoch": 0.6767676767676768,
+ "grad_norm": 1.8764615058898926,
+ "learning_rate": 4.3252525252525255e-06,
+ "loss": 1.1396210193634033,
+ "mean_token_accuracy": 0.7197117805480957,
+ "num_tokens": 5488640.0,
+ "step": 335
+ },
+ {
+ "entropy": 1.4819872379302979,
+ "epoch": 0.6787878787878788,
+ "grad_norm": 2.0907511711120605,
+ "learning_rate": 4.323232323232323e-06,
+ "loss": 1.460550308227539,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 5505024.0,
+ "step": 336
+ },
+ {
+ "entropy": 1.0744472742080688,
+ "epoch": 0.6808080808080809,
+ "grad_norm": 2.227606773376465,
+ "learning_rate": 4.321212121212121e-06,
+ "loss": 1.0909301042556763,
+ "mean_token_accuracy": 0.7258182764053345,
+ "num_tokens": 5521408.0,
+ "step": 337
+ },
+ {
+ "entropy": 1.507999300956726,
+ "epoch": 0.6828282828282828,
+ "grad_norm": 2.0332415103912354,
+ "learning_rate": 4.31919191919192e-06,
+ "loss": 1.5173046588897705,
+ "mean_token_accuracy": 0.6374572515487671,
+ "num_tokens": 5537792.0,
+ "step": 338
+ },
+ {
+ "entropy": 1.6792720556259155,
+ "epoch": 0.6848484848484848,
+ "grad_norm": 2.0194997787475586,
+ "learning_rate": 4.317171717171718e-06,
+ "loss": 1.679445743560791,
+ "mean_token_accuracy": 0.6138250827789307,
+ "num_tokens": 5554176.0,
+ "step": 339
+ },
+ {
+ "entropy": 1.6470589637756348,
+ "epoch": 0.6868686868686869,
+ "grad_norm": 2.09116268157959,
+ "learning_rate": 4.315151515151516e-06,
+ "loss": 1.6386632919311523,
+ "mean_token_accuracy": 0.6146799921989441,
+ "num_tokens": 5570560.0,
+ "step": 340
+ },
+ {
+ "entropy": 1.3612488508224487,
+ "epoch": 0.6888888888888889,
+ "grad_norm": 2.1586217880249023,
+ "learning_rate": 4.313131313131314e-06,
+ "loss": 1.3698725700378418,
+ "mean_token_accuracy": 0.6696995496749878,
+ "num_tokens": 5586944.0,
+ "step": 341
+ },
+ {
+ "entropy": 1.400327205657959,
+ "epoch": 0.6909090909090909,
+ "grad_norm": 2.082094192504883,
+ "learning_rate": 4.3111111111111115e-06,
+ "loss": 1.396535873413086,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 5603328.0,
+ "step": 342
+ },
+ {
+ "entropy": 1.389290690422058,
+ "epoch": 0.692929292929293,
+ "grad_norm": 2.0780303478240967,
+ "learning_rate": 4.309090909090909e-06,
+ "loss": 1.4275782108306885,
+ "mean_token_accuracy": 0.6656082272529602,
+ "num_tokens": 5619712.0,
+ "step": 343
+ },
+ {
+ "entropy": 1.5133870840072632,
+ "epoch": 0.694949494949495,
+ "grad_norm": 1.9819531440734863,
+ "learning_rate": 4.307070707070707e-06,
+ "loss": 1.5309596061706543,
+ "mean_token_accuracy": 0.6373351216316223,
+ "num_tokens": 5636096.0,
+ "step": 344
+ },
+ {
+ "entropy": 1.483219861984253,
+ "epoch": 0.696969696969697,
+ "grad_norm": 1.9794325828552246,
+ "learning_rate": 4.305050505050505e-06,
+ "loss": 1.4693087339401245,
+ "mean_token_accuracy": 0.6550439596176147,
+ "num_tokens": 5652480.0,
+ "step": 345
+ },
+ {
+ "entropy": 1.381489634513855,
+ "epoch": 0.6989898989898989,
+ "grad_norm": 2.0637686252593994,
+ "learning_rate": 4.303030303030303e-06,
+ "loss": 1.3862476348876953,
+ "mean_token_accuracy": 0.6631045341491699,
+ "num_tokens": 5668864.0,
+ "step": 346
+ },
+ {
+ "entropy": 1.9860024452209473,
+ "epoch": 0.701010101010101,
+ "grad_norm": 2.1626803874969482,
+ "learning_rate": 4.301010101010101e-06,
+ "loss": 1.9815950393676758,
+ "mean_token_accuracy": 0.5698583126068115,
+ "num_tokens": 5685248.0,
+ "step": 347
+ },
+ {
+ "entropy": 1.5044004917144775,
+ "epoch": 0.703030303030303,
+ "grad_norm": 2.060976266860962,
+ "learning_rate": 4.298989898989899e-06,
+ "loss": 1.4937127828598022,
+ "mean_token_accuracy": 0.6524792313575745,
+ "num_tokens": 5701632.0,
+ "step": 348
+ },
+ {
+ "entropy": 1.3397772312164307,
+ "epoch": 0.705050505050505,
+ "grad_norm": 2.0162901878356934,
+ "learning_rate": 4.296969696969698e-06,
+ "loss": 1.3358572721481323,
+ "mean_token_accuracy": 0.6949804425239563,
+ "num_tokens": 5718016.0,
+ "step": 349
+ },
+ {
+ "entropy": 1.145772099494934,
+ "epoch": 0.7070707070707071,
+ "grad_norm": 2.097634792327881,
+ "learning_rate": 4.2949494949494955e-06,
+ "loss": 1.1833416223526,
+ "mean_token_accuracy": 0.7104909420013428,
+ "num_tokens": 5734400.0,
+ "step": 350
+ },
+ {
+ "epoch": 0.7070707070707071,
+ "eval_entropy": 1.5476290602837839,
+ "eval_loss": 1.5603480339050293,
+ "eval_mean_token_accuracy": 0.640111118555069,
+ "eval_num_tokens": 5734400.0,
+ "eval_runtime": 43.7844,
+ "eval_samples_per_second": 22.611,
+ "eval_steps_per_second": 2.832,
+ "step": 350
+ },
+ {
+ "entropy": 1.4311926364898682,
+ "epoch": 0.7090909090909091,
+ "grad_norm": 2.002321720123291,
+ "learning_rate": 4.292929292929293e-06,
+ "loss": 1.4534825086593628,
+ "mean_token_accuracy": 0.6614558100700378,
+ "num_tokens": 5750784.0,
+ "step": 351
+ },
+ {
+ "entropy": 1.3983922004699707,
+ "epoch": 0.7111111111111111,
+ "grad_norm": 2.1724867820739746,
+ "learning_rate": 4.290909090909091e-06,
+ "loss": 1.3969402313232422,
+ "mean_token_accuracy": 0.6652418375015259,
+ "num_tokens": 5767168.0,
+ "step": 352
+ },
+ {
+ "entropy": 1.8218920230865479,
+ "epoch": 0.7131313131313132,
+ "grad_norm": 2.1629281044006348,
+ "learning_rate": 4.288888888888889e-06,
+ "loss": 1.8196980953216553,
+ "mean_token_accuracy": 0.6027112603187561,
+ "num_tokens": 5783552.0,
+ "step": 353
+ },
+ {
+ "entropy": 1.5322320461273193,
+ "epoch": 0.7151515151515152,
+ "grad_norm": 1.8486647605895996,
+ "learning_rate": 4.286868686868687e-06,
+ "loss": 1.5504610538482666,
+ "mean_token_accuracy": 0.6533341407775879,
+ "num_tokens": 5799936.0,
+ "step": 354
+ },
+ {
+ "entropy": 1.935966968536377,
+ "epoch": 0.7171717171717171,
+ "grad_norm": 2.252814292907715,
+ "learning_rate": 4.284848484848485e-06,
+ "loss": 1.9300384521484375,
+ "mean_token_accuracy": 0.5656448602676392,
+ "num_tokens": 5816320.0,
+ "step": 355
+ },
+ {
+ "entropy": 1.6711398363113403,
+ "epoch": 0.7191919191919192,
+ "grad_norm": 2.023379325866699,
+ "learning_rate": 4.282828282828283e-06,
+ "loss": 1.6584455966949463,
+ "mean_token_accuracy": 0.6235954761505127,
+ "num_tokens": 5832704.0,
+ "step": 356
+ },
+ {
+ "entropy": 1.3922803401947021,
+ "epoch": 0.7212121212121212,
+ "grad_norm": 2.0487611293792725,
+ "learning_rate": 4.280808080808081e-06,
+ "loss": 1.4220250844955444,
+ "mean_token_accuracy": 0.6591963768005371,
+ "num_tokens": 5849088.0,
+ "step": 357
+ },
+ {
+ "entropy": 1.59521484375,
+ "epoch": 0.7232323232323232,
+ "grad_norm": 1.8598614931106567,
+ "learning_rate": 4.278787878787879e-06,
+ "loss": 1.5979329347610474,
+ "mean_token_accuracy": 0.6237176060676575,
+ "num_tokens": 5865472.0,
+ "step": 358
+ },
+ {
+ "entropy": 1.5810115337371826,
+ "epoch": 0.7252525252525253,
+ "grad_norm": 2.140115737915039,
+ "learning_rate": 4.276767676767677e-06,
+ "loss": 1.5774705410003662,
+ "mean_token_accuracy": 0.6274425983428955,
+ "num_tokens": 5881856.0,
+ "step": 359
+ },
+ {
+ "entropy": 1.5839109420776367,
+ "epoch": 0.7272727272727273,
+ "grad_norm": 2.0947749614715576,
+ "learning_rate": 4.274747474747475e-06,
+ "loss": 1.601511001586914,
+ "mean_token_accuracy": 0.630984365940094,
+ "num_tokens": 5898240.0,
+ "step": 360
+ },
+ {
+ "entropy": 1.195770263671875,
+ "epoch": 0.7292929292929293,
+ "grad_norm": 1.8740363121032715,
+ "learning_rate": 4.272727272727273e-06,
+ "loss": 1.195652961730957,
+ "mean_token_accuracy": 0.7077430486679077,
+ "num_tokens": 5914624.0,
+ "step": 361
+ },
+ {
+ "entropy": 1.375698208808899,
+ "epoch": 0.7313131313131314,
+ "grad_norm": 1.9580703973770142,
+ "learning_rate": 4.270707070707071e-06,
+ "loss": 1.3746864795684814,
+ "mean_token_accuracy": 0.6775158643722534,
+ "num_tokens": 5931008.0,
+ "step": 362
+ },
+ {
+ "entropy": 1.7259451150894165,
+ "epoch": 0.7333333333333333,
+ "grad_norm": 2.3127365112304688,
+ "learning_rate": 4.268686868686869e-06,
+ "loss": 1.745998501777649,
+ "mean_token_accuracy": 0.6040546894073486,
+ "num_tokens": 5947392.0,
+ "step": 363
+ },
+ {
+ "entropy": 1.209228754043579,
+ "epoch": 0.7353535353535353,
+ "grad_norm": 1.9004793167114258,
+ "learning_rate": 4.266666666666668e-06,
+ "loss": 1.232427716255188,
+ "mean_token_accuracy": 0.6925989389419556,
+ "num_tokens": 5963776.0,
+ "step": 364
+ },
+ {
+ "entropy": 1.2811263799667358,
+ "epoch": 0.7373737373737373,
+ "grad_norm": 1.9568246603012085,
+ "learning_rate": 4.2646464646464655e-06,
+ "loss": 1.291853427886963,
+ "mean_token_accuracy": 0.6884465217590332,
+ "num_tokens": 5980160.0,
+ "step": 365
+ },
+ {
+ "entropy": 1.843044638633728,
+ "epoch": 0.7393939393939394,
+ "grad_norm": 2.132735252380371,
+ "learning_rate": 4.262626262626263e-06,
+ "loss": 1.8818857669830322,
+ "mean_token_accuracy": 0.5785295367240906,
+ "num_tokens": 5996544.0,
+ "step": 366
+ },
+ {
+ "entropy": 1.3353440761566162,
+ "epoch": 0.7414141414141414,
+ "grad_norm": 1.8893013000488281,
+ "learning_rate": 4.260606060606061e-06,
+ "loss": 1.354011058807373,
+ "mean_token_accuracy": 0.6797752976417542,
+ "num_tokens": 6012928.0,
+ "step": 367
+ },
+ {
+ "entropy": 1.3889728784561157,
+ "epoch": 0.7434343434343434,
+ "grad_norm": 1.980757236480713,
+ "learning_rate": 4.258585858585859e-06,
+ "loss": 1.3671875,
+ "mean_token_accuracy": 0.6627381443977356,
+ "num_tokens": 6029312.0,
+ "step": 368
+ },
+ {
+ "entropy": 1.4605348110198975,
+ "epoch": 0.7454545454545455,
+ "grad_norm": 2.1033780574798584,
+ "learning_rate": 4.256565656565657e-06,
+ "loss": 1.455024003982544,
+ "mean_token_accuracy": 0.6451514363288879,
+ "num_tokens": 6045696.0,
+ "step": 369
+ },
+ {
+ "entropy": 1.4382058382034302,
+ "epoch": 0.7474747474747475,
+ "grad_norm": 2.1068074703216553,
+ "learning_rate": 4.254545454545455e-06,
+ "loss": 1.4422768354415894,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 6062080.0,
+ "step": 370
+ },
+ {
+ "entropy": 1.8046759366989136,
+ "epoch": 0.7494949494949495,
+ "grad_norm": 2.214466094970703,
+ "learning_rate": 4.252525252525253e-06,
+ "loss": 1.8247106075286865,
+ "mean_token_accuracy": 0.6003297567367554,
+ "num_tokens": 6078464.0,
+ "step": 371
+ },
+ {
+ "entropy": 1.671690583229065,
+ "epoch": 0.7515151515151515,
+ "grad_norm": 1.9790785312652588,
+ "learning_rate": 4.250505050505051e-06,
+ "loss": 1.6907753944396973,
+ "mean_token_accuracy": 0.6232290863990784,
+ "num_tokens": 6094848.0,
+ "step": 372
+ },
+ {
+ "entropy": 1.6881897449493408,
+ "epoch": 0.7535353535353535,
+ "grad_norm": 1.8638463020324707,
+ "learning_rate": 4.248484848484849e-06,
+ "loss": 1.7132716178894043,
+ "mean_token_accuracy": 0.6357474327087402,
+ "num_tokens": 6111232.0,
+ "step": 373
+ },
+ {
+ "entropy": 1.2555122375488281,
+ "epoch": 0.7555555555555555,
+ "grad_norm": 2.082378387451172,
+ "learning_rate": 4.246464646464647e-06,
+ "loss": 1.240688681602478,
+ "mean_token_accuracy": 0.6965070962905884,
+ "num_tokens": 6127616.0,
+ "step": 374
+ },
+ {
+ "entropy": 1.847135305404663,
+ "epoch": 0.7575757575757576,
+ "grad_norm": 2.142962694168091,
+ "learning_rate": 4.244444444444445e-06,
+ "loss": 1.8840911388397217,
+ "mean_token_accuracy": 0.5822545289993286,
+ "num_tokens": 6144000.0,
+ "step": 375
+ },
+ {
+ "entropy": 1.239328384399414,
+ "epoch": 0.7595959595959596,
+ "grad_norm": 2.0589468479156494,
+ "learning_rate": 4.242424242424243e-06,
+ "loss": 1.256324052810669,
+ "mean_token_accuracy": 0.6845383644104004,
+ "num_tokens": 6160384.0,
+ "step": 376
+ },
+ {
+ "entropy": 1.5047202110290527,
+ "epoch": 0.7616161616161616,
+ "grad_norm": 1.7951308488845825,
+ "learning_rate": 4.240404040404041e-06,
+ "loss": 1.5063304901123047,
+ "mean_token_accuracy": 0.6583414673805237,
+ "num_tokens": 6176768.0,
+ "step": 377
+ },
+ {
+ "entropy": 1.4072566032409668,
+ "epoch": 0.7636363636363637,
+ "grad_norm": 2.1670594215393066,
+ "learning_rate": 4.238383838383839e-06,
+ "loss": 1.4205389022827148,
+ "mean_token_accuracy": 0.658707857131958,
+ "num_tokens": 6193152.0,
+ "step": 378
+ },
+ {
+ "entropy": 1.3207885026931763,
+ "epoch": 0.7656565656565657,
+ "grad_norm": 1.9017083644866943,
+ "learning_rate": 4.236363636363637e-06,
+ "loss": 1.3169896602630615,
+ "mean_token_accuracy": 0.6954079270362854,
+ "num_tokens": 6209536.0,
+ "step": 379
+ },
+ {
+ "entropy": 1.4762436151504517,
+ "epoch": 0.7676767676767676,
+ "grad_norm": 2.0023069381713867,
+ "learning_rate": 4.234343434343435e-06,
+ "loss": 1.4725041389465332,
+ "mean_token_accuracy": 0.6620053648948669,
+ "num_tokens": 6225920.0,
+ "step": 380
+ },
+ {
+ "entropy": 1.4895304441452026,
+ "epoch": 0.7696969696969697,
+ "grad_norm": 1.9528017044067383,
+ "learning_rate": 4.2323232323232325e-06,
+ "loss": 1.49650239944458,
+ "mean_token_accuracy": 0.6508915424346924,
+ "num_tokens": 6242304.0,
+ "step": 381
+ },
+ {
+ "entropy": 1.3024516105651855,
+ "epoch": 0.7717171717171717,
+ "grad_norm": 1.9855588674545288,
+ "learning_rate": 4.2303030303030304e-06,
+ "loss": 1.34218168258667,
+ "mean_token_accuracy": 0.6838055849075317,
+ "num_tokens": 6258688.0,
+ "step": 382
+ },
+ {
+ "entropy": 1.6005626916885376,
+ "epoch": 0.7737373737373737,
+ "grad_norm": 2.028286933898926,
+ "learning_rate": 4.228282828282828e-06,
+ "loss": 1.6299283504486084,
+ "mean_token_accuracy": 0.6315950155258179,
+ "num_tokens": 6275072.0,
+ "step": 383
+ },
+ {
+ "entropy": 1.7050484418869019,
+ "epoch": 0.7757575757575758,
+ "grad_norm": 2.474047899246216,
+ "learning_rate": 4.226262626262626e-06,
+ "loss": 1.777151346206665,
+ "mean_token_accuracy": 0.5919027924537659,
+ "num_tokens": 6291456.0,
+ "step": 384
+ },
+ {
+ "entropy": 1.5014543533325195,
+ "epoch": 0.7777777777777778,
+ "grad_norm": 1.9866594076156616,
+ "learning_rate": 4.224242424242425e-06,
+ "loss": 1.5308949947357178,
+ "mean_token_accuracy": 0.639106035232544,
+ "num_tokens": 6307840.0,
+ "step": 385
+ },
+ {
+ "entropy": 1.6957359313964844,
+ "epoch": 0.7797979797979798,
+ "grad_norm": 2.229820966720581,
+ "learning_rate": 4.222222222222223e-06,
+ "loss": 1.728761911392212,
+ "mean_token_accuracy": 0.6242061257362366,
+ "num_tokens": 6324224.0,
+ "step": 386
+ },
+ {
+ "entropy": 1.6823521852493286,
+ "epoch": 0.7818181818181819,
+ "grad_norm": 2.033383369445801,
+ "learning_rate": 4.220202020202021e-06,
+ "loss": 1.7310154438018799,
+ "mean_token_accuracy": 0.6257938742637634,
+ "num_tokens": 6340608.0,
+ "step": 387
+ },
+ {
+ "entropy": 1.710307240486145,
+ "epoch": 0.7838383838383839,
+ "grad_norm": 2.061861038208008,
+ "learning_rate": 4.218181818181819e-06,
+ "loss": 1.7066943645477295,
+ "mean_token_accuracy": 0.6123595237731934,
+ "num_tokens": 6356992.0,
+ "step": 388
+ },
+ {
+ "entropy": 1.241638422012329,
+ "epoch": 0.7858585858585858,
+ "grad_norm": 1.9743852615356445,
+ "learning_rate": 4.2161616161616165e-06,
+ "loss": 1.2520272731781006,
+ "mean_token_accuracy": 0.692415714263916,
+ "num_tokens": 6373376.0,
+ "step": 389
+ },
+ {
+ "entropy": 1.5918776988983154,
+ "epoch": 0.7878787878787878,
+ "grad_norm": 2.156675100326538,
+ "learning_rate": 4.214141414141414e-06,
+ "loss": 1.6060255765914917,
+ "mean_token_accuracy": 0.6178553700447083,
+ "num_tokens": 6389760.0,
+ "step": 390
+ },
+ {
+ "entropy": 1.7307862043380737,
+ "epoch": 0.7898989898989899,
+ "grad_norm": 2.171247959136963,
+ "learning_rate": 4.212121212121212e-06,
+ "loss": 1.7327581644058228,
+ "mean_token_accuracy": 0.6502808928489685,
+ "num_tokens": 6406144.0,
+ "step": 391
+ },
+ {
+ "entropy": 1.6725553274154663,
+ "epoch": 0.7919191919191919,
+ "grad_norm": 2.020228624343872,
+ "learning_rate": 4.21010101010101e-06,
+ "loss": 1.6803646087646484,
+ "mean_token_accuracy": 0.6383732557296753,
+ "num_tokens": 6422528.0,
+ "step": 392
+ },
+ {
+ "entropy": 1.4120928049087524,
+ "epoch": 0.793939393939394,
+ "grad_norm": 1.9896639585494995,
+ "learning_rate": 4.208080808080808e-06,
+ "loss": 1.3974279165267944,
+ "mean_token_accuracy": 0.6661577820777893,
+ "num_tokens": 6438912.0,
+ "step": 393
+ },
+ {
+ "entropy": 0.933545708656311,
+ "epoch": 0.795959595959596,
+ "grad_norm": 1.6884223222732544,
+ "learning_rate": 4.206060606060606e-06,
+ "loss": 0.9287986755371094,
+ "mean_token_accuracy": 0.7636175155639648,
+ "num_tokens": 6455296.0,
+ "step": 394
+ },
+ {
+ "entropy": 1.419004201889038,
+ "epoch": 0.797979797979798,
+ "grad_norm": 2.2590551376342773,
+ "learning_rate": 4.204040404040405e-06,
+ "loss": 1.4652538299560547,
+ "mean_token_accuracy": 0.6589521169662476,
+ "num_tokens": 6471680.0,
+ "step": 395
+ },
+ {
+ "entropy": 1.750221610069275,
+ "epoch": 0.8,
+ "grad_norm": 2.195030450820923,
+ "learning_rate": 4.2020202020202026e-06,
+ "loss": 1.7328863143920898,
+ "mean_token_accuracy": 0.6008182764053345,
+ "num_tokens": 6488064.0,
+ "step": 396
+ },
+ {
+ "entropy": 1.7440015077590942,
+ "epoch": 0.802020202020202,
+ "grad_norm": 1.9833927154541016,
+ "learning_rate": 4.2000000000000004e-06,
+ "loss": 1.7617835998535156,
+ "mean_token_accuracy": 0.5992916226387024,
+ "num_tokens": 6504448.0,
+ "step": 397
+ },
+ {
+ "entropy": 1.1636452674865723,
+ "epoch": 0.804040404040404,
+ "grad_norm": 1.9506802558898926,
+ "learning_rate": 4.197979797979798e-06,
+ "loss": 1.1344032287597656,
+ "mean_token_accuracy": 0.7122618556022644,
+ "num_tokens": 6520832.0,
+ "step": 398
+ },
+ {
+ "entropy": 1.6173542737960815,
+ "epoch": 0.806060606060606,
+ "grad_norm": 2.0997231006622314,
+ "learning_rate": 4.195959595959596e-06,
+ "loss": 1.6303956508636475,
+ "mean_token_accuracy": 0.6215192675590515,
+ "num_tokens": 6537216.0,
+ "step": 399
+ },
+ {
+ "entropy": 1.4391542673110962,
+ "epoch": 0.8080808080808081,
+ "grad_norm": 2.356828212738037,
+ "learning_rate": 4.193939393939394e-06,
+ "loss": 1.4465923309326172,
+ "mean_token_accuracy": 0.6594406366348267,
+ "num_tokens": 6553600.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.8080808080808081,
+ "eval_entropy": 1.5504949785047961,
+ "eval_loss": 1.5544542074203491,
+ "eval_mean_token_accuracy": 0.6409837569921247,
+ "eval_num_tokens": 6553600.0,
+ "eval_runtime": 43.7986,
+ "eval_samples_per_second": 22.603,
+ "eval_steps_per_second": 2.831,
+ "step": 400
+ },
+ {
+ "entropy": 1.60548996925354,
+ "epoch": 0.8101010101010101,
+ "grad_norm": 2.1894404888153076,
+ "learning_rate": 4.191919191919192e-06,
+ "loss": 1.6116085052490234,
+ "mean_token_accuracy": 0.6276868581771851,
+ "num_tokens": 6569984.0,
+ "step": 401
+ },
+ {
+ "entropy": 1.436041235923767,
+ "epoch": 0.8121212121212121,
+ "grad_norm": 2.1180264949798584,
+ "learning_rate": 4.18989898989899e-06,
+ "loss": 1.4203698635101318,
+ "mean_token_accuracy": 0.6554714441299438,
+ "num_tokens": 6586368.0,
+ "step": 402
+ },
+ {
+ "entropy": 1.1348106861114502,
+ "epoch": 0.8141414141414142,
+ "grad_norm": 2.0420851707458496,
+ "learning_rate": 4.187878787878788e-06,
+ "loss": 1.1424527168273926,
+ "mean_token_accuracy": 0.7154372334480286,
+ "num_tokens": 6602752.0,
+ "step": 403
+ },
+ {
+ "entropy": 1.4039727449417114,
+ "epoch": 0.8161616161616162,
+ "grad_norm": 2.148340940475464,
+ "learning_rate": 4.185858585858586e-06,
+ "loss": 1.4246132373809814,
+ "mean_token_accuracy": 0.6723864078521729,
+ "num_tokens": 6619136.0,
+ "step": 404
+ },
+ {
+ "entropy": 1.4222626686096191,
+ "epoch": 0.8181818181818182,
+ "grad_norm": 1.9436827898025513,
+ "learning_rate": 4.1838383838383835e-06,
+ "loss": 1.4235990047454834,
+ "mean_token_accuracy": 0.6759281754493713,
+ "num_tokens": 6635520.0,
+ "step": 405
+ },
+ {
+ "entropy": 1.4771310091018677,
+ "epoch": 0.8202020202020202,
+ "grad_norm": 2.0953726768493652,
+ "learning_rate": 4.181818181818182e-06,
+ "loss": 1.501934289932251,
+ "mean_token_accuracy": 0.6535173654556274,
+ "num_tokens": 6651904.0,
+ "step": 406
+ },
+ {
+ "entropy": 1.526256799697876,
+ "epoch": 0.8222222222222222,
+ "grad_norm": 2.245994806289673,
+ "learning_rate": 4.17979797979798e-06,
+ "loss": 1.539383888244629,
+ "mean_token_accuracy": 0.6417317986488342,
+ "num_tokens": 6668288.0,
+ "step": 407
+ },
+ {
+ "entropy": 1.1716097593307495,
+ "epoch": 0.8242424242424242,
+ "grad_norm": 1.8283652067184448,
+ "learning_rate": 4.177777777777778e-06,
+ "loss": 1.1798359155654907,
+ "mean_token_accuracy": 0.7123839855194092,
+ "num_tokens": 6684672.0,
+ "step": 408
+ },
+ {
+ "entropy": 1.4581540822982788,
+ "epoch": 0.8262626262626263,
+ "grad_norm": 1.9325168132781982,
+ "learning_rate": 4.175757575757576e-06,
+ "loss": 1.4526585340499878,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 6701056.0,
+ "step": 409
+ },
+ {
+ "entropy": 1.4073102474212646,
+ "epoch": 0.8282828282828283,
+ "grad_norm": 2.1543467044830322,
+ "learning_rate": 4.173737373737375e-06,
+ "loss": 1.437713861465454,
+ "mean_token_accuracy": 0.6725696325302124,
+ "num_tokens": 6717440.0,
+ "step": 410
+ },
+ {
+ "entropy": 1.5970062017440796,
+ "epoch": 0.8303030303030303,
+ "grad_norm": 2.1714792251586914,
+ "learning_rate": 4.1717171717171726e-06,
+ "loss": 1.613295078277588,
+ "mean_token_accuracy": 0.6229848265647888,
+ "num_tokens": 6733824.0,
+ "step": 411
+ },
+ {
+ "entropy": 1.449837327003479,
+ "epoch": 0.8323232323232324,
+ "grad_norm": 2.2499871253967285,
+ "learning_rate": 4.1696969696969705e-06,
+ "loss": 1.489758014678955,
+ "mean_token_accuracy": 0.645639955997467,
+ "num_tokens": 6750208.0,
+ "step": 412
+ },
+ {
+ "entropy": 1.7696173191070557,
+ "epoch": 0.8343434343434344,
+ "grad_norm": 2.3637073040008545,
+ "learning_rate": 4.167676767676768e-06,
+ "loss": 1.8147599697113037,
+ "mean_token_accuracy": 0.5821323990821838,
+ "num_tokens": 6766592.0,
+ "step": 413
+ },
+ {
+ "entropy": 1.99376380443573,
+ "epoch": 0.8363636363636363,
+ "grad_norm": 2.265683174133301,
+ "learning_rate": 4.165656565656566e-06,
+ "loss": 2.009024143218994,
+ "mean_token_accuracy": 0.5591108798980713,
+ "num_tokens": 6782976.0,
+ "step": 414
+ },
+ {
+ "entropy": 1.7276980876922607,
+ "epoch": 0.8383838383838383,
+ "grad_norm": 1.9407477378845215,
+ "learning_rate": 4.163636363636364e-06,
+ "loss": 1.7130229473114014,
+ "mean_token_accuracy": 0.6202979683876038,
+ "num_tokens": 6799360.0,
+ "step": 415
+ },
+ {
+ "entropy": 1.5418223142623901,
+ "epoch": 0.8404040404040404,
+ "grad_norm": 1.9765743017196655,
+ "learning_rate": 4.161616161616162e-06,
+ "loss": 1.5627632141113281,
+ "mean_token_accuracy": 0.6433194875717163,
+ "num_tokens": 6815744.0,
+ "step": 416
+ },
+ {
+ "entropy": 1.6040345430374146,
+ "epoch": 0.8424242424242424,
+ "grad_norm": 2.1942877769470215,
+ "learning_rate": 4.15959595959596e-06,
+ "loss": 1.6044622659683228,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 6832128.0,
+ "step": 417
+ },
+ {
+ "entropy": 1.8461577892303467,
+ "epoch": 0.8444444444444444,
+ "grad_norm": 2.289196729660034,
+ "learning_rate": 4.157575757575758e-06,
+ "loss": 1.8679372072219849,
+ "mean_token_accuracy": 0.5887884497642517,
+ "num_tokens": 6848512.0,
+ "step": 418
+ },
+ {
+ "entropy": 1.4079350233078003,
+ "epoch": 0.8464646464646465,
+ "grad_norm": 1.9526047706604004,
+ "learning_rate": 4.155555555555556e-06,
+ "loss": 1.4145114421844482,
+ "mean_token_accuracy": 0.6731802821159363,
+ "num_tokens": 6864896.0,
+ "step": 419
+ },
+ {
+ "entropy": 1.1973973512649536,
+ "epoch": 0.8484848484848485,
+ "grad_norm": 2.0716679096221924,
+ "learning_rate": 4.1535353535353536e-06,
+ "loss": 1.260810136795044,
+ "mean_token_accuracy": 0.701697587966919,
+ "num_tokens": 6881280.0,
+ "step": 420
+ },
+ {
+ "entropy": 1.507702350616455,
+ "epoch": 0.8505050505050505,
+ "grad_norm": 2.0233314037323,
+ "learning_rate": 4.151515151515152e-06,
+ "loss": 1.513720154762268,
+ "mean_token_accuracy": 0.6497313380241394,
+ "num_tokens": 6897664.0,
+ "step": 421
+ },
+ {
+ "entropy": 1.54402756690979,
+ "epoch": 0.8525252525252526,
+ "grad_norm": 2.23366379737854,
+ "learning_rate": 4.14949494949495e-06,
+ "loss": 1.5434964895248413,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 6914048.0,
+ "step": 422
+ },
+ {
+ "entropy": 1.820296049118042,
+ "epoch": 0.8545454545454545,
+ "grad_norm": 2.066905975341797,
+ "learning_rate": 4.147474747474748e-06,
+ "loss": 1.8356924057006836,
+ "mean_token_accuracy": 0.5886663198471069,
+ "num_tokens": 6930432.0,
+ "step": 423
+ },
+ {
+ "entropy": 1.4747720956802368,
+ "epoch": 0.8565656565656565,
+ "grad_norm": 2.040022850036621,
+ "learning_rate": 4.145454545454546e-06,
+ "loss": 1.4495999813079834,
+ "mean_token_accuracy": 0.6532731056213379,
+ "num_tokens": 6946816.0,
+ "step": 424
+ },
+ {
+ "entropy": 1.7536696195602417,
+ "epoch": 0.8585858585858586,
+ "grad_norm": 2.0884320735931396,
+ "learning_rate": 4.143434343434344e-06,
+ "loss": 1.7520158290863037,
+ "mean_token_accuracy": 0.6083903312683105,
+ "num_tokens": 6963200.0,
+ "step": 425
+ },
+ {
+ "entropy": 1.715582251548767,
+ "epoch": 0.8606060606060606,
+ "grad_norm": 2.2991514205932617,
+ "learning_rate": 4.141414141414142e-06,
+ "loss": 1.7138090133666992,
+ "mean_token_accuracy": 0.607107937335968,
+ "num_tokens": 6979584.0,
+ "step": 426
+ },
+ {
+ "entropy": 1.8116382360458374,
+ "epoch": 0.8626262626262626,
+ "grad_norm": 2.289909839630127,
+ "learning_rate": 4.13939393939394e-06,
+ "loss": 1.7755894660949707,
+ "mean_token_accuracy": 0.5776746273040771,
+ "num_tokens": 6995968.0,
+ "step": 427
+ },
+ {
+ "entropy": 1.487213373184204,
+ "epoch": 0.8646464646464647,
+ "grad_norm": 1.8834803104400635,
+ "learning_rate": 4.1373737373737375e-06,
+ "loss": 1.511157751083374,
+ "mean_token_accuracy": 0.6546165347099304,
+ "num_tokens": 7012352.0,
+ "step": 428
+ },
+ {
+ "entropy": 1.2769891023635864,
+ "epoch": 0.8666666666666667,
+ "grad_norm": 1.892616629600525,
+ "learning_rate": 4.135353535353535e-06,
+ "loss": 1.2772598266601562,
+ "mean_token_accuracy": 0.6984611749649048,
+ "num_tokens": 7028736.0,
+ "step": 429
+ },
+ {
+ "entropy": 1.579519271850586,
+ "epoch": 0.8686868686868687,
+ "grad_norm": 1.9801563024520874,
+ "learning_rate": 4.133333333333333e-06,
+ "loss": 1.5647528171539307,
+ "mean_token_accuracy": 0.6482046842575073,
+ "num_tokens": 7045120.0,
+ "step": 430
+ },
+ {
+ "entropy": 1.407600998878479,
+ "epoch": 0.8707070707070707,
+ "grad_norm": 2.1737446784973145,
+ "learning_rate": 4.131313131313132e-06,
+ "loss": 1.4184494018554688,
+ "mean_token_accuracy": 0.6640815734863281,
+ "num_tokens": 7061504.0,
+ "step": 431
+ },
+ {
+ "entropy": 1.9118441343307495,
+ "epoch": 0.8727272727272727,
+ "grad_norm": 1.9541205167770386,
+ "learning_rate": 4.12929292929293e-06,
+ "loss": 1.9581422805786133,
+ "mean_token_accuracy": 0.564667820930481,
+ "num_tokens": 7077888.0,
+ "step": 432
+ },
+ {
+ "entropy": 1.925604224205017,
+ "epoch": 0.8747474747474747,
+ "grad_norm": 1.9696223735809326,
+ "learning_rate": 4.127272727272728e-06,
+ "loss": 1.9226163625717163,
+ "mean_token_accuracy": 0.5870786309242249,
+ "num_tokens": 7094272.0,
+ "step": 433
+ },
+ {
+ "entropy": 1.3994735479354858,
+ "epoch": 0.8767676767676768,
+ "grad_norm": 2.003532886505127,
+ "learning_rate": 4.125252525252526e-06,
+ "loss": 1.4291752576828003,
+ "mean_token_accuracy": 0.669516384601593,
+ "num_tokens": 7110656.0,
+ "step": 434
+ },
+ {
+ "entropy": 1.5550929307937622,
+ "epoch": 0.8787878787878788,
+ "grad_norm": 2.2658586502075195,
+ "learning_rate": 4.1232323232323236e-06,
+ "loss": 1.5533335208892822,
+ "mean_token_accuracy": 0.6242672204971313,
+ "num_tokens": 7127040.0,
+ "step": 435
+ },
+ {
+ "entropy": 1.6622785329818726,
+ "epoch": 0.8808080808080808,
+ "grad_norm": 2.0748393535614014,
+ "learning_rate": 4.1212121212121215e-06,
+ "loss": 1.700000524520874,
+ "mean_token_accuracy": 0.6221299171447754,
+ "num_tokens": 7143424.0,
+ "step": 436
+ },
+ {
+ "entropy": 1.1223996877670288,
+ "epoch": 0.8828282828282829,
+ "grad_norm": 2.0348756313323975,
+ "learning_rate": 4.119191919191919e-06,
+ "loss": 1.143293857574463,
+ "mean_token_accuracy": 0.7045676708221436,
+ "num_tokens": 7159808.0,
+ "step": 437
+ },
+ {
+ "entropy": 1.7156380414962769,
+ "epoch": 0.8848484848484849,
+ "grad_norm": 2.306549549102783,
+ "learning_rate": 4.117171717171717e-06,
+ "loss": 1.7625794410705566,
+ "mean_token_accuracy": 0.6049706935882568,
+ "num_tokens": 7176192.0,
+ "step": 438
+ },
+ {
+ "entropy": 1.8507202863693237,
+ "epoch": 0.8868686868686869,
+ "grad_norm": 2.2955853939056396,
+ "learning_rate": 4.115151515151515e-06,
+ "loss": 1.8923052549362183,
+ "mean_token_accuracy": 0.5938568711280823,
+ "num_tokens": 7192576.0,
+ "step": 439
+ },
+ {
+ "entropy": 1.813754916191101,
+ "epoch": 0.8888888888888888,
+ "grad_norm": 2.095700263977051,
+ "learning_rate": 4.113131313131313e-06,
+ "loss": 1.8375307321548462,
+ "mean_token_accuracy": 0.5848192572593689,
+ "num_tokens": 7208960.0,
+ "step": 440
+ },
+ {
+ "entropy": 1.4185007810592651,
+ "epoch": 0.8909090909090909,
+ "grad_norm": 2.118213176727295,
+ "learning_rate": 4.111111111111111e-06,
+ "loss": 1.4548171758651733,
+ "mean_token_accuracy": 0.657608687877655,
+ "num_tokens": 7225344.0,
+ "step": 441
+ },
+ {
+ "entropy": 1.1041690111160278,
+ "epoch": 0.8929292929292929,
+ "grad_norm": 1.9638988971710205,
+ "learning_rate": 4.10909090909091e-06,
+ "loss": 1.1232322454452515,
+ "mean_token_accuracy": 0.7068881392478943,
+ "num_tokens": 7241728.0,
+ "step": 442
+ },
+ {
+ "entropy": 1.6423180103302002,
+ "epoch": 0.8949494949494949,
+ "grad_norm": 2.32987117767334,
+ "learning_rate": 4.1070707070707075e-06,
+ "loss": 1.665462613105774,
+ "mean_token_accuracy": 0.6133365631103516,
+ "num_tokens": 7258112.0,
+ "step": 443
+ },
+ {
+ "entropy": 1.4778310060501099,
+ "epoch": 0.896969696969697,
+ "grad_norm": 2.1247661113739014,
+ "learning_rate": 4.105050505050505e-06,
+ "loss": 1.4554922580718994,
+ "mean_token_accuracy": 0.6474108695983887,
+ "num_tokens": 7274496.0,
+ "step": 444
+ },
+ {
+ "entropy": 1.3777755498886108,
+ "epoch": 0.898989898989899,
+ "grad_norm": 1.9243263006210327,
+ "learning_rate": 4.103030303030303e-06,
+ "loss": 1.3942883014678955,
+ "mean_token_accuracy": 0.6656692624092102,
+ "num_tokens": 7290880.0,
+ "step": 445
+ },
+ {
+ "entropy": 1.1036415100097656,
+ "epoch": 0.901010101010101,
+ "grad_norm": 1.9711178541183472,
+ "learning_rate": 4.101010101010101e-06,
+ "loss": 1.1070351600646973,
+ "mean_token_accuracy": 0.7213605046272278,
+ "num_tokens": 7307264.0,
+ "step": 446
+ },
+ {
+ "entropy": 1.695487380027771,
+ "epoch": 0.9030303030303031,
+ "grad_norm": 2.1113150119781494,
+ "learning_rate": 4.098989898989899e-06,
+ "loss": 1.6993653774261475,
+ "mean_token_accuracy": 0.5992305874824524,
+ "num_tokens": 7323648.0,
+ "step": 447
+ },
+ {
+ "entropy": 1.496254801750183,
+ "epoch": 0.9050505050505051,
+ "grad_norm": 2.072986602783203,
+ "learning_rate": 4.096969696969697e-06,
+ "loss": 1.5046567916870117,
+ "mean_token_accuracy": 0.6558378338813782,
+ "num_tokens": 7340032.0,
+ "step": 448
+ },
+ {
+ "entropy": 2.1845033168792725,
+ "epoch": 0.907070707070707,
+ "grad_norm": 2.3246262073516846,
+ "learning_rate": 4.094949494949495e-06,
+ "loss": 2.1508708000183105,
+ "mean_token_accuracy": 0.5376160144805908,
+ "num_tokens": 7356416.0,
+ "step": 449
+ },
+ {
+ "entropy": 1.6329164505004883,
+ "epoch": 0.9090909090909091,
+ "grad_norm": 1.997310757637024,
+ "learning_rate": 4.092929292929294e-06,
+ "loss": 1.6422264575958252,
+ "mean_token_accuracy": 0.6232290863990784,
+ "num_tokens": 7372800.0,
+ "step": 450
+ },
+ {
+ "epoch": 0.9090909090909091,
+ "eval_entropy": 1.5515337480652718,
+ "eval_loss": 1.5485161542892456,
+ "eval_mean_token_accuracy": 0.6417716929028111,
+ "eval_num_tokens": 7372800.0,
+ "eval_runtime": 43.7901,
+ "eval_samples_per_second": 22.608,
+ "eval_steps_per_second": 2.832,
+ "step": 450
+ },
+ {
+ "entropy": 1.7854291200637817,
+ "epoch": 0.9111111111111111,
+ "grad_norm": 2.0212173461914062,
+ "learning_rate": 4.0909090909090915e-06,
+ "loss": 1.7920666933059692,
+ "mean_token_accuracy": 0.5950170755386353,
+ "num_tokens": 7389184.0,
+ "step": 451
+ },
+ {
+ "entropy": 1.216304898262024,
+ "epoch": 0.9131313131313131,
+ "grad_norm": 1.8800705671310425,
+ "learning_rate": 4.088888888888889e-06,
+ "loss": 1.2014267444610596,
+ "mean_token_accuracy": 0.7076819539070129,
+ "num_tokens": 7405568.0,
+ "step": 452
+ },
+ {
+ "entropy": 1.5593703985214233,
+ "epoch": 0.9151515151515152,
+ "grad_norm": 2.101381301879883,
+ "learning_rate": 4.086868686868687e-06,
+ "loss": 1.559610366821289,
+ "mean_token_accuracy": 0.6337933540344238,
+ "num_tokens": 7421952.0,
+ "step": 453
+ },
+ {
+ "entropy": 1.4199841022491455,
+ "epoch": 0.9171717171717172,
+ "grad_norm": 2.0038692951202393,
+ "learning_rate": 4.084848484848485e-06,
+ "loss": 1.4040653705596924,
+ "mean_token_accuracy": 0.660845160484314,
+ "num_tokens": 7438336.0,
+ "step": 454
+ },
+ {
+ "entropy": 1.2010453939437866,
+ "epoch": 0.9191919191919192,
+ "grad_norm": 2.004110336303711,
+ "learning_rate": 4.082828282828283e-06,
+ "loss": 1.194115400314331,
+ "mean_token_accuracy": 0.6955910921096802,
+ "num_tokens": 7454720.0,
+ "step": 455
+ },
+ {
+ "entropy": 1.2295804023742676,
+ "epoch": 0.9212121212121213,
+ "grad_norm": 2.130387544631958,
+ "learning_rate": 4.080808080808081e-06,
+ "loss": 1.2125787734985352,
+ "mean_token_accuracy": 0.6993771195411682,
+ "num_tokens": 7471104.0,
+ "step": 456
+ },
+ {
+ "entropy": 1.3706485033035278,
+ "epoch": 0.9232323232323232,
+ "grad_norm": 2.1667706966400146,
+ "learning_rate": 4.07878787878788e-06,
+ "loss": 1.3886957168579102,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 7487488.0,
+ "step": 457
+ },
+ {
+ "entropy": 1.714059591293335,
+ "epoch": 0.9252525252525252,
+ "grad_norm": 2.0084264278411865,
+ "learning_rate": 4.0767676767676775e-06,
+ "loss": 1.724153757095337,
+ "mean_token_accuracy": 0.602161705493927,
+ "num_tokens": 7503872.0,
+ "step": 458
+ },
+ {
+ "entropy": 1.3170617818832397,
+ "epoch": 0.9272727272727272,
+ "grad_norm": 1.9923994541168213,
+ "learning_rate": 4.0747474747474754e-06,
+ "loss": 1.3518096208572388,
+ "mean_token_accuracy": 0.6801416873931885,
+ "num_tokens": 7520256.0,
+ "step": 459
+ },
+ {
+ "entropy": 1.7946380376815796,
+ "epoch": 0.9292929292929293,
+ "grad_norm": 2.3475260734558105,
+ "learning_rate": 4.072727272727273e-06,
+ "loss": 1.824514389038086,
+ "mean_token_accuracy": 0.6005740165710449,
+ "num_tokens": 7536640.0,
+ "step": 460
+ },
+ {
+ "entropy": 1.3695449829101562,
+ "epoch": 0.9313131313131313,
+ "grad_norm": 2.0983943939208984,
+ "learning_rate": 4.070707070707071e-06,
+ "loss": 1.3934273719787598,
+ "mean_token_accuracy": 0.6723253726959229,
+ "num_tokens": 7553024.0,
+ "step": 461
+ },
+ {
+ "entropy": 1.5890663862228394,
+ "epoch": 0.9333333333333333,
+ "grad_norm": 2.1465413570404053,
+ "learning_rate": 4.068686868686869e-06,
+ "loss": 1.611652135848999,
+ "mean_token_accuracy": 0.6408158540725708,
+ "num_tokens": 7569408.0,
+ "step": 462
+ },
+ {
+ "entropy": 1.2593727111816406,
+ "epoch": 0.9353535353535354,
+ "grad_norm": 1.7885241508483887,
+ "learning_rate": 4.066666666666667e-06,
+ "loss": 1.2781705856323242,
+ "mean_token_accuracy": 0.6946751475334167,
+ "num_tokens": 7585792.0,
+ "step": 463
+ },
+ {
+ "entropy": 1.5680429935455322,
+ "epoch": 0.9373737373737374,
+ "grad_norm": 2.1466636657714844,
+ "learning_rate": 4.064646464646465e-06,
+ "loss": 1.60218346118927,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 7602176.0,
+ "step": 464
+ },
+ {
+ "entropy": 1.681670069694519,
+ "epoch": 0.9393939393939394,
+ "grad_norm": 2.2211875915527344,
+ "learning_rate": 4.062626262626263e-06,
+ "loss": 1.6819908618927002,
+ "mean_token_accuracy": 0.6177943348884583,
+ "num_tokens": 7618560.0,
+ "step": 465
+ },
+ {
+ "entropy": 1.2239924669265747,
+ "epoch": 0.9414141414141414,
+ "grad_norm": 1.9997022151947021,
+ "learning_rate": 4.060606060606061e-06,
+ "loss": 1.2383348941802979,
+ "mean_token_accuracy": 0.6922325491905212,
+ "num_tokens": 7634944.0,
+ "step": 466
+ },
+ {
+ "entropy": 1.291772723197937,
+ "epoch": 0.9434343434343434,
+ "grad_norm": 2.0868117809295654,
+ "learning_rate": 4.058585858585859e-06,
+ "loss": 1.2879221439361572,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 7651328.0,
+ "step": 467
+ },
+ {
+ "entropy": 1.2860186100006104,
+ "epoch": 0.9454545454545454,
+ "grad_norm": 1.8586393594741821,
+ "learning_rate": 4.056565656565657e-06,
+ "loss": 1.2820203304290771,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 7667712.0,
+ "step": 468
+ },
+ {
+ "entropy": 1.860795259475708,
+ "epoch": 0.9474747474747475,
+ "grad_norm": 2.364405393600464,
+ "learning_rate": 4.054545454545455e-06,
+ "loss": 1.8880727291107178,
+ "mean_token_accuracy": 0.5821323990821838,
+ "num_tokens": 7684096.0,
+ "step": 469
+ },
+ {
+ "entropy": 1.6017589569091797,
+ "epoch": 0.9494949494949495,
+ "grad_norm": 2.023054599761963,
+ "learning_rate": 4.052525252525253e-06,
+ "loss": 1.5993852615356445,
+ "mean_token_accuracy": 0.6366634368896484,
+ "num_tokens": 7700480.0,
+ "step": 470
+ },
+ {
+ "entropy": 1.8498003482818604,
+ "epoch": 0.9515151515151515,
+ "grad_norm": 2.4474003314971924,
+ "learning_rate": 4.050505050505051e-06,
+ "loss": 1.868700623512268,
+ "mean_token_accuracy": 0.5826209187507629,
+ "num_tokens": 7716864.0,
+ "step": 471
+ },
+ {
+ "entropy": 1.5625540018081665,
+ "epoch": 0.9535353535353536,
+ "grad_norm": 2.1018362045288086,
+ "learning_rate": 4.048484848484849e-06,
+ "loss": 1.571077585220337,
+ "mean_token_accuracy": 0.6433805823326111,
+ "num_tokens": 7733248.0,
+ "step": 472
+ },
+ {
+ "entropy": 1.8534579277038574,
+ "epoch": 0.9555555555555556,
+ "grad_norm": 2.407588243484497,
+ "learning_rate": 4.046464646464647e-06,
+ "loss": 1.8789153099060059,
+ "mean_token_accuracy": 0.5859794616699219,
+ "num_tokens": 7749632.0,
+ "step": 473
+ },
+ {
+ "entropy": 1.3264559507369995,
+ "epoch": 0.9575757575757575,
+ "grad_norm": 2.007199764251709,
+ "learning_rate": 4.044444444444445e-06,
+ "loss": 1.3489338159561157,
+ "mean_token_accuracy": 0.6650586128234863,
+ "num_tokens": 7766016.0,
+ "step": 474
+ },
+ {
+ "entropy": 1.1361761093139648,
+ "epoch": 0.9595959595959596,
+ "grad_norm": 1.9226998090744019,
+ "learning_rate": 4.0424242424242425e-06,
+ "loss": 1.156738519668579,
+ "mean_token_accuracy": 0.7226428985595703,
+ "num_tokens": 7782400.0,
+ "step": 475
+ },
+ {
+ "entropy": 1.550872802734375,
+ "epoch": 0.9616161616161616,
+ "grad_norm": 2.0082473754882812,
+ "learning_rate": 4.04040404040404e-06,
+ "loss": 1.5657379627227783,
+ "mean_token_accuracy": 0.642953097820282,
+ "num_tokens": 7798784.0,
+ "step": 476
+ },
+ {
+ "entropy": 1.0122721195220947,
+ "epoch": 0.9636363636363636,
+ "grad_norm": 1.9946776628494263,
+ "learning_rate": 4.038383838383838e-06,
+ "loss": 1.0301119089126587,
+ "mean_token_accuracy": 0.7361993193626404,
+ "num_tokens": 7815168.0,
+ "step": 477
+ },
+ {
+ "entropy": 1.61614990234375,
+ "epoch": 0.9656565656565657,
+ "grad_norm": 2.5009427070617676,
+ "learning_rate": 4.036363636363637e-06,
+ "loss": 1.6194994449615479,
+ "mean_token_accuracy": 0.620175838470459,
+ "num_tokens": 7831552.0,
+ "step": 478
+ },
+ {
+ "entropy": 1.5723443031311035,
+ "epoch": 0.9676767676767677,
+ "grad_norm": 1.9101917743682861,
+ "learning_rate": 4.034343434343435e-06,
+ "loss": 1.5586073398590088,
+ "mean_token_accuracy": 0.6223741769790649,
+ "num_tokens": 7847936.0,
+ "step": 479
+ },
+ {
+ "entropy": 1.271834373474121,
+ "epoch": 0.9696969696969697,
+ "grad_norm": 1.768438458442688,
+ "learning_rate": 4.032323232323233e-06,
+ "loss": 1.2466087341308594,
+ "mean_token_accuracy": 0.692354679107666,
+ "num_tokens": 7864320.0,
+ "step": 480
+ },
+ {
+ "entropy": 1.4550020694732666,
+ "epoch": 0.9717171717171718,
+ "grad_norm": 1.9753917455673218,
+ "learning_rate": 4.030303030303031e-06,
+ "loss": 1.4689980745315552,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 7880704.0,
+ "step": 481
+ },
+ {
+ "entropy": 2.023750066757202,
+ "epoch": 0.9737373737373738,
+ "grad_norm": 2.3014674186706543,
+ "learning_rate": 4.0282828282828285e-06,
+ "loss": 2.0601019859313965,
+ "mean_token_accuracy": 0.5528212189674377,
+ "num_tokens": 7897088.0,
+ "step": 482
+ },
+ {
+ "entropy": 1.3225218057632446,
+ "epoch": 0.9757575757575757,
+ "grad_norm": 1.9937688112258911,
+ "learning_rate": 4.0262626262626264e-06,
+ "loss": 1.3186583518981934,
+ "mean_token_accuracy": 0.6751343607902527,
+ "num_tokens": 7913472.0,
+ "step": 483
+ },
+ {
+ "entropy": 1.4357911348342896,
+ "epoch": 0.9777777777777777,
+ "grad_norm": 1.9591492414474487,
+ "learning_rate": 4.024242424242424e-06,
+ "loss": 1.4157384634017944,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 7929856.0,
+ "step": 484
+ },
+ {
+ "entropy": 1.470274567604065,
+ "epoch": 0.9797979797979798,
+ "grad_norm": 1.9318779706954956,
+ "learning_rate": 4.022222222222222e-06,
+ "loss": 1.4754853248596191,
+ "mean_token_accuracy": 0.6497923731803894,
+ "num_tokens": 7946240.0,
+ "step": 485
+ },
+ {
+ "entropy": 1.345750331878662,
+ "epoch": 0.9818181818181818,
+ "grad_norm": 1.9079619646072388,
+ "learning_rate": 4.02020202020202e-06,
+ "loss": 1.336526870727539,
+ "mean_token_accuracy": 0.6800805926322937,
+ "num_tokens": 7962624.0,
+ "step": 486
+ },
+ {
+ "entropy": 1.4641839265823364,
+ "epoch": 0.9838383838383838,
+ "grad_norm": 1.8413265943527222,
+ "learning_rate": 4.018181818181818e-06,
+ "loss": 1.4556326866149902,
+ "mean_token_accuracy": 0.6591963768005371,
+ "num_tokens": 7979008.0,
+ "step": 487
+ },
+ {
+ "entropy": 1.7966911792755127,
+ "epoch": 0.9858585858585859,
+ "grad_norm": 2.138899564743042,
+ "learning_rate": 4.016161616161616e-06,
+ "loss": 1.822898507118225,
+ "mean_token_accuracy": 0.5959941148757935,
+ "num_tokens": 7995392.0,
+ "step": 488
+ },
+ {
+ "entropy": 1.4334503412246704,
+ "epoch": 0.9878787878787879,
+ "grad_norm": 2.206122636795044,
+ "learning_rate": 4.014141414141415e-06,
+ "loss": 1.4127681255340576,
+ "mean_token_accuracy": 0.6609672904014587,
+ "num_tokens": 8011776.0,
+ "step": 489
+ },
+ {
+ "entropy": 1.684112548828125,
+ "epoch": 0.98989898989899,
+ "grad_norm": 2.0637400150299072,
+ "learning_rate": 4.0121212121212125e-06,
+ "loss": 1.6790317296981812,
+ "mean_token_accuracy": 0.6159012913703918,
+ "num_tokens": 8028160.0,
+ "step": 490
+ },
+ {
+ "entropy": 2.0716898441314697,
+ "epoch": 0.9919191919191919,
+ "grad_norm": 3.3912627696990967,
+ "learning_rate": 4.01010101010101e-06,
+ "loss": 2.0814826488494873,
+ "mean_token_accuracy": 0.5522105693817139,
+ "num_tokens": 8044544.0,
+ "step": 491
+ },
+ {
+ "entropy": 1.8764609098434448,
+ "epoch": 0.9939393939393939,
+ "grad_norm": 2.00569748878479,
+ "learning_rate": 4.008080808080808e-06,
+ "loss": 1.9150068759918213,
+ "mean_token_accuracy": 0.5823766589164734,
+ "num_tokens": 8060928.0,
+ "step": 492
+ },
+ {
+ "entropy": 1.630242943763733,
+ "epoch": 0.9959595959595959,
+ "grad_norm": 2.0648858547210693,
+ "learning_rate": 4.006060606060607e-06,
+ "loss": 1.6354784965515137,
+ "mean_token_accuracy": 0.621213972568512,
+ "num_tokens": 8077312.0,
+ "step": 493
+ },
+ {
+ "entropy": 1.7174078226089478,
+ "epoch": 0.997979797979798,
+ "grad_norm": 2.1376583576202393,
+ "learning_rate": 4.004040404040405e-06,
+ "loss": 1.7092773914337158,
+ "mean_token_accuracy": 0.6129701733589172,
+ "num_tokens": 8093696.0,
+ "step": 494
+ },
+ {
+ "entropy": 1.2112717628479004,
+ "epoch": 1.0,
+ "grad_norm": 1.9164371490478516,
+ "learning_rate": 4.002020202020203e-06,
+ "loss": 1.2106354236602783,
+ "mean_token_accuracy": 0.7040180563926697,
+ "num_tokens": 8110080.0,
+ "step": 495
+ },
+ {
+ "entropy": 1.2168891429901123,
+ "epoch": 1.002020202020202,
+ "grad_norm": 1.9845075607299805,
+ "learning_rate": 4.000000000000001e-06,
+ "loss": 1.1398870944976807,
+ "mean_token_accuracy": 0.7053004503250122,
+ "num_tokens": 8126464.0,
+ "step": 496
+ },
+ {
+ "entropy": 1.4670923948287964,
+ "epoch": 1.004040404040404,
+ "grad_norm": 2.0864014625549316,
+ "learning_rate": 3.9979797979797986e-06,
+ "loss": 1.4241242408752441,
+ "mean_token_accuracy": 0.6605398058891296,
+ "num_tokens": 8142848.0,
+ "step": 497
+ },
+ {
+ "entropy": 1.560593843460083,
+ "epoch": 1.006060606060606,
+ "grad_norm": 1.8882137537002563,
+ "learning_rate": 3.9959595959595964e-06,
+ "loss": 1.5164835453033447,
+ "mean_token_accuracy": 0.6610894203186035,
+ "num_tokens": 8159232.0,
+ "step": 498
+ },
+ {
+ "entropy": 1.2573609352111816,
+ "epoch": 1.0080808080808081,
+ "grad_norm": 2.011486530303955,
+ "learning_rate": 3.993939393939394e-06,
+ "loss": 1.2119636535644531,
+ "mean_token_accuracy": 0.6832559704780579,
+ "num_tokens": 8175616.0,
+ "step": 499
+ },
+ {
+ "entropy": 1.6119122505187988,
+ "epoch": 1.0101010101010102,
+ "grad_norm": 2.0089032649993896,
+ "learning_rate": 3.991919191919192e-06,
+ "loss": 1.5869622230529785,
+ "mean_token_accuracy": 0.6301905512809753,
+ "num_tokens": 8192000.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.0101010101010102,
+ "eval_entropy": 1.4907484121860997,
+ "eval_loss": 1.5444872379302979,
+ "eval_mean_token_accuracy": 0.6426531960887294,
+ "eval_num_tokens": 8192000.0,
+ "eval_runtime": 43.729,
+ "eval_samples_per_second": 22.639,
+ "eval_steps_per_second": 2.836,
+ "step": 500
+ },
+ {
+ "entropy": 1.5645418167114258,
+ "epoch": 1.0121212121212122,
+ "grad_norm": 2.171133279800415,
+ "learning_rate": 3.98989898989899e-06,
+ "loss": 1.5252666473388672,
+ "mean_token_accuracy": 0.639594554901123,
+ "num_tokens": 8208384.0,
+ "step": 501
+ },
+ {
+ "entropy": 1.2985379695892334,
+ "epoch": 1.0141414141414142,
+ "grad_norm": 1.9075100421905518,
+ "learning_rate": 3.987878787878788e-06,
+ "loss": 1.2863168716430664,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 8224768.0,
+ "step": 502
+ },
+ {
+ "entropy": 1.4055086374282837,
+ "epoch": 1.0161616161616163,
+ "grad_norm": 1.8511557579040527,
+ "learning_rate": 3.985858585858587e-06,
+ "loss": 1.440205454826355,
+ "mean_token_accuracy": 0.6671348214149475,
+ "num_tokens": 8241152.0,
+ "step": 503
+ },
+ {
+ "entropy": 1.0818580389022827,
+ "epoch": 1.018181818181818,
+ "grad_norm": 1.8912067413330078,
+ "learning_rate": 3.983838383838385e-06,
+ "loss": 1.0614542961120605,
+ "mean_token_accuracy": 0.7345505356788635,
+ "num_tokens": 8257536.0,
+ "step": 504
+ },
+ {
+ "entropy": 0.9176992177963257,
+ "epoch": 1.02020202020202,
+ "grad_norm": 1.7737077474594116,
+ "learning_rate": 3.9818181818181825e-06,
+ "loss": 0.9281337261199951,
+ "mean_token_accuracy": 0.7594040036201477,
+ "num_tokens": 8273920.0,
+ "step": 505
+ },
+ {
+ "entropy": 1.8801840543746948,
+ "epoch": 1.0222222222222221,
+ "grad_norm": 2.191689968109131,
+ "learning_rate": 3.97979797979798e-06,
+ "loss": 1.9127342700958252,
+ "mean_token_accuracy": 0.5732169151306152,
+ "num_tokens": 8290304.0,
+ "step": 506
+ },
+ {
+ "entropy": 1.2336418628692627,
+ "epoch": 1.0242424242424242,
+ "grad_norm": 2.0369555950164795,
+ "learning_rate": 3.977777777777778e-06,
+ "loss": 1.2513363361358643,
+ "mean_token_accuracy": 0.6852100491523743,
+ "num_tokens": 8306688.0,
+ "step": 507
+ },
+ {
+ "entropy": 1.8379974365234375,
+ "epoch": 1.0262626262626262,
+ "grad_norm": 2.176361083984375,
+ "learning_rate": 3.975757575757576e-06,
+ "loss": 1.8472888469696045,
+ "mean_token_accuracy": 0.5863458514213562,
+ "num_tokens": 8323072.0,
+ "step": 508
+ },
+ {
+ "entropy": 1.4421337842941284,
+ "epoch": 1.0282828282828282,
+ "grad_norm": 2.305441379547119,
+ "learning_rate": 3.973737373737374e-06,
+ "loss": 1.4835591316223145,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 8339456.0,
+ "step": 509
+ },
+ {
+ "entropy": 1.535184621810913,
+ "epoch": 1.0303030303030303,
+ "grad_norm": 2.0329015254974365,
+ "learning_rate": 3.971717171717172e-06,
+ "loss": 1.547795057296753,
+ "mean_token_accuracy": 0.6268319487571716,
+ "num_tokens": 8355840.0,
+ "step": 510
+ },
+ {
+ "entropy": 1.295592188835144,
+ "epoch": 1.0323232323232323,
+ "grad_norm": 2.0321359634399414,
+ "learning_rate": 3.96969696969697e-06,
+ "loss": 1.2885974645614624,
+ "mean_token_accuracy": 0.681485116481781,
+ "num_tokens": 8372224.0,
+ "step": 511
+ },
+ {
+ "entropy": 1.345553994178772,
+ "epoch": 1.0343434343434343,
+ "grad_norm": 1.9151290655136108,
+ "learning_rate": 3.967676767676768e-06,
+ "loss": 1.3364320993423462,
+ "mean_token_accuracy": 0.6849657893180847,
+ "num_tokens": 8388608.0,
+ "step": 512
+ },
+ {
+ "entropy": 1.3150815963745117,
+ "epoch": 1.0363636363636364,
+ "grad_norm": 1.9379258155822754,
+ "learning_rate": 3.965656565656566e-06,
+ "loss": 1.317258596420288,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 8404992.0,
+ "step": 513
+ },
+ {
+ "entropy": 1.46832275390625,
+ "epoch": 1.0383838383838384,
+ "grad_norm": 2.1009161472320557,
+ "learning_rate": 3.963636363636364e-06,
+ "loss": 1.4794366359710693,
+ "mean_token_accuracy": 0.6513800621032715,
+ "num_tokens": 8421376.0,
+ "step": 514
+ },
+ {
+ "entropy": 1.389290452003479,
+ "epoch": 1.0404040404040404,
+ "grad_norm": 1.8813941478729248,
+ "learning_rate": 3.961616161616162e-06,
+ "loss": 1.3930776119232178,
+ "mean_token_accuracy": 0.6799584627151489,
+ "num_tokens": 8437760.0,
+ "step": 515
+ },
+ {
+ "entropy": 1.2919796705245972,
+ "epoch": 1.0424242424242425,
+ "grad_norm": 2.0765745639801025,
+ "learning_rate": 3.95959595959596e-06,
+ "loss": 1.2943801879882812,
+ "mean_token_accuracy": 0.6929653286933899,
+ "num_tokens": 8454144.0,
+ "step": 516
+ },
+ {
+ "entropy": 1.172440767288208,
+ "epoch": 1.0444444444444445,
+ "grad_norm": 2.126800298690796,
+ "learning_rate": 3.957575757575758e-06,
+ "loss": 1.1923961639404297,
+ "mean_token_accuracy": 0.7098192572593689,
+ "num_tokens": 8470528.0,
+ "step": 517
+ },
+ {
+ "entropy": 1.8239458799362183,
+ "epoch": 1.0464646464646465,
+ "grad_norm": 1.96744966506958,
+ "learning_rate": 3.955555555555556e-06,
+ "loss": 1.840916633605957,
+ "mean_token_accuracy": 0.6033830046653748,
+ "num_tokens": 8486912.0,
+ "step": 518
+ },
+ {
+ "entropy": 1.4117076396942139,
+ "epoch": 1.0484848484848486,
+ "grad_norm": 2.0560126304626465,
+ "learning_rate": 3.953535353535354e-06,
+ "loss": 1.421530842781067,
+ "mean_token_accuracy": 0.6581583023071289,
+ "num_tokens": 8503296.0,
+ "step": 519
+ },
+ {
+ "entropy": 1.7085175514221191,
+ "epoch": 1.0505050505050506,
+ "grad_norm": 2.1386539936065674,
+ "learning_rate": 3.951515151515152e-06,
+ "loss": 1.7334365844726562,
+ "mean_token_accuracy": 0.6282975077629089,
+ "num_tokens": 8519680.0,
+ "step": 520
+ },
+ {
+ "entropy": 1.0607928037643433,
+ "epoch": 1.0525252525252524,
+ "grad_norm": 1.981020212173462,
+ "learning_rate": 3.9494949494949496e-06,
+ "loss": 1.0639690160751343,
+ "mean_token_accuracy": 0.722337543964386,
+ "num_tokens": 8536064.0,
+ "step": 521
+ },
+ {
+ "entropy": 1.2227518558502197,
+ "epoch": 1.0545454545454545,
+ "grad_norm": 1.9116015434265137,
+ "learning_rate": 3.9474747474747474e-06,
+ "loss": 1.2139748334884644,
+ "mean_token_accuracy": 0.704384446144104,
+ "num_tokens": 8552448.0,
+ "step": 522
+ },
+ {
+ "entropy": 1.2655551433563232,
+ "epoch": 1.0565656565656565,
+ "grad_norm": 2.176706075668335,
+ "learning_rate": 3.945454545454545e-06,
+ "loss": 1.2869982719421387,
+ "mean_token_accuracy": 0.678798258304596,
+ "num_tokens": 8568832.0,
+ "step": 523
+ },
+ {
+ "entropy": 1.436476707458496,
+ "epoch": 1.0585858585858585,
+ "grad_norm": 2.034846544265747,
+ "learning_rate": 3.943434343434343e-06,
+ "loss": 1.431445837020874,
+ "mean_token_accuracy": 0.6650586128234863,
+ "num_tokens": 8585216.0,
+ "step": 524
+ },
+ {
+ "entropy": 1.4563549757003784,
+ "epoch": 1.0606060606060606,
+ "grad_norm": 2.0301241874694824,
+ "learning_rate": 3.941414141414142e-06,
+ "loss": 1.468353033065796,
+ "mean_token_accuracy": 0.6550439596176147,
+ "num_tokens": 8601600.0,
+ "step": 525
+ },
+ {
+ "entropy": 1.4636993408203125,
+ "epoch": 1.0626262626262626,
+ "grad_norm": 2.092679023742676,
+ "learning_rate": 3.93939393939394e-06,
+ "loss": 1.4488987922668457,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 8617984.0,
+ "step": 526
+ },
+ {
+ "entropy": 1.1217654943466187,
+ "epoch": 1.0646464646464646,
+ "grad_norm": 1.953627347946167,
+ "learning_rate": 3.937373737373738e-06,
+ "loss": 1.1403257846832275,
+ "mean_token_accuracy": 0.7172080874443054,
+ "num_tokens": 8634368.0,
+ "step": 527
+ },
+ {
+ "entropy": 1.7785910367965698,
+ "epoch": 1.0666666666666667,
+ "grad_norm": 1.8496789932250977,
+ "learning_rate": 3.935353535353536e-06,
+ "loss": 1.7961615324020386,
+ "mean_token_accuracy": 0.6036272644996643,
+ "num_tokens": 8650752.0,
+ "step": 528
+ },
+ {
+ "entropy": 1.0998575687408447,
+ "epoch": 1.0686868686868687,
+ "grad_norm": 1.8732962608337402,
+ "learning_rate": 3.9333333333333335e-06,
+ "loss": 1.0960031747817993,
+ "mean_token_accuracy": 0.7223986387252808,
+ "num_tokens": 8667136.0,
+ "step": 529
+ },
+ {
+ "entropy": 1.6707724332809448,
+ "epoch": 1.0707070707070707,
+ "grad_norm": 2.220453977584839,
+ "learning_rate": 3.931313131313131e-06,
+ "loss": 1.6837453842163086,
+ "mean_token_accuracy": 0.6148021221160889,
+ "num_tokens": 8683520.0,
+ "step": 530
+ },
+ {
+ "entropy": 1.6108022928237915,
+ "epoch": 1.0727272727272728,
+ "grad_norm": 2.2464118003845215,
+ "learning_rate": 3.929292929292929e-06,
+ "loss": 1.633517861366272,
+ "mean_token_accuracy": 0.6195651888847351,
+ "num_tokens": 8699904.0,
+ "step": 531
+ },
+ {
+ "entropy": 1.1888173818588257,
+ "epoch": 1.0747474747474748,
+ "grad_norm": 1.8803986310958862,
+ "learning_rate": 3.927272727272727e-06,
+ "loss": 1.1904420852661133,
+ "mean_token_accuracy": 0.7134220600128174,
+ "num_tokens": 8716288.0,
+ "step": 532
+ },
+ {
+ "entropy": 1.0656445026397705,
+ "epoch": 1.0767676767676768,
+ "grad_norm": 2.038243532180786,
+ "learning_rate": 3.925252525252525e-06,
+ "loss": 1.0505216121673584,
+ "mean_token_accuracy": 0.7284440398216248,
+ "num_tokens": 8732672.0,
+ "step": 533
+ },
+ {
+ "entropy": 1.1473655700683594,
+ "epoch": 1.0787878787878789,
+ "grad_norm": 1.981107234954834,
+ "learning_rate": 3.923232323232323e-06,
+ "loss": 1.136179804801941,
+ "mean_token_accuracy": 0.7085368633270264,
+ "num_tokens": 8749056.0,
+ "step": 534
+ },
+ {
+ "entropy": 1.340027928352356,
+ "epoch": 1.0808080808080809,
+ "grad_norm": 2.2797436714172363,
+ "learning_rate": 3.921212121212122e-06,
+ "loss": 1.334214210510254,
+ "mean_token_accuracy": 0.6749511361122131,
+ "num_tokens": 8765440.0,
+ "step": 535
+ },
+ {
+ "entropy": 1.1464864015579224,
+ "epoch": 1.082828282828283,
+ "grad_norm": 1.9428092241287231,
+ "learning_rate": 3.9191919191919196e-06,
+ "loss": 1.1649314165115356,
+ "mean_token_accuracy": 0.72013920545578,
+ "num_tokens": 8781824.0,
+ "step": 536
+ },
+ {
+ "entropy": 1.784925103187561,
+ "epoch": 1.084848484848485,
+ "grad_norm": 2.157468795776367,
+ "learning_rate": 3.9171717171717175e-06,
+ "loss": 1.7725508213043213,
+ "mean_token_accuracy": 0.6014899611473083,
+ "num_tokens": 8798208.0,
+ "step": 537
+ },
+ {
+ "entropy": 1.362166166305542,
+ "epoch": 1.0868686868686868,
+ "grad_norm": 2.109646797180176,
+ "learning_rate": 3.915151515151515e-06,
+ "loss": 1.331969976425171,
+ "mean_token_accuracy": 0.6720200181007385,
+ "num_tokens": 8814592.0,
+ "step": 538
+ },
+ {
+ "entropy": 1.5614176988601685,
+ "epoch": 1.0888888888888888,
+ "grad_norm": 2.1047098636627197,
+ "learning_rate": 3.913131313131314e-06,
+ "loss": 1.534292459487915,
+ "mean_token_accuracy": 0.6446629166603088,
+ "num_tokens": 8830976.0,
+ "step": 539
+ },
+ {
+ "entropy": 1.5551490783691406,
+ "epoch": 1.0909090909090908,
+ "grad_norm": 2.10304594039917,
+ "learning_rate": 3.911111111111112e-06,
+ "loss": 1.5706363916397095,
+ "mean_token_accuracy": 0.6322056651115417,
+ "num_tokens": 8847360.0,
+ "step": 540
+ },
+ {
+ "entropy": 1.7433172464370728,
+ "epoch": 1.0929292929292929,
+ "grad_norm": 1.8621257543563843,
+ "learning_rate": 3.90909090909091e-06,
+ "loss": 1.7367552518844604,
+ "mean_token_accuracy": 0.6162066459655762,
+ "num_tokens": 8863744.0,
+ "step": 541
+ },
+ {
+ "entropy": 1.4073128700256348,
+ "epoch": 1.094949494949495,
+ "grad_norm": 1.939588189125061,
+ "learning_rate": 3.907070707070708e-06,
+ "loss": 1.3844857215881348,
+ "mean_token_accuracy": 0.6634709239006042,
+ "num_tokens": 8880128.0,
+ "step": 542
+ },
+ {
+ "entropy": 1.479836344718933,
+ "epoch": 1.096969696969697,
+ "grad_norm": 2.06921648979187,
+ "learning_rate": 3.905050505050506e-06,
+ "loss": 1.4933744668960571,
+ "mean_token_accuracy": 0.6510136723518372,
+ "num_tokens": 8896512.0,
+ "step": 543
+ },
+ {
+ "entropy": 1.3934576511383057,
+ "epoch": 1.098989898989899,
+ "grad_norm": 2.0697920322418213,
+ "learning_rate": 3.9030303030303035e-06,
+ "loss": 1.3886666297912598,
+ "mean_token_accuracy": 0.6775158643722534,
+ "num_tokens": 8912896.0,
+ "step": 544
+ },
+ {
+ "entropy": 1.5223709344863892,
+ "epoch": 1.101010101010101,
+ "grad_norm": 2.1627066135406494,
+ "learning_rate": 3.901010101010101e-06,
+ "loss": 1.5601061582565308,
+ "mean_token_accuracy": 0.6392892003059387,
+ "num_tokens": 8929280.0,
+ "step": 545
+ },
+ {
+ "entropy": 1.4462933540344238,
+ "epoch": 1.103030303030303,
+ "grad_norm": 1.9871046543121338,
+ "learning_rate": 3.898989898989899e-06,
+ "loss": 1.463792085647583,
+ "mean_token_accuracy": 0.6518075466156006,
+ "num_tokens": 8945664.0,
+ "step": 546
+ },
+ {
+ "entropy": 1.325921654701233,
+ "epoch": 1.105050505050505,
+ "grad_norm": 1.9081087112426758,
+ "learning_rate": 3.896969696969697e-06,
+ "loss": 1.3303362131118774,
+ "mean_token_accuracy": 0.7009648084640503,
+ "num_tokens": 8962048.0,
+ "step": 547
+ },
+ {
+ "entropy": 1.415048360824585,
+ "epoch": 1.107070707070707,
+ "grad_norm": 2.3306756019592285,
+ "learning_rate": 3.894949494949495e-06,
+ "loss": 1.4139145612716675,
+ "mean_token_accuracy": 0.6849047541618347,
+ "num_tokens": 8978432.0,
+ "step": 548
+ },
+ {
+ "entropy": 1.5863295793533325,
+ "epoch": 1.1090909090909091,
+ "grad_norm": 1.993159294128418,
+ "learning_rate": 3.892929292929293e-06,
+ "loss": 1.6010534763336182,
+ "mean_token_accuracy": 0.6424035429954529,
+ "num_tokens": 8994816.0,
+ "step": 549
+ },
+ {
+ "entropy": 1.5526721477508545,
+ "epoch": 1.1111111111111112,
+ "grad_norm": 2.0528876781463623,
+ "learning_rate": 3.890909090909092e-06,
+ "loss": 1.5465538501739502,
+ "mean_token_accuracy": 0.659807026386261,
+ "num_tokens": 9011200.0,
+ "step": 550
+ },
+ {
+ "epoch": 1.1111111111111112,
+ "eval_entropy": 1.4479231247978825,
+ "eval_loss": 1.5459802150726318,
+ "eval_mean_token_accuracy": 0.6425906530311031,
+ "eval_num_tokens": 9011200.0,
+ "eval_runtime": 43.7828,
+ "eval_samples_per_second": 22.612,
+ "eval_steps_per_second": 2.832,
+ "step": 550
+ },
+ {
+ "entropy": 1.4322376251220703,
+ "epoch": 1.1131313131313132,
+ "grad_norm": 1.933549404144287,
+ "learning_rate": 3.88888888888889e-06,
+ "loss": 1.4371025562286377,
+ "mean_token_accuracy": 0.670676589012146,
+ "num_tokens": 9027584.0,
+ "step": 551
+ },
+ {
+ "entropy": 1.5050671100616455,
+ "epoch": 1.1151515151515152,
+ "grad_norm": 1.9736099243164062,
+ "learning_rate": 3.8868686868686875e-06,
+ "loss": 1.5362370014190674,
+ "mean_token_accuracy": 0.651624321937561,
+ "num_tokens": 9043968.0,
+ "step": 552
+ },
+ {
+ "entropy": 1.4335887432098389,
+ "epoch": 1.1171717171717173,
+ "grad_norm": 1.8896421194076538,
+ "learning_rate": 3.884848484848485e-06,
+ "loss": 1.4439888000488281,
+ "mean_token_accuracy": 0.670615553855896,
+ "num_tokens": 9060352.0,
+ "step": 553
+ },
+ {
+ "entropy": 1.5979355573654175,
+ "epoch": 1.1191919191919193,
+ "grad_norm": 2.1710526943206787,
+ "learning_rate": 3.882828282828283e-06,
+ "loss": 1.629098653793335,
+ "mean_token_accuracy": 0.6226184368133545,
+ "num_tokens": 9076736.0,
+ "step": 554
+ },
+ {
+ "entropy": 1.2901698350906372,
+ "epoch": 1.121212121212121,
+ "grad_norm": 2.129443407058716,
+ "learning_rate": 3.880808080808081e-06,
+ "loss": 1.2824913263320923,
+ "mean_token_accuracy": 0.6816682815551758,
+ "num_tokens": 9093120.0,
+ "step": 555
+ },
+ {
+ "entropy": 1.403212308883667,
+ "epoch": 1.1232323232323231,
+ "grad_norm": 1.883240818977356,
+ "learning_rate": 3.878787878787879e-06,
+ "loss": 1.3960213661193848,
+ "mean_token_accuracy": 0.6651197075843811,
+ "num_tokens": 9109504.0,
+ "step": 556
+ },
+ {
+ "entropy": 1.3959479331970215,
+ "epoch": 1.1252525252525252,
+ "grad_norm": 2.1145691871643066,
+ "learning_rate": 3.876767676767677e-06,
+ "loss": 1.4046590328216553,
+ "mean_token_accuracy": 0.6607230305671692,
+ "num_tokens": 9125888.0,
+ "step": 557
+ },
+ {
+ "entropy": 1.0899873971939087,
+ "epoch": 1.1272727272727272,
+ "grad_norm": 1.8862192630767822,
+ "learning_rate": 3.874747474747475e-06,
+ "loss": 1.0965509414672852,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 9142272.0,
+ "step": 558
+ },
+ {
+ "entropy": 1.0380184650421143,
+ "epoch": 1.1292929292929292,
+ "grad_norm": 1.946702241897583,
+ "learning_rate": 3.872727272727273e-06,
+ "loss": 1.0539875030517578,
+ "mean_token_accuracy": 0.7423058152198792,
+ "num_tokens": 9158656.0,
+ "step": 559
+ },
+ {
+ "entropy": 1.1173628568649292,
+ "epoch": 1.1313131313131313,
+ "grad_norm": 2.002847909927368,
+ "learning_rate": 3.8707070707070706e-06,
+ "loss": 1.128816843032837,
+ "mean_token_accuracy": 0.7112848162651062,
+ "num_tokens": 9175040.0,
+ "step": 560
+ },
+ {
+ "entropy": 1.6536206007003784,
+ "epoch": 1.1333333333333333,
+ "grad_norm": 2.212761640548706,
+ "learning_rate": 3.868686868686869e-06,
+ "loss": 1.6286437511444092,
+ "mean_token_accuracy": 0.6277479529380798,
+ "num_tokens": 9191424.0,
+ "step": 561
+ },
+ {
+ "entropy": 1.7187970876693726,
+ "epoch": 1.1353535353535353,
+ "grad_norm": 2.207310199737549,
+ "learning_rate": 3.866666666666667e-06,
+ "loss": 1.7072829008102417,
+ "mean_token_accuracy": 0.6180996298789978,
+ "num_tokens": 9207808.0,
+ "step": 562
+ },
+ {
+ "entropy": 1.7057682275772095,
+ "epoch": 1.1373737373737374,
+ "grad_norm": 2.1582961082458496,
+ "learning_rate": 3.864646464646465e-06,
+ "loss": 1.7216498851776123,
+ "mean_token_accuracy": 0.6105886697769165,
+ "num_tokens": 9224192.0,
+ "step": 563
+ },
+ {
+ "entropy": 1.8016951084136963,
+ "epoch": 1.1393939393939394,
+ "grad_norm": 2.035249948501587,
+ "learning_rate": 3.862626262626263e-06,
+ "loss": 1.8101240396499634,
+ "mean_token_accuracy": 0.6199315786361694,
+ "num_tokens": 9240576.0,
+ "step": 564
+ },
+ {
+ "entropy": 1.094889760017395,
+ "epoch": 1.1414141414141414,
+ "grad_norm": 2.119861364364624,
+ "learning_rate": 3.860606060606061e-06,
+ "loss": 1.0990344285964966,
+ "mean_token_accuracy": 0.7071323990821838,
+ "num_tokens": 9256960.0,
+ "step": 565
+ },
+ {
+ "entropy": 1.537480115890503,
+ "epoch": 1.1434343434343435,
+ "grad_norm": 2.167386770248413,
+ "learning_rate": 3.858585858585859e-06,
+ "loss": 1.5262541770935059,
+ "mean_token_accuracy": 0.6343429684638977,
+ "num_tokens": 9273344.0,
+ "step": 566
+ },
+ {
+ "entropy": 1.2940728664398193,
+ "epoch": 1.1454545454545455,
+ "grad_norm": 1.941097617149353,
+ "learning_rate": 3.856565656565657e-06,
+ "loss": 1.3145123720169067,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 9289728.0,
+ "step": 567
+ },
+ {
+ "entropy": 1.3154000043869019,
+ "epoch": 1.1474747474747475,
+ "grad_norm": 2.088576078414917,
+ "learning_rate": 3.8545454545454545e-06,
+ "loss": 1.3154902458190918,
+ "mean_token_accuracy": 0.6703101992607117,
+ "num_tokens": 9306112.0,
+ "step": 568
+ },
+ {
+ "entropy": 1.3576427698135376,
+ "epoch": 1.1494949494949496,
+ "grad_norm": 1.9895246028900146,
+ "learning_rate": 3.852525252525252e-06,
+ "loss": 1.3295378684997559,
+ "mean_token_accuracy": 0.6762335300445557,
+ "num_tokens": 9322496.0,
+ "step": 569
+ },
+ {
+ "entropy": 1.6067878007888794,
+ "epoch": 1.1515151515151516,
+ "grad_norm": 2.021191358566284,
+ "learning_rate": 3.85050505050505e-06,
+ "loss": 1.6273870468139648,
+ "mean_token_accuracy": 0.6329995393753052,
+ "num_tokens": 9338880.0,
+ "step": 570
+ },
+ {
+ "entropy": 1.4831246137619019,
+ "epoch": 1.1535353535353536,
+ "grad_norm": 2.114612340927124,
+ "learning_rate": 3.848484848484848e-06,
+ "loss": 1.4925904273986816,
+ "mean_token_accuracy": 0.6566316485404968,
+ "num_tokens": 9355264.0,
+ "step": 571
+ },
+ {
+ "entropy": 1.4476258754730225,
+ "epoch": 1.1555555555555554,
+ "grad_norm": 2.3435230255126953,
+ "learning_rate": 3.846464646464647e-06,
+ "loss": 1.438629388809204,
+ "mean_token_accuracy": 0.656020998954773,
+ "num_tokens": 9371648.0,
+ "step": 572
+ },
+ {
+ "entropy": 1.7930315732955933,
+ "epoch": 1.1575757575757575,
+ "grad_norm": 2.1700010299682617,
+ "learning_rate": 3.844444444444445e-06,
+ "loss": 1.786928653717041,
+ "mean_token_accuracy": 0.6028333902359009,
+ "num_tokens": 9388032.0,
+ "step": 573
+ },
+ {
+ "entropy": 1.3800512552261353,
+ "epoch": 1.1595959595959595,
+ "grad_norm": 2.2036688327789307,
+ "learning_rate": 3.842424242424243e-06,
+ "loss": 1.3767224550247192,
+ "mean_token_accuracy": 0.6692110300064087,
+ "num_tokens": 9404416.0,
+ "step": 574
+ },
+ {
+ "entropy": 0.8562329411506653,
+ "epoch": 1.1616161616161615,
+ "grad_norm": 1.765388011932373,
+ "learning_rate": 3.840404040404041e-06,
+ "loss": 0.8366047143936157,
+ "mean_token_accuracy": 0.783707857131958,
+ "num_tokens": 9420800.0,
+ "step": 575
+ },
+ {
+ "entropy": 1.4267486333847046,
+ "epoch": 1.1636363636363636,
+ "grad_norm": 2.0768239498138428,
+ "learning_rate": 3.8383838383838385e-06,
+ "loss": 1.4165449142456055,
+ "mean_token_accuracy": 0.656020998954773,
+ "num_tokens": 9437184.0,
+ "step": 576
+ },
+ {
+ "entropy": 1.4123388528823853,
+ "epoch": 1.1656565656565656,
+ "grad_norm": 2.028716802597046,
+ "learning_rate": 3.836363636363636e-06,
+ "loss": 1.420403003692627,
+ "mean_token_accuracy": 0.6729360222816467,
+ "num_tokens": 9453568.0,
+ "step": 577
+ },
+ {
+ "entropy": 1.1549286842346191,
+ "epoch": 1.1676767676767676,
+ "grad_norm": 2.1142919063568115,
+ "learning_rate": 3.834343434343435e-06,
+ "loss": 1.1487064361572266,
+ "mean_token_accuracy": 0.7040180563926697,
+ "num_tokens": 9469952.0,
+ "step": 578
+ },
+ {
+ "entropy": 1.4779953956604004,
+ "epoch": 1.1696969696969697,
+ "grad_norm": 2.166046142578125,
+ "learning_rate": 3.832323232323233e-06,
+ "loss": 1.4788683652877808,
+ "mean_token_accuracy": 0.6436858773231506,
+ "num_tokens": 9486336.0,
+ "step": 579
+ },
+ {
+ "entropy": 1.568039059638977,
+ "epoch": 1.1717171717171717,
+ "grad_norm": 2.067704200744629,
+ "learning_rate": 3.830303030303031e-06,
+ "loss": 1.5830929279327393,
+ "mean_token_accuracy": 0.6461895704269409,
+ "num_tokens": 9502720.0,
+ "step": 580
+ },
+ {
+ "entropy": 1.1785298585891724,
+ "epoch": 1.1737373737373737,
+ "grad_norm": 1.9789953231811523,
+ "learning_rate": 3.828282828282829e-06,
+ "loss": 1.2083481550216675,
+ "mean_token_accuracy": 0.7120786309242249,
+ "num_tokens": 9519104.0,
+ "step": 581
+ },
+ {
+ "entropy": 1.3783847093582153,
+ "epoch": 1.1757575757575758,
+ "grad_norm": 2.1503992080688477,
+ "learning_rate": 3.826262626262627e-06,
+ "loss": 1.3721052408218384,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 9535488.0,
+ "step": 582
+ },
+ {
+ "entropy": 1.120093584060669,
+ "epoch": 1.1777777777777778,
+ "grad_norm": 1.9822942018508911,
+ "learning_rate": 3.8242424242424245e-06,
+ "loss": 1.1215628385543823,
+ "mean_token_accuracy": 0.7122618556022644,
+ "num_tokens": 9551872.0,
+ "step": 583
+ },
+ {
+ "entropy": 1.4621506929397583,
+ "epoch": 1.1797979797979798,
+ "grad_norm": 2.159489631652832,
+ "learning_rate": 3.8222222222222224e-06,
+ "loss": 1.4614722728729248,
+ "mean_token_accuracy": 0.6535173654556274,
+ "num_tokens": 9568256.0,
+ "step": 584
+ },
+ {
+ "entropy": 1.015797734260559,
+ "epoch": 1.1818181818181819,
+ "grad_norm": 1.846848726272583,
+ "learning_rate": 3.82020202020202e-06,
+ "loss": 1.0082862377166748,
+ "mean_token_accuracy": 0.7394968271255493,
+ "num_tokens": 9584640.0,
+ "step": 585
+ },
+ {
+ "entropy": 1.364890217781067,
+ "epoch": 1.183838383838384,
+ "grad_norm": 2.175546646118164,
+ "learning_rate": 3.818181818181819e-06,
+ "loss": 1.3496818542480469,
+ "mean_token_accuracy": 0.6665241718292236,
+ "num_tokens": 9601024.0,
+ "step": 586
+ },
+ {
+ "entropy": 1.6056870222091675,
+ "epoch": 1.185858585858586,
+ "grad_norm": 2.1069748401641846,
+ "learning_rate": 3.816161616161617e-06,
+ "loss": 1.6048622131347656,
+ "mean_token_accuracy": 0.642892062664032,
+ "num_tokens": 9617408.0,
+ "step": 587
+ },
+ {
+ "entropy": 1.415107250213623,
+ "epoch": 1.187878787878788,
+ "grad_norm": 2.184544324874878,
+ "learning_rate": 3.8141414141414144e-06,
+ "loss": 1.4305826425552368,
+ "mean_token_accuracy": 0.6619443297386169,
+ "num_tokens": 9633792.0,
+ "step": 588
+ },
+ {
+ "entropy": 1.6554296016693115,
+ "epoch": 1.1898989898989898,
+ "grad_norm": 2.109793186187744,
+ "learning_rate": 3.8121212121212127e-06,
+ "loss": 1.6850776672363281,
+ "mean_token_accuracy": 0.6116267442703247,
+ "num_tokens": 9650176.0,
+ "step": 589
+ },
+ {
+ "entropy": 1.681472659111023,
+ "epoch": 1.1919191919191918,
+ "grad_norm": 2.3179714679718018,
+ "learning_rate": 3.8101010101010106e-06,
+ "loss": 1.699328064918518,
+ "mean_token_accuracy": 0.6105275750160217,
+ "num_tokens": 9666560.0,
+ "step": 590
+ },
+ {
+ "entropy": 1.113366961479187,
+ "epoch": 1.1939393939393939,
+ "grad_norm": 1.9885324239730835,
+ "learning_rate": 3.8080808080808085e-06,
+ "loss": 1.1357836723327637,
+ "mean_token_accuracy": 0.7157425284385681,
+ "num_tokens": 9682944.0,
+ "step": 591
+ },
+ {
+ "entropy": 1.1010088920593262,
+ "epoch": 1.195959595959596,
+ "grad_norm": 1.9745922088623047,
+ "learning_rate": 3.8060606060606064e-06,
+ "loss": 1.094293475151062,
+ "mean_token_accuracy": 0.7214215993881226,
+ "num_tokens": 9699328.0,
+ "step": 592
+ },
+ {
+ "entropy": 1.562911033630371,
+ "epoch": 1.197979797979798,
+ "grad_norm": 2.0526134967803955,
+ "learning_rate": 3.8040404040404043e-06,
+ "loss": 1.5747783184051514,
+ "mean_token_accuracy": 0.6342818737030029,
+ "num_tokens": 9715712.0,
+ "step": 593
+ },
+ {
+ "entropy": 1.6541608572006226,
+ "epoch": 1.2,
+ "grad_norm": 2.1268227100372314,
+ "learning_rate": 3.8020202020202026e-06,
+ "loss": 1.696983814239502,
+ "mean_token_accuracy": 0.6127259135246277,
+ "num_tokens": 9732096.0,
+ "step": 594
+ },
+ {
+ "entropy": 1.5259482860565186,
+ "epoch": 1.202020202020202,
+ "grad_norm": 2.240692377090454,
+ "learning_rate": 3.8000000000000005e-06,
+ "loss": 1.5582221746444702,
+ "mean_token_accuracy": 0.644052267074585,
+ "num_tokens": 9748480.0,
+ "step": 595
+ },
+ {
+ "entropy": 1.455372929573059,
+ "epoch": 1.204040404040404,
+ "grad_norm": 2.0934698581695557,
+ "learning_rate": 3.7979797979797984e-06,
+ "loss": 1.464172124862671,
+ "mean_token_accuracy": 0.6555935740470886,
+ "num_tokens": 9764864.0,
+ "step": 596
+ },
+ {
+ "entropy": 1.5074836015701294,
+ "epoch": 1.206060606060606,
+ "grad_norm": 1.9779568910598755,
+ "learning_rate": 3.7959595959595962e-06,
+ "loss": 1.5280466079711914,
+ "mean_token_accuracy": 0.6460063457489014,
+ "num_tokens": 9781248.0,
+ "step": 597
+ },
+ {
+ "entropy": 1.3286548852920532,
+ "epoch": 1.208080808080808,
+ "grad_norm": 1.9357717037200928,
+ "learning_rate": 3.793939393939394e-06,
+ "loss": 1.3448848724365234,
+ "mean_token_accuracy": 0.6816072463989258,
+ "num_tokens": 9797632.0,
+ "step": 598
+ },
+ {
+ "entropy": 1.5161375999450684,
+ "epoch": 1.2101010101010101,
+ "grad_norm": 2.224217414855957,
+ "learning_rate": 3.791919191919192e-06,
+ "loss": 1.5168235301971436,
+ "mean_token_accuracy": 0.6453346610069275,
+ "num_tokens": 9814016.0,
+ "step": 599
+ },
+ {
+ "entropy": 1.3337587118148804,
+ "epoch": 1.2121212121212122,
+ "grad_norm": 1.9308290481567383,
+ "learning_rate": 3.7898989898989903e-06,
+ "loss": 1.3429791927337646,
+ "mean_token_accuracy": 0.6827064156532288,
+ "num_tokens": 9830400.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.2121212121212122,
+ "eval_entropy": 1.4592116455877981,
+ "eval_loss": 1.5424447059631348,
+ "eval_mean_token_accuracy": 0.6431668299821115,
+ "eval_num_tokens": 9830400.0,
+ "eval_runtime": 43.8289,
+ "eval_samples_per_second": 22.588,
+ "eval_steps_per_second": 2.829,
+ "step": 600
+ },
+ {
+ "entropy": 1.6697322130203247,
+ "epoch": 1.2141414141414142,
+ "grad_norm": 1.9462894201278687,
+ "learning_rate": 3.7878787878787882e-06,
+ "loss": 1.6434354782104492,
+ "mean_token_accuracy": 0.635808527469635,
+ "num_tokens": 9846784.0,
+ "step": 601
+ },
+ {
+ "entropy": 1.427184820175171,
+ "epoch": 1.2161616161616162,
+ "grad_norm": 2.196017026901245,
+ "learning_rate": 3.785858585858586e-06,
+ "loss": 1.4024749994277954,
+ "mean_token_accuracy": 0.6720200181007385,
+ "num_tokens": 9863168.0,
+ "step": 602
+ },
+ {
+ "entropy": 1.4623222351074219,
+ "epoch": 1.2181818181818183,
+ "grad_norm": 2.160585403442383,
+ "learning_rate": 3.783838383838384e-06,
+ "loss": 1.4455416202545166,
+ "mean_token_accuracy": 0.6557767391204834,
+ "num_tokens": 9879552.0,
+ "step": 603
+ },
+ {
+ "entropy": 1.348331093788147,
+ "epoch": 1.2202020202020203,
+ "grad_norm": 2.079458713531494,
+ "learning_rate": 3.781818181818182e-06,
+ "loss": 1.3672473430633545,
+ "mean_token_accuracy": 0.6834391951560974,
+ "num_tokens": 9895936.0,
+ "step": 604
+ },
+ {
+ "entropy": 1.362277865409851,
+ "epoch": 1.2222222222222223,
+ "grad_norm": 2.10718035697937,
+ "learning_rate": 3.77979797979798e-06,
+ "loss": 1.3567216396331787,
+ "mean_token_accuracy": 0.6659135222434998,
+ "num_tokens": 9912320.0,
+ "step": 605
+ },
+ {
+ "entropy": 1.2743226289749146,
+ "epoch": 1.2242424242424241,
+ "grad_norm": 2.116549491882324,
+ "learning_rate": 3.777777777777778e-06,
+ "loss": 1.303470253944397,
+ "mean_token_accuracy": 0.6791035532951355,
+ "num_tokens": 9928704.0,
+ "step": 606
+ },
+ {
+ "entropy": 1.079649567604065,
+ "epoch": 1.2262626262626264,
+ "grad_norm": 1.8429855108261108,
+ "learning_rate": 3.775757575757576e-06,
+ "loss": 1.0616915225982666,
+ "mean_token_accuracy": 0.7321690320968628,
+ "num_tokens": 9945088.0,
+ "step": 607
+ },
+ {
+ "entropy": 1.363136649131775,
+ "epoch": 1.2282828282828282,
+ "grad_norm": 2.171295166015625,
+ "learning_rate": 3.773737373737374e-06,
+ "loss": 1.3525331020355225,
+ "mean_token_accuracy": 0.6732413172721863,
+ "num_tokens": 9961472.0,
+ "step": 608
+ },
+ {
+ "entropy": 1.324924349784851,
+ "epoch": 1.2303030303030302,
+ "grad_norm": 2.0872693061828613,
+ "learning_rate": 3.7717171717171717e-06,
+ "loss": 1.3282644748687744,
+ "mean_token_accuracy": 0.674462616443634,
+ "num_tokens": 9977856.0,
+ "step": 609
+ },
+ {
+ "entropy": 1.0672967433929443,
+ "epoch": 1.2323232323232323,
+ "grad_norm": 2.0819947719573975,
+ "learning_rate": 3.76969696969697e-06,
+ "loss": 1.0929367542266846,
+ "mean_token_accuracy": 0.715254008769989,
+ "num_tokens": 9994240.0,
+ "step": 610
+ },
+ {
+ "entropy": 1.4465869665145874,
+ "epoch": 1.2343434343434343,
+ "grad_norm": 2.1786868572235107,
+ "learning_rate": 3.767676767676768e-06,
+ "loss": 1.436307668685913,
+ "mean_token_accuracy": 0.6642037034034729,
+ "num_tokens": 10010624.0,
+ "step": 611
+ },
+ {
+ "entropy": 1.6424144506454468,
+ "epoch": 1.2363636363636363,
+ "grad_norm": 2.2582032680511475,
+ "learning_rate": 3.765656565656566e-06,
+ "loss": 1.6621832847595215,
+ "mean_token_accuracy": 0.6218246221542358,
+ "num_tokens": 10027008.0,
+ "step": 612
+ },
+ {
+ "entropy": 1.546712875366211,
+ "epoch": 1.2383838383838384,
+ "grad_norm": 2.1685879230499268,
+ "learning_rate": 3.7636363636363637e-06,
+ "loss": 1.5617464780807495,
+ "mean_token_accuracy": 0.6325110197067261,
+ "num_tokens": 10043392.0,
+ "step": 613
+ },
+ {
+ "entropy": 1.5758557319641113,
+ "epoch": 1.2404040404040404,
+ "grad_norm": 2.0911128520965576,
+ "learning_rate": 3.7616161616161616e-06,
+ "loss": 1.5830271244049072,
+ "mean_token_accuracy": 0.6349536180496216,
+ "num_tokens": 10059776.0,
+ "step": 614
+ },
+ {
+ "entropy": 1.5223995447158813,
+ "epoch": 1.2424242424242424,
+ "grad_norm": 2.0333359241485596,
+ "learning_rate": 3.7595959595959595e-06,
+ "loss": 1.5132982730865479,
+ "mean_token_accuracy": 0.6518075466156006,
+ "num_tokens": 10076160.0,
+ "step": 615
+ },
+ {
+ "entropy": 1.0950185060501099,
+ "epoch": 1.2444444444444445,
+ "grad_norm": 2.0048129558563232,
+ "learning_rate": 3.757575757575758e-06,
+ "loss": 1.0901896953582764,
+ "mean_token_accuracy": 0.723375678062439,
+ "num_tokens": 10092544.0,
+ "step": 616
+ },
+ {
+ "entropy": 1.340641736984253,
+ "epoch": 1.2464646464646465,
+ "grad_norm": 2.079256534576416,
+ "learning_rate": 3.7555555555555557e-06,
+ "loss": 1.3583415746688843,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 10108928.0,
+ "step": 617
+ },
+ {
+ "entropy": 1.1836222410202026,
+ "epoch": 1.2484848484848485,
+ "grad_norm": 1.9266347885131836,
+ "learning_rate": 3.7535353535353536e-06,
+ "loss": 1.171565294265747,
+ "mean_token_accuracy": 0.7046287059783936,
+ "num_tokens": 10125312.0,
+ "step": 618
+ },
+ {
+ "entropy": 1.6007641553878784,
+ "epoch": 1.2505050505050506,
+ "grad_norm": 2.25252103805542,
+ "learning_rate": 3.7515151515151515e-06,
+ "loss": 1.5955660343170166,
+ "mean_token_accuracy": 0.6306790709495544,
+ "num_tokens": 10141696.0,
+ "step": 619
+ },
+ {
+ "entropy": 1.8159959316253662,
+ "epoch": 1.2525252525252526,
+ "grad_norm": 2.255959987640381,
+ "learning_rate": 3.74949494949495e-06,
+ "loss": 1.8223116397857666,
+ "mean_token_accuracy": 0.5867122411727905,
+ "num_tokens": 10158080.0,
+ "step": 620
+ },
+ {
+ "entropy": 1.6469950675964355,
+ "epoch": 1.2545454545454544,
+ "grad_norm": 1.9183777570724487,
+ "learning_rate": 3.747474747474748e-06,
+ "loss": 1.6623587608337402,
+ "mean_token_accuracy": 0.6283586025238037,
+ "num_tokens": 10174464.0,
+ "step": 621
+ },
+ {
+ "entropy": 1.3507136106491089,
+ "epoch": 1.2565656565656567,
+ "grad_norm": 1.9393805265426636,
+ "learning_rate": 3.745454545454546e-06,
+ "loss": 1.3371413946151733,
+ "mean_token_accuracy": 0.6808744668960571,
+ "num_tokens": 10190848.0,
+ "step": 622
+ },
+ {
+ "entropy": 1.5176761150360107,
+ "epoch": 1.2585858585858585,
+ "grad_norm": 2.0721757411956787,
+ "learning_rate": 3.743434343434344e-06,
+ "loss": 1.5010406970977783,
+ "mean_token_accuracy": 0.6603566408157349,
+ "num_tokens": 10207232.0,
+ "step": 623
+ },
+ {
+ "entropy": 1.1409586668014526,
+ "epoch": 1.2606060606060607,
+ "grad_norm": 1.90805983543396,
+ "learning_rate": 3.7414141414141418e-06,
+ "loss": 1.1339551210403442,
+ "mean_token_accuracy": 0.7151318788528442,
+ "num_tokens": 10223616.0,
+ "step": 624
+ },
+ {
+ "entropy": 1.2258127927780151,
+ "epoch": 1.2626262626262625,
+ "grad_norm": 1.9276432991027832,
+ "learning_rate": 3.73939393939394e-06,
+ "loss": 1.2232249975204468,
+ "mean_token_accuracy": 0.7053614854812622,
+ "num_tokens": 10240000.0,
+ "step": 625
+ },
+ {
+ "entropy": 1.236358642578125,
+ "epoch": 1.2646464646464646,
+ "grad_norm": 2.0792832374572754,
+ "learning_rate": 3.737373737373738e-06,
+ "loss": 1.2570738792419434,
+ "mean_token_accuracy": 0.6869809627532959,
+ "num_tokens": 10256384.0,
+ "step": 626
+ },
+ {
+ "entropy": 1.0995185375213623,
+ "epoch": 1.2666666666666666,
+ "grad_norm": 2.035024881362915,
+ "learning_rate": 3.735353535353536e-06,
+ "loss": 1.10158109664917,
+ "mean_token_accuracy": 0.7248412370681763,
+ "num_tokens": 10272768.0,
+ "step": 627
+ },
+ {
+ "entropy": 1.8980706930160522,
+ "epoch": 1.2686868686868686,
+ "grad_norm": 2.040414333343506,
+ "learning_rate": 3.7333333333333337e-06,
+ "loss": 1.9260807037353516,
+ "mean_token_accuracy": 0.5953834652900696,
+ "num_tokens": 10289152.0,
+ "step": 628
+ },
+ {
+ "entropy": 1.4265168905258179,
+ "epoch": 1.2707070707070707,
+ "grad_norm": 2.418179750442505,
+ "learning_rate": 3.7313131313131316e-06,
+ "loss": 1.4415385723114014,
+ "mean_token_accuracy": 0.6535784006118774,
+ "num_tokens": 10305536.0,
+ "step": 629
+ },
+ {
+ "entropy": 1.217471957206726,
+ "epoch": 1.2727272727272727,
+ "grad_norm": 2.072441577911377,
+ "learning_rate": 3.72929292929293e-06,
+ "loss": 1.2361960411071777,
+ "mean_token_accuracy": 0.6947972774505615,
+ "num_tokens": 10321920.0,
+ "step": 630
+ },
+ {
+ "entropy": 1.0714137554168701,
+ "epoch": 1.2747474747474747,
+ "grad_norm": 3.0428647994995117,
+ "learning_rate": 3.727272727272728e-06,
+ "loss": 1.112711787223816,
+ "mean_token_accuracy": 0.7243527173995972,
+ "num_tokens": 10338304.0,
+ "step": 631
+ },
+ {
+ "entropy": 1.5873851776123047,
+ "epoch": 1.2767676767676768,
+ "grad_norm": 1.945098638534546,
+ "learning_rate": 3.7252525252525257e-06,
+ "loss": 1.595362663269043,
+ "mean_token_accuracy": 0.639594554901123,
+ "num_tokens": 10354688.0,
+ "step": 632
+ },
+ {
+ "entropy": 1.9688408374786377,
+ "epoch": 1.2787878787878788,
+ "grad_norm": 2.0450353622436523,
+ "learning_rate": 3.7232323232323236e-06,
+ "loss": 1.9989259243011475,
+ "mean_token_accuracy": 0.5685759782791138,
+ "num_tokens": 10371072.0,
+ "step": 633
+ },
+ {
+ "entropy": 1.2927459478378296,
+ "epoch": 1.2808080808080808,
+ "grad_norm": 1.959108591079712,
+ "learning_rate": 3.7212121212121215e-06,
+ "loss": 1.3025646209716797,
+ "mean_token_accuracy": 0.6853932738304138,
+ "num_tokens": 10387456.0,
+ "step": 634
+ },
+ {
+ "entropy": 1.6645994186401367,
+ "epoch": 1.2828282828282829,
+ "grad_norm": 2.041923999786377,
+ "learning_rate": 3.7191919191919194e-06,
+ "loss": 1.6959854364395142,
+ "mean_token_accuracy": 0.6319003701210022,
+ "num_tokens": 10403840.0,
+ "step": 635
+ },
+ {
+ "entropy": 1.401423692703247,
+ "epoch": 1.284848484848485,
+ "grad_norm": 2.040456533432007,
+ "learning_rate": 3.7171717171717177e-06,
+ "loss": 1.3859784603118896,
+ "mean_token_accuracy": 0.6740962266921997,
+ "num_tokens": 10420224.0,
+ "step": 636
+ },
+ {
+ "entropy": 1.0597256422042847,
+ "epoch": 1.286868686868687,
+ "grad_norm": 2.053690195083618,
+ "learning_rate": 3.7151515151515156e-06,
+ "loss": 1.052672266960144,
+ "mean_token_accuracy": 0.7290546894073486,
+ "num_tokens": 10436608.0,
+ "step": 637
+ },
+ {
+ "entropy": 1.280874252319336,
+ "epoch": 1.2888888888888888,
+ "grad_norm": 2.0566959381103516,
+ "learning_rate": 3.7131313131313135e-06,
+ "loss": 1.2883412837982178,
+ "mean_token_accuracy": 0.6822178959846497,
+ "num_tokens": 10452992.0,
+ "step": 638
+ },
+ {
+ "entropy": 1.299896240234375,
+ "epoch": 1.290909090909091,
+ "grad_norm": 1.8896070718765259,
+ "learning_rate": 3.7111111111111113e-06,
+ "loss": 1.3038103580474854,
+ "mean_token_accuracy": 0.6712872385978699,
+ "num_tokens": 10469376.0,
+ "step": 639
+ },
+ {
+ "entropy": 1.1713769435882568,
+ "epoch": 1.2929292929292928,
+ "grad_norm": 2.1309149265289307,
+ "learning_rate": 3.7090909090909092e-06,
+ "loss": 1.1899120807647705,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 10485760.0,
+ "step": 640
+ },
+ {
+ "entropy": 1.3056974411010742,
+ "epoch": 1.294949494949495,
+ "grad_norm": 1.9990391731262207,
+ "learning_rate": 3.7070707070707075e-06,
+ "loss": 1.3287105560302734,
+ "mean_token_accuracy": 0.6773326992988586,
+ "num_tokens": 10502144.0,
+ "step": 641
+ },
+ {
+ "entropy": 1.7352585792541504,
+ "epoch": 1.2969696969696969,
+ "grad_norm": 2.100043535232544,
+ "learning_rate": 3.7050505050505054e-06,
+ "loss": 1.7806944847106934,
+ "mean_token_accuracy": 0.60332190990448,
+ "num_tokens": 10518528.0,
+ "step": 642
+ },
+ {
+ "entropy": 1.3748377561569214,
+ "epoch": 1.298989898989899,
+ "grad_norm": 2.1280689239501953,
+ "learning_rate": 3.7030303030303033e-06,
+ "loss": 1.379891037940979,
+ "mean_token_accuracy": 0.6617611050605774,
+ "num_tokens": 10534912.0,
+ "step": 643
+ },
+ {
+ "entropy": 0.9991571307182312,
+ "epoch": 1.301010101010101,
+ "grad_norm": 1.7343134880065918,
+ "learning_rate": 3.701010101010101e-06,
+ "loss": 1.0082780122756958,
+ "mean_token_accuracy": 0.740229606628418,
+ "num_tokens": 10551296.0,
+ "step": 644
+ },
+ {
+ "entropy": 1.6313605308532715,
+ "epoch": 1.303030303030303,
+ "grad_norm": 2.216167449951172,
+ "learning_rate": 3.698989898989899e-06,
+ "loss": 1.6183781623840332,
+ "mean_token_accuracy": 0.6164509057998657,
+ "num_tokens": 10567680.0,
+ "step": 645
+ },
+ {
+ "entropy": 1.4174962043762207,
+ "epoch": 1.305050505050505,
+ "grad_norm": 2.0921854972839355,
+ "learning_rate": 3.6969696969696974e-06,
+ "loss": 1.4087945222854614,
+ "mean_token_accuracy": 0.6705544590950012,
+ "num_tokens": 10584064.0,
+ "step": 646
+ },
+ {
+ "entropy": 1.8302873373031616,
+ "epoch": 1.307070707070707,
+ "grad_norm": 2.0742204189300537,
+ "learning_rate": 3.6949494949494953e-06,
+ "loss": 1.8456642627716064,
+ "mean_token_accuracy": 0.5914142727851868,
+ "num_tokens": 10600448.0,
+ "step": 647
+ },
+ {
+ "entropy": 1.29628324508667,
+ "epoch": 1.309090909090909,
+ "grad_norm": 2.1446709632873535,
+ "learning_rate": 3.692929292929293e-06,
+ "loss": 1.3066375255584717,
+ "mean_token_accuracy": 0.6798363327980042,
+ "num_tokens": 10616832.0,
+ "step": 648
+ },
+ {
+ "entropy": 1.396378993988037,
+ "epoch": 1.3111111111111111,
+ "grad_norm": 1.9578899145126343,
+ "learning_rate": 3.690909090909091e-06,
+ "loss": 1.3943686485290527,
+ "mean_token_accuracy": 0.6772105693817139,
+ "num_tokens": 10633216.0,
+ "step": 649
+ },
+ {
+ "entropy": 1.6457722187042236,
+ "epoch": 1.3131313131313131,
+ "grad_norm": 1.9999926090240479,
+ "learning_rate": 3.688888888888889e-06,
+ "loss": 1.6266872882843018,
+ "mean_token_accuracy": 0.630923330783844,
+ "num_tokens": 10649600.0,
+ "step": 650
+ },
+ {
+ "epoch": 1.3131313131313131,
+ "eval_entropy": 1.456459879875183,
+ "eval_loss": 1.539737582206726,
+ "eval_mean_token_accuracy": 0.643713459853203,
+ "eval_num_tokens": 10649600.0,
+ "eval_runtime": 43.7637,
+ "eval_samples_per_second": 22.621,
+ "eval_steps_per_second": 2.833,
+ "step": 650
+ },
+ {
+ "entropy": 1.1152859926223755,
+ "epoch": 1.3151515151515152,
+ "grad_norm": 2.9232723712921143,
+ "learning_rate": 3.686868686868687e-06,
+ "loss": 1.099653959274292,
+ "mean_token_accuracy": 0.7227039337158203,
+ "num_tokens": 10665984.0,
+ "step": 651
+ },
+ {
+ "entropy": 1.6141386032104492,
+ "epoch": 1.3171717171717172,
+ "grad_norm": 2.1557929515838623,
+ "learning_rate": 3.684848484848485e-06,
+ "loss": 1.6156055927276611,
+ "mean_token_accuracy": 0.6288471221923828,
+ "num_tokens": 10682368.0,
+ "step": 652
+ },
+ {
+ "entropy": 1.282158374786377,
+ "epoch": 1.3191919191919192,
+ "grad_norm": 2.061983346939087,
+ "learning_rate": 3.682828282828283e-06,
+ "loss": 1.2867733240127563,
+ "mean_token_accuracy": 0.6869198679924011,
+ "num_tokens": 10698752.0,
+ "step": 653
+ },
+ {
+ "entropy": 0.9986366033554077,
+ "epoch": 1.3212121212121213,
+ "grad_norm": 2.0446274280548096,
+ "learning_rate": 3.680808080808081e-06,
+ "loss": 1.019629716873169,
+ "mean_token_accuracy": 0.7427943348884583,
+ "num_tokens": 10715136.0,
+ "step": 654
+ },
+ {
+ "entropy": 1.4256011247634888,
+ "epoch": 1.3232323232323233,
+ "grad_norm": 2.1024749279022217,
+ "learning_rate": 3.678787878787879e-06,
+ "loss": 1.4269766807556152,
+ "mean_token_accuracy": 0.6674401760101318,
+ "num_tokens": 10731520.0,
+ "step": 655
+ },
+ {
+ "entropy": 1.4913274049758911,
+ "epoch": 1.3252525252525253,
+ "grad_norm": 2.068432569503784,
+ "learning_rate": 3.6767676767676767e-06,
+ "loss": 1.4930779933929443,
+ "mean_token_accuracy": 0.6474719047546387,
+ "num_tokens": 10747904.0,
+ "step": 656
+ },
+ {
+ "entropy": 1.2957285642623901,
+ "epoch": 1.3272727272727272,
+ "grad_norm": 2.2480008602142334,
+ "learning_rate": 3.674747474747475e-06,
+ "loss": 1.3001320362091064,
+ "mean_token_accuracy": 0.679286777973175,
+ "num_tokens": 10764288.0,
+ "step": 657
+ },
+ {
+ "entropy": 1.328946828842163,
+ "epoch": 1.3292929292929294,
+ "grad_norm": 2.311176300048828,
+ "learning_rate": 3.672727272727273e-06,
+ "loss": 1.3286024332046509,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 10780672.0,
+ "step": 658
+ },
+ {
+ "entropy": 1.458139419555664,
+ "epoch": 1.3313131313131312,
+ "grad_norm": 2.1967899799346924,
+ "learning_rate": 3.670707070707071e-06,
+ "loss": 1.4384279251098633,
+ "mean_token_accuracy": 0.6435637474060059,
+ "num_tokens": 10797056.0,
+ "step": 659
+ },
+ {
+ "entropy": 1.43666672706604,
+ "epoch": 1.3333333333333333,
+ "grad_norm": 2.163083076477051,
+ "learning_rate": 3.6686868686868687e-06,
+ "loss": 1.4396371841430664,
+ "mean_token_accuracy": 0.6531509757041931,
+ "num_tokens": 10813440.0,
+ "step": 660
+ },
+ {
+ "entropy": 1.6210501194000244,
+ "epoch": 1.3353535353535353,
+ "grad_norm": 2.3601770401000977,
+ "learning_rate": 3.6666666666666666e-06,
+ "loss": 1.6370227336883545,
+ "mean_token_accuracy": 0.6149242520332336,
+ "num_tokens": 10829824.0,
+ "step": 661
+ },
+ {
+ "entropy": 0.9602832794189453,
+ "epoch": 1.3373737373737373,
+ "grad_norm": 1.8452314138412476,
+ "learning_rate": 3.664646464646465e-06,
+ "loss": 0.9445997476577759,
+ "mean_token_accuracy": 0.759709358215332,
+ "num_tokens": 10846208.0,
+ "step": 662
+ },
+ {
+ "entropy": 1.2215200662612915,
+ "epoch": 1.3393939393939394,
+ "grad_norm": 2.019989252090454,
+ "learning_rate": 3.662626262626263e-06,
+ "loss": 1.2451637983322144,
+ "mean_token_accuracy": 0.7051172256469727,
+ "num_tokens": 10862592.0,
+ "step": 663
+ },
+ {
+ "entropy": 1.3253310918807983,
+ "epoch": 1.3414141414141414,
+ "grad_norm": 1.9700425863265991,
+ "learning_rate": 3.660606060606061e-06,
+ "loss": 1.3407385349273682,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 10878976.0,
+ "step": 664
+ },
+ {
+ "entropy": 1.1397737264633179,
+ "epoch": 1.3434343434343434,
+ "grad_norm": 2.1194040775299072,
+ "learning_rate": 3.658585858585859e-06,
+ "loss": 1.1545679569244385,
+ "mean_token_accuracy": 0.7071323990821838,
+ "num_tokens": 10895360.0,
+ "step": 665
+ },
+ {
+ "entropy": 1.1714493036270142,
+ "epoch": 1.3454545454545455,
+ "grad_norm": 2.078051805496216,
+ "learning_rate": 3.6565656565656573e-06,
+ "loss": 1.1751537322998047,
+ "mean_token_accuracy": 0.6963238716125488,
+ "num_tokens": 10911744.0,
+ "step": 666
+ },
+ {
+ "entropy": 1.2954860925674438,
+ "epoch": 1.3474747474747475,
+ "grad_norm": 1.9348593950271606,
+ "learning_rate": 3.654545454545455e-06,
+ "loss": 1.2961801290512085,
+ "mean_token_accuracy": 0.6831338405609131,
+ "num_tokens": 10928128.0,
+ "step": 667
+ },
+ {
+ "entropy": 1.401628851890564,
+ "epoch": 1.3494949494949495,
+ "grad_norm": 2.1757614612579346,
+ "learning_rate": 3.652525252525253e-06,
+ "loss": 1.4025013446807861,
+ "mean_token_accuracy": 0.6590132117271423,
+ "num_tokens": 10944512.0,
+ "step": 668
+ },
+ {
+ "entropy": 1.4164557456970215,
+ "epoch": 1.3515151515151516,
+ "grad_norm": 2.0192055702209473,
+ "learning_rate": 3.650505050505051e-06,
+ "loss": 1.43379545211792,
+ "mean_token_accuracy": 0.6554714441299438,
+ "num_tokens": 10960896.0,
+ "step": 669
+ },
+ {
+ "entropy": 1.4888815879821777,
+ "epoch": 1.3535353535353536,
+ "grad_norm": 2.2166643142700195,
+ "learning_rate": 3.648484848484849e-06,
+ "loss": 1.494372844696045,
+ "mean_token_accuracy": 0.6402052044868469,
+ "num_tokens": 10977280.0,
+ "step": 670
+ },
+ {
+ "entropy": 1.215625286102295,
+ "epoch": 1.3555555555555556,
+ "grad_norm": 1.8059836626052856,
+ "learning_rate": 3.6464646464646467e-06,
+ "loss": 1.2074902057647705,
+ "mean_token_accuracy": 0.7123228907585144,
+ "num_tokens": 10993664.0,
+ "step": 671
+ },
+ {
+ "entropy": 0.9577685594558716,
+ "epoch": 1.3575757575757577,
+ "grad_norm": 1.8803631067276,
+ "learning_rate": 3.644444444444445e-06,
+ "loss": 0.956764817237854,
+ "mean_token_accuracy": 0.759709358215332,
+ "num_tokens": 11010048.0,
+ "step": 672
+ },
+ {
+ "entropy": 1.7215807437896729,
+ "epoch": 1.3595959595959597,
+ "grad_norm": 2.1421561241149902,
+ "learning_rate": 3.642424242424243e-06,
+ "loss": 1.7220706939697266,
+ "mean_token_accuracy": 0.6187102794647217,
+ "num_tokens": 11026432.0,
+ "step": 673
+ },
+ {
+ "entropy": 1.057277798652649,
+ "epoch": 1.3616161616161615,
+ "grad_norm": 1.9014254808425903,
+ "learning_rate": 3.640404040404041e-06,
+ "loss": 1.0582892894744873,
+ "mean_token_accuracy": 0.7327185869216919,
+ "num_tokens": 11042816.0,
+ "step": 674
+ },
+ {
+ "entropy": 1.220097541809082,
+ "epoch": 1.3636363636363638,
+ "grad_norm": 2.1406402587890625,
+ "learning_rate": 3.6383838383838387e-06,
+ "loss": 1.2152808904647827,
+ "mean_token_accuracy": 0.6976673007011414,
+ "num_tokens": 11059200.0,
+ "step": 675
+ },
+ {
+ "entropy": 1.4171489477157593,
+ "epoch": 1.3656565656565656,
+ "grad_norm": 2.1809890270233154,
+ "learning_rate": 3.6363636363636366e-06,
+ "loss": 1.4846035242080688,
+ "mean_token_accuracy": 0.6681118607521057,
+ "num_tokens": 11075584.0,
+ "step": 676
+ },
+ {
+ "entropy": 1.2915124893188477,
+ "epoch": 1.3676767676767676,
+ "grad_norm": 2.0533218383789062,
+ "learning_rate": 3.634343434343435e-06,
+ "loss": 1.3094089031219482,
+ "mean_token_accuracy": 0.6841719746589661,
+ "num_tokens": 11091968.0,
+ "step": 677
+ },
+ {
+ "entropy": 1.4717603921890259,
+ "epoch": 1.3696969696969696,
+ "grad_norm": 2.125450849533081,
+ "learning_rate": 3.6323232323232328e-06,
+ "loss": 1.479896903038025,
+ "mean_token_accuracy": 0.6601734161376953,
+ "num_tokens": 11108352.0,
+ "step": 678
+ },
+ {
+ "entropy": 1.0841981172561646,
+ "epoch": 1.3717171717171717,
+ "grad_norm": 1.936905026435852,
+ "learning_rate": 3.6303030303030307e-06,
+ "loss": 1.0895963907241821,
+ "mean_token_accuracy": 0.7307645082473755,
+ "num_tokens": 11124736.0,
+ "step": 679
+ },
+ {
+ "entropy": 0.85239177942276,
+ "epoch": 1.3737373737373737,
+ "grad_norm": 1.7117112874984741,
+ "learning_rate": 3.6282828282828286e-06,
+ "loss": 0.8716775178909302,
+ "mean_token_accuracy": 0.7721666097640991,
+ "num_tokens": 11141120.0,
+ "step": 680
+ },
+ {
+ "entropy": 1.4737738370895386,
+ "epoch": 1.3757575757575757,
+ "grad_norm": 2.0140671730041504,
+ "learning_rate": 3.6262626262626264e-06,
+ "loss": 1.5029723644256592,
+ "mean_token_accuracy": 0.653822660446167,
+ "num_tokens": 11157504.0,
+ "step": 681
+ },
+ {
+ "entropy": 1.260698914527893,
+ "epoch": 1.3777777777777778,
+ "grad_norm": 1.9868851900100708,
+ "learning_rate": 3.6242424242424248e-06,
+ "loss": 1.256290316581726,
+ "mean_token_accuracy": 0.6891182065010071,
+ "num_tokens": 11173888.0,
+ "step": 682
+ },
+ {
+ "entropy": 1.7418453693389893,
+ "epoch": 1.3797979797979798,
+ "grad_norm": 2.0905439853668213,
+ "learning_rate": 3.6222222222222226e-06,
+ "loss": 1.7568984031677246,
+ "mean_token_accuracy": 0.6291524171829224,
+ "num_tokens": 11190272.0,
+ "step": 683
+ },
+ {
+ "entropy": 1.5552523136138916,
+ "epoch": 1.3818181818181818,
+ "grad_norm": 2.2071683406829834,
+ "learning_rate": 3.6202020202020205e-06,
+ "loss": 1.555542230606079,
+ "mean_token_accuracy": 0.6403883695602417,
+ "num_tokens": 11206656.0,
+ "step": 684
+ },
+ {
+ "entropy": 1.4404902458190918,
+ "epoch": 1.3838383838383839,
+ "grad_norm": 2.276245594024658,
+ "learning_rate": 3.6181818181818184e-06,
+ "loss": 1.4155148267745972,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 11223040.0,
+ "step": 685
+ },
+ {
+ "entropy": 1.1282018423080444,
+ "epoch": 1.385858585858586,
+ "grad_norm": 1.9824057817459106,
+ "learning_rate": 3.6161616161616163e-06,
+ "loss": 1.099952220916748,
+ "mean_token_accuracy": 0.7234978079795837,
+ "num_tokens": 11239424.0,
+ "step": 686
+ },
+ {
+ "entropy": 1.5559885501861572,
+ "epoch": 1.387878787878788,
+ "grad_norm": 2.243121862411499,
+ "learning_rate": 3.614141414141414e-06,
+ "loss": 1.520850658416748,
+ "mean_token_accuracy": 0.6340987086296082,
+ "num_tokens": 11255808.0,
+ "step": 687
+ },
+ {
+ "entropy": 1.322407841682434,
+ "epoch": 1.38989898989899,
+ "grad_norm": 2.049233913421631,
+ "learning_rate": 3.6121212121212125e-06,
+ "loss": 1.322263479232788,
+ "mean_token_accuracy": 0.6778212189674377,
+ "num_tokens": 11272192.0,
+ "step": 688
+ },
+ {
+ "entropy": 1.3112859725952148,
+ "epoch": 1.391919191919192,
+ "grad_norm": 2.0666465759277344,
+ "learning_rate": 3.6101010101010104e-06,
+ "loss": 1.3103243112564087,
+ "mean_token_accuracy": 0.6828285455703735,
+ "num_tokens": 11288576.0,
+ "step": 689
+ },
+ {
+ "entropy": 1.3321104049682617,
+ "epoch": 1.393939393939394,
+ "grad_norm": 2.5464279651641846,
+ "learning_rate": 3.6080808080808083e-06,
+ "loss": 1.3247697353363037,
+ "mean_token_accuracy": 0.6785539984703064,
+ "num_tokens": 11304960.0,
+ "step": 690
+ },
+ {
+ "entropy": 1.0779680013656616,
+ "epoch": 1.3959595959595958,
+ "grad_norm": 2.1386117935180664,
+ "learning_rate": 3.606060606060606e-06,
+ "loss": 1.0994013547897339,
+ "mean_token_accuracy": 0.7129946351051331,
+ "num_tokens": 11321344.0,
+ "step": 691
+ },
+ {
+ "entropy": 1.0701864957809448,
+ "epoch": 1.397979797979798,
+ "grad_norm": 1.9387527704238892,
+ "learning_rate": 3.604040404040404e-06,
+ "loss": 1.0633184909820557,
+ "mean_token_accuracy": 0.7378480434417725,
+ "num_tokens": 11337728.0,
+ "step": 692
+ },
+ {
+ "entropy": 1.2258752584457397,
+ "epoch": 1.4,
+ "grad_norm": 2.0486111640930176,
+ "learning_rate": 3.6020202020202024e-06,
+ "loss": 1.2098207473754883,
+ "mean_token_accuracy": 0.6999877691268921,
+ "num_tokens": 11354112.0,
+ "step": 693
+ },
+ {
+ "entropy": 1.4652774333953857,
+ "epoch": 1.402020202020202,
+ "grad_norm": 2.043079376220703,
+ "learning_rate": 3.6000000000000003e-06,
+ "loss": 1.4780974388122559,
+ "mean_token_accuracy": 0.6681729555130005,
+ "num_tokens": 11370496.0,
+ "step": 694
+ },
+ {
+ "entropy": 1.3215711116790771,
+ "epoch": 1.404040404040404,
+ "grad_norm": 2.1327438354492188,
+ "learning_rate": 3.597979797979798e-06,
+ "loss": 1.3116662502288818,
+ "mean_token_accuracy": 0.6757450103759766,
+ "num_tokens": 11386880.0,
+ "step": 695
+ },
+ {
+ "entropy": 1.624266266822815,
+ "epoch": 1.406060606060606,
+ "grad_norm": 2.114398717880249,
+ "learning_rate": 3.595959595959596e-06,
+ "loss": 1.628610372543335,
+ "mean_token_accuracy": 0.6487542986869812,
+ "num_tokens": 11403264.0,
+ "step": 696
+ },
+ {
+ "entropy": 1.6059489250183105,
+ "epoch": 1.408080808080808,
+ "grad_norm": 1.952991008758545,
+ "learning_rate": 3.593939393939394e-06,
+ "loss": 1.6145906448364258,
+ "mean_token_accuracy": 0.6257938742637634,
+ "num_tokens": 11419648.0,
+ "step": 697
+ },
+ {
+ "entropy": 1.0662391185760498,
+ "epoch": 1.41010101010101,
+ "grad_norm": 2.0804851055145264,
+ "learning_rate": 3.5919191919191922e-06,
+ "loss": 1.0772000551223755,
+ "mean_token_accuracy": 0.7187347412109375,
+ "num_tokens": 11436032.0,
+ "step": 698
+ },
+ {
+ "entropy": 1.221283197402954,
+ "epoch": 1.412121212121212,
+ "grad_norm": 1.9502744674682617,
+ "learning_rate": 3.58989898989899e-06,
+ "loss": 1.2352337837219238,
+ "mean_token_accuracy": 0.6918050646781921,
+ "num_tokens": 11452416.0,
+ "step": 699
+ },
+ {
+ "entropy": 1.4205158948898315,
+ "epoch": 1.4141414141414141,
+ "grad_norm": 2.2222518920898438,
+ "learning_rate": 3.587878787878788e-06,
+ "loss": 1.451093077659607,
+ "mean_token_accuracy": 0.6648754477500916,
+ "num_tokens": 11468800.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.4141414141414141,
+ "eval_entropy": 1.4370074204860195,
+ "eval_loss": 1.5383458137512207,
+ "eval_mean_token_accuracy": 0.6441497793120723,
+ "eval_num_tokens": 11468800.0,
+ "eval_runtime": 43.744,
+ "eval_samples_per_second": 22.632,
+ "eval_steps_per_second": 2.835,
+ "step": 700
+ },
+ {
+ "entropy": 1.5432499647140503,
+ "epoch": 1.4161616161616162,
+ "grad_norm": 2.084463596343994,
+ "learning_rate": 3.585858585858586e-06,
+ "loss": 1.5958356857299805,
+ "mean_token_accuracy": 0.6377015113830566,
+ "num_tokens": 11485184.0,
+ "step": 701
+ },
+ {
+ "entropy": 1.297119379043579,
+ "epoch": 1.4181818181818182,
+ "grad_norm": 2.1996524333953857,
+ "learning_rate": 3.5838383838383838e-06,
+ "loss": 1.3346054553985596,
+ "mean_token_accuracy": 0.6801416873931885,
+ "num_tokens": 11501568.0,
+ "step": 702
+ },
+ {
+ "entropy": 1.3905766010284424,
+ "epoch": 1.4202020202020202,
+ "grad_norm": 2.1683545112609863,
+ "learning_rate": 3.5818181818181817e-06,
+ "loss": 1.40826416015625,
+ "mean_token_accuracy": 0.6653639674186707,
+ "num_tokens": 11517952.0,
+ "step": 703
+ },
+ {
+ "entropy": 0.9598695635795593,
+ "epoch": 1.4222222222222223,
+ "grad_norm": 1.9240537881851196,
+ "learning_rate": 3.57979797979798e-06,
+ "loss": 0.9487459659576416,
+ "mean_token_accuracy": 0.7556179761886597,
+ "num_tokens": 11534336.0,
+ "step": 704
+ },
+ {
+ "entropy": 1.2008687257766724,
+ "epoch": 1.4242424242424243,
+ "grad_norm": 1.9687083959579468,
+ "learning_rate": 3.577777777777778e-06,
+ "loss": 1.2234617471694946,
+ "mean_token_accuracy": 0.6982779502868652,
+ "num_tokens": 11550720.0,
+ "step": 705
+ },
+ {
+ "entropy": 1.1168856620788574,
+ "epoch": 1.4262626262626263,
+ "grad_norm": 2.1796388626098633,
+ "learning_rate": 3.575757575757576e-06,
+ "loss": 1.1320589780807495,
+ "mean_token_accuracy": 0.7057889699935913,
+ "num_tokens": 11567104.0,
+ "step": 706
+ },
+ {
+ "entropy": 1.3408682346343994,
+ "epoch": 1.4282828282828284,
+ "grad_norm": 1.9048689603805542,
+ "learning_rate": 3.573737373737374e-06,
+ "loss": 1.3476686477661133,
+ "mean_token_accuracy": 0.6839887499809265,
+ "num_tokens": 11583488.0,
+ "step": 707
+ },
+ {
+ "entropy": 1.4392427206039429,
+ "epoch": 1.4303030303030302,
+ "grad_norm": 2.183016777038574,
+ "learning_rate": 3.5717171717171724e-06,
+ "loss": 1.4443378448486328,
+ "mean_token_accuracy": 0.6546775698661804,
+ "num_tokens": 11599872.0,
+ "step": 708
+ },
+ {
+ "entropy": 1.1428641080856323,
+ "epoch": 1.4323232323232324,
+ "grad_norm": 2.0477187633514404,
+ "learning_rate": 3.5696969696969703e-06,
+ "loss": 1.1438124179840088,
+ "mean_token_accuracy": 0.7126282453536987,
+ "num_tokens": 11616256.0,
+ "step": 709
+ },
+ {
+ "entropy": 1.6266967058181763,
+ "epoch": 1.4343434343434343,
+ "grad_norm": 2.322098731994629,
+ "learning_rate": 3.567676767676768e-06,
+ "loss": 1.6161916255950928,
+ "mean_token_accuracy": 0.6202979683876038,
+ "num_tokens": 11632640.0,
+ "step": 710
+ },
+ {
+ "entropy": 1.349686622619629,
+ "epoch": 1.4363636363636363,
+ "grad_norm": 2.021871328353882,
+ "learning_rate": 3.565656565656566e-06,
+ "loss": 1.3713490962982178,
+ "mean_token_accuracy": 0.6596238613128662,
+ "num_tokens": 11649024.0,
+ "step": 711
+ },
+ {
+ "entropy": 1.4476866722106934,
+ "epoch": 1.4383838383838383,
+ "grad_norm": 2.194718837738037,
+ "learning_rate": 3.563636363636364e-06,
+ "loss": 1.4593651294708252,
+ "mean_token_accuracy": 0.6476551294326782,
+ "num_tokens": 11665408.0,
+ "step": 712
+ },
+ {
+ "entropy": 1.625157356262207,
+ "epoch": 1.4404040404040404,
+ "grad_norm": 2.0966169834136963,
+ "learning_rate": 3.5616161616161622e-06,
+ "loss": 1.6374845504760742,
+ "mean_token_accuracy": 0.6293356418609619,
+ "num_tokens": 11681792.0,
+ "step": 713
+ },
+ {
+ "entropy": 1.985729455947876,
+ "epoch": 1.4424242424242424,
+ "grad_norm": 2.129556655883789,
+ "learning_rate": 3.55959595959596e-06,
+ "loss": 2.0454561710357666,
+ "mean_token_accuracy": 0.5728505253791809,
+ "num_tokens": 11698176.0,
+ "step": 714
+ },
+ {
+ "entropy": 1.546321153640747,
+ "epoch": 1.4444444444444444,
+ "grad_norm": 2.1565628051757812,
+ "learning_rate": 3.557575757575758e-06,
+ "loss": 1.5467555522918701,
+ "mean_token_accuracy": 0.6351978778839111,
+ "num_tokens": 11714560.0,
+ "step": 715
+ },
+ {
+ "entropy": 1.3690776824951172,
+ "epoch": 1.4464646464646465,
+ "grad_norm": 2.206984519958496,
+ "learning_rate": 3.555555555555556e-06,
+ "loss": 1.3877894878387451,
+ "mean_token_accuracy": 0.6911333799362183,
+ "num_tokens": 11730944.0,
+ "step": 716
+ },
+ {
+ "entropy": 1.3643333911895752,
+ "epoch": 1.4484848484848485,
+ "grad_norm": 2.0049662590026855,
+ "learning_rate": 3.553535353535354e-06,
+ "loss": 1.364513635635376,
+ "mean_token_accuracy": 0.6781876087188721,
+ "num_tokens": 11747328.0,
+ "step": 717
+ },
+ {
+ "entropy": 1.337018370628357,
+ "epoch": 1.4505050505050505,
+ "grad_norm": 2.0919127464294434,
+ "learning_rate": 3.551515151515152e-06,
+ "loss": 1.3578065633773804,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 11763712.0,
+ "step": 718
+ },
+ {
+ "entropy": 1.3421508073806763,
+ "epoch": 1.4525252525252526,
+ "grad_norm": 2.0651159286499023,
+ "learning_rate": 3.54949494949495e-06,
+ "loss": 1.33928382396698,
+ "mean_token_accuracy": 0.6866145730018616,
+ "num_tokens": 11780096.0,
+ "step": 719
+ },
+ {
+ "entropy": 1.2841005325317383,
+ "epoch": 1.4545454545454546,
+ "grad_norm": 2.124370813369751,
+ "learning_rate": 3.547474747474748e-06,
+ "loss": 1.258314609527588,
+ "mean_token_accuracy": 0.6806302070617676,
+ "num_tokens": 11796480.0,
+ "step": 720
+ },
+ {
+ "entropy": 1.56289803981781,
+ "epoch": 1.4565656565656566,
+ "grad_norm": 1.9271100759506226,
+ "learning_rate": 3.5454545454545458e-06,
+ "loss": 1.5867946147918701,
+ "mean_token_accuracy": 0.6430752277374268,
+ "num_tokens": 11812864.0,
+ "step": 721
+ },
+ {
+ "entropy": 1.3374838829040527,
+ "epoch": 1.4585858585858587,
+ "grad_norm": 2.1113364696502686,
+ "learning_rate": 3.5434343434343437e-06,
+ "loss": 1.327169418334961,
+ "mean_token_accuracy": 0.6806912422180176,
+ "num_tokens": 11829248.0,
+ "step": 722
+ },
+ {
+ "entropy": 1.7233415842056274,
+ "epoch": 1.4606060606060607,
+ "grad_norm": 2.1862399578094482,
+ "learning_rate": 3.5414141414141416e-06,
+ "loss": 1.7290821075439453,
+ "mean_token_accuracy": 0.6056423783302307,
+ "num_tokens": 11845632.0,
+ "step": 723
+ },
+ {
+ "entropy": 1.28484046459198,
+ "epoch": 1.4626262626262627,
+ "grad_norm": 2.0059030055999756,
+ "learning_rate": 3.53939393939394e-06,
+ "loss": 1.2958555221557617,
+ "mean_token_accuracy": 0.6774548292160034,
+ "num_tokens": 11862016.0,
+ "step": 724
+ },
+ {
+ "entropy": 1.2592295408248901,
+ "epoch": 1.4646464646464645,
+ "grad_norm": 1.9422065019607544,
+ "learning_rate": 3.5373737373737378e-06,
+ "loss": 1.2501411437988281,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 11878400.0,
+ "step": 725
+ },
+ {
+ "entropy": 1.3708571195602417,
+ "epoch": 1.4666666666666668,
+ "grad_norm": 2.164499044418335,
+ "learning_rate": 3.5353535353535356e-06,
+ "loss": 1.3901662826538086,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 11894784.0,
+ "step": 726
+ },
+ {
+ "entropy": 1.239045262336731,
+ "epoch": 1.4686868686868686,
+ "grad_norm": 1.9581060409545898,
+ "learning_rate": 3.5333333333333335e-06,
+ "loss": 1.2436164617538452,
+ "mean_token_accuracy": 0.6939423680305481,
+ "num_tokens": 11911168.0,
+ "step": 727
+ },
+ {
+ "entropy": 1.5965995788574219,
+ "epoch": 1.4707070707070706,
+ "grad_norm": 2.343669891357422,
+ "learning_rate": 3.5313131313131314e-06,
+ "loss": 1.5918347835540771,
+ "mean_token_accuracy": 0.6274425983428955,
+ "num_tokens": 11927552.0,
+ "step": 728
+ },
+ {
+ "entropy": 1.1196811199188232,
+ "epoch": 1.4727272727272727,
+ "grad_norm": 2.181840181350708,
+ "learning_rate": 3.5292929292929297e-06,
+ "loss": 1.1142621040344238,
+ "mean_token_accuracy": 0.7192842960357666,
+ "num_tokens": 11943936.0,
+ "step": 729
+ },
+ {
+ "entropy": 1.129361629486084,
+ "epoch": 1.4747474747474747,
+ "grad_norm": 2.065730571746826,
+ "learning_rate": 3.5272727272727276e-06,
+ "loss": 1.143613576889038,
+ "mean_token_accuracy": 0.7145212292671204,
+ "num_tokens": 11960320.0,
+ "step": 730
+ },
+ {
+ "entropy": 1.4940218925476074,
+ "epoch": 1.4767676767676767,
+ "grad_norm": 2.083453893661499,
+ "learning_rate": 3.5252525252525255e-06,
+ "loss": 1.4957321882247925,
+ "mean_token_accuracy": 0.6481436491012573,
+ "num_tokens": 11976704.0,
+ "step": 731
+ },
+ {
+ "entropy": 1.3427786827087402,
+ "epoch": 1.4787878787878788,
+ "grad_norm": 2.0897183418273926,
+ "learning_rate": 3.5232323232323234e-06,
+ "loss": 1.354066014289856,
+ "mean_token_accuracy": 0.6660356521606445,
+ "num_tokens": 11993088.0,
+ "step": 732
+ },
+ {
+ "entropy": 1.3300065994262695,
+ "epoch": 1.4808080808080808,
+ "grad_norm": 2.0537912845611572,
+ "learning_rate": 3.5212121212121213e-06,
+ "loss": 1.3332751989364624,
+ "mean_token_accuracy": 0.6817293763160706,
+ "num_tokens": 12009472.0,
+ "step": 733
+ },
+ {
+ "entropy": 1.0657827854156494,
+ "epoch": 1.4828282828282828,
+ "grad_norm": 1.9099130630493164,
+ "learning_rate": 3.5191919191919196e-06,
+ "loss": 1.067232608795166,
+ "mean_token_accuracy": 0.734245240688324,
+ "num_tokens": 12025856.0,
+ "step": 734
+ },
+ {
+ "entropy": 1.5265862941741943,
+ "epoch": 1.4848484848484849,
+ "grad_norm": 2.100236177444458,
+ "learning_rate": 3.5171717171717175e-06,
+ "loss": 1.5169599056243896,
+ "mean_token_accuracy": 0.6382511258125305,
+ "num_tokens": 12042240.0,
+ "step": 735
+ },
+ {
+ "entropy": 1.4428536891937256,
+ "epoch": 1.486868686868687,
+ "grad_norm": 1.9902187585830688,
+ "learning_rate": 3.5151515151515154e-06,
+ "loss": 1.4398434162139893,
+ "mean_token_accuracy": 0.675500750541687,
+ "num_tokens": 12058624.0,
+ "step": 736
+ },
+ {
+ "entropy": 1.528032660484314,
+ "epoch": 1.488888888888889,
+ "grad_norm": 2.043238878250122,
+ "learning_rate": 3.5131313131313133e-06,
+ "loss": 1.5280101299285889,
+ "mean_token_accuracy": 0.6431363224983215,
+ "num_tokens": 12075008.0,
+ "step": 737
+ },
+ {
+ "entropy": 1.4250329732894897,
+ "epoch": 1.490909090909091,
+ "grad_norm": 1.791640281677246,
+ "learning_rate": 3.511111111111111e-06,
+ "loss": 1.426466464996338,
+ "mean_token_accuracy": 0.6765388250350952,
+ "num_tokens": 12091392.0,
+ "step": 738
+ },
+ {
+ "entropy": 1.1264820098876953,
+ "epoch": 1.492929292929293,
+ "grad_norm": 2.0549607276916504,
+ "learning_rate": 3.509090909090909e-06,
+ "loss": 1.1271553039550781,
+ "mean_token_accuracy": 0.6996213793754578,
+ "num_tokens": 12107776.0,
+ "step": 739
+ },
+ {
+ "entropy": 1.538375735282898,
+ "epoch": 1.494949494949495,
+ "grad_norm": 2.22322940826416,
+ "learning_rate": 3.5070707070707073e-06,
+ "loss": 1.5588887929916382,
+ "mean_token_accuracy": 0.6384953856468201,
+ "num_tokens": 12124160.0,
+ "step": 740
+ },
+ {
+ "entropy": 1.2698255777359009,
+ "epoch": 1.496969696969697,
+ "grad_norm": 2.17710542678833,
+ "learning_rate": 3.5050505050505052e-06,
+ "loss": 1.29567289352417,
+ "mean_token_accuracy": 0.6762945652008057,
+ "num_tokens": 12140544.0,
+ "step": 741
+ },
+ {
+ "entropy": 1.523453950881958,
+ "epoch": 1.4989898989898989,
+ "grad_norm": 2.0350148677825928,
+ "learning_rate": 3.503030303030303e-06,
+ "loss": 1.5341038703918457,
+ "mean_token_accuracy": 0.6367855668067932,
+ "num_tokens": 12156928.0,
+ "step": 742
+ },
+ {
+ "entropy": 1.4250539541244507,
+ "epoch": 1.5010101010101011,
+ "grad_norm": 2.1306707859039307,
+ "learning_rate": 3.501010101010101e-06,
+ "loss": 1.4353611469268799,
+ "mean_token_accuracy": 0.6626160144805908,
+ "num_tokens": 12173312.0,
+ "step": 743
+ },
+ {
+ "entropy": 1.1440296173095703,
+ "epoch": 1.503030303030303,
+ "grad_norm": 2.053969383239746,
+ "learning_rate": 3.498989898989899e-06,
+ "loss": 1.1151821613311768,
+ "mean_token_accuracy": 0.7080483436584473,
+ "num_tokens": 12189696.0,
+ "step": 744
+ },
+ {
+ "entropy": 1.5290073156356812,
+ "epoch": 1.5050505050505052,
+ "grad_norm": 2.0550003051757812,
+ "learning_rate": 3.496969696969697e-06,
+ "loss": 1.5260624885559082,
+ "mean_token_accuracy": 0.6493038535118103,
+ "num_tokens": 12206080.0,
+ "step": 745
+ },
+ {
+ "entropy": 1.1096605062484741,
+ "epoch": 1.507070707070707,
+ "grad_norm": 1.8131766319274902,
+ "learning_rate": 3.494949494949495e-06,
+ "loss": 1.1221846342086792,
+ "mean_token_accuracy": 0.7263678312301636,
+ "num_tokens": 12222464.0,
+ "step": 746
+ },
+ {
+ "entropy": 1.282676339149475,
+ "epoch": 1.509090909090909,
+ "grad_norm": 2.3051960468292236,
+ "learning_rate": 3.492929292929293e-06,
+ "loss": 1.2863187789916992,
+ "mean_token_accuracy": 0.6765388250350952,
+ "num_tokens": 12238848.0,
+ "step": 747
+ },
+ {
+ "entropy": 1.2971303462982178,
+ "epoch": 1.511111111111111,
+ "grad_norm": 2.0721139907836914,
+ "learning_rate": 3.4909090909090913e-06,
+ "loss": 1.3010127544403076,
+ "mean_token_accuracy": 0.6753175258636475,
+ "num_tokens": 12255232.0,
+ "step": 748
+ },
+ {
+ "entropy": 1.3711751699447632,
+ "epoch": 1.513131313131313,
+ "grad_norm": 1.9657210111618042,
+ "learning_rate": 3.4888888888888896e-06,
+ "loss": 1.3703930377960205,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 12271616.0,
+ "step": 749
+ },
+ {
+ "entropy": 1.512154459953308,
+ "epoch": 1.5151515151515151,
+ "grad_norm": 2.214172124862671,
+ "learning_rate": 3.4868686868686875e-06,
+ "loss": 1.5243256092071533,
+ "mean_token_accuracy": 0.6485100388526917,
+ "num_tokens": 12288000.0,
+ "step": 750
+ },
+ {
+ "epoch": 1.5151515151515151,
+ "eval_entropy": 1.4458443743567313,
+ "eval_loss": 1.535510540008545,
+ "eval_mean_token_accuracy": 0.6444821915318889,
+ "eval_num_tokens": 12288000.0,
+ "eval_runtime": 43.8043,
+ "eval_samples_per_second": 22.601,
+ "eval_steps_per_second": 2.831,
+ "step": 750
+ },
+ {
+ "entropy": 1.2052820920944214,
+ "epoch": 1.5171717171717172,
+ "grad_norm": 2.104870319366455,
+ "learning_rate": 3.4848484848484854e-06,
+ "loss": 1.2207554578781128,
+ "mean_token_accuracy": 0.695713222026825,
+ "num_tokens": 12304384.0,
+ "step": 751
+ },
+ {
+ "entropy": 1.732282280921936,
+ "epoch": 1.5191919191919192,
+ "grad_norm": 2.101760149002075,
+ "learning_rate": 3.4828282828282833e-06,
+ "loss": 1.7461241483688354,
+ "mean_token_accuracy": 0.6505251526832581,
+ "num_tokens": 12320768.0,
+ "step": 752
+ },
+ {
+ "entropy": 1.5805878639221191,
+ "epoch": 1.5212121212121212,
+ "grad_norm": 2.139244318008423,
+ "learning_rate": 3.480808080808081e-06,
+ "loss": 1.5813164710998535,
+ "mean_token_accuracy": 0.6281143426895142,
+ "num_tokens": 12337152.0,
+ "step": 753
+ },
+ {
+ "entropy": 1.1882269382476807,
+ "epoch": 1.5232323232323233,
+ "grad_norm": 2.187206745147705,
+ "learning_rate": 3.4787878787878795e-06,
+ "loss": 1.1732902526855469,
+ "mean_token_accuracy": 0.7063385248184204,
+ "num_tokens": 12353536.0,
+ "step": 754
+ },
+ {
+ "entropy": 1.4743424654006958,
+ "epoch": 1.5252525252525253,
+ "grad_norm": 2.12687349319458,
+ "learning_rate": 3.4767676767676774e-06,
+ "loss": 1.4681663513183594,
+ "mean_token_accuracy": 0.6558378338813782,
+ "num_tokens": 12369920.0,
+ "step": 755
+ },
+ {
+ "entropy": 1.5533041954040527,
+ "epoch": 1.5272727272727273,
+ "grad_norm": 2.1306610107421875,
+ "learning_rate": 3.4747474747474752e-06,
+ "loss": 1.5599431991577148,
+ "mean_token_accuracy": 0.6399609446525574,
+ "num_tokens": 12386304.0,
+ "step": 756
+ },
+ {
+ "entropy": 0.8933209180831909,
+ "epoch": 1.5292929292929291,
+ "grad_norm": 2.425602912902832,
+ "learning_rate": 3.472727272727273e-06,
+ "loss": 0.8840203285217285,
+ "mean_token_accuracy": 0.7638006806373596,
+ "num_tokens": 12402688.0,
+ "step": 757
+ },
+ {
+ "entropy": 1.6764189004898071,
+ "epoch": 1.5313131313131314,
+ "grad_norm": 2.0684356689453125,
+ "learning_rate": 3.470707070707071e-06,
+ "loss": 1.6948609352111816,
+ "mean_token_accuracy": 0.6087567210197449,
+ "num_tokens": 12419072.0,
+ "step": 758
+ },
+ {
+ "entropy": 1.1875263452529907,
+ "epoch": 1.5333333333333332,
+ "grad_norm": 2.0625953674316406,
+ "learning_rate": 3.468686868686869e-06,
+ "loss": 1.1840041875839233,
+ "mean_token_accuracy": 0.7067660093307495,
+ "num_tokens": 12435456.0,
+ "step": 759
+ },
+ {
+ "entropy": 1.1589192152023315,
+ "epoch": 1.5353535353535355,
+ "grad_norm": 1.9212846755981445,
+ "learning_rate": 3.4666666666666672e-06,
+ "loss": 1.1537678241729736,
+ "mean_token_accuracy": 0.7107962965965271,
+ "num_tokens": 12451840.0,
+ "step": 760
+ },
+ {
+ "entropy": 0.9687032699584961,
+ "epoch": 1.5373737373737373,
+ "grad_norm": 1.9402192831039429,
+ "learning_rate": 3.464646464646465e-06,
+ "loss": 0.9954442977905273,
+ "mean_token_accuracy": 0.7412676811218262,
+ "num_tokens": 12468224.0,
+ "step": 761
+ },
+ {
+ "entropy": 1.4129019975662231,
+ "epoch": 1.5393939393939395,
+ "grad_norm": 2.0903310775756836,
+ "learning_rate": 3.462626262626263e-06,
+ "loss": 1.4131944179534912,
+ "mean_token_accuracy": 0.6676844358444214,
+ "num_tokens": 12484608.0,
+ "step": 762
+ },
+ {
+ "entropy": 1.5170351266860962,
+ "epoch": 1.5414141414141413,
+ "grad_norm": 2.12807035446167,
+ "learning_rate": 3.460606060606061e-06,
+ "loss": 1.5342246294021606,
+ "mean_token_accuracy": 0.6621885895729065,
+ "num_tokens": 12500992.0,
+ "step": 763
+ },
+ {
+ "entropy": 1.1815718412399292,
+ "epoch": 1.5434343434343434,
+ "grad_norm": 2.2491719722747803,
+ "learning_rate": 3.4585858585858588e-06,
+ "loss": 1.1669261455535889,
+ "mean_token_accuracy": 0.694614052772522,
+ "num_tokens": 12517376.0,
+ "step": 764
+ },
+ {
+ "entropy": 1.547598958015442,
+ "epoch": 1.5454545454545454,
+ "grad_norm": 2.136096954345703,
+ "learning_rate": 3.456565656565657e-06,
+ "loss": 1.5515470504760742,
+ "mean_token_accuracy": 0.648876428604126,
+ "num_tokens": 12533760.0,
+ "step": 765
+ },
+ {
+ "entropy": 0.7156143188476562,
+ "epoch": 1.5474747474747474,
+ "grad_norm": 1.8139498233795166,
+ "learning_rate": 3.454545454545455e-06,
+ "loss": 0.7052675485610962,
+ "mean_token_accuracy": 0.8103932738304138,
+ "num_tokens": 12550144.0,
+ "step": 766
+ },
+ {
+ "entropy": 1.400156855583191,
+ "epoch": 1.5494949494949495,
+ "grad_norm": 2.14924693107605,
+ "learning_rate": 3.452525252525253e-06,
+ "loss": 1.4047740697860718,
+ "mean_token_accuracy": 0.6719589829444885,
+ "num_tokens": 12566528.0,
+ "step": 767
+ },
+ {
+ "entropy": 1.8254657983779907,
+ "epoch": 1.5515151515151515,
+ "grad_norm": 2.1882269382476807,
+ "learning_rate": 3.4505050505050507e-06,
+ "loss": 1.8615440130233765,
+ "mean_token_accuracy": 0.5776746273040771,
+ "num_tokens": 12582912.0,
+ "step": 768
+ },
+ {
+ "entropy": 1.5947710275650024,
+ "epoch": 1.5535353535353535,
+ "grad_norm": 2.3221426010131836,
+ "learning_rate": 3.4484848484848486e-06,
+ "loss": 1.6178712844848633,
+ "mean_token_accuracy": 0.6210918426513672,
+ "num_tokens": 12599296.0,
+ "step": 769
+ },
+ {
+ "entropy": 1.2678714990615845,
+ "epoch": 1.5555555555555556,
+ "grad_norm": 1.970064640045166,
+ "learning_rate": 3.446464646464647e-06,
+ "loss": 1.2646088600158691,
+ "mean_token_accuracy": 0.6990107297897339,
+ "num_tokens": 12615680.0,
+ "step": 770
+ },
+ {
+ "entropy": 1.3723604679107666,
+ "epoch": 1.5575757575757576,
+ "grad_norm": 2.171534776687622,
+ "learning_rate": 3.444444444444445e-06,
+ "loss": 1.3890197277069092,
+ "mean_token_accuracy": 0.6709819436073303,
+ "num_tokens": 12632064.0,
+ "step": 771
+ },
+ {
+ "entropy": 1.0273096561431885,
+ "epoch": 1.5595959595959596,
+ "grad_norm": 2.072798490524292,
+ "learning_rate": 3.4424242424242427e-06,
+ "loss": 1.029193639755249,
+ "mean_token_accuracy": 0.7348558902740479,
+ "num_tokens": 12648448.0,
+ "step": 772
+ },
+ {
+ "entropy": 1.4004037380218506,
+ "epoch": 1.5616161616161617,
+ "grad_norm": 2.111480474472046,
+ "learning_rate": 3.4404040404040406e-06,
+ "loss": 1.4213340282440186,
+ "mean_token_accuracy": 0.660906195640564,
+ "num_tokens": 12664832.0,
+ "step": 773
+ },
+ {
+ "entropy": 1.533424735069275,
+ "epoch": 1.5636363636363635,
+ "grad_norm": 2.0949435234069824,
+ "learning_rate": 3.4383838383838385e-06,
+ "loss": 1.5259253978729248,
+ "mean_token_accuracy": 0.6544333100318909,
+ "num_tokens": 12681216.0,
+ "step": 774
+ },
+ {
+ "entropy": 1.5620275735855103,
+ "epoch": 1.5656565656565657,
+ "grad_norm": 2.339731454849243,
+ "learning_rate": 3.4363636363636364e-06,
+ "loss": 1.5596071481704712,
+ "mean_token_accuracy": 0.6290302872657776,
+ "num_tokens": 12697600.0,
+ "step": 775
+ },
+ {
+ "entropy": 1.3272082805633545,
+ "epoch": 1.5676767676767676,
+ "grad_norm": 2.0871188640594482,
+ "learning_rate": 3.4343434343434347e-06,
+ "loss": 1.3413164615631104,
+ "mean_token_accuracy": 0.6809965968132019,
+ "num_tokens": 12713984.0,
+ "step": 776
+ },
+ {
+ "entropy": 1.202813982963562,
+ "epoch": 1.5696969696969698,
+ "grad_norm": 2.0538578033447266,
+ "learning_rate": 3.4323232323232326e-06,
+ "loss": 1.1947424411773682,
+ "mean_token_accuracy": 0.6969956159591675,
+ "num_tokens": 12730368.0,
+ "step": 777
+ },
+ {
+ "entropy": 1.3332773447036743,
+ "epoch": 1.5717171717171716,
+ "grad_norm": 1.9941202402114868,
+ "learning_rate": 3.4303030303030305e-06,
+ "loss": 1.3345956802368164,
+ "mean_token_accuracy": 0.6761724352836609,
+ "num_tokens": 12746752.0,
+ "step": 778
+ },
+ {
+ "entropy": 1.1724364757537842,
+ "epoch": 1.5737373737373739,
+ "grad_norm": 2.213365316390991,
+ "learning_rate": 3.4282828282828284e-06,
+ "loss": 1.1479787826538086,
+ "mean_token_accuracy": 0.7132999300956726,
+ "num_tokens": 12763136.0,
+ "step": 779
+ },
+ {
+ "entropy": 1.4718358516693115,
+ "epoch": 1.5757575757575757,
+ "grad_norm": 1.9743510484695435,
+ "learning_rate": 3.4262626262626262e-06,
+ "loss": 1.4844720363616943,
+ "mean_token_accuracy": 0.656448483467102,
+ "num_tokens": 12779520.0,
+ "step": 780
+ },
+ {
+ "entropy": 1.362882375717163,
+ "epoch": 1.5777777777777777,
+ "grad_norm": 2.370483875274658,
+ "learning_rate": 3.4242424242424246e-06,
+ "loss": 1.350801706314087,
+ "mean_token_accuracy": 0.6707376837730408,
+ "num_tokens": 12795904.0,
+ "step": 781
+ },
+ {
+ "entropy": 1.8302308320999146,
+ "epoch": 1.5797979797979798,
+ "grad_norm": 2.19045090675354,
+ "learning_rate": 3.4222222222222224e-06,
+ "loss": 1.8371320962905884,
+ "mean_token_accuracy": 0.5929408669471741,
+ "num_tokens": 12812288.0,
+ "step": 782
+ },
+ {
+ "entropy": 1.3435529470443726,
+ "epoch": 1.5818181818181818,
+ "grad_norm": 2.1254351139068604,
+ "learning_rate": 3.4202020202020203e-06,
+ "loss": 1.3621928691864014,
+ "mean_token_accuracy": 0.6867367029190063,
+ "num_tokens": 12828672.0,
+ "step": 783
+ },
+ {
+ "entropy": 1.8402602672576904,
+ "epoch": 1.5838383838383838,
+ "grad_norm": 2.123666524887085,
+ "learning_rate": 3.4181818181818182e-06,
+ "loss": 1.8564848899841309,
+ "mean_token_accuracy": 0.5871397256851196,
+ "num_tokens": 12845056.0,
+ "step": 784
+ },
+ {
+ "entropy": 1.441917896270752,
+ "epoch": 1.5858585858585859,
+ "grad_norm": 2.3286895751953125,
+ "learning_rate": 3.416161616161616e-06,
+ "loss": 1.4724184274673462,
+ "mean_token_accuracy": 0.6438080072402954,
+ "num_tokens": 12861440.0,
+ "step": 785
+ },
+ {
+ "entropy": 1.3071452379226685,
+ "epoch": 1.587878787878788,
+ "grad_norm": 2.149143934249878,
+ "learning_rate": 3.414141414141414e-06,
+ "loss": 1.331390142440796,
+ "mean_token_accuracy": 0.679347813129425,
+ "num_tokens": 12877824.0,
+ "step": 786
+ },
+ {
+ "entropy": 1.3547145128250122,
+ "epoch": 1.58989898989899,
+ "grad_norm": 2.2531180381774902,
+ "learning_rate": 3.4121212121212123e-06,
+ "loss": 1.361851453781128,
+ "mean_token_accuracy": 0.6767830848693848,
+ "num_tokens": 12894208.0,
+ "step": 787
+ },
+ {
+ "entropy": 0.9811291098594666,
+ "epoch": 1.591919191919192,
+ "grad_norm": 2.1053760051727295,
+ "learning_rate": 3.41010101010101e-06,
+ "loss": 0.9885507822036743,
+ "mean_token_accuracy": 0.7480459213256836,
+ "num_tokens": 12910592.0,
+ "step": 788
+ },
+ {
+ "entropy": 1.4940402507781982,
+ "epoch": 1.593939393939394,
+ "grad_norm": 2.240074634552002,
+ "learning_rate": 3.408080808080808e-06,
+ "loss": 1.5014076232910156,
+ "mean_token_accuracy": 0.6441743969917297,
+ "num_tokens": 12926976.0,
+ "step": 789
+ },
+ {
+ "entropy": 1.8134219646453857,
+ "epoch": 1.595959595959596,
+ "grad_norm": 2.040239095687866,
+ "learning_rate": 3.406060606060606e-06,
+ "loss": 1.8437519073486328,
+ "mean_token_accuracy": 0.5904372334480286,
+ "num_tokens": 12943360.0,
+ "step": 790
+ },
+ {
+ "entropy": 1.7233681678771973,
+ "epoch": 1.5979797979797978,
+ "grad_norm": 2.381786823272705,
+ "learning_rate": 3.4040404040404047e-06,
+ "loss": 1.7328217029571533,
+ "mean_token_accuracy": 0.6004518866539001,
+ "num_tokens": 12959744.0,
+ "step": 791
+ },
+ {
+ "entropy": 1.3966271877288818,
+ "epoch": 1.6,
+ "grad_norm": 2.17006778717041,
+ "learning_rate": 3.4020202020202026e-06,
+ "loss": 1.4065337181091309,
+ "mean_token_accuracy": 0.6629824042320251,
+ "num_tokens": 12976128.0,
+ "step": 792
+ },
+ {
+ "entropy": 1.5002557039260864,
+ "epoch": 1.602020202020202,
+ "grad_norm": 2.558037281036377,
+ "learning_rate": 3.4000000000000005e-06,
+ "loss": 1.4841307401657104,
+ "mean_token_accuracy": 0.647838294506073,
+ "num_tokens": 12992512.0,
+ "step": 793
+ },
+ {
+ "entropy": 1.7432687282562256,
+ "epoch": 1.6040404040404042,
+ "grad_norm": 2.134734630584717,
+ "learning_rate": 3.3979797979797984e-06,
+ "loss": 1.7539207935333252,
+ "mean_token_accuracy": 0.6028333902359009,
+ "num_tokens": 13008896.0,
+ "step": 794
+ },
+ {
+ "entropy": 1.4490517377853394,
+ "epoch": 1.606060606060606,
+ "grad_norm": 2.1590232849121094,
+ "learning_rate": 3.3959595959595963e-06,
+ "loss": 1.468411922454834,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 13025280.0,
+ "step": 795
+ },
+ {
+ "entropy": 1.3823497295379639,
+ "epoch": 1.6080808080808082,
+ "grad_norm": 2.1508285999298096,
+ "learning_rate": 3.3939393939393946e-06,
+ "loss": 1.4011330604553223,
+ "mean_token_accuracy": 0.6530898809432983,
+ "num_tokens": 13041664.0,
+ "step": 796
+ },
+ {
+ "entropy": 1.6982436180114746,
+ "epoch": 1.61010101010101,
+ "grad_norm": 2.077131986618042,
+ "learning_rate": 3.3919191919191925e-06,
+ "loss": 1.727889060974121,
+ "mean_token_accuracy": 0.6232290863990784,
+ "num_tokens": 13058048.0,
+ "step": 797
+ },
+ {
+ "entropy": 1.7268915176391602,
+ "epoch": 1.612121212121212,
+ "grad_norm": 2.0703542232513428,
+ "learning_rate": 3.3898989898989903e-06,
+ "loss": 1.7333730459213257,
+ "mean_token_accuracy": 0.6110160946846008,
+ "num_tokens": 13074432.0,
+ "step": 798
+ },
+ {
+ "entropy": 1.6253595352172852,
+ "epoch": 1.614141414141414,
+ "grad_norm": 2.241154432296753,
+ "learning_rate": 3.3878787878787882e-06,
+ "loss": 1.6275582313537598,
+ "mean_token_accuracy": 0.6198094487190247,
+ "num_tokens": 13090816.0,
+ "step": 799
+ },
+ {
+ "entropy": 1.8784692287445068,
+ "epoch": 1.6161616161616161,
+ "grad_norm": 2.505871057510376,
+ "learning_rate": 3.385858585858586e-06,
+ "loss": 1.8784008026123047,
+ "mean_token_accuracy": 0.5944064259529114,
+ "num_tokens": 13107200.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.6161616161616161,
+ "eval_entropy": 1.4455043437980837,
+ "eval_loss": 1.5330992937088013,
+ "eval_mean_token_accuracy": 0.6448845310557273,
+ "eval_num_tokens": 13107200.0,
+ "eval_runtime": 43.766,
+ "eval_samples_per_second": 22.62,
+ "eval_steps_per_second": 2.833,
+ "step": 800
+ },
+ {
+ "entropy": 1.921440601348877,
+ "epoch": 1.6181818181818182,
+ "grad_norm": 2.1760783195495605,
+ "learning_rate": 3.3838383838383844e-06,
+ "loss": 1.9410110712051392,
+ "mean_token_accuracy": 0.5776746273040771,
+ "num_tokens": 13123584.0,
+ "step": 801
+ },
+ {
+ "entropy": 1.4233160018920898,
+ "epoch": 1.6202020202020202,
+ "grad_norm": 2.2687666416168213,
+ "learning_rate": 3.3818181818181823e-06,
+ "loss": 1.4465446472167969,
+ "mean_token_accuracy": 0.6488153338432312,
+ "num_tokens": 13139968.0,
+ "step": 802
+ },
+ {
+ "entropy": 1.697847843170166,
+ "epoch": 1.6222222222222222,
+ "grad_norm": 2.0649187564849854,
+ "learning_rate": 3.37979797979798e-06,
+ "loss": 1.7235385179519653,
+ "mean_token_accuracy": 0.6196262836456299,
+ "num_tokens": 13156352.0,
+ "step": 803
+ },
+ {
+ "entropy": 1.2027701139450073,
+ "epoch": 1.6242424242424243,
+ "grad_norm": 2.0115890502929688,
+ "learning_rate": 3.377777777777778e-06,
+ "loss": 1.1890676021575928,
+ "mean_token_accuracy": 0.6928431987762451,
+ "num_tokens": 13172736.0,
+ "step": 804
+ },
+ {
+ "entropy": 1.4847105741500854,
+ "epoch": 1.6262626262626263,
+ "grad_norm": 2.145098924636841,
+ "learning_rate": 3.375757575757576e-06,
+ "loss": 1.4817116260528564,
+ "mean_token_accuracy": 0.6415486335754395,
+ "num_tokens": 13189120.0,
+ "step": 805
+ },
+ {
+ "entropy": 1.3548893928527832,
+ "epoch": 1.6282828282828283,
+ "grad_norm": 2.3037521839141846,
+ "learning_rate": 3.3737373737373743e-06,
+ "loss": 1.3433952331542969,
+ "mean_token_accuracy": 0.6681729555130005,
+ "num_tokens": 13205504.0,
+ "step": 806
+ },
+ {
+ "entropy": 1.375793218612671,
+ "epoch": 1.6303030303030304,
+ "grad_norm": 2.0814852714538574,
+ "learning_rate": 3.371717171717172e-06,
+ "loss": 1.3506405353546143,
+ "mean_token_accuracy": 0.6634098887443542,
+ "num_tokens": 13221888.0,
+ "step": 807
+ },
+ {
+ "entropy": 1.1417323350906372,
+ "epoch": 1.6323232323232322,
+ "grad_norm": 2.0166866779327393,
+ "learning_rate": 3.36969696969697e-06,
+ "loss": 1.1731860637664795,
+ "mean_token_accuracy": 0.7123839855194092,
+ "num_tokens": 13238272.0,
+ "step": 808
+ },
+ {
+ "entropy": 1.3159022331237793,
+ "epoch": 1.6343434343434344,
+ "grad_norm": 1.9626281261444092,
+ "learning_rate": 3.367676767676768e-06,
+ "loss": 1.3286499977111816,
+ "mean_token_accuracy": 0.675561785697937,
+ "num_tokens": 13254656.0,
+ "step": 809
+ },
+ {
+ "entropy": 1.325775384902954,
+ "epoch": 1.6363636363636362,
+ "grad_norm": 2.1239242553710938,
+ "learning_rate": 3.365656565656566e-06,
+ "loss": 1.345514178276062,
+ "mean_token_accuracy": 0.6780043840408325,
+ "num_tokens": 13271040.0,
+ "step": 810
+ },
+ {
+ "entropy": 1.8307870626449585,
+ "epoch": 1.6383838383838385,
+ "grad_norm": 2.208296298980713,
+ "learning_rate": 3.3636363636363637e-06,
+ "loss": 1.8402234315872192,
+ "mean_token_accuracy": 0.5958719849586487,
+ "num_tokens": 13287424.0,
+ "step": 811
+ },
+ {
+ "entropy": 1.2596150636672974,
+ "epoch": 1.6404040404040403,
+ "grad_norm": 2.0936427116394043,
+ "learning_rate": 3.361616161616162e-06,
+ "loss": 1.2552804946899414,
+ "mean_token_accuracy": 0.6874083876609802,
+ "num_tokens": 13303808.0,
+ "step": 812
+ },
+ {
+ "entropy": 1.2575111389160156,
+ "epoch": 1.6424242424242426,
+ "grad_norm": 2.0232772827148438,
+ "learning_rate": 3.35959595959596e-06,
+ "loss": 1.2805989980697632,
+ "mean_token_accuracy": 0.6916829347610474,
+ "num_tokens": 13320192.0,
+ "step": 813
+ },
+ {
+ "entropy": 1.0270155668258667,
+ "epoch": 1.6444444444444444,
+ "grad_norm": 1.9090715646743774,
+ "learning_rate": 3.357575757575758e-06,
+ "loss": 1.0277824401855469,
+ "mean_token_accuracy": 0.7379091382026672,
+ "num_tokens": 13336576.0,
+ "step": 814
+ },
+ {
+ "entropy": 1.2992243766784668,
+ "epoch": 1.6464646464646466,
+ "grad_norm": 2.1718814373016357,
+ "learning_rate": 3.3555555555555557e-06,
+ "loss": 1.3278638124465942,
+ "mean_token_accuracy": 0.6764777898788452,
+ "num_tokens": 13352960.0,
+ "step": 815
+ },
+ {
+ "entropy": 1.5365362167358398,
+ "epoch": 1.6484848484848484,
+ "grad_norm": 2.0298495292663574,
+ "learning_rate": 3.3535353535353536e-06,
+ "loss": 1.5257508754730225,
+ "mean_token_accuracy": 0.6511358022689819,
+ "num_tokens": 13369344.0,
+ "step": 816
+ },
+ {
+ "entropy": 1.4384456872940063,
+ "epoch": 1.6505050505050505,
+ "grad_norm": 2.375277042388916,
+ "learning_rate": 3.351515151515152e-06,
+ "loss": 1.4287049770355225,
+ "mean_token_accuracy": 0.645639955997467,
+ "num_tokens": 13385728.0,
+ "step": 817
+ },
+ {
+ "entropy": 1.7104265689849854,
+ "epoch": 1.6525252525252525,
+ "grad_norm": 2.052535057067871,
+ "learning_rate": 3.34949494949495e-06,
+ "loss": 1.6971676349639893,
+ "mean_token_accuracy": 0.6159623861312866,
+ "num_tokens": 13402112.0,
+ "step": 818
+ },
+ {
+ "entropy": 1.5908539295196533,
+ "epoch": 1.6545454545454545,
+ "grad_norm": 2.047088861465454,
+ "learning_rate": 3.3474747474747477e-06,
+ "loss": 1.5640246868133545,
+ "mean_token_accuracy": 0.640754759311676,
+ "num_tokens": 13418496.0,
+ "step": 819
+ },
+ {
+ "entropy": 1.3660207986831665,
+ "epoch": 1.6565656565656566,
+ "grad_norm": 2.2711079120635986,
+ "learning_rate": 3.3454545454545456e-06,
+ "loss": 1.3601036071777344,
+ "mean_token_accuracy": 0.6577919125556946,
+ "num_tokens": 13434880.0,
+ "step": 820
+ },
+ {
+ "entropy": 1.5897634029388428,
+ "epoch": 1.6585858585858586,
+ "grad_norm": 2.0869712829589844,
+ "learning_rate": 3.3434343434343435e-06,
+ "loss": 1.5801420211791992,
+ "mean_token_accuracy": 0.6312897205352783,
+ "num_tokens": 13451264.0,
+ "step": 821
+ },
+ {
+ "entropy": 1.428406834602356,
+ "epoch": 1.6606060606060606,
+ "grad_norm": 2.049370765686035,
+ "learning_rate": 3.3414141414141413e-06,
+ "loss": 1.4145596027374268,
+ "mean_token_accuracy": 0.6649975776672363,
+ "num_tokens": 13467648.0,
+ "step": 822
+ },
+ {
+ "entropy": 1.5026675462722778,
+ "epoch": 1.6626262626262627,
+ "grad_norm": 2.157031297683716,
+ "learning_rate": 3.3393939393939397e-06,
+ "loss": 1.4902830123901367,
+ "mean_token_accuracy": 0.6524181962013245,
+ "num_tokens": 13484032.0,
+ "step": 823
+ },
+ {
+ "entropy": 1.4907052516937256,
+ "epoch": 1.6646464646464647,
+ "grad_norm": 2.1476478576660156,
+ "learning_rate": 3.3373737373737375e-06,
+ "loss": 1.5102436542510986,
+ "mean_token_accuracy": 0.6485100388526917,
+ "num_tokens": 13500416.0,
+ "step": 824
+ },
+ {
+ "entropy": 1.4277782440185547,
+ "epoch": 1.6666666666666665,
+ "grad_norm": 2.2880661487579346,
+ "learning_rate": 3.3353535353535354e-06,
+ "loss": 1.4358019828796387,
+ "mean_token_accuracy": 0.6522960662841797,
+ "num_tokens": 13516800.0,
+ "step": 825
+ },
+ {
+ "entropy": 1.5560128688812256,
+ "epoch": 1.6686868686868688,
+ "grad_norm": 2.048403024673462,
+ "learning_rate": 3.3333333333333333e-06,
+ "loss": 1.5472501516342163,
+ "mean_token_accuracy": 0.6488153338432312,
+ "num_tokens": 13533184.0,
+ "step": 826
+ },
+ {
+ "entropy": 1.665900707244873,
+ "epoch": 1.6707070707070706,
+ "grad_norm": 2.0828492641448975,
+ "learning_rate": 3.331313131313131e-06,
+ "loss": 1.6905372142791748,
+ "mean_token_accuracy": 0.629885196685791,
+ "num_tokens": 13549568.0,
+ "step": 827
+ },
+ {
+ "entropy": 1.3484426736831665,
+ "epoch": 1.6727272727272728,
+ "grad_norm": 2.1873531341552734,
+ "learning_rate": 3.3292929292929295e-06,
+ "loss": 1.3510258197784424,
+ "mean_token_accuracy": 0.6721421480178833,
+ "num_tokens": 13565952.0,
+ "step": 828
+ },
+ {
+ "entropy": 1.7577860355377197,
+ "epoch": 1.6747474747474747,
+ "grad_norm": 2.0467135906219482,
+ "learning_rate": 3.3272727272727274e-06,
+ "loss": 1.7791969776153564,
+ "mean_token_accuracy": 0.6028944849967957,
+ "num_tokens": 13582336.0,
+ "step": 829
+ },
+ {
+ "entropy": 1.4549124240875244,
+ "epoch": 1.676767676767677,
+ "grad_norm": 2.2004988193511963,
+ "learning_rate": 3.3252525252525253e-06,
+ "loss": 1.4512457847595215,
+ "mean_token_accuracy": 0.6521128416061401,
+ "num_tokens": 13598720.0,
+ "step": 830
+ },
+ {
+ "entropy": 1.2226758003234863,
+ "epoch": 1.6787878787878787,
+ "grad_norm": 2.0866682529449463,
+ "learning_rate": 3.323232323232323e-06,
+ "loss": 1.226635456085205,
+ "mean_token_accuracy": 0.6969345211982727,
+ "num_tokens": 13615104.0,
+ "step": 831
+ },
+ {
+ "entropy": 0.9826563000679016,
+ "epoch": 1.680808080808081,
+ "grad_norm": 1.9865771532058716,
+ "learning_rate": 3.321212121212121e-06,
+ "loss": 1.009648323059082,
+ "mean_token_accuracy": 0.7507327795028687,
+ "num_tokens": 13631488.0,
+ "step": 832
+ },
+ {
+ "entropy": 1.620038390159607,
+ "epoch": 1.6828282828282828,
+ "grad_norm": 2.1745760440826416,
+ "learning_rate": 3.3191919191919194e-06,
+ "loss": 1.615234136581421,
+ "mean_token_accuracy": 0.6305569410324097,
+ "num_tokens": 13647872.0,
+ "step": 833
+ },
+ {
+ "entropy": 1.4803876876831055,
+ "epoch": 1.6848484848484848,
+ "grad_norm": 2.328029155731201,
+ "learning_rate": 3.3171717171717177e-06,
+ "loss": 1.509049892425537,
+ "mean_token_accuracy": 0.6353810429573059,
+ "num_tokens": 13664256.0,
+ "step": 834
+ },
+ {
+ "entropy": 1.2290453910827637,
+ "epoch": 1.6868686868686869,
+ "grad_norm": 2.1777281761169434,
+ "learning_rate": 3.3151515151515156e-06,
+ "loss": 1.222726583480835,
+ "mean_token_accuracy": 0.6842330098152161,
+ "num_tokens": 13680640.0,
+ "step": 835
+ },
+ {
+ "entropy": 1.1965430974960327,
+ "epoch": 1.6888888888888889,
+ "grad_norm": 2.211397886276245,
+ "learning_rate": 3.3131313131313135e-06,
+ "loss": 1.2027852535247803,
+ "mean_token_accuracy": 0.7028578519821167,
+ "num_tokens": 13697024.0,
+ "step": 836
+ },
+ {
+ "entropy": 1.5326080322265625,
+ "epoch": 1.690909090909091,
+ "grad_norm": 2.8396589756011963,
+ "learning_rate": 3.3111111111111118e-06,
+ "loss": 1.5819613933563232,
+ "mean_token_accuracy": 0.625,
+ "num_tokens": 13713408.0,
+ "step": 837
+ },
+ {
+ "entropy": 1.2514865398406982,
+ "epoch": 1.692929292929293,
+ "grad_norm": 1.923771858215332,
+ "learning_rate": 3.3090909090909097e-06,
+ "loss": 1.2518126964569092,
+ "mean_token_accuracy": 0.6955300569534302,
+ "num_tokens": 13729792.0,
+ "step": 838
+ },
+ {
+ "entropy": 1.3717304468154907,
+ "epoch": 1.694949494949495,
+ "grad_norm": 2.0393056869506836,
+ "learning_rate": 3.3070707070707076e-06,
+ "loss": 1.400814175605774,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 13746176.0,
+ "step": 839
+ },
+ {
+ "entropy": 1.2871394157409668,
+ "epoch": 1.696969696969697,
+ "grad_norm": 2.114823579788208,
+ "learning_rate": 3.3050505050505054e-06,
+ "loss": 1.302154541015625,
+ "mean_token_accuracy": 0.6790425181388855,
+ "num_tokens": 13762560.0,
+ "step": 840
+ },
+ {
+ "entropy": 1.518404483795166,
+ "epoch": 1.698989898989899,
+ "grad_norm": 2.186727523803711,
+ "learning_rate": 3.3030303030303033e-06,
+ "loss": 1.5067068338394165,
+ "mean_token_accuracy": 0.638006865978241,
+ "num_tokens": 13778944.0,
+ "step": 841
+ },
+ {
+ "entropy": 1.5698254108428955,
+ "epoch": 1.7010101010101009,
+ "grad_norm": 2.159721851348877,
+ "learning_rate": 3.3010101010101016e-06,
+ "loss": 1.5568101406097412,
+ "mean_token_accuracy": 0.6398998498916626,
+ "num_tokens": 13795328.0,
+ "step": 842
+ },
+ {
+ "entropy": 1.5159670114517212,
+ "epoch": 1.7030303030303031,
+ "grad_norm": 2.0655386447906494,
+ "learning_rate": 3.2989898989898995e-06,
+ "loss": 1.5152846574783325,
+ "mean_token_accuracy": 0.6441133618354797,
+ "num_tokens": 13811712.0,
+ "step": 843
+ },
+ {
+ "entropy": 1.231048822402954,
+ "epoch": 1.705050505050505,
+ "grad_norm": 1.99764084815979,
+ "learning_rate": 3.2969696969696974e-06,
+ "loss": 1.2419885396957397,
+ "mean_token_accuracy": 0.6936370134353638,
+ "num_tokens": 13828096.0,
+ "step": 844
+ },
+ {
+ "entropy": 1.1431403160095215,
+ "epoch": 1.7070707070707072,
+ "grad_norm": 2.0046544075012207,
+ "learning_rate": 3.2949494949494953e-06,
+ "loss": 1.147315502166748,
+ "mean_token_accuracy": 0.7155593633651733,
+ "num_tokens": 13844480.0,
+ "step": 845
+ },
+ {
+ "entropy": 1.903164267539978,
+ "epoch": 1.709090909090909,
+ "grad_norm": 2.068286418914795,
+ "learning_rate": 3.292929292929293e-06,
+ "loss": 1.9086098670959473,
+ "mean_token_accuracy": 0.5785295367240906,
+ "num_tokens": 13860864.0,
+ "step": 846
+ },
+ {
+ "entropy": 1.028931736946106,
+ "epoch": 1.7111111111111112,
+ "grad_norm": 2.008197546005249,
+ "learning_rate": 3.290909090909091e-06,
+ "loss": 1.0251559019088745,
+ "mean_token_accuracy": 0.7308866381645203,
+ "num_tokens": 13877248.0,
+ "step": 847
+ },
+ {
+ "entropy": 1.8438282012939453,
+ "epoch": 1.713131313131313,
+ "grad_norm": 2.180811882019043,
+ "learning_rate": 3.2888888888888894e-06,
+ "loss": 1.8572561740875244,
+ "mean_token_accuracy": 0.5788959264755249,
+ "num_tokens": 13893632.0,
+ "step": 848
+ },
+ {
+ "entropy": 1.437190294265747,
+ "epoch": 1.7151515151515153,
+ "grad_norm": 2.1013762950897217,
+ "learning_rate": 3.2868686868686873e-06,
+ "loss": 1.4337413311004639,
+ "mean_token_accuracy": 0.6489985585212708,
+ "num_tokens": 13910016.0,
+ "step": 849
+ },
+ {
+ "entropy": 1.482985496520996,
+ "epoch": 1.7171717171717171,
+ "grad_norm": 2.290910243988037,
+ "learning_rate": 3.284848484848485e-06,
+ "loss": 1.4959741830825806,
+ "mean_token_accuracy": 0.6447850465774536,
+ "num_tokens": 13926400.0,
+ "step": 850
+ },
+ {
+ "epoch": 1.7171717171717171,
+ "eval_entropy": 1.447427170411233,
+ "eval_loss": 1.5309957265853882,
+ "eval_mean_token_accuracy": 0.6452888370521607,
+ "eval_num_tokens": 13926400.0,
+ "eval_runtime": 43.7619,
+ "eval_samples_per_second": 22.622,
+ "eval_steps_per_second": 2.834,
+ "step": 850
+ },
+ {
+ "entropy": 1.4470106363296509,
+ "epoch": 1.7191919191919192,
+ "grad_norm": 2.2015624046325684,
+ "learning_rate": 3.282828282828283e-06,
+ "loss": 1.462576150894165,
+ "mean_token_accuracy": 0.643991231918335,
+ "num_tokens": 13942784.0,
+ "step": 851
+ },
+ {
+ "entropy": 1.4063832759857178,
+ "epoch": 1.7212121212121212,
+ "grad_norm": 2.1743109226226807,
+ "learning_rate": 3.280808080808081e-06,
+ "loss": 1.402491569519043,
+ "mean_token_accuracy": 0.6533952355384827,
+ "num_tokens": 13959168.0,
+ "step": 852
+ },
+ {
+ "entropy": 1.3735251426696777,
+ "epoch": 1.7232323232323232,
+ "grad_norm": 2.1350960731506348,
+ "learning_rate": 3.2787878787878793e-06,
+ "loss": 1.383405327796936,
+ "mean_token_accuracy": 0.6767830848693848,
+ "num_tokens": 13975552.0,
+ "step": 853
+ },
+ {
+ "entropy": 1.359702229499817,
+ "epoch": 1.7252525252525253,
+ "grad_norm": 2.1547393798828125,
+ "learning_rate": 3.276767676767677e-06,
+ "loss": 1.3454554080963135,
+ "mean_token_accuracy": 0.6712262034416199,
+ "num_tokens": 13991936.0,
+ "step": 854
+ },
+ {
+ "entropy": 1.0641778707504272,
+ "epoch": 1.7272727272727273,
+ "grad_norm": 2.0301826000213623,
+ "learning_rate": 3.274747474747475e-06,
+ "loss": 1.0626115798950195,
+ "mean_token_accuracy": 0.7188568711280823,
+ "num_tokens": 14008320.0,
+ "step": 855
+ },
+ {
+ "entropy": 1.598792552947998,
+ "epoch": 1.7292929292929293,
+ "grad_norm": 2.3324217796325684,
+ "learning_rate": 3.272727272727273e-06,
+ "loss": 1.6028941869735718,
+ "mean_token_accuracy": 0.6462506055831909,
+ "num_tokens": 14024704.0,
+ "step": 856
+ },
+ {
+ "entropy": 1.6304137706756592,
+ "epoch": 1.7313131313131314,
+ "grad_norm": 1.9968358278274536,
+ "learning_rate": 3.270707070707071e-06,
+ "loss": 1.6449415683746338,
+ "mean_token_accuracy": 0.6322056651115417,
+ "num_tokens": 14041088.0,
+ "step": 857
+ },
+ {
+ "entropy": 1.3219174146652222,
+ "epoch": 1.7333333333333334,
+ "grad_norm": 2.059927225112915,
+ "learning_rate": 3.2686868686868687e-06,
+ "loss": 1.3487168550491333,
+ "mean_token_accuracy": 0.6769052147865295,
+ "num_tokens": 14057472.0,
+ "step": 858
+ },
+ {
+ "entropy": 1.4645651578903198,
+ "epoch": 1.7353535353535352,
+ "grad_norm": 2.068962812423706,
+ "learning_rate": 3.266666666666667e-06,
+ "loss": 1.4480202198028564,
+ "mean_token_accuracy": 0.6521128416061401,
+ "num_tokens": 14073856.0,
+ "step": 859
+ },
+ {
+ "entropy": 1.5005300045013428,
+ "epoch": 1.7373737373737375,
+ "grad_norm": 2.228736162185669,
+ "learning_rate": 3.264646464646465e-06,
+ "loss": 1.5110201835632324,
+ "mean_token_accuracy": 0.6482657790184021,
+ "num_tokens": 14090240.0,
+ "step": 860
+ },
+ {
+ "entropy": 1.1641852855682373,
+ "epoch": 1.7393939393939393,
+ "grad_norm": 2.0611488819122314,
+ "learning_rate": 3.262626262626263e-06,
+ "loss": 1.1905086040496826,
+ "mean_token_accuracy": 0.7104909420013428,
+ "num_tokens": 14106624.0,
+ "step": 861
+ },
+ {
+ "entropy": 1.4315950870513916,
+ "epoch": 1.7414141414141415,
+ "grad_norm": 1.9914237260818481,
+ "learning_rate": 3.2606060606060607e-06,
+ "loss": 1.467012882232666,
+ "mean_token_accuracy": 0.657608687877655,
+ "num_tokens": 14123008.0,
+ "step": 862
+ },
+ {
+ "entropy": 1.5196973085403442,
+ "epoch": 1.7434343434343433,
+ "grad_norm": 2.3258447647094727,
+ "learning_rate": 3.2585858585858586e-06,
+ "loss": 1.5382301807403564,
+ "mean_token_accuracy": 0.6370298266410828,
+ "num_tokens": 14139392.0,
+ "step": 863
+ },
+ {
+ "entropy": 1.5098228454589844,
+ "epoch": 1.7454545454545456,
+ "grad_norm": 2.146327495574951,
+ "learning_rate": 3.256565656565657e-06,
+ "loss": 1.540649652481079,
+ "mean_token_accuracy": 0.6439301371574402,
+ "num_tokens": 14155776.0,
+ "step": 864
+ },
+ {
+ "entropy": 1.128011703491211,
+ "epoch": 1.7474747474747474,
+ "grad_norm": 1.967443823814392,
+ "learning_rate": 3.2545454545454548e-06,
+ "loss": 1.1707985401153564,
+ "mean_token_accuracy": 0.7298485636711121,
+ "num_tokens": 14172160.0,
+ "step": 865
+ },
+ {
+ "entropy": 1.9117931127548218,
+ "epoch": 1.7494949494949497,
+ "grad_norm": 2.097781181335449,
+ "learning_rate": 3.2525252525252527e-06,
+ "loss": 1.9291374683380127,
+ "mean_token_accuracy": 0.580483615398407,
+ "num_tokens": 14188544.0,
+ "step": 866
+ },
+ {
+ "entropy": 1.9053187370300293,
+ "epoch": 1.7515151515151515,
+ "grad_norm": 1.9865039587020874,
+ "learning_rate": 3.2505050505050505e-06,
+ "loss": 1.932790756225586,
+ "mean_token_accuracy": 0.5770639777183533,
+ "num_tokens": 14204928.0,
+ "step": 867
+ },
+ {
+ "entropy": 1.2647870779037476,
+ "epoch": 1.7535353535353535,
+ "grad_norm": 2.099891185760498,
+ "learning_rate": 3.2484848484848484e-06,
+ "loss": 1.281562328338623,
+ "mean_token_accuracy": 0.6938812732696533,
+ "num_tokens": 14221312.0,
+ "step": 868
+ },
+ {
+ "entropy": 1.5446428060531616,
+ "epoch": 1.7555555555555555,
+ "grad_norm": 1.9044189453125,
+ "learning_rate": 3.2464646464646467e-06,
+ "loss": 1.5440425872802734,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 14237696.0,
+ "step": 869
+ },
+ {
+ "entropy": 1.179898977279663,
+ "epoch": 1.7575757575757576,
+ "grad_norm": 2.0257933139801025,
+ "learning_rate": 3.2444444444444446e-06,
+ "loss": 1.1607933044433594,
+ "mean_token_accuracy": 0.7053614854812622,
+ "num_tokens": 14254080.0,
+ "step": 870
+ },
+ {
+ "entropy": 1.0462855100631714,
+ "epoch": 1.7595959595959596,
+ "grad_norm": 1.8995661735534668,
+ "learning_rate": 3.2424242424242425e-06,
+ "loss": 1.0395057201385498,
+ "mean_token_accuracy": 0.7405959963798523,
+ "num_tokens": 14270464.0,
+ "step": 871
+ },
+ {
+ "entropy": 0.8866081833839417,
+ "epoch": 1.7616161616161616,
+ "grad_norm": 1.7807546854019165,
+ "learning_rate": 3.2404040404040404e-06,
+ "loss": 0.8795047998428345,
+ "mean_token_accuracy": 0.7721666097640991,
+ "num_tokens": 14286848.0,
+ "step": 872
+ },
+ {
+ "entropy": 1.9576365947723389,
+ "epoch": 1.7636363636363637,
+ "grad_norm": 2.1867618560791016,
+ "learning_rate": 3.2383838383838383e-06,
+ "loss": 1.9605103731155396,
+ "mean_token_accuracy": 0.5809110999107361,
+ "num_tokens": 14303232.0,
+ "step": 873
+ },
+ {
+ "entropy": 1.010751485824585,
+ "epoch": 1.7656565656565657,
+ "grad_norm": 1.9643300771713257,
+ "learning_rate": 3.236363636363636e-06,
+ "loss": 0.9990894794464111,
+ "mean_token_accuracy": 0.7386419177055359,
+ "num_tokens": 14319616.0,
+ "step": 874
+ },
+ {
+ "entropy": 1.3587232828140259,
+ "epoch": 1.7676767676767677,
+ "grad_norm": 2.2632040977478027,
+ "learning_rate": 3.2343434343434345e-06,
+ "loss": 1.3631021976470947,
+ "mean_token_accuracy": 0.665791392326355,
+ "num_tokens": 14336000.0,
+ "step": 875
+ },
+ {
+ "entropy": 1.6577962636947632,
+ "epoch": 1.7696969696969695,
+ "grad_norm": 2.3661980628967285,
+ "learning_rate": 3.232323232323233e-06,
+ "loss": 1.6802719831466675,
+ "mean_token_accuracy": 0.6024059653282166,
+ "num_tokens": 14352384.0,
+ "step": 876
+ },
+ {
+ "entropy": 1.4332902431488037,
+ "epoch": 1.7717171717171718,
+ "grad_norm": 2.2296342849731445,
+ "learning_rate": 3.2303030303030307e-06,
+ "loss": 1.4129014015197754,
+ "mean_token_accuracy": 0.6511358022689819,
+ "num_tokens": 14368768.0,
+ "step": 877
+ },
+ {
+ "entropy": 1.2260215282440186,
+ "epoch": 1.7737373737373736,
+ "grad_norm": 2.0659983158111572,
+ "learning_rate": 3.228282828282829e-06,
+ "loss": 1.2417192459106445,
+ "mean_token_accuracy": 0.693514883518219,
+ "num_tokens": 14385152.0,
+ "step": 878
+ },
+ {
+ "entropy": 1.5402687788009644,
+ "epoch": 1.7757575757575759,
+ "grad_norm": 2.2024054527282715,
+ "learning_rate": 3.226262626262627e-06,
+ "loss": 1.5535321235656738,
+ "mean_token_accuracy": 0.6331827044487,
+ "num_tokens": 14401536.0,
+ "step": 879
+ },
+ {
+ "entropy": 1.2205268144607544,
+ "epoch": 1.7777777777777777,
+ "grad_norm": 2.0056662559509277,
+ "learning_rate": 3.2242424242424248e-06,
+ "loss": 1.2244641780853271,
+ "mean_token_accuracy": 0.7037127614021301,
+ "num_tokens": 14417920.0,
+ "step": 880
+ },
+ {
+ "entropy": 1.542244791984558,
+ "epoch": 1.77979797979798,
+ "grad_norm": 2.0935254096984863,
+ "learning_rate": 3.2222222222222227e-06,
+ "loss": 1.5638453960418701,
+ "mean_token_accuracy": 0.648937463760376,
+ "num_tokens": 14434304.0,
+ "step": 881
+ },
+ {
+ "entropy": 1.4249905347824097,
+ "epoch": 1.7818181818181817,
+ "grad_norm": 1.9853826761245728,
+ "learning_rate": 3.2202020202020206e-06,
+ "loss": 1.4453399181365967,
+ "mean_token_accuracy": 0.6869809627532959,
+ "num_tokens": 14450688.0,
+ "step": 882
+ },
+ {
+ "entropy": 1.4777165651321411,
+ "epoch": 1.783838383838384,
+ "grad_norm": 2.064542055130005,
+ "learning_rate": 3.2181818181818184e-06,
+ "loss": 1.4756921529769897,
+ "mean_token_accuracy": 0.6640205383300781,
+ "num_tokens": 14467072.0,
+ "step": 883
+ },
+ {
+ "entropy": 1.3442282676696777,
+ "epoch": 1.7858585858585858,
+ "grad_norm": 2.043712854385376,
+ "learning_rate": 3.2161616161616168e-06,
+ "loss": 1.3412827253341675,
+ "mean_token_accuracy": 0.6821568012237549,
+ "num_tokens": 14483456.0,
+ "step": 884
+ },
+ {
+ "entropy": 1.5201579332351685,
+ "epoch": 1.7878787878787878,
+ "grad_norm": 2.060661792755127,
+ "learning_rate": 3.2141414141414146e-06,
+ "loss": 1.5367834568023682,
+ "mean_token_accuracy": 0.6442354917526245,
+ "num_tokens": 14499840.0,
+ "step": 885
+ },
+ {
+ "entropy": 1.1536649465560913,
+ "epoch": 1.7898989898989899,
+ "grad_norm": 2.1190037727355957,
+ "learning_rate": 3.2121212121212125e-06,
+ "loss": 1.1588165760040283,
+ "mean_token_accuracy": 0.7039570212364197,
+ "num_tokens": 14516224.0,
+ "step": 886
+ },
+ {
+ "entropy": 1.109966516494751,
+ "epoch": 1.791919191919192,
+ "grad_norm": 2.0320141315460205,
+ "learning_rate": 3.2101010101010104e-06,
+ "loss": 1.1113003492355347,
+ "mean_token_accuracy": 0.7123228907585144,
+ "num_tokens": 14532608.0,
+ "step": 887
+ },
+ {
+ "entropy": 1.5709099769592285,
+ "epoch": 1.793939393939394,
+ "grad_norm": 2.0467336177825928,
+ "learning_rate": 3.2080808080808083e-06,
+ "loss": 1.5823577642440796,
+ "mean_token_accuracy": 0.6404494643211365,
+ "num_tokens": 14548992.0,
+ "step": 888
+ },
+ {
+ "entropy": 1.4305545091629028,
+ "epoch": 1.795959595959596,
+ "grad_norm": 2.0764269828796387,
+ "learning_rate": 3.2060606060606066e-06,
+ "loss": 1.438415765762329,
+ "mean_token_accuracy": 0.6574255228042603,
+ "num_tokens": 14565376.0,
+ "step": 889
+ },
+ {
+ "entropy": 1.3523615598678589,
+ "epoch": 1.797979797979798,
+ "grad_norm": 2.167036294937134,
+ "learning_rate": 3.2040404040404045e-06,
+ "loss": 1.3782477378845215,
+ "mean_token_accuracy": 0.6645090579986572,
+ "num_tokens": 14581760.0,
+ "step": 890
+ },
+ {
+ "entropy": 1.491297721862793,
+ "epoch": 1.8,
+ "grad_norm": 2.3090412616729736,
+ "learning_rate": 3.2020202020202024e-06,
+ "loss": 1.4965641498565674,
+ "mean_token_accuracy": 0.636907696723938,
+ "num_tokens": 14598144.0,
+ "step": 891
+ },
+ {
+ "entropy": 1.2584501504898071,
+ "epoch": 1.802020202020202,
+ "grad_norm": 2.1699554920196533,
+ "learning_rate": 3.2000000000000003e-06,
+ "loss": 1.2622835636138916,
+ "mean_token_accuracy": 0.6901563405990601,
+ "num_tokens": 14614528.0,
+ "step": 892
+ },
+ {
+ "entropy": 2.149350643157959,
+ "epoch": 1.8040404040404039,
+ "grad_norm": 2.2669718265533447,
+ "learning_rate": 3.197979797979798e-06,
+ "loss": 2.167891263961792,
+ "mean_token_accuracy": 0.5497679710388184,
+ "num_tokens": 14630912.0,
+ "step": 893
+ },
+ {
+ "entropy": 1.1999561786651611,
+ "epoch": 1.8060606060606061,
+ "grad_norm": 2.163228988647461,
+ "learning_rate": 3.195959595959596e-06,
+ "loss": 1.2024329900741577,
+ "mean_token_accuracy": 0.7035906314849854,
+ "num_tokens": 14647296.0,
+ "step": 894
+ },
+ {
+ "entropy": 1.770652413368225,
+ "epoch": 1.808080808080808,
+ "grad_norm": 2.1631994247436523,
+ "learning_rate": 3.1939393939393944e-06,
+ "loss": 1.7568567991256714,
+ "mean_token_accuracy": 0.6030776500701904,
+ "num_tokens": 14663680.0,
+ "step": 895
+ },
+ {
+ "entropy": 1.2487529516220093,
+ "epoch": 1.8101010101010102,
+ "grad_norm": 1.987622857093811,
+ "learning_rate": 3.1919191919191923e-06,
+ "loss": 1.255242109298706,
+ "mean_token_accuracy": 0.6929042339324951,
+ "num_tokens": 14680064.0,
+ "step": 896
+ },
+ {
+ "entropy": 1.138524055480957,
+ "epoch": 1.812121212121212,
+ "grad_norm": 2.0367984771728516,
+ "learning_rate": 3.18989898989899e-06,
+ "loss": 1.1514946222305298,
+ "mean_token_accuracy": 0.7093917727470398,
+ "num_tokens": 14696448.0,
+ "step": 897
+ },
+ {
+ "entropy": 1.3337515592575073,
+ "epoch": 1.8141414141414143,
+ "grad_norm": 1.9483140707015991,
+ "learning_rate": 3.187878787878788e-06,
+ "loss": 1.3251439332962036,
+ "mean_token_accuracy": 0.6861260533332825,
+ "num_tokens": 14712832.0,
+ "step": 898
+ },
+ {
+ "entropy": 1.047120451927185,
+ "epoch": 1.816161616161616,
+ "grad_norm": 2.0481390953063965,
+ "learning_rate": 3.185858585858586e-06,
+ "loss": 1.071772575378418,
+ "mean_token_accuracy": 0.7275891304016113,
+ "num_tokens": 14729216.0,
+ "step": 899
+ },
+ {
+ "entropy": 1.3311363458633423,
+ "epoch": 1.8181818181818183,
+ "grad_norm": 2.3203413486480713,
+ "learning_rate": 3.1838383838383842e-06,
+ "loss": 1.334134817123413,
+ "mean_token_accuracy": 0.6643869280815125,
+ "num_tokens": 14745600.0,
+ "step": 900
+ },
+ {
+ "epoch": 1.8181818181818183,
+ "eval_entropy": 1.4476436400605786,
+ "eval_loss": 1.5290467739105225,
+ "eval_mean_token_accuracy": 0.6456143543604882,
+ "eval_num_tokens": 14745600.0,
+ "eval_runtime": 43.8113,
+ "eval_samples_per_second": 22.597,
+ "eval_steps_per_second": 2.83,
+ "step": 900
+ },
+ {
+ "entropy": 1.6842114925384521,
+ "epoch": 1.8202020202020202,
+ "grad_norm": 2.1709823608398438,
+ "learning_rate": 3.181818181818182e-06,
+ "loss": 1.6816682815551758,
+ "mean_token_accuracy": 0.6033830046653748,
+ "num_tokens": 14761984.0,
+ "step": 901
+ },
+ {
+ "entropy": 1.2661798000335693,
+ "epoch": 1.8222222222222222,
+ "grad_norm": 2.113783836364746,
+ "learning_rate": 3.17979797979798e-06,
+ "loss": 1.249183177947998,
+ "mean_token_accuracy": 0.6865534782409668,
+ "num_tokens": 14778368.0,
+ "step": 902
+ },
+ {
+ "entropy": 1.2666339874267578,
+ "epoch": 1.8242424242424242,
+ "grad_norm": 2.0210978984832764,
+ "learning_rate": 3.177777777777778e-06,
+ "loss": 1.2548515796661377,
+ "mean_token_accuracy": 0.686431348323822,
+ "num_tokens": 14794752.0,
+ "step": 903
+ },
+ {
+ "entropy": 1.1660066843032837,
+ "epoch": 1.8262626262626263,
+ "grad_norm": 2.0998034477233887,
+ "learning_rate": 3.1757575757575758e-06,
+ "loss": 1.1654324531555176,
+ "mean_token_accuracy": 0.695713222026825,
+ "num_tokens": 14811136.0,
+ "step": 904
+ },
+ {
+ "entropy": 1.2902735471725464,
+ "epoch": 1.8282828282828283,
+ "grad_norm": 2.1510303020477295,
+ "learning_rate": 3.173737373737374e-06,
+ "loss": 1.2879812717437744,
+ "mean_token_accuracy": 0.6693942546844482,
+ "num_tokens": 14827520.0,
+ "step": 905
+ },
+ {
+ "entropy": 1.1441799402236938,
+ "epoch": 1.8303030303030303,
+ "grad_norm": 1.989449143409729,
+ "learning_rate": 3.171717171717172e-06,
+ "loss": 1.1552281379699707,
+ "mean_token_accuracy": 0.7127503752708435,
+ "num_tokens": 14843904.0,
+ "step": 906
+ },
+ {
+ "entropy": 1.08464515209198,
+ "epoch": 1.8323232323232324,
+ "grad_norm": 2.094696044921875,
+ "learning_rate": 3.16969696969697e-06,
+ "loss": 1.0758531093597412,
+ "mean_token_accuracy": 0.7164142727851868,
+ "num_tokens": 14860288.0,
+ "step": 907
+ },
+ {
+ "entropy": 1.3847618103027344,
+ "epoch": 1.8343434343434344,
+ "grad_norm": 2.207976818084717,
+ "learning_rate": 3.1676767676767678e-06,
+ "loss": 1.3722931146621704,
+ "mean_token_accuracy": 0.6741573214530945,
+ "num_tokens": 14876672.0,
+ "step": 908
+ },
+ {
+ "entropy": 1.3558534383773804,
+ "epoch": 1.8363636363636364,
+ "grad_norm": 2.166674852371216,
+ "learning_rate": 3.1656565656565656e-06,
+ "loss": 1.3612618446350098,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 14893056.0,
+ "step": 909
+ },
+ {
+ "entropy": 1.4160822629928589,
+ "epoch": 1.8383838383838382,
+ "grad_norm": 2.2242727279663086,
+ "learning_rate": 3.1636363636363635e-06,
+ "loss": 1.408278226852417,
+ "mean_token_accuracy": 0.6634098887443542,
+ "num_tokens": 14909440.0,
+ "step": 910
+ },
+ {
+ "entropy": 1.1337573528289795,
+ "epoch": 1.8404040404040405,
+ "grad_norm": 2.1882550716400146,
+ "learning_rate": 3.161616161616162e-06,
+ "loss": 1.1503205299377441,
+ "mean_token_accuracy": 0.7059721350669861,
+ "num_tokens": 14925824.0,
+ "step": 911
+ },
+ {
+ "entropy": 1.4373403787612915,
+ "epoch": 1.8424242424242423,
+ "grad_norm": 2.1595654487609863,
+ "learning_rate": 3.1595959595959597e-06,
+ "loss": 1.4344165325164795,
+ "mean_token_accuracy": 0.6599902510643005,
+ "num_tokens": 14942208.0,
+ "step": 912
+ },
+ {
+ "entropy": 1.0798827409744263,
+ "epoch": 1.8444444444444446,
+ "grad_norm": 2.101088047027588,
+ "learning_rate": 3.1575757575757576e-06,
+ "loss": 1.0873513221740723,
+ "mean_token_accuracy": 0.7169027924537659,
+ "num_tokens": 14958592.0,
+ "step": 913
+ },
+ {
+ "entropy": 1.7024599313735962,
+ "epoch": 1.8464646464646464,
+ "grad_norm": 2.291907548904419,
+ "learning_rate": 3.1555555555555555e-06,
+ "loss": 1.7014999389648438,
+ "mean_token_accuracy": 0.6105275750160217,
+ "num_tokens": 14974976.0,
+ "step": 914
+ },
+ {
+ "entropy": 1.7765953540802002,
+ "epoch": 1.8484848484848486,
+ "grad_norm": 2.1465439796447754,
+ "learning_rate": 3.1535353535353534e-06,
+ "loss": 1.788269281387329,
+ "mean_token_accuracy": 0.6066194176673889,
+ "num_tokens": 14991360.0,
+ "step": 915
+ },
+ {
+ "entropy": 1.5223884582519531,
+ "epoch": 1.8505050505050504,
+ "grad_norm": 2.313291549682617,
+ "learning_rate": 3.1515151515151517e-06,
+ "loss": 1.55397367477417,
+ "mean_token_accuracy": 0.6377626061439514,
+ "num_tokens": 15007744.0,
+ "step": 916
+ },
+ {
+ "entropy": 1.5820955038070679,
+ "epoch": 1.8525252525252527,
+ "grad_norm": 2.094886541366577,
+ "learning_rate": 3.1494949494949496e-06,
+ "loss": 1.58372962474823,
+ "mean_token_accuracy": 0.6339154839515686,
+ "num_tokens": 15024128.0,
+ "step": 917
+ },
+ {
+ "entropy": 1.7399076223373413,
+ "epoch": 1.8545454545454545,
+ "grad_norm": 2.0311105251312256,
+ "learning_rate": 3.1474747474747475e-06,
+ "loss": 1.7362079620361328,
+ "mean_token_accuracy": 0.604421079158783,
+ "num_tokens": 15040512.0,
+ "step": 918
+ },
+ {
+ "entropy": 1.4311537742614746,
+ "epoch": 1.8565656565656565,
+ "grad_norm": 2.13740873336792,
+ "learning_rate": 3.145454545454546e-06,
+ "loss": 1.4574000835418701,
+ "mean_token_accuracy": 0.648876428604126,
+ "num_tokens": 15056896.0,
+ "step": 919
+ },
+ {
+ "entropy": 1.6997709274291992,
+ "epoch": 1.8585858585858586,
+ "grad_norm": 2.1604959964752197,
+ "learning_rate": 3.143434343434344e-06,
+ "loss": 1.694093942642212,
+ "mean_token_accuracy": 0.6144357323646545,
+ "num_tokens": 15073280.0,
+ "step": 920
+ },
+ {
+ "entropy": 1.5796921253204346,
+ "epoch": 1.8606060606060606,
+ "grad_norm": 2.3852932453155518,
+ "learning_rate": 3.141414141414142e-06,
+ "loss": 1.5799579620361328,
+ "mean_token_accuracy": 0.6322667598724365,
+ "num_tokens": 15089664.0,
+ "step": 921
+ },
+ {
+ "entropy": 1.6185977458953857,
+ "epoch": 1.8626262626262626,
+ "grad_norm": 2.0631208419799805,
+ "learning_rate": 3.13939393939394e-06,
+ "loss": 1.6541715860366821,
+ "mean_token_accuracy": 0.632083535194397,
+ "num_tokens": 15106048.0,
+ "step": 922
+ },
+ {
+ "entropy": 1.5872372388839722,
+ "epoch": 1.8646464646464647,
+ "grad_norm": 2.154554843902588,
+ "learning_rate": 3.1373737373737378e-06,
+ "loss": 1.5946767330169678,
+ "mean_token_accuracy": 0.6294577717781067,
+ "num_tokens": 15122432.0,
+ "step": 923
+ },
+ {
+ "entropy": 1.6059986352920532,
+ "epoch": 1.8666666666666667,
+ "grad_norm": 1.9893742799758911,
+ "learning_rate": 3.1353535353535357e-06,
+ "loss": 1.6153039932250977,
+ "mean_token_accuracy": 0.6373962163925171,
+ "num_tokens": 15138816.0,
+ "step": 924
+ },
+ {
+ "entropy": 1.3143881559371948,
+ "epoch": 1.8686868686868687,
+ "grad_norm": 1.8989832401275635,
+ "learning_rate": 3.133333333333334e-06,
+ "loss": 1.3332319259643555,
+ "mean_token_accuracy": 0.6842330098152161,
+ "num_tokens": 15155200.0,
+ "step": 925
+ },
+ {
+ "entropy": 1.0474469661712646,
+ "epoch": 1.8707070707070708,
+ "grad_norm": 1.9129916429519653,
+ "learning_rate": 3.131313131313132e-06,
+ "loss": 1.0238264799118042,
+ "mean_token_accuracy": 0.7459697127342224,
+ "num_tokens": 15171584.0,
+ "step": 926
+ },
+ {
+ "entropy": 1.581508994102478,
+ "epoch": 1.8727272727272726,
+ "grad_norm": 2.0047285556793213,
+ "learning_rate": 3.1292929292929297e-06,
+ "loss": 1.6087100505828857,
+ "mean_token_accuracy": 0.6282364726066589,
+ "num_tokens": 15187968.0,
+ "step": 927
+ },
+ {
+ "entropy": 1.0985661745071411,
+ "epoch": 1.8747474747474748,
+ "grad_norm": 2.1207540035247803,
+ "learning_rate": 3.1272727272727276e-06,
+ "loss": 1.1158297061920166,
+ "mean_token_accuracy": 0.7111626863479614,
+ "num_tokens": 15204352.0,
+ "step": 928
+ },
+ {
+ "entropy": 1.4591490030288696,
+ "epoch": 1.8767676767676766,
+ "grad_norm": 2.2879691123962402,
+ "learning_rate": 3.1252525252525255e-06,
+ "loss": 1.4775316715240479,
+ "mean_token_accuracy": 0.6477161645889282,
+ "num_tokens": 15220736.0,
+ "step": 929
+ },
+ {
+ "entropy": 1.5469937324523926,
+ "epoch": 1.878787878787879,
+ "grad_norm": 2.0972726345062256,
+ "learning_rate": 3.1232323232323234e-06,
+ "loss": 1.5949021577835083,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 15237120.0,
+ "step": 930
+ },
+ {
+ "entropy": 1.363472819328308,
+ "epoch": 1.8808080808080807,
+ "grad_norm": 2.149606943130493,
+ "learning_rate": 3.1212121212121217e-06,
+ "loss": 1.358612298965454,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 15253504.0,
+ "step": 931
+ },
+ {
+ "entropy": 1.189648985862732,
+ "epoch": 1.882828282828283,
+ "grad_norm": 2.2575035095214844,
+ "learning_rate": 3.1191919191919196e-06,
+ "loss": 1.209303379058838,
+ "mean_token_accuracy": 0.7002320289611816,
+ "num_tokens": 15269888.0,
+ "step": 932
+ },
+ {
+ "entropy": 1.3054684400558472,
+ "epoch": 1.8848484848484848,
+ "grad_norm": 2.243915319442749,
+ "learning_rate": 3.1171717171717175e-06,
+ "loss": 1.333367109298706,
+ "mean_token_accuracy": 0.6703712940216064,
+ "num_tokens": 15286272.0,
+ "step": 933
+ },
+ {
+ "entropy": 1.6298167705535889,
+ "epoch": 1.886868686868687,
+ "grad_norm": 1.9654396772384644,
+ "learning_rate": 3.1151515151515154e-06,
+ "loss": 1.6496453285217285,
+ "mean_token_accuracy": 0.6248778700828552,
+ "num_tokens": 15302656.0,
+ "step": 934
+ },
+ {
+ "entropy": 1.1228219270706177,
+ "epoch": 1.8888888888888888,
+ "grad_norm": 2.2492377758026123,
+ "learning_rate": 3.1131313131313133e-06,
+ "loss": 1.1560063362121582,
+ "mean_token_accuracy": 0.699499249458313,
+ "num_tokens": 15319040.0,
+ "step": 935
+ },
+ {
+ "entropy": 1.7481759786605835,
+ "epoch": 1.8909090909090909,
+ "grad_norm": 2.1635665893554688,
+ "learning_rate": 3.1111111111111116e-06,
+ "loss": 1.737868070602417,
+ "mean_token_accuracy": 0.6030776500701904,
+ "num_tokens": 15335424.0,
+ "step": 936
+ },
+ {
+ "entropy": 1.3964993953704834,
+ "epoch": 1.892929292929293,
+ "grad_norm": 2.262946367263794,
+ "learning_rate": 3.1090909090909095e-06,
+ "loss": 1.3927817344665527,
+ "mean_token_accuracy": 0.6546775698661804,
+ "num_tokens": 15351808.0,
+ "step": 937
+ },
+ {
+ "entropy": 1.2503907680511475,
+ "epoch": 1.894949494949495,
+ "grad_norm": 1.9837188720703125,
+ "learning_rate": 3.1070707070707074e-06,
+ "loss": 1.2529189586639404,
+ "mean_token_accuracy": 0.6965681314468384,
+ "num_tokens": 15368192.0,
+ "step": 938
+ },
+ {
+ "entropy": 0.9774144291877747,
+ "epoch": 1.896969696969697,
+ "grad_norm": 1.9201257228851318,
+ "learning_rate": 3.1050505050505052e-06,
+ "loss": 0.9864459037780762,
+ "mean_token_accuracy": 0.7534807324409485,
+ "num_tokens": 15384576.0,
+ "step": 939
+ },
+ {
+ "entropy": 1.4065781831741333,
+ "epoch": 1.898989898989899,
+ "grad_norm": 2.357865571975708,
+ "learning_rate": 3.103030303030303e-06,
+ "loss": 1.428115725517273,
+ "mean_token_accuracy": 0.6493649482727051,
+ "num_tokens": 15400960.0,
+ "step": 940
+ },
+ {
+ "entropy": 1.1632903814315796,
+ "epoch": 1.901010101010101,
+ "grad_norm": 1.8824918270111084,
+ "learning_rate": 3.1010101010101014e-06,
+ "loss": 1.1478252410888672,
+ "mean_token_accuracy": 0.7158036231994629,
+ "num_tokens": 15417344.0,
+ "step": 941
+ },
+ {
+ "entropy": 1.7470908164978027,
+ "epoch": 1.903030303030303,
+ "grad_norm": 2.2958669662475586,
+ "learning_rate": 3.0989898989898993e-06,
+ "loss": 1.7697877883911133,
+ "mean_token_accuracy": 0.5892769694328308,
+ "num_tokens": 15433728.0,
+ "step": 942
+ },
+ {
+ "entropy": 1.2897151708602905,
+ "epoch": 1.905050505050505,
+ "grad_norm": 2.155731439590454,
+ "learning_rate": 3.0969696969696972e-06,
+ "loss": 1.2971919775009155,
+ "mean_token_accuracy": 0.6731802821159363,
+ "num_tokens": 15450112.0,
+ "step": 943
+ },
+ {
+ "entropy": 1.2687026262283325,
+ "epoch": 1.907070707070707,
+ "grad_norm": 2.0896284580230713,
+ "learning_rate": 3.094949494949495e-06,
+ "loss": 1.2423906326293945,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 15466496.0,
+ "step": 944
+ },
+ {
+ "entropy": 1.5710495710372925,
+ "epoch": 1.9090909090909092,
+ "grad_norm": 2.200758457183838,
+ "learning_rate": 3.092929292929293e-06,
+ "loss": 1.5329574346542358,
+ "mean_token_accuracy": 0.6560820937156677,
+ "num_tokens": 15482880.0,
+ "step": 945
+ },
+ {
+ "entropy": 1.1555253267288208,
+ "epoch": 1.911111111111111,
+ "grad_norm": 2.278230905532837,
+ "learning_rate": 3.090909090909091e-06,
+ "loss": 1.1469731330871582,
+ "mean_token_accuracy": 0.7220932841300964,
+ "num_tokens": 15499264.0,
+ "step": 946
+ },
+ {
+ "entropy": 1.2870018482208252,
+ "epoch": 1.9131313131313132,
+ "grad_norm": 1.8973854780197144,
+ "learning_rate": 3.088888888888889e-06,
+ "loss": 1.2787907123565674,
+ "mean_token_accuracy": 0.6885075569152832,
+ "num_tokens": 15515648.0,
+ "step": 947
+ },
+ {
+ "entropy": 1.324872612953186,
+ "epoch": 1.915151515151515,
+ "grad_norm": 2.1889214515686035,
+ "learning_rate": 3.086868686868687e-06,
+ "loss": 1.3286981582641602,
+ "mean_token_accuracy": 0.6743404865264893,
+ "num_tokens": 15532032.0,
+ "step": 948
+ },
+ {
+ "entropy": 1.5601656436920166,
+ "epoch": 1.9171717171717173,
+ "grad_norm": 2.304993152618408,
+ "learning_rate": 3.084848484848485e-06,
+ "loss": 1.5766493082046509,
+ "mean_token_accuracy": 0.6172447204589844,
+ "num_tokens": 15548416.0,
+ "step": 949
+ },
+ {
+ "entropy": 1.4633477926254272,
+ "epoch": 1.9191919191919191,
+ "grad_norm": 1.9083963632583618,
+ "learning_rate": 3.082828282828283e-06,
+ "loss": 1.4554777145385742,
+ "mean_token_accuracy": 0.6667073965072632,
+ "num_tokens": 15564800.0,
+ "step": 950
+ },
+ {
+ "epoch": 1.9191919191919191,
+ "eval_entropy": 1.4443931824737979,
+ "eval_loss": 1.5272752046585083,
+ "eval_mean_token_accuracy": 0.6459201723337173,
+ "eval_num_tokens": 15564800.0,
+ "eval_runtime": 43.7243,
+ "eval_samples_per_second": 22.642,
+ "eval_steps_per_second": 2.836,
+ "step": 950
+ },
+ {
+ "entropy": 1.3350679874420166,
+ "epoch": 1.9212121212121214,
+ "grad_norm": 2.139172315597534,
+ "learning_rate": 3.0808080808080807e-06,
+ "loss": 1.3285927772521973,
+ "mean_token_accuracy": 0.6833781003952026,
+ "num_tokens": 15581184.0,
+ "step": 951
+ },
+ {
+ "entropy": 1.2373814582824707,
+ "epoch": 1.9232323232323232,
+ "grad_norm": 2.1068115234375,
+ "learning_rate": 3.078787878787879e-06,
+ "loss": 1.2527921199798584,
+ "mean_token_accuracy": 0.6969345211982727,
+ "num_tokens": 15597568.0,
+ "step": 952
+ },
+ {
+ "entropy": 1.2182631492614746,
+ "epoch": 1.9252525252525252,
+ "grad_norm": 2.1326634883880615,
+ "learning_rate": 3.076767676767677e-06,
+ "loss": 1.2174904346466064,
+ "mean_token_accuracy": 0.6905227303504944,
+ "num_tokens": 15613952.0,
+ "step": 953
+ },
+ {
+ "entropy": 0.9768888354301453,
+ "epoch": 1.9272727272727272,
+ "grad_norm": 1.9833085536956787,
+ "learning_rate": 3.074747474747475e-06,
+ "loss": 0.9956569671630859,
+ "mean_token_accuracy": 0.7401685118675232,
+ "num_tokens": 15630336.0,
+ "step": 954
+ },
+ {
+ "entropy": 0.7818430066108704,
+ "epoch": 1.9292929292929293,
+ "grad_norm": 1.9219205379486084,
+ "learning_rate": 3.0727272727272727e-06,
+ "loss": 0.7922182083129883,
+ "mean_token_accuracy": 0.7827919125556946,
+ "num_tokens": 15646720.0,
+ "step": 955
+ },
+ {
+ "entropy": 1.6172020435333252,
+ "epoch": 1.9313131313131313,
+ "grad_norm": 1.9390695095062256,
+ "learning_rate": 3.0707070707070706e-06,
+ "loss": 1.6629729270935059,
+ "mean_token_accuracy": 0.6192598938941956,
+ "num_tokens": 15663104.0,
+ "step": 956
+ },
+ {
+ "entropy": 1.291207194328308,
+ "epoch": 1.9333333333333333,
+ "grad_norm": 1.9242857694625854,
+ "learning_rate": 3.068686868686869e-06,
+ "loss": 1.2721552848815918,
+ "mean_token_accuracy": 0.6867367029190063,
+ "num_tokens": 15679488.0,
+ "step": 957
+ },
+ {
+ "entropy": 1.3730298280715942,
+ "epoch": 1.9353535353535354,
+ "grad_norm": 1.9483041763305664,
+ "learning_rate": 3.066666666666667e-06,
+ "loss": 1.3835055828094482,
+ "mean_token_accuracy": 0.6745237112045288,
+ "num_tokens": 15695872.0,
+ "step": 958
+ },
+ {
+ "entropy": 1.1266423463821411,
+ "epoch": 1.9373737373737374,
+ "grad_norm": 2.1663992404937744,
+ "learning_rate": 3.0646464646464647e-06,
+ "loss": 1.1091173887252808,
+ "mean_token_accuracy": 0.7151318788528442,
+ "num_tokens": 15712256.0,
+ "step": 959
+ },
+ {
+ "entropy": 1.298812747001648,
+ "epoch": 1.9393939393939394,
+ "grad_norm": 2.0564448833465576,
+ "learning_rate": 3.0626262626262626e-06,
+ "loss": 1.3167932033538818,
+ "mean_token_accuracy": 0.6812408566474915,
+ "num_tokens": 15728640.0,
+ "step": 960
+ },
+ {
+ "entropy": 1.7007938623428345,
+ "epoch": 1.9414141414141413,
+ "grad_norm": 2.1043670177459717,
+ "learning_rate": 3.0606060606060605e-06,
+ "loss": 1.6956250667572021,
+ "mean_token_accuracy": 0.6194430589675903,
+ "num_tokens": 15745024.0,
+ "step": 961
+ },
+ {
+ "entropy": 1.408955693244934,
+ "epoch": 1.9434343434343435,
+ "grad_norm": 2.0432121753692627,
+ "learning_rate": 3.058585858585859e-06,
+ "loss": 1.3905062675476074,
+ "mean_token_accuracy": 0.6662799119949341,
+ "num_tokens": 15761408.0,
+ "step": 962
+ },
+ {
+ "entropy": 1.938867211341858,
+ "epoch": 1.9454545454545453,
+ "grad_norm": 2.3359744548797607,
+ "learning_rate": 3.056565656565657e-06,
+ "loss": 1.9670305252075195,
+ "mean_token_accuracy": 0.5845139026641846,
+ "num_tokens": 15777792.0,
+ "step": 963
+ },
+ {
+ "entropy": 1.5049448013305664,
+ "epoch": 1.9474747474747476,
+ "grad_norm": 2.1907997131347656,
+ "learning_rate": 3.054545454545455e-06,
+ "loss": 1.534651756286621,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 15794176.0,
+ "step": 964
+ },
+ {
+ "entropy": 1.1916700601577759,
+ "epoch": 1.9494949494949494,
+ "grad_norm": 2.098696231842041,
+ "learning_rate": 3.052525252525253e-06,
+ "loss": 1.191361904144287,
+ "mean_token_accuracy": 0.715192973613739,
+ "num_tokens": 15810560.0,
+ "step": 965
+ },
+ {
+ "entropy": 1.6707743406295776,
+ "epoch": 1.9515151515151516,
+ "grad_norm": 2.106846570968628,
+ "learning_rate": 3.0505050505050508e-06,
+ "loss": 1.6789159774780273,
+ "mean_token_accuracy": 0.6133365631103516,
+ "num_tokens": 15826944.0,
+ "step": 966
+ },
+ {
+ "entropy": 1.4679991006851196,
+ "epoch": 1.9535353535353535,
+ "grad_norm": 2.1568050384521484,
+ "learning_rate": 3.048484848484849e-06,
+ "loss": 1.4427556991577148,
+ "mean_token_accuracy": 0.6526013612747192,
+ "num_tokens": 15843328.0,
+ "step": 967
+ },
+ {
+ "entropy": 0.9881705641746521,
+ "epoch": 1.9555555555555557,
+ "grad_norm": 2.029680013656616,
+ "learning_rate": 3.046464646464647e-06,
+ "loss": 0.9961811304092407,
+ "mean_token_accuracy": 0.7408402562141418,
+ "num_tokens": 15859712.0,
+ "step": 968
+ },
+ {
+ "entropy": 1.0721628665924072,
+ "epoch": 1.9575757575757575,
+ "grad_norm": 1.9763140678405762,
+ "learning_rate": 3.044444444444445e-06,
+ "loss": 1.067029356956482,
+ "mean_token_accuracy": 0.733146071434021,
+ "num_tokens": 15876096.0,
+ "step": 969
+ },
+ {
+ "entropy": 1.7053834199905396,
+ "epoch": 1.9595959595959596,
+ "grad_norm": 2.3659849166870117,
+ "learning_rate": 3.0424242424242427e-06,
+ "loss": 1.7629203796386719,
+ "mean_token_accuracy": 0.6105275750160217,
+ "num_tokens": 15892480.0,
+ "step": 970
+ },
+ {
+ "entropy": 1.8083471059799194,
+ "epoch": 1.9616161616161616,
+ "grad_norm": 2.081869602203369,
+ "learning_rate": 3.0404040404040406e-06,
+ "loss": 1.8430367708206177,
+ "mean_token_accuracy": 0.6009404063224792,
+ "num_tokens": 15908864.0,
+ "step": 971
+ },
+ {
+ "entropy": 1.2576755285263062,
+ "epoch": 1.9636363636363636,
+ "grad_norm": 2.128230571746826,
+ "learning_rate": 3.038383838383839e-06,
+ "loss": 1.2493822574615479,
+ "mean_token_accuracy": 0.6913776397705078,
+ "num_tokens": 15925248.0,
+ "step": 972
+ },
+ {
+ "entropy": 0.8995128273963928,
+ "epoch": 1.9656565656565657,
+ "grad_norm": 2.0216031074523926,
+ "learning_rate": 3.036363636363637e-06,
+ "loss": 0.9069615602493286,
+ "mean_token_accuracy": 0.7620908617973328,
+ "num_tokens": 15941632.0,
+ "step": 973
+ },
+ {
+ "entropy": 1.615832805633545,
+ "epoch": 1.9676767676767677,
+ "grad_norm": 2.26552152633667,
+ "learning_rate": 3.0343434343434347e-06,
+ "loss": 1.6284873485565186,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 15958016.0,
+ "step": 974
+ },
+ {
+ "entropy": 1.404674768447876,
+ "epoch": 1.9696969696969697,
+ "grad_norm": 2.1790690422058105,
+ "learning_rate": 3.0323232323232326e-06,
+ "loss": 1.4130914211273193,
+ "mean_token_accuracy": 0.6594406366348267,
+ "num_tokens": 15974400.0,
+ "step": 975
+ },
+ {
+ "entropy": 1.3440049886703491,
+ "epoch": 1.9717171717171718,
+ "grad_norm": 2.121338367462158,
+ "learning_rate": 3.0303030303030305e-06,
+ "loss": 1.3652238845825195,
+ "mean_token_accuracy": 0.6794699430465698,
+ "num_tokens": 15990784.0,
+ "step": 976
+ },
+ {
+ "entropy": 1.0894689559936523,
+ "epoch": 1.9737373737373738,
+ "grad_norm": 2.0155327320098877,
+ "learning_rate": 3.028282828282829e-06,
+ "loss": 1.0642526149749756,
+ "mean_token_accuracy": 0.7223986387252808,
+ "num_tokens": 16007168.0,
+ "step": 977
+ },
+ {
+ "entropy": 1.469588041305542,
+ "epoch": 1.9757575757575756,
+ "grad_norm": 2.2047550678253174,
+ "learning_rate": 3.0262626262626267e-06,
+ "loss": 1.498295545578003,
+ "mean_token_accuracy": 0.6441133618354797,
+ "num_tokens": 16023552.0,
+ "step": 978
+ },
+ {
+ "entropy": 1.6617093086242676,
+ "epoch": 1.9777777777777779,
+ "grad_norm": 1.9770722389221191,
+ "learning_rate": 3.0242424242424246e-06,
+ "loss": 1.6753556728363037,
+ "mean_token_accuracy": 0.6284807324409485,
+ "num_tokens": 16039936.0,
+ "step": 979
+ },
+ {
+ "entropy": 1.8029206991195679,
+ "epoch": 1.9797979797979797,
+ "grad_norm": 2.2365968227386475,
+ "learning_rate": 3.0222222222222225e-06,
+ "loss": 1.7957369089126587,
+ "mean_token_accuracy": 0.601062536239624,
+ "num_tokens": 16056320.0,
+ "step": 980
+ },
+ {
+ "entropy": 1.6331384181976318,
+ "epoch": 1.981818181818182,
+ "grad_norm": 2.0565884113311768,
+ "learning_rate": 3.0202020202020203e-06,
+ "loss": 1.673048973083496,
+ "mean_token_accuracy": 0.6203590631484985,
+ "num_tokens": 16072704.0,
+ "step": 981
+ },
+ {
+ "entropy": 1.1730273962020874,
+ "epoch": 1.9838383838383837,
+ "grad_norm": 2.0347228050231934,
+ "learning_rate": 3.0181818181818182e-06,
+ "loss": 1.1709872484207153,
+ "mean_token_accuracy": 0.7086589932441711,
+ "num_tokens": 16089088.0,
+ "step": 982
+ },
+ {
+ "entropy": 1.1109111309051514,
+ "epoch": 1.985858585858586,
+ "grad_norm": 1.9992051124572754,
+ "learning_rate": 3.0161616161616165e-06,
+ "loss": 1.097399353981018,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 16105472.0,
+ "step": 983
+ },
+ {
+ "entropy": 1.2580686807632446,
+ "epoch": 1.9878787878787878,
+ "grad_norm": 2.1748640537261963,
+ "learning_rate": 3.0141414141414144e-06,
+ "loss": 1.2503113746643066,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 16121856.0,
+ "step": 984
+ },
+ {
+ "entropy": 1.4884002208709717,
+ "epoch": 1.98989898989899,
+ "grad_norm": 2.3283042907714844,
+ "learning_rate": 3.0121212121212123e-06,
+ "loss": 1.4856922626495361,
+ "mean_token_accuracy": 0.6461895704269409,
+ "num_tokens": 16138240.0,
+ "step": 985
+ },
+ {
+ "entropy": 1.6224603652954102,
+ "epoch": 1.9919191919191919,
+ "grad_norm": 2.0596823692321777,
+ "learning_rate": 3.0101010101010102e-06,
+ "loss": 1.6202584505081177,
+ "mean_token_accuracy": 0.6388617753982544,
+ "num_tokens": 16154624.0,
+ "step": 986
+ },
+ {
+ "entropy": 1.559553623199463,
+ "epoch": 1.993939393939394,
+ "grad_norm": 2.100667953491211,
+ "learning_rate": 3.008080808080808e-06,
+ "loss": 1.5781179666519165,
+ "mean_token_accuracy": 0.6409379839897156,
+ "num_tokens": 16171008.0,
+ "step": 987
+ },
+ {
+ "entropy": 1.299710750579834,
+ "epoch": 1.995959595959596,
+ "grad_norm": 2.2846767902374268,
+ "learning_rate": 3.0060606060606064e-06,
+ "loss": 1.2758262157440186,
+ "mean_token_accuracy": 0.6882632970809937,
+ "num_tokens": 16187392.0,
+ "step": 988
+ },
+ {
+ "entropy": 1.3966935873031616,
+ "epoch": 1.997979797979798,
+ "grad_norm": 2.1244044303894043,
+ "learning_rate": 3.0040404040404043e-06,
+ "loss": 1.420769214630127,
+ "mean_token_accuracy": 0.6670737862586975,
+ "num_tokens": 16203776.0,
+ "step": 989
+ },
+ {
+ "entropy": 1.5851658582687378,
+ "epoch": 2.0,
+ "grad_norm": 2.277179002761841,
+ "learning_rate": 3.002020202020202e-06,
+ "loss": 1.5963382720947266,
+ "mean_token_accuracy": 0.6276868581771851,
+ "num_tokens": 16220160.0,
+ "step": 990
+ },
+ {
+ "entropy": 1.9146819114685059,
+ "epoch": 2.002020202020202,
+ "grad_norm": 2.0008981227874756,
+ "learning_rate": 3e-06,
+ "loss": 1.8820562362670898,
+ "mean_token_accuracy": 0.5895212292671204,
+ "num_tokens": 16236544.0,
+ "step": 991
+ },
+ {
+ "entropy": 1.3451478481292725,
+ "epoch": 2.004040404040404,
+ "grad_norm": 2.236388921737671,
+ "learning_rate": 2.997979797979798e-06,
+ "loss": 1.2709381580352783,
+ "mean_token_accuracy": 0.6848436594009399,
+ "num_tokens": 16252928.0,
+ "step": 992
+ },
+ {
+ "entropy": 1.4454528093338013,
+ "epoch": 2.006060606060606,
+ "grad_norm": 2.220324754714966,
+ "learning_rate": 2.9959595959595963e-06,
+ "loss": 1.387961506843567,
+ "mean_token_accuracy": 0.6642647981643677,
+ "num_tokens": 16269312.0,
+ "step": 993
+ },
+ {
+ "entropy": 1.2083219289779663,
+ "epoch": 2.008080808080808,
+ "grad_norm": 2.092430830001831,
+ "learning_rate": 2.993939393939394e-06,
+ "loss": 1.1450953483581543,
+ "mean_token_accuracy": 0.7159257531166077,
+ "num_tokens": 16285696.0,
+ "step": 994
+ },
+ {
+ "entropy": 1.3030426502227783,
+ "epoch": 2.01010101010101,
+ "grad_norm": 2.0722665786743164,
+ "learning_rate": 2.991919191919192e-06,
+ "loss": 1.2463462352752686,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 16302080.0,
+ "step": 995
+ },
+ {
+ "entropy": 1.3418742418289185,
+ "epoch": 2.012121212121212,
+ "grad_norm": 1.9004424810409546,
+ "learning_rate": 2.98989898989899e-06,
+ "loss": 1.3043954372406006,
+ "mean_token_accuracy": 0.6850268840789795,
+ "num_tokens": 16318464.0,
+ "step": 996
+ },
+ {
+ "entropy": 1.6736825704574585,
+ "epoch": 2.014141414141414,
+ "grad_norm": 2.132983446121216,
+ "learning_rate": 2.987878787878788e-06,
+ "loss": 1.631580114364624,
+ "mean_token_accuracy": 0.619076669216156,
+ "num_tokens": 16334848.0,
+ "step": 997
+ },
+ {
+ "entropy": 1.435375690460205,
+ "epoch": 2.0161616161616163,
+ "grad_norm": 2.2508206367492676,
+ "learning_rate": 2.9858585858585857e-06,
+ "loss": 1.3867809772491455,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 16351232.0,
+ "step": 998
+ },
+ {
+ "entropy": 1.050812005996704,
+ "epoch": 2.018181818181818,
+ "grad_norm": 1.878668189048767,
+ "learning_rate": 2.983838383838384e-06,
+ "loss": 1.0428903102874756,
+ "mean_token_accuracy": 0.7329018115997314,
+ "num_tokens": 16367616.0,
+ "step": 999
+ },
+ {
+ "entropy": 1.325859546661377,
+ "epoch": 2.0202020202020203,
+ "grad_norm": 1.8450349569320679,
+ "learning_rate": 2.981818181818182e-06,
+ "loss": 1.302099347114563,
+ "mean_token_accuracy": 0.6926599740982056,
+ "num_tokens": 16384000.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.0202020202020203,
+ "eval_entropy": 1.3899660999736478,
+ "eval_loss": 1.5310550928115845,
+ "eval_mean_token_accuracy": 0.6458596015168775,
+ "eval_num_tokens": 16384000.0,
+ "eval_runtime": 43.8845,
+ "eval_samples_per_second": 22.559,
+ "eval_steps_per_second": 2.826,
+ "step": 1000
+ },
+ {
+ "entropy": 1.5226235389709473,
+ "epoch": 2.022222222222222,
+ "grad_norm": 2.0676803588867188,
+ "learning_rate": 2.97979797979798e-06,
+ "loss": 1.4971344470977783,
+ "mean_token_accuracy": 0.6517464518547058,
+ "num_tokens": 16400384.0,
+ "step": 1001
+ },
+ {
+ "entropy": 0.9506940841674805,
+ "epoch": 2.0242424242424244,
+ "grad_norm": 1.972718596458435,
+ "learning_rate": 2.9777777777777777e-06,
+ "loss": 0.9229776859283447,
+ "mean_token_accuracy": 0.7554958462715149,
+ "num_tokens": 16416768.0,
+ "step": 1002
+ },
+ {
+ "entropy": 1.8095428943634033,
+ "epoch": 2.026262626262626,
+ "grad_norm": 2.119502305984497,
+ "learning_rate": 2.9757575757575756e-06,
+ "loss": 1.8333206176757812,
+ "mean_token_accuracy": 0.5888495445251465,
+ "num_tokens": 16433152.0,
+ "step": 1003
+ },
+ {
+ "entropy": 1.110617756843567,
+ "epoch": 2.0282828282828285,
+ "grad_norm": 2.1480863094329834,
+ "learning_rate": 2.9737373737373743e-06,
+ "loss": 1.0999674797058105,
+ "mean_token_accuracy": 0.7213605046272278,
+ "num_tokens": 16449536.0,
+ "step": 1004
+ },
+ {
+ "entropy": 1.1889066696166992,
+ "epoch": 2.0303030303030303,
+ "grad_norm": 2.1086478233337402,
+ "learning_rate": 2.971717171717172e-06,
+ "loss": 1.2093305587768555,
+ "mean_token_accuracy": 0.7071323990821838,
+ "num_tokens": 16465920.0,
+ "step": 1005
+ },
+ {
+ "entropy": 1.2134279012680054,
+ "epoch": 2.0323232323232325,
+ "grad_norm": 2.020108461380005,
+ "learning_rate": 2.96969696969697e-06,
+ "loss": 1.2015900611877441,
+ "mean_token_accuracy": 0.7037127614021301,
+ "num_tokens": 16482304.0,
+ "step": 1006
+ },
+ {
+ "entropy": 1.1034245491027832,
+ "epoch": 2.0343434343434343,
+ "grad_norm": 2.1722943782806396,
+ "learning_rate": 2.967676767676768e-06,
+ "loss": 1.1243445873260498,
+ "mean_token_accuracy": 0.7051172256469727,
+ "num_tokens": 16498688.0,
+ "step": 1007
+ },
+ {
+ "entropy": 1.6888902187347412,
+ "epoch": 2.036363636363636,
+ "grad_norm": 2.1574206352233887,
+ "learning_rate": 2.9656565656565663e-06,
+ "loss": 1.7164931297302246,
+ "mean_token_accuracy": 0.6174889802932739,
+ "num_tokens": 16515072.0,
+ "step": 1008
+ },
+ {
+ "entropy": 0.8055605292320251,
+ "epoch": 2.0383838383838384,
+ "grad_norm": 1.8896156549453735,
+ "learning_rate": 2.963636363636364e-06,
+ "loss": 0.7961650490760803,
+ "mean_token_accuracy": 0.7895700931549072,
+ "num_tokens": 16531456.0,
+ "step": 1009
+ },
+ {
+ "entropy": 1.7698009014129639,
+ "epoch": 2.04040404040404,
+ "grad_norm": 2.1700897216796875,
+ "learning_rate": 2.961616161616162e-06,
+ "loss": 1.7871267795562744,
+ "mean_token_accuracy": 0.6139472126960754,
+ "num_tokens": 16547840.0,
+ "step": 1010
+ },
+ {
+ "entropy": 1.414292335510254,
+ "epoch": 2.0424242424242425,
+ "grad_norm": 2.0185277462005615,
+ "learning_rate": 2.95959595959596e-06,
+ "loss": 1.4295077323913574,
+ "mean_token_accuracy": 0.6670126914978027,
+ "num_tokens": 16564224.0,
+ "step": 1011
+ },
+ {
+ "entropy": 1.4013340473175049,
+ "epoch": 2.0444444444444443,
+ "grad_norm": 2.1133840084075928,
+ "learning_rate": 2.957575757575758e-06,
+ "loss": 1.4482200145721436,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 16580608.0,
+ "step": 1012
+ },
+ {
+ "entropy": 1.342740774154663,
+ "epoch": 2.0464646464646465,
+ "grad_norm": 2.0520355701446533,
+ "learning_rate": 2.955555555555556e-06,
+ "loss": 1.3550419807434082,
+ "mean_token_accuracy": 0.6850879192352295,
+ "num_tokens": 16596992.0,
+ "step": 1013
+ },
+ {
+ "entropy": 1.2301024198532104,
+ "epoch": 2.0484848484848484,
+ "grad_norm": 2.1948137283325195,
+ "learning_rate": 2.953535353535354e-06,
+ "loss": 1.243154525756836,
+ "mean_token_accuracy": 0.6838055849075317,
+ "num_tokens": 16613376.0,
+ "step": 1014
+ },
+ {
+ "entropy": 1.3916606903076172,
+ "epoch": 2.0505050505050506,
+ "grad_norm": 2.241595506668091,
+ "learning_rate": 2.951515151515152e-06,
+ "loss": 1.4011318683624268,
+ "mean_token_accuracy": 0.664631187915802,
+ "num_tokens": 16629760.0,
+ "step": 1015
+ },
+ {
+ "entropy": 1.4715481996536255,
+ "epoch": 2.0525252525252524,
+ "grad_norm": 2.224256753921509,
+ "learning_rate": 2.94949494949495e-06,
+ "loss": 1.5011882781982422,
+ "mean_token_accuracy": 0.6493038535118103,
+ "num_tokens": 16646144.0,
+ "step": 1016
+ },
+ {
+ "entropy": 1.1261032819747925,
+ "epoch": 2.0545454545454547,
+ "grad_norm": 2.2784500122070312,
+ "learning_rate": 2.9474747474747477e-06,
+ "loss": 1.1250882148742676,
+ "mean_token_accuracy": 0.7178798317909241,
+ "num_tokens": 16662528.0,
+ "step": 1017
+ },
+ {
+ "entropy": 1.782008171081543,
+ "epoch": 2.0565656565656565,
+ "grad_norm": 2.1711416244506836,
+ "learning_rate": 2.9454545454545456e-06,
+ "loss": 1.8037612438201904,
+ "mean_token_accuracy": 0.6113824844360352,
+ "num_tokens": 16678912.0,
+ "step": 1018
+ },
+ {
+ "entropy": 1.521897315979004,
+ "epoch": 2.0585858585858587,
+ "grad_norm": 2.1903202533721924,
+ "learning_rate": 2.943434343434344e-06,
+ "loss": 1.5377610921859741,
+ "mean_token_accuracy": 0.642953097820282,
+ "num_tokens": 16695296.0,
+ "step": 1019
+ },
+ {
+ "entropy": 1.3112438917160034,
+ "epoch": 2.0606060606060606,
+ "grad_norm": 2.0299105644226074,
+ "learning_rate": 2.941414141414142e-06,
+ "loss": 1.3218681812286377,
+ "mean_token_accuracy": 0.6842941045761108,
+ "num_tokens": 16711680.0,
+ "step": 1020
+ },
+ {
+ "entropy": 1.3634895086288452,
+ "epoch": 2.062626262626263,
+ "grad_norm": 2.2818808555603027,
+ "learning_rate": 2.9393939393939397e-06,
+ "loss": 1.3611259460449219,
+ "mean_token_accuracy": 0.6758060455322266,
+ "num_tokens": 16728064.0,
+ "step": 1021
+ },
+ {
+ "entropy": 1.361467957496643,
+ "epoch": 2.0646464646464646,
+ "grad_norm": 2.290698289871216,
+ "learning_rate": 2.9373737373737376e-06,
+ "loss": 1.3082963228225708,
+ "mean_token_accuracy": 0.6809965968132019,
+ "num_tokens": 16744448.0,
+ "step": 1022
+ },
+ {
+ "entropy": 1.633399486541748,
+ "epoch": 2.066666666666667,
+ "grad_norm": 2.1775712966918945,
+ "learning_rate": 2.9353535353535355e-06,
+ "loss": 1.6423053741455078,
+ "mean_token_accuracy": 0.639655590057373,
+ "num_tokens": 16760832.0,
+ "step": 1023
+ },
+ {
+ "entropy": 1.4717872142791748,
+ "epoch": 2.0686868686868687,
+ "grad_norm": 2.2070701122283936,
+ "learning_rate": 2.9333333333333338e-06,
+ "loss": 1.508943796157837,
+ "mean_token_accuracy": 0.6469223499298096,
+ "num_tokens": 16777216.0,
+ "step": 1024
+ },
+ {
+ "entropy": 1.1494653224945068,
+ "epoch": 2.0707070707070705,
+ "grad_norm": 2.0239098072052,
+ "learning_rate": 2.9313131313131317e-06,
+ "loss": 1.1367695331573486,
+ "mean_token_accuracy": 0.7148265838623047,
+ "num_tokens": 16793600.0,
+ "step": 1025
+ },
+ {
+ "entropy": 1.0235252380371094,
+ "epoch": 2.0727272727272728,
+ "grad_norm": 2.071176052093506,
+ "learning_rate": 2.9292929292929295e-06,
+ "loss": 1.0369395017623901,
+ "mean_token_accuracy": 0.7396799921989441,
+ "num_tokens": 16809984.0,
+ "step": 1026
+ },
+ {
+ "entropy": 1.2325578927993774,
+ "epoch": 2.0747474747474746,
+ "grad_norm": 2.212671995162964,
+ "learning_rate": 2.9272727272727274e-06,
+ "loss": 1.2429314851760864,
+ "mean_token_accuracy": 0.688568651676178,
+ "num_tokens": 16826368.0,
+ "step": 1027
+ },
+ {
+ "entropy": 1.2879300117492676,
+ "epoch": 2.076767676767677,
+ "grad_norm": 2.0366690158843994,
+ "learning_rate": 2.9252525252525253e-06,
+ "loss": 1.2931241989135742,
+ "mean_token_accuracy": 0.6813018918037415,
+ "num_tokens": 16842752.0,
+ "step": 1028
+ },
+ {
+ "entropy": 0.9473312497138977,
+ "epoch": 2.0787878787878786,
+ "grad_norm": 2.0870468616485596,
+ "learning_rate": 2.9232323232323236e-06,
+ "loss": 0.9292516708374023,
+ "mean_token_accuracy": 0.7525036931037903,
+ "num_tokens": 16859136.0,
+ "step": 1029
+ },
+ {
+ "entropy": 1.3882765769958496,
+ "epoch": 2.080808080808081,
+ "grad_norm": 2.1285617351531982,
+ "learning_rate": 2.9212121212121215e-06,
+ "loss": 1.3798363208770752,
+ "mean_token_accuracy": 0.6768441796302795,
+ "num_tokens": 16875520.0,
+ "step": 1030
+ },
+ {
+ "entropy": 1.3588547706604004,
+ "epoch": 2.0828282828282827,
+ "grad_norm": 2.2275242805480957,
+ "learning_rate": 2.9191919191919194e-06,
+ "loss": 1.3538521528244019,
+ "mean_token_accuracy": 0.6615168452262878,
+ "num_tokens": 16891904.0,
+ "step": 1031
+ },
+ {
+ "entropy": 1.0415440797805786,
+ "epoch": 2.084848484848485,
+ "grad_norm": 2.2782297134399414,
+ "learning_rate": 2.9171717171717173e-06,
+ "loss": 1.03328537940979,
+ "mean_token_accuracy": 0.7577552795410156,
+ "num_tokens": 16908288.0,
+ "step": 1032
+ },
+ {
+ "entropy": 1.241741418838501,
+ "epoch": 2.0868686868686868,
+ "grad_norm": 2.141939163208008,
+ "learning_rate": 2.915151515151515e-06,
+ "loss": 1.2248635292053223,
+ "mean_token_accuracy": 0.6950415372848511,
+ "num_tokens": 16924672.0,
+ "step": 1033
+ },
+ {
+ "entropy": 1.1192725896835327,
+ "epoch": 2.088888888888889,
+ "grad_norm": 1.9980862140655518,
+ "learning_rate": 2.913131313131313e-06,
+ "loss": 1.1176412105560303,
+ "mean_token_accuracy": 0.7272838354110718,
+ "num_tokens": 16941056.0,
+ "step": 1034
+ },
+ {
+ "entropy": 1.1871322393417358,
+ "epoch": 2.090909090909091,
+ "grad_norm": 2.1212220191955566,
+ "learning_rate": 2.9111111111111114e-06,
+ "loss": 1.1670379638671875,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 16957440.0,
+ "step": 1035
+ },
+ {
+ "entropy": 1.5194982290267944,
+ "epoch": 2.092929292929293,
+ "grad_norm": 2.2593677043914795,
+ "learning_rate": 2.9090909090909093e-06,
+ "loss": 1.50520920753479,
+ "mean_token_accuracy": 0.6475940346717834,
+ "num_tokens": 16973824.0,
+ "step": 1036
+ },
+ {
+ "entropy": 1.212785243988037,
+ "epoch": 2.094949494949495,
+ "grad_norm": 2.221132278442383,
+ "learning_rate": 2.907070707070707e-06,
+ "loss": 1.206315040588379,
+ "mean_token_accuracy": 0.7046898007392883,
+ "num_tokens": 16990208.0,
+ "step": 1037
+ },
+ {
+ "entropy": 1.2913068532943726,
+ "epoch": 2.096969696969697,
+ "grad_norm": 2.0525012016296387,
+ "learning_rate": 2.905050505050505e-06,
+ "loss": 1.2987749576568604,
+ "mean_token_accuracy": 0.6894235610961914,
+ "num_tokens": 17006592.0,
+ "step": 1038
+ },
+ {
+ "entropy": 1.139485239982605,
+ "epoch": 2.098989898989899,
+ "grad_norm": 2.093764543533325,
+ "learning_rate": 2.903030303030303e-06,
+ "loss": 1.1460036039352417,
+ "mean_token_accuracy": 0.7205055952072144,
+ "num_tokens": 17022976.0,
+ "step": 1039
+ },
+ {
+ "entropy": 1.3781968355178833,
+ "epoch": 2.101010101010101,
+ "grad_norm": 2.095311164855957,
+ "learning_rate": 2.9010101010101012e-06,
+ "loss": 1.3901969194412231,
+ "mean_token_accuracy": 0.679286777973175,
+ "num_tokens": 17039360.0,
+ "step": 1040
+ },
+ {
+ "entropy": 1.1370116472244263,
+ "epoch": 2.103030303030303,
+ "grad_norm": 2.139094352722168,
+ "learning_rate": 2.898989898989899e-06,
+ "loss": 1.1491400003433228,
+ "mean_token_accuracy": 0.72007817029953,
+ "num_tokens": 17055744.0,
+ "step": 1041
+ },
+ {
+ "entropy": 1.0845732688903809,
+ "epoch": 2.105050505050505,
+ "grad_norm": 2.180278778076172,
+ "learning_rate": 2.896969696969697e-06,
+ "loss": 1.0764763355255127,
+ "mean_token_accuracy": 0.7365657091140747,
+ "num_tokens": 17072128.0,
+ "step": 1042
+ },
+ {
+ "entropy": 1.4869064092636108,
+ "epoch": 2.107070707070707,
+ "grad_norm": 2.053727388381958,
+ "learning_rate": 2.894949494949495e-06,
+ "loss": 1.4862562417984009,
+ "mean_token_accuracy": 0.6643258333206177,
+ "num_tokens": 17088512.0,
+ "step": 1043
+ },
+ {
+ "entropy": 1.048888921737671,
+ "epoch": 2.109090909090909,
+ "grad_norm": 2.1302237510681152,
+ "learning_rate": 2.892929292929293e-06,
+ "loss": 1.0331683158874512,
+ "mean_token_accuracy": 0.7388250827789307,
+ "num_tokens": 17104896.0,
+ "step": 1044
+ },
+ {
+ "entropy": 1.2839856147766113,
+ "epoch": 2.111111111111111,
+ "grad_norm": 2.8510677814483643,
+ "learning_rate": 2.8909090909090907e-06,
+ "loss": 1.3016979694366455,
+ "mean_token_accuracy": 0.6904616355895996,
+ "num_tokens": 17121280.0,
+ "step": 1045
+ },
+ {
+ "entropy": 1.050045371055603,
+ "epoch": 2.113131313131313,
+ "grad_norm": 2.2457358837127686,
+ "learning_rate": 2.888888888888889e-06,
+ "loss": 1.0580981969833374,
+ "mean_token_accuracy": 0.7221543788909912,
+ "num_tokens": 17137664.0,
+ "step": 1046
+ },
+ {
+ "entropy": 1.3087437152862549,
+ "epoch": 2.1151515151515152,
+ "grad_norm": 2.0929996967315674,
+ "learning_rate": 2.8868686868686873e-06,
+ "loss": 1.2914986610412598,
+ "mean_token_accuracy": 0.6939423680305481,
+ "num_tokens": 17154048.0,
+ "step": 1047
+ },
+ {
+ "entropy": 1.7247086763381958,
+ "epoch": 2.117171717171717,
+ "grad_norm": 2.2230091094970703,
+ "learning_rate": 2.884848484848485e-06,
+ "loss": 1.7394956350326538,
+ "mean_token_accuracy": 0.6131533980369568,
+ "num_tokens": 17170432.0,
+ "step": 1048
+ },
+ {
+ "entropy": 1.5816357135772705,
+ "epoch": 2.1191919191919193,
+ "grad_norm": 2.196422576904297,
+ "learning_rate": 2.8828282828282835e-06,
+ "loss": 1.6226823329925537,
+ "mean_token_accuracy": 0.6375183463096619,
+ "num_tokens": 17186816.0,
+ "step": 1049
+ },
+ {
+ "entropy": 1.2316261529922485,
+ "epoch": 2.121212121212121,
+ "grad_norm": 2.173909902572632,
+ "learning_rate": 2.8808080808080814e-06,
+ "loss": 1.2228440046310425,
+ "mean_token_accuracy": 0.6940034031867981,
+ "num_tokens": 17203200.0,
+ "step": 1050
+ },
+ {
+ "epoch": 2.121212121212121,
+ "eval_entropy": 1.3722701356295617,
+ "eval_loss": 1.5385833978652954,
+ "eval_mean_token_accuracy": 0.6450051809510877,
+ "eval_num_tokens": 17203200.0,
+ "eval_runtime": 43.9186,
+ "eval_samples_per_second": 22.542,
+ "eval_steps_per_second": 2.823,
+ "step": 1050
+ },
+ {
+ "entropy": 1.3023537397384644,
+ "epoch": 2.1232323232323234,
+ "grad_norm": 2.1490018367767334,
+ "learning_rate": 2.8787878787878793e-06,
+ "loss": 1.284008264541626,
+ "mean_token_accuracy": 0.7057278752326965,
+ "num_tokens": 17219584.0,
+ "step": 1051
+ },
+ {
+ "entropy": 1.3198270797729492,
+ "epoch": 2.125252525252525,
+ "grad_norm": 2.582298994064331,
+ "learning_rate": 2.876767676767677e-06,
+ "loss": 1.3185001611709595,
+ "mean_token_accuracy": 0.6772105693817139,
+ "num_tokens": 17235968.0,
+ "step": 1052
+ },
+ {
+ "entropy": 0.8889825940132141,
+ "epoch": 2.1272727272727274,
+ "grad_norm": 2.0617194175720215,
+ "learning_rate": 2.874747474747475e-06,
+ "loss": 0.889773964881897,
+ "mean_token_accuracy": 0.767892062664032,
+ "num_tokens": 17252352.0,
+ "step": 1053
+ },
+ {
+ "entropy": 1.5485399961471558,
+ "epoch": 2.1292929292929292,
+ "grad_norm": 2.2752370834350586,
+ "learning_rate": 2.872727272727273e-06,
+ "loss": 1.5542051792144775,
+ "mean_token_accuracy": 0.6397166848182678,
+ "num_tokens": 17268736.0,
+ "step": 1054
+ },
+ {
+ "entropy": 1.3949565887451172,
+ "epoch": 2.1313131313131315,
+ "grad_norm": 2.0112996101379395,
+ "learning_rate": 2.8707070707070713e-06,
+ "loss": 1.4111721515655518,
+ "mean_token_accuracy": 0.6659746170043945,
+ "num_tokens": 17285120.0,
+ "step": 1055
+ },
+ {
+ "entropy": 1.0529720783233643,
+ "epoch": 2.1333333333333333,
+ "grad_norm": 2.2219948768615723,
+ "learning_rate": 2.868686868686869e-06,
+ "loss": 1.0484942197799683,
+ "mean_token_accuracy": 0.7224596738815308,
+ "num_tokens": 17301504.0,
+ "step": 1056
+ },
+ {
+ "entropy": 1.5362433195114136,
+ "epoch": 2.1353535353535356,
+ "grad_norm": 2.4097044467926025,
+ "learning_rate": 2.866666666666667e-06,
+ "loss": 1.5809426307678223,
+ "mean_token_accuracy": 0.6266487836837769,
+ "num_tokens": 17317888.0,
+ "step": 1057
+ },
+ {
+ "entropy": 1.6682685613632202,
+ "epoch": 2.1373737373737374,
+ "grad_norm": 2.121086359024048,
+ "learning_rate": 2.864646464646465e-06,
+ "loss": 1.6636815071105957,
+ "mean_token_accuracy": 0.6317782402038574,
+ "num_tokens": 17334272.0,
+ "step": 1058
+ },
+ {
+ "entropy": 1.5480221509933472,
+ "epoch": 2.1393939393939396,
+ "grad_norm": 2.2226176261901855,
+ "learning_rate": 2.862626262626263e-06,
+ "loss": 1.535983681678772,
+ "mean_token_accuracy": 0.6623717546463013,
+ "num_tokens": 17350656.0,
+ "step": 1059
+ },
+ {
+ "entropy": 1.3323101997375488,
+ "epoch": 2.1414141414141414,
+ "grad_norm": 2.2644572257995605,
+ "learning_rate": 2.860606060606061e-06,
+ "loss": 1.3316677808761597,
+ "mean_token_accuracy": 0.6741573214530945,
+ "num_tokens": 17367040.0,
+ "step": 1060
+ },
+ {
+ "entropy": 1.5107028484344482,
+ "epoch": 2.1434343434343432,
+ "grad_norm": 2.1291613578796387,
+ "learning_rate": 2.858585858585859e-06,
+ "loss": 1.4996232986450195,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 17383424.0,
+ "step": 1061
+ },
+ {
+ "entropy": 1.5927387475967407,
+ "epoch": 2.1454545454545455,
+ "grad_norm": 2.1977617740631104,
+ "learning_rate": 2.856565656565657e-06,
+ "loss": 1.582688331604004,
+ "mean_token_accuracy": 0.6306790709495544,
+ "num_tokens": 17399808.0,
+ "step": 1062
+ },
+ {
+ "entropy": 1.0717219114303589,
+ "epoch": 2.1474747474747473,
+ "grad_norm": 2.2494494915008545,
+ "learning_rate": 2.8545454545454548e-06,
+ "loss": 1.0780384540557861,
+ "mean_token_accuracy": 0.7214826345443726,
+ "num_tokens": 17416192.0,
+ "step": 1063
+ },
+ {
+ "entropy": 1.484608769416809,
+ "epoch": 2.1494949494949496,
+ "grad_norm": 2.20664644241333,
+ "learning_rate": 2.8525252525252527e-06,
+ "loss": 1.5074207782745361,
+ "mean_token_accuracy": 0.6502808928489685,
+ "num_tokens": 17432576.0,
+ "step": 1064
+ },
+ {
+ "entropy": 1.6607396602630615,
+ "epoch": 2.1515151515151514,
+ "grad_norm": 2.123538017272949,
+ "learning_rate": 2.850505050505051e-06,
+ "loss": 1.659307837486267,
+ "mean_token_accuracy": 0.619076669216156,
+ "num_tokens": 17448960.0,
+ "step": 1065
+ },
+ {
+ "entropy": 1.1195216178894043,
+ "epoch": 2.1535353535353536,
+ "grad_norm": 2.037261486053467,
+ "learning_rate": 2.848484848484849e-06,
+ "loss": 1.127397894859314,
+ "mean_token_accuracy": 0.7209330797195435,
+ "num_tokens": 17465344.0,
+ "step": 1066
+ },
+ {
+ "entropy": 1.0512653589248657,
+ "epoch": 2.1555555555555554,
+ "grad_norm": 2.209764003753662,
+ "learning_rate": 2.8464646464646468e-06,
+ "loss": 1.073946475982666,
+ "mean_token_accuracy": 0.717391312122345,
+ "num_tokens": 17481728.0,
+ "step": 1067
+ },
+ {
+ "entropy": 1.131946325302124,
+ "epoch": 2.1575757575757577,
+ "grad_norm": 1.9188926219940186,
+ "learning_rate": 2.8444444444444446e-06,
+ "loss": 1.11629056930542,
+ "mean_token_accuracy": 0.7220322489738464,
+ "num_tokens": 17498112.0,
+ "step": 1068
+ },
+ {
+ "entropy": 1.4745967388153076,
+ "epoch": 2.1595959595959595,
+ "grad_norm": 2.285099983215332,
+ "learning_rate": 2.8424242424242425e-06,
+ "loss": 1.4795483350753784,
+ "mean_token_accuracy": 0.6466169953346252,
+ "num_tokens": 17514496.0,
+ "step": 1069
+ },
+ {
+ "entropy": 1.2614645957946777,
+ "epoch": 2.1616161616161618,
+ "grad_norm": 2.4019627571105957,
+ "learning_rate": 2.8404040404040404e-06,
+ "loss": 1.2659732103347778,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 17530880.0,
+ "step": 1070
+ },
+ {
+ "entropy": 1.4247770309448242,
+ "epoch": 2.1636363636363636,
+ "grad_norm": 2.350632905960083,
+ "learning_rate": 2.8383838383838387e-06,
+ "loss": 1.415325403213501,
+ "mean_token_accuracy": 0.6655471324920654,
+ "num_tokens": 17547264.0,
+ "step": 1071
+ },
+ {
+ "entropy": 1.5746078491210938,
+ "epoch": 2.165656565656566,
+ "grad_norm": 2.18448543548584,
+ "learning_rate": 2.8363636363636366e-06,
+ "loss": 1.6022642850875854,
+ "mean_token_accuracy": 0.6324499249458313,
+ "num_tokens": 17563648.0,
+ "step": 1072
+ },
+ {
+ "entropy": 1.5869743824005127,
+ "epoch": 2.1676767676767676,
+ "grad_norm": 2.3553452491760254,
+ "learning_rate": 2.8343434343434345e-06,
+ "loss": 1.6163790225982666,
+ "mean_token_accuracy": 0.6199926733970642,
+ "num_tokens": 17580032.0,
+ "step": 1073
+ },
+ {
+ "entropy": 1.2412667274475098,
+ "epoch": 2.16969696969697,
+ "grad_norm": 2.209017038345337,
+ "learning_rate": 2.8323232323232324e-06,
+ "loss": 1.2491700649261475,
+ "mean_token_accuracy": 0.6911333799362183,
+ "num_tokens": 17596416.0,
+ "step": 1074
+ },
+ {
+ "entropy": 0.9127920866012573,
+ "epoch": 2.1717171717171717,
+ "grad_norm": 1.9761381149291992,
+ "learning_rate": 2.8303030303030303e-06,
+ "loss": 0.8961890339851379,
+ "mean_token_accuracy": 0.7523815631866455,
+ "num_tokens": 17612800.0,
+ "step": 1075
+ },
+ {
+ "entropy": 1.2798824310302734,
+ "epoch": 2.1737373737373735,
+ "grad_norm": 2.397031784057617,
+ "learning_rate": 2.8282828282828286e-06,
+ "loss": 1.286920189857483,
+ "mean_token_accuracy": 0.6805080771446228,
+ "num_tokens": 17629184.0,
+ "step": 1076
+ },
+ {
+ "entropy": 1.7863305807113647,
+ "epoch": 2.175757575757576,
+ "grad_norm": 2.2798852920532227,
+ "learning_rate": 2.8262626262626265e-06,
+ "loss": 1.7654080390930176,
+ "mean_token_accuracy": 0.5806057453155518,
+ "num_tokens": 17645568.0,
+ "step": 1077
+ },
+ {
+ "entropy": 1.327653408050537,
+ "epoch": 2.1777777777777776,
+ "grad_norm": 2.3473095893859863,
+ "learning_rate": 2.8242424242424244e-06,
+ "loss": 1.3175032138824463,
+ "mean_token_accuracy": 0.6750732660293579,
+ "num_tokens": 17661952.0,
+ "step": 1078
+ },
+ {
+ "entropy": 1.4917371273040771,
+ "epoch": 2.17979797979798,
+ "grad_norm": 2.181729793548584,
+ "learning_rate": 2.8222222222222223e-06,
+ "loss": 1.4738472700119019,
+ "mean_token_accuracy": 0.6619443297386169,
+ "num_tokens": 17678336.0,
+ "step": 1079
+ },
+ {
+ "entropy": 1.4644533395767212,
+ "epoch": 2.1818181818181817,
+ "grad_norm": 2.2558112144470215,
+ "learning_rate": 2.82020202020202e-06,
+ "loss": 1.4563480615615845,
+ "mean_token_accuracy": 0.6484489440917969,
+ "num_tokens": 17694720.0,
+ "step": 1080
+ },
+ {
+ "entropy": 0.7626141905784607,
+ "epoch": 2.183838383838384,
+ "grad_norm": 1.8687561750411987,
+ "learning_rate": 2.818181818181818e-06,
+ "loss": 0.7718763947486877,
+ "mean_token_accuracy": 0.7982413172721863,
+ "num_tokens": 17711104.0,
+ "step": 1081
+ },
+ {
+ "entropy": 1.0613173246383667,
+ "epoch": 2.1858585858585857,
+ "grad_norm": 2.072643995285034,
+ "learning_rate": 2.8161616161616163e-06,
+ "loss": 1.0554629564285278,
+ "mean_token_accuracy": 0.734306275844574,
+ "num_tokens": 17727488.0,
+ "step": 1082
+ },
+ {
+ "entropy": 1.0348066091537476,
+ "epoch": 2.187878787878788,
+ "grad_norm": 1.8455089330673218,
+ "learning_rate": 2.8141414141414142e-06,
+ "loss": 1.0231983661651611,
+ "mean_token_accuracy": 0.7382755279541016,
+ "num_tokens": 17743872.0,
+ "step": 1083
+ },
+ {
+ "entropy": 1.271000862121582,
+ "epoch": 2.18989898989899,
+ "grad_norm": 2.3292477130889893,
+ "learning_rate": 2.812121212121212e-06,
+ "loss": 1.2822595834732056,
+ "mean_token_accuracy": 0.6816682815551758,
+ "num_tokens": 17760256.0,
+ "step": 1084
+ },
+ {
+ "entropy": 1.62147855758667,
+ "epoch": 2.191919191919192,
+ "grad_norm": 2.3269946575164795,
+ "learning_rate": 2.81010101010101e-06,
+ "loss": 1.6017215251922607,
+ "mean_token_accuracy": 0.635808527469635,
+ "num_tokens": 17776640.0,
+ "step": 1085
+ },
+ {
+ "entropy": 1.4834544658660889,
+ "epoch": 2.193939393939394,
+ "grad_norm": 2.223590135574341,
+ "learning_rate": 2.808080808080808e-06,
+ "loss": 1.496992826461792,
+ "mean_token_accuracy": 0.6494870781898499,
+ "num_tokens": 17793024.0,
+ "step": 1086
+ },
+ {
+ "entropy": 1.4784536361694336,
+ "epoch": 2.195959595959596,
+ "grad_norm": 2.169416666030884,
+ "learning_rate": 2.806060606060606e-06,
+ "loss": 1.4766731262207031,
+ "mean_token_accuracy": 0.6543722748756409,
+ "num_tokens": 17809408.0,
+ "step": 1087
+ },
+ {
+ "entropy": 1.3650349378585815,
+ "epoch": 2.197979797979798,
+ "grad_norm": 2.1369845867156982,
+ "learning_rate": 2.804040404040404e-06,
+ "loss": 1.3475263118743896,
+ "mean_token_accuracy": 0.6712262034416199,
+ "num_tokens": 17825792.0,
+ "step": 1088
+ },
+ {
+ "entropy": 1.052316665649414,
+ "epoch": 2.2,
+ "grad_norm": 2.3176774978637695,
+ "learning_rate": 2.802020202020202e-06,
+ "loss": 1.056478500366211,
+ "mean_token_accuracy": 0.7374206185340881,
+ "num_tokens": 17842176.0,
+ "step": 1089
+ },
+ {
+ "entropy": 1.1928741931915283,
+ "epoch": 2.202020202020202,
+ "grad_norm": 2.2518808841705322,
+ "learning_rate": 2.8000000000000003e-06,
+ "loss": 1.2238969802856445,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 17858560.0,
+ "step": 1090
+ },
+ {
+ "entropy": 1.135977864265442,
+ "epoch": 2.2040404040404042,
+ "grad_norm": 2.2688262462615967,
+ "learning_rate": 2.7979797979797986e-06,
+ "loss": 1.1330978870391846,
+ "mean_token_accuracy": 0.7053004503250122,
+ "num_tokens": 17874944.0,
+ "step": 1091
+ },
+ {
+ "entropy": 1.3542495965957642,
+ "epoch": 2.206060606060606,
+ "grad_norm": 2.1078014373779297,
+ "learning_rate": 2.7959595959595965e-06,
+ "loss": 1.3983874320983887,
+ "mean_token_accuracy": 0.6840498447418213,
+ "num_tokens": 17891328.0,
+ "step": 1092
+ },
+ {
+ "entropy": 1.1861188411712646,
+ "epoch": 2.2080808080808083,
+ "grad_norm": 2.348931312561035,
+ "learning_rate": 2.7939393939393944e-06,
+ "loss": 1.1982170343399048,
+ "mean_token_accuracy": 0.7014533281326294,
+ "num_tokens": 17907712.0,
+ "step": 1093
+ },
+ {
+ "entropy": 1.2858752012252808,
+ "epoch": 2.21010101010101,
+ "grad_norm": 2.1746175289154053,
+ "learning_rate": 2.7919191919191923e-06,
+ "loss": 1.302664041519165,
+ "mean_token_accuracy": 0.6818515062332153,
+ "num_tokens": 17924096.0,
+ "step": 1094
+ },
+ {
+ "entropy": 1.4817839860916138,
+ "epoch": 2.212121212121212,
+ "grad_norm": 1.9842815399169922,
+ "learning_rate": 2.78989898989899e-06,
+ "loss": 1.5031331777572632,
+ "mean_token_accuracy": 0.6546165347099304,
+ "num_tokens": 17940480.0,
+ "step": 1095
+ },
+ {
+ "entropy": 1.2977368831634521,
+ "epoch": 2.214141414141414,
+ "grad_norm": 2.0394232273101807,
+ "learning_rate": 2.7878787878787885e-06,
+ "loss": 1.3185319900512695,
+ "mean_token_accuracy": 0.6885075569152832,
+ "num_tokens": 17956864.0,
+ "step": 1096
+ },
+ {
+ "entropy": 1.010884404182434,
+ "epoch": 2.216161616161616,
+ "grad_norm": 2.1113393306732178,
+ "learning_rate": 2.7858585858585864e-06,
+ "loss": 1.0239849090576172,
+ "mean_token_accuracy": 0.7426111102104187,
+ "num_tokens": 17973248.0,
+ "step": 1097
+ },
+ {
+ "entropy": 1.6405178308486938,
+ "epoch": 2.2181818181818183,
+ "grad_norm": 2.220865249633789,
+ "learning_rate": 2.7838383838383842e-06,
+ "loss": 1.660733938217163,
+ "mean_token_accuracy": 0.6250610947608948,
+ "num_tokens": 17989632.0,
+ "step": 1098
+ },
+ {
+ "entropy": 1.2822861671447754,
+ "epoch": 2.22020202020202,
+ "grad_norm": 2.1409878730773926,
+ "learning_rate": 2.781818181818182e-06,
+ "loss": 1.2675114870071411,
+ "mean_token_accuracy": 0.7099413871765137,
+ "num_tokens": 18006016.0,
+ "step": 1099
+ },
+ {
+ "entropy": 1.5835071802139282,
+ "epoch": 2.2222222222222223,
+ "grad_norm": 2.32753586769104,
+ "learning_rate": 2.77979797979798e-06,
+ "loss": 1.585759162902832,
+ "mean_token_accuracy": 0.6321446299552917,
+ "num_tokens": 18022400.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.2222222222222223,
+ "eval_entropy": 1.3726552551792515,
+ "eval_loss": 1.5380089282989502,
+ "eval_mean_token_accuracy": 0.645188374384757,
+ "eval_num_tokens": 18022400.0,
+ "eval_runtime": 43.7591,
+ "eval_samples_per_second": 22.624,
+ "eval_steps_per_second": 2.834,
+ "step": 1100
+ },
+ {
+ "entropy": 1.0727043151855469,
+ "epoch": 2.224242424242424,
+ "grad_norm": 2.2024266719818115,
+ "learning_rate": 2.7777777777777783e-06,
+ "loss": 1.066201090812683,
+ "mean_token_accuracy": 0.7272838354110718,
+ "num_tokens": 18038784.0,
+ "step": 1101
+ },
+ {
+ "entropy": 1.1188048124313354,
+ "epoch": 2.2262626262626264,
+ "grad_norm": 2.032862663269043,
+ "learning_rate": 2.7757575757575762e-06,
+ "loss": 1.1292006969451904,
+ "mean_token_accuracy": 0.7198949456214905,
+ "num_tokens": 18055168.0,
+ "step": 1102
+ },
+ {
+ "entropy": 1.3658474683761597,
+ "epoch": 2.228282828282828,
+ "grad_norm": 2.081120491027832,
+ "learning_rate": 2.773737373737374e-06,
+ "loss": 1.3503609895706177,
+ "mean_token_accuracy": 0.6908280253410339,
+ "num_tokens": 18071552.0,
+ "step": 1103
+ },
+ {
+ "entropy": 1.5833252668380737,
+ "epoch": 2.2303030303030305,
+ "grad_norm": 2.174055576324463,
+ "learning_rate": 2.771717171717172e-06,
+ "loss": 1.5991246700286865,
+ "mean_token_accuracy": 0.6322056651115417,
+ "num_tokens": 18087936.0,
+ "step": 1104
+ },
+ {
+ "entropy": 1.2178122997283936,
+ "epoch": 2.2323232323232323,
+ "grad_norm": 2.328620195388794,
+ "learning_rate": 2.76969696969697e-06,
+ "loss": 1.2162861824035645,
+ "mean_token_accuracy": 0.6916218996047974,
+ "num_tokens": 18104320.0,
+ "step": 1105
+ },
+ {
+ "entropy": 1.2894606590270996,
+ "epoch": 2.2343434343434345,
+ "grad_norm": 2.236239433288574,
+ "learning_rate": 2.7676767676767678e-06,
+ "loss": 1.2695279121398926,
+ "mean_token_accuracy": 0.689728856086731,
+ "num_tokens": 18120704.0,
+ "step": 1106
+ },
+ {
+ "entropy": 1.0141552686691284,
+ "epoch": 2.2363636363636363,
+ "grad_norm": 2.000847339630127,
+ "learning_rate": 2.765656565656566e-06,
+ "loss": 1.0147396326065063,
+ "mean_token_accuracy": 0.7469467520713806,
+ "num_tokens": 18137088.0,
+ "step": 1107
+ },
+ {
+ "entropy": 1.150480031967163,
+ "epoch": 2.2383838383838386,
+ "grad_norm": 2.15156888961792,
+ "learning_rate": 2.763636363636364e-06,
+ "loss": 1.1593115329742432,
+ "mean_token_accuracy": 0.7129335403442383,
+ "num_tokens": 18153472.0,
+ "step": 1108
+ },
+ {
+ "entropy": 1.4387518167495728,
+ "epoch": 2.2404040404040404,
+ "grad_norm": 2.3262319564819336,
+ "learning_rate": 2.761616161616162e-06,
+ "loss": 1.4393596649169922,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 18169856.0,
+ "step": 1109
+ },
+ {
+ "entropy": 1.205459475517273,
+ "epoch": 2.242424242424242,
+ "grad_norm": 2.223987579345703,
+ "learning_rate": 2.7595959595959597e-06,
+ "loss": 1.1871377229690552,
+ "mean_token_accuracy": 0.7018197178840637,
+ "num_tokens": 18186240.0,
+ "step": 1110
+ },
+ {
+ "entropy": 1.428817868232727,
+ "epoch": 2.2444444444444445,
+ "grad_norm": 2.091627836227417,
+ "learning_rate": 2.7575757575757576e-06,
+ "loss": 1.4262187480926514,
+ "mean_token_accuracy": 0.6708598136901855,
+ "num_tokens": 18202624.0,
+ "step": 1111
+ },
+ {
+ "entropy": 1.420682668685913,
+ "epoch": 2.2464646464646463,
+ "grad_norm": 2.30232310295105,
+ "learning_rate": 2.755555555555556e-06,
+ "loss": 1.439821720123291,
+ "mean_token_accuracy": 0.6508305072784424,
+ "num_tokens": 18219008.0,
+ "step": 1112
+ },
+ {
+ "entropy": 1.2365189790725708,
+ "epoch": 2.2484848484848485,
+ "grad_norm": 2.1747143268585205,
+ "learning_rate": 2.753535353535354e-06,
+ "loss": 1.2286595106124878,
+ "mean_token_accuracy": 0.7011480331420898,
+ "num_tokens": 18235392.0,
+ "step": 1113
+ },
+ {
+ "entropy": 1.0271798372268677,
+ "epoch": 2.2505050505050503,
+ "grad_norm": 2.1767842769622803,
+ "learning_rate": 2.7515151515151517e-06,
+ "loss": 1.018047571182251,
+ "mean_token_accuracy": 0.7297264337539673,
+ "num_tokens": 18251776.0,
+ "step": 1114
+ },
+ {
+ "entropy": 1.229053258895874,
+ "epoch": 2.2525252525252526,
+ "grad_norm": 2.390345811843872,
+ "learning_rate": 2.7494949494949496e-06,
+ "loss": 1.250126838684082,
+ "mean_token_accuracy": 0.6869809627532959,
+ "num_tokens": 18268160.0,
+ "step": 1115
+ },
+ {
+ "entropy": 1.4062843322753906,
+ "epoch": 2.2545454545454544,
+ "grad_norm": 2.220144271850586,
+ "learning_rate": 2.7474747474747475e-06,
+ "loss": 1.4262535572052002,
+ "mean_token_accuracy": 0.6592574715614319,
+ "num_tokens": 18284544.0,
+ "step": 1116
+ },
+ {
+ "entropy": 1.1991937160491943,
+ "epoch": 2.2565656565656567,
+ "grad_norm": 1.9910556077957153,
+ "learning_rate": 2.7454545454545454e-06,
+ "loss": 1.1869618892669678,
+ "mean_token_accuracy": 0.7049340605735779,
+ "num_tokens": 18300928.0,
+ "step": 1117
+ },
+ {
+ "entropy": 1.3147934675216675,
+ "epoch": 2.2585858585858585,
+ "grad_norm": 2.033942222595215,
+ "learning_rate": 2.7434343434343437e-06,
+ "loss": 1.3236720561981201,
+ "mean_token_accuracy": 0.6854543089866638,
+ "num_tokens": 18317312.0,
+ "step": 1118
+ },
+ {
+ "entropy": 1.2828413248062134,
+ "epoch": 2.2606060606060607,
+ "grad_norm": 2.2729172706604004,
+ "learning_rate": 2.7414141414141416e-06,
+ "loss": 1.2601265907287598,
+ "mean_token_accuracy": 0.6866145730018616,
+ "num_tokens": 18333696.0,
+ "step": 1119
+ },
+ {
+ "entropy": 1.9708930253982544,
+ "epoch": 2.2626262626262625,
+ "grad_norm": 2.4053614139556885,
+ "learning_rate": 2.7393939393939395e-06,
+ "loss": 1.9953765869140625,
+ "mean_token_accuracy": 0.5719345211982727,
+ "num_tokens": 18350080.0,
+ "step": 1120
+ },
+ {
+ "entropy": 1.071018099784851,
+ "epoch": 2.264646464646465,
+ "grad_norm": 2.0399091243743896,
+ "learning_rate": 2.7373737373737374e-06,
+ "loss": 1.0672862529754639,
+ "mean_token_accuracy": 0.72007817029953,
+ "num_tokens": 18366464.0,
+ "step": 1121
+ },
+ {
+ "entropy": 1.8741599321365356,
+ "epoch": 2.2666666666666666,
+ "grad_norm": 2.0918753147125244,
+ "learning_rate": 2.7353535353535353e-06,
+ "loss": 1.8604744672775269,
+ "mean_token_accuracy": 0.598436713218689,
+ "num_tokens": 18382848.0,
+ "step": 1122
+ },
+ {
+ "entropy": 1.0931968688964844,
+ "epoch": 2.268686868686869,
+ "grad_norm": 2.161102294921875,
+ "learning_rate": 2.7333333333333336e-06,
+ "loss": 1.1152517795562744,
+ "mean_token_accuracy": 0.7209330797195435,
+ "num_tokens": 18399232.0,
+ "step": 1123
+ },
+ {
+ "entropy": 1.3318616151809692,
+ "epoch": 2.2707070707070707,
+ "grad_norm": 2.200199842453003,
+ "learning_rate": 2.7313131313131315e-06,
+ "loss": 1.3456424474716187,
+ "mean_token_accuracy": 0.6789203882217407,
+ "num_tokens": 18415616.0,
+ "step": 1124
+ },
+ {
+ "entropy": 1.3777986764907837,
+ "epoch": 2.2727272727272725,
+ "grad_norm": 2.328887701034546,
+ "learning_rate": 2.7292929292929293e-06,
+ "loss": 1.3955169916152954,
+ "mean_token_accuracy": 0.6679897308349609,
+ "num_tokens": 18432000.0,
+ "step": 1125
+ },
+ {
+ "entropy": 1.0748711824417114,
+ "epoch": 2.2747474747474747,
+ "grad_norm": 2.151282787322998,
+ "learning_rate": 2.7272727272727272e-06,
+ "loss": 1.0380895137786865,
+ "mean_token_accuracy": 0.736932098865509,
+ "num_tokens": 18448384.0,
+ "step": 1126
+ },
+ {
+ "entropy": 1.4420548677444458,
+ "epoch": 2.276767676767677,
+ "grad_norm": 2.133190870285034,
+ "learning_rate": 2.725252525252525e-06,
+ "loss": 1.4465012550354004,
+ "mean_token_accuracy": 0.6784929037094116,
+ "num_tokens": 18464768.0,
+ "step": 1127
+ },
+ {
+ "entropy": 0.9478949904441833,
+ "epoch": 2.278787878787879,
+ "grad_norm": 2.0902628898620605,
+ "learning_rate": 2.7232323232323234e-06,
+ "loss": 0.9504396915435791,
+ "mean_token_accuracy": 0.7458475828170776,
+ "num_tokens": 18481152.0,
+ "step": 1128
+ },
+ {
+ "entropy": 1.367720127105713,
+ "epoch": 2.2808080808080806,
+ "grad_norm": 2.0413167476654053,
+ "learning_rate": 2.7212121212121213e-06,
+ "loss": 1.3884644508361816,
+ "mean_token_accuracy": 0.6762945652008057,
+ "num_tokens": 18497536.0,
+ "step": 1129
+ },
+ {
+ "entropy": 1.6931284666061401,
+ "epoch": 2.282828282828283,
+ "grad_norm": 2.188426971435547,
+ "learning_rate": 2.719191919191919e-06,
+ "loss": 1.7233154773712158,
+ "mean_token_accuracy": 0.6323277950286865,
+ "num_tokens": 18513920.0,
+ "step": 1130
+ },
+ {
+ "entropy": 1.563072681427002,
+ "epoch": 2.2848484848484847,
+ "grad_norm": 2.241102695465088,
+ "learning_rate": 2.717171717171717e-06,
+ "loss": 1.5677220821380615,
+ "mean_token_accuracy": 0.640693724155426,
+ "num_tokens": 18530304.0,
+ "step": 1131
+ },
+ {
+ "entropy": 1.3332083225250244,
+ "epoch": 2.286868686868687,
+ "grad_norm": 2.209522008895874,
+ "learning_rate": 2.715151515151516e-06,
+ "loss": 1.337693452835083,
+ "mean_token_accuracy": 0.6715925931930542,
+ "num_tokens": 18546688.0,
+ "step": 1132
+ },
+ {
+ "entropy": 1.5389035940170288,
+ "epoch": 2.2888888888888888,
+ "grad_norm": 2.212047815322876,
+ "learning_rate": 2.7131313131313137e-06,
+ "loss": 1.52158784866333,
+ "mean_token_accuracy": 0.6447850465774536,
+ "num_tokens": 18563072.0,
+ "step": 1133
+ },
+ {
+ "entropy": 1.2687056064605713,
+ "epoch": 2.290909090909091,
+ "grad_norm": 2.1673405170440674,
+ "learning_rate": 2.7111111111111116e-06,
+ "loss": 1.2689636945724487,
+ "mean_token_accuracy": 0.6911333799362183,
+ "num_tokens": 18579456.0,
+ "step": 1134
+ },
+ {
+ "entropy": 1.1464369297027588,
+ "epoch": 2.292929292929293,
+ "grad_norm": 1.9283273220062256,
+ "learning_rate": 2.7090909090909095e-06,
+ "loss": 1.1613389253616333,
+ "mean_token_accuracy": 0.7145212292671204,
+ "num_tokens": 18595840.0,
+ "step": 1135
+ },
+ {
+ "entropy": 1.327767252922058,
+ "epoch": 2.294949494949495,
+ "grad_norm": 2.2193424701690674,
+ "learning_rate": 2.7070707070707074e-06,
+ "loss": 1.3209152221679688,
+ "mean_token_accuracy": 0.6740962266921997,
+ "num_tokens": 18612224.0,
+ "step": 1136
+ },
+ {
+ "entropy": 1.5820066928863525,
+ "epoch": 2.296969696969697,
+ "grad_norm": 2.2020492553710938,
+ "learning_rate": 2.7050505050505057e-06,
+ "loss": 1.603272795677185,
+ "mean_token_accuracy": 0.6400830745697021,
+ "num_tokens": 18628608.0,
+ "step": 1137
+ },
+ {
+ "entropy": 1.279178500175476,
+ "epoch": 2.298989898989899,
+ "grad_norm": 2.1509714126586914,
+ "learning_rate": 2.7030303030303036e-06,
+ "loss": 1.2742427587509155,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 18644992.0,
+ "step": 1138
+ },
+ {
+ "entropy": 1.2199708223342896,
+ "epoch": 2.301010101010101,
+ "grad_norm": 2.0223684310913086,
+ "learning_rate": 2.7010101010101015e-06,
+ "loss": 1.2254796028137207,
+ "mean_token_accuracy": 0.6971787810325623,
+ "num_tokens": 18661376.0,
+ "step": 1139
+ },
+ {
+ "entropy": 1.1640081405639648,
+ "epoch": 2.303030303030303,
+ "grad_norm": 2.1907923221588135,
+ "learning_rate": 2.6989898989898994e-06,
+ "loss": 1.170613408088684,
+ "mean_token_accuracy": 0.6979726552963257,
+ "num_tokens": 18677760.0,
+ "step": 1140
+ },
+ {
+ "entropy": 1.3213385343551636,
+ "epoch": 2.305050505050505,
+ "grad_norm": 2.170276641845703,
+ "learning_rate": 2.6969696969696972e-06,
+ "loss": 1.3338474035263062,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 18694144.0,
+ "step": 1141
+ },
+ {
+ "entropy": 1.6036078929901123,
+ "epoch": 2.3070707070707073,
+ "grad_norm": 2.3499386310577393,
+ "learning_rate": 2.694949494949495e-06,
+ "loss": 1.5859179496765137,
+ "mean_token_accuracy": 0.6349536180496216,
+ "num_tokens": 18710528.0,
+ "step": 1142
+ },
+ {
+ "entropy": 1.2171586751937866,
+ "epoch": 2.309090909090909,
+ "grad_norm": 2.0380377769470215,
+ "learning_rate": 2.6929292929292934e-06,
+ "loss": 1.2191288471221924,
+ "mean_token_accuracy": 0.7063385248184204,
+ "num_tokens": 18726912.0,
+ "step": 1143
+ },
+ {
+ "entropy": 1.165902018547058,
+ "epoch": 2.311111111111111,
+ "grad_norm": 2.077310085296631,
+ "learning_rate": 2.6909090909090913e-06,
+ "loss": 1.1728768348693848,
+ "mean_token_accuracy": 0.7075598239898682,
+ "num_tokens": 18743296.0,
+ "step": 1144
+ },
+ {
+ "entropy": 1.5172539949417114,
+ "epoch": 2.313131313131313,
+ "grad_norm": 2.0132439136505127,
+ "learning_rate": 2.6888888888888892e-06,
+ "loss": 1.5073471069335938,
+ "mean_token_accuracy": 0.6546775698661804,
+ "num_tokens": 18759680.0,
+ "step": 1145
+ },
+ {
+ "entropy": 1.3588616847991943,
+ "epoch": 2.315151515151515,
+ "grad_norm": 2.1851465702056885,
+ "learning_rate": 2.686868686868687e-06,
+ "loss": 1.4111744165420532,
+ "mean_token_accuracy": 0.6750732660293579,
+ "num_tokens": 18776064.0,
+ "step": 1146
+ },
+ {
+ "entropy": 1.1948320865631104,
+ "epoch": 2.317171717171717,
+ "grad_norm": 2.1817259788513184,
+ "learning_rate": 2.684848484848485e-06,
+ "loss": 1.188377857208252,
+ "mean_token_accuracy": 0.7122007608413696,
+ "num_tokens": 18792448.0,
+ "step": 1147
+ },
+ {
+ "entropy": 1.7049702405929565,
+ "epoch": 2.319191919191919,
+ "grad_norm": 2.309352159500122,
+ "learning_rate": 2.6828282828282833e-06,
+ "loss": 1.6966536045074463,
+ "mean_token_accuracy": 0.6052759885787964,
+ "num_tokens": 18808832.0,
+ "step": 1148
+ },
+ {
+ "entropy": 1.0853440761566162,
+ "epoch": 2.3212121212121213,
+ "grad_norm": 2.1501059532165527,
+ "learning_rate": 2.680808080808081e-06,
+ "loss": 1.0747997760772705,
+ "mean_token_accuracy": 0.7195896506309509,
+ "num_tokens": 18825216.0,
+ "step": 1149
+ },
+ {
+ "entropy": 1.209170937538147,
+ "epoch": 2.323232323232323,
+ "grad_norm": 2.105555772781372,
+ "learning_rate": 2.678787878787879e-06,
+ "loss": 1.2055076360702515,
+ "mean_token_accuracy": 0.7062774896621704,
+ "num_tokens": 18841600.0,
+ "step": 1150
+ },
+ {
+ "epoch": 2.323232323232323,
+ "eval_entropy": 1.3799022854335847,
+ "eval_loss": 1.5365934371948242,
+ "eval_mean_token_accuracy": 0.6452573234996488,
+ "eval_num_tokens": 18841600.0,
+ "eval_runtime": 43.7362,
+ "eval_samples_per_second": 22.636,
+ "eval_steps_per_second": 2.835,
+ "step": 1150
+ },
+ {
+ "entropy": 0.9533048868179321,
+ "epoch": 2.3252525252525253,
+ "grad_norm": 1.9681413173675537,
+ "learning_rate": 2.676767676767677e-06,
+ "loss": 0.9284776449203491,
+ "mean_token_accuracy": 0.7609916925430298,
+ "num_tokens": 18857984.0,
+ "step": 1151
+ },
+ {
+ "entropy": 1.575872778892517,
+ "epoch": 2.327272727272727,
+ "grad_norm": 2.15085768699646,
+ "learning_rate": 2.674747474747475e-06,
+ "loss": 1.5716705322265625,
+ "mean_token_accuracy": 0.6415486335754395,
+ "num_tokens": 18874368.0,
+ "step": 1152
+ },
+ {
+ "entropy": 1.1680493354797363,
+ "epoch": 2.3292929292929294,
+ "grad_norm": 2.189589023590088,
+ "learning_rate": 2.6727272727272727e-06,
+ "loss": 1.1651779413223267,
+ "mean_token_accuracy": 0.7156203985214233,
+ "num_tokens": 18890752.0,
+ "step": 1153
+ },
+ {
+ "entropy": 1.1636664867401123,
+ "epoch": 2.3313131313131312,
+ "grad_norm": 1.9992915391921997,
+ "learning_rate": 2.670707070707071e-06,
+ "loss": 1.1650042533874512,
+ "mean_token_accuracy": 0.7116512060165405,
+ "num_tokens": 18907136.0,
+ "step": 1154
+ },
+ {
+ "entropy": 1.205094337463379,
+ "epoch": 2.3333333333333335,
+ "grad_norm": 2.070323944091797,
+ "learning_rate": 2.668686868686869e-06,
+ "loss": 1.2071596384048462,
+ "mean_token_accuracy": 0.7018197178840637,
+ "num_tokens": 18923520.0,
+ "step": 1155
+ },
+ {
+ "entropy": 1.2256643772125244,
+ "epoch": 2.3353535353535353,
+ "grad_norm": 2.144339084625244,
+ "learning_rate": 2.666666666666667e-06,
+ "loss": 1.2168457508087158,
+ "mean_token_accuracy": 0.7010869383811951,
+ "num_tokens": 18939904.0,
+ "step": 1156
+ },
+ {
+ "entropy": 1.631039023399353,
+ "epoch": 2.3373737373737375,
+ "grad_norm": 2.2886807918548584,
+ "learning_rate": 2.6646464646464647e-06,
+ "loss": 1.6534450054168701,
+ "mean_token_accuracy": 0.6248778700828552,
+ "num_tokens": 18956288.0,
+ "step": 1157
+ },
+ {
+ "entropy": 1.0360562801361084,
+ "epoch": 2.3393939393939394,
+ "grad_norm": 2.137491226196289,
+ "learning_rate": 2.6626262626262626e-06,
+ "loss": 1.0167723894119263,
+ "mean_token_accuracy": 0.7330239415168762,
+ "num_tokens": 18972672.0,
+ "step": 1158
+ },
+ {
+ "entropy": 1.2292720079421997,
+ "epoch": 2.341414141414141,
+ "grad_norm": 3.1518330574035645,
+ "learning_rate": 2.660606060606061e-06,
+ "loss": 1.2180495262145996,
+ "mean_token_accuracy": 0.6957743167877197,
+ "num_tokens": 18989056.0,
+ "step": 1159
+ },
+ {
+ "entropy": 1.2210739850997925,
+ "epoch": 2.3434343434343434,
+ "grad_norm": 2.1314170360565186,
+ "learning_rate": 2.658585858585859e-06,
+ "loss": 1.2399296760559082,
+ "mean_token_accuracy": 0.7047508358955383,
+ "num_tokens": 19005440.0,
+ "step": 1160
+ },
+ {
+ "entropy": 1.2762846946716309,
+ "epoch": 2.3454545454545457,
+ "grad_norm": 2.1767046451568604,
+ "learning_rate": 2.6565656565656567e-06,
+ "loss": 1.2640776634216309,
+ "mean_token_accuracy": 0.6954079270362854,
+ "num_tokens": 19021824.0,
+ "step": 1161
+ },
+ {
+ "entropy": 1.271180272102356,
+ "epoch": 2.3474747474747475,
+ "grad_norm": 2.121891975402832,
+ "learning_rate": 2.6545454545454546e-06,
+ "loss": 1.2666800022125244,
+ "mean_token_accuracy": 0.6880801320075989,
+ "num_tokens": 19038208.0,
+ "step": 1162
+ },
+ {
+ "entropy": 1.5604509115219116,
+ "epoch": 2.3494949494949493,
+ "grad_norm": 2.320765495300293,
+ "learning_rate": 2.6525252525252525e-06,
+ "loss": 1.5687410831451416,
+ "mean_token_accuracy": 0.627198338508606,
+ "num_tokens": 19054592.0,
+ "step": 1163
+ },
+ {
+ "entropy": 1.1606905460357666,
+ "epoch": 2.3515151515151516,
+ "grad_norm": 2.1167874336242676,
+ "learning_rate": 2.6505050505050508e-06,
+ "loss": 1.1879122257232666,
+ "mean_token_accuracy": 0.7130556702613831,
+ "num_tokens": 19070976.0,
+ "step": 1164
+ },
+ {
+ "entropy": 1.5421797037124634,
+ "epoch": 2.3535353535353534,
+ "grad_norm": 2.144657850265503,
+ "learning_rate": 2.6484848484848487e-06,
+ "loss": 1.5562596321105957,
+ "mean_token_accuracy": 0.6350146532058716,
+ "num_tokens": 19087360.0,
+ "step": 1165
+ },
+ {
+ "entropy": 1.2803337574005127,
+ "epoch": 2.3555555555555556,
+ "grad_norm": 2.0440914630889893,
+ "learning_rate": 2.6464646464646466e-06,
+ "loss": 1.3008983135223389,
+ "mean_token_accuracy": 0.6868588328361511,
+ "num_tokens": 19103744.0,
+ "step": 1166
+ },
+ {
+ "entropy": 1.1863176822662354,
+ "epoch": 2.3575757575757574,
+ "grad_norm": 2.231771469116211,
+ "learning_rate": 2.6444444444444444e-06,
+ "loss": 1.1863257884979248,
+ "mean_token_accuracy": 0.7069491744041443,
+ "num_tokens": 19120128.0,
+ "step": 1167
+ },
+ {
+ "entropy": 1.1186378002166748,
+ "epoch": 2.3595959595959597,
+ "grad_norm": 2.0704708099365234,
+ "learning_rate": 2.6424242424242423e-06,
+ "loss": 1.1196620464324951,
+ "mean_token_accuracy": 0.726062536239624,
+ "num_tokens": 19136512.0,
+ "step": 1168
+ },
+ {
+ "entropy": 1.2110928297042847,
+ "epoch": 2.3616161616161615,
+ "grad_norm": 2.251551866531372,
+ "learning_rate": 2.6404040404040402e-06,
+ "loss": 1.2020606994628906,
+ "mean_token_accuracy": 0.7058500051498413,
+ "num_tokens": 19152896.0,
+ "step": 1169
+ },
+ {
+ "entropy": 1.302309513092041,
+ "epoch": 2.3636363636363638,
+ "grad_norm": 2.171961545944214,
+ "learning_rate": 2.6383838383838385e-06,
+ "loss": 1.3029515743255615,
+ "mean_token_accuracy": 0.673363447189331,
+ "num_tokens": 19169280.0,
+ "step": 1170
+ },
+ {
+ "entropy": 1.6036607027053833,
+ "epoch": 2.3656565656565656,
+ "grad_norm": 2.336979627609253,
+ "learning_rate": 2.6363636363636364e-06,
+ "loss": 1.6076864004135132,
+ "mean_token_accuracy": 0.630984365940094,
+ "num_tokens": 19185664.0,
+ "step": 1171
+ },
+ {
+ "entropy": 1.431620478630066,
+ "epoch": 2.367676767676768,
+ "grad_norm": 2.115891218185425,
+ "learning_rate": 2.6343434343434343e-06,
+ "loss": 1.4436556100845337,
+ "mean_token_accuracy": 0.6623717546463013,
+ "num_tokens": 19202048.0,
+ "step": 1172
+ },
+ {
+ "entropy": 1.4537419080734253,
+ "epoch": 2.3696969696969696,
+ "grad_norm": 2.497891664505005,
+ "learning_rate": 2.632323232323232e-06,
+ "loss": 1.48027503490448,
+ "mean_token_accuracy": 0.6352589130401611,
+ "num_tokens": 19218432.0,
+ "step": 1173
+ },
+ {
+ "entropy": 1.292363166809082,
+ "epoch": 2.371717171717172,
+ "grad_norm": 2.0235633850097656,
+ "learning_rate": 2.63030303030303e-06,
+ "loss": 1.3111207485198975,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 19234816.0,
+ "step": 1174
+ },
+ {
+ "entropy": 1.2336944341659546,
+ "epoch": 2.3737373737373737,
+ "grad_norm": 2.342643976211548,
+ "learning_rate": 2.628282828282829e-06,
+ "loss": 1.2427266836166382,
+ "mean_token_accuracy": 0.6844772696495056,
+ "num_tokens": 19251200.0,
+ "step": 1175
+ },
+ {
+ "entropy": 1.166039228439331,
+ "epoch": 2.375757575757576,
+ "grad_norm": 2.157937526702881,
+ "learning_rate": 2.6262626262626267e-06,
+ "loss": 1.167286992073059,
+ "mean_token_accuracy": 0.7115290760993958,
+ "num_tokens": 19267584.0,
+ "step": 1176
+ },
+ {
+ "entropy": 1.3824102878570557,
+ "epoch": 2.3777777777777778,
+ "grad_norm": 2.2874608039855957,
+ "learning_rate": 2.6242424242424246e-06,
+ "loss": 1.404619574546814,
+ "mean_token_accuracy": 0.6707376837730408,
+ "num_tokens": 19283968.0,
+ "step": 1177
+ },
+ {
+ "entropy": 0.8266427516937256,
+ "epoch": 2.3797979797979796,
+ "grad_norm": 2.098217010498047,
+ "learning_rate": 2.6222222222222225e-06,
+ "loss": 0.821276068687439,
+ "mean_token_accuracy": 0.7726551294326782,
+ "num_tokens": 19300352.0,
+ "step": 1178
+ },
+ {
+ "entropy": 1.4335079193115234,
+ "epoch": 2.381818181818182,
+ "grad_norm": 2.3051438331604004,
+ "learning_rate": 2.620202020202021e-06,
+ "loss": 1.437370777130127,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 19316736.0,
+ "step": 1179
+ },
+ {
+ "entropy": 1.0816318988800049,
+ "epoch": 2.3838383838383836,
+ "grad_norm": 2.0723016262054443,
+ "learning_rate": 2.6181818181818187e-06,
+ "loss": 1.0697057247161865,
+ "mean_token_accuracy": 0.7304592132568359,
+ "num_tokens": 19333120.0,
+ "step": 1180
+ },
+ {
+ "entropy": 1.2515255212783813,
+ "epoch": 2.385858585858586,
+ "grad_norm": 2.32125186920166,
+ "learning_rate": 2.6161616161616166e-06,
+ "loss": 1.256905198097229,
+ "mean_token_accuracy": 0.697300910949707,
+ "num_tokens": 19349504.0,
+ "step": 1181
+ },
+ {
+ "entropy": 1.0271868705749512,
+ "epoch": 2.3878787878787877,
+ "grad_norm": 2.0145103931427,
+ "learning_rate": 2.6141414141414145e-06,
+ "loss": 1.0158754587173462,
+ "mean_token_accuracy": 0.7518930435180664,
+ "num_tokens": 19365888.0,
+ "step": 1182
+ },
+ {
+ "entropy": 1.2139984369277954,
+ "epoch": 2.38989898989899,
+ "grad_norm": 2.1393911838531494,
+ "learning_rate": 2.6121212121212123e-06,
+ "loss": 1.2150651216506958,
+ "mean_token_accuracy": 0.7135441899299622,
+ "num_tokens": 19382272.0,
+ "step": 1183
+ },
+ {
+ "entropy": 1.076101303100586,
+ "epoch": 2.391919191919192,
+ "grad_norm": 2.1664907932281494,
+ "learning_rate": 2.6101010101010107e-06,
+ "loss": 1.0744431018829346,
+ "mean_token_accuracy": 0.7267953157424927,
+ "num_tokens": 19398656.0,
+ "step": 1184
+ },
+ {
+ "entropy": 1.5176570415496826,
+ "epoch": 2.393939393939394,
+ "grad_norm": 2.0756311416625977,
+ "learning_rate": 2.6080808080808085e-06,
+ "loss": 1.5209624767303467,
+ "mean_token_accuracy": 0.647777259349823,
+ "num_tokens": 19415040.0,
+ "step": 1185
+ },
+ {
+ "entropy": 1.0946495532989502,
+ "epoch": 2.395959595959596,
+ "grad_norm": 2.0545496940612793,
+ "learning_rate": 2.6060606060606064e-06,
+ "loss": 1.0858100652694702,
+ "mean_token_accuracy": 0.7226428985595703,
+ "num_tokens": 19431424.0,
+ "step": 1186
+ },
+ {
+ "entropy": 0.7713431715965271,
+ "epoch": 2.397979797979798,
+ "grad_norm": 2.0606112480163574,
+ "learning_rate": 2.6040404040404043e-06,
+ "loss": 0.7782045006752014,
+ "mean_token_accuracy": 0.7804103493690491,
+ "num_tokens": 19447808.0,
+ "step": 1187
+ },
+ {
+ "entropy": 1.2803305387496948,
+ "epoch": 2.4,
+ "grad_norm": 2.2125155925750732,
+ "learning_rate": 2.602020202020202e-06,
+ "loss": 1.2971004247665405,
+ "mean_token_accuracy": 0.6787371635437012,
+ "num_tokens": 19464192.0,
+ "step": 1188
+ },
+ {
+ "entropy": 0.9156424403190613,
+ "epoch": 2.402020202020202,
+ "grad_norm": 2.032531499862671,
+ "learning_rate": 2.6e-06,
+ "loss": 0.9119267463684082,
+ "mean_token_accuracy": 0.7627015113830566,
+ "num_tokens": 19480576.0,
+ "step": 1189
+ },
+ {
+ "entropy": 1.2698813676834106,
+ "epoch": 2.404040404040404,
+ "grad_norm": 2.2204320430755615,
+ "learning_rate": 2.5979797979797984e-06,
+ "loss": 1.2934629917144775,
+ "mean_token_accuracy": 0.682584285736084,
+ "num_tokens": 19496960.0,
+ "step": 1190
+ },
+ {
+ "entropy": 1.5677871704101562,
+ "epoch": 2.4060606060606062,
+ "grad_norm": 2.229994773864746,
+ "learning_rate": 2.5959595959595963e-06,
+ "loss": 1.591191053390503,
+ "mean_token_accuracy": 0.6297020316123962,
+ "num_tokens": 19513344.0,
+ "step": 1191
+ },
+ {
+ "entropy": 1.3057011365890503,
+ "epoch": 2.408080808080808,
+ "grad_norm": 2.4158618450164795,
+ "learning_rate": 2.593939393939394e-06,
+ "loss": 1.2989580631256104,
+ "mean_token_accuracy": 0.689728856086731,
+ "num_tokens": 19529728.0,
+ "step": 1192
+ },
+ {
+ "entropy": 1.3805862665176392,
+ "epoch": 2.41010101010101,
+ "grad_norm": 2.2611825466156006,
+ "learning_rate": 2.591919191919192e-06,
+ "loss": 1.385383129119873,
+ "mean_token_accuracy": 0.6634709239006042,
+ "num_tokens": 19546112.0,
+ "step": 1193
+ },
+ {
+ "entropy": 1.8123539686203003,
+ "epoch": 2.412121212121212,
+ "grad_norm": 2.3038923740386963,
+ "learning_rate": 2.58989898989899e-06,
+ "loss": 1.80764901638031,
+ "mean_token_accuracy": 0.5925744771957397,
+ "num_tokens": 19562496.0,
+ "step": 1194
+ },
+ {
+ "entropy": 1.1476300954818726,
+ "epoch": 2.4141414141414144,
+ "grad_norm": 2.2417445182800293,
+ "learning_rate": 2.5878787878787883e-06,
+ "loss": 1.1802024841308594,
+ "mean_token_accuracy": 0.7130556702613831,
+ "num_tokens": 19578880.0,
+ "step": 1195
+ },
+ {
+ "entropy": 1.6678205728530884,
+ "epoch": 2.416161616161616,
+ "grad_norm": 2.399136781692505,
+ "learning_rate": 2.585858585858586e-06,
+ "loss": 1.6780188083648682,
+ "mean_token_accuracy": 0.6161455512046814,
+ "num_tokens": 19595264.0,
+ "step": 1196
+ },
+ {
+ "entropy": 1.053451418876648,
+ "epoch": 2.418181818181818,
+ "grad_norm": 1.9980698823928833,
+ "learning_rate": 2.583838383838384e-06,
+ "loss": 1.0241587162017822,
+ "mean_token_accuracy": 0.7372984886169434,
+ "num_tokens": 19611648.0,
+ "step": 1197
+ },
+ {
+ "entropy": 1.5389430522918701,
+ "epoch": 2.4202020202020202,
+ "grad_norm": 2.171046733856201,
+ "learning_rate": 2.581818181818182e-06,
+ "loss": 1.5499310493469238,
+ "mean_token_accuracy": 0.6422203183174133,
+ "num_tokens": 19628032.0,
+ "step": 1198
+ },
+ {
+ "entropy": 1.4151558876037598,
+ "epoch": 2.422222222222222,
+ "grad_norm": 2.185184955596924,
+ "learning_rate": 2.57979797979798e-06,
+ "loss": 1.4296989440917969,
+ "mean_token_accuracy": 0.663593053817749,
+ "num_tokens": 19644416.0,
+ "step": 1199
+ },
+ {
+ "entropy": 1.1455156803131104,
+ "epoch": 2.4242424242424243,
+ "grad_norm": 2.224477767944336,
+ "learning_rate": 2.577777777777778e-06,
+ "loss": 1.1682045459747314,
+ "mean_token_accuracy": 0.7084147334098816,
+ "num_tokens": 19660800.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.4242424242424243,
+ "eval_entropy": 1.3761802339746105,
+ "eval_loss": 1.53595769405365,
+ "eval_mean_token_accuracy": 0.6453439944213436,
+ "eval_num_tokens": 19660800.0,
+ "eval_runtime": 43.8176,
+ "eval_samples_per_second": 22.594,
+ "eval_steps_per_second": 2.83,
+ "step": 1200
+ },
+ {
+ "entropy": 1.6039199829101562,
+ "epoch": 2.426262626262626,
+ "grad_norm": 2.122072696685791,
+ "learning_rate": 2.575757575757576e-06,
+ "loss": 1.625109314918518,
+ "mean_token_accuracy": 0.6306179761886597,
+ "num_tokens": 19677184.0,
+ "step": 1201
+ },
+ {
+ "entropy": 1.2364906072616577,
+ "epoch": 2.4282828282828284,
+ "grad_norm": 2.175671339035034,
+ "learning_rate": 2.573737373737374e-06,
+ "loss": 1.2398111820220947,
+ "mean_token_accuracy": 0.6886907815933228,
+ "num_tokens": 19693568.0,
+ "step": 1202
+ },
+ {
+ "entropy": 1.2937804460525513,
+ "epoch": 2.43030303030303,
+ "grad_norm": 2.1206040382385254,
+ "learning_rate": 2.571717171717172e-06,
+ "loss": 1.3073123693466187,
+ "mean_token_accuracy": 0.6762945652008057,
+ "num_tokens": 19709952.0,
+ "step": 1203
+ },
+ {
+ "entropy": 1.0239282846450806,
+ "epoch": 2.4323232323232324,
+ "grad_norm": 1.863510012626648,
+ "learning_rate": 2.5696969696969697e-06,
+ "loss": 1.015241026878357,
+ "mean_token_accuracy": 0.7452369332313538,
+ "num_tokens": 19726336.0,
+ "step": 1204
+ },
+ {
+ "entropy": 1.2327015399932861,
+ "epoch": 2.4343434343434343,
+ "grad_norm": 1.968019962310791,
+ "learning_rate": 2.5676767676767676e-06,
+ "loss": 1.2275054454803467,
+ "mean_token_accuracy": 0.6974841356277466,
+ "num_tokens": 19742720.0,
+ "step": 1205
+ },
+ {
+ "entropy": 1.130920171737671,
+ "epoch": 2.4363636363636365,
+ "grad_norm": 2.096205949783325,
+ "learning_rate": 2.565656565656566e-06,
+ "loss": 1.1229937076568604,
+ "mean_token_accuracy": 0.7102466821670532,
+ "num_tokens": 19759104.0,
+ "step": 1206
+ },
+ {
+ "entropy": 0.9204118251800537,
+ "epoch": 2.4383838383838383,
+ "grad_norm": 1.7956496477127075,
+ "learning_rate": 2.5636363636363638e-06,
+ "loss": 0.9276518821716309,
+ "mean_token_accuracy": 0.7644113302230835,
+ "num_tokens": 19775488.0,
+ "step": 1207
+ },
+ {
+ "entropy": 0.9552480578422546,
+ "epoch": 2.4404040404040406,
+ "grad_norm": 2.0838167667388916,
+ "learning_rate": 2.5616161616161617e-06,
+ "loss": 0.9676632881164551,
+ "mean_token_accuracy": 0.7421225905418396,
+ "num_tokens": 19791872.0,
+ "step": 1208
+ },
+ {
+ "entropy": 1.0109010934829712,
+ "epoch": 2.4424242424242424,
+ "grad_norm": 2.1739392280578613,
+ "learning_rate": 2.5595959595959595e-06,
+ "loss": 1.0201005935668945,
+ "mean_token_accuracy": 0.7366267442703247,
+ "num_tokens": 19808256.0,
+ "step": 1209
+ },
+ {
+ "entropy": 1.4037907123565674,
+ "epoch": 2.4444444444444446,
+ "grad_norm": 2.151865005493164,
+ "learning_rate": 2.5575757575757574e-06,
+ "loss": 1.4110395908355713,
+ "mean_token_accuracy": 0.6682339906692505,
+ "num_tokens": 19824640.0,
+ "step": 1210
+ },
+ {
+ "entropy": 1.2449947595596313,
+ "epoch": 2.4464646464646465,
+ "grad_norm": 2.065934896469116,
+ "learning_rate": 2.5555555555555557e-06,
+ "loss": 1.2521324157714844,
+ "mean_token_accuracy": 0.6952247023582458,
+ "num_tokens": 19841024.0,
+ "step": 1211
+ },
+ {
+ "entropy": 1.2075072526931763,
+ "epoch": 2.4484848484848483,
+ "grad_norm": 2.197885274887085,
+ "learning_rate": 2.5535353535353536e-06,
+ "loss": 1.2041654586791992,
+ "mean_token_accuracy": 0.69840008020401,
+ "num_tokens": 19857408.0,
+ "step": 1212
+ },
+ {
+ "entropy": 1.0454095602035522,
+ "epoch": 2.4505050505050505,
+ "grad_norm": 2.0778188705444336,
+ "learning_rate": 2.5515151515151515e-06,
+ "loss": 1.0392906665802002,
+ "mean_token_accuracy": 0.74187833070755,
+ "num_tokens": 19873792.0,
+ "step": 1213
+ },
+ {
+ "entropy": 1.3138911724090576,
+ "epoch": 2.4525252525252528,
+ "grad_norm": 2.1871910095214844,
+ "learning_rate": 2.5494949494949494e-06,
+ "loss": 1.317048192024231,
+ "mean_token_accuracy": 0.6720811128616333,
+ "num_tokens": 19890176.0,
+ "step": 1214
+ },
+ {
+ "entropy": 1.263680338859558,
+ "epoch": 2.4545454545454546,
+ "grad_norm": 2.129873752593994,
+ "learning_rate": 2.5474747474747473e-06,
+ "loss": 1.277045726776123,
+ "mean_token_accuracy": 0.7011480331420898,
+ "num_tokens": 19906560.0,
+ "step": 1215
+ },
+ {
+ "entropy": 0.9653311967849731,
+ "epoch": 2.4565656565656564,
+ "grad_norm": 2.1161508560180664,
+ "learning_rate": 2.5454545454545456e-06,
+ "loss": 0.9699352979660034,
+ "mean_token_accuracy": 0.7437713742256165,
+ "num_tokens": 19922944.0,
+ "step": 1216
+ },
+ {
+ "entropy": 1.350392460823059,
+ "epoch": 2.4585858585858587,
+ "grad_norm": 2.0958914756774902,
+ "learning_rate": 2.5434343434343435e-06,
+ "loss": 1.3442802429199219,
+ "mean_token_accuracy": 0.6768441796302795,
+ "num_tokens": 19939328.0,
+ "step": 1217
+ },
+ {
+ "entropy": 1.2484683990478516,
+ "epoch": 2.4606060606060605,
+ "grad_norm": 2.191668748855591,
+ "learning_rate": 2.541414141414142e-06,
+ "loss": 1.2663497924804688,
+ "mean_token_accuracy": 0.6958964467048645,
+ "num_tokens": 19955712.0,
+ "step": 1218
+ },
+ {
+ "entropy": 0.9751343131065369,
+ "epoch": 2.4626262626262627,
+ "grad_norm": 2.0976815223693848,
+ "learning_rate": 2.5393939393939397e-06,
+ "loss": 0.9734562635421753,
+ "mean_token_accuracy": 0.7372373938560486,
+ "num_tokens": 19972096.0,
+ "step": 1219
+ },
+ {
+ "entropy": 1.1655267477035522,
+ "epoch": 2.4646464646464645,
+ "grad_norm": 2.3504767417907715,
+ "learning_rate": 2.537373737373738e-06,
+ "loss": 1.1775636672973633,
+ "mean_token_accuracy": 0.7023082375526428,
+ "num_tokens": 19988480.0,
+ "step": 1220
+ },
+ {
+ "entropy": 1.3543325662612915,
+ "epoch": 2.466666666666667,
+ "grad_norm": 2.038313627243042,
+ "learning_rate": 2.535353535353536e-06,
+ "loss": 1.3447773456573486,
+ "mean_token_accuracy": 0.6779433488845825,
+ "num_tokens": 20004864.0,
+ "step": 1221
+ },
+ {
+ "entropy": 1.1814380884170532,
+ "epoch": 2.4686868686868686,
+ "grad_norm": 2.186947822570801,
+ "learning_rate": 2.5333333333333338e-06,
+ "loss": 1.186347246170044,
+ "mean_token_accuracy": 0.7064606547355652,
+ "num_tokens": 20021248.0,
+ "step": 1222
+ },
+ {
+ "entropy": 0.9775183796882629,
+ "epoch": 2.470707070707071,
+ "grad_norm": 2.144923210144043,
+ "learning_rate": 2.5313131313131317e-06,
+ "loss": 1.0010652542114258,
+ "mean_token_accuracy": 0.7385808229446411,
+ "num_tokens": 20037632.0,
+ "step": 1223
+ },
+ {
+ "entropy": 1.6076546907424927,
+ "epoch": 2.4727272727272727,
+ "grad_norm": 2.1664817333221436,
+ "learning_rate": 2.5292929292929296e-06,
+ "loss": 1.618837594985962,
+ "mean_token_accuracy": 0.6297630667686462,
+ "num_tokens": 20054016.0,
+ "step": 1224
+ },
+ {
+ "entropy": 1.0457805395126343,
+ "epoch": 2.474747474747475,
+ "grad_norm": 2.154000997543335,
+ "learning_rate": 2.5272727272727274e-06,
+ "loss": 1.0406007766723633,
+ "mean_token_accuracy": 0.7322911620140076,
+ "num_tokens": 20070400.0,
+ "step": 1225
+ },
+ {
+ "entropy": 1.065863847732544,
+ "epoch": 2.4767676767676767,
+ "grad_norm": 2.062626361846924,
+ "learning_rate": 2.5252525252525258e-06,
+ "loss": 1.0432696342468262,
+ "mean_token_accuracy": 0.7371152639389038,
+ "num_tokens": 20086784.0,
+ "step": 1226
+ },
+ {
+ "entropy": 1.5166304111480713,
+ "epoch": 2.4787878787878785,
+ "grad_norm": 2.089587926864624,
+ "learning_rate": 2.5232323232323236e-06,
+ "loss": 1.5205962657928467,
+ "mean_token_accuracy": 0.653822660446167,
+ "num_tokens": 20103168.0,
+ "step": 1227
+ },
+ {
+ "entropy": 1.5969332456588745,
+ "epoch": 2.480808080808081,
+ "grad_norm": 2.297184705734253,
+ "learning_rate": 2.5212121212121215e-06,
+ "loss": 1.611903190612793,
+ "mean_token_accuracy": 0.6246336102485657,
+ "num_tokens": 20119552.0,
+ "step": 1228
+ },
+ {
+ "entropy": 1.8385323286056519,
+ "epoch": 2.482828282828283,
+ "grad_norm": 2.0568299293518066,
+ "learning_rate": 2.5191919191919194e-06,
+ "loss": 1.848689079284668,
+ "mean_token_accuracy": 0.6079018115997314,
+ "num_tokens": 20135936.0,
+ "step": 1229
+ },
+ {
+ "entropy": 1.1586394309997559,
+ "epoch": 2.484848484848485,
+ "grad_norm": 1.91037917137146,
+ "learning_rate": 2.5171717171717173e-06,
+ "loss": 1.1482139825820923,
+ "mean_token_accuracy": 0.7165364027023315,
+ "num_tokens": 20152320.0,
+ "step": 1230
+ },
+ {
+ "entropy": 1.6905426979064941,
+ "epoch": 2.4868686868686867,
+ "grad_norm": 2.2317121028900146,
+ "learning_rate": 2.5151515151515156e-06,
+ "loss": 1.7028450965881348,
+ "mean_token_accuracy": 0.6125427484512329,
+ "num_tokens": 20168704.0,
+ "step": 1231
+ },
+ {
+ "entropy": 1.1329548358917236,
+ "epoch": 2.488888888888889,
+ "grad_norm": 2.112380027770996,
+ "learning_rate": 2.5131313131313135e-06,
+ "loss": 1.120601773262024,
+ "mean_token_accuracy": 0.7181240916252136,
+ "num_tokens": 20185088.0,
+ "step": 1232
+ },
+ {
+ "entropy": 1.2013109922409058,
+ "epoch": 2.4909090909090907,
+ "grad_norm": 2.087054491043091,
+ "learning_rate": 2.5111111111111114e-06,
+ "loss": 1.2169899940490723,
+ "mean_token_accuracy": 0.7089032530784607,
+ "num_tokens": 20201472.0,
+ "step": 1233
+ },
+ {
+ "entropy": 1.187458872795105,
+ "epoch": 2.492929292929293,
+ "grad_norm": 2.431793689727783,
+ "learning_rate": 2.5090909090909093e-06,
+ "loss": 1.2183618545532227,
+ "mean_token_accuracy": 0.6925378441810608,
+ "num_tokens": 20217856.0,
+ "step": 1234
+ },
+ {
+ "entropy": 1.2123541831970215,
+ "epoch": 2.494949494949495,
+ "grad_norm": 2.1715121269226074,
+ "learning_rate": 2.507070707070707e-06,
+ "loss": 1.2254973649978638,
+ "mean_token_accuracy": 0.703285276889801,
+ "num_tokens": 20234240.0,
+ "step": 1235
+ },
+ {
+ "entropy": 1.0582001209259033,
+ "epoch": 2.496969696969697,
+ "grad_norm": 2.222578763961792,
+ "learning_rate": 2.5050505050505055e-06,
+ "loss": 1.061441421508789,
+ "mean_token_accuracy": 0.7247191071510315,
+ "num_tokens": 20250624.0,
+ "step": 1236
+ },
+ {
+ "entropy": 1.5102840662002563,
+ "epoch": 2.498989898989899,
+ "grad_norm": 2.27860951423645,
+ "learning_rate": 2.5030303030303034e-06,
+ "loss": 1.519880771636963,
+ "mean_token_accuracy": 0.6581583023071289,
+ "num_tokens": 20267008.0,
+ "step": 1237
+ },
+ {
+ "entropy": 1.222317099571228,
+ "epoch": 2.501010101010101,
+ "grad_norm": 2.182908773422241,
+ "learning_rate": 2.5010101010101013e-06,
+ "loss": 1.2382556200027466,
+ "mean_token_accuracy": 0.6908891201019287,
+ "num_tokens": 20283392.0,
+ "step": 1238
+ },
+ {
+ "entropy": 1.252193570137024,
+ "epoch": 2.503030303030303,
+ "grad_norm": 2.2065556049346924,
+ "learning_rate": 2.498989898989899e-06,
+ "loss": 1.2510521411895752,
+ "mean_token_accuracy": 0.6914386749267578,
+ "num_tokens": 20299776.0,
+ "step": 1239
+ },
+ {
+ "entropy": 1.2909793853759766,
+ "epoch": 2.505050505050505,
+ "grad_norm": 2.374338150024414,
+ "learning_rate": 2.496969696969697e-06,
+ "loss": 1.3144972324371338,
+ "mean_token_accuracy": 0.6847215294837952,
+ "num_tokens": 20316160.0,
+ "step": 1240
+ },
+ {
+ "entropy": 1.5218966007232666,
+ "epoch": 2.507070707070707,
+ "grad_norm": 2.3914759159088135,
+ "learning_rate": 2.494949494949495e-06,
+ "loss": 1.5194602012634277,
+ "mean_token_accuracy": 0.6398998498916626,
+ "num_tokens": 20332544.0,
+ "step": 1241
+ },
+ {
+ "entropy": 1.2130569219589233,
+ "epoch": 2.509090909090909,
+ "grad_norm": 2.2857706546783447,
+ "learning_rate": 2.4929292929292932e-06,
+ "loss": 1.2035828828811646,
+ "mean_token_accuracy": 0.6977283954620361,
+ "num_tokens": 20348928.0,
+ "step": 1242
+ },
+ {
+ "entropy": 1.623070478439331,
+ "epoch": 2.511111111111111,
+ "grad_norm": 2.3757028579711914,
+ "learning_rate": 2.490909090909091e-06,
+ "loss": 1.654674768447876,
+ "mean_token_accuracy": 0.6242061257362366,
+ "num_tokens": 20365312.0,
+ "step": 1243
+ },
+ {
+ "entropy": 1.6762864589691162,
+ "epoch": 2.5131313131313133,
+ "grad_norm": 2.239466667175293,
+ "learning_rate": 2.488888888888889e-06,
+ "loss": 1.6712524890899658,
+ "mean_token_accuracy": 0.6280532479286194,
+ "num_tokens": 20381696.0,
+ "step": 1244
+ },
+ {
+ "entropy": 1.6754344701766968,
+ "epoch": 2.515151515151515,
+ "grad_norm": 2.2599003314971924,
+ "learning_rate": 2.486868686868687e-06,
+ "loss": 1.6697289943695068,
+ "mean_token_accuracy": 0.6158402562141418,
+ "num_tokens": 20398080.0,
+ "step": 1245
+ },
+ {
+ "entropy": 1.6282587051391602,
+ "epoch": 2.517171717171717,
+ "grad_norm": 2.0555050373077393,
+ "learning_rate": 2.4848484848484848e-06,
+ "loss": 1.6177103519439697,
+ "mean_token_accuracy": 0.63312166929245,
+ "num_tokens": 20414464.0,
+ "step": 1246
+ },
+ {
+ "entropy": 1.3457770347595215,
+ "epoch": 2.519191919191919,
+ "grad_norm": 2.3396496772766113,
+ "learning_rate": 2.482828282828283e-06,
+ "loss": 1.3288640975952148,
+ "mean_token_accuracy": 0.6720811128616333,
+ "num_tokens": 20430848.0,
+ "step": 1247
+ },
+ {
+ "entropy": 1.5269931554794312,
+ "epoch": 2.5212121212121215,
+ "grad_norm": 2.303053617477417,
+ "learning_rate": 2.480808080808081e-06,
+ "loss": 1.4953217506408691,
+ "mean_token_accuracy": 0.639167070388794,
+ "num_tokens": 20447232.0,
+ "step": 1248
+ },
+ {
+ "entropy": 1.3399546146392822,
+ "epoch": 2.5232323232323233,
+ "grad_norm": 2.3238017559051514,
+ "learning_rate": 2.478787878787879e-06,
+ "loss": 1.337552547454834,
+ "mean_token_accuracy": 0.6790425181388855,
+ "num_tokens": 20463616.0,
+ "step": 1249
+ },
+ {
+ "entropy": 1.0954687595367432,
+ "epoch": 2.525252525252525,
+ "grad_norm": 2.2266361713409424,
+ "learning_rate": 2.476767676767677e-06,
+ "loss": 1.074552297592163,
+ "mean_token_accuracy": 0.7192232608795166,
+ "num_tokens": 20480000.0,
+ "step": 1250
+ },
+ {
+ "epoch": 2.525252525252525,
+ "eval_entropy": 1.375552624464035,
+ "eval_loss": 1.5356626510620117,
+ "eval_mean_token_accuracy": 0.6455749580937047,
+ "eval_num_tokens": 20480000.0,
+ "eval_runtime": 43.8024,
+ "eval_samples_per_second": 22.602,
+ "eval_steps_per_second": 2.831,
+ "step": 1250
+ },
+ {
+ "entropy": 1.329379916191101,
+ "epoch": 2.5272727272727273,
+ "grad_norm": 2.288421392440796,
+ "learning_rate": 2.474747474747475e-06,
+ "loss": 1.3166120052337646,
+ "mean_token_accuracy": 0.6743404865264893,
+ "num_tokens": 20496384.0,
+ "step": 1251
+ },
+ {
+ "entropy": 1.3155947923660278,
+ "epoch": 2.529292929292929,
+ "grad_norm": 2.2791004180908203,
+ "learning_rate": 2.472727272727273e-06,
+ "loss": 1.3281152248382568,
+ "mean_token_accuracy": 0.6623717546463013,
+ "num_tokens": 20512768.0,
+ "step": 1252
+ },
+ {
+ "entropy": 1.2875827550888062,
+ "epoch": 2.5313131313131314,
+ "grad_norm": 2.193981409072876,
+ "learning_rate": 2.470707070707071e-06,
+ "loss": 1.280174732208252,
+ "mean_token_accuracy": 0.6996824741363525,
+ "num_tokens": 20529152.0,
+ "step": 1253
+ },
+ {
+ "entropy": 1.1551588773727417,
+ "epoch": 2.533333333333333,
+ "grad_norm": 2.297534942626953,
+ "learning_rate": 2.468686868686869e-06,
+ "loss": 1.1548980474472046,
+ "mean_token_accuracy": 0.7089643478393555,
+ "num_tokens": 20545536.0,
+ "step": 1254
+ },
+ {
+ "entropy": 1.1836578845977783,
+ "epoch": 2.5353535353535355,
+ "grad_norm": 2.1724929809570312,
+ "learning_rate": 2.466666666666667e-06,
+ "loss": 1.1787464618682861,
+ "mean_token_accuracy": 0.705422580242157,
+ "num_tokens": 20561920.0,
+ "step": 1255
+ },
+ {
+ "entropy": 1.0938197374343872,
+ "epoch": 2.5373737373737373,
+ "grad_norm": 2.247507095336914,
+ "learning_rate": 2.464646464646465e-06,
+ "loss": 1.0977723598480225,
+ "mean_token_accuracy": 0.7205055952072144,
+ "num_tokens": 20578304.0,
+ "step": 1256
+ },
+ {
+ "entropy": 1.790277361869812,
+ "epoch": 2.5393939393939395,
+ "grad_norm": 2.314159631729126,
+ "learning_rate": 2.462626262626263e-06,
+ "loss": 1.792272925376892,
+ "mean_token_accuracy": 0.6231069564819336,
+ "num_tokens": 20594688.0,
+ "step": 1257
+ },
+ {
+ "entropy": 1.385352611541748,
+ "epoch": 2.5414141414141413,
+ "grad_norm": 2.2065250873565674,
+ "learning_rate": 2.4606060606060607e-06,
+ "loss": 1.4161381721496582,
+ "mean_token_accuracy": 0.673363447189331,
+ "num_tokens": 20611072.0,
+ "step": 1258
+ },
+ {
+ "entropy": 1.5186140537261963,
+ "epoch": 2.5434343434343436,
+ "grad_norm": 2.277163028717041,
+ "learning_rate": 2.4585858585858586e-06,
+ "loss": 1.5157082080841064,
+ "mean_token_accuracy": 0.6420371532440186,
+ "num_tokens": 20627456.0,
+ "step": 1259
+ },
+ {
+ "entropy": 1.6179429292678833,
+ "epoch": 2.5454545454545454,
+ "grad_norm": 2.1880221366882324,
+ "learning_rate": 2.456565656565657e-06,
+ "loss": 1.6365107297897339,
+ "mean_token_accuracy": 0.6164509057998657,
+ "num_tokens": 20643840.0,
+ "step": 1260
+ },
+ {
+ "entropy": 1.5839602947235107,
+ "epoch": 2.5474747474747472,
+ "grad_norm": 2.3658924102783203,
+ "learning_rate": 2.454545454545455e-06,
+ "loss": 1.593346118927002,
+ "mean_token_accuracy": 0.6339765787124634,
+ "num_tokens": 20660224.0,
+ "step": 1261
+ },
+ {
+ "entropy": 1.3825792074203491,
+ "epoch": 2.5494949494949495,
+ "grad_norm": 2.3293564319610596,
+ "learning_rate": 2.4525252525252527e-06,
+ "loss": 1.44181489944458,
+ "mean_token_accuracy": 0.6660356521606445,
+ "num_tokens": 20676608.0,
+ "step": 1262
+ },
+ {
+ "entropy": 1.0796198844909668,
+ "epoch": 2.5515151515151517,
+ "grad_norm": 2.1055870056152344,
+ "learning_rate": 2.4505050505050506e-06,
+ "loss": 1.0861892700195312,
+ "mean_token_accuracy": 0.7263067960739136,
+ "num_tokens": 20692992.0,
+ "step": 1263
+ },
+ {
+ "entropy": 1.4059629440307617,
+ "epoch": 2.5535353535353535,
+ "grad_norm": 2.137063980102539,
+ "learning_rate": 2.4484848484848485e-06,
+ "loss": 1.4127235412597656,
+ "mean_token_accuracy": 0.6654250025749207,
+ "num_tokens": 20709376.0,
+ "step": 1264
+ },
+ {
+ "entropy": 1.2902467250823975,
+ "epoch": 2.5555555555555554,
+ "grad_norm": 2.175401210784912,
+ "learning_rate": 2.4464646464646468e-06,
+ "loss": 1.2854642868041992,
+ "mean_token_accuracy": 0.6966292262077332,
+ "num_tokens": 20725760.0,
+ "step": 1265
+ },
+ {
+ "entropy": 1.7958943843841553,
+ "epoch": 2.5575757575757576,
+ "grad_norm": 2.3500523567199707,
+ "learning_rate": 2.4444444444444447e-06,
+ "loss": 1.811906337738037,
+ "mean_token_accuracy": 0.5961162447929382,
+ "num_tokens": 20742144.0,
+ "step": 1266
+ },
+ {
+ "entropy": 1.7406131029129028,
+ "epoch": 2.55959595959596,
+ "grad_norm": 2.3911163806915283,
+ "learning_rate": 2.4424242424242426e-06,
+ "loss": 1.7608356475830078,
+ "mean_token_accuracy": 0.6002076268196106,
+ "num_tokens": 20758528.0,
+ "step": 1267
+ },
+ {
+ "entropy": 1.440137267112732,
+ "epoch": 2.5616161616161617,
+ "grad_norm": 2.057145833969116,
+ "learning_rate": 2.4404040404040404e-06,
+ "loss": 1.4450485706329346,
+ "mean_token_accuracy": 0.6570591330528259,
+ "num_tokens": 20774912.0,
+ "step": 1268
+ },
+ {
+ "entropy": 1.510685682296753,
+ "epoch": 2.5636363636363635,
+ "grad_norm": 2.379920244216919,
+ "learning_rate": 2.4383838383838383e-06,
+ "loss": 1.5113954544067383,
+ "mean_token_accuracy": 0.6450293064117432,
+ "num_tokens": 20791296.0,
+ "step": 1269
+ },
+ {
+ "entropy": 1.3595963716506958,
+ "epoch": 2.5656565656565657,
+ "grad_norm": 2.226229190826416,
+ "learning_rate": 2.4363636363636366e-06,
+ "loss": 1.3598928451538086,
+ "mean_token_accuracy": 0.6723864078521729,
+ "num_tokens": 20807680.0,
+ "step": 1270
+ },
+ {
+ "entropy": 1.3053373098373413,
+ "epoch": 2.5676767676767676,
+ "grad_norm": 2.181692361831665,
+ "learning_rate": 2.4343434343434345e-06,
+ "loss": 1.283501148223877,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 20824064.0,
+ "step": 1271
+ },
+ {
+ "entropy": 0.9631388187408447,
+ "epoch": 2.56969696969697,
+ "grad_norm": 2.083442449569702,
+ "learning_rate": 2.432323232323233e-06,
+ "loss": 0.9463216066360474,
+ "mean_token_accuracy": 0.7476184368133545,
+ "num_tokens": 20840448.0,
+ "step": 1272
+ },
+ {
+ "entropy": 1.0792899131774902,
+ "epoch": 2.5717171717171716,
+ "grad_norm": 2.204257011413574,
+ "learning_rate": 2.4303030303030307e-06,
+ "loss": 1.0787214040756226,
+ "mean_token_accuracy": 0.7241694927215576,
+ "num_tokens": 20856832.0,
+ "step": 1273
+ },
+ {
+ "entropy": 1.0843226909637451,
+ "epoch": 2.573737373737374,
+ "grad_norm": 2.0145976543426514,
+ "learning_rate": 2.4282828282828286e-06,
+ "loss": 1.0722554922103882,
+ "mean_token_accuracy": 0.7263678312301636,
+ "num_tokens": 20873216.0,
+ "step": 1274
+ },
+ {
+ "entropy": 1.5040221214294434,
+ "epoch": 2.5757575757575757,
+ "grad_norm": 2.3076000213623047,
+ "learning_rate": 2.4262626262626265e-06,
+ "loss": 1.5152506828308105,
+ "mean_token_accuracy": 0.6420371532440186,
+ "num_tokens": 20889600.0,
+ "step": 1275
+ },
+ {
+ "entropy": 1.5882561206817627,
+ "epoch": 2.5777777777777775,
+ "grad_norm": 2.093400716781616,
+ "learning_rate": 2.4242424242424244e-06,
+ "loss": 1.5827500820159912,
+ "mean_token_accuracy": 0.6293356418609619,
+ "num_tokens": 20905984.0,
+ "step": 1276
+ },
+ {
+ "entropy": 1.1761770248413086,
+ "epoch": 2.5797979797979798,
+ "grad_norm": 1.9723676443099976,
+ "learning_rate": 2.4222222222222223e-06,
+ "loss": 1.1729084253311157,
+ "mean_token_accuracy": 0.7160478830337524,
+ "num_tokens": 20922368.0,
+ "step": 1277
+ },
+ {
+ "entropy": 1.5020796060562134,
+ "epoch": 2.581818181818182,
+ "grad_norm": 2.198739767074585,
+ "learning_rate": 2.4202020202020206e-06,
+ "loss": 1.5012025833129883,
+ "mean_token_accuracy": 0.6408768892288208,
+ "num_tokens": 20938752.0,
+ "step": 1278
+ },
+ {
+ "entropy": 1.0234061479568481,
+ "epoch": 2.583838383838384,
+ "grad_norm": 2.0784571170806885,
+ "learning_rate": 2.4181818181818185e-06,
+ "loss": 1.0343588590621948,
+ "mean_token_accuracy": 0.7372984886169434,
+ "num_tokens": 20955136.0,
+ "step": 1279
+ },
+ {
+ "entropy": 1.6372766494750977,
+ "epoch": 2.5858585858585856,
+ "grad_norm": 2.339104652404785,
+ "learning_rate": 2.4161616161616164e-06,
+ "loss": 1.6200227737426758,
+ "mean_token_accuracy": 0.6249389052391052,
+ "num_tokens": 20971520.0,
+ "step": 1280
+ },
+ {
+ "entropy": 1.3991668224334717,
+ "epoch": 2.587878787878788,
+ "grad_norm": 2.33329439163208,
+ "learning_rate": 2.4141414141414143e-06,
+ "loss": 1.434525489807129,
+ "mean_token_accuracy": 0.6656692624092102,
+ "num_tokens": 20987904.0,
+ "step": 1281
+ },
+ {
+ "entropy": 0.9680843949317932,
+ "epoch": 2.58989898989899,
+ "grad_norm": 2.0454914569854736,
+ "learning_rate": 2.412121212121212e-06,
+ "loss": 0.9875590801239014,
+ "mean_token_accuracy": 0.7512823939323425,
+ "num_tokens": 21004288.0,
+ "step": 1282
+ },
+ {
+ "entropy": 1.1564005613327026,
+ "epoch": 2.591919191919192,
+ "grad_norm": 2.0994997024536133,
+ "learning_rate": 2.4101010101010105e-06,
+ "loss": 1.1473734378814697,
+ "mean_token_accuracy": 0.709208607673645,
+ "num_tokens": 21020672.0,
+ "step": 1283
+ },
+ {
+ "entropy": 1.435438871383667,
+ "epoch": 2.5939393939393938,
+ "grad_norm": 2.369999408721924,
+ "learning_rate": 2.4080808080808083e-06,
+ "loss": 1.4502406120300293,
+ "mean_token_accuracy": 0.6505251526832581,
+ "num_tokens": 21037056.0,
+ "step": 1284
+ },
+ {
+ "entropy": 1.358853816986084,
+ "epoch": 2.595959595959596,
+ "grad_norm": 4.034506320953369,
+ "learning_rate": 2.4060606060606062e-06,
+ "loss": 1.3811532258987427,
+ "mean_token_accuracy": 0.6720200181007385,
+ "num_tokens": 21053440.0,
+ "step": 1285
+ },
+ {
+ "entropy": 1.2741261720657349,
+ "epoch": 2.597979797979798,
+ "grad_norm": 2.231471061706543,
+ "learning_rate": 2.404040404040404e-06,
+ "loss": 1.2811863422393799,
+ "mean_token_accuracy": 0.6806302070617676,
+ "num_tokens": 21069824.0,
+ "step": 1286
+ },
+ {
+ "entropy": 1.3789101839065552,
+ "epoch": 2.6,
+ "grad_norm": 2.287457227706909,
+ "learning_rate": 2.402020202020202e-06,
+ "loss": 1.389050006866455,
+ "mean_token_accuracy": 0.6687836050987244,
+ "num_tokens": 21086208.0,
+ "step": 1287
+ },
+ {
+ "entropy": 1.0021989345550537,
+ "epoch": 2.602020202020202,
+ "grad_norm": 1.9996925592422485,
+ "learning_rate": 2.4000000000000003e-06,
+ "loss": 1.028086543083191,
+ "mean_token_accuracy": 0.7479237914085388,
+ "num_tokens": 21102592.0,
+ "step": 1288
+ },
+ {
+ "entropy": 1.4363199472427368,
+ "epoch": 2.604040404040404,
+ "grad_norm": 2.203239917755127,
+ "learning_rate": 2.397979797979798e-06,
+ "loss": 1.4645861387252808,
+ "mean_token_accuracy": 0.6590132117271423,
+ "num_tokens": 21118976.0,
+ "step": 1289
+ },
+ {
+ "entropy": 1.307484745979309,
+ "epoch": 2.606060606060606,
+ "grad_norm": 1.9925199747085571,
+ "learning_rate": 2.395959595959596e-06,
+ "loss": 1.3217129707336426,
+ "mean_token_accuracy": 0.6787371635437012,
+ "num_tokens": 21135360.0,
+ "step": 1290
+ },
+ {
+ "entropy": 1.2430635690689087,
+ "epoch": 2.608080808080808,
+ "grad_norm": 2.1385529041290283,
+ "learning_rate": 2.393939393939394e-06,
+ "loss": 1.238807201385498,
+ "mean_token_accuracy": 0.6949804425239563,
+ "num_tokens": 21151744.0,
+ "step": 1291
+ },
+ {
+ "entropy": 1.0351316928863525,
+ "epoch": 2.61010101010101,
+ "grad_norm": 2.2897744178771973,
+ "learning_rate": 2.3919191919191923e-06,
+ "loss": 1.032408595085144,
+ "mean_token_accuracy": 0.7267953157424927,
+ "num_tokens": 21168128.0,
+ "step": 1292
+ },
+ {
+ "entropy": 1.2167868614196777,
+ "epoch": 2.6121212121212123,
+ "grad_norm": 2.021771192550659,
+ "learning_rate": 2.38989898989899e-06,
+ "loss": 1.223731279373169,
+ "mean_token_accuracy": 0.7067049145698547,
+ "num_tokens": 21184512.0,
+ "step": 1293
+ },
+ {
+ "entropy": 1.0386477708816528,
+ "epoch": 2.614141414141414,
+ "grad_norm": 2.048285722732544,
+ "learning_rate": 2.387878787878788e-06,
+ "loss": 1.0437978506088257,
+ "mean_token_accuracy": 0.7332682013511658,
+ "num_tokens": 21200896.0,
+ "step": 1294
+ },
+ {
+ "entropy": 1.5832154750823975,
+ "epoch": 2.616161616161616,
+ "grad_norm": 2.214010715484619,
+ "learning_rate": 2.385858585858586e-06,
+ "loss": 1.5869958400726318,
+ "mean_token_accuracy": 0.6240839958190918,
+ "num_tokens": 21217280.0,
+ "step": 1295
+ },
+ {
+ "entropy": 1.4032398462295532,
+ "epoch": 2.618181818181818,
+ "grad_norm": 2.069399833679199,
+ "learning_rate": 2.3838383838383843e-06,
+ "loss": 1.40470290184021,
+ "mean_token_accuracy": 0.6671348214149475,
+ "num_tokens": 21233664.0,
+ "step": 1296
+ },
+ {
+ "entropy": 1.1057566404342651,
+ "epoch": 2.6202020202020204,
+ "grad_norm": 2.090847969055176,
+ "learning_rate": 2.381818181818182e-06,
+ "loss": 1.099064826965332,
+ "mean_token_accuracy": 0.7186736464500427,
+ "num_tokens": 21250048.0,
+ "step": 1297
+ },
+ {
+ "entropy": 1.1217924356460571,
+ "epoch": 2.6222222222222222,
+ "grad_norm": 2.2802088260650635,
+ "learning_rate": 2.37979797979798e-06,
+ "loss": 1.1425195932388306,
+ "mean_token_accuracy": 0.717452347278595,
+ "num_tokens": 21266432.0,
+ "step": 1298
+ },
+ {
+ "entropy": 1.3103245496749878,
+ "epoch": 2.624242424242424,
+ "grad_norm": 2.2961838245391846,
+ "learning_rate": 2.377777777777778e-06,
+ "loss": 1.325084924697876,
+ "mean_token_accuracy": 0.6704323291778564,
+ "num_tokens": 21282816.0,
+ "step": 1299
+ },
+ {
+ "entropy": 1.397556185722351,
+ "epoch": 2.6262626262626263,
+ "grad_norm": 2.14385986328125,
+ "learning_rate": 2.375757575757576e-06,
+ "loss": 1.3891851902008057,
+ "mean_token_accuracy": 0.6722642779350281,
+ "num_tokens": 21299200.0,
+ "step": 1300
+ },
+ {
+ "epoch": 2.6262626262626263,
+ "eval_entropy": 1.377457697064646,
+ "eval_loss": 1.5343767404556274,
+ "eval_mean_token_accuracy": 0.6456591679203895,
+ "eval_num_tokens": 21299200.0,
+ "eval_runtime": 43.8661,
+ "eval_samples_per_second": 22.569,
+ "eval_steps_per_second": 2.827,
+ "step": 1300
+ },
+ {
+ "entropy": 1.4542138576507568,
+ "epoch": 2.6282828282828286,
+ "grad_norm": 2.2326884269714355,
+ "learning_rate": 2.373737373737374e-06,
+ "loss": 1.459869384765625,
+ "mean_token_accuracy": 0.6545554399490356,
+ "num_tokens": 21315584.0,
+ "step": 1301
+ },
+ {
+ "entropy": 1.144904613494873,
+ "epoch": 2.6303030303030304,
+ "grad_norm": 2.0662593841552734,
+ "learning_rate": 2.371717171717172e-06,
+ "loss": 1.151012897491455,
+ "mean_token_accuracy": 0.7232535481452942,
+ "num_tokens": 21331968.0,
+ "step": 1302
+ },
+ {
+ "entropy": 1.2142722606658936,
+ "epoch": 2.632323232323232,
+ "grad_norm": 2.206763982772827,
+ "learning_rate": 2.36969696969697e-06,
+ "loss": 1.2040069103240967,
+ "mean_token_accuracy": 0.7002320289611816,
+ "num_tokens": 21348352.0,
+ "step": 1303
+ },
+ {
+ "entropy": 1.7695715427398682,
+ "epoch": 2.6343434343434344,
+ "grad_norm": 2.1346793174743652,
+ "learning_rate": 2.367676767676768e-06,
+ "loss": 1.7356187105178833,
+ "mean_token_accuracy": 0.6051538586616516,
+ "num_tokens": 21364736.0,
+ "step": 1304
+ },
+ {
+ "entropy": 1.351786494255066,
+ "epoch": 2.6363636363636362,
+ "grad_norm": 2.291290283203125,
+ "learning_rate": 2.3656565656565657e-06,
+ "loss": 1.3471777439117432,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 21381120.0,
+ "step": 1305
+ },
+ {
+ "entropy": 1.202124834060669,
+ "epoch": 2.6383838383838385,
+ "grad_norm": 2.1541965007781982,
+ "learning_rate": 2.363636363636364e-06,
+ "loss": 1.2085479497909546,
+ "mean_token_accuracy": 0.7031631469726562,
+ "num_tokens": 21397504.0,
+ "step": 1306
+ },
+ {
+ "entropy": 0.9269154667854309,
+ "epoch": 2.6404040404040403,
+ "grad_norm": 2.1681666374206543,
+ "learning_rate": 2.361616161616162e-06,
+ "loss": 0.9319549798965454,
+ "mean_token_accuracy": 0.7553126811981201,
+ "num_tokens": 21413888.0,
+ "step": 1307
+ },
+ {
+ "entropy": 1.0244951248168945,
+ "epoch": 2.6424242424242426,
+ "grad_norm": 1.9392226934432983,
+ "learning_rate": 2.3595959595959598e-06,
+ "loss": 0.9993175268173218,
+ "mean_token_accuracy": 0.7588544487953186,
+ "num_tokens": 21430272.0,
+ "step": 1308
+ },
+ {
+ "entropy": 1.256042718887329,
+ "epoch": 2.6444444444444444,
+ "grad_norm": 2.346327304840088,
+ "learning_rate": 2.3575757575757577e-06,
+ "loss": 1.2512779235839844,
+ "mean_token_accuracy": 0.6858206987380981,
+ "num_tokens": 21446656.0,
+ "step": 1309
+ },
+ {
+ "entropy": 1.0318644046783447,
+ "epoch": 2.6464646464646466,
+ "grad_norm": 1.988356113433838,
+ "learning_rate": 2.3555555555555555e-06,
+ "loss": 1.0428593158721924,
+ "mean_token_accuracy": 0.7383365631103516,
+ "num_tokens": 21463040.0,
+ "step": 1310
+ },
+ {
+ "entropy": 1.3145314455032349,
+ "epoch": 2.6484848484848484,
+ "grad_norm": 2.1777143478393555,
+ "learning_rate": 2.3535353535353534e-06,
+ "loss": 1.3207441568374634,
+ "mean_token_accuracy": 0.6881411671638489,
+ "num_tokens": 21479424.0,
+ "step": 1311
+ },
+ {
+ "entropy": 1.2858450412750244,
+ "epoch": 2.6505050505050507,
+ "grad_norm": 2.2654671669006348,
+ "learning_rate": 2.3515151515151517e-06,
+ "loss": 1.2940181493759155,
+ "mean_token_accuracy": 0.6831338405609131,
+ "num_tokens": 21495808.0,
+ "step": 1312
+ },
+ {
+ "entropy": 1.4315612316131592,
+ "epoch": 2.6525252525252525,
+ "grad_norm": 2.140456438064575,
+ "learning_rate": 2.3494949494949496e-06,
+ "loss": 1.4298607110977173,
+ "mean_token_accuracy": 0.6585246920585632,
+ "num_tokens": 21512192.0,
+ "step": 1313
+ },
+ {
+ "entropy": 1.2628042697906494,
+ "epoch": 2.6545454545454543,
+ "grad_norm": 2.387079954147339,
+ "learning_rate": 2.347474747474748e-06,
+ "loss": 1.2526830434799194,
+ "mean_token_accuracy": 0.6882632970809937,
+ "num_tokens": 21528576.0,
+ "step": 1314
+ },
+ {
+ "entropy": 1.3501923084259033,
+ "epoch": 2.6565656565656566,
+ "grad_norm": 2.17873215675354,
+ "learning_rate": 2.345454545454546e-06,
+ "loss": 1.3459683656692505,
+ "mean_token_accuracy": 0.6783707737922668,
+ "num_tokens": 21544960.0,
+ "step": 1315
+ },
+ {
+ "entropy": 1.4369540214538574,
+ "epoch": 2.658585858585859,
+ "grad_norm": 2.335825204849243,
+ "learning_rate": 2.3434343434343437e-06,
+ "loss": 1.4296600818634033,
+ "mean_token_accuracy": 0.6534562706947327,
+ "num_tokens": 21561344.0,
+ "step": 1316
+ },
+ {
+ "entropy": 1.1612765789031982,
+ "epoch": 2.6606060606060606,
+ "grad_norm": 2.194164276123047,
+ "learning_rate": 2.3414141414141416e-06,
+ "loss": 1.1527385711669922,
+ "mean_token_accuracy": 0.7140327095985413,
+ "num_tokens": 21577728.0,
+ "step": 1317
+ },
+ {
+ "entropy": 1.0844523906707764,
+ "epoch": 2.6626262626262625,
+ "grad_norm": 2.1018459796905518,
+ "learning_rate": 2.3393939393939395e-06,
+ "loss": 1.0732126235961914,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 21594112.0,
+ "step": 1318
+ },
+ {
+ "entropy": 1.1760655641555786,
+ "epoch": 2.6646464646464647,
+ "grad_norm": 2.1674582958221436,
+ "learning_rate": 2.337373737373738e-06,
+ "loss": 1.1928012371063232,
+ "mean_token_accuracy": 0.693453848361969,
+ "num_tokens": 21610496.0,
+ "step": 1319
+ },
+ {
+ "entropy": 1.3627854585647583,
+ "epoch": 2.6666666666666665,
+ "grad_norm": 2.2469325065612793,
+ "learning_rate": 2.3353535353535357e-06,
+ "loss": 1.375096321105957,
+ "mean_token_accuracy": 0.6670737862586975,
+ "num_tokens": 21626880.0,
+ "step": 1320
+ },
+ {
+ "entropy": 1.0562385320663452,
+ "epoch": 2.6686868686868688,
+ "grad_norm": 2.3479180335998535,
+ "learning_rate": 2.3333333333333336e-06,
+ "loss": 1.0513578653335571,
+ "mean_token_accuracy": 0.7401685118675232,
+ "num_tokens": 21643264.0,
+ "step": 1321
+ },
+ {
+ "entropy": 1.1622484922409058,
+ "epoch": 2.6707070707070706,
+ "grad_norm": 2.218021869659424,
+ "learning_rate": 2.3313131313131315e-06,
+ "loss": 1.172579288482666,
+ "mean_token_accuracy": 0.7042623162269592,
+ "num_tokens": 21659648.0,
+ "step": 1322
+ },
+ {
+ "entropy": 1.2139835357666016,
+ "epoch": 2.672727272727273,
+ "grad_norm": 2.2875492572784424,
+ "learning_rate": 2.3292929292929294e-06,
+ "loss": 1.2015337944030762,
+ "mean_token_accuracy": 0.7027357220649719,
+ "num_tokens": 21676032.0,
+ "step": 1323
+ },
+ {
+ "entropy": 1.7094130516052246,
+ "epoch": 2.6747474747474747,
+ "grad_norm": 2.2344024181365967,
+ "learning_rate": 2.3272727272727277e-06,
+ "loss": 1.7565287351608276,
+ "mean_token_accuracy": 0.6025891304016113,
+ "num_tokens": 21692416.0,
+ "step": 1324
+ },
+ {
+ "entropy": 1.1033966541290283,
+ "epoch": 2.676767676767677,
+ "grad_norm": 2.2697556018829346,
+ "learning_rate": 2.3252525252525256e-06,
+ "loss": 1.1173789501190186,
+ "mean_token_accuracy": 0.7180629968643188,
+ "num_tokens": 21708800.0,
+ "step": 1325
+ },
+ {
+ "entropy": 0.9456706643104553,
+ "epoch": 2.6787878787878787,
+ "grad_norm": 2.1194941997528076,
+ "learning_rate": 2.3232323232323234e-06,
+ "loss": 0.9613161087036133,
+ "mean_token_accuracy": 0.7573277950286865,
+ "num_tokens": 21725184.0,
+ "step": 1326
+ },
+ {
+ "entropy": 1.098917841911316,
+ "epoch": 2.680808080808081,
+ "grad_norm": 2.2719058990478516,
+ "learning_rate": 2.3212121212121213e-06,
+ "loss": 1.116957664489746,
+ "mean_token_accuracy": 0.709269642829895,
+ "num_tokens": 21741568.0,
+ "step": 1327
+ },
+ {
+ "entropy": 1.5637823343276978,
+ "epoch": 2.682828282828283,
+ "grad_norm": 2.257596731185913,
+ "learning_rate": 2.3191919191919192e-06,
+ "loss": 1.5726745128631592,
+ "mean_token_accuracy": 0.6359306573867798,
+ "num_tokens": 21757952.0,
+ "step": 1328
+ },
+ {
+ "entropy": 0.9321528673171997,
+ "epoch": 2.6848484848484846,
+ "grad_norm": 2.0641798973083496,
+ "learning_rate": 2.317171717171717e-06,
+ "loss": 0.9297301769256592,
+ "mean_token_accuracy": 0.7602589130401611,
+ "num_tokens": 21774336.0,
+ "step": 1329
+ },
+ {
+ "entropy": 1.2314496040344238,
+ "epoch": 2.686868686868687,
+ "grad_norm": 2.143329620361328,
+ "learning_rate": 2.3151515151515154e-06,
+ "loss": 1.2292556762695312,
+ "mean_token_accuracy": 0.6940034031867981,
+ "num_tokens": 21790720.0,
+ "step": 1330
+ },
+ {
+ "entropy": 1.195270299911499,
+ "epoch": 2.688888888888889,
+ "grad_norm": 2.291335105895996,
+ "learning_rate": 2.3131313131313133e-06,
+ "loss": 1.1904417276382446,
+ "mean_token_accuracy": 0.7023082375526428,
+ "num_tokens": 21807104.0,
+ "step": 1331
+ },
+ {
+ "entropy": 0.8783636093139648,
+ "epoch": 2.690909090909091,
+ "grad_norm": 2.069147825241089,
+ "learning_rate": 2.311111111111111e-06,
+ "loss": 0.8936513066291809,
+ "mean_token_accuracy": 0.7703346610069275,
+ "num_tokens": 21823488.0,
+ "step": 1332
+ },
+ {
+ "entropy": 1.3100625276565552,
+ "epoch": 2.6929292929292927,
+ "grad_norm": 2.396043300628662,
+ "learning_rate": 2.309090909090909e-06,
+ "loss": 1.3054237365722656,
+ "mean_token_accuracy": 0.6758671402931213,
+ "num_tokens": 21839872.0,
+ "step": 1333
+ },
+ {
+ "entropy": 0.9413285255432129,
+ "epoch": 2.694949494949495,
+ "grad_norm": 2.0738699436187744,
+ "learning_rate": 2.307070707070707e-06,
+ "loss": 0.9171029329299927,
+ "mean_token_accuracy": 0.7571446299552917,
+ "num_tokens": 21856256.0,
+ "step": 1334
+ },
+ {
+ "entropy": 1.268250584602356,
+ "epoch": 2.6969696969696972,
+ "grad_norm": 2.0988986492156982,
+ "learning_rate": 2.3050505050505053e-06,
+ "loss": 1.257792353630066,
+ "mean_token_accuracy": 0.6866145730018616,
+ "num_tokens": 21872640.0,
+ "step": 1335
+ },
+ {
+ "entropy": 1.3402502536773682,
+ "epoch": 2.698989898989899,
+ "grad_norm": 2.08109712600708,
+ "learning_rate": 2.303030303030303e-06,
+ "loss": 1.3316476345062256,
+ "mean_token_accuracy": 0.6869198679924011,
+ "num_tokens": 21889024.0,
+ "step": 1336
+ },
+ {
+ "entropy": 1.5612709522247314,
+ "epoch": 2.701010101010101,
+ "grad_norm": 2.2410786151885986,
+ "learning_rate": 2.3010101010101015e-06,
+ "loss": 1.5604108572006226,
+ "mean_token_accuracy": 0.6339765787124634,
+ "num_tokens": 21905408.0,
+ "step": 1337
+ },
+ {
+ "entropy": 1.0962555408477783,
+ "epoch": 2.703030303030303,
+ "grad_norm": 2.289069890975952,
+ "learning_rate": 2.2989898989898994e-06,
+ "loss": 1.1016948223114014,
+ "mean_token_accuracy": 0.714093804359436,
+ "num_tokens": 21921792.0,
+ "step": 1338
+ },
+ {
+ "entropy": 1.600198745727539,
+ "epoch": 2.705050505050505,
+ "grad_norm": 2.152244806289673,
+ "learning_rate": 2.2969696969696973e-06,
+ "loss": 1.608877420425415,
+ "mean_token_accuracy": 0.6394724249839783,
+ "num_tokens": 21938176.0,
+ "step": 1339
+ },
+ {
+ "entropy": 1.4823815822601318,
+ "epoch": 2.707070707070707,
+ "grad_norm": 2.142822742462158,
+ "learning_rate": 2.294949494949495e-06,
+ "loss": 1.4775569438934326,
+ "mean_token_accuracy": 0.6656082272529602,
+ "num_tokens": 21954560.0,
+ "step": 1340
+ },
+ {
+ "entropy": 1.1100481748580933,
+ "epoch": 2.709090909090909,
+ "grad_norm": 2.271402597427368,
+ "learning_rate": 2.292929292929293e-06,
+ "loss": 1.1097328662872314,
+ "mean_token_accuracy": 0.7238031029701233,
+ "num_tokens": 21970944.0,
+ "step": 1341
+ },
+ {
+ "entropy": 1.3482670783996582,
+ "epoch": 2.7111111111111112,
+ "grad_norm": 2.136296510696411,
+ "learning_rate": 2.2909090909090913e-06,
+ "loss": 1.3715920448303223,
+ "mean_token_accuracy": 0.670615553855896,
+ "num_tokens": 21987328.0,
+ "step": 1342
+ },
+ {
+ "entropy": 1.3454313278198242,
+ "epoch": 2.713131313131313,
+ "grad_norm": 1.8919764757156372,
+ "learning_rate": 2.2888888888888892e-06,
+ "loss": 1.3545129299163818,
+ "mean_token_accuracy": 0.6950415372848511,
+ "num_tokens": 22003712.0,
+ "step": 1343
+ },
+ {
+ "entropy": 1.314072847366333,
+ "epoch": 2.7151515151515153,
+ "grad_norm": 2.0495684146881104,
+ "learning_rate": 2.286868686868687e-06,
+ "loss": 1.3117344379425049,
+ "mean_token_accuracy": 0.6800195574760437,
+ "num_tokens": 22020096.0,
+ "step": 1344
+ },
+ {
+ "entropy": 0.7977169156074524,
+ "epoch": 2.717171717171717,
+ "grad_norm": 2.050006866455078,
+ "learning_rate": 2.284848484848485e-06,
+ "loss": 0.7982609868049622,
+ "mean_token_accuracy": 0.7774181962013245,
+ "num_tokens": 22036480.0,
+ "step": 1345
+ },
+ {
+ "entropy": 1.6121824979782104,
+ "epoch": 2.7191919191919194,
+ "grad_norm": 2.1058602333068848,
+ "learning_rate": 2.282828282828283e-06,
+ "loss": 1.6340572834014893,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 22052864.0,
+ "step": 1346
+ },
+ {
+ "entropy": 1.2698943614959717,
+ "epoch": 2.721212121212121,
+ "grad_norm": 1.9856007099151611,
+ "learning_rate": 2.2808080808080808e-06,
+ "loss": 1.2857555150985718,
+ "mean_token_accuracy": 0.7088422179222107,
+ "num_tokens": 22069248.0,
+ "step": 1347
+ },
+ {
+ "entropy": 1.6614608764648438,
+ "epoch": 2.723232323232323,
+ "grad_norm": 2.1818666458129883,
+ "learning_rate": 2.278787878787879e-06,
+ "loss": 1.6615056991577148,
+ "mean_token_accuracy": 0.6217635273933411,
+ "num_tokens": 22085632.0,
+ "step": 1348
+ },
+ {
+ "entropy": 1.542864203453064,
+ "epoch": 2.7252525252525253,
+ "grad_norm": 2.1022093296051025,
+ "learning_rate": 2.276767676767677e-06,
+ "loss": 1.5696978569030762,
+ "mean_token_accuracy": 0.6462506055831909,
+ "num_tokens": 22102016.0,
+ "step": 1349
+ },
+ {
+ "entropy": 1.0613912343978882,
+ "epoch": 2.7272727272727275,
+ "grad_norm": 2.213463068008423,
+ "learning_rate": 2.274747474747475e-06,
+ "loss": 1.0789921283721924,
+ "mean_token_accuracy": 0.7288104295730591,
+ "num_tokens": 22118400.0,
+ "step": 1350
+ },
+ {
+ "epoch": 2.7272727272727275,
+ "eval_entropy": 1.362602738603469,
+ "eval_loss": 1.5345665216445923,
+ "eval_mean_token_accuracy": 0.6458812678052533,
+ "eval_num_tokens": 22118400.0,
+ "eval_runtime": 43.734,
+ "eval_samples_per_second": 22.637,
+ "eval_steps_per_second": 2.835,
+ "step": 1350
+ },
+ {
+ "entropy": 1.175439715385437,
+ "epoch": 2.7292929292929293,
+ "grad_norm": 2.3636603355407715,
+ "learning_rate": 2.2727272727272728e-06,
+ "loss": 1.2032190561294556,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 22134784.0,
+ "step": 1351
+ },
+ {
+ "entropy": 1.056649923324585,
+ "epoch": 2.731313131313131,
+ "grad_norm": 2.111971139907837,
+ "learning_rate": 2.2707070707070706e-06,
+ "loss": 1.0646127462387085,
+ "mean_token_accuracy": 0.7132999300956726,
+ "num_tokens": 22151168.0,
+ "step": 1352
+ },
+ {
+ "entropy": 1.401559591293335,
+ "epoch": 2.7333333333333334,
+ "grad_norm": 2.269573211669922,
+ "learning_rate": 2.268686868686869e-06,
+ "loss": 1.405207633972168,
+ "mean_token_accuracy": 0.6612115502357483,
+ "num_tokens": 22167552.0,
+ "step": 1353
+ },
+ {
+ "entropy": 0.9708455204963684,
+ "epoch": 2.735353535353535,
+ "grad_norm": 2.3020989894866943,
+ "learning_rate": 2.266666666666667e-06,
+ "loss": 0.9864540100097656,
+ "mean_token_accuracy": 0.7361993193626404,
+ "num_tokens": 22183936.0,
+ "step": 1354
+ },
+ {
+ "entropy": 1.2840858697891235,
+ "epoch": 2.7373737373737375,
+ "grad_norm": 2.4489457607269287,
+ "learning_rate": 2.2646464646464647e-06,
+ "loss": 1.2992041110992432,
+ "mean_token_accuracy": 0.6783097386360168,
+ "num_tokens": 22200320.0,
+ "step": 1355
+ },
+ {
+ "entropy": 1.6704803705215454,
+ "epoch": 2.7393939393939393,
+ "grad_norm": 2.213287591934204,
+ "learning_rate": 2.262626262626263e-06,
+ "loss": 1.7022172212600708,
+ "mean_token_accuracy": 0.6433194875717163,
+ "num_tokens": 22216704.0,
+ "step": 1356
+ },
+ {
+ "entropy": 1.2570815086364746,
+ "epoch": 2.7414141414141415,
+ "grad_norm": 2.250062942504883,
+ "learning_rate": 2.260606060606061e-06,
+ "loss": 1.2799533605575562,
+ "mean_token_accuracy": 0.6823400259017944,
+ "num_tokens": 22233088.0,
+ "step": 1357
+ },
+ {
+ "entropy": 1.0966694355010986,
+ "epoch": 2.7434343434343433,
+ "grad_norm": 2.24507212638855,
+ "learning_rate": 2.258585858585859e-06,
+ "loss": 1.0954806804656982,
+ "mean_token_accuracy": 0.7264289259910583,
+ "num_tokens": 22249472.0,
+ "step": 1358
+ },
+ {
+ "entropy": 1.6675825119018555,
+ "epoch": 2.7454545454545456,
+ "grad_norm": 2.1572930812835693,
+ "learning_rate": 2.2565656565656567e-06,
+ "loss": 1.6607719659805298,
+ "mean_token_accuracy": 0.6113214492797852,
+ "num_tokens": 22265856.0,
+ "step": 1359
+ },
+ {
+ "entropy": 1.247696042060852,
+ "epoch": 2.7474747474747474,
+ "grad_norm": 2.105797290802002,
+ "learning_rate": 2.254545454545455e-06,
+ "loss": 1.2314106225967407,
+ "mean_token_accuracy": 0.6982169151306152,
+ "num_tokens": 22282240.0,
+ "step": 1360
+ },
+ {
+ "entropy": 1.6081417798995972,
+ "epoch": 2.7494949494949497,
+ "grad_norm": 2.1624395847320557,
+ "learning_rate": 2.252525252525253e-06,
+ "loss": 1.6011556386947632,
+ "mean_token_accuracy": 0.6282364726066589,
+ "num_tokens": 22298624.0,
+ "step": 1361
+ },
+ {
+ "entropy": 1.1124155521392822,
+ "epoch": 2.7515151515151515,
+ "grad_norm": 2.141758918762207,
+ "learning_rate": 2.250505050505051e-06,
+ "loss": 1.1052089929580688,
+ "mean_token_accuracy": 0.7202003002166748,
+ "num_tokens": 22315008.0,
+ "step": 1362
+ },
+ {
+ "entropy": 1.093716025352478,
+ "epoch": 2.7535353535353533,
+ "grad_norm": 2.2610108852386475,
+ "learning_rate": 2.2484848484848487e-06,
+ "loss": 1.095299482345581,
+ "mean_token_accuracy": 0.714154839515686,
+ "num_tokens": 22331392.0,
+ "step": 1363
+ },
+ {
+ "entropy": 1.353977918624878,
+ "epoch": 2.7555555555555555,
+ "grad_norm": 2.171783447265625,
+ "learning_rate": 2.2464646464646466e-06,
+ "loss": 1.3497436046600342,
+ "mean_token_accuracy": 0.6914386749267578,
+ "num_tokens": 22347776.0,
+ "step": 1364
+ },
+ {
+ "entropy": 1.4595965147018433,
+ "epoch": 2.757575757575758,
+ "grad_norm": 2.2337677478790283,
+ "learning_rate": 2.2444444444444445e-06,
+ "loss": 1.4730737209320068,
+ "mean_token_accuracy": 0.6578529477119446,
+ "num_tokens": 22364160.0,
+ "step": 1365
+ },
+ {
+ "entropy": 1.5668566226959229,
+ "epoch": 2.7595959595959596,
+ "grad_norm": 2.2195982933044434,
+ "learning_rate": 2.2424242424242428e-06,
+ "loss": 1.5661592483520508,
+ "mean_token_accuracy": 0.6397166848182678,
+ "num_tokens": 22380544.0,
+ "step": 1366
+ },
+ {
+ "entropy": 1.4419786930084229,
+ "epoch": 2.7616161616161614,
+ "grad_norm": 2.202221393585205,
+ "learning_rate": 2.2404040404040407e-06,
+ "loss": 1.4466135501861572,
+ "mean_token_accuracy": 0.6698827743530273,
+ "num_tokens": 22396928.0,
+ "step": 1367
+ },
+ {
+ "entropy": 1.43394136428833,
+ "epoch": 2.7636363636363637,
+ "grad_norm": 2.1969001293182373,
+ "learning_rate": 2.2383838383838385e-06,
+ "loss": 1.433483362197876,
+ "mean_token_accuracy": 0.6655471324920654,
+ "num_tokens": 22413312.0,
+ "step": 1368
+ },
+ {
+ "entropy": 1.048527717590332,
+ "epoch": 2.765656565656566,
+ "grad_norm": 2.142869472503662,
+ "learning_rate": 2.2363636363636364e-06,
+ "loss": 1.0373283624649048,
+ "mean_token_accuracy": 0.7396189570426941,
+ "num_tokens": 22429696.0,
+ "step": 1369
+ },
+ {
+ "entropy": 1.4282819032669067,
+ "epoch": 2.7676767676767677,
+ "grad_norm": 2.1550097465515137,
+ "learning_rate": 2.2343434343434343e-06,
+ "loss": 1.419884443283081,
+ "mean_token_accuracy": 0.6712262034416199,
+ "num_tokens": 22446080.0,
+ "step": 1370
+ },
+ {
+ "entropy": 1.5361018180847168,
+ "epoch": 2.7696969696969695,
+ "grad_norm": 2.1175451278686523,
+ "learning_rate": 2.2323232323232326e-06,
+ "loss": 1.5433859825134277,
+ "mean_token_accuracy": 0.636907696723938,
+ "num_tokens": 22462464.0,
+ "step": 1371
+ },
+ {
+ "entropy": 1.326242208480835,
+ "epoch": 2.771717171717172,
+ "grad_norm": 2.084632635116577,
+ "learning_rate": 2.2303030303030305e-06,
+ "loss": 1.3364207744598389,
+ "mean_token_accuracy": 0.6809965968132019,
+ "num_tokens": 22478848.0,
+ "step": 1372
+ },
+ {
+ "entropy": 1.255878210067749,
+ "epoch": 2.7737373737373736,
+ "grad_norm": 2.142777919769287,
+ "learning_rate": 2.2282828282828284e-06,
+ "loss": 1.264795184135437,
+ "mean_token_accuracy": 0.6875916123390198,
+ "num_tokens": 22495232.0,
+ "step": 1373
+ },
+ {
+ "entropy": 1.2916159629821777,
+ "epoch": 2.775757575757576,
+ "grad_norm": 2.115644693374634,
+ "learning_rate": 2.2262626262626263e-06,
+ "loss": 1.2945363521575928,
+ "mean_token_accuracy": 0.6895456910133362,
+ "num_tokens": 22511616.0,
+ "step": 1374
+ },
+ {
+ "entropy": 1.4490385055541992,
+ "epoch": 2.7777777777777777,
+ "grad_norm": 2.2078094482421875,
+ "learning_rate": 2.224242424242424e-06,
+ "loss": 1.4401804208755493,
+ "mean_token_accuracy": 0.6637151837348938,
+ "num_tokens": 22528000.0,
+ "step": 1375
+ },
+ {
+ "entropy": 1.2710940837860107,
+ "epoch": 2.77979797979798,
+ "grad_norm": 2.1877286434173584,
+ "learning_rate": 2.222222222222222e-06,
+ "loss": 1.2672982215881348,
+ "mean_token_accuracy": 0.6958353519439697,
+ "num_tokens": 22544384.0,
+ "step": 1376
+ },
+ {
+ "entropy": 1.3981144428253174,
+ "epoch": 2.7818181818181817,
+ "grad_norm": 2.2816240787506104,
+ "learning_rate": 2.2202020202020204e-06,
+ "loss": 1.4073718786239624,
+ "mean_token_accuracy": 0.6583414673805237,
+ "num_tokens": 22560768.0,
+ "step": 1377
+ },
+ {
+ "entropy": 1.541896104812622,
+ "epoch": 2.783838383838384,
+ "grad_norm": 2.3664891719818115,
+ "learning_rate": 2.2181818181818187e-06,
+ "loss": 1.5782896280288696,
+ "mean_token_accuracy": 0.6264045238494873,
+ "num_tokens": 22577152.0,
+ "step": 1378
+ },
+ {
+ "entropy": 1.1470069885253906,
+ "epoch": 2.785858585858586,
+ "grad_norm": 2.334867000579834,
+ "learning_rate": 2.2161616161616166e-06,
+ "loss": 1.1734097003936768,
+ "mean_token_accuracy": 0.6981558203697205,
+ "num_tokens": 22593536.0,
+ "step": 1379
+ },
+ {
+ "entropy": 1.3938566446304321,
+ "epoch": 2.787878787878788,
+ "grad_norm": 2.493093967437744,
+ "learning_rate": 2.2141414141414145e-06,
+ "loss": 1.4161372184753418,
+ "mean_token_accuracy": 0.6610283255577087,
+ "num_tokens": 22609920.0,
+ "step": 1380
+ },
+ {
+ "entropy": 1.2948062419891357,
+ "epoch": 2.78989898989899,
+ "grad_norm": 2.227708578109741,
+ "learning_rate": 2.2121212121212124e-06,
+ "loss": 1.3157434463500977,
+ "mean_token_accuracy": 0.6835002303123474,
+ "num_tokens": 22626304.0,
+ "step": 1381
+ },
+ {
+ "entropy": 0.9506068229675293,
+ "epoch": 2.7919191919191917,
+ "grad_norm": 2.1482889652252197,
+ "learning_rate": 2.2101010101010102e-06,
+ "loss": 0.950823187828064,
+ "mean_token_accuracy": 0.7500610947608948,
+ "num_tokens": 22642688.0,
+ "step": 1382
+ },
+ {
+ "entropy": 1.4429880380630493,
+ "epoch": 2.793939393939394,
+ "grad_norm": 2.8189656734466553,
+ "learning_rate": 2.208080808080808e-06,
+ "loss": 1.4801222085952759,
+ "mean_token_accuracy": 0.6469223499298096,
+ "num_tokens": 22659072.0,
+ "step": 1383
+ },
+ {
+ "entropy": 1.3517380952835083,
+ "epoch": 2.795959595959596,
+ "grad_norm": 2.047236442565918,
+ "learning_rate": 2.2060606060606064e-06,
+ "loss": 1.3715345859527588,
+ "mean_token_accuracy": 0.6921714544296265,
+ "num_tokens": 22675456.0,
+ "step": 1384
+ },
+ {
+ "entropy": 1.3647958040237427,
+ "epoch": 2.797979797979798,
+ "grad_norm": 2.296548366546631,
+ "learning_rate": 2.2040404040404043e-06,
+ "loss": 1.3669397830963135,
+ "mean_token_accuracy": 0.6769663095474243,
+ "num_tokens": 22691840.0,
+ "step": 1385
+ },
+ {
+ "entropy": 1.2830337285995483,
+ "epoch": 2.8,
+ "grad_norm": 2.222038745880127,
+ "learning_rate": 2.2020202020202022e-06,
+ "loss": 1.2938398122787476,
+ "mean_token_accuracy": 0.6786150336265564,
+ "num_tokens": 22708224.0,
+ "step": 1386
+ },
+ {
+ "entropy": 1.1581721305847168,
+ "epoch": 2.802020202020202,
+ "grad_norm": 1.9979426860809326,
+ "learning_rate": 2.2e-06,
+ "loss": 1.1363141536712646,
+ "mean_token_accuracy": 0.7106130719184875,
+ "num_tokens": 22724608.0,
+ "step": 1387
+ },
+ {
+ "entropy": 1.4855602979660034,
+ "epoch": 2.804040404040404,
+ "grad_norm": 2.2763257026672363,
+ "learning_rate": 2.197979797979798e-06,
+ "loss": 1.5020172595977783,
+ "mean_token_accuracy": 0.6478993892669678,
+ "num_tokens": 22740992.0,
+ "step": 1388
+ },
+ {
+ "entropy": 1.1942899227142334,
+ "epoch": 2.806060606060606,
+ "grad_norm": 2.1685962677001953,
+ "learning_rate": 2.1959595959595963e-06,
+ "loss": 1.188063621520996,
+ "mean_token_accuracy": 0.705483615398407,
+ "num_tokens": 22757376.0,
+ "step": 1389
+ },
+ {
+ "entropy": 1.1369596719741821,
+ "epoch": 2.808080808080808,
+ "grad_norm": 2.1820614337921143,
+ "learning_rate": 2.193939393939394e-06,
+ "loss": 1.1348206996917725,
+ "mean_token_accuracy": 0.7253297567367554,
+ "num_tokens": 22773760.0,
+ "step": 1390
+ },
+ {
+ "entropy": 1.2539693117141724,
+ "epoch": 2.81010101010101,
+ "grad_norm": 2.0384390354156494,
+ "learning_rate": 2.191919191919192e-06,
+ "loss": 1.250205636024475,
+ "mean_token_accuracy": 0.6993771195411682,
+ "num_tokens": 22790144.0,
+ "step": 1391
+ },
+ {
+ "entropy": 1.7445363998413086,
+ "epoch": 2.812121212121212,
+ "grad_norm": 2.55062198638916,
+ "learning_rate": 2.18989898989899e-06,
+ "loss": 1.7788689136505127,
+ "mean_token_accuracy": 0.607107937335968,
+ "num_tokens": 22806528.0,
+ "step": 1392
+ },
+ {
+ "entropy": 1.2282429933547974,
+ "epoch": 2.8141414141414143,
+ "grad_norm": 2.1791000366210938,
+ "learning_rate": 2.187878787878788e-06,
+ "loss": 1.2460708618164062,
+ "mean_token_accuracy": 0.697239875793457,
+ "num_tokens": 22822912.0,
+ "step": 1393
+ },
+ {
+ "entropy": 1.2007265090942383,
+ "epoch": 2.816161616161616,
+ "grad_norm": 2.4067599773406982,
+ "learning_rate": 2.1858585858585858e-06,
+ "loss": 1.2013460397720337,
+ "mean_token_accuracy": 0.6963238716125488,
+ "num_tokens": 22839296.0,
+ "step": 1394
+ },
+ {
+ "entropy": 1.7315549850463867,
+ "epoch": 2.8181818181818183,
+ "grad_norm": 2.15682053565979,
+ "learning_rate": 2.183838383838384e-06,
+ "loss": 1.6833488941192627,
+ "mean_token_accuracy": 0.6170004606246948,
+ "num_tokens": 22855680.0,
+ "step": 1395
+ },
+ {
+ "entropy": 1.325459599494934,
+ "epoch": 2.82020202020202,
+ "grad_norm": 2.0464699268341064,
+ "learning_rate": 2.181818181818182e-06,
+ "loss": 1.3265891075134277,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 22872064.0,
+ "step": 1396
+ },
+ {
+ "entropy": 1.0391966104507446,
+ "epoch": 2.822222222222222,
+ "grad_norm": 2.3595499992370605,
+ "learning_rate": 2.17979797979798e-06,
+ "loss": 1.0515706539154053,
+ "mean_token_accuracy": 0.7299706935882568,
+ "num_tokens": 22888448.0,
+ "step": 1397
+ },
+ {
+ "entropy": 1.5484130382537842,
+ "epoch": 2.824242424242424,
+ "grad_norm": 2.24381422996521,
+ "learning_rate": 2.1777777777777777e-06,
+ "loss": 1.5656720399856567,
+ "mean_token_accuracy": 0.6390449404716492,
+ "num_tokens": 22904832.0,
+ "step": 1398
+ },
+ {
+ "entropy": 1.2196807861328125,
+ "epoch": 2.8262626262626265,
+ "grad_norm": 2.3043432235717773,
+ "learning_rate": 2.175757575757576e-06,
+ "loss": 1.2172417640686035,
+ "mean_token_accuracy": 0.6985833048820496,
+ "num_tokens": 22921216.0,
+ "step": 1399
+ },
+ {
+ "entropy": 1.171323537826538,
+ "epoch": 2.8282828282828283,
+ "grad_norm": 2.34149169921875,
+ "learning_rate": 2.173737373737374e-06,
+ "loss": 1.1752846240997314,
+ "mean_token_accuracy": 0.6979726552963257,
+ "num_tokens": 22937600.0,
+ "step": 1400
+ },
+ {
+ "epoch": 2.8282828282828283,
+ "eval_entropy": 1.3776377598124165,
+ "eval_loss": 1.533128261566162,
+ "eval_mean_token_accuracy": 0.645915245336871,
+ "eval_num_tokens": 22937600.0,
+ "eval_runtime": 43.7952,
+ "eval_samples_per_second": 22.605,
+ "eval_steps_per_second": 2.831,
+ "step": 1400
+ },
+ {
+ "entropy": 1.2173237800598145,
+ "epoch": 2.83030303030303,
+ "grad_norm": 2.245490789413452,
+ "learning_rate": 2.171717171717172e-06,
+ "loss": 1.1928956508636475,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 22953984.0,
+ "step": 1401
+ },
+ {
+ "entropy": 1.4213385581970215,
+ "epoch": 2.8323232323232324,
+ "grad_norm": 2.192051649093628,
+ "learning_rate": 2.16969696969697e-06,
+ "loss": 1.4340262413024902,
+ "mean_token_accuracy": 0.6622496247291565,
+ "num_tokens": 22970368.0,
+ "step": 1402
+ },
+ {
+ "entropy": 1.922193169593811,
+ "epoch": 2.8343434343434346,
+ "grad_norm": 2.0441250801086426,
+ "learning_rate": 2.167676767676768e-06,
+ "loss": 1.9164612293243408,
+ "mean_token_accuracy": 0.5942232608795166,
+ "num_tokens": 22986752.0,
+ "step": 1403
+ },
+ {
+ "entropy": 1.3124938011169434,
+ "epoch": 2.8363636363636364,
+ "grad_norm": 2.245614528656006,
+ "learning_rate": 2.165656565656566e-06,
+ "loss": 1.3055529594421387,
+ "mean_token_accuracy": 0.680385947227478,
+ "num_tokens": 23003136.0,
+ "step": 1404
+ },
+ {
+ "entropy": 0.9893879294395447,
+ "epoch": 2.8383838383838382,
+ "grad_norm": 2.1041340827941895,
+ "learning_rate": 2.163636363636364e-06,
+ "loss": 0.9646933078765869,
+ "mean_token_accuracy": 0.7441377639770508,
+ "num_tokens": 23019520.0,
+ "step": 1405
+ },
+ {
+ "entropy": 1.4011882543563843,
+ "epoch": 2.8404040404040405,
+ "grad_norm": 2.5371105670928955,
+ "learning_rate": 2.1616161616161617e-06,
+ "loss": 1.381878137588501,
+ "mean_token_accuracy": 0.6522960662841797,
+ "num_tokens": 23035904.0,
+ "step": 1406
+ },
+ {
+ "entropy": 1.4563852548599243,
+ "epoch": 2.8424242424242423,
+ "grad_norm": 2.1308720111846924,
+ "learning_rate": 2.15959595959596e-06,
+ "loss": 1.4763004779815674,
+ "mean_token_accuracy": 0.6792256832122803,
+ "num_tokens": 23052288.0,
+ "step": 1407
+ },
+ {
+ "entropy": 0.8676514625549316,
+ "epoch": 2.8444444444444446,
+ "grad_norm": 2.016085147857666,
+ "learning_rate": 2.157575757575758e-06,
+ "loss": 0.8672611713409424,
+ "mean_token_accuracy": 0.7660601139068604,
+ "num_tokens": 23068672.0,
+ "step": 1408
+ },
+ {
+ "entropy": 1.2011700868606567,
+ "epoch": 2.8464646464646464,
+ "grad_norm": 2.1641454696655273,
+ "learning_rate": 2.1555555555555558e-06,
+ "loss": 1.2113897800445557,
+ "mean_token_accuracy": 0.7180019617080688,
+ "num_tokens": 23085056.0,
+ "step": 1409
+ },
+ {
+ "entropy": 1.7813633680343628,
+ "epoch": 2.8484848484848486,
+ "grad_norm": 2.1768839359283447,
+ "learning_rate": 2.1535353535353537e-06,
+ "loss": 1.7897224426269531,
+ "mean_token_accuracy": 0.6129701733589172,
+ "num_tokens": 23101440.0,
+ "step": 1410
+ },
+ {
+ "entropy": 1.0219851732254028,
+ "epoch": 2.8505050505050504,
+ "grad_norm": 2.299229145050049,
+ "learning_rate": 2.1515151515151515e-06,
+ "loss": 1.0073617696762085,
+ "mean_token_accuracy": 0.7240473628044128,
+ "num_tokens": 23117824.0,
+ "step": 1411
+ },
+ {
+ "entropy": 1.3342534303665161,
+ "epoch": 2.8525252525252527,
+ "grad_norm": 2.165161371231079,
+ "learning_rate": 2.1494949494949494e-06,
+ "loss": 1.3219788074493408,
+ "mean_token_accuracy": 0.6764777898788452,
+ "num_tokens": 23134208.0,
+ "step": 1412
+ },
+ {
+ "entropy": 1.1618846654891968,
+ "epoch": 2.8545454545454545,
+ "grad_norm": 2.1276957988739014,
+ "learning_rate": 2.1474747474747477e-06,
+ "loss": 1.1667187213897705,
+ "mean_token_accuracy": 0.7214215993881226,
+ "num_tokens": 23150592.0,
+ "step": 1413
+ },
+ {
+ "entropy": 1.3673025369644165,
+ "epoch": 2.8565656565656568,
+ "grad_norm": 2.249702215194702,
+ "learning_rate": 2.1454545454545456e-06,
+ "loss": 1.380744218826294,
+ "mean_token_accuracy": 0.6656082272529602,
+ "num_tokens": 23166976.0,
+ "step": 1414
+ },
+ {
+ "entropy": 1.4118674993515015,
+ "epoch": 2.8585858585858586,
+ "grad_norm": 2.1488327980041504,
+ "learning_rate": 2.1434343434343435e-06,
+ "loss": 1.4007214307785034,
+ "mean_token_accuracy": 0.6663410067558289,
+ "num_tokens": 23183360.0,
+ "step": 1415
+ },
+ {
+ "entropy": 1.4398424625396729,
+ "epoch": 2.8606060606060604,
+ "grad_norm": 2.2609732151031494,
+ "learning_rate": 2.1414141414141414e-06,
+ "loss": 1.4657073020935059,
+ "mean_token_accuracy": 0.6483268141746521,
+ "num_tokens": 23199744.0,
+ "step": 1416
+ },
+ {
+ "entropy": 1.2922199964523315,
+ "epoch": 2.8626262626262626,
+ "grad_norm": 2.1911425590515137,
+ "learning_rate": 2.1393939393939393e-06,
+ "loss": 1.3118690252304077,
+ "mean_token_accuracy": 0.6951025724411011,
+ "num_tokens": 23216128.0,
+ "step": 1417
+ },
+ {
+ "entropy": 1.6888933181762695,
+ "epoch": 2.864646464646465,
+ "grad_norm": 2.2805919647216797,
+ "learning_rate": 2.1373737373737376e-06,
+ "loss": 1.6726739406585693,
+ "mean_token_accuracy": 0.6136419177055359,
+ "num_tokens": 23232512.0,
+ "step": 1418
+ },
+ {
+ "entropy": 1.289890170097351,
+ "epoch": 2.8666666666666667,
+ "grad_norm": 2.092263698577881,
+ "learning_rate": 2.1353535353535355e-06,
+ "loss": 1.2876317501068115,
+ "mean_token_accuracy": 0.6835613250732422,
+ "num_tokens": 23248896.0,
+ "step": 1419
+ },
+ {
+ "entropy": 1.361393690109253,
+ "epoch": 2.8686868686868685,
+ "grad_norm": 2.1863481998443604,
+ "learning_rate": 2.133333333333334e-06,
+ "loss": 1.3719209432601929,
+ "mean_token_accuracy": 0.663532018661499,
+ "num_tokens": 23265280.0,
+ "step": 1420
+ },
+ {
+ "entropy": 1.1187894344329834,
+ "epoch": 2.8707070707070708,
+ "grad_norm": 2.256434679031372,
+ "learning_rate": 2.1313131313131317e-06,
+ "loss": 1.1177198886871338,
+ "mean_token_accuracy": 0.7082926034927368,
+ "num_tokens": 23281664.0,
+ "step": 1421
+ },
+ {
+ "entropy": 0.8779795169830322,
+ "epoch": 2.8727272727272726,
+ "grad_norm": 2.095226526260376,
+ "learning_rate": 2.1292929292929296e-06,
+ "loss": 0.8675153851509094,
+ "mean_token_accuracy": 0.7647777199745178,
+ "num_tokens": 23298048.0,
+ "step": 1422
+ },
+ {
+ "entropy": 1.458146095275879,
+ "epoch": 2.874747474747475,
+ "grad_norm": 2.225179433822632,
+ "learning_rate": 2.1272727272727275e-06,
+ "loss": 1.4488263130187988,
+ "mean_token_accuracy": 0.6640205383300781,
+ "num_tokens": 23314432.0,
+ "step": 1423
+ },
+ {
+ "entropy": 1.187269926071167,
+ "epoch": 2.8767676767676766,
+ "grad_norm": 2.023710250854492,
+ "learning_rate": 2.1252525252525254e-06,
+ "loss": 1.182060718536377,
+ "mean_token_accuracy": 0.7017586827278137,
+ "num_tokens": 23330816.0,
+ "step": 1424
+ },
+ {
+ "entropy": 1.1446877717971802,
+ "epoch": 2.878787878787879,
+ "grad_norm": 2.301314115524292,
+ "learning_rate": 2.1232323232323237e-06,
+ "loss": 1.1507803201675415,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 23347200.0,
+ "step": 1425
+ },
+ {
+ "entropy": 1.3453346490859985,
+ "epoch": 2.8808080808080807,
+ "grad_norm": 2.0338571071624756,
+ "learning_rate": 2.1212121212121216e-06,
+ "loss": 1.345799207687378,
+ "mean_token_accuracy": 0.6966292262077332,
+ "num_tokens": 23363584.0,
+ "step": 1426
+ },
+ {
+ "entropy": 1.2638238668441772,
+ "epoch": 2.882828282828283,
+ "grad_norm": 2.1575632095336914,
+ "learning_rate": 2.1191919191919194e-06,
+ "loss": 1.2882521152496338,
+ "mean_token_accuracy": 0.6901563405990601,
+ "num_tokens": 23379968.0,
+ "step": 1427
+ },
+ {
+ "entropy": 1.4490493535995483,
+ "epoch": 2.8848484848484848,
+ "grad_norm": 2.1735994815826416,
+ "learning_rate": 2.1171717171717173e-06,
+ "loss": 1.455702781677246,
+ "mean_token_accuracy": 0.6538837552070618,
+ "num_tokens": 23396352.0,
+ "step": 1428
+ },
+ {
+ "entropy": 1.3873618841171265,
+ "epoch": 2.886868686868687,
+ "grad_norm": 2.3870506286621094,
+ "learning_rate": 2.1151515151515152e-06,
+ "loss": 1.3657323122024536,
+ "mean_token_accuracy": 0.6692110300064087,
+ "num_tokens": 23412736.0,
+ "step": 1429
+ },
+ {
+ "entropy": 1.298308253288269,
+ "epoch": 2.888888888888889,
+ "grad_norm": 2.079481363296509,
+ "learning_rate": 2.113131313131313e-06,
+ "loss": 1.30775785446167,
+ "mean_token_accuracy": 0.6834391951560974,
+ "num_tokens": 23429120.0,
+ "step": 1430
+ },
+ {
+ "entropy": 1.1544564962387085,
+ "epoch": 2.8909090909090907,
+ "grad_norm": 2.2400357723236084,
+ "learning_rate": 2.1111111111111114e-06,
+ "loss": 1.17466139793396,
+ "mean_token_accuracy": 0.7093307375907898,
+ "num_tokens": 23445504.0,
+ "step": 1431
+ },
+ {
+ "entropy": 1.4711883068084717,
+ "epoch": 2.892929292929293,
+ "grad_norm": 2.1779074668884277,
+ "learning_rate": 2.1090909090909093e-06,
+ "loss": 1.4626137018203735,
+ "mean_token_accuracy": 0.6602955460548401,
+ "num_tokens": 23461888.0,
+ "step": 1432
+ },
+ {
+ "entropy": 1.4876407384872437,
+ "epoch": 2.894949494949495,
+ "grad_norm": 2.278554677963257,
+ "learning_rate": 2.107070707070707e-06,
+ "loss": 1.5031921863555908,
+ "mean_token_accuracy": 0.6570591330528259,
+ "num_tokens": 23478272.0,
+ "step": 1433
+ },
+ {
+ "entropy": 1.328355073928833,
+ "epoch": 2.896969696969697,
+ "grad_norm": 2.034842014312744,
+ "learning_rate": 2.105050505050505e-06,
+ "loss": 1.3163859844207764,
+ "mean_token_accuracy": 0.6878358721733093,
+ "num_tokens": 23494656.0,
+ "step": 1434
+ },
+ {
+ "entropy": 1.487100601196289,
+ "epoch": 2.898989898989899,
+ "grad_norm": 2.1980724334716797,
+ "learning_rate": 2.103030303030303e-06,
+ "loss": 1.4886071681976318,
+ "mean_token_accuracy": 0.6521739363670349,
+ "num_tokens": 23511040.0,
+ "step": 1435
+ },
+ {
+ "entropy": 1.4826854467391968,
+ "epoch": 2.901010101010101,
+ "grad_norm": 2.5214874744415283,
+ "learning_rate": 2.1010101010101013e-06,
+ "loss": 1.4610626697540283,
+ "mean_token_accuracy": 0.6503419876098633,
+ "num_tokens": 23527424.0,
+ "step": 1436
+ },
+ {
+ "entropy": 1.00849187374115,
+ "epoch": 2.9030303030303033,
+ "grad_norm": 2.1452033519744873,
+ "learning_rate": 2.098989898989899e-06,
+ "loss": 0.9949107766151428,
+ "mean_token_accuracy": 0.7457864880561829,
+ "num_tokens": 23543808.0,
+ "step": 1437
+ },
+ {
+ "entropy": 1.0621757507324219,
+ "epoch": 2.905050505050505,
+ "grad_norm": 2.1871836185455322,
+ "learning_rate": 2.096969696969697e-06,
+ "loss": 1.0466980934143066,
+ "mean_token_accuracy": 0.7275280952453613,
+ "num_tokens": 23560192.0,
+ "step": 1438
+ },
+ {
+ "entropy": 1.3413732051849365,
+ "epoch": 2.907070707070707,
+ "grad_norm": 2.2954704761505127,
+ "learning_rate": 2.094949494949495e-06,
+ "loss": 1.3602681159973145,
+ "mean_token_accuracy": 0.6686003804206848,
+ "num_tokens": 23576576.0,
+ "step": 1439
+ },
+ {
+ "entropy": 0.8138323426246643,
+ "epoch": 2.909090909090909,
+ "grad_norm": 1.9476791620254517,
+ "learning_rate": 2.092929292929293e-06,
+ "loss": 0.8208089470863342,
+ "mean_token_accuracy": 0.7796775698661804,
+ "num_tokens": 23592960.0,
+ "step": 1440
+ },
+ {
+ "entropy": 0.9035854339599609,
+ "epoch": 2.911111111111111,
+ "grad_norm": 1.9753291606903076,
+ "learning_rate": 2.090909090909091e-06,
+ "loss": 0.8889603614807129,
+ "mean_token_accuracy": 0.7610527873039246,
+ "num_tokens": 23609344.0,
+ "step": 1441
+ },
+ {
+ "entropy": 0.9301351308822632,
+ "epoch": 2.9131313131313132,
+ "grad_norm": 2.244597911834717,
+ "learning_rate": 2.088888888888889e-06,
+ "loss": 0.9369313716888428,
+ "mean_token_accuracy": 0.7603810429573059,
+ "num_tokens": 23625728.0,
+ "step": 1442
+ },
+ {
+ "entropy": 0.8740416765213013,
+ "epoch": 2.915151515151515,
+ "grad_norm": 2.0207667350769043,
+ "learning_rate": 2.0868686868686873e-06,
+ "loss": 0.8751406073570251,
+ "mean_token_accuracy": 0.7634342908859253,
+ "num_tokens": 23642112.0,
+ "step": 1443
+ },
+ {
+ "entropy": 1.044225811958313,
+ "epoch": 2.9171717171717173,
+ "grad_norm": 2.8100409507751465,
+ "learning_rate": 2.0848484848484852e-06,
+ "loss": 1.0568115711212158,
+ "mean_token_accuracy": 0.7291157841682434,
+ "num_tokens": 23658496.0,
+ "step": 1444
+ },
+ {
+ "entropy": 1.1093257665634155,
+ "epoch": 2.919191919191919,
+ "grad_norm": 2.2957236766815186,
+ "learning_rate": 2.082828282828283e-06,
+ "loss": 1.1235377788543701,
+ "mean_token_accuracy": 0.7108573317527771,
+ "num_tokens": 23674880.0,
+ "step": 1445
+ },
+ {
+ "entropy": 1.2211518287658691,
+ "epoch": 2.9212121212121214,
+ "grad_norm": 2.022287130355835,
+ "learning_rate": 2.080808080808081e-06,
+ "loss": 1.241473913192749,
+ "mean_token_accuracy": 0.7020029425621033,
+ "num_tokens": 23691264.0,
+ "step": 1446
+ },
+ {
+ "entropy": 1.3636398315429688,
+ "epoch": 2.923232323232323,
+ "grad_norm": 2.1484291553497314,
+ "learning_rate": 2.078787878787879e-06,
+ "loss": 1.3876409530639648,
+ "mean_token_accuracy": 0.6714093685150146,
+ "num_tokens": 23707648.0,
+ "step": 1447
+ },
+ {
+ "entropy": 1.1615006923675537,
+ "epoch": 2.9252525252525254,
+ "grad_norm": 2.775181293487549,
+ "learning_rate": 2.0767676767676768e-06,
+ "loss": 1.1792278289794922,
+ "mean_token_accuracy": 0.7070102691650391,
+ "num_tokens": 23724032.0,
+ "step": 1448
+ },
+ {
+ "entropy": 1.6308530569076538,
+ "epoch": 2.9272727272727272,
+ "grad_norm": 2.3813729286193848,
+ "learning_rate": 2.074747474747475e-06,
+ "loss": 1.6642422676086426,
+ "mean_token_accuracy": 0.6171225905418396,
+ "num_tokens": 23740416.0,
+ "step": 1449
+ },
+ {
+ "entropy": 1.2764222621917725,
+ "epoch": 2.929292929292929,
+ "grad_norm": 2.234309196472168,
+ "learning_rate": 2.072727272727273e-06,
+ "loss": 1.2756493091583252,
+ "mean_token_accuracy": 0.6824010610580444,
+ "num_tokens": 23756800.0,
+ "step": 1450
+ },
+ {
+ "epoch": 2.929292929292929,
+ "eval_entropy": 1.366065975639128,
+ "eval_loss": 1.5328131914138794,
+ "eval_mean_token_accuracy": 0.6461491642459747,
+ "eval_num_tokens": 23756800.0,
+ "eval_runtime": 43.8548,
+ "eval_samples_per_second": 22.574,
+ "eval_steps_per_second": 2.828,
+ "step": 1450
+ },
+ {
+ "entropy": 1.178619623184204,
+ "epoch": 2.9313131313131313,
+ "grad_norm": 2.0946547985076904,
+ "learning_rate": 2.070707070707071e-06,
+ "loss": 1.1751608848571777,
+ "mean_token_accuracy": 0.704384446144104,
+ "num_tokens": 23773184.0,
+ "step": 1451
+ },
+ {
+ "entropy": 1.319455862045288,
+ "epoch": 2.9333333333333336,
+ "grad_norm": 2.1925816535949707,
+ "learning_rate": 2.0686868686868688e-06,
+ "loss": 1.3229246139526367,
+ "mean_token_accuracy": 0.6867977380752563,
+ "num_tokens": 23789568.0,
+ "step": 1452
+ },
+ {
+ "entropy": 1.787271499633789,
+ "epoch": 2.9353535353535354,
+ "grad_norm": 2.374494791030884,
+ "learning_rate": 2.0666666666666666e-06,
+ "loss": 1.7788429260253906,
+ "mean_token_accuracy": 0.589154839515686,
+ "num_tokens": 23805952.0,
+ "step": 1453
+ },
+ {
+ "entropy": 1.25193452835083,
+ "epoch": 2.937373737373737,
+ "grad_norm": 2.3499720096588135,
+ "learning_rate": 2.064646464646465e-06,
+ "loss": 1.2651758193969727,
+ "mean_token_accuracy": 0.6863092184066772,
+ "num_tokens": 23822336.0,
+ "step": 1454
+ },
+ {
+ "entropy": 1.355589747428894,
+ "epoch": 2.9393939393939394,
+ "grad_norm": 2.228123426437378,
+ "learning_rate": 2.062626262626263e-06,
+ "loss": 1.3623197078704834,
+ "mean_token_accuracy": 0.6623717546463013,
+ "num_tokens": 23838720.0,
+ "step": 1455
+ },
+ {
+ "entropy": 1.2293426990509033,
+ "epoch": 2.9414141414141413,
+ "grad_norm": 2.4237186908721924,
+ "learning_rate": 2.0606060606060607e-06,
+ "loss": 1.2226693630218506,
+ "mean_token_accuracy": 0.6903395056724548,
+ "num_tokens": 23855104.0,
+ "step": 1456
+ },
+ {
+ "entropy": 1.2312723398208618,
+ "epoch": 2.9434343434343435,
+ "grad_norm": 2.2350525856018066,
+ "learning_rate": 2.0585858585858586e-06,
+ "loss": 1.235978364944458,
+ "mean_token_accuracy": 0.696201741695404,
+ "num_tokens": 23871488.0,
+ "step": 1457
+ },
+ {
+ "entropy": 1.2731300592422485,
+ "epoch": 2.9454545454545453,
+ "grad_norm": 2.488929033279419,
+ "learning_rate": 2.0565656565656565e-06,
+ "loss": 1.2763257026672363,
+ "mean_token_accuracy": 0.6765388250350952,
+ "num_tokens": 23887872.0,
+ "step": 1458
+ },
+ {
+ "entropy": 1.1283669471740723,
+ "epoch": 2.9474747474747476,
+ "grad_norm": 2.116241693496704,
+ "learning_rate": 2.054545454545455e-06,
+ "loss": 1.1279038190841675,
+ "mean_token_accuracy": 0.7123228907585144,
+ "num_tokens": 23904256.0,
+ "step": 1459
+ },
+ {
+ "entropy": 1.4969894886016846,
+ "epoch": 2.9494949494949494,
+ "grad_norm": 2.17519474029541,
+ "learning_rate": 2.0525252525252527e-06,
+ "loss": 1.5177810192108154,
+ "mean_token_accuracy": 0.6544333100318909,
+ "num_tokens": 23920640.0,
+ "step": 1460
+ },
+ {
+ "entropy": 1.3133295774459839,
+ "epoch": 2.9515151515151516,
+ "grad_norm": 2.149486780166626,
+ "learning_rate": 2.0505050505050506e-06,
+ "loss": 1.2985190153121948,
+ "mean_token_accuracy": 0.6745237112045288,
+ "num_tokens": 23937024.0,
+ "step": 1461
+ },
+ {
+ "entropy": 1.2777348756790161,
+ "epoch": 2.9535353535353535,
+ "grad_norm": 2.124922752380371,
+ "learning_rate": 2.0484848484848485e-06,
+ "loss": 1.2731128931045532,
+ "mean_token_accuracy": 0.692415714263916,
+ "num_tokens": 23953408.0,
+ "step": 1462
+ },
+ {
+ "entropy": 1.0544995069503784,
+ "epoch": 2.9555555555555557,
+ "grad_norm": 2.177363872528076,
+ "learning_rate": 2.046464646464647e-06,
+ "loss": 1.0588994026184082,
+ "mean_token_accuracy": 0.7378480434417725,
+ "num_tokens": 23969792.0,
+ "step": 1463
+ },
+ {
+ "entropy": 1.441129446029663,
+ "epoch": 2.9575757575757575,
+ "grad_norm": 2.5355494022369385,
+ "learning_rate": 2.0444444444444447e-06,
+ "loss": 1.4684169292449951,
+ "mean_token_accuracy": 0.6495481133460999,
+ "num_tokens": 23986176.0,
+ "step": 1464
+ },
+ {
+ "entropy": 1.3359375,
+ "epoch": 2.9595959595959593,
+ "grad_norm": 2.309727191925049,
+ "learning_rate": 2.0424242424242426e-06,
+ "loss": 1.339503288269043,
+ "mean_token_accuracy": 0.6707376837730408,
+ "num_tokens": 24002560.0,
+ "step": 1465
+ },
+ {
+ "entropy": 1.5922675132751465,
+ "epoch": 2.9616161616161616,
+ "grad_norm": 2.191904067993164,
+ "learning_rate": 2.0404040404040405e-06,
+ "loss": 1.613649845123291,
+ "mean_token_accuracy": 0.635869562625885,
+ "num_tokens": 24018944.0,
+ "step": 1466
+ },
+ {
+ "entropy": 1.152869701385498,
+ "epoch": 2.963636363636364,
+ "grad_norm": 2.1656837463378906,
+ "learning_rate": 2.0383838383838388e-06,
+ "loss": 1.1791510581970215,
+ "mean_token_accuracy": 0.7013311982154846,
+ "num_tokens": 24035328.0,
+ "step": 1467
+ },
+ {
+ "entropy": 1.491494059562683,
+ "epoch": 2.9656565656565657,
+ "grad_norm": 2.397916555404663,
+ "learning_rate": 2.0363636363636367e-06,
+ "loss": 1.4803133010864258,
+ "mean_token_accuracy": 0.6395334601402283,
+ "num_tokens": 24051712.0,
+ "step": 1468
+ },
+ {
+ "entropy": 1.165432095527649,
+ "epoch": 2.9676767676767675,
+ "grad_norm": 2.0728659629821777,
+ "learning_rate": 2.0343434343434345e-06,
+ "loss": 1.1676859855651855,
+ "mean_token_accuracy": 0.7170249223709106,
+ "num_tokens": 24068096.0,
+ "step": 1469
+ },
+ {
+ "entropy": 0.7055315971374512,
+ "epoch": 2.9696969696969697,
+ "grad_norm": 1.949097752571106,
+ "learning_rate": 2.0323232323232324e-06,
+ "loss": 0.7094426155090332,
+ "mean_token_accuracy": 0.8047752976417542,
+ "num_tokens": 24084480.0,
+ "step": 1470
+ },
+ {
+ "entropy": 1.5079377889633179,
+ "epoch": 2.971717171717172,
+ "grad_norm": 2.282525062561035,
+ "learning_rate": 2.0303030303030303e-06,
+ "loss": 1.5309293270111084,
+ "mean_token_accuracy": 0.65486079454422,
+ "num_tokens": 24100864.0,
+ "step": 1471
+ },
+ {
+ "entropy": 1.6969871520996094,
+ "epoch": 2.973737373737374,
+ "grad_norm": 2.2211408615112305,
+ "learning_rate": 2.0282828282828286e-06,
+ "loss": 1.6919132471084595,
+ "mean_token_accuracy": 0.6259770393371582,
+ "num_tokens": 24117248.0,
+ "step": 1472
+ },
+ {
+ "entropy": 1.3981496095657349,
+ "epoch": 2.9757575757575756,
+ "grad_norm": 2.27559232711792,
+ "learning_rate": 2.0262626262626265e-06,
+ "loss": 1.4188807010650635,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 24133632.0,
+ "step": 1473
+ },
+ {
+ "entropy": 1.2966978549957275,
+ "epoch": 2.977777777777778,
+ "grad_norm": 2.2315874099731445,
+ "learning_rate": 2.0242424242424244e-06,
+ "loss": 1.3034720420837402,
+ "mean_token_accuracy": 0.6849047541618347,
+ "num_tokens": 24150016.0,
+ "step": 1474
+ },
+ {
+ "entropy": 1.4312105178833008,
+ "epoch": 2.9797979797979797,
+ "grad_norm": 2.3630731105804443,
+ "learning_rate": 2.0222222222222223e-06,
+ "loss": 1.412591814994812,
+ "mean_token_accuracy": 0.6673180460929871,
+ "num_tokens": 24166400.0,
+ "step": 1475
+ },
+ {
+ "entropy": 1.246411681175232,
+ "epoch": 2.981818181818182,
+ "grad_norm": 2.101142644882202,
+ "learning_rate": 2.02020202020202e-06,
+ "loss": 1.2674810886383057,
+ "mean_token_accuracy": 0.691255509853363,
+ "num_tokens": 24182784.0,
+ "step": 1476
+ },
+ {
+ "entropy": 1.2367678880691528,
+ "epoch": 2.9838383838383837,
+ "grad_norm": 2.3414289951324463,
+ "learning_rate": 2.0181818181818185e-06,
+ "loss": 1.254493236541748,
+ "mean_token_accuracy": 0.6811797618865967,
+ "num_tokens": 24199168.0,
+ "step": 1477
+ },
+ {
+ "entropy": 1.3566304445266724,
+ "epoch": 2.985858585858586,
+ "grad_norm": 2.3050434589385986,
+ "learning_rate": 2.0161616161616164e-06,
+ "loss": 1.3336361646652222,
+ "mean_token_accuracy": 0.6761724352836609,
+ "num_tokens": 24215552.0,
+ "step": 1478
+ },
+ {
+ "entropy": 1.3928223848342896,
+ "epoch": 2.987878787878788,
+ "grad_norm": 2.2100086212158203,
+ "learning_rate": 2.0141414141414143e-06,
+ "loss": 1.4050222635269165,
+ "mean_token_accuracy": 0.6573033928871155,
+ "num_tokens": 24231936.0,
+ "step": 1479
+ },
+ {
+ "entropy": 1.067913293838501,
+ "epoch": 2.98989898989899,
+ "grad_norm": 2.0196874141693115,
+ "learning_rate": 2.012121212121212e-06,
+ "loss": 1.0836842060089111,
+ "mean_token_accuracy": 0.7427943348884583,
+ "num_tokens": 24248320.0,
+ "step": 1480
+ },
+ {
+ "entropy": 1.077475905418396,
+ "epoch": 2.991919191919192,
+ "grad_norm": 2.117917776107788,
+ "learning_rate": 2.01010101010101e-06,
+ "loss": 1.0825674533843994,
+ "mean_token_accuracy": 0.7288104295730591,
+ "num_tokens": 24264704.0,
+ "step": 1481
+ },
+ {
+ "entropy": 1.092706561088562,
+ "epoch": 2.993939393939394,
+ "grad_norm": 2.143916130065918,
+ "learning_rate": 2.008080808080808e-06,
+ "loss": 1.1073365211486816,
+ "mean_token_accuracy": 0.7271006107330322,
+ "num_tokens": 24281088.0,
+ "step": 1482
+ },
+ {
+ "entropy": 1.3734595775604248,
+ "epoch": 2.995959595959596,
+ "grad_norm": 2.3651299476623535,
+ "learning_rate": 2.0060606060606062e-06,
+ "loss": 1.3319274187088013,
+ "mean_token_accuracy": 0.6729360222816467,
+ "num_tokens": 24297472.0,
+ "step": 1483
+ },
+ {
+ "entropy": 1.5602202415466309,
+ "epoch": 2.9979797979797977,
+ "grad_norm": 2.4872968196868896,
+ "learning_rate": 2.004040404040404e-06,
+ "loss": 1.5969634056091309,
+ "mean_token_accuracy": 0.6352589130401611,
+ "num_tokens": 24313856.0,
+ "step": 1484
+ },
+ {
+ "entropy": 1.4174549579620361,
+ "epoch": 3.0,
+ "grad_norm": 2.1410610675811768,
+ "learning_rate": 2.0020202020202024e-06,
+ "loss": 1.4155133962631226,
+ "mean_token_accuracy": 0.6683561205863953,
+ "num_tokens": 24330240.0,
+ "step": 1485
+ },
+ {
+ "entropy": 1.5710192918777466,
+ "epoch": 3.002020202020202,
+ "grad_norm": 2.1068179607391357,
+ "learning_rate": 2.0000000000000003e-06,
+ "loss": 1.5049738883972168,
+ "mean_token_accuracy": 0.6563873887062073,
+ "num_tokens": 24346624.0,
+ "step": 1486
+ },
+ {
+ "entropy": 1.2311826944351196,
+ "epoch": 3.004040404040404,
+ "grad_norm": 2.238032579421997,
+ "learning_rate": 1.9979797979797982e-06,
+ "loss": 1.1740195751190186,
+ "mean_token_accuracy": 0.7018197178840637,
+ "num_tokens": 24363008.0,
+ "step": 1487
+ },
+ {
+ "entropy": 1.0681109428405762,
+ "epoch": 3.006060606060606,
+ "grad_norm": 2.0808138847351074,
+ "learning_rate": 1.995959595959596e-06,
+ "loss": 1.0269291400909424,
+ "mean_token_accuracy": 0.739130437374115,
+ "num_tokens": 24379392.0,
+ "step": 1488
+ },
+ {
+ "entropy": 1.2553848028182983,
+ "epoch": 3.008080808080808,
+ "grad_norm": 2.155320644378662,
+ "learning_rate": 1.993939393939394e-06,
+ "loss": 1.209822654724121,
+ "mean_token_accuracy": 0.7072545289993286,
+ "num_tokens": 24395776.0,
+ "step": 1489
+ },
+ {
+ "entropy": 1.5376615524291992,
+ "epoch": 3.01010101010101,
+ "grad_norm": 2.376460075378418,
+ "learning_rate": 1.9919191919191923e-06,
+ "loss": 1.485018014907837,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 24412160.0,
+ "step": 1490
+ },
+ {
+ "entropy": 1.0649843215942383,
+ "epoch": 3.012121212121212,
+ "grad_norm": 2.1056692600250244,
+ "learning_rate": 1.98989898989899e-06,
+ "loss": 1.037630558013916,
+ "mean_token_accuracy": 0.7341841459274292,
+ "num_tokens": 24428544.0,
+ "step": 1491
+ },
+ {
+ "entropy": 1.3711966276168823,
+ "epoch": 3.014141414141414,
+ "grad_norm": 2.238981008529663,
+ "learning_rate": 1.987878787878788e-06,
+ "loss": 1.3336507081985474,
+ "mean_token_accuracy": 0.6914386749267578,
+ "num_tokens": 24444928.0,
+ "step": 1492
+ },
+ {
+ "entropy": 1.3955618143081665,
+ "epoch": 3.0161616161616163,
+ "grad_norm": 2.183464765548706,
+ "learning_rate": 1.985858585858586e-06,
+ "loss": 1.3517842292785645,
+ "mean_token_accuracy": 0.6735466718673706,
+ "num_tokens": 24461312.0,
+ "step": 1493
+ },
+ {
+ "entropy": 1.0063103437423706,
+ "epoch": 3.018181818181818,
+ "grad_norm": 2.1911609172821045,
+ "learning_rate": 1.983838383838384e-06,
+ "loss": 0.9973118305206299,
+ "mean_token_accuracy": 0.7280166149139404,
+ "num_tokens": 24477696.0,
+ "step": 1494
+ },
+ {
+ "entropy": 1.3080904483795166,
+ "epoch": 3.0202020202020203,
+ "grad_norm": 2.1129884719848633,
+ "learning_rate": 1.981818181818182e-06,
+ "loss": 1.2758756875991821,
+ "mean_token_accuracy": 0.7027357220649719,
+ "num_tokens": 24494080.0,
+ "step": 1495
+ },
+ {
+ "entropy": 1.5414087772369385,
+ "epoch": 3.022222222222222,
+ "grad_norm": 2.1628341674804688,
+ "learning_rate": 1.97979797979798e-06,
+ "loss": 1.527054786682129,
+ "mean_token_accuracy": 0.6569370031356812,
+ "num_tokens": 24510464.0,
+ "step": 1496
+ },
+ {
+ "entropy": 1.44732666015625,
+ "epoch": 3.0242424242424244,
+ "grad_norm": 2.2525594234466553,
+ "learning_rate": 1.977777777777778e-06,
+ "loss": 1.3968576192855835,
+ "mean_token_accuracy": 0.6604787707328796,
+ "num_tokens": 24526848.0,
+ "step": 1497
+ },
+ {
+ "entropy": 1.522241234779358,
+ "epoch": 3.026262626262626,
+ "grad_norm": 2.1826529502868652,
+ "learning_rate": 1.975757575757576e-06,
+ "loss": 1.529256820678711,
+ "mean_token_accuracy": 0.6493649482727051,
+ "num_tokens": 24543232.0,
+ "step": 1498
+ },
+ {
+ "entropy": 0.8186452984809875,
+ "epoch": 3.0282828282828285,
+ "grad_norm": 2.1004087924957275,
+ "learning_rate": 1.9737373737373737e-06,
+ "loss": 0.8136417865753174,
+ "mean_token_accuracy": 0.7819370031356812,
+ "num_tokens": 24559616.0,
+ "step": 1499
+ },
+ {
+ "entropy": 1.2122654914855957,
+ "epoch": 3.0303030303030303,
+ "grad_norm": 2.4567720890045166,
+ "learning_rate": 1.9717171717171716e-06,
+ "loss": 1.236933946609497,
+ "mean_token_accuracy": 0.6828895807266235,
+ "num_tokens": 24576000.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.0303030303030303,
+ "eval_entropy": 1.3221501962792488,
+ "eval_loss": 1.5418624877929688,
+ "eval_mean_token_accuracy": 0.6455981039231823,
+ "eval_num_tokens": 24576000.0,
+ "eval_runtime": 43.8085,
+ "eval_samples_per_second": 22.598,
+ "eval_steps_per_second": 2.831,
+ "step": 1500
+ },
+ {
+ "entropy": 0.9493642449378967,
+ "epoch": 3.0323232323232325,
+ "grad_norm": 2.278731346130371,
+ "learning_rate": 1.96969696969697e-06,
+ "loss": 0.9456083178520203,
+ "mean_token_accuracy": 0.7484733462333679,
+ "num_tokens": 24592384.0,
+ "step": 1501
+ },
+ {
+ "entropy": 1.4509791135787964,
+ "epoch": 3.0343434343434343,
+ "grad_norm": 2.112172842025757,
+ "learning_rate": 1.967676767676768e-06,
+ "loss": 1.451171875,
+ "mean_token_accuracy": 0.6633487939834595,
+ "num_tokens": 24608768.0,
+ "step": 1502
+ },
+ {
+ "entropy": 1.6493220329284668,
+ "epoch": 3.036363636363636,
+ "grad_norm": 2.0969111919403076,
+ "learning_rate": 1.9656565656565657e-06,
+ "loss": 1.6576147079467773,
+ "mean_token_accuracy": 0.628724992275238,
+ "num_tokens": 24625152.0,
+ "step": 1503
+ },
+ {
+ "entropy": 1.5533742904663086,
+ "epoch": 3.0383838383838384,
+ "grad_norm": 2.1630685329437256,
+ "learning_rate": 1.9636363636363636e-06,
+ "loss": 1.556575894355774,
+ "mean_token_accuracy": 0.6745237112045288,
+ "num_tokens": 24641536.0,
+ "step": 1504
+ },
+ {
+ "entropy": 1.382328987121582,
+ "epoch": 3.04040404040404,
+ "grad_norm": 2.1493992805480957,
+ "learning_rate": 1.9616161616161615e-06,
+ "loss": 1.3725603818893433,
+ "mean_token_accuracy": 0.6811797618865967,
+ "num_tokens": 24657920.0,
+ "step": 1505
+ },
+ {
+ "entropy": 1.276682734489441,
+ "epoch": 3.0424242424242425,
+ "grad_norm": 2.342043161392212,
+ "learning_rate": 1.9595959595959598e-06,
+ "loss": 1.2861356735229492,
+ "mean_token_accuracy": 0.6843551397323608,
+ "num_tokens": 24674304.0,
+ "step": 1506
+ },
+ {
+ "entropy": 1.3813475370407104,
+ "epoch": 3.0444444444444443,
+ "grad_norm": 2.246891736984253,
+ "learning_rate": 1.9575757575757577e-06,
+ "loss": 1.3686306476593018,
+ "mean_token_accuracy": 0.6649364829063416,
+ "num_tokens": 24690688.0,
+ "step": 1507
+ },
+ {
+ "entropy": 1.2101274728775024,
+ "epoch": 3.0464646464646465,
+ "grad_norm": 2.2917656898498535,
+ "learning_rate": 1.955555555555556e-06,
+ "loss": 1.2131311893463135,
+ "mean_token_accuracy": 0.6958353519439697,
+ "num_tokens": 24707072.0,
+ "step": 1508
+ },
+ {
+ "entropy": 0.7796710133552551,
+ "epoch": 3.0484848484848484,
+ "grad_norm": 2.1023900508880615,
+ "learning_rate": 1.953535353535354e-06,
+ "loss": 0.7828338146209717,
+ "mean_token_accuracy": 0.7879824042320251,
+ "num_tokens": 24723456.0,
+ "step": 1509
+ },
+ {
+ "entropy": 0.8980224132537842,
+ "epoch": 3.0505050505050506,
+ "grad_norm": 2.259763240814209,
+ "learning_rate": 1.9515151515151518e-06,
+ "loss": 0.8986867070198059,
+ "mean_token_accuracy": 0.751038134098053,
+ "num_tokens": 24739840.0,
+ "step": 1510
+ },
+ {
+ "entropy": 1.1927038431167603,
+ "epoch": 3.0525252525252524,
+ "grad_norm": 2.2032012939453125,
+ "learning_rate": 1.9494949494949496e-06,
+ "loss": 1.1801973581314087,
+ "mean_token_accuracy": 0.7048729658126831,
+ "num_tokens": 24756224.0,
+ "step": 1511
+ },
+ {
+ "entropy": 0.8241261839866638,
+ "epoch": 3.0545454545454547,
+ "grad_norm": 1.9027519226074219,
+ "learning_rate": 1.9474747474747475e-06,
+ "loss": 0.8152725100517273,
+ "mean_token_accuracy": 0.7793111801147461,
+ "num_tokens": 24772608.0,
+ "step": 1512
+ },
+ {
+ "entropy": 1.1086668968200684,
+ "epoch": 3.0565656565656565,
+ "grad_norm": 2.4891581535339355,
+ "learning_rate": 1.945454545454546e-06,
+ "loss": 1.1167728900909424,
+ "mean_token_accuracy": 0.7162310481071472,
+ "num_tokens": 24788992.0,
+ "step": 1513
+ },
+ {
+ "entropy": 1.0804646015167236,
+ "epoch": 3.0585858585858587,
+ "grad_norm": 2.3115813732147217,
+ "learning_rate": 1.9434343434343437e-06,
+ "loss": 1.1059165000915527,
+ "mean_token_accuracy": 0.7208109498023987,
+ "num_tokens": 24805376.0,
+ "step": 1514
+ },
+ {
+ "entropy": 1.2628663778305054,
+ "epoch": 3.0606060606060606,
+ "grad_norm": 2.077954053878784,
+ "learning_rate": 1.9414141414141416e-06,
+ "loss": 1.2748162746429443,
+ "mean_token_accuracy": 0.697300910949707,
+ "num_tokens": 24821760.0,
+ "step": 1515
+ },
+ {
+ "entropy": 1.1143958568572998,
+ "epoch": 3.062626262626263,
+ "grad_norm": 2.3562631607055664,
+ "learning_rate": 1.9393939393939395e-06,
+ "loss": 1.127720832824707,
+ "mean_token_accuracy": 0.7080483436584473,
+ "num_tokens": 24838144.0,
+ "step": 1516
+ },
+ {
+ "entropy": 1.3625105619430542,
+ "epoch": 3.0646464646464646,
+ "grad_norm": 2.592428684234619,
+ "learning_rate": 1.9373737373737374e-06,
+ "loss": 1.3909248113632202,
+ "mean_token_accuracy": 0.6637151837348938,
+ "num_tokens": 24854528.0,
+ "step": 1517
+ },
+ {
+ "entropy": 1.032320261001587,
+ "epoch": 3.066666666666667,
+ "grad_norm": 2.400594711303711,
+ "learning_rate": 1.9353535353535353e-06,
+ "loss": 1.0697423219680786,
+ "mean_token_accuracy": 0.7302759885787964,
+ "num_tokens": 24870912.0,
+ "step": 1518
+ },
+ {
+ "entropy": 1.019578456878662,
+ "epoch": 3.0686868686868687,
+ "grad_norm": 2.137122869491577,
+ "learning_rate": 1.9333333333333336e-06,
+ "loss": 0.9904043674468994,
+ "mean_token_accuracy": 0.7461528778076172,
+ "num_tokens": 24887296.0,
+ "step": 1519
+ },
+ {
+ "entropy": 1.4399018287658691,
+ "epoch": 3.0707070707070705,
+ "grad_norm": 2.343580484390259,
+ "learning_rate": 1.9313131313131315e-06,
+ "loss": 1.429957628250122,
+ "mean_token_accuracy": 0.6615168452262878,
+ "num_tokens": 24903680.0,
+ "step": 1520
+ },
+ {
+ "entropy": 0.946161150932312,
+ "epoch": 3.0727272727272728,
+ "grad_norm": 1.9037182331085205,
+ "learning_rate": 1.9292929292929294e-06,
+ "loss": 0.943518877029419,
+ "mean_token_accuracy": 0.7626404762268066,
+ "num_tokens": 24920064.0,
+ "step": 1521
+ },
+ {
+ "entropy": 1.2314492464065552,
+ "epoch": 3.0747474747474746,
+ "grad_norm": 2.0896897315979004,
+ "learning_rate": 1.9272727272727273e-06,
+ "loss": 1.2434325218200684,
+ "mean_token_accuracy": 0.7122007608413696,
+ "num_tokens": 24936448.0,
+ "step": 1522
+ },
+ {
+ "entropy": 1.4557143449783325,
+ "epoch": 3.076767676767677,
+ "grad_norm": 2.162768602371216,
+ "learning_rate": 1.925252525252525e-06,
+ "loss": 1.4258036613464355,
+ "mean_token_accuracy": 0.6709819436073303,
+ "num_tokens": 24952832.0,
+ "step": 1523
+ },
+ {
+ "entropy": 1.1379952430725098,
+ "epoch": 3.0787878787878786,
+ "grad_norm": 2.322523832321167,
+ "learning_rate": 1.9232323232323235e-06,
+ "loss": 1.1321945190429688,
+ "mean_token_accuracy": 0.7206888198852539,
+ "num_tokens": 24969216.0,
+ "step": 1524
+ },
+ {
+ "entropy": 1.4143598079681396,
+ "epoch": 3.080808080808081,
+ "grad_norm": 2.2130038738250732,
+ "learning_rate": 1.9212121212121213e-06,
+ "loss": 1.4286584854125977,
+ "mean_token_accuracy": 0.6595627665519714,
+ "num_tokens": 24985600.0,
+ "step": 1525
+ },
+ {
+ "entropy": 0.9206982254981995,
+ "epoch": 3.0828282828282827,
+ "grad_norm": 2.150385618209839,
+ "learning_rate": 1.9191919191919192e-06,
+ "loss": 0.9122598171234131,
+ "mean_token_accuracy": 0.7564728856086731,
+ "num_tokens": 25001984.0,
+ "step": 1526
+ },
+ {
+ "entropy": 1.3168023824691772,
+ "epoch": 3.084848484848485,
+ "grad_norm": 2.2106544971466064,
+ "learning_rate": 1.9171717171717175e-06,
+ "loss": 1.3181350231170654,
+ "mean_token_accuracy": 0.6904616355895996,
+ "num_tokens": 25018368.0,
+ "step": 1527
+ },
+ {
+ "entropy": 1.2383761405944824,
+ "epoch": 3.0868686868686868,
+ "grad_norm": 2.1377766132354736,
+ "learning_rate": 1.9151515151515154e-06,
+ "loss": 1.2224464416503906,
+ "mean_token_accuracy": 0.7129335403442383,
+ "num_tokens": 25034752.0,
+ "step": 1528
+ },
+ {
+ "entropy": 1.6698395013809204,
+ "epoch": 3.088888888888889,
+ "grad_norm": 2.354219913482666,
+ "learning_rate": 1.9131313131313133e-06,
+ "loss": 1.67041015625,
+ "mean_token_accuracy": 0.6486932039260864,
+ "num_tokens": 25051136.0,
+ "step": 1529
+ },
+ {
+ "entropy": 1.1346160173416138,
+ "epoch": 3.090909090909091,
+ "grad_norm": 2.0619447231292725,
+ "learning_rate": 1.9111111111111112e-06,
+ "loss": 1.1436500549316406,
+ "mean_token_accuracy": 0.721177339553833,
+ "num_tokens": 25067520.0,
+ "step": 1530
+ },
+ {
+ "entropy": 1.4769412279129028,
+ "epoch": 3.092929292929293,
+ "grad_norm": 2.272189140319824,
+ "learning_rate": 1.9090909090909095e-06,
+ "loss": 1.4578258991241455,
+ "mean_token_accuracy": 0.6602955460548401,
+ "num_tokens": 25083904.0,
+ "step": 1531
+ },
+ {
+ "entropy": 1.3661279678344727,
+ "epoch": 3.094949494949495,
+ "grad_norm": 2.381265878677368,
+ "learning_rate": 1.9070707070707072e-06,
+ "loss": 1.3745051622390747,
+ "mean_token_accuracy": 0.6734245419502258,
+ "num_tokens": 25100288.0,
+ "step": 1532
+ },
+ {
+ "entropy": 1.0367696285247803,
+ "epoch": 3.096969696969697,
+ "grad_norm": 2.337775707244873,
+ "learning_rate": 1.9050505050505053e-06,
+ "loss": 1.0290615558624268,
+ "mean_token_accuracy": 0.7355275750160217,
+ "num_tokens": 25116672.0,
+ "step": 1533
+ },
+ {
+ "entropy": 0.9273203015327454,
+ "epoch": 3.098989898989899,
+ "grad_norm": 2.0960872173309326,
+ "learning_rate": 1.9030303030303032e-06,
+ "loss": 0.9162085056304932,
+ "mean_token_accuracy": 0.7639839053153992,
+ "num_tokens": 25133056.0,
+ "step": 1534
+ },
+ {
+ "entropy": 1.018664002418518,
+ "epoch": 3.101010101010101,
+ "grad_norm": 2.243028163909912,
+ "learning_rate": 1.9010101010101013e-06,
+ "loss": 1.019313097000122,
+ "mean_token_accuracy": 0.7399242520332336,
+ "num_tokens": 25149440.0,
+ "step": 1535
+ },
+ {
+ "entropy": 1.3178181648254395,
+ "epoch": 3.103030303030303,
+ "grad_norm": 2.305586338043213,
+ "learning_rate": 1.8989898989898992e-06,
+ "loss": 1.3278884887695312,
+ "mean_token_accuracy": 0.6838055849075317,
+ "num_tokens": 25165824.0,
+ "step": 1536
+ },
+ {
+ "entropy": 1.0808820724487305,
+ "epoch": 3.105050505050505,
+ "grad_norm": 2.2185559272766113,
+ "learning_rate": 1.896969696969697e-06,
+ "loss": 1.0852123498916626,
+ "mean_token_accuracy": 0.7187347412109375,
+ "num_tokens": 25182208.0,
+ "step": 1537
+ },
+ {
+ "entropy": 1.1828639507293701,
+ "epoch": 3.107070707070707,
+ "grad_norm": 2.5469112396240234,
+ "learning_rate": 1.8949494949494952e-06,
+ "loss": 1.1897902488708496,
+ "mean_token_accuracy": 0.697239875793457,
+ "num_tokens": 25198592.0,
+ "step": 1538
+ },
+ {
+ "entropy": 1.3447293043136597,
+ "epoch": 3.109090909090909,
+ "grad_norm": 2.2092692852020264,
+ "learning_rate": 1.892929292929293e-06,
+ "loss": 1.3312615156173706,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 25214976.0,
+ "step": 1539
+ },
+ {
+ "entropy": 1.392472743988037,
+ "epoch": 3.111111111111111,
+ "grad_norm": 2.3445911407470703,
+ "learning_rate": 1.890909090909091e-06,
+ "loss": 1.3892791271209717,
+ "mean_token_accuracy": 0.6742794513702393,
+ "num_tokens": 25231360.0,
+ "step": 1540
+ },
+ {
+ "entropy": 1.422629475593567,
+ "epoch": 3.113131313131313,
+ "grad_norm": 2.4753165245056152,
+ "learning_rate": 1.888888888888889e-06,
+ "loss": 1.432596206665039,
+ "mean_token_accuracy": 0.6670126914978027,
+ "num_tokens": 25247744.0,
+ "step": 1541
+ },
+ {
+ "entropy": 1.5371577739715576,
+ "epoch": 3.1151515151515152,
+ "grad_norm": 2.3083088397979736,
+ "learning_rate": 1.886868686868687e-06,
+ "loss": 1.5318076610565186,
+ "mean_token_accuracy": 0.6301905512809753,
+ "num_tokens": 25264128.0,
+ "step": 1542
+ },
+ {
+ "entropy": 1.1179860830307007,
+ "epoch": 3.117171717171717,
+ "grad_norm": 2.1037089824676514,
+ "learning_rate": 1.884848484848485e-06,
+ "loss": 1.123746395111084,
+ "mean_token_accuracy": 0.7327185869216919,
+ "num_tokens": 25280512.0,
+ "step": 1543
+ },
+ {
+ "entropy": 1.046632170677185,
+ "epoch": 3.1191919191919193,
+ "grad_norm": 2.267493963241577,
+ "learning_rate": 1.882828282828283e-06,
+ "loss": 1.027912974357605,
+ "mean_token_accuracy": 0.7275280952453613,
+ "num_tokens": 25296896.0,
+ "step": 1544
+ },
+ {
+ "entropy": 1.2848094701766968,
+ "epoch": 3.121212121212121,
+ "grad_norm": 2.1797454357147217,
+ "learning_rate": 1.8808080808080808e-06,
+ "loss": 1.3054044246673584,
+ "mean_token_accuracy": 0.7058500051498413,
+ "num_tokens": 25313280.0,
+ "step": 1545
+ },
+ {
+ "entropy": 1.132463812828064,
+ "epoch": 3.1232323232323234,
+ "grad_norm": 2.2171123027801514,
+ "learning_rate": 1.878787878787879e-06,
+ "loss": 1.1395090818405151,
+ "mean_token_accuracy": 0.7204445600509644,
+ "num_tokens": 25329664.0,
+ "step": 1546
+ },
+ {
+ "entropy": 1.084518551826477,
+ "epoch": 3.125252525252525,
+ "grad_norm": 2.2163641452789307,
+ "learning_rate": 1.8767676767676768e-06,
+ "loss": 1.093268871307373,
+ "mean_token_accuracy": 0.7297264337539673,
+ "num_tokens": 25346048.0,
+ "step": 1547
+ },
+ {
+ "entropy": 1.1031688451766968,
+ "epoch": 3.1272727272727274,
+ "grad_norm": 2.3715343475341797,
+ "learning_rate": 1.874747474747475e-06,
+ "loss": 1.1064910888671875,
+ "mean_token_accuracy": 0.7130556702613831,
+ "num_tokens": 25362432.0,
+ "step": 1548
+ },
+ {
+ "entropy": 1.515089988708496,
+ "epoch": 3.1292929292929292,
+ "grad_norm": 2.0995519161224365,
+ "learning_rate": 1.872727272727273e-06,
+ "loss": 1.5236327648162842,
+ "mean_token_accuracy": 0.6491206884384155,
+ "num_tokens": 25378816.0,
+ "step": 1549
+ },
+ {
+ "entropy": 1.26030695438385,
+ "epoch": 3.1313131313131315,
+ "grad_norm": 2.2167913913726807,
+ "learning_rate": 1.8707070707070709e-06,
+ "loss": 1.2750146389007568,
+ "mean_token_accuracy": 0.6991939544677734,
+ "num_tokens": 25395200.0,
+ "step": 1550
+ },
+ {
+ "epoch": 3.1313131313131315,
+ "eval_entropy": 1.3187109231948853,
+ "eval_loss": 1.5490814447402954,
+ "eval_mean_token_accuracy": 0.6446880385760339,
+ "eval_num_tokens": 25395200.0,
+ "eval_runtime": 43.7612,
+ "eval_samples_per_second": 22.623,
+ "eval_steps_per_second": 2.834,
+ "step": 1550
+ },
+ {
+ "entropy": 1.044468641281128,
+ "epoch": 3.1333333333333333,
+ "grad_norm": 2.189656972885132,
+ "learning_rate": 1.868686868686869e-06,
+ "loss": 1.035596251487732,
+ "mean_token_accuracy": 0.7405959963798523,
+ "num_tokens": 25411584.0,
+ "step": 1551
+ },
+ {
+ "entropy": 1.286029577255249,
+ "epoch": 3.1353535353535356,
+ "grad_norm": 2.3911969661712646,
+ "learning_rate": 1.8666666666666669e-06,
+ "loss": 1.287235975265503,
+ "mean_token_accuracy": 0.6918661594390869,
+ "num_tokens": 25427968.0,
+ "step": 1552
+ },
+ {
+ "entropy": 1.4401317834854126,
+ "epoch": 3.1373737373737374,
+ "grad_norm": 2.452929973602295,
+ "learning_rate": 1.864646464646465e-06,
+ "loss": 1.4605298042297363,
+ "mean_token_accuracy": 0.6466169953346252,
+ "num_tokens": 25444352.0,
+ "step": 1553
+ },
+ {
+ "entropy": 1.316934585571289,
+ "epoch": 3.1393939393939396,
+ "grad_norm": 2.4121034145355225,
+ "learning_rate": 1.8626262626262629e-06,
+ "loss": 1.3266665935516357,
+ "mean_token_accuracy": 0.6759892702102661,
+ "num_tokens": 25460736.0,
+ "step": 1554
+ },
+ {
+ "entropy": 1.2644363641738892,
+ "epoch": 3.1414141414141414,
+ "grad_norm": 2.2631289958953857,
+ "learning_rate": 1.8606060606060607e-06,
+ "loss": 1.2905628681182861,
+ "mean_token_accuracy": 0.6833170652389526,
+ "num_tokens": 25477120.0,
+ "step": 1555
+ },
+ {
+ "entropy": 1.3172475099563599,
+ "epoch": 3.1434343434343432,
+ "grad_norm": 2.357954502105713,
+ "learning_rate": 1.8585858585858588e-06,
+ "loss": 1.316823124885559,
+ "mean_token_accuracy": 0.6763556599617004,
+ "num_tokens": 25493504.0,
+ "step": 1556
+ },
+ {
+ "entropy": 1.392463207244873,
+ "epoch": 3.1454545454545455,
+ "grad_norm": 2.491037130355835,
+ "learning_rate": 1.8565656565656567e-06,
+ "loss": 1.3718677759170532,
+ "mean_token_accuracy": 0.6508915424346924,
+ "num_tokens": 25509888.0,
+ "step": 1557
+ },
+ {
+ "entropy": 1.3607147932052612,
+ "epoch": 3.1474747474747473,
+ "grad_norm": 2.306100845336914,
+ "learning_rate": 1.8545454545454546e-06,
+ "loss": 1.3523163795471191,
+ "mean_token_accuracy": 0.6557157039642334,
+ "num_tokens": 25526272.0,
+ "step": 1558
+ },
+ {
+ "entropy": 0.9888757467269897,
+ "epoch": 3.1494949494949496,
+ "grad_norm": 2.125560998916626,
+ "learning_rate": 1.8525252525252527e-06,
+ "loss": 0.9713444709777832,
+ "mean_token_accuracy": 0.7584269642829895,
+ "num_tokens": 25542656.0,
+ "step": 1559
+ },
+ {
+ "entropy": 1.286476492881775,
+ "epoch": 3.1515151515151514,
+ "grad_norm": 2.149113416671753,
+ "learning_rate": 1.8505050505050506e-06,
+ "loss": 1.2688651084899902,
+ "mean_token_accuracy": 0.6882022619247437,
+ "num_tokens": 25559040.0,
+ "step": 1560
+ },
+ {
+ "entropy": 0.9255673289299011,
+ "epoch": 3.1535353535353536,
+ "grad_norm": 2.1615419387817383,
+ "learning_rate": 1.8484848484848487e-06,
+ "loss": 0.9265275597572327,
+ "mean_token_accuracy": 0.7542135119438171,
+ "num_tokens": 25575424.0,
+ "step": 1561
+ },
+ {
+ "entropy": 1.4960277080535889,
+ "epoch": 3.1555555555555554,
+ "grad_norm": 2.183372974395752,
+ "learning_rate": 1.8464646464646466e-06,
+ "loss": 1.4737393856048584,
+ "mean_token_accuracy": 0.6516854166984558,
+ "num_tokens": 25591808.0,
+ "step": 1562
+ },
+ {
+ "entropy": 1.2294487953186035,
+ "epoch": 3.1575757575757577,
+ "grad_norm": 2.389885425567627,
+ "learning_rate": 1.8444444444444445e-06,
+ "loss": 1.210254192352295,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 25608192.0,
+ "step": 1563
+ },
+ {
+ "entropy": 1.0153220891952515,
+ "epoch": 3.1595959595959595,
+ "grad_norm": 2.131989002227783,
+ "learning_rate": 1.8424242424242426e-06,
+ "loss": 1.0005543231964111,
+ "mean_token_accuracy": 0.7426722049713135,
+ "num_tokens": 25624576.0,
+ "step": 1564
+ },
+ {
+ "entropy": 1.2591265439987183,
+ "epoch": 3.1616161616161618,
+ "grad_norm": 2.150913715362549,
+ "learning_rate": 1.8404040404040405e-06,
+ "loss": 1.2284668684005737,
+ "mean_token_accuracy": 0.6993771195411682,
+ "num_tokens": 25640960.0,
+ "step": 1565
+ },
+ {
+ "entropy": 1.009209394454956,
+ "epoch": 3.1636363636363636,
+ "grad_norm": 2.090205192565918,
+ "learning_rate": 1.8383838383838384e-06,
+ "loss": 0.9917510747909546,
+ "mean_token_accuracy": 0.7412066459655762,
+ "num_tokens": 25657344.0,
+ "step": 1566
+ },
+ {
+ "entropy": 1.716966986656189,
+ "epoch": 3.165656565656566,
+ "grad_norm": 2.2880618572235107,
+ "learning_rate": 1.8363636363636365e-06,
+ "loss": 1.7331494092941284,
+ "mean_token_accuracy": 0.6106497049331665,
+ "num_tokens": 25673728.0,
+ "step": 1567
+ },
+ {
+ "entropy": 1.5511447191238403,
+ "epoch": 3.1676767676767676,
+ "grad_norm": 2.371710777282715,
+ "learning_rate": 1.8343434343434343e-06,
+ "loss": 1.5570940971374512,
+ "mean_token_accuracy": 0.6477161645889282,
+ "num_tokens": 25690112.0,
+ "step": 1568
+ },
+ {
+ "entropy": 1.325405240058899,
+ "epoch": 3.16969696969697,
+ "grad_norm": 2.3747830390930176,
+ "learning_rate": 1.8323232323232324e-06,
+ "loss": 1.3260624408721924,
+ "mean_token_accuracy": 0.6791035532951355,
+ "num_tokens": 25706496.0,
+ "step": 1569
+ },
+ {
+ "entropy": 1.2529335021972656,
+ "epoch": 3.1717171717171717,
+ "grad_norm": 2.162775754928589,
+ "learning_rate": 1.8303030303030305e-06,
+ "loss": 1.257356882095337,
+ "mean_token_accuracy": 0.7066438794136047,
+ "num_tokens": 25722880.0,
+ "step": 1570
+ },
+ {
+ "entropy": 1.116769790649414,
+ "epoch": 3.1737373737373735,
+ "grad_norm": 2.217358350753784,
+ "learning_rate": 1.8282828282828286e-06,
+ "loss": 1.1458317041397095,
+ "mean_token_accuracy": 0.7087811231613159,
+ "num_tokens": 25739264.0,
+ "step": 1571
+ },
+ {
+ "entropy": 1.3465793132781982,
+ "epoch": 3.175757575757576,
+ "grad_norm": 2.225062370300293,
+ "learning_rate": 1.8262626262626265e-06,
+ "loss": 1.380183219909668,
+ "mean_token_accuracy": 0.6872862577438354,
+ "num_tokens": 25755648.0,
+ "step": 1572
+ },
+ {
+ "entropy": 1.237407922744751,
+ "epoch": 3.1777777777777776,
+ "grad_norm": 2.31829833984375,
+ "learning_rate": 1.8242424242424244e-06,
+ "loss": 1.247010588645935,
+ "mean_token_accuracy": 0.7034074068069458,
+ "num_tokens": 25772032.0,
+ "step": 1573
+ },
+ {
+ "entropy": 1.3967171907424927,
+ "epoch": 3.17979797979798,
+ "grad_norm": 2.4075193405151367,
+ "learning_rate": 1.8222222222222225e-06,
+ "loss": 1.4189220666885376,
+ "mean_token_accuracy": 0.6609672904014587,
+ "num_tokens": 25788416.0,
+ "step": 1574
+ },
+ {
+ "entropy": 1.4262871742248535,
+ "epoch": 3.1818181818181817,
+ "grad_norm": 2.507885217666626,
+ "learning_rate": 1.8202020202020204e-06,
+ "loss": 1.4657065868377686,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 25804800.0,
+ "step": 1575
+ },
+ {
+ "entropy": 1.1763924360275269,
+ "epoch": 3.183838383838384,
+ "grad_norm": 2.179891586303711,
+ "learning_rate": 1.8181818181818183e-06,
+ "loss": 1.1837804317474365,
+ "mean_token_accuracy": 0.7209941148757935,
+ "num_tokens": 25821184.0,
+ "step": 1576
+ },
+ {
+ "entropy": 1.119240403175354,
+ "epoch": 3.1858585858585857,
+ "grad_norm": 2.300708532333374,
+ "learning_rate": 1.8161616161616164e-06,
+ "loss": 1.1251145601272583,
+ "mean_token_accuracy": 0.7134220600128174,
+ "num_tokens": 25837568.0,
+ "step": 1577
+ },
+ {
+ "entropy": 1.3045564889907837,
+ "epoch": 3.187878787878788,
+ "grad_norm": 2.2904021739959717,
+ "learning_rate": 1.8141414141414143e-06,
+ "loss": 1.3114243745803833,
+ "mean_token_accuracy": 0.691316545009613,
+ "num_tokens": 25853952.0,
+ "step": 1578
+ },
+ {
+ "entropy": 1.0507739782333374,
+ "epoch": 3.18989898989899,
+ "grad_norm": 2.0942912101745605,
+ "learning_rate": 1.8121212121212124e-06,
+ "loss": 1.043527364730835,
+ "mean_token_accuracy": 0.7244748473167419,
+ "num_tokens": 25870336.0,
+ "step": 1579
+ },
+ {
+ "entropy": 1.2050808668136597,
+ "epoch": 3.191919191919192,
+ "grad_norm": 2.131643295288086,
+ "learning_rate": 1.8101010101010103e-06,
+ "loss": 1.1917791366577148,
+ "mean_token_accuracy": 0.7046898007392883,
+ "num_tokens": 25886720.0,
+ "step": 1580
+ },
+ {
+ "entropy": 1.3607940673828125,
+ "epoch": 3.193939393939394,
+ "grad_norm": 2.2744040489196777,
+ "learning_rate": 1.8080808080808082e-06,
+ "loss": 1.347360610961914,
+ "mean_token_accuracy": 0.6780043840408325,
+ "num_tokens": 25903104.0,
+ "step": 1581
+ },
+ {
+ "entropy": 1.4996237754821777,
+ "epoch": 3.195959595959596,
+ "grad_norm": 2.3050780296325684,
+ "learning_rate": 1.8060606060606063e-06,
+ "loss": 1.5023889541625977,
+ "mean_token_accuracy": 0.6423424482345581,
+ "num_tokens": 25919488.0,
+ "step": 1582
+ },
+ {
+ "entropy": 1.1950902938842773,
+ "epoch": 3.197979797979798,
+ "grad_norm": 2.408799648284912,
+ "learning_rate": 1.8040404040404041e-06,
+ "loss": 1.1868454217910767,
+ "mean_token_accuracy": 0.6998046040534973,
+ "num_tokens": 25935872.0,
+ "step": 1583
+ },
+ {
+ "entropy": 1.5395914316177368,
+ "epoch": 3.2,
+ "grad_norm": 2.4104502201080322,
+ "learning_rate": 1.802020202020202e-06,
+ "loss": 1.5414860248565674,
+ "mean_token_accuracy": 0.6382511258125305,
+ "num_tokens": 25952256.0,
+ "step": 1584
+ },
+ {
+ "entropy": 1.0701062679290771,
+ "epoch": 3.202020202020202,
+ "grad_norm": 2.2250685691833496,
+ "learning_rate": 1.8000000000000001e-06,
+ "loss": 1.0787923336029053,
+ "mean_token_accuracy": 0.7307645082473755,
+ "num_tokens": 25968640.0,
+ "step": 1585
+ },
+ {
+ "entropy": 1.0968927145004272,
+ "epoch": 3.2040404040404042,
+ "grad_norm": 2.3169026374816895,
+ "learning_rate": 1.797979797979798e-06,
+ "loss": 1.1023577451705933,
+ "mean_token_accuracy": 0.7217879891395569,
+ "num_tokens": 25985024.0,
+ "step": 1586
+ },
+ {
+ "entropy": 1.0547802448272705,
+ "epoch": 3.206060606060606,
+ "grad_norm": 2.1187734603881836,
+ "learning_rate": 1.7959595959595961e-06,
+ "loss": 1.0536352396011353,
+ "mean_token_accuracy": 0.733146071434021,
+ "num_tokens": 26001408.0,
+ "step": 1587
+ },
+ {
+ "entropy": 1.821456789970398,
+ "epoch": 3.2080808080808083,
+ "grad_norm": 2.2364695072174072,
+ "learning_rate": 1.793939393939394e-06,
+ "loss": 1.8386787176132202,
+ "mean_token_accuracy": 0.5963605046272278,
+ "num_tokens": 26017792.0,
+ "step": 1588
+ },
+ {
+ "entropy": 1.5173720121383667,
+ "epoch": 3.21010101010101,
+ "grad_norm": 2.2785775661468506,
+ "learning_rate": 1.7919191919191919e-06,
+ "loss": 1.5099977254867554,
+ "mean_token_accuracy": 0.6417317986488342,
+ "num_tokens": 26034176.0,
+ "step": 1589
+ },
+ {
+ "entropy": 1.5751056671142578,
+ "epoch": 3.212121212121212,
+ "grad_norm": 2.2048606872558594,
+ "learning_rate": 1.78989898989899e-06,
+ "loss": 1.5845966339111328,
+ "mean_token_accuracy": 0.633671224117279,
+ "num_tokens": 26050560.0,
+ "step": 1590
+ },
+ {
+ "entropy": 1.3307859897613525,
+ "epoch": 3.214141414141414,
+ "grad_norm": 2.310291051864624,
+ "learning_rate": 1.787878787878788e-06,
+ "loss": 1.3058912754058838,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 26066944.0,
+ "step": 1591
+ },
+ {
+ "entropy": 0.9954612255096436,
+ "epoch": 3.216161616161616,
+ "grad_norm": 2.1447651386260986,
+ "learning_rate": 1.7858585858585862e-06,
+ "loss": 0.975112795829773,
+ "mean_token_accuracy": 0.7406570315361023,
+ "num_tokens": 26083328.0,
+ "step": 1592
+ },
+ {
+ "entropy": 1.1513571739196777,
+ "epoch": 3.2181818181818183,
+ "grad_norm": 2.3595945835113525,
+ "learning_rate": 1.783838383838384e-06,
+ "loss": 1.1416239738464355,
+ "mean_token_accuracy": 0.7137274146080017,
+ "num_tokens": 26099712.0,
+ "step": 1593
+ },
+ {
+ "entropy": 0.9992931485176086,
+ "epoch": 3.22020202020202,
+ "grad_norm": 2.1605300903320312,
+ "learning_rate": 1.781818181818182e-06,
+ "loss": 1.0023880004882812,
+ "mean_token_accuracy": 0.738092303276062,
+ "num_tokens": 26116096.0,
+ "step": 1594
+ },
+ {
+ "entropy": 1.6680811643600464,
+ "epoch": 3.2222222222222223,
+ "grad_norm": 2.3036210536956787,
+ "learning_rate": 1.77979797979798e-06,
+ "loss": 1.7154381275177002,
+ "mean_token_accuracy": 0.6182217597961426,
+ "num_tokens": 26132480.0,
+ "step": 1595
+ },
+ {
+ "entropy": 1.113036036491394,
+ "epoch": 3.224242424242424,
+ "grad_norm": 2.3098108768463135,
+ "learning_rate": 1.777777777777778e-06,
+ "loss": 1.1006368398666382,
+ "mean_token_accuracy": 0.7120175957679749,
+ "num_tokens": 26148864.0,
+ "step": 1596
+ },
+ {
+ "entropy": 1.0055886507034302,
+ "epoch": 3.2262626262626264,
+ "grad_norm": 2.3227128982543945,
+ "learning_rate": 1.775757575757576e-06,
+ "loss": 1.0274525880813599,
+ "mean_token_accuracy": 0.7253297567367554,
+ "num_tokens": 26165248.0,
+ "step": 1597
+ },
+ {
+ "entropy": 1.139039397239685,
+ "epoch": 3.228282828282828,
+ "grad_norm": 2.415011405944824,
+ "learning_rate": 1.773737373737374e-06,
+ "loss": 1.1494395732879639,
+ "mean_token_accuracy": 0.7061553597450256,
+ "num_tokens": 26181632.0,
+ "step": 1598
+ },
+ {
+ "entropy": 1.1573477983474731,
+ "epoch": 3.2303030303030305,
+ "grad_norm": 2.2666749954223633,
+ "learning_rate": 1.7717171717171718e-06,
+ "loss": 1.1615169048309326,
+ "mean_token_accuracy": 0.7168416976928711,
+ "num_tokens": 26198016.0,
+ "step": 1599
+ },
+ {
+ "entropy": 1.1301828622817993,
+ "epoch": 3.2323232323232323,
+ "grad_norm": 2.345222234725952,
+ "learning_rate": 1.76969696969697e-06,
+ "loss": 1.1062344312667847,
+ "mean_token_accuracy": 0.7164753079414368,
+ "num_tokens": 26214400.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.2323232323232323,
+ "eval_entropy": 1.3245953331070561,
+ "eval_loss": 1.5489962100982666,
+ "eval_mean_token_accuracy": 0.644533898080549,
+ "eval_num_tokens": 26214400.0,
+ "eval_runtime": 43.7619,
+ "eval_samples_per_second": 22.622,
+ "eval_steps_per_second": 2.834,
+ "step": 1600
+ },
+ {
+ "entropy": 1.4168665409088135,
+ "epoch": 3.2343434343434345,
+ "grad_norm": 2.3160741329193115,
+ "learning_rate": 1.7676767676767678e-06,
+ "loss": 1.403707504272461,
+ "mean_token_accuracy": 0.6696385145187378,
+ "num_tokens": 26230784.0,
+ "step": 1601
+ },
+ {
+ "entropy": 1.4689940214157104,
+ "epoch": 3.2363636363636363,
+ "grad_norm": 2.1691131591796875,
+ "learning_rate": 1.7656565656565657e-06,
+ "loss": 1.463477611541748,
+ "mean_token_accuracy": 0.6482046842575073,
+ "num_tokens": 26247168.0,
+ "step": 1602
+ },
+ {
+ "entropy": 1.2312567234039307,
+ "epoch": 3.2383838383838386,
+ "grad_norm": 2.4240810871124268,
+ "learning_rate": 1.7636363636363638e-06,
+ "loss": 1.2253142595291138,
+ "mean_token_accuracy": 0.6933317184448242,
+ "num_tokens": 26263552.0,
+ "step": 1603
+ },
+ {
+ "entropy": 1.5346348285675049,
+ "epoch": 3.2404040404040404,
+ "grad_norm": 2.417025566101074,
+ "learning_rate": 1.7616161616161617e-06,
+ "loss": 1.5418915748596191,
+ "mean_token_accuracy": 0.6389228105545044,
+ "num_tokens": 26279936.0,
+ "step": 1604
+ },
+ {
+ "entropy": 1.4432504177093506,
+ "epoch": 3.242424242424242,
+ "grad_norm": 2.2379117012023926,
+ "learning_rate": 1.7595959595959598e-06,
+ "loss": 1.4543676376342773,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 26296320.0,
+ "step": 1605
+ },
+ {
+ "entropy": 1.54794442653656,
+ "epoch": 3.2444444444444445,
+ "grad_norm": 2.293386936187744,
+ "learning_rate": 1.7575757575757577e-06,
+ "loss": 1.525251865386963,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 26312704.0,
+ "step": 1606
+ },
+ {
+ "entropy": 1.3418866395950317,
+ "epoch": 3.2464646464646463,
+ "grad_norm": 2.143143892288208,
+ "learning_rate": 1.7555555555555556e-06,
+ "loss": 1.3268392086029053,
+ "mean_token_accuracy": 0.6758060455322266,
+ "num_tokens": 26329088.0,
+ "step": 1607
+ },
+ {
+ "entropy": 1.3032151460647583,
+ "epoch": 3.2484848484848485,
+ "grad_norm": 2.0813350677490234,
+ "learning_rate": 1.7535353535353537e-06,
+ "loss": 1.3105076551437378,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 26345472.0,
+ "step": 1608
+ },
+ {
+ "entropy": 1.258314847946167,
+ "epoch": 3.2505050505050503,
+ "grad_norm": 2.346703052520752,
+ "learning_rate": 1.7515151515151516e-06,
+ "loss": 1.2453927993774414,
+ "mean_token_accuracy": 0.6931484937667847,
+ "num_tokens": 26361856.0,
+ "step": 1609
+ },
+ {
+ "entropy": 1.1887613534927368,
+ "epoch": 3.2525252525252526,
+ "grad_norm": 2.2838189601898193,
+ "learning_rate": 1.7494949494949494e-06,
+ "loss": 1.2008028030395508,
+ "mean_token_accuracy": 0.7044455409049988,
+ "num_tokens": 26378240.0,
+ "step": 1610
+ },
+ {
+ "entropy": 1.2221968173980713,
+ "epoch": 3.2545454545454544,
+ "grad_norm": 2.201186418533325,
+ "learning_rate": 1.7474747474747475e-06,
+ "loss": 1.2126820087432861,
+ "mean_token_accuracy": 0.6948583126068115,
+ "num_tokens": 26394624.0,
+ "step": 1611
+ },
+ {
+ "entropy": 1.3306292295455933,
+ "epoch": 3.2565656565656567,
+ "grad_norm": 2.1501541137695312,
+ "learning_rate": 1.7454545454545456e-06,
+ "loss": 1.3301104307174683,
+ "mean_token_accuracy": 0.6844772696495056,
+ "num_tokens": 26411008.0,
+ "step": 1612
+ },
+ {
+ "entropy": 1.0881599187850952,
+ "epoch": 3.2585858585858585,
+ "grad_norm": 2.092081069946289,
+ "learning_rate": 1.7434343434343437e-06,
+ "loss": 1.0868645906448364,
+ "mean_token_accuracy": 0.7172691822052002,
+ "num_tokens": 26427392.0,
+ "step": 1613
+ },
+ {
+ "entropy": 1.1937274932861328,
+ "epoch": 3.2606060606060607,
+ "grad_norm": 2.563627243041992,
+ "learning_rate": 1.7414141414141416e-06,
+ "loss": 1.1793221235275269,
+ "mean_token_accuracy": 0.7015144228935242,
+ "num_tokens": 26443776.0,
+ "step": 1614
+ },
+ {
+ "entropy": 1.1501706838607788,
+ "epoch": 3.2626262626262625,
+ "grad_norm": 2.2964398860931396,
+ "learning_rate": 1.7393939393939397e-06,
+ "loss": 1.1438164710998535,
+ "mean_token_accuracy": 0.7105520367622375,
+ "num_tokens": 26460160.0,
+ "step": 1615
+ },
+ {
+ "entropy": 1.276473045349121,
+ "epoch": 3.264646464646465,
+ "grad_norm": 2.4301693439483643,
+ "learning_rate": 1.7373737373737376e-06,
+ "loss": 1.2897876501083374,
+ "mean_token_accuracy": 0.6933927536010742,
+ "num_tokens": 26476544.0,
+ "step": 1616
+ },
+ {
+ "entropy": 1.1926265954971313,
+ "epoch": 3.2666666666666666,
+ "grad_norm": 2.1503496170043945,
+ "learning_rate": 1.7353535353535355e-06,
+ "loss": 1.1882628202438354,
+ "mean_token_accuracy": 0.7013922929763794,
+ "num_tokens": 26492928.0,
+ "step": 1617
+ },
+ {
+ "entropy": 1.2843140363693237,
+ "epoch": 3.268686868686869,
+ "grad_norm": 2.312652587890625,
+ "learning_rate": 1.7333333333333336e-06,
+ "loss": 1.3045732975006104,
+ "mean_token_accuracy": 0.6849047541618347,
+ "num_tokens": 26509312.0,
+ "step": 1618
+ },
+ {
+ "entropy": 1.0693352222442627,
+ "epoch": 3.2707070707070707,
+ "grad_norm": 2.2860965728759766,
+ "learning_rate": 1.7313131313131315e-06,
+ "loss": 1.044942855834961,
+ "mean_token_accuracy": 0.72832190990448,
+ "num_tokens": 26525696.0,
+ "step": 1619
+ },
+ {
+ "entropy": 1.5462334156036377,
+ "epoch": 3.2727272727272725,
+ "grad_norm": 2.395378589630127,
+ "learning_rate": 1.7292929292929294e-06,
+ "loss": 1.5529801845550537,
+ "mean_token_accuracy": 0.6301294565200806,
+ "num_tokens": 26542080.0,
+ "step": 1620
+ },
+ {
+ "entropy": 1.0582746267318726,
+ "epoch": 3.2747474747474747,
+ "grad_norm": 2.198370933532715,
+ "learning_rate": 1.7272727272727275e-06,
+ "loss": 1.0674792528152466,
+ "mean_token_accuracy": 0.7289936542510986,
+ "num_tokens": 26558464.0,
+ "step": 1621
+ },
+ {
+ "entropy": 1.133894920349121,
+ "epoch": 3.276767676767677,
+ "grad_norm": 2.2087979316711426,
+ "learning_rate": 1.7252525252525254e-06,
+ "loss": 1.1322801113128662,
+ "mean_token_accuracy": 0.7148876190185547,
+ "num_tokens": 26574848.0,
+ "step": 1622
+ },
+ {
+ "entropy": 1.0465091466903687,
+ "epoch": 3.278787878787879,
+ "grad_norm": 2.4500746726989746,
+ "learning_rate": 1.7232323232323235e-06,
+ "loss": 1.042628526687622,
+ "mean_token_accuracy": 0.72832190990448,
+ "num_tokens": 26591232.0,
+ "step": 1623
+ },
+ {
+ "entropy": 1.3930310010910034,
+ "epoch": 3.2808080808080806,
+ "grad_norm": 2.2968733310699463,
+ "learning_rate": 1.7212121212121214e-06,
+ "loss": 1.3903234004974365,
+ "mean_token_accuracy": 0.6658524870872498,
+ "num_tokens": 26607616.0,
+ "step": 1624
+ },
+ {
+ "entropy": 1.4873614311218262,
+ "epoch": 3.282828282828283,
+ "grad_norm": 2.404604434967041,
+ "learning_rate": 1.7191919191919192e-06,
+ "loss": 1.4828845262527466,
+ "mean_token_accuracy": 0.6601123809814453,
+ "num_tokens": 26624000.0,
+ "step": 1625
+ },
+ {
+ "entropy": 1.4326503276824951,
+ "epoch": 3.2848484848484847,
+ "grad_norm": 2.3051655292510986,
+ "learning_rate": 1.7171717171717173e-06,
+ "loss": 1.4187182188034058,
+ "mean_token_accuracy": 0.6783097386360168,
+ "num_tokens": 26640384.0,
+ "step": 1626
+ },
+ {
+ "entropy": 1.067203402519226,
+ "epoch": 3.286868686868687,
+ "grad_norm": 2.1361143589019775,
+ "learning_rate": 1.7151515151515152e-06,
+ "loss": 1.0571379661560059,
+ "mean_token_accuracy": 0.7386419177055359,
+ "num_tokens": 26656768.0,
+ "step": 1627
+ },
+ {
+ "entropy": 0.9872021675109863,
+ "epoch": 3.2888888888888888,
+ "grad_norm": 2.084920883178711,
+ "learning_rate": 1.7131313131313131e-06,
+ "loss": 0.9779852628707886,
+ "mean_token_accuracy": 0.7591597437858582,
+ "num_tokens": 26673152.0,
+ "step": 1628
+ },
+ {
+ "entropy": 1.261454701423645,
+ "epoch": 3.290909090909091,
+ "grad_norm": 2.2008469104766846,
+ "learning_rate": 1.7111111111111112e-06,
+ "loss": 1.2701423168182373,
+ "mean_token_accuracy": 0.6892403364181519,
+ "num_tokens": 26689536.0,
+ "step": 1629
+ },
+ {
+ "entropy": 1.6490918397903442,
+ "epoch": 3.292929292929293,
+ "grad_norm": 2.2967329025268555,
+ "learning_rate": 1.7090909090909091e-06,
+ "loss": 1.6521049737930298,
+ "mean_token_accuracy": 0.6223741769790649,
+ "num_tokens": 26705920.0,
+ "step": 1630
+ },
+ {
+ "entropy": 1.241626262664795,
+ "epoch": 3.294949494949495,
+ "grad_norm": 2.3993594646453857,
+ "learning_rate": 1.707070707070707e-06,
+ "loss": 1.2557122707366943,
+ "mean_token_accuracy": 0.6982169151306152,
+ "num_tokens": 26722304.0,
+ "step": 1631
+ },
+ {
+ "entropy": 1.2038613557815552,
+ "epoch": 3.296969696969697,
+ "grad_norm": 2.6470985412597656,
+ "learning_rate": 1.705050505050505e-06,
+ "loss": 1.220262885093689,
+ "mean_token_accuracy": 0.702186107635498,
+ "num_tokens": 26738688.0,
+ "step": 1632
+ },
+ {
+ "entropy": 1.0352909564971924,
+ "epoch": 3.298989898989899,
+ "grad_norm": 2.30973219871521,
+ "learning_rate": 1.703030303030303e-06,
+ "loss": 1.0416737794876099,
+ "mean_token_accuracy": 0.7299095988273621,
+ "num_tokens": 26755072.0,
+ "step": 1633
+ },
+ {
+ "entropy": 1.0178903341293335,
+ "epoch": 3.301010101010101,
+ "grad_norm": 2.3068888187408447,
+ "learning_rate": 1.7010101010101013e-06,
+ "loss": 1.021026849746704,
+ "mean_token_accuracy": 0.7370542287826538,
+ "num_tokens": 26771456.0,
+ "step": 1634
+ },
+ {
+ "entropy": 1.1840031147003174,
+ "epoch": 3.303030303030303,
+ "grad_norm": 2.1070966720581055,
+ "learning_rate": 1.6989898989898992e-06,
+ "loss": 1.191172480583191,
+ "mean_token_accuracy": 0.7166585326194763,
+ "num_tokens": 26787840.0,
+ "step": 1635
+ },
+ {
+ "entropy": 1.3296533823013306,
+ "epoch": 3.305050505050505,
+ "grad_norm": 2.4398109912872314,
+ "learning_rate": 1.6969696969696973e-06,
+ "loss": 1.338945984840393,
+ "mean_token_accuracy": 0.67666095495224,
+ "num_tokens": 26804224.0,
+ "step": 1636
+ },
+ {
+ "entropy": 1.1331745386123657,
+ "epoch": 3.3070707070707073,
+ "grad_norm": 2.103158473968506,
+ "learning_rate": 1.6949494949494952e-06,
+ "loss": 1.139038324356079,
+ "mean_token_accuracy": 0.7154372334480286,
+ "num_tokens": 26820608.0,
+ "step": 1637
+ },
+ {
+ "entropy": 1.3300442695617676,
+ "epoch": 3.309090909090909,
+ "grad_norm": 2.4576940536499023,
+ "learning_rate": 1.692929292929293e-06,
+ "loss": 1.3464535474777222,
+ "mean_token_accuracy": 0.6715925931930542,
+ "num_tokens": 26836992.0,
+ "step": 1638
+ },
+ {
+ "entropy": 1.5538347959518433,
+ "epoch": 3.311111111111111,
+ "grad_norm": 2.4972009658813477,
+ "learning_rate": 1.6909090909090912e-06,
+ "loss": 1.544262409210205,
+ "mean_token_accuracy": 0.6377015113830566,
+ "num_tokens": 26853376.0,
+ "step": 1639
+ },
+ {
+ "entropy": 1.2610400915145874,
+ "epoch": 3.313131313131313,
+ "grad_norm": 2.354304790496826,
+ "learning_rate": 1.688888888888889e-06,
+ "loss": 1.2615927457809448,
+ "mean_token_accuracy": 0.6805691123008728,
+ "num_tokens": 26869760.0,
+ "step": 1640
+ },
+ {
+ "entropy": 0.9232268333435059,
+ "epoch": 3.315151515151515,
+ "grad_norm": 2.2459871768951416,
+ "learning_rate": 1.6868686868686871e-06,
+ "loss": 0.9295459985733032,
+ "mean_token_accuracy": 0.7508549094200134,
+ "num_tokens": 26886144.0,
+ "step": 1641
+ },
+ {
+ "entropy": 1.3030803203582764,
+ "epoch": 3.317171717171717,
+ "grad_norm": 2.086177110671997,
+ "learning_rate": 1.684848484848485e-06,
+ "loss": 1.3260836601257324,
+ "mean_token_accuracy": 0.6850268840789795,
+ "num_tokens": 26902528.0,
+ "step": 1642
+ },
+ {
+ "entropy": 1.0115952491760254,
+ "epoch": 3.319191919191919,
+ "grad_norm": 2.3342647552490234,
+ "learning_rate": 1.682828282828283e-06,
+ "loss": 1.0125452280044556,
+ "mean_token_accuracy": 0.7252076268196106,
+ "num_tokens": 26918912.0,
+ "step": 1643
+ },
+ {
+ "entropy": 0.9997871518135071,
+ "epoch": 3.3212121212121213,
+ "grad_norm": 2.0844249725341797,
+ "learning_rate": 1.680808080808081e-06,
+ "loss": 1.0233726501464844,
+ "mean_token_accuracy": 0.7490839958190918,
+ "num_tokens": 26935296.0,
+ "step": 1644
+ },
+ {
+ "entropy": 1.3131269216537476,
+ "epoch": 3.323232323232323,
+ "grad_norm": 2.279741048812866,
+ "learning_rate": 1.678787878787879e-06,
+ "loss": 1.3082493543624878,
+ "mean_token_accuracy": 0.6856985688209534,
+ "num_tokens": 26951680.0,
+ "step": 1645
+ },
+ {
+ "entropy": 1.5594273805618286,
+ "epoch": 3.3252525252525253,
+ "grad_norm": 2.423882246017456,
+ "learning_rate": 1.6767676767676768e-06,
+ "loss": 1.5775840282440186,
+ "mean_token_accuracy": 0.662493884563446,
+ "num_tokens": 26968064.0,
+ "step": 1646
+ },
+ {
+ "entropy": 1.2298411130905151,
+ "epoch": 3.327272727272727,
+ "grad_norm": 2.237107515335083,
+ "learning_rate": 1.674747474747475e-06,
+ "loss": 1.1941357851028442,
+ "mean_token_accuracy": 0.7106130719184875,
+ "num_tokens": 26984448.0,
+ "step": 1647
+ },
+ {
+ "entropy": 0.986072301864624,
+ "epoch": 3.3292929292929294,
+ "grad_norm": 2.2843995094299316,
+ "learning_rate": 1.6727272727272728e-06,
+ "loss": 0.9964872598648071,
+ "mean_token_accuracy": 0.7433438897132874,
+ "num_tokens": 27000832.0,
+ "step": 1648
+ },
+ {
+ "entropy": 1.2612992525100708,
+ "epoch": 3.3313131313131312,
+ "grad_norm": 2.2401392459869385,
+ "learning_rate": 1.6707070707070707e-06,
+ "loss": 1.2401535511016846,
+ "mean_token_accuracy": 0.6914997696876526,
+ "num_tokens": 27017216.0,
+ "step": 1649
+ },
+ {
+ "entropy": 0.8876240849494934,
+ "epoch": 3.3333333333333335,
+ "grad_norm": 2.055438995361328,
+ "learning_rate": 1.6686868686868688e-06,
+ "loss": 0.8796688914299011,
+ "mean_token_accuracy": 0.7739985585212708,
+ "num_tokens": 27033600.0,
+ "step": 1650
+ },
+ {
+ "epoch": 3.3333333333333335,
+ "eval_entropy": 1.3213856729768938,
+ "eval_loss": 1.5484445095062256,
+ "eval_mean_token_accuracy": 0.6446653873689713,
+ "eval_num_tokens": 27033600.0,
+ "eval_runtime": 43.7594,
+ "eval_samples_per_second": 22.624,
+ "eval_steps_per_second": 2.834,
+ "step": 1650
+ },
+ {
+ "entropy": 1.8024967908859253,
+ "epoch": 3.3353535353535353,
+ "grad_norm": 2.316970109939575,
+ "learning_rate": 1.6666666666666667e-06,
+ "loss": 1.8035298585891724,
+ "mean_token_accuracy": 0.6057034730911255,
+ "num_tokens": 27049984.0,
+ "step": 1651
+ },
+ {
+ "entropy": 0.8543419241905212,
+ "epoch": 3.3373737373737375,
+ "grad_norm": 2.2566277980804443,
+ "learning_rate": 1.6646464646464648e-06,
+ "loss": 0.8558261394500732,
+ "mean_token_accuracy": 0.7656326293945312,
+ "num_tokens": 27066368.0,
+ "step": 1652
+ },
+ {
+ "entropy": 1.3101993799209595,
+ "epoch": 3.3393939393939394,
+ "grad_norm": 2.490753650665283,
+ "learning_rate": 1.6626262626262626e-06,
+ "loss": 1.326491355895996,
+ "mean_token_accuracy": 0.6656082272529602,
+ "num_tokens": 27082752.0,
+ "step": 1653
+ },
+ {
+ "entropy": 1.226317048072815,
+ "epoch": 3.341414141414141,
+ "grad_norm": 2.438649892807007,
+ "learning_rate": 1.6606060606060605e-06,
+ "loss": 1.2096238136291504,
+ "mean_token_accuracy": 0.6954079270362854,
+ "num_tokens": 27099136.0,
+ "step": 1654
+ },
+ {
+ "entropy": 1.1575508117675781,
+ "epoch": 3.3434343434343434,
+ "grad_norm": 2.130772113800049,
+ "learning_rate": 1.6585858585858588e-06,
+ "loss": 1.1718693971633911,
+ "mean_token_accuracy": 0.7256350517272949,
+ "num_tokens": 27115520.0,
+ "step": 1655
+ },
+ {
+ "entropy": 1.4135949611663818,
+ "epoch": 3.3454545454545457,
+ "grad_norm": 2.3037710189819336,
+ "learning_rate": 1.6565656565656567e-06,
+ "loss": 1.408097505569458,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 27131904.0,
+ "step": 1656
+ },
+ {
+ "entropy": 0.977189838886261,
+ "epoch": 3.3474747474747475,
+ "grad_norm": 2.3096542358398438,
+ "learning_rate": 1.6545454545454548e-06,
+ "loss": 0.9848534464836121,
+ "mean_token_accuracy": 0.7306423783302307,
+ "num_tokens": 27148288.0,
+ "step": 1657
+ },
+ {
+ "entropy": 1.6641992330551147,
+ "epoch": 3.3494949494949493,
+ "grad_norm": 2.2562549114227295,
+ "learning_rate": 1.6525252525252527e-06,
+ "loss": 1.6742463111877441,
+ "mean_token_accuracy": 0.6157181262969971,
+ "num_tokens": 27164672.0,
+ "step": 1658
+ },
+ {
+ "entropy": 1.2698633670806885,
+ "epoch": 3.3515151515151516,
+ "grad_norm": 2.426100492477417,
+ "learning_rate": 1.6505050505050508e-06,
+ "loss": 1.2856690883636475,
+ "mean_token_accuracy": 0.6808133721351624,
+ "num_tokens": 27181056.0,
+ "step": 1659
+ },
+ {
+ "entropy": 1.4621158838272095,
+ "epoch": 3.3535353535353534,
+ "grad_norm": 2.3147833347320557,
+ "learning_rate": 1.6484848484848487e-06,
+ "loss": 1.468501091003418,
+ "mean_token_accuracy": 0.6610283255577087,
+ "num_tokens": 27197440.0,
+ "step": 1660
+ },
+ {
+ "entropy": 1.249279499053955,
+ "epoch": 3.3555555555555556,
+ "grad_norm": 2.237351894378662,
+ "learning_rate": 1.6464646464646466e-06,
+ "loss": 1.2397043704986572,
+ "mean_token_accuracy": 0.6951636672019958,
+ "num_tokens": 27213824.0,
+ "step": 1661
+ },
+ {
+ "entropy": 0.9608144164085388,
+ "epoch": 3.3575757575757574,
+ "grad_norm": 2.2147974967956543,
+ "learning_rate": 1.6444444444444447e-06,
+ "loss": 0.9720965623855591,
+ "mean_token_accuracy": 0.7529922127723694,
+ "num_tokens": 27230208.0,
+ "step": 1662
+ },
+ {
+ "entropy": 1.5832558870315552,
+ "epoch": 3.3595959595959597,
+ "grad_norm": 2.325833559036255,
+ "learning_rate": 1.6424242424242426e-06,
+ "loss": 1.5746217966079712,
+ "mean_token_accuracy": 0.6457010507583618,
+ "num_tokens": 27246592.0,
+ "step": 1663
+ },
+ {
+ "entropy": 1.35304856300354,
+ "epoch": 3.3616161616161615,
+ "grad_norm": 2.509624481201172,
+ "learning_rate": 1.6404040404040405e-06,
+ "loss": 1.3489930629730225,
+ "mean_token_accuracy": 0.6699438095092773,
+ "num_tokens": 27262976.0,
+ "step": 1664
+ },
+ {
+ "entropy": 1.3161576986312866,
+ "epoch": 3.3636363636363638,
+ "grad_norm": 2.393994092941284,
+ "learning_rate": 1.6383838383838386e-06,
+ "loss": 1.303264856338501,
+ "mean_token_accuracy": 0.6855764389038086,
+ "num_tokens": 27279360.0,
+ "step": 1665
+ },
+ {
+ "entropy": 1.1878900527954102,
+ "epoch": 3.3656565656565656,
+ "grad_norm": 2.180389165878296,
+ "learning_rate": 1.6363636363636365e-06,
+ "loss": 1.182593584060669,
+ "mean_token_accuracy": 0.7091475129127502,
+ "num_tokens": 27295744.0,
+ "step": 1666
+ },
+ {
+ "entropy": 1.3966656923294067,
+ "epoch": 3.367676767676768,
+ "grad_norm": 2.097033739089966,
+ "learning_rate": 1.6343434343434344e-06,
+ "loss": 1.3977530002593994,
+ "mean_token_accuracy": 0.6893014311790466,
+ "num_tokens": 27312128.0,
+ "step": 1667
+ },
+ {
+ "entropy": 1.298252820968628,
+ "epoch": 3.3696969696969696,
+ "grad_norm": 2.301867723464966,
+ "learning_rate": 1.6323232323232325e-06,
+ "loss": 1.2884492874145508,
+ "mean_token_accuracy": 0.6819125413894653,
+ "num_tokens": 27328512.0,
+ "step": 1668
+ },
+ {
+ "entropy": 1.0709348917007446,
+ "epoch": 3.371717171717172,
+ "grad_norm": 2.323345422744751,
+ "learning_rate": 1.6303030303030303e-06,
+ "loss": 1.0587565898895264,
+ "mean_token_accuracy": 0.7345505356788635,
+ "num_tokens": 27344896.0,
+ "step": 1669
+ },
+ {
+ "entropy": 1.4100518226623535,
+ "epoch": 3.3737373737373737,
+ "grad_norm": 2.3652331829071045,
+ "learning_rate": 1.6282828282828284e-06,
+ "loss": 1.4043725728988647,
+ "mean_token_accuracy": 0.670615553855896,
+ "num_tokens": 27361280.0,
+ "step": 1670
+ },
+ {
+ "entropy": 1.3682993650436401,
+ "epoch": 3.375757575757576,
+ "grad_norm": 2.4122917652130127,
+ "learning_rate": 1.6262626262626263e-06,
+ "loss": 1.3637261390686035,
+ "mean_token_accuracy": 0.665730357170105,
+ "num_tokens": 27377664.0,
+ "step": 1671
+ },
+ {
+ "entropy": 1.1528232097625732,
+ "epoch": 3.3777777777777778,
+ "grad_norm": 2.1029880046844482,
+ "learning_rate": 1.6242424242424242e-06,
+ "loss": 1.1693168878555298,
+ "mean_token_accuracy": 0.7155593633651733,
+ "num_tokens": 27394048.0,
+ "step": 1672
+ },
+ {
+ "entropy": 1.0737035274505615,
+ "epoch": 3.3797979797979796,
+ "grad_norm": 2.0809051990509033,
+ "learning_rate": 1.6222222222222223e-06,
+ "loss": 1.0787606239318848,
+ "mean_token_accuracy": 0.7236199378967285,
+ "num_tokens": 27410432.0,
+ "step": 1673
+ },
+ {
+ "entropy": 0.992008626461029,
+ "epoch": 3.381818181818182,
+ "grad_norm": 2.216033935546875,
+ "learning_rate": 1.6202020202020202e-06,
+ "loss": 0.9949617385864258,
+ "mean_token_accuracy": 0.7416340708732605,
+ "num_tokens": 27426816.0,
+ "step": 1674
+ },
+ {
+ "entropy": 1.3799123764038086,
+ "epoch": 3.3838383838383836,
+ "grad_norm": 2.218331813812256,
+ "learning_rate": 1.618181818181818e-06,
+ "loss": 1.400660514831543,
+ "mean_token_accuracy": 0.6707376837730408,
+ "num_tokens": 27443200.0,
+ "step": 1675
+ },
+ {
+ "entropy": 1.125901222229004,
+ "epoch": 3.385858585858586,
+ "grad_norm": 2.1194028854370117,
+ "learning_rate": 1.6161616161616164e-06,
+ "loss": 1.128243088722229,
+ "mean_token_accuracy": 0.7427332401275635,
+ "num_tokens": 27459584.0,
+ "step": 1676
+ },
+ {
+ "entropy": 1.347123384475708,
+ "epoch": 3.3878787878787877,
+ "grad_norm": 2.3231191635131836,
+ "learning_rate": 1.6141414141414145e-06,
+ "loss": 1.3301351070404053,
+ "mean_token_accuracy": 0.6792256832122803,
+ "num_tokens": 27475968.0,
+ "step": 1677
+ },
+ {
+ "entropy": 1.3429654836654663,
+ "epoch": 3.38989898989899,
+ "grad_norm": 2.3116424083709717,
+ "learning_rate": 1.6121212121212124e-06,
+ "loss": 1.3509732484817505,
+ "mean_token_accuracy": 0.6730581521987915,
+ "num_tokens": 27492352.0,
+ "step": 1678
+ },
+ {
+ "entropy": 1.0976272821426392,
+ "epoch": 3.391919191919192,
+ "grad_norm": 2.2770488262176514,
+ "learning_rate": 1.6101010101010103e-06,
+ "loss": 1.0915334224700928,
+ "mean_token_accuracy": 0.72826087474823,
+ "num_tokens": 27508736.0,
+ "step": 1679
+ },
+ {
+ "entropy": 1.6415719985961914,
+ "epoch": 3.393939393939394,
+ "grad_norm": 2.224179267883301,
+ "learning_rate": 1.6080808080808084e-06,
+ "loss": 1.6517691612243652,
+ "mean_token_accuracy": 0.6277479529380798,
+ "num_tokens": 27525120.0,
+ "step": 1680
+ },
+ {
+ "entropy": 1.2124820947647095,
+ "epoch": 3.395959595959596,
+ "grad_norm": 2.1096651554107666,
+ "learning_rate": 1.6060606060606063e-06,
+ "loss": 1.230252981185913,
+ "mean_token_accuracy": 0.7074987888336182,
+ "num_tokens": 27541504.0,
+ "step": 1681
+ },
+ {
+ "entropy": 1.4807898998260498,
+ "epoch": 3.397979797979798,
+ "grad_norm": 2.1753411293029785,
+ "learning_rate": 1.6040404040404042e-06,
+ "loss": 1.4894174337387085,
+ "mean_token_accuracy": 0.6585246920585632,
+ "num_tokens": 27557888.0,
+ "step": 1682
+ },
+ {
+ "entropy": 1.31308913230896,
+ "epoch": 3.4,
+ "grad_norm": 2.251997947692871,
+ "learning_rate": 1.6020202020202023e-06,
+ "loss": 1.3479615449905396,
+ "mean_token_accuracy": 0.6800805926322937,
+ "num_tokens": 27574272.0,
+ "step": 1683
+ },
+ {
+ "entropy": 1.1820056438446045,
+ "epoch": 3.402020202020202,
+ "grad_norm": 2.074507474899292,
+ "learning_rate": 1.6000000000000001e-06,
+ "loss": 1.1995149850845337,
+ "mean_token_accuracy": 0.7117733359336853,
+ "num_tokens": 27590656.0,
+ "step": 1684
+ },
+ {
+ "entropy": 1.2405987977981567,
+ "epoch": 3.404040404040404,
+ "grad_norm": 1.9572449922561646,
+ "learning_rate": 1.597979797979798e-06,
+ "loss": 1.228973627090454,
+ "mean_token_accuracy": 0.7143990993499756,
+ "num_tokens": 27607040.0,
+ "step": 1685
+ },
+ {
+ "entropy": 1.3054970502853394,
+ "epoch": 3.4060606060606062,
+ "grad_norm": 2.174598217010498,
+ "learning_rate": 1.5959595959595961e-06,
+ "loss": 1.2918202877044678,
+ "mean_token_accuracy": 0.7015754580497742,
+ "num_tokens": 27623424.0,
+ "step": 1686
+ },
+ {
+ "entropy": 1.2568256855010986,
+ "epoch": 3.408080808080808,
+ "grad_norm": 2.1647098064422607,
+ "learning_rate": 1.593939393939394e-06,
+ "loss": 1.2464665174484253,
+ "mean_token_accuracy": 0.7046898007392883,
+ "num_tokens": 27639808.0,
+ "step": 1687
+ },
+ {
+ "entropy": 0.9985859990119934,
+ "epoch": 3.41010101010101,
+ "grad_norm": 2.230548143386841,
+ "learning_rate": 1.5919191919191921e-06,
+ "loss": 0.9941741824150085,
+ "mean_token_accuracy": 0.7424889802932739,
+ "num_tokens": 27656192.0,
+ "step": 1688
+ },
+ {
+ "entropy": 1.2002249956130981,
+ "epoch": 3.412121212121212,
+ "grad_norm": 2.211632490158081,
+ "learning_rate": 1.58989898989899e-06,
+ "loss": 1.1901870965957642,
+ "mean_token_accuracy": 0.7168416976928711,
+ "num_tokens": 27672576.0,
+ "step": 1689
+ },
+ {
+ "entropy": 1.5074162483215332,
+ "epoch": 3.4141414141414144,
+ "grad_norm": 2.3280093669891357,
+ "learning_rate": 1.5878787878787879e-06,
+ "loss": 1.5252172946929932,
+ "mean_token_accuracy": 0.6465559601783752,
+ "num_tokens": 27688960.0,
+ "step": 1690
+ },
+ {
+ "entropy": 1.1828655004501343,
+ "epoch": 3.416161616161616,
+ "grad_norm": 2.3439552783966064,
+ "learning_rate": 1.585858585858586e-06,
+ "loss": 1.196863055229187,
+ "mean_token_accuracy": 0.7009037733078003,
+ "num_tokens": 27705344.0,
+ "step": 1691
+ },
+ {
+ "entropy": 1.176308035850525,
+ "epoch": 3.418181818181818,
+ "grad_norm": 2.460371255874634,
+ "learning_rate": 1.5838383838383839e-06,
+ "loss": 1.1818437576293945,
+ "mean_token_accuracy": 0.6998656392097473,
+ "num_tokens": 27721728.0,
+ "step": 1692
+ },
+ {
+ "entropy": 1.1989773511886597,
+ "epoch": 3.4202020202020202,
+ "grad_norm": 2.406575918197632,
+ "learning_rate": 1.5818181818181818e-06,
+ "loss": 1.2158204317092896,
+ "mean_token_accuracy": 0.6949194073677063,
+ "num_tokens": 27738112.0,
+ "step": 1693
+ },
+ {
+ "entropy": 1.537143588066101,
+ "epoch": 3.422222222222222,
+ "grad_norm": 2.298275947570801,
+ "learning_rate": 1.5797979797979799e-06,
+ "loss": 1.5335557460784912,
+ "mean_token_accuracy": 0.6571812629699707,
+ "num_tokens": 27754496.0,
+ "step": 1694
+ },
+ {
+ "entropy": 1.3271749019622803,
+ "epoch": 3.4242424242424243,
+ "grad_norm": 2.309699058532715,
+ "learning_rate": 1.5777777777777778e-06,
+ "loss": 1.3499958515167236,
+ "mean_token_accuracy": 0.6943087577819824,
+ "num_tokens": 27770880.0,
+ "step": 1695
+ },
+ {
+ "entropy": 1.4381791353225708,
+ "epoch": 3.426262626262626,
+ "grad_norm": 2.2183644771575928,
+ "learning_rate": 1.5757575757575759e-06,
+ "loss": 1.4350523948669434,
+ "mean_token_accuracy": 0.6568148732185364,
+ "num_tokens": 27787264.0,
+ "step": 1696
+ },
+ {
+ "entropy": 0.9867562055587769,
+ "epoch": 3.4282828282828284,
+ "grad_norm": 2.13663387298584,
+ "learning_rate": 1.5737373737373737e-06,
+ "loss": 0.9871019124984741,
+ "mean_token_accuracy": 0.7538471221923828,
+ "num_tokens": 27803648.0,
+ "step": 1697
+ },
+ {
+ "entropy": 1.0085591077804565,
+ "epoch": 3.43030303030303,
+ "grad_norm": 2.3447134494781494,
+ "learning_rate": 1.571717171717172e-06,
+ "loss": 1.0313187837600708,
+ "mean_token_accuracy": 0.7325354218482971,
+ "num_tokens": 27820032.0,
+ "step": 1698
+ },
+ {
+ "entropy": 0.9242914915084839,
+ "epoch": 3.4323232323232324,
+ "grad_norm": 2.16290545463562,
+ "learning_rate": 1.56969696969697e-06,
+ "loss": 0.9127025604248047,
+ "mean_token_accuracy": 0.7653273344039917,
+ "num_tokens": 27836416.0,
+ "step": 1699
+ },
+ {
+ "entropy": 1.4173065423965454,
+ "epoch": 3.4343434343434343,
+ "grad_norm": 2.192754030227661,
+ "learning_rate": 1.5676767676767678e-06,
+ "loss": 1.4122503995895386,
+ "mean_token_accuracy": 0.6770884394645691,
+ "num_tokens": 27852800.0,
+ "step": 1700
+ },
+ {
+ "epoch": 3.4343434343434343,
+ "eval_entropy": 1.3203289614569755,
+ "eval_loss": 1.5483064651489258,
+ "eval_mean_token_accuracy": 0.6447958845284677,
+ "eval_num_tokens": 27852800.0,
+ "eval_runtime": 43.7896,
+ "eval_samples_per_second": 22.608,
+ "eval_steps_per_second": 2.832,
+ "step": 1700
+ },
+ {
+ "entropy": 1.4677248001098633,
+ "epoch": 3.4363636363636365,
+ "grad_norm": 2.07183575630188,
+ "learning_rate": 1.565656565656566e-06,
+ "loss": 1.4772744178771973,
+ "mean_token_accuracy": 0.6927821040153503,
+ "num_tokens": 27869184.0,
+ "step": 1701
+ },
+ {
+ "entropy": 1.845194935798645,
+ "epoch": 3.4383838383838383,
+ "grad_norm": 1.9974539279937744,
+ "learning_rate": 1.5636363636363638e-06,
+ "loss": 1.8598425388336182,
+ "mean_token_accuracy": 0.5933683514595032,
+ "num_tokens": 27885568.0,
+ "step": 1702
+ },
+ {
+ "entropy": 1.1044740676879883,
+ "epoch": 3.4404040404040406,
+ "grad_norm": 2.199014186859131,
+ "learning_rate": 1.5616161616161617e-06,
+ "loss": 1.119746446609497,
+ "mean_token_accuracy": 0.7175744771957397,
+ "num_tokens": 27901952.0,
+ "step": 1703
+ },
+ {
+ "entropy": 0.920816957950592,
+ "epoch": 3.4424242424242424,
+ "grad_norm": 2.3172857761383057,
+ "learning_rate": 1.5595959595959598e-06,
+ "loss": 0.908664882183075,
+ "mean_token_accuracy": 0.7598314881324768,
+ "num_tokens": 27918336.0,
+ "step": 1704
+ },
+ {
+ "entropy": 1.4610254764556885,
+ "epoch": 3.4444444444444446,
+ "grad_norm": 2.5196661949157715,
+ "learning_rate": 1.5575757575757577e-06,
+ "loss": 1.4767801761627197,
+ "mean_token_accuracy": 0.652662456035614,
+ "num_tokens": 27934720.0,
+ "step": 1705
+ },
+ {
+ "entropy": 1.0131516456604004,
+ "epoch": 3.4464646464646465,
+ "grad_norm": 2.2522189617156982,
+ "learning_rate": 1.5555555555555558e-06,
+ "loss": 1.0143696069717407,
+ "mean_token_accuracy": 0.7348558902740479,
+ "num_tokens": 27951104.0,
+ "step": 1706
+ },
+ {
+ "entropy": 1.2054252624511719,
+ "epoch": 3.4484848484848483,
+ "grad_norm": 2.1769580841064453,
+ "learning_rate": 1.5535353535353537e-06,
+ "loss": 1.2020167112350464,
+ "mean_token_accuracy": 0.7076209187507629,
+ "num_tokens": 27967488.0,
+ "step": 1707
+ },
+ {
+ "entropy": 1.1004403829574585,
+ "epoch": 3.4505050505050505,
+ "grad_norm": 2.3803768157958984,
+ "learning_rate": 1.5515151515151516e-06,
+ "loss": 1.1220088005065918,
+ "mean_token_accuracy": 0.712506115436554,
+ "num_tokens": 27983872.0,
+ "step": 1708
+ },
+ {
+ "entropy": 1.423991322517395,
+ "epoch": 3.4525252525252528,
+ "grad_norm": 2.2648093700408936,
+ "learning_rate": 1.5494949494949497e-06,
+ "loss": 1.432944893836975,
+ "mean_token_accuracy": 0.6545554399490356,
+ "num_tokens": 28000256.0,
+ "step": 1709
+ },
+ {
+ "entropy": 1.5308680534362793,
+ "epoch": 3.4545454545454546,
+ "grad_norm": 2.1772451400756836,
+ "learning_rate": 1.5474747474747476e-06,
+ "loss": 1.5395504236221313,
+ "mean_token_accuracy": 0.6433805823326111,
+ "num_tokens": 28016640.0,
+ "step": 1710
+ },
+ {
+ "entropy": 1.3868193626403809,
+ "epoch": 3.4565656565656564,
+ "grad_norm": 2.1782312393188477,
+ "learning_rate": 1.5454545454545454e-06,
+ "loss": 1.3730117082595825,
+ "mean_token_accuracy": 0.6857596635818481,
+ "num_tokens": 28033024.0,
+ "step": 1711
+ },
+ {
+ "entropy": 0.6769964694976807,
+ "epoch": 3.4585858585858587,
+ "grad_norm": 1.941037654876709,
+ "learning_rate": 1.5434343434343435e-06,
+ "loss": 0.6863309144973755,
+ "mean_token_accuracy": 0.8126526474952698,
+ "num_tokens": 28049408.0,
+ "step": 1712
+ },
+ {
+ "entropy": 1.1113249063491821,
+ "epoch": 3.4606060606060605,
+ "grad_norm": 2.0039165019989014,
+ "learning_rate": 1.5414141414141414e-06,
+ "loss": 1.1056404113769531,
+ "mean_token_accuracy": 0.7314362525939941,
+ "num_tokens": 28065792.0,
+ "step": 1713
+ },
+ {
+ "entropy": 0.8827037811279297,
+ "epoch": 3.4626262626262627,
+ "grad_norm": 2.2235255241394043,
+ "learning_rate": 1.5393939393939395e-06,
+ "loss": 0.8903871178627014,
+ "mean_token_accuracy": 0.7547020316123962,
+ "num_tokens": 28082176.0,
+ "step": 1714
+ },
+ {
+ "entropy": 1.2060964107513428,
+ "epoch": 3.4646464646464645,
+ "grad_norm": 2.2997398376464844,
+ "learning_rate": 1.5373737373737374e-06,
+ "loss": 1.2247741222381592,
+ "mean_token_accuracy": 0.6979726552963257,
+ "num_tokens": 28098560.0,
+ "step": 1715
+ },
+ {
+ "entropy": 1.2543354034423828,
+ "epoch": 3.466666666666667,
+ "grad_norm": 2.2603039741516113,
+ "learning_rate": 1.5353535353535353e-06,
+ "loss": 1.2638390064239502,
+ "mean_token_accuracy": 0.6919271945953369,
+ "num_tokens": 28114944.0,
+ "step": 1716
+ },
+ {
+ "entropy": 1.4569451808929443,
+ "epoch": 3.4686868686868686,
+ "grad_norm": 2.3623344898223877,
+ "learning_rate": 1.5333333333333334e-06,
+ "loss": 1.4669182300567627,
+ "mean_token_accuracy": 0.6596238613128662,
+ "num_tokens": 28131328.0,
+ "step": 1717
+ },
+ {
+ "entropy": 1.0979474782943726,
+ "epoch": 3.470707070707071,
+ "grad_norm": 2.282487154006958,
+ "learning_rate": 1.5313131313131313e-06,
+ "loss": 1.123124361038208,
+ "mean_token_accuracy": 0.7218490242958069,
+ "num_tokens": 28147712.0,
+ "step": 1718
+ },
+ {
+ "entropy": 1.3850172758102417,
+ "epoch": 3.4727272727272727,
+ "grad_norm": 2.406338930130005,
+ "learning_rate": 1.5292929292929296e-06,
+ "loss": 1.361925482749939,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 28164096.0,
+ "step": 1719
+ },
+ {
+ "entropy": 1.3522284030914307,
+ "epoch": 3.474747474747475,
+ "grad_norm": 2.171316385269165,
+ "learning_rate": 1.5272727272727275e-06,
+ "loss": 1.3782949447631836,
+ "mean_token_accuracy": 0.6841108798980713,
+ "num_tokens": 28180480.0,
+ "step": 1720
+ },
+ {
+ "entropy": 1.4793171882629395,
+ "epoch": 3.4767676767676767,
+ "grad_norm": 2.29586124420166,
+ "learning_rate": 1.5252525252525254e-06,
+ "loss": 1.4899311065673828,
+ "mean_token_accuracy": 0.6422203183174133,
+ "num_tokens": 28196864.0,
+ "step": 1721
+ },
+ {
+ "entropy": 1.0572689771652222,
+ "epoch": 3.4787878787878785,
+ "grad_norm": 2.0798633098602295,
+ "learning_rate": 1.5232323232323235e-06,
+ "loss": 1.0417135953903198,
+ "mean_token_accuracy": 0.7372373938560486,
+ "num_tokens": 28213248.0,
+ "step": 1722
+ },
+ {
+ "entropy": 1.0050398111343384,
+ "epoch": 3.480808080808081,
+ "grad_norm": 2.205551862716675,
+ "learning_rate": 1.5212121212121214e-06,
+ "loss": 1.0072510242462158,
+ "mean_token_accuracy": 0.7414509057998657,
+ "num_tokens": 28229632.0,
+ "step": 1723
+ },
+ {
+ "entropy": 0.9438449144363403,
+ "epoch": 3.482828282828283,
+ "grad_norm": 2.177335262298584,
+ "learning_rate": 1.5191919191919195e-06,
+ "loss": 0.9125795364379883,
+ "mean_token_accuracy": 0.7605642676353455,
+ "num_tokens": 28246016.0,
+ "step": 1724
+ },
+ {
+ "entropy": 0.8600634336471558,
+ "epoch": 3.484848484848485,
+ "grad_norm": 2.286794662475586,
+ "learning_rate": 1.5171717171717174e-06,
+ "loss": 0.8473736047744751,
+ "mean_token_accuracy": 0.7839521169662476,
+ "num_tokens": 28262400.0,
+ "step": 1725
+ },
+ {
+ "entropy": 1.0827349424362183,
+ "epoch": 3.4868686868686867,
+ "grad_norm": 2.176316738128662,
+ "learning_rate": 1.5151515151515152e-06,
+ "loss": 1.0760138034820557,
+ "mean_token_accuracy": 0.7195896506309509,
+ "num_tokens": 28278784.0,
+ "step": 1726
+ },
+ {
+ "entropy": 1.3604737520217896,
+ "epoch": 3.488888888888889,
+ "grad_norm": 2.3393819332122803,
+ "learning_rate": 1.5131313131313133e-06,
+ "loss": 1.3466029167175293,
+ "mean_token_accuracy": 0.6731802821159363,
+ "num_tokens": 28295168.0,
+ "step": 1727
+ },
+ {
+ "entropy": 1.4611977338790894,
+ "epoch": 3.4909090909090907,
+ "grad_norm": 2.3396732807159424,
+ "learning_rate": 1.5111111111111112e-06,
+ "loss": 1.474691390991211,
+ "mean_token_accuracy": 0.6497313380241394,
+ "num_tokens": 28311552.0,
+ "step": 1728
+ },
+ {
+ "entropy": 1.1734099388122559,
+ "epoch": 3.492929292929293,
+ "grad_norm": 2.154437780380249,
+ "learning_rate": 1.5090909090909091e-06,
+ "loss": 1.1631931066513062,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 28327936.0,
+ "step": 1729
+ },
+ {
+ "entropy": 1.0015299320220947,
+ "epoch": 3.494949494949495,
+ "grad_norm": 2.273815393447876,
+ "learning_rate": 1.5070707070707072e-06,
+ "loss": 0.9818742871284485,
+ "mean_token_accuracy": 0.7361382246017456,
+ "num_tokens": 28344320.0,
+ "step": 1730
+ },
+ {
+ "entropy": 1.0342366695404053,
+ "epoch": 3.496969696969697,
+ "grad_norm": 2.1011879444122314,
+ "learning_rate": 1.5050505050505051e-06,
+ "loss": 1.02262282371521,
+ "mean_token_accuracy": 0.7448094487190247,
+ "num_tokens": 28360704.0,
+ "step": 1731
+ },
+ {
+ "entropy": 1.6318060159683228,
+ "epoch": 3.498989898989899,
+ "grad_norm": 2.338040590286255,
+ "learning_rate": 1.5030303030303032e-06,
+ "loss": 1.6215972900390625,
+ "mean_token_accuracy": 0.6225574016571045,
+ "num_tokens": 28377088.0,
+ "step": 1732
+ },
+ {
+ "entropy": 1.2391737699508667,
+ "epoch": 3.501010101010101,
+ "grad_norm": 2.2958035469055176,
+ "learning_rate": 1.501010101010101e-06,
+ "loss": 1.2481398582458496,
+ "mean_token_accuracy": 0.6922325491905212,
+ "num_tokens": 28393472.0,
+ "step": 1733
+ },
+ {
+ "entropy": 1.09321129322052,
+ "epoch": 3.503030303030303,
+ "grad_norm": 2.117506980895996,
+ "learning_rate": 1.498989898989899e-06,
+ "loss": 1.100616455078125,
+ "mean_token_accuracy": 0.7240473628044128,
+ "num_tokens": 28409856.0,
+ "step": 1734
+ },
+ {
+ "entropy": 1.2746680974960327,
+ "epoch": 3.505050505050505,
+ "grad_norm": 2.2428109645843506,
+ "learning_rate": 1.496969696969697e-06,
+ "loss": 1.278875470161438,
+ "mean_token_accuracy": 0.688629686832428,
+ "num_tokens": 28426240.0,
+ "step": 1735
+ },
+ {
+ "entropy": 0.9300931096076965,
+ "epoch": 3.507070707070707,
+ "grad_norm": 2.0250492095947266,
+ "learning_rate": 1.494949494949495e-06,
+ "loss": 0.9304848909378052,
+ "mean_token_accuracy": 0.7613580822944641,
+ "num_tokens": 28442624.0,
+ "step": 1736
+ },
+ {
+ "entropy": 1.5743480920791626,
+ "epoch": 3.509090909090909,
+ "grad_norm": 2.251974582672119,
+ "learning_rate": 1.4929292929292929e-06,
+ "loss": 1.570695400238037,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 28459008.0,
+ "step": 1737
+ },
+ {
+ "entropy": 1.0316240787506104,
+ "epoch": 3.511111111111111,
+ "grad_norm": 2.187208652496338,
+ "learning_rate": 1.490909090909091e-06,
+ "loss": 1.022985816001892,
+ "mean_token_accuracy": 0.7444430589675903,
+ "num_tokens": 28475392.0,
+ "step": 1738
+ },
+ {
+ "entropy": 1.0719387531280518,
+ "epoch": 3.5131313131313133,
+ "grad_norm": 2.1497936248779297,
+ "learning_rate": 1.4888888888888888e-06,
+ "loss": 1.087444543838501,
+ "mean_token_accuracy": 0.7261846661567688,
+ "num_tokens": 28491776.0,
+ "step": 1739
+ },
+ {
+ "entropy": 1.679359793663025,
+ "epoch": 3.515151515151515,
+ "grad_norm": 2.2430360317230225,
+ "learning_rate": 1.4868686868686872e-06,
+ "loss": 1.6981315612792969,
+ "mean_token_accuracy": 0.6258549094200134,
+ "num_tokens": 28508160.0,
+ "step": 1740
+ },
+ {
+ "entropy": 1.0614526271820068,
+ "epoch": 3.517171717171717,
+ "grad_norm": 2.220466375350952,
+ "learning_rate": 1.484848484848485e-06,
+ "loss": 1.0519301891326904,
+ "mean_token_accuracy": 0.7313751578330994,
+ "num_tokens": 28524544.0,
+ "step": 1741
+ },
+ {
+ "entropy": 1.267195224761963,
+ "epoch": 3.519191919191919,
+ "grad_norm": 1.9448764324188232,
+ "learning_rate": 1.4828282828282831e-06,
+ "loss": 1.2594044208526611,
+ "mean_token_accuracy": 0.7093917727470398,
+ "num_tokens": 28540928.0,
+ "step": 1742
+ },
+ {
+ "entropy": 1.0900983810424805,
+ "epoch": 3.5212121212121215,
+ "grad_norm": 2.292336940765381,
+ "learning_rate": 1.480808080808081e-06,
+ "loss": 1.0952692031860352,
+ "mean_token_accuracy": 0.7146433591842651,
+ "num_tokens": 28557312.0,
+ "step": 1743
+ },
+ {
+ "entropy": 1.4188793897628784,
+ "epoch": 3.5232323232323233,
+ "grad_norm": 2.355440139770508,
+ "learning_rate": 1.478787878787879e-06,
+ "loss": 1.4508819580078125,
+ "mean_token_accuracy": 0.6642037034034729,
+ "num_tokens": 28573696.0,
+ "step": 1744
+ },
+ {
+ "entropy": 1.52566397190094,
+ "epoch": 3.525252525252525,
+ "grad_norm": 2.2767279148101807,
+ "learning_rate": 1.476767676767677e-06,
+ "loss": 1.5568758249282837,
+ "mean_token_accuracy": 0.6472276449203491,
+ "num_tokens": 28590080.0,
+ "step": 1745
+ },
+ {
+ "entropy": 1.4695135354995728,
+ "epoch": 3.5272727272727273,
+ "grad_norm": 2.3080222606658936,
+ "learning_rate": 1.474747474747475e-06,
+ "loss": 1.4671947956085205,
+ "mean_token_accuracy": 0.6530898809432983,
+ "num_tokens": 28606464.0,
+ "step": 1746
+ },
+ {
+ "entropy": 1.438908338546753,
+ "epoch": 3.529292929292929,
+ "grad_norm": 2.485170364379883,
+ "learning_rate": 1.4727272727272728e-06,
+ "loss": 1.4531956911087036,
+ "mean_token_accuracy": 0.6664020419120789,
+ "num_tokens": 28622848.0,
+ "step": 1747
+ },
+ {
+ "entropy": 1.5307536125183105,
+ "epoch": 3.5313131313131314,
+ "grad_norm": 2.3280844688415527,
+ "learning_rate": 1.470707070707071e-06,
+ "loss": 1.5298030376434326,
+ "mean_token_accuracy": 0.642892062664032,
+ "num_tokens": 28639232.0,
+ "step": 1748
+ },
+ {
+ "entropy": 1.429180383682251,
+ "epoch": 3.533333333333333,
+ "grad_norm": 2.36387038230896,
+ "learning_rate": 1.4686868686868688e-06,
+ "loss": 1.4191480875015259,
+ "mean_token_accuracy": 0.6469833850860596,
+ "num_tokens": 28655616.0,
+ "step": 1749
+ },
+ {
+ "entropy": 0.9336722493171692,
+ "epoch": 3.5353535353535355,
+ "grad_norm": 2.1873295307159424,
+ "learning_rate": 1.4666666666666669e-06,
+ "loss": 0.9257663488388062,
+ "mean_token_accuracy": 0.7629457712173462,
+ "num_tokens": 28672000.0,
+ "step": 1750
+ },
+ {
+ "epoch": 3.5353535353535355,
+ "eval_entropy": 1.3185442157330052,
+ "eval_loss": 1.548416018486023,
+ "eval_mean_token_accuracy": 0.6448259276728476,
+ "eval_num_tokens": 28672000.0,
+ "eval_runtime": 43.8376,
+ "eval_samples_per_second": 22.583,
+ "eval_steps_per_second": 2.829,
+ "step": 1750
+ },
+ {
+ "entropy": 1.2647572755813599,
+ "epoch": 3.5373737373737373,
+ "grad_norm": 2.1273581981658936,
+ "learning_rate": 1.4646464646464648e-06,
+ "loss": 1.2557384967803955,
+ "mean_token_accuracy": 0.6935759782791138,
+ "num_tokens": 28688384.0,
+ "step": 1751
+ },
+ {
+ "entropy": 1.4252692461013794,
+ "epoch": 3.5393939393939395,
+ "grad_norm": 2.052034616470337,
+ "learning_rate": 1.4626262626262627e-06,
+ "loss": 1.43434739112854,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 28704768.0,
+ "step": 1752
+ },
+ {
+ "entropy": 1.6918041706085205,
+ "epoch": 3.5414141414141413,
+ "grad_norm": 2.20965313911438,
+ "learning_rate": 1.4606060606060608e-06,
+ "loss": 1.707175850868225,
+ "mean_token_accuracy": 0.6127870082855225,
+ "num_tokens": 28721152.0,
+ "step": 1753
+ },
+ {
+ "entropy": 1.5122125148773193,
+ "epoch": 3.5434343434343436,
+ "grad_norm": 2.2061564922332764,
+ "learning_rate": 1.4585858585858586e-06,
+ "loss": 1.5119690895080566,
+ "mean_token_accuracy": 0.6488153338432312,
+ "num_tokens": 28737536.0,
+ "step": 1754
+ },
+ {
+ "entropy": 0.9536482095718384,
+ "epoch": 3.5454545454545454,
+ "grad_norm": 2.310809373855591,
+ "learning_rate": 1.4565656565656565e-06,
+ "loss": 0.9411349296569824,
+ "mean_token_accuracy": 0.7589765787124634,
+ "num_tokens": 28753920.0,
+ "step": 1755
+ },
+ {
+ "entropy": 1.5147753953933716,
+ "epoch": 3.5474747474747472,
+ "grad_norm": 2.520862340927124,
+ "learning_rate": 1.4545454545454546e-06,
+ "loss": 1.5047588348388672,
+ "mean_token_accuracy": 0.639167070388794,
+ "num_tokens": 28770304.0,
+ "step": 1756
+ },
+ {
+ "entropy": 1.3881752490997314,
+ "epoch": 3.5494949494949495,
+ "grad_norm": 2.3421478271484375,
+ "learning_rate": 1.4525252525252525e-06,
+ "loss": 1.3775359392166138,
+ "mean_token_accuracy": 0.6719589829444885,
+ "num_tokens": 28786688.0,
+ "step": 1757
+ },
+ {
+ "entropy": 1.0432544946670532,
+ "epoch": 3.5515151515151517,
+ "grad_norm": 2.235539674758911,
+ "learning_rate": 1.4505050505050506e-06,
+ "loss": 1.055377721786499,
+ "mean_token_accuracy": 0.7360160946846008,
+ "num_tokens": 28803072.0,
+ "step": 1758
+ },
+ {
+ "entropy": 1.2739083766937256,
+ "epoch": 3.5535353535353535,
+ "grad_norm": 2.295605421066284,
+ "learning_rate": 1.4484848484848485e-06,
+ "loss": 1.289074420928955,
+ "mean_token_accuracy": 0.6969345211982727,
+ "num_tokens": 28819456.0,
+ "step": 1759
+ },
+ {
+ "entropy": 1.192219853401184,
+ "epoch": 3.5555555555555554,
+ "grad_norm": 2.1039023399353027,
+ "learning_rate": 1.4464646464646464e-06,
+ "loss": 1.2043861150741577,
+ "mean_token_accuracy": 0.7080483436584473,
+ "num_tokens": 28835840.0,
+ "step": 1760
+ },
+ {
+ "entropy": 1.002448320388794,
+ "epoch": 3.5575757575757576,
+ "grad_norm": 2.476088523864746,
+ "learning_rate": 1.4444444444444445e-06,
+ "loss": 1.0271326303482056,
+ "mean_token_accuracy": 0.7325354218482971,
+ "num_tokens": 28852224.0,
+ "step": 1761
+ },
+ {
+ "entropy": 1.4694463014602661,
+ "epoch": 3.55959595959596,
+ "grad_norm": 2.298769235610962,
+ "learning_rate": 1.4424242424242426e-06,
+ "loss": 1.4576467275619507,
+ "mean_token_accuracy": 0.6591353416442871,
+ "num_tokens": 28868608.0,
+ "step": 1762
+ },
+ {
+ "entropy": 1.4025219678878784,
+ "epoch": 3.5616161616161617,
+ "grad_norm": 2.148528575897217,
+ "learning_rate": 1.4404040404040407e-06,
+ "loss": 1.3884464502334595,
+ "mean_token_accuracy": 0.6655471324920654,
+ "num_tokens": 28884992.0,
+ "step": 1763
+ },
+ {
+ "entropy": 1.2829358577728271,
+ "epoch": 3.5636363636363635,
+ "grad_norm": 2.1344001293182373,
+ "learning_rate": 1.4383838383838386e-06,
+ "loss": 1.3100465536117554,
+ "mean_token_accuracy": 0.6872862577438354,
+ "num_tokens": 28901376.0,
+ "step": 1764
+ },
+ {
+ "entropy": 1.2500309944152832,
+ "epoch": 3.5656565656565657,
+ "grad_norm": 2.1933422088623047,
+ "learning_rate": 1.4363636363636365e-06,
+ "loss": 1.2566546201705933,
+ "mean_token_accuracy": 0.7057889699935913,
+ "num_tokens": 28917760.0,
+ "step": 1765
+ },
+ {
+ "entropy": 1.4471250772476196,
+ "epoch": 3.5676767676767676,
+ "grad_norm": 2.2238707542419434,
+ "learning_rate": 1.4343434343434346e-06,
+ "loss": 1.4434895515441895,
+ "mean_token_accuracy": 0.6715925931930542,
+ "num_tokens": 28934144.0,
+ "step": 1766
+ },
+ {
+ "entropy": 1.2484838962554932,
+ "epoch": 3.56969696969697,
+ "grad_norm": 2.272259473800659,
+ "learning_rate": 1.4323232323232325e-06,
+ "loss": 1.2546260356903076,
+ "mean_token_accuracy": 0.6996824741363525,
+ "num_tokens": 28950528.0,
+ "step": 1767
+ },
+ {
+ "entropy": 1.326412558555603,
+ "epoch": 3.5717171717171716,
+ "grad_norm": 2.157593250274658,
+ "learning_rate": 1.4303030303030306e-06,
+ "loss": 1.3175407648086548,
+ "mean_token_accuracy": 0.7037127614021301,
+ "num_tokens": 28966912.0,
+ "step": 1768
+ },
+ {
+ "entropy": 1.314650297164917,
+ "epoch": 3.573737373737374,
+ "grad_norm": 2.146393299102783,
+ "learning_rate": 1.4282828282828284e-06,
+ "loss": 1.3232550621032715,
+ "mean_token_accuracy": 0.6864924430847168,
+ "num_tokens": 28983296.0,
+ "step": 1769
+ },
+ {
+ "entropy": 1.2547006607055664,
+ "epoch": 3.5757575757575757,
+ "grad_norm": 2.2809762954711914,
+ "learning_rate": 1.4262626262626263e-06,
+ "loss": 1.2578558921813965,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 28999680.0,
+ "step": 1770
+ },
+ {
+ "entropy": 1.1902955770492554,
+ "epoch": 3.5777777777777775,
+ "grad_norm": 2.5193467140197754,
+ "learning_rate": 1.4242424242424244e-06,
+ "loss": 1.1852655410766602,
+ "mean_token_accuracy": 0.699499249458313,
+ "num_tokens": 29016064.0,
+ "step": 1771
+ },
+ {
+ "entropy": 1.075490951538086,
+ "epoch": 3.5797979797979798,
+ "grad_norm": 2.055223226547241,
+ "learning_rate": 1.4222222222222223e-06,
+ "loss": 1.09010648727417,
+ "mean_token_accuracy": 0.7302759885787964,
+ "num_tokens": 29032448.0,
+ "step": 1772
+ },
+ {
+ "entropy": 1.1549168825149536,
+ "epoch": 3.581818181818182,
+ "grad_norm": 2.1802778244018555,
+ "learning_rate": 1.4202020202020202e-06,
+ "loss": 1.1465229988098145,
+ "mean_token_accuracy": 0.7187957763671875,
+ "num_tokens": 29048832.0,
+ "step": 1773
+ },
+ {
+ "entropy": 1.0966418981552124,
+ "epoch": 3.583838383838384,
+ "grad_norm": 2.354775905609131,
+ "learning_rate": 1.4181818181818183e-06,
+ "loss": 1.0915825366973877,
+ "mean_token_accuracy": 0.7263067960739136,
+ "num_tokens": 29065216.0,
+ "step": 1774
+ },
+ {
+ "entropy": 1.3264915943145752,
+ "epoch": 3.5858585858585856,
+ "grad_norm": 2.291811943054199,
+ "learning_rate": 1.4161616161616162e-06,
+ "loss": 1.3168433904647827,
+ "mean_token_accuracy": 0.6811797618865967,
+ "num_tokens": 29081600.0,
+ "step": 1775
+ },
+ {
+ "entropy": 1.4051839113235474,
+ "epoch": 3.587878787878788,
+ "grad_norm": 2.4314849376678467,
+ "learning_rate": 1.4141414141414143e-06,
+ "loss": 1.4150385856628418,
+ "mean_token_accuracy": 0.6616389751434326,
+ "num_tokens": 29097984.0,
+ "step": 1776
+ },
+ {
+ "entropy": 1.045767903327942,
+ "epoch": 3.58989898989899,
+ "grad_norm": 2.361785650253296,
+ "learning_rate": 1.4121212121212122e-06,
+ "loss": 1.0414667129516602,
+ "mean_token_accuracy": 0.726062536239624,
+ "num_tokens": 29114368.0,
+ "step": 1777
+ },
+ {
+ "entropy": 1.0930231809616089,
+ "epoch": 3.591919191919192,
+ "grad_norm": 2.2943761348724365,
+ "learning_rate": 1.41010101010101e-06,
+ "loss": 1.116988182067871,
+ "mean_token_accuracy": 0.7142159342765808,
+ "num_tokens": 29130752.0,
+ "step": 1778
+ },
+ {
+ "entropy": 2.053565502166748,
+ "epoch": 3.5939393939393938,
+ "grad_norm": 2.274879217147827,
+ "learning_rate": 1.4080808080808082e-06,
+ "loss": 2.012974262237549,
+ "mean_token_accuracy": 0.5475085377693176,
+ "num_tokens": 29147136.0,
+ "step": 1779
+ },
+ {
+ "entropy": 1.666791319847107,
+ "epoch": 3.595959595959596,
+ "grad_norm": 2.3387227058410645,
+ "learning_rate": 1.406060606060606e-06,
+ "loss": 1.6848305463790894,
+ "mean_token_accuracy": 0.6218246221542358,
+ "num_tokens": 29163520.0,
+ "step": 1780
+ },
+ {
+ "entropy": 1.2312790155410767,
+ "epoch": 3.597979797979798,
+ "grad_norm": 2.1445071697235107,
+ "learning_rate": 1.404040404040404e-06,
+ "loss": 1.2197356224060059,
+ "mean_token_accuracy": 0.7146433591842651,
+ "num_tokens": 29179904.0,
+ "step": 1781
+ },
+ {
+ "entropy": 1.2540696859359741,
+ "epoch": 3.6,
+ "grad_norm": 2.3021488189697266,
+ "learning_rate": 1.402020202020202e-06,
+ "loss": 1.2441315650939941,
+ "mean_token_accuracy": 0.697239875793457,
+ "num_tokens": 29196288.0,
+ "step": 1782
+ },
+ {
+ "entropy": 1.3095312118530273,
+ "epoch": 3.602020202020202,
+ "grad_norm": 2.3379111289978027,
+ "learning_rate": 1.4000000000000001e-06,
+ "loss": 1.299248218536377,
+ "mean_token_accuracy": 0.6789814233779907,
+ "num_tokens": 29212672.0,
+ "step": 1783
+ },
+ {
+ "entropy": 1.0785331726074219,
+ "epoch": 3.604040404040404,
+ "grad_norm": 2.1612391471862793,
+ "learning_rate": 1.3979797979797982e-06,
+ "loss": 1.0741904973983765,
+ "mean_token_accuracy": 0.7294821739196777,
+ "num_tokens": 29229056.0,
+ "step": 1784
+ },
+ {
+ "entropy": 1.5178064107894897,
+ "epoch": 3.606060606060606,
+ "grad_norm": 2.7717669010162354,
+ "learning_rate": 1.3959595959595961e-06,
+ "loss": 1.4960123300552368,
+ "mean_token_accuracy": 0.6555935740470886,
+ "num_tokens": 29245440.0,
+ "step": 1785
+ },
+ {
+ "entropy": 0.9794894456863403,
+ "epoch": 3.608080808080808,
+ "grad_norm": 2.128119707107544,
+ "learning_rate": 1.3939393939393942e-06,
+ "loss": 0.964859664440155,
+ "mean_token_accuracy": 0.7516487836837769,
+ "num_tokens": 29261824.0,
+ "step": 1786
+ },
+ {
+ "entropy": 1.1770693063735962,
+ "epoch": 3.61010101010101,
+ "grad_norm": 2.2583603858947754,
+ "learning_rate": 1.3919191919191921e-06,
+ "loss": 1.163985252380371,
+ "mean_token_accuracy": 0.7167806625366211,
+ "num_tokens": 29278208.0,
+ "step": 1787
+ },
+ {
+ "entropy": 1.2855029106140137,
+ "epoch": 3.6121212121212123,
+ "grad_norm": 2.1924304962158203,
+ "learning_rate": 1.38989898989899e-06,
+ "loss": 1.3204423189163208,
+ "mean_token_accuracy": 0.6933927536010742,
+ "num_tokens": 29294592.0,
+ "step": 1788
+ },
+ {
+ "entropy": 1.1483845710754395,
+ "epoch": 3.614141414141414,
+ "grad_norm": 2.414332151412964,
+ "learning_rate": 1.3878787878787881e-06,
+ "loss": 1.154718041419983,
+ "mean_token_accuracy": 0.6999267339706421,
+ "num_tokens": 29310976.0,
+ "step": 1789
+ },
+ {
+ "entropy": 1.3682032823562622,
+ "epoch": 3.616161616161616,
+ "grad_norm": 2.2198476791381836,
+ "learning_rate": 1.385858585858586e-06,
+ "loss": 1.3729476928710938,
+ "mean_token_accuracy": 0.6736077070236206,
+ "num_tokens": 29327360.0,
+ "step": 1790
+ },
+ {
+ "entropy": 1.0998579263687134,
+ "epoch": 3.618181818181818,
+ "grad_norm": 2.328645706176758,
+ "learning_rate": 1.3838383838383839e-06,
+ "loss": 1.0919283628463745,
+ "mean_token_accuracy": 0.7213605046272278,
+ "num_tokens": 29343744.0,
+ "step": 1791
+ },
+ {
+ "entropy": 1.4821339845657349,
+ "epoch": 3.6202020202020204,
+ "grad_norm": 2.346853256225586,
+ "learning_rate": 1.381818181818182e-06,
+ "loss": 1.4857574701309204,
+ "mean_token_accuracy": 0.6529677510261536,
+ "num_tokens": 29360128.0,
+ "step": 1792
+ },
+ {
+ "entropy": 1.2080271244049072,
+ "epoch": 3.6222222222222222,
+ "grad_norm": 2.4182422161102295,
+ "learning_rate": 1.3797979797979799e-06,
+ "loss": 1.2055883407592773,
+ "mean_token_accuracy": 0.7100635170936584,
+ "num_tokens": 29376512.0,
+ "step": 1793
+ },
+ {
+ "entropy": 1.2058414220809937,
+ "epoch": 3.624242424242424,
+ "grad_norm": 2.216625690460205,
+ "learning_rate": 1.377777777777778e-06,
+ "loss": 1.2196989059448242,
+ "mean_token_accuracy": 0.7110405564308167,
+ "num_tokens": 29392896.0,
+ "step": 1794
+ },
+ {
+ "entropy": 1.2888880968093872,
+ "epoch": 3.6262626262626263,
+ "grad_norm": 2.339319944381714,
+ "learning_rate": 1.3757575757575759e-06,
+ "loss": 1.277637004852295,
+ "mean_token_accuracy": 0.6922935843467712,
+ "num_tokens": 29409280.0,
+ "step": 1795
+ },
+ {
+ "entropy": 1.3091189861297607,
+ "epoch": 3.6282828282828286,
+ "grad_norm": 2.2296347618103027,
+ "learning_rate": 1.3737373737373738e-06,
+ "loss": 1.3214037418365479,
+ "mean_token_accuracy": 0.6828285455703735,
+ "num_tokens": 29425664.0,
+ "step": 1796
+ },
+ {
+ "entropy": 1.3359358310699463,
+ "epoch": 3.6303030303030304,
+ "grad_norm": 2.3027234077453613,
+ "learning_rate": 1.3717171717171718e-06,
+ "loss": 1.3537523746490479,
+ "mean_token_accuracy": 0.6944919228553772,
+ "num_tokens": 29442048.0,
+ "step": 1797
+ },
+ {
+ "entropy": 1.4622148275375366,
+ "epoch": 3.632323232323232,
+ "grad_norm": 2.2217557430267334,
+ "learning_rate": 1.3696969696969697e-06,
+ "loss": 1.4778163433074951,
+ "mean_token_accuracy": 0.6425867080688477,
+ "num_tokens": 29458432.0,
+ "step": 1798
+ },
+ {
+ "entropy": 1.1139435768127441,
+ "epoch": 3.6343434343434344,
+ "grad_norm": 2.1497981548309326,
+ "learning_rate": 1.3676767676767676e-06,
+ "loss": 1.1079224348068237,
+ "mean_token_accuracy": 0.7202613353729248,
+ "num_tokens": 29474816.0,
+ "step": 1799
+ },
+ {
+ "entropy": 1.4551507234573364,
+ "epoch": 3.6363636363636362,
+ "grad_norm": 2.138988971710205,
+ "learning_rate": 1.3656565656565657e-06,
+ "loss": 1.469781517982483,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 29491200.0,
+ "step": 1800
+ },
+ {
+ "epoch": 3.6363636363636362,
+ "eval_entropy": 1.3177791665638647,
+ "eval_loss": 1.5487139225006104,
+ "eval_mean_token_accuracy": 0.6448490720602774,
+ "eval_num_tokens": 29491200.0,
+ "eval_runtime": 43.82,
+ "eval_samples_per_second": 22.592,
+ "eval_steps_per_second": 2.83,
+ "step": 1800
+ },
+ {
+ "entropy": 1.3909705877304077,
+ "epoch": 3.6383838383838385,
+ "grad_norm": 2.2257578372955322,
+ "learning_rate": 1.3636363636363636e-06,
+ "loss": 1.4063682556152344,
+ "mean_token_accuracy": 0.6611504554748535,
+ "num_tokens": 29507584.0,
+ "step": 1801
+ },
+ {
+ "entropy": 1.2972772121429443,
+ "epoch": 3.6404040404040403,
+ "grad_norm": 2.3228883743286133,
+ "learning_rate": 1.3616161616161617e-06,
+ "loss": 1.2978641986846924,
+ "mean_token_accuracy": 0.6862481832504272,
+ "num_tokens": 29523968.0,
+ "step": 1802
+ },
+ {
+ "entropy": 0.8828009366989136,
+ "epoch": 3.6424242424242426,
+ "grad_norm": 2.294520616531372,
+ "learning_rate": 1.3595959595959596e-06,
+ "loss": 0.8818602561950684,
+ "mean_token_accuracy": 0.7627626061439514,
+ "num_tokens": 29540352.0,
+ "step": 1803
+ },
+ {
+ "entropy": 1.3855260610580444,
+ "epoch": 3.6444444444444444,
+ "grad_norm": 2.160240411758423,
+ "learning_rate": 1.357575757575758e-06,
+ "loss": 1.3808461427688599,
+ "mean_token_accuracy": 0.6831949353218079,
+ "num_tokens": 29556736.0,
+ "step": 1804
+ },
+ {
+ "entropy": 1.1665101051330566,
+ "epoch": 3.6464646464646466,
+ "grad_norm": 2.3000075817108154,
+ "learning_rate": 1.3555555555555558e-06,
+ "loss": 1.1676980257034302,
+ "mean_token_accuracy": 0.7067049145698547,
+ "num_tokens": 29573120.0,
+ "step": 1805
+ },
+ {
+ "entropy": 1.05939519405365,
+ "epoch": 3.6484848484848484,
+ "grad_norm": 2.204202651977539,
+ "learning_rate": 1.3535353535353537e-06,
+ "loss": 1.0654125213623047,
+ "mean_token_accuracy": 0.7197728157043457,
+ "num_tokens": 29589504.0,
+ "step": 1806
+ },
+ {
+ "entropy": 1.355467677116394,
+ "epoch": 3.6505050505050507,
+ "grad_norm": 2.264705181121826,
+ "learning_rate": 1.3515151515151518e-06,
+ "loss": 1.3571414947509766,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 29605888.0,
+ "step": 1807
+ },
+ {
+ "entropy": 1.1876951456069946,
+ "epoch": 3.6525252525252525,
+ "grad_norm": 2.2944509983062744,
+ "learning_rate": 1.3494949494949497e-06,
+ "loss": 1.1937611103057861,
+ "mean_token_accuracy": 0.7105520367622375,
+ "num_tokens": 29622272.0,
+ "step": 1808
+ },
+ {
+ "entropy": 1.410723090171814,
+ "epoch": 3.6545454545454543,
+ "grad_norm": 2.329960584640503,
+ "learning_rate": 1.3474747474747476e-06,
+ "loss": 1.4132624864578247,
+ "mean_token_accuracy": 0.656448483467102,
+ "num_tokens": 29638656.0,
+ "step": 1809
+ },
+ {
+ "entropy": 1.018915057182312,
+ "epoch": 3.6565656565656566,
+ "grad_norm": 2.1073148250579834,
+ "learning_rate": 1.3454545454545457e-06,
+ "loss": 1.017066478729248,
+ "mean_token_accuracy": 0.7398021221160889,
+ "num_tokens": 29655040.0,
+ "step": 1810
+ },
+ {
+ "entropy": 1.385291337966919,
+ "epoch": 3.658585858585859,
+ "grad_norm": 2.4099128246307373,
+ "learning_rate": 1.3434343434343436e-06,
+ "loss": 1.3809027671813965,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 29671424.0,
+ "step": 1811
+ },
+ {
+ "entropy": 1.0589433908462524,
+ "epoch": 3.6606060606060606,
+ "grad_norm": 2.3987228870391846,
+ "learning_rate": 1.3414141414141417e-06,
+ "loss": 1.051498293876648,
+ "mean_token_accuracy": 0.7296043038368225,
+ "num_tokens": 29687808.0,
+ "step": 1812
+ },
+ {
+ "entropy": 1.0399458408355713,
+ "epoch": 3.6626262626262625,
+ "grad_norm": 1.9951106309890747,
+ "learning_rate": 1.3393939393939395e-06,
+ "loss": 1.0482317209243774,
+ "mean_token_accuracy": 0.745175838470459,
+ "num_tokens": 29704192.0,
+ "step": 1813
+ },
+ {
+ "entropy": 1.3024410009384155,
+ "epoch": 3.6646464646464647,
+ "grad_norm": 2.1363778114318848,
+ "learning_rate": 1.3373737373737374e-06,
+ "loss": 1.2995185852050781,
+ "mean_token_accuracy": 0.6889960765838623,
+ "num_tokens": 29720576.0,
+ "step": 1814
+ },
+ {
+ "entropy": 1.604906678199768,
+ "epoch": 3.6666666666666665,
+ "grad_norm": 2.2837791442871094,
+ "learning_rate": 1.3353535353535355e-06,
+ "loss": 1.6025669574737549,
+ "mean_token_accuracy": 0.6281143426895142,
+ "num_tokens": 29736960.0,
+ "step": 1815
+ },
+ {
+ "entropy": 1.0479960441589355,
+ "epoch": 3.6686868686868688,
+ "grad_norm": 2.200199842453003,
+ "learning_rate": 1.3333333333333334e-06,
+ "loss": 1.0443310737609863,
+ "mean_token_accuracy": 0.7302149534225464,
+ "num_tokens": 29753344.0,
+ "step": 1816
+ },
+ {
+ "entropy": 1.1220474243164062,
+ "epoch": 3.6707070707070706,
+ "grad_norm": 2.278193712234497,
+ "learning_rate": 1.3313131313131313e-06,
+ "loss": 1.1253700256347656,
+ "mean_token_accuracy": 0.717391312122345,
+ "num_tokens": 29769728.0,
+ "step": 1817
+ },
+ {
+ "entropy": 0.7910162210464478,
+ "epoch": 3.672727272727273,
+ "grad_norm": 2.171074151992798,
+ "learning_rate": 1.3292929292929294e-06,
+ "loss": 0.7818440198898315,
+ "mean_token_accuracy": 0.7832193374633789,
+ "num_tokens": 29786112.0,
+ "step": 1818
+ },
+ {
+ "entropy": 1.2416874170303345,
+ "epoch": 3.6747474747474747,
+ "grad_norm": 2.41068959236145,
+ "learning_rate": 1.3272727272727273e-06,
+ "loss": 1.2441900968551636,
+ "mean_token_accuracy": 0.6918050646781921,
+ "num_tokens": 29802496.0,
+ "step": 1819
+ },
+ {
+ "entropy": 1.1947519779205322,
+ "epoch": 3.676767676767677,
+ "grad_norm": 2.3515799045562744,
+ "learning_rate": 1.3252525252525254e-06,
+ "loss": 1.1756401062011719,
+ "mean_token_accuracy": 0.7001098990440369,
+ "num_tokens": 29818880.0,
+ "step": 1820
+ },
+ {
+ "entropy": 1.0655851364135742,
+ "epoch": 3.6787878787878787,
+ "grad_norm": 2.3352251052856445,
+ "learning_rate": 1.3232323232323233e-06,
+ "loss": 1.0540491342544556,
+ "mean_token_accuracy": 0.7285051345825195,
+ "num_tokens": 29835264.0,
+ "step": 1821
+ },
+ {
+ "entropy": 1.1881550550460815,
+ "epoch": 3.680808080808081,
+ "grad_norm": 2.483917474746704,
+ "learning_rate": 1.3212121212121212e-06,
+ "loss": 1.199643611907959,
+ "mean_token_accuracy": 0.6998046040534973,
+ "num_tokens": 29851648.0,
+ "step": 1822
+ },
+ {
+ "entropy": 1.2031608819961548,
+ "epoch": 3.682828282828283,
+ "grad_norm": 2.1765546798706055,
+ "learning_rate": 1.3191919191919193e-06,
+ "loss": 1.2054451704025269,
+ "mean_token_accuracy": 0.7191011309623718,
+ "num_tokens": 29868032.0,
+ "step": 1823
+ },
+ {
+ "entropy": 0.8889259099960327,
+ "epoch": 3.6848484848484846,
+ "grad_norm": 2.3284575939178467,
+ "learning_rate": 1.3171717171717172e-06,
+ "loss": 0.8793114423751831,
+ "mean_token_accuracy": 0.7661211490631104,
+ "num_tokens": 29884416.0,
+ "step": 1824
+ },
+ {
+ "entropy": 1.1559280157089233,
+ "epoch": 3.686868686868687,
+ "grad_norm": 2.2942442893981934,
+ "learning_rate": 1.315151515151515e-06,
+ "loss": 1.1748852729797363,
+ "mean_token_accuracy": 0.7139105796813965,
+ "num_tokens": 29900800.0,
+ "step": 1825
+ },
+ {
+ "entropy": 1.1315678358078003,
+ "epoch": 3.688888888888889,
+ "grad_norm": 2.0435519218444824,
+ "learning_rate": 1.3131313131313134e-06,
+ "loss": 1.123443603515625,
+ "mean_token_accuracy": 0.7311308979988098,
+ "num_tokens": 29917184.0,
+ "step": 1826
+ },
+ {
+ "entropy": 1.063825249671936,
+ "epoch": 3.690909090909091,
+ "grad_norm": 2.3425393104553223,
+ "learning_rate": 1.3111111111111112e-06,
+ "loss": 1.0752053260803223,
+ "mean_token_accuracy": 0.7281997799873352,
+ "num_tokens": 29933568.0,
+ "step": 1827
+ },
+ {
+ "entropy": 0.9652242660522461,
+ "epoch": 3.6929292929292927,
+ "grad_norm": 2.2079033851623535,
+ "learning_rate": 1.3090909090909093e-06,
+ "loss": 0.969928503036499,
+ "mean_token_accuracy": 0.7507938742637634,
+ "num_tokens": 29949952.0,
+ "step": 1828
+ },
+ {
+ "entropy": 1.4131009578704834,
+ "epoch": 3.694949494949495,
+ "grad_norm": 2.368713617324829,
+ "learning_rate": 1.3070707070707072e-06,
+ "loss": 1.4113342761993408,
+ "mean_token_accuracy": 0.6670737862586975,
+ "num_tokens": 29966336.0,
+ "step": 1829
+ },
+ {
+ "entropy": 1.4447262287139893,
+ "epoch": 3.6969696969696972,
+ "grad_norm": 2.142131805419922,
+ "learning_rate": 1.3050505050505053e-06,
+ "loss": 1.4544841051101685,
+ "mean_token_accuracy": 0.669516384601593,
+ "num_tokens": 29982720.0,
+ "step": 1830
+ },
+ {
+ "entropy": 1.2524710893630981,
+ "epoch": 3.698989898989899,
+ "grad_norm": 2.096489429473877,
+ "learning_rate": 1.3030303030303032e-06,
+ "loss": 1.2251232862472534,
+ "mean_token_accuracy": 0.7231924533843994,
+ "num_tokens": 29999104.0,
+ "step": 1831
+ },
+ {
+ "entropy": 1.2173584699630737,
+ "epoch": 3.701010101010101,
+ "grad_norm": 2.265334367752075,
+ "learning_rate": 1.301010101010101e-06,
+ "loss": 1.2278194427490234,
+ "mean_token_accuracy": 0.7136052846908569,
+ "num_tokens": 30015488.0,
+ "step": 1832
+ },
+ {
+ "entropy": 1.1699647903442383,
+ "epoch": 3.703030303030303,
+ "grad_norm": 2.274156093597412,
+ "learning_rate": 1.2989898989898992e-06,
+ "loss": 1.1550461053848267,
+ "mean_token_accuracy": 0.7139716744422913,
+ "num_tokens": 30031872.0,
+ "step": 1833
+ },
+ {
+ "entropy": 1.113942265510559,
+ "epoch": 3.705050505050505,
+ "grad_norm": 2.386925220489502,
+ "learning_rate": 1.296969696969697e-06,
+ "loss": 1.1161434650421143,
+ "mean_token_accuracy": 0.7212994694709778,
+ "num_tokens": 30048256.0,
+ "step": 1834
+ },
+ {
+ "entropy": 1.4958065748214722,
+ "epoch": 3.707070707070707,
+ "grad_norm": 2.2243921756744385,
+ "learning_rate": 1.294949494949495e-06,
+ "loss": 1.4940879344940186,
+ "mean_token_accuracy": 0.6489985585212708,
+ "num_tokens": 30064640.0,
+ "step": 1835
+ },
+ {
+ "entropy": 1.047438144683838,
+ "epoch": 3.709090909090909,
+ "grad_norm": 2.237632989883423,
+ "learning_rate": 1.292929292929293e-06,
+ "loss": 1.0492076873779297,
+ "mean_token_accuracy": 0.7387640476226807,
+ "num_tokens": 30081024.0,
+ "step": 1836
+ },
+ {
+ "entropy": 1.4816311597824097,
+ "epoch": 3.7111111111111112,
+ "grad_norm": 2.2184505462646484,
+ "learning_rate": 1.290909090909091e-06,
+ "loss": 1.483510971069336,
+ "mean_token_accuracy": 0.660906195640564,
+ "num_tokens": 30097408.0,
+ "step": 1837
+ },
+ {
+ "entropy": 1.1734580993652344,
+ "epoch": 3.713131313131313,
+ "grad_norm": 2.284940242767334,
+ "learning_rate": 1.288888888888889e-06,
+ "loss": 1.1763725280761719,
+ "mean_token_accuracy": 0.708109438419342,
+ "num_tokens": 30113792.0,
+ "step": 1838
+ },
+ {
+ "entropy": 1.1073024272918701,
+ "epoch": 3.7151515151515153,
+ "grad_norm": 2.381448268890381,
+ "learning_rate": 1.286868686868687e-06,
+ "loss": 1.1168363094329834,
+ "mean_token_accuracy": 0.722337543964386,
+ "num_tokens": 30130176.0,
+ "step": 1839
+ },
+ {
+ "entropy": 1.2699110507965088,
+ "epoch": 3.717171717171717,
+ "grad_norm": 2.23447585105896,
+ "learning_rate": 1.2848484848484848e-06,
+ "loss": 1.2582776546478271,
+ "mean_token_accuracy": 0.6878358721733093,
+ "num_tokens": 30146560.0,
+ "step": 1840
+ },
+ {
+ "entropy": 1.421061635017395,
+ "epoch": 3.7191919191919194,
+ "grad_norm": 2.1020593643188477,
+ "learning_rate": 1.282828282828283e-06,
+ "loss": 1.415670394897461,
+ "mean_token_accuracy": 0.6722032427787781,
+ "num_tokens": 30162944.0,
+ "step": 1841
+ },
+ {
+ "entropy": 0.8924360871315002,
+ "epoch": 3.721212121212121,
+ "grad_norm": 2.1613609790802,
+ "learning_rate": 1.2808080808080808e-06,
+ "loss": 0.8864036202430725,
+ "mean_token_accuracy": 0.7616023421287537,
+ "num_tokens": 30179328.0,
+ "step": 1842
+ },
+ {
+ "entropy": 1.2242110967636108,
+ "epoch": 3.723232323232323,
+ "grad_norm": 2.472944498062134,
+ "learning_rate": 1.2787878787878787e-06,
+ "loss": 1.227367877960205,
+ "mean_token_accuracy": 0.6939423680305481,
+ "num_tokens": 30195712.0,
+ "step": 1843
+ },
+ {
+ "entropy": 1.2816494703292847,
+ "epoch": 3.7252525252525253,
+ "grad_norm": 2.123680353164673,
+ "learning_rate": 1.2767676767676768e-06,
+ "loss": 1.2535889148712158,
+ "mean_token_accuracy": 0.6894845962524414,
+ "num_tokens": 30212096.0,
+ "step": 1844
+ },
+ {
+ "entropy": 1.0055866241455078,
+ "epoch": 3.7272727272727275,
+ "grad_norm": 2.2397797107696533,
+ "learning_rate": 1.2747474747474747e-06,
+ "loss": 1.0046356916427612,
+ "mean_token_accuracy": 0.7375427484512329,
+ "num_tokens": 30228480.0,
+ "step": 1845
+ },
+ {
+ "entropy": 0.9162007570266724,
+ "epoch": 3.7292929292929293,
+ "grad_norm": 2.2464940547943115,
+ "learning_rate": 1.2727272727272728e-06,
+ "loss": 0.9192468523979187,
+ "mean_token_accuracy": 0.7609306573867798,
+ "num_tokens": 30244864.0,
+ "step": 1846
+ },
+ {
+ "entropy": 1.3691668510437012,
+ "epoch": 3.731313131313131,
+ "grad_norm": 2.766839027404785,
+ "learning_rate": 1.270707070707071e-06,
+ "loss": 1.3715851306915283,
+ "mean_token_accuracy": 0.6667684316635132,
+ "num_tokens": 30261248.0,
+ "step": 1847
+ },
+ {
+ "entropy": 1.140328049659729,
+ "epoch": 3.7333333333333334,
+ "grad_norm": 2.1093955039978027,
+ "learning_rate": 1.268686868686869e-06,
+ "loss": 1.1491321325302124,
+ "mean_token_accuracy": 0.7158646583557129,
+ "num_tokens": 30277632.0,
+ "step": 1848
+ },
+ {
+ "entropy": 1.3393927812576294,
+ "epoch": 3.735353535353535,
+ "grad_norm": 2.216357469558716,
+ "learning_rate": 1.2666666666666669e-06,
+ "loss": 1.3406658172607422,
+ "mean_token_accuracy": 0.6829506754875183,
+ "num_tokens": 30294016.0,
+ "step": 1849
+ },
+ {
+ "entropy": 1.0507596731185913,
+ "epoch": 3.7373737373737375,
+ "grad_norm": 2.287649154663086,
+ "learning_rate": 1.2646464646464648e-06,
+ "loss": 1.0469536781311035,
+ "mean_token_accuracy": 0.7306423783302307,
+ "num_tokens": 30310400.0,
+ "step": 1850
+ },
+ {
+ "epoch": 3.7373737373737375,
+ "eval_entropy": 1.3188492747083786,
+ "eval_loss": 1.5484505891799927,
+ "eval_mean_token_accuracy": 0.6448682820604693,
+ "eval_num_tokens": 30310400.0,
+ "eval_runtime": 43.7649,
+ "eval_samples_per_second": 22.621,
+ "eval_steps_per_second": 2.833,
+ "step": 1850
+ },
+ {
+ "entropy": 1.0057004690170288,
+ "epoch": 3.7393939393939393,
+ "grad_norm": 2.1135971546173096,
+ "learning_rate": 1.2626262626262629e-06,
+ "loss": 1.0220353603363037,
+ "mean_token_accuracy": 0.7348558902740479,
+ "num_tokens": 30326784.0,
+ "step": 1851
+ },
+ {
+ "entropy": 1.185084581375122,
+ "epoch": 3.7414141414141415,
+ "grad_norm": 2.388561725616455,
+ "learning_rate": 1.2606060606060608e-06,
+ "loss": 1.205190658569336,
+ "mean_token_accuracy": 0.7070102691650391,
+ "num_tokens": 30343168.0,
+ "step": 1852
+ },
+ {
+ "entropy": 1.2007622718811035,
+ "epoch": 3.7434343434343433,
+ "grad_norm": 2.3002219200134277,
+ "learning_rate": 1.2585858585858587e-06,
+ "loss": 1.196336269378662,
+ "mean_token_accuracy": 0.7073155641555786,
+ "num_tokens": 30359552.0,
+ "step": 1853
+ },
+ {
+ "entropy": 0.8792212605476379,
+ "epoch": 3.7454545454545456,
+ "grad_norm": 2.1559953689575195,
+ "learning_rate": 1.2565656565656568e-06,
+ "loss": 0.8786029815673828,
+ "mean_token_accuracy": 0.7723497748374939,
+ "num_tokens": 30375936.0,
+ "step": 1854
+ },
+ {
+ "entropy": 1.0509400367736816,
+ "epoch": 3.7474747474747474,
+ "grad_norm": 2.3014485836029053,
+ "learning_rate": 1.2545454545454546e-06,
+ "loss": 1.0421940088272095,
+ "mean_token_accuracy": 0.741389811038971,
+ "num_tokens": 30392320.0,
+ "step": 1855
+ },
+ {
+ "entropy": 1.4965882301330566,
+ "epoch": 3.7494949494949497,
+ "grad_norm": 2.255364179611206,
+ "learning_rate": 1.2525252525252527e-06,
+ "loss": 1.5137383937835693,
+ "mean_token_accuracy": 0.6535173654556274,
+ "num_tokens": 30408704.0,
+ "step": 1856
+ },
+ {
+ "entropy": 1.5112299919128418,
+ "epoch": 3.7515151515151515,
+ "grad_norm": 2.356682062149048,
+ "learning_rate": 1.2505050505050506e-06,
+ "loss": 1.4965360164642334,
+ "mean_token_accuracy": 0.639167070388794,
+ "num_tokens": 30425088.0,
+ "step": 1857
+ },
+ {
+ "entropy": 0.7364286780357361,
+ "epoch": 3.7535353535353533,
+ "grad_norm": 2.0973432064056396,
+ "learning_rate": 1.2484848484848485e-06,
+ "loss": 0.7423363327980042,
+ "mean_token_accuracy": 0.7923790812492371,
+ "num_tokens": 30441472.0,
+ "step": 1858
+ },
+ {
+ "entropy": 1.094409704208374,
+ "epoch": 3.7555555555555555,
+ "grad_norm": 2.174180746078491,
+ "learning_rate": 1.2464646464646466e-06,
+ "loss": 1.0954921245574951,
+ "mean_token_accuracy": 0.7165974378585815,
+ "num_tokens": 30457856.0,
+ "step": 1859
+ },
+ {
+ "entropy": 1.1821874380111694,
+ "epoch": 3.757575757575758,
+ "grad_norm": 2.253767728805542,
+ "learning_rate": 1.2444444444444445e-06,
+ "loss": 1.1888916492462158,
+ "mean_token_accuracy": 0.7046898007392883,
+ "num_tokens": 30474240.0,
+ "step": 1860
+ },
+ {
+ "entropy": 1.1281737089157104,
+ "epoch": 3.7595959595959596,
+ "grad_norm": 2.378880023956299,
+ "learning_rate": 1.2424242424242424e-06,
+ "loss": 1.1276686191558838,
+ "mean_token_accuracy": 0.712506115436554,
+ "num_tokens": 30490624.0,
+ "step": 1861
+ },
+ {
+ "entropy": 1.1477409601211548,
+ "epoch": 3.7616161616161614,
+ "grad_norm": 2.2524328231811523,
+ "learning_rate": 1.2404040404040405e-06,
+ "loss": 1.169572114944458,
+ "mean_token_accuracy": 0.7145823240280151,
+ "num_tokens": 30507008.0,
+ "step": 1862
+ },
+ {
+ "entropy": 1.1877309083938599,
+ "epoch": 3.7636363636363637,
+ "grad_norm": 2.5215635299682617,
+ "learning_rate": 1.2383838383838386e-06,
+ "loss": 1.1812067031860352,
+ "mean_token_accuracy": 0.7001709938049316,
+ "num_tokens": 30523392.0,
+ "step": 1863
+ },
+ {
+ "entropy": 1.2082164287567139,
+ "epoch": 3.765656565656566,
+ "grad_norm": 2.248847484588623,
+ "learning_rate": 1.2363636363636365e-06,
+ "loss": 1.2150661945343018,
+ "mean_token_accuracy": 0.7056668400764465,
+ "num_tokens": 30539776.0,
+ "step": 1864
+ },
+ {
+ "entropy": 1.0533868074417114,
+ "epoch": 3.7676767676767677,
+ "grad_norm": 2.4208297729492188,
+ "learning_rate": 1.2343434343434346e-06,
+ "loss": 1.0599069595336914,
+ "mean_token_accuracy": 0.7183683514595032,
+ "num_tokens": 30556160.0,
+ "step": 1865
+ },
+ {
+ "entropy": 1.3612878322601318,
+ "epoch": 3.7696969696969695,
+ "grad_norm": 2.2831575870513916,
+ "learning_rate": 1.2323232323232325e-06,
+ "loss": 1.359129548072815,
+ "mean_token_accuracy": 0.681485116481781,
+ "num_tokens": 30572544.0,
+ "step": 1866
+ },
+ {
+ "entropy": 1.3154997825622559,
+ "epoch": 3.771717171717172,
+ "grad_norm": 2.2212936878204346,
+ "learning_rate": 1.2303030303030304e-06,
+ "loss": 1.3217754364013672,
+ "mean_token_accuracy": 0.6781265139579773,
+ "num_tokens": 30588928.0,
+ "step": 1867
+ },
+ {
+ "entropy": 1.3559744358062744,
+ "epoch": 3.7737373737373736,
+ "grad_norm": 2.317963123321533,
+ "learning_rate": 1.2282828282828285e-06,
+ "loss": 1.3600891828536987,
+ "mean_token_accuracy": 0.6749511361122131,
+ "num_tokens": 30605312.0,
+ "step": 1868
+ },
+ {
+ "entropy": 1.0591025352478027,
+ "epoch": 3.775757575757576,
+ "grad_norm": 2.2434401512145996,
+ "learning_rate": 1.2262626262626263e-06,
+ "loss": 1.069009780883789,
+ "mean_token_accuracy": 0.7206888198852539,
+ "num_tokens": 30621696.0,
+ "step": 1869
+ },
+ {
+ "entropy": 1.4170074462890625,
+ "epoch": 3.7777777777777777,
+ "grad_norm": 2.395284652709961,
+ "learning_rate": 1.2242424242424242e-06,
+ "loss": 1.4480173587799072,
+ "mean_token_accuracy": 0.6687225103378296,
+ "num_tokens": 30638080.0,
+ "step": 1870
+ },
+ {
+ "entropy": 1.2455501556396484,
+ "epoch": 3.77979797979798,
+ "grad_norm": 2.308814525604248,
+ "learning_rate": 1.2222222222222223e-06,
+ "loss": 1.238303542137146,
+ "mean_token_accuracy": 0.693514883518219,
+ "num_tokens": 30654464.0,
+ "step": 1871
+ },
+ {
+ "entropy": 1.167949914932251,
+ "epoch": 3.7818181818181817,
+ "grad_norm": 2.292120933532715,
+ "learning_rate": 1.2202020202020202e-06,
+ "loss": 1.16925847530365,
+ "mean_token_accuracy": 0.7136052846908569,
+ "num_tokens": 30670848.0,
+ "step": 1872
+ },
+ {
+ "entropy": 1.1319386959075928,
+ "epoch": 3.783838383838384,
+ "grad_norm": 2.2560858726501465,
+ "learning_rate": 1.2181818181818183e-06,
+ "loss": 1.1299757957458496,
+ "mean_token_accuracy": 0.7148265838623047,
+ "num_tokens": 30687232.0,
+ "step": 1873
+ },
+ {
+ "entropy": 1.1161472797393799,
+ "epoch": 3.785858585858586,
+ "grad_norm": 2.375944137573242,
+ "learning_rate": 1.2161616161616164e-06,
+ "loss": 1.1136269569396973,
+ "mean_token_accuracy": 0.7096971273422241,
+ "num_tokens": 30703616.0,
+ "step": 1874
+ },
+ {
+ "entropy": 1.223272442817688,
+ "epoch": 3.787878787878788,
+ "grad_norm": 2.5566787719726562,
+ "learning_rate": 1.2141414141414143e-06,
+ "loss": 1.2140392065048218,
+ "mean_token_accuracy": 0.6939423680305481,
+ "num_tokens": 30720000.0,
+ "step": 1875
+ },
+ {
+ "entropy": 1.5127382278442383,
+ "epoch": 3.78989898989899,
+ "grad_norm": 2.2809665203094482,
+ "learning_rate": 1.2121212121212122e-06,
+ "loss": 1.508399248123169,
+ "mean_token_accuracy": 0.6579140424728394,
+ "num_tokens": 30736384.0,
+ "step": 1876
+ },
+ {
+ "entropy": 1.344763994216919,
+ "epoch": 3.7919191919191917,
+ "grad_norm": 2.3228111267089844,
+ "learning_rate": 1.2101010101010103e-06,
+ "loss": 1.3470673561096191,
+ "mean_token_accuracy": 0.6806302070617676,
+ "num_tokens": 30752768.0,
+ "step": 1877
+ },
+ {
+ "entropy": 1.2828526496887207,
+ "epoch": 3.793939393939394,
+ "grad_norm": 2.51246976852417,
+ "learning_rate": 1.2080808080808082e-06,
+ "loss": 1.2934420108795166,
+ "mean_token_accuracy": 0.6673790812492371,
+ "num_tokens": 30769152.0,
+ "step": 1878
+ },
+ {
+ "entropy": 0.9060937762260437,
+ "epoch": 3.795959595959596,
+ "grad_norm": 2.1415040493011475,
+ "learning_rate": 1.206060606060606e-06,
+ "loss": 0.8956457376480103,
+ "mean_token_accuracy": 0.7670371532440186,
+ "num_tokens": 30785536.0,
+ "step": 1879
+ },
+ {
+ "entropy": 1.1543211936950684,
+ "epoch": 3.797979797979798,
+ "grad_norm": 2.426781415939331,
+ "learning_rate": 1.2040404040404042e-06,
+ "loss": 1.1588597297668457,
+ "mean_token_accuracy": 0.7090253829956055,
+ "num_tokens": 30801920.0,
+ "step": 1880
+ },
+ {
+ "entropy": 1.3253799676895142,
+ "epoch": 3.8,
+ "grad_norm": 2.4828150272369385,
+ "learning_rate": 1.202020202020202e-06,
+ "loss": 1.3082318305969238,
+ "mean_token_accuracy": 0.6839887499809265,
+ "num_tokens": 30818304.0,
+ "step": 1881
+ },
+ {
+ "entropy": 1.1644330024719238,
+ "epoch": 3.802020202020202,
+ "grad_norm": 2.3429148197174072,
+ "learning_rate": 1.2000000000000002e-06,
+ "loss": 1.1645771265029907,
+ "mean_token_accuracy": 0.7025524973869324,
+ "num_tokens": 30834688.0,
+ "step": 1882
+ },
+ {
+ "entropy": 1.1643813848495483,
+ "epoch": 3.804040404040404,
+ "grad_norm": 2.2955002784729004,
+ "learning_rate": 1.197979797979798e-06,
+ "loss": 1.1721268892288208,
+ "mean_token_accuracy": 0.7041401863098145,
+ "num_tokens": 30851072.0,
+ "step": 1883
+ },
+ {
+ "entropy": 1.0957778692245483,
+ "epoch": 3.806060606060606,
+ "grad_norm": 2.244861125946045,
+ "learning_rate": 1.1959595959595961e-06,
+ "loss": 1.1006194353103638,
+ "mean_token_accuracy": 0.7057889699935913,
+ "num_tokens": 30867456.0,
+ "step": 1884
+ },
+ {
+ "entropy": 1.420525074005127,
+ "epoch": 3.808080808080808,
+ "grad_norm": 2.376477003097534,
+ "learning_rate": 1.193939393939394e-06,
+ "loss": 1.4241583347320557,
+ "mean_token_accuracy": 0.662493884563446,
+ "num_tokens": 30883840.0,
+ "step": 1885
+ },
+ {
+ "entropy": 1.4050343036651611,
+ "epoch": 3.81010101010101,
+ "grad_norm": 2.310051202774048,
+ "learning_rate": 1.1919191919191921e-06,
+ "loss": 1.4288474321365356,
+ "mean_token_accuracy": 0.6623107194900513,
+ "num_tokens": 30900224.0,
+ "step": 1886
+ },
+ {
+ "entropy": 1.1658165454864502,
+ "epoch": 3.812121212121212,
+ "grad_norm": 2.1743791103363037,
+ "learning_rate": 1.18989898989899e-06,
+ "loss": 1.1644586324691772,
+ "mean_token_accuracy": 0.7122007608413696,
+ "num_tokens": 30916608.0,
+ "step": 1887
+ },
+ {
+ "entropy": 1.1667358875274658,
+ "epoch": 3.8141414141414143,
+ "grad_norm": 2.092580556869507,
+ "learning_rate": 1.187878787878788e-06,
+ "loss": 1.1762518882751465,
+ "mean_token_accuracy": 0.718551516532898,
+ "num_tokens": 30932992.0,
+ "step": 1888
+ },
+ {
+ "entropy": 1.2293628454208374,
+ "epoch": 3.816161616161616,
+ "grad_norm": 2.2432591915130615,
+ "learning_rate": 1.185858585858586e-06,
+ "loss": 1.249151587486267,
+ "mean_token_accuracy": 0.7038959264755249,
+ "num_tokens": 30949376.0,
+ "step": 1889
+ },
+ {
+ "entropy": 1.104671597480774,
+ "epoch": 3.8181818181818183,
+ "grad_norm": 2.7913901805877686,
+ "learning_rate": 1.183838383838384e-06,
+ "loss": 1.107041597366333,
+ "mean_token_accuracy": 0.7236809730529785,
+ "num_tokens": 30965760.0,
+ "step": 1890
+ },
+ {
+ "entropy": 0.9601510763168335,
+ "epoch": 3.82020202020202,
+ "grad_norm": 2.0736911296844482,
+ "learning_rate": 1.181818181818182e-06,
+ "loss": 0.9680359363555908,
+ "mean_token_accuracy": 0.7562286257743835,
+ "num_tokens": 30982144.0,
+ "step": 1891
+ },
+ {
+ "entropy": 1.2994087934494019,
+ "epoch": 3.822222222222222,
+ "grad_norm": 2.2076780796051025,
+ "learning_rate": 1.1797979797979799e-06,
+ "loss": 1.3263574838638306,
+ "mean_token_accuracy": 0.6968123912811279,
+ "num_tokens": 30998528.0,
+ "step": 1892
+ },
+ {
+ "entropy": 1.3631376028060913,
+ "epoch": 3.824242424242424,
+ "grad_norm": 2.340932846069336,
+ "learning_rate": 1.1777777777777778e-06,
+ "loss": 1.3866732120513916,
+ "mean_token_accuracy": 0.6775158643722534,
+ "num_tokens": 31014912.0,
+ "step": 1893
+ },
+ {
+ "entropy": 0.8883916735649109,
+ "epoch": 3.8262626262626265,
+ "grad_norm": 2.2482478618621826,
+ "learning_rate": 1.1757575757575759e-06,
+ "loss": 0.8972976207733154,
+ "mean_token_accuracy": 0.7602589130401611,
+ "num_tokens": 31031296.0,
+ "step": 1894
+ },
+ {
+ "entropy": 1.2881001234054565,
+ "epoch": 3.8282828282828283,
+ "grad_norm": 2.2452962398529053,
+ "learning_rate": 1.173737373737374e-06,
+ "loss": 1.298166036605835,
+ "mean_token_accuracy": 0.6886907815933228,
+ "num_tokens": 31047680.0,
+ "step": 1895
+ },
+ {
+ "entropy": 1.2942661046981812,
+ "epoch": 3.83030303030303,
+ "grad_norm": 2.5083208084106445,
+ "learning_rate": 1.1717171717171719e-06,
+ "loss": 1.3013086318969727,
+ "mean_token_accuracy": 0.6803248524665833,
+ "num_tokens": 31064064.0,
+ "step": 1896
+ },
+ {
+ "entropy": 1.1769400835037231,
+ "epoch": 3.8323232323232324,
+ "grad_norm": 2.2185699939727783,
+ "learning_rate": 1.1696969696969697e-06,
+ "loss": 1.1732335090637207,
+ "mean_token_accuracy": 0.7107352018356323,
+ "num_tokens": 31080448.0,
+ "step": 1897
+ },
+ {
+ "entropy": 1.3242368698120117,
+ "epoch": 3.8343434343434346,
+ "grad_norm": 2.153888702392578,
+ "learning_rate": 1.1676767676767678e-06,
+ "loss": 1.3406283855438232,
+ "mean_token_accuracy": 0.6897899508476257,
+ "num_tokens": 31096832.0,
+ "step": 1898
+ },
+ {
+ "entropy": 0.9292052984237671,
+ "epoch": 3.8363636363636364,
+ "grad_norm": 2.1435623168945312,
+ "learning_rate": 1.1656565656565657e-06,
+ "loss": 0.9380660057067871,
+ "mean_token_accuracy": 0.7523204684257507,
+ "num_tokens": 31113216.0,
+ "step": 1899
+ },
+ {
+ "entropy": 1.2560123205184937,
+ "epoch": 3.8383838383838382,
+ "grad_norm": 2.292471408843994,
+ "learning_rate": 1.1636363636363638e-06,
+ "loss": 1.2524765729904175,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 31129600.0,
+ "step": 1900
+ },
+ {
+ "epoch": 3.8383838383838382,
+ "eval_entropy": 1.323313660679325,
+ "eval_loss": 1.5475536584854126,
+ "eval_mean_token_accuracy": 0.6447510724106142,
+ "eval_num_tokens": 31129600.0,
+ "eval_runtime": 43.7651,
+ "eval_samples_per_second": 22.621,
+ "eval_steps_per_second": 2.833,
+ "step": 1900
+ },
+ {
+ "entropy": 1.0595868825912476,
+ "epoch": 3.8404040404040405,
+ "grad_norm": 2.2940235137939453,
+ "learning_rate": 1.1616161616161617e-06,
+ "loss": 1.0685131549835205,
+ "mean_token_accuracy": 0.7346116304397583,
+ "num_tokens": 31145984.0,
+ "step": 1901
+ },
+ {
+ "entropy": 1.1705970764160156,
+ "epoch": 3.8424242424242423,
+ "grad_norm": 2.200145959854126,
+ "learning_rate": 1.1595959595959596e-06,
+ "loss": 1.1744719743728638,
+ "mean_token_accuracy": 0.7096360325813293,
+ "num_tokens": 31162368.0,
+ "step": 1902
+ },
+ {
+ "entropy": 1.1404083967208862,
+ "epoch": 3.8444444444444446,
+ "grad_norm": 2.3402581214904785,
+ "learning_rate": 1.1575757575757577e-06,
+ "loss": 1.154109239578247,
+ "mean_token_accuracy": 0.7090253829956055,
+ "num_tokens": 31178752.0,
+ "step": 1903
+ },
+ {
+ "entropy": 1.0651684999465942,
+ "epoch": 3.8464646464646464,
+ "grad_norm": 2.1707308292388916,
+ "learning_rate": 1.1555555555555556e-06,
+ "loss": 1.0661014318466187,
+ "mean_token_accuracy": 0.7322300672531128,
+ "num_tokens": 31195136.0,
+ "step": 1904
+ },
+ {
+ "entropy": 1.4612106084823608,
+ "epoch": 3.8484848484848486,
+ "grad_norm": 2.3446035385131836,
+ "learning_rate": 1.1535353535353535e-06,
+ "loss": 1.4408762454986572,
+ "mean_token_accuracy": 0.6595017313957214,
+ "num_tokens": 31211520.0,
+ "step": 1905
+ },
+ {
+ "entropy": 1.2062592506408691,
+ "epoch": 3.8505050505050504,
+ "grad_norm": 2.244398593902588,
+ "learning_rate": 1.1515151515151516e-06,
+ "loss": 1.2011905908584595,
+ "mean_token_accuracy": 0.7075598239898682,
+ "num_tokens": 31227904.0,
+ "step": 1906
+ },
+ {
+ "entropy": 1.0715900659561157,
+ "epoch": 3.8525252525252527,
+ "grad_norm": 2.2543070316314697,
+ "learning_rate": 1.1494949494949497e-06,
+ "loss": 1.0634649991989136,
+ "mean_token_accuracy": 0.7305202484130859,
+ "num_tokens": 31244288.0,
+ "step": 1907
+ },
+ {
+ "entropy": 1.6116880178451538,
+ "epoch": 3.8545454545454545,
+ "grad_norm": 2.3540494441986084,
+ "learning_rate": 1.1474747474747476e-06,
+ "loss": 1.6299524307250977,
+ "mean_token_accuracy": 0.6351978778839111,
+ "num_tokens": 31260672.0,
+ "step": 1908
+ },
+ {
+ "entropy": 1.470803141593933,
+ "epoch": 3.8565656565656568,
+ "grad_norm": 2.2863407135009766,
+ "learning_rate": 1.1454545454545457e-06,
+ "loss": 1.4692970514297485,
+ "mean_token_accuracy": 0.6576697826385498,
+ "num_tokens": 31277056.0,
+ "step": 1909
+ },
+ {
+ "entropy": 1.0824670791625977,
+ "epoch": 3.8585858585858586,
+ "grad_norm": 2.3184683322906494,
+ "learning_rate": 1.1434343434343436e-06,
+ "loss": 1.0677670240402222,
+ "mean_token_accuracy": 0.7219101190567017,
+ "num_tokens": 31293440.0,
+ "step": 1910
+ },
+ {
+ "entropy": 1.027206540107727,
+ "epoch": 3.8606060606060604,
+ "grad_norm": 2.4096450805664062,
+ "learning_rate": 1.1414141414141414e-06,
+ "loss": 1.0224218368530273,
+ "mean_token_accuracy": 0.7347947955131531,
+ "num_tokens": 31309824.0,
+ "step": 1911
+ },
+ {
+ "entropy": 1.1143090724945068,
+ "epoch": 3.8626262626262626,
+ "grad_norm": 2.0057880878448486,
+ "learning_rate": 1.1393939393939395e-06,
+ "loss": 1.1075199842453003,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 31326208.0,
+ "step": 1912
+ },
+ {
+ "entropy": 1.299835205078125,
+ "epoch": 3.864646464646465,
+ "grad_norm": 2.554501533508301,
+ "learning_rate": 1.1373737373737374e-06,
+ "loss": 1.2906074523925781,
+ "mean_token_accuracy": 0.681485116481781,
+ "num_tokens": 31342592.0,
+ "step": 1913
+ },
+ {
+ "entropy": 1.289318561553955,
+ "epoch": 3.8666666666666667,
+ "grad_norm": 2.4257376194000244,
+ "learning_rate": 1.1353535353535353e-06,
+ "loss": 1.281335711479187,
+ "mean_token_accuracy": 0.678798258304596,
+ "num_tokens": 31358976.0,
+ "step": 1914
+ },
+ {
+ "entropy": 1.0814216136932373,
+ "epoch": 3.8686868686868685,
+ "grad_norm": 2.5448758602142334,
+ "learning_rate": 1.1333333333333334e-06,
+ "loss": 1.0837101936340332,
+ "mean_token_accuracy": 0.7264899611473083,
+ "num_tokens": 31375360.0,
+ "step": 1915
+ },
+ {
+ "entropy": 0.8491103649139404,
+ "epoch": 3.8707070707070708,
+ "grad_norm": 2.0053293704986572,
+ "learning_rate": 1.1313131313131315e-06,
+ "loss": 0.8459927439689636,
+ "mean_token_accuracy": 0.775036633014679,
+ "num_tokens": 31391744.0,
+ "step": 1916
+ },
+ {
+ "entropy": 1.2331805229187012,
+ "epoch": 3.8727272727272726,
+ "grad_norm": 2.1101794242858887,
+ "learning_rate": 1.1292929292929294e-06,
+ "loss": 1.241546869277954,
+ "mean_token_accuracy": 0.7051783204078674,
+ "num_tokens": 31408128.0,
+ "step": 1917
+ },
+ {
+ "entropy": 0.8649861812591553,
+ "epoch": 3.874747474747475,
+ "grad_norm": 2.098615884780884,
+ "learning_rate": 1.1272727272727275e-06,
+ "loss": 0.8645999431610107,
+ "mean_token_accuracy": 0.7702125310897827,
+ "num_tokens": 31424512.0,
+ "step": 1918
+ },
+ {
+ "entropy": 1.1396632194519043,
+ "epoch": 3.8767676767676766,
+ "grad_norm": 2.2155094146728516,
+ "learning_rate": 1.1252525252525254e-06,
+ "loss": 1.1333739757537842,
+ "mean_token_accuracy": 0.7166585326194763,
+ "num_tokens": 31440896.0,
+ "step": 1919
+ },
+ {
+ "entropy": 1.375836968421936,
+ "epoch": 3.878787878787879,
+ "grad_norm": 2.3003385066986084,
+ "learning_rate": 1.1232323232323233e-06,
+ "loss": 1.379508376121521,
+ "mean_token_accuracy": 0.6699438095092773,
+ "num_tokens": 31457280.0,
+ "step": 1920
+ },
+ {
+ "entropy": 1.2705941200256348,
+ "epoch": 3.8808080808080807,
+ "grad_norm": 2.156363010406494,
+ "learning_rate": 1.1212121212121214e-06,
+ "loss": 1.266032099723816,
+ "mean_token_accuracy": 0.6869198679924011,
+ "num_tokens": 31473664.0,
+ "step": 1921
+ },
+ {
+ "entropy": 1.6494578123092651,
+ "epoch": 3.882828282828283,
+ "grad_norm": 2.420069932937622,
+ "learning_rate": 1.1191919191919193e-06,
+ "loss": 1.6762641668319702,
+ "mean_token_accuracy": 0.6144357323646545,
+ "num_tokens": 31490048.0,
+ "step": 1922
+ },
+ {
+ "entropy": 0.9549956917762756,
+ "epoch": 3.8848484848484848,
+ "grad_norm": 2.199296236038208,
+ "learning_rate": 1.1171717171717172e-06,
+ "loss": 0.9642987251281738,
+ "mean_token_accuracy": 0.7506717443466187,
+ "num_tokens": 31506432.0,
+ "step": 1923
+ },
+ {
+ "entropy": 1.5379301309585571,
+ "epoch": 3.886868686868687,
+ "grad_norm": 2.2627663612365723,
+ "learning_rate": 1.1151515151515153e-06,
+ "loss": 1.5375440120697021,
+ "mean_token_accuracy": 0.6497313380241394,
+ "num_tokens": 31522816.0,
+ "step": 1924
+ },
+ {
+ "entropy": 1.009248971939087,
+ "epoch": 3.888888888888889,
+ "grad_norm": 2.142307758331299,
+ "learning_rate": 1.1131313131313131e-06,
+ "loss": 1.014758586883545,
+ "mean_token_accuracy": 0.7470077872276306,
+ "num_tokens": 31539200.0,
+ "step": 1925
+ },
+ {
+ "entropy": 1.1543548107147217,
+ "epoch": 3.8909090909090907,
+ "grad_norm": 2.2896368503570557,
+ "learning_rate": 1.111111111111111e-06,
+ "loss": 1.169635534286499,
+ "mean_token_accuracy": 0.7079873085021973,
+ "num_tokens": 31555584.0,
+ "step": 1926
+ },
+ {
+ "entropy": 1.1072580814361572,
+ "epoch": 3.892929292929293,
+ "grad_norm": 2.4316368103027344,
+ "learning_rate": 1.1090909090909093e-06,
+ "loss": 1.0753037929534912,
+ "mean_token_accuracy": 0.7245358824729919,
+ "num_tokens": 31571968.0,
+ "step": 1927
+ },
+ {
+ "entropy": 1.0660669803619385,
+ "epoch": 3.894949494949495,
+ "grad_norm": 2.2569425106048584,
+ "learning_rate": 1.1070707070707072e-06,
+ "loss": 1.0584138631820679,
+ "mean_token_accuracy": 0.7323521971702576,
+ "num_tokens": 31588352.0,
+ "step": 1928
+ },
+ {
+ "entropy": 1.4635326862335205,
+ "epoch": 3.896969696969697,
+ "grad_norm": 2.4725160598754883,
+ "learning_rate": 1.1050505050505051e-06,
+ "loss": 1.4772144556045532,
+ "mean_token_accuracy": 0.6534562706947327,
+ "num_tokens": 31604736.0,
+ "step": 1929
+ },
+ {
+ "entropy": 1.2802455425262451,
+ "epoch": 3.898989898989899,
+ "grad_norm": 2.188870906829834,
+ "learning_rate": 1.1030303030303032e-06,
+ "loss": 1.2900553941726685,
+ "mean_token_accuracy": 0.6868588328361511,
+ "num_tokens": 31621120.0,
+ "step": 1930
+ },
+ {
+ "entropy": 1.0175695419311523,
+ "epoch": 3.901010101010101,
+ "grad_norm": 2.177603244781494,
+ "learning_rate": 1.1010101010101011e-06,
+ "loss": 1.0199849605560303,
+ "mean_token_accuracy": 0.7407791614532471,
+ "num_tokens": 31637504.0,
+ "step": 1931
+ },
+ {
+ "entropy": 1.0328937768936157,
+ "epoch": 3.9030303030303033,
+ "grad_norm": 2.3460423946380615,
+ "learning_rate": 1.098989898989899e-06,
+ "loss": 1.0519663095474243,
+ "mean_token_accuracy": 0.7301538586616516,
+ "num_tokens": 31653888.0,
+ "step": 1932
+ },
+ {
+ "entropy": 1.3149690628051758,
+ "epoch": 3.905050505050505,
+ "grad_norm": 2.4549903869628906,
+ "learning_rate": 1.096969696969697e-06,
+ "loss": 1.311675786972046,
+ "mean_token_accuracy": 0.6631045341491699,
+ "num_tokens": 31670272.0,
+ "step": 1933
+ },
+ {
+ "entropy": 1.0760291814804077,
+ "epoch": 3.907070707070707,
+ "grad_norm": 2.1368870735168457,
+ "learning_rate": 1.094949494949495e-06,
+ "loss": 1.0474696159362793,
+ "mean_token_accuracy": 0.740290641784668,
+ "num_tokens": 31686656.0,
+ "step": 1934
+ },
+ {
+ "entropy": 1.4127235412597656,
+ "epoch": 3.909090909090909,
+ "grad_norm": 2.329832077026367,
+ "learning_rate": 1.0929292929292929e-06,
+ "loss": 1.4108169078826904,
+ "mean_token_accuracy": 0.6663410067558289,
+ "num_tokens": 31703040.0,
+ "step": 1935
+ },
+ {
+ "entropy": 1.5287094116210938,
+ "epoch": 3.911111111111111,
+ "grad_norm": 2.2737598419189453,
+ "learning_rate": 1.090909090909091e-06,
+ "loss": 1.5544226169586182,
+ "mean_token_accuracy": 0.6364802122116089,
+ "num_tokens": 31719424.0,
+ "step": 1936
+ },
+ {
+ "entropy": 1.1318615674972534,
+ "epoch": 3.9131313131313132,
+ "grad_norm": 2.3448705673217773,
+ "learning_rate": 1.0888888888888889e-06,
+ "loss": 1.1228995323181152,
+ "mean_token_accuracy": 0.7198339104652405,
+ "num_tokens": 31735808.0,
+ "step": 1937
+ },
+ {
+ "entropy": 1.0484049320220947,
+ "epoch": 3.915151515151515,
+ "grad_norm": 2.5756354331970215,
+ "learning_rate": 1.086868686868687e-06,
+ "loss": 1.0507314205169678,
+ "mean_token_accuracy": 0.7214215993881226,
+ "num_tokens": 31752192.0,
+ "step": 1938
+ },
+ {
+ "entropy": 0.9962558150291443,
+ "epoch": 3.9171717171717173,
+ "grad_norm": 2.379638910293579,
+ "learning_rate": 1.084848484848485e-06,
+ "loss": 0.9964162707328796,
+ "mean_token_accuracy": 0.7351001501083374,
+ "num_tokens": 31768576.0,
+ "step": 1939
+ },
+ {
+ "entropy": 1.0813647508621216,
+ "epoch": 3.919191919191919,
+ "grad_norm": 2.202664852142334,
+ "learning_rate": 1.082828282828283e-06,
+ "loss": 1.0924289226531982,
+ "mean_token_accuracy": 0.7243527173995972,
+ "num_tokens": 31784960.0,
+ "step": 1940
+ },
+ {
+ "entropy": 1.3451746702194214,
+ "epoch": 3.9212121212121214,
+ "grad_norm": 2.2476084232330322,
+ "learning_rate": 1.0808080808080808e-06,
+ "loss": 1.3437637090682983,
+ "mean_token_accuracy": 0.681485116481781,
+ "num_tokens": 31801344.0,
+ "step": 1941
+ },
+ {
+ "entropy": 1.1332415342330933,
+ "epoch": 3.923232323232323,
+ "grad_norm": 2.414275884628296,
+ "learning_rate": 1.078787878787879e-06,
+ "loss": 1.1400260925292969,
+ "mean_token_accuracy": 0.7132388949394226,
+ "num_tokens": 31817728.0,
+ "step": 1942
+ },
+ {
+ "entropy": 1.087522029876709,
+ "epoch": 3.9252525252525254,
+ "grad_norm": 2.1204850673675537,
+ "learning_rate": 1.0767676767676768e-06,
+ "loss": 1.0787461996078491,
+ "mean_token_accuracy": 0.7150708436965942,
+ "num_tokens": 31834112.0,
+ "step": 1943
+ },
+ {
+ "entropy": 1.1856560707092285,
+ "epoch": 3.9272727272727272,
+ "grad_norm": 2.270273447036743,
+ "learning_rate": 1.0747474747474747e-06,
+ "loss": 1.1918301582336426,
+ "mean_token_accuracy": 0.7099413871765137,
+ "num_tokens": 31850496.0,
+ "step": 1944
+ },
+ {
+ "entropy": 1.1141650676727295,
+ "epoch": 3.929292929292929,
+ "grad_norm": 2.357293128967285,
+ "learning_rate": 1.0727272727272728e-06,
+ "loss": 1.0945638418197632,
+ "mean_token_accuracy": 0.7214826345443726,
+ "num_tokens": 31866880.0,
+ "step": 1945
+ },
+ {
+ "entropy": 1.4306713342666626,
+ "epoch": 3.9313131313131313,
+ "grad_norm": 2.1920864582061768,
+ "learning_rate": 1.0707070707070707e-06,
+ "loss": 1.4291378259658813,
+ "mean_token_accuracy": 0.6696995496749878,
+ "num_tokens": 31883264.0,
+ "step": 1946
+ },
+ {
+ "entropy": 1.0448427200317383,
+ "epoch": 3.9333333333333336,
+ "grad_norm": 2.2893853187561035,
+ "learning_rate": 1.0686868686868688e-06,
+ "loss": 1.0350053310394287,
+ "mean_token_accuracy": 0.7333292365074158,
+ "num_tokens": 31899648.0,
+ "step": 1947
+ },
+ {
+ "entropy": 0.9403035044670105,
+ "epoch": 3.9353535353535354,
+ "grad_norm": 2.036454200744629,
+ "learning_rate": 1.066666666666667e-06,
+ "loss": 0.9342324137687683,
+ "mean_token_accuracy": 0.7620298266410828,
+ "num_tokens": 31916032.0,
+ "step": 1948
+ },
+ {
+ "entropy": 1.1731034517288208,
+ "epoch": 3.937373737373737,
+ "grad_norm": 2.388814687728882,
+ "learning_rate": 1.0646464646464648e-06,
+ "loss": 1.1642717123031616,
+ "mean_token_accuracy": 0.705422580242157,
+ "num_tokens": 31932416.0,
+ "step": 1949
+ },
+ {
+ "entropy": 1.4009122848510742,
+ "epoch": 3.9393939393939394,
+ "grad_norm": 2.3011586666107178,
+ "learning_rate": 1.0626262626262627e-06,
+ "loss": 1.3879787921905518,
+ "mean_token_accuracy": 0.6805080771446228,
+ "num_tokens": 31948800.0,
+ "step": 1950
+ },
+ {
+ "epoch": 3.9393939393939394,
+ "eval_entropy": 1.319143979299453,
+ "eval_loss": 1.5476959943771362,
+ "eval_mean_token_accuracy": 0.6448943807232764,
+ "eval_num_tokens": 31948800.0,
+ "eval_runtime": 43.7596,
+ "eval_samples_per_second": 22.624,
+ "eval_steps_per_second": 2.834,
+ "step": 1950
+ },
+ {
+ "entropy": 1.2538156509399414,
+ "epoch": 3.9414141414141413,
+ "grad_norm": 2.5176167488098145,
+ "learning_rate": 1.0606060606060608e-06,
+ "loss": 1.2646058797836304,
+ "mean_token_accuracy": 0.6989496946334839,
+ "num_tokens": 31965184.0,
+ "step": 1951
+ },
+ {
+ "entropy": 1.4409568309783936,
+ "epoch": 3.9434343434343435,
+ "grad_norm": 2.3068838119506836,
+ "learning_rate": 1.0585858585858587e-06,
+ "loss": 1.4423179626464844,
+ "mean_token_accuracy": 0.6614558100700378,
+ "num_tokens": 31981568.0,
+ "step": 1952
+ },
+ {
+ "entropy": 1.4900083541870117,
+ "epoch": 3.9454545454545453,
+ "grad_norm": 2.3615455627441406,
+ "learning_rate": 1.0565656565656566e-06,
+ "loss": 1.4933650493621826,
+ "mean_token_accuracy": 0.6474108695983887,
+ "num_tokens": 31997952.0,
+ "step": 1953
+ },
+ {
+ "entropy": 1.2034417390823364,
+ "epoch": 3.9474747474747476,
+ "grad_norm": 2.4732308387756348,
+ "learning_rate": 1.0545454545454547e-06,
+ "loss": 1.209761619567871,
+ "mean_token_accuracy": 0.6927210688591003,
+ "num_tokens": 32014336.0,
+ "step": 1954
+ },
+ {
+ "entropy": 1.1165226697921753,
+ "epoch": 3.9494949494949494,
+ "grad_norm": 2.4827890396118164,
+ "learning_rate": 1.0525252525252525e-06,
+ "loss": 1.1289414167404175,
+ "mean_token_accuracy": 0.7070713043212891,
+ "num_tokens": 32030720.0,
+ "step": 1955
+ },
+ {
+ "entropy": 1.2843526601791382,
+ "epoch": 3.9515151515151516,
+ "grad_norm": 2.32797908782959,
+ "learning_rate": 1.0505050505050506e-06,
+ "loss": 1.2694849967956543,
+ "mean_token_accuracy": 0.6875916123390198,
+ "num_tokens": 32047104.0,
+ "step": 1956
+ },
+ {
+ "entropy": 1.3727971315383911,
+ "epoch": 3.9535353535353535,
+ "grad_norm": 2.320406198501587,
+ "learning_rate": 1.0484848484848485e-06,
+ "loss": 1.3948733806610107,
+ "mean_token_accuracy": 0.6679286956787109,
+ "num_tokens": 32063488.0,
+ "step": 1957
+ },
+ {
+ "entropy": 1.4869349002838135,
+ "epoch": 3.9555555555555557,
+ "grad_norm": 2.2239322662353516,
+ "learning_rate": 1.0464646464646464e-06,
+ "loss": 1.5088552236557007,
+ "mean_token_accuracy": 0.6551660895347595,
+ "num_tokens": 32079872.0,
+ "step": 1958
+ },
+ {
+ "entropy": 1.2804311513900757,
+ "epoch": 3.9575757575757575,
+ "grad_norm": 2.355632781982422,
+ "learning_rate": 1.0444444444444445e-06,
+ "loss": 1.2881189584732056,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 32096256.0,
+ "step": 1959
+ },
+ {
+ "entropy": 1.469780683517456,
+ "epoch": 3.9595959595959593,
+ "grad_norm": 2.475818395614624,
+ "learning_rate": 1.0424242424242426e-06,
+ "loss": 1.4946942329406738,
+ "mean_token_accuracy": 0.6443576216697693,
+ "num_tokens": 32112640.0,
+ "step": 1960
+ },
+ {
+ "entropy": 1.0433298349380493,
+ "epoch": 3.9616161616161616,
+ "grad_norm": 2.335348606109619,
+ "learning_rate": 1.0404040404040405e-06,
+ "loss": 1.051847219467163,
+ "mean_token_accuracy": 0.7260014414787292,
+ "num_tokens": 32129024.0,
+ "step": 1961
+ },
+ {
+ "entropy": 1.060207486152649,
+ "epoch": 3.963636363636364,
+ "grad_norm": 2.465827465057373,
+ "learning_rate": 1.0383838383838384e-06,
+ "loss": 1.0738749504089355,
+ "mean_token_accuracy": 0.7250854969024658,
+ "num_tokens": 32145408.0,
+ "step": 1962
+ },
+ {
+ "entropy": 1.3710187673568726,
+ "epoch": 3.9656565656565657,
+ "grad_norm": 2.1859865188598633,
+ "learning_rate": 1.0363636363636365e-06,
+ "loss": 1.3790408372879028,
+ "mean_token_accuracy": 0.6800195574760437,
+ "num_tokens": 32161792.0,
+ "step": 1963
+ },
+ {
+ "entropy": 1.4380125999450684,
+ "epoch": 3.9676767676767675,
+ "grad_norm": 2.3186328411102295,
+ "learning_rate": 1.0343434343434344e-06,
+ "loss": 1.4353742599487305,
+ "mean_token_accuracy": 0.6627992391586304,
+ "num_tokens": 32178176.0,
+ "step": 1964
+ },
+ {
+ "entropy": 1.346064567565918,
+ "epoch": 3.9696969696969697,
+ "grad_norm": 2.455488920211792,
+ "learning_rate": 1.0323232323232325e-06,
+ "loss": 1.3504667282104492,
+ "mean_token_accuracy": 0.6808744668960571,
+ "num_tokens": 32194560.0,
+ "step": 1965
+ },
+ {
+ "entropy": 1.111870527267456,
+ "epoch": 3.971717171717172,
+ "grad_norm": 2.216954231262207,
+ "learning_rate": 1.0303030303030304e-06,
+ "loss": 1.1173250675201416,
+ "mean_token_accuracy": 0.7161700129508972,
+ "num_tokens": 32210944.0,
+ "step": 1966
+ },
+ {
+ "entropy": 1.570885181427002,
+ "epoch": 3.973737373737374,
+ "grad_norm": 2.5180883407592773,
+ "learning_rate": 1.0282828282828283e-06,
+ "loss": 1.550491213798523,
+ "mean_token_accuracy": 0.6203590631484985,
+ "num_tokens": 32227328.0,
+ "step": 1967
+ },
+ {
+ "entropy": 0.887984037399292,
+ "epoch": 3.9757575757575756,
+ "grad_norm": 2.193727970123291,
+ "learning_rate": 1.0262626262626264e-06,
+ "loss": 0.8939201831817627,
+ "mean_token_accuracy": 0.7674645781517029,
+ "num_tokens": 32243712.0,
+ "step": 1968
+ },
+ {
+ "entropy": 1.3493150472640991,
+ "epoch": 3.977777777777778,
+ "grad_norm": 2.320697784423828,
+ "learning_rate": 1.0242424242424242e-06,
+ "loss": 1.3643516302108765,
+ "mean_token_accuracy": 0.67659991979599,
+ "num_tokens": 32260096.0,
+ "step": 1969
+ },
+ {
+ "entropy": 1.2187929153442383,
+ "epoch": 3.9797979797979797,
+ "grad_norm": 2.2966790199279785,
+ "learning_rate": 1.0222222222222223e-06,
+ "loss": 1.2266913652420044,
+ "mean_token_accuracy": 0.701636552810669,
+ "num_tokens": 32276480.0,
+ "step": 1970
+ },
+ {
+ "entropy": 1.3222001791000366,
+ "epoch": 3.981818181818182,
+ "grad_norm": 2.484215497970581,
+ "learning_rate": 1.0202020202020202e-06,
+ "loss": 1.3209818601608276,
+ "mean_token_accuracy": 0.6782486438751221,
+ "num_tokens": 32292864.0,
+ "step": 1971
+ },
+ {
+ "entropy": 1.2982250452041626,
+ "epoch": 3.9838383838383837,
+ "grad_norm": 2.320852518081665,
+ "learning_rate": 1.0181818181818183e-06,
+ "loss": 1.3085607290267944,
+ "mean_token_accuracy": 0.6881411671638489,
+ "num_tokens": 32309248.0,
+ "step": 1972
+ },
+ {
+ "entropy": 1.3396943807601929,
+ "epoch": 3.985858585858586,
+ "grad_norm": 2.224574565887451,
+ "learning_rate": 1.0161616161616162e-06,
+ "loss": 1.3511459827423096,
+ "mean_token_accuracy": 0.6810576319694519,
+ "num_tokens": 32325632.0,
+ "step": 1973
+ },
+ {
+ "entropy": 1.2554755210876465,
+ "epoch": 3.987878787878788,
+ "grad_norm": 2.3757498264312744,
+ "learning_rate": 1.0141414141414143e-06,
+ "loss": 1.247807502746582,
+ "mean_token_accuracy": 0.687530517578125,
+ "num_tokens": 32342016.0,
+ "step": 1974
+ },
+ {
+ "entropy": 0.9622905850410461,
+ "epoch": 3.98989898989899,
+ "grad_norm": 2.2012438774108887,
+ "learning_rate": 1.0121212121212122e-06,
+ "loss": 0.9560307860374451,
+ "mean_token_accuracy": 0.7637396454811096,
+ "num_tokens": 32358400.0,
+ "step": 1975
+ },
+ {
+ "entropy": 1.1193549633026123,
+ "epoch": 3.991919191919192,
+ "grad_norm": 2.3705174922943115,
+ "learning_rate": 1.01010101010101e-06,
+ "loss": 1.11350679397583,
+ "mean_token_accuracy": 0.7154372334480286,
+ "num_tokens": 32374784.0,
+ "step": 1976
+ },
+ {
+ "entropy": 0.9361278414726257,
+ "epoch": 3.993939393939394,
+ "grad_norm": 2.174281358718872,
+ "learning_rate": 1.0080808080808082e-06,
+ "loss": 0.9388691186904907,
+ "mean_token_accuracy": 0.7485344409942627,
+ "num_tokens": 32391168.0,
+ "step": 1977
+ },
+ {
+ "entropy": 1.4282293319702148,
+ "epoch": 3.995959595959596,
+ "grad_norm": 2.1972262859344482,
+ "learning_rate": 1.006060606060606e-06,
+ "loss": 1.4244005680084229,
+ "mean_token_accuracy": 0.685332179069519,
+ "num_tokens": 32407552.0,
+ "step": 1978
+ },
+ {
+ "entropy": 1.221082091331482,
+ "epoch": 3.9979797979797977,
+ "grad_norm": 2.3935673236846924,
+ "learning_rate": 1.004040404040404e-06,
+ "loss": 1.1999341249465942,
+ "mean_token_accuracy": 0.6952857971191406,
+ "num_tokens": 32423936.0,
+ "step": 1979
+ },
+ {
+ "entropy": 1.1347371339797974,
+ "epoch": 4.0,
+ "grad_norm": 2.228233575820923,
+ "learning_rate": 1.002020202020202e-06,
+ "loss": 1.1378669738769531,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 32440320.0,
+ "step": 1980
+ },
+ {
+ "entropy": 1.1821788549423218,
+ "epoch": 4.002020202020202,
+ "grad_norm": 2.356572389602661,
+ "learning_rate": 1.0000000000000002e-06,
+ "loss": 1.1377968788146973,
+ "mean_token_accuracy": 0.708170473575592,
+ "num_tokens": 32456704.0,
+ "step": 1981
+ },
+ {
+ "entropy": 1.444516658782959,
+ "epoch": 4.004040404040404,
+ "grad_norm": 2.34165358543396,
+ "learning_rate": 9.97979797979798e-07,
+ "loss": 1.4065756797790527,
+ "mean_token_accuracy": 0.6689057350158691,
+ "num_tokens": 32473088.0,
+ "step": 1982
+ },
+ {
+ "entropy": 1.5600178241729736,
+ "epoch": 4.006060606060606,
+ "grad_norm": 2.147475004196167,
+ "learning_rate": 9.959595959595962e-07,
+ "loss": 1.5237784385681152,
+ "mean_token_accuracy": 0.6602345108985901,
+ "num_tokens": 32489472.0,
+ "step": 1983
+ },
+ {
+ "entropy": 1.3860907554626465,
+ "epoch": 4.008080808080808,
+ "grad_norm": 2.5050148963928223,
+ "learning_rate": 9.93939393939394e-07,
+ "loss": 1.3332314491271973,
+ "mean_token_accuracy": 0.6679897308349609,
+ "num_tokens": 32505856.0,
+ "step": 1984
+ },
+ {
+ "entropy": 1.2262948751449585,
+ "epoch": 4.01010101010101,
+ "grad_norm": 2.3707785606384277,
+ "learning_rate": 9.91919191919192e-07,
+ "loss": 1.1803091764450073,
+ "mean_token_accuracy": 0.6957743167877197,
+ "num_tokens": 32522240.0,
+ "step": 1985
+ },
+ {
+ "entropy": 1.2782310247421265,
+ "epoch": 4.012121212121212,
+ "grad_norm": 2.1337549686431885,
+ "learning_rate": 9.8989898989899e-07,
+ "loss": 1.2508152723312378,
+ "mean_token_accuracy": 0.6898509860038757,
+ "num_tokens": 32538624.0,
+ "step": 1986
+ },
+ {
+ "entropy": 1.2618422508239746,
+ "epoch": 4.014141414141414,
+ "grad_norm": 2.1014909744262695,
+ "learning_rate": 9.87878787878788e-07,
+ "loss": 1.2586122751235962,
+ "mean_token_accuracy": 0.7060942649841309,
+ "num_tokens": 32555008.0,
+ "step": 1987
+ },
+ {
+ "entropy": 1.4927153587341309,
+ "epoch": 4.016161616161616,
+ "grad_norm": 2.3997669219970703,
+ "learning_rate": 9.858585858585858e-07,
+ "loss": 1.458584189414978,
+ "mean_token_accuracy": 0.6642037034034729,
+ "num_tokens": 32571392.0,
+ "step": 1988
+ },
+ {
+ "entropy": 0.9929779767990112,
+ "epoch": 4.0181818181818185,
+ "grad_norm": 2.1199800968170166,
+ "learning_rate": 9.83838383838384e-07,
+ "loss": 0.9945173263549805,
+ "mean_token_accuracy": 0.7606863975524902,
+ "num_tokens": 32587776.0,
+ "step": 1989
+ },
+ {
+ "entropy": 1.2815021276474,
+ "epoch": 4.02020202020202,
+ "grad_norm": 2.2822794914245605,
+ "learning_rate": 9.818181818181818e-07,
+ "loss": 1.263106107711792,
+ "mean_token_accuracy": 0.7038959264755249,
+ "num_tokens": 32604160.0,
+ "step": 1990
+ },
+ {
+ "entropy": 1.2504572868347168,
+ "epoch": 4.022222222222222,
+ "grad_norm": 2.0446224212646484,
+ "learning_rate": 9.797979797979799e-07,
+ "loss": 1.2274131774902344,
+ "mean_token_accuracy": 0.7008426785469055,
+ "num_tokens": 32620544.0,
+ "step": 1991
+ },
+ {
+ "entropy": 1.1070255041122437,
+ "epoch": 4.024242424242424,
+ "grad_norm": 2.0727381706237793,
+ "learning_rate": 9.77777777777778e-07,
+ "loss": 1.082715392112732,
+ "mean_token_accuracy": 0.7302759885787964,
+ "num_tokens": 32636928.0,
+ "step": 1992
+ },
+ {
+ "entropy": 1.0761677026748657,
+ "epoch": 4.026262626262627,
+ "grad_norm": 2.0985822677612305,
+ "learning_rate": 9.757575757575759e-07,
+ "loss": 1.0548713207244873,
+ "mean_token_accuracy": 0.7333292365074158,
+ "num_tokens": 32653312.0,
+ "step": 1993
+ },
+ {
+ "entropy": 1.5109375715255737,
+ "epoch": 4.028282828282828,
+ "grad_norm": 2.426588535308838,
+ "learning_rate": 9.737373737373738e-07,
+ "loss": 1.4922651052474976,
+ "mean_token_accuracy": 0.6560820937156677,
+ "num_tokens": 32669696.0,
+ "step": 1994
+ },
+ {
+ "entropy": 1.2393261194229126,
+ "epoch": 4.03030303030303,
+ "grad_norm": 2.1131463050842285,
+ "learning_rate": 9.717171717171719e-07,
+ "loss": 1.2221450805664062,
+ "mean_token_accuracy": 0.7113458514213562,
+ "num_tokens": 32686080.0,
+ "step": 1995
+ },
+ {
+ "entropy": 1.2733023166656494,
+ "epoch": 4.0323232323232325,
+ "grad_norm": 2.42077898979187,
+ "learning_rate": 9.696969696969698e-07,
+ "loss": 1.266562581062317,
+ "mean_token_accuracy": 0.6916218996047974,
+ "num_tokens": 32702464.0,
+ "step": 1996
+ },
+ {
+ "entropy": 1.1015594005584717,
+ "epoch": 4.034343434343434,
+ "grad_norm": 2.3131461143493652,
+ "learning_rate": 9.676767676767676e-07,
+ "loss": 1.0699245929718018,
+ "mean_token_accuracy": 0.7295432090759277,
+ "num_tokens": 32718848.0,
+ "step": 1997
+ },
+ {
+ "entropy": 1.1488311290740967,
+ "epoch": 4.036363636363636,
+ "grad_norm": 2.460294723510742,
+ "learning_rate": 9.656565656565657e-07,
+ "loss": 1.1216062307357788,
+ "mean_token_accuracy": 0.7164753079414368,
+ "num_tokens": 32735232.0,
+ "step": 1998
+ },
+ {
+ "entropy": 1.1301594972610474,
+ "epoch": 4.038383838383838,
+ "grad_norm": 2.248311996459961,
+ "learning_rate": 9.636363636363636e-07,
+ "loss": 1.1271123886108398,
+ "mean_token_accuracy": 0.7147044539451599,
+ "num_tokens": 32751616.0,
+ "step": 1999
+ },
+ {
+ "entropy": 1.2287960052490234,
+ "epoch": 4.040404040404041,
+ "grad_norm": 2.191375732421875,
+ "learning_rate": 9.616161616161617e-07,
+ "loss": 1.2168409824371338,
+ "mean_token_accuracy": 0.7156814932823181,
+ "num_tokens": 32768000.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.040404040404041,
+ "eval_entropy": 1.294078712021151,
+ "eval_loss": 1.5553377866744995,
+ "eval_mean_token_accuracy": 0.6444841599272143,
+ "eval_num_tokens": 32768000.0,
+ "eval_runtime": 43.7303,
+ "eval_samples_per_second": 22.639,
+ "eval_steps_per_second": 2.836,
+ "step": 2000
+ }
+ ],
+ "logging_steps": 1,
+ "max_steps": 2475,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 5,
+ "save_steps": 500,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.77101290717184e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/training_args.bin b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/training_args.bin
new file mode 100644
index 0000000000000000000000000000000000000000..37649d4bae96a1df88666daf20b4e5b6e092d976
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/training_args.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:58bbcabfe99a1cf24f2e76aab66b507c2b720d9271dc9f17c8208d741a9c3a65
+size 7121
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/zero_to_fp32.py b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/zero_to_fp32.py
new file mode 100644
index 0000000000000000000000000000000000000000..3970548c400fd4361bd923b763db90e963ddaf8c
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/zero_to_fp32.py
@@ -0,0 +1,854 @@
+#!/usr/bin/env python
+
+# Copyright (c) Microsoft Corporation.
+# SPDX-License-Identifier: Apache-2.0
+
+# DeepSpeed Team
+
+# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets
+# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in
+# the future. Once extracted, the weights don't require DeepSpeed and can be used in any
+# application.
+#
+# example:
+# python zero_to_fp32.py . output_dir/
+# or
+# python zero_to_fp32.py . output_dir/ --safe_serialization
+
+import argparse
+import torch
+import glob
+import math
+import os
+import re
+import gc
+import json
+import numpy as np
+from tqdm import tqdm
+from collections import OrderedDict
+from dataclasses import dataclass
+
+# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with
+# DeepSpeed data structures it has to be available in the current python environment.
+from deepspeed.utils import logger
+from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS,
+ FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES,
+ FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS, AUTOEP_LAYERS_KEY,
+ AUTOEP_LAYERS_KEY_LEGACY, AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY,
+ AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT, PARAM_ALIGNMENT_PADDINGS)
+
+
+@dataclass
+class zero_model_state:
+ buffers: dict()
+ param_shapes: dict()
+ shared_params: list
+ ds_version: int
+ frozen_param_shapes: dict()
+ frozen_param_fragments: dict()
+
+
+debug = 0
+
+# load to cpu
+device = torch.device('cpu')
+
+OUTPUT_DTYPE_NAMES = {
+ 'float32': torch.float32,
+ 'fp32': torch.float32,
+ 'float16': torch.float16,
+ 'fp16': torch.float16,
+ 'bfloat16': torch.bfloat16,
+ 'bf16': torch.bfloat16,
+}
+
+
+def _resolve_output_dtype(dtype):
+ requested_dtype = dtype
+ if isinstance(dtype, str):
+ dtype_name = dtype[6:] if dtype.startswith('torch.') else dtype
+ dtype = OUTPUT_DTYPE_NAMES.get(dtype_name.lower())
+ if dtype not in set(OUTPUT_DTYPE_NAMES.values()):
+ supported = ', '.join(sorted(OUTPUT_DTYPE_NAMES))
+ raise ValueError(f"Unsupported output dtype {requested_dtype!r}. Choose one of: {supported}")
+ return dtype
+
+
+def atoi(text):
+ return int(text) if text.isdigit() else text
+
+
+def natural_keys(text):
+ '''
+ alist.sort(key=natural_keys) sorts in human order
+ http://nedbatchelder.com/blog/200712/human_sorting.html
+ (See Toothy's implementation in the comments)
+ '''
+ return [atoi(c) for c in re.split(r'(\d+)', text)]
+
+
+def get_model_state_file(checkpoint_dir, zero_stage):
+ if not os.path.isdir(checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist")
+
+ # there should be only one file
+ if zero_stage <= 2:
+ file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt")
+ elif zero_stage == 3:
+ file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt")
+
+ if not os.path.exists(file):
+ raise FileNotFoundError(f"can't find model states file at '{file}'")
+
+ return file
+
+
+def get_checkpoint_files(checkpoint_dir, glob_pattern):
+ # XXX: need to test that this simple glob rule works for multi-node setup too
+ ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys)
+
+ if len(ckpt_files) == 0:
+ raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'")
+
+ return ckpt_files
+
+
+def get_optim_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt")
+
+
+def get_model_state_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_model_states.pt")
+
+
+def _has_autoep_zero3_partitioned_metadata(state_dict):
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY)
+ if autoep_layers is None:
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY_LEGACY)
+ if not isinstance(autoep_layers, list):
+ return False
+ return any(
+ isinstance(entry, dict)
+ and entry.get(AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY) == AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT
+ for entry in autoep_layers)
+
+
+def _raise_if_autoep_zero3_partitioned_state(state_dict):
+ if _has_autoep_zero3_partitioned_metadata(state_dict):
+ raise NotImplementedError("zero_to_fp32 does not support AutoEP ZeRO-3 partition-native checkpoints. "
+ "AutoEP expert parameters are partitioned over expert replica groups, so "
+ "global data-parallel consolidation would produce incomplete expert tensors. "
+ "Use ds_to_universal.py for expert-aware conversion.")
+
+
+def _raise_if_autoep_zero3_partitioned_checkpoint(model_files):
+ for file in model_files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+
+def parse_model_states(files):
+ zero_model_states = []
+ for file in files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+ if BUFFER_NAMES not in state_dict:
+ raise ValueError(f"{file} is not a model state checkpoint")
+ buffer_names = state_dict[BUFFER_NAMES]
+ if debug:
+ print("Found buffers:", buffer_names)
+
+ # recover just the buffers while restoring them to fp32 if they were saved in fp16
+ buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names}
+ param_shapes = state_dict[PARAM_SHAPES]
+
+ # collect parameters that are included in param_shapes
+ param_names = []
+ for s in param_shapes:
+ for name in s.keys():
+ param_names.append(name)
+
+ # update with frozen parameters
+ frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None)
+ if frozen_param_shapes is not None:
+ if debug:
+ print(f"Found frozen_param_shapes: {frozen_param_shapes}")
+ param_names += list(frozen_param_shapes.keys())
+
+ # handle shared params
+ shared_params = [[k, v] for k, v in state_dict["shared_params"].items()]
+
+ ds_version = state_dict.get(DS_VERSION, None)
+
+ frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None)
+
+ z_model_state = zero_model_state(buffers=buffers,
+ param_shapes=param_shapes,
+ shared_params=shared_params,
+ ds_version=ds_version,
+ frozen_param_shapes=frozen_param_shapes,
+ frozen_param_fragments=frozen_param_fragments)
+ zero_model_states.append(z_model_state)
+
+ return zero_model_states
+
+
+def parse_optim_states(files, ds_checkpoint_dir):
+ total_files = len(files)
+ state_dicts = []
+ for f in tqdm(files, desc='Loading checkpoint shards'):
+ state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False)
+ # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights
+ # and also handle the case where it was already removed by another helper script
+ state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None)
+ state_dicts.append(state_dict)
+
+ if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]:
+ raise ValueError(f"{files[0]} is not a zero checkpoint")
+ zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE]
+ world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT]
+
+ # For ZeRO-2 each param group can have different partition_count as data parallelism for expert
+ # parameters can be different from data parallelism for non-expert parameters. So we can just
+ # use the max of the partition_count to get the dp world_size.
+
+ if type(world_size) is list:
+ world_size = max(world_size)
+
+ if world_size != total_files:
+ raise ValueError(
+ f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. "
+ "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes."
+ )
+
+ # the groups are named differently in each stage
+ if zero_stage <= 2:
+ fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS
+ elif zero_stage == 3:
+ fp32_groups_key = FP32_FLAT_GROUPS
+ else:
+ raise ValueError(f"unknown zero stage {zero_stage}")
+
+ fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))]
+ param_alignment_paddings = state_dicts[0][OPTIMIZER_STATE_DICT].get(PARAM_ALIGNMENT_PADDINGS)
+ return zero_stage, world_size, fp32_flat_groups, param_alignment_paddings
+
+
+def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters):
+ """
+ Returns fp32 state_dict reconstructed from ds checkpoint
+
+ Args:
+ - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are)
+
+ """
+ print(f"Processing zero checkpoint '{ds_checkpoint_dir}'")
+
+ # parse_model_states rejects AutoEP ZeRO-3 partition-native checkpoints
+ # before the expensive optimizer-shard load below.
+ model_files = get_model_state_files(ds_checkpoint_dir)
+ zero_model_states = parse_model_states(model_files)
+ print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}')
+
+ optim_files = get_optim_files(ds_checkpoint_dir)
+ zero_stage, world_size, fp32_flat_groups, param_alignment_paddings = parse_optim_states(
+ optim_files, ds_checkpoint_dir)
+ print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}")
+
+ if zero_stage <= 2:
+ return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters, param_alignment_paddings)
+ elif zero_stage == 3:
+ return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters)
+
+
+def _zero2_merge_frozen_params(state_dict, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ frozen_param_fragments = zero_model_states[0].frozen_param_fragments
+
+ if debug:
+ num_elem = sum(s.numel() for s in frozen_param_shapes.values())
+ print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in frozen_param_fragments.values()])
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ state_dict[name] = frozen_param_fragments[name]
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _has_callable(obj, fn):
+ attr = getattr(obj, fn, None)
+ return callable(attr)
+
+
+def _zero2_merge_trainable_params(state_dict,
+ world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ param_alignment_paddings=None):
+ param_shapes = zero_model_states[0].param_shapes
+
+ # Reconstruction protocol:
+ #
+ # XXX: document this
+
+ if debug:
+ for i in range(world_size):
+ for j in range(len(fp32_flat_groups[0])):
+ print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}")
+
+ # XXX: memory usage doubles here (zero2)
+ num_param_groups = len(fp32_flat_groups[0])
+ merged_single_partition_of_fp32_groups = []
+ for i in range(num_param_groups):
+ merged_partitions = [sd[i] for sd in fp32_flat_groups]
+ full_single_fp32_vector = torch.cat(merged_partitions, 0)
+ merged_single_partition_of_fp32_groups.append(full_single_fp32_vector)
+ avail_numel = sum(
+ [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups])
+
+ if debug:
+ wanted_params = sum([len(shapes) for shapes in param_shapes])
+ wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes])
+ # not asserting if there is a mismatch due to possible padding
+ print(f"Have {avail_numel} numels to process.")
+ print(f"Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ total_numel = 0
+ total_params = 0
+ for group_idx, (shapes,
+ full_single_fp32_vector) in enumerate(zip(param_shapes, merged_single_partition_of_fp32_groups)):
+ offset = 0
+ avail_numel = full_single_fp32_vector.numel()
+ group_alignment_paddings = None
+ if param_alignment_paddings is not None:
+ group_alignment_paddings = param_alignment_paddings[group_idx]
+ if len(group_alignment_paddings) != len(shapes):
+ raise ValueError(f"Expected {len(shapes)} parameter alignment paddings for group {group_idx}, "
+ f"but found {len(group_alignment_paddings)}")
+
+ for param_idx, (name, shape) in enumerate(shapes.items()):
+
+ unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape)
+ total_numel += unpartitioned_numel
+ total_params += 1
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+ state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape)
+ offset += unpartitioned_numel
+ if group_alignment_paddings is not None:
+ offset += group_alignment_paddings[param_idx]
+
+ # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and
+ # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex
+ # paddings performed in the code it's almost impossible to predict the exact numbers w/o the
+ # live optimizer object, so we are checking that the numbers are within the right range
+ align_to = 2 * world_size
+
+ def zero2_align(x):
+ return align_to * math.ceil(x / align_to)
+
+ if debug:
+ print(f"original offset={offset}, avail_numel={avail_numel}")
+
+ offset = zero2_align(offset)
+ avail_numel = zero2_align(avail_numel)
+
+ if debug:
+ print(f"aligned offset={offset}, avail_numel={avail_numel}")
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero2_checkpoint(world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ exclude_frozen_parameters,
+ param_alignment_paddings=None):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero2_merge_frozen_params(state_dict, zero_model_states)
+
+ _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states,
+ param_alignment_paddings)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def zero3_partitioned_param_info(unpartitioned_numel, world_size):
+ remainder = unpartitioned_numel % world_size
+ padding_numel = (world_size - remainder) if remainder else 0
+ partitioned_numel = math.ceil(unpartitioned_numel / world_size)
+ return partitioned_numel, padding_numel
+
+
+def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ if debug:
+ for i in range(world_size):
+ num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values())
+ print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in zero_model_states[0].frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states)
+ state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape)
+
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+class GatheredTensor:
+ """
+ A pseudo tensor that collects partitioned weights.
+ It is more memory efficient when there are multiple groups.
+ """
+
+ def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape):
+ self.flat_groups = flat_groups
+ self.flat_groups_offset = flat_groups_offset
+ self.offset = offset
+ self.partitioned_numel = partitioned_numel
+ self.shape = shape
+ self.dtype = self.flat_groups[0][0].dtype
+
+ def contiguous(self):
+ """
+ Merge partitioned weights from flat_groups into a single tensor.
+ """
+ end_idx = self.offset + self.partitioned_numel
+ world_size = len(self.flat_groups)
+ pad_flat_param_chunks = []
+
+ for rank_i in range(world_size):
+ # for each rank, we need to collect weights from related group/groups
+ flat_groups_at_rank_i = self.flat_groups[rank_i]
+ start_group_id = None
+ end_group_id = None
+ for group_id in range(len(self.flat_groups_offset)):
+ if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]:
+ start_group_id = group_id
+ if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]:
+ end_group_id = group_id
+ break
+ # collect weights from related group/groups
+ for group_id in range(start_group_id, end_group_id + 1):
+ flat_tensor = flat_groups_at_rank_i[group_id]
+ start_offset = self.offset - self.flat_groups_offset[group_id]
+ end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id]
+ pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset])
+
+ # collect weights from all ranks
+ pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0)
+ param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous()
+ return param
+
+
+def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states):
+ param_shapes = zero_model_states[0].param_shapes
+ avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size
+
+ # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each
+ # param, re-consolidating each param, while dealing with padding if any
+
+ # merge list of dicts, preserving order
+ param_shapes = {k: v for d in param_shapes for k, v in d.items()}
+
+ if debug:
+ for i in range(world_size):
+ print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}")
+
+ wanted_params = len(param_shapes)
+ wanted_numel = sum(shape.numel() for shape in param_shapes.values())
+ # not asserting if there is a mismatch due to possible padding
+ avail_numel = fp32_flat_groups[0].numel() * world_size
+ print(f"Trainable params: Have {avail_numel} numels to process.")
+ print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ offset = 0
+ total_numel = 0
+ total_params = 0
+ flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]]))
+ for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'):
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+ total_params += 1
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ # memory efficient tensor
+ tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape)
+ state_dict[name] = tensor
+ offset += partitioned_numel
+
+ offset *= world_size
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero3_merge_frozen_params(state_dict, world_size, zero_model_states)
+
+ _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def to_torch_tensor(state_dict, return_empty_tensor=False, dtype=None):
+ """
+ Convert state_dict of GatheredTensor to torch tensor
+ """
+ if dtype is not None:
+ dtype = _resolve_output_dtype(dtype)
+
+ torch_state_dict = {}
+ converted_tensors = {}
+ for name, tensor in state_dict.items():
+ tensor_id = id(tensor)
+ if tensor_id in converted_tensors: # shared tensors
+ shared_tensor = torch_state_dict[converted_tensors[tensor_id]]
+ torch_state_dict[name] = shared_tensor
+ else:
+ converted_tensors[tensor_id] = name
+ if return_empty_tensor:
+ torch_state_dict[name] = torch.empty(tensor.shape, dtype=dtype or tensor.dtype)
+ else:
+ contiguous_tensor = tensor.contiguous()
+ torch_state_dict[name] = contiguous_tensor.to(dtype=dtype) if dtype else contiguous_tensor
+ return torch_state_dict
+
+
+def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag=None,
+ exclude_frozen_parameters=False,
+ lazy_mode=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with
+ ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example
+ via a model hub.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient.
+ Convert the pesduo tensor to torch tensor by ``.contiguous()``
+
+ Returns:
+ - pytorch ``state_dict``
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ # do the training and checkpoint saving
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu
+ model = model.cpu() # move to cpu
+ model.load_state_dict(state_dict)
+ # submit to model hub or save the model to share with others
+
+ In this example the ``model`` will no longer be usable in the deepspeed context of the same
+ application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead.
+
+ Note: the above usage may not work if your application doesn't have sufficient free CPU memory.
+ You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with
+ the checkpoint. Or you can load state_dict in lazy mode ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu
+ for name, lazy_tensor in state_dict.item():
+ tensor = lazy_tensor.contiguous() # to cpu
+ print(name, tensor)
+ # del tensor to release memory if it no longer in use
+ """
+ if tag is None:
+ latest_path = os.path.join(checkpoint_dir, 'latest')
+ if os.path.isfile(latest_path):
+ with open(latest_path, 'r') as fd:
+ tag = fd.read().strip()
+ else:
+ raise ValueError(f"Unable to find 'latest' file at {latest_path}")
+
+ ds_checkpoint_dir = os.path.join(checkpoint_dir, tag)
+
+ if not os.path.isdir(ds_checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist")
+
+ state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters)
+ if lazy_mode:
+ return state_dict
+ else:
+ return to_torch_tensor(state_dict)
+
+
+def convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a consolidated ``state_dict`` file that can be
+ loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``output_dir``: directory for the PyTorch state_dict output files
+ - ``dtype``: output tensor dtype. Supports float32, float16, and bfloat16 as strings or torch dtypes.
+ - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB
+ - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ """
+
+ dtype = _resolve_output_dtype(dtype)
+
+ # Dependency pre-check
+ if safe_serialization:
+ try:
+ from safetensors.torch import save_file
+ except ImportError:
+ print('If you want to use `safe_serialization`, please `pip install safetensors`')
+ raise
+ if max_shard_size is not None:
+ try:
+ from huggingface_hub import split_torch_state_dict_into_shards
+ except ImportError:
+ print('If you want to use `max_shard_size`, please `pip install huggingface_hub`')
+ raise
+
+ # Convert zero checkpoint to state_dict
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag,
+ exclude_frozen_parameters,
+ lazy_mode=True)
+
+ # Shard the model if it is too big.
+ weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin"
+ if max_shard_size is not None:
+ filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors")
+ # an memory-efficient approach for sharding
+ empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True, dtype=dtype)
+ state_dict_split = split_torch_state_dict_into_shards(empty_state_dict,
+ filename_pattern=filename_pattern,
+ max_shard_size=max_shard_size)
+ else:
+ from collections import namedtuple
+ StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"])
+ state_dict_split = StateDictSplit(is_sharded=False,
+ filename_to_tensors={weights_name: list(state_dict.keys())})
+
+ # Save the model by shard
+ os.makedirs(output_dir, exist_ok=True)
+ filename_to_tensors = state_dict_split.filename_to_tensors.items()
+ for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"):
+ shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors}
+ shard_state_dict = to_torch_tensor(shard_state_dict, dtype=dtype)
+ output_path = os.path.join(output_dir, shard_file)
+ if safe_serialization:
+ save_file(shard_state_dict, output_path, metadata={"format": "pt"})
+ else:
+ torch.save(shard_state_dict, output_path)
+ # release the memory of current shard
+ for tensor_name in list(shard_state_dict.keys()):
+ del state_dict[tensor_name]
+ del shard_state_dict[tensor_name]
+ del shard_state_dict
+ gc.collect()
+
+ # Save index if sharded
+ if state_dict_split.is_sharded:
+ index = {
+ "metadata": state_dict_split.metadata,
+ "weight_map": state_dict_split.tensor_to_filename,
+ }
+ save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json"
+ save_index_file = os.path.join(output_dir, save_index_file)
+ with open(save_index_file, "w", encoding="utf-8") as f:
+ content = json.dumps(index, indent=2, sort_keys=True) + "\n"
+ f.write(content)
+
+
+def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir,
+ output_dir,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """Backward-compatible fp32 checkpoint conversion."""
+ return convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size=max_shard_size,
+ safe_serialization=safe_serialization,
+ tag=tag,
+ exclude_frozen_parameters=exclude_frozen_parameters)
+
+
+def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None):
+ """
+ 1. Put the provided model to cpu
+ 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict``
+ 3. Load it into the provided model
+
+ Args:
+ - ``model``: the model object to update
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+
+ Returns:
+ - ``model`: modified model
+
+ Make sure you have plenty of CPU memory available before you call this function. If you don't
+ have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it
+ conveniently placed for you in the checkpoint folder.
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint
+ model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir)
+ # submit to model hub or save the model to share with others
+
+ Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context
+ of the same application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ """
+ logger.info("Extracting fp32 weights")
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag)
+
+ logger.info("Overwriting model with fp32 weights")
+ model = model.cpu()
+ model.load_state_dict(state_dict, strict=False)
+
+ return model
+
+
+if __name__ == "__main__":
+ parser = argparse.ArgumentParser()
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir",
+ type=str,
+ help="directory to the pytorch fp32 state_dict output files"
+ "(e.g. path/checkpoint-12-output/)")
+ parser.add_argument(
+ "--max_shard_size",
+ type=str,
+ default="5GB",
+ help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size"
+ "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`"
+ "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances"
+ "without CPU OOM issues.")
+ parser.add_argument(
+ "--safe_serialization",
+ default=False,
+ action='store_true',
+ help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug")
+ args = parser.parse_args()
+
+ debug = args.debug
+
+ convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir,
+ args.output_dir,
+ max_shard_size=args.max_shard_size,
+ safe_serialization=args.safe_serialization,
+ tag=args.tag,
+ exclude_frozen_parameters=args.exclude_frozen_parameters)
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2000/zero_to_torch.py b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/zero_to_torch.py
new file mode 100644
index 0000000000000000000000000000000000000000..81312e252400d77f03cc1a88522f8f18ebe70ee7
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2000/zero_to_torch.py
@@ -0,0 +1,54 @@
+#!/usr/bin/env python
+
+# SPDX-License-Identifier: Apache-2.0
+# DeepSpeed Team
+
+import argparse
+
+if __package__:
+ from . import zero_to_fp32
+else:
+ import zero_to_fp32
+
+
+def main(args=None):
+ parser = argparse.ArgumentParser(
+ description="Convert a DeepSpeed ZeRO checkpoint to float32, float16, or bfloat16 PyTorch weights.")
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir", type=str, help="directory for the converted PyTorch state_dict files")
+ parser.add_argument("--dtype",
+ type=str,
+ choices=sorted(zero_to_fp32.OUTPUT_DTYPE_NAMES),
+ required=True,
+ help="output tensor dtype")
+ parser.add_argument("--max_shard_size",
+ type=str,
+ default="5GB",
+ help="maximum size of each checkpoint shard, such as 5GB or 500MB")
+ parser.add_argument("--safe_serialization",
+ default=False,
+ action='store_true',
+ help="save with safetensors instead of PyTorch pickle serialization")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier, e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug output")
+ parsed_args = parser.parse_args(args)
+
+ zero_to_fp32.debug = parsed_args.debug
+ zero_to_fp32.convert_zero_checkpoint_to_state_dict(parsed_args.checkpoint_dir,
+ parsed_args.output_dir,
+ dtype=parsed_args.dtype,
+ max_shard_size=parsed_args.max_shard_size,
+ safe_serialization=parsed_args.safe_serialization,
+ tag=parsed_args.tag,
+ exclude_frozen_parameters=parsed_args.exclude_frozen_parameters)
+
+
+if __name__ == "__main__":
+ main()
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/chat_template.jinja b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..01be9b307daa2d425f7c168c9fb145a286e0afb4
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/chat_template.jinja
@@ -0,0 +1,89 @@
+{%- if tools %}
+ {{- '<|im_start|>system\n' }}
+ {%- if messages[0].role == 'system' %}
+ {{- messages[0].content + '\n\n' }}
+ {%- endif %}
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+{%- endfor %}
+{%- for message in messages %}
+ {%- if message.content is string %}
+ {%- set content = message.content %}
+ {%- else %}
+ {%- set content = '' %}
+ {%- endif %}
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {%- if loop.last or (not loop.last and reasoning_content) %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if (loop.first and content) or (not loop.first) %}
+ {{- '\n' }}
+ {%- endif %}
+ {%- if tool_call.function %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {{- '\n{"name": "' }}
+ {{- tool_call.name }}
+ {{- '", "arguments": ' }}
+ {%- if tool_call.arguments is string %}
+ {{- tool_call.arguments }}
+ {%- else %}
+ {{- tool_call.arguments | tojson }}
+ {%- endif %}
+ {{- '}\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/config.json
new file mode 100644
index 0000000000000000000000000000000000000000..5d9cef07396baadff5390e4508eb33025967a029
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/config.json
@@ -0,0 +1,63 @@
+{
+ "architectures": [
+ "Qwen3ForCausalLM"
+ ],
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "bos_token_id": null,
+ "dtype": "bfloat16",
+ "eos_token_id": 151645,
+ "head_dim": 128,
+ "hidden_act": "silu",
+ "hidden_size": 2048,
+ "initializer_range": 0.02,
+ "intermediate_size": 6144,
+ "layer_types": [
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 40960,
+ "max_window_layers": 28,
+ "model_type": "qwen3",
+ "num_attention_heads": 16,
+ "num_hidden_layers": 28,
+ "num_key_value_heads": 8,
+ "pad_token_id": 151643,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 1000000,
+ "rope_type": "default"
+ },
+ "sliding_window": null,
+ "tie_word_embeddings": true,
+ "transformers_version": "5.17.0",
+ "use_cache": false,
+ "use_sliding_window": false,
+ "vocab_size": 151936
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/generation_config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/generation_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..e6941fe4b04f26113d6eef6255d005c4d7090bda
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/generation_config.json
@@ -0,0 +1,12 @@
+{
+ "do_sample": true,
+ "eos_token_id": [
+ 151645,
+ 151643
+ ],
+ "pad_token_id": 151643,
+ "temperature": 0.6,
+ "top_k": 20,
+ "top_p": 0.95,
+ "transformers_version": "5.17.0"
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/global_step2475/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/global_step2475/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..f7bef0b6f7a29272f6c6b35e9cef9e9a8c43c973
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/global_step2475/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:5b7dc896c12572435eb9976837f5cce7f3f70d76572df2261f79b9ad7cb47055
+size 10323466465
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/global_step2475/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/global_step2475/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..ee078fe6c39eeb9ed6ef0f87320673f0b81b1ce1
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/global_step2475/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:a309692649a69670b1edd7342b9e85ee0bd63b85a84d2b4980c5907407241776
+size 10323469601
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/global_step2475/mp_rank_00_model_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/global_step2475/mp_rank_00_model_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..60749262a949a122f52c61c4b393e5ed69dc39b9
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/global_step2475/mp_rank_00_model_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:c474b42b2049e044cb884a724f865ff3052d0a830e1bf02adcca1cf869d4855b
+size 3441239653
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/latest b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/latest
new file mode 100644
index 0000000000000000000000000000000000000000..fbeedf03172d647e3cbe93eb80f563c2fd003077
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/latest
@@ -0,0 +1 @@
+global_step2475
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/model.safetensors b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..7a8918d1c9d62ceb14cea048b7d448374c01ead2
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:fa5d551b4af650e317b35a41dce4800011bdfe6d7e07b934fdd8441e44043ddb
+size 4063515640
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/rng_state_0.pth b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/rng_state_0.pth
new file mode 100644
index 0000000000000000000000000000000000000000..06aaa9eb50010af39d8e52dfa7116959fb72976b
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/rng_state_0.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:948282bfdd138e468bab62957552a94f8947ff21a89bf81fbefc3360c5f0965e
+size 14917
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/rng_state_1.pth b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/rng_state_1.pth
new file mode 100644
index 0000000000000000000000000000000000000000..a2eddcc2f1907f052432f2cbf01e9eeb0ac9c9e3
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/rng_state_1.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:47a0523bd1f56a1423a54522d445aad486271bb34e995627e44b9c4abdc454ed
+size 14917
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/scheduler.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/scheduler.pt
new file mode 100644
index 0000000000000000000000000000000000000000..bd98883ea1f8fcdc981a2fee26dc446d08222be6
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/scheduler.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:d2890c1ef6057f33ee4e0f15383f1f24eb5a02e92cd00aeb789ea714f44aa540
+size 1465
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/tokenizer.json b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..c7afbed2efcdf019f88ab0572ec29d3bf595dfe2
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:be75606093db2094d7cd20f3c2f385c212750648bd6ea4fb2bf507a6a4c55506
+size 11422650
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/tokenizer_config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..770e41d6c92519d525eede4cbcf3ba27f6425311
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/tokenizer_config.json
@@ -0,0 +1,30 @@
+{
+ "add_prefix_space": false,
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "is_local": false,
+ "local_files_only": false,
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/trainer_state.json b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..0bf4da376561fa99c96de8776bbb48b33719e469
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/trainer_state.json
@@ -0,0 +1,25334 @@
+{
+ "best_global_step": 950,
+ "best_metric": 1.5272752046585083,
+ "best_model_checkpoint": "./checkpoints/qwen3-1.7b-teutonic-5e6/checkpoint-500",
+ "epoch": 5.0,
+ "eval_steps": 50,
+ "global_step": 2475,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 0.8295683860778809,
+ "epoch": 0.00202020202020202,
+ "grad_norm": 10.886772155761719,
+ "learning_rate": 5e-06,
+ "loss": 1.5185801982879639,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 16384.0,
+ "step": 1
+ },
+ {
+ "entropy": 1.1781222820281982,
+ "epoch": 0.00404040404040404,
+ "grad_norm": 13.80163288116455,
+ "learning_rate": 4.997979797979798e-06,
+ "loss": 2.18377685546875,
+ "mean_token_accuracy": 0.5700415372848511,
+ "num_tokens": 32768.0,
+ "step": 2
+ },
+ {
+ "entropy": 0.7972303032875061,
+ "epoch": 0.006060606060606061,
+ "grad_norm": 13.71261215209961,
+ "learning_rate": 4.995959595959596e-06,
+ "loss": 1.5810277462005615,
+ "mean_token_accuracy": 0.6782486438751221,
+ "num_tokens": 49152.0,
+ "step": 3
+ },
+ {
+ "entropy": 0.9709298610687256,
+ "epoch": 0.00808080808080808,
+ "grad_norm": 9.18797779083252,
+ "learning_rate": 4.993939393939394e-06,
+ "loss": 1.6923656463623047,
+ "mean_token_accuracy": 0.6447850465774536,
+ "num_tokens": 65536.0,
+ "step": 4
+ },
+ {
+ "entropy": 1.2161898612976074,
+ "epoch": 0.010101010101010102,
+ "grad_norm": 8.97508430480957,
+ "learning_rate": 4.991919191919192e-06,
+ "loss": 1.9361608028411865,
+ "mean_token_accuracy": 0.5922691822052002,
+ "num_tokens": 81920.0,
+ "step": 5
+ },
+ {
+ "entropy": 0.9950039982795715,
+ "epoch": 0.012121212121212121,
+ "grad_norm": 6.453213214874268,
+ "learning_rate": 4.98989898989899e-06,
+ "loss": 1.5012480020523071,
+ "mean_token_accuracy": 0.6671959161758423,
+ "num_tokens": 98304.0,
+ "step": 6
+ },
+ {
+ "entropy": 1.452682614326477,
+ "epoch": 0.014141414141414142,
+ "grad_norm": 8.50411605834961,
+ "learning_rate": 4.987878787878789e-06,
+ "loss": 2.1297783851623535,
+ "mean_token_accuracy": 0.5807889699935913,
+ "num_tokens": 114688.0,
+ "step": 7
+ },
+ {
+ "entropy": 1.4661014080047607,
+ "epoch": 0.01616161616161616,
+ "grad_norm": 4.290146827697754,
+ "learning_rate": 4.9858585858585865e-06,
+ "loss": 1.7391963005065918,
+ "mean_token_accuracy": 0.611993134021759,
+ "num_tokens": 131072.0,
+ "step": 8
+ },
+ {
+ "entropy": 1.9030903577804565,
+ "epoch": 0.01818181818181818,
+ "grad_norm": 4.503584384918213,
+ "learning_rate": 4.983838383838384e-06,
+ "loss": 2.283596992492676,
+ "mean_token_accuracy": 0.5261968970298767,
+ "num_tokens": 147456.0,
+ "step": 9
+ },
+ {
+ "entropy": 1.2784137725830078,
+ "epoch": 0.020202020202020204,
+ "grad_norm": 3.427410840988159,
+ "learning_rate": 4.981818181818182e-06,
+ "loss": 1.5032392740249634,
+ "mean_token_accuracy": 0.6578529477119446,
+ "num_tokens": 163840.0,
+ "step": 10
+ },
+ {
+ "entropy": 1.7487188577651978,
+ "epoch": 0.022222222222222223,
+ "grad_norm": 3.20536470413208,
+ "learning_rate": 4.97979797979798e-06,
+ "loss": 1.9184643030166626,
+ "mean_token_accuracy": 0.6093673706054688,
+ "num_tokens": 180224.0,
+ "step": 11
+ },
+ {
+ "entropy": 1.6585394144058228,
+ "epoch": 0.024242424242424242,
+ "grad_norm": 3.2463598251342773,
+ "learning_rate": 4.977777777777778e-06,
+ "loss": 1.8364639282226562,
+ "mean_token_accuracy": 0.6014899611473083,
+ "num_tokens": 196608.0,
+ "step": 12
+ },
+ {
+ "entropy": 1.4869519472122192,
+ "epoch": 0.026262626262626262,
+ "grad_norm": 2.8681719303131104,
+ "learning_rate": 4.975757575757576e-06,
+ "loss": 1.6356265544891357,
+ "mean_token_accuracy": 0.6361138224601746,
+ "num_tokens": 212992.0,
+ "step": 13
+ },
+ {
+ "entropy": 1.5179094076156616,
+ "epoch": 0.028282828282828285,
+ "grad_norm": 3.0470707416534424,
+ "learning_rate": 4.973737373737374e-06,
+ "loss": 1.6317660808563232,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 229376.0,
+ "step": 14
+ },
+ {
+ "entropy": 1.7384330034255981,
+ "epoch": 0.030303030303030304,
+ "grad_norm": 2.6149742603302,
+ "learning_rate": 4.971717171717172e-06,
+ "loss": 1.67923903465271,
+ "mean_token_accuracy": 0.6469223499298096,
+ "num_tokens": 245760.0,
+ "step": 15
+ },
+ {
+ "entropy": 2.108799457550049,
+ "epoch": 0.03232323232323232,
+ "grad_norm": 3.694795608520508,
+ "learning_rate": 4.9696969696969696e-06,
+ "loss": 1.9052371978759766,
+ "mean_token_accuracy": 0.5927577018737793,
+ "num_tokens": 262144.0,
+ "step": 16
+ },
+ {
+ "entropy": 1.7532848119735718,
+ "epoch": 0.03434343434343434,
+ "grad_norm": 3.1510567665100098,
+ "learning_rate": 4.9676767676767675e-06,
+ "loss": 1.6382691860198975,
+ "mean_token_accuracy": 0.6311675906181335,
+ "num_tokens": 278528.0,
+ "step": 17
+ },
+ {
+ "entropy": 1.723548412322998,
+ "epoch": 0.03636363636363636,
+ "grad_norm": 3.093825340270996,
+ "learning_rate": 4.965656565656566e-06,
+ "loss": 1.6039624214172363,
+ "mean_token_accuracy": 0.6313507556915283,
+ "num_tokens": 294912.0,
+ "step": 18
+ },
+ {
+ "entropy": 1.4790765047073364,
+ "epoch": 0.03838383838383838,
+ "grad_norm": 2.7150535583496094,
+ "learning_rate": 4.963636363636364e-06,
+ "loss": 1.4173667430877686,
+ "mean_token_accuracy": 0.6627381443977356,
+ "num_tokens": 311296.0,
+ "step": 19
+ },
+ {
+ "entropy": 1.5827536582946777,
+ "epoch": 0.04040404040404041,
+ "grad_norm": 2.610966444015503,
+ "learning_rate": 4.961616161616162e-06,
+ "loss": 1.4604644775390625,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 327680.0,
+ "step": 20
+ },
+ {
+ "entropy": 2.054673194885254,
+ "epoch": 0.04242424242424243,
+ "grad_norm": 2.612940788269043,
+ "learning_rate": 4.95959595959596e-06,
+ "loss": 1.962029218673706,
+ "mean_token_accuracy": 0.5719956159591675,
+ "num_tokens": 344064.0,
+ "step": 21
+ },
+ {
+ "entropy": 1.6684198379516602,
+ "epoch": 0.044444444444444446,
+ "grad_norm": 2.5426013469696045,
+ "learning_rate": 4.957575757575758e-06,
+ "loss": 1.591176986694336,
+ "mean_token_accuracy": 0.6519907116889954,
+ "num_tokens": 360448.0,
+ "step": 22
+ },
+ {
+ "entropy": 1.9070855379104614,
+ "epoch": 0.046464646464646465,
+ "grad_norm": 2.5853357315063477,
+ "learning_rate": 4.9555555555555565e-06,
+ "loss": 1.930276870727539,
+ "mean_token_accuracy": 0.5895823240280151,
+ "num_tokens": 376832.0,
+ "step": 23
+ },
+ {
+ "entropy": 1.716689109802246,
+ "epoch": 0.048484848484848485,
+ "grad_norm": 2.7608494758605957,
+ "learning_rate": 4.953535353535354e-06,
+ "loss": 1.739159345626831,
+ "mean_token_accuracy": 0.6028944849967957,
+ "num_tokens": 393216.0,
+ "step": 24
+ },
+ {
+ "entropy": 1.5666695833206177,
+ "epoch": 0.050505050505050504,
+ "grad_norm": 2.5973074436187744,
+ "learning_rate": 4.951515151515152e-06,
+ "loss": 1.6016302108764648,
+ "mean_token_accuracy": 0.626099169254303,
+ "num_tokens": 409600.0,
+ "step": 25
+ },
+ {
+ "entropy": 1.4267652034759521,
+ "epoch": 0.052525252525252523,
+ "grad_norm": 2.163451910018921,
+ "learning_rate": 4.94949494949495e-06,
+ "loss": 1.5093598365783691,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 425984.0,
+ "step": 26
+ },
+ {
+ "entropy": 1.8537150621414185,
+ "epoch": 0.05454545454545454,
+ "grad_norm": 2.6983258724212646,
+ "learning_rate": 4.947474747474748e-06,
+ "loss": 1.8831868171691895,
+ "mean_token_accuracy": 0.5802393555641174,
+ "num_tokens": 442368.0,
+ "step": 27
+ },
+ {
+ "entropy": 1.410015344619751,
+ "epoch": 0.05656565656565657,
+ "grad_norm": 2.4777796268463135,
+ "learning_rate": 4.945454545454546e-06,
+ "loss": 1.4835734367370605,
+ "mean_token_accuracy": 0.6519907116889954,
+ "num_tokens": 458752.0,
+ "step": 28
+ },
+ {
+ "entropy": 1.2399017810821533,
+ "epoch": 0.05858585858585859,
+ "grad_norm": 2.1676478385925293,
+ "learning_rate": 4.943434343434344e-06,
+ "loss": 1.330633282661438,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 475136.0,
+ "step": 29
+ },
+ {
+ "entropy": 1.6478898525238037,
+ "epoch": 0.06060606060606061,
+ "grad_norm": 2.5325536727905273,
+ "learning_rate": 4.941414141414142e-06,
+ "loss": 1.771777868270874,
+ "mean_token_accuracy": 0.6128480434417725,
+ "num_tokens": 491520.0,
+ "step": 30
+ },
+ {
+ "entropy": 1.7915360927581787,
+ "epoch": 0.06262626262626263,
+ "grad_norm": 2.2419557571411133,
+ "learning_rate": 4.93939393939394e-06,
+ "loss": 1.870645523071289,
+ "mean_token_accuracy": 0.6074743270874023,
+ "num_tokens": 507904.0,
+ "step": 31
+ },
+ {
+ "entropy": 1.7638899087905884,
+ "epoch": 0.06464646464646465,
+ "grad_norm": 2.8063058853149414,
+ "learning_rate": 4.937373737373738e-06,
+ "loss": 1.83987557888031,
+ "mean_token_accuracy": 0.5836589932441711,
+ "num_tokens": 524288.0,
+ "step": 32
+ },
+ {
+ "entropy": 1.4097516536712646,
+ "epoch": 0.06666666666666667,
+ "grad_norm": 2.1857714653015137,
+ "learning_rate": 4.935353535353536e-06,
+ "loss": 1.477668285369873,
+ "mean_token_accuracy": 0.6507083773612976,
+ "num_tokens": 540672.0,
+ "step": 33
+ },
+ {
+ "entropy": 1.4447426795959473,
+ "epoch": 0.06868686868686869,
+ "grad_norm": 2.3771870136260986,
+ "learning_rate": 4.933333333333334e-06,
+ "loss": 1.536318063735962,
+ "mean_token_accuracy": 0.6383732557296753,
+ "num_tokens": 557056.0,
+ "step": 34
+ },
+ {
+ "entropy": 1.9658164978027344,
+ "epoch": 0.0707070707070707,
+ "grad_norm": 2.4784936904907227,
+ "learning_rate": 4.931313131313132e-06,
+ "loss": 2.0565035343170166,
+ "mean_token_accuracy": 0.5581949353218079,
+ "num_tokens": 573440.0,
+ "step": 35
+ },
+ {
+ "entropy": 1.6045317649841309,
+ "epoch": 0.07272727272727272,
+ "grad_norm": 2.1128504276275635,
+ "learning_rate": 4.92929292929293e-06,
+ "loss": 1.6234952211380005,
+ "mean_token_accuracy": 0.6293356418609619,
+ "num_tokens": 589824.0,
+ "step": 36
+ },
+ {
+ "entropy": 1.5491269826889038,
+ "epoch": 0.07474747474747474,
+ "grad_norm": 2.1672937870025635,
+ "learning_rate": 4.927272727272728e-06,
+ "loss": 1.5809822082519531,
+ "mean_token_accuracy": 0.6419760584831238,
+ "num_tokens": 606208.0,
+ "step": 37
+ },
+ {
+ "entropy": 1.545534610748291,
+ "epoch": 0.07676767676767676,
+ "grad_norm": 2.2526934146881104,
+ "learning_rate": 4.925252525252526e-06,
+ "loss": 1.5707473754882812,
+ "mean_token_accuracy": 0.6344650983810425,
+ "num_tokens": 622592.0,
+ "step": 38
+ },
+ {
+ "entropy": 1.579596757888794,
+ "epoch": 0.07878787878787878,
+ "grad_norm": 2.3988492488861084,
+ "learning_rate": 4.9232323232323235e-06,
+ "loss": 1.6725983619689941,
+ "mean_token_accuracy": 0.6243282556533813,
+ "num_tokens": 638976.0,
+ "step": 39
+ },
+ {
+ "entropy": 2.0438785552978516,
+ "epoch": 0.08080808080808081,
+ "grad_norm": 2.3314359188079834,
+ "learning_rate": 4.9212121212121214e-06,
+ "loss": 2.0424888134002686,
+ "mean_token_accuracy": 0.570713222026825,
+ "num_tokens": 655360.0,
+ "step": 40
+ },
+ {
+ "entropy": 1.8690773248672485,
+ "epoch": 0.08282828282828283,
+ "grad_norm": 2.130401134490967,
+ "learning_rate": 4.919191919191919e-06,
+ "loss": 1.8796970844268799,
+ "mean_token_accuracy": 0.5882999300956726,
+ "num_tokens": 671744.0,
+ "step": 41
+ },
+ {
+ "entropy": 1.756626009941101,
+ "epoch": 0.08484848484848485,
+ "grad_norm": 2.342318534851074,
+ "learning_rate": 4.917171717171717e-06,
+ "loss": 1.71901535987854,
+ "mean_token_accuracy": 0.6173668503761292,
+ "num_tokens": 688128.0,
+ "step": 42
+ },
+ {
+ "entropy": 1.4642508029937744,
+ "epoch": 0.08686868686868687,
+ "grad_norm": 1.993338704109192,
+ "learning_rate": 4.915151515151516e-06,
+ "loss": 1.4660165309906006,
+ "mean_token_accuracy": 0.6687225103378296,
+ "num_tokens": 704512.0,
+ "step": 43
+ },
+ {
+ "entropy": 1.790807843208313,
+ "epoch": 0.08888888888888889,
+ "grad_norm": 2.3186943531036377,
+ "learning_rate": 4.913131313131314e-06,
+ "loss": 1.7102060317993164,
+ "mean_token_accuracy": 0.6238397359848022,
+ "num_tokens": 720896.0,
+ "step": 44
+ },
+ {
+ "entropy": 1.5970485210418701,
+ "epoch": 0.09090909090909091,
+ "grad_norm": 2.299307346343994,
+ "learning_rate": 4.911111111111112e-06,
+ "loss": 1.5170013904571533,
+ "mean_token_accuracy": 0.652662456035614,
+ "num_tokens": 737280.0,
+ "step": 45
+ },
+ {
+ "entropy": 1.3955466747283936,
+ "epoch": 0.09292929292929293,
+ "grad_norm": 2.171952962875366,
+ "learning_rate": 4.90909090909091e-06,
+ "loss": 1.4059661626815796,
+ "mean_token_accuracy": 0.6654250025749207,
+ "num_tokens": 753664.0,
+ "step": 46
+ },
+ {
+ "entropy": 1.7198575735092163,
+ "epoch": 0.09494949494949495,
+ "grad_norm": 2.385092258453369,
+ "learning_rate": 4.9070707070707075e-06,
+ "loss": 1.730346918106079,
+ "mean_token_accuracy": 0.6191987991333008,
+ "num_tokens": 770048.0,
+ "step": 47
+ },
+ {
+ "entropy": 1.3542555570602417,
+ "epoch": 0.09696969696969697,
+ "grad_norm": 2.1463189125061035,
+ "learning_rate": 4.905050505050505e-06,
+ "loss": 1.346085786819458,
+ "mean_token_accuracy": 0.680446982383728,
+ "num_tokens": 786432.0,
+ "step": 48
+ },
+ {
+ "entropy": 1.8084443807601929,
+ "epoch": 0.09898989898989899,
+ "grad_norm": 2.1505849361419678,
+ "learning_rate": 4.903030303030303e-06,
+ "loss": 1.847151756286621,
+ "mean_token_accuracy": 0.5926355719566345,
+ "num_tokens": 802816.0,
+ "step": 49
+ },
+ {
+ "entropy": 1.751160979270935,
+ "epoch": 0.10101010101010101,
+ "grad_norm": 2.1436259746551514,
+ "learning_rate": 4.901010101010101e-06,
+ "loss": 1.7802404165267944,
+ "mean_token_accuracy": 0.5996580123901367,
+ "num_tokens": 819200.0,
+ "step": 50
+ },
+ {
+ "epoch": 0.10101010101010101,
+ "eval_entropy": 1.6292865045609013,
+ "eval_loss": 1.6725393533706665,
+ "eval_mean_token_accuracy": 0.6230050469598463,
+ "eval_num_tokens": 819200.0,
+ "eval_runtime": 43.9148,
+ "eval_samples_per_second": 22.544,
+ "eval_steps_per_second": 2.824,
+ "step": 50
+ },
+ {
+ "entropy": 1.4428319931030273,
+ "epoch": 0.10303030303030303,
+ "grad_norm": 2.0954954624176025,
+ "learning_rate": 4.898989898989899e-06,
+ "loss": 1.4927232265472412,
+ "mean_token_accuracy": 0.6522349715232849,
+ "num_tokens": 835584.0,
+ "step": 51
+ },
+ {
+ "entropy": 1.7493115663528442,
+ "epoch": 0.10505050505050505,
+ "grad_norm": 2.300030469894409,
+ "learning_rate": 4.896969696969697e-06,
+ "loss": 1.737417221069336,
+ "mean_token_accuracy": 0.6213361024856567,
+ "num_tokens": 851968.0,
+ "step": 52
+ },
+ {
+ "entropy": 1.7801647186279297,
+ "epoch": 0.10707070707070707,
+ "grad_norm": 2.3947081565856934,
+ "learning_rate": 4.894949494949495e-06,
+ "loss": 1.8372564315795898,
+ "mean_token_accuracy": 0.5931240916252136,
+ "num_tokens": 868352.0,
+ "step": 53
+ },
+ {
+ "entropy": 1.6934887170791626,
+ "epoch": 0.10909090909090909,
+ "grad_norm": 2.1981089115142822,
+ "learning_rate": 4.8929292929292936e-06,
+ "loss": 1.734646201133728,
+ "mean_token_accuracy": 0.611932098865509,
+ "num_tokens": 884736.0,
+ "step": 54
+ },
+ {
+ "entropy": 1.3401941061019897,
+ "epoch": 0.1111111111111111,
+ "grad_norm": 2.193511724472046,
+ "learning_rate": 4.8909090909090914e-06,
+ "loss": 1.399888038635254,
+ "mean_token_accuracy": 0.6745847463607788,
+ "num_tokens": 901120.0,
+ "step": 55
+ },
+ {
+ "entropy": 1.8244661092758179,
+ "epoch": 0.11313131313131314,
+ "grad_norm": 2.4358489513397217,
+ "learning_rate": 4.888888888888889e-06,
+ "loss": 1.8716282844543457,
+ "mean_token_accuracy": 0.5867122411727905,
+ "num_tokens": 917504.0,
+ "step": 56
+ },
+ {
+ "entropy": 1.5019619464874268,
+ "epoch": 0.11515151515151516,
+ "grad_norm": 2.1135261058807373,
+ "learning_rate": 4.886868686868687e-06,
+ "loss": 1.523103952407837,
+ "mean_token_accuracy": 0.6414265036582947,
+ "num_tokens": 933888.0,
+ "step": 57
+ },
+ {
+ "entropy": 1.6132855415344238,
+ "epoch": 0.11717171717171718,
+ "grad_norm": 2.026301145553589,
+ "learning_rate": 4.884848484848485e-06,
+ "loss": 1.6233609914779663,
+ "mean_token_accuracy": 0.6279311180114746,
+ "num_tokens": 950272.0,
+ "step": 58
+ },
+ {
+ "entropy": 1.738538384437561,
+ "epoch": 0.1191919191919192,
+ "grad_norm": 2.1539394855499268,
+ "learning_rate": 4.882828282828283e-06,
+ "loss": 1.8147332668304443,
+ "mean_token_accuracy": 0.6124816536903381,
+ "num_tokens": 966656.0,
+ "step": 59
+ },
+ {
+ "entropy": 1.5533764362335205,
+ "epoch": 0.12121212121212122,
+ "grad_norm": 2.2603628635406494,
+ "learning_rate": 4.880808080808081e-06,
+ "loss": 1.562873125076294,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 983040.0,
+ "step": 60
+ },
+ {
+ "entropy": 1.722406268119812,
+ "epoch": 0.12323232323232323,
+ "grad_norm": 2.3630757331848145,
+ "learning_rate": 4.878787878787879e-06,
+ "loss": 1.7461689710617065,
+ "mean_token_accuracy": 0.6023448705673218,
+ "num_tokens": 999424.0,
+ "step": 61
+ },
+ {
+ "entropy": 1.6533517837524414,
+ "epoch": 0.12525252525252525,
+ "grad_norm": 2.2165415287017822,
+ "learning_rate": 4.876767676767677e-06,
+ "loss": 1.676560640335083,
+ "mean_token_accuracy": 0.6437469720840454,
+ "num_tokens": 1015808.0,
+ "step": 62
+ },
+ {
+ "entropy": 1.749995470046997,
+ "epoch": 0.12727272727272726,
+ "grad_norm": 2.1572678089141846,
+ "learning_rate": 4.8747474747474745e-06,
+ "loss": 1.784087896347046,
+ "mean_token_accuracy": 0.5884831547737122,
+ "num_tokens": 1032192.0,
+ "step": 63
+ },
+ {
+ "entropy": 1.442152738571167,
+ "epoch": 0.1292929292929293,
+ "grad_norm": 2.163490056991577,
+ "learning_rate": 4.872727272727273e-06,
+ "loss": 1.4307503700256348,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 1048576.0,
+ "step": 64
+ },
+ {
+ "entropy": 1.2657029628753662,
+ "epoch": 0.13131313131313133,
+ "grad_norm": 2.1225337982177734,
+ "learning_rate": 4.870707070707071e-06,
+ "loss": 1.2731966972351074,
+ "mean_token_accuracy": 0.688568651676178,
+ "num_tokens": 1064960.0,
+ "step": 65
+ },
+ {
+ "entropy": 1.1613880395889282,
+ "epoch": 0.13333333333333333,
+ "grad_norm": 1.9527196884155273,
+ "learning_rate": 4.868686868686869e-06,
+ "loss": 1.13922119140625,
+ "mean_token_accuracy": 0.7389472126960754,
+ "num_tokens": 1081344.0,
+ "step": 66
+ },
+ {
+ "entropy": 1.6936380863189697,
+ "epoch": 0.13535353535353536,
+ "grad_norm": 2.004284620285034,
+ "learning_rate": 4.866666666666667e-06,
+ "loss": 1.6982238292694092,
+ "mean_token_accuracy": 0.6191987991333008,
+ "num_tokens": 1097728.0,
+ "step": 67
+ },
+ {
+ "entropy": 1.750565528869629,
+ "epoch": 0.13737373737373737,
+ "grad_norm": 2.225955009460449,
+ "learning_rate": 4.864646464646466e-06,
+ "loss": 1.796521782875061,
+ "mean_token_accuracy": 0.5934293866157532,
+ "num_tokens": 1114112.0,
+ "step": 68
+ },
+ {
+ "entropy": 1.6608220338821411,
+ "epoch": 0.1393939393939394,
+ "grad_norm": 2.127035617828369,
+ "learning_rate": 4.8626262626262636e-06,
+ "loss": 1.6633095741271973,
+ "mean_token_accuracy": 0.6356253027915955,
+ "num_tokens": 1130496.0,
+ "step": 69
+ },
+ {
+ "entropy": 1.4848661422729492,
+ "epoch": 0.1414141414141414,
+ "grad_norm": 2.0338215827941895,
+ "learning_rate": 4.8606060606060615e-06,
+ "loss": 1.4789674282073975,
+ "mean_token_accuracy": 0.6680508255958557,
+ "num_tokens": 1146880.0,
+ "step": 70
+ },
+ {
+ "entropy": 1.2310466766357422,
+ "epoch": 0.14343434343434344,
+ "grad_norm": 2.105898141860962,
+ "learning_rate": 4.858585858585859e-06,
+ "loss": 1.2301937341690063,
+ "mean_token_accuracy": 0.7040791511535645,
+ "num_tokens": 1163264.0,
+ "step": 71
+ },
+ {
+ "entropy": 1.6310514211654663,
+ "epoch": 0.14545454545454545,
+ "grad_norm": 2.152125358581543,
+ "learning_rate": 4.856565656565657e-06,
+ "loss": 1.643636703491211,
+ "mean_token_accuracy": 0.6221299171447754,
+ "num_tokens": 1179648.0,
+ "step": 72
+ },
+ {
+ "entropy": 1.4747940301895142,
+ "epoch": 0.14747474747474748,
+ "grad_norm": 2.096461296081543,
+ "learning_rate": 4.854545454545455e-06,
+ "loss": 1.42953360080719,
+ "mean_token_accuracy": 0.6651807427406311,
+ "num_tokens": 1196032.0,
+ "step": 73
+ },
+ {
+ "entropy": 1.819259524345398,
+ "epoch": 0.1494949494949495,
+ "grad_norm": 2.2852063179016113,
+ "learning_rate": 4.852525252525253e-06,
+ "loss": 1.845325231552124,
+ "mean_token_accuracy": 0.6036272644996643,
+ "num_tokens": 1212416.0,
+ "step": 74
+ },
+ {
+ "entropy": 1.4233598709106445,
+ "epoch": 0.15151515151515152,
+ "grad_norm": 2.1157381534576416,
+ "learning_rate": 4.850505050505051e-06,
+ "loss": 1.4565438032150269,
+ "mean_token_accuracy": 0.6607230305671692,
+ "num_tokens": 1228800.0,
+ "step": 75
+ },
+ {
+ "entropy": 1.6441459655761719,
+ "epoch": 0.15353535353535352,
+ "grad_norm": 2.2092180252075195,
+ "learning_rate": 4.848484848484849e-06,
+ "loss": 1.6467639207839966,
+ "mean_token_accuracy": 0.6285417675971985,
+ "num_tokens": 1245184.0,
+ "step": 76
+ },
+ {
+ "entropy": 1.6124308109283447,
+ "epoch": 0.15555555555555556,
+ "grad_norm": 2.231876850128174,
+ "learning_rate": 4.846464646464647e-06,
+ "loss": 1.617384672164917,
+ "mean_token_accuracy": 0.6340987086296082,
+ "num_tokens": 1261568.0,
+ "step": 77
+ },
+ {
+ "entropy": 1.828405499458313,
+ "epoch": 0.15757575757575756,
+ "grad_norm": 2.1372313499450684,
+ "learning_rate": 4.8444444444444446e-06,
+ "loss": 1.8333203792572021,
+ "mean_token_accuracy": 0.5979481935501099,
+ "num_tokens": 1277952.0,
+ "step": 78
+ },
+ {
+ "entropy": 1.855564832687378,
+ "epoch": 0.1595959595959596,
+ "grad_norm": 2.1422762870788574,
+ "learning_rate": 4.842424242424243e-06,
+ "loss": 1.9133609533309937,
+ "mean_token_accuracy": 0.570652186870575,
+ "num_tokens": 1294336.0,
+ "step": 79
+ },
+ {
+ "entropy": 1.7908183336257935,
+ "epoch": 0.16161616161616163,
+ "grad_norm": 2.172368049621582,
+ "learning_rate": 4.840404040404041e-06,
+ "loss": 1.8109419345855713,
+ "mean_token_accuracy": 0.60332190990448,
+ "num_tokens": 1310720.0,
+ "step": 80
+ },
+ {
+ "entropy": 1.9537721872329712,
+ "epoch": 0.16363636363636364,
+ "grad_norm": 2.199505090713501,
+ "learning_rate": 4.838383838383839e-06,
+ "loss": 2.0001401901245117,
+ "mean_token_accuracy": 0.5585613250732422,
+ "num_tokens": 1327104.0,
+ "step": 81
+ },
+ {
+ "entropy": 1.5365772247314453,
+ "epoch": 0.16565656565656567,
+ "grad_norm": 2.0778913497924805,
+ "learning_rate": 4.836363636363637e-06,
+ "loss": 1.575089931488037,
+ "mean_token_accuracy": 0.6375183463096619,
+ "num_tokens": 1343488.0,
+ "step": 82
+ },
+ {
+ "entropy": 1.7177143096923828,
+ "epoch": 0.16767676767676767,
+ "grad_norm": 2.1010894775390625,
+ "learning_rate": 4.834343434343435e-06,
+ "loss": 1.7428388595581055,
+ "mean_token_accuracy": 0.6113824844360352,
+ "num_tokens": 1359872.0,
+ "step": 83
+ },
+ {
+ "entropy": 1.5080527067184448,
+ "epoch": 0.1696969696969697,
+ "grad_norm": 2.021969795227051,
+ "learning_rate": 4.832323232323233e-06,
+ "loss": 1.5361201763153076,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 1376256.0,
+ "step": 84
+ },
+ {
+ "entropy": 1.5042120218276978,
+ "epoch": 0.1717171717171717,
+ "grad_norm": 2.121314287185669,
+ "learning_rate": 4.830303030303031e-06,
+ "loss": 1.4912033081054688,
+ "mean_token_accuracy": 0.6621274948120117,
+ "num_tokens": 1392640.0,
+ "step": 85
+ },
+ {
+ "entropy": 1.9523948431015015,
+ "epoch": 0.17373737373737375,
+ "grad_norm": 2.1702609062194824,
+ "learning_rate": 4.8282828282828285e-06,
+ "loss": 1.9369449615478516,
+ "mean_token_accuracy": 0.5727283954620361,
+ "num_tokens": 1409024.0,
+ "step": 86
+ },
+ {
+ "entropy": 1.6174770593643188,
+ "epoch": 0.17575757575757575,
+ "grad_norm": 2.222412109375,
+ "learning_rate": 4.826262626262626e-06,
+ "loss": 1.6794973611831665,
+ "mean_token_accuracy": 0.6151685118675232,
+ "num_tokens": 1425408.0,
+ "step": 87
+ },
+ {
+ "entropy": 1.1480307579040527,
+ "epoch": 0.17777777777777778,
+ "grad_norm": 1.98936128616333,
+ "learning_rate": 4.824242424242424e-06,
+ "loss": 1.1324063539505005,
+ "mean_token_accuracy": 0.7193453907966614,
+ "num_tokens": 1441792.0,
+ "step": 88
+ },
+ {
+ "entropy": 1.5290263891220093,
+ "epoch": 0.1797979797979798,
+ "grad_norm": 2.098860263824463,
+ "learning_rate": 4.822222222222222e-06,
+ "loss": 1.556044340133667,
+ "mean_token_accuracy": 0.6415486335754395,
+ "num_tokens": 1458176.0,
+ "step": 89
+ },
+ {
+ "entropy": 1.1366127729415894,
+ "epoch": 0.18181818181818182,
+ "grad_norm": 1.9387420415878296,
+ "learning_rate": 4.820202020202021e-06,
+ "loss": 1.1635141372680664,
+ "mean_token_accuracy": 0.7168416976928711,
+ "num_tokens": 1474560.0,
+ "step": 90
+ },
+ {
+ "entropy": 1.5142875909805298,
+ "epoch": 0.18383838383838383,
+ "grad_norm": 2.259131908416748,
+ "learning_rate": 4.818181818181819e-06,
+ "loss": 1.5329954624176025,
+ "mean_token_accuracy": 0.6471666097640991,
+ "num_tokens": 1490944.0,
+ "step": 91
+ },
+ {
+ "entropy": 1.5197135210037231,
+ "epoch": 0.18585858585858586,
+ "grad_norm": 2.1230807304382324,
+ "learning_rate": 4.816161616161617e-06,
+ "loss": 1.541062593460083,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 1507328.0,
+ "step": 92
+ },
+ {
+ "entropy": 1.5469954013824463,
+ "epoch": 0.18787878787878787,
+ "grad_norm": 2.0568583011627197,
+ "learning_rate": 4.8141414141414146e-06,
+ "loss": 1.5564078092575073,
+ "mean_token_accuracy": 0.6384953856468201,
+ "num_tokens": 1523712.0,
+ "step": 93
+ },
+ {
+ "entropy": 1.5429692268371582,
+ "epoch": 0.1898989898989899,
+ "grad_norm": 2.200144052505493,
+ "learning_rate": 4.8121212121212125e-06,
+ "loss": 1.5292989015579224,
+ "mean_token_accuracy": 0.6373351216316223,
+ "num_tokens": 1540096.0,
+ "step": 94
+ },
+ {
+ "entropy": 1.4556076526641846,
+ "epoch": 0.1919191919191919,
+ "grad_norm": 2.250291585922241,
+ "learning_rate": 4.81010101010101e-06,
+ "loss": 1.426419734954834,
+ "mean_token_accuracy": 0.6604176759719849,
+ "num_tokens": 1556480.0,
+ "step": 95
+ },
+ {
+ "entropy": 1.4021440744400024,
+ "epoch": 0.19393939393939394,
+ "grad_norm": 2.287038803100586,
+ "learning_rate": 4.808080808080808e-06,
+ "loss": 1.4377000331878662,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 1572864.0,
+ "step": 96
+ },
+ {
+ "entropy": 1.658683180809021,
+ "epoch": 0.19595959595959597,
+ "grad_norm": 2.1817963123321533,
+ "learning_rate": 4.806060606060606e-06,
+ "loss": 1.6514620780944824,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 1589248.0,
+ "step": 97
+ },
+ {
+ "entropy": 1.5182844400405884,
+ "epoch": 0.19797979797979798,
+ "grad_norm": 2.144071340560913,
+ "learning_rate": 4.804040404040404e-06,
+ "loss": 1.5554628372192383,
+ "mean_token_accuracy": 0.6311064958572388,
+ "num_tokens": 1605632.0,
+ "step": 98
+ },
+ {
+ "entropy": 1.5997719764709473,
+ "epoch": 0.2,
+ "grad_norm": 2.0921664237976074,
+ "learning_rate": 4.802020202020202e-06,
+ "loss": 1.6185517311096191,
+ "mean_token_accuracy": 0.6286028623580933,
+ "num_tokens": 1622016.0,
+ "step": 99
+ },
+ {
+ "entropy": 1.4011279344558716,
+ "epoch": 0.20202020202020202,
+ "grad_norm": 2.2240700721740723,
+ "learning_rate": 4.800000000000001e-06,
+ "loss": 1.4112927913665771,
+ "mean_token_accuracy": 0.6696995496749878,
+ "num_tokens": 1638400.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.20202020202020202,
+ "eval_entropy": 1.606662715634992,
+ "eval_loss": 1.6283859014511108,
+ "eval_mean_token_accuracy": 0.6293055717983553,
+ "eval_num_tokens": 1638400.0,
+ "eval_runtime": 43.7782,
+ "eval_samples_per_second": 22.614,
+ "eval_steps_per_second": 2.832,
+ "step": 100
+ },
+ {
+ "entropy": 1.6743865013122559,
+ "epoch": 0.20404040404040405,
+ "grad_norm": 2.025153398513794,
+ "learning_rate": 4.7979797979797985e-06,
+ "loss": 1.6404725313186646,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 1654784.0,
+ "step": 101
+ },
+ {
+ "entropy": 1.6196308135986328,
+ "epoch": 0.20606060606060606,
+ "grad_norm": 2.037229299545288,
+ "learning_rate": 4.795959595959596e-06,
+ "loss": 1.647303581237793,
+ "mean_token_accuracy": 0.6203590631484985,
+ "num_tokens": 1671168.0,
+ "step": 102
+ },
+ {
+ "entropy": 1.5600125789642334,
+ "epoch": 0.2080808080808081,
+ "grad_norm": 2.144221782684326,
+ "learning_rate": 4.793939393939394e-06,
+ "loss": 1.6199731826782227,
+ "mean_token_accuracy": 0.6249389052391052,
+ "num_tokens": 1687552.0,
+ "step": 103
+ },
+ {
+ "entropy": 2.064497947692871,
+ "epoch": 0.2101010101010101,
+ "grad_norm": 2.3956470489501953,
+ "learning_rate": 4.791919191919192e-06,
+ "loss": 2.048987627029419,
+ "mean_token_accuracy": 0.5507450103759766,
+ "num_tokens": 1703936.0,
+ "step": 104
+ },
+ {
+ "entropy": 1.7934812307357788,
+ "epoch": 0.21212121212121213,
+ "grad_norm": 2.487302780151367,
+ "learning_rate": 4.78989898989899e-06,
+ "loss": 1.8285956382751465,
+ "mean_token_accuracy": 0.5749877691268921,
+ "num_tokens": 1720320.0,
+ "step": 105
+ },
+ {
+ "entropy": 1.365216851234436,
+ "epoch": 0.21414141414141413,
+ "grad_norm": 2.0714964866638184,
+ "learning_rate": 4.787878787878788e-06,
+ "loss": 1.3870220184326172,
+ "mean_token_accuracy": 0.6692721247673035,
+ "num_tokens": 1736704.0,
+ "step": 106
+ },
+ {
+ "entropy": 1.4983874559402466,
+ "epoch": 0.21616161616161617,
+ "grad_norm": 1.9995853900909424,
+ "learning_rate": 4.785858585858586e-06,
+ "loss": 1.4949266910552979,
+ "mean_token_accuracy": 0.6554103493690491,
+ "num_tokens": 1753088.0,
+ "step": 107
+ },
+ {
+ "entropy": 2.0503509044647217,
+ "epoch": 0.21818181818181817,
+ "grad_norm": 2.190884590148926,
+ "learning_rate": 4.783838383838385e-06,
+ "loss": 2.079286813735962,
+ "mean_token_accuracy": 0.5657669901847839,
+ "num_tokens": 1769472.0,
+ "step": 108
+ },
+ {
+ "entropy": 1.5557374954223633,
+ "epoch": 0.2202020202020202,
+ "grad_norm": 2.044100761413574,
+ "learning_rate": 4.7818181818181825e-06,
+ "loss": 1.5735318660736084,
+ "mean_token_accuracy": 0.6359916925430298,
+ "num_tokens": 1785856.0,
+ "step": 109
+ },
+ {
+ "entropy": 1.5567635297775269,
+ "epoch": 0.2222222222222222,
+ "grad_norm": 2.3714160919189453,
+ "learning_rate": 4.77979797979798e-06,
+ "loss": 1.6026921272277832,
+ "mean_token_accuracy": 0.6290302872657776,
+ "num_tokens": 1802240.0,
+ "step": 110
+ },
+ {
+ "entropy": 1.8457536697387695,
+ "epoch": 0.22424242424242424,
+ "grad_norm": 2.202939987182617,
+ "learning_rate": 4.777777777777778e-06,
+ "loss": 1.7986081838607788,
+ "mean_token_accuracy": 0.5952613353729248,
+ "num_tokens": 1818624.0,
+ "step": 111
+ },
+ {
+ "entropy": 1.8822020292282104,
+ "epoch": 0.22626262626262628,
+ "grad_norm": 2.2674992084503174,
+ "learning_rate": 4.775757575757576e-06,
+ "loss": 1.9095954895019531,
+ "mean_token_accuracy": 0.5769418478012085,
+ "num_tokens": 1835008.0,
+ "step": 112
+ },
+ {
+ "entropy": 1.5445998907089233,
+ "epoch": 0.22828282828282828,
+ "grad_norm": 2.2848100662231445,
+ "learning_rate": 4.773737373737374e-06,
+ "loss": 1.5832195281982422,
+ "mean_token_accuracy": 0.6337933540344238,
+ "num_tokens": 1851392.0,
+ "step": 113
+ },
+ {
+ "entropy": 1.934509515762329,
+ "epoch": 0.23030303030303031,
+ "grad_norm": 2.3585174083709717,
+ "learning_rate": 4.771717171717172e-06,
+ "loss": 1.9809319972991943,
+ "mean_token_accuracy": 0.5789570212364197,
+ "num_tokens": 1867776.0,
+ "step": 114
+ },
+ {
+ "entropy": 1.7354214191436768,
+ "epoch": 0.23232323232323232,
+ "grad_norm": 2.13913631439209,
+ "learning_rate": 4.769696969696971e-06,
+ "loss": 1.7527806758880615,
+ "mean_token_accuracy": 0.6061308979988098,
+ "num_tokens": 1884160.0,
+ "step": 115
+ },
+ {
+ "entropy": 1.7714784145355225,
+ "epoch": 0.23434343434343435,
+ "grad_norm": 1.9915403127670288,
+ "learning_rate": 4.7676767676767685e-06,
+ "loss": 1.8065431118011475,
+ "mean_token_accuracy": 0.5986199378967285,
+ "num_tokens": 1900544.0,
+ "step": 116
+ },
+ {
+ "entropy": 1.5272125005722046,
+ "epoch": 0.23636363636363636,
+ "grad_norm": 2.004565715789795,
+ "learning_rate": 4.765656565656566e-06,
+ "loss": 1.5074517726898193,
+ "mean_token_accuracy": 0.6601123809814453,
+ "num_tokens": 1916928.0,
+ "step": 117
+ },
+ {
+ "entropy": 1.5393218994140625,
+ "epoch": 0.2383838383838384,
+ "grad_norm": 2.018089532852173,
+ "learning_rate": 4.763636363636364e-06,
+ "loss": 1.5607573986053467,
+ "mean_token_accuracy": 0.6540058851242065,
+ "num_tokens": 1933312.0,
+ "step": 118
+ },
+ {
+ "entropy": 1.7827534675598145,
+ "epoch": 0.2404040404040404,
+ "grad_norm": 2.062368392944336,
+ "learning_rate": 4.761616161616162e-06,
+ "loss": 1.7844001054763794,
+ "mean_token_accuracy": 0.6187102794647217,
+ "num_tokens": 1949696.0,
+ "step": 119
+ },
+ {
+ "entropy": 1.416417121887207,
+ "epoch": 0.24242424242424243,
+ "grad_norm": 2.0980024337768555,
+ "learning_rate": 4.75959595959596e-06,
+ "loss": 1.4041050672531128,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 1966080.0,
+ "step": 120
+ },
+ {
+ "entropy": 1.3325153589248657,
+ "epoch": 0.24444444444444444,
+ "grad_norm": 1.9985002279281616,
+ "learning_rate": 4.757575757575758e-06,
+ "loss": 1.3197274208068848,
+ "mean_token_accuracy": 0.6806912422180176,
+ "num_tokens": 1982464.0,
+ "step": 121
+ },
+ {
+ "entropy": 1.7306798696517944,
+ "epoch": 0.24646464646464647,
+ "grad_norm": 2.2098441123962402,
+ "learning_rate": 4.755555555555556e-06,
+ "loss": 1.7595295906066895,
+ "mean_token_accuracy": 0.6110160946846008,
+ "num_tokens": 1998848.0,
+ "step": 122
+ },
+ {
+ "entropy": 1.3733264207839966,
+ "epoch": 0.24848484848484848,
+ "grad_norm": 1.9827327728271484,
+ "learning_rate": 4.753535353535354e-06,
+ "loss": 1.4026854038238525,
+ "mean_token_accuracy": 0.65486079454422,
+ "num_tokens": 2015232.0,
+ "step": 123
+ },
+ {
+ "entropy": 1.5910528898239136,
+ "epoch": 0.2505050505050505,
+ "grad_norm": 1.9615319967269897,
+ "learning_rate": 4.751515151515152e-06,
+ "loss": 1.6071114540100098,
+ "mean_token_accuracy": 0.648937463760376,
+ "num_tokens": 2031616.0,
+ "step": 124
+ },
+ {
+ "entropy": 1.3300938606262207,
+ "epoch": 0.25252525252525254,
+ "grad_norm": 1.9878504276275635,
+ "learning_rate": 4.7494949494949495e-06,
+ "loss": 1.3623383045196533,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 2048000.0,
+ "step": 125
+ },
+ {
+ "entropy": 1.6087368726730347,
+ "epoch": 0.2545454545454545,
+ "grad_norm": 2.264647960662842,
+ "learning_rate": 4.747474747474748e-06,
+ "loss": 1.634058952331543,
+ "mean_token_accuracy": 0.6211528778076172,
+ "num_tokens": 2064384.0,
+ "step": 126
+ },
+ {
+ "entropy": 1.536401391029358,
+ "epoch": 0.25656565656565655,
+ "grad_norm": 1.9561539888381958,
+ "learning_rate": 4.745454545454546e-06,
+ "loss": 1.5699501037597656,
+ "mean_token_accuracy": 0.6248167753219604,
+ "num_tokens": 2080768.0,
+ "step": 127
+ },
+ {
+ "entropy": 1.656266212463379,
+ "epoch": 0.2585858585858586,
+ "grad_norm": 2.1124353408813477,
+ "learning_rate": 4.743434343434344e-06,
+ "loss": 1.6612167358398438,
+ "mean_token_accuracy": 0.623900830745697,
+ "num_tokens": 2097152.0,
+ "step": 128
+ },
+ {
+ "entropy": 1.170629620552063,
+ "epoch": 0.2606060606060606,
+ "grad_norm": 1.917840600013733,
+ "learning_rate": 4.741414141414142e-06,
+ "loss": 1.1992300748825073,
+ "mean_token_accuracy": 0.6995603442192078,
+ "num_tokens": 2113536.0,
+ "step": 129
+ },
+ {
+ "entropy": 1.4126694202423096,
+ "epoch": 0.26262626262626265,
+ "grad_norm": 1.9041539430618286,
+ "learning_rate": 4.73939393939394e-06,
+ "loss": 1.4334447383880615,
+ "mean_token_accuracy": 0.6637151837348938,
+ "num_tokens": 2129920.0,
+ "step": 130
+ },
+ {
+ "entropy": 1.8490277528762817,
+ "epoch": 0.26464646464646463,
+ "grad_norm": 2.1440138816833496,
+ "learning_rate": 4.737373737373738e-06,
+ "loss": 1.9226353168487549,
+ "mean_token_accuracy": 0.5805447101593018,
+ "num_tokens": 2146304.0,
+ "step": 131
+ },
+ {
+ "entropy": 1.5000964403152466,
+ "epoch": 0.26666666666666666,
+ "grad_norm": 1.9615508317947388,
+ "learning_rate": 4.735353535353536e-06,
+ "loss": 1.495596170425415,
+ "mean_token_accuracy": 0.6542501449584961,
+ "num_tokens": 2162688.0,
+ "step": 132
+ },
+ {
+ "entropy": 1.9371142387390137,
+ "epoch": 0.2686868686868687,
+ "grad_norm": 2.202200412750244,
+ "learning_rate": 4.7333333333333335e-06,
+ "loss": 1.94151771068573,
+ "mean_token_accuracy": 0.5810332298278809,
+ "num_tokens": 2179072.0,
+ "step": 133
+ },
+ {
+ "entropy": 1.4535126686096191,
+ "epoch": 0.27070707070707073,
+ "grad_norm": 1.9804027080535889,
+ "learning_rate": 4.731313131313131e-06,
+ "loss": 1.4401545524597168,
+ "mean_token_accuracy": 0.6585246920585632,
+ "num_tokens": 2195456.0,
+ "step": 134
+ },
+ {
+ "entropy": 2.0871424674987793,
+ "epoch": 0.2727272727272727,
+ "grad_norm": 2.1417081356048584,
+ "learning_rate": 4.729292929292929e-06,
+ "loss": 2.117375373840332,
+ "mean_token_accuracy": 0.5600268840789795,
+ "num_tokens": 2211840.0,
+ "step": 135
+ },
+ {
+ "entropy": 1.2986469268798828,
+ "epoch": 0.27474747474747474,
+ "grad_norm": 2.0299136638641357,
+ "learning_rate": 4.727272727272728e-06,
+ "loss": 1.3631991147994995,
+ "mean_token_accuracy": 0.6750732660293579,
+ "num_tokens": 2228224.0,
+ "step": 136
+ },
+ {
+ "entropy": 1.163429617881775,
+ "epoch": 0.2767676767676768,
+ "grad_norm": 1.8368210792541504,
+ "learning_rate": 4.725252525252526e-06,
+ "loss": 1.1603795289993286,
+ "mean_token_accuracy": 0.7150708436965942,
+ "num_tokens": 2244608.0,
+ "step": 137
+ },
+ {
+ "entropy": 1.4301519393920898,
+ "epoch": 0.2787878787878788,
+ "grad_norm": 1.996767520904541,
+ "learning_rate": 4.723232323232324e-06,
+ "loss": 1.422170639038086,
+ "mean_token_accuracy": 0.6816682815551758,
+ "num_tokens": 2260992.0,
+ "step": 138
+ },
+ {
+ "entropy": 1.5160106420516968,
+ "epoch": 0.2808080808080808,
+ "grad_norm": 2.004770278930664,
+ "learning_rate": 4.721212121212122e-06,
+ "loss": 1.5385751724243164,
+ "mean_token_accuracy": 0.640693724155426,
+ "num_tokens": 2277376.0,
+ "step": 139
+ },
+ {
+ "entropy": 1.2483867406845093,
+ "epoch": 0.2828282828282828,
+ "grad_norm": 1.8488364219665527,
+ "learning_rate": 4.7191919191919195e-06,
+ "loss": 1.2563843727111816,
+ "mean_token_accuracy": 0.6998046040534973,
+ "num_tokens": 2293760.0,
+ "step": 140
+ },
+ {
+ "entropy": 1.3214129209518433,
+ "epoch": 0.28484848484848485,
+ "grad_norm": 2.1334660053253174,
+ "learning_rate": 4.717171717171717e-06,
+ "loss": 1.3392664194107056,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 2310144.0,
+ "step": 141
+ },
+ {
+ "entropy": 1.611849069595337,
+ "epoch": 0.2868686868686869,
+ "grad_norm": 2.0539803504943848,
+ "learning_rate": 4.715151515151515e-06,
+ "loss": 1.6335396766662598,
+ "mean_token_accuracy": 0.6235954761505127,
+ "num_tokens": 2326528.0,
+ "step": 142
+ },
+ {
+ "entropy": 1.5847896337509155,
+ "epoch": 0.28888888888888886,
+ "grad_norm": 2.1658759117126465,
+ "learning_rate": 4.713131313131313e-06,
+ "loss": 1.603764533996582,
+ "mean_token_accuracy": 0.633671224117279,
+ "num_tokens": 2342912.0,
+ "step": 143
+ },
+ {
+ "entropy": 1.5731406211853027,
+ "epoch": 0.2909090909090909,
+ "grad_norm": 2.0830390453338623,
+ "learning_rate": 4.711111111111111e-06,
+ "loss": 1.558933973312378,
+ "mean_token_accuracy": 0.6392892003059387,
+ "num_tokens": 2359296.0,
+ "step": 144
+ },
+ {
+ "entropy": 1.8901628255844116,
+ "epoch": 0.29292929292929293,
+ "grad_norm": 2.1436922550201416,
+ "learning_rate": 4.709090909090909e-06,
+ "loss": 1.878631353378296,
+ "mean_token_accuracy": 0.57333904504776,
+ "num_tokens": 2375680.0,
+ "step": 145
+ },
+ {
+ "entropy": 1.9344228506088257,
+ "epoch": 0.29494949494949496,
+ "grad_norm": 2.1245176792144775,
+ "learning_rate": 4.707070707070707e-06,
+ "loss": 1.9546704292297363,
+ "mean_token_accuracy": 0.5987420678138733,
+ "num_tokens": 2392064.0,
+ "step": 146
+ },
+ {
+ "entropy": 1.2455096244812012,
+ "epoch": 0.296969696969697,
+ "grad_norm": 1.896581768989563,
+ "learning_rate": 4.705050505050506e-06,
+ "loss": 1.2738728523254395,
+ "mean_token_accuracy": 0.7025524973869324,
+ "num_tokens": 2408448.0,
+ "step": 147
+ },
+ {
+ "entropy": 1.4235948324203491,
+ "epoch": 0.298989898989899,
+ "grad_norm": 2.522636890411377,
+ "learning_rate": 4.7030303030303035e-06,
+ "loss": 1.4524480104446411,
+ "mean_token_accuracy": 0.6441133618354797,
+ "num_tokens": 2424832.0,
+ "step": 148
+ },
+ {
+ "entropy": 1.764552116394043,
+ "epoch": 0.301010101010101,
+ "grad_norm": 2.0232255458831787,
+ "learning_rate": 4.701010101010101e-06,
+ "loss": 1.7811740636825562,
+ "mean_token_accuracy": 0.6229848265647888,
+ "num_tokens": 2441216.0,
+ "step": 149
+ },
+ {
+ "entropy": 1.74843168258667,
+ "epoch": 0.30303030303030304,
+ "grad_norm": 2.1589369773864746,
+ "learning_rate": 4.698989898989899e-06,
+ "loss": 1.7337679862976074,
+ "mean_token_accuracy": 0.5975207686424255,
+ "num_tokens": 2457600.0,
+ "step": 150
+ },
+ {
+ "epoch": 0.30303030303030304,
+ "eval_entropy": 1.6033287221385586,
+ "eval_loss": 1.6036633253097534,
+ "eval_mean_token_accuracy": 0.6329842450157288,
+ "eval_num_tokens": 2457600.0,
+ "eval_runtime": 43.7655,
+ "eval_samples_per_second": 22.621,
+ "eval_steps_per_second": 2.833,
+ "step": 150
+ },
+ {
+ "entropy": 2.0572290420532227,
+ "epoch": 0.30505050505050507,
+ "grad_norm": 2.0511579513549805,
+ "learning_rate": 4.696969696969698e-06,
+ "loss": 2.0196030139923096,
+ "mean_token_accuracy": 0.5519052147865295,
+ "num_tokens": 2473984.0,
+ "step": 151
+ },
+ {
+ "entropy": 1.5792397260665894,
+ "epoch": 0.30707070707070705,
+ "grad_norm": 2.048396587371826,
+ "learning_rate": 4.694949494949496e-06,
+ "loss": 1.575985074043274,
+ "mean_token_accuracy": 0.623961865901947,
+ "num_tokens": 2490368.0,
+ "step": 152
+ },
+ {
+ "entropy": 1.487528681755066,
+ "epoch": 0.3090909090909091,
+ "grad_norm": 2.1903791427612305,
+ "learning_rate": 4.692929292929294e-06,
+ "loss": 1.479973316192627,
+ "mean_token_accuracy": 0.6595017313957214,
+ "num_tokens": 2506752.0,
+ "step": 153
+ },
+ {
+ "entropy": 1.766797423362732,
+ "epoch": 0.3111111111111111,
+ "grad_norm": 2.1843011379241943,
+ "learning_rate": 4.690909090909092e-06,
+ "loss": 1.7993412017822266,
+ "mean_token_accuracy": 0.5965437293052673,
+ "num_tokens": 2523136.0,
+ "step": 154
+ },
+ {
+ "entropy": 1.7058254480361938,
+ "epoch": 0.31313131313131315,
+ "grad_norm": 2.204461097717285,
+ "learning_rate": 4.6888888888888895e-06,
+ "loss": 1.7346007823944092,
+ "mean_token_accuracy": 0.6077185869216919,
+ "num_tokens": 2539520.0,
+ "step": 155
+ },
+ {
+ "entropy": 1.4929591417312622,
+ "epoch": 0.3151515151515151,
+ "grad_norm": 2.1739237308502197,
+ "learning_rate": 4.6868686868686874e-06,
+ "loss": 1.4708621501922607,
+ "mean_token_accuracy": 0.6427088379859924,
+ "num_tokens": 2555904.0,
+ "step": 156
+ },
+ {
+ "entropy": 1.5797587633132935,
+ "epoch": 0.31717171717171716,
+ "grad_norm": 2.150561571121216,
+ "learning_rate": 4.684848484848485e-06,
+ "loss": 1.5921857357025146,
+ "mean_token_accuracy": 0.6262823939323425,
+ "num_tokens": 2572288.0,
+ "step": 157
+ },
+ {
+ "entropy": 1.6198230981826782,
+ "epoch": 0.3191919191919192,
+ "grad_norm": 2.061169385910034,
+ "learning_rate": 4.682828282828283e-06,
+ "loss": 1.6601009368896484,
+ "mean_token_accuracy": 0.619015634059906,
+ "num_tokens": 2588672.0,
+ "step": 158
+ },
+ {
+ "entropy": 1.4026126861572266,
+ "epoch": 0.3212121212121212,
+ "grad_norm": 2.066208839416504,
+ "learning_rate": 4.680808080808081e-06,
+ "loss": 1.4062483310699463,
+ "mean_token_accuracy": 0.6681729555130005,
+ "num_tokens": 2605056.0,
+ "step": 159
+ },
+ {
+ "entropy": 1.4608066082000732,
+ "epoch": 0.32323232323232326,
+ "grad_norm": 2.022627353668213,
+ "learning_rate": 4.678787878787879e-06,
+ "loss": 1.4644970893859863,
+ "mean_token_accuracy": 0.6533341407775879,
+ "num_tokens": 2621440.0,
+ "step": 160
+ },
+ {
+ "entropy": 1.222448468208313,
+ "epoch": 0.32525252525252524,
+ "grad_norm": 2.0399329662323,
+ "learning_rate": 4.676767676767677e-06,
+ "loss": 1.2547852993011475,
+ "mean_token_accuracy": 0.6925378441810608,
+ "num_tokens": 2637824.0,
+ "step": 161
+ },
+ {
+ "entropy": 1.8702255487442017,
+ "epoch": 0.32727272727272727,
+ "grad_norm": 2.177307367324829,
+ "learning_rate": 4.674747474747476e-06,
+ "loss": 1.9041712284088135,
+ "mean_token_accuracy": 0.5754152536392212,
+ "num_tokens": 2654208.0,
+ "step": 162
+ },
+ {
+ "entropy": 1.6861947774887085,
+ "epoch": 0.3292929292929293,
+ "grad_norm": 2.009544610977173,
+ "learning_rate": 4.6727272727272735e-06,
+ "loss": 1.7079355716705322,
+ "mean_token_accuracy": 0.615290641784668,
+ "num_tokens": 2670592.0,
+ "step": 163
+ },
+ {
+ "entropy": 1.3880327939987183,
+ "epoch": 0.33131313131313134,
+ "grad_norm": 2.16359543800354,
+ "learning_rate": 4.670707070707071e-06,
+ "loss": 1.4220571517944336,
+ "mean_token_accuracy": 0.6604787707328796,
+ "num_tokens": 2686976.0,
+ "step": 164
+ },
+ {
+ "entropy": 1.5760643482208252,
+ "epoch": 0.3333333333333333,
+ "grad_norm": 2.09773325920105,
+ "learning_rate": 4.668686868686869e-06,
+ "loss": 1.6036784648895264,
+ "mean_token_accuracy": 0.6267098188400269,
+ "num_tokens": 2703360.0,
+ "step": 165
+ },
+ {
+ "entropy": 1.078303575515747,
+ "epoch": 0.33535353535353535,
+ "grad_norm": 1.7760599851608276,
+ "learning_rate": 4.666666666666667e-06,
+ "loss": 1.0612695217132568,
+ "mean_token_accuracy": 0.7349169254302979,
+ "num_tokens": 2719744.0,
+ "step": 166
+ },
+ {
+ "entropy": 1.3722130060195923,
+ "epoch": 0.3373737373737374,
+ "grad_norm": 2.0816409587860107,
+ "learning_rate": 4.664646464646465e-06,
+ "loss": 1.3693504333496094,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 2736128.0,
+ "step": 167
+ },
+ {
+ "entropy": 1.8752760887145996,
+ "epoch": 0.3393939393939394,
+ "grad_norm": 2.1670358180999756,
+ "learning_rate": 4.662626262626263e-06,
+ "loss": 1.8874578475952148,
+ "mean_token_accuracy": 0.5881778001785278,
+ "num_tokens": 2752512.0,
+ "step": 168
+ },
+ {
+ "entropy": 1.7384581565856934,
+ "epoch": 0.3414141414141414,
+ "grad_norm": 2.0072429180145264,
+ "learning_rate": 4.660606060606061e-06,
+ "loss": 1.7491583824157715,
+ "mean_token_accuracy": 0.6041157841682434,
+ "num_tokens": 2768896.0,
+ "step": 169
+ },
+ {
+ "entropy": 1.6651691198349,
+ "epoch": 0.3434343434343434,
+ "grad_norm": 2.0812578201293945,
+ "learning_rate": 4.658585858585859e-06,
+ "loss": 1.6808438301086426,
+ "mean_token_accuracy": 0.6273204684257507,
+ "num_tokens": 2785280.0,
+ "step": 170
+ },
+ {
+ "entropy": 1.3426616191864014,
+ "epoch": 0.34545454545454546,
+ "grad_norm": 1.9108822345733643,
+ "learning_rate": 4.656565656565657e-06,
+ "loss": 1.3404264450073242,
+ "mean_token_accuracy": 0.6703101992607117,
+ "num_tokens": 2801664.0,
+ "step": 171
+ },
+ {
+ "entropy": 1.631722092628479,
+ "epoch": 0.3474747474747475,
+ "grad_norm": 2.07317852973938,
+ "learning_rate": 4.654545454545455e-06,
+ "loss": 1.6545813083648682,
+ "mean_token_accuracy": 0.6143136024475098,
+ "num_tokens": 2818048.0,
+ "step": 172
+ },
+ {
+ "entropy": 1.3678289651870728,
+ "epoch": 0.34949494949494947,
+ "grad_norm": 1.8517454862594604,
+ "learning_rate": 4.652525252525253e-06,
+ "loss": 1.3759769201278687,
+ "mean_token_accuracy": 0.6693942546844482,
+ "num_tokens": 2834432.0,
+ "step": 173
+ },
+ {
+ "entropy": 1.3927773237228394,
+ "epoch": 0.3515151515151515,
+ "grad_norm": 2.1304867267608643,
+ "learning_rate": 4.650505050505051e-06,
+ "loss": 1.4104211330413818,
+ "mean_token_accuracy": 0.6612725853919983,
+ "num_tokens": 2850816.0,
+ "step": 174
+ },
+ {
+ "entropy": 1.3352863788604736,
+ "epoch": 0.35353535353535354,
+ "grad_norm": 2.2788777351379395,
+ "learning_rate": 4.648484848484849e-06,
+ "loss": 1.3665719032287598,
+ "mean_token_accuracy": 0.6640205383300781,
+ "num_tokens": 2867200.0,
+ "step": 175
+ },
+ {
+ "entropy": 1.6800754070281982,
+ "epoch": 0.35555555555555557,
+ "grad_norm": 2.030787944793701,
+ "learning_rate": 4.646464646464647e-06,
+ "loss": 1.7239181995391846,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 2883584.0,
+ "step": 176
+ },
+ {
+ "entropy": 1.2852731943130493,
+ "epoch": 0.3575757575757576,
+ "grad_norm": 1.9148248434066772,
+ "learning_rate": 4.644444444444445e-06,
+ "loss": 1.2934880256652832,
+ "mean_token_accuracy": 0.6798363327980042,
+ "num_tokens": 2899968.0,
+ "step": 177
+ },
+ {
+ "entropy": 1.6366593837738037,
+ "epoch": 0.3595959595959596,
+ "grad_norm": 2.2264015674591064,
+ "learning_rate": 4.642424242424243e-06,
+ "loss": 1.632002592086792,
+ "mean_token_accuracy": 0.6180385947227478,
+ "num_tokens": 2916352.0,
+ "step": 178
+ },
+ {
+ "entropy": 1.3935565948486328,
+ "epoch": 0.3616161616161616,
+ "grad_norm": 2.0410475730895996,
+ "learning_rate": 4.6404040404040406e-06,
+ "loss": 1.407370686531067,
+ "mean_token_accuracy": 0.6722032427787781,
+ "num_tokens": 2932736.0,
+ "step": 179
+ },
+ {
+ "entropy": 1.0952510833740234,
+ "epoch": 0.36363636363636365,
+ "grad_norm": 1.937270164489746,
+ "learning_rate": 4.6383838383838384e-06,
+ "loss": 1.1101973056793213,
+ "mean_token_accuracy": 0.730947732925415,
+ "num_tokens": 2949120.0,
+ "step": 180
+ },
+ {
+ "entropy": 1.184926152229309,
+ "epoch": 0.3656565656565657,
+ "grad_norm": 1.9867528676986694,
+ "learning_rate": 4.636363636363636e-06,
+ "loss": 1.1932196617126465,
+ "mean_token_accuracy": 0.7085368633270264,
+ "num_tokens": 2965504.0,
+ "step": 181
+ },
+ {
+ "entropy": 1.4552072286605835,
+ "epoch": 0.36767676767676766,
+ "grad_norm": 1.9395766258239746,
+ "learning_rate": 4.634343434343434e-06,
+ "loss": 1.4559956789016724,
+ "mean_token_accuracy": 0.6534562706947327,
+ "num_tokens": 2981888.0,
+ "step": 182
+ },
+ {
+ "entropy": 1.6437443494796753,
+ "epoch": 0.3696969696969697,
+ "grad_norm": 2.1257567405700684,
+ "learning_rate": 4.632323232323233e-06,
+ "loss": 1.6260980367660522,
+ "mean_token_accuracy": 0.625,
+ "num_tokens": 2998272.0,
+ "step": 183
+ },
+ {
+ "entropy": 1.8264633417129517,
+ "epoch": 0.3717171717171717,
+ "grad_norm": 2.187041759490967,
+ "learning_rate": 4.630303030303031e-06,
+ "loss": 1.8431676626205444,
+ "mean_token_accuracy": 0.60332190990448,
+ "num_tokens": 3014656.0,
+ "step": 184
+ },
+ {
+ "entropy": 1.1121351718902588,
+ "epoch": 0.37373737373737376,
+ "grad_norm": 1.8460402488708496,
+ "learning_rate": 4.628282828282829e-06,
+ "loss": 1.1054425239562988,
+ "mean_token_accuracy": 0.7254518866539001,
+ "num_tokens": 3031040.0,
+ "step": 185
+ },
+ {
+ "entropy": 1.3531955480575562,
+ "epoch": 0.37575757575757573,
+ "grad_norm": 2.3463470935821533,
+ "learning_rate": 4.626262626262627e-06,
+ "loss": 1.359381914138794,
+ "mean_token_accuracy": 0.6610894203186035,
+ "num_tokens": 3047424.0,
+ "step": 186
+ },
+ {
+ "entropy": 1.2131577730178833,
+ "epoch": 0.37777777777777777,
+ "grad_norm": 1.9595171213150024,
+ "learning_rate": 4.6242424242424245e-06,
+ "loss": 1.2312005758285522,
+ "mean_token_accuracy": 0.6979115605354309,
+ "num_tokens": 3063808.0,
+ "step": 187
+ },
+ {
+ "entropy": 1.5441125631332397,
+ "epoch": 0.3797979797979798,
+ "grad_norm": 2.2971343994140625,
+ "learning_rate": 4.622222222222222e-06,
+ "loss": 1.5923339128494263,
+ "mean_token_accuracy": 0.6297020316123962,
+ "num_tokens": 3080192.0,
+ "step": 188
+ },
+ {
+ "entropy": 1.7998323440551758,
+ "epoch": 0.38181818181818183,
+ "grad_norm": 2.010552167892456,
+ "learning_rate": 4.62020202020202e-06,
+ "loss": 1.8257204294204712,
+ "mean_token_accuracy": 0.5997191071510315,
+ "num_tokens": 3096576.0,
+ "step": 189
+ },
+ {
+ "entropy": 1.389051914215088,
+ "epoch": 0.3838383838383838,
+ "grad_norm": 2.1183855533599854,
+ "learning_rate": 4.618181818181818e-06,
+ "loss": 1.431575059890747,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 3112960.0,
+ "step": 190
+ },
+ {
+ "entropy": 2.0066142082214355,
+ "epoch": 0.38585858585858585,
+ "grad_norm": 2.061399221420288,
+ "learning_rate": 4.616161616161616e-06,
+ "loss": 2.0477406978607178,
+ "mean_token_accuracy": 0.5454934239387512,
+ "num_tokens": 3129344.0,
+ "step": 191
+ },
+ {
+ "entropy": 1.3063198328018188,
+ "epoch": 0.3878787878787879,
+ "grad_norm": 1.9490301609039307,
+ "learning_rate": 4.614141414141414e-06,
+ "loss": 1.3293564319610596,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 3145728.0,
+ "step": 192
+ },
+ {
+ "entropy": 1.3636538982391357,
+ "epoch": 0.3898989898989899,
+ "grad_norm": 2.025458574295044,
+ "learning_rate": 4.612121212121212e-06,
+ "loss": 1.3736209869384766,
+ "mean_token_accuracy": 0.679286777973175,
+ "num_tokens": 3162112.0,
+ "step": 193
+ },
+ {
+ "entropy": 1.5669925212860107,
+ "epoch": 0.39191919191919194,
+ "grad_norm": 2.064033269882202,
+ "learning_rate": 4.6101010101010106e-06,
+ "loss": 1.5587083101272583,
+ "mean_token_accuracy": 0.6267709136009216,
+ "num_tokens": 3178496.0,
+ "step": 194
+ },
+ {
+ "entropy": 1.4489716291427612,
+ "epoch": 0.3939393939393939,
+ "grad_norm": 2.0174880027770996,
+ "learning_rate": 4.6080808080808085e-06,
+ "loss": 1.4331417083740234,
+ "mean_token_accuracy": 0.6571812629699707,
+ "num_tokens": 3194880.0,
+ "step": 195
+ },
+ {
+ "entropy": 2.026416778564453,
+ "epoch": 0.39595959595959596,
+ "grad_norm": 2.1820878982543945,
+ "learning_rate": 4.606060606060606e-06,
+ "loss": 2.029003143310547,
+ "mean_token_accuracy": 0.563568651676178,
+ "num_tokens": 3211264.0,
+ "step": 196
+ },
+ {
+ "entropy": 2.1844022274017334,
+ "epoch": 0.397979797979798,
+ "grad_norm": 2.175349473953247,
+ "learning_rate": 4.604040404040404e-06,
+ "loss": 2.2053825855255127,
+ "mean_token_accuracy": 0.5553248524665833,
+ "num_tokens": 3227648.0,
+ "step": 197
+ },
+ {
+ "entropy": 1.6750906705856323,
+ "epoch": 0.4,
+ "grad_norm": 1.8300689458847046,
+ "learning_rate": 4.602020202020203e-06,
+ "loss": 1.692289113998413,
+ "mean_token_accuracy": 0.6345261335372925,
+ "num_tokens": 3244032.0,
+ "step": 198
+ },
+ {
+ "entropy": 1.6192772388458252,
+ "epoch": 0.402020202020202,
+ "grad_norm": 1.9788341522216797,
+ "learning_rate": 4.600000000000001e-06,
+ "loss": 1.628842830657959,
+ "mean_token_accuracy": 0.615229606628418,
+ "num_tokens": 3260416.0,
+ "step": 199
+ },
+ {
+ "entropy": 1.444870948791504,
+ "epoch": 0.40404040404040403,
+ "grad_norm": 2.05141544342041,
+ "learning_rate": 4.597979797979799e-06,
+ "loss": 1.4365839958190918,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 3276800.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.40404040404040403,
+ "eval_entropy": 1.5766179907706477,
+ "eval_loss": 1.5878442525863647,
+ "eval_mean_token_accuracy": 0.6355829551335304,
+ "eval_num_tokens": 3276800.0,
+ "eval_runtime": 43.7272,
+ "eval_samples_per_second": 22.64,
+ "eval_steps_per_second": 2.836,
+ "step": 200
+ },
+ {
+ "entropy": 1.3354029655456543,
+ "epoch": 0.40606060606060607,
+ "grad_norm": 2.012895345687866,
+ "learning_rate": 4.595959595959597e-06,
+ "loss": 1.3289990425109863,
+ "mean_token_accuracy": 0.685271143913269,
+ "num_tokens": 3293184.0,
+ "step": 201
+ },
+ {
+ "entropy": 1.1990011930465698,
+ "epoch": 0.4080808080808081,
+ "grad_norm": 1.9462409019470215,
+ "learning_rate": 4.5939393939393945e-06,
+ "loss": 1.224869728088379,
+ "mean_token_accuracy": 0.6976673007011414,
+ "num_tokens": 3309568.0,
+ "step": 202
+ },
+ {
+ "entropy": 1.6442710161209106,
+ "epoch": 0.4101010101010101,
+ "grad_norm": 2.064532995223999,
+ "learning_rate": 4.591919191919192e-06,
+ "loss": 1.6800963878631592,
+ "mean_token_accuracy": 0.6111993193626404,
+ "num_tokens": 3325952.0,
+ "step": 203
+ },
+ {
+ "entropy": 1.8336306810379028,
+ "epoch": 0.4121212121212121,
+ "grad_norm": 2.478731393814087,
+ "learning_rate": 4.58989898989899e-06,
+ "loss": 1.8518702983856201,
+ "mean_token_accuracy": 0.6021006107330322,
+ "num_tokens": 3342336.0,
+ "step": 204
+ },
+ {
+ "entropy": 1.6767220497131348,
+ "epoch": 0.41414141414141414,
+ "grad_norm": 2.0676512718200684,
+ "learning_rate": 4.587878787878788e-06,
+ "loss": 1.674522042274475,
+ "mean_token_accuracy": 0.6178553700447083,
+ "num_tokens": 3358720.0,
+ "step": 205
+ },
+ {
+ "entropy": 1.7236497402191162,
+ "epoch": 0.4161616161616162,
+ "grad_norm": 2.057074785232544,
+ "learning_rate": 4.585858585858586e-06,
+ "loss": 1.725832462310791,
+ "mean_token_accuracy": 0.620114803314209,
+ "num_tokens": 3375104.0,
+ "step": 206
+ },
+ {
+ "entropy": 1.6493065357208252,
+ "epoch": 0.41818181818181815,
+ "grad_norm": 2.0946099758148193,
+ "learning_rate": 4.583838383838384e-06,
+ "loss": 1.6826295852661133,
+ "mean_token_accuracy": 0.6251221299171448,
+ "num_tokens": 3391488.0,
+ "step": 207
+ },
+ {
+ "entropy": 1.3565926551818848,
+ "epoch": 0.4202020202020202,
+ "grad_norm": 1.9611284732818604,
+ "learning_rate": 4.581818181818183e-06,
+ "loss": 1.346787452697754,
+ "mean_token_accuracy": 0.685332179069519,
+ "num_tokens": 3407872.0,
+ "step": 208
+ },
+ {
+ "entropy": 1.4401211738586426,
+ "epoch": 0.4222222222222222,
+ "grad_norm": 1.8614766597747803,
+ "learning_rate": 4.579797979797981e-06,
+ "loss": 1.4717891216278076,
+ "mean_token_accuracy": 0.650036633014679,
+ "num_tokens": 3424256.0,
+ "step": 209
+ },
+ {
+ "entropy": 1.194276213645935,
+ "epoch": 0.42424242424242425,
+ "grad_norm": 2.0625810623168945,
+ "learning_rate": 4.5777777777777785e-06,
+ "loss": 1.2106804847717285,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 3440640.0,
+ "step": 210
+ },
+ {
+ "entropy": 1.7622313499450684,
+ "epoch": 0.4262626262626263,
+ "grad_norm": 2.330610752105713,
+ "learning_rate": 4.575757575757576e-06,
+ "loss": 1.7872710227966309,
+ "mean_token_accuracy": 0.598436713218689,
+ "num_tokens": 3457024.0,
+ "step": 211
+ },
+ {
+ "entropy": 1.409427523612976,
+ "epoch": 0.42828282828282827,
+ "grad_norm": 2.0988259315490723,
+ "learning_rate": 4.573737373737374e-06,
+ "loss": 1.416553020477295,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 3473408.0,
+ "step": 212
+ },
+ {
+ "entropy": 1.6856107711791992,
+ "epoch": 0.4303030303030303,
+ "grad_norm": 2.341475009918213,
+ "learning_rate": 4.571717171717172e-06,
+ "loss": 1.692287802696228,
+ "mean_token_accuracy": 0.6024059653282166,
+ "num_tokens": 3489792.0,
+ "step": 213
+ },
+ {
+ "entropy": 1.997343897819519,
+ "epoch": 0.43232323232323233,
+ "grad_norm": 2.200498104095459,
+ "learning_rate": 4.56969696969697e-06,
+ "loss": 2.026289939880371,
+ "mean_token_accuracy": 0.5781631469726562,
+ "num_tokens": 3506176.0,
+ "step": 214
+ },
+ {
+ "entropy": 1.5175039768218994,
+ "epoch": 0.43434343434343436,
+ "grad_norm": 2.105257272720337,
+ "learning_rate": 4.567676767676768e-06,
+ "loss": 1.521841049194336,
+ "mean_token_accuracy": 0.6404494643211365,
+ "num_tokens": 3522560.0,
+ "step": 215
+ },
+ {
+ "entropy": 1.3616528511047363,
+ "epoch": 0.43636363636363634,
+ "grad_norm": 2.0035297870635986,
+ "learning_rate": 4.565656565656566e-06,
+ "loss": 1.3674360513687134,
+ "mean_token_accuracy": 0.6771494746208191,
+ "num_tokens": 3538944.0,
+ "step": 216
+ },
+ {
+ "entropy": 1.42499840259552,
+ "epoch": 0.4383838383838384,
+ "grad_norm": 1.9115629196166992,
+ "learning_rate": 4.563636363636364e-06,
+ "loss": 1.4129266738891602,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 3555328.0,
+ "step": 217
+ },
+ {
+ "entropy": 1.2844709157943726,
+ "epoch": 0.4404040404040404,
+ "grad_norm": 2.3313121795654297,
+ "learning_rate": 4.5616161616161616e-06,
+ "loss": 1.315006971359253,
+ "mean_token_accuracy": 0.681546151638031,
+ "num_tokens": 3571712.0,
+ "step": 218
+ },
+ {
+ "entropy": 1.5227075815200806,
+ "epoch": 0.44242424242424244,
+ "grad_norm": 2.1849124431610107,
+ "learning_rate": 4.55959595959596e-06,
+ "loss": 1.517989158630371,
+ "mean_token_accuracy": 0.6466169953346252,
+ "num_tokens": 3588096.0,
+ "step": 219
+ },
+ {
+ "entropy": 1.494642734527588,
+ "epoch": 0.4444444444444444,
+ "grad_norm": 2.3109116554260254,
+ "learning_rate": 4.557575757575758e-06,
+ "loss": 1.525421142578125,
+ "mean_token_accuracy": 0.6392281651496887,
+ "num_tokens": 3604480.0,
+ "step": 220
+ },
+ {
+ "entropy": 1.6428948640823364,
+ "epoch": 0.44646464646464645,
+ "grad_norm": 2.1182680130004883,
+ "learning_rate": 4.555555555555556e-06,
+ "loss": 1.6634926795959473,
+ "mean_token_accuracy": 0.6207864880561829,
+ "num_tokens": 3620864.0,
+ "step": 221
+ },
+ {
+ "entropy": 1.7323675155639648,
+ "epoch": 0.4484848484848485,
+ "grad_norm": 2.2620837688446045,
+ "learning_rate": 4.553535353535354e-06,
+ "loss": 1.7312631607055664,
+ "mean_token_accuracy": 0.6138250827789307,
+ "num_tokens": 3637248.0,
+ "step": 222
+ },
+ {
+ "entropy": 1.7863894701004028,
+ "epoch": 0.4505050505050505,
+ "grad_norm": 2.1416971683502197,
+ "learning_rate": 4.551515151515152e-06,
+ "loss": 1.799318552017212,
+ "mean_token_accuracy": 0.5906203985214233,
+ "num_tokens": 3653632.0,
+ "step": 223
+ },
+ {
+ "entropy": 1.7404330968856812,
+ "epoch": 0.45252525252525255,
+ "grad_norm": 2.0814504623413086,
+ "learning_rate": 4.54949494949495e-06,
+ "loss": 1.742197036743164,
+ "mean_token_accuracy": 0.6050317287445068,
+ "num_tokens": 3670016.0,
+ "step": 224
+ },
+ {
+ "entropy": 1.4387869834899902,
+ "epoch": 0.45454545454545453,
+ "grad_norm": 2.1386022567749023,
+ "learning_rate": 4.547474747474748e-06,
+ "loss": 1.4602317810058594,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 3686400.0,
+ "step": 225
+ },
+ {
+ "entropy": 1.2733348608016968,
+ "epoch": 0.45656565656565656,
+ "grad_norm": 2.02687668800354,
+ "learning_rate": 4.5454545454545455e-06,
+ "loss": 1.2683714628219604,
+ "mean_token_accuracy": 0.6966902613639832,
+ "num_tokens": 3702784.0,
+ "step": 226
+ },
+ {
+ "entropy": 1.4554595947265625,
+ "epoch": 0.4585858585858586,
+ "grad_norm": 2.169268846511841,
+ "learning_rate": 4.543434343434343e-06,
+ "loss": 1.4541833400726318,
+ "mean_token_accuracy": 0.6522960662841797,
+ "num_tokens": 3719168.0,
+ "step": 227
+ },
+ {
+ "entropy": 1.487573266029358,
+ "epoch": 0.46060606060606063,
+ "grad_norm": 1.9726165533065796,
+ "learning_rate": 4.541414141414141e-06,
+ "loss": 1.5024409294128418,
+ "mean_token_accuracy": 0.6509526371955872,
+ "num_tokens": 3735552.0,
+ "step": 228
+ },
+ {
+ "entropy": 1.3991138935089111,
+ "epoch": 0.4626262626262626,
+ "grad_norm": 2.0992283821105957,
+ "learning_rate": 4.539393939393939e-06,
+ "loss": 1.4016860723495483,
+ "mean_token_accuracy": 0.6639594435691833,
+ "num_tokens": 3751936.0,
+ "step": 229
+ },
+ {
+ "entropy": 1.6564134359359741,
+ "epoch": 0.46464646464646464,
+ "grad_norm": 2.047656297683716,
+ "learning_rate": 4.537373737373738e-06,
+ "loss": 1.6598721742630005,
+ "mean_token_accuracy": 0.6166951656341553,
+ "num_tokens": 3768320.0,
+ "step": 230
+ },
+ {
+ "entropy": 1.5165014266967773,
+ "epoch": 0.4666666666666667,
+ "grad_norm": 2.079996109008789,
+ "learning_rate": 4.535353535353536e-06,
+ "loss": 1.4980010986328125,
+ "mean_token_accuracy": 0.6370908617973328,
+ "num_tokens": 3784704.0,
+ "step": 231
+ },
+ {
+ "entropy": 1.5409225225448608,
+ "epoch": 0.4686868686868687,
+ "grad_norm": 2.0996923446655273,
+ "learning_rate": 4.533333333333334e-06,
+ "loss": 1.5504257678985596,
+ "mean_token_accuracy": 0.6465559601783752,
+ "num_tokens": 3801088.0,
+ "step": 232
+ },
+ {
+ "entropy": 1.3590043783187866,
+ "epoch": 0.4707070707070707,
+ "grad_norm": 2.14617919921875,
+ "learning_rate": 4.531313131313132e-06,
+ "loss": 1.3581812381744385,
+ "mean_token_accuracy": 0.6683561205863953,
+ "num_tokens": 3817472.0,
+ "step": 233
+ },
+ {
+ "entropy": 1.641785740852356,
+ "epoch": 0.4727272727272727,
+ "grad_norm": 1.9499926567077637,
+ "learning_rate": 4.5292929292929295e-06,
+ "loss": 1.6653470993041992,
+ "mean_token_accuracy": 0.6319614052772522,
+ "num_tokens": 3833856.0,
+ "step": 234
+ },
+ {
+ "entropy": 1.4700758457183838,
+ "epoch": 0.47474747474747475,
+ "grad_norm": 1.9411437511444092,
+ "learning_rate": 4.527272727272727e-06,
+ "loss": 1.4762463569641113,
+ "mean_token_accuracy": 0.6631656289100647,
+ "num_tokens": 3850240.0,
+ "step": 235
+ },
+ {
+ "entropy": 1.5418941974639893,
+ "epoch": 0.4767676767676768,
+ "grad_norm": 2.3191940784454346,
+ "learning_rate": 4.525252525252526e-06,
+ "loss": 1.5151214599609375,
+ "mean_token_accuracy": 0.6326331496238708,
+ "num_tokens": 3866624.0,
+ "step": 236
+ },
+ {
+ "entropy": 2.1102776527404785,
+ "epoch": 0.47878787878787876,
+ "grad_norm": 2.2287707328796387,
+ "learning_rate": 4.523232323232324e-06,
+ "loss": 2.106567859649658,
+ "mean_token_accuracy": 0.5506839156150818,
+ "num_tokens": 3883008.0,
+ "step": 237
+ },
+ {
+ "entropy": 1.7448827028274536,
+ "epoch": 0.4808080808080808,
+ "grad_norm": 2.2352893352508545,
+ "learning_rate": 4.521212121212122e-06,
+ "loss": 1.7495017051696777,
+ "mean_token_accuracy": 0.60326087474823,
+ "num_tokens": 3899392.0,
+ "step": 238
+ },
+ {
+ "entropy": 1.315240740776062,
+ "epoch": 0.48282828282828283,
+ "grad_norm": 1.9933631420135498,
+ "learning_rate": 4.51919191919192e-06,
+ "loss": 1.315302848815918,
+ "mean_token_accuracy": 0.686431348323822,
+ "num_tokens": 3915776.0,
+ "step": 239
+ },
+ {
+ "entropy": 1.5851637125015259,
+ "epoch": 0.48484848484848486,
+ "grad_norm": 2.153303623199463,
+ "learning_rate": 4.517171717171718e-06,
+ "loss": 1.5947662591934204,
+ "mean_token_accuracy": 0.6297020316123962,
+ "num_tokens": 3932160.0,
+ "step": 240
+ },
+ {
+ "entropy": 1.8050944805145264,
+ "epoch": 0.4868686868686869,
+ "grad_norm": 2.025022506713867,
+ "learning_rate": 4.5151515151515155e-06,
+ "loss": 1.8051010370254517,
+ "mean_token_accuracy": 0.6055202484130859,
+ "num_tokens": 3948544.0,
+ "step": 241
+ },
+ {
+ "entropy": 1.518296718597412,
+ "epoch": 0.4888888888888889,
+ "grad_norm": 2.1021833419799805,
+ "learning_rate": 4.513131313131313e-06,
+ "loss": 1.5396809577941895,
+ "mean_token_accuracy": 0.6359916925430298,
+ "num_tokens": 3964928.0,
+ "step": 242
+ },
+ {
+ "entropy": 1.518903136253357,
+ "epoch": 0.4909090909090909,
+ "grad_norm": 2.0960140228271484,
+ "learning_rate": 4.511111111111111e-06,
+ "loss": 1.5528055429458618,
+ "mean_token_accuracy": 0.6224963068962097,
+ "num_tokens": 3981312.0,
+ "step": 243
+ },
+ {
+ "entropy": 1.6960705518722534,
+ "epoch": 0.49292929292929294,
+ "grad_norm": 1.8580718040466309,
+ "learning_rate": 4.50909090909091e-06,
+ "loss": 1.7192862033843994,
+ "mean_token_accuracy": 0.6259770393371582,
+ "num_tokens": 3997696.0,
+ "step": 244
+ },
+ {
+ "entropy": 1.4633033275604248,
+ "epoch": 0.494949494949495,
+ "grad_norm": 1.8983049392700195,
+ "learning_rate": 4.507070707070708e-06,
+ "loss": 1.451701283454895,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 4014080.0,
+ "step": 245
+ },
+ {
+ "entropy": 1.6508095264434814,
+ "epoch": 0.49696969696969695,
+ "grad_norm": 2.298679828643799,
+ "learning_rate": 4.505050505050506e-06,
+ "loss": 1.6596897840499878,
+ "mean_token_accuracy": 0.6115046143531799,
+ "num_tokens": 4030464.0,
+ "step": 246
+ },
+ {
+ "entropy": 1.313779354095459,
+ "epoch": 0.498989898989899,
+ "grad_norm": 1.9894335269927979,
+ "learning_rate": 4.503030303030304e-06,
+ "loss": 1.3285409212112427,
+ "mean_token_accuracy": 0.6802027225494385,
+ "num_tokens": 4046848.0,
+ "step": 247
+ },
+ {
+ "entropy": 1.5139521360397339,
+ "epoch": 0.501010101010101,
+ "grad_norm": 2.028320789337158,
+ "learning_rate": 4.501010101010102e-06,
+ "loss": 1.5366487503051758,
+ "mean_token_accuracy": 0.6416707634925842,
+ "num_tokens": 4063232.0,
+ "step": 248
+ },
+ {
+ "entropy": 1.5277045965194702,
+ "epoch": 0.503030303030303,
+ "grad_norm": 2.3160979747772217,
+ "learning_rate": 4.4989898989898995e-06,
+ "loss": 1.5571036338806152,
+ "mean_token_accuracy": 0.6436858773231506,
+ "num_tokens": 4079616.0,
+ "step": 249
+ },
+ {
+ "entropy": 1.6084188222885132,
+ "epoch": 0.5050505050505051,
+ "grad_norm": 2.20550274848938,
+ "learning_rate": 4.496969696969697e-06,
+ "loss": 1.622127652168274,
+ "mean_token_accuracy": 0.6284196376800537,
+ "num_tokens": 4096000.0,
+ "step": 250
+ },
+ {
+ "epoch": 0.5050505050505051,
+ "eval_entropy": 1.5547234262189558,
+ "eval_loss": 1.5764786005020142,
+ "eval_mean_token_accuracy": 0.6375306306346771,
+ "eval_num_tokens": 4096000.0,
+ "eval_runtime": 43.7607,
+ "eval_samples_per_second": 22.623,
+ "eval_steps_per_second": 2.834,
+ "step": 250
+ },
+ {
+ "entropy": 1.4309135675430298,
+ "epoch": 0.5070707070707071,
+ "grad_norm": 2.080864906311035,
+ "learning_rate": 4.494949494949495e-06,
+ "loss": 1.4481091499328613,
+ "mean_token_accuracy": 0.6694552898406982,
+ "num_tokens": 4112384.0,
+ "step": 251
+ },
+ {
+ "entropy": 1.4067270755767822,
+ "epoch": 0.509090909090909,
+ "grad_norm": 2.036475419998169,
+ "learning_rate": 4.492929292929293e-06,
+ "loss": 1.4035298824310303,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 4128768.0,
+ "step": 252
+ },
+ {
+ "entropy": 2.1751608848571777,
+ "epoch": 0.5111111111111111,
+ "grad_norm": 1.953995943069458,
+ "learning_rate": 4.490909090909091e-06,
+ "loss": 2.1616692543029785,
+ "mean_token_accuracy": 0.5592941045761108,
+ "num_tokens": 4145152.0,
+ "step": 253
+ },
+ {
+ "entropy": 1.45353102684021,
+ "epoch": 0.5131313131313131,
+ "grad_norm": 2.084437370300293,
+ "learning_rate": 4.488888888888889e-06,
+ "loss": 1.4633586406707764,
+ "mean_token_accuracy": 0.6620664596557617,
+ "num_tokens": 4161536.0,
+ "step": 254
+ },
+ {
+ "entropy": 1.64310884475708,
+ "epoch": 0.5151515151515151,
+ "grad_norm": 2.0700111389160156,
+ "learning_rate": 4.486868686868688e-06,
+ "loss": 1.6868078708648682,
+ "mean_token_accuracy": 0.616328775882721,
+ "num_tokens": 4177920.0,
+ "step": 255
+ },
+ {
+ "entropy": 1.5113472938537598,
+ "epoch": 0.5171717171717172,
+ "grad_norm": 2.102180242538452,
+ "learning_rate": 4.4848484848484855e-06,
+ "loss": 1.5240120887756348,
+ "mean_token_accuracy": 0.638067901134491,
+ "num_tokens": 4194304.0,
+ "step": 256
+ },
+ {
+ "entropy": 1.5752851963043213,
+ "epoch": 0.5191919191919192,
+ "grad_norm": 2.026737689971924,
+ "learning_rate": 4.4828282828282834e-06,
+ "loss": 1.6041791439056396,
+ "mean_token_accuracy": 0.6275647282600403,
+ "num_tokens": 4210688.0,
+ "step": 257
+ },
+ {
+ "entropy": 1.548423171043396,
+ "epoch": 0.5212121212121212,
+ "grad_norm": 2.0578935146331787,
+ "learning_rate": 4.480808080808081e-06,
+ "loss": 1.563529372215271,
+ "mean_token_accuracy": 0.6348925232887268,
+ "num_tokens": 4227072.0,
+ "step": 258
+ },
+ {
+ "entropy": 1.5324457883834839,
+ "epoch": 0.5232323232323233,
+ "grad_norm": 2.216235637664795,
+ "learning_rate": 4.478787878787879e-06,
+ "loss": 1.5559678077697754,
+ "mean_token_accuracy": 0.6300073266029358,
+ "num_tokens": 4243456.0,
+ "step": 259
+ },
+ {
+ "entropy": 1.5275540351867676,
+ "epoch": 0.5252525252525253,
+ "grad_norm": 2.037306070327759,
+ "learning_rate": 4.476767676767677e-06,
+ "loss": 1.541567087173462,
+ "mean_token_accuracy": 0.6424035429954529,
+ "num_tokens": 4259840.0,
+ "step": 260
+ },
+ {
+ "entropy": 1.6842185258865356,
+ "epoch": 0.5272727272727272,
+ "grad_norm": 2.0241005420684814,
+ "learning_rate": 4.474747474747475e-06,
+ "loss": 1.6819056272506714,
+ "mean_token_accuracy": 0.6102222800254822,
+ "num_tokens": 4276224.0,
+ "step": 261
+ },
+ {
+ "entropy": 1.5656248331069946,
+ "epoch": 0.5292929292929293,
+ "grad_norm": 1.993054986000061,
+ "learning_rate": 4.472727272727273e-06,
+ "loss": 1.6132277250289917,
+ "mean_token_accuracy": 0.634709358215332,
+ "num_tokens": 4292608.0,
+ "step": 262
+ },
+ {
+ "entropy": 1.6354466676712036,
+ "epoch": 0.5313131313131313,
+ "grad_norm": 2.06508731842041,
+ "learning_rate": 4.470707070707071e-06,
+ "loss": 1.6475149393081665,
+ "mean_token_accuracy": 0.6121763586997986,
+ "num_tokens": 4308992.0,
+ "step": 263
+ },
+ {
+ "entropy": 1.5267232656478882,
+ "epoch": 0.5333333333333333,
+ "grad_norm": 2.1227569580078125,
+ "learning_rate": 4.468686868686869e-06,
+ "loss": 1.5468671321868896,
+ "mean_token_accuracy": 0.6365413069725037,
+ "num_tokens": 4325376.0,
+ "step": 264
+ },
+ {
+ "entropy": 1.2252761125564575,
+ "epoch": 0.5353535353535354,
+ "grad_norm": 2.0596134662628174,
+ "learning_rate": 4.4666666666666665e-06,
+ "loss": 1.2242389917373657,
+ "mean_token_accuracy": 0.6973620057106018,
+ "num_tokens": 4341760.0,
+ "step": 265
+ },
+ {
+ "entropy": 1.6007431745529175,
+ "epoch": 0.5373737373737374,
+ "grad_norm": 1.9341918230056763,
+ "learning_rate": 4.464646464646465e-06,
+ "loss": 1.5989094972610474,
+ "mean_token_accuracy": 0.6284196376800537,
+ "num_tokens": 4358144.0,
+ "step": 266
+ },
+ {
+ "entropy": 1.2708780765533447,
+ "epoch": 0.5393939393939394,
+ "grad_norm": 4.594091415405273,
+ "learning_rate": 4.462626262626263e-06,
+ "loss": 1.3484312295913696,
+ "mean_token_accuracy": 0.6790425181388855,
+ "num_tokens": 4374528.0,
+ "step": 267
+ },
+ {
+ "entropy": 1.5423723459243774,
+ "epoch": 0.5414141414141415,
+ "grad_norm": 1.933602213859558,
+ "learning_rate": 4.460606060606061e-06,
+ "loss": 1.594527244567871,
+ "mean_token_accuracy": 0.6386785507202148,
+ "num_tokens": 4390912.0,
+ "step": 268
+ },
+ {
+ "entropy": 1.7213952541351318,
+ "epoch": 0.5434343434343434,
+ "grad_norm": 2.195904016494751,
+ "learning_rate": 4.458585858585859e-06,
+ "loss": 1.724353551864624,
+ "mean_token_accuracy": 0.6008182764053345,
+ "num_tokens": 4407296.0,
+ "step": 269
+ },
+ {
+ "entropy": 1.4772557020187378,
+ "epoch": 0.5454545454545454,
+ "grad_norm": 2.0990796089172363,
+ "learning_rate": 4.456565656565657e-06,
+ "loss": 1.486825942993164,
+ "mean_token_accuracy": 0.6507083773612976,
+ "num_tokens": 4423680.0,
+ "step": 270
+ },
+ {
+ "entropy": 1.6876367330551147,
+ "epoch": 0.5474747474747474,
+ "grad_norm": 2.1944479942321777,
+ "learning_rate": 4.454545454545455e-06,
+ "loss": 1.71107816696167,
+ "mean_token_accuracy": 0.6027112603187561,
+ "num_tokens": 4440064.0,
+ "step": 271
+ },
+ {
+ "entropy": 1.5480726957321167,
+ "epoch": 0.5494949494949495,
+ "grad_norm": 2.1579341888427734,
+ "learning_rate": 4.452525252525253e-06,
+ "loss": 1.544647216796875,
+ "mean_token_accuracy": 0.6345261335372925,
+ "num_tokens": 4456448.0,
+ "step": 272
+ },
+ {
+ "entropy": 1.6161645650863647,
+ "epoch": 0.5515151515151515,
+ "grad_norm": 1.981154203414917,
+ "learning_rate": 4.4505050505050505e-06,
+ "loss": 1.6109068393707275,
+ "mean_token_accuracy": 0.6318392753601074,
+ "num_tokens": 4472832.0,
+ "step": 273
+ },
+ {
+ "entropy": 1.2576326131820679,
+ "epoch": 0.5535353535353535,
+ "grad_norm": 1.95668625831604,
+ "learning_rate": 4.448484848484848e-06,
+ "loss": 1.2614656686782837,
+ "mean_token_accuracy": 0.7025524973869324,
+ "num_tokens": 4489216.0,
+ "step": 274
+ },
+ {
+ "entropy": 1.405206561088562,
+ "epoch": 0.5555555555555556,
+ "grad_norm": 2.0302884578704834,
+ "learning_rate": 4.446464646464646e-06,
+ "loss": 1.416546106338501,
+ "mean_token_accuracy": 0.6753786206245422,
+ "num_tokens": 4505600.0,
+ "step": 275
+ },
+ {
+ "entropy": 1.9038625955581665,
+ "epoch": 0.5575757575757576,
+ "grad_norm": 2.06475567817688,
+ "learning_rate": 4.444444444444444e-06,
+ "loss": 1.9273614883422852,
+ "mean_token_accuracy": 0.5813996195793152,
+ "num_tokens": 4521984.0,
+ "step": 276
+ },
+ {
+ "entropy": 1.7208465337753296,
+ "epoch": 0.5595959595959596,
+ "grad_norm": 2.0136189460754395,
+ "learning_rate": 4.442424242424243e-06,
+ "loss": 1.7260158061981201,
+ "mean_token_accuracy": 0.6006350517272949,
+ "num_tokens": 4538368.0,
+ "step": 277
+ },
+ {
+ "entropy": 1.7570570707321167,
+ "epoch": 0.5616161616161616,
+ "grad_norm": 2.148594379425049,
+ "learning_rate": 4.440404040404041e-06,
+ "loss": 1.7799286842346191,
+ "mean_token_accuracy": 0.5943453907966614,
+ "num_tokens": 4554752.0,
+ "step": 278
+ },
+ {
+ "entropy": 1.6388157606124878,
+ "epoch": 0.5636363636363636,
+ "grad_norm": 2.1301987171173096,
+ "learning_rate": 4.438383838383839e-06,
+ "loss": 1.63419508934021,
+ "mean_token_accuracy": 0.6405715942382812,
+ "num_tokens": 4571136.0,
+ "step": 279
+ },
+ {
+ "entropy": 1.5902295112609863,
+ "epoch": 0.5656565656565656,
+ "grad_norm": 2.0526790618896484,
+ "learning_rate": 4.436363636363637e-06,
+ "loss": 1.6278276443481445,
+ "mean_token_accuracy": 0.615229606628418,
+ "num_tokens": 4587520.0,
+ "step": 280
+ },
+ {
+ "entropy": 1.5494027137756348,
+ "epoch": 0.5676767676767677,
+ "grad_norm": 1.9863859415054321,
+ "learning_rate": 4.434343434343435e-06,
+ "loss": 1.5622975826263428,
+ "mean_token_accuracy": 0.6261602640151978,
+ "num_tokens": 4603904.0,
+ "step": 281
+ },
+ {
+ "entropy": 1.2140685319900513,
+ "epoch": 0.5696969696969697,
+ "grad_norm": 2.4206902980804443,
+ "learning_rate": 4.432323232323233e-06,
+ "loss": 1.2389612197875977,
+ "mean_token_accuracy": 0.6943697929382324,
+ "num_tokens": 4620288.0,
+ "step": 282
+ },
+ {
+ "entropy": 1.4347270727157593,
+ "epoch": 0.5717171717171717,
+ "grad_norm": 2.0198237895965576,
+ "learning_rate": 4.430303030303031e-06,
+ "loss": 1.4648659229278564,
+ "mean_token_accuracy": 0.6573033928871155,
+ "num_tokens": 4636672.0,
+ "step": 283
+ },
+ {
+ "entropy": 1.3239331245422363,
+ "epoch": 0.5737373737373738,
+ "grad_norm": 1.9862704277038574,
+ "learning_rate": 4.428282828282829e-06,
+ "loss": 1.3520365953445435,
+ "mean_token_accuracy": 0.6852100491523743,
+ "num_tokens": 4653056.0,
+ "step": 284
+ },
+ {
+ "entropy": 1.7534631490707397,
+ "epoch": 0.5757575757575758,
+ "grad_norm": 2.0964176654815674,
+ "learning_rate": 4.426262626262627e-06,
+ "loss": 1.7659757137298584,
+ "mean_token_accuracy": 0.5975207686424255,
+ "num_tokens": 4669440.0,
+ "step": 285
+ },
+ {
+ "entropy": 1.1573433876037598,
+ "epoch": 0.5777777777777777,
+ "grad_norm": 2.0671567916870117,
+ "learning_rate": 4.424242424242425e-06,
+ "loss": 1.1479461193084717,
+ "mean_token_accuracy": 0.7143380641937256,
+ "num_tokens": 4685824.0,
+ "step": 286
+ },
+ {
+ "entropy": 1.2439504861831665,
+ "epoch": 0.5797979797979798,
+ "grad_norm": 2.0317327976226807,
+ "learning_rate": 4.422222222222223e-06,
+ "loss": 1.255782961845398,
+ "mean_token_accuracy": 0.691255509853363,
+ "num_tokens": 4702208.0,
+ "step": 287
+ },
+ {
+ "entropy": 1.5569473505020142,
+ "epoch": 0.5818181818181818,
+ "grad_norm": 2.0759670734405518,
+ "learning_rate": 4.4202020202020205e-06,
+ "loss": 1.5564974546432495,
+ "mean_token_accuracy": 0.6284807324409485,
+ "num_tokens": 4718592.0,
+ "step": 288
+ },
+ {
+ "entropy": 1.478676199913025,
+ "epoch": 0.5838383838383838,
+ "grad_norm": 1.9528205394744873,
+ "learning_rate": 4.418181818181818e-06,
+ "loss": 1.491654396057129,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 4734976.0,
+ "step": 289
+ },
+ {
+ "entropy": 1.2454503774642944,
+ "epoch": 0.5858585858585859,
+ "grad_norm": 1.9008079767227173,
+ "learning_rate": 4.416161616161616e-06,
+ "loss": 1.253904938697815,
+ "mean_token_accuracy": 0.6971787810325623,
+ "num_tokens": 4751360.0,
+ "step": 290
+ },
+ {
+ "entropy": 1.1740810871124268,
+ "epoch": 0.5878787878787879,
+ "grad_norm": 1.8888787031173706,
+ "learning_rate": 4.414141414141415e-06,
+ "loss": 1.195070505142212,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 4767744.0,
+ "step": 291
+ },
+ {
+ "entropy": 1.6064486503601074,
+ "epoch": 0.5898989898989899,
+ "grad_norm": 2.073559284210205,
+ "learning_rate": 4.412121212121213e-06,
+ "loss": 1.6180689334869385,
+ "mean_token_accuracy": 0.6242061257362366,
+ "num_tokens": 4784128.0,
+ "step": 292
+ },
+ {
+ "entropy": 1.6119383573532104,
+ "epoch": 0.591919191919192,
+ "grad_norm": 1.8773425817489624,
+ "learning_rate": 4.410101010101011e-06,
+ "loss": 1.5875662565231323,
+ "mean_token_accuracy": 0.647838294506073,
+ "num_tokens": 4800512.0,
+ "step": 293
+ },
+ {
+ "entropy": 1.392905592918396,
+ "epoch": 0.593939393939394,
+ "grad_norm": 2.1699368953704834,
+ "learning_rate": 4.408080808080809e-06,
+ "loss": 1.3949127197265625,
+ "mean_token_accuracy": 0.6538837552070618,
+ "num_tokens": 4816896.0,
+ "step": 294
+ },
+ {
+ "entropy": 1.5057002305984497,
+ "epoch": 0.5959595959595959,
+ "grad_norm": 2.2730712890625,
+ "learning_rate": 4.4060606060606066e-06,
+ "loss": 1.4755051136016846,
+ "mean_token_accuracy": 0.6498534679412842,
+ "num_tokens": 4833280.0,
+ "step": 295
+ },
+ {
+ "entropy": 1.5468902587890625,
+ "epoch": 0.597979797979798,
+ "grad_norm": 1.9911075830459595,
+ "learning_rate": 4.4040404040404044e-06,
+ "loss": 1.539963722229004,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 4849664.0,
+ "step": 296
+ },
+ {
+ "entropy": 1.5196901559829712,
+ "epoch": 0.6,
+ "grad_norm": 1.9859540462493896,
+ "learning_rate": 4.402020202020202e-06,
+ "loss": 1.523442029953003,
+ "mean_token_accuracy": 0.6417317986488342,
+ "num_tokens": 4866048.0,
+ "step": 297
+ },
+ {
+ "entropy": 1.8251866102218628,
+ "epoch": 0.602020202020202,
+ "grad_norm": 2.2566516399383545,
+ "learning_rate": 4.4e-06,
+ "loss": 1.8667771816253662,
+ "mean_token_accuracy": 0.5872007608413696,
+ "num_tokens": 4882432.0,
+ "step": 298
+ },
+ {
+ "entropy": 1.6816744804382324,
+ "epoch": 0.604040404040404,
+ "grad_norm": 2.0107715129852295,
+ "learning_rate": 4.397979797979798e-06,
+ "loss": 1.6907548904418945,
+ "mean_token_accuracy": 0.6176722049713135,
+ "num_tokens": 4898816.0,
+ "step": 299
+ },
+ {
+ "entropy": 1.4992223978042603,
+ "epoch": 0.6060606060606061,
+ "grad_norm": 2.1236329078674316,
+ "learning_rate": 4.395959595959596e-06,
+ "loss": 1.5015790462493896,
+ "mean_token_accuracy": 0.6372129917144775,
+ "num_tokens": 4915200.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.6060606060606061,
+ "eval_entropy": 1.5544315297757425,
+ "eval_loss": 1.5676765441894531,
+ "eval_mean_token_accuracy": 0.6389380799185845,
+ "eval_num_tokens": 4915200.0,
+ "eval_runtime": 43.7857,
+ "eval_samples_per_second": 22.61,
+ "eval_steps_per_second": 2.832,
+ "step": 300
+ },
+ {
+ "entropy": 1.518556833267212,
+ "epoch": 0.6080808080808081,
+ "grad_norm": 2.88371205329895,
+ "learning_rate": 4.393939393939394e-06,
+ "loss": 1.5310916900634766,
+ "mean_token_accuracy": 0.6551660895347595,
+ "num_tokens": 4931584.0,
+ "step": 301
+ },
+ {
+ "entropy": 1.4650386571884155,
+ "epoch": 0.6101010101010101,
+ "grad_norm": 2.1849780082702637,
+ "learning_rate": 4.391919191919193e-06,
+ "loss": 1.4405598640441895,
+ "mean_token_accuracy": 0.6531509757041931,
+ "num_tokens": 4947968.0,
+ "step": 302
+ },
+ {
+ "entropy": 1.5209505558013916,
+ "epoch": 0.6121212121212121,
+ "grad_norm": 2.1135010719299316,
+ "learning_rate": 4.3898989898989905e-06,
+ "loss": 1.5324647426605225,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 4964352.0,
+ "step": 303
+ },
+ {
+ "entropy": 1.448391318321228,
+ "epoch": 0.6141414141414141,
+ "grad_norm": 1.9959306716918945,
+ "learning_rate": 4.387878787878788e-06,
+ "loss": 1.4721965789794922,
+ "mean_token_accuracy": 0.6578529477119446,
+ "num_tokens": 4980736.0,
+ "step": 304
+ },
+ {
+ "entropy": 1.4609358310699463,
+ "epoch": 0.6161616161616161,
+ "grad_norm": 2.1308915615081787,
+ "learning_rate": 4.385858585858586e-06,
+ "loss": 1.4707520008087158,
+ "mean_token_accuracy": 0.6482046842575073,
+ "num_tokens": 4997120.0,
+ "step": 305
+ },
+ {
+ "entropy": 1.7125155925750732,
+ "epoch": 0.6181818181818182,
+ "grad_norm": 2.2170841693878174,
+ "learning_rate": 4.383838383838384e-06,
+ "loss": 1.7630269527435303,
+ "mean_token_accuracy": 0.5999022722244263,
+ "num_tokens": 5013504.0,
+ "step": 306
+ },
+ {
+ "entropy": 1.6740268468856812,
+ "epoch": 0.6202020202020202,
+ "grad_norm": 1.983644723892212,
+ "learning_rate": 4.381818181818182e-06,
+ "loss": 1.6849563121795654,
+ "mean_token_accuracy": 0.6237176060676575,
+ "num_tokens": 5029888.0,
+ "step": 307
+ },
+ {
+ "entropy": 1.3754971027374268,
+ "epoch": 0.6222222222222222,
+ "grad_norm": 2.005277395248413,
+ "learning_rate": 4.37979797979798e-06,
+ "loss": 1.385213851928711,
+ "mean_token_accuracy": 0.6638984084129333,
+ "num_tokens": 5046272.0,
+ "step": 308
+ },
+ {
+ "entropy": 1.5476733446121216,
+ "epoch": 0.6242424242424243,
+ "grad_norm": 2.4317610263824463,
+ "learning_rate": 4.377777777777778e-06,
+ "loss": 1.5417041778564453,
+ "mean_token_accuracy": 0.6323888897895813,
+ "num_tokens": 5062656.0,
+ "step": 309
+ },
+ {
+ "entropy": 1.4437031745910645,
+ "epoch": 0.6262626262626263,
+ "grad_norm": 2.1464109420776367,
+ "learning_rate": 4.375757575757576e-06,
+ "loss": 1.4704627990722656,
+ "mean_token_accuracy": 0.6772105693817139,
+ "num_tokens": 5079040.0,
+ "step": 310
+ },
+ {
+ "entropy": 1.4859641790390015,
+ "epoch": 0.6282828282828283,
+ "grad_norm": 2.0800492763519287,
+ "learning_rate": 4.373737373737374e-06,
+ "loss": 1.5072834491729736,
+ "mean_token_accuracy": 0.658707857131958,
+ "num_tokens": 5095424.0,
+ "step": 311
+ },
+ {
+ "entropy": 1.8733419179916382,
+ "epoch": 0.6303030303030303,
+ "grad_norm": 2.120965003967285,
+ "learning_rate": 4.3717171717171715e-06,
+ "loss": 1.8567254543304443,
+ "mean_token_accuracy": 0.5847581624984741,
+ "num_tokens": 5111808.0,
+ "step": 312
+ },
+ {
+ "entropy": 1.4578243494033813,
+ "epoch": 0.6323232323232323,
+ "grad_norm": 1.9577823877334595,
+ "learning_rate": 4.36969696969697e-06,
+ "loss": 1.4758052825927734,
+ "mean_token_accuracy": 0.6590742468833923,
+ "num_tokens": 5128192.0,
+ "step": 313
+ },
+ {
+ "entropy": 1.8680084943771362,
+ "epoch": 0.6343434343434343,
+ "grad_norm": 2.170994520187378,
+ "learning_rate": 4.367676767676768e-06,
+ "loss": 1.904400110244751,
+ "mean_token_accuracy": 0.5857962965965271,
+ "num_tokens": 5144576.0,
+ "step": 314
+ },
+ {
+ "entropy": 1.6488304138183594,
+ "epoch": 0.6363636363636364,
+ "grad_norm": 1.959490418434143,
+ "learning_rate": 4.365656565656566e-06,
+ "loss": 1.6570477485656738,
+ "mean_token_accuracy": 0.6257327795028687,
+ "num_tokens": 5160960.0,
+ "step": 315
+ },
+ {
+ "entropy": 1.5038025379180908,
+ "epoch": 0.6383838383838384,
+ "grad_norm": 2.072697401046753,
+ "learning_rate": 4.363636363636364e-06,
+ "loss": 1.5234860181808472,
+ "mean_token_accuracy": 0.6494259834289551,
+ "num_tokens": 5177344.0,
+ "step": 316
+ },
+ {
+ "entropy": 1.4154654741287231,
+ "epoch": 0.6404040404040404,
+ "grad_norm": 1.894587755203247,
+ "learning_rate": 4.361616161616162e-06,
+ "loss": 1.4131592512130737,
+ "mean_token_accuracy": 0.6667073965072632,
+ "num_tokens": 5193728.0,
+ "step": 317
+ },
+ {
+ "entropy": 1.5813250541687012,
+ "epoch": 0.6424242424242425,
+ "grad_norm": 2.4088737964630127,
+ "learning_rate": 4.35959595959596e-06,
+ "loss": 1.6236622333526611,
+ "mean_token_accuracy": 0.6313507556915283,
+ "num_tokens": 5210112.0,
+ "step": 318
+ },
+ {
+ "entropy": 1.4140045642852783,
+ "epoch": 0.6444444444444445,
+ "grad_norm": 1.991557240486145,
+ "learning_rate": 4.3575757575757576e-06,
+ "loss": 1.4242517948150635,
+ "mean_token_accuracy": 0.6569980382919312,
+ "num_tokens": 5226496.0,
+ "step": 319
+ },
+ {
+ "entropy": 1.615628957748413,
+ "epoch": 0.6464646464646465,
+ "grad_norm": 1.8819077014923096,
+ "learning_rate": 4.3555555555555555e-06,
+ "loss": 1.6331532001495361,
+ "mean_token_accuracy": 0.6299462914466858,
+ "num_tokens": 5242880.0,
+ "step": 320
+ },
+ {
+ "entropy": 1.3118394613265991,
+ "epoch": 0.6484848484848484,
+ "grad_norm": 2.0589284896850586,
+ "learning_rate": 4.353535353535353e-06,
+ "loss": 1.2880034446716309,
+ "mean_token_accuracy": 0.6842941045761108,
+ "num_tokens": 5259264.0,
+ "step": 321
+ },
+ {
+ "entropy": 1.2786612510681152,
+ "epoch": 0.6505050505050505,
+ "grad_norm": 2.033839225769043,
+ "learning_rate": 4.351515151515152e-06,
+ "loss": 1.2829055786132812,
+ "mean_token_accuracy": 0.6910112500190735,
+ "num_tokens": 5275648.0,
+ "step": 322
+ },
+ {
+ "entropy": 1.5632988214492798,
+ "epoch": 0.6525252525252525,
+ "grad_norm": 2.1970419883728027,
+ "learning_rate": 4.34949494949495e-06,
+ "loss": 1.5865097045898438,
+ "mean_token_accuracy": 0.642892062664032,
+ "num_tokens": 5292032.0,
+ "step": 323
+ },
+ {
+ "entropy": 1.1542725563049316,
+ "epoch": 0.6545454545454545,
+ "grad_norm": 1.9750654697418213,
+ "learning_rate": 4.347474747474748e-06,
+ "loss": 1.1401035785675049,
+ "mean_token_accuracy": 0.7061553597450256,
+ "num_tokens": 5308416.0,
+ "step": 324
+ },
+ {
+ "entropy": 1.6879942417144775,
+ "epoch": 0.6565656565656566,
+ "grad_norm": 2.0022354125976562,
+ "learning_rate": 4.345454545454546e-06,
+ "loss": 1.70950448513031,
+ "mean_token_accuracy": 0.6089398860931396,
+ "num_tokens": 5324800.0,
+ "step": 325
+ },
+ {
+ "entropy": 1.7589699029922485,
+ "epoch": 0.6585858585858586,
+ "grad_norm": 1.925520420074463,
+ "learning_rate": 4.343434343434344e-06,
+ "loss": 1.7749860286712646,
+ "mean_token_accuracy": 0.6015510559082031,
+ "num_tokens": 5341184.0,
+ "step": 326
+ },
+ {
+ "entropy": 1.4720325469970703,
+ "epoch": 0.6606060606060606,
+ "grad_norm": 1.9487124681472778,
+ "learning_rate": 4.341414141414142e-06,
+ "loss": 1.4983797073364258,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 5357568.0,
+ "step": 327
+ },
+ {
+ "entropy": 1.676164150238037,
+ "epoch": 0.6626262626262627,
+ "grad_norm": 2.13053035736084,
+ "learning_rate": 4.33939393939394e-06,
+ "loss": 1.699425458908081,
+ "mean_token_accuracy": 0.6100390553474426,
+ "num_tokens": 5373952.0,
+ "step": 328
+ },
+ {
+ "entropy": 1.3424437046051025,
+ "epoch": 0.6646464646464646,
+ "grad_norm": 2.0245954990386963,
+ "learning_rate": 4.337373737373738e-06,
+ "loss": 1.3393046855926514,
+ "mean_token_accuracy": 0.677760124206543,
+ "num_tokens": 5390336.0,
+ "step": 329
+ },
+ {
+ "entropy": 1.4926583766937256,
+ "epoch": 0.6666666666666666,
+ "grad_norm": 1.893343448638916,
+ "learning_rate": 4.335353535353536e-06,
+ "loss": 1.4779269695281982,
+ "mean_token_accuracy": 0.6713483333587646,
+ "num_tokens": 5406720.0,
+ "step": 330
+ },
+ {
+ "entropy": 1.5753449201583862,
+ "epoch": 0.6686868686868687,
+ "grad_norm": 2.051647424697876,
+ "learning_rate": 4.333333333333334e-06,
+ "loss": 1.622597336769104,
+ "mean_token_accuracy": 0.6436248421669006,
+ "num_tokens": 5423104.0,
+ "step": 331
+ },
+ {
+ "entropy": 1.4573988914489746,
+ "epoch": 0.6707070707070707,
+ "grad_norm": 1.8709567785263062,
+ "learning_rate": 4.331313131313132e-06,
+ "loss": 1.4902422428131104,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 5439488.0,
+ "step": 332
+ },
+ {
+ "entropy": 1.378867745399475,
+ "epoch": 0.6727272727272727,
+ "grad_norm": 2.235928773880005,
+ "learning_rate": 4.32929292929293e-06,
+ "loss": 1.4067103862762451,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 5455872.0,
+ "step": 333
+ },
+ {
+ "entropy": 1.7553350925445557,
+ "epoch": 0.6747474747474748,
+ "grad_norm": 2.0335066318511963,
+ "learning_rate": 4.327272727272728e-06,
+ "loss": 1.772943139076233,
+ "mean_token_accuracy": 0.5953834652900696,
+ "num_tokens": 5472256.0,
+ "step": 334
+ },
+ {
+ "entropy": 1.1587097644805908,
+ "epoch": 0.6767676767676768,
+ "grad_norm": 1.8764615058898926,
+ "learning_rate": 4.3252525252525255e-06,
+ "loss": 1.1396210193634033,
+ "mean_token_accuracy": 0.7197117805480957,
+ "num_tokens": 5488640.0,
+ "step": 335
+ },
+ {
+ "entropy": 1.4819872379302979,
+ "epoch": 0.6787878787878788,
+ "grad_norm": 2.0907511711120605,
+ "learning_rate": 4.323232323232323e-06,
+ "loss": 1.460550308227539,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 5505024.0,
+ "step": 336
+ },
+ {
+ "entropy": 1.0744472742080688,
+ "epoch": 0.6808080808080809,
+ "grad_norm": 2.227606773376465,
+ "learning_rate": 4.321212121212121e-06,
+ "loss": 1.0909301042556763,
+ "mean_token_accuracy": 0.7258182764053345,
+ "num_tokens": 5521408.0,
+ "step": 337
+ },
+ {
+ "entropy": 1.507999300956726,
+ "epoch": 0.6828282828282828,
+ "grad_norm": 2.0332415103912354,
+ "learning_rate": 4.31919191919192e-06,
+ "loss": 1.5173046588897705,
+ "mean_token_accuracy": 0.6374572515487671,
+ "num_tokens": 5537792.0,
+ "step": 338
+ },
+ {
+ "entropy": 1.6792720556259155,
+ "epoch": 0.6848484848484848,
+ "grad_norm": 2.0194997787475586,
+ "learning_rate": 4.317171717171718e-06,
+ "loss": 1.679445743560791,
+ "mean_token_accuracy": 0.6138250827789307,
+ "num_tokens": 5554176.0,
+ "step": 339
+ },
+ {
+ "entropy": 1.6470589637756348,
+ "epoch": 0.6868686868686869,
+ "grad_norm": 2.09116268157959,
+ "learning_rate": 4.315151515151516e-06,
+ "loss": 1.6386632919311523,
+ "mean_token_accuracy": 0.6146799921989441,
+ "num_tokens": 5570560.0,
+ "step": 340
+ },
+ {
+ "entropy": 1.3612488508224487,
+ "epoch": 0.6888888888888889,
+ "grad_norm": 2.1586217880249023,
+ "learning_rate": 4.313131313131314e-06,
+ "loss": 1.3698725700378418,
+ "mean_token_accuracy": 0.6696995496749878,
+ "num_tokens": 5586944.0,
+ "step": 341
+ },
+ {
+ "entropy": 1.400327205657959,
+ "epoch": 0.6909090909090909,
+ "grad_norm": 2.082094192504883,
+ "learning_rate": 4.3111111111111115e-06,
+ "loss": 1.396535873413086,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 5603328.0,
+ "step": 342
+ },
+ {
+ "entropy": 1.389290690422058,
+ "epoch": 0.692929292929293,
+ "grad_norm": 2.0780303478240967,
+ "learning_rate": 4.309090909090909e-06,
+ "loss": 1.4275782108306885,
+ "mean_token_accuracy": 0.6656082272529602,
+ "num_tokens": 5619712.0,
+ "step": 343
+ },
+ {
+ "entropy": 1.5133870840072632,
+ "epoch": 0.694949494949495,
+ "grad_norm": 1.9819531440734863,
+ "learning_rate": 4.307070707070707e-06,
+ "loss": 1.5309596061706543,
+ "mean_token_accuracy": 0.6373351216316223,
+ "num_tokens": 5636096.0,
+ "step": 344
+ },
+ {
+ "entropy": 1.483219861984253,
+ "epoch": 0.696969696969697,
+ "grad_norm": 1.9794325828552246,
+ "learning_rate": 4.305050505050505e-06,
+ "loss": 1.4693087339401245,
+ "mean_token_accuracy": 0.6550439596176147,
+ "num_tokens": 5652480.0,
+ "step": 345
+ },
+ {
+ "entropy": 1.381489634513855,
+ "epoch": 0.6989898989898989,
+ "grad_norm": 2.0637686252593994,
+ "learning_rate": 4.303030303030303e-06,
+ "loss": 1.3862476348876953,
+ "mean_token_accuracy": 0.6631045341491699,
+ "num_tokens": 5668864.0,
+ "step": 346
+ },
+ {
+ "entropy": 1.9860024452209473,
+ "epoch": 0.701010101010101,
+ "grad_norm": 2.1626803874969482,
+ "learning_rate": 4.301010101010101e-06,
+ "loss": 1.9815950393676758,
+ "mean_token_accuracy": 0.5698583126068115,
+ "num_tokens": 5685248.0,
+ "step": 347
+ },
+ {
+ "entropy": 1.5044004917144775,
+ "epoch": 0.703030303030303,
+ "grad_norm": 2.060976266860962,
+ "learning_rate": 4.298989898989899e-06,
+ "loss": 1.4937127828598022,
+ "mean_token_accuracy": 0.6524792313575745,
+ "num_tokens": 5701632.0,
+ "step": 348
+ },
+ {
+ "entropy": 1.3397772312164307,
+ "epoch": 0.705050505050505,
+ "grad_norm": 2.0162901878356934,
+ "learning_rate": 4.296969696969698e-06,
+ "loss": 1.3358572721481323,
+ "mean_token_accuracy": 0.6949804425239563,
+ "num_tokens": 5718016.0,
+ "step": 349
+ },
+ {
+ "entropy": 1.145772099494934,
+ "epoch": 0.7070707070707071,
+ "grad_norm": 2.097634792327881,
+ "learning_rate": 4.2949494949494955e-06,
+ "loss": 1.1833416223526,
+ "mean_token_accuracy": 0.7104909420013428,
+ "num_tokens": 5734400.0,
+ "step": 350
+ },
+ {
+ "epoch": 0.7070707070707071,
+ "eval_entropy": 1.5476290602837839,
+ "eval_loss": 1.5603480339050293,
+ "eval_mean_token_accuracy": 0.640111118555069,
+ "eval_num_tokens": 5734400.0,
+ "eval_runtime": 43.7844,
+ "eval_samples_per_second": 22.611,
+ "eval_steps_per_second": 2.832,
+ "step": 350
+ },
+ {
+ "entropy": 1.4311926364898682,
+ "epoch": 0.7090909090909091,
+ "grad_norm": 2.002321720123291,
+ "learning_rate": 4.292929292929293e-06,
+ "loss": 1.4534825086593628,
+ "mean_token_accuracy": 0.6614558100700378,
+ "num_tokens": 5750784.0,
+ "step": 351
+ },
+ {
+ "entropy": 1.3983922004699707,
+ "epoch": 0.7111111111111111,
+ "grad_norm": 2.1724867820739746,
+ "learning_rate": 4.290909090909091e-06,
+ "loss": 1.3969402313232422,
+ "mean_token_accuracy": 0.6652418375015259,
+ "num_tokens": 5767168.0,
+ "step": 352
+ },
+ {
+ "entropy": 1.8218920230865479,
+ "epoch": 0.7131313131313132,
+ "grad_norm": 2.1629281044006348,
+ "learning_rate": 4.288888888888889e-06,
+ "loss": 1.8196980953216553,
+ "mean_token_accuracy": 0.6027112603187561,
+ "num_tokens": 5783552.0,
+ "step": 353
+ },
+ {
+ "entropy": 1.5322320461273193,
+ "epoch": 0.7151515151515152,
+ "grad_norm": 1.8486647605895996,
+ "learning_rate": 4.286868686868687e-06,
+ "loss": 1.5504610538482666,
+ "mean_token_accuracy": 0.6533341407775879,
+ "num_tokens": 5799936.0,
+ "step": 354
+ },
+ {
+ "entropy": 1.935966968536377,
+ "epoch": 0.7171717171717171,
+ "grad_norm": 2.252814292907715,
+ "learning_rate": 4.284848484848485e-06,
+ "loss": 1.9300384521484375,
+ "mean_token_accuracy": 0.5656448602676392,
+ "num_tokens": 5816320.0,
+ "step": 355
+ },
+ {
+ "entropy": 1.6711398363113403,
+ "epoch": 0.7191919191919192,
+ "grad_norm": 2.023379325866699,
+ "learning_rate": 4.282828282828283e-06,
+ "loss": 1.6584455966949463,
+ "mean_token_accuracy": 0.6235954761505127,
+ "num_tokens": 5832704.0,
+ "step": 356
+ },
+ {
+ "entropy": 1.3922803401947021,
+ "epoch": 0.7212121212121212,
+ "grad_norm": 2.0487611293792725,
+ "learning_rate": 4.280808080808081e-06,
+ "loss": 1.4220250844955444,
+ "mean_token_accuracy": 0.6591963768005371,
+ "num_tokens": 5849088.0,
+ "step": 357
+ },
+ {
+ "entropy": 1.59521484375,
+ "epoch": 0.7232323232323232,
+ "grad_norm": 1.8598614931106567,
+ "learning_rate": 4.278787878787879e-06,
+ "loss": 1.5979329347610474,
+ "mean_token_accuracy": 0.6237176060676575,
+ "num_tokens": 5865472.0,
+ "step": 358
+ },
+ {
+ "entropy": 1.5810115337371826,
+ "epoch": 0.7252525252525253,
+ "grad_norm": 2.140115737915039,
+ "learning_rate": 4.276767676767677e-06,
+ "loss": 1.5774705410003662,
+ "mean_token_accuracy": 0.6274425983428955,
+ "num_tokens": 5881856.0,
+ "step": 359
+ },
+ {
+ "entropy": 1.5839109420776367,
+ "epoch": 0.7272727272727273,
+ "grad_norm": 2.0947749614715576,
+ "learning_rate": 4.274747474747475e-06,
+ "loss": 1.601511001586914,
+ "mean_token_accuracy": 0.630984365940094,
+ "num_tokens": 5898240.0,
+ "step": 360
+ },
+ {
+ "entropy": 1.195770263671875,
+ "epoch": 0.7292929292929293,
+ "grad_norm": 1.8740363121032715,
+ "learning_rate": 4.272727272727273e-06,
+ "loss": 1.195652961730957,
+ "mean_token_accuracy": 0.7077430486679077,
+ "num_tokens": 5914624.0,
+ "step": 361
+ },
+ {
+ "entropy": 1.375698208808899,
+ "epoch": 0.7313131313131314,
+ "grad_norm": 1.9580703973770142,
+ "learning_rate": 4.270707070707071e-06,
+ "loss": 1.3746864795684814,
+ "mean_token_accuracy": 0.6775158643722534,
+ "num_tokens": 5931008.0,
+ "step": 362
+ },
+ {
+ "entropy": 1.7259451150894165,
+ "epoch": 0.7333333333333333,
+ "grad_norm": 2.3127365112304688,
+ "learning_rate": 4.268686868686869e-06,
+ "loss": 1.745998501777649,
+ "mean_token_accuracy": 0.6040546894073486,
+ "num_tokens": 5947392.0,
+ "step": 363
+ },
+ {
+ "entropy": 1.209228754043579,
+ "epoch": 0.7353535353535353,
+ "grad_norm": 1.9004793167114258,
+ "learning_rate": 4.266666666666668e-06,
+ "loss": 1.232427716255188,
+ "mean_token_accuracy": 0.6925989389419556,
+ "num_tokens": 5963776.0,
+ "step": 364
+ },
+ {
+ "entropy": 1.2811263799667358,
+ "epoch": 0.7373737373737373,
+ "grad_norm": 1.9568246603012085,
+ "learning_rate": 4.2646464646464655e-06,
+ "loss": 1.291853427886963,
+ "mean_token_accuracy": 0.6884465217590332,
+ "num_tokens": 5980160.0,
+ "step": 365
+ },
+ {
+ "entropy": 1.843044638633728,
+ "epoch": 0.7393939393939394,
+ "grad_norm": 2.132735252380371,
+ "learning_rate": 4.262626262626263e-06,
+ "loss": 1.8818857669830322,
+ "mean_token_accuracy": 0.5785295367240906,
+ "num_tokens": 5996544.0,
+ "step": 366
+ },
+ {
+ "entropy": 1.3353440761566162,
+ "epoch": 0.7414141414141414,
+ "grad_norm": 1.8893013000488281,
+ "learning_rate": 4.260606060606061e-06,
+ "loss": 1.354011058807373,
+ "mean_token_accuracy": 0.6797752976417542,
+ "num_tokens": 6012928.0,
+ "step": 367
+ },
+ {
+ "entropy": 1.3889728784561157,
+ "epoch": 0.7434343434343434,
+ "grad_norm": 1.980757236480713,
+ "learning_rate": 4.258585858585859e-06,
+ "loss": 1.3671875,
+ "mean_token_accuracy": 0.6627381443977356,
+ "num_tokens": 6029312.0,
+ "step": 368
+ },
+ {
+ "entropy": 1.4605348110198975,
+ "epoch": 0.7454545454545455,
+ "grad_norm": 2.1033780574798584,
+ "learning_rate": 4.256565656565657e-06,
+ "loss": 1.455024003982544,
+ "mean_token_accuracy": 0.6451514363288879,
+ "num_tokens": 6045696.0,
+ "step": 369
+ },
+ {
+ "entropy": 1.4382058382034302,
+ "epoch": 0.7474747474747475,
+ "grad_norm": 2.1068074703216553,
+ "learning_rate": 4.254545454545455e-06,
+ "loss": 1.4422768354415894,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 6062080.0,
+ "step": 370
+ },
+ {
+ "entropy": 1.8046759366989136,
+ "epoch": 0.7494949494949495,
+ "grad_norm": 2.214466094970703,
+ "learning_rate": 4.252525252525253e-06,
+ "loss": 1.8247106075286865,
+ "mean_token_accuracy": 0.6003297567367554,
+ "num_tokens": 6078464.0,
+ "step": 371
+ },
+ {
+ "entropy": 1.671690583229065,
+ "epoch": 0.7515151515151515,
+ "grad_norm": 1.9790785312652588,
+ "learning_rate": 4.250505050505051e-06,
+ "loss": 1.6907753944396973,
+ "mean_token_accuracy": 0.6232290863990784,
+ "num_tokens": 6094848.0,
+ "step": 372
+ },
+ {
+ "entropy": 1.6881897449493408,
+ "epoch": 0.7535353535353535,
+ "grad_norm": 1.8638463020324707,
+ "learning_rate": 4.248484848484849e-06,
+ "loss": 1.7132716178894043,
+ "mean_token_accuracy": 0.6357474327087402,
+ "num_tokens": 6111232.0,
+ "step": 373
+ },
+ {
+ "entropy": 1.2555122375488281,
+ "epoch": 0.7555555555555555,
+ "grad_norm": 2.082378387451172,
+ "learning_rate": 4.246464646464647e-06,
+ "loss": 1.240688681602478,
+ "mean_token_accuracy": 0.6965070962905884,
+ "num_tokens": 6127616.0,
+ "step": 374
+ },
+ {
+ "entropy": 1.847135305404663,
+ "epoch": 0.7575757575757576,
+ "grad_norm": 2.142962694168091,
+ "learning_rate": 4.244444444444445e-06,
+ "loss": 1.8840911388397217,
+ "mean_token_accuracy": 0.5822545289993286,
+ "num_tokens": 6144000.0,
+ "step": 375
+ },
+ {
+ "entropy": 1.239328384399414,
+ "epoch": 0.7595959595959596,
+ "grad_norm": 2.0589468479156494,
+ "learning_rate": 4.242424242424243e-06,
+ "loss": 1.256324052810669,
+ "mean_token_accuracy": 0.6845383644104004,
+ "num_tokens": 6160384.0,
+ "step": 376
+ },
+ {
+ "entropy": 1.5047202110290527,
+ "epoch": 0.7616161616161616,
+ "grad_norm": 1.7951308488845825,
+ "learning_rate": 4.240404040404041e-06,
+ "loss": 1.5063304901123047,
+ "mean_token_accuracy": 0.6583414673805237,
+ "num_tokens": 6176768.0,
+ "step": 377
+ },
+ {
+ "entropy": 1.4072566032409668,
+ "epoch": 0.7636363636363637,
+ "grad_norm": 2.1670594215393066,
+ "learning_rate": 4.238383838383839e-06,
+ "loss": 1.4205389022827148,
+ "mean_token_accuracy": 0.658707857131958,
+ "num_tokens": 6193152.0,
+ "step": 378
+ },
+ {
+ "entropy": 1.3207885026931763,
+ "epoch": 0.7656565656565657,
+ "grad_norm": 1.9017083644866943,
+ "learning_rate": 4.236363636363637e-06,
+ "loss": 1.3169896602630615,
+ "mean_token_accuracy": 0.6954079270362854,
+ "num_tokens": 6209536.0,
+ "step": 379
+ },
+ {
+ "entropy": 1.4762436151504517,
+ "epoch": 0.7676767676767676,
+ "grad_norm": 2.0023069381713867,
+ "learning_rate": 4.234343434343435e-06,
+ "loss": 1.4725041389465332,
+ "mean_token_accuracy": 0.6620053648948669,
+ "num_tokens": 6225920.0,
+ "step": 380
+ },
+ {
+ "entropy": 1.4895304441452026,
+ "epoch": 0.7696969696969697,
+ "grad_norm": 1.9528017044067383,
+ "learning_rate": 4.2323232323232325e-06,
+ "loss": 1.49650239944458,
+ "mean_token_accuracy": 0.6508915424346924,
+ "num_tokens": 6242304.0,
+ "step": 381
+ },
+ {
+ "entropy": 1.3024516105651855,
+ "epoch": 0.7717171717171717,
+ "grad_norm": 1.9855588674545288,
+ "learning_rate": 4.2303030303030304e-06,
+ "loss": 1.34218168258667,
+ "mean_token_accuracy": 0.6838055849075317,
+ "num_tokens": 6258688.0,
+ "step": 382
+ },
+ {
+ "entropy": 1.6005626916885376,
+ "epoch": 0.7737373737373737,
+ "grad_norm": 2.028286933898926,
+ "learning_rate": 4.228282828282828e-06,
+ "loss": 1.6299283504486084,
+ "mean_token_accuracy": 0.6315950155258179,
+ "num_tokens": 6275072.0,
+ "step": 383
+ },
+ {
+ "entropy": 1.7050484418869019,
+ "epoch": 0.7757575757575758,
+ "grad_norm": 2.474047899246216,
+ "learning_rate": 4.226262626262626e-06,
+ "loss": 1.777151346206665,
+ "mean_token_accuracy": 0.5919027924537659,
+ "num_tokens": 6291456.0,
+ "step": 384
+ },
+ {
+ "entropy": 1.5014543533325195,
+ "epoch": 0.7777777777777778,
+ "grad_norm": 1.9866594076156616,
+ "learning_rate": 4.224242424242425e-06,
+ "loss": 1.5308949947357178,
+ "mean_token_accuracy": 0.639106035232544,
+ "num_tokens": 6307840.0,
+ "step": 385
+ },
+ {
+ "entropy": 1.6957359313964844,
+ "epoch": 0.7797979797979798,
+ "grad_norm": 2.229820966720581,
+ "learning_rate": 4.222222222222223e-06,
+ "loss": 1.728761911392212,
+ "mean_token_accuracy": 0.6242061257362366,
+ "num_tokens": 6324224.0,
+ "step": 386
+ },
+ {
+ "entropy": 1.6823521852493286,
+ "epoch": 0.7818181818181819,
+ "grad_norm": 2.033383369445801,
+ "learning_rate": 4.220202020202021e-06,
+ "loss": 1.7310154438018799,
+ "mean_token_accuracy": 0.6257938742637634,
+ "num_tokens": 6340608.0,
+ "step": 387
+ },
+ {
+ "entropy": 1.710307240486145,
+ "epoch": 0.7838383838383839,
+ "grad_norm": 2.061861038208008,
+ "learning_rate": 4.218181818181819e-06,
+ "loss": 1.7066943645477295,
+ "mean_token_accuracy": 0.6123595237731934,
+ "num_tokens": 6356992.0,
+ "step": 388
+ },
+ {
+ "entropy": 1.241638422012329,
+ "epoch": 0.7858585858585858,
+ "grad_norm": 1.9743852615356445,
+ "learning_rate": 4.2161616161616165e-06,
+ "loss": 1.2520272731781006,
+ "mean_token_accuracy": 0.692415714263916,
+ "num_tokens": 6373376.0,
+ "step": 389
+ },
+ {
+ "entropy": 1.5918776988983154,
+ "epoch": 0.7878787878787878,
+ "grad_norm": 2.156675100326538,
+ "learning_rate": 4.214141414141414e-06,
+ "loss": 1.6060255765914917,
+ "mean_token_accuracy": 0.6178553700447083,
+ "num_tokens": 6389760.0,
+ "step": 390
+ },
+ {
+ "entropy": 1.7307862043380737,
+ "epoch": 0.7898989898989899,
+ "grad_norm": 2.171247959136963,
+ "learning_rate": 4.212121212121212e-06,
+ "loss": 1.7327581644058228,
+ "mean_token_accuracy": 0.6502808928489685,
+ "num_tokens": 6406144.0,
+ "step": 391
+ },
+ {
+ "entropy": 1.6725553274154663,
+ "epoch": 0.7919191919191919,
+ "grad_norm": 2.020228624343872,
+ "learning_rate": 4.21010101010101e-06,
+ "loss": 1.6803646087646484,
+ "mean_token_accuracy": 0.6383732557296753,
+ "num_tokens": 6422528.0,
+ "step": 392
+ },
+ {
+ "entropy": 1.4120928049087524,
+ "epoch": 0.793939393939394,
+ "grad_norm": 1.9896639585494995,
+ "learning_rate": 4.208080808080808e-06,
+ "loss": 1.3974279165267944,
+ "mean_token_accuracy": 0.6661577820777893,
+ "num_tokens": 6438912.0,
+ "step": 393
+ },
+ {
+ "entropy": 0.933545708656311,
+ "epoch": 0.795959595959596,
+ "grad_norm": 1.6884223222732544,
+ "learning_rate": 4.206060606060606e-06,
+ "loss": 0.9287986755371094,
+ "mean_token_accuracy": 0.7636175155639648,
+ "num_tokens": 6455296.0,
+ "step": 394
+ },
+ {
+ "entropy": 1.419004201889038,
+ "epoch": 0.797979797979798,
+ "grad_norm": 2.2590551376342773,
+ "learning_rate": 4.204040404040405e-06,
+ "loss": 1.4652538299560547,
+ "mean_token_accuracy": 0.6589521169662476,
+ "num_tokens": 6471680.0,
+ "step": 395
+ },
+ {
+ "entropy": 1.750221610069275,
+ "epoch": 0.8,
+ "grad_norm": 2.195030450820923,
+ "learning_rate": 4.2020202020202026e-06,
+ "loss": 1.7328863143920898,
+ "mean_token_accuracy": 0.6008182764053345,
+ "num_tokens": 6488064.0,
+ "step": 396
+ },
+ {
+ "entropy": 1.7440015077590942,
+ "epoch": 0.802020202020202,
+ "grad_norm": 1.9833927154541016,
+ "learning_rate": 4.2000000000000004e-06,
+ "loss": 1.7617835998535156,
+ "mean_token_accuracy": 0.5992916226387024,
+ "num_tokens": 6504448.0,
+ "step": 397
+ },
+ {
+ "entropy": 1.1636452674865723,
+ "epoch": 0.804040404040404,
+ "grad_norm": 1.9506802558898926,
+ "learning_rate": 4.197979797979798e-06,
+ "loss": 1.1344032287597656,
+ "mean_token_accuracy": 0.7122618556022644,
+ "num_tokens": 6520832.0,
+ "step": 398
+ },
+ {
+ "entropy": 1.6173542737960815,
+ "epoch": 0.806060606060606,
+ "grad_norm": 2.0997231006622314,
+ "learning_rate": 4.195959595959596e-06,
+ "loss": 1.6303956508636475,
+ "mean_token_accuracy": 0.6215192675590515,
+ "num_tokens": 6537216.0,
+ "step": 399
+ },
+ {
+ "entropy": 1.4391542673110962,
+ "epoch": 0.8080808080808081,
+ "grad_norm": 2.356828212738037,
+ "learning_rate": 4.193939393939394e-06,
+ "loss": 1.4465923309326172,
+ "mean_token_accuracy": 0.6594406366348267,
+ "num_tokens": 6553600.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.8080808080808081,
+ "eval_entropy": 1.5504949785047961,
+ "eval_loss": 1.5544542074203491,
+ "eval_mean_token_accuracy": 0.6409837569921247,
+ "eval_num_tokens": 6553600.0,
+ "eval_runtime": 43.7986,
+ "eval_samples_per_second": 22.603,
+ "eval_steps_per_second": 2.831,
+ "step": 400
+ },
+ {
+ "entropy": 1.60548996925354,
+ "epoch": 0.8101010101010101,
+ "grad_norm": 2.1894404888153076,
+ "learning_rate": 4.191919191919192e-06,
+ "loss": 1.6116085052490234,
+ "mean_token_accuracy": 0.6276868581771851,
+ "num_tokens": 6569984.0,
+ "step": 401
+ },
+ {
+ "entropy": 1.436041235923767,
+ "epoch": 0.8121212121212121,
+ "grad_norm": 2.1180264949798584,
+ "learning_rate": 4.18989898989899e-06,
+ "loss": 1.4203698635101318,
+ "mean_token_accuracy": 0.6554714441299438,
+ "num_tokens": 6586368.0,
+ "step": 402
+ },
+ {
+ "entropy": 1.1348106861114502,
+ "epoch": 0.8141414141414142,
+ "grad_norm": 2.0420851707458496,
+ "learning_rate": 4.187878787878788e-06,
+ "loss": 1.1424527168273926,
+ "mean_token_accuracy": 0.7154372334480286,
+ "num_tokens": 6602752.0,
+ "step": 403
+ },
+ {
+ "entropy": 1.4039727449417114,
+ "epoch": 0.8161616161616162,
+ "grad_norm": 2.148340940475464,
+ "learning_rate": 4.185858585858586e-06,
+ "loss": 1.4246132373809814,
+ "mean_token_accuracy": 0.6723864078521729,
+ "num_tokens": 6619136.0,
+ "step": 404
+ },
+ {
+ "entropy": 1.4222626686096191,
+ "epoch": 0.8181818181818182,
+ "grad_norm": 1.9436827898025513,
+ "learning_rate": 4.1838383838383835e-06,
+ "loss": 1.4235990047454834,
+ "mean_token_accuracy": 0.6759281754493713,
+ "num_tokens": 6635520.0,
+ "step": 405
+ },
+ {
+ "entropy": 1.4771310091018677,
+ "epoch": 0.8202020202020202,
+ "grad_norm": 2.0953726768493652,
+ "learning_rate": 4.181818181818182e-06,
+ "loss": 1.501934289932251,
+ "mean_token_accuracy": 0.6535173654556274,
+ "num_tokens": 6651904.0,
+ "step": 406
+ },
+ {
+ "entropy": 1.526256799697876,
+ "epoch": 0.8222222222222222,
+ "grad_norm": 2.245994806289673,
+ "learning_rate": 4.17979797979798e-06,
+ "loss": 1.539383888244629,
+ "mean_token_accuracy": 0.6417317986488342,
+ "num_tokens": 6668288.0,
+ "step": 407
+ },
+ {
+ "entropy": 1.1716097593307495,
+ "epoch": 0.8242424242424242,
+ "grad_norm": 1.8283652067184448,
+ "learning_rate": 4.177777777777778e-06,
+ "loss": 1.1798359155654907,
+ "mean_token_accuracy": 0.7123839855194092,
+ "num_tokens": 6684672.0,
+ "step": 408
+ },
+ {
+ "entropy": 1.4581540822982788,
+ "epoch": 0.8262626262626263,
+ "grad_norm": 1.9325168132781982,
+ "learning_rate": 4.175757575757576e-06,
+ "loss": 1.4526585340499878,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 6701056.0,
+ "step": 409
+ },
+ {
+ "entropy": 1.4073102474212646,
+ "epoch": 0.8282828282828283,
+ "grad_norm": 2.1543467044830322,
+ "learning_rate": 4.173737373737375e-06,
+ "loss": 1.437713861465454,
+ "mean_token_accuracy": 0.6725696325302124,
+ "num_tokens": 6717440.0,
+ "step": 410
+ },
+ {
+ "entropy": 1.5970062017440796,
+ "epoch": 0.8303030303030303,
+ "grad_norm": 2.1714792251586914,
+ "learning_rate": 4.1717171717171726e-06,
+ "loss": 1.613295078277588,
+ "mean_token_accuracy": 0.6229848265647888,
+ "num_tokens": 6733824.0,
+ "step": 411
+ },
+ {
+ "entropy": 1.449837327003479,
+ "epoch": 0.8323232323232324,
+ "grad_norm": 2.2499871253967285,
+ "learning_rate": 4.1696969696969705e-06,
+ "loss": 1.489758014678955,
+ "mean_token_accuracy": 0.645639955997467,
+ "num_tokens": 6750208.0,
+ "step": 412
+ },
+ {
+ "entropy": 1.7696173191070557,
+ "epoch": 0.8343434343434344,
+ "grad_norm": 2.3637073040008545,
+ "learning_rate": 4.167676767676768e-06,
+ "loss": 1.8147599697113037,
+ "mean_token_accuracy": 0.5821323990821838,
+ "num_tokens": 6766592.0,
+ "step": 413
+ },
+ {
+ "entropy": 1.99376380443573,
+ "epoch": 0.8363636363636363,
+ "grad_norm": 2.265683174133301,
+ "learning_rate": 4.165656565656566e-06,
+ "loss": 2.009024143218994,
+ "mean_token_accuracy": 0.5591108798980713,
+ "num_tokens": 6782976.0,
+ "step": 414
+ },
+ {
+ "entropy": 1.7276980876922607,
+ "epoch": 0.8383838383838383,
+ "grad_norm": 1.9407477378845215,
+ "learning_rate": 4.163636363636364e-06,
+ "loss": 1.7130229473114014,
+ "mean_token_accuracy": 0.6202979683876038,
+ "num_tokens": 6799360.0,
+ "step": 415
+ },
+ {
+ "entropy": 1.5418223142623901,
+ "epoch": 0.8404040404040404,
+ "grad_norm": 1.9765743017196655,
+ "learning_rate": 4.161616161616162e-06,
+ "loss": 1.5627632141113281,
+ "mean_token_accuracy": 0.6433194875717163,
+ "num_tokens": 6815744.0,
+ "step": 416
+ },
+ {
+ "entropy": 1.6040345430374146,
+ "epoch": 0.8424242424242424,
+ "grad_norm": 2.1942877769470215,
+ "learning_rate": 4.15959595959596e-06,
+ "loss": 1.6044622659683228,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 6832128.0,
+ "step": 417
+ },
+ {
+ "entropy": 1.8461577892303467,
+ "epoch": 0.8444444444444444,
+ "grad_norm": 2.289196729660034,
+ "learning_rate": 4.157575757575758e-06,
+ "loss": 1.8679372072219849,
+ "mean_token_accuracy": 0.5887884497642517,
+ "num_tokens": 6848512.0,
+ "step": 418
+ },
+ {
+ "entropy": 1.4079350233078003,
+ "epoch": 0.8464646464646465,
+ "grad_norm": 1.9526047706604004,
+ "learning_rate": 4.155555555555556e-06,
+ "loss": 1.4145114421844482,
+ "mean_token_accuracy": 0.6731802821159363,
+ "num_tokens": 6864896.0,
+ "step": 419
+ },
+ {
+ "entropy": 1.1973973512649536,
+ "epoch": 0.8484848484848485,
+ "grad_norm": 2.0716679096221924,
+ "learning_rate": 4.1535353535353536e-06,
+ "loss": 1.260810136795044,
+ "mean_token_accuracy": 0.701697587966919,
+ "num_tokens": 6881280.0,
+ "step": 420
+ },
+ {
+ "entropy": 1.507702350616455,
+ "epoch": 0.8505050505050505,
+ "grad_norm": 2.0233314037323,
+ "learning_rate": 4.151515151515152e-06,
+ "loss": 1.513720154762268,
+ "mean_token_accuracy": 0.6497313380241394,
+ "num_tokens": 6897664.0,
+ "step": 421
+ },
+ {
+ "entropy": 1.54402756690979,
+ "epoch": 0.8525252525252526,
+ "grad_norm": 2.23366379737854,
+ "learning_rate": 4.14949494949495e-06,
+ "loss": 1.5434964895248413,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 6914048.0,
+ "step": 422
+ },
+ {
+ "entropy": 1.820296049118042,
+ "epoch": 0.8545454545454545,
+ "grad_norm": 2.066905975341797,
+ "learning_rate": 4.147474747474748e-06,
+ "loss": 1.8356924057006836,
+ "mean_token_accuracy": 0.5886663198471069,
+ "num_tokens": 6930432.0,
+ "step": 423
+ },
+ {
+ "entropy": 1.4747720956802368,
+ "epoch": 0.8565656565656565,
+ "grad_norm": 2.040022850036621,
+ "learning_rate": 4.145454545454546e-06,
+ "loss": 1.4495999813079834,
+ "mean_token_accuracy": 0.6532731056213379,
+ "num_tokens": 6946816.0,
+ "step": 424
+ },
+ {
+ "entropy": 1.7536696195602417,
+ "epoch": 0.8585858585858586,
+ "grad_norm": 2.0884320735931396,
+ "learning_rate": 4.143434343434344e-06,
+ "loss": 1.7520158290863037,
+ "mean_token_accuracy": 0.6083903312683105,
+ "num_tokens": 6963200.0,
+ "step": 425
+ },
+ {
+ "entropy": 1.715582251548767,
+ "epoch": 0.8606060606060606,
+ "grad_norm": 2.2991514205932617,
+ "learning_rate": 4.141414141414142e-06,
+ "loss": 1.7138090133666992,
+ "mean_token_accuracy": 0.607107937335968,
+ "num_tokens": 6979584.0,
+ "step": 426
+ },
+ {
+ "entropy": 1.8116382360458374,
+ "epoch": 0.8626262626262626,
+ "grad_norm": 2.289909839630127,
+ "learning_rate": 4.13939393939394e-06,
+ "loss": 1.7755894660949707,
+ "mean_token_accuracy": 0.5776746273040771,
+ "num_tokens": 6995968.0,
+ "step": 427
+ },
+ {
+ "entropy": 1.487213373184204,
+ "epoch": 0.8646464646464647,
+ "grad_norm": 1.8834803104400635,
+ "learning_rate": 4.1373737373737375e-06,
+ "loss": 1.511157751083374,
+ "mean_token_accuracy": 0.6546165347099304,
+ "num_tokens": 7012352.0,
+ "step": 428
+ },
+ {
+ "entropy": 1.2769891023635864,
+ "epoch": 0.8666666666666667,
+ "grad_norm": 1.892616629600525,
+ "learning_rate": 4.135353535353535e-06,
+ "loss": 1.2772598266601562,
+ "mean_token_accuracy": 0.6984611749649048,
+ "num_tokens": 7028736.0,
+ "step": 429
+ },
+ {
+ "entropy": 1.579519271850586,
+ "epoch": 0.8686868686868687,
+ "grad_norm": 1.9801563024520874,
+ "learning_rate": 4.133333333333333e-06,
+ "loss": 1.5647528171539307,
+ "mean_token_accuracy": 0.6482046842575073,
+ "num_tokens": 7045120.0,
+ "step": 430
+ },
+ {
+ "entropy": 1.407600998878479,
+ "epoch": 0.8707070707070707,
+ "grad_norm": 2.1737446784973145,
+ "learning_rate": 4.131313131313132e-06,
+ "loss": 1.4184494018554688,
+ "mean_token_accuracy": 0.6640815734863281,
+ "num_tokens": 7061504.0,
+ "step": 431
+ },
+ {
+ "entropy": 1.9118441343307495,
+ "epoch": 0.8727272727272727,
+ "grad_norm": 1.9541205167770386,
+ "learning_rate": 4.12929292929293e-06,
+ "loss": 1.9581422805786133,
+ "mean_token_accuracy": 0.564667820930481,
+ "num_tokens": 7077888.0,
+ "step": 432
+ },
+ {
+ "entropy": 1.925604224205017,
+ "epoch": 0.8747474747474747,
+ "grad_norm": 1.9696223735809326,
+ "learning_rate": 4.127272727272728e-06,
+ "loss": 1.9226163625717163,
+ "mean_token_accuracy": 0.5870786309242249,
+ "num_tokens": 7094272.0,
+ "step": 433
+ },
+ {
+ "entropy": 1.3994735479354858,
+ "epoch": 0.8767676767676768,
+ "grad_norm": 2.003532886505127,
+ "learning_rate": 4.125252525252526e-06,
+ "loss": 1.4291752576828003,
+ "mean_token_accuracy": 0.669516384601593,
+ "num_tokens": 7110656.0,
+ "step": 434
+ },
+ {
+ "entropy": 1.5550929307937622,
+ "epoch": 0.8787878787878788,
+ "grad_norm": 2.2658586502075195,
+ "learning_rate": 4.1232323232323236e-06,
+ "loss": 1.5533335208892822,
+ "mean_token_accuracy": 0.6242672204971313,
+ "num_tokens": 7127040.0,
+ "step": 435
+ },
+ {
+ "entropy": 1.6622785329818726,
+ "epoch": 0.8808080808080808,
+ "grad_norm": 2.0748393535614014,
+ "learning_rate": 4.1212121212121215e-06,
+ "loss": 1.700000524520874,
+ "mean_token_accuracy": 0.6221299171447754,
+ "num_tokens": 7143424.0,
+ "step": 436
+ },
+ {
+ "entropy": 1.1223996877670288,
+ "epoch": 0.8828282828282829,
+ "grad_norm": 2.0348756313323975,
+ "learning_rate": 4.119191919191919e-06,
+ "loss": 1.143293857574463,
+ "mean_token_accuracy": 0.7045676708221436,
+ "num_tokens": 7159808.0,
+ "step": 437
+ },
+ {
+ "entropy": 1.7156380414962769,
+ "epoch": 0.8848484848484849,
+ "grad_norm": 2.306549549102783,
+ "learning_rate": 4.117171717171717e-06,
+ "loss": 1.7625794410705566,
+ "mean_token_accuracy": 0.6049706935882568,
+ "num_tokens": 7176192.0,
+ "step": 438
+ },
+ {
+ "entropy": 1.8507202863693237,
+ "epoch": 0.8868686868686869,
+ "grad_norm": 2.2955853939056396,
+ "learning_rate": 4.115151515151515e-06,
+ "loss": 1.8923052549362183,
+ "mean_token_accuracy": 0.5938568711280823,
+ "num_tokens": 7192576.0,
+ "step": 439
+ },
+ {
+ "entropy": 1.813754916191101,
+ "epoch": 0.8888888888888888,
+ "grad_norm": 2.095700263977051,
+ "learning_rate": 4.113131313131313e-06,
+ "loss": 1.8375307321548462,
+ "mean_token_accuracy": 0.5848192572593689,
+ "num_tokens": 7208960.0,
+ "step": 440
+ },
+ {
+ "entropy": 1.4185007810592651,
+ "epoch": 0.8909090909090909,
+ "grad_norm": 2.118213176727295,
+ "learning_rate": 4.111111111111111e-06,
+ "loss": 1.4548171758651733,
+ "mean_token_accuracy": 0.657608687877655,
+ "num_tokens": 7225344.0,
+ "step": 441
+ },
+ {
+ "entropy": 1.1041690111160278,
+ "epoch": 0.8929292929292929,
+ "grad_norm": 1.9638988971710205,
+ "learning_rate": 4.10909090909091e-06,
+ "loss": 1.1232322454452515,
+ "mean_token_accuracy": 0.7068881392478943,
+ "num_tokens": 7241728.0,
+ "step": 442
+ },
+ {
+ "entropy": 1.6423180103302002,
+ "epoch": 0.8949494949494949,
+ "grad_norm": 2.32987117767334,
+ "learning_rate": 4.1070707070707075e-06,
+ "loss": 1.665462613105774,
+ "mean_token_accuracy": 0.6133365631103516,
+ "num_tokens": 7258112.0,
+ "step": 443
+ },
+ {
+ "entropy": 1.4778310060501099,
+ "epoch": 0.896969696969697,
+ "grad_norm": 2.1247661113739014,
+ "learning_rate": 4.105050505050505e-06,
+ "loss": 1.4554922580718994,
+ "mean_token_accuracy": 0.6474108695983887,
+ "num_tokens": 7274496.0,
+ "step": 444
+ },
+ {
+ "entropy": 1.3777755498886108,
+ "epoch": 0.898989898989899,
+ "grad_norm": 1.9243263006210327,
+ "learning_rate": 4.103030303030303e-06,
+ "loss": 1.3942883014678955,
+ "mean_token_accuracy": 0.6656692624092102,
+ "num_tokens": 7290880.0,
+ "step": 445
+ },
+ {
+ "entropy": 1.1036415100097656,
+ "epoch": 0.901010101010101,
+ "grad_norm": 1.9711178541183472,
+ "learning_rate": 4.101010101010101e-06,
+ "loss": 1.1070351600646973,
+ "mean_token_accuracy": 0.7213605046272278,
+ "num_tokens": 7307264.0,
+ "step": 446
+ },
+ {
+ "entropy": 1.695487380027771,
+ "epoch": 0.9030303030303031,
+ "grad_norm": 2.1113150119781494,
+ "learning_rate": 4.098989898989899e-06,
+ "loss": 1.6993653774261475,
+ "mean_token_accuracy": 0.5992305874824524,
+ "num_tokens": 7323648.0,
+ "step": 447
+ },
+ {
+ "entropy": 1.496254801750183,
+ "epoch": 0.9050505050505051,
+ "grad_norm": 2.072986602783203,
+ "learning_rate": 4.096969696969697e-06,
+ "loss": 1.5046567916870117,
+ "mean_token_accuracy": 0.6558378338813782,
+ "num_tokens": 7340032.0,
+ "step": 448
+ },
+ {
+ "entropy": 2.1845033168792725,
+ "epoch": 0.907070707070707,
+ "grad_norm": 2.3246262073516846,
+ "learning_rate": 4.094949494949495e-06,
+ "loss": 2.1508708000183105,
+ "mean_token_accuracy": 0.5376160144805908,
+ "num_tokens": 7356416.0,
+ "step": 449
+ },
+ {
+ "entropy": 1.6329164505004883,
+ "epoch": 0.9090909090909091,
+ "grad_norm": 1.997310757637024,
+ "learning_rate": 4.092929292929294e-06,
+ "loss": 1.6422264575958252,
+ "mean_token_accuracy": 0.6232290863990784,
+ "num_tokens": 7372800.0,
+ "step": 450
+ },
+ {
+ "epoch": 0.9090909090909091,
+ "eval_entropy": 1.5515337480652718,
+ "eval_loss": 1.5485161542892456,
+ "eval_mean_token_accuracy": 0.6417716929028111,
+ "eval_num_tokens": 7372800.0,
+ "eval_runtime": 43.7901,
+ "eval_samples_per_second": 22.608,
+ "eval_steps_per_second": 2.832,
+ "step": 450
+ },
+ {
+ "entropy": 1.7854291200637817,
+ "epoch": 0.9111111111111111,
+ "grad_norm": 2.0212173461914062,
+ "learning_rate": 4.0909090909090915e-06,
+ "loss": 1.7920666933059692,
+ "mean_token_accuracy": 0.5950170755386353,
+ "num_tokens": 7389184.0,
+ "step": 451
+ },
+ {
+ "entropy": 1.216304898262024,
+ "epoch": 0.9131313131313131,
+ "grad_norm": 1.8800705671310425,
+ "learning_rate": 4.088888888888889e-06,
+ "loss": 1.2014267444610596,
+ "mean_token_accuracy": 0.7076819539070129,
+ "num_tokens": 7405568.0,
+ "step": 452
+ },
+ {
+ "entropy": 1.5593703985214233,
+ "epoch": 0.9151515151515152,
+ "grad_norm": 2.101381301879883,
+ "learning_rate": 4.086868686868687e-06,
+ "loss": 1.559610366821289,
+ "mean_token_accuracy": 0.6337933540344238,
+ "num_tokens": 7421952.0,
+ "step": 453
+ },
+ {
+ "entropy": 1.4199841022491455,
+ "epoch": 0.9171717171717172,
+ "grad_norm": 2.0038692951202393,
+ "learning_rate": 4.084848484848485e-06,
+ "loss": 1.4040653705596924,
+ "mean_token_accuracy": 0.660845160484314,
+ "num_tokens": 7438336.0,
+ "step": 454
+ },
+ {
+ "entropy": 1.2010453939437866,
+ "epoch": 0.9191919191919192,
+ "grad_norm": 2.004110336303711,
+ "learning_rate": 4.082828282828283e-06,
+ "loss": 1.194115400314331,
+ "mean_token_accuracy": 0.6955910921096802,
+ "num_tokens": 7454720.0,
+ "step": 455
+ },
+ {
+ "entropy": 1.2295804023742676,
+ "epoch": 0.9212121212121213,
+ "grad_norm": 2.130387544631958,
+ "learning_rate": 4.080808080808081e-06,
+ "loss": 1.2125787734985352,
+ "mean_token_accuracy": 0.6993771195411682,
+ "num_tokens": 7471104.0,
+ "step": 456
+ },
+ {
+ "entropy": 1.3706485033035278,
+ "epoch": 0.9232323232323232,
+ "grad_norm": 2.1667706966400146,
+ "learning_rate": 4.07878787878788e-06,
+ "loss": 1.3886957168579102,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 7487488.0,
+ "step": 457
+ },
+ {
+ "entropy": 1.714059591293335,
+ "epoch": 0.9252525252525252,
+ "grad_norm": 2.0084264278411865,
+ "learning_rate": 4.0767676767676775e-06,
+ "loss": 1.724153757095337,
+ "mean_token_accuracy": 0.602161705493927,
+ "num_tokens": 7503872.0,
+ "step": 458
+ },
+ {
+ "entropy": 1.3170617818832397,
+ "epoch": 0.9272727272727272,
+ "grad_norm": 1.9923994541168213,
+ "learning_rate": 4.0747474747474754e-06,
+ "loss": 1.3518096208572388,
+ "mean_token_accuracy": 0.6801416873931885,
+ "num_tokens": 7520256.0,
+ "step": 459
+ },
+ {
+ "entropy": 1.7946380376815796,
+ "epoch": 0.9292929292929293,
+ "grad_norm": 2.3475260734558105,
+ "learning_rate": 4.072727272727273e-06,
+ "loss": 1.824514389038086,
+ "mean_token_accuracy": 0.6005740165710449,
+ "num_tokens": 7536640.0,
+ "step": 460
+ },
+ {
+ "entropy": 1.3695449829101562,
+ "epoch": 0.9313131313131313,
+ "grad_norm": 2.0983943939208984,
+ "learning_rate": 4.070707070707071e-06,
+ "loss": 1.3934273719787598,
+ "mean_token_accuracy": 0.6723253726959229,
+ "num_tokens": 7553024.0,
+ "step": 461
+ },
+ {
+ "entropy": 1.5890663862228394,
+ "epoch": 0.9333333333333333,
+ "grad_norm": 2.1465413570404053,
+ "learning_rate": 4.068686868686869e-06,
+ "loss": 1.611652135848999,
+ "mean_token_accuracy": 0.6408158540725708,
+ "num_tokens": 7569408.0,
+ "step": 462
+ },
+ {
+ "entropy": 1.2593727111816406,
+ "epoch": 0.9353535353535354,
+ "grad_norm": 1.7885241508483887,
+ "learning_rate": 4.066666666666667e-06,
+ "loss": 1.2781705856323242,
+ "mean_token_accuracy": 0.6946751475334167,
+ "num_tokens": 7585792.0,
+ "step": 463
+ },
+ {
+ "entropy": 1.5680429935455322,
+ "epoch": 0.9373737373737374,
+ "grad_norm": 2.1466636657714844,
+ "learning_rate": 4.064646464646465e-06,
+ "loss": 1.60218346118927,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 7602176.0,
+ "step": 464
+ },
+ {
+ "entropy": 1.681670069694519,
+ "epoch": 0.9393939393939394,
+ "grad_norm": 2.2211875915527344,
+ "learning_rate": 4.062626262626263e-06,
+ "loss": 1.6819908618927002,
+ "mean_token_accuracy": 0.6177943348884583,
+ "num_tokens": 7618560.0,
+ "step": 465
+ },
+ {
+ "entropy": 1.2239924669265747,
+ "epoch": 0.9414141414141414,
+ "grad_norm": 1.9997022151947021,
+ "learning_rate": 4.060606060606061e-06,
+ "loss": 1.2383348941802979,
+ "mean_token_accuracy": 0.6922325491905212,
+ "num_tokens": 7634944.0,
+ "step": 466
+ },
+ {
+ "entropy": 1.291772723197937,
+ "epoch": 0.9434343434343434,
+ "grad_norm": 2.0868117809295654,
+ "learning_rate": 4.058585858585859e-06,
+ "loss": 1.2879221439361572,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 7651328.0,
+ "step": 467
+ },
+ {
+ "entropy": 1.2860186100006104,
+ "epoch": 0.9454545454545454,
+ "grad_norm": 1.8586393594741821,
+ "learning_rate": 4.056565656565657e-06,
+ "loss": 1.2820203304290771,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 7667712.0,
+ "step": 468
+ },
+ {
+ "entropy": 1.860795259475708,
+ "epoch": 0.9474747474747475,
+ "grad_norm": 2.364405393600464,
+ "learning_rate": 4.054545454545455e-06,
+ "loss": 1.8880727291107178,
+ "mean_token_accuracy": 0.5821323990821838,
+ "num_tokens": 7684096.0,
+ "step": 469
+ },
+ {
+ "entropy": 1.6017589569091797,
+ "epoch": 0.9494949494949495,
+ "grad_norm": 2.023054599761963,
+ "learning_rate": 4.052525252525253e-06,
+ "loss": 1.5993852615356445,
+ "mean_token_accuracy": 0.6366634368896484,
+ "num_tokens": 7700480.0,
+ "step": 470
+ },
+ {
+ "entropy": 1.8498003482818604,
+ "epoch": 0.9515151515151515,
+ "grad_norm": 2.4474003314971924,
+ "learning_rate": 4.050505050505051e-06,
+ "loss": 1.868700623512268,
+ "mean_token_accuracy": 0.5826209187507629,
+ "num_tokens": 7716864.0,
+ "step": 471
+ },
+ {
+ "entropy": 1.5625540018081665,
+ "epoch": 0.9535353535353536,
+ "grad_norm": 2.1018362045288086,
+ "learning_rate": 4.048484848484849e-06,
+ "loss": 1.571077585220337,
+ "mean_token_accuracy": 0.6433805823326111,
+ "num_tokens": 7733248.0,
+ "step": 472
+ },
+ {
+ "entropy": 1.8534579277038574,
+ "epoch": 0.9555555555555556,
+ "grad_norm": 2.407588243484497,
+ "learning_rate": 4.046464646464647e-06,
+ "loss": 1.8789153099060059,
+ "mean_token_accuracy": 0.5859794616699219,
+ "num_tokens": 7749632.0,
+ "step": 473
+ },
+ {
+ "entropy": 1.3264559507369995,
+ "epoch": 0.9575757575757575,
+ "grad_norm": 2.007199764251709,
+ "learning_rate": 4.044444444444445e-06,
+ "loss": 1.3489338159561157,
+ "mean_token_accuracy": 0.6650586128234863,
+ "num_tokens": 7766016.0,
+ "step": 474
+ },
+ {
+ "entropy": 1.1361761093139648,
+ "epoch": 0.9595959595959596,
+ "grad_norm": 1.9226998090744019,
+ "learning_rate": 4.0424242424242425e-06,
+ "loss": 1.156738519668579,
+ "mean_token_accuracy": 0.7226428985595703,
+ "num_tokens": 7782400.0,
+ "step": 475
+ },
+ {
+ "entropy": 1.550872802734375,
+ "epoch": 0.9616161616161616,
+ "grad_norm": 2.0082473754882812,
+ "learning_rate": 4.04040404040404e-06,
+ "loss": 1.5657379627227783,
+ "mean_token_accuracy": 0.642953097820282,
+ "num_tokens": 7798784.0,
+ "step": 476
+ },
+ {
+ "entropy": 1.0122721195220947,
+ "epoch": 0.9636363636363636,
+ "grad_norm": 1.9946776628494263,
+ "learning_rate": 4.038383838383838e-06,
+ "loss": 1.0301119089126587,
+ "mean_token_accuracy": 0.7361993193626404,
+ "num_tokens": 7815168.0,
+ "step": 477
+ },
+ {
+ "entropy": 1.61614990234375,
+ "epoch": 0.9656565656565657,
+ "grad_norm": 2.5009427070617676,
+ "learning_rate": 4.036363636363637e-06,
+ "loss": 1.6194994449615479,
+ "mean_token_accuracy": 0.620175838470459,
+ "num_tokens": 7831552.0,
+ "step": 478
+ },
+ {
+ "entropy": 1.5723443031311035,
+ "epoch": 0.9676767676767677,
+ "grad_norm": 1.9101917743682861,
+ "learning_rate": 4.034343434343435e-06,
+ "loss": 1.5586073398590088,
+ "mean_token_accuracy": 0.6223741769790649,
+ "num_tokens": 7847936.0,
+ "step": 479
+ },
+ {
+ "entropy": 1.271834373474121,
+ "epoch": 0.9696969696969697,
+ "grad_norm": 1.768438458442688,
+ "learning_rate": 4.032323232323233e-06,
+ "loss": 1.2466087341308594,
+ "mean_token_accuracy": 0.692354679107666,
+ "num_tokens": 7864320.0,
+ "step": 480
+ },
+ {
+ "entropy": 1.4550020694732666,
+ "epoch": 0.9717171717171718,
+ "grad_norm": 1.9753917455673218,
+ "learning_rate": 4.030303030303031e-06,
+ "loss": 1.4689980745315552,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 7880704.0,
+ "step": 481
+ },
+ {
+ "entropy": 2.023750066757202,
+ "epoch": 0.9737373737373738,
+ "grad_norm": 2.3014674186706543,
+ "learning_rate": 4.0282828282828285e-06,
+ "loss": 2.0601019859313965,
+ "mean_token_accuracy": 0.5528212189674377,
+ "num_tokens": 7897088.0,
+ "step": 482
+ },
+ {
+ "entropy": 1.3225218057632446,
+ "epoch": 0.9757575757575757,
+ "grad_norm": 1.9937688112258911,
+ "learning_rate": 4.0262626262626264e-06,
+ "loss": 1.3186583518981934,
+ "mean_token_accuracy": 0.6751343607902527,
+ "num_tokens": 7913472.0,
+ "step": 483
+ },
+ {
+ "entropy": 1.4357911348342896,
+ "epoch": 0.9777777777777777,
+ "grad_norm": 1.9591492414474487,
+ "learning_rate": 4.024242424242424e-06,
+ "loss": 1.4157384634017944,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 7929856.0,
+ "step": 484
+ },
+ {
+ "entropy": 1.470274567604065,
+ "epoch": 0.9797979797979798,
+ "grad_norm": 1.9318779706954956,
+ "learning_rate": 4.022222222222222e-06,
+ "loss": 1.4754853248596191,
+ "mean_token_accuracy": 0.6497923731803894,
+ "num_tokens": 7946240.0,
+ "step": 485
+ },
+ {
+ "entropy": 1.345750331878662,
+ "epoch": 0.9818181818181818,
+ "grad_norm": 1.9079619646072388,
+ "learning_rate": 4.02020202020202e-06,
+ "loss": 1.336526870727539,
+ "mean_token_accuracy": 0.6800805926322937,
+ "num_tokens": 7962624.0,
+ "step": 486
+ },
+ {
+ "entropy": 1.4641839265823364,
+ "epoch": 0.9838383838383838,
+ "grad_norm": 1.8413265943527222,
+ "learning_rate": 4.018181818181818e-06,
+ "loss": 1.4556326866149902,
+ "mean_token_accuracy": 0.6591963768005371,
+ "num_tokens": 7979008.0,
+ "step": 487
+ },
+ {
+ "entropy": 1.7966911792755127,
+ "epoch": 0.9858585858585859,
+ "grad_norm": 2.138899564743042,
+ "learning_rate": 4.016161616161616e-06,
+ "loss": 1.822898507118225,
+ "mean_token_accuracy": 0.5959941148757935,
+ "num_tokens": 7995392.0,
+ "step": 488
+ },
+ {
+ "entropy": 1.4334503412246704,
+ "epoch": 0.9878787878787879,
+ "grad_norm": 2.206122636795044,
+ "learning_rate": 4.014141414141415e-06,
+ "loss": 1.4127681255340576,
+ "mean_token_accuracy": 0.6609672904014587,
+ "num_tokens": 8011776.0,
+ "step": 489
+ },
+ {
+ "entropy": 1.684112548828125,
+ "epoch": 0.98989898989899,
+ "grad_norm": 2.0637400150299072,
+ "learning_rate": 4.0121212121212125e-06,
+ "loss": 1.6790317296981812,
+ "mean_token_accuracy": 0.6159012913703918,
+ "num_tokens": 8028160.0,
+ "step": 490
+ },
+ {
+ "entropy": 2.0716898441314697,
+ "epoch": 0.9919191919191919,
+ "grad_norm": 3.3912627696990967,
+ "learning_rate": 4.01010101010101e-06,
+ "loss": 2.0814826488494873,
+ "mean_token_accuracy": 0.5522105693817139,
+ "num_tokens": 8044544.0,
+ "step": 491
+ },
+ {
+ "entropy": 1.8764609098434448,
+ "epoch": 0.9939393939393939,
+ "grad_norm": 2.00569748878479,
+ "learning_rate": 4.008080808080808e-06,
+ "loss": 1.9150068759918213,
+ "mean_token_accuracy": 0.5823766589164734,
+ "num_tokens": 8060928.0,
+ "step": 492
+ },
+ {
+ "entropy": 1.630242943763733,
+ "epoch": 0.9959595959595959,
+ "grad_norm": 2.0648858547210693,
+ "learning_rate": 4.006060606060607e-06,
+ "loss": 1.6354784965515137,
+ "mean_token_accuracy": 0.621213972568512,
+ "num_tokens": 8077312.0,
+ "step": 493
+ },
+ {
+ "entropy": 1.7174078226089478,
+ "epoch": 0.997979797979798,
+ "grad_norm": 2.1376583576202393,
+ "learning_rate": 4.004040404040405e-06,
+ "loss": 1.7092773914337158,
+ "mean_token_accuracy": 0.6129701733589172,
+ "num_tokens": 8093696.0,
+ "step": 494
+ },
+ {
+ "entropy": 1.2112717628479004,
+ "epoch": 1.0,
+ "grad_norm": 1.9164371490478516,
+ "learning_rate": 4.002020202020203e-06,
+ "loss": 1.2106354236602783,
+ "mean_token_accuracy": 0.7040180563926697,
+ "num_tokens": 8110080.0,
+ "step": 495
+ },
+ {
+ "entropy": 1.2168891429901123,
+ "epoch": 1.002020202020202,
+ "grad_norm": 1.9845075607299805,
+ "learning_rate": 4.000000000000001e-06,
+ "loss": 1.1398870944976807,
+ "mean_token_accuracy": 0.7053004503250122,
+ "num_tokens": 8126464.0,
+ "step": 496
+ },
+ {
+ "entropy": 1.4670923948287964,
+ "epoch": 1.004040404040404,
+ "grad_norm": 2.0864014625549316,
+ "learning_rate": 3.9979797979797986e-06,
+ "loss": 1.4241242408752441,
+ "mean_token_accuracy": 0.6605398058891296,
+ "num_tokens": 8142848.0,
+ "step": 497
+ },
+ {
+ "entropy": 1.560593843460083,
+ "epoch": 1.006060606060606,
+ "grad_norm": 1.8882137537002563,
+ "learning_rate": 3.9959595959595964e-06,
+ "loss": 1.5164835453033447,
+ "mean_token_accuracy": 0.6610894203186035,
+ "num_tokens": 8159232.0,
+ "step": 498
+ },
+ {
+ "entropy": 1.2573609352111816,
+ "epoch": 1.0080808080808081,
+ "grad_norm": 2.011486530303955,
+ "learning_rate": 3.993939393939394e-06,
+ "loss": 1.2119636535644531,
+ "mean_token_accuracy": 0.6832559704780579,
+ "num_tokens": 8175616.0,
+ "step": 499
+ },
+ {
+ "entropy": 1.6119122505187988,
+ "epoch": 1.0101010101010102,
+ "grad_norm": 2.0089032649993896,
+ "learning_rate": 3.991919191919192e-06,
+ "loss": 1.5869622230529785,
+ "mean_token_accuracy": 0.6301905512809753,
+ "num_tokens": 8192000.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.0101010101010102,
+ "eval_entropy": 1.4907484121860997,
+ "eval_loss": 1.5444872379302979,
+ "eval_mean_token_accuracy": 0.6426531960887294,
+ "eval_num_tokens": 8192000.0,
+ "eval_runtime": 43.729,
+ "eval_samples_per_second": 22.639,
+ "eval_steps_per_second": 2.836,
+ "step": 500
+ },
+ {
+ "entropy": 1.5645418167114258,
+ "epoch": 1.0121212121212122,
+ "grad_norm": 2.171133279800415,
+ "learning_rate": 3.98989898989899e-06,
+ "loss": 1.5252666473388672,
+ "mean_token_accuracy": 0.639594554901123,
+ "num_tokens": 8208384.0,
+ "step": 501
+ },
+ {
+ "entropy": 1.2985379695892334,
+ "epoch": 1.0141414141414142,
+ "grad_norm": 1.9075100421905518,
+ "learning_rate": 3.987878787878788e-06,
+ "loss": 1.2863168716430664,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 8224768.0,
+ "step": 502
+ },
+ {
+ "entropy": 1.4055086374282837,
+ "epoch": 1.0161616161616163,
+ "grad_norm": 1.8511557579040527,
+ "learning_rate": 3.985858585858587e-06,
+ "loss": 1.440205454826355,
+ "mean_token_accuracy": 0.6671348214149475,
+ "num_tokens": 8241152.0,
+ "step": 503
+ },
+ {
+ "entropy": 1.0818580389022827,
+ "epoch": 1.018181818181818,
+ "grad_norm": 1.8912067413330078,
+ "learning_rate": 3.983838383838385e-06,
+ "loss": 1.0614542961120605,
+ "mean_token_accuracy": 0.7345505356788635,
+ "num_tokens": 8257536.0,
+ "step": 504
+ },
+ {
+ "entropy": 0.9176992177963257,
+ "epoch": 1.02020202020202,
+ "grad_norm": 1.7737077474594116,
+ "learning_rate": 3.9818181818181825e-06,
+ "loss": 0.9281337261199951,
+ "mean_token_accuracy": 0.7594040036201477,
+ "num_tokens": 8273920.0,
+ "step": 505
+ },
+ {
+ "entropy": 1.8801840543746948,
+ "epoch": 1.0222222222222221,
+ "grad_norm": 2.191689968109131,
+ "learning_rate": 3.97979797979798e-06,
+ "loss": 1.9127342700958252,
+ "mean_token_accuracy": 0.5732169151306152,
+ "num_tokens": 8290304.0,
+ "step": 506
+ },
+ {
+ "entropy": 1.2336418628692627,
+ "epoch": 1.0242424242424242,
+ "grad_norm": 2.0369555950164795,
+ "learning_rate": 3.977777777777778e-06,
+ "loss": 1.2513363361358643,
+ "mean_token_accuracy": 0.6852100491523743,
+ "num_tokens": 8306688.0,
+ "step": 507
+ },
+ {
+ "entropy": 1.8379974365234375,
+ "epoch": 1.0262626262626262,
+ "grad_norm": 2.176361083984375,
+ "learning_rate": 3.975757575757576e-06,
+ "loss": 1.8472888469696045,
+ "mean_token_accuracy": 0.5863458514213562,
+ "num_tokens": 8323072.0,
+ "step": 508
+ },
+ {
+ "entropy": 1.4421337842941284,
+ "epoch": 1.0282828282828282,
+ "grad_norm": 2.305441379547119,
+ "learning_rate": 3.973737373737374e-06,
+ "loss": 1.4835591316223145,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 8339456.0,
+ "step": 509
+ },
+ {
+ "entropy": 1.535184621810913,
+ "epoch": 1.0303030303030303,
+ "grad_norm": 2.0329015254974365,
+ "learning_rate": 3.971717171717172e-06,
+ "loss": 1.547795057296753,
+ "mean_token_accuracy": 0.6268319487571716,
+ "num_tokens": 8355840.0,
+ "step": 510
+ },
+ {
+ "entropy": 1.295592188835144,
+ "epoch": 1.0323232323232323,
+ "grad_norm": 2.0321359634399414,
+ "learning_rate": 3.96969696969697e-06,
+ "loss": 1.2885974645614624,
+ "mean_token_accuracy": 0.681485116481781,
+ "num_tokens": 8372224.0,
+ "step": 511
+ },
+ {
+ "entropy": 1.345553994178772,
+ "epoch": 1.0343434343434343,
+ "grad_norm": 1.9151290655136108,
+ "learning_rate": 3.967676767676768e-06,
+ "loss": 1.3364320993423462,
+ "mean_token_accuracy": 0.6849657893180847,
+ "num_tokens": 8388608.0,
+ "step": 512
+ },
+ {
+ "entropy": 1.3150815963745117,
+ "epoch": 1.0363636363636364,
+ "grad_norm": 1.9379258155822754,
+ "learning_rate": 3.965656565656566e-06,
+ "loss": 1.317258596420288,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 8404992.0,
+ "step": 513
+ },
+ {
+ "entropy": 1.46832275390625,
+ "epoch": 1.0383838383838384,
+ "grad_norm": 2.1009161472320557,
+ "learning_rate": 3.963636363636364e-06,
+ "loss": 1.4794366359710693,
+ "mean_token_accuracy": 0.6513800621032715,
+ "num_tokens": 8421376.0,
+ "step": 514
+ },
+ {
+ "entropy": 1.389290452003479,
+ "epoch": 1.0404040404040404,
+ "grad_norm": 1.8813941478729248,
+ "learning_rate": 3.961616161616162e-06,
+ "loss": 1.3930776119232178,
+ "mean_token_accuracy": 0.6799584627151489,
+ "num_tokens": 8437760.0,
+ "step": 515
+ },
+ {
+ "entropy": 1.2919796705245972,
+ "epoch": 1.0424242424242425,
+ "grad_norm": 2.0765745639801025,
+ "learning_rate": 3.95959595959596e-06,
+ "loss": 1.2943801879882812,
+ "mean_token_accuracy": 0.6929653286933899,
+ "num_tokens": 8454144.0,
+ "step": 516
+ },
+ {
+ "entropy": 1.172440767288208,
+ "epoch": 1.0444444444444445,
+ "grad_norm": 2.126800298690796,
+ "learning_rate": 3.957575757575758e-06,
+ "loss": 1.1923961639404297,
+ "mean_token_accuracy": 0.7098192572593689,
+ "num_tokens": 8470528.0,
+ "step": 517
+ },
+ {
+ "entropy": 1.8239458799362183,
+ "epoch": 1.0464646464646465,
+ "grad_norm": 1.96744966506958,
+ "learning_rate": 3.955555555555556e-06,
+ "loss": 1.840916633605957,
+ "mean_token_accuracy": 0.6033830046653748,
+ "num_tokens": 8486912.0,
+ "step": 518
+ },
+ {
+ "entropy": 1.4117076396942139,
+ "epoch": 1.0484848484848486,
+ "grad_norm": 2.0560126304626465,
+ "learning_rate": 3.953535353535354e-06,
+ "loss": 1.421530842781067,
+ "mean_token_accuracy": 0.6581583023071289,
+ "num_tokens": 8503296.0,
+ "step": 519
+ },
+ {
+ "entropy": 1.7085175514221191,
+ "epoch": 1.0505050505050506,
+ "grad_norm": 2.1386539936065674,
+ "learning_rate": 3.951515151515152e-06,
+ "loss": 1.7334365844726562,
+ "mean_token_accuracy": 0.6282975077629089,
+ "num_tokens": 8519680.0,
+ "step": 520
+ },
+ {
+ "entropy": 1.0607928037643433,
+ "epoch": 1.0525252525252524,
+ "grad_norm": 1.981020212173462,
+ "learning_rate": 3.9494949494949496e-06,
+ "loss": 1.0639690160751343,
+ "mean_token_accuracy": 0.722337543964386,
+ "num_tokens": 8536064.0,
+ "step": 521
+ },
+ {
+ "entropy": 1.2227518558502197,
+ "epoch": 1.0545454545454545,
+ "grad_norm": 1.9116015434265137,
+ "learning_rate": 3.9474747474747474e-06,
+ "loss": 1.2139748334884644,
+ "mean_token_accuracy": 0.704384446144104,
+ "num_tokens": 8552448.0,
+ "step": 522
+ },
+ {
+ "entropy": 1.2655551433563232,
+ "epoch": 1.0565656565656565,
+ "grad_norm": 2.176706075668335,
+ "learning_rate": 3.945454545454545e-06,
+ "loss": 1.2869982719421387,
+ "mean_token_accuracy": 0.678798258304596,
+ "num_tokens": 8568832.0,
+ "step": 523
+ },
+ {
+ "entropy": 1.436476707458496,
+ "epoch": 1.0585858585858585,
+ "grad_norm": 2.034846544265747,
+ "learning_rate": 3.943434343434343e-06,
+ "loss": 1.431445837020874,
+ "mean_token_accuracy": 0.6650586128234863,
+ "num_tokens": 8585216.0,
+ "step": 524
+ },
+ {
+ "entropy": 1.4563549757003784,
+ "epoch": 1.0606060606060606,
+ "grad_norm": 2.0301241874694824,
+ "learning_rate": 3.941414141414142e-06,
+ "loss": 1.468353033065796,
+ "mean_token_accuracy": 0.6550439596176147,
+ "num_tokens": 8601600.0,
+ "step": 525
+ },
+ {
+ "entropy": 1.4636993408203125,
+ "epoch": 1.0626262626262626,
+ "grad_norm": 2.092679023742676,
+ "learning_rate": 3.93939393939394e-06,
+ "loss": 1.4488987922668457,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 8617984.0,
+ "step": 526
+ },
+ {
+ "entropy": 1.1217654943466187,
+ "epoch": 1.0646464646464646,
+ "grad_norm": 1.953627347946167,
+ "learning_rate": 3.937373737373738e-06,
+ "loss": 1.1403257846832275,
+ "mean_token_accuracy": 0.7172080874443054,
+ "num_tokens": 8634368.0,
+ "step": 527
+ },
+ {
+ "entropy": 1.7785910367965698,
+ "epoch": 1.0666666666666667,
+ "grad_norm": 1.8496789932250977,
+ "learning_rate": 3.935353535353536e-06,
+ "loss": 1.7961615324020386,
+ "mean_token_accuracy": 0.6036272644996643,
+ "num_tokens": 8650752.0,
+ "step": 528
+ },
+ {
+ "entropy": 1.0998575687408447,
+ "epoch": 1.0686868686868687,
+ "grad_norm": 1.8732962608337402,
+ "learning_rate": 3.9333333333333335e-06,
+ "loss": 1.0960031747817993,
+ "mean_token_accuracy": 0.7223986387252808,
+ "num_tokens": 8667136.0,
+ "step": 529
+ },
+ {
+ "entropy": 1.6707724332809448,
+ "epoch": 1.0707070707070707,
+ "grad_norm": 2.220453977584839,
+ "learning_rate": 3.931313131313131e-06,
+ "loss": 1.6837453842163086,
+ "mean_token_accuracy": 0.6148021221160889,
+ "num_tokens": 8683520.0,
+ "step": 530
+ },
+ {
+ "entropy": 1.6108022928237915,
+ "epoch": 1.0727272727272728,
+ "grad_norm": 2.2464118003845215,
+ "learning_rate": 3.929292929292929e-06,
+ "loss": 1.633517861366272,
+ "mean_token_accuracy": 0.6195651888847351,
+ "num_tokens": 8699904.0,
+ "step": 531
+ },
+ {
+ "entropy": 1.1888173818588257,
+ "epoch": 1.0747474747474748,
+ "grad_norm": 1.8803986310958862,
+ "learning_rate": 3.927272727272727e-06,
+ "loss": 1.1904420852661133,
+ "mean_token_accuracy": 0.7134220600128174,
+ "num_tokens": 8716288.0,
+ "step": 532
+ },
+ {
+ "entropy": 1.0656445026397705,
+ "epoch": 1.0767676767676768,
+ "grad_norm": 2.038243532180786,
+ "learning_rate": 3.925252525252525e-06,
+ "loss": 1.0505216121673584,
+ "mean_token_accuracy": 0.7284440398216248,
+ "num_tokens": 8732672.0,
+ "step": 533
+ },
+ {
+ "entropy": 1.1473655700683594,
+ "epoch": 1.0787878787878789,
+ "grad_norm": 1.981107234954834,
+ "learning_rate": 3.923232323232323e-06,
+ "loss": 1.136179804801941,
+ "mean_token_accuracy": 0.7085368633270264,
+ "num_tokens": 8749056.0,
+ "step": 534
+ },
+ {
+ "entropy": 1.340027928352356,
+ "epoch": 1.0808080808080809,
+ "grad_norm": 2.2797436714172363,
+ "learning_rate": 3.921212121212122e-06,
+ "loss": 1.334214210510254,
+ "mean_token_accuracy": 0.6749511361122131,
+ "num_tokens": 8765440.0,
+ "step": 535
+ },
+ {
+ "entropy": 1.1464864015579224,
+ "epoch": 1.082828282828283,
+ "grad_norm": 1.9428092241287231,
+ "learning_rate": 3.9191919191919196e-06,
+ "loss": 1.1649314165115356,
+ "mean_token_accuracy": 0.72013920545578,
+ "num_tokens": 8781824.0,
+ "step": 536
+ },
+ {
+ "entropy": 1.784925103187561,
+ "epoch": 1.084848484848485,
+ "grad_norm": 2.157468795776367,
+ "learning_rate": 3.9171717171717175e-06,
+ "loss": 1.7725508213043213,
+ "mean_token_accuracy": 0.6014899611473083,
+ "num_tokens": 8798208.0,
+ "step": 537
+ },
+ {
+ "entropy": 1.362166166305542,
+ "epoch": 1.0868686868686868,
+ "grad_norm": 2.109646797180176,
+ "learning_rate": 3.915151515151515e-06,
+ "loss": 1.331969976425171,
+ "mean_token_accuracy": 0.6720200181007385,
+ "num_tokens": 8814592.0,
+ "step": 538
+ },
+ {
+ "entropy": 1.5614176988601685,
+ "epoch": 1.0888888888888888,
+ "grad_norm": 2.1047098636627197,
+ "learning_rate": 3.913131313131314e-06,
+ "loss": 1.534292459487915,
+ "mean_token_accuracy": 0.6446629166603088,
+ "num_tokens": 8830976.0,
+ "step": 539
+ },
+ {
+ "entropy": 1.5551490783691406,
+ "epoch": 1.0909090909090908,
+ "grad_norm": 2.10304594039917,
+ "learning_rate": 3.911111111111112e-06,
+ "loss": 1.5706363916397095,
+ "mean_token_accuracy": 0.6322056651115417,
+ "num_tokens": 8847360.0,
+ "step": 540
+ },
+ {
+ "entropy": 1.7433172464370728,
+ "epoch": 1.0929292929292929,
+ "grad_norm": 1.8621257543563843,
+ "learning_rate": 3.90909090909091e-06,
+ "loss": 1.7367552518844604,
+ "mean_token_accuracy": 0.6162066459655762,
+ "num_tokens": 8863744.0,
+ "step": 541
+ },
+ {
+ "entropy": 1.4073128700256348,
+ "epoch": 1.094949494949495,
+ "grad_norm": 1.939588189125061,
+ "learning_rate": 3.907070707070708e-06,
+ "loss": 1.3844857215881348,
+ "mean_token_accuracy": 0.6634709239006042,
+ "num_tokens": 8880128.0,
+ "step": 542
+ },
+ {
+ "entropy": 1.479836344718933,
+ "epoch": 1.096969696969697,
+ "grad_norm": 2.06921648979187,
+ "learning_rate": 3.905050505050506e-06,
+ "loss": 1.4933744668960571,
+ "mean_token_accuracy": 0.6510136723518372,
+ "num_tokens": 8896512.0,
+ "step": 543
+ },
+ {
+ "entropy": 1.3934576511383057,
+ "epoch": 1.098989898989899,
+ "grad_norm": 2.0697920322418213,
+ "learning_rate": 3.9030303030303035e-06,
+ "loss": 1.3886666297912598,
+ "mean_token_accuracy": 0.6775158643722534,
+ "num_tokens": 8912896.0,
+ "step": 544
+ },
+ {
+ "entropy": 1.5223709344863892,
+ "epoch": 1.101010101010101,
+ "grad_norm": 2.1627066135406494,
+ "learning_rate": 3.901010101010101e-06,
+ "loss": 1.5601061582565308,
+ "mean_token_accuracy": 0.6392892003059387,
+ "num_tokens": 8929280.0,
+ "step": 545
+ },
+ {
+ "entropy": 1.4462933540344238,
+ "epoch": 1.103030303030303,
+ "grad_norm": 1.9871046543121338,
+ "learning_rate": 3.898989898989899e-06,
+ "loss": 1.463792085647583,
+ "mean_token_accuracy": 0.6518075466156006,
+ "num_tokens": 8945664.0,
+ "step": 546
+ },
+ {
+ "entropy": 1.325921654701233,
+ "epoch": 1.105050505050505,
+ "grad_norm": 1.9081087112426758,
+ "learning_rate": 3.896969696969697e-06,
+ "loss": 1.3303362131118774,
+ "mean_token_accuracy": 0.7009648084640503,
+ "num_tokens": 8962048.0,
+ "step": 547
+ },
+ {
+ "entropy": 1.415048360824585,
+ "epoch": 1.107070707070707,
+ "grad_norm": 2.3306756019592285,
+ "learning_rate": 3.894949494949495e-06,
+ "loss": 1.4139145612716675,
+ "mean_token_accuracy": 0.6849047541618347,
+ "num_tokens": 8978432.0,
+ "step": 548
+ },
+ {
+ "entropy": 1.5863295793533325,
+ "epoch": 1.1090909090909091,
+ "grad_norm": 1.993159294128418,
+ "learning_rate": 3.892929292929293e-06,
+ "loss": 1.6010534763336182,
+ "mean_token_accuracy": 0.6424035429954529,
+ "num_tokens": 8994816.0,
+ "step": 549
+ },
+ {
+ "entropy": 1.5526721477508545,
+ "epoch": 1.1111111111111112,
+ "grad_norm": 2.0528876781463623,
+ "learning_rate": 3.890909090909092e-06,
+ "loss": 1.5465538501739502,
+ "mean_token_accuracy": 0.659807026386261,
+ "num_tokens": 9011200.0,
+ "step": 550
+ },
+ {
+ "epoch": 1.1111111111111112,
+ "eval_entropy": 1.4479231247978825,
+ "eval_loss": 1.5459802150726318,
+ "eval_mean_token_accuracy": 0.6425906530311031,
+ "eval_num_tokens": 9011200.0,
+ "eval_runtime": 43.7828,
+ "eval_samples_per_second": 22.612,
+ "eval_steps_per_second": 2.832,
+ "step": 550
+ },
+ {
+ "entropy": 1.4322376251220703,
+ "epoch": 1.1131313131313132,
+ "grad_norm": 1.933549404144287,
+ "learning_rate": 3.88888888888889e-06,
+ "loss": 1.4371025562286377,
+ "mean_token_accuracy": 0.670676589012146,
+ "num_tokens": 9027584.0,
+ "step": 551
+ },
+ {
+ "entropy": 1.5050671100616455,
+ "epoch": 1.1151515151515152,
+ "grad_norm": 1.9736099243164062,
+ "learning_rate": 3.8868686868686875e-06,
+ "loss": 1.5362370014190674,
+ "mean_token_accuracy": 0.651624321937561,
+ "num_tokens": 9043968.0,
+ "step": 552
+ },
+ {
+ "entropy": 1.4335887432098389,
+ "epoch": 1.1171717171717173,
+ "grad_norm": 1.8896421194076538,
+ "learning_rate": 3.884848484848485e-06,
+ "loss": 1.4439888000488281,
+ "mean_token_accuracy": 0.670615553855896,
+ "num_tokens": 9060352.0,
+ "step": 553
+ },
+ {
+ "entropy": 1.5979355573654175,
+ "epoch": 1.1191919191919193,
+ "grad_norm": 2.1710526943206787,
+ "learning_rate": 3.882828282828283e-06,
+ "loss": 1.629098653793335,
+ "mean_token_accuracy": 0.6226184368133545,
+ "num_tokens": 9076736.0,
+ "step": 554
+ },
+ {
+ "entropy": 1.2901698350906372,
+ "epoch": 1.121212121212121,
+ "grad_norm": 2.129443407058716,
+ "learning_rate": 3.880808080808081e-06,
+ "loss": 1.2824913263320923,
+ "mean_token_accuracy": 0.6816682815551758,
+ "num_tokens": 9093120.0,
+ "step": 555
+ },
+ {
+ "entropy": 1.403212308883667,
+ "epoch": 1.1232323232323231,
+ "grad_norm": 1.883240818977356,
+ "learning_rate": 3.878787878787879e-06,
+ "loss": 1.3960213661193848,
+ "mean_token_accuracy": 0.6651197075843811,
+ "num_tokens": 9109504.0,
+ "step": 556
+ },
+ {
+ "entropy": 1.3959479331970215,
+ "epoch": 1.1252525252525252,
+ "grad_norm": 2.1145691871643066,
+ "learning_rate": 3.876767676767677e-06,
+ "loss": 1.4046590328216553,
+ "mean_token_accuracy": 0.6607230305671692,
+ "num_tokens": 9125888.0,
+ "step": 557
+ },
+ {
+ "entropy": 1.0899873971939087,
+ "epoch": 1.1272727272727272,
+ "grad_norm": 1.8862192630767822,
+ "learning_rate": 3.874747474747475e-06,
+ "loss": 1.0965509414672852,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 9142272.0,
+ "step": 558
+ },
+ {
+ "entropy": 1.0380184650421143,
+ "epoch": 1.1292929292929292,
+ "grad_norm": 1.946702241897583,
+ "learning_rate": 3.872727272727273e-06,
+ "loss": 1.0539875030517578,
+ "mean_token_accuracy": 0.7423058152198792,
+ "num_tokens": 9158656.0,
+ "step": 559
+ },
+ {
+ "entropy": 1.1173628568649292,
+ "epoch": 1.1313131313131313,
+ "grad_norm": 2.002847909927368,
+ "learning_rate": 3.8707070707070706e-06,
+ "loss": 1.128816843032837,
+ "mean_token_accuracy": 0.7112848162651062,
+ "num_tokens": 9175040.0,
+ "step": 560
+ },
+ {
+ "entropy": 1.6536206007003784,
+ "epoch": 1.1333333333333333,
+ "grad_norm": 2.212761640548706,
+ "learning_rate": 3.868686868686869e-06,
+ "loss": 1.6286437511444092,
+ "mean_token_accuracy": 0.6277479529380798,
+ "num_tokens": 9191424.0,
+ "step": 561
+ },
+ {
+ "entropy": 1.7187970876693726,
+ "epoch": 1.1353535353535353,
+ "grad_norm": 2.207310199737549,
+ "learning_rate": 3.866666666666667e-06,
+ "loss": 1.7072829008102417,
+ "mean_token_accuracy": 0.6180996298789978,
+ "num_tokens": 9207808.0,
+ "step": 562
+ },
+ {
+ "entropy": 1.7057682275772095,
+ "epoch": 1.1373737373737374,
+ "grad_norm": 2.1582961082458496,
+ "learning_rate": 3.864646464646465e-06,
+ "loss": 1.7216498851776123,
+ "mean_token_accuracy": 0.6105886697769165,
+ "num_tokens": 9224192.0,
+ "step": 563
+ },
+ {
+ "entropy": 1.8016951084136963,
+ "epoch": 1.1393939393939394,
+ "grad_norm": 2.035249948501587,
+ "learning_rate": 3.862626262626263e-06,
+ "loss": 1.8101240396499634,
+ "mean_token_accuracy": 0.6199315786361694,
+ "num_tokens": 9240576.0,
+ "step": 564
+ },
+ {
+ "entropy": 1.094889760017395,
+ "epoch": 1.1414141414141414,
+ "grad_norm": 2.119861364364624,
+ "learning_rate": 3.860606060606061e-06,
+ "loss": 1.0990344285964966,
+ "mean_token_accuracy": 0.7071323990821838,
+ "num_tokens": 9256960.0,
+ "step": 565
+ },
+ {
+ "entropy": 1.537480115890503,
+ "epoch": 1.1434343434343435,
+ "grad_norm": 2.167386770248413,
+ "learning_rate": 3.858585858585859e-06,
+ "loss": 1.5262541770935059,
+ "mean_token_accuracy": 0.6343429684638977,
+ "num_tokens": 9273344.0,
+ "step": 566
+ },
+ {
+ "entropy": 1.2940728664398193,
+ "epoch": 1.1454545454545455,
+ "grad_norm": 1.941097617149353,
+ "learning_rate": 3.856565656565657e-06,
+ "loss": 1.3145123720169067,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 9289728.0,
+ "step": 567
+ },
+ {
+ "entropy": 1.3154000043869019,
+ "epoch": 1.1474747474747475,
+ "grad_norm": 2.088576078414917,
+ "learning_rate": 3.8545454545454545e-06,
+ "loss": 1.3154902458190918,
+ "mean_token_accuracy": 0.6703101992607117,
+ "num_tokens": 9306112.0,
+ "step": 568
+ },
+ {
+ "entropy": 1.3576427698135376,
+ "epoch": 1.1494949494949496,
+ "grad_norm": 1.9895246028900146,
+ "learning_rate": 3.852525252525252e-06,
+ "loss": 1.3295378684997559,
+ "mean_token_accuracy": 0.6762335300445557,
+ "num_tokens": 9322496.0,
+ "step": 569
+ },
+ {
+ "entropy": 1.6067878007888794,
+ "epoch": 1.1515151515151516,
+ "grad_norm": 2.021191358566284,
+ "learning_rate": 3.85050505050505e-06,
+ "loss": 1.6273870468139648,
+ "mean_token_accuracy": 0.6329995393753052,
+ "num_tokens": 9338880.0,
+ "step": 570
+ },
+ {
+ "entropy": 1.4831246137619019,
+ "epoch": 1.1535353535353536,
+ "grad_norm": 2.114612340927124,
+ "learning_rate": 3.848484848484848e-06,
+ "loss": 1.4925904273986816,
+ "mean_token_accuracy": 0.6566316485404968,
+ "num_tokens": 9355264.0,
+ "step": 571
+ },
+ {
+ "entropy": 1.4476258754730225,
+ "epoch": 1.1555555555555554,
+ "grad_norm": 2.3435230255126953,
+ "learning_rate": 3.846464646464647e-06,
+ "loss": 1.438629388809204,
+ "mean_token_accuracy": 0.656020998954773,
+ "num_tokens": 9371648.0,
+ "step": 572
+ },
+ {
+ "entropy": 1.7930315732955933,
+ "epoch": 1.1575757575757575,
+ "grad_norm": 2.1700010299682617,
+ "learning_rate": 3.844444444444445e-06,
+ "loss": 1.786928653717041,
+ "mean_token_accuracy": 0.6028333902359009,
+ "num_tokens": 9388032.0,
+ "step": 573
+ },
+ {
+ "entropy": 1.3800512552261353,
+ "epoch": 1.1595959595959595,
+ "grad_norm": 2.2036688327789307,
+ "learning_rate": 3.842424242424243e-06,
+ "loss": 1.3767224550247192,
+ "mean_token_accuracy": 0.6692110300064087,
+ "num_tokens": 9404416.0,
+ "step": 574
+ },
+ {
+ "entropy": 0.8562329411506653,
+ "epoch": 1.1616161616161615,
+ "grad_norm": 1.765388011932373,
+ "learning_rate": 3.840404040404041e-06,
+ "loss": 0.8366047143936157,
+ "mean_token_accuracy": 0.783707857131958,
+ "num_tokens": 9420800.0,
+ "step": 575
+ },
+ {
+ "entropy": 1.4267486333847046,
+ "epoch": 1.1636363636363636,
+ "grad_norm": 2.0768239498138428,
+ "learning_rate": 3.8383838383838385e-06,
+ "loss": 1.4165449142456055,
+ "mean_token_accuracy": 0.656020998954773,
+ "num_tokens": 9437184.0,
+ "step": 576
+ },
+ {
+ "entropy": 1.4123388528823853,
+ "epoch": 1.1656565656565656,
+ "grad_norm": 2.028716802597046,
+ "learning_rate": 3.836363636363636e-06,
+ "loss": 1.420403003692627,
+ "mean_token_accuracy": 0.6729360222816467,
+ "num_tokens": 9453568.0,
+ "step": 577
+ },
+ {
+ "entropy": 1.1549286842346191,
+ "epoch": 1.1676767676767676,
+ "grad_norm": 2.1142919063568115,
+ "learning_rate": 3.834343434343435e-06,
+ "loss": 1.1487064361572266,
+ "mean_token_accuracy": 0.7040180563926697,
+ "num_tokens": 9469952.0,
+ "step": 578
+ },
+ {
+ "entropy": 1.4779953956604004,
+ "epoch": 1.1696969696969697,
+ "grad_norm": 2.166046142578125,
+ "learning_rate": 3.832323232323233e-06,
+ "loss": 1.4788683652877808,
+ "mean_token_accuracy": 0.6436858773231506,
+ "num_tokens": 9486336.0,
+ "step": 579
+ },
+ {
+ "entropy": 1.568039059638977,
+ "epoch": 1.1717171717171717,
+ "grad_norm": 2.067704200744629,
+ "learning_rate": 3.830303030303031e-06,
+ "loss": 1.5830929279327393,
+ "mean_token_accuracy": 0.6461895704269409,
+ "num_tokens": 9502720.0,
+ "step": 580
+ },
+ {
+ "entropy": 1.1785298585891724,
+ "epoch": 1.1737373737373737,
+ "grad_norm": 1.9789953231811523,
+ "learning_rate": 3.828282828282829e-06,
+ "loss": 1.2083481550216675,
+ "mean_token_accuracy": 0.7120786309242249,
+ "num_tokens": 9519104.0,
+ "step": 581
+ },
+ {
+ "entropy": 1.3783847093582153,
+ "epoch": 1.1757575757575758,
+ "grad_norm": 2.1503992080688477,
+ "learning_rate": 3.826262626262627e-06,
+ "loss": 1.3721052408218384,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 9535488.0,
+ "step": 582
+ },
+ {
+ "entropy": 1.120093584060669,
+ "epoch": 1.1777777777777778,
+ "grad_norm": 1.9822942018508911,
+ "learning_rate": 3.8242424242424245e-06,
+ "loss": 1.1215628385543823,
+ "mean_token_accuracy": 0.7122618556022644,
+ "num_tokens": 9551872.0,
+ "step": 583
+ },
+ {
+ "entropy": 1.4621506929397583,
+ "epoch": 1.1797979797979798,
+ "grad_norm": 2.159489631652832,
+ "learning_rate": 3.8222222222222224e-06,
+ "loss": 1.4614722728729248,
+ "mean_token_accuracy": 0.6535173654556274,
+ "num_tokens": 9568256.0,
+ "step": 584
+ },
+ {
+ "entropy": 1.015797734260559,
+ "epoch": 1.1818181818181819,
+ "grad_norm": 1.846848726272583,
+ "learning_rate": 3.82020202020202e-06,
+ "loss": 1.0082862377166748,
+ "mean_token_accuracy": 0.7394968271255493,
+ "num_tokens": 9584640.0,
+ "step": 585
+ },
+ {
+ "entropy": 1.364890217781067,
+ "epoch": 1.183838383838384,
+ "grad_norm": 2.175546646118164,
+ "learning_rate": 3.818181818181819e-06,
+ "loss": 1.3496818542480469,
+ "mean_token_accuracy": 0.6665241718292236,
+ "num_tokens": 9601024.0,
+ "step": 586
+ },
+ {
+ "entropy": 1.6056870222091675,
+ "epoch": 1.185858585858586,
+ "grad_norm": 2.1069748401641846,
+ "learning_rate": 3.816161616161617e-06,
+ "loss": 1.6048622131347656,
+ "mean_token_accuracy": 0.642892062664032,
+ "num_tokens": 9617408.0,
+ "step": 587
+ },
+ {
+ "entropy": 1.415107250213623,
+ "epoch": 1.187878787878788,
+ "grad_norm": 2.184544324874878,
+ "learning_rate": 3.8141414141414144e-06,
+ "loss": 1.4305826425552368,
+ "mean_token_accuracy": 0.6619443297386169,
+ "num_tokens": 9633792.0,
+ "step": 588
+ },
+ {
+ "entropy": 1.6554296016693115,
+ "epoch": 1.1898989898989898,
+ "grad_norm": 2.109793186187744,
+ "learning_rate": 3.8121212121212127e-06,
+ "loss": 1.6850776672363281,
+ "mean_token_accuracy": 0.6116267442703247,
+ "num_tokens": 9650176.0,
+ "step": 589
+ },
+ {
+ "entropy": 1.681472659111023,
+ "epoch": 1.1919191919191918,
+ "grad_norm": 2.3179714679718018,
+ "learning_rate": 3.8101010101010106e-06,
+ "loss": 1.699328064918518,
+ "mean_token_accuracy": 0.6105275750160217,
+ "num_tokens": 9666560.0,
+ "step": 590
+ },
+ {
+ "entropy": 1.113366961479187,
+ "epoch": 1.1939393939393939,
+ "grad_norm": 1.9885324239730835,
+ "learning_rate": 3.8080808080808085e-06,
+ "loss": 1.1357836723327637,
+ "mean_token_accuracy": 0.7157425284385681,
+ "num_tokens": 9682944.0,
+ "step": 591
+ },
+ {
+ "entropy": 1.1010088920593262,
+ "epoch": 1.195959595959596,
+ "grad_norm": 1.9745922088623047,
+ "learning_rate": 3.8060606060606064e-06,
+ "loss": 1.094293475151062,
+ "mean_token_accuracy": 0.7214215993881226,
+ "num_tokens": 9699328.0,
+ "step": 592
+ },
+ {
+ "entropy": 1.562911033630371,
+ "epoch": 1.197979797979798,
+ "grad_norm": 2.0526134967803955,
+ "learning_rate": 3.8040404040404043e-06,
+ "loss": 1.5747783184051514,
+ "mean_token_accuracy": 0.6342818737030029,
+ "num_tokens": 9715712.0,
+ "step": 593
+ },
+ {
+ "entropy": 1.6541608572006226,
+ "epoch": 1.2,
+ "grad_norm": 2.1268227100372314,
+ "learning_rate": 3.8020202020202026e-06,
+ "loss": 1.696983814239502,
+ "mean_token_accuracy": 0.6127259135246277,
+ "num_tokens": 9732096.0,
+ "step": 594
+ },
+ {
+ "entropy": 1.5259482860565186,
+ "epoch": 1.202020202020202,
+ "grad_norm": 2.240692377090454,
+ "learning_rate": 3.8000000000000005e-06,
+ "loss": 1.5582221746444702,
+ "mean_token_accuracy": 0.644052267074585,
+ "num_tokens": 9748480.0,
+ "step": 595
+ },
+ {
+ "entropy": 1.455372929573059,
+ "epoch": 1.204040404040404,
+ "grad_norm": 2.0934698581695557,
+ "learning_rate": 3.7979797979797984e-06,
+ "loss": 1.464172124862671,
+ "mean_token_accuracy": 0.6555935740470886,
+ "num_tokens": 9764864.0,
+ "step": 596
+ },
+ {
+ "entropy": 1.5074836015701294,
+ "epoch": 1.206060606060606,
+ "grad_norm": 1.9779568910598755,
+ "learning_rate": 3.7959595959595962e-06,
+ "loss": 1.5280466079711914,
+ "mean_token_accuracy": 0.6460063457489014,
+ "num_tokens": 9781248.0,
+ "step": 597
+ },
+ {
+ "entropy": 1.3286548852920532,
+ "epoch": 1.208080808080808,
+ "grad_norm": 1.9357717037200928,
+ "learning_rate": 3.793939393939394e-06,
+ "loss": 1.3448848724365234,
+ "mean_token_accuracy": 0.6816072463989258,
+ "num_tokens": 9797632.0,
+ "step": 598
+ },
+ {
+ "entropy": 1.5161375999450684,
+ "epoch": 1.2101010101010101,
+ "grad_norm": 2.224217414855957,
+ "learning_rate": 3.791919191919192e-06,
+ "loss": 1.5168235301971436,
+ "mean_token_accuracy": 0.6453346610069275,
+ "num_tokens": 9814016.0,
+ "step": 599
+ },
+ {
+ "entropy": 1.3337587118148804,
+ "epoch": 1.2121212121212122,
+ "grad_norm": 1.9308290481567383,
+ "learning_rate": 3.7898989898989903e-06,
+ "loss": 1.3429791927337646,
+ "mean_token_accuracy": 0.6827064156532288,
+ "num_tokens": 9830400.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.2121212121212122,
+ "eval_entropy": 1.4592116455877981,
+ "eval_loss": 1.5424447059631348,
+ "eval_mean_token_accuracy": 0.6431668299821115,
+ "eval_num_tokens": 9830400.0,
+ "eval_runtime": 43.8289,
+ "eval_samples_per_second": 22.588,
+ "eval_steps_per_second": 2.829,
+ "step": 600
+ },
+ {
+ "entropy": 1.6697322130203247,
+ "epoch": 1.2141414141414142,
+ "grad_norm": 1.9462894201278687,
+ "learning_rate": 3.7878787878787882e-06,
+ "loss": 1.6434354782104492,
+ "mean_token_accuracy": 0.635808527469635,
+ "num_tokens": 9846784.0,
+ "step": 601
+ },
+ {
+ "entropy": 1.427184820175171,
+ "epoch": 1.2161616161616162,
+ "grad_norm": 2.196017026901245,
+ "learning_rate": 3.785858585858586e-06,
+ "loss": 1.4024749994277954,
+ "mean_token_accuracy": 0.6720200181007385,
+ "num_tokens": 9863168.0,
+ "step": 602
+ },
+ {
+ "entropy": 1.4623222351074219,
+ "epoch": 1.2181818181818183,
+ "grad_norm": 2.160585403442383,
+ "learning_rate": 3.783838383838384e-06,
+ "loss": 1.4455416202545166,
+ "mean_token_accuracy": 0.6557767391204834,
+ "num_tokens": 9879552.0,
+ "step": 603
+ },
+ {
+ "entropy": 1.348331093788147,
+ "epoch": 1.2202020202020203,
+ "grad_norm": 2.079458713531494,
+ "learning_rate": 3.781818181818182e-06,
+ "loss": 1.3672473430633545,
+ "mean_token_accuracy": 0.6834391951560974,
+ "num_tokens": 9895936.0,
+ "step": 604
+ },
+ {
+ "entropy": 1.362277865409851,
+ "epoch": 1.2222222222222223,
+ "grad_norm": 2.10718035697937,
+ "learning_rate": 3.77979797979798e-06,
+ "loss": 1.3567216396331787,
+ "mean_token_accuracy": 0.6659135222434998,
+ "num_tokens": 9912320.0,
+ "step": 605
+ },
+ {
+ "entropy": 1.2743226289749146,
+ "epoch": 1.2242424242424241,
+ "grad_norm": 2.116549491882324,
+ "learning_rate": 3.777777777777778e-06,
+ "loss": 1.303470253944397,
+ "mean_token_accuracy": 0.6791035532951355,
+ "num_tokens": 9928704.0,
+ "step": 606
+ },
+ {
+ "entropy": 1.079649567604065,
+ "epoch": 1.2262626262626264,
+ "grad_norm": 1.8429855108261108,
+ "learning_rate": 3.775757575757576e-06,
+ "loss": 1.0616915225982666,
+ "mean_token_accuracy": 0.7321690320968628,
+ "num_tokens": 9945088.0,
+ "step": 607
+ },
+ {
+ "entropy": 1.363136649131775,
+ "epoch": 1.2282828282828282,
+ "grad_norm": 2.171295166015625,
+ "learning_rate": 3.773737373737374e-06,
+ "loss": 1.3525331020355225,
+ "mean_token_accuracy": 0.6732413172721863,
+ "num_tokens": 9961472.0,
+ "step": 608
+ },
+ {
+ "entropy": 1.324924349784851,
+ "epoch": 1.2303030303030302,
+ "grad_norm": 2.0872693061828613,
+ "learning_rate": 3.7717171717171717e-06,
+ "loss": 1.3282644748687744,
+ "mean_token_accuracy": 0.674462616443634,
+ "num_tokens": 9977856.0,
+ "step": 609
+ },
+ {
+ "entropy": 1.0672967433929443,
+ "epoch": 1.2323232323232323,
+ "grad_norm": 2.0819947719573975,
+ "learning_rate": 3.76969696969697e-06,
+ "loss": 1.0929367542266846,
+ "mean_token_accuracy": 0.715254008769989,
+ "num_tokens": 9994240.0,
+ "step": 610
+ },
+ {
+ "entropy": 1.4465869665145874,
+ "epoch": 1.2343434343434343,
+ "grad_norm": 2.1786868572235107,
+ "learning_rate": 3.767676767676768e-06,
+ "loss": 1.436307668685913,
+ "mean_token_accuracy": 0.6642037034034729,
+ "num_tokens": 10010624.0,
+ "step": 611
+ },
+ {
+ "entropy": 1.6424144506454468,
+ "epoch": 1.2363636363636363,
+ "grad_norm": 2.2582032680511475,
+ "learning_rate": 3.765656565656566e-06,
+ "loss": 1.6621832847595215,
+ "mean_token_accuracy": 0.6218246221542358,
+ "num_tokens": 10027008.0,
+ "step": 612
+ },
+ {
+ "entropy": 1.546712875366211,
+ "epoch": 1.2383838383838384,
+ "grad_norm": 2.1685879230499268,
+ "learning_rate": 3.7636363636363637e-06,
+ "loss": 1.5617464780807495,
+ "mean_token_accuracy": 0.6325110197067261,
+ "num_tokens": 10043392.0,
+ "step": 613
+ },
+ {
+ "entropy": 1.5758557319641113,
+ "epoch": 1.2404040404040404,
+ "grad_norm": 2.0911128520965576,
+ "learning_rate": 3.7616161616161616e-06,
+ "loss": 1.5830271244049072,
+ "mean_token_accuracy": 0.6349536180496216,
+ "num_tokens": 10059776.0,
+ "step": 614
+ },
+ {
+ "entropy": 1.5223995447158813,
+ "epoch": 1.2424242424242424,
+ "grad_norm": 2.0333359241485596,
+ "learning_rate": 3.7595959595959595e-06,
+ "loss": 1.5132982730865479,
+ "mean_token_accuracy": 0.6518075466156006,
+ "num_tokens": 10076160.0,
+ "step": 615
+ },
+ {
+ "entropy": 1.0950185060501099,
+ "epoch": 1.2444444444444445,
+ "grad_norm": 2.0048129558563232,
+ "learning_rate": 3.757575757575758e-06,
+ "loss": 1.0901896953582764,
+ "mean_token_accuracy": 0.723375678062439,
+ "num_tokens": 10092544.0,
+ "step": 616
+ },
+ {
+ "entropy": 1.340641736984253,
+ "epoch": 1.2464646464646465,
+ "grad_norm": 2.079256534576416,
+ "learning_rate": 3.7555555555555557e-06,
+ "loss": 1.3583415746688843,
+ "mean_token_accuracy": 0.671775758266449,
+ "num_tokens": 10108928.0,
+ "step": 617
+ },
+ {
+ "entropy": 1.1836222410202026,
+ "epoch": 1.2484848484848485,
+ "grad_norm": 1.9266347885131836,
+ "learning_rate": 3.7535353535353536e-06,
+ "loss": 1.171565294265747,
+ "mean_token_accuracy": 0.7046287059783936,
+ "num_tokens": 10125312.0,
+ "step": 618
+ },
+ {
+ "entropy": 1.6007641553878784,
+ "epoch": 1.2505050505050506,
+ "grad_norm": 2.25252103805542,
+ "learning_rate": 3.7515151515151515e-06,
+ "loss": 1.5955660343170166,
+ "mean_token_accuracy": 0.6306790709495544,
+ "num_tokens": 10141696.0,
+ "step": 619
+ },
+ {
+ "entropy": 1.8159959316253662,
+ "epoch": 1.2525252525252526,
+ "grad_norm": 2.255959987640381,
+ "learning_rate": 3.74949494949495e-06,
+ "loss": 1.8223116397857666,
+ "mean_token_accuracy": 0.5867122411727905,
+ "num_tokens": 10158080.0,
+ "step": 620
+ },
+ {
+ "entropy": 1.6469950675964355,
+ "epoch": 1.2545454545454544,
+ "grad_norm": 1.9183777570724487,
+ "learning_rate": 3.747474747474748e-06,
+ "loss": 1.6623587608337402,
+ "mean_token_accuracy": 0.6283586025238037,
+ "num_tokens": 10174464.0,
+ "step": 621
+ },
+ {
+ "entropy": 1.3507136106491089,
+ "epoch": 1.2565656565656567,
+ "grad_norm": 1.9393805265426636,
+ "learning_rate": 3.745454545454546e-06,
+ "loss": 1.3371413946151733,
+ "mean_token_accuracy": 0.6808744668960571,
+ "num_tokens": 10190848.0,
+ "step": 622
+ },
+ {
+ "entropy": 1.5176761150360107,
+ "epoch": 1.2585858585858585,
+ "grad_norm": 2.0721757411956787,
+ "learning_rate": 3.743434343434344e-06,
+ "loss": 1.5010406970977783,
+ "mean_token_accuracy": 0.6603566408157349,
+ "num_tokens": 10207232.0,
+ "step": 623
+ },
+ {
+ "entropy": 1.1409586668014526,
+ "epoch": 1.2606060606060607,
+ "grad_norm": 1.90805983543396,
+ "learning_rate": 3.7414141414141418e-06,
+ "loss": 1.1339551210403442,
+ "mean_token_accuracy": 0.7151318788528442,
+ "num_tokens": 10223616.0,
+ "step": 624
+ },
+ {
+ "entropy": 1.2258127927780151,
+ "epoch": 1.2626262626262625,
+ "grad_norm": 1.9276432991027832,
+ "learning_rate": 3.73939393939394e-06,
+ "loss": 1.2232249975204468,
+ "mean_token_accuracy": 0.7053614854812622,
+ "num_tokens": 10240000.0,
+ "step": 625
+ },
+ {
+ "entropy": 1.236358642578125,
+ "epoch": 1.2646464646464646,
+ "grad_norm": 2.0792832374572754,
+ "learning_rate": 3.737373737373738e-06,
+ "loss": 1.2570738792419434,
+ "mean_token_accuracy": 0.6869809627532959,
+ "num_tokens": 10256384.0,
+ "step": 626
+ },
+ {
+ "entropy": 1.0995185375213623,
+ "epoch": 1.2666666666666666,
+ "grad_norm": 2.035024881362915,
+ "learning_rate": 3.735353535353536e-06,
+ "loss": 1.10158109664917,
+ "mean_token_accuracy": 0.7248412370681763,
+ "num_tokens": 10272768.0,
+ "step": 627
+ },
+ {
+ "entropy": 1.8980706930160522,
+ "epoch": 1.2686868686868686,
+ "grad_norm": 2.040414333343506,
+ "learning_rate": 3.7333333333333337e-06,
+ "loss": 1.9260807037353516,
+ "mean_token_accuracy": 0.5953834652900696,
+ "num_tokens": 10289152.0,
+ "step": 628
+ },
+ {
+ "entropy": 1.4265168905258179,
+ "epoch": 1.2707070707070707,
+ "grad_norm": 2.418179750442505,
+ "learning_rate": 3.7313131313131316e-06,
+ "loss": 1.4415385723114014,
+ "mean_token_accuracy": 0.6535784006118774,
+ "num_tokens": 10305536.0,
+ "step": 629
+ },
+ {
+ "entropy": 1.217471957206726,
+ "epoch": 1.2727272727272727,
+ "grad_norm": 2.072441577911377,
+ "learning_rate": 3.72929292929293e-06,
+ "loss": 1.2361960411071777,
+ "mean_token_accuracy": 0.6947972774505615,
+ "num_tokens": 10321920.0,
+ "step": 630
+ },
+ {
+ "entropy": 1.0714137554168701,
+ "epoch": 1.2747474747474747,
+ "grad_norm": 3.0428647994995117,
+ "learning_rate": 3.727272727272728e-06,
+ "loss": 1.112711787223816,
+ "mean_token_accuracy": 0.7243527173995972,
+ "num_tokens": 10338304.0,
+ "step": 631
+ },
+ {
+ "entropy": 1.5873851776123047,
+ "epoch": 1.2767676767676768,
+ "grad_norm": 1.945098638534546,
+ "learning_rate": 3.7252525252525257e-06,
+ "loss": 1.595362663269043,
+ "mean_token_accuracy": 0.639594554901123,
+ "num_tokens": 10354688.0,
+ "step": 632
+ },
+ {
+ "entropy": 1.9688408374786377,
+ "epoch": 1.2787878787878788,
+ "grad_norm": 2.0450353622436523,
+ "learning_rate": 3.7232323232323236e-06,
+ "loss": 1.9989259243011475,
+ "mean_token_accuracy": 0.5685759782791138,
+ "num_tokens": 10371072.0,
+ "step": 633
+ },
+ {
+ "entropy": 1.2927459478378296,
+ "epoch": 1.2808080808080808,
+ "grad_norm": 1.959108591079712,
+ "learning_rate": 3.7212121212121215e-06,
+ "loss": 1.3025646209716797,
+ "mean_token_accuracy": 0.6853932738304138,
+ "num_tokens": 10387456.0,
+ "step": 634
+ },
+ {
+ "entropy": 1.6645994186401367,
+ "epoch": 1.2828282828282829,
+ "grad_norm": 2.041923999786377,
+ "learning_rate": 3.7191919191919194e-06,
+ "loss": 1.6959854364395142,
+ "mean_token_accuracy": 0.6319003701210022,
+ "num_tokens": 10403840.0,
+ "step": 635
+ },
+ {
+ "entropy": 1.401423692703247,
+ "epoch": 1.284848484848485,
+ "grad_norm": 2.040456533432007,
+ "learning_rate": 3.7171717171717177e-06,
+ "loss": 1.3859784603118896,
+ "mean_token_accuracy": 0.6740962266921997,
+ "num_tokens": 10420224.0,
+ "step": 636
+ },
+ {
+ "entropy": 1.0597256422042847,
+ "epoch": 1.286868686868687,
+ "grad_norm": 2.053690195083618,
+ "learning_rate": 3.7151515151515156e-06,
+ "loss": 1.052672266960144,
+ "mean_token_accuracy": 0.7290546894073486,
+ "num_tokens": 10436608.0,
+ "step": 637
+ },
+ {
+ "entropy": 1.280874252319336,
+ "epoch": 1.2888888888888888,
+ "grad_norm": 2.0566959381103516,
+ "learning_rate": 3.7131313131313135e-06,
+ "loss": 1.2883412837982178,
+ "mean_token_accuracy": 0.6822178959846497,
+ "num_tokens": 10452992.0,
+ "step": 638
+ },
+ {
+ "entropy": 1.299896240234375,
+ "epoch": 1.290909090909091,
+ "grad_norm": 1.8896070718765259,
+ "learning_rate": 3.7111111111111113e-06,
+ "loss": 1.3038103580474854,
+ "mean_token_accuracy": 0.6712872385978699,
+ "num_tokens": 10469376.0,
+ "step": 639
+ },
+ {
+ "entropy": 1.1713769435882568,
+ "epoch": 1.2929292929292928,
+ "grad_norm": 2.1309149265289307,
+ "learning_rate": 3.7090909090909092e-06,
+ "loss": 1.1899120807647705,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 10485760.0,
+ "step": 640
+ },
+ {
+ "entropy": 1.3056974411010742,
+ "epoch": 1.294949494949495,
+ "grad_norm": 1.9990391731262207,
+ "learning_rate": 3.7070707070707075e-06,
+ "loss": 1.3287105560302734,
+ "mean_token_accuracy": 0.6773326992988586,
+ "num_tokens": 10502144.0,
+ "step": 641
+ },
+ {
+ "entropy": 1.7352585792541504,
+ "epoch": 1.2969696969696969,
+ "grad_norm": 2.100043535232544,
+ "learning_rate": 3.7050505050505054e-06,
+ "loss": 1.7806944847106934,
+ "mean_token_accuracy": 0.60332190990448,
+ "num_tokens": 10518528.0,
+ "step": 642
+ },
+ {
+ "entropy": 1.3748377561569214,
+ "epoch": 1.298989898989899,
+ "grad_norm": 2.1280689239501953,
+ "learning_rate": 3.7030303030303033e-06,
+ "loss": 1.379891037940979,
+ "mean_token_accuracy": 0.6617611050605774,
+ "num_tokens": 10534912.0,
+ "step": 643
+ },
+ {
+ "entropy": 0.9991571307182312,
+ "epoch": 1.301010101010101,
+ "grad_norm": 1.7343134880065918,
+ "learning_rate": 3.701010101010101e-06,
+ "loss": 1.0082780122756958,
+ "mean_token_accuracy": 0.740229606628418,
+ "num_tokens": 10551296.0,
+ "step": 644
+ },
+ {
+ "entropy": 1.6313605308532715,
+ "epoch": 1.303030303030303,
+ "grad_norm": 2.216167449951172,
+ "learning_rate": 3.698989898989899e-06,
+ "loss": 1.6183781623840332,
+ "mean_token_accuracy": 0.6164509057998657,
+ "num_tokens": 10567680.0,
+ "step": 645
+ },
+ {
+ "entropy": 1.4174962043762207,
+ "epoch": 1.305050505050505,
+ "grad_norm": 2.0921854972839355,
+ "learning_rate": 3.6969696969696974e-06,
+ "loss": 1.4087945222854614,
+ "mean_token_accuracy": 0.6705544590950012,
+ "num_tokens": 10584064.0,
+ "step": 646
+ },
+ {
+ "entropy": 1.8302873373031616,
+ "epoch": 1.307070707070707,
+ "grad_norm": 2.0742204189300537,
+ "learning_rate": 3.6949494949494953e-06,
+ "loss": 1.8456642627716064,
+ "mean_token_accuracy": 0.5914142727851868,
+ "num_tokens": 10600448.0,
+ "step": 647
+ },
+ {
+ "entropy": 1.29628324508667,
+ "epoch": 1.309090909090909,
+ "grad_norm": 2.1446709632873535,
+ "learning_rate": 3.692929292929293e-06,
+ "loss": 1.3066375255584717,
+ "mean_token_accuracy": 0.6798363327980042,
+ "num_tokens": 10616832.0,
+ "step": 648
+ },
+ {
+ "entropy": 1.396378993988037,
+ "epoch": 1.3111111111111111,
+ "grad_norm": 1.9578899145126343,
+ "learning_rate": 3.690909090909091e-06,
+ "loss": 1.3943686485290527,
+ "mean_token_accuracy": 0.6772105693817139,
+ "num_tokens": 10633216.0,
+ "step": 649
+ },
+ {
+ "entropy": 1.6457722187042236,
+ "epoch": 1.3131313131313131,
+ "grad_norm": 1.9999926090240479,
+ "learning_rate": 3.688888888888889e-06,
+ "loss": 1.6266872882843018,
+ "mean_token_accuracy": 0.630923330783844,
+ "num_tokens": 10649600.0,
+ "step": 650
+ },
+ {
+ "epoch": 1.3131313131313131,
+ "eval_entropy": 1.456459879875183,
+ "eval_loss": 1.539737582206726,
+ "eval_mean_token_accuracy": 0.643713459853203,
+ "eval_num_tokens": 10649600.0,
+ "eval_runtime": 43.7637,
+ "eval_samples_per_second": 22.621,
+ "eval_steps_per_second": 2.833,
+ "step": 650
+ },
+ {
+ "entropy": 1.1152859926223755,
+ "epoch": 1.3151515151515152,
+ "grad_norm": 2.9232723712921143,
+ "learning_rate": 3.686868686868687e-06,
+ "loss": 1.099653959274292,
+ "mean_token_accuracy": 0.7227039337158203,
+ "num_tokens": 10665984.0,
+ "step": 651
+ },
+ {
+ "entropy": 1.6141386032104492,
+ "epoch": 1.3171717171717172,
+ "grad_norm": 2.1557929515838623,
+ "learning_rate": 3.684848484848485e-06,
+ "loss": 1.6156055927276611,
+ "mean_token_accuracy": 0.6288471221923828,
+ "num_tokens": 10682368.0,
+ "step": 652
+ },
+ {
+ "entropy": 1.282158374786377,
+ "epoch": 1.3191919191919192,
+ "grad_norm": 2.061983346939087,
+ "learning_rate": 3.682828282828283e-06,
+ "loss": 1.2867733240127563,
+ "mean_token_accuracy": 0.6869198679924011,
+ "num_tokens": 10698752.0,
+ "step": 653
+ },
+ {
+ "entropy": 0.9986366033554077,
+ "epoch": 1.3212121212121213,
+ "grad_norm": 2.0446274280548096,
+ "learning_rate": 3.680808080808081e-06,
+ "loss": 1.019629716873169,
+ "mean_token_accuracy": 0.7427943348884583,
+ "num_tokens": 10715136.0,
+ "step": 654
+ },
+ {
+ "entropy": 1.4256011247634888,
+ "epoch": 1.3232323232323233,
+ "grad_norm": 2.1024749279022217,
+ "learning_rate": 3.678787878787879e-06,
+ "loss": 1.4269766807556152,
+ "mean_token_accuracy": 0.6674401760101318,
+ "num_tokens": 10731520.0,
+ "step": 655
+ },
+ {
+ "entropy": 1.4913274049758911,
+ "epoch": 1.3252525252525253,
+ "grad_norm": 2.068432569503784,
+ "learning_rate": 3.6767676767676767e-06,
+ "loss": 1.4930779933929443,
+ "mean_token_accuracy": 0.6474719047546387,
+ "num_tokens": 10747904.0,
+ "step": 656
+ },
+ {
+ "entropy": 1.2957285642623901,
+ "epoch": 1.3272727272727272,
+ "grad_norm": 2.2480008602142334,
+ "learning_rate": 3.674747474747475e-06,
+ "loss": 1.3001320362091064,
+ "mean_token_accuracy": 0.679286777973175,
+ "num_tokens": 10764288.0,
+ "step": 657
+ },
+ {
+ "entropy": 1.328946828842163,
+ "epoch": 1.3292929292929294,
+ "grad_norm": 2.311176300048828,
+ "learning_rate": 3.672727272727273e-06,
+ "loss": 1.3286024332046509,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 10780672.0,
+ "step": 658
+ },
+ {
+ "entropy": 1.458139419555664,
+ "epoch": 1.3313131313131312,
+ "grad_norm": 2.1967899799346924,
+ "learning_rate": 3.670707070707071e-06,
+ "loss": 1.4384279251098633,
+ "mean_token_accuracy": 0.6435637474060059,
+ "num_tokens": 10797056.0,
+ "step": 659
+ },
+ {
+ "entropy": 1.43666672706604,
+ "epoch": 1.3333333333333333,
+ "grad_norm": 2.163083076477051,
+ "learning_rate": 3.6686868686868687e-06,
+ "loss": 1.4396371841430664,
+ "mean_token_accuracy": 0.6531509757041931,
+ "num_tokens": 10813440.0,
+ "step": 660
+ },
+ {
+ "entropy": 1.6210501194000244,
+ "epoch": 1.3353535353535353,
+ "grad_norm": 2.3601770401000977,
+ "learning_rate": 3.6666666666666666e-06,
+ "loss": 1.6370227336883545,
+ "mean_token_accuracy": 0.6149242520332336,
+ "num_tokens": 10829824.0,
+ "step": 661
+ },
+ {
+ "entropy": 0.9602832794189453,
+ "epoch": 1.3373737373737373,
+ "grad_norm": 1.8452314138412476,
+ "learning_rate": 3.664646464646465e-06,
+ "loss": 0.9445997476577759,
+ "mean_token_accuracy": 0.759709358215332,
+ "num_tokens": 10846208.0,
+ "step": 662
+ },
+ {
+ "entropy": 1.2215200662612915,
+ "epoch": 1.3393939393939394,
+ "grad_norm": 2.019989252090454,
+ "learning_rate": 3.662626262626263e-06,
+ "loss": 1.2451637983322144,
+ "mean_token_accuracy": 0.7051172256469727,
+ "num_tokens": 10862592.0,
+ "step": 663
+ },
+ {
+ "entropy": 1.3253310918807983,
+ "epoch": 1.3414141414141414,
+ "grad_norm": 1.9700425863265991,
+ "learning_rate": 3.660606060606061e-06,
+ "loss": 1.3407385349273682,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 10878976.0,
+ "step": 664
+ },
+ {
+ "entropy": 1.1397737264633179,
+ "epoch": 1.3434343434343434,
+ "grad_norm": 2.1194040775299072,
+ "learning_rate": 3.658585858585859e-06,
+ "loss": 1.1545679569244385,
+ "mean_token_accuracy": 0.7071323990821838,
+ "num_tokens": 10895360.0,
+ "step": 665
+ },
+ {
+ "entropy": 1.1714493036270142,
+ "epoch": 1.3454545454545455,
+ "grad_norm": 2.078051805496216,
+ "learning_rate": 3.6565656565656573e-06,
+ "loss": 1.1751537322998047,
+ "mean_token_accuracy": 0.6963238716125488,
+ "num_tokens": 10911744.0,
+ "step": 666
+ },
+ {
+ "entropy": 1.2954860925674438,
+ "epoch": 1.3474747474747475,
+ "grad_norm": 1.9348593950271606,
+ "learning_rate": 3.654545454545455e-06,
+ "loss": 1.2961801290512085,
+ "mean_token_accuracy": 0.6831338405609131,
+ "num_tokens": 10928128.0,
+ "step": 667
+ },
+ {
+ "entropy": 1.401628851890564,
+ "epoch": 1.3494949494949495,
+ "grad_norm": 2.1757614612579346,
+ "learning_rate": 3.652525252525253e-06,
+ "loss": 1.4025013446807861,
+ "mean_token_accuracy": 0.6590132117271423,
+ "num_tokens": 10944512.0,
+ "step": 668
+ },
+ {
+ "entropy": 1.4164557456970215,
+ "epoch": 1.3515151515151516,
+ "grad_norm": 2.0192055702209473,
+ "learning_rate": 3.650505050505051e-06,
+ "loss": 1.43379545211792,
+ "mean_token_accuracy": 0.6554714441299438,
+ "num_tokens": 10960896.0,
+ "step": 669
+ },
+ {
+ "entropy": 1.4888815879821777,
+ "epoch": 1.3535353535353536,
+ "grad_norm": 2.2166643142700195,
+ "learning_rate": 3.648484848484849e-06,
+ "loss": 1.494372844696045,
+ "mean_token_accuracy": 0.6402052044868469,
+ "num_tokens": 10977280.0,
+ "step": 670
+ },
+ {
+ "entropy": 1.215625286102295,
+ "epoch": 1.3555555555555556,
+ "grad_norm": 1.8059836626052856,
+ "learning_rate": 3.6464646464646467e-06,
+ "loss": 1.2074902057647705,
+ "mean_token_accuracy": 0.7123228907585144,
+ "num_tokens": 10993664.0,
+ "step": 671
+ },
+ {
+ "entropy": 0.9577685594558716,
+ "epoch": 1.3575757575757577,
+ "grad_norm": 1.8803631067276,
+ "learning_rate": 3.644444444444445e-06,
+ "loss": 0.956764817237854,
+ "mean_token_accuracy": 0.759709358215332,
+ "num_tokens": 11010048.0,
+ "step": 672
+ },
+ {
+ "entropy": 1.7215807437896729,
+ "epoch": 1.3595959595959597,
+ "grad_norm": 2.1421561241149902,
+ "learning_rate": 3.642424242424243e-06,
+ "loss": 1.7220706939697266,
+ "mean_token_accuracy": 0.6187102794647217,
+ "num_tokens": 11026432.0,
+ "step": 673
+ },
+ {
+ "entropy": 1.057277798652649,
+ "epoch": 1.3616161616161615,
+ "grad_norm": 1.9014254808425903,
+ "learning_rate": 3.640404040404041e-06,
+ "loss": 1.0582892894744873,
+ "mean_token_accuracy": 0.7327185869216919,
+ "num_tokens": 11042816.0,
+ "step": 674
+ },
+ {
+ "entropy": 1.220097541809082,
+ "epoch": 1.3636363636363638,
+ "grad_norm": 2.1406402587890625,
+ "learning_rate": 3.6383838383838387e-06,
+ "loss": 1.2152808904647827,
+ "mean_token_accuracy": 0.6976673007011414,
+ "num_tokens": 11059200.0,
+ "step": 675
+ },
+ {
+ "entropy": 1.4171489477157593,
+ "epoch": 1.3656565656565656,
+ "grad_norm": 2.1809890270233154,
+ "learning_rate": 3.6363636363636366e-06,
+ "loss": 1.4846035242080688,
+ "mean_token_accuracy": 0.6681118607521057,
+ "num_tokens": 11075584.0,
+ "step": 676
+ },
+ {
+ "entropy": 1.2915124893188477,
+ "epoch": 1.3676767676767676,
+ "grad_norm": 2.0533218383789062,
+ "learning_rate": 3.634343434343435e-06,
+ "loss": 1.3094089031219482,
+ "mean_token_accuracy": 0.6841719746589661,
+ "num_tokens": 11091968.0,
+ "step": 677
+ },
+ {
+ "entropy": 1.4717603921890259,
+ "epoch": 1.3696969696969696,
+ "grad_norm": 2.125450849533081,
+ "learning_rate": 3.6323232323232328e-06,
+ "loss": 1.479896903038025,
+ "mean_token_accuracy": 0.6601734161376953,
+ "num_tokens": 11108352.0,
+ "step": 678
+ },
+ {
+ "entropy": 1.0841981172561646,
+ "epoch": 1.3717171717171717,
+ "grad_norm": 1.936905026435852,
+ "learning_rate": 3.6303030303030307e-06,
+ "loss": 1.0895963907241821,
+ "mean_token_accuracy": 0.7307645082473755,
+ "num_tokens": 11124736.0,
+ "step": 679
+ },
+ {
+ "entropy": 0.85239177942276,
+ "epoch": 1.3737373737373737,
+ "grad_norm": 1.7117112874984741,
+ "learning_rate": 3.6282828282828286e-06,
+ "loss": 0.8716775178909302,
+ "mean_token_accuracy": 0.7721666097640991,
+ "num_tokens": 11141120.0,
+ "step": 680
+ },
+ {
+ "entropy": 1.4737738370895386,
+ "epoch": 1.3757575757575757,
+ "grad_norm": 2.0140671730041504,
+ "learning_rate": 3.6262626262626264e-06,
+ "loss": 1.5029723644256592,
+ "mean_token_accuracy": 0.653822660446167,
+ "num_tokens": 11157504.0,
+ "step": 681
+ },
+ {
+ "entropy": 1.260698914527893,
+ "epoch": 1.3777777777777778,
+ "grad_norm": 1.9868851900100708,
+ "learning_rate": 3.6242424242424248e-06,
+ "loss": 1.256290316581726,
+ "mean_token_accuracy": 0.6891182065010071,
+ "num_tokens": 11173888.0,
+ "step": 682
+ },
+ {
+ "entropy": 1.7418453693389893,
+ "epoch": 1.3797979797979798,
+ "grad_norm": 2.0905439853668213,
+ "learning_rate": 3.6222222222222226e-06,
+ "loss": 1.7568984031677246,
+ "mean_token_accuracy": 0.6291524171829224,
+ "num_tokens": 11190272.0,
+ "step": 683
+ },
+ {
+ "entropy": 1.5552523136138916,
+ "epoch": 1.3818181818181818,
+ "grad_norm": 2.2071683406829834,
+ "learning_rate": 3.6202020202020205e-06,
+ "loss": 1.555542230606079,
+ "mean_token_accuracy": 0.6403883695602417,
+ "num_tokens": 11206656.0,
+ "step": 684
+ },
+ {
+ "entropy": 1.4404902458190918,
+ "epoch": 1.3838383838383839,
+ "grad_norm": 2.276245594024658,
+ "learning_rate": 3.6181818181818184e-06,
+ "loss": 1.4155148267745972,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 11223040.0,
+ "step": 685
+ },
+ {
+ "entropy": 1.1282018423080444,
+ "epoch": 1.385858585858586,
+ "grad_norm": 1.9824057817459106,
+ "learning_rate": 3.6161616161616163e-06,
+ "loss": 1.099952220916748,
+ "mean_token_accuracy": 0.7234978079795837,
+ "num_tokens": 11239424.0,
+ "step": 686
+ },
+ {
+ "entropy": 1.5559885501861572,
+ "epoch": 1.387878787878788,
+ "grad_norm": 2.243121862411499,
+ "learning_rate": 3.614141414141414e-06,
+ "loss": 1.520850658416748,
+ "mean_token_accuracy": 0.6340987086296082,
+ "num_tokens": 11255808.0,
+ "step": 687
+ },
+ {
+ "entropy": 1.322407841682434,
+ "epoch": 1.38989898989899,
+ "grad_norm": 2.049233913421631,
+ "learning_rate": 3.6121212121212125e-06,
+ "loss": 1.322263479232788,
+ "mean_token_accuracy": 0.6778212189674377,
+ "num_tokens": 11272192.0,
+ "step": 688
+ },
+ {
+ "entropy": 1.3112859725952148,
+ "epoch": 1.391919191919192,
+ "grad_norm": 2.0666465759277344,
+ "learning_rate": 3.6101010101010104e-06,
+ "loss": 1.3103243112564087,
+ "mean_token_accuracy": 0.6828285455703735,
+ "num_tokens": 11288576.0,
+ "step": 689
+ },
+ {
+ "entropy": 1.3321104049682617,
+ "epoch": 1.393939393939394,
+ "grad_norm": 2.5464279651641846,
+ "learning_rate": 3.6080808080808083e-06,
+ "loss": 1.3247697353363037,
+ "mean_token_accuracy": 0.6785539984703064,
+ "num_tokens": 11304960.0,
+ "step": 690
+ },
+ {
+ "entropy": 1.0779680013656616,
+ "epoch": 1.3959595959595958,
+ "grad_norm": 2.1386117935180664,
+ "learning_rate": 3.606060606060606e-06,
+ "loss": 1.0994013547897339,
+ "mean_token_accuracy": 0.7129946351051331,
+ "num_tokens": 11321344.0,
+ "step": 691
+ },
+ {
+ "entropy": 1.0701864957809448,
+ "epoch": 1.397979797979798,
+ "grad_norm": 1.9387527704238892,
+ "learning_rate": 3.604040404040404e-06,
+ "loss": 1.0633184909820557,
+ "mean_token_accuracy": 0.7378480434417725,
+ "num_tokens": 11337728.0,
+ "step": 692
+ },
+ {
+ "entropy": 1.2258752584457397,
+ "epoch": 1.4,
+ "grad_norm": 2.0486111640930176,
+ "learning_rate": 3.6020202020202024e-06,
+ "loss": 1.2098207473754883,
+ "mean_token_accuracy": 0.6999877691268921,
+ "num_tokens": 11354112.0,
+ "step": 693
+ },
+ {
+ "entropy": 1.4652774333953857,
+ "epoch": 1.402020202020202,
+ "grad_norm": 2.043079376220703,
+ "learning_rate": 3.6000000000000003e-06,
+ "loss": 1.4780974388122559,
+ "mean_token_accuracy": 0.6681729555130005,
+ "num_tokens": 11370496.0,
+ "step": 694
+ },
+ {
+ "entropy": 1.3215711116790771,
+ "epoch": 1.404040404040404,
+ "grad_norm": 2.1327438354492188,
+ "learning_rate": 3.597979797979798e-06,
+ "loss": 1.3116662502288818,
+ "mean_token_accuracy": 0.6757450103759766,
+ "num_tokens": 11386880.0,
+ "step": 695
+ },
+ {
+ "entropy": 1.624266266822815,
+ "epoch": 1.406060606060606,
+ "grad_norm": 2.114398717880249,
+ "learning_rate": 3.595959595959596e-06,
+ "loss": 1.628610372543335,
+ "mean_token_accuracy": 0.6487542986869812,
+ "num_tokens": 11403264.0,
+ "step": 696
+ },
+ {
+ "entropy": 1.6059489250183105,
+ "epoch": 1.408080808080808,
+ "grad_norm": 1.952991008758545,
+ "learning_rate": 3.593939393939394e-06,
+ "loss": 1.6145906448364258,
+ "mean_token_accuracy": 0.6257938742637634,
+ "num_tokens": 11419648.0,
+ "step": 697
+ },
+ {
+ "entropy": 1.0662391185760498,
+ "epoch": 1.41010101010101,
+ "grad_norm": 2.0804851055145264,
+ "learning_rate": 3.5919191919191922e-06,
+ "loss": 1.0772000551223755,
+ "mean_token_accuracy": 0.7187347412109375,
+ "num_tokens": 11436032.0,
+ "step": 698
+ },
+ {
+ "entropy": 1.221283197402954,
+ "epoch": 1.412121212121212,
+ "grad_norm": 1.9502744674682617,
+ "learning_rate": 3.58989898989899e-06,
+ "loss": 1.2352337837219238,
+ "mean_token_accuracy": 0.6918050646781921,
+ "num_tokens": 11452416.0,
+ "step": 699
+ },
+ {
+ "entropy": 1.4205158948898315,
+ "epoch": 1.4141414141414141,
+ "grad_norm": 2.2222518920898438,
+ "learning_rate": 3.587878787878788e-06,
+ "loss": 1.451093077659607,
+ "mean_token_accuracy": 0.6648754477500916,
+ "num_tokens": 11468800.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.4141414141414141,
+ "eval_entropy": 1.4370074204860195,
+ "eval_loss": 1.5383458137512207,
+ "eval_mean_token_accuracy": 0.6441497793120723,
+ "eval_num_tokens": 11468800.0,
+ "eval_runtime": 43.744,
+ "eval_samples_per_second": 22.632,
+ "eval_steps_per_second": 2.835,
+ "step": 700
+ },
+ {
+ "entropy": 1.5432499647140503,
+ "epoch": 1.4161616161616162,
+ "grad_norm": 2.084463596343994,
+ "learning_rate": 3.585858585858586e-06,
+ "loss": 1.5958356857299805,
+ "mean_token_accuracy": 0.6377015113830566,
+ "num_tokens": 11485184.0,
+ "step": 701
+ },
+ {
+ "entropy": 1.297119379043579,
+ "epoch": 1.4181818181818182,
+ "grad_norm": 2.1996524333953857,
+ "learning_rate": 3.5838383838383838e-06,
+ "loss": 1.3346054553985596,
+ "mean_token_accuracy": 0.6801416873931885,
+ "num_tokens": 11501568.0,
+ "step": 702
+ },
+ {
+ "entropy": 1.3905766010284424,
+ "epoch": 1.4202020202020202,
+ "grad_norm": 2.1683545112609863,
+ "learning_rate": 3.5818181818181817e-06,
+ "loss": 1.40826416015625,
+ "mean_token_accuracy": 0.6653639674186707,
+ "num_tokens": 11517952.0,
+ "step": 703
+ },
+ {
+ "entropy": 0.9598695635795593,
+ "epoch": 1.4222222222222223,
+ "grad_norm": 1.9240537881851196,
+ "learning_rate": 3.57979797979798e-06,
+ "loss": 0.9487459659576416,
+ "mean_token_accuracy": 0.7556179761886597,
+ "num_tokens": 11534336.0,
+ "step": 704
+ },
+ {
+ "entropy": 1.2008687257766724,
+ "epoch": 1.4242424242424243,
+ "grad_norm": 1.9687083959579468,
+ "learning_rate": 3.577777777777778e-06,
+ "loss": 1.2234617471694946,
+ "mean_token_accuracy": 0.6982779502868652,
+ "num_tokens": 11550720.0,
+ "step": 705
+ },
+ {
+ "entropy": 1.1168856620788574,
+ "epoch": 1.4262626262626263,
+ "grad_norm": 2.1796388626098633,
+ "learning_rate": 3.575757575757576e-06,
+ "loss": 1.1320589780807495,
+ "mean_token_accuracy": 0.7057889699935913,
+ "num_tokens": 11567104.0,
+ "step": 706
+ },
+ {
+ "entropy": 1.3408682346343994,
+ "epoch": 1.4282828282828284,
+ "grad_norm": 1.9048689603805542,
+ "learning_rate": 3.573737373737374e-06,
+ "loss": 1.3476686477661133,
+ "mean_token_accuracy": 0.6839887499809265,
+ "num_tokens": 11583488.0,
+ "step": 707
+ },
+ {
+ "entropy": 1.4392427206039429,
+ "epoch": 1.4303030303030302,
+ "grad_norm": 2.183016777038574,
+ "learning_rate": 3.5717171717171724e-06,
+ "loss": 1.4443378448486328,
+ "mean_token_accuracy": 0.6546775698661804,
+ "num_tokens": 11599872.0,
+ "step": 708
+ },
+ {
+ "entropy": 1.1428641080856323,
+ "epoch": 1.4323232323232324,
+ "grad_norm": 2.0477187633514404,
+ "learning_rate": 3.5696969696969703e-06,
+ "loss": 1.1438124179840088,
+ "mean_token_accuracy": 0.7126282453536987,
+ "num_tokens": 11616256.0,
+ "step": 709
+ },
+ {
+ "entropy": 1.6266967058181763,
+ "epoch": 1.4343434343434343,
+ "grad_norm": 2.322098731994629,
+ "learning_rate": 3.567676767676768e-06,
+ "loss": 1.6161916255950928,
+ "mean_token_accuracy": 0.6202979683876038,
+ "num_tokens": 11632640.0,
+ "step": 710
+ },
+ {
+ "entropy": 1.349686622619629,
+ "epoch": 1.4363636363636363,
+ "grad_norm": 2.021871328353882,
+ "learning_rate": 3.565656565656566e-06,
+ "loss": 1.3713490962982178,
+ "mean_token_accuracy": 0.6596238613128662,
+ "num_tokens": 11649024.0,
+ "step": 711
+ },
+ {
+ "entropy": 1.4476866722106934,
+ "epoch": 1.4383838383838383,
+ "grad_norm": 2.194718837738037,
+ "learning_rate": 3.563636363636364e-06,
+ "loss": 1.4593651294708252,
+ "mean_token_accuracy": 0.6476551294326782,
+ "num_tokens": 11665408.0,
+ "step": 712
+ },
+ {
+ "entropy": 1.625157356262207,
+ "epoch": 1.4404040404040404,
+ "grad_norm": 2.0966169834136963,
+ "learning_rate": 3.5616161616161622e-06,
+ "loss": 1.6374845504760742,
+ "mean_token_accuracy": 0.6293356418609619,
+ "num_tokens": 11681792.0,
+ "step": 713
+ },
+ {
+ "entropy": 1.985729455947876,
+ "epoch": 1.4424242424242424,
+ "grad_norm": 2.129556655883789,
+ "learning_rate": 3.55959595959596e-06,
+ "loss": 2.0454561710357666,
+ "mean_token_accuracy": 0.5728505253791809,
+ "num_tokens": 11698176.0,
+ "step": 714
+ },
+ {
+ "entropy": 1.546321153640747,
+ "epoch": 1.4444444444444444,
+ "grad_norm": 2.1565628051757812,
+ "learning_rate": 3.557575757575758e-06,
+ "loss": 1.5467555522918701,
+ "mean_token_accuracy": 0.6351978778839111,
+ "num_tokens": 11714560.0,
+ "step": 715
+ },
+ {
+ "entropy": 1.3690776824951172,
+ "epoch": 1.4464646464646465,
+ "grad_norm": 2.206984519958496,
+ "learning_rate": 3.555555555555556e-06,
+ "loss": 1.3877894878387451,
+ "mean_token_accuracy": 0.6911333799362183,
+ "num_tokens": 11730944.0,
+ "step": 716
+ },
+ {
+ "entropy": 1.3643333911895752,
+ "epoch": 1.4484848484848485,
+ "grad_norm": 2.0049662590026855,
+ "learning_rate": 3.553535353535354e-06,
+ "loss": 1.364513635635376,
+ "mean_token_accuracy": 0.6781876087188721,
+ "num_tokens": 11747328.0,
+ "step": 717
+ },
+ {
+ "entropy": 1.337018370628357,
+ "epoch": 1.4505050505050505,
+ "grad_norm": 2.0919127464294434,
+ "learning_rate": 3.551515151515152e-06,
+ "loss": 1.3578065633773804,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 11763712.0,
+ "step": 718
+ },
+ {
+ "entropy": 1.3421508073806763,
+ "epoch": 1.4525252525252526,
+ "grad_norm": 2.0651159286499023,
+ "learning_rate": 3.54949494949495e-06,
+ "loss": 1.33928382396698,
+ "mean_token_accuracy": 0.6866145730018616,
+ "num_tokens": 11780096.0,
+ "step": 719
+ },
+ {
+ "entropy": 1.2841005325317383,
+ "epoch": 1.4545454545454546,
+ "grad_norm": 2.124370813369751,
+ "learning_rate": 3.547474747474748e-06,
+ "loss": 1.258314609527588,
+ "mean_token_accuracy": 0.6806302070617676,
+ "num_tokens": 11796480.0,
+ "step": 720
+ },
+ {
+ "entropy": 1.56289803981781,
+ "epoch": 1.4565656565656566,
+ "grad_norm": 1.9271100759506226,
+ "learning_rate": 3.5454545454545458e-06,
+ "loss": 1.5867946147918701,
+ "mean_token_accuracy": 0.6430752277374268,
+ "num_tokens": 11812864.0,
+ "step": 721
+ },
+ {
+ "entropy": 1.3374838829040527,
+ "epoch": 1.4585858585858587,
+ "grad_norm": 2.1113364696502686,
+ "learning_rate": 3.5434343434343437e-06,
+ "loss": 1.327169418334961,
+ "mean_token_accuracy": 0.6806912422180176,
+ "num_tokens": 11829248.0,
+ "step": 722
+ },
+ {
+ "entropy": 1.7233415842056274,
+ "epoch": 1.4606060606060607,
+ "grad_norm": 2.1862399578094482,
+ "learning_rate": 3.5414141414141416e-06,
+ "loss": 1.7290821075439453,
+ "mean_token_accuracy": 0.6056423783302307,
+ "num_tokens": 11845632.0,
+ "step": 723
+ },
+ {
+ "entropy": 1.28484046459198,
+ "epoch": 1.4626262626262627,
+ "grad_norm": 2.0059030055999756,
+ "learning_rate": 3.53939393939394e-06,
+ "loss": 1.2958555221557617,
+ "mean_token_accuracy": 0.6774548292160034,
+ "num_tokens": 11862016.0,
+ "step": 724
+ },
+ {
+ "entropy": 1.2592295408248901,
+ "epoch": 1.4646464646464645,
+ "grad_norm": 1.9422065019607544,
+ "learning_rate": 3.5373737373737378e-06,
+ "loss": 1.2501411437988281,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 11878400.0,
+ "step": 725
+ },
+ {
+ "entropy": 1.3708571195602417,
+ "epoch": 1.4666666666666668,
+ "grad_norm": 2.164499044418335,
+ "learning_rate": 3.5353535353535356e-06,
+ "loss": 1.3901662826538086,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 11894784.0,
+ "step": 726
+ },
+ {
+ "entropy": 1.239045262336731,
+ "epoch": 1.4686868686868686,
+ "grad_norm": 1.9581060409545898,
+ "learning_rate": 3.5333333333333335e-06,
+ "loss": 1.2436164617538452,
+ "mean_token_accuracy": 0.6939423680305481,
+ "num_tokens": 11911168.0,
+ "step": 727
+ },
+ {
+ "entropy": 1.5965995788574219,
+ "epoch": 1.4707070707070706,
+ "grad_norm": 2.343669891357422,
+ "learning_rate": 3.5313131313131314e-06,
+ "loss": 1.5918347835540771,
+ "mean_token_accuracy": 0.6274425983428955,
+ "num_tokens": 11927552.0,
+ "step": 728
+ },
+ {
+ "entropy": 1.1196811199188232,
+ "epoch": 1.4727272727272727,
+ "grad_norm": 2.181840181350708,
+ "learning_rate": 3.5292929292929297e-06,
+ "loss": 1.1142621040344238,
+ "mean_token_accuracy": 0.7192842960357666,
+ "num_tokens": 11943936.0,
+ "step": 729
+ },
+ {
+ "entropy": 1.129361629486084,
+ "epoch": 1.4747474747474747,
+ "grad_norm": 2.065730571746826,
+ "learning_rate": 3.5272727272727276e-06,
+ "loss": 1.143613576889038,
+ "mean_token_accuracy": 0.7145212292671204,
+ "num_tokens": 11960320.0,
+ "step": 730
+ },
+ {
+ "entropy": 1.4940218925476074,
+ "epoch": 1.4767676767676767,
+ "grad_norm": 2.083453893661499,
+ "learning_rate": 3.5252525252525255e-06,
+ "loss": 1.4957321882247925,
+ "mean_token_accuracy": 0.6481436491012573,
+ "num_tokens": 11976704.0,
+ "step": 731
+ },
+ {
+ "entropy": 1.3427786827087402,
+ "epoch": 1.4787878787878788,
+ "grad_norm": 2.0897183418273926,
+ "learning_rate": 3.5232323232323234e-06,
+ "loss": 1.354066014289856,
+ "mean_token_accuracy": 0.6660356521606445,
+ "num_tokens": 11993088.0,
+ "step": 732
+ },
+ {
+ "entropy": 1.3300065994262695,
+ "epoch": 1.4808080808080808,
+ "grad_norm": 2.0537912845611572,
+ "learning_rate": 3.5212121212121213e-06,
+ "loss": 1.3332751989364624,
+ "mean_token_accuracy": 0.6817293763160706,
+ "num_tokens": 12009472.0,
+ "step": 733
+ },
+ {
+ "entropy": 1.0657827854156494,
+ "epoch": 1.4828282828282828,
+ "grad_norm": 1.9099130630493164,
+ "learning_rate": 3.5191919191919196e-06,
+ "loss": 1.067232608795166,
+ "mean_token_accuracy": 0.734245240688324,
+ "num_tokens": 12025856.0,
+ "step": 734
+ },
+ {
+ "entropy": 1.5265862941741943,
+ "epoch": 1.4848484848484849,
+ "grad_norm": 2.100236177444458,
+ "learning_rate": 3.5171717171717175e-06,
+ "loss": 1.5169599056243896,
+ "mean_token_accuracy": 0.6382511258125305,
+ "num_tokens": 12042240.0,
+ "step": 735
+ },
+ {
+ "entropy": 1.4428536891937256,
+ "epoch": 1.486868686868687,
+ "grad_norm": 1.9902187585830688,
+ "learning_rate": 3.5151515151515154e-06,
+ "loss": 1.4398434162139893,
+ "mean_token_accuracy": 0.675500750541687,
+ "num_tokens": 12058624.0,
+ "step": 736
+ },
+ {
+ "entropy": 1.528032660484314,
+ "epoch": 1.488888888888889,
+ "grad_norm": 2.043238878250122,
+ "learning_rate": 3.5131313131313133e-06,
+ "loss": 1.5280101299285889,
+ "mean_token_accuracy": 0.6431363224983215,
+ "num_tokens": 12075008.0,
+ "step": 737
+ },
+ {
+ "entropy": 1.4250329732894897,
+ "epoch": 1.490909090909091,
+ "grad_norm": 1.791640281677246,
+ "learning_rate": 3.511111111111111e-06,
+ "loss": 1.426466464996338,
+ "mean_token_accuracy": 0.6765388250350952,
+ "num_tokens": 12091392.0,
+ "step": 738
+ },
+ {
+ "entropy": 1.1264820098876953,
+ "epoch": 1.492929292929293,
+ "grad_norm": 2.0549607276916504,
+ "learning_rate": 3.509090909090909e-06,
+ "loss": 1.1271553039550781,
+ "mean_token_accuracy": 0.6996213793754578,
+ "num_tokens": 12107776.0,
+ "step": 739
+ },
+ {
+ "entropy": 1.538375735282898,
+ "epoch": 1.494949494949495,
+ "grad_norm": 2.22322940826416,
+ "learning_rate": 3.5070707070707073e-06,
+ "loss": 1.5588887929916382,
+ "mean_token_accuracy": 0.6384953856468201,
+ "num_tokens": 12124160.0,
+ "step": 740
+ },
+ {
+ "entropy": 1.2698255777359009,
+ "epoch": 1.496969696969697,
+ "grad_norm": 2.17710542678833,
+ "learning_rate": 3.5050505050505052e-06,
+ "loss": 1.29567289352417,
+ "mean_token_accuracy": 0.6762945652008057,
+ "num_tokens": 12140544.0,
+ "step": 741
+ },
+ {
+ "entropy": 1.523453950881958,
+ "epoch": 1.4989898989898989,
+ "grad_norm": 2.0350148677825928,
+ "learning_rate": 3.503030303030303e-06,
+ "loss": 1.5341038703918457,
+ "mean_token_accuracy": 0.6367855668067932,
+ "num_tokens": 12156928.0,
+ "step": 742
+ },
+ {
+ "entropy": 1.4250539541244507,
+ "epoch": 1.5010101010101011,
+ "grad_norm": 2.1306707859039307,
+ "learning_rate": 3.501010101010101e-06,
+ "loss": 1.4353611469268799,
+ "mean_token_accuracy": 0.6626160144805908,
+ "num_tokens": 12173312.0,
+ "step": 743
+ },
+ {
+ "entropy": 1.1440296173095703,
+ "epoch": 1.503030303030303,
+ "grad_norm": 2.053969383239746,
+ "learning_rate": 3.498989898989899e-06,
+ "loss": 1.1151821613311768,
+ "mean_token_accuracy": 0.7080483436584473,
+ "num_tokens": 12189696.0,
+ "step": 744
+ },
+ {
+ "entropy": 1.5290073156356812,
+ "epoch": 1.5050505050505052,
+ "grad_norm": 2.0550003051757812,
+ "learning_rate": 3.496969696969697e-06,
+ "loss": 1.5260624885559082,
+ "mean_token_accuracy": 0.6493038535118103,
+ "num_tokens": 12206080.0,
+ "step": 745
+ },
+ {
+ "entropy": 1.1096605062484741,
+ "epoch": 1.507070707070707,
+ "grad_norm": 1.8131766319274902,
+ "learning_rate": 3.494949494949495e-06,
+ "loss": 1.1221846342086792,
+ "mean_token_accuracy": 0.7263678312301636,
+ "num_tokens": 12222464.0,
+ "step": 746
+ },
+ {
+ "entropy": 1.282676339149475,
+ "epoch": 1.509090909090909,
+ "grad_norm": 2.3051960468292236,
+ "learning_rate": 3.492929292929293e-06,
+ "loss": 1.2863187789916992,
+ "mean_token_accuracy": 0.6765388250350952,
+ "num_tokens": 12238848.0,
+ "step": 747
+ },
+ {
+ "entropy": 1.2971303462982178,
+ "epoch": 1.511111111111111,
+ "grad_norm": 2.0721139907836914,
+ "learning_rate": 3.4909090909090913e-06,
+ "loss": 1.3010127544403076,
+ "mean_token_accuracy": 0.6753175258636475,
+ "num_tokens": 12255232.0,
+ "step": 748
+ },
+ {
+ "entropy": 1.3711751699447632,
+ "epoch": 1.513131313131313,
+ "grad_norm": 1.9657210111618042,
+ "learning_rate": 3.4888888888888896e-06,
+ "loss": 1.3703930377960205,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 12271616.0,
+ "step": 749
+ },
+ {
+ "entropy": 1.512154459953308,
+ "epoch": 1.5151515151515151,
+ "grad_norm": 2.214172124862671,
+ "learning_rate": 3.4868686868686875e-06,
+ "loss": 1.5243256092071533,
+ "mean_token_accuracy": 0.6485100388526917,
+ "num_tokens": 12288000.0,
+ "step": 750
+ },
+ {
+ "epoch": 1.5151515151515151,
+ "eval_entropy": 1.4458443743567313,
+ "eval_loss": 1.535510540008545,
+ "eval_mean_token_accuracy": 0.6444821915318889,
+ "eval_num_tokens": 12288000.0,
+ "eval_runtime": 43.8043,
+ "eval_samples_per_second": 22.601,
+ "eval_steps_per_second": 2.831,
+ "step": 750
+ },
+ {
+ "entropy": 1.2052820920944214,
+ "epoch": 1.5171717171717172,
+ "grad_norm": 2.104870319366455,
+ "learning_rate": 3.4848484848484854e-06,
+ "loss": 1.2207554578781128,
+ "mean_token_accuracy": 0.695713222026825,
+ "num_tokens": 12304384.0,
+ "step": 751
+ },
+ {
+ "entropy": 1.732282280921936,
+ "epoch": 1.5191919191919192,
+ "grad_norm": 2.101760149002075,
+ "learning_rate": 3.4828282828282833e-06,
+ "loss": 1.7461241483688354,
+ "mean_token_accuracy": 0.6505251526832581,
+ "num_tokens": 12320768.0,
+ "step": 752
+ },
+ {
+ "entropy": 1.5805878639221191,
+ "epoch": 1.5212121212121212,
+ "grad_norm": 2.139244318008423,
+ "learning_rate": 3.480808080808081e-06,
+ "loss": 1.5813164710998535,
+ "mean_token_accuracy": 0.6281143426895142,
+ "num_tokens": 12337152.0,
+ "step": 753
+ },
+ {
+ "entropy": 1.1882269382476807,
+ "epoch": 1.5232323232323233,
+ "grad_norm": 2.187206745147705,
+ "learning_rate": 3.4787878787878795e-06,
+ "loss": 1.1732902526855469,
+ "mean_token_accuracy": 0.7063385248184204,
+ "num_tokens": 12353536.0,
+ "step": 754
+ },
+ {
+ "entropy": 1.4743424654006958,
+ "epoch": 1.5252525252525253,
+ "grad_norm": 2.12687349319458,
+ "learning_rate": 3.4767676767676774e-06,
+ "loss": 1.4681663513183594,
+ "mean_token_accuracy": 0.6558378338813782,
+ "num_tokens": 12369920.0,
+ "step": 755
+ },
+ {
+ "entropy": 1.5533041954040527,
+ "epoch": 1.5272727272727273,
+ "grad_norm": 2.1306610107421875,
+ "learning_rate": 3.4747474747474752e-06,
+ "loss": 1.5599431991577148,
+ "mean_token_accuracy": 0.6399609446525574,
+ "num_tokens": 12386304.0,
+ "step": 756
+ },
+ {
+ "entropy": 0.8933209180831909,
+ "epoch": 1.5292929292929291,
+ "grad_norm": 2.425602912902832,
+ "learning_rate": 3.472727272727273e-06,
+ "loss": 0.8840203285217285,
+ "mean_token_accuracy": 0.7638006806373596,
+ "num_tokens": 12402688.0,
+ "step": 757
+ },
+ {
+ "entropy": 1.6764189004898071,
+ "epoch": 1.5313131313131314,
+ "grad_norm": 2.0684356689453125,
+ "learning_rate": 3.470707070707071e-06,
+ "loss": 1.6948609352111816,
+ "mean_token_accuracy": 0.6087567210197449,
+ "num_tokens": 12419072.0,
+ "step": 758
+ },
+ {
+ "entropy": 1.1875263452529907,
+ "epoch": 1.5333333333333332,
+ "grad_norm": 2.0625953674316406,
+ "learning_rate": 3.468686868686869e-06,
+ "loss": 1.1840041875839233,
+ "mean_token_accuracy": 0.7067660093307495,
+ "num_tokens": 12435456.0,
+ "step": 759
+ },
+ {
+ "entropy": 1.1589192152023315,
+ "epoch": 1.5353535353535355,
+ "grad_norm": 1.9212846755981445,
+ "learning_rate": 3.4666666666666672e-06,
+ "loss": 1.1537678241729736,
+ "mean_token_accuracy": 0.7107962965965271,
+ "num_tokens": 12451840.0,
+ "step": 760
+ },
+ {
+ "entropy": 0.9687032699584961,
+ "epoch": 1.5373737373737373,
+ "grad_norm": 1.9402192831039429,
+ "learning_rate": 3.464646464646465e-06,
+ "loss": 0.9954442977905273,
+ "mean_token_accuracy": 0.7412676811218262,
+ "num_tokens": 12468224.0,
+ "step": 761
+ },
+ {
+ "entropy": 1.4129019975662231,
+ "epoch": 1.5393939393939395,
+ "grad_norm": 2.0903310775756836,
+ "learning_rate": 3.462626262626263e-06,
+ "loss": 1.4131944179534912,
+ "mean_token_accuracy": 0.6676844358444214,
+ "num_tokens": 12484608.0,
+ "step": 762
+ },
+ {
+ "entropy": 1.5170351266860962,
+ "epoch": 1.5414141414141413,
+ "grad_norm": 2.12807035446167,
+ "learning_rate": 3.460606060606061e-06,
+ "loss": 1.5342246294021606,
+ "mean_token_accuracy": 0.6621885895729065,
+ "num_tokens": 12500992.0,
+ "step": 763
+ },
+ {
+ "entropy": 1.1815718412399292,
+ "epoch": 1.5434343434343434,
+ "grad_norm": 2.2491719722747803,
+ "learning_rate": 3.4585858585858588e-06,
+ "loss": 1.1669261455535889,
+ "mean_token_accuracy": 0.694614052772522,
+ "num_tokens": 12517376.0,
+ "step": 764
+ },
+ {
+ "entropy": 1.547598958015442,
+ "epoch": 1.5454545454545454,
+ "grad_norm": 2.136096954345703,
+ "learning_rate": 3.456565656565657e-06,
+ "loss": 1.5515470504760742,
+ "mean_token_accuracy": 0.648876428604126,
+ "num_tokens": 12533760.0,
+ "step": 765
+ },
+ {
+ "entropy": 0.7156143188476562,
+ "epoch": 1.5474747474747474,
+ "grad_norm": 1.8139498233795166,
+ "learning_rate": 3.454545454545455e-06,
+ "loss": 0.7052675485610962,
+ "mean_token_accuracy": 0.8103932738304138,
+ "num_tokens": 12550144.0,
+ "step": 766
+ },
+ {
+ "entropy": 1.400156855583191,
+ "epoch": 1.5494949494949495,
+ "grad_norm": 2.14924693107605,
+ "learning_rate": 3.452525252525253e-06,
+ "loss": 1.4047740697860718,
+ "mean_token_accuracy": 0.6719589829444885,
+ "num_tokens": 12566528.0,
+ "step": 767
+ },
+ {
+ "entropy": 1.8254657983779907,
+ "epoch": 1.5515151515151515,
+ "grad_norm": 2.1882269382476807,
+ "learning_rate": 3.4505050505050507e-06,
+ "loss": 1.8615440130233765,
+ "mean_token_accuracy": 0.5776746273040771,
+ "num_tokens": 12582912.0,
+ "step": 768
+ },
+ {
+ "entropy": 1.5947710275650024,
+ "epoch": 1.5535353535353535,
+ "grad_norm": 2.3221426010131836,
+ "learning_rate": 3.4484848484848486e-06,
+ "loss": 1.6178712844848633,
+ "mean_token_accuracy": 0.6210918426513672,
+ "num_tokens": 12599296.0,
+ "step": 769
+ },
+ {
+ "entropy": 1.2678714990615845,
+ "epoch": 1.5555555555555556,
+ "grad_norm": 1.970064640045166,
+ "learning_rate": 3.446464646464647e-06,
+ "loss": 1.2646088600158691,
+ "mean_token_accuracy": 0.6990107297897339,
+ "num_tokens": 12615680.0,
+ "step": 770
+ },
+ {
+ "entropy": 1.3723604679107666,
+ "epoch": 1.5575757575757576,
+ "grad_norm": 2.171534776687622,
+ "learning_rate": 3.444444444444445e-06,
+ "loss": 1.3890197277069092,
+ "mean_token_accuracy": 0.6709819436073303,
+ "num_tokens": 12632064.0,
+ "step": 771
+ },
+ {
+ "entropy": 1.0273096561431885,
+ "epoch": 1.5595959595959596,
+ "grad_norm": 2.072798490524292,
+ "learning_rate": 3.4424242424242427e-06,
+ "loss": 1.029193639755249,
+ "mean_token_accuracy": 0.7348558902740479,
+ "num_tokens": 12648448.0,
+ "step": 772
+ },
+ {
+ "entropy": 1.4004037380218506,
+ "epoch": 1.5616161616161617,
+ "grad_norm": 2.111480474472046,
+ "learning_rate": 3.4404040404040406e-06,
+ "loss": 1.4213340282440186,
+ "mean_token_accuracy": 0.660906195640564,
+ "num_tokens": 12664832.0,
+ "step": 773
+ },
+ {
+ "entropy": 1.533424735069275,
+ "epoch": 1.5636363636363635,
+ "grad_norm": 2.0949435234069824,
+ "learning_rate": 3.4383838383838385e-06,
+ "loss": 1.5259253978729248,
+ "mean_token_accuracy": 0.6544333100318909,
+ "num_tokens": 12681216.0,
+ "step": 774
+ },
+ {
+ "entropy": 1.5620275735855103,
+ "epoch": 1.5656565656565657,
+ "grad_norm": 2.339731454849243,
+ "learning_rate": 3.4363636363636364e-06,
+ "loss": 1.5596071481704712,
+ "mean_token_accuracy": 0.6290302872657776,
+ "num_tokens": 12697600.0,
+ "step": 775
+ },
+ {
+ "entropy": 1.3272082805633545,
+ "epoch": 1.5676767676767676,
+ "grad_norm": 2.0871188640594482,
+ "learning_rate": 3.4343434343434347e-06,
+ "loss": 1.3413164615631104,
+ "mean_token_accuracy": 0.6809965968132019,
+ "num_tokens": 12713984.0,
+ "step": 776
+ },
+ {
+ "entropy": 1.202813982963562,
+ "epoch": 1.5696969696969698,
+ "grad_norm": 2.0538578033447266,
+ "learning_rate": 3.4323232323232326e-06,
+ "loss": 1.1947424411773682,
+ "mean_token_accuracy": 0.6969956159591675,
+ "num_tokens": 12730368.0,
+ "step": 777
+ },
+ {
+ "entropy": 1.3332773447036743,
+ "epoch": 1.5717171717171716,
+ "grad_norm": 1.9941202402114868,
+ "learning_rate": 3.4303030303030305e-06,
+ "loss": 1.3345956802368164,
+ "mean_token_accuracy": 0.6761724352836609,
+ "num_tokens": 12746752.0,
+ "step": 778
+ },
+ {
+ "entropy": 1.1724364757537842,
+ "epoch": 1.5737373737373739,
+ "grad_norm": 2.213365316390991,
+ "learning_rate": 3.4282828282828284e-06,
+ "loss": 1.1479787826538086,
+ "mean_token_accuracy": 0.7132999300956726,
+ "num_tokens": 12763136.0,
+ "step": 779
+ },
+ {
+ "entropy": 1.4718358516693115,
+ "epoch": 1.5757575757575757,
+ "grad_norm": 1.9743510484695435,
+ "learning_rate": 3.4262626262626262e-06,
+ "loss": 1.4844720363616943,
+ "mean_token_accuracy": 0.656448483467102,
+ "num_tokens": 12779520.0,
+ "step": 780
+ },
+ {
+ "entropy": 1.362882375717163,
+ "epoch": 1.5777777777777777,
+ "grad_norm": 2.370483875274658,
+ "learning_rate": 3.4242424242424246e-06,
+ "loss": 1.350801706314087,
+ "mean_token_accuracy": 0.6707376837730408,
+ "num_tokens": 12795904.0,
+ "step": 781
+ },
+ {
+ "entropy": 1.8302308320999146,
+ "epoch": 1.5797979797979798,
+ "grad_norm": 2.19045090675354,
+ "learning_rate": 3.4222222222222224e-06,
+ "loss": 1.8371320962905884,
+ "mean_token_accuracy": 0.5929408669471741,
+ "num_tokens": 12812288.0,
+ "step": 782
+ },
+ {
+ "entropy": 1.3435529470443726,
+ "epoch": 1.5818181818181818,
+ "grad_norm": 2.1254351139068604,
+ "learning_rate": 3.4202020202020203e-06,
+ "loss": 1.3621928691864014,
+ "mean_token_accuracy": 0.6867367029190063,
+ "num_tokens": 12828672.0,
+ "step": 783
+ },
+ {
+ "entropy": 1.8402602672576904,
+ "epoch": 1.5838383838383838,
+ "grad_norm": 2.123666524887085,
+ "learning_rate": 3.4181818181818182e-06,
+ "loss": 1.8564848899841309,
+ "mean_token_accuracy": 0.5871397256851196,
+ "num_tokens": 12845056.0,
+ "step": 784
+ },
+ {
+ "entropy": 1.441917896270752,
+ "epoch": 1.5858585858585859,
+ "grad_norm": 2.3286895751953125,
+ "learning_rate": 3.416161616161616e-06,
+ "loss": 1.4724184274673462,
+ "mean_token_accuracy": 0.6438080072402954,
+ "num_tokens": 12861440.0,
+ "step": 785
+ },
+ {
+ "entropy": 1.3071452379226685,
+ "epoch": 1.587878787878788,
+ "grad_norm": 2.149143934249878,
+ "learning_rate": 3.414141414141414e-06,
+ "loss": 1.331390142440796,
+ "mean_token_accuracy": 0.679347813129425,
+ "num_tokens": 12877824.0,
+ "step": 786
+ },
+ {
+ "entropy": 1.3547145128250122,
+ "epoch": 1.58989898989899,
+ "grad_norm": 2.2531180381774902,
+ "learning_rate": 3.4121212121212123e-06,
+ "loss": 1.361851453781128,
+ "mean_token_accuracy": 0.6767830848693848,
+ "num_tokens": 12894208.0,
+ "step": 787
+ },
+ {
+ "entropy": 0.9811291098594666,
+ "epoch": 1.591919191919192,
+ "grad_norm": 2.1053760051727295,
+ "learning_rate": 3.41010101010101e-06,
+ "loss": 0.9885507822036743,
+ "mean_token_accuracy": 0.7480459213256836,
+ "num_tokens": 12910592.0,
+ "step": 788
+ },
+ {
+ "entropy": 1.4940402507781982,
+ "epoch": 1.593939393939394,
+ "grad_norm": 2.240074634552002,
+ "learning_rate": 3.408080808080808e-06,
+ "loss": 1.5014076232910156,
+ "mean_token_accuracy": 0.6441743969917297,
+ "num_tokens": 12926976.0,
+ "step": 789
+ },
+ {
+ "entropy": 1.8134219646453857,
+ "epoch": 1.595959595959596,
+ "grad_norm": 2.040239095687866,
+ "learning_rate": 3.406060606060606e-06,
+ "loss": 1.8437519073486328,
+ "mean_token_accuracy": 0.5904372334480286,
+ "num_tokens": 12943360.0,
+ "step": 790
+ },
+ {
+ "entropy": 1.7233681678771973,
+ "epoch": 1.5979797979797978,
+ "grad_norm": 2.381786823272705,
+ "learning_rate": 3.4040404040404047e-06,
+ "loss": 1.7328217029571533,
+ "mean_token_accuracy": 0.6004518866539001,
+ "num_tokens": 12959744.0,
+ "step": 791
+ },
+ {
+ "entropy": 1.3966271877288818,
+ "epoch": 1.6,
+ "grad_norm": 2.17006778717041,
+ "learning_rate": 3.4020202020202026e-06,
+ "loss": 1.4065337181091309,
+ "mean_token_accuracy": 0.6629824042320251,
+ "num_tokens": 12976128.0,
+ "step": 792
+ },
+ {
+ "entropy": 1.5002557039260864,
+ "epoch": 1.602020202020202,
+ "grad_norm": 2.558037281036377,
+ "learning_rate": 3.4000000000000005e-06,
+ "loss": 1.4841307401657104,
+ "mean_token_accuracy": 0.647838294506073,
+ "num_tokens": 12992512.0,
+ "step": 793
+ },
+ {
+ "entropy": 1.7432687282562256,
+ "epoch": 1.6040404040404042,
+ "grad_norm": 2.134734630584717,
+ "learning_rate": 3.3979797979797984e-06,
+ "loss": 1.7539207935333252,
+ "mean_token_accuracy": 0.6028333902359009,
+ "num_tokens": 13008896.0,
+ "step": 794
+ },
+ {
+ "entropy": 1.4490517377853394,
+ "epoch": 1.606060606060606,
+ "grad_norm": 2.1590232849121094,
+ "learning_rate": 3.3959595959595963e-06,
+ "loss": 1.468411922454834,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 13025280.0,
+ "step": 795
+ },
+ {
+ "entropy": 1.3823497295379639,
+ "epoch": 1.6080808080808082,
+ "grad_norm": 2.1508285999298096,
+ "learning_rate": 3.3939393939393946e-06,
+ "loss": 1.4011330604553223,
+ "mean_token_accuracy": 0.6530898809432983,
+ "num_tokens": 13041664.0,
+ "step": 796
+ },
+ {
+ "entropy": 1.6982436180114746,
+ "epoch": 1.61010101010101,
+ "grad_norm": 2.077131986618042,
+ "learning_rate": 3.3919191919191925e-06,
+ "loss": 1.727889060974121,
+ "mean_token_accuracy": 0.6232290863990784,
+ "num_tokens": 13058048.0,
+ "step": 797
+ },
+ {
+ "entropy": 1.7268915176391602,
+ "epoch": 1.612121212121212,
+ "grad_norm": 2.0703542232513428,
+ "learning_rate": 3.3898989898989903e-06,
+ "loss": 1.7333730459213257,
+ "mean_token_accuracy": 0.6110160946846008,
+ "num_tokens": 13074432.0,
+ "step": 798
+ },
+ {
+ "entropy": 1.6253595352172852,
+ "epoch": 1.614141414141414,
+ "grad_norm": 2.241154432296753,
+ "learning_rate": 3.3878787878787882e-06,
+ "loss": 1.6275582313537598,
+ "mean_token_accuracy": 0.6198094487190247,
+ "num_tokens": 13090816.0,
+ "step": 799
+ },
+ {
+ "entropy": 1.8784692287445068,
+ "epoch": 1.6161616161616161,
+ "grad_norm": 2.505871057510376,
+ "learning_rate": 3.385858585858586e-06,
+ "loss": 1.8784008026123047,
+ "mean_token_accuracy": 0.5944064259529114,
+ "num_tokens": 13107200.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.6161616161616161,
+ "eval_entropy": 1.4455043437980837,
+ "eval_loss": 1.5330992937088013,
+ "eval_mean_token_accuracy": 0.6448845310557273,
+ "eval_num_tokens": 13107200.0,
+ "eval_runtime": 43.766,
+ "eval_samples_per_second": 22.62,
+ "eval_steps_per_second": 2.833,
+ "step": 800
+ },
+ {
+ "entropy": 1.921440601348877,
+ "epoch": 1.6181818181818182,
+ "grad_norm": 2.1760783195495605,
+ "learning_rate": 3.3838383838383844e-06,
+ "loss": 1.9410110712051392,
+ "mean_token_accuracy": 0.5776746273040771,
+ "num_tokens": 13123584.0,
+ "step": 801
+ },
+ {
+ "entropy": 1.4233160018920898,
+ "epoch": 1.6202020202020202,
+ "grad_norm": 2.2687666416168213,
+ "learning_rate": 3.3818181818181823e-06,
+ "loss": 1.4465446472167969,
+ "mean_token_accuracy": 0.6488153338432312,
+ "num_tokens": 13139968.0,
+ "step": 802
+ },
+ {
+ "entropy": 1.697847843170166,
+ "epoch": 1.6222222222222222,
+ "grad_norm": 2.0649187564849854,
+ "learning_rate": 3.37979797979798e-06,
+ "loss": 1.7235385179519653,
+ "mean_token_accuracy": 0.6196262836456299,
+ "num_tokens": 13156352.0,
+ "step": 803
+ },
+ {
+ "entropy": 1.2027701139450073,
+ "epoch": 1.6242424242424243,
+ "grad_norm": 2.0115890502929688,
+ "learning_rate": 3.377777777777778e-06,
+ "loss": 1.1890676021575928,
+ "mean_token_accuracy": 0.6928431987762451,
+ "num_tokens": 13172736.0,
+ "step": 804
+ },
+ {
+ "entropy": 1.4847105741500854,
+ "epoch": 1.6262626262626263,
+ "grad_norm": 2.145098924636841,
+ "learning_rate": 3.375757575757576e-06,
+ "loss": 1.4817116260528564,
+ "mean_token_accuracy": 0.6415486335754395,
+ "num_tokens": 13189120.0,
+ "step": 805
+ },
+ {
+ "entropy": 1.3548893928527832,
+ "epoch": 1.6282828282828283,
+ "grad_norm": 2.3037521839141846,
+ "learning_rate": 3.3737373737373743e-06,
+ "loss": 1.3433952331542969,
+ "mean_token_accuracy": 0.6681729555130005,
+ "num_tokens": 13205504.0,
+ "step": 806
+ },
+ {
+ "entropy": 1.375793218612671,
+ "epoch": 1.6303030303030304,
+ "grad_norm": 2.0814852714538574,
+ "learning_rate": 3.371717171717172e-06,
+ "loss": 1.3506405353546143,
+ "mean_token_accuracy": 0.6634098887443542,
+ "num_tokens": 13221888.0,
+ "step": 807
+ },
+ {
+ "entropy": 1.1417323350906372,
+ "epoch": 1.6323232323232322,
+ "grad_norm": 2.0166866779327393,
+ "learning_rate": 3.36969696969697e-06,
+ "loss": 1.1731860637664795,
+ "mean_token_accuracy": 0.7123839855194092,
+ "num_tokens": 13238272.0,
+ "step": 808
+ },
+ {
+ "entropy": 1.3159022331237793,
+ "epoch": 1.6343434343434344,
+ "grad_norm": 1.9626281261444092,
+ "learning_rate": 3.367676767676768e-06,
+ "loss": 1.3286499977111816,
+ "mean_token_accuracy": 0.675561785697937,
+ "num_tokens": 13254656.0,
+ "step": 809
+ },
+ {
+ "entropy": 1.325775384902954,
+ "epoch": 1.6363636363636362,
+ "grad_norm": 2.1239242553710938,
+ "learning_rate": 3.365656565656566e-06,
+ "loss": 1.345514178276062,
+ "mean_token_accuracy": 0.6780043840408325,
+ "num_tokens": 13271040.0,
+ "step": 810
+ },
+ {
+ "entropy": 1.8307870626449585,
+ "epoch": 1.6383838383838385,
+ "grad_norm": 2.208296298980713,
+ "learning_rate": 3.3636363636363637e-06,
+ "loss": 1.8402234315872192,
+ "mean_token_accuracy": 0.5958719849586487,
+ "num_tokens": 13287424.0,
+ "step": 811
+ },
+ {
+ "entropy": 1.2596150636672974,
+ "epoch": 1.6404040404040403,
+ "grad_norm": 2.0936427116394043,
+ "learning_rate": 3.361616161616162e-06,
+ "loss": 1.2552804946899414,
+ "mean_token_accuracy": 0.6874083876609802,
+ "num_tokens": 13303808.0,
+ "step": 812
+ },
+ {
+ "entropy": 1.2575111389160156,
+ "epoch": 1.6424242424242426,
+ "grad_norm": 2.0232772827148438,
+ "learning_rate": 3.35959595959596e-06,
+ "loss": 1.2805989980697632,
+ "mean_token_accuracy": 0.6916829347610474,
+ "num_tokens": 13320192.0,
+ "step": 813
+ },
+ {
+ "entropy": 1.0270155668258667,
+ "epoch": 1.6444444444444444,
+ "grad_norm": 1.9090715646743774,
+ "learning_rate": 3.357575757575758e-06,
+ "loss": 1.0277824401855469,
+ "mean_token_accuracy": 0.7379091382026672,
+ "num_tokens": 13336576.0,
+ "step": 814
+ },
+ {
+ "entropy": 1.2992243766784668,
+ "epoch": 1.6464646464646466,
+ "grad_norm": 2.1718814373016357,
+ "learning_rate": 3.3555555555555557e-06,
+ "loss": 1.3278638124465942,
+ "mean_token_accuracy": 0.6764777898788452,
+ "num_tokens": 13352960.0,
+ "step": 815
+ },
+ {
+ "entropy": 1.5365362167358398,
+ "epoch": 1.6484848484848484,
+ "grad_norm": 2.0298495292663574,
+ "learning_rate": 3.3535353535353536e-06,
+ "loss": 1.5257508754730225,
+ "mean_token_accuracy": 0.6511358022689819,
+ "num_tokens": 13369344.0,
+ "step": 816
+ },
+ {
+ "entropy": 1.4384456872940063,
+ "epoch": 1.6505050505050505,
+ "grad_norm": 2.375277042388916,
+ "learning_rate": 3.351515151515152e-06,
+ "loss": 1.4287049770355225,
+ "mean_token_accuracy": 0.645639955997467,
+ "num_tokens": 13385728.0,
+ "step": 817
+ },
+ {
+ "entropy": 1.7104265689849854,
+ "epoch": 1.6525252525252525,
+ "grad_norm": 2.052535057067871,
+ "learning_rate": 3.34949494949495e-06,
+ "loss": 1.6971676349639893,
+ "mean_token_accuracy": 0.6159623861312866,
+ "num_tokens": 13402112.0,
+ "step": 818
+ },
+ {
+ "entropy": 1.5908539295196533,
+ "epoch": 1.6545454545454545,
+ "grad_norm": 2.047088861465454,
+ "learning_rate": 3.3474747474747477e-06,
+ "loss": 1.5640246868133545,
+ "mean_token_accuracy": 0.640754759311676,
+ "num_tokens": 13418496.0,
+ "step": 819
+ },
+ {
+ "entropy": 1.3660207986831665,
+ "epoch": 1.6565656565656566,
+ "grad_norm": 2.2711079120635986,
+ "learning_rate": 3.3454545454545456e-06,
+ "loss": 1.3601036071777344,
+ "mean_token_accuracy": 0.6577919125556946,
+ "num_tokens": 13434880.0,
+ "step": 820
+ },
+ {
+ "entropy": 1.5897634029388428,
+ "epoch": 1.6585858585858586,
+ "grad_norm": 2.0869712829589844,
+ "learning_rate": 3.3434343434343435e-06,
+ "loss": 1.5801420211791992,
+ "mean_token_accuracy": 0.6312897205352783,
+ "num_tokens": 13451264.0,
+ "step": 821
+ },
+ {
+ "entropy": 1.428406834602356,
+ "epoch": 1.6606060606060606,
+ "grad_norm": 2.049370765686035,
+ "learning_rate": 3.3414141414141413e-06,
+ "loss": 1.4145596027374268,
+ "mean_token_accuracy": 0.6649975776672363,
+ "num_tokens": 13467648.0,
+ "step": 822
+ },
+ {
+ "entropy": 1.5026675462722778,
+ "epoch": 1.6626262626262627,
+ "grad_norm": 2.157031297683716,
+ "learning_rate": 3.3393939393939397e-06,
+ "loss": 1.4902830123901367,
+ "mean_token_accuracy": 0.6524181962013245,
+ "num_tokens": 13484032.0,
+ "step": 823
+ },
+ {
+ "entropy": 1.4907052516937256,
+ "epoch": 1.6646464646464647,
+ "grad_norm": 2.1476478576660156,
+ "learning_rate": 3.3373737373737375e-06,
+ "loss": 1.5102436542510986,
+ "mean_token_accuracy": 0.6485100388526917,
+ "num_tokens": 13500416.0,
+ "step": 824
+ },
+ {
+ "entropy": 1.4277782440185547,
+ "epoch": 1.6666666666666665,
+ "grad_norm": 2.2880661487579346,
+ "learning_rate": 3.3353535353535354e-06,
+ "loss": 1.4358019828796387,
+ "mean_token_accuracy": 0.6522960662841797,
+ "num_tokens": 13516800.0,
+ "step": 825
+ },
+ {
+ "entropy": 1.5560128688812256,
+ "epoch": 1.6686868686868688,
+ "grad_norm": 2.048403024673462,
+ "learning_rate": 3.3333333333333333e-06,
+ "loss": 1.5472501516342163,
+ "mean_token_accuracy": 0.6488153338432312,
+ "num_tokens": 13533184.0,
+ "step": 826
+ },
+ {
+ "entropy": 1.665900707244873,
+ "epoch": 1.6707070707070706,
+ "grad_norm": 2.0828492641448975,
+ "learning_rate": 3.331313131313131e-06,
+ "loss": 1.6905372142791748,
+ "mean_token_accuracy": 0.629885196685791,
+ "num_tokens": 13549568.0,
+ "step": 827
+ },
+ {
+ "entropy": 1.3484426736831665,
+ "epoch": 1.6727272727272728,
+ "grad_norm": 2.1873531341552734,
+ "learning_rate": 3.3292929292929295e-06,
+ "loss": 1.3510258197784424,
+ "mean_token_accuracy": 0.6721421480178833,
+ "num_tokens": 13565952.0,
+ "step": 828
+ },
+ {
+ "entropy": 1.7577860355377197,
+ "epoch": 1.6747474747474747,
+ "grad_norm": 2.0467135906219482,
+ "learning_rate": 3.3272727272727274e-06,
+ "loss": 1.7791969776153564,
+ "mean_token_accuracy": 0.6028944849967957,
+ "num_tokens": 13582336.0,
+ "step": 829
+ },
+ {
+ "entropy": 1.4549124240875244,
+ "epoch": 1.676767676767677,
+ "grad_norm": 2.2004988193511963,
+ "learning_rate": 3.3252525252525253e-06,
+ "loss": 1.4512457847595215,
+ "mean_token_accuracy": 0.6521128416061401,
+ "num_tokens": 13598720.0,
+ "step": 830
+ },
+ {
+ "entropy": 1.2226758003234863,
+ "epoch": 1.6787878787878787,
+ "grad_norm": 2.0866682529449463,
+ "learning_rate": 3.323232323232323e-06,
+ "loss": 1.226635456085205,
+ "mean_token_accuracy": 0.6969345211982727,
+ "num_tokens": 13615104.0,
+ "step": 831
+ },
+ {
+ "entropy": 0.9826563000679016,
+ "epoch": 1.680808080808081,
+ "grad_norm": 1.9865771532058716,
+ "learning_rate": 3.321212121212121e-06,
+ "loss": 1.009648323059082,
+ "mean_token_accuracy": 0.7507327795028687,
+ "num_tokens": 13631488.0,
+ "step": 832
+ },
+ {
+ "entropy": 1.620038390159607,
+ "epoch": 1.6828282828282828,
+ "grad_norm": 2.1745760440826416,
+ "learning_rate": 3.3191919191919194e-06,
+ "loss": 1.615234136581421,
+ "mean_token_accuracy": 0.6305569410324097,
+ "num_tokens": 13647872.0,
+ "step": 833
+ },
+ {
+ "entropy": 1.4803876876831055,
+ "epoch": 1.6848484848484848,
+ "grad_norm": 2.328029155731201,
+ "learning_rate": 3.3171717171717177e-06,
+ "loss": 1.509049892425537,
+ "mean_token_accuracy": 0.6353810429573059,
+ "num_tokens": 13664256.0,
+ "step": 834
+ },
+ {
+ "entropy": 1.2290453910827637,
+ "epoch": 1.6868686868686869,
+ "grad_norm": 2.1777281761169434,
+ "learning_rate": 3.3151515151515156e-06,
+ "loss": 1.222726583480835,
+ "mean_token_accuracy": 0.6842330098152161,
+ "num_tokens": 13680640.0,
+ "step": 835
+ },
+ {
+ "entropy": 1.1965430974960327,
+ "epoch": 1.6888888888888889,
+ "grad_norm": 2.211397886276245,
+ "learning_rate": 3.3131313131313135e-06,
+ "loss": 1.2027852535247803,
+ "mean_token_accuracy": 0.7028578519821167,
+ "num_tokens": 13697024.0,
+ "step": 836
+ },
+ {
+ "entropy": 1.5326080322265625,
+ "epoch": 1.690909090909091,
+ "grad_norm": 2.8396589756011963,
+ "learning_rate": 3.3111111111111118e-06,
+ "loss": 1.5819613933563232,
+ "mean_token_accuracy": 0.625,
+ "num_tokens": 13713408.0,
+ "step": 837
+ },
+ {
+ "entropy": 1.2514865398406982,
+ "epoch": 1.692929292929293,
+ "grad_norm": 1.923771858215332,
+ "learning_rate": 3.3090909090909097e-06,
+ "loss": 1.2518126964569092,
+ "mean_token_accuracy": 0.6955300569534302,
+ "num_tokens": 13729792.0,
+ "step": 838
+ },
+ {
+ "entropy": 1.3717304468154907,
+ "epoch": 1.694949494949495,
+ "grad_norm": 2.0393056869506836,
+ "learning_rate": 3.3070707070707076e-06,
+ "loss": 1.400814175605774,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 13746176.0,
+ "step": 839
+ },
+ {
+ "entropy": 1.2871394157409668,
+ "epoch": 1.696969696969697,
+ "grad_norm": 2.114823579788208,
+ "learning_rate": 3.3050505050505054e-06,
+ "loss": 1.302154541015625,
+ "mean_token_accuracy": 0.6790425181388855,
+ "num_tokens": 13762560.0,
+ "step": 840
+ },
+ {
+ "entropy": 1.518404483795166,
+ "epoch": 1.698989898989899,
+ "grad_norm": 2.186727523803711,
+ "learning_rate": 3.3030303030303033e-06,
+ "loss": 1.5067068338394165,
+ "mean_token_accuracy": 0.638006865978241,
+ "num_tokens": 13778944.0,
+ "step": 841
+ },
+ {
+ "entropy": 1.5698254108428955,
+ "epoch": 1.7010101010101009,
+ "grad_norm": 2.159721851348877,
+ "learning_rate": 3.3010101010101016e-06,
+ "loss": 1.5568101406097412,
+ "mean_token_accuracy": 0.6398998498916626,
+ "num_tokens": 13795328.0,
+ "step": 842
+ },
+ {
+ "entropy": 1.5159670114517212,
+ "epoch": 1.7030303030303031,
+ "grad_norm": 2.0655386447906494,
+ "learning_rate": 3.2989898989898995e-06,
+ "loss": 1.5152846574783325,
+ "mean_token_accuracy": 0.6441133618354797,
+ "num_tokens": 13811712.0,
+ "step": 843
+ },
+ {
+ "entropy": 1.231048822402954,
+ "epoch": 1.705050505050505,
+ "grad_norm": 1.99764084815979,
+ "learning_rate": 3.2969696969696974e-06,
+ "loss": 1.2419885396957397,
+ "mean_token_accuracy": 0.6936370134353638,
+ "num_tokens": 13828096.0,
+ "step": 844
+ },
+ {
+ "entropy": 1.1431403160095215,
+ "epoch": 1.7070707070707072,
+ "grad_norm": 2.0046544075012207,
+ "learning_rate": 3.2949494949494953e-06,
+ "loss": 1.147315502166748,
+ "mean_token_accuracy": 0.7155593633651733,
+ "num_tokens": 13844480.0,
+ "step": 845
+ },
+ {
+ "entropy": 1.903164267539978,
+ "epoch": 1.709090909090909,
+ "grad_norm": 2.068286418914795,
+ "learning_rate": 3.292929292929293e-06,
+ "loss": 1.9086098670959473,
+ "mean_token_accuracy": 0.5785295367240906,
+ "num_tokens": 13860864.0,
+ "step": 846
+ },
+ {
+ "entropy": 1.028931736946106,
+ "epoch": 1.7111111111111112,
+ "grad_norm": 2.008197546005249,
+ "learning_rate": 3.290909090909091e-06,
+ "loss": 1.0251559019088745,
+ "mean_token_accuracy": 0.7308866381645203,
+ "num_tokens": 13877248.0,
+ "step": 847
+ },
+ {
+ "entropy": 1.8438282012939453,
+ "epoch": 1.713131313131313,
+ "grad_norm": 2.180811882019043,
+ "learning_rate": 3.2888888888888894e-06,
+ "loss": 1.8572561740875244,
+ "mean_token_accuracy": 0.5788959264755249,
+ "num_tokens": 13893632.0,
+ "step": 848
+ },
+ {
+ "entropy": 1.437190294265747,
+ "epoch": 1.7151515151515153,
+ "grad_norm": 2.1013762950897217,
+ "learning_rate": 3.2868686868686873e-06,
+ "loss": 1.4337413311004639,
+ "mean_token_accuracy": 0.6489985585212708,
+ "num_tokens": 13910016.0,
+ "step": 849
+ },
+ {
+ "entropy": 1.482985496520996,
+ "epoch": 1.7171717171717171,
+ "grad_norm": 2.290910243988037,
+ "learning_rate": 3.284848484848485e-06,
+ "loss": 1.4959741830825806,
+ "mean_token_accuracy": 0.6447850465774536,
+ "num_tokens": 13926400.0,
+ "step": 850
+ },
+ {
+ "epoch": 1.7171717171717171,
+ "eval_entropy": 1.447427170411233,
+ "eval_loss": 1.5309957265853882,
+ "eval_mean_token_accuracy": 0.6452888370521607,
+ "eval_num_tokens": 13926400.0,
+ "eval_runtime": 43.7619,
+ "eval_samples_per_second": 22.622,
+ "eval_steps_per_second": 2.834,
+ "step": 850
+ },
+ {
+ "entropy": 1.4470106363296509,
+ "epoch": 1.7191919191919192,
+ "grad_norm": 2.2015624046325684,
+ "learning_rate": 3.282828282828283e-06,
+ "loss": 1.462576150894165,
+ "mean_token_accuracy": 0.643991231918335,
+ "num_tokens": 13942784.0,
+ "step": 851
+ },
+ {
+ "entropy": 1.4063832759857178,
+ "epoch": 1.7212121212121212,
+ "grad_norm": 2.1743109226226807,
+ "learning_rate": 3.280808080808081e-06,
+ "loss": 1.402491569519043,
+ "mean_token_accuracy": 0.6533952355384827,
+ "num_tokens": 13959168.0,
+ "step": 852
+ },
+ {
+ "entropy": 1.3735251426696777,
+ "epoch": 1.7232323232323232,
+ "grad_norm": 2.1350960731506348,
+ "learning_rate": 3.2787878787878793e-06,
+ "loss": 1.383405327796936,
+ "mean_token_accuracy": 0.6767830848693848,
+ "num_tokens": 13975552.0,
+ "step": 853
+ },
+ {
+ "entropy": 1.359702229499817,
+ "epoch": 1.7252525252525253,
+ "grad_norm": 2.1547393798828125,
+ "learning_rate": 3.276767676767677e-06,
+ "loss": 1.3454554080963135,
+ "mean_token_accuracy": 0.6712262034416199,
+ "num_tokens": 13991936.0,
+ "step": 854
+ },
+ {
+ "entropy": 1.0641778707504272,
+ "epoch": 1.7272727272727273,
+ "grad_norm": 2.0301826000213623,
+ "learning_rate": 3.274747474747475e-06,
+ "loss": 1.0626115798950195,
+ "mean_token_accuracy": 0.7188568711280823,
+ "num_tokens": 14008320.0,
+ "step": 855
+ },
+ {
+ "entropy": 1.598792552947998,
+ "epoch": 1.7292929292929293,
+ "grad_norm": 2.3324217796325684,
+ "learning_rate": 3.272727272727273e-06,
+ "loss": 1.6028941869735718,
+ "mean_token_accuracy": 0.6462506055831909,
+ "num_tokens": 14024704.0,
+ "step": 856
+ },
+ {
+ "entropy": 1.6304137706756592,
+ "epoch": 1.7313131313131314,
+ "grad_norm": 1.9968358278274536,
+ "learning_rate": 3.270707070707071e-06,
+ "loss": 1.6449415683746338,
+ "mean_token_accuracy": 0.6322056651115417,
+ "num_tokens": 14041088.0,
+ "step": 857
+ },
+ {
+ "entropy": 1.3219174146652222,
+ "epoch": 1.7333333333333334,
+ "grad_norm": 2.059927225112915,
+ "learning_rate": 3.2686868686868687e-06,
+ "loss": 1.3487168550491333,
+ "mean_token_accuracy": 0.6769052147865295,
+ "num_tokens": 14057472.0,
+ "step": 858
+ },
+ {
+ "entropy": 1.4645651578903198,
+ "epoch": 1.7353535353535352,
+ "grad_norm": 2.068962812423706,
+ "learning_rate": 3.266666666666667e-06,
+ "loss": 1.4480202198028564,
+ "mean_token_accuracy": 0.6521128416061401,
+ "num_tokens": 14073856.0,
+ "step": 859
+ },
+ {
+ "entropy": 1.5005300045013428,
+ "epoch": 1.7373737373737375,
+ "grad_norm": 2.228736162185669,
+ "learning_rate": 3.264646464646465e-06,
+ "loss": 1.5110201835632324,
+ "mean_token_accuracy": 0.6482657790184021,
+ "num_tokens": 14090240.0,
+ "step": 860
+ },
+ {
+ "entropy": 1.1641852855682373,
+ "epoch": 1.7393939393939393,
+ "grad_norm": 2.0611488819122314,
+ "learning_rate": 3.262626262626263e-06,
+ "loss": 1.1905086040496826,
+ "mean_token_accuracy": 0.7104909420013428,
+ "num_tokens": 14106624.0,
+ "step": 861
+ },
+ {
+ "entropy": 1.4315950870513916,
+ "epoch": 1.7414141414141415,
+ "grad_norm": 1.9914237260818481,
+ "learning_rate": 3.2606060606060607e-06,
+ "loss": 1.467012882232666,
+ "mean_token_accuracy": 0.657608687877655,
+ "num_tokens": 14123008.0,
+ "step": 862
+ },
+ {
+ "entropy": 1.5196973085403442,
+ "epoch": 1.7434343434343433,
+ "grad_norm": 2.3258447647094727,
+ "learning_rate": 3.2585858585858586e-06,
+ "loss": 1.5382301807403564,
+ "mean_token_accuracy": 0.6370298266410828,
+ "num_tokens": 14139392.0,
+ "step": 863
+ },
+ {
+ "entropy": 1.5098228454589844,
+ "epoch": 1.7454545454545456,
+ "grad_norm": 2.146327495574951,
+ "learning_rate": 3.256565656565657e-06,
+ "loss": 1.540649652481079,
+ "mean_token_accuracy": 0.6439301371574402,
+ "num_tokens": 14155776.0,
+ "step": 864
+ },
+ {
+ "entropy": 1.128011703491211,
+ "epoch": 1.7474747474747474,
+ "grad_norm": 1.967443823814392,
+ "learning_rate": 3.2545454545454548e-06,
+ "loss": 1.1707985401153564,
+ "mean_token_accuracy": 0.7298485636711121,
+ "num_tokens": 14172160.0,
+ "step": 865
+ },
+ {
+ "entropy": 1.9117931127548218,
+ "epoch": 1.7494949494949497,
+ "grad_norm": 2.097781181335449,
+ "learning_rate": 3.2525252525252527e-06,
+ "loss": 1.9291374683380127,
+ "mean_token_accuracy": 0.580483615398407,
+ "num_tokens": 14188544.0,
+ "step": 866
+ },
+ {
+ "entropy": 1.9053187370300293,
+ "epoch": 1.7515151515151515,
+ "grad_norm": 1.9865039587020874,
+ "learning_rate": 3.2505050505050505e-06,
+ "loss": 1.932790756225586,
+ "mean_token_accuracy": 0.5770639777183533,
+ "num_tokens": 14204928.0,
+ "step": 867
+ },
+ {
+ "entropy": 1.2647870779037476,
+ "epoch": 1.7535353535353535,
+ "grad_norm": 2.099891185760498,
+ "learning_rate": 3.2484848484848484e-06,
+ "loss": 1.281562328338623,
+ "mean_token_accuracy": 0.6938812732696533,
+ "num_tokens": 14221312.0,
+ "step": 868
+ },
+ {
+ "entropy": 1.5446428060531616,
+ "epoch": 1.7555555555555555,
+ "grad_norm": 1.9044189453125,
+ "learning_rate": 3.2464646464646467e-06,
+ "loss": 1.5440425872802734,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 14237696.0,
+ "step": 869
+ },
+ {
+ "entropy": 1.179898977279663,
+ "epoch": 1.7575757575757576,
+ "grad_norm": 2.0257933139801025,
+ "learning_rate": 3.2444444444444446e-06,
+ "loss": 1.1607933044433594,
+ "mean_token_accuracy": 0.7053614854812622,
+ "num_tokens": 14254080.0,
+ "step": 870
+ },
+ {
+ "entropy": 1.0462855100631714,
+ "epoch": 1.7595959595959596,
+ "grad_norm": 1.8995661735534668,
+ "learning_rate": 3.2424242424242425e-06,
+ "loss": 1.0395057201385498,
+ "mean_token_accuracy": 0.7405959963798523,
+ "num_tokens": 14270464.0,
+ "step": 871
+ },
+ {
+ "entropy": 0.8866081833839417,
+ "epoch": 1.7616161616161616,
+ "grad_norm": 1.7807546854019165,
+ "learning_rate": 3.2404040404040404e-06,
+ "loss": 0.8795047998428345,
+ "mean_token_accuracy": 0.7721666097640991,
+ "num_tokens": 14286848.0,
+ "step": 872
+ },
+ {
+ "entropy": 1.9576365947723389,
+ "epoch": 1.7636363636363637,
+ "grad_norm": 2.1867618560791016,
+ "learning_rate": 3.2383838383838383e-06,
+ "loss": 1.9605103731155396,
+ "mean_token_accuracy": 0.5809110999107361,
+ "num_tokens": 14303232.0,
+ "step": 873
+ },
+ {
+ "entropy": 1.010751485824585,
+ "epoch": 1.7656565656565657,
+ "grad_norm": 1.9643300771713257,
+ "learning_rate": 3.236363636363636e-06,
+ "loss": 0.9990894794464111,
+ "mean_token_accuracy": 0.7386419177055359,
+ "num_tokens": 14319616.0,
+ "step": 874
+ },
+ {
+ "entropy": 1.3587232828140259,
+ "epoch": 1.7676767676767677,
+ "grad_norm": 2.2632040977478027,
+ "learning_rate": 3.2343434343434345e-06,
+ "loss": 1.3631021976470947,
+ "mean_token_accuracy": 0.665791392326355,
+ "num_tokens": 14336000.0,
+ "step": 875
+ },
+ {
+ "entropy": 1.6577962636947632,
+ "epoch": 1.7696969696969695,
+ "grad_norm": 2.3661980628967285,
+ "learning_rate": 3.232323232323233e-06,
+ "loss": 1.6802719831466675,
+ "mean_token_accuracy": 0.6024059653282166,
+ "num_tokens": 14352384.0,
+ "step": 876
+ },
+ {
+ "entropy": 1.4332902431488037,
+ "epoch": 1.7717171717171718,
+ "grad_norm": 2.2296342849731445,
+ "learning_rate": 3.2303030303030307e-06,
+ "loss": 1.4129014015197754,
+ "mean_token_accuracy": 0.6511358022689819,
+ "num_tokens": 14368768.0,
+ "step": 877
+ },
+ {
+ "entropy": 1.2260215282440186,
+ "epoch": 1.7737373737373736,
+ "grad_norm": 2.0659983158111572,
+ "learning_rate": 3.228282828282829e-06,
+ "loss": 1.2417192459106445,
+ "mean_token_accuracy": 0.693514883518219,
+ "num_tokens": 14385152.0,
+ "step": 878
+ },
+ {
+ "entropy": 1.5402687788009644,
+ "epoch": 1.7757575757575759,
+ "grad_norm": 2.2024054527282715,
+ "learning_rate": 3.226262626262627e-06,
+ "loss": 1.5535321235656738,
+ "mean_token_accuracy": 0.6331827044487,
+ "num_tokens": 14401536.0,
+ "step": 879
+ },
+ {
+ "entropy": 1.2205268144607544,
+ "epoch": 1.7777777777777777,
+ "grad_norm": 2.0056662559509277,
+ "learning_rate": 3.2242424242424248e-06,
+ "loss": 1.2244641780853271,
+ "mean_token_accuracy": 0.7037127614021301,
+ "num_tokens": 14417920.0,
+ "step": 880
+ },
+ {
+ "entropy": 1.542244791984558,
+ "epoch": 1.77979797979798,
+ "grad_norm": 2.0935254096984863,
+ "learning_rate": 3.2222222222222227e-06,
+ "loss": 1.5638453960418701,
+ "mean_token_accuracy": 0.648937463760376,
+ "num_tokens": 14434304.0,
+ "step": 881
+ },
+ {
+ "entropy": 1.4249905347824097,
+ "epoch": 1.7818181818181817,
+ "grad_norm": 1.9853826761245728,
+ "learning_rate": 3.2202020202020206e-06,
+ "loss": 1.4453399181365967,
+ "mean_token_accuracy": 0.6869809627532959,
+ "num_tokens": 14450688.0,
+ "step": 882
+ },
+ {
+ "entropy": 1.4777165651321411,
+ "epoch": 1.783838383838384,
+ "grad_norm": 2.064542055130005,
+ "learning_rate": 3.2181818181818184e-06,
+ "loss": 1.4756921529769897,
+ "mean_token_accuracy": 0.6640205383300781,
+ "num_tokens": 14467072.0,
+ "step": 883
+ },
+ {
+ "entropy": 1.3442282676696777,
+ "epoch": 1.7858585858585858,
+ "grad_norm": 2.043712854385376,
+ "learning_rate": 3.2161616161616168e-06,
+ "loss": 1.3412827253341675,
+ "mean_token_accuracy": 0.6821568012237549,
+ "num_tokens": 14483456.0,
+ "step": 884
+ },
+ {
+ "entropy": 1.5201579332351685,
+ "epoch": 1.7878787878787878,
+ "grad_norm": 2.060661792755127,
+ "learning_rate": 3.2141414141414146e-06,
+ "loss": 1.5367834568023682,
+ "mean_token_accuracy": 0.6442354917526245,
+ "num_tokens": 14499840.0,
+ "step": 885
+ },
+ {
+ "entropy": 1.1536649465560913,
+ "epoch": 1.7898989898989899,
+ "grad_norm": 2.1190037727355957,
+ "learning_rate": 3.2121212121212125e-06,
+ "loss": 1.1588165760040283,
+ "mean_token_accuracy": 0.7039570212364197,
+ "num_tokens": 14516224.0,
+ "step": 886
+ },
+ {
+ "entropy": 1.109966516494751,
+ "epoch": 1.791919191919192,
+ "grad_norm": 2.0320141315460205,
+ "learning_rate": 3.2101010101010104e-06,
+ "loss": 1.1113003492355347,
+ "mean_token_accuracy": 0.7123228907585144,
+ "num_tokens": 14532608.0,
+ "step": 887
+ },
+ {
+ "entropy": 1.5709099769592285,
+ "epoch": 1.793939393939394,
+ "grad_norm": 2.0467336177825928,
+ "learning_rate": 3.2080808080808083e-06,
+ "loss": 1.5823577642440796,
+ "mean_token_accuracy": 0.6404494643211365,
+ "num_tokens": 14548992.0,
+ "step": 888
+ },
+ {
+ "entropy": 1.4305545091629028,
+ "epoch": 1.795959595959596,
+ "grad_norm": 2.0764269828796387,
+ "learning_rate": 3.2060606060606066e-06,
+ "loss": 1.438415765762329,
+ "mean_token_accuracy": 0.6574255228042603,
+ "num_tokens": 14565376.0,
+ "step": 889
+ },
+ {
+ "entropy": 1.3523615598678589,
+ "epoch": 1.797979797979798,
+ "grad_norm": 2.167036294937134,
+ "learning_rate": 3.2040404040404045e-06,
+ "loss": 1.3782477378845215,
+ "mean_token_accuracy": 0.6645090579986572,
+ "num_tokens": 14581760.0,
+ "step": 890
+ },
+ {
+ "entropy": 1.491297721862793,
+ "epoch": 1.8,
+ "grad_norm": 2.3090412616729736,
+ "learning_rate": 3.2020202020202024e-06,
+ "loss": 1.4965641498565674,
+ "mean_token_accuracy": 0.636907696723938,
+ "num_tokens": 14598144.0,
+ "step": 891
+ },
+ {
+ "entropy": 1.2584501504898071,
+ "epoch": 1.802020202020202,
+ "grad_norm": 2.1699554920196533,
+ "learning_rate": 3.2000000000000003e-06,
+ "loss": 1.2622835636138916,
+ "mean_token_accuracy": 0.6901563405990601,
+ "num_tokens": 14614528.0,
+ "step": 892
+ },
+ {
+ "entropy": 2.149350643157959,
+ "epoch": 1.8040404040404039,
+ "grad_norm": 2.2669718265533447,
+ "learning_rate": 3.197979797979798e-06,
+ "loss": 2.167891263961792,
+ "mean_token_accuracy": 0.5497679710388184,
+ "num_tokens": 14630912.0,
+ "step": 893
+ },
+ {
+ "entropy": 1.1999561786651611,
+ "epoch": 1.8060606060606061,
+ "grad_norm": 2.163228988647461,
+ "learning_rate": 3.195959595959596e-06,
+ "loss": 1.2024329900741577,
+ "mean_token_accuracy": 0.7035906314849854,
+ "num_tokens": 14647296.0,
+ "step": 894
+ },
+ {
+ "entropy": 1.770652413368225,
+ "epoch": 1.808080808080808,
+ "grad_norm": 2.1631994247436523,
+ "learning_rate": 3.1939393939393944e-06,
+ "loss": 1.7568567991256714,
+ "mean_token_accuracy": 0.6030776500701904,
+ "num_tokens": 14663680.0,
+ "step": 895
+ },
+ {
+ "entropy": 1.2487529516220093,
+ "epoch": 1.8101010101010102,
+ "grad_norm": 1.987622857093811,
+ "learning_rate": 3.1919191919191923e-06,
+ "loss": 1.255242109298706,
+ "mean_token_accuracy": 0.6929042339324951,
+ "num_tokens": 14680064.0,
+ "step": 896
+ },
+ {
+ "entropy": 1.138524055480957,
+ "epoch": 1.812121212121212,
+ "grad_norm": 2.0367984771728516,
+ "learning_rate": 3.18989898989899e-06,
+ "loss": 1.1514946222305298,
+ "mean_token_accuracy": 0.7093917727470398,
+ "num_tokens": 14696448.0,
+ "step": 897
+ },
+ {
+ "entropy": 1.3337515592575073,
+ "epoch": 1.8141414141414143,
+ "grad_norm": 1.9483140707015991,
+ "learning_rate": 3.187878787878788e-06,
+ "loss": 1.3251439332962036,
+ "mean_token_accuracy": 0.6861260533332825,
+ "num_tokens": 14712832.0,
+ "step": 898
+ },
+ {
+ "entropy": 1.047120451927185,
+ "epoch": 1.816161616161616,
+ "grad_norm": 2.0481390953063965,
+ "learning_rate": 3.185858585858586e-06,
+ "loss": 1.071772575378418,
+ "mean_token_accuracy": 0.7275891304016113,
+ "num_tokens": 14729216.0,
+ "step": 899
+ },
+ {
+ "entropy": 1.3311363458633423,
+ "epoch": 1.8181818181818183,
+ "grad_norm": 2.3203413486480713,
+ "learning_rate": 3.1838383838383842e-06,
+ "loss": 1.334134817123413,
+ "mean_token_accuracy": 0.6643869280815125,
+ "num_tokens": 14745600.0,
+ "step": 900
+ },
+ {
+ "epoch": 1.8181818181818183,
+ "eval_entropy": 1.4476436400605786,
+ "eval_loss": 1.5290467739105225,
+ "eval_mean_token_accuracy": 0.6456143543604882,
+ "eval_num_tokens": 14745600.0,
+ "eval_runtime": 43.8113,
+ "eval_samples_per_second": 22.597,
+ "eval_steps_per_second": 2.83,
+ "step": 900
+ },
+ {
+ "entropy": 1.6842114925384521,
+ "epoch": 1.8202020202020202,
+ "grad_norm": 2.1709823608398438,
+ "learning_rate": 3.181818181818182e-06,
+ "loss": 1.6816682815551758,
+ "mean_token_accuracy": 0.6033830046653748,
+ "num_tokens": 14761984.0,
+ "step": 901
+ },
+ {
+ "entropy": 1.2661798000335693,
+ "epoch": 1.8222222222222222,
+ "grad_norm": 2.113783836364746,
+ "learning_rate": 3.17979797979798e-06,
+ "loss": 1.249183177947998,
+ "mean_token_accuracy": 0.6865534782409668,
+ "num_tokens": 14778368.0,
+ "step": 902
+ },
+ {
+ "entropy": 1.2666339874267578,
+ "epoch": 1.8242424242424242,
+ "grad_norm": 2.0210978984832764,
+ "learning_rate": 3.177777777777778e-06,
+ "loss": 1.2548515796661377,
+ "mean_token_accuracy": 0.686431348323822,
+ "num_tokens": 14794752.0,
+ "step": 903
+ },
+ {
+ "entropy": 1.1660066843032837,
+ "epoch": 1.8262626262626263,
+ "grad_norm": 2.0998034477233887,
+ "learning_rate": 3.1757575757575758e-06,
+ "loss": 1.1654324531555176,
+ "mean_token_accuracy": 0.695713222026825,
+ "num_tokens": 14811136.0,
+ "step": 904
+ },
+ {
+ "entropy": 1.2902735471725464,
+ "epoch": 1.8282828282828283,
+ "grad_norm": 2.1510303020477295,
+ "learning_rate": 3.173737373737374e-06,
+ "loss": 1.2879812717437744,
+ "mean_token_accuracy": 0.6693942546844482,
+ "num_tokens": 14827520.0,
+ "step": 905
+ },
+ {
+ "entropy": 1.1441799402236938,
+ "epoch": 1.8303030303030303,
+ "grad_norm": 1.989449143409729,
+ "learning_rate": 3.171717171717172e-06,
+ "loss": 1.1552281379699707,
+ "mean_token_accuracy": 0.7127503752708435,
+ "num_tokens": 14843904.0,
+ "step": 906
+ },
+ {
+ "entropy": 1.08464515209198,
+ "epoch": 1.8323232323232324,
+ "grad_norm": 2.094696044921875,
+ "learning_rate": 3.16969696969697e-06,
+ "loss": 1.0758531093597412,
+ "mean_token_accuracy": 0.7164142727851868,
+ "num_tokens": 14860288.0,
+ "step": 907
+ },
+ {
+ "entropy": 1.3847618103027344,
+ "epoch": 1.8343434343434344,
+ "grad_norm": 2.207976818084717,
+ "learning_rate": 3.1676767676767678e-06,
+ "loss": 1.3722931146621704,
+ "mean_token_accuracy": 0.6741573214530945,
+ "num_tokens": 14876672.0,
+ "step": 908
+ },
+ {
+ "entropy": 1.3558534383773804,
+ "epoch": 1.8363636363636364,
+ "grad_norm": 2.166674852371216,
+ "learning_rate": 3.1656565656565656e-06,
+ "loss": 1.3612618446350098,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 14893056.0,
+ "step": 909
+ },
+ {
+ "entropy": 1.4160822629928589,
+ "epoch": 1.8383838383838382,
+ "grad_norm": 2.2242727279663086,
+ "learning_rate": 3.1636363636363635e-06,
+ "loss": 1.408278226852417,
+ "mean_token_accuracy": 0.6634098887443542,
+ "num_tokens": 14909440.0,
+ "step": 910
+ },
+ {
+ "entropy": 1.1337573528289795,
+ "epoch": 1.8404040404040405,
+ "grad_norm": 2.1882550716400146,
+ "learning_rate": 3.161616161616162e-06,
+ "loss": 1.1503205299377441,
+ "mean_token_accuracy": 0.7059721350669861,
+ "num_tokens": 14925824.0,
+ "step": 911
+ },
+ {
+ "entropy": 1.4373403787612915,
+ "epoch": 1.8424242424242423,
+ "grad_norm": 2.1595654487609863,
+ "learning_rate": 3.1595959595959597e-06,
+ "loss": 1.4344165325164795,
+ "mean_token_accuracy": 0.6599902510643005,
+ "num_tokens": 14942208.0,
+ "step": 912
+ },
+ {
+ "entropy": 1.0798827409744263,
+ "epoch": 1.8444444444444446,
+ "grad_norm": 2.101088047027588,
+ "learning_rate": 3.1575757575757576e-06,
+ "loss": 1.0873513221740723,
+ "mean_token_accuracy": 0.7169027924537659,
+ "num_tokens": 14958592.0,
+ "step": 913
+ },
+ {
+ "entropy": 1.7024599313735962,
+ "epoch": 1.8464646464646464,
+ "grad_norm": 2.291907548904419,
+ "learning_rate": 3.1555555555555555e-06,
+ "loss": 1.7014999389648438,
+ "mean_token_accuracy": 0.6105275750160217,
+ "num_tokens": 14974976.0,
+ "step": 914
+ },
+ {
+ "entropy": 1.7765953540802002,
+ "epoch": 1.8484848484848486,
+ "grad_norm": 2.1465439796447754,
+ "learning_rate": 3.1535353535353534e-06,
+ "loss": 1.788269281387329,
+ "mean_token_accuracy": 0.6066194176673889,
+ "num_tokens": 14991360.0,
+ "step": 915
+ },
+ {
+ "entropy": 1.5223884582519531,
+ "epoch": 1.8505050505050504,
+ "grad_norm": 2.313291549682617,
+ "learning_rate": 3.1515151515151517e-06,
+ "loss": 1.55397367477417,
+ "mean_token_accuracy": 0.6377626061439514,
+ "num_tokens": 15007744.0,
+ "step": 916
+ },
+ {
+ "entropy": 1.5820955038070679,
+ "epoch": 1.8525252525252527,
+ "grad_norm": 2.094886541366577,
+ "learning_rate": 3.1494949494949496e-06,
+ "loss": 1.58372962474823,
+ "mean_token_accuracy": 0.6339154839515686,
+ "num_tokens": 15024128.0,
+ "step": 917
+ },
+ {
+ "entropy": 1.7399076223373413,
+ "epoch": 1.8545454545454545,
+ "grad_norm": 2.0311105251312256,
+ "learning_rate": 3.1474747474747475e-06,
+ "loss": 1.7362079620361328,
+ "mean_token_accuracy": 0.604421079158783,
+ "num_tokens": 15040512.0,
+ "step": 918
+ },
+ {
+ "entropy": 1.4311537742614746,
+ "epoch": 1.8565656565656565,
+ "grad_norm": 2.13740873336792,
+ "learning_rate": 3.145454545454546e-06,
+ "loss": 1.4574000835418701,
+ "mean_token_accuracy": 0.648876428604126,
+ "num_tokens": 15056896.0,
+ "step": 919
+ },
+ {
+ "entropy": 1.6997709274291992,
+ "epoch": 1.8585858585858586,
+ "grad_norm": 2.1604959964752197,
+ "learning_rate": 3.143434343434344e-06,
+ "loss": 1.694093942642212,
+ "mean_token_accuracy": 0.6144357323646545,
+ "num_tokens": 15073280.0,
+ "step": 920
+ },
+ {
+ "entropy": 1.5796921253204346,
+ "epoch": 1.8606060606060606,
+ "grad_norm": 2.3852932453155518,
+ "learning_rate": 3.141414141414142e-06,
+ "loss": 1.5799579620361328,
+ "mean_token_accuracy": 0.6322667598724365,
+ "num_tokens": 15089664.0,
+ "step": 921
+ },
+ {
+ "entropy": 1.6185977458953857,
+ "epoch": 1.8626262626262626,
+ "grad_norm": 2.0631208419799805,
+ "learning_rate": 3.13939393939394e-06,
+ "loss": 1.6541715860366821,
+ "mean_token_accuracy": 0.632083535194397,
+ "num_tokens": 15106048.0,
+ "step": 922
+ },
+ {
+ "entropy": 1.5872372388839722,
+ "epoch": 1.8646464646464647,
+ "grad_norm": 2.154554843902588,
+ "learning_rate": 3.1373737373737378e-06,
+ "loss": 1.5946767330169678,
+ "mean_token_accuracy": 0.6294577717781067,
+ "num_tokens": 15122432.0,
+ "step": 923
+ },
+ {
+ "entropy": 1.6059986352920532,
+ "epoch": 1.8666666666666667,
+ "grad_norm": 1.9893742799758911,
+ "learning_rate": 3.1353535353535357e-06,
+ "loss": 1.6153039932250977,
+ "mean_token_accuracy": 0.6373962163925171,
+ "num_tokens": 15138816.0,
+ "step": 924
+ },
+ {
+ "entropy": 1.3143881559371948,
+ "epoch": 1.8686868686868687,
+ "grad_norm": 1.8989832401275635,
+ "learning_rate": 3.133333333333334e-06,
+ "loss": 1.3332319259643555,
+ "mean_token_accuracy": 0.6842330098152161,
+ "num_tokens": 15155200.0,
+ "step": 925
+ },
+ {
+ "entropy": 1.0474469661712646,
+ "epoch": 1.8707070707070708,
+ "grad_norm": 1.9129916429519653,
+ "learning_rate": 3.131313131313132e-06,
+ "loss": 1.0238264799118042,
+ "mean_token_accuracy": 0.7459697127342224,
+ "num_tokens": 15171584.0,
+ "step": 926
+ },
+ {
+ "entropy": 1.581508994102478,
+ "epoch": 1.8727272727272726,
+ "grad_norm": 2.0047285556793213,
+ "learning_rate": 3.1292929292929297e-06,
+ "loss": 1.6087100505828857,
+ "mean_token_accuracy": 0.6282364726066589,
+ "num_tokens": 15187968.0,
+ "step": 927
+ },
+ {
+ "entropy": 1.0985661745071411,
+ "epoch": 1.8747474747474748,
+ "grad_norm": 2.1207540035247803,
+ "learning_rate": 3.1272727272727276e-06,
+ "loss": 1.1158297061920166,
+ "mean_token_accuracy": 0.7111626863479614,
+ "num_tokens": 15204352.0,
+ "step": 928
+ },
+ {
+ "entropy": 1.4591490030288696,
+ "epoch": 1.8767676767676766,
+ "grad_norm": 2.2879691123962402,
+ "learning_rate": 3.1252525252525255e-06,
+ "loss": 1.4775316715240479,
+ "mean_token_accuracy": 0.6477161645889282,
+ "num_tokens": 15220736.0,
+ "step": 929
+ },
+ {
+ "entropy": 1.5469937324523926,
+ "epoch": 1.878787878787879,
+ "grad_norm": 2.0972726345062256,
+ "learning_rate": 3.1232323232323234e-06,
+ "loss": 1.5949021577835083,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 15237120.0,
+ "step": 930
+ },
+ {
+ "entropy": 1.363472819328308,
+ "epoch": 1.8808080808080807,
+ "grad_norm": 2.149606943130493,
+ "learning_rate": 3.1212121212121217e-06,
+ "loss": 1.358612298965454,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 15253504.0,
+ "step": 931
+ },
+ {
+ "entropy": 1.189648985862732,
+ "epoch": 1.882828282828283,
+ "grad_norm": 2.2575035095214844,
+ "learning_rate": 3.1191919191919196e-06,
+ "loss": 1.209303379058838,
+ "mean_token_accuracy": 0.7002320289611816,
+ "num_tokens": 15269888.0,
+ "step": 932
+ },
+ {
+ "entropy": 1.3054684400558472,
+ "epoch": 1.8848484848484848,
+ "grad_norm": 2.243915319442749,
+ "learning_rate": 3.1171717171717175e-06,
+ "loss": 1.333367109298706,
+ "mean_token_accuracy": 0.6703712940216064,
+ "num_tokens": 15286272.0,
+ "step": 933
+ },
+ {
+ "entropy": 1.6298167705535889,
+ "epoch": 1.886868686868687,
+ "grad_norm": 1.9654396772384644,
+ "learning_rate": 3.1151515151515154e-06,
+ "loss": 1.6496453285217285,
+ "mean_token_accuracy": 0.6248778700828552,
+ "num_tokens": 15302656.0,
+ "step": 934
+ },
+ {
+ "entropy": 1.1228219270706177,
+ "epoch": 1.8888888888888888,
+ "grad_norm": 2.2492377758026123,
+ "learning_rate": 3.1131313131313133e-06,
+ "loss": 1.1560063362121582,
+ "mean_token_accuracy": 0.699499249458313,
+ "num_tokens": 15319040.0,
+ "step": 935
+ },
+ {
+ "entropy": 1.7481759786605835,
+ "epoch": 1.8909090909090909,
+ "grad_norm": 2.1635665893554688,
+ "learning_rate": 3.1111111111111116e-06,
+ "loss": 1.737868070602417,
+ "mean_token_accuracy": 0.6030776500701904,
+ "num_tokens": 15335424.0,
+ "step": 936
+ },
+ {
+ "entropy": 1.3964993953704834,
+ "epoch": 1.892929292929293,
+ "grad_norm": 2.262946367263794,
+ "learning_rate": 3.1090909090909095e-06,
+ "loss": 1.3927817344665527,
+ "mean_token_accuracy": 0.6546775698661804,
+ "num_tokens": 15351808.0,
+ "step": 937
+ },
+ {
+ "entropy": 1.2503907680511475,
+ "epoch": 1.894949494949495,
+ "grad_norm": 1.9837188720703125,
+ "learning_rate": 3.1070707070707074e-06,
+ "loss": 1.2529189586639404,
+ "mean_token_accuracy": 0.6965681314468384,
+ "num_tokens": 15368192.0,
+ "step": 938
+ },
+ {
+ "entropy": 0.9774144291877747,
+ "epoch": 1.896969696969697,
+ "grad_norm": 1.9201257228851318,
+ "learning_rate": 3.1050505050505052e-06,
+ "loss": 0.9864459037780762,
+ "mean_token_accuracy": 0.7534807324409485,
+ "num_tokens": 15384576.0,
+ "step": 939
+ },
+ {
+ "entropy": 1.4065781831741333,
+ "epoch": 1.898989898989899,
+ "grad_norm": 2.357865571975708,
+ "learning_rate": 3.103030303030303e-06,
+ "loss": 1.428115725517273,
+ "mean_token_accuracy": 0.6493649482727051,
+ "num_tokens": 15400960.0,
+ "step": 940
+ },
+ {
+ "entropy": 1.1632903814315796,
+ "epoch": 1.901010101010101,
+ "grad_norm": 1.8824918270111084,
+ "learning_rate": 3.1010101010101014e-06,
+ "loss": 1.1478252410888672,
+ "mean_token_accuracy": 0.7158036231994629,
+ "num_tokens": 15417344.0,
+ "step": 941
+ },
+ {
+ "entropy": 1.7470908164978027,
+ "epoch": 1.903030303030303,
+ "grad_norm": 2.2958669662475586,
+ "learning_rate": 3.0989898989898993e-06,
+ "loss": 1.7697877883911133,
+ "mean_token_accuracy": 0.5892769694328308,
+ "num_tokens": 15433728.0,
+ "step": 942
+ },
+ {
+ "entropy": 1.2897151708602905,
+ "epoch": 1.905050505050505,
+ "grad_norm": 2.155731439590454,
+ "learning_rate": 3.0969696969696972e-06,
+ "loss": 1.2971919775009155,
+ "mean_token_accuracy": 0.6731802821159363,
+ "num_tokens": 15450112.0,
+ "step": 943
+ },
+ {
+ "entropy": 1.2687026262283325,
+ "epoch": 1.907070707070707,
+ "grad_norm": 2.0896284580230713,
+ "learning_rate": 3.094949494949495e-06,
+ "loss": 1.2423906326293945,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 15466496.0,
+ "step": 944
+ },
+ {
+ "entropy": 1.5710495710372925,
+ "epoch": 1.9090909090909092,
+ "grad_norm": 2.200758457183838,
+ "learning_rate": 3.092929292929293e-06,
+ "loss": 1.5329574346542358,
+ "mean_token_accuracy": 0.6560820937156677,
+ "num_tokens": 15482880.0,
+ "step": 945
+ },
+ {
+ "entropy": 1.1555253267288208,
+ "epoch": 1.911111111111111,
+ "grad_norm": 2.278230905532837,
+ "learning_rate": 3.090909090909091e-06,
+ "loss": 1.1469731330871582,
+ "mean_token_accuracy": 0.7220932841300964,
+ "num_tokens": 15499264.0,
+ "step": 946
+ },
+ {
+ "entropy": 1.2870018482208252,
+ "epoch": 1.9131313131313132,
+ "grad_norm": 1.8973854780197144,
+ "learning_rate": 3.088888888888889e-06,
+ "loss": 1.2787907123565674,
+ "mean_token_accuracy": 0.6885075569152832,
+ "num_tokens": 15515648.0,
+ "step": 947
+ },
+ {
+ "entropy": 1.324872612953186,
+ "epoch": 1.915151515151515,
+ "grad_norm": 2.1889214515686035,
+ "learning_rate": 3.086868686868687e-06,
+ "loss": 1.3286981582641602,
+ "mean_token_accuracy": 0.6743404865264893,
+ "num_tokens": 15532032.0,
+ "step": 948
+ },
+ {
+ "entropy": 1.5601656436920166,
+ "epoch": 1.9171717171717173,
+ "grad_norm": 2.304993152618408,
+ "learning_rate": 3.084848484848485e-06,
+ "loss": 1.5766493082046509,
+ "mean_token_accuracy": 0.6172447204589844,
+ "num_tokens": 15548416.0,
+ "step": 949
+ },
+ {
+ "entropy": 1.4633477926254272,
+ "epoch": 1.9191919191919191,
+ "grad_norm": 1.9083963632583618,
+ "learning_rate": 3.082828282828283e-06,
+ "loss": 1.4554777145385742,
+ "mean_token_accuracy": 0.6667073965072632,
+ "num_tokens": 15564800.0,
+ "step": 950
+ },
+ {
+ "epoch": 1.9191919191919191,
+ "eval_entropy": 1.4443931824737979,
+ "eval_loss": 1.5272752046585083,
+ "eval_mean_token_accuracy": 0.6459201723337173,
+ "eval_num_tokens": 15564800.0,
+ "eval_runtime": 43.7243,
+ "eval_samples_per_second": 22.642,
+ "eval_steps_per_second": 2.836,
+ "step": 950
+ },
+ {
+ "entropy": 1.3350679874420166,
+ "epoch": 1.9212121212121214,
+ "grad_norm": 2.139172315597534,
+ "learning_rate": 3.0808080808080807e-06,
+ "loss": 1.3285927772521973,
+ "mean_token_accuracy": 0.6833781003952026,
+ "num_tokens": 15581184.0,
+ "step": 951
+ },
+ {
+ "entropy": 1.2373814582824707,
+ "epoch": 1.9232323232323232,
+ "grad_norm": 2.1068115234375,
+ "learning_rate": 3.078787878787879e-06,
+ "loss": 1.2527921199798584,
+ "mean_token_accuracy": 0.6969345211982727,
+ "num_tokens": 15597568.0,
+ "step": 952
+ },
+ {
+ "entropy": 1.2182631492614746,
+ "epoch": 1.9252525252525252,
+ "grad_norm": 2.1326634883880615,
+ "learning_rate": 3.076767676767677e-06,
+ "loss": 1.2174904346466064,
+ "mean_token_accuracy": 0.6905227303504944,
+ "num_tokens": 15613952.0,
+ "step": 953
+ },
+ {
+ "entropy": 0.9768888354301453,
+ "epoch": 1.9272727272727272,
+ "grad_norm": 1.9833085536956787,
+ "learning_rate": 3.074747474747475e-06,
+ "loss": 0.9956569671630859,
+ "mean_token_accuracy": 0.7401685118675232,
+ "num_tokens": 15630336.0,
+ "step": 954
+ },
+ {
+ "entropy": 0.7818430066108704,
+ "epoch": 1.9292929292929293,
+ "grad_norm": 1.9219205379486084,
+ "learning_rate": 3.0727272727272727e-06,
+ "loss": 0.7922182083129883,
+ "mean_token_accuracy": 0.7827919125556946,
+ "num_tokens": 15646720.0,
+ "step": 955
+ },
+ {
+ "entropy": 1.6172020435333252,
+ "epoch": 1.9313131313131313,
+ "grad_norm": 1.9390695095062256,
+ "learning_rate": 3.0707070707070706e-06,
+ "loss": 1.6629729270935059,
+ "mean_token_accuracy": 0.6192598938941956,
+ "num_tokens": 15663104.0,
+ "step": 956
+ },
+ {
+ "entropy": 1.291207194328308,
+ "epoch": 1.9333333333333333,
+ "grad_norm": 1.9242857694625854,
+ "learning_rate": 3.068686868686869e-06,
+ "loss": 1.2721552848815918,
+ "mean_token_accuracy": 0.6867367029190063,
+ "num_tokens": 15679488.0,
+ "step": 957
+ },
+ {
+ "entropy": 1.3730298280715942,
+ "epoch": 1.9353535353535354,
+ "grad_norm": 1.9483041763305664,
+ "learning_rate": 3.066666666666667e-06,
+ "loss": 1.3835055828094482,
+ "mean_token_accuracy": 0.6745237112045288,
+ "num_tokens": 15695872.0,
+ "step": 958
+ },
+ {
+ "entropy": 1.1266423463821411,
+ "epoch": 1.9373737373737374,
+ "grad_norm": 2.1663992404937744,
+ "learning_rate": 3.0646464646464647e-06,
+ "loss": 1.1091173887252808,
+ "mean_token_accuracy": 0.7151318788528442,
+ "num_tokens": 15712256.0,
+ "step": 959
+ },
+ {
+ "entropy": 1.298812747001648,
+ "epoch": 1.9393939393939394,
+ "grad_norm": 2.0564448833465576,
+ "learning_rate": 3.0626262626262626e-06,
+ "loss": 1.3167932033538818,
+ "mean_token_accuracy": 0.6812408566474915,
+ "num_tokens": 15728640.0,
+ "step": 960
+ },
+ {
+ "entropy": 1.7007938623428345,
+ "epoch": 1.9414141414141413,
+ "grad_norm": 2.1043670177459717,
+ "learning_rate": 3.0606060606060605e-06,
+ "loss": 1.6956250667572021,
+ "mean_token_accuracy": 0.6194430589675903,
+ "num_tokens": 15745024.0,
+ "step": 961
+ },
+ {
+ "entropy": 1.408955693244934,
+ "epoch": 1.9434343434343435,
+ "grad_norm": 2.0432121753692627,
+ "learning_rate": 3.058585858585859e-06,
+ "loss": 1.3905062675476074,
+ "mean_token_accuracy": 0.6662799119949341,
+ "num_tokens": 15761408.0,
+ "step": 962
+ },
+ {
+ "entropy": 1.938867211341858,
+ "epoch": 1.9454545454545453,
+ "grad_norm": 2.3359744548797607,
+ "learning_rate": 3.056565656565657e-06,
+ "loss": 1.9670305252075195,
+ "mean_token_accuracy": 0.5845139026641846,
+ "num_tokens": 15777792.0,
+ "step": 963
+ },
+ {
+ "entropy": 1.5049448013305664,
+ "epoch": 1.9474747474747476,
+ "grad_norm": 2.1907997131347656,
+ "learning_rate": 3.054545454545455e-06,
+ "loss": 1.534651756286621,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 15794176.0,
+ "step": 964
+ },
+ {
+ "entropy": 1.1916700601577759,
+ "epoch": 1.9494949494949494,
+ "grad_norm": 2.098696231842041,
+ "learning_rate": 3.052525252525253e-06,
+ "loss": 1.191361904144287,
+ "mean_token_accuracy": 0.715192973613739,
+ "num_tokens": 15810560.0,
+ "step": 965
+ },
+ {
+ "entropy": 1.6707743406295776,
+ "epoch": 1.9515151515151516,
+ "grad_norm": 2.106846570968628,
+ "learning_rate": 3.0505050505050508e-06,
+ "loss": 1.6789159774780273,
+ "mean_token_accuracy": 0.6133365631103516,
+ "num_tokens": 15826944.0,
+ "step": 966
+ },
+ {
+ "entropy": 1.4679991006851196,
+ "epoch": 1.9535353535353535,
+ "grad_norm": 2.1568050384521484,
+ "learning_rate": 3.048484848484849e-06,
+ "loss": 1.4427556991577148,
+ "mean_token_accuracy": 0.6526013612747192,
+ "num_tokens": 15843328.0,
+ "step": 967
+ },
+ {
+ "entropy": 0.9881705641746521,
+ "epoch": 1.9555555555555557,
+ "grad_norm": 2.029680013656616,
+ "learning_rate": 3.046464646464647e-06,
+ "loss": 0.9961811304092407,
+ "mean_token_accuracy": 0.7408402562141418,
+ "num_tokens": 15859712.0,
+ "step": 968
+ },
+ {
+ "entropy": 1.0721628665924072,
+ "epoch": 1.9575757575757575,
+ "grad_norm": 1.9763140678405762,
+ "learning_rate": 3.044444444444445e-06,
+ "loss": 1.067029356956482,
+ "mean_token_accuracy": 0.733146071434021,
+ "num_tokens": 15876096.0,
+ "step": 969
+ },
+ {
+ "entropy": 1.7053834199905396,
+ "epoch": 1.9595959595959596,
+ "grad_norm": 2.3659849166870117,
+ "learning_rate": 3.0424242424242427e-06,
+ "loss": 1.7629203796386719,
+ "mean_token_accuracy": 0.6105275750160217,
+ "num_tokens": 15892480.0,
+ "step": 970
+ },
+ {
+ "entropy": 1.8083471059799194,
+ "epoch": 1.9616161616161616,
+ "grad_norm": 2.081869602203369,
+ "learning_rate": 3.0404040404040406e-06,
+ "loss": 1.8430367708206177,
+ "mean_token_accuracy": 0.6009404063224792,
+ "num_tokens": 15908864.0,
+ "step": 971
+ },
+ {
+ "entropy": 1.2576755285263062,
+ "epoch": 1.9636363636363636,
+ "grad_norm": 2.128230571746826,
+ "learning_rate": 3.038383838383839e-06,
+ "loss": 1.2493822574615479,
+ "mean_token_accuracy": 0.6913776397705078,
+ "num_tokens": 15925248.0,
+ "step": 972
+ },
+ {
+ "entropy": 0.8995128273963928,
+ "epoch": 1.9656565656565657,
+ "grad_norm": 2.0216031074523926,
+ "learning_rate": 3.036363636363637e-06,
+ "loss": 0.9069615602493286,
+ "mean_token_accuracy": 0.7620908617973328,
+ "num_tokens": 15941632.0,
+ "step": 973
+ },
+ {
+ "entropy": 1.615832805633545,
+ "epoch": 1.9676767676767677,
+ "grad_norm": 2.26552152633667,
+ "learning_rate": 3.0343434343434347e-06,
+ "loss": 1.6284873485565186,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 15958016.0,
+ "step": 974
+ },
+ {
+ "entropy": 1.404674768447876,
+ "epoch": 1.9696969696969697,
+ "grad_norm": 2.1790690422058105,
+ "learning_rate": 3.0323232323232326e-06,
+ "loss": 1.4130914211273193,
+ "mean_token_accuracy": 0.6594406366348267,
+ "num_tokens": 15974400.0,
+ "step": 975
+ },
+ {
+ "entropy": 1.3440049886703491,
+ "epoch": 1.9717171717171718,
+ "grad_norm": 2.121338367462158,
+ "learning_rate": 3.0303030303030305e-06,
+ "loss": 1.3652238845825195,
+ "mean_token_accuracy": 0.6794699430465698,
+ "num_tokens": 15990784.0,
+ "step": 976
+ },
+ {
+ "entropy": 1.0894689559936523,
+ "epoch": 1.9737373737373738,
+ "grad_norm": 2.0155327320098877,
+ "learning_rate": 3.028282828282829e-06,
+ "loss": 1.0642526149749756,
+ "mean_token_accuracy": 0.7223986387252808,
+ "num_tokens": 16007168.0,
+ "step": 977
+ },
+ {
+ "entropy": 1.469588041305542,
+ "epoch": 1.9757575757575756,
+ "grad_norm": 2.2047550678253174,
+ "learning_rate": 3.0262626262626267e-06,
+ "loss": 1.498295545578003,
+ "mean_token_accuracy": 0.6441133618354797,
+ "num_tokens": 16023552.0,
+ "step": 978
+ },
+ {
+ "entropy": 1.6617093086242676,
+ "epoch": 1.9777777777777779,
+ "grad_norm": 1.9770722389221191,
+ "learning_rate": 3.0242424242424246e-06,
+ "loss": 1.6753556728363037,
+ "mean_token_accuracy": 0.6284807324409485,
+ "num_tokens": 16039936.0,
+ "step": 979
+ },
+ {
+ "entropy": 1.8029206991195679,
+ "epoch": 1.9797979797979797,
+ "grad_norm": 2.2365968227386475,
+ "learning_rate": 3.0222222222222225e-06,
+ "loss": 1.7957369089126587,
+ "mean_token_accuracy": 0.601062536239624,
+ "num_tokens": 16056320.0,
+ "step": 980
+ },
+ {
+ "entropy": 1.6331384181976318,
+ "epoch": 1.981818181818182,
+ "grad_norm": 2.0565884113311768,
+ "learning_rate": 3.0202020202020203e-06,
+ "loss": 1.673048973083496,
+ "mean_token_accuracy": 0.6203590631484985,
+ "num_tokens": 16072704.0,
+ "step": 981
+ },
+ {
+ "entropy": 1.1730273962020874,
+ "epoch": 1.9838383838383837,
+ "grad_norm": 2.0347228050231934,
+ "learning_rate": 3.0181818181818182e-06,
+ "loss": 1.1709872484207153,
+ "mean_token_accuracy": 0.7086589932441711,
+ "num_tokens": 16089088.0,
+ "step": 982
+ },
+ {
+ "entropy": 1.1109111309051514,
+ "epoch": 1.985858585858586,
+ "grad_norm": 1.9992051124572754,
+ "learning_rate": 3.0161616161616165e-06,
+ "loss": 1.097399353981018,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 16105472.0,
+ "step": 983
+ },
+ {
+ "entropy": 1.2580686807632446,
+ "epoch": 1.9878787878787878,
+ "grad_norm": 2.1748640537261963,
+ "learning_rate": 3.0141414141414144e-06,
+ "loss": 1.2503113746643066,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 16121856.0,
+ "step": 984
+ },
+ {
+ "entropy": 1.4884002208709717,
+ "epoch": 1.98989898989899,
+ "grad_norm": 2.3283042907714844,
+ "learning_rate": 3.0121212121212123e-06,
+ "loss": 1.4856922626495361,
+ "mean_token_accuracy": 0.6461895704269409,
+ "num_tokens": 16138240.0,
+ "step": 985
+ },
+ {
+ "entropy": 1.6224603652954102,
+ "epoch": 1.9919191919191919,
+ "grad_norm": 2.0596823692321777,
+ "learning_rate": 3.0101010101010102e-06,
+ "loss": 1.6202584505081177,
+ "mean_token_accuracy": 0.6388617753982544,
+ "num_tokens": 16154624.0,
+ "step": 986
+ },
+ {
+ "entropy": 1.559553623199463,
+ "epoch": 1.993939393939394,
+ "grad_norm": 2.100667953491211,
+ "learning_rate": 3.008080808080808e-06,
+ "loss": 1.5781179666519165,
+ "mean_token_accuracy": 0.6409379839897156,
+ "num_tokens": 16171008.0,
+ "step": 987
+ },
+ {
+ "entropy": 1.299710750579834,
+ "epoch": 1.995959595959596,
+ "grad_norm": 2.2846767902374268,
+ "learning_rate": 3.0060606060606064e-06,
+ "loss": 1.2758262157440186,
+ "mean_token_accuracy": 0.6882632970809937,
+ "num_tokens": 16187392.0,
+ "step": 988
+ },
+ {
+ "entropy": 1.3966935873031616,
+ "epoch": 1.997979797979798,
+ "grad_norm": 2.1244044303894043,
+ "learning_rate": 3.0040404040404043e-06,
+ "loss": 1.420769214630127,
+ "mean_token_accuracy": 0.6670737862586975,
+ "num_tokens": 16203776.0,
+ "step": 989
+ },
+ {
+ "entropy": 1.5851658582687378,
+ "epoch": 2.0,
+ "grad_norm": 2.277179002761841,
+ "learning_rate": 3.002020202020202e-06,
+ "loss": 1.5963382720947266,
+ "mean_token_accuracy": 0.6276868581771851,
+ "num_tokens": 16220160.0,
+ "step": 990
+ },
+ {
+ "entropy": 1.9146819114685059,
+ "epoch": 2.002020202020202,
+ "grad_norm": 2.0008981227874756,
+ "learning_rate": 3e-06,
+ "loss": 1.8820562362670898,
+ "mean_token_accuracy": 0.5895212292671204,
+ "num_tokens": 16236544.0,
+ "step": 991
+ },
+ {
+ "entropy": 1.3451478481292725,
+ "epoch": 2.004040404040404,
+ "grad_norm": 2.236388921737671,
+ "learning_rate": 2.997979797979798e-06,
+ "loss": 1.2709381580352783,
+ "mean_token_accuracy": 0.6848436594009399,
+ "num_tokens": 16252928.0,
+ "step": 992
+ },
+ {
+ "entropy": 1.4454528093338013,
+ "epoch": 2.006060606060606,
+ "grad_norm": 2.220324754714966,
+ "learning_rate": 2.9959595959595963e-06,
+ "loss": 1.387961506843567,
+ "mean_token_accuracy": 0.6642647981643677,
+ "num_tokens": 16269312.0,
+ "step": 993
+ },
+ {
+ "entropy": 1.2083219289779663,
+ "epoch": 2.008080808080808,
+ "grad_norm": 2.092430830001831,
+ "learning_rate": 2.993939393939394e-06,
+ "loss": 1.1450953483581543,
+ "mean_token_accuracy": 0.7159257531166077,
+ "num_tokens": 16285696.0,
+ "step": 994
+ },
+ {
+ "entropy": 1.3030426502227783,
+ "epoch": 2.01010101010101,
+ "grad_norm": 2.0722665786743164,
+ "learning_rate": 2.991919191919192e-06,
+ "loss": 1.2463462352752686,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 16302080.0,
+ "step": 995
+ },
+ {
+ "entropy": 1.3418742418289185,
+ "epoch": 2.012121212121212,
+ "grad_norm": 1.9004424810409546,
+ "learning_rate": 2.98989898989899e-06,
+ "loss": 1.3043954372406006,
+ "mean_token_accuracy": 0.6850268840789795,
+ "num_tokens": 16318464.0,
+ "step": 996
+ },
+ {
+ "entropy": 1.6736825704574585,
+ "epoch": 2.014141414141414,
+ "grad_norm": 2.132983446121216,
+ "learning_rate": 2.987878787878788e-06,
+ "loss": 1.631580114364624,
+ "mean_token_accuracy": 0.619076669216156,
+ "num_tokens": 16334848.0,
+ "step": 997
+ },
+ {
+ "entropy": 1.435375690460205,
+ "epoch": 2.0161616161616163,
+ "grad_norm": 2.2508206367492676,
+ "learning_rate": 2.9858585858585857e-06,
+ "loss": 1.3867809772491455,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 16351232.0,
+ "step": 998
+ },
+ {
+ "entropy": 1.050812005996704,
+ "epoch": 2.018181818181818,
+ "grad_norm": 1.878668189048767,
+ "learning_rate": 2.983838383838384e-06,
+ "loss": 1.0428903102874756,
+ "mean_token_accuracy": 0.7329018115997314,
+ "num_tokens": 16367616.0,
+ "step": 999
+ },
+ {
+ "entropy": 1.325859546661377,
+ "epoch": 2.0202020202020203,
+ "grad_norm": 1.8450349569320679,
+ "learning_rate": 2.981818181818182e-06,
+ "loss": 1.302099347114563,
+ "mean_token_accuracy": 0.6926599740982056,
+ "num_tokens": 16384000.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.0202020202020203,
+ "eval_entropy": 1.3899660999736478,
+ "eval_loss": 1.5310550928115845,
+ "eval_mean_token_accuracy": 0.6458596015168775,
+ "eval_num_tokens": 16384000.0,
+ "eval_runtime": 43.8845,
+ "eval_samples_per_second": 22.559,
+ "eval_steps_per_second": 2.826,
+ "step": 1000
+ },
+ {
+ "entropy": 1.5226235389709473,
+ "epoch": 2.022222222222222,
+ "grad_norm": 2.0676803588867188,
+ "learning_rate": 2.97979797979798e-06,
+ "loss": 1.4971344470977783,
+ "mean_token_accuracy": 0.6517464518547058,
+ "num_tokens": 16400384.0,
+ "step": 1001
+ },
+ {
+ "entropy": 0.9506940841674805,
+ "epoch": 2.0242424242424244,
+ "grad_norm": 1.972718596458435,
+ "learning_rate": 2.9777777777777777e-06,
+ "loss": 0.9229776859283447,
+ "mean_token_accuracy": 0.7554958462715149,
+ "num_tokens": 16416768.0,
+ "step": 1002
+ },
+ {
+ "entropy": 1.8095428943634033,
+ "epoch": 2.026262626262626,
+ "grad_norm": 2.119502305984497,
+ "learning_rate": 2.9757575757575756e-06,
+ "loss": 1.8333206176757812,
+ "mean_token_accuracy": 0.5888495445251465,
+ "num_tokens": 16433152.0,
+ "step": 1003
+ },
+ {
+ "entropy": 1.110617756843567,
+ "epoch": 2.0282828282828285,
+ "grad_norm": 2.1480863094329834,
+ "learning_rate": 2.9737373737373743e-06,
+ "loss": 1.0999674797058105,
+ "mean_token_accuracy": 0.7213605046272278,
+ "num_tokens": 16449536.0,
+ "step": 1004
+ },
+ {
+ "entropy": 1.1889066696166992,
+ "epoch": 2.0303030303030303,
+ "grad_norm": 2.1086478233337402,
+ "learning_rate": 2.971717171717172e-06,
+ "loss": 1.2093305587768555,
+ "mean_token_accuracy": 0.7071323990821838,
+ "num_tokens": 16465920.0,
+ "step": 1005
+ },
+ {
+ "entropy": 1.2134279012680054,
+ "epoch": 2.0323232323232325,
+ "grad_norm": 2.020108461380005,
+ "learning_rate": 2.96969696969697e-06,
+ "loss": 1.2015900611877441,
+ "mean_token_accuracy": 0.7037127614021301,
+ "num_tokens": 16482304.0,
+ "step": 1006
+ },
+ {
+ "entropy": 1.1034245491027832,
+ "epoch": 2.0343434343434343,
+ "grad_norm": 2.1722943782806396,
+ "learning_rate": 2.967676767676768e-06,
+ "loss": 1.1243445873260498,
+ "mean_token_accuracy": 0.7051172256469727,
+ "num_tokens": 16498688.0,
+ "step": 1007
+ },
+ {
+ "entropy": 1.6888902187347412,
+ "epoch": 2.036363636363636,
+ "grad_norm": 2.1574206352233887,
+ "learning_rate": 2.9656565656565663e-06,
+ "loss": 1.7164931297302246,
+ "mean_token_accuracy": 0.6174889802932739,
+ "num_tokens": 16515072.0,
+ "step": 1008
+ },
+ {
+ "entropy": 0.8055605292320251,
+ "epoch": 2.0383838383838384,
+ "grad_norm": 1.8896156549453735,
+ "learning_rate": 2.963636363636364e-06,
+ "loss": 0.7961650490760803,
+ "mean_token_accuracy": 0.7895700931549072,
+ "num_tokens": 16531456.0,
+ "step": 1009
+ },
+ {
+ "entropy": 1.7698009014129639,
+ "epoch": 2.04040404040404,
+ "grad_norm": 2.1700897216796875,
+ "learning_rate": 2.961616161616162e-06,
+ "loss": 1.7871267795562744,
+ "mean_token_accuracy": 0.6139472126960754,
+ "num_tokens": 16547840.0,
+ "step": 1010
+ },
+ {
+ "entropy": 1.414292335510254,
+ "epoch": 2.0424242424242425,
+ "grad_norm": 2.0185277462005615,
+ "learning_rate": 2.95959595959596e-06,
+ "loss": 1.4295077323913574,
+ "mean_token_accuracy": 0.6670126914978027,
+ "num_tokens": 16564224.0,
+ "step": 1011
+ },
+ {
+ "entropy": 1.4013340473175049,
+ "epoch": 2.0444444444444443,
+ "grad_norm": 2.1133840084075928,
+ "learning_rate": 2.957575757575758e-06,
+ "loss": 1.4482200145721436,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 16580608.0,
+ "step": 1012
+ },
+ {
+ "entropy": 1.342740774154663,
+ "epoch": 2.0464646464646465,
+ "grad_norm": 2.0520355701446533,
+ "learning_rate": 2.955555555555556e-06,
+ "loss": 1.3550419807434082,
+ "mean_token_accuracy": 0.6850879192352295,
+ "num_tokens": 16596992.0,
+ "step": 1013
+ },
+ {
+ "entropy": 1.2301024198532104,
+ "epoch": 2.0484848484848484,
+ "grad_norm": 2.1948137283325195,
+ "learning_rate": 2.953535353535354e-06,
+ "loss": 1.243154525756836,
+ "mean_token_accuracy": 0.6838055849075317,
+ "num_tokens": 16613376.0,
+ "step": 1014
+ },
+ {
+ "entropy": 1.3916606903076172,
+ "epoch": 2.0505050505050506,
+ "grad_norm": 2.241595506668091,
+ "learning_rate": 2.951515151515152e-06,
+ "loss": 1.4011318683624268,
+ "mean_token_accuracy": 0.664631187915802,
+ "num_tokens": 16629760.0,
+ "step": 1015
+ },
+ {
+ "entropy": 1.4715481996536255,
+ "epoch": 2.0525252525252524,
+ "grad_norm": 2.224256753921509,
+ "learning_rate": 2.94949494949495e-06,
+ "loss": 1.5011882781982422,
+ "mean_token_accuracy": 0.6493038535118103,
+ "num_tokens": 16646144.0,
+ "step": 1016
+ },
+ {
+ "entropy": 1.1261032819747925,
+ "epoch": 2.0545454545454547,
+ "grad_norm": 2.2784500122070312,
+ "learning_rate": 2.9474747474747477e-06,
+ "loss": 1.1250882148742676,
+ "mean_token_accuracy": 0.7178798317909241,
+ "num_tokens": 16662528.0,
+ "step": 1017
+ },
+ {
+ "entropy": 1.782008171081543,
+ "epoch": 2.0565656565656565,
+ "grad_norm": 2.1711416244506836,
+ "learning_rate": 2.9454545454545456e-06,
+ "loss": 1.8037612438201904,
+ "mean_token_accuracy": 0.6113824844360352,
+ "num_tokens": 16678912.0,
+ "step": 1018
+ },
+ {
+ "entropy": 1.521897315979004,
+ "epoch": 2.0585858585858587,
+ "grad_norm": 2.1903202533721924,
+ "learning_rate": 2.943434343434344e-06,
+ "loss": 1.5377610921859741,
+ "mean_token_accuracy": 0.642953097820282,
+ "num_tokens": 16695296.0,
+ "step": 1019
+ },
+ {
+ "entropy": 1.3112438917160034,
+ "epoch": 2.0606060606060606,
+ "grad_norm": 2.0299105644226074,
+ "learning_rate": 2.941414141414142e-06,
+ "loss": 1.3218681812286377,
+ "mean_token_accuracy": 0.6842941045761108,
+ "num_tokens": 16711680.0,
+ "step": 1020
+ },
+ {
+ "entropy": 1.3634895086288452,
+ "epoch": 2.062626262626263,
+ "grad_norm": 2.2818808555603027,
+ "learning_rate": 2.9393939393939397e-06,
+ "loss": 1.3611259460449219,
+ "mean_token_accuracy": 0.6758060455322266,
+ "num_tokens": 16728064.0,
+ "step": 1021
+ },
+ {
+ "entropy": 1.361467957496643,
+ "epoch": 2.0646464646464646,
+ "grad_norm": 2.290698289871216,
+ "learning_rate": 2.9373737373737376e-06,
+ "loss": 1.3082963228225708,
+ "mean_token_accuracy": 0.6809965968132019,
+ "num_tokens": 16744448.0,
+ "step": 1022
+ },
+ {
+ "entropy": 1.633399486541748,
+ "epoch": 2.066666666666667,
+ "grad_norm": 2.1775712966918945,
+ "learning_rate": 2.9353535353535355e-06,
+ "loss": 1.6423053741455078,
+ "mean_token_accuracy": 0.639655590057373,
+ "num_tokens": 16760832.0,
+ "step": 1023
+ },
+ {
+ "entropy": 1.4717872142791748,
+ "epoch": 2.0686868686868687,
+ "grad_norm": 2.2070701122283936,
+ "learning_rate": 2.9333333333333338e-06,
+ "loss": 1.508943796157837,
+ "mean_token_accuracy": 0.6469223499298096,
+ "num_tokens": 16777216.0,
+ "step": 1024
+ },
+ {
+ "entropy": 1.1494653224945068,
+ "epoch": 2.0707070707070705,
+ "grad_norm": 2.0239098072052,
+ "learning_rate": 2.9313131313131317e-06,
+ "loss": 1.1367695331573486,
+ "mean_token_accuracy": 0.7148265838623047,
+ "num_tokens": 16793600.0,
+ "step": 1025
+ },
+ {
+ "entropy": 1.0235252380371094,
+ "epoch": 2.0727272727272728,
+ "grad_norm": 2.071176052093506,
+ "learning_rate": 2.9292929292929295e-06,
+ "loss": 1.0369395017623901,
+ "mean_token_accuracy": 0.7396799921989441,
+ "num_tokens": 16809984.0,
+ "step": 1026
+ },
+ {
+ "entropy": 1.2325578927993774,
+ "epoch": 2.0747474747474746,
+ "grad_norm": 2.212671995162964,
+ "learning_rate": 2.9272727272727274e-06,
+ "loss": 1.2429314851760864,
+ "mean_token_accuracy": 0.688568651676178,
+ "num_tokens": 16826368.0,
+ "step": 1027
+ },
+ {
+ "entropy": 1.2879300117492676,
+ "epoch": 2.076767676767677,
+ "grad_norm": 2.0366690158843994,
+ "learning_rate": 2.9252525252525253e-06,
+ "loss": 1.2931241989135742,
+ "mean_token_accuracy": 0.6813018918037415,
+ "num_tokens": 16842752.0,
+ "step": 1028
+ },
+ {
+ "entropy": 0.9473312497138977,
+ "epoch": 2.0787878787878786,
+ "grad_norm": 2.0870468616485596,
+ "learning_rate": 2.9232323232323236e-06,
+ "loss": 0.9292516708374023,
+ "mean_token_accuracy": 0.7525036931037903,
+ "num_tokens": 16859136.0,
+ "step": 1029
+ },
+ {
+ "entropy": 1.3882765769958496,
+ "epoch": 2.080808080808081,
+ "grad_norm": 2.1285617351531982,
+ "learning_rate": 2.9212121212121215e-06,
+ "loss": 1.3798363208770752,
+ "mean_token_accuracy": 0.6768441796302795,
+ "num_tokens": 16875520.0,
+ "step": 1030
+ },
+ {
+ "entropy": 1.3588547706604004,
+ "epoch": 2.0828282828282827,
+ "grad_norm": 2.2275242805480957,
+ "learning_rate": 2.9191919191919194e-06,
+ "loss": 1.3538521528244019,
+ "mean_token_accuracy": 0.6615168452262878,
+ "num_tokens": 16891904.0,
+ "step": 1031
+ },
+ {
+ "entropy": 1.0415440797805786,
+ "epoch": 2.084848484848485,
+ "grad_norm": 2.2782297134399414,
+ "learning_rate": 2.9171717171717173e-06,
+ "loss": 1.03328537940979,
+ "mean_token_accuracy": 0.7577552795410156,
+ "num_tokens": 16908288.0,
+ "step": 1032
+ },
+ {
+ "entropy": 1.241741418838501,
+ "epoch": 2.0868686868686868,
+ "grad_norm": 2.141939163208008,
+ "learning_rate": 2.915151515151515e-06,
+ "loss": 1.2248635292053223,
+ "mean_token_accuracy": 0.6950415372848511,
+ "num_tokens": 16924672.0,
+ "step": 1033
+ },
+ {
+ "entropy": 1.1192725896835327,
+ "epoch": 2.088888888888889,
+ "grad_norm": 1.9980862140655518,
+ "learning_rate": 2.913131313131313e-06,
+ "loss": 1.1176412105560303,
+ "mean_token_accuracy": 0.7272838354110718,
+ "num_tokens": 16941056.0,
+ "step": 1034
+ },
+ {
+ "entropy": 1.1871322393417358,
+ "epoch": 2.090909090909091,
+ "grad_norm": 2.1212220191955566,
+ "learning_rate": 2.9111111111111114e-06,
+ "loss": 1.1670379638671875,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 16957440.0,
+ "step": 1035
+ },
+ {
+ "entropy": 1.5194982290267944,
+ "epoch": 2.092929292929293,
+ "grad_norm": 2.2593677043914795,
+ "learning_rate": 2.9090909090909093e-06,
+ "loss": 1.50520920753479,
+ "mean_token_accuracy": 0.6475940346717834,
+ "num_tokens": 16973824.0,
+ "step": 1036
+ },
+ {
+ "entropy": 1.212785243988037,
+ "epoch": 2.094949494949495,
+ "grad_norm": 2.221132278442383,
+ "learning_rate": 2.907070707070707e-06,
+ "loss": 1.206315040588379,
+ "mean_token_accuracy": 0.7046898007392883,
+ "num_tokens": 16990208.0,
+ "step": 1037
+ },
+ {
+ "entropy": 1.2913068532943726,
+ "epoch": 2.096969696969697,
+ "grad_norm": 2.0525012016296387,
+ "learning_rate": 2.905050505050505e-06,
+ "loss": 1.2987749576568604,
+ "mean_token_accuracy": 0.6894235610961914,
+ "num_tokens": 17006592.0,
+ "step": 1038
+ },
+ {
+ "entropy": 1.139485239982605,
+ "epoch": 2.098989898989899,
+ "grad_norm": 2.093764543533325,
+ "learning_rate": 2.903030303030303e-06,
+ "loss": 1.1460036039352417,
+ "mean_token_accuracy": 0.7205055952072144,
+ "num_tokens": 17022976.0,
+ "step": 1039
+ },
+ {
+ "entropy": 1.3781968355178833,
+ "epoch": 2.101010101010101,
+ "grad_norm": 2.095311164855957,
+ "learning_rate": 2.9010101010101012e-06,
+ "loss": 1.3901969194412231,
+ "mean_token_accuracy": 0.679286777973175,
+ "num_tokens": 17039360.0,
+ "step": 1040
+ },
+ {
+ "entropy": 1.1370116472244263,
+ "epoch": 2.103030303030303,
+ "grad_norm": 2.139094352722168,
+ "learning_rate": 2.898989898989899e-06,
+ "loss": 1.1491400003433228,
+ "mean_token_accuracy": 0.72007817029953,
+ "num_tokens": 17055744.0,
+ "step": 1041
+ },
+ {
+ "entropy": 1.0845732688903809,
+ "epoch": 2.105050505050505,
+ "grad_norm": 2.180278778076172,
+ "learning_rate": 2.896969696969697e-06,
+ "loss": 1.0764763355255127,
+ "mean_token_accuracy": 0.7365657091140747,
+ "num_tokens": 17072128.0,
+ "step": 1042
+ },
+ {
+ "entropy": 1.4869064092636108,
+ "epoch": 2.107070707070707,
+ "grad_norm": 2.053727388381958,
+ "learning_rate": 2.894949494949495e-06,
+ "loss": 1.4862562417984009,
+ "mean_token_accuracy": 0.6643258333206177,
+ "num_tokens": 17088512.0,
+ "step": 1043
+ },
+ {
+ "entropy": 1.048888921737671,
+ "epoch": 2.109090909090909,
+ "grad_norm": 2.1302237510681152,
+ "learning_rate": 2.892929292929293e-06,
+ "loss": 1.0331683158874512,
+ "mean_token_accuracy": 0.7388250827789307,
+ "num_tokens": 17104896.0,
+ "step": 1044
+ },
+ {
+ "entropy": 1.2839856147766113,
+ "epoch": 2.111111111111111,
+ "grad_norm": 2.8510677814483643,
+ "learning_rate": 2.8909090909090907e-06,
+ "loss": 1.3016979694366455,
+ "mean_token_accuracy": 0.6904616355895996,
+ "num_tokens": 17121280.0,
+ "step": 1045
+ },
+ {
+ "entropy": 1.050045371055603,
+ "epoch": 2.113131313131313,
+ "grad_norm": 2.2457358837127686,
+ "learning_rate": 2.888888888888889e-06,
+ "loss": 1.0580981969833374,
+ "mean_token_accuracy": 0.7221543788909912,
+ "num_tokens": 17137664.0,
+ "step": 1046
+ },
+ {
+ "entropy": 1.3087437152862549,
+ "epoch": 2.1151515151515152,
+ "grad_norm": 2.0929996967315674,
+ "learning_rate": 2.8868686868686873e-06,
+ "loss": 1.2914986610412598,
+ "mean_token_accuracy": 0.6939423680305481,
+ "num_tokens": 17154048.0,
+ "step": 1047
+ },
+ {
+ "entropy": 1.7247086763381958,
+ "epoch": 2.117171717171717,
+ "grad_norm": 2.2230091094970703,
+ "learning_rate": 2.884848484848485e-06,
+ "loss": 1.7394956350326538,
+ "mean_token_accuracy": 0.6131533980369568,
+ "num_tokens": 17170432.0,
+ "step": 1048
+ },
+ {
+ "entropy": 1.5816357135772705,
+ "epoch": 2.1191919191919193,
+ "grad_norm": 2.196422576904297,
+ "learning_rate": 2.8828282828282835e-06,
+ "loss": 1.6226823329925537,
+ "mean_token_accuracy": 0.6375183463096619,
+ "num_tokens": 17186816.0,
+ "step": 1049
+ },
+ {
+ "entropy": 1.2316261529922485,
+ "epoch": 2.121212121212121,
+ "grad_norm": 2.173909902572632,
+ "learning_rate": 2.8808080808080814e-06,
+ "loss": 1.2228440046310425,
+ "mean_token_accuracy": 0.6940034031867981,
+ "num_tokens": 17203200.0,
+ "step": 1050
+ },
+ {
+ "epoch": 2.121212121212121,
+ "eval_entropy": 1.3722701356295617,
+ "eval_loss": 1.5385833978652954,
+ "eval_mean_token_accuracy": 0.6450051809510877,
+ "eval_num_tokens": 17203200.0,
+ "eval_runtime": 43.9186,
+ "eval_samples_per_second": 22.542,
+ "eval_steps_per_second": 2.823,
+ "step": 1050
+ },
+ {
+ "entropy": 1.3023537397384644,
+ "epoch": 2.1232323232323234,
+ "grad_norm": 2.1490018367767334,
+ "learning_rate": 2.8787878787878793e-06,
+ "loss": 1.284008264541626,
+ "mean_token_accuracy": 0.7057278752326965,
+ "num_tokens": 17219584.0,
+ "step": 1051
+ },
+ {
+ "entropy": 1.3198270797729492,
+ "epoch": 2.125252525252525,
+ "grad_norm": 2.582298994064331,
+ "learning_rate": 2.876767676767677e-06,
+ "loss": 1.3185001611709595,
+ "mean_token_accuracy": 0.6772105693817139,
+ "num_tokens": 17235968.0,
+ "step": 1052
+ },
+ {
+ "entropy": 0.8889825940132141,
+ "epoch": 2.1272727272727274,
+ "grad_norm": 2.0617194175720215,
+ "learning_rate": 2.874747474747475e-06,
+ "loss": 0.889773964881897,
+ "mean_token_accuracy": 0.767892062664032,
+ "num_tokens": 17252352.0,
+ "step": 1053
+ },
+ {
+ "entropy": 1.5485399961471558,
+ "epoch": 2.1292929292929292,
+ "grad_norm": 2.2752370834350586,
+ "learning_rate": 2.872727272727273e-06,
+ "loss": 1.5542051792144775,
+ "mean_token_accuracy": 0.6397166848182678,
+ "num_tokens": 17268736.0,
+ "step": 1054
+ },
+ {
+ "entropy": 1.3949565887451172,
+ "epoch": 2.1313131313131315,
+ "grad_norm": 2.0112996101379395,
+ "learning_rate": 2.8707070707070713e-06,
+ "loss": 1.4111721515655518,
+ "mean_token_accuracy": 0.6659746170043945,
+ "num_tokens": 17285120.0,
+ "step": 1055
+ },
+ {
+ "entropy": 1.0529720783233643,
+ "epoch": 2.1333333333333333,
+ "grad_norm": 2.2219948768615723,
+ "learning_rate": 2.868686868686869e-06,
+ "loss": 1.0484942197799683,
+ "mean_token_accuracy": 0.7224596738815308,
+ "num_tokens": 17301504.0,
+ "step": 1056
+ },
+ {
+ "entropy": 1.5362433195114136,
+ "epoch": 2.1353535353535356,
+ "grad_norm": 2.4097044467926025,
+ "learning_rate": 2.866666666666667e-06,
+ "loss": 1.5809426307678223,
+ "mean_token_accuracy": 0.6266487836837769,
+ "num_tokens": 17317888.0,
+ "step": 1057
+ },
+ {
+ "entropy": 1.6682685613632202,
+ "epoch": 2.1373737373737374,
+ "grad_norm": 2.121086359024048,
+ "learning_rate": 2.864646464646465e-06,
+ "loss": 1.6636815071105957,
+ "mean_token_accuracy": 0.6317782402038574,
+ "num_tokens": 17334272.0,
+ "step": 1058
+ },
+ {
+ "entropy": 1.5480221509933472,
+ "epoch": 2.1393939393939396,
+ "grad_norm": 2.2226176261901855,
+ "learning_rate": 2.862626262626263e-06,
+ "loss": 1.535983681678772,
+ "mean_token_accuracy": 0.6623717546463013,
+ "num_tokens": 17350656.0,
+ "step": 1059
+ },
+ {
+ "entropy": 1.3323101997375488,
+ "epoch": 2.1414141414141414,
+ "grad_norm": 2.2644572257995605,
+ "learning_rate": 2.860606060606061e-06,
+ "loss": 1.3316677808761597,
+ "mean_token_accuracy": 0.6741573214530945,
+ "num_tokens": 17367040.0,
+ "step": 1060
+ },
+ {
+ "entropy": 1.5107028484344482,
+ "epoch": 2.1434343434343432,
+ "grad_norm": 2.1291613578796387,
+ "learning_rate": 2.858585858585859e-06,
+ "loss": 1.4996232986450195,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 17383424.0,
+ "step": 1061
+ },
+ {
+ "entropy": 1.5927387475967407,
+ "epoch": 2.1454545454545455,
+ "grad_norm": 2.1977617740631104,
+ "learning_rate": 2.856565656565657e-06,
+ "loss": 1.582688331604004,
+ "mean_token_accuracy": 0.6306790709495544,
+ "num_tokens": 17399808.0,
+ "step": 1062
+ },
+ {
+ "entropy": 1.0717219114303589,
+ "epoch": 2.1474747474747473,
+ "grad_norm": 2.2494494915008545,
+ "learning_rate": 2.8545454545454548e-06,
+ "loss": 1.0780384540557861,
+ "mean_token_accuracy": 0.7214826345443726,
+ "num_tokens": 17416192.0,
+ "step": 1063
+ },
+ {
+ "entropy": 1.484608769416809,
+ "epoch": 2.1494949494949496,
+ "grad_norm": 2.20664644241333,
+ "learning_rate": 2.8525252525252527e-06,
+ "loss": 1.5074207782745361,
+ "mean_token_accuracy": 0.6502808928489685,
+ "num_tokens": 17432576.0,
+ "step": 1064
+ },
+ {
+ "entropy": 1.6607396602630615,
+ "epoch": 2.1515151515151514,
+ "grad_norm": 2.123538017272949,
+ "learning_rate": 2.850505050505051e-06,
+ "loss": 1.659307837486267,
+ "mean_token_accuracy": 0.619076669216156,
+ "num_tokens": 17448960.0,
+ "step": 1065
+ },
+ {
+ "entropy": 1.1195216178894043,
+ "epoch": 2.1535353535353536,
+ "grad_norm": 2.037261486053467,
+ "learning_rate": 2.848484848484849e-06,
+ "loss": 1.127397894859314,
+ "mean_token_accuracy": 0.7209330797195435,
+ "num_tokens": 17465344.0,
+ "step": 1066
+ },
+ {
+ "entropy": 1.0512653589248657,
+ "epoch": 2.1555555555555554,
+ "grad_norm": 2.209764003753662,
+ "learning_rate": 2.8464646464646468e-06,
+ "loss": 1.073946475982666,
+ "mean_token_accuracy": 0.717391312122345,
+ "num_tokens": 17481728.0,
+ "step": 1067
+ },
+ {
+ "entropy": 1.131946325302124,
+ "epoch": 2.1575757575757577,
+ "grad_norm": 1.9188926219940186,
+ "learning_rate": 2.8444444444444446e-06,
+ "loss": 1.11629056930542,
+ "mean_token_accuracy": 0.7220322489738464,
+ "num_tokens": 17498112.0,
+ "step": 1068
+ },
+ {
+ "entropy": 1.4745967388153076,
+ "epoch": 2.1595959595959595,
+ "grad_norm": 2.285099983215332,
+ "learning_rate": 2.8424242424242425e-06,
+ "loss": 1.4795483350753784,
+ "mean_token_accuracy": 0.6466169953346252,
+ "num_tokens": 17514496.0,
+ "step": 1069
+ },
+ {
+ "entropy": 1.2614645957946777,
+ "epoch": 2.1616161616161618,
+ "grad_norm": 2.4019627571105957,
+ "learning_rate": 2.8404040404040404e-06,
+ "loss": 1.2659732103347778,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 17530880.0,
+ "step": 1070
+ },
+ {
+ "entropy": 1.4247770309448242,
+ "epoch": 2.1636363636363636,
+ "grad_norm": 2.350632905960083,
+ "learning_rate": 2.8383838383838387e-06,
+ "loss": 1.415325403213501,
+ "mean_token_accuracy": 0.6655471324920654,
+ "num_tokens": 17547264.0,
+ "step": 1071
+ },
+ {
+ "entropy": 1.5746078491210938,
+ "epoch": 2.165656565656566,
+ "grad_norm": 2.18448543548584,
+ "learning_rate": 2.8363636363636366e-06,
+ "loss": 1.6022642850875854,
+ "mean_token_accuracy": 0.6324499249458313,
+ "num_tokens": 17563648.0,
+ "step": 1072
+ },
+ {
+ "entropy": 1.5869743824005127,
+ "epoch": 2.1676767676767676,
+ "grad_norm": 2.3553452491760254,
+ "learning_rate": 2.8343434343434345e-06,
+ "loss": 1.6163790225982666,
+ "mean_token_accuracy": 0.6199926733970642,
+ "num_tokens": 17580032.0,
+ "step": 1073
+ },
+ {
+ "entropy": 1.2412667274475098,
+ "epoch": 2.16969696969697,
+ "grad_norm": 2.209017038345337,
+ "learning_rate": 2.8323232323232324e-06,
+ "loss": 1.2491700649261475,
+ "mean_token_accuracy": 0.6911333799362183,
+ "num_tokens": 17596416.0,
+ "step": 1074
+ },
+ {
+ "entropy": 0.9127920866012573,
+ "epoch": 2.1717171717171717,
+ "grad_norm": 1.9761381149291992,
+ "learning_rate": 2.8303030303030303e-06,
+ "loss": 0.8961890339851379,
+ "mean_token_accuracy": 0.7523815631866455,
+ "num_tokens": 17612800.0,
+ "step": 1075
+ },
+ {
+ "entropy": 1.2798824310302734,
+ "epoch": 2.1737373737373735,
+ "grad_norm": 2.397031784057617,
+ "learning_rate": 2.8282828282828286e-06,
+ "loss": 1.286920189857483,
+ "mean_token_accuracy": 0.6805080771446228,
+ "num_tokens": 17629184.0,
+ "step": 1076
+ },
+ {
+ "entropy": 1.7863305807113647,
+ "epoch": 2.175757575757576,
+ "grad_norm": 2.2798852920532227,
+ "learning_rate": 2.8262626262626265e-06,
+ "loss": 1.7654080390930176,
+ "mean_token_accuracy": 0.5806057453155518,
+ "num_tokens": 17645568.0,
+ "step": 1077
+ },
+ {
+ "entropy": 1.327653408050537,
+ "epoch": 2.1777777777777776,
+ "grad_norm": 2.3473095893859863,
+ "learning_rate": 2.8242424242424244e-06,
+ "loss": 1.3175032138824463,
+ "mean_token_accuracy": 0.6750732660293579,
+ "num_tokens": 17661952.0,
+ "step": 1078
+ },
+ {
+ "entropy": 1.4917371273040771,
+ "epoch": 2.17979797979798,
+ "grad_norm": 2.181729793548584,
+ "learning_rate": 2.8222222222222223e-06,
+ "loss": 1.4738472700119019,
+ "mean_token_accuracy": 0.6619443297386169,
+ "num_tokens": 17678336.0,
+ "step": 1079
+ },
+ {
+ "entropy": 1.4644533395767212,
+ "epoch": 2.1818181818181817,
+ "grad_norm": 2.2558112144470215,
+ "learning_rate": 2.82020202020202e-06,
+ "loss": 1.4563480615615845,
+ "mean_token_accuracy": 0.6484489440917969,
+ "num_tokens": 17694720.0,
+ "step": 1080
+ },
+ {
+ "entropy": 0.7626141905784607,
+ "epoch": 2.183838383838384,
+ "grad_norm": 1.8687561750411987,
+ "learning_rate": 2.818181818181818e-06,
+ "loss": 0.7718763947486877,
+ "mean_token_accuracy": 0.7982413172721863,
+ "num_tokens": 17711104.0,
+ "step": 1081
+ },
+ {
+ "entropy": 1.0613173246383667,
+ "epoch": 2.1858585858585857,
+ "grad_norm": 2.072643995285034,
+ "learning_rate": 2.8161616161616163e-06,
+ "loss": 1.0554629564285278,
+ "mean_token_accuracy": 0.734306275844574,
+ "num_tokens": 17727488.0,
+ "step": 1082
+ },
+ {
+ "entropy": 1.0348066091537476,
+ "epoch": 2.187878787878788,
+ "grad_norm": 1.8455089330673218,
+ "learning_rate": 2.8141414141414142e-06,
+ "loss": 1.0231983661651611,
+ "mean_token_accuracy": 0.7382755279541016,
+ "num_tokens": 17743872.0,
+ "step": 1083
+ },
+ {
+ "entropy": 1.271000862121582,
+ "epoch": 2.18989898989899,
+ "grad_norm": 2.3292477130889893,
+ "learning_rate": 2.812121212121212e-06,
+ "loss": 1.2822595834732056,
+ "mean_token_accuracy": 0.6816682815551758,
+ "num_tokens": 17760256.0,
+ "step": 1084
+ },
+ {
+ "entropy": 1.62147855758667,
+ "epoch": 2.191919191919192,
+ "grad_norm": 2.3269946575164795,
+ "learning_rate": 2.81010101010101e-06,
+ "loss": 1.6017215251922607,
+ "mean_token_accuracy": 0.635808527469635,
+ "num_tokens": 17776640.0,
+ "step": 1085
+ },
+ {
+ "entropy": 1.4834544658660889,
+ "epoch": 2.193939393939394,
+ "grad_norm": 2.223590135574341,
+ "learning_rate": 2.808080808080808e-06,
+ "loss": 1.496992826461792,
+ "mean_token_accuracy": 0.6494870781898499,
+ "num_tokens": 17793024.0,
+ "step": 1086
+ },
+ {
+ "entropy": 1.4784536361694336,
+ "epoch": 2.195959595959596,
+ "grad_norm": 2.169416666030884,
+ "learning_rate": 2.806060606060606e-06,
+ "loss": 1.4766731262207031,
+ "mean_token_accuracy": 0.6543722748756409,
+ "num_tokens": 17809408.0,
+ "step": 1087
+ },
+ {
+ "entropy": 1.3650349378585815,
+ "epoch": 2.197979797979798,
+ "grad_norm": 2.1369845867156982,
+ "learning_rate": 2.804040404040404e-06,
+ "loss": 1.3475263118743896,
+ "mean_token_accuracy": 0.6712262034416199,
+ "num_tokens": 17825792.0,
+ "step": 1088
+ },
+ {
+ "entropy": 1.052316665649414,
+ "epoch": 2.2,
+ "grad_norm": 2.3176774978637695,
+ "learning_rate": 2.802020202020202e-06,
+ "loss": 1.056478500366211,
+ "mean_token_accuracy": 0.7374206185340881,
+ "num_tokens": 17842176.0,
+ "step": 1089
+ },
+ {
+ "entropy": 1.1928741931915283,
+ "epoch": 2.202020202020202,
+ "grad_norm": 2.2518808841705322,
+ "learning_rate": 2.8000000000000003e-06,
+ "loss": 1.2238969802856445,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 17858560.0,
+ "step": 1090
+ },
+ {
+ "entropy": 1.135977864265442,
+ "epoch": 2.2040404040404042,
+ "grad_norm": 2.2688262462615967,
+ "learning_rate": 2.7979797979797986e-06,
+ "loss": 1.1330978870391846,
+ "mean_token_accuracy": 0.7053004503250122,
+ "num_tokens": 17874944.0,
+ "step": 1091
+ },
+ {
+ "entropy": 1.3542495965957642,
+ "epoch": 2.206060606060606,
+ "grad_norm": 2.1078014373779297,
+ "learning_rate": 2.7959595959595965e-06,
+ "loss": 1.3983874320983887,
+ "mean_token_accuracy": 0.6840498447418213,
+ "num_tokens": 17891328.0,
+ "step": 1092
+ },
+ {
+ "entropy": 1.1861188411712646,
+ "epoch": 2.2080808080808083,
+ "grad_norm": 2.348931312561035,
+ "learning_rate": 2.7939393939393944e-06,
+ "loss": 1.1982170343399048,
+ "mean_token_accuracy": 0.7014533281326294,
+ "num_tokens": 17907712.0,
+ "step": 1093
+ },
+ {
+ "entropy": 1.2858752012252808,
+ "epoch": 2.21010101010101,
+ "grad_norm": 2.1746175289154053,
+ "learning_rate": 2.7919191919191923e-06,
+ "loss": 1.302664041519165,
+ "mean_token_accuracy": 0.6818515062332153,
+ "num_tokens": 17924096.0,
+ "step": 1094
+ },
+ {
+ "entropy": 1.4817839860916138,
+ "epoch": 2.212121212121212,
+ "grad_norm": 1.9842815399169922,
+ "learning_rate": 2.78989898989899e-06,
+ "loss": 1.5031331777572632,
+ "mean_token_accuracy": 0.6546165347099304,
+ "num_tokens": 17940480.0,
+ "step": 1095
+ },
+ {
+ "entropy": 1.2977368831634521,
+ "epoch": 2.214141414141414,
+ "grad_norm": 2.0394232273101807,
+ "learning_rate": 2.7878787878787885e-06,
+ "loss": 1.3185319900512695,
+ "mean_token_accuracy": 0.6885075569152832,
+ "num_tokens": 17956864.0,
+ "step": 1096
+ },
+ {
+ "entropy": 1.010884404182434,
+ "epoch": 2.216161616161616,
+ "grad_norm": 2.1113393306732178,
+ "learning_rate": 2.7858585858585864e-06,
+ "loss": 1.0239849090576172,
+ "mean_token_accuracy": 0.7426111102104187,
+ "num_tokens": 17973248.0,
+ "step": 1097
+ },
+ {
+ "entropy": 1.6405178308486938,
+ "epoch": 2.2181818181818183,
+ "grad_norm": 2.220865249633789,
+ "learning_rate": 2.7838383838383842e-06,
+ "loss": 1.660733938217163,
+ "mean_token_accuracy": 0.6250610947608948,
+ "num_tokens": 17989632.0,
+ "step": 1098
+ },
+ {
+ "entropy": 1.2822861671447754,
+ "epoch": 2.22020202020202,
+ "grad_norm": 2.1409878730773926,
+ "learning_rate": 2.781818181818182e-06,
+ "loss": 1.2675114870071411,
+ "mean_token_accuracy": 0.7099413871765137,
+ "num_tokens": 18006016.0,
+ "step": 1099
+ },
+ {
+ "entropy": 1.5835071802139282,
+ "epoch": 2.2222222222222223,
+ "grad_norm": 2.32753586769104,
+ "learning_rate": 2.77979797979798e-06,
+ "loss": 1.585759162902832,
+ "mean_token_accuracy": 0.6321446299552917,
+ "num_tokens": 18022400.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.2222222222222223,
+ "eval_entropy": 1.3726552551792515,
+ "eval_loss": 1.5380089282989502,
+ "eval_mean_token_accuracy": 0.645188374384757,
+ "eval_num_tokens": 18022400.0,
+ "eval_runtime": 43.7591,
+ "eval_samples_per_second": 22.624,
+ "eval_steps_per_second": 2.834,
+ "step": 1100
+ },
+ {
+ "entropy": 1.0727043151855469,
+ "epoch": 2.224242424242424,
+ "grad_norm": 2.2024266719818115,
+ "learning_rate": 2.7777777777777783e-06,
+ "loss": 1.066201090812683,
+ "mean_token_accuracy": 0.7272838354110718,
+ "num_tokens": 18038784.0,
+ "step": 1101
+ },
+ {
+ "entropy": 1.1188048124313354,
+ "epoch": 2.2262626262626264,
+ "grad_norm": 2.032862663269043,
+ "learning_rate": 2.7757575757575762e-06,
+ "loss": 1.1292006969451904,
+ "mean_token_accuracy": 0.7198949456214905,
+ "num_tokens": 18055168.0,
+ "step": 1102
+ },
+ {
+ "entropy": 1.3658474683761597,
+ "epoch": 2.228282828282828,
+ "grad_norm": 2.081120491027832,
+ "learning_rate": 2.773737373737374e-06,
+ "loss": 1.3503609895706177,
+ "mean_token_accuracy": 0.6908280253410339,
+ "num_tokens": 18071552.0,
+ "step": 1103
+ },
+ {
+ "entropy": 1.5833252668380737,
+ "epoch": 2.2303030303030305,
+ "grad_norm": 2.174055576324463,
+ "learning_rate": 2.771717171717172e-06,
+ "loss": 1.5991246700286865,
+ "mean_token_accuracy": 0.6322056651115417,
+ "num_tokens": 18087936.0,
+ "step": 1104
+ },
+ {
+ "entropy": 1.2178122997283936,
+ "epoch": 2.2323232323232323,
+ "grad_norm": 2.328620195388794,
+ "learning_rate": 2.76969696969697e-06,
+ "loss": 1.2162861824035645,
+ "mean_token_accuracy": 0.6916218996047974,
+ "num_tokens": 18104320.0,
+ "step": 1105
+ },
+ {
+ "entropy": 1.2894606590270996,
+ "epoch": 2.2343434343434345,
+ "grad_norm": 2.236239433288574,
+ "learning_rate": 2.7676767676767678e-06,
+ "loss": 1.2695279121398926,
+ "mean_token_accuracy": 0.689728856086731,
+ "num_tokens": 18120704.0,
+ "step": 1106
+ },
+ {
+ "entropy": 1.0141552686691284,
+ "epoch": 2.2363636363636363,
+ "grad_norm": 2.000847339630127,
+ "learning_rate": 2.765656565656566e-06,
+ "loss": 1.0147396326065063,
+ "mean_token_accuracy": 0.7469467520713806,
+ "num_tokens": 18137088.0,
+ "step": 1107
+ },
+ {
+ "entropy": 1.150480031967163,
+ "epoch": 2.2383838383838386,
+ "grad_norm": 2.15156888961792,
+ "learning_rate": 2.763636363636364e-06,
+ "loss": 1.1593115329742432,
+ "mean_token_accuracy": 0.7129335403442383,
+ "num_tokens": 18153472.0,
+ "step": 1108
+ },
+ {
+ "entropy": 1.4387518167495728,
+ "epoch": 2.2404040404040404,
+ "grad_norm": 2.3262319564819336,
+ "learning_rate": 2.761616161616162e-06,
+ "loss": 1.4393596649169922,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 18169856.0,
+ "step": 1109
+ },
+ {
+ "entropy": 1.205459475517273,
+ "epoch": 2.242424242424242,
+ "grad_norm": 2.223987579345703,
+ "learning_rate": 2.7595959595959597e-06,
+ "loss": 1.1871377229690552,
+ "mean_token_accuracy": 0.7018197178840637,
+ "num_tokens": 18186240.0,
+ "step": 1110
+ },
+ {
+ "entropy": 1.428817868232727,
+ "epoch": 2.2444444444444445,
+ "grad_norm": 2.091627836227417,
+ "learning_rate": 2.7575757575757576e-06,
+ "loss": 1.4262187480926514,
+ "mean_token_accuracy": 0.6708598136901855,
+ "num_tokens": 18202624.0,
+ "step": 1111
+ },
+ {
+ "entropy": 1.420682668685913,
+ "epoch": 2.2464646464646463,
+ "grad_norm": 2.30232310295105,
+ "learning_rate": 2.755555555555556e-06,
+ "loss": 1.439821720123291,
+ "mean_token_accuracy": 0.6508305072784424,
+ "num_tokens": 18219008.0,
+ "step": 1112
+ },
+ {
+ "entropy": 1.2365189790725708,
+ "epoch": 2.2484848484848485,
+ "grad_norm": 2.1747143268585205,
+ "learning_rate": 2.753535353535354e-06,
+ "loss": 1.2286595106124878,
+ "mean_token_accuracy": 0.7011480331420898,
+ "num_tokens": 18235392.0,
+ "step": 1113
+ },
+ {
+ "entropy": 1.0271798372268677,
+ "epoch": 2.2505050505050503,
+ "grad_norm": 2.1767842769622803,
+ "learning_rate": 2.7515151515151517e-06,
+ "loss": 1.018047571182251,
+ "mean_token_accuracy": 0.7297264337539673,
+ "num_tokens": 18251776.0,
+ "step": 1114
+ },
+ {
+ "entropy": 1.229053258895874,
+ "epoch": 2.2525252525252526,
+ "grad_norm": 2.390345811843872,
+ "learning_rate": 2.7494949494949496e-06,
+ "loss": 1.250126838684082,
+ "mean_token_accuracy": 0.6869809627532959,
+ "num_tokens": 18268160.0,
+ "step": 1115
+ },
+ {
+ "entropy": 1.4062843322753906,
+ "epoch": 2.2545454545454544,
+ "grad_norm": 2.220144271850586,
+ "learning_rate": 2.7474747474747475e-06,
+ "loss": 1.4262535572052002,
+ "mean_token_accuracy": 0.6592574715614319,
+ "num_tokens": 18284544.0,
+ "step": 1116
+ },
+ {
+ "entropy": 1.1991937160491943,
+ "epoch": 2.2565656565656567,
+ "grad_norm": 1.9910556077957153,
+ "learning_rate": 2.7454545454545454e-06,
+ "loss": 1.1869618892669678,
+ "mean_token_accuracy": 0.7049340605735779,
+ "num_tokens": 18300928.0,
+ "step": 1117
+ },
+ {
+ "entropy": 1.3147934675216675,
+ "epoch": 2.2585858585858585,
+ "grad_norm": 2.033942222595215,
+ "learning_rate": 2.7434343434343437e-06,
+ "loss": 1.3236720561981201,
+ "mean_token_accuracy": 0.6854543089866638,
+ "num_tokens": 18317312.0,
+ "step": 1118
+ },
+ {
+ "entropy": 1.2828413248062134,
+ "epoch": 2.2606060606060607,
+ "grad_norm": 2.2729172706604004,
+ "learning_rate": 2.7414141414141416e-06,
+ "loss": 1.2601265907287598,
+ "mean_token_accuracy": 0.6866145730018616,
+ "num_tokens": 18333696.0,
+ "step": 1119
+ },
+ {
+ "entropy": 1.9708930253982544,
+ "epoch": 2.2626262626262625,
+ "grad_norm": 2.4053614139556885,
+ "learning_rate": 2.7393939393939395e-06,
+ "loss": 1.9953765869140625,
+ "mean_token_accuracy": 0.5719345211982727,
+ "num_tokens": 18350080.0,
+ "step": 1120
+ },
+ {
+ "entropy": 1.071018099784851,
+ "epoch": 2.264646464646465,
+ "grad_norm": 2.0399091243743896,
+ "learning_rate": 2.7373737373737374e-06,
+ "loss": 1.0672862529754639,
+ "mean_token_accuracy": 0.72007817029953,
+ "num_tokens": 18366464.0,
+ "step": 1121
+ },
+ {
+ "entropy": 1.8741599321365356,
+ "epoch": 2.2666666666666666,
+ "grad_norm": 2.0918753147125244,
+ "learning_rate": 2.7353535353535353e-06,
+ "loss": 1.8604744672775269,
+ "mean_token_accuracy": 0.598436713218689,
+ "num_tokens": 18382848.0,
+ "step": 1122
+ },
+ {
+ "entropy": 1.0931968688964844,
+ "epoch": 2.268686868686869,
+ "grad_norm": 2.161102294921875,
+ "learning_rate": 2.7333333333333336e-06,
+ "loss": 1.1152517795562744,
+ "mean_token_accuracy": 0.7209330797195435,
+ "num_tokens": 18399232.0,
+ "step": 1123
+ },
+ {
+ "entropy": 1.3318616151809692,
+ "epoch": 2.2707070707070707,
+ "grad_norm": 2.200199842453003,
+ "learning_rate": 2.7313131313131315e-06,
+ "loss": 1.3456424474716187,
+ "mean_token_accuracy": 0.6789203882217407,
+ "num_tokens": 18415616.0,
+ "step": 1124
+ },
+ {
+ "entropy": 1.3777986764907837,
+ "epoch": 2.2727272727272725,
+ "grad_norm": 2.328887701034546,
+ "learning_rate": 2.7292929292929293e-06,
+ "loss": 1.3955169916152954,
+ "mean_token_accuracy": 0.6679897308349609,
+ "num_tokens": 18432000.0,
+ "step": 1125
+ },
+ {
+ "entropy": 1.0748711824417114,
+ "epoch": 2.2747474747474747,
+ "grad_norm": 2.151282787322998,
+ "learning_rate": 2.7272727272727272e-06,
+ "loss": 1.0380895137786865,
+ "mean_token_accuracy": 0.736932098865509,
+ "num_tokens": 18448384.0,
+ "step": 1126
+ },
+ {
+ "entropy": 1.4420548677444458,
+ "epoch": 2.276767676767677,
+ "grad_norm": 2.133190870285034,
+ "learning_rate": 2.725252525252525e-06,
+ "loss": 1.4465012550354004,
+ "mean_token_accuracy": 0.6784929037094116,
+ "num_tokens": 18464768.0,
+ "step": 1127
+ },
+ {
+ "entropy": 0.9478949904441833,
+ "epoch": 2.278787878787879,
+ "grad_norm": 2.0902628898620605,
+ "learning_rate": 2.7232323232323234e-06,
+ "loss": 0.9504396915435791,
+ "mean_token_accuracy": 0.7458475828170776,
+ "num_tokens": 18481152.0,
+ "step": 1128
+ },
+ {
+ "entropy": 1.367720127105713,
+ "epoch": 2.2808080808080806,
+ "grad_norm": 2.0413167476654053,
+ "learning_rate": 2.7212121212121213e-06,
+ "loss": 1.3884644508361816,
+ "mean_token_accuracy": 0.6762945652008057,
+ "num_tokens": 18497536.0,
+ "step": 1129
+ },
+ {
+ "entropy": 1.6931284666061401,
+ "epoch": 2.282828282828283,
+ "grad_norm": 2.188426971435547,
+ "learning_rate": 2.719191919191919e-06,
+ "loss": 1.7233154773712158,
+ "mean_token_accuracy": 0.6323277950286865,
+ "num_tokens": 18513920.0,
+ "step": 1130
+ },
+ {
+ "entropy": 1.563072681427002,
+ "epoch": 2.2848484848484847,
+ "grad_norm": 2.241102695465088,
+ "learning_rate": 2.717171717171717e-06,
+ "loss": 1.5677220821380615,
+ "mean_token_accuracy": 0.640693724155426,
+ "num_tokens": 18530304.0,
+ "step": 1131
+ },
+ {
+ "entropy": 1.3332083225250244,
+ "epoch": 2.286868686868687,
+ "grad_norm": 2.209522008895874,
+ "learning_rate": 2.715151515151516e-06,
+ "loss": 1.337693452835083,
+ "mean_token_accuracy": 0.6715925931930542,
+ "num_tokens": 18546688.0,
+ "step": 1132
+ },
+ {
+ "entropy": 1.5389035940170288,
+ "epoch": 2.2888888888888888,
+ "grad_norm": 2.212047815322876,
+ "learning_rate": 2.7131313131313137e-06,
+ "loss": 1.52158784866333,
+ "mean_token_accuracy": 0.6447850465774536,
+ "num_tokens": 18563072.0,
+ "step": 1133
+ },
+ {
+ "entropy": 1.2687056064605713,
+ "epoch": 2.290909090909091,
+ "grad_norm": 2.1673405170440674,
+ "learning_rate": 2.7111111111111116e-06,
+ "loss": 1.2689636945724487,
+ "mean_token_accuracy": 0.6911333799362183,
+ "num_tokens": 18579456.0,
+ "step": 1134
+ },
+ {
+ "entropy": 1.1464369297027588,
+ "epoch": 2.292929292929293,
+ "grad_norm": 1.9283273220062256,
+ "learning_rate": 2.7090909090909095e-06,
+ "loss": 1.1613389253616333,
+ "mean_token_accuracy": 0.7145212292671204,
+ "num_tokens": 18595840.0,
+ "step": 1135
+ },
+ {
+ "entropy": 1.327767252922058,
+ "epoch": 2.294949494949495,
+ "grad_norm": 2.2193424701690674,
+ "learning_rate": 2.7070707070707074e-06,
+ "loss": 1.3209152221679688,
+ "mean_token_accuracy": 0.6740962266921997,
+ "num_tokens": 18612224.0,
+ "step": 1136
+ },
+ {
+ "entropy": 1.5820066928863525,
+ "epoch": 2.296969696969697,
+ "grad_norm": 2.2020492553710938,
+ "learning_rate": 2.7050505050505057e-06,
+ "loss": 1.603272795677185,
+ "mean_token_accuracy": 0.6400830745697021,
+ "num_tokens": 18628608.0,
+ "step": 1137
+ },
+ {
+ "entropy": 1.279178500175476,
+ "epoch": 2.298989898989899,
+ "grad_norm": 2.1509714126586914,
+ "learning_rate": 2.7030303030303036e-06,
+ "loss": 1.2742427587509155,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 18644992.0,
+ "step": 1138
+ },
+ {
+ "entropy": 1.2199708223342896,
+ "epoch": 2.301010101010101,
+ "grad_norm": 2.0223684310913086,
+ "learning_rate": 2.7010101010101015e-06,
+ "loss": 1.2254796028137207,
+ "mean_token_accuracy": 0.6971787810325623,
+ "num_tokens": 18661376.0,
+ "step": 1139
+ },
+ {
+ "entropy": 1.1640081405639648,
+ "epoch": 2.303030303030303,
+ "grad_norm": 2.1907923221588135,
+ "learning_rate": 2.6989898989898994e-06,
+ "loss": 1.170613408088684,
+ "mean_token_accuracy": 0.6979726552963257,
+ "num_tokens": 18677760.0,
+ "step": 1140
+ },
+ {
+ "entropy": 1.3213385343551636,
+ "epoch": 2.305050505050505,
+ "grad_norm": 2.170276641845703,
+ "learning_rate": 2.6969696969696972e-06,
+ "loss": 1.3338474035263062,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 18694144.0,
+ "step": 1141
+ },
+ {
+ "entropy": 1.6036078929901123,
+ "epoch": 2.3070707070707073,
+ "grad_norm": 2.3499386310577393,
+ "learning_rate": 2.694949494949495e-06,
+ "loss": 1.5859179496765137,
+ "mean_token_accuracy": 0.6349536180496216,
+ "num_tokens": 18710528.0,
+ "step": 1142
+ },
+ {
+ "entropy": 1.2171586751937866,
+ "epoch": 2.309090909090909,
+ "grad_norm": 2.0380377769470215,
+ "learning_rate": 2.6929292929292934e-06,
+ "loss": 1.2191288471221924,
+ "mean_token_accuracy": 0.7063385248184204,
+ "num_tokens": 18726912.0,
+ "step": 1143
+ },
+ {
+ "entropy": 1.165902018547058,
+ "epoch": 2.311111111111111,
+ "grad_norm": 2.077310085296631,
+ "learning_rate": 2.6909090909090913e-06,
+ "loss": 1.1728768348693848,
+ "mean_token_accuracy": 0.7075598239898682,
+ "num_tokens": 18743296.0,
+ "step": 1144
+ },
+ {
+ "entropy": 1.5172539949417114,
+ "epoch": 2.313131313131313,
+ "grad_norm": 2.0132439136505127,
+ "learning_rate": 2.6888888888888892e-06,
+ "loss": 1.5073471069335938,
+ "mean_token_accuracy": 0.6546775698661804,
+ "num_tokens": 18759680.0,
+ "step": 1145
+ },
+ {
+ "entropy": 1.3588616847991943,
+ "epoch": 2.315151515151515,
+ "grad_norm": 2.1851465702056885,
+ "learning_rate": 2.686868686868687e-06,
+ "loss": 1.4111744165420532,
+ "mean_token_accuracy": 0.6750732660293579,
+ "num_tokens": 18776064.0,
+ "step": 1146
+ },
+ {
+ "entropy": 1.1948320865631104,
+ "epoch": 2.317171717171717,
+ "grad_norm": 2.1817259788513184,
+ "learning_rate": 2.684848484848485e-06,
+ "loss": 1.188377857208252,
+ "mean_token_accuracy": 0.7122007608413696,
+ "num_tokens": 18792448.0,
+ "step": 1147
+ },
+ {
+ "entropy": 1.7049702405929565,
+ "epoch": 2.319191919191919,
+ "grad_norm": 2.309352159500122,
+ "learning_rate": 2.6828282828282833e-06,
+ "loss": 1.6966536045074463,
+ "mean_token_accuracy": 0.6052759885787964,
+ "num_tokens": 18808832.0,
+ "step": 1148
+ },
+ {
+ "entropy": 1.0853440761566162,
+ "epoch": 2.3212121212121213,
+ "grad_norm": 2.1501059532165527,
+ "learning_rate": 2.680808080808081e-06,
+ "loss": 1.0747997760772705,
+ "mean_token_accuracy": 0.7195896506309509,
+ "num_tokens": 18825216.0,
+ "step": 1149
+ },
+ {
+ "entropy": 1.209170937538147,
+ "epoch": 2.323232323232323,
+ "grad_norm": 2.105555772781372,
+ "learning_rate": 2.678787878787879e-06,
+ "loss": 1.2055076360702515,
+ "mean_token_accuracy": 0.7062774896621704,
+ "num_tokens": 18841600.0,
+ "step": 1150
+ },
+ {
+ "epoch": 2.323232323232323,
+ "eval_entropy": 1.3799022854335847,
+ "eval_loss": 1.5365934371948242,
+ "eval_mean_token_accuracy": 0.6452573234996488,
+ "eval_num_tokens": 18841600.0,
+ "eval_runtime": 43.7362,
+ "eval_samples_per_second": 22.636,
+ "eval_steps_per_second": 2.835,
+ "step": 1150
+ },
+ {
+ "entropy": 0.9533048868179321,
+ "epoch": 2.3252525252525253,
+ "grad_norm": 1.9681413173675537,
+ "learning_rate": 2.676767676767677e-06,
+ "loss": 0.9284776449203491,
+ "mean_token_accuracy": 0.7609916925430298,
+ "num_tokens": 18857984.0,
+ "step": 1151
+ },
+ {
+ "entropy": 1.575872778892517,
+ "epoch": 2.327272727272727,
+ "grad_norm": 2.15085768699646,
+ "learning_rate": 2.674747474747475e-06,
+ "loss": 1.5716705322265625,
+ "mean_token_accuracy": 0.6415486335754395,
+ "num_tokens": 18874368.0,
+ "step": 1152
+ },
+ {
+ "entropy": 1.1680493354797363,
+ "epoch": 2.3292929292929294,
+ "grad_norm": 2.189589023590088,
+ "learning_rate": 2.6727272727272727e-06,
+ "loss": 1.1651779413223267,
+ "mean_token_accuracy": 0.7156203985214233,
+ "num_tokens": 18890752.0,
+ "step": 1153
+ },
+ {
+ "entropy": 1.1636664867401123,
+ "epoch": 2.3313131313131312,
+ "grad_norm": 1.9992915391921997,
+ "learning_rate": 2.670707070707071e-06,
+ "loss": 1.1650042533874512,
+ "mean_token_accuracy": 0.7116512060165405,
+ "num_tokens": 18907136.0,
+ "step": 1154
+ },
+ {
+ "entropy": 1.205094337463379,
+ "epoch": 2.3333333333333335,
+ "grad_norm": 2.070323944091797,
+ "learning_rate": 2.668686868686869e-06,
+ "loss": 1.2071596384048462,
+ "mean_token_accuracy": 0.7018197178840637,
+ "num_tokens": 18923520.0,
+ "step": 1155
+ },
+ {
+ "entropy": 1.2256643772125244,
+ "epoch": 2.3353535353535353,
+ "grad_norm": 2.144339084625244,
+ "learning_rate": 2.666666666666667e-06,
+ "loss": 1.2168457508087158,
+ "mean_token_accuracy": 0.7010869383811951,
+ "num_tokens": 18939904.0,
+ "step": 1156
+ },
+ {
+ "entropy": 1.631039023399353,
+ "epoch": 2.3373737373737375,
+ "grad_norm": 2.2886807918548584,
+ "learning_rate": 2.6646464646464647e-06,
+ "loss": 1.6534450054168701,
+ "mean_token_accuracy": 0.6248778700828552,
+ "num_tokens": 18956288.0,
+ "step": 1157
+ },
+ {
+ "entropy": 1.0360562801361084,
+ "epoch": 2.3393939393939394,
+ "grad_norm": 2.137491226196289,
+ "learning_rate": 2.6626262626262626e-06,
+ "loss": 1.0167723894119263,
+ "mean_token_accuracy": 0.7330239415168762,
+ "num_tokens": 18972672.0,
+ "step": 1158
+ },
+ {
+ "entropy": 1.2292720079421997,
+ "epoch": 2.341414141414141,
+ "grad_norm": 3.1518330574035645,
+ "learning_rate": 2.660606060606061e-06,
+ "loss": 1.2180495262145996,
+ "mean_token_accuracy": 0.6957743167877197,
+ "num_tokens": 18989056.0,
+ "step": 1159
+ },
+ {
+ "entropy": 1.2210739850997925,
+ "epoch": 2.3434343434343434,
+ "grad_norm": 2.1314170360565186,
+ "learning_rate": 2.658585858585859e-06,
+ "loss": 1.2399296760559082,
+ "mean_token_accuracy": 0.7047508358955383,
+ "num_tokens": 19005440.0,
+ "step": 1160
+ },
+ {
+ "entropy": 1.2762846946716309,
+ "epoch": 2.3454545454545457,
+ "grad_norm": 2.1767046451568604,
+ "learning_rate": 2.6565656565656567e-06,
+ "loss": 1.2640776634216309,
+ "mean_token_accuracy": 0.6954079270362854,
+ "num_tokens": 19021824.0,
+ "step": 1161
+ },
+ {
+ "entropy": 1.271180272102356,
+ "epoch": 2.3474747474747475,
+ "grad_norm": 2.121891975402832,
+ "learning_rate": 2.6545454545454546e-06,
+ "loss": 1.2666800022125244,
+ "mean_token_accuracy": 0.6880801320075989,
+ "num_tokens": 19038208.0,
+ "step": 1162
+ },
+ {
+ "entropy": 1.5604509115219116,
+ "epoch": 2.3494949494949493,
+ "grad_norm": 2.320765495300293,
+ "learning_rate": 2.6525252525252525e-06,
+ "loss": 1.5687410831451416,
+ "mean_token_accuracy": 0.627198338508606,
+ "num_tokens": 19054592.0,
+ "step": 1163
+ },
+ {
+ "entropy": 1.1606905460357666,
+ "epoch": 2.3515151515151516,
+ "grad_norm": 2.1167874336242676,
+ "learning_rate": 2.6505050505050508e-06,
+ "loss": 1.1879122257232666,
+ "mean_token_accuracy": 0.7130556702613831,
+ "num_tokens": 19070976.0,
+ "step": 1164
+ },
+ {
+ "entropy": 1.5421797037124634,
+ "epoch": 2.3535353535353534,
+ "grad_norm": 2.144657850265503,
+ "learning_rate": 2.6484848484848487e-06,
+ "loss": 1.5562596321105957,
+ "mean_token_accuracy": 0.6350146532058716,
+ "num_tokens": 19087360.0,
+ "step": 1165
+ },
+ {
+ "entropy": 1.2803337574005127,
+ "epoch": 2.3555555555555556,
+ "grad_norm": 2.0440914630889893,
+ "learning_rate": 2.6464646464646466e-06,
+ "loss": 1.3008983135223389,
+ "mean_token_accuracy": 0.6868588328361511,
+ "num_tokens": 19103744.0,
+ "step": 1166
+ },
+ {
+ "entropy": 1.1863176822662354,
+ "epoch": 2.3575757575757574,
+ "grad_norm": 2.231771469116211,
+ "learning_rate": 2.6444444444444444e-06,
+ "loss": 1.1863257884979248,
+ "mean_token_accuracy": 0.7069491744041443,
+ "num_tokens": 19120128.0,
+ "step": 1167
+ },
+ {
+ "entropy": 1.1186378002166748,
+ "epoch": 2.3595959595959597,
+ "grad_norm": 2.0704708099365234,
+ "learning_rate": 2.6424242424242423e-06,
+ "loss": 1.1196620464324951,
+ "mean_token_accuracy": 0.726062536239624,
+ "num_tokens": 19136512.0,
+ "step": 1168
+ },
+ {
+ "entropy": 1.2110928297042847,
+ "epoch": 2.3616161616161615,
+ "grad_norm": 2.251551866531372,
+ "learning_rate": 2.6404040404040402e-06,
+ "loss": 1.2020606994628906,
+ "mean_token_accuracy": 0.7058500051498413,
+ "num_tokens": 19152896.0,
+ "step": 1169
+ },
+ {
+ "entropy": 1.302309513092041,
+ "epoch": 2.3636363636363638,
+ "grad_norm": 2.171961545944214,
+ "learning_rate": 2.6383838383838385e-06,
+ "loss": 1.3029515743255615,
+ "mean_token_accuracy": 0.673363447189331,
+ "num_tokens": 19169280.0,
+ "step": 1170
+ },
+ {
+ "entropy": 1.6036607027053833,
+ "epoch": 2.3656565656565656,
+ "grad_norm": 2.336979627609253,
+ "learning_rate": 2.6363636363636364e-06,
+ "loss": 1.6076864004135132,
+ "mean_token_accuracy": 0.630984365940094,
+ "num_tokens": 19185664.0,
+ "step": 1171
+ },
+ {
+ "entropy": 1.431620478630066,
+ "epoch": 2.367676767676768,
+ "grad_norm": 2.115891218185425,
+ "learning_rate": 2.6343434343434343e-06,
+ "loss": 1.4436556100845337,
+ "mean_token_accuracy": 0.6623717546463013,
+ "num_tokens": 19202048.0,
+ "step": 1172
+ },
+ {
+ "entropy": 1.4537419080734253,
+ "epoch": 2.3696969696969696,
+ "grad_norm": 2.497891664505005,
+ "learning_rate": 2.632323232323232e-06,
+ "loss": 1.48027503490448,
+ "mean_token_accuracy": 0.6352589130401611,
+ "num_tokens": 19218432.0,
+ "step": 1173
+ },
+ {
+ "entropy": 1.292363166809082,
+ "epoch": 2.371717171717172,
+ "grad_norm": 2.0235633850097656,
+ "learning_rate": 2.63030303030303e-06,
+ "loss": 1.3111207485198975,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 19234816.0,
+ "step": 1174
+ },
+ {
+ "entropy": 1.2336944341659546,
+ "epoch": 2.3737373737373737,
+ "grad_norm": 2.342643976211548,
+ "learning_rate": 2.628282828282829e-06,
+ "loss": 1.2427266836166382,
+ "mean_token_accuracy": 0.6844772696495056,
+ "num_tokens": 19251200.0,
+ "step": 1175
+ },
+ {
+ "entropy": 1.166039228439331,
+ "epoch": 2.375757575757576,
+ "grad_norm": 2.157937526702881,
+ "learning_rate": 2.6262626262626267e-06,
+ "loss": 1.167286992073059,
+ "mean_token_accuracy": 0.7115290760993958,
+ "num_tokens": 19267584.0,
+ "step": 1176
+ },
+ {
+ "entropy": 1.3824102878570557,
+ "epoch": 2.3777777777777778,
+ "grad_norm": 2.2874608039855957,
+ "learning_rate": 2.6242424242424246e-06,
+ "loss": 1.404619574546814,
+ "mean_token_accuracy": 0.6707376837730408,
+ "num_tokens": 19283968.0,
+ "step": 1177
+ },
+ {
+ "entropy": 0.8266427516937256,
+ "epoch": 2.3797979797979796,
+ "grad_norm": 2.098217010498047,
+ "learning_rate": 2.6222222222222225e-06,
+ "loss": 0.821276068687439,
+ "mean_token_accuracy": 0.7726551294326782,
+ "num_tokens": 19300352.0,
+ "step": 1178
+ },
+ {
+ "entropy": 1.4335079193115234,
+ "epoch": 2.381818181818182,
+ "grad_norm": 2.3051438331604004,
+ "learning_rate": 2.620202020202021e-06,
+ "loss": 1.437370777130127,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 19316736.0,
+ "step": 1179
+ },
+ {
+ "entropy": 1.0816318988800049,
+ "epoch": 2.3838383838383836,
+ "grad_norm": 2.0723016262054443,
+ "learning_rate": 2.6181818181818187e-06,
+ "loss": 1.0697057247161865,
+ "mean_token_accuracy": 0.7304592132568359,
+ "num_tokens": 19333120.0,
+ "step": 1180
+ },
+ {
+ "entropy": 1.2515255212783813,
+ "epoch": 2.385858585858586,
+ "grad_norm": 2.32125186920166,
+ "learning_rate": 2.6161616161616166e-06,
+ "loss": 1.256905198097229,
+ "mean_token_accuracy": 0.697300910949707,
+ "num_tokens": 19349504.0,
+ "step": 1181
+ },
+ {
+ "entropy": 1.0271868705749512,
+ "epoch": 2.3878787878787877,
+ "grad_norm": 2.0145103931427,
+ "learning_rate": 2.6141414141414145e-06,
+ "loss": 1.0158754587173462,
+ "mean_token_accuracy": 0.7518930435180664,
+ "num_tokens": 19365888.0,
+ "step": 1182
+ },
+ {
+ "entropy": 1.2139984369277954,
+ "epoch": 2.38989898989899,
+ "grad_norm": 2.1393911838531494,
+ "learning_rate": 2.6121212121212123e-06,
+ "loss": 1.2150651216506958,
+ "mean_token_accuracy": 0.7135441899299622,
+ "num_tokens": 19382272.0,
+ "step": 1183
+ },
+ {
+ "entropy": 1.076101303100586,
+ "epoch": 2.391919191919192,
+ "grad_norm": 2.1664907932281494,
+ "learning_rate": 2.6101010101010107e-06,
+ "loss": 1.0744431018829346,
+ "mean_token_accuracy": 0.7267953157424927,
+ "num_tokens": 19398656.0,
+ "step": 1184
+ },
+ {
+ "entropy": 1.5176570415496826,
+ "epoch": 2.393939393939394,
+ "grad_norm": 2.0756311416625977,
+ "learning_rate": 2.6080808080808085e-06,
+ "loss": 1.5209624767303467,
+ "mean_token_accuracy": 0.647777259349823,
+ "num_tokens": 19415040.0,
+ "step": 1185
+ },
+ {
+ "entropy": 1.0946495532989502,
+ "epoch": 2.395959595959596,
+ "grad_norm": 2.0545496940612793,
+ "learning_rate": 2.6060606060606064e-06,
+ "loss": 1.0858100652694702,
+ "mean_token_accuracy": 0.7226428985595703,
+ "num_tokens": 19431424.0,
+ "step": 1186
+ },
+ {
+ "entropy": 0.7713431715965271,
+ "epoch": 2.397979797979798,
+ "grad_norm": 2.0606112480163574,
+ "learning_rate": 2.6040404040404043e-06,
+ "loss": 0.7782045006752014,
+ "mean_token_accuracy": 0.7804103493690491,
+ "num_tokens": 19447808.0,
+ "step": 1187
+ },
+ {
+ "entropy": 1.2803305387496948,
+ "epoch": 2.4,
+ "grad_norm": 2.2125155925750732,
+ "learning_rate": 2.602020202020202e-06,
+ "loss": 1.2971004247665405,
+ "mean_token_accuracy": 0.6787371635437012,
+ "num_tokens": 19464192.0,
+ "step": 1188
+ },
+ {
+ "entropy": 0.9156424403190613,
+ "epoch": 2.402020202020202,
+ "grad_norm": 2.032531499862671,
+ "learning_rate": 2.6e-06,
+ "loss": 0.9119267463684082,
+ "mean_token_accuracy": 0.7627015113830566,
+ "num_tokens": 19480576.0,
+ "step": 1189
+ },
+ {
+ "entropy": 1.2698813676834106,
+ "epoch": 2.404040404040404,
+ "grad_norm": 2.2204320430755615,
+ "learning_rate": 2.5979797979797984e-06,
+ "loss": 1.2934629917144775,
+ "mean_token_accuracy": 0.682584285736084,
+ "num_tokens": 19496960.0,
+ "step": 1190
+ },
+ {
+ "entropy": 1.5677871704101562,
+ "epoch": 2.4060606060606062,
+ "grad_norm": 2.229994773864746,
+ "learning_rate": 2.5959595959595963e-06,
+ "loss": 1.591191053390503,
+ "mean_token_accuracy": 0.6297020316123962,
+ "num_tokens": 19513344.0,
+ "step": 1191
+ },
+ {
+ "entropy": 1.3057011365890503,
+ "epoch": 2.408080808080808,
+ "grad_norm": 2.4158618450164795,
+ "learning_rate": 2.593939393939394e-06,
+ "loss": 1.2989580631256104,
+ "mean_token_accuracy": 0.689728856086731,
+ "num_tokens": 19529728.0,
+ "step": 1192
+ },
+ {
+ "entropy": 1.3805862665176392,
+ "epoch": 2.41010101010101,
+ "grad_norm": 2.2611825466156006,
+ "learning_rate": 2.591919191919192e-06,
+ "loss": 1.385383129119873,
+ "mean_token_accuracy": 0.6634709239006042,
+ "num_tokens": 19546112.0,
+ "step": 1193
+ },
+ {
+ "entropy": 1.8123539686203003,
+ "epoch": 2.412121212121212,
+ "grad_norm": 2.3038923740386963,
+ "learning_rate": 2.58989898989899e-06,
+ "loss": 1.80764901638031,
+ "mean_token_accuracy": 0.5925744771957397,
+ "num_tokens": 19562496.0,
+ "step": 1194
+ },
+ {
+ "entropy": 1.1476300954818726,
+ "epoch": 2.4141414141414144,
+ "grad_norm": 2.2417445182800293,
+ "learning_rate": 2.5878787878787883e-06,
+ "loss": 1.1802024841308594,
+ "mean_token_accuracy": 0.7130556702613831,
+ "num_tokens": 19578880.0,
+ "step": 1195
+ },
+ {
+ "entropy": 1.6678205728530884,
+ "epoch": 2.416161616161616,
+ "grad_norm": 2.399136781692505,
+ "learning_rate": 2.585858585858586e-06,
+ "loss": 1.6780188083648682,
+ "mean_token_accuracy": 0.6161455512046814,
+ "num_tokens": 19595264.0,
+ "step": 1196
+ },
+ {
+ "entropy": 1.053451418876648,
+ "epoch": 2.418181818181818,
+ "grad_norm": 1.9980698823928833,
+ "learning_rate": 2.583838383838384e-06,
+ "loss": 1.0241587162017822,
+ "mean_token_accuracy": 0.7372984886169434,
+ "num_tokens": 19611648.0,
+ "step": 1197
+ },
+ {
+ "entropy": 1.5389430522918701,
+ "epoch": 2.4202020202020202,
+ "grad_norm": 2.171046733856201,
+ "learning_rate": 2.581818181818182e-06,
+ "loss": 1.5499310493469238,
+ "mean_token_accuracy": 0.6422203183174133,
+ "num_tokens": 19628032.0,
+ "step": 1198
+ },
+ {
+ "entropy": 1.4151558876037598,
+ "epoch": 2.422222222222222,
+ "grad_norm": 2.185184955596924,
+ "learning_rate": 2.57979797979798e-06,
+ "loss": 1.4296989440917969,
+ "mean_token_accuracy": 0.663593053817749,
+ "num_tokens": 19644416.0,
+ "step": 1199
+ },
+ {
+ "entropy": 1.1455156803131104,
+ "epoch": 2.4242424242424243,
+ "grad_norm": 2.224477767944336,
+ "learning_rate": 2.577777777777778e-06,
+ "loss": 1.1682045459747314,
+ "mean_token_accuracy": 0.7084147334098816,
+ "num_tokens": 19660800.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.4242424242424243,
+ "eval_entropy": 1.3761802339746105,
+ "eval_loss": 1.53595769405365,
+ "eval_mean_token_accuracy": 0.6453439944213436,
+ "eval_num_tokens": 19660800.0,
+ "eval_runtime": 43.8176,
+ "eval_samples_per_second": 22.594,
+ "eval_steps_per_second": 2.83,
+ "step": 1200
+ },
+ {
+ "entropy": 1.6039199829101562,
+ "epoch": 2.426262626262626,
+ "grad_norm": 2.122072696685791,
+ "learning_rate": 2.575757575757576e-06,
+ "loss": 1.625109314918518,
+ "mean_token_accuracy": 0.6306179761886597,
+ "num_tokens": 19677184.0,
+ "step": 1201
+ },
+ {
+ "entropy": 1.2364906072616577,
+ "epoch": 2.4282828282828284,
+ "grad_norm": 2.175671339035034,
+ "learning_rate": 2.573737373737374e-06,
+ "loss": 1.2398111820220947,
+ "mean_token_accuracy": 0.6886907815933228,
+ "num_tokens": 19693568.0,
+ "step": 1202
+ },
+ {
+ "entropy": 1.2937804460525513,
+ "epoch": 2.43030303030303,
+ "grad_norm": 2.1206040382385254,
+ "learning_rate": 2.571717171717172e-06,
+ "loss": 1.3073123693466187,
+ "mean_token_accuracy": 0.6762945652008057,
+ "num_tokens": 19709952.0,
+ "step": 1203
+ },
+ {
+ "entropy": 1.0239282846450806,
+ "epoch": 2.4323232323232324,
+ "grad_norm": 1.863510012626648,
+ "learning_rate": 2.5696969696969697e-06,
+ "loss": 1.015241026878357,
+ "mean_token_accuracy": 0.7452369332313538,
+ "num_tokens": 19726336.0,
+ "step": 1204
+ },
+ {
+ "entropy": 1.2327015399932861,
+ "epoch": 2.4343434343434343,
+ "grad_norm": 1.968019962310791,
+ "learning_rate": 2.5676767676767676e-06,
+ "loss": 1.2275054454803467,
+ "mean_token_accuracy": 0.6974841356277466,
+ "num_tokens": 19742720.0,
+ "step": 1205
+ },
+ {
+ "entropy": 1.130920171737671,
+ "epoch": 2.4363636363636365,
+ "grad_norm": 2.096205949783325,
+ "learning_rate": 2.565656565656566e-06,
+ "loss": 1.1229937076568604,
+ "mean_token_accuracy": 0.7102466821670532,
+ "num_tokens": 19759104.0,
+ "step": 1206
+ },
+ {
+ "entropy": 0.9204118251800537,
+ "epoch": 2.4383838383838383,
+ "grad_norm": 1.7956496477127075,
+ "learning_rate": 2.5636363636363638e-06,
+ "loss": 0.9276518821716309,
+ "mean_token_accuracy": 0.7644113302230835,
+ "num_tokens": 19775488.0,
+ "step": 1207
+ },
+ {
+ "entropy": 0.9552480578422546,
+ "epoch": 2.4404040404040406,
+ "grad_norm": 2.0838167667388916,
+ "learning_rate": 2.5616161616161617e-06,
+ "loss": 0.9676632881164551,
+ "mean_token_accuracy": 0.7421225905418396,
+ "num_tokens": 19791872.0,
+ "step": 1208
+ },
+ {
+ "entropy": 1.0109010934829712,
+ "epoch": 2.4424242424242424,
+ "grad_norm": 2.1739392280578613,
+ "learning_rate": 2.5595959595959595e-06,
+ "loss": 1.0201005935668945,
+ "mean_token_accuracy": 0.7366267442703247,
+ "num_tokens": 19808256.0,
+ "step": 1209
+ },
+ {
+ "entropy": 1.4037907123565674,
+ "epoch": 2.4444444444444446,
+ "grad_norm": 2.151865005493164,
+ "learning_rate": 2.5575757575757574e-06,
+ "loss": 1.4110395908355713,
+ "mean_token_accuracy": 0.6682339906692505,
+ "num_tokens": 19824640.0,
+ "step": 1210
+ },
+ {
+ "entropy": 1.2449947595596313,
+ "epoch": 2.4464646464646465,
+ "grad_norm": 2.065934896469116,
+ "learning_rate": 2.5555555555555557e-06,
+ "loss": 1.2521324157714844,
+ "mean_token_accuracy": 0.6952247023582458,
+ "num_tokens": 19841024.0,
+ "step": 1211
+ },
+ {
+ "entropy": 1.2075072526931763,
+ "epoch": 2.4484848484848483,
+ "grad_norm": 2.197885274887085,
+ "learning_rate": 2.5535353535353536e-06,
+ "loss": 1.2041654586791992,
+ "mean_token_accuracy": 0.69840008020401,
+ "num_tokens": 19857408.0,
+ "step": 1212
+ },
+ {
+ "entropy": 1.0454095602035522,
+ "epoch": 2.4505050505050505,
+ "grad_norm": 2.0778188705444336,
+ "learning_rate": 2.5515151515151515e-06,
+ "loss": 1.0392906665802002,
+ "mean_token_accuracy": 0.74187833070755,
+ "num_tokens": 19873792.0,
+ "step": 1213
+ },
+ {
+ "entropy": 1.3138911724090576,
+ "epoch": 2.4525252525252528,
+ "grad_norm": 2.1871910095214844,
+ "learning_rate": 2.5494949494949494e-06,
+ "loss": 1.317048192024231,
+ "mean_token_accuracy": 0.6720811128616333,
+ "num_tokens": 19890176.0,
+ "step": 1214
+ },
+ {
+ "entropy": 1.263680338859558,
+ "epoch": 2.4545454545454546,
+ "grad_norm": 2.129873752593994,
+ "learning_rate": 2.5474747474747473e-06,
+ "loss": 1.277045726776123,
+ "mean_token_accuracy": 0.7011480331420898,
+ "num_tokens": 19906560.0,
+ "step": 1215
+ },
+ {
+ "entropy": 0.9653311967849731,
+ "epoch": 2.4565656565656564,
+ "grad_norm": 2.1161508560180664,
+ "learning_rate": 2.5454545454545456e-06,
+ "loss": 0.9699352979660034,
+ "mean_token_accuracy": 0.7437713742256165,
+ "num_tokens": 19922944.0,
+ "step": 1216
+ },
+ {
+ "entropy": 1.350392460823059,
+ "epoch": 2.4585858585858587,
+ "grad_norm": 2.0958914756774902,
+ "learning_rate": 2.5434343434343435e-06,
+ "loss": 1.3442802429199219,
+ "mean_token_accuracy": 0.6768441796302795,
+ "num_tokens": 19939328.0,
+ "step": 1217
+ },
+ {
+ "entropy": 1.2484683990478516,
+ "epoch": 2.4606060606060605,
+ "grad_norm": 2.191668748855591,
+ "learning_rate": 2.541414141414142e-06,
+ "loss": 1.2663497924804688,
+ "mean_token_accuracy": 0.6958964467048645,
+ "num_tokens": 19955712.0,
+ "step": 1218
+ },
+ {
+ "entropy": 0.9751343131065369,
+ "epoch": 2.4626262626262627,
+ "grad_norm": 2.0976815223693848,
+ "learning_rate": 2.5393939393939397e-06,
+ "loss": 0.9734562635421753,
+ "mean_token_accuracy": 0.7372373938560486,
+ "num_tokens": 19972096.0,
+ "step": 1219
+ },
+ {
+ "entropy": 1.1655267477035522,
+ "epoch": 2.4646464646464645,
+ "grad_norm": 2.3504767417907715,
+ "learning_rate": 2.537373737373738e-06,
+ "loss": 1.1775636672973633,
+ "mean_token_accuracy": 0.7023082375526428,
+ "num_tokens": 19988480.0,
+ "step": 1220
+ },
+ {
+ "entropy": 1.3543325662612915,
+ "epoch": 2.466666666666667,
+ "grad_norm": 2.038313627243042,
+ "learning_rate": 2.535353535353536e-06,
+ "loss": 1.3447773456573486,
+ "mean_token_accuracy": 0.6779433488845825,
+ "num_tokens": 20004864.0,
+ "step": 1221
+ },
+ {
+ "entropy": 1.1814380884170532,
+ "epoch": 2.4686868686868686,
+ "grad_norm": 2.186947822570801,
+ "learning_rate": 2.5333333333333338e-06,
+ "loss": 1.186347246170044,
+ "mean_token_accuracy": 0.7064606547355652,
+ "num_tokens": 20021248.0,
+ "step": 1222
+ },
+ {
+ "entropy": 0.9775183796882629,
+ "epoch": 2.470707070707071,
+ "grad_norm": 2.144923210144043,
+ "learning_rate": 2.5313131313131317e-06,
+ "loss": 1.0010652542114258,
+ "mean_token_accuracy": 0.7385808229446411,
+ "num_tokens": 20037632.0,
+ "step": 1223
+ },
+ {
+ "entropy": 1.6076546907424927,
+ "epoch": 2.4727272727272727,
+ "grad_norm": 2.1664817333221436,
+ "learning_rate": 2.5292929292929296e-06,
+ "loss": 1.618837594985962,
+ "mean_token_accuracy": 0.6297630667686462,
+ "num_tokens": 20054016.0,
+ "step": 1224
+ },
+ {
+ "entropy": 1.0457805395126343,
+ "epoch": 2.474747474747475,
+ "grad_norm": 2.154000997543335,
+ "learning_rate": 2.5272727272727274e-06,
+ "loss": 1.0406007766723633,
+ "mean_token_accuracy": 0.7322911620140076,
+ "num_tokens": 20070400.0,
+ "step": 1225
+ },
+ {
+ "entropy": 1.065863847732544,
+ "epoch": 2.4767676767676767,
+ "grad_norm": 2.062626361846924,
+ "learning_rate": 2.5252525252525258e-06,
+ "loss": 1.0432696342468262,
+ "mean_token_accuracy": 0.7371152639389038,
+ "num_tokens": 20086784.0,
+ "step": 1226
+ },
+ {
+ "entropy": 1.5166304111480713,
+ "epoch": 2.4787878787878785,
+ "grad_norm": 2.089587926864624,
+ "learning_rate": 2.5232323232323236e-06,
+ "loss": 1.5205962657928467,
+ "mean_token_accuracy": 0.653822660446167,
+ "num_tokens": 20103168.0,
+ "step": 1227
+ },
+ {
+ "entropy": 1.5969332456588745,
+ "epoch": 2.480808080808081,
+ "grad_norm": 2.297184705734253,
+ "learning_rate": 2.5212121212121215e-06,
+ "loss": 1.611903190612793,
+ "mean_token_accuracy": 0.6246336102485657,
+ "num_tokens": 20119552.0,
+ "step": 1228
+ },
+ {
+ "entropy": 1.8385323286056519,
+ "epoch": 2.482828282828283,
+ "grad_norm": 2.0568299293518066,
+ "learning_rate": 2.5191919191919194e-06,
+ "loss": 1.848689079284668,
+ "mean_token_accuracy": 0.6079018115997314,
+ "num_tokens": 20135936.0,
+ "step": 1229
+ },
+ {
+ "entropy": 1.1586394309997559,
+ "epoch": 2.484848484848485,
+ "grad_norm": 1.91037917137146,
+ "learning_rate": 2.5171717171717173e-06,
+ "loss": 1.1482139825820923,
+ "mean_token_accuracy": 0.7165364027023315,
+ "num_tokens": 20152320.0,
+ "step": 1230
+ },
+ {
+ "entropy": 1.6905426979064941,
+ "epoch": 2.4868686868686867,
+ "grad_norm": 2.2317121028900146,
+ "learning_rate": 2.5151515151515156e-06,
+ "loss": 1.7028450965881348,
+ "mean_token_accuracy": 0.6125427484512329,
+ "num_tokens": 20168704.0,
+ "step": 1231
+ },
+ {
+ "entropy": 1.1329548358917236,
+ "epoch": 2.488888888888889,
+ "grad_norm": 2.112380027770996,
+ "learning_rate": 2.5131313131313135e-06,
+ "loss": 1.120601773262024,
+ "mean_token_accuracy": 0.7181240916252136,
+ "num_tokens": 20185088.0,
+ "step": 1232
+ },
+ {
+ "entropy": 1.2013109922409058,
+ "epoch": 2.4909090909090907,
+ "grad_norm": 2.087054491043091,
+ "learning_rate": 2.5111111111111114e-06,
+ "loss": 1.2169899940490723,
+ "mean_token_accuracy": 0.7089032530784607,
+ "num_tokens": 20201472.0,
+ "step": 1233
+ },
+ {
+ "entropy": 1.187458872795105,
+ "epoch": 2.492929292929293,
+ "grad_norm": 2.431793689727783,
+ "learning_rate": 2.5090909090909093e-06,
+ "loss": 1.2183618545532227,
+ "mean_token_accuracy": 0.6925378441810608,
+ "num_tokens": 20217856.0,
+ "step": 1234
+ },
+ {
+ "entropy": 1.2123541831970215,
+ "epoch": 2.494949494949495,
+ "grad_norm": 2.1715121269226074,
+ "learning_rate": 2.507070707070707e-06,
+ "loss": 1.2254973649978638,
+ "mean_token_accuracy": 0.703285276889801,
+ "num_tokens": 20234240.0,
+ "step": 1235
+ },
+ {
+ "entropy": 1.0582001209259033,
+ "epoch": 2.496969696969697,
+ "grad_norm": 2.222578763961792,
+ "learning_rate": 2.5050505050505055e-06,
+ "loss": 1.061441421508789,
+ "mean_token_accuracy": 0.7247191071510315,
+ "num_tokens": 20250624.0,
+ "step": 1236
+ },
+ {
+ "entropy": 1.5102840662002563,
+ "epoch": 2.498989898989899,
+ "grad_norm": 2.27860951423645,
+ "learning_rate": 2.5030303030303034e-06,
+ "loss": 1.519880771636963,
+ "mean_token_accuracy": 0.6581583023071289,
+ "num_tokens": 20267008.0,
+ "step": 1237
+ },
+ {
+ "entropy": 1.222317099571228,
+ "epoch": 2.501010101010101,
+ "grad_norm": 2.182908773422241,
+ "learning_rate": 2.5010101010101013e-06,
+ "loss": 1.2382556200027466,
+ "mean_token_accuracy": 0.6908891201019287,
+ "num_tokens": 20283392.0,
+ "step": 1238
+ },
+ {
+ "entropy": 1.252193570137024,
+ "epoch": 2.503030303030303,
+ "grad_norm": 2.2065556049346924,
+ "learning_rate": 2.498989898989899e-06,
+ "loss": 1.2510521411895752,
+ "mean_token_accuracy": 0.6914386749267578,
+ "num_tokens": 20299776.0,
+ "step": 1239
+ },
+ {
+ "entropy": 1.2909793853759766,
+ "epoch": 2.505050505050505,
+ "grad_norm": 2.374338150024414,
+ "learning_rate": 2.496969696969697e-06,
+ "loss": 1.3144972324371338,
+ "mean_token_accuracy": 0.6847215294837952,
+ "num_tokens": 20316160.0,
+ "step": 1240
+ },
+ {
+ "entropy": 1.5218966007232666,
+ "epoch": 2.507070707070707,
+ "grad_norm": 2.3914759159088135,
+ "learning_rate": 2.494949494949495e-06,
+ "loss": 1.5194602012634277,
+ "mean_token_accuracy": 0.6398998498916626,
+ "num_tokens": 20332544.0,
+ "step": 1241
+ },
+ {
+ "entropy": 1.2130569219589233,
+ "epoch": 2.509090909090909,
+ "grad_norm": 2.2857706546783447,
+ "learning_rate": 2.4929292929292932e-06,
+ "loss": 1.2035828828811646,
+ "mean_token_accuracy": 0.6977283954620361,
+ "num_tokens": 20348928.0,
+ "step": 1242
+ },
+ {
+ "entropy": 1.623070478439331,
+ "epoch": 2.511111111111111,
+ "grad_norm": 2.3757028579711914,
+ "learning_rate": 2.490909090909091e-06,
+ "loss": 1.654674768447876,
+ "mean_token_accuracy": 0.6242061257362366,
+ "num_tokens": 20365312.0,
+ "step": 1243
+ },
+ {
+ "entropy": 1.6762864589691162,
+ "epoch": 2.5131313131313133,
+ "grad_norm": 2.239466667175293,
+ "learning_rate": 2.488888888888889e-06,
+ "loss": 1.6712524890899658,
+ "mean_token_accuracy": 0.6280532479286194,
+ "num_tokens": 20381696.0,
+ "step": 1244
+ },
+ {
+ "entropy": 1.6754344701766968,
+ "epoch": 2.515151515151515,
+ "grad_norm": 2.2599003314971924,
+ "learning_rate": 2.486868686868687e-06,
+ "loss": 1.6697289943695068,
+ "mean_token_accuracy": 0.6158402562141418,
+ "num_tokens": 20398080.0,
+ "step": 1245
+ },
+ {
+ "entropy": 1.6282587051391602,
+ "epoch": 2.517171717171717,
+ "grad_norm": 2.0555050373077393,
+ "learning_rate": 2.4848484848484848e-06,
+ "loss": 1.6177103519439697,
+ "mean_token_accuracy": 0.63312166929245,
+ "num_tokens": 20414464.0,
+ "step": 1246
+ },
+ {
+ "entropy": 1.3457770347595215,
+ "epoch": 2.519191919191919,
+ "grad_norm": 2.3396496772766113,
+ "learning_rate": 2.482828282828283e-06,
+ "loss": 1.3288640975952148,
+ "mean_token_accuracy": 0.6720811128616333,
+ "num_tokens": 20430848.0,
+ "step": 1247
+ },
+ {
+ "entropy": 1.5269931554794312,
+ "epoch": 2.5212121212121215,
+ "grad_norm": 2.303053617477417,
+ "learning_rate": 2.480808080808081e-06,
+ "loss": 1.4953217506408691,
+ "mean_token_accuracy": 0.639167070388794,
+ "num_tokens": 20447232.0,
+ "step": 1248
+ },
+ {
+ "entropy": 1.3399546146392822,
+ "epoch": 2.5232323232323233,
+ "grad_norm": 2.3238017559051514,
+ "learning_rate": 2.478787878787879e-06,
+ "loss": 1.337552547454834,
+ "mean_token_accuracy": 0.6790425181388855,
+ "num_tokens": 20463616.0,
+ "step": 1249
+ },
+ {
+ "entropy": 1.0954687595367432,
+ "epoch": 2.525252525252525,
+ "grad_norm": 2.2266361713409424,
+ "learning_rate": 2.476767676767677e-06,
+ "loss": 1.074552297592163,
+ "mean_token_accuracy": 0.7192232608795166,
+ "num_tokens": 20480000.0,
+ "step": 1250
+ },
+ {
+ "epoch": 2.525252525252525,
+ "eval_entropy": 1.375552624464035,
+ "eval_loss": 1.5356626510620117,
+ "eval_mean_token_accuracy": 0.6455749580937047,
+ "eval_num_tokens": 20480000.0,
+ "eval_runtime": 43.8024,
+ "eval_samples_per_second": 22.602,
+ "eval_steps_per_second": 2.831,
+ "step": 1250
+ },
+ {
+ "entropy": 1.329379916191101,
+ "epoch": 2.5272727272727273,
+ "grad_norm": 2.288421392440796,
+ "learning_rate": 2.474747474747475e-06,
+ "loss": 1.3166120052337646,
+ "mean_token_accuracy": 0.6743404865264893,
+ "num_tokens": 20496384.0,
+ "step": 1251
+ },
+ {
+ "entropy": 1.3155947923660278,
+ "epoch": 2.529292929292929,
+ "grad_norm": 2.2791004180908203,
+ "learning_rate": 2.472727272727273e-06,
+ "loss": 1.3281152248382568,
+ "mean_token_accuracy": 0.6623717546463013,
+ "num_tokens": 20512768.0,
+ "step": 1252
+ },
+ {
+ "entropy": 1.2875827550888062,
+ "epoch": 2.5313131313131314,
+ "grad_norm": 2.193981409072876,
+ "learning_rate": 2.470707070707071e-06,
+ "loss": 1.280174732208252,
+ "mean_token_accuracy": 0.6996824741363525,
+ "num_tokens": 20529152.0,
+ "step": 1253
+ },
+ {
+ "entropy": 1.1551588773727417,
+ "epoch": 2.533333333333333,
+ "grad_norm": 2.297534942626953,
+ "learning_rate": 2.468686868686869e-06,
+ "loss": 1.1548980474472046,
+ "mean_token_accuracy": 0.7089643478393555,
+ "num_tokens": 20545536.0,
+ "step": 1254
+ },
+ {
+ "entropy": 1.1836578845977783,
+ "epoch": 2.5353535353535355,
+ "grad_norm": 2.1724929809570312,
+ "learning_rate": 2.466666666666667e-06,
+ "loss": 1.1787464618682861,
+ "mean_token_accuracy": 0.705422580242157,
+ "num_tokens": 20561920.0,
+ "step": 1255
+ },
+ {
+ "entropy": 1.0938197374343872,
+ "epoch": 2.5373737373737373,
+ "grad_norm": 2.247507095336914,
+ "learning_rate": 2.464646464646465e-06,
+ "loss": 1.0977723598480225,
+ "mean_token_accuracy": 0.7205055952072144,
+ "num_tokens": 20578304.0,
+ "step": 1256
+ },
+ {
+ "entropy": 1.790277361869812,
+ "epoch": 2.5393939393939395,
+ "grad_norm": 2.314159631729126,
+ "learning_rate": 2.462626262626263e-06,
+ "loss": 1.792272925376892,
+ "mean_token_accuracy": 0.6231069564819336,
+ "num_tokens": 20594688.0,
+ "step": 1257
+ },
+ {
+ "entropy": 1.385352611541748,
+ "epoch": 2.5414141414141413,
+ "grad_norm": 2.2065250873565674,
+ "learning_rate": 2.4606060606060607e-06,
+ "loss": 1.4161381721496582,
+ "mean_token_accuracy": 0.673363447189331,
+ "num_tokens": 20611072.0,
+ "step": 1258
+ },
+ {
+ "entropy": 1.5186140537261963,
+ "epoch": 2.5434343434343436,
+ "grad_norm": 2.277163028717041,
+ "learning_rate": 2.4585858585858586e-06,
+ "loss": 1.5157082080841064,
+ "mean_token_accuracy": 0.6420371532440186,
+ "num_tokens": 20627456.0,
+ "step": 1259
+ },
+ {
+ "entropy": 1.6179429292678833,
+ "epoch": 2.5454545454545454,
+ "grad_norm": 2.1880221366882324,
+ "learning_rate": 2.456565656565657e-06,
+ "loss": 1.6365107297897339,
+ "mean_token_accuracy": 0.6164509057998657,
+ "num_tokens": 20643840.0,
+ "step": 1260
+ },
+ {
+ "entropy": 1.5839602947235107,
+ "epoch": 2.5474747474747472,
+ "grad_norm": 2.3658924102783203,
+ "learning_rate": 2.454545454545455e-06,
+ "loss": 1.593346118927002,
+ "mean_token_accuracy": 0.6339765787124634,
+ "num_tokens": 20660224.0,
+ "step": 1261
+ },
+ {
+ "entropy": 1.3825792074203491,
+ "epoch": 2.5494949494949495,
+ "grad_norm": 2.3293564319610596,
+ "learning_rate": 2.4525252525252527e-06,
+ "loss": 1.44181489944458,
+ "mean_token_accuracy": 0.6660356521606445,
+ "num_tokens": 20676608.0,
+ "step": 1262
+ },
+ {
+ "entropy": 1.0796198844909668,
+ "epoch": 2.5515151515151517,
+ "grad_norm": 2.1055870056152344,
+ "learning_rate": 2.4505050505050506e-06,
+ "loss": 1.0861892700195312,
+ "mean_token_accuracy": 0.7263067960739136,
+ "num_tokens": 20692992.0,
+ "step": 1263
+ },
+ {
+ "entropy": 1.4059629440307617,
+ "epoch": 2.5535353535353535,
+ "grad_norm": 2.137063980102539,
+ "learning_rate": 2.4484848484848485e-06,
+ "loss": 1.4127235412597656,
+ "mean_token_accuracy": 0.6654250025749207,
+ "num_tokens": 20709376.0,
+ "step": 1264
+ },
+ {
+ "entropy": 1.2902467250823975,
+ "epoch": 2.5555555555555554,
+ "grad_norm": 2.175401210784912,
+ "learning_rate": 2.4464646464646468e-06,
+ "loss": 1.2854642868041992,
+ "mean_token_accuracy": 0.6966292262077332,
+ "num_tokens": 20725760.0,
+ "step": 1265
+ },
+ {
+ "entropy": 1.7958943843841553,
+ "epoch": 2.5575757575757576,
+ "grad_norm": 2.3500523567199707,
+ "learning_rate": 2.4444444444444447e-06,
+ "loss": 1.811906337738037,
+ "mean_token_accuracy": 0.5961162447929382,
+ "num_tokens": 20742144.0,
+ "step": 1266
+ },
+ {
+ "entropy": 1.7406131029129028,
+ "epoch": 2.55959595959596,
+ "grad_norm": 2.3911163806915283,
+ "learning_rate": 2.4424242424242426e-06,
+ "loss": 1.7608356475830078,
+ "mean_token_accuracy": 0.6002076268196106,
+ "num_tokens": 20758528.0,
+ "step": 1267
+ },
+ {
+ "entropy": 1.440137267112732,
+ "epoch": 2.5616161616161617,
+ "grad_norm": 2.057145833969116,
+ "learning_rate": 2.4404040404040404e-06,
+ "loss": 1.4450485706329346,
+ "mean_token_accuracy": 0.6570591330528259,
+ "num_tokens": 20774912.0,
+ "step": 1268
+ },
+ {
+ "entropy": 1.510685682296753,
+ "epoch": 2.5636363636363635,
+ "grad_norm": 2.379920244216919,
+ "learning_rate": 2.4383838383838383e-06,
+ "loss": 1.5113954544067383,
+ "mean_token_accuracy": 0.6450293064117432,
+ "num_tokens": 20791296.0,
+ "step": 1269
+ },
+ {
+ "entropy": 1.3595963716506958,
+ "epoch": 2.5656565656565657,
+ "grad_norm": 2.226229190826416,
+ "learning_rate": 2.4363636363636366e-06,
+ "loss": 1.3598928451538086,
+ "mean_token_accuracy": 0.6723864078521729,
+ "num_tokens": 20807680.0,
+ "step": 1270
+ },
+ {
+ "entropy": 1.3053373098373413,
+ "epoch": 2.5676767676767676,
+ "grad_norm": 2.181692361831665,
+ "learning_rate": 2.4343434343434345e-06,
+ "loss": 1.283501148223877,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 20824064.0,
+ "step": 1271
+ },
+ {
+ "entropy": 0.9631388187408447,
+ "epoch": 2.56969696969697,
+ "grad_norm": 2.083442449569702,
+ "learning_rate": 2.432323232323233e-06,
+ "loss": 0.9463216066360474,
+ "mean_token_accuracy": 0.7476184368133545,
+ "num_tokens": 20840448.0,
+ "step": 1272
+ },
+ {
+ "entropy": 1.0792899131774902,
+ "epoch": 2.5717171717171716,
+ "grad_norm": 2.204257011413574,
+ "learning_rate": 2.4303030303030307e-06,
+ "loss": 1.0787214040756226,
+ "mean_token_accuracy": 0.7241694927215576,
+ "num_tokens": 20856832.0,
+ "step": 1273
+ },
+ {
+ "entropy": 1.0843226909637451,
+ "epoch": 2.573737373737374,
+ "grad_norm": 2.0145976543426514,
+ "learning_rate": 2.4282828282828286e-06,
+ "loss": 1.0722554922103882,
+ "mean_token_accuracy": 0.7263678312301636,
+ "num_tokens": 20873216.0,
+ "step": 1274
+ },
+ {
+ "entropy": 1.5040221214294434,
+ "epoch": 2.5757575757575757,
+ "grad_norm": 2.3076000213623047,
+ "learning_rate": 2.4262626262626265e-06,
+ "loss": 1.5152506828308105,
+ "mean_token_accuracy": 0.6420371532440186,
+ "num_tokens": 20889600.0,
+ "step": 1275
+ },
+ {
+ "entropy": 1.5882561206817627,
+ "epoch": 2.5777777777777775,
+ "grad_norm": 2.093400716781616,
+ "learning_rate": 2.4242424242424244e-06,
+ "loss": 1.5827500820159912,
+ "mean_token_accuracy": 0.6293356418609619,
+ "num_tokens": 20905984.0,
+ "step": 1276
+ },
+ {
+ "entropy": 1.1761770248413086,
+ "epoch": 2.5797979797979798,
+ "grad_norm": 1.9723676443099976,
+ "learning_rate": 2.4222222222222223e-06,
+ "loss": 1.1729084253311157,
+ "mean_token_accuracy": 0.7160478830337524,
+ "num_tokens": 20922368.0,
+ "step": 1277
+ },
+ {
+ "entropy": 1.5020796060562134,
+ "epoch": 2.581818181818182,
+ "grad_norm": 2.198739767074585,
+ "learning_rate": 2.4202020202020206e-06,
+ "loss": 1.5012025833129883,
+ "mean_token_accuracy": 0.6408768892288208,
+ "num_tokens": 20938752.0,
+ "step": 1278
+ },
+ {
+ "entropy": 1.0234061479568481,
+ "epoch": 2.583838383838384,
+ "grad_norm": 2.0784571170806885,
+ "learning_rate": 2.4181818181818185e-06,
+ "loss": 1.0343588590621948,
+ "mean_token_accuracy": 0.7372984886169434,
+ "num_tokens": 20955136.0,
+ "step": 1279
+ },
+ {
+ "entropy": 1.6372766494750977,
+ "epoch": 2.5858585858585856,
+ "grad_norm": 2.339104652404785,
+ "learning_rate": 2.4161616161616164e-06,
+ "loss": 1.6200227737426758,
+ "mean_token_accuracy": 0.6249389052391052,
+ "num_tokens": 20971520.0,
+ "step": 1280
+ },
+ {
+ "entropy": 1.3991668224334717,
+ "epoch": 2.587878787878788,
+ "grad_norm": 2.33329439163208,
+ "learning_rate": 2.4141414141414143e-06,
+ "loss": 1.434525489807129,
+ "mean_token_accuracy": 0.6656692624092102,
+ "num_tokens": 20987904.0,
+ "step": 1281
+ },
+ {
+ "entropy": 0.9680843949317932,
+ "epoch": 2.58989898989899,
+ "grad_norm": 2.0454914569854736,
+ "learning_rate": 2.412121212121212e-06,
+ "loss": 0.9875590801239014,
+ "mean_token_accuracy": 0.7512823939323425,
+ "num_tokens": 21004288.0,
+ "step": 1282
+ },
+ {
+ "entropy": 1.1564005613327026,
+ "epoch": 2.591919191919192,
+ "grad_norm": 2.0994997024536133,
+ "learning_rate": 2.4101010101010105e-06,
+ "loss": 1.1473734378814697,
+ "mean_token_accuracy": 0.709208607673645,
+ "num_tokens": 21020672.0,
+ "step": 1283
+ },
+ {
+ "entropy": 1.435438871383667,
+ "epoch": 2.5939393939393938,
+ "grad_norm": 2.369999408721924,
+ "learning_rate": 2.4080808080808083e-06,
+ "loss": 1.4502406120300293,
+ "mean_token_accuracy": 0.6505251526832581,
+ "num_tokens": 21037056.0,
+ "step": 1284
+ },
+ {
+ "entropy": 1.358853816986084,
+ "epoch": 2.595959595959596,
+ "grad_norm": 4.034506320953369,
+ "learning_rate": 2.4060606060606062e-06,
+ "loss": 1.3811532258987427,
+ "mean_token_accuracy": 0.6720200181007385,
+ "num_tokens": 21053440.0,
+ "step": 1285
+ },
+ {
+ "entropy": 1.2741261720657349,
+ "epoch": 2.597979797979798,
+ "grad_norm": 2.231471061706543,
+ "learning_rate": 2.404040404040404e-06,
+ "loss": 1.2811863422393799,
+ "mean_token_accuracy": 0.6806302070617676,
+ "num_tokens": 21069824.0,
+ "step": 1286
+ },
+ {
+ "entropy": 1.3789101839065552,
+ "epoch": 2.6,
+ "grad_norm": 2.287457227706909,
+ "learning_rate": 2.402020202020202e-06,
+ "loss": 1.389050006866455,
+ "mean_token_accuracy": 0.6687836050987244,
+ "num_tokens": 21086208.0,
+ "step": 1287
+ },
+ {
+ "entropy": 1.0021989345550537,
+ "epoch": 2.602020202020202,
+ "grad_norm": 1.9996925592422485,
+ "learning_rate": 2.4000000000000003e-06,
+ "loss": 1.028086543083191,
+ "mean_token_accuracy": 0.7479237914085388,
+ "num_tokens": 21102592.0,
+ "step": 1288
+ },
+ {
+ "entropy": 1.4363199472427368,
+ "epoch": 2.604040404040404,
+ "grad_norm": 2.203239917755127,
+ "learning_rate": 2.397979797979798e-06,
+ "loss": 1.4645861387252808,
+ "mean_token_accuracy": 0.6590132117271423,
+ "num_tokens": 21118976.0,
+ "step": 1289
+ },
+ {
+ "entropy": 1.307484745979309,
+ "epoch": 2.606060606060606,
+ "grad_norm": 1.9925199747085571,
+ "learning_rate": 2.395959595959596e-06,
+ "loss": 1.3217129707336426,
+ "mean_token_accuracy": 0.6787371635437012,
+ "num_tokens": 21135360.0,
+ "step": 1290
+ },
+ {
+ "entropy": 1.2430635690689087,
+ "epoch": 2.608080808080808,
+ "grad_norm": 2.1385529041290283,
+ "learning_rate": 2.393939393939394e-06,
+ "loss": 1.238807201385498,
+ "mean_token_accuracy": 0.6949804425239563,
+ "num_tokens": 21151744.0,
+ "step": 1291
+ },
+ {
+ "entropy": 1.0351316928863525,
+ "epoch": 2.61010101010101,
+ "grad_norm": 2.2897744178771973,
+ "learning_rate": 2.3919191919191923e-06,
+ "loss": 1.032408595085144,
+ "mean_token_accuracy": 0.7267953157424927,
+ "num_tokens": 21168128.0,
+ "step": 1292
+ },
+ {
+ "entropy": 1.2167868614196777,
+ "epoch": 2.6121212121212123,
+ "grad_norm": 2.021771192550659,
+ "learning_rate": 2.38989898989899e-06,
+ "loss": 1.223731279373169,
+ "mean_token_accuracy": 0.7067049145698547,
+ "num_tokens": 21184512.0,
+ "step": 1293
+ },
+ {
+ "entropy": 1.0386477708816528,
+ "epoch": 2.614141414141414,
+ "grad_norm": 2.048285722732544,
+ "learning_rate": 2.387878787878788e-06,
+ "loss": 1.0437978506088257,
+ "mean_token_accuracy": 0.7332682013511658,
+ "num_tokens": 21200896.0,
+ "step": 1294
+ },
+ {
+ "entropy": 1.5832154750823975,
+ "epoch": 2.616161616161616,
+ "grad_norm": 2.214010715484619,
+ "learning_rate": 2.385858585858586e-06,
+ "loss": 1.5869958400726318,
+ "mean_token_accuracy": 0.6240839958190918,
+ "num_tokens": 21217280.0,
+ "step": 1295
+ },
+ {
+ "entropy": 1.4032398462295532,
+ "epoch": 2.618181818181818,
+ "grad_norm": 2.069399833679199,
+ "learning_rate": 2.3838383838383843e-06,
+ "loss": 1.40470290184021,
+ "mean_token_accuracy": 0.6671348214149475,
+ "num_tokens": 21233664.0,
+ "step": 1296
+ },
+ {
+ "entropy": 1.1057566404342651,
+ "epoch": 2.6202020202020204,
+ "grad_norm": 2.090847969055176,
+ "learning_rate": 2.381818181818182e-06,
+ "loss": 1.099064826965332,
+ "mean_token_accuracy": 0.7186736464500427,
+ "num_tokens": 21250048.0,
+ "step": 1297
+ },
+ {
+ "entropy": 1.1217924356460571,
+ "epoch": 2.6222222222222222,
+ "grad_norm": 2.2802088260650635,
+ "learning_rate": 2.37979797979798e-06,
+ "loss": 1.1425195932388306,
+ "mean_token_accuracy": 0.717452347278595,
+ "num_tokens": 21266432.0,
+ "step": 1298
+ },
+ {
+ "entropy": 1.3103245496749878,
+ "epoch": 2.624242424242424,
+ "grad_norm": 2.2961838245391846,
+ "learning_rate": 2.377777777777778e-06,
+ "loss": 1.325084924697876,
+ "mean_token_accuracy": 0.6704323291778564,
+ "num_tokens": 21282816.0,
+ "step": 1299
+ },
+ {
+ "entropy": 1.397556185722351,
+ "epoch": 2.6262626262626263,
+ "grad_norm": 2.14385986328125,
+ "learning_rate": 2.375757575757576e-06,
+ "loss": 1.3891851902008057,
+ "mean_token_accuracy": 0.6722642779350281,
+ "num_tokens": 21299200.0,
+ "step": 1300
+ },
+ {
+ "epoch": 2.6262626262626263,
+ "eval_entropy": 1.377457697064646,
+ "eval_loss": 1.5343767404556274,
+ "eval_mean_token_accuracy": 0.6456591679203895,
+ "eval_num_tokens": 21299200.0,
+ "eval_runtime": 43.8661,
+ "eval_samples_per_second": 22.569,
+ "eval_steps_per_second": 2.827,
+ "step": 1300
+ },
+ {
+ "entropy": 1.4542138576507568,
+ "epoch": 2.6282828282828286,
+ "grad_norm": 2.2326884269714355,
+ "learning_rate": 2.373737373737374e-06,
+ "loss": 1.459869384765625,
+ "mean_token_accuracy": 0.6545554399490356,
+ "num_tokens": 21315584.0,
+ "step": 1301
+ },
+ {
+ "entropy": 1.144904613494873,
+ "epoch": 2.6303030303030304,
+ "grad_norm": 2.0662593841552734,
+ "learning_rate": 2.371717171717172e-06,
+ "loss": 1.151012897491455,
+ "mean_token_accuracy": 0.7232535481452942,
+ "num_tokens": 21331968.0,
+ "step": 1302
+ },
+ {
+ "entropy": 1.2142722606658936,
+ "epoch": 2.632323232323232,
+ "grad_norm": 2.206763982772827,
+ "learning_rate": 2.36969696969697e-06,
+ "loss": 1.2040069103240967,
+ "mean_token_accuracy": 0.7002320289611816,
+ "num_tokens": 21348352.0,
+ "step": 1303
+ },
+ {
+ "entropy": 1.7695715427398682,
+ "epoch": 2.6343434343434344,
+ "grad_norm": 2.1346793174743652,
+ "learning_rate": 2.367676767676768e-06,
+ "loss": 1.7356187105178833,
+ "mean_token_accuracy": 0.6051538586616516,
+ "num_tokens": 21364736.0,
+ "step": 1304
+ },
+ {
+ "entropy": 1.351786494255066,
+ "epoch": 2.6363636363636362,
+ "grad_norm": 2.291290283203125,
+ "learning_rate": 2.3656565656565657e-06,
+ "loss": 1.3471777439117432,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 21381120.0,
+ "step": 1305
+ },
+ {
+ "entropy": 1.202124834060669,
+ "epoch": 2.6383838383838385,
+ "grad_norm": 2.1541965007781982,
+ "learning_rate": 2.363636363636364e-06,
+ "loss": 1.2085479497909546,
+ "mean_token_accuracy": 0.7031631469726562,
+ "num_tokens": 21397504.0,
+ "step": 1306
+ },
+ {
+ "entropy": 0.9269154667854309,
+ "epoch": 2.6404040404040403,
+ "grad_norm": 2.1681666374206543,
+ "learning_rate": 2.361616161616162e-06,
+ "loss": 0.9319549798965454,
+ "mean_token_accuracy": 0.7553126811981201,
+ "num_tokens": 21413888.0,
+ "step": 1307
+ },
+ {
+ "entropy": 1.0244951248168945,
+ "epoch": 2.6424242424242426,
+ "grad_norm": 1.9392226934432983,
+ "learning_rate": 2.3595959595959598e-06,
+ "loss": 0.9993175268173218,
+ "mean_token_accuracy": 0.7588544487953186,
+ "num_tokens": 21430272.0,
+ "step": 1308
+ },
+ {
+ "entropy": 1.256042718887329,
+ "epoch": 2.6444444444444444,
+ "grad_norm": 2.346327304840088,
+ "learning_rate": 2.3575757575757577e-06,
+ "loss": 1.2512779235839844,
+ "mean_token_accuracy": 0.6858206987380981,
+ "num_tokens": 21446656.0,
+ "step": 1309
+ },
+ {
+ "entropy": 1.0318644046783447,
+ "epoch": 2.6464646464646466,
+ "grad_norm": 1.988356113433838,
+ "learning_rate": 2.3555555555555555e-06,
+ "loss": 1.0428593158721924,
+ "mean_token_accuracy": 0.7383365631103516,
+ "num_tokens": 21463040.0,
+ "step": 1310
+ },
+ {
+ "entropy": 1.3145314455032349,
+ "epoch": 2.6484848484848484,
+ "grad_norm": 2.1777143478393555,
+ "learning_rate": 2.3535353535353534e-06,
+ "loss": 1.3207441568374634,
+ "mean_token_accuracy": 0.6881411671638489,
+ "num_tokens": 21479424.0,
+ "step": 1311
+ },
+ {
+ "entropy": 1.2858450412750244,
+ "epoch": 2.6505050505050507,
+ "grad_norm": 2.2654671669006348,
+ "learning_rate": 2.3515151515151517e-06,
+ "loss": 1.2940181493759155,
+ "mean_token_accuracy": 0.6831338405609131,
+ "num_tokens": 21495808.0,
+ "step": 1312
+ },
+ {
+ "entropy": 1.4315612316131592,
+ "epoch": 2.6525252525252525,
+ "grad_norm": 2.140456438064575,
+ "learning_rate": 2.3494949494949496e-06,
+ "loss": 1.4298607110977173,
+ "mean_token_accuracy": 0.6585246920585632,
+ "num_tokens": 21512192.0,
+ "step": 1313
+ },
+ {
+ "entropy": 1.2628042697906494,
+ "epoch": 2.6545454545454543,
+ "grad_norm": 2.387079954147339,
+ "learning_rate": 2.347474747474748e-06,
+ "loss": 1.2526830434799194,
+ "mean_token_accuracy": 0.6882632970809937,
+ "num_tokens": 21528576.0,
+ "step": 1314
+ },
+ {
+ "entropy": 1.3501923084259033,
+ "epoch": 2.6565656565656566,
+ "grad_norm": 2.17873215675354,
+ "learning_rate": 2.345454545454546e-06,
+ "loss": 1.3459683656692505,
+ "mean_token_accuracy": 0.6783707737922668,
+ "num_tokens": 21544960.0,
+ "step": 1315
+ },
+ {
+ "entropy": 1.4369540214538574,
+ "epoch": 2.658585858585859,
+ "grad_norm": 2.335825204849243,
+ "learning_rate": 2.3434343434343437e-06,
+ "loss": 1.4296600818634033,
+ "mean_token_accuracy": 0.6534562706947327,
+ "num_tokens": 21561344.0,
+ "step": 1316
+ },
+ {
+ "entropy": 1.1612765789031982,
+ "epoch": 2.6606060606060606,
+ "grad_norm": 2.194164276123047,
+ "learning_rate": 2.3414141414141416e-06,
+ "loss": 1.1527385711669922,
+ "mean_token_accuracy": 0.7140327095985413,
+ "num_tokens": 21577728.0,
+ "step": 1317
+ },
+ {
+ "entropy": 1.0844523906707764,
+ "epoch": 2.6626262626262625,
+ "grad_norm": 2.1018459796905518,
+ "learning_rate": 2.3393939393939395e-06,
+ "loss": 1.0732126235961914,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 21594112.0,
+ "step": 1318
+ },
+ {
+ "entropy": 1.1760655641555786,
+ "epoch": 2.6646464646464647,
+ "grad_norm": 2.1674582958221436,
+ "learning_rate": 2.337373737373738e-06,
+ "loss": 1.1928012371063232,
+ "mean_token_accuracy": 0.693453848361969,
+ "num_tokens": 21610496.0,
+ "step": 1319
+ },
+ {
+ "entropy": 1.3627854585647583,
+ "epoch": 2.6666666666666665,
+ "grad_norm": 2.2469325065612793,
+ "learning_rate": 2.3353535353535357e-06,
+ "loss": 1.375096321105957,
+ "mean_token_accuracy": 0.6670737862586975,
+ "num_tokens": 21626880.0,
+ "step": 1320
+ },
+ {
+ "entropy": 1.0562385320663452,
+ "epoch": 2.6686868686868688,
+ "grad_norm": 2.3479180335998535,
+ "learning_rate": 2.3333333333333336e-06,
+ "loss": 1.0513578653335571,
+ "mean_token_accuracy": 0.7401685118675232,
+ "num_tokens": 21643264.0,
+ "step": 1321
+ },
+ {
+ "entropy": 1.1622484922409058,
+ "epoch": 2.6707070707070706,
+ "grad_norm": 2.218021869659424,
+ "learning_rate": 2.3313131313131315e-06,
+ "loss": 1.172579288482666,
+ "mean_token_accuracy": 0.7042623162269592,
+ "num_tokens": 21659648.0,
+ "step": 1322
+ },
+ {
+ "entropy": 1.2139835357666016,
+ "epoch": 2.672727272727273,
+ "grad_norm": 2.2875492572784424,
+ "learning_rate": 2.3292929292929294e-06,
+ "loss": 1.2015337944030762,
+ "mean_token_accuracy": 0.7027357220649719,
+ "num_tokens": 21676032.0,
+ "step": 1323
+ },
+ {
+ "entropy": 1.7094130516052246,
+ "epoch": 2.6747474747474747,
+ "grad_norm": 2.2344024181365967,
+ "learning_rate": 2.3272727272727277e-06,
+ "loss": 1.7565287351608276,
+ "mean_token_accuracy": 0.6025891304016113,
+ "num_tokens": 21692416.0,
+ "step": 1324
+ },
+ {
+ "entropy": 1.1033966541290283,
+ "epoch": 2.676767676767677,
+ "grad_norm": 2.2697556018829346,
+ "learning_rate": 2.3252525252525256e-06,
+ "loss": 1.1173789501190186,
+ "mean_token_accuracy": 0.7180629968643188,
+ "num_tokens": 21708800.0,
+ "step": 1325
+ },
+ {
+ "entropy": 0.9456706643104553,
+ "epoch": 2.6787878787878787,
+ "grad_norm": 2.1194941997528076,
+ "learning_rate": 2.3232323232323234e-06,
+ "loss": 0.9613161087036133,
+ "mean_token_accuracy": 0.7573277950286865,
+ "num_tokens": 21725184.0,
+ "step": 1326
+ },
+ {
+ "entropy": 1.098917841911316,
+ "epoch": 2.680808080808081,
+ "grad_norm": 2.2719058990478516,
+ "learning_rate": 2.3212121212121213e-06,
+ "loss": 1.116957664489746,
+ "mean_token_accuracy": 0.709269642829895,
+ "num_tokens": 21741568.0,
+ "step": 1327
+ },
+ {
+ "entropy": 1.5637823343276978,
+ "epoch": 2.682828282828283,
+ "grad_norm": 2.257596731185913,
+ "learning_rate": 2.3191919191919192e-06,
+ "loss": 1.5726745128631592,
+ "mean_token_accuracy": 0.6359306573867798,
+ "num_tokens": 21757952.0,
+ "step": 1328
+ },
+ {
+ "entropy": 0.9321528673171997,
+ "epoch": 2.6848484848484846,
+ "grad_norm": 2.0641798973083496,
+ "learning_rate": 2.317171717171717e-06,
+ "loss": 0.9297301769256592,
+ "mean_token_accuracy": 0.7602589130401611,
+ "num_tokens": 21774336.0,
+ "step": 1329
+ },
+ {
+ "entropy": 1.2314496040344238,
+ "epoch": 2.686868686868687,
+ "grad_norm": 2.143329620361328,
+ "learning_rate": 2.3151515151515154e-06,
+ "loss": 1.2292556762695312,
+ "mean_token_accuracy": 0.6940034031867981,
+ "num_tokens": 21790720.0,
+ "step": 1330
+ },
+ {
+ "entropy": 1.195270299911499,
+ "epoch": 2.688888888888889,
+ "grad_norm": 2.291335105895996,
+ "learning_rate": 2.3131313131313133e-06,
+ "loss": 1.1904417276382446,
+ "mean_token_accuracy": 0.7023082375526428,
+ "num_tokens": 21807104.0,
+ "step": 1331
+ },
+ {
+ "entropy": 0.8783636093139648,
+ "epoch": 2.690909090909091,
+ "grad_norm": 2.069147825241089,
+ "learning_rate": 2.311111111111111e-06,
+ "loss": 0.8936513066291809,
+ "mean_token_accuracy": 0.7703346610069275,
+ "num_tokens": 21823488.0,
+ "step": 1332
+ },
+ {
+ "entropy": 1.3100625276565552,
+ "epoch": 2.6929292929292927,
+ "grad_norm": 2.396043300628662,
+ "learning_rate": 2.309090909090909e-06,
+ "loss": 1.3054237365722656,
+ "mean_token_accuracy": 0.6758671402931213,
+ "num_tokens": 21839872.0,
+ "step": 1333
+ },
+ {
+ "entropy": 0.9413285255432129,
+ "epoch": 2.694949494949495,
+ "grad_norm": 2.0738699436187744,
+ "learning_rate": 2.307070707070707e-06,
+ "loss": 0.9171029329299927,
+ "mean_token_accuracy": 0.7571446299552917,
+ "num_tokens": 21856256.0,
+ "step": 1334
+ },
+ {
+ "entropy": 1.268250584602356,
+ "epoch": 2.6969696969696972,
+ "grad_norm": 2.0988986492156982,
+ "learning_rate": 2.3050505050505053e-06,
+ "loss": 1.257792353630066,
+ "mean_token_accuracy": 0.6866145730018616,
+ "num_tokens": 21872640.0,
+ "step": 1335
+ },
+ {
+ "entropy": 1.3402502536773682,
+ "epoch": 2.698989898989899,
+ "grad_norm": 2.08109712600708,
+ "learning_rate": 2.303030303030303e-06,
+ "loss": 1.3316476345062256,
+ "mean_token_accuracy": 0.6869198679924011,
+ "num_tokens": 21889024.0,
+ "step": 1336
+ },
+ {
+ "entropy": 1.5612709522247314,
+ "epoch": 2.701010101010101,
+ "grad_norm": 2.2410786151885986,
+ "learning_rate": 2.3010101010101015e-06,
+ "loss": 1.5604108572006226,
+ "mean_token_accuracy": 0.6339765787124634,
+ "num_tokens": 21905408.0,
+ "step": 1337
+ },
+ {
+ "entropy": 1.0962555408477783,
+ "epoch": 2.703030303030303,
+ "grad_norm": 2.289069890975952,
+ "learning_rate": 2.2989898989898994e-06,
+ "loss": 1.1016948223114014,
+ "mean_token_accuracy": 0.714093804359436,
+ "num_tokens": 21921792.0,
+ "step": 1338
+ },
+ {
+ "entropy": 1.600198745727539,
+ "epoch": 2.705050505050505,
+ "grad_norm": 2.152244806289673,
+ "learning_rate": 2.2969696969696973e-06,
+ "loss": 1.608877420425415,
+ "mean_token_accuracy": 0.6394724249839783,
+ "num_tokens": 21938176.0,
+ "step": 1339
+ },
+ {
+ "entropy": 1.4823815822601318,
+ "epoch": 2.707070707070707,
+ "grad_norm": 2.142822742462158,
+ "learning_rate": 2.294949494949495e-06,
+ "loss": 1.4775569438934326,
+ "mean_token_accuracy": 0.6656082272529602,
+ "num_tokens": 21954560.0,
+ "step": 1340
+ },
+ {
+ "entropy": 1.1100481748580933,
+ "epoch": 2.709090909090909,
+ "grad_norm": 2.271402597427368,
+ "learning_rate": 2.292929292929293e-06,
+ "loss": 1.1097328662872314,
+ "mean_token_accuracy": 0.7238031029701233,
+ "num_tokens": 21970944.0,
+ "step": 1341
+ },
+ {
+ "entropy": 1.3482670783996582,
+ "epoch": 2.7111111111111112,
+ "grad_norm": 2.136296510696411,
+ "learning_rate": 2.2909090909090913e-06,
+ "loss": 1.3715920448303223,
+ "mean_token_accuracy": 0.670615553855896,
+ "num_tokens": 21987328.0,
+ "step": 1342
+ },
+ {
+ "entropy": 1.3454313278198242,
+ "epoch": 2.713131313131313,
+ "grad_norm": 1.8919764757156372,
+ "learning_rate": 2.2888888888888892e-06,
+ "loss": 1.3545129299163818,
+ "mean_token_accuracy": 0.6950415372848511,
+ "num_tokens": 22003712.0,
+ "step": 1343
+ },
+ {
+ "entropy": 1.314072847366333,
+ "epoch": 2.7151515151515153,
+ "grad_norm": 2.0495684146881104,
+ "learning_rate": 2.286868686868687e-06,
+ "loss": 1.3117344379425049,
+ "mean_token_accuracy": 0.6800195574760437,
+ "num_tokens": 22020096.0,
+ "step": 1344
+ },
+ {
+ "entropy": 0.7977169156074524,
+ "epoch": 2.717171717171717,
+ "grad_norm": 2.050006866455078,
+ "learning_rate": 2.284848484848485e-06,
+ "loss": 0.7982609868049622,
+ "mean_token_accuracy": 0.7774181962013245,
+ "num_tokens": 22036480.0,
+ "step": 1345
+ },
+ {
+ "entropy": 1.6121824979782104,
+ "epoch": 2.7191919191919194,
+ "grad_norm": 2.1058602333068848,
+ "learning_rate": 2.282828282828283e-06,
+ "loss": 1.6340572834014893,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 22052864.0,
+ "step": 1346
+ },
+ {
+ "entropy": 1.2698943614959717,
+ "epoch": 2.721212121212121,
+ "grad_norm": 1.9856007099151611,
+ "learning_rate": 2.2808080808080808e-06,
+ "loss": 1.2857555150985718,
+ "mean_token_accuracy": 0.7088422179222107,
+ "num_tokens": 22069248.0,
+ "step": 1347
+ },
+ {
+ "entropy": 1.6614608764648438,
+ "epoch": 2.723232323232323,
+ "grad_norm": 2.1818666458129883,
+ "learning_rate": 2.278787878787879e-06,
+ "loss": 1.6615056991577148,
+ "mean_token_accuracy": 0.6217635273933411,
+ "num_tokens": 22085632.0,
+ "step": 1348
+ },
+ {
+ "entropy": 1.542864203453064,
+ "epoch": 2.7252525252525253,
+ "grad_norm": 2.1022093296051025,
+ "learning_rate": 2.276767676767677e-06,
+ "loss": 1.5696978569030762,
+ "mean_token_accuracy": 0.6462506055831909,
+ "num_tokens": 22102016.0,
+ "step": 1349
+ },
+ {
+ "entropy": 1.0613912343978882,
+ "epoch": 2.7272727272727275,
+ "grad_norm": 2.213463068008423,
+ "learning_rate": 2.274747474747475e-06,
+ "loss": 1.0789921283721924,
+ "mean_token_accuracy": 0.7288104295730591,
+ "num_tokens": 22118400.0,
+ "step": 1350
+ },
+ {
+ "epoch": 2.7272727272727275,
+ "eval_entropy": 1.362602738603469,
+ "eval_loss": 1.5345665216445923,
+ "eval_mean_token_accuracy": 0.6458812678052533,
+ "eval_num_tokens": 22118400.0,
+ "eval_runtime": 43.734,
+ "eval_samples_per_second": 22.637,
+ "eval_steps_per_second": 2.835,
+ "step": 1350
+ },
+ {
+ "entropy": 1.175439715385437,
+ "epoch": 2.7292929292929293,
+ "grad_norm": 2.3636603355407715,
+ "learning_rate": 2.2727272727272728e-06,
+ "loss": 1.2032190561294556,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 22134784.0,
+ "step": 1351
+ },
+ {
+ "entropy": 1.056649923324585,
+ "epoch": 2.731313131313131,
+ "grad_norm": 2.111971139907837,
+ "learning_rate": 2.2707070707070706e-06,
+ "loss": 1.0646127462387085,
+ "mean_token_accuracy": 0.7132999300956726,
+ "num_tokens": 22151168.0,
+ "step": 1352
+ },
+ {
+ "entropy": 1.401559591293335,
+ "epoch": 2.7333333333333334,
+ "grad_norm": 2.269573211669922,
+ "learning_rate": 2.268686868686869e-06,
+ "loss": 1.405207633972168,
+ "mean_token_accuracy": 0.6612115502357483,
+ "num_tokens": 22167552.0,
+ "step": 1353
+ },
+ {
+ "entropy": 0.9708455204963684,
+ "epoch": 2.735353535353535,
+ "grad_norm": 2.3020989894866943,
+ "learning_rate": 2.266666666666667e-06,
+ "loss": 0.9864540100097656,
+ "mean_token_accuracy": 0.7361993193626404,
+ "num_tokens": 22183936.0,
+ "step": 1354
+ },
+ {
+ "entropy": 1.2840858697891235,
+ "epoch": 2.7373737373737375,
+ "grad_norm": 2.4489457607269287,
+ "learning_rate": 2.2646464646464647e-06,
+ "loss": 1.2992041110992432,
+ "mean_token_accuracy": 0.6783097386360168,
+ "num_tokens": 22200320.0,
+ "step": 1355
+ },
+ {
+ "entropy": 1.6704803705215454,
+ "epoch": 2.7393939393939393,
+ "grad_norm": 2.213287591934204,
+ "learning_rate": 2.262626262626263e-06,
+ "loss": 1.7022172212600708,
+ "mean_token_accuracy": 0.6433194875717163,
+ "num_tokens": 22216704.0,
+ "step": 1356
+ },
+ {
+ "entropy": 1.2570815086364746,
+ "epoch": 2.7414141414141415,
+ "grad_norm": 2.250062942504883,
+ "learning_rate": 2.260606060606061e-06,
+ "loss": 1.2799533605575562,
+ "mean_token_accuracy": 0.6823400259017944,
+ "num_tokens": 22233088.0,
+ "step": 1357
+ },
+ {
+ "entropy": 1.0966694355010986,
+ "epoch": 2.7434343434343433,
+ "grad_norm": 2.24507212638855,
+ "learning_rate": 2.258585858585859e-06,
+ "loss": 1.0954806804656982,
+ "mean_token_accuracy": 0.7264289259910583,
+ "num_tokens": 22249472.0,
+ "step": 1358
+ },
+ {
+ "entropy": 1.6675825119018555,
+ "epoch": 2.7454545454545456,
+ "grad_norm": 2.1572930812835693,
+ "learning_rate": 2.2565656565656567e-06,
+ "loss": 1.6607719659805298,
+ "mean_token_accuracy": 0.6113214492797852,
+ "num_tokens": 22265856.0,
+ "step": 1359
+ },
+ {
+ "entropy": 1.247696042060852,
+ "epoch": 2.7474747474747474,
+ "grad_norm": 2.105797290802002,
+ "learning_rate": 2.254545454545455e-06,
+ "loss": 1.2314106225967407,
+ "mean_token_accuracy": 0.6982169151306152,
+ "num_tokens": 22282240.0,
+ "step": 1360
+ },
+ {
+ "entropy": 1.6081417798995972,
+ "epoch": 2.7494949494949497,
+ "grad_norm": 2.1624395847320557,
+ "learning_rate": 2.252525252525253e-06,
+ "loss": 1.6011556386947632,
+ "mean_token_accuracy": 0.6282364726066589,
+ "num_tokens": 22298624.0,
+ "step": 1361
+ },
+ {
+ "entropy": 1.1124155521392822,
+ "epoch": 2.7515151515151515,
+ "grad_norm": 2.141758918762207,
+ "learning_rate": 2.250505050505051e-06,
+ "loss": 1.1052089929580688,
+ "mean_token_accuracy": 0.7202003002166748,
+ "num_tokens": 22315008.0,
+ "step": 1362
+ },
+ {
+ "entropy": 1.093716025352478,
+ "epoch": 2.7535353535353533,
+ "grad_norm": 2.2610108852386475,
+ "learning_rate": 2.2484848484848487e-06,
+ "loss": 1.095299482345581,
+ "mean_token_accuracy": 0.714154839515686,
+ "num_tokens": 22331392.0,
+ "step": 1363
+ },
+ {
+ "entropy": 1.353977918624878,
+ "epoch": 2.7555555555555555,
+ "grad_norm": 2.171783447265625,
+ "learning_rate": 2.2464646464646466e-06,
+ "loss": 1.3497436046600342,
+ "mean_token_accuracy": 0.6914386749267578,
+ "num_tokens": 22347776.0,
+ "step": 1364
+ },
+ {
+ "entropy": 1.4595965147018433,
+ "epoch": 2.757575757575758,
+ "grad_norm": 2.2337677478790283,
+ "learning_rate": 2.2444444444444445e-06,
+ "loss": 1.4730737209320068,
+ "mean_token_accuracy": 0.6578529477119446,
+ "num_tokens": 22364160.0,
+ "step": 1365
+ },
+ {
+ "entropy": 1.5668566226959229,
+ "epoch": 2.7595959595959596,
+ "grad_norm": 2.2195982933044434,
+ "learning_rate": 2.2424242424242428e-06,
+ "loss": 1.5661592483520508,
+ "mean_token_accuracy": 0.6397166848182678,
+ "num_tokens": 22380544.0,
+ "step": 1366
+ },
+ {
+ "entropy": 1.4419786930084229,
+ "epoch": 2.7616161616161614,
+ "grad_norm": 2.202221393585205,
+ "learning_rate": 2.2404040404040407e-06,
+ "loss": 1.4466135501861572,
+ "mean_token_accuracy": 0.6698827743530273,
+ "num_tokens": 22396928.0,
+ "step": 1367
+ },
+ {
+ "entropy": 1.43394136428833,
+ "epoch": 2.7636363636363637,
+ "grad_norm": 2.1969001293182373,
+ "learning_rate": 2.2383838383838385e-06,
+ "loss": 1.433483362197876,
+ "mean_token_accuracy": 0.6655471324920654,
+ "num_tokens": 22413312.0,
+ "step": 1368
+ },
+ {
+ "entropy": 1.048527717590332,
+ "epoch": 2.765656565656566,
+ "grad_norm": 2.142869472503662,
+ "learning_rate": 2.2363636363636364e-06,
+ "loss": 1.0373283624649048,
+ "mean_token_accuracy": 0.7396189570426941,
+ "num_tokens": 22429696.0,
+ "step": 1369
+ },
+ {
+ "entropy": 1.4282819032669067,
+ "epoch": 2.7676767676767677,
+ "grad_norm": 2.1550097465515137,
+ "learning_rate": 2.2343434343434343e-06,
+ "loss": 1.419884443283081,
+ "mean_token_accuracy": 0.6712262034416199,
+ "num_tokens": 22446080.0,
+ "step": 1370
+ },
+ {
+ "entropy": 1.5361018180847168,
+ "epoch": 2.7696969696969695,
+ "grad_norm": 2.1175451278686523,
+ "learning_rate": 2.2323232323232326e-06,
+ "loss": 1.5433859825134277,
+ "mean_token_accuracy": 0.636907696723938,
+ "num_tokens": 22462464.0,
+ "step": 1371
+ },
+ {
+ "entropy": 1.326242208480835,
+ "epoch": 2.771717171717172,
+ "grad_norm": 2.084632635116577,
+ "learning_rate": 2.2303030303030305e-06,
+ "loss": 1.3364207744598389,
+ "mean_token_accuracy": 0.6809965968132019,
+ "num_tokens": 22478848.0,
+ "step": 1372
+ },
+ {
+ "entropy": 1.255878210067749,
+ "epoch": 2.7737373737373736,
+ "grad_norm": 2.142777919769287,
+ "learning_rate": 2.2282828282828284e-06,
+ "loss": 1.264795184135437,
+ "mean_token_accuracy": 0.6875916123390198,
+ "num_tokens": 22495232.0,
+ "step": 1373
+ },
+ {
+ "entropy": 1.2916159629821777,
+ "epoch": 2.775757575757576,
+ "grad_norm": 2.115644693374634,
+ "learning_rate": 2.2262626262626263e-06,
+ "loss": 1.2945363521575928,
+ "mean_token_accuracy": 0.6895456910133362,
+ "num_tokens": 22511616.0,
+ "step": 1374
+ },
+ {
+ "entropy": 1.4490385055541992,
+ "epoch": 2.7777777777777777,
+ "grad_norm": 2.2078094482421875,
+ "learning_rate": 2.224242424242424e-06,
+ "loss": 1.4401804208755493,
+ "mean_token_accuracy": 0.6637151837348938,
+ "num_tokens": 22528000.0,
+ "step": 1375
+ },
+ {
+ "entropy": 1.2710940837860107,
+ "epoch": 2.77979797979798,
+ "grad_norm": 2.1877286434173584,
+ "learning_rate": 2.222222222222222e-06,
+ "loss": 1.2672982215881348,
+ "mean_token_accuracy": 0.6958353519439697,
+ "num_tokens": 22544384.0,
+ "step": 1376
+ },
+ {
+ "entropy": 1.3981144428253174,
+ "epoch": 2.7818181818181817,
+ "grad_norm": 2.2816240787506104,
+ "learning_rate": 2.2202020202020204e-06,
+ "loss": 1.4073718786239624,
+ "mean_token_accuracy": 0.6583414673805237,
+ "num_tokens": 22560768.0,
+ "step": 1377
+ },
+ {
+ "entropy": 1.541896104812622,
+ "epoch": 2.783838383838384,
+ "grad_norm": 2.3664891719818115,
+ "learning_rate": 2.2181818181818187e-06,
+ "loss": 1.5782896280288696,
+ "mean_token_accuracy": 0.6264045238494873,
+ "num_tokens": 22577152.0,
+ "step": 1378
+ },
+ {
+ "entropy": 1.1470069885253906,
+ "epoch": 2.785858585858586,
+ "grad_norm": 2.334867000579834,
+ "learning_rate": 2.2161616161616166e-06,
+ "loss": 1.1734097003936768,
+ "mean_token_accuracy": 0.6981558203697205,
+ "num_tokens": 22593536.0,
+ "step": 1379
+ },
+ {
+ "entropy": 1.3938566446304321,
+ "epoch": 2.787878787878788,
+ "grad_norm": 2.493093967437744,
+ "learning_rate": 2.2141414141414145e-06,
+ "loss": 1.4161372184753418,
+ "mean_token_accuracy": 0.6610283255577087,
+ "num_tokens": 22609920.0,
+ "step": 1380
+ },
+ {
+ "entropy": 1.2948062419891357,
+ "epoch": 2.78989898989899,
+ "grad_norm": 2.227708578109741,
+ "learning_rate": 2.2121212121212124e-06,
+ "loss": 1.3157434463500977,
+ "mean_token_accuracy": 0.6835002303123474,
+ "num_tokens": 22626304.0,
+ "step": 1381
+ },
+ {
+ "entropy": 0.9506068229675293,
+ "epoch": 2.7919191919191917,
+ "grad_norm": 2.1482889652252197,
+ "learning_rate": 2.2101010101010102e-06,
+ "loss": 0.950823187828064,
+ "mean_token_accuracy": 0.7500610947608948,
+ "num_tokens": 22642688.0,
+ "step": 1382
+ },
+ {
+ "entropy": 1.4429880380630493,
+ "epoch": 2.793939393939394,
+ "grad_norm": 2.8189656734466553,
+ "learning_rate": 2.208080808080808e-06,
+ "loss": 1.4801222085952759,
+ "mean_token_accuracy": 0.6469223499298096,
+ "num_tokens": 22659072.0,
+ "step": 1383
+ },
+ {
+ "entropy": 1.3517380952835083,
+ "epoch": 2.795959595959596,
+ "grad_norm": 2.047236442565918,
+ "learning_rate": 2.2060606060606064e-06,
+ "loss": 1.3715345859527588,
+ "mean_token_accuracy": 0.6921714544296265,
+ "num_tokens": 22675456.0,
+ "step": 1384
+ },
+ {
+ "entropy": 1.3647958040237427,
+ "epoch": 2.797979797979798,
+ "grad_norm": 2.296548366546631,
+ "learning_rate": 2.2040404040404043e-06,
+ "loss": 1.3669397830963135,
+ "mean_token_accuracy": 0.6769663095474243,
+ "num_tokens": 22691840.0,
+ "step": 1385
+ },
+ {
+ "entropy": 1.2830337285995483,
+ "epoch": 2.8,
+ "grad_norm": 2.222038745880127,
+ "learning_rate": 2.2020202020202022e-06,
+ "loss": 1.2938398122787476,
+ "mean_token_accuracy": 0.6786150336265564,
+ "num_tokens": 22708224.0,
+ "step": 1386
+ },
+ {
+ "entropy": 1.1581721305847168,
+ "epoch": 2.802020202020202,
+ "grad_norm": 1.9979426860809326,
+ "learning_rate": 2.2e-06,
+ "loss": 1.1363141536712646,
+ "mean_token_accuracy": 0.7106130719184875,
+ "num_tokens": 22724608.0,
+ "step": 1387
+ },
+ {
+ "entropy": 1.4855602979660034,
+ "epoch": 2.804040404040404,
+ "grad_norm": 2.2763257026672363,
+ "learning_rate": 2.197979797979798e-06,
+ "loss": 1.5020172595977783,
+ "mean_token_accuracy": 0.6478993892669678,
+ "num_tokens": 22740992.0,
+ "step": 1388
+ },
+ {
+ "entropy": 1.1942899227142334,
+ "epoch": 2.806060606060606,
+ "grad_norm": 2.1685962677001953,
+ "learning_rate": 2.1959595959595963e-06,
+ "loss": 1.188063621520996,
+ "mean_token_accuracy": 0.705483615398407,
+ "num_tokens": 22757376.0,
+ "step": 1389
+ },
+ {
+ "entropy": 1.1369596719741821,
+ "epoch": 2.808080808080808,
+ "grad_norm": 2.1820614337921143,
+ "learning_rate": 2.193939393939394e-06,
+ "loss": 1.1348206996917725,
+ "mean_token_accuracy": 0.7253297567367554,
+ "num_tokens": 22773760.0,
+ "step": 1390
+ },
+ {
+ "entropy": 1.2539693117141724,
+ "epoch": 2.81010101010101,
+ "grad_norm": 2.0384390354156494,
+ "learning_rate": 2.191919191919192e-06,
+ "loss": 1.250205636024475,
+ "mean_token_accuracy": 0.6993771195411682,
+ "num_tokens": 22790144.0,
+ "step": 1391
+ },
+ {
+ "entropy": 1.7445363998413086,
+ "epoch": 2.812121212121212,
+ "grad_norm": 2.55062198638916,
+ "learning_rate": 2.18989898989899e-06,
+ "loss": 1.7788689136505127,
+ "mean_token_accuracy": 0.607107937335968,
+ "num_tokens": 22806528.0,
+ "step": 1392
+ },
+ {
+ "entropy": 1.2282429933547974,
+ "epoch": 2.8141414141414143,
+ "grad_norm": 2.1791000366210938,
+ "learning_rate": 2.187878787878788e-06,
+ "loss": 1.2460708618164062,
+ "mean_token_accuracy": 0.697239875793457,
+ "num_tokens": 22822912.0,
+ "step": 1393
+ },
+ {
+ "entropy": 1.2007265090942383,
+ "epoch": 2.816161616161616,
+ "grad_norm": 2.4067599773406982,
+ "learning_rate": 2.1858585858585858e-06,
+ "loss": 1.2013460397720337,
+ "mean_token_accuracy": 0.6963238716125488,
+ "num_tokens": 22839296.0,
+ "step": 1394
+ },
+ {
+ "entropy": 1.7315549850463867,
+ "epoch": 2.8181818181818183,
+ "grad_norm": 2.15682053565979,
+ "learning_rate": 2.183838383838384e-06,
+ "loss": 1.6833488941192627,
+ "mean_token_accuracy": 0.6170004606246948,
+ "num_tokens": 22855680.0,
+ "step": 1395
+ },
+ {
+ "entropy": 1.325459599494934,
+ "epoch": 2.82020202020202,
+ "grad_norm": 2.0464699268341064,
+ "learning_rate": 2.181818181818182e-06,
+ "loss": 1.3265891075134277,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 22872064.0,
+ "step": 1396
+ },
+ {
+ "entropy": 1.0391966104507446,
+ "epoch": 2.822222222222222,
+ "grad_norm": 2.3595499992370605,
+ "learning_rate": 2.17979797979798e-06,
+ "loss": 1.0515706539154053,
+ "mean_token_accuracy": 0.7299706935882568,
+ "num_tokens": 22888448.0,
+ "step": 1397
+ },
+ {
+ "entropy": 1.5484130382537842,
+ "epoch": 2.824242424242424,
+ "grad_norm": 2.24381422996521,
+ "learning_rate": 2.1777777777777777e-06,
+ "loss": 1.5656720399856567,
+ "mean_token_accuracy": 0.6390449404716492,
+ "num_tokens": 22904832.0,
+ "step": 1398
+ },
+ {
+ "entropy": 1.2196807861328125,
+ "epoch": 2.8262626262626265,
+ "grad_norm": 2.3043432235717773,
+ "learning_rate": 2.175757575757576e-06,
+ "loss": 1.2172417640686035,
+ "mean_token_accuracy": 0.6985833048820496,
+ "num_tokens": 22921216.0,
+ "step": 1399
+ },
+ {
+ "entropy": 1.171323537826538,
+ "epoch": 2.8282828282828283,
+ "grad_norm": 2.34149169921875,
+ "learning_rate": 2.173737373737374e-06,
+ "loss": 1.1752846240997314,
+ "mean_token_accuracy": 0.6979726552963257,
+ "num_tokens": 22937600.0,
+ "step": 1400
+ },
+ {
+ "epoch": 2.8282828282828283,
+ "eval_entropy": 1.3776377598124165,
+ "eval_loss": 1.533128261566162,
+ "eval_mean_token_accuracy": 0.645915245336871,
+ "eval_num_tokens": 22937600.0,
+ "eval_runtime": 43.7952,
+ "eval_samples_per_second": 22.605,
+ "eval_steps_per_second": 2.831,
+ "step": 1400
+ },
+ {
+ "entropy": 1.2173237800598145,
+ "epoch": 2.83030303030303,
+ "grad_norm": 2.245490789413452,
+ "learning_rate": 2.171717171717172e-06,
+ "loss": 1.1928956508636475,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 22953984.0,
+ "step": 1401
+ },
+ {
+ "entropy": 1.4213385581970215,
+ "epoch": 2.8323232323232324,
+ "grad_norm": 2.192051649093628,
+ "learning_rate": 2.16969696969697e-06,
+ "loss": 1.4340262413024902,
+ "mean_token_accuracy": 0.6622496247291565,
+ "num_tokens": 22970368.0,
+ "step": 1402
+ },
+ {
+ "entropy": 1.922193169593811,
+ "epoch": 2.8343434343434346,
+ "grad_norm": 2.0441250801086426,
+ "learning_rate": 2.167676767676768e-06,
+ "loss": 1.9164612293243408,
+ "mean_token_accuracy": 0.5942232608795166,
+ "num_tokens": 22986752.0,
+ "step": 1403
+ },
+ {
+ "entropy": 1.3124938011169434,
+ "epoch": 2.8363636363636364,
+ "grad_norm": 2.245614528656006,
+ "learning_rate": 2.165656565656566e-06,
+ "loss": 1.3055529594421387,
+ "mean_token_accuracy": 0.680385947227478,
+ "num_tokens": 23003136.0,
+ "step": 1404
+ },
+ {
+ "entropy": 0.9893879294395447,
+ "epoch": 2.8383838383838382,
+ "grad_norm": 2.1041340827941895,
+ "learning_rate": 2.163636363636364e-06,
+ "loss": 0.9646933078765869,
+ "mean_token_accuracy": 0.7441377639770508,
+ "num_tokens": 23019520.0,
+ "step": 1405
+ },
+ {
+ "entropy": 1.4011882543563843,
+ "epoch": 2.8404040404040405,
+ "grad_norm": 2.5371105670928955,
+ "learning_rate": 2.1616161616161617e-06,
+ "loss": 1.381878137588501,
+ "mean_token_accuracy": 0.6522960662841797,
+ "num_tokens": 23035904.0,
+ "step": 1406
+ },
+ {
+ "entropy": 1.4563852548599243,
+ "epoch": 2.8424242424242423,
+ "grad_norm": 2.1308720111846924,
+ "learning_rate": 2.15959595959596e-06,
+ "loss": 1.4763004779815674,
+ "mean_token_accuracy": 0.6792256832122803,
+ "num_tokens": 23052288.0,
+ "step": 1407
+ },
+ {
+ "entropy": 0.8676514625549316,
+ "epoch": 2.8444444444444446,
+ "grad_norm": 2.016085147857666,
+ "learning_rate": 2.157575757575758e-06,
+ "loss": 0.8672611713409424,
+ "mean_token_accuracy": 0.7660601139068604,
+ "num_tokens": 23068672.0,
+ "step": 1408
+ },
+ {
+ "entropy": 1.2011700868606567,
+ "epoch": 2.8464646464646464,
+ "grad_norm": 2.1641454696655273,
+ "learning_rate": 2.1555555555555558e-06,
+ "loss": 1.2113897800445557,
+ "mean_token_accuracy": 0.7180019617080688,
+ "num_tokens": 23085056.0,
+ "step": 1409
+ },
+ {
+ "entropy": 1.7813633680343628,
+ "epoch": 2.8484848484848486,
+ "grad_norm": 2.1768839359283447,
+ "learning_rate": 2.1535353535353537e-06,
+ "loss": 1.7897224426269531,
+ "mean_token_accuracy": 0.6129701733589172,
+ "num_tokens": 23101440.0,
+ "step": 1410
+ },
+ {
+ "entropy": 1.0219851732254028,
+ "epoch": 2.8505050505050504,
+ "grad_norm": 2.299229145050049,
+ "learning_rate": 2.1515151515151515e-06,
+ "loss": 1.0073617696762085,
+ "mean_token_accuracy": 0.7240473628044128,
+ "num_tokens": 23117824.0,
+ "step": 1411
+ },
+ {
+ "entropy": 1.3342534303665161,
+ "epoch": 2.8525252525252527,
+ "grad_norm": 2.165161371231079,
+ "learning_rate": 2.1494949494949494e-06,
+ "loss": 1.3219788074493408,
+ "mean_token_accuracy": 0.6764777898788452,
+ "num_tokens": 23134208.0,
+ "step": 1412
+ },
+ {
+ "entropy": 1.1618846654891968,
+ "epoch": 2.8545454545454545,
+ "grad_norm": 2.1276957988739014,
+ "learning_rate": 2.1474747474747477e-06,
+ "loss": 1.1667187213897705,
+ "mean_token_accuracy": 0.7214215993881226,
+ "num_tokens": 23150592.0,
+ "step": 1413
+ },
+ {
+ "entropy": 1.3673025369644165,
+ "epoch": 2.8565656565656568,
+ "grad_norm": 2.249702215194702,
+ "learning_rate": 2.1454545454545456e-06,
+ "loss": 1.380744218826294,
+ "mean_token_accuracy": 0.6656082272529602,
+ "num_tokens": 23166976.0,
+ "step": 1414
+ },
+ {
+ "entropy": 1.4118674993515015,
+ "epoch": 2.8585858585858586,
+ "grad_norm": 2.1488327980041504,
+ "learning_rate": 2.1434343434343435e-06,
+ "loss": 1.4007214307785034,
+ "mean_token_accuracy": 0.6663410067558289,
+ "num_tokens": 23183360.0,
+ "step": 1415
+ },
+ {
+ "entropy": 1.4398424625396729,
+ "epoch": 2.8606060606060604,
+ "grad_norm": 2.2609732151031494,
+ "learning_rate": 2.1414141414141414e-06,
+ "loss": 1.4657073020935059,
+ "mean_token_accuracy": 0.6483268141746521,
+ "num_tokens": 23199744.0,
+ "step": 1416
+ },
+ {
+ "entropy": 1.2922199964523315,
+ "epoch": 2.8626262626262626,
+ "grad_norm": 2.1911425590515137,
+ "learning_rate": 2.1393939393939393e-06,
+ "loss": 1.3118690252304077,
+ "mean_token_accuracy": 0.6951025724411011,
+ "num_tokens": 23216128.0,
+ "step": 1417
+ },
+ {
+ "entropy": 1.6888933181762695,
+ "epoch": 2.864646464646465,
+ "grad_norm": 2.2805919647216797,
+ "learning_rate": 2.1373737373737376e-06,
+ "loss": 1.6726739406585693,
+ "mean_token_accuracy": 0.6136419177055359,
+ "num_tokens": 23232512.0,
+ "step": 1418
+ },
+ {
+ "entropy": 1.289890170097351,
+ "epoch": 2.8666666666666667,
+ "grad_norm": 2.092263698577881,
+ "learning_rate": 2.1353535353535355e-06,
+ "loss": 1.2876317501068115,
+ "mean_token_accuracy": 0.6835613250732422,
+ "num_tokens": 23248896.0,
+ "step": 1419
+ },
+ {
+ "entropy": 1.361393690109253,
+ "epoch": 2.8686868686868685,
+ "grad_norm": 2.1863481998443604,
+ "learning_rate": 2.133333333333334e-06,
+ "loss": 1.3719209432601929,
+ "mean_token_accuracy": 0.663532018661499,
+ "num_tokens": 23265280.0,
+ "step": 1420
+ },
+ {
+ "entropy": 1.1187894344329834,
+ "epoch": 2.8707070707070708,
+ "grad_norm": 2.256434679031372,
+ "learning_rate": 2.1313131313131317e-06,
+ "loss": 1.1177198886871338,
+ "mean_token_accuracy": 0.7082926034927368,
+ "num_tokens": 23281664.0,
+ "step": 1421
+ },
+ {
+ "entropy": 0.8779795169830322,
+ "epoch": 2.8727272727272726,
+ "grad_norm": 2.095226526260376,
+ "learning_rate": 2.1292929292929296e-06,
+ "loss": 0.8675153851509094,
+ "mean_token_accuracy": 0.7647777199745178,
+ "num_tokens": 23298048.0,
+ "step": 1422
+ },
+ {
+ "entropy": 1.458146095275879,
+ "epoch": 2.874747474747475,
+ "grad_norm": 2.225179433822632,
+ "learning_rate": 2.1272727272727275e-06,
+ "loss": 1.4488263130187988,
+ "mean_token_accuracy": 0.6640205383300781,
+ "num_tokens": 23314432.0,
+ "step": 1423
+ },
+ {
+ "entropy": 1.187269926071167,
+ "epoch": 2.8767676767676766,
+ "grad_norm": 2.023710250854492,
+ "learning_rate": 2.1252525252525254e-06,
+ "loss": 1.182060718536377,
+ "mean_token_accuracy": 0.7017586827278137,
+ "num_tokens": 23330816.0,
+ "step": 1424
+ },
+ {
+ "entropy": 1.1446877717971802,
+ "epoch": 2.878787878787879,
+ "grad_norm": 2.301314115524292,
+ "learning_rate": 2.1232323232323237e-06,
+ "loss": 1.1507803201675415,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 23347200.0,
+ "step": 1425
+ },
+ {
+ "entropy": 1.3453346490859985,
+ "epoch": 2.8808080808080807,
+ "grad_norm": 2.0338571071624756,
+ "learning_rate": 2.1212121212121216e-06,
+ "loss": 1.345799207687378,
+ "mean_token_accuracy": 0.6966292262077332,
+ "num_tokens": 23363584.0,
+ "step": 1426
+ },
+ {
+ "entropy": 1.2638238668441772,
+ "epoch": 2.882828282828283,
+ "grad_norm": 2.1575632095336914,
+ "learning_rate": 2.1191919191919194e-06,
+ "loss": 1.2882521152496338,
+ "mean_token_accuracy": 0.6901563405990601,
+ "num_tokens": 23379968.0,
+ "step": 1427
+ },
+ {
+ "entropy": 1.4490493535995483,
+ "epoch": 2.8848484848484848,
+ "grad_norm": 2.1735994815826416,
+ "learning_rate": 2.1171717171717173e-06,
+ "loss": 1.455702781677246,
+ "mean_token_accuracy": 0.6538837552070618,
+ "num_tokens": 23396352.0,
+ "step": 1428
+ },
+ {
+ "entropy": 1.3873618841171265,
+ "epoch": 2.886868686868687,
+ "grad_norm": 2.3870506286621094,
+ "learning_rate": 2.1151515151515152e-06,
+ "loss": 1.3657323122024536,
+ "mean_token_accuracy": 0.6692110300064087,
+ "num_tokens": 23412736.0,
+ "step": 1429
+ },
+ {
+ "entropy": 1.298308253288269,
+ "epoch": 2.888888888888889,
+ "grad_norm": 2.079481363296509,
+ "learning_rate": 2.113131313131313e-06,
+ "loss": 1.30775785446167,
+ "mean_token_accuracy": 0.6834391951560974,
+ "num_tokens": 23429120.0,
+ "step": 1430
+ },
+ {
+ "entropy": 1.1544564962387085,
+ "epoch": 2.8909090909090907,
+ "grad_norm": 2.2400357723236084,
+ "learning_rate": 2.1111111111111114e-06,
+ "loss": 1.17466139793396,
+ "mean_token_accuracy": 0.7093307375907898,
+ "num_tokens": 23445504.0,
+ "step": 1431
+ },
+ {
+ "entropy": 1.4711883068084717,
+ "epoch": 2.892929292929293,
+ "grad_norm": 2.1779074668884277,
+ "learning_rate": 2.1090909090909093e-06,
+ "loss": 1.4626137018203735,
+ "mean_token_accuracy": 0.6602955460548401,
+ "num_tokens": 23461888.0,
+ "step": 1432
+ },
+ {
+ "entropy": 1.4876407384872437,
+ "epoch": 2.894949494949495,
+ "grad_norm": 2.278554677963257,
+ "learning_rate": 2.107070707070707e-06,
+ "loss": 1.5031921863555908,
+ "mean_token_accuracy": 0.6570591330528259,
+ "num_tokens": 23478272.0,
+ "step": 1433
+ },
+ {
+ "entropy": 1.328355073928833,
+ "epoch": 2.896969696969697,
+ "grad_norm": 2.034842014312744,
+ "learning_rate": 2.105050505050505e-06,
+ "loss": 1.3163859844207764,
+ "mean_token_accuracy": 0.6878358721733093,
+ "num_tokens": 23494656.0,
+ "step": 1434
+ },
+ {
+ "entropy": 1.487100601196289,
+ "epoch": 2.898989898989899,
+ "grad_norm": 2.1980724334716797,
+ "learning_rate": 2.103030303030303e-06,
+ "loss": 1.4886071681976318,
+ "mean_token_accuracy": 0.6521739363670349,
+ "num_tokens": 23511040.0,
+ "step": 1435
+ },
+ {
+ "entropy": 1.4826854467391968,
+ "epoch": 2.901010101010101,
+ "grad_norm": 2.5214874744415283,
+ "learning_rate": 2.1010101010101013e-06,
+ "loss": 1.4610626697540283,
+ "mean_token_accuracy": 0.6503419876098633,
+ "num_tokens": 23527424.0,
+ "step": 1436
+ },
+ {
+ "entropy": 1.00849187374115,
+ "epoch": 2.9030303030303033,
+ "grad_norm": 2.1452033519744873,
+ "learning_rate": 2.098989898989899e-06,
+ "loss": 0.9949107766151428,
+ "mean_token_accuracy": 0.7457864880561829,
+ "num_tokens": 23543808.0,
+ "step": 1437
+ },
+ {
+ "entropy": 1.0621757507324219,
+ "epoch": 2.905050505050505,
+ "grad_norm": 2.1871836185455322,
+ "learning_rate": 2.096969696969697e-06,
+ "loss": 1.0466980934143066,
+ "mean_token_accuracy": 0.7275280952453613,
+ "num_tokens": 23560192.0,
+ "step": 1438
+ },
+ {
+ "entropy": 1.3413732051849365,
+ "epoch": 2.907070707070707,
+ "grad_norm": 2.2954704761505127,
+ "learning_rate": 2.094949494949495e-06,
+ "loss": 1.3602681159973145,
+ "mean_token_accuracy": 0.6686003804206848,
+ "num_tokens": 23576576.0,
+ "step": 1439
+ },
+ {
+ "entropy": 0.8138323426246643,
+ "epoch": 2.909090909090909,
+ "grad_norm": 1.9476791620254517,
+ "learning_rate": 2.092929292929293e-06,
+ "loss": 0.8208089470863342,
+ "mean_token_accuracy": 0.7796775698661804,
+ "num_tokens": 23592960.0,
+ "step": 1440
+ },
+ {
+ "entropy": 0.9035854339599609,
+ "epoch": 2.911111111111111,
+ "grad_norm": 1.9753291606903076,
+ "learning_rate": 2.090909090909091e-06,
+ "loss": 0.8889603614807129,
+ "mean_token_accuracy": 0.7610527873039246,
+ "num_tokens": 23609344.0,
+ "step": 1441
+ },
+ {
+ "entropy": 0.9301351308822632,
+ "epoch": 2.9131313131313132,
+ "grad_norm": 2.244597911834717,
+ "learning_rate": 2.088888888888889e-06,
+ "loss": 0.9369313716888428,
+ "mean_token_accuracy": 0.7603810429573059,
+ "num_tokens": 23625728.0,
+ "step": 1442
+ },
+ {
+ "entropy": 0.8740416765213013,
+ "epoch": 2.915151515151515,
+ "grad_norm": 2.0207667350769043,
+ "learning_rate": 2.0868686868686873e-06,
+ "loss": 0.8751406073570251,
+ "mean_token_accuracy": 0.7634342908859253,
+ "num_tokens": 23642112.0,
+ "step": 1443
+ },
+ {
+ "entropy": 1.044225811958313,
+ "epoch": 2.9171717171717173,
+ "grad_norm": 2.8100409507751465,
+ "learning_rate": 2.0848484848484852e-06,
+ "loss": 1.0568115711212158,
+ "mean_token_accuracy": 0.7291157841682434,
+ "num_tokens": 23658496.0,
+ "step": 1444
+ },
+ {
+ "entropy": 1.1093257665634155,
+ "epoch": 2.919191919191919,
+ "grad_norm": 2.2957236766815186,
+ "learning_rate": 2.082828282828283e-06,
+ "loss": 1.1235377788543701,
+ "mean_token_accuracy": 0.7108573317527771,
+ "num_tokens": 23674880.0,
+ "step": 1445
+ },
+ {
+ "entropy": 1.2211518287658691,
+ "epoch": 2.9212121212121214,
+ "grad_norm": 2.022287130355835,
+ "learning_rate": 2.080808080808081e-06,
+ "loss": 1.241473913192749,
+ "mean_token_accuracy": 0.7020029425621033,
+ "num_tokens": 23691264.0,
+ "step": 1446
+ },
+ {
+ "entropy": 1.3636398315429688,
+ "epoch": 2.923232323232323,
+ "grad_norm": 2.1484291553497314,
+ "learning_rate": 2.078787878787879e-06,
+ "loss": 1.3876409530639648,
+ "mean_token_accuracy": 0.6714093685150146,
+ "num_tokens": 23707648.0,
+ "step": 1447
+ },
+ {
+ "entropy": 1.1615006923675537,
+ "epoch": 2.9252525252525254,
+ "grad_norm": 2.775181293487549,
+ "learning_rate": 2.0767676767676768e-06,
+ "loss": 1.1792278289794922,
+ "mean_token_accuracy": 0.7070102691650391,
+ "num_tokens": 23724032.0,
+ "step": 1448
+ },
+ {
+ "entropy": 1.6308530569076538,
+ "epoch": 2.9272727272727272,
+ "grad_norm": 2.3813729286193848,
+ "learning_rate": 2.074747474747475e-06,
+ "loss": 1.6642422676086426,
+ "mean_token_accuracy": 0.6171225905418396,
+ "num_tokens": 23740416.0,
+ "step": 1449
+ },
+ {
+ "entropy": 1.2764222621917725,
+ "epoch": 2.929292929292929,
+ "grad_norm": 2.234309196472168,
+ "learning_rate": 2.072727272727273e-06,
+ "loss": 1.2756493091583252,
+ "mean_token_accuracy": 0.6824010610580444,
+ "num_tokens": 23756800.0,
+ "step": 1450
+ },
+ {
+ "epoch": 2.929292929292929,
+ "eval_entropy": 1.366065975639128,
+ "eval_loss": 1.5328131914138794,
+ "eval_mean_token_accuracy": 0.6461491642459747,
+ "eval_num_tokens": 23756800.0,
+ "eval_runtime": 43.8548,
+ "eval_samples_per_second": 22.574,
+ "eval_steps_per_second": 2.828,
+ "step": 1450
+ },
+ {
+ "entropy": 1.178619623184204,
+ "epoch": 2.9313131313131313,
+ "grad_norm": 2.0946547985076904,
+ "learning_rate": 2.070707070707071e-06,
+ "loss": 1.1751608848571777,
+ "mean_token_accuracy": 0.704384446144104,
+ "num_tokens": 23773184.0,
+ "step": 1451
+ },
+ {
+ "entropy": 1.319455862045288,
+ "epoch": 2.9333333333333336,
+ "grad_norm": 2.1925816535949707,
+ "learning_rate": 2.0686868686868688e-06,
+ "loss": 1.3229246139526367,
+ "mean_token_accuracy": 0.6867977380752563,
+ "num_tokens": 23789568.0,
+ "step": 1452
+ },
+ {
+ "entropy": 1.787271499633789,
+ "epoch": 2.9353535353535354,
+ "grad_norm": 2.374494791030884,
+ "learning_rate": 2.0666666666666666e-06,
+ "loss": 1.7788429260253906,
+ "mean_token_accuracy": 0.589154839515686,
+ "num_tokens": 23805952.0,
+ "step": 1453
+ },
+ {
+ "entropy": 1.25193452835083,
+ "epoch": 2.937373737373737,
+ "grad_norm": 2.3499720096588135,
+ "learning_rate": 2.064646464646465e-06,
+ "loss": 1.2651758193969727,
+ "mean_token_accuracy": 0.6863092184066772,
+ "num_tokens": 23822336.0,
+ "step": 1454
+ },
+ {
+ "entropy": 1.355589747428894,
+ "epoch": 2.9393939393939394,
+ "grad_norm": 2.228123426437378,
+ "learning_rate": 2.062626262626263e-06,
+ "loss": 1.3623197078704834,
+ "mean_token_accuracy": 0.6623717546463013,
+ "num_tokens": 23838720.0,
+ "step": 1455
+ },
+ {
+ "entropy": 1.2293426990509033,
+ "epoch": 2.9414141414141413,
+ "grad_norm": 2.4237186908721924,
+ "learning_rate": 2.0606060606060607e-06,
+ "loss": 1.2226693630218506,
+ "mean_token_accuracy": 0.6903395056724548,
+ "num_tokens": 23855104.0,
+ "step": 1456
+ },
+ {
+ "entropy": 1.2312723398208618,
+ "epoch": 2.9434343434343435,
+ "grad_norm": 2.2350525856018066,
+ "learning_rate": 2.0585858585858586e-06,
+ "loss": 1.235978364944458,
+ "mean_token_accuracy": 0.696201741695404,
+ "num_tokens": 23871488.0,
+ "step": 1457
+ },
+ {
+ "entropy": 1.2731300592422485,
+ "epoch": 2.9454545454545453,
+ "grad_norm": 2.488929033279419,
+ "learning_rate": 2.0565656565656565e-06,
+ "loss": 1.2763257026672363,
+ "mean_token_accuracy": 0.6765388250350952,
+ "num_tokens": 23887872.0,
+ "step": 1458
+ },
+ {
+ "entropy": 1.1283669471740723,
+ "epoch": 2.9474747474747476,
+ "grad_norm": 2.116241693496704,
+ "learning_rate": 2.054545454545455e-06,
+ "loss": 1.1279038190841675,
+ "mean_token_accuracy": 0.7123228907585144,
+ "num_tokens": 23904256.0,
+ "step": 1459
+ },
+ {
+ "entropy": 1.4969894886016846,
+ "epoch": 2.9494949494949494,
+ "grad_norm": 2.17519474029541,
+ "learning_rate": 2.0525252525252527e-06,
+ "loss": 1.5177810192108154,
+ "mean_token_accuracy": 0.6544333100318909,
+ "num_tokens": 23920640.0,
+ "step": 1460
+ },
+ {
+ "entropy": 1.3133295774459839,
+ "epoch": 2.9515151515151516,
+ "grad_norm": 2.149486780166626,
+ "learning_rate": 2.0505050505050506e-06,
+ "loss": 1.2985190153121948,
+ "mean_token_accuracy": 0.6745237112045288,
+ "num_tokens": 23937024.0,
+ "step": 1461
+ },
+ {
+ "entropy": 1.2777348756790161,
+ "epoch": 2.9535353535353535,
+ "grad_norm": 2.124922752380371,
+ "learning_rate": 2.0484848484848485e-06,
+ "loss": 1.2731128931045532,
+ "mean_token_accuracy": 0.692415714263916,
+ "num_tokens": 23953408.0,
+ "step": 1462
+ },
+ {
+ "entropy": 1.0544995069503784,
+ "epoch": 2.9555555555555557,
+ "grad_norm": 2.177363872528076,
+ "learning_rate": 2.046464646464647e-06,
+ "loss": 1.0588994026184082,
+ "mean_token_accuracy": 0.7378480434417725,
+ "num_tokens": 23969792.0,
+ "step": 1463
+ },
+ {
+ "entropy": 1.441129446029663,
+ "epoch": 2.9575757575757575,
+ "grad_norm": 2.5355494022369385,
+ "learning_rate": 2.0444444444444447e-06,
+ "loss": 1.4684169292449951,
+ "mean_token_accuracy": 0.6495481133460999,
+ "num_tokens": 23986176.0,
+ "step": 1464
+ },
+ {
+ "entropy": 1.3359375,
+ "epoch": 2.9595959595959593,
+ "grad_norm": 2.309727191925049,
+ "learning_rate": 2.0424242424242426e-06,
+ "loss": 1.339503288269043,
+ "mean_token_accuracy": 0.6707376837730408,
+ "num_tokens": 24002560.0,
+ "step": 1465
+ },
+ {
+ "entropy": 1.5922675132751465,
+ "epoch": 2.9616161616161616,
+ "grad_norm": 2.191904067993164,
+ "learning_rate": 2.0404040404040405e-06,
+ "loss": 1.613649845123291,
+ "mean_token_accuracy": 0.635869562625885,
+ "num_tokens": 24018944.0,
+ "step": 1466
+ },
+ {
+ "entropy": 1.152869701385498,
+ "epoch": 2.963636363636364,
+ "grad_norm": 2.1656837463378906,
+ "learning_rate": 2.0383838383838388e-06,
+ "loss": 1.1791510581970215,
+ "mean_token_accuracy": 0.7013311982154846,
+ "num_tokens": 24035328.0,
+ "step": 1467
+ },
+ {
+ "entropy": 1.491494059562683,
+ "epoch": 2.9656565656565657,
+ "grad_norm": 2.397916555404663,
+ "learning_rate": 2.0363636363636367e-06,
+ "loss": 1.4803133010864258,
+ "mean_token_accuracy": 0.6395334601402283,
+ "num_tokens": 24051712.0,
+ "step": 1468
+ },
+ {
+ "entropy": 1.165432095527649,
+ "epoch": 2.9676767676767675,
+ "grad_norm": 2.0728659629821777,
+ "learning_rate": 2.0343434343434345e-06,
+ "loss": 1.1676859855651855,
+ "mean_token_accuracy": 0.7170249223709106,
+ "num_tokens": 24068096.0,
+ "step": 1469
+ },
+ {
+ "entropy": 0.7055315971374512,
+ "epoch": 2.9696969696969697,
+ "grad_norm": 1.949097752571106,
+ "learning_rate": 2.0323232323232324e-06,
+ "loss": 0.7094426155090332,
+ "mean_token_accuracy": 0.8047752976417542,
+ "num_tokens": 24084480.0,
+ "step": 1470
+ },
+ {
+ "entropy": 1.5079377889633179,
+ "epoch": 2.971717171717172,
+ "grad_norm": 2.282525062561035,
+ "learning_rate": 2.0303030303030303e-06,
+ "loss": 1.5309293270111084,
+ "mean_token_accuracy": 0.65486079454422,
+ "num_tokens": 24100864.0,
+ "step": 1471
+ },
+ {
+ "entropy": 1.6969871520996094,
+ "epoch": 2.973737373737374,
+ "grad_norm": 2.2211408615112305,
+ "learning_rate": 2.0282828282828286e-06,
+ "loss": 1.6919132471084595,
+ "mean_token_accuracy": 0.6259770393371582,
+ "num_tokens": 24117248.0,
+ "step": 1472
+ },
+ {
+ "entropy": 1.3981496095657349,
+ "epoch": 2.9757575757575756,
+ "grad_norm": 2.27559232711792,
+ "learning_rate": 2.0262626262626265e-06,
+ "loss": 1.4188807010650635,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 24133632.0,
+ "step": 1473
+ },
+ {
+ "entropy": 1.2966978549957275,
+ "epoch": 2.977777777777778,
+ "grad_norm": 2.2315874099731445,
+ "learning_rate": 2.0242424242424244e-06,
+ "loss": 1.3034720420837402,
+ "mean_token_accuracy": 0.6849047541618347,
+ "num_tokens": 24150016.0,
+ "step": 1474
+ },
+ {
+ "entropy": 1.4312105178833008,
+ "epoch": 2.9797979797979797,
+ "grad_norm": 2.3630731105804443,
+ "learning_rate": 2.0222222222222223e-06,
+ "loss": 1.412591814994812,
+ "mean_token_accuracy": 0.6673180460929871,
+ "num_tokens": 24166400.0,
+ "step": 1475
+ },
+ {
+ "entropy": 1.246411681175232,
+ "epoch": 2.981818181818182,
+ "grad_norm": 2.101142644882202,
+ "learning_rate": 2.02020202020202e-06,
+ "loss": 1.2674810886383057,
+ "mean_token_accuracy": 0.691255509853363,
+ "num_tokens": 24182784.0,
+ "step": 1476
+ },
+ {
+ "entropy": 1.2367678880691528,
+ "epoch": 2.9838383838383837,
+ "grad_norm": 2.3414289951324463,
+ "learning_rate": 2.0181818181818185e-06,
+ "loss": 1.254493236541748,
+ "mean_token_accuracy": 0.6811797618865967,
+ "num_tokens": 24199168.0,
+ "step": 1477
+ },
+ {
+ "entropy": 1.3566304445266724,
+ "epoch": 2.985858585858586,
+ "grad_norm": 2.3050434589385986,
+ "learning_rate": 2.0161616161616164e-06,
+ "loss": 1.3336361646652222,
+ "mean_token_accuracy": 0.6761724352836609,
+ "num_tokens": 24215552.0,
+ "step": 1478
+ },
+ {
+ "entropy": 1.3928223848342896,
+ "epoch": 2.987878787878788,
+ "grad_norm": 2.2100086212158203,
+ "learning_rate": 2.0141414141414143e-06,
+ "loss": 1.4050222635269165,
+ "mean_token_accuracy": 0.6573033928871155,
+ "num_tokens": 24231936.0,
+ "step": 1479
+ },
+ {
+ "entropy": 1.067913293838501,
+ "epoch": 2.98989898989899,
+ "grad_norm": 2.0196874141693115,
+ "learning_rate": 2.012121212121212e-06,
+ "loss": 1.0836842060089111,
+ "mean_token_accuracy": 0.7427943348884583,
+ "num_tokens": 24248320.0,
+ "step": 1480
+ },
+ {
+ "entropy": 1.077475905418396,
+ "epoch": 2.991919191919192,
+ "grad_norm": 2.117917776107788,
+ "learning_rate": 2.01010101010101e-06,
+ "loss": 1.0825674533843994,
+ "mean_token_accuracy": 0.7288104295730591,
+ "num_tokens": 24264704.0,
+ "step": 1481
+ },
+ {
+ "entropy": 1.092706561088562,
+ "epoch": 2.993939393939394,
+ "grad_norm": 2.143916130065918,
+ "learning_rate": 2.008080808080808e-06,
+ "loss": 1.1073365211486816,
+ "mean_token_accuracy": 0.7271006107330322,
+ "num_tokens": 24281088.0,
+ "step": 1482
+ },
+ {
+ "entropy": 1.3734595775604248,
+ "epoch": 2.995959595959596,
+ "grad_norm": 2.3651299476623535,
+ "learning_rate": 2.0060606060606062e-06,
+ "loss": 1.3319274187088013,
+ "mean_token_accuracy": 0.6729360222816467,
+ "num_tokens": 24297472.0,
+ "step": 1483
+ },
+ {
+ "entropy": 1.5602202415466309,
+ "epoch": 2.9979797979797977,
+ "grad_norm": 2.4872968196868896,
+ "learning_rate": 2.004040404040404e-06,
+ "loss": 1.5969634056091309,
+ "mean_token_accuracy": 0.6352589130401611,
+ "num_tokens": 24313856.0,
+ "step": 1484
+ },
+ {
+ "entropy": 1.4174549579620361,
+ "epoch": 3.0,
+ "grad_norm": 2.1410610675811768,
+ "learning_rate": 2.0020202020202024e-06,
+ "loss": 1.4155133962631226,
+ "mean_token_accuracy": 0.6683561205863953,
+ "num_tokens": 24330240.0,
+ "step": 1485
+ },
+ {
+ "entropy": 1.5710192918777466,
+ "epoch": 3.002020202020202,
+ "grad_norm": 2.1068179607391357,
+ "learning_rate": 2.0000000000000003e-06,
+ "loss": 1.5049738883972168,
+ "mean_token_accuracy": 0.6563873887062073,
+ "num_tokens": 24346624.0,
+ "step": 1486
+ },
+ {
+ "entropy": 1.2311826944351196,
+ "epoch": 3.004040404040404,
+ "grad_norm": 2.238032579421997,
+ "learning_rate": 1.9979797979797982e-06,
+ "loss": 1.1740195751190186,
+ "mean_token_accuracy": 0.7018197178840637,
+ "num_tokens": 24363008.0,
+ "step": 1487
+ },
+ {
+ "entropy": 1.0681109428405762,
+ "epoch": 3.006060606060606,
+ "grad_norm": 2.0808138847351074,
+ "learning_rate": 1.995959595959596e-06,
+ "loss": 1.0269291400909424,
+ "mean_token_accuracy": 0.739130437374115,
+ "num_tokens": 24379392.0,
+ "step": 1488
+ },
+ {
+ "entropy": 1.2553848028182983,
+ "epoch": 3.008080808080808,
+ "grad_norm": 2.155320644378662,
+ "learning_rate": 1.993939393939394e-06,
+ "loss": 1.209822654724121,
+ "mean_token_accuracy": 0.7072545289993286,
+ "num_tokens": 24395776.0,
+ "step": 1489
+ },
+ {
+ "entropy": 1.5376615524291992,
+ "epoch": 3.01010101010101,
+ "grad_norm": 2.376460075378418,
+ "learning_rate": 1.9919191919191923e-06,
+ "loss": 1.485018014907837,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 24412160.0,
+ "step": 1490
+ },
+ {
+ "entropy": 1.0649843215942383,
+ "epoch": 3.012121212121212,
+ "grad_norm": 2.1056692600250244,
+ "learning_rate": 1.98989898989899e-06,
+ "loss": 1.037630558013916,
+ "mean_token_accuracy": 0.7341841459274292,
+ "num_tokens": 24428544.0,
+ "step": 1491
+ },
+ {
+ "entropy": 1.3711966276168823,
+ "epoch": 3.014141414141414,
+ "grad_norm": 2.238981008529663,
+ "learning_rate": 1.987878787878788e-06,
+ "loss": 1.3336507081985474,
+ "mean_token_accuracy": 0.6914386749267578,
+ "num_tokens": 24444928.0,
+ "step": 1492
+ },
+ {
+ "entropy": 1.3955618143081665,
+ "epoch": 3.0161616161616163,
+ "grad_norm": 2.183464765548706,
+ "learning_rate": 1.985858585858586e-06,
+ "loss": 1.3517842292785645,
+ "mean_token_accuracy": 0.6735466718673706,
+ "num_tokens": 24461312.0,
+ "step": 1493
+ },
+ {
+ "entropy": 1.0063103437423706,
+ "epoch": 3.018181818181818,
+ "grad_norm": 2.1911609172821045,
+ "learning_rate": 1.983838383838384e-06,
+ "loss": 0.9973118305206299,
+ "mean_token_accuracy": 0.7280166149139404,
+ "num_tokens": 24477696.0,
+ "step": 1494
+ },
+ {
+ "entropy": 1.3080904483795166,
+ "epoch": 3.0202020202020203,
+ "grad_norm": 2.1129884719848633,
+ "learning_rate": 1.981818181818182e-06,
+ "loss": 1.2758756875991821,
+ "mean_token_accuracy": 0.7027357220649719,
+ "num_tokens": 24494080.0,
+ "step": 1495
+ },
+ {
+ "entropy": 1.5414087772369385,
+ "epoch": 3.022222222222222,
+ "grad_norm": 2.1628341674804688,
+ "learning_rate": 1.97979797979798e-06,
+ "loss": 1.527054786682129,
+ "mean_token_accuracy": 0.6569370031356812,
+ "num_tokens": 24510464.0,
+ "step": 1496
+ },
+ {
+ "entropy": 1.44732666015625,
+ "epoch": 3.0242424242424244,
+ "grad_norm": 2.2525594234466553,
+ "learning_rate": 1.977777777777778e-06,
+ "loss": 1.3968576192855835,
+ "mean_token_accuracy": 0.6604787707328796,
+ "num_tokens": 24526848.0,
+ "step": 1497
+ },
+ {
+ "entropy": 1.522241234779358,
+ "epoch": 3.026262626262626,
+ "grad_norm": 2.1826529502868652,
+ "learning_rate": 1.975757575757576e-06,
+ "loss": 1.529256820678711,
+ "mean_token_accuracy": 0.6493649482727051,
+ "num_tokens": 24543232.0,
+ "step": 1498
+ },
+ {
+ "entropy": 0.8186452984809875,
+ "epoch": 3.0282828282828285,
+ "grad_norm": 2.1004087924957275,
+ "learning_rate": 1.9737373737373737e-06,
+ "loss": 0.8136417865753174,
+ "mean_token_accuracy": 0.7819370031356812,
+ "num_tokens": 24559616.0,
+ "step": 1499
+ },
+ {
+ "entropy": 1.2122654914855957,
+ "epoch": 3.0303030303030303,
+ "grad_norm": 2.4567720890045166,
+ "learning_rate": 1.9717171717171716e-06,
+ "loss": 1.236933946609497,
+ "mean_token_accuracy": 0.6828895807266235,
+ "num_tokens": 24576000.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.0303030303030303,
+ "eval_entropy": 1.3221501962792488,
+ "eval_loss": 1.5418624877929688,
+ "eval_mean_token_accuracy": 0.6455981039231823,
+ "eval_num_tokens": 24576000.0,
+ "eval_runtime": 43.8085,
+ "eval_samples_per_second": 22.598,
+ "eval_steps_per_second": 2.831,
+ "step": 1500
+ },
+ {
+ "entropy": 0.9493642449378967,
+ "epoch": 3.0323232323232325,
+ "grad_norm": 2.278731346130371,
+ "learning_rate": 1.96969696969697e-06,
+ "loss": 0.9456083178520203,
+ "mean_token_accuracy": 0.7484733462333679,
+ "num_tokens": 24592384.0,
+ "step": 1501
+ },
+ {
+ "entropy": 1.4509791135787964,
+ "epoch": 3.0343434343434343,
+ "grad_norm": 2.112172842025757,
+ "learning_rate": 1.967676767676768e-06,
+ "loss": 1.451171875,
+ "mean_token_accuracy": 0.6633487939834595,
+ "num_tokens": 24608768.0,
+ "step": 1502
+ },
+ {
+ "entropy": 1.6493220329284668,
+ "epoch": 3.036363636363636,
+ "grad_norm": 2.0969111919403076,
+ "learning_rate": 1.9656565656565657e-06,
+ "loss": 1.6576147079467773,
+ "mean_token_accuracy": 0.628724992275238,
+ "num_tokens": 24625152.0,
+ "step": 1503
+ },
+ {
+ "entropy": 1.5533742904663086,
+ "epoch": 3.0383838383838384,
+ "grad_norm": 2.1630685329437256,
+ "learning_rate": 1.9636363636363636e-06,
+ "loss": 1.556575894355774,
+ "mean_token_accuracy": 0.6745237112045288,
+ "num_tokens": 24641536.0,
+ "step": 1504
+ },
+ {
+ "entropy": 1.382328987121582,
+ "epoch": 3.04040404040404,
+ "grad_norm": 2.1493992805480957,
+ "learning_rate": 1.9616161616161615e-06,
+ "loss": 1.3725603818893433,
+ "mean_token_accuracy": 0.6811797618865967,
+ "num_tokens": 24657920.0,
+ "step": 1505
+ },
+ {
+ "entropy": 1.276682734489441,
+ "epoch": 3.0424242424242425,
+ "grad_norm": 2.342043161392212,
+ "learning_rate": 1.9595959595959598e-06,
+ "loss": 1.2861356735229492,
+ "mean_token_accuracy": 0.6843551397323608,
+ "num_tokens": 24674304.0,
+ "step": 1506
+ },
+ {
+ "entropy": 1.3813475370407104,
+ "epoch": 3.0444444444444443,
+ "grad_norm": 2.246891736984253,
+ "learning_rate": 1.9575757575757577e-06,
+ "loss": 1.3686306476593018,
+ "mean_token_accuracy": 0.6649364829063416,
+ "num_tokens": 24690688.0,
+ "step": 1507
+ },
+ {
+ "entropy": 1.2101274728775024,
+ "epoch": 3.0464646464646465,
+ "grad_norm": 2.2917656898498535,
+ "learning_rate": 1.955555555555556e-06,
+ "loss": 1.2131311893463135,
+ "mean_token_accuracy": 0.6958353519439697,
+ "num_tokens": 24707072.0,
+ "step": 1508
+ },
+ {
+ "entropy": 0.7796710133552551,
+ "epoch": 3.0484848484848484,
+ "grad_norm": 2.1023900508880615,
+ "learning_rate": 1.953535353535354e-06,
+ "loss": 0.7828338146209717,
+ "mean_token_accuracy": 0.7879824042320251,
+ "num_tokens": 24723456.0,
+ "step": 1509
+ },
+ {
+ "entropy": 0.8980224132537842,
+ "epoch": 3.0505050505050506,
+ "grad_norm": 2.259763240814209,
+ "learning_rate": 1.9515151515151518e-06,
+ "loss": 0.8986867070198059,
+ "mean_token_accuracy": 0.751038134098053,
+ "num_tokens": 24739840.0,
+ "step": 1510
+ },
+ {
+ "entropy": 1.1927038431167603,
+ "epoch": 3.0525252525252524,
+ "grad_norm": 2.2032012939453125,
+ "learning_rate": 1.9494949494949496e-06,
+ "loss": 1.1801973581314087,
+ "mean_token_accuracy": 0.7048729658126831,
+ "num_tokens": 24756224.0,
+ "step": 1511
+ },
+ {
+ "entropy": 0.8241261839866638,
+ "epoch": 3.0545454545454547,
+ "grad_norm": 1.9027519226074219,
+ "learning_rate": 1.9474747474747475e-06,
+ "loss": 0.8152725100517273,
+ "mean_token_accuracy": 0.7793111801147461,
+ "num_tokens": 24772608.0,
+ "step": 1512
+ },
+ {
+ "entropy": 1.1086668968200684,
+ "epoch": 3.0565656565656565,
+ "grad_norm": 2.4891581535339355,
+ "learning_rate": 1.945454545454546e-06,
+ "loss": 1.1167728900909424,
+ "mean_token_accuracy": 0.7162310481071472,
+ "num_tokens": 24788992.0,
+ "step": 1513
+ },
+ {
+ "entropy": 1.0804646015167236,
+ "epoch": 3.0585858585858587,
+ "grad_norm": 2.3115813732147217,
+ "learning_rate": 1.9434343434343437e-06,
+ "loss": 1.1059165000915527,
+ "mean_token_accuracy": 0.7208109498023987,
+ "num_tokens": 24805376.0,
+ "step": 1514
+ },
+ {
+ "entropy": 1.2628663778305054,
+ "epoch": 3.0606060606060606,
+ "grad_norm": 2.077954053878784,
+ "learning_rate": 1.9414141414141416e-06,
+ "loss": 1.2748162746429443,
+ "mean_token_accuracy": 0.697300910949707,
+ "num_tokens": 24821760.0,
+ "step": 1515
+ },
+ {
+ "entropy": 1.1143958568572998,
+ "epoch": 3.062626262626263,
+ "grad_norm": 2.3562631607055664,
+ "learning_rate": 1.9393939393939395e-06,
+ "loss": 1.127720832824707,
+ "mean_token_accuracy": 0.7080483436584473,
+ "num_tokens": 24838144.0,
+ "step": 1516
+ },
+ {
+ "entropy": 1.3625105619430542,
+ "epoch": 3.0646464646464646,
+ "grad_norm": 2.592428684234619,
+ "learning_rate": 1.9373737373737374e-06,
+ "loss": 1.3909248113632202,
+ "mean_token_accuracy": 0.6637151837348938,
+ "num_tokens": 24854528.0,
+ "step": 1517
+ },
+ {
+ "entropy": 1.032320261001587,
+ "epoch": 3.066666666666667,
+ "grad_norm": 2.400594711303711,
+ "learning_rate": 1.9353535353535353e-06,
+ "loss": 1.0697423219680786,
+ "mean_token_accuracy": 0.7302759885787964,
+ "num_tokens": 24870912.0,
+ "step": 1518
+ },
+ {
+ "entropy": 1.019578456878662,
+ "epoch": 3.0686868686868687,
+ "grad_norm": 2.137122869491577,
+ "learning_rate": 1.9333333333333336e-06,
+ "loss": 0.9904043674468994,
+ "mean_token_accuracy": 0.7461528778076172,
+ "num_tokens": 24887296.0,
+ "step": 1519
+ },
+ {
+ "entropy": 1.4399018287658691,
+ "epoch": 3.0707070707070705,
+ "grad_norm": 2.343580484390259,
+ "learning_rate": 1.9313131313131315e-06,
+ "loss": 1.429957628250122,
+ "mean_token_accuracy": 0.6615168452262878,
+ "num_tokens": 24903680.0,
+ "step": 1520
+ },
+ {
+ "entropy": 0.946161150932312,
+ "epoch": 3.0727272727272728,
+ "grad_norm": 1.9037182331085205,
+ "learning_rate": 1.9292929292929294e-06,
+ "loss": 0.943518877029419,
+ "mean_token_accuracy": 0.7626404762268066,
+ "num_tokens": 24920064.0,
+ "step": 1521
+ },
+ {
+ "entropy": 1.2314492464065552,
+ "epoch": 3.0747474747474746,
+ "grad_norm": 2.0896897315979004,
+ "learning_rate": 1.9272727272727273e-06,
+ "loss": 1.2434325218200684,
+ "mean_token_accuracy": 0.7122007608413696,
+ "num_tokens": 24936448.0,
+ "step": 1522
+ },
+ {
+ "entropy": 1.4557143449783325,
+ "epoch": 3.076767676767677,
+ "grad_norm": 2.162768602371216,
+ "learning_rate": 1.925252525252525e-06,
+ "loss": 1.4258036613464355,
+ "mean_token_accuracy": 0.6709819436073303,
+ "num_tokens": 24952832.0,
+ "step": 1523
+ },
+ {
+ "entropy": 1.1379952430725098,
+ "epoch": 3.0787878787878786,
+ "grad_norm": 2.322523832321167,
+ "learning_rate": 1.9232323232323235e-06,
+ "loss": 1.1321945190429688,
+ "mean_token_accuracy": 0.7206888198852539,
+ "num_tokens": 24969216.0,
+ "step": 1524
+ },
+ {
+ "entropy": 1.4143598079681396,
+ "epoch": 3.080808080808081,
+ "grad_norm": 2.2130038738250732,
+ "learning_rate": 1.9212121212121213e-06,
+ "loss": 1.4286584854125977,
+ "mean_token_accuracy": 0.6595627665519714,
+ "num_tokens": 24985600.0,
+ "step": 1525
+ },
+ {
+ "entropy": 0.9206982254981995,
+ "epoch": 3.0828282828282827,
+ "grad_norm": 2.150385618209839,
+ "learning_rate": 1.9191919191919192e-06,
+ "loss": 0.9122598171234131,
+ "mean_token_accuracy": 0.7564728856086731,
+ "num_tokens": 25001984.0,
+ "step": 1526
+ },
+ {
+ "entropy": 1.3168023824691772,
+ "epoch": 3.084848484848485,
+ "grad_norm": 2.2106544971466064,
+ "learning_rate": 1.9171717171717175e-06,
+ "loss": 1.3181350231170654,
+ "mean_token_accuracy": 0.6904616355895996,
+ "num_tokens": 25018368.0,
+ "step": 1527
+ },
+ {
+ "entropy": 1.2383761405944824,
+ "epoch": 3.0868686868686868,
+ "grad_norm": 2.1377766132354736,
+ "learning_rate": 1.9151515151515154e-06,
+ "loss": 1.2224464416503906,
+ "mean_token_accuracy": 0.7129335403442383,
+ "num_tokens": 25034752.0,
+ "step": 1528
+ },
+ {
+ "entropy": 1.6698395013809204,
+ "epoch": 3.088888888888889,
+ "grad_norm": 2.354219913482666,
+ "learning_rate": 1.9131313131313133e-06,
+ "loss": 1.67041015625,
+ "mean_token_accuracy": 0.6486932039260864,
+ "num_tokens": 25051136.0,
+ "step": 1529
+ },
+ {
+ "entropy": 1.1346160173416138,
+ "epoch": 3.090909090909091,
+ "grad_norm": 2.0619447231292725,
+ "learning_rate": 1.9111111111111112e-06,
+ "loss": 1.1436500549316406,
+ "mean_token_accuracy": 0.721177339553833,
+ "num_tokens": 25067520.0,
+ "step": 1530
+ },
+ {
+ "entropy": 1.4769412279129028,
+ "epoch": 3.092929292929293,
+ "grad_norm": 2.272189140319824,
+ "learning_rate": 1.9090909090909095e-06,
+ "loss": 1.4578258991241455,
+ "mean_token_accuracy": 0.6602955460548401,
+ "num_tokens": 25083904.0,
+ "step": 1531
+ },
+ {
+ "entropy": 1.3661279678344727,
+ "epoch": 3.094949494949495,
+ "grad_norm": 2.381265878677368,
+ "learning_rate": 1.9070707070707072e-06,
+ "loss": 1.3745051622390747,
+ "mean_token_accuracy": 0.6734245419502258,
+ "num_tokens": 25100288.0,
+ "step": 1532
+ },
+ {
+ "entropy": 1.0367696285247803,
+ "epoch": 3.096969696969697,
+ "grad_norm": 2.337775707244873,
+ "learning_rate": 1.9050505050505053e-06,
+ "loss": 1.0290615558624268,
+ "mean_token_accuracy": 0.7355275750160217,
+ "num_tokens": 25116672.0,
+ "step": 1533
+ },
+ {
+ "entropy": 0.9273203015327454,
+ "epoch": 3.098989898989899,
+ "grad_norm": 2.0960872173309326,
+ "learning_rate": 1.9030303030303032e-06,
+ "loss": 0.9162085056304932,
+ "mean_token_accuracy": 0.7639839053153992,
+ "num_tokens": 25133056.0,
+ "step": 1534
+ },
+ {
+ "entropy": 1.018664002418518,
+ "epoch": 3.101010101010101,
+ "grad_norm": 2.243028163909912,
+ "learning_rate": 1.9010101010101013e-06,
+ "loss": 1.019313097000122,
+ "mean_token_accuracy": 0.7399242520332336,
+ "num_tokens": 25149440.0,
+ "step": 1535
+ },
+ {
+ "entropy": 1.3178181648254395,
+ "epoch": 3.103030303030303,
+ "grad_norm": 2.305586338043213,
+ "learning_rate": 1.8989898989898992e-06,
+ "loss": 1.3278884887695312,
+ "mean_token_accuracy": 0.6838055849075317,
+ "num_tokens": 25165824.0,
+ "step": 1536
+ },
+ {
+ "entropy": 1.0808820724487305,
+ "epoch": 3.105050505050505,
+ "grad_norm": 2.2185559272766113,
+ "learning_rate": 1.896969696969697e-06,
+ "loss": 1.0852123498916626,
+ "mean_token_accuracy": 0.7187347412109375,
+ "num_tokens": 25182208.0,
+ "step": 1537
+ },
+ {
+ "entropy": 1.1828639507293701,
+ "epoch": 3.107070707070707,
+ "grad_norm": 2.5469112396240234,
+ "learning_rate": 1.8949494949494952e-06,
+ "loss": 1.1897902488708496,
+ "mean_token_accuracy": 0.697239875793457,
+ "num_tokens": 25198592.0,
+ "step": 1538
+ },
+ {
+ "entropy": 1.3447293043136597,
+ "epoch": 3.109090909090909,
+ "grad_norm": 2.2092692852020264,
+ "learning_rate": 1.892929292929293e-06,
+ "loss": 1.3312615156173706,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 25214976.0,
+ "step": 1539
+ },
+ {
+ "entropy": 1.392472743988037,
+ "epoch": 3.111111111111111,
+ "grad_norm": 2.3445911407470703,
+ "learning_rate": 1.890909090909091e-06,
+ "loss": 1.3892791271209717,
+ "mean_token_accuracy": 0.6742794513702393,
+ "num_tokens": 25231360.0,
+ "step": 1540
+ },
+ {
+ "entropy": 1.422629475593567,
+ "epoch": 3.113131313131313,
+ "grad_norm": 2.4753165245056152,
+ "learning_rate": 1.888888888888889e-06,
+ "loss": 1.432596206665039,
+ "mean_token_accuracy": 0.6670126914978027,
+ "num_tokens": 25247744.0,
+ "step": 1541
+ },
+ {
+ "entropy": 1.5371577739715576,
+ "epoch": 3.1151515151515152,
+ "grad_norm": 2.3083088397979736,
+ "learning_rate": 1.886868686868687e-06,
+ "loss": 1.5318076610565186,
+ "mean_token_accuracy": 0.6301905512809753,
+ "num_tokens": 25264128.0,
+ "step": 1542
+ },
+ {
+ "entropy": 1.1179860830307007,
+ "epoch": 3.117171717171717,
+ "grad_norm": 2.1037089824676514,
+ "learning_rate": 1.884848484848485e-06,
+ "loss": 1.123746395111084,
+ "mean_token_accuracy": 0.7327185869216919,
+ "num_tokens": 25280512.0,
+ "step": 1543
+ },
+ {
+ "entropy": 1.046632170677185,
+ "epoch": 3.1191919191919193,
+ "grad_norm": 2.267493963241577,
+ "learning_rate": 1.882828282828283e-06,
+ "loss": 1.027912974357605,
+ "mean_token_accuracy": 0.7275280952453613,
+ "num_tokens": 25296896.0,
+ "step": 1544
+ },
+ {
+ "entropy": 1.2848094701766968,
+ "epoch": 3.121212121212121,
+ "grad_norm": 2.1797454357147217,
+ "learning_rate": 1.8808080808080808e-06,
+ "loss": 1.3054044246673584,
+ "mean_token_accuracy": 0.7058500051498413,
+ "num_tokens": 25313280.0,
+ "step": 1545
+ },
+ {
+ "entropy": 1.132463812828064,
+ "epoch": 3.1232323232323234,
+ "grad_norm": 2.2171123027801514,
+ "learning_rate": 1.878787878787879e-06,
+ "loss": 1.1395090818405151,
+ "mean_token_accuracy": 0.7204445600509644,
+ "num_tokens": 25329664.0,
+ "step": 1546
+ },
+ {
+ "entropy": 1.084518551826477,
+ "epoch": 3.125252525252525,
+ "grad_norm": 2.2163641452789307,
+ "learning_rate": 1.8767676767676768e-06,
+ "loss": 1.093268871307373,
+ "mean_token_accuracy": 0.7297264337539673,
+ "num_tokens": 25346048.0,
+ "step": 1547
+ },
+ {
+ "entropy": 1.1031688451766968,
+ "epoch": 3.1272727272727274,
+ "grad_norm": 2.3715343475341797,
+ "learning_rate": 1.874747474747475e-06,
+ "loss": 1.1064910888671875,
+ "mean_token_accuracy": 0.7130556702613831,
+ "num_tokens": 25362432.0,
+ "step": 1548
+ },
+ {
+ "entropy": 1.515089988708496,
+ "epoch": 3.1292929292929292,
+ "grad_norm": 2.0995519161224365,
+ "learning_rate": 1.872727272727273e-06,
+ "loss": 1.5236327648162842,
+ "mean_token_accuracy": 0.6491206884384155,
+ "num_tokens": 25378816.0,
+ "step": 1549
+ },
+ {
+ "entropy": 1.26030695438385,
+ "epoch": 3.1313131313131315,
+ "grad_norm": 2.2167913913726807,
+ "learning_rate": 1.8707070707070709e-06,
+ "loss": 1.2750146389007568,
+ "mean_token_accuracy": 0.6991939544677734,
+ "num_tokens": 25395200.0,
+ "step": 1550
+ },
+ {
+ "epoch": 3.1313131313131315,
+ "eval_entropy": 1.3187109231948853,
+ "eval_loss": 1.5490814447402954,
+ "eval_mean_token_accuracy": 0.6446880385760339,
+ "eval_num_tokens": 25395200.0,
+ "eval_runtime": 43.7612,
+ "eval_samples_per_second": 22.623,
+ "eval_steps_per_second": 2.834,
+ "step": 1550
+ },
+ {
+ "entropy": 1.044468641281128,
+ "epoch": 3.1333333333333333,
+ "grad_norm": 2.189656972885132,
+ "learning_rate": 1.868686868686869e-06,
+ "loss": 1.035596251487732,
+ "mean_token_accuracy": 0.7405959963798523,
+ "num_tokens": 25411584.0,
+ "step": 1551
+ },
+ {
+ "entropy": 1.286029577255249,
+ "epoch": 3.1353535353535356,
+ "grad_norm": 2.3911969661712646,
+ "learning_rate": 1.8666666666666669e-06,
+ "loss": 1.287235975265503,
+ "mean_token_accuracy": 0.6918661594390869,
+ "num_tokens": 25427968.0,
+ "step": 1552
+ },
+ {
+ "entropy": 1.4401317834854126,
+ "epoch": 3.1373737373737374,
+ "grad_norm": 2.452929973602295,
+ "learning_rate": 1.864646464646465e-06,
+ "loss": 1.4605298042297363,
+ "mean_token_accuracy": 0.6466169953346252,
+ "num_tokens": 25444352.0,
+ "step": 1553
+ },
+ {
+ "entropy": 1.316934585571289,
+ "epoch": 3.1393939393939396,
+ "grad_norm": 2.4121034145355225,
+ "learning_rate": 1.8626262626262629e-06,
+ "loss": 1.3266665935516357,
+ "mean_token_accuracy": 0.6759892702102661,
+ "num_tokens": 25460736.0,
+ "step": 1554
+ },
+ {
+ "entropy": 1.2644363641738892,
+ "epoch": 3.1414141414141414,
+ "grad_norm": 2.2631289958953857,
+ "learning_rate": 1.8606060606060607e-06,
+ "loss": 1.2905628681182861,
+ "mean_token_accuracy": 0.6833170652389526,
+ "num_tokens": 25477120.0,
+ "step": 1555
+ },
+ {
+ "entropy": 1.3172475099563599,
+ "epoch": 3.1434343434343432,
+ "grad_norm": 2.357954502105713,
+ "learning_rate": 1.8585858585858588e-06,
+ "loss": 1.316823124885559,
+ "mean_token_accuracy": 0.6763556599617004,
+ "num_tokens": 25493504.0,
+ "step": 1556
+ },
+ {
+ "entropy": 1.392463207244873,
+ "epoch": 3.1454545454545455,
+ "grad_norm": 2.491037130355835,
+ "learning_rate": 1.8565656565656567e-06,
+ "loss": 1.3718677759170532,
+ "mean_token_accuracy": 0.6508915424346924,
+ "num_tokens": 25509888.0,
+ "step": 1557
+ },
+ {
+ "entropy": 1.3607147932052612,
+ "epoch": 3.1474747474747473,
+ "grad_norm": 2.306100845336914,
+ "learning_rate": 1.8545454545454546e-06,
+ "loss": 1.3523163795471191,
+ "mean_token_accuracy": 0.6557157039642334,
+ "num_tokens": 25526272.0,
+ "step": 1558
+ },
+ {
+ "entropy": 0.9888757467269897,
+ "epoch": 3.1494949494949496,
+ "grad_norm": 2.125560998916626,
+ "learning_rate": 1.8525252525252527e-06,
+ "loss": 0.9713444709777832,
+ "mean_token_accuracy": 0.7584269642829895,
+ "num_tokens": 25542656.0,
+ "step": 1559
+ },
+ {
+ "entropy": 1.286476492881775,
+ "epoch": 3.1515151515151514,
+ "grad_norm": 2.149113416671753,
+ "learning_rate": 1.8505050505050506e-06,
+ "loss": 1.2688651084899902,
+ "mean_token_accuracy": 0.6882022619247437,
+ "num_tokens": 25559040.0,
+ "step": 1560
+ },
+ {
+ "entropy": 0.9255673289299011,
+ "epoch": 3.1535353535353536,
+ "grad_norm": 2.1615419387817383,
+ "learning_rate": 1.8484848484848487e-06,
+ "loss": 0.9265275597572327,
+ "mean_token_accuracy": 0.7542135119438171,
+ "num_tokens": 25575424.0,
+ "step": 1561
+ },
+ {
+ "entropy": 1.4960277080535889,
+ "epoch": 3.1555555555555554,
+ "grad_norm": 2.183372974395752,
+ "learning_rate": 1.8464646464646466e-06,
+ "loss": 1.4737393856048584,
+ "mean_token_accuracy": 0.6516854166984558,
+ "num_tokens": 25591808.0,
+ "step": 1562
+ },
+ {
+ "entropy": 1.2294487953186035,
+ "epoch": 3.1575757575757577,
+ "grad_norm": 2.389885425567627,
+ "learning_rate": 1.8444444444444445e-06,
+ "loss": 1.210254192352295,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 25608192.0,
+ "step": 1563
+ },
+ {
+ "entropy": 1.0153220891952515,
+ "epoch": 3.1595959595959595,
+ "grad_norm": 2.131989002227783,
+ "learning_rate": 1.8424242424242426e-06,
+ "loss": 1.0005543231964111,
+ "mean_token_accuracy": 0.7426722049713135,
+ "num_tokens": 25624576.0,
+ "step": 1564
+ },
+ {
+ "entropy": 1.2591265439987183,
+ "epoch": 3.1616161616161618,
+ "grad_norm": 2.150913715362549,
+ "learning_rate": 1.8404040404040405e-06,
+ "loss": 1.2284668684005737,
+ "mean_token_accuracy": 0.6993771195411682,
+ "num_tokens": 25640960.0,
+ "step": 1565
+ },
+ {
+ "entropy": 1.009209394454956,
+ "epoch": 3.1636363636363636,
+ "grad_norm": 2.090205192565918,
+ "learning_rate": 1.8383838383838384e-06,
+ "loss": 0.9917510747909546,
+ "mean_token_accuracy": 0.7412066459655762,
+ "num_tokens": 25657344.0,
+ "step": 1566
+ },
+ {
+ "entropy": 1.716966986656189,
+ "epoch": 3.165656565656566,
+ "grad_norm": 2.2880618572235107,
+ "learning_rate": 1.8363636363636365e-06,
+ "loss": 1.7331494092941284,
+ "mean_token_accuracy": 0.6106497049331665,
+ "num_tokens": 25673728.0,
+ "step": 1567
+ },
+ {
+ "entropy": 1.5511447191238403,
+ "epoch": 3.1676767676767676,
+ "grad_norm": 2.371710777282715,
+ "learning_rate": 1.8343434343434343e-06,
+ "loss": 1.5570940971374512,
+ "mean_token_accuracy": 0.6477161645889282,
+ "num_tokens": 25690112.0,
+ "step": 1568
+ },
+ {
+ "entropy": 1.325405240058899,
+ "epoch": 3.16969696969697,
+ "grad_norm": 2.3747830390930176,
+ "learning_rate": 1.8323232323232324e-06,
+ "loss": 1.3260624408721924,
+ "mean_token_accuracy": 0.6791035532951355,
+ "num_tokens": 25706496.0,
+ "step": 1569
+ },
+ {
+ "entropy": 1.2529335021972656,
+ "epoch": 3.1717171717171717,
+ "grad_norm": 2.162775754928589,
+ "learning_rate": 1.8303030303030305e-06,
+ "loss": 1.257356882095337,
+ "mean_token_accuracy": 0.7066438794136047,
+ "num_tokens": 25722880.0,
+ "step": 1570
+ },
+ {
+ "entropy": 1.116769790649414,
+ "epoch": 3.1737373737373735,
+ "grad_norm": 2.217358350753784,
+ "learning_rate": 1.8282828282828286e-06,
+ "loss": 1.1458317041397095,
+ "mean_token_accuracy": 0.7087811231613159,
+ "num_tokens": 25739264.0,
+ "step": 1571
+ },
+ {
+ "entropy": 1.3465793132781982,
+ "epoch": 3.175757575757576,
+ "grad_norm": 2.225062370300293,
+ "learning_rate": 1.8262626262626265e-06,
+ "loss": 1.380183219909668,
+ "mean_token_accuracy": 0.6872862577438354,
+ "num_tokens": 25755648.0,
+ "step": 1572
+ },
+ {
+ "entropy": 1.237407922744751,
+ "epoch": 3.1777777777777776,
+ "grad_norm": 2.31829833984375,
+ "learning_rate": 1.8242424242424244e-06,
+ "loss": 1.247010588645935,
+ "mean_token_accuracy": 0.7034074068069458,
+ "num_tokens": 25772032.0,
+ "step": 1573
+ },
+ {
+ "entropy": 1.3967171907424927,
+ "epoch": 3.17979797979798,
+ "grad_norm": 2.4075193405151367,
+ "learning_rate": 1.8222222222222225e-06,
+ "loss": 1.4189220666885376,
+ "mean_token_accuracy": 0.6609672904014587,
+ "num_tokens": 25788416.0,
+ "step": 1574
+ },
+ {
+ "entropy": 1.4262871742248535,
+ "epoch": 3.1818181818181817,
+ "grad_norm": 2.507885217666626,
+ "learning_rate": 1.8202020202020204e-06,
+ "loss": 1.4657065868377686,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 25804800.0,
+ "step": 1575
+ },
+ {
+ "entropy": 1.1763924360275269,
+ "epoch": 3.183838383838384,
+ "grad_norm": 2.179891586303711,
+ "learning_rate": 1.8181818181818183e-06,
+ "loss": 1.1837804317474365,
+ "mean_token_accuracy": 0.7209941148757935,
+ "num_tokens": 25821184.0,
+ "step": 1576
+ },
+ {
+ "entropy": 1.119240403175354,
+ "epoch": 3.1858585858585857,
+ "grad_norm": 2.300708532333374,
+ "learning_rate": 1.8161616161616164e-06,
+ "loss": 1.1251145601272583,
+ "mean_token_accuracy": 0.7134220600128174,
+ "num_tokens": 25837568.0,
+ "step": 1577
+ },
+ {
+ "entropy": 1.3045564889907837,
+ "epoch": 3.187878787878788,
+ "grad_norm": 2.2904021739959717,
+ "learning_rate": 1.8141414141414143e-06,
+ "loss": 1.3114243745803833,
+ "mean_token_accuracy": 0.691316545009613,
+ "num_tokens": 25853952.0,
+ "step": 1578
+ },
+ {
+ "entropy": 1.0507739782333374,
+ "epoch": 3.18989898989899,
+ "grad_norm": 2.0942912101745605,
+ "learning_rate": 1.8121212121212124e-06,
+ "loss": 1.043527364730835,
+ "mean_token_accuracy": 0.7244748473167419,
+ "num_tokens": 25870336.0,
+ "step": 1579
+ },
+ {
+ "entropy": 1.2050808668136597,
+ "epoch": 3.191919191919192,
+ "grad_norm": 2.131643295288086,
+ "learning_rate": 1.8101010101010103e-06,
+ "loss": 1.1917791366577148,
+ "mean_token_accuracy": 0.7046898007392883,
+ "num_tokens": 25886720.0,
+ "step": 1580
+ },
+ {
+ "entropy": 1.3607940673828125,
+ "epoch": 3.193939393939394,
+ "grad_norm": 2.2744040489196777,
+ "learning_rate": 1.8080808080808082e-06,
+ "loss": 1.347360610961914,
+ "mean_token_accuracy": 0.6780043840408325,
+ "num_tokens": 25903104.0,
+ "step": 1581
+ },
+ {
+ "entropy": 1.4996237754821777,
+ "epoch": 3.195959595959596,
+ "grad_norm": 2.3050780296325684,
+ "learning_rate": 1.8060606060606063e-06,
+ "loss": 1.5023889541625977,
+ "mean_token_accuracy": 0.6423424482345581,
+ "num_tokens": 25919488.0,
+ "step": 1582
+ },
+ {
+ "entropy": 1.1950902938842773,
+ "epoch": 3.197979797979798,
+ "grad_norm": 2.408799648284912,
+ "learning_rate": 1.8040404040404041e-06,
+ "loss": 1.1868454217910767,
+ "mean_token_accuracy": 0.6998046040534973,
+ "num_tokens": 25935872.0,
+ "step": 1583
+ },
+ {
+ "entropy": 1.5395914316177368,
+ "epoch": 3.2,
+ "grad_norm": 2.4104502201080322,
+ "learning_rate": 1.802020202020202e-06,
+ "loss": 1.5414860248565674,
+ "mean_token_accuracy": 0.6382511258125305,
+ "num_tokens": 25952256.0,
+ "step": 1584
+ },
+ {
+ "entropy": 1.0701062679290771,
+ "epoch": 3.202020202020202,
+ "grad_norm": 2.2250685691833496,
+ "learning_rate": 1.8000000000000001e-06,
+ "loss": 1.0787923336029053,
+ "mean_token_accuracy": 0.7307645082473755,
+ "num_tokens": 25968640.0,
+ "step": 1585
+ },
+ {
+ "entropy": 1.0968927145004272,
+ "epoch": 3.2040404040404042,
+ "grad_norm": 2.3169026374816895,
+ "learning_rate": 1.797979797979798e-06,
+ "loss": 1.1023577451705933,
+ "mean_token_accuracy": 0.7217879891395569,
+ "num_tokens": 25985024.0,
+ "step": 1586
+ },
+ {
+ "entropy": 1.0547802448272705,
+ "epoch": 3.206060606060606,
+ "grad_norm": 2.1187734603881836,
+ "learning_rate": 1.7959595959595961e-06,
+ "loss": 1.0536352396011353,
+ "mean_token_accuracy": 0.733146071434021,
+ "num_tokens": 26001408.0,
+ "step": 1587
+ },
+ {
+ "entropy": 1.821456789970398,
+ "epoch": 3.2080808080808083,
+ "grad_norm": 2.2364695072174072,
+ "learning_rate": 1.793939393939394e-06,
+ "loss": 1.8386787176132202,
+ "mean_token_accuracy": 0.5963605046272278,
+ "num_tokens": 26017792.0,
+ "step": 1588
+ },
+ {
+ "entropy": 1.5173720121383667,
+ "epoch": 3.21010101010101,
+ "grad_norm": 2.2785775661468506,
+ "learning_rate": 1.7919191919191919e-06,
+ "loss": 1.5099977254867554,
+ "mean_token_accuracy": 0.6417317986488342,
+ "num_tokens": 26034176.0,
+ "step": 1589
+ },
+ {
+ "entropy": 1.5751056671142578,
+ "epoch": 3.212121212121212,
+ "grad_norm": 2.2048606872558594,
+ "learning_rate": 1.78989898989899e-06,
+ "loss": 1.5845966339111328,
+ "mean_token_accuracy": 0.633671224117279,
+ "num_tokens": 26050560.0,
+ "step": 1590
+ },
+ {
+ "entropy": 1.3307859897613525,
+ "epoch": 3.214141414141414,
+ "grad_norm": 2.310291051864624,
+ "learning_rate": 1.787878787878788e-06,
+ "loss": 1.3058912754058838,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 26066944.0,
+ "step": 1591
+ },
+ {
+ "entropy": 0.9954612255096436,
+ "epoch": 3.216161616161616,
+ "grad_norm": 2.1447651386260986,
+ "learning_rate": 1.7858585858585862e-06,
+ "loss": 0.975112795829773,
+ "mean_token_accuracy": 0.7406570315361023,
+ "num_tokens": 26083328.0,
+ "step": 1592
+ },
+ {
+ "entropy": 1.1513571739196777,
+ "epoch": 3.2181818181818183,
+ "grad_norm": 2.3595945835113525,
+ "learning_rate": 1.783838383838384e-06,
+ "loss": 1.1416239738464355,
+ "mean_token_accuracy": 0.7137274146080017,
+ "num_tokens": 26099712.0,
+ "step": 1593
+ },
+ {
+ "entropy": 0.9992931485176086,
+ "epoch": 3.22020202020202,
+ "grad_norm": 2.1605300903320312,
+ "learning_rate": 1.781818181818182e-06,
+ "loss": 1.0023880004882812,
+ "mean_token_accuracy": 0.738092303276062,
+ "num_tokens": 26116096.0,
+ "step": 1594
+ },
+ {
+ "entropy": 1.6680811643600464,
+ "epoch": 3.2222222222222223,
+ "grad_norm": 2.3036210536956787,
+ "learning_rate": 1.77979797979798e-06,
+ "loss": 1.7154381275177002,
+ "mean_token_accuracy": 0.6182217597961426,
+ "num_tokens": 26132480.0,
+ "step": 1595
+ },
+ {
+ "entropy": 1.113036036491394,
+ "epoch": 3.224242424242424,
+ "grad_norm": 2.3098108768463135,
+ "learning_rate": 1.777777777777778e-06,
+ "loss": 1.1006368398666382,
+ "mean_token_accuracy": 0.7120175957679749,
+ "num_tokens": 26148864.0,
+ "step": 1596
+ },
+ {
+ "entropy": 1.0055886507034302,
+ "epoch": 3.2262626262626264,
+ "grad_norm": 2.3227128982543945,
+ "learning_rate": 1.775757575757576e-06,
+ "loss": 1.0274525880813599,
+ "mean_token_accuracy": 0.7253297567367554,
+ "num_tokens": 26165248.0,
+ "step": 1597
+ },
+ {
+ "entropy": 1.139039397239685,
+ "epoch": 3.228282828282828,
+ "grad_norm": 2.415011405944824,
+ "learning_rate": 1.773737373737374e-06,
+ "loss": 1.1494395732879639,
+ "mean_token_accuracy": 0.7061553597450256,
+ "num_tokens": 26181632.0,
+ "step": 1598
+ },
+ {
+ "entropy": 1.1573477983474731,
+ "epoch": 3.2303030303030305,
+ "grad_norm": 2.2666749954223633,
+ "learning_rate": 1.7717171717171718e-06,
+ "loss": 1.1615169048309326,
+ "mean_token_accuracy": 0.7168416976928711,
+ "num_tokens": 26198016.0,
+ "step": 1599
+ },
+ {
+ "entropy": 1.1301828622817993,
+ "epoch": 3.2323232323232323,
+ "grad_norm": 2.345222234725952,
+ "learning_rate": 1.76969696969697e-06,
+ "loss": 1.1062344312667847,
+ "mean_token_accuracy": 0.7164753079414368,
+ "num_tokens": 26214400.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.2323232323232323,
+ "eval_entropy": 1.3245953331070561,
+ "eval_loss": 1.5489962100982666,
+ "eval_mean_token_accuracy": 0.644533898080549,
+ "eval_num_tokens": 26214400.0,
+ "eval_runtime": 43.7619,
+ "eval_samples_per_second": 22.622,
+ "eval_steps_per_second": 2.834,
+ "step": 1600
+ },
+ {
+ "entropy": 1.4168665409088135,
+ "epoch": 3.2343434343434345,
+ "grad_norm": 2.3160741329193115,
+ "learning_rate": 1.7676767676767678e-06,
+ "loss": 1.403707504272461,
+ "mean_token_accuracy": 0.6696385145187378,
+ "num_tokens": 26230784.0,
+ "step": 1601
+ },
+ {
+ "entropy": 1.4689940214157104,
+ "epoch": 3.2363636363636363,
+ "grad_norm": 2.1691131591796875,
+ "learning_rate": 1.7656565656565657e-06,
+ "loss": 1.463477611541748,
+ "mean_token_accuracy": 0.6482046842575073,
+ "num_tokens": 26247168.0,
+ "step": 1602
+ },
+ {
+ "entropy": 1.2312567234039307,
+ "epoch": 3.2383838383838386,
+ "grad_norm": 2.4240810871124268,
+ "learning_rate": 1.7636363636363638e-06,
+ "loss": 1.2253142595291138,
+ "mean_token_accuracy": 0.6933317184448242,
+ "num_tokens": 26263552.0,
+ "step": 1603
+ },
+ {
+ "entropy": 1.5346348285675049,
+ "epoch": 3.2404040404040404,
+ "grad_norm": 2.417025566101074,
+ "learning_rate": 1.7616161616161617e-06,
+ "loss": 1.5418915748596191,
+ "mean_token_accuracy": 0.6389228105545044,
+ "num_tokens": 26279936.0,
+ "step": 1604
+ },
+ {
+ "entropy": 1.4432504177093506,
+ "epoch": 3.242424242424242,
+ "grad_norm": 2.2379117012023926,
+ "learning_rate": 1.7595959595959598e-06,
+ "loss": 1.4543676376342773,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 26296320.0,
+ "step": 1605
+ },
+ {
+ "entropy": 1.54794442653656,
+ "epoch": 3.2444444444444445,
+ "grad_norm": 2.293386936187744,
+ "learning_rate": 1.7575757575757577e-06,
+ "loss": 1.525251865386963,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 26312704.0,
+ "step": 1606
+ },
+ {
+ "entropy": 1.3418866395950317,
+ "epoch": 3.2464646464646463,
+ "grad_norm": 2.143143892288208,
+ "learning_rate": 1.7555555555555556e-06,
+ "loss": 1.3268392086029053,
+ "mean_token_accuracy": 0.6758060455322266,
+ "num_tokens": 26329088.0,
+ "step": 1607
+ },
+ {
+ "entropy": 1.3032151460647583,
+ "epoch": 3.2484848484848485,
+ "grad_norm": 2.0813350677490234,
+ "learning_rate": 1.7535353535353537e-06,
+ "loss": 1.3105076551437378,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 26345472.0,
+ "step": 1608
+ },
+ {
+ "entropy": 1.258314847946167,
+ "epoch": 3.2505050505050503,
+ "grad_norm": 2.346703052520752,
+ "learning_rate": 1.7515151515151516e-06,
+ "loss": 1.2453927993774414,
+ "mean_token_accuracy": 0.6931484937667847,
+ "num_tokens": 26361856.0,
+ "step": 1609
+ },
+ {
+ "entropy": 1.1887613534927368,
+ "epoch": 3.2525252525252526,
+ "grad_norm": 2.2838189601898193,
+ "learning_rate": 1.7494949494949494e-06,
+ "loss": 1.2008028030395508,
+ "mean_token_accuracy": 0.7044455409049988,
+ "num_tokens": 26378240.0,
+ "step": 1610
+ },
+ {
+ "entropy": 1.2221968173980713,
+ "epoch": 3.2545454545454544,
+ "grad_norm": 2.201186418533325,
+ "learning_rate": 1.7474747474747475e-06,
+ "loss": 1.2126820087432861,
+ "mean_token_accuracy": 0.6948583126068115,
+ "num_tokens": 26394624.0,
+ "step": 1611
+ },
+ {
+ "entropy": 1.3306292295455933,
+ "epoch": 3.2565656565656567,
+ "grad_norm": 2.1501541137695312,
+ "learning_rate": 1.7454545454545456e-06,
+ "loss": 1.3301104307174683,
+ "mean_token_accuracy": 0.6844772696495056,
+ "num_tokens": 26411008.0,
+ "step": 1612
+ },
+ {
+ "entropy": 1.0881599187850952,
+ "epoch": 3.2585858585858585,
+ "grad_norm": 2.092081069946289,
+ "learning_rate": 1.7434343434343437e-06,
+ "loss": 1.0868645906448364,
+ "mean_token_accuracy": 0.7172691822052002,
+ "num_tokens": 26427392.0,
+ "step": 1613
+ },
+ {
+ "entropy": 1.1937274932861328,
+ "epoch": 3.2606060606060607,
+ "grad_norm": 2.563627243041992,
+ "learning_rate": 1.7414141414141416e-06,
+ "loss": 1.1793221235275269,
+ "mean_token_accuracy": 0.7015144228935242,
+ "num_tokens": 26443776.0,
+ "step": 1614
+ },
+ {
+ "entropy": 1.1501706838607788,
+ "epoch": 3.2626262626262625,
+ "grad_norm": 2.2964398860931396,
+ "learning_rate": 1.7393939393939397e-06,
+ "loss": 1.1438164710998535,
+ "mean_token_accuracy": 0.7105520367622375,
+ "num_tokens": 26460160.0,
+ "step": 1615
+ },
+ {
+ "entropy": 1.276473045349121,
+ "epoch": 3.264646464646465,
+ "grad_norm": 2.4301693439483643,
+ "learning_rate": 1.7373737373737376e-06,
+ "loss": 1.2897876501083374,
+ "mean_token_accuracy": 0.6933927536010742,
+ "num_tokens": 26476544.0,
+ "step": 1616
+ },
+ {
+ "entropy": 1.1926265954971313,
+ "epoch": 3.2666666666666666,
+ "grad_norm": 2.1503496170043945,
+ "learning_rate": 1.7353535353535355e-06,
+ "loss": 1.1882628202438354,
+ "mean_token_accuracy": 0.7013922929763794,
+ "num_tokens": 26492928.0,
+ "step": 1617
+ },
+ {
+ "entropy": 1.2843140363693237,
+ "epoch": 3.268686868686869,
+ "grad_norm": 2.312652587890625,
+ "learning_rate": 1.7333333333333336e-06,
+ "loss": 1.3045732975006104,
+ "mean_token_accuracy": 0.6849047541618347,
+ "num_tokens": 26509312.0,
+ "step": 1618
+ },
+ {
+ "entropy": 1.0693352222442627,
+ "epoch": 3.2707070707070707,
+ "grad_norm": 2.2860965728759766,
+ "learning_rate": 1.7313131313131315e-06,
+ "loss": 1.044942855834961,
+ "mean_token_accuracy": 0.72832190990448,
+ "num_tokens": 26525696.0,
+ "step": 1619
+ },
+ {
+ "entropy": 1.5462334156036377,
+ "epoch": 3.2727272727272725,
+ "grad_norm": 2.395378589630127,
+ "learning_rate": 1.7292929292929294e-06,
+ "loss": 1.5529801845550537,
+ "mean_token_accuracy": 0.6301294565200806,
+ "num_tokens": 26542080.0,
+ "step": 1620
+ },
+ {
+ "entropy": 1.0582746267318726,
+ "epoch": 3.2747474747474747,
+ "grad_norm": 2.198370933532715,
+ "learning_rate": 1.7272727272727275e-06,
+ "loss": 1.0674792528152466,
+ "mean_token_accuracy": 0.7289936542510986,
+ "num_tokens": 26558464.0,
+ "step": 1621
+ },
+ {
+ "entropy": 1.133894920349121,
+ "epoch": 3.276767676767677,
+ "grad_norm": 2.2087979316711426,
+ "learning_rate": 1.7252525252525254e-06,
+ "loss": 1.1322801113128662,
+ "mean_token_accuracy": 0.7148876190185547,
+ "num_tokens": 26574848.0,
+ "step": 1622
+ },
+ {
+ "entropy": 1.0465091466903687,
+ "epoch": 3.278787878787879,
+ "grad_norm": 2.4500746726989746,
+ "learning_rate": 1.7232323232323235e-06,
+ "loss": 1.042628526687622,
+ "mean_token_accuracy": 0.72832190990448,
+ "num_tokens": 26591232.0,
+ "step": 1623
+ },
+ {
+ "entropy": 1.3930310010910034,
+ "epoch": 3.2808080808080806,
+ "grad_norm": 2.2968733310699463,
+ "learning_rate": 1.7212121212121214e-06,
+ "loss": 1.3903234004974365,
+ "mean_token_accuracy": 0.6658524870872498,
+ "num_tokens": 26607616.0,
+ "step": 1624
+ },
+ {
+ "entropy": 1.4873614311218262,
+ "epoch": 3.282828282828283,
+ "grad_norm": 2.404604434967041,
+ "learning_rate": 1.7191919191919192e-06,
+ "loss": 1.4828845262527466,
+ "mean_token_accuracy": 0.6601123809814453,
+ "num_tokens": 26624000.0,
+ "step": 1625
+ },
+ {
+ "entropy": 1.4326503276824951,
+ "epoch": 3.2848484848484847,
+ "grad_norm": 2.3051655292510986,
+ "learning_rate": 1.7171717171717173e-06,
+ "loss": 1.4187182188034058,
+ "mean_token_accuracy": 0.6783097386360168,
+ "num_tokens": 26640384.0,
+ "step": 1626
+ },
+ {
+ "entropy": 1.067203402519226,
+ "epoch": 3.286868686868687,
+ "grad_norm": 2.1361143589019775,
+ "learning_rate": 1.7151515151515152e-06,
+ "loss": 1.0571379661560059,
+ "mean_token_accuracy": 0.7386419177055359,
+ "num_tokens": 26656768.0,
+ "step": 1627
+ },
+ {
+ "entropy": 0.9872021675109863,
+ "epoch": 3.2888888888888888,
+ "grad_norm": 2.084920883178711,
+ "learning_rate": 1.7131313131313131e-06,
+ "loss": 0.9779852628707886,
+ "mean_token_accuracy": 0.7591597437858582,
+ "num_tokens": 26673152.0,
+ "step": 1628
+ },
+ {
+ "entropy": 1.261454701423645,
+ "epoch": 3.290909090909091,
+ "grad_norm": 2.2008469104766846,
+ "learning_rate": 1.7111111111111112e-06,
+ "loss": 1.2701423168182373,
+ "mean_token_accuracy": 0.6892403364181519,
+ "num_tokens": 26689536.0,
+ "step": 1629
+ },
+ {
+ "entropy": 1.6490918397903442,
+ "epoch": 3.292929292929293,
+ "grad_norm": 2.2967329025268555,
+ "learning_rate": 1.7090909090909091e-06,
+ "loss": 1.6521049737930298,
+ "mean_token_accuracy": 0.6223741769790649,
+ "num_tokens": 26705920.0,
+ "step": 1630
+ },
+ {
+ "entropy": 1.241626262664795,
+ "epoch": 3.294949494949495,
+ "grad_norm": 2.3993594646453857,
+ "learning_rate": 1.707070707070707e-06,
+ "loss": 1.2557122707366943,
+ "mean_token_accuracy": 0.6982169151306152,
+ "num_tokens": 26722304.0,
+ "step": 1631
+ },
+ {
+ "entropy": 1.2038613557815552,
+ "epoch": 3.296969696969697,
+ "grad_norm": 2.6470985412597656,
+ "learning_rate": 1.705050505050505e-06,
+ "loss": 1.220262885093689,
+ "mean_token_accuracy": 0.702186107635498,
+ "num_tokens": 26738688.0,
+ "step": 1632
+ },
+ {
+ "entropy": 1.0352909564971924,
+ "epoch": 3.298989898989899,
+ "grad_norm": 2.30973219871521,
+ "learning_rate": 1.703030303030303e-06,
+ "loss": 1.0416737794876099,
+ "mean_token_accuracy": 0.7299095988273621,
+ "num_tokens": 26755072.0,
+ "step": 1633
+ },
+ {
+ "entropy": 1.0178903341293335,
+ "epoch": 3.301010101010101,
+ "grad_norm": 2.3068888187408447,
+ "learning_rate": 1.7010101010101013e-06,
+ "loss": 1.021026849746704,
+ "mean_token_accuracy": 0.7370542287826538,
+ "num_tokens": 26771456.0,
+ "step": 1634
+ },
+ {
+ "entropy": 1.1840031147003174,
+ "epoch": 3.303030303030303,
+ "grad_norm": 2.1070966720581055,
+ "learning_rate": 1.6989898989898992e-06,
+ "loss": 1.191172480583191,
+ "mean_token_accuracy": 0.7166585326194763,
+ "num_tokens": 26787840.0,
+ "step": 1635
+ },
+ {
+ "entropy": 1.3296533823013306,
+ "epoch": 3.305050505050505,
+ "grad_norm": 2.4398109912872314,
+ "learning_rate": 1.6969696969696973e-06,
+ "loss": 1.338945984840393,
+ "mean_token_accuracy": 0.67666095495224,
+ "num_tokens": 26804224.0,
+ "step": 1636
+ },
+ {
+ "entropy": 1.1331745386123657,
+ "epoch": 3.3070707070707073,
+ "grad_norm": 2.103158473968506,
+ "learning_rate": 1.6949494949494952e-06,
+ "loss": 1.139038324356079,
+ "mean_token_accuracy": 0.7154372334480286,
+ "num_tokens": 26820608.0,
+ "step": 1637
+ },
+ {
+ "entropy": 1.3300442695617676,
+ "epoch": 3.309090909090909,
+ "grad_norm": 2.4576940536499023,
+ "learning_rate": 1.692929292929293e-06,
+ "loss": 1.3464535474777222,
+ "mean_token_accuracy": 0.6715925931930542,
+ "num_tokens": 26836992.0,
+ "step": 1638
+ },
+ {
+ "entropy": 1.5538347959518433,
+ "epoch": 3.311111111111111,
+ "grad_norm": 2.4972009658813477,
+ "learning_rate": 1.6909090909090912e-06,
+ "loss": 1.544262409210205,
+ "mean_token_accuracy": 0.6377015113830566,
+ "num_tokens": 26853376.0,
+ "step": 1639
+ },
+ {
+ "entropy": 1.2610400915145874,
+ "epoch": 3.313131313131313,
+ "grad_norm": 2.354304790496826,
+ "learning_rate": 1.688888888888889e-06,
+ "loss": 1.2615927457809448,
+ "mean_token_accuracy": 0.6805691123008728,
+ "num_tokens": 26869760.0,
+ "step": 1640
+ },
+ {
+ "entropy": 0.9232268333435059,
+ "epoch": 3.315151515151515,
+ "grad_norm": 2.2459871768951416,
+ "learning_rate": 1.6868686868686871e-06,
+ "loss": 0.9295459985733032,
+ "mean_token_accuracy": 0.7508549094200134,
+ "num_tokens": 26886144.0,
+ "step": 1641
+ },
+ {
+ "entropy": 1.3030803203582764,
+ "epoch": 3.317171717171717,
+ "grad_norm": 2.086177110671997,
+ "learning_rate": 1.684848484848485e-06,
+ "loss": 1.3260836601257324,
+ "mean_token_accuracy": 0.6850268840789795,
+ "num_tokens": 26902528.0,
+ "step": 1642
+ },
+ {
+ "entropy": 1.0115952491760254,
+ "epoch": 3.319191919191919,
+ "grad_norm": 2.3342647552490234,
+ "learning_rate": 1.682828282828283e-06,
+ "loss": 1.0125452280044556,
+ "mean_token_accuracy": 0.7252076268196106,
+ "num_tokens": 26918912.0,
+ "step": 1643
+ },
+ {
+ "entropy": 0.9997871518135071,
+ "epoch": 3.3212121212121213,
+ "grad_norm": 2.0844249725341797,
+ "learning_rate": 1.680808080808081e-06,
+ "loss": 1.0233726501464844,
+ "mean_token_accuracy": 0.7490839958190918,
+ "num_tokens": 26935296.0,
+ "step": 1644
+ },
+ {
+ "entropy": 1.3131269216537476,
+ "epoch": 3.323232323232323,
+ "grad_norm": 2.279741048812866,
+ "learning_rate": 1.678787878787879e-06,
+ "loss": 1.3082493543624878,
+ "mean_token_accuracy": 0.6856985688209534,
+ "num_tokens": 26951680.0,
+ "step": 1645
+ },
+ {
+ "entropy": 1.5594273805618286,
+ "epoch": 3.3252525252525253,
+ "grad_norm": 2.423882246017456,
+ "learning_rate": 1.6767676767676768e-06,
+ "loss": 1.5775840282440186,
+ "mean_token_accuracy": 0.662493884563446,
+ "num_tokens": 26968064.0,
+ "step": 1646
+ },
+ {
+ "entropy": 1.2298411130905151,
+ "epoch": 3.327272727272727,
+ "grad_norm": 2.237107515335083,
+ "learning_rate": 1.674747474747475e-06,
+ "loss": 1.1941357851028442,
+ "mean_token_accuracy": 0.7106130719184875,
+ "num_tokens": 26984448.0,
+ "step": 1647
+ },
+ {
+ "entropy": 0.986072301864624,
+ "epoch": 3.3292929292929294,
+ "grad_norm": 2.2843995094299316,
+ "learning_rate": 1.6727272727272728e-06,
+ "loss": 0.9964872598648071,
+ "mean_token_accuracy": 0.7433438897132874,
+ "num_tokens": 27000832.0,
+ "step": 1648
+ },
+ {
+ "entropy": 1.2612992525100708,
+ "epoch": 3.3313131313131312,
+ "grad_norm": 2.2401392459869385,
+ "learning_rate": 1.6707070707070707e-06,
+ "loss": 1.2401535511016846,
+ "mean_token_accuracy": 0.6914997696876526,
+ "num_tokens": 27017216.0,
+ "step": 1649
+ },
+ {
+ "entropy": 0.8876240849494934,
+ "epoch": 3.3333333333333335,
+ "grad_norm": 2.055438995361328,
+ "learning_rate": 1.6686868686868688e-06,
+ "loss": 0.8796688914299011,
+ "mean_token_accuracy": 0.7739985585212708,
+ "num_tokens": 27033600.0,
+ "step": 1650
+ },
+ {
+ "epoch": 3.3333333333333335,
+ "eval_entropy": 1.3213856729768938,
+ "eval_loss": 1.5484445095062256,
+ "eval_mean_token_accuracy": 0.6446653873689713,
+ "eval_num_tokens": 27033600.0,
+ "eval_runtime": 43.7594,
+ "eval_samples_per_second": 22.624,
+ "eval_steps_per_second": 2.834,
+ "step": 1650
+ },
+ {
+ "entropy": 1.8024967908859253,
+ "epoch": 3.3353535353535353,
+ "grad_norm": 2.316970109939575,
+ "learning_rate": 1.6666666666666667e-06,
+ "loss": 1.8035298585891724,
+ "mean_token_accuracy": 0.6057034730911255,
+ "num_tokens": 27049984.0,
+ "step": 1651
+ },
+ {
+ "entropy": 0.8543419241905212,
+ "epoch": 3.3373737373737375,
+ "grad_norm": 2.2566277980804443,
+ "learning_rate": 1.6646464646464648e-06,
+ "loss": 0.8558261394500732,
+ "mean_token_accuracy": 0.7656326293945312,
+ "num_tokens": 27066368.0,
+ "step": 1652
+ },
+ {
+ "entropy": 1.3101993799209595,
+ "epoch": 3.3393939393939394,
+ "grad_norm": 2.490753650665283,
+ "learning_rate": 1.6626262626262626e-06,
+ "loss": 1.326491355895996,
+ "mean_token_accuracy": 0.6656082272529602,
+ "num_tokens": 27082752.0,
+ "step": 1653
+ },
+ {
+ "entropy": 1.226317048072815,
+ "epoch": 3.341414141414141,
+ "grad_norm": 2.438649892807007,
+ "learning_rate": 1.6606060606060605e-06,
+ "loss": 1.2096238136291504,
+ "mean_token_accuracy": 0.6954079270362854,
+ "num_tokens": 27099136.0,
+ "step": 1654
+ },
+ {
+ "entropy": 1.1575508117675781,
+ "epoch": 3.3434343434343434,
+ "grad_norm": 2.130772113800049,
+ "learning_rate": 1.6585858585858588e-06,
+ "loss": 1.1718693971633911,
+ "mean_token_accuracy": 0.7256350517272949,
+ "num_tokens": 27115520.0,
+ "step": 1655
+ },
+ {
+ "entropy": 1.4135949611663818,
+ "epoch": 3.3454545454545457,
+ "grad_norm": 2.3037710189819336,
+ "learning_rate": 1.6565656565656567e-06,
+ "loss": 1.408097505569458,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 27131904.0,
+ "step": 1656
+ },
+ {
+ "entropy": 0.977189838886261,
+ "epoch": 3.3474747474747475,
+ "grad_norm": 2.3096542358398438,
+ "learning_rate": 1.6545454545454548e-06,
+ "loss": 0.9848534464836121,
+ "mean_token_accuracy": 0.7306423783302307,
+ "num_tokens": 27148288.0,
+ "step": 1657
+ },
+ {
+ "entropy": 1.6641992330551147,
+ "epoch": 3.3494949494949493,
+ "grad_norm": 2.2562549114227295,
+ "learning_rate": 1.6525252525252527e-06,
+ "loss": 1.6742463111877441,
+ "mean_token_accuracy": 0.6157181262969971,
+ "num_tokens": 27164672.0,
+ "step": 1658
+ },
+ {
+ "entropy": 1.2698633670806885,
+ "epoch": 3.3515151515151516,
+ "grad_norm": 2.426100492477417,
+ "learning_rate": 1.6505050505050508e-06,
+ "loss": 1.2856690883636475,
+ "mean_token_accuracy": 0.6808133721351624,
+ "num_tokens": 27181056.0,
+ "step": 1659
+ },
+ {
+ "entropy": 1.4621158838272095,
+ "epoch": 3.3535353535353534,
+ "grad_norm": 2.3147833347320557,
+ "learning_rate": 1.6484848484848487e-06,
+ "loss": 1.468501091003418,
+ "mean_token_accuracy": 0.6610283255577087,
+ "num_tokens": 27197440.0,
+ "step": 1660
+ },
+ {
+ "entropy": 1.249279499053955,
+ "epoch": 3.3555555555555556,
+ "grad_norm": 2.237351894378662,
+ "learning_rate": 1.6464646464646466e-06,
+ "loss": 1.2397043704986572,
+ "mean_token_accuracy": 0.6951636672019958,
+ "num_tokens": 27213824.0,
+ "step": 1661
+ },
+ {
+ "entropy": 0.9608144164085388,
+ "epoch": 3.3575757575757574,
+ "grad_norm": 2.2147974967956543,
+ "learning_rate": 1.6444444444444447e-06,
+ "loss": 0.9720965623855591,
+ "mean_token_accuracy": 0.7529922127723694,
+ "num_tokens": 27230208.0,
+ "step": 1662
+ },
+ {
+ "entropy": 1.5832558870315552,
+ "epoch": 3.3595959595959597,
+ "grad_norm": 2.325833559036255,
+ "learning_rate": 1.6424242424242426e-06,
+ "loss": 1.5746217966079712,
+ "mean_token_accuracy": 0.6457010507583618,
+ "num_tokens": 27246592.0,
+ "step": 1663
+ },
+ {
+ "entropy": 1.35304856300354,
+ "epoch": 3.3616161616161615,
+ "grad_norm": 2.509624481201172,
+ "learning_rate": 1.6404040404040405e-06,
+ "loss": 1.3489930629730225,
+ "mean_token_accuracy": 0.6699438095092773,
+ "num_tokens": 27262976.0,
+ "step": 1664
+ },
+ {
+ "entropy": 1.3161576986312866,
+ "epoch": 3.3636363636363638,
+ "grad_norm": 2.393994092941284,
+ "learning_rate": 1.6383838383838386e-06,
+ "loss": 1.303264856338501,
+ "mean_token_accuracy": 0.6855764389038086,
+ "num_tokens": 27279360.0,
+ "step": 1665
+ },
+ {
+ "entropy": 1.1878900527954102,
+ "epoch": 3.3656565656565656,
+ "grad_norm": 2.180389165878296,
+ "learning_rate": 1.6363636363636365e-06,
+ "loss": 1.182593584060669,
+ "mean_token_accuracy": 0.7091475129127502,
+ "num_tokens": 27295744.0,
+ "step": 1666
+ },
+ {
+ "entropy": 1.3966656923294067,
+ "epoch": 3.367676767676768,
+ "grad_norm": 2.097033739089966,
+ "learning_rate": 1.6343434343434344e-06,
+ "loss": 1.3977530002593994,
+ "mean_token_accuracy": 0.6893014311790466,
+ "num_tokens": 27312128.0,
+ "step": 1667
+ },
+ {
+ "entropy": 1.298252820968628,
+ "epoch": 3.3696969696969696,
+ "grad_norm": 2.301867723464966,
+ "learning_rate": 1.6323232323232325e-06,
+ "loss": 1.2884492874145508,
+ "mean_token_accuracy": 0.6819125413894653,
+ "num_tokens": 27328512.0,
+ "step": 1668
+ },
+ {
+ "entropy": 1.0709348917007446,
+ "epoch": 3.371717171717172,
+ "grad_norm": 2.323345422744751,
+ "learning_rate": 1.6303030303030303e-06,
+ "loss": 1.0587565898895264,
+ "mean_token_accuracy": 0.7345505356788635,
+ "num_tokens": 27344896.0,
+ "step": 1669
+ },
+ {
+ "entropy": 1.4100518226623535,
+ "epoch": 3.3737373737373737,
+ "grad_norm": 2.3652331829071045,
+ "learning_rate": 1.6282828282828284e-06,
+ "loss": 1.4043725728988647,
+ "mean_token_accuracy": 0.670615553855896,
+ "num_tokens": 27361280.0,
+ "step": 1670
+ },
+ {
+ "entropy": 1.3682993650436401,
+ "epoch": 3.375757575757576,
+ "grad_norm": 2.4122917652130127,
+ "learning_rate": 1.6262626262626263e-06,
+ "loss": 1.3637261390686035,
+ "mean_token_accuracy": 0.665730357170105,
+ "num_tokens": 27377664.0,
+ "step": 1671
+ },
+ {
+ "entropy": 1.1528232097625732,
+ "epoch": 3.3777777777777778,
+ "grad_norm": 2.1029880046844482,
+ "learning_rate": 1.6242424242424242e-06,
+ "loss": 1.1693168878555298,
+ "mean_token_accuracy": 0.7155593633651733,
+ "num_tokens": 27394048.0,
+ "step": 1672
+ },
+ {
+ "entropy": 1.0737035274505615,
+ "epoch": 3.3797979797979796,
+ "grad_norm": 2.0809051990509033,
+ "learning_rate": 1.6222222222222223e-06,
+ "loss": 1.0787606239318848,
+ "mean_token_accuracy": 0.7236199378967285,
+ "num_tokens": 27410432.0,
+ "step": 1673
+ },
+ {
+ "entropy": 0.992008626461029,
+ "epoch": 3.381818181818182,
+ "grad_norm": 2.216033935546875,
+ "learning_rate": 1.6202020202020202e-06,
+ "loss": 0.9949617385864258,
+ "mean_token_accuracy": 0.7416340708732605,
+ "num_tokens": 27426816.0,
+ "step": 1674
+ },
+ {
+ "entropy": 1.3799123764038086,
+ "epoch": 3.3838383838383836,
+ "grad_norm": 2.218331813812256,
+ "learning_rate": 1.618181818181818e-06,
+ "loss": 1.400660514831543,
+ "mean_token_accuracy": 0.6707376837730408,
+ "num_tokens": 27443200.0,
+ "step": 1675
+ },
+ {
+ "entropy": 1.125901222229004,
+ "epoch": 3.385858585858586,
+ "grad_norm": 2.1194028854370117,
+ "learning_rate": 1.6161616161616164e-06,
+ "loss": 1.128243088722229,
+ "mean_token_accuracy": 0.7427332401275635,
+ "num_tokens": 27459584.0,
+ "step": 1676
+ },
+ {
+ "entropy": 1.347123384475708,
+ "epoch": 3.3878787878787877,
+ "grad_norm": 2.3231191635131836,
+ "learning_rate": 1.6141414141414145e-06,
+ "loss": 1.3301351070404053,
+ "mean_token_accuracy": 0.6792256832122803,
+ "num_tokens": 27475968.0,
+ "step": 1677
+ },
+ {
+ "entropy": 1.3429654836654663,
+ "epoch": 3.38989898989899,
+ "grad_norm": 2.3116424083709717,
+ "learning_rate": 1.6121212121212124e-06,
+ "loss": 1.3509732484817505,
+ "mean_token_accuracy": 0.6730581521987915,
+ "num_tokens": 27492352.0,
+ "step": 1678
+ },
+ {
+ "entropy": 1.0976272821426392,
+ "epoch": 3.391919191919192,
+ "grad_norm": 2.2770488262176514,
+ "learning_rate": 1.6101010101010103e-06,
+ "loss": 1.0915334224700928,
+ "mean_token_accuracy": 0.72826087474823,
+ "num_tokens": 27508736.0,
+ "step": 1679
+ },
+ {
+ "entropy": 1.6415719985961914,
+ "epoch": 3.393939393939394,
+ "grad_norm": 2.224179267883301,
+ "learning_rate": 1.6080808080808084e-06,
+ "loss": 1.6517691612243652,
+ "mean_token_accuracy": 0.6277479529380798,
+ "num_tokens": 27525120.0,
+ "step": 1680
+ },
+ {
+ "entropy": 1.2124820947647095,
+ "epoch": 3.395959595959596,
+ "grad_norm": 2.1096651554107666,
+ "learning_rate": 1.6060606060606063e-06,
+ "loss": 1.230252981185913,
+ "mean_token_accuracy": 0.7074987888336182,
+ "num_tokens": 27541504.0,
+ "step": 1681
+ },
+ {
+ "entropy": 1.4807898998260498,
+ "epoch": 3.397979797979798,
+ "grad_norm": 2.1753411293029785,
+ "learning_rate": 1.6040404040404042e-06,
+ "loss": 1.4894174337387085,
+ "mean_token_accuracy": 0.6585246920585632,
+ "num_tokens": 27557888.0,
+ "step": 1682
+ },
+ {
+ "entropy": 1.31308913230896,
+ "epoch": 3.4,
+ "grad_norm": 2.251997947692871,
+ "learning_rate": 1.6020202020202023e-06,
+ "loss": 1.3479615449905396,
+ "mean_token_accuracy": 0.6800805926322937,
+ "num_tokens": 27574272.0,
+ "step": 1683
+ },
+ {
+ "entropy": 1.1820056438446045,
+ "epoch": 3.402020202020202,
+ "grad_norm": 2.074507474899292,
+ "learning_rate": 1.6000000000000001e-06,
+ "loss": 1.1995149850845337,
+ "mean_token_accuracy": 0.7117733359336853,
+ "num_tokens": 27590656.0,
+ "step": 1684
+ },
+ {
+ "entropy": 1.2405987977981567,
+ "epoch": 3.404040404040404,
+ "grad_norm": 1.9572449922561646,
+ "learning_rate": 1.597979797979798e-06,
+ "loss": 1.228973627090454,
+ "mean_token_accuracy": 0.7143990993499756,
+ "num_tokens": 27607040.0,
+ "step": 1685
+ },
+ {
+ "entropy": 1.3054970502853394,
+ "epoch": 3.4060606060606062,
+ "grad_norm": 2.174598217010498,
+ "learning_rate": 1.5959595959595961e-06,
+ "loss": 1.2918202877044678,
+ "mean_token_accuracy": 0.7015754580497742,
+ "num_tokens": 27623424.0,
+ "step": 1686
+ },
+ {
+ "entropy": 1.2568256855010986,
+ "epoch": 3.408080808080808,
+ "grad_norm": 2.1647098064422607,
+ "learning_rate": 1.593939393939394e-06,
+ "loss": 1.2464665174484253,
+ "mean_token_accuracy": 0.7046898007392883,
+ "num_tokens": 27639808.0,
+ "step": 1687
+ },
+ {
+ "entropy": 0.9985859990119934,
+ "epoch": 3.41010101010101,
+ "grad_norm": 2.230548143386841,
+ "learning_rate": 1.5919191919191921e-06,
+ "loss": 0.9941741824150085,
+ "mean_token_accuracy": 0.7424889802932739,
+ "num_tokens": 27656192.0,
+ "step": 1688
+ },
+ {
+ "entropy": 1.2002249956130981,
+ "epoch": 3.412121212121212,
+ "grad_norm": 2.211632490158081,
+ "learning_rate": 1.58989898989899e-06,
+ "loss": 1.1901870965957642,
+ "mean_token_accuracy": 0.7168416976928711,
+ "num_tokens": 27672576.0,
+ "step": 1689
+ },
+ {
+ "entropy": 1.5074162483215332,
+ "epoch": 3.4141414141414144,
+ "grad_norm": 2.3280093669891357,
+ "learning_rate": 1.5878787878787879e-06,
+ "loss": 1.5252172946929932,
+ "mean_token_accuracy": 0.6465559601783752,
+ "num_tokens": 27688960.0,
+ "step": 1690
+ },
+ {
+ "entropy": 1.1828655004501343,
+ "epoch": 3.416161616161616,
+ "grad_norm": 2.3439552783966064,
+ "learning_rate": 1.585858585858586e-06,
+ "loss": 1.196863055229187,
+ "mean_token_accuracy": 0.7009037733078003,
+ "num_tokens": 27705344.0,
+ "step": 1691
+ },
+ {
+ "entropy": 1.176308035850525,
+ "epoch": 3.418181818181818,
+ "grad_norm": 2.460371255874634,
+ "learning_rate": 1.5838383838383839e-06,
+ "loss": 1.1818437576293945,
+ "mean_token_accuracy": 0.6998656392097473,
+ "num_tokens": 27721728.0,
+ "step": 1692
+ },
+ {
+ "entropy": 1.1989773511886597,
+ "epoch": 3.4202020202020202,
+ "grad_norm": 2.406575918197632,
+ "learning_rate": 1.5818181818181818e-06,
+ "loss": 1.2158204317092896,
+ "mean_token_accuracy": 0.6949194073677063,
+ "num_tokens": 27738112.0,
+ "step": 1693
+ },
+ {
+ "entropy": 1.537143588066101,
+ "epoch": 3.422222222222222,
+ "grad_norm": 2.298275947570801,
+ "learning_rate": 1.5797979797979799e-06,
+ "loss": 1.5335557460784912,
+ "mean_token_accuracy": 0.6571812629699707,
+ "num_tokens": 27754496.0,
+ "step": 1694
+ },
+ {
+ "entropy": 1.3271749019622803,
+ "epoch": 3.4242424242424243,
+ "grad_norm": 2.309699058532715,
+ "learning_rate": 1.5777777777777778e-06,
+ "loss": 1.3499958515167236,
+ "mean_token_accuracy": 0.6943087577819824,
+ "num_tokens": 27770880.0,
+ "step": 1695
+ },
+ {
+ "entropy": 1.4381791353225708,
+ "epoch": 3.426262626262626,
+ "grad_norm": 2.2183644771575928,
+ "learning_rate": 1.5757575757575759e-06,
+ "loss": 1.4350523948669434,
+ "mean_token_accuracy": 0.6568148732185364,
+ "num_tokens": 27787264.0,
+ "step": 1696
+ },
+ {
+ "entropy": 0.9867562055587769,
+ "epoch": 3.4282828282828284,
+ "grad_norm": 2.13663387298584,
+ "learning_rate": 1.5737373737373737e-06,
+ "loss": 0.9871019124984741,
+ "mean_token_accuracy": 0.7538471221923828,
+ "num_tokens": 27803648.0,
+ "step": 1697
+ },
+ {
+ "entropy": 1.0085591077804565,
+ "epoch": 3.43030303030303,
+ "grad_norm": 2.3447134494781494,
+ "learning_rate": 1.571717171717172e-06,
+ "loss": 1.0313187837600708,
+ "mean_token_accuracy": 0.7325354218482971,
+ "num_tokens": 27820032.0,
+ "step": 1698
+ },
+ {
+ "entropy": 0.9242914915084839,
+ "epoch": 3.4323232323232324,
+ "grad_norm": 2.16290545463562,
+ "learning_rate": 1.56969696969697e-06,
+ "loss": 0.9127025604248047,
+ "mean_token_accuracy": 0.7653273344039917,
+ "num_tokens": 27836416.0,
+ "step": 1699
+ },
+ {
+ "entropy": 1.4173065423965454,
+ "epoch": 3.4343434343434343,
+ "grad_norm": 2.192754030227661,
+ "learning_rate": 1.5676767676767678e-06,
+ "loss": 1.4122503995895386,
+ "mean_token_accuracy": 0.6770884394645691,
+ "num_tokens": 27852800.0,
+ "step": 1700
+ },
+ {
+ "epoch": 3.4343434343434343,
+ "eval_entropy": 1.3203289614569755,
+ "eval_loss": 1.5483064651489258,
+ "eval_mean_token_accuracy": 0.6447958845284677,
+ "eval_num_tokens": 27852800.0,
+ "eval_runtime": 43.7896,
+ "eval_samples_per_second": 22.608,
+ "eval_steps_per_second": 2.832,
+ "step": 1700
+ },
+ {
+ "entropy": 1.4677248001098633,
+ "epoch": 3.4363636363636365,
+ "grad_norm": 2.07183575630188,
+ "learning_rate": 1.565656565656566e-06,
+ "loss": 1.4772744178771973,
+ "mean_token_accuracy": 0.6927821040153503,
+ "num_tokens": 27869184.0,
+ "step": 1701
+ },
+ {
+ "entropy": 1.845194935798645,
+ "epoch": 3.4383838383838383,
+ "grad_norm": 1.9974539279937744,
+ "learning_rate": 1.5636363636363638e-06,
+ "loss": 1.8598425388336182,
+ "mean_token_accuracy": 0.5933683514595032,
+ "num_tokens": 27885568.0,
+ "step": 1702
+ },
+ {
+ "entropy": 1.1044740676879883,
+ "epoch": 3.4404040404040406,
+ "grad_norm": 2.199014186859131,
+ "learning_rate": 1.5616161616161617e-06,
+ "loss": 1.119746446609497,
+ "mean_token_accuracy": 0.7175744771957397,
+ "num_tokens": 27901952.0,
+ "step": 1703
+ },
+ {
+ "entropy": 0.920816957950592,
+ "epoch": 3.4424242424242424,
+ "grad_norm": 2.3172857761383057,
+ "learning_rate": 1.5595959595959598e-06,
+ "loss": 0.908664882183075,
+ "mean_token_accuracy": 0.7598314881324768,
+ "num_tokens": 27918336.0,
+ "step": 1704
+ },
+ {
+ "entropy": 1.4610254764556885,
+ "epoch": 3.4444444444444446,
+ "grad_norm": 2.5196661949157715,
+ "learning_rate": 1.5575757575757577e-06,
+ "loss": 1.4767801761627197,
+ "mean_token_accuracy": 0.652662456035614,
+ "num_tokens": 27934720.0,
+ "step": 1705
+ },
+ {
+ "entropy": 1.0131516456604004,
+ "epoch": 3.4464646464646465,
+ "grad_norm": 2.2522189617156982,
+ "learning_rate": 1.5555555555555558e-06,
+ "loss": 1.0143696069717407,
+ "mean_token_accuracy": 0.7348558902740479,
+ "num_tokens": 27951104.0,
+ "step": 1706
+ },
+ {
+ "entropy": 1.2054252624511719,
+ "epoch": 3.4484848484848483,
+ "grad_norm": 2.1769580841064453,
+ "learning_rate": 1.5535353535353537e-06,
+ "loss": 1.2020167112350464,
+ "mean_token_accuracy": 0.7076209187507629,
+ "num_tokens": 27967488.0,
+ "step": 1707
+ },
+ {
+ "entropy": 1.1004403829574585,
+ "epoch": 3.4505050505050505,
+ "grad_norm": 2.3803768157958984,
+ "learning_rate": 1.5515151515151516e-06,
+ "loss": 1.1220088005065918,
+ "mean_token_accuracy": 0.712506115436554,
+ "num_tokens": 27983872.0,
+ "step": 1708
+ },
+ {
+ "entropy": 1.423991322517395,
+ "epoch": 3.4525252525252528,
+ "grad_norm": 2.2648093700408936,
+ "learning_rate": 1.5494949494949497e-06,
+ "loss": 1.432944893836975,
+ "mean_token_accuracy": 0.6545554399490356,
+ "num_tokens": 28000256.0,
+ "step": 1709
+ },
+ {
+ "entropy": 1.5308680534362793,
+ "epoch": 3.4545454545454546,
+ "grad_norm": 2.1772451400756836,
+ "learning_rate": 1.5474747474747476e-06,
+ "loss": 1.5395504236221313,
+ "mean_token_accuracy": 0.6433805823326111,
+ "num_tokens": 28016640.0,
+ "step": 1710
+ },
+ {
+ "entropy": 1.3868193626403809,
+ "epoch": 3.4565656565656564,
+ "grad_norm": 2.1782312393188477,
+ "learning_rate": 1.5454545454545454e-06,
+ "loss": 1.3730117082595825,
+ "mean_token_accuracy": 0.6857596635818481,
+ "num_tokens": 28033024.0,
+ "step": 1711
+ },
+ {
+ "entropy": 0.6769964694976807,
+ "epoch": 3.4585858585858587,
+ "grad_norm": 1.941037654876709,
+ "learning_rate": 1.5434343434343435e-06,
+ "loss": 0.6863309144973755,
+ "mean_token_accuracy": 0.8126526474952698,
+ "num_tokens": 28049408.0,
+ "step": 1712
+ },
+ {
+ "entropy": 1.1113249063491821,
+ "epoch": 3.4606060606060605,
+ "grad_norm": 2.0039165019989014,
+ "learning_rate": 1.5414141414141414e-06,
+ "loss": 1.1056404113769531,
+ "mean_token_accuracy": 0.7314362525939941,
+ "num_tokens": 28065792.0,
+ "step": 1713
+ },
+ {
+ "entropy": 0.8827037811279297,
+ "epoch": 3.4626262626262627,
+ "grad_norm": 2.2235255241394043,
+ "learning_rate": 1.5393939393939395e-06,
+ "loss": 0.8903871178627014,
+ "mean_token_accuracy": 0.7547020316123962,
+ "num_tokens": 28082176.0,
+ "step": 1714
+ },
+ {
+ "entropy": 1.2060964107513428,
+ "epoch": 3.4646464646464645,
+ "grad_norm": 2.2997398376464844,
+ "learning_rate": 1.5373737373737374e-06,
+ "loss": 1.2247741222381592,
+ "mean_token_accuracy": 0.6979726552963257,
+ "num_tokens": 28098560.0,
+ "step": 1715
+ },
+ {
+ "entropy": 1.2543354034423828,
+ "epoch": 3.466666666666667,
+ "grad_norm": 2.2603039741516113,
+ "learning_rate": 1.5353535353535353e-06,
+ "loss": 1.2638390064239502,
+ "mean_token_accuracy": 0.6919271945953369,
+ "num_tokens": 28114944.0,
+ "step": 1716
+ },
+ {
+ "entropy": 1.4569451808929443,
+ "epoch": 3.4686868686868686,
+ "grad_norm": 2.3623344898223877,
+ "learning_rate": 1.5333333333333334e-06,
+ "loss": 1.4669182300567627,
+ "mean_token_accuracy": 0.6596238613128662,
+ "num_tokens": 28131328.0,
+ "step": 1717
+ },
+ {
+ "entropy": 1.0979474782943726,
+ "epoch": 3.470707070707071,
+ "grad_norm": 2.282487154006958,
+ "learning_rate": 1.5313131313131313e-06,
+ "loss": 1.123124361038208,
+ "mean_token_accuracy": 0.7218490242958069,
+ "num_tokens": 28147712.0,
+ "step": 1718
+ },
+ {
+ "entropy": 1.3850172758102417,
+ "epoch": 3.4727272727272727,
+ "grad_norm": 2.406338930130005,
+ "learning_rate": 1.5292929292929296e-06,
+ "loss": 1.361925482749939,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 28164096.0,
+ "step": 1719
+ },
+ {
+ "entropy": 1.3522284030914307,
+ "epoch": 3.474747474747475,
+ "grad_norm": 2.171316385269165,
+ "learning_rate": 1.5272727272727275e-06,
+ "loss": 1.3782949447631836,
+ "mean_token_accuracy": 0.6841108798980713,
+ "num_tokens": 28180480.0,
+ "step": 1720
+ },
+ {
+ "entropy": 1.4793171882629395,
+ "epoch": 3.4767676767676767,
+ "grad_norm": 2.29586124420166,
+ "learning_rate": 1.5252525252525254e-06,
+ "loss": 1.4899311065673828,
+ "mean_token_accuracy": 0.6422203183174133,
+ "num_tokens": 28196864.0,
+ "step": 1721
+ },
+ {
+ "entropy": 1.0572689771652222,
+ "epoch": 3.4787878787878785,
+ "grad_norm": 2.0798633098602295,
+ "learning_rate": 1.5232323232323235e-06,
+ "loss": 1.0417135953903198,
+ "mean_token_accuracy": 0.7372373938560486,
+ "num_tokens": 28213248.0,
+ "step": 1722
+ },
+ {
+ "entropy": 1.0050398111343384,
+ "epoch": 3.480808080808081,
+ "grad_norm": 2.205551862716675,
+ "learning_rate": 1.5212121212121214e-06,
+ "loss": 1.0072510242462158,
+ "mean_token_accuracy": 0.7414509057998657,
+ "num_tokens": 28229632.0,
+ "step": 1723
+ },
+ {
+ "entropy": 0.9438449144363403,
+ "epoch": 3.482828282828283,
+ "grad_norm": 2.177335262298584,
+ "learning_rate": 1.5191919191919195e-06,
+ "loss": 0.9125795364379883,
+ "mean_token_accuracy": 0.7605642676353455,
+ "num_tokens": 28246016.0,
+ "step": 1724
+ },
+ {
+ "entropy": 0.8600634336471558,
+ "epoch": 3.484848484848485,
+ "grad_norm": 2.286794662475586,
+ "learning_rate": 1.5171717171717174e-06,
+ "loss": 0.8473736047744751,
+ "mean_token_accuracy": 0.7839521169662476,
+ "num_tokens": 28262400.0,
+ "step": 1725
+ },
+ {
+ "entropy": 1.0827349424362183,
+ "epoch": 3.4868686868686867,
+ "grad_norm": 2.176316738128662,
+ "learning_rate": 1.5151515151515152e-06,
+ "loss": 1.0760138034820557,
+ "mean_token_accuracy": 0.7195896506309509,
+ "num_tokens": 28278784.0,
+ "step": 1726
+ },
+ {
+ "entropy": 1.3604737520217896,
+ "epoch": 3.488888888888889,
+ "grad_norm": 2.3393819332122803,
+ "learning_rate": 1.5131313131313133e-06,
+ "loss": 1.3466029167175293,
+ "mean_token_accuracy": 0.6731802821159363,
+ "num_tokens": 28295168.0,
+ "step": 1727
+ },
+ {
+ "entropy": 1.4611977338790894,
+ "epoch": 3.4909090909090907,
+ "grad_norm": 2.3396732807159424,
+ "learning_rate": 1.5111111111111112e-06,
+ "loss": 1.474691390991211,
+ "mean_token_accuracy": 0.6497313380241394,
+ "num_tokens": 28311552.0,
+ "step": 1728
+ },
+ {
+ "entropy": 1.1734099388122559,
+ "epoch": 3.492929292929293,
+ "grad_norm": 2.154437780380249,
+ "learning_rate": 1.5090909090909091e-06,
+ "loss": 1.1631931066513062,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 28327936.0,
+ "step": 1729
+ },
+ {
+ "entropy": 1.0015299320220947,
+ "epoch": 3.494949494949495,
+ "grad_norm": 2.273815393447876,
+ "learning_rate": 1.5070707070707072e-06,
+ "loss": 0.9818742871284485,
+ "mean_token_accuracy": 0.7361382246017456,
+ "num_tokens": 28344320.0,
+ "step": 1730
+ },
+ {
+ "entropy": 1.0342366695404053,
+ "epoch": 3.496969696969697,
+ "grad_norm": 2.1011879444122314,
+ "learning_rate": 1.5050505050505051e-06,
+ "loss": 1.02262282371521,
+ "mean_token_accuracy": 0.7448094487190247,
+ "num_tokens": 28360704.0,
+ "step": 1731
+ },
+ {
+ "entropy": 1.6318060159683228,
+ "epoch": 3.498989898989899,
+ "grad_norm": 2.338040590286255,
+ "learning_rate": 1.5030303030303032e-06,
+ "loss": 1.6215972900390625,
+ "mean_token_accuracy": 0.6225574016571045,
+ "num_tokens": 28377088.0,
+ "step": 1732
+ },
+ {
+ "entropy": 1.2391737699508667,
+ "epoch": 3.501010101010101,
+ "grad_norm": 2.2958035469055176,
+ "learning_rate": 1.501010101010101e-06,
+ "loss": 1.2481398582458496,
+ "mean_token_accuracy": 0.6922325491905212,
+ "num_tokens": 28393472.0,
+ "step": 1733
+ },
+ {
+ "entropy": 1.09321129322052,
+ "epoch": 3.503030303030303,
+ "grad_norm": 2.117506980895996,
+ "learning_rate": 1.498989898989899e-06,
+ "loss": 1.100616455078125,
+ "mean_token_accuracy": 0.7240473628044128,
+ "num_tokens": 28409856.0,
+ "step": 1734
+ },
+ {
+ "entropy": 1.2746680974960327,
+ "epoch": 3.505050505050505,
+ "grad_norm": 2.2428109645843506,
+ "learning_rate": 1.496969696969697e-06,
+ "loss": 1.278875470161438,
+ "mean_token_accuracy": 0.688629686832428,
+ "num_tokens": 28426240.0,
+ "step": 1735
+ },
+ {
+ "entropy": 0.9300931096076965,
+ "epoch": 3.507070707070707,
+ "grad_norm": 2.0250492095947266,
+ "learning_rate": 1.494949494949495e-06,
+ "loss": 0.9304848909378052,
+ "mean_token_accuracy": 0.7613580822944641,
+ "num_tokens": 28442624.0,
+ "step": 1736
+ },
+ {
+ "entropy": 1.5743480920791626,
+ "epoch": 3.509090909090909,
+ "grad_norm": 2.251974582672119,
+ "learning_rate": 1.4929292929292929e-06,
+ "loss": 1.570695400238037,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 28459008.0,
+ "step": 1737
+ },
+ {
+ "entropy": 1.0316240787506104,
+ "epoch": 3.511111111111111,
+ "grad_norm": 2.187208652496338,
+ "learning_rate": 1.490909090909091e-06,
+ "loss": 1.022985816001892,
+ "mean_token_accuracy": 0.7444430589675903,
+ "num_tokens": 28475392.0,
+ "step": 1738
+ },
+ {
+ "entropy": 1.0719387531280518,
+ "epoch": 3.5131313131313133,
+ "grad_norm": 2.1497936248779297,
+ "learning_rate": 1.4888888888888888e-06,
+ "loss": 1.087444543838501,
+ "mean_token_accuracy": 0.7261846661567688,
+ "num_tokens": 28491776.0,
+ "step": 1739
+ },
+ {
+ "entropy": 1.679359793663025,
+ "epoch": 3.515151515151515,
+ "grad_norm": 2.2430360317230225,
+ "learning_rate": 1.4868686868686872e-06,
+ "loss": 1.6981315612792969,
+ "mean_token_accuracy": 0.6258549094200134,
+ "num_tokens": 28508160.0,
+ "step": 1740
+ },
+ {
+ "entropy": 1.0614526271820068,
+ "epoch": 3.517171717171717,
+ "grad_norm": 2.220466375350952,
+ "learning_rate": 1.484848484848485e-06,
+ "loss": 1.0519301891326904,
+ "mean_token_accuracy": 0.7313751578330994,
+ "num_tokens": 28524544.0,
+ "step": 1741
+ },
+ {
+ "entropy": 1.267195224761963,
+ "epoch": 3.519191919191919,
+ "grad_norm": 1.9448764324188232,
+ "learning_rate": 1.4828282828282831e-06,
+ "loss": 1.2594044208526611,
+ "mean_token_accuracy": 0.7093917727470398,
+ "num_tokens": 28540928.0,
+ "step": 1742
+ },
+ {
+ "entropy": 1.0900983810424805,
+ "epoch": 3.5212121212121215,
+ "grad_norm": 2.292336940765381,
+ "learning_rate": 1.480808080808081e-06,
+ "loss": 1.0952692031860352,
+ "mean_token_accuracy": 0.7146433591842651,
+ "num_tokens": 28557312.0,
+ "step": 1743
+ },
+ {
+ "entropy": 1.4188793897628784,
+ "epoch": 3.5232323232323233,
+ "grad_norm": 2.355440139770508,
+ "learning_rate": 1.478787878787879e-06,
+ "loss": 1.4508819580078125,
+ "mean_token_accuracy": 0.6642037034034729,
+ "num_tokens": 28573696.0,
+ "step": 1744
+ },
+ {
+ "entropy": 1.52566397190094,
+ "epoch": 3.525252525252525,
+ "grad_norm": 2.2767279148101807,
+ "learning_rate": 1.476767676767677e-06,
+ "loss": 1.5568758249282837,
+ "mean_token_accuracy": 0.6472276449203491,
+ "num_tokens": 28590080.0,
+ "step": 1745
+ },
+ {
+ "entropy": 1.4695135354995728,
+ "epoch": 3.5272727272727273,
+ "grad_norm": 2.3080222606658936,
+ "learning_rate": 1.474747474747475e-06,
+ "loss": 1.4671947956085205,
+ "mean_token_accuracy": 0.6530898809432983,
+ "num_tokens": 28606464.0,
+ "step": 1746
+ },
+ {
+ "entropy": 1.438908338546753,
+ "epoch": 3.529292929292929,
+ "grad_norm": 2.485170364379883,
+ "learning_rate": 1.4727272727272728e-06,
+ "loss": 1.4531956911087036,
+ "mean_token_accuracy": 0.6664020419120789,
+ "num_tokens": 28622848.0,
+ "step": 1747
+ },
+ {
+ "entropy": 1.5307536125183105,
+ "epoch": 3.5313131313131314,
+ "grad_norm": 2.3280844688415527,
+ "learning_rate": 1.470707070707071e-06,
+ "loss": 1.5298030376434326,
+ "mean_token_accuracy": 0.642892062664032,
+ "num_tokens": 28639232.0,
+ "step": 1748
+ },
+ {
+ "entropy": 1.429180383682251,
+ "epoch": 3.533333333333333,
+ "grad_norm": 2.36387038230896,
+ "learning_rate": 1.4686868686868688e-06,
+ "loss": 1.4191480875015259,
+ "mean_token_accuracy": 0.6469833850860596,
+ "num_tokens": 28655616.0,
+ "step": 1749
+ },
+ {
+ "entropy": 0.9336722493171692,
+ "epoch": 3.5353535353535355,
+ "grad_norm": 2.1873295307159424,
+ "learning_rate": 1.4666666666666669e-06,
+ "loss": 0.9257663488388062,
+ "mean_token_accuracy": 0.7629457712173462,
+ "num_tokens": 28672000.0,
+ "step": 1750
+ },
+ {
+ "epoch": 3.5353535353535355,
+ "eval_entropy": 1.3185442157330052,
+ "eval_loss": 1.548416018486023,
+ "eval_mean_token_accuracy": 0.6448259276728476,
+ "eval_num_tokens": 28672000.0,
+ "eval_runtime": 43.8376,
+ "eval_samples_per_second": 22.583,
+ "eval_steps_per_second": 2.829,
+ "step": 1750
+ },
+ {
+ "entropy": 1.2647572755813599,
+ "epoch": 3.5373737373737373,
+ "grad_norm": 2.1273581981658936,
+ "learning_rate": 1.4646464646464648e-06,
+ "loss": 1.2557384967803955,
+ "mean_token_accuracy": 0.6935759782791138,
+ "num_tokens": 28688384.0,
+ "step": 1751
+ },
+ {
+ "entropy": 1.4252692461013794,
+ "epoch": 3.5393939393939395,
+ "grad_norm": 2.052034616470337,
+ "learning_rate": 1.4626262626262627e-06,
+ "loss": 1.43434739112854,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 28704768.0,
+ "step": 1752
+ },
+ {
+ "entropy": 1.6918041706085205,
+ "epoch": 3.5414141414141413,
+ "grad_norm": 2.20965313911438,
+ "learning_rate": 1.4606060606060608e-06,
+ "loss": 1.707175850868225,
+ "mean_token_accuracy": 0.6127870082855225,
+ "num_tokens": 28721152.0,
+ "step": 1753
+ },
+ {
+ "entropy": 1.5122125148773193,
+ "epoch": 3.5434343434343436,
+ "grad_norm": 2.2061564922332764,
+ "learning_rate": 1.4585858585858586e-06,
+ "loss": 1.5119690895080566,
+ "mean_token_accuracy": 0.6488153338432312,
+ "num_tokens": 28737536.0,
+ "step": 1754
+ },
+ {
+ "entropy": 0.9536482095718384,
+ "epoch": 3.5454545454545454,
+ "grad_norm": 2.310809373855591,
+ "learning_rate": 1.4565656565656565e-06,
+ "loss": 0.9411349296569824,
+ "mean_token_accuracy": 0.7589765787124634,
+ "num_tokens": 28753920.0,
+ "step": 1755
+ },
+ {
+ "entropy": 1.5147753953933716,
+ "epoch": 3.5474747474747472,
+ "grad_norm": 2.520862340927124,
+ "learning_rate": 1.4545454545454546e-06,
+ "loss": 1.5047588348388672,
+ "mean_token_accuracy": 0.639167070388794,
+ "num_tokens": 28770304.0,
+ "step": 1756
+ },
+ {
+ "entropy": 1.3881752490997314,
+ "epoch": 3.5494949494949495,
+ "grad_norm": 2.3421478271484375,
+ "learning_rate": 1.4525252525252525e-06,
+ "loss": 1.3775359392166138,
+ "mean_token_accuracy": 0.6719589829444885,
+ "num_tokens": 28786688.0,
+ "step": 1757
+ },
+ {
+ "entropy": 1.0432544946670532,
+ "epoch": 3.5515151515151517,
+ "grad_norm": 2.235539674758911,
+ "learning_rate": 1.4505050505050506e-06,
+ "loss": 1.055377721786499,
+ "mean_token_accuracy": 0.7360160946846008,
+ "num_tokens": 28803072.0,
+ "step": 1758
+ },
+ {
+ "entropy": 1.2739083766937256,
+ "epoch": 3.5535353535353535,
+ "grad_norm": 2.295605421066284,
+ "learning_rate": 1.4484848484848485e-06,
+ "loss": 1.289074420928955,
+ "mean_token_accuracy": 0.6969345211982727,
+ "num_tokens": 28819456.0,
+ "step": 1759
+ },
+ {
+ "entropy": 1.192219853401184,
+ "epoch": 3.5555555555555554,
+ "grad_norm": 2.1039023399353027,
+ "learning_rate": 1.4464646464646464e-06,
+ "loss": 1.2043861150741577,
+ "mean_token_accuracy": 0.7080483436584473,
+ "num_tokens": 28835840.0,
+ "step": 1760
+ },
+ {
+ "entropy": 1.002448320388794,
+ "epoch": 3.5575757575757576,
+ "grad_norm": 2.476088523864746,
+ "learning_rate": 1.4444444444444445e-06,
+ "loss": 1.0271326303482056,
+ "mean_token_accuracy": 0.7325354218482971,
+ "num_tokens": 28852224.0,
+ "step": 1761
+ },
+ {
+ "entropy": 1.4694463014602661,
+ "epoch": 3.55959595959596,
+ "grad_norm": 2.298769235610962,
+ "learning_rate": 1.4424242424242426e-06,
+ "loss": 1.4576467275619507,
+ "mean_token_accuracy": 0.6591353416442871,
+ "num_tokens": 28868608.0,
+ "step": 1762
+ },
+ {
+ "entropy": 1.4025219678878784,
+ "epoch": 3.5616161616161617,
+ "grad_norm": 2.148528575897217,
+ "learning_rate": 1.4404040404040407e-06,
+ "loss": 1.3884464502334595,
+ "mean_token_accuracy": 0.6655471324920654,
+ "num_tokens": 28884992.0,
+ "step": 1763
+ },
+ {
+ "entropy": 1.2829358577728271,
+ "epoch": 3.5636363636363635,
+ "grad_norm": 2.1344001293182373,
+ "learning_rate": 1.4383838383838386e-06,
+ "loss": 1.3100465536117554,
+ "mean_token_accuracy": 0.6872862577438354,
+ "num_tokens": 28901376.0,
+ "step": 1764
+ },
+ {
+ "entropy": 1.2500309944152832,
+ "epoch": 3.5656565656565657,
+ "grad_norm": 2.1933422088623047,
+ "learning_rate": 1.4363636363636365e-06,
+ "loss": 1.2566546201705933,
+ "mean_token_accuracy": 0.7057889699935913,
+ "num_tokens": 28917760.0,
+ "step": 1765
+ },
+ {
+ "entropy": 1.4471250772476196,
+ "epoch": 3.5676767676767676,
+ "grad_norm": 2.2238707542419434,
+ "learning_rate": 1.4343434343434346e-06,
+ "loss": 1.4434895515441895,
+ "mean_token_accuracy": 0.6715925931930542,
+ "num_tokens": 28934144.0,
+ "step": 1766
+ },
+ {
+ "entropy": 1.2484838962554932,
+ "epoch": 3.56969696969697,
+ "grad_norm": 2.272259473800659,
+ "learning_rate": 1.4323232323232325e-06,
+ "loss": 1.2546260356903076,
+ "mean_token_accuracy": 0.6996824741363525,
+ "num_tokens": 28950528.0,
+ "step": 1767
+ },
+ {
+ "entropy": 1.326412558555603,
+ "epoch": 3.5717171717171716,
+ "grad_norm": 2.157593250274658,
+ "learning_rate": 1.4303030303030306e-06,
+ "loss": 1.3175407648086548,
+ "mean_token_accuracy": 0.7037127614021301,
+ "num_tokens": 28966912.0,
+ "step": 1768
+ },
+ {
+ "entropy": 1.314650297164917,
+ "epoch": 3.573737373737374,
+ "grad_norm": 2.146393299102783,
+ "learning_rate": 1.4282828282828284e-06,
+ "loss": 1.3232550621032715,
+ "mean_token_accuracy": 0.6864924430847168,
+ "num_tokens": 28983296.0,
+ "step": 1769
+ },
+ {
+ "entropy": 1.2547006607055664,
+ "epoch": 3.5757575757575757,
+ "grad_norm": 2.2809762954711914,
+ "learning_rate": 1.4262626262626263e-06,
+ "loss": 1.2578558921813965,
+ "mean_token_accuracy": 0.689667820930481,
+ "num_tokens": 28999680.0,
+ "step": 1770
+ },
+ {
+ "entropy": 1.1902955770492554,
+ "epoch": 3.5777777777777775,
+ "grad_norm": 2.5193467140197754,
+ "learning_rate": 1.4242424242424244e-06,
+ "loss": 1.1852655410766602,
+ "mean_token_accuracy": 0.699499249458313,
+ "num_tokens": 29016064.0,
+ "step": 1771
+ },
+ {
+ "entropy": 1.075490951538086,
+ "epoch": 3.5797979797979798,
+ "grad_norm": 2.055223226547241,
+ "learning_rate": 1.4222222222222223e-06,
+ "loss": 1.09010648727417,
+ "mean_token_accuracy": 0.7302759885787964,
+ "num_tokens": 29032448.0,
+ "step": 1772
+ },
+ {
+ "entropy": 1.1549168825149536,
+ "epoch": 3.581818181818182,
+ "grad_norm": 2.1802778244018555,
+ "learning_rate": 1.4202020202020202e-06,
+ "loss": 1.1465229988098145,
+ "mean_token_accuracy": 0.7187957763671875,
+ "num_tokens": 29048832.0,
+ "step": 1773
+ },
+ {
+ "entropy": 1.0966418981552124,
+ "epoch": 3.583838383838384,
+ "grad_norm": 2.354775905609131,
+ "learning_rate": 1.4181818181818183e-06,
+ "loss": 1.0915825366973877,
+ "mean_token_accuracy": 0.7263067960739136,
+ "num_tokens": 29065216.0,
+ "step": 1774
+ },
+ {
+ "entropy": 1.3264915943145752,
+ "epoch": 3.5858585858585856,
+ "grad_norm": 2.291811943054199,
+ "learning_rate": 1.4161616161616162e-06,
+ "loss": 1.3168433904647827,
+ "mean_token_accuracy": 0.6811797618865967,
+ "num_tokens": 29081600.0,
+ "step": 1775
+ },
+ {
+ "entropy": 1.4051839113235474,
+ "epoch": 3.587878787878788,
+ "grad_norm": 2.4314849376678467,
+ "learning_rate": 1.4141414141414143e-06,
+ "loss": 1.4150385856628418,
+ "mean_token_accuracy": 0.6616389751434326,
+ "num_tokens": 29097984.0,
+ "step": 1776
+ },
+ {
+ "entropy": 1.045767903327942,
+ "epoch": 3.58989898989899,
+ "grad_norm": 2.361785650253296,
+ "learning_rate": 1.4121212121212122e-06,
+ "loss": 1.0414667129516602,
+ "mean_token_accuracy": 0.726062536239624,
+ "num_tokens": 29114368.0,
+ "step": 1777
+ },
+ {
+ "entropy": 1.0930231809616089,
+ "epoch": 3.591919191919192,
+ "grad_norm": 2.2943761348724365,
+ "learning_rate": 1.41010101010101e-06,
+ "loss": 1.116988182067871,
+ "mean_token_accuracy": 0.7142159342765808,
+ "num_tokens": 29130752.0,
+ "step": 1778
+ },
+ {
+ "entropy": 2.053565502166748,
+ "epoch": 3.5939393939393938,
+ "grad_norm": 2.274879217147827,
+ "learning_rate": 1.4080808080808082e-06,
+ "loss": 2.012974262237549,
+ "mean_token_accuracy": 0.5475085377693176,
+ "num_tokens": 29147136.0,
+ "step": 1779
+ },
+ {
+ "entropy": 1.666791319847107,
+ "epoch": 3.595959595959596,
+ "grad_norm": 2.3387227058410645,
+ "learning_rate": 1.406060606060606e-06,
+ "loss": 1.6848305463790894,
+ "mean_token_accuracy": 0.6218246221542358,
+ "num_tokens": 29163520.0,
+ "step": 1780
+ },
+ {
+ "entropy": 1.2312790155410767,
+ "epoch": 3.597979797979798,
+ "grad_norm": 2.1445071697235107,
+ "learning_rate": 1.404040404040404e-06,
+ "loss": 1.2197356224060059,
+ "mean_token_accuracy": 0.7146433591842651,
+ "num_tokens": 29179904.0,
+ "step": 1781
+ },
+ {
+ "entropy": 1.2540696859359741,
+ "epoch": 3.6,
+ "grad_norm": 2.3021488189697266,
+ "learning_rate": 1.402020202020202e-06,
+ "loss": 1.2441315650939941,
+ "mean_token_accuracy": 0.697239875793457,
+ "num_tokens": 29196288.0,
+ "step": 1782
+ },
+ {
+ "entropy": 1.3095312118530273,
+ "epoch": 3.602020202020202,
+ "grad_norm": 2.3379111289978027,
+ "learning_rate": 1.4000000000000001e-06,
+ "loss": 1.299248218536377,
+ "mean_token_accuracy": 0.6789814233779907,
+ "num_tokens": 29212672.0,
+ "step": 1783
+ },
+ {
+ "entropy": 1.0785331726074219,
+ "epoch": 3.604040404040404,
+ "grad_norm": 2.1612391471862793,
+ "learning_rate": 1.3979797979797982e-06,
+ "loss": 1.0741904973983765,
+ "mean_token_accuracy": 0.7294821739196777,
+ "num_tokens": 29229056.0,
+ "step": 1784
+ },
+ {
+ "entropy": 1.5178064107894897,
+ "epoch": 3.606060606060606,
+ "grad_norm": 2.7717669010162354,
+ "learning_rate": 1.3959595959595961e-06,
+ "loss": 1.4960123300552368,
+ "mean_token_accuracy": 0.6555935740470886,
+ "num_tokens": 29245440.0,
+ "step": 1785
+ },
+ {
+ "entropy": 0.9794894456863403,
+ "epoch": 3.608080808080808,
+ "grad_norm": 2.128119707107544,
+ "learning_rate": 1.3939393939393942e-06,
+ "loss": 0.964859664440155,
+ "mean_token_accuracy": 0.7516487836837769,
+ "num_tokens": 29261824.0,
+ "step": 1786
+ },
+ {
+ "entropy": 1.1770693063735962,
+ "epoch": 3.61010101010101,
+ "grad_norm": 2.2583603858947754,
+ "learning_rate": 1.3919191919191921e-06,
+ "loss": 1.163985252380371,
+ "mean_token_accuracy": 0.7167806625366211,
+ "num_tokens": 29278208.0,
+ "step": 1787
+ },
+ {
+ "entropy": 1.2855029106140137,
+ "epoch": 3.6121212121212123,
+ "grad_norm": 2.1924304962158203,
+ "learning_rate": 1.38989898989899e-06,
+ "loss": 1.3204423189163208,
+ "mean_token_accuracy": 0.6933927536010742,
+ "num_tokens": 29294592.0,
+ "step": 1788
+ },
+ {
+ "entropy": 1.1483845710754395,
+ "epoch": 3.614141414141414,
+ "grad_norm": 2.414332151412964,
+ "learning_rate": 1.3878787878787881e-06,
+ "loss": 1.154718041419983,
+ "mean_token_accuracy": 0.6999267339706421,
+ "num_tokens": 29310976.0,
+ "step": 1789
+ },
+ {
+ "entropy": 1.3682032823562622,
+ "epoch": 3.616161616161616,
+ "grad_norm": 2.2198476791381836,
+ "learning_rate": 1.385858585858586e-06,
+ "loss": 1.3729476928710938,
+ "mean_token_accuracy": 0.6736077070236206,
+ "num_tokens": 29327360.0,
+ "step": 1790
+ },
+ {
+ "entropy": 1.0998579263687134,
+ "epoch": 3.618181818181818,
+ "grad_norm": 2.328645706176758,
+ "learning_rate": 1.3838383838383839e-06,
+ "loss": 1.0919283628463745,
+ "mean_token_accuracy": 0.7213605046272278,
+ "num_tokens": 29343744.0,
+ "step": 1791
+ },
+ {
+ "entropy": 1.4821339845657349,
+ "epoch": 3.6202020202020204,
+ "grad_norm": 2.346853256225586,
+ "learning_rate": 1.381818181818182e-06,
+ "loss": 1.4857574701309204,
+ "mean_token_accuracy": 0.6529677510261536,
+ "num_tokens": 29360128.0,
+ "step": 1792
+ },
+ {
+ "entropy": 1.2080271244049072,
+ "epoch": 3.6222222222222222,
+ "grad_norm": 2.4182422161102295,
+ "learning_rate": 1.3797979797979799e-06,
+ "loss": 1.2055883407592773,
+ "mean_token_accuracy": 0.7100635170936584,
+ "num_tokens": 29376512.0,
+ "step": 1793
+ },
+ {
+ "entropy": 1.2058414220809937,
+ "epoch": 3.624242424242424,
+ "grad_norm": 2.216625690460205,
+ "learning_rate": 1.377777777777778e-06,
+ "loss": 1.2196989059448242,
+ "mean_token_accuracy": 0.7110405564308167,
+ "num_tokens": 29392896.0,
+ "step": 1794
+ },
+ {
+ "entropy": 1.2888880968093872,
+ "epoch": 3.6262626262626263,
+ "grad_norm": 2.339319944381714,
+ "learning_rate": 1.3757575757575759e-06,
+ "loss": 1.277637004852295,
+ "mean_token_accuracy": 0.6922935843467712,
+ "num_tokens": 29409280.0,
+ "step": 1795
+ },
+ {
+ "entropy": 1.3091189861297607,
+ "epoch": 3.6282828282828286,
+ "grad_norm": 2.2296347618103027,
+ "learning_rate": 1.3737373737373738e-06,
+ "loss": 1.3214037418365479,
+ "mean_token_accuracy": 0.6828285455703735,
+ "num_tokens": 29425664.0,
+ "step": 1796
+ },
+ {
+ "entropy": 1.3359358310699463,
+ "epoch": 3.6303030303030304,
+ "grad_norm": 2.3027234077453613,
+ "learning_rate": 1.3717171717171718e-06,
+ "loss": 1.3537523746490479,
+ "mean_token_accuracy": 0.6944919228553772,
+ "num_tokens": 29442048.0,
+ "step": 1797
+ },
+ {
+ "entropy": 1.4622148275375366,
+ "epoch": 3.632323232323232,
+ "grad_norm": 2.2217557430267334,
+ "learning_rate": 1.3696969696969697e-06,
+ "loss": 1.4778163433074951,
+ "mean_token_accuracy": 0.6425867080688477,
+ "num_tokens": 29458432.0,
+ "step": 1798
+ },
+ {
+ "entropy": 1.1139435768127441,
+ "epoch": 3.6343434343434344,
+ "grad_norm": 2.1497981548309326,
+ "learning_rate": 1.3676767676767676e-06,
+ "loss": 1.1079224348068237,
+ "mean_token_accuracy": 0.7202613353729248,
+ "num_tokens": 29474816.0,
+ "step": 1799
+ },
+ {
+ "entropy": 1.4551507234573364,
+ "epoch": 3.6363636363636362,
+ "grad_norm": 2.138988971710205,
+ "learning_rate": 1.3656565656565657e-06,
+ "loss": 1.469781517982483,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 29491200.0,
+ "step": 1800
+ },
+ {
+ "epoch": 3.6363636363636362,
+ "eval_entropy": 1.3177791665638647,
+ "eval_loss": 1.5487139225006104,
+ "eval_mean_token_accuracy": 0.6448490720602774,
+ "eval_num_tokens": 29491200.0,
+ "eval_runtime": 43.82,
+ "eval_samples_per_second": 22.592,
+ "eval_steps_per_second": 2.83,
+ "step": 1800
+ },
+ {
+ "entropy": 1.3909705877304077,
+ "epoch": 3.6383838383838385,
+ "grad_norm": 2.2257578372955322,
+ "learning_rate": 1.3636363636363636e-06,
+ "loss": 1.4063682556152344,
+ "mean_token_accuracy": 0.6611504554748535,
+ "num_tokens": 29507584.0,
+ "step": 1801
+ },
+ {
+ "entropy": 1.2972772121429443,
+ "epoch": 3.6404040404040403,
+ "grad_norm": 2.3228883743286133,
+ "learning_rate": 1.3616161616161617e-06,
+ "loss": 1.2978641986846924,
+ "mean_token_accuracy": 0.6862481832504272,
+ "num_tokens": 29523968.0,
+ "step": 1802
+ },
+ {
+ "entropy": 0.8828009366989136,
+ "epoch": 3.6424242424242426,
+ "grad_norm": 2.294520616531372,
+ "learning_rate": 1.3595959595959596e-06,
+ "loss": 0.8818602561950684,
+ "mean_token_accuracy": 0.7627626061439514,
+ "num_tokens": 29540352.0,
+ "step": 1803
+ },
+ {
+ "entropy": 1.3855260610580444,
+ "epoch": 3.6444444444444444,
+ "grad_norm": 2.160240411758423,
+ "learning_rate": 1.357575757575758e-06,
+ "loss": 1.3808461427688599,
+ "mean_token_accuracy": 0.6831949353218079,
+ "num_tokens": 29556736.0,
+ "step": 1804
+ },
+ {
+ "entropy": 1.1665101051330566,
+ "epoch": 3.6464646464646466,
+ "grad_norm": 2.3000075817108154,
+ "learning_rate": 1.3555555555555558e-06,
+ "loss": 1.1676980257034302,
+ "mean_token_accuracy": 0.7067049145698547,
+ "num_tokens": 29573120.0,
+ "step": 1805
+ },
+ {
+ "entropy": 1.05939519405365,
+ "epoch": 3.6484848484848484,
+ "grad_norm": 2.204202651977539,
+ "learning_rate": 1.3535353535353537e-06,
+ "loss": 1.0654125213623047,
+ "mean_token_accuracy": 0.7197728157043457,
+ "num_tokens": 29589504.0,
+ "step": 1806
+ },
+ {
+ "entropy": 1.355467677116394,
+ "epoch": 3.6505050505050507,
+ "grad_norm": 2.264705181121826,
+ "learning_rate": 1.3515151515151518e-06,
+ "loss": 1.3571414947509766,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 29605888.0,
+ "step": 1807
+ },
+ {
+ "entropy": 1.1876951456069946,
+ "epoch": 3.6525252525252525,
+ "grad_norm": 2.2944509983062744,
+ "learning_rate": 1.3494949494949497e-06,
+ "loss": 1.1937611103057861,
+ "mean_token_accuracy": 0.7105520367622375,
+ "num_tokens": 29622272.0,
+ "step": 1808
+ },
+ {
+ "entropy": 1.410723090171814,
+ "epoch": 3.6545454545454543,
+ "grad_norm": 2.329960584640503,
+ "learning_rate": 1.3474747474747476e-06,
+ "loss": 1.4132624864578247,
+ "mean_token_accuracy": 0.656448483467102,
+ "num_tokens": 29638656.0,
+ "step": 1809
+ },
+ {
+ "entropy": 1.018915057182312,
+ "epoch": 3.6565656565656566,
+ "grad_norm": 2.1073148250579834,
+ "learning_rate": 1.3454545454545457e-06,
+ "loss": 1.017066478729248,
+ "mean_token_accuracy": 0.7398021221160889,
+ "num_tokens": 29655040.0,
+ "step": 1810
+ },
+ {
+ "entropy": 1.385291337966919,
+ "epoch": 3.658585858585859,
+ "grad_norm": 2.4099128246307373,
+ "learning_rate": 1.3434343434343436e-06,
+ "loss": 1.3809027671813965,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 29671424.0,
+ "step": 1811
+ },
+ {
+ "entropy": 1.0589433908462524,
+ "epoch": 3.6606060606060606,
+ "grad_norm": 2.3987228870391846,
+ "learning_rate": 1.3414141414141417e-06,
+ "loss": 1.051498293876648,
+ "mean_token_accuracy": 0.7296043038368225,
+ "num_tokens": 29687808.0,
+ "step": 1812
+ },
+ {
+ "entropy": 1.0399458408355713,
+ "epoch": 3.6626262626262625,
+ "grad_norm": 1.9951106309890747,
+ "learning_rate": 1.3393939393939395e-06,
+ "loss": 1.0482317209243774,
+ "mean_token_accuracy": 0.745175838470459,
+ "num_tokens": 29704192.0,
+ "step": 1813
+ },
+ {
+ "entropy": 1.3024410009384155,
+ "epoch": 3.6646464646464647,
+ "grad_norm": 2.1363778114318848,
+ "learning_rate": 1.3373737373737374e-06,
+ "loss": 1.2995185852050781,
+ "mean_token_accuracy": 0.6889960765838623,
+ "num_tokens": 29720576.0,
+ "step": 1814
+ },
+ {
+ "entropy": 1.604906678199768,
+ "epoch": 3.6666666666666665,
+ "grad_norm": 2.2837791442871094,
+ "learning_rate": 1.3353535353535355e-06,
+ "loss": 1.6025669574737549,
+ "mean_token_accuracy": 0.6281143426895142,
+ "num_tokens": 29736960.0,
+ "step": 1815
+ },
+ {
+ "entropy": 1.0479960441589355,
+ "epoch": 3.6686868686868688,
+ "grad_norm": 2.200199842453003,
+ "learning_rate": 1.3333333333333334e-06,
+ "loss": 1.0443310737609863,
+ "mean_token_accuracy": 0.7302149534225464,
+ "num_tokens": 29753344.0,
+ "step": 1816
+ },
+ {
+ "entropy": 1.1220474243164062,
+ "epoch": 3.6707070707070706,
+ "grad_norm": 2.278193712234497,
+ "learning_rate": 1.3313131313131313e-06,
+ "loss": 1.1253700256347656,
+ "mean_token_accuracy": 0.717391312122345,
+ "num_tokens": 29769728.0,
+ "step": 1817
+ },
+ {
+ "entropy": 0.7910162210464478,
+ "epoch": 3.672727272727273,
+ "grad_norm": 2.171074151992798,
+ "learning_rate": 1.3292929292929294e-06,
+ "loss": 0.7818440198898315,
+ "mean_token_accuracy": 0.7832193374633789,
+ "num_tokens": 29786112.0,
+ "step": 1818
+ },
+ {
+ "entropy": 1.2416874170303345,
+ "epoch": 3.6747474747474747,
+ "grad_norm": 2.41068959236145,
+ "learning_rate": 1.3272727272727273e-06,
+ "loss": 1.2441900968551636,
+ "mean_token_accuracy": 0.6918050646781921,
+ "num_tokens": 29802496.0,
+ "step": 1819
+ },
+ {
+ "entropy": 1.1947519779205322,
+ "epoch": 3.676767676767677,
+ "grad_norm": 2.3515799045562744,
+ "learning_rate": 1.3252525252525254e-06,
+ "loss": 1.1756401062011719,
+ "mean_token_accuracy": 0.7001098990440369,
+ "num_tokens": 29818880.0,
+ "step": 1820
+ },
+ {
+ "entropy": 1.0655851364135742,
+ "epoch": 3.6787878787878787,
+ "grad_norm": 2.3352251052856445,
+ "learning_rate": 1.3232323232323233e-06,
+ "loss": 1.0540491342544556,
+ "mean_token_accuracy": 0.7285051345825195,
+ "num_tokens": 29835264.0,
+ "step": 1821
+ },
+ {
+ "entropy": 1.1881550550460815,
+ "epoch": 3.680808080808081,
+ "grad_norm": 2.483917474746704,
+ "learning_rate": 1.3212121212121212e-06,
+ "loss": 1.199643611907959,
+ "mean_token_accuracy": 0.6998046040534973,
+ "num_tokens": 29851648.0,
+ "step": 1822
+ },
+ {
+ "entropy": 1.2031608819961548,
+ "epoch": 3.682828282828283,
+ "grad_norm": 2.1765546798706055,
+ "learning_rate": 1.3191919191919193e-06,
+ "loss": 1.2054451704025269,
+ "mean_token_accuracy": 0.7191011309623718,
+ "num_tokens": 29868032.0,
+ "step": 1823
+ },
+ {
+ "entropy": 0.8889259099960327,
+ "epoch": 3.6848484848484846,
+ "grad_norm": 2.3284575939178467,
+ "learning_rate": 1.3171717171717172e-06,
+ "loss": 0.8793114423751831,
+ "mean_token_accuracy": 0.7661211490631104,
+ "num_tokens": 29884416.0,
+ "step": 1824
+ },
+ {
+ "entropy": 1.1559280157089233,
+ "epoch": 3.686868686868687,
+ "grad_norm": 2.2942442893981934,
+ "learning_rate": 1.315151515151515e-06,
+ "loss": 1.1748852729797363,
+ "mean_token_accuracy": 0.7139105796813965,
+ "num_tokens": 29900800.0,
+ "step": 1825
+ },
+ {
+ "entropy": 1.1315678358078003,
+ "epoch": 3.688888888888889,
+ "grad_norm": 2.0435519218444824,
+ "learning_rate": 1.3131313131313134e-06,
+ "loss": 1.123443603515625,
+ "mean_token_accuracy": 0.7311308979988098,
+ "num_tokens": 29917184.0,
+ "step": 1826
+ },
+ {
+ "entropy": 1.063825249671936,
+ "epoch": 3.690909090909091,
+ "grad_norm": 2.3425393104553223,
+ "learning_rate": 1.3111111111111112e-06,
+ "loss": 1.0752053260803223,
+ "mean_token_accuracy": 0.7281997799873352,
+ "num_tokens": 29933568.0,
+ "step": 1827
+ },
+ {
+ "entropy": 0.9652242660522461,
+ "epoch": 3.6929292929292927,
+ "grad_norm": 2.2079033851623535,
+ "learning_rate": 1.3090909090909093e-06,
+ "loss": 0.969928503036499,
+ "mean_token_accuracy": 0.7507938742637634,
+ "num_tokens": 29949952.0,
+ "step": 1828
+ },
+ {
+ "entropy": 1.4131009578704834,
+ "epoch": 3.694949494949495,
+ "grad_norm": 2.368713617324829,
+ "learning_rate": 1.3070707070707072e-06,
+ "loss": 1.4113342761993408,
+ "mean_token_accuracy": 0.6670737862586975,
+ "num_tokens": 29966336.0,
+ "step": 1829
+ },
+ {
+ "entropy": 1.4447262287139893,
+ "epoch": 3.6969696969696972,
+ "grad_norm": 2.142131805419922,
+ "learning_rate": 1.3050505050505053e-06,
+ "loss": 1.4544841051101685,
+ "mean_token_accuracy": 0.669516384601593,
+ "num_tokens": 29982720.0,
+ "step": 1830
+ },
+ {
+ "entropy": 1.2524710893630981,
+ "epoch": 3.698989898989899,
+ "grad_norm": 2.096489429473877,
+ "learning_rate": 1.3030303030303032e-06,
+ "loss": 1.2251232862472534,
+ "mean_token_accuracy": 0.7231924533843994,
+ "num_tokens": 29999104.0,
+ "step": 1831
+ },
+ {
+ "entropy": 1.2173584699630737,
+ "epoch": 3.701010101010101,
+ "grad_norm": 2.265334367752075,
+ "learning_rate": 1.301010101010101e-06,
+ "loss": 1.2278194427490234,
+ "mean_token_accuracy": 0.7136052846908569,
+ "num_tokens": 30015488.0,
+ "step": 1832
+ },
+ {
+ "entropy": 1.1699647903442383,
+ "epoch": 3.703030303030303,
+ "grad_norm": 2.274156093597412,
+ "learning_rate": 1.2989898989898992e-06,
+ "loss": 1.1550461053848267,
+ "mean_token_accuracy": 0.7139716744422913,
+ "num_tokens": 30031872.0,
+ "step": 1833
+ },
+ {
+ "entropy": 1.113942265510559,
+ "epoch": 3.705050505050505,
+ "grad_norm": 2.386925220489502,
+ "learning_rate": 1.296969696969697e-06,
+ "loss": 1.1161434650421143,
+ "mean_token_accuracy": 0.7212994694709778,
+ "num_tokens": 30048256.0,
+ "step": 1834
+ },
+ {
+ "entropy": 1.4958065748214722,
+ "epoch": 3.707070707070707,
+ "grad_norm": 2.2243921756744385,
+ "learning_rate": 1.294949494949495e-06,
+ "loss": 1.4940879344940186,
+ "mean_token_accuracy": 0.6489985585212708,
+ "num_tokens": 30064640.0,
+ "step": 1835
+ },
+ {
+ "entropy": 1.047438144683838,
+ "epoch": 3.709090909090909,
+ "grad_norm": 2.237632989883423,
+ "learning_rate": 1.292929292929293e-06,
+ "loss": 1.0492076873779297,
+ "mean_token_accuracy": 0.7387640476226807,
+ "num_tokens": 30081024.0,
+ "step": 1836
+ },
+ {
+ "entropy": 1.4816311597824097,
+ "epoch": 3.7111111111111112,
+ "grad_norm": 2.2184505462646484,
+ "learning_rate": 1.290909090909091e-06,
+ "loss": 1.483510971069336,
+ "mean_token_accuracy": 0.660906195640564,
+ "num_tokens": 30097408.0,
+ "step": 1837
+ },
+ {
+ "entropy": 1.1734580993652344,
+ "epoch": 3.713131313131313,
+ "grad_norm": 2.284940242767334,
+ "learning_rate": 1.288888888888889e-06,
+ "loss": 1.1763725280761719,
+ "mean_token_accuracy": 0.708109438419342,
+ "num_tokens": 30113792.0,
+ "step": 1838
+ },
+ {
+ "entropy": 1.1073024272918701,
+ "epoch": 3.7151515151515153,
+ "grad_norm": 2.381448268890381,
+ "learning_rate": 1.286868686868687e-06,
+ "loss": 1.1168363094329834,
+ "mean_token_accuracy": 0.722337543964386,
+ "num_tokens": 30130176.0,
+ "step": 1839
+ },
+ {
+ "entropy": 1.2699110507965088,
+ "epoch": 3.717171717171717,
+ "grad_norm": 2.23447585105896,
+ "learning_rate": 1.2848484848484848e-06,
+ "loss": 1.2582776546478271,
+ "mean_token_accuracy": 0.6878358721733093,
+ "num_tokens": 30146560.0,
+ "step": 1840
+ },
+ {
+ "entropy": 1.421061635017395,
+ "epoch": 3.7191919191919194,
+ "grad_norm": 2.1020593643188477,
+ "learning_rate": 1.282828282828283e-06,
+ "loss": 1.415670394897461,
+ "mean_token_accuracy": 0.6722032427787781,
+ "num_tokens": 30162944.0,
+ "step": 1841
+ },
+ {
+ "entropy": 0.8924360871315002,
+ "epoch": 3.721212121212121,
+ "grad_norm": 2.1613609790802,
+ "learning_rate": 1.2808080808080808e-06,
+ "loss": 0.8864036202430725,
+ "mean_token_accuracy": 0.7616023421287537,
+ "num_tokens": 30179328.0,
+ "step": 1842
+ },
+ {
+ "entropy": 1.2242110967636108,
+ "epoch": 3.723232323232323,
+ "grad_norm": 2.472944498062134,
+ "learning_rate": 1.2787878787878787e-06,
+ "loss": 1.227367877960205,
+ "mean_token_accuracy": 0.6939423680305481,
+ "num_tokens": 30195712.0,
+ "step": 1843
+ },
+ {
+ "entropy": 1.2816494703292847,
+ "epoch": 3.7252525252525253,
+ "grad_norm": 2.123680353164673,
+ "learning_rate": 1.2767676767676768e-06,
+ "loss": 1.2535889148712158,
+ "mean_token_accuracy": 0.6894845962524414,
+ "num_tokens": 30212096.0,
+ "step": 1844
+ },
+ {
+ "entropy": 1.0055866241455078,
+ "epoch": 3.7272727272727275,
+ "grad_norm": 2.2397797107696533,
+ "learning_rate": 1.2747474747474747e-06,
+ "loss": 1.0046356916427612,
+ "mean_token_accuracy": 0.7375427484512329,
+ "num_tokens": 30228480.0,
+ "step": 1845
+ },
+ {
+ "entropy": 0.9162007570266724,
+ "epoch": 3.7292929292929293,
+ "grad_norm": 2.2464940547943115,
+ "learning_rate": 1.2727272727272728e-06,
+ "loss": 0.9192468523979187,
+ "mean_token_accuracy": 0.7609306573867798,
+ "num_tokens": 30244864.0,
+ "step": 1846
+ },
+ {
+ "entropy": 1.3691668510437012,
+ "epoch": 3.731313131313131,
+ "grad_norm": 2.766839027404785,
+ "learning_rate": 1.270707070707071e-06,
+ "loss": 1.3715851306915283,
+ "mean_token_accuracy": 0.6667684316635132,
+ "num_tokens": 30261248.0,
+ "step": 1847
+ },
+ {
+ "entropy": 1.140328049659729,
+ "epoch": 3.7333333333333334,
+ "grad_norm": 2.1093955039978027,
+ "learning_rate": 1.268686868686869e-06,
+ "loss": 1.1491321325302124,
+ "mean_token_accuracy": 0.7158646583557129,
+ "num_tokens": 30277632.0,
+ "step": 1848
+ },
+ {
+ "entropy": 1.3393927812576294,
+ "epoch": 3.735353535353535,
+ "grad_norm": 2.216357469558716,
+ "learning_rate": 1.2666666666666669e-06,
+ "loss": 1.3406658172607422,
+ "mean_token_accuracy": 0.6829506754875183,
+ "num_tokens": 30294016.0,
+ "step": 1849
+ },
+ {
+ "entropy": 1.0507596731185913,
+ "epoch": 3.7373737373737375,
+ "grad_norm": 2.287649154663086,
+ "learning_rate": 1.2646464646464648e-06,
+ "loss": 1.0469536781311035,
+ "mean_token_accuracy": 0.7306423783302307,
+ "num_tokens": 30310400.0,
+ "step": 1850
+ },
+ {
+ "epoch": 3.7373737373737375,
+ "eval_entropy": 1.3188492747083786,
+ "eval_loss": 1.5484505891799927,
+ "eval_mean_token_accuracy": 0.6448682820604693,
+ "eval_num_tokens": 30310400.0,
+ "eval_runtime": 43.7649,
+ "eval_samples_per_second": 22.621,
+ "eval_steps_per_second": 2.833,
+ "step": 1850
+ },
+ {
+ "entropy": 1.0057004690170288,
+ "epoch": 3.7393939393939393,
+ "grad_norm": 2.1135971546173096,
+ "learning_rate": 1.2626262626262629e-06,
+ "loss": 1.0220353603363037,
+ "mean_token_accuracy": 0.7348558902740479,
+ "num_tokens": 30326784.0,
+ "step": 1851
+ },
+ {
+ "entropy": 1.185084581375122,
+ "epoch": 3.7414141414141415,
+ "grad_norm": 2.388561725616455,
+ "learning_rate": 1.2606060606060608e-06,
+ "loss": 1.205190658569336,
+ "mean_token_accuracy": 0.7070102691650391,
+ "num_tokens": 30343168.0,
+ "step": 1852
+ },
+ {
+ "entropy": 1.2007622718811035,
+ "epoch": 3.7434343434343433,
+ "grad_norm": 2.3002219200134277,
+ "learning_rate": 1.2585858585858587e-06,
+ "loss": 1.196336269378662,
+ "mean_token_accuracy": 0.7073155641555786,
+ "num_tokens": 30359552.0,
+ "step": 1853
+ },
+ {
+ "entropy": 0.8792212605476379,
+ "epoch": 3.7454545454545456,
+ "grad_norm": 2.1559953689575195,
+ "learning_rate": 1.2565656565656568e-06,
+ "loss": 0.8786029815673828,
+ "mean_token_accuracy": 0.7723497748374939,
+ "num_tokens": 30375936.0,
+ "step": 1854
+ },
+ {
+ "entropy": 1.0509400367736816,
+ "epoch": 3.7474747474747474,
+ "grad_norm": 2.3014485836029053,
+ "learning_rate": 1.2545454545454546e-06,
+ "loss": 1.0421940088272095,
+ "mean_token_accuracy": 0.741389811038971,
+ "num_tokens": 30392320.0,
+ "step": 1855
+ },
+ {
+ "entropy": 1.4965882301330566,
+ "epoch": 3.7494949494949497,
+ "grad_norm": 2.255364179611206,
+ "learning_rate": 1.2525252525252527e-06,
+ "loss": 1.5137383937835693,
+ "mean_token_accuracy": 0.6535173654556274,
+ "num_tokens": 30408704.0,
+ "step": 1856
+ },
+ {
+ "entropy": 1.5112299919128418,
+ "epoch": 3.7515151515151515,
+ "grad_norm": 2.356682062149048,
+ "learning_rate": 1.2505050505050506e-06,
+ "loss": 1.4965360164642334,
+ "mean_token_accuracy": 0.639167070388794,
+ "num_tokens": 30425088.0,
+ "step": 1857
+ },
+ {
+ "entropy": 0.7364286780357361,
+ "epoch": 3.7535353535353533,
+ "grad_norm": 2.0973432064056396,
+ "learning_rate": 1.2484848484848485e-06,
+ "loss": 0.7423363327980042,
+ "mean_token_accuracy": 0.7923790812492371,
+ "num_tokens": 30441472.0,
+ "step": 1858
+ },
+ {
+ "entropy": 1.094409704208374,
+ "epoch": 3.7555555555555555,
+ "grad_norm": 2.174180746078491,
+ "learning_rate": 1.2464646464646466e-06,
+ "loss": 1.0954921245574951,
+ "mean_token_accuracy": 0.7165974378585815,
+ "num_tokens": 30457856.0,
+ "step": 1859
+ },
+ {
+ "entropy": 1.1821874380111694,
+ "epoch": 3.757575757575758,
+ "grad_norm": 2.253767728805542,
+ "learning_rate": 1.2444444444444445e-06,
+ "loss": 1.1888916492462158,
+ "mean_token_accuracy": 0.7046898007392883,
+ "num_tokens": 30474240.0,
+ "step": 1860
+ },
+ {
+ "entropy": 1.1281737089157104,
+ "epoch": 3.7595959595959596,
+ "grad_norm": 2.378880023956299,
+ "learning_rate": 1.2424242424242424e-06,
+ "loss": 1.1276686191558838,
+ "mean_token_accuracy": 0.712506115436554,
+ "num_tokens": 30490624.0,
+ "step": 1861
+ },
+ {
+ "entropy": 1.1477409601211548,
+ "epoch": 3.7616161616161614,
+ "grad_norm": 2.2524328231811523,
+ "learning_rate": 1.2404040404040405e-06,
+ "loss": 1.169572114944458,
+ "mean_token_accuracy": 0.7145823240280151,
+ "num_tokens": 30507008.0,
+ "step": 1862
+ },
+ {
+ "entropy": 1.1877309083938599,
+ "epoch": 3.7636363636363637,
+ "grad_norm": 2.5215635299682617,
+ "learning_rate": 1.2383838383838386e-06,
+ "loss": 1.1812067031860352,
+ "mean_token_accuracy": 0.7001709938049316,
+ "num_tokens": 30523392.0,
+ "step": 1863
+ },
+ {
+ "entropy": 1.2082164287567139,
+ "epoch": 3.765656565656566,
+ "grad_norm": 2.248847484588623,
+ "learning_rate": 1.2363636363636365e-06,
+ "loss": 1.2150661945343018,
+ "mean_token_accuracy": 0.7056668400764465,
+ "num_tokens": 30539776.0,
+ "step": 1864
+ },
+ {
+ "entropy": 1.0533868074417114,
+ "epoch": 3.7676767676767677,
+ "grad_norm": 2.4208297729492188,
+ "learning_rate": 1.2343434343434346e-06,
+ "loss": 1.0599069595336914,
+ "mean_token_accuracy": 0.7183683514595032,
+ "num_tokens": 30556160.0,
+ "step": 1865
+ },
+ {
+ "entropy": 1.3612878322601318,
+ "epoch": 3.7696969696969695,
+ "grad_norm": 2.2831575870513916,
+ "learning_rate": 1.2323232323232325e-06,
+ "loss": 1.359129548072815,
+ "mean_token_accuracy": 0.681485116481781,
+ "num_tokens": 30572544.0,
+ "step": 1866
+ },
+ {
+ "entropy": 1.3154997825622559,
+ "epoch": 3.771717171717172,
+ "grad_norm": 2.2212936878204346,
+ "learning_rate": 1.2303030303030304e-06,
+ "loss": 1.3217754364013672,
+ "mean_token_accuracy": 0.6781265139579773,
+ "num_tokens": 30588928.0,
+ "step": 1867
+ },
+ {
+ "entropy": 1.3559744358062744,
+ "epoch": 3.7737373737373736,
+ "grad_norm": 2.317963123321533,
+ "learning_rate": 1.2282828282828285e-06,
+ "loss": 1.3600891828536987,
+ "mean_token_accuracy": 0.6749511361122131,
+ "num_tokens": 30605312.0,
+ "step": 1868
+ },
+ {
+ "entropy": 1.0591025352478027,
+ "epoch": 3.775757575757576,
+ "grad_norm": 2.2434401512145996,
+ "learning_rate": 1.2262626262626263e-06,
+ "loss": 1.069009780883789,
+ "mean_token_accuracy": 0.7206888198852539,
+ "num_tokens": 30621696.0,
+ "step": 1869
+ },
+ {
+ "entropy": 1.4170074462890625,
+ "epoch": 3.7777777777777777,
+ "grad_norm": 2.395284652709961,
+ "learning_rate": 1.2242424242424242e-06,
+ "loss": 1.4480173587799072,
+ "mean_token_accuracy": 0.6687225103378296,
+ "num_tokens": 30638080.0,
+ "step": 1870
+ },
+ {
+ "entropy": 1.2455501556396484,
+ "epoch": 3.77979797979798,
+ "grad_norm": 2.308814525604248,
+ "learning_rate": 1.2222222222222223e-06,
+ "loss": 1.238303542137146,
+ "mean_token_accuracy": 0.693514883518219,
+ "num_tokens": 30654464.0,
+ "step": 1871
+ },
+ {
+ "entropy": 1.167949914932251,
+ "epoch": 3.7818181818181817,
+ "grad_norm": 2.292120933532715,
+ "learning_rate": 1.2202020202020202e-06,
+ "loss": 1.16925847530365,
+ "mean_token_accuracy": 0.7136052846908569,
+ "num_tokens": 30670848.0,
+ "step": 1872
+ },
+ {
+ "entropy": 1.1319386959075928,
+ "epoch": 3.783838383838384,
+ "grad_norm": 2.2560858726501465,
+ "learning_rate": 1.2181818181818183e-06,
+ "loss": 1.1299757957458496,
+ "mean_token_accuracy": 0.7148265838623047,
+ "num_tokens": 30687232.0,
+ "step": 1873
+ },
+ {
+ "entropy": 1.1161472797393799,
+ "epoch": 3.785858585858586,
+ "grad_norm": 2.375944137573242,
+ "learning_rate": 1.2161616161616164e-06,
+ "loss": 1.1136269569396973,
+ "mean_token_accuracy": 0.7096971273422241,
+ "num_tokens": 30703616.0,
+ "step": 1874
+ },
+ {
+ "entropy": 1.223272442817688,
+ "epoch": 3.787878787878788,
+ "grad_norm": 2.5566787719726562,
+ "learning_rate": 1.2141414141414143e-06,
+ "loss": 1.2140392065048218,
+ "mean_token_accuracy": 0.6939423680305481,
+ "num_tokens": 30720000.0,
+ "step": 1875
+ },
+ {
+ "entropy": 1.5127382278442383,
+ "epoch": 3.78989898989899,
+ "grad_norm": 2.2809665203094482,
+ "learning_rate": 1.2121212121212122e-06,
+ "loss": 1.508399248123169,
+ "mean_token_accuracy": 0.6579140424728394,
+ "num_tokens": 30736384.0,
+ "step": 1876
+ },
+ {
+ "entropy": 1.344763994216919,
+ "epoch": 3.7919191919191917,
+ "grad_norm": 2.3228111267089844,
+ "learning_rate": 1.2101010101010103e-06,
+ "loss": 1.3470673561096191,
+ "mean_token_accuracy": 0.6806302070617676,
+ "num_tokens": 30752768.0,
+ "step": 1877
+ },
+ {
+ "entropy": 1.2828526496887207,
+ "epoch": 3.793939393939394,
+ "grad_norm": 2.51246976852417,
+ "learning_rate": 1.2080808080808082e-06,
+ "loss": 1.2934420108795166,
+ "mean_token_accuracy": 0.6673790812492371,
+ "num_tokens": 30769152.0,
+ "step": 1878
+ },
+ {
+ "entropy": 0.9060937762260437,
+ "epoch": 3.795959595959596,
+ "grad_norm": 2.1415040493011475,
+ "learning_rate": 1.206060606060606e-06,
+ "loss": 0.8956457376480103,
+ "mean_token_accuracy": 0.7670371532440186,
+ "num_tokens": 30785536.0,
+ "step": 1879
+ },
+ {
+ "entropy": 1.1543211936950684,
+ "epoch": 3.797979797979798,
+ "grad_norm": 2.426781415939331,
+ "learning_rate": 1.2040404040404042e-06,
+ "loss": 1.1588597297668457,
+ "mean_token_accuracy": 0.7090253829956055,
+ "num_tokens": 30801920.0,
+ "step": 1880
+ },
+ {
+ "entropy": 1.3253799676895142,
+ "epoch": 3.8,
+ "grad_norm": 2.4828150272369385,
+ "learning_rate": 1.202020202020202e-06,
+ "loss": 1.3082318305969238,
+ "mean_token_accuracy": 0.6839887499809265,
+ "num_tokens": 30818304.0,
+ "step": 1881
+ },
+ {
+ "entropy": 1.1644330024719238,
+ "epoch": 3.802020202020202,
+ "grad_norm": 2.3429148197174072,
+ "learning_rate": 1.2000000000000002e-06,
+ "loss": 1.1645771265029907,
+ "mean_token_accuracy": 0.7025524973869324,
+ "num_tokens": 30834688.0,
+ "step": 1882
+ },
+ {
+ "entropy": 1.1643813848495483,
+ "epoch": 3.804040404040404,
+ "grad_norm": 2.2955002784729004,
+ "learning_rate": 1.197979797979798e-06,
+ "loss": 1.1721268892288208,
+ "mean_token_accuracy": 0.7041401863098145,
+ "num_tokens": 30851072.0,
+ "step": 1883
+ },
+ {
+ "entropy": 1.0957778692245483,
+ "epoch": 3.806060606060606,
+ "grad_norm": 2.244861125946045,
+ "learning_rate": 1.1959595959595961e-06,
+ "loss": 1.1006194353103638,
+ "mean_token_accuracy": 0.7057889699935913,
+ "num_tokens": 30867456.0,
+ "step": 1884
+ },
+ {
+ "entropy": 1.420525074005127,
+ "epoch": 3.808080808080808,
+ "grad_norm": 2.376477003097534,
+ "learning_rate": 1.193939393939394e-06,
+ "loss": 1.4241583347320557,
+ "mean_token_accuracy": 0.662493884563446,
+ "num_tokens": 30883840.0,
+ "step": 1885
+ },
+ {
+ "entropy": 1.4050343036651611,
+ "epoch": 3.81010101010101,
+ "grad_norm": 2.310051202774048,
+ "learning_rate": 1.1919191919191921e-06,
+ "loss": 1.4288474321365356,
+ "mean_token_accuracy": 0.6623107194900513,
+ "num_tokens": 30900224.0,
+ "step": 1886
+ },
+ {
+ "entropy": 1.1658165454864502,
+ "epoch": 3.812121212121212,
+ "grad_norm": 2.1743791103363037,
+ "learning_rate": 1.18989898989899e-06,
+ "loss": 1.1644586324691772,
+ "mean_token_accuracy": 0.7122007608413696,
+ "num_tokens": 30916608.0,
+ "step": 1887
+ },
+ {
+ "entropy": 1.1667358875274658,
+ "epoch": 3.8141414141414143,
+ "grad_norm": 2.092580556869507,
+ "learning_rate": 1.187878787878788e-06,
+ "loss": 1.1762518882751465,
+ "mean_token_accuracy": 0.718551516532898,
+ "num_tokens": 30932992.0,
+ "step": 1888
+ },
+ {
+ "entropy": 1.2293628454208374,
+ "epoch": 3.816161616161616,
+ "grad_norm": 2.2432591915130615,
+ "learning_rate": 1.185858585858586e-06,
+ "loss": 1.249151587486267,
+ "mean_token_accuracy": 0.7038959264755249,
+ "num_tokens": 30949376.0,
+ "step": 1889
+ },
+ {
+ "entropy": 1.104671597480774,
+ "epoch": 3.8181818181818183,
+ "grad_norm": 2.7913901805877686,
+ "learning_rate": 1.183838383838384e-06,
+ "loss": 1.107041597366333,
+ "mean_token_accuracy": 0.7236809730529785,
+ "num_tokens": 30965760.0,
+ "step": 1890
+ },
+ {
+ "entropy": 0.9601510763168335,
+ "epoch": 3.82020202020202,
+ "grad_norm": 2.0736911296844482,
+ "learning_rate": 1.181818181818182e-06,
+ "loss": 0.9680359363555908,
+ "mean_token_accuracy": 0.7562286257743835,
+ "num_tokens": 30982144.0,
+ "step": 1891
+ },
+ {
+ "entropy": 1.2994087934494019,
+ "epoch": 3.822222222222222,
+ "grad_norm": 2.2076780796051025,
+ "learning_rate": 1.1797979797979799e-06,
+ "loss": 1.3263574838638306,
+ "mean_token_accuracy": 0.6968123912811279,
+ "num_tokens": 30998528.0,
+ "step": 1892
+ },
+ {
+ "entropy": 1.3631376028060913,
+ "epoch": 3.824242424242424,
+ "grad_norm": 2.340932846069336,
+ "learning_rate": 1.1777777777777778e-06,
+ "loss": 1.3866732120513916,
+ "mean_token_accuracy": 0.6775158643722534,
+ "num_tokens": 31014912.0,
+ "step": 1893
+ },
+ {
+ "entropy": 0.8883916735649109,
+ "epoch": 3.8262626262626265,
+ "grad_norm": 2.2482478618621826,
+ "learning_rate": 1.1757575757575759e-06,
+ "loss": 0.8972976207733154,
+ "mean_token_accuracy": 0.7602589130401611,
+ "num_tokens": 31031296.0,
+ "step": 1894
+ },
+ {
+ "entropy": 1.2881001234054565,
+ "epoch": 3.8282828282828283,
+ "grad_norm": 2.2452962398529053,
+ "learning_rate": 1.173737373737374e-06,
+ "loss": 1.298166036605835,
+ "mean_token_accuracy": 0.6886907815933228,
+ "num_tokens": 31047680.0,
+ "step": 1895
+ },
+ {
+ "entropy": 1.2942661046981812,
+ "epoch": 3.83030303030303,
+ "grad_norm": 2.5083208084106445,
+ "learning_rate": 1.1717171717171719e-06,
+ "loss": 1.3013086318969727,
+ "mean_token_accuracy": 0.6803248524665833,
+ "num_tokens": 31064064.0,
+ "step": 1896
+ },
+ {
+ "entropy": 1.1769400835037231,
+ "epoch": 3.8323232323232324,
+ "grad_norm": 2.2185699939727783,
+ "learning_rate": 1.1696969696969697e-06,
+ "loss": 1.1732335090637207,
+ "mean_token_accuracy": 0.7107352018356323,
+ "num_tokens": 31080448.0,
+ "step": 1897
+ },
+ {
+ "entropy": 1.3242368698120117,
+ "epoch": 3.8343434343434346,
+ "grad_norm": 2.153888702392578,
+ "learning_rate": 1.1676767676767678e-06,
+ "loss": 1.3406283855438232,
+ "mean_token_accuracy": 0.6897899508476257,
+ "num_tokens": 31096832.0,
+ "step": 1898
+ },
+ {
+ "entropy": 0.9292052984237671,
+ "epoch": 3.8363636363636364,
+ "grad_norm": 2.1435623168945312,
+ "learning_rate": 1.1656565656565657e-06,
+ "loss": 0.9380660057067871,
+ "mean_token_accuracy": 0.7523204684257507,
+ "num_tokens": 31113216.0,
+ "step": 1899
+ },
+ {
+ "entropy": 1.2560123205184937,
+ "epoch": 3.8383838383838382,
+ "grad_norm": 2.292471408843994,
+ "learning_rate": 1.1636363636363638e-06,
+ "loss": 1.2524765729904175,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 31129600.0,
+ "step": 1900
+ },
+ {
+ "epoch": 3.8383838383838382,
+ "eval_entropy": 1.323313660679325,
+ "eval_loss": 1.5475536584854126,
+ "eval_mean_token_accuracy": 0.6447510724106142,
+ "eval_num_tokens": 31129600.0,
+ "eval_runtime": 43.7651,
+ "eval_samples_per_second": 22.621,
+ "eval_steps_per_second": 2.833,
+ "step": 1900
+ },
+ {
+ "entropy": 1.0595868825912476,
+ "epoch": 3.8404040404040405,
+ "grad_norm": 2.2940235137939453,
+ "learning_rate": 1.1616161616161617e-06,
+ "loss": 1.0685131549835205,
+ "mean_token_accuracy": 0.7346116304397583,
+ "num_tokens": 31145984.0,
+ "step": 1901
+ },
+ {
+ "entropy": 1.1705970764160156,
+ "epoch": 3.8424242424242423,
+ "grad_norm": 2.200145959854126,
+ "learning_rate": 1.1595959595959596e-06,
+ "loss": 1.1744719743728638,
+ "mean_token_accuracy": 0.7096360325813293,
+ "num_tokens": 31162368.0,
+ "step": 1902
+ },
+ {
+ "entropy": 1.1404083967208862,
+ "epoch": 3.8444444444444446,
+ "grad_norm": 2.3402581214904785,
+ "learning_rate": 1.1575757575757577e-06,
+ "loss": 1.154109239578247,
+ "mean_token_accuracy": 0.7090253829956055,
+ "num_tokens": 31178752.0,
+ "step": 1903
+ },
+ {
+ "entropy": 1.0651684999465942,
+ "epoch": 3.8464646464646464,
+ "grad_norm": 2.1707308292388916,
+ "learning_rate": 1.1555555555555556e-06,
+ "loss": 1.0661014318466187,
+ "mean_token_accuracy": 0.7322300672531128,
+ "num_tokens": 31195136.0,
+ "step": 1904
+ },
+ {
+ "entropy": 1.4612106084823608,
+ "epoch": 3.8484848484848486,
+ "grad_norm": 2.3446035385131836,
+ "learning_rate": 1.1535353535353535e-06,
+ "loss": 1.4408762454986572,
+ "mean_token_accuracy": 0.6595017313957214,
+ "num_tokens": 31211520.0,
+ "step": 1905
+ },
+ {
+ "entropy": 1.2062592506408691,
+ "epoch": 3.8505050505050504,
+ "grad_norm": 2.244398593902588,
+ "learning_rate": 1.1515151515151516e-06,
+ "loss": 1.2011905908584595,
+ "mean_token_accuracy": 0.7075598239898682,
+ "num_tokens": 31227904.0,
+ "step": 1906
+ },
+ {
+ "entropy": 1.0715900659561157,
+ "epoch": 3.8525252525252527,
+ "grad_norm": 2.2543070316314697,
+ "learning_rate": 1.1494949494949497e-06,
+ "loss": 1.0634649991989136,
+ "mean_token_accuracy": 0.7305202484130859,
+ "num_tokens": 31244288.0,
+ "step": 1907
+ },
+ {
+ "entropy": 1.6116880178451538,
+ "epoch": 3.8545454545454545,
+ "grad_norm": 2.3540494441986084,
+ "learning_rate": 1.1474747474747476e-06,
+ "loss": 1.6299524307250977,
+ "mean_token_accuracy": 0.6351978778839111,
+ "num_tokens": 31260672.0,
+ "step": 1908
+ },
+ {
+ "entropy": 1.470803141593933,
+ "epoch": 3.8565656565656568,
+ "grad_norm": 2.2863407135009766,
+ "learning_rate": 1.1454545454545457e-06,
+ "loss": 1.4692970514297485,
+ "mean_token_accuracy": 0.6576697826385498,
+ "num_tokens": 31277056.0,
+ "step": 1909
+ },
+ {
+ "entropy": 1.0824670791625977,
+ "epoch": 3.8585858585858586,
+ "grad_norm": 2.3184683322906494,
+ "learning_rate": 1.1434343434343436e-06,
+ "loss": 1.0677670240402222,
+ "mean_token_accuracy": 0.7219101190567017,
+ "num_tokens": 31293440.0,
+ "step": 1910
+ },
+ {
+ "entropy": 1.027206540107727,
+ "epoch": 3.8606060606060604,
+ "grad_norm": 2.4096450805664062,
+ "learning_rate": 1.1414141414141414e-06,
+ "loss": 1.0224218368530273,
+ "mean_token_accuracy": 0.7347947955131531,
+ "num_tokens": 31309824.0,
+ "step": 1911
+ },
+ {
+ "entropy": 1.1143090724945068,
+ "epoch": 3.8626262626262626,
+ "grad_norm": 2.0057880878448486,
+ "learning_rate": 1.1393939393939395e-06,
+ "loss": 1.1075199842453003,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 31326208.0,
+ "step": 1912
+ },
+ {
+ "entropy": 1.299835205078125,
+ "epoch": 3.864646464646465,
+ "grad_norm": 2.554501533508301,
+ "learning_rate": 1.1373737373737374e-06,
+ "loss": 1.2906074523925781,
+ "mean_token_accuracy": 0.681485116481781,
+ "num_tokens": 31342592.0,
+ "step": 1913
+ },
+ {
+ "entropy": 1.289318561553955,
+ "epoch": 3.8666666666666667,
+ "grad_norm": 2.4257376194000244,
+ "learning_rate": 1.1353535353535353e-06,
+ "loss": 1.281335711479187,
+ "mean_token_accuracy": 0.678798258304596,
+ "num_tokens": 31358976.0,
+ "step": 1914
+ },
+ {
+ "entropy": 1.0814216136932373,
+ "epoch": 3.8686868686868685,
+ "grad_norm": 2.5448758602142334,
+ "learning_rate": 1.1333333333333334e-06,
+ "loss": 1.0837101936340332,
+ "mean_token_accuracy": 0.7264899611473083,
+ "num_tokens": 31375360.0,
+ "step": 1915
+ },
+ {
+ "entropy": 0.8491103649139404,
+ "epoch": 3.8707070707070708,
+ "grad_norm": 2.0053293704986572,
+ "learning_rate": 1.1313131313131315e-06,
+ "loss": 0.8459927439689636,
+ "mean_token_accuracy": 0.775036633014679,
+ "num_tokens": 31391744.0,
+ "step": 1916
+ },
+ {
+ "entropy": 1.2331805229187012,
+ "epoch": 3.8727272727272726,
+ "grad_norm": 2.1101794242858887,
+ "learning_rate": 1.1292929292929294e-06,
+ "loss": 1.241546869277954,
+ "mean_token_accuracy": 0.7051783204078674,
+ "num_tokens": 31408128.0,
+ "step": 1917
+ },
+ {
+ "entropy": 0.8649861812591553,
+ "epoch": 3.874747474747475,
+ "grad_norm": 2.098615884780884,
+ "learning_rate": 1.1272727272727275e-06,
+ "loss": 0.8645999431610107,
+ "mean_token_accuracy": 0.7702125310897827,
+ "num_tokens": 31424512.0,
+ "step": 1918
+ },
+ {
+ "entropy": 1.1396632194519043,
+ "epoch": 3.8767676767676766,
+ "grad_norm": 2.2155094146728516,
+ "learning_rate": 1.1252525252525254e-06,
+ "loss": 1.1333739757537842,
+ "mean_token_accuracy": 0.7166585326194763,
+ "num_tokens": 31440896.0,
+ "step": 1919
+ },
+ {
+ "entropy": 1.375836968421936,
+ "epoch": 3.878787878787879,
+ "grad_norm": 2.3003385066986084,
+ "learning_rate": 1.1232323232323233e-06,
+ "loss": 1.379508376121521,
+ "mean_token_accuracy": 0.6699438095092773,
+ "num_tokens": 31457280.0,
+ "step": 1920
+ },
+ {
+ "entropy": 1.2705941200256348,
+ "epoch": 3.8808080808080807,
+ "grad_norm": 2.156363010406494,
+ "learning_rate": 1.1212121212121214e-06,
+ "loss": 1.266032099723816,
+ "mean_token_accuracy": 0.6869198679924011,
+ "num_tokens": 31473664.0,
+ "step": 1921
+ },
+ {
+ "entropy": 1.6494578123092651,
+ "epoch": 3.882828282828283,
+ "grad_norm": 2.420069932937622,
+ "learning_rate": 1.1191919191919193e-06,
+ "loss": 1.6762641668319702,
+ "mean_token_accuracy": 0.6144357323646545,
+ "num_tokens": 31490048.0,
+ "step": 1922
+ },
+ {
+ "entropy": 0.9549956917762756,
+ "epoch": 3.8848484848484848,
+ "grad_norm": 2.199296236038208,
+ "learning_rate": 1.1171717171717172e-06,
+ "loss": 0.9642987251281738,
+ "mean_token_accuracy": 0.7506717443466187,
+ "num_tokens": 31506432.0,
+ "step": 1923
+ },
+ {
+ "entropy": 1.5379301309585571,
+ "epoch": 3.886868686868687,
+ "grad_norm": 2.2627663612365723,
+ "learning_rate": 1.1151515151515153e-06,
+ "loss": 1.5375440120697021,
+ "mean_token_accuracy": 0.6497313380241394,
+ "num_tokens": 31522816.0,
+ "step": 1924
+ },
+ {
+ "entropy": 1.009248971939087,
+ "epoch": 3.888888888888889,
+ "grad_norm": 2.142307758331299,
+ "learning_rate": 1.1131313131313131e-06,
+ "loss": 1.014758586883545,
+ "mean_token_accuracy": 0.7470077872276306,
+ "num_tokens": 31539200.0,
+ "step": 1925
+ },
+ {
+ "entropy": 1.1543548107147217,
+ "epoch": 3.8909090909090907,
+ "grad_norm": 2.2896368503570557,
+ "learning_rate": 1.111111111111111e-06,
+ "loss": 1.169635534286499,
+ "mean_token_accuracy": 0.7079873085021973,
+ "num_tokens": 31555584.0,
+ "step": 1926
+ },
+ {
+ "entropy": 1.1072580814361572,
+ "epoch": 3.892929292929293,
+ "grad_norm": 2.4316368103027344,
+ "learning_rate": 1.1090909090909093e-06,
+ "loss": 1.0753037929534912,
+ "mean_token_accuracy": 0.7245358824729919,
+ "num_tokens": 31571968.0,
+ "step": 1927
+ },
+ {
+ "entropy": 1.0660669803619385,
+ "epoch": 3.894949494949495,
+ "grad_norm": 2.2569425106048584,
+ "learning_rate": 1.1070707070707072e-06,
+ "loss": 1.0584138631820679,
+ "mean_token_accuracy": 0.7323521971702576,
+ "num_tokens": 31588352.0,
+ "step": 1928
+ },
+ {
+ "entropy": 1.4635326862335205,
+ "epoch": 3.896969696969697,
+ "grad_norm": 2.4725160598754883,
+ "learning_rate": 1.1050505050505051e-06,
+ "loss": 1.4772144556045532,
+ "mean_token_accuracy": 0.6534562706947327,
+ "num_tokens": 31604736.0,
+ "step": 1929
+ },
+ {
+ "entropy": 1.2802455425262451,
+ "epoch": 3.898989898989899,
+ "grad_norm": 2.188870906829834,
+ "learning_rate": 1.1030303030303032e-06,
+ "loss": 1.2900553941726685,
+ "mean_token_accuracy": 0.6868588328361511,
+ "num_tokens": 31621120.0,
+ "step": 1930
+ },
+ {
+ "entropy": 1.0175695419311523,
+ "epoch": 3.901010101010101,
+ "grad_norm": 2.177603244781494,
+ "learning_rate": 1.1010101010101011e-06,
+ "loss": 1.0199849605560303,
+ "mean_token_accuracy": 0.7407791614532471,
+ "num_tokens": 31637504.0,
+ "step": 1931
+ },
+ {
+ "entropy": 1.0328937768936157,
+ "epoch": 3.9030303030303033,
+ "grad_norm": 2.3460423946380615,
+ "learning_rate": 1.098989898989899e-06,
+ "loss": 1.0519663095474243,
+ "mean_token_accuracy": 0.7301538586616516,
+ "num_tokens": 31653888.0,
+ "step": 1932
+ },
+ {
+ "entropy": 1.3149690628051758,
+ "epoch": 3.905050505050505,
+ "grad_norm": 2.4549903869628906,
+ "learning_rate": 1.096969696969697e-06,
+ "loss": 1.311675786972046,
+ "mean_token_accuracy": 0.6631045341491699,
+ "num_tokens": 31670272.0,
+ "step": 1933
+ },
+ {
+ "entropy": 1.0760291814804077,
+ "epoch": 3.907070707070707,
+ "grad_norm": 2.1368870735168457,
+ "learning_rate": 1.094949494949495e-06,
+ "loss": 1.0474696159362793,
+ "mean_token_accuracy": 0.740290641784668,
+ "num_tokens": 31686656.0,
+ "step": 1934
+ },
+ {
+ "entropy": 1.4127235412597656,
+ "epoch": 3.909090909090909,
+ "grad_norm": 2.329832077026367,
+ "learning_rate": 1.0929292929292929e-06,
+ "loss": 1.4108169078826904,
+ "mean_token_accuracy": 0.6663410067558289,
+ "num_tokens": 31703040.0,
+ "step": 1935
+ },
+ {
+ "entropy": 1.5287094116210938,
+ "epoch": 3.911111111111111,
+ "grad_norm": 2.2737598419189453,
+ "learning_rate": 1.090909090909091e-06,
+ "loss": 1.5544226169586182,
+ "mean_token_accuracy": 0.6364802122116089,
+ "num_tokens": 31719424.0,
+ "step": 1936
+ },
+ {
+ "entropy": 1.1318615674972534,
+ "epoch": 3.9131313131313132,
+ "grad_norm": 2.3448705673217773,
+ "learning_rate": 1.0888888888888889e-06,
+ "loss": 1.1228995323181152,
+ "mean_token_accuracy": 0.7198339104652405,
+ "num_tokens": 31735808.0,
+ "step": 1937
+ },
+ {
+ "entropy": 1.0484049320220947,
+ "epoch": 3.915151515151515,
+ "grad_norm": 2.5756354331970215,
+ "learning_rate": 1.086868686868687e-06,
+ "loss": 1.0507314205169678,
+ "mean_token_accuracy": 0.7214215993881226,
+ "num_tokens": 31752192.0,
+ "step": 1938
+ },
+ {
+ "entropy": 0.9962558150291443,
+ "epoch": 3.9171717171717173,
+ "grad_norm": 2.379638910293579,
+ "learning_rate": 1.084848484848485e-06,
+ "loss": 0.9964162707328796,
+ "mean_token_accuracy": 0.7351001501083374,
+ "num_tokens": 31768576.0,
+ "step": 1939
+ },
+ {
+ "entropy": 1.0813647508621216,
+ "epoch": 3.919191919191919,
+ "grad_norm": 2.202664852142334,
+ "learning_rate": 1.082828282828283e-06,
+ "loss": 1.0924289226531982,
+ "mean_token_accuracy": 0.7243527173995972,
+ "num_tokens": 31784960.0,
+ "step": 1940
+ },
+ {
+ "entropy": 1.3451746702194214,
+ "epoch": 3.9212121212121214,
+ "grad_norm": 2.2476084232330322,
+ "learning_rate": 1.0808080808080808e-06,
+ "loss": 1.3437637090682983,
+ "mean_token_accuracy": 0.681485116481781,
+ "num_tokens": 31801344.0,
+ "step": 1941
+ },
+ {
+ "entropy": 1.1332415342330933,
+ "epoch": 3.923232323232323,
+ "grad_norm": 2.414275884628296,
+ "learning_rate": 1.078787878787879e-06,
+ "loss": 1.1400260925292969,
+ "mean_token_accuracy": 0.7132388949394226,
+ "num_tokens": 31817728.0,
+ "step": 1942
+ },
+ {
+ "entropy": 1.087522029876709,
+ "epoch": 3.9252525252525254,
+ "grad_norm": 2.1204850673675537,
+ "learning_rate": 1.0767676767676768e-06,
+ "loss": 1.0787461996078491,
+ "mean_token_accuracy": 0.7150708436965942,
+ "num_tokens": 31834112.0,
+ "step": 1943
+ },
+ {
+ "entropy": 1.1856560707092285,
+ "epoch": 3.9272727272727272,
+ "grad_norm": 2.270273447036743,
+ "learning_rate": 1.0747474747474747e-06,
+ "loss": 1.1918301582336426,
+ "mean_token_accuracy": 0.7099413871765137,
+ "num_tokens": 31850496.0,
+ "step": 1944
+ },
+ {
+ "entropy": 1.1141650676727295,
+ "epoch": 3.929292929292929,
+ "grad_norm": 2.357293128967285,
+ "learning_rate": 1.0727272727272728e-06,
+ "loss": 1.0945638418197632,
+ "mean_token_accuracy": 0.7214826345443726,
+ "num_tokens": 31866880.0,
+ "step": 1945
+ },
+ {
+ "entropy": 1.4306713342666626,
+ "epoch": 3.9313131313131313,
+ "grad_norm": 2.1920864582061768,
+ "learning_rate": 1.0707070707070707e-06,
+ "loss": 1.4291378259658813,
+ "mean_token_accuracy": 0.6696995496749878,
+ "num_tokens": 31883264.0,
+ "step": 1946
+ },
+ {
+ "entropy": 1.0448427200317383,
+ "epoch": 3.9333333333333336,
+ "grad_norm": 2.2893853187561035,
+ "learning_rate": 1.0686868686868688e-06,
+ "loss": 1.0350053310394287,
+ "mean_token_accuracy": 0.7333292365074158,
+ "num_tokens": 31899648.0,
+ "step": 1947
+ },
+ {
+ "entropy": 0.9403035044670105,
+ "epoch": 3.9353535353535354,
+ "grad_norm": 2.036454200744629,
+ "learning_rate": 1.066666666666667e-06,
+ "loss": 0.9342324137687683,
+ "mean_token_accuracy": 0.7620298266410828,
+ "num_tokens": 31916032.0,
+ "step": 1948
+ },
+ {
+ "entropy": 1.1731034517288208,
+ "epoch": 3.937373737373737,
+ "grad_norm": 2.388814687728882,
+ "learning_rate": 1.0646464646464648e-06,
+ "loss": 1.1642717123031616,
+ "mean_token_accuracy": 0.705422580242157,
+ "num_tokens": 31932416.0,
+ "step": 1949
+ },
+ {
+ "entropy": 1.4009122848510742,
+ "epoch": 3.9393939393939394,
+ "grad_norm": 2.3011586666107178,
+ "learning_rate": 1.0626262626262627e-06,
+ "loss": 1.3879787921905518,
+ "mean_token_accuracy": 0.6805080771446228,
+ "num_tokens": 31948800.0,
+ "step": 1950
+ },
+ {
+ "epoch": 3.9393939393939394,
+ "eval_entropy": 1.319143979299453,
+ "eval_loss": 1.5476959943771362,
+ "eval_mean_token_accuracy": 0.6448943807232764,
+ "eval_num_tokens": 31948800.0,
+ "eval_runtime": 43.7596,
+ "eval_samples_per_second": 22.624,
+ "eval_steps_per_second": 2.834,
+ "step": 1950
+ },
+ {
+ "entropy": 1.2538156509399414,
+ "epoch": 3.9414141414141413,
+ "grad_norm": 2.5176167488098145,
+ "learning_rate": 1.0606060606060608e-06,
+ "loss": 1.2646058797836304,
+ "mean_token_accuracy": 0.6989496946334839,
+ "num_tokens": 31965184.0,
+ "step": 1951
+ },
+ {
+ "entropy": 1.4409568309783936,
+ "epoch": 3.9434343434343435,
+ "grad_norm": 2.3068838119506836,
+ "learning_rate": 1.0585858585858587e-06,
+ "loss": 1.4423179626464844,
+ "mean_token_accuracy": 0.6614558100700378,
+ "num_tokens": 31981568.0,
+ "step": 1952
+ },
+ {
+ "entropy": 1.4900083541870117,
+ "epoch": 3.9454545454545453,
+ "grad_norm": 2.3615455627441406,
+ "learning_rate": 1.0565656565656566e-06,
+ "loss": 1.4933650493621826,
+ "mean_token_accuracy": 0.6474108695983887,
+ "num_tokens": 31997952.0,
+ "step": 1953
+ },
+ {
+ "entropy": 1.2034417390823364,
+ "epoch": 3.9474747474747476,
+ "grad_norm": 2.4732308387756348,
+ "learning_rate": 1.0545454545454547e-06,
+ "loss": 1.209761619567871,
+ "mean_token_accuracy": 0.6927210688591003,
+ "num_tokens": 32014336.0,
+ "step": 1954
+ },
+ {
+ "entropy": 1.1165226697921753,
+ "epoch": 3.9494949494949494,
+ "grad_norm": 2.4827890396118164,
+ "learning_rate": 1.0525252525252525e-06,
+ "loss": 1.1289414167404175,
+ "mean_token_accuracy": 0.7070713043212891,
+ "num_tokens": 32030720.0,
+ "step": 1955
+ },
+ {
+ "entropy": 1.2843526601791382,
+ "epoch": 3.9515151515151516,
+ "grad_norm": 2.32797908782959,
+ "learning_rate": 1.0505050505050506e-06,
+ "loss": 1.2694849967956543,
+ "mean_token_accuracy": 0.6875916123390198,
+ "num_tokens": 32047104.0,
+ "step": 1956
+ },
+ {
+ "entropy": 1.3727971315383911,
+ "epoch": 3.9535353535353535,
+ "grad_norm": 2.320406198501587,
+ "learning_rate": 1.0484848484848485e-06,
+ "loss": 1.3948733806610107,
+ "mean_token_accuracy": 0.6679286956787109,
+ "num_tokens": 32063488.0,
+ "step": 1957
+ },
+ {
+ "entropy": 1.4869349002838135,
+ "epoch": 3.9555555555555557,
+ "grad_norm": 2.2239322662353516,
+ "learning_rate": 1.0464646464646464e-06,
+ "loss": 1.5088552236557007,
+ "mean_token_accuracy": 0.6551660895347595,
+ "num_tokens": 32079872.0,
+ "step": 1958
+ },
+ {
+ "entropy": 1.2804311513900757,
+ "epoch": 3.9575757575757575,
+ "grad_norm": 2.355632781982422,
+ "learning_rate": 1.0444444444444445e-06,
+ "loss": 1.2881189584732056,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 32096256.0,
+ "step": 1959
+ },
+ {
+ "entropy": 1.469780683517456,
+ "epoch": 3.9595959595959593,
+ "grad_norm": 2.475818395614624,
+ "learning_rate": 1.0424242424242426e-06,
+ "loss": 1.4946942329406738,
+ "mean_token_accuracy": 0.6443576216697693,
+ "num_tokens": 32112640.0,
+ "step": 1960
+ },
+ {
+ "entropy": 1.0433298349380493,
+ "epoch": 3.9616161616161616,
+ "grad_norm": 2.335348606109619,
+ "learning_rate": 1.0404040404040405e-06,
+ "loss": 1.051847219467163,
+ "mean_token_accuracy": 0.7260014414787292,
+ "num_tokens": 32129024.0,
+ "step": 1961
+ },
+ {
+ "entropy": 1.060207486152649,
+ "epoch": 3.963636363636364,
+ "grad_norm": 2.465827465057373,
+ "learning_rate": 1.0383838383838384e-06,
+ "loss": 1.0738749504089355,
+ "mean_token_accuracy": 0.7250854969024658,
+ "num_tokens": 32145408.0,
+ "step": 1962
+ },
+ {
+ "entropy": 1.3710187673568726,
+ "epoch": 3.9656565656565657,
+ "grad_norm": 2.1859865188598633,
+ "learning_rate": 1.0363636363636365e-06,
+ "loss": 1.3790408372879028,
+ "mean_token_accuracy": 0.6800195574760437,
+ "num_tokens": 32161792.0,
+ "step": 1963
+ },
+ {
+ "entropy": 1.4380125999450684,
+ "epoch": 3.9676767676767675,
+ "grad_norm": 2.3186328411102295,
+ "learning_rate": 1.0343434343434344e-06,
+ "loss": 1.4353742599487305,
+ "mean_token_accuracy": 0.6627992391586304,
+ "num_tokens": 32178176.0,
+ "step": 1964
+ },
+ {
+ "entropy": 1.346064567565918,
+ "epoch": 3.9696969696969697,
+ "grad_norm": 2.455488920211792,
+ "learning_rate": 1.0323232323232325e-06,
+ "loss": 1.3504667282104492,
+ "mean_token_accuracy": 0.6808744668960571,
+ "num_tokens": 32194560.0,
+ "step": 1965
+ },
+ {
+ "entropy": 1.111870527267456,
+ "epoch": 3.971717171717172,
+ "grad_norm": 2.216954231262207,
+ "learning_rate": 1.0303030303030304e-06,
+ "loss": 1.1173250675201416,
+ "mean_token_accuracy": 0.7161700129508972,
+ "num_tokens": 32210944.0,
+ "step": 1966
+ },
+ {
+ "entropy": 1.570885181427002,
+ "epoch": 3.973737373737374,
+ "grad_norm": 2.5180883407592773,
+ "learning_rate": 1.0282828282828283e-06,
+ "loss": 1.550491213798523,
+ "mean_token_accuracy": 0.6203590631484985,
+ "num_tokens": 32227328.0,
+ "step": 1967
+ },
+ {
+ "entropy": 0.887984037399292,
+ "epoch": 3.9757575757575756,
+ "grad_norm": 2.193727970123291,
+ "learning_rate": 1.0262626262626264e-06,
+ "loss": 0.8939201831817627,
+ "mean_token_accuracy": 0.7674645781517029,
+ "num_tokens": 32243712.0,
+ "step": 1968
+ },
+ {
+ "entropy": 1.3493150472640991,
+ "epoch": 3.977777777777778,
+ "grad_norm": 2.320697784423828,
+ "learning_rate": 1.0242424242424242e-06,
+ "loss": 1.3643516302108765,
+ "mean_token_accuracy": 0.67659991979599,
+ "num_tokens": 32260096.0,
+ "step": 1969
+ },
+ {
+ "entropy": 1.2187929153442383,
+ "epoch": 3.9797979797979797,
+ "grad_norm": 2.2966790199279785,
+ "learning_rate": 1.0222222222222223e-06,
+ "loss": 1.2266913652420044,
+ "mean_token_accuracy": 0.701636552810669,
+ "num_tokens": 32276480.0,
+ "step": 1970
+ },
+ {
+ "entropy": 1.3222001791000366,
+ "epoch": 3.981818181818182,
+ "grad_norm": 2.484215497970581,
+ "learning_rate": 1.0202020202020202e-06,
+ "loss": 1.3209818601608276,
+ "mean_token_accuracy": 0.6782486438751221,
+ "num_tokens": 32292864.0,
+ "step": 1971
+ },
+ {
+ "entropy": 1.2982250452041626,
+ "epoch": 3.9838383838383837,
+ "grad_norm": 2.320852518081665,
+ "learning_rate": 1.0181818181818183e-06,
+ "loss": 1.3085607290267944,
+ "mean_token_accuracy": 0.6881411671638489,
+ "num_tokens": 32309248.0,
+ "step": 1972
+ },
+ {
+ "entropy": 1.3396943807601929,
+ "epoch": 3.985858585858586,
+ "grad_norm": 2.224574565887451,
+ "learning_rate": 1.0161616161616162e-06,
+ "loss": 1.3511459827423096,
+ "mean_token_accuracy": 0.6810576319694519,
+ "num_tokens": 32325632.0,
+ "step": 1973
+ },
+ {
+ "entropy": 1.2554755210876465,
+ "epoch": 3.987878787878788,
+ "grad_norm": 2.3757498264312744,
+ "learning_rate": 1.0141414141414143e-06,
+ "loss": 1.247807502746582,
+ "mean_token_accuracy": 0.687530517578125,
+ "num_tokens": 32342016.0,
+ "step": 1974
+ },
+ {
+ "entropy": 0.9622905850410461,
+ "epoch": 3.98989898989899,
+ "grad_norm": 2.2012438774108887,
+ "learning_rate": 1.0121212121212122e-06,
+ "loss": 0.9560307860374451,
+ "mean_token_accuracy": 0.7637396454811096,
+ "num_tokens": 32358400.0,
+ "step": 1975
+ },
+ {
+ "entropy": 1.1193549633026123,
+ "epoch": 3.991919191919192,
+ "grad_norm": 2.3705174922943115,
+ "learning_rate": 1.01010101010101e-06,
+ "loss": 1.11350679397583,
+ "mean_token_accuracy": 0.7154372334480286,
+ "num_tokens": 32374784.0,
+ "step": 1976
+ },
+ {
+ "entropy": 0.9361278414726257,
+ "epoch": 3.993939393939394,
+ "grad_norm": 2.174281358718872,
+ "learning_rate": 1.0080808080808082e-06,
+ "loss": 0.9388691186904907,
+ "mean_token_accuracy": 0.7485344409942627,
+ "num_tokens": 32391168.0,
+ "step": 1977
+ },
+ {
+ "entropy": 1.4282293319702148,
+ "epoch": 3.995959595959596,
+ "grad_norm": 2.1972262859344482,
+ "learning_rate": 1.006060606060606e-06,
+ "loss": 1.4244005680084229,
+ "mean_token_accuracy": 0.685332179069519,
+ "num_tokens": 32407552.0,
+ "step": 1978
+ },
+ {
+ "entropy": 1.221082091331482,
+ "epoch": 3.9979797979797977,
+ "grad_norm": 2.3935673236846924,
+ "learning_rate": 1.004040404040404e-06,
+ "loss": 1.1999341249465942,
+ "mean_token_accuracy": 0.6952857971191406,
+ "num_tokens": 32423936.0,
+ "step": 1979
+ },
+ {
+ "entropy": 1.1347371339797974,
+ "epoch": 4.0,
+ "grad_norm": 2.228233575820923,
+ "learning_rate": 1.002020202020202e-06,
+ "loss": 1.1378669738769531,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 32440320.0,
+ "step": 1980
+ },
+ {
+ "entropy": 1.1821788549423218,
+ "epoch": 4.002020202020202,
+ "grad_norm": 2.356572389602661,
+ "learning_rate": 1.0000000000000002e-06,
+ "loss": 1.1377968788146973,
+ "mean_token_accuracy": 0.708170473575592,
+ "num_tokens": 32456704.0,
+ "step": 1981
+ },
+ {
+ "entropy": 1.444516658782959,
+ "epoch": 4.004040404040404,
+ "grad_norm": 2.34165358543396,
+ "learning_rate": 9.97979797979798e-07,
+ "loss": 1.4065756797790527,
+ "mean_token_accuracy": 0.6689057350158691,
+ "num_tokens": 32473088.0,
+ "step": 1982
+ },
+ {
+ "entropy": 1.5600178241729736,
+ "epoch": 4.006060606060606,
+ "grad_norm": 2.147475004196167,
+ "learning_rate": 9.959595959595962e-07,
+ "loss": 1.5237784385681152,
+ "mean_token_accuracy": 0.6602345108985901,
+ "num_tokens": 32489472.0,
+ "step": 1983
+ },
+ {
+ "entropy": 1.3860907554626465,
+ "epoch": 4.008080808080808,
+ "grad_norm": 2.5050148963928223,
+ "learning_rate": 9.93939393939394e-07,
+ "loss": 1.3332314491271973,
+ "mean_token_accuracy": 0.6679897308349609,
+ "num_tokens": 32505856.0,
+ "step": 1984
+ },
+ {
+ "entropy": 1.2262948751449585,
+ "epoch": 4.01010101010101,
+ "grad_norm": 2.3707785606384277,
+ "learning_rate": 9.91919191919192e-07,
+ "loss": 1.1803091764450073,
+ "mean_token_accuracy": 0.6957743167877197,
+ "num_tokens": 32522240.0,
+ "step": 1985
+ },
+ {
+ "entropy": 1.2782310247421265,
+ "epoch": 4.012121212121212,
+ "grad_norm": 2.1337549686431885,
+ "learning_rate": 9.8989898989899e-07,
+ "loss": 1.2508152723312378,
+ "mean_token_accuracy": 0.6898509860038757,
+ "num_tokens": 32538624.0,
+ "step": 1986
+ },
+ {
+ "entropy": 1.2618422508239746,
+ "epoch": 4.014141414141414,
+ "grad_norm": 2.1014909744262695,
+ "learning_rate": 9.87878787878788e-07,
+ "loss": 1.2586122751235962,
+ "mean_token_accuracy": 0.7060942649841309,
+ "num_tokens": 32555008.0,
+ "step": 1987
+ },
+ {
+ "entropy": 1.4927153587341309,
+ "epoch": 4.016161616161616,
+ "grad_norm": 2.3997669219970703,
+ "learning_rate": 9.858585858585858e-07,
+ "loss": 1.458584189414978,
+ "mean_token_accuracy": 0.6642037034034729,
+ "num_tokens": 32571392.0,
+ "step": 1988
+ },
+ {
+ "entropy": 0.9929779767990112,
+ "epoch": 4.0181818181818185,
+ "grad_norm": 2.1199800968170166,
+ "learning_rate": 9.83838383838384e-07,
+ "loss": 0.9945173263549805,
+ "mean_token_accuracy": 0.7606863975524902,
+ "num_tokens": 32587776.0,
+ "step": 1989
+ },
+ {
+ "entropy": 1.2815021276474,
+ "epoch": 4.02020202020202,
+ "grad_norm": 2.2822794914245605,
+ "learning_rate": 9.818181818181818e-07,
+ "loss": 1.263106107711792,
+ "mean_token_accuracy": 0.7038959264755249,
+ "num_tokens": 32604160.0,
+ "step": 1990
+ },
+ {
+ "entropy": 1.2504572868347168,
+ "epoch": 4.022222222222222,
+ "grad_norm": 2.0446224212646484,
+ "learning_rate": 9.797979797979799e-07,
+ "loss": 1.2274131774902344,
+ "mean_token_accuracy": 0.7008426785469055,
+ "num_tokens": 32620544.0,
+ "step": 1991
+ },
+ {
+ "entropy": 1.1070255041122437,
+ "epoch": 4.024242424242424,
+ "grad_norm": 2.0727381706237793,
+ "learning_rate": 9.77777777777778e-07,
+ "loss": 1.082715392112732,
+ "mean_token_accuracy": 0.7302759885787964,
+ "num_tokens": 32636928.0,
+ "step": 1992
+ },
+ {
+ "entropy": 1.0761677026748657,
+ "epoch": 4.026262626262627,
+ "grad_norm": 2.0985822677612305,
+ "learning_rate": 9.757575757575759e-07,
+ "loss": 1.0548713207244873,
+ "mean_token_accuracy": 0.7333292365074158,
+ "num_tokens": 32653312.0,
+ "step": 1993
+ },
+ {
+ "entropy": 1.5109375715255737,
+ "epoch": 4.028282828282828,
+ "grad_norm": 2.426588535308838,
+ "learning_rate": 9.737373737373738e-07,
+ "loss": 1.4922651052474976,
+ "mean_token_accuracy": 0.6560820937156677,
+ "num_tokens": 32669696.0,
+ "step": 1994
+ },
+ {
+ "entropy": 1.2393261194229126,
+ "epoch": 4.03030303030303,
+ "grad_norm": 2.1131463050842285,
+ "learning_rate": 9.717171717171719e-07,
+ "loss": 1.2221450805664062,
+ "mean_token_accuracy": 0.7113458514213562,
+ "num_tokens": 32686080.0,
+ "step": 1995
+ },
+ {
+ "entropy": 1.2733023166656494,
+ "epoch": 4.0323232323232325,
+ "grad_norm": 2.42077898979187,
+ "learning_rate": 9.696969696969698e-07,
+ "loss": 1.266562581062317,
+ "mean_token_accuracy": 0.6916218996047974,
+ "num_tokens": 32702464.0,
+ "step": 1996
+ },
+ {
+ "entropy": 1.1015594005584717,
+ "epoch": 4.034343434343434,
+ "grad_norm": 2.3131461143493652,
+ "learning_rate": 9.676767676767676e-07,
+ "loss": 1.0699245929718018,
+ "mean_token_accuracy": 0.7295432090759277,
+ "num_tokens": 32718848.0,
+ "step": 1997
+ },
+ {
+ "entropy": 1.1488311290740967,
+ "epoch": 4.036363636363636,
+ "grad_norm": 2.460294723510742,
+ "learning_rate": 9.656565656565657e-07,
+ "loss": 1.1216062307357788,
+ "mean_token_accuracy": 0.7164753079414368,
+ "num_tokens": 32735232.0,
+ "step": 1998
+ },
+ {
+ "entropy": 1.1301594972610474,
+ "epoch": 4.038383838383838,
+ "grad_norm": 2.248311996459961,
+ "learning_rate": 9.636363636363636e-07,
+ "loss": 1.1271123886108398,
+ "mean_token_accuracy": 0.7147044539451599,
+ "num_tokens": 32751616.0,
+ "step": 1999
+ },
+ {
+ "entropy": 1.2287960052490234,
+ "epoch": 4.040404040404041,
+ "grad_norm": 2.191375732421875,
+ "learning_rate": 9.616161616161617e-07,
+ "loss": 1.2168409824371338,
+ "mean_token_accuracy": 0.7156814932823181,
+ "num_tokens": 32768000.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.040404040404041,
+ "eval_entropy": 1.294078712021151,
+ "eval_loss": 1.5553377866744995,
+ "eval_mean_token_accuracy": 0.6444841599272143,
+ "eval_num_tokens": 32768000.0,
+ "eval_runtime": 43.7303,
+ "eval_samples_per_second": 22.639,
+ "eval_steps_per_second": 2.836,
+ "step": 2000
+ },
+ {
+ "entropy": 1.0581393241882324,
+ "epoch": 4.042424242424242,
+ "grad_norm": 2.360215187072754,
+ "learning_rate": 9.595959595959596e-07,
+ "loss": 1.042952060699463,
+ "mean_token_accuracy": 0.7269784808158875,
+ "num_tokens": 32784384.0,
+ "step": 2001
+ },
+ {
+ "entropy": 1.0822330713272095,
+ "epoch": 4.044444444444444,
+ "grad_norm": 2.3221960067749023,
+ "learning_rate": 9.575757575757577e-07,
+ "loss": 1.0822763442993164,
+ "mean_token_accuracy": 0.7313751578330994,
+ "num_tokens": 32800768.0,
+ "step": 2002
+ },
+ {
+ "entropy": 1.1480356454849243,
+ "epoch": 4.0464646464646465,
+ "grad_norm": 2.063100576400757,
+ "learning_rate": 9.555555555555556e-07,
+ "loss": 1.123166799545288,
+ "mean_token_accuracy": 0.7303370833396912,
+ "num_tokens": 32817152.0,
+ "step": 2003
+ },
+ {
+ "entropy": 1.3967088460922241,
+ "epoch": 4.048484848484849,
+ "grad_norm": 2.17568039894104,
+ "learning_rate": 9.535353535353536e-07,
+ "loss": 1.4080045223236084,
+ "mean_token_accuracy": 0.6711040735244751,
+ "num_tokens": 32833536.0,
+ "step": 2004
+ },
+ {
+ "entropy": 1.2580901384353638,
+ "epoch": 4.05050505050505,
+ "grad_norm": 2.141166925430298,
+ "learning_rate": 9.515151515151516e-07,
+ "loss": 1.2547274827957153,
+ "mean_token_accuracy": 0.7031631469726562,
+ "num_tokens": 32849920.0,
+ "step": 2005
+ },
+ {
+ "entropy": 0.9946291446685791,
+ "epoch": 4.052525252525252,
+ "grad_norm": 2.490000009536743,
+ "learning_rate": 9.494949494949496e-07,
+ "loss": 1.0014936923980713,
+ "mean_token_accuracy": 0.7382755279541016,
+ "num_tokens": 32866304.0,
+ "step": 2006
+ },
+ {
+ "entropy": 1.3571540117263794,
+ "epoch": 4.054545454545455,
+ "grad_norm": 2.130330801010132,
+ "learning_rate": 9.474747474747476e-07,
+ "loss": 1.3513038158416748,
+ "mean_token_accuracy": 0.6856375336647034,
+ "num_tokens": 32882688.0,
+ "step": 2007
+ },
+ {
+ "entropy": 1.0289682149887085,
+ "epoch": 4.056565656565657,
+ "grad_norm": 2.0878100395202637,
+ "learning_rate": 9.454545454545455e-07,
+ "loss": 1.0360488891601562,
+ "mean_token_accuracy": 0.7443209290504456,
+ "num_tokens": 32899072.0,
+ "step": 2008
+ },
+ {
+ "entropy": 1.078924536705017,
+ "epoch": 4.058585858585858,
+ "grad_norm": 1.9717739820480347,
+ "learning_rate": 9.434343434343435e-07,
+ "loss": 1.0830042362213135,
+ "mean_token_accuracy": 0.7435271143913269,
+ "num_tokens": 32915456.0,
+ "step": 2009
+ },
+ {
+ "entropy": 1.5092878341674805,
+ "epoch": 4.0606060606060606,
+ "grad_norm": 2.406719923019409,
+ "learning_rate": 9.414141414141415e-07,
+ "loss": 1.5087292194366455,
+ "mean_token_accuracy": 0.6460063457489014,
+ "num_tokens": 32931840.0,
+ "step": 2010
+ },
+ {
+ "entropy": 1.427893042564392,
+ "epoch": 4.062626262626263,
+ "grad_norm": 2.3738598823547363,
+ "learning_rate": 9.393939393939395e-07,
+ "loss": 1.4216761589050293,
+ "mean_token_accuracy": 0.6571201682090759,
+ "num_tokens": 32948224.0,
+ "step": 2011
+ },
+ {
+ "entropy": 1.1727535724639893,
+ "epoch": 4.064646464646465,
+ "grad_norm": 1.9937793016433716,
+ "learning_rate": 9.373737373737376e-07,
+ "loss": 1.1711244583129883,
+ "mean_token_accuracy": 0.7261846661567688,
+ "num_tokens": 32964608.0,
+ "step": 2012
+ },
+ {
+ "entropy": 1.634767770767212,
+ "epoch": 4.066666666666666,
+ "grad_norm": 2.2499399185180664,
+ "learning_rate": 9.353535353535354e-07,
+ "loss": 1.6378939151763916,
+ "mean_token_accuracy": 0.6338544487953186,
+ "num_tokens": 32980992.0,
+ "step": 2013
+ },
+ {
+ "entropy": 1.378767967224121,
+ "epoch": 4.068686868686869,
+ "grad_norm": 2.147827386856079,
+ "learning_rate": 9.333333333333334e-07,
+ "loss": 1.3705543279647827,
+ "mean_token_accuracy": 0.6703712940216064,
+ "num_tokens": 32997376.0,
+ "step": 2014
+ },
+ {
+ "entropy": 0.8587742447853088,
+ "epoch": 4.070707070707071,
+ "grad_norm": 2.1850945949554443,
+ "learning_rate": 9.313131313131314e-07,
+ "loss": 0.8584544658660889,
+ "mean_token_accuracy": 0.7740595936775208,
+ "num_tokens": 33013760.0,
+ "step": 2015
+ },
+ {
+ "entropy": 1.180991291999817,
+ "epoch": 4.072727272727272,
+ "grad_norm": 2.3740382194519043,
+ "learning_rate": 9.292929292929294e-07,
+ "loss": 1.1824800968170166,
+ "mean_token_accuracy": 0.6996213793754578,
+ "num_tokens": 33030144.0,
+ "step": 2016
+ },
+ {
+ "entropy": 1.127561092376709,
+ "epoch": 4.074747474747475,
+ "grad_norm": 2.1335041522979736,
+ "learning_rate": 9.272727272727273e-07,
+ "loss": 1.1388006210327148,
+ "mean_token_accuracy": 0.7244137525558472,
+ "num_tokens": 33046528.0,
+ "step": 2017
+ },
+ {
+ "entropy": 1.154600977897644,
+ "epoch": 4.076767676767677,
+ "grad_norm": 2.288207530975342,
+ "learning_rate": 9.252525252525253e-07,
+ "loss": 1.1633810997009277,
+ "mean_token_accuracy": 0.7138495445251465,
+ "num_tokens": 33062912.0,
+ "step": 2018
+ },
+ {
+ "entropy": 1.3016736507415771,
+ "epoch": 4.078787878787879,
+ "grad_norm": 2.6412227153778076,
+ "learning_rate": 9.232323232323233e-07,
+ "loss": 1.3045625686645508,
+ "mean_token_accuracy": 0.6678065657615662,
+ "num_tokens": 33079296.0,
+ "step": 2019
+ },
+ {
+ "entropy": 1.461438536643982,
+ "epoch": 4.08080808080808,
+ "grad_norm": 2.4295499324798584,
+ "learning_rate": 9.212121212121213e-07,
+ "loss": 1.4820640087127686,
+ "mean_token_accuracy": 0.6492428183555603,
+ "num_tokens": 33095680.0,
+ "step": 2020
+ },
+ {
+ "entropy": 1.1305612325668335,
+ "epoch": 4.082828282828283,
+ "grad_norm": 2.3236217498779297,
+ "learning_rate": 9.191919191919192e-07,
+ "loss": 1.1307878494262695,
+ "mean_token_accuracy": 0.7134220600128174,
+ "num_tokens": 33112064.0,
+ "step": 2021
+ },
+ {
+ "entropy": 0.9688110947608948,
+ "epoch": 4.084848484848485,
+ "grad_norm": 2.404463052749634,
+ "learning_rate": 9.171717171717172e-07,
+ "loss": 0.9707077145576477,
+ "mean_token_accuracy": 0.7424889802932739,
+ "num_tokens": 33128448.0,
+ "step": 2022
+ },
+ {
+ "entropy": 1.456017255783081,
+ "epoch": 4.086868686868687,
+ "grad_norm": 2.426558017730713,
+ "learning_rate": 9.151515151515153e-07,
+ "loss": 1.4475734233856201,
+ "mean_token_accuracy": 0.6397166848182678,
+ "num_tokens": 33144832.0,
+ "step": 2023
+ },
+ {
+ "entropy": 1.1142091751098633,
+ "epoch": 4.088888888888889,
+ "grad_norm": 2.5632755756378174,
+ "learning_rate": 9.131313131313133e-07,
+ "loss": 1.1232866048812866,
+ "mean_token_accuracy": 0.7278944849967957,
+ "num_tokens": 33161216.0,
+ "step": 2024
+ },
+ {
+ "entropy": 1.4831620454788208,
+ "epoch": 4.090909090909091,
+ "grad_norm": 2.428093433380127,
+ "learning_rate": 9.111111111111113e-07,
+ "loss": 1.4886207580566406,
+ "mean_token_accuracy": 0.6450904011726379,
+ "num_tokens": 33177600.0,
+ "step": 2025
+ },
+ {
+ "entropy": 1.1659386157989502,
+ "epoch": 4.092929292929293,
+ "grad_norm": 2.404301881790161,
+ "learning_rate": 9.090909090909091e-07,
+ "loss": 1.1533830165863037,
+ "mean_token_accuracy": 0.7195896506309509,
+ "num_tokens": 33193984.0,
+ "step": 2026
+ },
+ {
+ "entropy": 1.560425877571106,
+ "epoch": 4.094949494949495,
+ "grad_norm": 2.2221803665161133,
+ "learning_rate": 9.070707070707071e-07,
+ "loss": 1.5449508428573608,
+ "mean_token_accuracy": 0.6680508255958557,
+ "num_tokens": 33210368.0,
+ "step": 2027
+ },
+ {
+ "entropy": 1.040557861328125,
+ "epoch": 4.096969696969697,
+ "grad_norm": 2.272596597671509,
+ "learning_rate": 9.050505050505051e-07,
+ "loss": 1.0452677011489868,
+ "mean_token_accuracy": 0.7357718348503113,
+ "num_tokens": 33226752.0,
+ "step": 2028
+ },
+ {
+ "entropy": 1.3482027053833008,
+ "epoch": 4.098989898989899,
+ "grad_norm": 2.360107421875,
+ "learning_rate": 9.030303030303031e-07,
+ "loss": 1.3335392475128174,
+ "mean_token_accuracy": 0.6714704632759094,
+ "num_tokens": 33243136.0,
+ "step": 2029
+ },
+ {
+ "entropy": 1.2164970636367798,
+ "epoch": 4.101010101010101,
+ "grad_norm": 2.100684881210327,
+ "learning_rate": 9.01010101010101e-07,
+ "loss": 1.2075049877166748,
+ "mean_token_accuracy": 0.7048729658126831,
+ "num_tokens": 33259520.0,
+ "step": 2030
+ },
+ {
+ "entropy": 0.9130767583847046,
+ "epoch": 4.1030303030303035,
+ "grad_norm": 2.145026922225952,
+ "learning_rate": 8.98989898989899e-07,
+ "loss": 0.9055933356285095,
+ "mean_token_accuracy": 0.758671224117279,
+ "num_tokens": 33275904.0,
+ "step": 2031
+ },
+ {
+ "entropy": 0.9220786094665527,
+ "epoch": 4.105050505050505,
+ "grad_norm": 2.0946104526519775,
+ "learning_rate": 8.96969696969697e-07,
+ "loss": 0.9177285432815552,
+ "mean_token_accuracy": 0.7683805823326111,
+ "num_tokens": 33292288.0,
+ "step": 2032
+ },
+ {
+ "entropy": 1.2093071937561035,
+ "epoch": 4.107070707070707,
+ "grad_norm": 2.0910632610321045,
+ "learning_rate": 8.94949494949495e-07,
+ "loss": 1.2280278205871582,
+ "mean_token_accuracy": 0.7200170755386353,
+ "num_tokens": 33308672.0,
+ "step": 2033
+ },
+ {
+ "entropy": 1.3322206735610962,
+ "epoch": 4.109090909090909,
+ "grad_norm": 2.3038177490234375,
+ "learning_rate": 8.929292929292931e-07,
+ "loss": 1.3241100311279297,
+ "mean_token_accuracy": 0.6911944150924683,
+ "num_tokens": 33325056.0,
+ "step": 2034
+ },
+ {
+ "entropy": 1.2418142557144165,
+ "epoch": 4.111111111111111,
+ "grad_norm": 2.1876115798950195,
+ "learning_rate": 8.90909090909091e-07,
+ "loss": 1.2438215017318726,
+ "mean_token_accuracy": 0.7025524973869324,
+ "num_tokens": 33341440.0,
+ "step": 2035
+ },
+ {
+ "entropy": 1.2280832529067993,
+ "epoch": 4.113131313131313,
+ "grad_norm": 2.4577319622039795,
+ "learning_rate": 8.88888888888889e-07,
+ "loss": 1.202743411064148,
+ "mean_token_accuracy": 0.6992549896240234,
+ "num_tokens": 33357824.0,
+ "step": 2036
+ },
+ {
+ "entropy": 1.132125735282898,
+ "epoch": 4.115151515151515,
+ "grad_norm": 2.29577898979187,
+ "learning_rate": 8.86868686868687e-07,
+ "loss": 1.107844591140747,
+ "mean_token_accuracy": 0.7243527173995972,
+ "num_tokens": 33374208.0,
+ "step": 2037
+ },
+ {
+ "entropy": 1.8715779781341553,
+ "epoch": 4.1171717171717175,
+ "grad_norm": 2.433678388595581,
+ "learning_rate": 8.84848484848485e-07,
+ "loss": 1.8939162492752075,
+ "mean_token_accuracy": 0.611932098865509,
+ "num_tokens": 33390592.0,
+ "step": 2038
+ },
+ {
+ "entropy": 1.3923977613449097,
+ "epoch": 4.119191919191919,
+ "grad_norm": 2.385688066482544,
+ "learning_rate": 8.828282828282829e-07,
+ "loss": 1.3869637250900269,
+ "mean_token_accuracy": 0.6941866278648376,
+ "num_tokens": 33406976.0,
+ "step": 2039
+ },
+ {
+ "entropy": 1.6810003519058228,
+ "epoch": 4.121212121212121,
+ "grad_norm": 2.4660162925720215,
+ "learning_rate": 8.808080808080808e-07,
+ "loss": 1.6879138946533203,
+ "mean_token_accuracy": 0.6045432090759277,
+ "num_tokens": 33423360.0,
+ "step": 2040
+ },
+ {
+ "entropy": 1.1977758407592773,
+ "epoch": 4.123232323232323,
+ "grad_norm": 2.199223518371582,
+ "learning_rate": 8.787878787878788e-07,
+ "loss": 1.2097350358963013,
+ "mean_token_accuracy": 0.7071323990821838,
+ "num_tokens": 33439744.0,
+ "step": 2041
+ },
+ {
+ "entropy": 1.3029590845108032,
+ "epoch": 4.125252525252526,
+ "grad_norm": 2.3923046588897705,
+ "learning_rate": 8.767676767676768e-07,
+ "loss": 1.323540210723877,
+ "mean_token_accuracy": 0.6738519668579102,
+ "num_tokens": 33456128.0,
+ "step": 2042
+ },
+ {
+ "entropy": 0.8669192790985107,
+ "epoch": 4.127272727272727,
+ "grad_norm": 2.2486660480499268,
+ "learning_rate": 8.747474747474747e-07,
+ "loss": 0.8708467483520508,
+ "mean_token_accuracy": 0.7698461413383484,
+ "num_tokens": 33472512.0,
+ "step": 2043
+ },
+ {
+ "entropy": 1.0041810274124146,
+ "epoch": 4.129292929292929,
+ "grad_norm": 2.2023773193359375,
+ "learning_rate": 8.727272727272728e-07,
+ "loss": 0.9956705570220947,
+ "mean_token_accuracy": 0.746275007724762,
+ "num_tokens": 33488896.0,
+ "step": 2044
+ },
+ {
+ "entropy": 0.8258928060531616,
+ "epoch": 4.1313131313131315,
+ "grad_norm": 2.158754825592041,
+ "learning_rate": 8.707070707070708e-07,
+ "loss": 0.8288166522979736,
+ "mean_token_accuracy": 0.7741817235946655,
+ "num_tokens": 33505280.0,
+ "step": 2045
+ },
+ {
+ "entropy": 1.3376224040985107,
+ "epoch": 4.133333333333334,
+ "grad_norm": 2.277294397354126,
+ "learning_rate": 8.686868686868688e-07,
+ "loss": 1.331207036972046,
+ "mean_token_accuracy": 0.6915608048439026,
+ "num_tokens": 33521664.0,
+ "step": 2046
+ },
+ {
+ "entropy": 0.8669873476028442,
+ "epoch": 4.135353535353535,
+ "grad_norm": 2.3317325115203857,
+ "learning_rate": 8.666666666666668e-07,
+ "loss": 0.8673149943351746,
+ "mean_token_accuracy": 0.7650219798088074,
+ "num_tokens": 33538048.0,
+ "step": 2047
+ },
+ {
+ "entropy": 1.4122123718261719,
+ "epoch": 4.137373737373737,
+ "grad_norm": 2.4016566276550293,
+ "learning_rate": 8.646464646464647e-07,
+ "loss": 1.4340333938598633,
+ "mean_token_accuracy": 0.6679286956787109,
+ "num_tokens": 33554432.0,
+ "step": 2048
+ },
+ {
+ "entropy": 1.1499886512756348,
+ "epoch": 4.13939393939394,
+ "grad_norm": 2.3876852989196777,
+ "learning_rate": 8.626262626262627e-07,
+ "loss": 1.1466901302337646,
+ "mean_token_accuracy": 0.7115290760993958,
+ "num_tokens": 33570816.0,
+ "step": 2049
+ },
+ {
+ "entropy": 1.260066270828247,
+ "epoch": 4.141414141414141,
+ "grad_norm": 2.383570909500122,
+ "learning_rate": 8.606060606060607e-07,
+ "loss": 1.2224504947662354,
+ "mean_token_accuracy": 0.6926599740982056,
+ "num_tokens": 33587200.0,
+ "step": 2050
+ },
+ {
+ "epoch": 4.141414141414141,
+ "eval_entropy": 1.2900591329220803,
+ "eval_loss": 1.561437964439392,
+ "eval_mean_token_accuracy": 0.643797178422251,
+ "eval_num_tokens": 33587200.0,
+ "eval_runtime": 43.833,
+ "eval_samples_per_second": 22.586,
+ "eval_steps_per_second": 2.829,
+ "step": 2050
+ },
+ {
+ "entropy": 1.233297348022461,
+ "epoch": 4.143434343434343,
+ "grad_norm": 2.400827407836914,
+ "learning_rate": 8.585858585858587e-07,
+ "loss": 1.2277863025665283,
+ "mean_token_accuracy": 0.696201741695404,
+ "num_tokens": 33603584.0,
+ "step": 2051
+ },
+ {
+ "entropy": 1.1504113674163818,
+ "epoch": 4.1454545454545455,
+ "grad_norm": 2.1206517219543457,
+ "learning_rate": 8.565656565656566e-07,
+ "loss": 1.1498513221740723,
+ "mean_token_accuracy": 0.7126892805099487,
+ "num_tokens": 33619968.0,
+ "step": 2052
+ },
+ {
+ "entropy": 1.2686772346496582,
+ "epoch": 4.147474747474748,
+ "grad_norm": 2.293596029281616,
+ "learning_rate": 8.545454545454546e-07,
+ "loss": 1.271289348602295,
+ "mean_token_accuracy": 0.6941255331039429,
+ "num_tokens": 33636352.0,
+ "step": 2053
+ },
+ {
+ "entropy": 1.0670050382614136,
+ "epoch": 4.149494949494949,
+ "grad_norm": 2.4050474166870117,
+ "learning_rate": 8.525252525252525e-07,
+ "loss": 1.077490210533142,
+ "mean_token_accuracy": 0.7255740165710449,
+ "num_tokens": 33652736.0,
+ "step": 2054
+ },
+ {
+ "entropy": 1.2747689485549927,
+ "epoch": 4.151515151515151,
+ "grad_norm": 2.327498197555542,
+ "learning_rate": 8.505050505050506e-07,
+ "loss": 1.2684743404388428,
+ "mean_token_accuracy": 0.695713222026825,
+ "num_tokens": 33669120.0,
+ "step": 2055
+ },
+ {
+ "entropy": 1.4799714088439941,
+ "epoch": 4.153535353535354,
+ "grad_norm": 2.347869396209717,
+ "learning_rate": 8.484848484848486e-07,
+ "loss": 1.4689722061157227,
+ "mean_token_accuracy": 0.6625549793243408,
+ "num_tokens": 33685504.0,
+ "step": 2056
+ },
+ {
+ "entropy": 1.1450932025909424,
+ "epoch": 4.155555555555556,
+ "grad_norm": 2.486754894256592,
+ "learning_rate": 8.464646464646465e-07,
+ "loss": 1.1476457118988037,
+ "mean_token_accuracy": 0.705483615398407,
+ "num_tokens": 33701888.0,
+ "step": 2057
+ },
+ {
+ "entropy": 1.6324634552001953,
+ "epoch": 4.157575757575757,
+ "grad_norm": 2.251194477081299,
+ "learning_rate": 8.444444444444445e-07,
+ "loss": 1.620585560798645,
+ "mean_token_accuracy": 0.6596848964691162,
+ "num_tokens": 33718272.0,
+ "step": 2058
+ },
+ {
+ "entropy": 1.295936107635498,
+ "epoch": 4.1595959595959595,
+ "grad_norm": 2.140843629837036,
+ "learning_rate": 8.424242424242425e-07,
+ "loss": 1.2875292301177979,
+ "mean_token_accuracy": 0.708109438419342,
+ "num_tokens": 33734656.0,
+ "step": 2059
+ },
+ {
+ "entropy": 1.292955756187439,
+ "epoch": 4.161616161616162,
+ "grad_norm": 2.4827163219451904,
+ "learning_rate": 8.404040404040405e-07,
+ "loss": 1.2855807542800903,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 33751040.0,
+ "step": 2060
+ },
+ {
+ "entropy": 0.9475373029708862,
+ "epoch": 4.163636363636364,
+ "grad_norm": 2.347381114959717,
+ "learning_rate": 8.383838383838384e-07,
+ "loss": 0.934272289276123,
+ "mean_token_accuracy": 0.7487787008285522,
+ "num_tokens": 33767424.0,
+ "step": 2061
+ },
+ {
+ "entropy": 1.2446081638336182,
+ "epoch": 4.165656565656565,
+ "grad_norm": 2.2981362342834473,
+ "learning_rate": 8.363636363636364e-07,
+ "loss": 1.2680091857910156,
+ "mean_token_accuracy": 0.7056668400764465,
+ "num_tokens": 33783808.0,
+ "step": 2062
+ },
+ {
+ "entropy": 1.1058030128479004,
+ "epoch": 4.167676767676768,
+ "grad_norm": 2.0872671604156494,
+ "learning_rate": 8.343434343434344e-07,
+ "loss": 1.093427062034607,
+ "mean_token_accuracy": 0.7307645082473755,
+ "num_tokens": 33800192.0,
+ "step": 2063
+ },
+ {
+ "entropy": 1.4973342418670654,
+ "epoch": 4.16969696969697,
+ "grad_norm": 2.4032182693481445,
+ "learning_rate": 8.323232323232324e-07,
+ "loss": 1.5094172954559326,
+ "mean_token_accuracy": 0.6663410067558289,
+ "num_tokens": 33816576.0,
+ "step": 2064
+ },
+ {
+ "entropy": 0.8914118409156799,
+ "epoch": 4.171717171717171,
+ "grad_norm": 2.370084047317505,
+ "learning_rate": 8.303030303030303e-07,
+ "loss": 0.8813928365707397,
+ "mean_token_accuracy": 0.7614191770553589,
+ "num_tokens": 33832960.0,
+ "step": 2065
+ },
+ {
+ "entropy": 1.1234400272369385,
+ "epoch": 4.1737373737373735,
+ "grad_norm": 2.2805073261260986,
+ "learning_rate": 8.282828282828284e-07,
+ "loss": 1.119314432144165,
+ "mean_token_accuracy": 0.7155593633651733,
+ "num_tokens": 33849344.0,
+ "step": 2066
+ },
+ {
+ "entropy": 0.9295584559440613,
+ "epoch": 4.175757575757576,
+ "grad_norm": 2.3400092124938965,
+ "learning_rate": 8.262626262626264e-07,
+ "loss": 0.925437867641449,
+ "mean_token_accuracy": 0.7456643581390381,
+ "num_tokens": 33865728.0,
+ "step": 2067
+ },
+ {
+ "entropy": 1.2219396829605103,
+ "epoch": 4.177777777777778,
+ "grad_norm": 2.5290143489837646,
+ "learning_rate": 8.242424242424244e-07,
+ "loss": 1.2008111476898193,
+ "mean_token_accuracy": 0.7040180563926697,
+ "num_tokens": 33882112.0,
+ "step": 2068
+ },
+ {
+ "entropy": 1.3869670629501343,
+ "epoch": 4.179797979797979,
+ "grad_norm": 2.4521372318267822,
+ "learning_rate": 8.222222222222223e-07,
+ "loss": 1.3759180307388306,
+ "mean_token_accuracy": 0.6649975776672363,
+ "num_tokens": 33898496.0,
+ "step": 2069
+ },
+ {
+ "entropy": 0.9756981730461121,
+ "epoch": 4.181818181818182,
+ "grad_norm": 2.1221506595611572,
+ "learning_rate": 8.202020202020202e-07,
+ "loss": 0.9636279344558716,
+ "mean_token_accuracy": 0.7576331496238708,
+ "num_tokens": 33914880.0,
+ "step": 2070
+ },
+ {
+ "entropy": 0.8014331459999084,
+ "epoch": 4.183838383838384,
+ "grad_norm": 2.1101298332214355,
+ "learning_rate": 8.181818181818182e-07,
+ "loss": 0.7967961430549622,
+ "mean_token_accuracy": 0.7816316485404968,
+ "num_tokens": 33931264.0,
+ "step": 2071
+ },
+ {
+ "entropy": 1.141619086265564,
+ "epoch": 4.185858585858586,
+ "grad_norm": 2.259256601333618,
+ "learning_rate": 8.161616161616162e-07,
+ "loss": 1.1158604621887207,
+ "mean_token_accuracy": 0.7250854969024658,
+ "num_tokens": 33947648.0,
+ "step": 2072
+ },
+ {
+ "entropy": 0.8742624521255493,
+ "epoch": 4.1878787878787875,
+ "grad_norm": 2.200969934463501,
+ "learning_rate": 8.141414141414142e-07,
+ "loss": 0.8776901364326477,
+ "mean_token_accuracy": 0.7754641175270081,
+ "num_tokens": 33964032.0,
+ "step": 2073
+ },
+ {
+ "entropy": 1.1458066701889038,
+ "epoch": 4.18989898989899,
+ "grad_norm": 2.365546703338623,
+ "learning_rate": 8.121212121212121e-07,
+ "loss": 1.1447772979736328,
+ "mean_token_accuracy": 0.7194064259529114,
+ "num_tokens": 33980416.0,
+ "step": 2074
+ },
+ {
+ "entropy": 1.0582295656204224,
+ "epoch": 4.191919191919192,
+ "grad_norm": 2.2105917930603027,
+ "learning_rate": 8.101010101010101e-07,
+ "loss": 1.0469292402267456,
+ "mean_token_accuracy": 0.7400463819503784,
+ "num_tokens": 33996800.0,
+ "step": 2075
+ },
+ {
+ "entropy": 1.318009376525879,
+ "epoch": 4.193939393939394,
+ "grad_norm": 2.4097955226898193,
+ "learning_rate": 8.080808080808082e-07,
+ "loss": 1.321338415145874,
+ "mean_token_accuracy": 0.6783097386360168,
+ "num_tokens": 34013184.0,
+ "step": 2076
+ },
+ {
+ "entropy": 1.3597925901412964,
+ "epoch": 4.195959595959596,
+ "grad_norm": 2.0832197666168213,
+ "learning_rate": 8.060606060606062e-07,
+ "loss": 1.3505959510803223,
+ "mean_token_accuracy": 0.6894845962524414,
+ "num_tokens": 34029568.0,
+ "step": 2077
+ },
+ {
+ "entropy": 1.1852680444717407,
+ "epoch": 4.197979797979798,
+ "grad_norm": 2.3396389484405518,
+ "learning_rate": 8.040404040404042e-07,
+ "loss": 1.1788443326950073,
+ "mean_token_accuracy": 0.7175134420394897,
+ "num_tokens": 34045952.0,
+ "step": 2078
+ },
+ {
+ "entropy": 1.1703139543533325,
+ "epoch": 4.2,
+ "grad_norm": 2.4051332473754883,
+ "learning_rate": 8.020202020202021e-07,
+ "loss": 1.179924488067627,
+ "mean_token_accuracy": 0.7060942649841309,
+ "num_tokens": 34062336.0,
+ "step": 2079
+ },
+ {
+ "entropy": 0.8304579854011536,
+ "epoch": 4.202020202020202,
+ "grad_norm": 2.030073404312134,
+ "learning_rate": 8.000000000000001e-07,
+ "loss": 0.8240759968757629,
+ "mean_token_accuracy": 0.784745991230011,
+ "num_tokens": 34078720.0,
+ "step": 2080
+ },
+ {
+ "entropy": 0.9552163481712341,
+ "epoch": 4.204040404040404,
+ "grad_norm": 2.1599645614624023,
+ "learning_rate": 7.979797979797981e-07,
+ "loss": 0.9678778648376465,
+ "mean_token_accuracy": 0.753724992275238,
+ "num_tokens": 34095104.0,
+ "step": 2081
+ },
+ {
+ "entropy": 1.700339913368225,
+ "epoch": 4.206060606060606,
+ "grad_norm": 2.778423309326172,
+ "learning_rate": 7.959595959595961e-07,
+ "loss": 1.6714180707931519,
+ "mean_token_accuracy": 0.6206033229827881,
+ "num_tokens": 34111488.0,
+ "step": 2082
+ },
+ {
+ "entropy": 1.2214075326919556,
+ "epoch": 4.208080808080808,
+ "grad_norm": 2.4050512313842773,
+ "learning_rate": 7.939393939393939e-07,
+ "loss": 1.2122421264648438,
+ "mean_token_accuracy": 0.6995603442192078,
+ "num_tokens": 34127872.0,
+ "step": 2083
+ },
+ {
+ "entropy": 1.0523896217346191,
+ "epoch": 4.21010101010101,
+ "grad_norm": 2.1733455657958984,
+ "learning_rate": 7.919191919191919e-07,
+ "loss": 1.0562810897827148,
+ "mean_token_accuracy": 0.7385808229446411,
+ "num_tokens": 34144256.0,
+ "step": 2084
+ },
+ {
+ "entropy": 1.3346856832504272,
+ "epoch": 4.212121212121212,
+ "grad_norm": 2.446331739425659,
+ "learning_rate": 7.898989898989899e-07,
+ "loss": 1.325127363204956,
+ "mean_token_accuracy": 0.6767830848693848,
+ "num_tokens": 34160640.0,
+ "step": 2085
+ },
+ {
+ "entropy": 1.216209888458252,
+ "epoch": 4.214141414141414,
+ "grad_norm": 2.2457573413848877,
+ "learning_rate": 7.878787878787879e-07,
+ "loss": 1.1888031959533691,
+ "mean_token_accuracy": 0.7133610248565674,
+ "num_tokens": 34177024.0,
+ "step": 2086
+ },
+ {
+ "entropy": 1.2156273126602173,
+ "epoch": 4.216161616161616,
+ "grad_norm": 2.2188119888305664,
+ "learning_rate": 7.85858585858586e-07,
+ "loss": 1.2307485342025757,
+ "mean_token_accuracy": 0.7011480331420898,
+ "num_tokens": 34193408.0,
+ "step": 2087
+ },
+ {
+ "entropy": 1.0172580480575562,
+ "epoch": 4.218181818181818,
+ "grad_norm": 1.8507698774337769,
+ "learning_rate": 7.838383838383839e-07,
+ "loss": 0.9992572069168091,
+ "mean_token_accuracy": 0.7587933540344238,
+ "num_tokens": 34209792.0,
+ "step": 2088
+ },
+ {
+ "entropy": 1.3547221422195435,
+ "epoch": 4.22020202020202,
+ "grad_norm": 2.2932472229003906,
+ "learning_rate": 7.818181818181819e-07,
+ "loss": 1.3692772388458252,
+ "mean_token_accuracy": 0.669577419757843,
+ "num_tokens": 34226176.0,
+ "step": 2089
+ },
+ {
+ "entropy": 1.3517241477966309,
+ "epoch": 4.222222222222222,
+ "grad_norm": 2.362355947494507,
+ "learning_rate": 7.797979797979799e-07,
+ "loss": 1.3620293140411377,
+ "mean_token_accuracy": 0.6656692624092102,
+ "num_tokens": 34242560.0,
+ "step": 2090
+ },
+ {
+ "entropy": 1.0812968015670776,
+ "epoch": 4.224242424242425,
+ "grad_norm": 2.288313627243042,
+ "learning_rate": 7.777777777777779e-07,
+ "loss": 1.0882915258407593,
+ "mean_token_accuracy": 0.7280776500701904,
+ "num_tokens": 34258944.0,
+ "step": 2091
+ },
+ {
+ "entropy": 1.2385846376419067,
+ "epoch": 4.226262626262626,
+ "grad_norm": 2.2588205337524414,
+ "learning_rate": 7.757575757575758e-07,
+ "loss": 1.2337942123413086,
+ "mean_token_accuracy": 0.6944919228553772,
+ "num_tokens": 34275328.0,
+ "step": 2092
+ },
+ {
+ "entropy": 0.8685792088508606,
+ "epoch": 4.228282828282828,
+ "grad_norm": 2.193739175796509,
+ "learning_rate": 7.737373737373738e-07,
+ "loss": 0.8698766827583313,
+ "mean_token_accuracy": 0.7663654088973999,
+ "num_tokens": 34291712.0,
+ "step": 2093
+ },
+ {
+ "entropy": 1.2384530305862427,
+ "epoch": 4.2303030303030305,
+ "grad_norm": 2.3214962482452393,
+ "learning_rate": 7.717171717171718e-07,
+ "loss": 1.2307186126708984,
+ "mean_token_accuracy": 0.7134831547737122,
+ "num_tokens": 34308096.0,
+ "step": 2094
+ },
+ {
+ "entropy": 1.4578503370285034,
+ "epoch": 4.232323232323233,
+ "grad_norm": 2.4814023971557617,
+ "learning_rate": 7.696969696969698e-07,
+ "loss": 1.4594008922576904,
+ "mean_token_accuracy": 0.6678676009178162,
+ "num_tokens": 34324480.0,
+ "step": 2095
+ },
+ {
+ "entropy": 0.9257369041442871,
+ "epoch": 4.234343434343434,
+ "grad_norm": 2.2866013050079346,
+ "learning_rate": 7.676767676767677e-07,
+ "loss": 0.933411717414856,
+ "mean_token_accuracy": 0.7463971376419067,
+ "num_tokens": 34340864.0,
+ "step": 2096
+ },
+ {
+ "entropy": 0.8323895335197449,
+ "epoch": 4.236363636363636,
+ "grad_norm": 2.132780075073242,
+ "learning_rate": 7.656565656565656e-07,
+ "loss": 0.822212278842926,
+ "mean_token_accuracy": 0.7714338302612305,
+ "num_tokens": 34357248.0,
+ "step": 2097
+ },
+ {
+ "entropy": 1.3601847887039185,
+ "epoch": 4.238383838383839,
+ "grad_norm": 2.483175039291382,
+ "learning_rate": 7.636363636363637e-07,
+ "loss": 1.3723442554473877,
+ "mean_token_accuracy": 0.6633487939834595,
+ "num_tokens": 34373632.0,
+ "step": 2098
+ },
+ {
+ "entropy": 1.109177589416504,
+ "epoch": 4.240404040404041,
+ "grad_norm": 2.1533427238464355,
+ "learning_rate": 7.616161616161617e-07,
+ "loss": 1.0950508117675781,
+ "mean_token_accuracy": 0.7376037836074829,
+ "num_tokens": 34390016.0,
+ "step": 2099
+ },
+ {
+ "entropy": 0.9974305033683777,
+ "epoch": 4.242424242424242,
+ "grad_norm": 2.475922107696533,
+ "learning_rate": 7.595959595959597e-07,
+ "loss": 0.979351282119751,
+ "mean_token_accuracy": 0.7522594332695007,
+ "num_tokens": 34406400.0,
+ "step": 2100
+ },
+ {
+ "epoch": 4.242424242424242,
+ "eval_entropy": 1.2880813412127956,
+ "eval_loss": 1.562015175819397,
+ "eval_mean_token_accuracy": 0.6436735732901481,
+ "eval_num_tokens": 34406400.0,
+ "eval_runtime": 43.7511,
+ "eval_samples_per_second": 22.628,
+ "eval_steps_per_second": 2.834,
+ "step": 2100
+ },
+ {
+ "entropy": 1.4373509883880615,
+ "epoch": 4.2444444444444445,
+ "grad_norm": 2.398466110229492,
+ "learning_rate": 7.575757575757576e-07,
+ "loss": 1.4485313892364502,
+ "mean_token_accuracy": 0.6607840657234192,
+ "num_tokens": 34422784.0,
+ "step": 2101
+ },
+ {
+ "entropy": 1.1279411315917969,
+ "epoch": 4.246464646464647,
+ "grad_norm": 2.1290903091430664,
+ "learning_rate": 7.555555555555556e-07,
+ "loss": 1.1336861848831177,
+ "mean_token_accuracy": 0.7290546894073486,
+ "num_tokens": 34439168.0,
+ "step": 2102
+ },
+ {
+ "entropy": 1.453575849533081,
+ "epoch": 4.248484848484848,
+ "grad_norm": 2.205562114715576,
+ "learning_rate": 7.535353535353536e-07,
+ "loss": 1.4421193599700928,
+ "mean_token_accuracy": 0.6577308177947998,
+ "num_tokens": 34455552.0,
+ "step": 2103
+ },
+ {
+ "entropy": 0.9789026975631714,
+ "epoch": 4.25050505050505,
+ "grad_norm": 2.220710039138794,
+ "learning_rate": 7.515151515151516e-07,
+ "loss": 0.9738274812698364,
+ "mean_token_accuracy": 0.7520151734352112,
+ "num_tokens": 34471936.0,
+ "step": 2104
+ },
+ {
+ "entropy": 1.12283194065094,
+ "epoch": 4.252525252525253,
+ "grad_norm": 2.2798845767974854,
+ "learning_rate": 7.494949494949495e-07,
+ "loss": 1.111656665802002,
+ "mean_token_accuracy": 0.7236199378967285,
+ "num_tokens": 34488320.0,
+ "step": 2105
+ },
+ {
+ "entropy": 1.0451518297195435,
+ "epoch": 4.254545454545455,
+ "grad_norm": 2.389167547225952,
+ "learning_rate": 7.474747474747475e-07,
+ "loss": 1.045143723487854,
+ "mean_token_accuracy": 0.7235588431358337,
+ "num_tokens": 34504704.0,
+ "step": 2106
+ },
+ {
+ "entropy": 1.3338992595672607,
+ "epoch": 4.256565656565656,
+ "grad_norm": 2.3781392574310303,
+ "learning_rate": 7.454545454545455e-07,
+ "loss": 1.3461604118347168,
+ "mean_token_accuracy": 0.6740351915359497,
+ "num_tokens": 34521088.0,
+ "step": 2107
+ },
+ {
+ "entropy": 1.4721654653549194,
+ "epoch": 4.2585858585858585,
+ "grad_norm": 2.293487071990967,
+ "learning_rate": 7.434343434343436e-07,
+ "loss": 1.4750356674194336,
+ "mean_token_accuracy": 0.6606009006500244,
+ "num_tokens": 34537472.0,
+ "step": 2108
+ },
+ {
+ "entropy": 0.7618300914764404,
+ "epoch": 4.260606060606061,
+ "grad_norm": 2.092986583709717,
+ "learning_rate": 7.414141414141416e-07,
+ "loss": 0.7633351683616638,
+ "mean_token_accuracy": 0.7957987189292908,
+ "num_tokens": 34553856.0,
+ "step": 2109
+ },
+ {
+ "entropy": 0.9247039556503296,
+ "epoch": 4.262626262626263,
+ "grad_norm": 2.023836851119995,
+ "learning_rate": 7.393939393939395e-07,
+ "loss": 0.8996185064315796,
+ "mean_token_accuracy": 0.775036633014679,
+ "num_tokens": 34570240.0,
+ "step": 2110
+ },
+ {
+ "entropy": 1.0806818008422852,
+ "epoch": 4.264646464646464,
+ "grad_norm": 2.447587490081787,
+ "learning_rate": 7.373737373737375e-07,
+ "loss": 1.107656478881836,
+ "mean_token_accuracy": 0.7337567210197449,
+ "num_tokens": 34586624.0,
+ "step": 2111
+ },
+ {
+ "entropy": 1.4007959365844727,
+ "epoch": 4.266666666666667,
+ "grad_norm": 2.2774436473846436,
+ "learning_rate": 7.353535353535354e-07,
+ "loss": 1.3865636587142944,
+ "mean_token_accuracy": 0.6830117106437683,
+ "num_tokens": 34603008.0,
+ "step": 2112
+ },
+ {
+ "entropy": 1.0637953281402588,
+ "epoch": 4.268686868686869,
+ "grad_norm": 2.239159107208252,
+ "learning_rate": 7.333333333333334e-07,
+ "loss": 1.0556224584579468,
+ "mean_token_accuracy": 0.7425500750541687,
+ "num_tokens": 34619392.0,
+ "step": 2113
+ },
+ {
+ "entropy": 0.9682835340499878,
+ "epoch": 4.270707070707071,
+ "grad_norm": 2.5597312450408936,
+ "learning_rate": 7.313131313131313e-07,
+ "loss": 0.9757053256034851,
+ "mean_token_accuracy": 0.7452369332313538,
+ "num_tokens": 34635776.0,
+ "step": 2114
+ },
+ {
+ "entropy": 1.183341383934021,
+ "epoch": 4.2727272727272725,
+ "grad_norm": 2.5379812717437744,
+ "learning_rate": 7.292929292929293e-07,
+ "loss": 1.1930429935455322,
+ "mean_token_accuracy": 0.7052393555641174,
+ "num_tokens": 34652160.0,
+ "step": 2115
+ },
+ {
+ "entropy": 1.0186142921447754,
+ "epoch": 4.274747474747475,
+ "grad_norm": 2.3810384273529053,
+ "learning_rate": 7.272727272727273e-07,
+ "loss": 1.0331826210021973,
+ "mean_token_accuracy": 0.7370542287826538,
+ "num_tokens": 34668544.0,
+ "step": 2116
+ },
+ {
+ "entropy": 1.5887846946716309,
+ "epoch": 4.276767676767677,
+ "grad_norm": 2.179713249206543,
+ "learning_rate": 7.252525252525253e-07,
+ "loss": 1.575054407119751,
+ "mean_token_accuracy": 0.6392892003059387,
+ "num_tokens": 34684928.0,
+ "step": 2117
+ },
+ {
+ "entropy": 1.1686691045761108,
+ "epoch": 4.278787878787879,
+ "grad_norm": 2.100404739379883,
+ "learning_rate": 7.232323232323232e-07,
+ "loss": 1.1814364194869995,
+ "mean_token_accuracy": 0.7209941148757935,
+ "num_tokens": 34701312.0,
+ "step": 2118
+ },
+ {
+ "entropy": 1.2804527282714844,
+ "epoch": 4.280808080808081,
+ "grad_norm": 2.5362112522125244,
+ "learning_rate": 7.212121212121213e-07,
+ "loss": 1.278024673461914,
+ "mean_token_accuracy": 0.6805691123008728,
+ "num_tokens": 34717696.0,
+ "step": 2119
+ },
+ {
+ "entropy": 1.141945481300354,
+ "epoch": 4.282828282828283,
+ "grad_norm": 2.4499824047088623,
+ "learning_rate": 7.191919191919193e-07,
+ "loss": 1.1508493423461914,
+ "mean_token_accuracy": 0.7129335403442383,
+ "num_tokens": 34734080.0,
+ "step": 2120
+ },
+ {
+ "entropy": 1.1163101196289062,
+ "epoch": 4.284848484848485,
+ "grad_norm": 2.3706541061401367,
+ "learning_rate": 7.171717171717173e-07,
+ "loss": 1.0950313806533813,
+ "mean_token_accuracy": 0.7261846661567688,
+ "num_tokens": 34750464.0,
+ "step": 2121
+ },
+ {
+ "entropy": 1.0530426502227783,
+ "epoch": 4.2868686868686865,
+ "grad_norm": 2.1800615787506104,
+ "learning_rate": 7.151515151515153e-07,
+ "loss": 1.0400605201721191,
+ "mean_token_accuracy": 0.744076669216156,
+ "num_tokens": 34766848.0,
+ "step": 2122
+ },
+ {
+ "entropy": 1.4187507629394531,
+ "epoch": 4.288888888888889,
+ "grad_norm": 2.283302068710327,
+ "learning_rate": 7.131313131313132e-07,
+ "loss": 1.4388368129730225,
+ "mean_token_accuracy": 0.659807026386261,
+ "num_tokens": 34783232.0,
+ "step": 2123
+ },
+ {
+ "entropy": 1.04351806640625,
+ "epoch": 4.290909090909091,
+ "grad_norm": 2.2792043685913086,
+ "learning_rate": 7.111111111111112e-07,
+ "loss": 1.0404431819915771,
+ "mean_token_accuracy": 0.7292379140853882,
+ "num_tokens": 34799616.0,
+ "step": 2124
+ },
+ {
+ "entropy": 1.4637887477874756,
+ "epoch": 4.292929292929293,
+ "grad_norm": 2.4931323528289795,
+ "learning_rate": 7.090909090909092e-07,
+ "loss": 1.4716092348098755,
+ "mean_token_accuracy": 0.6443576216697693,
+ "num_tokens": 34816000.0,
+ "step": 2125
+ },
+ {
+ "entropy": 1.133570909500122,
+ "epoch": 4.294949494949495,
+ "grad_norm": 2.2696118354797363,
+ "learning_rate": 7.070707070707071e-07,
+ "loss": 1.138695240020752,
+ "mean_token_accuracy": 0.7142159342765808,
+ "num_tokens": 34832384.0,
+ "step": 2126
+ },
+ {
+ "entropy": 1.057089924812317,
+ "epoch": 4.296969696969697,
+ "grad_norm": 2.3984944820404053,
+ "learning_rate": 7.05050505050505e-07,
+ "loss": 1.0433732271194458,
+ "mean_token_accuracy": 0.7341231107711792,
+ "num_tokens": 34848768.0,
+ "step": 2127
+ },
+ {
+ "entropy": 1.287866234779358,
+ "epoch": 4.298989898989899,
+ "grad_norm": 2.204712152481079,
+ "learning_rate": 7.03030303030303e-07,
+ "loss": 1.3041845560073853,
+ "mean_token_accuracy": 0.687530517578125,
+ "num_tokens": 34865152.0,
+ "step": 2128
+ },
+ {
+ "entropy": 1.1710352897644043,
+ "epoch": 4.301010101010101,
+ "grad_norm": 2.5103063583374023,
+ "learning_rate": 7.01010101010101e-07,
+ "loss": 1.1735949516296387,
+ "mean_token_accuracy": 0.7047508358955383,
+ "num_tokens": 34881536.0,
+ "step": 2129
+ },
+ {
+ "entropy": 0.8662670850753784,
+ "epoch": 4.303030303030303,
+ "grad_norm": 2.1789443492889404,
+ "learning_rate": 6.989898989898991e-07,
+ "loss": 0.8674213290214539,
+ "mean_token_accuracy": 0.7714948654174805,
+ "num_tokens": 34897920.0,
+ "step": 2130
+ },
+ {
+ "entropy": 1.1292206048965454,
+ "epoch": 4.305050505050505,
+ "grad_norm": 2.3685660362243652,
+ "learning_rate": 6.969696969696971e-07,
+ "loss": 1.1365619897842407,
+ "mean_token_accuracy": 0.7210552096366882,
+ "num_tokens": 34914304.0,
+ "step": 2131
+ },
+ {
+ "entropy": 1.0297276973724365,
+ "epoch": 4.307070707070707,
+ "grad_norm": 2.4006168842315674,
+ "learning_rate": 6.94949494949495e-07,
+ "loss": 1.0344676971435547,
+ "mean_token_accuracy": 0.7421836853027344,
+ "num_tokens": 34930688.0,
+ "step": 2132
+ },
+ {
+ "entropy": 0.8545892834663391,
+ "epoch": 4.309090909090909,
+ "grad_norm": 2.171968698501587,
+ "learning_rate": 6.92929292929293e-07,
+ "loss": 0.8570476770401001,
+ "mean_token_accuracy": 0.7680141925811768,
+ "num_tokens": 34947072.0,
+ "step": 2133
+ },
+ {
+ "entropy": 0.9131754040718079,
+ "epoch": 4.311111111111111,
+ "grad_norm": 2.3538546562194824,
+ "learning_rate": 6.90909090909091e-07,
+ "loss": 0.9100440740585327,
+ "mean_token_accuracy": 0.755984365940094,
+ "num_tokens": 34963456.0,
+ "step": 2134
+ },
+ {
+ "entropy": 1.3461705446243286,
+ "epoch": 4.313131313131313,
+ "grad_norm": 2.226499080657959,
+ "learning_rate": 6.88888888888889e-07,
+ "loss": 1.3430912494659424,
+ "mean_token_accuracy": 0.6741573214530945,
+ "num_tokens": 34979840.0,
+ "step": 2135
+ },
+ {
+ "entropy": 1.0766938924789429,
+ "epoch": 4.315151515151515,
+ "grad_norm": 2.382495880126953,
+ "learning_rate": 6.868686868686869e-07,
+ "loss": 1.0890635251998901,
+ "mean_token_accuracy": 0.7278944849967957,
+ "num_tokens": 34996224.0,
+ "step": 2136
+ },
+ {
+ "entropy": 0.8639549016952515,
+ "epoch": 4.317171717171717,
+ "grad_norm": 2.2745895385742188,
+ "learning_rate": 6.848484848484849e-07,
+ "loss": 0.8547804355621338,
+ "mean_token_accuracy": 0.7794944047927856,
+ "num_tokens": 35012608.0,
+ "step": 2137
+ },
+ {
+ "entropy": 1.1669604778289795,
+ "epoch": 4.319191919191919,
+ "grad_norm": 2.2132558822631836,
+ "learning_rate": 6.828282828282829e-07,
+ "loss": 1.1499347686767578,
+ "mean_token_accuracy": 0.7079873085021973,
+ "num_tokens": 35028992.0,
+ "step": 2138
+ },
+ {
+ "entropy": 1.4229295253753662,
+ "epoch": 4.321212121212121,
+ "grad_norm": 2.2925033569335938,
+ "learning_rate": 6.808080808080809e-07,
+ "loss": 1.4052009582519531,
+ "mean_token_accuracy": 0.6652418375015259,
+ "num_tokens": 35045376.0,
+ "step": 2139
+ },
+ {
+ "entropy": 1.175937294960022,
+ "epoch": 4.3232323232323235,
+ "grad_norm": 2.878568172454834,
+ "learning_rate": 6.78787878787879e-07,
+ "loss": 1.173958659172058,
+ "mean_token_accuracy": 0.7080483436584473,
+ "num_tokens": 35061760.0,
+ "step": 2140
+ },
+ {
+ "entropy": 1.1963285207748413,
+ "epoch": 4.325252525252525,
+ "grad_norm": 2.5476808547973633,
+ "learning_rate": 6.767676767676768e-07,
+ "loss": 1.2027249336242676,
+ "mean_token_accuracy": 0.7070713043212891,
+ "num_tokens": 35078144.0,
+ "step": 2141
+ },
+ {
+ "entropy": 1.4109331369400024,
+ "epoch": 4.327272727272727,
+ "grad_norm": 2.547231435775757,
+ "learning_rate": 6.747474747474748e-07,
+ "loss": 1.4095146656036377,
+ "mean_token_accuracy": 0.6638373136520386,
+ "num_tokens": 35094528.0,
+ "step": 2142
+ },
+ {
+ "entropy": 1.2844510078430176,
+ "epoch": 4.329292929292929,
+ "grad_norm": 2.398951768875122,
+ "learning_rate": 6.727272727272728e-07,
+ "loss": 1.268770694732666,
+ "mean_token_accuracy": 0.7037127614021301,
+ "num_tokens": 35110912.0,
+ "step": 2143
+ },
+ {
+ "entropy": 1.3457868099212646,
+ "epoch": 4.331313131313132,
+ "grad_norm": 2.4499454498291016,
+ "learning_rate": 6.707070707070708e-07,
+ "loss": 1.355639934539795,
+ "mean_token_accuracy": 0.6747679710388184,
+ "num_tokens": 35127296.0,
+ "step": 2144
+ },
+ {
+ "entropy": 1.2578988075256348,
+ "epoch": 4.333333333333333,
+ "grad_norm": 2.3502230644226074,
+ "learning_rate": 6.686868686868687e-07,
+ "loss": 1.2514359951019287,
+ "mean_token_accuracy": 0.6861260533332825,
+ "num_tokens": 35143680.0,
+ "step": 2145
+ },
+ {
+ "entropy": 0.9508306384086609,
+ "epoch": 4.335353535353535,
+ "grad_norm": 2.344722270965576,
+ "learning_rate": 6.666666666666667e-07,
+ "loss": 0.9492694139480591,
+ "mean_token_accuracy": 0.7473741769790649,
+ "num_tokens": 35160064.0,
+ "step": 2146
+ },
+ {
+ "entropy": 1.2369167804718018,
+ "epoch": 4.3373737373737375,
+ "grad_norm": 2.4445602893829346,
+ "learning_rate": 6.646464646464647e-07,
+ "loss": 1.2398593425750732,
+ "mean_token_accuracy": 0.6878358721733093,
+ "num_tokens": 35176448.0,
+ "step": 2147
+ },
+ {
+ "entropy": 1.3641530275344849,
+ "epoch": 4.33939393939394,
+ "grad_norm": 2.3283517360687256,
+ "learning_rate": 6.626262626262627e-07,
+ "loss": 1.3664302825927734,
+ "mean_token_accuracy": 0.6764166951179504,
+ "num_tokens": 35192832.0,
+ "step": 2148
+ },
+ {
+ "entropy": 1.5864531993865967,
+ "epoch": 4.341414141414141,
+ "grad_norm": 2.1810457706451416,
+ "learning_rate": 6.606060606060606e-07,
+ "loss": 1.5945943593978882,
+ "mean_token_accuracy": 0.6441743969917297,
+ "num_tokens": 35209216.0,
+ "step": 2149
+ },
+ {
+ "entropy": 1.0947312116622925,
+ "epoch": 4.343434343434343,
+ "grad_norm": 2.3473317623138428,
+ "learning_rate": 6.585858585858586e-07,
+ "loss": 1.0883324146270752,
+ "mean_token_accuracy": 0.7239863276481628,
+ "num_tokens": 35225600.0,
+ "step": 2150
+ },
+ {
+ "epoch": 4.343434343434343,
+ "eval_entropy": 1.2868958841408453,
+ "eval_loss": 1.5624313354492188,
+ "eval_mean_token_accuracy": 0.6437114924192429,
+ "eval_num_tokens": 35225600.0,
+ "eval_runtime": 43.7703,
+ "eval_samples_per_second": 22.618,
+ "eval_steps_per_second": 2.833,
+ "step": 2150
+ },
+ {
+ "entropy": 0.953440248966217,
+ "epoch": 4.345454545454546,
+ "grad_norm": 2.175570249557495,
+ "learning_rate": 6.565656565656567e-07,
+ "loss": 0.9720486998558044,
+ "mean_token_accuracy": 0.7511602640151978,
+ "num_tokens": 35241984.0,
+ "step": 2151
+ },
+ {
+ "entropy": 1.4737303256988525,
+ "epoch": 4.347474747474747,
+ "grad_norm": 2.3273777961730957,
+ "learning_rate": 6.545454545454547e-07,
+ "loss": 1.4861772060394287,
+ "mean_token_accuracy": 0.6781876087188721,
+ "num_tokens": 35258368.0,
+ "step": 2152
+ },
+ {
+ "entropy": 0.9462009072303772,
+ "epoch": 4.349494949494949,
+ "grad_norm": 2.175786256790161,
+ "learning_rate": 6.525252525252527e-07,
+ "loss": 0.949480414390564,
+ "mean_token_accuracy": 0.7550073266029358,
+ "num_tokens": 35274752.0,
+ "step": 2153
+ },
+ {
+ "entropy": 1.2302833795547485,
+ "epoch": 4.351515151515152,
+ "grad_norm": 2.344184398651123,
+ "learning_rate": 6.505050505050506e-07,
+ "loss": 1.2456318140029907,
+ "mean_token_accuracy": 0.7030410170555115,
+ "num_tokens": 35291136.0,
+ "step": 2154
+ },
+ {
+ "entropy": 0.9937285780906677,
+ "epoch": 4.353535353535354,
+ "grad_norm": 2.5566635131835938,
+ "learning_rate": 6.484848484848485e-07,
+ "loss": 1.00638747215271,
+ "mean_token_accuracy": 0.7330239415168762,
+ "num_tokens": 35307520.0,
+ "step": 2155
+ },
+ {
+ "entropy": 1.2210053205490112,
+ "epoch": 4.355555555555555,
+ "grad_norm": 2.367755174636841,
+ "learning_rate": 6.464646464646465e-07,
+ "loss": 1.2135249376296997,
+ "mean_token_accuracy": 0.6969956159591675,
+ "num_tokens": 35323904.0,
+ "step": 2156
+ },
+ {
+ "entropy": 0.9756261110305786,
+ "epoch": 4.357575757575757,
+ "grad_norm": 2.2705581188201904,
+ "learning_rate": 6.444444444444445e-07,
+ "loss": 0.9723948240280151,
+ "mean_token_accuracy": 0.751038134098053,
+ "num_tokens": 35340288.0,
+ "step": 2157
+ },
+ {
+ "entropy": 0.9649578928947449,
+ "epoch": 4.35959595959596,
+ "grad_norm": 2.2868213653564453,
+ "learning_rate": 6.424242424242424e-07,
+ "loss": 0.9617897272109985,
+ "mean_token_accuracy": 0.752137303352356,
+ "num_tokens": 35356672.0,
+ "step": 2158
+ },
+ {
+ "entropy": 1.196886658668518,
+ "epoch": 4.361616161616162,
+ "grad_norm": 2.504281759262085,
+ "learning_rate": 6.404040404040404e-07,
+ "loss": 1.1963926553726196,
+ "mean_token_accuracy": 0.7131778001785278,
+ "num_tokens": 35373056.0,
+ "step": 2159
+ },
+ {
+ "entropy": 0.8882641196250916,
+ "epoch": 4.363636363636363,
+ "grad_norm": 2.2975146770477295,
+ "learning_rate": 6.383838383838384e-07,
+ "loss": 0.8899753093719482,
+ "mean_token_accuracy": 0.7612970471382141,
+ "num_tokens": 35389440.0,
+ "step": 2160
+ },
+ {
+ "entropy": 1.0600148439407349,
+ "epoch": 4.365656565656566,
+ "grad_norm": 2.363847255706787,
+ "learning_rate": 6.363636363636364e-07,
+ "loss": 1.0516207218170166,
+ "mean_token_accuracy": 0.7245969772338867,
+ "num_tokens": 35405824.0,
+ "step": 2161
+ },
+ {
+ "entropy": 1.4234628677368164,
+ "epoch": 4.367676767676768,
+ "grad_norm": 2.414850950241089,
+ "learning_rate": 6.343434343434345e-07,
+ "loss": 1.43110191822052,
+ "mean_token_accuracy": 0.6621885895729065,
+ "num_tokens": 35422208.0,
+ "step": 2162
+ },
+ {
+ "entropy": 0.8017680644989014,
+ "epoch": 4.36969696969697,
+ "grad_norm": 2.2276418209075928,
+ "learning_rate": 6.323232323232324e-07,
+ "loss": 0.7956520318984985,
+ "mean_token_accuracy": 0.783646821975708,
+ "num_tokens": 35438592.0,
+ "step": 2163
+ },
+ {
+ "entropy": 0.9344257712364197,
+ "epoch": 4.3717171717171714,
+ "grad_norm": 2.2372374534606934,
+ "learning_rate": 6.303030303030304e-07,
+ "loss": 0.9264242649078369,
+ "mean_token_accuracy": 0.7545188069343567,
+ "num_tokens": 35454976.0,
+ "step": 2164
+ },
+ {
+ "entropy": 1.2193312644958496,
+ "epoch": 4.373737373737374,
+ "grad_norm": 2.213578462600708,
+ "learning_rate": 6.282828282828284e-07,
+ "loss": 1.2413791418075562,
+ "mean_token_accuracy": 0.7096971273422241,
+ "num_tokens": 35471360.0,
+ "step": 2165
+ },
+ {
+ "entropy": 1.2569602727890015,
+ "epoch": 4.375757575757576,
+ "grad_norm": 2.372586250305176,
+ "learning_rate": 6.262626262626264e-07,
+ "loss": 1.2514206171035767,
+ "mean_token_accuracy": 0.7004762887954712,
+ "num_tokens": 35487744.0,
+ "step": 2166
+ },
+ {
+ "entropy": 0.9451959729194641,
+ "epoch": 4.377777777777778,
+ "grad_norm": 2.2225098609924316,
+ "learning_rate": 6.242424242424243e-07,
+ "loss": 0.9277691841125488,
+ "mean_token_accuracy": 0.7629457712173462,
+ "num_tokens": 35504128.0,
+ "step": 2167
+ },
+ {
+ "entropy": 1.2604646682739258,
+ "epoch": 4.37979797979798,
+ "grad_norm": 2.3232014179229736,
+ "learning_rate": 6.222222222222223e-07,
+ "loss": 1.2507843971252441,
+ "mean_token_accuracy": 0.694614052772522,
+ "num_tokens": 35520512.0,
+ "step": 2168
+ },
+ {
+ "entropy": 0.9686046838760376,
+ "epoch": 4.381818181818182,
+ "grad_norm": 2.1185109615325928,
+ "learning_rate": 6.202020202020202e-07,
+ "loss": 0.9650119543075562,
+ "mean_token_accuracy": 0.7553126811981201,
+ "num_tokens": 35536896.0,
+ "step": 2169
+ },
+ {
+ "entropy": 1.117854118347168,
+ "epoch": 4.383838383838384,
+ "grad_norm": 2.6666815280914307,
+ "learning_rate": 6.181818181818182e-07,
+ "loss": 1.1222784519195557,
+ "mean_token_accuracy": 0.7167195677757263,
+ "num_tokens": 35553280.0,
+ "step": 2170
+ },
+ {
+ "entropy": 1.2812732458114624,
+ "epoch": 4.3858585858585855,
+ "grad_norm": 2.3317956924438477,
+ "learning_rate": 6.161616161616162e-07,
+ "loss": 1.304545283317566,
+ "mean_token_accuracy": 0.6802027225494385,
+ "num_tokens": 35569664.0,
+ "step": 2171
+ },
+ {
+ "entropy": 1.1000746488571167,
+ "epoch": 4.387878787878788,
+ "grad_norm": 2.411543369293213,
+ "learning_rate": 6.141414141414142e-07,
+ "loss": 1.0838086605072021,
+ "mean_token_accuracy": 0.7247801423072815,
+ "num_tokens": 35586048.0,
+ "step": 2172
+ },
+ {
+ "entropy": 1.5119904279708862,
+ "epoch": 4.38989898989899,
+ "grad_norm": 2.3798773288726807,
+ "learning_rate": 6.121212121212121e-07,
+ "loss": 1.5091912746429443,
+ "mean_token_accuracy": 0.644052267074585,
+ "num_tokens": 35602432.0,
+ "step": 2173
+ },
+ {
+ "entropy": 1.3415027856826782,
+ "epoch": 4.391919191919192,
+ "grad_norm": 2.361830472946167,
+ "learning_rate": 6.101010101010101e-07,
+ "loss": 1.3209997415542603,
+ "mean_token_accuracy": 0.6723253726959229,
+ "num_tokens": 35618816.0,
+ "step": 2174
+ },
+ {
+ "entropy": 1.2479910850524902,
+ "epoch": 4.393939393939394,
+ "grad_norm": 2.24318265914917,
+ "learning_rate": 6.080808080808082e-07,
+ "loss": 1.2585164308547974,
+ "mean_token_accuracy": 0.7048729658126831,
+ "num_tokens": 35635200.0,
+ "step": 2175
+ },
+ {
+ "entropy": 1.430103063583374,
+ "epoch": 4.395959595959596,
+ "grad_norm": 2.334134101867676,
+ "learning_rate": 6.060606060606061e-07,
+ "loss": 1.4244396686553955,
+ "mean_token_accuracy": 0.6552271842956543,
+ "num_tokens": 35651584.0,
+ "step": 2176
+ },
+ {
+ "entropy": 1.7399390935897827,
+ "epoch": 4.397979797979798,
+ "grad_norm": 2.362614393234253,
+ "learning_rate": 6.040404040404041e-07,
+ "loss": 1.7584240436553955,
+ "mean_token_accuracy": 0.6219467520713806,
+ "num_tokens": 35667968.0,
+ "step": 2177
+ },
+ {
+ "entropy": 1.078808307647705,
+ "epoch": 4.4,
+ "grad_norm": 2.210782289505005,
+ "learning_rate": 6.020202020202021e-07,
+ "loss": 1.0720242261886597,
+ "mean_token_accuracy": 0.7338788509368896,
+ "num_tokens": 35684352.0,
+ "step": 2178
+ },
+ {
+ "entropy": 1.418910026550293,
+ "epoch": 4.402020202020202,
+ "grad_norm": 2.601738929748535,
+ "learning_rate": 6.000000000000001e-07,
+ "loss": 1.4044787883758545,
+ "mean_token_accuracy": 0.6562652587890625,
+ "num_tokens": 35700736.0,
+ "step": 2179
+ },
+ {
+ "entropy": 1.1740971803665161,
+ "epoch": 4.404040404040404,
+ "grad_norm": 2.2930097579956055,
+ "learning_rate": 5.979797979797981e-07,
+ "loss": 1.1786755323410034,
+ "mean_token_accuracy": 0.7087811231613159,
+ "num_tokens": 35717120.0,
+ "step": 2180
+ },
+ {
+ "entropy": 0.9672836661338806,
+ "epoch": 4.406060606060606,
+ "grad_norm": 2.149219274520874,
+ "learning_rate": 5.959595959595961e-07,
+ "loss": 0.9852940440177917,
+ "mean_token_accuracy": 0.7513434290885925,
+ "num_tokens": 35733504.0,
+ "step": 2181
+ },
+ {
+ "entropy": 1.3657665252685547,
+ "epoch": 4.4080808080808085,
+ "grad_norm": 2.5746331214904785,
+ "learning_rate": 5.93939393939394e-07,
+ "loss": 1.3388352394104004,
+ "mean_token_accuracy": 0.6656082272529602,
+ "num_tokens": 35749888.0,
+ "step": 2182
+ },
+ {
+ "entropy": 1.6251881122589111,
+ "epoch": 4.41010101010101,
+ "grad_norm": 2.2786130905151367,
+ "learning_rate": 5.91919191919192e-07,
+ "loss": 1.6205543279647827,
+ "mean_token_accuracy": 0.6703712940216064,
+ "num_tokens": 35766272.0,
+ "step": 2183
+ },
+ {
+ "entropy": 1.0865193605422974,
+ "epoch": 4.412121212121212,
+ "grad_norm": 2.426384687423706,
+ "learning_rate": 5.898989898989899e-07,
+ "loss": 1.094101905822754,
+ "mean_token_accuracy": 0.715254008769989,
+ "num_tokens": 35782656.0,
+ "step": 2184
+ },
+ {
+ "entropy": 1.110110878944397,
+ "epoch": 4.414141414141414,
+ "grad_norm": 2.1766345500946045,
+ "learning_rate": 5.878787878787879e-07,
+ "loss": 1.09341299533844,
+ "mean_token_accuracy": 0.739130437374115,
+ "num_tokens": 35799040.0,
+ "step": 2185
+ },
+ {
+ "entropy": 1.2953979969024658,
+ "epoch": 4.416161616161617,
+ "grad_norm": 2.149765729904175,
+ "learning_rate": 5.858585858585859e-07,
+ "loss": 1.2975831031799316,
+ "mean_token_accuracy": 0.7040791511535645,
+ "num_tokens": 35815424.0,
+ "step": 2186
+ },
+ {
+ "entropy": 0.7426241636276245,
+ "epoch": 4.418181818181818,
+ "grad_norm": 2.299720287322998,
+ "learning_rate": 5.838383838383839e-07,
+ "loss": 0.7390038967132568,
+ "mean_token_accuracy": 0.7927454710006714,
+ "num_tokens": 35831808.0,
+ "step": 2187
+ },
+ {
+ "entropy": 1.1807751655578613,
+ "epoch": 4.42020202020202,
+ "grad_norm": 2.2330236434936523,
+ "learning_rate": 5.818181818181819e-07,
+ "loss": 1.1834851503372192,
+ "mean_token_accuracy": 0.7061553597450256,
+ "num_tokens": 35848192.0,
+ "step": 2188
+ },
+ {
+ "entropy": 1.2835958003997803,
+ "epoch": 4.4222222222222225,
+ "grad_norm": 2.284749746322632,
+ "learning_rate": 5.797979797979798e-07,
+ "loss": 1.2744988203048706,
+ "mean_token_accuracy": 0.6910722851753235,
+ "num_tokens": 35864576.0,
+ "step": 2189
+ },
+ {
+ "entropy": 0.7347697019577026,
+ "epoch": 4.424242424242424,
+ "grad_norm": 2.1876397132873535,
+ "learning_rate": 5.777777777777778e-07,
+ "loss": 0.7683783769607544,
+ "mean_token_accuracy": 0.7909135222434998,
+ "num_tokens": 35880960.0,
+ "step": 2190
+ },
+ {
+ "entropy": 1.0840578079223633,
+ "epoch": 4.426262626262626,
+ "grad_norm": 2.3153281211853027,
+ "learning_rate": 5.757575757575758e-07,
+ "loss": 1.0639472007751465,
+ "mean_token_accuracy": 0.7304592132568359,
+ "num_tokens": 35897344.0,
+ "step": 2191
+ },
+ {
+ "entropy": 1.019670009613037,
+ "epoch": 4.428282828282828,
+ "grad_norm": 2.3929173946380615,
+ "learning_rate": 5.737373737373738e-07,
+ "loss": 1.007870078086853,
+ "mean_token_accuracy": 0.7322300672531128,
+ "num_tokens": 35913728.0,
+ "step": 2192
+ },
+ {
+ "entropy": 1.3530149459838867,
+ "epoch": 4.430303030303031,
+ "grad_norm": 2.312758445739746,
+ "learning_rate": 5.717171717171718e-07,
+ "loss": 1.3727014064788818,
+ "mean_token_accuracy": 0.6725696325302124,
+ "num_tokens": 35930112.0,
+ "step": 2193
+ },
+ {
+ "entropy": 0.8414053320884705,
+ "epoch": 4.432323232323232,
+ "grad_norm": 2.2400619983673096,
+ "learning_rate": 5.696969696969698e-07,
+ "loss": 0.8350386619567871,
+ "mean_token_accuracy": 0.7728993892669678,
+ "num_tokens": 35946496.0,
+ "step": 2194
+ },
+ {
+ "entropy": 1.4875850677490234,
+ "epoch": 4.434343434343434,
+ "grad_norm": 2.376569986343384,
+ "learning_rate": 5.676767676767677e-07,
+ "loss": 1.4847931861877441,
+ "mean_token_accuracy": 0.6506472826004028,
+ "num_tokens": 35962880.0,
+ "step": 2195
+ },
+ {
+ "entropy": 0.9875659942626953,
+ "epoch": 4.4363636363636365,
+ "grad_norm": 2.1472887992858887,
+ "learning_rate": 5.656565656565658e-07,
+ "loss": 0.9780405759811401,
+ "mean_token_accuracy": 0.7515876889228821,
+ "num_tokens": 35979264.0,
+ "step": 2196
+ },
+ {
+ "entropy": 1.5663740634918213,
+ "epoch": 4.438383838383839,
+ "grad_norm": 2.605659246444702,
+ "learning_rate": 5.636363636363638e-07,
+ "loss": 1.55465829372406,
+ "mean_token_accuracy": 0.6351978778839111,
+ "num_tokens": 35995648.0,
+ "step": 2197
+ },
+ {
+ "entropy": 1.0373486280441284,
+ "epoch": 4.44040404040404,
+ "grad_norm": 2.259995937347412,
+ "learning_rate": 5.616161616161616e-07,
+ "loss": 1.0467290878295898,
+ "mean_token_accuracy": 0.735344409942627,
+ "num_tokens": 36012032.0,
+ "step": 2198
+ },
+ {
+ "entropy": 0.9681136012077332,
+ "epoch": 4.442424242424242,
+ "grad_norm": 2.393617630004883,
+ "learning_rate": 5.595959595959596e-07,
+ "loss": 0.9561377763748169,
+ "mean_token_accuracy": 0.7390693426132202,
+ "num_tokens": 36028416.0,
+ "step": 2199
+ },
+ {
+ "entropy": 1.3843019008636475,
+ "epoch": 4.444444444444445,
+ "grad_norm": 2.3265609741210938,
+ "learning_rate": 5.575757575757576e-07,
+ "loss": 1.372997522354126,
+ "mean_token_accuracy": 0.6861870884895325,
+ "num_tokens": 36044800.0,
+ "step": 2200
+ },
+ {
+ "epoch": 4.444444444444445,
+ "eval_entropy": 1.2872899544815863,
+ "eval_loss": 1.5627764463424683,
+ "eval_mean_token_accuracy": 0.6437114914578776,
+ "eval_num_tokens": 36044800.0,
+ "eval_runtime": 43.7611,
+ "eval_samples_per_second": 22.623,
+ "eval_steps_per_second": 2.834,
+ "step": 2200
+ },
+ {
+ "entropy": 0.9683943390846252,
+ "epoch": 4.446464646464646,
+ "grad_norm": 2.1208672523498535,
+ "learning_rate": 5.555555555555555e-07,
+ "loss": 0.9520723819732666,
+ "mean_token_accuracy": 0.7614191770553589,
+ "num_tokens": 36061184.0,
+ "step": 2201
+ },
+ {
+ "entropy": 1.2325289249420166,
+ "epoch": 4.448484848484848,
+ "grad_norm": 2.3613944053649902,
+ "learning_rate": 5.535353535353536e-07,
+ "loss": 1.2266604900360107,
+ "mean_token_accuracy": 0.7127503752708435,
+ "num_tokens": 36077568.0,
+ "step": 2202
+ },
+ {
+ "entropy": 1.2971447706222534,
+ "epoch": 4.4505050505050505,
+ "grad_norm": 2.4161171913146973,
+ "learning_rate": 5.515151515151516e-07,
+ "loss": 1.298982858657837,
+ "mean_token_accuracy": 0.6858817934989929,
+ "num_tokens": 36093952.0,
+ "step": 2203
+ },
+ {
+ "entropy": 1.2562965154647827,
+ "epoch": 4.452525252525253,
+ "grad_norm": 2.4957022666931152,
+ "learning_rate": 5.494949494949495e-07,
+ "loss": 1.2517296075820923,
+ "mean_token_accuracy": 0.6927821040153503,
+ "num_tokens": 36110336.0,
+ "step": 2204
+ },
+ {
+ "entropy": 1.2625181674957275,
+ "epoch": 4.454545454545454,
+ "grad_norm": 2.1725847721099854,
+ "learning_rate": 5.474747474747475e-07,
+ "loss": 1.2470554113388062,
+ "mean_token_accuracy": 0.7031021118164062,
+ "num_tokens": 36126720.0,
+ "step": 2205
+ },
+ {
+ "entropy": 1.1061078310012817,
+ "epoch": 4.456565656565656,
+ "grad_norm": 2.4533944129943848,
+ "learning_rate": 5.454545454545455e-07,
+ "loss": 1.0851916074752808,
+ "mean_token_accuracy": 0.7231924533843994,
+ "num_tokens": 36143104.0,
+ "step": 2206
+ },
+ {
+ "entropy": 1.125205636024475,
+ "epoch": 4.458585858585859,
+ "grad_norm": 2.3659775257110596,
+ "learning_rate": 5.434343434343435e-07,
+ "loss": 1.1383261680603027,
+ "mean_token_accuracy": 0.7042623162269592,
+ "num_tokens": 36159488.0,
+ "step": 2207
+ },
+ {
+ "entropy": 1.3721956014633179,
+ "epoch": 4.460606060606061,
+ "grad_norm": 2.4929234981536865,
+ "learning_rate": 5.414141414141415e-07,
+ "loss": 1.3432800769805908,
+ "mean_token_accuracy": 0.67666095495224,
+ "num_tokens": 36175872.0,
+ "step": 2208
+ },
+ {
+ "entropy": 0.9716646671295166,
+ "epoch": 4.462626262626262,
+ "grad_norm": 2.1126415729522705,
+ "learning_rate": 5.393939393939395e-07,
+ "loss": 0.9754329919815063,
+ "mean_token_accuracy": 0.7575720548629761,
+ "num_tokens": 36192256.0,
+ "step": 2209
+ },
+ {
+ "entropy": 1.1441161632537842,
+ "epoch": 4.4646464646464645,
+ "grad_norm": 2.329407215118408,
+ "learning_rate": 5.373737373737374e-07,
+ "loss": 1.1453542709350586,
+ "mean_token_accuracy": 0.7070713043212891,
+ "num_tokens": 36208640.0,
+ "step": 2210
+ },
+ {
+ "entropy": 1.3255770206451416,
+ "epoch": 4.466666666666667,
+ "grad_norm": 2.0918211936950684,
+ "learning_rate": 5.353535353535354e-07,
+ "loss": 1.3274650573730469,
+ "mean_token_accuracy": 0.6834391951560974,
+ "num_tokens": 36225024.0,
+ "step": 2211
+ },
+ {
+ "entropy": 1.4749172925949097,
+ "epoch": 4.468686868686869,
+ "grad_norm": 2.1065104007720947,
+ "learning_rate": 5.333333333333335e-07,
+ "loss": 1.4526000022888184,
+ "mean_token_accuracy": 0.6637151837348938,
+ "num_tokens": 36241408.0,
+ "step": 2212
+ },
+ {
+ "entropy": 1.3020631074905396,
+ "epoch": 4.47070707070707,
+ "grad_norm": 2.435131788253784,
+ "learning_rate": 5.313131313131313e-07,
+ "loss": 1.3230618238449097,
+ "mean_token_accuracy": 0.683744490146637,
+ "num_tokens": 36257792.0,
+ "step": 2213
+ },
+ {
+ "entropy": 1.2354505062103271,
+ "epoch": 4.472727272727273,
+ "grad_norm": 2.2865445613861084,
+ "learning_rate": 5.292929292929293e-07,
+ "loss": 1.2283403873443604,
+ "mean_token_accuracy": 0.695713222026825,
+ "num_tokens": 36274176.0,
+ "step": 2214
+ },
+ {
+ "entropy": 0.9121840596199036,
+ "epoch": 4.474747474747475,
+ "grad_norm": 2.379857063293457,
+ "learning_rate": 5.272727272727273e-07,
+ "loss": 0.909171462059021,
+ "mean_token_accuracy": 0.755923330783844,
+ "num_tokens": 36290560.0,
+ "step": 2215
+ },
+ {
+ "entropy": 1.3496302366256714,
+ "epoch": 4.476767676767677,
+ "grad_norm": 2.101379871368408,
+ "learning_rate": 5.252525252525253e-07,
+ "loss": 1.3399009704589844,
+ "mean_token_accuracy": 0.69840008020401,
+ "num_tokens": 36306944.0,
+ "step": 2216
+ },
+ {
+ "entropy": 1.609591007232666,
+ "epoch": 4.4787878787878785,
+ "grad_norm": 2.506319284439087,
+ "learning_rate": 5.232323232323232e-07,
+ "loss": 1.6377949714660645,
+ "mean_token_accuracy": 0.6235954761505127,
+ "num_tokens": 36323328.0,
+ "step": 2217
+ },
+ {
+ "entropy": 1.0830663442611694,
+ "epoch": 4.480808080808081,
+ "grad_norm": 2.206979274749756,
+ "learning_rate": 5.212121212121213e-07,
+ "loss": 1.0871551036834717,
+ "mean_token_accuracy": 0.7242916226387024,
+ "num_tokens": 36339712.0,
+ "step": 2218
+ },
+ {
+ "entropy": 1.0723860263824463,
+ "epoch": 4.482828282828283,
+ "grad_norm": 2.9275877475738525,
+ "learning_rate": 5.191919191919192e-07,
+ "loss": 1.0785467624664307,
+ "mean_token_accuracy": 0.7305202484130859,
+ "num_tokens": 36356096.0,
+ "step": 2219
+ },
+ {
+ "entropy": 1.3322672843933105,
+ "epoch": 4.484848484848484,
+ "grad_norm": 2.3471016883850098,
+ "learning_rate": 5.171717171717172e-07,
+ "loss": 1.311643123626709,
+ "mean_token_accuracy": 0.6893014311790466,
+ "num_tokens": 36372480.0,
+ "step": 2220
+ },
+ {
+ "entropy": 1.29927396774292,
+ "epoch": 4.486868686868687,
+ "grad_norm": 2.427845001220703,
+ "learning_rate": 5.151515151515152e-07,
+ "loss": 1.3044838905334473,
+ "mean_token_accuracy": 0.697239875793457,
+ "num_tokens": 36388864.0,
+ "step": 2221
+ },
+ {
+ "entropy": 1.341801404953003,
+ "epoch": 4.488888888888889,
+ "grad_norm": 2.4492251873016357,
+ "learning_rate": 5.131313131313132e-07,
+ "loss": 1.341687560081482,
+ "mean_token_accuracy": 0.6740351915359497,
+ "num_tokens": 36405248.0,
+ "step": 2222
+ },
+ {
+ "entropy": 0.7857770323753357,
+ "epoch": 4.490909090909091,
+ "grad_norm": 2.296898365020752,
+ "learning_rate": 5.111111111111112e-07,
+ "loss": 0.8039225935935974,
+ "mean_token_accuracy": 0.7828529477119446,
+ "num_tokens": 36421632.0,
+ "step": 2223
+ },
+ {
+ "entropy": 0.8067459464073181,
+ "epoch": 4.4929292929292926,
+ "grad_norm": 2.2211732864379883,
+ "learning_rate": 5.090909090909092e-07,
+ "loss": 0.8270186185836792,
+ "mean_token_accuracy": 0.7794944047927856,
+ "num_tokens": 36438016.0,
+ "step": 2224
+ },
+ {
+ "entropy": 1.1513580083847046,
+ "epoch": 4.494949494949495,
+ "grad_norm": 2.4064536094665527,
+ "learning_rate": 5.070707070707072e-07,
+ "loss": 1.1496974229812622,
+ "mean_token_accuracy": 0.7101245522499084,
+ "num_tokens": 36454400.0,
+ "step": 2225
+ },
+ {
+ "entropy": 1.0617595911026,
+ "epoch": 4.496969696969697,
+ "grad_norm": 2.2687058448791504,
+ "learning_rate": 5.05050505050505e-07,
+ "loss": 1.069061040878296,
+ "mean_token_accuracy": 0.7382144331932068,
+ "num_tokens": 36470784.0,
+ "step": 2226
+ },
+ {
+ "entropy": 1.009508490562439,
+ "epoch": 4.498989898989899,
+ "grad_norm": 2.3550171852111816,
+ "learning_rate": 5.03030303030303e-07,
+ "loss": 1.0016307830810547,
+ "mean_token_accuracy": 0.7346116304397583,
+ "num_tokens": 36487168.0,
+ "step": 2227
+ },
+ {
+ "entropy": 0.9507298469543457,
+ "epoch": 4.501010101010101,
+ "grad_norm": 2.431490182876587,
+ "learning_rate": 5.01010101010101e-07,
+ "loss": 0.9455212950706482,
+ "mean_token_accuracy": 0.7419394254684448,
+ "num_tokens": 36503552.0,
+ "step": 2228
+ },
+ {
+ "entropy": 1.0880755186080933,
+ "epoch": 4.503030303030303,
+ "grad_norm": 2.223511219024658,
+ "learning_rate": 4.98989898989899e-07,
+ "loss": 1.0870615243911743,
+ "mean_token_accuracy": 0.733207106590271,
+ "num_tokens": 36519936.0,
+ "step": 2229
+ },
+ {
+ "entropy": 1.468039870262146,
+ "epoch": 4.505050505050505,
+ "grad_norm": 2.192481517791748,
+ "learning_rate": 4.96969696969697e-07,
+ "loss": 1.4589731693267822,
+ "mean_token_accuracy": 0.6582193374633789,
+ "num_tokens": 36536320.0,
+ "step": 2230
+ },
+ {
+ "entropy": 1.124917984008789,
+ "epoch": 4.5070707070707074,
+ "grad_norm": 2.2918739318847656,
+ "learning_rate": 4.94949494949495e-07,
+ "loss": 1.120725393295288,
+ "mean_token_accuracy": 0.7203224301338196,
+ "num_tokens": 36552704.0,
+ "step": 2231
+ },
+ {
+ "entropy": 0.9215601682662964,
+ "epoch": 4.509090909090909,
+ "grad_norm": 2.1858043670654297,
+ "learning_rate": 4.929292929292929e-07,
+ "loss": 0.9341068863868713,
+ "mean_token_accuracy": 0.7614191770553589,
+ "num_tokens": 36569088.0,
+ "step": 2232
+ },
+ {
+ "entropy": 1.160864233970642,
+ "epoch": 4.511111111111111,
+ "grad_norm": 2.378822088241577,
+ "learning_rate": 4.909090909090909e-07,
+ "loss": 1.165703296661377,
+ "mean_token_accuracy": 0.7143380641937256,
+ "num_tokens": 36585472.0,
+ "step": 2233
+ },
+ {
+ "entropy": 1.1323046684265137,
+ "epoch": 4.513131313131313,
+ "grad_norm": 2.0554256439208984,
+ "learning_rate": 4.88888888888889e-07,
+ "loss": 1.127324104309082,
+ "mean_token_accuracy": 0.7274059653282166,
+ "num_tokens": 36601856.0,
+ "step": 2234
+ },
+ {
+ "entropy": 1.160245418548584,
+ "epoch": 4.515151515151516,
+ "grad_norm": 2.190343141555786,
+ "learning_rate": 4.868686868686869e-07,
+ "loss": 1.178252935409546,
+ "mean_token_accuracy": 0.7177577018737793,
+ "num_tokens": 36618240.0,
+ "step": 2235
+ },
+ {
+ "entropy": 1.0734480619430542,
+ "epoch": 4.517171717171717,
+ "grad_norm": 2.3177547454833984,
+ "learning_rate": 4.848484848484849e-07,
+ "loss": 1.0701775550842285,
+ "mean_token_accuracy": 0.7159867882728577,
+ "num_tokens": 36634624.0,
+ "step": 2236
+ },
+ {
+ "entropy": 1.0354589223861694,
+ "epoch": 4.519191919191919,
+ "grad_norm": 2.433401584625244,
+ "learning_rate": 4.828282828282829e-07,
+ "loss": 1.0339555740356445,
+ "mean_token_accuracy": 0.7307034730911255,
+ "num_tokens": 36651008.0,
+ "step": 2237
+ },
+ {
+ "entropy": 1.7667415142059326,
+ "epoch": 4.5212121212121215,
+ "grad_norm": 2.2882981300354004,
+ "learning_rate": 4.808080808080809e-07,
+ "loss": 1.7917096614837646,
+ "mean_token_accuracy": 0.619015634059906,
+ "num_tokens": 36667392.0,
+ "step": 2238
+ },
+ {
+ "entropy": 1.3639158010482788,
+ "epoch": 4.523232323232323,
+ "grad_norm": 2.151674747467041,
+ "learning_rate": 4.787878787878789e-07,
+ "loss": 1.3818566799163818,
+ "mean_token_accuracy": 0.6798974275588989,
+ "num_tokens": 36683776.0,
+ "step": 2239
+ },
+ {
+ "entropy": 1.5619690418243408,
+ "epoch": 4.525252525252525,
+ "grad_norm": 2.41402006149292,
+ "learning_rate": 4.767676767676768e-07,
+ "loss": 1.5720285177230835,
+ "mean_token_accuracy": 0.622801661491394,
+ "num_tokens": 36700160.0,
+ "step": 2240
+ },
+ {
+ "entropy": 1.1401708126068115,
+ "epoch": 4.527272727272727,
+ "grad_norm": 2.5265958309173584,
+ "learning_rate": 4.747474747474748e-07,
+ "loss": 1.1326185464859009,
+ "mean_token_accuracy": 0.7091475129127502,
+ "num_tokens": 36716544.0,
+ "step": 2241
+ },
+ {
+ "entropy": 1.32151460647583,
+ "epoch": 4.52929292929293,
+ "grad_norm": 2.58975887298584,
+ "learning_rate": 4.7272727272727273e-07,
+ "loss": 1.3325283527374268,
+ "mean_token_accuracy": 0.678859293460846,
+ "num_tokens": 36732928.0,
+ "step": 2242
+ },
+ {
+ "entropy": 0.9835161566734314,
+ "epoch": 4.531313131313131,
+ "grad_norm": 2.2142131328582764,
+ "learning_rate": 4.7070707070707073e-07,
+ "loss": 0.9954148530960083,
+ "mean_token_accuracy": 0.7529922127723694,
+ "num_tokens": 36749312.0,
+ "step": 2243
+ },
+ {
+ "entropy": 1.6663132905960083,
+ "epoch": 4.533333333333333,
+ "grad_norm": 2.3992927074432373,
+ "learning_rate": 4.686868686868688e-07,
+ "loss": 1.6849396228790283,
+ "mean_token_accuracy": 0.6166340708732605,
+ "num_tokens": 36765696.0,
+ "step": 2244
+ },
+ {
+ "entropy": 1.2209111452102661,
+ "epoch": 4.5353535353535355,
+ "grad_norm": 2.415360689163208,
+ "learning_rate": 4.666666666666667e-07,
+ "loss": 1.222484827041626,
+ "mean_token_accuracy": 0.7084758281707764,
+ "num_tokens": 36782080.0,
+ "step": 2245
+ },
+ {
+ "entropy": 1.1928186416625977,
+ "epoch": 4.537373737373738,
+ "grad_norm": 2.3891279697418213,
+ "learning_rate": 4.646464646464647e-07,
+ "loss": 1.2071551084518433,
+ "mean_token_accuracy": 0.6979726552963257,
+ "num_tokens": 36798464.0,
+ "step": 2246
+ },
+ {
+ "entropy": 1.0771721601486206,
+ "epoch": 4.539393939393939,
+ "grad_norm": 2.1842703819274902,
+ "learning_rate": 4.6262626262626265e-07,
+ "loss": 1.0782114267349243,
+ "mean_token_accuracy": 0.7377259135246277,
+ "num_tokens": 36814848.0,
+ "step": 2247
+ },
+ {
+ "entropy": 0.7138144969940186,
+ "epoch": 4.541414141414141,
+ "grad_norm": 2.052765130996704,
+ "learning_rate": 4.6060606060606064e-07,
+ "loss": 0.7110669612884521,
+ "mean_token_accuracy": 0.803798258304596,
+ "num_tokens": 36831232.0,
+ "step": 2248
+ },
+ {
+ "entropy": 1.0407626628875732,
+ "epoch": 4.543434343434344,
+ "grad_norm": 2.396315813064575,
+ "learning_rate": 4.585858585858586e-07,
+ "loss": 1.0258148908615112,
+ "mean_token_accuracy": 0.739130437374115,
+ "num_tokens": 36847616.0,
+ "step": 2249
+ },
+ {
+ "entropy": 1.3311498165130615,
+ "epoch": 4.545454545454545,
+ "grad_norm": 2.403750419616699,
+ "learning_rate": 4.5656565656565663e-07,
+ "loss": 1.3521225452423096,
+ "mean_token_accuracy": 0.680446982383728,
+ "num_tokens": 36864000.0,
+ "step": 2250
+ },
+ {
+ "epoch": 4.545454545454545,
+ "eval_entropy": 1.2901163678015433,
+ "eval_loss": 1.56230628490448,
+ "eval_mean_token_accuracy": 0.6438065368321634,
+ "eval_num_tokens": 36864000.0,
+ "eval_runtime": 43.7396,
+ "eval_samples_per_second": 22.634,
+ "eval_steps_per_second": 2.835,
+ "step": 2250
+ },
+ {
+ "entropy": 1.0132540464401245,
+ "epoch": 4.547474747474747,
+ "grad_norm": 2.424539089202881,
+ "learning_rate": 4.5454545454545457e-07,
+ "loss": 0.9965545535087585,
+ "mean_token_accuracy": 0.7355886697769165,
+ "num_tokens": 36880384.0,
+ "step": 2251
+ },
+ {
+ "entropy": 1.566239833831787,
+ "epoch": 4.5494949494949495,
+ "grad_norm": 2.498107671737671,
+ "learning_rate": 4.5252525252525257e-07,
+ "loss": 1.5575640201568604,
+ "mean_token_accuracy": 0.6338544487953186,
+ "num_tokens": 36896768.0,
+ "step": 2252
+ },
+ {
+ "entropy": 1.1055033206939697,
+ "epoch": 4.551515151515152,
+ "grad_norm": 2.2892208099365234,
+ "learning_rate": 4.505050505050505e-07,
+ "loss": 1.0803035497665405,
+ "mean_token_accuracy": 0.7255129218101501,
+ "num_tokens": 36913152.0,
+ "step": 2253
+ },
+ {
+ "entropy": 1.2764747142791748,
+ "epoch": 4.553535353535354,
+ "grad_norm": 2.2250852584838867,
+ "learning_rate": 4.484848484848485e-07,
+ "loss": 1.2709777355194092,
+ "mean_token_accuracy": 0.7001709938049316,
+ "num_tokens": 36929536.0,
+ "step": 2254
+ },
+ {
+ "entropy": 1.082503318786621,
+ "epoch": 4.555555555555555,
+ "grad_norm": 2.4460432529449463,
+ "learning_rate": 4.4646464646464655e-07,
+ "loss": 1.072137475013733,
+ "mean_token_accuracy": 0.7195896506309509,
+ "num_tokens": 36945920.0,
+ "step": 2255
+ },
+ {
+ "entropy": 1.116898775100708,
+ "epoch": 4.557575757575758,
+ "grad_norm": 2.265634536743164,
+ "learning_rate": 4.444444444444445e-07,
+ "loss": 1.1262788772583008,
+ "mean_token_accuracy": 0.7217268943786621,
+ "num_tokens": 36962304.0,
+ "step": 2256
+ },
+ {
+ "entropy": 1.7029410600662231,
+ "epoch": 4.55959595959596,
+ "grad_norm": 2.507423162460327,
+ "learning_rate": 4.424242424242425e-07,
+ "loss": 1.7347257137298584,
+ "mean_token_accuracy": 0.6124816536903381,
+ "num_tokens": 36978688.0,
+ "step": 2257
+ },
+ {
+ "entropy": 1.312424898147583,
+ "epoch": 4.561616161616161,
+ "grad_norm": 2.5053603649139404,
+ "learning_rate": 4.404040404040404e-07,
+ "loss": 1.302088975906372,
+ "mean_token_accuracy": 0.6765388250350952,
+ "num_tokens": 36995072.0,
+ "step": 2258
+ },
+ {
+ "entropy": 1.0829205513000488,
+ "epoch": 4.5636363636363635,
+ "grad_norm": 2.2573883533477783,
+ "learning_rate": 4.383838383838384e-07,
+ "loss": 1.0810492038726807,
+ "mean_token_accuracy": 0.7468856573104858,
+ "num_tokens": 37011456.0,
+ "step": 2259
+ },
+ {
+ "entropy": 1.1587903499603271,
+ "epoch": 4.565656565656566,
+ "grad_norm": 2.3444430828094482,
+ "learning_rate": 4.363636363636364e-07,
+ "loss": 1.1578619480133057,
+ "mean_token_accuracy": 0.7051172256469727,
+ "num_tokens": 37027840.0,
+ "step": 2260
+ },
+ {
+ "entropy": 1.1421524286270142,
+ "epoch": 4.567676767676768,
+ "grad_norm": 2.4562175273895264,
+ "learning_rate": 4.343434343434344e-07,
+ "loss": 1.1468560695648193,
+ "mean_token_accuracy": 0.7044455409049988,
+ "num_tokens": 37044224.0,
+ "step": 2261
+ },
+ {
+ "entropy": 0.8396296501159668,
+ "epoch": 4.569696969696969,
+ "grad_norm": 2.081439733505249,
+ "learning_rate": 4.3232323232323235e-07,
+ "loss": 0.846064031124115,
+ "mean_token_accuracy": 0.7702735662460327,
+ "num_tokens": 37060608.0,
+ "step": 2262
+ },
+ {
+ "entropy": 1.3769422769546509,
+ "epoch": 4.571717171717172,
+ "grad_norm": 2.249382972717285,
+ "learning_rate": 4.3030303030303034e-07,
+ "loss": 1.391121745109558,
+ "mean_token_accuracy": 0.6820957660675049,
+ "num_tokens": 37076992.0,
+ "step": 2263
+ },
+ {
+ "entropy": 1.8412320613861084,
+ "epoch": 4.573737373737374,
+ "grad_norm": 2.3502392768859863,
+ "learning_rate": 4.282828282828283e-07,
+ "loss": 1.8429474830627441,
+ "mean_token_accuracy": 0.5960552096366882,
+ "num_tokens": 37093376.0,
+ "step": 2264
+ },
+ {
+ "entropy": 1.3433306217193604,
+ "epoch": 4.575757575757576,
+ "grad_norm": 2.2805447578430176,
+ "learning_rate": 4.262626262626263e-07,
+ "loss": 1.3156907558441162,
+ "mean_token_accuracy": 0.6905227303504944,
+ "num_tokens": 37109760.0,
+ "step": 2265
+ },
+ {
+ "entropy": 0.8410167694091797,
+ "epoch": 4.5777777777777775,
+ "grad_norm": 2.1443328857421875,
+ "learning_rate": 4.242424242424243e-07,
+ "loss": 0.8473227024078369,
+ "mean_token_accuracy": 0.7844406366348267,
+ "num_tokens": 37126144.0,
+ "step": 2266
+ },
+ {
+ "entropy": 1.2433832883834839,
+ "epoch": 4.57979797979798,
+ "grad_norm": 2.4752817153930664,
+ "learning_rate": 4.2222222222222226e-07,
+ "loss": 1.2559361457824707,
+ "mean_token_accuracy": 0.6909501552581787,
+ "num_tokens": 37142528.0,
+ "step": 2267
+ },
+ {
+ "entropy": 1.2694175243377686,
+ "epoch": 4.581818181818182,
+ "grad_norm": 2.369257688522339,
+ "learning_rate": 4.2020202020202026e-07,
+ "loss": 1.2467796802520752,
+ "mean_token_accuracy": 0.6978505253791809,
+ "num_tokens": 37158912.0,
+ "step": 2268
+ },
+ {
+ "entropy": 1.281100869178772,
+ "epoch": 4.583838383838383,
+ "grad_norm": 2.594801664352417,
+ "learning_rate": 4.181818181818182e-07,
+ "loss": 1.2897577285766602,
+ "mean_token_accuracy": 0.6805691123008728,
+ "num_tokens": 37175296.0,
+ "step": 2269
+ },
+ {
+ "entropy": 1.2010201215744019,
+ "epoch": 4.585858585858586,
+ "grad_norm": 2.5778253078460693,
+ "learning_rate": 4.161616161616162e-07,
+ "loss": 1.2004069089889526,
+ "mean_token_accuracy": 0.7007816433906555,
+ "num_tokens": 37191680.0,
+ "step": 2270
+ },
+ {
+ "entropy": 1.1471829414367676,
+ "epoch": 4.587878787878788,
+ "grad_norm": 2.2475953102111816,
+ "learning_rate": 4.141414141414142e-07,
+ "loss": 1.1470632553100586,
+ "mean_token_accuracy": 0.7180629968643188,
+ "num_tokens": 37208064.0,
+ "step": 2271
+ },
+ {
+ "entropy": 1.2060309648513794,
+ "epoch": 4.58989898989899,
+ "grad_norm": 2.556947946548462,
+ "learning_rate": 4.121212121212122e-07,
+ "loss": 1.2037420272827148,
+ "mean_token_accuracy": 0.7006595134735107,
+ "num_tokens": 37224448.0,
+ "step": 2272
+ },
+ {
+ "entropy": 1.3802626132965088,
+ "epoch": 4.591919191919192,
+ "grad_norm": 2.199343681335449,
+ "learning_rate": 4.101010101010101e-07,
+ "loss": 1.3555655479431152,
+ "mean_token_accuracy": 0.6707376837730408,
+ "num_tokens": 37240832.0,
+ "step": 2273
+ },
+ {
+ "entropy": 1.1409947872161865,
+ "epoch": 4.593939393939394,
+ "grad_norm": 2.383211612701416,
+ "learning_rate": 4.080808080808081e-07,
+ "loss": 1.1248835325241089,
+ "mean_token_accuracy": 0.7173302173614502,
+ "num_tokens": 37257216.0,
+ "step": 2274
+ },
+ {
+ "entropy": 0.811996340751648,
+ "epoch": 4.595959595959596,
+ "grad_norm": 2.3031976222991943,
+ "learning_rate": 4.0606060606060605e-07,
+ "loss": 0.8029609322547913,
+ "mean_token_accuracy": 0.7873107194900513,
+ "num_tokens": 37273600.0,
+ "step": 2275
+ },
+ {
+ "entropy": 1.4265928268432617,
+ "epoch": 4.597979797979798,
+ "grad_norm": 2.5571768283843994,
+ "learning_rate": 4.040404040404041e-07,
+ "loss": 1.4269866943359375,
+ "mean_token_accuracy": 0.6546165347099304,
+ "num_tokens": 37289984.0,
+ "step": 2276
+ },
+ {
+ "entropy": 1.6510447263717651,
+ "epoch": 4.6,
+ "grad_norm": 2.3172078132629395,
+ "learning_rate": 4.020202020202021e-07,
+ "loss": 1.6616134643554688,
+ "mean_token_accuracy": 0.6251832246780396,
+ "num_tokens": 37306368.0,
+ "step": 2277
+ },
+ {
+ "entropy": 1.0235978364944458,
+ "epoch": 4.602020202020202,
+ "grad_norm": 2.3221075534820557,
+ "learning_rate": 4.0000000000000003e-07,
+ "loss": 1.0012810230255127,
+ "mean_token_accuracy": 0.7437713742256165,
+ "num_tokens": 37322752.0,
+ "step": 2278
+ },
+ {
+ "entropy": 1.029131531715393,
+ "epoch": 4.604040404040404,
+ "grad_norm": 2.189196825027466,
+ "learning_rate": 3.9797979797979803e-07,
+ "loss": 1.0218143463134766,
+ "mean_token_accuracy": 0.7482901811599731,
+ "num_tokens": 37339136.0,
+ "step": 2279
+ },
+ {
+ "entropy": 1.329385757446289,
+ "epoch": 4.606060606060606,
+ "grad_norm": 2.4340617656707764,
+ "learning_rate": 3.9595959595959597e-07,
+ "loss": 1.3449084758758545,
+ "mean_token_accuracy": 0.6770884394645691,
+ "num_tokens": 37355520.0,
+ "step": 2280
+ },
+ {
+ "entropy": 0.7388880848884583,
+ "epoch": 4.608080808080808,
+ "grad_norm": 2.2112226486206055,
+ "learning_rate": 3.9393939393939396e-07,
+ "loss": 0.7312659025192261,
+ "mean_token_accuracy": 0.7933561205863953,
+ "num_tokens": 37371904.0,
+ "step": 2281
+ },
+ {
+ "entropy": 1.159648060798645,
+ "epoch": 4.61010101010101,
+ "grad_norm": 2.5980238914489746,
+ "learning_rate": 3.9191919191919196e-07,
+ "loss": 1.2006101608276367,
+ "mean_token_accuracy": 0.7051783204078674,
+ "num_tokens": 37388288.0,
+ "step": 2282
+ },
+ {
+ "entropy": 1.2951687574386597,
+ "epoch": 4.612121212121212,
+ "grad_norm": 2.244856119155884,
+ "learning_rate": 3.8989898989898995e-07,
+ "loss": 1.2880356311798096,
+ "mean_token_accuracy": 0.6805080771446228,
+ "num_tokens": 37404672.0,
+ "step": 2283
+ },
+ {
+ "entropy": 1.1866800785064697,
+ "epoch": 4.6141414141414145,
+ "grad_norm": 2.307337999343872,
+ "learning_rate": 3.878787878787879e-07,
+ "loss": 1.1886307001113892,
+ "mean_token_accuracy": 0.7155593633651733,
+ "num_tokens": 37421056.0,
+ "step": 2284
+ },
+ {
+ "entropy": 1.3319196701049805,
+ "epoch": 4.616161616161616,
+ "grad_norm": 2.263145923614502,
+ "learning_rate": 3.858585858585859e-07,
+ "loss": 1.317441701889038,
+ "mean_token_accuracy": 0.6865534782409668,
+ "num_tokens": 37437440.0,
+ "step": 2285
+ },
+ {
+ "entropy": 2.135301351547241,
+ "epoch": 4.618181818181818,
+ "grad_norm": 2.3971385955810547,
+ "learning_rate": 3.838383838383838e-07,
+ "loss": 2.114279270172119,
+ "mean_token_accuracy": 0.541829526424408,
+ "num_tokens": 37453824.0,
+ "step": 2286
+ },
+ {
+ "entropy": 1.0097599029541016,
+ "epoch": 4.62020202020202,
+ "grad_norm": 2.405428171157837,
+ "learning_rate": 3.8181818181818187e-07,
+ "loss": 1.007436990737915,
+ "mean_token_accuracy": 0.7344895005226135,
+ "num_tokens": 37470208.0,
+ "step": 2287
+ },
+ {
+ "entropy": 1.4621717929840088,
+ "epoch": 4.622222222222222,
+ "grad_norm": 2.3339080810546875,
+ "learning_rate": 3.7979797979797987e-07,
+ "loss": 1.4692507982254028,
+ "mean_token_accuracy": 0.653761625289917,
+ "num_tokens": 37486592.0,
+ "step": 2288
+ },
+ {
+ "entropy": 1.4064738750457764,
+ "epoch": 4.624242424242424,
+ "grad_norm": 2.5219573974609375,
+ "learning_rate": 3.777777777777778e-07,
+ "loss": 1.4030996561050415,
+ "mean_token_accuracy": 0.6621885895729065,
+ "num_tokens": 37502976.0,
+ "step": 2289
+ },
+ {
+ "entropy": 0.9653409719467163,
+ "epoch": 4.626262626262626,
+ "grad_norm": 2.309343099594116,
+ "learning_rate": 3.757575757575758e-07,
+ "loss": 0.9549931287765503,
+ "mean_token_accuracy": 0.7438324093818665,
+ "num_tokens": 37519360.0,
+ "step": 2290
+ },
+ {
+ "entropy": 1.439044713973999,
+ "epoch": 4.6282828282828286,
+ "grad_norm": 2.388458013534546,
+ "learning_rate": 3.7373737373737374e-07,
+ "loss": 1.4296658039093018,
+ "mean_token_accuracy": 0.6632266640663147,
+ "num_tokens": 37535744.0,
+ "step": 2291
+ },
+ {
+ "entropy": 1.1554685831069946,
+ "epoch": 4.63030303030303,
+ "grad_norm": 2.307220935821533,
+ "learning_rate": 3.717171717171718e-07,
+ "loss": 1.1408238410949707,
+ "mean_token_accuracy": 0.7106741666793823,
+ "num_tokens": 37552128.0,
+ "step": 2292
+ },
+ {
+ "entropy": 1.3482651710510254,
+ "epoch": 4.632323232323232,
+ "grad_norm": 2.4873476028442383,
+ "learning_rate": 3.6969696969696973e-07,
+ "loss": 1.3547667264938354,
+ "mean_token_accuracy": 0.6782486438751221,
+ "num_tokens": 37568512.0,
+ "step": 2293
+ },
+ {
+ "entropy": 1.2003843784332275,
+ "epoch": 4.634343434343434,
+ "grad_norm": 2.6622185707092285,
+ "learning_rate": 3.676767676767677e-07,
+ "loss": 1.220603585243225,
+ "mean_token_accuracy": 0.7004152536392212,
+ "num_tokens": 37584896.0,
+ "step": 2294
+ },
+ {
+ "entropy": 1.4963154792785645,
+ "epoch": 4.636363636363637,
+ "grad_norm": 2.388099193572998,
+ "learning_rate": 3.6565656565656566e-07,
+ "loss": 1.4815962314605713,
+ "mean_token_accuracy": 0.6540058851242065,
+ "num_tokens": 37601280.0,
+ "step": 2295
+ },
+ {
+ "entropy": 0.8894418478012085,
+ "epoch": 4.638383838383838,
+ "grad_norm": 2.2750332355499268,
+ "learning_rate": 3.6363636363636366e-07,
+ "loss": 0.8816108703613281,
+ "mean_token_accuracy": 0.7600757479667664,
+ "num_tokens": 37617664.0,
+ "step": 2296
+ },
+ {
+ "entropy": 1.4483006000518799,
+ "epoch": 4.64040404040404,
+ "grad_norm": 2.4239723682403564,
+ "learning_rate": 3.616161616161616e-07,
+ "loss": 1.4309420585632324,
+ "mean_token_accuracy": 0.6664631366729736,
+ "num_tokens": 37634048.0,
+ "step": 2297
+ },
+ {
+ "entropy": 1.0523942708969116,
+ "epoch": 4.642424242424243,
+ "grad_norm": 2.5061404705047607,
+ "learning_rate": 3.5959595959595965e-07,
+ "loss": 1.0694353580474854,
+ "mean_token_accuracy": 0.7223986387252808,
+ "num_tokens": 37650432.0,
+ "step": 2298
+ },
+ {
+ "entropy": 1.023050308227539,
+ "epoch": 4.644444444444445,
+ "grad_norm": 2.3206429481506348,
+ "learning_rate": 3.5757575757575764e-07,
+ "loss": 1.0274075269699097,
+ "mean_token_accuracy": 0.736932098865509,
+ "num_tokens": 37666816.0,
+ "step": 2299
+ },
+ {
+ "entropy": 1.237621784210205,
+ "epoch": 4.646464646464646,
+ "grad_norm": 2.2803795337677,
+ "learning_rate": 3.555555555555556e-07,
+ "loss": 1.2464512586593628,
+ "mean_token_accuracy": 0.704323410987854,
+ "num_tokens": 37683200.0,
+ "step": 2300
+ },
+ {
+ "epoch": 4.646464646464646,
+ "eval_entropy": 1.28836673738495,
+ "eval_loss": 1.5621296167373657,
+ "eval_mean_token_accuracy": 0.6437666464236474,
+ "eval_num_tokens": 37683200.0,
+ "eval_runtime": 43.76,
+ "eval_samples_per_second": 22.623,
+ "eval_steps_per_second": 2.834,
+ "step": 2300
+ },
+ {
+ "entropy": 1.0633931159973145,
+ "epoch": 4.648484848484848,
+ "grad_norm": 2.4361109733581543,
+ "learning_rate": 3.535353535353536e-07,
+ "loss": 1.0744309425354004,
+ "mean_token_accuracy": 0.7197728157043457,
+ "num_tokens": 37699584.0,
+ "step": 2301
+ },
+ {
+ "entropy": 1.3343605995178223,
+ "epoch": 4.650505050505051,
+ "grad_norm": 2.421180486679077,
+ "learning_rate": 3.515151515151515e-07,
+ "loss": 1.3187456130981445,
+ "mean_token_accuracy": 0.6835613250732422,
+ "num_tokens": 37715968.0,
+ "step": 2302
+ },
+ {
+ "entropy": 1.0245436429977417,
+ "epoch": 4.652525252525253,
+ "grad_norm": 2.140960693359375,
+ "learning_rate": 3.4949494949494956e-07,
+ "loss": 1.0146875381469727,
+ "mean_token_accuracy": 0.7372373938560486,
+ "num_tokens": 37732352.0,
+ "step": 2303
+ },
+ {
+ "entropy": 1.1643346548080444,
+ "epoch": 4.654545454545454,
+ "grad_norm": 2.2306506633758545,
+ "learning_rate": 3.474747474747475e-07,
+ "loss": 1.1504415273666382,
+ "mean_token_accuracy": 0.7142769694328308,
+ "num_tokens": 37748736.0,
+ "step": 2304
+ },
+ {
+ "entropy": 0.7440503835678101,
+ "epoch": 4.656565656565657,
+ "grad_norm": 2.0574123859405518,
+ "learning_rate": 3.454545454545455e-07,
+ "loss": 0.7455213069915771,
+ "mean_token_accuracy": 0.8050195574760437,
+ "num_tokens": 37765120.0,
+ "step": 2305
+ },
+ {
+ "entropy": 1.4619858264923096,
+ "epoch": 4.658585858585859,
+ "grad_norm": 2.6212973594665527,
+ "learning_rate": 3.4343434343434344e-07,
+ "loss": 1.469425916671753,
+ "mean_token_accuracy": 0.6445407867431641,
+ "num_tokens": 37781504.0,
+ "step": 2306
+ },
+ {
+ "entropy": 0.9174419641494751,
+ "epoch": 4.66060606060606,
+ "grad_norm": 2.220879316329956,
+ "learning_rate": 3.4141414141414143e-07,
+ "loss": 0.9032682180404663,
+ "mean_token_accuracy": 0.757022500038147,
+ "num_tokens": 37797888.0,
+ "step": 2307
+ },
+ {
+ "entropy": 1.4366378784179688,
+ "epoch": 4.6626262626262625,
+ "grad_norm": 2.5851221084594727,
+ "learning_rate": 3.393939393939395e-07,
+ "loss": 1.4307548999786377,
+ "mean_token_accuracy": 0.6482657790184021,
+ "num_tokens": 37814272.0,
+ "step": 2308
+ },
+ {
+ "entropy": 1.2210568189620972,
+ "epoch": 4.664646464646465,
+ "grad_norm": 2.420168161392212,
+ "learning_rate": 3.373737373737374e-07,
+ "loss": 1.2302658557891846,
+ "mean_token_accuracy": 0.7040791511535645,
+ "num_tokens": 37830656.0,
+ "step": 2309
+ },
+ {
+ "entropy": 1.6781017780303955,
+ "epoch": 4.666666666666667,
+ "grad_norm": 2.405329704284668,
+ "learning_rate": 3.353535353535354e-07,
+ "loss": 1.7171658277511597,
+ "mean_token_accuracy": 0.6167562007904053,
+ "num_tokens": 37847040.0,
+ "step": 2310
+ },
+ {
+ "entropy": 1.555785894393921,
+ "epoch": 4.668686868686868,
+ "grad_norm": 2.4297945499420166,
+ "learning_rate": 3.3333333333333335e-07,
+ "loss": 1.5461559295654297,
+ "mean_token_accuracy": 0.6530898809432983,
+ "num_tokens": 37863424.0,
+ "step": 2311
+ },
+ {
+ "entropy": 1.2855968475341797,
+ "epoch": 4.670707070707071,
+ "grad_norm": 2.272463798522949,
+ "learning_rate": 3.3131313131313135e-07,
+ "loss": 1.259823203086853,
+ "mean_token_accuracy": 0.6882022619247437,
+ "num_tokens": 37879808.0,
+ "step": 2312
+ },
+ {
+ "entropy": 1.4039292335510254,
+ "epoch": 4.672727272727273,
+ "grad_norm": 2.327253818511963,
+ "learning_rate": 3.292929292929293e-07,
+ "loss": 1.4226019382476807,
+ "mean_token_accuracy": 0.6649364829063416,
+ "num_tokens": 37896192.0,
+ "step": 2313
+ },
+ {
+ "entropy": 1.3019342422485352,
+ "epoch": 4.674747474747475,
+ "grad_norm": 2.5177788734436035,
+ "learning_rate": 3.2727272727272733e-07,
+ "loss": 1.3209342956542969,
+ "mean_token_accuracy": 0.6801416873931885,
+ "num_tokens": 37912576.0,
+ "step": 2314
+ },
+ {
+ "entropy": 1.002327561378479,
+ "epoch": 4.6767676767676765,
+ "grad_norm": 2.3929429054260254,
+ "learning_rate": 3.252525252525253e-07,
+ "loss": 1.0002248287200928,
+ "mean_token_accuracy": 0.735832929611206,
+ "num_tokens": 37928960.0,
+ "step": 2315
+ },
+ {
+ "entropy": 1.0516724586486816,
+ "epoch": 4.678787878787879,
+ "grad_norm": 2.405729293823242,
+ "learning_rate": 3.2323232323232327e-07,
+ "loss": 1.05308198928833,
+ "mean_token_accuracy": 0.7308256030082703,
+ "num_tokens": 37945344.0,
+ "step": 2316
+ },
+ {
+ "entropy": 1.1786670684814453,
+ "epoch": 4.680808080808081,
+ "grad_norm": 2.480250120162964,
+ "learning_rate": 3.212121212121212e-07,
+ "loss": 1.1930567026138306,
+ "mean_token_accuracy": 0.7120786309242249,
+ "num_tokens": 37961728.0,
+ "step": 2317
+ },
+ {
+ "entropy": 1.6102875471115112,
+ "epoch": 4.682828282828282,
+ "grad_norm": 2.2855021953582764,
+ "learning_rate": 3.191919191919192e-07,
+ "loss": 1.5947301387786865,
+ "mean_token_accuracy": 0.6359916925430298,
+ "num_tokens": 37978112.0,
+ "step": 2318
+ },
+ {
+ "entropy": 1.3153326511383057,
+ "epoch": 4.684848484848485,
+ "grad_norm": 2.46415638923645,
+ "learning_rate": 3.1717171717171725e-07,
+ "loss": 1.3392620086669922,
+ "mean_token_accuracy": 0.6741573214530945,
+ "num_tokens": 37994496.0,
+ "step": 2319
+ },
+ {
+ "entropy": 1.0658379793167114,
+ "epoch": 4.686868686868687,
+ "grad_norm": 2.5052623748779297,
+ "learning_rate": 3.151515151515152e-07,
+ "loss": 1.078431248664856,
+ "mean_token_accuracy": 0.7183072566986084,
+ "num_tokens": 38010880.0,
+ "step": 2320
+ },
+ {
+ "entropy": 1.589642882347107,
+ "epoch": 4.688888888888889,
+ "grad_norm": 2.3059611320495605,
+ "learning_rate": 3.131313131313132e-07,
+ "loss": 1.592090129852295,
+ "mean_token_accuracy": 0.6395334601402283,
+ "num_tokens": 38027264.0,
+ "step": 2321
+ },
+ {
+ "entropy": 1.2305296659469604,
+ "epoch": 4.690909090909091,
+ "grad_norm": 2.271082639694214,
+ "learning_rate": 3.111111111111111e-07,
+ "loss": 1.2300341129302979,
+ "mean_token_accuracy": 0.686431348323822,
+ "num_tokens": 38043648.0,
+ "step": 2322
+ },
+ {
+ "entropy": 1.054584264755249,
+ "epoch": 4.692929292929293,
+ "grad_norm": 2.352559804916382,
+ "learning_rate": 3.090909090909091e-07,
+ "loss": 1.0419890880584717,
+ "mean_token_accuracy": 0.7354665398597717,
+ "num_tokens": 38060032.0,
+ "step": 2323
+ },
+ {
+ "entropy": 1.6653000116348267,
+ "epoch": 4.694949494949495,
+ "grad_norm": 2.4491634368896484,
+ "learning_rate": 3.070707070707071e-07,
+ "loss": 1.6999539136886597,
+ "mean_token_accuracy": 0.6111382246017456,
+ "num_tokens": 38076416.0,
+ "step": 2324
+ },
+ {
+ "entropy": 1.2883809804916382,
+ "epoch": 4.696969696969697,
+ "grad_norm": 2.5294644832611084,
+ "learning_rate": 3.0505050505050505e-07,
+ "loss": 1.2754499912261963,
+ "mean_token_accuracy": 0.6855764389038086,
+ "num_tokens": 38092800.0,
+ "step": 2325
+ },
+ {
+ "entropy": 0.8978599905967712,
+ "epoch": 4.698989898989899,
+ "grad_norm": 2.085676908493042,
+ "learning_rate": 3.0303030303030305e-07,
+ "loss": 0.8723149299621582,
+ "mean_token_accuracy": 0.7736321687698364,
+ "num_tokens": 38109184.0,
+ "step": 2326
+ },
+ {
+ "entropy": 1.1231838464736938,
+ "epoch": 4.701010101010101,
+ "grad_norm": 2.4599316120147705,
+ "learning_rate": 3.0101010101010104e-07,
+ "loss": 1.125774621963501,
+ "mean_token_accuracy": 0.7134220600128174,
+ "num_tokens": 38125568.0,
+ "step": 2327
+ },
+ {
+ "entropy": 0.8676767349243164,
+ "epoch": 4.703030303030303,
+ "grad_norm": 2.30765438079834,
+ "learning_rate": 2.9898989898989904e-07,
+ "loss": 0.8640745878219604,
+ "mean_token_accuracy": 0.7744259834289551,
+ "num_tokens": 38141952.0,
+ "step": 2328
+ },
+ {
+ "entropy": 1.2736501693725586,
+ "epoch": 4.705050505050505,
+ "grad_norm": 2.3648366928100586,
+ "learning_rate": 2.96969696969697e-07,
+ "loss": 1.2754569053649902,
+ "mean_token_accuracy": 0.6851490139961243,
+ "num_tokens": 38158336.0,
+ "step": 2329
+ },
+ {
+ "entropy": 0.9255363941192627,
+ "epoch": 4.707070707070707,
+ "grad_norm": 2.335263967514038,
+ "learning_rate": 2.9494949494949497e-07,
+ "loss": 0.9199962019920349,
+ "mean_token_accuracy": 0.7528700828552246,
+ "num_tokens": 38174720.0,
+ "step": 2330
+ },
+ {
+ "entropy": 0.9790836572647095,
+ "epoch": 4.709090909090909,
+ "grad_norm": 2.2479305267333984,
+ "learning_rate": 2.9292929292929296e-07,
+ "loss": 0.9697257280349731,
+ "mean_token_accuracy": 0.7452369332313538,
+ "num_tokens": 38191104.0,
+ "step": 2331
+ },
+ {
+ "entropy": 1.099324345588684,
+ "epoch": 4.711111111111111,
+ "grad_norm": 2.2268218994140625,
+ "learning_rate": 2.9090909090909096e-07,
+ "loss": 1.1064157485961914,
+ "mean_token_accuracy": 0.731008768081665,
+ "num_tokens": 38207488.0,
+ "step": 2332
+ },
+ {
+ "entropy": 1.2142791748046875,
+ "epoch": 4.7131313131313135,
+ "grad_norm": 2.3290510177612305,
+ "learning_rate": 2.888888888888889e-07,
+ "loss": 1.1970348358154297,
+ "mean_token_accuracy": 0.6973620057106018,
+ "num_tokens": 38223872.0,
+ "step": 2333
+ },
+ {
+ "entropy": 1.235068440437317,
+ "epoch": 4.715151515151515,
+ "grad_norm": 2.636742353439331,
+ "learning_rate": 2.868686868686869e-07,
+ "loss": 1.2286301851272583,
+ "mean_token_accuracy": 0.6879580020904541,
+ "num_tokens": 38240256.0,
+ "step": 2334
+ },
+ {
+ "entropy": 1.0521979331970215,
+ "epoch": 4.717171717171717,
+ "grad_norm": 2.3975024223327637,
+ "learning_rate": 2.848484848484849e-07,
+ "loss": 1.0421833992004395,
+ "mean_token_accuracy": 0.7196506857872009,
+ "num_tokens": 38256640.0,
+ "step": 2335
+ },
+ {
+ "entropy": 0.9967750906944275,
+ "epoch": 4.719191919191919,
+ "grad_norm": 2.463973045349121,
+ "learning_rate": 2.828282828282829e-07,
+ "loss": 0.9987051486968994,
+ "mean_token_accuracy": 0.7416951656341553,
+ "num_tokens": 38273024.0,
+ "step": 2336
+ },
+ {
+ "entropy": 1.0743719339370728,
+ "epoch": 4.721212121212121,
+ "grad_norm": 2.17183518409729,
+ "learning_rate": 2.808080808080808e-07,
+ "loss": 1.0761301517486572,
+ "mean_token_accuracy": 0.7257571816444397,
+ "num_tokens": 38289408.0,
+ "step": 2337
+ },
+ {
+ "entropy": 1.3123915195465088,
+ "epoch": 4.723232323232323,
+ "grad_norm": 2.502078056335449,
+ "learning_rate": 2.787878787878788e-07,
+ "loss": 1.3049037456512451,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 38305792.0,
+ "step": 2338
+ },
+ {
+ "entropy": 0.9125492572784424,
+ "epoch": 4.725252525252525,
+ "grad_norm": 2.288921594619751,
+ "learning_rate": 2.767676767676768e-07,
+ "loss": 0.9170413017272949,
+ "mean_token_accuracy": 0.7563507556915283,
+ "num_tokens": 38322176.0,
+ "step": 2339
+ },
+ {
+ "entropy": 0.9668527245521545,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 2.2450435161590576,
+ "learning_rate": 2.7474747474747475e-07,
+ "loss": 0.9799595475196838,
+ "mean_token_accuracy": 0.7448094487190247,
+ "num_tokens": 38338560.0,
+ "step": 2340
+ },
+ {
+ "entropy": 1.2308948040008545,
+ "epoch": 4.72929292929293,
+ "grad_norm": 2.4422991275787354,
+ "learning_rate": 2.7272727272727274e-07,
+ "loss": 1.2512444257736206,
+ "mean_token_accuracy": 0.6996824741363525,
+ "num_tokens": 38354944.0,
+ "step": 2341
+ },
+ {
+ "entropy": 1.3918697834014893,
+ "epoch": 4.731313131313131,
+ "grad_norm": 2.560283660888672,
+ "learning_rate": 2.7070707070707074e-07,
+ "loss": 1.3936901092529297,
+ "mean_token_accuracy": 0.6690889000892639,
+ "num_tokens": 38371328.0,
+ "step": 2342
+ },
+ {
+ "entropy": 0.951773464679718,
+ "epoch": 4.733333333333333,
+ "grad_norm": 2.337327241897583,
+ "learning_rate": 2.686868686868687e-07,
+ "loss": 0.9381144046783447,
+ "mean_token_accuracy": 0.7452979683876038,
+ "num_tokens": 38387712.0,
+ "step": 2343
+ },
+ {
+ "entropy": 1.1627814769744873,
+ "epoch": 4.735353535353536,
+ "grad_norm": 2.3551900386810303,
+ "learning_rate": 2.666666666666667e-07,
+ "loss": 1.1717885732650757,
+ "mean_token_accuracy": 0.7102466821670532,
+ "num_tokens": 38404096.0,
+ "step": 2344
+ },
+ {
+ "entropy": 1.223041296005249,
+ "epoch": 4.737373737373737,
+ "grad_norm": 2.2816755771636963,
+ "learning_rate": 2.6464646464646467e-07,
+ "loss": 1.2163041830062866,
+ "mean_token_accuracy": 0.7085979580879211,
+ "num_tokens": 38420480.0,
+ "step": 2345
+ },
+ {
+ "entropy": 0.9747529625892639,
+ "epoch": 4.739393939393939,
+ "grad_norm": 2.310767889022827,
+ "learning_rate": 2.6262626262626266e-07,
+ "loss": 0.973397970199585,
+ "mean_token_accuracy": 0.7438935041427612,
+ "num_tokens": 38436864.0,
+ "step": 2346
+ },
+ {
+ "entropy": 1.3344645500183105,
+ "epoch": 4.7414141414141415,
+ "grad_norm": 2.2414627075195312,
+ "learning_rate": 2.6060606060606065e-07,
+ "loss": 1.348139762878418,
+ "mean_token_accuracy": 0.6953468322753906,
+ "num_tokens": 38453248.0,
+ "step": 2347
+ },
+ {
+ "entropy": 1.1264088153839111,
+ "epoch": 4.743434343434344,
+ "grad_norm": 2.222374677658081,
+ "learning_rate": 2.585858585858586e-07,
+ "loss": 1.1195029020309448,
+ "mean_token_accuracy": 0.7311919927597046,
+ "num_tokens": 38469632.0,
+ "step": 2348
+ },
+ {
+ "entropy": 1.1974331140518188,
+ "epoch": 4.745454545454545,
+ "grad_norm": 2.448791265487671,
+ "learning_rate": 2.565656565656566e-07,
+ "loss": 1.1753729581832886,
+ "mean_token_accuracy": 0.7039570212364197,
+ "num_tokens": 38486016.0,
+ "step": 2349
+ },
+ {
+ "entropy": 1.1791099309921265,
+ "epoch": 4.747474747474747,
+ "grad_norm": 2.425783634185791,
+ "learning_rate": 2.545454545454546e-07,
+ "loss": 1.1861391067504883,
+ "mean_token_accuracy": 0.6938812732696533,
+ "num_tokens": 38502400.0,
+ "step": 2350
+ },
+ {
+ "epoch": 4.747474747474747,
+ "eval_entropy": 1.2881583263797145,
+ "eval_loss": 1.5621256828308105,
+ "eval_mean_token_accuracy": 0.6438006249166304,
+ "eval_num_tokens": 38502400.0,
+ "eval_runtime": 43.7945,
+ "eval_samples_per_second": 22.606,
+ "eval_steps_per_second": 2.831,
+ "step": 2350
+ },
+ {
+ "entropy": 1.0894598960876465,
+ "epoch": 4.74949494949495,
+ "grad_norm": 2.1677145957946777,
+ "learning_rate": 2.525252525252525e-07,
+ "loss": 1.1142408847808838,
+ "mean_token_accuracy": 0.7368099689483643,
+ "num_tokens": 38518784.0,
+ "step": 2351
+ },
+ {
+ "entropy": 1.2555266618728638,
+ "epoch": 4.751515151515152,
+ "grad_norm": 2.330214500427246,
+ "learning_rate": 2.505050505050505e-07,
+ "loss": 1.241432785987854,
+ "mean_token_accuracy": 0.7002931237220764,
+ "num_tokens": 38535168.0,
+ "step": 2352
+ },
+ {
+ "entropy": 1.2537733316421509,
+ "epoch": 4.753535353535353,
+ "grad_norm": 2.2559266090393066,
+ "learning_rate": 2.484848484848485e-07,
+ "loss": 1.25982666015625,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 38551552.0,
+ "step": 2353
+ },
+ {
+ "entropy": 1.3228288888931274,
+ "epoch": 4.7555555555555555,
+ "grad_norm": 2.329820156097412,
+ "learning_rate": 2.4646464646464645e-07,
+ "loss": 1.32167387008667,
+ "mean_token_accuracy": 0.67659991979599,
+ "num_tokens": 38567936.0,
+ "step": 2354
+ },
+ {
+ "entropy": 1.093949556350708,
+ "epoch": 4.757575757575758,
+ "grad_norm": 2.358074903488159,
+ "learning_rate": 2.444444444444445e-07,
+ "loss": 1.0948805809020996,
+ "mean_token_accuracy": 0.7231924533843994,
+ "num_tokens": 38584320.0,
+ "step": 2355
+ },
+ {
+ "entropy": 1.0497996807098389,
+ "epoch": 4.759595959595959,
+ "grad_norm": 2.2141003608703613,
+ "learning_rate": 2.4242424242424244e-07,
+ "loss": 1.0230276584625244,
+ "mean_token_accuracy": 0.742977499961853,
+ "num_tokens": 38600704.0,
+ "step": 2356
+ },
+ {
+ "entropy": 1.1963584423065186,
+ "epoch": 4.761616161616161,
+ "grad_norm": 2.2645151615142822,
+ "learning_rate": 2.4040404040404043e-07,
+ "loss": 1.181758165359497,
+ "mean_token_accuracy": 0.7053614854812622,
+ "num_tokens": 38617088.0,
+ "step": 2357
+ },
+ {
+ "entropy": 1.4849578142166138,
+ "epoch": 4.763636363636364,
+ "grad_norm": 2.188263177871704,
+ "learning_rate": 2.383838383838384e-07,
+ "loss": 1.466001033782959,
+ "mean_token_accuracy": 0.6846604943275452,
+ "num_tokens": 38633472.0,
+ "step": 2358
+ },
+ {
+ "entropy": 1.535861849784851,
+ "epoch": 4.765656565656566,
+ "grad_norm": 2.2588133811950684,
+ "learning_rate": 2.3636363636363637e-07,
+ "loss": 1.5331593751907349,
+ "mean_token_accuracy": 0.6493038535118103,
+ "num_tokens": 38649856.0,
+ "step": 2359
+ },
+ {
+ "entropy": 1.0385324954986572,
+ "epoch": 4.767676767676767,
+ "grad_norm": 2.2858803272247314,
+ "learning_rate": 2.343434343434344e-07,
+ "loss": 1.049726963043213,
+ "mean_token_accuracy": 0.7335124611854553,
+ "num_tokens": 38666240.0,
+ "step": 2360
+ },
+ {
+ "entropy": 1.3631771802902222,
+ "epoch": 4.7696969696969695,
+ "grad_norm": 2.2661380767822266,
+ "learning_rate": 2.3232323232323235e-07,
+ "loss": 1.361598014831543,
+ "mean_token_accuracy": 0.6767220497131348,
+ "num_tokens": 38682624.0,
+ "step": 2361
+ },
+ {
+ "entropy": 0.8404029011726379,
+ "epoch": 4.771717171717172,
+ "grad_norm": 2.2505478858947754,
+ "learning_rate": 2.3030303030303032e-07,
+ "loss": 0.8151557445526123,
+ "mean_token_accuracy": 0.7870664596557617,
+ "num_tokens": 38699008.0,
+ "step": 2362
+ },
+ {
+ "entropy": 1.173842191696167,
+ "epoch": 4.773737373737374,
+ "grad_norm": 2.144379138946533,
+ "learning_rate": 2.2828282828282832e-07,
+ "loss": 1.1829612255096436,
+ "mean_token_accuracy": 0.7094528675079346,
+ "num_tokens": 38715392.0,
+ "step": 2363
+ },
+ {
+ "entropy": 1.5040391683578491,
+ "epoch": 4.775757575757575,
+ "grad_norm": 2.397090196609497,
+ "learning_rate": 2.2626262626262628e-07,
+ "loss": 1.5017142295837402,
+ "mean_token_accuracy": 0.6525403261184692,
+ "num_tokens": 38731776.0,
+ "step": 2364
+ },
+ {
+ "entropy": 1.0069396495819092,
+ "epoch": 4.777777777777778,
+ "grad_norm": 2.2198808193206787,
+ "learning_rate": 2.2424242424242425e-07,
+ "loss": 1.0101712942123413,
+ "mean_token_accuracy": 0.7387640476226807,
+ "num_tokens": 38748160.0,
+ "step": 2365
+ },
+ {
+ "entropy": 1.0643916130065918,
+ "epoch": 4.77979797979798,
+ "grad_norm": 2.1866135597229004,
+ "learning_rate": 2.2222222222222224e-07,
+ "loss": 1.0893548727035522,
+ "mean_token_accuracy": 0.7278944849967957,
+ "num_tokens": 38764544.0,
+ "step": 2366
+ },
+ {
+ "entropy": 1.093658208847046,
+ "epoch": 4.781818181818182,
+ "grad_norm": 2.309128761291504,
+ "learning_rate": 2.202020202020202e-07,
+ "loss": 1.0758569240570068,
+ "mean_token_accuracy": 0.7228871583938599,
+ "num_tokens": 38780928.0,
+ "step": 2367
+ },
+ {
+ "entropy": 1.0118215084075928,
+ "epoch": 4.783838383838384,
+ "grad_norm": 2.3465147018432617,
+ "learning_rate": 2.181818181818182e-07,
+ "loss": 1.0125476121902466,
+ "mean_token_accuracy": 0.7398021221160889,
+ "num_tokens": 38797312.0,
+ "step": 2368
+ },
+ {
+ "entropy": 1.4553667306900024,
+ "epoch": 4.785858585858586,
+ "grad_norm": 2.311668872833252,
+ "learning_rate": 2.1616161616161617e-07,
+ "loss": 1.4538980722427368,
+ "mean_token_accuracy": 0.6701270341873169,
+ "num_tokens": 38813696.0,
+ "step": 2369
+ },
+ {
+ "entropy": 1.4284709692001343,
+ "epoch": 4.787878787878788,
+ "grad_norm": 2.2102832794189453,
+ "learning_rate": 2.1414141414141414e-07,
+ "loss": 1.445950984954834,
+ "mean_token_accuracy": 0.674401581287384,
+ "num_tokens": 38830080.0,
+ "step": 2370
+ },
+ {
+ "entropy": 1.3425463438034058,
+ "epoch": 4.78989898989899,
+ "grad_norm": 2.264972448348999,
+ "learning_rate": 2.1212121212121216e-07,
+ "loss": 1.3158369064331055,
+ "mean_token_accuracy": 0.685271143913269,
+ "num_tokens": 38846464.0,
+ "step": 2371
+ },
+ {
+ "entropy": 1.0617026090621948,
+ "epoch": 4.791919191919192,
+ "grad_norm": 2.3085737228393555,
+ "learning_rate": 2.1010101010101013e-07,
+ "loss": 1.0665439367294312,
+ "mean_token_accuracy": 0.7296653389930725,
+ "num_tokens": 38862848.0,
+ "step": 2372
+ },
+ {
+ "entropy": 1.580702543258667,
+ "epoch": 4.793939393939394,
+ "grad_norm": 2.872378349304199,
+ "learning_rate": 2.080808080808081e-07,
+ "loss": 1.5895251035690308,
+ "mean_token_accuracy": 0.6335490942001343,
+ "num_tokens": 38879232.0,
+ "step": 2373
+ },
+ {
+ "entropy": 1.4491817951202393,
+ "epoch": 4.795959595959596,
+ "grad_norm": 2.2542786598205566,
+ "learning_rate": 2.060606060606061e-07,
+ "loss": 1.4576756954193115,
+ "mean_token_accuracy": 0.669577419757843,
+ "num_tokens": 38895616.0,
+ "step": 2374
+ },
+ {
+ "entropy": 1.1148335933685303,
+ "epoch": 4.797979797979798,
+ "grad_norm": 2.310889959335327,
+ "learning_rate": 2.0404040404040406e-07,
+ "loss": 1.1072784662246704,
+ "mean_token_accuracy": 0.724963366985321,
+ "num_tokens": 38912000.0,
+ "step": 2375
+ },
+ {
+ "entropy": 1.1296288967132568,
+ "epoch": 4.8,
+ "grad_norm": 2.3222877979278564,
+ "learning_rate": 2.0202020202020205e-07,
+ "loss": 1.1322218179702759,
+ "mean_token_accuracy": 0.7090253829956055,
+ "num_tokens": 38928384.0,
+ "step": 2376
+ },
+ {
+ "entropy": 1.0851423740386963,
+ "epoch": 4.802020202020202,
+ "grad_norm": 2.2862296104431152,
+ "learning_rate": 2.0000000000000002e-07,
+ "loss": 1.0714319944381714,
+ "mean_token_accuracy": 0.732046902179718,
+ "num_tokens": 38944768.0,
+ "step": 2377
+ },
+ {
+ "entropy": 1.4850348234176636,
+ "epoch": 4.804040404040404,
+ "grad_norm": 2.2243518829345703,
+ "learning_rate": 1.9797979797979798e-07,
+ "loss": 1.483095407485962,
+ "mean_token_accuracy": 0.6584025621414185,
+ "num_tokens": 38961152.0,
+ "step": 2378
+ },
+ {
+ "entropy": 1.0152039527893066,
+ "epoch": 4.806060606060606,
+ "grad_norm": 2.3812599182128906,
+ "learning_rate": 1.9595959595959598e-07,
+ "loss": 1.0178192853927612,
+ "mean_token_accuracy": 0.7494503855705261,
+ "num_tokens": 38977536.0,
+ "step": 2379
+ },
+ {
+ "entropy": 1.606149435043335,
+ "epoch": 4.808080808080808,
+ "grad_norm": 2.578829050064087,
+ "learning_rate": 1.9393939393939395e-07,
+ "loss": 1.6279492378234863,
+ "mean_token_accuracy": 0.6199926733970642,
+ "num_tokens": 38993920.0,
+ "step": 2380
+ },
+ {
+ "entropy": 1.254974126815796,
+ "epoch": 4.81010101010101,
+ "grad_norm": 2.365147590637207,
+ "learning_rate": 1.919191919191919e-07,
+ "loss": 1.2483952045440674,
+ "mean_token_accuracy": 0.6998656392097473,
+ "num_tokens": 39010304.0,
+ "step": 2381
+ },
+ {
+ "entropy": 1.0788639783859253,
+ "epoch": 4.8121212121212125,
+ "grad_norm": 2.290659189224243,
+ "learning_rate": 1.8989898989898993e-07,
+ "loss": 1.1055562496185303,
+ "mean_token_accuracy": 0.7249022722244263,
+ "num_tokens": 39026688.0,
+ "step": 2382
+ },
+ {
+ "entropy": 1.4539564847946167,
+ "epoch": 4.814141414141414,
+ "grad_norm": 2.395479440689087,
+ "learning_rate": 1.878787878787879e-07,
+ "loss": 1.4771209955215454,
+ "mean_token_accuracy": 0.6563263535499573,
+ "num_tokens": 39043072.0,
+ "step": 2383
+ },
+ {
+ "entropy": 0.9699754118919373,
+ "epoch": 4.816161616161616,
+ "grad_norm": 2.471874713897705,
+ "learning_rate": 1.858585858585859e-07,
+ "loss": 0.9586566686630249,
+ "mean_token_accuracy": 0.7446262836456299,
+ "num_tokens": 39059456.0,
+ "step": 2384
+ },
+ {
+ "entropy": 1.3050302267074585,
+ "epoch": 4.818181818181818,
+ "grad_norm": 2.2205452919006348,
+ "learning_rate": 1.8383838383838386e-07,
+ "loss": 1.3049702644348145,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 39075840.0,
+ "step": 2385
+ },
+ {
+ "entropy": 1.1255296468734741,
+ "epoch": 4.82020202020202,
+ "grad_norm": 2.274259328842163,
+ "learning_rate": 1.8181818181818183e-07,
+ "loss": 1.1260244846343994,
+ "mean_token_accuracy": 0.7134220600128174,
+ "num_tokens": 39092224.0,
+ "step": 2386
+ },
+ {
+ "entropy": 0.9318177103996277,
+ "epoch": 4.822222222222222,
+ "grad_norm": 2.0648000240325928,
+ "learning_rate": 1.7979797979797982e-07,
+ "loss": 0.9120785593986511,
+ "mean_token_accuracy": 0.7661211490631104,
+ "num_tokens": 39108608.0,
+ "step": 2387
+ },
+ {
+ "entropy": 1.0134271383285522,
+ "epoch": 4.824242424242424,
+ "grad_norm": 2.260668992996216,
+ "learning_rate": 1.777777777777778e-07,
+ "loss": 1.0051692724227905,
+ "mean_token_accuracy": 0.7439545392990112,
+ "num_tokens": 39124992.0,
+ "step": 2388
+ },
+ {
+ "entropy": 1.201913833618164,
+ "epoch": 4.8262626262626265,
+ "grad_norm": 2.3676605224609375,
+ "learning_rate": 1.7575757575757576e-07,
+ "loss": 1.2044906616210938,
+ "mean_token_accuracy": 0.7144601941108704,
+ "num_tokens": 39141376.0,
+ "step": 2389
+ },
+ {
+ "entropy": 1.2177425622940063,
+ "epoch": 4.828282828282829,
+ "grad_norm": 2.068251609802246,
+ "learning_rate": 1.7373737373737375e-07,
+ "loss": 1.2142643928527832,
+ "mean_token_accuracy": 0.7080483436584473,
+ "num_tokens": 39157760.0,
+ "step": 2390
+ },
+ {
+ "entropy": 1.4004939794540405,
+ "epoch": 4.83030303030303,
+ "grad_norm": 2.4678943157196045,
+ "learning_rate": 1.7171717171717172e-07,
+ "loss": 1.382983922958374,
+ "mean_token_accuracy": 0.6609672904014587,
+ "num_tokens": 39174144.0,
+ "step": 2391
+ },
+ {
+ "entropy": 1.2480416297912598,
+ "epoch": 4.832323232323232,
+ "grad_norm": 2.2275490760803223,
+ "learning_rate": 1.6969696969696974e-07,
+ "loss": 1.2442829608917236,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 39190528.0,
+ "step": 2392
+ },
+ {
+ "entropy": 1.175554633140564,
+ "epoch": 4.834343434343435,
+ "grad_norm": 2.3274128437042236,
+ "learning_rate": 1.676767676767677e-07,
+ "loss": 1.1996537446975708,
+ "mean_token_accuracy": 0.7000488638877869,
+ "num_tokens": 39206912.0,
+ "step": 2393
+ },
+ {
+ "entropy": 1.129797339439392,
+ "epoch": 4.836363636363636,
+ "grad_norm": 2.0076446533203125,
+ "learning_rate": 1.6565656565656567e-07,
+ "loss": 1.1391470432281494,
+ "mean_token_accuracy": 0.7203224301338196,
+ "num_tokens": 39223296.0,
+ "step": 2394
+ },
+ {
+ "entropy": 1.3851672410964966,
+ "epoch": 4.838383838383838,
+ "grad_norm": 2.322408676147461,
+ "learning_rate": 1.6363636363636367e-07,
+ "loss": 1.3847455978393555,
+ "mean_token_accuracy": 0.6731191873550415,
+ "num_tokens": 39239680.0,
+ "step": 2395
+ },
+ {
+ "entropy": 0.807838499546051,
+ "epoch": 4.8404040404040405,
+ "grad_norm": 2.1578664779663086,
+ "learning_rate": 1.6161616161616163e-07,
+ "loss": 0.790963888168335,
+ "mean_token_accuracy": 0.7919516563415527,
+ "num_tokens": 39256064.0,
+ "step": 2396
+ },
+ {
+ "entropy": 1.3650189638137817,
+ "epoch": 4.842424242424243,
+ "grad_norm": 2.470627546310425,
+ "learning_rate": 1.595959595959596e-07,
+ "loss": 1.352724552154541,
+ "mean_token_accuracy": 0.6680508255958557,
+ "num_tokens": 39272448.0,
+ "step": 2397
+ },
+ {
+ "entropy": 0.9988412261009216,
+ "epoch": 4.844444444444444,
+ "grad_norm": 2.3024678230285645,
+ "learning_rate": 1.575757575757576e-07,
+ "loss": 1.0097228288650513,
+ "mean_token_accuracy": 0.7401074767112732,
+ "num_tokens": 39288832.0,
+ "step": 2398
+ },
+ {
+ "entropy": 1.2273977994918823,
+ "epoch": 4.846464646464646,
+ "grad_norm": 2.496877908706665,
+ "learning_rate": 1.5555555555555556e-07,
+ "loss": 1.2331998348236084,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 39305216.0,
+ "step": 2399
+ },
+ {
+ "entropy": 1.1379625797271729,
+ "epoch": 4.848484848484849,
+ "grad_norm": 2.2165470123291016,
+ "learning_rate": 1.5353535353535356e-07,
+ "loss": 1.1311036348342896,
+ "mean_token_accuracy": 0.7255129218101501,
+ "num_tokens": 39321600.0,
+ "step": 2400
+ },
+ {
+ "epoch": 4.848484848484849,
+ "eval_entropy": 1.287453404838039,
+ "eval_loss": 1.5620986223220825,
+ "eval_mean_token_accuracy": 0.6438380523074058,
+ "eval_num_tokens": 39321600.0,
+ "eval_runtime": 43.7382,
+ "eval_samples_per_second": 22.635,
+ "eval_steps_per_second": 2.835,
+ "step": 2400
+ },
+ {
+ "entropy": 0.8480889797210693,
+ "epoch": 4.850505050505051,
+ "grad_norm": 2.2270820140838623,
+ "learning_rate": 1.5151515151515152e-07,
+ "loss": 0.8555670976638794,
+ "mean_token_accuracy": 0.7665486335754395,
+ "num_tokens": 39337984.0,
+ "step": 2401
+ },
+ {
+ "entropy": 0.9117488265037537,
+ "epoch": 4.852525252525252,
+ "grad_norm": 2.1996190547943115,
+ "learning_rate": 1.4949494949494952e-07,
+ "loss": 0.9289630651473999,
+ "mean_token_accuracy": 0.7600146532058716,
+ "num_tokens": 39354368.0,
+ "step": 2402
+ },
+ {
+ "entropy": 1.3071238994598389,
+ "epoch": 4.8545454545454545,
+ "grad_norm": 2.178358793258667,
+ "learning_rate": 1.4747474747474749e-07,
+ "loss": 1.3033668994903564,
+ "mean_token_accuracy": 0.6831338405609131,
+ "num_tokens": 39370752.0,
+ "step": 2403
+ },
+ {
+ "entropy": 1.4874638319015503,
+ "epoch": 4.856565656565657,
+ "grad_norm": 2.360041379928589,
+ "learning_rate": 1.4545454545454548e-07,
+ "loss": 1.4955557584762573,
+ "mean_token_accuracy": 0.6526013612747192,
+ "num_tokens": 39387136.0,
+ "step": 2404
+ },
+ {
+ "entropy": 1.1542364358901978,
+ "epoch": 4.858585858585858,
+ "grad_norm": 2.1776201725006104,
+ "learning_rate": 1.4343434343434345e-07,
+ "loss": 1.1404229402542114,
+ "mean_token_accuracy": 0.7199560403823853,
+ "num_tokens": 39403520.0,
+ "step": 2405
+ },
+ {
+ "entropy": 1.2594319581985474,
+ "epoch": 4.86060606060606,
+ "grad_norm": 2.144207715988159,
+ "learning_rate": 1.4141414141414144e-07,
+ "loss": 1.272618055343628,
+ "mean_token_accuracy": 0.7062774896621704,
+ "num_tokens": 39419904.0,
+ "step": 2406
+ },
+ {
+ "entropy": 1.4888932704925537,
+ "epoch": 4.862626262626263,
+ "grad_norm": 2.461423873901367,
+ "learning_rate": 1.393939393939394e-07,
+ "loss": 1.4978430271148682,
+ "mean_token_accuracy": 0.648937463760376,
+ "num_tokens": 39436288.0,
+ "step": 2407
+ },
+ {
+ "entropy": 1.2378987073898315,
+ "epoch": 4.864646464646465,
+ "grad_norm": 2.3147332668304443,
+ "learning_rate": 1.3737373737373738e-07,
+ "loss": 1.251128077507019,
+ "mean_token_accuracy": 0.7049340605735779,
+ "num_tokens": 39452672.0,
+ "step": 2408
+ },
+ {
+ "entropy": 1.0804370641708374,
+ "epoch": 4.866666666666667,
+ "grad_norm": 2.2359390258789062,
+ "learning_rate": 1.3535353535353537e-07,
+ "loss": 1.0663418769836426,
+ "mean_token_accuracy": 0.7359550595283508,
+ "num_tokens": 39469056.0,
+ "step": 2409
+ },
+ {
+ "entropy": 0.9537230730056763,
+ "epoch": 4.8686868686868685,
+ "grad_norm": 2.1780338287353516,
+ "learning_rate": 1.3333333333333336e-07,
+ "loss": 0.9360350370407104,
+ "mean_token_accuracy": 0.755984365940094,
+ "num_tokens": 39485440.0,
+ "step": 2410
+ },
+ {
+ "entropy": 1.2282828092575073,
+ "epoch": 4.870707070707071,
+ "grad_norm": 2.4646949768066406,
+ "learning_rate": 1.3131313131313133e-07,
+ "loss": 1.2513031959533691,
+ "mean_token_accuracy": 0.6998656392097473,
+ "num_tokens": 39501824.0,
+ "step": 2411
+ },
+ {
+ "entropy": 0.9471758008003235,
+ "epoch": 4.872727272727273,
+ "grad_norm": 2.4472343921661377,
+ "learning_rate": 1.292929292929293e-07,
+ "loss": 0.9313589334487915,
+ "mean_token_accuracy": 0.745175838470459,
+ "num_tokens": 39518208.0,
+ "step": 2412
+ },
+ {
+ "entropy": 1.5314515829086304,
+ "epoch": 4.874747474747474,
+ "grad_norm": 2.40248703956604,
+ "learning_rate": 1.272727272727273e-07,
+ "loss": 1.513268232345581,
+ "mean_token_accuracy": 0.6563873887062073,
+ "num_tokens": 39534592.0,
+ "step": 2413
+ },
+ {
+ "entropy": 1.4170082807540894,
+ "epoch": 4.876767676767677,
+ "grad_norm": 2.513214588165283,
+ "learning_rate": 1.2525252525252526e-07,
+ "loss": 1.4214344024658203,
+ "mean_token_accuracy": 0.6609672904014587,
+ "num_tokens": 39550976.0,
+ "step": 2414
+ },
+ {
+ "entropy": 1.2669848203659058,
+ "epoch": 4.878787878787879,
+ "grad_norm": 2.3023788928985596,
+ "learning_rate": 1.2323232323232323e-07,
+ "loss": 1.2646489143371582,
+ "mean_token_accuracy": 0.6824621558189392,
+ "num_tokens": 39567360.0,
+ "step": 2415
+ },
+ {
+ "entropy": 1.4063810110092163,
+ "epoch": 4.880808080808081,
+ "grad_norm": 2.303424596786499,
+ "learning_rate": 1.2121212121212122e-07,
+ "loss": 1.399657964706421,
+ "mean_token_accuracy": 0.6720811128616333,
+ "num_tokens": 39583744.0,
+ "step": 2416
+ },
+ {
+ "entropy": 1.4641772508621216,
+ "epoch": 4.8828282828282825,
+ "grad_norm": 2.468921661376953,
+ "learning_rate": 1.191919191919192e-07,
+ "loss": 1.46146559715271,
+ "mean_token_accuracy": 0.65492182970047,
+ "num_tokens": 39600128.0,
+ "step": 2417
+ },
+ {
+ "entropy": 1.2154735326766968,
+ "epoch": 4.884848484848485,
+ "grad_norm": 2.429311752319336,
+ "learning_rate": 1.171717171717172e-07,
+ "loss": 1.2101836204528809,
+ "mean_token_accuracy": 0.6988885998725891,
+ "num_tokens": 39616512.0,
+ "step": 2418
+ },
+ {
+ "entropy": 0.8925865888595581,
+ "epoch": 4.886868686868687,
+ "grad_norm": 2.281524419784546,
+ "learning_rate": 1.1515151515151516e-07,
+ "loss": 0.884310245513916,
+ "mean_token_accuracy": 0.7589154839515686,
+ "num_tokens": 39632896.0,
+ "step": 2419
+ },
+ {
+ "entropy": 1.2473207712173462,
+ "epoch": 4.888888888888889,
+ "grad_norm": 2.0147485733032227,
+ "learning_rate": 1.1313131313131314e-07,
+ "loss": 1.2424726486206055,
+ "mean_token_accuracy": 0.7096971273422241,
+ "num_tokens": 39649280.0,
+ "step": 2420
+ },
+ {
+ "entropy": 1.176668405532837,
+ "epoch": 4.890909090909091,
+ "grad_norm": 2.4631848335266113,
+ "learning_rate": 1.1111111111111112e-07,
+ "loss": 1.173363208770752,
+ "mean_token_accuracy": 0.6982779502868652,
+ "num_tokens": 39665664.0,
+ "step": 2421
+ },
+ {
+ "entropy": 1.1733225584030151,
+ "epoch": 4.892929292929293,
+ "grad_norm": 2.567352294921875,
+ "learning_rate": 1.090909090909091e-07,
+ "loss": 1.1714212894439697,
+ "mean_token_accuracy": 0.7132999300956726,
+ "num_tokens": 39682048.0,
+ "step": 2422
+ },
+ {
+ "entropy": 0.9787822961807251,
+ "epoch": 4.894949494949495,
+ "grad_norm": 2.5099260807037354,
+ "learning_rate": 1.0707070707070707e-07,
+ "loss": 0.9771278500556946,
+ "mean_token_accuracy": 0.7329018115997314,
+ "num_tokens": 39698432.0,
+ "step": 2423
+ },
+ {
+ "entropy": 0.9620134234428406,
+ "epoch": 4.8969696969696965,
+ "grad_norm": 2.085623025894165,
+ "learning_rate": 1.0505050505050506e-07,
+ "loss": 0.9678645133972168,
+ "mean_token_accuracy": 0.7519540786743164,
+ "num_tokens": 39714816.0,
+ "step": 2424
+ },
+ {
+ "entropy": 1.3669517040252686,
+ "epoch": 4.898989898989899,
+ "grad_norm": 2.2397220134735107,
+ "learning_rate": 1.0303030303030304e-07,
+ "loss": 1.3635847568511963,
+ "mean_token_accuracy": 0.6789814233779907,
+ "num_tokens": 39731200.0,
+ "step": 2425
+ },
+ {
+ "entropy": 1.088536262512207,
+ "epoch": 4.901010101010101,
+ "grad_norm": 2.311772108078003,
+ "learning_rate": 1.0101010101010103e-07,
+ "loss": 1.074340581893921,
+ "mean_token_accuracy": 0.7220932841300964,
+ "num_tokens": 39747584.0,
+ "step": 2426
+ },
+ {
+ "entropy": 1.3117040395736694,
+ "epoch": 4.903030303030303,
+ "grad_norm": 2.3678650856018066,
+ "learning_rate": 9.898989898989899e-08,
+ "loss": 1.3200736045837402,
+ "mean_token_accuracy": 0.6888129115104675,
+ "num_tokens": 39763968.0,
+ "step": 2427
+ },
+ {
+ "entropy": 1.0334731340408325,
+ "epoch": 4.9050505050505055,
+ "grad_norm": 2.244715452194214,
+ "learning_rate": 9.696969696969697e-08,
+ "loss": 1.0399707555770874,
+ "mean_token_accuracy": 0.7382755279541016,
+ "num_tokens": 39780352.0,
+ "step": 2428
+ },
+ {
+ "entropy": 1.2658854722976685,
+ "epoch": 4.907070707070707,
+ "grad_norm": 2.3209128379821777,
+ "learning_rate": 9.494949494949497e-08,
+ "loss": 1.2778537273406982,
+ "mean_token_accuracy": 0.6900952458381653,
+ "num_tokens": 39796736.0,
+ "step": 2429
+ },
+ {
+ "entropy": 1.4913005828857422,
+ "epoch": 4.909090909090909,
+ "grad_norm": 2.4210398197174072,
+ "learning_rate": 9.292929292929295e-08,
+ "loss": 1.5127770900726318,
+ "mean_token_accuracy": 0.641792893409729,
+ "num_tokens": 39813120.0,
+ "step": 2430
+ },
+ {
+ "entropy": 1.7913345098495483,
+ "epoch": 4.911111111111111,
+ "grad_norm": 2.3230996131896973,
+ "learning_rate": 9.090909090909091e-08,
+ "loss": 1.806335687637329,
+ "mean_token_accuracy": 0.5915364027023315,
+ "num_tokens": 39829504.0,
+ "step": 2431
+ },
+ {
+ "entropy": 1.3686211109161377,
+ "epoch": 4.913131313131313,
+ "grad_norm": 2.3728842735290527,
+ "learning_rate": 8.88888888888889e-08,
+ "loss": 1.3729017972946167,
+ "mean_token_accuracy": 0.6770273447036743,
+ "num_tokens": 39845888.0,
+ "step": 2432
+ },
+ {
+ "entropy": 1.532094120979309,
+ "epoch": 4.915151515151515,
+ "grad_norm": 2.3725192546844482,
+ "learning_rate": 8.686868686868688e-08,
+ "loss": 1.5053999423980713,
+ "mean_token_accuracy": 0.6447240114212036,
+ "num_tokens": 39862272.0,
+ "step": 2433
+ },
+ {
+ "entropy": 1.1579054594039917,
+ "epoch": 4.917171717171717,
+ "grad_norm": 2.4051802158355713,
+ "learning_rate": 8.484848484848487e-08,
+ "loss": 1.1492040157318115,
+ "mean_token_accuracy": 0.7176966071128845,
+ "num_tokens": 39878656.0,
+ "step": 2434
+ },
+ {
+ "entropy": 1.1870861053466797,
+ "epoch": 4.91919191919192,
+ "grad_norm": 2.2848308086395264,
+ "learning_rate": 8.282828282828284e-08,
+ "loss": 1.161110281944275,
+ "mean_token_accuracy": 0.7132999300956726,
+ "num_tokens": 39895040.0,
+ "step": 2435
+ },
+ {
+ "entropy": 0.993489682674408,
+ "epoch": 4.921212121212121,
+ "grad_norm": 2.209522247314453,
+ "learning_rate": 8.080808080808082e-08,
+ "loss": 0.9955021142959595,
+ "mean_token_accuracy": 0.7460307478904724,
+ "num_tokens": 39911424.0,
+ "step": 2436
+ },
+ {
+ "entropy": 0.8698616027832031,
+ "epoch": 4.923232323232323,
+ "grad_norm": 2.0848515033721924,
+ "learning_rate": 7.87878787878788e-08,
+ "loss": 0.8670492172241211,
+ "mean_token_accuracy": 0.7761968970298767,
+ "num_tokens": 39927808.0,
+ "step": 2437
+ },
+ {
+ "entropy": 1.2253624200820923,
+ "epoch": 4.925252525252525,
+ "grad_norm": 2.166091203689575,
+ "learning_rate": 7.676767676767678e-08,
+ "loss": 1.1965932846069336,
+ "mean_token_accuracy": 0.7053004503250122,
+ "num_tokens": 39944192.0,
+ "step": 2438
+ },
+ {
+ "entropy": 1.1075690984725952,
+ "epoch": 4.927272727272728,
+ "grad_norm": 2.2962300777435303,
+ "learning_rate": 7.474747474747476e-08,
+ "loss": 1.1296148300170898,
+ "mean_token_accuracy": 0.7225818037986755,
+ "num_tokens": 39960576.0,
+ "step": 2439
+ },
+ {
+ "entropy": 1.234410047531128,
+ "epoch": 4.929292929292929,
+ "grad_norm": 2.331155776977539,
+ "learning_rate": 7.272727272727274e-08,
+ "loss": 1.2488322257995605,
+ "mean_token_accuracy": 0.6974230408668518,
+ "num_tokens": 39976960.0,
+ "step": 2440
+ },
+ {
+ "entropy": 1.4327800273895264,
+ "epoch": 4.931313131313131,
+ "grad_norm": 2.460622787475586,
+ "learning_rate": 7.070707070707072e-08,
+ "loss": 1.4103214740753174,
+ "mean_token_accuracy": 0.6623717546463013,
+ "num_tokens": 39993344.0,
+ "step": 2441
+ },
+ {
+ "entropy": 1.3475353717803955,
+ "epoch": 4.933333333333334,
+ "grad_norm": 2.5242390632629395,
+ "learning_rate": 6.868686868686869e-08,
+ "loss": 1.3579360246658325,
+ "mean_token_accuracy": 0.6707987189292908,
+ "num_tokens": 40009728.0,
+ "step": 2442
+ },
+ {
+ "entropy": 1.259186029434204,
+ "epoch": 4.935353535353535,
+ "grad_norm": 2.615501642227173,
+ "learning_rate": 6.666666666666668e-08,
+ "loss": 1.2570360898971558,
+ "mean_token_accuracy": 0.6861870884895325,
+ "num_tokens": 40026112.0,
+ "step": 2443
+ },
+ {
+ "entropy": 1.1449041366577148,
+ "epoch": 4.937373737373737,
+ "grad_norm": 2.3570308685302734,
+ "learning_rate": 6.464646464646465e-08,
+ "loss": 1.1318464279174805,
+ "mean_token_accuracy": 0.7102466821670532,
+ "num_tokens": 40042496.0,
+ "step": 2444
+ },
+ {
+ "entropy": 0.9617025852203369,
+ "epoch": 4.9393939393939394,
+ "grad_norm": 2.316823959350586,
+ "learning_rate": 6.262626262626263e-08,
+ "loss": 0.9381533861160278,
+ "mean_token_accuracy": 0.7504274845123291,
+ "num_tokens": 40058880.0,
+ "step": 2445
+ },
+ {
+ "entropy": 1.0141503810882568,
+ "epoch": 4.941414141414142,
+ "grad_norm": 2.1891255378723145,
+ "learning_rate": 6.060606060606061e-08,
+ "loss": 1.015519618988037,
+ "mean_token_accuracy": 0.738092303276062,
+ "num_tokens": 40075264.0,
+ "step": 2446
+ },
+ {
+ "entropy": 1.2403353452682495,
+ "epoch": 4.943434343434343,
+ "grad_norm": 2.4201672077178955,
+ "learning_rate": 5.85858585858586e-08,
+ "loss": 1.2536835670471191,
+ "mean_token_accuracy": 0.6921714544296265,
+ "num_tokens": 40091648.0,
+ "step": 2447
+ },
+ {
+ "entropy": 1.2879153490066528,
+ "epoch": 4.945454545454545,
+ "grad_norm": 2.2885098457336426,
+ "learning_rate": 5.656565656565657e-08,
+ "loss": 1.2876033782958984,
+ "mean_token_accuracy": 0.7035295367240906,
+ "num_tokens": 40108032.0,
+ "step": 2448
+ },
+ {
+ "entropy": 1.6080931425094604,
+ "epoch": 4.947474747474748,
+ "grad_norm": 2.2233543395996094,
+ "learning_rate": 5.454545454545455e-08,
+ "loss": 1.6212408542633057,
+ "mean_token_accuracy": 0.63312166929245,
+ "num_tokens": 40124416.0,
+ "step": 2449
+ },
+ {
+ "entropy": 1.1142158508300781,
+ "epoch": 4.94949494949495,
+ "grad_norm": 2.270122766494751,
+ "learning_rate": 5.252525252525253e-08,
+ "loss": 1.1052987575531006,
+ "mean_token_accuracy": 0.7298485636711121,
+ "num_tokens": 40140800.0,
+ "step": 2450
+ },
+ {
+ "epoch": 4.94949494949495,
+ "eval_entropy": 1.2876735839151567,
+ "eval_loss": 1.562165379524231,
+ "eval_mean_token_accuracy": 0.6437897917724424,
+ "eval_num_tokens": 40140800.0,
+ "eval_runtime": 43.7403,
+ "eval_samples_per_second": 22.634,
+ "eval_steps_per_second": 2.835,
+ "step": 2450
+ },
+ {
+ "entropy": 1.339135766029358,
+ "epoch": 4.951515151515151,
+ "grad_norm": 2.068509101867676,
+ "learning_rate": 5.050505050505051e-08,
+ "loss": 1.3422555923461914,
+ "mean_token_accuracy": 0.6739740967750549,
+ "num_tokens": 40157184.0,
+ "step": 2451
+ },
+ {
+ "entropy": 1.086835265159607,
+ "epoch": 4.9535353535353535,
+ "grad_norm": 2.3591971397399902,
+ "learning_rate": 4.8484848484848486e-08,
+ "loss": 1.0669522285461426,
+ "mean_token_accuracy": 0.7236199378967285,
+ "num_tokens": 40173568.0,
+ "step": 2452
+ },
+ {
+ "entropy": 1.2980481386184692,
+ "epoch": 4.955555555555556,
+ "grad_norm": 2.3696742057800293,
+ "learning_rate": 4.6464646464646474e-08,
+ "loss": 1.313071370124817,
+ "mean_token_accuracy": 0.6906448602676392,
+ "num_tokens": 40189952.0,
+ "step": 2453
+ },
+ {
+ "entropy": 1.1795636415481567,
+ "epoch": 4.957575757575757,
+ "grad_norm": 2.3436481952667236,
+ "learning_rate": 4.444444444444445e-08,
+ "loss": 1.1898691654205322,
+ "mean_token_accuracy": 0.7040791511535645,
+ "num_tokens": 40206336.0,
+ "step": 2454
+ },
+ {
+ "entropy": 0.8319778442382812,
+ "epoch": 4.959595959595959,
+ "grad_norm": 2.1321425437927246,
+ "learning_rate": 4.2424242424242435e-08,
+ "loss": 0.8329704999923706,
+ "mean_token_accuracy": 0.7830972075462341,
+ "num_tokens": 40222720.0,
+ "step": 2455
+ },
+ {
+ "entropy": 1.052415132522583,
+ "epoch": 4.961616161616162,
+ "grad_norm": 2.2577855587005615,
+ "learning_rate": 4.040404040404041e-08,
+ "loss": 1.0562504529953003,
+ "mean_token_accuracy": 0.733146071434021,
+ "num_tokens": 40239104.0,
+ "step": 2456
+ },
+ {
+ "entropy": 1.0988104343414307,
+ "epoch": 4.963636363636364,
+ "grad_norm": 2.401578187942505,
+ "learning_rate": 3.838383838383839e-08,
+ "loss": 1.1040318012237549,
+ "mean_token_accuracy": 0.72013920545578,
+ "num_tokens": 40255488.0,
+ "step": 2457
+ },
+ {
+ "entropy": 1.3352779150009155,
+ "epoch": 4.965656565656566,
+ "grad_norm": 2.185018301010132,
+ "learning_rate": 3.636363636363637e-08,
+ "loss": 1.32777738571167,
+ "mean_token_accuracy": 0.6927210688591003,
+ "num_tokens": 40271872.0,
+ "step": 2458
+ },
+ {
+ "entropy": 1.740423560142517,
+ "epoch": 4.9676767676767675,
+ "grad_norm": 2.3727855682373047,
+ "learning_rate": 3.4343434343434344e-08,
+ "loss": 1.7246336936950684,
+ "mean_token_accuracy": 0.6031387448310852,
+ "num_tokens": 40288256.0,
+ "step": 2459
+ },
+ {
+ "entropy": 1.2249867916107178,
+ "epoch": 4.96969696969697,
+ "grad_norm": 2.190229654312134,
+ "learning_rate": 3.2323232323232324e-08,
+ "loss": 1.2399539947509766,
+ "mean_token_accuracy": 0.7046898007392883,
+ "num_tokens": 40304640.0,
+ "step": 2460
+ },
+ {
+ "entropy": 1.051764726638794,
+ "epoch": 4.971717171717172,
+ "grad_norm": 2.1387240886688232,
+ "learning_rate": 3.0303030303030305e-08,
+ "loss": 1.0502032041549683,
+ "mean_token_accuracy": 0.7348558902740479,
+ "num_tokens": 40321024.0,
+ "step": 2461
+ },
+ {
+ "entropy": 0.8195315599441528,
+ "epoch": 4.973737373737373,
+ "grad_norm": 2.1464476585388184,
+ "learning_rate": 2.8282828282828285e-08,
+ "loss": 0.8101259469985962,
+ "mean_token_accuracy": 0.77992182970047,
+ "num_tokens": 40337408.0,
+ "step": 2462
+ },
+ {
+ "entropy": 0.9888697266578674,
+ "epoch": 4.975757575757576,
+ "grad_norm": 2.357499837875366,
+ "learning_rate": 2.6262626262626266e-08,
+ "loss": 0.9762573838233948,
+ "mean_token_accuracy": 0.7430996298789978,
+ "num_tokens": 40353792.0,
+ "step": 2463
+ },
+ {
+ "entropy": 1.4075063467025757,
+ "epoch": 4.977777777777778,
+ "grad_norm": 2.2885241508483887,
+ "learning_rate": 2.4242424242424243e-08,
+ "loss": 1.3647881746292114,
+ "mean_token_accuracy": 0.6737909317016602,
+ "num_tokens": 40370176.0,
+ "step": 2464
+ },
+ {
+ "entropy": 0.6581518054008484,
+ "epoch": 4.97979797979798,
+ "grad_norm": 2.228896379470825,
+ "learning_rate": 2.2222222222222224e-08,
+ "loss": 0.6321805715560913,
+ "mean_token_accuracy": 0.8178431987762451,
+ "num_tokens": 40386560.0,
+ "step": 2465
+ },
+ {
+ "entropy": 1.0636364221572876,
+ "epoch": 4.9818181818181815,
+ "grad_norm": 2.3927156925201416,
+ "learning_rate": 2.0202020202020204e-08,
+ "loss": 1.0664286613464355,
+ "mean_token_accuracy": 0.7248412370681763,
+ "num_tokens": 40402944.0,
+ "step": 2466
+ },
+ {
+ "entropy": 0.9568659663200378,
+ "epoch": 4.983838383838384,
+ "grad_norm": 2.3572115898132324,
+ "learning_rate": 1.8181818181818185e-08,
+ "loss": 0.9277185201644897,
+ "mean_token_accuracy": 0.7493282556533813,
+ "num_tokens": 40419328.0,
+ "step": 2467
+ },
+ {
+ "entropy": 1.0510457754135132,
+ "epoch": 4.985858585858586,
+ "grad_norm": 2.425138473510742,
+ "learning_rate": 1.6161616161616162e-08,
+ "loss": 1.0535608530044556,
+ "mean_token_accuracy": 0.7256961464881897,
+ "num_tokens": 40435712.0,
+ "step": 2468
+ },
+ {
+ "entropy": 0.7372819185256958,
+ "epoch": 4.987878787878788,
+ "grad_norm": 2.304194688796997,
+ "learning_rate": 1.4141414141414143e-08,
+ "loss": 0.7333900332450867,
+ "mean_token_accuracy": 0.7998901009559631,
+ "num_tokens": 40452096.0,
+ "step": 2469
+ },
+ {
+ "entropy": 1.5864061117172241,
+ "epoch": 4.98989898989899,
+ "grad_norm": 2.5311288833618164,
+ "learning_rate": 1.2121212121212122e-08,
+ "loss": 1.5565006732940674,
+ "mean_token_accuracy": 0.6236565709114075,
+ "num_tokens": 40468480.0,
+ "step": 2470
+ },
+ {
+ "entropy": 1.3043371438980103,
+ "epoch": 4.991919191919192,
+ "grad_norm": 2.3082878589630127,
+ "learning_rate": 1.0101010101010102e-08,
+ "loss": 1.3108078241348267,
+ "mean_token_accuracy": 0.6911944150924683,
+ "num_tokens": 40484864.0,
+ "step": 2471
+ },
+ {
+ "entropy": 0.968794584274292,
+ "epoch": 4.993939393939394,
+ "grad_norm": 2.276085376739502,
+ "learning_rate": 8.080808080808081e-09,
+ "loss": 0.9717127084732056,
+ "mean_token_accuracy": 0.7609916925430298,
+ "num_tokens": 40501248.0,
+ "step": 2472
+ },
+ {
+ "entropy": 1.117543339729309,
+ "epoch": 4.9959595959595955,
+ "grad_norm": 2.148294448852539,
+ "learning_rate": 6.060606060606061e-09,
+ "loss": 1.1264331340789795,
+ "mean_token_accuracy": 0.727161705493927,
+ "num_tokens": 40517632.0,
+ "step": 2473
+ },
+ {
+ "entropy": 1.251431941986084,
+ "epoch": 4.997979797979798,
+ "grad_norm": 2.5389761924743652,
+ "learning_rate": 4.0404040404040405e-09,
+ "loss": 1.261974573135376,
+ "mean_token_accuracy": 0.689728856086731,
+ "num_tokens": 40534016.0,
+ "step": 2474
+ },
+ {
+ "entropy": 1.1107192039489746,
+ "epoch": 5.0,
+ "grad_norm": 2.3861618041992188,
+ "learning_rate": 2.0202020202020203e-09,
+ "loss": 1.0901215076446533,
+ "mean_token_accuracy": 0.7343673706054688,
+ "num_tokens": 40550400.0,
+ "step": 2475
+ },
+ {
+ "epoch": 5.0,
+ "eval_entropy": 1.287564484342452,
+ "eval_loss": 1.5621511936187744,
+ "eval_mean_token_accuracy": 0.6438104760262274,
+ "eval_num_tokens": 40550400.0,
+ "eval_runtime": 43.7155,
+ "eval_samples_per_second": 22.646,
+ "eval_steps_per_second": 2.837,
+ "step": 2475
+ }
+ ],
+ "logging_steps": 1,
+ "max_steps": 2475,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 5,
+ "save_steps": 500,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": true
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 3.429128472625152e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/training_args.bin b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/training_args.bin
new file mode 100644
index 0000000000000000000000000000000000000000..37649d4bae96a1df88666daf20b4e5b6e092d976
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/training_args.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:58bbcabfe99a1cf24f2e76aab66b507c2b720d9271dc9f17c8208d741a9c3a65
+size 7121
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/zero_to_fp32.py b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/zero_to_fp32.py
new file mode 100644
index 0000000000000000000000000000000000000000..3970548c400fd4361bd923b763db90e963ddaf8c
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/zero_to_fp32.py
@@ -0,0 +1,854 @@
+#!/usr/bin/env python
+
+# Copyright (c) Microsoft Corporation.
+# SPDX-License-Identifier: Apache-2.0
+
+# DeepSpeed Team
+
+# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets
+# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in
+# the future. Once extracted, the weights don't require DeepSpeed and can be used in any
+# application.
+#
+# example:
+# python zero_to_fp32.py . output_dir/
+# or
+# python zero_to_fp32.py . output_dir/ --safe_serialization
+
+import argparse
+import torch
+import glob
+import math
+import os
+import re
+import gc
+import json
+import numpy as np
+from tqdm import tqdm
+from collections import OrderedDict
+from dataclasses import dataclass
+
+# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with
+# DeepSpeed data structures it has to be available in the current python environment.
+from deepspeed.utils import logger
+from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS,
+ FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES,
+ FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS, AUTOEP_LAYERS_KEY,
+ AUTOEP_LAYERS_KEY_LEGACY, AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY,
+ AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT, PARAM_ALIGNMENT_PADDINGS)
+
+
+@dataclass
+class zero_model_state:
+ buffers: dict()
+ param_shapes: dict()
+ shared_params: list
+ ds_version: int
+ frozen_param_shapes: dict()
+ frozen_param_fragments: dict()
+
+
+debug = 0
+
+# load to cpu
+device = torch.device('cpu')
+
+OUTPUT_DTYPE_NAMES = {
+ 'float32': torch.float32,
+ 'fp32': torch.float32,
+ 'float16': torch.float16,
+ 'fp16': torch.float16,
+ 'bfloat16': torch.bfloat16,
+ 'bf16': torch.bfloat16,
+}
+
+
+def _resolve_output_dtype(dtype):
+ requested_dtype = dtype
+ if isinstance(dtype, str):
+ dtype_name = dtype[6:] if dtype.startswith('torch.') else dtype
+ dtype = OUTPUT_DTYPE_NAMES.get(dtype_name.lower())
+ if dtype not in set(OUTPUT_DTYPE_NAMES.values()):
+ supported = ', '.join(sorted(OUTPUT_DTYPE_NAMES))
+ raise ValueError(f"Unsupported output dtype {requested_dtype!r}. Choose one of: {supported}")
+ return dtype
+
+
+def atoi(text):
+ return int(text) if text.isdigit() else text
+
+
+def natural_keys(text):
+ '''
+ alist.sort(key=natural_keys) sorts in human order
+ http://nedbatchelder.com/blog/200712/human_sorting.html
+ (See Toothy's implementation in the comments)
+ '''
+ return [atoi(c) for c in re.split(r'(\d+)', text)]
+
+
+def get_model_state_file(checkpoint_dir, zero_stage):
+ if not os.path.isdir(checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist")
+
+ # there should be only one file
+ if zero_stage <= 2:
+ file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt")
+ elif zero_stage == 3:
+ file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt")
+
+ if not os.path.exists(file):
+ raise FileNotFoundError(f"can't find model states file at '{file}'")
+
+ return file
+
+
+def get_checkpoint_files(checkpoint_dir, glob_pattern):
+ # XXX: need to test that this simple glob rule works for multi-node setup too
+ ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys)
+
+ if len(ckpt_files) == 0:
+ raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'")
+
+ return ckpt_files
+
+
+def get_optim_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt")
+
+
+def get_model_state_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_model_states.pt")
+
+
+def _has_autoep_zero3_partitioned_metadata(state_dict):
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY)
+ if autoep_layers is None:
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY_LEGACY)
+ if not isinstance(autoep_layers, list):
+ return False
+ return any(
+ isinstance(entry, dict)
+ and entry.get(AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY) == AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT
+ for entry in autoep_layers)
+
+
+def _raise_if_autoep_zero3_partitioned_state(state_dict):
+ if _has_autoep_zero3_partitioned_metadata(state_dict):
+ raise NotImplementedError("zero_to_fp32 does not support AutoEP ZeRO-3 partition-native checkpoints. "
+ "AutoEP expert parameters are partitioned over expert replica groups, so "
+ "global data-parallel consolidation would produce incomplete expert tensors. "
+ "Use ds_to_universal.py for expert-aware conversion.")
+
+
+def _raise_if_autoep_zero3_partitioned_checkpoint(model_files):
+ for file in model_files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+
+def parse_model_states(files):
+ zero_model_states = []
+ for file in files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+ if BUFFER_NAMES not in state_dict:
+ raise ValueError(f"{file} is not a model state checkpoint")
+ buffer_names = state_dict[BUFFER_NAMES]
+ if debug:
+ print("Found buffers:", buffer_names)
+
+ # recover just the buffers while restoring them to fp32 if they were saved in fp16
+ buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names}
+ param_shapes = state_dict[PARAM_SHAPES]
+
+ # collect parameters that are included in param_shapes
+ param_names = []
+ for s in param_shapes:
+ for name in s.keys():
+ param_names.append(name)
+
+ # update with frozen parameters
+ frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None)
+ if frozen_param_shapes is not None:
+ if debug:
+ print(f"Found frozen_param_shapes: {frozen_param_shapes}")
+ param_names += list(frozen_param_shapes.keys())
+
+ # handle shared params
+ shared_params = [[k, v] for k, v in state_dict["shared_params"].items()]
+
+ ds_version = state_dict.get(DS_VERSION, None)
+
+ frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None)
+
+ z_model_state = zero_model_state(buffers=buffers,
+ param_shapes=param_shapes,
+ shared_params=shared_params,
+ ds_version=ds_version,
+ frozen_param_shapes=frozen_param_shapes,
+ frozen_param_fragments=frozen_param_fragments)
+ zero_model_states.append(z_model_state)
+
+ return zero_model_states
+
+
+def parse_optim_states(files, ds_checkpoint_dir):
+ total_files = len(files)
+ state_dicts = []
+ for f in tqdm(files, desc='Loading checkpoint shards'):
+ state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False)
+ # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights
+ # and also handle the case where it was already removed by another helper script
+ state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None)
+ state_dicts.append(state_dict)
+
+ if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]:
+ raise ValueError(f"{files[0]} is not a zero checkpoint")
+ zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE]
+ world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT]
+
+ # For ZeRO-2 each param group can have different partition_count as data parallelism for expert
+ # parameters can be different from data parallelism for non-expert parameters. So we can just
+ # use the max of the partition_count to get the dp world_size.
+
+ if type(world_size) is list:
+ world_size = max(world_size)
+
+ if world_size != total_files:
+ raise ValueError(
+ f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. "
+ "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes."
+ )
+
+ # the groups are named differently in each stage
+ if zero_stage <= 2:
+ fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS
+ elif zero_stage == 3:
+ fp32_groups_key = FP32_FLAT_GROUPS
+ else:
+ raise ValueError(f"unknown zero stage {zero_stage}")
+
+ fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))]
+ param_alignment_paddings = state_dicts[0][OPTIMIZER_STATE_DICT].get(PARAM_ALIGNMENT_PADDINGS)
+ return zero_stage, world_size, fp32_flat_groups, param_alignment_paddings
+
+
+def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters):
+ """
+ Returns fp32 state_dict reconstructed from ds checkpoint
+
+ Args:
+ - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are)
+
+ """
+ print(f"Processing zero checkpoint '{ds_checkpoint_dir}'")
+
+ # parse_model_states rejects AutoEP ZeRO-3 partition-native checkpoints
+ # before the expensive optimizer-shard load below.
+ model_files = get_model_state_files(ds_checkpoint_dir)
+ zero_model_states = parse_model_states(model_files)
+ print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}')
+
+ optim_files = get_optim_files(ds_checkpoint_dir)
+ zero_stage, world_size, fp32_flat_groups, param_alignment_paddings = parse_optim_states(
+ optim_files, ds_checkpoint_dir)
+ print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}")
+
+ if zero_stage <= 2:
+ return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters, param_alignment_paddings)
+ elif zero_stage == 3:
+ return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters)
+
+
+def _zero2_merge_frozen_params(state_dict, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ frozen_param_fragments = zero_model_states[0].frozen_param_fragments
+
+ if debug:
+ num_elem = sum(s.numel() for s in frozen_param_shapes.values())
+ print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in frozen_param_fragments.values()])
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ state_dict[name] = frozen_param_fragments[name]
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _has_callable(obj, fn):
+ attr = getattr(obj, fn, None)
+ return callable(attr)
+
+
+def _zero2_merge_trainable_params(state_dict,
+ world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ param_alignment_paddings=None):
+ param_shapes = zero_model_states[0].param_shapes
+
+ # Reconstruction protocol:
+ #
+ # XXX: document this
+
+ if debug:
+ for i in range(world_size):
+ for j in range(len(fp32_flat_groups[0])):
+ print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}")
+
+ # XXX: memory usage doubles here (zero2)
+ num_param_groups = len(fp32_flat_groups[0])
+ merged_single_partition_of_fp32_groups = []
+ for i in range(num_param_groups):
+ merged_partitions = [sd[i] for sd in fp32_flat_groups]
+ full_single_fp32_vector = torch.cat(merged_partitions, 0)
+ merged_single_partition_of_fp32_groups.append(full_single_fp32_vector)
+ avail_numel = sum(
+ [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups])
+
+ if debug:
+ wanted_params = sum([len(shapes) for shapes in param_shapes])
+ wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes])
+ # not asserting if there is a mismatch due to possible padding
+ print(f"Have {avail_numel} numels to process.")
+ print(f"Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ total_numel = 0
+ total_params = 0
+ for group_idx, (shapes,
+ full_single_fp32_vector) in enumerate(zip(param_shapes, merged_single_partition_of_fp32_groups)):
+ offset = 0
+ avail_numel = full_single_fp32_vector.numel()
+ group_alignment_paddings = None
+ if param_alignment_paddings is not None:
+ group_alignment_paddings = param_alignment_paddings[group_idx]
+ if len(group_alignment_paddings) != len(shapes):
+ raise ValueError(f"Expected {len(shapes)} parameter alignment paddings for group {group_idx}, "
+ f"but found {len(group_alignment_paddings)}")
+
+ for param_idx, (name, shape) in enumerate(shapes.items()):
+
+ unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape)
+ total_numel += unpartitioned_numel
+ total_params += 1
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+ state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape)
+ offset += unpartitioned_numel
+ if group_alignment_paddings is not None:
+ offset += group_alignment_paddings[param_idx]
+
+ # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and
+ # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex
+ # paddings performed in the code it's almost impossible to predict the exact numbers w/o the
+ # live optimizer object, so we are checking that the numbers are within the right range
+ align_to = 2 * world_size
+
+ def zero2_align(x):
+ return align_to * math.ceil(x / align_to)
+
+ if debug:
+ print(f"original offset={offset}, avail_numel={avail_numel}")
+
+ offset = zero2_align(offset)
+ avail_numel = zero2_align(avail_numel)
+
+ if debug:
+ print(f"aligned offset={offset}, avail_numel={avail_numel}")
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero2_checkpoint(world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ exclude_frozen_parameters,
+ param_alignment_paddings=None):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero2_merge_frozen_params(state_dict, zero_model_states)
+
+ _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states,
+ param_alignment_paddings)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def zero3_partitioned_param_info(unpartitioned_numel, world_size):
+ remainder = unpartitioned_numel % world_size
+ padding_numel = (world_size - remainder) if remainder else 0
+ partitioned_numel = math.ceil(unpartitioned_numel / world_size)
+ return partitioned_numel, padding_numel
+
+
+def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ if debug:
+ for i in range(world_size):
+ num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values())
+ print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in zero_model_states[0].frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states)
+ state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape)
+
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+class GatheredTensor:
+ """
+ A pseudo tensor that collects partitioned weights.
+ It is more memory efficient when there are multiple groups.
+ """
+
+ def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape):
+ self.flat_groups = flat_groups
+ self.flat_groups_offset = flat_groups_offset
+ self.offset = offset
+ self.partitioned_numel = partitioned_numel
+ self.shape = shape
+ self.dtype = self.flat_groups[0][0].dtype
+
+ def contiguous(self):
+ """
+ Merge partitioned weights from flat_groups into a single tensor.
+ """
+ end_idx = self.offset + self.partitioned_numel
+ world_size = len(self.flat_groups)
+ pad_flat_param_chunks = []
+
+ for rank_i in range(world_size):
+ # for each rank, we need to collect weights from related group/groups
+ flat_groups_at_rank_i = self.flat_groups[rank_i]
+ start_group_id = None
+ end_group_id = None
+ for group_id in range(len(self.flat_groups_offset)):
+ if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]:
+ start_group_id = group_id
+ if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]:
+ end_group_id = group_id
+ break
+ # collect weights from related group/groups
+ for group_id in range(start_group_id, end_group_id + 1):
+ flat_tensor = flat_groups_at_rank_i[group_id]
+ start_offset = self.offset - self.flat_groups_offset[group_id]
+ end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id]
+ pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset])
+
+ # collect weights from all ranks
+ pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0)
+ param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous()
+ return param
+
+
+def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states):
+ param_shapes = zero_model_states[0].param_shapes
+ avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size
+
+ # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each
+ # param, re-consolidating each param, while dealing with padding if any
+
+ # merge list of dicts, preserving order
+ param_shapes = {k: v for d in param_shapes for k, v in d.items()}
+
+ if debug:
+ for i in range(world_size):
+ print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}")
+
+ wanted_params = len(param_shapes)
+ wanted_numel = sum(shape.numel() for shape in param_shapes.values())
+ # not asserting if there is a mismatch due to possible padding
+ avail_numel = fp32_flat_groups[0].numel() * world_size
+ print(f"Trainable params: Have {avail_numel} numels to process.")
+ print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ offset = 0
+ total_numel = 0
+ total_params = 0
+ flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]]))
+ for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'):
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+ total_params += 1
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ # memory efficient tensor
+ tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape)
+ state_dict[name] = tensor
+ offset += partitioned_numel
+
+ offset *= world_size
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero3_merge_frozen_params(state_dict, world_size, zero_model_states)
+
+ _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def to_torch_tensor(state_dict, return_empty_tensor=False, dtype=None):
+ """
+ Convert state_dict of GatheredTensor to torch tensor
+ """
+ if dtype is not None:
+ dtype = _resolve_output_dtype(dtype)
+
+ torch_state_dict = {}
+ converted_tensors = {}
+ for name, tensor in state_dict.items():
+ tensor_id = id(tensor)
+ if tensor_id in converted_tensors: # shared tensors
+ shared_tensor = torch_state_dict[converted_tensors[tensor_id]]
+ torch_state_dict[name] = shared_tensor
+ else:
+ converted_tensors[tensor_id] = name
+ if return_empty_tensor:
+ torch_state_dict[name] = torch.empty(tensor.shape, dtype=dtype or tensor.dtype)
+ else:
+ contiguous_tensor = tensor.contiguous()
+ torch_state_dict[name] = contiguous_tensor.to(dtype=dtype) if dtype else contiguous_tensor
+ return torch_state_dict
+
+
+def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag=None,
+ exclude_frozen_parameters=False,
+ lazy_mode=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with
+ ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example
+ via a model hub.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient.
+ Convert the pesduo tensor to torch tensor by ``.contiguous()``
+
+ Returns:
+ - pytorch ``state_dict``
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ # do the training and checkpoint saving
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu
+ model = model.cpu() # move to cpu
+ model.load_state_dict(state_dict)
+ # submit to model hub or save the model to share with others
+
+ In this example the ``model`` will no longer be usable in the deepspeed context of the same
+ application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead.
+
+ Note: the above usage may not work if your application doesn't have sufficient free CPU memory.
+ You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with
+ the checkpoint. Or you can load state_dict in lazy mode ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu
+ for name, lazy_tensor in state_dict.item():
+ tensor = lazy_tensor.contiguous() # to cpu
+ print(name, tensor)
+ # del tensor to release memory if it no longer in use
+ """
+ if tag is None:
+ latest_path = os.path.join(checkpoint_dir, 'latest')
+ if os.path.isfile(latest_path):
+ with open(latest_path, 'r') as fd:
+ tag = fd.read().strip()
+ else:
+ raise ValueError(f"Unable to find 'latest' file at {latest_path}")
+
+ ds_checkpoint_dir = os.path.join(checkpoint_dir, tag)
+
+ if not os.path.isdir(ds_checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist")
+
+ state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters)
+ if lazy_mode:
+ return state_dict
+ else:
+ return to_torch_tensor(state_dict)
+
+
+def convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a consolidated ``state_dict`` file that can be
+ loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``output_dir``: directory for the PyTorch state_dict output files
+ - ``dtype``: output tensor dtype. Supports float32, float16, and bfloat16 as strings or torch dtypes.
+ - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB
+ - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ """
+
+ dtype = _resolve_output_dtype(dtype)
+
+ # Dependency pre-check
+ if safe_serialization:
+ try:
+ from safetensors.torch import save_file
+ except ImportError:
+ print('If you want to use `safe_serialization`, please `pip install safetensors`')
+ raise
+ if max_shard_size is not None:
+ try:
+ from huggingface_hub import split_torch_state_dict_into_shards
+ except ImportError:
+ print('If you want to use `max_shard_size`, please `pip install huggingface_hub`')
+ raise
+
+ # Convert zero checkpoint to state_dict
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag,
+ exclude_frozen_parameters,
+ lazy_mode=True)
+
+ # Shard the model if it is too big.
+ weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin"
+ if max_shard_size is not None:
+ filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors")
+ # an memory-efficient approach for sharding
+ empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True, dtype=dtype)
+ state_dict_split = split_torch_state_dict_into_shards(empty_state_dict,
+ filename_pattern=filename_pattern,
+ max_shard_size=max_shard_size)
+ else:
+ from collections import namedtuple
+ StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"])
+ state_dict_split = StateDictSplit(is_sharded=False,
+ filename_to_tensors={weights_name: list(state_dict.keys())})
+
+ # Save the model by shard
+ os.makedirs(output_dir, exist_ok=True)
+ filename_to_tensors = state_dict_split.filename_to_tensors.items()
+ for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"):
+ shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors}
+ shard_state_dict = to_torch_tensor(shard_state_dict, dtype=dtype)
+ output_path = os.path.join(output_dir, shard_file)
+ if safe_serialization:
+ save_file(shard_state_dict, output_path, metadata={"format": "pt"})
+ else:
+ torch.save(shard_state_dict, output_path)
+ # release the memory of current shard
+ for tensor_name in list(shard_state_dict.keys()):
+ del state_dict[tensor_name]
+ del shard_state_dict[tensor_name]
+ del shard_state_dict
+ gc.collect()
+
+ # Save index if sharded
+ if state_dict_split.is_sharded:
+ index = {
+ "metadata": state_dict_split.metadata,
+ "weight_map": state_dict_split.tensor_to_filename,
+ }
+ save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json"
+ save_index_file = os.path.join(output_dir, save_index_file)
+ with open(save_index_file, "w", encoding="utf-8") as f:
+ content = json.dumps(index, indent=2, sort_keys=True) + "\n"
+ f.write(content)
+
+
+def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir,
+ output_dir,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """Backward-compatible fp32 checkpoint conversion."""
+ return convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size=max_shard_size,
+ safe_serialization=safe_serialization,
+ tag=tag,
+ exclude_frozen_parameters=exclude_frozen_parameters)
+
+
+def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None):
+ """
+ 1. Put the provided model to cpu
+ 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict``
+ 3. Load it into the provided model
+
+ Args:
+ - ``model``: the model object to update
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+
+ Returns:
+ - ``model`: modified model
+
+ Make sure you have plenty of CPU memory available before you call this function. If you don't
+ have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it
+ conveniently placed for you in the checkpoint folder.
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint
+ model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir)
+ # submit to model hub or save the model to share with others
+
+ Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context
+ of the same application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ """
+ logger.info("Extracting fp32 weights")
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag)
+
+ logger.info("Overwriting model with fp32 weights")
+ model = model.cpu()
+ model.load_state_dict(state_dict, strict=False)
+
+ return model
+
+
+if __name__ == "__main__":
+ parser = argparse.ArgumentParser()
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir",
+ type=str,
+ help="directory to the pytorch fp32 state_dict output files"
+ "(e.g. path/checkpoint-12-output/)")
+ parser.add_argument(
+ "--max_shard_size",
+ type=str,
+ default="5GB",
+ help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size"
+ "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`"
+ "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances"
+ "without CPU OOM issues.")
+ parser.add_argument(
+ "--safe_serialization",
+ default=False,
+ action='store_true',
+ help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug")
+ args = parser.parse_args()
+
+ debug = args.debug
+
+ convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir,
+ args.output_dir,
+ max_shard_size=args.max_shard_size,
+ safe_serialization=args.safe_serialization,
+ tag=args.tag,
+ exclude_frozen_parameters=args.exclude_frozen_parameters)
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-2475/zero_to_torch.py b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/zero_to_torch.py
new file mode 100644
index 0000000000000000000000000000000000000000..81312e252400d77f03cc1a88522f8f18ebe70ee7
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-2475/zero_to_torch.py
@@ -0,0 +1,54 @@
+#!/usr/bin/env python
+
+# SPDX-License-Identifier: Apache-2.0
+# DeepSpeed Team
+
+import argparse
+
+if __package__:
+ from . import zero_to_fp32
+else:
+ import zero_to_fp32
+
+
+def main(args=None):
+ parser = argparse.ArgumentParser(
+ description="Convert a DeepSpeed ZeRO checkpoint to float32, float16, or bfloat16 PyTorch weights.")
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir", type=str, help="directory for the converted PyTorch state_dict files")
+ parser.add_argument("--dtype",
+ type=str,
+ choices=sorted(zero_to_fp32.OUTPUT_DTYPE_NAMES),
+ required=True,
+ help="output tensor dtype")
+ parser.add_argument("--max_shard_size",
+ type=str,
+ default="5GB",
+ help="maximum size of each checkpoint shard, such as 5GB or 500MB")
+ parser.add_argument("--safe_serialization",
+ default=False,
+ action='store_true',
+ help="save with safetensors instead of PyTorch pickle serialization")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier, e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug output")
+ parsed_args = parser.parse_args(args)
+
+ zero_to_fp32.debug = parsed_args.debug
+ zero_to_fp32.convert_zero_checkpoint_to_state_dict(parsed_args.checkpoint_dir,
+ parsed_args.output_dir,
+ dtype=parsed_args.dtype,
+ max_shard_size=parsed_args.max_shard_size,
+ safe_serialization=parsed_args.safe_serialization,
+ tag=parsed_args.tag,
+ exclude_frozen_parameters=parsed_args.exclude_frozen_parameters)
+
+
+if __name__ == "__main__":
+ main()
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/chat_template.jinja b/qwen3-1.7b-teutonic-5e6/checkpoint-500/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..01be9b307daa2d425f7c168c9fb145a286e0afb4
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/chat_template.jinja
@@ -0,0 +1,89 @@
+{%- if tools %}
+ {{- '<|im_start|>system\n' }}
+ {%- if messages[0].role == 'system' %}
+ {{- messages[0].content + '\n\n' }}
+ {%- endif %}
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+{%- endfor %}
+{%- for message in messages %}
+ {%- if message.content is string %}
+ {%- set content = message.content %}
+ {%- else %}
+ {%- set content = '' %}
+ {%- endif %}
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {%- if loop.last or (not loop.last and reasoning_content) %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if (loop.first and content) or (not loop.first) %}
+ {{- '\n' }}
+ {%- endif %}
+ {%- if tool_call.function %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {{- '\n{"name": "' }}
+ {{- tool_call.name }}
+ {{- '", "arguments": ' }}
+ {%- if tool_call.arguments is string %}
+ {{- tool_call.arguments }}
+ {%- else %}
+ {{- tool_call.arguments | tojson }}
+ {%- endif %}
+ {{- '}\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-500/config.json
new file mode 100644
index 0000000000000000000000000000000000000000..5d9cef07396baadff5390e4508eb33025967a029
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/config.json
@@ -0,0 +1,63 @@
+{
+ "architectures": [
+ "Qwen3ForCausalLM"
+ ],
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "bos_token_id": null,
+ "dtype": "bfloat16",
+ "eos_token_id": 151645,
+ "head_dim": 128,
+ "hidden_act": "silu",
+ "hidden_size": 2048,
+ "initializer_range": 0.02,
+ "intermediate_size": 6144,
+ "layer_types": [
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 40960,
+ "max_window_layers": 28,
+ "model_type": "qwen3",
+ "num_attention_heads": 16,
+ "num_hidden_layers": 28,
+ "num_key_value_heads": 8,
+ "pad_token_id": 151643,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 1000000,
+ "rope_type": "default"
+ },
+ "sliding_window": null,
+ "tie_word_embeddings": true,
+ "transformers_version": "5.17.0",
+ "use_cache": false,
+ "use_sliding_window": false,
+ "vocab_size": 151936
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/generation_config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-500/generation_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..e6941fe4b04f26113d6eef6255d005c4d7090bda
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/generation_config.json
@@ -0,0 +1,12 @@
+{
+ "do_sample": true,
+ "eos_token_id": [
+ 151645,
+ 151643
+ ],
+ "pad_token_id": 151643,
+ "temperature": 0.6,
+ "top_k": 20,
+ "top_p": 0.95,
+ "transformers_version": "5.17.0"
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/global_step500/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-500/global_step500/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..854b672f440410bc3e8f1921b5db6bb30a260bff
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/global_step500/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8800edf94a3f4750c9e8c47f82dab44c8cc38201965ec29d6346f4d162fd170e
+size 10323466465
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/global_step500/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-500/global_step500/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..1a16d5856367942cb4eecc5f78d83ccf6ac6c5a7
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/global_step500/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e136d49fb681060d83ca93ddcef1ea2178e9f0c5c64372db2e92efb55850266f
+size 10323469601
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/global_step500/mp_rank_00_model_states.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-500/global_step500/mp_rank_00_model_states.pt
new file mode 100644
index 0000000000000000000000000000000000000000..ce49b1c0fe34713c27b1fea1c08d3fdeb87d0d11
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/global_step500/mp_rank_00_model_states.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:b7412a16595601ac6ba787a41f47b0c59c91caa5b52011b66c0aeb5370017759
+size 3441239653
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/latest b/qwen3-1.7b-teutonic-5e6/checkpoint-500/latest
new file mode 100644
index 0000000000000000000000000000000000000000..f0b47ce15fff9a01b2a416a473b2148085048a50
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/latest
@@ -0,0 +1 @@
+global_step500
\ No newline at end of file
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/model.safetensors b/qwen3-1.7b-teutonic-5e6/checkpoint-500/model.safetensors
new file mode 100644
index 0000000000000000000000000000000000000000..bf23dac79d2a45730934b7d8aab9289a12cbb5c4
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:70efeaa28c9ee409c8711feaa8683fb3fcfacec4f4b27ca7004a1504efe0a937
+size 4063515640
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/rng_state_0.pth b/qwen3-1.7b-teutonic-5e6/checkpoint-500/rng_state_0.pth
new file mode 100644
index 0000000000000000000000000000000000000000..9bb2f7c587bceefcdb6b3b7d2fac4553d0efcd5c
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/rng_state_0.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:089233f905e02a28defe58c22a9508707e22f23429596c648fd56ed174238a34
+size 14917
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/rng_state_1.pth b/qwen3-1.7b-teutonic-5e6/checkpoint-500/rng_state_1.pth
new file mode 100644
index 0000000000000000000000000000000000000000..b6237e77e3428dfd4402934af3d4a66fe06bd4a4
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/rng_state_1.pth
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:d9713286962ba6aa18d08540280c05cfd8c3a97d78b57a5169a53bad4ab58862
+size 14917
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/scheduler.pt b/qwen3-1.7b-teutonic-5e6/checkpoint-500/scheduler.pt
new file mode 100644
index 0000000000000000000000000000000000000000..91206e5c25c136c4f7c581d53f3dc5a254e11b02
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/scheduler.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:4380e66fdb61ffd08e35795045b869c90719a46c6838b482b138f11fc30632e3
+size 1465
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/tokenizer.json b/qwen3-1.7b-teutonic-5e6/checkpoint-500/tokenizer.json
new file mode 100644
index 0000000000000000000000000000000000000000..c7afbed2efcdf019f88ab0572ec29d3bf595dfe2
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:be75606093db2094d7cd20f3c2f385c212750648bd6ea4fb2bf507a6a4c55506
+size 11422650
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/tokenizer_config.json b/qwen3-1.7b-teutonic-5e6/checkpoint-500/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..770e41d6c92519d525eede4cbcf3ba27f6425311
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/tokenizer_config.json
@@ -0,0 +1,30 @@
+{
+ "add_prefix_space": false,
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "is_local": false,
+ "local_files_only": false,
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/trainer_state.json b/qwen3-1.7b-teutonic-5e6/checkpoint-500/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..5ddfd567aeff40337af5c7b88968585cf5e07b83
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/trainer_state.json
@@ -0,0 +1,5144 @@
+{
+ "best_global_step": 500,
+ "best_metric": 1.5444872379302979,
+ "best_model_checkpoint": "./checkpoints/qwen3-1.7b-teutonic-5e6/checkpoint-500",
+ "epoch": 1.0101010101010102,
+ "eval_steps": 50,
+ "global_step": 500,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 0.8295683860778809,
+ "epoch": 0.00202020202020202,
+ "grad_norm": 10.886772155761719,
+ "learning_rate": 5e-06,
+ "loss": 1.5185801982879639,
+ "mean_token_accuracy": 0.672874927520752,
+ "num_tokens": 16384.0,
+ "step": 1
+ },
+ {
+ "entropy": 1.1781222820281982,
+ "epoch": 0.00404040404040404,
+ "grad_norm": 13.80163288116455,
+ "learning_rate": 4.997979797979798e-06,
+ "loss": 2.18377685546875,
+ "mean_token_accuracy": 0.5700415372848511,
+ "num_tokens": 32768.0,
+ "step": 2
+ },
+ {
+ "entropy": 0.7972303032875061,
+ "epoch": 0.006060606060606061,
+ "grad_norm": 13.71261215209961,
+ "learning_rate": 4.995959595959596e-06,
+ "loss": 1.5810277462005615,
+ "mean_token_accuracy": 0.6782486438751221,
+ "num_tokens": 49152.0,
+ "step": 3
+ },
+ {
+ "entropy": 0.9709298610687256,
+ "epoch": 0.00808080808080808,
+ "grad_norm": 9.18797779083252,
+ "learning_rate": 4.993939393939394e-06,
+ "loss": 1.6923656463623047,
+ "mean_token_accuracy": 0.6447850465774536,
+ "num_tokens": 65536.0,
+ "step": 4
+ },
+ {
+ "entropy": 1.2161898612976074,
+ "epoch": 0.010101010101010102,
+ "grad_norm": 8.97508430480957,
+ "learning_rate": 4.991919191919192e-06,
+ "loss": 1.9361608028411865,
+ "mean_token_accuracy": 0.5922691822052002,
+ "num_tokens": 81920.0,
+ "step": 5
+ },
+ {
+ "entropy": 0.9950039982795715,
+ "epoch": 0.012121212121212121,
+ "grad_norm": 6.453213214874268,
+ "learning_rate": 4.98989898989899e-06,
+ "loss": 1.5012480020523071,
+ "mean_token_accuracy": 0.6671959161758423,
+ "num_tokens": 98304.0,
+ "step": 6
+ },
+ {
+ "entropy": 1.452682614326477,
+ "epoch": 0.014141414141414142,
+ "grad_norm": 8.50411605834961,
+ "learning_rate": 4.987878787878789e-06,
+ "loss": 2.1297783851623535,
+ "mean_token_accuracy": 0.5807889699935913,
+ "num_tokens": 114688.0,
+ "step": 7
+ },
+ {
+ "entropy": 1.4661014080047607,
+ "epoch": 0.01616161616161616,
+ "grad_norm": 4.290146827697754,
+ "learning_rate": 4.9858585858585865e-06,
+ "loss": 1.7391963005065918,
+ "mean_token_accuracy": 0.611993134021759,
+ "num_tokens": 131072.0,
+ "step": 8
+ },
+ {
+ "entropy": 1.9030903577804565,
+ "epoch": 0.01818181818181818,
+ "grad_norm": 4.503584384918213,
+ "learning_rate": 4.983838383838384e-06,
+ "loss": 2.283596992492676,
+ "mean_token_accuracy": 0.5261968970298767,
+ "num_tokens": 147456.0,
+ "step": 9
+ },
+ {
+ "entropy": 1.2784137725830078,
+ "epoch": 0.020202020202020204,
+ "grad_norm": 3.427410840988159,
+ "learning_rate": 4.981818181818182e-06,
+ "loss": 1.5032392740249634,
+ "mean_token_accuracy": 0.6578529477119446,
+ "num_tokens": 163840.0,
+ "step": 10
+ },
+ {
+ "entropy": 1.7487188577651978,
+ "epoch": 0.022222222222222223,
+ "grad_norm": 3.20536470413208,
+ "learning_rate": 4.97979797979798e-06,
+ "loss": 1.9184643030166626,
+ "mean_token_accuracy": 0.6093673706054688,
+ "num_tokens": 180224.0,
+ "step": 11
+ },
+ {
+ "entropy": 1.6585394144058228,
+ "epoch": 0.024242424242424242,
+ "grad_norm": 3.2463598251342773,
+ "learning_rate": 4.977777777777778e-06,
+ "loss": 1.8364639282226562,
+ "mean_token_accuracy": 0.6014899611473083,
+ "num_tokens": 196608.0,
+ "step": 12
+ },
+ {
+ "entropy": 1.4869519472122192,
+ "epoch": 0.026262626262626262,
+ "grad_norm": 2.8681719303131104,
+ "learning_rate": 4.975757575757576e-06,
+ "loss": 1.6356265544891357,
+ "mean_token_accuracy": 0.6361138224601746,
+ "num_tokens": 212992.0,
+ "step": 13
+ },
+ {
+ "entropy": 1.5179094076156616,
+ "epoch": 0.028282828282828285,
+ "grad_norm": 3.0470707416534424,
+ "learning_rate": 4.973737373737374e-06,
+ "loss": 1.6317660808563232,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 229376.0,
+ "step": 14
+ },
+ {
+ "entropy": 1.7384330034255981,
+ "epoch": 0.030303030303030304,
+ "grad_norm": 2.6149742603302,
+ "learning_rate": 4.971717171717172e-06,
+ "loss": 1.67923903465271,
+ "mean_token_accuracy": 0.6469223499298096,
+ "num_tokens": 245760.0,
+ "step": 15
+ },
+ {
+ "entropy": 2.108799457550049,
+ "epoch": 0.03232323232323232,
+ "grad_norm": 3.694795608520508,
+ "learning_rate": 4.9696969696969696e-06,
+ "loss": 1.9052371978759766,
+ "mean_token_accuracy": 0.5927577018737793,
+ "num_tokens": 262144.0,
+ "step": 16
+ },
+ {
+ "entropy": 1.7532848119735718,
+ "epoch": 0.03434343434343434,
+ "grad_norm": 3.1510567665100098,
+ "learning_rate": 4.9676767676767675e-06,
+ "loss": 1.6382691860198975,
+ "mean_token_accuracy": 0.6311675906181335,
+ "num_tokens": 278528.0,
+ "step": 17
+ },
+ {
+ "entropy": 1.723548412322998,
+ "epoch": 0.03636363636363636,
+ "grad_norm": 3.093825340270996,
+ "learning_rate": 4.965656565656566e-06,
+ "loss": 1.6039624214172363,
+ "mean_token_accuracy": 0.6313507556915283,
+ "num_tokens": 294912.0,
+ "step": 18
+ },
+ {
+ "entropy": 1.4790765047073364,
+ "epoch": 0.03838383838383838,
+ "grad_norm": 2.7150535583496094,
+ "learning_rate": 4.963636363636364e-06,
+ "loss": 1.4173667430877686,
+ "mean_token_accuracy": 0.6627381443977356,
+ "num_tokens": 311296.0,
+ "step": 19
+ },
+ {
+ "entropy": 1.5827536582946777,
+ "epoch": 0.04040404040404041,
+ "grad_norm": 2.610966444015503,
+ "learning_rate": 4.961616161616162e-06,
+ "loss": 1.4604644775390625,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 327680.0,
+ "step": 20
+ },
+ {
+ "entropy": 2.054673194885254,
+ "epoch": 0.04242424242424243,
+ "grad_norm": 2.612940788269043,
+ "learning_rate": 4.95959595959596e-06,
+ "loss": 1.962029218673706,
+ "mean_token_accuracy": 0.5719956159591675,
+ "num_tokens": 344064.0,
+ "step": 21
+ },
+ {
+ "entropy": 1.6684198379516602,
+ "epoch": 0.044444444444444446,
+ "grad_norm": 2.5426013469696045,
+ "learning_rate": 4.957575757575758e-06,
+ "loss": 1.591176986694336,
+ "mean_token_accuracy": 0.6519907116889954,
+ "num_tokens": 360448.0,
+ "step": 22
+ },
+ {
+ "entropy": 1.9070855379104614,
+ "epoch": 0.046464646464646465,
+ "grad_norm": 2.5853357315063477,
+ "learning_rate": 4.9555555555555565e-06,
+ "loss": 1.930276870727539,
+ "mean_token_accuracy": 0.5895823240280151,
+ "num_tokens": 376832.0,
+ "step": 23
+ },
+ {
+ "entropy": 1.716689109802246,
+ "epoch": 0.048484848484848485,
+ "grad_norm": 2.7608494758605957,
+ "learning_rate": 4.953535353535354e-06,
+ "loss": 1.739159345626831,
+ "mean_token_accuracy": 0.6028944849967957,
+ "num_tokens": 393216.0,
+ "step": 24
+ },
+ {
+ "entropy": 1.5666695833206177,
+ "epoch": 0.050505050505050504,
+ "grad_norm": 2.5973074436187744,
+ "learning_rate": 4.951515151515152e-06,
+ "loss": 1.6016302108764648,
+ "mean_token_accuracy": 0.626099169254303,
+ "num_tokens": 409600.0,
+ "step": 25
+ },
+ {
+ "entropy": 1.4267652034759521,
+ "epoch": 0.052525252525252523,
+ "grad_norm": 2.163451910018921,
+ "learning_rate": 4.94949494949495e-06,
+ "loss": 1.5093598365783691,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 425984.0,
+ "step": 26
+ },
+ {
+ "entropy": 1.8537150621414185,
+ "epoch": 0.05454545454545454,
+ "grad_norm": 2.6983258724212646,
+ "learning_rate": 4.947474747474748e-06,
+ "loss": 1.8831868171691895,
+ "mean_token_accuracy": 0.5802393555641174,
+ "num_tokens": 442368.0,
+ "step": 27
+ },
+ {
+ "entropy": 1.410015344619751,
+ "epoch": 0.05656565656565657,
+ "grad_norm": 2.4777796268463135,
+ "learning_rate": 4.945454545454546e-06,
+ "loss": 1.4835734367370605,
+ "mean_token_accuracy": 0.6519907116889954,
+ "num_tokens": 458752.0,
+ "step": 28
+ },
+ {
+ "entropy": 1.2399017810821533,
+ "epoch": 0.05858585858585859,
+ "grad_norm": 2.1676478385925293,
+ "learning_rate": 4.943434343434344e-06,
+ "loss": 1.330633282661438,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 475136.0,
+ "step": 29
+ },
+ {
+ "entropy": 1.6478898525238037,
+ "epoch": 0.06060606060606061,
+ "grad_norm": 2.5325536727905273,
+ "learning_rate": 4.941414141414142e-06,
+ "loss": 1.771777868270874,
+ "mean_token_accuracy": 0.6128480434417725,
+ "num_tokens": 491520.0,
+ "step": 30
+ },
+ {
+ "entropy": 1.7915360927581787,
+ "epoch": 0.06262626262626263,
+ "grad_norm": 2.2419557571411133,
+ "learning_rate": 4.93939393939394e-06,
+ "loss": 1.870645523071289,
+ "mean_token_accuracy": 0.6074743270874023,
+ "num_tokens": 507904.0,
+ "step": 31
+ },
+ {
+ "entropy": 1.7638899087905884,
+ "epoch": 0.06464646464646465,
+ "grad_norm": 2.8063058853149414,
+ "learning_rate": 4.937373737373738e-06,
+ "loss": 1.83987557888031,
+ "mean_token_accuracy": 0.5836589932441711,
+ "num_tokens": 524288.0,
+ "step": 32
+ },
+ {
+ "entropy": 1.4097516536712646,
+ "epoch": 0.06666666666666667,
+ "grad_norm": 2.1857714653015137,
+ "learning_rate": 4.935353535353536e-06,
+ "loss": 1.477668285369873,
+ "mean_token_accuracy": 0.6507083773612976,
+ "num_tokens": 540672.0,
+ "step": 33
+ },
+ {
+ "entropy": 1.4447426795959473,
+ "epoch": 0.06868686868686869,
+ "grad_norm": 2.3771870136260986,
+ "learning_rate": 4.933333333333334e-06,
+ "loss": 1.536318063735962,
+ "mean_token_accuracy": 0.6383732557296753,
+ "num_tokens": 557056.0,
+ "step": 34
+ },
+ {
+ "entropy": 1.9658164978027344,
+ "epoch": 0.0707070707070707,
+ "grad_norm": 2.4784936904907227,
+ "learning_rate": 4.931313131313132e-06,
+ "loss": 2.0565035343170166,
+ "mean_token_accuracy": 0.5581949353218079,
+ "num_tokens": 573440.0,
+ "step": 35
+ },
+ {
+ "entropy": 1.6045317649841309,
+ "epoch": 0.07272727272727272,
+ "grad_norm": 2.1128504276275635,
+ "learning_rate": 4.92929292929293e-06,
+ "loss": 1.6234952211380005,
+ "mean_token_accuracy": 0.6293356418609619,
+ "num_tokens": 589824.0,
+ "step": 36
+ },
+ {
+ "entropy": 1.5491269826889038,
+ "epoch": 0.07474747474747474,
+ "grad_norm": 2.1672937870025635,
+ "learning_rate": 4.927272727272728e-06,
+ "loss": 1.5809822082519531,
+ "mean_token_accuracy": 0.6419760584831238,
+ "num_tokens": 606208.0,
+ "step": 37
+ },
+ {
+ "entropy": 1.545534610748291,
+ "epoch": 0.07676767676767676,
+ "grad_norm": 2.2526934146881104,
+ "learning_rate": 4.925252525252526e-06,
+ "loss": 1.5707473754882812,
+ "mean_token_accuracy": 0.6344650983810425,
+ "num_tokens": 622592.0,
+ "step": 38
+ },
+ {
+ "entropy": 1.579596757888794,
+ "epoch": 0.07878787878787878,
+ "grad_norm": 2.3988492488861084,
+ "learning_rate": 4.9232323232323235e-06,
+ "loss": 1.6725983619689941,
+ "mean_token_accuracy": 0.6243282556533813,
+ "num_tokens": 638976.0,
+ "step": 39
+ },
+ {
+ "entropy": 2.0438785552978516,
+ "epoch": 0.08080808080808081,
+ "grad_norm": 2.3314359188079834,
+ "learning_rate": 4.9212121212121214e-06,
+ "loss": 2.0424888134002686,
+ "mean_token_accuracy": 0.570713222026825,
+ "num_tokens": 655360.0,
+ "step": 40
+ },
+ {
+ "entropy": 1.8690773248672485,
+ "epoch": 0.08282828282828283,
+ "grad_norm": 2.130401134490967,
+ "learning_rate": 4.919191919191919e-06,
+ "loss": 1.8796970844268799,
+ "mean_token_accuracy": 0.5882999300956726,
+ "num_tokens": 671744.0,
+ "step": 41
+ },
+ {
+ "entropy": 1.756626009941101,
+ "epoch": 0.08484848484848485,
+ "grad_norm": 2.342318534851074,
+ "learning_rate": 4.917171717171717e-06,
+ "loss": 1.71901535987854,
+ "mean_token_accuracy": 0.6173668503761292,
+ "num_tokens": 688128.0,
+ "step": 42
+ },
+ {
+ "entropy": 1.4642508029937744,
+ "epoch": 0.08686868686868687,
+ "grad_norm": 1.993338704109192,
+ "learning_rate": 4.915151515151516e-06,
+ "loss": 1.4660165309906006,
+ "mean_token_accuracy": 0.6687225103378296,
+ "num_tokens": 704512.0,
+ "step": 43
+ },
+ {
+ "entropy": 1.790807843208313,
+ "epoch": 0.08888888888888889,
+ "grad_norm": 2.3186943531036377,
+ "learning_rate": 4.913131313131314e-06,
+ "loss": 1.7102060317993164,
+ "mean_token_accuracy": 0.6238397359848022,
+ "num_tokens": 720896.0,
+ "step": 44
+ },
+ {
+ "entropy": 1.5970485210418701,
+ "epoch": 0.09090909090909091,
+ "grad_norm": 2.299307346343994,
+ "learning_rate": 4.911111111111112e-06,
+ "loss": 1.5170013904571533,
+ "mean_token_accuracy": 0.652662456035614,
+ "num_tokens": 737280.0,
+ "step": 45
+ },
+ {
+ "entropy": 1.3955466747283936,
+ "epoch": 0.09292929292929293,
+ "grad_norm": 2.171952962875366,
+ "learning_rate": 4.90909090909091e-06,
+ "loss": 1.4059661626815796,
+ "mean_token_accuracy": 0.6654250025749207,
+ "num_tokens": 753664.0,
+ "step": 46
+ },
+ {
+ "entropy": 1.7198575735092163,
+ "epoch": 0.09494949494949495,
+ "grad_norm": 2.385092258453369,
+ "learning_rate": 4.9070707070707075e-06,
+ "loss": 1.730346918106079,
+ "mean_token_accuracy": 0.6191987991333008,
+ "num_tokens": 770048.0,
+ "step": 47
+ },
+ {
+ "entropy": 1.3542555570602417,
+ "epoch": 0.09696969696969697,
+ "grad_norm": 2.1463189125061035,
+ "learning_rate": 4.905050505050505e-06,
+ "loss": 1.346085786819458,
+ "mean_token_accuracy": 0.680446982383728,
+ "num_tokens": 786432.0,
+ "step": 48
+ },
+ {
+ "entropy": 1.8084443807601929,
+ "epoch": 0.09898989898989899,
+ "grad_norm": 2.1505849361419678,
+ "learning_rate": 4.903030303030303e-06,
+ "loss": 1.847151756286621,
+ "mean_token_accuracy": 0.5926355719566345,
+ "num_tokens": 802816.0,
+ "step": 49
+ },
+ {
+ "entropy": 1.751160979270935,
+ "epoch": 0.10101010101010101,
+ "grad_norm": 2.1436259746551514,
+ "learning_rate": 4.901010101010101e-06,
+ "loss": 1.7802404165267944,
+ "mean_token_accuracy": 0.5996580123901367,
+ "num_tokens": 819200.0,
+ "step": 50
+ },
+ {
+ "epoch": 0.10101010101010101,
+ "eval_entropy": 1.6292865045609013,
+ "eval_loss": 1.6725393533706665,
+ "eval_mean_token_accuracy": 0.6230050469598463,
+ "eval_num_tokens": 819200.0,
+ "eval_runtime": 43.9148,
+ "eval_samples_per_second": 22.544,
+ "eval_steps_per_second": 2.824,
+ "step": 50
+ },
+ {
+ "entropy": 1.4428319931030273,
+ "epoch": 0.10303030303030303,
+ "grad_norm": 2.0954954624176025,
+ "learning_rate": 4.898989898989899e-06,
+ "loss": 1.4927232265472412,
+ "mean_token_accuracy": 0.6522349715232849,
+ "num_tokens": 835584.0,
+ "step": 51
+ },
+ {
+ "entropy": 1.7493115663528442,
+ "epoch": 0.10505050505050505,
+ "grad_norm": 2.300030469894409,
+ "learning_rate": 4.896969696969697e-06,
+ "loss": 1.737417221069336,
+ "mean_token_accuracy": 0.6213361024856567,
+ "num_tokens": 851968.0,
+ "step": 52
+ },
+ {
+ "entropy": 1.7801647186279297,
+ "epoch": 0.10707070707070707,
+ "grad_norm": 2.3947081565856934,
+ "learning_rate": 4.894949494949495e-06,
+ "loss": 1.8372564315795898,
+ "mean_token_accuracy": 0.5931240916252136,
+ "num_tokens": 868352.0,
+ "step": 53
+ },
+ {
+ "entropy": 1.6934887170791626,
+ "epoch": 0.10909090909090909,
+ "grad_norm": 2.1981089115142822,
+ "learning_rate": 4.8929292929292936e-06,
+ "loss": 1.734646201133728,
+ "mean_token_accuracy": 0.611932098865509,
+ "num_tokens": 884736.0,
+ "step": 54
+ },
+ {
+ "entropy": 1.3401941061019897,
+ "epoch": 0.1111111111111111,
+ "grad_norm": 2.193511724472046,
+ "learning_rate": 4.8909090909090914e-06,
+ "loss": 1.399888038635254,
+ "mean_token_accuracy": 0.6745847463607788,
+ "num_tokens": 901120.0,
+ "step": 55
+ },
+ {
+ "entropy": 1.8244661092758179,
+ "epoch": 0.11313131313131314,
+ "grad_norm": 2.4358489513397217,
+ "learning_rate": 4.888888888888889e-06,
+ "loss": 1.8716282844543457,
+ "mean_token_accuracy": 0.5867122411727905,
+ "num_tokens": 917504.0,
+ "step": 56
+ },
+ {
+ "entropy": 1.5019619464874268,
+ "epoch": 0.11515151515151516,
+ "grad_norm": 2.1135261058807373,
+ "learning_rate": 4.886868686868687e-06,
+ "loss": 1.523103952407837,
+ "mean_token_accuracy": 0.6414265036582947,
+ "num_tokens": 933888.0,
+ "step": 57
+ },
+ {
+ "entropy": 1.6132855415344238,
+ "epoch": 0.11717171717171718,
+ "grad_norm": 2.026301145553589,
+ "learning_rate": 4.884848484848485e-06,
+ "loss": 1.6233609914779663,
+ "mean_token_accuracy": 0.6279311180114746,
+ "num_tokens": 950272.0,
+ "step": 58
+ },
+ {
+ "entropy": 1.738538384437561,
+ "epoch": 0.1191919191919192,
+ "grad_norm": 2.1539394855499268,
+ "learning_rate": 4.882828282828283e-06,
+ "loss": 1.8147332668304443,
+ "mean_token_accuracy": 0.6124816536903381,
+ "num_tokens": 966656.0,
+ "step": 59
+ },
+ {
+ "entropy": 1.5533764362335205,
+ "epoch": 0.12121212121212122,
+ "grad_norm": 2.2603628635406494,
+ "learning_rate": 4.880808080808081e-06,
+ "loss": 1.562873125076294,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 983040.0,
+ "step": 60
+ },
+ {
+ "entropy": 1.722406268119812,
+ "epoch": 0.12323232323232323,
+ "grad_norm": 2.3630757331848145,
+ "learning_rate": 4.878787878787879e-06,
+ "loss": 1.7461689710617065,
+ "mean_token_accuracy": 0.6023448705673218,
+ "num_tokens": 999424.0,
+ "step": 61
+ },
+ {
+ "entropy": 1.6533517837524414,
+ "epoch": 0.12525252525252525,
+ "grad_norm": 2.2165415287017822,
+ "learning_rate": 4.876767676767677e-06,
+ "loss": 1.676560640335083,
+ "mean_token_accuracy": 0.6437469720840454,
+ "num_tokens": 1015808.0,
+ "step": 62
+ },
+ {
+ "entropy": 1.749995470046997,
+ "epoch": 0.12727272727272726,
+ "grad_norm": 2.1572678089141846,
+ "learning_rate": 4.8747474747474745e-06,
+ "loss": 1.784087896347046,
+ "mean_token_accuracy": 0.5884831547737122,
+ "num_tokens": 1032192.0,
+ "step": 63
+ },
+ {
+ "entropy": 1.442152738571167,
+ "epoch": 0.1292929292929293,
+ "grad_norm": 2.163490056991577,
+ "learning_rate": 4.872727272727273e-06,
+ "loss": 1.4307503700256348,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 1048576.0,
+ "step": 64
+ },
+ {
+ "entropy": 1.2657029628753662,
+ "epoch": 0.13131313131313133,
+ "grad_norm": 2.1225337982177734,
+ "learning_rate": 4.870707070707071e-06,
+ "loss": 1.2731966972351074,
+ "mean_token_accuracy": 0.688568651676178,
+ "num_tokens": 1064960.0,
+ "step": 65
+ },
+ {
+ "entropy": 1.1613880395889282,
+ "epoch": 0.13333333333333333,
+ "grad_norm": 1.9527196884155273,
+ "learning_rate": 4.868686868686869e-06,
+ "loss": 1.13922119140625,
+ "mean_token_accuracy": 0.7389472126960754,
+ "num_tokens": 1081344.0,
+ "step": 66
+ },
+ {
+ "entropy": 1.6936380863189697,
+ "epoch": 0.13535353535353536,
+ "grad_norm": 2.004284620285034,
+ "learning_rate": 4.866666666666667e-06,
+ "loss": 1.6982238292694092,
+ "mean_token_accuracy": 0.6191987991333008,
+ "num_tokens": 1097728.0,
+ "step": 67
+ },
+ {
+ "entropy": 1.750565528869629,
+ "epoch": 0.13737373737373737,
+ "grad_norm": 2.225955009460449,
+ "learning_rate": 4.864646464646466e-06,
+ "loss": 1.796521782875061,
+ "mean_token_accuracy": 0.5934293866157532,
+ "num_tokens": 1114112.0,
+ "step": 68
+ },
+ {
+ "entropy": 1.6608220338821411,
+ "epoch": 0.1393939393939394,
+ "grad_norm": 2.127035617828369,
+ "learning_rate": 4.8626262626262636e-06,
+ "loss": 1.6633095741271973,
+ "mean_token_accuracy": 0.6356253027915955,
+ "num_tokens": 1130496.0,
+ "step": 69
+ },
+ {
+ "entropy": 1.4848661422729492,
+ "epoch": 0.1414141414141414,
+ "grad_norm": 2.0338215827941895,
+ "learning_rate": 4.8606060606060615e-06,
+ "loss": 1.4789674282073975,
+ "mean_token_accuracy": 0.6680508255958557,
+ "num_tokens": 1146880.0,
+ "step": 70
+ },
+ {
+ "entropy": 1.2310466766357422,
+ "epoch": 0.14343434343434344,
+ "grad_norm": 2.105898141860962,
+ "learning_rate": 4.858585858585859e-06,
+ "loss": 1.2301937341690063,
+ "mean_token_accuracy": 0.7040791511535645,
+ "num_tokens": 1163264.0,
+ "step": 71
+ },
+ {
+ "entropy": 1.6310514211654663,
+ "epoch": 0.14545454545454545,
+ "grad_norm": 2.152125358581543,
+ "learning_rate": 4.856565656565657e-06,
+ "loss": 1.643636703491211,
+ "mean_token_accuracy": 0.6221299171447754,
+ "num_tokens": 1179648.0,
+ "step": 72
+ },
+ {
+ "entropy": 1.4747940301895142,
+ "epoch": 0.14747474747474748,
+ "grad_norm": 2.096461296081543,
+ "learning_rate": 4.854545454545455e-06,
+ "loss": 1.42953360080719,
+ "mean_token_accuracy": 0.6651807427406311,
+ "num_tokens": 1196032.0,
+ "step": 73
+ },
+ {
+ "entropy": 1.819259524345398,
+ "epoch": 0.1494949494949495,
+ "grad_norm": 2.2852063179016113,
+ "learning_rate": 4.852525252525253e-06,
+ "loss": 1.845325231552124,
+ "mean_token_accuracy": 0.6036272644996643,
+ "num_tokens": 1212416.0,
+ "step": 74
+ },
+ {
+ "entropy": 1.4233598709106445,
+ "epoch": 0.15151515151515152,
+ "grad_norm": 2.1157381534576416,
+ "learning_rate": 4.850505050505051e-06,
+ "loss": 1.4565438032150269,
+ "mean_token_accuracy": 0.6607230305671692,
+ "num_tokens": 1228800.0,
+ "step": 75
+ },
+ {
+ "entropy": 1.6441459655761719,
+ "epoch": 0.15353535353535352,
+ "grad_norm": 2.2092180252075195,
+ "learning_rate": 4.848484848484849e-06,
+ "loss": 1.6467639207839966,
+ "mean_token_accuracy": 0.6285417675971985,
+ "num_tokens": 1245184.0,
+ "step": 76
+ },
+ {
+ "entropy": 1.6124308109283447,
+ "epoch": 0.15555555555555556,
+ "grad_norm": 2.231876850128174,
+ "learning_rate": 4.846464646464647e-06,
+ "loss": 1.617384672164917,
+ "mean_token_accuracy": 0.6340987086296082,
+ "num_tokens": 1261568.0,
+ "step": 77
+ },
+ {
+ "entropy": 1.828405499458313,
+ "epoch": 0.15757575757575756,
+ "grad_norm": 2.1372313499450684,
+ "learning_rate": 4.8444444444444446e-06,
+ "loss": 1.8333203792572021,
+ "mean_token_accuracy": 0.5979481935501099,
+ "num_tokens": 1277952.0,
+ "step": 78
+ },
+ {
+ "entropy": 1.855564832687378,
+ "epoch": 0.1595959595959596,
+ "grad_norm": 2.1422762870788574,
+ "learning_rate": 4.842424242424243e-06,
+ "loss": 1.9133609533309937,
+ "mean_token_accuracy": 0.570652186870575,
+ "num_tokens": 1294336.0,
+ "step": 79
+ },
+ {
+ "entropy": 1.7908183336257935,
+ "epoch": 0.16161616161616163,
+ "grad_norm": 2.172368049621582,
+ "learning_rate": 4.840404040404041e-06,
+ "loss": 1.8109419345855713,
+ "mean_token_accuracy": 0.60332190990448,
+ "num_tokens": 1310720.0,
+ "step": 80
+ },
+ {
+ "entropy": 1.9537721872329712,
+ "epoch": 0.16363636363636364,
+ "grad_norm": 2.199505090713501,
+ "learning_rate": 4.838383838383839e-06,
+ "loss": 2.0001401901245117,
+ "mean_token_accuracy": 0.5585613250732422,
+ "num_tokens": 1327104.0,
+ "step": 81
+ },
+ {
+ "entropy": 1.5365772247314453,
+ "epoch": 0.16565656565656567,
+ "grad_norm": 2.0778913497924805,
+ "learning_rate": 4.836363636363637e-06,
+ "loss": 1.575089931488037,
+ "mean_token_accuracy": 0.6375183463096619,
+ "num_tokens": 1343488.0,
+ "step": 82
+ },
+ {
+ "entropy": 1.7177143096923828,
+ "epoch": 0.16767676767676767,
+ "grad_norm": 2.1010894775390625,
+ "learning_rate": 4.834343434343435e-06,
+ "loss": 1.7428388595581055,
+ "mean_token_accuracy": 0.6113824844360352,
+ "num_tokens": 1359872.0,
+ "step": 83
+ },
+ {
+ "entropy": 1.5080527067184448,
+ "epoch": 0.1696969696969697,
+ "grad_norm": 2.021969795227051,
+ "learning_rate": 4.832323232323233e-06,
+ "loss": 1.5361201763153076,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 1376256.0,
+ "step": 84
+ },
+ {
+ "entropy": 1.5042120218276978,
+ "epoch": 0.1717171717171717,
+ "grad_norm": 2.121314287185669,
+ "learning_rate": 4.830303030303031e-06,
+ "loss": 1.4912033081054688,
+ "mean_token_accuracy": 0.6621274948120117,
+ "num_tokens": 1392640.0,
+ "step": 85
+ },
+ {
+ "entropy": 1.9523948431015015,
+ "epoch": 0.17373737373737375,
+ "grad_norm": 2.1702609062194824,
+ "learning_rate": 4.8282828282828285e-06,
+ "loss": 1.9369449615478516,
+ "mean_token_accuracy": 0.5727283954620361,
+ "num_tokens": 1409024.0,
+ "step": 86
+ },
+ {
+ "entropy": 1.6174770593643188,
+ "epoch": 0.17575757575757575,
+ "grad_norm": 2.222412109375,
+ "learning_rate": 4.826262626262626e-06,
+ "loss": 1.6794973611831665,
+ "mean_token_accuracy": 0.6151685118675232,
+ "num_tokens": 1425408.0,
+ "step": 87
+ },
+ {
+ "entropy": 1.1480307579040527,
+ "epoch": 0.17777777777777778,
+ "grad_norm": 1.98936128616333,
+ "learning_rate": 4.824242424242424e-06,
+ "loss": 1.1324063539505005,
+ "mean_token_accuracy": 0.7193453907966614,
+ "num_tokens": 1441792.0,
+ "step": 88
+ },
+ {
+ "entropy": 1.5290263891220093,
+ "epoch": 0.1797979797979798,
+ "grad_norm": 2.098860263824463,
+ "learning_rate": 4.822222222222222e-06,
+ "loss": 1.556044340133667,
+ "mean_token_accuracy": 0.6415486335754395,
+ "num_tokens": 1458176.0,
+ "step": 89
+ },
+ {
+ "entropy": 1.1366127729415894,
+ "epoch": 0.18181818181818182,
+ "grad_norm": 1.9387420415878296,
+ "learning_rate": 4.820202020202021e-06,
+ "loss": 1.1635141372680664,
+ "mean_token_accuracy": 0.7168416976928711,
+ "num_tokens": 1474560.0,
+ "step": 90
+ },
+ {
+ "entropy": 1.5142875909805298,
+ "epoch": 0.18383838383838383,
+ "grad_norm": 2.259131908416748,
+ "learning_rate": 4.818181818181819e-06,
+ "loss": 1.5329954624176025,
+ "mean_token_accuracy": 0.6471666097640991,
+ "num_tokens": 1490944.0,
+ "step": 91
+ },
+ {
+ "entropy": 1.5197135210037231,
+ "epoch": 0.18585858585858586,
+ "grad_norm": 2.1230807304382324,
+ "learning_rate": 4.816161616161617e-06,
+ "loss": 1.541062593460083,
+ "mean_token_accuracy": 0.6398388147354126,
+ "num_tokens": 1507328.0,
+ "step": 92
+ },
+ {
+ "entropy": 1.5469954013824463,
+ "epoch": 0.18787878787878787,
+ "grad_norm": 2.0568583011627197,
+ "learning_rate": 4.8141414141414146e-06,
+ "loss": 1.5564078092575073,
+ "mean_token_accuracy": 0.6384953856468201,
+ "num_tokens": 1523712.0,
+ "step": 93
+ },
+ {
+ "entropy": 1.5429692268371582,
+ "epoch": 0.1898989898989899,
+ "grad_norm": 2.200144052505493,
+ "learning_rate": 4.8121212121212125e-06,
+ "loss": 1.5292989015579224,
+ "mean_token_accuracy": 0.6373351216316223,
+ "num_tokens": 1540096.0,
+ "step": 94
+ },
+ {
+ "entropy": 1.4556076526641846,
+ "epoch": 0.1919191919191919,
+ "grad_norm": 2.250291585922241,
+ "learning_rate": 4.81010101010101e-06,
+ "loss": 1.426419734954834,
+ "mean_token_accuracy": 0.6604176759719849,
+ "num_tokens": 1556480.0,
+ "step": 95
+ },
+ {
+ "entropy": 1.4021440744400024,
+ "epoch": 0.19393939393939394,
+ "grad_norm": 2.287038803100586,
+ "learning_rate": 4.808080808080808e-06,
+ "loss": 1.4377000331878662,
+ "mean_token_accuracy": 0.6572422981262207,
+ "num_tokens": 1572864.0,
+ "step": 96
+ },
+ {
+ "entropy": 1.658683180809021,
+ "epoch": 0.19595959595959597,
+ "grad_norm": 2.1817963123321533,
+ "learning_rate": 4.806060606060606e-06,
+ "loss": 1.6514620780944824,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 1589248.0,
+ "step": 97
+ },
+ {
+ "entropy": 1.5182844400405884,
+ "epoch": 0.19797979797979798,
+ "grad_norm": 2.144071340560913,
+ "learning_rate": 4.804040404040404e-06,
+ "loss": 1.5554628372192383,
+ "mean_token_accuracy": 0.6311064958572388,
+ "num_tokens": 1605632.0,
+ "step": 98
+ },
+ {
+ "entropy": 1.5997719764709473,
+ "epoch": 0.2,
+ "grad_norm": 2.0921664237976074,
+ "learning_rate": 4.802020202020202e-06,
+ "loss": 1.6185517311096191,
+ "mean_token_accuracy": 0.6286028623580933,
+ "num_tokens": 1622016.0,
+ "step": 99
+ },
+ {
+ "entropy": 1.4011279344558716,
+ "epoch": 0.20202020202020202,
+ "grad_norm": 2.2240700721740723,
+ "learning_rate": 4.800000000000001e-06,
+ "loss": 1.4112927913665771,
+ "mean_token_accuracy": 0.6696995496749878,
+ "num_tokens": 1638400.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.20202020202020202,
+ "eval_entropy": 1.606662715634992,
+ "eval_loss": 1.6283859014511108,
+ "eval_mean_token_accuracy": 0.6293055717983553,
+ "eval_num_tokens": 1638400.0,
+ "eval_runtime": 43.7782,
+ "eval_samples_per_second": 22.614,
+ "eval_steps_per_second": 2.832,
+ "step": 100
+ },
+ {
+ "entropy": 1.6743865013122559,
+ "epoch": 0.20404040404040405,
+ "grad_norm": 2.025153398513794,
+ "learning_rate": 4.7979797979797985e-06,
+ "loss": 1.6404725313186646,
+ "mean_token_accuracy": 0.656509518623352,
+ "num_tokens": 1654784.0,
+ "step": 101
+ },
+ {
+ "entropy": 1.6196308135986328,
+ "epoch": 0.20606060606060606,
+ "grad_norm": 2.037229299545288,
+ "learning_rate": 4.795959595959596e-06,
+ "loss": 1.647303581237793,
+ "mean_token_accuracy": 0.6203590631484985,
+ "num_tokens": 1671168.0,
+ "step": 102
+ },
+ {
+ "entropy": 1.5600125789642334,
+ "epoch": 0.2080808080808081,
+ "grad_norm": 2.144221782684326,
+ "learning_rate": 4.793939393939394e-06,
+ "loss": 1.6199731826782227,
+ "mean_token_accuracy": 0.6249389052391052,
+ "num_tokens": 1687552.0,
+ "step": 103
+ },
+ {
+ "entropy": 2.064497947692871,
+ "epoch": 0.2101010101010101,
+ "grad_norm": 2.3956470489501953,
+ "learning_rate": 4.791919191919192e-06,
+ "loss": 2.048987627029419,
+ "mean_token_accuracy": 0.5507450103759766,
+ "num_tokens": 1703936.0,
+ "step": 104
+ },
+ {
+ "entropy": 1.7934812307357788,
+ "epoch": 0.21212121212121213,
+ "grad_norm": 2.487302780151367,
+ "learning_rate": 4.78989898989899e-06,
+ "loss": 1.8285956382751465,
+ "mean_token_accuracy": 0.5749877691268921,
+ "num_tokens": 1720320.0,
+ "step": 105
+ },
+ {
+ "entropy": 1.365216851234436,
+ "epoch": 0.21414141414141413,
+ "grad_norm": 2.0714964866638184,
+ "learning_rate": 4.787878787878788e-06,
+ "loss": 1.3870220184326172,
+ "mean_token_accuracy": 0.6692721247673035,
+ "num_tokens": 1736704.0,
+ "step": 106
+ },
+ {
+ "entropy": 1.4983874559402466,
+ "epoch": 0.21616161616161617,
+ "grad_norm": 1.9995853900909424,
+ "learning_rate": 4.785858585858586e-06,
+ "loss": 1.4949266910552979,
+ "mean_token_accuracy": 0.6554103493690491,
+ "num_tokens": 1753088.0,
+ "step": 107
+ },
+ {
+ "entropy": 2.0503509044647217,
+ "epoch": 0.21818181818181817,
+ "grad_norm": 2.190884590148926,
+ "learning_rate": 4.783838383838385e-06,
+ "loss": 2.079286813735962,
+ "mean_token_accuracy": 0.5657669901847839,
+ "num_tokens": 1769472.0,
+ "step": 108
+ },
+ {
+ "entropy": 1.5557374954223633,
+ "epoch": 0.2202020202020202,
+ "grad_norm": 2.044100761413574,
+ "learning_rate": 4.7818181818181825e-06,
+ "loss": 1.5735318660736084,
+ "mean_token_accuracy": 0.6359916925430298,
+ "num_tokens": 1785856.0,
+ "step": 109
+ },
+ {
+ "entropy": 1.5567635297775269,
+ "epoch": 0.2222222222222222,
+ "grad_norm": 2.3714160919189453,
+ "learning_rate": 4.77979797979798e-06,
+ "loss": 1.6026921272277832,
+ "mean_token_accuracy": 0.6290302872657776,
+ "num_tokens": 1802240.0,
+ "step": 110
+ },
+ {
+ "entropy": 1.8457536697387695,
+ "epoch": 0.22424242424242424,
+ "grad_norm": 2.202939987182617,
+ "learning_rate": 4.777777777777778e-06,
+ "loss": 1.7986081838607788,
+ "mean_token_accuracy": 0.5952613353729248,
+ "num_tokens": 1818624.0,
+ "step": 111
+ },
+ {
+ "entropy": 1.8822020292282104,
+ "epoch": 0.22626262626262628,
+ "grad_norm": 2.2674992084503174,
+ "learning_rate": 4.775757575757576e-06,
+ "loss": 1.9095954895019531,
+ "mean_token_accuracy": 0.5769418478012085,
+ "num_tokens": 1835008.0,
+ "step": 112
+ },
+ {
+ "entropy": 1.5445998907089233,
+ "epoch": 0.22828282828282828,
+ "grad_norm": 2.2848100662231445,
+ "learning_rate": 4.773737373737374e-06,
+ "loss": 1.5832195281982422,
+ "mean_token_accuracy": 0.6337933540344238,
+ "num_tokens": 1851392.0,
+ "step": 113
+ },
+ {
+ "entropy": 1.934509515762329,
+ "epoch": 0.23030303030303031,
+ "grad_norm": 2.3585174083709717,
+ "learning_rate": 4.771717171717172e-06,
+ "loss": 1.9809319972991943,
+ "mean_token_accuracy": 0.5789570212364197,
+ "num_tokens": 1867776.0,
+ "step": 114
+ },
+ {
+ "entropy": 1.7354214191436768,
+ "epoch": 0.23232323232323232,
+ "grad_norm": 2.13913631439209,
+ "learning_rate": 4.769696969696971e-06,
+ "loss": 1.7527806758880615,
+ "mean_token_accuracy": 0.6061308979988098,
+ "num_tokens": 1884160.0,
+ "step": 115
+ },
+ {
+ "entropy": 1.7714784145355225,
+ "epoch": 0.23434343434343435,
+ "grad_norm": 1.9915403127670288,
+ "learning_rate": 4.7676767676767685e-06,
+ "loss": 1.8065431118011475,
+ "mean_token_accuracy": 0.5986199378967285,
+ "num_tokens": 1900544.0,
+ "step": 116
+ },
+ {
+ "entropy": 1.5272125005722046,
+ "epoch": 0.23636363636363636,
+ "grad_norm": 2.004565715789795,
+ "learning_rate": 4.765656565656566e-06,
+ "loss": 1.5074517726898193,
+ "mean_token_accuracy": 0.6601123809814453,
+ "num_tokens": 1916928.0,
+ "step": 117
+ },
+ {
+ "entropy": 1.5393218994140625,
+ "epoch": 0.2383838383838384,
+ "grad_norm": 2.018089532852173,
+ "learning_rate": 4.763636363636364e-06,
+ "loss": 1.5607573986053467,
+ "mean_token_accuracy": 0.6540058851242065,
+ "num_tokens": 1933312.0,
+ "step": 118
+ },
+ {
+ "entropy": 1.7827534675598145,
+ "epoch": 0.2404040404040404,
+ "grad_norm": 2.062368392944336,
+ "learning_rate": 4.761616161616162e-06,
+ "loss": 1.7844001054763794,
+ "mean_token_accuracy": 0.6187102794647217,
+ "num_tokens": 1949696.0,
+ "step": 119
+ },
+ {
+ "entropy": 1.416417121887207,
+ "epoch": 0.24242424242424243,
+ "grad_norm": 2.0980024337768555,
+ "learning_rate": 4.75959595959596e-06,
+ "loss": 1.4041050672531128,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 1966080.0,
+ "step": 120
+ },
+ {
+ "entropy": 1.3325153589248657,
+ "epoch": 0.24444444444444444,
+ "grad_norm": 1.9985002279281616,
+ "learning_rate": 4.757575757575758e-06,
+ "loss": 1.3197274208068848,
+ "mean_token_accuracy": 0.6806912422180176,
+ "num_tokens": 1982464.0,
+ "step": 121
+ },
+ {
+ "entropy": 1.7306798696517944,
+ "epoch": 0.24646464646464647,
+ "grad_norm": 2.2098441123962402,
+ "learning_rate": 4.755555555555556e-06,
+ "loss": 1.7595295906066895,
+ "mean_token_accuracy": 0.6110160946846008,
+ "num_tokens": 1998848.0,
+ "step": 122
+ },
+ {
+ "entropy": 1.3733264207839966,
+ "epoch": 0.24848484848484848,
+ "grad_norm": 1.9827327728271484,
+ "learning_rate": 4.753535353535354e-06,
+ "loss": 1.4026854038238525,
+ "mean_token_accuracy": 0.65486079454422,
+ "num_tokens": 2015232.0,
+ "step": 123
+ },
+ {
+ "entropy": 1.5910528898239136,
+ "epoch": 0.2505050505050505,
+ "grad_norm": 1.9615319967269897,
+ "learning_rate": 4.751515151515152e-06,
+ "loss": 1.6071114540100098,
+ "mean_token_accuracy": 0.648937463760376,
+ "num_tokens": 2031616.0,
+ "step": 124
+ },
+ {
+ "entropy": 1.3300938606262207,
+ "epoch": 0.25252525252525254,
+ "grad_norm": 1.9878504276275635,
+ "learning_rate": 4.7494949494949495e-06,
+ "loss": 1.3623383045196533,
+ "mean_token_accuracy": 0.6873473525047302,
+ "num_tokens": 2048000.0,
+ "step": 125
+ },
+ {
+ "entropy": 1.6087368726730347,
+ "epoch": 0.2545454545454545,
+ "grad_norm": 2.264647960662842,
+ "learning_rate": 4.747474747474748e-06,
+ "loss": 1.634058952331543,
+ "mean_token_accuracy": 0.6211528778076172,
+ "num_tokens": 2064384.0,
+ "step": 126
+ },
+ {
+ "entropy": 1.536401391029358,
+ "epoch": 0.25656565656565655,
+ "grad_norm": 1.9561539888381958,
+ "learning_rate": 4.745454545454546e-06,
+ "loss": 1.5699501037597656,
+ "mean_token_accuracy": 0.6248167753219604,
+ "num_tokens": 2080768.0,
+ "step": 127
+ },
+ {
+ "entropy": 1.656266212463379,
+ "epoch": 0.2585858585858586,
+ "grad_norm": 2.1124353408813477,
+ "learning_rate": 4.743434343434344e-06,
+ "loss": 1.6612167358398438,
+ "mean_token_accuracy": 0.623900830745697,
+ "num_tokens": 2097152.0,
+ "step": 128
+ },
+ {
+ "entropy": 1.170629620552063,
+ "epoch": 0.2606060606060606,
+ "grad_norm": 1.917840600013733,
+ "learning_rate": 4.741414141414142e-06,
+ "loss": 1.1992300748825073,
+ "mean_token_accuracy": 0.6995603442192078,
+ "num_tokens": 2113536.0,
+ "step": 129
+ },
+ {
+ "entropy": 1.4126694202423096,
+ "epoch": 0.26262626262626265,
+ "grad_norm": 1.9041539430618286,
+ "learning_rate": 4.73939393939394e-06,
+ "loss": 1.4334447383880615,
+ "mean_token_accuracy": 0.6637151837348938,
+ "num_tokens": 2129920.0,
+ "step": 130
+ },
+ {
+ "entropy": 1.8490277528762817,
+ "epoch": 0.26464646464646463,
+ "grad_norm": 2.1440138816833496,
+ "learning_rate": 4.737373737373738e-06,
+ "loss": 1.9226353168487549,
+ "mean_token_accuracy": 0.5805447101593018,
+ "num_tokens": 2146304.0,
+ "step": 131
+ },
+ {
+ "entropy": 1.5000964403152466,
+ "epoch": 0.26666666666666666,
+ "grad_norm": 1.9615508317947388,
+ "learning_rate": 4.735353535353536e-06,
+ "loss": 1.495596170425415,
+ "mean_token_accuracy": 0.6542501449584961,
+ "num_tokens": 2162688.0,
+ "step": 132
+ },
+ {
+ "entropy": 1.9371142387390137,
+ "epoch": 0.2686868686868687,
+ "grad_norm": 2.202200412750244,
+ "learning_rate": 4.7333333333333335e-06,
+ "loss": 1.94151771068573,
+ "mean_token_accuracy": 0.5810332298278809,
+ "num_tokens": 2179072.0,
+ "step": 133
+ },
+ {
+ "entropy": 1.4535126686096191,
+ "epoch": 0.27070707070707073,
+ "grad_norm": 1.9804027080535889,
+ "learning_rate": 4.731313131313131e-06,
+ "loss": 1.4401545524597168,
+ "mean_token_accuracy": 0.6585246920585632,
+ "num_tokens": 2195456.0,
+ "step": 134
+ },
+ {
+ "entropy": 2.0871424674987793,
+ "epoch": 0.2727272727272727,
+ "grad_norm": 2.1417081356048584,
+ "learning_rate": 4.729292929292929e-06,
+ "loss": 2.117375373840332,
+ "mean_token_accuracy": 0.5600268840789795,
+ "num_tokens": 2211840.0,
+ "step": 135
+ },
+ {
+ "entropy": 1.2986469268798828,
+ "epoch": 0.27474747474747474,
+ "grad_norm": 2.0299136638641357,
+ "learning_rate": 4.727272727272728e-06,
+ "loss": 1.3631991147994995,
+ "mean_token_accuracy": 0.6750732660293579,
+ "num_tokens": 2228224.0,
+ "step": 136
+ },
+ {
+ "entropy": 1.163429617881775,
+ "epoch": 0.2767676767676768,
+ "grad_norm": 1.8368210792541504,
+ "learning_rate": 4.725252525252526e-06,
+ "loss": 1.1603795289993286,
+ "mean_token_accuracy": 0.7150708436965942,
+ "num_tokens": 2244608.0,
+ "step": 137
+ },
+ {
+ "entropy": 1.4301519393920898,
+ "epoch": 0.2787878787878788,
+ "grad_norm": 1.996767520904541,
+ "learning_rate": 4.723232323232324e-06,
+ "loss": 1.422170639038086,
+ "mean_token_accuracy": 0.6816682815551758,
+ "num_tokens": 2260992.0,
+ "step": 138
+ },
+ {
+ "entropy": 1.5160106420516968,
+ "epoch": 0.2808080808080808,
+ "grad_norm": 2.004770278930664,
+ "learning_rate": 4.721212121212122e-06,
+ "loss": 1.5385751724243164,
+ "mean_token_accuracy": 0.640693724155426,
+ "num_tokens": 2277376.0,
+ "step": 139
+ },
+ {
+ "entropy": 1.2483867406845093,
+ "epoch": 0.2828282828282828,
+ "grad_norm": 1.8488364219665527,
+ "learning_rate": 4.7191919191919195e-06,
+ "loss": 1.2563843727111816,
+ "mean_token_accuracy": 0.6998046040534973,
+ "num_tokens": 2293760.0,
+ "step": 140
+ },
+ {
+ "entropy": 1.3214129209518433,
+ "epoch": 0.28484848484848485,
+ "grad_norm": 2.1334660053253174,
+ "learning_rate": 4.717171717171717e-06,
+ "loss": 1.3392664194107056,
+ "mean_token_accuracy": 0.6822789311408997,
+ "num_tokens": 2310144.0,
+ "step": 141
+ },
+ {
+ "entropy": 1.611849069595337,
+ "epoch": 0.2868686868686869,
+ "grad_norm": 2.0539803504943848,
+ "learning_rate": 4.715151515151515e-06,
+ "loss": 1.6335396766662598,
+ "mean_token_accuracy": 0.6235954761505127,
+ "num_tokens": 2326528.0,
+ "step": 142
+ },
+ {
+ "entropy": 1.5847896337509155,
+ "epoch": 0.28888888888888886,
+ "grad_norm": 2.1658759117126465,
+ "learning_rate": 4.713131313131313e-06,
+ "loss": 1.603764533996582,
+ "mean_token_accuracy": 0.633671224117279,
+ "num_tokens": 2342912.0,
+ "step": 143
+ },
+ {
+ "entropy": 1.5731406211853027,
+ "epoch": 0.2909090909090909,
+ "grad_norm": 2.0830390453338623,
+ "learning_rate": 4.711111111111111e-06,
+ "loss": 1.558933973312378,
+ "mean_token_accuracy": 0.6392892003059387,
+ "num_tokens": 2359296.0,
+ "step": 144
+ },
+ {
+ "entropy": 1.8901628255844116,
+ "epoch": 0.29292929292929293,
+ "grad_norm": 2.1436922550201416,
+ "learning_rate": 4.709090909090909e-06,
+ "loss": 1.878631353378296,
+ "mean_token_accuracy": 0.57333904504776,
+ "num_tokens": 2375680.0,
+ "step": 145
+ },
+ {
+ "entropy": 1.9344228506088257,
+ "epoch": 0.29494949494949496,
+ "grad_norm": 2.1245176792144775,
+ "learning_rate": 4.707070707070707e-06,
+ "loss": 1.9546704292297363,
+ "mean_token_accuracy": 0.5987420678138733,
+ "num_tokens": 2392064.0,
+ "step": 146
+ },
+ {
+ "entropy": 1.2455096244812012,
+ "epoch": 0.296969696969697,
+ "grad_norm": 1.896581768989563,
+ "learning_rate": 4.705050505050506e-06,
+ "loss": 1.2738728523254395,
+ "mean_token_accuracy": 0.7025524973869324,
+ "num_tokens": 2408448.0,
+ "step": 147
+ },
+ {
+ "entropy": 1.4235948324203491,
+ "epoch": 0.298989898989899,
+ "grad_norm": 2.522636890411377,
+ "learning_rate": 4.7030303030303035e-06,
+ "loss": 1.4524480104446411,
+ "mean_token_accuracy": 0.6441133618354797,
+ "num_tokens": 2424832.0,
+ "step": 148
+ },
+ {
+ "entropy": 1.764552116394043,
+ "epoch": 0.301010101010101,
+ "grad_norm": 2.0232255458831787,
+ "learning_rate": 4.701010101010101e-06,
+ "loss": 1.7811740636825562,
+ "mean_token_accuracy": 0.6229848265647888,
+ "num_tokens": 2441216.0,
+ "step": 149
+ },
+ {
+ "entropy": 1.74843168258667,
+ "epoch": 0.30303030303030304,
+ "grad_norm": 2.1589369773864746,
+ "learning_rate": 4.698989898989899e-06,
+ "loss": 1.7337679862976074,
+ "mean_token_accuracy": 0.5975207686424255,
+ "num_tokens": 2457600.0,
+ "step": 150
+ },
+ {
+ "epoch": 0.30303030303030304,
+ "eval_entropy": 1.6033287221385586,
+ "eval_loss": 1.6036633253097534,
+ "eval_mean_token_accuracy": 0.6329842450157288,
+ "eval_num_tokens": 2457600.0,
+ "eval_runtime": 43.7655,
+ "eval_samples_per_second": 22.621,
+ "eval_steps_per_second": 2.833,
+ "step": 150
+ },
+ {
+ "entropy": 2.0572290420532227,
+ "epoch": 0.30505050505050507,
+ "grad_norm": 2.0511579513549805,
+ "learning_rate": 4.696969696969698e-06,
+ "loss": 2.0196030139923096,
+ "mean_token_accuracy": 0.5519052147865295,
+ "num_tokens": 2473984.0,
+ "step": 151
+ },
+ {
+ "entropy": 1.5792397260665894,
+ "epoch": 0.30707070707070705,
+ "grad_norm": 2.048396587371826,
+ "learning_rate": 4.694949494949496e-06,
+ "loss": 1.575985074043274,
+ "mean_token_accuracy": 0.623961865901947,
+ "num_tokens": 2490368.0,
+ "step": 152
+ },
+ {
+ "entropy": 1.487528681755066,
+ "epoch": 0.3090909090909091,
+ "grad_norm": 2.1903791427612305,
+ "learning_rate": 4.692929292929294e-06,
+ "loss": 1.479973316192627,
+ "mean_token_accuracy": 0.6595017313957214,
+ "num_tokens": 2506752.0,
+ "step": 153
+ },
+ {
+ "entropy": 1.766797423362732,
+ "epoch": 0.3111111111111111,
+ "grad_norm": 2.1843011379241943,
+ "learning_rate": 4.690909090909092e-06,
+ "loss": 1.7993412017822266,
+ "mean_token_accuracy": 0.5965437293052673,
+ "num_tokens": 2523136.0,
+ "step": 154
+ },
+ {
+ "entropy": 1.7058254480361938,
+ "epoch": 0.31313131313131315,
+ "grad_norm": 2.204461097717285,
+ "learning_rate": 4.6888888888888895e-06,
+ "loss": 1.7346007823944092,
+ "mean_token_accuracy": 0.6077185869216919,
+ "num_tokens": 2539520.0,
+ "step": 155
+ },
+ {
+ "entropy": 1.4929591417312622,
+ "epoch": 0.3151515151515151,
+ "grad_norm": 2.1739237308502197,
+ "learning_rate": 4.6868686868686874e-06,
+ "loss": 1.4708621501922607,
+ "mean_token_accuracy": 0.6427088379859924,
+ "num_tokens": 2555904.0,
+ "step": 156
+ },
+ {
+ "entropy": 1.5797587633132935,
+ "epoch": 0.31717171717171716,
+ "grad_norm": 2.150561571121216,
+ "learning_rate": 4.684848484848485e-06,
+ "loss": 1.5921857357025146,
+ "mean_token_accuracy": 0.6262823939323425,
+ "num_tokens": 2572288.0,
+ "step": 157
+ },
+ {
+ "entropy": 1.6198230981826782,
+ "epoch": 0.3191919191919192,
+ "grad_norm": 2.061169385910034,
+ "learning_rate": 4.682828282828283e-06,
+ "loss": 1.6601009368896484,
+ "mean_token_accuracy": 0.619015634059906,
+ "num_tokens": 2588672.0,
+ "step": 158
+ },
+ {
+ "entropy": 1.4026126861572266,
+ "epoch": 0.3212121212121212,
+ "grad_norm": 2.066208839416504,
+ "learning_rate": 4.680808080808081e-06,
+ "loss": 1.4062483310699463,
+ "mean_token_accuracy": 0.6681729555130005,
+ "num_tokens": 2605056.0,
+ "step": 159
+ },
+ {
+ "entropy": 1.4608066082000732,
+ "epoch": 0.32323232323232326,
+ "grad_norm": 2.022627353668213,
+ "learning_rate": 4.678787878787879e-06,
+ "loss": 1.4644970893859863,
+ "mean_token_accuracy": 0.6533341407775879,
+ "num_tokens": 2621440.0,
+ "step": 160
+ },
+ {
+ "entropy": 1.222448468208313,
+ "epoch": 0.32525252525252524,
+ "grad_norm": 2.0399329662323,
+ "learning_rate": 4.676767676767677e-06,
+ "loss": 1.2547852993011475,
+ "mean_token_accuracy": 0.6925378441810608,
+ "num_tokens": 2637824.0,
+ "step": 161
+ },
+ {
+ "entropy": 1.8702255487442017,
+ "epoch": 0.32727272727272727,
+ "grad_norm": 2.177307367324829,
+ "learning_rate": 4.674747474747476e-06,
+ "loss": 1.9041712284088135,
+ "mean_token_accuracy": 0.5754152536392212,
+ "num_tokens": 2654208.0,
+ "step": 162
+ },
+ {
+ "entropy": 1.6861947774887085,
+ "epoch": 0.3292929292929293,
+ "grad_norm": 2.009544610977173,
+ "learning_rate": 4.6727272727272735e-06,
+ "loss": 1.7079355716705322,
+ "mean_token_accuracy": 0.615290641784668,
+ "num_tokens": 2670592.0,
+ "step": 163
+ },
+ {
+ "entropy": 1.3880327939987183,
+ "epoch": 0.33131313131313134,
+ "grad_norm": 2.16359543800354,
+ "learning_rate": 4.670707070707071e-06,
+ "loss": 1.4220571517944336,
+ "mean_token_accuracy": 0.6604787707328796,
+ "num_tokens": 2686976.0,
+ "step": 164
+ },
+ {
+ "entropy": 1.5760643482208252,
+ "epoch": 0.3333333333333333,
+ "grad_norm": 2.09773325920105,
+ "learning_rate": 4.668686868686869e-06,
+ "loss": 1.6036784648895264,
+ "mean_token_accuracy": 0.6267098188400269,
+ "num_tokens": 2703360.0,
+ "step": 165
+ },
+ {
+ "entropy": 1.078303575515747,
+ "epoch": 0.33535353535353535,
+ "grad_norm": 1.7760599851608276,
+ "learning_rate": 4.666666666666667e-06,
+ "loss": 1.0612695217132568,
+ "mean_token_accuracy": 0.7349169254302979,
+ "num_tokens": 2719744.0,
+ "step": 166
+ },
+ {
+ "entropy": 1.3722130060195923,
+ "epoch": 0.3373737373737374,
+ "grad_norm": 2.0816409587860107,
+ "learning_rate": 4.664646464646465e-06,
+ "loss": 1.3693504333496094,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 2736128.0,
+ "step": 167
+ },
+ {
+ "entropy": 1.8752760887145996,
+ "epoch": 0.3393939393939394,
+ "grad_norm": 2.1670358180999756,
+ "learning_rate": 4.662626262626263e-06,
+ "loss": 1.8874578475952148,
+ "mean_token_accuracy": 0.5881778001785278,
+ "num_tokens": 2752512.0,
+ "step": 168
+ },
+ {
+ "entropy": 1.7384581565856934,
+ "epoch": 0.3414141414141414,
+ "grad_norm": 2.0072429180145264,
+ "learning_rate": 4.660606060606061e-06,
+ "loss": 1.7491583824157715,
+ "mean_token_accuracy": 0.6041157841682434,
+ "num_tokens": 2768896.0,
+ "step": 169
+ },
+ {
+ "entropy": 1.6651691198349,
+ "epoch": 0.3434343434343434,
+ "grad_norm": 2.0812578201293945,
+ "learning_rate": 4.658585858585859e-06,
+ "loss": 1.6808438301086426,
+ "mean_token_accuracy": 0.6273204684257507,
+ "num_tokens": 2785280.0,
+ "step": 170
+ },
+ {
+ "entropy": 1.3426616191864014,
+ "epoch": 0.34545454545454546,
+ "grad_norm": 1.9108822345733643,
+ "learning_rate": 4.656565656565657e-06,
+ "loss": 1.3404264450073242,
+ "mean_token_accuracy": 0.6703101992607117,
+ "num_tokens": 2801664.0,
+ "step": 171
+ },
+ {
+ "entropy": 1.631722092628479,
+ "epoch": 0.3474747474747475,
+ "grad_norm": 2.07317852973938,
+ "learning_rate": 4.654545454545455e-06,
+ "loss": 1.6545813083648682,
+ "mean_token_accuracy": 0.6143136024475098,
+ "num_tokens": 2818048.0,
+ "step": 172
+ },
+ {
+ "entropy": 1.3678289651870728,
+ "epoch": 0.34949494949494947,
+ "grad_norm": 1.8517454862594604,
+ "learning_rate": 4.652525252525253e-06,
+ "loss": 1.3759769201278687,
+ "mean_token_accuracy": 0.6693942546844482,
+ "num_tokens": 2834432.0,
+ "step": 173
+ },
+ {
+ "entropy": 1.3927773237228394,
+ "epoch": 0.3515151515151515,
+ "grad_norm": 2.1304867267608643,
+ "learning_rate": 4.650505050505051e-06,
+ "loss": 1.4104211330413818,
+ "mean_token_accuracy": 0.6612725853919983,
+ "num_tokens": 2850816.0,
+ "step": 174
+ },
+ {
+ "entropy": 1.3352863788604736,
+ "epoch": 0.35353535353535354,
+ "grad_norm": 2.2788777351379395,
+ "learning_rate": 4.648484848484849e-06,
+ "loss": 1.3665719032287598,
+ "mean_token_accuracy": 0.6640205383300781,
+ "num_tokens": 2867200.0,
+ "step": 175
+ },
+ {
+ "entropy": 1.6800754070281982,
+ "epoch": 0.35555555555555557,
+ "grad_norm": 2.030787944793701,
+ "learning_rate": 4.646464646464647e-06,
+ "loss": 1.7239181995391846,
+ "mean_token_accuracy": 0.6193209290504456,
+ "num_tokens": 2883584.0,
+ "step": 176
+ },
+ {
+ "entropy": 1.2852731943130493,
+ "epoch": 0.3575757575757576,
+ "grad_norm": 1.9148248434066772,
+ "learning_rate": 4.644444444444445e-06,
+ "loss": 1.2934880256652832,
+ "mean_token_accuracy": 0.6798363327980042,
+ "num_tokens": 2899968.0,
+ "step": 177
+ },
+ {
+ "entropy": 1.6366593837738037,
+ "epoch": 0.3595959595959596,
+ "grad_norm": 2.2264015674591064,
+ "learning_rate": 4.642424242424243e-06,
+ "loss": 1.632002592086792,
+ "mean_token_accuracy": 0.6180385947227478,
+ "num_tokens": 2916352.0,
+ "step": 178
+ },
+ {
+ "entropy": 1.3935565948486328,
+ "epoch": 0.3616161616161616,
+ "grad_norm": 2.0410475730895996,
+ "learning_rate": 4.6404040404040406e-06,
+ "loss": 1.407370686531067,
+ "mean_token_accuracy": 0.6722032427787781,
+ "num_tokens": 2932736.0,
+ "step": 179
+ },
+ {
+ "entropy": 1.0952510833740234,
+ "epoch": 0.36363636363636365,
+ "grad_norm": 1.937270164489746,
+ "learning_rate": 4.6383838383838384e-06,
+ "loss": 1.1101973056793213,
+ "mean_token_accuracy": 0.730947732925415,
+ "num_tokens": 2949120.0,
+ "step": 180
+ },
+ {
+ "entropy": 1.184926152229309,
+ "epoch": 0.3656565656565657,
+ "grad_norm": 1.9867528676986694,
+ "learning_rate": 4.636363636363636e-06,
+ "loss": 1.1932196617126465,
+ "mean_token_accuracy": 0.7085368633270264,
+ "num_tokens": 2965504.0,
+ "step": 181
+ },
+ {
+ "entropy": 1.4552072286605835,
+ "epoch": 0.36767676767676766,
+ "grad_norm": 1.9395766258239746,
+ "learning_rate": 4.634343434343434e-06,
+ "loss": 1.4559956789016724,
+ "mean_token_accuracy": 0.6534562706947327,
+ "num_tokens": 2981888.0,
+ "step": 182
+ },
+ {
+ "entropy": 1.6437443494796753,
+ "epoch": 0.3696969696969697,
+ "grad_norm": 2.1257567405700684,
+ "learning_rate": 4.632323232323233e-06,
+ "loss": 1.6260980367660522,
+ "mean_token_accuracy": 0.625,
+ "num_tokens": 2998272.0,
+ "step": 183
+ },
+ {
+ "entropy": 1.8264633417129517,
+ "epoch": 0.3717171717171717,
+ "grad_norm": 2.187041759490967,
+ "learning_rate": 4.630303030303031e-06,
+ "loss": 1.8431676626205444,
+ "mean_token_accuracy": 0.60332190990448,
+ "num_tokens": 3014656.0,
+ "step": 184
+ },
+ {
+ "entropy": 1.1121351718902588,
+ "epoch": 0.37373737373737376,
+ "grad_norm": 1.8460402488708496,
+ "learning_rate": 4.628282828282829e-06,
+ "loss": 1.1054425239562988,
+ "mean_token_accuracy": 0.7254518866539001,
+ "num_tokens": 3031040.0,
+ "step": 185
+ },
+ {
+ "entropy": 1.3531955480575562,
+ "epoch": 0.37575757575757573,
+ "grad_norm": 2.3463470935821533,
+ "learning_rate": 4.626262626262627e-06,
+ "loss": 1.359381914138794,
+ "mean_token_accuracy": 0.6610894203186035,
+ "num_tokens": 3047424.0,
+ "step": 186
+ },
+ {
+ "entropy": 1.2131577730178833,
+ "epoch": 0.37777777777777777,
+ "grad_norm": 1.9595171213150024,
+ "learning_rate": 4.6242424242424245e-06,
+ "loss": 1.2312005758285522,
+ "mean_token_accuracy": 0.6979115605354309,
+ "num_tokens": 3063808.0,
+ "step": 187
+ },
+ {
+ "entropy": 1.5441125631332397,
+ "epoch": 0.3797979797979798,
+ "grad_norm": 2.2971343994140625,
+ "learning_rate": 4.622222222222222e-06,
+ "loss": 1.5923339128494263,
+ "mean_token_accuracy": 0.6297020316123962,
+ "num_tokens": 3080192.0,
+ "step": 188
+ },
+ {
+ "entropy": 1.7998323440551758,
+ "epoch": 0.38181818181818183,
+ "grad_norm": 2.010552167892456,
+ "learning_rate": 4.62020202020202e-06,
+ "loss": 1.8257204294204712,
+ "mean_token_accuracy": 0.5997191071510315,
+ "num_tokens": 3096576.0,
+ "step": 189
+ },
+ {
+ "entropy": 1.389051914215088,
+ "epoch": 0.3838383838383838,
+ "grad_norm": 2.1183855533599854,
+ "learning_rate": 4.618181818181818e-06,
+ "loss": 1.431575059890747,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 3112960.0,
+ "step": 190
+ },
+ {
+ "entropy": 2.0066142082214355,
+ "epoch": 0.38585858585858585,
+ "grad_norm": 2.061399221420288,
+ "learning_rate": 4.616161616161616e-06,
+ "loss": 2.0477406978607178,
+ "mean_token_accuracy": 0.5454934239387512,
+ "num_tokens": 3129344.0,
+ "step": 191
+ },
+ {
+ "entropy": 1.3063198328018188,
+ "epoch": 0.3878787878787879,
+ "grad_norm": 1.9490301609039307,
+ "learning_rate": 4.614141414141414e-06,
+ "loss": 1.3293564319610596,
+ "mean_token_accuracy": 0.6797142028808594,
+ "num_tokens": 3145728.0,
+ "step": 192
+ },
+ {
+ "entropy": 1.3636538982391357,
+ "epoch": 0.3898989898989899,
+ "grad_norm": 2.025458574295044,
+ "learning_rate": 4.612121212121212e-06,
+ "loss": 1.3736209869384766,
+ "mean_token_accuracy": 0.679286777973175,
+ "num_tokens": 3162112.0,
+ "step": 193
+ },
+ {
+ "entropy": 1.5669925212860107,
+ "epoch": 0.39191919191919194,
+ "grad_norm": 2.064033269882202,
+ "learning_rate": 4.6101010101010106e-06,
+ "loss": 1.5587083101272583,
+ "mean_token_accuracy": 0.6267709136009216,
+ "num_tokens": 3178496.0,
+ "step": 194
+ },
+ {
+ "entropy": 1.4489716291427612,
+ "epoch": 0.3939393939393939,
+ "grad_norm": 2.0174880027770996,
+ "learning_rate": 4.6080808080808085e-06,
+ "loss": 1.4331417083740234,
+ "mean_token_accuracy": 0.6571812629699707,
+ "num_tokens": 3194880.0,
+ "step": 195
+ },
+ {
+ "entropy": 2.026416778564453,
+ "epoch": 0.39595959595959596,
+ "grad_norm": 2.1820878982543945,
+ "learning_rate": 4.606060606060606e-06,
+ "loss": 2.029003143310547,
+ "mean_token_accuracy": 0.563568651676178,
+ "num_tokens": 3211264.0,
+ "step": 196
+ },
+ {
+ "entropy": 2.1844022274017334,
+ "epoch": 0.397979797979798,
+ "grad_norm": 2.175349473953247,
+ "learning_rate": 4.604040404040404e-06,
+ "loss": 2.2053825855255127,
+ "mean_token_accuracy": 0.5553248524665833,
+ "num_tokens": 3227648.0,
+ "step": 197
+ },
+ {
+ "entropy": 1.6750906705856323,
+ "epoch": 0.4,
+ "grad_norm": 1.8300689458847046,
+ "learning_rate": 4.602020202020203e-06,
+ "loss": 1.692289113998413,
+ "mean_token_accuracy": 0.6345261335372925,
+ "num_tokens": 3244032.0,
+ "step": 198
+ },
+ {
+ "entropy": 1.6192772388458252,
+ "epoch": 0.402020202020202,
+ "grad_norm": 1.9788341522216797,
+ "learning_rate": 4.600000000000001e-06,
+ "loss": 1.628842830657959,
+ "mean_token_accuracy": 0.615229606628418,
+ "num_tokens": 3260416.0,
+ "step": 199
+ },
+ {
+ "entropy": 1.444870948791504,
+ "epoch": 0.40404040404040403,
+ "grad_norm": 2.05141544342041,
+ "learning_rate": 4.597979797979799e-06,
+ "loss": 1.4365839958190918,
+ "mean_token_accuracy": 0.652723491191864,
+ "num_tokens": 3276800.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.40404040404040403,
+ "eval_entropy": 1.5766179907706477,
+ "eval_loss": 1.5878442525863647,
+ "eval_mean_token_accuracy": 0.6355829551335304,
+ "eval_num_tokens": 3276800.0,
+ "eval_runtime": 43.7272,
+ "eval_samples_per_second": 22.64,
+ "eval_steps_per_second": 2.836,
+ "step": 200
+ },
+ {
+ "entropy": 1.3354029655456543,
+ "epoch": 0.40606060606060607,
+ "grad_norm": 2.012895345687866,
+ "learning_rate": 4.595959595959597e-06,
+ "loss": 1.3289990425109863,
+ "mean_token_accuracy": 0.685271143913269,
+ "num_tokens": 3293184.0,
+ "step": 201
+ },
+ {
+ "entropy": 1.1990011930465698,
+ "epoch": 0.4080808080808081,
+ "grad_norm": 1.9462409019470215,
+ "learning_rate": 4.5939393939393945e-06,
+ "loss": 1.224869728088379,
+ "mean_token_accuracy": 0.6976673007011414,
+ "num_tokens": 3309568.0,
+ "step": 202
+ },
+ {
+ "entropy": 1.6442710161209106,
+ "epoch": 0.4101010101010101,
+ "grad_norm": 2.064532995223999,
+ "learning_rate": 4.591919191919192e-06,
+ "loss": 1.6800963878631592,
+ "mean_token_accuracy": 0.6111993193626404,
+ "num_tokens": 3325952.0,
+ "step": 203
+ },
+ {
+ "entropy": 1.8336306810379028,
+ "epoch": 0.4121212121212121,
+ "grad_norm": 2.478731393814087,
+ "learning_rate": 4.58989898989899e-06,
+ "loss": 1.8518702983856201,
+ "mean_token_accuracy": 0.6021006107330322,
+ "num_tokens": 3342336.0,
+ "step": 204
+ },
+ {
+ "entropy": 1.6767220497131348,
+ "epoch": 0.41414141414141414,
+ "grad_norm": 2.0676512718200684,
+ "learning_rate": 4.587878787878788e-06,
+ "loss": 1.674522042274475,
+ "mean_token_accuracy": 0.6178553700447083,
+ "num_tokens": 3358720.0,
+ "step": 205
+ },
+ {
+ "entropy": 1.7236497402191162,
+ "epoch": 0.4161616161616162,
+ "grad_norm": 2.057074785232544,
+ "learning_rate": 4.585858585858586e-06,
+ "loss": 1.725832462310791,
+ "mean_token_accuracy": 0.620114803314209,
+ "num_tokens": 3375104.0,
+ "step": 206
+ },
+ {
+ "entropy": 1.6493065357208252,
+ "epoch": 0.41818181818181815,
+ "grad_norm": 2.0946099758148193,
+ "learning_rate": 4.583838383838384e-06,
+ "loss": 1.6826295852661133,
+ "mean_token_accuracy": 0.6251221299171448,
+ "num_tokens": 3391488.0,
+ "step": 207
+ },
+ {
+ "entropy": 1.3565926551818848,
+ "epoch": 0.4202020202020202,
+ "grad_norm": 1.9611284732818604,
+ "learning_rate": 4.581818181818183e-06,
+ "loss": 1.346787452697754,
+ "mean_token_accuracy": 0.685332179069519,
+ "num_tokens": 3407872.0,
+ "step": 208
+ },
+ {
+ "entropy": 1.4401211738586426,
+ "epoch": 0.4222222222222222,
+ "grad_norm": 1.8614766597747803,
+ "learning_rate": 4.579797979797981e-06,
+ "loss": 1.4717891216278076,
+ "mean_token_accuracy": 0.650036633014679,
+ "num_tokens": 3424256.0,
+ "step": 209
+ },
+ {
+ "entropy": 1.194276213645935,
+ "epoch": 0.42424242424242425,
+ "grad_norm": 2.0625810623168945,
+ "learning_rate": 4.5777777777777785e-06,
+ "loss": 1.2106804847717285,
+ "mean_token_accuracy": 0.700537383556366,
+ "num_tokens": 3440640.0,
+ "step": 210
+ },
+ {
+ "entropy": 1.7622313499450684,
+ "epoch": 0.4262626262626263,
+ "grad_norm": 2.330610752105713,
+ "learning_rate": 4.575757575757576e-06,
+ "loss": 1.7872710227966309,
+ "mean_token_accuracy": 0.598436713218689,
+ "num_tokens": 3457024.0,
+ "step": 211
+ },
+ {
+ "entropy": 1.409427523612976,
+ "epoch": 0.42828282828282827,
+ "grad_norm": 2.0988259315490723,
+ "learning_rate": 4.573737373737374e-06,
+ "loss": 1.416553020477295,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 3473408.0,
+ "step": 212
+ },
+ {
+ "entropy": 1.6856107711791992,
+ "epoch": 0.4303030303030303,
+ "grad_norm": 2.341475009918213,
+ "learning_rate": 4.571717171717172e-06,
+ "loss": 1.692287802696228,
+ "mean_token_accuracy": 0.6024059653282166,
+ "num_tokens": 3489792.0,
+ "step": 213
+ },
+ {
+ "entropy": 1.997343897819519,
+ "epoch": 0.43232323232323233,
+ "grad_norm": 2.200498104095459,
+ "learning_rate": 4.56969696969697e-06,
+ "loss": 2.026289939880371,
+ "mean_token_accuracy": 0.5781631469726562,
+ "num_tokens": 3506176.0,
+ "step": 214
+ },
+ {
+ "entropy": 1.5175039768218994,
+ "epoch": 0.43434343434343436,
+ "grad_norm": 2.105257272720337,
+ "learning_rate": 4.567676767676768e-06,
+ "loss": 1.521841049194336,
+ "mean_token_accuracy": 0.6404494643211365,
+ "num_tokens": 3522560.0,
+ "step": 215
+ },
+ {
+ "entropy": 1.3616528511047363,
+ "epoch": 0.43636363636363634,
+ "grad_norm": 2.0035297870635986,
+ "learning_rate": 4.565656565656566e-06,
+ "loss": 1.3674360513687134,
+ "mean_token_accuracy": 0.6771494746208191,
+ "num_tokens": 3538944.0,
+ "step": 216
+ },
+ {
+ "entropy": 1.42499840259552,
+ "epoch": 0.4383838383838384,
+ "grad_norm": 1.9115629196166992,
+ "learning_rate": 4.563636363636364e-06,
+ "loss": 1.4129266738891602,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 3555328.0,
+ "step": 217
+ },
+ {
+ "entropy": 1.2844709157943726,
+ "epoch": 0.4404040404040404,
+ "grad_norm": 2.3313121795654297,
+ "learning_rate": 4.5616161616161616e-06,
+ "loss": 1.315006971359253,
+ "mean_token_accuracy": 0.681546151638031,
+ "num_tokens": 3571712.0,
+ "step": 218
+ },
+ {
+ "entropy": 1.5227075815200806,
+ "epoch": 0.44242424242424244,
+ "grad_norm": 2.1849124431610107,
+ "learning_rate": 4.55959595959596e-06,
+ "loss": 1.517989158630371,
+ "mean_token_accuracy": 0.6466169953346252,
+ "num_tokens": 3588096.0,
+ "step": 219
+ },
+ {
+ "entropy": 1.494642734527588,
+ "epoch": 0.4444444444444444,
+ "grad_norm": 2.3109116554260254,
+ "learning_rate": 4.557575757575758e-06,
+ "loss": 1.525421142578125,
+ "mean_token_accuracy": 0.6392281651496887,
+ "num_tokens": 3604480.0,
+ "step": 220
+ },
+ {
+ "entropy": 1.6428948640823364,
+ "epoch": 0.44646464646464645,
+ "grad_norm": 2.1182680130004883,
+ "learning_rate": 4.555555555555556e-06,
+ "loss": 1.6634926795959473,
+ "mean_token_accuracy": 0.6207864880561829,
+ "num_tokens": 3620864.0,
+ "step": 221
+ },
+ {
+ "entropy": 1.7323675155639648,
+ "epoch": 0.4484848484848485,
+ "grad_norm": 2.2620837688446045,
+ "learning_rate": 4.553535353535354e-06,
+ "loss": 1.7312631607055664,
+ "mean_token_accuracy": 0.6138250827789307,
+ "num_tokens": 3637248.0,
+ "step": 222
+ },
+ {
+ "entropy": 1.7863894701004028,
+ "epoch": 0.4505050505050505,
+ "grad_norm": 2.1416971683502197,
+ "learning_rate": 4.551515151515152e-06,
+ "loss": 1.799318552017212,
+ "mean_token_accuracy": 0.5906203985214233,
+ "num_tokens": 3653632.0,
+ "step": 223
+ },
+ {
+ "entropy": 1.7404330968856812,
+ "epoch": 0.45252525252525255,
+ "grad_norm": 2.0814504623413086,
+ "learning_rate": 4.54949494949495e-06,
+ "loss": 1.742197036743164,
+ "mean_token_accuracy": 0.6050317287445068,
+ "num_tokens": 3670016.0,
+ "step": 224
+ },
+ {
+ "entropy": 1.4387869834899902,
+ "epoch": 0.45454545454545453,
+ "grad_norm": 2.1386022567749023,
+ "learning_rate": 4.547474747474748e-06,
+ "loss": 1.4602317810058594,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 3686400.0,
+ "step": 225
+ },
+ {
+ "entropy": 1.2733348608016968,
+ "epoch": 0.45656565656565656,
+ "grad_norm": 2.02687668800354,
+ "learning_rate": 4.5454545454545455e-06,
+ "loss": 1.2683714628219604,
+ "mean_token_accuracy": 0.6966902613639832,
+ "num_tokens": 3702784.0,
+ "step": 226
+ },
+ {
+ "entropy": 1.4554595947265625,
+ "epoch": 0.4585858585858586,
+ "grad_norm": 2.169268846511841,
+ "learning_rate": 4.543434343434343e-06,
+ "loss": 1.4541833400726318,
+ "mean_token_accuracy": 0.6522960662841797,
+ "num_tokens": 3719168.0,
+ "step": 227
+ },
+ {
+ "entropy": 1.487573266029358,
+ "epoch": 0.46060606060606063,
+ "grad_norm": 1.9726165533065796,
+ "learning_rate": 4.541414141414141e-06,
+ "loss": 1.5024409294128418,
+ "mean_token_accuracy": 0.6509526371955872,
+ "num_tokens": 3735552.0,
+ "step": 228
+ },
+ {
+ "entropy": 1.3991138935089111,
+ "epoch": 0.4626262626262626,
+ "grad_norm": 2.0992283821105957,
+ "learning_rate": 4.539393939393939e-06,
+ "loss": 1.4016860723495483,
+ "mean_token_accuracy": 0.6639594435691833,
+ "num_tokens": 3751936.0,
+ "step": 229
+ },
+ {
+ "entropy": 1.6564134359359741,
+ "epoch": 0.46464646464646464,
+ "grad_norm": 2.047656297683716,
+ "learning_rate": 4.537373737373738e-06,
+ "loss": 1.6598721742630005,
+ "mean_token_accuracy": 0.6166951656341553,
+ "num_tokens": 3768320.0,
+ "step": 230
+ },
+ {
+ "entropy": 1.5165014266967773,
+ "epoch": 0.4666666666666667,
+ "grad_norm": 2.079996109008789,
+ "learning_rate": 4.535353535353536e-06,
+ "loss": 1.4980010986328125,
+ "mean_token_accuracy": 0.6370908617973328,
+ "num_tokens": 3784704.0,
+ "step": 231
+ },
+ {
+ "entropy": 1.5409225225448608,
+ "epoch": 0.4686868686868687,
+ "grad_norm": 2.0996923446655273,
+ "learning_rate": 4.533333333333334e-06,
+ "loss": 1.5504257678985596,
+ "mean_token_accuracy": 0.6465559601783752,
+ "num_tokens": 3801088.0,
+ "step": 232
+ },
+ {
+ "entropy": 1.3590043783187866,
+ "epoch": 0.4707070707070707,
+ "grad_norm": 2.14617919921875,
+ "learning_rate": 4.531313131313132e-06,
+ "loss": 1.3581812381744385,
+ "mean_token_accuracy": 0.6683561205863953,
+ "num_tokens": 3817472.0,
+ "step": 233
+ },
+ {
+ "entropy": 1.641785740852356,
+ "epoch": 0.4727272727272727,
+ "grad_norm": 1.9499926567077637,
+ "learning_rate": 4.5292929292929295e-06,
+ "loss": 1.6653470993041992,
+ "mean_token_accuracy": 0.6319614052772522,
+ "num_tokens": 3833856.0,
+ "step": 234
+ },
+ {
+ "entropy": 1.4700758457183838,
+ "epoch": 0.47474747474747475,
+ "grad_norm": 1.9411437511444092,
+ "learning_rate": 4.527272727272727e-06,
+ "loss": 1.4762463569641113,
+ "mean_token_accuracy": 0.6631656289100647,
+ "num_tokens": 3850240.0,
+ "step": 235
+ },
+ {
+ "entropy": 1.5418941974639893,
+ "epoch": 0.4767676767676768,
+ "grad_norm": 2.3191940784454346,
+ "learning_rate": 4.525252525252526e-06,
+ "loss": 1.5151214599609375,
+ "mean_token_accuracy": 0.6326331496238708,
+ "num_tokens": 3866624.0,
+ "step": 236
+ },
+ {
+ "entropy": 2.1102776527404785,
+ "epoch": 0.47878787878787876,
+ "grad_norm": 2.2287707328796387,
+ "learning_rate": 4.523232323232324e-06,
+ "loss": 2.106567859649658,
+ "mean_token_accuracy": 0.5506839156150818,
+ "num_tokens": 3883008.0,
+ "step": 237
+ },
+ {
+ "entropy": 1.7448827028274536,
+ "epoch": 0.4808080808080808,
+ "grad_norm": 2.2352893352508545,
+ "learning_rate": 4.521212121212122e-06,
+ "loss": 1.7495017051696777,
+ "mean_token_accuracy": 0.60326087474823,
+ "num_tokens": 3899392.0,
+ "step": 238
+ },
+ {
+ "entropy": 1.315240740776062,
+ "epoch": 0.48282828282828283,
+ "grad_norm": 1.9933631420135498,
+ "learning_rate": 4.51919191919192e-06,
+ "loss": 1.315302848815918,
+ "mean_token_accuracy": 0.686431348323822,
+ "num_tokens": 3915776.0,
+ "step": 239
+ },
+ {
+ "entropy": 1.5851637125015259,
+ "epoch": 0.48484848484848486,
+ "grad_norm": 2.153303623199463,
+ "learning_rate": 4.517171717171718e-06,
+ "loss": 1.5947662591934204,
+ "mean_token_accuracy": 0.6297020316123962,
+ "num_tokens": 3932160.0,
+ "step": 240
+ },
+ {
+ "entropy": 1.8050944805145264,
+ "epoch": 0.4868686868686869,
+ "grad_norm": 2.025022506713867,
+ "learning_rate": 4.5151515151515155e-06,
+ "loss": 1.8051010370254517,
+ "mean_token_accuracy": 0.6055202484130859,
+ "num_tokens": 3948544.0,
+ "step": 241
+ },
+ {
+ "entropy": 1.518296718597412,
+ "epoch": 0.4888888888888889,
+ "grad_norm": 2.1021833419799805,
+ "learning_rate": 4.513131313131313e-06,
+ "loss": 1.5396809577941895,
+ "mean_token_accuracy": 0.6359916925430298,
+ "num_tokens": 3964928.0,
+ "step": 242
+ },
+ {
+ "entropy": 1.518903136253357,
+ "epoch": 0.4909090909090909,
+ "grad_norm": 2.0960140228271484,
+ "learning_rate": 4.511111111111111e-06,
+ "loss": 1.5528055429458618,
+ "mean_token_accuracy": 0.6224963068962097,
+ "num_tokens": 3981312.0,
+ "step": 243
+ },
+ {
+ "entropy": 1.6960705518722534,
+ "epoch": 0.49292929292929294,
+ "grad_norm": 1.8580718040466309,
+ "learning_rate": 4.50909090909091e-06,
+ "loss": 1.7192862033843994,
+ "mean_token_accuracy": 0.6259770393371582,
+ "num_tokens": 3997696.0,
+ "step": 244
+ },
+ {
+ "entropy": 1.4633033275604248,
+ "epoch": 0.494949494949495,
+ "grad_norm": 1.8983049392700195,
+ "learning_rate": 4.507070707070708e-06,
+ "loss": 1.451701283454895,
+ "mean_token_accuracy": 0.6669516563415527,
+ "num_tokens": 4014080.0,
+ "step": 245
+ },
+ {
+ "entropy": 1.6508095264434814,
+ "epoch": 0.49696969696969695,
+ "grad_norm": 2.298679828643799,
+ "learning_rate": 4.505050505050506e-06,
+ "loss": 1.6596897840499878,
+ "mean_token_accuracy": 0.6115046143531799,
+ "num_tokens": 4030464.0,
+ "step": 246
+ },
+ {
+ "entropy": 1.313779354095459,
+ "epoch": 0.498989898989899,
+ "grad_norm": 1.9894335269927979,
+ "learning_rate": 4.503030303030304e-06,
+ "loss": 1.3285409212112427,
+ "mean_token_accuracy": 0.6802027225494385,
+ "num_tokens": 4046848.0,
+ "step": 247
+ },
+ {
+ "entropy": 1.5139521360397339,
+ "epoch": 0.501010101010101,
+ "grad_norm": 2.028320789337158,
+ "learning_rate": 4.501010101010102e-06,
+ "loss": 1.5366487503051758,
+ "mean_token_accuracy": 0.6416707634925842,
+ "num_tokens": 4063232.0,
+ "step": 248
+ },
+ {
+ "entropy": 1.5277045965194702,
+ "epoch": 0.503030303030303,
+ "grad_norm": 2.3160979747772217,
+ "learning_rate": 4.4989898989898995e-06,
+ "loss": 1.5571036338806152,
+ "mean_token_accuracy": 0.6436858773231506,
+ "num_tokens": 4079616.0,
+ "step": 249
+ },
+ {
+ "entropy": 1.6084188222885132,
+ "epoch": 0.5050505050505051,
+ "grad_norm": 2.20550274848938,
+ "learning_rate": 4.496969696969697e-06,
+ "loss": 1.622127652168274,
+ "mean_token_accuracy": 0.6284196376800537,
+ "num_tokens": 4096000.0,
+ "step": 250
+ },
+ {
+ "epoch": 0.5050505050505051,
+ "eval_entropy": 1.5547234262189558,
+ "eval_loss": 1.5764786005020142,
+ "eval_mean_token_accuracy": 0.6375306306346771,
+ "eval_num_tokens": 4096000.0,
+ "eval_runtime": 43.7607,
+ "eval_samples_per_second": 22.623,
+ "eval_steps_per_second": 2.834,
+ "step": 250
+ },
+ {
+ "entropy": 1.4309135675430298,
+ "epoch": 0.5070707070707071,
+ "grad_norm": 2.080864906311035,
+ "learning_rate": 4.494949494949495e-06,
+ "loss": 1.4481091499328613,
+ "mean_token_accuracy": 0.6694552898406982,
+ "num_tokens": 4112384.0,
+ "step": 251
+ },
+ {
+ "entropy": 1.4067270755767822,
+ "epoch": 0.509090909090909,
+ "grad_norm": 2.036475419998169,
+ "learning_rate": 4.492929292929293e-06,
+ "loss": 1.4035298824310303,
+ "mean_token_accuracy": 0.6547996997833252,
+ "num_tokens": 4128768.0,
+ "step": 252
+ },
+ {
+ "entropy": 2.1751608848571777,
+ "epoch": 0.5111111111111111,
+ "grad_norm": 1.953995943069458,
+ "learning_rate": 4.490909090909091e-06,
+ "loss": 2.1616692543029785,
+ "mean_token_accuracy": 0.5592941045761108,
+ "num_tokens": 4145152.0,
+ "step": 253
+ },
+ {
+ "entropy": 1.45353102684021,
+ "epoch": 0.5131313131313131,
+ "grad_norm": 2.084437370300293,
+ "learning_rate": 4.488888888888889e-06,
+ "loss": 1.4633586406707764,
+ "mean_token_accuracy": 0.6620664596557617,
+ "num_tokens": 4161536.0,
+ "step": 254
+ },
+ {
+ "entropy": 1.64310884475708,
+ "epoch": 0.5151515151515151,
+ "grad_norm": 2.0700111389160156,
+ "learning_rate": 4.486868686868688e-06,
+ "loss": 1.6868078708648682,
+ "mean_token_accuracy": 0.616328775882721,
+ "num_tokens": 4177920.0,
+ "step": 255
+ },
+ {
+ "entropy": 1.5113472938537598,
+ "epoch": 0.5171717171717172,
+ "grad_norm": 2.102180242538452,
+ "learning_rate": 4.4848484848484855e-06,
+ "loss": 1.5240120887756348,
+ "mean_token_accuracy": 0.638067901134491,
+ "num_tokens": 4194304.0,
+ "step": 256
+ },
+ {
+ "entropy": 1.5752851963043213,
+ "epoch": 0.5191919191919192,
+ "grad_norm": 2.026737689971924,
+ "learning_rate": 4.4828282828282834e-06,
+ "loss": 1.6041791439056396,
+ "mean_token_accuracy": 0.6275647282600403,
+ "num_tokens": 4210688.0,
+ "step": 257
+ },
+ {
+ "entropy": 1.548423171043396,
+ "epoch": 0.5212121212121212,
+ "grad_norm": 2.0578935146331787,
+ "learning_rate": 4.480808080808081e-06,
+ "loss": 1.563529372215271,
+ "mean_token_accuracy": 0.6348925232887268,
+ "num_tokens": 4227072.0,
+ "step": 258
+ },
+ {
+ "entropy": 1.5324457883834839,
+ "epoch": 0.5232323232323233,
+ "grad_norm": 2.216235637664795,
+ "learning_rate": 4.478787878787879e-06,
+ "loss": 1.5559678077697754,
+ "mean_token_accuracy": 0.6300073266029358,
+ "num_tokens": 4243456.0,
+ "step": 259
+ },
+ {
+ "entropy": 1.5275540351867676,
+ "epoch": 0.5252525252525253,
+ "grad_norm": 2.037306070327759,
+ "learning_rate": 4.476767676767677e-06,
+ "loss": 1.541567087173462,
+ "mean_token_accuracy": 0.6424035429954529,
+ "num_tokens": 4259840.0,
+ "step": 260
+ },
+ {
+ "entropy": 1.6842185258865356,
+ "epoch": 0.5272727272727272,
+ "grad_norm": 2.0241005420684814,
+ "learning_rate": 4.474747474747475e-06,
+ "loss": 1.6819056272506714,
+ "mean_token_accuracy": 0.6102222800254822,
+ "num_tokens": 4276224.0,
+ "step": 261
+ },
+ {
+ "entropy": 1.5656248331069946,
+ "epoch": 0.5292929292929293,
+ "grad_norm": 1.993054986000061,
+ "learning_rate": 4.472727272727273e-06,
+ "loss": 1.6132277250289917,
+ "mean_token_accuracy": 0.634709358215332,
+ "num_tokens": 4292608.0,
+ "step": 262
+ },
+ {
+ "entropy": 1.6354466676712036,
+ "epoch": 0.5313131313131313,
+ "grad_norm": 2.06508731842041,
+ "learning_rate": 4.470707070707071e-06,
+ "loss": 1.6475149393081665,
+ "mean_token_accuracy": 0.6121763586997986,
+ "num_tokens": 4308992.0,
+ "step": 263
+ },
+ {
+ "entropy": 1.5267232656478882,
+ "epoch": 0.5333333333333333,
+ "grad_norm": 2.1227569580078125,
+ "learning_rate": 4.468686868686869e-06,
+ "loss": 1.5468671321868896,
+ "mean_token_accuracy": 0.6365413069725037,
+ "num_tokens": 4325376.0,
+ "step": 264
+ },
+ {
+ "entropy": 1.2252761125564575,
+ "epoch": 0.5353535353535354,
+ "grad_norm": 2.0596134662628174,
+ "learning_rate": 4.4666666666666665e-06,
+ "loss": 1.2242389917373657,
+ "mean_token_accuracy": 0.6973620057106018,
+ "num_tokens": 4341760.0,
+ "step": 265
+ },
+ {
+ "entropy": 1.6007431745529175,
+ "epoch": 0.5373737373737374,
+ "grad_norm": 1.9341918230056763,
+ "learning_rate": 4.464646464646465e-06,
+ "loss": 1.5989094972610474,
+ "mean_token_accuracy": 0.6284196376800537,
+ "num_tokens": 4358144.0,
+ "step": 266
+ },
+ {
+ "entropy": 1.2708780765533447,
+ "epoch": 0.5393939393939394,
+ "grad_norm": 4.594091415405273,
+ "learning_rate": 4.462626262626263e-06,
+ "loss": 1.3484312295913696,
+ "mean_token_accuracy": 0.6790425181388855,
+ "num_tokens": 4374528.0,
+ "step": 267
+ },
+ {
+ "entropy": 1.5423723459243774,
+ "epoch": 0.5414141414141415,
+ "grad_norm": 1.933602213859558,
+ "learning_rate": 4.460606060606061e-06,
+ "loss": 1.594527244567871,
+ "mean_token_accuracy": 0.6386785507202148,
+ "num_tokens": 4390912.0,
+ "step": 268
+ },
+ {
+ "entropy": 1.7213952541351318,
+ "epoch": 0.5434343434343434,
+ "grad_norm": 2.195904016494751,
+ "learning_rate": 4.458585858585859e-06,
+ "loss": 1.724353551864624,
+ "mean_token_accuracy": 0.6008182764053345,
+ "num_tokens": 4407296.0,
+ "step": 269
+ },
+ {
+ "entropy": 1.4772557020187378,
+ "epoch": 0.5454545454545454,
+ "grad_norm": 2.0990796089172363,
+ "learning_rate": 4.456565656565657e-06,
+ "loss": 1.486825942993164,
+ "mean_token_accuracy": 0.6507083773612976,
+ "num_tokens": 4423680.0,
+ "step": 270
+ },
+ {
+ "entropy": 1.6876367330551147,
+ "epoch": 0.5474747474747474,
+ "grad_norm": 2.1944479942321777,
+ "learning_rate": 4.454545454545455e-06,
+ "loss": 1.71107816696167,
+ "mean_token_accuracy": 0.6027112603187561,
+ "num_tokens": 4440064.0,
+ "step": 271
+ },
+ {
+ "entropy": 1.5480726957321167,
+ "epoch": 0.5494949494949495,
+ "grad_norm": 2.1579341888427734,
+ "learning_rate": 4.452525252525253e-06,
+ "loss": 1.544647216796875,
+ "mean_token_accuracy": 0.6345261335372925,
+ "num_tokens": 4456448.0,
+ "step": 272
+ },
+ {
+ "entropy": 1.6161645650863647,
+ "epoch": 0.5515151515151515,
+ "grad_norm": 1.981154203414917,
+ "learning_rate": 4.4505050505050505e-06,
+ "loss": 1.6109068393707275,
+ "mean_token_accuracy": 0.6318392753601074,
+ "num_tokens": 4472832.0,
+ "step": 273
+ },
+ {
+ "entropy": 1.2576326131820679,
+ "epoch": 0.5535353535353535,
+ "grad_norm": 1.95668625831604,
+ "learning_rate": 4.448484848484848e-06,
+ "loss": 1.2614656686782837,
+ "mean_token_accuracy": 0.7025524973869324,
+ "num_tokens": 4489216.0,
+ "step": 274
+ },
+ {
+ "entropy": 1.405206561088562,
+ "epoch": 0.5555555555555556,
+ "grad_norm": 2.0302884578704834,
+ "learning_rate": 4.446464646464646e-06,
+ "loss": 1.416546106338501,
+ "mean_token_accuracy": 0.6753786206245422,
+ "num_tokens": 4505600.0,
+ "step": 275
+ },
+ {
+ "entropy": 1.9038625955581665,
+ "epoch": 0.5575757575757576,
+ "grad_norm": 2.06475567817688,
+ "learning_rate": 4.444444444444444e-06,
+ "loss": 1.9273614883422852,
+ "mean_token_accuracy": 0.5813996195793152,
+ "num_tokens": 4521984.0,
+ "step": 276
+ },
+ {
+ "entropy": 1.7208465337753296,
+ "epoch": 0.5595959595959596,
+ "grad_norm": 2.0136189460754395,
+ "learning_rate": 4.442424242424243e-06,
+ "loss": 1.7260158061981201,
+ "mean_token_accuracy": 0.6006350517272949,
+ "num_tokens": 4538368.0,
+ "step": 277
+ },
+ {
+ "entropy": 1.7570570707321167,
+ "epoch": 0.5616161616161616,
+ "grad_norm": 2.148594379425049,
+ "learning_rate": 4.440404040404041e-06,
+ "loss": 1.7799286842346191,
+ "mean_token_accuracy": 0.5943453907966614,
+ "num_tokens": 4554752.0,
+ "step": 278
+ },
+ {
+ "entropy": 1.6388157606124878,
+ "epoch": 0.5636363636363636,
+ "grad_norm": 2.1301987171173096,
+ "learning_rate": 4.438383838383839e-06,
+ "loss": 1.63419508934021,
+ "mean_token_accuracy": 0.6405715942382812,
+ "num_tokens": 4571136.0,
+ "step": 279
+ },
+ {
+ "entropy": 1.5902295112609863,
+ "epoch": 0.5656565656565656,
+ "grad_norm": 2.0526790618896484,
+ "learning_rate": 4.436363636363637e-06,
+ "loss": 1.6278276443481445,
+ "mean_token_accuracy": 0.615229606628418,
+ "num_tokens": 4587520.0,
+ "step": 280
+ },
+ {
+ "entropy": 1.5494027137756348,
+ "epoch": 0.5676767676767677,
+ "grad_norm": 1.9863859415054321,
+ "learning_rate": 4.434343434343435e-06,
+ "loss": 1.5622975826263428,
+ "mean_token_accuracy": 0.6261602640151978,
+ "num_tokens": 4603904.0,
+ "step": 281
+ },
+ {
+ "entropy": 1.2140685319900513,
+ "epoch": 0.5696969696969697,
+ "grad_norm": 2.4206902980804443,
+ "learning_rate": 4.432323232323233e-06,
+ "loss": 1.2389612197875977,
+ "mean_token_accuracy": 0.6943697929382324,
+ "num_tokens": 4620288.0,
+ "step": 282
+ },
+ {
+ "entropy": 1.4347270727157593,
+ "epoch": 0.5717171717171717,
+ "grad_norm": 2.0198237895965576,
+ "learning_rate": 4.430303030303031e-06,
+ "loss": 1.4648659229278564,
+ "mean_token_accuracy": 0.6573033928871155,
+ "num_tokens": 4636672.0,
+ "step": 283
+ },
+ {
+ "entropy": 1.3239331245422363,
+ "epoch": 0.5737373737373738,
+ "grad_norm": 1.9862704277038574,
+ "learning_rate": 4.428282828282829e-06,
+ "loss": 1.3520365953445435,
+ "mean_token_accuracy": 0.6852100491523743,
+ "num_tokens": 4653056.0,
+ "step": 284
+ },
+ {
+ "entropy": 1.7534631490707397,
+ "epoch": 0.5757575757575758,
+ "grad_norm": 2.0964176654815674,
+ "learning_rate": 4.426262626262627e-06,
+ "loss": 1.7659757137298584,
+ "mean_token_accuracy": 0.5975207686424255,
+ "num_tokens": 4669440.0,
+ "step": 285
+ },
+ {
+ "entropy": 1.1573433876037598,
+ "epoch": 0.5777777777777777,
+ "grad_norm": 2.0671567916870117,
+ "learning_rate": 4.424242424242425e-06,
+ "loss": 1.1479461193084717,
+ "mean_token_accuracy": 0.7143380641937256,
+ "num_tokens": 4685824.0,
+ "step": 286
+ },
+ {
+ "entropy": 1.2439504861831665,
+ "epoch": 0.5797979797979798,
+ "grad_norm": 2.0317327976226807,
+ "learning_rate": 4.422222222222223e-06,
+ "loss": 1.255782961845398,
+ "mean_token_accuracy": 0.691255509853363,
+ "num_tokens": 4702208.0,
+ "step": 287
+ },
+ {
+ "entropy": 1.5569473505020142,
+ "epoch": 0.5818181818181818,
+ "grad_norm": 2.0759670734405518,
+ "learning_rate": 4.4202020202020205e-06,
+ "loss": 1.5564974546432495,
+ "mean_token_accuracy": 0.6284807324409485,
+ "num_tokens": 4718592.0,
+ "step": 288
+ },
+ {
+ "entropy": 1.478676199913025,
+ "epoch": 0.5838383838383838,
+ "grad_norm": 1.9528205394744873,
+ "learning_rate": 4.418181818181818e-06,
+ "loss": 1.491654396057129,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 4734976.0,
+ "step": 289
+ },
+ {
+ "entropy": 1.2454503774642944,
+ "epoch": 0.5858585858585859,
+ "grad_norm": 1.9008079767227173,
+ "learning_rate": 4.416161616161616e-06,
+ "loss": 1.253904938697815,
+ "mean_token_accuracy": 0.6971787810325623,
+ "num_tokens": 4751360.0,
+ "step": 290
+ },
+ {
+ "entropy": 1.1740810871124268,
+ "epoch": 0.5878787878787879,
+ "grad_norm": 1.8888787031173706,
+ "learning_rate": 4.414141414141415e-06,
+ "loss": 1.195070505142212,
+ "mean_token_accuracy": 0.7048119306564331,
+ "num_tokens": 4767744.0,
+ "step": 291
+ },
+ {
+ "entropy": 1.6064486503601074,
+ "epoch": 0.5898989898989899,
+ "grad_norm": 2.073559284210205,
+ "learning_rate": 4.412121212121213e-06,
+ "loss": 1.6180689334869385,
+ "mean_token_accuracy": 0.6242061257362366,
+ "num_tokens": 4784128.0,
+ "step": 292
+ },
+ {
+ "entropy": 1.6119383573532104,
+ "epoch": 0.591919191919192,
+ "grad_norm": 1.8773425817489624,
+ "learning_rate": 4.410101010101011e-06,
+ "loss": 1.5875662565231323,
+ "mean_token_accuracy": 0.647838294506073,
+ "num_tokens": 4800512.0,
+ "step": 293
+ },
+ {
+ "entropy": 1.392905592918396,
+ "epoch": 0.593939393939394,
+ "grad_norm": 2.1699368953704834,
+ "learning_rate": 4.408080808080809e-06,
+ "loss": 1.3949127197265625,
+ "mean_token_accuracy": 0.6538837552070618,
+ "num_tokens": 4816896.0,
+ "step": 294
+ },
+ {
+ "entropy": 1.5057002305984497,
+ "epoch": 0.5959595959595959,
+ "grad_norm": 2.2730712890625,
+ "learning_rate": 4.4060606060606066e-06,
+ "loss": 1.4755051136016846,
+ "mean_token_accuracy": 0.6498534679412842,
+ "num_tokens": 4833280.0,
+ "step": 295
+ },
+ {
+ "entropy": 1.5468902587890625,
+ "epoch": 0.597979797979798,
+ "grad_norm": 1.9911075830459595,
+ "learning_rate": 4.4040404040404044e-06,
+ "loss": 1.539963722229004,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 4849664.0,
+ "step": 296
+ },
+ {
+ "entropy": 1.5196901559829712,
+ "epoch": 0.6,
+ "grad_norm": 1.9859540462493896,
+ "learning_rate": 4.402020202020202e-06,
+ "loss": 1.523442029953003,
+ "mean_token_accuracy": 0.6417317986488342,
+ "num_tokens": 4866048.0,
+ "step": 297
+ },
+ {
+ "entropy": 1.8251866102218628,
+ "epoch": 0.602020202020202,
+ "grad_norm": 2.2566516399383545,
+ "learning_rate": 4.4e-06,
+ "loss": 1.8667771816253662,
+ "mean_token_accuracy": 0.5872007608413696,
+ "num_tokens": 4882432.0,
+ "step": 298
+ },
+ {
+ "entropy": 1.6816744804382324,
+ "epoch": 0.604040404040404,
+ "grad_norm": 2.0107715129852295,
+ "learning_rate": 4.397979797979798e-06,
+ "loss": 1.6907548904418945,
+ "mean_token_accuracy": 0.6176722049713135,
+ "num_tokens": 4898816.0,
+ "step": 299
+ },
+ {
+ "entropy": 1.4992223978042603,
+ "epoch": 0.6060606060606061,
+ "grad_norm": 2.1236329078674316,
+ "learning_rate": 4.395959595959596e-06,
+ "loss": 1.5015790462493896,
+ "mean_token_accuracy": 0.6372129917144775,
+ "num_tokens": 4915200.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.6060606060606061,
+ "eval_entropy": 1.5544315297757425,
+ "eval_loss": 1.5676765441894531,
+ "eval_mean_token_accuracy": 0.6389380799185845,
+ "eval_num_tokens": 4915200.0,
+ "eval_runtime": 43.7857,
+ "eval_samples_per_second": 22.61,
+ "eval_steps_per_second": 2.832,
+ "step": 300
+ },
+ {
+ "entropy": 1.518556833267212,
+ "epoch": 0.6080808080808081,
+ "grad_norm": 2.88371205329895,
+ "learning_rate": 4.393939393939394e-06,
+ "loss": 1.5310916900634766,
+ "mean_token_accuracy": 0.6551660895347595,
+ "num_tokens": 4931584.0,
+ "step": 301
+ },
+ {
+ "entropy": 1.4650386571884155,
+ "epoch": 0.6101010101010101,
+ "grad_norm": 2.1849780082702637,
+ "learning_rate": 4.391919191919193e-06,
+ "loss": 1.4405598640441895,
+ "mean_token_accuracy": 0.6531509757041931,
+ "num_tokens": 4947968.0,
+ "step": 302
+ },
+ {
+ "entropy": 1.5209505558013916,
+ "epoch": 0.6121212121212121,
+ "grad_norm": 2.1135010719299316,
+ "learning_rate": 4.3898989898989905e-06,
+ "loss": 1.5324647426605225,
+ "mean_token_accuracy": 0.6561431288719177,
+ "num_tokens": 4964352.0,
+ "step": 303
+ },
+ {
+ "entropy": 1.448391318321228,
+ "epoch": 0.6141414141414141,
+ "grad_norm": 1.9959306716918945,
+ "learning_rate": 4.387878787878788e-06,
+ "loss": 1.4721965789794922,
+ "mean_token_accuracy": 0.6578529477119446,
+ "num_tokens": 4980736.0,
+ "step": 304
+ },
+ {
+ "entropy": 1.4609358310699463,
+ "epoch": 0.6161616161616161,
+ "grad_norm": 2.1308915615081787,
+ "learning_rate": 4.385858585858586e-06,
+ "loss": 1.4707520008087158,
+ "mean_token_accuracy": 0.6482046842575073,
+ "num_tokens": 4997120.0,
+ "step": 305
+ },
+ {
+ "entropy": 1.7125155925750732,
+ "epoch": 0.6181818181818182,
+ "grad_norm": 2.2170841693878174,
+ "learning_rate": 4.383838383838384e-06,
+ "loss": 1.7630269527435303,
+ "mean_token_accuracy": 0.5999022722244263,
+ "num_tokens": 5013504.0,
+ "step": 306
+ },
+ {
+ "entropy": 1.6740268468856812,
+ "epoch": 0.6202020202020202,
+ "grad_norm": 1.983644723892212,
+ "learning_rate": 4.381818181818182e-06,
+ "loss": 1.6849563121795654,
+ "mean_token_accuracy": 0.6237176060676575,
+ "num_tokens": 5029888.0,
+ "step": 307
+ },
+ {
+ "entropy": 1.3754971027374268,
+ "epoch": 0.6222222222222222,
+ "grad_norm": 2.005277395248413,
+ "learning_rate": 4.37979797979798e-06,
+ "loss": 1.385213851928711,
+ "mean_token_accuracy": 0.6638984084129333,
+ "num_tokens": 5046272.0,
+ "step": 308
+ },
+ {
+ "entropy": 1.5476733446121216,
+ "epoch": 0.6242424242424243,
+ "grad_norm": 2.4317610263824463,
+ "learning_rate": 4.377777777777778e-06,
+ "loss": 1.5417041778564453,
+ "mean_token_accuracy": 0.6323888897895813,
+ "num_tokens": 5062656.0,
+ "step": 309
+ },
+ {
+ "entropy": 1.4437031745910645,
+ "epoch": 0.6262626262626263,
+ "grad_norm": 2.1464109420776367,
+ "learning_rate": 4.375757575757576e-06,
+ "loss": 1.4704627990722656,
+ "mean_token_accuracy": 0.6772105693817139,
+ "num_tokens": 5079040.0,
+ "step": 310
+ },
+ {
+ "entropy": 1.4859641790390015,
+ "epoch": 0.6282828282828283,
+ "grad_norm": 2.0800492763519287,
+ "learning_rate": 4.373737373737374e-06,
+ "loss": 1.5072834491729736,
+ "mean_token_accuracy": 0.658707857131958,
+ "num_tokens": 5095424.0,
+ "step": 311
+ },
+ {
+ "entropy": 1.8733419179916382,
+ "epoch": 0.6303030303030303,
+ "grad_norm": 2.120965003967285,
+ "learning_rate": 4.3717171717171715e-06,
+ "loss": 1.8567254543304443,
+ "mean_token_accuracy": 0.5847581624984741,
+ "num_tokens": 5111808.0,
+ "step": 312
+ },
+ {
+ "entropy": 1.4578243494033813,
+ "epoch": 0.6323232323232323,
+ "grad_norm": 1.9577823877334595,
+ "learning_rate": 4.36969696969697e-06,
+ "loss": 1.4758052825927734,
+ "mean_token_accuracy": 0.6590742468833923,
+ "num_tokens": 5128192.0,
+ "step": 313
+ },
+ {
+ "entropy": 1.8680084943771362,
+ "epoch": 0.6343434343434343,
+ "grad_norm": 2.170994520187378,
+ "learning_rate": 4.367676767676768e-06,
+ "loss": 1.904400110244751,
+ "mean_token_accuracy": 0.5857962965965271,
+ "num_tokens": 5144576.0,
+ "step": 314
+ },
+ {
+ "entropy": 1.6488304138183594,
+ "epoch": 0.6363636363636364,
+ "grad_norm": 1.959490418434143,
+ "learning_rate": 4.365656565656566e-06,
+ "loss": 1.6570477485656738,
+ "mean_token_accuracy": 0.6257327795028687,
+ "num_tokens": 5160960.0,
+ "step": 315
+ },
+ {
+ "entropy": 1.5038025379180908,
+ "epoch": 0.6383838383838384,
+ "grad_norm": 2.072697401046753,
+ "learning_rate": 4.363636363636364e-06,
+ "loss": 1.5234860181808472,
+ "mean_token_accuracy": 0.6494259834289551,
+ "num_tokens": 5177344.0,
+ "step": 316
+ },
+ {
+ "entropy": 1.4154654741287231,
+ "epoch": 0.6404040404040404,
+ "grad_norm": 1.894587755203247,
+ "learning_rate": 4.361616161616162e-06,
+ "loss": 1.4131592512130737,
+ "mean_token_accuracy": 0.6667073965072632,
+ "num_tokens": 5193728.0,
+ "step": 317
+ },
+ {
+ "entropy": 1.5813250541687012,
+ "epoch": 0.6424242424242425,
+ "grad_norm": 2.4088737964630127,
+ "learning_rate": 4.35959595959596e-06,
+ "loss": 1.6236622333526611,
+ "mean_token_accuracy": 0.6313507556915283,
+ "num_tokens": 5210112.0,
+ "step": 318
+ },
+ {
+ "entropy": 1.4140045642852783,
+ "epoch": 0.6444444444444445,
+ "grad_norm": 1.991557240486145,
+ "learning_rate": 4.3575757575757576e-06,
+ "loss": 1.4242517948150635,
+ "mean_token_accuracy": 0.6569980382919312,
+ "num_tokens": 5226496.0,
+ "step": 319
+ },
+ {
+ "entropy": 1.615628957748413,
+ "epoch": 0.6464646464646465,
+ "grad_norm": 1.8819077014923096,
+ "learning_rate": 4.3555555555555555e-06,
+ "loss": 1.6331532001495361,
+ "mean_token_accuracy": 0.6299462914466858,
+ "num_tokens": 5242880.0,
+ "step": 320
+ },
+ {
+ "entropy": 1.3118394613265991,
+ "epoch": 0.6484848484848484,
+ "grad_norm": 2.0589284896850586,
+ "learning_rate": 4.353535353535353e-06,
+ "loss": 1.2880034446716309,
+ "mean_token_accuracy": 0.6842941045761108,
+ "num_tokens": 5259264.0,
+ "step": 321
+ },
+ {
+ "entropy": 1.2786612510681152,
+ "epoch": 0.6505050505050505,
+ "grad_norm": 2.033839225769043,
+ "learning_rate": 4.351515151515152e-06,
+ "loss": 1.2829055786132812,
+ "mean_token_accuracy": 0.6910112500190735,
+ "num_tokens": 5275648.0,
+ "step": 322
+ },
+ {
+ "entropy": 1.5632988214492798,
+ "epoch": 0.6525252525252525,
+ "grad_norm": 2.1970419883728027,
+ "learning_rate": 4.34949494949495e-06,
+ "loss": 1.5865097045898438,
+ "mean_token_accuracy": 0.642892062664032,
+ "num_tokens": 5292032.0,
+ "step": 323
+ },
+ {
+ "entropy": 1.1542725563049316,
+ "epoch": 0.6545454545454545,
+ "grad_norm": 1.9750654697418213,
+ "learning_rate": 4.347474747474748e-06,
+ "loss": 1.1401035785675049,
+ "mean_token_accuracy": 0.7061553597450256,
+ "num_tokens": 5308416.0,
+ "step": 324
+ },
+ {
+ "entropy": 1.6879942417144775,
+ "epoch": 0.6565656565656566,
+ "grad_norm": 2.0022354125976562,
+ "learning_rate": 4.345454545454546e-06,
+ "loss": 1.70950448513031,
+ "mean_token_accuracy": 0.6089398860931396,
+ "num_tokens": 5324800.0,
+ "step": 325
+ },
+ {
+ "entropy": 1.7589699029922485,
+ "epoch": 0.6585858585858586,
+ "grad_norm": 1.925520420074463,
+ "learning_rate": 4.343434343434344e-06,
+ "loss": 1.7749860286712646,
+ "mean_token_accuracy": 0.6015510559082031,
+ "num_tokens": 5341184.0,
+ "step": 326
+ },
+ {
+ "entropy": 1.4720325469970703,
+ "epoch": 0.6606060606060606,
+ "grad_norm": 1.9487124681472778,
+ "learning_rate": 4.341414141414142e-06,
+ "loss": 1.4983797073364258,
+ "mean_token_accuracy": 0.6537005305290222,
+ "num_tokens": 5357568.0,
+ "step": 327
+ },
+ {
+ "entropy": 1.676164150238037,
+ "epoch": 0.6626262626262627,
+ "grad_norm": 2.13053035736084,
+ "learning_rate": 4.33939393939394e-06,
+ "loss": 1.699425458908081,
+ "mean_token_accuracy": 0.6100390553474426,
+ "num_tokens": 5373952.0,
+ "step": 328
+ },
+ {
+ "entropy": 1.3424437046051025,
+ "epoch": 0.6646464646464646,
+ "grad_norm": 2.0245954990386963,
+ "learning_rate": 4.337373737373738e-06,
+ "loss": 1.3393046855926514,
+ "mean_token_accuracy": 0.677760124206543,
+ "num_tokens": 5390336.0,
+ "step": 329
+ },
+ {
+ "entropy": 1.4926583766937256,
+ "epoch": 0.6666666666666666,
+ "grad_norm": 1.893343448638916,
+ "learning_rate": 4.335353535353536e-06,
+ "loss": 1.4779269695281982,
+ "mean_token_accuracy": 0.6713483333587646,
+ "num_tokens": 5406720.0,
+ "step": 330
+ },
+ {
+ "entropy": 1.5753449201583862,
+ "epoch": 0.6686868686868687,
+ "grad_norm": 2.051647424697876,
+ "learning_rate": 4.333333333333334e-06,
+ "loss": 1.622597336769104,
+ "mean_token_accuracy": 0.6436248421669006,
+ "num_tokens": 5423104.0,
+ "step": 331
+ },
+ {
+ "entropy": 1.4573988914489746,
+ "epoch": 0.6707070707070707,
+ "grad_norm": 1.8709567785263062,
+ "learning_rate": 4.331313131313132e-06,
+ "loss": 1.4902422428131104,
+ "mean_token_accuracy": 0.6682950854301453,
+ "num_tokens": 5439488.0,
+ "step": 332
+ },
+ {
+ "entropy": 1.378867745399475,
+ "epoch": 0.6727272727272727,
+ "grad_norm": 2.235928773880005,
+ "learning_rate": 4.32929292929293e-06,
+ "loss": 1.4067103862762451,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 5455872.0,
+ "step": 333
+ },
+ {
+ "entropy": 1.7553350925445557,
+ "epoch": 0.6747474747474748,
+ "grad_norm": 2.0335066318511963,
+ "learning_rate": 4.327272727272728e-06,
+ "loss": 1.772943139076233,
+ "mean_token_accuracy": 0.5953834652900696,
+ "num_tokens": 5472256.0,
+ "step": 334
+ },
+ {
+ "entropy": 1.1587097644805908,
+ "epoch": 0.6767676767676768,
+ "grad_norm": 1.8764615058898926,
+ "learning_rate": 4.3252525252525255e-06,
+ "loss": 1.1396210193634033,
+ "mean_token_accuracy": 0.7197117805480957,
+ "num_tokens": 5488640.0,
+ "step": 335
+ },
+ {
+ "entropy": 1.4819872379302979,
+ "epoch": 0.6787878787878788,
+ "grad_norm": 2.0907511711120605,
+ "learning_rate": 4.323232323232323e-06,
+ "loss": 1.460550308227539,
+ "mean_token_accuracy": 0.6520518064498901,
+ "num_tokens": 5505024.0,
+ "step": 336
+ },
+ {
+ "entropy": 1.0744472742080688,
+ "epoch": 0.6808080808080809,
+ "grad_norm": 2.227606773376465,
+ "learning_rate": 4.321212121212121e-06,
+ "loss": 1.0909301042556763,
+ "mean_token_accuracy": 0.7258182764053345,
+ "num_tokens": 5521408.0,
+ "step": 337
+ },
+ {
+ "entropy": 1.507999300956726,
+ "epoch": 0.6828282828282828,
+ "grad_norm": 2.0332415103912354,
+ "learning_rate": 4.31919191919192e-06,
+ "loss": 1.5173046588897705,
+ "mean_token_accuracy": 0.6374572515487671,
+ "num_tokens": 5537792.0,
+ "step": 338
+ },
+ {
+ "entropy": 1.6792720556259155,
+ "epoch": 0.6848484848484848,
+ "grad_norm": 2.0194997787475586,
+ "learning_rate": 4.317171717171718e-06,
+ "loss": 1.679445743560791,
+ "mean_token_accuracy": 0.6138250827789307,
+ "num_tokens": 5554176.0,
+ "step": 339
+ },
+ {
+ "entropy": 1.6470589637756348,
+ "epoch": 0.6868686868686869,
+ "grad_norm": 2.09116268157959,
+ "learning_rate": 4.315151515151516e-06,
+ "loss": 1.6386632919311523,
+ "mean_token_accuracy": 0.6146799921989441,
+ "num_tokens": 5570560.0,
+ "step": 340
+ },
+ {
+ "entropy": 1.3612488508224487,
+ "epoch": 0.6888888888888889,
+ "grad_norm": 2.1586217880249023,
+ "learning_rate": 4.313131313131314e-06,
+ "loss": 1.3698725700378418,
+ "mean_token_accuracy": 0.6696995496749878,
+ "num_tokens": 5586944.0,
+ "step": 341
+ },
+ {
+ "entropy": 1.400327205657959,
+ "epoch": 0.6909090909090909,
+ "grad_norm": 2.082094192504883,
+ "learning_rate": 4.3111111111111115e-06,
+ "loss": 1.396535873413086,
+ "mean_token_accuracy": 0.6780654788017273,
+ "num_tokens": 5603328.0,
+ "step": 342
+ },
+ {
+ "entropy": 1.389290690422058,
+ "epoch": 0.692929292929293,
+ "grad_norm": 2.0780303478240967,
+ "learning_rate": 4.309090909090909e-06,
+ "loss": 1.4275782108306885,
+ "mean_token_accuracy": 0.6656082272529602,
+ "num_tokens": 5619712.0,
+ "step": 343
+ },
+ {
+ "entropy": 1.5133870840072632,
+ "epoch": 0.694949494949495,
+ "grad_norm": 1.9819531440734863,
+ "learning_rate": 4.307070707070707e-06,
+ "loss": 1.5309596061706543,
+ "mean_token_accuracy": 0.6373351216316223,
+ "num_tokens": 5636096.0,
+ "step": 344
+ },
+ {
+ "entropy": 1.483219861984253,
+ "epoch": 0.696969696969697,
+ "grad_norm": 1.9794325828552246,
+ "learning_rate": 4.305050505050505e-06,
+ "loss": 1.4693087339401245,
+ "mean_token_accuracy": 0.6550439596176147,
+ "num_tokens": 5652480.0,
+ "step": 345
+ },
+ {
+ "entropy": 1.381489634513855,
+ "epoch": 0.6989898989898989,
+ "grad_norm": 2.0637686252593994,
+ "learning_rate": 4.303030303030303e-06,
+ "loss": 1.3862476348876953,
+ "mean_token_accuracy": 0.6631045341491699,
+ "num_tokens": 5668864.0,
+ "step": 346
+ },
+ {
+ "entropy": 1.9860024452209473,
+ "epoch": 0.701010101010101,
+ "grad_norm": 2.1626803874969482,
+ "learning_rate": 4.301010101010101e-06,
+ "loss": 1.9815950393676758,
+ "mean_token_accuracy": 0.5698583126068115,
+ "num_tokens": 5685248.0,
+ "step": 347
+ },
+ {
+ "entropy": 1.5044004917144775,
+ "epoch": 0.703030303030303,
+ "grad_norm": 2.060976266860962,
+ "learning_rate": 4.298989898989899e-06,
+ "loss": 1.4937127828598022,
+ "mean_token_accuracy": 0.6524792313575745,
+ "num_tokens": 5701632.0,
+ "step": 348
+ },
+ {
+ "entropy": 1.3397772312164307,
+ "epoch": 0.705050505050505,
+ "grad_norm": 2.0162901878356934,
+ "learning_rate": 4.296969696969698e-06,
+ "loss": 1.3358572721481323,
+ "mean_token_accuracy": 0.6949804425239563,
+ "num_tokens": 5718016.0,
+ "step": 349
+ },
+ {
+ "entropy": 1.145772099494934,
+ "epoch": 0.7070707070707071,
+ "grad_norm": 2.097634792327881,
+ "learning_rate": 4.2949494949494955e-06,
+ "loss": 1.1833416223526,
+ "mean_token_accuracy": 0.7104909420013428,
+ "num_tokens": 5734400.0,
+ "step": 350
+ },
+ {
+ "epoch": 0.7070707070707071,
+ "eval_entropy": 1.5476290602837839,
+ "eval_loss": 1.5603480339050293,
+ "eval_mean_token_accuracy": 0.640111118555069,
+ "eval_num_tokens": 5734400.0,
+ "eval_runtime": 43.7844,
+ "eval_samples_per_second": 22.611,
+ "eval_steps_per_second": 2.832,
+ "step": 350
+ },
+ {
+ "entropy": 1.4311926364898682,
+ "epoch": 0.7090909090909091,
+ "grad_norm": 2.002321720123291,
+ "learning_rate": 4.292929292929293e-06,
+ "loss": 1.4534825086593628,
+ "mean_token_accuracy": 0.6614558100700378,
+ "num_tokens": 5750784.0,
+ "step": 351
+ },
+ {
+ "entropy": 1.3983922004699707,
+ "epoch": 0.7111111111111111,
+ "grad_norm": 2.1724867820739746,
+ "learning_rate": 4.290909090909091e-06,
+ "loss": 1.3969402313232422,
+ "mean_token_accuracy": 0.6652418375015259,
+ "num_tokens": 5767168.0,
+ "step": 352
+ },
+ {
+ "entropy": 1.8218920230865479,
+ "epoch": 0.7131313131313132,
+ "grad_norm": 2.1629281044006348,
+ "learning_rate": 4.288888888888889e-06,
+ "loss": 1.8196980953216553,
+ "mean_token_accuracy": 0.6027112603187561,
+ "num_tokens": 5783552.0,
+ "step": 353
+ },
+ {
+ "entropy": 1.5322320461273193,
+ "epoch": 0.7151515151515152,
+ "grad_norm": 1.8486647605895996,
+ "learning_rate": 4.286868686868687e-06,
+ "loss": 1.5504610538482666,
+ "mean_token_accuracy": 0.6533341407775879,
+ "num_tokens": 5799936.0,
+ "step": 354
+ },
+ {
+ "entropy": 1.935966968536377,
+ "epoch": 0.7171717171717171,
+ "grad_norm": 2.252814292907715,
+ "learning_rate": 4.284848484848485e-06,
+ "loss": 1.9300384521484375,
+ "mean_token_accuracy": 0.5656448602676392,
+ "num_tokens": 5816320.0,
+ "step": 355
+ },
+ {
+ "entropy": 1.6711398363113403,
+ "epoch": 0.7191919191919192,
+ "grad_norm": 2.023379325866699,
+ "learning_rate": 4.282828282828283e-06,
+ "loss": 1.6584455966949463,
+ "mean_token_accuracy": 0.6235954761505127,
+ "num_tokens": 5832704.0,
+ "step": 356
+ },
+ {
+ "entropy": 1.3922803401947021,
+ "epoch": 0.7212121212121212,
+ "grad_norm": 2.0487611293792725,
+ "learning_rate": 4.280808080808081e-06,
+ "loss": 1.4220250844955444,
+ "mean_token_accuracy": 0.6591963768005371,
+ "num_tokens": 5849088.0,
+ "step": 357
+ },
+ {
+ "entropy": 1.59521484375,
+ "epoch": 0.7232323232323232,
+ "grad_norm": 1.8598614931106567,
+ "learning_rate": 4.278787878787879e-06,
+ "loss": 1.5979329347610474,
+ "mean_token_accuracy": 0.6237176060676575,
+ "num_tokens": 5865472.0,
+ "step": 358
+ },
+ {
+ "entropy": 1.5810115337371826,
+ "epoch": 0.7252525252525253,
+ "grad_norm": 2.140115737915039,
+ "learning_rate": 4.276767676767677e-06,
+ "loss": 1.5774705410003662,
+ "mean_token_accuracy": 0.6274425983428955,
+ "num_tokens": 5881856.0,
+ "step": 359
+ },
+ {
+ "entropy": 1.5839109420776367,
+ "epoch": 0.7272727272727273,
+ "grad_norm": 2.0947749614715576,
+ "learning_rate": 4.274747474747475e-06,
+ "loss": 1.601511001586914,
+ "mean_token_accuracy": 0.630984365940094,
+ "num_tokens": 5898240.0,
+ "step": 360
+ },
+ {
+ "entropy": 1.195770263671875,
+ "epoch": 0.7292929292929293,
+ "grad_norm": 1.8740363121032715,
+ "learning_rate": 4.272727272727273e-06,
+ "loss": 1.195652961730957,
+ "mean_token_accuracy": 0.7077430486679077,
+ "num_tokens": 5914624.0,
+ "step": 361
+ },
+ {
+ "entropy": 1.375698208808899,
+ "epoch": 0.7313131313131314,
+ "grad_norm": 1.9580703973770142,
+ "learning_rate": 4.270707070707071e-06,
+ "loss": 1.3746864795684814,
+ "mean_token_accuracy": 0.6775158643722534,
+ "num_tokens": 5931008.0,
+ "step": 362
+ },
+ {
+ "entropy": 1.7259451150894165,
+ "epoch": 0.7333333333333333,
+ "grad_norm": 2.3127365112304688,
+ "learning_rate": 4.268686868686869e-06,
+ "loss": 1.745998501777649,
+ "mean_token_accuracy": 0.6040546894073486,
+ "num_tokens": 5947392.0,
+ "step": 363
+ },
+ {
+ "entropy": 1.209228754043579,
+ "epoch": 0.7353535353535353,
+ "grad_norm": 1.9004793167114258,
+ "learning_rate": 4.266666666666668e-06,
+ "loss": 1.232427716255188,
+ "mean_token_accuracy": 0.6925989389419556,
+ "num_tokens": 5963776.0,
+ "step": 364
+ },
+ {
+ "entropy": 1.2811263799667358,
+ "epoch": 0.7373737373737373,
+ "grad_norm": 1.9568246603012085,
+ "learning_rate": 4.2646464646464655e-06,
+ "loss": 1.291853427886963,
+ "mean_token_accuracy": 0.6884465217590332,
+ "num_tokens": 5980160.0,
+ "step": 365
+ },
+ {
+ "entropy": 1.843044638633728,
+ "epoch": 0.7393939393939394,
+ "grad_norm": 2.132735252380371,
+ "learning_rate": 4.262626262626263e-06,
+ "loss": 1.8818857669830322,
+ "mean_token_accuracy": 0.5785295367240906,
+ "num_tokens": 5996544.0,
+ "step": 366
+ },
+ {
+ "entropy": 1.3353440761566162,
+ "epoch": 0.7414141414141414,
+ "grad_norm": 1.8893013000488281,
+ "learning_rate": 4.260606060606061e-06,
+ "loss": 1.354011058807373,
+ "mean_token_accuracy": 0.6797752976417542,
+ "num_tokens": 6012928.0,
+ "step": 367
+ },
+ {
+ "entropy": 1.3889728784561157,
+ "epoch": 0.7434343434343434,
+ "grad_norm": 1.980757236480713,
+ "learning_rate": 4.258585858585859e-06,
+ "loss": 1.3671875,
+ "mean_token_accuracy": 0.6627381443977356,
+ "num_tokens": 6029312.0,
+ "step": 368
+ },
+ {
+ "entropy": 1.4605348110198975,
+ "epoch": 0.7454545454545455,
+ "grad_norm": 2.1033780574798584,
+ "learning_rate": 4.256565656565657e-06,
+ "loss": 1.455024003982544,
+ "mean_token_accuracy": 0.6451514363288879,
+ "num_tokens": 6045696.0,
+ "step": 369
+ },
+ {
+ "entropy": 1.4382058382034302,
+ "epoch": 0.7474747474747475,
+ "grad_norm": 2.1068074703216553,
+ "learning_rate": 4.254545454545455e-06,
+ "loss": 1.4422768354415894,
+ "mean_token_accuracy": 0.6630434989929199,
+ "num_tokens": 6062080.0,
+ "step": 370
+ },
+ {
+ "entropy": 1.8046759366989136,
+ "epoch": 0.7494949494949495,
+ "grad_norm": 2.214466094970703,
+ "learning_rate": 4.252525252525253e-06,
+ "loss": 1.8247106075286865,
+ "mean_token_accuracy": 0.6003297567367554,
+ "num_tokens": 6078464.0,
+ "step": 371
+ },
+ {
+ "entropy": 1.671690583229065,
+ "epoch": 0.7515151515151515,
+ "grad_norm": 1.9790785312652588,
+ "learning_rate": 4.250505050505051e-06,
+ "loss": 1.6907753944396973,
+ "mean_token_accuracy": 0.6232290863990784,
+ "num_tokens": 6094848.0,
+ "step": 372
+ },
+ {
+ "entropy": 1.6881897449493408,
+ "epoch": 0.7535353535353535,
+ "grad_norm": 1.8638463020324707,
+ "learning_rate": 4.248484848484849e-06,
+ "loss": 1.7132716178894043,
+ "mean_token_accuracy": 0.6357474327087402,
+ "num_tokens": 6111232.0,
+ "step": 373
+ },
+ {
+ "entropy": 1.2555122375488281,
+ "epoch": 0.7555555555555555,
+ "grad_norm": 2.082378387451172,
+ "learning_rate": 4.246464646464647e-06,
+ "loss": 1.240688681602478,
+ "mean_token_accuracy": 0.6965070962905884,
+ "num_tokens": 6127616.0,
+ "step": 374
+ },
+ {
+ "entropy": 1.847135305404663,
+ "epoch": 0.7575757575757576,
+ "grad_norm": 2.142962694168091,
+ "learning_rate": 4.244444444444445e-06,
+ "loss": 1.8840911388397217,
+ "mean_token_accuracy": 0.5822545289993286,
+ "num_tokens": 6144000.0,
+ "step": 375
+ },
+ {
+ "entropy": 1.239328384399414,
+ "epoch": 0.7595959595959596,
+ "grad_norm": 2.0589468479156494,
+ "learning_rate": 4.242424242424243e-06,
+ "loss": 1.256324052810669,
+ "mean_token_accuracy": 0.6845383644104004,
+ "num_tokens": 6160384.0,
+ "step": 376
+ },
+ {
+ "entropy": 1.5047202110290527,
+ "epoch": 0.7616161616161616,
+ "grad_norm": 1.7951308488845825,
+ "learning_rate": 4.240404040404041e-06,
+ "loss": 1.5063304901123047,
+ "mean_token_accuracy": 0.6583414673805237,
+ "num_tokens": 6176768.0,
+ "step": 377
+ },
+ {
+ "entropy": 1.4072566032409668,
+ "epoch": 0.7636363636363637,
+ "grad_norm": 2.1670594215393066,
+ "learning_rate": 4.238383838383839e-06,
+ "loss": 1.4205389022827148,
+ "mean_token_accuracy": 0.658707857131958,
+ "num_tokens": 6193152.0,
+ "step": 378
+ },
+ {
+ "entropy": 1.3207885026931763,
+ "epoch": 0.7656565656565657,
+ "grad_norm": 1.9017083644866943,
+ "learning_rate": 4.236363636363637e-06,
+ "loss": 1.3169896602630615,
+ "mean_token_accuracy": 0.6954079270362854,
+ "num_tokens": 6209536.0,
+ "step": 379
+ },
+ {
+ "entropy": 1.4762436151504517,
+ "epoch": 0.7676767676767676,
+ "grad_norm": 2.0023069381713867,
+ "learning_rate": 4.234343434343435e-06,
+ "loss": 1.4725041389465332,
+ "mean_token_accuracy": 0.6620053648948669,
+ "num_tokens": 6225920.0,
+ "step": 380
+ },
+ {
+ "entropy": 1.4895304441452026,
+ "epoch": 0.7696969696969697,
+ "grad_norm": 1.9528017044067383,
+ "learning_rate": 4.2323232323232325e-06,
+ "loss": 1.49650239944458,
+ "mean_token_accuracy": 0.6508915424346924,
+ "num_tokens": 6242304.0,
+ "step": 381
+ },
+ {
+ "entropy": 1.3024516105651855,
+ "epoch": 0.7717171717171717,
+ "grad_norm": 1.9855588674545288,
+ "learning_rate": 4.2303030303030304e-06,
+ "loss": 1.34218168258667,
+ "mean_token_accuracy": 0.6838055849075317,
+ "num_tokens": 6258688.0,
+ "step": 382
+ },
+ {
+ "entropy": 1.6005626916885376,
+ "epoch": 0.7737373737373737,
+ "grad_norm": 2.028286933898926,
+ "learning_rate": 4.228282828282828e-06,
+ "loss": 1.6299283504486084,
+ "mean_token_accuracy": 0.6315950155258179,
+ "num_tokens": 6275072.0,
+ "step": 383
+ },
+ {
+ "entropy": 1.7050484418869019,
+ "epoch": 0.7757575757575758,
+ "grad_norm": 2.474047899246216,
+ "learning_rate": 4.226262626262626e-06,
+ "loss": 1.777151346206665,
+ "mean_token_accuracy": 0.5919027924537659,
+ "num_tokens": 6291456.0,
+ "step": 384
+ },
+ {
+ "entropy": 1.5014543533325195,
+ "epoch": 0.7777777777777778,
+ "grad_norm": 1.9866594076156616,
+ "learning_rate": 4.224242424242425e-06,
+ "loss": 1.5308949947357178,
+ "mean_token_accuracy": 0.639106035232544,
+ "num_tokens": 6307840.0,
+ "step": 385
+ },
+ {
+ "entropy": 1.6957359313964844,
+ "epoch": 0.7797979797979798,
+ "grad_norm": 2.229820966720581,
+ "learning_rate": 4.222222222222223e-06,
+ "loss": 1.728761911392212,
+ "mean_token_accuracy": 0.6242061257362366,
+ "num_tokens": 6324224.0,
+ "step": 386
+ },
+ {
+ "entropy": 1.6823521852493286,
+ "epoch": 0.7818181818181819,
+ "grad_norm": 2.033383369445801,
+ "learning_rate": 4.220202020202021e-06,
+ "loss": 1.7310154438018799,
+ "mean_token_accuracy": 0.6257938742637634,
+ "num_tokens": 6340608.0,
+ "step": 387
+ },
+ {
+ "entropy": 1.710307240486145,
+ "epoch": 0.7838383838383839,
+ "grad_norm": 2.061861038208008,
+ "learning_rate": 4.218181818181819e-06,
+ "loss": 1.7066943645477295,
+ "mean_token_accuracy": 0.6123595237731934,
+ "num_tokens": 6356992.0,
+ "step": 388
+ },
+ {
+ "entropy": 1.241638422012329,
+ "epoch": 0.7858585858585858,
+ "grad_norm": 1.9743852615356445,
+ "learning_rate": 4.2161616161616165e-06,
+ "loss": 1.2520272731781006,
+ "mean_token_accuracy": 0.692415714263916,
+ "num_tokens": 6373376.0,
+ "step": 389
+ },
+ {
+ "entropy": 1.5918776988983154,
+ "epoch": 0.7878787878787878,
+ "grad_norm": 2.156675100326538,
+ "learning_rate": 4.214141414141414e-06,
+ "loss": 1.6060255765914917,
+ "mean_token_accuracy": 0.6178553700447083,
+ "num_tokens": 6389760.0,
+ "step": 390
+ },
+ {
+ "entropy": 1.7307862043380737,
+ "epoch": 0.7898989898989899,
+ "grad_norm": 2.171247959136963,
+ "learning_rate": 4.212121212121212e-06,
+ "loss": 1.7327581644058228,
+ "mean_token_accuracy": 0.6502808928489685,
+ "num_tokens": 6406144.0,
+ "step": 391
+ },
+ {
+ "entropy": 1.6725553274154663,
+ "epoch": 0.7919191919191919,
+ "grad_norm": 2.020228624343872,
+ "learning_rate": 4.21010101010101e-06,
+ "loss": 1.6803646087646484,
+ "mean_token_accuracy": 0.6383732557296753,
+ "num_tokens": 6422528.0,
+ "step": 392
+ },
+ {
+ "entropy": 1.4120928049087524,
+ "epoch": 0.793939393939394,
+ "grad_norm": 1.9896639585494995,
+ "learning_rate": 4.208080808080808e-06,
+ "loss": 1.3974279165267944,
+ "mean_token_accuracy": 0.6661577820777893,
+ "num_tokens": 6438912.0,
+ "step": 393
+ },
+ {
+ "entropy": 0.933545708656311,
+ "epoch": 0.795959595959596,
+ "grad_norm": 1.6884223222732544,
+ "learning_rate": 4.206060606060606e-06,
+ "loss": 0.9287986755371094,
+ "mean_token_accuracy": 0.7636175155639648,
+ "num_tokens": 6455296.0,
+ "step": 394
+ },
+ {
+ "entropy": 1.419004201889038,
+ "epoch": 0.797979797979798,
+ "grad_norm": 2.2590551376342773,
+ "learning_rate": 4.204040404040405e-06,
+ "loss": 1.4652538299560547,
+ "mean_token_accuracy": 0.6589521169662476,
+ "num_tokens": 6471680.0,
+ "step": 395
+ },
+ {
+ "entropy": 1.750221610069275,
+ "epoch": 0.8,
+ "grad_norm": 2.195030450820923,
+ "learning_rate": 4.2020202020202026e-06,
+ "loss": 1.7328863143920898,
+ "mean_token_accuracy": 0.6008182764053345,
+ "num_tokens": 6488064.0,
+ "step": 396
+ },
+ {
+ "entropy": 1.7440015077590942,
+ "epoch": 0.802020202020202,
+ "grad_norm": 1.9833927154541016,
+ "learning_rate": 4.2000000000000004e-06,
+ "loss": 1.7617835998535156,
+ "mean_token_accuracy": 0.5992916226387024,
+ "num_tokens": 6504448.0,
+ "step": 397
+ },
+ {
+ "entropy": 1.1636452674865723,
+ "epoch": 0.804040404040404,
+ "grad_norm": 1.9506802558898926,
+ "learning_rate": 4.197979797979798e-06,
+ "loss": 1.1344032287597656,
+ "mean_token_accuracy": 0.7122618556022644,
+ "num_tokens": 6520832.0,
+ "step": 398
+ },
+ {
+ "entropy": 1.6173542737960815,
+ "epoch": 0.806060606060606,
+ "grad_norm": 2.0997231006622314,
+ "learning_rate": 4.195959595959596e-06,
+ "loss": 1.6303956508636475,
+ "mean_token_accuracy": 0.6215192675590515,
+ "num_tokens": 6537216.0,
+ "step": 399
+ },
+ {
+ "entropy": 1.4391542673110962,
+ "epoch": 0.8080808080808081,
+ "grad_norm": 2.356828212738037,
+ "learning_rate": 4.193939393939394e-06,
+ "loss": 1.4465923309326172,
+ "mean_token_accuracy": 0.6594406366348267,
+ "num_tokens": 6553600.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.8080808080808081,
+ "eval_entropy": 1.5504949785047961,
+ "eval_loss": 1.5544542074203491,
+ "eval_mean_token_accuracy": 0.6409837569921247,
+ "eval_num_tokens": 6553600.0,
+ "eval_runtime": 43.7986,
+ "eval_samples_per_second": 22.603,
+ "eval_steps_per_second": 2.831,
+ "step": 400
+ },
+ {
+ "entropy": 1.60548996925354,
+ "epoch": 0.8101010101010101,
+ "grad_norm": 2.1894404888153076,
+ "learning_rate": 4.191919191919192e-06,
+ "loss": 1.6116085052490234,
+ "mean_token_accuracy": 0.6276868581771851,
+ "num_tokens": 6569984.0,
+ "step": 401
+ },
+ {
+ "entropy": 1.436041235923767,
+ "epoch": 0.8121212121212121,
+ "grad_norm": 2.1180264949798584,
+ "learning_rate": 4.18989898989899e-06,
+ "loss": 1.4203698635101318,
+ "mean_token_accuracy": 0.6554714441299438,
+ "num_tokens": 6586368.0,
+ "step": 402
+ },
+ {
+ "entropy": 1.1348106861114502,
+ "epoch": 0.8141414141414142,
+ "grad_norm": 2.0420851707458496,
+ "learning_rate": 4.187878787878788e-06,
+ "loss": 1.1424527168273926,
+ "mean_token_accuracy": 0.7154372334480286,
+ "num_tokens": 6602752.0,
+ "step": 403
+ },
+ {
+ "entropy": 1.4039727449417114,
+ "epoch": 0.8161616161616162,
+ "grad_norm": 2.148340940475464,
+ "learning_rate": 4.185858585858586e-06,
+ "loss": 1.4246132373809814,
+ "mean_token_accuracy": 0.6723864078521729,
+ "num_tokens": 6619136.0,
+ "step": 404
+ },
+ {
+ "entropy": 1.4222626686096191,
+ "epoch": 0.8181818181818182,
+ "grad_norm": 1.9436827898025513,
+ "learning_rate": 4.1838383838383835e-06,
+ "loss": 1.4235990047454834,
+ "mean_token_accuracy": 0.6759281754493713,
+ "num_tokens": 6635520.0,
+ "step": 405
+ },
+ {
+ "entropy": 1.4771310091018677,
+ "epoch": 0.8202020202020202,
+ "grad_norm": 2.0953726768493652,
+ "learning_rate": 4.181818181818182e-06,
+ "loss": 1.501934289932251,
+ "mean_token_accuracy": 0.6535173654556274,
+ "num_tokens": 6651904.0,
+ "step": 406
+ },
+ {
+ "entropy": 1.526256799697876,
+ "epoch": 0.8222222222222222,
+ "grad_norm": 2.245994806289673,
+ "learning_rate": 4.17979797979798e-06,
+ "loss": 1.539383888244629,
+ "mean_token_accuracy": 0.6417317986488342,
+ "num_tokens": 6668288.0,
+ "step": 407
+ },
+ {
+ "entropy": 1.1716097593307495,
+ "epoch": 0.8242424242424242,
+ "grad_norm": 1.8283652067184448,
+ "learning_rate": 4.177777777777778e-06,
+ "loss": 1.1798359155654907,
+ "mean_token_accuracy": 0.7123839855194092,
+ "num_tokens": 6684672.0,
+ "step": 408
+ },
+ {
+ "entropy": 1.4581540822982788,
+ "epoch": 0.8262626262626263,
+ "grad_norm": 1.9325168132781982,
+ "learning_rate": 4.175757575757576e-06,
+ "loss": 1.4526585340499878,
+ "mean_token_accuracy": 0.662432849407196,
+ "num_tokens": 6701056.0,
+ "step": 409
+ },
+ {
+ "entropy": 1.4073102474212646,
+ "epoch": 0.8282828282828283,
+ "grad_norm": 2.1543467044830322,
+ "learning_rate": 4.173737373737375e-06,
+ "loss": 1.437713861465454,
+ "mean_token_accuracy": 0.6725696325302124,
+ "num_tokens": 6717440.0,
+ "step": 410
+ },
+ {
+ "entropy": 1.5970062017440796,
+ "epoch": 0.8303030303030303,
+ "grad_norm": 2.1714792251586914,
+ "learning_rate": 4.1717171717171726e-06,
+ "loss": 1.613295078277588,
+ "mean_token_accuracy": 0.6229848265647888,
+ "num_tokens": 6733824.0,
+ "step": 411
+ },
+ {
+ "entropy": 1.449837327003479,
+ "epoch": 0.8323232323232324,
+ "grad_norm": 2.2499871253967285,
+ "learning_rate": 4.1696969696969705e-06,
+ "loss": 1.489758014678955,
+ "mean_token_accuracy": 0.645639955997467,
+ "num_tokens": 6750208.0,
+ "step": 412
+ },
+ {
+ "entropy": 1.7696173191070557,
+ "epoch": 0.8343434343434344,
+ "grad_norm": 2.3637073040008545,
+ "learning_rate": 4.167676767676768e-06,
+ "loss": 1.8147599697113037,
+ "mean_token_accuracy": 0.5821323990821838,
+ "num_tokens": 6766592.0,
+ "step": 413
+ },
+ {
+ "entropy": 1.99376380443573,
+ "epoch": 0.8363636363636363,
+ "grad_norm": 2.265683174133301,
+ "learning_rate": 4.165656565656566e-06,
+ "loss": 2.009024143218994,
+ "mean_token_accuracy": 0.5591108798980713,
+ "num_tokens": 6782976.0,
+ "step": 414
+ },
+ {
+ "entropy": 1.7276980876922607,
+ "epoch": 0.8383838383838383,
+ "grad_norm": 1.9407477378845215,
+ "learning_rate": 4.163636363636364e-06,
+ "loss": 1.7130229473114014,
+ "mean_token_accuracy": 0.6202979683876038,
+ "num_tokens": 6799360.0,
+ "step": 415
+ },
+ {
+ "entropy": 1.5418223142623901,
+ "epoch": 0.8404040404040404,
+ "grad_norm": 1.9765743017196655,
+ "learning_rate": 4.161616161616162e-06,
+ "loss": 1.5627632141113281,
+ "mean_token_accuracy": 0.6433194875717163,
+ "num_tokens": 6815744.0,
+ "step": 416
+ },
+ {
+ "entropy": 1.6040345430374146,
+ "epoch": 0.8424242424242424,
+ "grad_norm": 2.1942877769470215,
+ "learning_rate": 4.15959595959596e-06,
+ "loss": 1.6044622659683228,
+ "mean_token_accuracy": 0.6278700828552246,
+ "num_tokens": 6832128.0,
+ "step": 417
+ },
+ {
+ "entropy": 1.8461577892303467,
+ "epoch": 0.8444444444444444,
+ "grad_norm": 2.289196729660034,
+ "learning_rate": 4.157575757575758e-06,
+ "loss": 1.8679372072219849,
+ "mean_token_accuracy": 0.5887884497642517,
+ "num_tokens": 6848512.0,
+ "step": 418
+ },
+ {
+ "entropy": 1.4079350233078003,
+ "epoch": 0.8464646464646465,
+ "grad_norm": 1.9526047706604004,
+ "learning_rate": 4.155555555555556e-06,
+ "loss": 1.4145114421844482,
+ "mean_token_accuracy": 0.6731802821159363,
+ "num_tokens": 6864896.0,
+ "step": 419
+ },
+ {
+ "entropy": 1.1973973512649536,
+ "epoch": 0.8484848484848485,
+ "grad_norm": 2.0716679096221924,
+ "learning_rate": 4.1535353535353536e-06,
+ "loss": 1.260810136795044,
+ "mean_token_accuracy": 0.701697587966919,
+ "num_tokens": 6881280.0,
+ "step": 420
+ },
+ {
+ "entropy": 1.507702350616455,
+ "epoch": 0.8505050505050505,
+ "grad_norm": 2.0233314037323,
+ "learning_rate": 4.151515151515152e-06,
+ "loss": 1.513720154762268,
+ "mean_token_accuracy": 0.6497313380241394,
+ "num_tokens": 6897664.0,
+ "step": 421
+ },
+ {
+ "entropy": 1.54402756690979,
+ "epoch": 0.8525252525252526,
+ "grad_norm": 2.23366379737854,
+ "learning_rate": 4.14949494949495e-06,
+ "loss": 1.5434964895248413,
+ "mean_token_accuracy": 0.6502198576927185,
+ "num_tokens": 6914048.0,
+ "step": 422
+ },
+ {
+ "entropy": 1.820296049118042,
+ "epoch": 0.8545454545454545,
+ "grad_norm": 2.066905975341797,
+ "learning_rate": 4.147474747474748e-06,
+ "loss": 1.8356924057006836,
+ "mean_token_accuracy": 0.5886663198471069,
+ "num_tokens": 6930432.0,
+ "step": 423
+ },
+ {
+ "entropy": 1.4747720956802368,
+ "epoch": 0.8565656565656565,
+ "grad_norm": 2.040022850036621,
+ "learning_rate": 4.145454545454546e-06,
+ "loss": 1.4495999813079834,
+ "mean_token_accuracy": 0.6532731056213379,
+ "num_tokens": 6946816.0,
+ "step": 424
+ },
+ {
+ "entropy": 1.7536696195602417,
+ "epoch": 0.8585858585858586,
+ "grad_norm": 2.0884320735931396,
+ "learning_rate": 4.143434343434344e-06,
+ "loss": 1.7520158290863037,
+ "mean_token_accuracy": 0.6083903312683105,
+ "num_tokens": 6963200.0,
+ "step": 425
+ },
+ {
+ "entropy": 1.715582251548767,
+ "epoch": 0.8606060606060606,
+ "grad_norm": 2.2991514205932617,
+ "learning_rate": 4.141414141414142e-06,
+ "loss": 1.7138090133666992,
+ "mean_token_accuracy": 0.607107937335968,
+ "num_tokens": 6979584.0,
+ "step": 426
+ },
+ {
+ "entropy": 1.8116382360458374,
+ "epoch": 0.8626262626262626,
+ "grad_norm": 2.289909839630127,
+ "learning_rate": 4.13939393939394e-06,
+ "loss": 1.7755894660949707,
+ "mean_token_accuracy": 0.5776746273040771,
+ "num_tokens": 6995968.0,
+ "step": 427
+ },
+ {
+ "entropy": 1.487213373184204,
+ "epoch": 0.8646464646464647,
+ "grad_norm": 1.8834803104400635,
+ "learning_rate": 4.1373737373737375e-06,
+ "loss": 1.511157751083374,
+ "mean_token_accuracy": 0.6546165347099304,
+ "num_tokens": 7012352.0,
+ "step": 428
+ },
+ {
+ "entropy": 1.2769891023635864,
+ "epoch": 0.8666666666666667,
+ "grad_norm": 1.892616629600525,
+ "learning_rate": 4.135353535353535e-06,
+ "loss": 1.2772598266601562,
+ "mean_token_accuracy": 0.6984611749649048,
+ "num_tokens": 7028736.0,
+ "step": 429
+ },
+ {
+ "entropy": 1.579519271850586,
+ "epoch": 0.8686868686868687,
+ "grad_norm": 1.9801563024520874,
+ "learning_rate": 4.133333333333333e-06,
+ "loss": 1.5647528171539307,
+ "mean_token_accuracy": 0.6482046842575073,
+ "num_tokens": 7045120.0,
+ "step": 430
+ },
+ {
+ "entropy": 1.407600998878479,
+ "epoch": 0.8707070707070707,
+ "grad_norm": 2.1737446784973145,
+ "learning_rate": 4.131313131313132e-06,
+ "loss": 1.4184494018554688,
+ "mean_token_accuracy": 0.6640815734863281,
+ "num_tokens": 7061504.0,
+ "step": 431
+ },
+ {
+ "entropy": 1.9118441343307495,
+ "epoch": 0.8727272727272727,
+ "grad_norm": 1.9541205167770386,
+ "learning_rate": 4.12929292929293e-06,
+ "loss": 1.9581422805786133,
+ "mean_token_accuracy": 0.564667820930481,
+ "num_tokens": 7077888.0,
+ "step": 432
+ },
+ {
+ "entropy": 1.925604224205017,
+ "epoch": 0.8747474747474747,
+ "grad_norm": 1.9696223735809326,
+ "learning_rate": 4.127272727272728e-06,
+ "loss": 1.9226163625717163,
+ "mean_token_accuracy": 0.5870786309242249,
+ "num_tokens": 7094272.0,
+ "step": 433
+ },
+ {
+ "entropy": 1.3994735479354858,
+ "epoch": 0.8767676767676768,
+ "grad_norm": 2.003532886505127,
+ "learning_rate": 4.125252525252526e-06,
+ "loss": 1.4291752576828003,
+ "mean_token_accuracy": 0.669516384601593,
+ "num_tokens": 7110656.0,
+ "step": 434
+ },
+ {
+ "entropy": 1.5550929307937622,
+ "epoch": 0.8787878787878788,
+ "grad_norm": 2.2658586502075195,
+ "learning_rate": 4.1232323232323236e-06,
+ "loss": 1.5533335208892822,
+ "mean_token_accuracy": 0.6242672204971313,
+ "num_tokens": 7127040.0,
+ "step": 435
+ },
+ {
+ "entropy": 1.6622785329818726,
+ "epoch": 0.8808080808080808,
+ "grad_norm": 2.0748393535614014,
+ "learning_rate": 4.1212121212121215e-06,
+ "loss": 1.700000524520874,
+ "mean_token_accuracy": 0.6221299171447754,
+ "num_tokens": 7143424.0,
+ "step": 436
+ },
+ {
+ "entropy": 1.1223996877670288,
+ "epoch": 0.8828282828282829,
+ "grad_norm": 2.0348756313323975,
+ "learning_rate": 4.119191919191919e-06,
+ "loss": 1.143293857574463,
+ "mean_token_accuracy": 0.7045676708221436,
+ "num_tokens": 7159808.0,
+ "step": 437
+ },
+ {
+ "entropy": 1.7156380414962769,
+ "epoch": 0.8848484848484849,
+ "grad_norm": 2.306549549102783,
+ "learning_rate": 4.117171717171717e-06,
+ "loss": 1.7625794410705566,
+ "mean_token_accuracy": 0.6049706935882568,
+ "num_tokens": 7176192.0,
+ "step": 438
+ },
+ {
+ "entropy": 1.8507202863693237,
+ "epoch": 0.8868686868686869,
+ "grad_norm": 2.2955853939056396,
+ "learning_rate": 4.115151515151515e-06,
+ "loss": 1.8923052549362183,
+ "mean_token_accuracy": 0.5938568711280823,
+ "num_tokens": 7192576.0,
+ "step": 439
+ },
+ {
+ "entropy": 1.813754916191101,
+ "epoch": 0.8888888888888888,
+ "grad_norm": 2.095700263977051,
+ "learning_rate": 4.113131313131313e-06,
+ "loss": 1.8375307321548462,
+ "mean_token_accuracy": 0.5848192572593689,
+ "num_tokens": 7208960.0,
+ "step": 440
+ },
+ {
+ "entropy": 1.4185007810592651,
+ "epoch": 0.8909090909090909,
+ "grad_norm": 2.118213176727295,
+ "learning_rate": 4.111111111111111e-06,
+ "loss": 1.4548171758651733,
+ "mean_token_accuracy": 0.657608687877655,
+ "num_tokens": 7225344.0,
+ "step": 441
+ },
+ {
+ "entropy": 1.1041690111160278,
+ "epoch": 0.8929292929292929,
+ "grad_norm": 1.9638988971710205,
+ "learning_rate": 4.10909090909091e-06,
+ "loss": 1.1232322454452515,
+ "mean_token_accuracy": 0.7068881392478943,
+ "num_tokens": 7241728.0,
+ "step": 442
+ },
+ {
+ "entropy": 1.6423180103302002,
+ "epoch": 0.8949494949494949,
+ "grad_norm": 2.32987117767334,
+ "learning_rate": 4.1070707070707075e-06,
+ "loss": 1.665462613105774,
+ "mean_token_accuracy": 0.6133365631103516,
+ "num_tokens": 7258112.0,
+ "step": 443
+ },
+ {
+ "entropy": 1.4778310060501099,
+ "epoch": 0.896969696969697,
+ "grad_norm": 2.1247661113739014,
+ "learning_rate": 4.105050505050505e-06,
+ "loss": 1.4554922580718994,
+ "mean_token_accuracy": 0.6474108695983887,
+ "num_tokens": 7274496.0,
+ "step": 444
+ },
+ {
+ "entropy": 1.3777755498886108,
+ "epoch": 0.898989898989899,
+ "grad_norm": 1.9243263006210327,
+ "learning_rate": 4.103030303030303e-06,
+ "loss": 1.3942883014678955,
+ "mean_token_accuracy": 0.6656692624092102,
+ "num_tokens": 7290880.0,
+ "step": 445
+ },
+ {
+ "entropy": 1.1036415100097656,
+ "epoch": 0.901010101010101,
+ "grad_norm": 1.9711178541183472,
+ "learning_rate": 4.101010101010101e-06,
+ "loss": 1.1070351600646973,
+ "mean_token_accuracy": 0.7213605046272278,
+ "num_tokens": 7307264.0,
+ "step": 446
+ },
+ {
+ "entropy": 1.695487380027771,
+ "epoch": 0.9030303030303031,
+ "grad_norm": 2.1113150119781494,
+ "learning_rate": 4.098989898989899e-06,
+ "loss": 1.6993653774261475,
+ "mean_token_accuracy": 0.5992305874824524,
+ "num_tokens": 7323648.0,
+ "step": 447
+ },
+ {
+ "entropy": 1.496254801750183,
+ "epoch": 0.9050505050505051,
+ "grad_norm": 2.072986602783203,
+ "learning_rate": 4.096969696969697e-06,
+ "loss": 1.5046567916870117,
+ "mean_token_accuracy": 0.6558378338813782,
+ "num_tokens": 7340032.0,
+ "step": 448
+ },
+ {
+ "entropy": 2.1845033168792725,
+ "epoch": 0.907070707070707,
+ "grad_norm": 2.3246262073516846,
+ "learning_rate": 4.094949494949495e-06,
+ "loss": 2.1508708000183105,
+ "mean_token_accuracy": 0.5376160144805908,
+ "num_tokens": 7356416.0,
+ "step": 449
+ },
+ {
+ "entropy": 1.6329164505004883,
+ "epoch": 0.9090909090909091,
+ "grad_norm": 1.997310757637024,
+ "learning_rate": 4.092929292929294e-06,
+ "loss": 1.6422264575958252,
+ "mean_token_accuracy": 0.6232290863990784,
+ "num_tokens": 7372800.0,
+ "step": 450
+ },
+ {
+ "epoch": 0.9090909090909091,
+ "eval_entropy": 1.5515337480652718,
+ "eval_loss": 1.5485161542892456,
+ "eval_mean_token_accuracy": 0.6417716929028111,
+ "eval_num_tokens": 7372800.0,
+ "eval_runtime": 43.7901,
+ "eval_samples_per_second": 22.608,
+ "eval_steps_per_second": 2.832,
+ "step": 450
+ },
+ {
+ "entropy": 1.7854291200637817,
+ "epoch": 0.9111111111111111,
+ "grad_norm": 2.0212173461914062,
+ "learning_rate": 4.0909090909090915e-06,
+ "loss": 1.7920666933059692,
+ "mean_token_accuracy": 0.5950170755386353,
+ "num_tokens": 7389184.0,
+ "step": 451
+ },
+ {
+ "entropy": 1.216304898262024,
+ "epoch": 0.9131313131313131,
+ "grad_norm": 1.8800705671310425,
+ "learning_rate": 4.088888888888889e-06,
+ "loss": 1.2014267444610596,
+ "mean_token_accuracy": 0.7076819539070129,
+ "num_tokens": 7405568.0,
+ "step": 452
+ },
+ {
+ "entropy": 1.5593703985214233,
+ "epoch": 0.9151515151515152,
+ "grad_norm": 2.101381301879883,
+ "learning_rate": 4.086868686868687e-06,
+ "loss": 1.559610366821289,
+ "mean_token_accuracy": 0.6337933540344238,
+ "num_tokens": 7421952.0,
+ "step": 453
+ },
+ {
+ "entropy": 1.4199841022491455,
+ "epoch": 0.9171717171717172,
+ "grad_norm": 2.0038692951202393,
+ "learning_rate": 4.084848484848485e-06,
+ "loss": 1.4040653705596924,
+ "mean_token_accuracy": 0.660845160484314,
+ "num_tokens": 7438336.0,
+ "step": 454
+ },
+ {
+ "entropy": 1.2010453939437866,
+ "epoch": 0.9191919191919192,
+ "grad_norm": 2.004110336303711,
+ "learning_rate": 4.082828282828283e-06,
+ "loss": 1.194115400314331,
+ "mean_token_accuracy": 0.6955910921096802,
+ "num_tokens": 7454720.0,
+ "step": 455
+ },
+ {
+ "entropy": 1.2295804023742676,
+ "epoch": 0.9212121212121213,
+ "grad_norm": 2.130387544631958,
+ "learning_rate": 4.080808080808081e-06,
+ "loss": 1.2125787734985352,
+ "mean_token_accuracy": 0.6993771195411682,
+ "num_tokens": 7471104.0,
+ "step": 456
+ },
+ {
+ "entropy": 1.3706485033035278,
+ "epoch": 0.9232323232323232,
+ "grad_norm": 2.1667706966400146,
+ "learning_rate": 4.07878787878788e-06,
+ "loss": 1.3886957168579102,
+ "mean_token_accuracy": 0.6686614751815796,
+ "num_tokens": 7487488.0,
+ "step": 457
+ },
+ {
+ "entropy": 1.714059591293335,
+ "epoch": 0.9252525252525252,
+ "grad_norm": 2.0084264278411865,
+ "learning_rate": 4.0767676767676775e-06,
+ "loss": 1.724153757095337,
+ "mean_token_accuracy": 0.602161705493927,
+ "num_tokens": 7503872.0,
+ "step": 458
+ },
+ {
+ "entropy": 1.3170617818832397,
+ "epoch": 0.9272727272727272,
+ "grad_norm": 1.9923994541168213,
+ "learning_rate": 4.0747474747474754e-06,
+ "loss": 1.3518096208572388,
+ "mean_token_accuracy": 0.6801416873931885,
+ "num_tokens": 7520256.0,
+ "step": 459
+ },
+ {
+ "entropy": 1.7946380376815796,
+ "epoch": 0.9292929292929293,
+ "grad_norm": 2.3475260734558105,
+ "learning_rate": 4.072727272727273e-06,
+ "loss": 1.824514389038086,
+ "mean_token_accuracy": 0.6005740165710449,
+ "num_tokens": 7536640.0,
+ "step": 460
+ },
+ {
+ "entropy": 1.3695449829101562,
+ "epoch": 0.9313131313131313,
+ "grad_norm": 2.0983943939208984,
+ "learning_rate": 4.070707070707071e-06,
+ "loss": 1.3934273719787598,
+ "mean_token_accuracy": 0.6723253726959229,
+ "num_tokens": 7553024.0,
+ "step": 461
+ },
+ {
+ "entropy": 1.5890663862228394,
+ "epoch": 0.9333333333333333,
+ "grad_norm": 2.1465413570404053,
+ "learning_rate": 4.068686868686869e-06,
+ "loss": 1.611652135848999,
+ "mean_token_accuracy": 0.6408158540725708,
+ "num_tokens": 7569408.0,
+ "step": 462
+ },
+ {
+ "entropy": 1.2593727111816406,
+ "epoch": 0.9353535353535354,
+ "grad_norm": 1.7885241508483887,
+ "learning_rate": 4.066666666666667e-06,
+ "loss": 1.2781705856323242,
+ "mean_token_accuracy": 0.6946751475334167,
+ "num_tokens": 7585792.0,
+ "step": 463
+ },
+ {
+ "entropy": 1.5680429935455322,
+ "epoch": 0.9373737373737374,
+ "grad_norm": 2.1466636657714844,
+ "learning_rate": 4.064646464646465e-06,
+ "loss": 1.60218346118927,
+ "mean_token_accuracy": 0.6334269642829895,
+ "num_tokens": 7602176.0,
+ "step": 464
+ },
+ {
+ "entropy": 1.681670069694519,
+ "epoch": 0.9393939393939394,
+ "grad_norm": 2.2211875915527344,
+ "learning_rate": 4.062626262626263e-06,
+ "loss": 1.6819908618927002,
+ "mean_token_accuracy": 0.6177943348884583,
+ "num_tokens": 7618560.0,
+ "step": 465
+ },
+ {
+ "entropy": 1.2239924669265747,
+ "epoch": 0.9414141414141414,
+ "grad_norm": 1.9997022151947021,
+ "learning_rate": 4.060606060606061e-06,
+ "loss": 1.2383348941802979,
+ "mean_token_accuracy": 0.6922325491905212,
+ "num_tokens": 7634944.0,
+ "step": 466
+ },
+ {
+ "entropy": 1.291772723197937,
+ "epoch": 0.9434343434343434,
+ "grad_norm": 2.0868117809295654,
+ "learning_rate": 4.058585858585859e-06,
+ "loss": 1.2879221439361572,
+ "mean_token_accuracy": 0.6883854269981384,
+ "num_tokens": 7651328.0,
+ "step": 467
+ },
+ {
+ "entropy": 1.2860186100006104,
+ "epoch": 0.9454545454545454,
+ "grad_norm": 1.8586393594741821,
+ "learning_rate": 4.056565656565657e-06,
+ "loss": 1.2820203304290771,
+ "mean_token_accuracy": 0.6802638173103333,
+ "num_tokens": 7667712.0,
+ "step": 468
+ },
+ {
+ "entropy": 1.860795259475708,
+ "epoch": 0.9474747474747475,
+ "grad_norm": 2.364405393600464,
+ "learning_rate": 4.054545454545455e-06,
+ "loss": 1.8880727291107178,
+ "mean_token_accuracy": 0.5821323990821838,
+ "num_tokens": 7684096.0,
+ "step": 469
+ },
+ {
+ "entropy": 1.6017589569091797,
+ "epoch": 0.9494949494949495,
+ "grad_norm": 2.023054599761963,
+ "learning_rate": 4.052525252525253e-06,
+ "loss": 1.5993852615356445,
+ "mean_token_accuracy": 0.6366634368896484,
+ "num_tokens": 7700480.0,
+ "step": 470
+ },
+ {
+ "entropy": 1.8498003482818604,
+ "epoch": 0.9515151515151515,
+ "grad_norm": 2.4474003314971924,
+ "learning_rate": 4.050505050505051e-06,
+ "loss": 1.868700623512268,
+ "mean_token_accuracy": 0.5826209187507629,
+ "num_tokens": 7716864.0,
+ "step": 471
+ },
+ {
+ "entropy": 1.5625540018081665,
+ "epoch": 0.9535353535353536,
+ "grad_norm": 2.1018362045288086,
+ "learning_rate": 4.048484848484849e-06,
+ "loss": 1.571077585220337,
+ "mean_token_accuracy": 0.6433805823326111,
+ "num_tokens": 7733248.0,
+ "step": 472
+ },
+ {
+ "entropy": 1.8534579277038574,
+ "epoch": 0.9555555555555556,
+ "grad_norm": 2.407588243484497,
+ "learning_rate": 4.046464646464647e-06,
+ "loss": 1.8789153099060059,
+ "mean_token_accuracy": 0.5859794616699219,
+ "num_tokens": 7749632.0,
+ "step": 473
+ },
+ {
+ "entropy": 1.3264559507369995,
+ "epoch": 0.9575757575757575,
+ "grad_norm": 2.007199764251709,
+ "learning_rate": 4.044444444444445e-06,
+ "loss": 1.3489338159561157,
+ "mean_token_accuracy": 0.6650586128234863,
+ "num_tokens": 7766016.0,
+ "step": 474
+ },
+ {
+ "entropy": 1.1361761093139648,
+ "epoch": 0.9595959595959596,
+ "grad_norm": 1.9226998090744019,
+ "learning_rate": 4.0424242424242425e-06,
+ "loss": 1.156738519668579,
+ "mean_token_accuracy": 0.7226428985595703,
+ "num_tokens": 7782400.0,
+ "step": 475
+ },
+ {
+ "entropy": 1.550872802734375,
+ "epoch": 0.9616161616161616,
+ "grad_norm": 2.0082473754882812,
+ "learning_rate": 4.04040404040404e-06,
+ "loss": 1.5657379627227783,
+ "mean_token_accuracy": 0.642953097820282,
+ "num_tokens": 7798784.0,
+ "step": 476
+ },
+ {
+ "entropy": 1.0122721195220947,
+ "epoch": 0.9636363636363636,
+ "grad_norm": 1.9946776628494263,
+ "learning_rate": 4.038383838383838e-06,
+ "loss": 1.0301119089126587,
+ "mean_token_accuracy": 0.7361993193626404,
+ "num_tokens": 7815168.0,
+ "step": 477
+ },
+ {
+ "entropy": 1.61614990234375,
+ "epoch": 0.9656565656565657,
+ "grad_norm": 2.5009427070617676,
+ "learning_rate": 4.036363636363637e-06,
+ "loss": 1.6194994449615479,
+ "mean_token_accuracy": 0.620175838470459,
+ "num_tokens": 7831552.0,
+ "step": 478
+ },
+ {
+ "entropy": 1.5723443031311035,
+ "epoch": 0.9676767676767677,
+ "grad_norm": 1.9101917743682861,
+ "learning_rate": 4.034343434343435e-06,
+ "loss": 1.5586073398590088,
+ "mean_token_accuracy": 0.6223741769790649,
+ "num_tokens": 7847936.0,
+ "step": 479
+ },
+ {
+ "entropy": 1.271834373474121,
+ "epoch": 0.9696969696969697,
+ "grad_norm": 1.768438458442688,
+ "learning_rate": 4.032323232323233e-06,
+ "loss": 1.2466087341308594,
+ "mean_token_accuracy": 0.692354679107666,
+ "num_tokens": 7864320.0,
+ "step": 480
+ },
+ {
+ "entropy": 1.4550020694732666,
+ "epoch": 0.9717171717171718,
+ "grad_norm": 1.9753917455673218,
+ "learning_rate": 4.030303030303031e-06,
+ "loss": 1.4689980745315552,
+ "mean_token_accuracy": 0.6530288457870483,
+ "num_tokens": 7880704.0,
+ "step": 481
+ },
+ {
+ "entropy": 2.023750066757202,
+ "epoch": 0.9737373737373738,
+ "grad_norm": 2.3014674186706543,
+ "learning_rate": 4.0282828282828285e-06,
+ "loss": 2.0601019859313965,
+ "mean_token_accuracy": 0.5528212189674377,
+ "num_tokens": 7897088.0,
+ "step": 482
+ },
+ {
+ "entropy": 1.3225218057632446,
+ "epoch": 0.9757575757575757,
+ "grad_norm": 1.9937688112258911,
+ "learning_rate": 4.0262626262626264e-06,
+ "loss": 1.3186583518981934,
+ "mean_token_accuracy": 0.6751343607902527,
+ "num_tokens": 7913472.0,
+ "step": 483
+ },
+ {
+ "entropy": 1.4357911348342896,
+ "epoch": 0.9777777777777777,
+ "grad_norm": 1.9591492414474487,
+ "learning_rate": 4.024242424242424e-06,
+ "loss": 1.4157384634017944,
+ "mean_token_accuracy": 0.6618832349777222,
+ "num_tokens": 7929856.0,
+ "step": 484
+ },
+ {
+ "entropy": 1.470274567604065,
+ "epoch": 0.9797979797979798,
+ "grad_norm": 1.9318779706954956,
+ "learning_rate": 4.022222222222222e-06,
+ "loss": 1.4754853248596191,
+ "mean_token_accuracy": 0.6497923731803894,
+ "num_tokens": 7946240.0,
+ "step": 485
+ },
+ {
+ "entropy": 1.345750331878662,
+ "epoch": 0.9818181818181818,
+ "grad_norm": 1.9079619646072388,
+ "learning_rate": 4.02020202020202e-06,
+ "loss": 1.336526870727539,
+ "mean_token_accuracy": 0.6800805926322937,
+ "num_tokens": 7962624.0,
+ "step": 486
+ },
+ {
+ "entropy": 1.4641839265823364,
+ "epoch": 0.9838383838383838,
+ "grad_norm": 1.8413265943527222,
+ "learning_rate": 4.018181818181818e-06,
+ "loss": 1.4556326866149902,
+ "mean_token_accuracy": 0.6591963768005371,
+ "num_tokens": 7979008.0,
+ "step": 487
+ },
+ {
+ "entropy": 1.7966911792755127,
+ "epoch": 0.9858585858585859,
+ "grad_norm": 2.138899564743042,
+ "learning_rate": 4.016161616161616e-06,
+ "loss": 1.822898507118225,
+ "mean_token_accuracy": 0.5959941148757935,
+ "num_tokens": 7995392.0,
+ "step": 488
+ },
+ {
+ "entropy": 1.4334503412246704,
+ "epoch": 0.9878787878787879,
+ "grad_norm": 2.206122636795044,
+ "learning_rate": 4.014141414141415e-06,
+ "loss": 1.4127681255340576,
+ "mean_token_accuracy": 0.6609672904014587,
+ "num_tokens": 8011776.0,
+ "step": 489
+ },
+ {
+ "entropy": 1.684112548828125,
+ "epoch": 0.98989898989899,
+ "grad_norm": 2.0637400150299072,
+ "learning_rate": 4.0121212121212125e-06,
+ "loss": 1.6790317296981812,
+ "mean_token_accuracy": 0.6159012913703918,
+ "num_tokens": 8028160.0,
+ "step": 490
+ },
+ {
+ "entropy": 2.0716898441314697,
+ "epoch": 0.9919191919191919,
+ "grad_norm": 3.3912627696990967,
+ "learning_rate": 4.01010101010101e-06,
+ "loss": 2.0814826488494873,
+ "mean_token_accuracy": 0.5522105693817139,
+ "num_tokens": 8044544.0,
+ "step": 491
+ },
+ {
+ "entropy": 1.8764609098434448,
+ "epoch": 0.9939393939393939,
+ "grad_norm": 2.00569748878479,
+ "learning_rate": 4.008080808080808e-06,
+ "loss": 1.9150068759918213,
+ "mean_token_accuracy": 0.5823766589164734,
+ "num_tokens": 8060928.0,
+ "step": 492
+ },
+ {
+ "entropy": 1.630242943763733,
+ "epoch": 0.9959595959595959,
+ "grad_norm": 2.0648858547210693,
+ "learning_rate": 4.006060606060607e-06,
+ "loss": 1.6354784965515137,
+ "mean_token_accuracy": 0.621213972568512,
+ "num_tokens": 8077312.0,
+ "step": 493
+ },
+ {
+ "entropy": 1.7174078226089478,
+ "epoch": 0.997979797979798,
+ "grad_norm": 2.1376583576202393,
+ "learning_rate": 4.004040404040405e-06,
+ "loss": 1.7092773914337158,
+ "mean_token_accuracy": 0.6129701733589172,
+ "num_tokens": 8093696.0,
+ "step": 494
+ },
+ {
+ "entropy": 1.2112717628479004,
+ "epoch": 1.0,
+ "grad_norm": 1.9164371490478516,
+ "learning_rate": 4.002020202020203e-06,
+ "loss": 1.2106354236602783,
+ "mean_token_accuracy": 0.7040180563926697,
+ "num_tokens": 8110080.0,
+ "step": 495
+ },
+ {
+ "entropy": 1.2168891429901123,
+ "epoch": 1.002020202020202,
+ "grad_norm": 1.9845075607299805,
+ "learning_rate": 4.000000000000001e-06,
+ "loss": 1.1398870944976807,
+ "mean_token_accuracy": 0.7053004503250122,
+ "num_tokens": 8126464.0,
+ "step": 496
+ },
+ {
+ "entropy": 1.4670923948287964,
+ "epoch": 1.004040404040404,
+ "grad_norm": 2.0864014625549316,
+ "learning_rate": 3.9979797979797986e-06,
+ "loss": 1.4241242408752441,
+ "mean_token_accuracy": 0.6605398058891296,
+ "num_tokens": 8142848.0,
+ "step": 497
+ },
+ {
+ "entropy": 1.560593843460083,
+ "epoch": 1.006060606060606,
+ "grad_norm": 1.8882137537002563,
+ "learning_rate": 3.9959595959595964e-06,
+ "loss": 1.5164835453033447,
+ "mean_token_accuracy": 0.6610894203186035,
+ "num_tokens": 8159232.0,
+ "step": 498
+ },
+ {
+ "entropy": 1.2573609352111816,
+ "epoch": 1.0080808080808081,
+ "grad_norm": 2.011486530303955,
+ "learning_rate": 3.993939393939394e-06,
+ "loss": 1.2119636535644531,
+ "mean_token_accuracy": 0.6832559704780579,
+ "num_tokens": 8175616.0,
+ "step": 499
+ },
+ {
+ "entropy": 1.6119122505187988,
+ "epoch": 1.0101010101010102,
+ "grad_norm": 2.0089032649993896,
+ "learning_rate": 3.991919191919192e-06,
+ "loss": 1.5869622230529785,
+ "mean_token_accuracy": 0.6301905512809753,
+ "num_tokens": 8192000.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.0101010101010102,
+ "eval_entropy": 1.4907484121860997,
+ "eval_loss": 1.5444872379302979,
+ "eval_mean_token_accuracy": 0.6426531960887294,
+ "eval_num_tokens": 8192000.0,
+ "eval_runtime": 43.729,
+ "eval_samples_per_second": 22.639,
+ "eval_steps_per_second": 2.836,
+ "step": 500
+ }
+ ],
+ "logging_steps": 1,
+ "max_steps": 2475,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 5,
+ "save_steps": 500,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 6.9275322679296e+16,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/training_args.bin b/qwen3-1.7b-teutonic-5e6/checkpoint-500/training_args.bin
new file mode 100644
index 0000000000000000000000000000000000000000..37649d4bae96a1df88666daf20b4e5b6e092d976
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/training_args.bin
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:58bbcabfe99a1cf24f2e76aab66b507c2b720d9271dc9f17c8208d741a9c3a65
+size 7121
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/zero_to_fp32.py b/qwen3-1.7b-teutonic-5e6/checkpoint-500/zero_to_fp32.py
new file mode 100644
index 0000000000000000000000000000000000000000..3970548c400fd4361bd923b763db90e963ddaf8c
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/zero_to_fp32.py
@@ -0,0 +1,854 @@
+#!/usr/bin/env python
+
+# Copyright (c) Microsoft Corporation.
+# SPDX-License-Identifier: Apache-2.0
+
+# DeepSpeed Team
+
+# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets
+# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in
+# the future. Once extracted, the weights don't require DeepSpeed and can be used in any
+# application.
+#
+# example:
+# python zero_to_fp32.py . output_dir/
+# or
+# python zero_to_fp32.py . output_dir/ --safe_serialization
+
+import argparse
+import torch
+import glob
+import math
+import os
+import re
+import gc
+import json
+import numpy as np
+from tqdm import tqdm
+from collections import OrderedDict
+from dataclasses import dataclass
+
+# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with
+# DeepSpeed data structures it has to be available in the current python environment.
+from deepspeed.utils import logger
+from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS,
+ FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES,
+ FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS, AUTOEP_LAYERS_KEY,
+ AUTOEP_LAYERS_KEY_LEGACY, AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY,
+ AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT, PARAM_ALIGNMENT_PADDINGS)
+
+
+@dataclass
+class zero_model_state:
+ buffers: dict()
+ param_shapes: dict()
+ shared_params: list
+ ds_version: int
+ frozen_param_shapes: dict()
+ frozen_param_fragments: dict()
+
+
+debug = 0
+
+# load to cpu
+device = torch.device('cpu')
+
+OUTPUT_DTYPE_NAMES = {
+ 'float32': torch.float32,
+ 'fp32': torch.float32,
+ 'float16': torch.float16,
+ 'fp16': torch.float16,
+ 'bfloat16': torch.bfloat16,
+ 'bf16': torch.bfloat16,
+}
+
+
+def _resolve_output_dtype(dtype):
+ requested_dtype = dtype
+ if isinstance(dtype, str):
+ dtype_name = dtype[6:] if dtype.startswith('torch.') else dtype
+ dtype = OUTPUT_DTYPE_NAMES.get(dtype_name.lower())
+ if dtype not in set(OUTPUT_DTYPE_NAMES.values()):
+ supported = ', '.join(sorted(OUTPUT_DTYPE_NAMES))
+ raise ValueError(f"Unsupported output dtype {requested_dtype!r}. Choose one of: {supported}")
+ return dtype
+
+
+def atoi(text):
+ return int(text) if text.isdigit() else text
+
+
+def natural_keys(text):
+ '''
+ alist.sort(key=natural_keys) sorts in human order
+ http://nedbatchelder.com/blog/200712/human_sorting.html
+ (See Toothy's implementation in the comments)
+ '''
+ return [atoi(c) for c in re.split(r'(\d+)', text)]
+
+
+def get_model_state_file(checkpoint_dir, zero_stage):
+ if not os.path.isdir(checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist")
+
+ # there should be only one file
+ if zero_stage <= 2:
+ file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt")
+ elif zero_stage == 3:
+ file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt")
+
+ if not os.path.exists(file):
+ raise FileNotFoundError(f"can't find model states file at '{file}'")
+
+ return file
+
+
+def get_checkpoint_files(checkpoint_dir, glob_pattern):
+ # XXX: need to test that this simple glob rule works for multi-node setup too
+ ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys)
+
+ if len(ckpt_files) == 0:
+ raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'")
+
+ return ckpt_files
+
+
+def get_optim_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt")
+
+
+def get_model_state_files(checkpoint_dir):
+ return get_checkpoint_files(checkpoint_dir, "*_model_states.pt")
+
+
+def _has_autoep_zero3_partitioned_metadata(state_dict):
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY)
+ if autoep_layers is None:
+ autoep_layers = state_dict.get(AUTOEP_LAYERS_KEY_LEGACY)
+ if not isinstance(autoep_layers, list):
+ return False
+ return any(
+ isinstance(entry, dict)
+ and entry.get(AUTOEP_ZERO3_EXPERT_STATE_FORMAT_KEY) == AUTOEP_ZERO3_PARTITIONED_EXPERT_STATE_FORMAT
+ for entry in autoep_layers)
+
+
+def _raise_if_autoep_zero3_partitioned_state(state_dict):
+ if _has_autoep_zero3_partitioned_metadata(state_dict):
+ raise NotImplementedError("zero_to_fp32 does not support AutoEP ZeRO-3 partition-native checkpoints. "
+ "AutoEP expert parameters are partitioned over expert replica groups, so "
+ "global data-parallel consolidation would produce incomplete expert tensors. "
+ "Use ds_to_universal.py for expert-aware conversion.")
+
+
+def _raise_if_autoep_zero3_partitioned_checkpoint(model_files):
+ for file in model_files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+
+def parse_model_states(files):
+ zero_model_states = []
+ for file in files:
+ state_dict = torch.load(file, map_location=device, weights_only=False)
+ _raise_if_autoep_zero3_partitioned_state(state_dict)
+
+ if BUFFER_NAMES not in state_dict:
+ raise ValueError(f"{file} is not a model state checkpoint")
+ buffer_names = state_dict[BUFFER_NAMES]
+ if debug:
+ print("Found buffers:", buffer_names)
+
+ # recover just the buffers while restoring them to fp32 if they were saved in fp16
+ buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names}
+ param_shapes = state_dict[PARAM_SHAPES]
+
+ # collect parameters that are included in param_shapes
+ param_names = []
+ for s in param_shapes:
+ for name in s.keys():
+ param_names.append(name)
+
+ # update with frozen parameters
+ frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None)
+ if frozen_param_shapes is not None:
+ if debug:
+ print(f"Found frozen_param_shapes: {frozen_param_shapes}")
+ param_names += list(frozen_param_shapes.keys())
+
+ # handle shared params
+ shared_params = [[k, v] for k, v in state_dict["shared_params"].items()]
+
+ ds_version = state_dict.get(DS_VERSION, None)
+
+ frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None)
+
+ z_model_state = zero_model_state(buffers=buffers,
+ param_shapes=param_shapes,
+ shared_params=shared_params,
+ ds_version=ds_version,
+ frozen_param_shapes=frozen_param_shapes,
+ frozen_param_fragments=frozen_param_fragments)
+ zero_model_states.append(z_model_state)
+
+ return zero_model_states
+
+
+def parse_optim_states(files, ds_checkpoint_dir):
+ total_files = len(files)
+ state_dicts = []
+ for f in tqdm(files, desc='Loading checkpoint shards'):
+ state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False)
+ # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights
+ # and also handle the case where it was already removed by another helper script
+ state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None)
+ state_dicts.append(state_dict)
+
+ if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]:
+ raise ValueError(f"{files[0]} is not a zero checkpoint")
+ zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE]
+ world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT]
+
+ # For ZeRO-2 each param group can have different partition_count as data parallelism for expert
+ # parameters can be different from data parallelism for non-expert parameters. So we can just
+ # use the max of the partition_count to get the dp world_size.
+
+ if type(world_size) is list:
+ world_size = max(world_size)
+
+ if world_size != total_files:
+ raise ValueError(
+ f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. "
+ "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes."
+ )
+
+ # the groups are named differently in each stage
+ if zero_stage <= 2:
+ fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS
+ elif zero_stage == 3:
+ fp32_groups_key = FP32_FLAT_GROUPS
+ else:
+ raise ValueError(f"unknown zero stage {zero_stage}")
+
+ fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))]
+ param_alignment_paddings = state_dicts[0][OPTIMIZER_STATE_DICT].get(PARAM_ALIGNMENT_PADDINGS)
+ return zero_stage, world_size, fp32_flat_groups, param_alignment_paddings
+
+
+def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters):
+ """
+ Returns fp32 state_dict reconstructed from ds checkpoint
+
+ Args:
+ - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are)
+
+ """
+ print(f"Processing zero checkpoint '{ds_checkpoint_dir}'")
+
+ # parse_model_states rejects AutoEP ZeRO-3 partition-native checkpoints
+ # before the expensive optimizer-shard load below.
+ model_files = get_model_state_files(ds_checkpoint_dir)
+ zero_model_states = parse_model_states(model_files)
+ print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}')
+
+ optim_files = get_optim_files(ds_checkpoint_dir)
+ zero_stage, world_size, fp32_flat_groups, param_alignment_paddings = parse_optim_states(
+ optim_files, ds_checkpoint_dir)
+ print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}")
+
+ if zero_stage <= 2:
+ return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters, param_alignment_paddings)
+ elif zero_stage == 3:
+ return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters)
+
+
+def _zero2_merge_frozen_params(state_dict, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ frozen_param_fragments = zero_model_states[0].frozen_param_fragments
+
+ if debug:
+ num_elem = sum(s.numel() for s in frozen_param_shapes.values())
+ print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in frozen_param_fragments.values()])
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ state_dict[name] = frozen_param_fragments[name]
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _has_callable(obj, fn):
+ attr = getattr(obj, fn, None)
+ return callable(attr)
+
+
+def _zero2_merge_trainable_params(state_dict,
+ world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ param_alignment_paddings=None):
+ param_shapes = zero_model_states[0].param_shapes
+
+ # Reconstruction protocol:
+ #
+ # XXX: document this
+
+ if debug:
+ for i in range(world_size):
+ for j in range(len(fp32_flat_groups[0])):
+ print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}")
+
+ # XXX: memory usage doubles here (zero2)
+ num_param_groups = len(fp32_flat_groups[0])
+ merged_single_partition_of_fp32_groups = []
+ for i in range(num_param_groups):
+ merged_partitions = [sd[i] for sd in fp32_flat_groups]
+ full_single_fp32_vector = torch.cat(merged_partitions, 0)
+ merged_single_partition_of_fp32_groups.append(full_single_fp32_vector)
+ avail_numel = sum(
+ [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups])
+
+ if debug:
+ wanted_params = sum([len(shapes) for shapes in param_shapes])
+ wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes])
+ # not asserting if there is a mismatch due to possible padding
+ print(f"Have {avail_numel} numels to process.")
+ print(f"Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ total_numel = 0
+ total_params = 0
+ for group_idx, (shapes,
+ full_single_fp32_vector) in enumerate(zip(param_shapes, merged_single_partition_of_fp32_groups)):
+ offset = 0
+ avail_numel = full_single_fp32_vector.numel()
+ group_alignment_paddings = None
+ if param_alignment_paddings is not None:
+ group_alignment_paddings = param_alignment_paddings[group_idx]
+ if len(group_alignment_paddings) != len(shapes):
+ raise ValueError(f"Expected {len(shapes)} parameter alignment paddings for group {group_idx}, "
+ f"but found {len(group_alignment_paddings)}")
+
+ for param_idx, (name, shape) in enumerate(shapes.items()):
+
+ unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape)
+ total_numel += unpartitioned_numel
+ total_params += 1
+
+ if debug:
+ print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+ state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape)
+ offset += unpartitioned_numel
+ if group_alignment_paddings is not None:
+ offset += group_alignment_paddings[param_idx]
+
+ # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and
+ # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex
+ # paddings performed in the code it's almost impossible to predict the exact numbers w/o the
+ # live optimizer object, so we are checking that the numbers are within the right range
+ align_to = 2 * world_size
+
+ def zero2_align(x):
+ return align_to * math.ceil(x / align_to)
+
+ if debug:
+ print(f"original offset={offset}, avail_numel={avail_numel}")
+
+ offset = zero2_align(offset)
+ avail_numel = zero2_align(avail_numel)
+
+ if debug:
+ print(f"aligned offset={offset}, avail_numel={avail_numel}")
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero2_checkpoint(world_size,
+ fp32_flat_groups,
+ zero_model_states,
+ exclude_frozen_parameters,
+ param_alignment_paddings=None):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero2_merge_frozen_params(state_dict, zero_model_states)
+
+ _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states,
+ param_alignment_paddings)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def zero3_partitioned_param_info(unpartitioned_numel, world_size):
+ remainder = unpartitioned_numel % world_size
+ padding_numel = (world_size - remainder) if remainder else 0
+ partitioned_numel = math.ceil(unpartitioned_numel / world_size)
+ return partitioned_numel, padding_numel
+
+
+def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states):
+ if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+ return
+
+ if debug:
+ for i in range(world_size):
+ num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values())
+ print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+
+ frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+ wanted_params = len(frozen_param_shapes)
+ wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+ avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size
+ print(f'Frozen params: Have {avail_numel} numels to process.')
+ print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+
+ total_params = 0
+ total_numel = 0
+ for name, shape in zero_model_states[0].frozen_param_shapes.items():
+ total_params += 1
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+
+ param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states)
+ state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape)
+
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+
+
+class GatheredTensor:
+ """
+ A pseudo tensor that collects partitioned weights.
+ It is more memory efficient when there are multiple groups.
+ """
+
+ def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape):
+ self.flat_groups = flat_groups
+ self.flat_groups_offset = flat_groups_offset
+ self.offset = offset
+ self.partitioned_numel = partitioned_numel
+ self.shape = shape
+ self.dtype = self.flat_groups[0][0].dtype
+
+ def contiguous(self):
+ """
+ Merge partitioned weights from flat_groups into a single tensor.
+ """
+ end_idx = self.offset + self.partitioned_numel
+ world_size = len(self.flat_groups)
+ pad_flat_param_chunks = []
+
+ for rank_i in range(world_size):
+ # for each rank, we need to collect weights from related group/groups
+ flat_groups_at_rank_i = self.flat_groups[rank_i]
+ start_group_id = None
+ end_group_id = None
+ for group_id in range(len(self.flat_groups_offset)):
+ if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]:
+ start_group_id = group_id
+ if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]:
+ end_group_id = group_id
+ break
+ # collect weights from related group/groups
+ for group_id in range(start_group_id, end_group_id + 1):
+ flat_tensor = flat_groups_at_rank_i[group_id]
+ start_offset = self.offset - self.flat_groups_offset[group_id]
+ end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id]
+ pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset])
+
+ # collect weights from all ranks
+ pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0)
+ param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous()
+ return param
+
+
+def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states):
+ param_shapes = zero_model_states[0].param_shapes
+ avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size
+
+ # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each
+ # param, re-consolidating each param, while dealing with padding if any
+
+ # merge list of dicts, preserving order
+ param_shapes = {k: v for d in param_shapes for k, v in d.items()}
+
+ if debug:
+ for i in range(world_size):
+ print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}")
+
+ wanted_params = len(param_shapes)
+ wanted_numel = sum(shape.numel() for shape in param_shapes.values())
+ # not asserting if there is a mismatch due to possible padding
+ avail_numel = fp32_flat_groups[0].numel() * world_size
+ print(f"Trainable params: Have {avail_numel} numels to process.")
+ print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.")
+
+ # params
+ # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+ # out-of-core computing solution
+ offset = 0
+ total_numel = 0
+ total_params = 0
+ flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]]))
+ for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'):
+ unpartitioned_numel = shape.numel()
+ total_numel += unpartitioned_numel
+ total_params += 1
+ partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+
+ if debug:
+ print(
+ f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+ )
+
+ # memory efficient tensor
+ tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape)
+ state_dict[name] = tensor
+ offset += partitioned_numel
+
+ offset *= world_size
+
+ # Sanity check
+ if offset != avail_numel:
+ raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+
+ print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements")
+
+
+def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+ exclude_frozen_parameters):
+ state_dict = OrderedDict()
+
+ # buffers
+ buffers = zero_model_states[0].buffers
+ state_dict.update(buffers)
+ if debug:
+ print(f"added {len(buffers)} buffers")
+
+ if not exclude_frozen_parameters:
+ _zero3_merge_frozen_params(state_dict, world_size, zero_model_states)
+
+ _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states)
+
+ # recover shared parameters
+ for pair in zero_model_states[0].shared_params:
+ if pair[1] in state_dict:
+ state_dict[pair[0]] = state_dict[pair[1]]
+
+ return state_dict
+
+
+def to_torch_tensor(state_dict, return_empty_tensor=False, dtype=None):
+ """
+ Convert state_dict of GatheredTensor to torch tensor
+ """
+ if dtype is not None:
+ dtype = _resolve_output_dtype(dtype)
+
+ torch_state_dict = {}
+ converted_tensors = {}
+ for name, tensor in state_dict.items():
+ tensor_id = id(tensor)
+ if tensor_id in converted_tensors: # shared tensors
+ shared_tensor = torch_state_dict[converted_tensors[tensor_id]]
+ torch_state_dict[name] = shared_tensor
+ else:
+ converted_tensors[tensor_id] = name
+ if return_empty_tensor:
+ torch_state_dict[name] = torch.empty(tensor.shape, dtype=dtype or tensor.dtype)
+ else:
+ contiguous_tensor = tensor.contiguous()
+ torch_state_dict[name] = contiguous_tensor.to(dtype=dtype) if dtype else contiguous_tensor
+ return torch_state_dict
+
+
+def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag=None,
+ exclude_frozen_parameters=False,
+ lazy_mode=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with
+ ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example
+ via a model hub.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient.
+ Convert the pesduo tensor to torch tensor by ``.contiguous()``
+
+ Returns:
+ - pytorch ``state_dict``
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ # do the training and checkpoint saving
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu
+ model = model.cpu() # move to cpu
+ model.load_state_dict(state_dict)
+ # submit to model hub or save the model to share with others
+
+ In this example the ``model`` will no longer be usable in the deepspeed context of the same
+ application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead.
+
+ Note: the above usage may not work if your application doesn't have sufficient free CPU memory.
+ You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with
+ the checkpoint. Or you can load state_dict in lazy mode ::
+
+ from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu
+ for name, lazy_tensor in state_dict.item():
+ tensor = lazy_tensor.contiguous() # to cpu
+ print(name, tensor)
+ # del tensor to release memory if it no longer in use
+ """
+ if tag is None:
+ latest_path = os.path.join(checkpoint_dir, 'latest')
+ if os.path.isfile(latest_path):
+ with open(latest_path, 'r') as fd:
+ tag = fd.read().strip()
+ else:
+ raise ValueError(f"Unable to find 'latest' file at {latest_path}")
+
+ ds_checkpoint_dir = os.path.join(checkpoint_dir, tag)
+
+ if not os.path.isdir(ds_checkpoint_dir):
+ raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist")
+
+ state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters)
+ if lazy_mode:
+ return state_dict
+ else:
+ return to_torch_tensor(state_dict)
+
+
+def convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """
+ Convert ZeRO 2 or 3 checkpoint into a consolidated ``state_dict`` file that can be
+ loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed.
+
+ Args:
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``output_dir``: directory for the PyTorch state_dict output files
+ - ``dtype``: output tensor dtype. Supports float32, float16, and bfloat16 as strings or torch dtypes.
+ - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB
+ - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+ - ``exclude_frozen_parameters``: exclude frozen parameters
+ """
+
+ dtype = _resolve_output_dtype(dtype)
+
+ # Dependency pre-check
+ if safe_serialization:
+ try:
+ from safetensors.torch import save_file
+ except ImportError:
+ print('If you want to use `safe_serialization`, please `pip install safetensors`')
+ raise
+ if max_shard_size is not None:
+ try:
+ from huggingface_hub import split_torch_state_dict_into_shards
+ except ImportError:
+ print('If you want to use `max_shard_size`, please `pip install huggingface_hub`')
+ raise
+
+ # Convert zero checkpoint to state_dict
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir,
+ tag,
+ exclude_frozen_parameters,
+ lazy_mode=True)
+
+ # Shard the model if it is too big.
+ weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin"
+ if max_shard_size is not None:
+ filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors")
+ # an memory-efficient approach for sharding
+ empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True, dtype=dtype)
+ state_dict_split = split_torch_state_dict_into_shards(empty_state_dict,
+ filename_pattern=filename_pattern,
+ max_shard_size=max_shard_size)
+ else:
+ from collections import namedtuple
+ StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"])
+ state_dict_split = StateDictSplit(is_sharded=False,
+ filename_to_tensors={weights_name: list(state_dict.keys())})
+
+ # Save the model by shard
+ os.makedirs(output_dir, exist_ok=True)
+ filename_to_tensors = state_dict_split.filename_to_tensors.items()
+ for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"):
+ shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors}
+ shard_state_dict = to_torch_tensor(shard_state_dict, dtype=dtype)
+ output_path = os.path.join(output_dir, shard_file)
+ if safe_serialization:
+ save_file(shard_state_dict, output_path, metadata={"format": "pt"})
+ else:
+ torch.save(shard_state_dict, output_path)
+ # release the memory of current shard
+ for tensor_name in list(shard_state_dict.keys()):
+ del state_dict[tensor_name]
+ del shard_state_dict[tensor_name]
+ del shard_state_dict
+ gc.collect()
+
+ # Save index if sharded
+ if state_dict_split.is_sharded:
+ index = {
+ "metadata": state_dict_split.metadata,
+ "weight_map": state_dict_split.tensor_to_filename,
+ }
+ save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json"
+ save_index_file = os.path.join(output_dir, save_index_file)
+ with open(save_index_file, "w", encoding="utf-8") as f:
+ content = json.dumps(index, indent=2, sort_keys=True) + "\n"
+ f.write(content)
+
+
+def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir,
+ output_dir,
+ max_shard_size="5GB",
+ safe_serialization=False,
+ tag=None,
+ exclude_frozen_parameters=False):
+ """Backward-compatible fp32 checkpoint conversion."""
+ return convert_zero_checkpoint_to_state_dict(checkpoint_dir,
+ output_dir,
+ dtype=torch.float32,
+ max_shard_size=max_shard_size,
+ safe_serialization=safe_serialization,
+ tag=tag,
+ exclude_frozen_parameters=exclude_frozen_parameters)
+
+
+def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None):
+ """
+ 1. Put the provided model to cpu
+ 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict``
+ 3. Load it into the provided model
+
+ Args:
+ - ``model``: the model object to update
+ - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+ - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+
+ Returns:
+ - ``model`: modified model
+
+ Make sure you have plenty of CPU memory available before you call this function. If you don't
+ have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it
+ conveniently placed for you in the checkpoint folder.
+
+ A typical usage might be ::
+
+ from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint
+ model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir)
+ # submit to model hub or save the model to share with others
+
+ Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context
+ of the same application. i.e. you will need to re-initialize the deepspeed engine, since
+ ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+
+ """
+ logger.info("Extracting fp32 weights")
+ state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag)
+
+ logger.info("Overwriting model with fp32 weights")
+ model = model.cpu()
+ model.load_state_dict(state_dict, strict=False)
+
+ return model
+
+
+if __name__ == "__main__":
+ parser = argparse.ArgumentParser()
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir",
+ type=str,
+ help="directory to the pytorch fp32 state_dict output files"
+ "(e.g. path/checkpoint-12-output/)")
+ parser.add_argument(
+ "--max_shard_size",
+ type=str,
+ default="5GB",
+ help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size"
+ "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`"
+ "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances"
+ "without CPU OOM issues.")
+ parser.add_argument(
+ "--safe_serialization",
+ default=False,
+ action='store_true',
+ help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug")
+ args = parser.parse_args()
+
+ debug = args.debug
+
+ convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir,
+ args.output_dir,
+ max_shard_size=args.max_shard_size,
+ safe_serialization=args.safe_serialization,
+ tag=args.tag,
+ exclude_frozen_parameters=args.exclude_frozen_parameters)
diff --git a/qwen3-1.7b-teutonic-5e6/checkpoint-500/zero_to_torch.py b/qwen3-1.7b-teutonic-5e6/checkpoint-500/zero_to_torch.py
new file mode 100644
index 0000000000000000000000000000000000000000..81312e252400d77f03cc1a88522f8f18ebe70ee7
--- /dev/null
+++ b/qwen3-1.7b-teutonic-5e6/checkpoint-500/zero_to_torch.py
@@ -0,0 +1,54 @@
+#!/usr/bin/env python
+
+# SPDX-License-Identifier: Apache-2.0
+# DeepSpeed Team
+
+import argparse
+
+if __package__:
+ from . import zero_to_fp32
+else:
+ import zero_to_fp32
+
+
+def main(args=None):
+ parser = argparse.ArgumentParser(
+ description="Convert a DeepSpeed ZeRO checkpoint to float32, float16, or bfloat16 PyTorch weights.")
+ parser.add_argument("checkpoint_dir",
+ type=str,
+ help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+ parser.add_argument("output_dir", type=str, help="directory for the converted PyTorch state_dict files")
+ parser.add_argument("--dtype",
+ type=str,
+ choices=sorted(zero_to_fp32.OUTPUT_DTYPE_NAMES),
+ required=True,
+ help="output tensor dtype")
+ parser.add_argument("--max_shard_size",
+ type=str,
+ default="5GB",
+ help="maximum size of each checkpoint shard, such as 5GB or 500MB")
+ parser.add_argument("--safe_serialization",
+ default=False,
+ action='store_true',
+ help="save with safetensors instead of PyTorch pickle serialization")
+ parser.add_argument("-t",
+ "--tag",
+ type=str,
+ default=None,
+ help="checkpoint tag used as a unique identifier, e.g., global_step1")
+ parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+ parser.add_argument("-d", "--debug", action='store_true', help="enable debug output")
+ parsed_args = parser.parse_args(args)
+
+ zero_to_fp32.debug = parsed_args.debug
+ zero_to_fp32.convert_zero_checkpoint_to_state_dict(parsed_args.checkpoint_dir,
+ parsed_args.output_dir,
+ dtype=parsed_args.dtype,
+ max_shard_size=parsed_args.max_shard_size,
+ safe_serialization=parsed_args.safe_serialization,
+ tag=parsed_args.tag,
+ exclude_frozen_parameters=parsed_args.exclude_frozen_parameters)
+
+
+if __name__ == "__main__":
+ main()