Text Generation
Transformers
Safetensors
qwen2
Generated from Trainer
grpo
rlcr
trl
conversational
text-generation-inference
Instructions to use jhuang265/SFT-RLCR-math with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use jhuang265/SFT-RLCR-math with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="jhuang265/SFT-RLCR-math") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("jhuang265/SFT-RLCR-math") model = AutoModelForCausalLM.from_pretrained("jhuang265/SFT-RLCR-math", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=256) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use jhuang265/SFT-RLCR-math with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "jhuang265/SFT-RLCR-math" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "jhuang265/SFT-RLCR-math", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/jhuang265/SFT-RLCR-math
- SGLang
How to use jhuang265/SFT-RLCR-math with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "jhuang265/SFT-RLCR-math" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "jhuang265/SFT-RLCR-math", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "jhuang265/SFT-RLCR-math" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "jhuang265/SFT-RLCR-math", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use jhuang265/SFT-RLCR-math with Docker Model Runner:
docker model run hf.co/jhuang265/SFT-RLCR-math
Download trainer_state.json from jhuang265/SFT-RLCR-math: direct link, hf CLI and curl.
- Browser
- Download file 77.1 kB
-
https://huggingface.co/jhuang265/SFT-RLCR-math/resolve/main/trainer_state.json
- Command line
-
hf download hf://jhuang265/SFT-RLCR-math/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/jhuang265/SFT-RLCR-math/resolve/main/trainer_state.json
77.1 kB
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.5, | |
| "eval_steps": 50, | |
| "global_step": 234, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.041015625, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 4000.4, | |
| "completions/mean_length": 1164.1234375, | |
| "completions/mean_terminated_length": 1038.845556640625, | |
| "completions/min_length": 247.2, | |
| "completions/min_terminated_length": 247.2, | |
| "entropy": 0.29370769949164244, | |
| "epoch": 0.010683760683760684, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.14847157895565033, | |
| "learning_rate": 4.2553191489361704e-07, | |
| "loss": -0.0248, | |
| "num_tokens": 14698896.0, | |
| "reward": 2.5872025966644285, | |
| "reward_std": 1.4765283107757567, | |
| "rewards/accuracy_reward/mean": 0.34619140625, | |
| "rewards/accuracy_reward/std": 0.4755214035511017, | |
| "rewards/brier_reward/mean": 0.49328577518463135, | |
| "rewards/brier_reward/std": 0.44167842864990237, | |
| "rewards/confidence_one_or_zero/mean": 0.431640625, | |
| "rewards/confidence_one_or_zero/std": 0.49507494568824767, | |
| "rewards/format_reward/mean": 0.7203125, | |
| "rewards/format_reward/std": 0.44880709052085876, | |
| "rewards/mean_confidence_reward/mean": 0.5957722783088684, | |
| "rewards/mean_confidence_reward/std": 0.39281755685806274, | |
| "step": 5, | |
| "step_time": 367.5162501453742 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04013671875, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 4028.0, | |
| "completions/mean_length": 1158.4236328125, | |
| "completions/mean_terminated_length": 1035.5475341796875, | |
| "completions/min_length": 236.0, | |
| "completions/min_terminated_length": 236.0, | |
| "entropy": 0.2964494117535651, | |
| "epoch": 0.021367521367521368, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.14055821299552917, | |
| "learning_rate": 9.574468085106384e-07, | |
| "loss": -0.0212, | |
| "num_tokens": 29323618.0, | |
| "reward": 2.626321029663086, | |
| "reward_std": 1.4372277736663819, | |
| "rewards/accuracy_reward/mean": 0.3529296875, | |
| "rewards/accuracy_reward/std": 0.4779347002506256, | |
| "rewards/brier_reward/mean": 0.5081964015960694, | |
| "rewards/brier_reward/std": 0.43526085615158083, | |
| "rewards/confidence_one_or_zero/mean": 0.41826171875, | |
| "rewards/confidence_one_or_zero/std": 0.49299114346504214, | |
| "rewards/format_reward/mean": 0.746875, | |
| "rewards/format_reward/std": 0.4341681182384491, | |
| "rewards/mean_confidence_reward/mean": 0.6000582456588746, | |
| "rewards/mean_confidence_reward/std": 0.38636099696159365, | |
| "step": 10, | |
| "step_time": 321.1076524061791 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04140625, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3991.8, | |
| "completions/mean_length": 1159.415625, | |
| "completions/mean_terminated_length": 1033.0634399414062, | |
| "completions/min_length": 130.2, | |
| "completions/min_terminated_length": 130.2, | |
| "entropy": 0.2963161684107035, | |
| "epoch": 0.03205128205128205, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.38358214497566223, | |
| "learning_rate": 1.4893617021276596e-06, | |
| "loss": -0.0239, | |
| "num_tokens": 43913314.0, | |
| "reward": 2.622881555557251, | |
| "reward_std": 1.4426464796066285, | |
| "rewards/accuracy_reward/mean": 0.35615234375, | |
| "rewards/accuracy_reward/std": 0.4773412704467773, | |
| "rewards/brier_reward/mean": 0.5073358297348023, | |
| "rewards/brier_reward/std": 0.43741809129714965, | |
| "rewards/confidence_one_or_zero/mean": 0.42236328125, | |
| "rewards/confidence_one_or_zero/std": 0.4939651072025299, | |
| "rewards/format_reward/mean": 0.74052734375, | |
| "rewards/format_reward/std": 0.43735886216163633, | |
| "rewards/mean_confidence_reward/mean": 0.5965027928352356, | |
| "rewards/mean_confidence_reward/std": 0.3892210364341736, | |
| "step": 15, | |
| "step_time": 320.404392082378 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04677734375, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 4007.2, | |
| "completions/mean_length": 1199.3455078125, | |
| "completions/mean_terminated_length": 1057.2992553710938, | |
| "completions/min_length": 263.6, | |
| "completions/min_terminated_length": 263.6, | |
| "entropy": 0.2863605673890561, | |
| "epoch": 0.042735042735042736, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 1.0963141918182373, | |
| "learning_rate": 2.021276595744681e-06, | |
| "loss": -0.0233, | |
| "num_tokens": 58973652.0, | |
| "reward": 2.4881054878234865, | |
| "reward_std": 1.4243582010269165, | |
| "rewards/accuracy_reward/mean": 0.303515625, | |
| "rewards/accuracy_reward/std": 0.4579374611377716, | |
| "rewards/brier_reward/mean": 0.48311116695404055, | |
| "rewards/brier_reward/std": 0.4374946057796478, | |
| "rewards/confidence_one_or_zero/mean": 0.41103515625, | |
| "rewards/confidence_one_or_zero/std": 0.4917535543441772, | |
| "rewards/format_reward/mean": 0.71962890625, | |
| "rewards/format_reward/std": 0.4489608943462372, | |
| "rewards/mean_confidence_reward/mean": 0.570814573764801, | |
| "rewards/mean_confidence_reward/std": 0.39406808614730837, | |
| "step": 20, | |
| "step_time": 332.20311605894824 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.03974609375, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3903.0, | |
| "completions/mean_length": 1148.490234375, | |
| "completions/mean_terminated_length": 1026.6469360351562, | |
| "completions/min_length": 243.6, | |
| "completions/min_terminated_length": 243.6, | |
| "entropy": 0.2810601927805692, | |
| "epoch": 0.053418803418803416, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 3.739562749862671, | |
| "learning_rate": 2.553191489361702e-06, | |
| "loss": -0.02, | |
| "num_tokens": 73469776.0, | |
| "reward": 2.631763458251953, | |
| "reward_std": 1.4347328186035155, | |
| "rewards/accuracy_reward/mean": 0.34892578125, | |
| "rewards/accuracy_reward/std": 0.47504717111587524, | |
| "rewards/brier_reward/mean": 0.5076832473278046, | |
| "rewards/brier_reward/std": 0.4349519371986389, | |
| "rewards/confidence_one_or_zero/mean": 0.420703125, | |
| "rewards/confidence_one_or_zero/std": 0.49354149103164674, | |
| "rewards/format_reward/mean": 0.748046875, | |
| "rewards/format_reward/std": 0.4338900506496429, | |
| "rewards/mean_confidence_reward/mean": 0.6064043879508972, | |
| "rewards/mean_confidence_reward/std": 0.3849062204360962, | |
| "step": 25, | |
| "step_time": 320.1903787172225 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0404296875, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 4019.2, | |
| "completions/mean_length": 1165.85546875, | |
| "completions/mean_terminated_length": 1042.3886474609376, | |
| "completions/min_length": 220.4, | |
| "completions/min_terminated_length": 220.4, | |
| "entropy": 0.2301187983015552, | |
| "epoch": 0.0641025641025641, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 199.96067810058594, | |
| "learning_rate": 3.0851063829787237e-06, | |
| "loss": -0.0199, | |
| "num_tokens": 88222312.0, | |
| "reward": 2.6316072940826416, | |
| "reward_std": 1.4807042837142945, | |
| "rewards/accuracy_reward/mean": 0.35673828125, | |
| "rewards/accuracy_reward/std": 0.47840901613235476, | |
| "rewards/brier_reward/mean": 0.506071788072586, | |
| "rewards/brier_reward/std": 0.4398545265197754, | |
| "rewards/confidence_one_or_zero/mean": 0.43662109375, | |
| "rewards/confidence_one_or_zero/std": 0.49545411467552186, | |
| "rewards/format_reward/mean": 0.73134765625, | |
| "rewards/format_reward/std": 0.4433063805103302, | |
| "rewards/mean_confidence_reward/mean": 0.6008285045623779, | |
| "rewards/mean_confidence_reward/std": 0.3925713062286377, | |
| "step": 30, | |
| "step_time": 326.57087952201545 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0490234375, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3916.0, | |
| "completions/mean_length": 1185.3583984375, | |
| "completions/mean_terminated_length": 1035.7810302734374, | |
| "completions/min_length": 239.4, | |
| "completions/min_terminated_length": 239.4, | |
| "entropy": 0.2210580409388058, | |
| "epoch": 0.07478632478632478, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 133.9806365966797, | |
| "learning_rate": 3.6170212765957453e-06, | |
| "loss": -0.0226, | |
| "num_tokens": 103107902.0, | |
| "reward": 2.585563850402832, | |
| "reward_std": 1.454831600189209, | |
| "rewards/accuracy_reward/mean": 0.33759765625, | |
| "rewards/accuracy_reward/std": 0.47166956663131715, | |
| "rewards/brier_reward/mean": 0.5002726972103119, | |
| "rewards/brier_reward/std": 0.4371703028678894, | |
| "rewards/confidence_one_or_zero/mean": 0.41552734375, | |
| "rewards/confidence_one_or_zero/std": 0.4925929605960846, | |
| "rewards/format_reward/mean": 0.73896484375, | |
| "rewards/format_reward/std": 0.4386298477649689, | |
| "rewards/mean_confidence_reward/mean": 0.5932011604309082, | |
| "rewards/mean_confidence_reward/std": 0.38995088934898375, | |
| "step": 35, | |
| "step_time": 325.6446264376165 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0408203125, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 4019.4, | |
| "completions/mean_length": 1149.20869140625, | |
| "completions/mean_terminated_length": 1023.7782958984375, | |
| "completions/min_length": 284.2, | |
| "completions/min_terminated_length": 284.2, | |
| "entropy": 0.3068808923708275, | |
| "epoch": 0.08547008547008547, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 113.78675079345703, | |
| "learning_rate": 4.148936170212766e-06, | |
| "loss": -0.017, | |
| "num_tokens": 117596471.0, | |
| "reward": 2.62867956161499, | |
| "reward_std": 1.4407520055770875, | |
| "rewards/accuracy_reward/mean": 0.34384765625, | |
| "rewards/accuracy_reward/std": 0.4746952474117279, | |
| "rewards/brier_reward/mean": 0.5058294236660004, | |
| "rewards/brier_reward/std": 0.43723568320274353, | |
| "rewards/confidence_one_or_zero/mean": 0.43291015625, | |
| "rewards/confidence_one_or_zero/std": 0.4955411970615387, | |
| "rewards/format_reward/mean": 0.74208984375, | |
| "rewards/format_reward/std": 0.43702192902565, | |
| "rewards/mean_confidence_reward/mean": 0.6040024995803833, | |
| "rewards/mean_confidence_reward/std": 0.3885011911392212, | |
| "step": 40, | |
| "step_time": 325.2610327706119 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04638671875, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3996.8, | |
| "completions/mean_length": 1179.61962890625, | |
| "completions/mean_terminated_length": 1037.8166137695312, | |
| "completions/min_length": 251.2, | |
| "completions/min_terminated_length": 251.2, | |
| "entropy": 0.3366824609809555, | |
| "epoch": 0.09615384615384616, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 124.41181182861328, | |
| "learning_rate": 4.680851063829788e-06, | |
| "loss": -0.0239, | |
| "num_tokens": 132464704.0, | |
| "reward": 2.6292791843414305, | |
| "reward_std": 1.4946486711502076, | |
| "rewards/accuracy_reward/mean": 0.35771484375, | |
| "rewards/accuracy_reward/std": 0.4783689081668854, | |
| "rewards/brier_reward/mean": 0.5130708456039429, | |
| "rewards/brier_reward/std": 0.44048008918762205, | |
| "rewards/confidence_one_or_zero/mean": 0.42802734375, | |
| "rewards/confidence_one_or_zero/std": 0.4943909227848053, | |
| "rewards/format_reward/mean": 0.73212890625, | |
| "rewards/format_reward/std": 0.44279989004135134, | |
| "rewards/mean_confidence_reward/mean": 0.5983372449874877, | |
| "rewards/mean_confidence_reward/std": 0.39211158752441405, | |
| "step": 45, | |
| "step_time": 329.7312524779816 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0419921875, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3980.4, | |
| "completions/mean_length": 1176.43818359375, | |
| "completions/mean_terminated_length": 1048.7527954101563, | |
| "completions/min_length": 247.4, | |
| "completions/min_terminated_length": 247.4, | |
| "entropy": 0.418773017404601, | |
| "epoch": 0.10683760683760683, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 62.133018493652344, | |
| "learning_rate": 4.9465240641711236e-06, | |
| "loss": -0.0165, | |
| "num_tokens": 147298055.0, | |
| "reward": 2.5864771366119386, | |
| "reward_std": 1.4536908149719239, | |
| "rewards/accuracy_reward/mean": 0.3388671875, | |
| "rewards/accuracy_reward/std": 0.4714273869991302, | |
| "rewards/brier_reward/mean": 0.4910121440887451, | |
| "rewards/brier_reward/std": 0.44000319242477415, | |
| "rewards/confidence_one_or_zero/mean": 0.43486328125, | |
| "rewards/confidence_one_or_zero/std": 0.4950097680091858, | |
| "rewards/format_reward/mean": 0.728515625, | |
| "rewards/format_reward/std": 0.4440678656101227, | |
| "rewards/mean_confidence_reward/mean": 0.5932189226150513, | |
| "rewards/mean_confidence_reward/std": 0.39245480895042417, | |
| "step": 50, | |
| "step_time": 322.2430747395556 | |
| }, | |
| { | |
| "epoch": 0.10683760683760683, | |
| "eval_clip_ratio/high_max": 0.0, | |
| "eval_clip_ratio/high_mean": 0.0, | |
| "eval_clip_ratio/low_mean": 0.0, | |
| "eval_clip_ratio/low_min": 0.0, | |
| "eval_clip_ratio/region_mean": 0.0, | |
| "eval_completions/clipped_ratio": 0.0478515625, | |
| "eval_completions/max_length": 3660.875, | |
| "eval_completions/max_terminated_length": 2446.375, | |
| "eval_completions/mean_length": 1183.4482421875, | |
| "eval_completions/mean_terminated_length": 1035.961950302124, | |
| "eval_completions/min_length": 449.375, | |
| "eval_completions/min_terminated_length": 449.375, | |
| "eval_entropy": 0.4594858642667532, | |
| "eval_frac_reward_zero_std": 1.0, | |
| "eval_loss": 0.0, | |
| "eval_num_tokens": 147298055.0, | |
| "eval_reward": 2.5969152376055717, | |
| "eval_reward_std": 1.4885545708239079, | |
| "eval_rewards/accuracy_reward/mean": 0.34765625, | |
| "eval_rewards/accuracy_reward/std": 0.4782447386533022, | |
| "eval_rewards/brier_reward/mean": 0.5097439922392368, | |
| "eval_rewards/brier_reward/std": 0.438809622079134, | |
| "eval_rewards/confidence_one_or_zero/mean": 0.4150390625, | |
| "eval_rewards/confidence_one_or_zero/std": 0.49284233059734106, | |
| "eval_rewards/format_reward/mean": 0.7451171875, | |
| "eval_rewards/format_reward/std": 0.43596830405294895, | |
| "eval_rewards/mean_confidence_reward/mean": 0.5793587230145931, | |
| "eval_rewards/mean_confidence_reward/std": 0.39388769399374723, | |
| "eval_runtime": 1149.3092, | |
| "eval_samples_per_second": 0.87, | |
| "eval_steps_per_second": 0.028, | |
| "step": 50 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04443359375, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3851.6, | |
| "completions/mean_length": 1186.297265625, | |
| "completions/mean_terminated_length": 1051.1856811523437, | |
| "completions/min_length": 253.8, | |
| "completions/min_terminated_length": 253.8, | |
| "entropy": 0.4116662655491382, | |
| "epoch": 0.11752136752136752, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 69.27256774902344, | |
| "learning_rate": 4.812834224598931e-06, | |
| "loss": -0.0233, | |
| "num_tokens": 162181707.0, | |
| "reward": 2.5811704635620116, | |
| "reward_std": 1.4448149919509887, | |
| "rewards/accuracy_reward/mean": 0.33203125, | |
| "rewards/accuracy_reward/std": 0.4704195737838745, | |
| "rewards/brier_reward/mean": 0.4908031582832336, | |
| "rewards/brier_reward/std": 0.43675305843353274, | |
| "rewards/confidence_one_or_zero/mean": 0.42431640625, | |
| "rewards/confidence_one_or_zero/std": 0.4941523432731628, | |
| "rewards/format_reward/mean": 0.735546875, | |
| "rewards/format_reward/std": 0.44057986736297605, | |
| "rewards/mean_confidence_reward/mean": 0.5984728097915649, | |
| "rewards/mean_confidence_reward/std": 0.3909616231918335, | |
| "step": 55, | |
| "step_time": 330.042653635249 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04189453125, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3965.2, | |
| "completions/mean_length": 1177.36982421875, | |
| "completions/mean_terminated_length": 1050.1990234375, | |
| "completions/min_length": 251.2, | |
| "completions/min_terminated_length": 251.2, | |
| "entropy": 0.4373515026643872, | |
| "epoch": 0.1282051282051282, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 101.64539337158203, | |
| "learning_rate": 4.6791443850267385e-06, | |
| "loss": -0.0211, | |
| "num_tokens": 176994198.0, | |
| "reward": 2.591030979156494, | |
| "reward_std": 1.45223228931427, | |
| "rewards/accuracy_reward/mean": 0.337109375, | |
| "rewards/accuracy_reward/std": 0.4722390055656433, | |
| "rewards/brier_reward/mean": 0.5020074665546417, | |
| "rewards/brier_reward/std": 0.43737395405769347, | |
| "rewards/confidence_one_or_zero/mean": 0.41845703125, | |
| "rewards/confidence_one_or_zero/std": 0.49311497807502747, | |
| "rewards/format_reward/mean": 0.734765625, | |
| "rewards/format_reward/std": 0.44106330871582033, | |
| "rewards/mean_confidence_reward/mean": 0.5986914038658142, | |
| "rewards/mean_confidence_reward/std": 0.38671804666519166, | |
| "step": 60, | |
| "step_time": 347.4772788655682 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.05126953125, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 4001.0, | |
| "completions/mean_length": 1238.319921875, | |
| "completions/mean_terminated_length": 1084.0480224609375, | |
| "completions/min_length": 282.6, | |
| "completions/min_terminated_length": 282.6, | |
| "entropy": 0.4563113780459389, | |
| "epoch": 0.1388888888888889, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 53.89928436279297, | |
| "learning_rate": 4.5454545454545455e-06, | |
| "loss": -0.028, | |
| "num_tokens": 192411170.0, | |
| "reward": 2.531825304031372, | |
| "reward_std": 1.4431338548660277, | |
| "rewards/accuracy_reward/mean": 0.3255859375, | |
| "rewards/accuracy_reward/std": 0.4675427436828613, | |
| "rewards/brier_reward/mean": 0.49114506840705874, | |
| "rewards/brier_reward/std": 0.43718346357345583, | |
| "rewards/confidence_one_or_zero/mean": 0.412890625, | |
| "rewards/confidence_one_or_zero/std": 0.4916431367397308, | |
| "rewards/format_reward/mean": 0.7236328125, | |
| "rewards/format_reward/std": 0.4470420956611633, | |
| "rewards/mean_confidence_reward/mean": 0.5785707950592041, | |
| "rewards/mean_confidence_reward/std": 0.39329431056976316, | |
| "step": 65, | |
| "step_time": 391.79989567998564 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.046484375, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3956.0, | |
| "completions/mean_length": 1216.59765625, | |
| "completions/mean_terminated_length": 1076.82607421875, | |
| "completions/min_length": 245.6, | |
| "completions/min_terminated_length": 245.6, | |
| "entropy": 0.4711520684882998, | |
| "epoch": 0.14957264957264957, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 57.16364669799805, | |
| "learning_rate": 4.411764705882353e-06, | |
| "loss": -0.0207, | |
| "num_tokens": 207638154.0, | |
| "reward": 2.516926908493042, | |
| "reward_std": 1.428751039505005, | |
| "rewards/accuracy_reward/mean": 0.314453125, | |
| "rewards/accuracy_reward/std": 0.4608186721801758, | |
| "rewards/brier_reward/mean": 0.49181228280067446, | |
| "rewards/brier_reward/std": 0.4358379542827606, | |
| "rewards/confidence_one_or_zero/mean": 0.41123046875, | |
| "rewards/confidence_one_or_zero/std": 0.491403067111969, | |
| "rewards/format_reward/mean": 0.725390625, | |
| "rewards/format_reward/std": 0.44508775472640993, | |
| "rewards/mean_confidence_reward/mean": 0.574040412902832, | |
| "rewards/mean_confidence_reward/std": 0.3923916518688202, | |
| "step": 70, | |
| "step_time": 330.1905146706442 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04140625, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3948.4, | |
| "completions/mean_length": 1172.76875, | |
| "completions/mean_terminated_length": 1046.49931640625, | |
| "completions/min_length": 231.4, | |
| "completions/min_terminated_length": 231.4, | |
| "entropy": 0.4409632431343198, | |
| "epoch": 0.16025641025641027, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 50.008419036865234, | |
| "learning_rate": 4.2780748663101604e-06, | |
| "loss": -0.0224, | |
| "num_tokens": 222380138.0, | |
| "reward": 2.5926557064056395, | |
| "reward_std": 1.463102674484253, | |
| "rewards/accuracy_reward/mean": 0.33291015625, | |
| "rewards/accuracy_reward/std": 0.4709408342838287, | |
| "rewards/brier_reward/mean": 0.5047689855098725, | |
| "rewards/brier_reward/std": 0.4396240770816803, | |
| "rewards/confidence_one_or_zero/mean": 0.4283203125, | |
| "rewards/confidence_one_or_zero/std": 0.49480087161064146, | |
| "rewards/format_reward/mean": 0.7337890625, | |
| "rewards/format_reward/std": 0.4413725435733795, | |
| "rewards/mean_confidence_reward/mean": 0.5928672432899476, | |
| "rewards/mean_confidence_reward/std": 0.3934659421443939, | |
| "step": 75, | |
| "step_time": 326.668984343193 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04423828125, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3992.6, | |
| "completions/mean_length": 1149.94189453125, | |
| "completions/mean_terminated_length": 1013.5361328125, | |
| "completions/min_length": 282.6, | |
| "completions/min_terminated_length": 282.6, | |
| "entropy": 0.4194035842316225, | |
| "epoch": 0.17094017094017094, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 64.48490142822266, | |
| "learning_rate": 4.144385026737968e-06, | |
| "loss": -0.0261, | |
| "num_tokens": 236899959.0, | |
| "reward": 2.5700586795806886, | |
| "reward_std": 1.4412338256835937, | |
| "rewards/accuracy_reward/mean": 0.32666015625, | |
| "rewards/accuracy_reward/std": 0.46828957796096804, | |
| "rewards/brier_reward/mean": 0.4898384869098663, | |
| "rewards/brier_reward/std": 0.4382441997528076, | |
| "rewards/confidence_one_or_zero/mean": 0.42744140625, | |
| "rewards/confidence_one_or_zero/std": 0.49459370970726013, | |
| "rewards/format_reward/mean": 0.7330078125, | |
| "rewards/format_reward/std": 0.4424092710018158, | |
| "rewards/mean_confidence_reward/mean": 0.5931108236312866, | |
| "rewards/mean_confidence_reward/std": 0.39181647896766664, | |
| "step": 80, | |
| "step_time": 323.0481036014127 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04208984375, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3887.0, | |
| "completions/mean_length": 1177.4208984375, | |
| "completions/mean_terminated_length": 1049.3630737304688, | |
| "completions/min_length": 202.6, | |
| "completions/min_terminated_length": 202.6, | |
| "entropy": 0.39985626018606124, | |
| "epoch": 0.18162393162393162, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 45.62771987915039, | |
| "learning_rate": 4.010695187165775e-06, | |
| "loss": -0.0225, | |
| "num_tokens": 251679821.0, | |
| "reward": 2.59846568107605, | |
| "reward_std": 1.4533775568008422, | |
| "rewards/accuracy_reward/mean": 0.34990234375, | |
| "rewards/accuracy_reward/std": 0.4756861090660095, | |
| "rewards/brier_reward/mean": 0.5023018896579743, | |
| "rewards/brier_reward/std": 0.4387582540512085, | |
| "rewards/confidence_one_or_zero/mean": 0.427734375, | |
| "rewards/confidence_one_or_zero/std": 0.494358617067337, | |
| "rewards/format_reward/mean": 0.73212890625, | |
| "rewards/format_reward/std": 0.44288029670715334, | |
| "rewards/mean_confidence_reward/mean": 0.5863980650901794, | |
| "rewards/mean_confidence_reward/std": 0.3929993689060211, | |
| "step": 85, | |
| "step_time": 326.0249995706487 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0462890625, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3998.4, | |
| "completions/mean_length": 1179.9412109375, | |
| "completions/mean_terminated_length": 1038.520068359375, | |
| "completions/min_length": 259.2, | |
| "completions/min_terminated_length": 259.2, | |
| "entropy": 0.386576225515455, | |
| "epoch": 0.19230769230769232, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 193.96762084960938, | |
| "learning_rate": 3.877005347593583e-06, | |
| "loss": -0.0228, | |
| "num_tokens": 266478067.0, | |
| "reward": 2.579456090927124, | |
| "reward_std": 1.4271894216537475, | |
| "rewards/accuracy_reward/mean": 0.32578125, | |
| "rewards/accuracy_reward/std": 0.46765764355659484, | |
| "rewards/brier_reward/mean": 0.4961786985397339, | |
| "rewards/brier_reward/std": 0.4369286894798279, | |
| "rewards/confidence_one_or_zero/mean": 0.4203125, | |
| "rewards/confidence_one_or_zero/std": 0.4934973418712616, | |
| "rewards/format_reward/mean": 0.74404296875, | |
| "rewards/format_reward/std": 0.43625056743621826, | |
| "rewards/mean_confidence_reward/mean": 0.5931406259536743, | |
| "rewards/mean_confidence_reward/std": 0.39092748165130614, | |
| "step": 90, | |
| "step_time": 322.8700365928322 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04658203125, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3999.6, | |
| "completions/mean_length": 1198.956640625, | |
| "completions/mean_terminated_length": 1057.507568359375, | |
| "completions/min_length": 263.8, | |
| "completions/min_terminated_length": 263.8, | |
| "entropy": 0.40121041517704725, | |
| "epoch": 0.202991452991453, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 41.008140563964844, | |
| "learning_rate": 3.7433155080213907e-06, | |
| "loss": -0.0227, | |
| "num_tokens": 281502167.0, | |
| "reward": 2.608871269226074, | |
| "reward_std": 1.4490824222564698, | |
| "rewards/accuracy_reward/mean": 0.344921875, | |
| "rewards/accuracy_reward/std": 0.47531471252441404, | |
| "rewards/brier_reward/mean": 0.5078621506690979, | |
| "rewards/brier_reward/std": 0.43720985054969785, | |
| "rewards/confidence_one_or_zero/mean": 0.421875, | |
| "rewards/confidence_one_or_zero/std": 0.4936180472373962, | |
| "rewards/format_reward/mean": 0.742578125, | |
| "rewards/format_reward/std": 0.4370300233364105, | |
| "rewards/mean_confidence_reward/mean": 0.5916341543197632, | |
| "rewards/mean_confidence_reward/std": 0.39123871326446535, | |
| "step": 95, | |
| "step_time": 323.7242567136098 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0431640625, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3955.4, | |
| "completions/mean_length": 1154.41572265625, | |
| "completions/mean_terminated_length": 1021.7558959960937, | |
| "completions/min_length": 272.8, | |
| "completions/min_terminated_length": 272.8, | |
| "entropy": 0.4168419130612165, | |
| "epoch": 0.21367521367521367, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 57.19181442260742, | |
| "learning_rate": 3.609625668449198e-06, | |
| "loss": -0.0236, | |
| "num_tokens": 296056888.0, | |
| "reward": 2.6315658569335936, | |
| "reward_std": 1.4593602418899536, | |
| "rewards/accuracy_reward/mean": 0.35224609375, | |
| "rewards/accuracy_reward/std": 0.47758880257606506, | |
| "rewards/brier_reward/mean": 0.5140846490859985, | |
| "rewards/brier_reward/std": 0.4383812129497528, | |
| "rewards/confidence_one_or_zero/mean": 0.42919921875, | |
| "rewards/confidence_one_or_zero/std": 0.494834303855896, | |
| "rewards/format_reward/mean": 0.741796875, | |
| "rewards/format_reward/std": 0.43728084564208985, | |
| "rewards/mean_confidence_reward/mean": 0.5942391753196716, | |
| "rewards/mean_confidence_reward/std": 0.39173622727394103, | |
| "step": 100, | |
| "step_time": 341.3402804447949 | |
| }, | |
| { | |
| "epoch": 0.21367521367521367, | |
| "eval_clip_ratio/high_max": 0.0, | |
| "eval_clip_ratio/high_mean": 0.0, | |
| "eval_clip_ratio/low_mean": 0.0, | |
| "eval_clip_ratio/low_min": 0.0, | |
| "eval_clip_ratio/region_mean": 0.0, | |
| "eval_completions/clipped_ratio": 0.044921875, | |
| "eval_completions/max_length": 3675.625, | |
| "eval_completions/max_terminated_length": 2566.5625, | |
| "eval_completions/mean_length": 1191.265625, | |
| "eval_completions/mean_terminated_length": 1054.0882835388184, | |
| "eval_completions/min_length": 447.875, | |
| "eval_completions/min_terminated_length": 447.875, | |
| "eval_entropy": 0.3911281004548073, | |
| "eval_frac_reward_zero_std": 1.0, | |
| "eval_loss": 0.0, | |
| "eval_num_tokens": 296056888.0, | |
| "eval_reward": 2.5998095087707043, | |
| "eval_reward_std": 1.4141752794384956, | |
| "eval_rewards/accuracy_reward/mean": 0.3369140625, | |
| "eval_rewards/accuracy_reward/std": 0.4713865462690592, | |
| "eval_rewards/brier_reward/mean": 0.4994282014667988, | |
| "eval_rewards/brier_reward/std": 0.44008473958820105, | |
| "eval_rewards/confidence_one_or_zero/mean": 0.419921875, | |
| "eval_rewards/confidence_one_or_zero/std": 0.49413473159074783, | |
| "eval_rewards/format_reward/mean": 0.7421875, | |
| "eval_rewards/format_reward/std": 0.4395229946821928, | |
| "eval_rewards/mean_confidence_reward/mean": 0.6013578549027443, | |
| "eval_rewards/mean_confidence_reward/std": 0.38793430011719465, | |
| "eval_runtime": 1211.1914, | |
| "eval_samples_per_second": 0.826, | |
| "eval_steps_per_second": 0.026, | |
| "step": 100 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.03994140625, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 4009.4, | |
| "completions/mean_length": 1162.73779296875, | |
| "completions/mean_terminated_length": 1040.7655639648438, | |
| "completions/min_length": 195.2, | |
| "completions/min_terminated_length": 195.2, | |
| "entropy": 0.4001290183980018, | |
| "epoch": 0.22435897435897437, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 41.48870849609375, | |
| "learning_rate": 3.4759358288770056e-06, | |
| "loss": -0.0209, | |
| "num_tokens": 310698331.0, | |
| "reward": 2.588319683074951, | |
| "reward_std": 1.4540923595428468, | |
| "rewards/accuracy_reward/mean": 0.33447265625, | |
| "rewards/accuracy_reward/std": 0.47117613554000853, | |
| "rewards/brier_reward/mean": 0.4937448620796204, | |
| "rewards/brier_reward/std": 0.43921745419502256, | |
| "rewards/confidence_one_or_zero/mean": 0.429296875, | |
| "rewards/confidence_one_or_zero/std": 0.49498026371002196, | |
| "rewards/format_reward/mean": 0.73095703125, | |
| "rewards/format_reward/std": 0.4429859757423401, | |
| "rewards/mean_confidence_reward/mean": 0.5998483061790466, | |
| "rewards/mean_confidence_reward/std": 0.3917877316474915, | |
| "step": 105, | |
| "step_time": 338.7956139975722 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.035546875, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3968.0, | |
| "completions/mean_length": 1152.4916015625, | |
| "completions/mean_terminated_length": 1043.9873779296875, | |
| "completions/min_length": 216.2, | |
| "completions/min_terminated_length": 216.2, | |
| "entropy": 0.4095216895919293, | |
| "epoch": 0.23504273504273504, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 78.59355163574219, | |
| "learning_rate": 3.342245989304813e-06, | |
| "loss": -0.0159, | |
| "num_tokens": 325250693.0, | |
| "reward": 2.6221971035003664, | |
| "reward_std": 1.4129359245300293, | |
| "rewards/accuracy_reward/mean": 0.34150390625, | |
| "rewards/accuracy_reward/std": 0.4733522355556488, | |
| "rewards/brier_reward/mean": 0.4949895441532135, | |
| "rewards/brier_reward/std": 0.43677046298980715, | |
| "rewards/confidence_one_or_zero/mean": 0.42919921875, | |
| "rewards/confidence_one_or_zero/std": 0.49494434595108033, | |
| "rewards/format_reward/mean": 0.748828125, | |
| "rewards/format_reward/std": 0.43359296917915346, | |
| "rewards/mean_confidence_reward/mean": 0.607676339149475, | |
| "rewards/mean_confidence_reward/std": 0.3874302625656128, | |
| "step": 110, | |
| "step_time": 319.2142815226136 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04208984375, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3922.4, | |
| "completions/mean_length": 1179.708203125, | |
| "completions/mean_terminated_length": 1051.603564453125, | |
| "completions/min_length": 263.0, | |
| "completions/min_terminated_length": 263.0, | |
| "entropy": 0.3744899015408009, | |
| "epoch": 0.24572649572649571, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 44.732879638671875, | |
| "learning_rate": 3.2085561497326205e-06, | |
| "loss": -0.0202, | |
| "num_tokens": 340073081.0, | |
| "reward": 2.59310622215271, | |
| "reward_std": 1.4364994049072266, | |
| "rewards/accuracy_reward/mean": 0.35048828125, | |
| "rewards/accuracy_reward/std": 0.4767671048641205, | |
| "rewards/brier_reward/mean": 0.5079159557819366, | |
| "rewards/brier_reward/std": 0.4364722192287445, | |
| "rewards/confidence_one_or_zero/mean": 0.41123046875, | |
| "rewards/confidence_one_or_zero/std": 0.4919556140899658, | |
| "rewards/format_reward/mean": 0.7400390625, | |
| "rewards/format_reward/std": 0.4384325683116913, | |
| "rewards/mean_confidence_reward/mean": 0.583432388305664, | |
| "rewards/mean_confidence_reward/std": 0.3897099018096924, | |
| "step": 115, | |
| "step_time": 326.647366704233 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04453125, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3945.0, | |
| "completions/mean_length": 1200.745703125, | |
| "completions/mean_terminated_length": 1066.298779296875, | |
| "completions/min_length": 227.4, | |
| "completions/min_terminated_length": 227.4, | |
| "entropy": 0.34471772906836123, | |
| "epoch": 0.2564102564102564, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 61.09455871582031, | |
| "learning_rate": 3.074866310160428e-06, | |
| "loss": -0.0255, | |
| "num_tokens": 355119949.0, | |
| "reward": 2.5888769149780275, | |
| "reward_std": 1.432522964477539, | |
| "rewards/accuracy_reward/mean": 0.33251953125, | |
| "rewards/accuracy_reward/std": 0.4707206726074219, | |
| "rewards/brier_reward/mean": 0.49854403734207153, | |
| "rewards/brier_reward/std": 0.43708345890045164, | |
| "rewards/confidence_one_or_zero/mean": 0.421875, | |
| "rewards/confidence_one_or_zero/std": 0.49373169541358947, | |
| "rewards/format_reward/mean": 0.7423828125, | |
| "rewards/format_reward/std": 0.43607338666915896, | |
| "rewards/mean_confidence_reward/mean": 0.5935555100440979, | |
| "rewards/mean_confidence_reward/std": 0.39031049609184265, | |
| "step": 120, | |
| "step_time": 324.7173171197093 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04765625, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3938.0, | |
| "completions/mean_length": 1179.1443359375, | |
| "completions/mean_terminated_length": 1033.1288330078125, | |
| "completions/min_length": 279.4, | |
| "completions/min_terminated_length": 279.4, | |
| "entropy": 0.32342109945602715, | |
| "epoch": 0.2670940170940171, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 57.27123260498047, | |
| "learning_rate": 2.9411764705882355e-06, | |
| "loss": -0.0236, | |
| "num_tokens": 369945203.0, | |
| "reward": 2.578601837158203, | |
| "reward_std": 1.4519781589508056, | |
| "rewards/accuracy_reward/mean": 0.347265625, | |
| "rewards/accuracy_reward/std": 0.4754137098789215, | |
| "rewards/brier_reward/mean": 0.5017790496349335, | |
| "rewards/brier_reward/std": 0.43707227110862734, | |
| "rewards/confidence_one_or_zero/mean": 0.41171875, | |
| "rewards/confidence_one_or_zero/std": 0.4922350883483887, | |
| "rewards/format_reward/mean": 0.73779296875, | |
| "rewards/format_reward/std": 0.4398411691188812, | |
| "rewards/mean_confidence_reward/mean": 0.5800454020500183, | |
| "rewards/mean_confidence_reward/std": 0.39250563979148867, | |
| "step": 125, | |
| "step_time": 346.2828420913778 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0419921875, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 4003.6, | |
| "completions/mean_length": 1171.39365234375, | |
| "completions/mean_terminated_length": 1043.3955444335938, | |
| "completions/min_length": 271.0, | |
| "completions/min_terminated_length": 271.0, | |
| "entropy": 0.35659047805238514, | |
| "epoch": 0.2777777777777778, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 113.86180877685547, | |
| "learning_rate": 2.807486631016043e-06, | |
| "loss": -0.0234, | |
| "num_tokens": 384686290.0, | |
| "reward": 2.6278841972351072, | |
| "reward_std": 1.4369913339614868, | |
| "rewards/accuracy_reward/mean": 0.34736328125, | |
| "rewards/accuracy_reward/std": 0.475992888212204, | |
| "rewards/brier_reward/mean": 0.5168704152107239, | |
| "rewards/brier_reward/std": 0.4365030348300934, | |
| "rewards/confidence_one_or_zero/mean": 0.42607421875, | |
| "rewards/confidence_one_or_zero/std": 0.4945238888263702, | |
| "rewards/format_reward/mean": 0.74873046875, | |
| "rewards/format_reward/std": 0.4332437634468079, | |
| "rewards/mean_confidence_reward/mean": 0.5888458251953125, | |
| "rewards/mean_confidence_reward/std": 0.39102033972740174, | |
| "step": 130, | |
| "step_time": 321.3360222982825 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.03935546875, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3972.4, | |
| "completions/mean_length": 1128.96396484375, | |
| "completions/mean_terminated_length": 1007.7831909179688, | |
| "completions/min_length": 282.4, | |
| "completions/min_terminated_length": 282.4, | |
| "entropy": 0.35520400705281646, | |
| "epoch": 0.28846153846153844, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 51.285396575927734, | |
| "learning_rate": 2.673796791443851e-06, | |
| "loss": -0.0227, | |
| "num_tokens": 398983489.0, | |
| "reward": 2.612396001815796, | |
| "reward_std": 1.4276126384735108, | |
| "rewards/accuracy_reward/mean": 0.3345703125, | |
| "rewards/accuracy_reward/std": 0.47118029594421384, | |
| "rewards/brier_reward/mean": 0.49303132891654966, | |
| "rewards/brier_reward/std": 0.4375665545463562, | |
| "rewards/confidence_one_or_zero/mean": 0.4322265625, | |
| "rewards/confidence_one_or_zero/std": 0.49502651691436766, | |
| "rewards/format_reward/mean": 0.74296875, | |
| "rewards/format_reward/std": 0.43659918904304507, | |
| "rewards/mean_confidence_reward/mean": 0.6095991253852844, | |
| "rewards/mean_confidence_reward/std": 0.38876975774765016, | |
| "step": 135, | |
| "step_time": 317.259214475425 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.03896484375, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 4068.4, | |
| "completions/mean_length": 1158.2162109375, | |
| "completions/mean_terminated_length": 1039.444482421875, | |
| "completions/min_length": 250.0, | |
| "completions/min_terminated_length": 250.0, | |
| "entropy": 0.3379080446669832, | |
| "epoch": 0.29914529914529914, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 47.08708953857422, | |
| "learning_rate": 2.5401069518716583e-06, | |
| "loss": -0.0164, | |
| "num_tokens": 413628743.0, | |
| "reward": 2.624250793457031, | |
| "reward_std": 1.4579155921936036, | |
| "rewards/accuracy_reward/mean": 0.35654296875, | |
| "rewards/accuracy_reward/std": 0.4779155910015106, | |
| "rewards/brier_reward/mean": 0.5080420076847076, | |
| "rewards/brier_reward/std": 0.4370752513408661, | |
| "rewards/confidence_one_or_zero/mean": 0.41474609375, | |
| "rewards/confidence_one_or_zero/std": 0.49261121153831483, | |
| "rewards/format_reward/mean": 0.73642578125, | |
| "rewards/format_reward/std": 0.44039976596832275, | |
| "rewards/mean_confidence_reward/mean": 0.6084939122200013, | |
| "rewards/mean_confidence_reward/std": 0.3848548471927643, | |
| "step": 140, | |
| "step_time": 322.5389275003457 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04482421875, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 4020.0, | |
| "completions/mean_length": 1198.82666015625, | |
| "completions/mean_terminated_length": 1063.138720703125, | |
| "completions/min_length": 259.2, | |
| "completions/min_terminated_length": 259.2, | |
| "entropy": 0.3416525034001097, | |
| "epoch": 0.30982905982905984, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 49.23389434814453, | |
| "learning_rate": 2.4064171122994653e-06, | |
| "loss": -0.0207, | |
| "num_tokens": 428679224.0, | |
| "reward": 2.584191846847534, | |
| "reward_std": 1.4531973361968995, | |
| "rewards/accuracy_reward/mean": 0.33994140625, | |
| "rewards/accuracy_reward/std": 0.472433865070343, | |
| "rewards/brier_reward/mean": 0.4880970597267151, | |
| "rewards/brier_reward/std": 0.438845157623291, | |
| "rewards/confidence_one_or_zero/mean": 0.4294921875, | |
| "rewards/confidence_one_or_zero/std": 0.49454295039176943, | |
| "rewards/format_reward/mean": 0.73310546875, | |
| "rewards/format_reward/std": 0.4407926738262177, | |
| "rewards/mean_confidence_reward/mean": 0.5935557723045349, | |
| "rewards/mean_confidence_reward/std": 0.3939161837100983, | |
| "step": 145, | |
| "step_time": 324.0329591148824 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04072265625, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3972.4, | |
| "completions/mean_length": 1154.97421875, | |
| "completions/mean_terminated_length": 1030.1244262695313, | |
| "completions/min_length": 221.4, | |
| "completions/min_terminated_length": 221.4, | |
| "entropy": 0.3519633636577055, | |
| "epoch": 0.32051282051282054, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 54.82425308227539, | |
| "learning_rate": 2.2727272727272728e-06, | |
| "loss": -0.019, | |
| "num_tokens": 443254160.0, | |
| "reward": 2.583753252029419, | |
| "reward_std": 1.4211549758911133, | |
| "rewards/accuracy_reward/mean": 0.32998046875, | |
| "rewards/accuracy_reward/std": 0.46994357705116274, | |
| "rewards/brier_reward/mean": 0.503885543346405, | |
| "rewards/brier_reward/std": 0.433600527048111, | |
| "rewards/confidence_one_or_zero/mean": 0.41416015625, | |
| "rewards/confidence_one_or_zero/std": 0.4925421476364136, | |
| "rewards/format_reward/mean": 0.74814453125, | |
| "rewards/format_reward/std": 0.4341081440448761, | |
| "rewards/mean_confidence_reward/mean": 0.5875824809074401, | |
| "rewards/mean_confidence_reward/std": 0.388624894618988, | |
| "step": 150, | |
| "step_time": 322.4442724415218 | |
| }, | |
| { | |
| "epoch": 0.32051282051282054, | |
| "eval_clip_ratio/high_max": 0.0, | |
| "eval_clip_ratio/high_mean": 0.0, | |
| "eval_clip_ratio/low_mean": 0.0, | |
| "eval_clip_ratio/low_min": 0.0, | |
| "eval_clip_ratio/region_mean": 0.0, | |
| "eval_completions/clipped_ratio": 0.0390625, | |
| "eval_completions/max_length": 3729.6875, | |
| "eval_completions/max_terminated_length": 2385.375, | |
| "eval_completions/mean_length": 1152.037109375, | |
| "eval_completions/mean_terminated_length": 1031.337080001831, | |
| "eval_completions/min_length": 444.15625, | |
| "eval_completions/min_terminated_length": 444.15625, | |
| "eval_entropy": 0.32576982071623206, | |
| "eval_frac_reward_zero_std": 1.0, | |
| "eval_loss": 0.0, | |
| "eval_num_tokens": 443254160.0, | |
| "eval_reward": 2.609559252858162, | |
| "eval_reward_std": 1.437463615089655, | |
| "eval_rewards/accuracy_reward/mean": 0.3466796875, | |
| "eval_rewards/accuracy_reward/std": 0.4741403367370367, | |
| "eval_rewards/brier_reward/mean": 0.49707255978137255, | |
| "eval_rewards/brier_reward/std": 0.4325491338968277, | |
| "eval_rewards/confidence_one_or_zero/mean": 0.4345703125, | |
| "eval_rewards/confidence_one_or_zero/std": 0.4974057199433446, | |
| "eval_rewards/format_reward/mean": 0.740234375, | |
| "eval_rewards/format_reward/std": 0.43520408356562257, | |
| "eval_rewards/mean_confidence_reward/mean": 0.591002281755209, | |
| "eval_rewards/mean_confidence_reward/std": 0.3949732268229127, | |
| "eval_runtime": 1184.2626, | |
| "eval_samples_per_second": 0.844, | |
| "eval_steps_per_second": 0.027, | |
| "step": 150 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0337890625, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3998.0, | |
| "completions/mean_length": 1110.99599609375, | |
| "completions/mean_terminated_length": 1006.7109252929688, | |
| "completions/min_length": 238.0, | |
| "completions/min_terminated_length": 238.0, | |
| "entropy": 0.340514807915315, | |
| "epoch": 0.3311965811965812, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 42.09675979614258, | |
| "learning_rate": 2.1390374331550802e-06, | |
| "loss": -0.0158, | |
| "num_tokens": 457382311.0, | |
| "reward": 2.6362682342529298, | |
| "reward_std": 1.4206720113754272, | |
| "rewards/accuracy_reward/mean": 0.33486328125, | |
| "rewards/accuracy_reward/std": 0.47186189889907837, | |
| "rewards/brier_reward/mean": 0.5024402737617493, | |
| "rewards/brier_reward/std": 0.43651157021522524, | |
| "rewards/confidence_one_or_zero/mean": 0.43583984375, | |
| "rewards/confidence_one_or_zero/std": 0.49555398225784303, | |
| "rewards/format_reward/mean": 0.7517578125, | |
| "rewards/format_reward/std": 0.43134459257125857, | |
| "rewards/mean_confidence_reward/mean": 0.6113669753074646, | |
| "rewards/mean_confidence_reward/std": 0.38755360841751096, | |
| "step": 155, | |
| "step_time": 317.9468389595451 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.03837890625, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3940.8, | |
| "completions/mean_length": 1123.14443359375, | |
| "completions/mean_terminated_length": 1004.75517578125, | |
| "completions/min_length": 282.8, | |
| "completions/min_terminated_length": 282.8, | |
| "entropy": 0.3312236491590738, | |
| "epoch": 0.3418803418803419, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 51.59230041503906, | |
| "learning_rate": 2.0053475935828877e-06, | |
| "loss": -0.018, | |
| "num_tokens": 471616750.0, | |
| "reward": 2.6946078300476075, | |
| "reward_std": 1.4457947969436646, | |
| "rewards/accuracy_reward/mean": 0.36123046875, | |
| "rewards/accuracy_reward/std": 0.4788636863231659, | |
| "rewards/brier_reward/mean": 0.5252399325370789, | |
| "rewards/brier_reward/std": 0.4370757818222046, | |
| "rewards/confidence_one_or_zero/mean": 0.43427734375, | |
| "rewards/confidence_one_or_zero/std": 0.4952123582363129, | |
| "rewards/format_reward/mean": 0.76083984375, | |
| "rewards/format_reward/std": 0.42635048627853395, | |
| "rewards/mean_confidence_reward/mean": 0.6130202889442444, | |
| "rewards/mean_confidence_reward/std": 0.3868469834327698, | |
| "step": 160, | |
| "step_time": 320.616255954816 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.03603515625, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3912.8, | |
| "completions/mean_length": 1148.70595703125, | |
| "completions/mean_terminated_length": 1038.7396850585938, | |
| "completions/min_length": 254.6, | |
| "completions/min_terminated_length": 254.6, | |
| "entropy": 0.3219002692261711, | |
| "epoch": 0.3525641025641026, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 44.704288482666016, | |
| "learning_rate": 1.8716577540106954e-06, | |
| "loss": -0.0202, | |
| "num_tokens": 486130507.0, | |
| "reward": 2.67243070602417, | |
| "reward_std": 1.4341658115386964, | |
| "rewards/accuracy_reward/mean": 0.3478515625, | |
| "rewards/accuracy_reward/std": 0.4750068366527557, | |
| "rewards/brier_reward/mean": 0.5088487803936005, | |
| "rewards/brier_reward/std": 0.4378484785556793, | |
| "rewards/confidence_one_or_zero/mean": 0.446875, | |
| "rewards/confidence_one_or_zero/std": 0.4969118058681488, | |
| "rewards/format_reward/mean": 0.7537109375, | |
| "rewards/format_reward/std": 0.43048771023750304, | |
| "rewards/mean_confidence_reward/mean": 0.6151445508003235, | |
| "rewards/mean_confidence_reward/std": 0.38804330229759215, | |
| "step": 165, | |
| "step_time": 318.20381522698443 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04267578125, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 4009.8, | |
| "completions/mean_length": 1193.27939453125, | |
| "completions/mean_terminated_length": 1064.359521484375, | |
| "completions/min_length": 272.6, | |
| "completions/min_terminated_length": 272.6, | |
| "entropy": 0.31800271323882046, | |
| "epoch": 0.36324786324786323, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 45.46564865112305, | |
| "learning_rate": 1.7379679144385028e-06, | |
| "loss": -0.0204, | |
| "num_tokens": 501104760.0, | |
| "reward": 2.635536003112793, | |
| "reward_std": 1.4441087245941162, | |
| "rewards/accuracy_reward/mean": 0.3525390625, | |
| "rewards/accuracy_reward/std": 0.4760962724685669, | |
| "rewards/brier_reward/mean": 0.5073639392852783, | |
| "rewards/brier_reward/std": 0.43809244632720945, | |
| "rewards/confidence_one_or_zero/mean": 0.433203125, | |
| "rewards/confidence_one_or_zero/std": 0.49548872113227843, | |
| "rewards/format_reward/mean": 0.745703125, | |
| "rewards/format_reward/std": 0.43517242670059203, | |
| "rewards/mean_confidence_reward/mean": 0.5967267632484436, | |
| "rewards/mean_confidence_reward/std": 0.3925954043865204, | |
| "step": 170, | |
| "step_time": 324.3902578342066 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.03447265625, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3978.8, | |
| "completions/mean_length": 1120.2951171875, | |
| "completions/mean_terminated_length": 1014.105224609375, | |
| "completions/min_length": 285.0, | |
| "completions/min_terminated_length": 285.0, | |
| "entropy": 0.3251201260834932, | |
| "epoch": 0.37393162393162394, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 65.23611450195312, | |
| "learning_rate": 1.6042780748663103e-06, | |
| "loss": -0.0164, | |
| "num_tokens": 515338566.0, | |
| "reward": 2.6606284618377685, | |
| "reward_std": 1.4600170612335206, | |
| "rewards/accuracy_reward/mean": 0.36572265625, | |
| "rewards/accuracy_reward/std": 0.4810932517051697, | |
| "rewards/brier_reward/mean": 0.5115406513214111, | |
| "rewards/brier_reward/std": 0.43966758251190186, | |
| "rewards/confidence_one_or_zero/mean": 0.433203125, | |
| "rewards/confidence_one_or_zero/std": 0.4955389678478241, | |
| "rewards/format_reward/mean": 0.73984375, | |
| "rewards/format_reward/std": 0.43864802122116087, | |
| "rewards/mean_confidence_reward/mean": 0.6103182315826416, | |
| "rewards/mean_confidence_reward/std": 0.3892994046211243, | |
| "step": 175, | |
| "step_time": 320.5348702490388 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.03662109375, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3997.6, | |
| "completions/mean_length": 1140.8505859375, | |
| "completions/mean_terminated_length": 1028.3723876953125, | |
| "completions/min_length": 276.0, | |
| "completions/min_terminated_length": 276.0, | |
| "entropy": 0.32873620714526625, | |
| "epoch": 0.38461538461538464, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 51.08501052856445, | |
| "learning_rate": 1.4705882352941177e-06, | |
| "loss": -0.0196, | |
| "num_tokens": 529769868.0, | |
| "reward": 2.6234814167022704, | |
| "reward_std": 1.4477176189422607, | |
| "rewards/accuracy_reward/mean": 0.3451171875, | |
| "rewards/accuracy_reward/std": 0.4743470072746277, | |
| "rewards/brier_reward/mean": 0.5132450461387634, | |
| "rewards/brier_reward/std": 0.4347148656845093, | |
| "rewards/confidence_one_or_zero/mean": 0.4205078125, | |
| "rewards/confidence_one_or_zero/std": 0.4931892991065979, | |
| "rewards/format_reward/mean": 0.7466796875, | |
| "rewards/format_reward/std": 0.43422102332115176, | |
| "rewards/mean_confidence_reward/mean": 0.5979317545890808, | |
| "rewards/mean_confidence_reward/std": 0.3880310356616974, | |
| "step": 180, | |
| "step_time": 325.9552943095856 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04052734375, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 4005.2, | |
| "completions/mean_length": 1181.13349609375, | |
| "completions/mean_terminated_length": 1058.2173706054687, | |
| "completions/min_length": 288.0, | |
| "completions/min_terminated_length": 288.0, | |
| "entropy": 0.31275777535047383, | |
| "epoch": 0.3952991452991453, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 44.81126022338867, | |
| "learning_rate": 1.3368983957219254e-06, | |
| "loss": -0.0205, | |
| "num_tokens": 544664387.0, | |
| "reward": 2.5762894630432127, | |
| "reward_std": 1.4388552904129028, | |
| "rewards/accuracy_reward/mean": 0.3298828125, | |
| "rewards/accuracy_reward/std": 0.4654023349285126, | |
| "rewards/brier_reward/mean": 0.4998352527618408, | |
| "rewards/brier_reward/std": 0.4382630228996277, | |
| "rewards/confidence_one_or_zero/mean": 0.42275390625, | |
| "rewards/confidence_one_or_zero/std": 0.49179916381835936, | |
| "rewards/format_reward/mean": 0.73115234375, | |
| "rewards/format_reward/std": 0.4424052357673645, | |
| "rewards/mean_confidence_reward/mean": 0.5926651358604431, | |
| "rewards/mean_confidence_reward/std": 0.38963629603385924, | |
| "step": 185, | |
| "step_time": 407.50393955440376 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0375, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3929.2, | |
| "completions/mean_length": 1182.69365234375, | |
| "completions/mean_terminated_length": 1069.9430908203126, | |
| "completions/min_length": 270.2, | |
| "completions/min_terminated_length": 270.2, | |
| "entropy": 0.30875583661254496, | |
| "epoch": 0.405982905982906, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 46.6525993347168, | |
| "learning_rate": 1.2032085561497326e-06, | |
| "loss": -0.0198, | |
| "num_tokens": 559514658.0, | |
| "reward": 2.5919751167297362, | |
| "reward_std": 1.4350115060806274, | |
| "rewards/accuracy_reward/mean": 0.3408203125, | |
| "rewards/accuracy_reward/std": 0.47263641357421876, | |
| "rewards/brier_reward/mean": 0.49980634450912476, | |
| "rewards/brier_reward/std": 0.4361814737319946, | |
| "rewards/confidence_one_or_zero/mean": 0.4193359375, | |
| "rewards/confidence_one_or_zero/std": 0.49343532919883726, | |
| "rewards/format_reward/mean": 0.73642578125, | |
| "rewards/format_reward/std": 0.4384405970573425, | |
| "rewards/mean_confidence_reward/mean": 0.5955868244171143, | |
| "rewards/mean_confidence_reward/std": 0.38822770714759824, | |
| "step": 190, | |
| "step_time": 322.8024162671703 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04228515625, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3993.0, | |
| "completions/mean_length": 1174.65224609375, | |
| "completions/mean_terminated_length": 1046.3890502929687, | |
| "completions/min_length": 255.8, | |
| "completions/min_terminated_length": 255.8, | |
| "entropy": 0.31124953711405395, | |
| "epoch": 0.4166666666666667, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 50.37832260131836, | |
| "learning_rate": 1.0695187165775401e-06, | |
| "loss": -0.0215, | |
| "num_tokens": 574310297.0, | |
| "reward": 2.6151120185852053, | |
| "reward_std": 1.4608880996704101, | |
| "rewards/accuracy_reward/mean": 0.344140625, | |
| "rewards/accuracy_reward/std": 0.4716655910015106, | |
| "rewards/brier_reward/mean": 0.5032954812049866, | |
| "rewards/brier_reward/std": 0.4398936152458191, | |
| "rewards/confidence_one_or_zero/mean": 0.43369140625, | |
| "rewards/confidence_one_or_zero/std": 0.4940564870834351, | |
| "rewards/format_reward/mean": 0.73154296875, | |
| "rewards/format_reward/std": 0.442363041639328, | |
| "rewards/mean_confidence_reward/mean": 0.6024415254592895, | |
| "rewards/mean_confidence_reward/std": 0.3903405725955963, | |
| "step": 195, | |
| "step_time": 321.9405225500348 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04658203125, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3911.0, | |
| "completions/mean_length": 1195.96796875, | |
| "completions/mean_terminated_length": 1054.292431640625, | |
| "completions/min_length": 218.4, | |
| "completions/min_terminated_length": 218.4, | |
| "entropy": 0.3140326828230172, | |
| "epoch": 0.42735042735042733, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 52.459930419921875, | |
| "learning_rate": 9.358288770053477e-07, | |
| "loss": -0.0244, | |
| "num_tokens": 589303217.0, | |
| "reward": 2.6150192737579347, | |
| "reward_std": 1.4392563343048095, | |
| "rewards/accuracy_reward/mean": 0.3431640625, | |
| "rewards/accuracy_reward/std": 0.47419439554214476, | |
| "rewards/brier_reward/mean": 0.4979334771633148, | |
| "rewards/brier_reward/std": 0.4386617362499237, | |
| "rewards/confidence_one_or_zero/mean": 0.43544921875, | |
| "rewards/confidence_one_or_zero/std": 0.49546384811401367, | |
| "rewards/format_reward/mean": 0.74296875, | |
| "rewards/format_reward/std": 0.43653143644332887, | |
| "rewards/mean_confidence_reward/mean": 0.5955037713050843, | |
| "rewards/mean_confidence_reward/std": 0.393673437833786, | |
| "step": 200, | |
| "step_time": 327.2914565466228 | |
| }, | |
| { | |
| "epoch": 0.42735042735042733, | |
| "eval_clip_ratio/high_max": 0.0, | |
| "eval_clip_ratio/high_mean": 0.0, | |
| "eval_clip_ratio/low_mean": 0.0, | |
| "eval_clip_ratio/low_min": 0.0, | |
| "eval_clip_ratio/region_mean": 0.0, | |
| "eval_completions/clipped_ratio": 0.0439453125, | |
| "eval_completions/max_length": 3846.3125, | |
| "eval_completions/max_terminated_length": 2380.96875, | |
| "eval_completions/mean_length": 1170.236328125, | |
| "eval_completions/mean_terminated_length": 1035.2478408813477, | |
| "eval_completions/min_length": 453.4375, | |
| "eval_completions/min_terminated_length": 453.4375, | |
| "eval_entropy": 0.3072325438261032, | |
| "eval_frac_reward_zero_std": 1.0, | |
| "eval_loss": 0.0, | |
| "eval_num_tokens": 589303217.0, | |
| "eval_reward": 2.593014381825924, | |
| "eval_reward_std": 1.4711584821343422, | |
| "eval_rewards/accuracy_reward/mean": 0.341796875, | |
| "eval_rewards/accuracy_reward/std": 0.4742839252576232, | |
| "eval_rewards/brier_reward/mean": 0.4914909126237035, | |
| "eval_rewards/brier_reward/std": 0.4407998891547322, | |
| "eval_rewards/confidence_one_or_zero/mean": 0.447265625, | |
| "eval_rewards/confidence_one_or_zero/std": 0.498204636387527, | |
| "eval_rewards/format_reward/mean": 0.7216796875, | |
| "eval_rewards/format_reward/std": 0.44888558331876993, | |
| "eval_rewards/mean_confidence_reward/mean": 0.5907812491059303, | |
| "eval_rewards/mean_confidence_reward/std": 0.39370104763656855, | |
| "eval_runtime": 1185.0883, | |
| "eval_samples_per_second": 0.844, | |
| "eval_steps_per_second": 0.027, | |
| "step": 200 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0373046875, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3964.4, | |
| "completions/mean_length": 1128.76904296875, | |
| "completions/mean_terminated_length": 1013.8509521484375, | |
| "completions/min_length": 235.8, | |
| "completions/min_terminated_length": 235.8, | |
| "entropy": 0.32033217654097823, | |
| "epoch": 0.43803418803418803, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 109.52311706542969, | |
| "learning_rate": 8.021390374331551e-07, | |
| "loss": -0.014, | |
| "num_tokens": 603609268.0, | |
| "reward": 2.658170557022095, | |
| "reward_std": 1.431856918334961, | |
| "rewards/accuracy_reward/mean": 0.34990234375, | |
| "rewards/accuracy_reward/std": 0.4752007782459259, | |
| "rewards/brier_reward/mean": 0.5081121861934662, | |
| "rewards/brier_reward/std": 0.43636615872383117, | |
| "rewards/confidence_one_or_zero/mean": 0.44365234375, | |
| "rewards/confidence_one_or_zero/std": 0.49671694040298464, | |
| "rewards/format_reward/mean": 0.75224609375, | |
| "rewards/format_reward/std": 0.43108250498771666, | |
| "rewards/mean_confidence_reward/mean": 0.6042575478553772, | |
| "rewards/mean_confidence_reward/std": 0.38912311792373655, | |
| "step": 205, | |
| "step_time": 321.3963442307548 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0412109375, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3887.4, | |
| "completions/mean_length": 1184.64619140625, | |
| "completions/mean_terminated_length": 1059.6198486328126, | |
| "completions/min_length": 246.8, | |
| "completions/min_terminated_length": 246.8, | |
| "entropy": 0.3036916059441864, | |
| "epoch": 0.44871794871794873, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 46.13463592529297, | |
| "learning_rate": 6.684491978609627e-07, | |
| "loss": -0.0219, | |
| "num_tokens": 618507469.0, | |
| "reward": 2.5911818981170653, | |
| "reward_std": 1.4422379732131958, | |
| "rewards/accuracy_reward/mean": 0.33408203125, | |
| "rewards/accuracy_reward/std": 0.47096659541130065, | |
| "rewards/brier_reward/mean": 0.49200026988983153, | |
| "rewards/brier_reward/std": 0.43940954804420473, | |
| "rewards/confidence_one_or_zero/mean": 0.43505859375, | |
| "rewards/confidence_one_or_zero/std": 0.4954834520816803, | |
| "rewards/format_reward/mean": 0.73203125, | |
| "rewards/format_reward/std": 0.44260523915290834, | |
| "rewards/mean_confidence_reward/mean": 0.598009729385376, | |
| "rewards/mean_confidence_reward/std": 0.39167081713676455, | |
| "step": 210, | |
| "step_time": 323.0747571212065 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.0435546875, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3939.6, | |
| "completions/mean_length": 1168.0533203125, | |
| "completions/mean_terminated_length": 1034.6664672851562, | |
| "completions/min_length": 224.2, | |
| "completions/min_terminated_length": 224.2, | |
| "entropy": 0.31387688296381383, | |
| "epoch": 0.4594017094017094, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 36.15897750854492, | |
| "learning_rate": 5.347593582887701e-07, | |
| "loss": -0.021, | |
| "num_tokens": 633201967.0, | |
| "reward": 2.620379829406738, | |
| "reward_std": 1.4509658813476562, | |
| "rewards/accuracy_reward/mean": 0.35732421875, | |
| "rewards/accuracy_reward/std": 0.4786747872829437, | |
| "rewards/brier_reward/mean": 0.5078815937042236, | |
| "rewards/brier_reward/std": 0.43832914233207704, | |
| "rewards/confidence_one_or_zero/mean": 0.4224609375, | |
| "rewards/confidence_one_or_zero/std": 0.49330766797065734, | |
| "rewards/format_reward/mean": 0.74013671875, | |
| "rewards/format_reward/std": 0.4384992718696594, | |
| "rewards/mean_confidence_reward/mean": 0.5925763964653015, | |
| "rewards/mean_confidence_reward/std": 0.3911791563034058, | |
| "step": 215, | |
| "step_time": 326.1934914130543 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.04453125, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 4025.4, | |
| "completions/mean_length": 1179.8091796875, | |
| "completions/mean_terminated_length": 1044.0080932617188, | |
| "completions/min_length": 254.6, | |
| "completions/min_terminated_length": 254.6, | |
| "entropy": 0.3016074412036687, | |
| "epoch": 0.4700854700854701, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 62.14570999145508, | |
| "learning_rate": 4.0106951871657757e-07, | |
| "loss": -0.0236, | |
| "num_tokens": 648016717.0, | |
| "reward": 2.6373492240905763, | |
| "reward_std": 1.4634708881378173, | |
| "rewards/accuracy_reward/mean": 0.35615234375, | |
| "rewards/accuracy_reward/std": 0.47809425592422483, | |
| "rewards/brier_reward/mean": 0.5045531094074249, | |
| "rewards/brier_reward/std": 0.44011043310165404, | |
| "rewards/confidence_one_or_zero/mean": 0.43154296875, | |
| "rewards/confidence_one_or_zero/std": 0.4952175259590149, | |
| "rewards/format_reward/mean": 0.7416015625, | |
| "rewards/format_reward/std": 0.43776689767837523, | |
| "rewards/mean_confidence_reward/mean": 0.6034992337226868, | |
| "rewards/mean_confidence_reward/std": 0.3924152433872223, | |
| "step": 220, | |
| "step_time": 321.48763779564763 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.03720703125, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3961.0, | |
| "completions/mean_length": 1166.6537109375, | |
| "completions/mean_terminated_length": 1053.6300415039063, | |
| "completions/min_length": 254.8, | |
| "completions/min_terminated_length": 254.8, | |
| "entropy": 0.30844552812632176, | |
| "epoch": 0.4807692307692308, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 151.7078094482422, | |
| "learning_rate": 2.6737967914438503e-07, | |
| "loss": -0.0172, | |
| "num_tokens": 662686483.0, | |
| "reward": 2.641693115234375, | |
| "reward_std": 1.4303761720657349, | |
| "rewards/accuracy_reward/mean": 0.34609375, | |
| "rewards/accuracy_reward/std": 0.47535844445228576, | |
| "rewards/brier_reward/mean": 0.5199149966239929, | |
| "rewards/brier_reward/std": 0.4357679784297943, | |
| "rewards/confidence_one_or_zero/mean": 0.42568359375, | |
| "rewards/confidence_one_or_zero/std": 0.49414241313934326, | |
| "rewards/format_reward/mean": 0.7541015625, | |
| "rewards/format_reward/std": 0.4301507592201233, | |
| "rewards/mean_confidence_reward/mean": 0.5958992719650269, | |
| "rewards/mean_confidence_reward/std": 0.38701295852661133, | |
| "step": 225, | |
| "step_time": 327.222905562527 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.041796875, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 3919.0, | |
| "completions/mean_length": 1171.34111328125, | |
| "completions/mean_terminated_length": 1043.8849853515626, | |
| "completions/min_length": 235.4, | |
| "completions/min_terminated_length": 235.4, | |
| "entropy": 0.30160802758764477, | |
| "epoch": 0.49145299145299143, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 126.87531280517578, | |
| "learning_rate": 1.3368983957219251e-07, | |
| "loss": -0.0223, | |
| "num_tokens": 677407768.0, | |
| "reward": 2.662746286392212, | |
| "reward_std": 1.4676513671875, | |
| "rewards/accuracy_reward/mean": 0.3689453125, | |
| "rewards/accuracy_reward/std": 0.4824755251407623, | |
| "rewards/brier_reward/mean": 0.515411776304245, | |
| "rewards/brier_reward/std": 0.43887125253677367, | |
| "rewards/confidence_one_or_zero/mean": 0.44208984375, | |
| "rewards/confidence_one_or_zero/std": 0.4962202250957489, | |
| "rewards/format_reward/mean": 0.742578125, | |
| "rewards/format_reward/std": 0.4369687378406525, | |
| "rewards/mean_confidence_reward/mean": 0.5937211871147156, | |
| "rewards/mean_confidence_reward/std": 0.39389788508415224, | |
| "step": 230, | |
| "step_time": 318.9965775484394 | |
| }, | |
| { | |
| "clip_ratio/high_max": 0.0, | |
| "clip_ratio/high_mean": 0.0, | |
| "clip_ratio/low_mean": 0.0, | |
| "clip_ratio/low_min": 0.0, | |
| "clip_ratio/region_mean": 0.0, | |
| "completions/clipped_ratio": 0.043212890625, | |
| "completions/max_length": 4096.0, | |
| "completions/max_terminated_length": 4027.5, | |
| "completions/mean_length": 1166.7020263671875, | |
| "completions/mean_terminated_length": 1034.5452728271484, | |
| "completions/min_length": 155.0, | |
| "completions/min_terminated_length": 155.0, | |
| "entropy": 0.30643512052483857, | |
| "epoch": 0.5, | |
| "frac_reward_zero_std": 0.0, | |
| "num_tokens": 689170639.0, | |
| "reward": 2.711099922657013, | |
| "reward_std": 1.4795014560222626, | |
| "rewards/accuracy_reward/mean": 0.3792724609375, | |
| "rewards/accuracy_reward/std": 0.4842975437641144, | |
| "rewards/brier_reward/mean": 0.5229446142911911, | |
| "rewards/brier_reward/std": 0.4396687373518944, | |
| "rewards/confidence_one_or_zero/mean": 0.439453125, | |
| "rewards/confidence_one_or_zero/std": 0.49557578563690186, | |
| "rewards/format_reward/mean": 0.75439453125, | |
| "rewards/format_reward/std": 0.4301748499274254, | |
| "rewards/mean_confidence_reward/mean": 0.6150352358818054, | |
| "rewards/mean_confidence_reward/std": 0.388339601457119, | |
| "step": 234, | |
| "step_time": 323.7886903610197, | |
| "total_flos": 0.0, | |
| "train_loss": -0.004756694548150413, | |
| "train_runtime": 20325.6125, | |
| "train_samples_per_second": 0.738, | |
| "train_steps_per_second": 0.012 | |
| } | |
| ], | |
| "logging_steps": 5, | |
| "max_steps": 234, | |
| "num_input_tokens_seen": 689170639, | |
| "num_train_epochs": 1, | |
| "save_steps": 60, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 0.0, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |