appvoid commited on
Commit
0cc0eea
·
verified ·
1 Parent(s): 055057e

Update TensorBoard training metrics

Browse files
benchmark_cache/shard_scheduler.json CHANGED
@@ -22,8 +22,8 @@
22
  "tokens_per_second": 598315.063954628,
23
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
24
  "estimated_pages_for_buffer": 1,
25
- "required_token_positions_per_second": 77244.17117457373,
26
- "required_pages_per_second_upper_estimate": 0.0053439309930273715
27
  },
28
  {
29
  "source": "rewrite6",
@@ -36,8 +36,8 @@
36
  "tokens_per_second": 8533.957213384612,
37
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
38
  "estimated_pages_for_buffer": 1,
39
- "required_token_positions_per_second": 9655.521396821716,
40
- "required_pages_per_second_upper_estimate": 0.004042565178634351
41
  },
42
  {
43
  "source": "openmath",
@@ -50,8 +50,8 @@
50
  "tokens_per_second": 380144.35761751566,
51
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
52
  "estimated_pages_for_buffer": 1,
53
- "required_token_positions_per_second": 19311.04279364343,
54
- "required_pages_per_second_upper_estimate": 0.004021980947470773
55
  },
56
  {
57
  "source": "ultra_qa",
@@ -64,8 +64,8 @@
64
  "tokens_per_second": 43742.16556775435,
65
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
66
  "estimated_pages_for_buffer": 1,
67
- "required_token_positions_per_second": 28966.564190465146,
68
- "required_pages_per_second_upper_estimate": 0.001736501293835831
69
  },
70
  {
71
  "source": "ultra_style",
@@ -78,8 +78,8 @@
78
  "tokens_per_second": 22018.86276523721,
79
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
80
  "estimated_pages_for_buffer": 1,
81
- "required_token_positions_per_second": 28966.564190465146,
82
- "required_pages_per_second_upper_estimate": 0.0022520229553579427
83
  },
84
  {
85
  "source": "cortex",
@@ -92,8 +92,8 @@
92
  "tokens_per_second": 910315.184299418,
93
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
94
  "estimated_pages_for_buffer": 23,
95
- "required_token_positions_per_second": 28966.564190465146,
96
- "required_pages_per_second_upper_estimate": 0.3715519835618469
97
  }
98
  ],
99
  "gpu_measurement": "Selected forward/backward estimate; replaced by live successful update timings.",
@@ -158,33 +158,27 @@
158
  "prefetch_batches": 63,
159
  "prefetch_capacity_limit": 512,
160
  "batch_memory_estimate_bytes": 720750,
161
- "producer_batch_seconds": 0.12210022925785324,
162
- "producer_p95_seconds": 0.38375506599550135,
163
- "gpu_update_seconds": 0.954479786356603,
164
- "producer_batches_per_second": 8.189992812283618,
165
- "gpu_batches_per_second": 1.0476911237870785,
166
- "producer_headroom": 7.817182589730582,
167
  "sustainable": true,
168
- "buffer_seconds": 60.13222654046599,
169
  "buffer_drain_seconds": null,
170
  "shard_target_mib": 16,
171
- "upload_pages_per_commit": 84,
172
  "max_pending_pages": 4096,
173
- "generation_bytes_per_second": 494987.90737296373,
174
- "upload_bytes_per_second": 4517615.744659073,
175
  "upload_sustainable": true,
176
  "logical_page_rows": 4096,
177
  "logical_cortex_page_rows": 128,
178
- "estimated_full_shards_per_hour": 106.21288219348607,
179
  "selection_policy": "Smallest shard within 90% of measured local peak, enlarged to amortize 30 seconds of measured page production; bounded to 256 MiB."
180
  },
181
  "upload_measurements": [
182
- {
183
- "seconds": 1.198663317001774,
184
- "bytes": 9767212,
185
- "pages": 29,
186
- "shards": 3
187
- },
188
  {
189
  "seconds": 1.4251030520026688,
190
  "bytes": 1167175,
@@ -562,6 +556,12 @@
562
  "bytes": 5878935,
563
  "pages": 28,
564
  "shards": 2
 
 
 
 
 
 
565
  }
566
  ],
567
  "cache_key": {
 
22
  "tokens_per_second": 598315.063954628,
23
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
24
  "estimated_pages_for_buffer": 1,
25
+ "required_token_positions_per_second": 76774.05654670329,
26
+ "required_pages_per_second_upper_estimate": 0.005311407372255073
27
  },
28
  {
29
  "source": "rewrite6",
 
36
  "tokens_per_second": 8533.957213384612,
37
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
38
  "estimated_pages_for_buffer": 1,
39
+ "required_token_positions_per_second": 9596.75706833791,
40
+ "required_pages_per_second_upper_estimate": 0.004017961781436903
41
  },
42
  {
43
  "source": "openmath",
 
50
  "tokens_per_second": 380144.35761751566,
51
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
52
  "estimated_pages_for_buffer": 1,
53
+ "required_token_positions_per_second": 19193.51413667582,
54
+ "required_pages_per_second_upper_estimate": 0.003997502827663532
55
  },
56
  {
57
  "source": "ultra_qa",
 
64
  "tokens_per_second": 43742.16556775435,
65
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
66
  "estimated_pages_for_buffer": 1,
67
+ "required_token_positions_per_second": 28790.271205013734,
68
+ "required_pages_per_second_upper_estimate": 0.0017259327985418213
69
  },
70
  {
71
  "source": "ultra_style",
 
78
  "tokens_per_second": 22018.86276523721,
79
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
80
  "estimated_pages_for_buffer": 1,
81
+ "required_token_positions_per_second": 28790.271205013734,
82
+ "required_pages_per_second_upper_estimate": 0.0022383169511699884
83
  },
84
  {
85
  "source": "cortex",
 
92
  "tokens_per_second": 910315.184299418,
93
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
94
  "estimated_pages_for_buffer": 23,
95
+ "required_token_positions_per_second": 28790.271205013734,
96
+ "required_pages_per_second_upper_estimate": 0.36929068643313623
97
  }
98
  ],
99
  "gpu_measurement": "Selected forward/backward estimate; replaced by live successful update timings.",
 
158
  "prefetch_batches": 63,
159
  "prefetch_capacity_limit": 512,
160
  "batch_memory_estimate_bytes": 720750,
161
+ "producer_batch_seconds": 0.4091385062965287,
162
+ "producer_p95_seconds": 0.3623796640022192,
163
+ "gpu_update_seconds": 0.960324402751204,
164
+ "producer_batches_per_second": 2.4441600695370296,
165
+ "gpu_batches_per_second": 1.0413147860609713,
166
+ "producer_headroom": 2.3471865590064893,
167
  "sustainable": true,
168
+ "buffer_seconds": 60.50043737332585,
169
  "buffer_drain_seconds": null,
170
  "shard_target_mib": 16,
171
+ "upload_pages_per_commit": 78,
172
  "max_pending_pages": 4096,
173
+ "generation_bytes_per_second": 443325.19472720014,
174
+ "upload_bytes_per_second": 4487753.8827649625,
175
  "upload_sustainable": true,
176
  "logical_page_rows": 4096,
177
  "logical_cortex_page_rows": 128,
178
+ "estimated_full_shards_per_hour": 95.12726670610431,
179
  "selection_policy": "Smallest shard within 90% of measured local peak, enlarged to amortize 30 seconds of measured page production; bounded to 256 MiB."
180
  },
181
  "upload_measurements": [
 
 
 
 
 
 
182
  {
183
  "seconds": 1.4251030520026688,
184
  "bytes": 1167175,
 
556
  "bytes": 5878935,
557
  "pages": 28,
558
  "shards": 2
559
+ },
560
+ {
561
+ "seconds": 1.573873765002645,
562
+ "bytes": 8582970,
563
+ "pages": 41,
564
+ "shards": 3
565
  }
566
  ],
567
  "cache_key": {
metrics/void-byte-v1/1791254470898546162-7724d9f6/train.jsonl CHANGED
@@ -437,3 +437,4 @@
437
  {"step": 803700, "loss": 0.5388901233673096, "lr": 3e-05, "grad_norm": 0.2735688570848663, "recovery_retries": 0, "loss_scale": 1.0, "microbatch": 90, "input_bytes_and_specials": 117638367567, "tokens_per_second": 150629.6751526873, "data_wait_s": 9.963005140889436e-06, "gpu_peak_gb": 89.37899398803711}
438
  {"step": 803800, "loss": 0.5099372267723083, "lr": 3e-05, "grad_norm": 0.2714258411883778, "recovery_retries": 0, "loss_scale": 1.0, "microbatch": 90, "input_bytes_and_specials": 117652931556, "tokens_per_second": 151436.96065108583, "data_wait_s": 1.22519995784387e-05, "gpu_peak_gb": 89.37899398803711}
439
  {"step": 803900, "loss": 0.5207173824310303, "lr": 3e-05, "grad_norm": 0.2727557766442316, "recovery_retries": 0, "loss_scale": 1.0, "microbatch": 90, "input_bytes_and_specials": 117667628222, "tokens_per_second": 152070.79059758803, "data_wait_s": 9.208997653331608e-06, "gpu_peak_gb": 89.37899398803711}
 
 
437
  {"step": 803700, "loss": 0.5388901233673096, "lr": 3e-05, "grad_norm": 0.2735688570848663, "recovery_retries": 0, "loss_scale": 1.0, "microbatch": 90, "input_bytes_and_specials": 117638367567, "tokens_per_second": 150629.6751526873, "data_wait_s": 9.963005140889436e-06, "gpu_peak_gb": 89.37899398803711}
438
  {"step": 803800, "loss": 0.5099372267723083, "lr": 3e-05, "grad_norm": 0.2714258411883778, "recovery_retries": 0, "loss_scale": 1.0, "microbatch": 90, "input_bytes_and_specials": 117652931556, "tokens_per_second": 151436.96065108583, "data_wait_s": 1.22519995784387e-05, "gpu_peak_gb": 89.37899398803711}
439
  {"step": 803900, "loss": 0.5207173824310303, "lr": 3e-05, "grad_norm": 0.2727557766442316, "recovery_retries": 0, "loss_scale": 1.0, "microbatch": 90, "input_bytes_and_specials": 117667628222, "tokens_per_second": 152070.79059758803, "data_wait_s": 9.208997653331608e-06, "gpu_peak_gb": 89.37899398803711}
440
+ {"step": 804000, "loss": 0.555134654045105, "lr": 3e-05, "grad_norm": 0.2694330548798989, "recovery_retries": 0, "loss_scale": 1.0, "microbatch": 90, "input_bytes_and_specials": 117682351354, "tokens_per_second": 152743.03588176318, "data_wait_s": 1.2853000953327864e-05, "gpu_peak_gb": 89.37899398803711}
runs/void-byte-v1/events.out.tfevents.1791254470.1e0c9aa3-e42e-441e-9e17-2e25895f438d-9bhv5.366.0.1791254470898546162-7724d9f6 CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a4e8f5248edb9506c96f9dbf706a224ad6712934470ba18f9284065d7237060d
3
- size 936231
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:113fbae046f4d69401b79bee0939e4a1cb1eb6556739fc9219f306876262ed69
3
+ size 938349