appvoid commited on
Commit
e234aef
·
verified ·
1 Parent(s): 713af13

Update TensorBoard training metrics

Browse files
benchmark_cache/shard_scheduler.json CHANGED
@@ -22,8 +22,8 @@
22
  "tokens_per_second": 598315.063954628,
23
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
24
  "estimated_pages_for_buffer": 1,
25
- "required_token_positions_per_second": 77149.02481426059,
26
- "required_pages_per_second_upper_estimate": 0.005337348547050936
27
  },
28
  {
29
  "source": "rewrite6",
@@ -36,8 +36,8 @@
36
  "tokens_per_second": 8533.957213384612,
37
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
38
  "estimated_pages_for_buffer": 1,
39
- "required_token_positions_per_second": 9643.628101782573,
40
- "required_pages_per_second_upper_estimate": 0.004037585704361704
41
  },
42
  {
43
  "source": "openmath",
@@ -50,8 +50,8 @@
50
  "tokens_per_second": 380144.35761751566,
51
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
52
  "estimated_pages_for_buffer": 1,
53
- "required_token_positions_per_second": 19287.256203565146,
54
- "required_pages_per_second_upper_estimate": 0.0040170268280520305
55
  },
56
  {
57
  "source": "ultra_qa",
@@ -64,8 +64,8 @@
64
  "tokens_per_second": 43742.16556775435,
65
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
66
  "estimated_pages_for_buffer": 1,
67
- "required_token_positions_per_second": 28930.88430534772,
68
- "required_pages_per_second_upper_estimate": 0.0017343623392030714
69
  },
70
  {
71
  "source": "ultra_style",
@@ -78,8 +78,8 @@
78
  "tokens_per_second": 22018.86276523721,
79
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
80
  "estimated_pages_for_buffer": 1,
81
- "required_token_positions_per_second": 28930.88430534772,
82
- "required_pages_per_second_upper_estimate": 0.002249249001229292
83
  },
84
  {
85
  "source": "cortex",
@@ -92,8 +92,8 @@
92
  "tokens_per_second": 910315.184299418,
93
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
94
  "estimated_pages_for_buffer": 23,
95
- "required_token_positions_per_second": 28930.88430534772,
96
- "required_pages_per_second_upper_estimate": 0.37109432030563644
97
  }
98
  ],
99
  "gpu_measurement": "Selected forward/backward estimate; replaced by live successful update timings.",
@@ -158,33 +158,27 @@
158
  "prefetch_batches": 63,
159
  "prefetch_capacity_limit": 512,
160
  "batch_memory_estimate_bytes": 720750,
161
- "producer_batch_seconds": 0.15969040192970851,
162
- "producer_p95_seconds": 0.3450825920008356,
163
- "gpu_update_seconds": 0.9556569273234905,
164
- "producer_batches_per_second": 6.262117121103957,
165
- "gpu_batches_per_second": 1.046400618683005,
166
- "producer_headroom": 5.98443560649403,
167
  "sustainable": true,
168
- "buffer_seconds": 60.206386421379904,
169
  "buffer_drain_seconds": null,
170
  "shard_target_mib": 16,
171
- "upload_pages_per_commit": 79,
172
  "max_pending_pages": 4096,
173
- "generation_bytes_per_second": 434030.52152475435,
174
- "upload_bytes_per_second": 2903125.768790339,
175
  "upload_sustainable": true,
176
  "logical_page_rows": 4096,
177
  "logical_cortex_page_rows": 128,
178
- "estimated_full_shards_per_hour": 93.13284620577787,
179
  "selection_policy": "Smallest shard within 90% of measured local peak, enlarged to amortize 30 seconds of measured page production; bounded to 256 MiB."
180
  },
181
  "upload_measurements": [
182
- {
183
- "seconds": 1.3232240569996065,
184
- "bytes": 8048155,
185
- "pages": 41,
186
- "shards": 3
187
- },
188
  {
189
  "seconds": 3.3732278300012695,
190
  "bytes": 11426245,
@@ -562,6 +556,12 @@
562
  "bytes": 2721542,
563
  "pages": 39,
564
  "shards": 2
 
 
 
 
 
 
565
  }
566
  ],
567
  "cache_key": {
 
22
  "tokens_per_second": 598315.063954628,
23
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
24
  "estimated_pages_for_buffer": 1,
25
+ "required_token_positions_per_second": 76578.36655994454,
26
+ "required_pages_per_second_upper_estimate": 0.0052978690849077754
27
  },
28
  {
29
  "source": "rewrite6",
 
36
  "tokens_per_second": 8533.957213384612,
37
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
38
  "estimated_pages_for_buffer": 1,
39
+ "required_token_positions_per_second": 9572.295819993067,
40
+ "required_pages_per_second_upper_estimate": 0.0040077203675638684
41
  },
42
  {
43
  "source": "openmath",
 
50
  "tokens_per_second": 380144.35761751566,
51
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
52
  "estimated_pages_for_buffer": 1,
53
+ "required_token_positions_per_second": 19144.591639986134,
54
+ "required_pages_per_second_upper_estimate": 0.0039873135617760685
55
  },
56
  {
57
  "source": "ultra_qa",
 
64
  "tokens_per_second": 43742.16556775435,
65
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
66
  "estimated_pages_for_buffer": 1,
67
+ "required_token_positions_per_second": 28716.887459979203,
68
+ "required_pages_per_second_upper_estimate": 0.001721533555077492
69
  },
70
  {
71
  "source": "ultra_style",
 
78
  "tokens_per_second": 22018.86276523721,
79
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
80
  "estimated_pages_for_buffer": 1,
81
+ "required_token_positions_per_second": 28716.887459979203,
82
+ "required_pages_per_second_upper_estimate": 0.0022326116877745355
83
  },
84
  {
85
  "source": "cortex",
 
92
  "tokens_per_second": 910315.184299418,
93
  "note": "Bounded fresh sample; full-page latency is an extrapolation.",
94
  "estimated_pages_for_buffer": 23,
95
+ "required_token_positions_per_second": 28716.887459979203,
96
+ "required_pages_per_second_upper_estimate": 0.3683493985451598
97
  }
98
  ],
99
  "gpu_measurement": "Selected forward/backward estimate; replaced by live successful update timings.",
 
158
  "prefetch_batches": 63,
159
  "prefetch_capacity_limit": 512,
160
  "batch_memory_estimate_bytes": 720750,
161
+ "producer_batch_seconds": 0.09964710097636953,
162
+ "producer_p95_seconds": 0.3395600780058885,
163
+ "gpu_update_seconds": 0.9627784361564657,
164
+ "producer_batches_per_second": 10.035414881132784,
165
+ "gpu_batches_per_second": 1.0386605707457757,
166
+ "producer_headroom": 9.661881045438347,
167
  "sustainable": true,
168
+ "buffer_seconds": 60.65504147785734,
169
  "buffer_drain_seconds": null,
170
  "shard_target_mib": 16,
171
+ "upload_pages_per_commit": 87,
172
  "max_pending_pages": 4096,
173
+ "generation_bytes_per_second": 454172.71488623496,
174
+ "upload_bytes_per_second": 2881985.7215351244,
175
  "upload_sustainable": true,
176
  "logical_page_rows": 4096,
177
  "logical_cortex_page_rows": 128,
178
+ "estimated_full_shards_per_hour": 97.45489201488768,
179
  "selection_policy": "Smallest shard within 90% of measured local peak, enlarged to amortize 30 seconds of measured page production; bounded to 256 MiB."
180
  },
181
  "upload_measurements": [
 
 
 
 
 
 
182
  {
183
  "seconds": 3.3732278300012695,
184
  "bytes": 11426245,
 
556
  "bytes": 2721542,
557
  "pages": 39,
558
  "shards": 2
559
+ },
560
+ {
561
+ "seconds": 1.6763505359995179,
562
+ "bytes": 5924226,
563
+ "pages": 29,
564
+ "shards": 2
565
  }
566
  ],
567
  "cache_key": {
metrics/void-byte-v1/1791342976705245012-6808dd50/train.jsonl CHANGED
@@ -434,3 +434,4 @@
434
  {"step": 885900, "loss": 0.6447805762290955, "lr": 3e-05, "grad_norm": 0.35156226701477516, "recovery_retries": 0, "loss_scale": 1.0, "microbatch": 90, "input_bytes_and_specials": 129670955519, "tokens_per_second": 150993.02279477424, "data_wait_s": 1.1322001228109002e-05, "gpu_peak_gb": 89.37899398803711}
435
  {"step": 886000, "loss": 0.54771488904953, "lr": 3e-05, "grad_norm": 0.31169686749996584, "recovery_retries": 0, "loss_scale": 1.0, "microbatch": 90, "input_bytes_and_specials": 129685560151, "tokens_per_second": 151801.6015801023, "data_wait_s": 1.4566001482307911e-05, "gpu_peak_gb": 89.37899398803711}
436
  {"step": 886100, "loss": 0.4592820107936859, "lr": 3e-05, "grad_norm": 0.31501846194969857, "recovery_retries": 0, "loss_scale": 1.0, "microbatch": 90, "input_bytes_and_specials": 129700265402, "tokens_per_second": 152859.72386339528, "data_wait_s": 1.7710997781250626e-05, "gpu_peak_gb": 89.37899398803711}
 
 
434
  {"step": 885900, "loss": 0.6447805762290955, "lr": 3e-05, "grad_norm": 0.35156226701477516, "recovery_retries": 0, "loss_scale": 1.0, "microbatch": 90, "input_bytes_and_specials": 129670955519, "tokens_per_second": 150993.02279477424, "data_wait_s": 1.1322001228109002e-05, "gpu_peak_gb": 89.37899398803711}
435
  {"step": 886000, "loss": 0.54771488904953, "lr": 3e-05, "grad_norm": 0.31169686749996584, "recovery_retries": 0, "loss_scale": 1.0, "microbatch": 90, "input_bytes_and_specials": 129685560151, "tokens_per_second": 151801.6015801023, "data_wait_s": 1.4566001482307911e-05, "gpu_peak_gb": 89.37899398803711}
436
  {"step": 886100, "loss": 0.4592820107936859, "lr": 3e-05, "grad_norm": 0.31501846194969857, "recovery_retries": 0, "loss_scale": 1.0, "microbatch": 90, "input_bytes_and_specials": 129700265402, "tokens_per_second": 152859.72386339528, "data_wait_s": 1.7710997781250626e-05, "gpu_peak_gb": 89.37899398803711}
437
+ {"step": 886200, "loss": 0.5351279377937317, "lr": 3e-05, "grad_norm": 0.3124352346805511, "recovery_retries": 0, "loss_scale": 1.0, "microbatch": 90, "input_bytes_and_specials": 129714919216, "tokens_per_second": 152400.64649286724, "data_wait_s": 1.4372999430634081e-05, "gpu_peak_gb": 89.37899398803711}
runs/void-byte-v1/events.out.tfevents.1791342976.f74d737f-395e-43a1-ae69-439b0359d002-2qp5c.418.0.1791342976705245012-6808dd50 CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b512c4311ace615b7c303a982b8d977b58d3d7bf0f263825fee197f23b9f5c76
3
- size 930660
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3dcbcef8928077e278a4f98411051efbc04293c040950ca7dcd724f30eb95c81
3
+ size 932778