Update tokenizer, configuration and training reports
Browse files
reports/run/metrics.jsonl
CHANGED
|
@@ -46,3 +46,5 @@
|
|
| 46 |
{"step": 920, "tokens": 482344960, "loss": 3.551728057861328, "tokens_per_second": 985259.8203679301, "lr": 0.0006900000000000001, "gradient_norm": 0.3959476351737976, "benchmark": false}
|
| 47 |
{"step": 940, "tokens": 492830720, "loss": 3.52474365234375, "tokens_per_second": 986379.5885503634, "lr": 0.000705, "gradient_norm": 0.3469522297382355, "benchmark": false}
|
| 48 |
{"step": 960, "tokens": 503316480, "loss": 3.5565567016601562, "tokens_per_second": 991150.2588607525, "lr": 0.0007199999999999999, "gradient_norm": 0.3613435924053192, "benchmark": false}
|
|
|
|
|
|
|
|
|
| 46 |
{"step": 920, "tokens": 482344960, "loss": 3.551728057861328, "tokens_per_second": 985259.8203679301, "lr": 0.0006900000000000001, "gradient_norm": 0.3959476351737976, "benchmark": false}
|
| 47 |
{"step": 940, "tokens": 492830720, "loss": 3.52474365234375, "tokens_per_second": 986379.5885503634, "lr": 0.000705, "gradient_norm": 0.3469522297382355, "benchmark": false}
|
| 48 |
{"step": 960, "tokens": 503316480, "loss": 3.5565567016601562, "tokens_per_second": 991150.2588607525, "lr": 0.0007199999999999999, "gradient_norm": 0.3613435924053192, "benchmark": false}
|
| 49 |
+
{"step": 980, "tokens": 513802240, "loss": 3.534979248046875, "tokens_per_second": 954816.5784302262, "lr": 0.000735, "gradient_norm": 0.36277028918266296, "benchmark": false}
|
| 50 |
+
{"step": 1000, "tokens": 524288000, "loss": 3.512640380859375, "tokens_per_second": 982882.901952814, "lr": 0.00075, "gradient_norm": 0.36223894357681274, "benchmark": false}
|
reports/run/validation.jsonl
ADDED
|
@@ -0,0 +1 @@
|
|
|
|
|
|
|
| 1 |
+
{"step": 1000, "source_validation_loss": {"fineweb_edu": 3.6357946395874023, "dclm_edu": 3.6318132877349854, "cosmopedia": 2.9174532890319824, "finemath": 2.940213680267334}}
|