Download checkpoint.json from Akagi201/longburn: direct link, hf CLI and curl.
- Browser
- Download file 1.77 kB
-
https://huggingface.co/Akagi201/longburn/resolve/main/checkpoint.json
- Command line
-
hf download hf://Akagi201/longburn/checkpoint.json
-
curl -L -o checkpoint.json https://huggingface.co/Akagi201/longburn/resolve/main/checkpoint.json
1.77 kB
| { | |
| "version": 1, | |
| "trainer_config": { | |
| "optimizer": { | |
| "learning_rate": 0.003, | |
| "encoder_lr": 0.003, | |
| "head_lr": 0.003, | |
| "weight_decay": 0.0001, | |
| "max_grad_norm": 1.0, | |
| "warmup_steps": 100, | |
| "scheduler": "Cosine", | |
| "min_lr": 1e-06, | |
| "optimizer_type": "AdamW" | |
| }, | |
| "loss": { | |
| "log_score_weight": 1.0, | |
| "spherical_weight": 0.75, | |
| "rps_weight": 1.0, | |
| "epsilon": 1e-07 | |
| }, | |
| "total_steps": 1880, | |
| "num_epochs": 40, | |
| "batch_size": 64, | |
| "validation_split": 0.0, | |
| "early_stopping_patience": 3, | |
| "grad_accum_steps": 1, | |
| "log_interval": 20, | |
| "checkpoint_interval": 0 | |
| }, | |
| "optimizer_config": { | |
| "learning_rate": 0.003, | |
| "encoder_lr": 0.003, | |
| "head_lr": 0.003, | |
| "weight_decay": 0.0001, | |
| "max_grad_norm": 1.0, | |
| "warmup_steps": 100, | |
| "scheduler": "Cosine", | |
| "min_lr": 1e-06, | |
| "optimizer_type": "AdamW" | |
| }, | |
| "model_config": { | |
| "encoder": { | |
| "vocab_size": 261, | |
| "hidden_size": 128, | |
| "num_layers": 2, | |
| "num_heads": 4, | |
| "max_seq_len": 256, | |
| "dropout": 0.1, | |
| "sliding_window": 64, | |
| "global_attn_every_n_layers": 2, | |
| "rope_theta_global": 160000.0, | |
| "rope_theta_local": 10000.0, | |
| "ffn_hidden_size": 0, | |
| "norm_epsilon": 1e-05, | |
| "activation": "Gelu" | |
| }, | |
| "head": { | |
| "attention": { | |
| "input_size": 128, | |
| "rank": 32, | |
| "num_reads": 1, | |
| "dropout": 0.0 | |
| }, | |
| "hidden_size": 128, | |
| "num_types": 3, | |
| "num_heads": 4, | |
| "num_head_layers": 1, | |
| "max_options": 32, | |
| "dropout": 0.1 | |
| }, | |
| "option_embedding_size": 64 | |
| }, | |
| "epoch": 8, | |
| "batch": 0, | |
| "best_val_loss": 0.08570641155044238, | |
| "weights_path": "model.weights" | |
| } | |