lfm2-700m-linux-command / train_record.json
thealper2's picture
Add fine-tuned LFM2-700M NL->command model
bc6c786 verified
Raw History Blame Contribute Delete
16.5 kB
{
"stage": "train",
"timestamp": "2026-09-21T11:15:01+00:00",
"model_name": "LiquidAI/LFM2-700M",
"seed": 42,
"config": {
"paths": {
"data_dir": "data",
"raw_dir": "data/raw",
"processed_dir": "data/processed",
"train_dir": "data/train",
"validation_dir": "data/validation",
"test_dir": "data/test",
"reports_dir": "reports",
"outputs_dir": "outputs"
},
"data": {
"nl2bash_repo": "jiacheng-ye/nl2bash",
"linux_commands_repo": "mecha-org/linux-command-dataset",
"nl2bash_archive_url": "https://www.dropbox.com/s/wy7uahzbir7lrq1/nl2bash.zip?dl=1",
"min_instruction_chars": 5,
"min_command_chars": 2,
"max_instruction_chars": 600,
"max_command_chars": 600,
"head_command_cap": 2500,
"exact_command_cap": 40,
"near_duplicate_threshold": 0.9,
"drop_near_duplicates": false,
"split_grouping": "template",
"train_ratio": 0.9,
"validation_ratio": 0.05,
"test_ratio": 0.05,
"seed": 42
},
"model": {
"model_name": "LiquidAI/LFM2-700M",
"dtype": "bfloat16",
"attn_implementation": "sdpa",
"system_prompt": null,
"max_length": 128,
"trust_remote_code": false
},
"lora": {
"r": 32,
"alpha": 64,
"dropout": 0.05,
"target_modules": [
"q_proj",
"k_proj",
"v_proj",
"out_proj",
"w1",
"w2",
"w3",
"in_proj"
],
"exclude_modules": [
"conv.conv"
],
"modules_to_save": []
},
"training": {
"method": "full",
"output_dir": "outputs/lfm2-linux-command",
"run_name": "lfm2-700m-linux-command",
"num_train_epochs": 3,
"per_device_train_batch_size": 16,
"per_device_eval_batch_size": 32,
"gradient_accumulation_steps": 2,
"learning_rate": 3e-05,
"lr_scheduler_type": "cosine",
"warmup_ratio": 0.03,
"weight_decay": 0.01,
"max_grad_norm": 1.0,
"optim": "adamw_torch_fused",
"adam_beta1": 0.9,
"adam_beta2": 0.95,
"adam_epsilon": 1e-08,
"bf16": true,
"fp16": false,
"gradient_checkpointing": false,
"group_by_length": true,
"logging_steps": 20,
"eval_strategy": "epoch",
"save_strategy": "epoch",
"save_total_limit": 2,
"load_best_model_at_end": true,
"metric_for_best_model": "eval_loss",
"greater_is_better": false,
"early_stopping_patience": 2,
"dataloader_num_workers": 4,
"seed": 42,
"report_to": []
},
"generation": {
"max_new_tokens": 128,
"do_sample": false,
"temperature": 1.0,
"top_p": 1.0,
"num_beams": 1,
"repetition_penalty": 1.0,
"batch_size": 32
},
"evaluation": {
"limit": null,
"execute_in_sandbox": false,
"sandbox_image": "linux-cmd-sandbox:latest",
"sandbox_timeout_s": 10,
"sandbox_memory": "256m",
"sandbox_cpus": "1.0",
"sandbox_pids_limit": 128,
"sandbox_network": false,
"max_execution_examples": 200
}
},
"environment": {
"python": "3.12.3",
"platform": "Linux-6.18.33.2-microsoft-standard-WSL2-x86_64-with-glibc2.39",
"torch": "2.11.0+cu128",
"transformers": "5.17.0",
"git_revision": null,
"datasets": "4.3.0",
"peft": "0.18.1",
"accelerate": "1.12.0",
"trl": "0.24.0",
"gpu": "NVIDIA GeForce RTX 5060 Ti",
"gpu_memory_gb": 15.9,
"cuda": "12.8"
},
"result": {
"method": "full",
"parameters": {
"total": 742489344,
"trainable": 742489344
},
"tokenization": {
"train": {
"encoded": 11756,
"skipped_too_long": 6,
"skipped_empty_target": 0
},
"validation": {
"encoded": 652,
"skipped_too_long": 2,
"skipped_empty_target": 0
}
},
"num_train_examples": 11756,
"num_validation_examples": 652,
"num_test_examples": 653,
"train_runtime_s": 425.0,
"train_metrics": {
"train_runtime": 416.811,
"train_samples_per_second": 84.614,
"train_steps_per_second": 2.649,
"total_flos": 5049728172804096.0,
"train_loss": 0.5160034051623897,
"epoch": 3.0
},
"eval_metrics": {
"eval_loss": 0.6445356011390686,
"eval_runtime": 2.2801,
"eval_samples_per_second": 285.956,
"eval_steps_per_second": 9.21,
"epoch": 3.0
},
"peak_vram_gb": 8.95,
"log_history": [
{
"loss": 2.2648730278015137,
"grad_norm": 26.875,
"learning_rate": 0.0,
"epoch": 0.0027210884353741495,
"step": 1
},
{
"loss": 2.3296870181435034,
"grad_norm": 20.5,
"learning_rate": 1.6764705882352943e-05,
"epoch": 0.05442176870748299,
"step": 20
},
{
"loss": 1.2557416915893556,
"grad_norm": 15.5625,
"learning_rate": 2.999838368626891e-05,
"epoch": 0.10884353741496598,
"step": 40
},
{
"loss": 1.2152017593383788,
"grad_norm": 10.625,
"learning_rate": 2.995960957056267e-05,
"epoch": 0.16326530612244897,
"step": 60
},
{
"loss": 1.0797980308532715,
"grad_norm": 10.6875,
"learning_rate": 2.986926658161179e-05,
"epoch": 0.21768707482993196,
"step": 80
},
{
"loss": 0.7814510822296142,
"grad_norm": 22.875,
"learning_rate": 2.9727666150414773e-05,
"epoch": 0.272108843537415,
"step": 100
},
{
"loss": 1.1167201042175292,
"grad_norm": 7.40625,
"learning_rate": 2.953529640299211e-05,
"epoch": 0.32653061224489793,
"step": 120
},
{
"loss": 0.7122071743011474,
"grad_norm": 12.1875,
"learning_rate": 2.929282047771477e-05,
"epoch": 0.38095238095238093,
"step": 140
},
{
"loss": 0.8981359481811524,
"grad_norm": 7.78125,
"learning_rate": 2.9001074239328856e-05,
"epoch": 0.43537414965986393,
"step": 160
},
{
"loss": 0.8201946258544922,
"grad_norm": 8.25,
"learning_rate": 2.8661063397556667e-05,
"epoch": 0.4897959183673469,
"step": 180
},
{
"loss": 0.6475086212158203,
"grad_norm": 13.125,
"learning_rate": 2.8273960040206944e-05,
"epoch": 0.54421768707483,
"step": 200
},
{
"loss": 0.9737781524658203,
"grad_norm": 8.3125,
"learning_rate": 2.7841098592745374e-05,
"epoch": 0.5986394557823129,
"step": 220
},
{
"loss": 0.6579679012298584,
"grad_norm": 12.125,
"learning_rate": 2.7363971218253575e-05,
"epoch": 0.6530612244897959,
"step": 240
},
{
"loss": 0.803803539276123,
"grad_norm": 7.0625,
"learning_rate": 2.684422267363384e-05,
"epoch": 0.7074829931972789,
"step": 260
},
{
"loss": 0.742891788482666,
"grad_norm": 9.8125,
"learning_rate": 2.628364463979135e-05,
"epoch": 0.7619047619047619,
"step": 280
},
{
"loss": 0.5735934257507325,
"grad_norm": 8.8125,
"learning_rate": 2.568416954533894e-05,
"epoch": 0.8163265306122449,
"step": 300
},
{
"loss": 0.8808271408081054,
"grad_norm": 7.03125,
"learning_rate": 2.5047863905115338e-05,
"epoch": 0.8707482993197279,
"step": 320
},
{
"loss": 0.5917014122009278,
"grad_norm": 9.0625,
"learning_rate": 2.4376921196480406e-05,
"epoch": 0.9251700680272109,
"step": 340
},
{
"loss": 0.629461145401001,
"grad_norm": 9.375,
"learning_rate": 2.3673654297944308e-05,
"epoch": 0.9795918367346939,
"step": 360
},
{
"eval_loss": 0.7183327674865723,
"eval_runtime": 1.8387,
"eval_samples_per_second": 354.607,
"eval_steps_per_second": 11.421,
"epoch": 1.0,
"step": 368
},
{
"loss": 0.5892221450805664,
"grad_norm": 6.40625,
"learning_rate": 2.29404875161961e-05,
"epoch": 1.0326530612244897,
"step": 380
},
{
"loss": 0.4322396755218506,
"grad_norm": 7.875,
"learning_rate": 2.2179948229016393e-05,
"epoch": 1.0870748299319728,
"step": 400
},
{
"loss": 0.2959575176239014,
"grad_norm": 7.21875,
"learning_rate": 2.139465817288254e-05,
"epoch": 1.1414965986394559,
"step": 420
},
{
"loss": 0.5574175834655761,
"grad_norm": 9.5625,
"learning_rate": 2.0587324405299893e-05,
"epoch": 1.1959183673469387,
"step": 440
},
{
"loss": 0.3074038982391357,
"grad_norm": 6.9375,
"learning_rate": 1.9760729973013758e-05,
"epoch": 1.2503401360544217,
"step": 460
},
{
"loss": 0.4826845169067383,
"grad_norm": 7.40625,
"learning_rate": 1.8917724318270762e-05,
"epoch": 1.3047619047619048,
"step": 480
},
{
"loss": 0.37243363857269285,
"grad_norm": 8.0625,
"learning_rate": 1.806121345620111e-05,
"epoch": 1.3591836734693876,
"step": 500
},
{
"loss": 0.29408578872680663,
"grad_norm": 6.65625,
"learning_rate": 1.7194149957182412e-05,
"epoch": 1.4136054421768707,
"step": 520
},
{
"loss": 0.523699426651001,
"grad_norm": 8.0,
"learning_rate": 1.6319522768717947e-05,
"epoch": 1.4680272108843537,
"step": 540
},
{
"loss": 0.27834906578063967,
"grad_norm": 7.0625,
"learning_rate": 1.544034691191541e-05,
"epoch": 1.5224489795918368,
"step": 560
},
{
"loss": 0.45731005668640134,
"grad_norm": 7.34375,
"learning_rate": 1.455965308808459e-05,
"epoch": 1.5768707482993198,
"step": 580
},
{
"loss": 0.36221044063568114,
"grad_norm": 7.4375,
"learning_rate": 1.3680477231282058e-05,
"epoch": 1.6312925170068027,
"step": 600
},
{
"loss": 0.28891568183898925,
"grad_norm": 7.8125,
"learning_rate": 1.280585004281759e-05,
"epoch": 1.6857142857142857,
"step": 620
},
{
"loss": 0.5141252517700196,
"grad_norm": 7.1875,
"learning_rate": 1.1938786543798891e-05,
"epoch": 1.7401360544217686,
"step": 640
},
{
"loss": 0.29115273952484133,
"grad_norm": 5.3125,
"learning_rate": 1.1082275681729237e-05,
"epoch": 1.7945578231292516,
"step": 660
},
{
"loss": 0.41370329856872556,
"grad_norm": 5.90625,
"learning_rate": 1.0239270026986243e-05,
"epoch": 1.8489795918367347,
"step": 680
},
{
"loss": 0.3591457366943359,
"grad_norm": 7.90625,
"learning_rate": 9.412675594700113e-06,
"epoch": 1.9034013605442177,
"step": 700
},
{
"loss": 0.27732415199279786,
"grad_norm": 6.96875,
"learning_rate": 8.605341827117464e-06,
"epoch": 1.9578231292517008,
"step": 720
},
{
"eval_loss": 0.6445356011390686,
"eval_runtime": 1.8506,
"eval_samples_per_second": 352.315,
"eval_steps_per_second": 11.348,
"epoch": 2.0,
"step": 736
},
{
"loss": 0.3676326751708984,
"grad_norm": 5.59375,
"learning_rate": 7.820051770983611e-06,
"epoch": 2.0108843537414964,
"step": 740
},
{
"loss": 0.3336158752441406,
"grad_norm": 5.375,
"learning_rate": 7.059512483803904e-06,
"epoch": 2.0653061224489795,
"step": 760
},
{
"loss": 0.16438820362091064,
"grad_norm": 5.78125,
"learning_rate": 6.326345702055698e-06,
"epoch": 2.1197278911564625,
"step": 780
},
{
"loss": 0.3438990592956543,
"grad_norm": 5.6875,
"learning_rate": 5.623078803519595e-06,
"epoch": 2.1741496598639456,
"step": 800
},
{
"loss": 0.21838486194610596,
"grad_norm": 4.8125,
"learning_rate": 4.952136094884666e-06,
"epoch": 2.2285714285714286,
"step": 820
},
{
"loss": 0.2150651216506958,
"grad_norm": 6.75,
"learning_rate": 4.315830454661059e-06,
"epoch": 2.2829931972789117,
"step": 840
},
{
"loss": 0.34454209804534913,
"grad_norm": 6.125,
"learning_rate": 3.7163553602086496e-06,
"epoch": 2.3374149659863948,
"step": 860
},
{
"loss": 0.14302738904953002,
"grad_norm": 4.8125,
"learning_rate": 3.1557773263661605e-06,
"epoch": 2.3918367346938774,
"step": 880
},
{
"loss": 0.32184672355651855,
"grad_norm": 6.03125,
"learning_rate": 2.6360287817464257e-06,
"epoch": 2.4462585034013604,
"step": 900
},
{
"loss": 0.1849319100379944,
"grad_norm": 6.15625,
"learning_rate": 2.1589014072546294e-06,
"epoch": 2.5006802721088435,
"step": 920
},
{
"loss": 0.20881271362304688,
"grad_norm": 6.71875,
"learning_rate": 1.7260399597930592e-06,
"epoch": 2.5551020408163265,
"step": 940
},
{
"loss": 0.31119983196258544,
"grad_norm": 7.0625,
"learning_rate": 1.3389366024433347e-06,
"epoch": 2.6095238095238096,
"step": 960
},
{
"loss": 0.1483125329017639,
"grad_norm": 4.1875,
"learning_rate": 9.989257606711437e-07,
"epoch": 2.6639455782312926,
"step": 980
},
{
"loss": 0.3087357997894287,
"grad_norm": 7.09375,
"learning_rate": 7.071795222852296e-07,
"epoch": 2.7183673469387752,
"step": 1000
},
{
"loss": 0.19563177824020386,
"grad_norm": 4.96875,
"learning_rate": 4.6470359700789e-07,
"epoch": 2.7727891156462583,
"step": 1020
},
{
"loss": 0.1930193543434143,
"grad_norm": 6.15625,
"learning_rate": 2.7233384958522675e-07,
"epoch": 2.8272108843537413,
"step": 1040
},
{
"loss": 0.29953775405883787,
"grad_norm": 6.59375,
"learning_rate": 1.3073341838821028e-07,
"epoch": 2.8816326530612244,
"step": 1060
},
{
"loss": 0.15995726585388184,
"grad_norm": 5.40625,
"learning_rate": 4.039042943733251e-08,
"epoch": 2.9360544217687075,
"step": 1080
},
{
"loss": 0.20271103382110595,
"grad_norm": 5.5,
"learning_rate": 1.616313731091501e-09,
"epoch": 2.9904761904761905,
"step": 1100
},
{
"eval_loss": 0.6698360443115234,
"eval_runtime": 2.3865,
"eval_samples_per_second": 273.207,
"eval_steps_per_second": 8.8,
"epoch": 3.0,
"step": 1104
},
{
"train_runtime": 416.811,
"train_samples_per_second": 84.614,
"train_steps_per_second": 2.649,
"total_flos": 5049728172804096.0,
"train_loss": 0.5160034051623897,
"epoch": 3.0,
"step": 1104
},
{
"eval_loss": 0.6445356011390686,
"eval_runtime": 2.2801,
"eval_samples_per_second": 285.956,
"eval_steps_per_second": 9.21,
"epoch": 3.0,
"step": 1104
}
],
"runtime": {
"torch_version": "2.11.0+cu128",
"transformers_version": "5.17.0",
"cuda_available": true,
"dtype": "bfloat16",
"attn_implementation": "sdpa",
"gpu_name": "NVIDIA GeForce RTX 5060 Ti",
"gpu_total_memory_gb": 15.9,
"gpu_capability": "12.0"
}
}
}