{ "model_name": "Sol Lassi 600K Base", "backend": "MLX", "architecture": "DenseControlLM / dense-deep", "parameters": 600000, "optimizer": "M-SimOW", "optimizer_beta": 0.8, "weight_decay": 0.1, "learning_rate_schedule": [ {"tokens": 500000000, "learning_rate": 0.006}, {"tokens": 500000000, "learning_rate": 0.003} ], "training_tokens": 1000000000, "context_length": 128, "batch_size": 32, "seed": 7, "dataset": "HuggingFaceFW/finephrase", "dataset_revision": "78cf4a5ed0099214979c094c963e699c19163838", "dataset_manifest": "finephrase-balanced-500m-2k-v2", "dataset_configs": ["faq", "math", "table", "tutorial"], "dataset_split_method": "source-id-disjoint SHA-256 split", "training_loss_note": "The trainer recorded per-minibatch loss; no validation or benchmark result is claimed in this release." }