{ "model_type": "pivot", "architectures": [ "PivotModel" ], "auto_map": { "AutoConfig": "configuration_pivot.PivotConfig", "AutoModel": "modeling_pivot.PivotModel" }, "dsbt_config": { "backbone": { "encoder": "huggingface", "model_id": "LiquidAI/LFM2.5-Encoder-350M", "revision": "b886781f7c6f10ca9b7096e21b83e30a073c2f39", "trust_remote_code": true }, "scorer": { "type": "mlp", "hidden_size": 1024 }, "data": { "k_min": 2, "k_max": 16, "max_context_tokens": 512, "max_option_tokens": 64, "noul_true": "true", "noul_false": "false", "split_ratios": [ 0.8, 0.1, 0.1 ], "family_sample_caps": { "casehold": 0.15 } }, "train": { "epochs": 8, "warmup_epochs": 2, "min_pcgrad_epochs": 4, "batch_size": 64, "grad_accum": 1, "lr_encoder": 1e-05, "lr_scorer": 5e-05, "lr_schedule": "cosine", "lr_warmup_ratio": 0.05, "lr_min_ratio": 0.1, "weight_decay": 0.01, "grad_clip": 1.0, "precision": "bf16", "seed": 42, "decoupling": "pcgrad", "log_every": 100, "num_workers": 8, "early_stop_patience": 2, "lora": { "enabled": false } }, "eval": { "k_strata": [ 2, 4, 8, 16 ], "ece_bins": 15, "batch_size": 128, "temperature_scaling": false }, "brier": { "reduction": "mean_over_real_options" }, "serving": { "max_context_tokens": 512, "max_option_tokens": 128 } }, "encoder_config": { "transformers_version": "5.17.0", "architectures": [ "Lfm2BidirectionalForMaskedLM" ], "output_hidden_states": false, "return_dict": true, "dtype": "float32", "chunk_size_feed_forward": 0, "is_encoder_decoder": false, "id2label": { "0": "LABEL_0", "1": "LABEL_1" }, "label2id": { "LABEL_0": 0, "LABEL_1": 1 }, "problem_type": null, "vocab_size": 65536, "hidden_size": 1024, "intermediate_size": 6656, "num_hidden_layers": 16, "num_attention_heads": 16, "num_key_value_heads": 8, "max_position_embeddings": 128000, "initializer_range": 0.02, "norm_eps": 1e-05, "use_cache": false, "pad_token_id": 0, "bos_token_id": 1, "eos_token_id": 7, "tie_word_embeddings": true, "rope_parameters": { "rope_theta": 1000000.0, "rope_type": "default" }, "conv_bias": false, "conv_L_cache": 3, "block_multiple_of": 256, "block_ffn_dim_multiplier": 1.0, "block_auto_adjust_ff_dim": true, "full_attn_idxs": null, "layer_types": [ "conv", "conv", "full_attention", "conv", "conv", "full_attention", "conv", "conv", "full_attention", "conv", "full_attention", "conv", "full_attention", "conv", "full_attention", "conv" ], "_name_or_path": "LiquidAI/LFM2.5-Encoder-350M", "block_dim": 1024, "block_mlp_init_scale": 1.0, "block_norm_eps": 1e-05, "block_out_init_scale": 1.0, "block_use_swiglu": true, "block_use_xavier_init": true, "conv_dim": 1024, "conv_dim_out": 1024, "conv_use_xavier_init": true, "model_type": "lfm2", "num_heads": 16, "use_pos_enc": true, "auto_map": { "AutoModel": "modeling_lfm2_bidirectional.Lfm2BidirectionalModel", "AutoModelForMaskedLM": "modeling_lfm2_bidirectional.Lfm2BidirectionalForMaskedLM" }, "output_attentions": false }, "pivot_training": { "selected_epoch": 7, "global_step": 18008, "method": "CE warmup -> live multiclass Brier + PCGrad", "probability_contract": "softmax(logits.float())" } }