Modilify-Mk2-preview-mlx / export_manifest.json
ydy9038074's picture
Publish Modilify Mk2 Preview MLX
e4f7326 verified
Raw History Blame Contribute Delete
308 kB
{
"format": "modilify_mk2_native_mlx_inference_v1",
"created_at": "2026-10-06T07:00:46.116333+00:00",
"state_schema_version": 25,
"training_scheme": "gold_prefix_shared_commit_0_256_committed_ce_calibration_causal_throughput_terminal_sft",
"memory_scheme": "dual_timescale_gdn2_trajectory_memory",
"memory_architecture": "compact_gdn2_v2",
"global_step": 1250,
"lora_config": {
"r": 16,
"alpha": 16,
"dropout": 0.05,
"target_modules": [
"q_proj",
"k_proj",
"v_proj",
"o_proj",
"gate_proj",
"up_proj",
"down_proj",
"proj"
],
"expert_r": 8,
"expert_alpha": 8
},
"precision_policy": "gdn2_small_fp32_v1",
"release_version": "1.0.0",
"model_id": "Modilify/Modilify-Mk2-preview-mlx",
"base_model": "google/diffusiongemma-26B-A4B-it",
"source_manifest_sha256": "450600bb96c5d3d2c85dff82e7de2bede33a20df142f57c1f765b71322bbb827",
"trainable_names": [
"latent_deliberation.blocks.0.attn.k_norm.weight",
"latent_deliberation.blocks.0.attn.k_proj.weight",
"latent_deliberation.blocks.0.attn.o_proj.weight",
"latent_deliberation.blocks.0.attn.q_norm.weight",
"latent_deliberation.blocks.0.attn.q_proj.weight",
"latent_deliberation.blocks.0.attn.v_proj.weight",
"latent_deliberation.blocks.0.ff.down.weight",
"latent_deliberation.blocks.0.ff.gate.weight",
"latent_deliberation.blocks.0.ff.up.weight",
"latent_deliberation.blocks.0.ff_norm.weight",
"latent_deliberation.blocks.0.norm.weight",
"latent_deliberation.blocks.1.attn.k_norm.weight",
"latent_deliberation.blocks.1.attn.k_proj.weight",
"latent_deliberation.blocks.1.attn.o_proj.weight",
"latent_deliberation.blocks.1.attn.q_norm.weight",
"latent_deliberation.blocks.1.attn.q_proj.weight",
"latent_deliberation.blocks.1.attn.v_proj.weight",
"latent_deliberation.blocks.1.ff.down.weight",
"latent_deliberation.blocks.1.ff.gate.weight",
"latent_deliberation.blocks.1.ff.up.weight",
"latent_deliberation.blocks.1.ff_norm.weight",
"latent_deliberation.blocks.1.norm.weight",
"latent_deliberation.blocks.2.attn.k_norm.weight",
"latent_deliberation.blocks.2.attn.k_proj.weight",
"latent_deliberation.blocks.2.attn.o_proj.weight",
"latent_deliberation.blocks.2.attn.q_norm.weight",
"latent_deliberation.blocks.2.attn.q_proj.weight",
"latent_deliberation.blocks.2.attn.v_proj.weight",
"latent_deliberation.blocks.2.ff.down.weight",
"latent_deliberation.blocks.2.ff.gate.weight",
"latent_deliberation.blocks.2.ff.up.weight",
"latent_deliberation.blocks.2.ff_norm.weight",
"latent_deliberation.blocks.2.norm.weight",
"latent_deliberation.blocks.3.attn.k_norm.weight",
"latent_deliberation.blocks.3.attn.k_proj.weight",
"latent_deliberation.blocks.3.attn.o_proj.weight",
"latent_deliberation.blocks.3.attn.q_norm.weight",
"latent_deliberation.blocks.3.attn.q_proj.weight",
"latent_deliberation.blocks.3.attn.v_proj.weight",
"latent_deliberation.blocks.3.ff.down.weight",
"latent_deliberation.blocks.3.ff.gate.weight",
"latent_deliberation.blocks.3.ff.up.weight",
"latent_deliberation.blocks.3.ff_norm.weight",
"latent_deliberation.blocks.3.norm.weight",
"latent_deliberation.experience_in.weight",
"latent_deliberation.output_norm.weight",
"latent_deliberation.persistent_memory_bus.alpha",
"latent_deliberation.reason_embed.weight",
"latent_deliberation.trajectory.cell.a_log",
"latent_deliberation.trajectory.cell.b_proj.weight",
"latent_deliberation.trajectory.cell.dt_bias",
"latent_deliberation.trajectory.cell.f_proj.down.weight",
"latent_deliberation.trajectory.cell.f_proj.up.weight",
"latent_deliberation.trajectory.cell.g_proj.down.weight",
"latent_deliberation.trajectory.cell.g_proj.up.weight",
"latent_deliberation.trajectory.cell.k_proj.weight",
"latent_deliberation.trajectory.cell.o_proj.weight",
"latent_deliberation.trajectory.cell.q_proj.weight",
"latent_deliberation.trajectory.cell.v_proj.weight",
"latent_deliberation.trajectory.cell.w_proj.weight",
"latent_deliberation.trajectory.persistent.a_log",
"latent_deliberation.trajectory.persistent.b_proj.weight",
"latent_deliberation.trajectory.persistent.dt_bias",
"latent_deliberation.trajectory.persistent.f_proj.down.weight",
"latent_deliberation.trajectory.persistent.f_proj.up.weight",
"latent_deliberation.trajectory.persistent.g_proj.down.weight",
"latent_deliberation.trajectory.persistent.g_proj.up.weight",
"latent_deliberation.trajectory.persistent.k_proj.weight",
"latent_deliberation.trajectory.persistent.o_proj.weight",
"latent_deliberation.trajectory.persistent.q_proj.weight",
"latent_deliberation.trajectory.persistent.v_proj.weight",
"latent_deliberation.trajectory.persistent.w_proj.weight",
"latent_deliberation.trajectory.probe_embed.weight",
"latent_deliberation.trajectory.row.a_log",
"latent_deliberation.trajectory.row.b_proj.weight",
"latent_deliberation.trajectory.row.dt_bias",
"latent_deliberation.trajectory.row.f_proj.down.weight",
"latent_deliberation.trajectory.row.f_proj.up.weight",
"latent_deliberation.trajectory.row.g_proj.down.weight",
"latent_deliberation.trajectory.row.g_proj.up.weight",
"latent_deliberation.trajectory.row.k_proj.weight",
"latent_deliberation.trajectory.row.o_proj.weight",
"latent_deliberation.trajectory.row.q_proj.weight",
"latent_deliberation.trajectory.row.v_proj.weight",
"latent_deliberation.trajectory.row.w_proj.weight",
"latent_deliberation.working_memory_bus.address_norm.weight",
"latent_deliberation.working_memory_bus.alpha",
"latent_deliberation.working_memory_bus.k_proj.weight",
"latent_deliberation.working_memory_bus.memory_norm.weight",
"latent_deliberation.working_memory_bus.o_proj.0.weight",
"latent_deliberation.working_memory_bus.o_proj.1.weight",
"latent_deliberation.working_memory_bus.o_proj.2.weight",
"latent_deliberation.working_memory_bus.o_proj.3.weight",
"latent_deliberation.working_memory_bus.o_proj.4.weight",
"latent_deliberation.working_memory_bus.q_norm.weight",
"latent_deliberation.working_memory_bus.q_proj.0.weight",
"latent_deliberation.working_memory_bus.q_proj.1.weight",
"latent_deliberation.working_memory_bus.q_proj.2.weight",
"latent_deliberation.working_memory_bus.q_proj.3.weight",
"latent_deliberation.working_memory_bus.q_proj.4.weight",
"latent_deliberation.working_memory_bus.rel_bias",
"latent_deliberation.working_memory_bus.v_proj.weight",
"model.decoder.layers.0.experts.down_proj.lora_a",
"model.decoder.layers.0.experts.down_proj.lora_b",
"model.decoder.layers.0.experts.gate_up_proj.lora_a",
"model.decoder.layers.0.experts.gate_up_proj.lora_b",
"model.decoder.layers.0.mlp.down_proj.lora_a",
"model.decoder.layers.0.mlp.down_proj.lora_b",
"model.decoder.layers.0.mlp.gate_proj.lora_a",
"model.decoder.layers.0.mlp.gate_proj.lora_b",
"model.decoder.layers.0.mlp.up_proj.lora_a",
"model.decoder.layers.0.mlp.up_proj.lora_b",
"model.decoder.layers.0.self_attn.k_proj.lora_a",
"model.decoder.layers.0.self_attn.k_proj.lora_b",
"model.decoder.layers.0.self_attn.o_proj.lora_a",
"model.decoder.layers.0.self_attn.o_proj.lora_b",
"model.decoder.layers.0.self_attn.q_proj.lora_a",
"model.decoder.layers.0.self_attn.q_proj.lora_b",
"model.decoder.layers.0.self_attn.v_proj.lora_a",
"model.decoder.layers.0.self_attn.v_proj.lora_b",
"model.decoder.layers.1.experts.down_proj.lora_a",
"model.decoder.layers.1.experts.down_proj.lora_b",
"model.decoder.layers.1.experts.gate_up_proj.lora_a",
"model.decoder.layers.1.experts.gate_up_proj.lora_b",
"model.decoder.layers.1.mlp.down_proj.lora_a",
"model.decoder.layers.1.mlp.down_proj.lora_b",
"model.decoder.layers.1.mlp.gate_proj.lora_a",
"model.decoder.layers.1.mlp.gate_proj.lora_b",
"model.decoder.layers.1.mlp.up_proj.lora_a",
"model.decoder.layers.1.mlp.up_proj.lora_b",
"model.decoder.layers.1.self_attn.k_proj.lora_a",
"model.decoder.layers.1.self_attn.k_proj.lora_b",
"model.decoder.layers.1.self_attn.o_proj.lora_a",
"model.decoder.layers.1.self_attn.o_proj.lora_b",
"model.decoder.layers.1.self_attn.q_proj.lora_a",
"model.decoder.layers.1.self_attn.q_proj.lora_b",
"model.decoder.layers.1.self_attn.v_proj.lora_a",
"model.decoder.layers.1.self_attn.v_proj.lora_b",
"model.decoder.layers.10.experts.down_proj.lora_a",
"model.decoder.layers.10.experts.down_proj.lora_b",
"model.decoder.layers.10.experts.gate_up_proj.lora_a",
"model.decoder.layers.10.experts.gate_up_proj.lora_b",
"model.decoder.layers.10.mlp.down_proj.lora_a",
"model.decoder.layers.10.mlp.down_proj.lora_b",
"model.decoder.layers.10.mlp.gate_proj.lora_a",
"model.decoder.layers.10.mlp.gate_proj.lora_b",
"model.decoder.layers.10.mlp.up_proj.lora_a",
"model.decoder.layers.10.mlp.up_proj.lora_b",
"model.decoder.layers.10.self_attn.k_proj.lora_a",
"model.decoder.layers.10.self_attn.k_proj.lora_b",
"model.decoder.layers.10.self_attn.o_proj.lora_a",
"model.decoder.layers.10.self_attn.o_proj.lora_b",
"model.decoder.layers.10.self_attn.q_proj.lora_a",
"model.decoder.layers.10.self_attn.q_proj.lora_b",
"model.decoder.layers.10.self_attn.v_proj.lora_a",
"model.decoder.layers.10.self_attn.v_proj.lora_b",
"model.decoder.layers.11.experts.down_proj.lora_a",
"model.decoder.layers.11.experts.down_proj.lora_b",
"model.decoder.layers.11.experts.gate_up_proj.lora_a",
"model.decoder.layers.11.experts.gate_up_proj.lora_b",
"model.decoder.layers.11.mlp.down_proj.lora_a",
"model.decoder.layers.11.mlp.down_proj.lora_b",
"model.decoder.layers.11.mlp.gate_proj.lora_a",
"model.decoder.layers.11.mlp.gate_proj.lora_b",
"model.decoder.layers.11.mlp.up_proj.lora_a",
"model.decoder.layers.11.mlp.up_proj.lora_b",
"model.decoder.layers.11.self_attn.k_proj.lora_a",
"model.decoder.layers.11.self_attn.k_proj.lora_b",
"model.decoder.layers.11.self_attn.o_proj.lora_a",
"model.decoder.layers.11.self_attn.o_proj.lora_b",
"model.decoder.layers.11.self_attn.q_proj.lora_a",
"model.decoder.layers.11.self_attn.q_proj.lora_b",
"model.decoder.layers.12.experts.down_proj.lora_a",
"model.decoder.layers.12.experts.down_proj.lora_b",
"model.decoder.layers.12.experts.gate_up_proj.lora_a",
"model.decoder.layers.12.experts.gate_up_proj.lora_b",
"model.decoder.layers.12.mlp.down_proj.lora_a",
"model.decoder.layers.12.mlp.down_proj.lora_b",
"model.decoder.layers.12.mlp.gate_proj.lora_a",
"model.decoder.layers.12.mlp.gate_proj.lora_b",
"model.decoder.layers.12.mlp.up_proj.lora_a",
"model.decoder.layers.12.mlp.up_proj.lora_b",
"model.decoder.layers.12.self_attn.k_proj.lora_a",
"model.decoder.layers.12.self_attn.k_proj.lora_b",
"model.decoder.layers.12.self_attn.o_proj.lora_a",
"model.decoder.layers.12.self_attn.o_proj.lora_b",
"model.decoder.layers.12.self_attn.q_proj.lora_a",
"model.decoder.layers.12.self_attn.q_proj.lora_b",
"model.decoder.layers.12.self_attn.v_proj.lora_a",
"model.decoder.layers.12.self_attn.v_proj.lora_b",
"model.decoder.layers.13.experts.down_proj.lora_a",
"model.decoder.layers.13.experts.down_proj.lora_b",
"model.decoder.layers.13.experts.gate_up_proj.lora_a",
"model.decoder.layers.13.experts.gate_up_proj.lora_b",
"model.decoder.layers.13.mlp.down_proj.lora_a",
"model.decoder.layers.13.mlp.down_proj.lora_b",
"model.decoder.layers.13.mlp.gate_proj.lora_a",
"model.decoder.layers.13.mlp.gate_proj.lora_b",
"model.decoder.layers.13.mlp.up_proj.lora_a",
"model.decoder.layers.13.mlp.up_proj.lora_b",
"model.decoder.layers.13.self_attn.k_proj.lora_a",
"model.decoder.layers.13.self_attn.k_proj.lora_b",
"model.decoder.layers.13.self_attn.o_proj.lora_a",
"model.decoder.layers.13.self_attn.o_proj.lora_b",
"model.decoder.layers.13.self_attn.q_proj.lora_a",
"model.decoder.layers.13.self_attn.q_proj.lora_b",
"model.decoder.layers.13.self_attn.v_proj.lora_a",
"model.decoder.layers.13.self_attn.v_proj.lora_b",
"model.decoder.layers.14.experts.down_proj.lora_a",
"model.decoder.layers.14.experts.down_proj.lora_b",
"model.decoder.layers.14.experts.gate_up_proj.lora_a",
"model.decoder.layers.14.experts.gate_up_proj.lora_b",
"model.decoder.layers.14.mlp.down_proj.lora_a",
"model.decoder.layers.14.mlp.down_proj.lora_b",
"model.decoder.layers.14.mlp.gate_proj.lora_a",
"model.decoder.layers.14.mlp.gate_proj.lora_b",
"model.decoder.layers.14.mlp.up_proj.lora_a",
"model.decoder.layers.14.mlp.up_proj.lora_b",
"model.decoder.layers.14.self_attn.k_proj.lora_a",
"model.decoder.layers.14.self_attn.k_proj.lora_b",
"model.decoder.layers.14.self_attn.o_proj.lora_a",
"model.decoder.layers.14.self_attn.o_proj.lora_b",
"model.decoder.layers.14.self_attn.q_proj.lora_a",
"model.decoder.layers.14.self_attn.q_proj.lora_b",
"model.decoder.layers.14.self_attn.v_proj.lora_a",
"model.decoder.layers.14.self_attn.v_proj.lora_b",
"model.decoder.layers.15.experts.down_proj.lora_a",
"model.decoder.layers.15.experts.down_proj.lora_b",
"model.decoder.layers.15.experts.gate_up_proj.lora_a",
"model.decoder.layers.15.experts.gate_up_proj.lora_b",
"model.decoder.layers.15.mlp.down_proj.lora_a",
"model.decoder.layers.15.mlp.down_proj.lora_b",
"model.decoder.layers.15.mlp.gate_proj.lora_a",
"model.decoder.layers.15.mlp.gate_proj.lora_b",
"model.decoder.layers.15.mlp.up_proj.lora_a",
"model.decoder.layers.15.mlp.up_proj.lora_b",
"model.decoder.layers.15.self_attn.k_proj.lora_a",
"model.decoder.layers.15.self_attn.k_proj.lora_b",
"model.decoder.layers.15.self_attn.o_proj.lora_a",
"model.decoder.layers.15.self_attn.o_proj.lora_b",
"model.decoder.layers.15.self_attn.q_proj.lora_a",
"model.decoder.layers.15.self_attn.q_proj.lora_b",
"model.decoder.layers.15.self_attn.v_proj.lora_a",
"model.decoder.layers.15.self_attn.v_proj.lora_b",
"model.decoder.layers.16.experts.down_proj.lora_a",
"model.decoder.layers.16.experts.down_proj.lora_b",
"model.decoder.layers.16.experts.gate_up_proj.lora_a",
"model.decoder.layers.16.experts.gate_up_proj.lora_b",
"model.decoder.layers.16.mlp.down_proj.lora_a",
"model.decoder.layers.16.mlp.down_proj.lora_b",
"model.decoder.layers.16.mlp.gate_proj.lora_a",
"model.decoder.layers.16.mlp.gate_proj.lora_b",
"model.decoder.layers.16.mlp.up_proj.lora_a",
"model.decoder.layers.16.mlp.up_proj.lora_b",
"model.decoder.layers.16.self_attn.k_proj.lora_a",
"model.decoder.layers.16.self_attn.k_proj.lora_b",
"model.decoder.layers.16.self_attn.o_proj.lora_a",
"model.decoder.layers.16.self_attn.o_proj.lora_b",
"model.decoder.layers.16.self_attn.q_proj.lora_a",
"model.decoder.layers.16.self_attn.q_proj.lora_b",
"model.decoder.layers.16.self_attn.v_proj.lora_a",
"model.decoder.layers.16.self_attn.v_proj.lora_b",
"model.decoder.layers.17.experts.down_proj.lora_a",
"model.decoder.layers.17.experts.down_proj.lora_b",
"model.decoder.layers.17.experts.gate_up_proj.lora_a",
"model.decoder.layers.17.experts.gate_up_proj.lora_b",
"model.decoder.layers.17.mlp.down_proj.lora_a",
"model.decoder.layers.17.mlp.down_proj.lora_b",
"model.decoder.layers.17.mlp.gate_proj.lora_a",
"model.decoder.layers.17.mlp.gate_proj.lora_b",
"model.decoder.layers.17.mlp.up_proj.lora_a",
"model.decoder.layers.17.mlp.up_proj.lora_b",
"model.decoder.layers.17.self_attn.k_proj.lora_a",
"model.decoder.layers.17.self_attn.k_proj.lora_b",
"model.decoder.layers.17.self_attn.o_proj.lora_a",
"model.decoder.layers.17.self_attn.o_proj.lora_b",
"model.decoder.layers.17.self_attn.q_proj.lora_a",
"model.decoder.layers.17.self_attn.q_proj.lora_b",
"model.decoder.layers.18.experts.down_proj.lora_a",
"model.decoder.layers.18.experts.down_proj.lora_b",
"model.decoder.layers.18.experts.gate_up_proj.lora_a",
"model.decoder.layers.18.experts.gate_up_proj.lora_b",
"model.decoder.layers.18.mlp.down_proj.lora_a",
"model.decoder.layers.18.mlp.down_proj.lora_b",
"model.decoder.layers.18.mlp.gate_proj.lora_a",
"model.decoder.layers.18.mlp.gate_proj.lora_b",
"model.decoder.layers.18.mlp.up_proj.lora_a",
"model.decoder.layers.18.mlp.up_proj.lora_b",
"model.decoder.layers.18.self_attn.k_proj.lora_a",
"model.decoder.layers.18.self_attn.k_proj.lora_b",
"model.decoder.layers.18.self_attn.o_proj.lora_a",
"model.decoder.layers.18.self_attn.o_proj.lora_b",
"model.decoder.layers.18.self_attn.q_proj.lora_a",
"model.decoder.layers.18.self_attn.q_proj.lora_b",
"model.decoder.layers.18.self_attn.v_proj.lora_a",
"model.decoder.layers.18.self_attn.v_proj.lora_b",
"model.decoder.layers.19.experts.down_proj.lora_a",
"model.decoder.layers.19.experts.down_proj.lora_b",
"model.decoder.layers.19.experts.gate_up_proj.lora_a",
"model.decoder.layers.19.experts.gate_up_proj.lora_b",
"model.decoder.layers.19.mlp.down_proj.lora_a",
"model.decoder.layers.19.mlp.down_proj.lora_b",
"model.decoder.layers.19.mlp.gate_proj.lora_a",
"model.decoder.layers.19.mlp.gate_proj.lora_b",
"model.decoder.layers.19.mlp.up_proj.lora_a",
"model.decoder.layers.19.mlp.up_proj.lora_b",
"model.decoder.layers.19.self_attn.k_proj.lora_a",
"model.decoder.layers.19.self_attn.k_proj.lora_b",
"model.decoder.layers.19.self_attn.o_proj.lora_a",
"model.decoder.layers.19.self_attn.o_proj.lora_b",
"model.decoder.layers.19.self_attn.q_proj.lora_a",
"model.decoder.layers.19.self_attn.q_proj.lora_b",
"model.decoder.layers.19.self_attn.v_proj.lora_a",
"model.decoder.layers.19.self_attn.v_proj.lora_b",
"model.decoder.layers.2.experts.down_proj.lora_a",
"model.decoder.layers.2.experts.down_proj.lora_b",
"model.decoder.layers.2.experts.gate_up_proj.lora_a",
"model.decoder.layers.2.experts.gate_up_proj.lora_b",
"model.decoder.layers.2.mlp.down_proj.lora_a",
"model.decoder.layers.2.mlp.down_proj.lora_b",
"model.decoder.layers.2.mlp.gate_proj.lora_a",
"model.decoder.layers.2.mlp.gate_proj.lora_b",
"model.decoder.layers.2.mlp.up_proj.lora_a",
"model.decoder.layers.2.mlp.up_proj.lora_b",
"model.decoder.layers.2.self_attn.k_proj.lora_a",
"model.decoder.layers.2.self_attn.k_proj.lora_b",
"model.decoder.layers.2.self_attn.o_proj.lora_a",
"model.decoder.layers.2.self_attn.o_proj.lora_b",
"model.decoder.layers.2.self_attn.q_proj.lora_a",
"model.decoder.layers.2.self_attn.q_proj.lora_b",
"model.decoder.layers.2.self_attn.v_proj.lora_a",
"model.decoder.layers.2.self_attn.v_proj.lora_b",
"model.decoder.layers.20.experts.down_proj.lora_a",
"model.decoder.layers.20.experts.down_proj.lora_b",
"model.decoder.layers.20.experts.gate_up_proj.lora_a",
"model.decoder.layers.20.experts.gate_up_proj.lora_b",
"model.decoder.layers.20.mlp.down_proj.lora_a",
"model.decoder.layers.20.mlp.down_proj.lora_b",
"model.decoder.layers.20.mlp.gate_proj.lora_a",
"model.decoder.layers.20.mlp.gate_proj.lora_b",
"model.decoder.layers.20.mlp.up_proj.lora_a",
"model.decoder.layers.20.mlp.up_proj.lora_b",
"model.decoder.layers.20.self_attn.k_proj.lora_a",
"model.decoder.layers.20.self_attn.k_proj.lora_b",
"model.decoder.layers.20.self_attn.o_proj.lora_a",
"model.decoder.layers.20.self_attn.o_proj.lora_b",
"model.decoder.layers.20.self_attn.q_proj.lora_a",
"model.decoder.layers.20.self_attn.q_proj.lora_b",
"model.decoder.layers.20.self_attn.v_proj.lora_a",
"model.decoder.layers.20.self_attn.v_proj.lora_b",
"model.decoder.layers.21.experts.down_proj.lora_a",
"model.decoder.layers.21.experts.down_proj.lora_b",
"model.decoder.layers.21.experts.gate_up_proj.lora_a",
"model.decoder.layers.21.experts.gate_up_proj.lora_b",
"model.decoder.layers.21.mlp.down_proj.lora_a",
"model.decoder.layers.21.mlp.down_proj.lora_b",
"model.decoder.layers.21.mlp.gate_proj.lora_a",
"model.decoder.layers.21.mlp.gate_proj.lora_b",
"model.decoder.layers.21.mlp.up_proj.lora_a",
"model.decoder.layers.21.mlp.up_proj.lora_b",
"model.decoder.layers.21.self_attn.k_proj.lora_a",
"model.decoder.layers.21.self_attn.k_proj.lora_b",
"model.decoder.layers.21.self_attn.o_proj.lora_a",
"model.decoder.layers.21.self_attn.o_proj.lora_b",
"model.decoder.layers.21.self_attn.q_proj.lora_a",
"model.decoder.layers.21.self_attn.q_proj.lora_b",
"model.decoder.layers.21.self_attn.v_proj.lora_a",
"model.decoder.layers.21.self_attn.v_proj.lora_b",
"model.decoder.layers.22.experts.down_proj.lora_a",
"model.decoder.layers.22.experts.down_proj.lora_b",
"model.decoder.layers.22.experts.gate_up_proj.lora_a",
"model.decoder.layers.22.experts.gate_up_proj.lora_b",
"model.decoder.layers.22.mlp.down_proj.lora_a",
"model.decoder.layers.22.mlp.down_proj.lora_b",
"model.decoder.layers.22.mlp.gate_proj.lora_a",
"model.decoder.layers.22.mlp.gate_proj.lora_b",
"model.decoder.layers.22.mlp.up_proj.lora_a",
"model.decoder.layers.22.mlp.up_proj.lora_b",
"model.decoder.layers.22.self_attn.k_proj.lora_a",
"model.decoder.layers.22.self_attn.k_proj.lora_b",
"model.decoder.layers.22.self_attn.o_proj.lora_a",
"model.decoder.layers.22.self_attn.o_proj.lora_b",
"model.decoder.layers.22.self_attn.q_proj.lora_a",
"model.decoder.layers.22.self_attn.q_proj.lora_b",
"model.decoder.layers.22.self_attn.v_proj.lora_a",
"model.decoder.layers.22.self_attn.v_proj.lora_b",
"model.decoder.layers.23.experts.down_proj.lora_a",
"model.decoder.layers.23.experts.down_proj.lora_b",
"model.decoder.layers.23.experts.gate_up_proj.lora_a",
"model.decoder.layers.23.experts.gate_up_proj.lora_b",
"model.decoder.layers.23.mlp.down_proj.lora_a",
"model.decoder.layers.23.mlp.down_proj.lora_b",
"model.decoder.layers.23.mlp.gate_proj.lora_a",
"model.decoder.layers.23.mlp.gate_proj.lora_b",
"model.decoder.layers.23.mlp.up_proj.lora_a",
"model.decoder.layers.23.mlp.up_proj.lora_b",
"model.decoder.layers.23.self_attn.k_proj.lora_a",
"model.decoder.layers.23.self_attn.k_proj.lora_b",
"model.decoder.layers.23.self_attn.o_proj.lora_a",
"model.decoder.layers.23.self_attn.o_proj.lora_b",
"model.decoder.layers.23.self_attn.q_proj.lora_a",
"model.decoder.layers.23.self_attn.q_proj.lora_b",
"model.decoder.layers.24.experts.down_proj.lora_a",
"model.decoder.layers.24.experts.down_proj.lora_b",
"model.decoder.layers.24.experts.gate_up_proj.lora_a",
"model.decoder.layers.24.experts.gate_up_proj.lora_b",
"model.decoder.layers.24.mlp.down_proj.lora_a",
"model.decoder.layers.24.mlp.down_proj.lora_b",
"model.decoder.layers.24.mlp.gate_proj.lora_a",
"model.decoder.layers.24.mlp.gate_proj.lora_b",
"model.decoder.layers.24.mlp.up_proj.lora_a",
"model.decoder.layers.24.mlp.up_proj.lora_b",
"model.decoder.layers.24.self_attn.k_proj.lora_a",
"model.decoder.layers.24.self_attn.k_proj.lora_b",
"model.decoder.layers.24.self_attn.o_proj.lora_a",
"model.decoder.layers.24.self_attn.o_proj.lora_b",
"model.decoder.layers.24.self_attn.q_proj.lora_a",
"model.decoder.layers.24.self_attn.q_proj.lora_b",
"model.decoder.layers.24.self_attn.v_proj.lora_a",
"model.decoder.layers.24.self_attn.v_proj.lora_b",
"model.decoder.layers.25.experts.down_proj.lora_a",
"model.decoder.layers.25.experts.down_proj.lora_b",
"model.decoder.layers.25.experts.gate_up_proj.lora_a",
"model.decoder.layers.25.experts.gate_up_proj.lora_b",
"model.decoder.layers.25.mlp.down_proj.lora_a",
"model.decoder.layers.25.mlp.down_proj.lora_b",
"model.decoder.layers.25.mlp.gate_proj.lora_a",
"model.decoder.layers.25.mlp.gate_proj.lora_b",
"model.decoder.layers.25.mlp.up_proj.lora_a",
"model.decoder.layers.25.mlp.up_proj.lora_b",
"model.decoder.layers.25.self_attn.k_proj.lora_a",
"model.decoder.layers.25.self_attn.k_proj.lora_b",
"model.decoder.layers.25.self_attn.o_proj.lora_a",
"model.decoder.layers.25.self_attn.o_proj.lora_b",
"model.decoder.layers.25.self_attn.q_proj.lora_a",
"model.decoder.layers.25.self_attn.q_proj.lora_b",
"model.decoder.layers.25.self_attn.v_proj.lora_a",
"model.decoder.layers.25.self_attn.v_proj.lora_b",
"model.decoder.layers.26.experts.down_proj.lora_a",
"model.decoder.layers.26.experts.down_proj.lora_b",
"model.decoder.layers.26.experts.gate_up_proj.lora_a",
"model.decoder.layers.26.experts.gate_up_proj.lora_b",
"model.decoder.layers.26.mlp.down_proj.lora_a",
"model.decoder.layers.26.mlp.down_proj.lora_b",
"model.decoder.layers.26.mlp.gate_proj.lora_a",
"model.decoder.layers.26.mlp.gate_proj.lora_b",
"model.decoder.layers.26.mlp.up_proj.lora_a",
"model.decoder.layers.26.mlp.up_proj.lora_b",
"model.decoder.layers.26.self_attn.k_proj.lora_a",
"model.decoder.layers.26.self_attn.k_proj.lora_b",
"model.decoder.layers.26.self_attn.o_proj.lora_a",
"model.decoder.layers.26.self_attn.o_proj.lora_b",
"model.decoder.layers.26.self_attn.q_proj.lora_a",
"model.decoder.layers.26.self_attn.q_proj.lora_b",
"model.decoder.layers.26.self_attn.v_proj.lora_a",
"model.decoder.layers.26.self_attn.v_proj.lora_b",
"model.decoder.layers.27.experts.down_proj.lora_a",
"model.decoder.layers.27.experts.down_proj.lora_b",
"model.decoder.layers.27.experts.gate_up_proj.lora_a",
"model.decoder.layers.27.experts.gate_up_proj.lora_b",
"model.decoder.layers.27.mlp.down_proj.lora_a",
"model.decoder.layers.27.mlp.down_proj.lora_b",
"model.decoder.layers.27.mlp.gate_proj.lora_a",
"model.decoder.layers.27.mlp.gate_proj.lora_b",
"model.decoder.layers.27.mlp.up_proj.lora_a",
"model.decoder.layers.27.mlp.up_proj.lora_b",
"model.decoder.layers.27.self_attn.k_proj.lora_a",
"model.decoder.layers.27.self_attn.k_proj.lora_b",
"model.decoder.layers.27.self_attn.o_proj.lora_a",
"model.decoder.layers.27.self_attn.o_proj.lora_b",
"model.decoder.layers.27.self_attn.q_proj.lora_a",
"model.decoder.layers.27.self_attn.q_proj.lora_b",
"model.decoder.layers.27.self_attn.v_proj.lora_a",
"model.decoder.layers.27.self_attn.v_proj.lora_b",
"model.decoder.layers.28.experts.down_proj.lora_a",
"model.decoder.layers.28.experts.down_proj.lora_b",
"model.decoder.layers.28.experts.gate_up_proj.lora_a",
"model.decoder.layers.28.experts.gate_up_proj.lora_b",
"model.decoder.layers.28.mlp.down_proj.lora_a",
"model.decoder.layers.28.mlp.down_proj.lora_b",
"model.decoder.layers.28.mlp.gate_proj.lora_a",
"model.decoder.layers.28.mlp.gate_proj.lora_b",
"model.decoder.layers.28.mlp.up_proj.lora_a",
"model.decoder.layers.28.mlp.up_proj.lora_b",
"model.decoder.layers.28.self_attn.k_proj.lora_a",
"model.decoder.layers.28.self_attn.k_proj.lora_b",
"model.decoder.layers.28.self_attn.o_proj.lora_a",
"model.decoder.layers.28.self_attn.o_proj.lora_b",
"model.decoder.layers.28.self_attn.q_proj.lora_a",
"model.decoder.layers.28.self_attn.q_proj.lora_b",
"model.decoder.layers.28.self_attn.v_proj.lora_a",
"model.decoder.layers.28.self_attn.v_proj.lora_b",
"model.decoder.layers.29.experts.down_proj.lora_a",
"model.decoder.layers.29.experts.down_proj.lora_b",
"model.decoder.layers.29.experts.gate_up_proj.lora_a",
"model.decoder.layers.29.experts.gate_up_proj.lora_b",
"model.decoder.layers.29.mlp.down_proj.lora_a",
"model.decoder.layers.29.mlp.down_proj.lora_b",
"model.decoder.layers.29.mlp.gate_proj.lora_a",
"model.decoder.layers.29.mlp.gate_proj.lora_b",
"model.decoder.layers.29.mlp.up_proj.lora_a",
"model.decoder.layers.29.mlp.up_proj.lora_b",
"model.decoder.layers.29.self_attn.k_proj.lora_a",
"model.decoder.layers.29.self_attn.k_proj.lora_b",
"model.decoder.layers.29.self_attn.o_proj.lora_a",
"model.decoder.layers.29.self_attn.o_proj.lora_b",
"model.decoder.layers.29.self_attn.q_proj.lora_a",
"model.decoder.layers.29.self_attn.q_proj.lora_b",
"model.decoder.layers.3.experts.down_proj.lora_a",
"model.decoder.layers.3.experts.down_proj.lora_b",
"model.decoder.layers.3.experts.gate_up_proj.lora_a",
"model.decoder.layers.3.experts.gate_up_proj.lora_b",
"model.decoder.layers.3.mlp.down_proj.lora_a",
"model.decoder.layers.3.mlp.down_proj.lora_b",
"model.decoder.layers.3.mlp.gate_proj.lora_a",
"model.decoder.layers.3.mlp.gate_proj.lora_b",
"model.decoder.layers.3.mlp.up_proj.lora_a",
"model.decoder.layers.3.mlp.up_proj.lora_b",
"model.decoder.layers.3.self_attn.k_proj.lora_a",
"model.decoder.layers.3.self_attn.k_proj.lora_b",
"model.decoder.layers.3.self_attn.o_proj.lora_a",
"model.decoder.layers.3.self_attn.o_proj.lora_b",
"model.decoder.layers.3.self_attn.q_proj.lora_a",
"model.decoder.layers.3.self_attn.q_proj.lora_b",
"model.decoder.layers.3.self_attn.v_proj.lora_a",
"model.decoder.layers.3.self_attn.v_proj.lora_b",
"model.decoder.layers.4.experts.down_proj.lora_a",
"model.decoder.layers.4.experts.down_proj.lora_b",
"model.decoder.layers.4.experts.gate_up_proj.lora_a",
"model.decoder.layers.4.experts.gate_up_proj.lora_b",
"model.decoder.layers.4.mlp.down_proj.lora_a",
"model.decoder.layers.4.mlp.down_proj.lora_b",
"model.decoder.layers.4.mlp.gate_proj.lora_a",
"model.decoder.layers.4.mlp.gate_proj.lora_b",
"model.decoder.layers.4.mlp.up_proj.lora_a",
"model.decoder.layers.4.mlp.up_proj.lora_b",
"model.decoder.layers.4.self_attn.k_proj.lora_a",
"model.decoder.layers.4.self_attn.k_proj.lora_b",
"model.decoder.layers.4.self_attn.o_proj.lora_a",
"model.decoder.layers.4.self_attn.o_proj.lora_b",
"model.decoder.layers.4.self_attn.q_proj.lora_a",
"model.decoder.layers.4.self_attn.q_proj.lora_b",
"model.decoder.layers.4.self_attn.v_proj.lora_a",
"model.decoder.layers.4.self_attn.v_proj.lora_b",
"model.decoder.layers.5.experts.down_proj.lora_a",
"model.decoder.layers.5.experts.down_proj.lora_b",
"model.decoder.layers.5.experts.gate_up_proj.lora_a",
"model.decoder.layers.5.experts.gate_up_proj.lora_b",
"model.decoder.layers.5.mlp.down_proj.lora_a",
"model.decoder.layers.5.mlp.down_proj.lora_b",
"model.decoder.layers.5.mlp.gate_proj.lora_a",
"model.decoder.layers.5.mlp.gate_proj.lora_b",
"model.decoder.layers.5.mlp.up_proj.lora_a",
"model.decoder.layers.5.mlp.up_proj.lora_b",
"model.decoder.layers.5.self_attn.k_proj.lora_a",
"model.decoder.layers.5.self_attn.k_proj.lora_b",
"model.decoder.layers.5.self_attn.o_proj.lora_a",
"model.decoder.layers.5.self_attn.o_proj.lora_b",
"model.decoder.layers.5.self_attn.q_proj.lora_a",
"model.decoder.layers.5.self_attn.q_proj.lora_b",
"model.decoder.layers.6.experts.down_proj.lora_a",
"model.decoder.layers.6.experts.down_proj.lora_b",
"model.decoder.layers.6.experts.gate_up_proj.lora_a",
"model.decoder.layers.6.experts.gate_up_proj.lora_b",
"model.decoder.layers.6.mlp.down_proj.lora_a",
"model.decoder.layers.6.mlp.down_proj.lora_b",
"model.decoder.layers.6.mlp.gate_proj.lora_a",
"model.decoder.layers.6.mlp.gate_proj.lora_b",
"model.decoder.layers.6.mlp.up_proj.lora_a",
"model.decoder.layers.6.mlp.up_proj.lora_b",
"model.decoder.layers.6.self_attn.k_proj.lora_a",
"model.decoder.layers.6.self_attn.k_proj.lora_b",
"model.decoder.layers.6.self_attn.o_proj.lora_a",
"model.decoder.layers.6.self_attn.o_proj.lora_b",
"model.decoder.layers.6.self_attn.q_proj.lora_a",
"model.decoder.layers.6.self_attn.q_proj.lora_b",
"model.decoder.layers.6.self_attn.v_proj.lora_a",
"model.decoder.layers.6.self_attn.v_proj.lora_b",
"model.decoder.layers.7.experts.down_proj.lora_a",
"model.decoder.layers.7.experts.down_proj.lora_b",
"model.decoder.layers.7.experts.gate_up_proj.lora_a",
"model.decoder.layers.7.experts.gate_up_proj.lora_b",
"model.decoder.layers.7.mlp.down_proj.lora_a",
"model.decoder.layers.7.mlp.down_proj.lora_b",
"model.decoder.layers.7.mlp.gate_proj.lora_a",
"model.decoder.layers.7.mlp.gate_proj.lora_b",
"model.decoder.layers.7.mlp.up_proj.lora_a",
"model.decoder.layers.7.mlp.up_proj.lora_b",
"model.decoder.layers.7.self_attn.k_proj.lora_a",
"model.decoder.layers.7.self_attn.k_proj.lora_b",
"model.decoder.layers.7.self_attn.o_proj.lora_a",
"model.decoder.layers.7.self_attn.o_proj.lora_b",
"model.decoder.layers.7.self_attn.q_proj.lora_a",
"model.decoder.layers.7.self_attn.q_proj.lora_b",
"model.decoder.layers.7.self_attn.v_proj.lora_a",
"model.decoder.layers.7.self_attn.v_proj.lora_b",
"model.decoder.layers.8.experts.down_proj.lora_a",
"model.decoder.layers.8.experts.down_proj.lora_b",
"model.decoder.layers.8.experts.gate_up_proj.lora_a",
"model.decoder.layers.8.experts.gate_up_proj.lora_b",
"model.decoder.layers.8.mlp.down_proj.lora_a",
"model.decoder.layers.8.mlp.down_proj.lora_b",
"model.decoder.layers.8.mlp.gate_proj.lora_a",
"model.decoder.layers.8.mlp.gate_proj.lora_b",
"model.decoder.layers.8.mlp.up_proj.lora_a",
"model.decoder.layers.8.mlp.up_proj.lora_b",
"model.decoder.layers.8.self_attn.k_proj.lora_a",
"model.decoder.layers.8.self_attn.k_proj.lora_b",
"model.decoder.layers.8.self_attn.o_proj.lora_a",
"model.decoder.layers.8.self_attn.o_proj.lora_b",
"model.decoder.layers.8.self_attn.q_proj.lora_a",
"model.decoder.layers.8.self_attn.q_proj.lora_b",
"model.decoder.layers.8.self_attn.v_proj.lora_a",
"model.decoder.layers.8.self_attn.v_proj.lora_b",
"model.decoder.layers.9.experts.down_proj.lora_a",
"model.decoder.layers.9.experts.down_proj.lora_b",
"model.decoder.layers.9.experts.gate_up_proj.lora_a",
"model.decoder.layers.9.experts.gate_up_proj.lora_b",
"model.decoder.layers.9.mlp.down_proj.lora_a",
"model.decoder.layers.9.mlp.down_proj.lora_b",
"model.decoder.layers.9.mlp.gate_proj.lora_a",
"model.decoder.layers.9.mlp.gate_proj.lora_b",
"model.decoder.layers.9.mlp.up_proj.lora_a",
"model.decoder.layers.9.mlp.up_proj.lora_b",
"model.decoder.layers.9.self_attn.k_proj.lora_a",
"model.decoder.layers.9.self_attn.k_proj.lora_b",
"model.decoder.layers.9.self_attn.o_proj.lora_a",
"model.decoder.layers.9.self_attn.o_proj.lora_b",
"model.decoder.layers.9.self_attn.q_proj.lora_a",
"model.decoder.layers.9.self_attn.q_proj.lora_b",
"model.decoder.layers.9.self_attn.v_proj.lora_a",
"model.decoder.layers.9.self_attn.v_proj.lora_b"
],
"trainable_tensor_count": 632,
"total_tensor_count": 1323,
"total_size": 51791503298,
"tensors": {
"model.decoder.embed_tokens.weight": {
"shape": [
262144,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.0.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.1.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.2.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.3.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.4.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.self_attn.q_proj.linear.weight": {
"shape": [
8192,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.self_attn.q_proj.lora_b": {
"shape": [
16,
8192
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.self_attn.k_proj.linear.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.self_attn.k_proj.lora_b": {
"shape": [
16,
1024
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.self_attn.o_proj.linear.weight": {
"shape": [
2816,
8192
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.self_attn.o_proj.lora_a": {
"shape": [
8192,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.self_attn.q_norm.weight": {
"shape": [
512
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.self_attn.k_norm.weight": {
"shape": [
512
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.5.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.6.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.7.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.8.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.9.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.10.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.self_attn.q_proj.linear.weight": {
"shape": [
8192,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.self_attn.q_proj.lora_b": {
"shape": [
16,
8192
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.self_attn.k_proj.linear.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.self_attn.k_proj.lora_b": {
"shape": [
16,
1024
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.self_attn.o_proj.linear.weight": {
"shape": [
2816,
8192
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.self_attn.o_proj.lora_a": {
"shape": [
8192,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.self_attn.q_norm.weight": {
"shape": [
512
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.self_attn.k_norm.weight": {
"shape": [
512
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.11.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.12.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.13.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.14.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.15.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.16.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.self_attn.q_proj.linear.weight": {
"shape": [
8192,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.self_attn.q_proj.lora_b": {
"shape": [
16,
8192
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.self_attn.k_proj.linear.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.self_attn.k_proj.lora_b": {
"shape": [
16,
1024
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.self_attn.o_proj.linear.weight": {
"shape": [
2816,
8192
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.self_attn.o_proj.lora_a": {
"shape": [
8192,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.self_attn.q_norm.weight": {
"shape": [
512
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.self_attn.k_norm.weight": {
"shape": [
512
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.17.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.18.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.19.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.20.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.21.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.22.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.self_attn.q_proj.linear.weight": {
"shape": [
8192,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.self_attn.q_proj.lora_b": {
"shape": [
16,
8192
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.self_attn.k_proj.linear.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.self_attn.k_proj.lora_b": {
"shape": [
16,
1024
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.self_attn.o_proj.linear.weight": {
"shape": [
2816,
8192
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.self_attn.o_proj.lora_a": {
"shape": [
8192,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.self_attn.q_norm.weight": {
"shape": [
512
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.self_attn.k_norm.weight": {
"shape": [
512
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.23.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.24.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.25.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.26.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.27.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.self_attn.q_proj.linear.weight": {
"shape": [
4096,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.self_attn.q_proj.lora_b": {
"shape": [
16,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.self_attn.k_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.self_attn.k_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.self_attn.v_proj.linear.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.self_attn.v_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.self_attn.v_proj.lora_b": {
"shape": [
16,
2048
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.self_attn.o_proj.linear.weight": {
"shape": [
2816,
4096
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.self_attn.o_proj.lora_a": {
"shape": [
4096,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.self_attn.q_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.self_attn.k_norm.weight": {
"shape": [
256
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.28.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.self_attn.q_proj.linear.weight": {
"shape": [
8192,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.self_attn.q_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.self_attn.q_proj.lora_b": {
"shape": [
16,
8192
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.self_attn.k_proj.linear.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.self_attn.k_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.self_attn.k_proj.lora_b": {
"shape": [
16,
1024
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.self_attn.o_proj.linear.weight": {
"shape": [
2816,
8192
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.self_attn.o_proj.lora_a": {
"shape": [
8192,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.self_attn.o_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.self_attn.q_norm.weight": {
"shape": [
512
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.self_attn.k_norm.weight": {
"shape": [
512
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.mlp.gate_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.mlp.gate_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.mlp.gate_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.mlp.up_proj.linear.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.mlp.up_proj.lora_a": {
"shape": [
2816,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.mlp.up_proj.lora_b": {
"shape": [
16,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.mlp.down_proj.linear.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.mlp.down_proj.lora_a": {
"shape": [
2112,
16
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.mlp.down_proj.lora_b": {
"shape": [
16,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.input_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.post_attention_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.pre_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.post_feedforward_layernorm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.router.proj.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.router.scale": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.router.per_expert_scale": {
"shape": [
128
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.experts.gate_up_proj.linear.weight": {
"shape": [
128,
1408,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.experts.gate_up_proj.lora_a": {
"shape": [
128,
8,
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.experts.gate_up_proj.lora_b": {
"shape": [
128,
1408,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.experts.down_proj.linear.weight": {
"shape": [
128,
2816,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.experts.down_proj.lora_a": {
"shape": [
128,
8,
704
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.experts.down_proj.lora_b": {
"shape": [
128,
2816,
8
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.post_feedforward_layernorm_1.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.post_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.pre_feedforward_layernorm_2.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.layers.29.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.decoder.norm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.self_conditioning.pre_norm.weight": {
"shape": [
2816
],
"dtype": "bfloat16"
},
"model.decoder.self_conditioning.gate_proj.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.self_conditioning.up_proj.weight": {
"shape": [
2112,
2816
],
"dtype": "bfloat16"
},
"model.decoder.self_conditioning.down_proj.weight": {
"shape": [
2816,
2112
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.0.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.1.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.2.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.3.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.4.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.5.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.6.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.7.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.8.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.9.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.10.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.11.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.12.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.13.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.14.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.15.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.16.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.17.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.18.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.19.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.20.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.21.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.22.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.23.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.24.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.25.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.26.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.27.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.28.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"model.encoder.language_model.layers.29.layer_scalar": {
"shape": [
1
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.cell.q_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.cell.k_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.cell.v_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.cell.f_proj.down.weight": {
"shape": [
64,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.cell.f_proj.up.weight": {
"shape": [
1024,
64
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.cell.b_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.cell.w_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.cell.g_proj.down.weight": {
"shape": [
64,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.cell.g_proj.up.weight": {
"shape": [
1024,
64
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.cell.o_proj.weight": {
"shape": [
2816,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.cell.a_log": {
"shape": [
16
],
"dtype": "float32"
},
"latent_deliberation.trajectory.cell.dt_bias": {
"shape": [
16,
64
],
"dtype": "float32"
},
"latent_deliberation.trajectory.row.q_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.row.k_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.row.v_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.row.f_proj.down.weight": {
"shape": [
64,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.row.f_proj.up.weight": {
"shape": [
1024,
64
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.row.b_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.row.w_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.row.g_proj.down.weight": {
"shape": [
64,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.row.g_proj.up.weight": {
"shape": [
1024,
64
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.row.o_proj.weight": {
"shape": [
2816,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.row.a_log": {
"shape": [
16
],
"dtype": "float32"
},
"latent_deliberation.trajectory.row.dt_bias": {
"shape": [
16,
64
],
"dtype": "float32"
},
"latent_deliberation.trajectory.persistent.q_proj.weight": {
"shape": [
2048,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.persistent.k_proj.weight": {
"shape": [
2048,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.persistent.v_proj.weight": {
"shape": [
2048,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.persistent.f_proj.down.weight": {
"shape": [
128,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.persistent.f_proj.up.weight": {
"shape": [
2048,
128
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.persistent.b_proj.weight": {
"shape": [
2048,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.persistent.w_proj.weight": {
"shape": [
2048,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.persistent.g_proj.down.weight": {
"shape": [
128,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.persistent.g_proj.up.weight": {
"shape": [
2048,
128
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.persistent.o_proj.weight": {
"shape": [
2816,
2048
],
"dtype": "bfloat16"
},
"latent_deliberation.trajectory.persistent.a_log": {
"shape": [
16
],
"dtype": "float32"
},
"latent_deliberation.trajectory.persistent.dt_bias": {
"shape": [
16,
128
],
"dtype": "float32"
},
"latent_deliberation.trajectory.probe_embed.weight": {
"shape": [
4,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.0.norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.0.attn.q_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.0.attn.k_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.0.attn.v_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.0.attn.o_proj.weight": {
"shape": [
2816,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.0.attn.q_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.0.attn.k_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.0.ff_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.0.ff.gate.weight": {
"shape": [
7168,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.0.ff.up.weight": {
"shape": [
7168,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.0.ff.down.weight": {
"shape": [
2816,
7168
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.1.norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.1.attn.q_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.1.attn.k_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.1.attn.v_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.1.attn.o_proj.weight": {
"shape": [
2816,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.1.attn.q_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.1.attn.k_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.1.ff_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.1.ff.gate.weight": {
"shape": [
7168,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.1.ff.up.weight": {
"shape": [
7168,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.1.ff.down.weight": {
"shape": [
2816,
7168
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.2.norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.2.attn.q_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.2.attn.k_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.2.attn.v_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.2.attn.o_proj.weight": {
"shape": [
2816,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.2.attn.q_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.2.attn.k_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.2.ff_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.2.ff.gate.weight": {
"shape": [
7168,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.2.ff.up.weight": {
"shape": [
7168,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.2.ff.down.weight": {
"shape": [
2816,
7168
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.3.norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.3.attn.q_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.3.attn.k_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.3.attn.v_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.3.attn.o_proj.weight": {
"shape": [
2816,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.3.attn.q_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.3.attn.k_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.3.ff_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.blocks.3.ff.gate.weight": {
"shape": [
7168,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.3.ff.up.weight": {
"shape": [
7168,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.blocks.3.ff.down.weight": {
"shape": [
2816,
7168
],
"dtype": "bfloat16"
},
"latent_deliberation.output_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.working_memory_bus.memory_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.working_memory_bus.address_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.working_memory_bus.k_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.working_memory_bus.v_proj.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.working_memory_bus.q_norm.weight": {
"shape": [
2816
],
"dtype": "float32"
},
"latent_deliberation.working_memory_bus.q_proj.0.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.working_memory_bus.q_proj.1.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.working_memory_bus.q_proj.2.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.working_memory_bus.q_proj.3.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.working_memory_bus.q_proj.4.weight": {
"shape": [
1024,
2816
],
"dtype": "bfloat16"
},
"latent_deliberation.working_memory_bus.o_proj.0.weight": {
"shape": [
2816,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.working_memory_bus.o_proj.1.weight": {
"shape": [
2816,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.working_memory_bus.o_proj.2.weight": {
"shape": [
2816,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.working_memory_bus.o_proj.3.weight": {
"shape": [
2816,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.working_memory_bus.o_proj.4.weight": {
"shape": [
2816,
1024
],
"dtype": "bfloat16"
},
"latent_deliberation.working_memory_bus.alpha": {
"shape": [
5,
16
],
"dtype": "bfloat16"
},
"latent_deliberation.working_memory_bus.rel_bias": {
"shape": [
16,
511
],
"dtype": "bfloat16"
},
"latent_deliberation.persistent_memory_bus.alpha": {
"shape": [
5,
1
],
"dtype": "bfloat16"
},
"latent_deliberation.experience_in.weight": {
"shape": [
1024,
8448
],
"dtype": "bfloat16"
},
"latent_deliberation.reason_embed.weight": {
"shape": [
6,
1024
],
"dtype": "bfloat16"
}
},
"shards": [
{
"file": "model-00001.safetensors",
"bytes": 776579654,
"sha256": "374380ce2183b488367e840c546c1f4c7d6251fd2740f8d19a89a32f257dbffb",
"tensors": [
"latent_deliberation.blocks.0.attn.k_norm.weight",
"latent_deliberation.blocks.0.attn.k_proj.weight",
"latent_deliberation.blocks.0.attn.o_proj.weight",
"latent_deliberation.blocks.0.attn.q_norm.weight",
"latent_deliberation.blocks.0.attn.q_proj.weight",
"latent_deliberation.blocks.0.attn.v_proj.weight",
"latent_deliberation.blocks.0.ff.down.weight",
"latent_deliberation.blocks.0.ff.gate.weight",
"latent_deliberation.blocks.0.ff.up.weight",
"latent_deliberation.blocks.0.ff_norm.weight",
"latent_deliberation.blocks.0.norm.weight",
"latent_deliberation.blocks.1.attn.k_norm.weight",
"latent_deliberation.blocks.1.attn.k_proj.weight",
"latent_deliberation.blocks.1.attn.o_proj.weight",
"latent_deliberation.blocks.1.attn.q_norm.weight",
"latent_deliberation.blocks.1.attn.q_proj.weight",
"latent_deliberation.blocks.1.attn.v_proj.weight",
"latent_deliberation.blocks.1.ff.down.weight",
"latent_deliberation.blocks.1.ff.gate.weight",
"latent_deliberation.blocks.1.ff.up.weight",
"latent_deliberation.blocks.1.ff_norm.weight",
"latent_deliberation.blocks.1.norm.weight",
"latent_deliberation.blocks.2.attn.k_norm.weight",
"latent_deliberation.blocks.2.attn.k_proj.weight",
"latent_deliberation.blocks.2.attn.o_proj.weight",
"latent_deliberation.blocks.2.attn.q_norm.weight",
"latent_deliberation.blocks.2.attn.q_proj.weight",
"latent_deliberation.blocks.2.attn.v_proj.weight",
"latent_deliberation.blocks.2.ff.down.weight",
"latent_deliberation.blocks.2.ff.gate.weight",
"latent_deliberation.blocks.2.ff.up.weight",
"latent_deliberation.blocks.2.ff_norm.weight",
"latent_deliberation.blocks.2.norm.weight",
"latent_deliberation.blocks.3.attn.k_norm.weight",
"latent_deliberation.blocks.3.attn.k_proj.weight",
"latent_deliberation.blocks.3.attn.o_proj.weight",
"latent_deliberation.blocks.3.attn.q_norm.weight",
"latent_deliberation.blocks.3.attn.q_proj.weight",
"latent_deliberation.blocks.3.attn.v_proj.weight",
"latent_deliberation.blocks.3.ff.down.weight",
"latent_deliberation.blocks.3.ff.gate.weight",
"latent_deliberation.blocks.3.ff.up.weight",
"latent_deliberation.blocks.3.ff_norm.weight",
"latent_deliberation.blocks.3.norm.weight",
"latent_deliberation.experience_in.weight",
"latent_deliberation.output_norm.weight",
"latent_deliberation.persistent_memory_bus.alpha",
"latent_deliberation.reason_embed.weight",
"latent_deliberation.trajectory.cell.a_log",
"latent_deliberation.trajectory.cell.b_proj.weight",
"latent_deliberation.trajectory.cell.dt_bias",
"latent_deliberation.trajectory.cell.f_proj.down.weight",
"latent_deliberation.trajectory.cell.f_proj.up.weight",
"latent_deliberation.trajectory.cell.g_proj.down.weight",
"latent_deliberation.trajectory.cell.g_proj.up.weight",
"latent_deliberation.trajectory.cell.k_proj.weight",
"latent_deliberation.trajectory.cell.o_proj.weight",
"latent_deliberation.trajectory.cell.q_proj.weight",
"latent_deliberation.trajectory.cell.v_proj.weight",
"latent_deliberation.trajectory.cell.w_proj.weight",
"latent_deliberation.trajectory.persistent.a_log",
"latent_deliberation.trajectory.persistent.b_proj.weight",
"latent_deliberation.trajectory.persistent.dt_bias",
"latent_deliberation.trajectory.persistent.f_proj.down.weight",
"latent_deliberation.trajectory.persistent.f_proj.up.weight",
"latent_deliberation.trajectory.persistent.g_proj.down.weight",
"latent_deliberation.trajectory.persistent.g_proj.up.weight",
"latent_deliberation.trajectory.persistent.k_proj.weight",
"latent_deliberation.trajectory.persistent.o_proj.weight",
"latent_deliberation.trajectory.persistent.q_proj.weight",
"latent_deliberation.trajectory.persistent.v_proj.weight",
"latent_deliberation.trajectory.persistent.w_proj.weight",
"latent_deliberation.trajectory.probe_embed.weight",
"latent_deliberation.trajectory.row.a_log",
"latent_deliberation.trajectory.row.b_proj.weight",
"latent_deliberation.trajectory.row.dt_bias",
"latent_deliberation.trajectory.row.f_proj.down.weight",
"latent_deliberation.trajectory.row.f_proj.up.weight",
"latent_deliberation.trajectory.row.g_proj.down.weight",
"latent_deliberation.trajectory.row.g_proj.up.weight",
"latent_deliberation.trajectory.row.k_proj.weight",
"latent_deliberation.trajectory.row.o_proj.weight",
"latent_deliberation.trajectory.row.q_proj.weight",
"latent_deliberation.trajectory.row.v_proj.weight",
"latent_deliberation.trajectory.row.w_proj.weight",
"latent_deliberation.working_memory_bus.address_norm.weight",
"latent_deliberation.working_memory_bus.alpha",
"latent_deliberation.working_memory_bus.k_proj.weight",
"latent_deliberation.working_memory_bus.memory_norm.weight",
"latent_deliberation.working_memory_bus.o_proj.0.weight",
"latent_deliberation.working_memory_bus.o_proj.1.weight",
"latent_deliberation.working_memory_bus.o_proj.2.weight",
"latent_deliberation.working_memory_bus.o_proj.3.weight",
"latent_deliberation.working_memory_bus.o_proj.4.weight",
"latent_deliberation.working_memory_bus.q_norm.weight",
"latent_deliberation.working_memory_bus.q_proj.0.weight",
"latent_deliberation.working_memory_bus.q_proj.1.weight",
"latent_deliberation.working_memory_bus.q_proj.2.weight",
"latent_deliberation.working_memory_bus.q_proj.3.weight",
"latent_deliberation.working_memory_bus.q_proj.4.weight",
"latent_deliberation.working_memory_bus.rel_bias",
"latent_deliberation.working_memory_bus.v_proj.weight"
]
},
{
"file": "model-00002.safetensors",
"bytes": 1991115265,
"sha256": "3b11844cc3f237a2b8008c1a7df7ffe2d6e78b4e4789af9e8dc756d619c72cf6",
"tensors": [
"model.decoder.embed_tokens.weight",
"model.decoder.layers.0.experts.down_proj.linear.weight",
"model.decoder.layers.0.experts.down_proj.lora_a",
"model.decoder.layers.0.experts.down_proj.lora_b"
]
},
{
"file": "model-00003.safetensors",
"bytes": 1645281286,
"sha256": "e4ca40905b0e8da647a20a735659268fce793827a64ccdf8de747b06fb604313",
"tensors": [
"model.decoder.layers.0.experts.gate_up_proj.linear.weight",
"model.decoder.layers.0.experts.gate_up_proj.lora_a",
"model.decoder.layers.0.experts.gate_up_proj.lora_b",
"model.decoder.layers.0.input_layernorm.weight",
"model.decoder.layers.0.layer_scalar",
"model.decoder.layers.0.mlp.down_proj.linear.weight",
"model.decoder.layers.0.mlp.down_proj.lora_a",
"model.decoder.layers.0.mlp.down_proj.lora_b",
"model.decoder.layers.0.mlp.gate_proj.linear.weight",
"model.decoder.layers.0.mlp.gate_proj.lora_a",
"model.decoder.layers.0.mlp.gate_proj.lora_b",
"model.decoder.layers.0.mlp.up_proj.linear.weight",
"model.decoder.layers.0.mlp.up_proj.lora_a",
"model.decoder.layers.0.mlp.up_proj.lora_b",
"model.decoder.layers.0.post_attention_layernorm.weight",
"model.decoder.layers.0.post_feedforward_layernorm.weight",
"model.decoder.layers.0.post_feedforward_layernorm_1.weight",
"model.decoder.layers.0.post_feedforward_layernorm_2.weight",
"model.decoder.layers.0.pre_feedforward_layernorm.weight",
"model.decoder.layers.0.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.0.router.per_expert_scale",
"model.decoder.layers.0.router.proj.weight",
"model.decoder.layers.0.router.scale",
"model.decoder.layers.0.self_attn.k_norm.weight",
"model.decoder.layers.0.self_attn.k_proj.linear.weight",
"model.decoder.layers.0.self_attn.k_proj.lora_a",
"model.decoder.layers.0.self_attn.k_proj.lora_b",
"model.decoder.layers.0.self_attn.o_proj.linear.weight",
"model.decoder.layers.0.self_attn.o_proj.lora_a",
"model.decoder.layers.0.self_attn.o_proj.lora_b",
"model.decoder.layers.0.self_attn.q_norm.weight",
"model.decoder.layers.0.self_attn.q_proj.linear.weight",
"model.decoder.layers.0.self_attn.q_proj.lora_a",
"model.decoder.layers.0.self_attn.q_proj.lora_b",
"model.decoder.layers.0.self_attn.v_proj.linear.weight",
"model.decoder.layers.0.self_attn.v_proj.lora_a",
"model.decoder.layers.0.self_attn.v_proj.lora_b",
"model.decoder.layers.1.experts.down_proj.linear.weight",
"model.decoder.layers.1.experts.down_proj.lora_a",
"model.decoder.layers.1.experts.down_proj.lora_b"
]
},
{
"file": "model-00004.safetensors",
"bytes": 1645281307,
"sha256": "8909471307dfe90a1b5d908f89d62ee9456754aa3fc1f4c5a1d36f2fb7b0ca6f",
"tensors": [
"model.decoder.layers.1.experts.gate_up_proj.linear.weight",
"model.decoder.layers.1.experts.gate_up_proj.lora_a",
"model.decoder.layers.1.experts.gate_up_proj.lora_b",
"model.decoder.layers.1.input_layernorm.weight",
"model.decoder.layers.1.layer_scalar",
"model.decoder.layers.1.mlp.down_proj.linear.weight",
"model.decoder.layers.1.mlp.down_proj.lora_a",
"model.decoder.layers.1.mlp.down_proj.lora_b",
"model.decoder.layers.1.mlp.gate_proj.linear.weight",
"model.decoder.layers.1.mlp.gate_proj.lora_a",
"model.decoder.layers.1.mlp.gate_proj.lora_b",
"model.decoder.layers.1.mlp.up_proj.linear.weight",
"model.decoder.layers.1.mlp.up_proj.lora_a",
"model.decoder.layers.1.mlp.up_proj.lora_b",
"model.decoder.layers.1.post_attention_layernorm.weight",
"model.decoder.layers.1.post_feedforward_layernorm.weight",
"model.decoder.layers.1.post_feedforward_layernorm_1.weight",
"model.decoder.layers.1.post_feedforward_layernorm_2.weight",
"model.decoder.layers.1.pre_feedforward_layernorm.weight",
"model.decoder.layers.1.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.1.router.per_expert_scale",
"model.decoder.layers.1.router.proj.weight",
"model.decoder.layers.1.router.scale",
"model.decoder.layers.1.self_attn.k_norm.weight",
"model.decoder.layers.1.self_attn.k_proj.linear.weight",
"model.decoder.layers.1.self_attn.k_proj.lora_a",
"model.decoder.layers.1.self_attn.k_proj.lora_b",
"model.decoder.layers.1.self_attn.o_proj.linear.weight",
"model.decoder.layers.1.self_attn.o_proj.lora_a",
"model.decoder.layers.1.self_attn.o_proj.lora_b",
"model.decoder.layers.1.self_attn.q_norm.weight",
"model.decoder.layers.1.self_attn.q_proj.linear.weight",
"model.decoder.layers.1.self_attn.q_proj.lora_a",
"model.decoder.layers.1.self_attn.q_proj.lora_b",
"model.decoder.layers.1.self_attn.v_proj.linear.weight",
"model.decoder.layers.1.self_attn.v_proj.lora_a",
"model.decoder.layers.1.self_attn.v_proj.lora_b",
"model.decoder.layers.10.experts.down_proj.linear.weight",
"model.decoder.layers.10.experts.down_proj.lora_a",
"model.decoder.layers.10.experts.down_proj.lora_b"
]
},
{
"file": "model-00005.safetensors",
"bytes": 1645281376,
"sha256": "f213f94cb031abe72a258c325145aeb6c0a6fecf9c6d17e46298207141d27cc7",
"tensors": [
"model.decoder.layers.10.experts.gate_up_proj.linear.weight",
"model.decoder.layers.10.experts.gate_up_proj.lora_a",
"model.decoder.layers.10.experts.gate_up_proj.lora_b",
"model.decoder.layers.10.input_layernorm.weight",
"model.decoder.layers.10.layer_scalar",
"model.decoder.layers.10.mlp.down_proj.linear.weight",
"model.decoder.layers.10.mlp.down_proj.lora_a",
"model.decoder.layers.10.mlp.down_proj.lora_b",
"model.decoder.layers.10.mlp.gate_proj.linear.weight",
"model.decoder.layers.10.mlp.gate_proj.lora_a",
"model.decoder.layers.10.mlp.gate_proj.lora_b",
"model.decoder.layers.10.mlp.up_proj.linear.weight",
"model.decoder.layers.10.mlp.up_proj.lora_a",
"model.decoder.layers.10.mlp.up_proj.lora_b",
"model.decoder.layers.10.post_attention_layernorm.weight",
"model.decoder.layers.10.post_feedforward_layernorm.weight",
"model.decoder.layers.10.post_feedforward_layernorm_1.weight",
"model.decoder.layers.10.post_feedforward_layernorm_2.weight",
"model.decoder.layers.10.pre_feedforward_layernorm.weight",
"model.decoder.layers.10.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.10.router.per_expert_scale",
"model.decoder.layers.10.router.proj.weight",
"model.decoder.layers.10.router.scale",
"model.decoder.layers.10.self_attn.k_norm.weight",
"model.decoder.layers.10.self_attn.k_proj.linear.weight",
"model.decoder.layers.10.self_attn.k_proj.lora_a",
"model.decoder.layers.10.self_attn.k_proj.lora_b",
"model.decoder.layers.10.self_attn.o_proj.linear.weight",
"model.decoder.layers.10.self_attn.o_proj.lora_a",
"model.decoder.layers.10.self_attn.o_proj.lora_b",
"model.decoder.layers.10.self_attn.q_norm.weight",
"model.decoder.layers.10.self_attn.q_proj.linear.weight",
"model.decoder.layers.10.self_attn.q_proj.lora_a",
"model.decoder.layers.10.self_attn.q_proj.lora_b",
"model.decoder.layers.10.self_attn.v_proj.linear.weight",
"model.decoder.layers.10.self_attn.v_proj.lora_a",
"model.decoder.layers.10.self_attn.v_proj.lora_b",
"model.decoder.layers.11.experts.down_proj.linear.weight",
"model.decoder.layers.11.experts.down_proj.lora_a",
"model.decoder.layers.11.experts.down_proj.lora_b"
]
},
{
"file": "model-00006.safetensors",
"bytes": 1674191579,
"sha256": "7d4997e1fdc157712d55572f1f427400bdb176888e6ad420bbb8567d6e50fbde",
"tensors": [
"model.decoder.layers.11.experts.gate_up_proj.linear.weight",
"model.decoder.layers.11.experts.gate_up_proj.lora_a",
"model.decoder.layers.11.experts.gate_up_proj.lora_b",
"model.decoder.layers.11.input_layernorm.weight",
"model.decoder.layers.11.layer_scalar",
"model.decoder.layers.11.mlp.down_proj.linear.weight",
"model.decoder.layers.11.mlp.down_proj.lora_a",
"model.decoder.layers.11.mlp.down_proj.lora_b",
"model.decoder.layers.11.mlp.gate_proj.linear.weight",
"model.decoder.layers.11.mlp.gate_proj.lora_a",
"model.decoder.layers.11.mlp.gate_proj.lora_b",
"model.decoder.layers.11.mlp.up_proj.linear.weight",
"model.decoder.layers.11.mlp.up_proj.lora_a",
"model.decoder.layers.11.mlp.up_proj.lora_b",
"model.decoder.layers.11.post_attention_layernorm.weight",
"model.decoder.layers.11.post_feedforward_layernorm.weight",
"model.decoder.layers.11.post_feedforward_layernorm_1.weight",
"model.decoder.layers.11.post_feedforward_layernorm_2.weight",
"model.decoder.layers.11.pre_feedforward_layernorm.weight",
"model.decoder.layers.11.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.11.router.per_expert_scale",
"model.decoder.layers.11.router.proj.weight",
"model.decoder.layers.11.router.scale",
"model.decoder.layers.11.self_attn.k_norm.weight",
"model.decoder.layers.11.self_attn.k_proj.linear.weight",
"model.decoder.layers.11.self_attn.k_proj.lora_a",
"model.decoder.layers.11.self_attn.k_proj.lora_b",
"model.decoder.layers.11.self_attn.o_proj.linear.weight",
"model.decoder.layers.11.self_attn.o_proj.lora_a",
"model.decoder.layers.11.self_attn.o_proj.lora_b",
"model.decoder.layers.11.self_attn.q_norm.weight",
"model.decoder.layers.11.self_attn.q_proj.linear.weight",
"model.decoder.layers.11.self_attn.q_proj.lora_a",
"model.decoder.layers.11.self_attn.q_proj.lora_b",
"model.decoder.layers.12.experts.down_proj.linear.weight",
"model.decoder.layers.12.experts.down_proj.lora_a",
"model.decoder.layers.12.experts.down_proj.lora_b"
]
},
{
"file": "model-00007.safetensors",
"bytes": 1645281438,
"sha256": "ec97a3868a1d77d35ff51e38e718db99d353ef44e0d320136966ec437f3376da",
"tensors": [
"model.decoder.layers.12.experts.gate_up_proj.linear.weight",
"model.decoder.layers.12.experts.gate_up_proj.lora_a",
"model.decoder.layers.12.experts.gate_up_proj.lora_b",
"model.decoder.layers.12.input_layernorm.weight",
"model.decoder.layers.12.layer_scalar",
"model.decoder.layers.12.mlp.down_proj.linear.weight",
"model.decoder.layers.12.mlp.down_proj.lora_a",
"model.decoder.layers.12.mlp.down_proj.lora_b",
"model.decoder.layers.12.mlp.gate_proj.linear.weight",
"model.decoder.layers.12.mlp.gate_proj.lora_a",
"model.decoder.layers.12.mlp.gate_proj.lora_b",
"model.decoder.layers.12.mlp.up_proj.linear.weight",
"model.decoder.layers.12.mlp.up_proj.lora_a",
"model.decoder.layers.12.mlp.up_proj.lora_b",
"model.decoder.layers.12.post_attention_layernorm.weight",
"model.decoder.layers.12.post_feedforward_layernorm.weight",
"model.decoder.layers.12.post_feedforward_layernorm_1.weight",
"model.decoder.layers.12.post_feedforward_layernorm_2.weight",
"model.decoder.layers.12.pre_feedforward_layernorm.weight",
"model.decoder.layers.12.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.12.router.per_expert_scale",
"model.decoder.layers.12.router.proj.weight",
"model.decoder.layers.12.router.scale",
"model.decoder.layers.12.self_attn.k_norm.weight",
"model.decoder.layers.12.self_attn.k_proj.linear.weight",
"model.decoder.layers.12.self_attn.k_proj.lora_a",
"model.decoder.layers.12.self_attn.k_proj.lora_b",
"model.decoder.layers.12.self_attn.o_proj.linear.weight",
"model.decoder.layers.12.self_attn.o_proj.lora_a",
"model.decoder.layers.12.self_attn.o_proj.lora_b",
"model.decoder.layers.12.self_attn.q_norm.weight",
"model.decoder.layers.12.self_attn.q_proj.linear.weight",
"model.decoder.layers.12.self_attn.q_proj.lora_a",
"model.decoder.layers.12.self_attn.q_proj.lora_b",
"model.decoder.layers.12.self_attn.v_proj.linear.weight",
"model.decoder.layers.12.self_attn.v_proj.lora_a",
"model.decoder.layers.12.self_attn.v_proj.lora_b",
"model.decoder.layers.13.experts.down_proj.linear.weight",
"model.decoder.layers.13.experts.down_proj.lora_a",
"model.decoder.layers.13.experts.down_proj.lora_b"
]
},
{
"file": "model-00008.safetensors",
"bytes": 1645281390,
"sha256": "c8aeeb93591a35251e6669fcb56d10101db3714468b5f4d1eecb27ae69a7cb98",
"tensors": [
"model.decoder.layers.13.experts.gate_up_proj.linear.weight",
"model.decoder.layers.13.experts.gate_up_proj.lora_a",
"model.decoder.layers.13.experts.gate_up_proj.lora_b",
"model.decoder.layers.13.input_layernorm.weight",
"model.decoder.layers.13.layer_scalar",
"model.decoder.layers.13.mlp.down_proj.linear.weight",
"model.decoder.layers.13.mlp.down_proj.lora_a",
"model.decoder.layers.13.mlp.down_proj.lora_b",
"model.decoder.layers.13.mlp.gate_proj.linear.weight",
"model.decoder.layers.13.mlp.gate_proj.lora_a",
"model.decoder.layers.13.mlp.gate_proj.lora_b",
"model.decoder.layers.13.mlp.up_proj.linear.weight",
"model.decoder.layers.13.mlp.up_proj.lora_a",
"model.decoder.layers.13.mlp.up_proj.lora_b",
"model.decoder.layers.13.post_attention_layernorm.weight",
"model.decoder.layers.13.post_feedforward_layernorm.weight",
"model.decoder.layers.13.post_feedforward_layernorm_1.weight",
"model.decoder.layers.13.post_feedforward_layernorm_2.weight",
"model.decoder.layers.13.pre_feedforward_layernorm.weight",
"model.decoder.layers.13.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.13.router.per_expert_scale",
"model.decoder.layers.13.router.proj.weight",
"model.decoder.layers.13.router.scale",
"model.decoder.layers.13.self_attn.k_norm.weight",
"model.decoder.layers.13.self_attn.k_proj.linear.weight",
"model.decoder.layers.13.self_attn.k_proj.lora_a",
"model.decoder.layers.13.self_attn.k_proj.lora_b",
"model.decoder.layers.13.self_attn.o_proj.linear.weight",
"model.decoder.layers.13.self_attn.o_proj.lora_a",
"model.decoder.layers.13.self_attn.o_proj.lora_b",
"model.decoder.layers.13.self_attn.q_norm.weight",
"model.decoder.layers.13.self_attn.q_proj.linear.weight",
"model.decoder.layers.13.self_attn.q_proj.lora_a",
"model.decoder.layers.13.self_attn.q_proj.lora_b",
"model.decoder.layers.13.self_attn.v_proj.linear.weight",
"model.decoder.layers.13.self_attn.v_proj.lora_a",
"model.decoder.layers.13.self_attn.v_proj.lora_b",
"model.decoder.layers.14.experts.down_proj.linear.weight",
"model.decoder.layers.14.experts.down_proj.lora_a",
"model.decoder.layers.14.experts.down_proj.lora_b"
]
},
{
"file": "model-00009.safetensors",
"bytes": 1645281404,
"sha256": "43b686872a4680f4d021f2ddaf71a592601972645cc6f97136708a2b529dc4c2",
"tensors": [
"model.decoder.layers.14.experts.gate_up_proj.linear.weight",
"model.decoder.layers.14.experts.gate_up_proj.lora_a",
"model.decoder.layers.14.experts.gate_up_proj.lora_b",
"model.decoder.layers.14.input_layernorm.weight",
"model.decoder.layers.14.layer_scalar",
"model.decoder.layers.14.mlp.down_proj.linear.weight",
"model.decoder.layers.14.mlp.down_proj.lora_a",
"model.decoder.layers.14.mlp.down_proj.lora_b",
"model.decoder.layers.14.mlp.gate_proj.linear.weight",
"model.decoder.layers.14.mlp.gate_proj.lora_a",
"model.decoder.layers.14.mlp.gate_proj.lora_b",
"model.decoder.layers.14.mlp.up_proj.linear.weight",
"model.decoder.layers.14.mlp.up_proj.lora_a",
"model.decoder.layers.14.mlp.up_proj.lora_b",
"model.decoder.layers.14.post_attention_layernorm.weight",
"model.decoder.layers.14.post_feedforward_layernorm.weight",
"model.decoder.layers.14.post_feedforward_layernorm_1.weight",
"model.decoder.layers.14.post_feedforward_layernorm_2.weight",
"model.decoder.layers.14.pre_feedforward_layernorm.weight",
"model.decoder.layers.14.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.14.router.per_expert_scale",
"model.decoder.layers.14.router.proj.weight",
"model.decoder.layers.14.router.scale",
"model.decoder.layers.14.self_attn.k_norm.weight",
"model.decoder.layers.14.self_attn.k_proj.linear.weight",
"model.decoder.layers.14.self_attn.k_proj.lora_a",
"model.decoder.layers.14.self_attn.k_proj.lora_b",
"model.decoder.layers.14.self_attn.o_proj.linear.weight",
"model.decoder.layers.14.self_attn.o_proj.lora_a",
"model.decoder.layers.14.self_attn.o_proj.lora_b",
"model.decoder.layers.14.self_attn.q_norm.weight",
"model.decoder.layers.14.self_attn.q_proj.linear.weight",
"model.decoder.layers.14.self_attn.q_proj.lora_a",
"model.decoder.layers.14.self_attn.q_proj.lora_b",
"model.decoder.layers.14.self_attn.v_proj.linear.weight",
"model.decoder.layers.14.self_attn.v_proj.lora_a",
"model.decoder.layers.14.self_attn.v_proj.lora_b",
"model.decoder.layers.15.experts.down_proj.linear.weight",
"model.decoder.layers.15.experts.down_proj.lora_a",
"model.decoder.layers.15.experts.down_proj.lora_b"
]
},
{
"file": "model-00010.safetensors",
"bytes": 1645281370,
"sha256": "946aa5129578785476e9e241757b64a0f4ec5777c873b576b25bbdc67d2f5f08",
"tensors": [
"model.decoder.layers.15.experts.gate_up_proj.linear.weight",
"model.decoder.layers.15.experts.gate_up_proj.lora_a",
"model.decoder.layers.15.experts.gate_up_proj.lora_b",
"model.decoder.layers.15.input_layernorm.weight",
"model.decoder.layers.15.layer_scalar",
"model.decoder.layers.15.mlp.down_proj.linear.weight",
"model.decoder.layers.15.mlp.down_proj.lora_a",
"model.decoder.layers.15.mlp.down_proj.lora_b",
"model.decoder.layers.15.mlp.gate_proj.linear.weight",
"model.decoder.layers.15.mlp.gate_proj.lora_a",
"model.decoder.layers.15.mlp.gate_proj.lora_b",
"model.decoder.layers.15.mlp.up_proj.linear.weight",
"model.decoder.layers.15.mlp.up_proj.lora_a",
"model.decoder.layers.15.mlp.up_proj.lora_b",
"model.decoder.layers.15.post_attention_layernorm.weight",
"model.decoder.layers.15.post_feedforward_layernorm.weight",
"model.decoder.layers.15.post_feedforward_layernorm_1.weight",
"model.decoder.layers.15.post_feedforward_layernorm_2.weight",
"model.decoder.layers.15.pre_feedforward_layernorm.weight",
"model.decoder.layers.15.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.15.router.per_expert_scale",
"model.decoder.layers.15.router.proj.weight",
"model.decoder.layers.15.router.scale",
"model.decoder.layers.15.self_attn.k_norm.weight",
"model.decoder.layers.15.self_attn.k_proj.linear.weight",
"model.decoder.layers.15.self_attn.k_proj.lora_a",
"model.decoder.layers.15.self_attn.k_proj.lora_b",
"model.decoder.layers.15.self_attn.o_proj.linear.weight",
"model.decoder.layers.15.self_attn.o_proj.lora_a",
"model.decoder.layers.15.self_attn.o_proj.lora_b",
"model.decoder.layers.15.self_attn.q_norm.weight",
"model.decoder.layers.15.self_attn.q_proj.linear.weight",
"model.decoder.layers.15.self_attn.q_proj.lora_a",
"model.decoder.layers.15.self_attn.q_proj.lora_b",
"model.decoder.layers.15.self_attn.v_proj.linear.weight",
"model.decoder.layers.15.self_attn.v_proj.lora_a",
"model.decoder.layers.15.self_attn.v_proj.lora_b",
"model.decoder.layers.16.experts.down_proj.linear.weight",
"model.decoder.layers.16.experts.down_proj.lora_a",
"model.decoder.layers.16.experts.down_proj.lora_b"
]
},
{
"file": "model-00011.safetensors",
"bytes": 1645281424,
"sha256": "adb4df6d408098ec73a1ed3a6f4fbad0202fd93d4af150828996720341c141ec",
"tensors": [
"model.decoder.layers.16.experts.gate_up_proj.linear.weight",
"model.decoder.layers.16.experts.gate_up_proj.lora_a",
"model.decoder.layers.16.experts.gate_up_proj.lora_b",
"model.decoder.layers.16.input_layernorm.weight",
"model.decoder.layers.16.layer_scalar",
"model.decoder.layers.16.mlp.down_proj.linear.weight",
"model.decoder.layers.16.mlp.down_proj.lora_a",
"model.decoder.layers.16.mlp.down_proj.lora_b",
"model.decoder.layers.16.mlp.gate_proj.linear.weight",
"model.decoder.layers.16.mlp.gate_proj.lora_a",
"model.decoder.layers.16.mlp.gate_proj.lora_b",
"model.decoder.layers.16.mlp.up_proj.linear.weight",
"model.decoder.layers.16.mlp.up_proj.lora_a",
"model.decoder.layers.16.mlp.up_proj.lora_b",
"model.decoder.layers.16.post_attention_layernorm.weight",
"model.decoder.layers.16.post_feedforward_layernorm.weight",
"model.decoder.layers.16.post_feedforward_layernorm_1.weight",
"model.decoder.layers.16.post_feedforward_layernorm_2.weight",
"model.decoder.layers.16.pre_feedforward_layernorm.weight",
"model.decoder.layers.16.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.16.router.per_expert_scale",
"model.decoder.layers.16.router.proj.weight",
"model.decoder.layers.16.router.scale",
"model.decoder.layers.16.self_attn.k_norm.weight",
"model.decoder.layers.16.self_attn.k_proj.linear.weight",
"model.decoder.layers.16.self_attn.k_proj.lora_a",
"model.decoder.layers.16.self_attn.k_proj.lora_b",
"model.decoder.layers.16.self_attn.o_proj.linear.weight",
"model.decoder.layers.16.self_attn.o_proj.lora_a",
"model.decoder.layers.16.self_attn.o_proj.lora_b",
"model.decoder.layers.16.self_attn.q_norm.weight",
"model.decoder.layers.16.self_attn.q_proj.linear.weight",
"model.decoder.layers.16.self_attn.q_proj.lora_a",
"model.decoder.layers.16.self_attn.q_proj.lora_b",
"model.decoder.layers.16.self_attn.v_proj.linear.weight",
"model.decoder.layers.16.self_attn.v_proj.lora_a",
"model.decoder.layers.16.self_attn.v_proj.lora_b",
"model.decoder.layers.17.experts.down_proj.linear.weight",
"model.decoder.layers.17.experts.down_proj.lora_a",
"model.decoder.layers.17.experts.down_proj.lora_b"
]
},
{
"file": "model-00012.safetensors",
"bytes": 1674191611,
"sha256": "86c9845b281f09b894ae62b3dde3574cd779417a8906b52a471b601c6ae19890",
"tensors": [
"model.decoder.layers.17.experts.gate_up_proj.linear.weight",
"model.decoder.layers.17.experts.gate_up_proj.lora_a",
"model.decoder.layers.17.experts.gate_up_proj.lora_b",
"model.decoder.layers.17.input_layernorm.weight",
"model.decoder.layers.17.layer_scalar",
"model.decoder.layers.17.mlp.down_proj.linear.weight",
"model.decoder.layers.17.mlp.down_proj.lora_a",
"model.decoder.layers.17.mlp.down_proj.lora_b",
"model.decoder.layers.17.mlp.gate_proj.linear.weight",
"model.decoder.layers.17.mlp.gate_proj.lora_a",
"model.decoder.layers.17.mlp.gate_proj.lora_b",
"model.decoder.layers.17.mlp.up_proj.linear.weight",
"model.decoder.layers.17.mlp.up_proj.lora_a",
"model.decoder.layers.17.mlp.up_proj.lora_b",
"model.decoder.layers.17.post_attention_layernorm.weight",
"model.decoder.layers.17.post_feedforward_layernorm.weight",
"model.decoder.layers.17.post_feedforward_layernorm_1.weight",
"model.decoder.layers.17.post_feedforward_layernorm_2.weight",
"model.decoder.layers.17.pre_feedforward_layernorm.weight",
"model.decoder.layers.17.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.17.router.per_expert_scale",
"model.decoder.layers.17.router.proj.weight",
"model.decoder.layers.17.router.scale",
"model.decoder.layers.17.self_attn.k_norm.weight",
"model.decoder.layers.17.self_attn.k_proj.linear.weight",
"model.decoder.layers.17.self_attn.k_proj.lora_a",
"model.decoder.layers.17.self_attn.k_proj.lora_b",
"model.decoder.layers.17.self_attn.o_proj.linear.weight",
"model.decoder.layers.17.self_attn.o_proj.lora_a",
"model.decoder.layers.17.self_attn.o_proj.lora_b",
"model.decoder.layers.17.self_attn.q_norm.weight",
"model.decoder.layers.17.self_attn.q_proj.linear.weight",
"model.decoder.layers.17.self_attn.q_proj.lora_a",
"model.decoder.layers.17.self_attn.q_proj.lora_b",
"model.decoder.layers.18.experts.down_proj.linear.weight",
"model.decoder.layers.18.experts.down_proj.lora_a",
"model.decoder.layers.18.experts.down_proj.lora_b"
]
},
{
"file": "model-00013.safetensors",
"bytes": 1645281386,
"sha256": "b2042c1d4bdb49b8a4ed0423a86c4694f2c0cf345e6d247022bc919b818db9e4",
"tensors": [
"model.decoder.layers.18.experts.gate_up_proj.linear.weight",
"model.decoder.layers.18.experts.gate_up_proj.lora_a",
"model.decoder.layers.18.experts.gate_up_proj.lora_b",
"model.decoder.layers.18.input_layernorm.weight",
"model.decoder.layers.18.layer_scalar",
"model.decoder.layers.18.mlp.down_proj.linear.weight",
"model.decoder.layers.18.mlp.down_proj.lora_a",
"model.decoder.layers.18.mlp.down_proj.lora_b",
"model.decoder.layers.18.mlp.gate_proj.linear.weight",
"model.decoder.layers.18.mlp.gate_proj.lora_a",
"model.decoder.layers.18.mlp.gate_proj.lora_b",
"model.decoder.layers.18.mlp.up_proj.linear.weight",
"model.decoder.layers.18.mlp.up_proj.lora_a",
"model.decoder.layers.18.mlp.up_proj.lora_b",
"model.decoder.layers.18.post_attention_layernorm.weight",
"model.decoder.layers.18.post_feedforward_layernorm.weight",
"model.decoder.layers.18.post_feedforward_layernorm_1.weight",
"model.decoder.layers.18.post_feedforward_layernorm_2.weight",
"model.decoder.layers.18.pre_feedforward_layernorm.weight",
"model.decoder.layers.18.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.18.router.per_expert_scale",
"model.decoder.layers.18.router.proj.weight",
"model.decoder.layers.18.router.scale",
"model.decoder.layers.18.self_attn.k_norm.weight",
"model.decoder.layers.18.self_attn.k_proj.linear.weight",
"model.decoder.layers.18.self_attn.k_proj.lora_a",
"model.decoder.layers.18.self_attn.k_proj.lora_b",
"model.decoder.layers.18.self_attn.o_proj.linear.weight",
"model.decoder.layers.18.self_attn.o_proj.lora_a",
"model.decoder.layers.18.self_attn.o_proj.lora_b",
"model.decoder.layers.18.self_attn.q_norm.weight",
"model.decoder.layers.18.self_attn.q_proj.linear.weight",
"model.decoder.layers.18.self_attn.q_proj.lora_a",
"model.decoder.layers.18.self_attn.q_proj.lora_b",
"model.decoder.layers.18.self_attn.v_proj.linear.weight",
"model.decoder.layers.18.self_attn.v_proj.lora_a",
"model.decoder.layers.18.self_attn.v_proj.lora_b",
"model.decoder.layers.19.experts.down_proj.linear.weight",
"model.decoder.layers.19.experts.down_proj.lora_a",
"model.decoder.layers.19.experts.down_proj.lora_b"
]
},
{
"file": "model-00014.safetensors",
"bytes": 1645281393,
"sha256": "0233e8d5a91a79edd030479e287621af3bd962f080d7b1717dd03ab6fb417c97",
"tensors": [
"model.decoder.layers.19.experts.gate_up_proj.linear.weight",
"model.decoder.layers.19.experts.gate_up_proj.lora_a",
"model.decoder.layers.19.experts.gate_up_proj.lora_b",
"model.decoder.layers.19.input_layernorm.weight",
"model.decoder.layers.19.layer_scalar",
"model.decoder.layers.19.mlp.down_proj.linear.weight",
"model.decoder.layers.19.mlp.down_proj.lora_a",
"model.decoder.layers.19.mlp.down_proj.lora_b",
"model.decoder.layers.19.mlp.gate_proj.linear.weight",
"model.decoder.layers.19.mlp.gate_proj.lora_a",
"model.decoder.layers.19.mlp.gate_proj.lora_b",
"model.decoder.layers.19.mlp.up_proj.linear.weight",
"model.decoder.layers.19.mlp.up_proj.lora_a",
"model.decoder.layers.19.mlp.up_proj.lora_b",
"model.decoder.layers.19.post_attention_layernorm.weight",
"model.decoder.layers.19.post_feedforward_layernorm.weight",
"model.decoder.layers.19.post_feedforward_layernorm_1.weight",
"model.decoder.layers.19.post_feedforward_layernorm_2.weight",
"model.decoder.layers.19.pre_feedforward_layernorm.weight",
"model.decoder.layers.19.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.19.router.per_expert_scale",
"model.decoder.layers.19.router.proj.weight",
"model.decoder.layers.19.router.scale",
"model.decoder.layers.19.self_attn.k_norm.weight",
"model.decoder.layers.19.self_attn.k_proj.linear.weight",
"model.decoder.layers.19.self_attn.k_proj.lora_a",
"model.decoder.layers.19.self_attn.k_proj.lora_b",
"model.decoder.layers.19.self_attn.o_proj.linear.weight",
"model.decoder.layers.19.self_attn.o_proj.lora_a",
"model.decoder.layers.19.self_attn.o_proj.lora_b",
"model.decoder.layers.19.self_attn.q_norm.weight",
"model.decoder.layers.19.self_attn.q_proj.linear.weight",
"model.decoder.layers.19.self_attn.q_proj.lora_a",
"model.decoder.layers.19.self_attn.q_proj.lora_b",
"model.decoder.layers.19.self_attn.v_proj.linear.weight",
"model.decoder.layers.19.self_attn.v_proj.lora_a",
"model.decoder.layers.19.self_attn.v_proj.lora_b",
"model.decoder.layers.2.experts.down_proj.linear.weight",
"model.decoder.layers.2.experts.down_proj.lora_a",
"model.decoder.layers.2.experts.down_proj.lora_b"
]
},
{
"file": "model-00015.safetensors",
"bytes": 1645281363,
"sha256": "75bab4540f1aa39d31271ec3d36e414e24fa500d3bce0dc5a00da0c1a8a25582",
"tensors": [
"model.decoder.layers.2.experts.gate_up_proj.linear.weight",
"model.decoder.layers.2.experts.gate_up_proj.lora_a",
"model.decoder.layers.2.experts.gate_up_proj.lora_b",
"model.decoder.layers.2.input_layernorm.weight",
"model.decoder.layers.2.layer_scalar",
"model.decoder.layers.2.mlp.down_proj.linear.weight",
"model.decoder.layers.2.mlp.down_proj.lora_a",
"model.decoder.layers.2.mlp.down_proj.lora_b",
"model.decoder.layers.2.mlp.gate_proj.linear.weight",
"model.decoder.layers.2.mlp.gate_proj.lora_a",
"model.decoder.layers.2.mlp.gate_proj.lora_b",
"model.decoder.layers.2.mlp.up_proj.linear.weight",
"model.decoder.layers.2.mlp.up_proj.lora_a",
"model.decoder.layers.2.mlp.up_proj.lora_b",
"model.decoder.layers.2.post_attention_layernorm.weight",
"model.decoder.layers.2.post_feedforward_layernorm.weight",
"model.decoder.layers.2.post_feedforward_layernorm_1.weight",
"model.decoder.layers.2.post_feedforward_layernorm_2.weight",
"model.decoder.layers.2.pre_feedforward_layernorm.weight",
"model.decoder.layers.2.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.2.router.per_expert_scale",
"model.decoder.layers.2.router.proj.weight",
"model.decoder.layers.2.router.scale",
"model.decoder.layers.2.self_attn.k_norm.weight",
"model.decoder.layers.2.self_attn.k_proj.linear.weight",
"model.decoder.layers.2.self_attn.k_proj.lora_a",
"model.decoder.layers.2.self_attn.k_proj.lora_b",
"model.decoder.layers.2.self_attn.o_proj.linear.weight",
"model.decoder.layers.2.self_attn.o_proj.lora_a",
"model.decoder.layers.2.self_attn.o_proj.lora_b",
"model.decoder.layers.2.self_attn.q_norm.weight",
"model.decoder.layers.2.self_attn.q_proj.linear.weight",
"model.decoder.layers.2.self_attn.q_proj.lora_a",
"model.decoder.layers.2.self_attn.q_proj.lora_b",
"model.decoder.layers.2.self_attn.v_proj.linear.weight",
"model.decoder.layers.2.self_attn.v_proj.lora_a",
"model.decoder.layers.2.self_attn.v_proj.lora_b",
"model.decoder.layers.20.experts.down_proj.linear.weight",
"model.decoder.layers.20.experts.down_proj.lora_a",
"model.decoder.layers.20.experts.down_proj.lora_b"
]
},
{
"file": "model-00016.safetensors",
"bytes": 1645281392,
"sha256": "37e7c3bbf2fc81bd14f95dd5e14d49e7e6cda481b8478d64562a8be0d2c989fa",
"tensors": [
"model.decoder.layers.20.experts.gate_up_proj.linear.weight",
"model.decoder.layers.20.experts.gate_up_proj.lora_a",
"model.decoder.layers.20.experts.gate_up_proj.lora_b",
"model.decoder.layers.20.input_layernorm.weight",
"model.decoder.layers.20.layer_scalar",
"model.decoder.layers.20.mlp.down_proj.linear.weight",
"model.decoder.layers.20.mlp.down_proj.lora_a",
"model.decoder.layers.20.mlp.down_proj.lora_b",
"model.decoder.layers.20.mlp.gate_proj.linear.weight",
"model.decoder.layers.20.mlp.gate_proj.lora_a",
"model.decoder.layers.20.mlp.gate_proj.lora_b",
"model.decoder.layers.20.mlp.up_proj.linear.weight",
"model.decoder.layers.20.mlp.up_proj.lora_a",
"model.decoder.layers.20.mlp.up_proj.lora_b",
"model.decoder.layers.20.post_attention_layernorm.weight",
"model.decoder.layers.20.post_feedforward_layernorm.weight",
"model.decoder.layers.20.post_feedforward_layernorm_1.weight",
"model.decoder.layers.20.post_feedforward_layernorm_2.weight",
"model.decoder.layers.20.pre_feedforward_layernorm.weight",
"model.decoder.layers.20.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.20.router.per_expert_scale",
"model.decoder.layers.20.router.proj.weight",
"model.decoder.layers.20.router.scale",
"model.decoder.layers.20.self_attn.k_norm.weight",
"model.decoder.layers.20.self_attn.k_proj.linear.weight",
"model.decoder.layers.20.self_attn.k_proj.lora_a",
"model.decoder.layers.20.self_attn.k_proj.lora_b",
"model.decoder.layers.20.self_attn.o_proj.linear.weight",
"model.decoder.layers.20.self_attn.o_proj.lora_a",
"model.decoder.layers.20.self_attn.o_proj.lora_b",
"model.decoder.layers.20.self_attn.q_norm.weight",
"model.decoder.layers.20.self_attn.q_proj.linear.weight",
"model.decoder.layers.20.self_attn.q_proj.lora_a",
"model.decoder.layers.20.self_attn.q_proj.lora_b",
"model.decoder.layers.20.self_attn.v_proj.linear.weight",
"model.decoder.layers.20.self_attn.v_proj.lora_a",
"model.decoder.layers.20.self_attn.v_proj.lora_b",
"model.decoder.layers.21.experts.down_proj.linear.weight",
"model.decoder.layers.21.experts.down_proj.lora_a",
"model.decoder.layers.21.experts.down_proj.lora_b"
]
},
{
"file": "model-00017.safetensors",
"bytes": 1645281346,
"sha256": "82dc6c75a7ca3a36ddb16733beead912507fcb5fbc236d06b9c249b9eb22ac09",
"tensors": [
"model.decoder.layers.21.experts.gate_up_proj.linear.weight",
"model.decoder.layers.21.experts.gate_up_proj.lora_a",
"model.decoder.layers.21.experts.gate_up_proj.lora_b",
"model.decoder.layers.21.input_layernorm.weight",
"model.decoder.layers.21.layer_scalar",
"model.decoder.layers.21.mlp.down_proj.linear.weight",
"model.decoder.layers.21.mlp.down_proj.lora_a",
"model.decoder.layers.21.mlp.down_proj.lora_b",
"model.decoder.layers.21.mlp.gate_proj.linear.weight",
"model.decoder.layers.21.mlp.gate_proj.lora_a",
"model.decoder.layers.21.mlp.gate_proj.lora_b",
"model.decoder.layers.21.mlp.up_proj.linear.weight",
"model.decoder.layers.21.mlp.up_proj.lora_a",
"model.decoder.layers.21.mlp.up_proj.lora_b",
"model.decoder.layers.21.post_attention_layernorm.weight",
"model.decoder.layers.21.post_feedforward_layernorm.weight",
"model.decoder.layers.21.post_feedforward_layernorm_1.weight",
"model.decoder.layers.21.post_feedforward_layernorm_2.weight",
"model.decoder.layers.21.pre_feedforward_layernorm.weight",
"model.decoder.layers.21.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.21.router.per_expert_scale",
"model.decoder.layers.21.router.proj.weight",
"model.decoder.layers.21.router.scale",
"model.decoder.layers.21.self_attn.k_norm.weight",
"model.decoder.layers.21.self_attn.k_proj.linear.weight",
"model.decoder.layers.21.self_attn.k_proj.lora_a",
"model.decoder.layers.21.self_attn.k_proj.lora_b",
"model.decoder.layers.21.self_attn.o_proj.linear.weight",
"model.decoder.layers.21.self_attn.o_proj.lora_a",
"model.decoder.layers.21.self_attn.o_proj.lora_b",
"model.decoder.layers.21.self_attn.q_norm.weight",
"model.decoder.layers.21.self_attn.q_proj.linear.weight",
"model.decoder.layers.21.self_attn.q_proj.lora_a",
"model.decoder.layers.21.self_attn.q_proj.lora_b",
"model.decoder.layers.21.self_attn.v_proj.linear.weight",
"model.decoder.layers.21.self_attn.v_proj.lora_a",
"model.decoder.layers.21.self_attn.v_proj.lora_b",
"model.decoder.layers.22.experts.down_proj.linear.weight",
"model.decoder.layers.22.experts.down_proj.lora_a",
"model.decoder.layers.22.experts.down_proj.lora_b"
]
},
{
"file": "model-00018.safetensors",
"bytes": 1645281342,
"sha256": "b49d0e174f0d8422d737d7023c283a555f359c994a07e593aae5d07eb291c0ae",
"tensors": [
"model.decoder.layers.22.experts.gate_up_proj.linear.weight",
"model.decoder.layers.22.experts.gate_up_proj.lora_a",
"model.decoder.layers.22.experts.gate_up_proj.lora_b",
"model.decoder.layers.22.input_layernorm.weight",
"model.decoder.layers.22.layer_scalar",
"model.decoder.layers.22.mlp.down_proj.linear.weight",
"model.decoder.layers.22.mlp.down_proj.lora_a",
"model.decoder.layers.22.mlp.down_proj.lora_b",
"model.decoder.layers.22.mlp.gate_proj.linear.weight",
"model.decoder.layers.22.mlp.gate_proj.lora_a",
"model.decoder.layers.22.mlp.gate_proj.lora_b",
"model.decoder.layers.22.mlp.up_proj.linear.weight",
"model.decoder.layers.22.mlp.up_proj.lora_a",
"model.decoder.layers.22.mlp.up_proj.lora_b",
"model.decoder.layers.22.post_attention_layernorm.weight",
"model.decoder.layers.22.post_feedforward_layernorm.weight",
"model.decoder.layers.22.post_feedforward_layernorm_1.weight",
"model.decoder.layers.22.post_feedforward_layernorm_2.weight",
"model.decoder.layers.22.pre_feedforward_layernorm.weight",
"model.decoder.layers.22.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.22.router.per_expert_scale",
"model.decoder.layers.22.router.proj.weight",
"model.decoder.layers.22.router.scale",
"model.decoder.layers.22.self_attn.k_norm.weight",
"model.decoder.layers.22.self_attn.k_proj.linear.weight",
"model.decoder.layers.22.self_attn.k_proj.lora_a",
"model.decoder.layers.22.self_attn.k_proj.lora_b",
"model.decoder.layers.22.self_attn.o_proj.linear.weight",
"model.decoder.layers.22.self_attn.o_proj.lora_a",
"model.decoder.layers.22.self_attn.o_proj.lora_b",
"model.decoder.layers.22.self_attn.q_norm.weight",
"model.decoder.layers.22.self_attn.q_proj.linear.weight",
"model.decoder.layers.22.self_attn.q_proj.lora_a",
"model.decoder.layers.22.self_attn.q_proj.lora_b",
"model.decoder.layers.22.self_attn.v_proj.linear.weight",
"model.decoder.layers.22.self_attn.v_proj.lora_a",
"model.decoder.layers.22.self_attn.v_proj.lora_b",
"model.decoder.layers.23.experts.down_proj.linear.weight",
"model.decoder.layers.23.experts.down_proj.lora_a",
"model.decoder.layers.23.experts.down_proj.lora_b"
]
},
{
"file": "model-00019.safetensors",
"bytes": 1674191627,
"sha256": "e8e66177d4ad899a85ca712eb15fce721a7db756121ce3123d13b16eb3c0b0a8",
"tensors": [
"model.decoder.layers.23.experts.gate_up_proj.linear.weight",
"model.decoder.layers.23.experts.gate_up_proj.lora_a",
"model.decoder.layers.23.experts.gate_up_proj.lora_b",
"model.decoder.layers.23.input_layernorm.weight",
"model.decoder.layers.23.layer_scalar",
"model.decoder.layers.23.mlp.down_proj.linear.weight",
"model.decoder.layers.23.mlp.down_proj.lora_a",
"model.decoder.layers.23.mlp.down_proj.lora_b",
"model.decoder.layers.23.mlp.gate_proj.linear.weight",
"model.decoder.layers.23.mlp.gate_proj.lora_a",
"model.decoder.layers.23.mlp.gate_proj.lora_b",
"model.decoder.layers.23.mlp.up_proj.linear.weight",
"model.decoder.layers.23.mlp.up_proj.lora_a",
"model.decoder.layers.23.mlp.up_proj.lora_b",
"model.decoder.layers.23.post_attention_layernorm.weight",
"model.decoder.layers.23.post_feedforward_layernorm.weight",
"model.decoder.layers.23.post_feedforward_layernorm_1.weight",
"model.decoder.layers.23.post_feedforward_layernorm_2.weight",
"model.decoder.layers.23.pre_feedforward_layernorm.weight",
"model.decoder.layers.23.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.23.router.per_expert_scale",
"model.decoder.layers.23.router.proj.weight",
"model.decoder.layers.23.router.scale",
"model.decoder.layers.23.self_attn.k_norm.weight",
"model.decoder.layers.23.self_attn.k_proj.linear.weight",
"model.decoder.layers.23.self_attn.k_proj.lora_a",
"model.decoder.layers.23.self_attn.k_proj.lora_b",
"model.decoder.layers.23.self_attn.o_proj.linear.weight",
"model.decoder.layers.23.self_attn.o_proj.lora_a",
"model.decoder.layers.23.self_attn.o_proj.lora_b",
"model.decoder.layers.23.self_attn.q_norm.weight",
"model.decoder.layers.23.self_attn.q_proj.linear.weight",
"model.decoder.layers.23.self_attn.q_proj.lora_a",
"model.decoder.layers.23.self_attn.q_proj.lora_b",
"model.decoder.layers.24.experts.down_proj.linear.weight",
"model.decoder.layers.24.experts.down_proj.lora_a",
"model.decoder.layers.24.experts.down_proj.lora_b"
]
},
{
"file": "model-00020.safetensors",
"bytes": 1645281442,
"sha256": "d87e3d52c22cbec2e5681d7c048ddbe5109df7f8c7af99c713c00dfe351b2ae6",
"tensors": [
"model.decoder.layers.24.experts.gate_up_proj.linear.weight",
"model.decoder.layers.24.experts.gate_up_proj.lora_a",
"model.decoder.layers.24.experts.gate_up_proj.lora_b",
"model.decoder.layers.24.input_layernorm.weight",
"model.decoder.layers.24.layer_scalar",
"model.decoder.layers.24.mlp.down_proj.linear.weight",
"model.decoder.layers.24.mlp.down_proj.lora_a",
"model.decoder.layers.24.mlp.down_proj.lora_b",
"model.decoder.layers.24.mlp.gate_proj.linear.weight",
"model.decoder.layers.24.mlp.gate_proj.lora_a",
"model.decoder.layers.24.mlp.gate_proj.lora_b",
"model.decoder.layers.24.mlp.up_proj.linear.weight",
"model.decoder.layers.24.mlp.up_proj.lora_a",
"model.decoder.layers.24.mlp.up_proj.lora_b",
"model.decoder.layers.24.post_attention_layernorm.weight",
"model.decoder.layers.24.post_feedforward_layernorm.weight",
"model.decoder.layers.24.post_feedforward_layernorm_1.weight",
"model.decoder.layers.24.post_feedforward_layernorm_2.weight",
"model.decoder.layers.24.pre_feedforward_layernorm.weight",
"model.decoder.layers.24.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.24.router.per_expert_scale",
"model.decoder.layers.24.router.proj.weight",
"model.decoder.layers.24.router.scale",
"model.decoder.layers.24.self_attn.k_norm.weight",
"model.decoder.layers.24.self_attn.k_proj.linear.weight",
"model.decoder.layers.24.self_attn.k_proj.lora_a",
"model.decoder.layers.24.self_attn.k_proj.lora_b",
"model.decoder.layers.24.self_attn.o_proj.linear.weight",
"model.decoder.layers.24.self_attn.o_proj.lora_a",
"model.decoder.layers.24.self_attn.o_proj.lora_b",
"model.decoder.layers.24.self_attn.q_norm.weight",
"model.decoder.layers.24.self_attn.q_proj.linear.weight",
"model.decoder.layers.24.self_attn.q_proj.lora_a",
"model.decoder.layers.24.self_attn.q_proj.lora_b",
"model.decoder.layers.24.self_attn.v_proj.linear.weight",
"model.decoder.layers.24.self_attn.v_proj.lora_a",
"model.decoder.layers.24.self_attn.v_proj.lora_b",
"model.decoder.layers.25.experts.down_proj.linear.weight",
"model.decoder.layers.25.experts.down_proj.lora_a",
"model.decoder.layers.25.experts.down_proj.lora_b"
]
},
{
"file": "model-00021.safetensors",
"bytes": 1645281412,
"sha256": "44aecb5538ee528dcc90f49733268c67795a44a71b0fece8eb1b51b84cca59ea",
"tensors": [
"model.decoder.layers.25.experts.gate_up_proj.linear.weight",
"model.decoder.layers.25.experts.gate_up_proj.lora_a",
"model.decoder.layers.25.experts.gate_up_proj.lora_b",
"model.decoder.layers.25.input_layernorm.weight",
"model.decoder.layers.25.layer_scalar",
"model.decoder.layers.25.mlp.down_proj.linear.weight",
"model.decoder.layers.25.mlp.down_proj.lora_a",
"model.decoder.layers.25.mlp.down_proj.lora_b",
"model.decoder.layers.25.mlp.gate_proj.linear.weight",
"model.decoder.layers.25.mlp.gate_proj.lora_a",
"model.decoder.layers.25.mlp.gate_proj.lora_b",
"model.decoder.layers.25.mlp.up_proj.linear.weight",
"model.decoder.layers.25.mlp.up_proj.lora_a",
"model.decoder.layers.25.mlp.up_proj.lora_b",
"model.decoder.layers.25.post_attention_layernorm.weight",
"model.decoder.layers.25.post_feedforward_layernorm.weight",
"model.decoder.layers.25.post_feedforward_layernorm_1.weight",
"model.decoder.layers.25.post_feedforward_layernorm_2.weight",
"model.decoder.layers.25.pre_feedforward_layernorm.weight",
"model.decoder.layers.25.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.25.router.per_expert_scale",
"model.decoder.layers.25.router.proj.weight",
"model.decoder.layers.25.router.scale",
"model.decoder.layers.25.self_attn.k_norm.weight",
"model.decoder.layers.25.self_attn.k_proj.linear.weight",
"model.decoder.layers.25.self_attn.k_proj.lora_a",
"model.decoder.layers.25.self_attn.k_proj.lora_b",
"model.decoder.layers.25.self_attn.o_proj.linear.weight",
"model.decoder.layers.25.self_attn.o_proj.lora_a",
"model.decoder.layers.25.self_attn.o_proj.lora_b",
"model.decoder.layers.25.self_attn.q_norm.weight",
"model.decoder.layers.25.self_attn.q_proj.linear.weight",
"model.decoder.layers.25.self_attn.q_proj.lora_a",
"model.decoder.layers.25.self_attn.q_proj.lora_b",
"model.decoder.layers.25.self_attn.v_proj.linear.weight",
"model.decoder.layers.25.self_attn.v_proj.lora_a",
"model.decoder.layers.25.self_attn.v_proj.lora_b",
"model.decoder.layers.26.experts.down_proj.linear.weight",
"model.decoder.layers.26.experts.down_proj.lora_a",
"model.decoder.layers.26.experts.down_proj.lora_b"
]
},
{
"file": "model-00022.safetensors",
"bytes": 1645281408,
"sha256": "70f3124fee705d9cb5221936c59f39820ab9c37a2c70bad89176e309e1c1ca07",
"tensors": [
"model.decoder.layers.26.experts.gate_up_proj.linear.weight",
"model.decoder.layers.26.experts.gate_up_proj.lora_a",
"model.decoder.layers.26.experts.gate_up_proj.lora_b",
"model.decoder.layers.26.input_layernorm.weight",
"model.decoder.layers.26.layer_scalar",
"model.decoder.layers.26.mlp.down_proj.linear.weight",
"model.decoder.layers.26.mlp.down_proj.lora_a",
"model.decoder.layers.26.mlp.down_proj.lora_b",
"model.decoder.layers.26.mlp.gate_proj.linear.weight",
"model.decoder.layers.26.mlp.gate_proj.lora_a",
"model.decoder.layers.26.mlp.gate_proj.lora_b",
"model.decoder.layers.26.mlp.up_proj.linear.weight",
"model.decoder.layers.26.mlp.up_proj.lora_a",
"model.decoder.layers.26.mlp.up_proj.lora_b",
"model.decoder.layers.26.post_attention_layernorm.weight",
"model.decoder.layers.26.post_feedforward_layernorm.weight",
"model.decoder.layers.26.post_feedforward_layernorm_1.weight",
"model.decoder.layers.26.post_feedforward_layernorm_2.weight",
"model.decoder.layers.26.pre_feedforward_layernorm.weight",
"model.decoder.layers.26.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.26.router.per_expert_scale",
"model.decoder.layers.26.router.proj.weight",
"model.decoder.layers.26.router.scale",
"model.decoder.layers.26.self_attn.k_norm.weight",
"model.decoder.layers.26.self_attn.k_proj.linear.weight",
"model.decoder.layers.26.self_attn.k_proj.lora_a",
"model.decoder.layers.26.self_attn.k_proj.lora_b",
"model.decoder.layers.26.self_attn.o_proj.linear.weight",
"model.decoder.layers.26.self_attn.o_proj.lora_a",
"model.decoder.layers.26.self_attn.o_proj.lora_b",
"model.decoder.layers.26.self_attn.q_norm.weight",
"model.decoder.layers.26.self_attn.q_proj.linear.weight",
"model.decoder.layers.26.self_attn.q_proj.lora_a",
"model.decoder.layers.26.self_attn.q_proj.lora_b",
"model.decoder.layers.26.self_attn.v_proj.linear.weight",
"model.decoder.layers.26.self_attn.v_proj.lora_a",
"model.decoder.layers.26.self_attn.v_proj.lora_b",
"model.decoder.layers.27.experts.down_proj.linear.weight",
"model.decoder.layers.27.experts.down_proj.lora_a",
"model.decoder.layers.27.experts.down_proj.lora_b"
]
},
{
"file": "model-00023.safetensors",
"bytes": 1645281368,
"sha256": "499f422a0073dce797799000ab7ea6df9e77f845aad9cff999ac9d404a47b8a0",
"tensors": [
"model.decoder.layers.27.experts.gate_up_proj.linear.weight",
"model.decoder.layers.27.experts.gate_up_proj.lora_a",
"model.decoder.layers.27.experts.gate_up_proj.lora_b",
"model.decoder.layers.27.input_layernorm.weight",
"model.decoder.layers.27.layer_scalar",
"model.decoder.layers.27.mlp.down_proj.linear.weight",
"model.decoder.layers.27.mlp.down_proj.lora_a",
"model.decoder.layers.27.mlp.down_proj.lora_b",
"model.decoder.layers.27.mlp.gate_proj.linear.weight",
"model.decoder.layers.27.mlp.gate_proj.lora_a",
"model.decoder.layers.27.mlp.gate_proj.lora_b",
"model.decoder.layers.27.mlp.up_proj.linear.weight",
"model.decoder.layers.27.mlp.up_proj.lora_a",
"model.decoder.layers.27.mlp.up_proj.lora_b",
"model.decoder.layers.27.post_attention_layernorm.weight",
"model.decoder.layers.27.post_feedforward_layernorm.weight",
"model.decoder.layers.27.post_feedforward_layernorm_1.weight",
"model.decoder.layers.27.post_feedforward_layernorm_2.weight",
"model.decoder.layers.27.pre_feedforward_layernorm.weight",
"model.decoder.layers.27.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.27.router.per_expert_scale",
"model.decoder.layers.27.router.proj.weight",
"model.decoder.layers.27.router.scale",
"model.decoder.layers.27.self_attn.k_norm.weight",
"model.decoder.layers.27.self_attn.k_proj.linear.weight",
"model.decoder.layers.27.self_attn.k_proj.lora_a",
"model.decoder.layers.27.self_attn.k_proj.lora_b",
"model.decoder.layers.27.self_attn.o_proj.linear.weight",
"model.decoder.layers.27.self_attn.o_proj.lora_a",
"model.decoder.layers.27.self_attn.o_proj.lora_b",
"model.decoder.layers.27.self_attn.q_norm.weight",
"model.decoder.layers.27.self_attn.q_proj.linear.weight",
"model.decoder.layers.27.self_attn.q_proj.lora_a",
"model.decoder.layers.27.self_attn.q_proj.lora_b",
"model.decoder.layers.27.self_attn.v_proj.linear.weight",
"model.decoder.layers.27.self_attn.v_proj.lora_a",
"model.decoder.layers.27.self_attn.v_proj.lora_b",
"model.decoder.layers.28.experts.down_proj.linear.weight",
"model.decoder.layers.28.experts.down_proj.lora_a",
"model.decoder.layers.28.experts.down_proj.lora_b"
]
},
{
"file": "model-00024.safetensors",
"bytes": 1645281350,
"sha256": "e7cd9ffad7914610f2cf54be55ac46a5d2082d5faee7f3d7d2854fa46315d46e",
"tensors": [
"model.decoder.layers.28.experts.gate_up_proj.linear.weight",
"model.decoder.layers.28.experts.gate_up_proj.lora_a",
"model.decoder.layers.28.experts.gate_up_proj.lora_b",
"model.decoder.layers.28.input_layernorm.weight",
"model.decoder.layers.28.layer_scalar",
"model.decoder.layers.28.mlp.down_proj.linear.weight",
"model.decoder.layers.28.mlp.down_proj.lora_a",
"model.decoder.layers.28.mlp.down_proj.lora_b",
"model.decoder.layers.28.mlp.gate_proj.linear.weight",
"model.decoder.layers.28.mlp.gate_proj.lora_a",
"model.decoder.layers.28.mlp.gate_proj.lora_b",
"model.decoder.layers.28.mlp.up_proj.linear.weight",
"model.decoder.layers.28.mlp.up_proj.lora_a",
"model.decoder.layers.28.mlp.up_proj.lora_b",
"model.decoder.layers.28.post_attention_layernorm.weight",
"model.decoder.layers.28.post_feedforward_layernorm.weight",
"model.decoder.layers.28.post_feedforward_layernorm_1.weight",
"model.decoder.layers.28.post_feedforward_layernorm_2.weight",
"model.decoder.layers.28.pre_feedforward_layernorm.weight",
"model.decoder.layers.28.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.28.router.per_expert_scale",
"model.decoder.layers.28.router.proj.weight",
"model.decoder.layers.28.router.scale",
"model.decoder.layers.28.self_attn.k_norm.weight",
"model.decoder.layers.28.self_attn.k_proj.linear.weight",
"model.decoder.layers.28.self_attn.k_proj.lora_a",
"model.decoder.layers.28.self_attn.k_proj.lora_b",
"model.decoder.layers.28.self_attn.o_proj.linear.weight",
"model.decoder.layers.28.self_attn.o_proj.lora_a",
"model.decoder.layers.28.self_attn.o_proj.lora_b",
"model.decoder.layers.28.self_attn.q_norm.weight",
"model.decoder.layers.28.self_attn.q_proj.linear.weight",
"model.decoder.layers.28.self_attn.q_proj.lora_a",
"model.decoder.layers.28.self_attn.q_proj.lora_b",
"model.decoder.layers.28.self_attn.v_proj.linear.weight",
"model.decoder.layers.28.self_attn.v_proj.lora_a",
"model.decoder.layers.28.self_attn.v_proj.lora_b",
"model.decoder.layers.29.experts.down_proj.linear.weight",
"model.decoder.layers.29.experts.down_proj.lora_a",
"model.decoder.layers.29.experts.down_proj.lora_b"
]
},
{
"file": "model-00025.safetensors",
"bytes": 1674191592,
"sha256": "234e835f2a3abdcd98cdbba245f057948573dd480301c94c00921f6d5c91bd96",
"tensors": [
"model.decoder.layers.29.experts.gate_up_proj.linear.weight",
"model.decoder.layers.29.experts.gate_up_proj.lora_a",
"model.decoder.layers.29.experts.gate_up_proj.lora_b",
"model.decoder.layers.29.input_layernorm.weight",
"model.decoder.layers.29.layer_scalar",
"model.decoder.layers.29.mlp.down_proj.linear.weight",
"model.decoder.layers.29.mlp.down_proj.lora_a",
"model.decoder.layers.29.mlp.down_proj.lora_b",
"model.decoder.layers.29.mlp.gate_proj.linear.weight",
"model.decoder.layers.29.mlp.gate_proj.lora_a",
"model.decoder.layers.29.mlp.gate_proj.lora_b",
"model.decoder.layers.29.mlp.up_proj.linear.weight",
"model.decoder.layers.29.mlp.up_proj.lora_a",
"model.decoder.layers.29.mlp.up_proj.lora_b",
"model.decoder.layers.29.post_attention_layernorm.weight",
"model.decoder.layers.29.post_feedforward_layernorm.weight",
"model.decoder.layers.29.post_feedforward_layernorm_1.weight",
"model.decoder.layers.29.post_feedforward_layernorm_2.weight",
"model.decoder.layers.29.pre_feedforward_layernorm.weight",
"model.decoder.layers.29.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.29.router.per_expert_scale",
"model.decoder.layers.29.router.proj.weight",
"model.decoder.layers.29.router.scale",
"model.decoder.layers.29.self_attn.k_norm.weight",
"model.decoder.layers.29.self_attn.k_proj.linear.weight",
"model.decoder.layers.29.self_attn.k_proj.lora_a",
"model.decoder.layers.29.self_attn.k_proj.lora_b",
"model.decoder.layers.29.self_attn.o_proj.linear.weight",
"model.decoder.layers.29.self_attn.o_proj.lora_a",
"model.decoder.layers.29.self_attn.o_proj.lora_b",
"model.decoder.layers.29.self_attn.q_norm.weight",
"model.decoder.layers.29.self_attn.q_proj.linear.weight",
"model.decoder.layers.29.self_attn.q_proj.lora_a",
"model.decoder.layers.29.self_attn.q_proj.lora_b",
"model.decoder.layers.3.experts.down_proj.linear.weight",
"model.decoder.layers.3.experts.down_proj.lora_a",
"model.decoder.layers.3.experts.down_proj.lora_b"
]
},
{
"file": "model-00026.safetensors",
"bytes": 1645281350,
"sha256": "57581d8a8c3efc5f19ac487469272cbf8d9fa68cb978c5d8f605701f3dca7fa2",
"tensors": [
"model.decoder.layers.3.experts.gate_up_proj.linear.weight",
"model.decoder.layers.3.experts.gate_up_proj.lora_a",
"model.decoder.layers.3.experts.gate_up_proj.lora_b",
"model.decoder.layers.3.input_layernorm.weight",
"model.decoder.layers.3.layer_scalar",
"model.decoder.layers.3.mlp.down_proj.linear.weight",
"model.decoder.layers.3.mlp.down_proj.lora_a",
"model.decoder.layers.3.mlp.down_proj.lora_b",
"model.decoder.layers.3.mlp.gate_proj.linear.weight",
"model.decoder.layers.3.mlp.gate_proj.lora_a",
"model.decoder.layers.3.mlp.gate_proj.lora_b",
"model.decoder.layers.3.mlp.up_proj.linear.weight",
"model.decoder.layers.3.mlp.up_proj.lora_a",
"model.decoder.layers.3.mlp.up_proj.lora_b",
"model.decoder.layers.3.post_attention_layernorm.weight",
"model.decoder.layers.3.post_feedforward_layernorm.weight",
"model.decoder.layers.3.post_feedforward_layernorm_1.weight",
"model.decoder.layers.3.post_feedforward_layernorm_2.weight",
"model.decoder.layers.3.pre_feedforward_layernorm.weight",
"model.decoder.layers.3.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.3.router.per_expert_scale",
"model.decoder.layers.3.router.proj.weight",
"model.decoder.layers.3.router.scale",
"model.decoder.layers.3.self_attn.k_norm.weight",
"model.decoder.layers.3.self_attn.k_proj.linear.weight",
"model.decoder.layers.3.self_attn.k_proj.lora_a",
"model.decoder.layers.3.self_attn.k_proj.lora_b",
"model.decoder.layers.3.self_attn.o_proj.linear.weight",
"model.decoder.layers.3.self_attn.o_proj.lora_a",
"model.decoder.layers.3.self_attn.o_proj.lora_b",
"model.decoder.layers.3.self_attn.q_norm.weight",
"model.decoder.layers.3.self_attn.q_proj.linear.weight",
"model.decoder.layers.3.self_attn.q_proj.lora_a",
"model.decoder.layers.3.self_attn.q_proj.lora_b",
"model.decoder.layers.3.self_attn.v_proj.linear.weight",
"model.decoder.layers.3.self_attn.v_proj.lora_a",
"model.decoder.layers.3.self_attn.v_proj.lora_b",
"model.decoder.layers.4.experts.down_proj.linear.weight",
"model.decoder.layers.4.experts.down_proj.lora_a",
"model.decoder.layers.4.experts.down_proj.lora_b"
]
},
{
"file": "model-00027.safetensors",
"bytes": 1645281304,
"sha256": "a2d814a172600dd0169ceac390fde8d8683926d72be9bc025c368c9c9bf5e5e9",
"tensors": [
"model.decoder.layers.4.experts.gate_up_proj.linear.weight",
"model.decoder.layers.4.experts.gate_up_proj.lora_a",
"model.decoder.layers.4.experts.gate_up_proj.lora_b",
"model.decoder.layers.4.input_layernorm.weight",
"model.decoder.layers.4.layer_scalar",
"model.decoder.layers.4.mlp.down_proj.linear.weight",
"model.decoder.layers.4.mlp.down_proj.lora_a",
"model.decoder.layers.4.mlp.down_proj.lora_b",
"model.decoder.layers.4.mlp.gate_proj.linear.weight",
"model.decoder.layers.4.mlp.gate_proj.lora_a",
"model.decoder.layers.4.mlp.gate_proj.lora_b",
"model.decoder.layers.4.mlp.up_proj.linear.weight",
"model.decoder.layers.4.mlp.up_proj.lora_a",
"model.decoder.layers.4.mlp.up_proj.lora_b",
"model.decoder.layers.4.post_attention_layernorm.weight",
"model.decoder.layers.4.post_feedforward_layernorm.weight",
"model.decoder.layers.4.post_feedforward_layernorm_1.weight",
"model.decoder.layers.4.post_feedforward_layernorm_2.weight",
"model.decoder.layers.4.pre_feedforward_layernorm.weight",
"model.decoder.layers.4.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.4.router.per_expert_scale",
"model.decoder.layers.4.router.proj.weight",
"model.decoder.layers.4.router.scale",
"model.decoder.layers.4.self_attn.k_norm.weight",
"model.decoder.layers.4.self_attn.k_proj.linear.weight",
"model.decoder.layers.4.self_attn.k_proj.lora_a",
"model.decoder.layers.4.self_attn.k_proj.lora_b",
"model.decoder.layers.4.self_attn.o_proj.linear.weight",
"model.decoder.layers.4.self_attn.o_proj.lora_a",
"model.decoder.layers.4.self_attn.o_proj.lora_b",
"model.decoder.layers.4.self_attn.q_norm.weight",
"model.decoder.layers.4.self_attn.q_proj.linear.weight",
"model.decoder.layers.4.self_attn.q_proj.lora_a",
"model.decoder.layers.4.self_attn.q_proj.lora_b",
"model.decoder.layers.4.self_attn.v_proj.linear.weight",
"model.decoder.layers.4.self_attn.v_proj.lora_a",
"model.decoder.layers.4.self_attn.v_proj.lora_b",
"model.decoder.layers.5.experts.down_proj.linear.weight",
"model.decoder.layers.5.experts.down_proj.lora_a",
"model.decoder.layers.5.experts.down_proj.lora_b"
]
},
{
"file": "model-00028.safetensors",
"bytes": 1674191574,
"sha256": "a7ee3b8626e6b76a82e0fbd78508a66151504ad02e5983f2895c735f3c41e704",
"tensors": [
"model.decoder.layers.5.experts.gate_up_proj.linear.weight",
"model.decoder.layers.5.experts.gate_up_proj.lora_a",
"model.decoder.layers.5.experts.gate_up_proj.lora_b",
"model.decoder.layers.5.input_layernorm.weight",
"model.decoder.layers.5.layer_scalar",
"model.decoder.layers.5.mlp.down_proj.linear.weight",
"model.decoder.layers.5.mlp.down_proj.lora_a",
"model.decoder.layers.5.mlp.down_proj.lora_b",
"model.decoder.layers.5.mlp.gate_proj.linear.weight",
"model.decoder.layers.5.mlp.gate_proj.lora_a",
"model.decoder.layers.5.mlp.gate_proj.lora_b",
"model.decoder.layers.5.mlp.up_proj.linear.weight",
"model.decoder.layers.5.mlp.up_proj.lora_a",
"model.decoder.layers.5.mlp.up_proj.lora_b",
"model.decoder.layers.5.post_attention_layernorm.weight",
"model.decoder.layers.5.post_feedforward_layernorm.weight",
"model.decoder.layers.5.post_feedforward_layernorm_1.weight",
"model.decoder.layers.5.post_feedforward_layernorm_2.weight",
"model.decoder.layers.5.pre_feedforward_layernorm.weight",
"model.decoder.layers.5.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.5.router.per_expert_scale",
"model.decoder.layers.5.router.proj.weight",
"model.decoder.layers.5.router.scale",
"model.decoder.layers.5.self_attn.k_norm.weight",
"model.decoder.layers.5.self_attn.k_proj.linear.weight",
"model.decoder.layers.5.self_attn.k_proj.lora_a",
"model.decoder.layers.5.self_attn.k_proj.lora_b",
"model.decoder.layers.5.self_attn.o_proj.linear.weight",
"model.decoder.layers.5.self_attn.o_proj.lora_a",
"model.decoder.layers.5.self_attn.o_proj.lora_b",
"model.decoder.layers.5.self_attn.q_norm.weight",
"model.decoder.layers.5.self_attn.q_proj.linear.weight",
"model.decoder.layers.5.self_attn.q_proj.lora_a",
"model.decoder.layers.5.self_attn.q_proj.lora_b",
"model.decoder.layers.6.experts.down_proj.linear.weight",
"model.decoder.layers.6.experts.down_proj.lora_a",
"model.decoder.layers.6.experts.down_proj.lora_b"
]
},
{
"file": "model-00029.safetensors",
"bytes": 1645281378,
"sha256": "51e757bfbf302e147a926faf4ad7ab2baa97355b5e8ffd688b06a62f74b95f6b",
"tensors": [
"model.decoder.layers.6.experts.gate_up_proj.linear.weight",
"model.decoder.layers.6.experts.gate_up_proj.lora_a",
"model.decoder.layers.6.experts.gate_up_proj.lora_b",
"model.decoder.layers.6.input_layernorm.weight",
"model.decoder.layers.6.layer_scalar",
"model.decoder.layers.6.mlp.down_proj.linear.weight",
"model.decoder.layers.6.mlp.down_proj.lora_a",
"model.decoder.layers.6.mlp.down_proj.lora_b",
"model.decoder.layers.6.mlp.gate_proj.linear.weight",
"model.decoder.layers.6.mlp.gate_proj.lora_a",
"model.decoder.layers.6.mlp.gate_proj.lora_b",
"model.decoder.layers.6.mlp.up_proj.linear.weight",
"model.decoder.layers.6.mlp.up_proj.lora_a",
"model.decoder.layers.6.mlp.up_proj.lora_b",
"model.decoder.layers.6.post_attention_layernorm.weight",
"model.decoder.layers.6.post_feedforward_layernorm.weight",
"model.decoder.layers.6.post_feedforward_layernorm_1.weight",
"model.decoder.layers.6.post_feedforward_layernorm_2.weight",
"model.decoder.layers.6.pre_feedforward_layernorm.weight",
"model.decoder.layers.6.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.6.router.per_expert_scale",
"model.decoder.layers.6.router.proj.weight",
"model.decoder.layers.6.router.scale",
"model.decoder.layers.6.self_attn.k_norm.weight",
"model.decoder.layers.6.self_attn.k_proj.linear.weight",
"model.decoder.layers.6.self_attn.k_proj.lora_a",
"model.decoder.layers.6.self_attn.k_proj.lora_b",
"model.decoder.layers.6.self_attn.o_proj.linear.weight",
"model.decoder.layers.6.self_attn.o_proj.lora_a",
"model.decoder.layers.6.self_attn.o_proj.lora_b",
"model.decoder.layers.6.self_attn.q_norm.weight",
"model.decoder.layers.6.self_attn.q_proj.linear.weight",
"model.decoder.layers.6.self_attn.q_proj.lora_a",
"model.decoder.layers.6.self_attn.q_proj.lora_b",
"model.decoder.layers.6.self_attn.v_proj.linear.weight",
"model.decoder.layers.6.self_attn.v_proj.lora_a",
"model.decoder.layers.6.self_attn.v_proj.lora_b",
"model.decoder.layers.7.experts.down_proj.linear.weight",
"model.decoder.layers.7.experts.down_proj.lora_a",
"model.decoder.layers.7.experts.down_proj.lora_b"
]
},
{
"file": "model-00030.safetensors",
"bytes": 1645281282,
"sha256": "2dcc2427d1c1bd6d143283f4d2cede73940db3c093b59b45c1c1b879b5406631",
"tensors": [
"model.decoder.layers.7.experts.gate_up_proj.linear.weight",
"model.decoder.layers.7.experts.gate_up_proj.lora_a",
"model.decoder.layers.7.experts.gate_up_proj.lora_b",
"model.decoder.layers.7.input_layernorm.weight",
"model.decoder.layers.7.layer_scalar",
"model.decoder.layers.7.mlp.down_proj.linear.weight",
"model.decoder.layers.7.mlp.down_proj.lora_a",
"model.decoder.layers.7.mlp.down_proj.lora_b",
"model.decoder.layers.7.mlp.gate_proj.linear.weight",
"model.decoder.layers.7.mlp.gate_proj.lora_a",
"model.decoder.layers.7.mlp.gate_proj.lora_b",
"model.decoder.layers.7.mlp.up_proj.linear.weight",
"model.decoder.layers.7.mlp.up_proj.lora_a",
"model.decoder.layers.7.mlp.up_proj.lora_b",
"model.decoder.layers.7.post_attention_layernorm.weight",
"model.decoder.layers.7.post_feedforward_layernorm.weight",
"model.decoder.layers.7.post_feedforward_layernorm_1.weight",
"model.decoder.layers.7.post_feedforward_layernorm_2.weight",
"model.decoder.layers.7.pre_feedforward_layernorm.weight",
"model.decoder.layers.7.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.7.router.per_expert_scale",
"model.decoder.layers.7.router.proj.weight",
"model.decoder.layers.7.router.scale",
"model.decoder.layers.7.self_attn.k_norm.weight",
"model.decoder.layers.7.self_attn.k_proj.linear.weight",
"model.decoder.layers.7.self_attn.k_proj.lora_a",
"model.decoder.layers.7.self_attn.k_proj.lora_b",
"model.decoder.layers.7.self_attn.o_proj.linear.weight",
"model.decoder.layers.7.self_attn.o_proj.lora_a",
"model.decoder.layers.7.self_attn.o_proj.lora_b",
"model.decoder.layers.7.self_attn.q_norm.weight",
"model.decoder.layers.7.self_attn.q_proj.linear.weight",
"model.decoder.layers.7.self_attn.q_proj.lora_a",
"model.decoder.layers.7.self_attn.q_proj.lora_b",
"model.decoder.layers.7.self_attn.v_proj.linear.weight",
"model.decoder.layers.7.self_attn.v_proj.lora_a",
"model.decoder.layers.7.self_attn.v_proj.lora_b",
"model.decoder.layers.8.experts.down_proj.linear.weight",
"model.decoder.layers.8.experts.down_proj.lora_a",
"model.decoder.layers.8.experts.down_proj.lora_b"
]
},
{
"file": "model-00031.safetensors",
"bytes": 1645281334,
"sha256": "df89b8419ce01b7d78f761aac8e324df22004cfeba4c9ae81c627dde94a73535",
"tensors": [
"model.decoder.layers.8.experts.gate_up_proj.linear.weight",
"model.decoder.layers.8.experts.gate_up_proj.lora_a",
"model.decoder.layers.8.experts.gate_up_proj.lora_b",
"model.decoder.layers.8.input_layernorm.weight",
"model.decoder.layers.8.layer_scalar",
"model.decoder.layers.8.mlp.down_proj.linear.weight",
"model.decoder.layers.8.mlp.down_proj.lora_a",
"model.decoder.layers.8.mlp.down_proj.lora_b",
"model.decoder.layers.8.mlp.gate_proj.linear.weight",
"model.decoder.layers.8.mlp.gate_proj.lora_a",
"model.decoder.layers.8.mlp.gate_proj.lora_b",
"model.decoder.layers.8.mlp.up_proj.linear.weight",
"model.decoder.layers.8.mlp.up_proj.lora_a",
"model.decoder.layers.8.mlp.up_proj.lora_b",
"model.decoder.layers.8.post_attention_layernorm.weight",
"model.decoder.layers.8.post_feedforward_layernorm.weight",
"model.decoder.layers.8.post_feedforward_layernorm_1.weight",
"model.decoder.layers.8.post_feedforward_layernorm_2.weight",
"model.decoder.layers.8.pre_feedforward_layernorm.weight",
"model.decoder.layers.8.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.8.router.per_expert_scale",
"model.decoder.layers.8.router.proj.weight",
"model.decoder.layers.8.router.scale",
"model.decoder.layers.8.self_attn.k_norm.weight",
"model.decoder.layers.8.self_attn.k_proj.linear.weight",
"model.decoder.layers.8.self_attn.k_proj.lora_a",
"model.decoder.layers.8.self_attn.k_proj.lora_b",
"model.decoder.layers.8.self_attn.o_proj.linear.weight",
"model.decoder.layers.8.self_attn.o_proj.lora_a",
"model.decoder.layers.8.self_attn.o_proj.lora_b",
"model.decoder.layers.8.self_attn.q_norm.weight",
"model.decoder.layers.8.self_attn.q_proj.linear.weight",
"model.decoder.layers.8.self_attn.q_proj.lora_a",
"model.decoder.layers.8.self_attn.q_proj.lora_b",
"model.decoder.layers.8.self_attn.v_proj.linear.weight",
"model.decoder.layers.8.self_attn.v_proj.lora_a",
"model.decoder.layers.8.self_attn.v_proj.lora_b",
"model.decoder.layers.9.experts.down_proj.linear.weight",
"model.decoder.layers.9.experts.down_proj.lora_a",
"model.decoder.layers.9.experts.down_proj.lora_b"
]
},
{
"file": "model-00032.safetensors",
"bytes": 1166260864,
"sha256": "c62b07e428849f2db92bf286a58d2657c685deb2128692ef0de49d5df071f226",
"tensors": [
"model.decoder.layers.9.experts.gate_up_proj.linear.weight",
"model.decoder.layers.9.experts.gate_up_proj.lora_a",
"model.decoder.layers.9.experts.gate_up_proj.lora_b",
"model.decoder.layers.9.input_layernorm.weight",
"model.decoder.layers.9.layer_scalar",
"model.decoder.layers.9.mlp.down_proj.linear.weight",
"model.decoder.layers.9.mlp.down_proj.lora_a",
"model.decoder.layers.9.mlp.down_proj.lora_b",
"model.decoder.layers.9.mlp.gate_proj.linear.weight",
"model.decoder.layers.9.mlp.gate_proj.lora_a",
"model.decoder.layers.9.mlp.gate_proj.lora_b",
"model.decoder.layers.9.mlp.up_proj.linear.weight",
"model.decoder.layers.9.mlp.up_proj.lora_a",
"model.decoder.layers.9.mlp.up_proj.lora_b",
"model.decoder.layers.9.post_attention_layernorm.weight",
"model.decoder.layers.9.post_feedforward_layernorm.weight",
"model.decoder.layers.9.post_feedforward_layernorm_1.weight",
"model.decoder.layers.9.post_feedforward_layernorm_2.weight",
"model.decoder.layers.9.pre_feedforward_layernorm.weight",
"model.decoder.layers.9.pre_feedforward_layernorm_2.weight",
"model.decoder.layers.9.router.per_expert_scale",
"model.decoder.layers.9.router.proj.weight",
"model.decoder.layers.9.router.scale",
"model.decoder.layers.9.self_attn.k_norm.weight",
"model.decoder.layers.9.self_attn.k_proj.linear.weight",
"model.decoder.layers.9.self_attn.k_proj.lora_a",
"model.decoder.layers.9.self_attn.k_proj.lora_b",
"model.decoder.layers.9.self_attn.o_proj.linear.weight",
"model.decoder.layers.9.self_attn.o_proj.lora_a",
"model.decoder.layers.9.self_attn.o_proj.lora_b",
"model.decoder.layers.9.self_attn.q_norm.weight",
"model.decoder.layers.9.self_attn.q_proj.linear.weight",
"model.decoder.layers.9.self_attn.q_proj.lora_a",
"model.decoder.layers.9.self_attn.q_proj.lora_b",
"model.decoder.layers.9.self_attn.v_proj.linear.weight",
"model.decoder.layers.9.self_attn.v_proj.lora_a",
"model.decoder.layers.9.self_attn.v_proj.lora_b",
"model.decoder.norm.weight",
"model.decoder.self_conditioning.down_proj.weight",
"model.decoder.self_conditioning.gate_proj.weight",
"model.decoder.self_conditioning.pre_norm.weight",
"model.decoder.self_conditioning.up_proj.weight",
"model.encoder.language_model.layers.0.layer_scalar",
"model.encoder.language_model.layers.1.layer_scalar",
"model.encoder.language_model.layers.10.layer_scalar",
"model.encoder.language_model.layers.11.layer_scalar",
"model.encoder.language_model.layers.12.layer_scalar",
"model.encoder.language_model.layers.13.layer_scalar",
"model.encoder.language_model.layers.14.layer_scalar",
"model.encoder.language_model.layers.15.layer_scalar",
"model.encoder.language_model.layers.16.layer_scalar",
"model.encoder.language_model.layers.17.layer_scalar",
"model.encoder.language_model.layers.18.layer_scalar",
"model.encoder.language_model.layers.19.layer_scalar",
"model.encoder.language_model.layers.2.layer_scalar",
"model.encoder.language_model.layers.20.layer_scalar",
"model.encoder.language_model.layers.21.layer_scalar",
"model.encoder.language_model.layers.22.layer_scalar",
"model.encoder.language_model.layers.23.layer_scalar",
"model.encoder.language_model.layers.24.layer_scalar",
"model.encoder.language_model.layers.25.layer_scalar",
"model.encoder.language_model.layers.26.layer_scalar",
"model.encoder.language_model.layers.27.layer_scalar",
"model.encoder.language_model.layers.28.layer_scalar",
"model.encoder.language_model.layers.29.layer_scalar",
"model.encoder.language_model.layers.3.layer_scalar",
"model.encoder.language_model.layers.4.layer_scalar",
"model.encoder.language_model.layers.5.layer_scalar",
"model.encoder.language_model.layers.6.layer_scalar",
"model.encoder.language_model.layers.7.layer_scalar",
"model.encoder.language_model.layers.8.layer_scalar",
"model.encoder.language_model.layers.9.layer_scalar"
]
}
],
"dependencies": {
"mlx": "0.32.2",
"mlx-lm": "0.31.3",
"mlx-vlm": "0.7.2",
"transformers": "5.14.1",
"huggingface-hub": "1.20.1",
"safetensors": "0.8.0",
"numpy": "2.5.0"
}
}