{ "schema_version": "nanojev-mlx-quant-v1", "source_checkpoint": "NanoJev", "source_weights_sha256": "fff62d1412685c1714eaa386acb603f9690371fb3cc8ad03dc41319302597c28", "bits": 4, "group_size": 64, "include_embed": true, "scales_dtype": "float16", "note": "backbone linears + embed_tokens in MLX affine 4-bit (group 64); head and norms kept in fp16", "quantized_params_by_bucket": { "mlp": 264241152, "self_attn": 176160768, "embed_tokens": 155582464 }, "relative_max_error_by_bucket": { "embed_tokens": { "max": 0.06698610633611679, "mean": 0.06698610633611679 }, "mlp": { "max": 0.12449125945568085, "mean": 0.06786140923698743 }, "self_attn": { "max": 0.11749649047851562, "mean": 0.07736335305630096 } }, "packed_weights_bytes": 335857708, "packed_weights_sha256": "332d47eb23c81b0370f580e87e0e55ef737ba1baa206a8d300eadf9617307b62", "dequant_fp32_bytes": 2384507132, "dequant_fp32_sha256": "2e5bf94be4fa2264e95e4ee3ba763d6240a41faaff6f6cd643f9e1eea29fe291", "seconds": 87.46 }