embeddinggemma-2-0.8bpw-text / quantization_config.json
LT99's picture
Initial release: EmbeddingGemma-2 0.8 BPW Text (LittleBit Quantized)
eeb3430 verified
Raw History Blame Contribute Delete
757 Bytes
{
"quant_method": "littlebit",
"bits_per_weight": 0.8,
"distribution": "asymmetric_65_35",
"asymmetric_distribution": [
0.65,
0.35
],
"latent_factorization": "dual_svid",
"multi_scale_compensation": true,
"packed_bitstream": true,
"modalities": [
"text"
],
"memory_reduction_pct": 81.7,
"target_ram_mb": 274.5,
"base_model": "google/embeddinggemma-2",
"base_dimensions": 768,
"streaming_avx2_supported": true,
"zero_ram_inflation": true,
"research_organization": "Samsung Research",
"paper_title": "LittleBit: Ultra Low-Bit Quantization via Latent Factorization",
"paper_arxiv_id": "2506.13771",
"paper_url": "https://arxiv.org/abs/2506.13771",
"paper_html_url": "https://arxiv.org/html/2506.13771v5"
}