{ "quant_method": "littlebit", "bits_per_weight": 0.8, "distribution": "asymmetric_65_35", "asymmetric_distribution": [ 0.65, 0.35 ], "latent_factorization": "dual_svid", "multi_scale_compensation": true, "packed_bitstream": true, "modalities": [ "text" ], "memory_reduction_pct": 81.7, "target_ram_mb": 274.5, "base_model": "google/embeddinggemma-2", "base_dimensions": 768, "streaming_avx2_supported": true, "zero_ram_inflation": true, "research_organization": "Samsung Research", "paper_title": "LittleBit: Ultra Low-Bit Quantization via Latent Factorization", "paper_arxiv_id": "2506.13771", "paper_url": "https://arxiv.org/abs/2506.13771", "paper_html_url": "https://arxiv.org/html/2506.13771v5" }