HyQuant: Hybrid-Precision Quantization for LLM Attention Paper • 2608.27875 • Published 27 days ago • 29
BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference Paper • 2609.04971 • Published 20 days ago • 42