Sharpen Without Search: On-Policy Distillation of Sequence-Level Power Distribution Paper • 2610.06804 • Published 2 days ago • 4
Labels Override Definitions in Jev-Style Typed Decision Models Paper • 2610.02586 • Published 6 days ago • 5
VISTA: Vision-Language Inference for Training-Free Stock Time-Series Analysis Paper • 2505.18570 • Published May 24, 2025
Activation Steering for Chain-of-Thought Compression Paper • 2507.04742 • Published Jul 7, 2025 • 1 • 1
GEAR: An Efficient KV Cache Compression Recipefor Near-Lossless Generative Inference of LLM Paper • 2403.05527 • Published Mar 8, 2024 • 2
Hymba: A Hybrid-head Architecture for Small Language Models Paper • 2411.13676 • Published Nov 20, 2024 • 50
LaMDA: Large Model Fine-Tuning via Spectrally Decomposed Low-Dimensional Adaptation Paper • 2406.12832 • Published Jun 18, 2024