Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift Paper • 2607.17524 • Published 12 days ago • 6
Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift Paper • 2607.17524 • Published 12 days ago • 6
Value-Aware Stochastic KV Cache Eviction for Reasoning Models Paper • 2606.03928 • Published Jun 2 • 8
Value-Aware Stochastic KV Cache Eviction for Reasoning Models Paper • 2606.03928 • Published Jun 2 • 8
Convergent Evolution: How Different Language Models Learn Similar Number Representations Paper • 2604.20817 • Published Apr 22 • 8
Convergent Evolution: How Different Language Models Learn Similar Number Representations Paper • 2604.20817 • Published Apr 22 • 8
EvoClaw: Evaluating AI Agents on Continuous Software Evolution Paper • 2603.13428 • Published Mar 13 • 22
LatentChem: From Textual CoT to Latent Thinking in Chemical Reasoning Paper • 2602.07075 • Published Feb 6 • 19
When Do Transformers Learn Heuristics for Graph Connectivity? Paper • 2510.19753 • Published Oct 22, 2025 • 4
Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning Paper • 2507.16746 • Published Jul 22, 2025 • 36
Agent KB: Leveraging Cross-Domain Experience for Agentic Problem Solving Paper • 2507.06229 • Published Jul 8, 2025 • 78
Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models Paper • 2505.14071 • Published May 20, 2025 • 1
MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents Paper • 2503.01935 • Published Mar 3, 2025 • 30
FoNE: Precise Single-Token Number Embeddings via Fourier Features Paper • 2502.09741 • Published Feb 13, 2025 • 15
MMVU: Measuring Expert-Level Multi-Discipline Video Understanding Paper • 2501.12380 • Published Jan 21, 2025 • 82
TLDR: Token-Level Detective Reward Model for Large Vision Language Models Paper • 2410.04734 • Published Oct 7, 2024 • 19