Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable Paper • 2607.13285 • Published 24 days ago • 232
SWE-Pruner Pro: The Coder LLM Already Knows What to Prune Paper • 2607.18213 • Published 18 days ago • 79
Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models Paper • 2607.08317 • Published 29 days ago • 35
ScarfBench: A Benchmark for Cross-Framework Application Migration in Enterprise Java Paper • 2605.06754 • Published May 18 • 1
HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment Paper • 2607.00572 • Published Jul 1 • 3
FastContext: Training Efficient Repository Explorer for Coding Agents Paper • 2606.14066 • Published Jun 12 • 94
SWE-Explore: Benchmarking How Coding Agents Explore Repositories Paper • 2606.07297 • Published Jun 5 • 123
GrepSeek: Training Search Agents for Direct Corpus Interaction Paper • 2605.29307 • Published May 28 • 117
Code2LoRA: Hypernetwork-Generated Adapters for Code Language Models under Software Evolution Paper • 2606.06492 • Published Jun 4 • 96
A Local Perturbation Theory for Cross-Domain Interference and Recovery in Multi-Domain RL Paper • 2606.02398 • Published Jun 1 • 28
Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction Paper • 2605.05242 • Published May 3 • 127