Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL Paper • 2609.20715 • Published 8 days ago • 42
Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking Paper • 2609.10745 • Published 16 days ago • 22
MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes Paper • 2609.10016 • Published 16 days ago • 29
Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training Paper • 2608.26730 • Published 29 days ago • 155
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? Paper • 2608.19799 • Published Aug 20 • 67
JonathanColetti/Qwen3.8-27B-Uncensored-GGUF Text Generation • 27B • Updated 27 days ago • 2.33M • 1.25k
Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination Paper • 2608.14391 • Published Aug 14 • 285
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published Aug 1 • 265