Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models Paper • 2606.18142 • Published Jun 17 • 2
Do LLMs Hold Their Values? MANTA: A Multi-Turn Adversarial Benchmark for Animal Welfare Reasoning Paper • 2605.16301 • Published Jun 3 • 1
Subliminal Clocks: Latent Time Modelling in Diffusion Language Models Paper • 2607.01774 • Published 7 days ago • 38
ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning Paper • 2607.17599 • Published 7 days ago • 2
Trajectory-aware Cross-view Geo-localization with Sequential Observations Paper • 2607.15491 • Published 11 days ago • 6
Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts Training Paper • 2607.19058 • Published 6 days ago • 6
Delineate Anything v2: A Global Foundation Model for Field Delineation Paper • 2607.19069 • Published 6 days ago • 5
Appearance Pointers -- Multimodal Region Control of Diffusion Transformers Paper • 2607.19344 • Published 6 days ago • 4
EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration Paper • 2607.18529 • Published 7 days ago • 4
Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness Paper • 2607.19322 • Published 6 days ago • 8