OSWorld-Science: A Benchmark of Computer Use Agents for Learning and Using Scientific Software Paper • 2609.39903 • Published 5 days ago • 52
Diffusion-based Cumulative Adversarial Purification for Vision Language Models Paper • 2506.03933 • Published Jun 10
Multi-Step Alignment as Markov Games: An Optimistic Online Gradient Descent Approach with Convergence Guarantees Paper • 2502.12678 • Published May 24, 2025
Membership Inference Attacks against Large Vision-Language Models Paper • 2411.02902 • Published Nov 5, 2024
Sanity-Checking Pruning Methods: Random Tickets can Win the Jackpot Paper • 2009.11094 • Published Oct 22, 2020
High-Dimensional Kernel Methods under Covariate Shift: Data-Dependent Implicit Regularization Paper • 2406.03171 • Published Jun 5, 2024
ReCAST: Reward Credit Assignment across Timesteps for Online Diffusion Reinforcement Paper • 2609.13425 • Published 24 days ago • 9
A Unifying Lens on Supervised Fine-Tuning Through Target Distribution Design Paper • 2606.11189 • Published Jun 9 • 2
Generalization of Scaled Deep ResNets in the Mean-Field Regime Paper • 2403.09889 • Published Mar 14, 2024
QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents Paper • 2606.32034 • Published Jun 30 • 10
DataComp-VLM: Improved Open Datasets for Vision-Language Models Paper • 2606.28551 • Published Jun 26 • 52
VGGSounder: Audio-Visual Evaluations for Foundation Models Paper • 2508.08237 • Published Oct 18, 2025 • 1
FutureSim: Replaying World Events to Evaluate Adaptive Agents Paper • 2605.15188 • Published May 14 • 7
Round-Trip Translation Reveals What Frontier Multilingual Benchmarks Miss Paper • 2604.12911 • Published Apr 14
LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning Paper • 2604.14140 • Published Apr 15 • 1