ServImage: An Image Generation and Editing Benchmark from Real-world Commercial Imaging Services Paper • 2604.24023 • Published Apr 27 • 1
The Cylindrical Representation Hypothesis for Language Model Steering Paper • 2605.01844 • Published May 3 • 3
M3MAD-Bench: Are Multi-Agent Debates Really Effective Across Domains and Modalities? Paper • 2601.02854 • Published Jan 6 • 1
FinCUABuild: Can Agents Build Reliable Benchmarks for Dynamic Financial Computer Use? Paper • 2609.07603 • Published 23 days ago • 1
ServImage: An Image Generation and Editing Benchmark from Real-world Commercial Imaging Services Paper • 2604.24023 • Published Apr 27 • 1