stabilityai/stable-diffusion-3.5-large-turbo Text-to-Image • 8B • Updated Oct 22, 2024 • 8.23k • • 692
When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research Paper • 2505.11855 • Published May 17, 2025 • 10
ArxivBench: Can LLMs Assist Researchers in Conducting Research? Paper • 2504.10496 • Published Apr 6, 2025 • 2