Model Bench Leaderboard Evaluating Models Running 4.96k Arena Leaderboard 🏆 4.96k View the LMArena leaderboard in full‑screen Running on CPU Upgrade 7.6k MTEB Leaderboard 📊 7.6k Embedding Leaderboard Running Agents 433 Reward Bench Leaderboard 📐 433 Explore and compare model scores on RewardBench benchmarks
Running Agents 433 Reward Bench Leaderboard 📐 433 Explore and compare model scores on RewardBench benchmarks
Reasoning Datasets Datasets with reasoning traces across various domains released by the community. bespokelabs/Bespoke-Stratos-35k Viewer • Updated Jan 22, 2025 • 35k • 92 • 6 open-thoughts/OpenThoughts-114k Viewer • Updated Aug 31, 2025 • 228k • 83.3k • 892 open-r1/OpenThoughts-114k-math Viewer • Updated Jan 30, 2025 • 89.1k • 1.26k • 97 PrimeIntellect/NuminaMath-QwQ-CoT-5M Viewer • Updated Jan 22, 2025 • 5.14M • 1.32k • 63
Model Bench Leaderboard Evaluating Models Running 4.96k Arena Leaderboard 🏆 4.96k View the LMArena leaderboard in full‑screen Running on CPU Upgrade 7.6k MTEB Leaderboard 📊 7.6k Embedding Leaderboard Running Agents 433 Reward Bench Leaderboard 📐 433 Explore and compare model scores on RewardBench benchmarks
Running Agents 433 Reward Bench Leaderboard 📐 433 Explore and compare model scores on RewardBench benchmarks
Reasoning Datasets Datasets with reasoning traces across various domains released by the community. bespokelabs/Bespoke-Stratos-35k Viewer • Updated Jan 22, 2025 • 35k • 92 • 6 open-thoughts/OpenThoughts-114k Viewer • Updated Aug 31, 2025 • 228k • 83.3k • 892 open-r1/OpenThoughts-114k-math Viewer • Updated Jan 30, 2025 • 89.1k • 1.26k • 97 PrimeIntellect/NuminaMath-QwQ-CoT-5M Viewer • Updated Jan 22, 2025 • 5.14M • 1.32k • 63