Runtime error Agents 20 Rabbits Leaderboard 💊 20 Visualize and analyze language model robustness to drug name synonyms
Running on CPU Upgrade 14.1k Open LLM Leaderboard 🏆 14.1k Track, rank and evaluate open LLMs and chatbots
Running on CPU Upgrade Agents 258 MMLU-Pro Leaderboard 🥇 258 More advanced and challenging multi-task evaluation