BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation Paper • 2506.00482 • Published May 31, 2025 • 8
CLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in Korean Paper • 2403.06412 • Published Mar 11, 2024 • 3
CSRT: Evaluation and Analysis of LLMs using Code-Switching Red-Teaming Dataset Paper • 2406.15481 • Published Jun 17, 2024 • 1