ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code Paper • 2506.02314 • Published Jun 2, 2025
Rethinking Model Evaluation as Narrowing the Socio-Technical Gap Paper • 2306.03100 • Published Jun 1, 2023
Faux Polyglot: A Study on Information Disparity in Multilingual Large Language Models Paper • 2407.05502 • Published Jul 7, 2024
Improving Context-Aware Preference Modeling for Language Models Paper • 2407.14916 • Published Jul 20, 2024 • 4
Crossing Linguistic Horizons: Finetuning and Comprehensive Evaluation of Vietnamese Large Language Models Paper • 2403.02715 • Published Mar 5, 2024 • 3
Generative Echo Chamber? Effects of LLM-Powered Search Systems on Diverse Information Seeking Paper • 2402.05880 • Published Feb 8, 2024 • 3
Deep Language Networks: Joint Prompt Training of Stacked LLMs using Variational Inference Paper • 2306.12509 • Published Jun 21, 2023 • 15
DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models Paper • 2306.11698 • Published Jun 20, 2023 • 13