Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction Paper • 2607.20911 • Published 7 days ago • 25
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget Paper • 2607.14952 • Published 14 days ago • 203
fpadovani/ita-latn-100mb-after-ppt-shuff-dyck-100mb-ckpt500_seed10 Text Generation • 0.1B • Updated 22 days ago • 1.37k • 1
RedVox: Safety and Fairness Gaps in Speech Models Across Languages Paper • 2606.26968 • Published Jun 25 • 16
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation Paper • 2605.23271 • Published May 22 • 82