view article Article Is it agentic enough? Benchmarking open models on your own tooling +1 lysandre, SaylorTwift, pcuenq β’ Jun 18 β’ 21
view article Article ScarfBench: Benchmarking AI Agents for Enterprise Java Framework Migration ibm-research β’ 29 days ago β’ 26
view article Article Welcome Inkling by Thinking Machines +2 burtenshaw, merve, pcuenq, ariG23498 β’ 14 days ago β’ 136
view article Article Run and Compare AI Evaluations with a CLI for Developers and Coding Agents phranzia β’ 1 day ago β’ 2
view article Article Run and Compare AI Evaluations with a CLI for Developers and Coding Agents phranzia β’ 1 day ago β’ 2