OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language World Models Paper โข 2604.10866 โข Published Apr 13 โข 69