OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding Paper ⢠2607.27155 ⢠Published 2 days ago ⢠7
Can AI agents conduct open-ended AI research? Early evidence from two case studies Paper ⢠2607.27191 ⢠Published 2 days ago ⢠12
GPT-Red: Automated Red Teaming via Self-Play at Scale Paper ⢠2607.26115 ⢠Published 3 days ago ⢠4
PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models Paper ⢠2607.24957 ⢠Published 4 days ago ⢠13
OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs Paper ⢠2607.25669 ⢠Published 3 days ago ⢠8
view post Post 87 The capture stack for collecting high-fidelity egocentric RGB-D data on commodity mobile devices is now open-source.https://x.com/fpv_labs/status/2082098617704436058 See translation Reply
view post Post 3724 who's working on an NVFP4 version of Kimi-K3? See translation 4 replies Ā· š¤ 8 8 š 6 6 š 4 4 š„ 4 4 š 1 1 + Reply
GNM Head: A Generative aNthropometric Model of the human head Paper ⢠2607.23687 ⢠Published 5 days ago ⢠5
FilmBench: A Film-Grade Benchmark for Cinematic Video Generation Paper ⢠2607.24241 ⢠Published 4 days ago ⢠6
Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning Paper ⢠2607.21653 ⢠Published 9 days ago ⢠30
Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering Paper ⢠2607.21848 ⢠Published 8 days ago ⢠8
Scaling Native Multimodal Pre-Training From Scratch Paper ⢠2607.22043 ⢠Published 7 days ago ⢠28
SceneActBench: Can Agents Act on the 3D Scenes They See? Paper ⢠2607.22393 ⢠Published 7 days ago ⢠7
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills Paper ⢠2607.22529 ⢠Published 7 days ago ⢠45
Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction Paper ⢠2607.20911 ⢠Published 8 days ago ⢠26