Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges Paper • 2607.19011 • Published 7 days ago • 2
Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers Paper • 2607.19139 • Published 7 days ago • 73
EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World Paper • 2607.17250 • Published 9 days ago • 89
See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models Paper • 2607.11498 • Published 15 days ago • 7
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning Paper • 2607.12395 • Published 14 days ago • 99
Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget Paper • 2607.13125 • Published 10 days ago • 137
Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation Paper • 2607.11886 • Published 15 days ago • 84