Submitted by Zhicheng Sun 13 Learning from Next-Frame Prediction: Autoregressive Video Modeling Encodes Effective Representations Peking University 22 2
Submitted by Bohan Zeng 225 DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI Peking University 8.21k 6
Submitted by Bohan Zeng 41 Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling Peking University 32 1
Submitted by Yuyang Li 2 Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation Peking University 37 2
Submitted by Bohan Zeng 8 VABench: A Comprehensive Benchmark for Audio-Video Generation Peking University 21 2
Submitted by YuchuanTian 26 From Next-Token to Next-Block: A Principled Adaptation Path for Diffusion LLMs Peking University 3
Submitted by Zeyu Zhang 6 EgoLCD: Egocentric Video Generation with Long Context Diffusion Peking University 9 2
Submitted by Jianzong Wu 14 Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation Peking University 19 2
Submitted by Weiyang Jin 33 Does Understanding Inform Generation in Unified Multimodal Models? From Analysis to Path Forward Peking University 60 2
Submitted by ZehongMa 66 DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation Peking University 247 3
Submitted by HuangTing 5 MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots Peking University 117 2