From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement Paper • 2607.23802 • Published 9 days ago • 82
QQWorld: Quantile-Quantile Matching for World Model Regularization Paper • 2607.28415 • Published 5 days ago • 27
SULAND v2: A Refined RGB Dataset and Deep Learning Object Detection Benchmark for UAV/UGV-Based SUrface LANDmine Detection Under Domain Shift Paper • 2607.28996 • Published 4 days ago • 3
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents Paper • 2607.28227 • Published 5 days ago • 296
Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing Paper • 2607.19064 • Published 14 days ago • 76
UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models Paper • 2607.23373 • Published 10 days ago • 6
Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model Paper • 2607.24904 • Published 8 days ago • 32
Progress Reward Modeling for Robotic Learning: A Comprehensive Survey Paper • 2607.21655 • Published 13 days ago • 192
Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning Paper • 2607.21653 • Published 13 days ago • 32
SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments Paper • 2607.20207 • Published 13 days ago • 4
ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion Paper • 2607.20417 • Published 13 days ago • 9
DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines Paper • 2607.16617 • Published 17 days ago • 140
AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report Paper • 2607.18367 • Published 15 days ago • 59
ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU Paper • 2607.19191 • Published 14 days ago • 308
FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications Paper • 2607.18171 • Published 15 days ago • 6
See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models Paper • 2607.11498 • Published 22 days ago • 7
RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources Paper • 2606.29538 • Published 19 days ago • 142
Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos Paper • 2607.16107 • Published 18 days ago • 11
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories Paper • 2607.15330 • Published 19 days ago • 71