Puppeteer: Object-Grounded Posture-Aware Co-Speech Gesture Generation Paper • 2609.00369 • Published Aug 31 • 22
SynthGait-19K: A Physically Grounded Synthetic Video Dataset for Gait Parameter Estimation Paper • 2609.08108 • Published 26 days ago • 18
ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion Paper • 2607.20417 • Published Jul 22 • 10
Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling Paper • 2607.01642 • Published Jul 2 • 38
PhotoQuilt: Training-Free Arbitrary-Resolution Photomosaics via Bootstrapped Tiled Denoising Paper • 2606.30968 • Published Jun 29 • 26
SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers Paper • 2605.22668 • Published May 21 • 43
HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds Paper • 2604.14268 • Published Apr 15 • 128
DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation Paper • 2602.23165 • Published Feb 26 • 3
MIBURI: Towards Expressive Interactive Gesture Synthesis Paper • 2603.03282 • Published Mar 3 • 5
OmniLottie: Generating Vector Animations via Parameterized Lottie Tokens Paper • 2603.02138 • Published Mar 2 • 151
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains Paper • 2603.01301 • Published Mar 1 • 8
LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation Paper • 2602.11451 • Published Feb 11 • 18
LTX-2: Efficient Joint Audio-Visual Foundation Model Paper • 2601.03233 • Published Jan 6 • 197
EasyV2V: A High-quality Instruction-based Video Editing Framework Paper • 2512.16920 • Published Dec 18, 2025 • 18
PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs Paper • 2512.14944 • Published Mar 13 • 36
CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives Paper • 2512.14696 • Published Dec 16, 2025 • 8