Our research focuses on Vision-Language and Embodied AI.
OmniEcho: Spatial Audio Understanding for Embodied Agents
M$^3$Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks