view article Article autotrust/JEV-27B-VL: a decision model that learned to see without a single image of training autotrust • 7 days ago • 165
VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models Paper • 2609.32607 • Published 12 days ago • 154
In-Context Learning for Robots: Methods and Applications Paper • 2609.36012 • Published 10 days ago • 389
Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering Paper • 2608.21450 • Published Aug 19 • 25