TakalaWang/Discussion-Phi-4-multimodal-instruct-audio-dimp-reasoning Text Generation • 6B • Updated May 15, 2025 • 146 • 4
gabrielamarques/paper_015384925_visual_question_answering Visual Question Answering • Updated Aug 21 • 3
TRACE: Temporal Audit and Condition-aware Evaluation of Streaming Video Understanding Paper • 2609.30670 • Published 8 days ago • 11
Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models Paper • 2609.26637 • Published 11 days ago • 24
RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling Paper • 2609.22947 • Published 14 days ago • 41
SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue Paper • 2609.26780 • Published 11 days ago • 102
yjyjyj98/thinkmorph-interleaved_reasoning-multimodal_reward-beta0.04_attnFixed-SFT_NEW-yes_bbox_ckpt200 11B • Updated Apr 5 • 10 • 2
Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms Paper • 2609.27321 • Published 10 days ago • 22
era-temporary/eb_alfred_sft_single_step_reasoning_dataset_success_episodes_multimodal-lr1e-5-full-e1-bs-16 4B • Updated Jun 30, 2025 • 21 • 4
Tri-PvP: Exposing Modality Bias in Omni-Modal Large Language Models through Perceptual-Propositional Evidence Conflicts Paper • 2609.06011 • Published 28 days ago • 18
open-source-metrics/visual-question-answering-checkpoint-downloads Viewer • Updated Oct 6, 2022 • 302 • 94 • 6