Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning
面向多跳音视频推理的主动全模态感知代理
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 针对多跳音视频推理中证据稀疏且跨模态分布的问题,提出MOV-Bench基准和AOP-Agent代理框架,通过分层全模态记忆与观察-反思-重规划循环实现主动感知,显著提升开源全模态大模型在长视频和推理密集型问题上的性能。