Rationale-Guided Learning for Multimodal Emotion Recognition
基于理由引导学习的多模态情感识别
专题命中 视觉推理 :MLLM(summary_cn,abstract);分类 cs.AI
AI总结 针对多模态情感识别忽略人类因果推理的问题,提出理由引导学习框架,结合双加工理论与MLLM生成的理由训练模型,在IEMOCAP和MELD基准取得最优性能,且推理无额外开销。
Comments ICASSP 2026
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
基于理由引导学习的多模态情感识别
专题命中 视觉推理 :MLLM(summary_cn,abstract);分类 cs.AI
AI总结 针对多模态情感识别忽略人类因果推理的问题,提出理由引导学习框架,结合双加工理论与MLLM生成的理由训练模型,在IEMOCAP和MELD基准取得最优性能,且推理无额外开销。
Comments ICASSP 2026
空间记忆智能体:用于空间智能的基于经验的过程记忆
机构 * Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究提出SMA框架,让冻结VLM智能体无需外部空间工具,通过无参数更新自进化提升空间推理,在多基准和模型上表现最优,提供了空间自进化的实用路径。
Comments Under Review
MMArch:基于建筑证据的多模态推理基准测试
专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型(MLLM)在工程多模态推理基准上的表现,构建MMArch基准,发现现有MLLM与人类专家存在差距,为相关研究提供评估基准。
EffectLearner:面向真实世界视频物体移除的世界感知物体-效应推理
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV
AI总结 该研究提出EffectLearner框架,结合VLM物体-效应推理器与DiT视频擦除器,构建专属数据集EffectWorld并采用渐进式训练,在视频物体移除任务上实现更优性能。
Comments Project: https://morleyolsen.github.io/EffectLearner/
超越单摄像头:体育视频理解中的智能多视角推理
机构 * Zhejiang University(浙江大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 针对体育视频多视角理解缺乏评估基准及MLLMs难以利用多视角信息的问题,引入SportMV - Bench基准,分析瓶颈所在,并提出SportMV - Agent框架,通过迭代循环实现主动视角选择等,相比最强MLLM基线有显著提升。
MoRAL:面向边缘自动驾驶的紧凑型视觉语言模型的传感器接地鸟瞰图推理
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 MoRAL是一种两阶段微调流水线,指导Cosmos-Reason2-2B基于物理编码的BEV表示进行驾驶决策,在参数仅为零样本基准四分之一的情况下,在8类驾驶问题中7类胜出,紧急制动召回率提升至47.8%,可在消费级8GB GPU高效运行。
Comments 7 pages, 5 figures, 6 tables. Accepted to the 14th IEEE International Conference on Intelligent Mobile Computing (IEEE IMC 2026), Fukuoka, Japan, July 27-30, 2026
基于多模态记忆压缩的长视野具身决策
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Northwestern University(西北大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV
AI总结 该研究提出DunphyBench基准用于评估长视野具身决策,发现当前智能体与人类表现存在差距,设计了MeMento记忆压缩器,使VLM驱动智能体准确率提升7.18%且内存使用降低85.38%。
PanDent:面向牙科放射学中全面的牙级结构-语言一致性
机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) ; Imperial College London(帝国理工学院) ; University of Science and Technology of China(中国科学技术大学) ; Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) ; Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)
专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。
面向决策关键型应用的多模态大语言模型中可解释且资源高效的空间推理
机构 * Heritage Institute of Technology(遗产技术学院) ; Kalyani Government Engineering College(卡利亚尼政府工程学院) ; IAIRO ; Intel Corporation(英特尔公司)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 针对多模态大语言模型空间判断不透明及细粒度空间理解不足的问题,提出无需训练的ByDeWay-V2框架,结合YOLO-World-L注入空间谓词,在多个基准上显著提升空间推理性能,适配资源受限场景。
Comments 14 pages
S-Agent:空间工具使用激发空间智能推理
机构 * NTU(南洋理工大学) ; THU(清华大学) ; ByteDance(字节跳动) ; NWPU(西北工业大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV
AI总结 提出S-Agent空间工具使用智能体范式,通过时空证据积累和层次化工具集,将VLM作为语义规划器,实现连续多视图图像和视频的空间推理,在无训练下提升开源和闭源VLM性能,并基于S-300K轨迹微调得到紧凑空间智能体S-Agent-8B。
Comments Project Page : https://Ropedia.github.io/S-Agent
用慢速基础模型训练快速机器人策略
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);grounding(abstract)
AI总结 本文提出VGRS方法,通过利用慢速基础模型训练快速机器人策略,结合LLM生成奖励与视觉分析诊断,提升机器人在复杂任务中的表现和部署效率。
DeforM:通过时空掩码实现推理引导的物理感知视频生成
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV
AI总结 研究针对视频生成模型难以生成物理感知视频的问题,提出DeforM框架,引入VLM引导的物理推理模块及两种策略,经实验验证该框架能提高生成变形场景的真实感,优于基线模型。
LaViDa:用于多模态理解的大型扩散语言模型
机构 * UCLA(加州大学洛杉矶分校) ; Panasonic AI Research(松下人工智能研究) ; Adobe Research(Adobe研究) ; Salesforce Research(Salesforce研究)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);LLaVA(abstract);visual reasoning(abstract)
AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。
Comments 26 pages, 8 figures
超越标量奖励:将推理内化到分数分布中
机构 * Alibaba Group(阿里巴巴集团) ; Nankai University(南开大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV
AI总结 提出Z-Reward框架,通过教师-学生模型将推理型奖励内化为紧凑VLM的分数分布,实现高效且准确的文本到图像优化。
Comments Z-Image Team Technical Report. Project page: https://srameo.github.io/projects/z-reward/
BUS:用于高级多模态推理的受脑启发的无监督自我反思
机构 * AAAI Press(美国人工智能协会出版社)
专题命中 视觉推理 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 研究针对VLM处理复杂视觉任务的不足,受脑启发提出BUS无监督训练框架,通过反向预测提升其反思推理能力,无需标注数据,与多种微调方法兼容,经实验验证在多任务中有效提升了VLM推理性能。
非对称互变分学习实现多模态连续推理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 针对多模态大语言模型离散推理丢失感知细节及训练-推理不匹配问题,提出非对称互变分学习框架,通过双向KL散度校准先验与后验,缓解答案泄露,提升连续潜在推理性能。
CodePercept: 基于代码的MLLM视觉STEM感知
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学) ; Qwen Team(通义实验室) ; Beijing Institute of Technology(北京理工大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :MLLM(title_cn,abstract_cn);visual reasoning(abstract);分类 cs.CV
AI总结 本文发现多模态大模型在STEM视觉推理中感知能力是瓶颈,提出通过代码作为感知媒介,构建ICC-1M数据集和STEM2Code-Eval基准来增强和评估感知能力。
Comments Accepted by CVPR2026
ERQA-Plus:具身AI推理的诊断基准
机构 * Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 视觉推理 :LLaVA(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 提出ERQA-Plus基准,包含1766个基于机器人中心图像的问答实例,覆盖感知、动作、社交、导航和常识推理,用于诊断具身AI的推理能力。
Comments under review at NeurIPS
通过闭环视觉基础验证弥合自我反思中的模态脱节
机构 * Beijing Institute of Technology(北京理工大学) ; Shenzhen MSU-BIT University(深圳MSU-BIT大学)
专题命中 视觉推理 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出MIRROR框架,通过闭环视觉反思(草稿-批评-区域验证-修订)减少VLM幻觉,并构建ReflectV数据集训练视觉基础的多轮反思。
VisualFLIP: 在多模态推理中,预测是否依赖于任务关键的视觉证据?
机构 * Imperial College London(伦敦帝国理工学院)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract_cn)
AI总结 提出VisualFLIP基准,通过成对图像扰动测试多模态大模型是否真正依赖关键视觉证据,发现正确预测与证据依赖存在分离。
WorldBench: 一个具有挑战性且视觉多样的多模态推理基准
机构 * Princeton University(普林斯顿大学) ; NYU(纽约大学) ; University of Waterloo(滑铁卢大学) ; Meta, FAIR(Meta和FAIR)
专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 提出WorldBench,通过构建多领域视觉概念分类法并收集多样化图像,设计前沿MLLM难以回答的问题,以评估多模态大语言模型的视觉理解能力,揭示其弱点。
Comments Project page: https://worldbench-vl.github.io/
面向机器人任务规划的3D grounded视觉-语言框架:自动化提示合成与监督推理
机构 * Tsinghua University(清华大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 本文提出融合2D提示合成模块和小语言模型的框架,提升机器人3D场景理解与任务执行能力,实验显示任务成功率高达96.0%。
Journal ref Engineering Applications of Artificial Intelligence, vol. 164, p. 113268, 2026
ToolFG:面向良好基础的细粒度图像分类
机构 * Lancaster University(兰卡斯特大学) ; Peking University(北京大学)
专题命中 视觉推理 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 提出ToolFG框架,通过MCTS引导的工具使用知识蒸馏和模型-工具协同进化机制,使MLLM自主调用外部工具获取可靠视觉线索,实现细粒度图像分类。
Reasmory: 3D重建作为VLMs空间推理的显式记忆
机构 * Cornell Tech, Cornell University(康奈尔科技学院、康奈尔大学) ; NVIDIA(英伟达) ; illoca AI(illoca人工智能) ; The University of California, Merced(加州大学梅尔塞德斯分校)
专题命中 视觉推理 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出Reasmory框架,通过结构化程序执行重建的3D显式记忆,并引入轻量级领域特定语言约束VLM查询和操作,在空间推理任务上提升6-18%。
nuReasoning:面向长尾自动驾驶的推理中心数据集与基准
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Motional
专题命中 视觉推理 :VLM(summary_cn,abstract_cn);visual question answering(abstract);分类 cs.CV
AI总结 提出nuReasoning数据集,包含2万段20秒长尾驾驶场景的推理标注,支持空间、决策和反事实推理评估,并证明推理监督可提升VLM和VLA的驾驶性能。
GSAM: 一种通用且安全的铰接物体操作机器人框架
机构 * College of Computer Science, Chongqing University, Chongqing, China(重庆大学计算机学院) ; Lumos Robotics, China(Lumos机器人中国) ; Xi'an Jiaotong-Liverpool University, China(西安交通大学利物浦大学) ; Fudan University, China(复旦大学) ; Department of Information Engineering and Computer Science, University of Trento, Trento, Italy(特伦托大学信息工程与计算机科学系)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.AI
AI总结 提出GSAM框架,通过视觉感知器生成运动学参数、基于VLM的细调器进行常识推理修正、交互约束函数生成器集成障碍物避免知识,并由运动学感知规划器验证轨迹可达性,在50个铰链任务上相比最佳基线将标准差降低3.1%、操作成功率提升36.0%。
Comments Accepted by the 19th International Conference on Parallel Problem Solving from Nature (PPSN 2026)
SpaMEM:具身环境中通过感知-记忆集成进行动态空间推理的基准测试
机构 * The University of New South Wales(新南威尔士大学) ; The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; Xinjiang University(新疆大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 视觉推理 :VLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 提出SpaMEM基准,通过动作条件场景变换和多模态数据,分层评估多模态大模型在具身环境中的空间信念演化能力,揭示坐标一致性和视觉记忆瓶颈。
DMN: 一种用于多图像输入多模态大语言模型的组合框架
机构 * AI Security Lab(360人工智能安全实验室) ; International Computer Science Institute(国际计算机科学研究所) ; UC Berkeley(加州大学伯克利分校) ; Beihang University(北航大学)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 本文提出DMN框架,通过分布式指令、多模态证据和数字链任务,提升多图像输入多模态大语言模型的 jailbreak 性能,实验表明其在GPT-4o、Gemini-2.5-pro和Claude Sonnet 4上的攻击成功率超过90%。
Comments ACL 2026 main conference
Agentick: 一个统一的连续决策制定代理基准测试
机构 * Mila Quebec AI Institute(魁北克AI研究所) ; Université de Montréal(蒙特利尔大学) ; Google DeepMind(谷歌DeepMind)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.AI
AI总结 Agentick是一个统一的连续决策制定代理基准测试,评估RL、LLM、VLM等代理在共同基础上的表现,揭示各方法的不足,为通用自主代理研究提供实验基础。
DeepSight: 通过潜在状态预测实现长视距世界建模的端到端自动驾驶
机构 * Tsinghua University(清华大学) ; Amap, Alibaba Group(阿里巴巴集团Amap) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV
AI总结 本文提出通过鸟瞰图空间预测连续未来帧的潜在语义特征,实现长视距世界建模,并引入高效适应性文本推理机制提升复杂场景下的驾驶性能。
Comments ICML 2026