MM-LLMs: Recent Advances in MultiModal Large Language Models
专题命中 视觉推理 :multimodal large language model(title,abstract)
Comments Accepted by ACL2024 (findings)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :multimodal large language model(title,abstract)
Comments Accepted by ACL2024 (findings)
专题命中 视觉推理 :vision-language model(title,abstract)
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG
Comments 22 pages, 10 figures
专题命中 视觉推理 :vision-language model(title,abstract)
Comments Preprint
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at NeurIPS 2023 (Datasets and Benchmarks)
专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG
Comments Code: https://github.com/pleaseconnectwifi/DANCE Project page: shuquanye.com/DANCE_website
专题命中 视觉推理 :visual reasoning(title,abstract)
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG
Comments AAAI 2021 paper. Code: https://github.com/husheng12345/SRAN
专题命中 视觉推理 :grounding(title,abstract)
Comments 26 pages, 8 figures
Journal ref NeurIPS 2021 (Dataset and Benchmarks Track)
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG
Comments Robotics: Science and Systems (R:SS) 2020
专题命中 视觉推理 :visual reasoning(title,abstract)
Comments AAAI NCHRC 2017
机构 * Apple(苹果公司)
专题命中 视觉推理 :visual reasoning(title,comments);分类 cs.CV、cs.LG
Comments additional experiments added, title changed from "Visual Scratchpads: Enabling Global Reasoning in Vision" to "Chain-of-Sketch: Enabling Global Visual Reasoning"
想象感知标记增强多模态语言模型的空间推理能力
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(Allen人工智能研究所) ; Microsoft(微软) ; OpenAI(开放人工智能研究院)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.AI
AI总结 提出想象感知标记(IPT)作为中间感知表征,通过监督学习提升多模态语言模型在不可见视角推理、遮挡路径追踪等空间推理任务上的性能,在三个新构建的数据集上优于文本思维链训练。
视觉推理引导的光场遮挡去除
机构 * Johannes Kepler University(约翰·开普勒大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出结合光场积分与视觉语言模型的框架,通过多视图融合和语义先验恢复被遮挡场景,在合成和真实数据上取得最优性能。
PhysX-CoT:从单张图像生成可用于仿真的3D资产的结构化物理推理
机构 * Space Engineering University(航天工程大学)
专题命中 视觉推理 :grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 PhysX-CoT将单张图像生成仿真3D资产视为显式结构化物理推理过程,通过分解部件级状态轨迹优化相关指标,在多方面优于基线,生成资产在Unreal Engine 5中表现良好。
SmartMage:面向3D场景理解的动态模态编排
机构 * Zhejiang University(浙江大学) ; Stanford University(斯坦福大学)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文针对现有MLLMs采用固定模态组合的缺陷,提出SmartMage模型,通过SMART和MAGE模块动态编排模态,在5个3D场景理解基准上取得最优性能,在RGB视频理解基准上表现具竞争力。
Comments Accepted to ACM MM 2026
让几何引导:在多模态大语言模型中逐层展开几何先验
机构 * Xi’an Jiaotong University(西安交通大学) ; Peking University(北京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; InspireOmni
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出GUIDE框架,通过多级采样和逐步融合几何先验,提升多模态大语言模型在空间推理任务中的性能。
Comments Revised manuscript with updated experiments, figures, and presentation
RemoteZero:零样本地理空间推理
专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);分类 cs.CV
AI总结 本研究提出无标签强化学习框架RemoteZero,利用MLLM的评估能力和航拍图像优势,以语义一致性为内在奖励实现地理空间推理,性能优于监督基线且可自演化,适配多类地球观测任务。
追踪、验证与修正:一种用于多模态大语言模型空间推理的无训练框架
机构 * East China Normal University(华东师范大学) ; Zhongguancun Academy(中关村学院) ; Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 视觉推理 :multimodal large language model(abstract,abstract_cn);MLLM(abstract);分类 cs.CV
AI总结 针对多模态大语言模型空间推理的错误传播问题,提出无训练的追踪-验证-修正框架,构建空间证据图并评估证据可靠性,在15种模型-数据集设置下平均准确率达68.94%,优于基线。
Comments 19 pages, 7 figures
用于一致多参考图像编辑的评估-验证奖励
机构 * Xi’an Jiaotong University(西安交通大学) ; Amap, Alibaba(高德,阿里巴巴) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 针对多参考图像编辑的视觉一致性与奖励模型缺失问题,提出多维度评估-验证奖励EVR,实现无需架构改动的现成编辑器RL微调,性能优于Qwen-Image-Edit并达到或超NanoBanana。
用于自动驾驶视觉语言模型可验证推理的未来轨迹延迟暴露
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI
AI总结 该研究针对自动驾驶VLA模型的轨迹锚定偏差问题,提出AD-MCQ规划框架与DEFT-RLVR方法,将未来轨迹转化为决策后验证目标,提升了自动驾驶推理能力并保留了通用视觉能力。
PhysAgent:用于可靠远程心率估计的多智能体框架
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 PhysAgent是一种推理时多智能体候选验证框架,以多个基础rPPG估计器输出为待验证生理假设,结合Qwen3-VL-4B多模态大语言模型推理与确定性融合,提升远程心率估计的稳定性与可靠性。
FaithEyes:通过多智能体过程图像验证实现可信的工具使用
机构 * Samsung Research(三星研究院) ; Peking University(北京大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 本研究提出多智能体框架FaithEyes,通过子智能体判断主智能体的工具调用以提升工具使用可信性,在视觉感知与推理基准上实现了更优准确率。
基于结构化场景知识和可验证推理-行动一致性的自动驾驶认知双过程规划
机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) ; National Engineering Research Center of Electric Vehicles, Beijing Institute of Technology(北京理工大学电动车辆国家工程研究中心) ; School of Mechanical Engineering, Southeast University(东南大学机械工程学院)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 研究自动驾驶高级规划问题,提出认知双过程规划框架,用S-CoT模式表示场景知识,通过自动数据引擎、视觉仲裁器及验证器实现自适应推理和规则验证,提升规划准确性、逻辑一致性并降低延迟,明确性能下降条件。
AutoVSR:用于从电路原理图生成符号表达式的自动视觉到符号推理
机构 * Hunan University, Changsha, China(湖南大学) ; Wuhan University of Technology, Wuhan, China(武汉理工大学) ; Huazhong University of Science and Technology, Wuhan, China(华中科技大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.AI
AI总结 研究旨在解决从电路原理图生成符号表达式的难题,提出AutoVSR框架,利用视觉语言模型,通过重建电路图为可执行中间表示并借助符号求解器推理,引入两项创新提升准确率,在任务中表现优于其他方法,还降低了推理成本和提高了计算效率。
不要愚弄我两次:通过经验驱动推理在野外适应逆境
机构 * Department of Engineering Design, Indian Institute of Technology, Madras(印度理工学院工程设计系,马德拉斯) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG
AI总结 提出一种持续学习框架,使移动机器人能够在线从干扰中学习,通过语义将异常行为归因于原因,从而更好地预测和规划未来。
Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
缓解零样本视频时刻检索中的模态和语言风格差距
机构 * Sungkyunkwan University(成均馆大学)
专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 研究零样本视频时刻检索中模态和语言风格差距问题,提出基于自相似性的时刻提议和评分方法及查询感知的多模态大语言模型推理阶段,有效缓解差距,在相关基准测试中达最优性能。
Comments ECCV 2026 (* These authors contributed equally.)
认识自我,理解世界:用于基于多模态大语言模型的无人机时空推理的双认知基准测试
机构 * Northwestern Polytechnical University(西北工业大学) ; China University of Petroleum(中国石油大学)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 该研究针对多模态大语言模型在无人机场景双认知能力评估不足的问题,提出UAV-DualCog基准测试,涵盖图像和视频任务,通过自动化管道构建数据,评估发现现有模型存在瓶颈,该基准测试有价值。
Comments 11 pages, 4 figures, 7 tables. Project website: https://uav-dualcog.lozumi.com
打破似曾相识:通过视觉语言推理对视觉场所识别进行独立审计
机构 * School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院) ; School of Electrical Engineering and Computer Science, Queensland University of Technology(昆士兰科技大学电气工程与计算机科学学院) ; School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 研究针对视觉场所识别中图像匹配阈值在环境变化下不可靠的问题,引入视觉场所识别审计框架,利用视觉语言模型通过联合推理评估检索匹配,经实验验证该方法有效提升召回率并降低误接受率。
长期体育视频中的时间组成推理方法
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出SportsTime基准和CoTR方法,通过时间接地证据组成提升体育视频长期推理能力,优于现有多模态大语言模型。