Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models
专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
Comments Project Page: https://sites.google.com/view/chain-of-spot/
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
Comments Project Page: https://sites.google.com/view/chain-of-spot/
专题命中 视觉推理 :vision-language model(title);visual language model(abstract);visual reasoning(abstract);分类 cs.CV
Comments 13 pages, 7 figures
专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.AI
Comments under review
专题命中 视觉推理 :vision language model(title);VLM(abstract);visual reasoning(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments Project page: https://yuzhou914.github.io/SmartEdit/
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments Technical Report. Project page: https://rshaojimmy.github.io/Projects/JiuTian-LION Code: https://github.com/rshaojimmy/JiuTian
专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉推理 :visual language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted to WACV
专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted to Findings of EMNLP
专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV
Comments CVPR 2018 pre-print
专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV
Comments Equal contribution by first two authors. Accepted in WACV 2019
SPARED:基于推理的AI生成图像检测方法,采用对抗编辑数据
专题命中 视觉推理 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 本研究提出对抗强化学习框架SPARED,通过扩散图像编辑器与推理型MLLM的交替博弈,训练出能抗捷径、泛化能力强的AI生成图像检测器,在三个外部基准上性能单调提升。
文本中的去偏:相信你的视觉:面向视觉反常识推理的文本锚定跨模态迁移
机构 * Ant Group(蚂蚁集团)
专题命中 视觉推理 :grounding(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对多模态大语言模型视觉反常识推理中语言先验干扰问题,提出文本锚定数据构建流程及后训练框架 TACT,实现无需视觉数据的跨模态去偏,提升模型视觉推理性能。
OPD-V:结合模态平衡的视觉在线策略自蒸馏
机构 * National University of Singapore(新加坡国立大学) ; Ludwig Maximilian University of Munich(慕尼黑大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Sun Yat-sen University(中山大学)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对多模态大语言模型的模态不平衡问题,提出视觉在线策略自蒸馏范式OPD-V,通过正、负教师模型实现模态平衡,在多基准与骨干上提升推理性能并降低训练成本。
Comments Corrected the uploaded manuscript. Project Page:https://github.com/aniri15/OPD-V
JigShape:通过拼图任务评估视觉语言模型的视觉几何推理能力
机构 * University of Southern California(南加州大学) ; National University of Singapore(新加坡国立大学) ; Adobe Research(奥多比研究院) ; Texas A&M University(德克萨斯农工大学) ; Rice University(莱斯大学) ; The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 视觉推理 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出JigShape拼图基准,发现零样本VLM大多缺乏几何推理能力,所有模型在大尺寸拼图上均出现性能崩塌,将可扩展几何推理确立为VLM的开放性挑战。
O-VAD:通过以对象为中心的跟踪和推理进行工业视频异常检测
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Griffith University(格里菲斯大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 针对工业视频异常检测,现有基于VLM的方法在工业场景中性能不佳的问题,提出无训练的智能框架O-VAD,通过跟踪对象时空动态和推理状态轨迹来检测异常,在多数据集实验中优于多种方法且能提供可解释报告。
Comments Accepted to ECCV 2026
解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器
专题命中 视觉推理 :MLLM(title_cn,abstract_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。
Comments Accepted to the CompLearn Workshop at ICML 2026
TriViewBench: 多视图结构推理中受控复杂度缩放
机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
专题命中 视觉推理 :visual reasoning(abstract);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract_cn)
AI总结 提出TriViewBench基准,通过合成3D场景控制物体数量和遮挡,评估18个多模态大模型在多视图推理中的能力层次和性能退化,发现跨视图空间表示是瓶颈。
Comments 26 pages, 8 figures
m2sv: 地图到街景空间推理的可扩展基准
机构 * University of Hawai'i at M\=anoa, Honolulu, HI, USA
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 提出m2sv基准,通过匹配朝北俯视图与街景图像推断相机方向,评估VLM空间推理能力;最佳模型准确率65.2%,低于人类72.0%,揭示几何对齐与推理一致性的差距。
感知、交互、推理:构建工具增强的视觉智能体用于空间推理
机构 * Tsinghua University(清华大学) ; Virginia Tech(弗吉尼亚理工大学) ; NVIDIA(英伟达)
专题命中 视觉推理 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出PERIA智能体,通过视觉感知和交互工具增强VLM的空间推理能力,在13个基准上优于同类模型7.0%-14.8%。
推理,再推理:跨视角重访提升空间推理
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视觉推理 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 提出ReRe框架,通过生成互补新视角视频让MLLM先推理再验证,无需训练即可显著提升空间推理性能。
Comments ICML 2026
MARIC:用于图像分类的多智能体推理
机构 * Enhans, Seoul, South Korea(韩国首尔Enhans) ; Peking University, Beijing, China(中国北京北京大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
AI总结 提出多智能体框架MARIC,通过分解图像分类为协作推理过程,利用大纲智能体、方面智能体和推理智能体进行多视角分析与综合,在四个基准数据集上显著优于基线方法。
Comments 11 pages, preprint
VLMs能否解锁语义异常检测?一个结构化推理的框架
机构 * Professorship of Autonomous Vehicle Systems TUM School of Engineering ; Design, Technical University of Munich Munich, Germany
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 本文提出SAVANT框架,通过结构化推理方法提升VLM在语义异常检测中的性能,实现对自动驾驶场景中罕见异常情况的更准确识别。
Comments 8 pages, 5 figures
推理可移植性:引导MLLMs在RLVR时代的持续学习
机构 * Shenzhen Graduate School of Peking University(北京大学深圳研究生院) ; Centre for Artificial Intelligence and Robotics, HKISI, CAS(香港科学院人工智能与机器人研究中心) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出了一种名为推理可移植性(RP)的机制,通过在持续学习中引入推理层面的约束,改进了多模态大语言模型在RLVR环境下的适应能力,实验表明RDB-CL在提升最后准确率方面优于基线方法。
通过定制代理推理增强VLMs在少样本多模态时间序列分类中的能力
机构 * Sun Yat-sen University(中山大学) ; Xiaomi Corporation(小米公司) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文提出MarsTSC框架,通过自演化知识库和代理推理提升少样本多模态时间序列分类性能,实验表明其在六个VLM基础上均优于传统和基础模型基线。
Comments 18 pages, 12 figures, 6 tables. Preprint
VLRS-Bench: 一种面向遥感的视觉-语言推理基准
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)
专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VLRS-Bench,首个专注于复杂遥感推理的基准,包含2000个问题-答案对,涵盖14项任务和八个时间阶段,揭示现有MLLM在遥感任务中的瓶颈。
Motion-o:基于轨迹的视频推理
机构 * Northeastern University(东北大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 Motion-o通过引入运动链推理,使视频推理模型能够显式且可验证地表示物体运动轨迹,提升动态和轨迹依赖性推理的可监督性。
像植物学家一样思考:用意图驱动的连续询问挑战多模态语言模型
机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) ; Department of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) ; Department of Agronomy, Gazipur Agricultural University(加兹ipur农业大学作物学系) ; Department of Botany, University of Dhaka(达卡大学植物学系)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)
AI总结 本文提出PlantInquiryVQA基准,通过结构化询问提升植物病害诊断准确性,揭示多步意图驱动的视觉推理方法,改进多模态模型的临床推理能力。
Comments Accepted at ACL 2026 Findings