Improving Visual Reasoning with Iterative Evidence Refinement
通过迭代证据细化提升视觉推理
专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出SIEVE框架,利用模型内部信号直接支持图像 grounded 推理,通过强化学习指导视觉重访,提升多基准性能8%。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
通过迭代证据细化提升视觉推理
专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出SIEVE框架,利用模型内部信号直接支持图像 grounded 推理,通过强化学习指导视觉重访,提升多基准性能8%。
CORAL:在分层视觉语言框架中实现上下文推理与局部规划用于水下监测
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract)
AI总结 CORAL框架通过分离高层语义推理与底层反应控制,提升水下监测的覆盖率和安全性,减少碰撞并降低对VLM的调用次数。
Comments Submitted to IROS 2026
CAMD:面向多模态大语言模型高效推理的覆盖感知多模态解码
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.LG
AI总结 本文提出CAMD,通过动态分配计算资源提升多模态大语言模型的推理效率与可靠性,解决解码方法在易例和难例间的计算不匹配问题。
RieMind:基于几何的场景理解空间智能体
机构 * Riemann Lab, Huawei Technologies(华为技术有限公司里斯曼实验室)
专题命中 视觉推理 :visual language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出RieMind,通过显式3D场景图实现空间推理,证明解耦感知与推理能显著提升空间推理能力,实验结果显示比现有方法提升16%-50%。
利用视觉语言模型推理来约束任务和运动规划
机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) ; Department of Computer Science, Rice University(莱斯大学计算机科学系) ; Ken Kennedy Institute, Rice University(莱斯大学肯尼迪研究所)
专题命中 视觉推理 :VLM(title);vision-language model(abstract)
AI总结 本文提出VIZ-COAST方法,利用大预训练视觉语言模型的空间推理能力,提前识别向下细化中的问题,减少规划时间并消除失败。
Comments 9 pages, 7 figures, 1 table. Submitted to IROS 2026
MA-VLCM:一种用于多智能体团队设置中策略价值估计的视觉语言批评模型
机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; Clemson University(克莱姆斯大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI
AI总结 本文提出MA-VLCM,通过预训练的视觉语言模型替代传统集中批评者,提升多智能体强化学习的样本效率和泛化能力,适用于资源受限的机器人部署。
Comments 7 pages, 6 figures
从自身视角到世界视角:通过强化学习实现具身系统的协作空间推理
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出E2W基准和CoRL框架,通过结合链式推理监督微调与强化学习,解决多智能体系统中分布式视角下的空间推理问题,实现跨视角实体识别与任务执行。
RenderMem:将渲染作为空间记忆检索
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.AI
AI总结 RenderMem通过将渲染作为3D世界与空间推理的接口,使智能体能直接进行视角相关的可见性与遮挡推理,提升空间记忆系统的表现。
面向统一模型的基于推理的视频编辑:带有自我反思学习
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出RVE任务,通过构建RVE-Bench基准,引入自反思学习框架ReViSE,提升视频编辑的准确性和视觉质量。
Colon-X:推动智能结肠镜向临床推理迈进
机构 * NKIARI & SLAI, Shenzhen Futian and VCIP, Nankai University, Tianjin, China(NKIARI与SLAI,深圳福田及VCIP,南开大学,天津,中国) ; Australian National University (ANU), Canberra, Australia(澳大利亚国立大学(ANU),堪培拉,澳大利亚) ; King Abdullah University of Science and Technology (KAUST), Thuwal, Saudi Arabia(国王阿卜杜勒·阿齐兹大学(KAUST),图瓦尔,沙特阿拉伯) ; Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科学、技术和研究局(A*STAR),新加坡)
专题命中 视觉推理 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出Colon-X,构建了最全面的结肠镜多模态数据集ColonVQA,并开发了专为结肠镜设计的ColonR1模型,通过任务自适应奖励和梯度稳定策略优化,在数据稀缺条件下实现了56.61%的总体准确率,优于监督微调方法。
Comments Technical report (v2)
Marmot:通过多智能体推理实现对象级自校正
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 Marmot通过多智能体推理实现对象级自校正,提升图像文本对齐的准确性,解决多对象场景中计数、属性和空间关系的校正问题。
Journal ref Machine Intelligence Research, 2026
ST-VLA:为通用机器人操作实现4D感知的时空理解
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)
AI总结 ST-VLA通过统一的3D-4D表示连接感知与动作,利用ST-Human数据集训练时空视觉语言模型,提升复杂3D场景中的鲁棒性和泛化能力。
Comments 25 pages, under review
VisionCoach: 通过视觉感知提示强化视频推理
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 VisionCoach通过视觉提示指导强化学习,提升视频推理的时空定位能力,实现无需外部工具的高效推理。
Comments Project website: https://visioncoach.github.io/
ECG-Reasoning-Benchmark: 一个用于评估心电图解读中临床推理能力的基准
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ECG-Reasoning-Benchmark,通过6400个样本系统评估17种核心心电图诊断的逐步推理能力,发现现有多模态大语言模型在多步逻辑推理中存在严重缺陷,无法有效将心电图发现与实际信号证据关联。
Comments Preprint. 9 pages for main text, 2 pages for references, 19 pages for supplementary materials (appendix)
通过4D逃脱房间任务评估大模型的时间意识和跨模态主动感知
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出4D逃脱房间任务,用于评估大模型在时间变化和不可逆条件下跨模态感知和时间意识的能力,发现模型在多模态整合中存在模态偏差和能力差距。
线索至关重要:利用潜在视觉线索增强视频推理
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV
AI总结 本文提出ClueNet框架,通过两阶段监督微调方法,解决视频推理中视觉线索提取、过滤与推理对齐问题,提升视频问答的准确性和可解释性。
Comments 18 pages, 7 figures
Video-CoE:通过事件链强化视频事件预测
机构 * AMAP, Alibaba Group(阿里妈妈,阿里巴巴集团)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV
AI总结 本文提出Video-CoE方法,通过构建时间事件链提升视频事件预测的准确性,实验表明其优于现有主流大语言模型。
Comments 21 pages, 18 figures, 6 tables
生成式视觉链式思维用于图像编辑
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
AI总结 本文提出GVCoT框架,通过生成空间线索实现视觉推理与编辑,解决复杂场景下的编辑定位问题,提出GVCoT-Edit-Instruct数据集和SREdit-Bench基准,实验表明其在图像编辑任务中表现优异。
Comments Project page: https://pris-cv.github.io/GVCoT/
缓冲区很重要:在大语言模型推理中释放离策略强化学习的潜力
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI
AI总结 本文提出BAPO框架,通过动态选择训练批次和保证策略改进下限,提升大语言模型训练效率,实验显示在数学、规划和视觉推理任务中平均提升12.5%。
EviAgent:基于证据的放射学报告生成代理
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 EviAgent通过引入多维视觉专家和检索机制,解决放射学报告生成中的透明性与证据支持问题,实验表明其在多个数据集上优于通用和专用模型。
ProFocus:面向视觉-语言导航的前瞻性感知与聚焦推理
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 ProFocus通过大语言模型与视觉-语言模型的协作,实现前瞻性感知和聚焦推理,提升视觉-语言导航任务的效率与准确性。
Comments Accepted by CVPR 2026
主动发现框架:通过神经符号LaTeX合成实现自主物理推理
专题命中 视觉推理 :grounding(abstract);分类 cs.LG
AI总结 本文提出主动发现框架,通过神经符号LaTeX合成实现自主物理推理,解决神经网络在大规模计算中的精度问题,并验证其在物理常数推导中的有效性。
Comments V4 Coming S00N :)
基于推理的自然语言解释方法用于语言模型
专题命中 视觉推理 :grounding(abstract);分类 cs.LG
AI总结 本文提出一种通过推理过程生成可信自然语言解释的方法,通过将推理过程转化为token序列并解码为自然语言,提升解释的准确性与答案质量。
Comments (v2) Added acknowledgements section
Journal ref In: Guidotti, R., Schmid, U., Longo, L. (eds) Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2578. Springer, Cham
SCoCCA: 通过典型相关分析进行多模态稀疏概念分解
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出SCoCCA,通过典型相关分析实现多模态稀疏概念分解,提升跨模态对齐与可解释性,实现概念发现的最优性能。
QTrack: 基于查询的多模态 MOT 推理
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出基于查询的多模态 MOT 推理方法,通过自然语言查询定位和跟踪特定目标,构建了 RMOT26 基准并提出 QTrack 模型,结合多模态推理与跟踪定位,提升语言引导的跟踪性能。
Comments Project Page: https://gaashlab.github.io/QTrack/
WAT:在线视频理解需要先观看再思考
机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室,人工智能与机器人研究院,西安交通大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) ; University of Science and Technology Beijing(北京科技大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 WAT提出双阶段框架,通过分阶段处理实现在线视频理解,结合查询与短期记忆进行跨时间推理,实验显示在多个基准上表现优异。