arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-17 至 2026-04-17 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 11 篇

2604.14951 2026-04-17 cs.CV cs.AI cs.CL cs.MM 86%

RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models

RaTA-Tool: 基于检索的多模态大语言模型工具选择

Gabriele Mattioli, Evelyn Turri, Sara Sarto, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出RaTA-Tool框架,利用多模态大语言模型将多模态查询转化为结构化任务描述,并通过语义丰富的工具描述检索合适工具,支持开放世界场景下的工具扩展。

Comments ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14799 2026-04-17 cs.CL cs.CV 81%

Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems

在何时不回答:评估多模态推理系统中的退避

Nishanth Madhusudhan, Vikas Yadav, Alexandre Lacoste

机构 * ServiceNow Research(ServiceNow研究院)

专题命中 视觉推理 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出MM-AQA基准,通过视觉模态依赖性和证据充分性变换生成不可回答实例,评估三种前沿VLM和两种MAS架构,发现VLM在标准提示下 rarely 退避,MAS提升退避但引入准确率-退避权衡,序列设计表现优异,表明退避意识训练比提示或更多代理更重要。

Comments 10 pages and 4 figures (excluding appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14568 2026-04-17 cs.CV cs.CL 79%

Learning Adaptive Reasoning Paths for Efficient Visual Reasoning

学习高效的视觉推理路径

Yixu Huang, Tinghui Zhu, Muhao Chen

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

AI总结 本文提出AVR框架,通过分解视觉推理为三个认知功能,动态选择响应格式,减少推理冗余,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14507 2026-04-17 cs.CV cs.LG 79%

H2VLR: Heterogeneous Hypergraph Vision-Language Reasoning for Few-Shot Anomaly Detection

H2VLR:异构超图视觉-语言推理用于少样本异常检测

Jianghong Huang, Luping Ji, Weiwei Duan, Mao Ye

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出H2VLR框架,通过统一超图联合建模视觉区域和语义概念,将少样本异常检测转化为高阶推理问题,有效提升异常检测性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05418 2026-04-17 cs.CV cs.AI 79%

VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG

VideoStir:通过时空结构化和意图感知的RAG理解长视频

Honghao Fu, Miao Xu, Yiwei Wang, Dailing Zhang, Jun Liu, Yujun Cai

机构 * University of Queensland(昆士兰大学) University of California, Merced(加州大学默塞德分校) Institute of Automation, CAS(中国科学院自动化研究所) Lancaster University(兰卡斯特大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VideoStir通过构建时空图和意图相关性评分器,改进长视频RAG框架,实现基于意图的结构化推理,无需辅助信息即可竞争现有最佳基线。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18129 2026-04-17 cs.CV cs.CL 77%

One RL to See Them All: Visual Triple Unified Reinforcement Learning

一个RL看尽一切:视觉三合一强化学习

Yan Ma, Linge Du, Xuyang Shen, Shaoxiang Chen, Pengfei Li, Qibing Ren, Lizhuang Ma, Yuchao Dai, Pengfei Liu, Junjie Yan

机构 * Qwen Team(通义实验室)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出V-Triune方法,通过三个协调抽象提升多模态RL性能,开发Orsta模型在多个任务中表现优异,展示统一RL在视觉语言模型中的优势。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14041 2026-04-17 cs.CV 70%

Seek-and-Solve: Benchmarking MLLMs for Visual Clue-Driven Reasoning in Daily Scenarios

寻找并解决:用于日常场景中视觉线索驱动推理的MLLMs基准测试

Xiaomin Li, Tala Wang, Zichen Zhong, Ying Zhang, Zirui Zheng, Takashi Isobe, Dezhuang Li, Huchuan Lu, You He, Xu Jia

机构 * Dalian University of Technology(大连理工大学) WeChat, Tencent Inc.(微信,腾讯公司) Tsinghua University(清华大学)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出DailyClue基准测试,旨在评估MLLMs在日常场景中通过视觉线索进行推理的能力,强调真实日常活动和挑战性查询设计,推动模型深入理解与推理。

Comments Accepted by ACL Findings 2026. Project page: https://xiaominli1020.github.io/DailyClue/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14806 2026-04-17 cs.SD cs.MM 67%

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

倾听、暂停与推理:迈向基于感知的混合推理以实现音频理解

Jieyi Wang, Yazhe Niu, Dexuan Xu, Zhongyu Wei

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) CUHK MMLab(香港中文大学多媒体实验室) Fudan University(复旦大学)

专题命中 视觉推理 :grounding(abstract,abstract_cn)

AI总结 本文提出HyPeR框架,通过感知-推理混合方法提升音频理解能力,通过PAQA数据集训练模型并引入PAUSE标记和一致性奖励,实验表明其在复杂音频场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11600 2026-04-17 cs.CV 57%

Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language

几何解析:一种统一形式语言用于平面和立体几何的图表解析

Peijie Wang, Ming-Liang Zhang, Jun Cao, Chao Deng, Dekang Ran, Hongda Sun, Pi Bu, Xuan Zhang, Yingyao Wang, Jun Song, Bo Zheng, Fei Yin, Cheng-Lin Liu

机构 * MAIS, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种统一形式语言,结合平面和立体几何,构建了GDP-29K数据集,通过监督微调与可验证奖励的强化学习提升几何解析性能,提升MLLMs的几何推理能力。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05541 2026-04-17 cs.CV 57%

EchoAgent: Towards Reliable Echocardiography Interpretation with "Eyes","Hands" and "Minds"

EchoAgent:迈向可靠超声心动图解读的“眼、手、脑”系统

Qin Wang, Zhiqing He, Yu Liu, Bowen Guo, Zeju Li, Miao Zhao, Wenhao Ju, Zhiling Luo, Xianhong Shu, Yi Guo, Yuanyuan Wang

机构 * Fudan University(复旦大学) Fudan Zhongshan Hospital(复旦中山医院) Fuwai Yunnan Hospital(阜外云南医院) Fuwai Beijing Hospital(阜外北京医院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出EchoAgent,通过整合视觉、手动操作与专家知识,实现端到端的超声心动图解读,提升临床可靠性与实用性。

Comments Accepted by CVPR 2026 CV4Clinical, 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15244 2026-04-17 cs.CL 50%

From Tokens to Steps: Verification-Aware Speculative Decoding for Efficient Multi-Step Reasoning

从标记到步骤:面向验证的推测解码用于高效多步推理

Kiran Purohit, Ramasuri Narayanam, Soumyabrata Pal

机构 * IIT Kharagpur(印度克哈格普尔理工学院) Adobe Research(Adobe研究院)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出SpecGuard框架,通过模型内部信号进行步骤级验证,提升多步推理的准确性和效率,实验显示在多个推理基准上准确率提升3.6%且延迟降低11%。

详情

展开后加载摘要…

URL PDF HTML 收藏