arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-29 至 2026-07-29 共收录 21 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2604.27720 2026-07-29 cs.AI 版本更新 89%

Why Does Grounding Hurt Medical VQA? Benchmarking, Diagnosis, and Fine-Tuning of Vision-Language Models

对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应

Xupeng Chen, Binbin Shi, Chenqian Le, Qifu Yin, Lang Lin, Haowei Ni, Ran Gong, Panfeng Li

机构 * New York University, New York, USA(纽约大学) Tsinghua University, Beijing, China(清华大学) Columbia University, New York, USA(哥伦比亚大学) University of Michigan, Ann Arbor, USA(密歇根大学)

专题命中 视觉问答 :vision-language model(title,abstract);grounding(title,abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文审计了五种前沿视觉-语言模型在医学视觉问答中的表现,发现定位失败和格式崩溃是信任瓶颈,通过领域适应可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09733 2026-07-29 cs.CL cs.CV 版本更新 88%

VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation

VisRAG2.0:通过视觉检索增强生成中的证据引导多图像推理减轻视觉幻觉

Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun

机构 * School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院) School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 研究针对视觉检索增强生成中VLM存在的视觉幻觉及证据识别问题,提出证据引导的多图像推理框架EVisRAG,引入RS-GRPO改进训练,实验表明该方法能提升性能、减少幻觉,有效提高视觉基础和推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24743 2026-07-29 cs.CV cs.AI cs.CL 版本更新 79%

ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding

ClinFusion:用于整体医学理解的以视觉为中心的多模态大语言模型系统

Hangjie Yuan, Yichen Qian, Zhiwei Tang, Xianzhe Xu, Lirong Wu, Sicheng Yang, Jinwang Wang, Pengju Wang, Zhitao Zeng, Yizeng Han, Yan Xing, Shengxuan Luo, Tao Feng, Qing Xie, Weigen Yao, Yi Yang, Zuozhu Liu, Jiasheng Tang, Shaocheng Wang, Jitao Wang, Jiahong Dong, Weihua Chen, Feng Xu, Fan Wang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Laboratory(湖畔实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Radiology, The Affiliated Yangming Hospital of Ningbo University(宁波大学附属阳明医院放射科) Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University(浙江大学伊利诺伊大学厄巴纳香槟校区联合学院,浙江大学) Hepato-Pancreato-Biliary Center, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua Medicine, Tsinghua University(清华长庚医院肝胆胰中心,清华大学临床医学院,清华医学,清华大学) School of Software, Tsinghua University(清华大学软件学院) Beijing National Research Center for Information Science and Technology, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态大语言模型在医学领域部署的挑战,提出ClinFusion,采用组合级联视觉编码器架构和视觉基础评估框架,在多模态医学基准测试中表现优异,超越开源和专有模型,经专家盲评验证效果良好。

Comments Code: https://github.com/alibaba-damo-academy/ClinFusion Models: https://huggingface.co/collections/Alibaba-DAMO-Academy/clinfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15353 2026-07-29 cs.CL cs.AI 版本更新 70%

NeuroSymActive: Differentiable Neural-Symbolic Reasoning with Active Exploration for Knowledge Graph Question Answering

NeuroSymActive:基于主动探索的可微神经符号推理用于知识图谱问答

Rong Fu, Yang Li, Zeyu Zhang, Jiekai Wu, Yaohua Liu, Shuaishuai Cao, Yangchen Zeng, Yuhang Zhang, Xiaojing Du, Simon Fong

机构 * University of Macau(澳门大学) University of Chinese Academy of Sciences(中国科学院大学) The Australian National University(澳大利亚国立大学) Juntendo University(静冈大学) Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Central South University(中南大学) Southeast University(东南大学) China Agricultural University(中国农业大学) Adelaide University(阿德莱德大学)

专题命中 视觉问答 :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 NeuroSymActive结合可微神经符号推理层和主动探索控制器,通过软统一流程模块和神经路径评估器提升知识图谱问答的准确性和效率。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18368 2026-07-29 cs.AI 版本更新 57%

Neuro-Symbolic Meta-Policies for Temporal Knowledge-Graph Memory under Partial Observability

部分可观测性下用于时态知识图谱记忆的神经符号元策略

Taewoon Kim, Vincent François-Lavet, Michael Cochez

机构 * HumemAI(胡梅人工智能公司) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ELLIS Institute Finland & Abo Akademi University(芬兰埃利斯研究所和图尔库大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 研究部分可观测性下的强化学习,提出神经符号元策略,结合知识图谱编码与值头,通过RDF表示等实现语义网基础,在特定设置下限定符感知的StarE - GNN配置性能最佳且有可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 5 篇

2607.07395 2026-07-29 cs.CV cs.AI cs.LG 版本更新 75%

When Prompts Ignore Structure: Graph-Based Attribute Reasoning for Calibrated VLMs

当提示忽略结构时:基于图的属性推理用于校准视觉语言模型

Tanay Sodha, Aditya Sharma, Ramya Hebbalaguppe, Vinti Agarwal, Pranav Murthy Yeluripaty

机构 * Birla Institute of Technology and Science, Pilani(贝拉科技与科学学院皮拉尼分校) TCS Research(塔塔咨询服务公司研究院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 研究视觉语言模型测试时自适应中可靠置信度估计问题,提出ARGTCA方法,将(类,属性)对表示为符号属性图节点,用对比目标训练图注意力网络,引入两种属性选择策略,实验证明该方法能有效降低校准误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13454 2026-07-29 cs.CV cs.AI 版本更新 73%

GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解

Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15753 2026-07-29 cs.AI 版本更新 70%

RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought

RoboPIN: 基于锚定思维链的具身推理

Yaoting Huang, Yifu Yuan, Linqi Han, Chengwen Li, Shuoheng Zhang, Xianze Yao, Hongyao Tang, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 提出Pinned Chain-of-Thought (PinCoT)推理范式,通过结构化视觉锚点绑定实体,解决多步推理中实体引用漂移和视觉解耦问题;训练4B参数模型在14个基准上平均超越最强7B基线12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14366 2026-07-29 cs.AI cs.RO 版本更新 70%

Towards Embodied Cognition in Robots via Spatially Grounded Synthetic Worlds

通过空间基础合成世界实现机器人的具身认知

Joel Currie, Gioele Migno, Enrico Piacenti, Maria Elena Giannaccini, Patric Bach, Davide De Tommaso, Agnieszka Wykowska

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.AI

AI总结 提出训练视觉语言模型执行视觉视角采择的概念框架,引入合成数据集用于空间推理任务监督学习,专注推断Z轴距离,数据集公开,为具身人工智能系统空间理解奠基。

Comments Accepted to: Intelligent Autonomous Systems (IAS) 2025 as Late Breaking Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15050 2026-07-29 cs.CL 版本更新 50%

Beyond Factual Accuracy: Evaluating Global Reasoning Integrity in RAG Systems with LogicScore

超越事实准确性:使用逻辑得分评估RAG系统中的全球推理完整性

Zhichao Yan, Yunxiao Zhao, Jiapu Wang, Jiaoyan Chen, Xiaoli Li, Ru Li, Jeff Z. Pan

机构 * Shanxi University(山西大学) Nanjing University of Science and Technology(南京理工大学) University of Manchester(曼彻斯特大学) Singapore University of Technology and Design(新加坡科技设计大学) University of Edinburgh(爱丁堡大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出LogicScore,通过全局推理审查弥补RAG系统在长文本生成中逻辑完整性不足的问题,揭示模型在事实准确性高但全局推理质量差的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 7 篇

2606.00435 2026-07-29 cs.CV cs.AI 版本更新 86%

Detect Before You Leap: Mirage Detection in Vision-Language Models

在跳跃前检测:视觉语言模型中的幻象检测

Sayeed Shafayet Chowdhury, Md. Shaown Miah, S. M. Taiabul Haque, Syed Ishtiaque Ahmed

机构 * Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对视觉语言模型在缺乏视觉证据时产生自信但无根据回答的幻象问题,提出文本条件层内对齐方法,通过分析视觉编码器各层补丁令牌与问题嵌入的对齐轨迹,结合像素统计、零样本域路由和结构化自评估,实现高精度预响应幻象检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27176 2026-07-29 cs.CV 版本更新 85%

MEDIC-AD: Towards Medical Vision-Language Model's Clinical Intelligence

MEDIC-AD:迈向医疗视觉-语言模型的临床智能

Woohyeon Park, Jaeik Kim, Sunghwan Steve Cho, Pa Hong, Wookyoung Jeong, Yoojin Nam, Namjoon Kim, Ginny Y. Wong, Ka Chun Cheung, Jaeyoung Do

机构 * AIDAS Laboratory, Seoul National University(首尔大学AIDAS实验室) Samsung Changwon Hospital(三星昌原医院) Samsung Medical Center(三星医疗中心) NVIDIA, Santa Clara, USA(英伟达(美国圣克拉拉))

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 MEDIC-AD通过分阶段框架提升医疗视觉-语言模型在病变检测、症状跟踪和视觉可解释性方面的性能,实现临床应用中的最优表现。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09611 2026-07-29 cs.CV cs.AI cs.CR 版本更新 84%

AGMark: Attention-Guided Dynamic Watermarking for Large Vision-Language Models

AGMark:基于注意力的动态水印技术用于大视觉-语言模型

Yue Li, Xin Yi, Dongsheng Shi, Yongyi Cui, Gerard de Melo, Linlin Wang

机构 * East China Normal University(华东师范大学) Hasso Plattner Institute(哈索普拉特纳研究所) University of Potsdam(波茨坦大学)

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 AGMark通过动态注意力机制提升大视觉-语言模型的水印可靠性,实现高质量生成和强视觉语义保真度。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06276 2026-07-29 cs.CV cs.AI 版本更新 79%

RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension

RefBench-PRO:面向感知与推理的指称表达理解基准

Tianyi Gao, Hao Li, Han Fang, Xin Wei, Xiaodong Dong, Hongbo Sun, Ye Yuan, Zhongjiang He, Jinglin Xu, Jingmin Xin, Hao Sun

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(国家人机混合增强智能重点实验室) National Engineering Research Center for Visual Information and Applications(国家视觉信息与应用工程技术研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI)) China Telecom(中国电信) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology Beijing(北京科技大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI

AI总结 RefBench-PRO提出一个面向感知与推理的指称表达理解基准,通过分解指称表达为感知和推理两个维度,设计六个逐步递增的挑战任务,并引入Ref-R1强化学习方案提升定位精度,实现对多模态大语言模型的可解释评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04364 2026-07-29 cs.CV cs.LG 版本更新 62%

Spatially Grounded Concept Bottleneck Models via Part-Factorized Attention

通过部分分解注意力的空间基础概念瓶颈模型

Dhanesh Ramachandram

机构 * Vector Institute(向量研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 提出一种部分分解的概念瓶颈模型,通过空间先验约束注意力,在细粒度识别中实现可解释性并提升定位精度。

Comments Updated references, abstract and rewrite to remove terse language

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10643 2026-07-29 stat.ML cs.AI cs.LG 版本更新 62%

TaylorPODA: A Taylor Expansion-Based Method to Improve Post-Hoc Attributions for Opaque Models

TaylorPODA:一种基于泰勒展开的方法,用于改进不透明模型的事后归因

Yuchi Tang, Iñaki Esnaola, George Panoutsos

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究针对不透明模型事后归因方法缺乏普遍标准的问题,提出基于泰勒展开框架的TaylorPODA方法,通过引入假设、分析矛盾、设计可控分配机制等,使其既满足假设又适应下游目标,提升了归因与用户定义效用的对齐及解释的可交流性。

Comments 21 pages, 4 figures. Submitted to TMLR. Re-upload with amended manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22669 2026-07-29 physics.chem-ph 版本更新 50%

DeepHartree: A Poisson-Coupled Neural Field for One-Shot Density Functional Theory

DeepHartree:一种与泊松方程耦合的神经场,用于可扩展的密度泛函理论

Jiankun Wu, Jinming Fan, Chao Qian, Shaodong Zhou

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DeepHartree通过与泊松方程耦合的神经场,加速了线性组合原子轨道密度泛函理论的SCF求解,解决了计算瓶颈问题,实现了跨基组和系统的零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2508.05899 2026-07-29 cs.CV cs.GR 版本更新 57%

HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing

HOLODECK 2.0:基于视觉-语言的3D世界生成与编辑

Zixuan Bian, Ruohan Ren, Yue Yang, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学) Cornell University(康奈尔大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 HOLODECK 2.0通过视觉-语言模型生成高质量3D场景并支持交互式编辑,提升游戏设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2601.02295 2026-07-29 cs.RO 版本更新 67%

CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding

CycleVLA: 通过子任务回溯和最小贝叶斯风险解码实现的前瞻性自修正视觉-语言-动作模型

Chenyang Ma, Kai Lu, Guangyu Yang, Jiuming Liu, Shitong Xu, Bill Byrne, Ioannis Havoutis, Niki Trigoni, Andrew Markham

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Engineering, University of Cambridge(剑桥大学工程系)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 CycleVLA通过子任务回溯和最小贝叶斯风险解码实现前瞻性自修正,提升视觉-语言-动作模型的故障预测与恢复能力

Comments Project Page: https://dannymcy.github.io/cyclevla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21409 2026-07-29 cs.RO 版本更新 50%

DSCD-Nav: Dual-Stance Cooperative Debate for Object Navigation

DSCD-Nav: 双视角协作辩论用于物体导航

Weitao An, Qi Liu, Chenghao Xu, Jiayi Chai, Xu Yang, Kun Wei, Cheng Deng

机构 * School of Electronic Engineering, Xidian University, Xi' an 710071, China.(西安电子科技大学电子工程学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 DSCD-Nav通过双视角协作辩论机制提升机器人在部分可观测环境中的导航可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 1 篇

2607.22205 2026-07-29 cs.CV cs.AI 版本更新 79%

Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs

推进前填充:能力差距驱动的场景专用遥感多模态大语言模型的训练后处理

Yuheng Zong, Minghua Wang, Xin Zhao, Zhi-Hui Zhan, Antonio Plaza, Jon Atli Benediktsson

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对地球观测应用中遥感多模态大语言模型因高质量数据稀缺和能力覆盖不完整难以实现细粒度场景专业化的问题,提出能力差距驱动的推进前填充(FBA)方法,经实验验证其效果优于其他方法,提升了模型在相关基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏