arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-23 至 2026-02-23 共收录 26 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2602.17871 2026-02-23 cs.CV cs.AI cs.LG cs.MM 87%

Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models

理解视觉语言模型的细粒度知识能力

Dhruba Ghosh, Yuhui Zhang, Ludwig Schmidt

机构 * Stanford University(斯坦福大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究了视觉语言模型在细粒度知识任务中的表现,发现更好的语言模型和视觉编码器对细粒度分类性能有显著影响,预训练阶段也至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17689 2026-02-23 cs.LG cs.AI cs.CL cs.CV 75%

Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction

具有领域不变多模态掩码重建的医学视觉-语言模型鲁棒预训练

Melika Filvantorkaman, Mohsen Piri

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Robust-MMR框架,通过显式建模鲁棒性提升医学视觉-语言模型在跨领域和扰动下的表现,实现更可靠的医疗应用。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14201 2026-02-23 cs.CV cs.AI 62%

GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery

GeoEyes: 面向超高清遥感影像证据驱动理解的按需视觉聚焦

Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yifan Zhang, Long Lan, Xue Yang, Hongda Sun, Yulin Wang, Di Wang, Jun Song, Jing Zhang, Bo Du

机构 * National University of Defense Technology, China(国防科技大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) University of the Chinese Academy of Sciences, China(中国科学院大学) Shanghai Jiao Tong University, China(上海交通大学) Wuhan University, China(武汉大学) Chinese Academy of Science, China(中国科学院) Tsinghua University, China(清华大学) Renmin University of China, China(中国人民大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 GeoEyes通过分阶段训练框架,结合冷启动数据集和代理强化学习方法,解决超高清遥感影像中证据获取不足的问题,提升视觉问答任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13662 2026-02-23 cs.CV cs.AI 62%

LeafNet: A Large-Scale Dataset and Comprehensive Benchmark for Foundational Vision-Language Understanding of Plant Diseases

LeafNet:一个大规模数据集和全面基准,用于植物病害的基础视觉-语言理解

Khang Nguyen Quoc, Phuong D. Dao, Luyl-Da Quach

机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) Department of Integrative Biology, The University of Texas at Austin(德克萨斯大学奥斯汀分校整合生物学系) Department of Software Engineering, FPT University(FPT大学软件工程系)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 LeafNet通过大规模多模态数据集和基准测试,揭示了VLMs在植物疾病理解中的性能差异,强调了多模态架构在提升诊断精度中的关键作用。

Comments 26 pages, 13 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 3 篇

2602.18374 2026-02-23 cs.RO cs.AI 70%

Zero-shot Interactive Perception

零样本交互感知

Venkatesh Sripada, Frank Guerin, Amir Ghalamzan

机构 * University of Surrey(萨里大学) University of Sheffield(谢菲尔德大学)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.AI

AI总结 ZS-IP通过结合多策略操作与基于记忆的视觉语言模型,实现零样本交互感知,提升复杂场景中推操作的性能。

Comments Original manuscript submitted on April 24, 2025. Timestamped and publicly available on OpenReview: https://openreview.net/forum?id=7MhpFcr5Nx

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15605 2026-02-23 cs.CV 57%

GIFT: A Framework Towards Global Interpretable Faithful Textual Explanations of Vision Classifiers

GIFT: 一种面向视觉分类器全局可解释忠实文本解释的框架

Éloi Zablocki, Valentin Gerard, Amaia Cardiel, Eric Gaussier, Matthieu Cord, Eduardo Valle

机构 * Université Grenoble Alpes(法国格勒诺布尔大学) Sorbonne Université(巴黎索邦大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 GIFT提出一种框架,通过生成局部反事实并转化为文本解释,实现视觉分类器的全局可解释和忠实性。

Comments TMLR 2026 (featured certification)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08364 2026-02-23 cs.CL 50%

Structure-Augmented Reasoning Generation

结构增强的推理生成

Jash Rajesh Parekh, Pengcheng Jiang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉推理 :grounding(abstract)

AI总结 结构增强的推理生成通过显式推理结构提升多跳查询的准确性和连贯性,兼容现有RAG流程,无需定制检索器或微调。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 9 篇

2602.17826 2026-02-23 cs.AI cs.LG cs.SC 81%

Ontology-Guided Neuro-Symbolic Inference: Grounding Language Models with Mathematical Domain Knowledge

本体引导的神经符号推理:通过数学领域知识 grounding 语言模型

Marcelo Labre

机构 * Advanced Institute for Artificial Intelligence (AI2)(人工智能研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过引入形式化数学本体,提升语言模型在数学推理任务中的可靠性,验证了神经符号方法在增强形式化 grounding 方面的潜力与挑战。

Comments Submitted to NeuS 2026. Supplementary materials and code: https://doi.org/10.5281/zenodo.18665030

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18031 2026-02-23 cs.CV cs.AI cs.LG 78%

ViGText: Deepfake Image Detection with Vision-Language Model Explanations and Graph Neural Networks

ViGText: 基于视觉-语言模型解释和图神经网络的深度伪造图像检测

Ahmad ALBarqawi, Mahmoud Nazzal, Issa Khalil, Abdallah Khreishah, NhatHai Phan

机构 * New Jersey Institute of Technology(新泽西理工学院) Old Dominion University(旧 Dominion 大学)

专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

AI总结 ViGText结合视觉-语言模型解释和图神经网络,提升深度伪造检测的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17677 2026-02-23 cs.LG cs.CL cs.RO 77%

Reducing Text Bias in Synthetically Generated MCQAs for VLMs in Autonomous Driving

减少自动驾驶VLMs中合成生成MCQA的文本偏差

Sutej Kulgod, Sean Ye, Sanchit Tanwar, Christoffer Heckman

机构 * Zoox, Inc.(Zoox公司)

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);grounding(abstract);分类 cs.LG

AI总结 本文提出方法减少自动驾驶VLMs中合成生成MCQA的文本偏差,通过解耦正确答案与语言痕迹并采用课程学习策略,使模型依赖视觉基础以提升感知理解能力。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10164 2026-02-23 cs.AI cs.SC 57%

Two Constraint Compilation Methods for Lifted Planning

用于提升规划的两种约束编译方法

Periklis Mantenoglou, Luigi Bonassi, Enrico Scala, Pedro Zuidberg Dos Martires

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出两种无需地面化的约束编译方法,用于提升大规模规划问题的效率和规范简洁性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17913 2026-02-23 cs.DB cs.AI 57%

From Lossy to Verified: A Provenance-Aware Tiered Memory for Agents

从损失到验证:一种面向代理的分层内存

Qiming Zhu, Shunian Chen, Rui Yu, Zhehao Wu, Benyou Wang

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 TierMem 提出了一种面向代理的分层内存框架,通过双层内存结构在推理时分配证据,以降低 token 消耗和延迟,提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17799 2026-02-23 cs.CV 57%

Enabling Training-Free Text-Based Remote Sensing Segmentation

无需训练的基于文本的遥感分割

Jose Sosa, Danila Rukhovich, Anis Kacem, Djamila Aouada

机构 * SnT, University of Luxembourg(SnT,卢森堡大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 本研究提出无需额外训练的遥感分割方法,结合对比和生成型VLMs与SAM,实现零样本开放词汇语义分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18203 2026-02-23 q-bio.BM 50%

Metrology of Complexity and Implications for the Study of the Emergence of Life

复杂性的计量及其对生命起源研究的启示

Sara Imari Walker

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出通过分子组装理论测量分子复杂性,以研究生命起源的物理机制,并推动跨学科的统一研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16206 2026-02-23 cs.HC 50%

The Agony of Opacity: Foundations for Reflective Interpretability in AI-Mediated Mental Health Support

透明的痛苦:面向人工智能辅助心理健康支持的反思可解释性基础

Sachin R. Pendse, Darren Gergle, Rachel Kornfield, Kaylee Kruzan, David Mohr, Jessica Schleider, Jina Suh, Annie Wescott, Jonah Meyerhoff

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种面向人工智能辅助心理健康支持的反思可解释性方法,旨在提升用户对模型输出的理解和自主性,以应对严重心理困扰的特殊需求。

Comments Accepted to IASEAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18145 2026-02-23 cs.CL 50%

Detecting Contextual Hallucinations in LLMs with Frequency-Aware Attention

基于频率感知注意力的LLM幻觉检测

Siya Qi, Yudong Chen, Runcong Zhao, Qinglin Zhu, Zhanghao Hu, Wei Liu, Yulan He, Zheng Yuan, Lin Gui

机构 * Department of Informatics, King's College London, UK(伦敦国王学院信息学院) Department of Statistics, University of Warwick, UK(沃里克大学统计系) School of Computer Science, The University of Sheffield, UK(谢菲尔德大学计算机科学学院) The Alan Turing Institute, UK(艾伦·图灵研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种基于频率感知注意力的轻量级幻觉检测方法,通过分析生成过程中注意力的高频成分,有效识别幻觉token,提升了LLM在上下文生成中的可靠性。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 1 篇

2602.18424 2026-02-23 cs.CV cs.RO 83%

CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation

CapNav:基于能力条件的室内导航基准测试

Xia Su, Ruiqi Chen, Benlin Liu, Jingwei Ma, Zonglin Di, Ranjay Krishna, Jon Froehlich

专题命中 GUI与屏幕智能体 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 CapNav基准测试评估VLMs在不同移动约束下室内导航能力,发现其性能随约束增加而下降,且先进模型仍难以处理空间推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 1 篇

2602.18055 2026-02-23 cs.LG 57%

Continual-NExT: A Unified Comprehension And Generation Continual Learning Framework

Continual-NExT: 一种统一的理解和生成持续学习框架

Jingyang Qiao, Zhizhong Zhang, Xin Tan, Jingyu Gong, Yanyun Qu, Yuan Xie

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xiamen University(厦门大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.LG

AI总结 本文提出Continual-NExT框架,通过MAGE方法提升双到双多模态大语言模型的持续学习能力,实现跨模态知识转移和减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 5 篇

2602.18010 2026-02-23 cs.SD 82%

Scaling Audio-Text Retrieval with Multimodal Large Language Models

通过多模态大语言模型扩展音频-文本检索

Jilan Xu, Carl Thomé, Danijela Horak, Weidi Xie, Andrew Zisserman

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Epidemic Sound School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract)

AI总结 AuroLA通过多模态大语言模型实现音频-文本检索的扩展,利用可扩展的数据管道和混合NCE损失提升检索性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18612 2026-02-23 cs.CV 70%

Mod-Adapter: Tuning-Free and Versatile Multi-concept Personalization via Modulation Adapter

Mod-Adapter:通过调制适配器实现无需微调的多概念个性化

Weizhi Zhong, Huan Yang, Zheng Liu, Huiguo He, Zijian He, Xuesong Niu, Di Zhang, Guanbin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Kolors Team, Kuaishou Technology(快手科技Kolors团队) Shenzhen Loop Area Institute, Shenzhen, China(深圳循环区研究所) Guangdong Key Laboratory of Big Data Analysis and Processing, Guangzhou, China(广东大数据分析与处理重点实验室) South China University of Technology, Guangzhou, China(华南理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出Mod-Adapter方法,通过调制适配器实现无需微调的多概念个性化,有效定制物体和抽象概念,提升生成质量。

Comments Accepted by ICLR 2026, project page: https://weizhi-zhong.github.io/Mod-Adapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00319 2026-02-23 cs.RO 67%

When Digital Twins Meet Large Language Models: Realistic, Interactive, and Editable Simulation for Autonomous Driving

当数字孪生遇见大语言模型:用于自动驾驶的逼真、交互和可编辑的模拟

Tanmay Vilas Samak, Chinmay Vilas Samak, Bing Li, Venkat Krovi

机构 * Department of Automotive Engineering, Clemson University International Center for Automotive Research (CU-ICAR)(汽车工程系,克莱姆森大学国际汽车研究中心(CU-ICAR))

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract)

AI总结 本文提出结合数字孪生与大语言模型的框架,实现自动驾驶场景的逼真、交互和可编辑模拟,提升自动驾驶研究的效率和真实性。

Comments Accepted in IEEE Robotics & Automation Magazine (RAM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18019 2026-02-23 cs.CV cs.AI 62%

DeepSVU: Towards In-depth Security-oriented Video Understanding via Unified Physical-world Regularized MoE

DeepSVU: 向深入的安全导向视频理解迈进:通过统一的物理世界正则化MoE

Yujie Jin, Wenxin Zhang, Jingjing Wang, Guodong Zhou

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DeepSVU任务,通过统一物理世界正则化MoE方法,提升视频中威胁的识别、归因和评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17770 2026-02-23 cs.CV cs.LG 62%

CLUTCH: Contextualized Language model for Unlocking Text-Conditioned Hand motion modelling in the wild

CLUTCH:解锁野外文本条件手部运动建模的上下文化语言模型

Balamurugan Thambiraja, Omid Taheri, Radek Danecek, Giorgio Becherini, Gerard Pons-Moll, Justus Thies

机构 * Technical University of Darmstadt(德累斯顿技术大学) Max-Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tuebingen(图宾根大学) Tubingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 CLUTCH通过引入3D-HIW数据集和SHIFT架构,提出基于LLM的手部动画系统,提升野外手部运动建模的保真度与泛化能力。

Comments ICLR2026; Project page: https://balamuruganthambiraja.github.io/CLUTCH/

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他VLM 3 篇

2602.17869 2026-02-23 cs.CV 70%

Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models

学习紧凑的视频表示以在大规模多模态模型中实现高效的长视频理解

Yuxiao Chen, Jue Wang, Zhikang Zhang, Jingru Yi, Xu Zhang, Yang Zou, Zhaowei Cai, Jianbo Yuan, Xinyu Li, Hao Yang, Davide Modolo

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出了一种端到端的长视频理解框架,结合自适应视频采样器和空间时间视频压缩器,以高效处理长视频的冗余问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18262 2026-02-23 cs.CL cs.AI cs.LG 62%

Simplifying Outcomes of Language Model Component Analyses with ELIA

用ELIA简化语言模型组件分析的结果

Aaron Louis Eidt, Nils Feldhus

机构 * Technische Universität Berlin(柏林技术大学) Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫茨研究所) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 ELIA通过交互式界面和AI生成的自然语言解释,简化了语言模型组件分析,帮助非专家理解复杂模型。

Comments EACL 2026 System Demonstrations. GitHub: https://github.com/aaron0eidt/ELIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04587 2026-02-23 cs.CL cs.AI cs.CY 57%

VILLAIN at AVerImaTeC: Verifying Image-Text Claims via Multi-Agent Collaboration

VILLAIN 在 AVerImaTeC 上:通过多智能体协作验证图像-文本声明

Jaeyoon Jung, Yejun Yoon, Kunwoo Park

机构 * School of AI Convergence, Soongsil University(人工智能融合学院,顺世大学) MAUM AI Inc.(MAUM人工智能公司) Department of Intelligent Semiconductors, Soongsil University(智能半导体系,顺世大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 VILLAIN 通过多智能体协作验证图像-文本声明,实现事实核查系统的高效准确验证。

Comments A system description paper for the AVerImaTeC shared task at the Ninth FEVER Workshop (co-located with EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏