arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-25 至 2026-03-25 共收录 19 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 19 篇

2603.22763 2026-03-25 cs.CV 85%

ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding

ENC-Bench:用于评估多模态大语言模型在电子航海图理解中的基准

Ao Cheng, Xingming Li, Xuanyu Ji, Xixiang He, Qiyao Sun, Chunping Qiu, Runke Huang, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) Intelligent Game and Decision Lab(智能游戏与决策实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);InternVL(abstract);grounding(abstract);分类 cs.CV

AI总结 ENC-Bench是首个专注于专业电子航海图理解的基准,包含20490个经过专家验证的样本,评估了10种先进多模态大语言模型在符号识别、空间推理和航海决策中的表现,揭示了模型在符号 grounding、空间计算和多约束推理方面的系统性挑战。

Comments Accepted to CVPR 2026, Project page: https://qingyonghu.github.io/ENC-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01047 2026-03-25 cs.CV cs.AI 84%

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

残差解码:通过历史感知残差引导减轻大视觉-语言模型中的幻觉

Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

机构 * Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出残差解码方法,通过利用历史信息辅助解码,纠正大视觉-语言模型中的语言先验偏差,有效抑制幻觉并提升视觉接地能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26865 2026-03-25 cs.CV cs.AI 84%

Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench

视觉语言模型能否胜任?通过MeasureBench评估视觉测量阅读

Fenfen Lin, Yesheng Liu, Haiyu Xu, Chen Yue, Zheqi He, Mingxuan Zhao, Miguel Hu Chen, Jiakang Liu, JG Yao, Xi Yang

机构 * BAAI FlagEval Team(BAAI FlagEval团队)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MeasureBench基准测试,评估视觉语言模型在测量阅读任务中的表现,发现即使最强模型也难以处理,通过强化微调提升性能,揭示了当前模型在细粒度空间定位上的局限。

Comments Project page: https://flageval-baai.github.io/MeasureBenchPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23478 2026-03-25 cs.CV 83%

UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation

UniFunc3D: 统一的主动空间-时间接地用于3D功能分割

Jiaying Lin, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 UniFunc3D通过统一框架实现3D场景功能分割,利用多模态大语言模型作为主动观察者,结合语义、时间和空间推理,提升任务分解的准确性与效率,实现优于其他方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02505 2026-03-25 cs.CV 83%

GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding

GeoDiT:一种基于扩散的视觉-语言模型,用于地理空间理解

Jiaqi Liu, Ronghao Fu, Haoran Liu, Lang Sun, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, Changchun 130012, China(吉林大学计算机科学与技术学院,长春 130012,中国) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出GeoDiT,一种基于扩散的视觉-语言模型,用于地理空间理解。该模型通过并行细化过程实现整体粗到细的合成,解决了传统自回归模型在结构化输出生成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22706 2026-03-25 cs.CV cs.SE 77%

How Far Can VLMs Go for Visual Bug Detection? Studying 19,738 Keyframes from 41 Hours of Gameplay Videos

VLMs在视觉缺陷检测中能走多远?研究41小时游戏录像中的19,738个关键帧

Wentao Lu, Alexander Senchenko, Alan Sayle, Abram Hindle, Cor-Paul Bezemer

机构 * University of Alberta(阿尔伯塔大学)

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 研究通过分析41小时游戏录像中的19,738个关键帧,评估VLMs在实际场景中检测视觉缺陷的能力,发现其性能有限,需结合混合方法提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22892 2026-03-25 cs.LG 70%

VLGOR: Visual-Language Knowledge Guided Offline Reinforcement Learning for Generalizable Agents

VLGOR:基于视觉-语言知识的离线强化学习用于通用智能体

Pengsen Liu, Maosen Zeng, Nan Tang, Kaiyuan Li, Jing-Cheng Pang, Yunan Liu, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China \& School of Artificial Intelligence, Nanjing University, China Computational Intelligence Center (CIC), School of Computer Artificial Intelligence, Shandong Jianzhu University, Jinan, 250101, China

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.LG

AI总结 本文提出VLGOR框架,结合视觉和语言知识生成虚拟轨迹,提升智能体在未见任务中的泛化能力,实验显示其性能比基线方法高24%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22985 2026-03-25 cs.CL cs.CY 67%

Beyond Hate: Differentiating Uncivil and Intolerant Speech in Multimodal Content Moderation

超越仇恨:区分多模态内容审核中的不文明与不宽容言论

Nils A. Herrmann, Tobias Eder, Jingyi He, Georg Groh

专题命中 视觉定位与Grounding :vision-language model(abstract);LLaVA(abstract)

AI总结 本文提出细粒度标注方案区分不文明与不宽容言论,通过2030个仇恨漫画数据验证,细粒度标注提升模型性能,减少有害内容误判。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23030 2026-03-25 cs.CV cs.AI 62%

Looking Beyond the Window: Global-Local Aligned CLIP for Training-free Open-Vocabulary Semantic Segmentation

超越窗口:用于无训练开放词汇语义分割的全局-局部对齐CLIP

ByeongCheol Lee, Hyun Seok Seong, Sangeek Hyun, Gilhan Park, WonJun Moon, Jae-Pil Heo

机构 * Sungkyunkwan University(全北大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GLA-CLIP框架,通过增强窗口间信息交换解决传统滑动窗口方法的语义不一致问题,引入代理锚点和动态归一化方案提升小目标检测性能。

Comments 18 pages, 13 figures, 12 tables, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22317 2026-03-25 cs.LG cs.AI 62%

Geometric Mixture-of-Experts with Curvature-Guided Adaptive Routing for Graph Representation Learning

具有曲率引导自适应路由的几何混合专家用于图表示学习

Haifang Cao, Yu Wang, Timing Li, Xinjie Yao, Pengfei Zhu

机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(智能与计算学院,天津大学,天津,中国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GeoMoE框架,通过Ollivier-Ricci曲率指导的自适应路由融合不同黎曼空间的节点表示,提升多尺度拓扑结构的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17908 2026-03-25 cs.CL cs.AI cs.IR 57%

Principled Context Engineering for RAG: Statistical Guarantees via Conformal Prediction

基于RAG的原理化上下文工程:通过符合预测实现统计保证

Debashish Chakraborty, Eugene Yang, Daniel Khashabi, Dawn Lawrie, Kevin Duh

机构 * HLTCOE, Johns Hopkins University(HLTCOE,约翰霍普金斯大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出通过符合预测框架实现RAG的上下文工程,通过统计可控的过滤方法减少冗余上下文,提升事实准确性。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23126 2026-03-25 cs.CV 57%

3rd Place of MeViS-Audio Track of the 5th PVUW: VIRST-Audio

第5届PVUW比赛MeViS-Audio赛道的第三名:VIRST-Audio

Jihwan Hong, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出VIRST-Audio框架,通过将音频转换为文本并基于文本进行分割,实现音频驱动的视频对象分割,实验表明其在MeViS-Audio赛道上取得第三名,展示了良好的泛化能力和稳定性。

Comments 4 pages, 2 figures. Technical report for the CVPR 2026 PVUW Workshop (MeViS-Audio Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07990 2026-03-25 cs.LG 57%

MJ1: Multimodal Judgment via Grounded Verification

MJ1: 通过 grounded 验证实现多模态判断

Bhavesh Kumar, Dylan Feng, Leonard Tang

机构 * Haize Labs(哈泽实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 MJ1 通过结构化 grounded 验证链和反事实一致性奖励提升多模态判断准确性,训练后在 MMRB2 数据集上达到 77.0% 准确率,超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18933 2026-03-25 cs.CV cs.RO 57%

Point What You Mean: Visually Grounded Instruction Policy

指出你的意图:基于视觉的指令策略

Hang Yu, Juntu Zhao, Yufeng Liu, Kaiyu Li, Cheng Ma, Di Zhang, Yingdong Hu, Guang Chen, Junyuan Xie, Junliang Guo, Junqiao Zhao, Yang Gao

机构 * Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Spirit AI Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出Point-VLA,通过结合视觉提示提升物体指称能力,在复杂场景中实现更精准的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22289 2026-03-25 cs.CL cs.AI 57%

MERIT: Memory-Enhanced Retrieval for Interpretable Knowledge Tracing

MERIT: 用于可解释知识追踪的记忆增强检索

Runze Li, Kedi Chen, Guwei Feng, Mo Yu, Jun Wang, Wei Zhang

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) Shanghai Innovation Institute(上海创新研究院) WeChat AI, Tencent(微信AI,腾讯)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 MERIT提出一种无需训练的框架,结合冻结LLM推理与结构化教学记忆,通过语义去噪将学生分类为潜在认知模式,并构建模式库生成显式推理依据,提升教育诊断的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23013 2026-03-25 cs.CL 50%

Knowledge Access Beats Model Size: Memory Augmented Routing for Persistent AI Agents

知识访问胜过模型规模:基于对话记忆的持久AI代理路由

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

机构 * vLLM Semantic Router Project(vLLM语义路由器项目) MBZUAI McGill University(麦吉尔大学) Mila AMD Red Hat(红帽)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出利用对话记忆提升AI代理效率,通过轻量模型结合检索信息,使小模型在用户特定查询中表现优于大模型,证明知识访问比模型规模更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22704 2026-03-25 cs.CL 50%

Synthetic or Authentic? Building Mental Patient Simulators from Longitudinal Evidence

合成还是真实?从纵向证据构建心理健康患者模拟器

Baihan Li, Bingrui Jin, Kunyao Lan, Ming Wang, Mengyue Wu

机构 * SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院) X-LANCE Lab(X-LANCE实验室) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出DEPROFILE框架,通过整合多源数据构建统一患者档案,提升对话真实性和行为多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21898 2026-03-25 cs.HC 50%

From Scores to Strategies: Towards Gaze-Informed Diagnostic Assessment for Visualization Literacy

从分数到策略:面向可视化素养的凝视引导诊断评估

Kathrin Schnizer

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出通过凝视数据补充传统测试,以更全面评估读者在可视化信息处理中的认知负荷和策略差异,推动评估从二元分类向精细化描述转变。

Comments 4 pages, Workshop on Data Literacy for the 21st Century at CHI 2026, April 26, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14425 2026-03-25 cs.DB 50%

Time and Relations into Focus: Ontological Foundations of Object-Centric Event Data

时间与关系聚焦:对象导向事件数据的本体论基础

Hosna Hooshyar, Mattia Fumagalli, Marco Montali, Giancarlo Guizzardi

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于本体论的对象导向事件数据模型,通过三步方法解决现有模型在时间与动态关系方面的不足,增强表达能力与清晰度。

详情

展开后加载摘要…

URL PDF HTML 收藏