arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-20 至 2026-04-20 共收录 15 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 15 篇

2604.15495 2026-04-20 cs.AI cs.CV cs.HC cs.RO 84%

GIST: Multimodal Knowledge Extraction and Spatial Grounding via Intelligent Semantic Topology

GIST:通过智能语义拓扑进行多模态知识提取与空间定位

Shivendra Agrawal, Bradley Hayes

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 GIST通过智能语义拓扑提取多模态知识,构建语义标注的导航拓扑,实现复杂环境中的空间定位与人类-AI交互任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13660 2026-04-20 cs.CV 83%

VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection

VRAG-DFD: 可验证检索增强的基于大语言模型的深度伪造检测

Hui Han, Shunli Wang, Yandan Zhao, Taiping Yao, Shouhong Ding

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 视觉定位与Grounding :MLLM(title,abstract);分类 cs.CV

AI总结 本文提出VRAG-DFD框架,通过结合检索增强生成和强化学习,解决深度伪造检测中专业伪造知识不足的问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15663 2026-04-20 cs.SE cs.AI 81%

CodeMMR: Bridging Natural Language, Code, and Image for Unified Retrieval

CodeMMR:连接自然语言、代码和图像以实现统一检索

Jiahui Geng, Qing Li, Fengyu Cai, Fakhri Karray

机构 * MBZUAI Linköping University(林雪平大学) University of Groningen(格罗宁根大学) TU Darmstadt(图宾根大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.AI

AI总结 本文提出CodeMMR,通过指令式多模态对齐,将自然语言、代码和图像嵌入共享语义空间,实现跨模态和语言的强泛化,优于基线模型,并提升RAG中的代码生成精度与视觉 grounding。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15376 2026-04-20 cs.CV cs.AI 81%

Zoom Consistency: A Free Confidence Signal in Multi-Step Visual Grounding Pipelines

Zoom一致性:多步视觉定位流水线中的免费置信度信号

Keon Kim, Krish Chelikavada

机构 * Om Labs(Om实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出zoom一致性作为多步视觉定位流水线中的一种免费置信度信号,通过几何量在共享坐标空间中的比较,提升不同架构VLMs的预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05547 2026-04-20 cs.CV cs.AI 81%

VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck

VIB-Probe:通过变分信息瓶颈检测和缓解视觉-语言模型中的幻觉

Feiran Zhang, Yixin Wu, Zhenghua Wang, Xiaohua Wang, Changze Lv, Xuanjing Huang, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院,上海,中国) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理重点实验室)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VIB-Probe框架,通过变分信息瓶颈理论检测和缓解视觉-语言模型中的幻觉,利用注意力头提取判别模式并过滤语义噪声,实验表明其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13590 2026-04-20 eess.IV cs.AI cs.CV 81%

Intelligent Healthcare Imaging Platform: A VLM-Based Framework for Automated Medical Image Analysis and Clinical Report Generation

智能医疗影像平台:基于视觉语言模型的自动化医学图像分析与临床报告生成框架

Samer Al-Hamadani

机构 * Automated Manufacturing Department/Al-Khwarizmi College of Engineering/ University of Baghdad/Gilgamesh University(自动化制造部门/阿尔·卡瓦尔齐米工程学院/巴格达大学/吉尔伽美什大学)

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于视觉语言模型的智能多模态框架,用于自动化医学图像分析和临床报告生成,结合视觉特征提取与自然语言处理,实现上下文图像解释,并通过多层可视化技术提升临床信心。

Comments 32 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15756 2026-04-20 cs.CL cs.CV 79%

TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models

TTL: 用于基于预训练视觉-语言模型的分布外检测的测试时文本学习

Jinlun Ye, Jiang Liao, Runhe Lai, Xinhua Lu, Jiaxin Zhuang, Zhiyong Gan, Ruixuan Wang

机构 * Sun Yat-sen University(中山大学) China United Network Communications Corporation Limited Guangdong Branch(中国联合网络通信集团有限公司广东分公司) Peng Cheng Laboratory(鹏城实验室) Hong Kong University of Science and Technology(香港科技大学) Key Laboratory of Machine Intelligence and Advanced Computing, MOE(教育部机器智能与高级计算重点实验室)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出TTL框架,通过动态学习测试流中的分布外文本语义提升测试时分布外检测性能,实验表明其在多个基准上均取得最优效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08809 2026-04-20 cs.LG stat.AP 70%

Structural Evaluation Metrics for SVG Generation via Leave-One-Out Analysis

通过留一验证分析评估SVG生成的结构评价指标

Haonan Zhu, Adrienne Deganutti, Elad Hirsch, Purvanshi Mehta

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出基于留一验证分析的元素级评估方法,用于评估SVG生成的结构特性,引入四个结构性指标并验证其在多个生成系统中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15736 2026-04-20 cs.CV cs.CL 70%

RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees

RefereeBench: 视频多模态大语言模型是否准备好成为多项目裁判

Yichen Xu, Yuanhang Liu, Chuhan Wang, Zihan Zhao, jinghan luo, Jianzhe Ma, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Sichuan University(四川大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出RefereeBench,首个评估多模态大语言模型作为自动体育裁判的基准,通过11项运动925个视频和6475对问答,评估犯规存在、分类、推理、实体感知和时间定位能力,发现当前模型在规则应用和时间定位上表现不足。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15972 2026-04-20 cs.CV cs.AI 62%

When Cultures Meet: Multicultural Text-to-Image Generation

当文化相遇:多文化文本到图像生成

Parth Bhalerao, Mounika Yalamarty, Brian Trinh, Oana Ignat

机构 * Santa Clara University(圣克拉拉大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出多文化文本到图像生成任务,构建首个评估基准,分析先进模型在多文化场景下的表现,提出MosAIG框架提升图像生成质量与文化准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16004 2026-04-20 cs.CL cs.AI 57%

AgentV-RL: Scaling Reward Modeling with Agentic Verifier

AgentV-RL: 通过代理验证器扩展奖励建模

Jiazheng Zhang, Ziche Fu, Zhiheng Xi, Wenqing Jing, Mingxu Chai, Wei He, Guoqiang Zhang, Chenghao Fan, Chenxin An, Wenxiang Chen, Zhicheng Liu, Haojie Pan, Dingwei Zhu, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Agentic Verifier框架,通过多轮工具增强的反思过程提升奖励建模效果,实验显示其在并行和顺序TTS任务中表现优异,4B变体超越现有最优ORMs 25.2%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15946 2026-04-20 cs.CV cs.RO 57%

SENSE: Stereo OpEN Vocabulary SEmantic Segmentation

SENSE:立体视图开放词汇语义分割

Thomas Campagnolo, Ezio Malis, Philippe Martinet, Gaétan Bahl

机构 * Centre Inria d’Universite Cote d’Azur, France(法国里莫纳大学信息科学研究中心) NXP Semiconductors, France(法国恩智科半导体公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SENSE,通过立体视觉与视觉语言模型提升开放词汇语义分割的精度,实验显示在PhraseStereo数据集上平均精度提升2.9%,并在Cityscapes和KITTI上取得更好的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05722 2026-04-20 cs.LG physics.chem-ph 57%

Teaching Language Models Mechanistic Explainability Through MechSMILES

通过MechSMILES教会语言模型机制性可解释性

Théo A. Neukomm, Zlatko Jončev, Philippe Schwaller

机构 * Laboratory of Artificial Chemical Intelligence (LIAC), Institut des Sciences et Ingénierie Chimiques, Ecole Polytechnique Fédérale de Lausanne (EPFL), Lausanne 1015, Switzerland(人工化学智能实验室(LIAC)、化学与工程学院、瑞士联邦理工学院(EPFL)、拉沃斯纳1015号)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出MechSMILES框架,通过箭头推导法教会语言模型预测化学反应机制,实现了反应路径验证、原子映射和催化剂识别等能力,展示了在复杂机制预测任务中的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08480 2026-04-20 cs.CV 57%

Video-STAR: Reinforcing Open-Vocabulary Action Recognition with Tools

Video-STAR: 通过工具强化开放词汇动作识别

Zhenlong Yuan, Xiangyan Qu, Chengxuan Qian, Rui Chen, Jing Tang, Lei Sun, Xiangxiang Chu, Dapeng Zhang, Yiwei Wang, Yujun Cai, Shuo Li

机构 * AMAP, Alibaba Group(阿里集团AMAP) University of California at Merced(加州大学默塞德分校) University of Queensland(昆士兰大学) Case Western Reserve University(凯斯西储大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 Video-STAR通过结合上下文子动作分解与工具增强强化学习,提升开放词汇动作识别的细粒度匹配与跨模态推理能力,有效减少跨模态幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09033 2026-04-20 cs.CL 50%

Do LLMs Really Know What They Don't Know? Internal States Mainly Reflect Knowledge Recall Rather Than Truthfulness

大语言模型真的了解它们不知道的东西吗?内部状态主要反映知识回忆而非真实性

Chi Seng Cheang, Hou Pong Chan, Wenxuan Zhang, Yang Deng

机构 * Singapore Management University(新加坡国立管理学院) DAMO Academy, Alibaba Group(阿里集团达摩院) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨大语言模型是否真正了解其未知领域,通过分析内部状态发现其主要反映知识回忆而非真实性,提出hallucination分类方法以区分不同hallucination类型。

详情

展开后加载摘要…

URL PDF HTML 收藏