arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-20 至 2026-03-20 共收录 20 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 20 篇

2603.18988 2026-03-20 cs.RO 89%

MERGE: Guided Vision-Language Models for Multi-Actor Event Reasoning and Grounding in Human-Robot Interaction

MERGE:面向人类机器人交互中多主体事件推理与 grounding 的引导视觉-语言模型

Joerg Deigmoeller, Nakul Agarwal, Stephan Hasler, Daniel Tanneberg, Anna Belardinelli, Reza Ghoddoosian, Chao Wang, Felix Ocker, Fan Zhang, Behzad Dariush, Michael Gienger

机构 * Honda Research Institute Europe(本田欧洲研究院) Honda Research Institute USA(本田美国研究院)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract)

AI总结 MERGE 通过引导视觉语言模型实现动态人类机器人交互中多主体事件的推理与 grounding,提升 situational awareness 与效率,基于 GROUND 数据集验证其性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19166 2026-03-20 cs.RO cs.AI cs.CL cs.CV cs.LG 87%

Meanings and Measurements: Multi-Agent Probabilistic Grounding for Vision-Language Navigation

含义与测量:多智能体概率性视觉语言导航

Swagat Padhan, Lakshya Jain, Bhavya Minesh Shah, Omkar Patil, Thao Nguyen, Nakul Gopalan

机构 * Arizona State University(亚利桑那州立大学) Haverford College(哈弗福德学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出MAPG框架,通过分解语言查询并利用VLM进行语义 grounding,解决复杂度量-语义语言查询的难题,同时引入MAPG-Bench评估指标,展示在现实机器人中的应用效果。

Comments Equal contribution: Swagat Padhan and Lakshya Jain, 9 pages, 6 figures, paper website: https://lakshya-asu.github.io/Meanings-Measurements-Multi-Agent-Probabilistic-Grounding/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18210 2026-03-20 cs.RO 82%

GoalVLM: VLM-driven Object Goal Navigation for Multi-Agent System

GoalVLM: 多智能体系统中基于视觉语言模型的目标导航

MoniJesu James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

机构 * Intelligent Space Robotics Laboratory(智能空间机器人实验室) Center for Digital Engineering(数字工程中心) Skolkovo Institute of Science and Technology(斯克尔科夫科学与技术研究所)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract)

AI总结 本文提出GoalVLM,一种基于视觉语言模型的多智能体零样本开放词汇目标导航框架,通过整合SAM3和SpaceOM实现语义优先级探索,无需重新训练即可完成复杂目标导航任务。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19026 2026-03-20 cs.CV 79%

Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token

重新思考MLLM本身作为分割器:仅用一个分割标记

Anqi Zhang, Xiaokang Ji, Guangyu Gao, Jianbo Jiao, Chi Harold Liu, Yunchao Wei

机构 * Beijing Institute of Technology(北京理工大学) University of Birmingham(伯明翰大学) Beijing Jiaotong University(北京交通大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视觉定位与Grounding :MLLM(title,abstract);分类 cs.CV

AI总结 本文提出SELF1E方法,通过保留原始图像分辨率并利用残差特征提升分割精度,无需外部解码器即可实现与专业解码器相当的分割性能。

Comments Paper is accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18453 2026-03-20 cs.CV 79%

Learning Consistent Temporal Grounding between Related Tasks in Sports Coaching

在体育指导中学习相关任务之间的一致时间定位

Arushi Rai, Adriana Kovashka

机构 * University of Pittsburgh, Pittsburgh PA 15260, USA(匹兹堡大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出通过自一致性目标改进时间定位,利用相关任务共享帧的关注机制,在三个体育指导任务中提升准确率和BERTScore。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18627 2026-03-20 cs.AI 77%

Agentic Flow Steering and Parallel Rollout Search for Spatially Grounded Text-to-Image Generation

代理流引导与并行展开搜索用于空间感知的文本到图像生成

Ping Chen, Daoxuan Zhang, Xiangming Wang, Yungeng Liu, Haijin Zeng, Yongyong Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出AFS-Search框架,通过闭合环路机制和空间感知引导提升文本到图像生成的精度与效率,实现性能和速度的双重优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18579 2026-03-20 cs.CL cs.AI cs.LG 76%

ICE: Intervention-Consistent Explanation Evaluation with Statistical Grounding for LLMs

ICE:基于统计基础的LLM干预一致解释评估

Abhinaba Basu, Pavan Chakraborty

机构 * Indian Institute of Information Technology, Allahabad(印度阿勒颇信息学院) National Institute of Electronics and Information Technology(电子与信息技术国家研究院)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 本文提出ICE框架,通过多干预操作比较解释与随机基线,发现解释一致性依赖于干预操作,且不同语言模型在不同任务上的表现存在显著差异,揭示了模型与语言之间的复杂交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19209 2026-03-20 cs.CV cs.LG 74%

Do VLMs Need Vision Transformers? Evaluating State Space Models as Vision Encoders

视觉语言模型需要视觉变换器吗?评估状态空间模型作为视觉编码器

Shang-Jui Ray Kuo, Paola Cascante-Bonilla

机构 * Stony Brook University(石英 Brook 大学)

专题命中 视觉定位与Grounding :VLM(abstract,comments);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文评估了状态空间模型作为视觉编码器在视觉语言模型中的有效性,发现其在VQA和定位任务中表现优异,并提出稳定策略提升鲁棒性。

Comments Project page: https://lab-spell.github.io/vlm-ssm-vision-encoders/ ; Code: https://github.com/raykuo18/vlm-ssm-vision-encoders

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15888 2026-03-20 cs.AI cs.CV cs.RO 73%

AsgardBench -- Evaluating Visually Grounded Interactive Planning Under Minimal Feedback

AsgardBench -- 评估基于视觉的交互式规划在最小反馈下的表现

Andrea Tupini, Lars Liden, Reuben Tan, Yu Wang, Jianfeng Gao

机构 * Microsoft(微软)

专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 AsgardBench旨在评估基于视觉的高阶动作序列生成和交互式规划,重点在于执行过程中基于视觉观察而非导航或低级操作的计划适应。通过限制代理输入为图像、动作历史和轻量级成功/失败信号,该基准测试强调条件分支和计划修复。

Comments 19 figures, 6 tables, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09909 2026-03-20 cs.AI 70%

MedMASLab: A Unified Orchestration Framework for Benchmarking Multimodal Medical Multi-Agent Systems

MedMASLab:多模态医疗多智能体系统的统一协调框架

Yunhang Qian, Xiaobin Hu, Jiaquan Yu, Siyang Xin, Xiaokun Chen, Jiangning Zhang, Peng-Tao Jiang, Jiawei Liu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学) vivo Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出MedMASLab框架,解决医疗多智能体系统中多模态整合碎片化问题,通过标准化通信协议、自动化评估器和大规模基准测试,揭示领域特定性能差距,为未来自主临床系统建立新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19008 2026-03-20 cs.CL cs.AI cs.LG 62%

Hypothesis-Conditioned Query Rewriting for Decision-Useful Retrieval

基于假设的查询重写用于决策有用的检索

Hangeol Chang, Changsun Lee, Seungjoon Rho, Junho Yeo, Jong Chul Ye

机构 * Graduate School of AI, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) School of Electrical Engineering, KAIST, Republic of Korea(韩国科学技术院电气工程学院) Department of Industrial Engineering, Yonsei University, Republic of Korea(延世大学工业工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HCQR框架,通过重写查询获取证据支持假设、区分替代方案和验证关键线索,提升检索与答案选择的对齐度,实验表明在MedQA和MMLU-Med上优于传统RAG方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02906 2026-03-20 cs.CV cs.AI cs.MM 62%

MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding

MRD:多分辨率检索-检测融合用于高分辨率图像理解

Fan Yang, Xingping Dong, Xin Yu, Wenhan Luo, Wei Liu, Kaihao Zhang

机构 * HITSZ(哈尔滨工业大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MRD框架,通过多分辨率语义融合和开放词汇检测提升高分辨率图像理解,实现局部和全局视角的增强,取得单目标和多目标理解任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23098 2026-03-20 cs.CV cs.AI 62%

Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding

无视位置,语言偏见:探测视觉语言编码器中中间层表征偏见以实现零样本语言基础空间理解

Na Min An, Inha Kang, Minhyun Lee, Hyunjung Shim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Samsung Electronics(三星电子)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了视觉语言编码器中间层中位置和语言相关信息的偏见,通过层间分析发现常规最终层多模态嵌入优先考虑全局语义对齐,导致视觉嵌入对位置线索敏感性低,多语言文本嵌入在共享空间中形成语言依赖的几何偏移,提出构建空间地图的方法提升零样本图像分割性能。

Comments 61 pages, 28 Figures, 15 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19059 2026-03-20 cs.CV 57%

SignAgent: Agentic LLMs for Linguistically-Grounded Sign Language Annotation and Dataset Curation

SignAgent:用于语言学基础的手语标注和数据集整理的代理LLM

Oliver Cory, Ozge Mercanoglu Sincan, Richard Bowden

机构 * Centre for Vision, Speech and Signal Processing(视觉、语音和信号处理中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出SignAgent,一种利用大语言模型进行可扩展、语言学基础的手语标注和数据集整理的新框架。通过SignAgent协调器和SignGraph,解决传统方法和手动标注的瓶颈,实现大规模语言感知数据标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18625 2026-03-20 cs.CV 57%

GenVideoLens: Where LVLMs Fall Short in AI-Generated Video Detection?

GenVideoLens:在AI生成视频检测中LVLMs的局限性

Yueying Zou, Pei Pei Li, Zekun Li, Xinyu Guo, Xing Cui, Huaibo Huang, Ran He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Center for Research on Intelligent Perception and Computing, NLPR, Institute of Automation, Chinese Academy of Sciences(智能感知与计算中心、国家智能感知与信息处理实验室、中国科学院自动化研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 GenVideoLens通过细粒度评估揭示LVLM在AI生成视频检测中的能力差距,发现其在光学一致性、物理交互和时间因果推理上表现不足,且模型性能在不同维度上差异显著。

Comments ECCV 2026 submission. 14 pages, 6 figures, 4 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18510 2026-03-20 cs.CV 57%

OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting

OnlinePG: 在线开放词汇全景映射与3D高斯点云分裂

Hongjia Zhai, Qi Zhang, Xiaokun Pan, Xiyu Zhang, Yitong Dong, Huaqi Zhang, Dan Xu, Guofeng Zhang

机构 * State Key Lab of CAD & CG(CAD与CG国家重点实验室) VIVO BlueImage Lab(VIVO BlueImage实验室) HKUST(香港科技大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 本文提出OnlinePG,通过在线全景映射结合3D高斯点云分裂实现开放词汇场景理解,解决现有方法在实时性和实例级理解上的不足。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18331 2026-03-20 cs.AI 57%

Understanding the Theoretical Foundations of Deep Neural Networks through Differential Equations

通过微分方程理解深度神经网络的理论基础

Hongjue Zhao, Yizhuo Chen, Yuchen Wang, Hairong Qi, Lui Sha, Tarek Abdelzaher, Huajie Shao

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Tennessee, Knoxville(田纳西大学科廷分校) William & Mary(威廉与玛丽学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过微分方程探讨深度神经网络的理论基础,分析其架构、性能提升及实际应用,提出模型和层级的双重视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17314 2026-03-20 cs.CV 57%

A Proposal-Free Query-Guided Network for Grounded Multimodal Named Entity Recognition

无提案查询引导网络用于 grounded 多模态命名实体识别

Hongbing Li, Jiamin Liu, Shuo Zhang, Bo Xiao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出无提案查询引导网络,通过文本引导和跨模态交互统一多模态推理与解码,提升开放域场景下的命名实体识别精度与鲁棒性。

Comments There is an error in the methods section

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10053 2026-03-20 cs.CV 57%

DREAM: A Benchmark Study for Deepfake photoREalism AssessMent

DREAM:深度伪造照片真实感评估基准研究

Bo Peng, Zichuan Wang, Sheng Yu, Xiaochuan Jin, Wei Wang, Jing Dong

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新技术实验室,自动化研究所,中国科学院)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 本文提出DREAM基准,用于评估深度伪造照片的真实感,包含高质量视频数据集、14万评分及描述文本,分析18种方法,包括基于大视觉语言模型和新提出描述对齐CLIP方法。

Comments Accepted by IEEE T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19195 2026-03-20 eess.AS cs.CL cs.SD 50%

How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation

LLM骨干中的听觉知识如何塑造音频语言模型:全面评估

Ke-Han Lu, Szu-Wei Fu, Chao-Han Huck Yang, Zhehuai Chen, Sung-Feng Huang, Chih-Kai Yang, Yi-Cheng Lin, Chi-Yuan Hsiao, Wenze Ren, En-Pei Hu, Yu-Han Huang, An-Yu Cheng, Cheng-Han Chiang, Yu Tsao, Yu-Chiang Frank Wang, Hung-yi Lee

机构 * National Taiwan University, Taiwan(国立台湾大学) NVIDIA Academia Sinica, Taiwan(台湾“学术院”)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究比较不同LLM在文本仅和音频基础设置下的表现,揭示听觉知识在不同家族间差异显著,文本结果与音频性能强相关。

Comments Project website: https://kehanlu.github.io/AKB

详情

展开后加载摘要…

URL PDF HTML 收藏