arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-14 至 2026-05-14 共收录 19 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 19 篇

2605.13530 2026-05-14 cs.CV cs.AI 92%

Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs

迈向统一的手术场景理解:通过多模态大语言模型弥合推理与 grounding

Jincai Huang, Shihao Zou, Yuchen Guo, Jingjing Li, Wei Ji, Kai Wang, Shanshan Wang, Weixin Si

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Northwestern University(西北大学) University of Alberta(阿尔伯塔大学) Yale University(耶鲁大学) Nanfang Hospital(南华医院) Shenzhen University of Advanced Technology(深圳大学先进技术研究院)

专题命中 视觉定位与Grounding :grounding(title,title_cn);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SurgMLLM框架,通过统一推理与视觉 grounding 实现手术场景理解,提升三元组识别和分割精度,实验表明其在三元组识别指标AP_IVT上提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01750 2026-05-14 cs.MA cs.AI 90%

Talk is Cheap, Communication is Hard: Dynamic Grounding Failures and Repair in Multi-Agent Negotiation

言者无罪,沟通艰难:多智能体谈判中的动态 grounding 故障与修复

Yiheng Yao, Chelsea Zou, Robert D. Hawkins

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 本文研究多智能体谈判中动态 grounding 的故障与修复,通过多轮谈判游戏揭示四类失败模式,发现协调瓶颈在于动态 grounding 而非个体推理或信息不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13034 2026-05-14 cs.CV cs.IR 89%

ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence

ViDR:基于源视觉证据的多模态深度研究报告 grounding

Zhuofan Shi, Peilun Jia, Baoqin Sun, Haiyang Shen, Sixiong Xie, Yun Ma, Xiang Jing

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) National Key Laboratory of Data Space Technology and System(数据空间技术与系统国家重点实验室) School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 视觉定位与Grounding :grounding(title,title_cn);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 ViDR通过源视觉证据构建多模态深度研究报告框架,提升报告质量与证据可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13054 2026-05-14 cs.CV 89%

Topo-R1: Detecting Topological Anomalies via Vision-Language Models

Topo-R1: 通过视觉-语言模型检测拓扑异常

Meilong Xu, Qingqiao Hu, Xiaoling Hu, Shahira Abousamra, Xin Yu, Weimin Lyu, Kehan Qi, Dimitris Samaras, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) Stanford University(斯坦福大学) Penn State University(宾夕法尼亚州立大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本文通过构建拓扑感知基准Topo-R1,评估视觉-语言模型在检测管状网络拓扑异常中的能力,发现现有模型缺乏拓扑感知,提出基于拓扑感知奖励的联合评分方法,显著提升模型在ID和OOD测试中的性能。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17555 2026-05-14 cs.CV 88%

GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking

GraphThinker: 通过事件图思维强化时间感知的视频推理

Zixu Cheng, Da Li, Jian Hu, Yuhang Zang, Ziquan Liu, Shaogang Gong, Wei Li

机构 * Queen Mary University of London(伦敦玛丽女王大学) Samsung AI Centre Cambridge(剑桥三星人工智能中心) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出GraphThinker,通过构建结构化事件表示并强化视觉 grounding,减少视频推理中的时间幻觉。在RexTime和VidHalluc数据集上取得显著提升。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13228 2026-05-14 cs.CV cs.AI 81%

ReTool-Video: Recursive Tool-Using Video Agents with Meta-Augmented Tool Grounding

ReTool-Video:具有元增强工具定位的递归工具使用视频代理

Xiao Liu, Nayu Liu, Junnan Zhu, Ruirui Chen, Guohui Xiang, Changjian Wang, Kaiwen Wei, Rongzhen Li, Jiang Zhong

机构 * Chongqing University(重庆大学) Tianjin University(天津大学) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院MAIS) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局高性能计算研究所) Chongqing National Data AI Research Institute, AI Research Lab(重庆国家数据AI研究院,AI研究实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出ReTool-Video,通过构建元增强视频工具库和递归工具使用方法,提升视频理解的稳定性和效果,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13803 2026-05-14 cs.CV 79%

EvoGround: Self-Evolving Video Agents for Video Temporal Grounding

EvoGround:用于视频时间定位的自进化视频智能体

Minjoon Jung, Byoung-Tak Zhang, Lorenzo Torresani

机构 * Seoul National University(首尔国立大学) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出EvoGround框架,通过两个自进化智能体自学习视频时间定位,无需人工标注数据,在多个基准上表现优异。

Comments Project page: https://minjoong507.github.io/projects/EvoGround/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02752 2026-05-14 cs.CV 79%

Does it Really Count? Assessing Semantic Grounding in Text-Guided Class-Agnostic Counting

真的计数吗?评估文本引导的类无关计数中的语义基础

Giacomo Pacini, Luca Ciampi, Nicola Messina, Nicola Tonellotto, Giuseppe Amato, Fabrizio Falchi

机构 * Institute of Information Science and Technologies of the National Research Council (ISTI-CNR)(意大利国家研究理事会信息科学与技术研究所) University of Pisa - Department of Information Engineering(比萨大学信息工程系)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文评估了文本引导的类无关计数中语义基础的重要性,提出新的评估框架和数据集,揭示现有模型在理解对象类别描述上的不足。

Comments Code available at https://github.com/ciampluca/PrACo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13122 2026-05-14 cs.CV 79%

Early Semantic Grounding in Image Editing Models for Zero-Shot Referring Image Segmentation

图像编辑模型中的早期语义接地用于零样本指引用图像分割

Jingxuan He, Xiyu Wang, Yunke Wang, Mengyu Zheng, Chang Xu

机构 * The University of Sydney(悉尼大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文探讨利用图像编辑模型的隐含语义接地能力进行零样本指引用图像分割,通过分析发现早期去噪步骤即可实现前景背景分离,提出无需训练的框架利用预训练模型的中间表示进行分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18951 2026-05-14 cs.LG 79%

Benchmarking Attribute Discrimination in Infant-Scale Vision-Language Models

对婴儿级视觉-语言模型属性辨别能力的基准测试

Patrick Batsell, Satoshi Tsutsui, Bihan Wen

机构 * Rice University(里士大学) ROSE Lab(ROSE实验室) School of EEE, Nanyang Technological University(南洋理工大学电子工程学院)

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.LG

AI总结 研究通过合成渲染对比颜色、尺寸和纹理属性,评估婴儿训练模型在属性辨别上的能力,发现其在视觉和语言属性信息上存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19651 2026-05-14 cs.CV 70%

Scalable Object Detection in the Car Interior With Vision Foundation Models

在汽车内部实现可扩展的目标检测与定位:基于视觉基础模型

Sebastian Schmidt, Bálint Mészáros, Ahmet Firintepe, Stephan Günnemann

机构 * Technical University of Munich, School of Computation, Information and Technology(慕尼黑技术大学,计算、信息与技术学院) BMW Group(宝马集团)

专题命中 视觉定位与Grounding :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出ODAL框架,利用分布式架构结合视觉基础模型,在车载与云平台间分配计算任务,通过ODALbench评估,轻量模型经微调后在检测和定位任务中表现优异,性能优于GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04506 2026-05-14 cs.CV cs.AI 62%

Ilov3Splat: Instance-Level Open-Vocabulary 3D Scene Understanding in Gaussian Splatting

Ilov3Splat:基于高斯散射的实例级开放词汇3D场景理解

Binh Long Nguyen, Kien Nguyen, Sridha Sridharan, Clinton Fookes, Peyman Moghadam

机构 * School of Electrical Engineering and Robotics(电气工程与机器人学学院) Queensland University of Technology(昆士兰理工大学) CSIRO Robotics(CSIRO机器人部) CSIRO

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Ilov3Splat框架,通过增强高斯散射以实现实例级开放词汇3D场景理解,利用多分辨率哈希嵌入和对比损失提升语言语义关联与实例区分能力。

Comments The International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23013 2026-05-14 cs.CV cs.LG 62%

SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling

SubspaceAD:通过子空间建模实现无训练少样本异常检测

Camile Lendering, Erkut Akdag, Egor Bondarev

机构 * AIMS Group, Department of Electrical Engineering, Eindhoven University of Technology(AIMS组,电气工程系,埃因霍温理工大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 SubspaceAD提出一种无需训练的少样本异常检测方法,通过冻结DINOv2模型提取正常图像的补丁特征,并利用PCA建模估计正常变化的低维子空间,从而在无训练、提示微调或内存库的情况下实现最先进的性能。

Comments Accepted to CVPR 2026. Revised version with corrected AU-PRO evaluation and recomputed metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15867 2026-05-14 cs.LG cs.AI cs.CL cs.MA 62%

RDMA: Cost Effective Agent-Driven Rare Disease Mining from Electronic Health Records

RDMA: 低成本的代理驱动罕见病挖掘从电子健康记录

John Wu, Adam Cross, Jimeng Sun

机构 * Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Department of Pediatrics, University of Illinois College of Medicine Peoria(伊利诺伊大学皮奥里亚医学院儿科系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 RDMA通过代理框架在电子健康记录中挖掘罕见病,无需特定任务训练,提升性能并降低部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13725 2026-05-14 cs.AI cs.SI 57%

ScioMind: Cognitively Grounded Multi-Agent Social Simulation with Anchoring-Based Belief Dynamics and Dynamic Profiles

ScioMind:基于认知的多智能体社交模拟与基于锚定的信念动态和动态资料

Yitian Yang, Yiqun Duan, Linghan Huang, Yiqi Zhu, Francesco Bailo, Chunmeizi Su, Huaming Chen

机构 * The University of Sydney(悉尼大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 ScioMind结合结构化意见动态与LLM代理推理,通过记忆锚定信念更新规则、分层记忆架构和动态代理资料提升社交模拟的真实性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12988 2026-05-14 cs.AI cs.CY cs.IR 57%

Retrieval-Augmented Tutoring for Algorithm Tracing and Problem-Solving in AI Education

增强检索的辅导系统用于AI教育中的算法追踪与问题解决

Mragisha Jain, Tirth Bhatt, Griffin Pitts, Aum Pandya, Peter Brusilovsky, Narges Norouzi, Arto Hellas, Juho Leinonen, Bita Akram

机构 * North Carolina State University(北卡罗来纳州立大学) University of Pittsburgh(匹兹堡大学) University of California, Berkeley(加州大学伯克利分校) Aalto University(阿尔托大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出KITE系统,通过增强检索生成技术辅助学生理解算法追踪和问题解决,提升算法推理能力。

Comments Paper accepted to the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026), co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12536 2026-05-14 q-bio.NC cs.AI cs.IT math.IT 57%

Information as Maximum-Caliber Deviation: A bridge between Integrated Information Theory and the Free Energy Principle

信息作为最大 caliber 偏离:集成信息理论与自由能原理之间的桥梁

Alexander Kearney

机构 * University of Oxford(牛津大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出信息可定义为动态偏离最大 caliber 路径集的量,通过最大 caliber 变分原理重新推导了IIT的现象学计算,为IIT扩展到新动态领域提供了理论桥梁。

Comments 84 pages, 10 figures, 2 tables Extended version of a Master's thesis, Mathematical Institute, University of Oxford

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12905 2026-05-14 cs.IR 50%

Same Image, Different Meanings: Toward Retrieval of Context-Dependent Meanings

同一图像,不同含义:面向依赖上下文的含义检索

Ayuto Tsutsumi, Ryosuke Kohita

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究图像意义的上下文依赖性及其对检索的影响,提出L1-L4框架,探讨嵌入式叙事上下文对不同抽象层次检索效果的影响。

Comments SIGIR 2026 (short paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09335 2026-05-14 quant-ph 50%

Steganographic Entanglement Sharing

量子纠缠分发的隐写术

Bruno Avritzer, Todd A. Brun

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出利用量子数态和相干态在光学信道中实现量子信息传输,展示隐写术纠缠分发在非经典态传送中的实用性,即使存在主动窃听者。

Comments 9 pages, 7 figures

Journal ref Phys. Rev. A 112, 022604 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏