arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-25 至 2026-06-25 共收录 16 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 16 篇

2606.25160 2026-06-25 cs.RO cs.CV 新提交 85%

Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding

面向低延迟视觉语言模型:在自我中心视觉理解中实现双重正确预测

Qitong Wang, Fan Du, Pranav Maneriker, Jihui Jin, Christopher Rasmussen

机构 * Dolby Laboratories, Inc.(杜比实验室公司) University of Delaware(特拉华大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对人机协作中低延迟需求,提出基于双重正确预测的剪枝策略,在保持证据定位的同时提升预测准确性,在自我中心视频数据集上实现最高精度与双重正确性。

Comments International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25763 2026-06-25 cs.CV 新提交 84%

ShutterMuse: Capture-Time Photography Guidance with MLLMs

ShutterMuse: 基于多模态大语言模型的拍摄时刻摄影指导

Jiayu Li, Yixiao Fang, Tianyu Hu, Wei Cheng, Ping Huang, Zheheng Fan, Gang Yu, Xingjun Ma

机构 * Fudan University(复旦大学) StepFun

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出CaptureGuide-Bench基准测试,评估MLLM在摄影师构图与主体姿态推荐方面的能力,并构建ShutterMuse统一模型,通过监督与强化微调实现最佳综合性能。

Comments Project Page:https://lijayutnt.github.io/ShutterMuse

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25491 2026-06-25 cs.CV cs.AI 新提交 84%

HG-Bench: A Benchmark for Multi-Page Handwritten Answer-Region Grounding in Automated Homework Assessment

HG-Bench: 自动作业批改中多页手写答案区域定位的基准

Chuangxin Zhao, Boyan Shi, Yanling Wang, Yijian LU, Canran Xiao, Jiali Chen, Jun Xia, Yan Wang, Ji Qi, Juanzi Li

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 针对自动作业批改中多页手写答案区域定位的缺失评估,提出HG-Bench基准,包含500个带层级标注的样本,并设计页面感知评估协议,揭示现有模型在步骤级定位上的能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01085 2026-06-25 cs.CV cs.CL 版本更新 79%

Generalised Medical Phrase Grounding

通用医学短语定位

Wenjun Zhang, Shekhar S. Chandra, Aaron Nicolson

机构 * The University of Queensland(昆士兰大学) Australian e-Health Research Centre, CSIRO Health and Biosecurity(澳大利亚电子健康研究中心,CSIRO健康与生物安全)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对现有医学短语定位方法无法处理多区域、非诊断性及不可定位短语的问题,提出通用医学短语定位任务及MedGrounder模型,采用两阶段训练策略,在零样本迁移和多区域/不可定位短语上优于基线方法。

Comments Accepted by IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25360 2026-06-25 cs.RO 新提交 78%

Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning

解耦语义与几何基础:面向语言条件模仿学习的空间视觉提示

Yanzhe Tang, Xinyu Shao, Yuxuan Hu, Siyu Chen, Bowen Yang, Yajun Gao, Tongtong Cao, Xiu Li, Long Zeng

机构 * Tsinghua University(清华大学) Huawei Technologies Co., Ltd.(华为技术有限公司) National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 提出SVP-IL解耦架构,通过视觉语言基础模型将指令解析为零样本几何掩码,生成空间视觉提示并注入连续动作生成器,在低数据条件下显著提升语言条件模仿学习的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25880 2026-06-25 cs.CV 新提交 77%

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习

Yuchen Xie, Xinyu Zhou, Kuangji Zuo, Yanshuo Lu, Fengrui Huang, Boyu Ma, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25894 2026-06-25 cs.CV cs.AI 新提交 73%

Enhancing Brain MRI Anomaly Detection and Reasoning with ROI Rethink and Synthetic Data

通过ROI重思考与合成数据增强脑部MRI异常检测与推理

Shangkun Li, Jie Xu, Yi Guo, Zeju Li, Yuanyuan Wang

机构 * College of Biomedical Engineering, Fudan University(复旦大学 生物医学工程学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出BrReMark框架,通过显式区域标记和假设验证机制增强脑部MRI诊断的可信度,结合结构化推理轨迹的监督微调和强化学习,以及基于域随机化的病理合成增强,显著提升定位精度并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25585 2026-06-25 cs.CV 新提交 70%

FeVOS: Foresight Expression Video Object Segmentation

FeVOS:前瞻性表达视频目标分割

Kehan Lan, Kaining Ying, Henghui Ding

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院大数据研究所)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出前瞻性表达视频目标分割任务,通过推理时空线索预测未来目标,并构建FeVOS数据集和FeVOS-R1模型,实现最先进性能。

Comments Accepted by ECCV 2026. Homepage: https://henghuiding.com/FeVOS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18008 2026-06-25 cs.CV 新提交 70%

PhaseWin: An Efficient Search Algorithm for Faithful Visual Attribution

PhaseWin:一种用于忠实视觉归因的高效搜索算法

Zihan Gu, Junchi Zhang, Li Liu, Xiaochun Cao, Hua Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Shanghai Center for Mathematical Sciences, Fudan University(复旦大学上海数学中心) College of Electronic Science and Technology, National University of Defense Technology(国防科技大学电子科学学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出PhaseWin算法,通过分阶段窗口搜索将视觉归因的计算复杂度从O(n²)降至O(n),在保持接近贪心算法忠实度的同时大幅减少模型评估次数。

Comments 26 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25532 2026-06-25 cs.AI cs.AR cs.LG cs.MA 新提交 62%

Agentic evolution of physically constrained foundation models

物理约束基础模型的智能体演化

Jiangwei Zhang, Wen Sun, Chong Wang, Shiyao Li, Cheng Che, Chunjing Han, Dan Meng, Jian Yang, Yu Wang, Rui Hou

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出基于演化知识图谱的多智能体发现引擎,自动设计硬件兼容计算系统,在基础模型部署中演化出超越人工的压缩方法,实现大规模模型高效部署。

Comments 29 pages, 5 main figures and 4 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-06-25 cs.CE 新提交 50%

Retrieval-Grounded Multilingual LLM Assistance for Island Smallholder Farmers

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25533 2026-06-25 cs.CR cs.CL 新提交 50%

Security and Privacy in Retrieval-Augmented Generation: Architectures, Threats, Defenses, and Future Directions for Building Trustworthy Systems

检索增强生成中的安全与隐私:构建可信系统的架构、威胁、防御与未来方向

Balamurugan Palanisamy, G S S Chalapathi, Vikas Hassija, Rajkumar Buyya

机构 * Department of Electrical and Electronics Engineering(电子与电气工程系) Birla Institute of Technology and Science, Pilani, Pilani Campus(比拉理工学院和科学学院,比拉校区) Department of Computer Engineering, KIIT University(计算机工程系,KIIT大学) Quantum Cloud Computing and Distributed Systems (qCLOUDS) Laboratory(量子云计算与分布式系统(qCLOUDS)实验室) Department of Computing and Information Systems(计算与信息系统系) The University of Melbourne(墨尔本大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文综述了检索增强生成系统在集中式、设备端、联邦和混合范式下的隐私与安全挑战,提出了涵盖检索、上下文构建和生成阶段的统一威胁分类,并分析了攻击类别及防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25610 2026-06-25 astro-ph.IM astro-ph.GA 新提交 50%

The Galaxy's Guide to the Tokenizer: A Benchmark for Scientific Foundation Models

银河系分词器指南:科学基础模型的基准测试

Sogol Sanjaripour, Michael J. Smith, Manuel Pérez-Carrasco, Juan Rafael Martínez-Galarza, Bahram Mobasher, Gabriela Canalizo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究在统一transformer框架下比较四种分词策略对天文图像重建和物理属性预测的影响,发现重建与表征质量解耦,无单一方法全面最优。

Comments Accepted as a spotlight talk at the Conference on Physics and AI (PAI) 2026, Stanford University

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19157 2026-06-25 eess.AS cs.CL 新提交 50%

IndicContextEval: A Benchmark for Evaluating Context Utilisation in Audio Large Language Models Across 8 Indic Languages

IndicContextEval:评估8种印度语言音频大语言模型上下文利用能力的基准

Sakshi Joshi, Dhruv Subhash Rathi, Sanskar Singh, Eldho Ittan George, R J Hari, Kaushal Bhogale, Mitesh M. Khapra

机构 * AI4Bharat, Indian Institute of Technology Madras, India(AI4Bharat,印度理工学院马德拉斯分校) Sarvam AI, India(Sarvam AI,印度)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出IndicContextEval基准,包含8种印度语言555位说话人的56小时自然语音,通过7级提示框架评估音频大语言模型是否真正利用上下文而非依赖参数化知识。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13814 2026-06-25 cs.IR 新提交 50%

TASR: Training-Free Adaptive Stopping for Iterative Retrieval

TASR:无需训练的迭代检索自适应停止规则

Adrian Kieback, Uyiosa Philip Amadasun, Aman Chadha, Aaron Elkins

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出TASR,一种无需训练的迭代检索停止规则,通过重复答案检测和逻辑回归边际阈值减少冗余检索,在多种配置下保持高F1值并降低调用次数。

Comments 20 pages, 5 figures. Accepted at Agent4IR Workshop, KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07826 2026-06-25 quant-ph math-ph math.MP 新提交 50%

The classical boundaries of the EPR argument and quantum ontology

EPR论证与量子本体论的经典边界

Vincenzo Chilla

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过希尔伯特空间经典力学将经典性归结为布尔性逻辑约束,指出EPR论证揭示的是其前提的经典边界而非量子不完备性,并基于观察环境与观察对象的结构二分提出一种语境依赖的量子本体论。

Comments 41 pages, corrected one mathematical equation, minor corrections and changes in the text

详情

展开后加载摘要…

URL PDF HTML 收藏