arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-08 至 2026-07-08 共收录 18 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 18 篇

2607.05978 2026-07-08 cs.CV cs.AI 新提交 90%

Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention

提出并关注:通过多令牌局部注意力实现无训练的多模态大语言模型接地置信度

Daniel Shalam, Emanuel Ben Baruch, Avi Ben Cohen, Tal Remez

机构 * Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型接地置信度问题,提出无训练的多令牌局部注意力(MTLA)方法,通过在声称区域内求和并跨预测令牌聚合恢复更强接地信号,在多模型家族和模态中提升了幻觉AUROC及零样本检测AP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09927 2026-07-08 cs.CV 版本更新 87%

BLPR: Robust License Plate Recognition under Viewpoint and Illumination Variations via Confidence-Driven VLM Fallback

BLPR: 通过置信度驱动的VLM回退实现视点和光照变化下的鲁棒车牌识别

Guillermo Auza Banegas, Diego Calvimontes Vera, Natalia Condori Peredo, Edwin Salcedo, Sergio Castro Sandoval

机构 * Queen Mary University of London(伦敦玛丽女王大学)

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出BLPR框架,通过合成数据预训练和真实数据微调提升Bolivian车牌识别鲁棒性,引入轻量视觉语言模型作为置信度回退机制,实现89.6%的字符识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06445 2026-07-08 cs.CV cs.AI 新提交 85%

Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

代理分析:作为条件编码器的视觉语言模型中的定位信号

Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik

机构 * Tel Aviv University, Tel Aviv, Israel(特拉维夫大学) Google DeepMind(谷歌DeepMind)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型(VLMs)作条件编码器时编辑管道定位性能差的问题,引入代理分析框架,通过训练代理模型分析VLM中间表示来揭示编码定位信息的表示,发现现有条件提取策略缺陷,为条件架构设计提供新思路。

Comments Accepted as a Spotlight at the ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23020 2026-07-08 cs.CV cs.AI 版本更新 84%

OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding

OpenGround:基于规划的开放世界3D视觉定位在线感知

Wenyuan Huang, Zhenyu Zhang, Zhao Wang, Zhou Wei, Ting Huang, Fang Zhao, Jian Yang

机构 * Nanjing University, School of Intelligent Science and Technology(南京大学智能科学与技术学院) China Mobile Zijin Innovation Institute(中国移动紫金创新院)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual language model(abstract);分类 cs.CV、cs.AI

AI总结 针对开放世界3D视觉定位中现有方法的局限,提出OpenGround框架,集成任务链规划与上下文引导感知,还构建OpenTarget数据集。实验表明其在多个数据集上性能优异,在开放世界评估中有显著提升。

Comments ECCV2026, 46 pages, 13 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06374 2026-07-08 cs.CV 新提交 81%

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

花瓶博物馆:古希腊陶器数字智能博物馆

Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 针对古希腊陶器文化遗产领域中视觉语言模型面临的挑战,提出轻量级模块化多模态智能体框架花瓶博物馆,结合虚拟博物馆与花瓶智能体,经多模态感知等操作,提高引用有效性,减少幻觉并产生更中立答案。

Comments Code: https://github.com/AIGeeksGroup/VaseMuseum. Website: https://aigeeksgroup.github.io/VaseMuseum

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23876 2026-07-08 cs.CV cs.AI 版本更新 81%

Rethinking Visual Autoregressive Sampling with Information-Grounding Guidance

基于信息基础引导的视觉自回归采样再思考

Ky Dan Nguyen, Hoang Lam Tran, Anh-Dung Dinh, Daochang Liu, Weidong Cai, Xiuying Wang, Chang Xu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 研究基于下一尺度预测的自回归模型在图像生成中因信息不一致致引导信号分散问题,提出信息基础引导(IGG)框架,通过动态加权将引导锚定到语义重要令牌,在相关任务中生成更优图像,有效纠正基于AR的方法。

Comments Accepted to The Forty-Third International Conference on Machine Learning (ICML 2026); 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06402 2026-07-08 cs.CV cs.AI cs.LG 新提交 75%

What Images Cannot Say: Language-Guided Olfactory Representation Learning

图像无法表达的:语言引导的嗅觉表征学习

Eleftherios Tsonis, Xi Wang, Vicky Kalogeiton

机构 * LIX, École Polytechnique, IP Paris, CNRS(LIX,巴黎高等理工学院,IP巴黎,CNRS)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究图像与嗅觉对齐难题,提出SCENT多模态框架,利用视觉语言模型生成场景描述符,训练气味编码器,通过语言引导潜在分解分离特定对象气味与环境贡献,提升跨模态检索性能,产生可解释表征。

Comments ECCV 2026. Project page: https://www.lix.polytechnique.fr/vista/projects/2026_scent_tsonis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05625 2026-07-08 cs.CV 新提交 70%

Cross-Contextual Vision-Language Adaptation with LoRA for Personalized Severe Adverse Event Detection in Clinical Wound Monitoring

基于LoRA的跨上下文视觉语言适配用于临床伤口监测中的个性化严重不良事件检测

Aditi Naiknaware, Jian Sun, Aminreza Khandan, Shengyang Huang, Sean Dow, Bijan Najafi, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 研究针对临床伤口监测中严重不良事件检测问题,提出基于双流LoRA框架及跨上下文融合机制的多模态框架,结合多种方法识别个性化严重不良事件并捕捉愈合动态,在相关实验中展现良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04703 2026-07-08 cs.HC 版本更新 67%

Bounded Autonomy: Controlling LLM Characters in Live Multiplayer Games

有界自主性:控制游戏中的LLM角色

Yunjia Guo, Jinghan Zhu, Siyu Wang, Haixin Qiao

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本文提出有界自主性架构,通过三种接口控制游戏中的LLM角色,使其在多人互动中保持可执行性和社会一致性,并通过实验验证其有效性。

Comments 9 pages, 5 figures, 5 tables; manuscript unchanged from v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19216 2026-07-08 cs.CV cs.AI cs.LG 版本更新 67%

DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising

DreamPartGen: 通过协作潜在去噪实现语义引导的部件级3D生成

Tianjiao Yu, Xinzhuo Li, Muntasir Wahed, Jerry Xiong, Yifan Shen, Ying Shen, Ismini Lourentzou

机构 * University of Illinois Urbana - Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 DreamPartGen通过协作潜在去噪实现语义引导的部件级3D生成,引入双部件潜在和关系语义潜在,提升几何和语义一致性,实现高质量文本对齐的3D合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05568 2026-07-08 cs.CV cs.AI 新提交 62%

Harnessing Generative Image Models for Training-Free Primitive Shape Abstraction

利用生成式图像模型进行无训练的原始形状抽象

Gregor Kobsik, Tim Elsner, Leif Kobbelt

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究如何利用生成式图像模型进行无训练的原始形状抽象,通过渲染多视图图像、分析语义部分、绘制分割掩码、重新投影和拟合超二次基元的流程,实现与类别无关且方向不变,在相关数据集上Chamfer距离最低。

Comments 13 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06229 2026-07-08 cs.CL cs.AI cs.DB 新提交 57%

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

Spider 2.0-AIFunc:将现实世界的文本到SQL扩展到人工智能原生SQL工作流程

Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

机构 * UC San Diego(加州大学圣地亚哥分校) Snowflake AI Research(Snowflake人工智能研究院) University of Hong Kong(香港大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对现有文本到SQL基准无法评估模型生成人工智能原生SQL能力的问题,构建Spider 2.0-AIFunc基准,经特定管道和多轮验证,评估十个先进语言模型,发现准确率差距及传统代理框架转移无效等情况。

Comments 24 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05970 2026-07-08 cs.IR cs.AI 新提交 57%

Faithful or Findable? Evaluating LLM-Generated Metadata for RDF Dataset Search

忠实还是可查找?评估用于RDF数据集搜索的大语言模型生成的元数据

Riccardo Terrenzi, Serkan Ayvaz

机构 * University of Southern Denmark(南部丹麦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究RDF数据集六种元数据生成设置,评估其检索有效性与忠实性。发现无约束重写检索增益强但忠实性低,更有根据的设置提高了忠实性,基于配置文件的重写权衡最佳,将合成元数据定位为需综合评估多方面的系统级信息检索问题。

Comments 5 pages, 1 figure, accepted at SynthIR @ SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05253 2026-07-08 cs.CV 新提交 57%

Repurposing CLIP to Localize at Pixel Level

复用CLIP实现像素级定位

Jiaxiang Fang, Shiqiang Ma, Jing Wang, Siyu Chen, Fei Guo, Shengfeng He

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Advanced Technology Center Beijing AI Laboratory(北京人工智能先进技术中心) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 针对CLIP全局特征偏差导致难以适配像素级预测的问题,提出CLIPix框架,结合抗噪校正与定位嵌入策略,保留CLIP泛化性,在PASCAL、COCO上取得最优像素级定位性能。

Comments Accepted by IEEE TMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27106 2026-07-08 cs.CR cs.AI 新提交 57%

Application of LLMs to Threat Assessment of Foreign Peacekeeping Missions

LLMs在外国维和任务威胁评估中的应用

Gerhard Backfried, Christian Schmidt, Diego Pilutti, Michael Suker

机构 * HENSOLDT Austria(海恩索尔特奥地利公司) Austrian Ministry of Defence(奥地利国防部)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出利用大语言模型(LLMs)结合风险模型和OSINT媒体数据,自动提取维和任务相关威胁,评估显示自动结果与人工判断高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20735 2026-07-08 cs.AI cs.LO 版本更新 57%

Implementing Metric Temporal Answer Set Programming

实现度量时态回答集编程

Arvid Becker, Pedro Cabalar, Martin Diéguez, Susana Hahn, Javier Romero, Torsten Schaub

机构 * University of Potsdam, Germany(波恩大学) University of Corunna, Spain(科鲁纳大学) University of Angers, France(昂热大学) Potassco Solutions, Germany(Potassco解决方案)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究如何实现度量时态回答集编程,利用带差异约束的ASP扩展处理时间相关方面,有效解耦度量ASP与时间粒度,解决处理细粒度时间约束时的可扩展性问题,使解决方案不受时间精度影响。

Comments Under consideration in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03863 2026-07-08 cs.CL 新提交 50%

Rethinking Scientific Discovery in the Agentic Era

在智能时代重新思考科学发现

Yining Zheng, Yuxin Wang, Jiahao Lu, Shicheng Fang, Weiyi Wang, Yongzhuo Yang, Bowen Li, Haochen Ma, Chen Hu, Bowen Chen, Yang Wang, Huanhui Chen, Yitong Chen, Jiajun Chen, Zhiyuan Li, Yanlin Li, Zhuo Yang, Qifeng Wu, Jiaying He, Zhijie Jinluo, Xiaohu Xu, Yi Feng, Juncheng Qian, Yizhou Chen, Yang Cheng, Tong Zhu, Tianlei Ying, Hongyu Yu, Hongjun Xiang, Xipeng Qiu

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) East China Normal University(华东师范大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究提出智能科学操作系统SCION,以科学智能体为元工具连接科研要素,核心是研究执行计划,集成多种方法支持长期科研工作,经实验验证其在多方面优于现有基线,推动AI成为可溯源、可复用的科研创新协调操作层。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31480 2026-07-08 cs.CL 版本更新 50%

Language Models Can Resolve Reference Compositionally, But It's Not Their Native Strength: The Case of the Personal Relation Task

语言模型可以组合性地解析指代,但这并非其天然优势:以个人关系任务为例

Bart Evelo, Meaghan Fowlie, Denis Paperno

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过个人关系任务,比较人类与大型语言模型在外延任务(确定指称对象)和内涵任务(结构化表示意义)上的表现,发现人类更擅长外延任务而LLM更擅长内涵任务,表明缺乏指称基础是LLM模拟人类语言理解的关键缺失。

Comments A pre-MIT Press publication version. Paper accepted to Transactions of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏