arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-08 至 2026-05-08 共收录 19 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 19 篇

2602.17419 2026-05-08 cs.CV 89%

EAGLE: Expert-Augmented Attention Guidance for Tuning-Free Industrial Anomaly Detection in Multimodal Large Language Models

EAGLE:专家增强的注意力引导用于多模态大语言模型中的无调优工业异常检测

Xiaomeng Peng, Xilang Huang, Seon Han Choi

机构 * Ewha Womans University(峨山女子大学)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);分类 cs.CV

AI总结 EAGLE通过整合专家异常检测器与冻结的MLLM,提出无调优框架,提升多模态大语言模型在工业异常检测中的准确率,且在MVTec-AD和VisA数据集上达到94.4%和88.1%的异常鉴别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15872 2026-05-08 cs.RO cs.CV cs.LG 88%

MARVL: Multi-Stage Guidance for Robotic Manipulation via Vision-Language Models

MARVL:通过视觉-语言模型实现机器人操作的多阶段引导

Xunlan Zhou, Xuanlin Chen, Shaowei Zhang, ShengHua Wan, Xiaohai Hu, Lei Yuan, De-chuan Zhan

机构 * School of Intelligent Science and Technology, Nanjing University, China(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, School of Artificial Intelligence, Nanjing University, China(南京大学新型软件技术国家实验室,人工智能学院) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) MACS Lab, University of Washington(华盛顿大学MACS实验室)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出MARVL,通过视觉-语言模型实现机器人操作的多阶段引导,解决传统密集奖励函数设计中的问题,提升样本效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08110 2026-05-08 cs.CV cs.CL cs.LG 88%

The ART of Composition: Attention-Regularized Training for Compositional Visual Grounding

构图的艺术:用于组合视觉定位的注意力正则化训练

Jiayun Luo, Mir Rayat Imtiaz Hossain, Pritam Sarkar, Boyang Li, Leonid Sigal

机构 * The University of British Columbia(不列颠哥伦比亚大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出CompART,通过分解标题为以对象为中心的短语并构建复合短语,提升多对象定位能力,验证了其在多种视觉语言模型上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06080 2026-05-08 cs.CV 81%

MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation

MSD-Score:多尺度分布评分用于无参考图像描述评估

Shichao Kan, Xuyang Zhang, Haojie Zhang, Zhe Zhu, Yigang Cen, Yixiong Liang, Lianlei Shan, Linna Zhang, Zhe Qu, Jiazhi Xia

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) School of Computer Science and Technology and the State Key Laboratory of Advanced Rail Autonomous Operation, Beijing Jiaotong University(北京交通大学计算机科学与技术学院和先进轨道交通自主运行国家重点实验室) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Mechanical Engineering, Guizhou University(贵州大学机械工程学院)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.CV

AI总结 本文提出MSD-Score,一种无参考图像描述评估指标,通过多尺度分布评分方法量化语义差异,实现对局部 grounding 错误的透明诊断,优于现有无参考指标。

Comments Preprint. 17 pages, 10 figures. Code is available at: https://steinsgatesg.github.io/MSDScore/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02379 2026-05-08 cs.LG cs.CV 79%

Teaching Metric Distance to Discrete Autoregressive Language Models

向离散自回归语言模型传授度量距离

Jiwan Chung, Saejin Kim, Yongrae Jo, Jaewoo Park, Dongjun Min, Youngjae Yu

机构 * Yonsei University(延世大学) LG AI Research(LG AI研究院) Seoul National University(首尔国立大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.CV、cs.LG

AI总结 本文提出DIST2Loss,通过奖励加权分布替代one-hot目标,提升离散自回归模型的数据效率和跨领域表现,应用于视觉 grounding、机器人操控、奖励建模和向量量化图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05400 2026-05-08 cs.SE cs.AI cs.HC 77%

Mise en Place for Agentic Coding: Deliberate Preparation as Context Engineering Methodology

代理编程的准备:作为情境工程方法论的刻意准备

Andrew Zigler

机构 * LinearB

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.AI

AI总结 本文提出了一种三阶段的代理编程准备方法,通过情境 grounding、协作规范和任务分解,提升 AI 编程的效率与质量,通过 hackathon 实验验证了准备阶段的重要性。

Comments 5 pages. Accepted at VibeX 2026, the 1st International Workshop on Vibe Coding and Vibe Researching, co-located with EASE 2026, Glasgow, June 9-12 2026. Camera-ready version. Research artifact: https://doi.org/10.5281/zenodo.19868258

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05546 2026-05-08 cs.AI 70%

SPARK: Self-Play with Asymmetric Reward from Knowledge Graphs

SPARK:基于知识图谱的异步奖励自我对抗学习

Hyobin Park, Taeseop Kim, Dong-Geol Choi

机构 * Hanbat National University, South Korea(韩国翰bac国立大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 SPARK通过构建统一知识图谱实现多文档科学文献的自我对抗学习,利用图路径生成关系推理问题并基于结构化事实计算奖励,优于传统自对抗基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03354 2026-05-08 cs.AI 70%

What Happens Inside Agent Memory? Circuit Analysis from Emergence to Diagnosis

代理记忆内部发生了什么?从涌现到诊断的电路分析

Xutao Mao, Jinman Zhao, Gerald Penn, Cong Wang

机构 * City University of Hong Kong(香港城市大学) University of Toronto(多伦多大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 研究揭示了代理记忆中控制与内容电路的因果关系及共享枢纽的机制,开发出76.2%准确率的无监督诊断工具,优于监督基线13分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07794 2026-05-08 cs.IR 67%

Query Expansion in the Age of Pre-trained and Large Language Models: A Comprehensive Survey

预训练和大语言模型时代的问题扩展:综述

Minghan Li, Xinxuan Lv, Junjie Zou, Tongna Chen, Chao Zhang, Suchao An, Ercong Nie, Guodong Zhou

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本文综述了预训练和大语言模型时代的问题扩展方法,探讨了不同模型家族如何实现新的扩展行为,并分析了四种设计维度下的最新技术,总结了应用模式和部署考虑,指出了未来挑战和方向。

Comments 42 pages,10 figures,6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22038 2026-05-08 cs.CL 67%

Early Risk Prediction with Temporally and Contextually Grounded Clinical Language Processing

利用时序和情境 grounding 的临床语言处理进行早期风险预测

Rochana Chaturvedi, Yue Zhou, Andrew D. Boyd, Brian T. Layden, Mudassir Rashid, Lu Cheng, Ali Cinar, Barbara Di Eugenio

机构 * Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 视觉定位与Grounding :grounding(title_cn)

AI总结 本文提出两种方法,HiTGNN 通过时序图神经网络建模患者轨迹,ReVeAL 通过轻量框架提升预测准确性与公平性,用于2型糖尿病早期筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05344 2026-05-08 cs.CV cs.AI cs.IR 62%

Open-SAT: LLM-Guided Query Embedding Refinement for Open-Vocabulary Object Retrieval in Satellite Imagery

Open-SAT: 一种基于LLM的查询嵌入细化方法用于卫星影像开放词汇物体检索

Md Adnan Arefeen, Biplob Debnath, Ravi K. Rajendran, Murugan Sankaradas, Srimat T. Chakradhar

机构 * North South University(北南大学) NEC Laboratories America(NEC实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Open-SAT通过LLM引导在推理阶段优化查询与卫星影像内容的对齐,提升开放词汇检索性能,实验表明其F1分数提升达16.04%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06434 2026-05-08 cs.AI 57%

Knowledge Graphs, the Missing Link in Agentic AI-based Formal Verification

知识图谱:代理AI形式验证中的缺失链接

Vaisakh Naduvodi Viswambharan, Keerthan Kopparam Radhakrishna, Deepak Narayan Gadde, Aman Kumar

机构 * 1 Infineon Technologies Dresden AG \& Co. KG, Germany 2 Infineon Technologies Semiconductor India Private Limited, India

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出基于知识图谱的验证方法,通过结构化中间表示提取规范、RTL和工具反馈,提升形式验证中规范到RTL的关联性,并通过多代理工作流生成SVAs及三种修正循环。

Comments To appear at the IEEE International Conference on IC Design and Technology 2026 (ICICDT), June 22 - 24, 2026, Dresden, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05807 2026-05-08 cs.CR cs.AI 57%

LCC-LLM: Leveraging Code-Centric Large Language Models for Malware Attribution

LCC-LLM:利用代码导向的大语言模型进行恶意软件归因

Christopher G. Pedraza Pohlenz, Hassan Jalil Hadi, Ali Hassan, Ali Shoker

机构 * CyberSaR, King Abdullah University of Science and Technology(CyberSaR,国王阿卜杜勒·阿齐兹大学科学与技术学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出LCC-LLM,一种代码导向的恶意软件归因和多任务静态恶意软件分析框架,通过构建包含34000个PE样本的LCCD数据集,结合静态分析与多源安全知识,提升恶意软件归因的可靠性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05643 2026-05-08 cs.AI cs.IR 57%

Text-Graph Synergy: A Bidirectional Verification and Completion Framework for RAG

文本-图协同:一种双向验证与完成框架用于RAG

Jiarui Zhong, Hong Cai Chen

机构 * School of Automation, Southeast University(自动化学院,东南大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出TGS-RAG框架,通过双向机制融合文本与图结构,解决传统RAG中信息孤岛问题,提升多跳推理性能。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05626 2026-05-08 cs.CL cs.AI 57%

When2Speak: A Dataset for Temporal Participation and Turn-Taking in Multi-Party Conversations for Large Language Models

When2Speak: 一个多党对话中大型语言模型的时间参与和发言时机的数据集

Vihaan Nama, Shreya Mendi, Zian Ye, Brinnae Bent

机构 * Pratt School of Engineering(普拉特工程学院) Duke University(杜克大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出When2Speak数据集,通过四阶段生成流程学习群体互动中的发言时机,通过强化学习优化模型,提升多党对话中的发言准确性与自然度。

Comments Currently under review. Dataset can be found: https://huggingface.co/datasets/duke-trust-lab/When2Speak

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05538 2026-05-08 cs.AI cs.IR 57%

AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases

AgenticRAG:企业知识库中的代理检索

Susheel Suresh, Hazel Mak, Shangpo Chou, Fred Kroon, Sahil Bhatnagar

机构 * Microsoft Corporation(微软公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 AgenticRAG通过在现有企业检索基础设施上叠加轻量级代理框架,使语言模型能够自主迭代检索信息、导航文档并分析证据,提升了检索准确率和事实性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20616 2026-05-08 cs.CV 57%

Shape2Animal: Creative Animal Generation from Natural Silhouettes

Shape2Animal: 从自然剪影生成创意动物

Quoc-Duy Tran, Anh-Tuan Vo, Dinh-Khoi Vo, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市科学技术大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学) University of Dayton, Ohio, US(Dayton 大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Shape2Animal框架,通过将自然物体剪影转化为 plausible 动物形式,展现人类对模糊刺激的感知能力。利用 vision-language 模型和扩散模型生成视觉连贯的动物图像,适用于视觉叙事、教育内容等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06311 2026-05-08 cs.RO 50%

Toward Visually Realistic Simulation: A Benchmark for Evaluating Robot Manipulation in Simulation

迈向视觉逼真模拟:评估机器人操作的基准测试

Yixin Zhu, Zixiong Wang, Jian Yang, Jin Xie, Jingyi Yu, Jiayuan Gu, Beibei Wang

机构 * Nanjing University(南京大学) Nankai University(南开大学) ShanghaiTech University(上海科技大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出VISER基准,通过高保真3D资产和物理渲染材料,评估机器人操作的视觉逼真度,提升仿真与现实性能的关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11409 2026-05-08 quant-ph 50%

When T-Depth Misleads: Predicting Fault-Tolerant Quantum Execution Slowdown under Magic-State Delivery Constraints

当T深度误导:在魔态交付限制下预测容错量子执行延迟

Boshuai Ye, Arif Ali Khan, Peng Liang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出通过slack ratio和Delta_max预测量子执行延迟,揭示静态T深度无法准确预测执行性能,实验证明Delta_max是预测延迟的最强指标。

Comments 10 pages, 10 figures. Code available at https://github.com/C2-Q/BARC/

详情

展开后加载摘要…

URL PDF HTML 收藏