arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-28 至 2026-04-28 共收录 26 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 26 篇

2604.24396 2026-04-28 cs.CV cs.AI 92%

Global Context or Local Detail? Adaptive Visual Grounding for Hallucination Mitigation

全局上下文还是局部细节?面向幻觉缓解的自适应视觉 grounding

Yubo Jiang, Xin Yang, Abudukelimu Wuerkaixi, Zheming Yuan, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics, Beihang University(北航航天学院) Longcat Interaction Team, Meituan(美团Longcat交互团队) Tianmushan Laboratory, Beihang University(北航天门山实验室)

专题命中 视觉定位与Grounding :grounding(title,title_cn);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);InternVL(abstract,abstract_cn)

AI总结 本文提出PND框架,通过双路径对比在解码过程中增强视觉真实性,减少幻觉并提升描述细节,无需模型微调。

Comments 9 pages, 8 figures, Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23366 2026-04-28 cs.AI cs.MA 90%

GSAR: Typed Grounding for Hallucination Detection and Recovery in Multi-Agent LLMs

GSAR:多智能体大语言模型中基于类型的 grounding 检测与恢复

Federico A. Kamelhar

机构 * Agentic AI Oracle Corporation(Agentic AI Oracle公司)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 GSAR 提出了一种 grounding 评估与规划框架,通过四类分类、证据权重分配、矛盾惩罚评分和三层决策函数,实现多智能体大语言模型中的 hallucination 检测与恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02791 2026-04-28 cs.CL 89%

Making Dialogue Grounding Data Rich: A Three-Tier Data Synthesis Framework for Generalized Referring Expression Comprehension

使对话 grounding 数据丰富:一种三层数据合成框架用于通用指称表达理解

Juexi Shao, Siyou Li, Yujian Gan, Chris Madge, Vanja Karan, Massimo Poesio

机构 * Queen Mary University of London(伦敦玛丽女王大学) Queen's University Belfast(贝尔法斯特女王大学) University of Vienna(维也纳大学) Utrecht University(乌得勒支大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn)

AI总结 本文提出三层数据合成框架,通过平衡真实性和可控性,生成可扩展的对话条件 grounding 监督,提升指称表达理解的性能。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 18142-18146

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24589 2026-04-28 cs.AI astro-ph.GA astro-ph.IM 89%

A systematic evaluation of vision-language models for observational astronomical reasoning tasks

对视觉语言模型在观测天文学推理任务中的系统评估

Wenke Ren, Hengxiao Guo, Wenwen Zuo, Xiaoman Zhang

机构 * Shanghai Astronomical Observatory, Chinese Academy of Sciences(上海天文台,中国科学院)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI

AI总结 本文系统评估了视觉语言模型在观测天文学推理任务中的表现,发现模型性能依赖于模态,且物理知识 grounding 对提升准确性至关重要。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18803 2026-04-28 cs.CV cs.AI 84%

LLM-as-Judge Framework for Evaluating Tone-Induced Hallucination in Vision-Language Models

用于评估视觉-语言模型中语气诱导幻觉的LLM-as-Judge框架

Zhiyuan Jiang, Weihao Hong, Xinlei Guan, Tejaswi Dhandu, Miles Q. Li, Meng Xu, Kuan Huang, Umamaheswara Rao Tida, Bingyu Shen, Daehan Kwak, Boyang Li

机构 * Kean University(凯恩大学) North Dakota State University(北达科他州立大学) McGill University(麦吉尔大学) University of Notre Dame(圣母大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Ghost-100基准,通过结构化提示强度框架评估不同模型在提示压力下的表现,发现H-Rate和H-Score在模型家族间显著分化,且某些模型对语气敏感度非单调。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24062 2026-04-28 cs.AI 83%

Grounding Before Generalizing: How AI Differs from Humans in Causal Transfer

在泛化之前建立基础:人工智能如何与人类在因果迁移中不同

Liangru Xiang, Yuxi Ma, Zhihao Cao, Yixin Zhu, Song-Chun Zhu

机构 * Department of Automation(清华大学自动化系) Institute for Artificial Intelligence(北京大学人工智能研究院) School of Psychological and Cognitive Sciences(北京大学心理与认知科学系) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health(北京行为与心理健康重点实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision language model(abstract);分类 cs.AI

AI总结 研究探讨了人工智能与人类在因果迁移中的差异,发现AI模型在缺乏环境基础映射时难以高效迁移,而人类能利用先验结构知识。文本条件中AI表现优异,但视觉信息反而降低性能,揭示AI依赖符号处理而非多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23121 2026-04-28 cs.RO cs.CV 81%

Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training

打破锁定:在低数据VLA后训练中保持可引导性

Suning Huang, Jiaqi Shao, Ke Wang, Qianzhong Chen, Jiankai Sun, Yanjiang Guo, Mac Schwager, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.CV

AI总结 本文提出DeLock方法,通过保留视觉 grounding 和测试时对比提示指导,解决VLA策略在低数据后训练中因过度专业化导致的概念和空间锁定问题,实验证明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11831 2026-04-28 cs.CV 79%

Towards High-Fidelity CAD Generation via LLM-Driven Program Generation and Text-Based B-Rep Primitive Grounding

通过LLM驱动的程序生成和基于文本的B-Rep基础构建实现高保真的CAD生成

Jiahao Li, Qingwang Zhang, Qiuyu Chen, Guozhan Qiu, Yunzhong Lou, Xiangdong Zhou

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出FutureCAD框架,利用LLM和BRepGround变压器生成高保真的CAD模型,通过自然语言指定几何选择并训练数据集提升生成性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07157 2026-04-28 cs.CV 79%

Multi-Scale Contrastive Learning for Video Temporal Grounding

多尺度对比学习用于视频时间定位

Thong Thanh Nguyen, Yi Bin, Xiaobao Wu, Zhiyuan Hu, Cong-Duy T Nguyen, See-Kiong Ng, Anh Tuan Luu

机构 * Institute of Data Science (IDS), National University of Singapore(数据科学研究所(IDS),新加坡国立大学) Tongji University(同济大学) Nanyang Technological University (NTU)(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出多尺度对比学习框架,通过多阶段视频编码器生成样本,无需数据增强或在线记忆库,提升视频时间定位的语义表达。

Comments Accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22805 2026-04-28 cs.CV cs.AI cs.SY eess.SY 79%

See No Evil: Semantic Context-Aware Privacy Risk Detection for AR

见不得恶:面向AR的语义上下文感知隐私风险检测

Jialu Liu, Yao Li, Zhuoheng Li, Huining Li, Ying Chen

机构 * Pennsylvania State University(宾夕法尼亚州立大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PrivAR框架,利用视觉语言模型进行AR环境中的语义隐私风险检测,通过上下文推理识别敏感信息并降低隐私泄露风险,实验表明其在准确率和F1分数上优于基线方法。

Comments Proc. IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17092 2026-04-28 cs.CV 77%

SPAGS: Sparse-View Articulated Object Reconstruction from Single State via Planar Gaussian Splatting

SPAGS:基于单一状态的稀疏视角关节物体重建(通过平面高斯溅射)

Di Wu, Liu Liu, Xueyu Yuan, Wenxiao Chen, Lijun Yue, Liuzhu Chen, Yiming Tang, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Tencent RoboticsX(腾讯机器人院)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种无需多视角观测的关节物体重建方法,通过平面高斯溅射实现稀疏视角下的高精度重建,结合视觉-语言模型实现开放词汇部分分割与参数估计。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23588 2026-04-28 cs.AI cs.CL cs.IR 74%

FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim Verification

FinGround:通过原子性声明验证检测和支撑金融幻觉

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 FinGround通过三阶段验证-支撑流程,针对金融文档问答中的计算错误进行验证和修正,有效降低幻觉率,其在金融领域具有重要应用价值。

Comments Accepted to ACL 2026 Industry Track. 14 pages, 1 figure, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19451 2026-04-28 cs.CV cs.AI 73%

LoFi: Location-Aware Fine-Grained Representation Learning for Chest X-ray

LoFi:面向胸部X光的基于位置的细粒度表示学习

Myeongkyun Kang, Yanting Yang, Xiaoxiao Li

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LoFi,通过联合优化sigmoid、标注和位置感知标注损失,提升胸部X光的检索和短语接地性能,实验表明在MIMIC-CXR和PadChest-GR数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24562 2026-04-28 cs.AI cs.CL cs.CY 70%

Towards Lawful Autonomous Driving: Deriving Scenario-Aware Driving Requirements from Traffic Laws and Regulations

迈向合法自动驾驶:从交通法规中推导场景感知的驾驶要求

Bowen Jian, Rongjie Yu, Hong Wang, Liqiang Wang, Zihang Zou

机构 * College of Transportation, Tongji University(同济大学交通运输学院) The Key Laboratory of Road and Traffic Engineering, Ministry of Education(教育部道路与交通工程重点实验室) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) College of Computer Science, University of Central Florida(佛罗里达中央大学计算机科学学院) Optixway AI

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种基于交通场景分类的新型方法,利用大语言模型推导法律要求,提升自动驾驶系统的合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23935 2026-04-28 cs.CV 70%

2nd of the 5th PVUW MeViS-Audio Track: ASR-SaSaSa2VA

第五届PVUW MeViS-Audio Track的第二名:ASR-SaSaSa2VA

Zhiyu Wang, Xudong Kang, Shutao Li

机构 * Hunan University(湖南大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出ASR-SaSaSa2VA框架,通过ASR将音频转换为文本描述,结合预训练文本引导视频分割模型实现高效的音频引导视频分割,解决了计算复杂度高、对齐困难和数据依赖性强的问题。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21277 2026-04-28 cs.AI 70%

Can MLLMs "Read" What is Missing?

LLMs能否

Jindi Guo, Chaozheng Huang, Xi Fang

机构 * DP Technology(DP技术)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 MMTR-Bench评估多模态大语言模型从视觉上下文直接重建遮蔽文本的能力,通过单页或多页输入测试,聚焦布局理解、视觉关联和知识整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22773 2026-04-28 cs.HC 67%

Trace Mutation in Human-LLM Dialogue: The Transcript as Forensic and Mitigation Surface

人类-大语言模型对话中的痕迹突变: transcripts作为取证与缓解表面

William J. Bensen

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 研究探讨了人类-LLM对话中'痕迹突变'现象,分析了两种突变形式及其对对话连续性的影响,指出其与编造和阿谀不同,且难以通过常规对话修复机制解决。

Comments 15 pages, 2 figures, 6 tables. Submitted to CHIWORK 2026 as Late-Breaking Work. Supplementary data: https://doi.org/10.5281/zenodo.19153940

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24703 2026-04-28 cs.SE cs.AI 57%

Defective Task Descriptions in LLM-Based Code Generation: Detection and Analysis

基于大语言模型的代码生成中的缺陷任务描述:检测与分析

Amal Akli, Mike Papadakis, Maxime Cordy, Yves Le Traon

机构 * University of Luxembourg(卢森堡大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出SpecValidator,通过轻量级模型检测任务描述缺陷,结果显示其在检测准确性与鲁棒性上优于其他模型,揭示了任务描述结构对LLM性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24083 2026-04-28 cs.AI cs.CL cs.CR 57%

The Kerimov-Alekberli Model: An Information-Geometric Framework for Real-Time System Stability

Kerimov-Alekberli模型:一个信息几何框架用于实时系统稳定性

Hikmat Karimov, Rahid Zahid Alekberli

机构 * Institute of Defense Technologies and Cybersecurity(国防技术与网络安全研究所) Azerbaijan Technical University(阿塞拜疆技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Kerimov-Alekberli模型,通过将非平衡热力学与随机控制相结合,构建了一个信息几何框架,用于实时系统稳定性的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23585 2026-04-28 cs.CL cs.IR cs.LG 57%

ComplianceNLP: Knowledge-Graph-Augmented RAG for Multi-Framework Regulatory Gap Detection

ComplianceNLP:基于知识图谱的多框架监管缺口检测RAG系统

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 ComplianceNLP通过整合知识图谱增强的RAG系统,实现监管变化自动监控、义务提取及合规缺口识别,其在监管缺口检测上达到87.7 F1,优于GPT-4o+RAG,且在实际部署中显著提升分析师效率。

Comments Accepted at ACL 2026 Industry Track. 19 pages, 15 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23424 2026-04-28 cs.LG cs.CL 57%

Evolve: A Persistent Knowledge Lifecycle for Small Language Models

Evolve:为小型语言模型设计的持久知识生命周期

Dikran Hovagimian

机构 * Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 Evolve通过持久知识库与小型模型结合,提升准确率并降低教师模型调用成本,采用语义连贯的段落存储方式,实现知识的自动合并与刷新,有效提升任务性能。

Comments 35 pages, 1 figure. Code and evaluation data: https://gitlab.com/dikran.hovagimian/evolve

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23344 2026-04-28 cs.CV 57%

Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection

探索开放词汇目标检测中的层次一致性与无偏目标性

Sanghoon Lee, Geon Lee, Hyekang Park, Bumsub Ham

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology (KIST)(韩国科学技术院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种新颖的伪标签框架,通过层次一致性校准和LoCLIP模型提升开放词汇目标检测的准确性与可靠性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23173 2026-04-28 cs.CV 57%

One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition

一个身份,多种角色:多模态实体指代用于增强视频情境识别

Balaji Darur, Amanmeet Garg, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad, India(IIIT海得拉尔学院计算机视觉研究所,印度) Amazon Prime Video, Seattle(亚马逊Prime视频,西雅图)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出多模态实体指代(MEC)方法,通过结合文本和视频信息提升视频情境识别的准确性和一致性,实验结果显示在描述和视觉定位方面均取得显著提升。

Comments Accepted to CVPR 2026 Findings. Project Page: https://katha-ai.github.io/projects/cinemec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22984 2026-04-28 cs.CV cs.GR 57%

BrickNet: Graph-Backed Generative Brick Assembly

BrickNet:基于图的生成积木组装

Peter Kulits, Cordelia Schmid

机构 * Inria, Ècole Normale Supèrieure, CNRS, PSL Research University(法国国家科学研究中心、巴黎高等师范学校、CNRS、巴黎萨克雷大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 BrickNet通过图结构生成积木构建序列,解决物理约束下的结构生成问题,提升生成序列的物理合理性。

Comments CVPR 2026; project page: https://kulits.github.io/BrickNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09297 2026-04-28 cs.RO 50%

One-Shot Real-World Demonstration Synthesis for Scalable Bimanual Manipulation

单次现实演示合成用于可扩展的双臂操作

Huayi Zhou, Kui Jia

机构 * HNuzhy

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出BiDemoSyn框架,通过单个现实示例生成大量高质量双臂操作演示,结合任务分解与视觉引导对齐,实现高效且物理可行的演示合成,提升机器人操作的泛化能力与数据效率。

Comments accepted by RSS 2026. The project link is https://hnuzhy.github.io/projects/BiDemoSyn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24104 2026-04-28 cs.CL 50%

Factual and Edit-Sensitive Graph-to-Sequence Generation via Graph-Aware Adaptive Noising

通过图感知自适应噪声生成事实和编辑敏感的图到序列生成

Aditya Hemant Shahane, Anuj Kumar Sirohi, Tanmoy Chakraborty, Prathosh A P, Sandeep Kumar

机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi, New Delhi, India(印度理工学院德里分校电子工程系) Indian Institute of Science, Bengaluru, India(印度科学研究所,班加罗尔,印度)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出DLM4G框架,通过自适应噪声策略提升图到序列生成的事实性和编辑敏感性,在多个数据集上优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏