arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-07 至 2026-08-07 共收录 24 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 24 篇

2608.06154 2026-08-07 cs.RO cs.AI cs.CV 新提交 91%

Visual Grounding in Zero-Shot Vision-Language Control

零样本视觉语言控制中的视觉 grounding

J. de Curtò, Dayani Plasencia, Diego Sánchez, I. de Zarzà

专题命中 视觉定位与Grounding :grounding(title,title_cn);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文针对零样本视觉语言控制中VLMs决策是否基于视觉输入的问题,通过多组消融实验分析了多种VLMs的表现,提出对称共识守护者方法,验证了VLMs可作为有界的危险助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21138 2026-08-07 cs.CV 版本更新 81%

SEED: Simple ViT and Evolving Harness for Explainable Text Forgery Detection

SEED: 用于可解释文本伪造检测的简单ViT与演化框架

Kahim Wong, Kemou Li, Yiming Chen, Haiwei Wu, Jiantao Zhou

机构 * State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系智慧城市物联网国家重点实验室) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 提出SEED系统,结合相似性引导数据增强、单一ViT联合检测与定位、以及基于MLLM的演化报告生成,在ACM MM 2026文本伪造挑战赛中获得第三名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14538 2026-08-07 cs.AI cs.LG 版本更新 81%

Symbol Grounding in Neuro-Symbolic AI: A Gentle Introduction to Reasoning Shortcuts

神经符号AI中的符号接地:推理快捷方式的入门介绍

Emanuele Marconato, Samuele Bortolotti, Emile van Krieken, Paolo Morettin, Elena Umili, Antonio Vergari, Efthymia Tsamoura, Andrea Passerini, Stefano Teso

机构 * University of Trento(特伦托大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Sapienza University of Rome(罗马大学) University of Edinburgh(爱丁堡大学) Huawei Labs(华为实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨神经符号AI中推理快捷方式的问题,分析其成因与影响,并提供解决方法与策略,以提升模型的可靠性和可信度。

Comments Published on JAIR (Integration of Logical Constraints in Deep Learning special track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05569 2026-08-07 cs.CV 新提交 79%

CoordRefer: Coordinate-Aware 3D Visual Grounding from Multiview Images

CoordRefer:基于多视图图像的坐标感知三维视觉定位

Haijie Li, Jiaxin Zhang, Dave Zhenyu Chen, Youyu Chen, Yanmin Wu, Jian Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出CoordRefer框架,解耦坐标帧选择与坐标条件三维定位,在ScanRefer数据集上实现定位精度提升,性能优于坐标不可知基线及部分显式三维输入方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13621 2026-08-07 cs.CV 版本更新 79%

Visual Intention Grounding for Egocentric Assistants

面向第一人称视角助手的视觉意图定位

Pengzhan Sun, Junbin Xiao, Tze Ho Elden Tse, Yicong Li, Arjun Akula, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Google DeepMind(谷歌DeepMind)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出首个第一人称视觉意图定位数据集EgoIntention,及推理至定位(RoG)指令微调方法,解决多模态模型在第一人称视角下的意图定位问题,实现了统一的视觉定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05341 2026-08-07 cs.CV cs.LG 新提交 79%

Positive-Unlabeled Preference Optimization For Chest X-ray Report Generation

面向胸部X射线报告生成的正例-无标签偏好优化

Yuta Kobayashi, Pradyun Ramesh, Muhammad Ahmed Chaudhry, Vincent Jeanselme, Judy Wawira Gichoya, Sanmi Koyejo, Kathleen Capaccione, Shalmali Joshi

机构 * Columbia University(哥伦比亚大学) Stanford University(斯坦福大学) Emory University(埃默里大学)

专题命中 视觉定位与Grounding :VLM(summary_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 该研究针对放射报告生成VLM的遗漏噪声问题,提出PU-DPO框架,将未提及项视为无标签,通过对比对优化,提升病理检测率与隐藏正例恢复能力,增强对遗漏噪声的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05699 2026-08-07 cs.CV 新提交 77%

TAU-Bench: From Anomaly Instance Tracking to Fine-Grained Video Anomaly Understanding

TAU-Bench:从异常实例跟踪到细粒度视频异常理解

Kepeng Yang, Dongxuan Liu, Rongxin Gao, Zixin Su, Rui Wu, Shuzhao Xie, Chenxin Li, Panwang Pan, Yuzhi Huang, Yue Huang, Jingyan Jiang

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 该研究引入TAU-Bench这一以跟踪为核心的基准,用于联合评估异常实例跟踪与细粒度视频异常理解,发现现有视觉-语言模型存在语义推理与视觉接地的差距,为构建更可靠的视频异常理解系统提供了关键评估方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05876 2026-08-07 cs.AI cs.CL 新提交 74%

Personalized Deep Research Query Refinement with Graph-Scaffolded Evidence Grounding

基于图支架证据锚定的个性化深度研究查询优化

Soojin Yoon, Dongha Lee

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本研究提出G-STEER方法,通过图支架证据锚定优化用户请求为个性化研究规范,在提升深度研究智能体报告个性化的同时,大幅减少向用户提问的数量。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06075 2026-08-07 cs.CV cs.AI 新提交 73%

Domain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal Case

面向智能体图像编辑的领域 grounded 候选选择:以阴影去除为例

Shilin Hu, Jingyi Xu, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究以阴影去除为例,提出领域 grounded 的智能体候选选择流程,结合物理原理约束商用视觉-语言模型的生成,在 ShadowRemovalRefine 基准上使 CDD 降低至少 47%,证明经典低级视觉先验仍具实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06277 2026-08-07 cs.CV cs.LG 版本更新 73%

Dynamic Object Masks as Goal Representations for Visual Goal-Conditioned Reinforcement Learning

动态目标掩码作为视觉目标条件强化学习的目标表示

Fahim Shahriar, Cheryl Wang, Alireza Azimi, Gautham Vasan, Hany Hamed, Abhishek Naik, A. Rupam Mahmood, Colin Bellinger

机构 * University of Alberta(阿尔伯塔大学) McGill University(麦吉尔大学) University of Ottawa(渥太华大学) AMII CIFAR Canada AI Chair(CIFAR加拿大人工智能主席) Vector Institute(向量研究所)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 该研究针对视觉目标条件强化学习,提出动态目标掩码作为目标表示,结合Detic等预训练检测器生成掩码,在机械臂和仿真导航任务中实现高成功率与高效学习,支持仿真到现实迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05864 2026-08-07 cs.AI 新提交 70%

Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs?

视觉感知不等于决策:多模态大语言模型能成为有效的首席执行官吗?

Yuyang Dai, Xueqing Peng, Yuxia Wang, Preslav Nakov, Zhuohan Xie

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 该研究构建C-SUITEBENCH多模态基准,评估9个前沿模型作为CEO的决策能力,发现多模态输入可提升证据推理但会损害受限资源分配,揭示多模态智能体的视觉感知与受限行动是可分离瓶颈。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05792 2026-08-07 cs.AI 新提交 70%

When Agentic AI Meets Integrated Sensing and Communication

当智能体AI遇上集成感知与通信

Kai Li, Conggai Li, Sarah Ali Siddiqui, Syed Sohail Ahmed, Xin Yuan, Shenghong Li, Wei Ni

机构 * University of Luxembourg(卢森堡大学) CSIRO(联邦科学与工业研究组织) Qassim University(卡西姆大学) Edith Cowan University(伊迪丝·考恩大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本综述提出智能体AI与集成感知通信结合的AISAC范式,构建六阶段闭环框架与五成熟度等级,梳理相关领域进展,分析交叉需求,发现现有系统智能体成熟度不足,并指出多方面开放挑战。

Comments 35 pages, 132 references, 10 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04955 2026-08-07 cs.CV 版本更新 70%

Towards Valid B-Rep Generation: Training-Free Wireframe Anomaly Detection and Repair

面向有效边界表示(B-Rep)生成:无需训练的线框异常检测与修复

Jingyu Wu, Youcheng Cai, Tengyu Luo, Ligang Liu

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对CAD模型B-Rep生成中线框的几何拓扑异常问题,提出无需训练的WDR框架,通过GTAD检测风险、EGGTR修复,提升了B-Rep有效性且保留模型质量,可集成至多种生成流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01348 2026-08-07 cs.CV 版本更新 70%

Prompt-Driven Simulation with Feature Perturbation for Cross-Domain Few-Shot Object Detection

面向跨域小样本目标检测的、结合特征扰动的提示驱动模拟方法

Linhai Zhuo, Junxi Cai, Tianwen Qian, Qingping Zheng, Yang Liu

机构 * Fuzhou University(福州大学) Xiamen University(厦门大学)

专题命中 视觉定位与Grounding :VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 本文提出PSP-FSOD框架,结合提示驱动域模拟与特征扰动正则化,缓解跨域小样本目标检测的域偏移与标注数据不足问题,在多个基准上实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05730 2026-08-07 cs.HC 新提交 67%

SpaceVLA: Spatially Grounded VLA for Robotic Manipulation with User-Authored Grasp and Place Anchors

SpaceVLA:用于机器人操作的空间 grounding VLA,支持用户编写的抓取与放置锚点

Daniia Zinniatullina, Iaroslav Kolomiets, Mikhail Konenkov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

专题命中 视觉定位与Grounding :grounding(title_cn)

AI总结 本研究针对VLA模型操作时缺乏显式空间意图的问题,提出视觉意图锚点的XR流程,通过微调OpenVLA-7B的SpaceVLA模型,在Unity试验中实现91.25%抓取成功率,完成机器人抓取放置任务。

Comments A poster for the ISMAR conference, 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14750 2026-08-07 eess.AS cs.AI cs.CV cs.SD 版本更新 62%

Pixel-TTS: Image based Text Rendering for Robust Text-to-Speech

Pixel-TTS: 基于图像的文字渲染实现鲁棒文本转语音

Adarsh Arigala, Arjun Gangwar, S Umesh, Yova Kementchedjhieva

机构 * SPRING Lab, Indian Institute of Technology, Madras, India(SPRING实验室,印度理工学院,马德拉斯,印度) MBZUAI, UAE(MBZUAI,阿联酋)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出Pixel-TTS框架,将文本渲染为图像并通过2D卷积生成嵌入,消除嵌入矩阵扩展,提升对未见字符和拼写变体的鲁棒性,实现零样本泛化。

Comments 11 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14299 2026-08-07 cs.CV cs.LG 版本更新 62%

What Drives Test-Time Adaptation for CLIP? A Controlled Empirical Study from an Update Perspective

什么驱动了CLIP的测试时适应?从更新视角进行的受控实证研究

Jiazhen Huang, Xiao Chen, Zhiming Liu, Yaru Sun, Jingyan Jiang, Zhi Wang

机构 * Tsinghua University(清华大学) Shenzhen Technology University(深圳技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文通过受控实证研究,从更新视角分析了CLIP测试时适应方法的驱动因素,揭示了适应增益主要来自测试时证据和可靠代理,而非繁重优化,并指出无单一范式普遍最优。

Comments Benchmark and codes are available at https://github.com/walawalagoose/TTABC

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05983 2026-08-07 cs.CV 新提交 57%

Universal Concept Disruption for SAM3 Image Segmentation

用于SAM3图像分割的通用概念干扰

Hao Wang, Yuxuan Zhang, Wei Yang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对SAM3图像分割的对抗鲁棒性空白,提出通用概念干扰(UCD)攻击方法,在多数据集上显著降低SAM3的分割性能,且扰动可跨SAM3.1及视频推理迁移,仅有限恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05219 2026-08-07 cs.AI 新提交 57%

When Privileged Guidance Misaligns: State-Matched Routing and Contextualized Self-Distillation for Multi-Turn Agents

当特权指导出现错位:面向多轮智能体的状态匹配路由与语境化自蒸馏

Junzhuo Liu, Weiwei Li, Jun Ling, Peng Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对多轮智能体特权指导的状态-参考不匹配问题,提出SMRC-SD方法,通过状态匹配路由与语境化自蒸馏提升了ALFWorld和WebShop任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01905 2026-08-07 cs.CV 版本更新 57%

PhotoHOI: Synthesizing 3D Hand-Object Interactions from a Single RGB Photograph

PhotoHOI:从单张RGB照片合成3D手-物体交互

Zhenhao Zhang, Jiajun Zhang, Wei Min, Yebin Liu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 PhotoHOI从单张RGB照片与开放词汇指令合成3D手-物体交互,通过视觉-语言模型解析任务规格、规划碰撞感知轨迹、学习接触与抓取先验,在GRAB、H2O数据集及真实照片上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11402 2026-08-07 cs.CV 版本更新 57%

SCD4VPR: Multi-modal Scene Change Detection for Long-term Visual Place Recognition Database Update

基于视觉-语言表示学习的场景变化检测

Diwei Sheng, Vijayraj Gohil, Satyam Gaba, Zihan Liu, Giles Hamilton-Fletcher, John-Ross Rizzo, Yongqing Liang, Chen Feng

机构 * New York University(纽约大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 本文提出LangSCD框架,通过融合语言和视觉信息提升场景变化检测的鲁棒性,引入几何-语义匹配模块和多类标注数据集NYC-CD,实验证明其在多个基准上的优越性能。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06022 2026-08-07 cs.CL q-bio.GN 新提交 50%

EpiBench: Can LLMs Understand Epitopes for Antibody Drug Discovery?

EpiBench:大型语言模型能否为抗体药物发现表位?

Zirui Wang, Jiaqi Wang, Qinghan Wang, Yuzhi Xu, Gang Du, Tingjun Hou, Odin Zhang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究提出用于评估大型语言模型表位推理能力的基准EpiBench,发现现有通用LLMs在抗体药物发现相关表位推理上仍存局限,为改进序列感知型生物医学LLMs提供了测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05917 2026-08-07 cs.SE 新提交 50%

Escaping the Self-Repair Trap: Improving Test Oracle Generation via Dual-Context Awareness

跳出自修复陷阱:通过双上下文感知改进测试预言生成

Kefan Li, Hongyue Yu, Yuan Yuan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对迭代自修复引发的自修复陷阱问题,提出非迭代高效框架DCAware,结合结构化静态上下文与动态状态,在低计算成本下提升测试预言的故障检测效果

Comments Accepted to ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05957 2026-08-07 cond-mat.mtrl-sci 新提交 50%

ASE2SPRKKR: a unified Python framework integrating the Spin-Polarized Relativistic Korringa-Kohn-Rostoker method into the Atomic Simulation Environment

ASE2SPRKKR:将自旋极化相对论Korringa-Kohn-Rostoker(SPR-KKR)方法集成到原子模拟环境(ASE)的统一Python框架

Ridha Eddhib, Matyáš Novák, Hubert Ebert, Aki Pulkkinen, Ján Minár

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究人员开发了将SPR-KKR集成到ASE的Python框架ASE2SPRKKR,扩展了Atoms对象功能,支持多类材料计算,符合FAIR原则,为相关代码融入现代材料发现工作流提供了蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏