arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-24 至 2026-06-24 共收录 23 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 23 篇

2605.01482 2026-06-24 cs.AI 版本更新 85%

Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization

通过群体相对策略优化在结构因果模型中 grounding 多跳推理

Yunhan Bu, Quan Zhang, Huaping Zhang, Guotong Geng, Chunxiao Gao, Askar Hamdulla, Juan Wang, Qiuchi Li, Baohua Zhang, Shuai Lei, Yunbo Cao, Zhunchen Luo

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院,乌鲁木齐,中国) Beijing Institute of Technology, Beijing, China(北京理工大学,北京,中国) Military Science Information Research Center, Academy of Military Science, Beijing, China(军事科学院军事科学信息研究中心,北京,中国)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 本文提出基于结构因果模型的多跳事实验证框架,通过群体相对策略优化解决推理链长度与准确率的平衡问题,实验表明其在HoVer和EX-FEVER数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24759 2026-06-24 cs.CV cs.AI 新提交 84%

UniDrive: A Unified Vision-Language and Grounding Framework for Interpretable Risk Understanding in Autonomous Driving

UniDrive: 面向自动驾驶可解释风险理解的统一视觉-语言与定位框架

Xiaowei Gao, Pengxiang Li, Yitai Cheng, Ruihan Xu, James Haworth, Stephen Law, Yun Ye

机构 * organization= Department of Earth Science \& Engineering, Imperial College London , city= London , postcode= SW7 2AZ , country= United Kingdom organization= SpaceTimeLab, Department of Civil, Environmental Geomatic Engineering, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom organization= Department of Computing, The Hong Kong Polytechnic University , city= Hong Kong , country= China organization= Trinity College, University of Oxford , city= Oxford , postcode= OX1 3BH , country= United Kingdom organization= Department of Geography, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom organization= Centre for Global Infrastructure Resilience, The Bartlett School of Sustainable Construction, University College London , city= London , postcode= WC1E 7HB , country= United Kingdom

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出UniDrive框架,通过融合时序推理与高分辨率感知分支,联合生成风险描述和边界框定位,在DRAMA-Reasoning基准上超越现有方法,提升小目标定位和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24884 2026-06-24 cs.RO cs.AI cs.LG 新提交 82%

InSight: Self-Guided Skill Acquisition via Steerable VLAs

InSight: 通过可引导的VLA实现自主技能获取

Maggie Wang, Lars Osterberg, Stephen Tian, Ola Shorinwa, Jiajun Wu, Mac Schwager

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出InSight框架,通过将VLA模型在基本动作层面变得可引导,实现自主技能获取,包括自动分割演示为基本动作和VLM引导的数据飞轮,无需人类演示即可学习新技能。

Comments Project website: https://insight-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11197 2026-06-24 cs.CV 版本更新 81%

MedP-CLIP: Medical CLIP with Region-Aware Prompt Integration

MedP-CLIP:具有区域感知提示集成的医学CLIP

Jiahui Peng, He Yao, Jingwen Li, Yanzhou Su, Sibo Ju, Yujie Lu, Jin Ye, Hongchun Lu, Xue Li, Lincheng Jiang, Min Zhu, Junlong Cheng

机构 * Sichuan University(四川大学) Xinjiang University(新疆大学) Alibaba Group(阿里巴巴集团) Fuzhou University(福州大学) Shanghai AI Laboratory(上海人工智能实验室) Southwest Jiaotong University(西南交通大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出MedP-CLIP,一种区域感知医学视觉语言模型,通过特征级区域提示集成机制,支持多种提示形式,在保持全局上下文的同时聚焦局部区域,在零样本识别、交互式分割等任务中显著优于基线方法。

Comments Accepted by Medical Image Analysis (MedIA)

Journal ref Medical Image Analysis, 113 (2026), 104193

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14792 2026-06-24 cs.CV 版本更新 77%

MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection

MSPL: 用于开放词汇目标检测的多步伪标签方法

Hojun Choi, Youngsun Lim, Jaeyo Shin, Hyunjung Shim

机构 * KAIST AI(韩国韩世大学AI研究所) Boston University(波士顿大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24344 2026-06-24 cs.LO cs.AI 新提交 74%

What Does ODRL Mean? A Cross-Level Ontological Grounding of Permissions, Prohibitions, and Duties in UFO-L

ODRL 意味着什么?UFO-L 中许可、禁止和义务的跨层次本体论基础

Daham M. Mustafa, Christoph Lange, Giancarlo Guizzardi, Diego Collarana, Christoph Quix, Stefan Decker

机构 * University of Twente, The Netherlands(特文特大学,荷兰) RWTH Aachen University, Aachen, Germany(亚琛工业大学,德国)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 针对 ODRL 策略评估器忽略规范立场、权威结构等问题,提出跨层次设计原则,将 ODRL 规则映射到 UFO-L 中的法律关联子,从两种扩展至八种法律立场,并在 Isabelle/HOL 中机械验证。

Comments Accepted at FOIS 2026 (16th International Conference on Formal Ontology in Information Systems), Vitória, Brazil; to appear in Frontiers in Artificial Intelligence and Applications, IOS Press. 16 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23888 2026-06-24 eess.IV cs.AI cs.CV 新提交 73%

E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis

E-MRL: 跨视图对齐的证据驱动多模态强化学习用于可靠的3D肿瘤分析

Sijing Li, Zhongwei Qiu, Zhuoya Wang, Boxiang Yun, Zhenyu Yi, Jianwei Xu, Wenqiao Zhang, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(华平实验室) Huazhong University of Science and Technology(华中科技大学) East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出跨视图对齐的证据驱动多模态强化学习框架E-MRL,通过将生成过程建模为“诊断-定位-验证”的马尔可夫决策过程,并引入跨视图一致性奖励,减少视觉幻觉并提升3D CT肿瘤诊断准确性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24208 2026-06-24 cs.RO 新提交 71%

Grounding Generative Policies in Physics: Optimization-Guided Diffusion for Robot Control

将生成式策略基于物理:面向机器人控制的优化引导扩散

Sabrina Bodmer, René Zurbrügg, Tifanny Portela, Hao Ma, Alexandre Didier, Marco Hutter, Colin Jones, Melanie Zeilinger

机构 * ETH Zurich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 提出推理时优化框架,通过将扩散引导建模为约束优化问题,在采样中施加物理可行性约束,无需重训练即可提升机器人任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24539 2026-06-24 cs.CV 新提交 70%

PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought

PointVG-R: 通过视觉思维链在多模态大语言模型中内化几何推理以实现精确指向定位

Ling Li, Bowen Liu, Zinuo Zhan, Jianhui Zhong, Ziyu Zhu, Bingcai Wei, Kenglun Chang, Zhidong Deng

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Wuhan University(武汉大学)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出PointVG-R,通过强化学习和冷启动数据内化几何推理,结合视觉思维链数据集EgoPoint-CoT,在指向性视觉定位任务中实现mIoU提升15.86个点的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23917 2026-06-24 cs.CV 新提交 70%

Trustworthy Image Authentication using Forensic Knowledge Graphs

使用取证知识图谱的可信图像认证

Tai D. Nguyen, Matthew C. Stamm

机构 * Drexel University(德雷塞尔大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出取证知识图谱(FKG)框架,通过结构化取证证据提取与推理实现可解释的图像伪造检测,优于现有检测器和视觉语言模型。

Comments Accepted and Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23835 2026-06-24 cs.CV eess.IV 新提交 70%

ABACUS: Adapting Unified Foundation Model for Bridging Image Count Understanding and Generation

ABACUS: 自适应统一基础模型,桥接图像计数理解与生成

Anindya Mondal, Sauradip Nag, Anjan Dutta

机构 * University of Surrey(萨里大学) Simon Fraser University(西蒙菲莎大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出ABACUS统一视觉语言模型,通过密度感知自适应缩放、边界感知计数策略和循环一致性GRPO,无需特定训练即可处理多种计数任务并生成计数忠实图像,在七个基准上达到最优。

Comments Under review, webpage: https://mondalanindya.github.io/ABACUS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24255 2026-06-24 cs.CV cs.AI 新提交 62%

Social Structure Matters in 3D Human-Human Interaction Generation

社会结构在三维人-人交互生成中的重要性

Zhongju Wang, Beier Wang, Yatao Bian, Pichao Wang, Zhi Wang, Daoyi Dong, Hongdong Li, Huadong Mo, Zhenhong Sun

机构 * University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学) NVIDIA(英伟达) Nanjing University(南京大学) University of Technology Sydney(悉尼科技大学) Australian National University(澳大利亚国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出Solo-to-Social框架,利用LLM规划社会结构(阶段分解、角色分配)并指导运动执行器生成协调的双人3D运动,解决文本驱动的人-人交互生成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23991 2026-06-24 cs.AI cs.LG cs.MA cs.RO 新提交 62%

Critique of Agent Model

智能体模型批判

Eric Xing, Mingkai Deng, Jinyu Hou

机构 * Institute of Foundation Models, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学基础模型研究所) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文区分了自动化与智能体,提出真正智能体需内化目标、身份、决策、自我调节和学习等结构,并设计了GIC通用智能体架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24498 2026-06-24 cs.CV 新提交 57%

VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection

VistaRef: 提升指向目标检测的视觉空间方位感知能力

Ling Li, Zhizhen Cai, Xinkun Wu, Ziyu Zhu, Jiaqing Lyu, Bowen Liu, Zhidong Deng

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Dalian University of Technology(大连理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出VistaRef框架,通过局部手部实体建模和几何射线建模模块增强空间方位感知,并引入方向一致性对齐损失,在指向目标检测任务中实现14个绝对点的精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24464 2026-06-24 cs.CV 新提交 57%

Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation

通过几何感知蒸馏提升文本驱动视频分割

Tianyu Zhu, Yingping Liang, Hesong Li, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出GeoLaV两阶段框架,通过单目几何预训练和几何感知蒸馏,将3D几何知识从图像迁移到视频,提升文本驱动视频分割的时空一致性和语言定位能力,在多个基准上达到最优。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24414 2026-06-24 cs.AI 新提交 57%

Cycle-Consistent Neural Explanation of Formal Verification Certificates

形式验证证书的循环一致性神经解释

Andoni Rodriguez, Alberto Pozanco, Daniel Borrajo

机构 * J.P. Morgan AI Research(摩根大通人工智能研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出循环一致性神经架构,通过前向和逆向网络结合符号验证器,生成忠实于形式验证证书的自然语言解释,在金融合规领域测试中达到90.0%的循环验证正确性,比多LLM基线高13.9个百分点。

Comments 15 pages of main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24333 2026-06-24 cs.CV 新提交 57%

UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation

UniTranslator:一种用于端到端图像内机器翻译的统一多模态框架

Jiahao Lyu, Pei Fu, Zhenhang Li, Shaojie Zhang, Jiahui Yang, Yu Zhou, Can Ma, Zhenbo Luo, Jian Luan

机构 * MiLM Plus, Xiaomi Inc(小米公司MiLM Plus) Binghamton University(宾汉姆顿大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出UniTranslator统一框架,通过理解-生成对齐模块和空间掩码解码器解决翻译理解与文本编辑的冲突及空间错位问题,在多个基准上实现最先进性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23915 2026-06-24 cs.CL cs.IR cs.LG 新提交 57%

Do LLM Attribution Metrics Transfer? Auditing Retrieval-Augmented Generation Evaluation Across Datasets and Constructs

LLM归因指标是否可迁移?跨数据集和构念的检索增强生成评估审计

Tianyu Ding, Aditya Nannapaneni, Juan Pablo De la Cruz Weinstein

机构 * Amazon Web Services(亚马逊云服务)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本研究审计了八种自动归因评分器在三个评估构念上的表现,发现没有评分器能在所有数据集上保持最佳性能,指标排名会反转,且简单选择最佳平均评分器会导致显著遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22775 2026-06-24 stat.ME cs.LG 新提交 57%

Target-Aware Linear Regression Under Distribution Shift

分布漂移下的目标感知线性回归

Zhewen Hou, Tian Zheng

机构 * Department of Statistics(统计学系) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 针对训练与部署间的分布漂移,提出混合损失估计器作为目标感知基准,并开发了约束矩匹配和两阶段估计两种计算可行方案,推导渐近均方误差并比较性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24610 2026-06-24 cs.CL 新提交 50%

Same Lesson, Different Story: Cross-Lingual Reconstruction of Cultural Narratives in Large Language Models

同一教训,不同故事:大型语言模型中文化叙事的跨语言重构

Jory Alshaalan, Haya Albaker, Abeer Aldayel, Aljawharah Alabdullatif, Rehab Alahmadi

机构 * College of Computer and Information Sciences(计算机与信息科学学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究通过跨语言谚语集和四种LLM生成叙事,评估模型在跨语言条件下是否保留文化意义,发现跨语言提示基本保留语义但改变叙事结构,且模型间存在强收敛。

Comments This paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24448 2026-06-24 cs.RO 新提交 50%

Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos

监督幸存信息:基于几何引导的合成机器人视频VLA适配

Danze Chen, Yanzhe Chen, Qiming Huang, Zhijun Cao, Chen Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学 Show Lab)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出GRA方法,从合成视频中提取几何信息(2D末端执行器路径点)监督视觉表征,仅用真实演示训练动作头,在真实机器人任务中优于伪动作基线。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10452 2026-06-24 cs.CL 50%

NOSE: Neural Olfactory-Semantic Embedding with Tri-Modal Orthogonal Contrastive Learning

NOSE:神经嗅觉-语义嵌入与三模态正交对比学习

Yanyi Su, Hongshuai Wang, Zhifeng Gao, Jun Cheng

机构 * State Key Laboratory of Physical Chemistry of Solid Surface, College of Chemistry and Chemical Engineering, Xiamen University, Xiamen, China(厦门大学固体表面物理化学国家重点实验室,化学与化学工程学院,厦门,中国) DP Technology(DP技术) Laboratory of AI for Electrochemistry (AI4EC), Tan Kah Kee Innovation Laboratory (IKKEM), Xiamen, China(电化学人工智能实验室(AI4EC),淡凯实验室(IKKEM),厦门,中国) Institute of Artificial Intelligence, Xiamen University, Xiamen, China(人工智能研究院,厦门大学,厦门,中国)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出NOSE框架,通过三模态正交对比学习实现分子结构、受体序列和语言描述的对齐,解决嗅觉路径表示学习的碎片化问题,实现生物基础与语义可解释性的统一。

Comments Accepted to the ACL 2026 Main Conference

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2026, 19615-19647

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18542 2026-06-24 cs.CL 版本更新 50%

Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs

业务即规则:面向LLM的业务规则流建模基准与框架

Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出BREX基准(409份真实业务文档与2855条专家标注规则)和ExIde框架,通过可执行伪代码生成显式建模规则依赖,在13个LLM上验证了可执行接地作为归纳偏置的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏