arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7370 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7370 篇

2407.05256 2024-07-18 cs.CV cs.AI 73%

Unlocking Textual and Visual Wisdom: Open-Vocabulary 3D Object Detection Enhanced by Comprehensive Guidance from Text and Image

Pengkun Jiao, Na Zhao, Jingjing Chen, Yu-Gang Jiang

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05814 2024-07-09 cs.CV cs.AI cs.MM 73%

Cross-domain Few-shot In-context Learning for Enhancing Traffic Sign Recognition

Yaozong Gan, Guang Li, Ren Togo, Keisuke Maeda, Takahiro Ogawa, Miki Haseyama

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12716 2024-06-11 cs.CV cs.CL cs.LG 73%

BloomVQA: Assessing Hierarchical Multi-modal Comprehension

Yunye Gong, Robik Shrestha, Jared Claypoole, Michael Cogswell, Arijit Ray, Christopher Kanan, Ajay Divakaran

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments Accepted by ACL Findings (2024). Dataset available at https://huggingface.co/datasets/ygong/BloomVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14230 2024-05-24 cs.CV cs.AI cs.CL 73%

Boosting Medical Image-based Cancer Detection via Text-guided Supervision from Reports

Guangyu Guo, Jiawen Yao, Yingda Xia, Tony C. W. Mok, Zhilin Zheng, Junwei Han, Le Lu, Dingwen Zhang, Jian Zhou, Ling Zhang

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01959 2024-04-09 cs.CV cs.CR cs.LG 73%

Bi-LORA: A Vision-Language Approach for Synthetic Image Detection

Mamadou Keita, Wassim Hamidouche, Hessen Bougueffa Eutamene, Abdenour Hadid, Abdelmalik Taleb-Ahmed

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05136 2024-03-12 cs.AI cs.CV 73%

InstructDET: Diversifying Referring Object Detection with Generalized Instructions

Ronghao Dang, Jiangyan Feng, Haodong Zhang, Chongjian Ge, Lin Song, Lijun Gong, Chengju Liu, Qijun Chen, Feng Zhu, Rui Zhao, Yibing Song

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 29 pages (include Appendix) Published in ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10945 2023-12-19 cs.CV cs.CL cs.LG 73%

LaViP:Language-Grounded Visual Prompts

Nilakshan Kunananthaseelan, Jing Zhang, Mehrtash Harandi

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments The 38th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12231 2023-05-23 eess.IV cs.CV cs.LG 73%

Bi-VLGM : Bi-Level Class-Severity-Aware Vision-Language Graph Matching for Text Guided Medical Image Segmentation

Chen Wenting, Liu Jie, Yuan Yixuan

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.12614 2023-01-31 cs.RO cs.AI cs.CV 73%

RREx-BoT: Remote Referring Expressions with a Bag of Tricks

Gunnar A. Sigurdsson, Jesse Thomason, Gaurav S. Sukhatme, Robinson Piramuthu

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07643 2022-11-21 cs.CV cs.CL cs.LG 73%

Coarse-to-Fine Vision-Language Pre-training with Fusion in the Backbone

Zi-Yi Dou, Aishwarya Kamath, Zhe Gan, Pengchuan Zhang, Jianfeng Wang, Linjie Li, Zicheng Liu, Ce Liu, Yann LeCun, Nanyun Peng, Jianfeng Gao, Lijuan Wang

专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments NeurIPS 2022. Project Website: https://ashkamath.github.io/FIBER_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.09874 2022-10-18 cs.RO cs.AI cs.CV 73%

Open-vocabulary Queryable Scene Representations for Real World Planning

Boyuan Chen, Fei Xia, Brian Ichter, Kanishka Rao, Keerthana Gopalakrishnan, Michael S. Ryoo, Austin Stone, Daniel Kappler

专题命中 视觉定位与Grounding :visual language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments v2, added references to concurrent work and acknowledgments

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.10126 2022-09-22 cs.CV cs.LG 73%

Exploring Modulated Detection Transformer as a Tool for Action Recognition in Videos

Tomás Crisol, Joel Ermantraut, Adrián Rostagno, Santiago L. Aggio, Javier Iparraguirre

专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments 5 pages, 2 figures, 1 results chart

Journal ref JAIIO - JORNADAS ARGENTINAS DE INFORMATICA 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.12763 2021-10-13 cs.CV cs.CL cs.LG 73%

MDETR -- Modulated Detection for End-to-End Multi-Modal Understanding

Aishwarya Kamath, Mannat Singh, Yann LeCun, Gabriel Synnaeve, Ishan Misra, Nicolas Carion

专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.04626 2021-01-13 cs.CV cs.AI 73%

Predicting Relative Depth between Objects from Semantic Features

Stefan Cassar, Adrian Muscat, Dylan Seychell

专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06243 2026-01-21 cs.CL cs.AI 72%

CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning

CoT Referring: 通过 grounded 推理改进指称表达任务

Qihua Dong, Luis Figueroa, Handong Zhao, Kushal Kafle, Jason Kuen, Zhihong Ding, Scott Cohen, Yun Fu

机构 * Adobe Research(Adobe研究院) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :MLLM(abstract,comments);multimodal large language model(abstract);分类 cs.AI

AI总结 通过 grounded 推理改进指称表达任务,提出CoT Referring方法,提升多模态大语言模型在复杂指称场景中的性能。

Comments MLLM, Referring Expression Segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16860 2024-12-05 cs.CV 72%

Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs

Shengbang Tong, Ellis Brown, Penghao Wu, Sanghyun Woo, Manoj Middepogu, Sai Charitha Akula, Jihan Yang, Shusheng Yang, Adithya Iyer, Xichen Pan, Ziteng Wang, Rob Fergus, Yann LeCun, Saining Xie

专题命中 视觉定位与Grounding :MLLM(abstract,comments);grounding(abstract);分类 cs.CV

Comments NeurIPS 2024 (Oral). Website at https://cambrian-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17177 2026-08-19 cs.SE 新提交 71%

Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation

将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估

Michele Tufano, James McClure, José Cambronero, Runxiang Cheng, Sherry Y. Shi, Renyao Wei, Dorothy Chen, Franjo Ivančić, Livio Dalloro, Pat Rondon

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01785 2026-08-17 cs.CL cs.SE 版本更新 71%

Seeing is Coding: On the Effectiveness of Vision Language Models in Code Understanding

CodeOCR: 关于视觉语言模型在代码理解中的有效性

Yuling Shi, Chaoxiang Xie, Zhensu Sun, Yeheng Chen, Chenxu Zhang, Longfei Yun, Chengcheng Wan, Hongyu Zhang, David Lo, Xiaodong Gu

机构 * Shanghai Jiao Tong University China Hohai University China Singapore Management University Singapore Imperial College London United Kingdom East China Normal University \& Shanghai Innovation Institute China Chongqing University China Shanghai Jiao Tong University Hohai University Singapore Management University Imperial College London East China Normal University \& Shanghai Innovation Institute Chongqing University

专题命中 视觉定位与Grounding :vision language model(title)

AI总结 本文探讨多模态大语言模型在代码理解中的有效性,发现其可通过图像压缩显著提升效率,并在代码克隆检测等任务中表现出更强的抗压缩能力。

Comments ISSTA 2026 camera ready. Code and data are available at https://github.com/YerbaPage/CodeOCR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05061 2026-08-12 cs.CL 版本更新 71%

No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding

无免费标签:缺乏人类基准的LLM作为评判的局限性

Michael Krumdick, Charles Lovering, Varshini Reddy, Seth Ebner, Chris Tanner

机构 * Kensho Technologies MIT(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出BFF-Bench基准测试,通过专家评估LLM响应的正确性,揭示LLM作为评判在无人类基准时的局限性,显示当无正确参考时,LLM评判与人类专家的高一致性仅限于LLM能正确回答的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00669 2026-08-04 cs.IR 新提交 71%

GARDRec: Decision-Level Graph Grounding for Large Language Model Recommendation

GARDRec:面向大语言模型推荐的决策级图接地方法

Yong Wang, Hongliang Sun, Jinlan Liu, Hua Zhang, Dianbo Sui, Dianhui Chu, Zhiying Tu

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文针对现有图增强型LLM推荐器排序决策受用户-物品关系约束弱的问题,提出GARDRec框架,通过图接地技术提升下一项推荐的候选排序性能,经实验验证其优于代表性基线。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27136 2026-07-30 cs.IR 新提交 71%

KAMR: Grounding Generation via Knowledge-Aligned Multi-hop Retrieval

KAMR:基于知识对齐多跳检索的接地生成

Xiaochen Wang, Yuan Zhong, Haoyu Wang, Ting Wang, Fenglong Ma

专题命中 视觉定位与Grounding :grounding(title)

AI总结 该研究针对多跳检索中三元组排序与监督缺失问题,提出KAMR知识对齐多跳检索器,通过构建部分对齐数据集优化对比目标,在多基准与LLM主干上提升了多跳检索和下游问答性能。

Comments Accepted by COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21574 2026-07-24 cs.CL 新提交 71%

Surprisal Theory is Tautological (without Rational Grounding)

惊奇理论是同义反复的(缺乏理性基础)

Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 研究惊奇理论,指出其在无额外约束时是同义反复,任何难度模式都与某语言模型一致,无法证伪。长期被隐含假设掩盖,近期实证削弱该假设。结论是打破同义反复需理性主义干预,相关语言模型应源自非经验驱动模型。

Comments Under "Review" at ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01293 2026-07-03 cs.CL 新提交 71%

RuleChef: Grounding LLM Task Knowledge in Human-Editable Rules

RuleChef:将LLM任务知识扎根于可人工编辑的规则

Ádám Kovács, Nadia Verdha, Gábor Recski

机构 * KR Labs(KR实验室) TU Wien(维也纳工业大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 提出RuleChef框架,利用大语言模型为NLP任务生成可执行规则,并通过示例和人工反馈迭代优化,最终得到快速、确定且可检查的规则系统。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00895 2026-07-02 cs.CL 新提交 71%

Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and Documents

超越文档基础:代码、工具输出和文档上的跨度级幻觉检测

Ádám Kovács, Bowei He, Xue Liu, István Boros, Szilveszter Tóth, Gábor Recski

机构 * KR Labs(KR实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) TU Wien(维也纳工业大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 提出一个统一的跨度级幻觉检测基准,涵盖代码、工具输出、结构化文档和自然语言RAG数据,通过微调Qwen3.5-2B模型在跨域场景下显著优于现有方法。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24208 2026-06-24 cs.RO 新提交 71%

Grounding Generative Policies in Physics: Optimization-Guided Diffusion for Robot Control

将生成式策略基于物理:面向机器人控制的优化引导扩散

Sabrina Bodmer, René Zurbrügg, Tifanny Portela, Hao Ma, Alexandre Didier, Marco Hutter, Colin Jones, Melanie Zeilinger

机构 * ETH Zurich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 提出推理时优化框架,通过将扩散引导建模为约束优化问题,在采样中施加物理可行性约束,无需重训练即可提升机器人任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18134 2026-06-17 eess.AS 新提交 71%

Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning

通过说话人日志条件将口语大语言模型扩展到多说话人音频

Alexander Polok, Samuele Cornell, Sathvik Udupa, Jan Černocký, Shinji Watanabe, Lukáš Burget

专题命中 视觉定位与Grounding :grounding(title)

AI总结 提出基于说话人日志条件的口语语言模型,通过条件化声学编码器提取目标说话人表示,避免序列化输出训练导致的灾难性遗忘,在多个数据集上显著提升说话人属性转录性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10696 2026-05-22 cs.RO 71%

VRA: Grounding Discrete-Time Joint Acceleration in Voltage-Constrained Actuation

VRA:在电压受限致动器中接地离散时间联合加速度

Lingwei Zhang, Jiaming Wang, Tianlin Zhang, Zhitao Song, Xuanqi Zeng, Weipeng Xia, Zhongyu Li, Yun-hui Liu

机构 * Department of Mechanical and Automation Engineering(机械与自动化工程系) Hong Kong Embodied AI Lab(香港具身AI实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出VRA方法,通过将运动学加速度与电压受限致动器物理相联系,解决在电压受限情况下不可实现的加速度问题,实验表明该方法能消除不可实现的加速度,恢复一致的近约束执行并减少约束引起的振荡。

Comments 10 pages, Accepted by RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18653 2026-05-19 cs.MM 71%

Will It Go Viral? Grounding Micro-Video Popularity Prediction on the Open Web

它会流行吗?基于开放网络的微视频流行度预测

Ryang Heo, Dongha Lee

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出了一种基于开放网络的微视频流行度预测方法,通过引入实时开放网络上下文来提升预测准确性,展示了WEBSHORTS数据集和SHORTS-CAST框架在预测微视频流行度方面的有效性。

Comments Working Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05687 2026-05-11 cs.RO 71%

Contact-Grounded Policy: Dexterous Visuotactile Policy with Generative Contact Grounding

接触导向策略:具备生成接触基础的灵活视觉-触觉策略

Zhengtong Xu, Yeping Wang, Ben Abbatematteo, Jom Preechayasomboon, Sonny Chan, Nick Colonnese, Amirhossein H. Memar

机构 * Purdue University(普渡大学) Meta Reality Labs Research(Meta现实实验室) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出Contact-Grounded Policy,通过预测机器人状态和触觉反馈的耦合轨迹,生成接触基础的灵活视觉-触觉策略,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03059 2026-04-14 cs.HC cs.CL cs.ET cs.IR 71%

From Speech-to-Spatial: Grounding Utterances on A Live Shared View with Augmented Reality

从语音到空间:利用增强现实进行共享视图中话语的定位

Yoonsang Kim, Divyansh Pradhan, Devshree Jadeja, Arie Kaufman

机构 * Center for Visual Computing, Stony Brook University(石溪大学视觉计算中心)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出Speech-to-Spatial框架,通过语音指令生成空间定位的AR指导,无需额外线索或人工标注,提升任务效率和可用性。

Comments 11 pages, 6 figures. This is the author's version of the article that appeared at the IEEE Conference on Virtual Reality and 3D User Interfaces (IEEE VR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏