arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7302 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7302 篇

2508.08066 2025-08-21 cs.CV cs.AI cs.CL cs.LG 91%

ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model

Weitai Kang, Weiming Zhuang, Zhizhong Li, Yan Yan, Lingjuan Lyu

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校) Sony AI(索尼人工智能)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract)

Comments 8 pages for the main paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18577 2026-08-12 cs.CV 版本更新 91%

Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs

无基础的注意力:医学视觉语言模型中视觉解释的因果评估

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(萨伊勒实验室,纽黑文大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);grounding(title);LLaVA(abstract,abstract_cn);vision-language model(abstract)

AI总结 研究医学视觉语言模型中视觉解释的因果评估,通过多种方式审核注意力热图忠实度,发现没有评估的VLM满足忠实标准,热图虽视觉上安心但不忠实,临床解释需可控指标和因果扰动而非仅视觉检查。

Comments iMIMIC Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02791 2026-08-05 cs.CV 新提交 91%

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

更好、更强、更快、更广泛:基于多模态大型语言模型(MLLM)的结构化全掩码预测分割

Jiazhen Liu, Mingkuan Feng, Long Chen

机构 * The Hong Kong University of Science and Technology (HKUST)(香港科技大学)

专题命中 视觉定位与Grounding :MLLM(title,title_cn);grounding(abstract);分类 cs.CV

AI总结 STAMPlus通过结构化全掩码预测解耦自回归对话与非自回归掩码预测,解决了MLLM分割的三难问题,在提升性能的同时降低延迟,实现多类开放词汇等分割任务的SOTA表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01638 2026-08-04 cs.CV 新提交 91%

Dynamic Resolution Routing for Efficient Egocentric Grounding

面向高效自我中心 grounding 的动态分辨率路由

Huixin Sun, Wangbo Zhao, Fanyue Wei, Qiuxia Lin, Pengzhan Sun, Angela Yao

机构 * National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对自我中心视觉 grounding 中视觉 token 处理成本过高的问题,提出 SmartRes 框架,通过动态分辨率路由减少视觉 token,在 Ego4D 等数据集上实现 token 缩减与性能提升,代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11025 2026-08-04 cs.CV 版本更新 91%

Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images

图像推理中的测试时感知扩展:解决图像推理中的 grounding 困境

Zheng Jiang, Yiming Chen, Nan He, Jiahui Chen, Chaoyang Li, Houde Qian, Lifeng Sun

机构 * Tsinghua University(清华大学) Beijing University of Technology(北京工业大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出 TTSP 框架,通过测试时扩展感知解决图像推理中的 grounding 困境,通过生成多个感知轨迹并过滤不可靠轨迹来提升细粒度视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27823 2026-07-31 cs.CV 新提交 91%

Hallucinations Leave a Grounding Signature:Verifier-Guided Decoding for Selective Object Correction

幻觉留下 grounding 特征:用于选择性对象修正的验证器引导解码

Lei Yang, Xinze Liu, Dayan Wu, Ding Wang, Hengjie Zhu, Zihao Zhang, Tianzhu Hu, Hanqi Wu, Peng Fu, Zheng Lin

专题命中 视觉定位与Grounding :grounding(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对大型视觉语言模型的对象幻觉问题,提出基于内在 grounding 特征(IGS)的验证器引导解码(VGD)框架,在保留视觉理解和对象覆盖率的同时,实现了最先进的对象幻觉缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26913 2026-07-30 cs.CV 新提交 91%

Prior Directions: Why GUI Grounding Gets Locked in the Past

先验方向:为什么GUI grounding会被锁定在过去

Weile Gong, Zijian Lu, Mingcai Chen, Yiping Zuo, Xin He, Weibei Fan

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究探究视觉-语言模型的GUI grounding锁定问题,提出先验方向概念,发现其是锁定的关键,移除该方向分量可恢复视觉grounding。

Comments 13 pages, 8 figures. Code: https://github.com/phare111/prior-directions

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11957 2026-07-27 cs.CV 版本更新 91%

Anomalous Frame Detection Using VLM-Based Description Comparison for Extracting Expert-Specific Actions and Contextual Decision-Making Scenes with Intra-Video Self-Similarity

基于VLM描述比较的异常帧检测,用于提取特定专家操作和具有视频内自相似性的上下文决策场景

Ryo Sakai, Kaname Yokoyama

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文针对关键基础设施维护中专家知识传承问题,提出基于VLM描述比较检测异常帧的方法,可提取特定专家操作及上下文决策场景,在模拟实验中该方法的提取率高于传统方法,有效发现含专家知识的候选场景。

Comments 17 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17455 2026-06-29 cs.CV cs.RO 版本更新 91%

VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization

VLM引导的视觉地点识别用于行星级地理定位

Sania Waheed, Na Min An, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * Univ. of Southampton, UK(英国南安普顿大学) KAIST, South Korea(韩国科学技术院) QUT, Australia(昆士兰科技大学) Univ. of Essex, UK(英国埃塞克斯大学)

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出VLM与检索式VPR结合的混合框架,利用VLM生成先验约束搜索空间,再通过检索和重排序实现行星级地理定位,在街道和城市级别分别提升4.51%和13.52%。

Journal ref Proceedings of the Australasian Conference on Robotics and Automation (ACRA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22537 2026-06-26 cs.CV 新提交 91%

NegAS: Negative Label Guided Attention and Scoring for Out-of-Distribution Object Detection with Vision-Language Models

NegAS: 基于负标签引导的注意力与评分用于视觉语言模型的分布外目标检测

Yingjie Zhang, Shuai Li, Peng Wang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract,abstract_cn);分类 cs.CV

AI总结 提出NegAS框架,利用负标签引导注意力(NegA)和基于sigmoid的OOD评分函数(NegS),解决VLM检测器中OOD区域利用不足和评分不兼容问题,显著提升OOD检测性能。

Comments Accept to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14803 2026-06-16 cs.CV 新提交 91%

HSQ-VLM: A Novel Spatially-Constrained Quadrant Segmentation VLM Model for Explainability in Diabetic Retinopathy

HSQ-VLM: 一种用于糖尿病视网膜病变可解释性的新型空间约束象限分割VLM模型

Shivum Telang

机构 * Pittsburgh, Pennsylvania(宾夕法尼亚州匹兹堡)

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出HSQ-VLM,利用地标锚定笛卡尔交叉注意力机制和四象限拓扑潜在分割,实现眼底图像中病变的解剖精确量化与自然语言报告生成,在出血和微动脉瘤检测上达到99.6%和96.4%的灵敏度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22558 2026-05-22 cs.CV 91%

GeoWeaver: Grounding Visual Tokens with Geometric Evidence before Scene Reasoning

GeoWeaver: 在场景推理前通过几何证据 grounding 视觉 token

Deshui Miao, Xingsen Huang, Yameng Gu, Xin Li, Haijun Zhang, Ming-Hsuan Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Pazhou Lab (Huangpu)(琶洲实验室(黄埔)) Hainan University(海南大学) University of California at Merced(加州大学默塞德分校)

专题命中 视觉定位与Grounding :grounding(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出 GeoWeaver,一种在场景推理前通过几何证据对视觉 token 进行 grounding 的框架,以提升空间推理能力并保持多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06828 2026-08-03 cs.CV cs.AI 版本更新 91%

Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models

步级视觉 grounding 信念预测长视界视觉语言模型的分布外泛化

Md Ashikur Rahman, Md Arifur Rahman, Niamul Hassan Samin, Abdullah Ibne Hanif Arean, Juena Ahmed Noshin

机构 * The KOW Company(KOW公司) University of Dhaka(达卡大学) American International University - Bangladesh (AIUB)(孟加拉国美国国际大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究发现长视界视觉语言模型中,步级视觉接地信念预测分布外泛化能力,揭示了模型中间推理与视觉状态的一致性对鲁棒性的影响。

Comments Following the initial submission, we conducted additional experiments that materially changed our understanding of the problem. These new results do not support the central claim of the current manuscript. To avoid disseminating conclusions that we no longer consider adequately supported, we are withdrawing this version while we reassess the findings and prepare a substantially revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13156 2026-07-07 cs.CV cs.AI 新提交 91%

Iterative Visual Thinking and the Self-Correction Mirage in VLM Grounding

迭代视觉思维:通过视觉反馈教会视觉语言模型空间自我修正

Animesh Tripathy, Aswanth Krishnan

机构 * QpiAI India Pvt. Ltd(QpiAI印度私人有限公司)

专题命中 视觉定位与Grounding :VLM(title,abstract);grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出迭代视觉思维(IVT)框架,通过视觉反馈闭环和两阶段训练(SFT+GRPO),使视觉语言模型具备空间自我修正能力,在三个基准上提升指标2.4-3.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10978 2026-03-12 cs.CV cs.AI 91%

GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations

GroundCount: 通过目标检测对视觉语言模型进行接地以缓解计数幻觉

Boyuan Chen, Minghao Shao, Siddharth Garg, Ramesh Karri, Muhammad Shafique

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(title);vision language model(abstract);VLM(abstract)

AI总结 GroundCount通过目标检测提供空间接地,缓解视觉语言模型计数幻觉,提升准确率并减少推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15426 2025-07-17 cs.CV cs.AI 91%

Visual Position Prompt for MLLM based Visual Grounding

Wei Tang, Yanpeng Sun, Qinying Gu, Zechao Li

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(title,abstract);LLaVA(abstract);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10412 2026-08-12 cs.HC cs.CY 新提交 90%

When the Interviewer Is a Bot: Behavior, Breakdowns, and Trust in MLLM-Led Interviews

当面试官是机器人时:多模态大语言模型(MLLM)主导的面试中的行为、故障与信任

He Zhang, Kambinachi Chukwuma, ChanMin Kim, John M. Carroll

专题命中 视觉定位与Grounding :MLLM(title,title_cn);grounding(abstract)

AI总结 该研究通过构建InterviewBot系统开展实证研究,分析了MLLM主导面试的行为、故障与社会动态,为以人为中心的面试自动化提供设计启示。

Comments Accepted to ACM HCOMP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04574 2026-08-06 cs.CL 新提交 90%

When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents

当记忆“说谎”:VLM智能体中空间记忆过时的实证研究

Yushi Sun, Yanjie Zhang

机构 * Tencent LIGHTSPEED(腾讯光速工作室)

专题命中 视觉定位与Grounding :VLM(title,title_cn);grounding(abstract)

AI总结 该研究通过动态FrozenLake测试平台,探究了VLM智能体的空间记忆过时问题,发现文本可解性不代表视觉接地、信任过时记忆存在安全隐患、审核无法完全消除差距,明确了相关核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29649 2026-06-30 cs.CL 90%

Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages

VLM检测有害ASCII艺术的分辨率阈值:跨构建模式与语言的研究

Yikai Hua, Peter West

机构 * Department of Computer Science(计算机科学系) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(abstract)

AI总结 研究图像分辨率如何影响VLM检测有害ASCII艺术,发现检测率在特定分辨率阈值以上急剧下降,且基于单词的模式最难检测,揭示了VLM内容审核系统的系统性漏洞。

Comments 13 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17362 2026-06-17 cs.CV cs.AI cs.LG cs.RO 新提交 90%

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

DriveJudge: 用视觉-语言模型重新思考自动驾驶评估

Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

机构 * NVIDIA(英伟达)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出DriveJudge,结合规则评估与VLM推理,通过选择性调用物理规则函数实现可解释且上下文感知的驾驶评估,在驾驶质量分类和轨迹偏好选择任务上超越现有方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24564 2026-05-01 cs.CL cs.IR cs.IT math.IT 90%

MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG

MEG-RAG: 多模态证据 grounding 的量化研究以提升 RAG 中的证据选择

Xihang Wang, Zihan Wang, Chengkai Huang, Quan Z. Sheng, Lina Yao

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Zhejiang University(浙江大学) Peking University(北京大学) University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) CSIRO’s Data61(CSIRO 数据61)

专题命中 视觉定位与Grounding :grounding(title,title_cn);multimodal large language model(abstract)

AI总结 本文提出 MEG-RAG 框架,通过语义感知的多模态证据 grounding 方法提升 RAG 中的证据选择准确性与多模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10554 2026-05-05 cs.CV 90%

Grounding Everything in Tokens for Multimodal Large Language Models

基于令牌的多模态大语言模型的 grounding

Xiangxuan Ren, Zhongdao Wang, Liping Hou, Pin Tang, Guoqing Wang, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence(人工智能混合专家模型关键实验室) AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院) Central Research Institute, Huawei(华为中央研究院)

专题命中 视觉定位与Grounding :grounding(title,title_cn);multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出GETok方法,通过整合可学习的令牌词汇提升多模态大语言模型在2D空间中的物体定位能力,实验显示其在多种指引用例任务中表现更优。

Comments 19 pages, 16 figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03278 2025-03-06 cs.CV cs.CL 90%

Enhancing Abnormality Grounding for Vision Language Models with Knowledge Descriptions

Jun Li, Che Liu, Wenjia Bai, Rossella Arcucci, Cosmin I. Bercea, Julia A. Schnabel

专题命中 视觉定位与Grounding :grounding(title,abstract);vision language model(title);VLM(abstract);visual language model(abstract)

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29879 2026-07-01 cs.CV cs.AI 版本更新 90%

LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving

LWDrive: 基于逐层世界模型的视觉-语言模型自动驾驶规划

Chen Yang, Yuhao Wei, Ze Xu, Ziheng Zou, Shuang Liang, Delin Ouyang, Lingfeng Qi, Jie Li, Guofa Li

机构 * Chongqing University(重庆大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出LWDrive框架,通过逐层世界模型引导,将VLM输出的粗轨迹逐步细化为几何精确、多视角感知的规划轨迹,在NAVSIM基准上取得92.0分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11479 2026-06-12 cs.LG cs.AI cs.MA 版本更新 90%

Grammar of the Wave: Towards Explainable Multivariate Time Series Event Detection via Neuro-Symbolic VLM Agents

波的语法:通过神经符号VLM智能体实现可解释的多变量时间序列事件检测

Sky Chenwei Wan, Yifei Y. Wang, Tianjun Hou, Xiqing Chang, Aymeric Jan

机构 * AI Lab, SLB(SLB人工智能实验室) Télécom Paris, Institut Polytechnique de Paris, France(巴黎电信学院,巴黎高等理工学院,法国)

专题命中 视觉定位与Grounding :VLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出语言引导的时间序列事件检测(TSED)任务,通过事件逻辑树(ELT)将文本描述转化为结构化时序逻辑,并构建神经符号VLM智能体SELA,实现零/少样本事件检测与可解释推理。

Comments 8 pages (main text), 28 pages total including appendix. 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23883 2026-05-25 cs.CV cs.AI 90%

PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

PGT: 用于提升多模态大语言模型视觉定位的程序化生成任务

Rim Assouel, Amir Bar, Michal Drozdzal, Adriana Romero-Soriano

机构 * Mila - Qu\'ebec AI Institute FAIR at Meta Superintelligence Labs McGill University Canada CIFAR AI Chair

专题命中 视觉定位与Grounding :grounding(title,summary_cn);LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出程序化生成任务(PGT)框架,通过叠加几何基元生成密集监督信号,解耦视觉定位能力与语义先验,显著提升多模态大语言模型在细粒度理解任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22034 2026-05-22 cs.CV cs.AI 90%

AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding

AgroVG:一个大规模多源基准用于农业视觉 grounding

Haocheng Li, Juepeng Zheng, Zenghao Yang, Kaiqi Du, Guilong Xiao, Gengmeng Pu, Haohuan Fu, Jianxi Huang

机构 * China Agricultural University(中国农业大学) Sun Yat-sen University(中山大学) Tianjin University(天津大学) Tsinghua University(清华大学) Southwest Jiaotong University(西南交通大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV、cs.AI

AI总结 本文提出AgroVG基准,用于评估农业视觉 grounding能力,通过多源数据集和任务特定协议,评估模型在多目标、多实例和无目标场景下的性能,揭示了现有模型在农业视觉 grounding任务中的不足。

Comments 45 pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21954 2026-05-22 cs.CV cs.AI 90%

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

Dazhao Du, Liao Duan, Jian Liu, Tao Han, Yujia Zhang, Eric Liu, Xi Chen, Song Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) Xi’an Jiaotong University(西安交通大学) Tencent(腾讯)

专题命中 视觉定位与Grounding :grounding(title,title_cn);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型(MLLMs)在视频时间定位中的感知与生成之间的差距,提出了一种推理阶段的读取-再生成框架,通过利用注意力线索来提高时间定位的准确性,从而在三个视频时间定位基准上提升了MiMo-VL-7B、Qwen3-VL-8B和TimeLens-8B的性能。

Comments Project Website: https://ddz16.github.io/mllmsknowwhen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16871 2026-04-21 cs.AI cs.LG 90%

GRAIL: Autonomous Concept Grounding for Neuro-Symbolic Reinforcement Learning

GRAIL:自主概念 grounding 用于神经符号强化学习

Hikaru Shindo, Henri Rößler, Quentin Delfosse, Kristian Kersting

机构 * Technical University of Darmstadt(达姆施塔特技术大学) Google Intrinsic(谷歌内在) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Centre for Cognitive Science, TU Darmstadt(达姆施塔特技术大学认知科学中心)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI、cs.LG

AI总结 GRAIL通过环境交互自主 grounding 关系概念,利用大语言模型提供弱监督,提升在稀疏奖励和概念对齐问题中的性能,实验显示其在Atari游戏中表现优异。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13013 2024-04-22 cs.CV cs.AI cs.CL cs.LG 90%

Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models

Chuofan Ma, Yi Jiang, Jiannan Wu, Zehuan Yuan, Xiaojuan Qi

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏