arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7314 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7314 篇

2506.06006 2026-06-04 cs.CV cs.AI cs.CL 87%

Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics

视觉语言模型能预测未来状态吗?从逆动力学引导世界模型

Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

机构 * Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) NVIDIA(NVIDIA公司) University of Groningen(格罗宁根大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文发现视觉语言模型(VLM)难以直接进行前向动力学预测(FDP),但逆动力学预测(IDP)更容易学习,并利用IDP通过弱监督学习和推理时验证两种策略引导FDP,在Aurora-Bench上取得与最先进图像编辑模型竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10611 2026-04-03 cs.CV cs.AI 87%

Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding

Molmo2:具有视频理解和 grounding 的开放权重和数据的视觉语言模型

Christopher Clark, Jieyu Zhang, Zixian Ma, Jae Sung Park, Mohammadreza Salehi, Rohun Tripathi, Sangho Lee, Zhongzheng Ren, Chris Dongjoo Kim, Yinuo Yang, Vincent Shao, Yue Yang, Weikai Huang, Ziqi Gao, Taira Anderson, Jianrui Zhang, Jitesh Jain, George Stoica, Winson Han, Ali Farhadi, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(title);分类 cs.CV、cs.AI

AI总结 Molmo2 是一种开放源代码的视频语言模型,通过7个新视频数据集和2个多图像数据集,实现了单图像、多图像和视频任务中的点驱动 grounding 能力,其8B模型在短视频计数和描述任务中表现优异,在视频 grounding 任务中超越了现有开源和专有模型。

Comments Updated first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05895 2025-08-06 cs.CV cs.AI 87%

Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI

Benjamin Raphael Ernhofer, Daniil Prokhorov, Jannica Langner, Dominik Bollmann

机构 * SPARKS Solutions GmbH(SPARKS解决方案有限公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19103 2024-12-02 cs.CV cs.CL 87%

VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models

Jeongho Ju, Daeyoung Kim, SunYoung Park, Youngjune Kim

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,comments);grounding(abstract,comments);分类 cs.CV

Comments 24 pages, 15 figures, 4 tables. Model weights at https://huggingface.co/NCSOFT/VARCO-VISION-14B. Benchmarks released at NCSOFT's HuggingFace repositories (K-MMBench, K-SEED, K-MMStar, K-DTCBench, K-LLaVA-W). VARCO-VISION is an open-source Korean-English VLM with OCR, grounding, and referring capabilities

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27365 2026-05-28 cs.CV cs.AI cs.LG cs.RO 87%

LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding

LocateAnything: 基于并行框解码的快速高质量视觉定位

Shihao Wang, Shilong Liu, Yuanguo Kuang, Xinyu Wei, Yangzhou Liu, Zhiqi Li, Yunze Man, Guo Chen, Andrew Tao, Guilin Liu, Jan Kautz, Lei Zhang, Zhiding Yu

机构 * The Hong Kong Polytechnic University(香港理工大学) Princeton University(普林斯顿大学) Nanjing University(南京大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出并行框解码(PBD)方法,将边界框和点作为原子单元单步解码,结合大规模数据集LocateAnything-Data,实现高效统一的目标定位与检测,在保持高精度同时显著提升解码吞吐量。

Comments fix github link

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04279 2026-05-26 cs.CL 87%

ECG-R1: Protocol-Guided and Modality-Agnostic MLLM for Reliable ECG Interpretation

ECG-R1: 协议引导且模态无关的可靠心电图解读多模态大语言模型

Jiarui Jin, Haoyu Wang, Xingliang Wu, Xiaocheng Fang, Xiang Lan, Zihan Wang, Deyun Zhang, Bo Liu, Yingying Zhang, Xian Wu, Hongyan Li, Shenda Hong

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) National Institute of Health Data Science, Peking University(北京大学健康数据科学国家研究院) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Tianjin Institute of Cardiology, the Second Hospital of Tianjin Medical University(天津医科大学第二医院心内科) National University of Singapore(新加坡国立大学) Jarvis Lab, Tencent(腾讯 Jarvis实验室) HeartVoice Medical Technology(HeartVoice医疗科技)

专题命中 视觉定位与Grounding :MLLM(title,abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 提出ECG-R1,通过协议引导数据生成、模态解耦架构和强化学习,实现可靠的心电图解读。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02839 2026-05-26 cs.RO 87%

Language Movement Primitives: Grounding Language Models in Robot Motion

语言运动基元:将语言模型锚定在机器人运动中

Yinlong Dai, Benjamin A. Christie, Daniel J. Evans, Dylan P. Losey, Simon Stepputtis

机构 * Collab , Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, VA 24061(合作组,机械工程系,弗吉尼亚理工学院,黑斯堡,VA 24061) TEA Lab , Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, VA 24061(TEA实验室,机械工程系,弗吉尼亚理工学院,黑斯堡,VA 24061)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);grounding(title)

AI总结 提出语言运动基元(LMP)框架,通过将视觉语言模型(VLM)推理与动态运动基元(DMP)参数化结合,实现零样本机器人操作任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22519 2026-04-27 cs.RO 87%

Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding

通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型

Khoa Vo, Taisei Hanyu, Yuki Ikebe, Trong Thang Pham, Nhat Chung, Minh Nhat Vu, Duy Nguyen Ho Minh, Anh Nguyen, Anthony Gunderman, Chase Rainwater, Ngan Le

机构 * University of Arkansas(阿拉巴马大学) National University of Singapore(新加坡国立大学) TU Wien(维也纳技术大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) University of Stuttgart(斯图加特大学) University of Liverpool(利物浦大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本文提出OBEYED-VLA框架,通过分离感知接地与动作推理提升视觉-语言-动作模型在现实环境中的鲁棒性,特别是在存在干扰物、目标缺失和背景变化等挑战性场景中表现优异。

Comments Under review. Project website: https://uark-aicv.github.io/OBEYED_VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21546 2025-12-15 cs.CV cs.AI cs.CL cs.LG 87%

Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination

反事实分割推理:诊断和缓解像素接地幻觉

Xinzhuo Li, Adheesh Juvekar, Jiaxun Zhang, Xingyou Liu, Muntasir Wahed, Kiet A. Nguyen, Yifan Shen, Tianjiao Yu, Ismini Lourentzou

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出反事实分割推理任务,通过反事实微调训练模型减少分割幻觉,实验表明其在减少幻觉和提升分割性能方面效果显著。

Comments Project webpage: https://plan-lab.github.io/hallusegbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07171 2025-11-11 cs.CV cs.AI cs.LG 87%

Federated Learning for Video Violence Detection: Complementary Roles of Lightweight CNNs and Vision-Language Models for Energy-Efficient Use

Sébastien Thuau, Siba Haidar, Rachid Chelouah

机构 * esieaLab, ETIS Laboratory(esiea实验室,ETIS实验室) ESIEA, University of CY Cergy(ESIEA,CY塞克大学) ETIS Laboratory, CNR1S, UMR8051(ETIS实验室,CNR1S,UMR8051)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 5 pages, 3 figures, ICTAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04477 2025-10-07 cs.CV cs.AI cs.CL cs.LG 87%

MedCLM: Learning to Localize and Reason via a CoT-Curriculum in Medical Vision-Language Models

Soo Yong Kim, Suin Cho, Vincent-Daniel Yun, Gyeongyeon Hwang

机构 * A.I.MATICS Inc(A.I.MATICS公司) Boston University(波士顿大学) University of Southern California(南加州大学) Heuron(Heuron公司) MODULABS, Open Neural Networks Research Lab(MODULABS,开放神经网络研究实验室)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03987 2025-03-07 cs.CV cs.AI cs.CL cs.LG 87%

RetinalGPT: A Retinal Clinical Preference Conversational Assistant Powered by Large Vision-Language Models

Wenhui Zhu, Xin Li, Xiwen Chen, Peijie Qiu, Vamsi Krishna Vasa, Xuanzhao Dong, Yanxi Chen, Natasha Lepore, Oana Dumitrascu, Yi Su, Yalin Wang

专题命中 视觉定位与Grounding :vision-language model(title);LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04681 2024-07-08 cs.CV cs.AI cs.CL cs.LG 87%

Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge

Yuanze Lin, Yunsheng Li, Dongdong Chen, Weijian Xu, Ronald Clark, Philip Torr, Lu Yuan

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16035 2023-10-25 cs.CV cs.AI cs.CL cs.LG stat.ML 87%

What's Left? Concept Grounding with Logic-Enhanced Foundation Models

Joy Hsu, Jiayuan Mao, Joshua B. Tenenbaum, Jiajun Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2023. First two authors contributed equally. Project page: https://web.stanford.edu/~joycj/projects/left_neurips_2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16846 2024-04-17 cs.CV cs.AI cs.CL 87%

GROUNDHOG: Grounding Large Language Models to Holistic Segmentation

Yichi Zhang, Ziqiao Ma, Xiaofeng Gao, Suhaila Shakiah, Qiaozi Gao, Joyce Chai

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(abstract,comments);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR 2024. Website: https://groundhog-mllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07117 2026-08-10 cs.CV 新提交 86%

Beyond Fluency: A Clinical Benchmark and Anomaly-Enhanced Baseline for Spine MRI Report Generation

超越流畅性:脊柱MRI报告生成的临床基准与异常增强基线

Bruno Palau, Franziska Vogt, Daria Laslo, Haobo Li, Ender Konukoglu, Maria Monzon, Catherine R. Jutzeler

机构 * ETH Zurich(苏黎世联邦理工学院) Swiss Institute of Bioinformatics (SIB)(瑞士生物信息学研究所)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 该研究针对放射学报告的耗时与阅片差异问题,构建腰椎MRI的VLM临床基准,提出半监督U-Net++生成异常热图增强VLM的框架,提升诊断可靠性与可解释性。

Comments Maria Monzon and Catherine R. Jutzeler contributed equally as shared last authors. Accepted at the CV4Clinic Workshop, CVPR 2026

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6759-6770

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31533 2026-07-24 cs.CV 版本更新 86%

MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes

MV-GEL:语言驱动的多视图网格几何实体定位

Kartik Bali, Roland Aydin

机构 * Helmholtz Zentrum Hereon(亥姆霍兹赫里恩研究中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(汉堡工业大学连续介质与材料力学研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出MV-GEL框架,通过语言查询定位网格上的细粒度几何实体,利用视角选择模块GELviews优先选择可观察性高的视角,结合VLM分割和光线投射提升定位精度。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17423 2026-07-14 cs.CV cs.HC cs.IT math.IT 版本更新 86%

VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR

VIBE:用于TL;DR的无注释视频到文本信息瓶颈评估

Shenghui Chen, Po-han Li, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 针对决策任务中VLM输出冗长及现有评估依赖人工注释的问题,提出无注释的VIBE方法,用基础和效用指标对VLM输出评分并排序选择,在多个数据集上验证该方法能显著提升任务准确性、减少响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00920 2026-07-03 cs.CV 新提交 86%

GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images

GMO-E$^2$DIT:面向电商图像的接地多操作编辑

Zipeng Guo, Xiaoan Liu, Lichen Ma, Cheng Wang, Yu He, Xiaolong Fu, Jingling Fu, Xinyuan Shan, Shaojie Guo, Luohang Liu, Junshi Huang, Yan Li

机构 * Wuhan University(武汉大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出GMO-E$^2$DIT框架,通过VLM代理构建区域接地编辑议程,结合掩码条件图像编辑器和反思循环,实现多操作、可审计的电商图像编辑,在指令准确性和编辑保真度上超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28385 2026-06-30 cs.RO cs.AI 86%

RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis

RoboGaze: 通过结构化视觉-语言分析评估机器人世界模型

Minh-Loi Nguyen, Nghiem Tuong Diep, Hung Khang Nguyen, Minh Le, Doanh Le Thien, Hoang H. Tran, Dung D. Le, Vu N. Duong, Daniel Sonntag, An Thai Le, Duy Minh Ho Nguyen, Vien Anh Ngo, Tran Van Nhiem

机构 * Ho Chi Minh City University of Science, Vietnam National University(越南国家科学大学胡志明市大学) VinRobotics VinUniversity German Research Center for AI (DFKI)(人工智能研究中心(DFKI)) University of Stuttgart(斯图加特大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) Technische Universität Darmstadt(达姆施塔特技术大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 提出RoboGaze,一种无需训练的多智能体VLM框架,通过任务-场景对齐、维度专家路由和批评验证三阶段流水线,对机器人操作视频进行结构化可解释评估,显著提升描述F1和时序对齐性能。

Comments First version 29 pages, 7 figures. Project webpage: https://robogaze-eval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02994 2026-06-03 cs.CV 86%

Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation

Video-OPD:通过在线策略蒸馏实现多模态大语言模型在时序视频定位中的高效后训练

Jiaze Li, Hao Yin, Haoran Xu, Boshen Xu, Wenhui Tan, Zewen He, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title);分类 cs.CV

AI总结 提出Video-OPD框架,利用在线策略蒸馏和教师验证分歧聚焦课程,以高效后训练多模态大语言模型进行时序视频定位,克服稀疏奖励和高计算开销问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30140 2026-05-29 cs.CV 86%

AnomalyAgent: Training-Free Agentic Models for Zero-/Few-Shot Anomaly Detection

AnomalyAgent: 用于零样本/少样本异常检测的无训练智能体模型

Yi Zhang, Jiawen Zhu, Lele Fu, Guansong Pang

机构 * Singapore Management University(新加坡国立管理学院) Sun Yat-sen University(中山大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);MLLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract)

AI总结 提出一种基于多模态大语言模型的无训练智能体框架AnomalyAgent,通过定制工具集和记忆模块实现零样本/少样本异常检测,在逻辑/上下文异常等复杂场景中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26689 2026-05-27 cs.CV cs.CL 86%

PinPoint: Prompting with Informative Interior Points

PinPoint: 通过信息性内部点进行提示

Pouya Sadeghi, Shawn He, Pedro Pablo Guerrero Vela, C. Thomas, Alex Wong, Sirisha Rambhatla

机构 * University of Waterloo(滑铁卢大学) Critical ML Apple(苹果公司)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 针对指代图像分割中VLM与SAM结合时因提示模糊导致的性能差距,提出无需训练的确定性点选择器PinPoint,通过融合视觉线索选择稳定、信息丰富的内部点,在无训练下达到监督和强化学习方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18748 2026-05-19 cs.CV 86%

Aurora: Unified Video Editing with a Tool-Using Agent

Aurora: 一种基于工具使用的统一视频编辑框架

Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo

机构 * MIT-IBM(MIT-IBM研究院) NVIDIA(NVIDIA公司)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出Aurora框架,通过结合增强的视觉语言模型(VLM)代理和统一视频扩散变换器,解决视频编辑中的文本和视觉不充分问题,提升了视频编辑的灵活性和准确性。

Comments Code: https://github.com/yeates/Aurora

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02093 2026-04-03 cs.CV 86%

GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding

GroundVTS:多模态大语言模型中的视频时间定位视觉标记采样

Rong Fan, Kaiyan Xiao, Minghao Zhu, Liuyi Wang, Kai Dai, Zhao Yang

机构 * Newcapec AI Research(新开普人工智能研究院) Fudan University(复旦大学) Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title);分类 cs.CV

AI总结 本文提出GroundVTS,通过细粒度查询引导机制筛选视觉标记,提升视频时间定位的时空信息保留与时间连贯性,实验表明其在三个标准基准上优于现有方法。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09463 2026-03-03 cs.AI 86%

SpotAgent: Grounding Visual Geo-localization in Large Vision-Language Models through Agentic Reasoning

SpotAgent:通过代理推理在大视觉语言模型中实现视觉地理定位

Furong Jia, Ling Dai, Wenjin Deng, Fan Zhang, Chen Hu, Daxin Jiang, Yu Liu

机构 * Peking University(北京大学) StepFun

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title);分类 cs.AI

AI总结 SpotAgent通过代理推理提升大视觉语言模型在地理定位中的表现,结合外部工具验证和强化学习优化,实现更精确和可靠的定位结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25669 2025-10-01 cs.AI 86%

GroundSight: Augmenting Vision-Language Models with Grounding Information and De-hallucination

Xinxi Chen, Tianyang Chen, Lijia Hong

机构 * Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :vision-language model(title);grounding(title);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12236 2025-07-17 cs.CV 86%

Generate to Ground: Multimodal Text Conditioning Boosts Phrase Grounding in Medical Vision-Language Models

Felix Nützel, Mischa Dombrowski, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗赖堡-亚历山大大学埃尔兰根-纽伦堡) Imperial College London(伦敦帝国理工学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(title);分类 cs.CV

Comments 20 pages, 6 figures. To appear in Proc. MIDL 2025 (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20373 2025-06-26 cs.RO cs.AI cs.HC 86%

CARMA: Context-Aware Situational Grounding of Human-Robot Group Interactions by Combining Vision-Language Models with Object and Action Recognition

Joerg Deigmoeller, Stephan Hasler, Nakul Agarwal, Daniel Tanneberg, Anna Belardinelli, Reza Ghoddoosian, Chao Wang, Felix Ocker, Fan Zhang, Behzad Dariush, Michael Gienger

机构 * Honda Research Institute Europe(本田欧洲研究院) Honda Research Institute USA(本田美国研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10902 2024-06-18 cs.CV cs.CL 86%

Light Up the Shadows: Enhance Long-Tailed Entity Grounding with Concept-Guided Vision-Language Models

Yikai Zhang, Qianyu He, Xintao Wang, Siyu Yuan, Jiaqing Liang, Yanghua Xiao

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏