arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7348 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7348 篇

2603.18453 2026-03-20 cs.CV 79%

Learning Consistent Temporal Grounding between Related Tasks in Sports Coaching

在体育指导中学习相关任务之间的一致时间定位

Arushi Rai, Adriana Kovashka

机构 * University of Pittsburgh, Pittsburgh PA 15260, USA(匹兹堡大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出通过自一致性目标改进时间定位,利用相关任务共享帧的关注机制,在三个体育指导任务中提升准确率和BERTScore。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17647 2026-03-19 cs.CV 79%

Part-Aware Open-Vocabulary 3D Affordance Grounding via Prototypical Semantic and Geometric Alignment

面向部分的开放词汇3D功能接地 via 语义和几何对齐

Dongqiang Gou, Xuming He

机构 * ShanghaiTech University(上海科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出一种双阶段跨模态框架,通过增强语义和几何表示,解决开放词汇3D功能接地中的语义一致性、几何对齐和开放词汇泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17079 2026-03-19 cs.CV 79%

ACE-LoRA: Graph-Attentive Context Enhancement for Parameter-Efficient Adaptation of Medical Vision-Language Models

ACE-LoRA:图注意上下文增强用于医疗视觉-语言模型的参数高效适应

M. Arda Aydın, Melih B. Yilmaz, Aykut Koç, Tolga Çukur

机构 * Bilkent University(比尔肯特大学) National Magnetic Resonance Research Center (UMRAM)(国家磁共振研究所以及UMRAM)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ACE-LoRA框架,通过整合LoRA模块和ACE-HGNN模块,提升医疗VLM的零样本泛化能力,解决领域特异性与泛化能力的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15583 2026-03-17 cs.CV 79%

Grounding World Simulation Models in a Real-World Metropolis

将世界模拟模型扎根于现实世界中的城市

Junyoung Seo, Hyunwook Choi, Minkyung Kwon, Jinhyeok Choi, Siyoon Jin, Gayoung Lee, Junho Kim, JoungBin Lee, Geonmo Gu, Dongyoon Han, Sangdoo Yun, Seungryong Kim, Jin-Hwa Kim

机构 * KAIST AI(韩国科学技术院人工智能研究中心) NAVER AI Lab(NAVER人工智能实验室) SNU AIIS(成均馆大学人工智能研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出Seoul World Model,通过检索增强的条件生成真实城市场景,解决时间错位和轨迹多样性问题,生成高保真、时序一致的长时景视频。

Comments project page: https://seoul-world-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15237 2026-03-17 cs.CV 79%

Multi-turn Physics-informed Vision-language Model for Physics-grounded Anomaly Detection

多轮物理引导的视觉-语言模型用于物理基础的异常检测

Yao Gu, Xiaohao Xu, Yingna Wu

机构 * Shanghaitech University(上海科技大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种多轮物理引导的视觉-语言模型,通过编码物体属性和动态约束提升物理基础异常检测性能,实验显示其在视频级检测中达到96.7%的AUROC,优于现有最佳方法。

Comments Accepted by IEEE ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13024 2026-03-17 cs.CV 79%

Learning 2D Invariant Affordance Knowledge for 3D Affordance Grounding

学习2D不变的可供性知识以实现3D可供性定位

Xianqiang Gao, Pingrui Zhang, Delin Qu, Dong Wang, Zhigang Wang, Yan Ding, Bin Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出MIFAG框架,通过多视角交互图像提取不变可供性知识,提升3D对象可供性定位的泛化能力。

Comments Accepted by AAAI 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01960 2026-03-17 cs.LG 79%

Grounding Generated Videos in Feasible Plans via World Models

通过世界模型将生成视频接地到可行计划中

Christos Ziakas, Amir Bar, Alessandra Russo

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 本文提出GVP-WM方法,通过学习动作条件的世界模型,将生成视频计划接地为可行动作序列,解决视频生成计划在时间一致性和物理约束上的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21105 2026-03-16 cs.CV 79%

RLM: A Vision-Language Model Approach for Radar Scene Understanding

RLM:一种用于雷达场景理解的视觉-语言模型方法

Pushkal Mishra, Kshitiz Bansal, Dinesh Bharadia

机构 * University of California San Diego(加州大学圣地亚哥分校) Blue River Technology

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.CV

AI总结 本文提出RadarVLM,通过结构化空间语言监督学习统一的场景表示,改进了雷达场景理解中的空间推理能力,实验显示其在生成描述和车辆分割任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12208 2026-03-13 cs.CV 79%

ForensicZip: More Tokens are Better but Not Necessary in Forensic Vision-Language Models

ForensicZip: 更多令牌更好但并非必要在取证视觉-语言模型中

Yingxin Lai, Zitong Yu, Jun Wang, Linlin Shen, Yong Xu, Xiaochun Cao

机构 * Great Bay University(大湾大学) Shenzhen University(深圳大学) Harbin Institute of Technology(哈尔滨工业大学) School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络安全科学与技术学院)

专题命中 视觉定位与Grounding :vision-language model(title);multimodal large language model(abstract);分类 cs.CV

AI总结 ForensicZip通过引入无需训练的框架,从伪造驱动的角度重新定义令牌压缩,利用最优传输问题量化物理不连续性,实现高压缩率下的取证证据分离与高效检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07966 2026-03-10 cs.CV 79%

Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time

用眼睛倾听:跨时空的自体视觉共指基准测试

Weijie Zhou, Xuantang Xiong, Zhenlin Hu, Xiaomeng Zhu, Chaoyang Zhao, Honghui Dong, Zhengyou Zhang, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA)) Tencent Robotics X(腾讯机器人X) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出EcoG-Bench,通过严格测试语音-手势绑定,揭示多模态接口可能限制时间对齐线索的可观察性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07403 2026-03-10 cs.CV 79%

Prompt-Based Caption Generation for Single-Tooth Dental Images Using Vision-Language Models

基于提示的单牙牙科图像标题生成使用视觉-语言模型

Anastasiia Sukhanova, Aiden Taylor, Julian Myers, Zichun Wang, Kartha Veerya Jammuladinne, Satya Sri Rajiteswari Nimmagadda, Aniruddha Maiti, Ananya Jana

机构 * Marshall University(马歇尔大学) West Virginia State University(西弗吉尼亚州立大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出使用视觉-语言模型生成单牙牙科图像标题,解决现有数据集缺乏和标题描述不全面的问题。

Comments Accepted to IEEE International Conference on Semantic Computing (IEEE ICSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06973 2026-03-10 cs.CV 79%

T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding

T2SGrid: 视频时间定位的时空网格化

Chaohong Guo, Yihan He, Yongwei Nie, Fei Ma, Xuemiao Xu, Chengjiang Long

机构 * South China University of Technology(南方科技大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) Bytedance Inc(字节跳动公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 T2SGrid通过将视频时间理解转化为空间理解任务,利用网格化技术提升视频时间定位的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06732 2026-03-10 cs.CV 79%

HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos

HERO: 分层嵌入-细化用于视频中开放词汇时间句接地

Tingting Han, Xinsong Tao, Yufei Yin, Min Tan, Sicheng Zhao, Zhou Yu

机构 * Laboratory of Complex Systems Modeling and Simulation, School of Computer Science and Technology, Hangzhou Dianzi University(电子科技大学复杂系统建模与仿真实验室,计算机科学与技术学院) Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,电子科技大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 HERO提出一种分层嵌入-细化框架,用于视频中开放词汇时间句接地,通过多级语义建模和跨模态细化提升视频与语言的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07915 2026-03-06 cs.AI cs.CL cs.SY eess.SY 79%

A Signal Contract for Online Language Grounding and Discovery in Decision-Making

在线语言 grounding 与决策制定中的语言发现信号契约

Dimitris Panagopoulos, Adolfo Perrusquia, Weisi Guo

机构 * Faculty of Engineering and Applied Science, Cranfield University(工程与应用科学学院,克兰菲尔德大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 LUCIFER 通过信号契约实现在线语言 grounding,提升决策安全性和信息收集效率,需结合两者才能达成最佳效果。

Comments 10 pages, 4 Figures, 4 Tables, submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01486 2026-03-03 cs.AI 79%

Agentic Multi-Source Grounding for Enhanced Query Intent Understanding: A DoorDash Case Study

代理多源接地以增强查询意图理解:一个DoorDash案例研究

Emmanuel Aboah Boateng, Kyle MacDonald, Akshad Viswanathan, Sudeep Das

机构 * DoorDash, Inc.(DoorDash公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出一种代理多源接地系统,通过目录检索和网络搜索结合,提升多意图查询的准确率,已在DoorDash实现90.7%的准确率提升。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01927 2026-03-03 cs.AI cs.MA 79%

From Grounding to Planning: Benchmarking Bottlenecks in Web Agents

从基础到规划:网络代理中的瓶颈基准测试

Segev Shlomov, Ben wiesel, Aviad Sela, Ido Levy, Liane Galanti, Roy Abitbol

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文通过分析网络代理的规划和基础组件,发现规划是性能退化的主要原因,提出新的基准测试以改进代理能力。

Journal ref ECAI 2025 - 28th European Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23677 2026-03-02 cs.CV 79%

Vision-Language Semantic Grounding for Multi-Domain Crop-Weed Segmentation

面向多领域作物杂草分割的视觉-语言语义定位

Nazia Hossain, Xintong Jiang, Yu Tian, Philippe Seguin, O. Grant Clark, Shangpeng Sun

机构 * Department of Bioresource Engineering, McGill University(生物资源工程系,麦吉尔大学) Department of Plant Science, McGill University(植物科学系,麦吉尔大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 VL-WS通过视觉-语言对齐实现多领域作物杂草细粒度分割,提升泛化能力和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21865 2026-02-26 cs.LG 79%

Beyond RAG vs. Long-Context: Learning Distraction-Aware Retrieval for Efficient Knowledge Grounding

超越RAG与长上下文:学习抗干扰检索以实现高效的知识 grounding

Seongwoong Shim, Myunsoo Kim, Jae Hyeon Cho, Byung-Jun Lee

机构 * Korea University, Decision Making Lab(韩国大学,决策实验室) LG CNS

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 本文提出LDAR方法,通过学习抗干扰检索提升知识 grounding 的效率与性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21406 2026-02-26 cs.CV 79%

Exploring Vision-Language Models for Open-Vocabulary Zero-Shot Action Segmentation

探索用于开放词汇零样本动作分割的视觉-语言模型

Asim Unmesh, Kaki Ramesh, Mayank Patel, Rahul Jain, Karthik Ramani

机构 * Purdue University(普渡大学) Birla Institute of Technology and Science (BITS) Hyderabad(比拉理工学院和科学研究院(BITS)海得拉巴)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出开放词汇零样本时间动作分割方法,利用视觉-语言模型的零样本能力,通过帧-动作嵌入相似性和相似性矩阵时间分割实现无需训练的分割任务,展示了其在结构化时间理解中的潜力。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20639 2026-02-25 cs.AI 79%

Grounding LLMs in Scientific Discovery via Embodied Actions

通过具身动作 grounding LLMs 在科学发现中

Bo Zhang, Jinfeng Zhou, Yuxuan Chen, Jianing Yin, Minlie Huang, Hongning Wang

机构 * Tsinghua University, Beijing, China(清华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 通过具身动作框架,LLMs在科学发现中实现更稳定的物理模拟和更高的建模准确性。

Comments 24 pages, 7 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19768 2026-02-25 cs.CV 79%

TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding

TraceVision: 一种具有轨迹感知能力的视觉-语言模型,用于类人空间理解

Fan Yang, Shurong Zheng, Hongyin Zhao, Yufei Zhan, Xin Li, Yousong Zhu, Chaoyang Zhao Ming Tang, Jinqiao Wang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 TraceVision通过整合轨迹感知的空间理解,实现了类人空间认知,提升视觉-语言模型在轨迹引导任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13961 2026-02-17 cs.CV astro-ph.IM cs.CL 79%

MarsRetrieval: Benchmarking Vision-Language Models for Planetary-Scale Geospatial Retrieval on Mars

MarsRetrieval: 用于火星尺度地理空间检索的视觉-语言模型基准测试

Shuoyuan Wang, Yiran Wang, Hongxin Wei

机构 * Department of Statistics and Data Science(统计与数据科学系) Department of Earth and Space Sciences(地球与空间科学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 MarsRetrieval提出了一种用于评估视觉-语言模型在火星地理空间发现中检索能力的基准测试,强调领域特定微调对可推广发现的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13195 2026-02-16 cs.CV 79%

Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision

对话式图像分割:通过可扩展监督将抽象概念具象化

Aadarsh Sahoo, Georgia Gkioxari

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出对话式图像分割方法,通过可扩展监督将抽象概念转化为精确掩码,并引入ConverSeg基准和ConverSeg-Net模型提升分割性能。

Comments Project webpage: https://glab-caltech.github.io/converseg/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07388 2026-02-16 cs.AI 79%

Invert4TVG: A Temporal Video Grounding Framework with Inversion Tasks Preserving Action Understanding Ability

Invert4TVG: 一种具有逆向任务的时序视频定位框架,以保持动作理解能力

Zhaoyu Chen, Hongnan Lin, Yongwei Nie, Fei Ma, Xuemiao Xu, Fei Yu, Chengjiang Long

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) ByteDance Inc.(字节跳动公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 Invert4TVG通过引入逆向任务保持动作理解能力,提升时序视频定位的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07827 2026-02-10 cs.CV 79%

Open-Text Aerial Detection: A Unified Framework For Aerial Visual Grounding And Detection

开放文本航空检测:面向航空场景理解的统一框架

Guoting Wei, Xia Yuan, Yang Zhou, Haizhao Jing, Yu Liu, Xianbiao Qi, Chunxia Zhao, Haokui Zhang, Rong Xiao

机构 * Nanjing University of Science and Technology(南京理工大学) Northwestern Polytechnical University(西北工业大学) Zhejiang Lab(浙江实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 OTA-Det提出一个统一框架,整合开放词汇航空检测与遥感视觉定位,通过任务重述和密集语义对齐策略实现细粒度语义理解和多目标检测,达到最佳性能并保持实时推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05215 2026-02-06 cs.CV 79%

E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching

E.M.Ground: 一种具有整体事件感知和匹配的时序地面视频大语言模型

Jiahao Nie, Wenbin An, Gongjie Zhang, Yicheng Xu, Yap-Peng Tan, Alex C. Kot, Shijian Lu

机构 * Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学交叉学科研究生项目) Xi’an Jiaotong University, China(西安交通大学) Alibaba DAMO Academy, Singapore(阿里巴巴达摩院) Institute of Science Tokyo, Japan(东京科学研究院) VinUniversity, Vietnam(文大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 E.M.Ground通过引入事件标记、平滑处理和多粒度特征聚合,提升了时序视频地面任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17729 2026-02-05 cs.AI 79%

M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark

M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准

Yang Zhou, Mingyu Zhao, Zhenting Wang, Difei Gu, Bangwei Guo, Ruosong Ye, Ligong Han, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 视觉定位与Grounding :MLLM(title);grounding(abstract);分类 cs.AI

AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03071 2026-02-05 cs.CV 79%

Finding Optimal Video Moment without Training: Gaussian Boundary Optimization for Weakly Supervised Video Grounding

无需训练即可找到最优视频片段:用于弱监督视频定位的高斯边界优化

Sunoh Kim, Kimin Yun, Daeho Um

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出GBO方法,通过解决优化问题提升弱监督视频定位的定位性能,无需训练且兼容多种提案架构。

Comments Accepted in IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03361 2026-02-04 cs.CV 79%

Z3D: Zero-Shot 3D Visual Grounding from Images

Z3D:从图像实现零样本3D视觉定位

Nikita Drozdov, Andrey Lemeshko, Nikita Gavrilov, Anton Konushin, Danila Rukhovich, Maksim Kolodiazhnyi

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Higher School of Economics(高等经济学院) M3L Lab, Institute of Mechanics, Armenia(阿塞拜疆力学研究所M3L实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 Z3D通过先进的零样本3D实例分割和基于提示的推理,实现了从多视角图像中无需几何监督的零样本3D视觉定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09981 2026-02-03 cs.CV 79%

DR$^2$Seg: Decomposed Two-Stage Rollouts for Efficient Reasoning Segmentation in Multimodal Large Language Models

DR$^2$Seg: 分解式两阶段 rollout 用于多模态大语言模型中的高效推理分割

Yulin He, Wei Chen, Zhikang Jian, Tianhang Guo, Wenjuan Zhou, Minglong Li, Shaowu Yang, Wenjing Yang

机构 * School of Computer, National University of Defense Technology, Changsha, China(计算机学院,国防科技大学,中国长沙)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

AI总结 DR$^2$Seg通过分解式两阶段rollout策略提升多模态大语言模型中的推理效率和分割准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏