arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7348 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7348 篇

2511.05791 2026-03-17 cs.RO cs.AI cs.LG 81%

VLAD-Grasp: Zero-shot Grasp Detection via Vision-Language Models

VLAD-Grasp:基于视觉-语言模型的零样本抓取检测

Manav Kulshrestha, S. Talha Bukhari, Damon Conover, Aniket Bera

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出VLAD-Grasp,一种基于视觉-语言模型的零样本抓取检测方法,通过生成目标图像、预测深度和分割、对齐点云来恢复可执行抓取姿态,无需训练数据,性能与最新方法相当。

Comments 8 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12773 2026-03-16 cs.CV cs.AI eess.IV 81%

Empowering Semantic-Sensitive Underwater Image Enhancement with VLM

通过VLM赋能语义敏感的水下图像增强

Guodong Fan, Shengning Zhou, Genji Yuan, Huiyu Li, Jingchun Zhou, Jinjiang Li

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出利用视觉语言模型增强水下图像增强的语义敏感能力,通过生成文本描述并生成空间语义指导图,提升图像重建的语义聚焦度,实验验证其在感知质量和检测分割任务中的有效性。

Comments Accepted as an Oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12606 2026-03-16 cs.CV cs.AI 81%

Mastering Negation: Boosting Grounding Models via Grouped Opposition-Based Learning

掌握否定:通过分组对立学习提升 grounding 模型

Zesheng Yang, Xi Jiang, Bingzhang Hu, Weili Guan, Runmin Cong, Guo-Jun Qi, Feng Zheng

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出 D-Negation 数据集及分组对立学习框架,通过显式建模否定语义提升视觉语言 grounding 模型的鲁棒性和定位精度。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00184 2026-03-11 cs.CV cs.AI 81%

Zero-Shot and Supervised Bird Image Segmentation Using Foundation Models: A Dual-Pipeline Approach with Grounding DINO~1.5, YOLOv11, and SAM~2.1

基于基础模型的零样本和监督鸟类图像分割:结合Grounding DINO~1.5、YOLOv11和SAM~2.1的双管道方法

Abhinav Munagala

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于基础模型的双管道方法,利用Grounding DINO、YOLO和SAM实现零样本和监督的鸟类图像分割,提升分割精度并简化领域适应过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06302 2026-03-09 cs.CV cs.AI 81%

DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models

DEX-AR: 一种用于自回归视觉-语言模型的动态可解释性方法

Walid Bousselham, Angie Boggust, Hendrik Strobelt, Hilde Kuehne

机构 * Tuebingen AI Center University of Tuebingen(图宾根人工智能中心图宾根大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) IBM Research(IBM研究院)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 DEX-AR是一种针对自回归视觉-语言模型的动态可解释性方法,通过生成2D热图来解释模型决策过程,提升模型可解释性和性能评估。

Comments Project page: https://walidbousselham.com/DEX-AR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14895 2026-03-09 cs.CV cs.AI 81%

SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA

SpatialMem: 用于语言定位和问答的度量对齐长周期视频记忆

Xinyi Zheng, Yunze Liu, Chi-Hao Wu, Fan Zhang, Hao Zheng, Wenqi Zhou, Walterio W. Mayol-Cuevas, Junxiao Shen

机构 * University of Bristol(布里斯托大学) Memories.ai Research(Memories.ai研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 SpatialMem通过构建度量对齐的空间支架,实现长周期视频记忆的可解释检索与问答,支持语言引导的检索和离线导航任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18471 2026-03-02 cs.IR cs.AI cs.CL cs.LG q-fin.ST 81%

FinBloom: Knowledge Grounding Large Language Model with Real-time Financial Data

FinBloom:基于实时金融数据的知识引导大型语言模型

Ankur Sinha, Chaitanya Agarwal, Pekka Malo

机构 * Indian Institute of Management Ahmedabad(印度管理学院阿赫迈德亚德分校) Aalto University School of Business(阿尔托大学商学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 FinBloom通过实时金融数据增强LLMs能力,实现高效金融任务处理。

Comments 39 pages, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06008 2026-02-27 cs.CV cs.AI 81%

Detection and Measurement of Hailstones with Multimodal Large Language Models

利用多模态大语言模型检测和测量冰雹

Moritz Alker, David C. Schedl, Andreas Stöckl

机构 * Digital Media Lab University of Applied Sciences Upper Austria(数字媒体实验室 上奥地利应用科学大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 利用多模态大语言模型检测和测量冰雹,通过社交媒体图像实现快速评估

Comments 6 pages, 5 figures, accepted at The 2nd International Conference on Electrical and Computer Engineering Researches

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18702 2026-02-24 cs.CV cs.AI 81%

Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding

基于接地的思考:用于长视频理解的课程强化推理与视频接地

Houlun Chen, Xin Wang, Guangyao Li, Yuwei Zhou, Yihan Chen, Jia Jia, Wenwu Zhu

机构 * Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 Video-TwG通过课程强化框架和接地范式提升长视频理解,采用双阶段策略和TwG-GRPO算法优化推理与接地质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17826 2026-02-23 cs.AI cs.LG cs.SC 81%

Ontology-Guided Neuro-Symbolic Inference: Grounding Language Models with Mathematical Domain Knowledge

本体引导的神经符号推理:通过数学领域知识 grounding 语言模型

Marcelo Labre

机构 * Advanced Institute for Artificial Intelligence (AI2)(人工智能研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过引入形式化数学本体,提升语言模型在数学推理任务中的可靠性,验证了神经符号方法在增强形式化 grounding 方面的潜力与挑战。

Comments Submitted to NeuS 2026. Supplementary materials and code: https://doi.org/10.5281/zenodo.18665030

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05523 2026-02-19 cs.CV cs.AI 81%

Prompt When the Animal is: Temporal Animal Behavior Grounding with Positional Recovery Training

提示当动物是:基于位置恢复训练的时序动物行为 grounding

Sheng Yan, Xin Du, Zongying Li, Yi Wang, Hongcang Jin, Mengyuan Liu

机构 * School of Artificial Intelligence, Chongqing University of Technology(重庆理工大学人工智能学院) National Key Laboratory of General Artificial Intelligence, Shenzhen Graduate School, Peking University(北京大学深圳研究生院国家通用人工智能实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出 Port 框架,通过位置恢复训练提升动物行为时序 grounding 的准确性,在 Animal Kingdom 数据集上取得 38.52 的 IoU@0.3 成绩,并在 ICME 2024 挑战赛中表现突出。

Comments Accepted by ICMEW 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13313 2026-02-17 cs.CV cs.AI 81%

Agentic Spatio-Temporal Grounding via Collaborative Reasoning

基于协作推理的代理时空 grounding

Heng Zhao, Yew-Soon Ong, Joey Tianyi Zhou

机构 * CFAR, IHPC, Agency for Science, Technology and Research(A*STAR)(CFAR、IHPC、新加坡科技研究局) CCDS, Nanyang Technological University(CCDS、南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出ASTG框架,通过协作推理实现开放世界下的时空视频grounding,提升检索效率并优于现有弱监督和零样本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09252 2026-02-11 cs.CV cs.AI cs.MA 81%

VLM-Guided Iterative Refinement for Surgical Image Segmentation with Foundation Models

基于基础模型的手术图像分割迭代细化方法

Ange Lou, Yamin Li, Qi Chang, Nan Xi, Luyuan Xie, Zichao Li, Tianyu Luan

机构 * School of Automation Science and Engineering, South China University of Technology, Guangzhou, China(自动化科学与工程学院,华南理工大学,广州,中国) Vanderbilt University, Nashville, TN, USA(范德比尔特大学,纳什维尔,田纳西州,美国) The Pennsylvania State University, University Park, PA , USA(宾夕法尼亚州立大学,大学园,宾夕法尼亚州,美国) Peking University, Beijing , China(北京大学,北京,中国) Virginia Commonwealth University, Richmond, VA, USA(弗吉尼亚共同wealth大学,里士满,弗吉尼亚州,美国) University of California San Diego, San Diego, CA, USA(加州大学圣地亚哥分校,圣地亚哥,加利福尼亚州,美国)

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IR-SIS,一种基于自然语言描述的手术图像分割迭代细化系统,结合视觉-语言模型和自适应工作流,实现高精度分割与临床交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07017 2026-02-10 cs.CV cs.AI 81%

XAI-CLIP: ROI-Guided Perturbation Framework for Explainable Medical Image Segmentation in Multimodal Vision-Language Models

XAI-CLIP: 通过区域感兴趣引导扰动框架实现多模态视觉-语言模型中可解释的医学图像分割

Thuraya Alzubaidi, Sana Ammar, Maryam Alsharqi, Islem Rekik, Muzammil Behzad

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学) Massachusetts Institute of Technology(麻省理工学院) Imperial College London(伦敦帝国学院) KFUPM-SDAIA Joint Research Centre for Artificial Intelligence(KFUPM-SDAIA联合人工智能研究中心)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 XAI-CLIP通过多模态视觉-语言模型嵌入实现医学图像分割的可解释性和效率提升,减少计算开销并提高分割精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08512 2026-01-28 cs.CV cs.AI 81%

MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding

MLVTG: 基于Mamba的特征对齐与LLM驱动的多模态视频时间定位

Zhiyi Zhu, Xiaoyu Wu, Zihao Liu, Linlin Yang

机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 MLVTG通过结合MambaAligner和LLMRefiner,实现了多模态视频时间定位的高精度定位与语义净化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15316 2026-01-23 cs.AI cs.CV 81%

The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection

范式转变:大型视觉语言模型在多模态虚假新闻检测中的全面调查

Wei Ai, Yilong Tan, Yuntao Shou, Tao Meng, Haowen Chen, Zhixiong He, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(计算机与数学学院,中央南大学林业科技学院) College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) College of Economics and Management, Central South University of Forestry and Technology(经济管理学院,中央南大学林业科技学院) Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过大型视觉语言模型全面调查多模态虚假新闻检测,分析其发展历程、技术挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19825 2026-01-21 cs.LG cs.AI cs.DB 81%

Position: Foundation Models for Tabular Data within Systemic Contexts Need Grounding

位置:在系统性情境中为表格数据构建的基础模型需要接地

Tassilo Klein, Johannes Hoffart

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出语义链接表和SLT基础模型,通过双阶段训练实现表格数据在操作上下文中的接地,强调操作知识对自主代理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03543 2026-01-19 cs.CV cs.AI 81%

GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models

GPT-4增强的多模态接地用于自动驾驶:利用跨模态注意力与大语言模型

Haicheng Liao, Huanming Shen, Zhenning Li, Chengyue Wang, Guofa Li, Yiming Bie, Chengzhong Xu

机构 * Univ City(大学城市)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种结合GPT-4的大语言模型的多模态接地框架,用于提升自动驾驶中的视觉理解和指令执行能力。

Journal ref Communications in Transportation Research 4 (2024) 100116

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08811 2026-01-14 cs.CV cs.AI 81%

Reasoning Matters for 3D Visual Grounding

推理在3D视觉定位中至关重要

Hsiang-Wei Huang, Kuang-Ming Chen, Wenhao Chai, Cheng-Yen Yang, Jen-Hao Cheng, Jenq-Neng Hwang

机构 * University of Washington(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种自动合成3D视觉定位数据的管道,并引入了在仅使用1.6%训练数据下表现优于现有方法的Reason3DVG-8B模型,证明了推理在3D视觉定位中的重要性。

Comments 2025 CVPR Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06205 2026-01-01 cs.AI cs.CL cs.LG 81%

On measuring grounding and generalizing grounding problems

关于测量 grounding 并推广 grounding 问题

Daniel Quigley, Eric Maynard

机构 * Center for Possible Minds(可能心智中心) Indiana University(印第安纳大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种框架,用于测量和推广 grounding 问题,通过定义不同需求和评估标准,分析了符号、参照、向量和关系四种模式的 grounding 现状,并探讨了其在不同任务中的表现。

Comments resubmission: 39 pages, 85 sources, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19466 2025-12-30 cs.CV cs.LG 81%

ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection

ForgerySleuth: 赋能多模态大语言模型进行图像篡改检测

Zhihao Sun, Haoran Jiang, Haoran Chen, Yixin Cao, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

AI总结 ForgerySleuth通过多模态大语言模型进行图像篡改检测,利用线索融合和数据集构建提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21641 2025-12-29 cs.CV cs.AI 81%

TrackTeller: Temporal Multimodal 3D Grounding for Behavior-Dependent Object References

TrackTeller: 基于时间的多模态3D定位用于行为依赖的对象引用

Jiahong Yu, Ziqi Wang, Hailiang Zhao, Wei Zhai, Xueqiang Yan, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 TrackTeller通过融合LiDAR图像、语言条件解码和时间推理,提升动态3D场景中基于语言的物体定位与跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21728 2025-12-23 cs.CL cs.AI cs.LG 81%

Affective Multimodal Agents with Proactive Knowledge Grounding for Emotionally Aligned Marketing Dialogue

具有主动知识 grounding 的情感多模态代理用于情感对齐的营销对话

Lin Yu, Xiaofei Han, Yifei Kang, Chiung-Yi Tseng, Danyang Zhang, Ziqian Bi, Zhimo Han

机构 * Hunan Police Academy, Department of Criminal Investigation(湖南警察学院犯罪侦查系) Business College, California State University(加州州立大学长滩分校商学院) Northwestern University(西北大学) AI Agent Lab, Vokram Group(Vokram集团AI代理实验室) Beijing University of Technology(北京理工大学) Zheng Zhou University of Light Industry(郑州轻工业大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 AffectMind通过主动知识 grounding 和情绪-意图对齐模型,提升营销对话中的情感一致性与说服效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16442 2025-12-22 cs.CV cs.AI 81%

EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning

EDVD-LLaMA: 通过多模态大语言模型推理进行可解释的深度伪造视频检测

Haoran Sun, Chen Cai, Huiping Zhuang, Kong Aik Lee, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电子与电气工程学院,南洋理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 视觉定位与Grounding :multimodal large language model(title);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 EDVD-LLaMA通过多模态大语言模型推理实现深度伪造视频检测的可解释性,结合时空特征提取和细粒度推理机制,提升检测准确性与解释可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12842 2025-12-16 cs.RO cs.AI cs.LG 81%

SAGA: Open-World Mobile Manipulation via Structured Affordance Grounding

SAGA:通过结构化可及性 grounding 实现开放世界移动操作

Kuan Fang, Yuxin Chen, Xinghao Zhu, Farzad Niroui, Lingfeng Sun, Jiuguang Wang

机构 * RAI Institute(RAI研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 SAGA通过结构化可及性接地实现开放世界移动操作,能有效处理多种任务形式并实现零样本执行。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09348 2025-12-15 cs.CL cs.AI cs.CV 81%

MOAT: Evaluating LMMs for Capability Integration and Instruction Grounding

MOAT:评估LMMs在能力整合和指令接地方面的表现

Zhoutong Ye, Mingze Sun, Huan-ang Gao, Xutong Wang, Xiangyang Wang, Yu Mei, Chang Liu, Qinwei Li, Chengwen Zhang, Qinghuan Lan, Chun Yu, Yuanchun Shi

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 MOAT通过1005个复杂现实视觉问题评估LMMs在能力整合和指令接地方面的表现,发现最佳模型仅达44%准确率,揭示了LMMs在复杂任务中的不足。

Comments Project page: https://cambrian-yzt.github.io/MOAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26360 2025-12-09 cs.CV cs.AI 81%

TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos

TimeScope: 向长视频中面向任务的时序定位迈进

Xiangrui Liu, Minghao Qin, Yan Shu, Zhengyang Liang, Yang Tian, Chen Jason Zhang, Bo Zhao, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) University of Trento(特伦多大学) Singapore Management University(新加坡管理大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 TimeScope通过逐步推理实现长视频中面向任务的时序定位,提升定位精度并增强下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05941 2025-12-08 cs.CV cs.AI cs.CL 81%

Zoom in, Click out: Unlocking and Evaluating the Potential of Zooming for GUI Grounding

聚焦,点击:解锁和评估缩放在GUI定位中的潜力

Zhiyuan Jiang, Shenghao Xie, Wenyi Li, Wenqiang Zu, Peihang Li, Jiahao Qiu, Siqi Pei, Lei Ma, Tiejun Huang, Mengdi Wang, Shilong Liu

机构 * Xi’an Jiaotong University(西安交通大学) Princeton University(普林斯顿大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出ZoomClick方法,通过引入缩放先验知识提升GUI定位性能,实现动态空间聚焦与自适应上下文切换,并在多个基准上取得最佳结果。

Comments Code is available at https://github.com/Princeton-AI2-Lab/ZoomClick

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06996 2025-12-03 cs.CV cs.AI 81%

Visible Yet Unreadable: A Systematic Blind Spot of Vision Language Models Across Writing Systems

可见却不可读:跨书写系统下视觉语言模型的系统性盲区

Jie Zhang, Ting Xu, Gelei Deng, Runyi Hu, Han Qiu, Tianwei Zhang, Qing Guo, Ivor Tsang

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了视觉语言模型在跨书写系统下识别碎片化文本的鲁棒性,发现其在可见但不可读的刺激下表现下降,揭示了模型对组成先验依赖不足的结构性限制。

Comments arXiv admin note: This article has been withdrawn by arXiv administrators due to violation of arXiv policy regarding generative AI authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23311 2025-12-01 cs.CV cs.AI cs.CL 81%

Toward Automatic Safe Driving Instruction: A Large-Scale Vision Language Model Approach

迈向自动安全驾驶指令:一种大规模视觉语言模型方法

Haruki Sakajo, Hiroshi Takato, Hiroshi Tsutsui, Komei Soda, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) Teatis inc.(Teatis公司) Queensland university of technology(昆士兰理工大学)

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种大规模视觉语言模型方法,用于生成安全驾驶指令,通过构建数据集并评估模型性能,展示了微调模型在自动驾驶安全中的应用与挑战。

Comments Accepted to MMLoSo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏