arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-12 至 2026-05-12 共收录 174 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 37 篇

2602.03916 2026-05-12 cs.CV cs.CE cs.CL cs.LG 81%

SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?

SpatiaLab: 视觉-语言模型能否在真实环境中进行空间推理?

Azmine Toushik Wasi, Wahid Faisal, Abdur Rahman, Mahfuz Ahmed Anik, Munem Shahriar, Mohsin Mahmud Topu, Sadia Tasnim Meem, Rahatun Nesa Priti, Sabrina Afroz Mitu, Md. Iqramul Hoque, Shahriyar Zaman Ridoy, Mohammed Eunus Ali, Majd Hawasly, Mohammad Raza, Md Rizwan Parvez

机构 * Computational Intelligence and Operations Laboratory(计算智能与运筹实验室) Shahjalal University of Science and Technology(沙赫jalal科技大学) BRAC University(BRAC大学) North South University(北南大学) Monash University(墨尔本大学) Qatar Computing Research Institute(卡塔尔计算研究院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 SpatiaLab通过真实场景下的空间推理任务评估视觉-语言模型的能力,揭示其在复杂空间关系、深度感知和3D几何方面的不足。

Comments Accepted to ICLR 2026 (https://openreview.net/forum?id=fWWUPOb0CT). 92 Pages. 42 Figures and 29 Tables

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09218 2026-05-12 cs.CV cs.AI cs.LG cs.RO 80%

Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models

Flame3D: 无需3D特定训练的3D场景零样本组合推理

Sagar Bharadwaj, Ziyong Ma, Anurag Ghosh, Srinivasan Seshan, Anthony Rowe

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Flame3D通过可组合的空间工具和训练自由框架,实现3D场景的零样本组合推理,支持动态空间合成和外部数据整合,展示了在ScanQA和Compose3D上的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18111 2026-05-12 cs.CV 79%

When Large Vision-Language Models Meet Person Re-Identification

当大视觉-语言模型遇见人重识别

Qizao Wang, Bin Li, Xiangyang Xue

机构 * School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机科学学院,上海,中国)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出LVLM-ReID框架,利用大视觉-语言模型的生成能力提升人重识别的准确性,通过语义引导交互模块生成关键外观语义特征,无需额外标注即可在多个基准上取得竞争性结果。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09449 2026-05-12 cs.CV 77%

SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs

SpaceMind++:迈向空间感知认知地图的视频多模态大语言模型

Bo Gu, Zhikang Zhang, Zizhuang Wei, Zhenyuan Chen, Lingyun Li, Zhuoyi Song

机构 * Fudan University(复旦大学) Huawei(华为) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 SpaceMind++通过构建体素化认知地图,实现空间一致性的视觉推理,提升视频多模态大语言模型在3D环境中的表现。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08735 2026-05-12 cs.CV 77%

CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models

CollabVR: 基于视觉-语言和视频生成模型的协作视频推理

Joowon Kim, Seungho Shin, Joonhyung Park, Eunho Yang

机构 * KAIST(韩国科学技术院) Kyung Hee University(庆熙大学) AITRICS

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 CollabVR通过结合视觉-语言模型与视频生成模型,在步骤级实现协作视频推理,提升多步任务性能,并在基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09900 2026-05-12 cs.AI cs.CL cs.CV 73%

The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

为视觉语言模型解开 Gordian 结:图式结理作为一项难题基准

Hao Liu, Jicheng Liu

机构 * Department of Psychology(心理学系) New York University(纽约大学) Department of Computer Science(计算机科学系) University of Southern California(南加州大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出 KnotBench 基准,通过 858,318 张图像与 Regina 签名验证,评估 VLMs 在结图识别、预测和跨模态接地任务中的能力,发现模型在结操作模拟上存在显著不足。

Comments 41 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15879 2026-05-12 cs.CV cs.AI cs.CL 73%

GRIT: Teaching MLLMs to Think with Images

GRIT: 教授大语言模型通过图像思考

Yue Fan, Xuehai He, Diji Yang, Kaizhi Zheng, Ching-Chen Kuo, Yuting Zheng, Sravana Jyothi Narayanaraju, Xinze Guan, Xin Eric Wang

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) UC Santa Barbara(加州大学圣芭芭拉分校) eBay

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 GRIT提出一种基于图像和文本的 grounded reasoning 方法,通过强化学习实现高效训练,使大语言模型生成视觉基础的推理链。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09614 2026-05-12 cs.CV 70%

Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning

反射锚点用于长链多模态推理中的传播感知视觉保留

Xuan Gong, Hanbo Huang, Hao Zheng, Yiran Zhang, Wenbin Dai, Weishu Zhao, Shiyu Liang

机构 * Shanghai Jiao Tong University(上海交通大学) Lanzhou University(兰州大学)

专题命中 视觉推理 :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出RAPO方法,通过信息论分析优化视觉传播潜力和局部分支空间,提升长链多模态推理的视觉信息保留效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08452 2026-05-12 cs.CV 70%

NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics

NICE FACT: 诊断和校准VLMs在运动物理定量推理中的能力

Jian Lan, Zhicheng Liu, Xinpeng Wang, Yuhao Zhou, Haokun Chen, Jiancheng Lv, Barbara Plank, Thomas Seidl

机构 * University of Munich (LMU)(慕尼黑大学(LMU)) Munich Center of Machine Learning(慕尼黑机器学习中心) Sichuan University(四川大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文研究VLMs在运动物理定量推理中的表现,提出NICE和FACT双诊断框架,分析视觉真实性、物理定律理解和时间定位,揭示模型在识别视觉前提和应用物理定律方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13710 2026-05-12 cs.CV 70%

SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs

SLQ:通过共享潜在查询桥接模态以实现冻结MLLMs的检索

Haoran Lou, Ziyan Liu, Chunxiao Fan, Yuexin Wu, Yue Ming, Hao Wu, Kai Zuo, Yibo Chen, Xu Tang

机构 * School of Electronic Engineering, Beijing University of Posts(北京邮电大学电子工程学院) Xiaohongshu Inc., China(小红书公司)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 SLQ通过冻结MLLMs的主干,引入共享潜在查询提升多模态检索性能,实验显示其在多个基准上表现优异。

Comments Accepted to ICML-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21164 2026-05-12 cs.AI 70%

Concise Geometric Description as a Bridge: Unleashing the Potential of LLM for Plane Geometry Problem Solving

简洁几何描述作为桥梁:释放LLM在平面几何问题求解中的潜力

Jingyun Wang, Dian Li, Xiaohan Wang, Gang Liu, Jiahong Yan, Guoliang Kang

机构 * Beihang University(北航大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出通过训练多模态大语言模型解释器生成几何描述,再利用通用LLM进行推理,以解决平面几何问题。通过设计CDL匹配奖励机制,提升生成几何描述的效率,并在新构建的Formalgeo7k-Rec-CoT数据集上验证了方法的有效性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07575 2026-05-12 cs.CV cs.AI 62%

Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding

响应-G1:面向前瞻性流视频理解的显式场景图建模

Ke Ma, Jiaqi Tang, Bin Guo, Xueting Han, Ruonan Xu, Qingfeng He, Ziheng Wang, Xu Wang, Qifeng Chen, Zhiwen Yu, Yunhao Liu

机构 * Northwestern Polytechnical University(北华大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 响应-G1通过显式场景图建模提升前瞻性流视频理解,通过三阶段流程实现视频证据与查询条件的结构化对齐,提高响应时机的可解释性和准确性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18184 2026-05-12 cs.LG cs.AI 62%

ActivationReasoning: Logical Reasoning in Latent Activation Spaces

ActivationReasoning: 在潜在激活空间中的逻辑推理

Lukas Helff, Ruben Härle, Wolfgang Stammer, Felix Friedrich, Manuel Brack, Antonia Wüst, Hikaru Shindo, Patrick Schramowski, Kristian Kersting

机构 * TU Darmstadt(图恩-达姆施塔特大学) Lab1141(Lab1141实验室) Aleph Alpha Research(Aleph Alpha研究) MPI-Inf, SIC(马克斯·普朗克研究所(MPI-Inf)) Meta FAIR Adobe Applied Research(Adobe应用研究) DFKI(DFKI研究所) CERTAIN, Germany(德国CERTAIN)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ActivationReasoning框架,通过在LLM的潜在空间中嵌入显式逻辑推理,提升模型的推理能力、可控性和对齐性,验证了在多跳推理、抽象与鲁棒性、自然语言推理及安全任务中的有效性。

Comments Proceedings of the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09272 2026-05-12 cs.AI cs.CL cs.CV 62%

Towards Conversational Medical AI with Eyes, Ears and a Voice

面向有眼睛、耳朵和声音的对话式医疗AI

Meet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya Rysbek, Toshiyuki Fukuzawa, Yana Lunts, Jan Freyberg, Michael B. Chang, Aniruddh Raghu, David Stutz, Devora Berlowitz, Eliseo Papa, Taylan Cemgil, JD Velasquez, Jack Chen, Arthur Chen, Doug Fritz, Charlie Taylor, Katya Tregubova, Jing Rong Lim, Richard Green, Sara Mahdavi, Mahvish Nagda, Jihyeon Lee, Craig Schiff, Liviu Panait, Sukhdeep Singh, Valentin Liévin, David G. T. Barrett, Hannah Gladman, Anna Cupani, Francesca Pietra, Uchechi Okereke, Katherine Tong, Clemens Meyer, Erwan Rolland, Mili Sanwalka, Michael D. Howell, Shixiang Shane Gu, Bibo Xu, Euan A. Ashley, S. M. Ali Eslami, Gregory Wayne, Pushmeet Kohli, Vivek Natarajan, Adam Rodman, Alan Karthikesalingam, Ryutaro Tanno

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Beth Israel Deaconess Medical Center, Harvard Medical School(贝塞斯达医院, 哈佛医学院) Stanford University(斯坦福大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AI co-clinician系统,利用音频视频数据实现实时临床决策,通过TelePACES评估标准显示其在管理计划和诊断差异方面接近医生,但在体格检查和疾病特异性推理上仍有不足。

Comments Video examples are available on Youtube: https://youtu.be/y5Vaa_SN1t0, https://youtu.be/dC4icb75vLQ, and https://youtu.be/E7iEvWo-E6c

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07436 2026-05-12 cs.CV cs.AI cs.ET 62%

Prompt to Protection: A Comparative Study of Multimodal LLMs in Construction Hazard Recognition

提示到保护:多模态大语言模型在建筑危险识别中的比较研究

Nishi Chaudhary, S M Jamil Uddin, Sathvik Sharath Chandra, Anto Ovid, Alex Albert

机构 * Department of Construction Management, Colorado State University(科罗拉多州立大学建设管理系) Department of Civil, Construction, and Environmental Engineering, North Carolina State University(北卡罗来纳州立大学土木、建设与环境工程系)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文比较了五种先进多模态大语言模型在建筑危险识别中的表现,发现提示策略显著影响性能,CoT提示效果最佳,GPT-4.5和GPT-o3表现突出,强调了提示设计在提升建筑安全应用准确性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28902 2026-05-12 cs.AI 57%

ChartDiff: A Large-Scale Benchmark for Comprehending Pairs of Charts

ChartDiff:一种大规模的图表对理解基准

Rongtian Ye

机构 * Department of Computer Science, Aalto University(阿尔托大学计算机科学系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出ChartDiff,首个大规模多图表对比总结基准,通过8541对图表数据评估不同模型,揭示通用模型与专用模型在对比总结中的性能差异。

Comments 21 pages, 17 figures, accepted to ACL 2026: the 4th Workshop on Advances in Language and Vision Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20381 2026-05-12 cs.CV 57%

ReaMOT: A Benchmark and Framework for Reasoning-based Multi-Object Tracking

ReaMOT:基于推理的多目标跟踪基准与框架

Sijia Chen, Yanqiu Yu, En Yu, Wenbing Tao

机构 * National Key Laboratory of Science and Technology on Multi-spectral Information Processing, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(国家多谱信息处理科学与技术重点实验室,人工智能与自动化学院,华中科技大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 ReaMOT通过引入推理能力的多目标跟踪框架,解决传统方法在复杂指令下的泛化问题,提出ReaTrack框架并实现RHOTA指标的显著提升。

Comments Code: https://github.com/chen-si-jia/ReaMOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09703 2026-05-12 cs.CV 57%

MOTOR-Bench: A Real-world Dataset and Multi-agent Framework for Zero-shot Human Mental State Understanding

MOTOR-Bench:一个现实世界数据集和多智能体框架,用于零样本人类心理状态理解

Xiaoyu Yuan, Niklas Heikkala, Tiina Törmänen, Hanna Järvenoja, Guoying Zhao, Haoyu Chen

机构 * University of Oulu(奥卢大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MOTOR-Bench,通过现实世界数据集和多智能体框架,解决零样本人类心理状态理解问题,展示了多智能体框架在行为、认知和情绪预测上的优越性能。

Comments Accepted by CVPR 2026 workshop AI4RWC

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09544 2026-05-12 cs.AI 57%

TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning

TIDE-Bench:面向任务的工具整合推理评估

Yize Li, Junzhi Li, Jason Song, Chuxiong Sun, Rui Wang, Changwen Zheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出TIDE-Bench,一个高效全面的工具整合推理评估基准,通过多样任务设置、任务感知评估协议和高质量评价集,揭示工具整合推理中的持续瓶颈。

Comments 10 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09262 2026-05-12 cs.CV cs.CL 57%

Reinforcing Multimodal Reasoning Against Visual Degradation

增强多模态推理以对抗视觉退化

Rui Liu, Dian Yu, Haolin Liu, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文言) University of Maryland, College Park(马里兰大学 College Park 分校) University of Virginia(弗吉尼亚大学) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出ROMA框架,通过优化动态增强多模态大语言模型对视觉退化的鲁棒性,提升在多种基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05831 2026-05-12 cs.CV 57%

Unifying Scientific Communication: Fine-Grained Correspondence Across Scientific Media

统一科学交流:跨科学媒体的细粒度对应

Megha Mariam K. M, Vineeth N. Balasubramanian, C. V. Jawahar

机构 * IIIT Hyderabad(IIIT海得拉尔学院) Microsoft Research India & IIT Hyderabad(微软研究院印度分部及IIIT海得拉尔学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出MCD数据集,通过整合科研论文、演示视频、解释视频和幻灯片,评估不同模型在发现跨格式细粒度对应关系中的能力,揭示了视觉语言模型和嵌入模型的优缺点。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14702 2026-05-12 cs.AI cs.CL 57%

Polymath: A Challenging Multi-modal Mathematical Reasoning Benchmark

PolyMATH:一个具有挑战性的多模态数学推理基准

Himanshu Gupta, Shreyas Verma, Ujjwala Anantheswaran, Kevin Scaria, Mihir Parmar, Swaroop Mishra, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉推理 :MLLM(abstract);分类 cs.AI

AI总结 PolyMATH基准通过5000张高质量图像评估多模态大语言模型的推理能力,揭示其在空间关系和抽象推理上的不足,指出模型无法真正理解视觉信息,存在逻辑错误风险。

Comments Accepted in Neural Information Processing Systems (NeurIPS 2025) Workshop: Foundations of Reasoning in Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08965 2026-05-12 cs.CV 57%

Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning

大语言模型能否进行视觉说服推理?评估推理的有效性与忠实性

Naeun Lee, Hyunjong Kim, Sunghwan Choi, Injin Kong, Yohan Jo

机构 * Seoul National University(首尔国立大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文研究大语言模型在视觉说服推理中的有效性与忠实性,提出通过多样化的教师生成推理进行监督微调以提升预测性能,并引入三维忠实性评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08774 2026-05-12 cs.RO cs.LG 57%

ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation

ProcVLM:基于学习的程序导向进度奖励用于机器人操作

Youhe Feng, Hansen Shi, Haoyang Li, Xinlei Guo, Yang Wang, Chengyang Zhang, Jinkai Zhang, Xiaohan Zhang, Jie Tang, Jing Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Zhipu AI(智谱AI) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

AI总结 ProcVLM通过程序结构和阶段内视觉变化学习密集的进度奖励,提升机器人操作的程序推理能力,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉定位与Grounding 39 篇

2604.14125 2026-05-12 cs.CV cs.AI cs.RO 88%

HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System

HiVLA:一种以视觉为基础的分层具身操作系统

Tianshuo Yang, Guanyu Chen, Yutian Chen, Zhixuan Liang, Yitian Liu, Zanxin Chen, Chunpu Xu, Haotian Liang, Jiangmiao Pang, Yao Mu, Ping Luo

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 HiVLA提出一种分层框架,将高层语义规划与底层动作控制解耦,通过视觉 grounding 和 Diffusion Transformer 专家提升机器人操作能力,实验证明其在长时序技能组合和精细操作中表现优异。

Comments Project Page: https://tianshuoy.github.io/HiVLA-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09060 2026-05-12 cs.CL 88%

Language-Conditioned Visual Grounding with CLIP Multilingual

基于CLIP多语言的语言条件视觉 grounding

J. de Curtò, Mauro Liz, I. de Zarzà

机构 * 1 Department of Computer Applications in Science \& Engineering, BARCELONA Supercomputing Center, Barcelona, Spain 3 Department of Electrical Computer Engineering, Boston University, Boston, MA 02215, USA 4 Human centered AI, Data \& Software, LUXEMBOURG Institute of Science

专题命中 视觉定位与Grounding :grounding(title,title_cn);vision-language model(abstract)

AI总结 研究通过密集多语言CLIP探针分析多语言视觉语言模型的性能差异,发现低资源语言在文本分支存在结构性惩罚,编码器扩展能缓解部分失败案例,同时保持跨语言相似性,但空间对齐问题导致集群掩码IoU下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08816 2026-05-12 cs.AI cs.CY 87%

Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?

镜中镜:视觉语言模型代理是否真的能辨认自己?

Filippo Ziliotto, Ciro Beneduce, Bruno Lepri, Luciano Serafini, Massimiliano Luca, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) University of Trento(特伦托大学)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 研究探讨视觉语言模型是否能通过镜像识别自身,通过设计3D基准测试评估其自我识别能力,发现更强的模型能利用镜像信息进行行动,而较弱的模型则无法正确提取自身相关信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06673 2026-05-12 cs.CV 87%

Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding

基于检测器的视频大语言模型用于高效的时空定位

Shida Gao, Feng Xue, Xiangfeng Wang, Anlong Ming, Zhaowen Lin, Haiyang Zhang, Teng Long, Nicu Sebe, Yihua Shao, Haozhe Wang, Wei Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Trento(特伦特大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology(香港科技大学) ZTE Corporation(中兴通讯)

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出DEViL模型,通过将密集空间定位任务转移给训练良好的检测器,提升视频时空定位的效率与性能,实现43.1%的m_vIoU和14.33 FPS的高效表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10769 2026-05-12 cs.CV cs.AI 86%

MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation

MPerS: 动态多模态大语言模型混合专家感知引导的遥感场景分割

Ziyi Wang, Xianping Ma, Ziyao Wang, Hongyang Zhang, Man On Pun

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Southwest Jiaotong University(西南交通大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出MPerS方法,通过设计多提示生成高质量遥感描述,结合DINOv3提取视觉特征,利用动态混合专家模块和语言查询引导注意力实现精准分割。

Comments Accepted to CVPR 2026 Findings. 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09387 2026-05-12 cs.AI cs.RO 81%

NEXUS: Continual Learning of Symbolic Constraints for Safe and Robust Embodied Planning

NEXUS:用于安全和稳健体素规划的符号约束连续学习

Tiehan Cui, Peipei Liu, Yanxu Mao, Congying Liu, Mingzhe Xing, Datao You

机构 * School of Artificial Intelligence and Automation(人工智能与自动化学院) Huazhong University of Science and Technology(华中科技大学) School of Software(软件学院) Henan University(河南大学) Institute of Information Engineering(信息工程研究所) Chinese Academy of Sciences(中国科学院) School of Cyberspace Security(网络空间安全学院) University of the Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.AI

AI总结 NEXUS通过模块化框架实现体素代理的连续学习,将符号 artifacts 用于符号 grounding 和知识演化,将概率风险评估转化为确定性硬约束,提升任务成功率并抵御对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏