arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7370 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7370 篇

2605.15054 2026-05-15 cs.CV 70%

LATERN: Test-Time Context-Aware Explainable Video Anomaly Detection

LATERN:测试时上下文感知的可解释视频异常检测

Mitchell Piehl, Muchao Ye

机构 * The University of Iowa(爱荷华大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出LATERN框架,通过上下文感知模块和递归证据聚合模块提升视频异常检测的准确性和解释一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14908 2026-05-15 cs.CV 70%

SteerSeg: Attention Steering for Reasoning Video Segmentation

SteerSeg: 基于注意力引导的视频分割

Ali Cheraghian, Hamidreza Dastmalchi, Abdelwahed Khamis, Morteza Saberi, Aijun An, Lars Petersson

机构 * Macquarie University(麦考瑞大学) York University(约克大学) CSIRO Data61(CSIRO数据61) UTS(UTS大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 SteerSeg通过输入级条件引导解决注意力对齐问题,结合可学习软提示和推理引导的CoT提示,提升视频分割的时空定位能力。

Comments Project page: https://steerseg.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14192 2026-05-15 cs.CL cs.AI 70%

Why Retrieval-Augmented Generation Fails: A Graph Perspective

为何检索增强生成失败:一种图视角

Kai Guo, Xinnan Dai, Zhibo Zhang, Nuohan Lin, Shenglai Zeng, Jie Ren, Haoyu Han, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本文从图视角分析检索增强生成失败原因,发现正确回答具有更深层推理路径和更分布的证据流,而失败回答则表现出碎片化和集中化的证据流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03532 2026-05-15 cs.CV 70%

OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation

OpenTrack3D: 向准确且通用的开放词汇3D实例分割迈进

Zhishan Zhou, Siyuan Wei, Zengran Wang, Chunjie Wang, Xiaosheng Yan, Xiao Liu

机构 * PICO, ByteDance, Beijing(字节跳动北京研究院)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出OpenTrack3D框架,通过在线构建跨视角一致的对象提案和多模态大语言模型提升开放词汇3D实例分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19651 2026-05-14 cs.CV 70%

Scalable Object Detection in the Car Interior With Vision Foundation Models

在汽车内部实现可扩展的目标检测与定位:基于视觉基础模型

Sebastian Schmidt, Bálint Mészáros, Ahmet Firintepe, Stephan Günnemann

机构 * Technical University of Munich, School of Computation, Information and Technology(慕尼黑技术大学,计算、信息与技术学院) BMW Group(宝马集团)

专题命中 视觉定位与Grounding :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出ODAL框架,利用分布式架构结合视觉基础模型,在车载与云平台间分配计算任务,通过ODALbench评估,轻量模型经微调后在检测和定位任务中表现优异,性能优于GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09443 2026-05-12 cs.CV cs.CL 70%

Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent

通过角色视角:解决多模态角色扮演代理中的模态-角色干扰

Yihong Tang, Kehai Chen, Xuefeng Bai, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Loop Area Institute (SLAI)(深圳环城院)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出CAVI框架,通过角色视角减少多模态角色扮演代理中的模态-角色干扰,提升角色一致的多模态交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13484 2026-05-12 cs.CV cs.CY 70%

MINGLE: VLMs for Semantically Complex Region Detection in Urban Scenes

MINGLE:用于城市场景中语义复杂区域检测的视觉语言模型

Liu Liu, Alexandra Kudaeva, Marco Cipriano, Fatimeh Al Ghannam, Freya Tan, Gerard de Melo, Andres Sevtsuk

机构 * Massachusetts Institute of Technology(麻省理工学院) Hasso Plattner Institute(于尔克·平特纳研究所)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出MINGLE模型,通过整合人类检测、视觉语言推理和轻量级空间聚合算法,实现城市场景中社交群体区域的检测,贡献包括新数据集和语义丰富的标注方法。

Comments 13 pages, 4 figures Updated with the camera-ready version after acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07457 2026-05-11 cs.CV 70%

EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement

EditRefiner:一种对齐人类的代理框架用于图像编辑细化

Zitong Xu, Huiyu Duan, Yifei Nie, Mingda Du, Sijing Wu, Xiongkuo Min, Tianyi Zheng, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(Vivo移动通信有限公司) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出EditRefiner,一种对齐人类的代理框架,通过人类反馈数据集改进图像编辑的细粒度问题,通过感知-推理-行动-评估循环提升编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07334 2026-05-11 cs.CV 70%

RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation

RCoT-Seg:强化链式推理用于视频推理与分割

Junwei Wen, Deshui Miao, Guangming Lu, Xin Li, Wenjie Pei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Pazhou Lab (Huangpu)(琶洲实验室(黄埔))

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出RCoT-Seg框架,通过分离时间推理与空间感知,改进视频分割中关键帧选择与定位,提升多目标场景下的鲁棒性与精度。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05546 2026-05-08 cs.AI 70%

SPARK: Self-Play with Asymmetric Reward from Knowledge Graphs

SPARK:基于知识图谱的异步奖励自我对抗学习

Hyobin Park, Taeseop Kim, Dong-Geol Choi

机构 * Hanbat National University, South Korea(韩国翰bac国立大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 SPARK通过构建统一知识图谱实现多文档科学文献的自我对抗学习,利用图路径生成关系推理问题并基于结构化事实计算奖励,优于传统自对抗基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03354 2026-05-08 cs.AI 70%

What Happens Inside Agent Memory? Circuit Analysis from Emergence to Diagnosis

代理记忆内部发生了什么?从涌现到诊断的电路分析

Xutao Mao, Jinman Zhao, Gerald Penn, Cong Wang

机构 * City University of Hong Kong(香港城市大学) University of Toronto(多伦多大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 研究揭示了代理记忆中控制与内容电路的因果关系及共享枢纽的机制,开发出76.2%准确率的无监督诊断工具,优于监督基线13分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00060 2026-05-04 cs.AI cs.SY eess.SY 70%

TADI: Tool-Augmented Drilling Intelligence via Agentic LLM Orchestration over Heterogeneous Wellsite Data

TADI:通过异构钻井现场数据的代理LLM编排实现工具增强的钻井智能

Rong Lu

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 TADI通过代理LLM编排整合钻井数据,实现证据驱动的分析智能,展示了领域专用工具设计对分析质量的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24562 2026-04-28 cs.AI cs.CL cs.CY 70%

Towards Lawful Autonomous Driving: Deriving Scenario-Aware Driving Requirements from Traffic Laws and Regulations

迈向合法自动驾驶:从交通法规中推导场景感知的驾驶要求

Bowen Jian, Rongjie Yu, Hong Wang, Liqiang Wang, Zihang Zou

机构 * College of Transportation, Tongji University(同济大学交通运输学院) The Key Laboratory of Road and Traffic Engineering, Ministry of Education(教育部道路与交通工程重点实验室) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) College of Computer Science, University of Central Florida(佛罗里达中央大学计算机科学学院) Optixway AI

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种基于交通场景分类的新型方法,利用大语言模型推导法律要求,提升自动驾驶系统的合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23935 2026-04-28 cs.CV 70%

2nd of the 5th PVUW MeViS-Audio Track: ASR-SaSaSa2VA

第五届PVUW MeViS-Audio Track的第二名:ASR-SaSaSa2VA

Zhiyu Wang, Xudong Kang, Shutao Li

机构 * Hunan University(湖南大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出ASR-SaSaSa2VA框架,通过ASR将音频转换为文本描述,结合预训练文本引导视频分割模型实现高效的音频引导视频分割,解决了计算复杂度高、对齐困难和数据依赖性强的问题。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21277 2026-04-28 cs.AI 70%

Can MLLMs "Read" What is Missing?

LLMs能否

Jindi Guo, Chaozheng Huang, Xi Fang

机构 * DP Technology(DP技术)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 MMTR-Bench评估多模态大语言模型从视觉上下文直接重建遮蔽文本的能力,通过单页或多页输入测试,聚焦布局理解、视觉关联和知识整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19798 2026-04-23 cs.CY cs.CV econ.EM 70%

Diagnosing Urban Street Vitality via a Visual-Semantic and Spatiotemporal Framework for Street-Level Economics

通过视觉-语义和时空框架诊断城市街道活力

Xinxin Zhuo, Mengyuan Niu, Ruizhe Wang, Junyan Yang, Qiao Wang

机构 * School of Economics and Management, Southeast University(经济管理学院,东南大学) School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) School of Architecture, Southeast University(建筑学院,东南大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出基于视觉-语义和时空框架的街道经济活力指数,结合时空数据和LBS信息,揭示街道活力的时空异质性及品牌层级影响。

Comments Submitted to ACM Transactions on Spatial Computing. This paper is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17319 2026-04-21 cs.CV cs.CL 70%

E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition

E2E-GMNER:端到端生成式 grounded 多模态命名实体识别

Meng Zhang, Jinzhong Ning, Xiaolong Wu, Hongfei Lin, Yijia Zhang

机构 * Dalian Maritime University(大连海事大学) Dalian University of Technology(大连理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出E2E-GMNER,通过端到端生成框架统一实体识别、语义类型预测和视觉定位,采用链式推理和GRBP提升鲁棒性,实验证明其在多模态命名实体识别任务中表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08809 2026-04-20 cs.LG stat.AP 70%

Structural Evaluation Metrics for SVG Generation via Leave-One-Out Analysis

通过留一验证分析评估SVG生成的结构评价指标

Haonan Zhu, Adrienne Deganutti, Elad Hirsch, Purvanshi Mehta

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出基于留一验证分析的元素级评估方法,用于评估SVG生成的结构特性,引入四个结构性指标并验证其在多个生成系统中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15736 2026-04-20 cs.CV cs.CL 70%

RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees

RefereeBench: 视频多模态大语言模型是否准备好成为多项目裁判

Yichen Xu, Yuanhang Liu, Chuhan Wang, Zihan Zhao, jinghan luo, Jianzhe Ma, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Sichuan University(四川大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出RefereeBench,首个评估多模态大语言模型作为自动体育裁判的基准,通过11项运动925个视频和6475对问答,评估犯规存在、分类、推理、实体感知和时间定位能力,发现当前模型在规则应用和时间定位上表现不足。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14147 2026-04-16 cs.CV 70%

ROSE: Retrieval-Oriented Segmentation Enhancement

ROSE:基于检索的分割增强

Song Tang, Guangquan Jie, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ROSE框架,通过引入网络检索模块和提示增强模块,提升多模态大语言模型在新兴实体和新实体分割任务中的性能,实验表明其在NEST基准上表现优异。

Comments CVPR 2026 Findings, Project Page: https://henghuiding.com/ROSE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13602 2026-04-16 cs.LG 70%

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges

大模型时代的奖励黑客:机制、涌现偏差、挑战

Xiaohua Wang, Muzhao Tian, Yuqi Zeng, Zisu Huang, Jiakang Yuan, Bowen Chen, Jingwen Xu, Mingbo Zhou, Wenhao Liu, Muling Wu, Zhengkang Guo, Qi Qian, Yifei Wang, Feiran Zhang, Ruicheng Yin, Shihan Dou, Changze Lv, Tao Chen, Kaitao Song, Xu Tan, Tao Gui, Xiaoqing Zheng, Xuanjing Huang

机构 * Fudan NLP Group(复旦大学NLP小组)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.LG

AI总结 本文探讨大模型中奖励黑客的机制与挑战,提出代理压缩假说框架,分析优化过程中的表现偏差和对抗性行为,提出检测与缓解策略。

Comments 42 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13292 2026-04-16 cs.CV 70%

See&Say: Vision Language Guided Safe Zone Detection for Autonomous Package Delivery Drones

See&Say:基于视觉语言的自主配送无人机安全区域检测

Mahyar Ghazanfari, Peng Wei

机构 * George Washington University(乔治·华盛顿大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出See&Say框架,结合几何安全提示与语义感知,利用视觉语言模型实现迭代优化,提升无人机配送中安全区域检测的可靠性与动态适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06921 2026-04-16 cs.CR cs.AI 70%

Neuro-Symbolic AI for Cybersecurity: State of the Art, Challenges, and Opportunities

神经符号AI在网络安全中的应用:现状、挑战与机遇

Safayat Bin Hakim, Muhammad Adil, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

机构 * Department of Information Systems, University of Maryland, Baltimore County(信息系统系,马里兰大学巴尔的摩分校) Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学) Department of Computer Science, University of Colorado Boulder(计算机科学系,科罗拉多大学博尔德分校) Laboratory for Cybersecurity Dynamics, Department of Computer Science, University of Colorado Colorado Springs(网络安全动力实验室,科罗拉多大学科罗拉多斯普林斯分校)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本文综述了神经符号AI在网络安全中的应用,分析了103篇文献,指出多智能体和结构化集成架构在复杂场景中表现更优,因果推理能提升防御能力,知识引导学习提高效率和可解释性,但评估标准化和人机协作仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12508 2026-04-15 cs.CV 70%

From Attenuation to Attention: Variational Information Flow Manipulation for Fine-Grained Visual Perception

从衰减到注意:用于细粒度视觉感知的变分信息流操控

Jilong Zhu, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(智能信息处理重点实验室,计算技术研究所,中国科学院(ICT/CAS)) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院(ICT/CAS)) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出变分信息流框架,通过建模问题-答案对相关的视觉显著性作为潜在分布,解决多模态大语言模型在细粒度感知任务中的信息衰减问题,提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11082 2026-04-14 cs.CV 70%

RESP: Reference-guided Sequential Prompting for Visual Glitch Detection in Video Games

RESP:基于参考的顺序提示用于视频游戏中的视觉故障检测

Yakun Yu, Ashley Wiens, Adrián Barahona-Ríos, Benedict Wilkins, Saman Zadtootaghaj, Nabajeet Barman, Cor-Paul Bezemer

机构 * University of Alberta(阿尔伯塔大学) Sony Interactive Entertainment(索尼互动娱乐)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出RESP框架,通过参考引导提示实现多帧视频游戏故障检测,利用VLMs在视频层面进行比较而非孤立分类,提升检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09249 2026-04-14 cs.CV cs.IR 70%

FashionStylist: An Expert Knowledge-enhanced Multimodal Dataset for Fashion Understanding

FashionStylist: 一个增强专家知识的多模态数据集用于时尚理解

Kaidong Feng, Zhuoxuan Huang, Huizhong Guo, Yuting Jin, Xinyu Chen, Yue Liang, Yifei Gai, Li Zhou, Yunshan Ma, Zhu Sun

机构 * Yanshan University(燕山大学) Central South University(中南大学) Zhejiang University(浙江大学) Southwest University(西南大学) Singapore Management University(新加坡管理大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出FashionStylist,一个专家标注的多任务时尚理解基准,支持服装到物品定位、服装补全和评估任务,提升多模态时尚系统的语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10675 2026-04-14 cs.CV 70%

HiddenObjects: Scalable Diffusion-Distilled Spatial Priors for Object Placement

HiddenObjects: 用于物体放置的可扩展扩散-蒸馏空间先验

Marco Schouten, Ioannis Siglidis, Serge Belongie, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) University of Copenhagen(哥本哈根大学) Pioneer Centre for AI(人工智能先锋中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出通过扩散模型蒸馏学习显式的类别条件空间先验,用于自然场景中的物体放置。通过自动化框架构建大规模数据集,实验表明其优于人类标注和现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20136 2026-04-14 cs.CL cs.AI 70%

M$^3$KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation

M$^3$KG-RAG:多跳多模态知识图谱增强的检索增强生成

Hyeongcheol Park, Jiyoung Seo, Jaewon Mun, Hogun Park, Wonmin Byeon, Sung June Kim, Hyeonsoo Im, JeungSub Lee, Sangpil Kim

机构 * Korea University(高丽大学) Sungkyunkwan University(成均馆大学) NVIDIA Research(英伟达研究院) Hanwha Systems(韩华系统)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出M$^3$KG-RAG,通过构建多跳多模态知识图谱并引入GRASP机制,提升多模态大语言模型的推理深度和回答准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09056 2026-04-14 cs.CV 70%

ConceptPose: Training-Free Zero-Shot Object Pose Estimation using Concept Vectors

ConceptPose:基于概念向量的无训练零样本物体姿态估计

Liming Kuang, Yordanka Velikova, Mahdi Saleh, Jan-Nico Zaech, Danda Pani Paudel, Benjamin Busam

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 ConceptPose利用视觉语言模型生成开放词汇3D概念图,通过建立概念图间的3D-3D对应关系,实现无训练的零样本物体姿态估计,优于现有最佳基线62%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10039 2026-04-14 cs.CV 70%

Counting to Four is still a Chore for VLMs

为VLMs计数仍是一项苦差事

Duy Le Dinh Anh, Patrick Amadeus Irawan, Tuan Van Vo

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文通过行为和机制分析研究VLMs的计数行为,提出COUNTINGTRICKS评估套件,揭示模型在不同布局和对抗提示下的漏洞,并验证Modality Attention Share方法能缓解计数失败问题。

详情

展开后加载摘要…

URL PDF HTML 收藏