arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-12 至 2026-05-12 共收录 39 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 39 篇

2604.14125 2026-05-12 cs.CV cs.AI cs.RO 88%

HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System

HiVLA:一种以视觉为基础的分层具身操作系统

Tianshuo Yang, Guanyu Chen, Yutian Chen, Zhixuan Liang, Yitian Liu, Zanxin Chen, Chunpu Xu, Haotian Liang, Jiangmiao Pang, Yao Mu, Ping Luo

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 HiVLA提出一种分层框架,将高层语义规划与底层动作控制解耦,通过视觉 grounding 和 Diffusion Transformer 专家提升机器人操作能力,实验证明其在长时序技能组合和精细操作中表现优异。

Comments Project Page: https://tianshuoy.github.io/HiVLA-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09060 2026-05-12 cs.CL 88%

Language-Conditioned Visual Grounding with CLIP Multilingual

基于CLIP多语言的语言条件视觉 grounding

J. de Curtò, Mauro Liz, I. de Zarzà

机构 * 1 Department of Computer Applications in Science \& Engineering, BARCELONA Supercomputing Center, Barcelona, Spain 3 Department of Electrical Computer Engineering, Boston University, Boston, MA 02215, USA 4 Human centered AI, Data \& Software, LUXEMBOURG Institute of Science

专题命中 视觉定位与Grounding :grounding(title,title_cn);vision-language model(abstract)

AI总结 研究通过密集多语言CLIP探针分析多语言视觉语言模型的性能差异,发现低资源语言在文本分支存在结构性惩罚,编码器扩展能缓解部分失败案例,同时保持跨语言相似性,但空间对齐问题导致集群掩码IoU下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08816 2026-05-12 cs.AI cs.CY 87%

Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?

镜中镜:视觉语言模型代理是否真的能辨认自己?

Filippo Ziliotto, Ciro Beneduce, Bruno Lepri, Luciano Serafini, Massimiliano Luca, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) University of Trento(特伦托大学)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 研究探讨视觉语言模型是否能通过镜像识别自身,通过设计3D基准测试评估其自我识别能力,发现更强的模型能利用镜像信息进行行动,而较弱的模型则无法正确提取自身相关信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06673 2026-05-12 cs.CV 87%

Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding

基于检测器的视频大语言模型用于高效的时空定位

Shida Gao, Feng Xue, Xiangfeng Wang, Anlong Ming, Zhaowen Lin, Haiyang Zhang, Teng Long, Nicu Sebe, Yihua Shao, Haozhe Wang, Wei Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Trento(特伦特大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology(香港科技大学) ZTE Corporation(中兴通讯)

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出DEViL模型,通过将密集空间定位任务转移给训练良好的检测器,提升视频时空定位的效率与性能,实现43.1%的m_vIoU和14.33 FPS的高效表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10769 2026-05-12 cs.CV cs.AI 86%

MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation

MPerS: 动态多模态大语言模型混合专家感知引导的遥感场景分割

Ziyi Wang, Xianping Ma, Ziyao Wang, Hongyang Zhang, Man On Pun

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Southwest Jiaotong University(西南交通大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出MPerS方法,通过设计多提示生成高质量遥感描述,结合DINOv3提取视觉特征,利用动态混合专家模块和语言查询引导注意力实现精准分割。

Comments Accepted to CVPR 2026 Findings. 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09387 2026-05-12 cs.AI cs.RO 81%

NEXUS: Continual Learning of Symbolic Constraints for Safe and Robust Embodied Planning

NEXUS:用于安全和稳健体素规划的符号约束连续学习

Tiehan Cui, Peipei Liu, Yanxu Mao, Congying Liu, Mingzhe Xing, Datao You

机构 * School of Artificial Intelligence and Automation(人工智能与自动化学院) Huazhong University of Science and Technology(华中科技大学) School of Software(软件学院) Henan University(河南大学) Institute of Information Engineering(信息工程研究所) Chinese Academy of Sciences(中国科学院) School of Cyberspace Security(网络空间安全学院) University of the Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.AI

AI总结 NEXUS通过模块化框架实现体素代理的连续学习,将符号 artifacts 用于符号 grounding 和知识演化,将概率风险评估转化为确定性硬约束,提升任务成功率并抵御对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09090 2026-05-12 cs.CV cs.AI 81%

Investigating Anisotropy in Visual Grounding under Controlled Counterfactual Perturbations

探究在可控反事实扰动下的视觉语义对齐中的各向异性

Gabriele Lombardo, Luigi Maiorana, Liliana Lo Presti, Marco La Cascia

机构 * Department of Engineering(工程系)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了在可控反事实扰动下视觉语义对齐中的各向异性影响,通过对比两种不同嵌入几何的模型发现,余弦相似度与近似行为无显著关联,表明各向异性不足以解释反事实错误。

Comments To be published in the proceedings of the 5th Explainable AI for Computer Vision (XAI4CV) Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09802 2026-05-12 cs.CV cs.AI cs.LG 80%

CrossVL: Complexity-Aware Feature Routing and Paired Curriculum for Cross-View Vision-Language Detection

CrossVL: 用于跨视角视觉语言检测的复杂度感知特征路由与配对课程学习

Zhipeng Liu, Chunbo Luo

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出CrossVL框架,结合复杂度感知路径聚合和配对课程学习,提升跨视角视觉语言模型的检测性能,实验显示其在MAVREC数据集上提升了aerial mAP并缩小了地面与空中视角的性能差距。

Comments Accepted to CVPR 2026. Code available at https://github.com/1nyourlife/Crossvl_cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09419 2026-05-12 cs.AI 79%

From Passive Reuse to Active Reasoning: Grounding Large Language Models for Neuro-Symbolic Experience Replay

从被动重用来主动推理:为神经符号经验回放构建大型语言模型

Yanan Xiao, Yixiang Tang, Zechen Feng, Lu Jiang, Minghao Yin, Pengyang Wang

机构 * Affiliation(机构1)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出神经符号经验回放框架,通过将经验回放从被动样本重用机制转变为知识构建的主动引擎,解决语言推理与数值优化的不兼容问题,提升样本效率和收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08837 2026-05-12 cs.CL cs.AI 79%

The Grounding Gap: How LLMs Anchor the Meaning of Abstract Concepts Differently from Humans

概念基础差距:LLMs如何以不同于人类的方式锚定抽象概念的含义

Odysseas S. Chlapanis, Orfeas Menis Mastromichalakis, Christos H. Papadimitriou

机构 * Department of Informatics(信息学院) Athens University of Economics and Business(雅典经济与商业大学) Archimedes, Athena Research Center(阿基米德·雅典研究中心) Instituto de Telecomunicações(电信研究所) Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 研究比较了LLMs与人类对抽象概念的锚定方式,发现LLMs过度依赖词关联,缺乏情感和内部状态属性,导致基础差距显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10397 2026-05-12 cs.CV cs.AI 79%

AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation

AnomalyClaw:通过工具引导的反驳实现通用视觉异常检测代理

Xi Jiang, Yinjie Zhao, Zesheng Yang, Feng Zheng

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology (SUSTech), Shenzhen, China(南方科技大学计算机科学与工程系,深圳,中国) School of EEE, Nanyang Technological University (NTU), Singapore(南洋理工大学电子工程学院,新加坡) CFAR, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)的CFAR,新加坡)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AnomalyClaw,一种无需训练的视觉异常检测代理,通过多轮反驳过程提升异常判断。在CrossDomainVAD-12基准上,AnomalyClaw在多个模型上均取得显著提升,且引入自演化扩展提升模型性能。

Comments We release the agent, the benchmark, and the analysis artifacts at https://github.com/jam-cc/AnomalyClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16253 2026-05-12 cs.CV cs.AI 76%

Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models

将评分接地:为可靠视觉语言处理奖励模型的显式视觉前提验证

Junxin Wang, Dai Guan, Weijie Qiu, Zhihang Li, Yongbo Gai, Zhengyi Yang, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴大模型应用团队) Alibaba Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所阿里巴巴分所) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV、cs.AI

AI总结 本文提出EVPV方法,通过显式验证视觉前提提升视觉语言处理奖励模型的可靠性,实验表明其在多模态推理基准上提升了重排序准确率。

Comments 27 pages, 4 figures, 10 tables. Evaluated on VisualProcessBench and six multimodal reasoning benchmarks (LogicVista, MMMU, MathVerse-VO, MathVision, MathVista, WeMath). Includes ablations and causal analysis via controlled constraint corruption. Code: https://github.com/Qwen-Applications/EVPV-PRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07177 2026-05-12 cs.LG cs.AI 73%

HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents

HyperEyes: 双粒度效率感知强化学习用于并行多模态搜索代理

Guankai Li, Jiabin Chen, Yi Xu, Xichen Zhang, Yuan Lu

机构 * Xiaohongshu Inc.(小红书公司) University of Cambridge(剑桥大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 HyperEyes通过双粒度效率感知强化学习,实现并行多模态搜索代理,提升搜索效率与准确性,其在六个基准测试中超越现有开源代理。

Comments Code & Data: https://github.com/DeepExperience/HyperEyes

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08820 2026-05-12 cs.CV cs.AI cs.CR 73%

FraudBench: A Multimodal Benchmark for Detecting AI-Generated Fraudulent Refund Evidence

FraudBench: 一个多模态基准用于检测AI生成的欺诈性退款证据

Xinyu Yan, Boyang Chen, Jiaming Zhang, Tiantong Wu, Hong Xi Tae, Yichen He, Tiantong Wang, Yachun Mi, Yurong Hao, Yilei Zhao, Lei Xiao, Longtao Huang, Pengjun Xie, Wei Liu, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性科技实验室) Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出FraudBench,一个用于检测AI生成欺诈性退款证据的多模态基准。通过真实用户评价证据构建,结合图像编辑模型生成伪造证据,并评估不同模型在不同生成器下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09443 2026-05-12 cs.CV cs.CL 70%

Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent

通过角色视角:解决多模态角色扮演代理中的模态-角色干扰

Yihong Tang, Kehai Chen, Xuefeng Bai, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Loop Area Institute (SLAI)(深圳环城院)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出CAVI框架,通过角色视角减少多模态角色扮演代理中的模态-角色干扰,提升角色一致的多模态交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13484 2026-05-12 cs.CV cs.CY 70%

MINGLE: VLMs for Semantically Complex Region Detection in Urban Scenes

MINGLE:用于城市场景中语义复杂区域检测的视觉语言模型

Liu Liu, Alexandra Kudaeva, Marco Cipriano, Fatimeh Al Ghannam, Freya Tan, Gerard de Melo, Andres Sevtsuk

机构 * Massachusetts Institute of Technology(麻省理工学院) Hasso Plattner Institute(于尔克·平特纳研究所)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出MINGLE模型,通过整合人类检测、视觉语言推理和轻量级空间聚合算法,实现城市场景中社交群体区域的检测,贡献包括新数据集和语义丰富的标注方法。

Comments 13 pages, 4 figures Updated with the camera-ready version after acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08136 2026-05-12 cs.CL 67%

EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments

EconWebArena:在现实网络环境中评估自主代理在经济任务上的基准测试

Zefang Liu, Yinzhu Quan

机构 * Capital One Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本文提出EconWebArena基准,通过360个精心挑选的任务测试自主代理在经济任务中的能力,强调权威数据源和基于网络的经济推理,评估多种多模态LLM的表现,揭示性能差距和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10833 2026-05-12 cs.CV cs.AI 62%

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

MMVIAD:多视角多任务视频理解用于工业异常检测

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Meituan Inc.(美团公司) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMVIAD,首个工业异常检测连续多视角视频数据集及多任务评估基准,通过两阶段训练流程提升模型泛化能力,在四个任务中取得优于GPT-5.4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13896 2026-05-12 q-bio.QM cs.AI cs.CV cs.MA 62%

GenCellAgent: Generalizable, Training-Free Cellular Image Segmentation via Large Language Model Agents

GenCellAgent:基于大语言模型代理的通用、无需训练的细胞图像分割

Xi Yu, Yang Yang, Qun Liu, Yonghua Du, Sean McSweeney, Yuewei Lin

机构 * Artificial Intelligence Department, Brookhaven National Laboratory, Upton, 11973, NY, US(1 人工智能部门,布鲁赫萨尔国家实验室,乌普顿,11973,纽约,美国) National Synchrotron Light Source II, Brookhaven National Laboratory, Upton, 11973, NY, US(2 国家同步辐射光源II,布鲁赫萨尔国家实验室,乌普顿,11973,纽约,美国) Biology Department, Brookhaven National Laboratory, Upton, 11973, NY, US(3 生物学部门,布鲁赫萨尔国家实验室,乌普顿,11973,纽约,美国)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 GenCellAgent通过规划-执行-评估循环实现无需训练的细胞图像分割,自动分配最佳工具并支持文本引导分割,优于现有方法且减少标注负担。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10808 2026-05-12 cs.CR cs.AI 57%

Threat Modelling using Domain-Adapted Language Models: Empirical Evaluation and Insights

基于领域适应语言模型的威胁建模:实证评估与洞察

Saba Pourhanifeh, AbdulAziz AbdulGhaffar, Ashraf Matrawy

机构 * Department of Systems(系统部) School of Information Technology(信息技术学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过评估不同规模的领域适应语言模型,探讨了领域适应、模型规模、解码策略和提示技术对STRIDE威胁分类的影响,揭示了当前LLM在结构化威胁建模中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10756 2026-05-12 cs.CV 57%

TINS: Test-time ID-prototype-separated Negative Semantics Learning for OOD Detection

TINS: 测试时ID-原型分离的负语义学习用于OD检测

Yifeng Yang, Jubo Feng, Jing Xu, Xinbing Wang, Qinying Gu, Nanyang Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 TINS通过测试时ID-原型分离负语义学习方法,提升OOD检测性能,实验显示在Four-OOD基准上FPR95显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10531 2026-05-12 cs.AI 57%

A Reflective Storytelling Agent for Older Adults: Integrating Argumentation Schemes and Argument Mining in LLM-Based Personalised Narratives

为老年人设计的反思性叙事代理:在基于LLM的个性化叙事中整合论证方案和论证挖掘

Jayalakshmi Baskar, Vera C. Kaelin, Kaan Kilic, Helena Lindgren

机构 * Umeå University, Department of Computing Science(乌尔姆大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究探讨了基于知识驱动的LLM叙事是否能支持老年人与数字伴侣的有意义互动。通过整合知识图谱、用户建模、论证理论和论证挖掘,系统在生成叙事时提供指导和检查。研究发现,论证质量与清晰度相关,文化相关性影响使用意愿,而高幻觉风险指标的叙事常被感知为不一致。

Comments Submitted to ACM Transactions on Intelligent Systems and Technology (TIST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10186 2026-05-12 cs.CL cs.AI 57%

LegalCiteBench: Evaluating Citation Reliability in Legal Language Models

LegalCiteBench: 评估法律语言模型中的引文可靠性

Sijia Chen, Hang Yin, Shunfan Zhou

机构 * Northeastern University(东北大学) Phala

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出LegalCiteBench,用于评估法律语言模型在闭书环境下引文恢复、验证和案例匹配的能力,发现即使最强模型在引文检索和完成任务上得分低于7/100,且多数模型存在误导性引文问题。

Comments Preprint. 23 pages including references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10130 2026-05-12 cs.CV 57%

Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection

Thermal-Det: 语言引导的跨模态蒸馏用于开放词汇热成像目标检测

Yasiru Ranasinghe, Elim Schenck, Florence Yellin, Shuowen Hu, Christopher Funk, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Kitware DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出Thermal-Det,首个针对热成像的开放词汇检测器,通过合成数据集和跨模态蒸馏提升热成像目标检测性能,实验显示在公开基准上取得2-4%的AP提升。

Comments Accepted at CVPR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04093 2026-05-12 cs.LG 57%

Federated Concept-Based Models: Interpretable models with distributed supervision

联邦概念模型:具有分布式监督的可解释模型

Dario Fenoglio, Arianna Casanova, Francesco De Santis, Gabriele Dominici, Johannes Schneider, Pietro Barbiero, Giovanni De Felice, Marc Langheinrich, Martin Gjoreski

机构 * Università della Svizzera italiana(瑞士联邦理工学院) University of Liechtenstein(利亨斯坦大学) Politecnico di Torino(都灵理工大学) IBM Research Zurich(IBM 苏黎世研究实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出联邦概念模型(F-CMs),在动态联邦学习环境中实现概念可解释性,通过聚合跨机构的概念信息并适应概念监督变化,提升模型准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09976 2026-05-12 cs.CV 57%

OZ-TAL: Online Zero-Shot Temporal Action Localization

OZ-TAL:在线零样本时间动作定位

Chaolei Han, Hongsong Wang, Xin Gong, Jie Gui

机构 * School of Cyber Science and Engineering, Southeast University(东南大学信息科学与工程学院) Engineering Research Center of Blockchain Application, Supervision and Management (Southeast University), Ministry of Education(教育部区块链应用、监督与管理工程研究中心(东南大学)) Purple Mountain Laboratories, Nanjing(紫金山实验室(南京)) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出OZ-TAL任务,旨在在线检测未见过的动作,提出无需训练的框架利用VLMs并增强视觉表示,实验表明方法在离线和在线零样本设置中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09591 2026-05-12 cs.CV 57%

From Pixels to Concepts: Do Segmentation Models Understand What They Segment?

从像素到概念:分割模型是否理解它们所分割的内容?

Shuang Liang, Zeqing Wang, Yuxian Li, Xihui Liu, Han Wang

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) CASIC, The University of Hong Kong(香港大学中国科学院自动化所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出CAFE基准,评估可提示分割模型对概念的忠实性。通过属性层面的反事实操纵,测试模型在误导性提示下的表现,揭示分割模型可能依赖视觉显著但语义误导的线索。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09513 2026-05-12 cs.CV cs.RO 57%

QueST: Persistent Queries as Semantic Monitors for Drift Suppression in Long-Horizon Tracking

QueST:持久查询作为语义监控用于长周期跟踪中的漂移抑制

Mayank Anand, Mohammad Saqlain, Kyan Mahajan, Priya Shukla, Gora Chand Nandi, Andrew Melnik

机构 * Center for Intelligent Robotics(智能机器人中心) Indian Institute of Information Technology Allahabad(阿拔斯理工大学) University of Bremen(不莱梅大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 QueST通过将相关实体视为持久语义查询,而非短暂点跟踪,利用时空视频特征全局注意力,减少漂移并提升长周期跟踪的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09012 2026-05-12 cs.AI 57%

Re$^2$Math: Benchmarking Theorem Retrieval in Research-Level Mathematics

Re²Math:研究级数学中的定理检索基准测试

Zicheng Lyu, Wenjie Yang, Shengzhong Zhang, Zengfeng Huang

机构 * Fudan University(复旦大学) Fudan University Shanghai Innovation Institute(复旦大学上海创新研究院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Re²Math基准测试旨在评估从部分数学证明中检索工具的能力,通过构建包含层级上下文和可选泄漏控制锚点提示的实例,评估系统在检索文献支持的数学工具时的准确性与适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08874 2026-05-12 cs.CV 57%

Semantic Alignment in Hyperbolic Space for Open-Vocabulary Semantic Segmentation

超几何空间中的语义对齐用于开放词汇语义分割

Hoang M. Truong, Hai Nguyen-Truong, Dang Huynh

机构 * Fulbright University Vietnam(富布赖特大学越南分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出HyRo框架,通过解耦超几何空间中的层次和语义对齐,提升开放词汇语义分割性能。

Comments Accepted to the PVUW Workshop at CVPR 2026. Project page: https://tmhoanggg.github.io/HyRo/

详情

展开后加载摘要…

URL PDF HTML 收藏