arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-15 至 2026-05-15 共收录 71 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 24 篇

2605.15054 2026-05-15 cs.CV 70%

LATERN: Test-Time Context-Aware Explainable Video Anomaly Detection

LATERN:测试时上下文感知的可解释视频异常检测

Mitchell Piehl, Muchao Ye

机构 * The University of Iowa(爱荷华大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出LATERN框架,通过上下文感知模块和递归证据聚合模块提升视频异常检测的准确性和解释一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14908 2026-05-15 cs.CV 70%

SteerSeg: Attention Steering for Reasoning Video Segmentation

SteerSeg: 基于注意力引导的视频分割

Ali Cheraghian, Hamidreza Dastmalchi, Abdelwahed Khamis, Morteza Saberi, Aijun An, Lars Petersson

机构 * Macquarie University(麦考瑞大学) York University(约克大学) CSIRO Data61(CSIRO数据61) UTS(UTS大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 SteerSeg通过输入级条件引导解决注意力对齐问题,结合可学习软提示和推理引导的CoT提示,提升视频分割的时空定位能力。

Comments Project page: https://steerseg.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14192 2026-05-15 cs.CL cs.AI 70%

Why Retrieval-Augmented Generation Fails: A Graph Perspective

为何检索增强生成失败:一种图视角

Kai Guo, Xinnan Dai, Zhibo Zhang, Nuohan Lin, Shenglai Zeng, Jie Ren, Haoyu Han, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本文从图视角分析检索增强生成失败原因,发现正确回答具有更深层推理路径和更分布的证据流,而失败回答则表现出碎片化和集中化的证据流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03532 2026-05-15 cs.CV 70%

OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation

OpenTrack3D: 向准确且通用的开放词汇3D实例分割迈进

Zhishan Zhou, Siyuan Wei, Zengran Wang, Chunjie Wang, Xiaosheng Yan, Xiao Liu

机构 * PICO, ByteDance, Beijing(字节跳动北京研究院)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出OpenTrack3D框架,通过在线构建跨视角一致的对象提案和多模态大语言模型提升开放词汇3D实例分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14600 2026-05-15 cs.CL 67%

SciPaths: Forecasting Pathways to Scientific Discovery

SciPaths: 预测科学发现的路径

Eric Chamoun, Yizhou Chi, Yulong Chen, Rui Cao, Zifeng Ding, Michalis Korakakis, Andreas Vlachos

机构 * University of Cambridge(剑桥大学) The Alan Turing Institute(艾伦·图灵研究所) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本文提出SciPaths基准,通过专家标注的262条金路径和2444条银路径,评估科学发现路径预测任务,发现核心方法依赖最难恢复,需改进分解质量以提升端到端路径恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14966 2026-05-15 cs.CV cs.AI 62%

MHSA: A Lightweight Framework for Mitigating Hallucinations via Steered Attention in LVLMs

MHSA:一种轻量级框架,通过引导注意力缓解LVLMs中的幻觉

Wei Ding, Yilin Li, Yudong Zhang, Ruobing Xie, Xingwu Sun, Jiansheng Chen, Yu Wang

机构 * Tsinghua University(清华大学) Tsinghua University, Tencent(清华大学腾讯) Tencent(腾讯) University of Science and Technology Beijing(北京科技大学) University of Macau(澳门大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MHSA框架,通过学习修正跨模态注意力模式来缓解LVLMs中的幻觉,采用简单三层MLP生成器和DHCP判别器信号指导训练,无需修改模型参数即可在多种数据集和模型上有效减少判别和生成幻觉。

Comments 19 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14413 2026-05-15 cs.LG cs.AI 62%

MahaVar: OOD Detection via Class-wise Mahalanobis Distance Variance under Neural Collapse

MahaVar: 通过神经崩溃下类内马哈拉诺斯距离方差实现分布外检测

Donghwan Kim, Hyunsoo Yoon

机构 * Department of Industrial Engineering(工业工程系) Yonsei University(延世大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MahaVar方法,利用类内马哈拉诺斯距离方差作为分布外检测指标,在CIFAR-100和ImageNet上取得最佳性能。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14389 2026-05-15 cs.AI cs.CL cs.LG 62%

Nexus : An Agentic Framework for Time Series Forecasting

Nexus:一个用于时间序列预测的代理框架

Sarkar Snigdha Sarathi Das, Palash Goyal, Mihir Parmar, Nanyun Peng, Vishy Tirumalashetty, Chun-Liang Li, Rui Zhang, Jinsung Yoon, Tomas Pfister

机构 * Google(谷歌) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 Nexus框架通过分解预测任务,整合上下文信息,提升时间序列预测的准确性与可解释性,超越传统模型和LLM的局限。

Comments 30 Pages, 3 figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15109 2026-05-15 cs.AI cs.IR 57%

Why Neighborhoods Matter: Traversal Context and Provenance in Agentic GraphRAG

为什么社区重要:代理图RAG中的遍历上下文与溯源

Riccardo Terrenzi, Maximilian von Zastrow, Serkan Ayvaz

机构 * Centre for Industrial Software, University of Southern Denmark, Alsion 2, 6400 Sønderborg, Denmark(丹麦南部大学工业软件中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文探讨了代理图RAG中引用忠实性的轨迹层面问题,通过实验表明引用证据和遍历上下文都对答案准确性有影响。

Comments 7 pages, 2 figures, Submitted at IJCAI-ECAI 2026 Joint Workshop on GENAIK and NORA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14607 2026-05-15 cs.CV cs.CY 57%

ViMU: Benchmarking Video Metaphorical Understanding

ViMU:视频隐喻理解基准测试

Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 ViMU旨在评估视频理解模型对隐含意义的识别能力,通过多模态证据推理,解决现有模型对隐喻、讽刺和社会意义理解不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19973 2026-05-15 cs.NI cs.AI 57%

A Tutorial on Cognitive Biases in Agentic AI-Driven 6G Autonomous Networks

面向6G自主网络的智能偏差教程

Hatim Chergui, Farhad Rezazadeh, Merouane Debbah, Christos Verikoukis

机构 * i2CAT Foundation(i2CAT基金会) Hostelworld Group(Hostelworld集团) Technical University of Catalonia (UPC)(技术大学(加泰罗尼亚)) Khalifa University of Science and Technology(卡里玛大学) ISI/ATH University of Patras(帕特拉大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文探讨了在6G自主网络中因人类设计引入的认知偏差问题,通过两个案例展示如何利用智能体AI缓解锚定偏差和时间偏差,提升网络管理和边缘计算的效率与节能效果。

Comments 26 pages, 18 figures, 4 tables, link to source code available. Accepted at IEEE OJCOMS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13884 2026-05-15 q-bio.NC cs.AI 57%

Consciousness as Uncommon Self-Knowledge: A Synergistic Information Framework

意识作为罕见的自我知识:一种协同信息框架

Krti Tallam

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出罕见自我知识作为意识的标准,通过协同信息框架区分意识与元认知,解决IIT等理论的反例,并提供可操作的实证预测。

Comments Conceptual and formal paper on consciousness as uncommon self-knowledge, 8 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15019 2026-05-15 cs.CL 50%

From Scenes to Elements: Multi-Granularity Evidence Retrieval for Verifiable Multimodal RAG

从场景到元素:面向可验证多模态RAG的多粒度证据检索

Guanhua Chen, Chuyue Huang, Yutong Yao, Shudong Liu, Xueqing Song, Lidia S. Chao, Derek F. Wong

机构 * NLP 2 CT Lab, Department of Computer and Information Science, University of Macau(NLP2CT实验室,计算机与信息科学系,澳门大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出GranuRAG框架,通过多粒度跨模态对齐和元素级检索,解决多模态RAG中粗粒度证据与细粒度查询不匹配的问题,提升可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14169 2026-05-15 cs.CL 50%

BOOKMARKS: Efficient Active Storyline Memory for Role-playing

BOOKMARKS: 为角色扮演高效主动故事线记忆

Letian Peng, Ziche Liu, Yiming Huang, Longfei Yun, Kun Zhou, Yupeng Hou, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 BOOKMARKS通过主动初始化和维护任务相关书签,提升角色扮演代理的长期一致性,有效避免信息丢失。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 2 篇

2605.13862 2026-05-15 cs.GR cs.CV eess.IV 70%

Seed3D 2.0: Advancing High-Fidelity Simulation-Ready 3D Content Generation

Seed3D 2.0: 推动高保真仿真准备的3D内容生成

Diandian Gu, Jing Lin, Gaohong Liu, Jiahang Liu, Su Ma, Guang Shi, Jun Wang, Qinlong Wang, Qianyi Wu, Zhongcong Xu, Xuanyu Yi, Zihao Yu, Jianfeng Zhang, Zhuolin Zheng, Yifan Zhu, Rui Chen, Hengkai Guo, Xiaoyang Guo, Mingcong Han, Xu Han, Xiu Li, Yixun Liang, Weiqiang Lou, Junzhe Lu, Guan Luo, Minghan Qin, Shuguang Wang, Yuang Wang

机构 * ByteDance(字节跳动)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 Seed3D 2.0通过改进生成保真度、仿真能力及应用范围,引入统一PBR模型和仿真准备模型套件,提升3D内容生成精度与视觉效果。

Comments Seed3D 2.0 Technical Report; Official Page on https://seed.bytedance.com/seed3d_2_0

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23477 2026-05-15 cs.CL 50%

MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring

MMTutorBench:首个多模态AI数学辅导基准

Tengchao Yang, Sichen Guo, Mengzhao Jia, Jiaming Su, Yuanyang Liu, Zhihan Zhang, Meng Jiang

机构 * Tongji University(同济大学) Fudan University(复旦大学) University of Notre Dame(圣母大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 文档图表理解 :multimodal large language model(abstract)

AI总结 MMTutorBench首次提出多模态AI数学辅导基准,包含685个围绕教学关键步骤构建的问题,通过六维度细粒度评估和三个任务(洞察发现、操作构建、操作执行)评估12个顶级MLLMs,揭示了专有与开源系统间的性能差异及OCR、少样本提示等对辅导质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 6 篇

2605.14801 2026-05-15 cs.RO 88%

Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN

探索VLM-LLM导航中的瓶颈:3D场景理解能力如何影响零样本VLN

Ziyi Xia, Chaoran Xiong, Litao Wei, Xinhao Hu, Ling Pei

机构 * Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(上海导航与基于位置的服务关键实验室,上海交通大学)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract)

AI总结 本文研究了零样本视觉-语言导航中3D场景理解能力对性能的影响,提出了统计成功率上限,揭示了感知饱和现象,建议转向导航相关的核心词汇和准确的边界框比例。

Comments Accepted by ICRA Workshop MM-Spatial AI, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14747 2026-05-15 cs.CL cs.AI cs.CV cs.LG 80%

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

Video2GUI:合成大规模交互轨迹用于通用GUI代理预训练

Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Video2GUI框架,通过自动提取互联网视频中的GUI交互轨迹,生成大规模数据集WildGUI,提升了GUI代理的泛化能力。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13609 2026-05-15 cs.CV cs.LG 73%

Do-Undo Bench: Reversibility for Action Understanding in Image Generation

Do-Undo基准:图像生成中动作理解的可逆性

Shweta Mahajan, Shreya Kadambi, Hoang Le, Rajeev Yasarla, Apratim Bhattacharyya, Munawar Hayat, Fatih Porikli

机构 * York University(约克大学) Vector Institute for AI(人工智能向量研究所) Qualcomm AI Research(高通人工智能研究)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Do-Undo任务和基准,解决视觉-语言模型在理解并生成由现实动作驱动的场景变换中的关键缺口。通过要求模型模拟现实动作的后果并逆转至原始状态,测试真正的因果理解。实验表明当前模型在动作可逆性上存在困难,凸显评估动作理解的必要性。

Comments Project page: https://s-mahajan.github.io/Do-Undo-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14950 2026-05-15 cs.CV cs.RO 57%

Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model

Evo-Depth:一种轻量化的深度增强视觉-语言-动作模型

Tao Lin, Yuxin Du, Jiting Liu, Nuobei Zhu, Yunhe Li, Yuqian Fu, Yinxinyu Chen, Hongyi Cai, Zewei Ye, Bing Cheng, Kai Ye, Yiran Mao, Yilei Zhong, MingKang Dong, Junchi Yan, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 大学科学与技术大学) Nanyang Technological University(南洋理工大学) SJTU-Quic Robot Joint Lab(上海交通大学-Quick 机器人联合实验室)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出Evo-Depth模型,通过轻量隐式深度编码模块和空间增强模块提升视觉-语言-动作任务中的空间感知能力,实现高效部署与高精度操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14851 2026-05-15 cs.CV cs.RO 57%

AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving

AutoMoT:一种基于异步混合变换器的统一视觉-语言-动作模型用于端到端自动驾驶

Wenhui Huang, Songyan Zhang, Qihang Huang, Zhidong Wang, Zhiqi Mao, Collister Chua, Zhan Chen, Long Chen, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Harvard University, US(哈佛大学,美国)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出AutoMoT,一种统一视觉-语言-动作模型,通过异步混合变换器架构解决自动驾驶中推理与动作空间分布不一致、推理效率低等问题,实验证明其在多基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14051 2026-05-15 cs.AI 57%

SPIN: Structural LLM Planning via Iterative Navigation for Industrial Tasks

SPIN:通过迭代导航进行工业任务的结构LLM规划

Yusuke Ozaki, Dhaval Patel

机构 * University at Albany(阿尔巴马大学) IBM(国际商业机器公司) Kwansei Gakuin University(关西大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 SPIN通过结合验证的有向无环图规划与前缀执行控制,减少任务执行次数并提高完成率,适用于工业任务规划。

Comments 31 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 1 篇

2605.14396 2026-05-15 cs.CV cs.CR cs.LG cs.RO 73%

Systematic Discovery of Semantic Attacks in Online Map Construction through Conditional Diffusion

通过条件扩散系统发现在线地图构建中的语义攻击

Chenyi Wang, Ruoyu Song, Raymond Muller, Jean-Philippe Monteuuis, Jonathan Petit, Z. Berkay Celik, Ryan Gerdes, Ming F. Li

机构 * University of Arizona(亚利桑那大学) Purdue University(普渡大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本文提出MIRAGE框架,系统发现能绕过对抗防御的语义攻击,通过寻找环境变化(如阴影、湿路)来降低地图预测准确性,实验显示两种攻击在多种防御下仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 15 篇

2602.04657 2026-05-15 cs.CV 87%

TRIO: Token Reduction via Inference-Objective Guidance for Efficient Vision-Language Models

TRIO: 通过推理目标引导的令牌缩减以提高视觉-语言模型的效率

Haokui Zhang, Congyang Ou, Dawei Yan, Peng Wang, Qingsen Yan, Yu Zhang, Ying Li, Rong Xiao

机构 * School of Cyberspace Security, Northwestern Polytechnical University(网络安全学院,西北工业大学) School of Computer Science, Northwestern Polytechnical University(计算机学院,西北工业大学) Intellifusion(智融科技)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract);分类 cs.CV

AI总结 TRIO从推理目标角度出发,通过梯度显著性指导视觉令牌压缩,保留输出不变性,提升视觉-语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14621 2026-05-15 cs.CV cs.AI cs.CL 82%

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

我们真的需要外部工具来缓解幻觉吗?SIRA:共享前缀内部重构归因

Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

机构 * Tsinghua University(清华大学) The University of Sydney(悉尼大学) Stanford University(斯坦福大学) Baichuan AI(百川AI)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 SIRA通过内部构建对比参考减少视觉语言模型的幻觉,无需外部工具或额外计算,保持描述覆盖并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14291 2026-05-15 cs.CR cs.AI cs.CL cs.CV cs.LG 82%

To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model

看清并非学习:保护多模态数据免受大视觉语言模型的未经授权微调

Chengshuai Zhao, Zhen Tan, Dawei Li, Zhiyuan Yu, Huan Liu

机构 * School of Computing Augmented Intelligence, Arizona State University, Tempe, AZ, USA Department of Computer Science Engineering, Texas A\&M University, College Station, TX, USA

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出MMGuard,通过注入不可察觉扰动主动利用LVLM学习动态,生成不可学习示例,从而保护多模态数据免受未经授权的微调。通过最小化训练损失,扰动创建优化捷径,导致模型在推理时因噪声过拟合而性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14938 2026-05-15 cs.LG cs.CV 81%

Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models

Octopus:无历史梯度正交化用于多模态大语言模型中的持续学习

Yuehao Liu, Shanyan Guan, Weijia Zhang, Xuanming Shang, Yanhao Ge, Wei Li, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能大模型关键实验室,人工智能研究院,上海交通大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

AI总结 Octopus提出一种基于无历史梯度正交化的方法,通过两阶段微调策略平衡持续学习中的可塑性与稳定性,实验表明其在UCIT数据集上性能优于现有最佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14893 2026-05-15 cs.CV cs.AI cs.LG 80%

Your CLIP has 164 dimensions of noise: Exploring the embeddings covariance eigenspectrum of contrastively pretrained vision-language transformers

你的CLIP有164个噪声维度:探索对比性预训练视觉-语言变换器的嵌入协方差特征谱

Jakub Grzywaczewski, Dawid Płudowski, Przemysław Biecek

机构 * Warsaw University of Technology(华沙技术大学) Centre for Credible Artificial Intelligence(可信人工智能中心) University of Warsaw(华沙大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文通过协方差矩阵谱分解,揭示对比预训练VLMs的潜在空间中多模态噪声结构,发现去除共享噪声维度对下游任务性能无害,提供对现代VLMs表征结构的新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14988 2026-05-15 cs.CV 77%

Compositional Video Generation via Inference-Time Guidance

通过推理时间引导进行组合视频生成

Ariel Shaulov, Eitan Shaar, Amit Edenzon, Gal Chechik, Lior Wolf

机构 * Tel-Aviv University(特拉维夫大学) Bar Ilan University(巴伊兰大学) NVIDIA Research(NVIDIA研究)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 本文提出CVG方法,通过利用交叉注意力图中的空间时间接地信号,提升冻结文本到视频模型的组合忠实度,无需修改模型结构或微调生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12624 2026-05-15 cs.RO cs.CV 70%

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

MindVLA-U1:统一流架构使VLA超越VA用于自动驾驶

Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Li Auto Tsinghua University(清华大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 MindVLA-U1通过统一流架构实现自动驾驶中VLA超越VA,采用统一视觉语言模型骨干和流匹配连续动作轨迹,在保持各模态自然输出形式的同时,实现高效规划和低延迟。

Comments Work in progress. Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏