arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 142 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 142 篇

2603.05962 2026-06-24 cs.CV 版本更新 57%

A novel Framework for Open-Vocabulary Multi-Object Recognition using CLIP

一种基于CLIP的开放词汇多目标识别新框架

Wei Yu Chen, Ying Dai

机构 * Faculty of Software and Information Science(软件与信息科学学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出一种两阶段开放词汇目标识别框架,先分割后识别,利用CLIP生成嵌入进行跨模态匹配,在多个数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00918 2026-06-23 cs.AI 版本更新 57%

Sparse Neuron Ablation Triggers Catastrophic Collapse of the Language Core in Large Vision-Language Models

稀疏神经元消融引发大型视觉-语言模型中语言核心的灾难性崩溃

Cen Lu, Yung-Chen Tang, Andrea Cavallaro

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士洛桑联邦理工学院) Idiap Research Institute(日内瓦研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出渐进式神经元消融方法CAN,发现消融极少量(如LLaVA-1.5-7b中仅4个)位于语言模型下投影层的神经元即可导致LVLM灾难性崩溃,揭示功能依赖语言骨干中的稀疏神经元子集。

Comments Accepted to ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19196 2026-06-19 cs.CV 版本更新 57%

Benchmarking Vision Foundation Models for Domain-Generalizable Face Anti-Spoofing

面向域泛化人脸反欺骗的视觉基础模型基准测试

Mika Feng, Pierre Gallin-Martel, Koichi Ito, Takafumi Aoki

机构 * Graduate School of Information Sciences, Tohoku University, Japan(东北大学信息科学研究生院,日本)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文系统评估15种预训练视觉模型在人脸反欺骗域泛化中的表现,发现自监督ViT(尤其是DINOv2+Registers)结合数据增强和注意力损失在MICO协议上达到最优,且计算高效。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21978 2026-06-19 cs.LG cs.AI 版本更新 57%

Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models

超越推理增益:缓解大型推理模型中的通用能力遗忘

Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

机构 * Meta Superintelligence Labs(Meta超智能实验室) New York University(纽约大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对强化学习训练导致推理模型遗忘基础能力的问题,提出RECAP重放策略,通过动态目标重加权在线调整训练重点,在保持通用能力的同时提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18746 2026-06-17 cs.CV 版本更新 57%

Bridging Modality Disconnect in Self-Reflection via Closed-Loop Visually Grounded Verification

通过闭环视觉基础验证弥合自我反思中的模态脱节

Haoyu Zhang, Yuwei Wu, Pengxiang Li, Xintong Zhang, Zhi Gao, Rui Gao, Mingyang Gao, Che Sun, Yunde Jia

机构 * Beijing Institute of Technology(北京理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出MIRROR框架,通过闭环视觉反思(草稿-批评-区域验证-修订)减少VLM幻觉,并构建ReflectV数据集训练视觉基础的多轮反思。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03584 2026-06-16 cs.CV 版本更新 57%

FrameOracle: Learning What to See and How Much to See in Videos

FrameOracle: 学习在视频中看什么以及看多少

Chaoyu Li, Tianzhi Li, Fei Tao, Zhenyu Zhao, Ziqian Wu, Maozheng Zhao, Juntong Song, Cheng Niu, Pooyan Fazli

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出FrameOracle轻量模块,预测相关帧及其数量,通过课程学习从弱代理信号到强监督,在多个VLM和基准上以更少帧数保持或提升精度。

Comments ICML 2026. Project page: https://people-robots.github.io/frameoracle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16093 2026-06-16 cs.CV 版本更新 57%

SAMTok: Representing Any Mask with Two Words

SAMTok: 用两个词表示任意掩码

Yikang Zhou, Tao Zhang, Dengxian Gong, Yuanzheng Wu, Ye Tian, Haochen Wang, Haobo Yuan, Jiacong Wang, Lu Qi, Hao Fei, Anran Wang, Zhuochen Wang, Yujing Wang, Cheng Chen, Shunping Ji, Xiangtai Li

机构 * Wuhan University(武汉大学) ByteDance(字节跳动) NUS(新加坡国立大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出离散掩码分词器SAMTok,将区域掩码转化为两个特殊标记,通过标准下一标记预测和简单强化学习使基础多模态大模型获得像素级能力,在多项任务上达到最先进水平。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05407 2026-06-15 cs.AI 版本更新 57%

PRISM: Perception Reasoning Interleaved for Sequential Decision Making

PRISM: 感知与推理交错用于序列决策

Mohamed Salim Aissi, Clemence Grislain, Clement Romac, Laure Soulier, Mohamed Chetouani, Olivier Sigaud, Nicolas Thome

机构 * Institut National de la Recherche Scientifique (INRS)(国家科学研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出PRISM框架,通过动态问答流水线紧密耦合视觉语言模型(VLM)和语言模型(LLM),实现任务驱动的感知,在ALFWorld和R2R基准上显著超越现有图像模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22791 2026-06-12 cs.CV 版本更新 57%

Modality-Aware Feature Matching in Visual and Vision-Language Applications: A Comprehensive Survey

视觉与视觉-语言应用中的模态感知特征匹配:全面综述

Weide Liu, Wei Zhou, Jun Liu, Ping Hu, Jun Cheng, Jungong Han, Weisi Lin

机构 * School of Computing and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机与人工智能学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) School of Computing and Communications, Lancaster University(兰卡斯特大学计算机与通讯学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Institute for Infocomm Research, Agency for Science, Technology and Research (A*STAR)(新加坡资讯研究院,科技研究局(A*STAR)) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 综述基于模态的特征匹配,涵盖传统手工方法和现代深度学习方法,重点讨论跨RGB、深度、3D点云、LiDAR、医学图像及视觉-语言模态的进展,突出模态感知技术。

Comments CSUR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10999 2026-06-09 cs.CV 版本更新 57%

TraversalBench: Challenging Paths to Follow for Vision Language Models

TraversalBench: 为视觉语言模型设计的复杂路径挑战测试集

Clara Petrova, Zhuo Chen, Marin Soljačić

机构 * Massachusetts Institute of Technology, Department of Physics(麻省理工学院物理系) Massachusetts Institute of Technology, Institute for Data, Systems, and Society(麻省理工学院数据、系统与社会研究所) NSF AI Institute for Artificial Intelligence and Fundamental Interactions(国家科学基金会人工智能与基本相互作用AI研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TraversalBench,一个用于评估视觉语言模型复杂视觉路径跟随能力的受控基准测试集,发现自相交是主要困难来源,揭示了模型在路径感知上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10028 2026-06-09 cs.LG cs.AI cs.DC 版本更新 57%

Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization

基于LLM增强优化的无人机低空经济网络高效机载视觉-语言推理

Yang Li, Ruichen Zhang, Yinqiu Liu, Guangyuan Liu, Abbas Jamalipour, Xianbin Wang, Dong In Kim

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院、新加坡国立科技大学) The University of Sydney, Sydney, Australia(悉尼大学、澳大利亚悉尼) Department of Electrical and Computer Engineering, Western University, London, Canada(电气与计算机工程系、西方大学、加拿大伦敦) Department of Electrical and Computer Engineering, Sungkyunkwan University, South Korea(电气与计算机工程系、全州大学、韩国)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对无人机低空经济网络中机载视觉-语言模型推理的准确性与通信效率挑战,提出分层优化框架,包括交替分辨率与功率优化算法及大语言模型增强的强化学习轨迹优化方法,有效提升推理性能与通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22278 2026-06-08 cs.CV cs.LG 版本更新 57%

The Dual Mechanisms of Spatial Variable Binding in Vision-Language Models

视觉-语言模型中空间变量绑定的双重机制

Kelly Cui, Nikhil Prakash, Shoval Messica, Ayush Raina, David Bau, Antonio Torralba, Tamar Rott Shaham

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Northeastern University(东北大学) Sony Playstation(索尼PlayStation)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文揭示视觉-语言模型通过语言骨干中的内容无关空间关系编码和视觉编码器中的全局布局表示两种机制实现空间变量绑定,其中视觉编码器起主导作用。

Comments 37 pages, 53 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01263 2026-08-07 cs.LG 版本更新 50%

Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models

提炼学生可见内容:面向视觉语言模型的Fisher投影在线策略蒸馏

Leyan Xue, Feng Xiong, Mingjun Ma, Changqing Zhang

专题命中 图文多模态 :multimodal(abstract)

AI总结 针对视觉语言模型在线策略蒸馏中教师修正与学生能力不匹配的问题,提出FP-OPD方法,在8B到2B的蒸馏中使7个多模态基准平均得分分别提升2.77和1.60个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13352 2026-08-04 cs.LG 版本更新 50%

GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding

GeoFlowVLM: 基于几何的联合不确定性用于冻结视觉-语言嵌入

Mayank Nautiyal, Li Ju, Andreas Hellander, Ekta Vats, Prashant Singh

机构 * Department of Information Technology, Uppsala University(乌普萨拉大学信息科技系) SciLifeLab, Uppsala University(乌普萨拉大学SciLifeLab)

专题命中 图文多模态 :cross-modal(abstract)

AI总结 GeoFlowVLM通过流匹配学习双编码VLM嵌入的联合分布,解决视觉-语言模型中缺乏联合不确定性的问题,提出条件检索熵和边际典型性得分以量化不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04171 2026-07-30 cs.RO cs.LG 版本更新 50%

Teaching Tiny VLA Models Where to Look and How to Move

XS-VLA:将粗粒度空间蒸馏与潜在流匹配相结合用于轻量级机器人控制

Iok Tong Lei, Ying Jie Yap, Wei Huang, Qingchen Xie, Qianzhi Li, Yujie Zhang, Xiaolong Liu, Zhidong Deng

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)

专题命中 图文多模态 :multimodal(abstract)

AI总结 提出XS-VLA框架,先通过微调从Qwen3-VL-4B向SmolVLM2-0.25B骨干网蒸馏空间语义知识,再用其增强骨干网训练潜在流匹配策略,提升轻量级机器人控制性能,在LIBERO基准测试中表现出色。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29968 2026-07-27 cs.DB 版本更新 50%

CLIP: Lightweight Cosine-Law-Based Inverted-List Pruning for IVF-Based Vector Search

CLIP:基于余弦定律的轻量级倒排列表剪枝技术用于IVF向量搜索

Yitong Song, Shuhang Lu, Pengcheng Zhang, Jianliang Xu

专题命中 图文多模态 :multimodal(abstract)

AI总结 针对IVF向量搜索中粗粒度执行导致高延迟的问题,提出基于余弦定律的轻量级剪枝技术CLIP,支持簇间和簇内剪枝,显著减少不必要的簇和向量访问,并开发了IVF-CLIP、HIVF-CLIP和LSM-IVF三种变体,实验表明剪枝率达78%,效率提升最高141%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07383 2026-07-20 cs.RO cs.LG 版本更新 50%

RhinoVLA Technical Report

RhinoVLA 技术报告

Huixi Technology, :, Chen Zhang, Chenyang Zhou, Guanglei Ding, Guanghui He, Haibin Gao, Jiajia Chen, Jianyong Zhang, Lianyi Yu, Ningyi Xu, Ping Xu, Qingchen Li, Yingjun Hu, Yijia Zhang, Yuxi Liu

机构 * Huixi Intelligence(慧溪智能)

专题命中 图文多模态 :multimodal(abstract)

AI总结 针对边缘硬件上VLA模型部署延迟问题,提出RhinoVLA,通过令牌高效骨干、连续动作专家和统一接口实现实时闭环控制,在Huixi R1上达到11.69 Hz推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05754 2026-07-17 cs.RO 版本更新 50%

Safe-Night VLA: Seeing the Unseen via Thermal-Perceptive Vision-Language-Action Models for Safety-Critical Manipulation

Safe-Night VLA: 通过热感知视觉-语言-动作模型看见未见事物以实现安全关键操作

Dian Yu, Qingchuan Zhou, Bingkun Huang, Majid Khadiv, Zewen Yang

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑机器人与机器智能研究所(MIRMI),技术大学慕尼黑(TUM))

专题命中 图文多模态 :multimodal(abstract)

AI总结 Safe-Night VLA通过整合热感知技术,实现了安全关键操作中的非可见领域感知与稳健执行。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04364 2026-07-14 cs.LG 版本更新 50%

RL Forgets! Towards Continual Policy Optimization

强化学习会遗忘!迈向持续策略优化

Mao-Lin Luo, Zhe-Xu Wang, Zi-Hao Zhou, Bo Ye, Jian Zhao, Min-Ling Zhang, Tong Wei

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education(教育部计算机网络和信息集成重点实验室(东南大学)) Zhongguancun Academy(中关村科学城公司) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究持续训练中强化学习易遗忘问题,引入MRCL基准测试,提出持续策略优化框架CPO,通过参数移动正则化减少遗忘,多模型规模实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09016 2026-07-10 cs.RO 版本更新 50%

Open-Vocabulary Object-Goal Navigation by Generalizing Semantic Mapping with Dense CLIP

通过用密集CLIP泛化语义映射实现开放词汇目标导航

Meng Wei, Chenyang Wan, Tai Wang, Yuqiang Yang, Wenzhe Cai, Yilun Chen, Hanqing Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 图文多模态 :cross-modal(abstract)

AI总结 研究面向对象的实体导航任务,提出OVExp框架,利用密集CLIP模型展示基于语义地图的目标预测网络泛化能力,设计跨模态转移策略解决训练成本高问题,在ObjectNav基准上对未知目标有强大泛化能力。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04630 2026-07-07 cs.SE 版本更新 50%

Foundation Models for Software Engineering of Cyber-Physical Systems: the Road Ahead

网络物理系统软件工程的基础模型:未来之路

Chengjie Lu, Pablo Valle, Jiahui Wu, Erblin Isaku, Hassan Sartaj, Aitor Arrieta, Shaukat Ali

专题命中 图文多模态 :multimodal(abstract)

AI总结 探讨基础模型在网络物理系统软件工程中的应用,指出除语言模型外其他模型潜力大。通过文献等得出前瞻性研究路线图,突出挑战与机会,还讨论了应用模型的常见挑战,为研究和实践提供指导。

Comments 3 figures, 20 tables, 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16013 2026-06-12 cs.RO cs.SE 版本更新 50%

Safety Case Patterns for VLA-based driving systems: Insights from SimLingo

基于VLA的驾驶系统的安全案例模式:来自SimLingo的见解

Gerhard Yu, Fuyuki Ishikawa, Oluwafemi Odu, Alvine Boaye Belle

机构 * York University(约克大学) National Institute of Informatics(国家信息研究所)

专题命中 图文多模态 :multimodal(abstract)

AI总结 针对VLA驾驶系统提出RAISE安全案例设计方法,通过扩展HARA和定制模式,结合SimLingo案例验证其构建基于证据的安全声明的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏