arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-17 至 2026-03-17 共收录 199 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 23 篇

2603.13884 2026-03-17 cs.CV 83%

SCoCCA: Multi-modal Sparse Concept Decomposition via Canonical Correlation Analysis

SCoCCA: 通过典型相关分析进行多模态稀疏概念分解

Ehud Gordon, Meir Yossef Levi, Guy Gilboa

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出SCoCCA,通过典型相关分析实现多模态稀疏概念分解,提升跨模态对齐与可解释性,实现概念发现的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14349 2026-03-17 cs.IR 82%

Learning Image-Text Matching with Optimal Partial Transport

通过最优部分传输学习图像-文本匹配

Zhengxin Pan, Haishuai Wang, Fangyu Wu, Bailing Zhang, Jiajun Bu, Hongyang Chen

专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract)

AI总结 本文提出OMIT网络,利用最优传输理论和跨模态移动距离,高效计算图像与文本片段相似性,通过部分匹配消除冗余对齐,验证了其在Flickr30K和MS-COCO数据集上的优越性能。

Comments accepted by ICASSP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07685 2026-03-17 cs.CV cs.AI cs.LG 81%

Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought

增强推理的多模态链式推理

Shin'ya Yamaguchi, Kosuke Nishida, Daiki Chijiwa

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出RED方法,通过KL约束奖励最大化提升多模态链式推理的准确性和忠实度,实验表明其在多个基准和模型上显著优于传统方法。

Comments Accepted to CVPR 2026 (Main); Code is available at https://github.com/yshinya6/red/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22596 2026-03-17 cs.CV 79%

SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning

SAM-R1:通过强化学习利用SAM进行多模态分割的奖励反馈

Jiaqi Huang, Zunnan Xu, Jun Zhou, Ting Liu, Yicheng Xiao, Mingwen Ou, Bowen Ji, Xiu Li, Kehong Yuan

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SAM-R1框架,通过整合任务特定的细粒度奖励与定制优化目标,提升多模态模型在图像理解任务中的细粒度推理与分割对齐能力,仅用3k训练样本即在多个基准上取得优异表现。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13370 2026-03-17 cs.CV cs.LG 79%

GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning

GraphVLM:多模态图学习的视觉语言模型基准测试

Jiajin Liu, Dongzhe Fan, Chuanhao Ji, Daochen Zha, Qiaoyu Tan

机构 * NYU Shanghai(纽约大学上海分校) New York University(纽约大学) Rice University(休斯顿大学) East China Normal University(华东师范大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 GraphVLM通过三种范式评估视觉语言模型在多模态图学习中的能力,发现VLM-as-Predictor在性能上表现最佳,展示了其在多模态图学习中的潜力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14745 2026-03-17 cs.LG 78%

CAMD: Coverage-Aware Multimodal Decoding for Efficient Reasoning of Multimodal Large Language Models

CAMD:面向多模态大语言模型高效推理的覆盖感知多模态解码

Huijie Guo, Jingyao Wang, Lingyu Si, Jiahuan Zhou, Changwen Zheng, Wenwen Qiang

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 本文提出CAMD,通过动态分配计算资源提升多模态大语言模型的推理效率与可靠性,解决解码方法在易例和难例间的计算不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09586 2026-03-17 cs.CV 70%

Delving into Spectral Clustering with Vision-Language Representations

深入探讨基于视觉-语言表示的谱聚类

Bo Peng, Yuanwei Hu, Bo Liu, Ling Chen, Jie Lu, Zhen Fang

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于预训练视觉语言模型的神经切线核谱聚类方法,通过跨模态对齐提升图像聚类性能,实验表明在16个基准数据集上显著优于现有方法。

Comments ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14825 2026-03-17 cs.CV cs.AI 62%

Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection

双鸟归一投影:通过推理时特征投影在LVLMs中调和安全与效用

Yewon Han, Yumin Seol, EunGyung Kong, Minsoo Jo, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Mobilint

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了安全与效用在LVLMs中的对抗性,提出通过推理时投影消除模态偏差方向以提升安全性和效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13385 2026-03-17 cs.CV cs.AI cs.CR cs.IR 62%

VisualLeakBench: Auditing the Fragility of Large Vision-Language Models against PII Leakage and Social Engineering

VisualLeakBench: 对大型视觉-语言模型在PII泄露和社会工程中的脆弱性进行审计

Youting Wang, Yuan Tang, Yitian Qian, Chen Zhao

机构 * Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) New York University(纽约大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisualLeakBench,通过合成对抗图像评估LVLMs对OCR注入和PII泄露的鲁棒性,揭示了Claude~4在PII识别上的高风险及防御策略的模板依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13341 2026-03-17 cs.CV cs.AI 62%

Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning

注意源无关跨域少样本学习中的判别性陷阱

Zhenyu Zhang, Yixiong Zou, Yuhua Li, Ruixuan Li, Guangyao Chen

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究源无关跨域少样本学习中增强视觉模态判别性会抑制VLM性能的现象,提出通过扰动视觉学习以引导跨模态对齐的方法,实验显示在多种设置和数据集上取得新状态-of-the-art结果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06569 2026-03-17 cs.CV 61%

Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders

Penguin-VL:探索基于大语言模型的视觉编码器的效率极限

Boqiang Zhang, Lei Ke, Ruihan Yang, Qi Gao, Tianyuan Qu, Rossell Chen, Dong Yu, Leoweiliang

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 图文多模态 :multimodal(abstract,comments);分类 cs.CV

AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。

Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15166 2026-03-17 cs.CV 57%

DAIT: Distillation from Vision-Language Models to Lightweight Classifiers with Adaptive Intermediate Teacher Transfer

DAIT: 从视觉-语言模型到轻量分类器的适应性中间教师知识蒸馏

Zhengxu He, Jun Li, Zhijian Wu

机构 * School of Computer and Electronic Information, Nanjing Normal University, Nanjing, China(南京师范大学计算机与电子信息学院) Medical Artificial Intelligence Lab, Westlake University(西湖大学医学人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DAIT方法,通过引入可训练的中间教师模型,从冻结的视觉-语言模型中适应性地蒸馏出任务对齐的知识,提升细粒度视觉分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15046 2026-03-17 cs.RO cs.AI 57%

AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation

AnoleVLA:基于深度状态空间模型的轻量级视觉-语言-动作模型用于移动操作

Yusuke Takagi, Motonari Kambara, Daichi Yashima, Koki Seno, Kento Tokura, Komei Sugiura

机构 * Keio University(keio大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出AnoleVLA,一种轻量级视觉-语言-动作模型,通过深度状态空间模型高效处理多模态序列,提升移动操作的效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14989 2026-03-17 cs.CV 57%

MMSpec: Benchmarking Speculative Decoding for Vision-Language Models

MMSpec:用于视觉-语言模型的推测解码基准测试

Hui Shen, Xin Wang, Ping Zhang, Yunta Hsieh, Qi Han, Zhongwei Wan, Ziheng Zhang, Jingxuan Zhang, Jing Xiong, Ziyuan Liu, Yifan Zhang, Hangrui Cao, Chenyang Zhao, Mi Zhang

机构 * University of Michigan(密歇根大学) The Ohio State University(俄亥俄州立大学) Independent(独立) Indiana University(印第安纳大学) The University of Hong Kong(香港大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) LMSYS Org(LMSYS组织)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MMSpec基准,评估视觉-语言模型中的推测解码方法,发现文本模型在多模态场景下表现下降,视觉意识在大批次中更关键,且吞吐量提升不等于延迟降低,提出ViSkip方法实现最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11664 2026-03-17 cs.CV 57%

BackdoorIDS: Zero-shot Backdoor Detection for Pretrained Vision Encoder

BackdoorIDS: 预训练视觉编码器的零样本后门检测

Siquan Huang, Yijiang Li, Ningzhi Gao, Xingfu Yan, Leyu Shi, Ying Gao

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 BackdoorIDS通过分析输入在逐步遮蔽过程中的嵌入序列变化,利用密度聚类检测后门攻击,实现对预训练视觉编码器的零样本后门检测,优于现有防御方法。

Comments 17 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04658 2026-03-17 cs.SD cs.AI 57%

LAMB: LLM-based Audio Captioning with Modality Gap Bridging via Cauchy-Schwarz Divergence

LAMB:基于LLM的音频描述通过Cauchy-Schwarz散度弥合模态间隙

Hyeongkeun Lee, Jongmin Choi, KiHyun Nam, Joon Son Chung

专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出LAMB框架,通过Cauchy-Schwarz散度弥合音频与文本嵌入空间的模态差距,设计Two-Stream Adapter和Token Guide提升LLM解码器推理能力,在AudioCaps上取得最佳性能。

Comments 5 pages, 2 figures; Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08723 2026-03-17 cs.LG cs.CV 57%

Is CLIP ideal? No. Can we fix it? Yes!

CLIP是否理想?不。我们能否修复它?是的!

Raphi Kang, Yue Song, Georgia Gkioxari, Pietro Perona

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文分析了CLIP潜在空间的几何局限性,提出DCSM方法以解决其根本问题,提升了CLIP-like模型在多个基准上的性能。

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14336 2026-03-17 cs.CV 57%

UAVBench and UAVIT-1M: Benchmarking and Enhancing MLLMs for Low-Altitude UAV Vision-Language Understanding

UAVBench 和 UAVIT-1M:用于低空无人机视觉-语言理解的LLM基准测试与增强

Yang Zhan, Yuan Yuan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出UAVBench和UAVIT-1M,用于评估和提升LLM在低空无人机视觉-语言任务中的能力,通过大规模数据集和基准测试揭示开源LLM在低空视觉内容生成上的不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14012 2026-03-17 cs.CV 57%

Multi-Grained Vision-Language Alignment for Domain Generalized Person Re-Identification

多粒度视觉-语言对齐用于领域泛化的人员重识别

Jiachen Li, Xiaojin Gong, Dongping Zhang

专题命中 图文多模态 :MLLM(abstract);分类 cs.CV

AI总结 本文提出基于CLIP的多粒度视觉-语言对齐框架,通过引入多粒度提示和自适应掩码模块提升领域泛化人员重识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13951 2026-03-17 cs.CV 57%

DCP-CLIP:A Coarse-to-Fine Framework for Open-Vocabulary Semantic Segmentation with Dual Interaction

DCP-CLIP:一种面向开放词汇语义分割的粗到细框架

Jing Wang, Huimin Shi, Quan Zhou, Qibo Liu, Suofei Zhang, Huimin Lu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出DCP-CLIP框架,通过动态生成文本特征和显式建模双交互,解决开放词汇语义分割中的跨模态通信不足和计算成本高的问题,提升分割精度和效率。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13437 2026-03-17 cs.CV eess.SP 57%

Vision-Language Based Expert Reporting for Painting Authentication and Defect Detection

基于视觉-语言的专家报告用于绘画认证和缺陷检测

Eman Ouda, Mohammed Salah, Arsenii O. Chulkov, Gianfranco Gargiulo, Gian Luca Tartaglia, Stefano Sfarra, Yusra Abdulrahman

机构 * organization= Khalifa University of Science Technology, Department of Aerospace Engineering , city= Abu Dhabi , country= United Arab Emirates organization= National Research Tomsk Polytechnic University , country= Russia organization= Academy of Fine Arts of Naples , city= Naples , country= Italy organization= Academy of Fine Arts of Sassari , city= Sassari , country= Italy organization= Department of Industrial Economics (DIIIE), University of L’Aquila , city= L'Aquila I-67100 , country= Italy organization= Advanced Research Innovation Center (ARIC), Khalifa University of Science \& Technology , city= Abu Dhabi , country= UAE

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种自动化的热成像-视觉-语言模型框架,用于绘画认证和缺陷检测,通过多模态分析与结构化文本报告生成,提高评估的可解释性和一致性。

Comments Submitted to Journal of Cultural Heritage

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18519 2026-03-17 cs.LG 50%

CHIPS: Efficient CLIP Adaptation via Curvature-aware Hybrid Influence-based Data Selection

CHIPS: 通过曲率感知的混合影响数据选择实现高效的CLIP适应

Xinlin Zhuang, Yichen Li, Xiwei Liu, Haolin Yang, Yifan Lu, Ziyun Zou, Yulong Li, Huifa Li, Dongliang Chen, Qinglei Wang, Weiyang Liu, Ying Qian, Jiangming Shi, Imran Razzak

专题命中 图文多模态 :image-text(abstract)

AI总结 本文提出CHIPS方法,通过曲率感知和混合影响数据选择,实现高效的CLIP垂直领域适应,在医疗和通用领域基准中均表现出色。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11920 2026-03-17 cs.RO 50%

H2R: A Human-to-Robot Data Augmentation for Robot Pre-training from Videos

H2R: 一种从视频中为机器人预训练的人到机器人的数据增强

Guangrun Li, Yaoxu Lyu, Zhuoyang Liu, Chengkai Hou, Jieyu Zhang, Shanghang Zhang

专题命中 图文多模态 :image-text(abstract)

AI总结 H2R通过将人类视角视频转换为机器人视角数据,弥合人机视觉差距,提升机器人预训练效果,实验显示在模拟和现实场景中均显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 12 篇

2603.14992 2026-03-17 cs.AI cs.MM 84%

Exposing Cross-Modal Consistency for Fake News Detection in Short-Form Videos

揭示短视频中跨模态一致性以检测虚假新闻

Chong Tian, Yu Wang, Chenxu Yang, Junyi Guan, Zheng Lin, Yuhan Liu, Xiuying Chen, Qirong Ho

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽亚德人工智能大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出MAGIC3模型,通过多粒度跨模态一致性建模提升虚假新闻检测性能,实现高准确率与低成本的平衡。

Comments 16 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13340 2026-03-17 cs.CV 83%

Complementarity-Supervised Spectral-Band Routing for Multimodal Emotion Recognition

互补监督的频带路由用于多模态情感识别

Zhexian Huang, Bo Zhao, Hui Ma, Zhishu Liu, Jie Zhang, Ruixin Zhang, Shouhong Ding, Zitong Yu

机构 * Great Bay University(大湾大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Tencent Youtu Lab(腾讯优图实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出互补监督多频带专家网络Atsuko,通过多尺度频带分解和专家协作,解决多模态情感识别中模态间互补性不足和粗粒融合的问题,提升情感任务的细粒表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13760 2026-03-17 cs.AI cs.SD 79%

Multimodal Emotion Regression with Multi-Objective Optimization and VAD-Aware Audio Modeling for the 10th ABAW EMI Track

多模态情感回归:基于多目标优化和VAD感知音频建模的第10届ABAW EMI任务

Jiawen Huang, Chenxi Huang, Zhuofan Wen, Hailiang Yao, Shun Chen, Longjiang Yang, Cong Yu, Fengyu Zhang, Ran Liu, Bin Liu

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出多目标优化和VAD感知音频建模方法,用于改进Hume-Vidmimic2数据集上的情感模仿强度估计任务,通过多模态融合和共享回归头提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14662 2026-03-17 cs.HC 78%

ViDscribe: Multimodal AI for Customizing Audio Description and Question Answering in Online Videos

ViDscribe:多模态AI用于定制在线视频的音频描述和问答

Maryam Cheema, Sina Elahimanesh, Pooyan Fazli, Hasti Seifi

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 ViDscribe通过整合AI生成的音频描述和六种用户自定义选项,提升视障和低视力用户在YouTube视频中的交互体验,研究显示定制化描述提高了效果和沉浸感。

Comments CHI EA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14636 2026-03-17 cs.SD cs.AI cs.CL eess.AS 67%

Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models

引导隐藏状态:用于大音频-语言模型链式推理的无训练模型引导

Lok-Lam Ieong, Chia-Chien Chen, Chih-Kai Yang, Yu-Han Huang, An-Yu Cheng, Hung-yi Lee

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 研究通过无训练的模型引导方法提升大音频-语言模型的推理能力,采用多种信息源策略在四个模型和四个基准上进行评估,结果显示推理准确率提升达4.4%,并发现跨模态迁移效应。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16917 2026-03-17 cs.SD cs.AI cs.CL eess.AS 67%

SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models

SAKE:迈向大型音频-语言模型的听觉属性知识编辑

Chih-Kai Yang, Yen-Ting Piao, Tzu-Wen Hsu, Szu-Wei Fu, Zhehuai Chen, Ke-Han Lu, Sung-Feng Huang, Chao-Han Huck Yang, Yu-Chiang Frank Wang, Yun-Nung Chen, Hung-yi Lee

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出SAKE基准,用于评估大型音频-语言模型中听觉属性知识的编辑方法,发现多数方法在可靠性上表现良好,但在听觉泛化和多模态知识传播方面存在不足,细调模态连接器比直接编辑LLM更稳健。

Comments Work in progress. Resources: https://github.com/ckyang1124/SAKE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07323 2026-03-17 cs.SD cs.AI eess.AS 62%

Speech Recognition on TV Series with Video-guided Post-ASR Correction

电视剧中基于视频引导的后ASR校正

Haoyuan Yang, Yue Zhang, Liqiang Jing, John H. L. Hansen

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出视频引导后ASR校正框架,利用视频大模态模型捕捉视频上下文以提升ASR在电视剧等复杂环境中的转录准确性。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏