arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-17 至 2026-03-17 共收录 199 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 12 篇

2603.13824 2026-03-17 cs.SD cs.AI 57%

Evaluating Semantic Fragility in Text-to-Audio Generation Systems Under Controlled Prompt Perturbations

在受控提示扰动下评估文本到音频生成系统中的语义脆弱性

Jiahui Wu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文评估文本到音频生成系统在受控提示扰动下的语义脆弱性,通过三种扰动方法测试不同模型的鲁棒性,发现大模型在语义一致性上表现更好,但音频和时间分析显示存在持续差异。

Comments 8 pages, 4 figures, Under ICCC'26 review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13262 2026-03-17 cs.SD cs.AI 57%

Evaluation of Audio Language Models for Fairness, Safety, and Security

音频语言模型的公平性、安全性和安全性评估

Ranya Aloufi, Srishti Gupta, Soumya Shaw, Battista Biggio, Lea Schönherr

机构 * Computer Science, Taibah University, Saudi Arabia(塔布大学计算机科学系,沙特阿拉伯) La Sapienza, University of Rome, Rome, Italy(罗马大学拉·萨皮恩扎分校,意大利) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(信息安全赫尔姆霍茨研究中心,德国萨尔布吕肯) University of Cagliari, Cagliari, Italy(卡利亚里大学,意大利卡利亚里)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种结构化分类方法,评估音频语言模型在公平性、安全性和安全性方面的表现,揭示音频信息整合对语义推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15668 2026-03-17 cs.SD 50%

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

EmotionThinker: 基于语调感知的强化学习用于可解释的语音情绪推理

Dingdong Wang, Shujie Liu, Tianhua Zhang, Youjun Chen, Jinyu Li, Helen Meng

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出EmotionThinker,通过强化学习将语音情绪识别转化为深度推理问题,利用细粒度声学线索生成可解释的情绪预测,改进了语音大语言模型的语调感知能力。

Comments ICLR 2026 (Oral). Project page: https://github.com/dingdongwang/EmotionThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15206 2026-03-17 cs.LG 50%

Chorus: Harmonizing Context and Sensing Signals for Data-Free Model Customization in IoT

Chorus:谐音上下文和传感信号以实现物联网中的无数据模型定制

Liyu Zhang, Yejia Liu, Kwun Ho Liu, Runxi Huang, Xiaomin Ouyang

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 Chorus通过学习上下文表示,在无需目标域数据的情况下,实现对未知部署条件的模型自适应,实验显示其在多种传感任务中性能优于现有方法,且推理延迟接近传感器部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13313 2026-03-17 cs.RO 50%

MRPoS: Mixed Reality-Based Robot Navigation Interface Using Spatial Pointing and Speech with Large Language Model

基于混合现实的机器人导航接口:结合空间指针与语音及大语言模型

Eduardo Iglesius, Masato Kobayashi, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Kobe University(Kobe大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出MRPoS接口,利用空间指针和语音交互替代传统手势,提升机器人导航的直观性和效率,实验表明任务完成时间与工作负荷显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频多模态 33 篇

2603.14719 2026-03-17 cs.LG 82%

Multimodal Deep Learning for Early Prediction of Patient Deterioration in the ICU: Integrating Time-Series EHR Data with Clinical Notes

多模态深度学习用于ICU中患者恶化的早期预测:整合时间序列电子健康记录数据与临床笔记

Binesh Sadanandan

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出一种多模态深度学习方法,结合结构化时间序列数据和非结构化临床笔记,用于预测ICU患者恶化。模型在MIMIC-IV数据库上训练,测试集AUROC达0.7857,临床笔记提升AUROC2.5个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15392 2026-03-17 cs.MM cs.HC 79%

Multimodal Cyber-physical Interaction in XR: Hybrid Doctoral Thesis Defense

XR中的多模态物理交互:混合博士论文答辩

Ahmad Alhilal, Kit Yung Lam, Lik-Hang Lee, Xuetong Wang, Sijia Li, Matti Siekkinen, Tristan Braud, Pan Hui

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出一种多模态框架,突破传统答辩模式,支持现场、虚拟现实和浏览器等多种参与方式,通过全身体姿追踪实现自然交互,验证了其在混合活动中的有效性。

Comments 10 pages, 3 figures, magazine paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07463 2026-03-17 cs.CV cs.LG eess.IV 79%

MSEG-VCUQ: Multimodal SEGmentation with Enhanced Vision Foundation Models, Convolutional Neural Networks, and Uncertainty Quantification for High-Speed Video Phase Detection Data

MSEG-VCUQ: 多模态分割与增强视觉基础模型、卷积神经网络和不确定性量化用于高速视频相位检测数据

Chika Maduabuchi, Ericmoore Jossou, Matteo Bucci

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MSEG-VCUQ,结合U-Net和SAM提升高速视频相位检测分割精度,引入不确定性量化和首个开源多模态数据集,实现更可靠的相位分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13759 2026-03-17 cs.CV 79%

QTrack: Query-Driven Reasoning for Multi-modal MOT

QTrack: 基于查询的多模态 MOT 推理

Tajamul Ashraf, Tavaheed Tariq, Sonia Yadav, Abrar Ul Riyaz, Wasif Tak, Moloud Abdar, Janibul Bashir

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出基于查询的多模态 MOT 推理方法,通过自然语言查询定位和跟踪特定目标,构建了 RMOT26 基准并提出 QTrack 模型,结合多模态推理与跟踪定位,提升语言引导的跟踪性能。

Comments Project Page: https://gaashlab.github.io/QTrack/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13367 2026-03-17 cs.CV cs.LG 79%

Multimodal Deep Learning for Dynamic and Static Neuroimaging: Integrating MRI and fMRI for Alzheimer Disease Analysis

多模态深度学习用于动态和静态神经影像:整合MRI和fMRI进行阿尔茨海默病分析

Anima Kujur, Zahra Monfared

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态深度学习框架,整合MRI和fMRI对阿尔茨海默病、轻度认知障碍和正常认知状态进行多类分类,通过3D卷积神经网络提取结构特征,用递归架构学习fMRI的时间特征,并融合这些表示进行联合空间-时间学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14953 2026-03-17 cs.CV cs.AI 73%

Learning Question-Aware Keyframe Selection with Synthetic Supervision for Video Question Answering

基于合成监督的学习问题感知关键帧选择用于视频问答

Minchan Kwon, Hyounguk Shon, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种问题感知的关键帧选择框架,通过伪关键帧标签和覆盖正则化提升视频问答的准确率,尤其在时间与因果问题上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15008 2026-03-17 cs.CV 70%

Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning

线索至关重要:利用潜在视觉线索增强视频推理

Kaixin zhang, Xiaohe Li, Jiahao Li, Haohua Wu, Xinyu Zhao, Zide Fan, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)

专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ClueNet框架,通过两阶段监督微调方法,解决视频推理中视觉线索提取、过滤与推理对齐问题,提升视频问答的准确性和可解释性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06662 2026-03-17 cs.CV cs.LG 70%

HyperTokens: Controlling Token Dynamics for Continual Video-Language Understanding

HyperTokens: 通过控制令牌动态实现连续视频-语言理解

Toan Nguyen, Yang Liu, Celso De Melo, Flora D. Salim

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出HyperTokens,通过按需生成微调令牌,控制提示更新并保持内存固定,通过元启发式正则化抑制遗忘,提升连续视频问答任务的准确率与保留率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12664 2026-03-17 cs.CL cs.AI 62%

From Text to Forecasts: Bridging Modality Gap with Temporal Evolution Semantic Space

从文本到预测:通过时间演化的语义空间弥合模态差距

Lehui Li, Yuyao Wang, Jisheng Yan, Wei Zhang, Jinliang Deng, Haoliang Sun, Zhongyi Han, Yongshun Gong

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TESS方法,通过引入时间演化语义空间弥合文本与预测模型间的模态差距,实验显示在四个真实世界数据集上预测误差降低29%。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10979 2026-03-17 cs.CV cs.AI 62%

PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs

PAS:一种无训练的时序编码稳定器

Bowen Sun, Yujun Cai, Ming-Hsuan Yang, Hang Wu, Yiwei Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对视频大语言模型中时序不一致问题,提出PAS机制,通过相位聚合平滑技术减少帧间扰动,提升注意力稳定性,实验表明在不增加计算开销的情况下提升了视频理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13374 2026-03-17 cs.CV cs.AI 62%

Geometry-Aware Semantic Reasoning for Training Free Video Anomaly Detection

基于几何的语义推理用于无训练视频异常检测

Ali Zia, Usman Ali, Muhammad Umer Ramzan, Hamza Abid, Abdul Rehman, Wei Xiang

机构 * School of Computing, Engineering \& Mathematical Sciences, La Trobe University, Melbourne, Australia School of Engineering Applied Sciences, GIFT University, Gujranwala 52250, Pakistan

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MM-VAD框架,通过将异常检测转为适应性测试时推理,利用双曲空间保留层次结构,并结合可学习提示和Mahalanobis细化提升性能,实现在多个基准上优于现有无训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05092 2026-03-17 cs.LG cs.AI cs.CL 62%

Aura: Universal Multi-dimensional Exogenous Integration for Aviation Time Series

Aura:通用多维外源整合用于航空时间序列

Jiafeng Lin, Mengren Zheng, Simeng Ye, Yuxuan Wang, Huan Zhang, Yuhui Liu, Zhongyi Pei, Jianmin Wang

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学) Hongshen College, Chongqing University(弘深学院、重庆大学) School of Software, Tsinghua University(软件学院、清华大学) China Southern Airlines(中国南方航空)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Aura框架,通过整合多维外源因素提升航空时间序列预测精度,实验表明其在航空安全与可靠性方面具有广泛应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15167 2026-03-17 cs.CV 57%

Question-guided Visual Compression with Memory Feedback for Long-Term Video Understanding

基于记忆反馈的问题引导视觉压缩用于长期视频理解

Sosuke Yamao, Natsuki Miyahara, Yuankai Qi, Shun Takeuchi

机构 * Fujitsu Research(富士通研究实验室) Macquarie University(麦考瑞大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出QViC-MF框架,通过问题引导的多模态选择性注意力和记忆反馈提升长期视频理解性能,在多个基准测试中取得显著提升。

Comments Accepted to CVPR 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15153 2026-03-17 cs.CV 57%

TextOVSR: Text-Guided Real-World Opera Video Super-Resolution

TextOVSR: 基于文本引导的现实世界歌剧视频超分辨率

Hua Chang, Xin Xu, Wei Liu, Jiayi Wu, Kui Jiang, Fei Ma, Qi Tian

机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System(湖北省智能信息处理与实时工业系统重点实验室) Harbin Institute of Technology Zhengzhou Research Institute(哈尔滨工业大学郑州研究所) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Huawei Technologies Ltd(华为技术有限公司)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对歌剧视频因早期拍摄设备限制和长期存储退化导致的视觉质量差问题,本文提出TextOVSR网络,通过引入两种文本提示引导超分辨率过程,结合文本增强判别器和降质鲁棒特征融合模块,提升纹理重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15003 2026-03-17 cs.CV 57%

Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning

Edit2Interp:从空间编辑到视频帧插值的图像基础模型适应

Nasrin Rahimi, Mısra Yavuz, Burak Can Biner, Yunus Bilge Kurt, Ahmet Rasim Emirdağı, Süleyman Aslan, Görkay Aydemir, M. Akın Yılmaz, A. Murat Tekalp

机构 * Codeway AI Research Dept. of Electrical \& Electronics Engineering, Ko c University, \. I stanbul, T\" u rkiye

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

AI总结 本文通过少量样本学习,将图像编辑模型适应于视频帧插值,揭示了静态场景中物体变换的理解可激活潜在的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14935 2026-03-17 cs.CV 57%

Video-CoE: Reinforcing Video Event Prediction via Chain of Events

Video-CoE:通过事件链强化视频事件预测

Qile Su, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里妈妈,阿里巴巴集团)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 本文提出Video-CoE方法,通过构建时间事件链提升视频事件预测的准确性,实验表明其优于现有主流大语言模型。

Comments 21 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06097 2026-03-17 cs.CV 57%

VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning

VideoChat-A1: 通过镜头链推理实现长视频的思考

Zikang Wang, Boyu Chen, Zhengrong Yue, Yi Wang, Yu Qiao, Limin Wang, Yali Wang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 VideoChat-A1通过镜头链推理方法,有效解决长视频理解难题,实现优于现有方法的性能,同时在效率上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14750 2026-03-17 cs.CV 57%

Face-Guided Sentiment Boundary Enhancement for Weakly-Supervised Temporal Sentiment Localization

基于面部引导的弱监督时间情感定位边界增强

Cailing Han, Zhangbin Li, Jinxing Zhou, Wei Qian, Jingjing Hu, Yanghao Zhou, Zhangling Duan, Dan Guo

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FSENet框架,通过面部特征引导情感定位,解决弱监督时间情感定位中的边界不精确问题,实现跨不同标注设置的高泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14733 2026-03-17 cs.CV 57%

A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding

一种具备技能的代理框架和多视频理解基准

Yue Zhang, Liqiang Jing, Jia Li, Yapeng Tian, Xinya Du, Yunhui Guo, Vibhav Gogate

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MVX-Bench多视频跨维基准和SAMA框架,通过整合视觉工具和技能实现结构化推理,实验显示其在多视频理解任务中优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14401 2026-03-17 cs.RO cs.CV 57%

OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer

OCRA:基于3D和触觉先验的人到机器人动作迁移的物体中心学习

Kuanning Wang, Ke Fan, Yuqian Fu, Siyu Lin, Hu Luo, Daniel Seita, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 OCRA通过结合3D和触觉先验,利用多视角视频和先进模型重建物体中心3D点云,生成稳健的机器人操作动作,实验表明其在视觉和视觉-触觉任务中优于现有方法。

Comments Project page: https://sressers.github.io/OCRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14361 2026-03-17 cs.CV 57%

BROTHER: Behavioral Recognition Optimized Through Heterogeneous Ensemble Regularization for Ambivalence and Hesitancy

BROTHER: 通过异质性集成正则化优化行为识别以应对矛盾与犹豫

Alexandre Pereira, Bruno Fernandes, Pablo Barros

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出BROTHER框架,通过异质集成正则化方法,结合视觉、音频和语言数据,提升对矛盾与犹豫等复杂行为状态的识别能力,采用PSO硬投票集成策略,实现宏F1分数达0.7465。

Comments 5 pages, 2 figures, 3 tables, Ambivalence/Hesitancy (AH) Video Recognition Challenge, ABAW10th, CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14300 2026-03-17 cs.CV 57%

Show Me When and Where: Towards Referring Video Object Segmentation in the Wild

展示时间与地点:迈向野外的指称视频对象分割

Mingqi Gao, Jinyu Yang, Jingnan Luo, Xiantong Zhen, Jungong Han, Giovanni Montana, Feng Zheng

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种新的野外指称视频对象分割任务,引入了包含更多时长和场景的YoURVOS数据集,并提出OMFormer方法以实现高效的时空定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14245 2026-03-17 cs.LG cs.AI 57%

GoldenStart: Q-Guided Priors and Entropy Control for Distilling Flow Policies

GoldenStart: 基于Q引导先验和熵控制的流策略蒸馏

He Zhang, Ying Sun, Hui Xiong

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出GoldenStart方法,通过Q引导先验和显式熵控制,改进流匹配策略的生成起点和探索能力,实现在连续控制任务中高效且具有探索性的策略。

Comments 23 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01804 2026-03-17 cs.CV 57%

V-CORE: Temporally Consistent Video Understanding for Video-LLM

V-CORE:面向视频大语言模型的时序一致视频理解

Zhengjian Kang, Qi Chen, Rui Liu, Kangtong Mo, Xingyu Zhang, Xiaoyu Deng, Ye Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 V-CORE通过引入显式时序约束提升视频理解性能,采用可学习空间聚合和因果感知时间投影器,有效解决视频时序一致性问题,在多个基准测试中取得显著成果。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19554 2026-03-17 cs.CV 57%

Harvest Video Foundation Models via Efficient Post-Pretraining

通过高效后预训练收获视频基础模型

Yizhuo Li, Kunchang Li, Yinan He, Yi Wang, Yali Wang, Limin Wang, Yu Qiao, Ping Luo

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种高效框架,通过随机丢弃视频片段和遮蔽文本来从图像基础模型中获取视频基础模型,提升了训练效率并强化了跨模态融合,实验表明其在多种视频-语言任务中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏