arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-04 至 2026-03-04 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 9 篇

2505.19892 2026-03-04 cs.AI 83%

OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging

OptMerge: 通过模型融合统一多模态大语言模型的能力与模态

Yongxian Wei, Runxi Cheng, Weike Jin, Enneng Yang, Li Shen, Lu Hou, Sinan Du, Chun Yuan, Xiaochun Cao, Dacheng Tao

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 OptMerge通过模型融合统一多模态大语言模型的能力与模态,提出基准和算法提升性能2.48%

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02390 2026-03-04 cs.CV eess.SP 83%

OpenMarcie: Dataset for Multimodal Action Recognition in Industrial Environments

OpenMarcie:工业环境中的多模态动作识别数据集

Hymalai Bello, Lala Ray, Joanna Sorysz, Sungho Suh, Paul Lukowicz

机构 * DFKI Kaiserslautern(DFKI凯撒斯劳滕) RPTU Kaiserslautern-Landau(RPTU凯撒斯劳滕-兰道) Korea University(韩国大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 OpenMarcie是首个大规模多模态数据集,用于工业环境中的动作识别,包含36名参与者在不同任务中的多模态数据,支持活动分类、开放词汇描述和跨模态对齐任务。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02655 2026-03-04 cs.CL cs.AI 81%

Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches

基于多模态大语言模型的实时游戏视频解说生成:暂停感知解码方法

Anum Afzal, Yuki Saito, Hiroya Takamura, Katsuhito Sudoh, Shinnosuke Takamichi, Graham Neubig, Florian Matthes, Tatsuya Ishigaki

机构 * School of CIT, Technical University of Munich(慕尼黑技术大学计算机信息学院) National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出两种基于提示的解码方法,利用多模态大语言模型实现实时游戏视频解说生成,通过动态间隔调整提升时间相关性与内容准确性。

Comments Accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02481 2026-03-04 cs.CV 79%

ModalPatch: A Plug-and-Play Module for Robust Multi-Modal 3D Object Detection under Modality Drop

ModalPatch: 一种插拔式模块,用于在模态缺失情况下鲁棒的多模态3D目标检测

Shuangzhi Li, Lei Ma, Xingyu Li

机构 * University of Alberta, Canada(阿尔伯塔大学) The University of Tokyo, Japan(东京大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 ModalPatch是一种插拔式模块,通过利用传感器数据的时间特性实现感知连续性,提升多模态3D目标检测在模态缺失情况下的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02569 2026-03-04 cs.HC 78%

An LLM-Assisted Toolkit for Inspectable Multimodal Emotion Data Annotation

一种辅助多模态情绪数据标注的工具包

Zheyuan Kuang, Weiwei Jiang, Nicholas Koemel, Matthew Ahmadi, Emmanuel Stamatakis, Benjamin Tag, Anusha Withana, Zhanna Sarsenbayeva

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种LLM辅助的多模态情绪数据标注工具包,通过可检查的工作流实现细粒度标注,提升跨模态一致性检查效率。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02546 2026-03-04 cs.CV 70%

On Discriminative vs. Generative classifiers: Rethinking MLLMs for Action Understanding

在判别与生成分类器之间:重新思考MLLMs用于动作理解

Zhanzhong Pang, Dibyadip Chatterjee, Fadime Sener, Angela Yao

机构 * National University of Singapore(国立新加坡大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出GAD分类器,通过生成辅助判别方法提升封闭集动作理解的准确性和效率,达到SOTA效果。

Comments 22 pages, 9 figures, 16 tables. Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18833 2026-03-04 cs.SD cs.CV eess.AS eess.IV 62%

PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation

PrismAudio:分解的思维链与多维奖励用于视频到音频生成

Huadai Liu, Kaicheng Luo, Wen Wang, Qian Chen, Peiwen Sun, Rongjie Huang, Xiangang Li, Jieping Ye, Wei Xue

机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学) Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团) The Chinese University of Hong Kong (CUHK)(香港中文大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 PrismAudio通过分解思维链与多维奖励,解决视频到音频生成中的目标纠缠问题,实现更高质量的生成效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02470 2026-03-04 cs.IT cs.LG cs.MM eess.IV math.IT 57%

Video TokenCom: Textual Intent-Guided Multi-Rate Video Token Communications with UEP-Based Adaptive Source-Channel Coding

视频令牌通信:基于UEP的自适应源信道编码的文本意图引导多速率视频令牌通信

Jingxuan Men, Mahdi Boloursaz Mashhadi, Ning Wang, Yi Ma, Mike Nilsson, Rahim Tafazolli

机构 * GIC & 6GIC, Institute for Communication Systems (ICS), University of Surrey(5GIC与6GIC,通信系统研究所(ICS),塞夫尔大学) Smart Internet Lab, University of Bristol(智能互联网实验室,布里斯托尔大学) British Telecom Research Lab, BT Group plc(英国电信研究实验室,BT集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

AI总结 本文提出基于UEP的自适应源信道编码的视频令牌通信框架,通过文本意图引导的多速率视频通信提升语义保真度和传输效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01412 2026-03-04 cs.CV 57%

UETrack: A Unified and Efficient Framework for Single Object Tracking

UETrack: 一种高效的单目标跟踪统一框架

Ben Kang, Jie Zhao, Xin Chen, Wanting Geng, Bin Zhang, Lu Zhang, Dong Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) City University of Hong Kong(香港城市大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 UETrack提出了一种高效的单目标跟踪框架,通过令牌池混合机制和目标感知蒸馏策略,实现多模态场景下的高效跟踪性能。

Comments This paper was accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏