arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-19 至 2026-03-19 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 9 篇

2603.11971 2026-03-19 cs.CV cs.AI 84%

Multimodal Emotion Recognition via Bi-directional Cross-Attention and Temporal Modeling

通过双向交叉注意力和时间建模的多模态情感识别

Junhyeong Byeon, Jeongyeol Kim, Sejoon Lim

机构 * Kookmin University(韩国釜山大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态情感识别框架,结合时间建模、音频学习和跨模态融合,提升野外视频中情绪识别的鲁棒性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16939 2026-03-19 cs.CV 83%

Solution for 10th Competition on Ambivalence/Hesitancy (AH) Video Recognition Challenge using Divergence-Based Multimodal Fusion

第十届Ambivalence/Hesitancy(AH)视频识别挑战赛中基于分歧的多模态融合解决方案

Aislan Gabriel O. Souza, Agostinho Freire, Leandro Honorato Silva, Igor Lucas B. da Silva, João Vinícius R. de Andrade, Gabriel C. de Albuquerque, Lucas Matheus da S. Oliveira, Mário Stela Guerra, Luciana Machado

机构 * Universidade de Pernambuco(巴伊亚大学) Escola Politécnica de Pernambuco(巴伊亚理工学院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于分歧的多模态融合方法,通过测量视觉、音频和文本通道间的跨模态冲突,提升AH识别性能,在BAH数据集上达到0.6808的宏F1分数,优于基准线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17541 2026-03-19 cs.CV 79%

Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models

时间收益,空间代价:重新审视多模态大语言模型中的视频微调

Linghao Zhang, Jungang Li, Yonghua Hei, Sicheng Tao, Song Dai, Yibo Yan, Zihao Dongfang, Weiting Liu, Chenxi Qin, Hanqian Li, Xin Zou, Jiahao Zhang, Shuhang Xun, Haiyun Jiang, Xuming Hu

机构 * SJTU(上海交通大学) HKUST(GZ)(香港科技大学(珠海)) HKUST(香港科技大学) CityU(城市大学) FDU(复旦大学) HIT(哈尔滨工业大学) TJU(天津大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究了视频微调对多模态大语言模型视觉能力的影响,发现视频性能提升的同时,静态图像表现可能受限,提出混合帧策略以缓解空间与时间理解的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17948 2026-03-19 cs.CV cs.AI 62%

VideoAtlas: Navigating Long-Form Video in Logarithmic Compute

VideoAtlas: 在对数计算中导航长视频

Mohamed Eltahir, Ali Habibullah, Yazan Alshoibi, Lama Ayash, Tanveer Hussain, Naeemullah Khan

机构 * King Abdullah University of Science and Technology (KAUST)(卡斯特大学) Department of Computer Science, King Khalid University (KKU)(国王 Khalid 大学计算机科学系) Department of Computer Science, Edge Hill University(Edge Hill 大学计算机科学系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VideoAtlas通过层次化网格结构实现长视频的无损表示,解决视频表示和长上下文问题,提出Video-RLM架构,展示对数计算增长、环境预算和自适应计算分配等贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17307 2026-03-19 cs.CV cs.AI 62%

Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding

Symphony:一种受认知启发的多智能体系统用于长视频理解

Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Kuaishou Technology(快手科技) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Symphony多智能体系统,通过模拟人类认知模式,提升长视频理解任务的推理能力,实验显示在多个基准测试中表现优异。

Comments Accepted by cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17930 2026-03-19 cs.CV 57%

Interpretable Traffic Responsibility from Dashcam Video via Legal Multi Agent Reasoning

基于法律多智能体推理的可解释交通责任分析

Jingchun Yang, Jinchang Zhang

机构 * Northeast University(东北大学) SUNY Binghamton University(纽约州立大学布法罗分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出C-TRAIL多模态数据集,结合视频与文本描述,通过两阶段框架实现交通责任判定,优于现有方法并提供透明法律推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14827 2026-03-19 cs.CV 57%

SemanticFace: Semantic Facial Action Estimation via Semantic Distillation in Interpretable Space

SemanticFace: 通过可解释空间中的语义蒸馏进行语义面部动作估计

Zejian Kang, Kai Zheng, Yuanchen Fei, Wentao Yang, Hongyuan Zou, Xiangru Huang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Hunan University(湖南大学) The University of Hong Kong(香港大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SemanticFace通过语义蒸馏在可解释空间中估计面部动作,提升系数精度和可解释性,实现跨身份泛化和抗域移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18886 2026-03-19 cs.CV 57%

MagicWorld: Towards Long-Horizon Stability for Interactive Video World Exploration

MagicWorld: 向交互视频世界探索的长时稳定迈进

Guangyuan Li, Bo Li, Jinwei Chen, Xiaobin Hu, Lei Zhao, Peng-Tao Jiang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo蓝影实验室,vivo移动通信有限公司) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MagicWorld模型,通过引入流引导运动保留约束和增强交互训练策略,解决复杂环境中运动漂移和长时交互误差累积问题,并构建RealWM120K数据集验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17653 2026-03-19 cs.RO 50%

REAL: Robust Extreme Agility via Spatio-Temporal Policy Learning and Physics-Guided Filtering

REAL:通过时空策略学习和物理引导过滤实现鲁棒极端敏捷

Jialong Liu, Dehan Shen, Yanbo Wen, Zeyu Jiang, Changhao Chen

机构 * PEAK-Lab, The Hong Kong University of Science and Technology (Guangzhou)(高峰实验室,香港科学与技术大学(广州))

专题命中 视频多模态 :cross-modal(abstract)

AI总结 REAL通过结合时空策略学习和物理引导过滤,提升在动态环境下极端敏捷的鲁棒性,能够在视觉干扰下实现可靠攀爬。

详情

展开后加载摘要…

URL PDF HTML 收藏