arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-20 至 2026-04-20 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 8 篇

2604.16172 2026-04-20 cs.MM 83%

MOMENTA: Mixture-of-Experts Over Multimodal Embeddings with Neural Temporal Aggregation for Misinformation Detection

MOMENTA: 多模态嵌入的专家混合模型结合神经时间聚合用于虚假信息检测

Yeganeh Abdollahinejad, Ahmad Mousavi, Naeemul Hassan, Kai Shu, Nathalie Japkowicz, Shahriar Khosravi, Amir Karami

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 MOMENTA通过融合多模态嵌入、神经时间聚合和领域对抗学习,有效捕捉多模态不一致性和时间动态,提升虚假信息检测的鲁棒性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15377 2026-04-20 cs.LG cs.CV cs.MM 81%

M3R: Localized Rainfall Nowcasting with Meteorology-Informed MultiModal Attention

M3R:基于气象信息的多模态注意力的局部降雨现在预测

Sanjeev Panta, Rhett M Morvant, Xu Yuan, Li Chen, Nian-Feng Tzeng

机构 * University of Louisiana at Lafayette, Lafayette, LA, USA(路易斯安那州立大学拉斐特分校) University of Delaware, Newark, DE, USA(德克萨斯大学达勒姆分校)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 M3R结合NEXRAD雷达图像与气象站数据,通过多模态注意力机制提升降雨预测精度与效率,实现更准确的降雨现在预测。

Comments Accepted at IEEE International Conference on Multimedia and Expo (ICME) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15127 2026-04-20 cs.MM 79%

MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video Production

MCSC-Bench:多模态情境到脚本创建用于真实视频制作

Huanran Hu, Zihui Ren, Dingyi Yang, Liangyu Chen, Qixiang Gao, Tiezheng Ge, Qin Jin

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出MCSC任务,通过多模态输入和用户指令生成结构化视频脚本,并引入首个大规模MCSC数据集MCSC-Bench,包含11K+标注视频,支持全面评估材料选择、叙事规划和条件脚本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08480 2026-04-20 cs.CV 70%

Video-STAR: Reinforcing Open-Vocabulary Action Recognition with Tools

Video-STAR: 通过工具强化开放词汇动作识别

Zhenlong Yuan, Xiangyan Qu, Chengxuan Qian, Rui Chen, Jing Tang, Lei Sun, Xiangxiang Chu, Dapeng Zhang, Yiwei Wang, Yujun Cai, Shuo Li

机构 * AMAP, Alibaba Group(阿里集团AMAP) University of California at Merced(加州大学默塞德分校) University of Queensland(昆士兰大学) Case Western Reserve University(凯斯西储大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Video-STAR通过结合上下文子动作分解与工具增强强化学习,提升开放词汇动作识别的细粒度匹配与跨模态推理能力,有效减少跨模态幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15736 2026-04-20 cs.CV cs.CL 62%

RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees

RefereeBench: 视频多模态大语言模型是否准备好成为多项目裁判

Yichen Xu, Yuanhang Liu, Chuhan Wang, Zihan Zhao, jinghan luo, Jianzhe Ma, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Sichuan University(四川大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出RefereeBench,首个评估多模态大语言模型作为自动体育裁判的基准,通过11项运动925个视频和6475对问答,评估犯规存在、分类、推理、实体感知和时间定位能力,发现当前模型在规则应用和时间定位上表现不足。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13091 2026-04-20 cs.CV 57%

Reasoning over Video: Evaluating How MLLMs Extract, Integrate, and Reconstruct Spatiotemporal Evidence

视频推理:评估大语言模型如何提取、整合和重构时空证据

Seunghwan Bang, Hwanjun Song

机构 * UNIST(全南大学) KAIST(韩国科学技术院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文评估大语言模型在视频中的时空推理能力,提出VAEX-BENCH基准,通过合成数据测试抽象推理任务,揭示模型在抽象任务中的局限性。

Comments Project page: https://disl-lab.github.io/VAEX-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20025 2026-04-20 cs.CV 57%

A Contextual Analysis of Driver-Facing and Dual-View Video Inputs for Distraction Detection in Naturalistic Driving Environments

面向驾驶员和双视角视频输入在自然驾驶环境中的干扰检测情境分析

Anthony Dontoh, Stephanie Ivey, Armstrong Aboah

机构 * Environmental Engineering The University of Memphis Memphis, TN, USA Email(环境工程 明尼苏达大学 内华达州法戈 邮箱) Environmental Engineering North Dakota State University Fargo, ND, USA Email(环境工程 内华达州立大学 内华达州法戈 邮箱)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了在自然驾驶环境中,结合道路面向和驾驶员面向视频输入对干扰检测准确性的影响,通过对比三种时空动作识别模型,发现多视角融合需依赖特定架构设计以避免干扰。

Journal ref 2025 IEEE International Conference on Future Machine Learning and Data Science (FMLDS), 02-05 Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01944 2026-04-20 cs.RO cs.CV 57%

AutoDrive-R$^2$: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving

AutoDrive-R$^2$: 促进自动驾驶VLA模型的推理与自反思能力

Zhenlong Yuan, Chengxuan Qian, Jing Tang, Rui Chen, Zijian Song, Lei Sun, Xiangxiang Chu, Yujun Cai, Dapeng Zhang, Shuo Li

机构 * AMAP, Alibaba Group(阿里集团AMAP) Sun Yat-sen University(中山大学) University of Queensland(昆士兰大学) Lanzhou University(兰州大学) Case Western Reserve University(凯斯西储大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AutoDrive-R$^2$框架,通过链式推理和强化学习提升自动驾驶VLA系统的推理与自反思能力,使用nuScenesR$^2$-6K数据集和GRPO算法实现高鲁棒性轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏