arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-11 至 2026-03-11 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 6 篇

2508.10729 2026-03-11 cs.CV cs.AI 81%

EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering

EgoCross:多模态大语言模型跨领域眼动视频问答基准测试

Yanjun Li, Yuqian Fu, Tianwen Qian, Qi'ao Xu, Silong Dai, Danda Pani Paudel, Luc Van Gool, Xiaoling Wang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 EgoCross提出一个跨领域眼动视频问答基准,评估多模态大语言模型在不同领域中的泛化能力,揭示现有模型在非日常领域任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09287 2026-03-11 cs.CV 79%

Exploring Modality-Aware Fusion and Decoupled Temporal Propagation for Multi-Modal Object Tracking

探索多模态感知融合与解耦时间传播用于多模态目标跟踪

Shilei Wang, Pujian Lai, Dong Gao, Jifeng Ning, Gong Cheng

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 MDTrack通过模态感知融合和解耦时间传播提升多模态目标跟踪性能,实现统一的模态处理和独立的时间信息捕捉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08927 2026-03-11 cs.CV cs.MM 62%

MEGC2026: Micro-Expression Grand Challenge on Visual Question Answering

MEGC2026:面向视觉问答的微表情大奖挑战

Xinqi Fan, Jingting Li, John See, Moi Hoon Yap, Su-Jing Wang, Adrian K. Davison

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特 Metropolitan 大学计算与数学系) State Key Laboratory of Cognitive Science and Mental Health, Institute of Psychology, CAS & Department of Psychology, University of the Chinese Academy of Sciences(中国科学院心理研究所认知科学与心理健康国家重点实验室及中国科学院大学心理学系) School of Mathematical and Computer Sciences, Heriot-Watt University Malaysia(赫瑞-沃森大学马来西亚分校数学与计算机科学学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 MEGC2026通过视觉问答任务探索微表情识别,利用多模态大语言模型和大视觉-语言模型提升微表情分析能力。

Comments MEGC 2026 at IEEE FG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07071 2026-03-11 cs.CV 57%

VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding

VirtueBench: 在长视频理解中评估在不确定性下的可信度

Xueqing Yu, Bohan Li, Yan Li, Zhenheng Yang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 VirtueBench通过评估模型在不确定性下的可信度,揭示了长视频理解中模型拒绝行为的差异及可靠性问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09482 2026-03-11 cs.RO 50%

StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving

StyleVLA: 驾驶风格感知的视觉语言动作模型用于自动驾驶

Yuan Gao, Dengyuan Hua, Mattia Piccinini, Finn Rasmus Schäfer, Korbinian Moller, Lin Li, Johannes Betz

专题命中 视频多模态 :multimodal(abstract)

AI总结 StyleVLA通过引入物理约束和混合损失,生成多样且物理合理的驾驶行为,优于现有专有和先进模型。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09070 2026-03-11 cs.RO 50%

3D UAV Trajectory Estimation and Classification from Internet Videos via Language Model

通过语言模型从互联网视频中估计和分类3D无人机轨迹

Haoxiang Lei, Daotong Wang, Shenghai Yuan, Jianbo Su

专题命中 视频多模态 :cross-modal(abstract)

AI总结 本文提出通过语言模型从互联网视频中估计和分类无人机3D轨迹,无需人工标注,实现了高效的数据采集与轨迹推断。

详情

展开后加载摘要…

URL PDF HTML 收藏