arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-11 至 2026-05-11 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 15 篇

2605.07642 2026-05-11 cs.CV 86%

EggHand: A Multimodal Foundation Model for Egocentric Hand Pose Forecasting

EggHand:一种用于第一人称手姿态预测的多模态基础模型

Jaeyoung Choi, Hyeondong Kim, Yujin Kim, Daehee Park

机构 * DGIST, Republic of Korea(韩国忠南科学技术院)

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.CV

AI总结 本文提出EggHand模型,通过结合视觉-语言-动作模型的动作解码器和第一人称视频-文本编码器,实现对第一人称视频中手姿态序列的预测,提升了在剧烈视角变化下的鲁棒性和可控性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16579 2026-05-11 cs.LG cs.AI 83%

EviDep: Trustworthy Multimodal Depression Estimation via Disentangled Evidential Learning

EviDep:通过解耦证据学习实现可信的多模态抑郁估计

Fangyuan Liu, Sirui Zhao, Zeyu Zhang, Jinyang Huang, Feng-Qi Cui, Bin Luo, Meng Li, Tong Xu, Enhong Chen

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Department of Psychiatry, The First Affiliated Hospital of University of Science and Technology of China, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学附属第一医院精神科,生命科学与医学学院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出EviDep框架,通过解耦证据学习量化抑郁严重程度及不确定性,提升多模态抑郁估计的可信度和不确定性校准能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07151 2026-05-11 cs.CV cs.AI 81%

DPG-CD: Depth-Prior-Guided Cross-Modal Joint 2D-3D Change Detection

DPG-CD: 基于深度先验的跨模态联合2D-3D变化检测

Luqi Zhang, Zhen Dong, Bisheng Yang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出DPG-CD框架,通过引入深度先验和多阶段跨时序跨模态融合,有效解决影像与DSM间模态差异导致的3D变化检测难题,提升2D语义和3D高度变化检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08084 2026-05-11 cs.RO cs.CV 79%

123D: Unifying Multi-Modal Autonomous Driving Data at Scale

123D:规模化统一多模态自动驾驶数据

Daniel Dauner, Valentin Charraut, Bastian Berle, Tianyu Li, Long Nguyen, Jiabao Wang, Changhui Jing, Maximilian Igl, Holger Caesar, Boris Ivanovic, Yiyi Liao, Andreas Geiger, Kashyap Chitta

机构 * KE:SAI University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) NVIDIA Research(NVIDIA研究) Valeo Brain(法雷奥大脑) OpenDriveLab at Shanghai Innovation Institute(上海创新研究院自动驾驶实验室) Zhejiang University(浙江大学) Delft University of Technology(代尔夫特理工大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 123D通过单一API统一多模态自动驾驶数据,解决数据碎片化、同步难题,并提供分析工具,支持跨数据集3D目标检测和强化学习规划应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07232 2026-05-11 cs.CV 79%

Towards multi-modal forgery representation learning for AI-generated video detection and localization

迈向多模态伪造表示学习的AI生成视频检测与定位

Dat Le, Khoa Nguyen, Xin Wang, Shu Hu

机构 * Purdue University(普渡大学) University at Albany, SUNY(纽约州立大学阿尔巴尼分校)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态融合框架,结合语义、时空视觉与多尺度音频分支,实现AI生成视频的检测与细粒度时间定位,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07859 2026-05-11 cs.CV 70%

EyeCue: Driver Cognitive Distraction Detection via Gaze-Empowered Egocentric Video Understanding

EyeCue:通过眼动增强的视点视频理解进行驾驶员认知分心检测

Lang Zhang, JinYi Yoon, Matthew Corbett, Abhijit Sarkar, Bo Ji

机构 * Virginia Tech(弗吉尼亚理工大学) Inha University(inha大学) Army Cyber Institute at West Point(西点军营陆军网络学院)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出EyeCue框架,通过眼动与视觉上下文的交互建模,实现驾驶员认知分心检测,利用CogDrive数据集验证其在多种驾驶场景下的高准确率和泛化能力。

Comments Accepted to the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07334 2026-05-11 cs.CV 70%

RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation

RCoT-Seg:强化链式推理用于视频推理与分割

Junwei Wen, Deshui Miao, Guangming Lu, Xin Li, Wenjie Pei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Pazhou Lab (Huangpu)(琶洲实验室(黄埔))

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出RCoT-Seg框架,通过分离时间推理与空间感知,改进视频分割中关键帧选择与定位,提升多目标场景下的鲁棒性与精度。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08073 2026-05-11 cs.CV cs.AI 62%

EmambaIR: Efficient Visual State Space Model for Event-guided Image Reconstruction

EmambaIR:用于事件引导图像重建的高效视觉状态空间模型

Wei Yu, Yunhang Qian

机构 * Harbin Institute of Technology(哈尔滨理工大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EmambaIR,一种高效的视觉状态空间模型,通过跨模态Top-k稀疏注意力模块和门控状态空间模块,提升事件流图像重建的效率与性能,实现更高效的全局上下文捕捉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07872 2026-05-11 cs.CV cs.AI 62%

Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models

视频理解奖励建模:一个稳健的基准和高效的奖励模型

Yuancheng Wei, Linli Yao, Lei Li, Haojie Zhang, Hao Zhou, Fandong Meng, Xu Sun

机构 * South China University of Technology(华南理工大学) Peking University(北京大学) The University of Hong Kong(香港大学) Tencent(腾讯)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Video Understanding Reward Bench基准和VideoDRM/VideoGRM模型,通过大规模高质量数据提升视频理解奖励建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05848 2026-05-11 cs.CV cs.AI 62%

VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding

VideoRouter: 为高效长视频理解的查询适应双路由

Kuanwei Lin, Wenhao Zhang, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VideoRouter通过双路由框架实现高效长视频理解,通过语义路由和图像路由动态分配证据,减少冗余token,提升压缩效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07299 2026-05-11 cs.CV cs.AI 62%

EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams

EgoPro-Bench:基于眼动视频流的个性化主动交互基准测试

Dongchuan Ran, Linyu Ou, Xueheng Li, Wenwen Tong, Chenxu Guo, Hewei Guo, Kaibing Wang, Lewei Lu

机构 * Beijing Institute of Technology(北京理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EgoPro-Bench,通过模拟用户画像生成多样化意图,构建高保真人机交互数据,评估主动交互能力,提升多模态大语言模型的意图理解与交互时机识别能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06924 2026-05-11 cs.CV cs.AI 62%

A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency

A$^2$RD:基于代理的自回归扩散用于长视频一致性

Do Xuan Long, Yale Song, Min-Yen Kan, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 A$^2$RD通过Retrieve-Synthesize-Refine-Update循环实现长视频一致性合成,提升视频生成的连贯性和叙事一致性。

Comments Project page: http://dxlong2000.github.io/AARD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08003 2026-05-11 cs.CV 57%

SphereVAD: Training-Free Video Anomaly Detection via Geodesic Inference on the Unit Hypersphere

SphereVAD: 基于单位超球面几何推断的无训练视频异常检测

Chao Huang, Penfei Wei, Wei Wang, Jie Wen, Zhihua Wang, Li Shen, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SphereVAD通过几何推断在单位超球面上实现无训练视频异常检测,利用预训练多模态大语言模型的中间层特征,通过Frechet均值中心化、Holistic Scene Attention和vMF引导的球面几何拉近技术,实现零样本异常识别。

Comments 48 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15840 2026-05-11 cs.RO cs.CV 57%

Large Video Planner Enables Generalizable Robot Control

大视频规划器实现通用机器人控制

Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Pieter Abbeel, Russ Tedrake, Vincent Sitzmann, Yilun Du

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) Harvard(哈佛大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出利用大规模视频预训练构建通用机器人基础模型,通过生成视频计划实现跨任务和环境的泛化控制,并在真实机器人上验证了其可行性。

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02371 2026-05-11 cs.CR cs.AI cs.DC 57%

Federated Spatiotemporal Graph Learning for Passive Attack Detection in Smart Grids

联邦时空图学习用于智能电网中的被动攻击检测

Bochra Al Agha, Razane Tajeddine

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种基于图的多模态检测器,通过融合物理层和行为指标检测智能电网中的被动攻击,采用联邦学习框架提升鲁棒性,实现高准确率和低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏