arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-30 至 2026-04-30 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 8 篇

2604.26379 2026-04-30 cs.CV 79%

A Multimodal Pre-trained Network for Integrated EEG-Video Seizure Detection

一种用于整合EEG-视频癫痫发作检测的多模态预训练网络

Tong Lu, Ke Xu, Zimo Zhang, Zitong Zhao, Danwei Weng, Ruiyu Wang, Miao Liu, Zizuo Zhang, Jingyi Yao, Yixuan Zhao, Wenchao Zhang, Min Wang, Guoming Luan, Minmin Luo, Zhifeng Yue

机构 * organization= Beijing Institute for Brain Research, Chinese Academy of Medical Sciences \& Peking Union Medical College , city= Beijing , postcode= 102206 , country= China organization= Chinese Institute for Brain Research, Beijing , city= Beijing , postcode= 102206 , country= China organization= Department of Neurosurgery, SanBo Brain Hospital, Capital Medical University , city= Beijing , postcode= 100018 , country= China organization= GenAns Biotechnology Co., Ltd , city= Beijing , postcode= 102206 , country= China organization= Laboratory for Clinical Medicine, Capital Medical University , city= Beijing , postcode= 100069 , country= China organization= Center of Epilepsy, Beijing Institute for Brain Disorders, Sanbo Brain Hospital, Capital Medical University , city= Beijing , postcode= 100018 , country= China organization= Beijing Key Laboratory of Brain Science

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出EEGVFusion框架,结合自监督EEG学习、时空视频编码、最优传输对齐和双向交叉注意力,整合神经和行为证据,实现高准确率的癫痫发作检测,同时降低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26247 2026-04-30 cs.IR cs.AI 79%

TimeMM: Time-as-Operator Spectral Filtering for Dynamic Multimodal Recommendation

TimeMM: 时域作为算子的动态多模态推荐谱过滤

Wei Yang, Rui Zhong, Zihan Lin, Xiaodan Wang, Cheng Chen, Huan Ren, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 TimeMM通过时域算子谱过滤框架,解决动态多模态推荐中用户兴趣非平稳性问题,引入自适应谱过滤和模态感知路由,提升推荐性能与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18662 2026-04-30 cs.RO cs.AI 79%

M2R2: MultiModal Robotic Representation for Temporal Action Segmentation

M2R2:多模态机器人表示用于时序动作分割

Daniel Sliwowski, Dongheui Lee

机构 * Autonomous Systems Lab, Technische Universität Wien (TU Wien)(自主系统实验室,维也纳技术大学) Institute of Robotics and Mechatronics, German Aerospace Center (DLR)(机器人与机电研究所,德国航空航天中心)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出M2R2多模态特征提取器,结合本体感知和体外感知信息,解决时序动作分割中多模态特征复用难题,并在三个机器人数据集上取得新突破。

Comments 8 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26330 2026-04-30 eess.SP 78%

Optimizing Tracking Accuracy in Energy-Constrained Multimodal ISAC via Lyapunov-Driven Heterogeneous Mixture-of-Experts

通过Lyapunov驱动的异构专家混合方法优化能量受限多模ISAC的跟踪精度

Wenqi Fan, Ning Wei, Ahmad Bazzi, Rongyan Xi, Zhixian Song, You Li, Zhihan Zeng, Yue Xiu, Chadi Assi

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种物理感知的多模融合感知与通信框架,通过语义信息年龄理论连接网络层排队延迟与物理层空间不确定性,采用Lyapunov驱动的异构专家混合方法优化跟踪后验Cramer-Rao界与系统能量预算,提升跟踪精度和RF鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25942 2026-04-30 cs.LG 78%

A Multimodal and Explainable Machine Learning Approach to Diagnosing Multi-Class Ejection Fraction from Electrocardiograms

一种多模态且可解释的机器学习方法用于从心电图中诊断多类射血分数

Catherine Ning, Yu Ma, Cindy Beini Wang, Sean McMahon, Joseph Radojevic, Steven Zweibel, Dimitris Bertsimas

机构 * Operations Research Center, Massachusetts Institute of Technology(麻省理工学院运营研究中心) Wisconsin School of Business, University of Wisconsin–Madison(威斯康星大学麦迪逊分校商学院) Heart and Vascular Institute, Hartford Hospital(哈特福德医院心脏与血管研究院)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种结合工程化12导联ECG时间序列特征与结构化电子健康记录变量的多模态机器学习框架,用于四类临床射血分数分类,并通过SHAP属性分析提高模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26565 2026-04-30 cs.CV 70%

DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation

DenseStep2M: 一种可扩展且无需训练的密集指令视频标注流水线

Mingji Ge, Qirui Chen, Zeqian Li, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出无需训练的DenseStep2M流水线,通过分割视频、过滤对齐不佳内容并利用先进多模态模型生成高质量步骤注释,构建了包含10万视频和200万步骤的大型数据集,支持长期视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06287 2026-04-30 cs.CV 57%

Perception Test 2025: Challenge Summary and a Unified VQA Extension

2025感知测试挑战:挑战总结及统一视觉问答扩展

Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学) University of Bristol(布里斯托大学) University of Oxford(牛津大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 2025年感知测试挑战旨在评估最新视频模型并衡量多模态感知的进步,通过统一任务测试揭示现有模型在统一接口下处理多样化感知任务的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26218 2026-04-30 cs.CV 57%

ViBE: Visual-to-M/EEG Brain Encoding via Spatio-Temporal VAE and Distribution-Aligned Projection

ViBE:通过时空VAE和分布对齐投影实现视觉到M/EEG脑编码

Ganxi Xu, Zhao-Rong Lai, Yuting Tang, Yonghao Song, Shuyan Zhou, Guoxu Zhou, Boyu Wang, Jian Zhu, Jinyi Long

机构 * Jinan University(济南大学) The First Affiliated Hospital of Jinan University(济南大学第一附属医院) Western University(西方大学) Guangdong University of Technology(广东工业大学) Tsinghua University(清华大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出ViBE框架,通过时空卷积变分自编码器和分布对齐投影,实现从视觉刺激生成高质量M/EEG信号,解决跨模态对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏