arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4721 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4721 篇

2606.03173 2026-06-03 cs.CY cs.LG cs.SI 78%

Auditing Engagement Incentives in the Kidfluencer Ecosystem: A Multimodal Weak Supervision Approach

审计儿童网红生态系统中的参与激励:一种多模态弱监督方法

Zijing Wei, Chao Peter Yang, Xuanjie Chen

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本研究采用多模态弱监督方法审计YouTube儿童网红频道,发现剥削信号与观看量显著正相关,且表演性劳动、情感诱饵和隐私侵犯能带来参与度溢价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23037 2026-05-25 cs.LG physics.flu-dyn 78%

Open Multimodal Datasets and Open-Source Software for Data-Driven Modeling of Multiphase Transport and Thermal Systems

用于多相输运和热系统数据驱动建模的开放多模态数据集与开源软件

Christy Dunlap, Hari Pandey, Stephen Pierson, Daniel Curl, Braden Stevens, Mohammad Ishraq Hossain, Annapurna Parjuli, Chinmaya Joshi, Han Hu

机构 * Department of Mechanical Engineering, University of Arkansas(阿肯色大学机械工程系)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文介绍了一个由NED3实验室开发的开放多模态数据集和开源软件生态系统,提出了空间加时间维度(S+TD)分类框架,并重点描述了SeqReg序列回归库,以推动可复现的AI赋能热流体研究。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18710 2026-05-19 cs.DC 78%

Mosaic: Towards Efficient Training of Multimodal Models with Spatial Resource Multiplexing

Mosaic:迈向多模态模型高效训练的时空资源复用

Yanbo Wang, Yuxuan Wang, Chen Chen, Chunyu Xue, Yu Feng, Anbang Wu, Quan Chen, Yin Chen, Qizhen Weng

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出Apollo系统,通过时空复用方法提升多模态模型训练效率,采用灵活的执行引擎和性能模型生成高质量部署计划,实测训练速度提升达1.31倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17065 2026-05-19 cs.MA 78%

PyraVid: Hierarchical Multimodal Memory for Long-Horizon Video Reasoning

PyraVid: 用于长时间视频推理的分层多模态记忆

Sikuan Yan, Sicheng Dong, Haotong Wang, Ercong Nie, Yilun Liu, Jinhe Bi, Yingjie Xu, Susanna Schwarzmann, Riccardo Trivisonno, Volker Tresp, Yunpu Ma

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出PyraVid,一种分层多模态记忆框架,通过事件分割理论启发,解决长视频中多模态信息整合、人本信息对齐和证据聚合等挑战,提升长时间视频推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16120 2026-05-18 cs.IR 78%

MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos

MERVIN:一种用于越南新闻视频多模态事件检索的统一框架

Anh-Tai Pham-Nguyen, Tung-Duong Le-Duc, Anh-Duy Le, Trung-Hieu Truong-Le

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出MERVIN框架,整合关键帧、转录文本和视频摘要,通过Gemini 1.5 Flash提升转录质量,利用Perception Encoder提取视觉特征,并结合越南语言模型生成文本嵌入,实现高效的多模态事件检索。

Comments Accepted to SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13623 2026-05-14 cs.LG 78%

Multimodal Graph-based Classification of Esophageal Motility Disorders

基于多模态图的食管动力障碍分类

Alexander Geiger, Lars Wagner, Daniel Rueckert, Alois Knoll, Dirk Wilhelm, Alissa Jell

机构 * Technical University of Munich, School of Medicine and Health, TUM University Hospital Rechts der Isar(慕尼黑技术大学医学院与健康学院,TUM医院Rechts der Isar分院) Technical University of Munich, School of Computation, Information and Technology(慕尼黑技术大学计算、信息与技术学院)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出结合高分辨率阻抗测压仪数据与患者信息的多模态图分类方法,通过图神经网络学习生理意义的表示,提升食管动力障碍分类的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11675 2026-05-13 q-bio.QM q-bio.NC 78%

Accounting for Missed Events in the Bayesian Modeling of IP3R Multimodal Gating

在IP3R多模态门控的贝叶斯建模中考虑遗漏事件

Schayma Ben Marzougui, Audrey Denizot, Hugues Berry

专题命中 视频多模态 :multimodal(title);multi-modal(abstract)

AI总结 本文通过改进的贝叶斯方法分析IP3R门控行为,考虑遗漏事件对动力学模型的影响,揭示了多模态模型中Park和Drive模式的动力学差异及钙浓度对状态转换率的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04750 2026-05-12 cs.LG 78%

PA-RNet: Perturbation-Aware Residual Network for Robust Multimodal Time Series Forecasting

PA-RNet:一种针对鲁棒多模态时间序列预测的扰动感知残差网络

Enqiang Zhu, Zhenbin Deng, Shengzhi Wang, Yi-Kun Tang, Chanjuan Liu

机构 * Institute of Computing Technology, Guangzhou University(广州大学计算机技术学院) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 PA-RNet通过扰动感知机制优化多模态特征,提升时间序列预测的鲁棒性,实验表明其在不同领域均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26330 2026-04-30 eess.SP 78%

Optimizing Tracking Accuracy in Energy-Constrained Multimodal ISAC via Lyapunov-Driven Heterogeneous Mixture-of-Experts

通过Lyapunov驱动的异构专家混合方法优化能量受限多模ISAC的跟踪精度

Wenqi Fan, Ning Wei, Ahmad Bazzi, Rongyan Xi, Zhixian Song, You Li, Zhihan Zeng, Yue Xiu, Chadi Assi

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种物理感知的多模融合感知与通信框架,通过语义信息年龄理论连接网络层排队延迟与物理层空间不确定性,采用Lyapunov驱动的异构专家混合方法优化跟踪后验Cramer-Rao界与系统能量预算,提升跟踪精度和RF鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25942 2026-04-30 cs.LG 78%

A Multimodal and Explainable Machine Learning Approach to Diagnosing Multi-Class Ejection Fraction from Electrocardiograms

一种多模态且可解释的机器学习方法用于从心电图中诊断多类射血分数

Catherine Ning, Yu Ma, Cindy Beini Wang, Sean McMahon, Joseph Radojevic, Steven Zweibel, Dimitris Bertsimas

机构 * Operations Research Center, Massachusetts Institute of Technology(麻省理工学院运营研究中心) Wisconsin School of Business, University of Wisconsin–Madison(威斯康星大学麦迪逊分校商学院) Heart and Vascular Institute, Hartford Hospital(哈特福德医院心脏与血管研究院)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种结合工程化12导联ECG时间序列特征与结构化电子健康记录变量的多模态机器学习框架,用于四类临床射血分数分类,并通过SHAP属性分析提高模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15793 2026-04-24 cs.LG cs.SY eess.SY 78%

Anomaly Detection in Smart Power Grids with Graph-Regularized MS-SVDD: a Multimodal Subspace Learning Approach

基于图正则化的多模态子空间学习的智能电网异常检测

Thomas Debelle, Fahad Sohrab, Pekka Abrahamsson, Moncef Gabbouj

机构 * Faculty of Information Technology and Communication Sciences(信息科技与通讯科学学院) Tampere University(塔尔库大学) Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种结合图正则化的多模态子空间学习方法,用于智能电网异常检测,通过共享低维子空间提升鲁棒性,验证了图先验与多模态子空间学习结合的有效性。

Comments 23 pages, 5 figures, supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20119 2026-04-23 cs.HC 78%

Zeitgeist-Aware Multimodal (ZAM) Datasets of Pro-Eating Disorder Short-Form Videos: An Idea Worth Researching

具有时间意识的多模态(ZAM)数据集:关于促进进食障碍短视频的研究想法

Eden Shaveet, Zefan Sramek, Yumi Hamamoto, Jing Du, Scott Griffiths, Thalia Zhang, Thalia Viranda, William Hornby, Flora Salim, Koji Yatani, Tanzeem Choudhury

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出ZAM数据集,旨在解决现有方法在识别促进进食障碍内容时的局限性,通过动态更新的多模态数据支持实时研究和模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15560 2026-04-23 astro-ph.EP astro-ph.IM cs.LG 78%

ExoNet: Calibrated Multimodal Deep Learning for TESS Exoplanet Candidate Vetting using Phase-Folded Light Curves, Stellar Parameters, and Multi-Head Attention

ExoNet:基于相位折叠光变曲线、恒星参数和多头注意力的校准多模态深度学习用于TESS行星候选体验证

Md. Rashadul Islam

机构 * Daffodil International University(达芙果国际大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 ExoNet通过融合相位折叠光变曲线、恒星参数和多头注意力机制,提升TESS行星候选体验证的准确率,实现高置信度信号和适居带候选体的识别。

Comments v2: Complete revision. Corrected systematic TOI/TIC cross-identification errors present in v1. Rebuilt inference pipeline using verified NASA Exoplanet Archive catalog (4,720 PC-disposition candidates, up from 200). Updated all results, figures, and performance metrics. 8 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10060 2026-04-14 cs.PF 78%

Mosaic: Cross-Modal Clustering for Efficient Video Understanding

Mosaic:用于高效视频理解的跨模态聚类

Tuowei Wang, He Zhou, Chengru Song, Qiushi Li, Ju Ren

专题命中 视频多模态 :cross-modal(title,abstract)

AI总结 Mosaic是首个针对流式长视频理解的跨模态聚类驱动VLM推理系统,通过优化KVCache管理实现1.38倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08334 2026-04-10 stat.CO stat.AP 78%

mmid: Multi-Modal Integration and Downstream analyses for healthcare analytics in Python

mmid:用于医疗分析的多模态整合与下游分析的Python工具

Andrea Mario Vergani, Valeria Iapaolo, Emanuele Di Angelantonio, Marco Masseroli, Francesca Ieva

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 mmid是一个Python包,提供多模态融合、填补缺失数据、分类、时间到事件预测和聚类功能,用于结构化环境中整合顺序数据并进行下游分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06697 2026-04-09 eess.SP 78%

Heterogeneous Mixture-of-Experts for Energy-Efficient Multimodal ISAC in Highly Mobile Networks

异构专家混合模型用于高移动网络中高效多模态ISAC

Wenqi Fan, Ning Wei, Rongyan Xi, Ahmad Bazzi, Yue Xiu, Chadi Assi, Jing Dong, Jing Jin

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出异构混合专家架构,解决高移动网络中多模态传感与毫米波通信的能耗与可靠性平衡问题,通过强化学习实现高效事件触发传感策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06417 2026-04-09 stat.CO 78%

Niching Importance Sampling for Multi-modal Rare-event Simulation

多模态稀有事件模拟中的 niching 重要性抽样

Hugh J. Kinnear, F. A. DiazDelaO

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 本文提出 niching 重要性抽样框架,结合可靠性分析和进化多模态优化技术,提高故障概率估计的鲁棒性,有效应对可靠性问题的几何挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19010 2026-04-07 eess.SP cs.RO 78%

PalpAid: Multimodal Pneumatic Tactile Sensor for Tissue Palpation

PalpAid:多模态气压触觉传感器用于组织触诊

Devi Yuliarti, Ravi Prakash, Hiu Ching Cheung, Amy Strong, Patrick J. Codd, Shan Lin

机构 * Duke University(杜克大学) Arizona State University(亚利桑那州立大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 PalpAid通过气压和声音传感器恢复机器人手术中的触觉信息,能区分不同硬度的3D打印物体和离体组织。

Comments IEEE-RAS RoboSoft 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02248 2026-04-03 stat.ML cs.LG 78%

BVFLMSP : Bayesian Vertical Federated Learning for Multimodal Survival with Privacy

BVFLMSP:基于贝叶斯垂直联邦学习的多模态生存预测

Abhilash Kar, Basisth Saha, Tanmay Sen, Biswabrata Pradhan

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出BVFLMSP框架,通过贝叶斯神经网络处理多模态数据,实现隐私保护下的生存预测,提升预测可靠性并提供不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01659 2026-04-03 cs.RO 78%

AURA: Multimodal Shared Autonomy for Real-World Urban Navigation

AURA:多模态共享自主控制用于真实世界城市导航

Yukai Ma, Honglin He, Selina Song, Wayne Wu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学)

专题命中 视频多模态 :multimodal(title);multi-modal(abstract)

AI总结 AURA通过将城市导航分解为高层人类指令和低层AI控制,减少人工操作负担,提升导航稳定性,并在真实世界中实现44%的接管减少。

Comments 17 pages, 18 figures, 4 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11797 2026-04-02 cs.HC cs.ET 78%

MURMR: A Multimodal Sensing Framework for Automated Group Behavior Analysis in Mixed Reality

MURMR:一种用于混合现实环境中自动化群体行为分析的多模态传感框架

Diana Romero, Yasra Chandio, Fatima Anwar, Salma Elmalaki

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出MURMR框架,通过头显原生数据自动分析团队协作动态,无需外部设备或人工标注,揭示了会话内结构分析和时间模块在捕捉群体行为中的互补作用。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29903 2026-04-01 q-bio.NC eess.SP 78%

Multimodal Higher-Order Brain Networks: A Topological Signal Processing Perspective

多模态高阶脑网络:拓扑信号处理视角

Breno C. Bispo, Stefania Sardellitti, Juliano B. Lima, Fernando A. N. Santos

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出基于拓扑信号处理的多模态框架,通过高阶拓扑域建模脑部,利用扩散MRI和静息态fMRI学习个体化脑细胞复合体,揭示高阶相互作用的拓扑特征及其与行为的关联。

Comments This paper has been sumbmitted to IEEE Transactions on Medical Imaging (TMI), March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29624 2026-04-01 cs.SE 78%

EcoScratch: Cost-Effective Multimodal Repair for Scratch Using Execution Feedback

EcoScratch: 低成本多模态修复用于刮痕使用执行反馈

Yuan Si, Ming Wang, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 EcoScratch通过轻量级运行时信号决定是否保持纯文本修复或升级到多模态提示,结合JSON补丁预算和验证努力,提升Scratch修复效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24975 2026-03-31 cs.IR 78%

Unbiased Multimodal Reranking for Long-Tail Short-Video Search

长尾短视频搜索的无偏多模态重排序

Wenyi Xu, Feiran Zhu, Songyang Li, Renzhe Zhou, Chao Zhang, Chenglei Dai, Yuren Mao, Yunjun Gao, Yi Zhang

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出基于LLM的多模态重排序框架,通过多阶段训练提升长尾查询内容质量,实验显示在AUC、NDCG@K和用户偏好判断等指标上优于基线方法,线上A/B测试验证了其在用户体验和消费指标上的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13315 2026-03-27 cs.RO 78%

Bi-HIL: Bilateral Control-Based Multimodal Hierarchical Imitation Learning via Subtask-Level Progress Rate and Keyframe Memory for Long-Horizon Contact-Rich Robotic Manipulation

双侧控制基于多模态分层模仿学习的长时程接触丰富机械臂操作

Thanpimon Buamanee, Masato Kobayashi, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Kobe University(神户大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出Bi-HIL框架,通过子任务级进度率和关键帧记忆实现长时程接触丰富机械臂操作的稳定分层协调,验证了显式建模子任务进展与力感知控制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22371 2026-03-25 eess.IV 78%

Multimodal Fusion of Skeleton Dynamics and Clinical Gait Features for Video-Based Cerebral Palsy Severity Assessment

基于骨骼动力学和临床步态特征的多模态融合用于视频基于的脑瘫严重程度评估

Kaiyuan Yang, Xupeng Chen, Jiangpeng He

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种多模态融合框架,结合骨骼动力学和临床有意义的步态特征,提升视频脑瘫严重程度评估的预测性能和生物力学可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17611 2026-03-24 nucl-th astro-ph.SR cond-mat.supr-con nucl-ex quant-ph 78%

Evidence for Multimodal Superfluidity of Neutrons

中子的多模超流性证据

Yuan-Zhuo Ma, Georgios Palkanoglou, Joseph Carlson, Stefano Gandolfi, Alexandros Gezerlis, Gabriel Given, Ashe Hicks, Dean Lee, Kevin E. Schmidt, Jiabin Yu

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 研究通过理论和实验证据揭示了中子富集系统中一种新物相——多模超流性,探讨其在不同维度模型中的表现及对中子星结构的影响。

Comments 61 pages, 37 figures; Minor revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11403 2026-03-20 quant-ph physics.optics 78%

Bidimensional measurements of photon statistics within a multimodal temporal framework

双维光子统计的多模时域测量

C. Hainaut, K. Ouahrouche, A. Rancon, G. Patera, C. Ouarkoub, M. Le Parquier, P. Suret, A. Amo

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种双维光子统计测量方法,利用DFG在非线性BBO晶体中实现高时间分辨率的单次成像,区分相干与热光子统计,并通过时间模式分解框架解释测量偏差原因。

Journal ref Phys. Rev. Research 8, 013286 (16 March, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26642 2026-03-20 cs.RO 78%

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测

Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid)) The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出MLA模型,通过多感官融合与未来目标预测,提升机器人在复杂接触任务中的操控能力,实验显示其在2D和3D任务中性能优于现有方法。

Comments Project page: https://robotic-mla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16685 2026-03-12 cs.LG cs.DC 78%

Communication-Efficient Multimodal Federated Learning: Joint Modality and Client Selection

高效多模态联邦学习:联合模态与客户端选择

Liangqi Yuan, Dong-Jun Han, Su Wang, Devesh Upadhyay, Christopher G. Brinton

机构 * School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) Department of Computer Science and Engineering, Yonsei University(延世大学计算机科学与工程系) School of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程学院) Saab Inc.(Saab公司)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出MFedMC框架,通过解耦架构和联合选择算法,实现高效多模态联邦学习,减少通信开销并提升模型泛化能力。

Comments arXiv admin note: text overlap with arXiv:2310.07048

详情

展开后加载摘要…

URL PDF HTML 收藏