arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4703 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4703 篇

2108.12868 2021-08-31 cs.CV 83%

A Multimodal Framework for Video Ads Understanding

Zejia Weng, Lingchen Meng, Rui Wang, Zuxuan Wu, Yu-Gang Jiang

专题命中 视频多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

Comments 4 pages; 2 figures; ACM MM 2021 workshop; Tencent Advertising Algorithm Competition ACM Multimedia 2021 Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.11974 2021-08-30 cs.CV 83%

Learning Cross-modal Contrastive Features for Video Domain Adaptation

Donghyun Kim, Yi-Hsuan Tsai, Bingbing Zhuang, Xiang Yu, Stan Sclaroff, Kate Saenko, Manmohan Chandraker

专题命中 视频多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

Comments Accepted in ICCV'21

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.12465 2021-04-27 cs.CV cs.AI cs.CL cs.MM 83%

GPT2MVS: Generative Pre-trained Transformer-2 for Multi-modal Video Summarization

Jia-Hong Huang, Luka Murn, Marta Mrak, Marcel Worring

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments This paper is accepted by ACM International Conference on Multimedia Retrieval (ICMR), 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.12667 2020-10-27 cs.CV 83%

Self-Supervised Learning by Cross-Modal Audio-Video Clustering

Humam Alwassel, Dhruv Mahajan, Bruno Korbar, Lorenzo Torresani, Bernard Ghanem, Du Tran

专题命中 视频多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2020 (spotlight presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.10639 2020-07-22 cs.CV 83%

Multi-modal Transformer for Video Retrieval

Valentin Gabeur, Chen Sun, Karteek Alahari, Cordelia Schmid

专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments ECCV 2020 (spotlight paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.09944 2019-10-28 cs.CV 83%

Watch, Listen and Tell: Multi-modal Weakly Supervised Dense Event Captioning

Tanzila Rahman, Bicheng Xu, Leonid Sigal

专题命中 视频多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV

Journal ref ICCV2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.03989 2018-10-23 cs.CV 83%

Image-to-Video Person Re-Identification by Reusing Cross-modal Embeddings

Zhongwei Xie, Lin Li, Xian Zhong, Luo Zhong

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

Comments under review for Pattern Recognition Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.05848 2018-10-01 cs.CV 83%

Towards Good Practices for Multi-modal Fusion in Large-scale Video Classification

Jinlai Liu, Zehuan Yuan, Changhu Wang

专题命中 视频多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV

Comments ECCV YouTube-8M workshop general paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.07999 2018-09-24 cs.CV cs.AI cs.CL cs.MM 83%

Multimodal Dual Attention Memory for Video Story Question Answering

Kyung-Min Kim, Seong-Ho Choi, Jin-Hwa Kim, Byoung-Tak Zhang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted for ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.08907 2016-03-30 cs.CV 83%

Cross-modal Supervision for Learning Active Speaker Detection in Video

Punarjay Chakravarty, Tinne Tuytelaars

专题命中 视频多模态 :cross-modal(title);multi-modal(abstract);audio-visual(abstract);分类 cs.CV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11683 2026-06-11 cs.CV cs.AI 新提交 82%

Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning

推理,再推理:跨视角重访提升空间推理

Chaofan Ma, Zhenjie Mao, Yuhuan Yang, Fanqin Zeng, Yue Shi, Yingjie Zhou, Xiaofeng Cao, Jiangchao Yao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 提出ReRe框架,通过生成互补新视角视频让MLLM先推理再验证,无需训练即可显著提升空间推理性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08415 2026-06-11 cs.CV cs.AI 版本更新 82%

CoVEBench: Can Video Editing Models Handle Complex Instructions?

CoVEBench: 视频编辑模型能处理复杂指令吗?

Jiangtao Wu, Jiaming Wang, Yiwen He, Yuanxing Zhang, Shihao Li, Dunyuan Liu, Xuedong Zhao, Jialu Chen, Zekun Moore Wang, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 视频多模态 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 提出CoVEBench基准,包含416个源视频和626条多点编辑指令,通过MLLM评估指令遵循度和保真度,揭示当前模型在组合编辑中常遗漏编辑或破坏保留约束。

Comments 34 pages, 11 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21954 2026-05-22 cs.CV cs.AI 82%

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

Dazhao Du, Liao Duan, Jian Liu, Tao Han, Yujia Zhang, Eric Liu, Xi Chen, Song Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) Xi’an Jiaotong University(西安交通大学) Tencent(腾讯)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型(MLLMs)在视频时间定位中的感知与生成之间的差距,提出了一种推理阶段的读取-再生成框架,通过利用注意力线索来提高时间定位的准确性,从而在三个视频时间定位基准上提升了MiMo-VL-7B、Qwen3-VL-8B和TimeLens-8B的性能。

Comments Project Website: https://ddz16.github.io/mllmsknowwhen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13294 2026-05-22 cs.CV cs.AI 82%

VisPhyWorld: Probing Physical Reasoning via Code-Driven Video Reconstruction

VisPhyWorld: 通过代码驱动的视频重建探测物理推理

Jiarong Liang, Max Ku, Ka-Hei Hui, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) Autodesk AI Lab(Autodesk人工智能实验室) Independent Researcher(独立研究者)

专题命中 视频多模态 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisPhyWorld框架,通过要求模型从视觉观察生成可执行的模拟器代码来评估物理推理能力,引入VisPhyBench基准测试集,验证模型在重建外观和模拟物理运动方面的能力,发现最先进的MLLM在准确推断物理参数和模拟一致的物理动态方面存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03781 2026-08-14 cs.RO 版本更新 82%

OpenRC: An Open-Source Robotic Colonoscopy Framework for Multimodal Data Acquisition and Autonomy Research

OpenRC:一种用于多模态数据采集和自主性研究的开源机器人结肠镜框架

Siddhartha Kapuria, Mohammad Rafiee Javazm, Naruhiko Ikoma, Joga Ivatury, Mohammad Ali Nasseri, Nassir Navab, Farshid Alambeigi

机构 * Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程系) Department of Surgical Oncology, Division of Surgery, The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心外科肿瘤学系) School of Medicine and Health, Technical University of Munich(慕尼黑工业大学医学与健康学院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 OpenRC框架通过整合开源硬件和多模态数据集,为机器人结肠镜和手术自主性研究提供了可重复的基础,支持同时记录视频、操作指令、执行状态和末端位置,并验证了运动一致性和跨模态延迟。

Comments Abstract: Added repository and contribution statement

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02260 2026-08-07 stat.ML cs.LG stat.AP 版本更新 82%

MoCA: Multi-modal Cross-masked Autoencoder for Time Series in Digital Health

MoCA:用于数字健康测量的多模态交叉掩码自编码器

Howon Ryu, Yuliang Chen, Yacun Wang, Andrea Z. LaCroix, Chongzhi Di, Loki Natarajan, Yu Wang, Jingjing Zou

机构 * Herbert Wertheim School of Public Health and Human Longevity Science, University of California, San Diego, San Diego, CA, USA(赫伯特·韦瑟姆公共卫生与人类长寿科学学院,加州大学圣地亚哥分校) Halıcıoğlu Data Science Institute, University of California San Diego, San Diego, CA, USA(哈利奇奥卢数据科学研究所,加州大学圣地亚哥分校) Department of Computer Science and Engineering, University of California San Diego, San Diego, CA, USA(计算机科学与工程系,加州大学圣地亚哥分校) Division of Public Health Sciences, Fred Hutchinson Cancer Center, Seattle, WA, USA(公共卫生科学部,Fred Hutchinson癌症中心)

专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 提出MoCA自监督学习框架,结合Transformer与MAE,通过跨模态掩码提升多模态可穿戴数据的重构与分类性能,兼具理论保障,可处理缺失模态并应用于数字健康领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03151 2026-08-05 cs.CR cs.HC 新提交 82%

AirKey: Multimodal Acoustic-Assisted WiFi Sensing for Zero-Training Robust PIN Inference

AirKey:用于零训练鲁棒PIN推断的多模态声学辅助WiFi感知

BaiChuan Wu, Bin Liu, Xiang Zhang, Zhi Liu, Jie Zhang, Chao Liu, Huan Yan, Meng Li, Fusang Zhang

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 AirKey是一种多模态感知框架,通过利用IEEE 802.11机制和声学信号辅助WiFi感知,实现零训练鲁棒PIN推断,准确率超现有单模态方案4倍,可在6次尝试内恢复设备解锁PIN,凸显智能界面的隐私漏洞。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11792 2026-06-12 cs.CV cs.AI cs.CL 新提交 82%

MultiToP: Learning to Patch Visual Tokens to Mitigate Hallucinations in Video Large Multimodal Models

MultiToP:学习修补视觉令牌以减轻视频大型多模态模型中的幻觉

Yuansheng Gao, Wenbin Xing, Jiahao Yuan, Kaiwen Zhou, Han Bao, Zonghui Wang, Wenzhi Chen

机构 * Zhejiang University(浙江大学) Sun Yat-sen University(中山大学) East China Normal University(华东师范大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出MultiToP框架,通过轻量级视觉令牌修补器动态替换不可靠视觉令牌,结合信息引导排名校准和稀疏正则化,在不修改原模型情况下减少视频多模态模型幻觉,显著提升F1分数和问答准确率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19130 2026-05-20 cs.LG cs.AI cs.CL cs.CV 82%

EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试

Dongyan Lin, Phillip Rust, Angel Villar Corrales, Alvin W. M. Tan, Mahi Luthra, Charles-Éric Saint-James, Rashel Moritz, Sheila Krogh-Jespersen, Vanessa Stark, Surya Parimi, Jiayi Shen, Youssef Benchekroun, Yosuke Higuchi, Martin Gleize, Tom Fizycki, Nicolas Hamilakis, Manel Khentout, Sho Tsuji, Balázs Kégl, Juan Pino, Michael C. Frank, Emmanuel Dupoux

机构 * Meta Superintelligence Labs(Meta超智能实验室) Stanford University(斯坦福大学) Meta Reality Labs(Meta现实实验室) The University of Tokyo(东京大学)

专题命中 视频多模态 :cross-modal(title);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18188 2026-05-19 cs.LG 82%

UTOPYA: A Multimodal Deep Learning Framework for Physics-Informed Anomaly Detection and Time-Series Prediction

UTOPYA:一种用于物理信息异常检测和时间序列预测的多模态深度学习框架

Robson W. S. Pessoa, Julien Amblard, Alessandra Russo, Idelfonso B. R. Nogueira

机构 * Department of Chemical Engineering, Norwegian University of Science and Technology (NTNU)(化学工程系,挪威科学与技术大学) Department of Computing, Imperial College London(计算系,帝国理工学院伦敦分校)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出UTOPYA框架,通过融合八种数据模态,利用FiLM条件交叉模态注意力和门控融合,共同解决批次蒸馏中的异常检测、时间序列预测和相分类问题,并通过物理信息正则化方案和课程学习方法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07259 2026-04-22 cs.CV cs.AI cs.LG cs.MM 82%

COMODO: Cross-Modal Video-to-IMU Distillation for Efficient Egocentric Human Activity Recognition

COMODO:跨模态视频到IMU知识蒸馏用于高效的第一人称人类活动识别

Baiyu Chen, Wilson Wongso, Zechen Li, Yonchanok Khaokaew, Hao Xue, Flora Salim

机构 * The University of New South Wales(新南威尔士大学) King Mongkut's University of Technology North Bangkok(科技技术北巴吞蓬大学) The Hong Kong University of Science(香港科学大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出COMODO框架,通过跨模态自监督蒸馏将视频语义知识转移到IMU,提升第一人称人类活动识别的效率与泛化能力。

Comments IMWUT/UbiComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17690 2026-04-21 cs.MM cs.CV cs.SD eess.AS 82%

Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis

多模态同步机制:来自基于解码器的视频-文本到语音合成的洞察

Akshita Gupta, Tatiana Likhomanenko, Karren Dai Yang, Richard He Bai, Zakaria Aldeneh, Navdeep Jaitly

机构 * Apple(苹果公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 本文通过视频-文本到语音合成研究多模态同步机制,探讨了解码器如何整合不同模态信息,以及模态顺序对性能和迁移的影响,提出了TimeSync指标用于细粒度分析。

Comments 30 pages, Decoder-only model, Speech Synthesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16411 2026-04-21 cs.LG 82%

CGCMA: Conditionally-Gated Cross-Modal Attention for Event-Conditioned Asynchronous Fusion

CGCMA:基于事件条件的异步融合条件门控跨模态注意力

Yunxiang Guo

机构 * Independent Researcher(独立研究者)

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract)

AI总结 本文提出CGCMA,用于异步融合场景中事件条件下的跨模态注意力,通过分离文本条件接地与滞后感知信任控制,提升异步多模态融合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08771 2026-04-13 cs.HC cs.ET 82%

TeamLLM: Exploring the Capabilities of LLMs for Multimodal Group Interaction Prediction

TeamLLM: 探索LLMs在多模态群体交互预测中的能力

Diana Romero, Xin Gao, Daniel Khalkhali, Salma Elmalaki

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(abstract)

AI总结 本文研究LLMs在多模态传感器数据中预测群体协调模式的能力,发现LLMs在语言基础行为上比LSTM基线提升3.2倍,细调准确率达96%。同时揭示了文本模型在多模态交互中的局限性及模拟模式的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18740 2026-04-08 cs.IR 82%

Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation

具有自适应偏好优化的多模态大语言模型用于序列推荐

Yu Wang, Yonghui Yang, Le Wu, Yi Zhang, Fei Liu, Richang Hong

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出HaNoRec框架,通过自适应偏好优化解决多模态序列推荐中的样本不平衡和跨模态语义偏差问题,提升推荐性能。

Comments Accepted by SIGIR 2026 (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02425 2026-03-30 cs.CV cs.AI cs.CL cs.IR cs.LG 82%

WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning

WorldMM: 动态多模态记忆代理用于长视频推理

Woongyeong Yeo, Kangsan Kim, Jaehong Yoon, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡南洋理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 WorldMM通过构建和检索多种互补记忆,提升长视频推理能力,实现8.4%的性能提升。

Comments CVPR 2026. Project page : https://worldmm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27321 2026-03-26 cs.LG 82%

MedM2T: A MultiModal Framework for Time-Aware Modeling with Electronic Health Record and Electrocardiogram Data

MedM2T:一种用于电子健康记录和心电图数据的时间感知多模态框架

Yu-Chen Kuo, Yi-Ju Tseng

机构 * Computational Health Informatics Program, Boston Children’s Hospital(儿童医院计算健康信息学项目,波士顿儿童医院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 MedM2T通过整合稀疏时间序列编码器、层次时间感知融合和双模态注意力机制,有效处理医疗数据的多模态和异构时间结构,实现对慢性及急性疾病动态的预测,展现优于现有方法的性能。

Comments This preprint version of the manuscript has been submitted to the IEEE Journal of Biomedical and Health Informatics (JBHI) for review. The implementation of MedM2T is available at https://github.com/DHLab-TSENG/MedM2T

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08138 2026-03-24 cs.CV cs.AI cs.MM 82%

Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability

通过跨模态注意力可区分性理解视频-语言模型中的时间逻辑一致性

Chengzhi Li, Heyan Huang, Ping Jian, Zhen Yang, Yaning Tian, Zhongbin Guo

机构 * School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学与技术学院,北京,中国) Beijing Engineering Research Center of High Volume Language Information Processing and Cloud Computing Applications, Beijing Institute of Technology, Beijing, China(高性能语言信息处理与云计算应用北京工程研究中心,北京理工大学,北京,中国)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究探讨视频-语言模型在时间逻辑一致性问题上的核心原因,提出TCAS方法提升跨模态注意力的时序分辨能力,实验验证了方法对时间逻辑一致性的提升效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15093 2026-03-24 eess.SP cs.IT math.IT 82%

Beam Prediction Based on Multimodal Large Language Models

基于多模态大语言模型的波束预测

Tianhao Mao, Le Liang, Jie Yang, Xiao Li, Shi Jin, Geoffrey Ye Li

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出基于多模态大语言模型的波束预测框架,通过融合RGB图像和LiDAR点云等异构数据,提升动态环境下波束预测精度与通信性能,实验表明其在波束准确性和通信性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14719 2026-03-17 cs.LG 82%

Multimodal Deep Learning for Early Prediction of Patient Deterioration in the ICU: Integrating Time-Series EHR Data with Clinical Notes

多模态深度学习用于ICU中患者恶化的早期预测:整合时间序列电子健康记录数据与临床笔记

Binesh Sadanandan

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出一种多模态深度学习方法,结合结构化时间序列数据和非结构化临床笔记,用于预测ICU患者恶化。模型在MIMIC-IV数据库上训练,测试集AUROC达0.7857,临床笔记提升AUROC2.5个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏