arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4726 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4726 篇

2512.09616 2025-12-11 cs.CV cs.AI cs.CL cs.LG 75%

Rethinking Chain-of-Thought Reasoning for Videos

重新思考视频中的链式推理

Yiwu Zhong, Zi-Yuan Hu, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本研究提出了一种高效的视频推理框架,通过简洁推理和减少的视觉标记提升推理效率和性能,无需依赖传统CoT注释或监督微调。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03319 2025-09-23 cs.CV cs.AI cs.MM 75%

SD-VSum: A Method and Dataset for Script-Driven Video Summarization

Manolis Mylonas, Evlampios Apostolidis, Vasileios Mezaris

机构 * ITI, CERTH(ITI、CERTH)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments In ACM Multimedia 2025, DOI:10.1145/3746027.3755821

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03970 2025-04-11 cs.CV cs.AI cs.CL cs.IR 75%

VideoComp: Advancing Fine-Grained Compositional and Temporal Alignment in Video-Text Models

Dahun Kim, AJ Piergiovanni, Ganesh Mallya, Anelia Angelova

专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments CVPR 2025, project page at https://github.com/google-deepmind/video_comp

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09612 2025-04-03 cs.CV cs.AI cs.CL 75%

Olympus: A Universal Task Router for Computer Vision Tasks

Yuanze Lin, Yunsheng Li, Dongdong Chen, Weijian Xu, Ronald Clark, Philip H. S. Torr

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to CVPR 2025, Project webpage: http://yuanze-lin.me/Olympus_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19702 2025-02-13 cs.CV cs.AI cs.MM 75%

TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning

Xiangyu Zeng, Kunchang Li, Chenting Wang, Xinhao Li, Tianxiang Jiang, Ziang Yan, Songze Li, Yansong Shi, Zhengrong Yue, Yi Wang, Yali Wang, Yu Qiao, Limin Wang

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12380 2025-01-22 cs.CV cs.AI cs.CL 75%

MMVU: Measuring Expert-Level Multi-Discipline Video Understanding

Yilun Zhao, Lujing Xie, Haowei Zhang, Guo Gan, Yitao Long, Zhiyuan Hu, Tongyan Hu, Weiyuan Chen, Chuhan Li, Junyang Song, Zhijian Xu, Chengye Wang, Weifeng Pan, Ziyao Shangguan, Xiangru Tang, Zhenwen Liang, Yixin Liu, Chen Zhao, Arman Cohan

专题命中 视频多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05854 2024-11-12 cs.MM cs.AI cs.CV cs.CY 75%

Harmful YouTube Video Detection: A Taxonomy of Online Harm and MLLMs as Alternative Annotators

Claire Wonjeong Jo, Miki Wesołowska, Magdalena Wojcieszak

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16533 2024-06-12 cs.CV cs.AI cs.CL 75%

ICSVR: Investigating Compositional and Syntactic Understanding in Video Retrieval Models

Avinash Madasu, Vasudev Lal

专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01232 2024-03-22 cs.LG 75%

Modality-aware Transformer for Financial Time series Forecasting

Hajar Emami, Xuan-Hong Dang, Yousaf Shah, Petros Zerfos

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13537 2023-07-26 cs.CV cs.AI cs.MM 75%

Spectrum-guided Multi-granularity Referring Video Object Segmentation

Bo Miao, Mohammed Bennamoun, Yongsheng Gao, Ajmal Mian

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by ICCV 2023, code is at https://github.com/bo-miao/SgMg

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.14546 2023-01-02 cs.CV cs.CL cs.MM 75%

HiTeA: Hierarchical Temporal-Aware Video-Language Pre-training

Qinghao Ye, Guohai Xu, Ming Yan, Haiyang Xu, Qi Qian, Ji Zhang, Fei Huang

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11446 2022-12-01 cs.CV cs.AI cs.CL 75%

SMAUG: Sparse Masked Autoencoder for Efficient Video-Language Pre-training

Yuanze Lin, Chen Wei, Huiyu Wang, Alan Yuille, Cihang Xie

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.16860 2022-11-14 cs.CV cs.MM cs.SD eess.AS eess.IV 75%

Investigating Modality Bias in Audio Visual Video Parsing

Piyush Singh Pasi, Shubham Nemani, Preethi Jyothi, Ganesh Ramakrishnan

专题命中 视频多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Work under review for ICASSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.02681 2021-10-20 cs.CL cs.AI cs.CV cs.LG 75%

VidLanKD: Improving Language Understanding via Video-Distilled Knowledge Transfer

Zineng Tang, Jaemin Cho, Hao Tan, Mohit Bansal

专题命中 视频多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments NeurIPS 2021 (19 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22331 2025-09-29 cs.CV cs.AI 74%

Pedestrian Attribute Recognition via Hierarchical Cross-Modality HyperGraph Learning

Xiao Wang, Shujuan Wu, Xiaoxia Cheng, Changwei Bi, Jin Tang, Bin Luo

机构 * School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学)

专题命中 视频多模态 :multi-modal(abstract,comments);cross-modal(abstract);分类 cs.CV、cs.AI

Comments The First Work that Exploits Multi-modal Knowledge Graph for Pedestrian Attribute Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19951 2025-07-23 cs.CV cs.CL cs.LG 74%

Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation

Shukang Yin, Chaoyou Fu, Sirui Zhao, Chunjiang Ge, Yan Yang, Yuhan Dai, Yongdong Luo, Tong Xu, Caifeng Shan, Enhong Chen

机构 * USTC(中国科学技术大学) NJU(南京大学) THU(清华大学) XMU(厦门大学)

专题命中 视频多模态 :MLLM(abstract,comments);multimodal(abstract);分类 cs.CV、cs.CL

Comments Project page: https://github.com/VITA-MLLM/Sparrow

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14952 2026-08-18 cs.RO cs.CV eess.SP 新提交 74%

Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails

不存在的证据:当视觉失效时维持世界模型的跨模态溯因风险感知

Cong Xu, Ravi Sankar

机构 * University of South Florida(南佛罗里达大学)

专题命中 视频多模态 :cross-modal(title);分类 cs.CV

AI总结 该研究提出跨模态溯因风险感知方法,在视觉失效时通过声学线索维持世界模型,可提前1.7秒预警,虚警减少42%,校准良好,能在视觉退化下保持高危险感知度。

Comments 7 pages, 3 figures. Working draft prepared for journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03142 2026-08-05 stat.ML cs.AI cs.LG 新提交 74%

Minimax-Optimal Semiparametric Contextual Dynamic Pricing with Multimodal Revenue

带多模态收益的极小极大最优半参数情境动态定价

Xueping Gong, Zhuoluo Zhang, Zhaowei Miao, Jiheng Zhang

专题命中 视频多模态 :multimodal(title);分类 cs.AI

AI总结 该研究针对带多模态收益的情境动态定价问题,提出经试点校正的分层决策划分策略,达到依赖极小极大平滑性的时域速率,填补了半参数情境动态定价的相关理论空白。

Comments 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20919 2026-07-31 cs.CV 版本更新 74%

GIM-ENDO: A Multimodal Endoscopic Image and Video Dataset for Gastric Intestinal Metaplasia Morphology and Pathology

GIM-ENDO:用于胃肠化生形态与病理的多模态内镜图像和视频数据集

Mojgan Forootan, Mahziar Setayeshfar, Ali Darvishi, Mohammad Tashakoripour, Hamidreza Bolhasani

机构 * Gastroenterology and Liver Disease Research Center, Research Institute for Gastroenterology and Liver Diseases, Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学胃肠病与肝病研究中心,胃肠病与肝病研究所) Iran University of Medical Sciences(伊朗医科大学) Shiraz University of Medical Sciences(设拉子医科大学) Gastroenterology Department, Amiralam Hospital, Tehran University of Medical Sciences(德黑兰医科大学阿米拉拉姆医院胃肠病科) Department of Computer Engineering, Science and Research Branch, Islamic Azad University(伊斯兰阿扎德大学科学与研究分校计算机工程系)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 针对胃黏膜肠化生(GIM)公开数据集缺失的问题,构建了包含多模态内镜图像、视频及病理标注的数据集GIM-ENDO,涵盖六种主要内镜征象和亚型分级,以促进AI辅助诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16362 2026-07-21 cs.CV 新提交 74%

OmniStyle-INR: Universal and Multimodal Style Transfer for INRs

OmniStyle-INR:用于隐式神经表示的通用多模态风格迁移

Rafał Kajca, Michał Miziołek, Kornel Howil, Rafał Tobiasz, Przemysław Spurek

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS 研究所)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 研究针对不同数据模态的风格迁移问题,提出OmniStyle-INR框架,利用基于网络的连续表示作为通用域,实现了在文本提示和视觉示例引导下跨视觉模态的高质量风格迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16084 2026-07-07 cs.LG cs.AI 版本更新 74%

Unveiling Stochasticity: Universal Multi-modal Probabilistic Modeling for Traffic Forecasting

揭示随机性:面向交通预测的通用多模态概率建模

Weijiang Xiong, Robert Fonod, Nikolas Geroliminis

机构 * Urban Transport Systems Laboratory (LUTS), EPFL(智能交通系统实验室(LUTS),EPFL)

专题命中 视频多模态 :multi-modal(title);分类 cs.AI

AI总结 本文提出一种通用多模态概率建模方法,通过替换输出层为GMM层,提升交通预测的不确定性建模能力,实验表明其在多种数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10180 2026-07-02 cs.CV 版本更新 74%

TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval

TCMA:面向无人机跨模态文本-视频检索的文本条件多粒度对齐

Zixu Zhao, Yang Zhan, Yunhao Li, Yan Li

机构 * Carnegie Mellon University(卡内基梅隆大学) The Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学)

专题命中 视频多模态 :cross-modal(title);分类 cs.CV

AI总结 针对无人机视频检索中数据集粗粒度、冗余标注问题,构建细粒度多样化标注数据集DVTMD,并提出文本条件多粒度对齐框架TCMA,实现全局-局部多层级对齐,在无人机文本-视频检索任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12105 2026-06-11 cs.RO cs.CV cs.LG 新提交 74%

DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model

DAM-VLA: 解耦异步多模态视觉语言动作模型

Pankhuri Vanjani, Zhuoyue Li, Jakub Suliga, Moritz Reuss, Gianluca Geraci, Xinkai Jiang, Rudolf Lioutikov

机构 * Intuitive Robots Lab, Karlsruhe Institute of Technology (KIT)(直觉机器人实验室,卡尔斯鲁厄理工学院) NVIDIA(英伟达) Robotics Institute of Germany(德国机器人研究所)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 针对VLA模型同步时钟与物理交互中不同模态频率不匹配的问题,提出DAM-VLA,通过解耦各模态时间处理、维护传感器速率更新的潜在缓冲区,并利用门控交叉注意力整合高频模态,在7个真实操作任务中平均成功率提升至95.2%。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13679 2026-06-09 cs.HC cs.CV 版本更新 74%

Toward Scalable Co-located Practical Learning: Assisting with Computer Vision and Multimodal Analytics

迈向可扩展的协同实践学习:协助计算机视觉和多模态分析

Xinyu Li, Linxuan Zhao, Yueqiao Jin, Yuchen Liu, Jin Zhou, Roberto Martinez-Maldonado, Dragan Gasevic, Lixiang Yan

机构 * Centre for Learning Analytics at Monash(墨尔本大学学习分析中心) Monash University(墨尔本大学) Department of Civil and Environmental Engineering(土木与环境工程系) School of Education(教育学院) The University of Hong Kong(香港大学)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 本研究评估了固定摄像头管道在重复护理模拟中的效果,通过多阶段源到目标适应提升行为检测精度,并利用行为轨迹分析提升模拟 debriefing 的可检索性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02994 2026-06-03 cs.CV 74%

Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation

Video-OPD:通过在线策略蒸馏实现多模态大语言模型在时序视频定位中的高效后训练

Jiaze Li, Hao Yin, Haoran Xu, Boshen Xu, Wenhui Tan, Zewen He, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 提出Video-OPD框架,利用在线策略蒸馏和教师验证分歧聚焦课程,以高效后训练多模态大语言模型进行时序视频定位,克服稀疏奖励和高计算开销问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01628 2026-06-02 q-bio.BM cs.AI 74%

Demystifying Multimodal Biomolecular Co-design With Intrinsic Geodesic Coupling

揭示具有内在测地耦合的多模态生物分子协同设计

Keyue Qiu, Xintong Wang, Zhilong Zhang, Hao Zhou, Wei-Ying Ma

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视频多模态 :multimodal(title);分类 cs.AI

AI总结 针对生物分子协同设计中模态间时间耦合被忽视的问题,提出GeoCoupling框架优化异构模态的时间耦合,在基于结构的药物设计和无条件蛋白质设计中提升物理有效性和多样性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21458 2026-05-19 cs.CV 74%

Mining Forgery Traces from Reconstruction Error: A Weakly Supervised Framework for Multimodal Deepfake Temporal Localization

从重建误差中挖掘伪造痕迹:一种用于多模态深度伪造时间定位的弱监督框架

Midou Guo, Qilin Yin, Wei Lu, Rui Yang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 本文提出RT-DeepLoc框架,通过重建误差识别深度伪造,利用MAE学习真实数据的时空模式,结合不对称视频对比损失提升定位精度,实验表明在大规模数据集上达到弱监督时间伪造定位的最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05959 2026-04-29 cs.CV cs.LG 74%

Multi-Modal Landslide Detection from Sentinel-1 SAR and Sentinel-2 Optical Imagery Using Multi-Encoder Vision Transformers and Ensemble Learning

基于Sentinel-1 SAR和Sentinel-2光学影像的多模态滑坡检测:使用多编码器视觉Transformer和集成学习

Ioannis Nasios

机构 * NodalPoint

专题命中 视频多模态 :multi-modal(title);分类 cs.CV

AI总结 本文提出融合Sentinel-2光学影像与Sentinel-1 SAR数据的多模型框架,利用多编码器视觉Transformer和集成学习提升滑坡检测精度,实现91.9的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14630 2026-04-17 cs.CV cs.LG 74%

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation

CMTM:跨模态令牌调制用于无监督视频对象分割

Inseok Jeon, Suhwan Cho, Minhyeok Lee, Seunghoon Lee, Minseok Kang, Jungho Lee, Chaewon Park, Donghyeong Kim, Sangyoun Lee

机构 * Yonsei University, Republic of Korea(延世大学,韩国)

专题命中 视频多模态 :cross-modal(title);分类 cs.CV

AI总结 本文提出CMTM方法,通过跨模态令牌调制增强外观与运动提示的交互,实现高效的多模态信息传播,取得最佳性能。

Comments 6 pages, 5 figures. Accepted to IEEE ICIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16806 2026-04-15 cs.CV 74%

MedGS: Gaussian Splatting for Multi-Modal 3D Medical Imaging

MedGS:用于多模态3D医学影像的高斯点散射

Kacper Marzol, Ignacy Kolton, Weronika Smolak-Dyżewska, Joanna Kaleta, Żaneta Świderska-Chadaj, Marcin Mazur, Mirosław Dziekiewicz, Tomasz Markiewicz, Przemysław Spurek

机构 * Jagiellonian University, Poland(雅盖隆大学,波兰) Warsaw University of Technology, Poland(华沙理工大学,波兰) IDEAS Research Institute, Poland(IDEAS研究所,波兰) Military Institute of Medicine, Poland(军事医学研究所,波兰)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV

AI总结 本文提出MedGS,一种利用内镜成像独特性质的3D重建框架,通过物理逼真重照明模型提升重建质量,实现更准确的临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏