arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-26 至 2026-03-26 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 6 篇

2603.24484 2026-03-26 cs.CV 83%

Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models

视频-only ToM:增强多模态大语言模型的理论思维

Siqi Liu, Xinyang Li, Bochao Zou, Junbao Zhuo, Huimin Ma, Jiansheng Chen

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出VisionToM框架,通过视觉干预增强多模态大语言模型的理论思维能力,改进模型在多模态任务中的推理和问答性能。

Comments 20 pages, 7 figures, accepted at CVPR 2026, project page: see https://founce.github.io/VisionToM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27321 2026-03-26 cs.LG 82%

MedM2T: A MultiModal Framework for Time-Aware Modeling with Electronic Health Record and Electrocardiogram Data

MedM2T:一种用于电子健康记录和心电图数据的时间感知多模态框架

Yu-Chen Kuo, Yi-Ju Tseng

机构 * Computational Health Informatics Program, Boston Children’s Hospital(儿童医院计算健康信息学项目,波士顿儿童医院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 MedM2T通过整合稀疏时间序列编码器、层次时间感知融合和双模态注意力机制,有效处理医疗数据的多模态和异构时间结构,实现对慢性及急性疾病动态的预测,展现优于现有方法的性能。

Comments This preprint version of the manuscript has been submitted to the IEEE Journal of Biomedical and Health Informatics (JBHI) for review. The implementation of MedM2T is available at https://github.com/DHLab-TSENG/MedM2T

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24539 2026-03-26 cs.CV cs.AI 62%

CliPPER: Contextual Video-Language Pretraining on Long-form Intraoperative Surgical Procedures for Event Recognition

CliPPER:基于长形式术中手术程序的上下文视频-语言预训练用于事件识别

Florian Stilz, Vinkle Srivastav, Nassir Navab, Nicolas Padoy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, France(斯特拉斯堡大学,法国国家科学研究中心,法国国家医学研究院,ICube,UMR7357,法国) IHU Strasbourg, France(斯特拉斯堡IHU,法国) Technical University of Munich, Germany(慕尼黑技术大学,德国)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CliPPER框架,通过手术讲座视频预训练,提升长形式手术视频的细粒度时间视频-文本识别,引入VTC_CTX和COP等预训练策略,改进多模态对齐,实现多个公开手术基准的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04000 2026-03-26 cs.CV cs.AI cs.LG 62%

Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding

分割后再地面:为长视频理解适应帧选择以查询类型

Jialuo Li, Bin Li, Jiahao Li, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DIG框架,根据查询类型调整帧选择策略,通过高效均匀采样处理全局查询,利用专用流程提取相关帧处理局部查询,提升长视频理解性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03404 2026-03-26 cs.CV cs.LG 57%

Set2Seq Transformer: Temporal and Position-Aware Set Representations for Sequential Multiple-Instance Learning

Set2Seq Transformer: 时序和位置感知的集合表示用于序列多实例学习

Athanasios Efthymiou, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Set2Seq Transformer,通过端到端多模态学习,联合建模集合结构和时间依赖性,提升在艺术分析和野火预测中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23779 2026-03-26 eess.IV physics.geo-ph 50%

Sentinel-2 for Crop Yield Estimation: A Systematic Review

哨兵-2用于作物产量估计:系统综述

Mohammadreza Narimani, Alireza Pourreza, Ali Moghimi, Parastoo Farajpoor

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文综述了利用哨兵-2卫星进行作物产量估计的最新进展,重点探讨了基于经验模型、作物生长模型融合和多源数据融合的方法,指出机器学习和深度学习在解释田间产量变异方面有显著效果,但受限于地面数据不足和云遮蔽问题。

Comments 29 pages, 5 figures, review paper

详情

展开后加载摘要…

URL PDF HTML 收藏