arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-08 至 2026-05-08 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 11 篇

2510.05652 2026-05-08 cs.CV 83%

SD-MVSum: Script-Driven Multimodal Video Summarization Method and Datasets

SD-MVSum:基于脚本的多模态视频摘要方法与数据集

Manolis Mylonas, Charalampia Zerva, Evlampios Apostolidis, Vasileios Mezaris

机构 * CERTH-ITI Thermi(CERTH-ITI热米)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出SD-MVSum方法及两个大规模数据集,通过引入加权跨模态注意力机制,结合脚本与视频音频内容提升摘要相关性,验证了方法在脚本驱动视频摘要中的有效性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19972 2026-05-08 cs.CV 79%

Boosting Reasoning in Large Multimodal Models via Activation Replay

通过激活回放提升大多模态模型的推理能力

Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯云图实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12828 2026-05-08 cs.LG cs.AI 70%

Risk Horizons: Structured Hypothesis Spaces for Longitudinal Clinical Prediction

风险视界:用于纵向临床预测的结构化假设空间

Zhan Qu, Michael Färber

机构 * TU Dresden(德累斯顿技术大学)

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出风险视界框架,通过结合确定性编码层级与数据驱动的滞后跨模态关联,将纵向预测转化为在紧凑且临床一致的假设空间中的排序问题,提升了多模态下次就诊预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14724 2026-05-08 cs.CV cs.AI cs.CL 67%

HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding

HERMES: KV缓存作为分层内存用于高效视频流理解

Haowei Zhang, Shudong Yang, Jinlan Fu, See-Kiong Ng, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 HERMES提出一种无需训练的架构,通过将KV缓存视为分层内存框架,实现视频流的实时准确理解,提升处理速度并降低内存消耗。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06083 2026-05-08 cs.CV cs.IR cs.LG cs.MM 62%

Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval

重新审视不确定性:关于部分相关视频检索的证据学习

Jun Li, Peifeng Lai, Xuhang Lou, Jinpeng Wang, Yuting Wang, Ke Chen, Yaowei Wang, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Holmes框架,通过多粒度跨模态证据聚合量化和建模不确定性,解决视频检索中因查询简短与视频内容丰富带来的语义模糊问题。

Comments Accepted by ICML 2026. 16 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06537 2026-05-08 cs.CV 57%

MedHorizon: Towards Long-context Medical Video Understanding in the Wild

MedHorizon:迈向真实场景下的长上下文医学视频理解

Bodong Du, Bowen Liu, Yang Yu, Xinpeng Ding, Zhiheng Wu, Shuning Wang, Shuo Nie, Naiming Liu, Qifeng Chen, Yangqiu Song, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Baidu Inc.(百度公司) Xidian University(西安电子科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MedHorizon提出一个真实场景下的长上下文医学视频理解基准,通过稀疏证据和多跳临床推理评估,揭示当前系统在完整流程理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05950 2026-05-08 cs.CL 57%

Lightweight Stylistic Consistency Profiling: Robust Detection of LLM-Generated Textual Content for Multimedia Moderation

轻量级风格一致性剖析:面向多媒体审核的LLM生成文本稳健检测

Siyuan Li, Aodu Wulianghai, Xi Lin, Xibin Yuan, Qinghua Mao, Guangyan Li, Xiang Chen, Jun Wu, Jianhua Li

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出LiSCP方法,通过结合离散风格特征与连续语义信号,提升对抗环境下的LLM生成文本检测鲁棒性,实现在多领域中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05912 2026-05-08 cs.LG cs.CV 57%

From Drops to Grid: Noise-Aware Spatio-Temporal Neural Process for Rainfall Estimation

从水滴到网格:面向噪声的时空神经过程用于降雨估计

Rafael Pablos Sarabia, Joachim Nyborg, Morten Birk, Ira Assent

机构 * Dept. Comp. Sc., Aarhus University(计算机科学系,奥胡斯大学) Cordulus

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出DropsToGrid方法,通过融合噪声天气站的时间序列与雷达空间信息,生成高分辨率降雨场,有效处理降雨的偏态、局部性和噪声问题,提升不确定性量化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18753 2026-05-08 cs.LG cs.AI 57%

Handling and Interpreting Missing Modalities in Patient Clinical Trajectories via Autoregressive Sequence Modeling

通过自回归序列建模处理和解释患者临床轨迹中的缺失模态

Andrew Wang, Ellie Pavlick, Ritambhara Singh

机构 * Brown University(布朗大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文通过自回归序列建模方法处理医疗数据中缺失模态的问题,提出对比预训练目标并验证了其在MIMIC-IV和eICU数据集上的有效性,提升了模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20079 2026-05-08 cs.CL 57%

Predicting States of Understanding in Explanatory Interactions Using Cognitive Load-Related Linguistic Cues

利用与认知负荷相关的语言线索预测解释互动中的理解状态

Yu Wang, Olcay Türk, Angela Grimminger, Hendrik Buschmeier

机构 * Faculty of Linguistics Literary Studies, Bielefeld University, Bielefeld, Germany Faculty of Arts Humanities, Paderborn University, Paderborn, Germany \| SFB/Transregio 318 ‘Constructing Explainability’, Bielefeld \& Paderborn, Germany

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究通过分析对话中说话者和听者的语言特征,探讨如何预测听者的理解状态。通过MUNDEX语料库的统计分析,发现认知负荷相关的语言线索与听者理解水平相关,使用三种语言线索和文本特征可提升预测效果。

Journal ref Proceedings of the 15th Language Resources and Evaluation Conference (LREC 2026), pp. 11368-11378

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17622 2026-05-08 cs.HC cs.CL cs.IR 57%

Memento: Towards Proactive Visualization of Everyday Memories with Personal Wearable AR Assistant

Memento:面向日常记忆主动可视化的人体可穿戴AR助手

Yoonsang Kim, Yalong Yang, Arie E. Kaufman

机构 * Stony Brook University(石溪大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 Memento通过捕捉用户语音查询及时空活动上下文,主动关联兴趣与情境,利用AR实现日常记忆的持续可视化,提升沉浸式应用体验。

Comments 8 pages, 5 figures. This is the author's version of the article that appeared at the IEEE Conference on Virtual Reality and 3D User Interfaces Abstracts and Workshops (IEEE VRW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏