arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-09 至 2026-04-09 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 8 篇

2604.04614 2026-04-09 cs.LG cs.AI 79%

A Clinical Point Cloud Paradigm for In-Hospital Mortality Prediction from Multi-Level Incomplete Multimodal EHRs

一种用于院内死亡预测的临床点云范式:从多级不完整多模态电子健康记录

Bohao Li, Tao Zou, Junchen Ye, Yan Gong, Bowen Du

机构 * Beihang University(北京航空航天大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出HealthPoint范式,通过统一的4D空间表示多级不完整多模态EHRs,引入低秩关系注意力机制和分层交互策略,实现灵活的事件级交互与细粒度自监督,提升模态恢复和未标记数据利用效率,实验表明其在风险预测中性能优异。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06697 2026-04-09 eess.SP 78%

Heterogeneous Mixture-of-Experts for Energy-Efficient Multimodal ISAC in Highly Mobile Networks

异构专家混合模型用于高移动网络中高效多模态ISAC

Wenqi Fan, Ning Wei, Rongyan Xi, Ahmad Bazzi, Yue Xiu, Chadi Assi, Jing Dong, Jing Jin

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出异构混合专家架构,解决高移动网络中多模态传感与毫米波通信的能耗与可靠性平衡问题,通过强化学习实现高效事件触发传感策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06417 2026-04-09 stat.CO 78%

Niching Importance Sampling for Multi-modal Rare-event Simulation

多模态稀有事件模拟中的 niching 重要性抽样

Hugh J. Kinnear, F. A. DiazDelaO

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 本文提出 niching 重要性抽样框架,结合可靠性分析和进化多模态优化技术,提高故障概率估计的鲁棒性,有效应对可靠性问题的几何挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06789 2026-04-09 cs.CV cs.CL 73%

Video-guided Machine Translation with Global Video Context

基于全局视频上下文的视频引导机器翻译

Jian Chen, JinZe Lv, Zi Long, XiangHua Fu

机构 * Shenzhen University(深圳大学) Shenzhen Technology University(深圳技术大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出一种全局视频引导的多模态翻译框架,通过预训练语义编码器和向量数据库实现视频片段与字幕的语义关联,结合注意力机制提升翻译效果,在大规模纪录片数据集上验证了其在长视频场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06204 2026-04-09 cs.CL cs.AI cs.HC 62%

SensorPersona: An LLM-Empowered System for Continual Persona Extraction from Longitudinal Mobile Sensor Streams

SensorPersona: 一种基于大语言模型的持续性人设提取系统,用于从长期移动传感器流中无感获取

Bufang Yang, Lilin Xu, Yixuan Li, Kaiwei Liu, Xiaofan Jiang, Zhenyu Yan

机构 * The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SensorPersona系统,通过多模态长期传感器流持续提取稳定用户人设,提升LLM代理的个性化响应质量。系统通过上下文编码、分层人设推理和自适应更新,实现对物理行为、心理特质和生活经验的全面分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20765 2026-04-09 cs.CV cs.AI 62%

Looking Beyond the Obvious: A Survey on Abstract Concept Recognition for Video Understanding

超越显而易见:视频理解中抽象概念识别的综述

Gowreesh Mago, Pascal Mettes, Stevan Rudinac

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了视频理解中抽象概念识别的挑战与方法,强调基础模型的进步对高阶抽象理解的重要性,指出需结合多模态基础模型避免重复发明轮子。

Comments Accepted at IJCV

Journal ref International Journal of Computer Vision 134, 217 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08334 2026-04-09 cs.CL cs.AI cs.LG cs.MA 62%

Exploring Natural Language-Based Strategies for Efficient Number Learning in Children through Reinforcement Learning

探索基于自然语言的策略以通过强化学习高效学习儿童数字

Tirthankar Mittra

机构 * Univeristy Of Colorado, Boulder(科罗拉多大学博尔德分校)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过强化学习框架研究儿童如何使用十进制积木组成数字,发现明确动作指导的指令更有效,并提出有效的教学课程以加速收敛和提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06330 2026-04-09 cs.CL 57%

STDec: Spatio-Temporal Stability Guided Decoding for dLLMs

STDec:基于时空稳定性的解码方法用于dLLMs

Yuzhe Chen, Jiale Cao, Xuyang Liu, Jin Xie, Aiping Yang, Yanwei Pang

机构 * Tianjin University(天津大学) Sichuan University(四川大学) Chongqing University(重庆大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 STDec通过结合空间和时间稳定性,改进dLLM解码,提升吞吐量并保持性能。

Comments Homepage: https://yzchen02.github.io/STDec

详情

展开后加载摘要…

URL PDF HTML 收藏