arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-13 至 2026-05-13 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 8 篇

2605.11760 2026-05-13 cs.CV 79%

M$^4$-SAM: Multi-Modal Mixture-of-Experts with Memory-Augmented SAM for RGB-D Video Salient Object Detection

M$^4$-SAM:基于内存增强的SAM多模态混合专家用于RGB-D视频显著目标检测

Jiyuan Liu, Jia Lin, Xiaofei Zhou, Runmin Cong, Deyang Liu, Zhi Liu

机构 * Hangzhou Dianzi University(杭州电子科技大学) Shandong University(山东大学) Anqing Normal University(安庆师范学院) Shanghai University(上海大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 M$^4$-SAM通过引入模态感知MoE-LORA、分层特征融合和伪引导初始化,提升SAM2在RGB-D视频显著目标检测中的性能,实现零样本检测。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11675 2026-05-13 q-bio.QM q-bio.NC 78%

Accounting for Missed Events in the Bayesian Modeling of IP3R Multimodal Gating

在IP3R多模态门控的贝叶斯建模中考虑遗漏事件

Schayma Ben Marzougui, Audrey Denizot, Hugues Berry

专题命中 视频多模态 :multimodal(title);multi-modal(abstract)

AI总结 本文通过改进的贝叶斯方法分析IP3R门控行为,考虑遗漏事件对动力学模型的影响,揭示了多模态模型中Park和Drive模式的动力学差异及钙浓度对状态转换率的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05922 2026-05-13 cs.CV 77%

Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling

思考,然后评分:视频奖励建模中的解耦推理与评分

Yuan Wang, Ouxiang Li, Yulong Xu, Borui Liao, Jiajun Liang, Jinghan Li, Meng Wang, Xintao Wang, Pengfei Wan, Kuien Liu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出DeScore模型,通过解耦推理与评分机制提升视频奖励建模的泛化能力,结合冷启动和强化学习优化,实现更稳定的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12326 2026-05-13 cs.CL cs.AI cs.LG 62%

Reconstructing Sepsis Trajectories from Clinical Case Reports using LLMs: the Textual Time Series Corpus for Sepsis

利用大语言模型从临床病例报告中重建脓毒症轨迹:脓毒症的文本时间序列语料库

Shahriar Noroozizadeh, Jeremy C. Weiss

机构 * Machine Learning Department and Heinz College Carnegie Mellon University(卡内基梅隆大学机器学习系和海恩兹学院) National Library of Medicine National Institutes of Health(美国国家医学图书馆)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大语言模型构建脓毒症文本时间序列语料库,通过提取病例报告中的时间局部发现,验证了LLM在时间局部化方面的有效性,并指出多模态整合的改进方向。

Comments Conference on Health, Inference, and Learning (CHIL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11993 2026-05-13 cs.CL 57%

Towards Visually-Guided Movie Subtitle Translation for Indic Languages

面向视觉引导的电影字幕翻译:用于印地语等语言

Tarun Chintada, Kshetrimayum Boynao Singh, Asif Ekbal

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Indian Institute of Technology Patna(印度理工学院帕纳布分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文研究了视觉引导的电影字幕翻译,针对低资源印地语等语言,提出两种轻量视觉锚定策略,发现时间错位是长视频的主要障碍,而选择性视觉锚定能有效提升翻译质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11782 2026-05-13 cs.CV 57%

Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low Vision

面向低视力人群的基于VQA的事件地图城市风险感知导航

Antoni Valls, Jordi Sanchez-Riera

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息技术研究所,CSIC-UPC)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于视觉问答的事件地图框架,利用视觉语言模型进行行人场景描述和危险识别,通过三级查询结构实现细粒度场景理解,生成风险感知导航地图,验证多模态大语言模型在助视导航中的有效性。

Comments 10 pages, 6 figures, submitted to IEEE T-ITS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07552 2026-05-13 cs.CV 57%

VIMCAN: Visual-Inertial 3D Human Pose Estimation with Hybrid Mamba-Cross-Attention Network

VIMCAN: 基于混合Mamba-交叉注意力网络的视觉-惯性3D人体姿态估计

Zepeng Yang, Junxuan Bai, Hao Li, Ju Dai, Junjun Pan, Yongfeng Yin, Bin Li

机构 * Beihang University(北航) Peng Cheng Laboratory(鹏城实验室) Capital University of Physical Education and Sports(首都体育学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 VIMCAN结合Mamba的高效序列建模与交叉注意力的空间推理,实现RGB关键点与穿戴式IMU数据的鲁棒融合,取得更优精度和实时推理性能。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11120 2026-05-13 cs.IT cs.SY eess.SP eess.SY math.IT stat.ML 50%

Sensor Design for Accuracy-Bounded Estimation via Maximum-Entropy Likelihood Synthesis

通过最大熵似然合成实现精度受限的估计器设计

Raktim Bhattacharya

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出通过最大熵后验进行似然合成,以在给定误差预算下实现高精度估计,适用于时空系统的大规模传感架构设计。

详情

展开后加载摘要…

URL PDF HTML 收藏