arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-23 至 2026-04-23 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 6 篇

2604.18570 2026-04-23 cs.LG cs.AI cs.CL 81%

A multimodal and temporal foundation model for virtual patient representations at healthcare system scale

面向医疗系统规模的多模态与时间基础模型:虚拟患者表示

Andrew Zhang, Tong Ding, Sophia J. Wagner, Caiwei Tian, Ming Y. Lu, Rowland Pettit, Joshua E. Lewis, Alexandre Misrahi, Dandan Mo, Long Phi Le, Faisal Mahmood

机构 * Department of Pathology, Mass General Brigham, Harvard Medical School(病理学系,马萨诸塞州总医院与哈佛医学院) Cancer Program, Broad Institute of Harvard and MIT(癌症计划,哈佛-麻省理工Broad研究所) Data Science Program, Dana-Farber Cancer Institute(数据科学计划,达纳-法伯癌症研究所) Health Sciences and Technology, Harvard-MIT(健康科学与技术,哈佛-麻省理工) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛约翰·A·保罗森工程与应用科学学院,哈佛大学) Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(电气工程与计算机科学,麻省理工学院(MIT)) School of Computer and Communication Sciences, EPFL, Lausanne, Switzerland(计算机与通信科学学院,EPFL,瑞士洛桑)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Apollo模型,整合多模态和时间信息,构建虚拟患者表示,用于预测疾病风险、治疗反应等,展示其在医疗计算中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10417 2026-04-23 cs.CV cs.AI cs.LG 81%

Combo-Gait: Unified Transformer Framework for Multi-Modal Gait Recognition and Attribute Analysis

Combo-Gait:多模态和多任务框架用于多模态步态识别与属性分析

Zhao-Yang Wang, Zhimin Shao, Anirudh Nanduri, Basudha Pal, Laura McDaniel, Jieneng Chen, Rama Chellappa

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Maryland(马里兰大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出结合2D时间轮廓与3D SMPL特征的多模态框架,实现步态识别与年龄、BMI、性别等属性估计,通过统一Transformer融合多模态特征,提升鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07295 2026-04-23 cs.RO cs.AI 79%

Learning Multi-Modal Whole-Body Control for Real-World Humanoid Robots

多模态全身控制学习用于现实世界的人形机器人

Pranay Dugar, Aayam Shrestha, Fangzhou Yu, Bart van Marum, Alan Fern

机构 * Collaborative Robotics and Intelligent Systems Institute (CoRIS)(协同机器人与智能系统研究所)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出了一种多模态全身控制器,通过统一接口实现多样化的人形机器人行为控制,展示了在仿真和真实世界中的有效性。

Comments Website: https://masked-humanoid.github.io/mhc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20119 2026-04-23 cs.HC 78%

Zeitgeist-Aware Multimodal (ZAM) Datasets of Pro-Eating Disorder Short-Form Videos: An Idea Worth Researching

具有时间意识的多模态(ZAM)数据集:关于促进进食障碍短视频的研究想法

Eden Shaveet, Zefan Sramek, Yumi Hamamoto, Jing Du, Scott Griffiths, Thalia Zhang, Thalia Viranda, William Hornby, Flora Salim, Koji Yatani, Tanzeem Choudhury

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出ZAM数据集,旨在解决现有方法在识别促进进食障碍内容时的局限性,通过动态更新的多模态数据支持实时研究和模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15560 2026-04-23 astro-ph.EP astro-ph.IM cs.LG 78%

ExoNet: Calibrated Multimodal Deep Learning for TESS Exoplanet Candidate Vetting using Phase-Folded Light Curves, Stellar Parameters, and Multi-Head Attention

ExoNet:基于相位折叠光变曲线、恒星参数和多头注意力的校准多模态深度学习用于TESS行星候选体验证

Md. Rashadul Islam

机构 * Daffodil International University(达芙果国际大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 ExoNet通过融合相位折叠光变曲线、恒星参数和多头注意力机制,提升TESS行星候选体验证的准确率,实现高置信度信号和适居带候选体的识别。

Comments v2: Complete revision. Corrected systematic TOI/TIC cross-identification errors present in v1. Rebuilt inference pipeline using verified NASA Exoplanet Archive catalog (4,720 PC-disposition candidates, up from 200). Updated all results, figures, and performance metrics. 8 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20136 2026-04-23 cs.CV cs.AI 62%

IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory

IMPACT-CYCLE:一种基于合同的多智能体系统,用于长视频语义记忆的层次级监督修正

Weitong Kong, Di Wen, Kunyu Peng, David Schneider, Zeyun Zhong, Alexander Jaus, Zdravko Marinov, Jiale Wei, Ruiping Liu, Junwei Zheng, Yufan Chen, Lei Qi, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) INSAIT ETH Zurich(苏黎世联邦理工学院) Technical University of Munich(慕尼黑技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IMPACT-CYCLE,通过多智能体系统实现长视频语义记忆的层次级监督修正,提升下游推理性能并降低人工仲裁成本。

Comments 7 pages, 2 figures, code are available at https://github.com/MKong17/IMPACT_CYCLE

详情

展开后加载摘要…

URL PDF HTML 收藏