arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-27 至 2026-04-27 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 6 篇

2507.09028 2026-04-27 q-bio.QM cs.AI 83%

From Classical Machine Learning to Emerging Foundation Models: Review on Multimodal Data Integration for Cancer Research

从经典机器学习到新兴基础模型:癌症研究中多模态数据整合的综述

Amgad Muneer, Muhammad Waqas, Maliazurina B Saad, Eman Showkatian, Rukhmini Bandyopadhyay, Hui Xu, Wentao Li, Joe Y Chang, Zhongxing Liao, Cara Haymaker, Luisa Solis Soto, Carol C Wu, Natalie I Vokes, Xiuning Le, Lauren A Byers, Don L Gibbons, John V Heymach, Jianjun Zhang, Jia Wu

机构 * Department of Imaging Physics, The University of Texas MD Anderson Cancer Center(影像物理系,德克萨斯大学MD安德森癌症中心) Department of Thoracic/Head and Neck Medical Oncology, The University of Texas MD Anderson Cancer Center(胸腔/头颈医学肿瘤科,德克萨斯大学MD安德森癌症中心) Department of Thoracic Radiation Oncology, The University of Texas MD Anderson Cancer Center(胸腔放射肿瘤科,德克萨斯大学MD安德森癌症中心) Department of Translational Molecular Pathology, The University of Texas MD Anderson Cancer Center(转化分子病理学系,德克萨斯大学MD安德森癌症中心) Department of Thoracic Imaging, The University of Texas MD Anderson Cancer Center(胸腔影像科,德克萨斯大学MD安德森癌症中心)

专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文综述了多模态数据整合在癌症研究中的应用,探讨了传统机器学习向基础模型转变的趋势,以及多组学与先进影像数据整合的最新方法和挑战。

Comments 10 figures, 5 tables

Journal ref Artificial Intelligence Review 59, 119 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22212 2026-04-27 eess.IV cs.CV cs.LG 79%

Multimodal Diffusion to Mutually Enhance Polarized Light and Low Resolution EBSD Data

多模态扩散用于互为增强的偏振光与低分辨率EBSD数据

Harry Dong, Timofey Efimov, Megna Shah, Jeff Simmons, Sean Donegan, Marc De Graef, Yuejie Chi

机构 * Carnegie Mellon University(卡内基梅隆大学) Air Force Research Laboratory(空军研究实验室) Yale University(耶鲁大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态扩散模型,通过结合偏振光和低分辨率EBSD数据,提升数据收集效率,实现颗粒边界预测、超分辨率和去噪等任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01650 2026-04-27 cs.HC cs.AI 79%

AromaGen: Interactive Generation of Rich Olfactory Experiences with Multimodal Language Models

AromaGen:基于多模态语言模型的交互式丰富嗅觉体验生成

Yunge Wen, Awu Chen, Jianing Yu, Jas Brooks, Hiroshi Ishii, Paul Pu Liang

机构 * MIT Media Lab(MIT媒体实验室) Harvard Graduate School of Design(哈佛设计研究生院) MIT CSAIL(MIT计算机科学与人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 AromaGen利用多模态语言模型实现基于文本和视觉输入的实时嗅觉生成,通过迭代优化提升嗅觉混合物的自然度,达到与真实食物香气相似的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19858 2026-04-27 cs.CV 57%

Wan-Image: Pushing the Boundaries of Generative Visual Intelligence

Wan-Image:推动生成视觉智能的边界

Chaojie Mao, Chen-Wei Xie, Chongyang Zhong, Haoyou Deng, Jiaxing Zhao, Jie Xiao, Jinbo Xing, Jingfeng Zhang, Jingren Zhou, Jingyi Zhang, Jun Dan, Kai Zhu, Kang Zhao, Keyu Yan, Minghui Chen, Pandeng Li, Shuangle Chen, Tong Shen, Yu Liu, Yue Jiang, Yulin Pan, Yuxiang Tuo, Zeyinzi Jiang, Zhen Han, Ang Wang, Bang Zhang, Baole Ai, Bin Wen, Boang Feng, Feiwu Yu, Gang Wang, Haiming Zhao, He Kang, Jianjing Xiang, Jianyuan Zeng, Jinkai Wang, Junjie Zhou, Ke Sun, Linqian Wu, Pei Gong, Pingyu Wu, Ruiwen Wu, Tongtong Su, Wenmeng Zhou, Wenting Shen, Wenyuan Yu, Xianjun Xu, Xiaoming Huang, Xiejie Shen, Xin Xu, Yan Kou, Yangyu Lv, Yifan Zhai, Yitong Huang, Yun Zheng, Yuntao Hong, Zhe Zhang, Zhicheng Zhang

机构 * Wan Team(万团队) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 Wan-Image通过统一多模态架构和大规模数据训练,实现从随意生成到专业级视觉工具的转变,具备超长文本渲染、多主体身份保持等专业能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21977 2026-04-27 cs.CV 57%

When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign Adapters

当LoRA背叛时:通过伪装成无害适配器对文本到图像模型进行后门攻击

Liangwei Lyu, Jiaqi Xu, Jianwei Ding, Qiyao Deng

机构 * People’s Public Security University of China(中国人民公安大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 研究提出MasqLoRA攻击框架,通过独立LoRA模块在文本到图像扩散模型中隐蔽注入恶意行为,实验显示其攻击成功率高达99.8%。

Comments Accepted to CVPR 2026 main track(poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21898 2026-04-27 cs.RO cs.AI 57%

Flexible Multitask Learning with Factorized Diffusion Policy

灵活的多任务学习与因子化扩散策略

Chaoqi Liu, Haonan Chen, Sigmund H. Høeg, Shaoxiong Yao, Yunzhu Li, Kris Hauser, Yilun Du

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Norwegian University of Science and Technology(挪威科学与技术大学) Columbia University(哥伦比亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种因子化扩散策略框架,通过将复杂动作分布分解为多个专用扩散模型,提升多任务学习的灵活性和适应性,实验证明其在仿真和现实机器人任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏