arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-18 至 2026-05-18 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 13 篇

2605.16165 2026-05-18 cs.CV cs.AI 84%

Second-Order Multi-Level Variance Correction for Modality Competition in Multimodal Models

二阶多级方差校正用于多模态模型中的模态竞争

Yishun Lu, Wes Armour

机构 * University of Oxford, Oxford, United Kingdom(牛津大学,英国)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ML-FOP-SOAP框架,通过多级方差校正提升多模态对齐稳定性,实验显示在Janus和Emu3数据集上,该方法提高了样本效率和训练速度,适用于大规模多模态基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22151 2026-05-18 cs.CV cs.CL 81%

MultiMat: Multimodal Program Synthesis for Procedural Materials using Large Multimodal Models

MultiMat: 多模态程序合成用于基于过程的材料生成

Jonas Belouadi, Tamy Boubekeur, Adrien Kaiser

机构 * University of Mannheim(曼海姆大学) Adobe Research(Adobe研究)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 MultiMat利用大规模多模态模型实现多模态程序合成,提升生成过程材料图的效率与视觉质量,优于纯文本基线方法。

Comments Accepted at ICLR 2026 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15792 2026-05-18 cs.CV 79%

Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models

反向流动:大型多模态模型中的生成到理解协同效应

Yujun Tong, Dongliang Chang, Zijin Yin, Xintong Liu, Yuanchen Fang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Key Laboratory of Multimodal Data Intelligent Perception and Governance(北京多模态数据智能感知与治理重点实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出生成到理解协同效应,通过生成过程作为中间推理步骤提升多模态理解,揭示生成与理解的双向关系及模型自我反思的不足。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12309 2026-05-18 cs.CV 79%

G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models

G$^2$TR: 基于生成的视觉标记减少方法用于分离编码统一多模态模型

Junxian Li, Kai Liu, Zizhong Ding, Zhixin Wang, Zhikai Chen, Renjing Pei, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出G$^2$TR方法,通过生成分支信号减少多模态模型的视觉标记,提升效率并保持性能,实验显示在图像理解和编辑任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16104 2026-05-18 q-bio.GN q-bio.QM 78%

StateXDiff: Cell State-Contextualized Multimodal Diffusion for Single-Cell Perturbation Prediction

StateXDiff: 单细胞扰动预测的细胞状态-上下文化多模态扩散框架

Peiting Shi, Ningfeng Que, Xianzhe Huang, Xiaofei Wang, Jianzhong Jeff Xi

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 StateXDiff通过整合转录组与蛋白质特征,构建多模态细胞状态表示,并利用条件扩散模型生成药物扰动特异性变化,提升单细胞扰动预测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24550 2026-05-18 cs.LG cs.SD 78%

Training-Free Multimodal Guidance for Video to Audio Generation

无需训练的多模态引导用于视频到音频生成

Eleonora Grassucci, Giuliano Galadini, Giordano Cicchetti, Aurelio Uncini, Fabio Antonacci, Danilo Comminiello

机构 * Dept. of Information Engineering, Electronics, and Telecomm., Sapienza University of Rome, Italy(信息工程、电子与电信系,罗马大学萨皮恩扎)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出无需训练的多模态引导机制,用于视频到音频扩散生成,通过模态嵌入跨度强制视频、音频和文本的一致对齐,提升生成质量与多模态对齐效果。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14876 2026-05-18 cs.CV cs.AI 62%

Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning

通过闭环验证推理解锁复杂视觉生成

Hanbo Cheng, Limin Lin, Ruo Zhang, Yicheng Pan, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CLVR框架,结合视觉语言逻辑规划与像素级扩散生成,通过自动化数据引擎和PPRL解决多步推理中的优化问题,同时引入DSWM降低推理成本,实验表明其在多个基准上优于开源模型,实现了复杂视觉生成的扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02307 2026-05-18 cs.CV cs.AI 62%

NoiseShift: Resolution-Aware Noise Recalibration for Better Low-Resolution Image Generation

NoiseShift: 为更好的低分辨率图像生成的分辨率感知噪声校准

Ruozhen He, Moayed Haji-Ali, Ziyan Yang, Vicente Ordonez

机构 * Rice University(里士大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出NoiseShift,通过校准噪声条件以恢复局部正反向一致性,提升低分辨率图像生成质量,无需额外计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15843 2026-05-18 cs.CV 57%

WorldAct: Activating Monolithic 3D Worlds into Interactive-Ready Object-Centric Scenes

WorldAct:将单体3D世界激活为可交互的以对象为中心的场景

Jichen Hu, Jiawei Guo, Jiazhong Cen, Chen Yang, Sikuang Li, Wei Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Inc(华为公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 WorldAct通过多模态代理将静态生成的3D世界分解为可编辑的交互场景,支持对象级编辑和任务执行,保留全局一致性。

Comments Project page: https://sjtu-deepvisionlab.github.io/WorldAct

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12894 2026-05-18 cs.RO cs.CV 57%

Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning

稀疏动作生成:通过实时剪枝加速扩散策略

Kangye Ji, Jianbo Zhou, Yuan Meng, Ye Li, Hanyun Cui, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Computer Science(计算机科学系)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SAG方法,通过自适应剪枝和重用机制实现稀疏动作生成,提升实时视觉运动控制效率,实验显示生成速度提升4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15660 2026-05-18 cs.CV 57%

MaTe: Images Are All You Need for Material Transfer via Diffusion Transformer

MaTe:仅需图像进行材料迁移的扩散变换器

Nisha Huang, Henglin Liu, Yizhou Lin, Kaer Huang, Chubin Chen, Jie Guo, Tong-Yee Lee, Xiu Li

机构 * Tsinghua University(清华大学) PengCheng Laboratory(鹏城实验室) Lenovo Research(联想研究院) National Cheng-Kung University(国立成功大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 MaTe通过多模态注意力机制实现材料迁移,无需文本指导或辅助网络,提升了生成质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15243 2026-05-18 cs.LG cs.AI q-bio.BM q-bio.MN q-bio.QM 57%

Reading the Cell, Designing the Cure: Perturbation-Conditioned Molecular Diffusion for Function-Oriented Drug Design

解读细胞,设计治愈:基于扰动条件的分子扩散用于功能导向的药物设计

Ziyu Xu, Zijian Zhang, Liang Wang, Zhiyuan Liu, Qiang Liu, Shu Wu, Liang Wang

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学先进交叉学科学院) NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院) National University of Singapore, Singapore(新加坡国立大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出基于转录组的药物设计(TBDD)作为生成逆问题,通过多分辨率转录组引导扩散框架,结合转录组扰动功能特征提取器,实现功能导向的药物分子设计,验证了其在结构质量和功能一致性上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16164 2026-05-18 cs.LG 50%

Entropic Auto-Encoding via Implicit Free-Energy Minimization

通过隐式自由能最小化实现熵编码解码

Hazhir Aliahmadi, Irina Babayan, Greg van Anders

机构 * Department of Physics, Engineering Physics & Astronomy, Queen’s University(物理系、工程物理与天文学系、女王大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出熵编码解码框架,通过自由能最小化隐式生成潜在变量先验,解决变分自编码器的后验崩溃问题,实现非高斯多模态潜在分布学习。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏