arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-20 至 2026-03-20 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 10 篇

2603.18600 2026-03-20 cs.CV 83%

Improving Joint Audio-Video Generation with Cross-Modal Context Learning

通过跨模态上下文学习提升联合音频视频生成

Bingqi Ma, Linlong Lang, Ming Zhang, Dailan He, Xingtong Ge, Yi Zhang, Guanglu Song, Yu Liu

机构 * Vivix Group Limited(维维克斯集团有限公司)

专题命中 多模态生成 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出跨模态上下文学习方法,解决双流Transformer生成中模态交互不一致、训练不稳定等问题,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18505 2026-03-20 cs.CV 79%

From Snapshots to Symphonies: The Evolution of Protein Prediction from Static Structures to Generative Dynamics and Multimodal Interactions

从快照到交响曲:蛋白质预测从静态结构到生成动态和多模态交互的演变

Jingzhi Chen, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文综述了人工智能在蛋白质科学中的范式转变,探讨了多模态表示、静态预测优化、生成框架、异质相互作用预测及功能推断等核心方法,指出现存瓶颈并展望未来方向。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14615 2026-03-20 cs.RO 78%

Accelerated Multi-Modal Motion Planning Using Context-Conditioned Diffusion Models

利用上下文条件扩散模型加速多模态运动规划

Edward Sandra, Lander Vanroye, Dries Dirckx, Ruben Cartuyvels, Jan Swevers, Wilm Decré

机构 * Department of Mechanical Engineering, KU Leuven(卢森堡鲁文大学机械工程系) Department of Computer Science, KU Leuven(卢森堡鲁文大学计算机科学系)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出CAMPD模型,通过上下文感知的扩散模型实现高效的多模态运动规划,适用于多样场景且无需重新训练,展示出在未见环境中生成高质量轨迹的能力。

Comments Accepted for publication at the 2026 IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18896 2026-03-20 cs.CV cs.AI 62%

Translating MRI to PET through Conditional Diffusion Models with Enhanced Pathology Awareness

通过增强病理意识的条件扩散模型将MRI翻译为PET

Yitong Li, Igor Yakushev, Dennis M. Hedderich, Christian Wachinger

机构 * Lab for Artificial Intelligence in Medical Imaging, Institute for Diagnostic and Interventional Radiology, School of Medicine and Health, TUM Klinikum, Technical University of Munich (TUM)(人工智能医学成像实验室,诊断与介入放射学研究所,医学院与健康学院,TUM医院,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Nuclear Medicine, School of Medicine and Health(核医学系,医学院与健康学院) Department of Neuroradiology, School of Medicine and Health(神经放射学系,医学院与健康学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PASTA框架,利用条件扩散模型生成高质量3D PET图像,通过双臂架构和多模态条件整合提升结构与病理细节的保留,使合成PET在阿尔茨海默病诊断中性能优于MRI,接近真实PET。

Comments Accepted by Medical Image Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19232 2026-03-20 cs.CV 57%

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19053 2026-03-20 cs.CV cs.GR 57%

SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation

SwiftTailor: 基于几何图像表示的高效3D服装生成

Phuc Pham, Uy Dieu Tran, Binh-Son Hua, Phong Nguyen

机构 * Qualcomm AI Research(高通AI研究) Trinity College Dublin(都柏林大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SwiftTailor框架,通过紧凑的几何图像表示统一缝纫图案推理与几何网格合成,提升3D服装生成的效率与精度。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04614 2026-03-20 cs.CV 57%

HyperAlign: Hyperbolic Entailment Cones for Adaptive Text-to-Image Alignment Assessment

HyperAlign:基于双曲蕴含几何的自适应文本到图像对齐评估

Wenzhi Chen, Bo Hu, Leida Li, Lihuo He, Wen Lu, Xinbo Gao

机构 * Chongqing University of Posts and Telecommunications(重庆邮电大学) Xidian University(西安电子科技大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 HyperAlign基于双曲蕴含几何提出自适应文本到图像对齐评估框架,通过CLIP提取欧几里得特征并映射到双曲空间,设计动态监督蕴含建模机制和自适应调制回归器,实现对图像-文本对齐的高效评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19029 2026-03-20 cs.RO 50%

ATG-MoE: Autoregressive trajectory generation with mixture-of-experts for assembly skill learning

ATG-MoE:基于混合专家的自主轨迹生成用于装配技能学习

Weihang Huang, Chaoran Zhang, Xiaoxin Deng, Hao Zhou, Zhaobo Xu, Shubo Cui, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Faculty of Engineering, Imperial College London(伦敦帝国理工学院工程学院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出ATG-MoE,通过混合专家架构实现多技能整合,解决传统方法在多阶段设计和多技能整合能力上的不足,实验显示其在模拟和实际应用中均表现优异。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18771 2026-03-20 cs.RO 50%

Empathetic Motion Generation for Humanoid Educational Robots via Reasoning-Guided Vision--Language--Motion Diffusion Architecture

通过推理引导的视觉-语言-运动扩散架构生成 empathetic 动作 for 人类教育机器人

Fuze Sun, Lingyu Li, Lekan Dai, Xinyu Fan

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出RG-VLMD框架,通过多模态情感估计、教学推理和教学-动作条件运动合成,生成适应性且语义一致的机器人行为。实验表明,推理引导的指令条件生成提升了教育人机交互中的动作可控性和教学表达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18755 2026-03-20 math.AP 50%

Spreading of pathological proteins through brain networks: a case study for Alzheimers disease

病理蛋白通过脑网络的传播:阿尔茨海默病的案例研究

G. Landi, A. Scaravelli, M. C. Tesi, C. Testa

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过数学建模研究阿尔茨海默病中tau蛋白的传播,探讨不同网络框架对蛋白质动态的影响,并验证模型与临床数据的一致性。

Comments 23 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏