arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 502 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 502 篇

2607.28708 2026-08-03 cs.LG 新提交 78%

MMFGU: Multimodal Federated Graph Unlearning

MMFGU:多模态联邦图遗忘

Haodong Lu, Zekai Chen, Weiwei Ji, Shihao Li, Xunkai Li, Xun Wu, Yinlin Zhu, Rong-Hua Li

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对现有联邦图遗忘无法满足多模态细粒度遗忘请求的问题,提出MMFGU框架,通过目标特定表示解耦等技术解决三大挑战,实验显示其能有效移除请求信息并实现41.5倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28446 2026-07-31 cs.CE 新提交 78%

CoLAS: Multimodal Corroboration of Latent Asset Signals for Financial Trading

CoLAS:面向金融交易的潜在资产信号多模态确证

Yanzheng Jin, Pengyang Shao, Xiaohao Liu, Xi Ai, Fei Shen, Kenji Kawaguchi

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究针对金融交易中异构模态信号不可靠的问题,提出CoLAS多模态确证框架,通过增强共享分量与鲁棒一致性目标,在股票和加密货币数据集上实现年化收益率和夏普比率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24747 2026-07-29 cs.CR cs.HC 新提交 78%

Multimodal User Authentication Method via Fusion of Keystroke Dynamics and Glove-Based Hand Kinematics

通过击键动力学和基于手套的手部运动学融合的多模态用户认证方法

Issei Hyakuda, Lei Jing

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对击键动力学受环境影响问题,提出融合击键动力学与手部运动学的多模态认证框架,用定制手套捕获特征,经混合架构融合,通过“未见”评估协议验证,该方法能有效提升认证准确率,融合模态增强了生物识别辨别力。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24607 2026-07-28 cs.IR 新提交 78%

One Graph, Multiple Gains: Single High-Quality Item-Item Graph for Multimodal Recommendation

一图多益:用于多模态推荐的单个高质量物品-物品图

Jinfeng Xu, Zheyu Chen, Ziyue Peng, Shuo Yang, Jinze Li, Zewei Liu, Shujie Li, Yipeng Du, Edith C. H. Ngai

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究多模态推荐中物品-物品图构建及应用,提出IIMRec框架构建高质量图,通过融合信号和NCER优化,并在推荐三阶段重用,以RIG、内容引导UI图扩展、INA三种方式使用,实验证明其性能优于基线,冷启动等条件下效果更佳。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23370 2026-07-28 cs.LG cs.CE econ.EM stat.CO 新提交 78%

Bitcoin Price Direction Prediction via Regime-Aware Multi-Modal Fusion of Social Sentiment and Technical Features

通过社会情绪与技术特征的状态感知多模态融合预测比特币价格走势

Muhammad Abdullah Haroon

机构 * FAST National University of Computer and Emerging Sciences (FAST-NUCES)(快速国立计算机与新兴科学大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 研究比特币亚日价格预测难题,提出状态感知多模态学习(RAML)方法,依据市场状态动态融合社会情绪与技术特征,实验表明该方法在预测中表现良好,确立状态条件自适应融合为多模态金融预测的必要原则。

Comments 19 pages, 15 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20742 2026-07-24 cs.LG 新提交 78%

Adaptive Confidence-weighted Expansion for Trustworthy Multi-Omics Multimodal Fusion

用于可信多组学多模态融合的自适应置信加权扩展

Mohammad Raahemi, Ali Sekhavati, Alireza Maleki, Hamid Nasiri

机构 * Faculty of Engineering, University of Ottawa(渥太华大学工程学院) RIV Lab, Department of Computer Engineering, Bu-Ali Sina University(布阿里·西纳大学计算机工程系RIV实验室) School of Computing and Communications, Lancaster University(兰卡斯特大学计算与通信学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态学习模型在噪声或无信息数据流下性能不佳及缺乏数据质量评估机制的问题,提出自适应置信加权扩展(ACE)框架,通过生成互补模态和双层置信机制提升性能,在多组学数据集评估中显著优于现有算法。

Comments Accepted for publication in the proceedings of the International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18897 2026-07-22 eess.IV 新提交 78%

Thinking Fast, Thinking Slow: Adaptive Multimodal Transformer-based Sensor Fusion for Depth Estimation on Ultra-low-power MCUs

快速思考,慢速思考:基于自适应多模态Transformer的超低功耗MCU深度估计传感器融合

Luca Crupi, Lorenzo Lamberti, Giovanni Badaracco, Daniele Allegri, Alessandro Giusti, Daniele Palossi

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对超低功耗MCU深度估计问题,提出结合多模态传感器融合与轻量级基于循环Transformer架构的自适应方法,通过令牌传播和增量传感器利用机制平衡能耗与精度,实验证明该方法节能且精度提升显著。

Comments 16 pages, 9 figures, 6 tables. This paper has been accepted for publication in the IEEE Sensors Journal Copyright 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16789 2026-07-21 cs.LG 新提交 78%

MultiLoReFT: Decoupling Shared and Modality-Specific Subspaces in Multimodal Learning via Low-Rank Representation Fine-Tuning

MultiLoReFT:通过低秩表示微调在多模态学习中解耦共享和特定模态子空间

Sana Tonekaboni, Viktoria Schuster, Caroline Uhler

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对多模态模型训练障碍,提出MultiLoReFT框架,通过低秩表示微调,将低秩适应扩展到多模态,学习可解释投影子空间解耦信息,能在多模态预测时揭示信息分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13466 2026-07-16 cs.LG quant-ph 新提交 78%

PQFA: Parallel Quantum Feature Augmentation of Fused Representations for Multimodal Classification

PQFA:用于多模态分类的融合表示的并行量子特征增强

Mingzhu Wang, Yun Shang

机构 * AMSS(中国科学院数学与系统科学研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究多模态学习中后融合增强问题,提出并行量子特征增强框架PQFA,将其应用于融合特征,经多种处理后幅度编码到量子电路预测。实验表明PQFA性能优、参数效率高,是混合量子 - 经典多模态学习后融合增强的有效策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11102 2026-07-14 cs.SD 新提交 78%

CHARM: Charge Calibration and Acoustic Rescue for LLM-based Multimodal Sarcasm Detection

CHARM:基于大语言模型的多模态讽刺检测中的电荷校准与声学救援

Qiyang Sun, Yi Chang, Yupei Li, Xi Shao, Zixing Zhang, Björn W. Schuller

机构 * GLAM – the Group on Language, Audio, & Music, Imperial College London(伦敦帝国理工学院语言、音频和音乐小组) College of Telecommunications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Shenzhen Research Institute, Hunan University(湖南大学深圳研究院) CHI – Chair of Health Informatics, TUM University Hospital(慕尼黑工业大学医院健康信息学主席) relAI – the Konrad Zuse School of Excellence in Reliable AI(康拉德·楚泽可靠人工智能卓越学院) MDSI – Munich Data Science Institute(慕尼黑数据科学研究所) MCML – Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对大语言模型在讽刺检测中过度预测积极类别及韵律线索利用不足的问题,提出CHARM框架,含双向电荷校准和声学后期融合救援两个模块,无需微调主干,提升检测性能,揭示跨文化韵律解耦,产生可解释的跨语言多模态检测器。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10532 2026-07-14 cs.IR 新提交 78%

Implicit Fine-tuning via Context Engineering: A Curriculum Learning Framework for Multimodal Entity Alignment

通过上下文工程进行隐式微调:多模态实体对齐的课程学习框架

Yunpeng Hong, Chenyang Bu, Di Wu, Yi He, Xindong Wu

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究多模态实体对齐问题,提出PTFEA课程学习框架,通过自适应难度调制和三阶段渐进推理将微调策略转化为上下文工程,实验证明该框架性能优越,提供了统一上下文工程和微调的理论框架。

Comments Accepted by KDD 2026

Journal ref SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09515 2026-07-13 cs.RO 新提交 78%

One-Shot Multimodal Learning from Demonstration with Force-Constrained Elastic Maps

基于力约束弹性映射的一次性多模态示范学习

Brendan Hertel, Jonathan Spanos, Navya Garg, Reza Azadeh

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多数示范学习方法忽视力与环境相互作用的问题,提出一次性多模态LfD框架。通过多模态概率分割提取力感知运动原语,扩展弹性映射表示并结合外力约束学习轨迹模型,经实验验证该方法具有多模态分割、力感知再现及跨平台通用性。

Comments 8 pages, 6 figures, 4 tables. Accepted for publication at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05736 2026-07-08 cs.LG 新提交 78%

Multimodal Molecular Representation Learning with Graph Neural Networks, Deep & Cross Networks, and SMILES Embeddings

基于图神经网络、深度交叉网络和SMILES嵌入的多模态分子表示学习

Qiwei Han, Chi Zhou, Ruobing Wang, Zheng Ma

机构 * Duke University(杜克大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对分子性质预测难题,提出三分支模块化融合神经网络,综合三种模态数据,经后期融合架构建立多模态潜在空间,在QM9基准测试中表现出色,降低误差,为高通量虚拟筛选提供高效模型。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03111 2026-07-07 eess.SP 新提交 78%

Edge-Assisted Multimodal UAV Localization with Resource-Efficient Compression and Robust Fusion

基于资源高效压缩和鲁棒融合的边缘辅助多模态无人机定位

Zhong Ye, Yinghui He, Guanding Yu, Pavel Loskot

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 设计多模态无人机定位框架,利用相机、LiDAR和雷达传感模态。通过信息瓶颈压缩等模块应对传感节点资源有限、数据差异大及模态数据退化缺失等挑战,实验表明该框架能准确可靠定位无人机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03099 2026-07-07 eess.IV eess.SP 新提交 78%

AirTF: Over-the-Air Token Fusion for Task-Oriented Multi-Modal Token Communications

AirTF:面向任务的多模态令牌通信的空中令牌融合

Bole Liu, Li Qiao, Minghui Wu, Yulin Shao, Zhen Gao

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 针对车联网中高维多模态传感数据传输面临的频谱瓶颈,提出AirTF框架。利用视觉变压器编码器提取语义令牌,通过共享无线信道并发传输,利用多址信道叠加特性空中融合多模态语义,提升频谱效率。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03520 2026-07-07 cs.IT cs.NI eess.SP math.IT 新提交 78%

ATS-ToDMA: Adaptive Token Selection and Token-Domain Multiple Access for Cross-Modal Semantic Communications

ATS-ToDMA:用于跨模态语义通信的自适应令牌选择和令牌域多址接入

Sachin Kadam, Dong In Kim

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 针对语义通信系统效率问题,提出ATS-ToDMA框架,通过联合进行语义令牌选择、干扰感知调度和语义感知功率分配,引入SSINR指标,开发调度器,推导分析边界,相比基准有性能提升。

Comments 13 pages, 9 figures. Submitted to a journal, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01821 2026-07-03 stat.ME 新提交 78%

Pattern-Calibrated Multimodal Prediction under Blockwise Missingness

分块缺失下的模式校准多模态预测

Junhan Yu, Kejian Zhang, Doudou Zhou, Guojun Zhu

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态数据分块缺失问题,提出MOSAIC框架,通过共享与特定模态表示学习及跨模式校准,在不混淆预测规则的前提下实现跨缺失模式信息借用,理论证明误差分解并验证其在有限目标样本或规则差异场景下的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01656 2026-07-03 cs.LG 新提交 78%

CALM: Interpretable Cross-Modal Alignment for Biomarker Discovery from Unpaired Data

CALM: 可解释的跨模态对齐用于从非配对数据中发现生物标志物

Jueqi Wang, Zachary Jacokes, John Darrell Van Horn, Kevin A. Pelphrey, Michael C. Schatz, Archana Venkataraman

机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院) Department of Psychology, University of Virginia(弗吉尼亚大学心理学系) Department of Neurology, University of Virginia(弗吉尼亚大学神经病学系) Departments of Computer Science and Biology, Johns Hopkins University(约翰霍普金斯大学计算机科学与生物学系)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 提出CALM框架,通过线性投影对齐脑区和遗传通路的潜在分布,从完全不相交的人群中学习可解释的跨模态关联,在自闭症谱系障碍数据上优于现有方法。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32016 2026-07-01 cs.LG 新提交 78%

FedLAB: Traceable Semantic Codebooks for Federated Multimodal Graph Foundation Learning

FedLAB: 面向联邦多模态图基础学习的可追踪语义码本

Zekai Chen, Kairui Yang, Xuaner Chen, Xunkai Li, Xun Wu, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出FedLAB框架,通过类型化分层码本组织模态证据、节点语义和拓扑上下文,实现联邦多模态图学习中的可追踪语义,在10个基准和6个下游任务上提升达7.53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25865 2026-06-25 q-bio.BM 新提交 78%

Molexar: A Unified Multimodal Molecular Foundation Model for Drug Design

Molexar:用于药物设计的统一多模态分子基础模型

Haoyu Lin, Yiyan Liao, Jinmei Pan, Xinliao Ling, Luhua Lai, Jianfeng Pei

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出Molexar,一种基于Fragment-SELFIES的统一多模态分子基础模型,通过自回归解码和条件注入实现高效分子生成,在多个任务上达到或超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25796 2026-06-25 cs.RO 新提交 78%

MIL-LC: A Robust Magnetometer-Inertial-LiDAR Fusion Multimodal Localization Framework

MIL-LC:一种鲁棒的磁力计-惯性-LiDAR融合多模态定位框架

Qiyang Lyu, Zhenyu Wu, Wei Wang, Hongming Shen, Danwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Centre for Advanced Robotics Technology Innovation (CARTIN)(先进机器人技术创新中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出MIL-LC框架,融合磁力计、惯性和LiDAR,解决GNSS缺失、几何重复或无纹理环境下的定位问题,通过磁地图与LiDAR退化检测实现鲁棒定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20757 2026-06-23 cs.LG 新提交 78%

Evidential Fusion Network for Multimodal Survival Prediction under Missing Modalities

缺失模态下的多模态生存预测证据融合网络

Yucheng Xing, Hailan Mo, Zi Wang, Ling Huang, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Imperial College London(帝国理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出EMMS模型,利用Dempster-Shafer理论和高斯随机模糊数融合多模态决策,处理缺失模态下的生存预测,无需生成缺失数据,在四个癌症数据集上达到最优性能并提供校准的不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20037 2026-06-19 cs.LG 新提交 78%

Alzheimer's Disease Diagnosis using a Multimodal Approach with 3D MRI and PET

使用3D MRI和PET的多模态方法诊断阿尔茨海默病

Loukas Ilias, Anthi-Maria Vozinaki, Christos Ntanos, Dimitris Askounis

机构 * DSS Lab, School of ECE, NTUA(NTUA ECE学院DSS实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出结合3D卷积特征提取器与三种融合策略(拼接、门控多模态单元、门控自注意力)及稀疏门控混合专家分类器的多模态模型,用于阿尔茨海默病诊断,在三个二分类任务上验证了输入自适应建模的有效性。

Comments 2025 IEEE International Conference on Bioinformatics and Biomedicine (BIBM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18436 2026-06-19 stat.ML cs.LG 新提交 78%

Pointwise is Pointless? A Multimodal Ablation Study for Precipitation Nowcasting with Graph Neural Networks

逐点是否无意义?基于图神经网络的降水临近预报的多模态消融研究

Ophélia Miralles, Máté Mile, Christoffer Artturi, Thomas Nipen, Ivar Seierstad

机构 * Norwegian Meteorological Institute(挪威气象研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本研究通过多模态图神经网络系统,消融分析雷达、数值预报、地面观测、卫星数据及训练损失对降水临近预报的影响,发现各模态分别改善不同方面,点观测虽提升局部但需结合损失函数和不确定性表示才能优化雷达场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18390 2026-06-18 cs.LG q-bio.QM 新提交 78%

MOLAR: Learning Multimodal Molecular Representations from Noisy Labels

MOLAR: 从噪声标签中学习多模态分子表示

Yingxu Wang, Kunyu Zhang, Nan Yin, Yu Li, Eran Segal

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zhengzhou University(郑州大学) The Education University of Hong Kong(香港教育大学) The Chinese University of Hong Kong(香港中文大学) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出MOLAR框架,通过分离干净属性推断与标签观测,利用图与文本模态的残差证据,从噪声标签中学习多模态分子表示,在自然噪声和标签翻转基准上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17741 2026-06-17 eess.SY cs.HC cs.SY 新提交 78%

A Wearable Multimodal Ultrasound+Inertial System for Real-Time Virtual Reality Interaction

用于实时虚拟现实交互的可穿戴多模态超声+惯性系统

Giusy Spacone, Sebastian Frey, Enzo Baraldi, Mattia Orlandi, Luca Benini, Andrea Cossettini

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出基于前臂和上臂超声与惯性传感的完全可穿戴多模态接口,结合WULPUS平台和Unity VR环境,通过多模态学习实现手部姿态和前臂位置估计,在三个任务中在线成功率超88%。

Comments 8 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12863 2026-06-17 cs.LG 新提交 78%

Multimodal Graph Negative Learning

多模态图负学习

Zhengyu Wu, Xu Wang, Hongchao Qin, Xunkai Li, Guang Zeng, Rong-Hua Li, Guoren Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出GraphMNL框架,通过负学习解决多模态属性图中节点级分支语义不平衡问题,避免主导分支偏差传播,在Grocery和Reddit M数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10759 2026-06-17 cs.IR 新提交 78%

miniReranker: Efficient Multimodal Reranking through Visual Cache Reuse and Interaction Sparsity

miniReranker: 通过视觉缓存重用和交互稀疏性实现高效多模态重排序

Yingqi Fan, Xuan Lu, Anhao Zhao, Junlong Tong, Ping Nie, Kai Zou, Yunpu Ma, Wei Zhang, Xiaoyu Shen

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出miniReranker,通过视觉优先格式、早期退出、窄交互带和嵌入器引导剪枝,将重排序运行时间降至密集实现的1%以下,同时保持96%以上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09770 2026-06-17 q-bio.NC cs.LG 新提交 78%

Discovering Functionally Selective Brain Regions with a Deep Topographic Multimodal Model

发现功能选择性脑区:一种深度地形多模态模型

Badr AlKhamissi, Johannes Mehrer, Lara Marinov, Ahmed Abdelaal, Abdulkadir Gokce, Martin Schrimpf

机构 * University of California, Berkeley(加州大学伯克利分校) Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出Topo-Omni模型,通过空间平滑微调预训练基础模型,在单一连续虚拟皮层上整合视觉、听觉和语言/认知处理,产生与人类神经影像一致的多模态聚类,并用于发现新脑区。

Comments Preprint. First two author contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13381 2026-06-12 cs.LG 新提交 78%

Hölder++: Improving the Quality-Coherence Trade-off in Multimodal VAEs

Hölder++:改进多模态VAE中的质量-一致性权衡

Huyen Vo, María Martínez-García, Isabel Valera

机构 * Hölder++: Improving the Quality-Coherence Trade-off in Multimodal VAEs Supplementary Material(Hölder++:多模态VAE中质量与一致性权衡的改进补充材料)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态VAE生成质量与语义一致性之间的权衡问题,提出Hölder++,通过精确Hölder池化、扩展架构和层次推理,在提升一致性的同时保持生成质量。

Comments Accepted at ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏