arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6897 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6897 篇

2607.03111 2026-07-07 eess.SP 新提交 78%

Edge-Assisted Multimodal UAV Localization with Resource-Efficient Compression and Robust Fusion

基于资源高效压缩和鲁棒融合的边缘辅助多模态无人机定位

Zhong Ye, Yinghui He, Guanding Yu, Pavel Loskot

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 设计多模态无人机定位框架,利用相机、LiDAR和雷达传感模态。通过信息瓶颈压缩等模块应对传感节点资源有限、数据差异大及模态数据退化缺失等挑战,实验表明该框架能准确可靠定位无人机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03099 2026-07-07 eess.IV eess.SP 新提交 78%

AirTF: Over-the-Air Token Fusion for Task-Oriented Multi-Modal Token Communications

AirTF:面向任务的多模态令牌通信的空中令牌融合

Bole Liu, Li Qiao, Minghui Wu, Yulin Shao, Zhen Gao

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 针对车联网中高维多模态传感数据传输面临的频谱瓶颈,提出AirTF框架。利用视觉变压器编码器提取语义令牌,通过共享无线信道并发传输,利用多址信道叠加特性空中融合多模态语义,提升频谱效率。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03520 2026-07-07 cs.IT cs.NI eess.SP math.IT 新提交 78%

ATS-ToDMA: Adaptive Token Selection and Token-Domain Multiple Access for Cross-Modal Semantic Communications

ATS-ToDMA:用于跨模态语义通信的自适应令牌选择和令牌域多址接入

Sachin Kadam, Dong In Kim

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 针对语义通信系统效率问题,提出ATS-ToDMA框架,通过联合进行语义令牌选择、干扰感知调度和语义感知功率分配,引入SSINR指标,开发调度器,推导分析边界,相比基准有性能提升。

Comments 13 pages, 9 figures. Submitted to a journal, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01821 2026-07-03 stat.ME 新提交 78%

Pattern-Calibrated Multimodal Prediction under Blockwise Missingness

分块缺失下的模式校准多模态预测

Junhan Yu, Kejian Zhang, Doudou Zhou, Guojun Zhu

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态数据分块缺失问题,提出MOSAIC框架,通过共享与特定模态表示学习及跨模式校准,在不混淆预测规则的前提下实现跨缺失模式信息借用,理论证明误差分解并验证其在有限目标样本或规则差异场景下的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01656 2026-07-03 cs.LG 新提交 78%

CALM: Interpretable Cross-Modal Alignment for Biomarker Discovery from Unpaired Data

CALM: 可解释的跨模态对齐用于从非配对数据中发现生物标志物

Jueqi Wang, Zachary Jacokes, John Darrell Van Horn, Kevin A. Pelphrey, Michael C. Schatz, Archana Venkataraman

机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院) Department of Psychology, University of Virginia(弗吉尼亚大学心理学系) Department of Neurology, University of Virginia(弗吉尼亚大学神经病学系) Departments of Computer Science and Biology, Johns Hopkins University(约翰霍普金斯大学计算机科学与生物学系)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 提出CALM框架,通过线性投影对齐脑区和遗传通路的潜在分布,从完全不相交的人群中学习可解释的跨模态关联,在自闭症谱系障碍数据上优于现有方法。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32016 2026-07-01 cs.LG 新提交 78%

FedLAB: Traceable Semantic Codebooks for Federated Multimodal Graph Foundation Learning

FedLAB: 面向联邦多模态图基础学习的可追踪语义码本

Zekai Chen, Kairui Yang, Xuaner Chen, Xunkai Li, Xun Wu, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出FedLAB框架,通过类型化分层码本组织模态证据、节点语义和拓扑上下文,实现联邦多模态图学习中的可追踪语义,在10个基准和6个下游任务上提升达7.53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25865 2026-06-25 q-bio.BM 新提交 78%

Molexar: A Unified Multimodal Molecular Foundation Model for Drug Design

Molexar:用于药物设计的统一多模态分子基础模型

Haoyu Lin, Yiyan Liao, Jinmei Pan, Xinliao Ling, Luhua Lai, Jianfeng Pei

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出Molexar,一种基于Fragment-SELFIES的统一多模态分子基础模型,通过自回归解码和条件注入实现高效分子生成,在多个任务上达到或超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25796 2026-06-25 cs.RO 新提交 78%

MIL-LC: A Robust Magnetometer-Inertial-LiDAR Fusion Multimodal Localization Framework

MIL-LC:一种鲁棒的磁力计-惯性-LiDAR融合多模态定位框架

Qiyang Lyu, Zhenyu Wu, Wei Wang, Hongming Shen, Danwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Centre for Advanced Robotics Technology Innovation (CARTIN)(先进机器人技术创新中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出MIL-LC框架,融合磁力计、惯性和LiDAR,解决GNSS缺失、几何重复或无纹理环境下的定位问题,通过磁地图与LiDAR退化检测实现鲁棒定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20757 2026-06-23 cs.LG 新提交 78%

Evidential Fusion Network for Multimodal Survival Prediction under Missing Modalities

缺失模态下的多模态生存预测证据融合网络

Yucheng Xing, Hailan Mo, Zi Wang, Ling Huang, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Imperial College London(帝国理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出EMMS模型,利用Dempster-Shafer理论和高斯随机模糊数融合多模态决策,处理缺失模态下的生存预测,无需生成缺失数据,在四个癌症数据集上达到最优性能并提供校准的不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20037 2026-06-19 cs.LG 新提交 78%

Alzheimer's Disease Diagnosis using a Multimodal Approach with 3D MRI and PET

使用3D MRI和PET的多模态方法诊断阿尔茨海默病

Loukas Ilias, Anthi-Maria Vozinaki, Christos Ntanos, Dimitris Askounis

机构 * DSS Lab, School of ECE, NTUA(NTUA ECE学院DSS实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出结合3D卷积特征提取器与三种融合策略(拼接、门控多模态单元、门控自注意力)及稀疏门控混合专家分类器的多模态模型,用于阿尔茨海默病诊断,在三个二分类任务上验证了输入自适应建模的有效性。

Comments 2025 IEEE International Conference on Bioinformatics and Biomedicine (BIBM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18436 2026-06-19 stat.ML cs.LG 新提交 78%

Pointwise is Pointless? A Multimodal Ablation Study for Precipitation Nowcasting with Graph Neural Networks

逐点是否无意义?基于图神经网络的降水临近预报的多模态消融研究

Ophélia Miralles, Máté Mile, Christoffer Artturi, Thomas Nipen, Ivar Seierstad

机构 * Norwegian Meteorological Institute(挪威气象研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本研究通过多模态图神经网络系统,消融分析雷达、数值预报、地面观测、卫星数据及训练损失对降水临近预报的影响,发现各模态分别改善不同方面,点观测虽提升局部但需结合损失函数和不确定性表示才能优化雷达场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18390 2026-06-18 cs.LG q-bio.QM 新提交 78%

MOLAR: Learning Multimodal Molecular Representations from Noisy Labels

MOLAR: 从噪声标签中学习多模态分子表示

Yingxu Wang, Kunyu Zhang, Nan Yin, Yu Li, Eran Segal

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zhengzhou University(郑州大学) The Education University of Hong Kong(香港教育大学) The Chinese University of Hong Kong(香港中文大学) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出MOLAR框架,通过分离干净属性推断与标签观测,利用图与文本模态的残差证据,从噪声标签中学习多模态分子表示,在自然噪声和标签翻转基准上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17741 2026-06-17 eess.SY cs.HC cs.SY 新提交 78%

A Wearable Multimodal Ultrasound+Inertial System for Real-Time Virtual Reality Interaction

用于实时虚拟现实交互的可穿戴多模态超声+惯性系统

Giusy Spacone, Sebastian Frey, Enzo Baraldi, Mattia Orlandi, Luca Benini, Andrea Cossettini

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出基于前臂和上臂超声与惯性传感的完全可穿戴多模态接口,结合WULPUS平台和Unity VR环境,通过多模态学习实现手部姿态和前臂位置估计,在三个任务中在线成功率超88%。

Comments 8 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12863 2026-06-17 cs.LG 新提交 78%

Multimodal Graph Negative Learning

多模态图负学习

Zhengyu Wu, Xu Wang, Hongchao Qin, Xunkai Li, Guang Zeng, Rong-Hua Li, Guoren Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出GraphMNL框架,通过负学习解决多模态属性图中节点级分支语义不平衡问题,避免主导分支偏差传播,在Grocery和Reddit M数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10759 2026-06-17 cs.IR 新提交 78%

miniReranker: Efficient Multimodal Reranking through Visual Cache Reuse and Interaction Sparsity

miniReranker: 通过视觉缓存重用和交互稀疏性实现高效多模态重排序

Yingqi Fan, Xuan Lu, Anhao Zhao, Junlong Tong, Ping Nie, Kai Zou, Yunpu Ma, Wei Zhang, Xiaoyu Shen

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出miniReranker,通过视觉优先格式、早期退出、窄交互带和嵌入器引导剪枝,将重排序运行时间降至密集实现的1%以下,同时保持96%以上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09770 2026-06-17 q-bio.NC cs.LG 新提交 78%

Discovering Functionally Selective Brain Regions with a Deep Topographic Multimodal Model

发现功能选择性脑区:一种深度地形多模态模型

Badr AlKhamissi, Johannes Mehrer, Lara Marinov, Ahmed Abdelaal, Abdulkadir Gokce, Martin Schrimpf

机构 * University of California, Berkeley(加州大学伯克利分校) Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出Topo-Omni模型,通过空间平滑微调预训练基础模型,在单一连续虚拟皮层上整合视觉、听觉和语言/认知处理,产生与人类神经影像一致的多模态聚类,并用于发现新脑区。

Comments Preprint. First two author contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13381 2026-06-12 cs.LG 新提交 78%

Hölder++: Improving the Quality-Coherence Trade-off in Multimodal VAEs

Hölder++:改进多模态VAE中的质量-一致性权衡

Huyen Vo, María Martínez-García, Isabel Valera

机构 * Hölder++: Improving the Quality-Coherence Trade-off in Multimodal VAEs Supplementary Material(Hölder++:多模态VAE中质量与一致性权衡的改进补充材料)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态VAE生成质量与语义一致性之间的权衡问题,提出Hölder++,通过精确Hölder池化、扩展架构和层次推理,在提升一致性的同时保持生成质量。

Comments Accepted at ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11749 2026-06-11 cs.IR 新提交 78%

FAST-MEL: A Fast, Accurate, and Storage Efficient Solution for Multimodal Entity Linking

FAST-MEL: 一种快速、准确且存储高效的多模态实体链接解决方案

Derrien Thomas, Laurent Amsaleg, Pascale Sébillot

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出FAST-MEL,通过紧凑的固定大小向量化表示文本和视觉信息,在保持高准确率的同时实现三个数量级的加速和一个数量级的存储节省。

Journal ref SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21639 2026-06-11 cs.CY cs.LG 版本更新 78%

A Multi-Modal Sensor Fusion Instrument for Measuring Regional Human Mobility: The Distributed Human Data Engine (DHDE)

多模态传感器融合仪器用于测量区域人类流动性:分布式人类数据引擎(DHDE)

Amil Khanzada, Takuji Takemoto

机构 * Headquarters for Regional Revitalization, University of Fukui, Japan(复兴地区总部,福井大学,日本)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 提出分布式人类数据引擎(DHDE),通过融合边缘AI相机、数字意图信号、行为记录和气象数据,解决外围区域人类流动性测量中传感器稀疏和行为异质性问题,验证了稀疏传感器补偿方法,并发现“低活力悖论”。

Comments 32 pages, 4 figures, 3 tables. Pre-print of a manuscript submitted for peer review (v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19276 2026-06-11 cs.IR 版本更新 78%

MOTOR: Learning ID-free Item Representation with Token Crossing for Embedding-based Multimodal Recommendation

MOTOR:基于令牌交叉的无ID多模态物品表示学习用于嵌入推荐

Kangning Zhang, Jiarui Jin, Yingjie Qin, Ruilong Su, Jianghao Lin, Yong Yu, Weinan Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出MOTOR框架,用可学习共享多模态令牌替代物品ID嵌入,通过产品量化和令牌交叉网络实现语义共享与冷启动改进。

Comments Accepted by ECML-PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03063 2026-06-10 cs.SI 78%

Unsupervised Multimodal Graph-based Model for Geo-social Analysis

无监督多模态图模型用于地理社交分析

Ehsaneddin Jalilian, Bernd Resch

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出无监督多模态图模型,整合语义与地理信息,提升灾难管理和舆论监控中的内容分析效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08553 2026-06-09 cs.SE 新提交 78%

FusionVul: A Multimodal Feature Fusion Framework for Source Code Vulnerability Detection

FusionVul:一种用于源代码漏洞检测的多模态特征融合框架

Hongyu Yang, Yaping Zhu, Jingchuan Luo, Hiroshi Nomaguchi, Chunhua Su, Willy Susilo

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract)

AI总结 提出FusionVul框架,融合Transformer和GNN分别提取序列语法与结构语义,通过交叉注意力融合网络和样本感知加权机制,在SVulD等数据集上取得更优F1分数,有效捕获复杂多样的漏洞模式。

Comments Accepted by The Journal of Systems and Software

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22243 2026-06-09 cs.RO 版本更新 78%

SODA-CitrON: Static Object Data Association by Clustering Multi-Modal Sensor Detections Online

SODA-CitrON:通过在线聚类多模态传感器检测实现静态物体数据关联

Jan Nausner, Kilian Wohlleben, Michael Hubner

机构 * Jan Nausner, Kilian Wohlleben, Michael Hubner

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出SODA-CitrON方法,通过在线聚类多模态传感器检测实现静态物体的数据关联,同时估计位置并维持持久跟踪,优于现有方法在F1分数、位置RMSE、MOTP和MOTA指标上。

Comments 8 pages, 5 figures; \c{opyright} 2026 IEEE. Accepted for the 2026 International Conference on Information Fusion (FUSION 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.06040 2026-06-04 stat.ME cs.NA math.NA stat.AP stat.ML 78%

Tensor Analysis and Fusion of Multimodal Brain Images

张量分析与多模态脑图像融合

Esin Karahan, Pedro A. Rojas-Lopez, Maria L. Bringas-Vega, Pedro A. Valdes-Hernandez, Pedro A. Valdes-Sosa

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出利用张量结构分析多模态神经影像数据,引入马尔可夫-彭罗斯图进行建模,首次将Granger因果分析视为张量回归问题,展示其在脑网络分解中的潜力。

Comments 23 pages, 15 figures, submitted to Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01471 2026-06-03 cs.IR cs.LG 78%

Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning

通过协同注意力重建内容以提升多模态嵌入质量

Jiahan Chen, Da Li, Hengran Zhang, Yinqiong Cai, Lixin Su, Jiafeng Guo, Daiting Shi, Dawei Yin, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc.(百度公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出CoCoA预训练范式,通过重构注意力流和基于EOS的重建任务,利用协同注意力优化多模态嵌入,使模型将输入语义压缩到<EOS>令牌中,从而提升嵌入质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31193 2026-06-01 cs.LG 78%

Geometry-based Schrödinger Bridges for Trustworthy Multimodal Fusion

基于几何的薛定谔桥用于可信多模态融合

Jiayu Xiong, Jing Wang, Qi Zhang, Wanlong Wang, Jun Xue

机构 * Department of Computer Science(计算机科学系) Techonology, Huaqiao University(技术学系,华侨大学) Xiamen Key Laboratory of Computer Vision(厦门计算机视觉实验室) Pattern Recognition, Huaqiao University(模式识别,华侨大学) Tongji University(同济大学) School of Cyber Science(网络科学学院) Engineering, Wuhan University(工程学院,武汉大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出基于几何的多模态融合方法GMF,利用扩散薛定谔桥的初始速度平方作为独立于预测的可靠性信号,以提升对低质量数据的鲁棒性。

Comments ICML 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27678 2026-05-28 cs.LG cs.DC 78%

Heterogeneous Parallelism for Multimodal Large Language Model Training

多模态大语言模型训练的异构并行

Yashaswi Karnati, Kamran Jafari, Akash Mehra, Li Ding, Pranav Prashant Thombre, Ali Roshan Ghias, Shifang Xu, Parth Mannan, Yu Yao, Hao Wu, Eric Harper, Ashwath Aithal, Nima Tajbakhsh

机构 * NVIDIA

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态大语言模型训练中单一LLM中心并行布局导致的吞吐量瓶颈,提出异构并行抽象,允许各模块独立布局和放置,并通过边界通信器实现张量语义保持,实验表明可提升TFLOPS/GPU最高49.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27583 2026-05-28 cs.LG 78%

Information-theoretic Multimodal Representation Learning for Electrocardiogram Signals

基于信息论的心电图信号多模态表示学习

Phu X. Nguyen, Konstantinos Kontras, Wei Dai, Huy Phan, Christos Chatzichristos, Paul Pu Liang, Bert Vandenberk, Maarten De Vos

机构 * KU Leuven(库勒芬大学) University Hospitals Leuven(鲁文大学医院) MIT(麻省理工学院) DFKI(德国达姆施塔特研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出MERIT框架,通过信息论视角结合掩码心电图建模与心电图-文本对比对齐,学习保留信号结构并整合临床语义的心电图表示,在分类、零样本和文本生成任务中取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20480 2026-05-28 cs.RO 78%

Degradation-Aware Cooperative Multi-Modal GNSS-Denied Localization Leveraging LiDAR-Based Robot Detections

基于激光雷达机器人检测的退化感知协同多模态GNSS拒止定位

Václav Pritzl, Xianjia Yu, Tomi Westerlund, Petr Štěpán, Martin Saska

机构 * Multi-robot Systems Group, Department of Cybernetics, Faculty of Electrical Engineering, Czech Technical University in Prague(布拉格捷克技术大学电气工程学院控制学系多机器人系统组) Turku Intelligent Embedded and Robotic Systems (TIERS) Lab, University of Turku(图尔库大学智能嵌入式与机器人系统实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 提出一种因子图框架下的自适应多模态多机器人协同定位方法,融合异步VIO、LIO和3D机器人间检测,通过插值因子和Wasserstein距离加权处理传感器退化,显著提升定位精度。

Comments Preprint version. This work has been submitted to Elsevier for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25726 2026-05-26 cs.IR 78%

SIREN: Unified Multi-Granularity Semantic Interaction for Multi-Modal Lifelong User Interest Modeling

SIREN:面向多模态终身用户兴趣建模的统一多粒度语义交互

Yaqian Zhang, Ruyi Yu, Tianyi Li, Bohan Liu, Maoquan Ye, Ke Wang, Shifeng Wen, Junwei Pan, Lijie Wang, Qi Zhou, Yeshou Cai, Chengguo Yin, Lifeng Wang, Hui Li, Lei Xiao, Haijie Gu

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 提出SIREN框架,通过统一多粒度语义交互(包括基于多模态相似性的软检索和基于语义ID的硬检索)解决多模态与协同空间的对齐问题,在离线数据集上达到最优GAUC,并在腾讯广告平台多个场景中取得GMV提升。

详情

展开后加载摘要…

URL PDF HTML 收藏