arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3020 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 530 篇

2607.18897 2026-07-22 eess.IV 新提交 78%

Thinking Fast, Thinking Slow: Adaptive Multimodal Transformer-based Sensor Fusion for Depth Estimation on Ultra-low-power MCUs

快速思考,慢速思考:基于自适应多模态Transformer的超低功耗MCU深度估计传感器融合

Luca Crupi, Lorenzo Lamberti, Giovanni Badaracco, Daniele Allegri, Alessandro Giusti, Daniele Palossi

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对超低功耗MCU深度估计问题,提出结合多模态传感器融合与轻量级基于循环Transformer架构的自适应方法,通过令牌传播和增量传感器利用机制平衡能耗与精度,实验证明该方法节能且精度提升显著。

Comments 16 pages, 9 figures, 6 tables. This paper has been accepted for publication in the IEEE Sensors Journal Copyright 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16789 2026-07-21 cs.LG 新提交 78%

MultiLoReFT: Decoupling Shared and Modality-Specific Subspaces in Multimodal Learning via Low-Rank Representation Fine-Tuning

MultiLoReFT:通过低秩表示微调在多模态学习中解耦共享和特定模态子空间

Sana Tonekaboni, Viktoria Schuster, Caroline Uhler

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对多模态模型训练障碍,提出MultiLoReFT框架,通过低秩表示微调,将低秩适应扩展到多模态,学习可解释投影子空间解耦信息,能在多模态预测时揭示信息分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13466 2026-07-16 cs.LG quant-ph 新提交 78%

PQFA: Parallel Quantum Feature Augmentation of Fused Representations for Multimodal Classification

PQFA:用于多模态分类的融合表示的并行量子特征增强

Mingzhu Wang, Yun Shang

机构 * AMSS(中国科学院数学与系统科学研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究多模态学习中后融合增强问题,提出并行量子特征增强框架PQFA,将其应用于融合特征,经多种处理后幅度编码到量子电路预测。实验表明PQFA性能优、参数效率高,是混合量子 - 经典多模态学习后融合增强的有效策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11102 2026-07-14 cs.SD 新提交 78%

CHARM: Charge Calibration and Acoustic Rescue for LLM-based Multimodal Sarcasm Detection

CHARM:基于大语言模型的多模态讽刺检测中的电荷校准与声学救援

Qiyang Sun, Yi Chang, Yupei Li, Xi Shao, Zixing Zhang, Björn W. Schuller

机构 * GLAM – the Group on Language, Audio, & Music, Imperial College London(伦敦帝国理工学院语言、音频和音乐小组) College of Telecommunications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Shenzhen Research Institute, Hunan University(湖南大学深圳研究院) CHI – Chair of Health Informatics, TUM University Hospital(慕尼黑工业大学医院健康信息学主席) relAI – the Konrad Zuse School of Excellence in Reliable AI(康拉德·楚泽可靠人工智能卓越学院) MDSI – Munich Data Science Institute(慕尼黑数据科学研究所) MCML – Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对大语言模型在讽刺检测中过度预测积极类别及韵律线索利用不足的问题,提出CHARM框架,含双向电荷校准和声学后期融合救援两个模块,无需微调主干,提升检测性能,揭示跨文化韵律解耦,产生可解释的跨语言多模态检测器。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10532 2026-07-14 cs.IR 新提交 78%

Implicit Fine-tuning via Context Engineering: A Curriculum Learning Framework for Multimodal Entity Alignment

通过上下文工程进行隐式微调:多模态实体对齐的课程学习框架

Yunpeng Hong, Chenyang Bu, Di Wu, Yi He, Xindong Wu

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究多模态实体对齐问题,提出PTFEA课程学习框架,通过自适应难度调制和三阶段渐进推理将微调策略转化为上下文工程,实验证明该框架性能优越,提供了统一上下文工程和微调的理论框架。

Comments Accepted by KDD 2026

Journal ref SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09515 2026-07-13 cs.RO 新提交 78%

One-Shot Multimodal Learning from Demonstration with Force-Constrained Elastic Maps

基于力约束弹性映射的一次性多模态示范学习

Brendan Hertel, Jonathan Spanos, Navya Garg, Reza Azadeh

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多数示范学习方法忽视力与环境相互作用的问题,提出一次性多模态LfD框架。通过多模态概率分割提取力感知运动原语,扩展弹性映射表示并结合外力约束学习轨迹模型,经实验验证该方法具有多模态分割、力感知再现及跨平台通用性。

Comments 8 pages, 6 figures, 4 tables. Accepted for publication at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05736 2026-07-08 cs.LG 新提交 78%

Multimodal Molecular Representation Learning with Graph Neural Networks, Deep & Cross Networks, and SMILES Embeddings

基于图神经网络、深度交叉网络和SMILES嵌入的多模态分子表示学习

Qiwei Han, Chi Zhou, Ruobing Wang, Zheng Ma

机构 * Duke University(杜克大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对分子性质预测难题,提出三分支模块化融合神经网络,综合三种模态数据,经后期融合架构建立多模态潜在空间,在QM9基准测试中表现出色,降低误差,为高通量虚拟筛选提供高效模型。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03111 2026-07-07 eess.SP 新提交 78%

Edge-Assisted Multimodal UAV Localization with Resource-Efficient Compression and Robust Fusion

基于资源高效压缩和鲁棒融合的边缘辅助多模态无人机定位

Zhong Ye, Yinghui He, Guanding Yu, Pavel Loskot

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 设计多模态无人机定位框架,利用相机、LiDAR和雷达传感模态。通过信息瓶颈压缩等模块应对传感节点资源有限、数据差异大及模态数据退化缺失等挑战,实验表明该框架能准确可靠定位无人机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03099 2026-07-07 eess.IV eess.SP 新提交 78%

AirTF: Over-the-Air Token Fusion for Task-Oriented Multi-Modal Token Communications

AirTF:面向任务的多模态令牌通信的空中令牌融合

Bole Liu, Li Qiao, Minghui Wu, Yulin Shao, Zhen Gao

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 针对车联网中高维多模态传感数据传输面临的频谱瓶颈,提出AirTF框架。利用视觉变压器编码器提取语义令牌,通过共享无线信道并发传输,利用多址信道叠加特性空中融合多模态语义,提升频谱效率。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03520 2026-07-07 cs.IT cs.NI eess.SP math.IT 新提交 78%

ATS-ToDMA: Adaptive Token Selection and Token-Domain Multiple Access for Cross-Modal Semantic Communications

ATS-ToDMA:用于跨模态语义通信的自适应令牌选择和令牌域多址接入

Sachin Kadam, Dong In Kim

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 针对语义通信系统效率问题,提出ATS-ToDMA框架,通过联合进行语义令牌选择、干扰感知调度和语义感知功率分配,引入SSINR指标,开发调度器,推导分析边界,相比基准有性能提升。

Comments 13 pages, 9 figures. Submitted to a journal, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01821 2026-07-03 stat.ME 新提交 78%

Pattern-Calibrated Multimodal Prediction under Blockwise Missingness

分块缺失下的模式校准多模态预测

Junhan Yu, Kejian Zhang, Doudou Zhou, Guojun Zhu

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态数据分块缺失问题,提出MOSAIC框架,通过共享与特定模态表示学习及跨模式校准,在不混淆预测规则的前提下实现跨缺失模式信息借用,理论证明误差分解并验证其在有限目标样本或规则差异场景下的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01656 2026-07-03 cs.LG 新提交 78%

CALM: Interpretable Cross-Modal Alignment for Biomarker Discovery from Unpaired Data

CALM: 可解释的跨模态对齐用于从非配对数据中发现生物标志物

Jueqi Wang, Zachary Jacokes, John Darrell Van Horn, Kevin A. Pelphrey, Michael C. Schatz, Archana Venkataraman

机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院) Department of Psychology, University of Virginia(弗吉尼亚大学心理学系) Department of Neurology, University of Virginia(弗吉尼亚大学神经病学系) Departments of Computer Science and Biology, Johns Hopkins University(约翰霍普金斯大学计算机科学与生物学系)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 提出CALM框架,通过线性投影对齐脑区和遗传通路的潜在分布,从完全不相交的人群中学习可解释的跨模态关联,在自闭症谱系障碍数据上优于现有方法。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32016 2026-07-01 cs.LG 新提交 78%

FedLAB: Traceable Semantic Codebooks for Federated Multimodal Graph Foundation Learning

FedLAB: 面向联邦多模态图基础学习的可追踪语义码本

Zekai Chen, Kairui Yang, Xuaner Chen, Xunkai Li, Xun Wu, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出FedLAB框架,通过类型化分层码本组织模态证据、节点语义和拓扑上下文,实现联邦多模态图学习中的可追踪语义,在10个基准和6个下游任务上提升达7.53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25865 2026-06-25 q-bio.BM 新提交 78%

Molexar: A Unified Multimodal Molecular Foundation Model for Drug Design

Molexar:用于药物设计的统一多模态分子基础模型

Haoyu Lin, Yiyan Liao, Jinmei Pan, Xinliao Ling, Luhua Lai, Jianfeng Pei

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出Molexar,一种基于Fragment-SELFIES的统一多模态分子基础模型,通过自回归解码和条件注入实现高效分子生成,在多个任务上达到或超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25796 2026-06-25 cs.RO 新提交 78%

MIL-LC: A Robust Magnetometer-Inertial-LiDAR Fusion Multimodal Localization Framework

MIL-LC:一种鲁棒的磁力计-惯性-LiDAR融合多模态定位框架

Qiyang Lyu, Zhenyu Wu, Wei Wang, Hongming Shen, Danwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Centre for Advanced Robotics Technology Innovation (CARTIN)(先进机器人技术创新中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出MIL-LC框架,融合磁力计、惯性和LiDAR,解决GNSS缺失、几何重复或无纹理环境下的定位问题,通过磁地图与LiDAR退化检测实现鲁棒定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20757 2026-06-23 cs.LG 新提交 78%

Evidential Fusion Network for Multimodal Survival Prediction under Missing Modalities

缺失模态下的多模态生存预测证据融合网络

Yucheng Xing, Hailan Mo, Zi Wang, Ling Huang, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Imperial College London(帝国理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出EMMS模型,利用Dempster-Shafer理论和高斯随机模糊数融合多模态决策,处理缺失模态下的生存预测,无需生成缺失数据,在四个癌症数据集上达到最优性能并提供校准的不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20037 2026-06-19 cs.LG 新提交 78%

Alzheimer's Disease Diagnosis using a Multimodal Approach with 3D MRI and PET

使用3D MRI和PET的多模态方法诊断阿尔茨海默病

Loukas Ilias, Anthi-Maria Vozinaki, Christos Ntanos, Dimitris Askounis

机构 * DSS Lab, School of ECE, NTUA(NTUA ECE学院DSS实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出结合3D卷积特征提取器与三种融合策略(拼接、门控多模态单元、门控自注意力)及稀疏门控混合专家分类器的多模态模型,用于阿尔茨海默病诊断,在三个二分类任务上验证了输入自适应建模的有效性。

Comments 2025 IEEE International Conference on Bioinformatics and Biomedicine (BIBM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18436 2026-06-19 stat.ML cs.LG 新提交 78%

Pointwise is Pointless? A Multimodal Ablation Study for Precipitation Nowcasting with Graph Neural Networks

逐点是否无意义?基于图神经网络的降水临近预报的多模态消融研究

Ophélia Miralles, Máté Mile, Christoffer Artturi, Thomas Nipen, Ivar Seierstad

机构 * Norwegian Meteorological Institute(挪威气象研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本研究通过多模态图神经网络系统,消融分析雷达、数值预报、地面观测、卫星数据及训练损失对降水临近预报的影响,发现各模态分别改善不同方面,点观测虽提升局部但需结合损失函数和不确定性表示才能优化雷达场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18390 2026-06-18 cs.LG q-bio.QM 新提交 78%

MOLAR: Learning Multimodal Molecular Representations from Noisy Labels

MOLAR: 从噪声标签中学习多模态分子表示

Yingxu Wang, Kunyu Zhang, Nan Yin, Yu Li, Eran Segal

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zhengzhou University(郑州大学) The Education University of Hong Kong(香港教育大学) The Chinese University of Hong Kong(香港中文大学) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出MOLAR框架,通过分离干净属性推断与标签观测,利用图与文本模态的残差证据,从噪声标签中学习多模态分子表示,在自然噪声和标签翻转基准上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17741 2026-06-17 eess.SY cs.HC cs.SY 新提交 78%

A Wearable Multimodal Ultrasound+Inertial System for Real-Time Virtual Reality Interaction

用于实时虚拟现实交互的可穿戴多模态超声+惯性系统

Giusy Spacone, Sebastian Frey, Enzo Baraldi, Mattia Orlandi, Luca Benini, Andrea Cossettini

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出基于前臂和上臂超声与惯性传感的完全可穿戴多模态接口,结合WULPUS平台和Unity VR环境,通过多模态学习实现手部姿态和前臂位置估计,在三个任务中在线成功率超88%。

Comments 8 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12863 2026-06-17 cs.LG 新提交 78%

Multimodal Graph Negative Learning

多模态图负学习

Zhengyu Wu, Xu Wang, Hongchao Qin, Xunkai Li, Guang Zeng, Rong-Hua Li, Guoren Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出GraphMNL框架,通过负学习解决多模态属性图中节点级分支语义不平衡问题,避免主导分支偏差传播,在Grocery和Reddit M数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10759 2026-06-17 cs.IR 新提交 78%

miniReranker: Efficient Multimodal Reranking through Visual Cache Reuse and Interaction Sparsity

miniReranker: 通过视觉缓存重用和交互稀疏性实现高效多模态重排序

Yingqi Fan, Xuan Lu, Anhao Zhao, Junlong Tong, Ping Nie, Kai Zou, Yunpu Ma, Wei Zhang, Xiaoyu Shen

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出miniReranker,通过视觉优先格式、早期退出、窄交互带和嵌入器引导剪枝,将重排序运行时间降至密集实现的1%以下,同时保持96%以上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09770 2026-06-17 q-bio.NC cs.LG 新提交 78%

Discovering Functionally Selective Brain Regions with a Deep Topographic Multimodal Model

发现功能选择性脑区:一种深度地形多模态模型

Badr AlKhamissi, Johannes Mehrer, Lara Marinov, Ahmed Abdelaal, Abdulkadir Gokce, Martin Schrimpf

机构 * University of California, Berkeley(加州大学伯克利分校) Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出Topo-Omni模型,通过空间平滑微调预训练基础模型,在单一连续虚拟皮层上整合视觉、听觉和语言/认知处理,产生与人类神经影像一致的多模态聚类,并用于发现新脑区。

Comments Preprint. First two author contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13381 2026-06-12 cs.LG 新提交 78%

Hölder++: Improving the Quality-Coherence Trade-off in Multimodal VAEs

Hölder++:改进多模态VAE中的质量-一致性权衡

Huyen Vo, María Martínez-García, Isabel Valera

机构 * Hölder++: Improving the Quality-Coherence Trade-off in Multimodal VAEs Supplementary Material(Hölder++:多模态VAE中质量与一致性权衡的改进补充材料)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态VAE生成质量与语义一致性之间的权衡问题,提出Hölder++,通过精确Hölder池化、扩展架构和层次推理,在提升一致性的同时保持生成质量。

Comments Accepted at ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11749 2026-06-11 cs.IR 新提交 78%

FAST-MEL: A Fast, Accurate, and Storage Efficient Solution for Multimodal Entity Linking

FAST-MEL: 一种快速、准确且存储高效的多模态实体链接解决方案

Derrien Thomas, Laurent Amsaleg, Pascale Sébillot

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出FAST-MEL,通过紧凑的固定大小向量化表示文本和视觉信息,在保持高准确率的同时实现三个数量级的加速和一个数量级的存储节省。

Journal ref SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08553 2026-06-09 cs.SE 新提交 78%

FusionVul: A Multimodal Feature Fusion Framework for Source Code Vulnerability Detection

FusionVul:一种用于源代码漏洞检测的多模态特征融合框架

Hongyu Yang, Yaping Zhu, Jingchuan Luo, Hiroshi Nomaguchi, Chunhua Su, Willy Susilo

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract)

AI总结 提出FusionVul框架,融合Transformer和GNN分别提取序列语法与结构语义,通过交叉注意力融合网络和样本感知加权机制,在SVulD等数据集上取得更优F1分数,有效捕获复杂多样的漏洞模式。

Comments Accepted by The Journal of Systems and Software

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13980 2026-08-17 cs.CV 新提交 77%

FIRM: Fine-Grained Intra-Token Representation of Masks for Remote Sensing Reasoning Segmentation

FIRM:面向遥感推理分割的掩码细粒度令牌内表示

Weidong Tang, Kaiyu Li, Yikai Wang, Yanan Wu, Haotian Gan, Shihong Wang, Xiangyong Cao

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出FIRM模型,通过预测视觉令牌内的r×r二值子单元掩码代码结合轻量连续渲染器优化边界,在5个遥感推理分割基准上取得领先结果,提升了细粒度分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09227 2026-08-11 cs.AI 新提交 77%

Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models

Omni2LoRA:用于高效全模态语言模型的保持一致性的参数化存储器

Puneet Mathur, Manan Suri, Dinesh Manocha

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI

AI总结 Omni2LoRA是一种保持一致性的参数化存储器压缩框架,通过优化秩分配策略提升全模态语言模型效率,在视听问答任务中优于多种基线,大幅缩短推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06948 2026-08-10 cs.AI 新提交 77%

LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents

多模态大模型模态迁移:自主地理信息系统智能体的先决条件

Ivan Majic, Zexian Huang, Franziska Hübl, Krzysztof Janowicz, Meilin Shi, Mina Karimi, Zilong Liu, Alexandra Fortacz-Lazan

机构 * Graz University of Technology(格拉茨工业大学) University of Vienna(维也纳大学) University of Liverpool(利物浦大学)

专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);multi-modal(abstract);分类 cs.AI

AI总结 本文针对自主GIS智能体的先决条件,提出LMM模态迁移任务,发现现有LMM在图像与文本模态间传递空间信息的能力不足,需加强多模态对齐以实现地理空间理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01635 2026-08-04 cs.CV 新提交 77%

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏