arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-03 至 2026-06-03 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 16 篇

2606.02679 2026-06-03 cs.LG cs.MM cs.SD eess.AS 84%

Before Fusion, Ask What to Keep: Contextual Calibration of Multimodal Signals

融合之前,先问保留什么:多模态信号的上下文校准

Jiyuan Liu, Liangwei Nathan Zheng, Wei Emma Zhang, Xinpei Wang, Weitong Chen

机构 * Adelaide University(阿德莱德大学) Shandong University(山东大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM、eess.AS

AI总结 提出一种紧凑的校准模块,在融合前对各模态特征进行实例级和维度级调制,抑制不可靠成分并增强上下文支持信号,提升多模态任务性能。

Comments 11 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01282 2026-06-03 cs.CV cs.AI 84%

Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model Enhancement

Align-KD:为移动视觉语言模型增强提取跨模态对齐知识

Qianhan Feng, Wenshuo Li, Tong Lin, Xinghao Chen

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University, China(通用人工智能国家重点实验室,智能科学与技术学院,北京大学,中国) Huawei Noah’s Ark Lab, China(华为诺亚方舟实验室,中国)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出Align-KD方法,通过蒸馏教师模型浅层跨模态对齐知识,指导1.7B学生模型学习视觉-文本匹配,在6个基准上平均提升2.0分。

Comments CVPR 2025 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03604 2026-06-03 cs.CL 83%

Beyond the Literal: Decomposing Pragmatic Intent in Multimodal Meme Understanding

超越字面:多模态模因理解中的语用意图分解

Zhengyi Zhao, Shubo Zhang, Zezhong Wang, Luyao Ye, Huimin Wang, Hanqi Yan, Binyang Li, Kam-Fai Wong, Yulan He

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei(华为) Central China Normal University(中央师范大学) Shenzhen University(深圳大学) King’s College London(伦敦国王学院) University of International Relations(国际关系大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CL

AI总结 针对大型视觉语言模型(LVLMs)在理解模因时倾向于描述字面内容而非语用意图的问题,提出Intent Projection框架,通过表示、输出和目标三层面的字面-语用分解,在六个基准上超越开源模型并缩小与专有模型的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03370 2026-06-03 eess.IV 82%

SMAC: Spatial-Modal Joint Modeling and Adaptive Representation Collapse for Multimodal Object Tracking

SMAC: 空间-模态联合建模与自适应表示崩溃的多模态目标跟踪

Meijing Gao, Qitai Sun, Huanyu Sun, Bingxuan Yang, Bingzhou Sun, Xu Chen, Yonghao Yan, Yuxuan Yang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对复杂光照下多模态多目标跟踪中空间与模态特征联合建模不足及固定融合策略适应性有限的问题,提出基于空间-模态卷积融合和蒸馏提示的多模态跟踪框架,通过解耦3D卷积、幅相分解和表示崩溃网络实现自适应融合,在UniRTL数据集上取得领先性能。

Comments 12 pages, 16 figures. Code and pretrained models are available at https://github.com/QitaiSun/SMAC

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05249 2026-06-03 cs.IR 82%

TriAlignGR: Triangular Multitask Alignment with Multimodal Deep Interest Mining for Generative Recommendation

TriAlignGR:面向生成式推荐的多模态深度兴趣挖掘与三角多任务对齐

Yangchen Zeng, Hao Peng, Rongfeng Guo, Zhenyu Yu, Zhiyuan Hu, Jinze Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出TriAlignGR统一多任务多模态框架,通过两阶段语义传播和三角多任务对齐,解决语义ID中的内容退化与语义不透明问题,实现生成式推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03341 2026-06-03 cs.CV 79%

Cross-Modality Feature Fusion Based on Structured State Space Duality for Multimodal Image Registration Network

基于结构化状态空间对偶性的跨模态特征融合多模态图像配准网络

Zhikang Li, Yan Wu, Xin Hu, Yi Dai, Ming Li

机构 * Remote Sensing Image Processing and Fusion Group, School of Electronic Engineering, Xidian University(遥感图像处理与融合组,电子工程学院,西安电子科技大学) National Key Laboratory of Radar Signal Processing, Xidian University(雷达信号处理国家级实验室,西安电子科技大学)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 提出RegNetMamba-2算法,利用结构化状态空间对偶性(SSD)在粗到细匹配过程中提取局部和全局结构特征,通过跨模态交互和多尺度融合模块实现多模态图像配准,在多个数据集上取得高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05530 2026-06-03 cs.AI 79%

MIND: Multi-rationale INtegrated Discriminative Reasoning Framework for Multi-modal Large Models

MIND:面向多模态大模型的多理由集成判别推理框架

Chuang Yu, Jinmiao Zhao, Mingxuan Zhao, Yunpeng Liu, Xiujun Shu, Yuanhao Feng, Bo Wang, Xiangyu Yue

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) MMLab, CUHK(CUHK多模态实验室)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在多理由语义建模、逻辑鲁棒性和抗误导方面的不足,提出MIND推理框架,通过“理解-反思-纠正”机制实现从被动模仿到主动判别推理的范式转变。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22468 2026-06-03 cs.LG cs.AI 79%

Learning the Neighborhood: Contrast-Free Multimodal Self-Supervised Molecular Graph Pretraining

学习邻域:无对比的多模态自监督分子图预训练

Boshra Ariguib, Mathias Niepert, Andrei Manolache

机构 * University of Tübingen(图宾根大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出C-FREE框架,通过预测子图嵌入与互补邻域的关系,融合2D拓扑和3D构象信息,实现无对比、无负样本的多模态自监督分子图预训练,在MoleculeNet上取得最优结果。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01471 2026-06-03 cs.IR cs.LG 78%

Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning

通过协同注意力重建内容以提升多模态嵌入质量

Jiahan Chen, Da Li, Hengran Zhang, Yinqiong Cai, Lixin Su, Jiafeng Guo, Daiting Shi, Dawei Yin, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc.(百度公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出CoCoA预训练范式,通过重构注意力流和基于EOS的重建任务,利用协同注意力优化多模态嵌入,使模型将输入语义压缩到<EOS>令牌中,从而提升嵌入质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03626 2026-06-03 cs.CV cs.AI cs.CY 76%

TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics

TurtleAI:海龟图形学中视觉编程的多模态模型基准测试

Chao Wen, Jacqueline Staub, Adish Singla

机构 * MPI-SWS(马克斯·普朗克研究所-斯图加特)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.AI

AI总结 提出TurtleAI基准,包含823个基于海龟图形学真实任务的视觉编程任务,评估20多个多模态模型发现成功率低于30%,并通过少量种子样本生成合成数据微调Qwen2-VL-72B提升约20%性能。

Comments ACL Findings 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03114 2026-06-03 cs.CV 74%

FAF-CD: Frequency-Aware Fusion for Change Detection under Imperfect Multimodal Remote Sensing

FAF-CD: 面向不完美多模态遥感的频率感知融合变化检测

Yufan Wang, Sokratis Makrogiannis, Chandra Kambhamettu

机构 * University of South Florida(佛罗里达州立大学) Delaware State University(特拉华州立大学)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 提出频率感知混合框架FAF-CD,通过DINOv3预训练ConvNeXt编码器、VMamba解码器及修正感知三支融合模块(可变形空间对齐+傅里叶/哈尔小波比较+自适应门控),在不完美异质遥感(如EO-SAR)和二元光学变化检测中提升精度并降低计算成本。

Comments Code will be released at https://github.com/VimsLab/FAF-CD

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03871 2026-06-03 cs.CV cs.CL cs.LG 73%

Visual Instruction Tuning Aligns Modalities through Abstraction

视觉指令调优通过抽象对齐模态

Luis Palacios, Lorenzo Basile, Diego Doimo, Alberto Cazzaniga

机构 * Area Science Park, Trieste, Italy(特里埃斯特Area Science Park)

专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 通过探针分析和因果干预,发现视觉指令调优将视觉特征直接嵌入LLM的中间语义层,绕过早期单模态处理层,并通过扩展和强化现有抽象阶段对齐视觉与文本表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03581 2026-06-03 cs.CV cs.RO 70%

UnsOcc: 3D Semantic Occupancy Prediction in Unstructured Scene via Rendering Fusion

UnsOcc:非结构化场景下基于渲染融合的3D语义占用预测

Ye Wu, Ruiqi Song, Baiyong Ding, Nanxin Zeng, Junjie Cheng, Yunfeng Ai

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Waytous Inc.(Waytous公司)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出UnsOcc多模态框架,通过渲染融合模块和基于高斯溅射的细节感知辅助监督,解决非结构化场景中跨模态融合困难与长尾分布问题,在露天矿和nuScenes数据集上超越现有方法。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26914 2026-06-03 cs.CV 57%

I2PRef: Image-Driven Point Completion with Iterative Refinement

I2PRef: 图像驱动的点云补全与迭代细化

Azhar Hussian, Marina Ritthaler, André Kaup, Vasileios Belagiannis

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出一种以图像为主要几何来源的点云补全方法,通过图像到点(I2P)模块直接从单张RGB图像重建完整点云,并利用基于Transformer的点到点(P2P)细化模块迭代优化,在ShapeNet-ViPC上取得最先进性能,Chamfer距离相对提升12.3%。

Comments Accepted at European Signal Processing Conference (EUSIPCO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18954 2026-06-03 cs.CV 57%

VOIC: Visible-Occluded Integrated Guidance for 3D Semantic Scene Completion

VOIC:可见-遮挡联合引导的3D语义场景补全

Zaidao Han, Risa Higashita, Jiang Liu

机构 * Research Institute of Trustworthy Autonomous Systems, Southern University of Science and Technology(可信自主系统研究院,南方科技大学) Department of Computer Science and Engineering, Southern University of Science and Technology(计算机科学与工程系,南方科技大学) School of Computer Science, University of Nottingham Ningbo China(宁波大学计算机学院) Department of Electronic and Information Engineering, Changchun University(电子与信息工程学院,长春大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出VOIC网络,通过解耦可见区域感知与遮挡区域推理,利用离线可见区域标签提取策略和双解码器框架,在SemanticKITTI和SSCBench-KITTI360上实现最先进的3D语义场景补全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1204.6120 2026-06-03 math.FA cs.IT cs.NA math.IT math.NA 50%

Geometric Separation by Single-Pass Alternating Thresholding

单次交替阈值化的几何分离

Gitta Kutyniok

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对点状和曲线奇异性的分离问题,本文提出并理论分析了基于小波和曲波帧的单次交替阈值化方法,利用簇相干性和几何稀疏性证明了在足够细尺度下可实现任意精确分离。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏