arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-03 至 2026-06-03 共收录 108 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 16 篇

2512.05530 2026-06-03 cs.AI 79%

MIND: Multi-rationale INtegrated Discriminative Reasoning Framework for Multi-modal Large Models

MIND:面向多模态大模型的多理由集成判别推理框架

Chuang Yu, Jinmiao Zhao, Mingxuan Zhao, Yunpeng Liu, Xiujun Shu, Yuanhao Feng, Bo Wang, Xiangyu Yue

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) MMLab, CUHK(CUHK多模态实验室)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在多理由语义建模、逻辑鲁棒性和抗误导方面的不足,提出MIND推理框架,通过“理解-反思-纠正”机制实现从被动模仿到主动判别推理的范式转变。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22468 2026-06-03 cs.LG cs.AI 79%

Learning the Neighborhood: Contrast-Free Multimodal Self-Supervised Molecular Graph Pretraining

学习邻域:无对比的多模态自监督分子图预训练

Boshra Ariguib, Mathias Niepert, Andrei Manolache

机构 * University of Tübingen(图宾根大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出C-FREE框架,通过预测子图嵌入与互补邻域的关系,融合2D拓扑和3D构象信息,实现无对比、无负样本的多模态自监督分子图预训练,在MoleculeNet上取得最优结果。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01471 2026-06-03 cs.IR cs.LG 78%

Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning

通过协同注意力重建内容以提升多模态嵌入质量

Jiahan Chen, Da Li, Hengran Zhang, Yinqiong Cai, Lixin Su, Jiafeng Guo, Daiting Shi, Dawei Yin, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc.(百度公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出CoCoA预训练范式,通过重构注意力流和基于EOS的重建任务,利用协同注意力优化多模态嵌入,使模型将输入语义压缩到<EOS>令牌中,从而提升嵌入质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03626 2026-06-03 cs.CV cs.AI cs.CY 76%

TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics

TurtleAI:海龟图形学中视觉编程的多模态模型基准测试

Chao Wen, Jacqueline Staub, Adish Singla

机构 * MPI-SWS(马克斯·普朗克研究所-斯图加特)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.AI

AI总结 提出TurtleAI基准,包含823个基于海龟图形学真实任务的视觉编程任务,评估20多个多模态模型发现成功率低于30%,并通过少量种子样本生成合成数据微调Qwen2-VL-72B提升约20%性能。

Comments ACL Findings 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03114 2026-06-03 cs.CV 74%

FAF-CD: Frequency-Aware Fusion for Change Detection under Imperfect Multimodal Remote Sensing

FAF-CD: 面向不完美多模态遥感的频率感知融合变化检测

Yufan Wang, Sokratis Makrogiannis, Chandra Kambhamettu

机构 * University of South Florida(佛罗里达州立大学) Delaware State University(特拉华州立大学)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 提出频率感知混合框架FAF-CD,通过DINOv3预训练ConvNeXt编码器、VMamba解码器及修正感知三支融合模块(可变形空间对齐+傅里叶/哈尔小波比较+自适应门控),在不完美异质遥感(如EO-SAR)和二元光学变化检测中提升精度并降低计算成本。

Comments Code will be released at https://github.com/VimsLab/FAF-CD

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03871 2026-06-03 cs.CV cs.CL cs.LG 73%

Visual Instruction Tuning Aligns Modalities through Abstraction

视觉指令调优通过抽象对齐模态

Luis Palacios, Lorenzo Basile, Diego Doimo, Alberto Cazzaniga

机构 * Area Science Park, Trieste, Italy(特里埃斯特Area Science Park)

专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 通过探针分析和因果干预,发现视觉指令调优将视觉特征直接嵌入LLM的中间语义层,绕过早期单模态处理层,并通过扩展和强化现有抽象阶段对齐视觉与文本表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03581 2026-06-03 cs.CV cs.RO 70%

UnsOcc: 3D Semantic Occupancy Prediction in Unstructured Scene via Rendering Fusion

UnsOcc:非结构化场景下基于渲染融合的3D语义占用预测

Ye Wu, Ruiqi Song, Baiyong Ding, Nanxin Zeng, Junjie Cheng, Yunfeng Ai

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Waytous Inc.(Waytous公司)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出UnsOcc多模态框架,通过渲染融合模块和基于高斯溅射的细节感知辅助监督,解决非结构化场景中跨模态融合困难与长尾分布问题,在露天矿和nuScenes数据集上超越现有方法。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26914 2026-06-03 cs.CV 57%

I2PRef: Image-Driven Point Completion with Iterative Refinement

I2PRef: 图像驱动的点云补全与迭代细化

Azhar Hussian, Marina Ritthaler, André Kaup, Vasileios Belagiannis

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出一种以图像为主要几何来源的点云补全方法,通过图像到点(I2P)模块直接从单张RGB图像重建完整点云,并利用基于Transformer的点到点(P2P)细化模块迭代优化,在ShapeNet-ViPC上取得最先进性能,Chamfer距离相对提升12.3%。

Comments Accepted at European Signal Processing Conference (EUSIPCO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18954 2026-06-03 cs.CV 57%

VOIC: Visible-Occluded Integrated Guidance for 3D Semantic Scene Completion

VOIC:可见-遮挡联合引导的3D语义场景补全

Zaidao Han, Risa Higashita, Jiang Liu

机构 * Research Institute of Trustworthy Autonomous Systems, Southern University of Science and Technology(可信自主系统研究院,南方科技大学) Department of Computer Science and Engineering, Southern University of Science and Technology(计算机科学与工程系,南方科技大学) School of Computer Science, University of Nottingham Ningbo China(宁波大学计算机学院) Department of Electronic and Information Engineering, Changchun University(电子与信息工程学院,长春大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出VOIC网络,通过解耦可见区域感知与遮挡区域推理,利用离线可见区域标签提取策略和双解码器框架,在SemanticKITTI和SSCBench-KITTI360上实现最先进的3D语义场景补全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1204.6120 2026-06-03 math.FA cs.IT cs.NA math.IT math.NA 50%

Geometric Separation by Single-Pass Alternating Thresholding

单次交替阈值化的几何分离

Gitta Kutyniok

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对点状和曲线奇异性的分离问题,本文提出并理论分析了基于小波和曲波帧的单次交替阈值化方法,利用簇相干性和几何稀疏性证明了在足够细尺度下可实现任意精确分离。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 8 篇

2606.02842 2026-06-03 cs.LG 82%

Spectral-Progressive Thought Flow for Lightweight Multimodal Reasoning

光谱渐进式思维流:轻量级多模态推理

Yixian Shen, Zhiheng Yang, Qi Bi, Changshuo Wang, Shuai Wang, Jia-Hong Huang, George Floros, Prayag Tiwari, Anuj Pathania

机构 * Informatics Institute, University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学信息学院) Department of Computer Science, University College London(伦敦大学学院计算机科学系) University of Thessaly, Volos, Greece(塞萨洛尼基大学) Department of Electronic and Electrical Engineering, Trinity College Dublin, Dublin, Ireland(都柏林信任学院电子与电气工程系) School of Information Technology, Halmstad University, Halmstad, Sweden(哈姆斯塔德大学信息科技学院) Amazon AGI, Seattle, USA(亚马逊人工智能研究部)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出光谱渐进式思维流(SpecFlow),通过在固定大小离散余弦空间中表示中间视觉思维,并利用无分类器引导将视觉状态更新与文本意图对齐,实现轻量级多模态空间推理,在保持竞争性能的同时将计算和KV缓存成本降低高达2.1倍。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03596 2026-06-03 astro-ph.HE stat.ML 78%

Multimodal Transformer Based Generic Mixture Density Network for Scattering Timescale Estimation of Fast Radio Bursts

基于多模态Transformer的通用混合密度网络用于快速射电暴散射时标估计

Bikash Kharel, Emmanuel Fonseca, Srinjoy Das, Mason Ng, Paul Scholz, Mawson W. Simmons, Lordrick Kahinga, Afrokk Khan

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出多模态Transformer通用混合密度网络(MT-GMDN),通过并行编码器融合FRB动态谱和时间序列特征,利用混合密度公式估计散射时标τ及其分布,在CHIME/FRB数据上达到94%的决定系数和90%的召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
1108.1042 2026-06-03 math.NA cs.NA math.OC 71%

On strong homogeneity of two global optimization algorithms based on statistical models of multimodal objective functions

基于多模态目标函数统计模型的两种全局优化算法的强齐次性

Antanas Zilinskas

专题命中 其他多模态 :multimodal(title)

AI总结 本文提出利用无穷算术实现全局优化算法,并引入强齐次性概念,证明P算法和一步贝叶斯算法具有该性质。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
1108.2126 2026-06-03 cs.RO cs.SY eess.SY math.OC 71%

Multi-Modal Local Sensing and Communication for Collective Underwater Systems

多模态本地感知与通信用于集体水下系统

Serge Kernbach, Tobias Dipper, Donny Sutantyo

专题命中 其他多模态 :multi-modal(title)

AI总结 本文研究集体水下系统中用于网络和集群模式的本地感知与通信,通过模态和子模态通信的特定组合实现多AUV间的专用协作。

Journal ref Proceedings of the 11th International Conference on Mobile Robots and Competitions, Robotica 2011, Lisbon, pp.96-101, 2011

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02589 2026-06-03 stat.ME stat.ML 50%

Rashomon-Seeded Annealing for Robust Bayesian Inference in Factorial Designs

Rashomon播种退火用于因子设计中的鲁棒贝叶斯推断

Yiyang Fan, Soumyakanti Pan, Tyler H. McCormick

专题命中 其他多模态 :multimodal(abstract)

AI总结 针对因子设计中模型不确定性导致的后验多模态和MCMC收敛问题,提出Rashomon播种退火方法,利用Rashomon集作为退火重要性采样的初始分布,实现无需穷举模型空间的完整后验推断。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1102.3089 2026-06-03 math.PR cs.NA math.NA 50%

A Gaussian mixture ensemble transform filter

高斯混合集成变换滤波器

Sebastian Reich

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种基于高斯混合或高斯核密度估计先验分布的集成变换滤波器(EGMF),通过连续贝叶斯滤波分析步骤设计,并在三个测试问题中验证其对非高斯单峰和多模态分布系统的跟踪能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
1203.3523 2026-06-03 eess.SY cs.SY math.OC 50%

Risk Sensitive Path Integral Control

风险敏感路径积分控制

Bart van den Broek, Wim Wiegerinck, Hilbert Kappen

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文证明路径积分方法可直接推广到风险敏感随机最优控制,通过指数加权代价最小化实现风险寻求或风险规避行为,并在非线性多模态控制中展示其效果。

Comments Appears in Proceedings of the Twenty-Sixth Conference on Uncertainty in Artificial Intelligence (UAI2010)

详情

展开后加载摘要…

URL PDF HTML 收藏
1103.0800 2026-06-03 eess.SY cs.SY math.OC 50%

Synthesizing Switching Logic to Minimize Long-Run Cost

合成切换逻辑以最小化长期成本

Susmit Jha, Sanjit A. Seshia, Ashish Tiwari

专题命中 其他多模态 :multi-modal(abstract)

AI总结 针对多模态动力系统,提出一种通过将合成问题转化为无约束数值优化问题来自动生成切换逻辑的方法,以最小化系统长期运行成本。

Comments UC Berkeley Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏