arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-05 至 2026-06-05 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 14 篇

2606.06485 2026-06-05 cs.CV 89%

PAR3D: A Unified 3D-MLLM with Part-Aware Representation for Scene Understanding

PAR3D: 一种用于场景理解的统一部件感知3D多模态大语言模型

Shaohui Dai, Yansong Qu, You Shen, Shengchuan Zhang, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 多模态训练与对齐 :MLLM(title,summary_cn);multimodal(abstract);分类 cs.CV

AI总结 提出PAR3D框架,通过部件感知3D表示学习和层次化分割查询生成,解决现有3D-MLLM在细粒度部件理解上的不足,在部件级问答和指代分割任务上取得显著提升。

Comments Project page: https://atrovast.github.io/PAR3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27343 2026-06-05 cs.CV 83%

JI-ADF: Joint-Individual Learning with Adaptive Decision Fusion for Multimodal Skin Lesion Classification

JI-ADF:联合-个体学习与自适应决策融合用于多模态皮肤病变分类

Phan Nguyen, Dat Cao, Hien Kha, Hien Chu, Minh Le, Trang Pham, Nguyen Quoc Khanh Le

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出JI-ADF框架,通过整合皮肤镜图像、临床照片和结构化患者数据,实现基于临床的皮肤病变分类,采用多模态表示学习和自适应决策融合机制,提升跨模态推理能力,并在MILK10k数据集上验证了其在实际临床场景中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05718 2026-06-05 cs.CV cs.AI cs.LG 81%

ViCuR: Visual Cues as Recoverable Privilege for Multimodal On-Policy Distillation

ViCuR: 视觉线索作为多模态在策略蒸馏中的可恢复特权

Kanghui Tian, Siyuan Liu, Ziang Yan, Sheng Xia, Shuai Dong, Yi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Nanjing University(南京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出ViCuR框架,通过将教师特权从答案侧替换为输入中的视觉线索,并引入轻量级线索恢复模块,解决多模态在策略蒸馏中的训练-测试不匹配问题,在七个基准上显著提升学生模型性能。

Comments 25 pages, 11 figures. Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06328 2026-06-05 cs.LG cs.AI 79%

PAMF: Prior-Aware Multimodal Fusion for Incomplete Time Series Data

PAMF: 面向不完整时间序列数据的先验感知多模态融合

Ziwen Kan, Wugeng Zheng, Tianlong Chen, Song Wang

机构 * Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系) Department of Computer Science, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出PAMF框架,通过先验感知流匹配和权重共享显式处理模态内缺失和模态级缺失,将插补与下游预测耦合,提升多模态医疗时间序列任务性能。

Comments 5 figures. arXiv preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26761 2026-06-05 cs.CV 79%

Once-For-All: A Train-Once and Select-Anytime Framework for Multimodal Instruction Tuning

Once-For-All: 一种用于多模态指令微调的“一次训练,随时选择”框架

Mingkang Dong, Hongyi Cai, Xiwen Lei, Jie Li, Tao Zhang, Muxin Pu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出OFA框架,通过一次训练可迁移的选择器,无需重新计算即可从任意数据集或模型中筛选出最具信息量的多模态指令数据,实现高效微调。

Comments 15 pages, 6 figures. Mingkang Dong and Hongyi Cai contributed equally to this work. Muxin Pu is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06102 2026-06-05 cs.AI cs.LG 74%

Step-adaptive multimodal fusion network with multi-scale cloud feature learning for ultra-short-term solar irradiance forecasting

步进自适应多模态融合网络与多尺度云特征学习用于超短期太阳辐照度预测

Jingxin Zhang Xiaoqin Wang

机构 * School of Automation, Southeast University(自动化学院,东南大学)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.AI

AI总结 提出一种步进自适应多模态融合网络,通过InceptionNeXt提取多尺度云特征、步进自适应低频补偿单元动态调整低频信息,并结合气象时间序列特征进行超短期太阳辐照度预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05491 2026-06-05 cs.CV cs.RO 72%

Unpaired RGB-Thermal Gaussian-Splatting Using Visual Geometric Transformers

无配对RGB-热成像高斯泼溅使用视觉几何变换器

Jean Cordonnier, Chenghao Xu, Olga Fink, Malcolm Mielle

机构 * Ecole Polytechnique Federale de Lausanne(瑞士联邦理工学院洛桑分校) Schindler EPFL Lab(施耐德EPFL实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract,comments);cross-modal(abstract);分类 cs.CV

AI总结 提出一种无配对RGB-热成像新视角合成框架,利用VGGT估计各模态相机位姿并通过Procrustes对齐,结合多模态3D高斯泼溅实现联合重建,在保持RGB保真度的同时实现热成像视图合成。

Comments Accepted at ICRA 2026's Workshop MM-SpatialAI: Multi-Modal Spatial AI for Robust Navigation and Open-World Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05455 2026-06-05 cs.CV 70%

Disentangled Fine-Grained Prototype Learning for Incomplete Image-Tabular Classification

面向不完整图像-表格分类的解缠细粒度原型学习

Feixiang Zhou, Jianyang Xie, Zhuangzhi Gao, Qinkai Yu, Fu Wang, Yuheng Fan, Jing Li, Zheheng Jiang, Yitian Zhao, Yanda Meng, He Zhao, Gregory Y. H. Lip, Yalin Zheng

机构 * School of Eye and Vision Sciences, University of Liverpool, U.K.(利物浦大学眼科与视觉科学学院) Department of Cardiovascular and Metabolic Medicine, University of Liverpool, U.K.(利物浦大学心血管与代谢医学系) School of Computer Science, University of Exeter, U.K.(埃克塞特大学计算机科学学院) School of Computer Science and Engineering, South China University of Technology, China(华南理工大学计算机科学与工程学院) School of Computing and Mathematical Sciences, University of Leicester, U.K.(莱斯特大学计算科学与数学科学学院) Ningbo Institute of Industrial Technology, Chinese Academy of Sciences, China(中国科学院宁波工业技术研究所) Bioengineering Program, Biological and Environmental Science and Engineering Division (BESE), King Abdullah University of Science and Technology (KAUST), Saudi Arabia(卡尔斯塔德大学科学与技术学院(KAUST)生物工程项目,沙特阿拉伯)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对图像-表格多模态学习中缺失模态问题,提出DFPL框架,通过共享-特定原型建模、原型级解缠和细粒度对齐,实现鲁棒分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05232 2026-06-05 cs.LG cs.AI 70%

Differentiable Efficient Operator Search

可微分高效算子搜索

Xiaohuan Pei, Jiyuan Zhang, Yuanfan Guo, Weiguo Feng, Tao Huang, Cho-Jui Hsieh, Chang Xu

机构 * The University of Sydney(悉尼大学) ByteDance(字节跳动) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 提出可微分高效算子搜索框架,统一解释多种token缩减算子,通过联合搜索缩减位置、保留数量和算子行为,在预算约束下优化多模态模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00054 2026-06-05 cs.CV cs.AI 62%

HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling

HiDe: 通过分层解耦重新思考高分辨率MLLMs中的Zoom-IN方法

Xianjie Liu, Yiman Hu, Yixiong Zou, Liang Wu, Jian Xu, Bo Zheng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HiDe框架,通过分层解耦方法解决高分辨率图像中背景干扰导致的视觉理解问题,提升多模态大语言模型在高分辨率图像任务中的性能。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14028 2026-06-05 cs.CV 57%

Unified Pix Token And Word Token Generative Language Model

统一像素标记与词标记的生成语言模型

Haun Leung, ZiNan Wang

机构 * Buaa.edu.cn(北京航空航天大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种统一像素标记和词标记的生成语言模型,通过引入图像无监督预训练、颜色折叠、全局条件注意力近似等方法,提升模型在图像细节识别上的能力,实验表明该模型在小模型和有限数据下仍表现优异。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21218 2026-06-05 cs.CV 57%

Latent Implicit Visual Reasoning

潜在隐式视觉推理

Kelvin Li, Chuyi Shang, Leonid Karlinsky, Rogerio Feris, Trevor Darrell, Roei Herzig

机构 * University of California, Berkeley(加州大学伯克利分校) Xero MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种任务无关的机制,训练大规模多模态模型(LMMs)在无需显式中间监督的情况下发现和使用潜在视觉推理标记,从而在多种视觉中心任务中优于直接监督微调,并在不使用辅助图像、边界框、图像裁剪、深度图或思维链注释的情况下,与或优于先前基于文本和显式视觉中间推理方法相媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20158 2026-06-05 cs.CV 57%

Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMs

在安全对齐的连续视觉指令微调中实现和谐参数适应

Ziqi Wang, Chang Che, Qi Wang, Hui Ma, Zenglin Shi, Cees G. M. Snoek, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了在安全对齐的连续视觉指令微调中如何平衡安全性和任务性能,提出了一种名为和谐参数适应(HPA)的后训练框架,通过参数分区、平衡选择和正交调整来缓解遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06288 2026-06-05 stat.ML cs.LG 50%

Discrete Causal Representations from Heterogeneous Domains: A Bayesian Approach with Social Survey Applications

来自异构域的离散因果表示:一种贝叶斯方法及其在社会调查中的应用

Ankur Garg, Michael Stettler, Aaron Schein, Julius von Kügelgen

机构 * Department of Statistics, University of Chicago(芝加哥大学统计学系) University of Tübingen(图宾根大学) Department of Statistics & Data Science Institute, University of Chicago(芝加哥大学统计学与数据科学研究所) Seminars for Statistics, ETH Zürich(苏黎世联邦理工学院统计系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出一种贝叶斯方法,从多环境数据中学习离散因果概念,通过序贯蒙特卡洛采样近似多模态后验,并在社会调查数据中验证了其推断有意义的高层概念和因果关系的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏