arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-29 至 2026-06-29 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 14 篇

2606.25034 2026-06-29 cs.CV cs.AI 新提交 88%

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

Yuvion VL:面向对抗性内容和AI安全的多模态基础模型

Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian Li, Yiliang Zhang, Guanghui Wang, Ziheng Wang, Ziwen Xu, Zhaoyu Fan, Jinhao Chen, Ruijie Jian, Hongxing Li, Chuxi Xiao, Xinyue Chen, Wenxuan Liu, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Dongjie Zhang, Yangfan Zhou, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Huiming Zhang, Wei Wang, Xipeng Cao, Jialun Chen, Xiao Chen, Shaola Ren, Yunqing Hu, Bin Li, Chengwen Yao, Meng Huang, Xianfeng Li, Bin Tang, Chao Liu, Hui Xue, Longtao Huang, Haiwen Hong

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(title);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出Yuvion VL系列多模态大语言模型,通过对抗性感知数据合成、三阶段训练和混淆对比微调,在内容和AI安全任务上达到行业领先性能,同时保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03710 2026-06-29 cs.CV cs.AI 版本更新 84%

MPFlow: Multi-modal Posterior-Guided Flow Matching for Zero-Shot MRI Reconstruction

MPFlow: 多模态后验引导的流匹配用于零样本MRI重建

Seunghoi Kim, Chen Jin, Henry F. J. Tregidgo, Matteo Figini, Daniel C. Alexander

机构 * 1 Hawkes Institute, UCL \, 2 Dept. of Medical Physics Biomedical Engineering, UCL 3 Dept. of Computer Science, UCL 4 Centre for AI, DS\&AI, AstraZeneca, UK

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出MPFlow框架,利用自监督预训练PAMRI学习跨模态共享表示,在推理时通过数据一致性和特征对齐引导采样,减少幻觉并提升零样本MRI重建效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01588 2026-06-29 cs.LG cs.AI 版本更新 83%

Spectral Text Fusion: A Frequency-Aware Approach to Multimodal Time-Series Forecasting

频谱文本融合:一种频率感知的多模态时间序列预测方法

Huu Hiep Nguyen, Minh Hoang Nguyen, Dung Nguyen, Hung Le

机构 * Applied Artificial Intelligence Initiative(应用人工智能计划) Deakin University(迪金大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 提出SpecTF框架,通过频谱分解将文本信息与时间序列在频域融合,利用轻量级交叉注意力机制自适应重加权频带,显著提升多模态时间序列预测性能。

Comments Accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08668 2026-06-29 eess.SP 版本更新 82%

Beyond Information Redundancy: Expanding Cross-Modal Knowledge Representation for Power Load Time Series Forecasting

PrismNet:通过多模态棱镜解读时间序列以实现可解释的电力负荷预测

Yuxuan Chen, Shuo Dai, Ruoyi Xu, Haipeng Xie

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multi-modal(abstract)

AI总结 PrismNet通过多模态增强模块和PID引导的多模态对比学习,提升电力负荷预测的可解释性与少样本学习能力,在实际数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26629 2026-06-29 cs.LG 版本更新 82%

Context-specific Credibility-aware Multimodal Fusion with Conditional Probabilistic Circuits

基于条件概率电路的上下文特定可信感知多模态融合

Pranuthi Tenali, Sahil Sidheekh, Saurabh Mathur, Erik Blasch, Kristian Kersting, Sriraam Natarajan

机构 * Department of Computer Science , TU Darmstadt(德累斯顿技术大学计算机科学系) Air Force Research Lab(空军研究实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出C$^2$MF框架,利用条件概率电路建模实例级源可靠性,通过KL散度度量上下文特定信息可信度,在跨模态冲突下提升预测准确率高达29%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27484 2026-06-29 cs.CV 新提交 79%

Fine-tuning a multimodal large language model for clinician-grade autism behavioral scoring from short home videos

微调多模态大语言模型用于从短视频中对自闭症行为进行临床级评分

Mohammadmahdi Honarmand, Parnian Azizian, Aaron Kline, Kae Nurge, Zerin Nasrin Tumpa, Saimourya Surabhi, Kaitlyn Dunlap, Yang Qian, Ali Kargarandehkordi, Sameer Neupane, Peter Washington, Dennis P. Wall

机构 * Stanford University(斯坦福大学) University of Hawaii at Manoa(夏威夷大学马诺阿分校) University of California San Francisco(加利福尼亚大学旧金山分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 微调Gemini 2.5 Pro模型,从400个临床评分的家庭视频中提取30个行为特征,在99名儿童上实现与临床医生评分的一致性提升40%,并零样本达到53%的自闭症诊断F1提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20196 2026-06-29 cs.AI 版本更新 79%

Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning

面向选择性多模态大语言模型遗忘的良性记忆遗忘

Zhen Zeng, Leijiang Gu, Zhangling Duan, Feng Li, Cees G. M. Snoek, Meng Wang, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型隐私泄露问题,提出S-MLLMUn Bench基准和SMFA框架,实现精确删除敏感知识同时保持模型基础能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27947 2026-06-29 cs.CV 新提交 77%

Understanding How MLLMs Describe Artworks Using Token Activation Maps

理解多模态大语言模型如何通过Token激活图描述艺术品

Nicola Fanelli, Pasquale De Marinis, Raffaele Scaringi, Eva Cetinic, Gennaro Vessio, Giovanna Castellano

机构 * University of Bari Aldo Moro(巴里阿尔多莫罗大学) University of Zurich(苏黎世大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 使用Token激活图(TAM)分析MLLMs在描述艺术品时对视觉区域的依赖,发现不同语义类别的token在视觉基础上有显著差异,并比较了TAM与SAM~3开放词汇分割。

Comments Accepted at PRESTIGE workshop at ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22709 2026-06-29 cs.CV cs.AI 版本更新 62%

Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs

基于置信度蒸馏的门控关系对齐用于高效视觉语言模型

Yanlong Chen, Amirhossein Habibian, Luca Benini, Yawei Li

机构 * Department of Information Technology(信息科技系) Electrical Engineering, ETH Zurich, Zurich, Switzerland(电气工程,苏黎世联邦理工学院,苏黎世,瑞士) Qualcomm AI Research, Amsterdam, the Netherlands(高通人工智能研究,阿姆斯特丹,荷兰) Department of Electrical, Electronic and Information Engineering(电气、电子与信息工程系) University of Bologna, Bologna, Italy(博洛尼亚大学,博洛尼亚,意大利) School of Electrical and Electronic Engineering(电气与电子工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出GRACE框架,通过信息瓶颈原理统一知识蒸馏与量化感知训练,使用置信度门控解耦蒸馏、关系中心核对齐和自适应控制器,在INT4量化下实现性能超越FP16基线并接近教师模型,同时显著降低内存和提升吞吐量。

Comments Accepted to the International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27773 2026-06-29 cs.CV 新提交 57%

ModaFlow: Modality-Aware Flow Matching for High-Fidelity Virtual Try-On

ModaFlow: 模态感知流匹配实现高保真虚拟试穿

Xiangyu Sai, Meysam Madadi, Sergio Escalera, Yong Xu

机构 * South China University of Technology(华南理工大学) Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) Guangdong Provincial Key Laboratory of Multimodal Big Data Intelligent Analysis(广东省多模态大数据智能分析重点实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出ModaFlow框架,通过模态感知引导、正则化损失和掩码操作策略,在虚拟试穿中实现衣物细节与人体几何的精确对齐,FID降低约30%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23951 2026-06-29 cs.CV 版本更新 57%

HunyuanImage 3.0 Technical Report

HunyuanImage 3.0 技术报告

Tencent Hunyuan Foundation Model Team

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 HunyuanImage 3.0是一种统一多模态理解与生成的自回归模型,通过精心数据整理、先进架构、原生思维链、渐进预训练和激进后训练,训练出超800亿参数MoE模型(推理时激活130亿),在文本-图像对齐和视觉质量上媲美最先进模型,并开源代码和权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27984 2026-06-29 cs.LG 新提交 50%

Dual-Learning based Penalized Multi-Align Clustering for Multi-View Incomplete and Disorderly Data

基于对偶学习的惩罚多对齐聚类用于多视图不完整与无序数据

Liang Zhao, Shubin Ma, Bo Xu, Qingchen Zhang

机构 * Dalian University of Technology(大连理工大学) Hainan University(海南大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对多模态数据的不完整和时间异步问题,提出基于对偶学习的惩罚多对齐聚类模型(DLPMAC),通过对偶学习保持语义和结构一致性,并利用惩罚机制实现多对多数据对齐,提升对齐精度并避免数据聚合。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27811 2026-06-29 cs.RO 新提交 50%

LXD-SLAM: LiDAR+X Dense SLAM with $\sum_{i=0}^{5}C_5^i$ Configurable Sensor Combinations

LXD-SLAM:基于LiDAR+X的密集SLAM,支持∑_{i=0}^{5}C_5^i种可配置传感器组合

Zhong Wang, Lin Zhang, Linfei Li, Ying Shen, Shaoming Zhang, Pengcheng Shi, Shengjie Zhao

机构 * Tongji University(同济大学) Wuhan University(武汉大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 提出LXD-SLAM,一种以3D LiDAR为中心的多传感器融合框架,支持32种传感器组合,通过统一的迭代误差状态卡尔曼滤波和混合位姿图实现高保真、全局一致的密集建图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19785 2026-06-29 eess.SP 版本更新 50%

Radar and Acoustic Sensor Fusion using a Transformer Encoder for Robust Drone Detection and Classification

基于Transformer编码器的雷达与声学传感器融合用于鲁棒的无人机检测与分类

Gevindu Ganganath, Pasindu Sankalpa, Samal Punsara, Demitha Pasindu, Chamira U. S. Edussooriya, Ranga Rodrigo, Udaya S. K. P. Miriya Thanthrige

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 针对无人机入侵安全问题,提出雷达与声学传感器融合的Transformer编码器方法,利用原始声学信号减少参数,在户外实验中优于现有技术。

Comments Accepted at IEEE 12$^{\text{th}}$~Moratuwa Engineering Research Conference 2026 (MERCon 2026)

Journal ref IEEE 12th Moratuwa Engineering Research Conference 2026 (MERCon 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏