arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-01 至 2026-04-01 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 13 篇

2603.29211 2026-04-01 cs.AI cs.CL cs.CV 82%

Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems

玄武:将通用多模态模型演进为内容生态系统工业级基础模型

Zhiqian Zhang, Xu Zhao, Xiaoqing Xu, Guangdong Liang, Weijia Wang, Xiaolei Lv, Bo Li, Jun Gao

机构 * Computational Intelligence Dept, Hello Group Inc(Hello Group Inc. 计算智能部)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Xuanwu VL-2B,通过三阶段训练流程平衡业务专精与通用能力,实现7项多模态指标平均67.90分,7项业务审核任务召回率94.38%,在对抗性OCR场景中超越Gemini-2.5-Pro。

Comments 41 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29450 2026-04-01 cs.CV cs.AI 81%

Few-shot Writer Adaptation via Multimodal In-Context Learning

基于多模态上下文学习的少样本作家适应

Tom Simon, Stephane Nicolas, Pierrick Tranouez, Clement Chatelain, Thierry Paquet

机构 * LITIS EA4108, University of Rouen Normandy(LITIS EA4108,鲁昂诺曼底大学) LITIS EA4108, INSA of Rouen Normandy(LITIS EA4108,鲁昂诺曼底国立应用科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于多模态上下文学习的少样本手写体识别框架,通过少量目标作家样本实现推理时的作家适应,无需参数更新,实验在IAM和RIMES数据集上取得优于现有模型的识别效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24680 2026-04-01 cs.CV 79%

ReDiPrune: Relevance-Diversity Pre-Projection Token Pruning for Efficient Multimodal LLMs

ReDiPrune:基于相关性与多样性的预投影令牌剪枝用于高效的多模态大语言模型

An Yu, Ting Yu Tsai, Zhenfei Zhang, Weiheng Lu, Felix X. -F. Ye, Ming-Ching Chang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 ReDiPrune是一种无需训练的预投影令牌剪枝方法,通过选择信息丰富的视觉令牌提升多模态大语言模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22779 2026-04-01 cs.IR cs.AI cs.LG 79%

KARMA: Knowledge-Action Regularized Multimodal Alignment for Personalized Search at Taobao

KARMA:面向淘宝个性化搜索的知识-行动正则化多模态对齐

Zhi Sun, Wenming Zhang, Yi Wei, Liren Yu, Zhixuan Zhang, Dan Ou, Haihong Tang

机构 * Taobao \& Tmall Group of Alibaba Hangzhou China Taobao \& Tmall Group of Alibaba

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 KARMA通过知识-行动正则化多模态对齐框架,解决个性化搜索中知识与行动冲突问题,提升语义可解性与行动指标,实现GMV增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19910 2026-04-01 cs.CV 79%

Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery

通过半监督率减少实现多模态表示学习的通用类别发现

Wei He, Xianghan Meng, Zhiyuan Huang, Xianbiao Qi, Rong Xiao, Chun-Guang Li

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Intellifusion Inc., Shenzhen, P.R. China(深圳云天励飞技术股份有限公司)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出SSR²-GCD框架,通过半监督率减少实现多模态表示学习,提升通用类别发现任务的结构属性和知识迁移能力。

Comments 15 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29968 2026-04-01 cs.CV cs.AI 62%

Trimodal Deep Learning for Glioma Survival Prediction: A Feasibility Study Integrating Histopathology, Gene Expression, and MRI

三模态深度学习在胶质瘤生存预测中的应用:整合组织病理学、基因表达和MRI的可行性研究

Iain Swift, JingHua Ye

机构 * Munster Technological University(芒斯特理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了三模态深度学习在胶质瘤生存预测中的可行性,通过整合组织病理学、基因表达和MRI数据,评估了不同融合策略的效果,发现三模态早期融合在小样本下有初步的预测价值。

Comments 6 pages, 1 figure, submitted to the IEEE CBMS 2026 conference, still waiting for notification

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29410 2026-04-01 cs.CV cs.AI cs.LG 62%

AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models

AGFT:基于对齐的微调以提升视觉-语言模型的零样本对抗鲁棒性

Yubo Cui, Xianchao Guan, Zijun Xiong, Zheng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute, Shenzhen, China(深圳市环域研究所)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AGFT框架,通过概率预测进行文本引导对抗训练,提升视觉-语言模型的零样本对抗鲁棒性,同时保持跨模态语义结构。

Comments Accepted by CVPR 2026; Code is available at \url{https://github.com/YuboCui/AGFT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21223 2026-04-01 cs.CV cs.CL 62%

Sigma: Semantically Informative Pre-training for Skeleton-based Sign Language Understanding

Sigma:基于骨骼的语义信息预训练用于手语理解

Muxin Pu, Mei Kuan Lim, Chun Yong Chong, Chen Change Loy

机构 * School of Information Technology, Monash University(莫纳什大学信息技术学院) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 Sigma提出一种统一的骨骼手语理解框架,通过语义对齐学习和预训练策略提升手语识别与翻译性能,展现语义信息预训练在多语言手语任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29784 2026-04-01 cs.CV 57%

MAPLE: Multi-Path Adaptive Propagation with Level-Aware Embeddings for Hierarchical Multi-Label Image Classification

MAPLE:多路径自适应传播与层次感知嵌入用于层次多标签图像分类

Boshko Koloski, Marjan Stoimchev, Jurica Levatić, Dragi Kocev, Sašo Džeroski

机构 * Jožef Stefan Institute(约热夫·斯特凡研究所) Jožef Stefan International Postgraduate School(约热夫·斯特凡国际研究生院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 MAPLE通过结合层次语义初始化、图结构编码和自适应多模态融合,有效提升遥感图像的层次多标签分类性能,在少样本场景下提升42%,参数开销仅增加2.6%。

Comments REO: Advances in Representation Learning for Earth Observation, accepted workshow paper at EurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29414 2026-04-01 cs.CV cs.RO 57%

Native-Domain Cross-Attention for Camera-LiDAR Extrinsic Calibration Under Large Initial Perturbations

本域交叉注意机制用于大初始扰动下的相机-激光雷达外校准

Ni Ou, Zhuo Chen, Xinru Zhang, Junzheng Wang

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Integrated Circuits and Electronics, Beijing Institute of Technology(北京理工大学集成电路与电子学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种本域交叉注意机制,通过直接对齐图像块和激光雷达点云实现可靠的跨模态交互,提升在大初始扰动下的外校准精度和鲁棒性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29478 2026-04-01 physics.ao-ph 50%

30-meter Land Surface Temperature from Landsat via Progressive Self-Training Downscaling

基于Landsat的30米地表温度降尺度方法

Huanfeng Shen, Chan Li, Menghui Jiang, Penghai Wu, Guanhao Zhang, Tian Xie

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出一种渐进自训练框架,通过交叉模态融合网络在无需高精度地面数据的情况下,将Landsat地表温度降尺度至30米分辨率,提升了空间分辨率和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29354 2026-04-01 eess.SP cs.SY eess.SY stat.ME 50%

ARC: Alignment-based RPM Estimation with Curvature-adaptive Tracking

基于对齐的无转速计转速估计与曲率自适应跟踪

Weiheng Hua, Changyu Hao

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出ARC方法,通过统一观测表示融合多个估计器,利用曲率感知的状态依赖运动先验,实现稳定且物理合理的轨迹估计,验证了不确定性感知的时间传播的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29205 2026-04-01 cs.HC 50%

BiMoE: Brain-Inspired Experts for EEG-Dominant Affective State Recognition

BiMoE:受脑启发的专家用于EEG主导的情感状态识别

Hongyu Zhu, Lin Chen, Mingsheng Shang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 BiMoE通过脑拓扑感知划分EEG信号,利用双流编码器提取局部和全局时空特征,结合多尺度大核卷积处理PPS,动态融合专家并通过联合损失函数提升多模态情感分类性能。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏