arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-17 至 2026-04-17 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 8 篇

2604.14218 2026-04-17 cs.CL cs.AI 84%

MEME-Fusion@CHiPSAL 2026: Multimodal Ablation Study of Hate Detection and Sentiment Analysis on Nepali Memes

MEME-Fusion@CHiPSAL 2026: 多模态消融研究:尼泊尔表情包中的仇恨检测与情感分析

Samir Wagle, Reewaj Khanal, Abiral Adhikari

机构 * Department of Computer Science and Engineering, Kathmandu University(加德满都大学计算机科学与工程系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文针对尼泊尔表情包中的仇恨检测与情感分析,提出融合CLIP与BGE-M3的多模态注意力融合架构,通过消融研究发现英文中心视觉模型在尼泊尔语 script 上表现不佳,且数据稀缺时传统集成方法效果下降。

Comments PrePrint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17417 2026-04-17 cs.LG cs.AI 83%

Generative Modeling of Class Probability for Multi-Modal Representation Learning

多模态表示学习中的类别概率生成建模

Jungkyoo Shin, Bumsoo Kim, Eunwoo Kim

机构 * Department of AI(人工智能系) School of CSE(计算机科学与工程学院) Chung-Ang University(Chung-Ang 大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出了一种基于类别概率分布的多模态表示学习方法CALM,通过生成和对齐类别概率分布提升多模态对齐效果,并引入跨模态概率变分自编码器以增强模态间关系的建模能力。

Comments To appear in CVPR 2025 (Highlight)

Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR), 2025, pp. 20737-20746

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22185 2026-04-17 cs.CV 79%

Beyond Augmentation: Cross-Modal Transformer Fusion with Bi-directional Attention for Low-Data Aneurysm Screening

超越增强:基于双向注意力的跨模态Transformer融合用于低数据动脉瘤筛查

Antara Titikhsha, Divyanshu Tak

机构 * Carnegie Mellon University(卡内基梅隆大学) Artificial Intelligence in Medicine (AIM) Program(医学人工智能(AIM)项目) Mass General Brigham(马萨诸塞总医院) Harvard Medical School(哈佛医学院) Department of Radiation Oncology(放射肿瘤科) Dana-Farber Cancer Institute(达纳-法伯癌症研究所) Brigham and Women’s Hospital(布里洛妇产科医院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出CMTF-Net,通过跨模态目标融合框架实现解剖结构化的动脉瘤筛查,采用14个血管区域独立监督,提升低数据场景下的检测精度与可解释性。

Comments We had major improvements in this second draft. Please refer to this version only

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14839 2026-04-17 cs.IR 78%

Well Begun is Half Done: Training-Free and Model-Agnostic Semantically Guaranteed User Representation Initialization for Multimodal Recommendation

万事开头难:免训练 且模型无关的语义保证用户表示初始化方法用于多模态推荐

Jinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li, Hewei Wang, Jianheng Tang, Wei Wang, Xiping Hu, Edith C. H. Ngai

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出SG-URInit方法,通过整合用户交互物品的模态特征和全局聚类特征,实现免训练且模型无关的用户表示初始化,有效提升多模态推荐性能并缓解物品冷启动问题。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11066 2026-04-17 cs.IR 78%

Decoupled Multimodal Fusion for User Interest Modeling in Click-Through Rate Prediction

解耦多模态融合用于点击通过率预测中的用户兴趣建模

Alin Fan, Hanqing Li, Sihan Lu, Jingsong Yuan, Jiandong Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出解耦多模态融合方法,通过构建目标感知特征和优化注意力机制,提升用户兴趣建模效果,实验表明在公开和工业数据集上均取得显著提升。

Comments Accepted by ICDE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14520 2026-04-17 cs.CV 70%

Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs

模态链:从静态融合到动态编排在多模态大语言模型中

Ziyang Luo, Nian Liu, Junwei Han

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 多模态训练与对齐 :multimodal(abstract);omni-modal(abstract);分类 cs.CV

AI总结 本文提出CoM框架,通过动态编排解决多模态融合的静态融合问题,提升模型在不同任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14568 2026-04-17 cs.CV cs.CL 62%

Learning Adaptive Reasoning Paths for Efficient Visual Reasoning

学习高效的视觉推理路径

Yixu Huang, Tinghui Zhu, Muhao Chen

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出AVR框架,通过分解视觉推理为三个认知功能,动态选择响应格式,减少推理冗余,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14168 2026-04-17 cs.CL cs.AI 62%

SAGE Celer 2.6 Technical Card

SAGE Celer 2.6 技术卡片

SAGEA Research Team, Basab Jha, Firoj Paudel, Ujjwal Puri, Adrian Liu, Ethan Henkel, Zhang Yuting, Mateusz Kowalczyk, Mei Huang, Choi Donghyuk, Wang Junhao

机构 * SAGEA Tribhuwan University(特里布文大学) Vedas College(维达斯学院) Madan Bhandari Memorial College(马达恩·巴恩迪纪念学院) Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 SAGE Celer 2.6 通过逆向推理管道优化逻辑路径,支持多模态功能,并针对南亚语言进行优化,在数学、编程和一般智能基准测试中表现优异。

Comments 28 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏