arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-02 至 2026-04-02 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 11 篇

2603.24327 2026-04-02 cs.CV 86%

Le MuMo JEPA: Multi-Modal Self-Supervised Representation Learning with Learnable Fusion Tokens

Le MuMo JEPA:多模态自监督表示学习中的可学习融合标记

Ciem Cornelissen, Sam Leroux, Pieter Simoens

机构 * IDLab, Department of Information Technology, Ghent University - imec(根特大学-imec信息技术系IDLab)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract,comments);multimodal(abstract);分类 cs.CV

AI总结 本文提出Le MuMo JEPA框架,通过学习融合标记实现多模态统一表示学习,实验显示其在性能与效率之间取得最佳平衡,尤其在CenterNet检测和密集深度估计中表现优异。

Comments 14 pages, 4 figures, supplementary material. Accepted at the CVPR 2026 Workshop on Unified Robotic Vision with Cross-Modal Sensing and Alignment (URVIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00234 2026-04-02 cs.CL cs.AI 84%

OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion

OmniFusion: 通过模块融合实现多语言多模态翻译

Sai Koneru, Matthias Huck, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) SAP SE(SAP公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OmniFusion系统,通过融合预训练多模态基础模型与翻译LLM,实现语音、语音加图像及文本加图像的多语言多模态翻译,降低SimulST延迟并提升翻译质量。

Comments Revised submission in review for ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20146 2026-04-02 cs.CV 83%

VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection

VMAD:视觉增强的多模态大语言模型用于零样本异常检测

Huilin Deng, Hongchen Luo, Wei Zhai, Yang Cao, Yu Kang

机构 * University of Science and Technology of China(中国科学技术大学) Northeastern University(东北大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 VMAD通过结合视觉信息与多模态大语言模型,提升零样本异常检测的精度与分析能力,提出缺陷敏感结构学习和局部增强令牌压缩等方法,结合RIAD数据集验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01184 2026-04-02 cs.CV 79%

Object Affordance Recognition and Grounding via Multi-scale Cross-modal Representation Learning

基于多尺度跨模态表示学习的对象 affordance 识别与定位

Xinhang Wan, Dongqiang Gou, Xinwang Liu, En Zhu, Xuming He

机构 * National University of Defense Technology(国防科技大学) ShanghaiTech University(上海科技大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种新的方法,通过学习 affordance 意识的 3D 表示和分阶段推理策略,解决对象 affordance 定位与分类任务中的依赖关系建模问题,提升识别效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05537 2026-04-02 cs.CV eess.IV 79%

Sketch It Out: Exploring Label-Free Structural Cues for Multimodal Gait Recognition

Sketch It Out: 探索无标签的结构线索用于多模态步态识别

Chao Zhang, Zhuang Zheng, Ruixin Li, Zhanyong Mei

机构 * Chengdu University of Technology(成都理工大学)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出SKETCH作为新的步态识别模态,通过无标签的结构线索提升多模态步态识别性能,实验表明其在SUSTech1K和CCPG数据集上取得优异效果。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08018 2026-04-02 cs.CV 74%

Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared

不再缺失:字典引导的跨模态图像融合在红外缺失情况下的应用

Yafei Zhang, Meng Ma, Huafeng Li, Yu Liu

机构 * Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) Department of Biomedical Engineering, Hefei University of Technology(合肥工业大学生物医学工程系)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

AI总结 本文提出了一种基于共享卷积字典的字典引导框架,解决红外缺失时的跨模态图像融合问题,通过联合字典学习、视觉引导红外推断和自适应融合方法提升感知质量和下游检测性能。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00867 2026-04-02 cs.CV 70%

A 4D Representation for Training-Free Agentic Reasoning from Monocular Laparoscopic Video

一种用于无训练代理推理的4D表示

Maximilian Fehrentz, Nicolas Stellwag, Robert Wiebe, Nicole Thorisch, Fabian Grob, Patrick Remerscheid, Ken-Joel Simmoteit, Benjamin D. Killeen, Christian Heiliger, Nassir Navab

机构 * Computer Aided Medical Procedures, TU Munich(慕尼黑工业大学计算机辅助医疗程序研究所) Hospital of the LMU Munich, Ludwig-Maximilians-Universität (LMU)(慕尼黑大学医院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出一种基于显式4D表示的框架,利用多模态大语言模型实现无训练的手术代理推理,提升时空理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00601 2026-04-02 cs.CV 70%

KG-CMI: Knowledge graph enhanced cross-Mamba interaction for medical visual question answering

KG-CMI: 基于知识图谱的跨Mamba交互用于医学视觉问答

Xianyao Zheng, Hong Yu, Hui Cui, Changming Sun, Xiangyu Li, Ran Su, Leyi Wei, Jia Zhou, Junbo Wang, Qiangguo Jin

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) Tianjin Central Hospital of Gynecology Obstetrics(天津市中心妇产科医院) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) CSIRO Data61(澳大利亚联邦科学与工业研究组织Data61) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Computer Software, Tianjin University(天津大学计算机软件学院) Centre for Artificial Intelligence driven Drug Discovery, Faculty of Applied Science, Macao Polytechnic University(澳门理工大学应用科学学院人工智能驱动药物发现中心) Department of Cardiology, Tianjin Chest Hospital(天津市胸科医院心内科)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出KG-CMI框架,通过整合医学知识图谱提升医学视觉问答的准确性与多样性,实验表明其在三个数据集上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19225 2026-04-02 eess.IV cs.CV 70%

Unified Medical Image Tokenizer for Autoregressive Synthesis and Understanding

统一的医学图像标记器用于自回归合成与理解

Chenglong Ma, Yuanfeng Ji, Jin Ye, Zilong Li, Chenhui Wang, Junzhi Ning, Wei Li, Lihao Liu, Qiushan Guo, Tianbin Li, Junjun He, Hongming Shan

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Stanford University(斯坦福大学) Shanghai AI Laboratory(上海人工智能实验室) ByteDance Seed(字节跳动Seed)

专题命中 多模态训练与对齐 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出MedITok,通过两阶段训练框架统一医学图像标记器,利用大规模未配对图像提升重建精度,并结合图像-文本对注入细粒度语义,实现自回归建模在诊断和生成任务中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00279 2026-04-02 cs.CV cs.AI 62%

The Geometry of Compromise: Unlocking Generative Capabilities via Controllable Modality Alignment

妥协的几何学:通过可控的模态对齐解锁生成能力

Hongyuan Liu, Qinli Yang, Wen Li, Zhong Zhang, Jiaming Liu, Wei Han, Zhili Qin, Jinxia Guo, Junming Shao

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Bristol(布里斯托大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过几何分析揭示模态间隙的两个组成部分,提出TPC-CMA框架以减少两者,显著提升跨模态对齐性能,实验显示在不同目标α下模态间隙大幅降低,同时保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20205 2026-04-02 cs.CV 57%

OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport

OTPrune: 通过最优传输实现分布对齐的视觉令牌剪枝

Xiwen Chen, Wenhui Zhu, Gen Li, Xuanzhao Dong, Yujian Xiong, Hao Wang, Peijie Qiu, Qingquan Song, Zhipeng Wang, Shao Tang, Yalin Wang, Abolfazl Razi

机构 * Morgan Stanley(摩根士丹利) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) Texas A&M University(德克萨斯农工大学) Rice University(莱斯大学) Florida State University(佛罗里达州立大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出OTPrune,通过最优传输对齐视觉表示分布,实现高效的视觉令牌剪枝,提升推理效率并保持表示的稳定性与语义忠实性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏