arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-02 至 2026-04-02 共收录 69 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 11 篇

2603.05537 2026-04-02 cs.CV eess.IV 79%

Sketch It Out: Exploring Label-Free Structural Cues for Multimodal Gait Recognition

Sketch It Out: 探索无标签的结构线索用于多模态步态识别

Chao Zhang, Zhuang Zheng, Ruixin Li, Zhanyong Mei

机构 * Chengdu University of Technology(成都理工大学)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出SKETCH作为新的步态识别模态,通过无标签的结构线索提升多模态步态识别性能,实验表明其在SUSTech1K和CCPG数据集上取得优异效果。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08018 2026-04-02 cs.CV 74%

Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared

不再缺失:字典引导的跨模态图像融合在红外缺失情况下的应用

Yafei Zhang, Meng Ma, Huafeng Li, Yu Liu

机构 * Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) Department of Biomedical Engineering, Hefei University of Technology(合肥工业大学生物医学工程系)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

AI总结 本文提出了一种基于共享卷积字典的字典引导框架,解决红外缺失时的跨模态图像融合问题,通过联合字典学习、视觉引导红外推断和自适应融合方法提升感知质量和下游检测性能。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00867 2026-04-02 cs.CV 70%

A 4D Representation for Training-Free Agentic Reasoning from Monocular Laparoscopic Video

一种用于无训练代理推理的4D表示

Maximilian Fehrentz, Nicolas Stellwag, Robert Wiebe, Nicole Thorisch, Fabian Grob, Patrick Remerscheid, Ken-Joel Simmoteit, Benjamin D. Killeen, Christian Heiliger, Nassir Navab

机构 * Computer Aided Medical Procedures, TU Munich(慕尼黑工业大学计算机辅助医疗程序研究所) Hospital of the LMU Munich, Ludwig-Maximilians-Universität (LMU)(慕尼黑大学医院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出一种基于显式4D表示的框架,利用多模态大语言模型实现无训练的手术代理推理,提升时空理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00601 2026-04-02 cs.CV 70%

KG-CMI: Knowledge graph enhanced cross-Mamba interaction for medical visual question answering

KG-CMI: 基于知识图谱的跨Mamba交互用于医学视觉问答

Xianyao Zheng, Hong Yu, Hui Cui, Changming Sun, Xiangyu Li, Ran Su, Leyi Wei, Jia Zhou, Junbo Wang, Qiangguo Jin

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) Tianjin Central Hospital of Gynecology Obstetrics(天津市中心妇产科医院) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) CSIRO Data61(澳大利亚联邦科学与工业研究组织Data61) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Computer Software, Tianjin University(天津大学计算机软件学院) Centre for Artificial Intelligence driven Drug Discovery, Faculty of Applied Science, Macao Polytechnic University(澳门理工大学应用科学学院人工智能驱动药物发现中心) Department of Cardiology, Tianjin Chest Hospital(天津市胸科医院心内科)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出KG-CMI框架,通过整合医学知识图谱提升医学视觉问答的准确性与多样性,实验表明其在三个数据集上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19225 2026-04-02 eess.IV cs.CV 70%

Unified Medical Image Tokenizer for Autoregressive Synthesis and Understanding

统一的医学图像标记器用于自回归合成与理解

Chenglong Ma, Yuanfeng Ji, Jin Ye, Zilong Li, Chenhui Wang, Junzhi Ning, Wei Li, Lihao Liu, Qiushan Guo, Tianbin Li, Junjun He, Hongming Shan

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Stanford University(斯坦福大学) Shanghai AI Laboratory(上海人工智能实验室) ByteDance Seed(字节跳动Seed)

专题命中 多模态训练与对齐 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出MedITok,通过两阶段训练框架统一医学图像标记器,利用大规模未配对图像提升重建精度,并结合图像-文本对注入细粒度语义,实现自回归建模在诊断和生成任务中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00279 2026-04-02 cs.CV cs.AI 62%

The Geometry of Compromise: Unlocking Generative Capabilities via Controllable Modality Alignment

妥协的几何学:通过可控的模态对齐解锁生成能力

Hongyuan Liu, Qinli Yang, Wen Li, Zhong Zhang, Jiaming Liu, Wei Han, Zhili Qin, Jinxia Guo, Junming Shao

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Bristol(布里斯托大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过几何分析揭示模态间隙的两个组成部分,提出TPC-CMA框架以减少两者,显著提升跨模态对齐性能,实验显示在不同目标α下模态间隙大幅降低,同时保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20205 2026-04-02 cs.CV 57%

OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport

OTPrune: 通过最优传输实现分布对齐的视觉令牌剪枝

Xiwen Chen, Wenhui Zhu, Gen Li, Xuanzhao Dong, Yujian Xiong, Hao Wang, Peijie Qiu, Qingquan Song, Zhipeng Wang, Shao Tang, Yalin Wang, Abolfazl Razi

机构 * Morgan Stanley(摩根士丹利) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) Texas A&M University(德克萨斯农工大学) Rice University(莱斯大学) Florida State University(佛罗里达州立大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出OTPrune,通过最优传输对齐视觉表示分布,实现高效的视觉令牌剪枝,提升推理效率并保持表示的稳定性与语义忠实性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 2 篇

2604.00363 2026-04-02 cs.RO cs.CV 57%

A Dual-Stream Transformer Architecture for Illumination-Invariant TIR-LiDAR Person Tracking

一种用于光照不变TIR-LiDAR人体跟踪的双流Transformer架构

Yuki Minase, Kanji Tanaka

机构 * Graduate School of Engineering, University of Fukui(福井大学工学研究科)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种双流Transformer架构,利用LiDAR和TIR摄像头实现全天候鲁棒的人体跟踪,通过知识迁移策略提升性能,实验显示在AO和SR指标上优于传统方法。

Comments 6 pages, 4 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00288 2026-04-02 cond-mat.mtrl-sci cond-mat.mes-hall 50%

Spatially modulated morphotropic phase boundaries in a compressively strained multiferroic thin film

铁电体薄膜中压缩应变引起的空间调制形变相界

Ting-Ran Liu, Xiangwei Guo, Sajid Husain, Maya Ramesh, Pushpendra Gupta, Darrell Schlom, Ramamoorthy Ramesh, Yu-Tsun Shao

专题命中 其他多模态 :multi-modal(abstract)

AI总结 研究发现压缩应变铁电体薄膜中存在两种相界,通过多模态衍射电子显微镜观察到有序双相界和新类型的锯齿状相界,揭示了相界形成与Landau和弹性能量平衡的关系。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏