arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-10 至 2026-04-10 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 10 篇

2604.08333 2026-04-10 cs.CV cs.AI cs.LG 84%

Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification

迷失在喧嚣中:揭示并剖析医学多模态大语言模型在图像分类中的性能退化

Xun Zhu, Fanbin Mo, Xi Chen, Kaili Zheng, Shaoshuai Yang, Yiming Shi, Jian Gao, Miao Li, Ji Wu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了医学多模态大语言模型在图像分类中的性能退化问题,通过实验和特征探查揭示了四个失败模式,并提出了量化评分用于评估特征演变的健康状况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07812 2026-04-10 cs.CV 83%

HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models

HAWK:多模态模型中的头部重要性感知视觉标记修剪

Qihui Zhu, Tao Zhang, Yuchen Wang, Zijian Wen, Mengjie Zhang, Shuangwu Chen, Xiaobin Tan, Jian Yang, Yang Liu, Zhenhua Dong, Xianzhi Yu, Yinfei Pan

机构 * University of Science and Technology of China(中国科学技术大学) ChangXin Memory Technologies, Inc(长鑫存储技术有限公司) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 HAWK通过识别不同注意力头在视觉任务中的重要性,有效保留关键视觉标记,提升多模态模型的推理效率与性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08089 2026-04-10 cs.SE 78%

GALA: Multimodal Graph Alignment for Bug Localization in Automated Program Repair

GALA: 多模态图对齐用于自动化程序修复中的缺陷定位

Zhuoyao Liu, Zhengran Zeng, Shu-Dong Huang, Yang Liu, Shikun Zhang, Wei Ye

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 GALA通过多模态图对齐方法,解决GUI截图场景下自动化程序修复的缺陷定位问题,通过结构化推理提升视觉与代码的映射精度。

Comments Code available at: https://github.com/lzyyyyy666/GALA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08065 2026-04-10 cs.LG 78%

Multimodal Latent Reasoning via Predictive Embeddings

通过预测嵌入进行多模态潜在推理

Ashutosh Adhikari, Mirella Lapata

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出Pearl框架,通过学习专家工具使用轨迹在潜在空间中进行多模态推理,无需显式调用工具,优于传统重建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07746 2026-04-10 cs.LG cs.CE physics.comp-ph 78%

Towards Rapid Constitutive Model Discovery from Multi-Modal Data: Physics Augmented Finite Element Model Updating (paFEMU)

面向多模态数据的快速本构模型发现:物理增强有限元模型更新(paFEMU)

Jingye Tan, Govinda Anantha Padmanabha, Steven J. Yang, Nikolaos Bouklas

机构 * University of Southern California(南加州大学) Cornell University(康奈尔大学) Ecole Polytechnique Federale de Lausanne (EPFL)(洛桑联邦理工学院) Pasteur Labs

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出paFEMU方法,结合AI本构建模、稀疏化可解释模型发现和基于有限元的伴随优化,利用多模态数据实现快速本构模型发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02711 2026-04-10 eess.SP 67%

Foundation Models Defining A New Era In Sensor-based Human Activity Recognition: A Survey And Outlook

基于传感器的人类活动识别的基石模型:一种综述与展望

Sizhen Bian, Mengxi Liu, Lala Shakti Swarup Ray, Bo Zhou, Bin Guo, Zhiwen Yu, Thomas Ploetz, Paul Lukowicz, Siyu Yuan, Vitor Fortes Rey

专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 本文综述了基于传感器的人类活动识别中的基石模型,分析了九种技术轴上的设计模式与权衡,并探讨了数据整理、多模态对齐、个性化、隐私和负责任部署等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07490 2026-04-10 cs.CL cs.AI 62%

Enabling Intrinsic Reasoning over Dense Geospatial Embeddings with DFR-Gemma

通过DFR-Gemma实现对密集地理嵌入的内在推理

Xuechen Zhang, Aviv Slobodkin, Joydeep Paul, Mandar Sharma, Samet Oymak, Shravya Shetty, Gautam Prasad

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 DFR-Gemma通过轻量投影器将高维嵌入与LLM潜在空间对齐,使LLM能直接处理地理嵌入进行空间推理,提升效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08074 2026-04-10 cs.CV 57%

DinoRADE: Full Spectral Radar-Camera Fusion with Vision Foundation Model Features for Multi-class Object Detection in Adverse Weather

DinoRADE:基于视觉基础模型特征的全谱雷达-摄像头融合用于恶劣天气下的多类目标检测

Christof Leitgeb, Thomas Puchleitner, Max Peter Ronecker, Daniel Watzenig

机构 * Infineon Technologies AG, Austria(英飞凌科技公司,奥地利) Graz University of Technology, Austria(格拉茨技术大学,奥地利) Virtual Vehicle Research GmbH, Austria(虚拟车辆研究有限公司,奥地利)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出DinoRADE,通过雷达-摄像头融合和视觉基础模型特征提升恶劣天气下的多类目标检测性能,首次在K-Radar数据集上评估并超越现有方法12.1%。

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01059 2026-04-10 cs.CL 57%

GroupGPT: A Token-efficient and Privacy-preserving Agentic Framework for Multi-User Chat Assistant

GroupGPT: 一种高效且隐私保护的多用户聊天助手代理框架

Zhuokang Shen, Yifan Wang, Hanyu Chen, Yunhang Shen, Wenxuan Huang, Gaoqi He, Jiao Xie, Rongrong Ji, Shaohui Lin

机构 * East China Normal University(华东师范大学) University of Nottingham Ningbo(宁波诺丁汉大学) Xiamen University(厦门大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 GroupGPT通过边缘-云协作架构实现高效决策,支持多模态输入,减少token使用并保护隐私,通过MUIR基准测试验证其准确性和用户接受度。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15409 2026-04-10 eess.SP cs.LG q-bio.NC 50%

Coupled generator decomposition for fusion of electro- and magnetoencephalography data

耦合生成器分解用于脑电与磁脑图数据融合

Anders Stevnhoved Olsen, Jesper Duemose Nielsen, Morten Mørup

机构 * Department of Applied Mathematics and Computer Science, Technical University of Denmark(丹麦技术大学应用数学与计算机科学系) Danish Research Centre for Magnetic Resonance, Centre for Functional and Diagnostic Imaging and Research, Copenhagen University Hospital Amager and Hvidovre(丹麦磁共振研究中心,功能与诊断影像及研究中心,哥本哈根大学医院阿迈厄和海维德夫)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出耦合生成器分解方法,用于融合脑电和磁脑图数据,通过稀疏主成分分析扩展,识别共同特征并处理模态和个体差异。

Journal ref EUSIPCO2024

详情

展开后加载摘要…

URL PDF HTML 收藏