arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-05 至 2026-05-05 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2510.05109 2026-05-05 cs.DC cs.AI cs.CL eess.SP 81%

Tiny but Mighty: A Software-Hardware Co-Design Approach for Efficient Multimodal Inference on Battery-Powered Small Devices

小巧但强大:一种软件硬件协同设计方法,用于电池供电小型设备上的高效多模态推理

Yilong Li, Shuai Zhang, Yijing Zeng, Hao Zhang, Xinmiao Xiong, Jingyu Liu, Pan Hu, Suman Banerjee

机构 * University of Wisconsin – Madison(威斯康星大学麦迪逊分校) Amazon Web Services AI(亚马逊网络服务人工智能) Uber(优步)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Nanomind框架,通过将多模态模型分解为模块化组件并分配到最佳计算单元,从而降低能耗并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01061 2026-05-05 cs.MM 79%

PRISM: Exposing and Resolving Spurious Isolation in Federated Multimodal Continual Learning

PRISM:揭示并解决联邦多模态持续学习中的虚假隔离

Beining Wu, Zihao Ding, Jun Huang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出PRISM方法,通过维护专家梯度子空间基底和重新解释MoE路由,解决联邦多模态持续学习中路由隔离失效、遗忘积累和梯度冲突问题,实验表明其在多个数据集上优于现有基线。

Comments submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00973 2026-05-05 cs.LG cs.AI eess.SP 79%

Physiology-Aware Masked Cross-Modal Reconstruction for Biosignal Representation Learning

生理感知的跨模态掩码重建用于生物信号表示学习

Hao Zhou, Simon A. Lee, Cyrus Tanade, Keum San Chun, Juhyeon Lee, Migyeong Gwak, Megha Thukral, Justin Sung, Eugene Hwang, Mehrab Bin Morshed, Li Zhu, Viswam Nathan, Md Mahbubur Rahman, Subramaniam Venkatraman, Sharanya Arcot Desai

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Samsung Research America(三星美国研究院)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出xMAE框架,通过跨模态掩码重建捕捉生物信号的时序关系,提升表示学习效果,在15/19下游任务中优于基线模型。

Comments Proceedings of the 43rd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10554 2026-05-05 cs.CV 79%

Grounding Everything in Tokens for Multimodal Large Language Models

基于令牌的多模态大语言模型的 grounding

Xiangxuan Ren, Zhongdao Wang, Liping Hou, Pin Tang, Guoqing Wang, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence(人工智能混合专家模型关键实验室) AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院) Central Research Institute, Huawei(华为中央研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GETok方法,通过整合可学习的令牌词汇提升多模态大语言模型在2D空间中的物体定位能力,实验显示其在多种指引用例任务中表现更优。

Comments 19 pages, 16 figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10320 2026-05-05 cs.CV eess.IV 79%

Boosting Multimodal Remote Sensing Image Classification with Transformer-based Heterogeneously Salient Graph Representation

通过基于变换器的异质显著图表示提升多模态遥感图像分类

Jiaqi Yang, Bo Du, Rong Liu, Zhu Mao, Liangpei Zhang

机构 * Department of Forest Sciences, University of Helsinki(赫尔辛基大学森林科学系) School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, Wuhan, China(武汉大学计算机学院、国家多媒体软件工程研究中心、人工智能研究院、湖北省多媒体与网络通信工程重点实验室,武汉,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于变换器的异质显著图表示方法,解决多模态遥感图像分类中特征表示不充分、长距离依赖建模复杂及过拟合问题,通过异质图编码器、多卷积调节器和均值前向策略提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00930 2026-05-05 q-bio.GN cs.AI 70%

CellxPert: Inference-Time MCMC Steering of a Multi-Omics Single-Cell Foundation Model for In-Silico Perturbation

CellxPert:一种多组学单细胞基础模型的推理时间MCMC引导方法用于计算机模拟扰动

Andac Demir, Erik W. Anderson, Jeremy L. Jenkins, Srayanta Mukherjee

机构 * Novartis Biomedical Research(诺华生物医学研究)

专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 CellxPert通过整合多组学数据,实现了对单细胞和空间多组学的统一表示,支持细胞类型注释、扰动响应预测和多组学整合,采用MCMC方法提升生物可解释性。

Journal ref ICLR Machine Learning for Genomics Explorations Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01365 2026-05-05 cs.CV cs.RO 57%

VoxAfford: Multi-Scale Voxel-Token Fusion for Open-Vocabulary 3D Affordance Detection

VoxAfford:多尺度体素-标记融合用于开放词汇3D affordance检测

Haowen Sun, Shaolong Zhang, Mingyang Li, Chengzhong Ma, Xinzhe Chen, Qiongjie Cui, Xingyu Chen, Zeyang Liu, Xuguang Lan

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家级实验室,人工智能与机器人研究所,西安交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VoxAfford,通过多尺度几何特征增强输出标记,提升3D affordance检测的定位精度,实验显示mIoU提升8%,并验证了零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01100 2026-05-05 cs.AI 57%

A Knowledge-Driven LLM-Based Decision-Support System for Explainable Defect Analysis and Mitigation Guidance in Laser Powder Bed Fusion

基于知识的LLM决策支持系统:用于激光粉末床融合的可解释缺陷分析与缓解指导

Basit Mahmud Shahriar, Md Habibor Rahman

机构 * Department of Mechanical Engineering, University of Massachusetts Dartmouth(达特茅斯大学机械工程系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种整合结构化缺陷知识与LLM推理的知识驱动决策支持系统,用于制造业中激光粉末床融合的可解释缺陷诊断与缓解指导。系统基于包含27种已知缺陷类型的知识库,支持模糊自然语言查询、文献支持的缺陷解释及基于编码工艺知识的缺陷原因和缓解策略指导。

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27437 2026-05-05 cs.CV 57%

SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning

SpatialStack:用于3D VLM空间推理的分层几何-语言融合

Jian Zhang, Shijie Zhou, Bangya Liu, Achuta Kadambi, Zhiwen Fan

机构 * XMU(厦门大学) UCLA(美国大学) Google(谷歌) UW-Madison(威斯康星大学麦迪逊分校) TAMU(德克萨斯农工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SpatialStack框架,通过分层融合视觉、几何和语言表征,提升3D空间推理能力,实验表明其在多个基准上表现优异。

Comments CVPR 2026, Project Website: https://spatial-stack.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏