arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-07 至 2026-04-07 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 10 篇

2604.04297 2026-04-07 cs.AI 83%

PanLUNA: An Efficient and Robust Query-Unified Multimodal Model for Edge Biosignal Intelligence

PanLUNA: 一种高效且稳健的多模态模型,用于边缘生物信号智能

Marija Zelic, Anna Tegon, Yawei Li, Thorir Mar Ingolfsson, Luca Benini

机构 * DEI, University of Bologna(博洛尼亚大学DEI)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 PanLUNA是一种紧凑的多模态基础模型,能够高效处理EEG、ECG和PPG信号,实现跨模态早期融合,同时在推理时对缺失模态具有鲁棒性。其在生物信号检测和睡眠分期任务中表现出色。

Comments 5 pages, 5 tables, 1 figure, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04797 2026-04-07 cs.CV cs.LG 79%

Multi-Modal Sensor Fusion using Hybrid Attention for Autonomous Driving

多模态传感器融合使用混合注意力用于自动驾驶

Mayank Mayank, Bharanidhar Duraisamy, Florian Geiß, Abhinav Valada

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) University of Freiburg(弗莱堡大学)

专题命中 多模态训练与对齐 :multi-modal(title);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MMF-BEV框架,通过变形注意力实现雷达与摄像头BEV融合,通过传感器贡献分析验证传感器互补性,并在VoD数据集上优于单模态基线。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04496 2026-04-07 cs.CV 79%

The Indra Representation Hypothesis for Multimodal Alignment

多模态对齐的Indra表示假说

Jianglin Lu, Hailing Wang, Kuo Yang, Yitian Zhang, Simon Jenni, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(Adobe研究院)

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Indra表示假说,通过范畴论中的V富化Yoneda嵌入,定义样本间关系轮廓,提升多模态对齐的鲁棒性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04488 2026-04-07 cs.CV cs.LG 79%

A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models

基于补丁的跨视图正则化框架用于多模态大语言模型中的后门防御

Tianmeng Fang, Yong Wang, Zetai Kong, Zengzhen Su, Jun Wang, Chengjin Yu, Wei Wang

机构 * Singapore Management University(新加坡管理大学) China University of Mining and Technology(中国矿业大学) The University of Melbourne(墨尔本大学) Anhui University(安徽大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种基于补丁增强和跨视图正则化的统一后门防御框架,通过约束特征表示和输出分布层面的异常行为,有效降低后门攻击成功率并保持正常生成能力。

Comments 26 pages, 3 figures. Subjects: Machine Learning (cs.LG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17514 2026-04-07 cs.CV 79%

EI: Early Intervention for Multimodal Imaging based Disease Recognition

EI:基于多模态影像的疾病识别早期干预

Qijie Wei, Hailan Lin, Xirong Li

机构 * Renmin University of China(中国人民大学) Beijing Key Laboratory for Intelligent Diagnosis of Fundus Diseases and Drug-Device R&D and Translation(眼底疾病智能诊断与药械研发转化北京市重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出EI框架,通过早期干预提升多模态影像疾病识别性能,引入MoR方法优化Vision Foundation Models适应,验证了在三个公开数据集上的有效性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04407 2026-04-07 eess.IV cs.CV cs.LG cs.MM 62%

NAIMA: Semantics Aware RGB Guided Depth Super-Resolution

NAIMA:基于语义的RGB引导深度超分辨率

Tayyab Nasir, Daochang Liu, Ajmal Mian

机构 * The University of Western Australia(西澳大利亚大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出NAIMA框架,通过引导token注意力模块和DINOv2整合,提升RGB引导深度超分辨率的语义感知能力,在多尺度和数据集上实现显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03296 2026-04-07 cs.CV cs.AI 62%

3D-IDE: 3D Implicit Depth Emergent

3D-IDE: 3D隐式深度涌现

Chushan Zhang, Ruihan Lu, Jinguang Tong, Yikai Wang, Hongdong Li

机构 * School of Computing, Australian National University(澳大利亚国立大学计算学院) School of EECS, The University of Queensland(昆士兰大学电气工程与计算机科学学院) FreiNexus School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3D-IDE方法,通过几何自监督学习实现3D感知的隐式涌现,消除了深度和姿态依赖,提升推理效率和多任务性能。

Comments CVPR 2026 accepted. Project page: https://chushanzhang.github.io/3D-IDE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27584 2026-04-07 cs.CV cs.IR cs.LG 57%

Image Hashing via Cross-View Code Alignment in the Age of Foundation Models

基于基础模型的跨视图代码对齐图像哈希

Ilyass Moummad, Kawtar Zaher, Hervé Goëau, Alexis Joly

机构 * INRIA(法国国家信息与自动化研究所) LIRMM(蒙彼利埃计算机科学、机器人及微电子实验室) INA(法国国家视听研究所) CIRAD(法国农业研究发展国际合作中心) AMAP(植物建模与生态学联合实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CroVCA方法,通过统一的二进制交叉熵损失和编码率最大化正则化,在少量训练轮次内实现高效图像哈希,适用于多种视觉检索任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04243 2026-04-07 cs.NI 50%

RELIEF: Turning Missing Modalities into Training Acceleration for Federated Learning on Heterogeneous IoT Edge

RELIEF: 将缺失的模态转化为联邦学习在异构物联网边缘设备上的训练加速

Beining Wu, Zihao Ding, Jun Huang

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 针对异构物联网边缘设备中系统-模态-数据异质性问题,提出RELIEF框架,通过将低秩适应(LoRA)投影矩阵划分模态对齐的列块,实现聚合、弹性训练和通信的统一接口,提升训练效率和资源利用率。

Comments 14 pages, submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04016 2026-04-07 cs.RO 50%

Odometry Calibration and Pose Estimation of a 4WIS4WID Mobile Wall Climbing Robot

四轮独立转向四轮独立驱动壁爬机器人姿态估计与里程计校准

Branimir Ćaran, Vladimir Milić, Marko Švaco, Bojan Jerbić

机构 * Croatian Academy of Sciences and Arts(克罗地亚科学与艺术学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文基于多模态测量融合设计了四轮独立转向四轮独立驱动壁爬机器人姿态估计器,采用扩展卡尔曼滤波和无迹卡尔曼滤波方法,解决传统定位传感器在复杂建筑立面环境中的不可行性问题。

Comments ACCEPTED FOR IEEE EUROPEAN CONFERENCE ON MOBILE ROBOTS 2025. PREPRINT VERSION. ACCEPTED JUNE, 2025 AND PRESENTED SEPTEMBER, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏