arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-21 至 2026-05-21 共收录 73 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 21 篇

2605.21075 2026-05-21 cs.CV cs.LG 74%

SpectralEarth-FM: Bringing Hyperspectral Imagery into Multimodal Earth Observation Pretraining

SpectralEarth-FM: 将高光谱图像引入多模态地球观测预训练

Nassim Ait Ali Braham, Aaron Banze, Conrad M. Albrecht, Julien Mairal, Jocelyn Chanussot, Xiao Xiang Zhu

机构 * Chair of Data Science in Earth Observation(地球观测数据科学主任) Technical University of Munich(慕尼黑技术大学) Remote Sensing Technology Institute(遥感技术研究所) German Aerospace Center (DLR)(德国航空航天中心) Department of Aerospace Engineering(航空航天工程系) University of the Bundeswehr Munich(联邦国防军慕尼黑大学) LEAP Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) Inria(法国国家信息与自动化技术研究院) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔INP) LJK

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 本文提出SpectralEarth-FM,一种用于多传感器地球观测输入的分层变压器,旨在联合处理高光谱图像与低通道观测。通过构建SpectralEarth-MM数据集,采用JEPA风格的目标进行预训练,实现了在高光谱下游任务和标准EO基准上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09180 2026-05-21 cs.CV cs.RO 74%

Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning

多模态融合用于视觉强化学习中的仿真到现实迁移

Zichun Xu, Jingdong Zhao, Chenyu Guo, Qianxue Zhang, Liao Zhang, Xiao Zhang, Yiming Ren, Lian Zhang, Zengren Zhao

机构 * Medical Artificial Intelligence Lab, The First Hospital of Hebei Medical University, Hebei Medical University(医学人工智能实验室,河北医科大学第一医院,河北医科大学) State Key Laboratory of Robotics and Systems, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 本文提出基于视觉变换器的多模态融合框架,通过融合RGB和深度信息提升泛化能力,并设计对比学习方案和课程式域随机化方案以提高样本效率和迁移性能,实验结果表明该方法在现实任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21308 2026-05-21 cs.CV cs.AI 62%

Deformba: Vision State Space Model with Adaptive State Fusion

Deformba:具有自适应状态融合的视觉状态空间模型

Hongyu Ke, Jack Morris, Yongkang Liu, Satoshi Kitai, Kentaro Oguchi, Yi Ding, Haoxin Wang

机构 * Department of Computer Science, Georgia State University(佐治亚州立大学计算机科学系) University of Tennessee Knoxville(田纳西大学肯纳邦克分校)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Deformba,一种能够动态增强空间结构信息并保持状态空间模型线性复杂度的自适应方法,通过多模态融合(如交叉注意力)提升视觉任务的性能,展示了在2D和3D视觉任务中的广泛适用性。

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21112 2026-05-21 cs.CV 57%

RCGDet3D: Rethinking 4D Radar-Camera Fusion-based 3D Object Detection with Enhanced Radar Feature Encoding

RCGDet3D: 重新思考基于增强雷达特征编码的4D雷达-相机融合3D目标检测

Weiyi Xiong, Bing Zhu

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出RCGDet3D,通过增强雷达特征编码而非复杂的多模态融合策略,实现了在3D目标检测中更高的准确性和实时性,为实时部署设定了新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20667 2026-05-21 cs.CV 57%

LER-YOLO: Reliability-Aware Expert Routing for Misaligned RGB-Infrared UAV Detection

LER-YOLO: 一种可靠性感知的专家路由方法用于对齐不准确的RGB-红外无人机检测

Liming Hou, Yueping Peng, Hexiang Hao, Ji Wang, Xuekai Zhang, Wei Tang, Zecong Ye, Xin Ying, Yubo He

机构 * Engineering University of PAP(中国人民解放军防务大学) Unit Command Department, Officers College of PAP(中国人民解放军军官学院作战指挥部)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 该研究提出LER-YOLO,一种可靠性感知的稀疏专家混合方法,用于解决RGB-红外遥感对中无人机检测的挑战,通过引入不确定性感知的目标对齐模块和可靠性引导的稀疏MoE融合模块,提升跨模态交互的可靠性。

Comments 17 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17631 2026-05-21 cs.LG cs.AI 57%

Time-Prompt: Integrated Heterogeneous Prompts for Unlocking LLMs in Time Series Forecasting

Time-Prompt: 集成异构提示以解锁时间序列预测中的LLM

Zesen Wang, Lijuan Lan, Yonggang Li

机构 * Central South University, Changsha, China(中南大学,长沙,中国)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出Time-Prompt框架,通过构建统一的提示范式、设计语义空间嵌入和跨模态对齐模块以及高效微调LLM参数,提升时间序列预测性能,并在碳排放数据集上验证其有效性。

Comments Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20536 2026-05-21 cs.CV 57%

HADS-Net:A Hybrid Attention-Augmented Dual-Stream Network with Physics-Informed Augmentation for Breast Ultrasound Image Classification

HADS-Net:一种融合注意力增强的双流网络,用于乳腺超声图像分类

Chinedu Emmanuel Mbonu, Blessing Nwamaka Iduh, Joseph Ikechukwu Odo, Doris Chinedu Asogwa

机构 * NedumCares

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出HADS-Net,一种融合注意力增强的双流网络,通过两个并行路径利用全局纹理和局部边界线索,结合物理信息增强,以提高乳腺超声图像分类的准确性。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20411 2026-05-21 eess.SY cs.SY 50%

Max-Entropy Moment Filtering for Stochastic Hybrid Systems

最大熵矩滤波器用于随机混合系统

Kaito Iwasaki, Tejaswi K. C., Anthony Bloch, Maani Ghaffari, Taeyoung Lee

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出了一种混合扩展的最大熵矩卡尔曼滤波器,用于从部分统计信息中进行滤波,通过传播有限的矩并通过随机混合动态重构信念,关键步骤是基于Dynkin公式推导出的矩传播规则,能够有效处理边界诱导的概率流,从而在不求解底层混合PDE的情况下获得可处理的矩动力学。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 5 篇

2601.05877 2026-05-21 cs.CL 79%

iReasoner: Trajectory-Aware Intrinsic Reasoning Supervision for Self-Evolving Large Multimodal Models

iReasoner: 一种面向轨迹的内在推理监督方法,用于自演化的大多模态模型

Meghana Sunil, Manikandarajan Venmathimaran, Muthu Subash Kavitha

机构 * Vellore Institute of Technology(韦洛雷理工学院) School of Information and Data Sciences(信息与数据科学学院) Nagasaki University(长崎大学) Loughborough University(洛桑大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出iReasoner,一种自演化框架,通过显式引导推理链和奖励内部一致性来提升大模型的隐式推理能力,在无监督设置下实现了多模态推理基准的性能提升。

Comments ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17618 2026-05-21 cs.AI 57%

Prediction of Challenging Behaviors Associated with Profound Autism in a Classroom Setting Using Wearable Sensors

使用可穿戴传感器预测课堂环境中与深度自闭症相关的行为问题

Yadhu Kartha, Conor Anderson, Jenny Foster, Theresa Hamlin, Johanna Lantz, Ryan Lay, Juergen Hahn, Gari D. Clifford, Hyeokhyen Kwon

机构 * Georgia Institute of Technology(佐治亚理工学院) The Center For Discovery(发现中心) Rensselaer Polytechnic Institute(伦斯勒理工学院) Georgia Institute of Technology, Emory University(佐治亚理工学院与埃默里大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究通过可穿戴传感器和机器学习方法,在真实课堂环境中预测自闭症深度患者的行为问题,展示了在教育环境中提前10分钟预测行为问题的可行性,并实现了AUC-ROC为0.78的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21093 2026-05-21 astro-ph.EP astro-ph.IM astro-ph.SR 50%

The Search for Technosignatures: a Review of Possibilities

寻找技术签名:可能性的综述

Clément Vidal, Benji L. Fields, Damian R. Sowinski, Mark Elowitz, Stuart Bartlett, Richard J. Terrile, Alex Ellery, Daliah Bibas, Armando M. Mastrogiovanni, Niklas Döbler, Manika Singla, Julia DeMarines, Theresa Fisher, Yuri Uno, Jake D. Turner, Evan L. Sneed, Advait Huggahalli, Megan Grace Li, Zhuofu, Li, Macy Huston, Ramiro Saide

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文综述了文献中提出的技术签名的多样性,从地球开始,逐步扩展到太阳系内外,探讨了技术签名的检测方法和主要贡献。

Comments 118 pages, paper started as a collective workshop at the Penn State SETI Symposium (PSETI 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21053 2026-05-21 cs.RO 50%

Perception of Social Robots as Communication Partners in Healthcare for Older Adults

在医疗领域中老年人对社交机器人作为交流伙伴的感知

Hana Yamamoto, Carlotta Julia Mayer, Charlotte Raithel, Theresa Buchner, Christian Werner, Yasuhisa Hirata, Monika Eckstein, Katja Mombaur

机构 * Institute for Anthropomatics and Robotics(人机学与机器人研究所) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Department of Robotics(机器人系) Tohoku University(东北大学) Institute of Medical Psychology(医学心理学研究所) Heidelberg University(海德堡大学) Institute of Psychology(心理学研究所)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 研究探讨了社交机器人在医疗领域中作为交流伙伴的有效性,以及积极提示对交互效果的影响,发现机器人与人类交互时压力水平无显著差异,且机器人能被接受为有效的交流伙伴,有助于减轻护理人员负担。

Comments 31 pages, 10 figures, Under review at International Journal of Social Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20030 2026-05-21 cs.LG math.OC 50%

Take It or Leave It: Intent-Controlled Partial Optimal Transport

Take It or Leave It: Intent-Controlled Partial Optimal Transport

Salil Parth Tripathi, Bertrand Chapron, Fabrice Collard, Nicolas Courty, Ronan Fablet

机构 * OceanDataLab Ifremer Université Bretagne Sud(布列塔尼大学) IMT Atlantique(IMT阿蒂提斯)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出了一种意图控制的局部最优传输(IC-POT),通过引入点wise拒绝成本替代全局拒绝机制,解决了在应用中需要更结构化的点wise拒绝机制的问题,并展示了其在正样本无标签学习和开放部分领域适应中的实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏