arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-25 至 2026-03-25 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 14 篇

2603.23272 2026-03-25 cs.CV cs.MM 84%

Multi-Modal Image Fusion via Intervention-Stable Feature Learning

多模态图像融合 via 干预稳定的特征学习

Xue Wang, Zheng Guan, Wenhua Qian, Chengchao Wang, Runzhuo Ma

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) School of Artificial Intelligence, Nanyang Normal University(南阳师范学院人工智能学院) Department of Electrical and Electronic Engineering, Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于因果原则的干预框架,通过三种干预策略探索模态关系,设计因果特征整合器捕捉稳健的模态依赖而非虚假关联。

Comments Accpted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23276 2026-03-25 cs.CV 83%

CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection

CCF:互补协作融合用于领域泛化的多模态3D目标检测

Yuchen Wu, Kun Wang, Yining Pan, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出CCF方法,通过查询解耦损失、LiDAR引导深度先验和互补跨模态掩码,提升多模态3D目标检测在跨领域场景下的鲁棒性,实验表明优于现有方法且保持源域性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22852 2026-03-25 cs.CV 83%

Gau-Occ: Geometry-Completed Gaussians for Multi-Modal 3D Occupancy Prediction

Gau-Occ:用于多模态3D占用预测的几何完备高斯分布

Chengxin Lv, Yihui Li, Hongyu Yang, YunHong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,北京航空航天大学,北京,中国) School of Computer Science and Engineering, Beihang University, Beijing, China(计算机科学与工程学院,北京航空航天大学,北京,中国) School of Artificial Intelligence, Beihang University, Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 Gau-Occ通过几何完备的3D高斯分布实现多模态3D占用预测,利用LiDAR完成扩散器恢复缺失结构并融合多视角图像语义,提升空间一致性和语义区分性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20008 2026-03-25 cs.CV cs.AI 81%

Pedestrian Crossing Intention Prediction Using Multimodal Fusion Network

基于多模态融合网络的行人过街意图预测

Yuanzhe Li, Steffen Müller

机构 * Chair of Automotive Engineering, Technische Universität Berlin(柏林技术大学汽车工程系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态融合网络,通过视觉和运动分支提取七种模态特征,有效整合互补信息,提升自动驾驶车辆在城市环境中对行人意图预测的准确性。

Comments 29th IAVSD International Symposium on Dynamics of Vehicles on Roads and Tracks (IAVSD 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22847 2026-03-25 cs.CV 79%

Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought

重新思考多模态链式推理的令牌级策略优化

Yunheng Li, Hangyi Kuang, Hengrui Zhang, Jiangxia Cao, Zhaojie Liu, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PEPO方法,通过令牌级分析多模态推理轨迹,结合感知先验和熵整合机制,提升多模态推理性能,实验显示在多种基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22757 2026-03-25 cs.CV 79%

Multimodal Industrial Anomaly Detection via Geometric Prior

基于几何先验的多模态工业异常检测

Min Li, Jinghui He, Gang Li, Jiachen Li, Jin Wan, Delong Han

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算功率网络与信息安全重点实验室,山东计算机科学中心(济南国家超算中心),齐鲁工业大学(山东省科学院)) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算功率互联网与服务计算重点实验室,山东省计算机科学基础研究中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于几何先验的异常检测网络GPAD,通过点云专家模型提取细粒度几何特征,并结合两阶段融合策略和几何先验实现高效多模态数据融合,提升几何缺陷检测精度。

Comments Accepted for publication in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22369 2026-03-25 q-bio.GN cs.AI cs.LG 79%

SynLeaF: A Dual-Stage Multimodal Fusion Framework for Synthetic Lethality Prediction Across Pan- and Single-Cancer Contexts

SynLeaF:一种用于跨泛癌和单癌情境的合成致死性预测双阶段多模态融合框架

Zheming Xing, Siyuan Zhou, Ruinan Wang, Rui Han, Shiming Zhang, Shiqu Chen, Yurui Huang, Jiahao Ma, Yifan Chen, Xuan Wang, Yadong Wang, Junyi Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 SynLeaF通过双阶段多模态融合框架,有效整合基因表达、突变、甲基化和拷贝数变异等多组学数据,并利用关系图卷积网络捕捉生物医学知识图谱中的结构化基因表示,从而在17/19种场景中实现优于现有方法的性能。

Comments 29 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22345 2026-03-25 cs.AI 79%

Dynamic Fusion-Aware Graph Convolutional Neural Network for Multimodal Emotion Recognition in Conversations

动态融合感知图卷积神经网络用于对话中的多模态情绪识别

Tao Meng, Weilun Tang, Yuntao Shou, Yilong Tan, Jun Zhou, Wei Ai, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(林业科技大学计算机与数学学院) Department of Computer Science, State University of New York, New Paltz, New York, 12561, USA(纽约州立大学新帕尔兹分校计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出DF-GCN,通过整合微分方程和全局信息向量,动态融合多模态特征,提升对话中情绪识别的灵活性和泛化能力。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02487 2026-03-25 cs.CV cs.AI 62%

Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding

掩码至关重要:解锁LLMs的三维场景-语言理解的空间推理能力

Yerim Jeon, Miso Lee, WonJun Moon, Jae-Pil Heo

机构 * Sungkyunkwan University(庆尚国立大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3D-SLIM掩码策略,通过适应性注意力掩码提升LLMs在三维场景-语言理解中的空间推理能力,解决传统因果掩码导致的顺序偏差和注意力受限问题。

Comments Accepted to CVPR 2026. GitHub Page: https://github.com/Jyerim/3D-SLIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06690 2026-03-25 cs.CV 57%

Spectral Gaps and Spatial Priors: Studying Hyperspectral Downstream Adaptation Using TerraMind

光谱间隙与空间先验:利用TerraMind研究高光谱下游适应

Julia Anna Leonardi, Johannes Jakubik, Paolo Fraccaro, Maria Antonia Brovelli

机构 * IBM Research Europe(IBM欧洲研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了TerraMind在无高光谱预训练情况下处理高光谱下游任务的适应性,比较了通道适应策略并证明了深度学习模型在处理高光谱数据方面的优势。

Comments Accepted to ICLR 2026 Machine Learning for Remote Sensing (ML4RS) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22039 2026-03-25 cs.LG cs.AI 57%

UniCA: Unified Covariate Adaptation for Time Series Foundation Model

UniCA: 时空基础模型的统一协变量适应

Lu Han, Yu Liu, Lan Li, Qiwen Deng, Jian Jiang, Yinbo Sun, Zhe Yu, Binfeng Wang, Xingyu Lu, Lintao Ma, Han-Jia Ye, De-Chuan Zhan

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院,中国) National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国) Ant Group, Hangzhou, China(蚂蚁集团,杭州,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 UniCA通过协变量同质化和统一注意力融合机制,提升时空基础模型对异质协变量的适应能力,实验证明其在多模态预测任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22838 2026-03-25 stat.ME 50%

Community Detection on Inhomogeneous Multilayer Networks with Extreme Sparsity

在不均匀多层网络上进行社区检测:极端稀疏性下的方法

Tao Shen, Wanjie Wang

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出MARS-CD方法,通过多层辅助正则化谱方法解决不均匀多层网络中极端稀疏性下的社区检测问题,理论保证了聚类质量并实现了弱一致和强一致。

Comments 35 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11858 2026-03-25 cs.LG 50%

Multi-Station WiFi CSI Sensing Framework Robust to Station-wise Feature Missingness and Limited Labeled Data

多站WiFi CSI感知框架:鲁棒于站级特征缺失和有限标记数据

Keita Kayano, Takayuki Nishio, Daiki Yoda, Yuta Hirai, Tomoko Adachi

机构 * School of Engineering, Institute of Science Tokyo(东京科学研究院工程学院) Wireless Systems R&D Department, Infrastructure Systems R&D Center, Corporate Laboratory, Toshiba Corporation(东芝公司无线系统研发部、基础设施系统研发中心、企业实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出一个多站WiFi CSI感知框架,解决实际CSI感知中的站级特征缺失和有限标记数据问题,通过结合跨模态自监督学习和站级掩码增强,提升鲁棒性。

Comments 17 pages, 14 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03473 2026-03-25 astro-ph.SR 50%

Vision-Based CNN Prediction of Sunspot Numbers from SDO/HMI Images

基于视觉的CNN对SDO/HMI图像中太阳黑子数的预测

Fabian C. Quintero-Pareja, Diederik A. Montano-Burbano, Santiago Quintero-Pareja, D. Sierra-Porta

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出基于视觉的回归框架,利用SDO/HMI图像预测太阳黑子数,通过CNN实现端到端映射,实验结果显示模型在预测精度和可解释性方面表现良好,为大规模太阳监测提供可行方案。

Comments 10 pages, 9 figures, 2 tables

Journal ref Published in the Open Journal of Astrophysics - 2026

详情

展开后加载摘要…

URL PDF HTML 收藏