arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-25 至 2026-03-25 共收录 105 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 14 篇

2603.22847 2026-03-25 cs.CV 79%

Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought

重新思考多模态链式推理的令牌级策略优化

Yunheng Li, Hangyi Kuang, Hengrui Zhang, Jiangxia Cao, Zhaojie Liu, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PEPO方法,通过令牌级分析多模态推理轨迹,结合感知先验和熵整合机制,提升多模态推理性能,实验显示在多种基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22757 2026-03-25 cs.CV 79%

Multimodal Industrial Anomaly Detection via Geometric Prior

基于几何先验的多模态工业异常检测

Min Li, Jinghui He, Gang Li, Jiachen Li, Jin Wan, Delong Han

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算功率网络与信息安全重点实验室,山东计算机科学中心(济南国家超算中心),齐鲁工业大学(山东省科学院)) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算功率互联网与服务计算重点实验室,山东省计算机科学基础研究中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于几何先验的异常检测网络GPAD,通过点云专家模型提取细粒度几何特征,并结合两阶段融合策略和几何先验实现高效多模态数据融合,提升几何缺陷检测精度。

Comments Accepted for publication in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22369 2026-03-25 q-bio.GN cs.AI cs.LG 79%

SynLeaF: A Dual-Stage Multimodal Fusion Framework for Synthetic Lethality Prediction Across Pan- and Single-Cancer Contexts

SynLeaF:一种用于跨泛癌和单癌情境的合成致死性预测双阶段多模态融合框架

Zheming Xing, Siyuan Zhou, Ruinan Wang, Rui Han, Shiming Zhang, Shiqu Chen, Yurui Huang, Jiahao Ma, Yifan Chen, Xuan Wang, Yadong Wang, Junyi Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 SynLeaF通过双阶段多模态融合框架,有效整合基因表达、突变、甲基化和拷贝数变异等多组学数据,并利用关系图卷积网络捕捉生物医学知识图谱中的结构化基因表示,从而在17/19种场景中实现优于现有方法的性能。

Comments 29 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22345 2026-03-25 cs.AI 79%

Dynamic Fusion-Aware Graph Convolutional Neural Network for Multimodal Emotion Recognition in Conversations

动态融合感知图卷积神经网络用于对话中的多模态情绪识别

Tao Meng, Weilun Tang, Yuntao Shou, Yilong Tan, Jun Zhou, Wei Ai, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(林业科技大学计算机与数学学院) Department of Computer Science, State University of New York, New Paltz, New York, 12561, USA(纽约州立大学新帕尔兹分校计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出DF-GCN,通过整合微分方程和全局信息向量,动态融合多模态特征,提升对话中情绪识别的灵活性和泛化能力。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02487 2026-03-25 cs.CV cs.AI 62%

Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding

掩码至关重要:解锁LLMs的三维场景-语言理解的空间推理能力

Yerim Jeon, Miso Lee, WonJun Moon, Jae-Pil Heo

机构 * Sungkyunkwan University(庆尚国立大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3D-SLIM掩码策略,通过适应性注意力掩码提升LLMs在三维场景-语言理解中的空间推理能力,解决传统因果掩码导致的顺序偏差和注意力受限问题。

Comments Accepted to CVPR 2026. GitHub Page: https://github.com/Jyerim/3D-SLIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06690 2026-03-25 cs.CV 57%

Spectral Gaps and Spatial Priors: Studying Hyperspectral Downstream Adaptation Using TerraMind

光谱间隙与空间先验:利用TerraMind研究高光谱下游适应

Julia Anna Leonardi, Johannes Jakubik, Paolo Fraccaro, Maria Antonia Brovelli

机构 * IBM Research Europe(IBM欧洲研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了TerraMind在无高光谱预训练情况下处理高光谱下游任务的适应性,比较了通道适应策略并证明了深度学习模型在处理高光谱数据方面的优势。

Comments Accepted to ICLR 2026 Machine Learning for Remote Sensing (ML4RS) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22039 2026-03-25 cs.LG cs.AI 57%

UniCA: Unified Covariate Adaptation for Time Series Foundation Model

UniCA: 时空基础模型的统一协变量适应

Lu Han, Yu Liu, Lan Li, Qiwen Deng, Jian Jiang, Yinbo Sun, Zhe Yu, Binfeng Wang, Xingyu Lu, Lintao Ma, Han-Jia Ye, De-Chuan Zhan

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院,中国) National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国) Ant Group, Hangzhou, China(蚂蚁集团,杭州,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 UniCA通过协变量同质化和统一注意力融合机制,提升时空基础模型对异质协变量的适应能力,实验证明其在多模态预测任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22838 2026-03-25 stat.ME 50%

Community Detection on Inhomogeneous Multilayer Networks with Extreme Sparsity

在不均匀多层网络上进行社区检测:极端稀疏性下的方法

Tao Shen, Wanjie Wang

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出MARS-CD方法,通过多层辅助正则化谱方法解决不均匀多层网络中极端稀疏性下的社区检测问题,理论保证了聚类质量并实现了弱一致和强一致。

Comments 35 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11858 2026-03-25 cs.LG 50%

Multi-Station WiFi CSI Sensing Framework Robust to Station-wise Feature Missingness and Limited Labeled Data

多站WiFi CSI感知框架:鲁棒于站级特征缺失和有限标记数据

Keita Kayano, Takayuki Nishio, Daiki Yoda, Yuta Hirai, Tomoko Adachi

机构 * School of Engineering, Institute of Science Tokyo(东京科学研究院工程学院) Wireless Systems R&D Department, Infrastructure Systems R&D Center, Corporate Laboratory, Toshiba Corporation(东芝公司无线系统研发部、基础设施系统研发中心、企业实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出一个多站WiFi CSI感知框架,解决实际CSI感知中的站级特征缺失和有限标记数据问题,通过结合跨模态自监督学习和站级掩码增强,提升鲁棒性。

Comments 17 pages, 14 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03473 2026-03-25 astro-ph.SR 50%

Vision-Based CNN Prediction of Sunspot Numbers from SDO/HMI Images

基于视觉的CNN对SDO/HMI图像中太阳黑子数的预测

Fabian C. Quintero-Pareja, Diederik A. Montano-Burbano, Santiago Quintero-Pareja, D. Sierra-Porta

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出基于视觉的回归框架,利用SDO/HMI图像预测太阳黑子数,通过CNN实现端到端映射,实验结果显示模型在预测精度和可解释性方面表现良好,为大规模太阳监测提供可行方案。

Comments 10 pages, 9 figures, 2 tables

Journal ref Published in the Open Journal of Astrophysics - 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 5 篇

2301.11842 2026-03-25 cs.LO 78%

Normalization for multimodal type theory

多模态类型论的规范化

Daniel Gratzer

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文证明了多模态依赖类型论MTT的规范化,通过将类型检查和转换简化为底层模态情况的模态相等性判断,提出了一种类型检查算法。

Journal ref Logical Methods in Computer Science, Volume 22, Issue 1 (March 17, 2026) lmcs:10871

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22635 2026-03-25 cond-mat.supr-con cond-mat.mes-hall cond-mat.mtrl-sci cond-mat.str-el 71%

Probing Electromigration of Oxygen Vacancies in YBa$_2$Cu$_3$O$_{7-δ}$ Devices by Multimodal X-ray Techniques

通过多模态X射线技术探测YBa$_2$Cu$_3$O$_{7-δ}$器件中氧空位的电迁移

Caio C. Quaglio-Gomes, Stefan Marinković, Elijah A. Abbey, Davi A. D. Chaves, Anna Palau, Alejandro V. Silhanek, Pedro Schio, Maycon Motta

专题命中 其他多模态 :multimodal(title)

AI总结 研究通过多模态X射线技术揭示了YBCO微桥在脉冲电迁移下的结构变化,展示了氧空位重排的微观机制,为高温度超导器件中的空位控制提供了新框架。

Comments 12 pages and 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23365 2026-03-25 cs.RO 50%

PinPoint: Monocular Needle Pose Estimation for Robotic Suturing via Stein Variational Newton and Geometric Residuals

PinPoint:通过Stein变分牛顿和几何残差进行机器人缝合的单目针姿态估计

Jesse F. d'Almeida, Tanner Watts, Susheela Sharma Stern, James Ferguson, Alan Kuntz, Robert J. Webster

机构 * Department of Mechanical Engineering, Vanderbilt University(范德比尔特大学机械工程系) Department of Electrical and Computer Engineering and Department of Computer Science, Vanderbilt University(范德比尔特大学电气与计算机工程系和计算机科学系) The Robotics Center and the Kahlert School of Computing, University of Utah(犹他大学机器人中心和Kahlert计算学院)

专题命中 其他多模态 :multimodal(abstract)

AI总结 PinPoint通过Stein变分牛顿和几何残差方法,解决单目内窥镜下针姿态估计的深度模糊和旋转对称性问题,显著降低位姿估计误差。

Comments 15 pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13682 2026-03-25 astro-ph.HE nucl-th 50%

Cross-Comparison of Sampling Algorithms for Pulse Profile Modeling of PSR J0740+6620

脉冲轮廓建模中采样算法的交叉比较:PSR J0740+6620

Mariska Hoogkamer, Yves Kini, Tuomo Salmi, Anna L. Watts, Johannes Buchner

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文比较了MultiNest和UltraNest在PSR J0740+6620脉冲轮廓建模中的表现,评估了参数恢复、收敛性和计算成本,发现两者均能产生准确的参数估计结果。

Comments Published in PRD

Journal ref Phys. Rev. D 112, 023008 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23210 2026-03-25 cond-mat.dis-nn cond-mat.mtrl-sci cs.LG 50%

Generative Inversion of Spectroscopic Data for Amorphous Structure Elucidation

光谱数据生成性反演以阐明非晶结构

Jiawei Guo, Daniel Schwalbe-Koda

机构 * Department of Materials Science and Engineering, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校材料科学与工程系)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出GLASS框架,通过多模态光谱测量反推原子结构,利用得分模型学习结构先验,展示PDFs在非晶材料研究中的有效性,并解决三个争议性实验问题。

Comments 10 pages; SI: 51 pages

详情

展开后加载摘要…

URL PDF HTML 收藏