arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-15 至 2026-04-15 共收录 78 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 17 篇

2604.12648 2026-04-15 cs.LG cs.AI 57%

TimeSAF: Towards LLM-Guided Semantic Asynchronous Fusion for Time Series Forecasting

TimeSAF:面向时间序列预测的LLM引导语义异步融合

Fan Zhang, Shiming Fan, Hua Wang

机构 * Shandong Technology and Business University(山东技术与商业大学) Ludong University(鲁东大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出TimeSAF框架,通过层级异步融合解决LLM与时间序列语义不匹配问题,采用独立语义融合模块和分阶段语义细化解码器,提升预测性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00655 2026-04-15 cs.CV 57%

Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding

Mema:增强视觉-语言理解的内存增强适配器

Ying Liu, Yudong Han, Kean Shi, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) Yangtze Delta Region Academy of Beijing Institude of Technology(北京理工大学长江三角洲地区研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Mema适配器,通过维护状态记忆积累层次视觉表示,提升多模态理解性能,实验验证其在复杂任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12356 2026-04-15 cs.CV 57%

OmniFood8K: Single-Image Nutrition Estimation via Hierarchical Frequency-Aligned Fusion

OmniFood8K:通过层次化频率对齐融合实现单图像营养估计

Dongjian Yu, Weiqing Min, Qian Jiang, Xing Lin, Xin Jin, Shuqiang Jiang

机构 * School of Software, Yunnan University, China(云南大学软件学院,中国) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OmniFood8K数据集和端到端框架,通过频率对齐融合模块提升单图像营养预测精度,解决中餐营养估计不足和深度传感器限制问题。

Comments Accepted by CVPR 2026 (Highlight Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12012 2026-04-15 cs.CV 57%

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

TIPSv2:通过增强的补丁-文本对齐推进视觉-语言预训练

Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washington Ramos, Krzysztof Choromanski, Mojtaba Seyedhosseini, Howard Zhou, André Araujo

机构 * Google(谷歌) DeepMind(深度Mind)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 本文提出TIPSv2,通过改进的预训练方法提升视觉-语言模型的补丁-文本对齐能力,实验表明其在多种任务和数据集上表现优异。

Comments CVPR2026 camera-ready + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10584 2026-04-15 cs.CV 57%

CoFusion: Multispectral and Hyperspectral Image Fusion via Spectral Coordinate Attention

CoFusion:通过光谱坐标注意力实现多谱段和超谱图像融合

Baisong Li

机构 * School of Integrated Circuits, Tsinghua University, Beijing 100084, China(集成电路学院,清华大学,北京100084,中国)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出CoFusion框架,通过建模跨尺度和跨模态依赖,提升多谱段和超谱图像融合的空谱协同效果,实现空谱细节增强与光谱保真度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10026 2026-04-15 cs.CV 57%

LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA

LaV-CoT:具有多方面奖励优化的语言感知视觉CoT

Jing Huang, Zhiya Tan, Shutao Gong, Fanwei Zeng, Joey Tianyi Zhou, Changtao Miao, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) CFAR, Agency for Science, Technology and Research(科技研究局CFAR)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 LaV-CoT通过多阶段推理流程和多方面奖励优化,提升多语言视觉问答的准确性和泛化能力,实现在公开数据集上的9.5%准确率提升。

Comments Accepted by WWW 2026 Industry Track - Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17976 2026-04-15 stat.CO cs.LG 50%

metasnf: Meta Clustering with Similarity Network Fusion in R

metasnf:基于相似性网络融合的元聚类在R中

Prashanth S Velayudhan, Xiaoqiao Xu, Prajkta Kallurkar, Ana Patricia Balbon, Maria T Secara, Adam Taback, Denise Sabac, Nicholas Chan, Shihao Ma, Bo Wang, Daniel Felsky, Stephanie H Ameis, Brian Cox, Colin Hawco, Lauren Erdman, Anne L Wheeler

机构 * Hospital for Sick Children(Sick Children 医院) University of Toronto(多伦多大学) Centre for Addiction and Mental Health(成瘾与心理健康中心)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 metasnf包通过元聚类方法,利用相似性网络融合实现高效搜索聚类解,提供可视化、表征和验证功能,帮助研究者发现基于上下文的聚类解。

Comments 66 pages, 26 figures, provisionally accepted at Journal of Statistical Software

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09374 2026-04-15 quant-ph cs.LG 50%

Variational Quantum Physics-Informed Neural Networks for Hydrological PDE-Constrained Learning with Inherent Uncertainty Quantification

变分量子物理信息神经网络用于具有内在不确定性量化的水文PDE约束学习

Prasad Nimantha Madusanka Ukwatta Hewage, Midhun Chakkravarthy, Ruvan Kumara Abeysekara

机构 * Faculty of Computer Science and Multimedia, Lincoln University College, Petaling Jaya, Selangor, Malaysia(计算机科学与多媒体学院,林肯大学学院,Petaling Jaya,Selangor,马来西亚)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出一种融合参数化变分量子电路的混合量子-经典物理信息神经网络,用于水文PDE约束学习,通过量子态编码多源遥感特征,并利用圣文森特浅水方程和曼宁流方程作为可微物理损失项,实现不确定性量化。

Comments 25 pages, 6 tables. Code available at https://github.com/nimanpra/HQC-PINN-Flood-Prediction. v2: corrected reference attributions in Section II.B

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 10 篇

2604.12271 2026-04-15 cs.LG 82%

RoleMAG: Learning Neighbor Roles in Multimodal Graphs

RoleMAG: 在多模态图中学习邻居角色

Yilong Zuo, Xunkai Li, Zhihan Zhang, Ronghua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 RoleMAG通过区分邻居在传播中的角色,改进多模态图的处理,实验表明其在RedditS和Bili_Dance上表现最佳,且在Toys上保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06448 2026-04-15 cs.CL 79%

Perception-Aware Policy Optimization for Multimodal Reasoning

面向多模态推理的感知意识策略优化

Zhenhailong Wang, Xuehang Guo, Sofia Stoica, Haiyang Xu, Hongru Wang, Hyeonjeong Ha, Xiusi Chen, Yangyi Chen, Ming Yan, Fei Huang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Alibaba Group(阿里巴巴集团)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出PAPO算法,通过引入隐式感知损失提升多模态推理性能,实现4.4%-17.5%的基准提升,尤其在视觉依赖性强的任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04204 2026-04-15 cs.CV cs.LG 79%

AGMA: Adaptive Gaussian Mixture Anchors for Prior-Guided Multimodal Human Trajectory Forecasting

AGMA:自适应高斯混合锚点用于先验引导的多模态人类轨迹预测

Chao Li, Rui Zhang, Siyuan Huang, Xian Zhong, Hongbo Jiang

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出AGMA,通过两阶段方法构建表达性先验,提升多模态人类轨迹预测的准确性和多样性,实验表明其在ETH-UCY等数据集上达到SOTA性能。

Comments Withdrawn for substantial revision and will be re-uploaded as a new manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13017 2026-04-15 cs.AI cs.HC 57%

PAL: Personal Adaptive Learner

PAL:个性化学习者

Megha Chakraborty, Darssan L. Eswaramoorthi, Madhur Thareja, Het Riteshkumar Shah, Finlay Palmer, Aryaman Bahl, Michelle A Ihetu, Amit Sheth

机构 * Artificial Intelligence Institute, University of South Carolina(人工智能研究院,南卡罗来纳大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 PAL通过实时分析多模态内容和动态调整问题难度,为学习者提供个性化学习体验,提升教育响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12508 2026-04-15 cs.CV 57%

From Attenuation to Attention: Variational Information Flow Manipulation for Fine-Grained Visual Perception

从衰减到注意:用于细粒度视觉感知的变分信息流操控

Jilong Zhu, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(智能信息处理重点实验室,计算技术研究所,中国科学院(ICT/CAS)) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院(ICT/CAS)) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出变分信息流框架,通过建模问题-答案对相关的视觉显著性作为潜在分布,解决多模态大语言模型在细粒度感知任务中的信息衰减问题,提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12180 2026-04-15 cs.LG cs.AI 57%

CycloneMAE: A Scalable Multi-Task Learning Model for Global Tropical Cyclone Probabilistic Forecasting

CycloneMAE:一种用于全球热带气旋概率预报的可扩展多任务学习模型

Renlong Hang, Zihao Xu, Jiuwei Zhao, Runling Yu, Leye Cheng, Qingshan Liu

机构 * School of Computer Science, School of Software(计算机科学学院、软件学院) Nanjing University of Information Science and Technology(南京信息工程大学) School of Atmospheric Sciences(大气科学学院) Shanghai Typhoon Institute(上海台风研究所) China Meteorological Administration(中国气象局) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

AI总结 CycloneMAE通过多模态数据学习可迁移的热带气旋表示,结合离散概率格机制与预训练/微调范式,实现确定性预报和概率分布输出,优于现有NWP系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10547 2026-04-15 q-bio.NC cs.AI cs.LG 57%

Pursuit of biomarkers of brain diseases: Beyond cohort comparisons

寻找脑部疾病的生物标志物:超越队列比较

Pascal Helson, Arvind Kumar

机构 * Science For Life Laboratory(生命科学实验室)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出通过多模态和纵向脑数据指导分组,以定义多维生物标志物,而非依赖单一数据类型的队列比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12671 2026-04-15 q-bio.QM eess.SP 50%

Differentiating Physical and Psychological Stress Using Wearable Physiological Signals and Salivary Cortisol

区分生理和心理压力:使用可穿戴生理信号和唾液皮质醇

Ozan Kaya, Nikoletta Athanassopoulou, George G. Malliaras, Marco Vinicio Alban-Paccha

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究通过可穿戴信号与唾液皮质醇结合区分生理和心理压力及恢复状态,发现加入皮质醇显著提升分类准确率,尤其对心理压力识别有帮助。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27552 2026-04-15 cs.LG cs.DC 50%

BLOSSOM: Block-wise Federated Learning Over Shared and Sparse Observed Modalities

BLOSSOM:基于共享和稀疏观测模态的块级联邦学习

Pranav M R, Jayant Chandwani, Ahmed M. Abdelmoniem, Arnab K. Paul

机构 * DaSH Lab, BITS Pilani, KK Birla Goa Campus, India(BITS Pilani 去年戈亚校区达什实验室,印度) Queen Mary University of London, United Kingdom(伦敦女王玛丽大学,英国)

专题命中 其他多模态 :multimodal(abstract)

AI总结 BLOSSOM提出一种任务无关的多模态联邦学习框架,通过块级聚合策略实现共享组件聚合与任务特定块保护,提升在模态缺失场景下的性能,实验显示其在模态稀疏情况下性能提升显著。

Comments Accepted to IJCNN 2026 (6 pages, 2 figures, 3 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08650 2026-04-15 cond-mat.mtrl-sci 50%

Intertwined polar, chiral, and ferro-rotational orders in a rotation-only insulator

旋转绝缘体中极性、手性和铁旋转序的交织

Weizhe Zhang, June Ho Yeo, Xiaoyu Guo, Tony Chiang, Nishkarsh Agarwal, John T. Heron, Kai Sun, Junjie Yang, Sang-Wook Cheong, Youngjun Ahn, Liuyan Zhao

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究通过Ni3TeO6旋转绝缘体揭示极性、手性和铁旋转序的交织关系,阐明其对域结构和域壁特性的影响,为域切换和控制提供新途径。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏