arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-11 至 2026-03-11 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 16 篇

2603.09173 2026-03-11 cs.CV 83%

Point Cloud as a Foreign Language for Multi-modal Large Language Model

点云作为多模态大语言模型的外语

Sneha Paul, Zachary Patterson, Nizar Bouguila

机构 * Concordia University(康科迪亚大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 SAGE是首个端到端3D多模态大语言模型,通过轻量级3D分词器直接处理点云,提升3D任务的推理能力与鲁棒性。

Comments Accepted in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09111 2026-03-11 cs.CV 83%

Progressive Representation Learning for Multimodal Sentiment Analysis with Incomplete Modalities

逐步表示学习用于不完整模态的多模态情感分析

Jindi Bao, Jianjun Qian, Mengkai Yan, Jian Yang

机构 * Nanjing University of Science and Technology(南京理工大学) Hohai University(河海大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 PRLF通过逐步表示学习框架,在不完整模态条件下提升多模态情感分析的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08800 2026-03-11 cs.CV 83%

Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM

Granulon: 通过自适应多粒度语义唤醒像素级视觉编码器以实现MLLM

Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming Jin

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 Granulon通过自适应多粒度语义增强,提升多模态大语言模型的像素级视觉理解和多粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09706 2026-03-11 cs.AI 79%

OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences

OOD-MMSafe: 推进多模态大语言模型安全性从有害意图到隐藏后果

Ming Wen, Kun Yang, Jingyu Zhang, Yuxuan Liu, shiwen cui, Shouling Ji, Xingjun Ma

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.AI

AI总结 OOD-MMSafe通过CASPO框架提升多模态大语言模型对隐藏后果的识别能力,显著降低风险识别失败率。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09258 2026-03-11 cs.CV 79%

Multimodal Graph Representation Learning with Dynamic Information Pathways

多模态图表示学习中的动态信息路径

Xiaobin Hong, Mingkai Lin, Xiaoli Wang, Chaoqun Wang, Wenzhong Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出DiP框架,通过动态信息路径实现多模态图表示学习,提升跨模态消息传播的适应性和表达性。

Comments 12 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13015 2026-03-11 cs.CV 79%

Multimodal Classification via Total Correlation Maximization

通过总相关性最大化实现多模态分类

Feng Yu, Xiangyu Wu, Yang Yang, Jianfeng Lu

机构 * Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出TCMax方法,通过最大化多模态特征与标签间的总相关性,缓解模态竞争并提升多模态分类性能。

Comments Accepted for publication at ICLR 2026; 19 pages; 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21064 2026-03-11 cs.CV 79%

Multimodal Skeleton-Based Action Representation Learning via Decomposition and Composition

多模态骨骼基动作表示学习通过分解与组合

Hongsong Wang, Heng Fei, Bingxuan Dai, Jie Gui

机构 * School of Computer Science and Engineering, Southeast University, Nanjing 210096, China(东南大学计算机科学与工程学院,南京210096,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用关键实验室(东南大学),中华人民共和国教育部,中国) School of Cyber Science and Engineering, Southeast University, Nanjing 210096, China(东南大学网络安全科学与工程学院,南京210096,中国) Engineering Research Center of Blockchain Application, Supervision And Management (Southeast University), Ministry of Education, China(区块链应用、监督与管理工程研究中心(东南大学),中华人民共和国教育部,中国) Purple Mountain Laboratories, Nanjing 210000, China(紫金山实验室,南京210000,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种自监督的多模态骨骼基动作表示学习框架,通过分解与组合策略平衡效率与效果,提升动作识别性能。

Comments Accepted by Machine Intelligence Research (Journal Impact Factor 8.7, 2024)

Journal ref Machine Intelligence Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15414 2026-03-11 eess.IV 78%

Entropy-and-Channel-Aware Adaptive-Rate Semantic Communication with MLLM-Aided Feature Compensation

熵与信道感知的自适应速率语义通信 with MLLM辅助特征补偿

Weixuan Chen, Qianqian Yang, Yuhao Chen, Chongwen Huang, Qian Wang, Zehui Xiong, Zhaoyang Zhang

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract)

AI总结 本文提出一种基于熵与信道感知的自适应速率语义通信框架,利用MLLM辅助特征补偿提升通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18811 2026-03-11 cs.CV cs.AI 62%

Mitigating Long-Tail Bias in HOI Detection via Adaptive Diversity Cache

通过自适应多样性缓存缓解HOI检测中的长尾偏差

Yuqiu Jiang, Xiaozhen Qiao, Yifan Chen, Ye Zheng, Zhe Sun, Xuelong Li

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出自适应多样性缓存模块,通过无训练机制缓解HOI检测中的长尾偏差,提升稀有类别检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09740 2026-03-11 cs.RO cs.CV 57%

Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments

逐步奖励:面向连续环境的视觉语言导航中的步骤感知对比对齐

Haoyuan Li, Rui Liu, Hehe Fan, Yi Yang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院,杭州,中国)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SACA框架,通过步骤感知对比对齐提升连续环境中视觉语言导航的性能,解决传统方法在错误恢复和训练稳定性方面的不足。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09702 2026-03-11 cs.CV 57%

TriFusion-SR: Joint Tri-Modal Medical Image Fusion and SR

TriFusion-SR:联合三模态医学图像融合与超分辨率

Fayaz Ali Dharejo, Sharif S. M. A., Aiman Khalil, Nachiket Chaudhary, Rizwan Ali Naqvi, Radu Timofte

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TriFusion-SR通过联合三模态医学图像融合与超分辨率技术,利用小波引导的条件扩散框架实现频率感知的跨模态交互,提升图像质量和分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09466 2026-03-11 cs.CV 57%

TopoOR: A Unified Topological Scene Representation for the Operating Room

TopoOR: 一种用于手术室的统一拓扑场景表示

Tony Danjun Wang, Ka Young Kim, Tolga Birdal, Nassir Navab, Lennart Bastian

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Imperial College London(伦敦帝国理工学院) Kyung Hee University(韩国庆熙大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TopoOR通过更高阶拓扑结构建模手术室的多模态特性,提升场景表达能力,优于传统图和LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09149 2026-03-11 cs.CV 57%

RTFDNet: Fusion-Decoupling for Robust RGB-T Segmentation

RTFDNet:用于鲁棒RGB-T分割的融合-解耦

Kunyu Tan, Mingjian Liang

机构 * independent researchers(独立研究人员)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 RTFDNet通过融合与解耦机制提升RGB-T分割的鲁棒性,采用三分支编码器-解码器结构,结合协同特征融合、跨模态解耦正则化和区域解耦正则化,实现高效独立推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03596 2026-03-11 cs.HC 50%

Exploring EEG and Eye Movement Fusion for Multi-Class Target RSVP-BCI

探索EEG和眼动融合用于多类目标RSVP-BCI

Xujin Li, Wei Wei, Kun Zhao, Jiayu Mao, Yizhuo Lu, Shuang Qiu, Huiguang He

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出MTREE-Net,通过融合EEG和眼动数据提升多类RSVP-BCI的解码性能。

Comments 17 pages, 9 figures

Journal ref Information Fusion, 2025, 121: 103135

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18741 2026-03-11 stat.ME 50%

Spectral Graph Filtering for Modality-Specific Representation Learning

基于谱图滤波的模态特异性表示学习

Shira Yoffe, Amit Moscovich, Ariel Jaffe

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出DELVE方法,通过谱图滤波提取模态特异性潜在变量,以识别不同模态间的差异结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08763 2026-03-11 cs.LG cs.RO 50%

SPREAD: Subspace Representation Distillation for Lifelong Imitation Learning

SPREAD: 为终身模仿学习的子空间表示蒸馏

Kaushik Roy, Giovanni D'urso, Nicholas Lawrance, Brendan Tidd, Peyman Moghadam

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 SPREAD通过子空间表示蒸馏方法,在终身模仿学习中提升知识迁移和泛化能力,缓解灾难性遗忘,实现最优性能。

Comments IEEE International Conference on Robotics & Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏