arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-24 至 2026-02-24 共收录 22 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 22 篇

2602.19605 2026-02-24 cs.CV cs.AI cs.MM 85%

CLCR: Cross-Level Semantic Collaborative Representation for Multimodal Learning

CLCR:多模态学习中的跨层语义协作表示

Chunlei Meng, Guanhong Huang, Rong Fu, Runmin Jian, Zhongxue Gan, Chun Ouyang

机构 * Fudan University(复旦大学) Shantou University(汕头大学) University of Macau(澳门大学) Guangzhou Huashang College(广州华商学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 CLCR通过跨层语义协同表示方法,有效解决多模态数据中的语义错位问题,提升多模态学习的表示质量与任务泛化能力。

Comments This study has been Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19585 2026-02-24 cs.MM cs.AI 84%

Tri-Subspaces Disentanglement for Multimodal Sentiment Analysis

三子空间解耦用于多模态情感分析

Chunlei Meng, Jiabin Luo, Zhenglin Yan, Zhenyu Yu, Rong Fu, Zhongxue Gan, Chun Ouyang

机构 * Fudan University(复旦大学) Peking University(北京大学) University of Macau(澳门大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出三子空间解耦框架,通过分解多模态特征为公共、子模态共享和私人子空间,提升多模态情感分析的性能和鲁棒性。

Comments This study has been Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20046 2026-02-24 cs.CV cs.LG 83%

Closing the gap in multimodal medical representation alignment

弥合多模态医学表征对齐的差距

Eleonora Grassucci, Giordano Cicchetti, Danilo Comminiello

机构 * Dept. of Information Engineering, Electronics, and Telecommunications(信息工程、电子与电信系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种模态无关的框架,用于弥合多模态医学表征对齐中的模态差距,提升放射学图像与临床文本之间的对齐效果。

Comments Accepted at MLSP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19832 2026-02-24 cs.CV 83%

M3S-Net: Multimodal Feature Fusion Network Based on Multi-scale Data for Ultra-short-term PV Power Forecasting

M3S-Net:基于多尺度数据的多模态特征融合网络用于超短期光伏功率预测

Penghui Niu, Taotao Cai, Suqi Zhang, Junhua Gu, Ping Zhang, Qiqi Liu, Jianxin Li

机构 * School of Artificial Intelligence, Hebei University of Technology(人工智能学院,河北工业大学) University of Southern Queensland(南方昆士兰大学) School of Information Engineering, Tianjin University of Commerce(信息工程学院,天津商业大学) Hebei Province Key Laboratory of Big Data Calculation, Hebei University of Technology(大数据计算河北重点实验室,河北工业大学) General AI Lab, School of Engineering, Westlake University(通用人工智能实验室,西湖大学) School of Business and Law, Edith Cowan University(商学院和法学院,埃迪斯科文大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 M3S-Net通过多尺度数据融合和跨模态Mamba交互模块,提升超短期光伏功率预测的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19505 2026-02-24 cs.CV 83%

Test-Time Computing for Referring Multimodal Large Language Models

测试时计算用于指代多模态大语言模型

Mingrui Wu, Hao Chen, Jiayi Ji, Xiaoshuai Sun, Zhiyuan Liu, Liujuan Cao, Ming-Ming Cheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) VCIP, CS, Nankai University(VCIP,计算机科学,南开大学) Tsinghua University(清华大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 ControlMLLM++通过注入可学习的视觉提示实现多模态大语言模型的测试时适应,提升细粒度视觉推理能力。

Comments arXiv admin note: substantial text overlap with arXiv:2407.21534

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03830 2026-02-24 cs.AI cs.CV cs.CY 81%

Decoding Tourist Perception in Historic Urban Quarters with Multimodal Social Media Data: An AI-Based Framework and Evidence from Shanghai

通过多模态社交媒体数据解码历史城市街区的游客感知:一种基于人工智能的框架及上海的实证

Kaizhen Tan, Yufan Wu, Yuxuan Liu, Haoran Zeng

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出基于人工智能的多模态框架,通过分析社交媒体数据解码游客对历史城市街区的感知,揭示感知与现实之间的差距,并为遗产管理和城市设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18745 2026-02-24 cs.CV cs.AI 81%

Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code

从零开始合成多模态几何数据集并借助绘图代码实现视觉对齐

Haobo Lin, Tianyi Bai, Chen Chen, Jiajun Zhang, Bohan Zeng, Wentao Zhang, Binhang Yuan

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出GeoCode数据集,通过代码预测实现视觉对齐,提升多模态几何推理性能。

Comments 58 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01696 2026-02-24 cs.CV cs.AI 81%

Cross-Modal Purification and Fusion for Small-Object RGB-D Transmission-Line Defect Detection

跨模态净化与融合用于小物体RGB-D传输线缺陷检测

Jiaming Cui, Wenqiang Li, Shuai Zhou, Ruifeng Qin, Feng Shen

机构 * School of Mechatronics Engineering, Harbin Institute of Technology(机械电子工程学院,哈尔滨工业大学) School of Instrument Science and Engineering, Harbin Institute of Technology(仪器科学与工程学院,哈尔滨工业大学) Electric Power Research Institute, Yunnan Power Grid Co., Ltd.(电力研究院,云南电网公司)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 CMAFNet通过跨模态净化与融合技术,提升小物体RGB-D传输线缺陷检测的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23479 2026-02-24 cs.CV 79%

MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding

MergeMix:一种用于视觉和多模态理解的统一增强范式

Xin Jin, Siyuan Li, Siyong Jian, Kai Yu, Huan Wang

机构 * Westlake University(西拉克大学) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 MergeMix通过高效的令牌合并Mixup增强方法,平衡了SFT和RL的优劣,提升多模态大语言模型的分类准确率和对齐能力。

Comments ICLR 2026, Web link: https://jinxins.github.io/MergeMix_Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19702 2026-02-24 cs.IR cs.AI 79%

DReX: An Explainable Deep Learning-based Multimodal Recommendation Framework

DReX:一种基于深度学习的可解释多模态推荐框架

Adamya Shyam, Venkateswara Rao Kagita, Bharti Rana, Vikas Kumar

机构 * University of Delhi, Delhi, India(德里大学) National Institute of Technology, Warangal, India(印度战争格尔国家理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 DReX通过多模态反馈的交互级特征逐步细化用户和物品表示,提升推荐系统的可解释性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19140 2026-02-24 cs.CV cs.LG 79%

CaReFlow: Cyclic Adaptive Rectified Flow for Multimodal Fusion

CaReFlow:循环适应修正流用于多模态融合

Sijie Mai, Shiqin Han

机构 * South China Normal University(华南师范大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 CaReFlow通过循环适应修正流实现多模态融合,解决模态间隙问题,提升分布对齐和特征转换的鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19058 2026-02-24 cs.CL 79%

Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer

大型语言模型和视觉语言模型是否共享神经元进行推理?证据和跨模态转移的机制

Chenhang Cui, An Zhang, Yuxin Chen, Gelei Deng, Jingnan Zheng, Zhenkai Liang, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型和视觉语言模型在推理过程中共享神经元的现象,提出SNRF框架实现低秩融合,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06450 2026-02-24 cs.CV cs.LG 79%

Countering Multi-modal Representation Collapse through Rank-targeted Fusion

通过秩目标融合对抗多模态表示崩溃

Seulgi Kim, Kiran Kokilepersaud, Mohit Prabhushankar, Ghassan AlRegib

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出Rank-enhancing Token Fuser框架,通过提升有效秩对抗多模态表示崩溃,验证了深度与RGB融合的平衡性,并在动作预测任务中取得显著性能提升。

Comments Accepted in 2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10652 2026-02-24 cs.CL 79%

ViTextVQA: A Large-Scale Visual Question Answering Dataset and a Novel Multimodal Feature Fusion Method for Vietnamese Text Comprehension in Images

ViTextVQA: 一个大规模视觉问答数据集和一种新的多模态特征融合方法用于图像中的越南语文本理解

Quan Van Nguyen, Dan Quang Tran, Huy Quang Pham, Thang Kien-Bao Nguyen, Nghia Hieu Nguyen, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen

机构 * Faculty of Information Science and Engineering, University of Information Technology(信息科学与工程学院,信息科技大学) Vietnam National University(越南国家大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 ViTextVQA是一个大规模视觉问答数据集,提出了一种新的多模态特征融合方法,用于提升图像中越南语文本的理解能力。

Comments International Journal of Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18752 2026-02-24 cs.CV cs.GR 79%

Optimizing ID Consistency in Multimodal Large Models: Facial Restoration via Alignment, Entanglement, and Disentanglement

多模态大模型中ID一致性优化:通过对齐、纠缠与解纠缠进行面部修复

Yuran Dong, Hang Dai, Mang Ye

机构 * National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 EditedID通过引入对齐、解纠缠和纠缠机制,提升多模态大模型中面部身份一致性的修复能力。

Comments ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18863 2026-02-24 eess.IV cs.CV cs.LG cs.MM 73%

TIACam: Text-Anchored Invariant Feature Learning with Auto-Augmentation for Camera-Robust Zero-Watermarking

TIACam: 基于自增强的文本锚定不变特征学习用于抗相机零水印

Abdullah All Tanvir, Agnibh Dasgupta, Xin Zhong

机构 * Department of Computer Science University of Nebraska Omaha(计算机科学系 内布拉斯加大学奥马哈分校)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 TIACam通过文本锚定不变特征学习和自增强技术,实现抗相机重拍的零水印系统,提升特征稳定性和水印提取准确性。

Comments This paper is accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19367 2026-02-24 cs.AI cs.CV 62%

Time Series, Vision, and Language: Exploring the Limits of Alignment in Contrastive Representation Spaces

时间序列、视觉与语言:探讨对比表示空间中对齐的极限

Pratham Yashwante, Rose Yu

机构 * University of California San Diego, USA(加州大学圣地亚哥分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了时间序列、视觉和语言在对比表示空间中的对齐问题,发现模型规模越大对齐性越强,但对齐是不对称的,图像可作为中介,文本和视觉信息的密度影响对齐效果。

Comments 24 Figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05992 2026-02-24 cs.CV cs.AI 62%

Exploring Partial Multi-Label Learning via Integrating Semantic Co-occurrence Knowledge

探索通过整合语义共现知识的半多标签学习

Xin Wu, Fei Teng, Yue Feng, Kaibo Shi, Zhuosheng Lin, Ji Zhang, James Wang

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学) Engineering Research Center of Sustainable Urban Intelligent Transportation, Ministry of Education(可持续城市智能交通工程研究中心,教育部) School of Engineering, Swinburne University of Technology(工程学院,斯winburne大学) School of Electronic and Information Engineering, Wuyi University(电子与信息工程学院,五邑大学) College of Electrical Engineering, Sichuan University(电气工程学院,四川大学) School of Computer Science, Chengdu University(计算机科学学院,成都大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SCINet框架,通过整合语义共现知识,提升半多标签学习的准确性与效果。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19870 2026-02-24 cs.CV 57%

ApET: Approximation-Error Guided Token Compression for Efficient VLMs

ApET:基于近似误差的令牌压缩用于高效的视觉语言模型

Qiankun Ma, Ziyao Zhang, Haofei Wang, Jie Chen, Zhen Song, Hairong Zheng

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Peng Cheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 ApET通过近似误差指导的令牌压缩,在不使用注意力机制的情况下高效压缩视觉语言模型的令牌预算,提升推理效率。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19615 2026-02-24 cs.CV 57%

Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness

清晰可见,自信推理:用于视觉语言模型盲点的即插即用修复方法

Xin Hu, Haomiao Ni, Yunbei Zhang, Jihun Hamm, Zechen Li, Zhengming Ding

机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) Department of Computer Science, University of Memphis(密苏里大学计算机科学系)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种无需微调的即插即用模块,通过细化视觉标记和丰富文本提示,提升VLM对罕见物体的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12047 2026-02-24 cs.CV 57%

PSGait: Gait Recognition using Parsing Skeleton

PSGait: 基于解析骨架的步态识别

Hangrui Xu, Zhengxian Wu, Chuanrui Zhang, Zhuohong Chen, Zhifang Liu, Peng Jiao, Haoqian Wang

机构 * The Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) School of Computer Science and Information Engineering, Hefei University of Technology, China(合肥工业大学计算机科学与信息工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 PSGait通过解析骨架与轮廓融合的方法提升步态识别的准确性和泛化能力,实现15.7%的精度提升。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17195 2026-02-24 cs.RO 50%

Depth-PC: A Visual Servo Framework Integrated with Cross-Modality Fusion for Sim2Real Transfer

Depth-PC: 一种集成跨模态融合的视觉伺服框架用于仿真到现实迁移

Haoyu Zhang, Yang Liu, Yimu Jiang, Weiyang Lin, Chao Ye

机构 * Research Institute of Intelligent Control and Systems, Harbin Institute of Technology(智能控制与系统研究所,哈尔滨工业大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 Depth-PC通过跨模态融合和图神经网络实现零样本仿真到现实迁移的视觉伺服框架

详情

展开后加载摘要…

URL PDF HTML 收藏