arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6887 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6887 篇

2407.04916 2025-02-28 cs.CV 79%

Completed Feature Disentanglement Learning for Multimodal MRIs Analysis

Tianling Liu, Hongying Liu, Fanhua Shang, Lequan Yu, Tong Han, Liang Wan

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments Accept by IEEE JBHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17900 2025-02-26 cs.LG cs.AI 79%

Knowledge-enhanced Multimodal ECG Representation Learning with Arbitrary-Lead Inputs

Che Liu, Cheng Ouyang, Zhongwei Wan, Haozhe Wang, Wenjia Bai, Rossella Arcucci

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17524 2025-02-26 eess.SP cs.AI cs.LG 79%

Multimodal Bearing Fault Classification Under Variable Conditions: A 1D CNN with Transfer Learning

Tasfiq E. Alam, Md Manjurul Ahsan, Shivakumar Raman

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00321 2025-02-25 cs.IR cs.AI 79%

MIM: Multi-modal Content Interest Modeling Paradigm for User Behavior Modeling

Bencheng Yan, Si Chen, Shichang Jia, Jianyu Liu, Yueran Liu, Chenghan Fu, Wanxian Guan, Hui Zhao, Xiang Zhang, Kai Zhang, Wenbo Su, Pengjie Wang, Jian Xu, Bo Zheng, Baolin Liu

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15542 2025-02-24 cs.IR cs.AI 79%

Bridging Domain Gaps between Pretrained Multimodal Models and Recommendations

Wenyu Zhang, Jie Luo, Xinming Zhang, Yuan Fang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15740 2025-02-24 cs.CV cs.RO 79%

MambaPlace:Text-to-Point-Cloud Cross-Modal Place Recognition with Attention Mamba Mechanisms

Tianyi Shang, Zhenyu Li, Pengjie Xu, Jinwei Qiao

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.CV

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12478 2025-02-19 cs.CL 79%

MSE-Adapter: A Lightweight Plugin Endowing LLMs with the Capability to Perform Multimodal Sentiment Analysis and Emotion Recognition

Yang Yang, Xunde Dong, Yupeng Qiang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15208 2025-02-18 cs.CV cs.LG cs.RO 79%

OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving

Shuo Xing, Chengyuan Qian, Yuping Wang, Hongyuan Hua, Kexin Tian, Yang Zhou, Zhengzhong Tu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments The 3rd WACV Workshop on Large Language and Vision Models for Autonomous Driving (LLVM-AD) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15981 2025-02-13 cs.CV cs.LG 79%

Robust Visual Representation Learning with Multi-modal Prior Knowledge for Image Classification Under Distribution Shift

Hongkuan Zhou, Lavdim Halilaj, Sebastian Monka, Stefan Schmid, Yuqicheng Zhu, Bo Xiong, Steffen Staab

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01162 2025-02-13 cs.CV 79%

Sparsity Meets Similarity: Leveraging Long-Tail Distribution for Dynamic Optimized Token Representation in Multimodal Large Language Models

Gaotong Yu, Yi Chen, Jian Xu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07391 2025-02-12 cs.CL 79%

Target-Augmented Shared Fusion-based Multimodal Sarcasm Explanation Generation

Palaash Goel, Dushyant Singh Chauhan, Md Shad Akhtar

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06583 2025-02-11 cs.CV 79%

Adaptive Perception for Unified Visual Multi-modal Object Tracking

Xiantao Hu, Bineng Zhong, Qihua Liang, Zhiyi Mo, Liangtao Shi, Ying Tai, Jian Yang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06100 2025-02-11 cs.CV eess.SP 79%

Col-OLHTR: A Novel Framework for Multimodal Online Handwritten Text Recognition

Chenyu Liu, Jinshui Hu, Baocai Yin, Jia Pan, Bing Yin, Jun Du, Qingfeng Liu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06062 2025-02-11 eess.IV cs.AI 79%

Multi-modal Data Fusion and Deep Ensemble Learning for Accurate Crop Yield Prediction

Akshay Dagadu Yewle, Laman Mirzayeva, Oktay Karakuş

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.AI

Comments 28 pages, 7 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04220 2025-02-10 cs.RO cs.AI cs.LG 79%

Multi-modal perception for soft robotic interactions using generative models

Enrico Donato, Egidio Falotico, Thomas George Thuruthel

专题命中 多模态训练与对齐 :multi-modal(title);cross-modal(abstract);分类 cs.AI

Comments Accepted for presentation at IEEE RoboSoft 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18407 2025-02-10 cs.LG cs.AI q-bio.BM 79%

A Group Symmetric Stochastic Differential Equation Model for Molecule Multi-modal Pretraining

Shengchao Liu, Weitao Du, Zhiming Ma, Hongyu Guo, Jian Tang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14455 2025-02-07 cs.CV 79%

Triple Path Enhanced Neural Architecture Search for Multimodal Fake News Detection

Bo Xu, Qiujie Xie, Jiahui Zhou, Linlin Zong

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments IEEE International Conference on Acoustics, Speech, and Signal Processing(ICASSP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02938 2025-02-06 cs.CL 79%

LLaVAC: Fine-tuning LLaVA as a Multimodal Sentiment Classifier

T. Chay-intr, Y. Chen, K. Viriyayudhakorn, T. Theeramunkong

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08167 2025-02-05 cs.LG cs.CL q-bio.QM 79%

MolBind: Multimodal Alignment of Language, Molecules, and Proteins

Teng Xiao, Chao Cui, Huaisheng Zhu, Vasant G. Honavar

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01467 2025-02-04 cs.CV 79%

Deep Unfolding Multi-modal Image Fusion Network via Attribution Analysis

Haowen Bai, Zixiang Zhao, Jiangshe Zhang, Baisong Jiang, Lilun Deng, Yukun Cui, Shuang Xu, Chunxia Zhang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00078 2025-02-04 eess.IV cs.CV 79%

Deep Ensembling with Multimodal Image Fusion for Efficient Classification of Lung Cancer

Surochita Pal, Sushmita Mitra

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05040 2025-02-04 cs.CV 79%

Unsupervised Multimodal 3D Medical Image Registration with Multilevel Correlation Balanced Optimization

Jiazheng Wang, Xiang Chen, Yuxi Zhang, Min Liu, Yaonan Wang, Hang Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments Method description for MICCAI Learn2Reg 2024 challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15099 2025-01-28 cs.CV cs.LG 79%

Bringing RGB and IR Together: Hierarchical Multi-Modal Enhancement for Robust Transmission Line Detection

Shengdong Zhang, Xiaoqin Zhang, Wenqi Ren, Linlin Shen, Shaohua Wan, Jun Zhang, Yujing M Jiang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10791 2025-01-28 cs.CV 79%

CAFuser: Condition-Aware Multimodal Fusion for Robust Semantic Perception of Driving Scenes

Tim Broedermann, Christos Sakaridis, Yuqian Fu, Luc Van Gool

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments IEEE Robotics and Automation Letters, The source code is publicly available at: https://github.com/timbroed/CAFuser

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09323 2025-01-28 cs.CV 79%

E2E-MFD: Towards End-to-End Synchronous Multimodal Fusion Detection

Jiaqing Zhang, Mingxiang Cao, Weiying Xie, Jie Lei, Daixun Li, Wenbo Huang, Yunsong Li, Xue Yang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11968 2025-01-22 cs.AI cs.LG 79%

Bridging Visualization and Optimization: Multimodal Large Language Models on Graph-Structured Combinatorial Optimization

Jie Zhao, Kang Hao Cheong, Witold Pedrycz

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10958 2025-01-22 cs.CV 79%

Rethinking Early-Fusion Strategies for Improved Multimodal Image Segmentation

Zhengwen Shen, Yulian Li, Han Zhang, Yuchen Weng, Jun Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00320 2025-01-22 cs.AI 79%

Advancing Multimodal Data Fusion in Pain Recognition: A Strategy Leveraging Statistical Correlation and Human-Centered Perspectives

Xingrui Gu, Zhixuan Wang, Irisa Jin, Zekun Wu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

Comments Accepted by AHRI 2024

Journal ref 2024 12th International Conference on Affective Computing and Intelligent Interaction Workshops and Demos (ACIIW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.07289 2025-01-22 cs.CV eess.IV 79%

VMLoc: Variational Fusion For Learning-Based Multimodal Camera Localization

Kaichen Zhou, Changhao Chen, Bing Wang, Muhamad Risqi U. Saputra, Niki Trigoni, Andrew Markham

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Journal ref The Thirty-Fifth AAAI Conference on Artificial Intelligence (AAAI-2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19070 2025-01-20 cs.CV 79%

Myriad: Large Multimodal Model by Applying Vision Experts for Industrial Anomaly Detection

Yuanze Li, Haolin Wang, Shihao Yuan, Ming Liu, Debin Zhao, Yiwen Guo, Chen Xu, Guangming Shi, Wangmeng Zuo

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏