arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6878 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6878 篇

2508.16230 2025-08-25 cs.CV cs.AI 81%

FlexMUSE: Multimodal Unification and Semantics Enhancement Framework with Flexible interaction for Creative Writing

Jiahao Chen, Zhiyong Ma, Wenbiao Du, Qingyuan Chuai

机构 * Cao Tu Li(Guangzhou) Technology Co., Ltd, China(广东曹图利技术有限公司) South China University of Technology, China(华南理工大学)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01068 2025-08-25 cs.CL cs.AI 81%

Multimodal Transformers are Hierarchical Modal-wise Heterogeneous Graphs

Yijie Jin, Junjie Peng, Xuanchao Lin, Haochen Yuan, Lan Wang, Cangzhi Zheng

机构 * School of Computer Engineering and Science, Shanghai University(上海大学计算机工程与科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

Journal ref https://aclanthology.org/2025.acl-long.109/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11319 2025-08-19 cs.CV cs.AI 81%

GeoSAM: Fine-tuning SAM with Multi-Modal Prompts for Mobility Infrastructure Segmentation

Rafi Ibn Sultan, Chengyin Li, Hui Zhu, Prashant Khanduri, Marco Brocanelli, Dongxiao Zhu

机构 * Department of Computer Science, Wayne State University, Detroit, MI, USA 48202(计算机科学系,韦恩州立大学) Department of Radiation Oncology, Henry Ford Health, Detroit, MI, USA 48202(放射肿瘤科,亨利福特健康) Department of Electrical and Computer Engineering, The Ohio State University, Columbus, Ohio, USA 43210(电气与计算机工程系,俄亥俄州立大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by European Conference on Artificial Intelligence (ECAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10552 2025-08-15 cs.CL cs.AI 81%

When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models

Huyu Wu, Meng Tang, Xinhan Zheng, Haiyun Jiang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06895 2025-08-12 cs.CV cs.AI 81%

BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models

Jianting Tang, Yubo Wang, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00826 2025-08-12 cs.CL cs.AI cs.LG 81%

HERGC: Heterogeneous Experts Representation and Generative Completion for Multimodal Knowledge Graphs

Yongkang Xiao, Rui Zhang

机构 * University of Minnesota(明尼苏达大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08195 2025-08-07 cs.RO cs.AI cs.CV 81%

3DTTNet: Multimodal Fusion-Based 3D Traversable Terrain Modeling for Off-Road Environments

Zitong Chen, Chao Sun, Shida Nie, Chen Min, Changjiu Ning, Haoyu Li, Bo Wang

机构 * Shenzhen Automotive Research Institute, Beijing Institute of Technology, Shenzhen(深圳汽车研究院,北京理工大学,深圳) School of Mechanical Engineering, Beijing Institute of Technology, Beijing(机械工程学院,北京理工大学,北京) Research Center for Intelligent Computing Systems, Institute of Computing Technology, Chinese Academy of Sciences, Beijing(智能计算系统研究中心,计算技术研究所,中国科学院,北京)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 15 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01455 2025-08-06 cs.CV cs.AI cs.LG 81%

Automatic Fused Multimodal Deep Learning for Plant Identification

Alfreds Lapkovskis, Natalia Nefedova, Ali Beikmohammadi

机构 * Department of Computer and Systems Sciences(计算机与系统科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Journal ref Front. Plant Sci., 05 August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01525 2025-08-05 cs.CV cs.AI 81%

MiraGe: Multimodal Discriminative Representation Learning for Generalizable AI-Generated Image Detection

Kuo Shi, Jie Lu, Shanshan Ye, Guangquan Zhang, Zhen Fang

机构 * University of Technology Sydney(悉尼技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20749 2025-07-29 cs.CL cs.CV 81%

Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study

Yiran Huang, Lukas Thede, Massimiliano Mancini, Wenjia Xu, Zeynep Akata

机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) Helmholtz Munich, Munich Center for Machine Learning, Germany(海德堡慕尼黑,慕尼黑机器学习中心,德国) University of Tübingen, Tübingen AI Center, Germany(图宾根大学,图宾根人工智能中心,德国) University of Trento, Italy(特伦托大学,意大利) Beijing University of Posts and Telecommunications, China(北京邮电大学,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted at GCPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06821 2025-07-29 cs.LG cs.AI cs.MM 81%

HeLo: Heterogeneous Multi-Modal Fusion with Label Correlation for Emotion Distribution Learning

Chuhang Zheng, Chunwei Tian, Jie Wen, Daoqiang Zhang, Qi Zhu

机构 * College of Artificial Intelligence(人工智能学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18940 2025-07-28 cs.CL cs.MM 81%

LLaVA-NeuMT: Selective Layer-Neuron Modulation for Efficient Multilingual Multimodal Translation

Jingxuan Wei, Caijun Jia, Qi Chen, Yujun Cai, Linzhuang Sun, Xiangxiang Zhang, Gaowei Wu, Bihui Yu

机构 * University of Chinese Academy of Sciences(中国科学院大学) The University of Queensland(昆士兰大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18929 2025-07-28 cs.CV cs.AI 81%

MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition

Jian Chen, Yuxuan Hu, Haifeng Lu, Wei Wang, Min Yang, Chengming Li, Xiping Hu

机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18512 2025-07-25 cs.CV cs.AI 81%

Explaining How Visual, Textual and Multimodal Encoders Share Concepts

Clément Cornet, Romaric Besançon, Hervé Le Borgne

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22116 2025-07-23 cs.CL cs.AI 81%

Multimodal Forecasting of Sparse Intraoperative Hypotension Events Powered by Language Model

Jintao Zhang, Zirui Liu, Mingyue Cheng, Shilong Zhang, Tingyue Pan, Yitong zhou, Qi Liu, Yanhu Xie

机构 * University of Science and Technology of China(中国科学技术大学) The First Affiliated Hospital of University of Science and Technology of China(中国科学技术大学第一附属医院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12795 2025-07-18 cs.CV cs.AI 81%

City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning

Penglei Sun, Yaoxian Song, Xiangru Zhu, Xiang Liu, Qiang Wang, Yue Liu, Changqun Xia, Tiefeng Li, Yang Yang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Zhejiang University(浙江大学) Fudan University(复旦大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Terminus Technologies Co., Ltd. Pengcheng Laboratory(鹏城实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12669 2025-07-18 eess.IV cs.AI cs.CV 81%

InSight: AI Mobile Screening Tool for Multiple Eye Disease Detection using Multimodal Fusion

Ananya Raghu, Anisha Raghu, Alice S. Tang, Yannis M. Paulus, Tyson N. Kim, Tomiko T. Oskotsky

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11892 2025-07-17 cs.CV cs.AI cs.HC 81%

From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition

Yu Liu, Leyuan Qu, Hanlei Shi, Di Gao, Yuhua Zheng, Taihao Li

机构 * Hangzhou Institute for Advanced Study(杭州先进研究院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05285 2025-07-15 cs.CL cs.AI cs.CY cs.IR 81%

Beyond classical and contemporary models: a transformative AI framework for student dropout prediction in distance learning using RAG, Prompt engineering, and Cross-modal fusion

Miloud Mihoubi, Meriem Zerkouk, Belkacem Chikhaoui

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CL、cs.AI

Comments 13 pages, 8 figures, 1 Algorithms, 17th International Conference on Education and New Learning Technologies,: 30 June-2 July, 2025 Location: Palma, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06067 2025-07-09 eess.IV cs.AI cs.CV 81%

Enhancing Synthetic CT from CBCT via Multimodal Fusion and End-To-End Registration

Maximilian Tschuchnig, Lukas Lamminger, Philipp Steininger, Michael Gadermayr

机构 * Salzburg University of Applied Sciences(萨尔茨堡应用科学大学) MedPhoton GmbH(MedPhoton公司) University of Salzburg(萨尔茨堡大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at CAIP 2025. arXiv admin note: substantial text overlap with arXiv:2506.08716

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04397 2025-07-01 cs.CL cs.AI cs.LG 81%

Multimodal Medical Code Tokenizer

Xiaorui Su, Shvat Messica, Yepeng Huang, Ruth Johnson, Lukas Fesser, Shanghua Gao, Faryad Sahneh, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School, Boston, MA, USA(生物医学信息学系,哈佛医学院,波士顿,马萨诸塞州,美国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments ICML'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09062 2025-07-01 cs.CV cs.AI cs.RO 81%

Multimodal Object Detection using Depth and Image Data for Manufacturing Parts

Nazanin Mahjourian, Vinh Nguyen

机构 * Department of Mechanical Engineering - Engineering Mechanics, Michigan Technological University(机械工程系-工程力学系,密歇根技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05319 2025-06-26 cs.CV cs.AI 81%

Robust Multimodal Learning for Ophthalmic Disease Grading via Disentangled Representation

Xinkun Wang, Yifang Wang, Senwei Liang, Feilong Tang, Chengzhi Liu, Ming Hu, Chao Hu, Junjun He, Zongyuan Ge, Imran Razzak

机构 * MBZUAI, United Arab Emirates(MBZUAI,阿联酋) Monash University, Australia(墨尔本大学,澳大利亚) Liverpool University, United Kingdom(利物浦大学,英国) China Unicom (Shanghai) Industrial Internet Co., Ltd., China(中国联合(上海)工业互联网有限公司,中国) Shanghai AI Lab, China(上海人工智能实验室,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 10pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18204 2025-06-25 cs.CV cs.AI 81%

Multimodal Fusion SLAM with Fourier Attention

Youjie Zhou, Guofeng Mei, Yiming Wang, Yi Wan, Fabio Poiesi

机构 * School of Mechanical Engineering, Shandong University(机械工程学院,山东大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted in IEEE RAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18683 2025-06-24 cs.CV cs.AI 81%

SIM-Net: A Multimodal Fusion Network Using Inferred 3D Object Shape Point Clouds from RGB Images for 2D Classification

Youcef Sklab, Hanane Ariouat, Eric Chenin, Edi Prifti, Jean-Daniel Zucker

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 25 pages, 9 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14704 2025-06-18 cs.CV cs.MM 81%

Tile Classification Based Viewport Prediction with Multi-modal Fusion Transformer

Zhihao Zhang, Yiwei Chen, Weizhan Zhang, Caixia Yan, Qinghua Zheng, Qi Wang, Wangdu Chen

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.MM

Comments This paper is accepted by ACM-MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11465 2025-06-16 cs.LG cs.AI cs.CV 81%

RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer

Haotian Ni, Yake Wei, Hang Liu, Gong Chen, Chong Peng, Hao Lin, Di Hu

机构 * Gaoling School of Artificial Intelligence Renmin University of China(中国人民大学人工智能学院) Beihang University(北京航空航天大学) Xiamen University(厦门大学) Beijing Key Laboratory of Research on Large Models(北京市大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心) Tencent(腾讯)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07943 2025-06-12 cs.CV cs.AI 81%

Decoupling the Image Perception and Multimodal Reasoning for Reasoning Segmentation with Digital Twin Representations

Yizhen Li, Dell Zhang, Xuelong Li, Yiqing Shen

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments This work was submitted without the consent of all co-authors. We request withdrawal until all parties agree

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02080 2025-06-12 cs.CV cs.CL cs.LG 81%

EMMA: Efficient Visual Alignment in Multi-Modal LLMs

Sara Ghazanfari, Alexandre Araujo, Prashanth Krishnamurthy, Siddharth Garg, Farshad Khorrami

机构 * Department of Electronic and Computer Engineering, New York University(电子与计算机工程系,纽约大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11494 2025-06-10 cs.CL cs.CV 81%

Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More

Zichen Wen, Yifeng Gao, Shaobo Wang, Junyuan Zhang, Qintong Zhang, Weijia Li, Conghui He, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏