arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6897 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6897 篇

2512.14712 2025-12-18 cs.LG cs.AI cs.CL cs.CV cs.CY 67%

SepsisSuite: Beyond Risk Stratification -- A Comparative Analysis of Deep Fusion vs. Expert Stacking for Prescriptive Sepsis AI

SepsisSuite: 超越风险分层 -- 深度融合与专家堆叠的比较分析用于处方性脓毒症AI

Ryan Cartularo

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 SepsisSuite通过深度融合与专家堆叠对比,提出SepsisLateFusion架构,实现预测临床发作前4小时的AUC 0.915,并提升抗生素选择性能。

Comments 7 Pages, 4 Tables, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06726 2025-12-09 cs.CV cs.AI cs.CL 67%

The Role of Entropy in Visual Grounding: Analysis and Optimization

熵在视觉定位中的作用:分析与优化

Shuo Li, Jiajun Sun, Zhihao Zhang, Xiaoran Fan, Senjie Jin, Hui Li, Yuming Yang, Junjie Ye, Lixing Shen, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Hikvision Research Institute(海康威视研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出ECVGPO算法,通过熵控制优化视觉定位任务,提升探索与利用的平衡,实现多基准的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00042 2025-12-02 cs.CV cs.AI cs.CL cs.CY 67%

Closing the Gap: Data-Centric Fine-Tuning of Vision Language Models for the Standardized Exam Questions

弥合差距:面向标准化考试题目的视觉语言模型数据驱动微调

Egemen Sert, Şeyda Ertekin

机构 * organization= Department of Computer Engineering, Middle East Technical University (METU) , city= Ankara , country= Türkiye organization= METU-DTX Digital Transformation \& Innovation Centre, METU , city= Ankara , country= Türkiye

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本研究通过高质量数据和优化语法提升视觉语言模型在标准化考试题目的多模态推理性能,达到接近SOTA的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19384 2025-10-23 cs.LG 67%

Learning Noise-Resilient and Transferable Graph-Text Alignment via Dynamic Quality Assessment

Yuhang Liu, Minglai Shao, Zengyi Wo, Yunlong Chu, Bing Hao, Shengzhong Liu, Ruijie Wang, Jianxin Li

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) Baidu(百度) Shanghai Jiao Tong University(上海交通大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19147 2025-10-14 cs.CL cs.AI cs.CV 67%

Shifting AI Efficiency From Model-Centric to Data-Centric Compression

Xuyang Liu, Zichen Wen, Shaobo Wang, Junjie Chen, Zhishan Tao, Yubo Wang, Tailai Chen, Xiangqi Jin, Chang Zou, Yiyu Wang, Chenfei Liao, Xu Zheng, Honggang Chen, Weijia Li, Xuming Hu, Conghui He, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Sichuan University(四川大学) University of Electronic Science & Technology of China(电子科技大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Project: \url{https://github.com/xuyang-liu16/Awesome-Token-level-Model-Compression}

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23590 2025-10-14 cs.CV cs.AI cs.CL 67%

Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles

Zifu Wang, Junyi Zhu, Bo Tang, Zhiyu Li, Feiyu Xiong, Jiaqian Yu, Matthew B. Blaschko

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08802 2025-10-13 cs.LG 67%

Edu-EmotionNet: Cross-Modality Attention Alignment with Temporal Feedback Loops

S M Rafiuddin

机构 * Department of Computer Science Oklahoma State University Stillwater, Oklahoma, USA(计算机科学系 奥克拉荷马州立大学 斯蒂尔沃特 奥克拉荷马州 美国)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

Comments 6 Pages, 6 Figures, 3 Tables, Accepted as a Regular Research paper at ICMLA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04417 2025-10-07 cs.LG cs.AI cs.CL cs.CV cs.IT math.IT 67%

Partial Information Decomposition via Normalizing Flows in Latent Gaussian Distributions

Wenyuan Zhao, Adithya Balachandran, Chao Tian, Paul Pu Liang

机构 * Texas A&M University(德克萨斯大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25712 2025-10-01 cs.LG 67%

Expert Merging: Model Merging with Unsupervised Expert Alignment and Importance-Guided Layer Chunking

Dengming Zhang, Xiaowen Ma, Zhenliang Ni, Zhenkai Wu, Han Shu, Xin Jiang, Xinghao Chen

机构 * Zhejiang University(浙江大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11425 2025-09-30 cs.SD cs.AI cs.CL eess.AS 67%

FuseCodec: Semantic-Contextual Fusion and Supervision for Neural Codecs

Md Mubtasim Ahasan, Rafat Hasan Khan, Tasnim Mohiuddin, Aman Chadha, Tariq Iqbal, M Ashraful Amin, Amin Ahsan Ali, Md Mofijul Islam, A K M Mahbubur Rahman

机构 * Center for Computational & Data Sciences, Independent University, Bangladesh(计算与数据科学中心,独立大学,孟加拉国) Amazon GenAI(亚马逊生成人工智能) Qatar Computing Research Institute(卡塔尔计算研究所) University of Virginia(弗吉尼亚大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22913 2025-09-30 cs.LG stat.ML 67%

Guided Manifold Alignment with Geometry-Regularized Twin Autoencoders

Jake S. Rhodes, Adam G. Rustad, Marshall S. Nielsen, Morgan Chase McClellan, Dallan Gardner, Dawson Hedges

机构 * Department of Statistics(统计学系) Department of Computer Science(计算机科学系) Neuroscience Center(神经科学中心) Neuroscience Center and Department of Psychology(神经科学中心和心理学系) Department of Psychology(心理学系)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract)

Comments 10 pages, 4 figures, 7 tables. Accepted at the MMAI workshop at ICDM, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20751 2025-09-26 cs.CV cs.AI cs.CL 67%

Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models

Zoe Wanying He, Sean Trott, Meenakshi Khosla

机构 * Department of Cognitive Science University of California, San Diego(认知科学系,加州大学圣地亚哥分校)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted at EMNLP 2025 (camera-ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19047 2025-09-24 cs.RO 67%

ManipForce: Force-Guided Policy Learning with Frequency-Aware Representation for Contact-Rich Manipulation

Geonhyup Lee, Yeongjin Lee, Kangmin Kim, Seongju Lee, Sangjun Noh, Seunghyeok Back, Kyoobin Lee

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology (GIST)(人工智能融合系,全州科学技术院) Department of AI Machinery, Korea Institute of Machinery & Materials (KIMM)(人工智能机械系,韩国机械材料研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06465 2025-09-12 cs.LG cs.CE q-bio.BM 67%

CAME-AB: Cross-Modality Attention with Mixture-of-Experts for Antibody Binding Site Prediction

Hongzong Li, Jiahao Ma, Zhanpeng Shi, Rui Xiao, Fanming Jin, Ye-Fan Hu, Hangjun Che, Jian-Dong Huang

机构 * Generative AI Research and Development Center The Hong Kong University of Science and Technology(生成式人工智能研究与发展中心 香港科学大学) MILES The University of Hong Kong(MILES 香港大学) College of Veterinary Medicine Jilin University(吉林大学兽医学院) School of Chemistry and Chemical Engineering South China University of Technology(华南理工大学化学与化工学院) School of Biomedical Sciences The University of Hong Kong(香港大学生物医学科学学院) Computational Immunology Centre BayVax Biotech Limited(计算免疫学中心 BayVax 生物技术有限公司) College of Electronic and Information Engineering Southwest University(西南大学电子与信息工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18297 2025-08-27 cs.CV cs.AI cs.CL 67%

Can VLMs Recall Factual Associations From Visual References?

Dhananjay Ashok, Ashutosh Chaubey, Hirona J. Arai, Jonathan May, Jesse Thomason

机构 * University of Southern California(南加州大学) Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments To appear at EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11737 2025-08-19 cs.CV cs.AI cs.CL cs.LG 67%

Ovis2.5 Technical Report

Shiyin Lu, Yang Li, Yu Xia, Yuwei Hu, Shanshan Zhao, Yanqing Ma, Zhichao Wei, Yinglun Li, Lunhao Duan, Jianshan Zhao, Yuxuan Han, Haijun Li, Wanying Chen, Junke Tang, Chengkun Hou, Zhixing Du, Tianli Zhou, Wenjie Zhang, Huping Ding, Jiahe Li, Wen Li, Gui Hu, Yiliang Gu, Siran Yang, Jiamang Wang, Hailong Sun, Yibo Wang, Hui Sun, Jinlong Huang, Yuping He, Shengze Shi, Weihong Zhang, Guodong Zheng, Junpeng Jiang, Sensen Gao, Yi-Feng Wu, Sijia Chen, Yuhui Chen, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10116 2025-08-15 cs.IR 67%

Bridging Modality Gaps in e-Commerce Products via Vision-Language Alignment

Yipeng Zhang, Hongju Yu, Aritra Mandal, Canran Xu, Qunzhi Zhou, Zhe Wu

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08602 2025-08-13 eess.SP 67%

Biomedical Signal Processing: EEG and ECG Classification with Discrete Wavelet Transforms, Energy Distribution, and Convolutional Neural Networks

Justin London

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06826 2025-08-12 cs.HC 67%

AdjustAR: AI-Driven In-Situ Adjustment of Site-Specific Augmented Reality Content

Nels Numan, Jessica Van Brummelen, Ziwen Lu, Anthony Steed

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract)

Comments 4 pages, 1 figure, ACM UIST 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18576 2025-08-08 cs.AI cs.CL cs.CV 67%

SafeWork-R1: Coevolving Safety and Intelligence under the AI-45$^{\circ}$ Law

Shanghai AI Lab, :, Yicheng Bao, Guanxu Chen, Mingkang Chen, Yunhao Chen, Chiyu Chen, Lingjie Chen, Sirui Chen, Xinquan Chen, Jie Cheng, Yu Cheng, Dengke Deng, Yizhuo Ding, Dan Ding, Xiaoshan Ding, Yi Ding, Zhichen Dong, Lingxiao Du, Yuyu Fan, Xinshun Feng, Yanwei Fu, Yuxuan Gao, Ruijun Ge, Tianle Gu, Lujun Gui, Jiaxuan Guo, Qianxi He, Yuenan Hou, Xuhao Hu, Hong Huang, Kaichen Huang, Shiyang Huang, Yuxian Jiang, Shanzhe Lei, Jie Li, Lijun Li, Hao Li, Juncheng Li, Xiangtian Li, Yafu Li, Lingyu Li, Xueyan Li, Haotian Liang, Dongrui Liu, Qihua Liu, Zhixuan Liu, Bangwei Liu, Huacan Liu, Yuexiao Liu, Zongkai Liu, Chaochao Lu, Yudong Lu, Xiaoya Lu, Zhenghao Lu, Qitan Lv, Caoyuan Ma, Jiachen Ma, Xiaoya Ma, Zhongtian Ma, Lingyu Meng, Ziqi Miao, Yazhe Niu, Yuezhang Peng, Yuan Pu, Han Qi, Chen Qian, Xingge Qiao, Jingjing Qu, Jiashu Qu, Wanying Qu, Wenwen Qu, Xiaoye Qu, Qihan Ren, Qingnan Ren, Qingyu Ren, Jing Shao, Wenqi Shao, Shuai Shao, Dongxing Shi, Xin Song, Xinhao Song, Yan Teng, Xuan Tong, Yingchun Wang, Xuhong Wang, Shujie Wang, Xin Wang, Yige Wang, Yixu Wang, Yuanfu Wang, Futing Wang, Ruofan Wang, Wenjie Wang, Yajie Wang, Muhao Wei, Xiaoyu Wen, Fenghua Weng, Yuqi Wu, Yingtong Xiong, Xingcheng Xu, Chao Yang, Yue Yang, Yang Yao, Yulei Ye, Zhenyun Yin, Yi Yu, Bo Zhang, Qiaosheng Zhang, Jinxuan Zhang, Yexin Zhang, Yinqiang Zheng, Hefeng Zhou, Zhanhui Zhou, Pengyu Zhu, Qingzi Zhu, Yubo Zhu, Bowen Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 47 pages, 18 figures, authors are listed in alphabetical order by their last names; v3 modifies minor issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01211 2025-08-05 cs.LG 67%

Multi-Operator Few-Shot Learning for Generalization Across PDE Families

Yile Li, Shandian Zhe

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07568 2025-07-11 stat.ME eess.IV 67%

Learnable Retrieval Enhanced Visual-Text Alignment and Fusion for Radiology Report Generation

Qin Zhou, Guoyan Liang, Xindi Li, Jingyuan Chen, Wang Zhe, Chang Yao, Sai Wu

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

Comments 10 pages,3 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00854 2025-07-09 cs.CL cs.AI cs.LG cs.MM q-bio.NC 67%

EEG2TEXT-CN: An Exploratory Study of Open-Vocabulary Chinese Text-EEG Alignment via Large Language Model and Contrastive Learning on ChineseEEG

Jacky Tai-Yu Lu, Jung Chiang, Chi-Sheng Chen, Anna Nai-Yun Tung, Hsiang Wei Hu, Yuan Chiao Cheng

机构 * Department of Artificial Intelligence in Healthcare, International Academia of Biomedical Innovation Technology(人工智能医疗系,国际生物医学创新技术学院) National Taiwan University(台湾大学) Neuro Industry Research, Neuro Industry, Inc.(神经产业研究,神经产业公司) Department of Biomedical Engineering, University of Southern California(生物医学工程系,南加州大学) Taiwan Artificial Intelligence Association(台湾人工智能协会)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01728 2025-07-03 eess.SP cs.LG 67%

Token Communication in the Era of Large Models: An Information Bottleneck-Based Approach

Hao Wei, Wanli Ni, Wen Wang, Wenjun Xu, Dusit Niyato, Ping Zhang

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) Department of Mathematics and Theories, Peng Cheng Laboratory(数学与理论部,鹏城实验室) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学) Pervasive Communications Center, Purple Mountain Laboratories(感知计算中心,紫金山实验室) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15895 2025-06-24 cs.LG cs.AI cs.CL cs.CV 67%

Directional Gradient Projection for Robust Fine-Tuning of Foundation Models

Chengyue Huang, Junjiao Tian, Brisa Maneechotesuwan, Shivang Chopra, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06479 2025-06-13 cs.CL cs.AI cs.CV 67%

Visually Descriptive Language Model for Vector Graphics Reasoning

Zhenhailong Wang, Joy Hsu, Xingyao Wang, Kuan-Hao Huang, Manling Li, Jiajun Wu, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Texas A&M University(德克萨斯A&M大学) Northwestern University(西北大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Project page: https://mikewangwzhl.github.io/VDLM/

Journal ref TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11492 2025-05-27 cs.AI cs.CL cs.CV 67%

Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding

Kung-Hsiang Huang, Can Qin, Haoyi Qiu, Philippe Laban, Shafiq Joty, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院) UCLA(加州大学洛杉矶分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Code and data are available at https://github.com/SalesforceAIResearch/CogAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02539 2025-05-27 cs.CV cs.AI cs.CL cs.LG 67%

Parrot: Multilingual Visual Instruction Tuning

Hai-Long Sun, Da-Wei Zhou, Yang Li, Shiyin Lu, Chao Yi, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, De-Chuan Zhan, Han-Jia Ye

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to ICML 2025. Code and dataset are available at: https://github.com/AIDC-AI/Parrot

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13973 2025-05-21 cs.CL cs.AI cs.CV 67%

Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models

Wenhui Zhu, Xuanzhao Dong, Xin Li, Peijie Qiu, Xiwen Chen, Abolfazl Razi, Aris Sotiras, Yi Su, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Washington University in St.Louis(华盛顿大学圣路易斯分校) Banner Alzheimer’s Institute(Banner阿尔茨海默病研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00738 2025-05-05 eess.IV cs.LG 67%

XeMap: Contextual Referring in Large-Scale Remote Sensing Environments

Yuxi Li, Lu Si, Yujie Hou, Chengaung Liu, Bin Li, Hongjian Fang, Jun Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏