arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6872 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6872 篇

2605.06073 2026-05-08 cs.LG 82%

PRISM: Iterative Cross-Modal Posterior Refinement for Dynamic Text-Attributed Graphs

PRISM:动态文本属性图的迭代跨模态后验细化

Trimble Chang, Yihang Liu, Mingjing Han, Han Zhang

机构 * College of Artificial Intelligence(人工智能学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 PRISM通过迭代跨模态后验细化方法,提升动态文本属性图的表示学习能力,有效捕捉节点语义与交互行为的动态依赖关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26181 2026-05-04 cs.LG 82%

SWAN: World-Aware Adaptive Multimodal Networks for Runtime Variations

SWAN:面向运行时变化的世界感知自适应多模态网络

Jason Wu, Shir-Kang Scott Jin, Yuyang Yuan, Maggie Wigness, Lance M. Kaplan, Hang Qiu, Mani Srivastava

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, Riverside(加州大学河滨分校) U.S. Army DEVCOM Army Research Laboratory(美国陆军 DEVCOM 军事研究实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 SWAN是一种新型多模态网络,通过动态资源分配和效率优化,在自动驾驶中实现复杂3D检测任务,减少49%的FLOPs并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06883 2026-04-28 cs.IR 82%

Structural and Disentangled Adaptation of Large Vision Language Models for Multimodal Recommendation

大型视觉语言模型的结构和解耦适应用于多模态推荐

Zhongtao Rao, Peilin Zhou, Dading Chong, Zhiwei Chen, Shoujin Wang, Nan Tang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出SDA框架,通过跨模态结构对齐和模态解耦适应,解决多模态推荐中表示不一致和梯度冲突问题,实验显示在三个Amazon数据集上提升了推荐性能。

Comments Accepted to SIGIR '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12424 2026-04-15 cs.CL cs.AI cs.CV 82%

Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation

解码中的扰动:通过动态文本扰动缓解多模态大语言模型的幻觉

Sihang Jia, Shuliang Liu, Songbo Yang, Yibo Yan, Xin Zou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Decoding by Perturbation方法,通过动态文本扰动缓解多模态大语言模型的幻觉问题,通过控制文本干预减少语言先验的影响,提升解码稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10404 2026-04-14 cs.ET cs.LG 82%

Sense Less, Infer More: Agentic Multimodal Transformers for Edge Medical Intelligence

感知更少,推断更多:面向边缘医疗智能的代理多模态变压器

Chengwei Zhou, Zhaoyan Jia, Haotian Yu, Xuming Chen, Brandon Lee, Christopher Pulliam, Steve Majerus, Massoud Pedram, Gourav Datta

机构 * Case Western Reserve University(凯斯西储大学) University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出AMI框架,通过代理多模态变压器在边缘设备上实现高效医疗监测,在减少传感器使用的同时提升诊断准确性。

Comments 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02771 2026-04-06 cs.CR 82%

ContractShield: Bridging Semantic-Structural Gaps via Hierarchical Cross-Modal Fusion for Multi-Label Vulnerability Detection in Obfuscated Smart Contracts

ContractShield:通过层次交叉模态融合弥合语义-结构差距以实现多标签漏洞检测

Minh-Dai Tran-Duong, Nguyen Hai Phong, Nguyen Chi Thanh, Doan Minh Trung, Tram Truong-Huu, Van-Hau Pham, Phan The Duy

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 ContractShield通过三级融合机制有效关联多互补特征,提升智能合约漏洞检测鲁棒性,实现89%的Hamming得分和五种主要漏洞类型的91%F1-score。

Comments 9 figures, 8 tables, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29211 2026-04-01 cs.AI cs.CL cs.CV 82%

Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems

玄武:将通用多模态模型演进为内容生态系统工业级基础模型

Zhiqian Zhang, Xu Zhao, Xiaoqing Xu, Guangdong Liang, Weijia Wang, Xiaolei Lv, Bo Li, Jun Gao

机构 * Computational Intelligence Dept, Hello Group Inc(Hello Group Inc. 计算智能部)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Xuanwu VL-2B,通过三阶段训练流程平衡业务专精与通用能力,实现7项多模态指标平均67.90分,7项业务审核任务召回率94.38%,在对抗性OCR场景中超越Gemini-2.5-Pro。

Comments 41 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27852 2026-03-31 quant-ph 82%

A Resource-Aligned Hybrid Quantum-Classical Framework for Multimodal Face Anti-Spoofing

一种资源对齐的混合量子-经典框架用于多模态面部防伪

Wanqi Sun, Jungang Xu, Chenghua Duan

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出一种混合MPS-VQC框架,通过结构化预量子压缩模块和量子分类器,有效处理多模态面部防伪问题,实现参数高效和资源优化。

Comments Under review at Quantum Information Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11331 2026-03-27 cs.IT math.IT 82%

AMBER: An Adaptive Multimodal Mask Transformer for Beam Prediction with Missing Modalities

AMBER: 一种自适应多模态掩码变换器用于缺失模态的波束预测

Chenyiming Wen, Binpu Shi, Min Li, Ming-Min Zhao, Min-Jian Zhao, Jiangzhou Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 AMBER通过自适应处理多模态数据中的缺失模态问题,提升波束预测的鲁棒性和准确性,实验表明其在真实世界数据集上优于现有多模态学习基线。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23004 2026-03-27 cs.LG 82%

QLIP: A Dynamic Quadtree Vision Prior Enhances MLLM Performance Without Retraining

QLIP:一种动态四叉树视觉先验增强MLLM性能无需重新训练

Kyle R. Chickering, Bangzheng Li, Muhao Chen

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract)

AI总结 QLIP通过动态四叉树视觉先验提升MLLM的粗粒度和细粒度视觉理解能力,无需重新训练,实验显示在LLaVA v1.5系列模型上提升视觉问答准确率,且在V-star基准测试中提升细节理解性能达13.6%。

Comments Accepted as ICLR 2026 poster. 22 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21612 2026-03-24 cs.LG 82%

Towards Multimodal Time Series Anomaly Detection with Semantic Alignment and Condensed Interaction

迈向多模态时间序列异常检测的语义对齐与压缩交互

Shiyan Hu, Jianxin Jin, Yang Shu, Peng Chen, Bin Yang, Chenjuan Guo

机构 * East China Normal University(华东师范大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出MindTS模型,通过语义对齐和压缩交互解决多模态时间序列异常检测中的关键问题,实验表明其性能优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12743 2026-03-16 cs.CV cs.AI cs.CL 82%

MoKus: Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization

MoKus: 利用跨模态知识迁移实现知识感知的概念定制

Chenyang Zhu, Hongxiang Li, Xiu Li, Long Chen

机构 * Tsinghua University(清华大学) HKUST(香港科技大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MoKus框架,通过跨模态知识迁移实现知识感知的概念定制,解决稀有token在预训练数据中缺失导致的性能不稳定问题,并引入KnowCusBench基准测试,验证了方法在概念定制任务中的优越性。

Comments Project Page: https://chenyangzhu1.github.io/MoKus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08459 2026-03-10 cs.LG 82%

Data-Driven Priors for Uncertainty-Aware Deterioration Risk Prediction with Multimodal Data

数据驱动先验用于多模态数据的不确定性感知退化风险预测

L. Julián Lechuga López, Tim G. J. Rudner, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) University of Toronto(多伦多大学) Tandon School of Engineering, New York University(纽约大学工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出MedCertAIn框架,通过数据驱动的先验方法提升多模态临床数据中风险预测的准确性和不确定性量化能力。

Comments 24 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07134 2026-03-10 cs.HC 82%

More Than 1v1: Human-AI Alignment in Early Developmental Communities with Multimodal LLMs

多于一对一:在早期发展社区中的人工智能对齐与多模态大语言模型

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract)

AI总结 本文探讨了在早期发展社区中,利用多模态大语言模型实现人机对齐的挑战,提出分层社区对齐框架,强调社区治理而非个体优化。

Comments Accepted at CHI 2026 BiAlign Workshop; OpenReview URL: https://openreview.net/forum?id=ikeH0hsBLN

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22695 2026-03-06 cs.DC 82%

Modality Inflation: Energy Characterization and Optimization Opportunities for MLLM Inference

模态膨胀:MLLM推理的能量特性与优化机会

Mona Moghadampanah, Adib Rezaei Shahmirzadi, Farhana Amin, Dimitrios S. Nikolopoulos

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract)

AI总结 本文研究了多模态大语言模型推理中的能量特性与优化机会,发现模态膨胀导致额外能耗,并提出阶段级DVFS优化方法以提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00720 2026-03-03 cs.LG 82%

MARS: Harmonizing Multimodal Convergence via Adaptive Rank Search

MARS: 通过自适应排名搜索实现多模态收敛的统一

Minkyoung Cho, Insu Jang, Shuowei Jin, Zesen Zhao, Adityan Jothi, Ethem F. Can, Min-Hung Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract)

AI总结 MARS通过自适应排名搜索优化多模态大语言模型微调,平衡训练动态并提升性能。

Comments 17 pages; Project Page: this https URL: https://minkyoungcho.github.io/mars/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13857 2026-02-17 cs.LG eess.SP 82%

sleep2vec: Unified Cross-Modal Alignment for Heterogeneous Nocturnal Biosignals

sleep2vec:用于异构夜间生物信号的统一跨模态对齐

Weixuan Yuan, Zengrui Jin, Yichen Wang, Donglin Xie, Ziyi Ye, Chao Zhang, Xuesong Chen

机构 * Five Seasons Medical(五 Seasons 医疗) Tsinghua University(清华大学) Beijing Key Laboratory for Sleep Breathing Disorder(北京睡眠呼吸障碍重点实验室) Peking University(北京大学) Fudan University(复旦大学) Technical University of Munich(慕尼黑技术大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 sleep2vec通过统一跨模态对齐和原理化缩放,实现了对异构夜间生物信号的高效、通用建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12618 2026-02-16 cs.CV cs.AI cs.CL 82%

Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models

通过注意力驱动的自我压缩进行视觉标记减少以提高高效多模态大语言模型的效率

Omer Faruk Deniz, Ruiyu Mao, Ruochen Li, Yapeng Tian, Latifur Khan

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 通过注意力驱动的自我压缩方法,有效减少多模态大语言模型中的视觉标记,提升计算效率并保持模型性能。

Comments 2025 IEEE International Conference on Big Data (BigData)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04755 2026-02-13 cs.CV cs.AI cs.MM 82%

Truth in the Few: High-Value Data Selection for Efficient Multi-Modal Reasoning

少量数据中的真实性:为高效多模态推理选择高价值数据

Shenshen Li, Xing Xu, Kaiyuan Deng, Lei Wang, Heng Tao Shen, Fumin Shen

机构 * University of Electronic Science and Technology of China(电子科技大学) School of Computer Science and Engineering(计算机科学与工程学院) Tongji University(同济大学) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本研究提出RAP方法,通过识别高价值认知样本和替换平凡实例,有效提升多模态推理效率,仅用9.3%训练数据即可实现性能超越。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02172 2026-02-12 cs.CV cs.AI cs.MM 82%

GaussianCross: Cross-modal Self-supervised 3D Representation Learning via Gaussian Splatting

GaussianCross: 通过高斯点撒技术实现跨模态自监督3D表示学习

Lei Yao, Yi Wang, Yi Zhang, Moyun Liu, Lap-Pui Chau

机构 * Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 GaussianCross通过高斯点撒技术实现跨模态自监督3D表示学习,提升3D点云的表示质量和泛化能力。

Comments 14 pages, 8 figures, accepted by MM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09445 2026-02-11 cs.IR 82%

Personalized Parameter-Efficient Fine-Tuning of Foundation Models for Multimodal Recommendation

面向多模态推荐的个性化参数高效微调

Sunwoo Kim, Hyunjin Hwang, Kijung Shin

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract)

AI总结 本文提出PerPEFT,一种面向多模态推荐的个性化参数高效微调策略,通过按兴趣分组并为每个组分配独立模块,提升推荐效果。

Comments To be published at The Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05646 2026-02-06 cs.LG 82%

Empowering Time Series Analysis with Large-Scale Multimodal Pretraining

通过大规模多模态预训练增强时间序列分析

Peng Chen, Siyuan Wang, Shiyan Hu, Xingjian Wu, Yang Shu, Zhongwen Rao, Meng Wang, Yijie Li, Bin Yang, Chenjuan Guo

机构 * East China Normal University, Shanghai, China(华东师范大学) HuaWei, ShenZhen, China(华为,深圳,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract)

AI总结 本文提出HORAI模型,通过多模态预训练提升时间序列分析的泛化能力,实现零样本预测和异常检测的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04920 2026-02-06 cs.LG cs.SD 82%

CyIN: Cyclic Informative Latent Space for Bridging Complete and Incomplete Multimodal Learning

CyIN:循环信息潜在空间用于连接完整与不完整多模态学习

Ronghao Lin, Qiaolin He, Sijie Mai, Ying Zeng, Aolin Xiong, Li Huang, Yap-Peng Tan, Haifeng Hu

机构 * School of Electronics and Information Technology, Sun Yat-Sen University(中山大学电子与信息学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) School of Computer Science, South China Normal University(华南师范大学计算机科学学院) Desay SV Automotive Co., Ltd(德赛股份有限公司) Pazhou Laboratory(琶洲实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 CyIN通过构建循环信息潜在空间,解决多模态学习中完整与不完整数据之间的性能差距,实现统一优化。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04231 2026-02-05 cs.RO 82%

GeoLanG: Geometry-Aware Language-Guided Grasping with Unified RGB-D Multimodal Learning

GeoLanG: 基于几何的语言引导抓取与统一RGB-D多模态学习

Rui Tang, Guankun Wang, Long Bai, Huxin Gao, Jiewen Lai, Chi Kit Ng, Jiazheng Wang, Fan Zhang, Hongliang Ren

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 GeoLanG通过统一RGB-D多模态学习,结合深度引导几何模块和自适应通道集成,实现鲁棒的语言引导抓取,提升复杂环境中的抓取精度和泛化能力。

Comments IEEE ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04016 2026-02-05 eess.SP cs.LG 82%

A Multi-Modal Foundational Model for Wireless Communication and Sensing

一种用于无线通信和传感的多模态基础模型

Vahid Yazdnian, Yasaman Ghasempour

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 本文提出了一种多模态基础模型,通过物理指导的自监督预训练策略,实现无线通信和传感任务的稳健泛化与高效适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21436 2026-02-05 cs.LG cs.AI cs.CL cs.CV 82%

From Consistency to Complementarity: Aligned and Disentangled Multi-modal Learning for Time Series Understanding and Reasoning

从一致性到互补性:面向时间序列理解和推理的对齐与解缠多模态学习

Hang Ni, Weijia Zhang, Fei Wang, Zezhi Shao, Hao Liu

机构 * The Hong Kong University of Science(香港科学与技术大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MADI通过细粒度对齐和解缠交互提升多模态时间序列理解和推理能力,实现更精确的数值-视觉模态整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00914 2026-02-03 cs.CL cs.AI cs.CY cs.SD eess.AS 82%

A Baseline Multimodal Approach to Emotion Recognition in Conversations

一种用于对话中情感识别的基线多模态方法

Víctor Yeste, Rodrigo Rivas-Arévalo

机构 * School of Science, Engineering and Design, Universidad Europea de Valencia(科学、工程与设计学院,欧洲大学 Valencia)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出了一种基于Transformer文本分类器和自监督语音模型的多模态基线方法,用于对话中情感识别,并通过实验展示了多模态融合的优势。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15388 2026-02-03 cs.CV cs.AI cs.CL 82%

LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models

LLaVA-PruMerge: 适应性令牌减少用于高效的大多模态模型

Yuzhang Shang, Mu Cai, Bingxin Xu, Yong Jae Lee, Yan Yan

机构 * UCF(佛罗里达大学) UW-Madison(威斯康星大学麦迪逊分校) USC(南加州大学) UIC(伊利诺伊大学香槟分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 LLaVA-PruMerge通过自适应视觉令牌减少策略,显著降低视觉令牌数量而不影响性能,适用于高效的大多模态模型。

Comments Accepted to ICCV 2025. First Version is released in 2024/03

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22498 2026-02-02 cs.IR 82%

FITMM: Adaptive Frequency-Aware Multimodal Recommendation via Information-Theoretic Representation Learning

FITMM: 一种基于信息论的多模态推荐方法

Wei Yang, Rui Zhong, Yiqun Chen, Shixuan Li, Heng Ping, Chi Lu, Peng Jiang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 FITMM通过频域信息论框架提升多模态推荐效果,采用频谱分解与信息瓶颈目标实现频带分离与融合,有效减少冗余并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17809 2026-01-27 cs.IT math.IT 82%

A Multi-Modal Fusion Platform for Joint Environment Sensing and Channel Sounding in Highly Dynamic Scenarios

一种多模态融合平台,用于高动态场景中的联合环境感知与信道探测

Xuejian Zhang, Ruisi He, Mi Yang, Zhengyu Zhang, Ziyi Qi

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract)

AI总结 本文提出一种多模态融合平台,用于高动态场景中联合环境感知与信道探测,支持多频段多天线测量和高精度环境感知。

详情

展开后加载摘要…

URL PDF HTML 收藏