arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-10 至 2026-08-10 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 11 篇

2608.07279 2026-08-10 eess.SP 新提交 85%

Token Communication for Multimodal Large Language Model

多模态大语言模型的令牌通信

Jingkai Ying, Zhijin Qin, Yuan Shen, Khaled B. Letaief

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本文针对多模态大语言模型(MLLMs)的令牌传输问题,提出适配MLLMs的令牌通信框架,通过集成神经编解码器、两阶段语义对齐训练及自适应适配器,在相同传输数据量下实现更优任务性能。

Comments 13 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07193 2026-08-10 cs.LG cs.CV 新提交 84%

An AI4AI Framework for Visual Token Pruning

用于视觉令牌剪枝的AI4AI框架

Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07385 2026-08-10 cs.LG cs.AI eess.AS eess.SP stat.ML 新提交 84%

Omni-modal decomposition autoencoders learn full-stack wearable disentangled representations

全模态分解自编码器学习全栈可穿戴解耦表示

Ioannis Ziogas, Ensieh Khazaei, Bilal Taha, Aamna Al Shehhi, Ahsan H. Khandoker, Leontios J. Hadjileontiadis, Dimitrios Hatzinakos

机构 * Khalifa University(哈利法大学) University of Toronto(多伦多大学) MIT Media Lab(麻省理工学院媒体实验室) Aristotle University of Thessaloniki(亚里士多德大学)

专题命中 多模态训练与对齐 :omni-modal(title,abstract);multi-modal(abstract);分类 cs.AI、eess.AS

AI总结 该研究针对现有多模态可穿戴模型的不足,提出OmniDecVAEs框架,在30模态的HAR任务中,提升了识别准确率与数据合成质量,可用于边缘可穿戴与医疗领域。

Comments 15 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00310 2026-08-10 cs.LG cs.AI 版本更新 83%

CASA: Classification Augmented with Safety Attention for Robust Multimodal Alignment

通过条件解码实现鲁棒的多模态安全性

Anurag Kumar, Raghuveer Peri, Jon Burnsky, Alexandru Nelus, Rohit Paturi, Srikanth Vishnubhotla, Yanjun Qi

机构 * The Ohio State University(俄亥俄州立大学) AWS(亚马逊云服务)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出CASA方法,通过内部表示预测安全令牌以提升多模态大语言模型的安全性,实验显示其在多种基准上显著降低攻击成功率,同时保持良性输入的实用性。

Comments 9 pages + Appendix section

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19597 2026-08-10 cs.LG stat.ML 82%

The Geometric Mechanics of Contrastive Representation Learning: Alignment Potentials, Entropic Dispersion, and Cross-modal Divergence

对比表示学习的几何力学:对齐势、熵分散和跨模态散度

Yichao Cai, Zhen Zhang, Yuhang Liu, Javen Qinfeng Shi

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 本文通过测度论框架,在大批量极限下证明InfoNCE目标与确定性能量景观的等价性,揭示单模态与对称多模态之间的几何分岔,并指出跨模态散度项导致模态间隙。

Comments 54 Pages, ICML 2026 (Refined document aesthetics for clearer reading)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06948 2026-08-10 cs.AI 新提交 77%

LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents

多模态大模型模态迁移:自主地理信息系统智能体的先决条件

Ivan Majic, Zexian Huang, Franziska Hübl, Krzysztof Janowicz, Meilin Shi, Mina Karimi, Zilong Liu, Alexandra Fortacz-Lazan

机构 * Graz University of Technology(格拉茨工业大学) University of Vienna(维也纳大学) University of Liverpool(利物浦大学)

专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);multi-modal(abstract);分类 cs.AI

AI总结 本文针对自主GIS智能体的先决条件,提出LMM模态迁移任务,发现现有LMM在图像与文本模态间传递空间信息的能力不足,需加强多模态对齐以实现地理空间理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06411 2026-08-10 cs.AI cs.CV 新提交 73%

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

学习在多模态大语言模型(MLLMs)中预测中间层注意力以进行视觉token剪枝

Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对MLLMs视觉token剪枝的固定层非最优及计算成本高的问题,提出MAP方法,实现仅保留5.56%视觉token时维持97.5%性能,获3.09倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06122 2026-08-10 cs.LG cs.AI 版本更新 70%

Is Self-Pretraining really useful to improve diagnosis in medical Time Series?

自预训练(SPT)真的有助于改进医疗时间序列的诊断吗?

Omar Coser, Antonio Orvieto, Paolo Soda, Loredana Zollo

机构 * Università Campus Bio-Medico di Roma(罗马生物医学大学校园大学) Umeå University(于默奥大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(埃利斯研究所蒂宾根分所)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 该研究探究自预训练(SPT)对Transformer在医疗时间序列诊断任务的影响,发现SPT可提升分类准确率0-6个百分点,是无需修改架构的通用有效策略。

Comments 21 pages, 7 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07088 2026-08-10 cs.CV cs.AI 新提交 62%

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

RoRA:面向角色的区域分配,用于多模态大语言模型中的视觉令牌剪枝

Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对多模态大语言模型视觉令牌剪枝的高开销问题,提出无训练框架RoRA,通过角色导向的区域分配实现高效剪枝,在多个模型系列上优于基线,大幅降低推理时间且保留高准确率。

Comments 9 pages, 4 figures, 4 tables. Code is available at https://github.com/LukieLuu/RoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11240 2026-08-10 cs.CV 版本更新 57%

Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models

解耦相似性用于大视觉-语言模型中的任务感知token剪枝

Kexin Ma, Jing Xiao, Chaofeng Chen, Geyong Min, Guibo Zhu, Jinqiao Wang, Liang Liao

机构 * Wuhan University(武汉大学) University of Exeter(埃克塞特大学) Chinese Academy of Sciences(中国科学院) Xi'an University of Electronic Science and Technology(西安电子科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出DeSAP方法,通过解耦相似性实现精准任务感知token剪枝,提升大视觉-语言模型的效率与性能,实验表明在不同基准和架构上均优于现有方法。

Comments Accepted at ACM Multimedia 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07183 2026-08-10 cs.LG 新提交 50%

Conformal Fusion Under Missing Modalities

缺失模态下的共形融合

Alireza Moayedikia

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出MCCF架构,解决缺失模态下的多模态融合问题,该架构兼具模态缺失鲁棒性与校准不确定性,在多基准测试中表现出良好的覆盖率与精度性能。

详情

展开后加载摘要…

URL PDF HTML 收藏