arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-12 至 2026-05-12 共收录 203 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 32 篇

2605.08288 2026-05-12 cs.LG cs.AI cs.CR cs.DC 74%

UMEDA: Unified Multi-modal Efficient Data Fusion for Privacy-Preserving Graph Federated Learning via Spectral-Gated Attention and Diffusion-Based Operator Alignment

UMEDA:统一多模态高效数据融合用于隐私保护图联邦学习的谱门控注意力与扩散算子对齐

Shih-Yu Lai, Hirozumi Yamaguchi, Shang-Tse Chen, Yu-Lun Liu, Bing-Yu Chen

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,Location,Country) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,Location,Country)

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.AI

AI总结 UMEDA通过谱门控注意力和扩散算子对齐,实现多模态数据在隐私保护下的高效联邦学习,提升准确性和通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10676 2026-05-12 cs.CV cs.LG 70%

Not Blind but Silenced: Rebalancing Vision and Language via Adversarial Counter-Commonsense Equilibrium

非盲目而是被沉默:通过对抗性反常识平衡视觉与语言

Qingxin Xiao, Peilin Zhao, Yangyang Zhao, Lingwei Dang, Qingyao Wu

机构 * South China University of Technology(华南理工大学) Institute for Super Robotics (Huangpu)(机器人研究所(黄埔)) Shanghai Jiao Tong University(上海交通大学) Changsha University of Science and Technology(长沙理工大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出ACE框架,通过对抗性反常识补丁扰动视觉上下文,动态平衡语言先验与视觉信息,提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04142 2026-05-12 cs.CV cs.AI cs.LG 62%

Turning Drift into Constraint: Robust Reasoning Alignment in Non-Stationary Multi-Stream Environments

将漂移转化为约束:非稳态多流环境中的鲁棒推理对齐

Xiaoyu Yang, En Yu, Wei Duan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所) Faulty of Engineering and Information Technology(工程与信息技术学院) University of Technology Sydney(悉尼技术大学) Australia(澳大利亚)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出APO框架,通过约束满足问题解决多源推理对齐问题,实验表明其在胸片解读中鲁棒性优于现有模型,并发布CXR-MAX基准测试集。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05066 2026-05-12 cs.LG cs.AI cs.CL 62%

Capacity-Aware Inference: Mitigating the Straggler Effect in Mixture of Experts

容量感知推理:减轻混合专家中的滞后效应

Shwai He, Weilin Cai, Jiayi Huang, Ang Li

机构 * University of Maryland, College Park(马里兰大学学院公园分校) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出容量感知令牌丢弃和扩展丢弃方法,通过减少专家负载不平衡提升混合专家模型的推理效率和性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08902 2026-05-12 cs.CV cs.AI 62%

DAPE: Dynamic Non-uniform Alignment and Progressive Detail Enhancement Techniques for Improving the Performance of Efficient Visual Language Models

DAPE:动态非均匀对齐与渐进细节增强技术以提升高效视觉语言模型的性能

Mengyuan Tian, Qiyan Zhao, Yanan Wang, Da-Han Wang

机构 * The Wang Yanan Institute for Studies in Economics, Xiamen University, Xiamen 361005, China(厦门大学王文安经济研究所) Fujian Key Laboratory of Pattern Recognition and Image Understanding, School of Computer and Information Engineering, Xiamen University of Technology, Xiamen 361024, China(福建pattern识别与图像理解重点实验室,厦门理工大学计算机与信息工程学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DAPE框架,通过动态跨模态对齐和连续细节引入技术,提升高效视觉语言模型的性能,减少计算开销并提升下游任务准确性。

Comments Accepted in ICIC 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08181 2026-05-12 cs.CV cs.AI cs.LG 62%

Text-Guided Multi-Scale Frequency Representation Adaptation

基于文本的多尺度频率表示适应

Weicai Yan, Xinhua Ma, Wang Lin, Tao Jin

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FreqAdapter,通过在频域进行多尺度信号微调,结合文本信息减少信息冗余,提升多模态模型的性能与效率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10470 2026-05-12 cs.CV 57%

Adaptive Context Matters: Towards Provable Multi-Modality Guidance for Super-Resolution

适应性上下文至关重要:迈向可证明的多模态引导超分辨率

Jinyi Luo, Minghao Liu, Yifan Li, Zejia Fan, Jiaying Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出M$^3$ESR框架,通过动态模态融合提升超分辨率的泛化和语义一致性,理论分析揭示了多模态SR的优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09982 2026-05-12 cs.CV 57%

ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning

ERASE: 通过自适应两阶段令牌剪枝消除冗余视觉令牌

Yuna Lee, Kyoungho Min, Yulhwa Kim

机构 * Department of Electrical and Computer Engineering, Sungkyunkwan University, Republic of Korea(电气与计算机工程系,成均馆大学,大韩民国) Department of Semiconductor Systems Engineering, Sungkyunkwan University, Republic of Korea(半导体系统工程系,成均馆大学,大韩民国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ERASE框架,通过自适应两阶段令牌剪枝方法减少冗余视觉令牌,实验证明在85%的令牌剪枝率下,模型准确率保持在89.46%。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09243 2026-05-12 cs.AI q-bio.NC 57%

How Much is Brain Data Worth for Machine Learning?

脑数据对机器学习有多大价值?

Lane Lewis, Zhixin Wang, David Schwab, Xaq Pitkow

机构 * Neuroscience Institute, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学神经科学研究所) Department of Machine Learning, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器学习系) NSF AI Institute for Artificial and Natural Intelligence (ARNI)(国家科学基金会人工智能与自然智能研究所) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学) CUNY Graduate Center, New York, NY, USA(纽约市立大学研究生中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文通过数学建模探讨脑数据与任务数据在机器学习中的价值与交换率,分析不同条件下脑数据对模型性能的提升作用。

Comments 9 pages main text, 5 figures, 34 pages of appendix with detailed proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09173 2026-05-12 cs.LG cs.AI 57%

WavesFM: Hierarchical Representation Learning for Longitudinal Wearable Sensor Waveforms

WavesFM:纵向可穿戴传感器波形的分层表示学习

Peng Cao, Zhijian Yang, Tennison Liu, Jonathan Wang, Jiang Wu, Magdalena Proszewska, Arvind Pillai, Mingwu Gao, Amir Farjadian, Lawrence Cai, Emily Blanchard, Daniel McDuff, Pramod Rudrapatna, Matthew Thompson, Anupam Pathak, Mark Malhotra, Shwetak Patel, Dina Katabi, Paolo Di Achille, Ming-Zher Poh

机构 * Google Research(谷歌研究) MIT(麻省理工学院) University of Washington(华盛顿大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 WavesFM通过分层自监督学习框架,解决长序列生理数据处理中的高采样频率、多模态依赖和长序列长度问题,实现对局部信号语义和复杂昼夜及跨日变化的建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08985 2026-05-12 cs.CV 57%

LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?

LLaVA-UHD v4: 什么使多模态大语言模型中的高效视觉编码成为可能?

Kechen Fang, Yihua Qin, Chongyi Wang, Wenshuo Ma, Tianyu Yu, Yuan Yao

机构 * Tsinghua University(清华大学) ModelBest

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文通过 slice-based 编码和 intra-ViT 早期压缩,提升了多模态大语言模型在高分辨率图像输入中的视觉编码效率,减少 55.8% 的 FLOPs 而不牺牲下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08814 2026-05-12 cs.CV 57%

Zero-Shot Chinese Character Recognition via Global-Local Dual-Branch Alignment and Hierarchical Inference

通过全局-局部双分支对齐和分层推理实现零样本中文字符识别

Wei Cao, Hao Xu, Xiaolei Diao

机构 * Jilin University, China(吉林大学,中国) University College London, UK(伦敦大学学院,英国)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出GL-HPN网络,通过统一的跨模态对齐框架学习字符图像和意象描述序列的全局和局部表示,解决零样本中文字符识别中的局部差异建模和大规模检索成本问题。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08815 2026-05-12 cs.LG q-bio.BM q-bio.GN q-bio.QM 50%

MicroFuse: Protein-to-Genome Expert Fusion for Microbial Operon Reasoning

MicroFuse:用于微生物启动子推理的蛋白质到基因组专家融合

Seungik Cho

机构 * Department of Physics and Astronomy, Rice University, Texas, USA(物理与天文学系,里士满大学,德克萨斯州,美国)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出MicroFuse框架,通过融合蛋白质结构表示和基因组上下文表示,提升微生物启动子预测的准确性。在OG-Operon100K数据集上,MicroFuse在多个评估指标上表现最优,尤其在生物上模糊的情况中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 10 篇

2605.08962 2026-05-12 cs.DC 85%

MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production

MegaScale-Omni: 一种面向多模态大语言模型生产训练的超大规模、工作负载容错系统

Chunyu Xue, Yangrui Chen, Jianyu Jiang, Ningxin Zheng, Junda Feng, Jingji Chen, Shixiong Zhao, Shen Yan, Yi Lin, Lei Shi, Zanbo Wang, Lishu Luo, Faming Wu, Haibin Lin, Xin Liu, Yanghua Peng, Quan Chen

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本文提出MegaScale-Omni系统,通过解耦并行策略、统一表示和负载平衡技术,提升多模态大语言模型在动态工作负载下的训练效率,实现1.27倍至7.57倍的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04415 2026-05-12 cs.CL cs.CV 81%

Dual Tuning for Reasoning Efficacy-Driven Data Curation in Multimodal LLM Training

双调优:面向多模态大语言模型训练的推理效能驱动的数据筛选

Ruobing Zheng, Tianqi Li, Jianing Li, Qingpei Guo, Yi Yuan, Jingdong Chen

机构 * Ant Group(蚂蚁集团)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出双调优框架,通过评估训练数据对推理训练的收益及推理训练的效能,指导多模态大语言模型的数据筛选与训练策略匹配。

Comments Project Page: https://digital-avatar.github.io/ai/ThinkingBoundary/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19503 2026-05-12 cs.DC 78%

ReaLB: Real-Time Load Balancing for Multimodal MoE Inference

ReaLB:多模态MoE推理的实时负载均衡

Yingping Wang, Yi Wu, Xiangyu Wu, Junwei Cui, Weilin Cai, Zhijiang Guo, Jiayi Huang

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 ReaLB通过实时调整MoE专家计算精度,提升多模态模型推理效率,减少负载不平衡,实现1.10-1.32倍的端到端加速,同时保持1%以内的精度损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10501 2026-05-12 cs.DC 67%

Accelerating Compound LLM Training Workloads with Maestro

通过Maestro加速复合大语言模型训练工作负载

Xiulong Yuan, Hongqing Chen, Jiaxuan Peng, Fan Zhou, Zhixiang Ruan, Zekun Wang, Bo Zheng, Rui Men, Haiquan Wang, Zhipeng Zhang, Langshi Chen, Man Yuan, Jiaqi Gao, Zhengping Qian, Junyang Lin, Yong Li, Wei Lin, Junhua Wang, Jingren Zhou

专题命中 其他多模态 :multimodal(abstract);MLLM(abstract)

AI总结 本文提出Maestro框架,针对复合LLM训练中的静态异构性和动态不规则性,通过分段图重构和波前调度算法提升硬件利用率,减少40%的GPU消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09112 2026-05-12 cs.LG cs.AI 57%

Contextual Plackett-Luce: An Efficient Neural Model for Probabilistic Sequence Selection under Ambiguity

基于上下文的Plackett-Luce模型:一种高效的神经模型,用于在模糊性下进行概率序列选择

Noam Mizrachi, Nadav Har-Tuv, Shai Shalev-Shwartz

机构 * Mobileye

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出Contextual Plackett-Luce模型,结合全并行评分与轻量级自回归选择过程,提升在模糊监督下的序列选择效率与鲁棒性。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03677 2026-05-12 cs.CL 57%

Instruction Anchor: Dissecting the Mechanistic Dynamics of Modality Arbitration

指令锚点:解构模态仲裁的机理动态

Yu Zhang, Mufan Xu, Xuefeng Bai, Kehai Chen, Pengfei Zhang, Yang Xiang, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文通过信息流视角研究模态跟随机制,揭示指令令牌作为模态仲裁的结构锚点,浅层注意力层负责多模态信息聚合,深层注意力层则根据指令意图选择性强化子空间,实验验证了注意力头的特定功能。

Comments Modality Following

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22873 2026-05-12 econ.GN q-fin.EC stat.ML 50%

Forecasting Residential Heating and Electricity Demand with Scalable, High-Resolution, Open-Source Models

利用可扩展、高分辨率、开源模型进行住宅供暖和电力需求预测

Stephen J. Lee, Cailinn Drouin

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出基于概率深度学习模型的高分辨率住宅供暖和非供暖电力需求预测框架,通过多模态建筑数据提升预测精度,相比ResStock模型在RMSE和WIS指标上均有显著提升。

Comments 11 pages, 4 figures, 2 tables. Published version (Energy and AI 24 (2026) 100726). Supplementary material available at the publisher: https://doi.org/10.1016/j.egyai.2026.100726

Journal ref Energy and AI 24 (2026) 100726

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09198 2026-05-12 cs.HC 50%

Rushed by Discomfort, Trapped by Immersion: Users' Experiences and Responses to Privacy Deceptive Design in Commercial VR Applications

因不适而仓促,被沉浸所困:用户在商业VR应用中对隐私欺骗设计的体验与反应

Hilda Hadan, Michaela Valiquette, Lennart E. Nacke, Leah Zhang-Kennedy

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究探讨了商业VR应用中隐私欺骗设计对用户的影响,发现VR设计通过认知漏洞和身体疲劳引发用户接受侵入性数据披露,强调了体感因素在隐私保护VR设计中的重要性。

Comments 40 pages (including supplementary materials), 12 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21456 2026-05-12 cs.LG cs.RO 50%

Tempered Sequential Monte Carlo for Trajectory and Policy Optimization with Differentiable Dynamics

温控序贯蒙特卡洛用于具有可微动力学的轨迹和策略优化

Heng Yang

机构 * Harvard University(哈佛大学)

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出温控序贯蒙特卡洛方法,用于在可微动力学下进行有限时间跨度的轨迹和策略优化,通过将控制器设计转化为推断问题,结合退火方案和哈密顿蒙特卡洛方法,提升采样效率和优化性能。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.00207 2026-05-12 stat.AP stat.ME 50%

Mixed-Response State-Space Model for Analyzing Multi-Dimensional Digital Phenotypes

混合响应状态空间模型用于分析多维数字表型

Tianchen Xu, Yuan Chen, Donglin Zeng, Yuanjia Wang

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出混合响应状态空间模型,用于联合捕捉多维、多模态数字表型及其测量过程,通过有限的潜在状态时间序列,以应对多维数字表型数据中的混杂因素和变异。

Comments 59 pages, 14 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏