arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-26 至 2026-05-26 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 9 篇

2503.11367 2026-05-26 cs.DC 85%

Efficient Distributed MLLM Training with Cornstarch

使用Cornstarch高效分布式多模态大语言模型训练

Insu Jang, Runyu Lu, Nikhil Bansal, Ang Chen, Mosharaf Chowdhury

专题命中 音频语音多模态 :MLLM(title,abstract);multimodal(abstract)

AI总结 提出Cornstarch框架,通过冻结感知流水线并行和令牌工作负载平衡的上下文并行,解决多模态大语言模型训练中的异构性问题,平均吞吐量提升2.26倍。

Comments ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25534 2026-05-26 cs.AI 81%

StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs

StructBreak: 多模态大语言模型中结构性认知过载引发的安全故障

Yang Luo, Xinran Liu, Tiantian Ji, Zhiyi Yin, Lingyun Peng, Shuyu Li

机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE), Beijing University of Posts and Telecommunications(可信分布式计算与服务重点实验室(MoE),北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 音频语音多模态 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 提出StructBreak框架,通过量化结构性认知过载(SCO)揭示一种高阶认知过载攻击范式,在六种主流MLLM上实现92%平均攻击成功率,并证明该攻击通过结构性通道绕过安全过滤器。

Comments 23 pages; accepted to Findings of ACL 2026. This paper contains examples of harmful content

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24047 2026-05-26 cs.CV 79%

EMMA: Extracting Multiple physical parameters from Multimodal Data

EMMA: 从多模态数据中提取多个物理参数

Farhat Shaikh, Ayan Banerjee, Sandeep Gupta

机构 * IMPACT Lab, School of Computing & Augmented Intelligence (SCAI)(IMPACT实验室,计算与增强智能学院) Arizona State University, Tempe, AZ(亚利桑那州立大学,Tempe)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出EMMA框架,利用物理信息多模态融合和LTC网络,从原始视频、音频和图像时间序列中联合推断系统动力学参数,无需先验条件或专用传感器,在100+场景中优于单模态方法。

Comments Accepted at CVPR 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23703 2026-05-26 cs.HC cs.AI cs.CY 79%

Talking Slide Avatars: Open-Source Multimodal Communication Approach for Teaching

Talking Slide Avatars: 面向教学的开源多模态通信方法

Xinxing Wu

机构 * School of Mathematics and Computer Science, Kentucky State University(肯塔基州立大学数学与计算机科学学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出一种集成OpenVoice和Ditto-TalkingHead的开源工作流,用于创建可说话的幻灯片头像,以增强在线教学中的教师存在感和叙事连续性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14334 2026-05-26 cs.IT math.IT 78%

Secure Joint Source-Channel Coding of Multimodal Semantic Sources

多模态语义源的安全联合源信道编码

Denis Kozlov, Mahtab Mirmohseni, Rahim Tafazolli

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 研究在噪声窃听信道上传输多模态语义源的安全联合源信道编码问题,建立了速率-失真-感知权衡的基本界限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28128 2026-05-26 cs.LG cs.CR 78%

ORACAL: A Robust and Explainable Multimodal Framework for Smart Contract Vulnerability Detection with Causal Graph Enrichment

ORACAL: 一种基于因果图增强的鲁棒且可解释的智能合约漏洞检测多模态框架

Tran Duong Minh Dai, Triet Huynh Minh Le, M. Ali Babar, Van-Hau Pham, Phan The Duy

机构 * Information Security Lab, University of Information Technology(信息安全部,信息科技大学) Vietnam National University(越南国家大学) School of Computer Science and Information Technology, Adelaide University(计算机科学与信息技术学院,阿德莱德大学)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 提出ORACAL异构多模态图学习框架,集成控制流图、数据流图和调用图,通过RAG和LLM增强关键子图,并采用因果注意力机制和PGExplainer实现鲁棒且可解释的智能合约漏洞检测。

Comments 21 pages, version 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13608 2026-05-26 cs.LG 78%

Is GPT-4o mini Blinded by its Own Safety Filters? Exposing the Multimodal-to-Unimodal Bottleneck in Hate Speech Detection

GPT-4o mini 是否被自身的安全过滤器蒙蔽?揭示多模态到单模态瓶颈在仇恨言论检测中的作用

Niruthiha Selvanayagam, Ted Kurti

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文通过 Hateful Memes Challenge 数据集系统分析 GPT-4o mini 在多模态仇恨言论检测中的安全架构,发现并实验验证了“单模态瓶颈”缺陷,即上下文无关的安全过滤器会优先阻断多模态推理,导致误报。

Comments This paper reports preliminary findings from a small-scale study whose sample size is insufficient to support the stated conclusions. The authors are withdrawing it to conduct a more comprehensive evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25928 2026-05-26 cs.CL cs.SD eess.AS 62%

Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization

Thaka at KSAA-2026 Task 2: 用于阿拉伯语音节符号化的正则化微调

Meshal Alamr, Hassan Alqaeri, Abdullah Aldahlawi

机构 * Thaka

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 针对低资源阿拉伯语音节符号化任务,通过正则化微调CATT-Whisper多模态模型,结合R-Drop一致性正则化、Optuna优化超参数和Focal Loss,在KSAA-2026共享任务中取得第一名。

Comments 4 pages, 1 figure. Published in Proceedings of OSACT7 (LREC 2026). Winning system for KSAA-2026 Task 2 on Arabic Speech Diacritization

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05450 2026-05-26 cs.AI cs.CL 62%

Distributed Partial Information Puzzles: Examining Common Ground Construction Under Epistemic Asymmetry

分布式部分信息谜题:在认知不对称下检验共同基础的构建

Yifan Zhu, Mariah Bradford, Kenneth Lai, Timothy Obiso, Videep Venkatesha, James Pustejovsky, Nikhil Krishnaswamy

机构 * Brandeis University(布兰迪斯大学) Colorado State University(科罗拉多州立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出分布式部分信息谜题(DPIP)任务,收集多模态数据集,并评估大语言模型与动态认知逻辑方法在追踪信念状态和共同基础构建上的表现。

Comments 10 pages, 4 figures

Journal ref Proceedings of COLING-LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏