Efficient Distributed MLLM Training with Cornstarch
使用Cornstarch高效分布式多模态大语言模型训练
专题命中 音频语音多模态 :MLLM(title,abstract);multimodal(abstract)
AI总结 提出Cornstarch框架,通过冻结感知流水线并行和令牌工作负载平衡的上下文并行,解决多模态大语言模型训练中的异构性问题,平均吞吐量提升2.26倍。
Comments ICML'26
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
使用Cornstarch高效分布式多模态大语言模型训练
专题命中 音频语音多模态 :MLLM(title,abstract);multimodal(abstract)
AI总结 提出Cornstarch框架,通过冻结感知流水线并行和令牌工作负载平衡的上下文并行,解决多模态大语言模型训练中的异构性问题,平均吞吐量提升2.26倍。
Comments ICML'26
StructBreak: 多模态大语言模型中结构性认知过载引发的安全故障
机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE), Beijing University of Posts and Telecommunications(可信分布式计算与服务重点实验室(MoE),北京邮电大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 音频语音多模态 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 提出StructBreak框架,通过量化结构性认知过载(SCO)揭示一种高阶认知过载攻击范式,在六种主流MLLM上实现92%平均攻击成功率,并证明该攻击通过结构性通道绕过安全过滤器。
Comments 23 pages; accepted to Findings of ACL 2026. This paper contains examples of harmful content
EMMA: 从多模态数据中提取多个物理参数
机构 * IMPACT Lab, School of Computing & Augmented Intelligence (SCAI)(IMPACT实验室,计算与增强智能学院) ; Arizona State University, Tempe, AZ(亚利桑那州立大学,Tempe)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 提出EMMA框架,利用物理信息多模态融合和LTC网络,从原始视频、音频和图像时间序列中联合推断系统动力学参数,无需先验条件或专用传感器,在100+场景中优于单模态方法。
Comments Accepted at CVPR 2026 (main conference)
Talking Slide Avatars: 面向教学的开源多模态通信方法
机构 * School of Mathematics and Computer Science, Kentucky State University(肯塔基州立大学数学与计算机科学学院)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 提出一种集成OpenVoice和Ditto-TalkingHead的开源工作流,用于创建可说话的幻灯片头像,以增强在线教学中的教师存在感和叙事连续性。
Comments 15 pages
多模态语义源的安全联合源信道编码
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 研究在噪声窃听信道上传输多模态语义源的安全联合源信道编码问题,建立了速率-失真-感知权衡的基本界限。
ORACAL: 一种基于因果图增强的鲁棒且可解释的智能合约漏洞检测多模态框架
机构 * Information Security Lab, University of Information Technology(信息安全部,信息科技大学) ; Vietnam National University(越南国家大学) ; School of Computer Science and Information Technology, Adelaide University(计算机科学与信息技术学院,阿德莱德大学)
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 提出ORACAL异构多模态图学习框架,集成控制流图、数据流图和调用图,通过RAG和LLM增强关键子图,并采用因果注意力机制和PGExplainer实现鲁棒且可解释的智能合约漏洞检测。
Comments 21 pages, version 2
GPT-4o mini 是否被自身的安全过滤器蒙蔽?揭示多模态到单模态瓶颈在仇恨言论检测中的作用
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文通过 Hateful Memes Challenge 数据集系统分析 GPT-4o mini 在多模态仇恨言论检测中的安全架构,发现并实验验证了“单模态瓶颈”缺陷,即上下文无关的安全过滤器会优先阻断多模态推理,导致误报。
Comments This paper reports preliminary findings from a small-scale study whose sample size is insufficient to support the stated conclusions. The authors are withdrawing it to conduct a more comprehensive evaluation
Thaka at KSAA-2026 Task 2: 用于阿拉伯语音节符号化的正则化微调
机构 * Thaka
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
AI总结 针对低资源阿拉伯语音节符号化任务,通过正则化微调CATT-Whisper多模态模型,结合R-Drop一致性正则化、Optuna优化超参数和Focal Loss,在KSAA-2026共享任务中取得第一名。
Comments 4 pages, 1 figure. Published in Proceedings of OSACT7 (LREC 2026). Winning system for KSAA-2026 Task 2 on Arabic Speech Diacritization
分布式部分信息谜题:在认知不对称下检验共同基础的构建
机构 * Brandeis University(布兰迪斯大学) ; Colorado State University(科罗拉多州立大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 提出分布式部分信息谜题(DPIP)任务,收集多模态数据集,并评估大语言模型与动态认知逻辑方法在追踪信念状态和共同基础构建上的表现。
Comments 10 pages, 4 figures
Journal ref Proceedings of COLING-LREC 2026