arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-15 至 2026-06-15 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 6 篇

2606.13712 2026-06-15 cs.SD cs.CL 新提交 79%

Multimodal Speaker Identification in Classroom Environments

课堂环境中的多模态说话人识别

Michael L. Chrzan, Meghavarshini Krishnaswamy, Robert Gibboni, Katie Wetstone, Wei Ai, Jing Liu

机构 * University of Michigan(密歇根大学) University of Pennsylvania(宾夕法尼亚大学) University of Maryland(马里兰大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 针对课堂背景噪声和儿童语音变异性导致纯声学模型准确率低的问题,提出融合声学嵌入与LLM语义上下文的多模态框架,将学生识别准确率从39.0%提升至50.3%,长句准确率达76.9%,角色区分准确率99.3%。

Comments 9 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21182 2026-06-15 cs.CL cs.AI cs.CV 版本更新 67%

Manga109-v2026: Revisiting Manga109 Annotations for Modern Manga Understanding

Manga109-v2026: 重新审视Manga109标注以适应现代漫画理解

Jeonghun Baek, Atsuyuki Miyai, Shota Onohara, Hikaru Ikuta, Kiyoharu Aizawa

机构 * University of Tokyo(东京大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文重新审视Manga109的对话文本标注,识别出五类标注问题,包括转录错误、缺失文本区域、对话与拟声词重叠以及未分割的对话气泡,并通过结合OCR基于的问题检测和人工修订构建Manga109-v2026,修订了约29,000个对话标注,使Manga109更好地适应现代OCR和多模态漫画理解系统,同时保留漫画特有的表达结构。

Comments Accepted to the Culture x AI Workshop at ICML 2026. Project page: https://manga109.github.io/manga109-project-website/en/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14321 2026-06-15 cs.SD cs.MM 新提交 57%

MaskedFOP: Polyglot Speaker Identification under Missing Visual Modality via Cascaded Graph Label Propagation

MaskedFOP:缺失视觉模态下的多语言说话人识别通过级联图标签传播

Ayoub Elkhouzari, Youssef Iraqi, Loubna Mekouar

机构 * College of Computing, University Mohammed VI Polytechnic(穆罕默德六世理工大学计算机学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 提出MaskedFOP系统,在测试时人脸完全缺失且语音为未见语言(乌尔都语)的挑战下,通过模态丢弃双头网络、互补嵌入平均和两级级联推理实现闭集多语言说话人识别,在POLY-SIM 2026挑战赛中取得第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17633 2026-06-15 cs.SD cs.CR 版本更新 50%

SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering

SARSteer: 通过安全消融拒绝引导保护大型音频语言模型

Weilin Lin, Jianze Li, Hui Xiong, Li Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出SARSteer,首个针对大型音频语言模型的推理时防御框架,通过文本衍生的拒绝引导和分解安全空间消融,有效提升有害查询拒绝率并减少良性查询的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16835 2026-06-15 cs.CR cs.LG 版本更新 50%

NeST: Neuron Selective Tuning for LLM Safety

NeST: 面向LLM安全的神经元选择性调优

Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出NeST框架,通过激活探测识别安全相关前馈神经元并训练共享簇级更新,仅用普通恶意提示即可泛化防御多种越狱攻击,在14个模型上以极少参数实现接近全微调的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15496 2026-06-15 cs.HC cs.RO 50%

Fast Multi-Party Open-Ended Conversation with a Social Robot

快速多方开放性对话与社交机器人

Giulio Antonio Abbo, Maria Jose Pinto-Bernal, Martijn Catrycke, Tony Belpaeme

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种结合多模态感知与大语言模型的多方对话系统,评估结果显示其在平行对话和小组讨论中表现出高参与度和准确率,但存在语音识别误差和响应延迟等技术限制。

Comments 15 pages, 5 figures, 4 tables; 2 appendices

Journal ref Front. Robot. AI 13:1766383 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏