arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 221 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 221 篇

2606.11033 2026-06-10 cs.LG cs.AI cs.CL 新提交 62%

AuRA: Internalizing Audio Understanding into LLMs as LoRA

AuRA: 将音频理解内化到LLM中作为LoRA

Bo Cheng, Lei Shi, Zhanyu Ma, Yuan Wu, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * Meituan(美团) Jilin University(吉林大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出AuRA方法,通过层间蒸馏将ASR编码器的语音表示内化到LoRA适配的LLM中,实现紧耦合的语音-语言联合建模和高效并行端到端推理,在多个基准上优于级联系统和现有适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09366 2026-06-09 cs.CL eess.AS 新提交 62%

Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs

文本就是一切?文本作为语音大语言模型的通用信息瓶颈

Ming-Hao Hsu, Yuxuan Hu, Shujie Liu, Jinyu Li, Yan Lu, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft Corporation(微软公司) Microsoft Research Asia(微软亚洲研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 提出Convex Gate(C-Gate)桥接语音与LLM,通过凸包约束将语音表示限制在LLM输入嵌入流形内,在ASR和情感识别上取得联合最优性能,并揭示几何结构而非离散性是关键设计因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06743 2026-06-08 cs.SD cs.AI cs.CL 新提交 62%

HybridCodec: Fast Dual-Stream, Semantically Enhanced Neural Audio Codec

HybridCodec: 快速双流、语义增强的神经音频编解码器

Arjun Gangwar, S Umesh

机构 * Indian Institute of Technology, Madras(印度理工学院马德拉斯分校)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出HybridCodec,一种结合语义蒸馏与双流架构的统一神经音频编解码器,实现强解耦、跨语言鲁棒性及3倍速度提升。

Comments 5 pages, 5 tables, 1 figure, Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14150 2026-08-17 cs.CL 新提交 57%

Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge

面向第二届MLC-SLM挑战赛的前置静音增强与多阶段合成监督

Kexin Shi, Renhe Sun, Yuge Huang, Ximeng Wang, Jiayi Zhou, Jian Liu, Malu Zhang

机构 * Ant Group(蚂蚁集团) UESTC(电子科技大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对第二届MLC-SLM挑战赛的两项任务,分别采用前置静音增强等策略微调VibeVoice-ASR-7B、用合成问答对微调Qwen3-Omni-30B-A3B-Instruct,提升了任务1和任务2的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12034 2026-08-13 eess.AS cs.SD 新提交 57%

The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models

2026 IEEE SLT智能眼镜挑战赛:基于音频-语言模型的自我中心多说话人语音识别与理解基准测试

Dehui Gao, Zhixian Zhao, Zhennan Lin, Yujie Liao, Yuhang Dai, Yike Zhu, Longshuai Xiao, Hui Bu, Xin Xu, Xie Chen, Shuai Wang, Liumeng Xue, Zhonghua Fu, Jun Du, Eng-Siong Chng, Jun Zhou, Lei Xie

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文介绍IEEE SLT 2026智能眼镜挑战赛,构建含714个真实场景会话的106小时四通道自我中心语音数据集,评估TSA-ASR与SLU,发现说话人重叠影响TSA-ASR性能、音频-语言模型难理解副语言声学。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11804 2026-08-13 eess.AS cs.SD 新提交 57%

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

MiDashengLM-Gen:基于大语言模型驱动的自回归流匹配的统一音频场景生成

Xingwei Sun, Heinrich Dinkel, Gang Li, Jiahao Mei, Yadong Niu, Zerui Han, Yuepeng Jiang, Jiahao Zhou, Lichun Fan, Jian Luan

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 MiDashengLM-Gen是首个端到端训练的通用文本到音频生成模型,通过结合LLM与每token条件流匹配,在Seed-TTS等基准上大幅提升语音可懂度,且支持多语言场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09593 2026-08-11 cs.SD cs.AI 新提交 57%

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

MADBench:面向模态感知音频深度伪造检测的基准

Yanqiu Li, Yang Xiao, Jisheng Bai, Bin Chen, Hong Jia, Ting Dang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 MADBench是首个区分语音与环境音频的音频深度伪造检测基准,测试发现环境音频操纵更易检测,现有预训练检测器在两类声学成分上均失效,为相关研究提供严谨基础。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08990 2026-08-11 cs.HC cs.MM 新提交 57%

AI-Guided Learning: Research on Knowledge and Skill Acquisition Support Methods Using Deep Learning Audio-Video Processing Techniques

AI引导式学习:基于深度学习音视频处理技术的知识与技能获取支持方法研究

Kazuki Kawamura

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 本研究提出含三个系统的AI引导式学习框架,通过深度学习音视频处理技术,解决学习中长内容耗时、技能模仿反馈不足的问题,相关系统在播放效率、视频时长缩减、发音提升上均有良好效果。

Comments 118 pages, 26 figures, 4 tables. Doctoral dissertation, Doctor of Interdisciplinary Informatics, The University of Tokyo; degree awarded September 19, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06900 2026-08-10 cs.SD eess.AS 新提交 57%

MMAG: A Multi-Control Mixed Audio Generation Benchmark

MMAG:多控制混合音频生成基准

Zihao Zheng, Xuenan Xu, Jiahao Mei, Yixuan Li, Minghao Lv, Wen Wu, Chao Zhang, Mengyue Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本研究针对现有音频生成基准的不足,推出MMAG混合音频生成基准,构建含4000个标注音频的数据集,提出系统评估协议,测试发现各类模型在多控制能力间存在性能权衡,为该领域提供综合基准。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06632 2026-08-10 cs.AI 新提交 57%

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

塑造你的信息流:一种基于大语言模型的智能体对话推荐系统

Ziyun Xu, Bosen Ding, Yue Zhang, Ji Qi, Qingyuan Song, Jizhou Huang, Liwei Wang, Jefferey Santelli, Yue Weng, Qichao Que, Zhenheng Yang, Junfeng Pan, Linhong Zhu

机构 * Meta Platforms(元平台公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于LLM的智能体推荐框架SYF,采用三层架构实现实时多模态内容协同策划,经离线评估与在线A/B实验验证,可提升信息流相关性与用户情感,为工业场景提供交互式推荐方案。

Comments Accepted in RecSys 2026 Industrial Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05803 2026-08-07 cs.CV 新提交 57%

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Vorch-Omni:视觉与听觉的多任务编排

Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 Vorch-Omni是基于流匹配扩散Transformer的统一多任务视听合成框架,支持10余项视听相关任务,为通用视听生成与操作提供可扩展基础。

Comments Project Page: https://vorch-project.github.io/Vorch-Omni-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03742 2026-08-05 cs.SD cs.AI 新提交 57%

AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities

基于AI的音效生成:跨输入模态生成模型的叙事性综述

Sandy Abdo, Bill Kapralos, Priyamvada Tripathi, KC Collins, Adam Dubrowski

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本章综述了跨文本、视觉等输入模态的AI音效生成模型,考察30篇文献,指出模型性能提升的同时存在时间同步局限等挑战,推动音效生成向自适应系统发展。

Comments 29 pages, 5 figures, to appear in G. A. Tsihrintzis, M. Virvou, N. Bourbakis, and L. C. Jain (Eds.), Advances in Global Applied Artificial Intelligence: Springer, Learning and Analytics in Intelligent Systems Book Series

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28687 2026-08-03 cs.LG cs.AI cs.ET 新提交 57%

Technological Advances in Detecting and Managing Cognitive Impairment in Older Adults: Trends, Challenges, and Future Directions

老年人认知障碍检测与管理的技术进展:趋势、挑战与未来方向

Mohammad Asif, Azizuddin Khan, Mohd Azam, Anurag Rajkumar Bombarde

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) T-Systems ICT India Pvt. Ltd.(德国电信系统印度信息通信技术私人有限公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综合老年人认知障碍检测与管理的技术进展,提出跨学科分类法等成果,指出现有模型多依赖小数据集,展望了可信多模态纵向验证系统的发展前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27436 2026-07-31 eess.AS 新提交 57%

WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction

WeSep:面向目标说话人提取的模块化与线索可组合框架

Ke Zhang, Xiaoyang Yu, Haoyu Li, Shuai Wang, Shuhan Zhang, Haizhou Li

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 WeSep是将目标说话人提取重新表述为异质线索条件学习问题的统一框架,通过模块化设计提升灵活性,多模态实验验证其稳定性,工具包将公开。

Comments 6 pages, accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26567 2026-07-30 cs.RO cs.CV 新提交 57%

Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots

Speech2Grasp:面向人形机器人的文本条件抓取检测到语音的高效数据迁移

Hung Nguyen, Kim Nhat Minh Nguyen, Van Duc Vu, Van-Danh Le, Hoang Huy Le, Dinh Tuan Nguyen, Pham Tuyen Le, Van-Truong Nguyen, Quan Nguyen

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本研究提出Speech2Grasp框架,以数据高效方式将文本条件抓取检测模型迁移至语音输入,通过轻量级MLP投影器适配,在人形机器人实验中性能优于级联ASR流水线且延迟更低,为文本系统扩展到语音提供实用范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25085 2026-07-29 eess.AS 新提交 57%

Text-Prompted CLAP: Learning Query-Conditioned Audio Representations via Contrastive Learning

文本提示的CLAP:通过对比学习学习查询条件音频表示

Mohan Li, Rama Doddipatla, Philip C. Woodland

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 研究旨在解决CLAP独立编码模态限制,提出TP-CLAP,通过引入交叉注意力融合模块,利用音频多项选择题框架训练,在音频问答、检索等任务中表现出色,优于标准CLAP基线。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24359 2026-07-28 cs.CV 新提交 57%

TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation

TaoMate:用于实时音频-视频数字人生成的锚点引导内存桥接演化和参考状态

Qijun Gan, Chenwei Zhang, Meiguang Jin, Junfeng Ma, Qiu Shen

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 研究实时长格式数字人生成问题,提出TaoMate框架,通过锚点引导、内存桥接等方法,在保持稳定外观和视听同步下,实现少步联合音频-视频生成,且能跨块并行执行加速自回归推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24082 2026-07-28 cs.AI 新提交 57%

Towards High-Level Semantic Intelligence

迈向高级语义智能

Xiujie Song, Gefei Yang, Yining You, Jiahui Gan, Qi Jia, Shota Watanabe, Tianxi Wan, Mengyue Wu, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 综述从语义复杂性角度审视人工智能语义智能发展,系统调研高级语义任务研究,总结理解和生成的相关方法及策略,旨在推动人工智能向高级语义智能持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19352 2026-07-23 cs.HC cs.CY cs.MM cs.SD 新提交 57%

Validating the Single Item Kawaii Measure

验证单项卡哇伊度量

Katie Seaborn, Yijia Wang

机构 * University of Cambridge(剑桥大学) Institute of Science(科学研究院) Tokyo Institute of Technology(东京技术大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 研究测量用户对卡哇伊感知的问题,通过九个数据集对单项度量进行收敛、已知群体和跨情境效度及信度检验,证明了其在声音和视觉卡哇伊感知方面效度的初步证据,并指出可进一步提高严谨性。

Comments Accepted at CUI '26 (Short Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17079 2026-07-21 eess.AS 新提交 57%

SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations

SALMONN-2:利用自监督表示提升通用听力能力

Xiaoyu Yang, Xuenan Xu, Wenyi Yu, Siyin Wang, Changli Tang, Terumi Chiba, Siyuan Hou, Ziyang Zhang, Wen Wu, Baoxiang Li, Guangzhi Sun, Chao Zhang, Philip Woodland

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 研究探索自监督学习音频表示能否为音频大语言模型提供基础,提出基于统一SSL编码器的SALMONN-2,用多层特征融合适配器,还探索多模态上下文学习。实验表明通用SSL编码器性能良好,SALMONN-2达先进水平,且特定训练可获多模态上下文学习能力。

Comments Disclaimer: This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17812 2026-07-21 cs.CL 新提交 57%

ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions

ESCUCHA:用于异构声学条件的西班牙语语音基准测试

Fernando López, Ana Ayala, Guillermo Segovia, Fernando Ibáñez, Ana Martínez, Pablo Gómez, Jordi Luque

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对现实声学条件下西班牙语语音理解受关注少的问题,引入ESCUCHA基准测试,含1000个人工挑选与音频配对的问题,强调推理与语言多样性,涵盖多类问题,测试发现先进模型与人类存在性能差距。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14182 2026-07-17 cs.RO cs.AI 新提交 57%

Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control

用于动态人形机器人全身控制的语义音频驱动理解

J. M. A. Marcelo, M. Brienza, E. Bugli, L. Comito, D. Nardi, D. D. Bloisi, V. Suriani

机构 * Sapienza University of Rome(罗马第一大学) International University of Rome(罗马国际大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 研究针对人形机器人自主性和动态环境响应受限问题,提出语义音频驱动的多模态编排框架,通过处理音频流、结合音乐与语音输入及强化学习控制,验证了该方法在模拟和实体机器人上的有效性。

Comments Accepted at 29th Robocup International Symposium, held on July 6th, 2026 in Incheon, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11792 2026-07-14 cs.RO eess.AS 新提交 57%

Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems

将所有内容都转换为在线 API 服务?关于在机器人系统中集成本地化语音识别模型的综述

Sheng Li, Jing Li, Felix Schijve, Jun Hu, Emilia Barakova

机构 * Institute of Science Tokyo(东京科学研究所) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 综述自动语音识别技术在机器人系统中的集成,涵盖其从传统到深度学习模型的演变、相关数据集与工具包,介绍基于 ASR 模型家族等的部署策略及实际平台,指出挑战与未来方向,助力社交机器人研究人员探索人机交互领域。

Comments accepted in 18th International Conference on Social Robotics (ICSR + ART 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09095 2026-07-13 cs.SD cs.MM 新提交 57%

Event-Based Token Sequences for Audio-Conditioned Music-Game Level Modeling

用于音频条件音乐游戏关卡建模的基于事件的令牌序列

Ke Zhang, Chu-Hsuan Hsueh, Kokolo Ikeda

机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 研究音乐游戏关卡程序生成问题,受基于事件的符号音乐建模启发,提出令牌级序列公式,构建Transformer模型,在事件级评估中优于基线,能系统分析音频对节奏对齐事件预测的支持。

Comments Camera-ready version, published at ICMR 2026

Journal ref Proceedings of the International Conference on Multimedia Retrieval (ICMR '26), June 16-19, 2026, Amsterdam, Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02343 2026-07-03 cs.SD cs.AI 新提交 57%

SelectTSL: Prompt-Guided Selective Target Sound Localization in Complex Scenarios

SelectTSL:复杂场景中提示引导的选择性目标声音定位

Ziyang Jiang, Yu Chen, Zexu Pan, Xinyuan Qian, Bowen Xing, Ivor W. Tsang, Xu-Cheng Yin, Haizhou Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出SelectTSL架构,通过提示引导的选择性注意力模块增强相位差,实现多源声场中仅定位用户指定目标,并估计到达方向和目标源数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10231 2026-07-03 eess.AS cs.SD 新提交 57%

LLM can Read Spectrogram: Encoder-free Speech-Language Modeling

LLM 能读频谱图:无编码器的语音语言建模

Ruchao Fan, Yiming Wang, Yuxuan Hu, Bo Ren, Yufei Xia, Xiaofei Wang, Yao Qian, Shujie Liu, Jinyu Li

机构 * Microsoft, USA(微软公司,美国)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 提出 Mel-LLM,一种无需专用语音编码器、直接将梅尔频谱图补丁通过线性投影输入 LLM 的架构,在 ASR 和 TTS 任务上验证了其可行性,ASR 性能与有编码器方案相当,TTS 初步可行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00387 2026-07-02 eess.AS 新提交 57%

From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning

从目标到应用:对齐音频自监督学习中的架构偏差

Kele Xu, Yulu Fang, Boda Zhou, Yulin Sun, Qisheng Xu, Qiya Song, Jin Zhang, Cheng Yang, Huaimin Wang

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文通过预训练目标、架构归纳偏差与下游应用的对齐,系统分析音频自监督学习,围绕五种范式讨论不同监督信号对表征的影响,并关联到CNN、RNN、状态空间模型、Transformer及混合架构的偏差,最后解读在语音、环境声、音乐、医学及多模态等领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27627 2026-06-29 cs.LG cs.AI 新提交 57%

HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models

HybridCodec:为高效语音语言模型建模离散和连续表示

Artem Ploujnikov, Francesco Verdini, Samir Sadok, Mirco Ravanelli

机构 * Mila, Quebec AI Institute(Mila-魁北克人工智能研究所) Concordia University(康考迪亚大学) Sapienza University of Rome(罗马大学) Inria, Université Grenoble Alpes CNRS, LJK(法国国家信息与自动化研究所,格勒诺布尔阿尔卑斯大学国家科学研究中心,让·库尔曼实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出HybridCodec,结合时间压缩离散令牌与降维连续残差,通过混合离散-连续焦点调制编解码器和混合Transformer,在离散域自回归推理并辅以非自回归预测和连续残差上采样,相比纯离散方法显著提升说话人特征保留并减少自回归步数。

Comments Accepted

Journal ref InterSpeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27380 2026-06-29 cs.CL 新提交 57%

A Survey of Automated Presentation Coaching: Systems, Methods, and Open Challenges

自动演讲辅导系统综述:系统、方法与开放挑战

Wen Liang, Li Siyan, Zackary Rackauckas, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司) RoleGaku

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文综述自动演讲辅导系统,提出五维任务分类法,覆盖发音、韵律、节奏和内容忠实度,并分析TTS示例生成与诊断方法,指出语料稀缺、口音公平和低延迟诊断等挑战。

Comments accepted into the BEA 2026 workshop at ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26793 2026-06-26 cs.CR cs.AI cs.LG 新提交 57%

MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG

MIRROR: 基于新颖性约束的记忆引导MCTS红队测试用于智能体RAG

Inderjeet Singh, Andrés Murillo, Motoyoshi Sekiya, Yuki Unno, Junichi Suga

机构 * Fujitsu Research of Europe, United Kingdom(欧洲富士通研究机构,英国) Fujitsu Limited, Japan(日本富士通有限公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出MIRROR框架,通过记忆引导蒙特卡洛树搜索和显式新颖性约束,在多模态智能体RAG系统的四个攻击面上实现高攻击成功率,并降低跨表面方差。

Comments 6 pages, 2 figures. Accepted at the 2026 International Joint Conference on Neural Networks (IJCNN 2026), IEEE WCCI 2026; presented as an oral talk. Code and ART-SafeBench benchmark: https://github.com/FujitsuResearch/mirror

详情

展开后加载摘要…

URL PDF HTML 收藏