Multimodal Speaker Verification as a Threat to Speaker Anonymization
多模态说话人验证对说话人匿名化的威胁
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
AI总结 研究多话语、多模态环境下的说话人验证,通过对多个匿名话语的音频、韵律和语言信息进行聚合,比较不同聚合策略,发现多模态系统性能更优,帧级聚合EER最低,即便少量匿名话语结合音频和文本也能显著降低EER。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
多模态说话人验证对说话人匿名化的威胁
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
AI总结 研究多话语、多模态环境下的说话人验证,通过对多个匿名话语的音频、韵律和语言信息进行聚合,比较不同聚合策略,发现多模态系统性能更优,帧级聚合EER最低,即便少量匿名话语结合音频和文本也能显著降低EER。
基于多视角语音特征的LoRA微调大语言模型用于痴呆检测
机构 * NAVER Cloud(NAVER云) ; Division of Communication and Media, Ewha Womans University(通信与媒体系,成均馆大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 提出LoRA微调LLM,通过统一提示整合ASR转录、话语主题、时间流畅度和音韵序列四种语音特征,实现多视角推理,在ADReSSo上F1达90.14%。
Comments Accepted at INTERSPEECH 2026
验证单项卡哇伊度量
机构 * University of Cambridge(剑桥大学) ; Institute of Science(科学研究院) ; Tokyo Institute of Technology(东京技术大学)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM
AI总结 研究测量用户对卡哇伊感知的问题,通过九个数据集对单项度量进行收敛、已知群体和跨情境效度及信度检验,证明了其在声音和视觉卡哇伊感知方面效度的初步证据,并指出可进一步提高严谨性。
Comments Accepted at CUI '26 (Short Paper)
CAPS:一种使用带带宽扩展的亚奈奎斯特采样实现可穿戴设备节能的级联重建模型
机构 * George Mason University(乔治梅森大学)
专题命中 音频语音多模态 :multimodal(abstract)
AI总结 研究可穿戴设备中联合降低ADC采样比特分辨率和频率对功耗及音频质量的影响,提出CAPS模型,采用亚奈奎斯特采样和低比特分辨率,降低功耗3.3倍,支持移动平台流操作,确保语音清晰度,平衡效率与节能。
Comments arXiv admin note: substantial text overlap with arXiv:2506.22321