arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4557 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4557 篇

2204.13206 2022-04-29 cs.SD eess.AS eess.IV 80%

Improving Multimodal Speech Recognition by Data Augmentation and Speech Representations

Dan Oneata, Horia Cucu

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

Comments Accepted at the Multimodal Learning and Applications Workshop (MULA) from CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.01353 2021-11-05 cs.CV cs.LG cs.RO 80%

There is More than Meets the Eye: Self-Supervised Multi-Object Detection and Tracking with Sound by Distilling Multimodal Knowledge

Francisco Rivera Valverde, Juana Valeria Hurtado, Abhinav Valada

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

Comments Accepted at CVPR 2021. Dataset, code and models are available at http://rl.uni-freiburg.de/research/multimodal-distill

Journal ref IEEE/ CVF International Conference on Computer Vision and Pattern Recognition (CVPR), pp. 11612-11621, 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.00734 2020-12-02 eess.AS cs.SD eess.IV 80%

Training Strategies to Handle Missing Modalities for Audio-Visual Expression Recognition

Srinivas Parthasarathy, Shiva Sundaram

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS;multimodal(comments)

Comments ICMI 2020 workshop on "MODELING SOCIO-EMOTIONAL AND COGNITIVE PROCESSES FROM MULTIMODAL DATA IN THE WILD"

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.09847 2020-08-25 eess.AS cs.SD eess.SP 80%

Time-Domain Multi-modal Bone/air Conducted Speech Enhancement

Cheng Yu, Kuo-Hsuan Hung, Syu-Siang Wang, Szu-Wei Fu, Yu Tsao, Jeih-weih Hung

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS

Comments multi-modal, bone/air-conducted signals, speech enhancement, fully convolutional network

Journal ref IEEE Signal Processing Letters, vol. 27, pp. 1035-1039, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.03876 2020-07-09 cs.CL 80%

Audio-Visual Understanding of Passenger Intents for In-Cabin Conversational Agents

Eda Okur, Shachi H Kumar, Saurav Sahay, Lama Nachman

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract,comments);分类 cs.CL

Comments ACL 2020 - Second Grand-Challenge and Workshop on Multimodal Language (Challenge-HML)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15265 2026-07-17 cs.CV cs.AI cs.MM cs.SD 新提交 80%

SceneBind: Binding What and Where Across Vision, Audio and Language

SceneBind:跨视觉、音频和语言绑定“什么”与“哪里”

Mingfei Chen, Zijun Cui, Ruoke Zhang, Hyeonggon Ryu, Eli Shlizerman

机构 * University of Washington(华盛顿大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究提出SceneBind全模态场景表示,结合全局语义与对象中心语义空间插槽解决空间结构缺失问题,还提出匹配方案。通过构建新数据集及训练协议进行训练评估,兼容预训练编码器,实现先进检索并能零样本转移到下游任务。

Comments Project website: https://scenebind.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18296 2026-05-19 cs.HC 80%

MEEDAV: A Synchronous Web Viewer for EEG, Eye-Tracking and Speech Data

MEEDAV:一种用于EEG、眼动追踪和语音数据同步可视化的Web查看器

Jan Pijálek, Karel Vlk, Ondřej Bojar

专题命中 音频语音多模态 :multi-modal(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract)

AI总结 本文提出MEEDAV,一种用于同步可视化EEG、眼动追踪和语音数据的开源Web应用,支持高密度EEG设置,并提供实时处理和交互式可视化功能,适用于心理语言学研究。

Comments Presented at ACAIN 2025 (Advanced Course & Symposium on Artificial Intelligence & Neuroscience), recipient of the Camillo Golgi Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16231 2026-01-26 cs.SD cs.AI cs.CL cs.LG eess.AS 80%

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models

SoundBreak: 对三模态模型上仅音频对抗攻击的系统研究

Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas

机构 * Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 SoundBreak研究了对三模态模型的仅音频对抗攻击,发现音频扰动可导致严重多模态失败,攻击成功率高达96%,并揭示了多模态系统中被忽视的单模态攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00279 2025-12-01 cs.MM cs.AI cs.CL cs.DC cs.LG cs.SD 80%

LongCat-Flash-Omni Technical Report

LongCat-Flash-Omni 技术报告

Meituan LongCat Team, Bairui Wang, Bayan, Bin Xiao, Bo Zhang, Bolin Rong, Borun Chen, Chang Wan, Chao Zhang, Chen Huang, Chen Chen, Chen Chen, Chengxu Yang, Chengzuo Yang, Cong Han, Dandan Peng, Delian Ruan, Detai Xin, Disong Wang, Dongchao Yang, Fanfan Liu, Fengjiao Chen, Fengyu Yang, Gan Dong, Gang Huang, Gang Xu, Guanglu Wan, Guoqiang Tan, Guoqiao Yu, Haibo Qiu, Hao Lu, Hongbo Liu, Hongyu Xiang, Jiaheng Wu, Jian Yang, Jiaxing Liu, Jing Huang, Jingang Wang, Jinrui Ding, Juchao Jiang, Jun Kuang, Jun Wang, Junhui Mei, Ke Ding, Kefeng Zhang, Lei Chen, Liang Shi, Limeng Qiao, Liming Zheng, Lin Ma, Liuyang Guo, Liya Ma, Luying Sun, Man Gao, Mengshen Zhu, Miao Cao, Minliang Lin, Nuo Xu, Peng Shi, Qi Zhang, Qian Fang, Qian Wang, Qian Yang, Quanxiu Wang, Rongxiang Weng, Rongxin Guo, Ruoxuan Liang, Senbin Yang, Shanbo Xu, Shanglin Lei, Shengze Ye, Shimin Chen, Shuaiqi Chen, Shujie Hu, Shuo Li, Siqi Yang, Siyu Xu, Siyu Ren, Song Li, Songxiang Liu, Tianhao Bai, Tianye Dai, Wei Hong, Wei Wang, Weixiao Zhao, Wengang Cao, Wenlong Zhu, Wenlong He, Xi Su, Xi Nan, Xiaohan Zhao, Xiaohao Wang, Xiaoyu Zhao, Xiaoyu Wang, Xiaoyu Li, Xin Pan, Xin Chen, Xiusong Sun, Xu Xiang, Xudong Xing, Xuezhi Cao, Xunliang Cai, Yang Yang, Yanli Tan, Yao Yao, Yerui Sun, Yi Chen, Yifan Lu, Yin Gong, Yining Zhang, Yitian Chen, Yiyang Gan, Yuchen Tang, Yuchen Xie, Yueqian Wang, Yuewen Zheng, Yufei Zhang, Yufeng Zhong, Yulei Qian, Yuqi Peng, Yuqian Li, Yuwei Jiang, Zeyang Hu, Zheng Zhang, Zhengkun Tian, Zhiqing Hong, Zhixiong Zeng, Zhuqi Mi, Ziran Li, Ziwen Wang, Ziyi Zhao, Ziyuan Zhuang, Zizhe Zhao

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 LongCat-Flash-Omni 是一个具有5600亿参数的开源多模态模型,通过课程启发式训练策略实现高效实时音频视觉交互,具备强大的多模态和单模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16359 2025-05-30 cs.CV cs.AI cs.MM 80%

Audio Visual Segmentation Through Text Embeddings

Kyungbok Lee, You Zhang, Zhiyao Duan

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20693 2024-07-31 cs.CV cs.AI cs.MM 80%

Boosting Audio Visual Question Answering via Key Semantic-Aware Cues

Guangyao Li, Henghui Du, Di Hu

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05206 2024-04-09 cs.CV cs.MM cs.SD eess.AS 80%

SoundingActions: Learning How Actions Sound from Narrated Egocentric Videos

Changan Chen, Kumar Ashutosh, Rohit Girdhar, David Harwath, Kristen Grauman

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted at CVPR 2024. Project page: https://vision.cs.utexas.edu/projects/soundingactions

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.12772 2022-08-16 cs.CV cs.MM cs.SD eess.AS 80%

Exploiting Transformation Invariance and Equivariance for Self-supervised Sound Localisation

Jinxiang Liu, Chen Ju, Weidi Xie, Ya Zhang

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Camera-ready Version for ACMMM 2022, Project page is https://jinxiang-liu.github.io/SSL-TIE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15066 2026-08-18 eess.SP cs.MM eess.IV 新提交 79%

ParaJSCC: A Parameterized Framework for Reusable Multimodal Joint Source-Channel Coding

ParaJSCC:一种用于可复用多模态联合信源信道编码的参数化框架

Kemi Chen, Mingkai Chen, Youjia Chen, Qian Liu, Wei Gao, Tiesong Zhao

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 针对多模态内容重复访问的效率问题,提出ParaJSCC参数化框架,通过离线生成参数包按需传输,降低延迟与传输速率并保持重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16686 2026-08-18 cs.HC cs.CL cs.RO 新提交 79%

Closing the Affective Loop: Multimodal Speaker-Listener Emotion-Dynamics-Aware Empathetic Social Robots

闭合情感循环:具情感动态感知的多模态说话人-听话人共情社交机器人

Zi Haur Pang, Casey Kennington, Tatsuya Kawahara

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究提出AffectLoop系统,在Misty II机器人上实现多模态情感动态感知的说话人-听话人共情交互,经试点研究验证可提升共情响应与用户满意度。

Comments This paper has been accepted for presentation at APSIPA ASC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14651 2026-08-18 cs.AI cs.HC 新提交 79%

Evaluating Multimodal LLMs across Text and Audio Modalities for Accessible Disaster Assistance

评估面向无障碍灾害援助的跨文本与音频模态多模态大语言模型

Anuridhi Gupta, Samara Mansoor, Hemant Purohit

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.AI

AI总结 本文评估了开放权重多模态大语言模型在灾害援助场景下跨文本与音频模态的响应一致性,发现其存在模态依赖的不公平性,为构建公平的灾害沟通AI工具提供了设计建议。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11752 2026-08-14 cs.CV cs.SD 版本更新 79%

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

UniSwap:用于说话视频的流音频-视觉身份交换

Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务集团)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 UniSwap是首个流音频-视觉身份替换框架,通过多阶段适配技术解决现有方法音视频一致性差等问题,实现高效稳定的说话视频身份替换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17387 2026-08-12 cs.CL 版本更新 79%

Generation-Step-Aware Framework for Cross-Modal Representation and Control in Multilingual Speech-Text Models

跨模态表示与控制的多语言语音-文本模型生成步骤感知框架

Toshiki Nakai, Varsha Suresh, Vera Demberg

机构 * Saarland University(萨尔兰大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL

AI总结 本文提出一个生成步骤感知框架,用于评估多语言语音-文本模型中的跨模态计算,发现跨模态语言对齐在生成初期最强,随后转向模态特定的自回归处理。

Comments 8 pages for the main text, 9 Figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09475 2026-08-11 cs.CV 新提交 79%

Agreement-Based Audio-Visual Segmentation:Champion Report for the MeViS-Audio Track in the 8th LSVOS Challenge

基于一致性的视听分割:第八届LSVOS挑战赛MeViS音频赛道冠军报告

Yiwen Ren, Jianing Liu, Yingxin Wang, Kexin Zhang, Licheng Jiao, Lingling Li, Xu Liu

机构 * National 111 Project Base of Intelligent Information Processing(智能信息处理国家111计划基地)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文针对第八届LSVOS挑战赛MeViS音频赛道,提出分阶段视听分割方案,以Qwen3-ASR为基础,通过掩码一致性选择轨迹并修正查询,结合多模态得分判断目标存在性,最终取得赛道第一的成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09288 2026-08-11 cs.SD cs.AI 新提交 79%

DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation

DAVE:用于真实场景语音分离的解耦式视听增强框架

Wei Zhou, Wanyi Ning, Yinshang Guo, Qianxiao Fang, Haitao Qian, Yingpeng Li

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI

AI总结 本文提出用于真实场景语音分离的解耦式视听增强框架DAVE,构建含219411个混合样本的DAVE-Corpus,采用渐进式多目标优化与选择性增强链,在挑战赛中展现出良好鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08510 2026-08-11 cs.CL 新提交 79%

From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios

从语音到交互:鸡尾酒会场景下多模态系统的分析

Thai-Binh Nguyen, Zhaolin Li, Jan Niehues, Alexander Waibel

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CL

AI总结 本研究分析了CHiME-9 MCoRec任务中不同多模态系统解决鸡尾酒会场景的策略,发现最优系统实现57%相对错误减少,且高语音重叠并非性能差异的主要原因。

Comments Accepted at ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03964 2026-08-07 eess.AS 版本更新 79%

Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE

基于QIANGDA与VOXBLINK2-AVSE的身份保真视听目标说话人提取

Peijun Yang, Zhan Jin, Xiaoyi Qin, Ruiyi Gan, Hao Wang, Juan Liu, Ming Li

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 本文提出QIANGDA普通话AV-TSE基准与VOXBLINK2-AVSE数据集,采用含AV-HuBERT等的提取器,通过双指标评估,取得了视听目标说话人提取的良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02183 2026-08-07 cs.AI 版本更新 79%

TRU: Targeted Reverse Update for Efficient Multimodal Recommendation Unlearning

TRU:面向高效多模态推荐去学习的定向反向更新

Zhanting Zhou, KaHou Tam, Ziqiang Zheng, Zeyu Ma, Yang Yang

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Macau(澳门大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态推荐系统中数据删除影响不均匀的问题,提出TRU框架,通过层级化干预实现更高效的去学习,提升保留与遗忘的平衡。

Comments Author Accepted Manuscript. Accepted for publication in the Proceedings of the 34th ACM International Conference on Multimedia (ACM MM '26). This author-created manuscript is not the ACM Version of Record

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06620 2026-08-05 eess.AS 版本更新 79%

Why Pre-trained Models Fail: Feature Entanglement in Multi-modal Depression Detection

预训练模型为何失效:多模态抑郁检测中的特征纠缠

Xiangyu Zhang, Beena Ahmed, Julien Epps

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS

AI总结 本文针对预训练模型在多模态抑郁检测中性能差的问题,提出信息分离框架解纠缠混合特征,显著提升了SSL模型和LLMs的检测性能,为相关系统开发提供了新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28129 2026-07-31 cs.CV cs.IR 新提交 79%

Face and Voice Cross-modal Association with Learning Convex Feature Embedding

基于凸特征嵌入学习的人脸与声音跨模态关联

Taewan Kim, Jiwoo Kang

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出结合跨模态注意力机制的凸特征嵌入方法,解决人脸与声音跨模态关联中的特征异质性问题,在VoxCeleb数据集的相关任务上较现有方法有显著提升。

Journal ref Multimedia Systems, vol. 31, no. 4, pp. 296, July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27212 2026-07-31 cs.HC cs.CL 新提交 79%

Digital Harf: A Clinically Integrated Multimodal AI System for Pervasive Arabic Speech and Language Therapy

Digital Harf:用于普及型阿拉伯语言语和语言治疗的临床整合多模态AI系统

Asif Azad, Mohammad Sadat Hossain, MD Sadik Hossain Shanto, Sabri Boughorbel, Abdulrhman Aljouie, Bdour Alwuqaysi, Yahya Bokhari, Ayah Othman Sindi, Ehsan Hoque

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 Digital Harf是专为阿拉伯语自闭症儿童设计的多模态AI治疗平台,其核心Agentic合成数据引擎解决阿拉伯语治疗内容短缺问题,获专家高接受率,为代表性语言环境构建AI治疗系统提供了思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08405 2026-07-31 cs.CV 版本更新 79%

SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation

SyncBreaker:面向音频驱动生成的多模态对抗攻击框架

Wenli Zhang, Xianglong Shi, Sirui Zhao, Xinqi Chen, Guo Cheng, Yifan Xu, Tong Xu, Yong Liao

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Technology(北京工业大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对音频驱动生成中单模态防护不足的问题,提出SyncBreaker框架,通过多模态联合扰动提升防护效果,有效抑制唇同步和面部动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26355 2026-07-30 cs.CL 新提交 79%

Symphony of Bias: Exploring Gender Associations with Musical Instruments in Multimodal LLMs

偏见交响曲:探索多模态大语言模型(LLMs)与乐器的性别关联

Farhan Farsi, Shayan Bali, Mohammad Heydari Rad, Negar Heidary, Donya Rooein

机构 * Amirkabir University of Technology(阿米尔卡比尔理工大学) King’s College London(伦敦国王学院) University of Tehran(德黑兰大学) Bocconi University(博科尼大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究推出多模态数据集Symphony-Bias,评估多模态模型在乐器性别关联上的偏见,发现多数结果符合社会研究,契合度随文本、视觉、音频依次减弱。

Comments 32 pages, 23 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25903 2026-07-29 eess.AS 新提交 79%

CARE: A Multimodal Corpus for Studying Speech and Non-Verbal Communication Across Multiple Medical Conditions

CARE:一个用于研究多种医疗状况下言语和非言语交流的多模态语料库

David Gimeno-Gómez, Catarina Botelho, Carlos-D. Martínez-Hinarejos, Isabel Trancoso, Alberto Abad

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 针对多模态语音分析领域因现有数据集存在局限而发展受限的问题,引入CARE v1.0多模态英语数据集,涵盖多种医疗状况,提供丰富描述符和元数据,支持多种应用,推动该领域研究发展。

Comments Under review in npj Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19636 2026-07-23 eess.AS 新提交 79%

Multimodal Speaker Verification as a Threat to Speaker Anonymization

多模态说话人验证对说话人匿名化的威胁

Ashi Garg, Cristina Aggazzotti, Leibny Paola García-Perera, Nicholas Andrews

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 研究多话语、多模态环境下的说话人验证,通过对多个匿名话语的音频、韵律和语言信息进行聚合,比较不同聚合策略,发现多模态系统性能更优,帧级聚合EER最低,即便少量匿名话语结合音频和文本也能显著降低EER。

详情

展开后加载摘要…

URL PDF HTML 收藏