Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders
用于社交机器人对话轮次转换的多模态语音活动投影及与语音活动相关的预训练编码器
机构 * i Intelligent Insights(4i智能洞察公司) ; Universidad de Sevilla(塞维利亚大学) ; Universidad Pablo de Olavide(巴勃罗·德奥拉维德大学) ; Honda Research Institute Japan(本田日本研究所)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI
AI总结 研究社交机器人对话轮次转换,提出多模态语音活动投影框架,基于预训练视听主干并经低秩适应,结合说话人间注意力及语义一致性损失,实验表明该方法优于基线,适用于调解型人机交互。
Comments Accepted for presentation at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). Acceptance notification date: 30 May 2026. Final published version pending