JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing
JoVA:联合视频音频生成的统一多模态学习
机构 * The University of Hong Kong(香港大学) ; ByteDance(字节跳动)
AI总结 JoVA通过联合自注意力机制和嘴巴区域损失,实现了高质量的视频音频生成,提升了嘴唇同步和语音质量。
Comments ECCV 2026
高校专区
JoVA:联合视频音频生成的统一多模态学习
机构 * The University of Hong Kong(香港大学) ; ByteDance(字节跳动)
AI总结 JoVA通过联合自注意力机制和嘴巴区域损失,实现了高质量的视频音频生成,提升了嘴唇同步和语音质量。
Comments ECCV 2026
迈向白盒深度无线感知
机构 * The University of Hong Kong(香港大学) ; MIT(麻省理工学院)
AI总结 该研究针对现有深度无线感知模型为黑盒的问题,提出基于复稀疏率降维原理的全复值Transformer模型RF-CRATE,引入子空间正则化解决数据稀缺问题,在五项数据集的多类任务中验证其性能优于黑盒模型且具备可解释性。