SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos
SALSA-V:基于视频的捷径增强式长同步音频生成模型
机构 * ETH Zurich(苏黎世联邦理工学院)
AI总结 SALSA-V是一种多模态视频转音频生成模型,通过掩码扩散目标和捷径损失实现长音频同步高保真生成,仅需8步采样即可快速生成,性能优于现有SOTA,可用于专业音频合成任务。
高校专区
SALSA-V:基于视频的捷径增强式长同步音频生成模型
机构 * ETH Zurich(苏黎世联邦理工学院)
AI总结 SALSA-V是一种多模态视频转音频生成模型,通过掩码扩散目标和捷径损失实现长音频同步高保真生成,仅需8步采样即可快速生成,性能优于现有SOTA,可用于专业音频合成任务。