HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis
HoliDubber: 通过文本引导的音频合成实现复杂声学场景的全景视频配音
专题命中 图像生成评测 :diffusion(abstract)
AI总结 提出HoliDubber框架,基于补丁自回归扩散Transformer,从单一文本提示联合生成语音和音效,实现全景视频配音,显著优于现有方法。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
HoliDubber: 通过文本引导的音频合成实现复杂声学场景的全景视频配音
专题命中 图像生成评测 :diffusion(abstract)
AI总结 提出HoliDubber框架,基于补丁自回归扩散Transformer,从单一文本提示联合生成语音和音效,实现全景视频配音,显著优于现有方法。
Shift-and-Sum 量化用于视觉自回归模型
机构 * Yonsei University(延世大学) ; Articron
专题命中 效率与蒸馏 :image generation(abstract);inpainting(abstract);分类 cs.CV
AI总结 提出针对视觉自回归模型的训练后量化框架,通过移位求和量化减少注意力值乘积误差,并采用重采样策略校准数据,在图像生成等任务上达到新最优。
Comments ICLR 2026
QPILOTS:面向流策略的高效测试时Q引导
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; LG Electronics(LG电子)
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 提出QPILOTS方法,在推理时通过投影去噪中间状态到最终动作估计并计算评论家梯度来引导流匹配和扩散策略,无需修改原策略,在离线到在线RL基准上达到90%平均成功率。
Comments 10 pages, 7 figures
SimWeaver:面向可变形操作的零样本RGB仿真到现实
机构 * Shanghai Jiao Tong University(上海交通大学) ; Horizon Robotics(地平线机器人) ; Style3D Research(Style3D研究院)
专题命中 其他图像生成 :image generation(abstract)
AI总结 提出SimWeaver框架,通过200条仿真演示训练零样本RGB VLA策略,在5种可变形任务中达到91%平均真实成功率,无需遥操作或任务校准。