Diffusion Models for Joint Audio-Video Generation
用于联合音频视频生成的扩散模型
专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出联合音频视频生成方法,通过构建高质量数据集、训练MM-扩散架构、探索联合潜在扩散及提出两步文本到音频视频生成流程,提升生成质量与一致性。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
用于联合音频视频生成的扩散模型
专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出联合音频视频生成方法,通过构建高质量数据集、训练MM-扩散架构、探索联合潜在扩散及提出两步文本到音频视频生成流程,提升生成质量与一致性。
Diffusion-DRF:免费、丰富且可微的奖励用于视频扩散微调
机构 * Northeastern University(东北大学) ; Snap Inc.(Snap公司)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 本文提出Diffusion-DRF框架,通过多维问题和密集VQA解释查询生成丰富反馈,实现稳定奖励微调,无需偏好数据集。
Comments Webpage: https://snap-research.github.io/diffusion-drf/
基于物理的视频扩散用于浅水方程
专题命中 视频扩散模型 :video diffusion(title,abstract)
AI总结 本文提出一种结合物理约束的视频扩散框架,直接在生成过程中整合物理定律,实现同时预测物理状态和真实视频,提升生成视频的物理合理性和效率。
Comments 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing
WorldCam: 交互式自回归3D游戏世界与相机姿态作为统一的几何表示
机构 * Adobe Research(Adobe研究院)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出WorldCam,通过将相机姿态作为统一的几何表示,解决交互式游戏世界中动作控制与长时序3D一致性问题,结合物理连续动作空间和全局相机姿态索引提升导航与视觉质量。
Comments Project page is available at https://cvlab-kaist.github.io/WorldCam/
VideoMatGen:基于联合生成模型的PBR材质
机构 * NVIDIA
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出基于视频扩散变压器架构的方法,通过输入几何和文本描述联合生成物理合理的PBR材质,包含基础颜色、粗糙度、金属度和高度图等属性。