2607.06856 2026-07-09 cs.CV cs.LG 新提交 79% Gen4U: Unifying Video Generation and Understanding via Diffusion Gen4U:通过扩散统一视频生成与理解 Michael King, Aravindh Mahendran, Matthew Koichi Grimes, Fedor Kitashov, Adham Elarabawy, Pedro Velez, Maks Ovsjanikov, Viorica Pătrăucean 机构 * Google DeepMind(谷歌DeepMind) 纠错 专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV AI总结 研究通过互 kNN 对齐指标揭示视频扩散模型潜在空间特性,引入 Gen4U 框架,该框架能单次前向传递重新利用生成表示,实验表明冻结的大规模视频扩散模型可作视频编码器,Gen4U 统一视频生成与理解范式且保留生成能力。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2607.06631 2026-07-09 cs.CV cs.AI cs.LG 新提交 79% Dynamic-in-Few-Step: Unifying Dynamic Computation and Few-Step Distillation for Efficient Video Generation 动态少步长:统一动态计算与少步长蒸馏以实现高效视频生成 Yu Cheng, Siyue Yao, Zhongang Qi, Shanyan Guan, Wei Li, Fajie Yuan 机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; BlueImage, vivo(蓝城图像,维沃) ; Xian Jiaotong-Liverpool University(西交利物浦大学) 纠错 专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV AI总结 针对视频扩散模型计算成本高问题,提出将动态结构稀疏化融入蒸馏过程的加速框架,联合优化去噪步骤与模型稀疏性,引入相关策略和机制确保训练稳定,开发推理引擎,有效提升效率且保持生成质量。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2607.04653 2026-07-09 cs.CV 新提交 57% Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising 通过角色感知联合训练和模态解耦去噪增强视频物理一致性 Guangting Zheng, Haojing Chen, Hao Li, Jingtao Zhang, Zhen Yang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang 机构 * University of Science and Technology of China(中国科学技术大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Fudan University(复旦大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Shanghai Jiao Tong University(上海交通大学) 纠错 专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV AI总结 研究针对视频扩散模型长程物理一致性挑战,提出VPT微调框架。通过角色感知信号清晰建模不同物理角色,采用模态解耦去噪策略及损失权重衰减,引入跨步自动引导,增强物理动力学,提升物理一致性与视觉质量。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图