TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation
TIDE: 任务隔离扩散模型用于统一视频编辑与生成
机构 * Zhejiang University(浙江大学) ; Bilibili Inc.(哔哩哔哩股份有限公司)
AI总结 提出TIDE统一框架,通过逐token任务嵌入和双路径条件机制,实现指令编辑、参考编辑和多参考生成,在多任务渐进训练下达到SOTA性能。
高校专区
TIDE: 任务隔离扩散模型用于统一视频编辑与生成
机构 * Zhejiang University(浙江大学) ; Bilibili Inc.(哔哩哔哩股份有限公司)
AI总结 提出TIDE统一框架,通过逐token任务嵌入和双路径条件机制,实现指令编辑、参考编辑和多参考生成,在多任务渐进训练下达到SOTA性能。
STRONG-VLA: 多模态扰动下视觉-语言-动作模型的解耦鲁棒性学习
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Xidian University(西安电子科技大学)
AI总结 本文提出STRONG-VLA框架,通过解耦鲁棒性学习与任务对齐优化,提升多模态扰动下的视觉-语言-动作模型鲁棒性与任务执行精度。
UniREditBench: 一个基于推理的图像编辑统一基准
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Zhejiang University(浙江大学) ; UC Berkeley(伯克利大学)
AI总结 UniREditBench通过多模态双参考评估和大规模合成数据集,提升图像编辑模型在复杂推理场景中的评估可靠性与性能表现。
Comments Project page: https://maplebb.github.io/UniREditBench
MotionStrata:用于紧凑视频自编码的分层运动隐变量
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Li Auto ; Zhejiang Lab(浙江实验室) ; State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)
AI总结 MotionStrata将运动预算分为全局与详细运动,在不增维度下实现分层表示,压缩时重建质量优于其他方法,为紧凑视频自编码提供新设计原则。