Conditional Dynamical Systems for Image Generation
用于图像生成的条件动力系统
专题命中 效率与蒸馏 :image generation(title,abstract)
AI总结 该研究开发了用于图像生成的连续动力系统,引入能量倾斜实现条件生成,在CIFAR-10上取得9.71的干净FID,为非GPU的高效生成任务提供了新方向。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
用于图像生成的条件动力系统
专题命中 效率与蒸馏 :image generation(title,abstract)
AI总结 该研究开发了用于图像生成的连续动力系统,引入能量倾斜实现条件生成,在CIFAR-10上取得9.71的干净FID,为非GPU的高效生成任务提供了新方向。
欧几里得格场论的跳扩散随机量化方法
专题命中 效率与蒸馏 :diffusion(title,abstract)
AI总结 该研究提出跳扩散随机量化方法,利用跳扩散过程的非连续路径特性改善遍历性,解决二维U(1)规范理论拓扑冻结的基准问题。
Comments 15 pages, 4 figures
DanceOPD:在策略生成场蒸馏
机构 * ByteDance Seed(字节跳动Seed) ; NUS(新加坡国立大学) ; UMD(马里兰大学) ; HKUST(香港科技大学)
专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 提出DanceOPD框架,通过将每个样本路由到能力场并查询低噪声学生诱导状态,用速度MSE损失训练流匹配模型,实现文本到图像、局部编辑和全局编辑的多能力组合,提升目标能力同时保持生成质量。
Comments Technical Report; 42 pages, 14 figures, 9 tables; Project Page at this https URL (https://danceopd.github.io/) GitHub Repo at this https URL (https://github.com/worldbench/DanceOPD)
MegaParts:通过令牌高效自回归建模将部件感知三维物体生成扩展至300个部件
机构 * The University of Hong Kong(香港大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Tongji University(同济大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 MegaParts提出结合结构化序列建模与令牌高效矢量量化形状令牌化器的自回归框架,将部件感知3D生成扩展至300个部件,性能优于基线模型,为大规模部件感知3D生成提供新方案。
Comments 12 pages, 6 pages appendix, 13 figures, technical report
SQuad:用于高效视频生成的次二次注意力蒸馏
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 针对视频扩散Transformer自注意力的二次复杂度瓶颈,提出SQuad次二次注意力蒸馏框架,通过两阶段蒸馏适配预训练模型,在保持生成质量的同时大幅提升效率。
基于同步感知跨模态稀疏注意力的高效视听生成
机构 * Alibaba Group(阿里巴巴集团) ; Alibaba Cloud Computing(阿里巴巴云计算) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。
EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存
机构 * Peking University(北京大学) ; Taiyuan University of Technology(太原理工大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。
Comments EchoCache is honored to be accepted by ACM MM 2026
IMPLICITSTAINER:基于神经隐式函数的无分辨率依赖数据高效虚拟染色
机构 * Kahlert School of Computing, University of Utah(犹他大学卡勒特计算学院) ; Department of Pathology, University of Utah(犹他大学病理学系)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出IMPLICITSTAINER,通过神经隐式深度学习模型将H&E图像转化为IHC图像,实现无分辨率依赖的高效虚拟染色,提升低数据场景下的鲁棒性与输出确定性。