HoloFusion: Towards Photo-realistic 3D Generative Modeling
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR
Comments ICCV 2023 conference; project page at: https://holodiffusion.github.io/holofusion
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR
Comments ICCV 2023 conference; project page at: https://holodiffusion.github.io/holofusion
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV、cs.GR
专题命中 效率与蒸馏 :image editing(abstract);分类 cs.CV、cs.GR
Comments ACM SIGGRAPH
专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV、cs.GR
Comments https://vcai.mpi-inf.mpg.de/projects/GVP/index.html
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV、cs.GR
专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV、cs.GR
Journal ref ACM Transactions on Graphics, 20(1), January 2001
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV;diffusion(comments)
Comments Accepted by NeurIPS 2023 Workshop on Diffusion Models
专题命中 效率与蒸馏 :diffusion(abstract,comments);分类 cs.CV
Comments To be published in the 2017 Computational Diffusion MRI Workshop of MICCAI
DreOPD:用于流匹配模型的退化参考外推式在线策略蒸馏
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Zhejiang University(浙江大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV
AI总结 本研究提出用于流匹配模型的DreOPD方法,将隐式奖励外推转为闭式速度回归并引入退化参考强化对比,在单/多教师设置下,其平均性能优于OPD及多任务RL基线,多数指标超专用教师。
Comments project page: https://sleepy1231.github.io/DreOPD/
GeoFlow:基于几何对齐先验的高效驾驶视频生成
机构 * Beihang University(北京航空航天大学) ; Macquarie University(麦考瑞大学) ; Tianyi Transportation Technology Co., Ltd(天宜交通科技有限公司) ; Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 GeoFlow是一款新型驾驶视频生成框架,通过构建几何对齐先验分布替代标准高斯噪声初始化,可提升生成效率与少步生成质量,减少推理步骤。
Comments Accepted at ECCV 2026
EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存
机构 * Peking University(北京大学) ; Taiyuan University of Technology(太原理工大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。
Comments EchoCache is honored to be accepted by ACM MM 2026
DUET:用于两步视频生成的蒸馏专家的多样性-质量二重奏
机构 * Alibaba Group(阿里巴巴集团)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出DUET模型,通过噪声级专家二重奏协调两步视频生成中质量与多样性的权衡,经改进的DUET+进一步提升质量并保留多样性优势,效果显著。
MotionStrata:用于紧凑视频自编码的分层运动隐变量
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Li Auto ; Zhejiang Lab(浙江实验室) ; State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 MotionStrata将运动预算分为全局与详细运动,在不增维度下实现分层表示,压缩时重建质量优于其他方法,为紧凑视频自编码提供新设计原则。
Flash-VAED: 用于高效视频生成的即插即用VAE解码器
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 Flash-VAED通过通道剪枝和分阶段运算优化,实现了高效视频生成的高质量与高速度平衡。
Comments Accepted by ICML 2026
自监督表示引导的生成式数据集蒸馏
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出SRG框架,将SSL几何转化为扩散引导,通过分阶段引导策略实现数据集蒸馏,在多数据集和IPC设置下优于生成式基线,可跨预训练表示空间迁移。
用于高效视频生成的 Token 半径注意力机制
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 该研究针对视频扩散 Transformer 自注意力计算成本高的问题,提出 Token 半径注意力机制,在多种视频生成模型配置上实现了高效加速,同时保持了良好的生成质量。
TurboClear:基于区域校准分布匹配与融合的单步对象-效果去除方法
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出基于SDXL的单步对象-效果去除模型TurboClear,通过区域校准分布匹配与可学习空间融合,大幅降低计算开销且保持良好视觉质量,效率优于相关基线方法。
Comments Code: https://github.com/GuoCalix/TurboClear
ChordVideo:基于低能量传输的一步式、无训练、时间一致的视频编辑
专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV
AI总结 ChordVideo扩展低能量原理到视频时间,通过共享噪声等技术解决ChordEdit的视频编辑时间问题,在TGVE/DAVIS上多指标提升,步数远少于多步编辑器
基于潜在流匹配的混合域后验采样用于逆问题
机构 * College of Computer Science, Sichuan University(四川大学计算机学院)
专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV
AI总结 针对潜在流模型应用于逆问题的一阶流形盲区瓶颈,提出混合域后验采样框架,结合朗之万动力学与潜在对齐,在多类逆问题上取得新的最优性能。
Comments Accepted to ACM Multimedia 2026
万松v1.0技术报告
机构 * Alibaba Group(阿里巴巴集团)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 针对音乐生成难题,提出万松方法,它是基于扩散的模型,可直接生成高保真多语言长歌曲并输出双声道,通过步长蒸馏加快推理,为微调定制提供途径,助力下游编辑任务。
Comments Wan Team, Alibaba Group
SAM3D-Phys:迈向真实世界中的多物体交互仿真
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Pengcheng Laboratory(鹏城实验室)
专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV
AI总结 提出SAM3D-Phys框架,结合场景重建与SAM3D生成式先验,从部分观测中恢复完整可仿真物体几何,并通过物理约束优化和掩码引导外观蒸馏实现场景一致性,支持多物体同时交互仿真。
Comments 9 pages, 4 figures
两步即可:基于一致性模型的高效3D点云异常检测
机构 * R.V. College of Engineering(R.V. 工程学院) ; Technical University of Applied Sciences Würzburg-Schweinfurt(Würzburg-Schweinfurt 应用科学大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出基于一致性学习的重建异常检测方法,通过简化推理过程提升效率,实现低延迟的3D点云异常检测,适用于资源受限设备。
Comments Accepted to CVPR 2026, at the 9th Workshop on Efficient Deep Learning for Computer Vision (ECV). To be published in the IEEE/CVF CVPR 2026 Workshop Proceedings
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 3479-3487
超越背景偏差:用于数据集蒸馏的显著性驱动原型对齐
机构 * University of Toyama(富山大学) ; Hokkaido University(北海道大学) ; University of Fukui(福井大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 针对数据集蒸馏中基于扩散方法的局限性,提出显著性驱动蒸馏框架,通过两步构建类判别潜在原型,增强代表性与泛化能力,实验证明其性能优于强基线。
ReGenVC:超低位率下的端到端实时生成式视频编码
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 ReGenVC是首个结合超低位率编码与实时解码的端到端生成式视频编解码器,通过技术优化实现24 fps输出,内存占用显著降低。
Comments 12 pages, 5 figures, 5 tables
EgoGVAE:基于引导变分自编码器的自我身体网格重建
机构 * Konkuk University(建国大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 该研究针对仅用头部姿态重建全身网格的难题,提出EgoGVAE方法,通过引导变分自编码器实现一步采样,推理速度比扩散方法快50倍以上,在基准数据集上提升了重建性能。
Comments 18 pages, 6 figures, Accepted to ECCV 2026
Veritas++:面向感知增强的AIGI检测的值感知在线策略蒸馏
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉科学学院) ; Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) ; Ant Group(蚂蚁集团) ; Sangfor Technologies Inc.(深信服科技股份有限公司)
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV
AI总结 该研究针对现有AIGI检测模型的感知瓶颈,提出Veritas++框架,通过PoRL与VaOPD机制增强感知能力,提升了检测泛化性与效率。
上下文中的动作合成:通过文本到运动蒸馏实现少样本动作合成
机构 * University of Trento(特伦托大学) ; CESI LINEACT
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 KineMIC通过文本到运动蒸馏实现少样本动作合成,提升HAR识别准确率23.1%
Comments To appear in the proceedings of 28th International Conference on Pattern Recognition (ICPR 2026). For references, please cite the official proceedings version. Paper website: https://lucazzola.github.io/kinemic-page/
通过置信度引导的数据增强改进未知协变量偏移下的知识蒸馏
机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) ; University of Tübingen(图宾根大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 针对未知协变量偏移下知识蒸馏效果受限的问题,提出置信度引导的扩散数据增强策略,经实验验证可提升多数据集上的相关准确率与虚假特征得分。
MXAttention:用于MXFP4注意力的数据无关最优缩放和预归一化量化
机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 针对基于扩散的视频生成模型中注意力二次成本的瓶颈,提出MXAttention框架,通过引入通用最优缩放和预归一化量化组件,缩小了MXFP4与FP16的成像质量差距,提升了帧级相似度,且性能与强大基线竞争。
SANA-Video 2.0:具有注意力残差的混合线性注意力用于高效视频生成
机构 * NVIDIA(英伟达)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 SANA-Video 2.0是一种混合视频扩散Transformer,采用混合线性-softmax注意力和块注意力残差,在单个GPU上生成高质量视频,成本大幅降低,实现可扩展长时、高分辨率视频生成,性能与大模型竞争且速度更快。
Comments 13 pages, 9 figures, 5 tables