Latent-Kernel Discrete Flow Maps for Few-Step Generation
用于少步生成的隐核离散流图
专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn)
AI总结 提出隐核离散流图(LKF)模型,通过共享隐变量绑定分解组件实现少步生成,在两个文本基准上较似然基线提升困惑度2.1-3.3倍,M=8时优于现有少步采样器
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
用于少步生成的隐核离散流图
专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn)
AI总结 提出隐核离散流图(LKF)模型,通过共享隐变量绑定分解组件实现少步生成,在两个文本基准上较似然基线提升困惑度2.1-3.3倍,M=8时优于现有少步采样器
BayesFP: 基于Feynman-Kac采样的流策略后验估计
机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) ; Australian Centre For Robotics, The University of Sydney(悉尼大学澳大利亚机器人中心) ; College of Connected Computing, Vanderbilt University(范德堡大学互联计算学院) ; NVIDIA(英伟达)
专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn)
AI总结 提出BayesFP框架,将预训练扩散/流匹配策略的约束轨迹生成视为贝叶斯后验采样,利用Feynman-Kac校正器实现无需重训练的推理时采样,在模拟和真实操作任务中提升零样本性能。
MegaParts:通过令牌高效自回归建模将部件感知三维物体生成扩展至300个部件
机构 * The University of Hong Kong(香港大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Tongji University(同济大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 MegaParts提出结合结构化序列建模与令牌高效矢量量化形状令牌化器的自回归框架,将部件感知3D生成扩展至300个部件,性能优于基线模型,为大规模部件感知3D生成提供新方案。
Comments 12 pages, 6 pages appendix, 13 figures, technical report
AudioX-Turbo:高效任意到音频生成的统一框架
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学) ; Noiz AI ; Independent Researcher(独立研究员)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.MM
AI总结 提出AudioX-Turbo,基于教师-学生范式的统一高效框架,通过多模态扩散Transformer和分布匹配蒸馏实现文本、视频、音频到音频的生成,仅需4步采样,NFE减少约25倍。
RoMAN-Flow:驯服自回归归一化流用于机器人操作中的离线强化学习
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 该研究针对机器人操作离线强化学习中AR-NFs采样开销大的问题,提出RoMAN-Flow框架,通过无采样的优势加权似然目标和策略蒸馏方法,在保证性能的同时大幅降低推理延迟。
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
Comments Paper under review
EfficientSync:基于变形参考纹理混合的实时唇形同步
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; South China University of Technology(华南理工大学) ; University of Rochester(罗切斯特大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 EfficientSync是一种基于变形的实时唇形同步框架,通过动态纹理混合器等技术保留参考纹理,在HDTF和VFHQ数据集上以166 FPS实现领先的视觉质量与身份保留效果。
Comments Under review
AViTS:用于高效动态分辨率生成的自适应时空令牌选择
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shandong University(山东大学) ; Terminal Intelligent Computing Division, Alibaba Cloud(阿里云终端智能计算事业部) ; Jilin University(吉林大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 该研究针对扩散变换器动态分辨率采样的冗余计算问题,提出AViTS框架,通过时空重要性感知的选择性上采样减少冗余,在FLUX等模型上实现显著加速且与其他优化技术兼容
Comments Accepted to ECCV 2026. 20 pages including appendix. Code: https://github.com/QHR69/AViTS
SQuad:用于高效视频生成的次二次注意力蒸馏
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 针对视频扩散Transformer自注意力的二次复杂度瓶颈,提出SQuad次二次注意力蒸馏框架,通过两阶段蒸馏适配预训练模型,在保持生成质量的同时大幅提升效率。
基于同步感知跨模态稀疏注意力的高效视听生成
机构 * Alibaba Group(阿里巴巴集团) ; Alibaba Cloud Computing(阿里巴巴云计算) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。
GeoFlow:基于几何对齐先验的高效驾驶视频生成
机构 * Beihang University(北京航空航天大学) ; Macquarie University(麦考瑞大学) ; Tianyi Transportation Technology Co., Ltd(天宜交通科技有限公司) ; Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 GeoFlow是一款新型驾驶视频生成框架,通过构建几何对齐先验分布替代标准高斯噪声初始化,可提升生成效率与少步生成质量,减少推理步骤。
Comments Accepted at ECCV 2026
DUET:用于两步视频生成的蒸馏专家的多样性-质量二重奏
机构 * Alibaba Group(阿里巴巴集团)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出DUET模型,通过噪声级专家二重奏协调两步视频生成中质量与多样性的权衡,经改进的DUET+进一步提升质量并保留多样性优势,效果显著。
自监督表示引导的生成式数据集蒸馏
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出SRG框架,将SSL几何转化为扩散引导,通过分阶段引导策略实现数据集蒸馏,在多数据集和IPC设置下优于生成式基线,可跨预训练表示空间迁移。
用于高效视频生成的 Token 半径注意力机制
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 该研究针对视频扩散 Transformer 自注意力计算成本高的问题,提出 Token 半径注意力机制,在多种视频生成模型配置上实现了高效加速,同时保持了良好的生成质量。
TurboClear:基于区域校准分布匹配与融合的单步对象-效果去除方法
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出基于SDXL的单步对象-效果去除模型TurboClear,通过区域校准分布匹配与可学习空间融合,大幅降低计算开销且保持良好视觉质量,效率优于相关基线方法。
Comments Code: https://github.com/GuoCalix/TurboClear
ChordVideo:基于低能量传输的一步式、无训练、时间一致的视频编辑
专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV
AI总结 ChordVideo扩展低能量原理到视频时间,通过共享噪声等技术解决ChordEdit的视频编辑时间问题,在TGVE/DAVIS上多指标提升,步数远少于多步编辑器
基于潜在流匹配的混合域后验采样用于逆问题
机构 * College of Computer Science, Sichuan University(四川大学计算机学院)
专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV
AI总结 针对潜在流模型应用于逆问题的一阶流形盲区瓶颈,提出混合域后验采样框架,结合朗之万动力学与潜在对齐,在多类逆问题上取得新的最优性能。
Comments Accepted to ACM Multimedia 2026
ReGenVC:超低位率下的端到端实时生成式视频编码
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 ReGenVC是首个结合超低位率编码与实时解码的端到端生成式视频编解码器,通过技术优化实现24 fps输出,内存占用显著降低。
Comments 12 pages, 5 figures, 5 tables
EgoGVAE:基于引导变分自编码器的自我身体网格重建
机构 * Konkuk University(建国大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 该研究针对仅用头部姿态重建全身网格的难题,提出EgoGVAE方法,通过引导变分自编码器实现一步采样,推理速度比扩散方法快50倍以上,在基准数据集上提升了重建性能。
Comments 18 pages, 6 figures, Accepted to ECCV 2026
Veritas++:面向感知增强的AIGI检测的值感知在线策略蒸馏
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉科学学院) ; Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) ; Ant Group(蚂蚁集团) ; Sangfor Technologies Inc.(深信服科技股份有限公司)
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV
AI总结 该研究针对现有AIGI检测模型的感知瓶颈,提出Veritas++框架,通过PoRL与VaOPD机制增强感知能力,提升了检测泛化性与效率。
MXAttention:用于MXFP4注意力的数据无关最优缩放和预归一化量化
机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 针对基于扩散的视频生成模型中注意力二次成本的瓶颈,提出MXAttention框架,通过引入通用最优缩放和预归一化量化组件,缩小了MXFP4与FP16的成像质量差距,提升了帧级相似度,且性能与强大基线竞争。
SANA-Video 2.0:具有注意力残差的混合线性注意力用于高效视频生成
机构 * NVIDIA(英伟达)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 SANA-Video 2.0是一种混合视频扩散Transformer,采用混合线性-softmax注意力和块注意力残差,在单个GPU上生成高质量视频,成本大幅降低,实现可扩展长时、高分辨率视频生成,性能与大模型竞争且速度更快。
Comments 13 pages, 9 figures, 5 tables
Ms. Forcing:通过多尺度分块和注意力实现高效流视频生成
机构 * Brown University(布朗大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Meta
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 研究针对流视频生成中传统方法的不足,提出Ms. Forcing范式,通过多尺度分块和注意力调整空间粒度,引入均匀噪声水平DMD减少不匹配,该方法提升了效率,在单个H200 GPU上性能显著优于Rolling Forcing。
现代视觉语言模型中用于强像素级图像篡改检测的简单域泛化
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; University College London(伦敦大学学院) ; Weizmann Institute of Science(魏茨曼科学研究所)
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV
AI总结 研究现代视觉语言模型中像素级图像篡改检测的域泛化,提出基于平衡小批量采样和后期注入策略的简单训练框架,大幅提升平均gIoU和cIoU,增强了篡改定位和分布外鲁棒性。
Comments Our code is available at https://github.com/VILA-Lab/PIXAR-DG
生成常微分方程中积分误差的空间传输
机构 * Columbia University(哥伦比亚大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 研究生成常微分方程中积分误差的空间传输问题,通过带符号的源和传输计算,利用单步截断残差和结构破坏零值等方法分析误差,还发现训练惩罚注入变化可降误差,模型可据此训练改变。
Comments 21 pages
从带草稿到无草稿:通过特权蒸馏和快速植入实现一步视频对象移除
机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) ; SGIT AI Lab, State Grid Corporation of China(国家电网公司SGIT人工智能实验室) ; Zhejiang University of Technology(浙江工业大学) ; Baidu(百度)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 研究视频对象移除问题,提出D2DF框架,通过特权蒸馏和自引导快速植入模块,将教师模型多步细化能力提炼到学生模型,实现一步视频对象移除,在质量和效率上优于传统及多步生成方法。
Comments Accepted by ECCV 2026
OPSD-V:用于训练后少步自回归视频生成器的策略内自蒸馏
机构 * Meituan(美团) ; HKUST(香港科技大学) ; City University of Hong Kong(香港城市大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 研究针对训练后少步自回归视频生成器存在的问题,提出OPSD-V策略内自蒸馏范式。通过引入真实长视频数据提供监督,学生和教师模型按特定方式运行,应用该范式于相关模型后,实验及用户研究表明其在多方面有改进且更受青睐。
Comments Project page: https://meigen-ai.github.io/OPSD-V ; Code: https://github.com/MeiGen-AI/OPSD-V
SAGA:自回归视频生成的稳定加速引导
机构 * University of Science, VNU-HCM(越南胡志明市国家大学) ; Vietnam National University(越南国家大学) ; University of Dayton(Dayton 大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 研究自回归视频生成中因重复使用潜在变量致时间误差问题,提出SAGA方法,它整合加速域频谱引导目标与初始化策略,无需训练可直接用于现有模型,能提升时间质量、减少时间不稳定性并保持视觉保真度。
动态少步长:统一动态计算与少步长蒸馏以实现高效视频生成
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; BlueImage, vivo(蓝城图像,维沃) ; Xian Jiaotong-Liverpool University(西交利物浦大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 针对视频扩散模型计算成本高问题,提出将动态结构稀疏化融入蒸馏过程的加速框架,联合优化去噪步骤与模型稀疏性,引入相关策略和机制确保训练稳定,开发推理引擎,有效提升效率且保持生成质量。
用于参数高效多镜头长视频外推的提示适配器上下文路由
机构 * Instituto de Investigación en Visión Artificial(人工视觉研究所)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 研究多镜头长视频外推问题,提出PACR-Video框架,通过冻结文本到视频扩散变换器,用低秩时间适配器及递归提示库增强,结合特定调优目标和调度,在多基准测试中优于多种基线,证明其能为长视频外推提供可控能力。
Comments 10 pages, 2 figures