arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2537 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2537 篇

2604.16514 2026-07-14 cs.CV cs.LG 版本更新 79%

BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation

BARD:通过高效渐进性块合并和分阶段蒸馏桥接自回归与扩散视觉-语言模型

Baoyou Chen, Hanchen Xia, Peng Tu, Haojun Shi, Liwei Zhang, Yuxuan Yao, Weihao Yuan, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Nanjing University(南京大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 BARD通过高效渐进块合并与分阶段蒸馏将预训练自回归视觉-语言模型转换为解码高效的扩散视觉-语言模型,实现在大块规模下性能恢复与解码效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32020 2026-07-01 cs.CV 新提交 79%

Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers

跨空间蒸馏:用现代扩散教师训练一步学生模型

Anh Nguyen, Ngan Nguyen, Duc Vu, Trung Dao, Viet Nguyen, Quan Dao, Kien Nguyen, Chi Tran, Phong Nguyen, Khoi Nguyen, Cuong Pham, Dimitris Metaxas, Vishal M. Patel, Anh Tran

机构 * Qualcomm AI Research(高通AI研究院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) Rutgers University(罗格斯大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出跨空间蒸馏框架,通过轻量级潜在接口Bridge解决教师与学生模型潜在空间不匹配问题,实现异构教师蒸馏到紧凑学生模型,显著提升性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31259 2026-07-01 cs.SD cs.AI cs.MM eess.AS 新提交 79%

SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation

SwiftAudio: 用于一步式文本到音频扩散生成的数据高效纯文本蒸馏

Binh Mai, Tran Quoc Bao Le, Hung Dinh, Cong Tran

机构 * Posts and Telecommunications Institute of Technology(邮电技术学院)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.MM

AI总结 提出SwiftAudio框架,通过仅使用文本描述从预训练扩散教师模型进行无音频蒸馏,实现一步式文本到音频生成,在AudioCaps和Clotho上达到最优性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04961 2026-06-30 cs.CV 79%

SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization

SSDD:单步扩散解码器用于高效图像标记化

Théophane Vallaeys, Jakob Verbeek, Matthieu Cord

机构 * Meta Fundamental AI Research(Meta 基础人工智能研究) Sorbonne University(索邦大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SSDD,一种基于Transformer和GAN-free训练的单步扩散解码器,提升了图像标记化的效率和稳定性,实现比KL-VAE更高的重建质量和更快的采样速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27829 2026-06-29 cs.CV 新提交 79%

CSD: Content-aware Speculative Decoding for Efficient Image Generation

CSD: 内容感知的投机解码用于高效图像生成

Mingcheng Wang, Junbo Qiao, Yunchen Li, Lingfu Jiang, Wei Li, Jie Hu, Jiao Xie, Zhou Yu, Xinghao Chen, Guixu Zhang, Shaohui Lin

机构 * East China Normal University(东华大学) Huawei Foundation(华为基金会) Key Laboratory of Advanced Theory and Application in Statistics and Data Science-MOE(统计与数据科学高级理论与应用关键实验室-教育部)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 提出内容感知投机解码算法CSD,通过熵驱动的概率松弛和最优重采样策略,在保持生成质量的同时加速自回归图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09959 2026-06-26 cs.CV 版本更新 79%

Towards Consistent and Efficient Dataset Distillation via Diffusion-Driven Selection

通过扩散驱动选择实现一致且高效的数据集蒸馏

Xinhao Zhong, Shuoyang Sun, Zhaoyang Xu, Xulin Gu, Bin Chen, Min Zhang, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Pengcheng Laboratory(鹏城实验室)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出利用扩散先验进行补丁选择而非生成的新框架,通过噪声预测和损失差异识别图像中独特区域,结合类内聚类和排序实现单步蒸馏,在多种指标和设置下优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25473 2026-06-25 cs.CV cs.LG 新提交 79%

Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models

Causal-rCM:一种用于流式视频生成和交互式世界模型中自回归扩散蒸馏的统一教师强制与自我强制开放配方

Kaiwen Zheng, Guande He, Min Zhao, Jintao Zhang, Huayu Chen, Jianfei Chen, Chen-Hsuan Lin, Ming-Yu Liu, Jun Zhu, Qianli Ma

机构 * Tsinghua University(清华大学) UT Austin(德克萨斯大学奥斯汀分校) NVIDIA(英伟达)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Causal-rCM框架,将扩散蒸馏扩展到自回归视频扩散,通过教师强制(前向散度)与自我强制(反向散度)互补,实现流式视频生成和交互式世界模型,在帧级和块级设置中达到最先进性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12024 2026-06-23 cs.CV 版本更新 79%

Null-Space Diffusion Distillation Unlocks Speed, Fidelity and Realism in Lensless Imaging

零空间扩散蒸馏解锁无透镜成像的速度、保真度和真实感

Jose Reinaldo Cunha Santos A V Silva Neto, Hodaka Kawachi, Yasushi Yagi, Tomoya Nakamura

机构 * D3 Center, The University of Osaka(大阪大学D3中心) The University of Osaka(大阪大学) SANKEN, The University of Osaka(SANKEN与大阪大学) Grad. Sch. of Eng. Sci., The University of Osaka(大阪大学工科科学院)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出零空间扩散蒸馏(NSDD),通过将结构化扩散先验蒸馏为前馈网络,实现单次高质量重建,兼顾测量一致性、感知质量和推理速度。

Comments 10 pages without references, 5 figures, 5 tables (supplementary materials not included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15980 2026-06-17 cs.CV 版本更新 79%

Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization

Flash-GRPO:通过单步策略优化实现视频扩散的高效对齐

Xiaoxuan He, Siming Fu, Zeyue Xue, Weijie Wang, Ruizhe He, Yuming Li, Dacheng Yin, Shuai Dong, Haoyang Huang, Hongfa Wang, Nan Duan, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Joy Future Academy(京东探索研究院) Independent Researcher(独立研究员) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Flash-GRPO单步训练框架,通过等时分组和时间梯度校正解决计算瓶颈,在低计算预算下实现优于全轨迹训练的对齐质量和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05703 2026-06-05 cs.CV 79%

Parallel Jacobi Decoding for Fast Autoregressive Image Generation

并行雅可比解码用于快速自回归图像生成

Boya Liao, Ying Li, Siyong Jian, Huan Wang

机构 * Westlake University(西交利物浦大学)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 提出并行雅可比解码(PJD),通过二维空间域扩展草稿令牌并调整注意力掩码,实现无需训练的自回归图像生成加速,在保持生成质量的同时获得4.8倍至6.4倍加速。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00658 2026-06-02 cs.CV cs.AI 79%

Collaborative Few-Step Distillation and Low-Bit Quantization for Wan2.2 Dual-Expert Video Diffusion Models

Wan2.2双专家视频扩散模型的协同少步蒸馏与低位量化

Jinyang Du, Shenghao Jin, Ziqian Xu, Ruihao Gong, Shiqiao Gu, Yang Yong, Jinyang Guo, Xianglong Liu

机构 * IEEE ICME 2026 GCC Low-Bit-width Large Model Quantization Challenge(GCC 低精度大模型量化挑战)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 针对Wan2.2-T2V-A14B视频扩散模型,提出结合少步分布匹配蒸馏与低位量化的部署压缩流程,通过双专家去噪分支校准、敏感层保护及HiF4低位表示,在保持质量的同时降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15141 2026-06-02 cs.CV 79%

Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation

Causal Forcing++:用于实时交互式视频生成的可扩展少步自回归扩散蒸馏

Min Zhao, Hongzhou Zhu, Kaiwen Zheng, Zihan Zhou, Bokai Yan, Xinyuan Li, Xiao Yang, Chongxuan Li, Jun Zhu

机构 * Tsinghua University(清华大学) ShengShu(盛数) Renmin University of China(中国人民大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Causal Forcing++框架,通过因果一致性蒸馏(causal CD)实现帧级1-2步自回归扩散蒸馏,在降低延迟和训练成本的同时提升视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23451 2026-05-25 cs.CV 79%

Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention

高效的一步扩散修复模型:紧凑令牌压缩与线性注意力

Bingtian Qiao, Yue Shi, Yingjie Zhou, Yong Guo, Guangtao Zhai, Jiezhang Cao

机构 * Shanghai Jiao Tong University(上海交通大学) Fuzhou University(福州市大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 效率与蒸馏 :diffusion(title);image synthesis(abstract);分类 cs.CV

AI总结 针对真实图像超分辨率中计算和内存成本随分辨率增长的问题,提出SANA-SR框架,通过32倍压缩自编码器和线性注意力DiT实现高效一步修复,在保持高质量的同时显著降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21605 2026-05-25 cs.CV 79%

GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation

GenEvolve: 通过工具编排的视觉经验蒸馏实现自我进化的图像生成智能体

Sixiang Chen, Zhaohu Xing, Tian Ye, Xinyu Geng, Yunlong Lin, Jianyu Lai, Xuanhua He, Fuxiang Zhai, Jialin Gao, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Meituan(美团) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 提出GenEvolve框架,通过工具编排的视觉经验蒸馏,使图像生成智能体在多样化任务中自我进化,提升工具使用和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21484 2026-05-21 cs.CV 79%

One-Step Distillation of Discrete Diffusion Image Generators via Fixed-Point Iteration

通过固定点迭代实现离散扩散图像生成器的一步蒸馏

Chaoyang Wang, Yunhai Tong

机构 * Peking University(北京大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种名为Fixed-Point Distillation (FPD)的端到端框架,通过部分破坏学生模型的一步草稿并用单个教师步骤进行细化,构建局部修正目标。该方法将离散标记提升为连续特征,并应用多带宽漂移损失,迭代累积这些修正。通过直通估计器将连续梯度回传到学生日志it,同时可选地引入无条件对抗目标以增强感知现实。在类别和文本条件生成上的评估验证了该框架的有效性,FPD在单步推理中实现了竞争性的视觉保真度和结构对齐,缩小了与多步教师之间的差距,同时优于现有离散蒸馏基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20600 2026-05-21 cs.CV 79%

Head-Aware Key-Value Compression for Efficient Autoregressive Image Generation

面向头部的键值压缩用于高效自回归图像生成

Guotao Liang, Baoquan Zhang, Zhiyuan Wen, Yunming Ye

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出HeadKV框架,通过根据注意力头的局部性偏置分配不同的缓存预算,提高自回归图像生成的效率和内存利用率,同时设计分层令牌驱逐策略以保留长距离信息。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19726 2026-05-20 cs.CV 79%

Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention

通过块近似稀疏注意力实现扩散语言模型的高效长上下文建模

Wenhu Zhang, Yiming Wu, Huanyu Wang, Yaoyang Liu, Huanzhang Dou, Senqiao Yang, Sitong Wu, Hanbin Zhao, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种块近似稀疏注意力框架(BA-Att),通过块级预下采样操作识别信息区域,避免依赖脆弱的位置先验,从而在保持高性能的同时提升计算效率,实验表明其在注意力计算上比FlashAttention快6.95倍,并在50%稀疏度下保持接近全注意力性能。

Comments CVPR 2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18346 2026-05-19 cs.CV cs.AI 79%

Focused Forcing: Content-Aware Per-Frame KV Selection for Efficient Autoregressive Video Diffusion

聚焦强制:面向内容的每帧KV选择用于高效的自回归视频扩散

Peiliang Cai, Evelyn Zhang, Jiacheng Liu, Hao Lin, Ruiqi Zhang, Weile Mo, Yue Ma, Shikang Zheng, Jiehang Huang, Dongrui Liu, Linfeng Zhang

机构 * SJTU(上海交通大学) SDU(山东大学) HUST(华中科技大学) UTokyo(东京大学) HKUST(香港科技大学) SCUT(上海大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种无需训练的KV选择方法,通过结合注意力分数和历史帧的多样性分数,保留最相关和有区别的历史帧,从而在不牺牲质量的情况下提高自回归视频扩散的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15592 2026-05-18 cs.CV 79%

Efficient Image Synthesis with Sphere Latent Encoder

高效图像合成与球形潜在编码器

Tung Do, Thuan Hoang Nguyen, Hao Li

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·拉希德人工智能大学)

专题命中 效率与蒸馏 :image synthesis(title);image generation(abstract);分类 cs.CV

AI总结 本文提出分离的固定预训练图像编码器和球形潜在去噪模型,提高效率并独立优化重建与生成。在多个数据集上,方法在生成质量和推理速度上优于Sphere Encoder。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14333 2026-05-15 cs.CV 79%

InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation

InsightTok: 提高离散分词中文本和面部保真度以用于自回归图像生成

Yang Yue, Fangyun Wei, Tianyu He, Jinjing Zhao, Zanlin Ni, Zeyu Liu, Jiayi Guo, Lei Shi, Yue Dong, Li Chen, Ji Li, Gao Huang, Dong Chen

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 InsightTok通过局部内容感知损失提升文本和面部保真度,在不牺牲通用重建质量的情况下优于现有分词器,从而推动离散图像生成的发展。

Comments Code and checkpoints are available at https://github.com/LeapLabTHU/InsightTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13724 2026-05-14 cs.CV cs.AI 79%

AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation

AnyFlow: 任意步视频扩散模型与在线策略流图蒸馏

Yuchao Gu, Guian Fang, Yuxin Jiang, Weijia Mao, Song Han, Han Cai, Mike Zheng Shou

机构 * NVIDIA Show Lab, National University of Singapore(新加坡国立大学Show实验室) MIT(麻省理工学院)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 AnyFlow通过优化完整ODE采样轨迹,解决一致性蒸馏在任意步视频生成中的性能退化问题,实现高效在线蒸馏以减少测试时误差。

Comments Project page at https://nvlabs.github.io/AnyFlow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02883 2026-05-11 cs.CV 79%

SemanticDialect: Semantic-Aware Mixed-Format Quantization for Video Diffusion Transformers

语义感知混合格式量化:用于视频扩散变换器的混合格式量化

Wonsuk Jang, Thierry Tambe

机构 * Stanford University(斯坦福大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SemanticDialect,通过块级混合格式量化和语义感知方言分配,提升视频扩散变换器的量化效果,实验表明其在Open-Sora 2.0上接近FP16质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22379 2026-04-27 cs.CV 79%

Efficient Diffusion Distillation via Embedding Loss

通过嵌入损失高效扩散蒸馏

Jincheng Ying, Yitao Chen, Li Wenlin, Minghui Xu, Yinhao Xiao

机构 * School of Big Data and Artificial Intelligence(大数据与人工智能学院) Guangdong University of Finance and Economics(广东金融学院) School of Computer Science(计算机科学学院) Shandong University(山东大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出嵌入损失,通过特征嵌入对齐提升生成质量并加速训练,实验表明在CIFAR-10等数据集上取得SOTA结果,同时减少训练迭代次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02242 2026-04-23 cs.CV 79%

Sampling-Aware Quantization for Diffusion Models

面向采样意识的扩散模型量化

Qian Zeng, Jie Song, Yuanyu Wan, Huiqiong Wang, Mingli Song

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) Ningbo Innovation Center, Zhejiang University(浙大宁波创新中心) State Key Laboratory of Blockchain and Security, Zhejiang University(浙江大学区块链与安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出面向采样意识的量化策略,通过混合阶轨迹对齐技术提升采样精度与效率,实验表明在保持高速采样器收敛特性的同时,生成质量更优。

Comments 17 pages, 12 figures, CVPR2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19736 2026-04-22 cs.CV 79%

Generative Drifting for Conditional Medical Image Generation

生成漂移用于条件医学图像生成

Zirong Li, Siyuan Mei, Weiwen Wu, Andreas Maier, Lina Gölz, Yan Xia

机构 * Department of Orthodontics and Orofacial Orthopedics, Friedrich-Alexander-University Erlangen-Nuremberg(口腔正畸与面部骨科系,弗里德里希-艾萨克-埃尔兰-纽伦堡大学) Department Artificial Intelligence in Biomedical Engineering, Friedrich-Alexander-University Erlangen-Nuremberg(生物医学工程人工智能系,弗里德里希-艾萨克-埃尔兰-纽伦堡大学) Pattern Recognition Lab, Friedrich-Alexander-University Erlangen-Nuremberg(模式识别实验室,弗里德里希-艾萨克-埃尔兰-纽伦堡大学) Department of Biomedical Engineering, Sun-Yat-sen University(生物医学工程系,孙中山大学)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出GDM框架,通过多目标学习提升3D医学图像生成的分布合理性与患者特异性保真度,同时保持单步推理效率,在MRI到CT合成和稀疏视图CT重建中优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05934 2026-04-08 cs.CV eess.IV 79%

Leveraging Image Editing Foundation Models for Data-Efficient CT Metal Artifact Reduction

利用图像编辑基础模型实现数据高效的CT金属伪影减少

Ahmet Rasim Emirdagi, Süleyman Aslan, Mısra Yavuz, Görkay Aydemir, Yunus Bilge Kurt, Nasrin Rahimi, Burak Can Biner, M. Akın Yılmaz

机构 * Codeway AI Research(Codeway AI 研究院)

专题命中 效率与蒸馏 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出利用视觉语言扩散基础模型进行金属伪影减少,通过参数高效低秩适应技术,仅需16-128对训练样本即可实现高效伪影抑制,并证明领域适应对减少幻觉至关重要。

Comments Accepted to CVPRW 2026 Med-Reasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13592 2026-04-08 cs.LG cs.CV 79%

Image Diffusion Preview with Consistency Solver

图像扩散预览与一致性求解器

Fu-Yun Wang, Hao Zhou, Liangzhe Yuan, Sanghyun Woo, Boqing Gong, Bohyung Han, Ming-Hsuan Yang, Han Zhang, Yukun Zhu, Ting Liu, Long Zhao

机构 * Google DeepMind(谷歌DeepMind) The Chinese University of Hong Kong(香港中文大学) Seoul National University(首尔大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ConsistencySolver,通过强化学习优化的轻量高阶求解器,提升图像扩散预览的质量与一致性,减少推理步骤,提高交互效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16515 2026-04-03 cs.CV 79%

SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer

SALAD: 通过高效的线性注意微调实现高稀疏性注意

Tongcheng Fang, Hanling Zhang, Ruiqi Xie, Zhuo Han, Xin Tao, Tianchen Zhao, Pengfei Wan, Wenbo Ding, Wanli Ouyang, Xuefei Ning, Yu Wang

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SALAD,通过并行的稀疏注意与轻量线性注意分支,结合多级静态-动态缩放策略,实现高达90%的稀疏性和1.52-2.03倍的推理加速,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28460 2026-04-01 cs.CV cs.LG 79%

$R_\text{dm}$: Re-conceptualizing Distribution Matching as a Reward for Diffusion Distillation

$R_\ ext{dm}$:重新概念化分布匹配作为扩散蒸馏的奖励

Linqian Fan, Peiqin Sun, Tiancheng Wen, Shun Lu, Chengru Song

机构 * KlingAI Research(KlingAI 研究院) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出将分布匹配重新概念化为奖励以提升扩散蒸馏性能,通过引入GNDM提升优化稳定性,实现无缝奖励整合和改进采样效率,实验表明其在生成质量与保真度上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29535 2026-04-01 cs.CV cs.AI 79%

Quantization with Unified Adaptive Distillation to enable multi-LoRA based one-for-all Generative Vision Models on edge

量化与统一自适应蒸馏用于在边缘设备上实现多LoRA基于的通用生成视觉模型

Sowmya Vajrala, Aakash Parmar, Prasanna R, Sravanth Kodavanti, Manjunath Arveti, Srinivas Soumitri Miriyala, Ashok Senapati

机构 * Samsung Research Institute Bangalore, India(三星研究所班加罗尔,印度)

专题命中 效率与蒸馏 :generative vision(title);image editing(abstract);分类 cs.CV

AI总结 本文提出统一框架,通过单共享模型在边缘设备上实现多任务生成式AI推理,采用动态任务切换和QUAD量化策略,减少内存占用和延迟,保持高质量生成效果。

Comments Accepted at the Mobile AI Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏