arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2537 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2537 篇

2602.07058 2026-03-26 cs.CV cs.AI cs.LG 77%

SPARE: Self-distillation for PARameter-Efficient Removal

SPARE:用于参数高效去除的自蒸馏

Natnael Mola, Leonardo S. B. Pereira, Carolina R. Kelsch, Luis H. Arribas, Juan C. S. M. Avedillo

机构 * Universidad Autonoma de Madrid(马德里自治大学) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 SPARE提出一种两阶段方法,结合参数定位与自蒸馏,实现文本到图像扩散模型中特定概念的高效去除,通过梯度重要性分析和稀疏低秩适配器实现轻量级修改,并通过时间步采样提升效率,验证了其在UnlearnCanvas基准上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22677 2025-12-01 cs.CV 77%

Decoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the Shield

解耦DMD:CFG增强作为矛,分布匹配作为盾

Dongyang Liu, Peng Gao, David Liu, Ruoyi Du, Zhen Li, Qilong Wu, Xin Jin, Sihan Cao, Shifeng Zhang, Hongsheng Li, Steven Hoi

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出解耦DMD方法,发现CFG增强是蒸馏核心驱动因素,分布匹配作为正则化器,通过解耦噪声调度提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05891 2025-10-08 cs.CV cs.AI 77%

$\bf{D^3}$QE: Learning Discrete Distribution Discrepancy-aware Quantization Error for Autoregressive-Generated Image Detection

Yanran Zhang, Bingyao Yu, Yu Zheng, Wenzhao Zheng, Yueqi Duan, Lei Chen, Jie Zhou, Jiwen Lu

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments 10 pages, 5 figures, published to ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05610 2025-10-08 cs.CV 77%

Efficient Conditional Generation on Scale-based Visual Autoregressive Models

Jiaqi Liu, Tao Huang, Chang Xu

机构 * The University of Sydney(悉尼大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09598 2025-08-14 cs.CV 77%

Images Speak Louder Than Scores: Failure Mode Escape for Enhancing Generative Quality

Jie Shao, Ke Zhu, Minghao Fu, Guo-hua Wang, Jianxin Wu

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14603 2025-06-18 cs.CV cs.LG 77%

Align Your Flow: Scaling Continuous-Time Flow Map Distillation

Amirmojtaba Sabour, Sanja Fidler, Karsten Kreis

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project page: https://research.nvidia.com/labs/toronto-ai/AlignYourFlow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05415 2025-05-20 cs.CV cs.AI 77%

UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding

Chenkai Xu, Xu Wang, Zhenyi Liao, Yishun Li, Tianqi Hou, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为) Tongji University(同济大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14169 2025-03-04 cs.CV 77%

Autoregressive Video Generation without Vector Quantization

Haoge Deng, Ting Pan, Haiwen Diao, Zhengxiong Luo, Yufeng Cui, Huchuan Lu, Shiguang Shan, Yonggang Qi, Xinlong Wang

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ICLR 2025. Project page at https://github.com/baaivision/NOVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07701 2025-02-18 cs.CV 77%

Magic 1-For-1: Generating One Minute Video Clips within One Minute

Hongwei Yi, Shitong Shao, Tian Ye, Jiantong Zhao, Qingyu Yin, Michael Lingelbach, Li Yuan, Yonghong Tian, Enze Xie, Daquan Zhou

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Serious updates are needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20404 2024-12-31 cs.CV 77%

Open-Sora: Democratizing Efficient Video Production for All

Zangwei Zheng, Xiangyu Peng, Tianji Yang, Chenhui Shen, Shenggui Li, Hongxin Liu, Yukun Zhou, Tianyi Li, Yang You

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04929 2024-12-10 cs.CV cs.AI cs.LG stat.ML 77%

Continuous Video Process: Modeling Videos as Continuous Multi-Dimensional Processes for Video Prediction

Gaurav Shrivastava, Abhinav Shrivastava

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Navigate to the project page https://www.cs.umd.edu/~gauravsh/cvp/supp/website.html for video results. Extended version of published CVPR paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06269 2024-11-20 cs.CV 77%

FastVideoEdit: Leveraging Consistency Models for Efficient Text-to-Video Editing

Youyuan Zhang, Xuan Ju, James J. Clark

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14089 2024-10-21 cs.CV 77%

MMAD-Purify: A Precision-Optimized Framework for Efficient and Scalable Multi-Modal Attacks

Xinxin Liu, Zhongliang Guo, Siyuan Huang, Chun Pong Lau

专题命中 效率与蒸馏 :diffusion(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11027 2024-10-10 cs.CV cs.AI 77%

Reward Guided Latent Consistency Distillation

Jiachen Li, Weixi Feng, Wenhu Chen, William Yang Wang

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by TMLR. Project page: https://rg-lcd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05492 2024-08-13 cs.CV 77%

ZePo: Zero-Shot Portrait Stylization with Faster Sampling

Jin Liu, Huaibo Huang, Jie Cao, Ran He

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01819 2024-07-19 cs.CV 77%

TP2O: Creative Text Pair-to-Object Generation using Balance Swap-Sampling

Jun Li, Zedong Zhang, Jian Yang

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by ECCV2024, Project page: https://njustzandyz.github.io/tp2o/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11966 2024-07-17 cs.CV cs.AI cs.LG 77%

Efficient Training with Denoised Neural Weights

Yifan Gong, Zheng Zhan, Yanyu Li, Yerlan Idelbayev, Andrey Zharkov, Kfir Aberman, Sergey Tulyakov, Yanzhi Wang, Jian Ren

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

Comments ECCV 2024. Project Page: https://yifanfanfanfan.github.io/denoised-weights/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06127 2024-06-04 cs.CV cs.AI cs.LG 77%

E$^{2}$GAN: Efficient Training of Efficient GANs for Image-to-Image Translation

Yifan Gong, Zheng Zhan, Qing Jin, Yanyu Li, Yerlan Idelbayev, Xian Liu, Andrey Zharkov, Kfir Aberman, Sergey Tulyakov, Yanzhi Wang, Jian Ren

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

Comments ICML 2024. Project Page: https://yifanfanfanfan.github.io/e2gan/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18920 2024-03-29 cs.CR cs.AI cs.CV 77%

CPR: Retrieval Augmented Generation for Copyright Protection

Aditya Golatkar, Alessandro Achille, Luca Zancato, Yu-Xiang Wang, Ashwin Swaminathan, Stefano Soatto

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15561 2023-11-28 cs.CV 77%

ET3D: Efficient Text-to-3D Generation via Multi-View Distillation

Yiming Chen, Zhiqi Li, Peidong Liu

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04378 2023-10-09 cs.CV cs.LG 77%

Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference

Simian Luo, Yiqin Tan, Longbo Huang, Jian Li, Hang Zhao

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.14306 2023-09-06 cs.CV 77%

Foreground-Background Separation through Concept Distillation from Generative Image Foundation Models

Mischa Dombrowski, Hadrien Reynaud, Matthew Baugh, Bernhard Kainz

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments Accepted at ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09024 2026-02-10 cs.CV 76%

Autoregressive Image Generation with Masked Bit Modeling

基于掩码位建模的自回归图像生成

Qihang Yu, Qihao Liu, Ju He, Xinyang Zhang, Yang Liu, Liang-Chieh Chen, Xi Chen

机构 * Amazon FAR (Frontier AI \& Robotics)

专题命中 效率与蒸馏 :image generation(title);分类 cs.CV;diffusion(comments)

AI总结 本文提出基于掩码位建模的自回归框架,通过扩大代码本大小有效缩小离散与连续方法的性能差距,实现更高效的图像生成。

Comments SOTA discrete visual generation defeats diffusion models with 0.99 FID score, project page is available at https://bar-gen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18834 2025-11-25 cs.CV cs.AI 76%

FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories

FlowSteer: 通过真实轨迹引导少步图像合成

Lei Ke, Hubery Yin, Gongye Liu, Zhengyao Lv, Jingcai Guo, Chen Li, Wenhan Luo, Yujiu Yang, Jing Lyu

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯公司微信视觉部门) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与蒸馏 :image synthesis(title,comments);分类 cs.CV

AI总结 FlowSteer通过引导学生沿教师真实生成轨迹提升ReFlow蒸馏效果,解决分布不匹配和优化调度器问题,提升少步图像合成质量。

Comments Few-Step Image Synthesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16796 2026-02-20 cs.LG math.OC 75%

Efficient Tail-Aware Generative Optimization via Flow Model Fine-Tuning

通过流模型微调实现高效的尾部感知生成优化

Zifan Wang, Riccardo De Santi, Xiaoyu Mo, Michael M. Zavlanos, Andreas Krause, Karl H. Johansson

机构 * KTH Royal Institute of Technology(皇家理工学院) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心) Duke University(杜克大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 本文提出TFFT算法,通过CVaR的变分对偶公式实现高效的尾部行为塑造,适用于生成模型的分布性微调。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11743 2026-01-21 cs.OS cs.DC 75%

Nixie: Efficient, Transparent Temporal Multiplexing for Consumer GPUs

Nixie:面向消费级显卡的高效透明时间复用

Yechen Xu, Yifei Wang, Nathanael Ren, Yiran Chen, Danyang Zhuo

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 Nixie通过高效透明的时间复用技术提升消费级GPU的交互任务性能,减少CPU pinned内存使用,提高响应速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07894 2025-04-11 cs.LG 75%

DiverseFlow: Sample-Efficient Diverse Mode Coverage in Flows

Mashrur M. Morshed, Vishnu Boddeti

专题命中 效率与蒸馏 :image generation(abstract);inpainting(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18958 2025-03-26 cs.AI math.PR stat.ML 75%

Advancing Deep Learning through Probability Engineering: A Pragmatic Paradigm for Modern AI

Jianyi Zhang

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

Comments Ph.D. dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03181 2026-08-14 cs.RO cs.CV 版本更新 74%

SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy

多视角视频扩散策略:一种3D空间-时间感知的视频动作模型

Peiyan Li, Yixiang Chen, Yuan Xu, Jiabing Yang, Xiangnan Wu, Jun Guo, Nan Sun, Long Qian, Xinghang Li, Xin Xiao, Jing Liu, Nianfeng Liu, Tao Kong, Yan Huang, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(五时代) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Wuhan University(武汉大学) Nanjing University(南京大学)

专题命中 效率与蒸馏 :diffusion(title);分类 cs.CV

AI总结 本文提出MV-VDP,通过联合建模环境的3D空间-时间状态,解决机器人操控中对3D空间结构和时间演变理解不足的问题,实现高效、鲁棒且可解释的动作执行。

Comments Updated Version; Project Website: https://spatialvam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24403 2026-07-28 cs.CV 新提交 74%

GenSplatCodec: Feed-Forward Gaussian Splatting Compression via One-Step Diffusion

GenSplatCodec:通过一步扩散实现前馈高斯点云压缩

Qiang Hu, Zhenlong Wu, Lei Huang, Zihan Zheng, Xiaoyun Zhang, Wenjun Zhang

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学协同媒体网络创新中心)

专题命中 效率与蒸馏 :diffusion(title);分类 cs.CV

AI总结 研究针对前馈3D高斯点云压缩难题,提出GenSplatCodec统一编解码器,采用双流编码与几何引导生成解码,经三阶段优化策略,在多数据集实验中展现出优于现有方法的率失真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏