arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2542 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2542 篇

2505.19868 2025-05-28 cs.CV 57%

Harnessing the Power of Training-Free Techniques in Text-to-2D Generation for Text-to-3D Generation via Score Distillation Sampling

Junhong Lee, Seungwook Kim, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(坡山科学技术大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19089 2025-05-27 cs.CV 57%

Plug-and-Play Context Feature Reuse for Efficient Masked Generation

Xuejie Liu, Anji Liu, Guy Van den Broeck, Yitao Liang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Computer Science Department, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学校)

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15800 2025-05-27 cs.CV 57%

Interspatial Attention for Efficient 4D Human Video Generation

Ruizhi Shao, Yinghao Xu, Yujun Shen, Ceyuan Yang, Yang Zheng, Changan Chen, Yebin Liu, Gordon Wetzstein

机构 * Tsinghua University(清华大学) Stanford University(斯坦福大学) Ant Research(蚂蚁研究) ByteDance Inc.(字节跳动公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

Comments Project page: https://dsaurus.github.io/isa4d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00965 2025-05-27 cs.CV cs.LG 57%

CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling

Xinze Wang, Chen Chen, Yinfei Yang, Hong-You Chen, Bowen Zhang, Aditya Pal, Xiangxin Zhu, Xianzhi Du

机构 * Apple(苹果公司)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15267 2025-05-23 cs.CV 57%

Contrastive Learning-Enhanced Trajectory Matching for Small-Scale Dataset Distillation

Wenmin Li, Shunsuke Sakai, Tatsuhito Hasegawa

机构 * Graduate School of Engineering, University of Fukui(福井大学工学研究科)

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10339 2025-05-23 quant-ph cs.CV cs.LG 57%

VAE-QWGAN: Addressing Mode Collapse in Quantum GANs via Autoencoding Priors

Aaron Mark Thomas, Harry Youel, Sharu Theresa Jose

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

Comments 30 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14709 2025-05-22 cs.CV cs.AI 57%

FastCar: Cache Attentive Replay for Fast Auto-Regressive Video Generation on the Edge

Xuan Shen, Weize Ma, Yufa Zhou, Enhao Tang, Yanyue Xie, Zhengang Li, Yifan Gong, Quanyi Wang, Henghui Ding, Yiwei Wang, Yanzhi Wang, Pu Zhao, Jun Lin, Jiuxiang Gu

机构 * Northeastern University(东北大学) Nanjing University(南京大学) Duke University(杜克大学) Adobe Research(Adobe研究) NUIST(南京信息工程大学) Fudan University(复旦大学) UCM(乌拉尔联邦大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

Comments Preprint Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07447 2025-05-21 cs.LG cs.AI cs.CV 57%

Unified Continuous Generative Models

Peng Sun, Yi Jiang, Tao Lin

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

Comments https://github.com/LINs-lab/UCGM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08175 2025-05-21 cs.SD cs.AI cs.LG cs.MM eess.AS 57%

Fast Text-to-Audio Generation with Adversarial Post-Training

Zachary Novack, Zach Evans, Zack Zukowski, Josiah Taylor, CJ Carr, Julian Parker, Adnan Al-Sinan, Gian Marco Iodice, Julian McAuley, Taylor Berg-Kirkpatrick, Jordi Pons

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03159 2025-05-21 cs.CV 57%

DeepMpMRI: Tensor-decomposition Regularized Learning for Fast and High-Fidelity Multi-Parametric Microstructural MR Imaging

Wenxin Fan, Jian Cheng, Qiyuan Tian, Ruoyou Wu, Juan Zou, Zan Chen, Shanshan Wang

机构 * Paul C. Lauterbur Research Center for Biomedical Imaging(Paul C. Lauterbur生物医学成像研究中心) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) Chinese Academy of Sciences(中国科学院) State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) Beihang University(北航) School of Biomedical Engineering(生物医学工程学院) Tsinghua University(清华大学) School of Physics and Electronic Science(物理与电子科学学院) Changsha University of Science and Technology(长沙理工大学) Faculty of Computer Science and Control Engineering(计算机科学与控制工程学院) Shenzhen University of Advanced Technology(深圳大学先进技术学院) Department of Information Engineering(信息工程学院) Zhejiang University of Technology(浙江工业大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13447 2025-05-20 cs.LG cs.CV 57%

Mean Flows for One-step Generative Modeling

Zhengyang Geng, Mingyang Deng, Xingjian Bai, J. Zico Kolter, Kaiming He

机构 * CMU(卡内基梅隆大学) MIT(麻省理工学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12849 2025-05-20 cs.CV 57%

Accelerate TarFlow Sampling with GS-Jacobi Iteration

Ben Liu, Zhen Qin

机构 * TapTap, Shanghai, China(TapTap(上海)) Zhejiang University, Hangzhou, China(浙江大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

Comments 17 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16112 2025-05-16 cs.NI cs.AI cs.MM 57%

PromptMobile: Efficient Promptus for Low Bandwidth Mobile Video Streaming

Liming Liu, Jiangkai Wu, Haoyang Wang, Peiheng Wang, Zongming Guo, Xinggong Zhang

机构 * Peking University(北京大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.MM

Comments 6 pages (excluding references), 10 figures, to appear in APNET 2025

Journal ref Proc. 9th Asia-Pacific Workshop on Networking (APNET), Aug 2025, Paper No. 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12514 2025-05-14 cs.RO cs.CV 57%

TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation

Junjie Wen, Yichen Zhu, Jinming Li, Minjie Zhu, Kun Wu, Zhiyuan Xu, Ning Liu, Ran Cheng, Chaomin Shen, Yaxin Peng, Feifei Feng, Jian Tang

机构 * East China Normal University(东华师范大学) Midea Group, AI Lab(美的集团人工智能实验室) Syracuse University(雪城大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Shanghai University(上海大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

Comments add more citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06198 2025-05-14 cs.CV 57%

Optimized View and Geometry Distillation from Multi-view Diffuser

Youjia Zhang, Zikai Song, Junqing Yu, Yawei Luo, Wei Yang

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

Comments IJCAI 2025. Project page: https://youjiazhang.github.io/USD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04621 2025-05-08 cs.SD cs.AI cs.LG cs.MM eess.AS 57%

Score Distillation Sampling for Audio: Source Separation, Synthesis, and Beyond

Jessie Richter-Powell, Antonio Torralba, Jonathan Lorraine

机构 * NVIDIA MIT(麻省理工学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.MM

Comments See the project website at https://research.nvidia.com/labs/toronto-ai/Audio-SDS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01888 2025-05-06 cs.CV 57%

Rethinking Score Distilling Sampling for 3D Editing and Generation

Xingyu Miao, Haoran Duan, Yang Long, Jungong Han

机构 * Xingyu Miao Haoran Duan Yang Long Jungong Han

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06685 2025-05-06 cs.CV 57%

Asymmetric Decision-Making in Online Knowledge Distillation:Unifying Consensus and Divergence

Zhaowei Chen, Borui Zhao, Yuchen Ge, Yuhao Chen, Renjie Song, Jiajun Liang

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00335 2025-05-02 cs.CV cs.AI 57%

Efficient Neural Video Representation with Temporally Coherent Modulation

Seungjun Shin, Suji Kim, Dokwan Oh

机构 * Samsung Advanced Institute of Technology(三星先进技术研究院)

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02922 2025-05-01 cs.LG cs.CV 57%

Elucidating the Preconditioning in Consistency Distillation

Kaiwen Zheng, Guande He, Jianfei Chen, Fan Bao, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, THBI Lab(计算机科学与技术系,人工智能研究所,BNRist中心,THBI实验室) Tsinghua-Bosch Joint ML Center, Tsinghua University(清华大学-博世联合机器学习中心,清华大学) Shengshu Technology(盛舒科技) Pazhou Lab (Huangpu), Guangzhou, China(黄埔实验室(广州),中国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

Comments Accepted at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17132 2025-04-29 cs.CV 57%

Latent Video Dataset Distillation

Ning Li, Antai Andy Liu, Jingran Zhang, Justin Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

Comments https://openreview.net/forum?id=i665TIHv92

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11927 2025-04-29 cs.CV 57%

FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training

Anjia Cao, Xing Wei, Zhiheng Ma

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) Shenzhen University of Advanced Technology(深圳先进技术大学) Guangdong Provincial Key Laboratory of Computility Microelectronics(广东省计算微电子重点实验室) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15513 2025-04-23 cs.CV 57%

InstaRevive: One-Step Image Enhancement via Dynamic Score Matching

Yixuan Zhu, Haolin Wang, Ao Li, Wenliang Zhao, Yansong Tang, Jingxuan Niu, Lei Chen, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14470 2025-04-22 cs.CV 57%

Turbo2K: Towards Ultra-Efficient and High-Quality 2K Video Synthesis

Jingjing Ren, Wenbo Li, Zhongdao Wang, Haoze Sun, Bangzhen Liu, Haoyu Chen, Jiaqi Xu, Aoxue Li, Shifeng Zhang, Bin Shao, Yong Guo, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Huawei Noah’s Ark Lab(华为诺亚实验室) South China University of Technology(华南理工大学) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

Comments Webpage at https://jingjingrenabc.github.io/turbo2k/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00127 2025-04-17 cs.CV cs.AI cs.CL 57%

Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads

Siqi Kou, Jiachun Jin, Zhihong Liu, Chang Liu, Ye Ma, Jian Jia, Quan Chen, Peng Jiang, Zhijie Deng

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11143 2025-04-16 cs.CV 57%

Taming Consistency Distillation for Accelerated Human Image Animation

Xiang Wang, Shiwei Zhang, Hangjie Yuan, Yujie Wei, Yingya Zhang, Changxin Gao, Yuehuan Wang, Nong Sang

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17636 2025-04-15 cs.CV 57%

HOMER: Homography-Based Efficient Multi-view 3D Object Removal

Jingcheng Ni, Weiguang Zhao, Daniel Wang, Ziyao Zeng, Chenyu You, Alex Wong, Kaizhu Huang

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05224 2025-04-08 cs.CV 57%

Reinforced Multi-teacher Knowledge Distillation for Efficient General Image Forgery Detection and Localization

Zeqin Yu, Jiangqun Ni, Jian Zhang, Haoyi Deng, Yuzhen Lin

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV

Comments Published to AAAI2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14762 2025-04-04 cs.CV cs.AI cs.LG 57%

Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction

Huiwon Jang, Sihyun Yu, Jinwoo Shin, Pieter Abbeel, Younggyo Seo

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

Comments Code is available on the project webpage: https://huiwon-jang.github.io/coordtok/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00999 2025-04-02 cs.CV cs.AI 57%

MergeVQ: A Unified Framework for Visual Generation and Representation with Disentangled Token Merging and Quantization

Siyuan Li, Luyuan Zhang, Zedong Wang, Juanxi Tian, Cheng Tan, Zicheng Liu, Chang Yu, Qingsong Xie, Haonan Lu, Haoqian Wang, Zhen Lei

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

Comments CVPR2025 (in process for more analysis and extension)

详情

展开后加载摘要…

URL PDF HTML 收藏