arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2537 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2537 篇

2512.17730 2025-12-22 cs.CV 70%

AdaptPrompt: Parameter-Efficient Adaptation of VLMs for Generalizable Deepfake Detection

AdaptPrompt: 为通用深度伪造检测高效调整视觉语言模型参数

Yichen Jiang, Mohammed Talha Alam, Sohail Ahmed Khan, Duc-Tien Dang-Nguyen, Fakhri Karray

机构 * University of Waterloo(滑铁卢大学) University of Bergen(卑尔根大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 AdaptPrompt通过参数高效迁移学习框架,利用CLIP模型提升深度伪造检测的泛化能力,实现跨领域和少量样本下的高准确率识别。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07884 2025-12-10 cs.LG cs.AI cs.CV 70%

GSPN-2: Efficient Parallel Sequence Modeling

GSPN-2:高效的并行序列建模

Hongjun Wang, Yitong Jiang, Collin McCarthy, David Wehr, Hanrong Ye, Xinhao Li, Ka Chun Cheung, Wonmin Byeon, Jinwei Gu, Ke Chen, Kai Han, Hongxu Yin, Pavlo Molchanov, Jan Kautz, Sifei Liu

机构 * NVIDIA The University of Hong Kong(香港大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与蒸馏 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 GSPN-2通过结构化矩阵变换和GPU优化实现,提升视觉应用中全局空间上下文建模的效率。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04039 2025-12-04 cs.CV cs.AI cs.LG 70%

Fast & Efficient Normalizing Flows and Applications of Image Generative Models

高效且快速的归一化流及图像生成模型的应用

Sandeep Nagar

机构 * International Institute of Information Technology (Deemed to be University)(国际信息技术学院(认定为大学)) IIIT Hyderabad(IIIT海得拉尔)

专题命中 效率与蒸馏 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本研究提出高效归一化流及图像生成模型的应用,包括超分辨率、农业质量评估、地质制图、隐私保护及艺术修复等

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09612 2025-11-11 cs.CV 70%

Consistent Story Generation: Unlocking the Potential of Zigzag Sampling

Mingxiao Li, Mang Ning, Marie-Francine Moens

机构 * KU Leuven(库勒芬大学) Utrecht University(乌得勒支大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 20 pages, 10 figures

Journal ref published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23588 2025-10-31 cs.CV 70%

FARMER: Flow AutoRegressive Transformer over Pixels

Guangting Zheng, Qinyu Zhao, Tao Yang, Fei Xiao, Zhijie Lin, Jie Wu, Jiajun Deng, Yanyong Zhang, Rui Zhu

机构 * University of Science and Technology of China(中国科学技术大学) Australian National University(澳大利亚国立大学) National University of Singapore(新加坡国立大学) University of Science(科学技术大学)

专题命中 效率与蒸馏 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments Bytedance Seed Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17153 2025-10-27 cs.CV cs.LG 70%

Distilled Decoding 1: One-step Sampling of Image Auto-regressive Models with Flow Matching

Enshu Liu, Xuefei Ning, Yu Wang, Zinan Lin

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02048 2025-10-22 eess.IV cs.AI cs.CV 70%

Regression is all you need for medical image translation

Sebastian Rassmann, David Kügler, Christian Ewert, Martin Reuter

机构 * German Center for Neurodegenerative Diseases (DZNE)(德国神经退行性疾病研究中心)

专题命中 效率与蒸馏 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14823 2025-10-17 cs.CV 70%

FraQAT: Quantization Aware Training with Fractional bits

Luca Morreale, Alberto Gil C. P. Ramos, Malcolm Chadwick, Mehid Noroozi, Ruchika Chavhan, Abhinav Mehrotra, Sourav Bhattacharya

机构 * Samsung AI Center Cambridge, UK(三星人工智能中心)

专题命中 效率与蒸馏 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02654 2025-10-06 cs.CV 70%

Smart-GRPO: Smartly Sampling Noise for Efficient RL of Flow-Matching Models

Benjamin Yu, Jackie Liu, Justin Cui

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13506 2025-09-18 cs.CV 70%

DEFT-VTON: Efficient Virtual Try-On with Consistent Generalised H-Transform

Xingzi Xu, Qi Li, Shuwen Qiu, Julien Han, Karim Bouyarmane

机构 * Amazon(亚马逊公司) Duke University(杜克大学) University of California, Los Angeles (UCLA)(加州大学洛杉矶分校)

专题命中 效率与蒸馏 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Published in 2025 CVPR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10140 2025-09-15 cs.CV 70%

Scalable Training for Vector-Quantized Networks with 100% Codebook Utilization

Yifan Chang, Jie Qin, Limeng Qiao, Xiaofeng Wang, Zheng Zhu, Lin Ma, Xingang Wang

机构 * CASIA(中国科学院自动化研究所) Meituan(美团) GigaAI UCAS(中国科学技术大学) Luoyang Institute for Robot and Intelligent Equipment(洛阳机器人与智能装备研究院)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16375 2025-09-03 cs.CV 70%

NuiScene: Exploring Efficient Generation of Unbounded Outdoor Scenes

Han-Hung Lee, Qinghong Han, Angel X. Chang

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 效率与蒸馏 :diffusion(abstract);inpainting(abstract);分类 cs.CV

Comments Project Page: \url{https://3dlg-hcvc.github.io/NuiScene/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05908 2025-08-22 eess.IV cs.CV cs.LG 70%

Inverse Problem Sampling in Latent Space Using Sequential Monte Carlo

Idan Achituve, Hai Victor Habi, Amir Rosenfeld, Arnon Netzer, Idit Diamant, Ethan Fetaya

机构 * Faculty of Engineering, Bar-Ilan University, Israel(工程学院,巴伊兰大学,以色列)

专题命中 效率与蒸馏 :diffusion(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05323 2025-08-08 cs.CV 70%

Textual Inversion for Efficient Adaptation of Open-Vocabulary Object Detectors Without Forgetting

Frank Ruis, Gertjan Burghouts, Hugo Kuijf

机构 * TNO(荷兰技术院) Intelligent Imaging(智能成像)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18192 2025-07-28 cs.CV 70%

TeEFusion: Blending Text Embeddings to Distill Classifier-Free Guidance

Minghao Fu, Guo-Hua Wang, Xiaohao Chen, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 效率与蒸馏 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by ICCV 2025. The code is publicly available at https://github.com/AIDC-AI/TeEFusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09596 2025-07-08 cs.CV cs.LG 70%

Efficient generative adversarial networks using linear additive-attention Transformers

Emilio Morales-Juarez, Gibran Fuentes-Pineda

机构 * Facultad de Ingeniería, Universidad Nacional Autónoma de México(墨西哥国立自治大学工程学院) Instituto de Investigaciones en Matematicas Aplicadas y en Sistemas, Universidad Nacional Autónoma de México(墨西哥国立自治大学应用数学与系统研究所)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06400 2025-06-10 eess.IV cs.CV 70%

ResPF: Residual Poisson Flow for Efficient and Physically Consistent Sparse-View CT Reconstruction

Changsheng Fang, Yongtong Liu, Bahareh Morovati, Shuo Han, Yu Shi, Li Zhou, Shuyi Fan, Hengyong Yu

机构 * Department of Electrical and Computer Engineering, University of Massachusetts Lowell(电子与计算机工程系,马萨诸塞大学洛厄尔分校)

专题命中 效率与蒸馏 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16335 2025-05-23 cs.CV cs.AI 70%

FPQVAR: Floating Point Quantization for Visual Autoregressive Model with FPGA Hardware Co-design

Renjie Wei, Songqiang Xu, Qingyu Guo, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits(集成电路学院) Beijing Advanced Innovation Center for Integrated Circuits(集成电路先进创新中心) School of Software and Microelectronics(软件与微电子学院)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12240 2025-05-07 cs.CV 70%

Cobra: Efficient Line Art COlorization with BRoAder References

Junhao Zhuang, Lingen Li, Xuan Ju, Zhaoyang Zhang, Chun Yuan, Ying Shan

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Tencent ARC Lab(腾讯ARC实验室)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Project page with code: https://zhuang2002.github.io/Cobra/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03744 2025-04-29 cs.CV cs.LG 70%

ReDistill: Residual Encoded Distillation for Peak Memory Reduction of CNNs

Fang Chen, Gourav Datta, Mujahid Al Rafi, Hyeran Jeon, Meng Tang

机构 * University of California Merced(加州大学默塞德分校) Case Western Reserve University(凯斯西储大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments 16 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18391 2025-04-28 cs.CV cs.LG 70%

Fast Autoregressive Models for Continuous Latent Generation

Tiankai Hang, Jianmin Bao, Fangyun Wei, Dong Chen

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04582 2025-04-09 cs.CV cs.AI cs.LG 70%

Your Image Generator Is Your New Private Dataset

Nicolo Resmini, Eugenio Lomurno, Cristian Sbrolli, Matteo Matteucci

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11044 2025-04-02 cs.CV 70%

PSF-4D: A Progressive Sampling Framework for View Consistent 4D Editing

Hasan Iqbal, Nazmul Karim, Umar Khalid, Azib Farooq, Zichun Zhong, Chen Chen, Jing Hua

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21758 2025-03-28 cs.CV 70%

Lumina-Image 2.0: A Unified and Efficient Image Generative Framework

Qi Qin, Le Zhuo, Yi Xin, Ruoyi Du, Zhen Li, Bin Fu, Yiting Lu, Jiakang Yuan, Xinyue Li, Dongyang Liu, Xiangyang Zhu, Manyuan Zhang, Will Beddow, Erwann Millon, Victor Perez, Wenhai Wang, Conghui He, Bo Zhang, Xiaohong Liu, Hongsheng Li, Yu Qiao, Chang Xu, Peng Gao

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Tech Report, 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21069 2025-03-28 cs.CV 70%

Efficient Multi-Instance Generation with Janus-Pro-Dirven Prompt Parsing

Fan Qi, Yu Duan, Changsheng Xu

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07920 2025-03-19 cs.CV cs.AI cs.CL 70%

Crowdsource, Crawl, or Generate? Creating SEA-VL, a Multicultural Vision-Language Dataset for Southeast Asia

Samuel Cahyawijaya, Holy Lovenia, Joel Ruben Antony Moniz, Tack Hwa Wong, Mohammad Rifqi Farhansyah, Thant Thiri Maung, Frederikus Hudi, David Anugraha, Muhammad Ravi Shulthan Habibi, Muhammad Reza Qorib, Amit Agarwal, Joseph Marvin Imperial, Hitesh Laxmichand Patel, Vicky Feliren, Bahrul Ilmi Nasution, Manuel Antonio Rufino, Genta Indra Winata, Rian Adam Rajagede, Carlos Rafael Catalan, Mohamed Fazli Imam, Priyaranjan Pattnayak, Salsabila Zahirah Pranida, Kevin Pratama, Yeshil Bangera, Adisai Na-Thalang, Patricia Nicole Monderin, Yueqi Song, Christian Simon, Lynnette Hui Xian Ng, Richardy Lobo' Sapan, Taki Hasan Rafi, Bin Wang, Supryadi, Kanyakorn Veerakanjana, Piyalitt Ittichaiwong, Matthew Theodore Roque, Karissa Vincentio, Takdanai Kreangphet, Phakphum Artkaew, Kadek Hendrawan Palgunadi, Yanzhi Yu, Rochana Prih Hastuti, William Nixon, Mithil Bangera, Adrian Xuan Wei Lim, Aye Hninn Khine, Hanif Muhammad Zhafran, Teddy Ferdinan, Audra Aurora Izzani, Ayushman Singh, Evan, Jauza Akbar Krito, Michael Anugraha, Fenal Ashokbhai Ilasariya, Haochen Li, John Amadeo Daniswara, Filbert Aurelian Tjiaranata, Eryawan Presma Yulianrifat, Can Udomcharoenchaikit, Fadil Risdian Ansori, Mahardika Krisna Ihsani, Giang Nguyen, Anab Maulana Barik, Dan John Velasco, Rifo Ahmad Genadi, Saptarshi Saha, Chengwei Wei, Isaiah Flores, Kenneth Ko Han Chen, Anjela Gail Santos, Wan Shen Lim, Kaung Si Phyo, Tim Santos, Meisyarah Dwiastuti, Jiayun Luo, Jan Christian Blaise Cruz, Ming Shan Hee, Ikhlasul Akmal Hanif, M. Alif Al Hakim, Muhammad Rizky Sya'ban, Kun Kerdthaisong, Lester James V. Miranda, Fajri Koto, Tirana Noor Fatyanosa, Alham Fikri Aji, Jostin Jerico Rosal, Jun Kevin, Robert Wijaya, Onno P. Kampman, Ruochen Zhang, Börje F. Karlsson, Peerat Limkonchotiwat

专题命中 效率与蒸馏 :image generation(abstract);generative vision(abstract);分类 cs.CV

Comments [SEA-VL Dataset] https://huggingface.co/collections/SEACrowd/sea-vl-multicultural-vl-dataset-for-southeast-asia-67cf223d0c341d4ba2b236e7 [Appendix J] https://github.com/SEACrowd/seacrowd.github.io/blob/master/docs/SEA_VL_Appendix_J.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10696 2025-03-17 cs.CV eess.IV 70%

Neighboring Autoregressive Modeling for Efficient Visual Generation

Yefei He, Yuanyu He, Shaoxuan He, Feng Chen, Hong Zhou, Kaipeng Zhang, Bohan Zhuang

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09601 2025-03-14 cs.CV 70%

RewardSDS: Aligning Score Distillation via Reward-Weighted Sampling

Itay Chachy, Guy Yariv, Sagie Benaim

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18135 2025-03-04 cs.CV 70%

ModeDreamer: Mode Guiding Score Distillation for Text-to-3D Generation using Reference Image Prompts

Uy Dieu Tran, Minh Luu, Phong Ha Nguyen, Khoi Nguyen, Binh-Son Hua

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project page: https://modedreamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06504 2025-03-03 cs.CV 70%

Preconditioned Score-based Generative Models

Hengyuan Ma, Xiatian Zhu, Jianfeng Feng, Li Zhang

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments IJCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏