arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2537 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2537 篇

2409.05926 2024-09-11 cs.LG cs.CL 67%

SVFit: Parameter-Efficient Fine-Tuning of Large Pre-Trained Models Using Singular Values

Chengwei Sun, Jiwei Wei, Yujia Wu, Yiming Shi, Shiyuan He, Zeyu Ma, Ning Xie, Yang Yang

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10988 2024-07-30 cs.LG cs.AI 67%

Flow Score Distillation for Diverse Text-to-3D Generation

Runjie Yan, Kailu Wu, Kaisheng Ma

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract)

Comments Consistent Flow Distillation is an improved version of this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12604 2024-06-19 cs.CL cs.AI 67%

Tiny Refinements Elicit Resilience: Toward Efficient Prefix-Model Against LLM Red-Teaming

Jiaxu Liu, Xiangyu Yin, Sihao Wu, Jianhong Wang, Meng Fang, Xinping Yi, Xiaowei Huang

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract)

Comments Preprint, 10 pages main with 10 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07805 2024-05-14 cs.LG cs.AI 67%

Generative Modeling with Phase Stochastic Bridges

Tianrong Chen, Jiatao Gu, Laurent Dinh, Evangelos A. Theodorou, Joshua Susskind, Shuangfei Zhai

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03054 2024-03-22 stat.ML cs.LG math.OC math.PR 67%

Posterior Sampling Based on Gradient Flows of the MMD with Negative Distance Kernel

Paul Hagemann, Johannes Hertrich, Fabian Altekrüger, Robert Beinert, Jannis Chemseddine, Gabriele Steidl

专题命中 效率与蒸馏 :image generation(abstract);inpainting(abstract)

Comments Published as a conference paper at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03507 2023-10-06 cs.CV cs.GR cs.MM 67%

RL-based Stateful Neural Adaptive Sampling and Denoising for Real-Time Path Tracing

Antoine Scardigli, Lukas Cavigelli, Lorenz K. Müller

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV、cs.GR、cs.MM

Comments Submitted to NeurIPS. https://openreview.net/forum?id=xNyR7DXUzJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.02388 2021-01-08 cs.LG 67%

Knowledge Distillation in Iterative Generative Models for Improved Sampling Speed

Eric Luhman, Troy Luhman

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract)

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12555 2026-07-07 cs.SD cs.CV cs.MM 新提交 62%

AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

AudioX-Turbo:高效任意到音频生成的统一框架

Zeyue Tian, Lei Ke, Zhaoyang Liu, Ruibin Yuan, Liumeng Xue, Yujiu Yang, Weijia Chen, Xu Tan, Qifeng Chen, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Noiz AI Independent Researcher(独立研究员)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 提出AudioX-Turbo,基于教师-学生范式的统一高效框架,通过多模态扩散Transformer和分布匹配蒸馏实现文本、视频、音频到音频的生成,仅需4步采样,NFE减少约25倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01910 2026-06-02 cs.GR cs.CV 62%

Single-Line Drawing Generation via Semantics-Driven Optimization

基于语义驱动的单线图生成

Tanguy Magne, Alexandre Binninger, Ruben Wiersma, Olga Sorkine-Hornung

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 提出一种基于语义驱动的方法,通过文本提示或输入图像自动生成矢量格式的单线图,利用分数蒸馏采样优化均匀有理B样条曲线参数,并引入额外损失项控制艺术风格,生成结果优于现有方法且支持下游制造。

Comments 18 pages, published in Computer Graphics Forum 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23632 2026-04-28 cs.CV cs.MM cs.SD 62%

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

Hallo-Live: 实时流式联合音频-视频虚拟形象生成与异步双流及以人类为中心的偏好蒸馏

Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Baidu(百度)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Hallo-Live框架,通过异步双流扩散与人类中心偏好蒸馏实现高保真实时音频视频虚拟形象生成,达到高吞吐量与低延迟,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14580 2026-04-17 cs.CV cs.MM cs.SD 62%

TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation

TurboTalk: 一步生成音频驱动的虚拟角色的渐进蒸馏

Xiangyu Liu, Feng Gao, Xiaomei Zhang, Yong Zhang, Xiaoming Wei, Zhen Lei, Xiangyu Zhu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团) The Hong Kong Polytechnic University(香港理工大学) CAIR, HKISI, CAS(中国科学院CAS HKISI CAIR)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出TurboTalk框架,通过分布匹配蒸馏和对抗蒸馏逐步压缩多步音频驱动视频扩散模型,实现单步生成高质量虚拟角色,推理速度提升120倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29572 2026-04-01 cs.GR cs.AI cs.CV 62%

Turbo4DGen: Ultra-Fast Acceleration for 4D Generation

Turbo4DGen: 4D生成的超快加速

Yuanbin Man, Ying Huang, Zhile Ren, Miao Yin

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出Turbo4DGen框架,通过时空缓存机制和动态语义感知注意力剪枝,显著减少4D生成中的冗余计算,实现9.7倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24793 2026-03-27 cs.CV cs.MM cs.SD 62%

AVControl: Efficient Framework for Training Audio-Visual Controls

AVControl: 用于音频-视觉控制训练的高效框架

Matan Ben-Yosef, Tavi Halperin, Naomi Ken Korem, Mohammad Salama, Harel Cain, Asaf Joseph, Anthony Chen, Urska Jelercic, Ofir Bibi

机构 * Lightricks

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV、cs.MM

AI总结 AVControl通过轻量级框架实现多模态控制,无需架构改动,支持多种独立训练的模态,如深度、姿态、边缘、相机轨迹等,并在多个基准测试中表现优异。

Comments Project page: https://matanby.github.io/AVControl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19089 2026-02-24 cs.CV cs.GR cs.LG 62%

Ani3DHuman: Photorealistic 3D Human Animation with Self-guided Stochastic Sampling

Ani3DHuman:基于自引导随机采样的逼真3D人体动画

Qi Sun, Can Wang, Jiaxiang Shang, Yingchun Liu, Jing Liao

机构 * City University of Hong Kong(香港城市大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 Ani3DHuman通过结合运动学动画与视频扩散先验,利用自引导随机采样实现逼真3D人体动画生成。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00504 2026-01-05 cs.CV cs.AI cs.GR 62%

MotionPhysics: Learnable Motion Distillation for Text-Guided Simulation

MotionPhysics: 通过自然语言引导的模拟学习可学习的运动蒸馏

Miaowei Wang, Jakub Zadrożny, Oisin Mac Aodha, Amir Vaxman

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 MotionPhysics通过自然语言引导模拟,利用可学习的运动蒸馏损失实现对3D物体物理参数的自动学习,提升动态模拟的逼真度和效率。

Comments AAAI2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01061 2025-10-02 cs.GR cs.CV cs.LG 62%

ReSWD: ReSTIR'd, not shaken. Combining Reservoir Sampling and Sliced Wasserstein Distance for Variance Reduction

Mark Boss, Andreas Engelhardt, Simon Donné, Varun Jampani

机构 * Stability AI University of Tübingen(图宾根大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16054 2025-06-23 cs.CV cs.GR 62%

PAROAttention: Pattern-Aware ReOrdering for Efficient Sparse and Quantized Attention in Visual Generation Models

Tianchen Zhao, Ke Hong, Xinhao Yang, Xuefeng Xiao, Huixia Li, Feng Ling, Ruiqi Xie, Siqi Chen, Hongyu Zhu, Yichong Zhang, Yu Wang

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV、cs.GR

Comments project page: https://a-suozhang.xyz/paroattn.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05278 2025-06-09 cs.CV cs.GR 62%

Birth and Death of a Rose

Chen Geng, Yunzhi Zhang, Shangzhe Wu, Jiajun Wu

机构 * Stanford University(斯坦福大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

Comments CVPR 2025 Oral. Project website: https://chen-geng.com/rose4d

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14040 2025-03-19 cs.GR cs.CV cs.SD 62%

MAG: Multi-Modal Aligned Autoregressive Co-Speech Gesture Generation without Vector Quantization

Binjie Liu, Lina Liu, Sanyi Zhang, Songen Gu, Yihao Zhi, Tianyi Zhu, Lei Yang, Long Ye

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04824 2025-03-13 cs.GR cs.AI cs.CV 62%

ProReflow: Progressive Reflow with Decomposed Velocity

Lei Ke, Haohang Xu, Xuefei Ning, Yu Li, Jiajun Li, Haoling Li, Yuxuan Lin, Dongsheng Jiang, Yujiu Yang, Linfeng Zhang

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Our codes will be released at Github

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20343 2024-10-29 cs.CV cs.GR cs.LG 62%

Unique3D: High-Quality and Efficient 3D Mesh Generation from a Single Image

Kailu Wu, Fangfu Liu, Zhihan Cai, Runjie Yan, Hanyang Wang, Yating Hu, Yueqi Duan, Kaisheng Ma

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Project page: https://wukailu.github.io/Unique3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13251 2024-10-18 cs.GR cs.CV cs.LG 62%

FlashTex: Fast Relightable Mesh Texturing with LightControlNet

Kangle Deng, Timothy Omernick, Alexander Weiss, Deva Ramanan, Jun-Yan Zhu, Tinghui Zhou, Maneesh Agrawala

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV、cs.GR

Comments Project page: https://flashtex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05099 2024-09-20 cs.CV cs.GR 62%

DreamMapping: High-Fidelity Text-to-3D Generation via Variational Distribution Mapping

Zeyu Cai, Duotun Wang, Yixun Liang, Zhijing Shao, Ying-Cong Chen, Xiaohang Zhan, Zeyu Wang

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

Comments 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06644 2024-07-30 cs.CV cs.AI cs.GR 62%

AnyHome: Open-Vocabulary Generation of Structured and Textured 3D Homes

Rao Fu, Zehao Wen, Zichen Liu, Srinath Sridhar

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV、cs.GR

Comments accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05154 2024-05-22 cs.CV cs.GR 62%

GSEdit: Efficient Text-Guided Editing of 3D Objects via Gaussian Splatting

Francesco Palandra, Andrea Sanchietti, Daniele Baieri, Emanuele Rodolà

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09965 2024-04-24 cs.CV cs.GR 62%

ProteusNeRF: Fast Lightweight NeRF Editing using 3D-Aware Image Context

Binglun Wang, Niladri Shekhar Dutt, Niloy J. Mitra

专题命中 效率与蒸馏 :image editing(abstract);分类 cs.CV、cs.GR

Comments Accepted at I3D'24 (ACM SIGGRAPH SYMPOSIUM ON INTERACTIVE 3D GRAPHICS AND GAMES)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06663 2023-12-12 cs.CV cs.GR 62%

CAD: Photorealistic 3D Generation via Adversarial Distillation

Ziyu Wan, Despoina Paschalidou, Ian Huang, Hongyu Liu, Bokui Shen, Xiaoyu Xiang, Jing Liao, Leonidas Guibas

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Project page: http://raywzy.com/CAD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00571 2023-11-02 cs.CV cs.AI cs.CL cs.HC cs.MM 62%

LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing

Wei-Ge Chen, Irina Spiridonova, Jianwei Yang, Jianfeng Gao, Chunyuan Li

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV、cs.MM

Comments 31 pages, 22 figures, 30M PDF file size; Project Page: https://llava-vl.github.io/llava-interactive/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19415 2023-11-01 cs.CV cs.AI cs.GR 62%

Text-to-3D with Classifier Score Distillation

Xin Yu, Yuan-Chen Guo, Yangguang Li, Ding Liang, Song-Hai Zhang, Xiaojuan Qi

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Our project page is https://xinyu-andy.github.io/Classifier-Score-Distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.12152 2023-10-16 cs.CV cs.GR 62%

Efficient Halftoning via Deep Reinforcement Learning

Haitian Jiang, Dongliang Xiong, Xiaowen Jiang, Li Ding, Liang Chen, Kai Huang

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

Journal ref IEEE Transactions on Image Processing (TIP), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏