arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-20 至 2026-03-20 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 7 篇

2509.22925 2026-03-20 cs.CV cs.AI cs.LG 85%

Soft-Di[M]O: Improving One-Step Discrete Image Generation with Soft Embeddings

Soft-Di[M]O: 通过软嵌入提升一步离散图像生成

Yuanzhi Zhu, Xi Wang, Stéphane Lathuilière, Vicky Kalogeiton

机构 * LIX, École Polytechnique, CNRS, IPP(IX实验室,巴黎高等理工学院,法国国家科学研究中心,IPP) Inria at Univ. Grenoble Alpes, CNRS, LJK(里尔大学,法国国家科学研究中心,LJK)

专题命中 效率与蒸馏 :image generation(title);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 本文提出Soft-Di[M]O框架,通过引入软嵌入解决一步生成器中离散token阻断梯度的问题,实现端到端训练并支持GAN精炼、可微奖励微调和TTEO。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18095 2026-03-20 cs.CV cs.LG 83%

Q-Drift: Quantization-Aware Drift Correction for Diffusion Model Sampling

Q-Drift:扩散模型采样中的量化感知漂移校正

Sooyoung Ryu, Mathieu Salzmann, Saqib Javed

机构 * Department of Computer Science and Engineering, Seoul National University, Seoul, South Korea(计算机科学与工程系,首尔国立大学,韩国首尔) School of Computer and Communication Sciences, EPFL, Lausanne, Switzerland(计算机与通信科学学院,瑞士洛桑联邦理工学院) Meta Reality Labs, Redmond, USA(Meta现实实验室,美国西雅图)

专题命中 效率与蒸馏 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Q-Drift,一种在采样端校正量化噪声的方法,通过将量化误差视为隐含的随机扰动,提升扩散模型生成质量,实验显示在多种模型和方法上均有效。

Comments 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18742 2026-03-20 cs.CV 79%

6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models

6Bit-Diffusion:视频扩散模型推理时的混合精度量化

Rundong Su, Jintao Zhang, Zhihang Yuan, Haojie Duanmu, Jianfei Chen, Jun Zhu

机构 * Fudan University(复旦大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种推理时的混合精度量化框架,通过动态分配NVFP4和INT8精度,提升视频扩散模型的效率与质量,实验显示在推理速度和内存占用上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18501 2026-03-20 cs.CV cs.AI 79%

Efficient Video Diffusion with Sparse Information Transmission for Video Compression

高效视频扩散与稀疏信息传输用于视频压缩

Mingde Zhou, Zheng Chen, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Diff-SIT方法,通过稀疏时序编码模块和单步视频扩散模型提升视频压缩的感知质量和时间一致性,尤其在超低比特率下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09465 2026-03-20 cs.CV 57%

OFTSR: One-Step Flow for Image Super-Resolution with Tunable Fidelity-Realism Trade-offs

OFTSR: 一种用于图像超分辨率的一步流方法,具有可调保真度-现实感权衡

Yuanzhi Zhu, Ruiqing Wang, Shilin Lu, Junnan Li, Hanshu Yan, Kai Zhang

机构 * Nanjing University(南京大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出OFTSR,一种基于流的图像超分辨率框架,通过可调保真度与现实感权衡实现一步生成。通过训练条件流模型并应用特殊约束,使学生模型预测与教师模型采样轨迹对齐,从而提升性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18572 2026-03-20 eess.IV cs.CV 57%

UEPS: Robust and Efficient MRI Reconstruction

UEPS:鲁棒且高效的MRI重建

Xiang Zhou, Hong Shang, Zijian Zhan, Tianyu He, Jintao Meng, Dong Liang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, China(深圳先进技术研究院,中国科学院,中国) School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University, China(生物医学工程学院,深圳大学医学院,深圳大学,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology, China(计算机科学与人工智能学院,深圳先进技术大学,中国) State Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences, China(生物医学成像科学与系统国家重点实验室,中国科学院,中国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出UEPS框架,通过消除CSM依赖、渐进分辨率和稀疏注意力机制,提升MRI重建的鲁棒性和效率,在多种临床转移测试中表现优异。

Comments The document contains the main paper and additional experimental details in the supplementary material. Open-source code can be found at: https://github.com/HongShangGroup/UEPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22592 2026-03-20 cs.LG 50%

OT-MeanFlow3D: Bridging Optimal Transport and Meanflow for Efficient 3D Point Cloud Generation

OT-MeanFlow3D: 通过最优传输与Meanflow弥合,实现高效的3D点云生成

Elaheh Akbari, Shansita Sharma, Ping He, Ahmadreza Moradipari, Kyungtae Han, Hamed Pirsiavash, Yikun Bai, Soheil Kolouri

机构 * Department of Computer Science, Vanderbilt University(范德比尔特大学计算机科学系) Toyota InfoTech Labs(丰田信息技术实验室) Department of Computer Science, University of California, Davis(加州大学戴维斯分校计算机科学系) Department of Mathematics, Purdue University(普渡大学数学系)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出OT-MeanFlow3D框架,通过整合最优传输采样,提升3D点云生成与修复的效率与准确性,实验表明其在ShapeNet上优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏