arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-18 至 2026-08-18 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 8 篇

2608.14961 2026-08-18 cs.ET 新提交 78%

Conditional Dynamical Systems for Image Generation

用于图像生成的条件动力系统

Lianlong Sun, Chuan Liu, Tong Geng, Michael Huang

专题命中 效率与蒸馏 :image generation(title,abstract)

AI总结 该研究开发了用于图像生成的连续动力系统,引入能量倾斜实现条件生成,在CIFAR-10上取得9.71的干净FID,为非GPU的高效生成任务提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16451 2026-08-18 hep-lat cond-mat.dis-nn nucl-th physics.comp-ph 新提交 78%

Jump-Diffusion Stochastic Quantization for Euclidean Lattice Field Theories

欧几里得格场论的跳扩散随机量化方法

Alexander Rothkopf

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 该研究提出跳扩散随机量化方法,利用跳扩散过程的非连续路径特性改善遍历性,解决二维U(1)规范理论拓扑冻结的基准问题。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27377 2026-08-18 cs.CV cs.CL cs.LG 版本更新 70%

DanceOPD: On-Policy Generative Field Distillation

DanceOPD:在策略生成场蒸馏

Wei Zhou, Xiongwei Zhu, Zelin Xu, Bo Dong, Lixue Gong, Yongyuan Liang, Meng Chu, Leigang Qu, Lingdong Kong, Wei Liu, Tat-Seng Chua

机构 * ByteDance Seed(字节跳动Seed) NUS(新加坡国立大学) UMD(马里兰大学) HKUST(香港科技大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出DanceOPD框架,通过将每个样本路由到能力场并查询低噪声学生诱导状态,用速度MSE损失训练流匹配模型,实现文本到图像、局部编辑和全局编辑的多能力组合,提升目标能力同时保持生成质量。

Comments Technical Report; 42 pages, 14 figures, 9 tables; Project Page at this https URL (https://danceopd.github.io/) GitHub Repo at this https URL (https://github.com/worldbench/DanceOPD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14783 2026-08-18 cs.CV cs.GR 新提交 62%

MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling

MegaParts:通过令牌高效自回归建模将部件感知三维物体生成扩展至300个部件

Manwen Liao, Xinyu Lian, Jian Mao, Kaixu Chen, Li Luo, Jinghao Yan, Wanshui Gan, Qiao Yu, Weitian Zhang, Chunhua Shen, Guang Chen, Bo Dai, Xudong Xu, Zhaoyang Lyu

机构 * The University of Hong Kong(香港大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Tongji University(同济大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 MegaParts提出结合结构化序列建模与令牌高效矢量量化形状令牌化器的自回归框架,将部件感知3D生成扩展至300个部件,性能优于基线模型,为大规模部件感知3D生成提供新方案。

Comments 12 pages, 6 pages appendix, 13 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16585 2026-08-18 cs.CV 新提交 57%

SQuad: Sub-Quadratic Attention Distillation for Efficient Video Generation

SQuad:用于高效视频生成的次二次注意力蒸馏

Animesh Karnewar, Denis Korzhenkov, Amirhossein Habibian, Mohsen Ghafoorian

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散Transformer自注意力的二次复杂度瓶颈,提出SQuad次二次注意力蒸馏框架,通过两阶段蒸馏适配预训练模型,在保持生成质量的同时大幅提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15522 2026-08-18 cs.CV 新提交 57%

Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention

基于同步感知跨模态稀疏注意力的高效视听生成

Shengchuan Gao, Teng Hu, Bohao Feng, Luchen Li, Wenqiang Wang, Hongqian Deng, Ran Yi

机构 * Alibaba Group(阿里巴巴集团) Alibaba Cloud Computing(阿里巴巴云计算) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02474 2026-08-18 cs.CV 版本更新 57%

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。

Comments EchoCache is honored to be accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09831 2026-08-18 eess.IV cs.CV 版本更新 57%

IMPLICITSTAINER: Resolution Agnostic Data-Efficient Virtual Staining Using Neural Implicit Functions

IMPLICITSTAINER:基于神经隐式函数的无分辨率依赖数据高效虚拟染色

Tushar Kataria, Beatrice Knudsen, Shireen Y. Elhabian

机构 * Kahlert School of Computing, University of Utah(犹他大学卡勒特计算学院) Department of Pathology, University of Utah(犹他大学病理学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出IMPLICITSTAINER,通过神经隐式深度学习模型将H&E图像转化为IHC图像,实现无分辨率依赖的高效虚拟染色,提升低数据场景下的鲁棒性与输出确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏