arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-03 至 2026-04-03 共收录 2 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2 篇

2601.16515 2026-04-03 cs.CV 79%

SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer

SALAD: 通过高效的线性注意微调实现高稀疏性注意

Tongcheng Fang, Hanling Zhang, Ruiqi Xie, Zhuo Han, Xin Tao, Tianchen Zhao, Pengfei Wan, Wenbo Ding, Wanli Ouyang, Xuefei Ning, Yu Wang

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SALAD,通过并行的稀疏注意与轻量线性注意分支,结合多级静态-动态缩放策略,实现高达90%的稀疏性和1.52-2.03倍的推理加速,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01843 2026-04-03 cs.CV cs.LG 57%

Investigating Permutation-Invariant Discrete Representation Learning for Spatially Aligned Images

研究排列不变的离散表示学习以空间对齐图像

Jamie S. J. Stirling, Noura Al-Moubayed, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文探讨了空间对齐数据的离散表示是否需要位置信息,提出PI-VQ模型,通过约束潜在代码无位置信息,实现全局语义特征捕捉和直接图像插值,同时引入匹配量化提升信息容量。

Comments 15 pages plus references; 5 figures; supplementary appended; accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏