arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-05 至 2026-06-05 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 4 篇

2606.05703 2026-06-05 cs.CV 79%

Parallel Jacobi Decoding for Fast Autoregressive Image Generation

并行雅可比解码用于快速自回归图像生成

Boya Liao, Ying Li, Siyong Jian, Huan Wang

机构 * Westlake University(西交利物浦大学)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 提出并行雅可比解码(PJD),通过二维空间域扩展草稿令牌并调整注意力掩码,实现无需训练的自回归图像生成加速,在保持生成质量的同时获得4.8倍至6.4倍加速。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06078 2026-06-05 cs.CV 57%

Knowledge Distillation for Visual Autoregressive Models

视觉自回归模型的知识蒸馏

Elia Peruzzo, Aritra Bhowmik, Guillaume Sautiere, Yuki M Asano, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究) University of Technology Nuremberg(纽伦堡技术大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 针对视觉自回归模型计算开销大的问题,提出VarKD蒸馏框架,通过选择性教师监督和减少令牌级歧义,在ImageNet上多个AR骨干网络中优于现有蒸馏方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05254 2026-06-05 cs.LG cs.CV cs.RO 57%

Flash-WAM: Modality-Aware Distillation for World Action Models

Flash-WAM:面向世界动作模型的模态感知蒸馏

Arman Akbari, Ci Zhang, Arash Akbari, Lin Zhao, Yixiao Chen, Weiwei Chen, Xuan Zhang, Geng Yuan, Yanzhi Wang

机构 * Northeastern University(东北大学) University of Georgia(佐治亚大学) EmbodyX Inc.(EmbodyX公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对世界动作模型联合生成视频和机器人动作时因多模态噪声分布不对称导致蒸馏失效的问题,提出模态感知步蒸馏框架Flash-WAM,通过为不同模态选择匹配噪声机制的参数化方法,实现单步推理并大幅加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06423 2026-06-05 cs.RO cs.AI 50%

RiskFlow: Fast and Faithful Safety-Critical Traffic Scenario Generation

RiskFlow: 快速且保真的安全关键交通场景生成

Qi Lan, Yining Tang, Yu Shen, Yi Zhou, Yuhao Wei, Jie Li, Guofa Li

机构 * National University of Singapore(新加坡国立大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出RiskFlow框架,通过动作空间中的单次前向传输替代迭代去噪,实现快速、保真的安全关键多智能体交通场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏