2606.27608
2026-06-29
cs.CV
cs.LG
新提交
81%
Qwen-Image-2.0-RL Technical Report
Qwen-Image-2.0-RL 技术报告
Yixian Xu, Kaiyuan Gao, Yuxiang Chen, Yilei Chen, Zecheng Tang, Zihao Liu, Zikai Zhou, Deqing Li, Hao Meng, Kuan Cao, Jiahao Li, Jie Zhang, Liang Peng, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yi Wang, Yu Wu, Yujia Wu, Zekai Zhang, Zhendong Wang, Xiao Xu, Kun Yan, Chenfei Wu
专题命中
后训练与偏好优化
:RLHF(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.LG
AI总结
提出基于强化学习与在线蒸馏的后训练流程,通过复合奖励模型和GRPO框架提升扩散模型的视觉质量与指令遵循能力,在多个基准上取得显著提升。