LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning
LightningRL: 通过强化学习打破块状dLLMs的精度-并行性权衡
机构 * Shanghai Jiao Tong University(上海交通大学) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 本文提出LightningRL框架,通过强化学习优化预训练dLLMs的速度-质量帕累托前沿,提升并行生成性能。