Driving Intents Amplify Planning-Oriented Reinforcement Learning
意图驱动强化学习放大规划导向的强化学习
机构 * Li Auto(力 auto) ; Tsinghua University(清华大学) ; CUHK MMLab(香港大学MMLab)
AI总结 本文提出DIAL框架,通过两阶段方法解决连续动作策略在偏好对齐中的模式崩溃问题,通过意图引导的采样扩展分布并提升性能。
Comments Project page: https://mind-omni.github.io/