TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning
TMRL: 差分时间步调节预训练实现高效策略微调的探索
机构 * University of Washington(华盛顿大学) ; Amazon FAR(亚马逊FAR)
AI总结 本文提出TMRL框架,通过结合行为克隆预训练与强化学习微调,解决预训练中动作分布狭窄的问题,提升机器人策略微调的样本效率。