TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning
TMRL: 差分时间步调节预训练实现高效策略微调的探索
机构 * University of Washington(华盛顿大学) ; Amazon FAR(亚马逊FAR)
专题命中 动作表示与策略 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出TMRL框架,通过结合行为克隆预训练与强化学习微调,解决预训练中动作分布狭窄的问题,提升机器人策略微调的样本效率。