DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation
DenseReward:通过失败合成进行密集奖励学习以实现机器人操作
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Shanghai Jiao Tong University(上海交通大学) ; Amazon AWS AI(亚马逊AWS人工智能)
专题命中 模仿学习与强化学习 :manipulation(title,abstract);robotic(title,abstract);robot learning(abstract);分类 cs.RO
AI总结 研究针对强化学习中缺乏可靠奖励模型的问题,提出DenseReward模型,通过自动生成失败数据合成逼真轨迹,从视觉和语言预测密集奖励分数,在模拟和现实操作中表现优异,还为下游任务提供指导并发布相关资源。
Comments Website: https://dense-reward.github.io/