Q-Learning With World Models
结合世界模型的Q学习
机构 * Stanford University(斯坦福大学) ; Peking University(北京大学)
AI总结 本研究提出QWM框架,将世界模型与标准Q学习结合,在真实环境训练中避免复合模型偏差,在Robomimic和LIBERO基准上的样本效率与性能均优于现有SOTA方法。
作者
Robotics / Machine Learning
结合世界模型的Q学习
机构 * Stanford University(斯坦福大学) ; Peking University(北京大学)
AI总结 本研究提出QWM框架,将世界模型与标准Q学习结合,在真实环境训练中避免复合模型偏差,在Robomimic和LIBERO基准上的样本效率与性能均优于现有SOTA方法。
EXPO-FT:面向视觉-语言-动作模型的样本高效强化学习微调
机构 * Stanford University(斯坦福大学)
AI总结 提出EXPO-FT系统,通过样本高效的强化学习微调预训练的VLA策略,在多种高精度操作任务中实现完美性能(30/30成功率),平均仅需19.1分钟在线机器人数据。