Towards Shutdownable Agents: Generalizing Stochastic Choice in RL Agents and LLMs
迈向可关闭的智能体:在强化学习智能体和大语言模型中推广随机选择
机构 * University of Oxford(牛津大学) ; University College London(伦敦大学学院) ; New College of Florida(佛罗里达新学院) ; Imperial College London(伦敦帝国学院) ; MIT(麻省理工学院)
AI总结 本文提出DReST奖励函数,通过惩罚重复选择相同长度轨迹来训练智能体在不同轨迹长度间随机选择并有效追求目标,实验表明DReST训练的智能体在未见过的场景中表现出更高的有用性和中立性。