Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories
Agentic-DPO:从专家轨迹上的模仿到智能体策略优化
机构 * Johns Hopkins University(约翰·霍普金斯大学)
专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.AI
AI总结 研究针对大语言模型智能体基于专家轨迹训练只学动作序列、难应对错误的问题,提出Agentic-DPO方法,通过转化专家轨迹为状态条件偏好监督,结合策略保持增强,实现低成本智能体策略优化,实验验证其有效性。