A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training
教师的少量步骤作用显著:智能体训练后基于策略的数据增强的成本效益
机构 * Stanford University(斯坦福大学) ; New York University(纽约大学)
AI总结 研究针对大语言模型智能体,将基于策略的数据构建视为预算分配问题,通过特定方式形式化设计空间,在多个任务中实验表明少量教师步骤在学习者诱导情境下更具成本效益。
Comments Accepted by ICML 2026 Workshop: RLxF: Reinforcement Learning from World Feedback