WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents
WebArbiter: 一种基于原则的推理过程奖励模型用于网络代理
机构 * LMU Munich(慕尼黑大学) ; Technical University of Munich(慕尼黑工业大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出WebArbiter,一种基于原则的推理过程奖励模型,用于网络导航任务。该模型通过文本生成产生结构化的解释,以指导任务完成。通过两阶段训练流程,提升模型的泛化能力,并在WebPRMBench基准测试中优于现有方法。
Comments Published as a conference paper at ICLR 2026. Extended version with additional experiments