AgentV-RL: Scaling Reward Modeling with Agentic Verifier
AgentV-RL: 通过代理验证器扩展奖励建模
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Huazhong University of Science and Technology(华中科技大学) ; The University of Hong Kong(香港大学) ; ByteDance Seed(字节跳动种子) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)
专题命中 测试时计算 :verifier(title,summary_cn);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Agentic Verifier框架,通过多轮工具增强的反思过程提升奖励建模效果,实验显示其在并行和顺序TTS任务中表现优异,4B变体超越现有最优ORMs 25.2%。
Comments ACL 2026