A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism
小语言和视觉语言模型网络智能体中GRPO的学习率门控失败:一个可控的无效结果及其机制
机构 * Monash University(莫纳什大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学) ; Pusan National University(釜山国立大学)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.AI
AI总结 研究4B到8B规模小语言和视觉语言模型网络智能体中GRPO的效果,通过控制变量实验发现其在已掌握任务上无明显提升,解释了学习率导致失败的机制,表明该耦合与模型规模相关。