VeriGate: Verifier-Gated Step-Level Supervision for GRPO
VeriGate: 验证器门控的步骤级监督用于GRPO
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
AI总结 提出VeriGate方法,通过验证器门控的步骤级监督扩展GRPO,解决稀疏奖励和信用分配问题,在多个推理基准上显著提升准确率。
高校专区
VeriGate: 验证器门控的步骤级监督用于GRPO
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
AI总结 提出VeriGate方法,通过验证器门控的步骤级监督扩展GRPO,解决稀疏奖励和信用分配问题,在多个推理基准上显著提升准确率。
SAW-Bench:在现实世界中学习情境感知
机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Yale University(耶鲁大学) ; Stanford University(斯坦福大学) ; University of Maryland, College Park(马里兰大学学院市分校) ; Amazon(亚马逊) ; University of California, Merced(加州大学默塞德分校)
AI总结 提出SAW-Bench基准,通过自录视频和问答对评估多模态基础模型的以观察者为中心的情境感知能力,揭示人类与模型间的显著性能差距。
将LLM后训练为更好的决策智能体:一种遗憾最小化方法
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Maryland, College Park(马里兰大学哥伦比亚学院)
AI总结 提出迭代遗憾最小化微调(Iterative RMFT),通过反复蒸馏低遗憾决策轨迹来后训练LLM,提升其在在线决策任务中的表现,无需依赖已知算法或人工模板。
Comments Camera ready version of ICML 2026
超越记忆:使用短语结构评估大型语言模型中的语义泛化
机构 * Georgetown University(乔治城大学) ; University of Bath(巴斯大学) ; DEVCOM U.S. Army Research Laboratory(美国陆军研究实验室) ; University of Maryland, College Park(马里兰大学学院公园分校)
AI总结 通过构式语法构建诊断评估,测试大型语言模型在低频但人类易理解的短语结构上的语义理解与泛化能力,发现模型在句法相同但语义不同的构式上性能下降超40%。
Comments Camera Ready: AACL-IJCNLP (2025)