arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Maryland, College Park(马里兰大学帕克分校)

2026-06-01 至 2026-06-01 共收录 4
2605.30451 2026-06-01 cs.LG

VeriGate: Verifier-Gated Step-Level Supervision for GRPO

VeriGate: 验证器门控的步骤级监督用于GRPO

Aakriti Agrawal, Minghui Liu, Furong Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 提出VeriGate方法,通过验证器门控的步骤级监督扩展GRPO,解决稀疏奖励和信用分配问题,在多个推理基准上显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16682 2026-06-01 cs.CV

SAW-Bench: Learning Situated Awareness in the Real World

SAW-Bench:在现实世界中学习情境感知

Chuhan Li, Rilyn Han, Joy Hsu, Yongyuan Liang, Rajiv Dhawan, Jiajun Wu, Ming-Hsuan Yang, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Yale University(耶鲁大学) Stanford University(斯坦福大学) University of Maryland, College Park(马里兰大学学院市分校) Amazon(亚马逊) University of California, Merced(加州大学默塞德分校)

AI总结 提出SAW-Bench基准,通过自录视频和问答对评估多模态基础模型的以观察者为中心的情境感知能力,揭示人类与模型间的显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04393 2026-06-01 cs.AI

Post-Training LLMs as Better Decision-Making Agents: A Regret-Minimization Approach

将LLM后训练为更好的决策智能体:一种遗憾最小化方法

Chanwoo Park, Ziyang Chen, Asuman Ozdaglar, Kaiqing Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Maryland, College Park(马里兰大学哥伦比亚学院)

AI总结 提出迭代遗憾最小化微调(Iterative RMFT),通过反复蒸馏低遗憾决策轨迹来后训练LLM,提升其在在线决策任务中的表现,无需依赖已知算法或人工模板。

Comments Camera ready version of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04661 2026-06-01 cs.CL cs.AI

Beyond Memorization: Assessing Semantic Generalization in Large Language Models Using Phrasal Constructions

超越记忆:使用短语结构评估大型语言模型中的语义泛化

Wesley Scivetti, Melissa Torgbi, Austin Blodgett, Mollie Shichman, Taylor Hudson, Claire Bonial, Harish Tayyar Madabushi

机构 * Georgetown University(乔治城大学) University of Bath(巴斯大学) DEVCOM U.S. Army Research Laboratory(美国陆军研究实验室) University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 通过构式语法构建诊断评估,测试大型语言模型在低频但人类易理解的短语结构上的语义理解与泛化能力,发现模型在句法相同但语义不同的构式上性能下降超40%。

Comments Camera Ready: AACL-IJCNLP (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏