arXivDaily arXiv每日学术速递 周一至周五更新

作者

Jiawei Han

Data Mining

2026-05-14 至 2026-05-14 共收录 3
2605.12995 2026-05-14 cs.LG

F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking

F-GRPO:基于统一候选生成与排序的因子化组相对策略优化

Rohan Surana, Gagan Mundada, Junda Wu, Xintong Li, Yizhu Jiao, Bowen Jin, Sizhe Zhou, Tong Yu, Ritwik Sinha, Jiawei Han, Jingbo Shang, Julian McAuley

机构 * UC San Diego(南加州大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究院)

AI总结 本文提出F-GRPO,通过因子化组相对策略优化统一完成候选生成与排序,解决传统方法中因反馈滞后导致的优化不稳定问题,提升推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12975 2026-05-14 cs.AI

Retrieval is Cheap, Show Me the Code: Executable Multi-Hop Reasoning for Retrieval-Augmented Generation

检索成本低廉,展示代码:可执行多跳推理的检索增强生成

Jiashuo Sun, Jimeng Shi, Yixuan Xie, Saizhuo Wang, Jash Rajesh Parekh, Pengcheng Jiang, Zhiyi Shi, Jiajun Fan, Qinglong Zheng, Peiran Li, Shaowen Wang, Ge Liu, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong University of Science and Technology(香港科学与技术大学) Texas A&M University(德克萨斯农工大学)

AI总结 本文提出PyRAG框架,将多跳检索增强生成转化为程序合成与执行,通过可执行Python代码实现可调试的推理过程,提升多跳问答性能。

Comments 32 pages, 20 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11299 2026-05-14 cs.LG cs.CL cs.SE

Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling

原始生成,双重判断:从测试时扩展进行自我训练

Yizhu Jiao, Ruixiang Zhang, Richard Bai, Jiawei Han, Ronan Collobert, Yizhe Zhang

机构 * Apple(苹果公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出DuST框架,通过双重判断空间提升代码生成与判断能力,实验显示在多个模型上显著提升测试时扩展性能。

详情

展开后加载摘要…

URL PDF HTML 收藏