arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-30 至 2026-04-30 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2 篇

2510.08049 2026-04-30 cs.CL cs.AI 62%

A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models

对过程奖励模型的调查:从结果信号到大语言模型的过程监督

Congmin Zheng, Jiachen Zhu, Zhuoying Ou, Yuxiang Chen, Kangning Zhang, Rong Shan, Zeyu Zheng, Mengyue Yang, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) Carnegie Mellon University(卡内基梅隆大学) University of Bristol(布里斯托大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了过程奖励模型,探讨了如何生成过程数据、构建PRMs及在测试时扩展和强化学习中的应用,涵盖数学、代码、文本、多模态推理、机器人和智能体等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15808 2026-04-30 cs.AI 57%

Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification

推理时的验证扩展:通过测试时的评分指南验证实现自我进化深度研究代理

Yuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯人工智能实验室) Singapore Management University(新加坡管理学院) The Renmin University of China(中国人民大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出通过测试时评分指南验证实现深度研究代理的自我进化,通过迭代验证策略模型输出,提升验证能力,实验显示在GAIA和XBench-DeepSearch上准确率提升8%-11%。

Comments ACL'2026-Findings

详情

展开后加载摘要…

URL PDF HTML 收藏