arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-09 至 2026-03-09 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2505.02387 2026-03-09 cs.CL cs.AI cs.LG 85%

RM-R1: Reward Modeling as Reasoning

RM-R1: 作为推理的奖励建模

Xiusi Chen, Gaotang Li, Ziqi Wang, Bowen Jin, Cheng Qian, Yu Wang, Hongru Wang, Yu Zhang, Denghui Zhang, Tong Zhang, Hanghang Tong, Heng Ji

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校) Texas A&M University(德克萨斯A&M大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RM-R1通过将奖励建模作为推理任务,提升模型的可解释性和性能,实验证明其在多个基准测试中表现优于现有模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06333 2026-03-09 cs.AI cs.CL cs.LG 67%

SAHOO: Safeguarded Alignment for High-Order Optimization Objectives in Recursive Self-Improvement

SAHOO:递归自我改进中高阶优化目标的安全保障

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(剑桥大学) AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊网络服务) Google, USA(谷歌) Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAHOO通过三种保障措施实现递归自我改进中高阶优化目标的安全保障,显著提升代码生成和推理质量,同时保持约束和事实性。

Comments Published at ICLR 2026 Workshop on AI with Recursive Self-Improvement. 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10177 2026-03-09 cs.LG cs.AI cs.CL cs.CY 67%

Towards Autonomous Mathematics Research

迈向自主数学研究

Tony Feng, Trieu H. Trinh, Garrett Bingham, Dawsen Hwang, Yuri Chervonyi, Junehyuk Jung, Joonkyung Lee, Carlo Pagano, Sang-hyun Kim, Federico Pasqualotto, Sergei Gukov, Jonathan N. Lee, Junsu Kim, Kaiying Hou, Golnaz Ghiasi, Yi Tay, YaGuang Li, Chenkai Kuang, Yuan Liu, Hanzhao Lin, Evan Zheran Liu, Nigamaa Nayakanti, Xiaomeng Yang, Heng-Tze Cheng, Demis Hassabis, Koray Kavukcuoglu, Quoc V. Le, Thang Luong

机构 * UC Berkeley(伯克利大学) Brown University(布朗大学) Yonsei University(延世大学) Concordia University(Concordia 大学) Korea Institute for Advanced Study(韩国高级研究院) UC San Diego(圣地亚哥大学) Caltech(加州理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Aletheia是一个能够自主生成、验证和修订数学解决方案的代理,展示了AI在数学研究中的应用,包括生成研究论文和解决开放问题。

Comments 42 pages, updated with summary of FirstProof results. Accompanied blog post https://deepmind.google/blog/accelerating-mathematical-and-scientific-discovery-with-gemini-deep-think/

详情

展开后加载摘要…

URL PDF HTML 收藏