arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-07 至 2026-08-07 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 4 篇

2506.18203 2026-08-07 cs.CL 版本更新 70%

Shrinking the Generation-Verification Gap with Weak Verifiers

缩小生成-验证差距的弱验证器

Jon Saad-Falcon, E. Kelly Buchanan, Mayee F. Chen, Tzu-Heng Huang, Brendan McLaughlin, Tanvir Bhathal, Shang Zhu, Ben Athiwaratkun, Frederic Sala, Scott Linderman, Azalia Mirhoseini, Christopher Ré

机构 * Stanford University(斯坦福大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Together AI

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 Weaver通过结合多个弱验证器,有效缩小生成-验证差距,提升验证性能至接近理想验证器水平。

Comments Annual Conference on Neural Information Processing Systems (NeurIPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03327 2026-08-07 cs.AI 版本更新 57%

Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents

截图还是工具?在混合GUI-MCP计算机使用智能体中引出工具使用并管理多模态上下文

Siqi Fan, Minghao Li, Xiaoqian Ma, Wenhui Tan, Xiusheng Huang, Juntong Wu, Liujie Zhang, Shuo Shang, Weihang Chen

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对混合GUI-MCP计算机使用智能体,发现工具使用存在采用缺口,通过调整工具奖励与上下文压缩优化,提升了智能体性能并降低输入成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31134 2026-08-07 cs.AI 版本更新 57%

Beyond the Library: An Agentic Framework for Autoformalizing Research Mathematics

超越图书馆:用于自动形式化研究数学的智能体框架

Arshia Soltani Moakhar, Iman Gholami, Max Springer, Mahdi JafariRaviz, MohammadTaghi Hajiaghayi

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出一种基于通用编码大语言模型的智能体自动形式化框架,通过多智能体管道和辅助引理技术,成功形式化了PutnamBench和STOC论文中的主要定理,其中两个证明无需额外公理。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06166 2026-08-07 cs.CY 新提交 50%

What out-of-the-box LLMs can(t) do in law? A Turing test in Italian exams for lawyers, judges and notaries

开箱即用的大语言模型(LLM)在法律领域能(不能)做什么?针对意大利律师、法官和公证人考试的图灵测试

Germana Bertoli, Ilaria Amelia Caggiano, Francesca Lagioia, Riccardo Rovatti, Giovanni Sartor, Emiliano Troisi

专题命中 代码与定理证明 :planning(abstract)

AI总结 本研究通过意大利律师、法官、公证人考试的盲法图灵测试,评估开箱即用的主流LLM的法律能力,发现其在部分法律任务表现接近人类但公证人考试全部失败,明确了LLM法律能力的范围与边界。

详情

展开后加载摘要…

URL PDF HTML 收藏