arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-05 至 2026-05-05 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 3 篇

2601.20055 2026-05-05 cs.CL cs.AI 81%

VERGE: Formal Refinement and Guidance Engine for Verifiable LLM Reasoning

VERGE:可验证LLM推理的正式细化和指导引擎

Vikash Singh, Darion Cassel, Nathaniel Weir, Nick Feng, Sam Bayless

机构 * Case Western Reserve University(凯斯西储大学) Amazon Web Services(亚马逊网络服务)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 VERGE结合LLM与SMT求解器,通过迭代细化生成验证引导答案。其通过分解LLM输出为原子声明,自动形式化为一阶逻辑,并利用自动定理证明验证逻辑一致性。引入多模型共识、语义路由和精确逻辑错误定位等创新,提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14607 2026-05-05 cs.AI 57%

GDPR Auto-Formalization with AI Agents and Human Verification

GDPR自动形式化与AI代理和人类验证

Ha Thanh Nguyen, Wachara Fungwacharakorn, Sabine Wehnert, May Myo Zin, Yuntao Kong, Jieying Xue, Michał Araszkiewicz, Randy Goebel, Ken Satoh

机构 * Center for Juris-Informatics, ROIS-DS(法律信息中心,ROIS-DS) Ruhr-University Bochum, RC-Trust(波恩鲁尔大学,RC-Trust) Alberta Machine Intelligence Institute, University of Alberta(阿尔伯塔机器智能研究所,阿尔伯塔大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文研究利用大语言模型在人类在环验证框架下实现GDPR条款自动形式化的整体过程,通过角色专业化工作流结合人类审查,构建高质量数据集并分析成功与问题案例,证明结构化验证和针对性人类监督对可靠法律形式化至关重要。

Comments Accepted at ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13209 2026-05-05 math.HO 50%

AI for Mathematics: Progress, Challenges, and Prospects

人工智能与数学:进展、挑战与前景

Haocheng Ju, Bin Dong

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文综述了AI4Math领域,探讨其在数学研究中的应用及发展,强调数学作为严格推理的测试场,推动通用推理能力的进步。

详情

展开后加载摘要…

URL PDF HTML 收藏