NaturalProver: Grounded Mathematical Proof Generation with Language Models
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI
Comments NeurIPS 2022
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI
Comments NeurIPS 2022
专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG
Comments accepted for International Workshop on Active Inference IWAI 2022, ECML PKDD workshop
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG
Comments 6 pages
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG
Journal ref Interservice/Industry Training, Simulation, and Education Conference (I/ITSEC) 2018
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG
Journal ref 2020 Interservice/Industry Training, Simulation, and Education Conference (I/ITSEC)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI
Comments IJCAI 2020
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI
Comments In Proceedings ICLP 2019, arXiv:1909.07646
Journal ref EPTCS 306, 2019, pp. 389-395
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG
六头 llama:通过 LoRA 调整的语言模型进行比较宗教伦理研究
机构 * Meta
专题命中 代码与定理证明 :reasoning(abstract,comments);分类 cs.AI
AI总结 本文通过 LoRA 调整的语言模型比较不同宗教文本对伦理推理的影响,发现调整模型在伦理推理上与基础模型有系统性差异,并在不同温度设置下表现出稳定性与多样性。
Comments 51 pages, 14 figures. We present Six Llamas, a comparative study examining whether Llama-3.1-8B models fine-tuned on distinct religious corpora encode systematically different patterns of ethical reasoning. Five LoRA-adapted variants are constructed for Christianity, Islam, Judaism, Hinduism, and Buddhism. For theoretical background on the condensate comparative method, see arXiv:2603.07329
机构 * Université Côte d’Azur(法国滨海大学) ; Inria(法国国家信息与自动化技术研究所) ; CNRS(法国国家科学研究中心) ; I3S(国际科学计算研究所) ; Sophia Antipolis, France(法国索菲亚大学) ; Data ScienceTech Institute (DSTI)(数据科学技术研究所)
专题命中 代码与定理证明 :reasoning(abstract,comments);分类 cs.AI
Comments accepted for the International Joint Conference on Rules and Reasoning (RuleML+RR) 2025
实验室驱动的对齐签名的出现:一种心理测量框架,用于审计生成AI中的潜在偏见和叠加风险
机构 * AI Researcher(人工智能研究员)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL
AI总结 本文提出了一种心理测量框架,用于审计生成AI中的潜在偏见和叠加风险,通过分析九个领先模型的实验室信号,揭示了持续行为聚类的成因。
Comments v2: expanded from 9 to 18 behavioral dimensions and from 4 to 6 developer organizations; revised statistical methodology (rank-based inference with effect-size criterion, replacing variance-decomposition approach); model-level results now reported; references corrected throughout
结合领域专家心智模型的大语言模型增强:通过因果提示工程减少大语言模型幻觉
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文提出结合专家心智模型(EMM)的因果提示工程框架,通过形式化相关前置流程构建EMM,减少LLM幻觉,在三类任务中验证了方法有效性。
Comments 42 pages,4 figures, 4 tables
迈向无风险的AI智能体部署
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 针对LLM智能体部署的安全、合规等风险,本文提出以智能体轨迹为基础,将测试与调试作为系统性研究方向,提炼部署就绪检查表并指出需解决的开放性问题,推动可信智能体部署。
证明是否以其应有的方式被证明?《几何原本》元素证明的忠实形式化
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出满足五项必要条件的Pistis智能体式证明搜索方法,通过OrderDecompose分治搜索生成欧几里得《几何原本》前三卷的忠实形式化Lean证明,其性能优于基线方法,可作为证明检查工具。
Comments Preprint. 18 pages, 14 figures, 7 tables
面向安全的大语言模型智能体:规范、验证与执行的综述
机构 * The University of Manchester(曼彻斯特大学) ; The University of Greenwich(格林威治大学) ; Technology Innovation Institute(技术创新研究院)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 该综述针对LLM智能体缺乏形式化任务级安全保障的问题,通过系统分析38项研究,揭示规范瓶颈等四项关键发现,提出三级分类体系与十大问题研究议程,为可信智能体AI研究提供方向。
Comments 28 pages
Mechanic:基于遗憾的正式分解工作流用于自动定理证明
机构 * Academy of Mathematics and Systems Science, CAS(数学与系统科学研究院,中国科学院) ; School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,中国科学院大学) ; School of Mathematical Science, UCAS(数学科学学院,中国科学院大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL
AI总结 Mechanic通过基于遗憾的正式分解策略提升自动定理证明效率,有效解决传统方法在处理失败尝试时的效率与上下文过长问题。
Comments Published as a conference paper at COLM 2026
视觉语言模型(VLMs)无法规划,但它们能进行形式化吗?
机构 * Drexel University(德雷塞尔大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 代码与定理证明 :planning(abstract);分类 cs.CL
AI总结 本研究提出5种VLM作为形式化器的流水线,评估后发现其表现优于端到端规划生成,较弱VLMs的瓶颈为物体关系视觉grounding,较强模型已克服该限制。
人类-人工智能替代原则:在你的组织中,你何时会被人工智能取代?
专题命中 代码与定理证明 :planning(abstract);分类 cs.AI
AI总结 研究人类员工何时被人工智能取代,提出HAT分析模型,编码人类技能与人工智能能力的经济不对称,推导多因素对人机替代的影响,得出替代原则,揭示其引发的组织变化及中层管理与高技能工人的脆弱性,统一相关理论。
结构理论中的确定化:基于闭包、可比性与联合可容许性的统一框架
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出了基于闭包、可比性与联合可容许性的统一框架,用于从多结构理论构造典范解释,区分非确定性类型并给出对应确定化机制,还可应用于LLM辅助推理以分析幻觉问题。
Comments Formal framework paper on canonicalization and determinization in structure theories; version v2.16.4; 29 pages
表征初始人机交互的证明形式化工作流
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Cambridge(剑桥大学) ; Princeton University(普林斯顿大学) ; University of Oxford(牛津大学) ; Caltech(加州理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; Universitat Politècnica de València(瓦伦西亚理工大学) ; New York University(纽约大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 通过混合方法分析,研究人们在形式化证明过程中对AI工具的需求、障碍及实际使用模式,发现AI辅助能提高形式化准确率且用户偏好多样但普遍希望保持人类对证明发现过程的高层控制。
Comments Updated working paper
Goedel-Code-Prover:面向开放状态的最新代码验证的分层证明搜索
机构 * ETH Zürich(苏黎世联邦理工学院) ; Princeton Language and Intelligence(普林斯顿语言与智能实验室) ; Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) ; MiroMind
专题命中 代码与定理证明 :planning(abstract);分类 cs.AI
AI总结 本文提出Goedel-Code-Prover框架,通过分层证明搜索提升Lean4中代码验证的自动化水平,实现62%的成功率,优于现有基线方法。
Comments Published as a COLM paper
面向AI原生大规模敏捷软件开发中的保证闭合
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 针对AI原生大规模敏捷软件开发中保证推理机器可操作的缺口,提出基于共享语义保证层的高层架构及六项对应能力,以实现保证闭合。
NiyamAI——一种使用零知识证明实现密码学可验证护栏的意图绑定AI智能体
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 Niyam-AI是一种基于零知识证明的意图绑定AI智能体框架,通过SHA-256承诺意图合约、Judge模型验证和zk-SNARK确保证明,在Agent-SafetyBench评估中较多款基线护栏实现显著安全性能提升。
截图还是工具?在混合GUI-MCP计算机使用智能体中引出工具使用并管理多模态上下文
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对混合GUI-MCP计算机使用智能体,发现工具使用存在采用缺口,通过调整工具奖励与上下文压缩优化,提升了智能体性能并降低输入成本。
超越图书馆:用于自动形式化研究数学的智能体框架
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 提出一种基于通用编码大语言模型的智能体自动形式化框架,通过多智能体管道和辅助引理技术,成功形式化了PutnamBench和STOC论文中的主要定理,其中两个证明无需额外公理。
Comments preprint
通过最小信息披露实现隐私保护的AI验证
专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI
AI总结 该研究提出最小信息披露(MID)方法,通过条件互信息衡量AI验证中的附带泄露,在多项验证任务中实现完美验证且零附带泄露,并支持基于Groth16 zk-SNARK的ZKP认证发布。
MechGeo:在Lean 4中自动形式化与证明欧几里得几何
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 MechGeo是基于Mathlib的智能体框架,可在Lean 4中自动形式化欧几里得几何问题并构造认证证明,在43道IMO几何题及Lean-IMO-Bbench上取得显著成果,为可信形式几何提供实用基础。
Comments 43 pages
判断并非枚举:大语言模型生成的可接受集合中的隐性遗漏
机构 * University of Macau(澳门大学) ; South China University of Technology(华南理工大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 该研究发现大语言模型作为评估者时,生成可接受集合的表现远差于判断表现,核心问题是隐性遗漏,通过重写错误预期值可大幅提升修复后的套件产量。
Comments 53 pages, 14 figures, 26 tables