A Divide-Align-Conquer Strategy for Program Synthesis
专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
Comments 11 pages, 9 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
Comments 11 pages, 9 figures
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.LG
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments 12 pages, 8 figures. This work has been submitted to the IEEE for possible publication
专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments This paper is a more detailed version of the following publication: Lavindra de Silva, "HTN Acting: A Formalism and an Algorithm", in Proceedings of AAMAS 2018
专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments Submitted to PAAMS 2021
大型语言模型中出现的模块化认知架构
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究探究大型语言模型是否会出现类似人类大脑的模块化认知架构,经对4个认知领域46项任务的回路分析,发现其会形成相似模块化架构,表明模块化可能是智能系统的基本属性。
Comments this https URL (https://pengrui-han.github.io/LLM_Modularity_Page/)
一个冻结的12B模型在经过验证的任务上超越前沿模型:100%准确率、零token、位精确、永远如此
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究提出一种让模型冻结,通过增长持久内存来解决问题的方法。在多个问题族实例上,四种架构得分优异,执行与参数扩展解耦。该方法在开放式推理中也有效,内存选择快,存储规模大,在已验证任务上超越前沿模型。
Comments Industry experience report. 14 pages, 8 figures. Public testbench: https://corbenic-galahad-bench.hf.space; companion repository with SHA-256 provenance manifest: https://github.com/corbenicai/galahad-bench
RECEIPT:用于白盒代理式XSS发现的确定性、抗奖励攻击验证
专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract)
AI总结 研究针对白盒代理式XSS发现中编码代理声明不可信的问题,提出RECEIPT验证框架,通过环境隔离等手段使发现可信,经实验评估,在预算内发现多个未知漏洞,相比其他方式能确认更多真实利用且无假阳性。
用于闭环1型糖尿病控制的可解释语言模型
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对1型糖尿病控制中人工胰腺系统“黑箱”问题,提出LLM-T1D方法,结合强化学习与大语言模型,训练专家RL系统并提炼知识到模型,开发出可解释且性能优的胰岛素泵控制器,在模拟器测试中血糖控制良好且能防幻觉。
Comments Accepted at the 2026 IEEE 22nd International Conference on Automation Science and Engineering conference (IEEE CASE 2026)
一种用于自然语言形式化和验证的神经符号方法
机构 * Amazon Web Services(亚马逊网络服务) ; University College London(伦敦大学学院) ; University of Toronto(多伦多大学) ; Queen Mary University of London(伦敦大学女王学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对大型语言模型缺乏形式正确性保证的问题,提出神经符号方法ARc,通过使用带人工指导的大型语言模型形式化自然语言政策,并在推理时验证逻辑正确性,实现高健全性和低误报率,还能产生可审计工件。
Comments 28 pages, 11 figures
CARVE: 内容感知循环与值效率的分块并行线性注意力
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出CARVE模型,通过仅在键轴上擦除解决delta规则架构的三个耦合缺陷,实现WY形式分块求解器,在1.3B参数上取得WikiText困惑度15.72,优于GDN-2。
Comments 33 pages, 3 figures, 11 tables, 5 algorithms (incl. appendices with full proofs and Triton kernel pseudocode). Single-author preprint
洪流与收获:通过极限语言生成视角证明琐碎知识对于生成有价值数学的必要性
机构 * University of New South Wales(新南威尔士大学) ; University of Sydney(悉尼大学) ; University of Cambridge(剑桥大学)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过极限语言生成模型证明,在形式化数学生成中,验证器无法替代品味:覆盖未记录的有价值数学必须产生无限但渐近可忽略的琐碎语句,这是理论上的必然。
学习通过A*后训练进行高效推理
机构 * ETH Zürich(苏黎世联邦理工学院) ; MPI for Intelligent Systems, Tübingen(图宾根智能系统研究所) ; Purdue University(普渡大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过A*搜索算法指导LLM生成正确且高效的推理步骤,提出监督微调和强化学习两种训练方法,在1B-3B参数模型上显著提升推理准确性和效率。
Comments Preprint
无证书,不执行:认证轨迹作为可信AI代理的基础
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract)
AI总结 提出提案-认证-执行(PCE)架构,通过可检查的认证轨迹确保AI代理仅在策略系统允许下执行,核心原则为“无证书,不执行”。
Lean 与理论计算机科学的交汇:形式-非形式对中可扩展的定理证明挑战合成
机构 * D-CHAB, ETH Zurich, Zurich, Switzerland. ; D-INFK, ETH Zurich, Zurich, Switzerland. ; ETH AI Center, Zurich, Switzerland. ; University of Pennsylvania, PA, USA. ; Independent Researcher.
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出利用理论计算机科学作为可扩展的严谨证明问题来源,通过算法定义自动生成大量挑战性定理-证明对,展示了在Busy Beaver问题和混合布尔算术问题上的应用,并揭示了自动定理证明在复杂问题上的局限性。
Comments Accepted to AI4MATH@ICML2025
关于并行思维的过度扩展诅咒:系统效能与样本效率的矛盾
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究并行思维中系统效能与样本效率的矛盾,提出Latent Budget Predictor提升预算利用率,并引入Pre-decoding Budget Adaptation改进解码效率。
Comments 44 pages, 66 figures, 24 tables
领域级元认知监控在前沿大语言模型中的应用:一个33模型图谱
机构 * Independent Researcher(独立研究员)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过33个前沿LLM在MMLU基准领域中的表现,揭示了元认知评分掩盖的领域级差异,发现应用/专业知识领域监控效果最佳,而形式推理和自然科学领域最难,且中等难度领域无显著差异。
Comments 25 pages, 7 figures, 1 supplementary table. Code and data: https://github.com/synthiumjp/metacognitive-profile-atlas
基于开放对话的目标推断的灵活代理对齐
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出OU-AGs框架,通过开放对话中目标推断提升代理对齐能力,采用GOOD方法实现动态目标分布,提高多领域任务中的意图对齐效果。
Comments Previous version of the paper was titled: Open-Universe Assistance Games
通过信息论理解角色扮演模型的泛化能力
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Tongyi Lab(通义实验室) ; Zhongguancun Academy(中关村学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过信息理论提出R-EMID指标,分析角色扮演模型在分布偏移下的泛化问题,提出协同强化学习框架提升对话生成概率,发现用户偏移对泛化影响最大。
Comments Accepted to ACL 2026 (Findings), camera-ready version
通过程序切片和逻辑删除增强基于LLM的规范生成
专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract)
AI总结 SLD-Spec通过程序切片和逻辑删除提升LLM生成规范的准确性和完整性
通过提示工程实现更智能的AI:来自数据科学应用的洞察与案例研究
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract)
AI总结 本文通过提示工程在不同领域的应用案例,展示其提升AI性能的潜力及方法论有效性。
通过课程指导自适应递归加速小型递归模型的训练速度
机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 CGAR通过课程指导自适应递归方法,提升小型递归模型训练效率,实现加速训练和保持模型质量。
用大语言模型解决不等式证明
机构 * Stanford University(斯坦福大学) ; UC Berkeley(伯克利大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种非正式但可验证的任务公式化方法,通过IneqMath数据集和LLM-as-judge评估框架,揭示了大语言模型在解决不等式证明任务中的局限性及改进方向。
Comments 50 pages, 24 figures, accepted as a Spotlight at NeurIPS 2025
自带知识图谱:零样本知识图谱问答的自监督程序合成
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; AWS AI Labs(AWS人工智能实验室)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 BYOKG通过自监督程序合成实现零样本知识图谱问答,利用探索机制和LLM生成查询程序,提升问答准确率。
BlockCert: Transformer机制的认证分块提取
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 BlockCert通过认证分块提取Transformer机制,提供可验证的误差界和覆盖率指标,实验证明其在多个模型上有效且具有实际应用价值。
Comments 16 pages, 1 figure
基于掩码与重排的自监督学习用于可验证奖励的强化学习
机构 * DP Technology(DP技术)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出MR-RLVR方法,通过掩码与重排自监督学习提升RLVR在仅结果可验证场景下的可扩展性和性能。
机构 * CNRS LIX Ecole Polytechnique, Institut Polytechnique de Paris(高等理工学院巴黎理工研究所)
专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG