arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-18 至 2026-08-18 共收录 229 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 13 篇

2604.06628 2026-08-18 cs.AI 版本更新 87%

Rethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capability

重新思考推理SFT中的泛化:对优化、数据和模型能力的条件分析

Qihan Ren, Peng Wang, Ruikun Cai, Shuai Shao, Dadi Guo, Yuejin Xie, Yafu Li, Quanshi Zhang, Xia Hu, Jing Shao, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文研究推理SFT的泛化问题,发现泛化受优化动态、训练数据和模型能力共同影响,指出短训练检查点可能低估泛化能力,数据质量和结构及模型能力均影响泛化效果,且推理提升与安全下降存在不对称性。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14927 2026-08-18 cs.AI cs.CL cs.LG 新提交 85%

LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks

大语言模型(LLM)可预测失败风险,但难以预测哪种协作协议能产生回报:推理任务中考虑成本的协议路由

Chih-Hsuan Yang, Jingyan Jiang, Cheng-Hau Yang, Vikram Vasudevan, Huihuo Zheng, Venkatram Vishwanath, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) Oregon State University(俄勒冈州立大学)

专题命中 数学推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨LLM多智能体系统中协作成本与收益的平衡,测试四种协作协议,发现LLM可预测失败风险但难以识别有效协议,置信度可支持初始协作升级,特定协议的成本感知路由仍待解决。

Comments 23 pages, 6 figures; includes appendices and ancillary aggregate-result CSV files

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13221 2026-08-18 cs.AI cs.LG 版本更新 84%

An Agentic AI Framework with Large Language Models and Chain-of-Thought for UAV-Assisted Logistics Scheduling with Mobile Edge Computing

基于大语言模型和链式推理的智能AI框架用于无人机辅助物流调度与移动边缘计算

Hanwen Zhang, Dusit Niyato, Wei Zhang, Xin Lou, Malcolm Yoke Hean Low

机构 * Nanyang Technological University(南洋理工大学) Singapore Institute of Technology(新加坡理工学院) Seatrium New Energy Laboratory(Seatrium 新能源实验室) Ministry of Education (MOE) Tier 1(教育部 Tier 1) Research Innovation and Enterprise (RIE) 2025 Industry Alignment Fund-Industry Collaboration Projects (IAF-ICP)(研究创新与企业 (RIE) 2025 行业对齐基金-行业合作项目 (IAF-ICP))

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结合大语言模型和链式推理的智能AI框架,用于解决无人机辅助物流调度中的混合调度问题,通过分层深度强化学习实现无人机路由和任务执行优化,提升物流效率与任务完成率。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15797 2026-08-18 cs.AI cs.CL 新提交 81%

KV-Rescue: Recovering Reasoning Language Model KV Eviction Loss via Stepwise Interleaving

KV-Rescue:通过逐步交错恢复推理语言模型的KV驱逐损失

Minsoo Cheong, Woosang Lim, Vincent-Daniel Yun, Sungjoo Yoo

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 KV-Rescue是一种无需训练的推理框架,通过交错轻量级辅助模型的推理步骤,结合在线检测器,在驱逐预算B=64时平均恢复了87%的KV驱逐损失准确率,还减少了43%的基础模型token生成量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16554 2026-08-18 cs.CL 新提交 79%

Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning

询问、条件化或弃权:针对缺失前提推理的强化学习

Yongqi Tong, Zhenyu Zhang, Zimi Liu, Kewei Fu, Mingli Song, Haofei Zhang, Junshao Zhang, Hong Zhu, Jiang-Ming Yang, Xin Zhang, Jianshe Li

机构 * Ant International(蚂蚁国际) Zhejiang University(浙江大学) Dingtalk, Alibaba Group(阿里巴巴集团钉钉) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出ACA-RL框架,结合MPB基准,训练模型应对缺失前提的推理任务,可询问、条件化或弃权,提升欠定问题处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15445 2026-08-18 cs.AI 新提交 79%

Measuring Reward Hacking and Reasoning-Answer Decoupling Under Position-Confounded Optimization

测量位置混淆优化下的奖励黑客行为与推理-答案解耦

Suyash Maniyar, Armaan Sandhu, Abhishek Mishra

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对位置混淆优化下的奖励黑客与推理-答案解耦问题,通过GRPO训练语言模型,发现模型会学习答案位置捷径,推理与答案解耦,且该捷径可跨域迁移,解耦率等指标可区分能力损失与捷径。

Comments Accepted at the AI Measurement Science Workshop, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16627 2026-08-18 cs.CL cs.AI 新提交 73%

When Do Explanations Help In-Context Learning? A Comparative Study of Natural Language Explanation Types and Faithfulness

解释何时能帮助上下文学习?自然语言解释类型与忠实度的比较研究

Mahdi Dhaini, Adam Dejl, Juraj Vladika, Volkan Özer, Barbara Plank, Gjergji Kasneci

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Imperial College London(伦敦帝国学院) Technical University of Munich(慕尼黑工业大学) MaiNLP lab, CIS, LMU Munich(慕尼黑大学CIS研究所MaiNLP实验室)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过在6个基准和4个指令调优模型上的比较评估,探究不同来源与选择方式的自然语言解释对上下文学习下游性能的影响,为实际提示流程中解释的选择和报告提供了见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16072 2026-08-18 cs.LG cs.AI 新提交 62%

Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization

学习剩余内容,而非已掌握内容:面向多奖励策略优化的饱和感知优势重加权方法

Yixuan Wang, Yifei Chen, Haichao Zhang, Haozheng Luo, Xander Wu, Jie Ni, Yun Fu, Nuno Vasconcelos, Yijiang Li

机构 * University of Florida(佛罗里达大学) UC San Diego(加州大学圣迭戈分校) Northeastern University(东北大学) Northwestern University(西北大学) Stanford University(斯坦福大学) Universität Innsbruck(因斯布鲁克大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对多奖励策略优化中现有方法的缺陷,提出SA-MRPO方法,动态分配优化资源,在数学推理、自适应推理、编码任务中均实现性能提升。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15360 2026-08-18 cs.LG cs.AI 新提交 62%

SAPE: Sandwich Adapters for Parameter Efficiency in Large Language Model Fine-Tuning

SAPE:用于大语言模型微调参数效率的三明治适配器

Mohammad Aref Jafari-Raddani, Morteza Mohajjel Kafshdooz

机构 * Qom University of Technology(库姆理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SAPE是一种基于三明治式硬权重共享拓扑的PEFT框架,通过隔离边界变换降低内存与计算开销,在低参数约束下,于RoBERTa-large、LLaMA-3.2等模型的多项任务中取得优于现有方法的性能。

Comments 16 pages, 4 figures, 10 tables, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15979 2026-08-18 cs.AI 新提交 57%

ALPS: Measuring Valid Creativity in Large Language Models with Mathematical Construction

ALPS:通过数学构造衡量大语言模型的有效创造力

Eric Xie, Wenqian Ye, Aidong Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出ALPS基准,通过要求生成可证正确的原创数学结构或证明其不存在的任务,评估大语言模型的有效创造力,测试发现现有推理模型在证明侧成功率14%、构造侧为0,多数实例未被解决并发布完整ALPS资源。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14685 2026-08-18 cs.LG stat.ML 新提交 57%

Rethinking Reverse KL as Adaptive Entropy Distillation

将反向KL重新思考为自适应熵蒸馏

Shizhen Li, Zhiyu Shen, Yuyin Lu, Yunhe Pang, Jielin Song, Yanghui Rao, Fu Lee Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科技学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对知识蒸馏难以平衡忠实模仿与鲁棒生成的问题,提出自适应熵蒸馏(AED)方法,通过分解反向KL目标函数并利用教师熵动态校准模仿强度,在指令遵循与数学推理基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12756 2026-08-18 cs.LG 版本更新 57%

Closing the Loop: A Control-Theoretic Framework for Provably Stable Time Series Forecasting with LLMs

闭环:基于控制理论的具有可证明稳定性的时序预测框架与大语言模型

Xingyu Zhang, Jingyao Wang, Zeen Song, Changwen Zheng, Wenwen Qiang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出F-LLM框架,通过控制理论方法解决大语言模型在时序预测中的误差累积问题,提供理论保证并实验验证其有效性。

Comments Accepted by ACM MM26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04854 2026-08-18 cs.SE 版本更新 50%

Assessing Large Language Models for Stabilizing Numerical Expressions in Scientific Software

评估大语言模型在科学软件中稳定数值表达式的能力

Tien Nguyen, Kirshanthan Sundararajah, Muhammad Ali Gulzar

专题命中 数学推理 :reasoning(abstract)

AI总结 本文评估大语言模型在数值稳定性任务中的表现,发现其在检测和稳定不稳定的计算方面与传统方法相当,并在某些情况下表现更优,但对控制流和高精度字面量处理较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 10 篇

2604.04120 2026-08-18 cs.CL 版本更新 87%

Shorter, but Still Trustworthy? An Empirical Study of Chain-of-Thought Compression

更短,但依然可信?链式推理压缩的实证研究

Lingjie Zeng, Xiaofan Chen, Yanbo Wang, Xiuying Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 代码与定理证明 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 本文实证研究了链式推理压缩对模型可信度的影响,评估了不同模型在安全、抗幻觉和多语言鲁棒性上的表现,提出标准化效率评分以揭示信任度权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16458 2026-08-18 cs.AR 新提交 82%

TRACE: Traversal and Reasoning Algebraic Computing Engine for Formal Hardware Verification

TRACE:用于形式化硬件验证的遍历与推理代数计算引擎

Jan Kleinekathöfer, Lennart Weingarten, Kamalika Datta, Rolf Drechsler

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 针对AI时代算术原语验证的计算瓶颈,提出SCA框架TRACE,采用优化归约技术,首次成功验证此前无法验证的优化MAC电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14566 2026-08-18 cs.AI 新提交 79%

Position: Evaluations of AI Moral Reasoning Still Miss Half of the Picture

立场:AI道德推理的评估仍遗漏了一半关键内容

Aidan Kierans, Ritam Dutt, Kaley Rittichier, Shiri Dori-Hacohen, Avijit Ghosh

机构 * University of Connecticut(康涅狄格大学) Carnegie Mellon University(卡内基梅隆大学) Hugging Face

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究指出现有LLM道德推理评估聚焦道德价值问题而忽视规范问题,识别出三大缺口并提出含规范表征、标注数据集及分层评估的研究议程,以推动规范推理的系统研究。

Comments 8 pages, 1 figure. Accepted for archival publication at the ACL 2026 Workshop on Evaluating Evaluations (EvalEval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16032 2026-08-18 cs.CR 新提交 78%

Proof-of-Execution Memory: Defending LLM Agents Against Forged-Reasoning Attacks by Verifying What Actually Happened

执行证明内存:通过验证实际发生的内容防御大语言模型智能体的伪造推理攻击

Md Habibur Rahman, Jaeho Kim

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 该研究针对大语言模型智能体的伪造推理攻击,提出执行证明内存(PoEM)防御方案,通过维护防篡改的HMAC链式分类账验证实际执行步骤,使攻击成功率降至0%,且误报率极低、开销微小。

Comments 8 pages, 6 figures, 5 tables. Code: https://github.com/bithabib/ai_security

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02763 2026-08-18 cs.CL cs.AI cs.CY 版本更新 62%

Bye-bye, Bluebook? Automating Legal Drudgery With AI-Augmented Rule Following

再见,蓝皮书?用AI辅助规则遵循实现法律苦差事自动化

Matthew Dahl, Eric Martínez

机构 * Yale Law School(耶鲁法学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对法律AI在《蓝皮书》引文格式任务的表现,构建了新基准,提出神经符号系统方法使准确率提升32.4个百分点至最高85.5%,指出AI与符号规则引擎结合是可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16411 2026-08-18 cs.SE cs.AI 新提交 57%

Towards Risk-free AI Agent Deployment

迈向无风险的AI智能体部署

Yintong Huo, Rangeet Pan, Abhik Roychoudhury

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 针对LLM智能体部署的安全、合规等风险,本文提出以智能体轨迹为基础,将测试与调试作为系统性研究方向,提炼部署就绪检查表并指出需解决的开放性问题,推动可信智能体部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15432 2026-08-18 cs.AI 新提交 57%

Does the Proof Prove It That Way? Faithful Formalization of Elements Proofs

证明是否以其应有的方式被证明?《几何原本》元素证明的忠实形式化

Tadd Mao, Tianjun Zhong, Dhruva Arekar, Yuming Feng, One An, Jiani Huang, Xujie Si, Ziyang Li

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出满足五项必要条件的Pistis智能体式证明搜索方法,通过OrderDecompose分治搜索生成欧几里得《几何原本》前三卷的忠实形式化Lean证明,其性能优于基线方法,可作为证明检查工具。

Comments Preprint. 18 pages, 14 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14590 2026-08-18 cs.AI 新提交 57%

Toward Safe LLM Agents: A Survey of Specification, Verification, and Enforcement

面向安全的大语言模型智能体:规范、验证与执行的综述

Pierre Dantas, Lucas Cordeiro, Ehsan Nowroozi, Tihanyi Norbert

机构 * The University of Manchester(曼彻斯特大学) The University of Greenwich(格林威治大学) Technology Innovation Institute(技术创新研究院)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 该综述针对LLM智能体缺乏形式化任务级安全保障的问题,通过系统分析38项研究,揭示规范瓶颈等四项关键发现,提出三级分类体系与十大问题研究议程,为可信智能体AI研究提供方向。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24465 2026-08-18 cs.CL 版本更新 57%

MechMath: Sorrifier-Driven Formal Decomposition Workflow for Automated Theorem Proving

Mechanic:基于遗憾的正式分解工作流用于自动定理证明

Ruichen Qiu, Yichuan Cao, Junqi Liu, Dakai Guo, Xiao-Shan Gao, Lihong Zhi, Ruyong Feng

机构 * Academy of Mathematics and Systems Science, CAS(数学与系统科学研究院,中国科学院) School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,中国科学院大学) School of Mathematical Science, UCAS(数学科学学院,中国科学院大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 Mechanic通过基于遗憾的正式分解策略提升自动定理证明效率,有效解决传统方法在处理失败尝试时的效率与上下文过长问题。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21576 2026-08-18 cs.CL 版本更新 57%

Vision Language Models Cannot Plan, but Can They Formalize?

视觉语言模型(VLMs)无法规划,但它们能进行形式化吗?

Muyu He, Yuxi Zheng, Yuchen Liu, Zijian An, Bill Cai, Jiani Huang, Lifeng Zhou, Feng Liu, Ziyang Li, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 代码与定理证明 :planning(abstract);分类 cs.CL

AI总结 本研究提出5种VLM作为形式化器的流水线,评估后发现其表现优于端到端规划生成,较弱VLMs的瓶颈为物体关系视觉grounding,较强模型已克服该限制。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 13 篇

2608.16419 2026-08-18 cs.LG cs.AI q-bio.QM 新提交 88%

PertMind: Eliciting Emergent Biological Reasoning in LLM via Reinforcement Learning on Cellular Perturbation Data

PertMind:通过细胞扰动数据的强化学习在大语言模型中引出涌现生物推理能力

Zhenchao Tang, Xiaogang Xu, Tianxu Lv, Jiahui Guan, Jiale Zhou, Haohuai He, Zhi Song, Hanbo Huang, Jiehui Huang, Jiafei Wu, Zhe Liu

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出PertMind模型,结合可信轨迹监督初始化与多层面强化信号,以细胞扰动图谱为强化学习环境训练,实现生物推理能力的涌现,且可迁移至多类生物任务。

Comments Project page: https://shapsider.github.io/PertMind/ Code: https://github.com/shapsider/PertMind Model: https://huggingface.co/tzcfly/PertMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16224 2026-08-18 cs.CL cs.AI 新提交 84%

STAIR: Semantic-Temporal Automaton for Interpretable Reasoning in Temporal Question Answering

STAIR:用于时间问答中可解释推理的语义-时间自动机

Xinlong Dai, Jinchuan Zhang, Lei Gao, Xinzhe Hu, Yuefeng He, Hui Gao

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出STAIR语义-时间自动机,将语义解读与时间推理分离,规则优先设计减少自由推理,在多个时间问答数据集上优于基线,提升了F1值且可解释性更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15673 2026-08-18 cs.LG cs.AI 新提交 82%

PL-Guard: Probabilistic Logic Reasoning for LLM Guardrails

PL-Guard:面向大语言模型安全护栏的概率逻辑推理

Satchit Chatterji, Shihan Wang, Giovanni Sileno, Erman Acar

机构 * University of Amsterdam(阿姆斯特丹大学) Utrecht University(乌得勒支大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出神经符号安全护栏架构PL-Guard,通过分离神经落地与概率符号推理,在XSTest基准上大幅降低大语言模型的不安全依从率,虽过度拒绝率略高,但提升了推理可审计性。

Comments Preliminary version of this paper was presented at the IJCAI 2026 Workshop on Logical and Symbolic Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16565 2026-08-18 cs.AI cs.LG math.PR 新提交 81%

Probabilistic Circuits as Reasoning Machines in Artificial Intelligence (Part I)

概率电路作为人工智能中的推理机器(第一部分)

Robert Peharz

机构 * Graz University of Technology(格拉茨工业大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 该论文第一部分研究概率电路(PCs)这一可处理框架,阐述其解决概率推理 NP 难问题的结构约束,涵盖其基础理论、学习方法、与深度学习集成等贡献,为人工智能不确定性推理提供支撑。

Comments Habilitation Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16637 2026-08-18 cs.AI 新提交 79%

PDDLCoder: Agentic PDDL Generation for LLM-Assisted Symbolic Planning

PDDLCoder:用于LLM辅助符号规划的智能体式PDDL生成工具

Veit Laule, Jiangtao Shuai, Manfred Hauswirth, Sonja Schimmler

机构 * Technical University of Berlin(柏林工业大学) Fraunhofer FOKUS(弗劳恩霍夫FOKUS研究院)

专题命中 逻辑推理 :planning(title,abstract);分类 cs.AI

AI总结 本研究提出智能体式PDDL生成框架PDDLCoder,引入含711个问题的NL-pddlgym基准,其在测试集上可生成89.6%可执行规划,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14569 2026-08-18 cs.AI 新提交 79%

Position: Certified Correctness in Neural Constraint Reasoning Requires Symbolic Integration

立场:神经约束推理的认证正确性需要符号集成

Shufeng Kong, Xiaochuan Zhang, Caihua Liu

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文针对神经约束推理在分布偏移下易出现约束违反的问题,提出需优先将神经方法与符号方法双向集成,通过多智能体认证推理框架实现计算效率与可证正确性。

Comments Accept by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14579 2026-08-18 cs.AI 新提交 70%

SKILL: Self-correcting Knowledge-guided Iterative Large Language Model Agent for Logic Optimization

SKILL:用于逻辑优化的自校正知识引导迭代大语言模型智能体

Rui Yang

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对逻辑综合优化的挑战,提出SKILL智能体,结合多LLM推理与RL交互,经基准测试实现12.4%的PDA提升及86.3%的50万门级逻辑系统成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏