arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45006 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1127 篇

2607.09059 2026-07-13 cs.AI 新提交 79%

ARCANA: A Reflective Multi-Agent Program Synthesis Framework for ARC-AGI-2 Reasoning

ARCANA:用于ARC-AGI-2推理的反射式多智能体程序合成框架

Kunbo Zhang, Lei Fu, Zeyu Wang, Zijing Liu, Kejian Tong

机构 * Columbia University(哥伦比亚大学) University of California, Los Angeles(加州大学洛杉矶分校) Northeastern University(东北大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 ARCANA是用于ARC-AGI-2推理的多智能体框架,将任务分解为感知、假设生成等步骤,智能体通过可微黑板通信,由元控制器调度。其设计结合程序搜索与校正,提升了抽象转换任务的推理效率和解决方案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22375 2026-06-23 cs.AI cs.CE cs.IR 新提交 79%

ARIA: A Causal-Aware Framework for Rescuing LLM Reasoning in Trustworthy Materials Discovery

ARIA: 一种用于在可信材料发现中拯救LLM推理的因果感知框架

Yi Cao, Liaoyaqi Wang, Jieneng Chen, Benjamin Van Durme, Alan Yuille, Paulette Clancy

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ARIA框架,通过因果感知的三级级联(直接因果推理、物理类比迁移、参数回退)解决LLM在材料发现中的上下文隧道问题,提升物理可信性。

Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20881 2026-06-23 cs.AI 新提交 79%

When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study

内在奖励何时对代码推理有效?一项全面研究

Xiaolong Jin, Xuandong Zhao, Wenbo Guo, Xiangyu Zhang, Dawn Song

机构 * Purdue University(普渡大学) UC Berkeley(加州大学伯克利分校) UC Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 通过系统实验,发现基于确定性的内在奖励方法在代码生成中早期有效但最终导致模型崩溃,且作为RLVR预训练无显著优势,并给出实用建议。

Comments 18 pages, 45 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20142 2026-06-19 cs.AI cs.MA 新提交 79%

RACL: Reasoning-Agent Control Layers for Continuous Metaheuristic Learning

RACL:用于连续元启发式学习的推理代理控制层

Antón Asla Manzárraga

机构 * Independent Researcher(独立研究者)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 提出RACL方法,在元启发式优化器之上添加推理代理,通过观察、推理和干预控制搜索行为,在车辆路径问题上平均成本降低0.641%-8.337%。

Comments 10 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11556 2026-06-19 cs.SE cs.AI 版本更新 79%

FM-Agent: Scaling Formal Methods to Large Systems via LLM-Based Hoare-Style Reasoning

FM-Agent: 通过基于LLM的Hoare风格推理将形式化方法扩展到大型系统

Haoran Ding, Zhaoguo Wang, Haibo Chen

机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(并行与分布式系统研究所,上海交通大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 提出FM-Agent框架,利用LLM自动生成函数级规范,实现大型系统的组合式推理,在143k行代码的系统中2天内发现522个新bug。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17648 2026-06-17 cs.AI 新提交 79%

From Brewing to Resolution: Tracing the Internal Lifecycle of Code Reasoning in LLMs

从酝酿到解析:追踪LLM中代码推理的内部生命周期

Siyue Chen, Yifu Guo, Yuquan Lu, Zishan Xu, Jiaye Lin, Jianbo Lin, Siyu Zhang, Cheng Yang, Junxin Li, Yujia Li, Yu Huo, Ruixuan Wang

机构 * South China University of Technology(华南理工大学) Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hangzhou Dianzi University(杭州电子科技大学) Guangzhou College of Technology and Business(广州工商学院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 提出双重诊断框架(逐层线性探针与上下文剥离解码),揭示LLM在代码推理中先酝酿答案后进入四种解析结果(已解析、过度处理、错误解析、未解析)的内部生命周期,发现酝酿支架稳定而解析成功随能力变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02881 2026-06-17 cs.SE cs.AI 版本更新 79%

Learning-Infused Formal Reasoning: From Contract Synthesis to Artifact Reuse and Formal Semantics

学习增强的形式化推理:从合约合成到工件复用和形式语义

Arshad Beg, Diarmuid O'Donoghue, Rosemary Monahan

机构 * Department of Computer Science(计算机科学系)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 提出将形式化方法与人工智能融合的长期研究愿景,通过自动化合约合成、语义工件复用和精化理论,构建知识驱动的验证生态系统,加速未来保障。

Comments LNCS Proceedings Submitted Version. 17 pages. Accepted and presented at VERIFAI-2026: The Interplay between Artificial Intelligence and Software Verification LASER center, Villebrumier, France, March 8-11, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06188 2026-06-05 cs.CL 79%

The Tell-Tale Norm: $\ell_2$ Magnitude as a Signal for Reasoning Dynamics in Large Language Models

告密范数:$\ell_2$ 幅度作为大语言模型推理动态的信号

Jinyang Zhang, Hongxin Ding, Yue Fang, Weibin Liao, Muyang Ye, Junfeng Zhao, Yasha Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出隐藏状态的 $\ell_2$ 范数作为大语言模型推理强度的内生信号,并通过稀疏自编码器分析、理论证明和因果干预验证其有效性,进而引入三种基于 $\ell_2$ 范数的测试时缩放技术以提升推理性能。

Comments ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05290 2026-06-03 cs.AI 79%

X-RAY: Mapping LLM Reasoning Capability via Formalized and Calibrated Probes

X-RAY: 通过形式化与校准探针映射大语言模型推理能力

Tianxi Gao, Yufan Cai, Yusi Yuan, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 提出X-RAY系统,利用形式化工具生成结构可控的校准探针,通过分析约束交互、推理深度和解空间几何等属性,揭示LLM在约束细化与解空间重构下的推理不对称性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27014 2026-05-27 cs.LO cs.AI 79%

ReasonOps: A Unified Operational Paradigm for Trustworthy Verified LLM Reasoning

ReasonOps: 可信验证的LLM推理的统一操作范式

Adnan Rashid

机构 * School of Electrical Engineering(电子工程学院) Computer Science (SEECS) National University of Sciences(计算机科学(SEECS)国家 Sciences and Technology)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ReasonOps,一种将推理视为持续监控、可验证、可靠性感知的操作过程的统一范式,整合语义解释、自动形式化、符号推理、定理证明、运行时保证、概率可靠性估计和自适应修正,以解决当前LLM推理中的逻辑不一致、幻觉符号转换等问题。

Comments 5 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13985 2026-05-25 cs.AI 79%

Bridging AI and Clinical Reasoning: Abductive Explanations for Alignment on Critical Symptoms

弥合AI与临床推理:针对关键症状对齐的溯因解释

Belona Sonna, Alban Grastien

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文利用形式溯因解释,通过最小充分特征集提供一致且保证的推理,使AI决策与临床推理对齐,在保持预测准确性的同时提供可操作的临床见解,建立可信AI框架。

Comments The Algorithm 1 is not entirely correct and they may affect the results as well. We are restarting the experimentations and will upload the new version as soon as possible

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12787 2026-05-25 cs.AI cs.MA 79%

Ax-Prover: A Deep Reasoning Agentic Framework for Theorem Proving in Mathematics and Quantum Physics

Ax-Prover:用于数学和量子物理定理证明的深度推理智能体框架

Benjamin Breen, Marco Del Tredici, Jacob McCarran, Javier Aspuru Mijares, Weichen Winston Yin, Kfir Sulimany, Jacob M. Taylor, Frank H. L. Koppens, Dirk Englund

机构 * Axiomatic_AI(公理人工智能) Massachusetts Institute of Technology (MIT)(麻省理工学院) Institut de Ciències Fotòniques (ICFO)(光子科学研究所) Institució Catalana de Recerca i Estudis Avançats (ICREA)(加泰罗尼亚高级研究与高等学院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 提出多智能体系统Ax-Prover,通过将大语言模型与Lean工具结合,实现跨科学领域的自动化定理证明,并在抽象代数和量子理论新基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19663 2026-05-20 cs.AI 79%

Pseudocode-Guided Structured Reasoning for Automating Reliable Inference in Vision-Language Models

基于伪代码的结构化推理用于自动化可靠推理在视觉-语言模型中

Weicong Ni, Tianbao Jiang, Linlin Wang

机构 * East China Normal University(东华师范大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于伪代码的结构化推理框架(PStar),旨在通过自适应选择结构化伪代码推理路径,提高视觉-语言模型在复杂任务中的可靠性和鲁棒性,从而减少幻觉现象并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12532 2026-05-14 q-fin.TR cs.AI stat.ME 79%

AgenticAITA: A Proof-Of-Concept About Deliberative Multi-Agent Reasoning for Autonomous Trading Systems

AgenticAITA: 关于自主交易系统中 deliberative 多智能体推理的证明概念

Ivan Letteri

机构 * Department of Information Engineering, Computer Science, and Mathematics, Center of Excellence for Research DEWS, University of L’Aquila(信息工程、计算机科学和数学系,DEWS研究中心,拉奎拉大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出AGENTICAITA框架,通过多智能体协作推理替代传统信号执行模式,实现自主交易系统中无离线训练的决策流程,展示其在金融决策中的可行性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11922 2026-05-13 cs.SE cs.CL 79%

StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning

StepCodeReasoner: 通过强化学习对齐代码推理与分步执行轨迹

Hao Wang, Rui Li, Lei Sha, Jie M. Zhang

机构 * Beihang University, Beijing, China(北京航空航天大学) Peking University, Beijing, China(北京大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) King's College London, United Kingdom(伦敦国王学院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出StepCodeReasoner框架,通过引入显式的中间执行状态监督,将代码推理转化为可验证的分步执行建模问题,并通过Bi-Level GRPO算法提升结构化信用分配,实验表明其在代码推理和生成任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23238 2026-05-12 cs.CR cs.AI 79%

Hiding in Plain Sight: Detectability-Aware Antidistillation of Reasoning Models

明目张胆:面向可检测性的推理模型抗蒸馏

Max Hartman, Vidhata Jayaraman, Moulik Choraria, Yash Savani, Lav R. Varshney

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Stony Brook University(石溪大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种面向可检测性的抗蒸馏方法,通过Stackelberg博弈框架显式编码可检测性约束,以稀疏扰动替代全迹中毒,提升教师模型性能并降低防御可见性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27713 2026-05-01 cs.AI 79%

Knowledge Graph Representations for LLM-Based Policy Compliance Reasoning

基于LLM的政策合规推理的知识图谱表示

Wilder Baldwin, Sepideh Ghanavati

机构 * University of Maine(缅因大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一个框架,通过构建知识图谱从AI政策文档中检索相关信息,评估五种LLM在42个政策问答任务上的表现,证明知识图谱增强提升了模型性能,且开放的LLM发现模式达到或超越了正式本体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06635 2026-04-30 cs.LG 79%

Graph Property Inference in Small Language Models: Effects of Representation and Reasoning Strategy

在小型语言模型中进行图属性推断:表示与推理策略的影响

Michal Podstawski

机构 * NASK National Research Institute, Warsaw, Poland(波兰华沙国家研究 institute)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.LG

AI总结 研究探讨了小型指令微调语言模型在图属性推断中的表现,发现输入表示和推理策略显著影响结果,未经过微调的模型在估计图属性时存在系统性误差,但通过改进表示和推理设计可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23563 2026-04-28 cs.CR cs.AI cs.IR 79%

CyberCane: Neuro-Symbolic RAG for Privacy-Preserving Phishing Detection with Formal Ontology Reasoning

CyberCane:基于形式本体推理的隐私保护钓鱼检测神经符号RAG

Safayat Bin Hakim, Aniqa Afzal, Qi Zhao, Vigna Majmundar, Pawel Sloboda, Houbing Herbert Song

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Bowie State University(鲍威州立大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 CyberCane结合确定性符号分析与隐私保护RAG,通过形式本体推理实现高召回率的钓鱼检测,在隐私保护和抗AI攻击方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10899 2026-04-22 cs.CL cs.LO cs.SE 79%

From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models

从证明到程序:刻画大语言模型中的工具诱导推理幻觉

Farima Fatahi Bayat, Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 研究探讨了工具增强语言模型在使用外部工具时产生的推理幻觉问题,通过PYMATH基准测试发现,尽管工具使用提升了最终答案准确率,但推理过程却愈发不连贯,提出基于偏好优化的框架以改善工具使用下的推理深度。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14628 2026-04-21 cs.PL cs.AI cs.CR cs.LO 79%

s2n-bignum-bench: A practical benchmark for evaluating low-level code reasoning of LLMs

s2n-bignum-bench:评估LLM低级代码推理能力的实用基准

Balaji Rao, John Harrison, Soonho Kong, Juneyoung Lee, Carlo Lipizzi

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Amazon Web Services(亚马逊网络服务)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出s2n-bignum-bench基准,用于评估LLM在工业级低级密码学汇编代码中的定理证明能力,通过形式化验证挑战证明生成。

Comments Accepted as a Workshop paper at AIPV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12133 2026-04-15 cs.AI 79%

Towards Platonic Representation for Table Reasoning: A Foundation for Permutation-Invariant Retrieval

迈向表格推理的柏拉图表示:一种排列不变检索的基础

Willy Carlos Tchuitcheu, Tan Lu, Ann Dooms

机构 * Department of Mathematics and Data Science, Vrije Universiteit Brussel (VUB)(瓦隆公国布鲁塞尔自由大学数学与数据科学系) Data Science Lab, Royal Library of Belgium (KBR)(比利时皇家图书馆数据科学实验室)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出柏拉图表示假设,主张表格推理需要内在排列不变的潜在空间,通过分析和实验揭示了现有模型在布局变化下的脆弱性,并提出结构感知的表格推理编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13356 2026-04-14 cs.CY cs.CL 79%

CogniAlign: Survivability-Grounded Multi-Agent Moral Reasoning for Safe and Transparent AI

CogniAlign:基于生存性的多智能体道德推理以实现安全透明的AI

Hasin Jawad Ali, Ilhamul Azam, Ajwad Abrar, Md. Kamrul Hasan, Hasan Mahmud

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 CogniAlign通过基于自然主义道德现实的多智能体框架,将道德推理 grounded 在生存性上,通过学科专家智能体的结构化辩论实现透明和经验锚定的判断,证明了可审计的AI对齐方法的可行性。

Comments Under Review

Journal ref AI and Ethics (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05080 2026-04-08 cs.SE cs.AI cs.LO cs.MA 79%

Nidus: Externalized Reasoning for AI-Assisted Engineering

Nidus:面向AI辅助工程的外部化推理

Danil Gorinevski

机构 * cybiont GmbH(cybiont有限公司)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 Nidus通过外部化推理机制,实现了AI辅助软件交付中的V模型机械化,通过约束表面确保工程不变量的可靠性,提出递归自治理、协同机制、规范强化和治理剧场预防四项贡献。

Comments 19 pages, 3 figures, 5 tables. Evaluated on self-hosting deployment. Patent pending (CH000371/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25810 2026-03-31 cs.PL cs.LG 79%

ExVerus: Verus Proof Repair via Counterexample Reasoning

ExVerus:通过反例推理进行证明修复

Jun Yang, Yuechun Sun, Yi Wu, Rodrigo Caridad, Yongwei Yuan, Jianan Yao, Shan Lu, Kexin Pei

机构 * The University of Chicago(芝加哥大学) Purdue University(普渡大学) The University of Toronto(多伦多大学) Microsoft Research(微软研究院)

专题命中 代码与定理证明 :reasoning(title);verifier(abstract);分类 cs.LG

AI总结 ExVerus利用反例推理指导LLM生成更准确的证明,通过自动生成和验证反例来提高证明的鲁棒性和效率。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14703 2026-03-17 cs.SE cs.AI 79%

Beyond Local Code Optimization: Multi-Agent Reasoning for Software System Optimization

超越局部代码优化:软件系统优化的多智能体推理

Huiyun Peng, Parth Vinod Patil, Antonio Zhong Qiu, George K. Thiruvathukal, James C. Davis

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出多智能体框架,通过整合控制流、数据流与架构依赖信号,实现微服务系统的整体优化,提升吞吐量和响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07997 2026-03-12 cs.CL 79%

BiasCause: Evaluate Socially Biased Causal Reasoning of Large Language Models

BiasCause: 评估大型语言模型的社会偏见因果推理

Tian Xie, Tongxin Yin, Vaishakh Keshava, Xueru Zhang, Siddhartha Reddy Jonnalagadda

机构 * Google(谷歌) The Ohio State University(俄亥俄州立大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出BiasCause框架,评估LLMs在回答社会偏见问题时的因果推理,揭示其偏见产生机制及去偏策略。

Comments This work has been done when the first author is at Google. The first author is a student at the Ohio State University

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21033 2026-03-06 cs.AI 79%

Towards Trustworthy Legal AI through LLM Agents and Formal Reasoning

通过LLM代理和形式推理实现可信的法律AI

Linze Chen, Yufan Cai, Zhe Hou, Jin Song Dong

机构 * National University of Singapore(国立新加坡大学) Griffith University(格里菲斯大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 L4L通过LLM代理与形式推理实现法律AI的可信性,通过四个阶段确保法律推理的逻辑性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01012 2026-03-04 cs.SE cs.AI 79%

FastCode: Fast and Cost-Efficient Code Understanding and Reasoning

FastCode: 快速且成本有效的代码理解和推理

Zhonghang Li, Zongwei Li, Yuxuan Chen, Han Shi, Jiawei Li, Jierun Chen, Haoli Bai, Chao Huang

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 FastCode通过结构化勘探机制提升代码推理效率,减少计算成本,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20973 2026-02-25 cs.CL 79%

Linear Reasoning vs. Proof by Cases: Obstacles for Large Language Models in FOL Problem Solving

线性推理与证明中的反证法:大型语言模型在一阶逻辑问题解决中的障碍

Yuliang Ji, Fuchen Shen, Jian Wu, Qiujie Xie, Yue Zhang

机构 * Nanjing University of Science and Technology(南京理工大学) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出PC-FOL数据集,通过对比线性推理与基于情况的推理,揭示大型语言模型在FOL问题解决中的核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏