arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-24 至 2026-06-24 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 7 篇

2606.24124 2026-06-24 cs.AI 新提交 90%

VeryTrace: Verifying Reasoning Traces through Compilable Formalism and Structured Verification

VeryTrace: 通过可编译形式化与结构化验证验证推理轨迹

Ninghan Zhong, Ahmet Ege Tanriverdi, Kaan Kale, Sriram Vishwanath

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology, USA(佐治亚理工学院电子与计算机工程学院) Department of Electrical and Computer Engineering, Bogazici University, Turkey(博亚奇大学电子与计算机工程系)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);planning(abstract)

AI总结 提出VeryTrace框架,将自然语言推理轨迹形式化为可编译的领域特定语言(DSL),结合确定性检查与LLM审计进行混合验证,实现步骤级错误定位与修复,在数学、机器人规划、亲属推理任务上提升准确率。

Comments Accepted at LM4Plan Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23238 2026-06-24 cs.AI 新提交 88%

HOLMES: Evaluating Higher-Order Logical Reasoning in LLMs

HOLMES: 评估大语言模型中的高阶逻辑推理

Yucheng Wu, Jundong Xu, Mingzhen Ju, Yue Yu, Chenpeng Wang, Haoxuan Li, Liangming Pan

机构 * State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) School of Computer Science, Peking University(北京大学计算机科学学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) YiXin-AILab, YIXIN(YiXin-AILab,YIXIN)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI

AI总结 提出HOLMES基准,基于高阶逻辑评估LLM在规则、谓词和约束上的推理能力,发现当前模型平均准确率仅50.64%,揭示高阶符号推理是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23938 2026-06-24 cs.AI cs.CL 新提交 88%

Neuro-Symbolic Drive: Rule-Grounded Faithful Reasoning for Driving VLAs

神经符号驱动:基于规则忠实推理的驾驶VLA

Xiangbo Gao, Xiukun Huang, Boyu Lu, Junge Zhang, Mengjie Mao, Jiachen Li, Wei Xiong, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学) Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学) University of California, Riverside(加利福尼亚大学河滨分校) University of Pittsburgh(匹兹堡大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 提出神经符号驱动框架,利用规则规划器的决策轨迹监督驾驶VLA,实现推理与运动生成的因果耦合,显著降低轨迹误差和碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16845 2026-06-24 cs.CL cs.AI 新提交 88%

Robust Dual-Signal Fusion: Hybrid Neuro-Symbolic Gating with Compressed Chain-of-Thought Refinement for Irony Detection in Social Media Texts

鲁棒双信号融合:混合神经符号门控与压缩链式思维精炼用于社交媒体文本讽刺检测

Ankit Bhattacharjee, Krityapriya Bhaumik

机构 * Indian Institute of Technology Kharagpur(印度理工学院克勒格布尔分校)

专题命中 逻辑推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出RDS融合框架,结合神经符号架构与压缩链式思维推理,在TweetEval和iSarcasm数据集上达到与微调BERTweet相当的性能,并显著优于监督方法。

Comments 11 pages total, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03476 2026-06-24 cs.LG cs.AI cs.MA cs.NA math.NA physics.comp-ph 版本更新 62%

ATHENA: Agentic Team for Hierarchical Evolutionary Numerical Algorithms

ATHENA:分层进化数值算法的智能团队

Juan Diego Toscano, Daniel T. Chen, George Em Karniadakis

机构 * Division of Applied Mathematics, Brown University(布朗大学应用数学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ATHENA通过知识驱动的诊断流程,实现科学计算与科学机器学习的自动化,结合专家蓝图和组合空间,生成高精度数值解和稳定求解器,达到10^-14的验证误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18747 2026-06-24 cs.IR cs.AI cs.CC cs.CL cs.DB 版本更新 62%

The $\mathbf{P}$-Completeness of Inverted Index Traversal: On the Complexity of Evaluating Boolean Query DAGs

倒排索引遍历的$\mathbf{P}$-完备性:关于布尔查询DAG评估的复杂性

Amir Aavani

机构 * Apple Inc.(苹果公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文证明基于DAG的布尔查询评估问题是$\mathbf{P}$-完备的,并提出一种稀疏感知算法ComputePN,通过正负对偶表示和DAG记忆化,将评估时间严格限制在$O(|Q| \cdot |U_{\mathit{active}}|)$,避免指数爆炸和全量扫描。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04560 2026-06-24 cs.RO 版本更新 50%

From Local Corrections to Generalized Skills: Improving Neuro-Symbolic Policies with MEMO

从局部修正到通用技能:利用MEMO改进神经符号策略

Benjamin A. Christie, Yinlong Dai, Mohammad Bararjanianbahnamiri, Simon Stepputtis, Dylan P. Losey

机构 * Collab Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, USA.(机械工程系,弗吉尼亚理工学院,黑斯堡,美国) TEA Lab(TEA实验室)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对机器人神经符号策略中技能不足的问题,提出MEMO框架,通过收集、聚类和改写多用户自然语言修正,构建检索增强的技能手册,动态扩展技能库,实现新任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏