arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-20 至 2026-05-20 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 9 篇

2605.19597 2026-05-20 cs.CL 88%

LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening

LLMEval-Logic: 一个验证求解器的中文逻辑推理基准,具有对抗性强化

Ming Zhang, Qiyuan Peng, Yinxi Wei, Yujiong Shen, Kexin Tan, Yuhui Wang, Zhenghao Xiang, Junjie Ye, Zhangyue Yin, Zhiheng Xi, Shihan Dou, Tao Gui, Maxm Pan, Ruizhi Yang, Qi Zhang, Xuanjing Huang

机构 * Institute of Trustworthy Embodied Artificial Intelligence(可信具身人工智能研究院) Fudan University(复旦大学) Hunyuan Team Tencent(腾讯 Hunyuan 团队) School of Philosophy Fudan University(复旦大学哲学学院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL

AI总结 本文提出LLMEval-Logic,一个基于真实情境场景的中文逻辑推理基准,通过作者和专家共同审核自然语言项目及其形式化参考,利用Z3验证注释答案,构建自然到形式的评分标准,并通过闭环对抗流程强化选定项目。基准包含246个基础项目和190个难度项目,评估14个前沿LLM显示当前模型存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19045 2026-05-20 cs.CY 88%

Beyond Nutrition Labels: How Analogical Reasoning Shapes Synthetic Media Disclosure Design

超越营养标签:类比推理如何塑造合成媒体披露设计

Claire R. Leibowicz

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract)

AI总结 本研究探讨了在复杂的社会技术约束下,AI政策制定者和实践者如何设计合成媒体披露,识别了过程透明和危害减少等关键披露目标,并揭示了规范性与中立性、主动与精确性之间的核心矛盾,强调了类比推理在管理但不解决这些矛盾中的作用。

Comments 18 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19944 2026-05-20 cs.LG cs.AI cs.CC cs.CL 82%

A Measure-Theoretic Analysis of Reasoning: Structural Generalization and Approximation Limits

关于推理的测度论分析:结构泛化与近似限制

Yuyang Zhang, Yifu Zhang, Xuehai Zhou, Xiaoyin Chen

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过最优传输理论分析推理过程,揭示了结构泛化和近似限制的理论机制,发现位置依赖注意力机制和Transformer电路深度对推理性能有显著影响。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19108 2026-05-20 cs.DC 80%

Unleashing the Power of Tree-of-Thoughts for Edge-Enabled AIGC Service Provisioning

释放树状思维的力量以实现边缘增强的AIGC服务 provisioning

Zhang Liu, Shanhao Zhan, Shaowei Shen, Lianfen Huang, Qiao Xiang, Ying-Jun Angela Zhang, Dusit Niyato

专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文研究了利用树状思维提示的移动边缘计算增强的AIGC服务 provisioning,通过建立DAG模型和提出DSAC算法来优化生成延迟和质量约束。

Comments 15 pages, 11 figures, journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15975 2026-05-20 cs.AI cs.RO 79%

Learning Bilevel Policies over Symbolic World Models for Long-Horizon Planning

在符号世界模型上学习双层策略以实现长周期规划

Dillon Z. Chen, Till Hofmann, Toryn Q. Klassen, Sheila A. McIlraith

机构 * Vector Institute(向量研究所) University of Toronto(多伦多大学) LAAS-CNRS(Laas--cnrs) University of Toulouse(图卢兹大学) RWTH Aachen University(亚琛工业大学)

专题命中 逻辑推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种结合低层模仿学习和高层符号抽象的双层策略,用于解决长周期规划问题,通过BISON系统在扩展的MetaWorld基准上验证了其在处理大量物体和长周期任务上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13392 2026-05-20 cs.AI 79%

ReSS: Learning Reasoning Models for Tabular Data Prediction via Symbolic Scaffold

ReSS: 通过符号支架学习表格数据预测的推理模型

Chenlang Yi, Gang Li, Zizhan Xiong, Tue Minh Cao, Yanmin Gong, My T. Thai, Tianbao Yang

机构 * Department of Computer Science & Engineering, Texas A&M University(德克萨斯A&M大学计算机科学与工程系) Department of Computer Science, University of Florida(佛罗里达大学计算机科学系)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ReSS框架,通过符号支架结合神经推理模型,提升表格数据预测的准确性和可解释性,实验表明其在医疗和金融领域优于传统决策树和标准微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19895 2026-05-20 cs.AI 74%

Streamlined Constraint Reasoning via CNN Pattern Recognition on Enumerated Solutions

通过枚举解的CNN模式识别实现约束推理简化

Patrick Spracklen

专题命中 逻辑推理 :reasoning(title);分类 cs.AI

AI总结 本文提出了一种新的方法,通过枚举可行解并训练卷积神经网络来识别结构模式,从而生成MiniZinc约束流式器,以提高约束编程中硬问题的求解效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19077 2026-05-20 cs.CL cs.AI 62%

ReacTOD: Bounded Neuro-Symbolic Agentic NLU for Zero-Shot Dialogue State Tracking

ReacTOD:用于零样本对话状态跟踪的受限神经符号代理NLU

Yanjun Lin, Zimo Xiao, Kartik Natarajan, Mahesh Sankaranarayanan, Niraj Nawanit, Rakshit Parashar, Austin Zhang, Karthik Konaraddi, Rishita Mote, Wei Niu

机构 * Amazon(亚马逊)

专题命中 逻辑推理 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出ReacTOD,一种受限神经符号架构,通过在自我纠正的ReAct循环中将NLU重新表述为离散工具调用来解决零样本对话状态跟踪问题,其核心方法是确定性验证,主要贡献是实现了新的零样本状态-of-the-art结果。

Comments Accepted at TrustNLP Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18847 2026-05-20 cs.LG cs.AI 62%

Transformers Linearly Represent Highly Structured World Models

Transformer 通过线性方式表示高度结构化的世界模型

Roman Kniazev, Nathanaël Fijalkow

机构 * LaBRI, CNRS University of Bordeaux(LaBRI、CNRS 波尔多大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了Transformer在训练过程中是否能构建任务的内部模型,并发现其内部表示结构与领域结构相匹配,通过Sudoku求解轨迹训练的Transformer展示了其内部计算机制和稀疏可解释的决策电路。

详情

展开后加载摘要…

URL PDF HTML 收藏