arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-18 至 2026-05-18 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 5 篇

2605.15967 2026-05-18 cs.AI cs.CV cs.LO 74%

Deterministic Event-Graph Substrates as World Models for Counterfactual Reasoning

确定性事件-图子结构作为世界模型用于反事实推理

Fabio Rovai

机构 * Tesseract Academy(Tesseract学院)

专题命中 逻辑推理 :reasoning(title);分类 cs.AI

AI总结 本文提出事件图子结构作为世界模型,通过结构化干预词汇fork日志来回答反事实查询,证明了解释性与反事实性查询的对偶性,并在CLEVRER验证规模上评估了基于领域无关子结构运行时的C++解释器。

Comments 10 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16207 2026-05-18 cs.AI cs.CL 62%

Confirming Correct, Missing the Rest: LLM Tutoring Agents Struggle Where Feedback Matters Most

确认正确,遗漏其余:LLM辅导代理在反馈最关键的地方表现不佳

Tahreem Yasir, Wenbo Li, Sam Gilson, Sutapa Dey Tithi, Xiaoyi Tian, Tiffany Barnes

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM在逻辑推理中的辅导性能,发现其在区分最优解、次优解和错误解方面存在系统性偏差,影响适应性教学效果。

Comments 22 pages, 20 fgures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16052 2026-05-18 cs.AI cs.CL 62%

Reasoners or Translators? Contamination-aware Evaluation and Neuro-Symbolic Robustness in Tax Law

理由者还是翻译者?面向污染的评估与税法中的神经符号鲁棒性

Parisa Kordjamshidi, Samer Aslan, Madhavan Seshadri, Leslie Barrett, Enrico Santus

机构 * Bloomberg(彭博社) Michigan State University(密歇根州立大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了税法推理中LLM性能受数据污染影响的问题,提出神经符号框架提升法律AI的可靠性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15393 2026-05-18 cs.LG 57%

LPDS: Evaluating LLM Robustness Through Logic-Preserving Difficulty Scaling

LPDS:通过逻辑保持难度扩展评估LLM鲁棒性

Philipp Mondorf, Samuel J. Bell, Jesse Dodge, Dieuwke Hupkes

机构 * FAIR at Meta(Meta 的 FAIR 部门) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出LPDS框架,通过系统搜索逻辑保持变化来评估LLM鲁棒性,发现难度增加导致性能下降,且微调困难变体能获得更一致的鲁棒性提升。

Comments 41 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16197 2026-05-18 cs.HC 50%

Position: AI as Part of Self -- Extending the Mind Requires Cognitive Co-Regulation

位置:AI作为自我的一部分——扩展心智需要认知共调节

Alina Gutoreva, Fendi Tsim, Trisevgeni Papakonstantinou

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文探讨了AI作为自我组成部分的重要性,强调认知共调节在人机认知系统中的必要性,指出传统约束无法实现安全与对齐,需通过人机协同调节来达成。

详情

展开后加载摘要…

URL PDF HTML 收藏