arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-03 至 2026-07-03 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 10 篇

2605.23965 2026-07-03 cs.AI cs.LG cs.SE 版本更新 88%

LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs

LGMT:基于逻辑的蜕变测试用于评估LLMs的推理可靠性

Zenghui Zhou, Man Li, Xiaoke Fang, Xinyi Zhou, Weibin Lin, Zheng Zheng

机构 * School of Automation Science and Electrical Engineering, Beihang University(自动化科学与电气工程学院,北京航空航天大学)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出LGMT框架,利用一阶逻辑推导蜕变关系,通过一致性检查评估LLM推理的鲁棒性,揭示传统评估忽略的隐藏缺陷。

Comments Zheng Zheng is the corresponding author

Journal ref Knowledge-Based Systems, Volume 348, 2026, 116324, ISSN 0950-7051

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02112 2026-07-03 cs.LG cs.CL 版本更新 81%

Recursive Models for Long-Horizon Reasoning

长程推理的递归模型

Chenxiao Yang, Nathan Srebro, Zhiyuan Li

机构 * Toyota Technological Institute at Chicago(丰田技术研究所)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出递归模型,通过递归调用自身在隔离上下文中解决子任务,突破上下文长度限制,理论证明可指数级降低活跃上下文需求,实验验证在SAT求解和围棋任务中提升长程准确性。

Comments in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02491 2026-07-03 cs.AI 新提交 79%

G-RRM: Guiding Symbolic Solvers with Recurrent Reasoning Models

G-RRM:用循环推理模型引导符号求解器

Timo Bertram, Sidhant Bhavnani, Richard Freinschlag, Erich Kobler, Andreas Mayr, Günter Klambauer

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出神经符号方法G-RRM,将符号等变循环推理模型与回溯或SAT求解器结合,通过神经引导提升约束满足问题的搜索效率,在9×9数独上回溯加速33.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01595 2026-07-03 cs.AI cs.CL 新提交 73%

Safe and Adaptive Cloud Healing: Verifying LLM-Generated Recovery Plans with a Neural-Symbolic World Model

安全且自适应的云修复:使用神经符号世界模型验证LLM生成的恢复计划

Junyan Tan, Haoran Lin, Siyuan Guo, Yichen Fang, Xinyue Luo, Tianyu Shen, Zeyu Qiao

机构 * Zhejiang University(浙江大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 提出PASE框架,将LLM作为规划引擎生成恢复计划,通过神经符号世界模型验证可行性,并利用DRL优化提示,实现动态自适应修复,显著降低恢复时间并提高未知故障检测精度。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20091 2026-07-03 cs.CL cs.AI 版本更新 73%

CreativityPrism: A Cross-Domain Evaluation Framework for Large Language Model Creativity

CreativityPrism:大语言模型创造力的跨域评估框架

Zhaoyi Joey Hou, Bowei Alvin Zhang, Yining Lu, Bhiman Kumar Baghel, Anneliese Brei, Ximing Lu, Meng Jiang, Faeze Brahman, Snigdha Chaturvedi, Haw-Shiuan Chang, Daniel Khashabi, Xiang Lorraine Li

机构 * University of Pittsburgh(匹兹堡大学) Johns Hopkins University(约翰霍普金斯大学) University of Notre Dame(诺特丹大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出CreativityPrism框架,整合发散思维、创意写作和逻辑推理三个领域的八项任务,从质量、新颖性和多样性三个维度评估LLM创造力,发现前沿模型在创意写作和逻辑推理上领先,但在发散思维上无显著优势,且各维度间相关性弱。

Comments Published in Transactions on Machine Learning Research (06/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01623 2026-07-03 cs.AI cs.LG 版本更新 73%

MAGIK: Mapping to Analogous Goals via Imagination-enabled Knowledge Transfer

MAGIK: 通过想象力驱动的知识迁移映射到类比目标

Ajsal Shereef Palattuparambil, Thommen George Karimpanal, Santu Rana

机构 * Applied Artificial Intelligence Initiative, Deakin University School of IT, Deakin University(应用人工智能倡议,德克萨斯大学IT学院,德克萨斯大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出MAGIK框架,利用想象力机制将目标任务实体映射到源域类比物,实现零样本知识迁移,在MiniGrid和MuJoCo任务上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01306 2026-07-03 cs.AI 新提交 57%

PACE: A Neuro-Symbolic Framework for Plausible and Actionable Counterfactual Explanations

PACE: 一种用于合理且可操作的反事实解释的神经符号框架

Pavel Iakovets, Liyanapathiranage Sudeepika Wajirakumari Samarathunga, Martin Thomas Horsch, Fadi Al Machot

机构 * University of Klagenfurt(克拉根福大学) Norwegian University of Life Sciences(挪威生命科学大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出PACE框架,结合神经网络预测与符号推理,生成符合领域约束的可操作反事实解释,在Adult Income数据集上验证了可行性与可解释性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17965 2026-07-03 cs.SE cs.AI 版本更新 57%

BLAgent: Agentic RAG for File-Level Bug Localization

BLAgent: 一种面向文件级Bug定位的代理RAG

Md Afif Al Mamun, Gias Uddin

机构 * University of Calgary(卡尔加里大学) York University(约克大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BLAgent,一种新型代理RAG框架,用于文件级Bug定位,通过结合代码结构感知的仓库编码、双视角查询转换和两阶段代理重排序,提高了Bug定位的准确性和效率。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01742 2026-07-03 cs.CR cs.SE 新提交 50%

Knowledge Over Parameters: Evolving Smart Contract Vulnerability Detection

知识超越参数:演化智能合约漏洞检测

Yuqiang Sun, Han Liu, Ying Li, Yiran Zhang, Zong Cao, Ziyun Guo, Yang Liu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出EvoVuln框架,将漏洞检测转化为程序性知识演化问题,通过运行时反转控制架构和两阶段演化流水线,仅用少量标注样本自动合成并优化检测逻辑,在五种真实漏洞类型上实现71%宏平均F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01641 2026-07-03 cs.SE 新提交 50%

When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents

当智能体不停止:揭示LLM智能体中的无限循环

Xinyi Hou, Shenao Wang, Yanjie Zhao, Haoyu Wang

专题命中 逻辑推理 :planning(abstract)

AI总结 提出IAL-Scan静态分析工具,通过抽象智能体代码为Agent IR并构建循环依赖图,检测LLM智能体项目中因反馈路径未有效约束导致的无限循环故障,在6549个仓库中达到91.9%精度。

详情

展开后加载摘要…

URL PDF HTML 收藏