arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-14 至 2026-08-14 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 9 篇

2608.12325 2026-08-14 cs.AI cs.CL cs.LG 新提交 82%

Position: Reasoning is a Learnable Rule-Based Process

立场:推理是一个可学习的基于规则的过程

Rachel Lawrence, Jacqueline Maasch

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出推理是可学习的基于规则的过程,针对生成式AI社区推理定义模糊问题,给出操作定义与研究交流最佳实践清单,以保障推理评估的结构效度。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12374 2026-08-14 cs.CL cs.AI 新提交 82%

Are you Talking Logic to Me? Assessing Language Models Syllogistic Reasoning Capabilities

你在跟我讲逻辑吗?评估语言模型的三段论推理能力

Hanna Abi Akl, Fabien Gandon, Catherine Faron, Pierre Monnin

机构 * Université Côte d’Azur(科特阿祖尔大学) Inria(法国国家信息与自动化研究所) CNRS(法国国家科学研究中心) I3S(信息科学与系统实验室) Data ScienceTech Institute(数据科学技术学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究通过扩展FOLIO和P-FOLIO数据集,探究不同KR符号对SLMs三段论推理的影响,提出SEF分类法并开源CLGC框架,为提升小型模型推理能力提供了新方法。

Comments Accepted to the International Joint Conference on Rules and Reasoning (RuleML+RR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13268 2026-08-14 cs.PL cs.LO 新提交 78%

Multiobjective Preexpectation Reasoning for Probabilistic Programs

概率程序的多目标预期望推理

Lena Verscht, Hannah Mertens, Kevin Batz, Sebastian Junges, Benjamin Lucien Kaminski, Joost-Pieter Katoen

专题命中 逻辑推理 :reasoning(title);planning(abstract)

AI总结 针对带非确定性的概率程序规划问题,提出多目标预期望变换器及对应策略综合规则,构建了无限MDP上多目标优化的程序层面符号方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12486 2026-08-14 cs.CL 新提交 77%

DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution

DIVE:通过多样性驱动的技能进化解锁冻结语言模型的自我提升

Siheng Xiong, Ali Payani, Oguzhan Gungordu, Faramarz Fekri

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 DIVE是一种多样性驱动的无参数框架,可让冻结LLM从任务经验和验证器反馈中进化出自然语言技能,在多项推理任务上优于现有方法,还能实现模型间技能迁移,让小模型性能匹配或超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12426 2026-08-14 cs.AI cs.CL 新提交 73%

Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction

大语言模型能遵循指令,但无法同时遵循太多:组合约束满足中的相变

Mariya I. Vasileva

机构 * Meta Superintelligence Labs(元超级智能实验室)

专题命中 逻辑推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出约束饱和评估基准,发现大语言模型在同时遵循5-6个以上指令约束时可靠性崩溃,不同类型约束的性能下降幅度存在差异,失败呈近独立的乘法累积效应。

Comments 35 pages, 7 figures, 13 tables. Reviewed in the ARR May 2026 cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12599 2026-08-14 cs.AI cs.LG 新提交 62%

Dead text or binding clause? Measuring and restoring constraint influence in black-box LLM dialogues

无效文本还是绑定条款?测量并恢复黑盒大语言模型对话中的约束影响

Haoyuan Zhu

机构 * University of Sheffield(谢菲尔德大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对黑盒大语言模型对话中撤销约束失效的问题,提出 sysname 方法,通过合约账本、顺序消融探针和修复阶梯实现复发率的测量、预测与修复,降低了约束撤销的失效概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13450 2026-08-14 cs.SE cs.CR cs.LG 新提交 57%

LLM-Assisted Dynamic Threat Analysis for Attacker-Reachable Software Weaknesses in Autonomous Vehicles

大语言模型辅助的自动驾驶车辆中攻击者可及软件弱点的动态威胁分析

Md Wasiul Haque, Sagar Dasgupta, Mizanur Rahman, Md Rayhanur Rahman

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对自动驾驶车辆软件弱点的动态威胁分析难题,探究LLM辅助Autoware的自动化测试工件生成,发现构建集成是核心障碍,推理模型编译测试用例的表现优于代码专用模型。

Comments 17 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11344 2026-08-14 cs.CY cs.AI q-fin.RM 版本更新 57%

Governing Agentic AI in FinTech

金融科技中智能体人工智能的治理

Henry Han

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 针对金融科技中智能体AI治理研究不足的问题,构建多层次治理理论,通过三项研究验证其机制,发现可验证性缺口是核心约束,该框架可扩展至其他高风险领域。

Comments 58 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03421 2026-08-14 cs.MA 版本更新 50%

When Truth Is Distributed: Misinformation Derails Collective Fact Recovery in LLM-Based Multi-Agent Systems

当真相被分散时:错误信息会破坏基于大语言模型(LLM)的多智能体系统中的集体事实恢复

Chenfei Yan, Zeyang Yue, Feifei Zhao, Erliang Lin, Lu Jia, Haibo Tong, Mingyang Lyu, Chengyi Sun, Yi Zeng

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本研究提出Hi-Agreement评估框架,发现基于LLM的多智能体系统中,关键证据持有者的虚假证词会破坏集体事实恢复,使恢复率从72.50%降至14.17%,且虚假证据会持续传播。

详情

展开后加载摘要…

URL PDF HTML 收藏