arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-04 至 2026-05-04 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 6 篇

2509.23330 2026-05-04 cs.CL 83%

Structured In-context Environment Scaling for Large Language Model Reasoning

结构化上下文环境扩展用于大语言模型推理

Peng Yu, Zeyuan Zhao, Shao Zhang, Luoyi Fu, Xinbing Wang, Ying Wen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出SIE框架,通过自动构建结构化数据环境提升大语言模型的推理能力,实现可扩展性、通用性和可验证性,实验显示其在结构化推理和跨领域逻辑推理中的有效性。

Comments Title modified for greater clarity and better alignment with the paper's focus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26173 2026-05-04 cs.LG cs.AI cs.CL 80%

Entropy Centroids as Intrinsic Rewards for Test-Time Scaling

熵中心作为测试时缩放的内在奖励

Wenshuo Zhao, Qi Zhu, Xingshan Zeng, Fei Mi, Lifeng Shang, Yi R., Fung

机构 * HKUST(香港科技大学) ZJU(浙江大学) Huawei(华为)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出熵中心作为测试时缩放的内在奖励,通过分析不确定性的时间结构提升模型响应质量,在不同规模模型上均优于现有基线。

Comments Under Review, 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00436 2026-05-04 cs.CL cs.AI 73%

Impact of Task Phrasing on Presumptions in Large Language Models

任务表述对大语言模型中假设的影响

Kenneth J. K. Ong

机构 * AI.DA STC ST Engineering(AI.DA STC ST工程)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了任务表述如何导致大语言模型产生假设,影响其适应能力,通过囚徒困境实验发现中性表述可减少假设影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00798 2026-05-04 cs.LG cs.CL cs.MA 62%

RunAgent: Interpreting Natural-Language Plans with Constraint-Guided Execution

RunAgent:通过约束引导执行解释自然语言计划

Arunabh Srivastava, Mohammad A., Khojastepour, Srimat Chakradhar, Sennur Ulukus

机构 * University of Maryland, College Park(马里兰大学学院公园分校) NEC Laboratories America, Inc.(NEC美国实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 RunAgent通过约束引导执行解释自然语言计划,结合代理语言的显式控制构造,提升结构化工作流执行的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00334 2026-05-04 cs.AI cs.CL 62%

AgentFloor: How Far Up the tool use Ladder Can Small Open-Weight Models Go?

AgentFloor: 小型开放权重模型在工具使用阶梯上能走多远?

Ranit Karmakar, Jayita Chatterjee

机构 * Harvard University(哈佛大学) Boston, MA 02115(波士顿,马萨诸塞州 02115)

专题命中 逻辑推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 AgentFloor基准测试评估了16种开放权重模型在代理工作流中的能力边界,发现小型模型已能处理大部分结构化工具使用任务,而长周期规划仍需前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00034 2026-05-04 cs.CR cs.PL cs.SE 50%

Symbolic Execution Meets Multi-LLM Orchestration: Detecting Memory Vulnerabilities in Incomplete Rust CVE Snippets

符号执行与多LLM协调:在不完整的Rust CVE代码片段中检测内存漏洞

Zeyad Abdelrazek, Young Lee

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出结合符号执行(KLEE)与四代理多LLM架构,解决不完整代码问题,通过协作合成可编译的KLEE测试用例,检测Rust不安全代码中的内存漏洞,实现90.3%的测试用例编译成功率,检测到1,206个关键错误。

Comments 11 pages, 1 figure, to be published in : Ease 2026 The 6th International Workshop on Software Security Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏