arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-29 至 2026-07-29 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 4 篇

2607.25996 2026-07-29 cs.SE 新提交 78%

RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models

RepoReasoner:评估长上下文语言模型的仓库级代码推理能力

Yanlin Wang, Suiquan Wang, Yanli Wang, Bowen Zhang, Daya Guo, Jiachi Chen, Zibin Zheng

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 研究针对现有代码推理基准测试局限,引入RepoReasoner评估仓库级代码推理,通过多阶段管道构建基准,评估输出预测和调用链预测能力,发现当前LLMs在仓库级推理存在局限,为未来相关研究提供方向。

Comments Published in FSE'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25408 2026-07-29 cs.AI 新提交 57%

Context Assembly as the Controlled Variable: A Control-Theoretic View of Harness Policies for Frozen LLM Agents

作为受控变量的上下文组装:冻结大语言模型智能体利用策略的控制理论视角

Debjyoti Paul

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 研究聚焦大语言模型智能体,以往控制工具选择等,本文将上下文组装视为受控变量,通过上下文博弈或强化学习策略在线学习,进行形式分解、稳定性论证及不确定性校准分析,给出控制理论视角的相关证据。

Comments 6 pages, 2 figures, 1 table. Code and companion paper's data: https://github.com/dpaul0501/context-optimization-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14137 2026-07-29 cs.PL cs.AI cs.LO cs.SE 交叉投稿 57%

Untrusted Authors, Trusted Answers: A Calculus of Fidelity-Graded Translations

不可信作者,可信答案:保真度分级翻译演算

Christoph Kirsch

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 研究翻译问题,提出保真度分级翻译演算,该演算可按程序检查、通过粘贴组合,核心在Lean 4中机械化,在hurdy - gurdy平台实现,报告了多项实验结果,其增长模型通过任何人贡献语言对扩展语言支持。

Comments 29 pages. v2: rewritten on the two-plane principle; directional squares primary (exactness = the identity-embedding case, mechanized incl. the lax telescope); the answerability loop and its economy (demand books, recommended-then-registered); post-snapshot exhibits. Code, evidence, Lean mechanization: https://github.com/cksystemsgroup/hurdy-gurdy (tag arxiv.2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05775 2026-07-29 cs.CL cs.CY 版本更新 57%

Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM

守护者与违规者:大语言模型有害内容生成与安全缓解研究综述

Chi Zhang, Changjia Zhu, Junjie Xiong, Xiaoran Xu, Lingyao Li, Yao Liu, Zhuo Lu

机构 * University of South Florida(佛罗里达州立大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 综述大语言模型在内容创作中带来的风险与挑战,系统回顾相关研究,提出危害与防御统一分类法,分析越狱策略,评估缓解措施,指出评估局限,明确未来研究方向以推动语言技术稳健且符合伦理发展。

详情

展开后加载摘要…

URL PDF HTML 收藏