arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-16 至 2026-07-16 共收录 15 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 2 篇

2607.13820 2026-07-16 cs.SE 新提交 79%

PROBE: Benchmarking Code Generation in Large Language Models

PROBE:大语言模型中代码生成的基准测试

Rodrigo Pato Nogueira, Marco Vieira, João R. Campos

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 针对大语言模型代码生成评估不足,介绍PROBE基准框架,基于多维度评估代码,用于评估多种模型和语言,发现LLMs虽有成果,但处理难题及小模型在特定语言上有困难,且常因易避免错误失败。

Comments Accepted for publication in Empirical Software Engineering (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13407 2026-07-16 cs.DB 新提交 50%

From Interpretation to Compilation: Compilation-Based Execution of Semantic Operators [Vision]

从解释到编译:基于编译的语义算子执行 [视觉]

Wenkai Dong, Yifan Wang

专题命中 代码生成 :program synthesis(abstract)

AI总结 研究语义算子系统执行效率问题,提出基于编译的执行方法,在编译时调用LLM将算子规范转为可执行代码,本地运行减少调用次数,应用于多种算子并集成到系统,初步结果显示减少了执行时间和调用次数,还拓展了LLM在该领域的角色认知。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2607.13091 2026-07-16 cs.SE cs.AI 新提交 84%

Self-Improving AI Coding Agents Through Accumulated Behavioral Rules: A Closed-Loop Framework

通过累积行为规则实现自我改进的人工智能编码代理:一个闭环框架

Aditya Aggarwal, Nahid Farhady Ghalaty

机构 * Microsoft(微软)

专题命中 软件智能体 :coding agent(title,abstract);code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究基于大语言模型的编码代理重复犯错问题,提出闭环框架,将审查评论编码为行为规则,经实验验证其能转移审查重点、降低错误复发率且跨接口转移,实现跨会话学习且不更新权重,积累人类工程智慧。

Comments Already presented and accepted in - 32nd ICE IEEE/ITMC Conference (ICE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13080 2026-07-16 cs.SE cs.AI 新提交 81%

Inference Economics of Enterprise Coding Agents: A Case Study of Cloud vs. On-Premise LLMs

企业编码代理的推理经济学:云与本地大语言模型的案例研究

Sheng-Wei Peng, Yi-Hsun Lin, Yi-Pei Lee

机构 * PEGAVERSE Pegatron Corporation(PEGAVERSE 联合科技公司)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究企业编码代理中云与本地大语言模型的权衡,通过案例研究对比两者,发现提示缓存可大幅降低API成本,本地配置缺陷修复负担高,不同场景下各有成本优劣,混合路由网关在成本与质量间有平衡表现。

Comments 20 pages, 13 figures, 14 tables. Industrial longitudinal case study

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13085 2026-07-16 cs.CR cs.AI 新提交 79%

Baselines Before Architecture: Evaluating Coding Agents for Autonomous Penetration Testing

架构之前的基线:评估用于自主渗透测试的编码代理

Ananda Dhakal, Krish Neupane, Aarjan Chaudhary

机构 * Kroda Labs(Kroda实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究针对自主渗透测试,以默认编码CLI代理为基线,在XBOW基准上用不同模型运行,比较不同框架结果及模型扩展效果,发现专业框架有提升,普通代理也能解决不少问题,新模型可提升同一框架,强调未来评估应报告模型匹配的普通代理基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14075 2026-07-16 cs.SE 新提交 57%

VisualRepair: Dynamic Tool Calling and Region Focusing for Visual Software Issue Repair

VisualRepair:用于视觉软件问题修复的动态工具调用和区域聚焦

Jingyu Xiao, Zhongyi Zhang, Haoran Hou, Yuxuan Wan, Yuan Jiang, Yintong Huo, Michael R. Lyu

专题命中 软件智能体 :program repair(abstract);分类 cs.SE

AI总结 针对现代软件视觉信息利用难题,提出VisualRepair框架,通过图像类型感知工具调用和动态测试时区域聚焦两模块,在SWE-bench基准测试中性能超现有方法,有效提升自动视觉软件问题修复能力。

Comments The paper was completed in March 2026 and is currently under review. The code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14082 2026-07-16 quant-ph 新提交 50%

Building Shor's Algorithm in Lean: An Agentic Formalization of Quantum Attacks on RSA-2048 and P-256

在Lean中构建肖尔算法:对RSA - 2048和P - 256的量子攻击的智能形式化

Lei Zhang, Yusheng Zhao, Hongshun Yao, Xin Wang

专题命中 软件智能体 :software agent(abstract)

AI总结 研究在Lean中对肖尔算法及其变体进行形式化,采用智能形式化方法让软件代理分析、编写代码及修复证明,建立数学基础用于分析RSA - 2048和P - 256加密设置下的量子攻击,为量子密码分析及算法设计验证助力。

Comments 21 pages, including appendix; 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2607.13111 2026-07-16 cs.SE cs.AI 新提交 62%

SemaDiff: Identifying Semantic-Changing Commits with Generated Code and Tests

SemaDiff:使用生成的代码和测试识别语义变化的提交

Maha Ayub, Michael Konstantinou, Ahmed Khanfir, Nikolaos Tsantalis, Mike Papadakis

机构 * SnT, University of Luxembourg(卢森堡大学SnT分校) RIADI, ENSI, University of Manouba(突尼斯曼努巴大学RIADI与ENSI分校) Concordia University(康科德大学)

专题命中 程序修复 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究软件仓库挖掘中区分语义保留与变化提交的问题,提出SemaDiff方法,通过行为分析、生成额外调用方法及依赖类等,实现对提交的语义判断,实验表明该方法能较准确地区分,语义变化提交检测精度高。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 3 篇

2607.13104 2026-07-16 cs.AI cs.CL cs.LG 新提交 56%

Self-Improvements in Modern Agentic Systems: A Survey

现代智能系统中的自我改进:一项综述

Zhe Ren, Yimeng Chen, Dandan Guo, Guowei Rong, Tonghui Li, R. B. Xiong, Qingfeng Lan, Wenyi Wang, Li Nanbo, Yibo Yang, Mingchen Zhuge, Jürgen Schmidhuber

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) University of Alberta(阿尔伯塔大学) The Swiss AI Lab IDSIA/USI/SUPSI(瑞士人工智能实验室IDSIA/USI/SUPSI)

专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)

AI总结 综述现代自我改进智能体从研究走向部署,目标是经验驱动的可控进化。提出系统级框架,将智能体视为基础模型与操作支架的耦合配置,自我改进形式化为更新算子,还组织回顾了相关工作、应用、评估等内容并展望未来。

Comments 97 pages, 12 figures. Project page: https://selfimproving-agent.github.io/ Repository: https://github.com/selfimproving-agent/awesome-Self-Improving-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14027 2026-07-16 cs.NE 新提交 50%

SPECS: Speciated Evolutionary Circuit Synthesis

SPECS:特定进化电路合成

Yağız Gençer, Stefan Uhlich, Andrea Bonetti, Arun Venkitaraman, Chia-Yu Hsieh, Lorenzo Servadei

专题命中 代码评测 :repository(abstract)

AI总结 提出用于自动模拟电路合成的SPECS遗传算法,借鉴NEAT原理,重新制定基因组表示并调整遗传算子,纳入布线约束和物种形成,在计算电路合成任务中,其解决方案质量和可靠性优于基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13987 2026-07-16 cs.CR 新提交 50%

Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation

智能体技能安全:威胁模型、攻击、防御与评估

Sanket Badhe, Priyanka Tiwari

专题命中 代码评测 :repository(abstract)

AI总结 研究智能体可复用技能安全,提出SkillSec-Eval框架,刻画技能生命周期并开发威胁分类法,通过对327个真实技能实证评估,发现多阶段有漏洞,强调需进行生命周期感知安全分析。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 4 篇

2607.13439 2026-07-16 cs.CR cs.SE 新提交 79%

DREA: Decoupled Reasoning and Exploration Agents for Repository-Level Vulnerability Detection

DREA:用于仓库级漏洞检测的解耦推理与探索代理

Mingyang Sun, Guozhu Meng

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 研究针对大语言模型用于仓库级漏洞检测时的不足,提出DREA框架,通过规划与探索代理解耦,实现目标导向上下文获取。构建RepoPairBench评估,提升配对正确性,降低成本,还发现安全推理质量是当前大语言模型的瓶颈。

Comments Accepted for presentation at Internetware 2026. 12 pages, 4 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13285 2026-07-16 cs.AI cs.SE 新提交 73%

Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable

Harness手册:使不断演进的智能体框架具有可读性、可导航性和可编辑性

Ruhan Wang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Yue Yu, Junyao Yang, Kishan Panaganti, Haitao Mi, Dongruo Zhou, Leoweiliang

机构 * Tencent(腾讯) Indiana University(印第安纳大学) University of Maryland, College Park(马里兰大学帕克分校) University of Georgia(佐治亚大学) National University of Singapore(新加坡国立大学)

专题命中 仓库级理解 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究智能体框架演进中行为定位难的问题,提出通过Harness手册和行为引导的渐进式披露,以行为为中心自动合成框架表示并辅助规划,提高行为定位和编辑计划质量,助力复杂智能体系统发展。

Comments 29 pages, 6 figures. Project page: https://ruhan-wang.github.io/Harness-Handbook/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13069 2026-07-16 cs.AI cs.CL cs.LO 新提交 62%

Interventional Grounding Audits: Black-Box Premise-Dependency Tests for LLM Chain-of-Thought via Predicate Substitution

介入式基础审计:通过谓词替换对大语言模型思维链进行黑盒前提依赖性测试

Hironao Nakamura

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型思维链前提依赖性问题,提出介入式基础审计方法,通过谓词替换干预前提并重新运行模型,在ProntoQA基准测试中检测前提依赖性表现优异,还发现了“正确答案,错误推理”信号。

Comments Accepted at the ICLR 2026 Workshop on Logical Reasoning of Large Language Models (https://iclr.cc/virtual/2026/10017466)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13277 2026-07-16 math.AG math.OC 新提交 50%

Euclidean Distance Degrees in Macaulay2

Macaulay2中的欧几里得距离度

William Huang, Jose Israel Rodriguez

专题命中 仓库级理解 :repository(abstract)

AI总结 介绍用于计算欧几里得距离度的Macaulay2软件包,它有基于子式和余法丛的符号方法及数值代数几何工具实现的数值方法,通过示例展示了其功能。

Comments to appear in Lecture Notes in Computer Science

详情

展开后加载摘要…

URL PDF HTML 收藏