arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-20 至 2026-08-20 共收录 17 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 3 篇

2608.18565 2026-08-20 cs.SE 新提交 74%

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation

SemaPLC:一种基于项目、经验证门控的PLC代码生成智能体框架

Yanlun Tu, Huacan Wang, Ziyue Zhou, Jie Zhou, Ningyan Zhu, Ge Chen, Wangyi Chen, Tengfei Zhou, Yifan Zhou, Dasheng Yang, Xiaofeng Mou, Hui Zhang, Yi Xu

专题命中 代码生成 :code generation(title);分类 cs.SE

AI总结 SemaPLC是基于项目、经验证门控的PLC代码生成智能体框架,通过外部检查确认任务完成,在多模型的POU任务及项目上下文任务中均表现最优,动态行为测试得分显著高于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19009 2026-08-20 cs.CL 新提交 57%

Grading the Graders: Verification Autonomy Levels (L0-L5) for LLM Reasoning

评估评估者:面向大语言模型推理的验证自主等级(L0-L5)

Yajie Yin

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。

Comments Code and data: this https URL (https://github.com/1549080929-debug/math_agent) Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18279 2026-08-20 physics.optics cs.LG 新提交 57%

A Comprehensive Review of Large Language Models for Nanophotonics: From Surrogate Modeling to Autonomous Design

面向纳米光子学的大语言模型综合综述:从代理建模到自主设计

Huanshu Zhang, Kegeng Tang, Lei Kang, Sawyer D. Campbell, Zihao Wang, Douglas H. Werner

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 该综述探讨大语言模型(LLMs)如何通过语义接口、代码生成及工具编排改进纳米光子学工作流,梳理相关方法的两类模式及跨学科应用,展望具备物理感知的多模态基础模型,推动AI从被动工具向主动科研合作者转变。

Comments Accepted for publication in Advanced Photonics

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2608.18280 2026-08-20 cs.SE cs.AI cs.CL cs.LG 新提交 77%

What Makes Software Issue Resolution Tasks Difficult for Agents?

什么因素导致软件问题解决任务对智能体而言难度较高?

Ebtesam Al-Haque, Brittany Johnson

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 该研究提出测量框架,基于CoderForge-Preview数据集的实证分析,发现软件问题解决任务难度可通过静态特征预测,核心驱动因素为补丁碎片化与代码库规模,为构建难度可控的智能体评估基准奠定基础。

Comments To appear in ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18167 2026-08-20 cs.AI cs.SE 新提交 73%

Adversarial Review: Structured Disagreement for Grounded Agentic Code Review

对抗评审:基于结构化分歧的 grounded 智能体代码评审

Eric S. Qiu, Joyce Gill

机构 * Cornell University(康奈尔大学) Stanford University(斯坦福大学)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出对抗评审(AR)协议,仅用3个智能体实现结构化分歧的协作代码评审,在LiveCodeBench、SWE-PRBench等基准上优于多智能体基线,证明无需大量智能体即可完成高效代码评审。

Comments Accepted to ICML 2026 Workshop on DL4C

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18389 2026-08-20 cs.AI 新提交 70%

A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations

锯齿状前沿:评估代码智能体对语义保留转换的鲁棒性

Hasan Najib Mahmud (1), Shreya Gupta (2), Isha Chaudhary (3), Nathaniel Enis (1), Ravi Mangal (1), Gagandeep Singh (3), Corina Pasareanu (4) ((1) Colorado State University, (2) Microsoft, (3) University of Illinois Urbana-Champaign, (4) Carnegie Mellon University)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 该研究评估AI代码智能体对语义保留代码转换的鲁棒性,发现其存在锯齿状鲁棒性前沿,mini-SWE agent更鲁棒,顶级模型仍易受此类扰动影响,引发部署可靠性担忧。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18227 2026-08-20 cs.RO 新提交 50%

Revisiting the "Push-T" Robot Manipulation Task with Agentic Robotics

用智能体机器人技术重新审视“Push-T”机器人操作任务

Shuangyu Xie, Kaiyuan Chen, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :coding agent(abstract)

AI总结 该研究在智能体机器人技术背景下,借助带Fable 5的Claude Code编码智能体,无需演示数据解决Push-T等机器人操作任务,其策略成功率达100%,步骤比基准扩散策略少46%,还支持多字母操作及跨实体机械臂仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2608.18595 2026-08-20 cs.SE 新提交 79%

OdinEval: A Reproducible Benchmark for LLM-Based Program Repair in the Odin Programming Language

OdinEval:用于基于大语言模型的Odin编程语言程序修复的可复现基准测试

Bang Xie, Hao Liu, Zhiyuan Peng, Xin Yin, Senjian Zhang, Yuan Luo, Chenhao Ying, Haiming Jin, Wei Chen, Shaocong Long, Zhenyu Shi

专题命中 程序修复 :program repair(title);repository(abstract);分类 cs.SE

AI总结 针对Odin语言程序修复的空白,本文构建可复现基准OdinEval,评估6个语言模型,Kimi-K3解决率66.7%、Qwen3.8-Max复现率96.4%,发布配套多类资源。

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 2 篇

2608.19011 2026-08-20 cs.CR cs.AI 新提交 57%

From Threat Intelligence to Detection: Knowledge-driven Enrichment and Template-based Rule Grounding for Automated Sigma Rule Generation

从威胁情报到检测:知识驱动的丰富化与基于模板的规则落地用于自动化Sigma规则生成

Sepehr Ghaffarzadegan, Boubakr Nour, Makan Pourzandi, Mourad Debbabi, Chadi Assi

专题命中 测试生成 :repository(abstract);分类 cs.AI

AI总结 本研究设计了AUTOSIGMA,结合知识驱动丰富化等技术,将非结构化CTI报告自动生成Sigma规则,其在多项指标上优于其他方案。

Comments Submitted for publication and currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18645 2026-08-20 cs.SE 新提交 57%

Code Health in LLM-Based Test Generation: Effectiveness and Token Efficiency

基于大语言模型的测试生成中的代码健康度:有效性与标记效率

Freya Wirdemann, Markus Borg, Nadim Hagatulah, Adam Tornhill

专题命中 测试生成 :coding agent(abstract);分类 cs.SE

AI总结 本研究探究LLM生成单元测试的有效性随CodeScene的CodeHealth水平的变化,发现CH是测试有效性的微弱但一致信号,且与输入标记数负相关,证实可维护性与LLM软件开发存在关联。

Comments Accepted at the Engineering Track of the 26th IEEE International Conference on Source Code Analysis and Manipulation (SCAM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 2 篇

2608.18588 2026-08-20 cs.SE 新提交 57%

AppEval: A Unified Benchmark for LLM-Based Mobile Application Repair in ArkTS, Swift, and Kotlin

AppEval:面向基于大语言模型的ArkTS、Swift及Kotlin移动应用修复的统一基准

Bang Xie, Hao Liu, Zhenyu Shi, Yonghao Zhang, Senjian Zhang, Zhiyuan Peng, Xin Yin, Chenhao Ying, Yuan Luo, Wei Chen, Haiming Jin, Shaocong Long, Xu Liu, Zhe Peng

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本研究提出AppEval基准框架,评估基于大语言模型的移动应用修复智能体在ArkTS、Swift、Kotlin平台的表现,发现其性能因智能体而异,且运行时感知的接受标准对有意义的比较至关重要。

Comments 9 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18242 2026-08-20 cs.LG 新提交 57%

ClosureBench: A Constructive Benchmark for Compositional Graph Reasoning

ClosureBench:面向组合图推理的构造式基准

Stefano Goria (AIM Research Lab)

机构 * AIM Research Lab(AIM研究实验室)

专题命中 代码评测 :program synthesis(abstract);分类 cs.LG

AI总结 本研究推出ClosureBench基准,评估不同规模模型在组合图推理任务的表现,发现模型存在记忆效应、组合推理瓶颈,微调输出程序的模型可提升性能。

Comments 30 pages, 5 figures, 11 tables. Code and data: this https URL (https://github.com/egolabs-ai/closurebench)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 5 篇

2608.18827 2026-08-20 cs.LG cs.AI cs.CL 新提交 67%

MLREF: Efficient Module Reuse for Reward Design in Reinforcement Learning via Large Language Models

MLREF:基于大语言模型的强化学习奖励设计中高效模块复用框架

Chenglin Liu, Xun Wang, Ruishuo Chen, Zhuoran Li, Longbo Huang

机构 * Institute for Interdisciplinary Information Sciences Tsinghua University(清华大学交叉信息研究院)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对强化学习奖励设计瓶颈,提出MLREF框架,通过模块池复用奖励组件,结合三种优化机制,在17个任务上实现比强基线更优且更稳定的性能。

Comments 22 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18733 2026-08-20 cs.SE cs.AI cs.LG 新提交 67%

Flama: a Python framework for development and deployment of production-ready APIs, machine learning, and LLM services

Flama:用于开发和部署生产级API、机器学习及大语言模型服务的Python框架

José A. Perdiguero López, Miguel A. Durán-Olivencia

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 Flama是一款开源Python框架,基于ASGI构建,统一REST API开发、ML服务与LLM推理,含七大子系统及多项内置功能,可支持多后端LLM部署等场景。

Comments 83 pages, 6 figures, 1 table. Software available at this https URL (https://github.com/vortico/flama), up-to-date documentation at this https URL (https://flama.dev)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18933 2026-08-20 cs.SE cs.AI 新提交 62%

SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution

SkillForge:面向项目特定问题解决的自蒸馏智能体

Silin Chen, Han Li, Xiaodong Gu, Yuling Shi, Haibing Guan

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 SkillForge是一种主动从代码库获取项目特定知识的自蒸馏框架,通过合成问题蒸馏技能,可提升LLM智能体解决特定代码库软件问题的性能。

Comments Our code and data are available at this https URL (https://github.com/cslsolow/SkillForge)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18822 2026-08-20 cs.SE 新提交 57%

Contract-Aware Rescue of a Drifted Isabelle Development: The Double-Tank Case Study

感知契约的漂移Isabelle开发修复:双水箱案例研究

Jim Woodcock, Gabriel Leite, Augusto Sampaio, Ran Wei

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 针对Isabelle开发漂移问题,以双水箱控制器案例为研究对象,用CAPRI工具重构修复了10个义务,完成部分验证工作,为交互式定理证明器的开发维护提供了实践参考。

Comments 15 pages. Submitted to Formal Methods for Autonomous Systems 2026 (FMAS 2026). Reproducibility artefact: DOI https://doi.org/10.5281/zenodo.21981425

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19001 2026-08-20 cs.CY 新提交 50%

Open at the Edge, Captured at the Center: llama.cpp and the Political Economy of Local AI Inference

边缘开放,中心捕获:llama.cpp 与本地 AI 推理的政治经济学

Woohyeuk Lee, Hanlin Li, David Gray Widder

专题命中 仓库级理解 :repository(abstract)

AI总结 该研究以 llama.cpp 为对象,分析本地 AI 推理的政治经济动态,发现本地推理拓宽参与度却将控制权向基础设施相关方转移,呼吁政策关注推理基础设施以维持云外 AI 开放性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏