arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-03 至 2026-08-03 共收录 8 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4 篇

2604.05150 2026-08-03 cs.SE cs.AI 版本更新 81%

Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation

编译AI:基于LLM的工作流自动化确定性代码生成

Geert Trooskens, Aaron Karlsberg, Anmol Sharma, Lamara De Brouwer, Max Van Puyvelde, Matthew Young, John Thickstun, Gil Alterovitz, Walter A. De Brouwer

机构 * XY.AI Labs, Palo Alto, CA(XY.AI实验室,帕洛阿尔托) Stanford University School of Medicine, Stanford, CA(斯坦福大学医学院,斯坦福) Cornell University, Department of Computer Science, Ithaca, NY(康奈尔大学计算机科学系,伊萨卡) Brigham and Women’s Hospital / Harvard Medical School, Boston, MA(布莱根妇女医院/哈佛医学院,波士顿)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 本文研究编译AI,一种大语言模型在编译阶段生成可执行代码,随后工作流确定性执行的范式。重点探讨其在高风险企业工作流中的应用,尤其在医疗领域,强调可靠性与可审计性。

Comments 14 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12088 2026-08-03 cs.SE 版本更新 79%

Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation

结构化安全审计:在LLM生成代码的正确性与内容安全之间平衡

Honghao Tan, Haibo Wang, Shin Hwei Tan

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文提出NLSafety-Utility Duality Score和Dual Reasoning,通过结构化安全审计和任务导向的代码审查,提升LLM生成代码的安全性和正确性,实验显示其在多个模型上显著提升SUDS评分。

Comments 13 pages. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Artifact: https://doi.org/10.5281/zenodo.19245736

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10046 2026-08-03 cs.SE 版本更新 79%

Automated Table Reproduction via Code Generation

Artisan: 自动化代理评估

Doehyun Baek, Michael Pradel

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 Artisan通过自动化LLM代理生成重现脚本,提升软件工程研究结果的可重复性,生成44/60个有效脚本并发现20个新错误。

Comments Accepted at ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09161 2026-08-03 cs.LG cs.AI cs.AR 版本更新 62%

Wrong Code, Right Structure: Learning Netlist Representations from Imperfect LLM-Generated RTL

错误代码,正确结构:从不完美的LLM生成RTL学习网表表示

Siyang Cai, Cangyuan Li, Haoyu Gao, Kun Wang, Yinhe Han, Ying Wang

机构 * CICS, Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用不完美的LLM生成RTL进行网表表示学习,通过数据增强和端到端流程,提升电路分析任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 1 篇

2607.19338 2026-08-03 cs.AI 版本更新 79%

CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents

CodeRescue:用于编码智能体的预算校准恢复路由

Qijia He, Jiayi Cheng, Chenqian Le, Rui Wang, Xunmei Liu, Yixian Chen, Jie Mei, Zhihao Wang, Xupeng Chen, Yuhuan Chen, Tao Wang

机构 * University of Washington(华盛顿大学) New York University(纽约大学) ByteDance(字节跳动) Amazon(亚马逊)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究编码智能体失败后的预算部署问题,核心方法是将其制定为异构动作上的恢复路由并训练监督路由器,添加CRC层实现预算变化下的成本控制,主要贡献是校准前沿在多个方面优于基线,节省恢复成本。

Comments Withdrawn at the request of ByteDance because the manuscript was submitted before completing the company's required internal review and approval process

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2507.22580 2026-08-03 cs.SE cs.AI 版本更新 62%

RePaCA: Leveraging Reasoning Large Language Models for Static Automated Patch Correctness Assessment

RePaCA:利用推理型大语言模型实现静态自动化补丁正确性评估

Marcos Fuster-Pena, David de-Fitero-Dominguez, Antonio Garcia-Cabot, Eva Garcia-Lopez

专题命中 程序修复 :program repair(abstract);分类 cs.SE、cs.AI

AI总结 RePaCA是利用推理型大语言模型的静态APCA技术,经强化学习微调后在Defects4J测试集上达83.1%准确率,泛化能力优于现有方法,可准确识别过拟合补丁并提升可解释性。

Comments Final published version in the Neurocomputing journal. Volume 701, 7 November 2026, 134583. DOI: https://doi.org/10.1016/j.neucom.2026.134583

Journal ref Neurocomputing (7 November 2026), Volume 701, 134583

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 1 篇

2601.02430 2026-08-03 cs.SE cs.AI 版本更新 62%

WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics

WebCoderBench: 用全面且可解释的评估指标对Web应用生成进行基准测试

Chenxu Liu, Yingjie Fu, Wei Yang, Ying Zhang, Tao Xie

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出WebCoderBench,首个基于真实用户需求的Web应用生成基准,包含1572个真实用户需求及24个细粒度评估指标,结合规则和LLM评估方法,提供可解释的评估结果,实验显示无单一最优模型,为模型优化提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 1 篇

2602.08913 2026-08-03 cs.LG stat.ML 版本更新 57%

GEMSS: A Variational Method for Discovering Multiple Sparse Solutions in Classification and Regression Problems

GEMSS: 一种用于在分类和回归问题中发现多个稀疏解的变分贝叶斯方法

Kateřina Henclová, Václav Šmídl

机构 * Faculty of Electrical Engineering, Czech Technical University(捷克技术大学电子工程系)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 提出GEMSS算法,利用结构化spike-and-slab先验、高斯混合近似后验和Jaccard惩罚,通过变分推断同时发现多个多样化的稀疏特征组合,在128个实验和3个真实数据集上优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏