arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-18 至 2026-08-18 共收录 29 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2608.16742 2026-08-18 cs.SE cs.AI 新提交 84%

TDD-Agent: Test-Driven Reasoning for Code Generation

TDD-Agent:用于代码生成的测试驱动推理

Hongyue Yu, Kefan Li, Jiakun Li, Hongzheng Chai, Yuan Yuan, Rui He, Junyi Wei

专题命中 代码生成 :code generation(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14659 2026-08-18 cs.AI cs.LG cs.SE 新提交 82%

When Uncertainty Isn't Enough: An Empirical Study of Self-Correction in Code Generation

当不确定性还不够时:代码生成中自校正的实证研究

Pranav Rakasi, Maanas Lalwani, Arnav Srivastava, Arya Palanivel, Tinuade Adeleke, Ruizhe Li, Sean Wu

机构 * University of Michigan(密歇根大学) New York University(纽约大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Algoverse AI University of Aberdeen(阿伯丁大学) University of Oxford(牛津大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本研究通过实证发现,针对代码生成的不确定性估计方法难以可靠提升生成准确率,仅基于验证的自校正策略可显著提升Pass@1指标,廉价不确定性估计器仅适合作为校正循环的门控信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15510 2026-08-18 cs.AI 新提交 79%

Who Leads Now? Token-Level Modality Arbitration for Chart-to-Code Generation

当前谁主导?用于图表转代码生成的令牌级模态仲裁

Qinghao Fu, Yarong Wang, Shunlei Ning, Yilin Wang, Shunwen Bai, Xinda Wang, Jiaotuan Wang, Yinan Nie, Wei Zhou

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 提出MoCA模型,通过CAB分离视觉与编码能力并动态仲裁贡献,经两阶段训练后在三个基准测试中取得与同类模型相当的图表转代码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16187 2026-08-18 cs.CR cs.AI cs.SE 新提交 73%

Securing AI-Generated Code: A Just-in-Time Vulnerability Detection and Remediation Pipeline

保护AI生成代码:一种即时漏洞检测与修复流水线

Mikhail Surikov

专题命中 代码生成 :code generation(abstract,abstract_cn);分类 cs.SE、cs.AI

AI总结 本文提出一种自动化安全评估流水线,可检测、修复AI生成代码的漏洞,在Claude的4种模型上评估发现,P2配置表现优于P1,Sonnet 4.6的修复效果最佳,且流水线有效性与初稿安全性不同。

Comments 7 pages, 8 tables, 2 figures. Georgia Institute of Technology Master's final practicum project. Code: this https URL (https://github.com/Droidsurikov/securing-ai-generated-code)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14653 2026-08-18 cs.LG cs.AI 新提交 62%

Do Uncertainty Signals Help? A Systematic Study of Uncertainty-Aware Decoding with Rollback Mechanisms

不确定信号是否有用?对带有回滚机制的不确定感知解码的系统研究

Xianzong Wu, Xiaohong Li, Yuejun Guo, Xinyang Liu, Tianlin Li, Junjie Wang, Qiang Hu

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文通过系统研究带有回滚机制的不确定感知解码,发现其可提升代码LLM的生成性能,其中token熵等信息论不确定信号效果最优,反馈引导的回滚是主要改进来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16302 2026-08-18 cs.SE 新提交 57%

Comparing the Quality of Code Generated by Vibe Coding Tools

比较 vibe 编码工具生成代码的质量

Gustavo da Mota, Kiev Gama

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本研究对比 Lovable、v0、Replit 三种 vibe 编码工具生成代码的结构质量,发现三者存在不同质量特征,选择工具需考量结构层面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16207 2026-08-18 cs.AI 新提交 57%

Competing at Every Price Point with Agentic Evolution over a Menu of LLMs

基于LLMs菜单的智能体进化,在每个价格点展开竞争

Andrew Borthwick

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本研究提出进化元智能体RoboPhD,通过对含9个LLM端点的菜单进行智能体进化,在DS-1000和PaperFindingBench两个任务上,除一个位置外占据所有帕累托前沿槽位,实现各价格点的竞争优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16484 2026-08-18 cs.CV 新提交 50%

Remote-Sensing City Layout Extraction with MLLM

基于多模态大语言模型(MLLM)的遥感城市布局提取

Zigan Zhou, Kai Li, Yupeng Deng

机构 * City University of Hong Kong(香港城市大学) University of Chinese Academy of Sciences(中国科学院大学) Aerospace Information Research Institute(空天信息创新研究院)

专题命中 代码生成 :code generation(abstract)

AI总结 本研究提出Code-as-City方法,利用MLLM将遥感顶视图图像转化为含平面与3D输出的可编辑城市布局,在CityLayout-100数据集上取得41.1%、48.3%的交并比,验证了视觉观测转城市代码的可行性。

Comments 4 pages, 2 figures, 4 tables. Accepted to IEEE APGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 7 篇

2608.16630 2026-08-18 cs.SE cs.LG 新提交 87%

The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks

编码智能体的工作集:仓库规模任务中的一致性债务

Bardia Mohammadi, Lars Klein, Aman Chadha, Akhil Arora, Laurent Bindschaedler

专题命中 软件智能体 :repository(title,abstract);coding agent(title);分类 cs.SE、cs.LG

AI总结 该研究针对仓库规模编码任务,建模一致性债务,通过7个模型和5个框架实验发现事实可用性决定编码结果,提出测试框架应核对编辑依赖事实可用性的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16295 2026-08-18 cs.CL 新提交 79%

Executable Code Knowledge: Code as a Native, Validation-Carrying Knowledge Representation for AI Coding Agents

可执行代码知识:作为AI编码智能体原生、带验证的知识表示的代码

Xueping Gao

机构 * Alibaba Cloud(阿里云)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL

AI总结 该研究提出可执行代码知识(ECK)及其单元ECKU,构建Python原型验证其在编码智能体任务中的效果,支持源绑定、验证等功能,为AI编码智能体提供了混合架构方案。

Comments 11 pages. Submitted to AgenticDev 2026, co-located with ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16022 2026-08-18 cs.SE 新提交 79%

OpenHarmony Bench: Evaluating LLMs and Coding Agents on OpenHarmony App Development

OpenHarmony Bench:评估LLM与编码智能体在OpenHarmony应用开发中的表现

Li Li, Han Hu, Tianjian Zhang, Xin Peng, Fangzhu Mao, Qingyu Zhang, Xiaoheng Xie, Zhongmin Tang, Zhihao Lin, Haolin Ruan, Miaomiao Dong, Liuchuan Zhu, Yue Li, Chi Chen, Wenkang Zhong, Mingfei Zhang, Yang Yu, Bo Sun, Chaorui Zhang, Weixi Zhang, Wei Han, Bo Bai, Kui Liu, Gang Fan, Siru Liu, Jiaqian Zhou, Jiali Sun, Yunbiao Dong, Wenhao Zhong, Yunhong Xu

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 该研究推出OPENHARMONY BENCH应用级编码基准,评估8个LLM驱动的DevEco Code在三类OpenHarmony ArkTS应用任务中的表现,发现新一代模型任务完成率更高、构建性接近饱和但行为正确性不足、spec驱动任务完成率最低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14876 2026-08-18 cs.CR cs.AI cs.CL cs.LG 新提交 67%

Workspace Topology as an Attack Vector in Agentic Coding Assistants

工作空间拓扑作为智能体代码助手的攻击向量

Alexandre G.R. Day, Pradeep Yadlapalli, Sriram Venkatapathy, Thomas Paniagua, Nick Raines, Sahil Wadhwa, Himanshu Kumar, Andy Luo, Sudeep Panyam, Rikhiya Ghosh, Pranab Mohanty, Giri Iyengar

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究将工作空间拓扑作为攻击向量,发现其会影响智能体代码助手的间接提示注入攻击成功率,高度模块化环境及安全提示可降低攻击成功率,为代码智能体安全测试提供实用价值。

Comments 15 pages, 10 figures. Preprint of a paper accepted at the Conference on Applied Machine Learning in Information Security (CAMLIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16801 2026-08-18 cs.AI cs.SE 新提交 62%

When Agents Coordinate: Measuring Coordination in Multi-Agent AI Coding

智能体协作:多智能体AI编码中的协作度量

Giuseppe Destefanis, Tomaso Aste

机构 * University College London(伦敦大学学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本研究引入时间网络工具度量多智能体AI编码团队的协作,分析团队规模、结构等对协作的影响,发现智能体存在主动获取隐藏评分材料的倾向,相关结果在封闭环境中得到复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14838 2026-08-18 cs.SE cs.CL cs.IR 新提交 62%

The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context

召回陷阱:固定预算代码上下文下,最大化召回率的检索器配置会降低问题解决效率

Alexander Adkins, Teimuraz Trapaidze

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL

AI总结 该研究发现,最大化召回率的检索器配置会降低代码修复的问题解决率,建议固定预算下不要按文件硬去重,应针对任务而非检索指标优化打包策略。

Comments 24 pages, 2 figures. Reproducibility artifact: Zenodo DOI https://doi.org/10.5281/zenodo.21879550

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15678 2026-08-18 cs.SE 新提交 57%

Where Accountability Lives: Mapping Human Responsibility to Workflow Artifacts in Agentic Software Development

责任归属:在智能体软件开发中将人类责任映射到工作流制品

Sabry E. Farrag

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 该研究分析智能体软件开发中责任归属的矛盾,替换验证分类法,发现责任归属方向相反,指出智能体工具未造成责任差距,相关数据已公开。

Comments 30 pages, 5 tables. Source collection of 118 archived documents and 12 processing scripts deposited at Zenodo, doi: https://doi.org/10.5281/zenodo.21965182

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 7 篇

2608.14711 2026-08-18 cs.AI 新提交 83%

Beyond Pass@k: Measuring Reliability and Security of Agentic Code Generation

超越Pass@k:衡量智能体代码生成的可靠性与安全性

Jiajun Jiang, Sharon Zheng, Natan Vidra, Spurthi Setty

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Cornell University(康奈尔大学)

专题命中 代码评测 :code generation(title);repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 该研究指出AI编码智能体基准误用Pass@k指标,提出正确的Reliability@k及安全调整版,通过实验验证误用指标的偏差,还在SWE-bench试点中发现真实场景下的核心问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14863 2026-08-18 cs.SE cs.AI cs.DC 新提交 73%

Evaluating Agentic Code Repair Capabilities in Distributed Systems

评估分布式系统中智能体的代码修复能力

Yibo Yan, Huijuan Wang, Junzhou He, Yizhuo Liang, Shaoyu Wang, Huanchen Sun, Seo Jin Park

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14560 2026-08-18 cs.DC cs.SE 新提交 61%

Agentic Kernel Optimization: Generating State-of-the-Art GPU Kernels Without Hand-Written CUDA

智能体内核优化:无需手动编写CUDA即可生成最先进的GPU内核

Mao Luo, Hongbin Li, Feng Lin, Hanling Yi, Zhe Huang

专题命中 代码评测 :coding agent(abstract);分类 cs.SE;code generation(comments)

AI总结 该研究构建多智能体编排框架Houmao的GPU内核优化工作流,利用通用代码智能体在无需手动CUDA代码的情况下,生成的GPU内核在多个任务上实现远超PyTorch和FlashInfer基线的加速,在竞赛中取得最优结果,证明代码智能体可作为GPU内核开发的有效自主优化器。

Comments Technical report on AI code generation for practical GPU kernels on NVIDIA Blackwell GPUs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16638 2026-08-18 cs.SE 新提交 57%

ModBench: A Pipeline for Building Modelica Benchmark Datasets Mined from Library Repositories

ModBench:用于构建从库仓库挖掘的Modelica基准数据集的流水线

Masoud Sadrnezhaad, Martin Sjölund, Adrian Pop, José Antonio Hernández López, Torvald Mårtensson, Dániel Varró

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 ModBench是用于构建Modelica基准数据集的流水线,经其处理Modelica标准库得到含85562个类快照的公开数据集,可支持模型演化分析等相关研究。

Comments Extended abstract accepted at SAM 2026, co-located with MODELS 2026. To appear in the ACM/IEEE MODELS 2026 Companion Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15931 2026-08-18 cs.CL 新提交 57%

PLSQLBench: Benchmarking LLM Systems for Executable Procedural Database Programming

PLSQLBench:面向可执行过程式数据库编程的大语言模型系统基准测试

Marianne Menglin Liu, Leonid Boytsov, Daniel W. Peterson, Pramuditha Perera, Rongguang Wang, Sai Ashish Somayajula, Syed Hamza Rafique, Rohit Saini, Shubham Pathak, Sujeeth Bharadwaj, Tao Sheng, Graham Horwood, Fahad Shah, Ankan Bansal, Sujith Ravi, Dan Roth

机构 * Oracle AI, Turing Enterprise Inc(Oracle AI 图灵企业公司)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 本研究提出首个过程式数据库编程基准PLSQLBench,含2865个任务实例,经8个LLM实验发现其在多方面存在困难,工具增强智能体性能有提升但仍有差距,凸显了传统基准未覆盖的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15250 2026-08-18 cs.SE 新提交 57%

Comparing Domain-Model Similarity Metrics Against Human Expert Ratings

对比领域模型相似度指标与人类专家评分

Vasiliy Seibert

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文实现5种领域模型相似度指标,对比其与39组领域模型的人类专家评分,发现无单一指标在所有标准占优,集成多指标或可替代人类专家评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15205 2026-08-18 math.DG 新提交 50%

Geometric turbulence: a geodesic-regression crisis indicator for equity covariance dynamics, with evidence from African markets

几何湍流:用于股权协方差动态的测地回归危机指标——来自非洲市场的证据

E. B. Camara, Y. U. Gaba, I. G. M. Nsiloulou

专题命中 代码评测 :repository(abstract)

AI总结 该研究提出一种基于对称正定锥测地回归的几何湍流指标,可准确识别市场压力事件,其预测性能优于传统欧氏回归,对应的去风险策略能降低最大回撤。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 7 篇

2608.14945 2026-08-18 cs.AI cs.CL 新提交 62%

Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL

信任并不足够:智能体强化学习中策略内自蒸馏的影响校准

Qizhen Lan, Xi Xiao, Xiangchen Guan, Mengchen Fan, Moule Lin, Jung Im Choi, Lijing Zhu

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 针对策略内自蒸馏的信任-效用不匹配问题,提出ICSD方法,在多基准任务上提升语言智能体性能,降低反向令牌的教师支持占比并提高梯度兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16262 2026-08-18 cs.SE 新提交 57%

Implicit, Yet Impactful: Understanding Hidden Dependencies in Java Projects

隐式却影响重大:理解Java项目中的隐藏依赖关系

Lyuye Zhang, Chengwei Liu, Fangyuan Zhang, Yiran Zhang, Yuan Zhou, Yang Liu

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本研究针对Java项目的隐式依赖问题,构建含1157个库、19812个版本及972个模块的数据集,量化其影响并分析应对措施,为开源生态系统提供解决方案。

Comments 13 pages, ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16112 2026-08-18 cs.SE 新提交 57%

Strategic Technical Debt: A Real Options Approach to Early-Stage Software Experimentation

策略性技术债务:早期软件实验的实物期权方法

Rashid Azarang, Mohammad Reza Azarang Esfandiari

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文将早期软件实验中刻意产生的技术债务视为看涨期权,明确策略性与有毒债务的边界,构建序贯模型得出关键结论,并开展两项预注册实证检验。

Comments 25 pages, 4 figures. Pre-registered empirical program: OSF bs3cr (EP3'), rvx5t (EP-Pi)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15881 2026-08-18 cs.LG cs.CE 新提交 57%

Deploying Frontier Agentic Technology in MOOSEnger, a Multiphysics-Capable AI Assistant

在多物理场AI助手MOOSEnger中部署前沿智能体技术

Zaid Abulawi, Mengnan Li, Guillaume Giudicelli, Yang Liu, Cody Permann

机构 * Texas A&M University (TAMU)(德克萨斯农工大学) Idaho National Laboratory (INL)(爱达荷国家实验室)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本研究为面向MOOSE框架的AI智能体MOOSEnger扩展本地托管模型管控层,经多类工程任务测试,MOOSEnger-GPT-5.2成功率达90%,凸显智能体管控层对多物理场仿真的支撑价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15102 2026-08-18 cs.CL 新提交 57%

A Declarative-Procedural Perspective on Expert Routing in Bilingual Mixture-of-Experts Language Models

双语混合专家语言模型中专家路由的声明式-过程式视角

Amrit Gopinath (1), Raghul (1), Durairaj Thenmozhi (2) ((1) Sri Sivasubramaniya Nadar College of Engineering, Chennai, India, (2) Shiv Nadar University Chennai, India)

机构 * Sri Sivasubramaniya Nadar College of Engineering(斯里·西瓦苏布拉马尼亚·纳达尔工程学院) Shiv Nadar University Chennai(钦奈希夫·纳达尔大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 该研究探究双语MoE语言模型的专家路由是否形成语言结构,对比课程学习与无课程训练的模型,发现无课程模型专业化更强但依赖随机种子,课程模型路由更均衡,揭示MoE路由可出现可解释语言组织。

Comments 15 pages, 6 figures, 12 tables (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15455 2026-08-18 stat.ME 新提交 50%

Competing-Risk Cure Models: A Five-Axis Systematic Review of Methodological Literature

竞争风险治愈模型:方法学文献的五轴系统综述

Nilotpal Sanyal

专题命中 仓库级理解 :repository(abstract)

AI总结 本文对26篇竞争风险治愈模型的方法学文献从五个维度进行系统综述,明确模型分类与差异,指出可重复性不足问题,为模型选择与相关研究提供支持。

Comments 34 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16418 2026-08-18 physics.chem-ph physics.atom-ph 新提交 50%

ChemReporter: A Framework for Curating and Exporting Large-Scale Chemical Datasets for MLIP Training

ChemReporter:用于整理和导出用于MLIP训练的大规模化学数据集的框架

Marie Bluntzer, Jules Tilly, Christoph Brunken

专题命中 仓库级理解 :repository(abstract)

AI总结 ChemReporter是一款模块化框架,可将异构大规模化学数据集转为统一可查询格式,经处理、查询、导出三个阶段生成MLIP可用训练数据,支持处理超内存规模数据集,已在GitHub和PyPI发布。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏