arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-18 至 2026-08-18 共收录 9 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 9 篇

2608.14711 2026-08-18 cs.AI 新提交 83%

Beyond Pass@k: Measuring Reliability and Security of Agentic Code Generation

超越Pass@k:衡量智能体代码生成的可靠性与安全性

Jiajun Jiang, Sharon Zheng, Natan Vidra, Spurthi Setty

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Cornell University(康奈尔大学)

专题命中 代码评测 :code generation(title);repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 该研究指出AI编码智能体基准误用Pass@k指标,提出正确的Reliability@k及安全调整版,通过实验验证误用指标的偏差,还在SWE-bench试点中发现真实场景下的核心问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14863 2026-08-18 cs.SE cs.AI cs.DC 新提交 73%

Evaluating Agentic Code Repair Capabilities in Distributed Systems

评估分布式系统中智能体的代码修复能力

Yibo Yan, Huijuan Wang, Junzhou He, Yizhuo Liang, Shaoyu Wang, Huanchen Sun, Seo Jin Park

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14560 2026-08-18 cs.DC cs.SE 新提交 61%

Agentic Kernel Optimization: Generating State-of-the-Art GPU Kernels Without Hand-Written CUDA

智能体内核优化:无需手动编写CUDA即可生成最先进的GPU内核

Mao Luo, Hongbin Li, Feng Lin, Hanling Yi, Zhe Huang

专题命中 代码评测 :coding agent(abstract);分类 cs.SE;code generation(comments)

AI总结 该研究构建多智能体编排框架Houmao的GPU内核优化工作流,利用通用代码智能体在无需手动CUDA代码的情况下,生成的GPU内核在多个任务上实现远超PyTorch和FlashInfer基线的加速,在竞赛中取得最优结果,证明代码智能体可作为GPU内核开发的有效自主优化器。

Comments Technical report on AI code generation for practical GPU kernels on NVIDIA Blackwell GPUs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16638 2026-08-18 cs.SE 新提交 57%

ModBench: A Pipeline for Building Modelica Benchmark Datasets Mined from Library Repositories

ModBench:用于构建从库仓库挖掘的Modelica基准数据集的流水线

Masoud Sadrnezhaad, Martin Sjölund, Adrian Pop, José Antonio Hernández López, Torvald Mårtensson, Dániel Varró

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 ModBench是用于构建Modelica基准数据集的流水线,经其处理Modelica标准库得到含85562个类快照的公开数据集,可支持模型演化分析等相关研究。

Comments Extended abstract accepted at SAM 2026, co-located with MODELS 2026. To appear in the ACM/IEEE MODELS 2026 Companion Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15931 2026-08-18 cs.CL 新提交 57%

PLSQLBench: Benchmarking LLM Systems for Executable Procedural Database Programming

PLSQLBench:面向可执行过程式数据库编程的大语言模型系统基准测试

Marianne Menglin Liu, Leonid Boytsov, Daniel W. Peterson, Pramuditha Perera, Rongguang Wang, Sai Ashish Somayajula, Syed Hamza Rafique, Rohit Saini, Shubham Pathak, Sujeeth Bharadwaj, Tao Sheng, Graham Horwood, Fahad Shah, Ankan Bansal, Sujith Ravi, Dan Roth

机构 * Oracle AI, Turing Enterprise Inc(Oracle AI 图灵企业公司)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 本研究提出首个过程式数据库编程基准PLSQLBench,含2865个任务实例,经8个LLM实验发现其在多方面存在困难,工具增强智能体性能有提升但仍有差距,凸显了传统基准未覆盖的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15250 2026-08-18 cs.SE 新提交 57%

Comparing Domain-Model Similarity Metrics Against Human Expert Ratings

对比领域模型相似度指标与人类专家评分

Vasiliy Seibert

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文实现5种领域模型相似度指标,对比其与39组领域模型的人类专家评分,发现无单一指标在所有标准占优,集成多指标或可替代人类专家评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11216 2026-08-18 cs.AI 版本更新 57%

AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research

AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准

Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva, Harold Chaput, Mohammad Reza Taesiri

机构 * Electronic Arts(美国艺电公司) Simon Fraser University(西蒙菲莎大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 AutoWorldModel-Bench是面向AI编码智能体的闭环基准,涵盖8个游戏环境,采用结构化状态表征,64次会话中多数智能体通过研究式修改改进了世界模型,可评估智能体的开放式研究能力。

Comments Project page: this https URL (https://electronicarts.github.io/AutoWorldModelBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17216 2026-08-18 cs.AI 版本更新 57%

ML-AutoResearch: Training Machine Learning Research Agents with Automatically Generated Environments

通过合成任务扩展实现AI科学家

Ziyang Cai, Amir Saeidi, Harkirat Behl

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文提出一种合成环境生成管道,用于训练能从实践中学习的机器学习代理。通过真实数据集验证和自调试循环,生成高质量合成任务,提升Qwen3-4B和Qwen3-8B在MLGym上的性能,AUP指标分别提升9%和12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15205 2026-08-18 math.DG 新提交 50%

Geometric turbulence: a geodesic-regression crisis indicator for equity covariance dynamics, with evidence from African markets

几何湍流:用于股权协方差动态的测地回归危机指标——来自非洲市场的证据

E. B. Camara, Y. U. Gaba, I. G. M. Nsiloulou

专题命中 代码评测 :repository(abstract)

AI总结 该研究提出一种基于对称正定锥测地回归的几何湍流指标,可准确识别市场压力事件,其预测性能优于传统欧氏回归,对应的去风险策略能降低最大回撤。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏