arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-08 至 2026-07-08 共收录 9 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 9 篇

2607.06505 2026-07-08 cs.SE cs.AI cs.DB 新提交 62%

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

使用北美行业分类系统(NAICS)对GitHub仓库进行行业分类

Kevin Xu, Alexander Quispe

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究利用北美行业分类系统对GitHub仓库进行行业分类,提出结合多种技术的检索与验证管道生成标签,构建NAICS-GH语料库,测试表明标签精度高,还对预训练编码器进行基准测试,相关数据和代码开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06125 2026-07-08 cs.SE cs.AI cs.CR 新提交 62%

Evaluating Fine-Tuning and Metrics for Neural Decompilation of Dart AOT Binaries

评估Dart AOT二进制文件神经反编译的微调与指标

Raafat Abualazm, Ayman AboElhassan, Amr G. Wassal

机构 * Cairo University Computer Engineering Department, Faculty of Engineering(开罗大学计算机工程系,工程学院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究针对Dart AOT二进制文件神经反编译,在新基准上用三个指标评估六种微调模型变体,发现无微调配置能显著提升pass@k,存在跨语言干扰及指标差异,指出汇编序列长度是任务难度关键预测指标,贡献新基准等并明确pass@k为主要评估指标。

Comments Under review at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05638 2026-07-08 cs.SE cs.AI 新提交 62%

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems

EvalLoop:一种用于商业人工智能系统评估驱动迭代改进的方法

Kenneth Benavides, Josh Fleischer, Danti Chen

机构 * Robert Half(罗伯特·哈夫公司)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究针对商业AI系统评估忽视迭代改进价值的问题,提出EvalLoop方法,通过维度指标分组、故障模式分类和结构化迭代工作流程,实现评估驱动的迭代改进,经案例研究验证有效,还能助力模型选择与部署权衡,且被打包为可重用工件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05443 2026-07-08 cs.IR cs.AI cs.SE 新提交 62%

Scientific Code Search at Scale: A Multi-Domain Dataset and Benchmark

大规模科学代码搜索:多领域数据集与基准测试

Nishan Pantha, Pranath Reddy Kumbam, Sajil Awale, Pushwitha Krishnappa, Muthukumaran Ramasubramanian, Nidhi Jha, Emily Foshee, Ankur Kumar, Rachel Slank, Ashkbiz Danehkar, Rahul Ramachandran

机构 * The University of Alabama in Huntsville (UAH)(阿拉巴马大学亨茨维尔分校) Universities Space Research Association (USRA)(大学空间研究协会) NASA Marshall Space Flight Center(美国国家航空航天局马歇尔太空飞行中心)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对科学家在众多GitHub库中找相关软件难的问题,构建含多领域科学存储库的语料库,引入存储库搜索及代码片段检索两个基准测试,揭示不同领域性能差异,相关数据集和基准已公开,助力科学工具发现研究。

Comments Datasets and benchmarks publicly released on HuggingFace. Code released on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14948 2026-07-08 cs.SE cs.AI 新提交 62%

Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment

超越正确性:通过可扩展的智能体判断标注增强代码大模型的架构推理能力

Kirill Vasilevski, Ximing Dong, Benjamin Rombaut, Milad Soltany, Ruochen Deng, Jiahuei Lin, Arthur Leung, Dayi Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) School of Computing, Queen’s University, Canada(皇后大学计算科学学院)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对代码大模型缺乏架构理解的问题,提出智能体判断流水线,利用强LLM作为专家架构评估的代理,通过两个判断器(ACJ和AQJ)实现可扩展标注,微调模型在SWE-bench上提升高达540%,并展现跨语言泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06413 2026-07-08 stat.ME cs.AI 新提交 61%

An Experimental Design Approach to Evaluating Agentic AI's Autonomous Model Discovery

一种评估智能体人工智能自主模型发现的实验设计方法

Hao He, Xueying Liu, Chris J. Kuhlman, Xinwei Deng

机构 * Department of Statistics, Virginia Tech(统计学系,弗吉尼亚理工学院) Department of Statistical Science, Baylor University(统计科学系,贝勒大学) Advanced Research Computing, Virginia Tech(高级研究计算,弗吉尼亚理工学院)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI;repository(comments)

AI总结 研究大型语言模型编码智能体自主模型发现行为,提出实验设计与分析框架,将智能体视为随机模型发现算子,在多种受控因素下研究Codex和Claude Code两个算子,进行回归模型和推理,开发规范分解,通过网络造词游戏测试平台得出相关深刻发现。

Comments 39 pages, 11 figures, 6 tables. Data and code available at the GitHub repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06000 2026-07-08 cs.CR 新提交 50%

Context-to-Execution Integrity for LLM Agents

语言模型代理的上下文到执行完整性

Igor Santos-Grueiro

专题命中 代码评测 :repository(abstract)

AI总结 研究语言模型代理执行中的上下文到执行完整性问题,提出CXI系统,通过策略标记、类型化释放等机制保障安全执行,经多方面评估,在AgentDojo和代码代理基准测试等中取得良好效果,确保权限绑定才允许执行。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05413 2026-07-08 cs.CY 新提交 50%

Measuring the Invisible: Evaluating the Impact of Public Funding on Open Source Software

衡量无形:评估公共资金对开源软件的影响

Laia Domenech Burin

专题命中 代码评测 :repository(abstract)

AI总结 研究公共资金对开源软件的影响,结合目标-问题-指标框架与广义合成控制法,估计主权科技基金对OSS仓库活动的因果效应,发现资金对项目速度指标有显著正向影响,为公共OSS资金评估框架设计提供实践启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12995 2026-07-08 math.CO cs.DS 版本更新 50%

Extending Exact Integrality Gap Computations for the Metric TSP

扩展度量TSP的子游走松弛整数规划间隙计算

William Cook, Stefan Hougardy, Moritz Petrich

专题命中 代码评测 :repository(abstract)

AI总结 本文通过扩展子游走松弛的整数规划间隙验证,发现n=11和n=12时极端点列表不完整,并将极端点枚举扩展到14个顶点,为4/3猜想提供支持。

Comments We extended the enumeration to n=15 in the general case

详情

展开后加载摘要…

URL PDF HTML 收藏