arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-27 至 2026-07-27 共收录 10 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 3 篇

2607.22471 2026-07-27 cs.SE cs.AI 新提交 81%

MineValiCoder: Reliable Code Generation with Test Case Quality Mining and Bipartite Graph-Based Mutual Validation

MineValiCoder:通过测试用例质量挖掘和基于二分图的相互验证实现可靠的代码生成

Zhen Zhao, Qihang Yang, Feifei Dai, Xiangfang Li, Bo Li

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 研究针对基于大语言模型的测试驱动开发中现有方法的不足,提出MineValiCoder框架,通过测试用例质量挖掘、并行TDD优化和二分图代码-测试相互验证三个模块,有效减轻LLM随机性,提升自动代码生成可靠性,在多基准测试中表现优异。

Comments 12 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21677 2026-07-27 cs.SE cs.AI 新提交 62%

Enhancing SLMs for Sustainable Code Optimization in Radio-Astronomy

增强小型语言模型以实现射电天文学中的可持续代码优化

Elisa Chiarotto, Jingbo Li, P. Chris Broekema, Rob V. van Nieuwpoort

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究利用小型语言模型(SLMs)优化射电天文学代码,通过多采样生成策略和纳入编译器反馈两种方式增强SLMs,提高代码生成质量和性能,用更少计算资源匹配或超越大型单生成模型,且使所有测试模型持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21609 2026-07-27 cs.AI 新提交 57%

Coupled Hierarchical Search over Topology and Execution for Agentic Workflow Synthesis

用于智能工作流合成的拓扑与执行耦合分层搜索

Dong Li, Yanchi Liu, Xujiang Zhao, Wei Cheng, Zhengzhang Chen, Xintao Wu, Zhong Chen, Chen Zhao, Haifeng Chen

机构 * Baylor University(贝勒大学) NEC Laboratories America(美国NEC实验室) University of Arkansas(阿肯色大学) Southern Illinois University(南伊利诺伊大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 针对大语言模型结构化工作流创建自动化难题,提出拓扑与执行耦合的搜索范式,引入HierFlow架构,通过反馈引导拓扑调整与树搜索优化子工作流,经多基准测试验证其性能优于基线,平衡了质量与效率且无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2607.21832 2026-07-27 cs.SE cs.LG 新提交 81%

How Do AI Coding Agents Contribute to Software Development? an Empirical Study of Agentic Pull Requests

人工智能编码代理如何为软件开发做出贡献?对代理拉取请求的实证研究

Iren Mazloomzadeh, Mohammad Mehdi Morovati, Foutse Khomh

机构 * Polytechnique Montréal(蒙特利尔大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.LG

AI总结 研究人工智能编码代理对软件开发的贡献,通过AIDev数据集,分析代理与人工生成PR的合并率差异、任务分布及关键特征,从实证和纵向角度理解其在软件开发中的作用、优点及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21909 2026-07-27 cs.SE 新提交 79%

Claim Plane: Enforceable Change Intents and Dynamic Scope for Parallel Coding Agents

声明平面:并行编码代理的可执行变更意图和动态范围

Maxim Nikolaev

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究并行编码代理变更问题,提出声明平面架构,工作者声明变更意图,控制平面管理,执行时处理突变,通过CooperBench机制检查展示可行性,为未来模型升级提供基础。

Comments 10 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21674 2026-07-27 cs.SE 新提交 79%

Output Format x Model Identity: Interaction Effects in Single-Round Coding Agent Performance

输出格式x模型标识:单轮编码代理性能中的交互效应

Yang Yang

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究输出格式与模型交互对单轮编码代理性能的影响,通过多模型、多格式、多任务实验发现无普遍最优格式,有格式滥用问题,提出特定于模型的输出策略及工具设计原则并开源数据模板。

Comments 16 pages, 7 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21629 2026-07-27 hep-ph hep-th 新提交 67%

Scattering Amplitudes as Programs: Self-Evolving Search for Theory and Event Generation

作为程序的散射振幅:理论与事件生成的自演化搜索

Yi Gu, Sven Krippendorf

专题命中 软件智能体 :repository(abstract);coding agent(abstract)

AI总结 该研究将散射振幅视为程序,连接揭示解析结构与构建数值评估器的目标。通过自演化程序搜索进行缩放、结构和精确操作搜索,优化振幅计算,在多个过程测试中取得加速等成果,初步证明部分振幅优化可系统化。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21656 2026-07-27 cs.SE cs.AI 新提交 62%

Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?

跨模型大语言模型代码审查:应该用Claude审查Codex还是相反?

Zuodong Xiang, Yike Zhang, YueMing Zhang, Hailu Xu

机构 * University of California, Davis(加州大学戴维斯分校) Johns Hopkins University(约翰霍普金斯大学) California State University, Long Beach(长滩加州州立大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究开发者同时使用Claude和Codex进行代码审查的成本、时间及配对顺序问题,通过对116个任务的六种条件实验发现,Claude审查Codex草稿效果好,反向则不佳,有用的配对是不对称的,应Claude审查Codex。

Comments This paper had been accepted by Agentic SE @ KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 1 篇

2607.22368 2026-07-27 cs.AI 新提交 57%

Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI

智能体基准测试能衡量能力吗?智能体人工智能时代的协议有效性

Jiaqi Shao, Hanck Chen, Wei Zhang, Maxm Pan, Bing Luo

机构 * Tencent(腾讯) The Hong Kong University of Science and Technology(香港科技大学) Duke Kunshan University(昆山杜克大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 研究智能体基准测试分数能否衡量能力,提出协议有效性概念及HackDetect事后审计方法,通过审计多基准测试轨迹发现暴露和奖励破解证据,量化分数膨胀,强调基准测试报告应证明分数反映预期能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 1 篇

2607.21885 2026-07-27 cs.LG cs.NA eess.SP math.NA 新提交 57%

Remedying Coarsening-Based GNN Training under Heterophily via Adaptive Complementary Enhancement

通过自适应互补增强修复异质性下基于粗化的图神经网络训练

Guoming Li, Jian Yang, Xukun Wang, Zixiao Wang, Shangsong Liang, Yifan Chen

机构 * Hong Kong Baptist University(香港浸会大学) Renmin University of China(中国人民大学) Chinese Academy of Sciences(中国科学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Sun Yat-sen University(中山大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 研究基于粗化的GNN训练在异构图上性能下降问题,提出自适应互补增强(ACE)策略,通过重新整合粗化丢弃信息、应用正则化及不确定性加权,在异构图基准上提升性能,同构图上保持竞争力且计算开销小。

Comments Accepted at the 42nd Conference on Uncertainty in Artificial Intelligence, UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏