arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-06 至 2026-08-06 共收录 17 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 6 篇

2608.04336 2026-08-06 cs.SE cs.AI 新提交 84%

COMPAS: Difficulty-Aware Joint Search for Optimizing Code Generation

COMPAS:面向优化代码生成的感知难度联合搜索

Jingzhi Gong, Jie M. Zhang, Gunel Jahangirova, Dong Huang, Mohammad Reza Mousavi, Mark Harman

专题命中 代码生成 :code generation(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出感知难度的 COMPAS 方法,通过联合搜索模型、提示词和解码设置优化代码生成,在 LiveCodeBench 和 SWE-bench 上均实现性能提升且成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04439 2026-08-06 cs.SE cs.AI 新提交 81%

ExeCRE: Execution-Consistency Guided Reliability Estimation for Self-Correcting Code Generation

ExeCRE:基于执行一致性引导的自校正代码生成可靠性估计

Yiru Dong, Richong Zhang, Fanshuang Kong, Si Chen

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 ExeCRE是基于执行一致性的代码可靠性估计框架,可减少自校正代码生成中的误导性反馈,提升有效性与稳定性,在GPT-5.2搭配LiveCodeBench及数学推理场景均有显著收益。

Comments 13 pages, 5 figures. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04270 2026-08-06 cs.SE cs.MA 新提交 70%

CURATE: Leveraging LLM Agents to Compose, Catalog, and Deploy Reproducible Workflows

CURATE:利用大语言模型智能体构建、编目和部署可复现工作流

Nolan Cutler, Chia-Chen Kuo, Nanda Velugoti, Kathryn Newhart, Renato Figueiredo

专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.SE

AI总结 该研究提出CURATE多智能体系统,覆盖工作流全生命周期,通过模块目录支持FAIR原则,用Claude Opus 4.8原型验证,完成6项含基准工作流复现及环境工程工作流开发的实验。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04384 2026-08-06 cs.AI 新提交 57%

Improving Auto-Design of Neural PDE Solvers with a Domain-Specific Language

用领域特定语言改进神经偏微分方程求解器的自动设计

Shengxin Kong, Liwen Xu, Jingwen Fu

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 该研究提出ADSL-PDE领域特定语言,通过结构化搜索空间提升神经PDE求解器自动设计的搜索效率与优化稳定性,前十次迭代性能提升超52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04768 2026-08-06 cs.CV 新提交 50%

Embedding Large Language Models into Flow Controls: An Agentic Framework for Adaptive and Trustworthy Automated Cooking

将大语言模型嵌入流程控制:一种用于自适应且可信的自动化烹饪的智能体框架

Zihan Song, Hongwei Huang, Yueshuo Sun, Yonglin Tian, Fei-Yue Wang, Bai Li

专题命中 代码生成 :code generation(abstract)

AI总结 针对自动化烹饪机器人的个性化与可信性问题,提出智能体框架,通过多智能体分解需求、分阶段生成执行代码,实验验证其在真实场景中可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04450 2026-08-06 cs.DC 新提交 50%

CommBench: Can LLMs Write Correct and Efficient GPU Communication Code?

CommBench:大语言模型能编写正确且高效的GPU通信代码吗?

Shuang Ma, Yuyi Li, Yihan Zhang, Hezhi Xie, Danyang Chen, Shuyang Ji, Ziming Mao, Cheng Ji, Ansha Prashanth, Wenting Yang, Yiran Wang, Chihan Cui, Pei Yu Lin, Ion Stoica, Yang Zhou

专题命中 代码生成 :code generation(abstract)

AI总结 本文提出GPU通信编程综合基准CommBench,评估发现最强代码生成模型GPT-5.5仅在30.7%任务中实现正确高效的GPU通信代码,凸显LLMs与专家水平的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2608.04804 2026-08-06 cs.SE cs.AI 新提交 87%

Scrouting: Cost-Aware Routing of Coding Agents by Scouting the Repository First

Scrouting:通过先探查仓库实现编码智能体的成本感知路由

Ishaan Bhola, Adithyan Krishnan, Mukunda NS

专题命中 软件智能体 :repository(title,abstract);coding agent(title);分类 cs.SE、cs.AI

AI总结 本文提出SuperScout,先探查仓库生成经沙箱验证的结构化交接内容,再路由任务至四个修复器,在SWE-bench Pro上以约五分之一成本达到最优单模型的解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04278 2026-08-06 cs.SE cs.AI 新提交 84%

EA-Graph: Artifact-Anchored Verification Memory for Coding Agents under Upstream Drift

EA-Graph:面向上游漂移场景下编码智能体的工件锚定验证记忆

Hwai-Jung Hsu, Cheng-Jan Chi, Hanna Everett

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究提出EA-Graph这一工件锚定验证记忆,经实验证实其在编码智能体的可证性判断任务中,能提升较小模型的表现,可缩小模型间能力差距。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04682 2026-08-06 cs.SE cs.AI 新提交 81%

Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports

Active-SWE:针对无问题报告的主动漏洞修复任务的编码智能体基准测试

Haobin Li, Ping Deng, Weizhong Qian, Liang Jiang, Zhenyu Huang, Mouxing Yang, Xi Peng

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 Active-SWE是首个针对无问题报告的主动多漏洞修复任务的编码智能体基准,实验显示现有顶尖编码智能体在该任务上性能有限。

Comments 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04942 2026-08-06 cs.LG cond-mat.mtrl-sci cond-mat.other cs.AI physics.chem-ph 新提交 62%

CheMLFlow: An Open-Source Platform for Cheminformatics and Materials Informatics Applications

CheMLFlow:用于化学信息学与材料信息学应用的开源平台

Brendan Smith, Susana Lopez-Moreno, Eric Dolores-Cuenca, Sangil Kim, Jose L. Mendoza-Cortes, Nijamudheen Abdulrahiman

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 CheMLFlow是用于构建端到端高通量智能体工作流的开源平台,可降低科学机器学习开发的编排开销,其在多类性质预测任务上达到文献性能,还支持非分子化学数据集的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04199 2026-08-06 astro-ph.SR 新提交 50%

A comparison of best fits obtained in white dwarf asteroseismology using the WDEC and the LPCODE

利用WDEC和LPCODE对白矮星星震学中最佳拟合结果的比较

Agnès Bischoff-Kim

专题命中 软件智能体 :code model(abstract)

AI总结 本研究通过对比WDEC与LPCODE对白矮星的星震学拟合结果,验证了两类模型的一致性,并探究了化学轮廓约束、模式加权等因素对拟合的影响,为白矮星批量星震学拟合提供了基础。

Comments 12 pages, 7 figures, published in the Astrophysical Journal

Journal ref The Astrophysical Journal, 2024, Volume 974, Issue 2, id.183

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2608.04857 2026-08-06 cs.CR cs.SE 新提交 57%

Hidden Ciphers and Where to Find Them: Static Discovery and Assessment of Cryptographic Assets in Software

隐藏的密码及其发现途径:软件中密码资产的静态发现与评估

Christian Näther, Eduard Hirsch

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 本文提出分类驱动的静态方法,可在不到6分钟处理57610个文件,发现370个密码资产(含6个CVE漏洞、52个后量子迁移候选),F1达0.75,助力密码资产发现与后量子迁移规划

Comments 22 pages, 8 figures, 5 tables, accepted at ICICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 2 篇

2608.04181 2026-08-06 cs.SE 新提交 70%

MergeSE: Post-Hoc Model Merging for Software Engineering Tasks Without Retraining

MergeSE:无需重新训练的软件工程任务事后模型合并

Palash R. Roy, Banani Roy, Kevin A. Schneider, Chanchal K. Roy

专题命中 代码评测 :code model(abstract);repository(abstract);分类 cs.SE

AI总结 MergeSE是一款开源工具,可对HuggingFace编码器检查点进行无训练合并,支持软件工程多类分类任务,能解决代码模型分布偏移导致的性能下降问题,合并效率高且性能优异。

Comments Accepted at ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04536 2026-08-06 cs.DB 新提交 50%

From Research Questions to Columns: Operationalization-Aware Data Discovery

从研究问题到列:感知操作化的数据发现

Houming Chen, H. V. Jagadish

专题命中 代码评测 :repository(abstract)

AI总结 该研究提出感知操作化的数据发现(OADD)任务,构建基准OADD-Bench,评估多种方法后发现OADD仍是未解决问题,其中OADD定向智能体表现最佳。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 2 篇

2608.05141 2026-08-06 cs.AI cs.LG cs.SE 新提交 82%

OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling

OctoLong:跨仓库代码上下文的训练中优化增强长上下文建模

Indraneil Paul, Falko Helm, Goran Glavaš, Iryna Gurevych

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 该研究提出OctoLong流水线,通过跨仓库代码上下文的训练中优化,训练出OctoLong-Instruct长上下文开源LMs,用其替代12%传统语料库可显著提升长上下文相关任务性能及短场景API使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04459 2026-08-06 cs.SE 新提交 57%

AdaptAgent: A Multi-agent, Domain-Guided Reasoning Framework for Code Adaptation

AdaptAgent:一种用于代码适配的多智能体、领域引导推理框架

Xiaokai Rong, Hridya Dhulipala, Aashish Yadavally, Tien N. Nguyen

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本研究提出AdaptAgent框架,通过分工的多智能体实现代码适配,在真实数据集上的语义正确性优于强基线,各智能体对适配效果均有重要作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他AI编程 1 篇

2608.04215 2026-08-06 cs.SE cs.AI 新提交 62%

A Unified Model for Cross-Domain Clone Detection via Model Merging

基于模型合并的跨域代码克隆检测统一模型

Palash R. Roy, Banani Roy, Kevin A. Schneider, Chanchal K. Roy

专题命中 其他AI编程 :code model(abstract);分类 cs.SE、cs.AI

AI总结 本文提出通过模型合并技术构建跨域代码克隆检测器,经实验验证TIES合并方法泛化性更优,合并后检测器性能优于零样本代码大模型且泛化性更强。

Comments Accepted at ASE 2026

Journal ref Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏