arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-13 至 2026-07-13 共收录 16 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 5 篇

2607.09146 2026-07-13 cs.SE 新提交 79%

Exploring the Potential of Program Flowcharts on Code Generation Using Multimodal LLMs

利用多模态大语言模型探索程序流程图在代码生成中的潜力

Yuki Toi, Tao Xiao, Kazushi Tomoto, Masanari Kondo, Yasutaka Kamei

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 研究利用多模态大语言模型探索程序流程图对代码生成的潜力,通过从示例代码生成流程图并与问题陈述一起提供给模型进行代码生成实验,发现结合流程图可提升性能,不同细节程度的流程图效果有差异,还比较了与少样本学习的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09059 2026-07-13 cs.AI 新提交 74%

ARCANA: A Reflective Multi-Agent Program Synthesis Framework for ARC-AGI-2 Reasoning

ARCANA:用于ARC-AGI-2推理的反射式多智能体程序合成框架

Kunbo Zhang, Lei Fu, Zeyu Wang, Zijing Liu, Kejian Tong

机构 * Columbia University(哥伦比亚大学) University of California, Los Angeles(加州大学洛杉矶分校) Northeastern University(东北大学)

专题命中 代码生成 :program synthesis(title);分类 cs.AI

AI总结 ARCANA是用于ARC-AGI-2推理的多智能体框架,将任务分解为感知、假设生成等步骤,智能体通过可微黑板通信,由元控制器调度。其设计结合程序搜索与校正,提升了抽象转换任务的推理效率和解决方案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09072 2026-07-13 cs.SE 新提交 57%

Agentic Proof and Property-Based Testing via Property-Templates in Data-Intensive Computing

通过数据密集型计算中的属性模板进行智能体证明和基于属性的测试

Seongmin Lee, Yaoxuan Wu, Miryung Kim

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 研究软件工程中意图规范和验证问题,提出用属性模板解决验证候选属性和实施PBT的子问题,设计智能体双轨验证框架,经评估该框架能提高证明成功率、减少幻觉、降低成本并提升代码覆盖,还能发现模型与实现差距。

Comments 12 pages, 7 figures, 4 tables; supplementary material included as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08885 2026-07-13 cs.SE 新提交 57%

Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions

程序员是大型语言模型生成断言的糟糕且过度自信的评判者

Zhanna Kaufman, Yuriy Brun, Adithya Murali, Madeline Endres

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 研究程序员评估大型语言模型生成断言的能力,通过实验发现程序员判断正确断言较准,判断错误断言较差,自然语言解释未带来整体益处,凸显帮助开发者评估机器生成可靠性工件的重要性。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08804 2026-07-13 cs.GR cs.RO 新提交 50%

Programming-by-Example for Batch-Editing Collision Meshes in 3D Software

3D软件中用于批量编辑碰撞网格的示例编程

Gengyang Xu, Dongwei Xiao, Hengcheng Zhu, Yiteng Peng, Wei Meng, Shuai Wang, Shing-Chi Cheung

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 代码生成 :program synthesis(abstract)

AI总结 针对3D软件中碰撞网格编辑难题,提出神经符号程序合成方法,将任务转化为例程编程问题,通过MeshForge工具实现,在6 hundred个碰撞网格的24个任务中评估,成功合成多数任务,平均所需演示次数和合成时间较少。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2607.09510 2026-07-13 cs.SE cs.AI 新提交 81%

Failure as a Process: An Anatomy of CLI Coding Agent Trajectories

失败作为一个过程:CLI编码代理轨迹剖析

Xiangxin Zhao, Han Li, Shuaiting Li, Tianyi Zhao, Earl T. Barr, Federica Sarro, He Ye

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究CLI编码代理失败轨迹,引入面向过程框架,收集并标注大量执行轨迹,发现失败多由认知错误驱动,起始于最初几步且常隐藏,提出提高编码代理可靠性需早期验证和干预,而非仅靠最终结果评估。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03968 2026-07-13 cs.SE cs.AI 新提交 81%

Refused in Chat, Written in Code: Workflow-Level Jailbreak Construction in IDE Coding Agents

在聊天中被拒绝,用代码编写:IDE 编码代理中的工作流级越狱构造

Abhishek Kumar, Carsten Maple

机构 * The Alan Turing Institute(阿尔法·图灵研究院)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究 IDE 编码代理安全评估问题,介绍工作流级越狱构造,通过对特定模型在不同基准测试下表现研究发现,对话拒绝基准可能高估其安全性,需跨多轮 IDE 工作流评估安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09553 2026-07-13 cs.SE 新提交 57%

Writing Bug Reports for Software Repair Agents: What Information Matters Most?

为软件修复代理编写错误报告:哪些信息最重要?

Vincenzo Luigi Bruno, Alessandro Giagnorio, Daniele Bifolco, Leon Wienges, Massimiliano Di Penta, Gabriele Bavota

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究软件开发中为软件修复代理编写错误报告的问题,通过对错误报告分类标注,用三个LLM主干运行mini-swe-agent,拟合回归模型,发现定位线索和建议修复等信息对代理成功更重要,传统对人类有用的信息作用较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09123 2026-07-13 cs.SE 新提交 57%

ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports

ReProAgent:从问题报告中通过工具增强的多阶段代理生成错误重现测试

Quanjun Zhang, Yi Zheng, Ye Shang, Weifeng Sun, Haichuan Hu, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究提出ReProAgent多阶段代理框架,从问题报告生成错误重现测试,将任务分解为四个阶段,集成多种工具支持各阶段,实验表明其能成功重现较多问题,优于基线,还可跨模型泛化并提升下游问题解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02134 2026-07-13 cs.AI 新提交 57%

Coding-agents can replicate scientific machine learning papers

编码代理可以复现科学机器学习论文

Atharva Hans, Ilias Bilionis

机构 * School of Mechanical Engineering, Purdue University(机械工程学院,普渡大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出Paper-replication工作流,让编码代理以目标驱动方式复现论文的计算声明,通过记录目标、重建方法、运行实验并验证,在四篇论文的12次独立运行中全部完成并通过验证。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 2 篇

2607.09101 2026-07-13 cs.SE 新提交 83%

Multi-Agent LLM Collaboration for Unit Test Generation via Human-Testing-Inspired Workflows

通过受人工测试启发的工作流程进行多智能体大语言模型协作以生成单元测试

Quanjun Zhang, Ye Shang, Siqi Gu, Jianyi Zhou, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 测试生成 :unit test generation(title,abstract);repository(abstract);分类 cs.SE

AI总结 研究针对现有基于大语言模型的单元测试生成方法的局限,提出TestAgent,通过多智能体协作机制模拟人工测试,设计专门智能体、配备工具API并构建知识图谱,在Java项目实验中取得优异结果,性能优于基线和搜索工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08983 2026-07-13 cs.SE cs.AI 新提交 81%

SCATE: Learning to Supervise Coding Agents for Cost-Effective Test Generation

SCATE:学习监督编码代理以实现经济高效的测试生成

Sijia Gu, Noor Nashid, Ali Mesbah

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 测试生成 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究针对编码代理惰性生成致代码覆盖不足问题,提出SCATE框架,将监督设为上下文博弈问题,依覆盖和可测试性指标选测试动作,集成不同编码代理,相比基线和其他方法有更高覆盖,能动态优化代理优势。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 3 篇

2607.08981 2026-07-13 cs.SE cs.AI 新提交 62%

The Patchwork Problem in LLM-Generated Code

大语言模型生成代码中的拼凑问题

Viraaji Mothukuri, Reza M. Parizi

机构 * Decentralized Science Lab, College of Computing and Software Engineering(分布式科学实验室,计算机与软件工程学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究大语言模型生成代码中的拼凑问题,将结构一致性形式化并引入故障分类法,提出混合验证框架,经实证评估和真实世界验证,揭示多数结构故障难被现有检查发现,模型间故障模式有别,此类故障普遍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07740 2026-07-13 cs.LG cs.AI 新提交 62%

Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE

Jet-Long:使用动态双焦点旋转位置编码的高效长上下文扩展

Haozhan Tang, Zerui Wang, Yuxian Gu, Song Han, Han Cai

机构 * NVIDIA(英伟达)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 研究针对现代语言模型长上下文应用中零样本上下文扩展问题,提出Jet-Long方法,通过动态双焦点RoPE及相关技术,在推理时开销小,在多种模型和基准测试中表现优异,还能推广到其他架构且超参数弹性强。

Comments added discussion of AdaGroPE and LaMPE (Findings of ACL 2026) with clarified contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09057 2026-07-13 cs.CV 新提交 50%

STEAM: Stable Self-Training with Elastic Matching and Adaptive Purification

STEAM:基于弹性匹配和自适应净化的稳定自训练

Shaoxiang Wang, Kejia Zhang, Haiwei Pan, Lan Zhang

机构 * heu(哈尔滨工程大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 跨视角地理定位中现有监督和无监督方法有局限,本文提出STEAM框架,通过稳定空间感知模块、弹性匹配和自适应净化进行自训练,在相关基准测试中性能达最优,验证了该框架在无监督跨视角地理定位中的有效性和优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 程序分析与验证 1 篇

2607.09217 2026-07-13 cs.AI cs.MS 新提交 70%

OpenProver: Agentic and Interactive Theorem Proving with Lean 4

OpenProver:使用Lean 4进行智能且交互式的定理证明

Matěj Kripner, Milan Straka

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理系)

专题命中 程序分析与验证 :code generation(abstract);repository(abstract);分类 cs.AI

AI总结 介绍用于大语言模型驱动的自动化定理证明的开源系统OpenProver,它集成特定架构,完全开源,能自动验证证明,提供交互式界面,通过在ProofNet上评估展示自动验证在定量消融实验中的潜力。

Comments 7 pages, 2 figures. Accepted at the 19th Conference on Intelligent Computer Mathematics (CICM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏