arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-30 至 2026-07-30 共收录 18 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2607.26805 2026-07-30 cs.SE 新提交 88%

MRCoder: An Efficient Context Selecting Approach for Repository-Level Code Generation

MRCoder:一种面向仓库级代码生成的高效上下文选择方法

Peiding Wang, Li Zhang, Fang Liu

专题命中 代码生成 :code generation(title,abstract);repository(title,abstract);分类 cs.SE

AI总结 MRCoder是一种基于Map-Reduce范式的仓库级代码生成上下文选择框架,通过SADGS策略和并行验证,在提升代码生成准确率的同时降低了token消耗与推理时间。

Comments Under review in TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26307 2026-07-30 cs.AI cs.SE 新提交 84%

TraceCoder: Explainable and Auditable Code Generation with Position-Key Snippet Versioning

TraceCoder:基于位置键代码片段版本控制的可解释可审计代码生成

Rwaida Alssadi, Muntaser Syed, Balaji Kasula, Lamine Deen, Majed Alotaibi, Mohammed Alghamdi, Tyler Ton, Ali Alqarni, Marius Silaghi

机构 * Florida Institute of Technology(佛罗里达理工学院)

专题命中 代码生成 :code generation(title,abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 TraceCoder通过三种机制实现可解释可审计代码生成,在30项算法编程任务上Mean Chg%达30%,使自动代码生成的内部叙事可审计复现,保障生产部署的信任与问责。

Comments Submitted Version (version submitted on May deadline to AGENTICS 2026). Version of Record to appear in AGENTICS proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26244 2026-07-30 cs.SE 新提交 83%

Do Code Language Models Use Tests? A Behavioral and Representational Study of Test-Driven Code Generation

代码语言模型是否利用测试?测试驱动代码生成的行为与表征研究

Yunhao Liang, Chengguang Gan, Ruixuan Ying, Hanjun Wei, Zhe Cui, Shiwen Ni

专题命中 代码生成 :code generation(title,abstract);code model(abstract);分类 cs.SE

AI总结 该研究以Qwen2.5-Coder-7B和Qwen3.6-27B为对象,针对多个代码生成任务探究代码语言模型对测试的利用情况,发现测试通过语义引导和上下文扰动影响模型,仅表征变化不代表有效利用测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26083 2026-07-30 cs.SE 新提交 83%

Cross-Model Cross-Language AI Coding Agent Performance: Accuracy and Speed of Parallel CLRS Algorithms

跨模型跨语言AI编程智能体性能:并行CLRS算法的准确率与速度

Shiqi Cheng, Evelyne Ringoot, Rabab Alomairy, Alan Edelman

专题命中 代码生成 :coding agent(title,abstract);code generation(abstract);分类 cs.SE

AI总结 本文评估Cursor's Composer 2.0等三款AI编程智能体在三种语言三类算法上的并行代码生成性能,发现其并行能力弱于串行,性能提升高度依赖算法与语言,需将运行时效率纳入大语言模型核心指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27167 2026-07-30 cs.SE cs.CL 新提交 76%

SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch

SpecFirst:将行为规范提取作为从零开始的基于智能体的程序合成中的一等步骤

Yihao Chen, Shi Chang, Feng Lin, Khaled Chawa, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

专题命中 代码生成 :program synthesis(title);分类 cs.SE、cs.CL

AI总结 SpecFirst是将行为规范提取设为独立前置阶段的两阶段框架,在ProgramBench上显著提升了从零开始的程序合成的测试通过率与二进制探索覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26490 2026-07-30 cs.AI cs.LG cs.NE 新提交 62%

EvoPINN: Agentic Discovery of Executable Algorithms for Physics-Informed Neural Networks

EvoPINN:面向物理信息神经网络可执行算法的智能体式发现框架

Peng Yin, Kai Li, Yifan Zhang, Jian Cheng

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 EvoPINN是智能体式框架,将PINN开发转化为基于执行的算法发现,通过LLM智能体迭代优化,自主发明SLRC-PINN,可显著降低PDE求解的相对L₂误差,为科学计算提供新机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26206 2026-07-30 cs.PL cs.MS cs.SE 新提交 62%

Progress in Benchmarking Generics for Mathematical Computation

数学计算泛型基准测试的进展

Daniel Pang, Stephen M. Watt

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.PL

AI总结 该研究推出SciGMark 1.5基准,对比Rust等语言的泛型与专用实现,扩展了符号计算相关测试,揭示泛型编程成本与类型解析时机等因素相关,为泛型性能优化提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26865 2026-07-30 stat.ML cs.AI cs.IT cs.LG math.IT 新提交 62%

Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

短思考、智能延迟、行动与循环:面向边缘大语言模型智能体的校准推理与感知不确定性的延迟机制

Amirmohammad Farzaneh, Osvaldo Simeone

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TSDS框架,结合收敛探测器与困惑度延迟规则,经LTT流程校准后,可在边缘LLM智能体上减少43%-73%的思考计算量,同时保证奖励与云端调用率,在多类基准任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2607.27146 2026-07-30 cs.SE cs.CL cs.LG 新提交 87%

MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis

MindForge:通过无源码程序合成教小型语言模型全生命周期软件工程

Yihao Chen, Shi Chang, Khaled Chawa, Feng Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

专题命中 软件智能体 :program synthesis(title,abstract);repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 研究针对小型语言模型从零构建程序的挑战,提出MindForge构建全生命周期无源码训练环境,微调Qwen3.6-27B后在ProgramBench及7个软件工程基准上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26819 2026-07-30 cs.SE cs.AI 新提交 84%

A First Look at Coding Agents' Compliance with AI Contribution Rules in Open-Source Communities

初探编码智能体在开源社区中对AI贡献规则的合规性

Wenhao Yang, Runzhi He, Minghui Zhou

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究构建RepoComplianceBench基准测试编码智能体对开源社区AI贡献规则的合规性,发现当前智能体几乎不主动检索规则,仅在提示等辅助下实现披露与验证,但始终不执行AI禁令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26937 2026-07-30 cs.SE 新提交 83%

VITAL-RAG: Invariance Race for Context Allocation in Coding Agents

VITAL-RAG:编码智能体中上下文分配的不变性竞争

Zijian Lu, Yonghua Lu, Mingcai Chen, Yiping Zuo, Xin He, Weijun Wang, Weibei Fan

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 VITAL-RAG针对编码智能体上下文分配的不变性竞争问题,通过按规范代码对象组织证据等方法,在RepoBench等数据集上提升了代码检索性能并减少了令牌占用。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26375 2026-07-30 cs.CL cs.HC 新提交 79%

(Im)Paired Programming: Coding Agents Improve Productivity but Harm Understanding

(非)配对编程:编码智能体提升生产力但损害理解能力

Nishant Balepur, Connor Baumler, Valerie Chen, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL

AI总结 该研究通过54名学生的对照实验,发现编码智能体虽提升生产力但损害用户代码理解,低投入交互加剧该问题,用户仍偏好智能体,同时为开发者提出了优化方向。

Comments In-progress Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26155 2026-07-30 cs.AI 新提交 79%

ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science

ClinLens:面向纵向多模态临床数据科学的长周期编码智能体

Yuan Zhu, Ethan B. Liu, Frank Nie, Jindong Han

机构 * Shandong University(山东大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 该研究推出CLINLENS基准,包含200项基于5种MIMIC资源的临床可执行任务,实验显示现有编码智能体与生物医学系统在正确临床分析上存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2607.26591 2026-07-30 cs.SE 新提交 70%

MultiFixer: A Coordinator-Proposer Based Multi-Agent Framework For Fixing Multi-Hunk Bugs

MultiFixer:一种用于修复多块漏洞的基于协调者-提议者的多智能体框架

Haichuan Hu, Chunrong Fang, Ye Shang, Jiawei Liu, Weifeng Sun, Guoqing Xie, Chenxing Zhong, Quanjun Zhang

专题命中 程序修复 :program repair(abstract);repository(abstract);分类 cs.SE

AI总结 该研究针对现有LLM-based APR方法难以修复多块漏洞的问题,提出MultiFixer多智能体框架,经多基准测试,其在Defects4J等数据集上达到最优修复效果,能有效修复多块漏洞。

Comments Accepted to 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 4 篇

2607.26117 2026-07-30 cs.SE cs.AI cs.LG 新提交 78%

Try Again, Don't Look Back: Blind Resampling Outperforms Self-Repair in Small Code Models

再试一次,不要回头:小型代码模型中盲重采样优于自我修复

Yuvraj Verma

专题命中 代码评测 :code model(title);分类 cs.SE、cs.AI、cs.LG

AI总结 该研究针对MBPP+数据集在三种规模代码模型上发现,盲重采样在7B以下表现最优,成本远低于其他重试方法,而基于自身失败尝试的自我修复存在锚定效应导致的性能损失。

Comments Code, pre-registrations and run traces: https://github.com/vermayuvraj/self-improving-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26656 2026-07-30 cs.CR cs.AI cs.SE 新提交 62%

Graph Is the Verifier: Agentic Reinforcement Learning for Interprocedural Vulnerability Detection

图作为验证器:用于过程间漏洞检测的智能体强化学习

Yikun Li, Ting Zhang, Jiakun Liu, Jinfeng Jiang, Yuheng Yieh, Yixin Yang, Wen Bin Leow, Yide Yin, Yintong Huo, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对现有漏洞检测孤立处理函数的问题,提出基于CPG的智能体强化学习框架VulAgentRL,通过图验证设计可靠奖励并预热初始化策略,在仓库级划分下的严格指标及多场景中均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26777 2026-07-30 cs.SE 新提交 57%

CodeSpec: Dual Executable Specifications for Agentic Long-Horizon Feature Development

CodeSpec:面向智能体长周期功能开发的双可执行规范

Peiding Wang, Li Zhang, Fang Liu, Taichuan Li, Yinghao Zhu

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 提出CodeSpec双可执行规范方法,通过配对子需求语义与仓库架构构建可靠功能链,在FeatureBench上优于基线,提升了长周期功能开发的设计与实现一致性及性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26451 2026-07-30 cs.SE 新提交 57%

ExplainBench: Evaluating Code Explanations from Agents

ExplainBench:评估智能体生成的代码解释

Zhiyuan Pan, Sungmin Kang, Imam Nur Bani Yusuf, Abhik Roychoudhury

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 该研究针对智能体代码解释缺乏评估基准的问题,提出ExplainBench基准,实验发现其对智能体的排名与SWE-bench Verified不同,还实现了解释审核智能体,可提升智能体解释的可信度。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏