arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1079 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1079 篇

2504.18316 2025-04-28 cs.SE cs.AI 81%

Towards Adaptive Software Agents for Debugging

Yacine Majdoub, Eya Ben Charrada, Haifa Touati

机构 * University of Gabes(盖斯大学)

专题命中 软件智能体 :software agent(title,abstract);分类 cs.SE、cs.AI

Comments 5 pages, 3 figures, FSE2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01422 2025-03-27 cs.SE cs.CL 81%

Alibaba LingmaAgent: Improving Automated Issue Resolution via Comprehensive Repository Exploration

Yingwei Ma, Qingping Yang, Rongyu Cao, Binhua Li, Fei Huang, Yongbin Li

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14269 2025-03-19 cs.CL cs.SE 81%

DARS: Dynamic Action Re-Sampling to Enhance Coding Agent Performance by Adaptive Tree Traversal

Vaibhav Aggarwal, Ojasv Kamal, Abhinav Japesh, Zhijing Jin, Bernhard Schölkopf

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08927 2025-03-06 cs.AI cs.CL 81%

VerilogCoder: Autonomous Verilog Coding Agents with Graph-based Planning and Abstract Syntax Tree (AST)-based Waveform Tracing Tool

Chia-Tung Ho, Haoxing Ren, Brucek Khailany

专题命中 软件智能体 :coding agent(title);code generation(abstract);分类 cs.CL、cs.AI

Comments main paper 7 pages, reference 1 page, it is the version that accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04683 2025-02-21 cs.CR cs.AI cs.SE 81%

Eliminating Backdoors in Neural Code Models for Secure Code Understanding

Weisong Sun, Yuchen Chen, Chunrong Fang, Yebo Feng, Yuan Xiao, An Guo, Quanjun Zhang, Yang Liu, Baowen Xu, Zhenyu Chen

专题命中 软件智能体 :code model(title,abstract);分类 cs.SE、cs.AI

Comments Accepted to the 33rd ACM International Conference on the Foundations of Software Engineering (FSE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19031 2024-12-30 cs.SE cs.AI 81%

Repository Structure-Aware Training Makes SLMs Better Issue Resolver

Zexiong Ma, Shengnan An, Zeqi Lin, Yanzhen Zou, Bing Xie

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08421 2024-01-08 cs.SE cs.AI 81%

Systematic Comparison of Software Agents and Digital Twins: Differences, Similarities, and Synergies in Industrial Production

Lasse Matthias Reinpold, Lukas Peter Wagner, Felix Gehlhoff, Malte Ramonat, Maximilian Kilthau, Milapji Singh Gill, Jonathan Tobias Reif, Vincent Henkel, Lena Scholz, Alexander Fay

专题命中 软件智能体 :software agent(title,abstract);分类 cs.SE、cs.AI

Comments Manuscript submitted to Journal of Intelligent Manufacturing, Corresponding dataset: https://doi.org/10.5281/zenodo.8120623 Additional references in Sec. 1, some other minor changes

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.05493 2020-07-15 cs.LG cs.NE cs.SE stat.ML 81%

Deep Transfer Learning for Source Code Modeling

Yasir Hussain, Zhiqiu Huang, Yu Zhou, Senzhang Wang

专题命中 软件智能体 :code model(title,abstract);分类 cs.SE、cs.LG

Journal ref International Journal of Software Engineering and Knowledge Engineering. Vol. 30, No. 05, pp. 649-668 (2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03332 2026-07-07 cs.SE 新提交 80%

AtomicCommitBench: Can Coding Agents Reconstruct Commit Histories from Squashed Patches?

原子提交基准测试:编码代理能否从压缩补丁中重建提交历史?

Zhihao Lin, Mingyi Zhou, Li Li

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究编码代理从压缩补丁重建提交历史的问题,将任务形式化为有重放要求的块到提交分区,构建基准测试并评估,发现自然重建比重放检查等难,部分方法表现较好,还找出常见失败模式及改进方法。

Comments 21 pages, 6 figures, benchmark paper on coding agents and software engineering; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11727 2026-08-13 cs.AI 新提交 79%

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents

Harness-IF:评估编码智能体在不同指令层面的指令遵循能力

Zining Huang, Haoran Que, Hong Zeng, Ge Zhang, Zuo Wang, Jin Chen, Haodong Wang, Zhongfei Hou, Changxin Pu, Shen Yan, Wenhao Huang

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本研究推出Harness-IF评估框架,引入AP-Acc指标区分编码智能体的指令合规与巧合,发现12个前沿模型在对抗先验规则上表现更差,且合并优先级不随提示深度变化。

Comments 26 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10934 2026-08-12 cs.SE 新提交 79%

Understanding the Architecture of Coding Agents: An Exploratory Study Using a Research Prototype

理解编码智能体的架构:一项使用研究原型的探索性研究

Marco Tulio Valente

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本研究通过推出编码智能体Ark及基准ArkBench,探索了编码智能体的架构,用gpt-5.4-mini测试Ark解决10项任务中的8项,还对比了其与先进编码智能体的架构,为相关研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08950 2026-08-11 cs.SE 新提交 79%

Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework

基于双向重构-验证框架的代码智能体独立补丁验证

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本研究针对代码智能体生成补丁后缺乏独立验证的问题,提出无需训练的RETRACE双向重构-验证框架,在SWE-bench Verified等基准上显著提升了代码补丁的正确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07147 2026-08-10 cs.AI 新提交 79%

DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training

DiDPO:用于编码智能体训练的差异内差异策略优化

Xucong Wang, Zhe Zhao, Liheng Yu, Di Wu, Xiaofeng Cao, Pengkun Wang

机构 * University of Science and Technology of China (USTC)(中国科学技术大学) Stanford University(斯坦福大学) Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) Tongji University(同济大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 针对编码智能体训练的细粒度信用分配难题,提出DiDPO方法,在Qwen2.5-7B-Coder上性能超可比方法10%以上,开源了支持多种RL方法的verl-code代码库。

Comments 16 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05223 2026-08-07 cs.SE cs.CR 新提交 79%

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

面向编码智能体中恶意技能文件的风险评估

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。

Comments 29 pages, 6 figures, 6 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02687 2026-08-07 cs.CR cs.SE 版本更新 79%

PolicyGuard: Prompt-Configurable Semantic DLP for LLM Coding Agents

PolicyGuard:面向LLM编码智能体的可配置提示语义数据防泄漏方案

Kyutae Park, Jungwon Kim, Daeyeol Shim

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 针对LLM编码智能体的PolicyGuard框架,以自然语言策略文件引导LLM分类用户提示,在冻结测试集和隐藏保留集上表现优异,泛化与跨模型能力突出。

Comments This paper is being withdrawn because it was submitted prior to completion of a required institutional review process. The authors intend to resubmit after the review is complete

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01347 2026-08-07 cs.CL 版本更新 79%

Same Task, Different Work: Prompt-Induced Waste in Coding Agents

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02670 2026-08-05 cs.CR cs.AI 新提交 79%

Permission Denied: Policy-Graded Evaluation of Coding Agents in Hardened Environments

权限受限:强化环境下编码智能体的策略分级评估

Dotan Davidovich, Yair Amar, Hai Rozencwajg, Or Hiltch

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 该研究针对强化环境下编码智能体的性能评估问题,在 Terminal-Bench 2.1 上评估 12 个智能体,发现策略强化会导致性能损失且模型选择依赖策略,并发布 Boundary-Bench 插件支持相关评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02642 2026-08-05 physics.chem-ph cs.AI 新提交 79%

MDArena: Evaluating Coding Agents on Realistic Molecular Dynamics Workflows

MDArena:面向真实分子动力学工作流的编码智能体评估基准

Nithishwer Mouroug Anand, Wei-Tse Hsu, Kyle Vaccaro, Eden James Gage, Jonathan David Colburn, Linda Xi Phan, Minjoon Seo, Kevin Guan, Philip C. Biggin

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 MDArena基准评估了6种编码智能体在真实分子动力学任务上的表现,发现其在精细科学工作流细节上存在不足,为追踪其可靠性进展提供了平台。

Comments 17 pages including appendices, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00947 2026-08-04 cs.SE 新提交 79%

Claim Plane: Reliability Gains and the Limits of Selective Concurrency for Parallel Coding Agents: A 30-Pair, Three-Seed Confirmatory Study of Deterministic Pre-Write Admission

声明平面:并行编码智能体选择性并发的可靠性提升与局限——确定性预写准入的30对、3种子验证性研究

Maxim Nikolaev

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 该研究提出声明平面机制,通过30对、3种子的验证性实验,发现其可提升并行编码智能体的可靠性,但静态准入会过度串行化执行,动态准入则存在范围覆盖问题,未实现有效并行加速。

Comments 10 pages, 4 figures, 6 main-text tables. Confirmatory follow-up to arXiv:2607.21909. Code: https://github.com/SkeinRank/claim-plane. Data and artifacts: https://huggingface.co/datasets/skeinrank/claim-plane-confirmatory-30x3

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00122 2026-08-04 cs.AI 新提交 79%

Shared Organizational Memory for Enterprise Coding Agents: System Design and Deployment Snapshot

企业编码智能体的共享组织记忆:系统设计与部署快照

Harsh Rao Dhanyamraju, Leonidas Raghav

机构 * SAP SE(思爱普公司)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本文设计部署共享组织记忆系统,将经验捕获融入企业编码工作流,收集并整理任务相关经验,管控风险并供智能体检索,目前其效果仍在评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29658 2026-08-03 cs.SE 新提交 79%

Reusing Past Repairs Through Hierarchical Trajectory Abstraction for Coding Agents

通过分层轨迹抽象复用编码智能体的过往修复工作

Yisen Xu, Jiayuan Zhou, Ruiqi Pan, Tse-Hsun Chen

专题命中 软件智能体 :coding agent(title);repository(abstract);分类 cs.SE

AI总结 本研究提出STAIR框架,通过分层轨迹抽象复用编码智能体过往修复经验,在SWE-bench Verified上显著提升修复智能体的Pass@1指标,且计划可跨智能体泛化。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28928 2026-08-03 cs.SE 新提交 79%

Automated Testing and Repair for Verified Compilers Generated by a Coding Agent

基于编码智能体生成的验证编译器的自动化测试与修复

Martin Rinard

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 该研究针对编码智能体生成的验证编译器,提出了基于智能体的自动化测试与修复系统,经评估其在Axon编译器上无奖励黑客攻击问题,可有效开展测试与修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19338 2026-08-03 cs.AI 版本更新 79%

CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents

CodeRescue:用于编码智能体的预算校准恢复路由

Qijia He, Jiayi Cheng, Chenqian Le, Rui Wang, Xunmei Liu, Yixian Chen, Jie Mei, Zhihao Wang, Xupeng Chen, Yuhuan Chen, Tao Wang

机构 * University of Washington(华盛顿大学) New York University(纽约大学) ByteDance(字节跳动) Amazon(亚马逊)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究编码智能体失败后的预算部署问题,核心方法是将其制定为异构动作上的恢复路由并训练监督路由器,添加CRC层实现预算变化下的成本控制,主要贡献是校准前沿在多个方面优于基线,节省恢复成本。

Comments Withdrawn at the request of ByteDance because the manuscript was submitted before completing the company's required internal review and approval process

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26375 2026-07-30 cs.CL cs.HC 新提交 79%

(Im)Paired Programming: Coding Agents Improve Productivity but Harm Understanding

(非)配对编程:编码智能体提升生产力但损害理解能力

Nishant Balepur, Connor Baumler, Valerie Chen, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL

AI总结 该研究通过54名学生的对照实验,发现编码智能体虽提升生产力但损害用户代码理解,低投入交互加剧该问题,用户仍偏好智能体,同时为开发者提出了优化方向。

Comments In-progress Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26155 2026-07-30 cs.AI 新提交 79%

ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science

ClinLens:面向纵向多模态临床数据科学的长周期编码智能体

Yuan Zhu, Ethan B. Liu, Frank Nie, Jindong Han

机构 * Shandong University(山东大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 该研究推出CLINLENS基准,包含200项基于5种MIMIC资源的临床可执行任务,实验显示现有编码智能体与生物医学系统在正确临床分析上存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25619 2026-07-29 cs.SE cs.CR 新提交 79%

SkillGate: Cost Efficient Runtime Malicious Skill File Detection in Coding Agents

SkillGate:编码代理中经济高效的运行时恶意技能文件检测

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究针对编码代理中恶意技能文件检测问题,提出SkillGate安全网关,采用混合正则表达式预过滤器+大语言模型判断管道,在SkillsBench基准测试中,检测效果好、成本低、运行时开销小,相比现有工具性能显著提升。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22585 2026-07-28 cs.AI 新提交 79%

The Scaffold Effect in Coding Agents: Harness Choice as a Hidden Variable in Coding-Agent Evaluation

编码智能体中的支架效应:在编码智能体评估中利用选择作为隐藏变量

Naman Vats, Oleg Golev

机构 * Alibaba(阿里巴巴) Agentic AI Foundation(Agentic人工智能基金会) OpenCode Contributors(OpenCode贡献者团队) Harbor Framework Team(Harbor框架团队)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究编码智能体评估中工具选择对结果的影响,通过在三个开源工具上评估两个模型,发现工具选择会使解决任务的令牌数有40倍差异,失败指纹有工具级偏差,建议按通过率选工具-模型对并报告相关指标,还发布了相关数据和脚本。

Comments 7 pages, 2 figures, 6 tables. Preliminary work; under review at the 5th DL4C Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02544 2026-07-28 cs.SE 版本更新 79%

Developer Experience with AI Coding Agents: HTTP Behavioral Signatures in Documentation Portals

与AI代码代理的开发者体验:文档门户中的HTTP行为签名

Oleksii Borysenko

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本文研究AI代码代理对技术文档访问的影响,发现HTTP行为特征在文档门户中具有可识别性,提出改进开发者文档设计和反馈机制的实践方案。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21909 2026-07-27 cs.SE 新提交 79%

Claim Plane: Enforceable Change Intents and Dynamic Scope for Parallel Coding Agents

声明平面:并行编码代理的可执行变更意图和动态范围

Maxim Nikolaev

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究并行编码代理变更问题,提出声明平面架构,工作者声明变更意图,控制平面管理,执行时处理突变,通过CooperBench机制检查展示可行性,为未来模型升级提供基础。

Comments 10 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21674 2026-07-27 cs.SE 新提交 79%

Output Format x Model Identity: Interaction Effects in Single-Round Coding Agent Performance

输出格式x模型标识:单轮编码代理性能中的交互效应

Yang Yang

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究输出格式与模型交互对单轮编码代理性能的影响,通过多模型、多格式、多任务实验发现无普遍最优格式,有格式滥用问题,提出特定于模型的输出策略及工具设计原则并开源数据模板。

Comments 16 pages, 7 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏