arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1079 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1079 篇

2505.23932 2026-03-10 cs.CL 57%

SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving

SwingArena: 用于长上下文GitHub问题解决的竞争性编程竞技场

Wendong Xu, Jing Xiong, Chenyang Zhao, Qiujiang Chen, Haoran Wang, Hui Shen, Zhongwei Wan, Jianbo Dai, Taiqiang Wu, He Xiao, Chaofan Tao, Z. Morley Mao, Ying Sheng, Zhijiang Guo, Hongxia Yang, Bei Yu, Lingpeng Kong, Quanquan Gu, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of California Los Angeles(加州大学洛杉矶分校) Tsinghua University(清华大学) University of Michigan Ann Arbor(密歇根大学安娜堡分校) The Ohio State University(俄亥俄州立大学) University of Edinburgh(爱丁堡大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LMSYS Org(LMSYS组织)

专题命中 软件智能体 :code generation(abstract);分类 cs.CL

AI总结 SwingArena是一个用于评估LLM在真实CI驱动软件开发环境中性能的竞争性编程竞技场,通过模拟软件迭代过程,结合检索增强型代码生成模块,实现对长上下文问题的高效处理。

Comments The paper has been accepted as an oral presentation at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06737 2026-03-10 cs.LO cs.AI cs.SC 57%

Agent Hunt: Bounty Based Collaborative Autoformalization With LLM Agents

Agent Hunt: 基于奖金的协作自动形式化与LLM代理

Chad E. Brown, Cezary Kaliszyk, Josef Urban

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 基于奖金的协作自动形式化方法,利用LLM代理在交互式定理证明环境中进行去中心化证明搜索与理论构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06064 2026-03-09 cs.AI 57%

Agentic LLM Planning via Step-Wise PDDL Simulation: An Empirical Characterisation

通过分步PDDL模拟实现代理LLM规划:一项实证分析

Kai Göbel, Pierrick Lorang, Patrik Zips, Tobias Glück

机构 * AIT Austrian Institute of Technology GmbH(奥地利技术研究院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文通过PyPDDLEngine实验证明代理LLM在任务规划中相比传统方法具有小幅优势,但效果受环境反馈类型影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02766 2026-03-04 cs.AI cs.MA 57%

EvoSkill: Automated Skill Discovery for Multi-Agent Systems

EvoSkill:多智能体系统的自动化技能发现

Salaheddin Alzubi, Noah Provenzano, Jaydon Bingham, Weiyuan Chen, Tu Vu

机构 * Sentient Virginia Tech(弗吉尼亚理工大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 EvoSkill通过自进化框架自动发现和优化多智能体系统的技能,提升在OfficeQA和SealQA等基准测试中的性能,并展示技能在跨任务迁移中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00729 2026-03-03 cs.CL 57%

Qwen3-Coder-Next Technical Report

Qwen3-Coder-Next 技术报告

Ruisheng Cao, Mouxiang Chen, Jiawei Chen, Zeyu Cui, Yunlong Feng, Binyuan Hui, Yuheng Jing, Kaixin Li, Mingze Li, Junyang Lin, Zeyao Ma, Kashun Shum, Xuwu Wang, Jinxi Wei, Jiaxi Yang, Jiajun Zhang, Lei Zhang, Zongmeng Zhang, Wenting Zhao, Fan Zhou

机构 * Qwen Team(通义实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 Qwen3-Coder-Next通过高效推理和代理训练技术,在小参数量下实现强大的编码能力,适用于研究和实际应用。

Comments Authors are listed alphabetically by their last names

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19383 2026-02-24 cs.SE 57%

On the Variability of Source Code in Maven Package Rebuilds

关于Maven包重建中源代码变化性的研究

Jens Dietrich, Behnaz Hassanshahi

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文研究了Maven包重建中源代码变化性问题,发现构建扩展生成的代码导致非等价源代码,提出应对策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13069 2026-02-24 cs.AI 57%

Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering

Ambig-SWE: 交互式代理以克服软件工程中的不充分性

Sanidhya Vijayvargiya, Xuhui Zhou, Akhila Yerukola, Maarten Sap, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 软件智能体 :code generation(abstract);分类 cs.AI

AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。

Comments 22 pages, 7 figures, Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17018 2026-02-20 cs.SE 57%

Not Only for Developers: Exploring Plugin Maintenance for Knowledge-Centric Communities

不仅仅为开发者:探索知识导向社区的插件维护

Giovanni Rosa, David Moreno-Lumbreras, Raula Gaikovina Kula

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究探讨了非开发者主导社区中插件生态系统的维护,通过分析Obsidian平台的插件发现六个知识管理相关主题,并揭示了其工程结构和可持续性问题。

Comments Accepted to SANER2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09612 2026-02-12 cs.SE 57%

Analyzing GitHub Issues and Pull Requests in nf-core Pipelines: Insights into nf-core Pipeline Repositories

分析 nf-core 流水线中的 GitHub 问题和拉取请求:对 nf-core 流水线仓库的洞察

Khairul Alam, Banani Roy

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文通过分析 nf-core 流水线的 GitHub 问题和拉取请求,揭示了开发和维护过程中面临的挑战,如工具开发、仓库维护及 CI 配置管理,并提出提升流水线可持续性和可重复性的方法。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02122 2026-02-05 cs.CL 57%

Fake News Detection: It's All in the Data!

虚假新闻检测:一切都在数据!

Soveatin Kuntur, Anna Wróblewska, Marcin Paprzycki, Maria Ganzha

机构 * Warsaw University of Technology(华沙技术大学) Systems Research Institute, Polish Academy of Sciences(波兰科学院系统研究所)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 本文综述强调数据集质量与多样性对虚假新闻检测模型的重要性,并提供了一个整合公开数据集的GitHub仓库以促进相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21194 2026-01-30 cs.SE 57%

Human-Agent versus Human Pull Requests: A Testing-Focused Characterization and Comparison

人类-智能体 vs 人类拉请:以测试为中心的特征分析与比较

Roberto Milanese, Francesco Salzano, Angelica Spina, Antonio Vitale, Remo Pareschi, Fausto Fasano, Mattia Fazzini

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本文研究了人类与智能体协作在软件测试中的影响,发现智能体协作能显著增加测试范围和新测试添加,但对测试质量无明显影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20171 2026-01-29 cs.SE 57%

Who Writes the Docs in SE 3.0? Agent vs. Human Documentation Pull Requests

在 SE 3.0 中谁撰写文档?代理 vs. 人类文档拉取请求

Kazuma Yamasaki, Joseph Ayobami Joshua, Tasha Settewong, Mahmoud Alfadel, Kazumasa Shimari, Kenichi Matsumoto

专题命中 软件智能体 :code generation(abstract);分类 cs.SE

AI总结 研究发现 AI 代理在文档拉取请求中比人类更活跃,且其文档修改较少被人类跟进,引发对文档质量和人机协作的担忧。

Comments Comments: 5 pages, 5 figures. To appear in MSR 2026 Mining Challenge (April 2026). Code available at https://github.com/NAIST-SE/msr2026-docs-prs-replication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20109 2026-01-29 cs.SE 57%

Beyond Bug Fixes: An Empirical Investigation of Post-Merge Code Quality Issues in Agent-Generated Pull Requests

超越Bug修复:对代理生成拉取请求合并后代码质量问题的实证研究

Shamse Tasnim Cynthia, Al Muttakin, Banani Roy

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本研究通过分析代理生成的bug修复PR合并后代码质量问题,发现代码异味主导,且合并成功不等于代码质量高,需系统化质量检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00753 2026-01-28 cs.SE 57%

Early-Stage Prediction of Review Effort in AI-Generated Pull Requests

AI生成拉取请求中早期阶段的审查努力预测

Dao Sy Duy Minh, Huynh Trung Kiet, Nguyen Lam Phu Quy, Pham Phu Hoa, Tran Chi Nguyen, Nguyen Dinh Ha Duong, Truong Bao Tran

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本研究提出一种基于创建时间的电路断开模型,用于预测AI生成拉取请求的高维护需求,通过静态复杂性线索识别高成本贡献,提升维护效率。

Comments 5 pages, 4 figures. Accepted to the 23rd International Conference on Mining Software Repositories (MSR '26)

Journal ref 23rd International Conference on Mining Software Repositories (MSR '26), April 13-14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17627 2026-01-27 cs.SE 57%

Code Change Characteristics and Description Alignment: A Comparative Study of Agentic versus Human Pull Requests

代码变更特征与描述对齐:代理与人类拉取请求的比较研究

Dung Pham, Taher A. Ghaleb

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 研究比较了代理与人类生成的拉取请求在代码变更特征和描述质量上的差异,发现代理在提交级消息质量上表现更好,但在PR级总结上不如人类,揭示了代理在微观精确性与宏观沟通之间的差距。

Comments Accepted at the 23rd International Conference on Mining Software Repositories (MSR '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16839 2026-01-26 cs.SE 57%

AI builds, We Analyze: An Empirical Study of AI-Generated Build Code Quality

AI构建,我们分析:对AI生成构建代码质量的实证研究

Anwar Ghammam, Mohamed Almukhtar

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本研究通过分析AI生成的构建代码质量,探讨其在构建系统中的影响,并发现AI生成代码既可能引入质量问题,也部分消除了现有问题,同时大部分代理提交被开发者接受。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16507 2026-01-26 cs.SE 57%

REprompt: Prompt Generation for Intelligent Software Development Guided by Requirements Engineering

REprompt:基于需求工程的智能软件开发提示生成

Junjie Shi, Weisong Sun, Zhenpeng Chen, Zhujun Wu, Xiaohong Chen, Zhi Jin, Yang Liu

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 REprompt是一种基于需求工程的多代理提示优化框架,旨在通过根植需求工程原则来优化系统和用户提示,提升智能软件开发中的提示生成效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13933 2026-01-21 cs.SE 57%

VulnResolver: A Hybrid Agent Framework for LLM-Based Automated Vulnerability Issue Resolution

VulnResolver: 一种基于大语言模型的混合代理框架用于LLM驱动的自动漏洞问题解决

Mingming Zhang, Xu Wang, Jian Zhang, Xiangxin Meng, Jiayi Zhang, Chunming Hu

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 VulnResolver是一种基于大语言模型的混合代理框架,通过上下文预收集和安全属性分析代理,实现自动化漏洞问题的高效解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13754 2026-01-21 cs.SE 57%

On Autopilot? An Empirical Study of Human-AI Teaming and Review Practices in Open Source

自动驾驶?开源软件中人类与AI协作及审查实践的实证研究

Haoyu Gao, Peerachai Banyongrakkul, Hao Guan, Mansooreh Zahedi, Christoph Treude

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本研究通过分析开源项目中AI辅助PR的互动模式,发现非所有权贡献者提交的AI共同撰写的PR被快速合并且反馈极少,揭示了AI在软件工程中的协作与审查实践问题。

Comments accepted as MSR short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11672 2026-01-21 cs.SE cs.SY eess.SY 57%

From Everything-is-a-File to Files-Are-All-You-Need: How Unix Philosophy Informs the Design of Agentic AI Systems

从『万物皆文件』到『文件即一切』:Unix哲学如何影响代理AI系统的设计

Deepak Babu Piskala

专题命中 软件智能体 :software agent(abstract);分类 cs.SE

AI总结 本文探讨了Unix哲学中的『万物皆文件』理念如何影响代理AI系统的设计,通过统一文件和代码抽象,提升系统维护性、可审计性和操作稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18852 2026-01-19 cs.SE 57%

What Drives Issue Resolution Speed? An Empirical Study of Scientific Workflow Systems on GitHub

是什么驱动了问题解决速度?对GitHub上科学工作流系统的实证研究

Khairul Alam, Banani Roy

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文通过实证研究分析了GitHub上科学工作流系统中问题解决速度的影响因素,发现标签和分配问题等机制与更快的解决速度相关,并提出了改进建议。

Comments 7

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07377 2026-01-13 cs.CV cs.AI 57%

Learning Dynamic Collaborative Network for Semi-supervised 3D Vessel Segmentation

学习动态协作网络用于半监督3D血管分割

Jiao Xu, Xin Chen, Lihe Zhang

机构 * Dalian University of Technology(大连理工大学) City University of Hong Kong(香港城市大学)

专题命中 软件智能体 :repository(abstract);分类 cs.AI

AI总结 DiCo通过动态协作网络和多视图整合模块,提升半监督3D血管分割性能

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04171 2026-01-08 cs.LG 57%

Agentic Rubrics as Contextual Verifiers for SWE Agents

代理 rubrics 作为 SWE 代理的上下文验证器

Mohit Raghavendra, Anisha Gunjal, Bing Liu, Yunzhong He

专题命中 软件智能体 :repository(abstract);分类 cs.LG

AI总结 代理 rubrics 通过上下文感知的检查清单提升 SWE 代理的验证效率与准确性。

Comments 31 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00477 2026-01-05 cs.CR cs.SE 57%

Security in the Age of AI Teammates: An Empirical Study of Agentic Pull Requests on GitHub

AI队友时代的安全:对GitHub上代理拉取请求的实证研究

Mohammed Latif Siddiq, Xinye Zhao, Vinicius Carvalho Lopes, Beatrice Casey, Joanna C. S. Santos

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 研究分析了GitHub上代理撰写的PR在安全方面的贡献,发现其主要进行支持性的安全加固活动,且PR被拒绝与复杂性和冗长性相关。

Comments Submitted to Information and Software Technology Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24656 2026-01-05 cs.SE 57%

Characterizing Bugs and Quality Attributes in Quantum Software: A Large-Scale Empirical Study

量子软件中缺陷和质量属性的特征化:一项大规模经验研究

Mir Mohammad Yousuf, Shabir Ahmad Sofi

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本研究通过大规模分析量子软件缺陷,揭示了全栈库和编译器的高缺陷率及自动化测试对减少缺陷的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24636 2026-01-01 cs.SE 57%

How Do Agentic AI Systems Deal With Software Energy Concerns? A Pull Request-Based Study

代理AI系统如何处理软件能耗问题?基于拉取请求的研究

Tanjum Motin Mitul, Md. Masud Mazumder, Md Nahidul Islam Opu, Shaiful Chowdhury

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本文研究了代理AI系统在生成软件时对能耗问题的意识,通过分析拉取请求发现,尽管构建和运行这些系统耗能高,但生成的软件制品表现出一定的能耗意识,但优化相关的PR因影响可维护性而被接受较少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22469 2025-12-30 cs.SE 57%

GraphLocator: Graph-guided Causal Reasoning for Issue Localization

GraphLocator: 图引导的因果推理用于问题定位

Wei Liu, Chao Peng, Pengfei Gao, Aofan Liu, Wei Zhang, Haiyan Zhao, Zhi Jin

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 GraphLocator通过因果图发现和动态解构解决软件问题定位中的因果不匹配和一对一不匹配问题,提升定位准确性和下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22087 2025-12-29 cs.CL 57%

Context as a Tool: Context Management for Long-Horizon SWE-Agents

上下文作为工具:长周期SWE代理的上下文管理

Shukai Liu, Jian Yang, Bo Jiang, Yizhi Li, Jinyang Guo, Xianglong Liu, Bryan Dai

机构 * Beihang University(北航大学) Manchester(曼彻斯特) Ubiquant

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 CAT通过整合上下文管理工具,提升SWE代理的长周期推理能力,实验表明其在SWE-Bench-Verified上达到57.6%的解决率,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21919 2025-12-29 cs.CL 57%

SWE-RM: Execution-free Feedback For Software Engineering Agents

SWE-RM:无执行反馈用于软件工程代理

KaShun Shum, Binyuan Hui, Jiawei Chen, Lei Zhang, X. W., Jiaxi Yang, Yuzhen Huang, Junyang Lin, Junxian He

机构 * The Hong Kong University of Science and Technology(香港科技大学) Alibaba Group(阿里巴巴集团)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 SWE-RM通过混合专家架构提升软件工程代理在TTS和RL中的性能,达到新的开源模型最佳水平。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02864 2025-12-23 cs.NE cs.AI math.CA math.CO math.MG 57%

Mathematical exploration and discovery at scale

大规模数学探索与发现

Bogdan Georgiev, Javier Gómez-Serrano, Terence Tao, Adam Zsolt Wagner

机构 * Google DeepMind(谷歌DeepMind) Department of Mathematics, Brown University(布朗大学数学系) Institute for Advanced Study(高级研究院) UCLA Department of Mathematics(加州大学洛杉矶分校数学系)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 AlphaEvolve通过进化搜索发现数学构造,提升数学问题解决效率

Comments 81 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏