arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1079 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1079 篇

2604.12301 2026-04-15 cs.DC cs.AI cs.SE 62%

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads

Local-Splitter:七种减少云LLM令牌使用量策略的测量研究

Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

机构 * Sperix Labs(Sperix实验室) VIA Cybersecurity Lab, KNUST(VIA网络安全实验室,科罗尼斯特大学) Quantum and Assistive Technologies Lab, KNUST(量子与辅助技术实验室,科罗尼斯特大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文研究了七种减少云LLM令牌使用量的策略,通过测量发现本地路由与提示压缩组合在编辑密集型任务中可节省45-79%的云令牌,而RAG密集型任务中完整策略集可节省51%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10300 2026-04-14 cs.SE cs.AI 62%

From Helpful to Trustworthy: LLM Agents for Pair Programming

从有益到可信:用于配对编程的LLM代理

Ragib Shahariar Ayon

机构 * Texas State University(德克萨斯州立大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文研究多代理LLM配对编程,通过外部化意图和工具迭代验证,提升代码可靠性、可审计性和可维护性。

Comments Accepted in 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (FSE Companion 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07900 2026-04-10 cs.SE cs.AI 62%

Rethinking the Value of Agent-Generated Tests for LLM-Based Software Engineering Agents

重新思考基于LLM的软件工程代理生成测试的价值

Zhi Chen, Zhensu Sun, Yuling Shi, Chao Peng, Xiaodong Gu, David Lo, Lingxiao Jiang

机构 * Singapore Management University(新加坡管理大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究探讨了LLM软件工程代理生成测试的有效性,发现测试主要作为反馈渠道,而非提升问题解决效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12374 2026-04-10 cs.SE cs.AI 62%

Beyond Final Code: A Process-Oriented Error Analysis of Software Development Agents in Real-World GitHub Scenarios

超越最终代码:对现实世界GitHub场景中软件开发代理的过程导向错误分析

Zhi Chen, Wei Ma, Lingxiao Jiang

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文通过分析3977个解决阶段轨迹和3931个测试阶段日志,揭示了软件开发代理在解决GitHub问题时的错误模式,发现Python执行错误与较低的解决率和更高的推理开销相关,并识别了影响基准公平性的三个bug。

Comments Paper accepted at ICSE 2026, Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07455 2026-04-10 cs.AI cs.LG cs.LO 62%

Munkres' General Topology Autoformalized in Isabelle/HOL

Munkres泛拓扑论在Isabelle/HOL中的自动形式化

Dustin Bryant, Jonathan Julián Huerta y Munive, Cezary Kaliszyk, Josef Urban

机构 * Independent(独立研究者) Aalborg University(奥尔堡大学) University of Melbourne(墨尔本大学) AI4REASON and University of Gothenburg / Chalmers University(AI4REASON 和哥德堡大学 / 查尔姆斯理工大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究利用LLM辅助在Isabelle/HOL中自动形式化Munkres泛拓扑教材,生成85000余行代码,涵盖39章节,证明包括Tychonoff定理等核心结果,方法结合声明性证明与sledgehammer工具,展现高效形式化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06126 2026-04-08 cs.LG cs.AI 62%

Gym-Anything: Turn any Software into an Agent Environment

Gym-Anything: 将任意软件转化为智能体环境

Pranjal Aggarwal, Graham Neubig, Sean Welleck

机构 * CMU(卡内基梅隆大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Gym-Anything框架,通过多智能体任务将任意软件转化为交互式计算机使用环境,生成涵盖医疗、天文、工程等领域的10K+长周期任务,提升现实场景下的智能体研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05955 2026-04-08 cs.SE cs.AI 62%

Does Pass Rate Tell the Whole Story? Evaluating Design Constraint Compliance in LLM-based Issue Resolution

通过率能讲述全部故事吗?评估基于LLM的问题解决的设计约束合规性

Kai Yu, Zhenhao Zhou, Junhao Zeng, Ying Wang, Xueying Du, Zhiqiang Yuan, Junwei Liu, Ziyu Zhou, Yujia Wang, Chong Wang, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出设计感知问题解决方法,引入bench基准,通过挖掘和验证真实项目中的设计约束,评估LLM在问题解决中设计约束的合规性,发现测试通过率高并不代表设计合规性好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04514 2026-04-07 cs.AI cs.CL cs.IR 62%

SuperLocalMemory V3.3: The Living Brain -- Biologically-Inspired Forgetting, Cognitive Quantization, and Multi-Channel Retrieval for Zero-LLM Agent Memory Systems

SuperLocalMemory V3.3:活脑——生物启发的遗忘、认知量化与多通道检索用于零LLM代理记忆系统

Varun Pratap Bhardwaj

机构 * Independent Researcher(独立研究员)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SuperLocalMemory V3.3,通过生物启发的遗忘机制、认知量化和多通道检索,实现零LLM代理的记忆系统,提升了多跳和对抗场景下的性能。

Comments 19 pages, 4 figures, 11 tables. Third paper in the SuperLocalMemory trilogy. Code: https://github.com/qualixar/superlocalmemory (v3.3.26). npm: superlocalmemory. PyPI: superlocalmemory

URL PDF HTML 收藏
2604.01496 2026-04-03 cs.SE cs.CL 62%

From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents

从SWE-ZERO到SWE-HERO:从无执行到基于执行的微调方法用于软件工程代理

Nikolai Ludwig, Wasi Uddin Ahmad, Somshubra Majumdar, Boris Ginsburg

机构 * NVIDIA(英伟达)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL

AI总结 本文提出一种两阶段SFT方法,通过知识蒸馏实现SWE-bench的最佳性能,通过进化精炼策略提升代码语义和工程流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08640 2026-04-03 cs.SE cs.AI 62%

Automating Android Build Repair: Bridging the Reasoning-Execution Gap in LLM Agents with Domain-Specific Tools

自动化Android构建修复:通过领域特定工具弥合LLM代理中的推理-执行差距

Ha Min Son, Huan Ren, Xin Liu, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校) CodeDroid LLC(CodeDroid有限责任公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出AndroidBuildBench基准和GradleFixer工具,通过领域特定抽象提升LLM修复Android构建错误的效率,解决LLM在低层执行中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08316 2026-03-30 cs.SE cs.AI 62%

SWE Context Bench: A Benchmark for Context Learning in Coding

SWE Context Bench: 一个用于编码上下文学习的基准测试

Jared Zhu, Minhao Hu, Junde Wu

机构 * Independent Researcher(独立研究员) University of Oxford(牛津大学) University of Edinburgh(爱丁堡大学) Technical University of Munich(慕尼黑工业大学) MemoraX AI National University of Singapore(新加坡国立大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出SWE-ContextBench基准,用于评估编程代理的上下文重用能力,通过1100个基础任务和376个相关任务,从GitHub问题和拉取请求中挖掘真实依赖关系,评估预测准确度、时间效率和成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23515 2026-03-26 cs.CL cs.AI 62%

Training a Large Language Model for Medical Coding Using Privacy-Preserving Synthetic Clinical Data

利用隐私保护的合成临床数据训练大型语言模型进行医学编码

John Cook, Michael Wyatt, Peng Wei, Iris Chin, Santosh Gupta, Van Zyl Van Vuuren, Richie Siburian, Amanda Spicer, Kristen Viviano, Alda Cami, Raunaq Malhotra, Zhewei Yao, Jeff Rasley, Gaurav Kaushik

机构 * Veradigm Snowflake

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了利用隐私保护的合成临床数据训练大型语言模型进行医学编码的可行性,通过微调Llama 3-70B模型,实现了ICD-10-CM和CPT代码的高精度预测,显著提升了编码准确性。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20691 2026-03-24 cs.SE cs.AI 62%

SWE-Next: Scalable Real-World Software Engineering Tasks for Agents

SWE-Next:可扩展的现实世界软件工程任务用于代理

Jiarong Liang, Zhiheng Lyu, Zijie Liu, Xiangchao Chen, Ping Nie, Kai Zou, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Independent(独立)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 SWE-Next通过执行 grounded 的框架实现可扩展的软件工程任务和轨迹收集,通过严格筛选和高效的数据采集提升训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17826 2026-03-19 cs.SE cs.AI 62%

FailureMem: A Failure-Aware Multimodal Framework for Autonomous Software Repair

FailureMem: 一种面向故障的多模态框架用于自主软件修复

Ruize Ma, Yilei Jiang, Shilin Zhang, Zheng Ma, Yi Feng, Vincent Ng, Zhi Wang, Xiangyu Yue, Chuanyi Li, Lewei Lu

机构 * Nanjing University(南京大学) SenseTime(秒速) The Chinese University of Hong Kong(香港中文大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 软件智能体 :program repair(abstract);分类 cs.SE、cs.AI

AI总结 本文提出FailureMem框架,通过融合工作流代理、主动感知工具和故障记忆库,提升多模态自动程序修复的效率与准确性,实验表明其在GUI修复任务中解决率提升3.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15914 2026-03-18 cs.LG cs.AI 62%

The Agentic Researcher: A Practical Guide to AI-Assisted Research in Mathematics and Machine Learning

代理研究员:人工智能辅助数学和机器学习研究的实用指南

Max Zimmer, Nico Pelleriti, Christophe Roux, Sebastian Pokutta

机构 * Department for AI in Society, Science, and Technology(人工智能与社会、科学和技术部门) Zuse Institute Berlin(柏林Zuse研究所) Institute of Mathematics(数学研究所) Technische Universität Berlin(柏林技术大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种开源框架,通过方法学规则将CLI编码代理转化为自主研究助手,并通过深度学习和数学案例研究,指导研究人员如何有效利用AI工具进行研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23586 2026-03-17 cs.SE cs.AI 62%

Reducing Cost of LLM Agents with Trajectory Reduction

通过轨迹缩减降低LLM代理的成本

Yuan-An Xiao, Pengfei Gao, Chao Peng, Yingfei Xiong

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出AgentDiet方法,通过减少LLM代理轨迹中的冗余信息,降低计算成本,实验显示可减少输入token和总计算成本达39.9%-59.7%和21.1%-35.9%。

Comments 22 pages, 5 figures; accepted for FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13640 2026-03-17 cs.LG cs.SE 62%

SemRep: Generative Code Representation Learning with Code Transformations

SemRep:基于代码变换的生成式代码表示学习

Weichen Li, Jiamin Song, Bogdan Alexandru Stoica, Arav Dhoot, Gabriel Ryan, Shengyu Fu, Kexin Pei

机构 * The University of Chicago(芝加哥大学) Columbia University(哥伦比亚大学) Microsoft(微软公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.LG

AI总结 SemRep通过生成式代码表示学习提升代码变换效果,利用语义保持变换作为中间表示,实现更准确的语义推理和更高效的代码优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04857 2026-03-06 cs.CL cs.SE 62%

FireBench: Evaluating Instruction Following in Enterprise and API-Driven LLM Applications

FireBench: 评估企业及 API 驱动的 LLM 应用中的指令遵循

Yunfan Zhang, Yijie Bei, Jetashree Ravi, Pawel Garbacki

机构 * Columbia University(哥伦比亚大学) Fireworks AI

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL

AI总结 FireBench 是一个评估企业及 API 驱动 LLM 应用中指令遵循能力的基准测试,通过 2400 个样本评估六个核心能力维度,评估 11 个 LLM 的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04582 2026-03-06 cs.AI cs.LG 62%

Self-Attribution Bias: When AI Monitors Go Easy on Themselves

自我归因偏差:当AI监控对自己宽容时

Dipika Khullar, Jack Hopkins, Rowan Wang, Fabien Roger

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 研究发现AI监控在自我归因偏差下可能低估风险,导致部署不充分的监控系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03800 2026-03-05 cs.AI cs.LG 62%

A Rubric-Supervised Critic from Sparse Real-World Outcomes

从稀疏现实结果中学习的评分监督批评者

Xingyao Wang, Valerie Chen, Heng Ji, Graham Neubig

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种从稀疏现实结果中学习的评分监督批评者模型,用于提升编码代理的训练和推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00575 2026-03-03 cs.AI cs.SE 62%

SWE-Hub: A Unified Production System for Scalable, Executable Software Engineering Tasks

SWE-Hub:一个统一的生产系统,用于可扩展、可执行的软件工程任务

Yucheng Zeng, Shupeng Li, Daxiang Dong, Ruijie Xu, Zimo Chen, Liwei Zheng, Yuxuan Li, Zhe Zhou, Haotian Zhao, Lun Tian, Heng Xiao, Tianshu Zhu, Longkun Hao, Jianmin Wu

机构 * Qianfan Team, Baidu Inc.(百度公司)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 SWE-Hub通过统一的生产系统解决软件工程任务中可执行、可扩展和现实数据的稀缺问题,整合环境自动化、大规模合成和多样化任务生成,实现持续交付可执行任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04189 2026-02-18 cs.LG cond-mat.dis-nn cs.AI 62%

BEP: A Binary Error Propagation Algorithm for Binary Neural Networks Training

BEP:一种用于二进制神经网络训练的二进制误差传播算法

Luca Colombo, Fabrizio Pittorino, Daniele Zambon, Carlo Baldassi, Manuel Roveri, Cesare Alippi

机构 * Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子、信息与生物工程系,米兰理工学院) Faculty of Informatics and IDSIA, Università della Svizzera italiana(信息学院和IDSIA,瑞士大学) Department of Computing Sciences and BIDSA, Bocconi University(计算科学系和BIDSA,博科尼大学)

专题命中 软件智能体 :repository(abstract);分类 cs.AI、cs.LG

AI总结 BEP是一种用于二进制神经网络训练的二进制误差传播算法,实现了端到端的二进制训练,提升了多层感知机和循环神经网络的测试准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03262 2026-02-18 cs.SE cs.CL 62%

Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks

Vibe 编程是否安全?在现实任务中对代理生成代码的漏洞基准测试

Songwen Zhao, Danqing Wang, Kexun Zhang, Jiaxuan Luo, Zhuo Li, Lei Li

机构 * Carnegie Mellon University Language Technologies Institute(卡内基梅隆大学语言技术研究所) Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学) HydroX AI

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL

AI总结 本文通过基准测试发现,Vibe 编程在现实任务中生成的代码安全性不足,尽管功能正确但存在安全漏洞,警示其在安全敏感领域应用的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14296 2026-02-17 cs.AI cs.SE 62%

AutoWebWorld: Synthesizing Infinite Verifiable Web Environments via Finite State Machines

AutoWebWorld: 通过有限状态机合成无限可验证的网页环境

Yifan Wu, Yiran Peng, Yiyu Chen, Jianhao Ruan, Zijie Zhuang, Cheng Yang, Jiayi Zhang, Man Chen, Yenchi Tseng, Zhaoyang Yu, Liang Chen, Yuyao Zhai, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Peking University(北京大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 AutoWebWorld通过有限状态机合成可验证的网页环境,实现自动化搜索与验证流程,提升WebGUI代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14293 2026-02-17 cs.LG cs.AI 62%

KernelBlaster: Continual Cross-Task CUDA Optimization via Memory-Augmented In-Context Reinforcement Learning

KernelBlaster: 通过记忆增强的上下文强化学习实现持续的跨任务CUDA优化

Kris Shengjun Dong, Sahil Modi, Dima Nikiforov, Sana Damani, Edward Lin, Siva Kumar Sastry Hari, Christos Kozyrakis

机构 * NVIDIA University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 KernelBlaster通过记忆增强的上下文强化学习框架提升CUDA代码优化性能,实现跨多个GPU架构世代的高效优化。

Comments 15 pages, 33 pages with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16956 2026-02-09 cs.SE cs.LG 62%

SpIDER: Spatially Informed Dense Embedding Retrieval for Software Issue Localization

SpIDER:面向软件问题定位的时空感知密集嵌入检索

Shravan Chaudhari, Rahul Thomas Jacob, Mononito Goswami, Jiajun Cao, Shihab Rashid, Christian Bock

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) AWS(亚马逊公司) AWS AI Labs(亚马逊人工智能实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.LG

AI总结 SpIDER通过结合LLM推理和图结构探索信息,提升代码库中相关代码单元的密集检索性能,实验显示在多个编程语言和基准测试中性能提升达13%。

Comments Initial preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04518 2026-02-05 cs.CY cs.AI cs.LG 62%

Learning the Value Systems of Agents with Preference-based and Inverse Reinforcement Learning

基于偏好和逆强化学习的学习代理价值系统

Andrés Holgado-Sánchez, Holger Billhardt, Alberto Fernández, Sascha Ossowski

机构 * Universidad Rey Juan Carlos(雷乌安卡洛斯大学)

专题命中 软件智能体 :software agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于偏好和逆强化学习的方法,用于自动从观察和人类示范中学习代理的价值系统,以解决不同用户价值系统差异带来的协议一致性问题。

Comments 42 pages, 5 figures. Published in Journal of Autonomous Agents and Multi-Agent Systems

Journal ref Holgado-Sánchez, A., Billhardt, H., Fernández, A., Ossowski, S. Learning the value systems of agents with preference-based and inverse reinforcement learning. Autonomous Agents Multi-Agent Systems 40, 4 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11544 2026-02-04 cs.HC cs.AI cs.CL 62%

Medication counseling with large language models: balancing flexibility and rigidity

利用大语言模型进行用药咨询:在灵活性与严谨性之间取得平衡

Joar Sabel, Mattias Wingren, Andreas Lundell, Sören Andersson, Sara Rosenberg, Susanne Hägglund, Linda Estman, Malin Andtfolk

机构 * Department of Engineering and Information Technology Åbo Akademi University(工程与信息科技系阿博阿卡迪米大学) Experience Lab Åbo Akademi University(经验实验室阿博阿卡迪米大学) Department of Natural and Health Sciences Åbo Akademi University(自然与健康科学系阿博阿卡迪米大学) Department of Caring and Ethics University of Stavanger(护理与伦理系斯塔万格大学)

专题命中 软件智能体 :software agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种利用大语言模型在药房环境中提供用药咨询的原型系统,旨在平衡对话要求与灵活性,减少幻觉并提高响应质量。

Comments Accepted for 2025 IEEE International Conference on Agentic AI (ICA). 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02361 2026-02-03 cs.SE cs.AI 62%

SWE-Universe: Scale Real-World Verifiable Environments to Millions

SWE-Universe: 将现实可验证环境扩展至百万级

Mouxiang Chen, Lei Zhang, Yunlong Feng, Xuwu Wang, Wenting Zhao, Ruisheng Cao, Jiaxi Yang, Jiawei Chen, Mingze Li, Zeyao Ma, Hao Ge, Zongmeng Zhang, Zeyu Cui, Dayiheng Liu, Jingren Zhou, Jianling Sun, Junyang Lin, Binyuan Hui

机构 * Qwen Team, Alibaba Group(通义团队,阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 SWE-Universe通过高效框架构建百万级现实可验证环境,提升编码代理训练效果。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00164 2026-02-03 cs.SE cs.AI 62%

Why Are AI Agent Involved Pull Requests (Fix-Related) Remain Unmerged? An Empirical Study

为何AI代理参与的修复相关拉取请求仍未合并?一项实证研究

Khairul Alam, Saikat Mondal, Banani Roy

机构 * University of Saskatchewan, Canada(萨斯喀彻温大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文通过实证研究揭示了AI代理生成的修复相关PRs合并失败的主要原因,指出测试用例失败和先前问题解决是主要障碍,为AI与人类协作改进提供方向。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏