arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1074 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1074 篇

2608.09072 2026-08-11 cs.SE cs.AI 新提交 90%

A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents

面向编码智能体的需求澄清、规划与代码生成的统一问题解决基准

Xin Zhou, Chun Yong Chong, Kisub Kim, Yun Peng, Rui Shu, Zihan Wu, Xu Han, Guowen Yuan, Zeyang Zhuang, Jounghoon Kim, Jeongjin Ju, Seongmin Ju, Taein Yoon, David Lo

专题命中 软件智能体 :code generation(title,abstract);coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究推出SWE-RPG编码智能体基准,评估发现主流编码智能体在该基准上平均解决率仅31.5%,隐性需求恢复是主要瓶颈,为改进编码智能体提供了方向。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12730 2026-01-09 cs.CL 89%

NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents

NL2Repo-Bench: 向编码代理的长周期仓库生成评估迈进

Jingzhe Ding, Shengda Long, Changxin Pu, Huan Zhou, Hongwan Gao, Xiang Gao, Chao He, Yue Hou, Fei Hu, Zhaojian Li, Weiran Shi, Zaiyuan Wang, Daoguang Zan, Chenchen Zhang, Xiaoxu Zhang, Qizhi Chen, Xianfu Cheng, Bo Deng, Qingshui Gu, Kai Hua, Juntao Lin, Pai Liu, Mingchen Li, Xuanguang Pan, Zifan Peng, Yujia Qin, Yong Shan, Zhewen Tan, Weihao Xie, Zihan Wang, Yishuo Yuan, Jiayu Zhang, Enduo Zhao, Yunfei Zhao, He Zhu, Liya Zhu, Chenyang Zou, Ming Ding, Jianpeng Jiao, Jiaheng Liu, Minghao Liu, Qian Liu, Chongyang Tao, Jian Yang, Tong Yang, Zhaoxiang Zhang, Xinjie Chen, Wenhao Huang, Ge Zhang

机构 * Nanjing University(南京大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);code generation(abstract);分类 cs.CL

AI总结 NL2Repo-Bench通过评估编码代理在长周期内生成仓库的能力,揭示了自主软件开发中的核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28591 2026-07-31 cs.SE cs.CL cs.LG 新提交 89%

Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments

Change2Task:从仓库变更到可执行编码智能体任务与环境

Haomin Qi, Xingliang Wang, Xuanqi Gao, Baihui Sang, Xin Zhang, Minghua Ma, Pengfei Gao, Yu Kang, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi Zhang

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 Change2Task系统基于仓库历史将已合并拉取请求转为编码智能体任务,在5类任务中实现79.6%验证成功率,比基准多恢复29.2%任务,可减少流程支出10.8%。

Comments 15 pages, 7 figures, and 15 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24882 2026-07-29 cs.IR cs.AI cs.CL 新提交 88%

Agent Retrieval Bench: Evaluating Repository Context Retrieval for Coding Agents

智能体检索基准:评估代码智能体的仓库上下文检索

Bowen Qin, Yi Xie

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 研究代码智能体仓库上下文检索问题,引入智能体检索基准,涵盖多种检索任务和样本。评估多种检索方法,发现无单一方法占优,存在校准差距,且记录轨迹有缺失。通过试验表明检索得出的初始上下文有优势,神谕金上下文还有提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11988 2026-06-25 cs.SE cs.AI 版本更新 88%

Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?

评估 AGENTS.md:仓库级上下文文件对编码助手有帮助吗?

Thibaud Gloaguen, Niels Mündler, Mark Müller, Veselin Raychev, Martin Vechev

机构 * Department of Computer Science(计算机科学系) ETH Zurich(苏黎世联邦理工学院)

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 通过SWE-bench任务和开发者提交的上下文文件,评估发现上下文文件并未普遍提升编码助手的任务成功率,反而平均增加20%以上的推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20512 2026-06-23 cs.SE cs.LG 新提交 88%

Probe-and-Refine Tuning of Repository Guidance for Coding Agents

代码代理的仓库指导的探测与精炼调优

Asa Shepard, Jeannie Albrecht

机构 * Williams College(威廉姆斯学院)

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE、cs.LG

AI总结 提出探测与精炼调优方法,通过合成bug修复探测迭代诊断和修补仓库指导文件,在SWE-bench Verified上以Qwen3.5-35B-A3B模型达到33.0%解决率,优于静态知识库的28.3%和无指导基线的25.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09268 2026-08-11 cs.HC cs.AI 新提交 88%

Can Coding Agents Solve Repository-Level Issues with Rendered Code? An Exploratory Study of Visual Representations

编码智能体能通过渲染代码解决仓库级问题吗?一项关于视觉表示的探索性研究

Weijie Liang, Yuanfeng Song, Xing Chen, Caleb Chen Cao, Sirui Han, Yike Guo

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.AI

AI总结 本研究探索将渲染代码作为编码智能体的操作上下文,基于 SWE-bench Verified 实验发现其可降低提示 token 成本但受模型架构限制,仅在原始代码读取为瓶颈时有用,是可行但有条件的压缩机制。

Comments 8 pages of main content

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02001 2026-08-04 cs.SE 新提交 88%

VulnGym: Benchmarking Coding Agents for Repository-Level Vulnerability Detection

VulnGym:面向代码智能体的仓库级漏洞检测基准测试

Kexing Ji, Jiachen Liu, Enze Hu, Cuiyun Gao, Keke Lian, Yongheng Liu, Lei Zhang, Tian Dong, Hao Chen, Wang Bin

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE

AI总结 研究人员提出VulnGym基准,解决现有基准难以评估代码智能体仓库级漏洞检测能力的问题,发现当前代码智能体在该检测及支撑追踪构建上仍存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25431 2026-07-29 cs.SE 新提交 88%

CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents

CodeNib:一种用于向编码代理提供仓库上下文的多视图数据系统

Zhongming Yu, Hengjia Yu, Boqin Yuan, Shuting Zhao, Yizhao Chen, Aryan Dokania, Mihir Jagtap, Jiayu Chang, Yitong Ma, Yash Jayswal, Wentao Ni, Hejia Zhang, Zhaoling Chen, Gangda Deng, Jishen Zhao

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE

AI总结 研究编码代理从仓库获取上下文的问题,提出CodeNib构建多视图数据系统,可重用视图并映射到源范围,通过运行时提供多种服务,实验表明其在更新速度、延迟等方面有优势,支持多视图仓库上下文服务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14066 2026-07-01 cs.SE 新提交 88%

FastContext: Training Efficient Repository Explorer for Coding Agents

FastContext: 为编码智能体训练高效的仓库探索器

Shaoqiu Zhang, Maoquan Wang, Yuling Shi, Yuhang Wang, Xiaodong Gu, Yongqiang Yao, Tori Gong, Sheng Chen, Rao Fu, Anisha Agarwal, Spandan Grag, Gabriel Ryan, Colin Merkel, Yufan Huang, Shengyu Fu

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE

AI总结 提出专用探索子智能体FastContext,通过并行工具调用和专注上下文生成,分离仓库探索与问题解决,在SWE-bench等任务上提升修复率达5.5%,降低编码智能体token消耗达60%。

Comments The current article involves some product IP issues and needs to be withdrawn and re-approved

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08703 2025-04-25 cs.SE 88%

SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents

Muhammad Shihab Rashid, Christian Bock, Yuan Zhuang, Alexander Buchholz, Tim Esler, Simon Valentin, Luca Franceschi, Martin Wistuba, Prabhu Teja Sivaprasad, Woo Jung Kim, Anoop Deoras, Giovanni Zappella, Laurent Callot

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE

Comments 20 pages, 6 figures, corrected author name spelling

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04804 2026-08-06 cs.SE cs.AI 新提交 87%

Scrouting: Cost-Aware Routing of Coding Agents by Scouting the Repository First

Scrouting:通过先探查仓库实现编码智能体的成本感知路由

Ishaan Bhola, Adithyan Krishnan, Mukunda NS

专题命中 软件智能体 :repository(title,abstract);coding agent(title);分类 cs.SE、cs.AI

AI总结 本文提出SuperScout,先探查仓库生成经沙箱验证的结构化交接内容,再路由任务至四个修复器,在SWE-bench Pro上以约五分之一成本达到最优单模型的解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27146 2026-07-30 cs.SE cs.CL cs.LG 新提交 87%

MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis

MindForge:通过无源码程序合成教小型语言模型全生命周期软件工程

Yihao Chen, Shi Chang, Khaled Chawa, Feng Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

专题命中 软件智能体 :program synthesis(title,abstract);repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 研究针对小型语言模型从零构建程序的挑战,提出MindForge构建全生命周期无源码训练环境,微调Qwen3.6-27B后在ProgramBench及7个软件工程基准上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04327 2026-01-09 cs.DC cs.AI 86%

ParaCodex: A Profiling-Guided Autonomous Coding Agent for Reliable Parallel Code Generation and Translation

ParaCodex: 一种基于性能分析的自主编码代理,用于可靠并行代码生成与翻译

Erel Kaplan, Tomer Bitan, Lian Ghrayeb, Le Chen, Tom Yotam, Niranjan Hasabnis, Gal Oren

专题命中 软件智能体 :coding agent(title,abstract);code generation(title);分类 cs.AI

AI总结 ParaCodex是一种基于性能分析的自主编码代理,通过分阶段热点分析、显式数据规划和正确性门控,实现高效并行代码生成与翻译,显著提升GPU性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21649 2026-01-30 cs.LG cs.AI cs.CL cs.SE 85%

SWE-Spot: Building Small Repo-Experts with Repository-Centric Learning

SWE-Spot:构建基于仓库的小型专家

Jinjun Peng, Magnus Saebo, Tianjun Zhong, Yi-Jie Cheng, Junfeng Yang, Baishakhi Ray, Simin Chen, Yangruibo Ding

机构 * Department of Computer Science, Columbia University, New York, USA(哥伦比亚大学计算机科学系) Computer Science Department, University of California, Los Angeles, California, USA(加州大学洛杉矶分校计算机科学系)

专题命中 软件智能体 :repository(title,abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 SWE-Spot提出仓库导向学习范式,通过参数知识获取训练小型专家模型,提升代码任务表现并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18901 2024-07-29 cs.SE cs.AI cs.CL cs.LG 85%

AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents

Harsh Trivedi, Tushar Khot, Mareike Hartmann, Ruskin Manku, Vinty Dong, Edward Li, Shashank Gupta, Ashish Sabharwal, Niranjan Balasubramanian

专题命中 软件智能体 :coding agent(title,abstract);code generation(abstract);分类 cs.SE、cs.CL、cs.AI

Comments ACL'24 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27283 2026-05-01 cs.CL cs.AI cs.LG 85%

Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents

学习何时记忆:风险敏感的上下文老虎机用于具有回避意识的记忆检索的LLM编码代理

Mehmet Iscan

机构 * PythaLab Yildiz Technical University(Yildiz技术大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RSCB-MC方法,通过风险敏感的上下文老虎机机制,解决编码代理在记忆检索中的安全性和有效性问题,实现非注入和回避作为首要安全动作。

Comments 26 pages, 7 figures, 10 tables. Code and deterministic local artifacts are available at the repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02499 2026-08-04 cs.SE cs.AI cs.CL 新提交 85%

SWE-Touch: Benchmarking Coding Agents When Users Touch the Code

SWE-Touch:用户接触代码时的编码智能体基准测试

Yuqiao Tan, Jinxiang Meng, Fangyu Lei, Minzheng Wang, Shizhu He, Jun Zhao, Kang Liu

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 SWE-Touch基准测试显示,编码智能体对共享工作空间的状态感知不足,反编辑使其解决率降低7.7个百分点,需优化相关协作能力。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/SWE-Touch

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20789 2026-06-01 cs.CL cs.LG cs.SE 85%

SERA: Soft-Verified Efficient Repository Agents

SERA:软验证的高效仓库智能体

Ethan Shen, Daniel Tormoen, Saurabh Shah, Ali Farhadi, Tim Dettmers

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Paul G. Allen School of Computer Science and Engineering(保罗·G·艾伦计算机科学与工程学院) Allen Institute of Artificial Intelligence(艾伦人工智能研究所) Machine Learning Department(机器学习系)

专题命中 软件智能体 :repository(title,abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 提出SERA方法,通过软验证生成(SVG)高效训练编码智能体,使其快速适应私有代码库,在开源模型中取得领先性能且成本极低。

Comments 21 main pages, 6 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08468 2026-05-12 cs.CL cs.AI cs.LG 85%

PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents

PYTHALAB-MERA:基于验证的内存、检索与接受控制用于冻结LLM编码代理

Mehmet Iscan

机构 * PythaLab, Yildiz Technical University(PythaLab,伊兹密尔技术大学)

专题命中 软件智能体 :coding agent(title,abstract);code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PYTHALAB-MERA通过轻量级外部控制器实现验证基础的内存管理、适应性检索与延迟信用分配,提升冻结本地模型在编码任务中的验证成功率。

Comments 28 pages, 4 figures, 7 tables; local CLI artifact evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14573 2026-08-14 cs.AI cs.SE 版本更新 84%

Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents

支付宝-PIBench:用于编码代理的现实支付集成基准测试

Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu

机构 * Ant Group(蚂蚁集团)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 研究旨在评估编码代理在支付宝支付集成任务中的表现,引入支付宝-PIBench基准测试,含九个产品项目和18个任务实例,分不同场景。通过评估六个编码代理模型得出评分通过率,发现有技能条件下RPR提升,为诊断模型能力和评估支付集成指导提供可控环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05886 2026-08-07 cs.SE cs.AI 新提交 84%

CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents

CodeGrep:用于LLM编码智能体的基于强化学习训练的检索智能体

Wuya Chen, Yihao yang, Yang Cao, Yue Lin

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究针对LLM编码智能体查找文件效率低的问题,提出基于GRPO训练的14B检索智能体CodeGrep,在SWE-Bench Verified上保持解决率的同时,减少了交互轮数和token使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04278 2026-08-06 cs.SE cs.AI 新提交 84%

EA-Graph: Artifact-Anchored Verification Memory for Coding Agents under Upstream Drift

EA-Graph:面向上游漂移场景下编码智能体的工件锚定验证记忆

Hwai-Jung Hsu, Cheng-Jan Chi, Hanna Everett

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究提出EA-Graph这一工件锚定验证记忆,经实验证实其在编码智能体的可证性判断任务中,能提升较小模型的表现,可缩小模型间能力差距。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27250 2026-07-31 cs.SE cs.AI 新提交 84%

Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories

上下文文件对编码智能体有帮助吗?针对真实仓库的双智能体消融研究

Prakhar Khatri

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究通过双智能体(Claude Code、Codex)的受控消融实验,发现上下文文件对编码智能体的正确性无显著提升,其失败源于实现技能而非知识缺失,还解释了过往研究矛盾的原因并公开了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26819 2026-07-30 cs.SE cs.AI 新提交 84%

A First Look at Coding Agents' Compliance with AI Contribution Rules in Open-Source Communities

初探编码智能体在开源社区中对AI贡献规则的合规性

Wenhao Yang, Runzhi He, Minghui Zhou

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究构建RepoComplianceBench基准测试编码智能体对开源社区AI贡献规则的合规性,发现当前智能体几乎不主动检索规则,仅在提示等辅助下实现披露与验证,但始终不执行AI禁令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01211 2026-07-17 cs.SE cs.AI 版本更新 84%

Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?

性能优化基准测试是否可靠地衡量编码智能体?

Zhi Chen, Zhensu Sun, Yuling Shi, David Lo, Lingxiao Jiang

机构 * Singapore Management University(新加坡管理大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究审计了三个仓库级性能优化基准(GSO、SWE-Perf、SWE-fficiency),发现参考补丁的可复现性差、评分规则导致排名不一致,且多数任务已被公开提交解决,揭示了聚合排名掩盖的性能差距。

Comments 12 pages, 7 figures. Public data: https://github.com/chenzhi-cz/performance-optimization-benchmark-reliability

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13091 2026-07-16 cs.SE cs.AI 新提交 84%

Self-Improving AI Coding Agents Through Accumulated Behavioral Rules: A Closed-Loop Framework

通过累积行为规则实现自我改进的人工智能编码代理:一个闭环框架

Aditya Aggarwal, Nahid Farhady Ghalaty

机构 * Microsoft(微软)

专题命中 软件智能体 :coding agent(title,abstract);code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究基于大语言模型的编码代理重复犯错问题,提出闭环框架,将审查评论编码为行为规则,经实验验证其能转移审查重点、降低错误复发率且跨接口转移,实现跨会话学习且不更新权重,积累人类工程智慧。

Comments Already presented and accepted in - 32nd ICE IEEE/ITMC Conference (ICE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09691 2026-07-14 cs.LG cs.AI 新提交 84%

What Context Does a Coding Agent Actually Need to Act?

编码智能体实际行动需要什么上下文?

Brian Sam-Bodden

机构 * Integrallis Software(Integrallis软件公司)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.AI、cs.LG

AI总结 研究编码智能体编辑代码时实际所需上下文,通过固定定位、改变代码表示并评分,发现代码本身自然语言摘要作用小,周围上下文无关紧要,压缩上下文效果好,还发现API推理的噪声底限,且发布相关工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22504 2026-07-08 cs.CR cs.AI cs.SE 新提交 84%

Lingering Authority: Revocable Resource-and-Effect Capabilities for Coding Agents

挥之不去的权限:面向编码智能体的可撤销资源与效果能力

Igor Santos-Grueiro

机构 * International University of La Rioja(拉里奥ja国际大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 针对编码智能体中临时权限残留问题,提出PORTICO监控器,通过可撤销能力生命周期管理,在保持任务成功率的同时消除越权副作用。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29957 2026-06-30 cs.SE cs.AI 84%

SWE-Together: Evaluating Coding Agents in Interactive User Sessions

SWE-Together:在交互式用户会话中评估编码代理

Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

机构 * Meta

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 提出SWE-Together基准,从真实用户-代理编码会话中重建多轮交互任务,并利用基于LLM的用户模拟器评估编码代理的协作能力,发现强代理成功率更高且干预更少。

详情

展开后加载摘要…

URL PDF HTML 收藏