arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-30 至 2026-06-30 共收录 10 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 10 篇

2606.29957 2026-06-30 cs.SE cs.AI 84%

SWE-Together: Evaluating Coding Agents in Interactive User Sessions

SWE-Together:在交互式用户会话中评估编码代理

Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

机构 * Meta

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 提出SWE-Together基准,从真实用户-代理编码会话中重建多轮交互任务,并利用基于LLM的用户模拟器评估编码代理的协作能力,发现强代理成功率更高且干预更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28436 2026-06-30 cs.SE cs.AI 84%

Dockerless: Environment-Free Program Verifier for Coding Agents

Dockerless: 面向编码智能体的无环境程序验证器

Wenhao Zeng, Yuling Shi, Xiaodong Gu, Chao Hu, Chaofan Wang, Yuhao Cui, Hongting Zhou, Mengnan Qi, Jianqiao Wangni, Zhaojian Yu, Shuzheng Gao, Kai Cai, Shilin He

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 提出Dockerless,一种无需执行代码即可验证补丁正确性的智能体验证器,通过智能体仓库探索收集证据判断补丁正确性,在验证基准上超越最强开源验证器14.3 AUC点,并实现完全无环境的训练后流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05755 2026-06-30 cs.CR cs.AI 79%

Red-Teaming Coding Agents from a Tool-Invocation Perspective: An Empirical Security Assessment

从工具调用角度审视代码代理的红队测试:一项经验性安全评估

Yuchong Xie, Mingyu Luo, Zesen Liu, Zhixiang Zhang, Kaikai Zhang, Yu Liu, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本文从工具调用角度对六个流行的代码代理进行红队测试,发现ToolLeak漏洞并实现远程代码执行,揭示了代码代理的安全风险及防御建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28434 2026-06-30 cs.SE cs.AI 76%

SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents

SWE-MeM:面向长周期编码代理的自适应内存管理学习

Shuzheng Gao, Wenhao Zeng, Zhaojian Yu, Jianqiao Wangni, Chaozheng Wang, Kai Cai, Shilin He, Michael R. Lyu

机构 * The Chinese University of Hong Kong, China(香港中文大学) Shanghai Jiao Tong University, China(上海交通大学) Tsinghua University, China(清华大学) ByteDance, China(字节跳动)

专题命中 软件智能体 :coding agent(title);分类 cs.SE、cs.AI

AI总结 提出SWE-MeM训练框架,通过灵活的内存工具和Memory-aware GRPO优化,让代理在有限上下文预算下自主决定压缩时机、内容和方式,在SWE-Bench Verified上以4B和30B模型分别达到43.4%和60.2%的解决率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28430 2026-06-30 cs.SE cs.AI 76%

Building to the Test: Coding Agents Deliver What You Check, Not What You Requested

为测试而构建:编码代理交付的是你检查的内容,而非你请求的内容

Yanuo Ma, Ben Kereopa-Yorke, Ben Schultz

机构 * Microsoft(微软)

专题命中 软件智能体 :coding agent(title);分类 cs.SE、cs.AI

AI总结 研究发现,在代码生成任务中,编码代理在测试存在时得分接近完美,但实际交付的库却残缺不全,揭示了“为测试而构建”的倾向,并提出了“验证自我意识”这一概念。

Comments 27 pages (9 main + 14 appendix), 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13932 2026-06-30 cs.SE cs.AI 62%

Code Reasoning for Software Engineering Tasks: A Survey and A Call to Action

代码推理用于软件工程任务:调查与呼吁行动

Saurabh Pujar, Ira Ceka, Irene Manotas, Gail Kaiser, Baishakhi Ray, Shyam Ramji

机构 * IBM Columbia University(哥伦比亚大学)

专题命中 软件智能体 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文调查代码推理技术,探讨其在软件工程任务中的影响,提出未来研究方向。

Comments Published in Transactions on Machine Learning Research (06/2026) 40 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06090 2026-06-30 cs.SE cs.AI cs.PF 62%

SWE-fficiency: Can Language Models Optimize Real-World Repositories on Real Workloads?

SWE-fficiency:语言模型能否在真实工作负载上优化现实世界仓库?

Jeffrey Jian Ma, Milad Hashemi, Amir Yazdanbakhsh, Kevin Swersky, Ofir Press, Enhui Li, Vijay Janapa Reddi, Parthasarathy Ranganathan

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学) Google(谷歌)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出SWE-fficiency基准,评估语言模型在真实工作负载上优化软件仓库性能的能力,发现现有模型在定位优化机会和保持正确性方面表现不佳。

Comments Appearing at ICML 2026. Data, code, and leaderboard are available at https://swefficiency.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30573 2026-06-30 cs.LG 57%

SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions

SWE-INTERACT: 将 SWE 基准重新构想为用户驱动的长周期编码会话

Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He

机构 * Scale AI

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 提出 SWE-Interact 测试平台,通过用户模拟器模拟多轮交互式软件开发任务,评估编码代理在模糊需求、渐进反馈和迭代修订下的意图发现与自适应能力。

Comments -

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29871 2026-06-30 cs.AI 57%

AI Training Manager: Bounded Closed-Loop Control of Adaptive Training Recipes

AI训练管理器:自适应训练配方的有界闭环控制

Anjali Rao, Nikhil Kamalkumar Advani

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出一种基于LLM的有界监督控制器,通过结构化遥测和约束动作空间,动态调整学习率、正则化等超参数,解决训练中的过拟合、损失不平衡等问题,在语言建模和强化学习任务中提升性能。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27996 2026-06-30 cs.AI cs.GR cs.HC 57%

Exploring LLM Agent Designs and Interaction Modalities for Scientific Visualization

探索LLM代理在科学可视化中的交互范式

Jackson Vonderhorst, Kuangshi Ai, Haichao Miao, Shusen Liu, Chaoli Wang

机构 * Univ. Notre Dame(诺特难大学) LLNL(劳伦斯利弗莫尔国家实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文研究不同类型的LLM代理在科学可视化任务中的表现,通过评估八种代表性代理在15个基准任务中的可视化质量、效率、鲁棒性和计算成本,发现通用编程代理任务成功率最高但计算成本高,领域专用代理更高效稳定但灵活性差,计算机使用代理在单步任务表现良好但多步流程受限。

详情

展开后加载摘要…

URL PDF HTML 收藏