arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-11 至 2026-05-11 共收录 9 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 9 篇

2603.24755 2026-05-11 cs.SE cs.AI cs.CL 82%

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

SlopCodeBench:评估编码代理在长周期迭代任务中性能退化的基准测试

Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert Ge, Dyah Adila, Nicholas Roberts, Frederic Sala, Aws Albarghouthi

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Washington State University(华盛顿州立大学) MIT(麻省理工学院)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出SlopCodeBench,通过36个问题和196个检查点评估编码代理在长周期迭代任务中的性能退化,发现代理代码在结构上逐渐退化并产生冗余代码,人类代码退化更慢。

Comments Code and Leaderboards are located at https://www.scbench.ai

详情
URL PDF HTML 收藏
2605.07769 2026-05-11 cs.SE 79%

Coding Agents Don't Know When to Act

编码代理不知何时行动

Thibaud Gloaguen, Niels Mündler, Mark Müller, Veselin Raychev, Martin Vechev

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究发现当前编码代理在处理过时bug报告时频繁错误修改代码,提出需显式引导无行动以避免技术债务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07127 2026-05-11 cs.LG cs.CL 62%

The Position Curse: LLMs Struggle to Locate the Last Few Items in a List

位置诅咒:LLM在列表中定位最后几个项目时表现不佳

Zhanqi Zhang, Hua-Dong Xiong, Robert C. Wilson, Mikio Aoi, Marcelo G. Mattar, Li Ji-An

机构 * UC San Diego(加州大学圣地亚哥分校) Georgia Tech(佐治亚理工学院) New York University(纽约大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.LG

AI总结 LLM在定位长列表中单个相关项目时表现优异,但在短列表中最后几个项目定位上存在缺陷,即位置诅咒。通过构建PosBench数据集进行微调后,虽然提升了定位能力,但仍未达到理想水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06717 2026-05-11 cs.SE cs.AI 62%

Agentic Coding Needs Proactivity, Not Just Autonomy

代理编码需要主动性,而非仅仅自主性

Nghi D. Q. Bui, Georgios Evangelopoulos

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文探讨了软件开发中代理编码的主动性与自主性区别,提出主动性分类和评估标准,旨在提升编码代理的洞察力和适应性。

Comments Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07420 2026-05-11 cs.LG cs.CV 57%

SR$^2$-LoRA: Self-Rectifying Inter-layer Relations in Low-Rank Adaptation for Class-Incremental Learning

SR$^2$-LoRA: 自适应层间关系的自我校正在低秩适应中的应用用于类别增量学习

Fengqiang Wan, Yipeng Lin, Kan Lv, Yang Yang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 软件智能体 :repository(abstract);分类 cs.LG

AI总结 本文提出SR$^2$-LoRA方法,通过约束层间关系漂移来缓解类别增量学习中的灾难性遗忘问题,理论分析显示其对估计扰动具有更强鲁棒性,实验表明其在任务数量增加时表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04320 2026-05-11 cs.SE 57%

Reproduction Test Generation for Java SWE Issues

Java SWE问题的再现测试生成

Toufique Ahmed, Jatin Ganhotra, Avraham Shinnar, Martin Hirzel

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文针对Java企业软件中的SWE问题,提出首个Java仓库级再现测试基准TDD-Bench-Java和高绩效的e-Otter++工具,填补了Python以外语言的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16928 2026-05-11 cs.GT cs.AI cs.MA 57%

Discovering Multiagent Learning Algorithms with Large Language Models

用大型语言模型发现多智能体学习算法

Zun Li, John Schultz, Daniel Hennes, Marc Lanctot

机构 * Google DeepMind(谷歌DeepMind)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文利用AlphaEvolve框架自动发现CFR和PSRO算法,提出VAD-CFR和SHOR-PSRO,通过简化核心机制获得更高效的WOP-CFR和PM-PSRO,提升泛化能力。

Comments More experiments and analysis on algorithmic distilliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25610 2026-05-11 quant-ph 50%

Optimizing ground state preparation protocols with autoresearch

利用自研算法优化基态准备协议

Luis Mantilla Calderón, Jérôme F. Gonthier, Ignacio Gustin, Varinia Bernales, Alán Aspuru-Guzik

专题命中 软件智能体 :coding agent(abstract)

AI总结 本文研究如何利用基于人工智能的语言模型编码代理优化不同基态准备和采样协议的超参数选择,通过在简单自旋模型和分子哈密顿量上验证,展示编码代理在受限计算预算下改进能量代理的能力。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07135 2026-05-11 cs.CR 50%

Demystifying and Detecting Agentic Workflow Injection Vulnerabilities in GitHub Actions

揭开GitHub Actions中代理工作流注入漏洞的面纱并检测其漏洞

Shenao Wang, Xinyi Hou, Zhao Liu, Yanjie Zhao, Xiao Cheng, Quanchen Zou, Xiangzheng Zhang, Haoyu Wang

专题命中 软件智能体 :repository(abstract)

AI总结 本文研究GitHub Actions中代理工作流注入漏洞,提出两种核心模式P2A和P2S,并设计TaintAWI工具,发现519个潜在漏洞,其中343个为零日漏洞,已优先披露并获得修复。

详情

展开后加载摘要…

URL PDF HTML 收藏