arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-10 至 2026-07-10 共收录 4 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 4 篇

2607.07946 2026-07-10 cs.SE cs.LG 新提交 81%

DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks

DeepSWE:在原始的、长周期工程任务上评估前沿编码智能体

Wenqi Huang, Charley Lee, Leonard Tng, Serena Ge

机构 * Datacurve

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.LG

AI总结 研究针对编码智能体评估,指出多数基准测试存在的问题。提出DeepSWE基准测试,其任务从零编写,用手写验证器评分,能避免相关问题,在区分智能体等方面表现出色,还发布了基准测试等相关内容。

Comments 32 pages, 10 figures. Code and data: https://github.com/datacurve-ai/deep-swe ; https://deepswe.datacurve.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07980 2026-07-10 cs.SE cs.AI 新提交 73%

3100 Opinions on Code Review in an AI World: Building Causal Theory from Practitioner Discourse

人工智能时代关于代码审查的3100种观点:从从业者话语中构建因果理论

Shyam Agarwal, Courtney Miller, Christian Kästner, Bogdan Vasilescu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究人工智能对代码审查的影响,通过收集从业者话语构建因果模型,明确审查是控制点,团队决定编码代理对软件影响,转化相关命题,还提供LLM辅助灰色文献理论构建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02514 2026-07-10 cs.AI 新提交 57%

Distributed Attacks in Persistent-State AI Control

持久状态AI控制中的分布式攻击

Josh Hills, Ida Caspary, Asa Cooper Stickland

机构 * Constellation Astra Fellowship(Constellation Astra 奖学金) Imperial College London(帝国理工学院) UK AI Security Institute(英国人工智能安全研究所)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 研究AI编码代理在持久代码库中跨拉取请求分布攻击的威胁,提出Iterative VibeCoding基准,发现单一监控器无法同时防御渐进与非渐进攻击,而状态跟踪监控器可显著降低渐进攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17510 2026-07-10 cs.SE 版本更新 57%

Psychological Safety Framework in Pull-based Open Source Projects

基于心理安全的拉式开源项目框架

Emeralda Sesari, Federica Sarro, Ayushi Rastogi

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文提出基于心理安全理论的框架,通过分析拉取请求互动中的10种可观察行为,构建心理安全指数,并验证其对贡献者短期和长期持续参与的影响。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏