arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-17 至 2026-07-17 共收录 9 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 9 篇

2607.01211 2026-07-17 cs.SE cs.AI 版本更新 84%

Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?

性能优化基准测试是否可靠地衡量编码智能体?

Zhi Chen, Zhensu Sun, Yuling Shi, David Lo, Lingxiao Jiang

机构 * Singapore Management University(新加坡管理大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究审计了三个仓库级性能优化基准(GSO、SWE-Perf、SWE-fficiency),发现参考补丁的可复现性差、评分规则导致排名不一致,且多数任务已被公开提交解决,揭示了聚合排名掩盖的性能差距。

Comments 12 pages, 7 figures. Public data: https://github.com/chenzhi-cz/performance-optimization-benchmark-reliability

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15205 2026-07-17 cs.SE cs.AI 新提交 81%

MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization

MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的可控基准

Shaoxiong Zhan, Shi Hu, Boyu Feng, Hai Lin, Andrew Gong, Zhengda Zhou, Jiaying Zhou, Yunyun Hou, Hao Su, Hai-Tao Zheng

机构 * Tsinghua University(清华大学)

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 研究针对仓库级问题定位多为文本任务,视觉证据作用不明的情况,引入MM-IssueLoc基准和评估协议,含多语言实例与标注等。评估LLM和检索系统,发现现有系统距可靠多模态定位有差距,该基准让视觉证据成评估变量,助于后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14340 2026-07-17 cs.SE cs.AI cs.CR 新提交 81%

The Prover Is the Judge: Verified Security Software from AI Coding Agents in Ada/SPARK

验证者即评判者:来自Ada/SPARK中AI编码代理的经过验证的安全软件

Tobias Philipp

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究人工智能编码代理生成安全软件代码的情况,核心方法是在验证器驱动循环下编写验证,主要贡献是通过GNATprove完成大量证明义务,降低监督成本,同时指出其不足及得出代理受反馈强度限制的教训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15143 2026-07-17 cs.CR cs.HC cs.SE 新提交 79%

Setup Complete, Now You Are Compromised: Weaponizing Setup Instructions Against AI Coding Agents

设置完成,现在你已被攻破:利用设置指令攻击人工智能编码代理

Aadesh Bagmar, Pushkar Saraf

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究人工智能编码代理在安装包时因不验证依赖项而面临的供应链攻击,通过编辑项目设置文档即可发动攻击。对前沿模型在多场景下测试,发现安装安全性取决于工具与模型组合,还存在多种检测问题,提出预安装检查可弥补大部分安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14390 2026-07-17 cs.SE cs.AI cs.IR 新提交 73%

Why Git Is the Memory Solution for the Agentic Development Lifecycle

为什么Git是智能开发生命周期的记忆解决方案

Frank Guo

机构 * MIT(麻省理工学院)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究智能开发生命周期中代码变更推理过程的记忆问题,提出将记忆与Git绑定的方法,通过解决种子供应和答案组装问题,实现低令牌数回答且结果可复制。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14890 2026-07-17 cs.AI cs.SE 新提交 62%

Proof-or-Stop: Don't Trust the Agent, Trust the Evidence -- Loop Engineering for Verifiable Evidence-Gated Lifecycle Control

证明或停止:不要信任代理,信任证据——用于可验证证据门控生命周期控制的循环工程

Jek Huang, Jeffery Hsia, Jiayi Sun, Freddie Shi, Wei Huang, Ian H. White

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究自主编码代理多步骤软件工作中生命周期状态缺乏证据支持的问题,提出证明或停止生命周期控制方法,经实验评估,该方法能有效控制生命周期转换,支持其作为与模型无关、主机中立的控制层。

Comments 48 pages, 10 figures, 29 numbered tables. Preprint v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14570 2026-07-17 cs.AI cs.CR 新提交 57%

Democratizing Agent Deployment Safety: A Structural Monitoring Approach

使智能体部署安全民主化:一种结构监测方法

Preeti Ravindra, Rahul Tiwari, Vincent Wolowski

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 研究人工智能智能体部署安全问题,引入信息流图(IFG)监测器,通过控制流、数据流图及原始代码差异分析结构安全回归。实验表明,IFG监测器能降低攻击错过率,还可同步作为部署前保障,为组织实现部署安全民主化提供实用途径。

Comments Accepted in ICML 2026 Workshops: AI4GOOD and AIWILD

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01185 2026-07-17 cs.AI 版本更新 57%

"Skill Issues'': Data-Centric Optimization of Lakehouse Agents

技能问题:湖仓代理的数据中心优化

Nicole Rose Schneider, Davide Ghilardi, Giacomo Piccinini, Jacopo Tagliabue

机构 * University of Maryland(马里兰大学) Università Milano Bicocca(米兰Bicocca大学) Bauplan Labs(Bauplan实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 针对分支湖仓Bauplan上的编码代理,提出数据中心的优化流程,通过生成任务验证器对、在隔离沙箱中执行候选技能并利用追踪信号和程序化检查评分,将准确率提升31.9%。

Comments Pre-print of paper accepted at ADS @ VLDB 2026, Boston

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14919 2026-07-17 cs.RO 新提交 50%

Human-Robot Interaction in GenAI Architectures via the Agent-Client Protocol

通过代理-客户端协议实现生成式人工智能架构中的人机交互

Jesus Moncada-Ramirez, Jose-Raul Ruiz-Sarmiento, Javier Gonzalez-Jimenez

机构 * Machine Perception and Intelligent Robotics Group (MAPIR-UMA), Malaga Institute for Mechatronics Engineering and Cyber-Physical Systems (IMECH.UMA), University of Malaga(机器感知与智能机器人组(MAPIR-UMA),马拉加机电一体化工程与网络物理系统研究所(IMECH.UMA),马拉加大学)

专题命中 软件智能体 :coding agent(abstract)

AI总结 研究针对GenAI推动下机器人架构中HRI层碎片化问题,提出采用代理-客户端协议(ACP),结合MCP构建三层解耦架构,消除架构依赖,支持异构界面,提供协作HRI能力,经实验验证了架构的互操作性和实时人在回路工作流程。

Comments 8 pages, 5 figures, 1 table. Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏