arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-12 至 2026-05-12 共收录 12 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 12 篇

2605.08468 2026-05-12 cs.CL cs.AI cs.LG 85%

PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents

PYTHALAB-MERA:基于验证的内存、检索与接受控制用于冻结LLM编码代理

Mehmet Iscan

机构 * PythaLab, Yildiz Technical University(PythaLab,伊兹密尔技术大学)

专题命中 软件智能体 :coding agent(title,abstract);code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PYTHALAB-MERA通过轻量级外部控制器实现验证基础的内存管理、适应性检索与延迟信用分配,提升冻结本地模型在编码任务中的验证成功率。

Comments 28 pages, 4 figures, 7 tables; local CLI artifact evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08366 2026-05-12 cs.LG cs.SE 81%

SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution

SWE Atlas:超越问题解决的编码代理基准测试

Mohit Raghavendra, Soham Dan, Miguel Romero Calvo, Yannis Yiming He, Johannes Baptist Mols, Gautam Anand, Cole McCollum, Edgar Arakelyan, Vijay Bharadwaj, Andrew Park, Jeff Da, MohammadHossein Rezaei, Bing Liu, Brad Kenstler, Yunzhong He

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.LG

AI总结 SWE Atlas通过涵盖代码库问答、测试编写和重构三个软件工程流程,提供了一种新的基准测试套件,评估编码代理的正确性和工程质量。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08927 2026-05-12 cs.PL 79%

Quantitative Comparison of Credible Compilation and Verification In Coding Agent Compiler Development

代码代理编译器开发中可信编译与验证的定量比较

Martin Rinard

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.PL

AI总结 本文通过首个由人类监督的验证编译器,比较了可信编译与验证两种编译验证方法的效率,发现验证需要更多开发工作量,且验证优化选择更不高效的算法,证书检查时间占主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09863 2026-05-12 cs.CR cs.AI cs.CL cs.IR cs.LG 67%

Nautilus Compass: Black-box Persona Drift Detection for Production LLM Agents

Nautilus Compass:生产LLM代理的黑盒人格漂移检测

Chunxiao Wang

机构 * Yiluo Technology Co., Ltd.(亿洛科技有限公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Nautilus Compass通过提示文本层的余弦相似度检测生产编码代理的人格漂移,无需调用LLM提取事实,实现高效且低成本的代理记忆层。

Comments 19 pages, 6 figures. MIT-licensed code + reproduction scripts at github.com/chunxiaoxx/nautilus-compass

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09283 2026-05-12 cs.AI cs.CL 62%

A Prompt-Aware Structuring Framework for Reliable Reuse of AI-Generated Content in the Agentic Web

面向可靠重用的AI生成内容结构化框架

Shusaku Egami, Masahiro Hamasaki

机构 * National Institute of Advanced Industrial Sciencen

专题命中 软件智能体 :software agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种结构化框架,通过在生成时自动附加元数据,提升AI生成内容的可追溯性和可靠性,以支持其安全重用。

Comments 5 pages, 2 figures, Accepted at FAAW@WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10480 2026-05-12 cs.AI 57%

ASIA: an Autonomous System Identification Agent

ASIA:一个自主系统识别代理

Dario Piga, Marco Forgione

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), SUPSI(达勒莫利人工智能研究所(IDSIA),SUPSI)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 ASIA通过自主编码代理自动完成系统识别中的模型选择与参数调优,基于两个基准测试分析其搜索行为和发现的架构策略,探讨了该方法的潜力与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09879 2026-05-12 cs.AI 57%

M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models

M2A:在大型语言模型中协同数学与代理推理

Junjian Wang, Xin Zhou, Qiran Xu, Kun Zhan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Li Auto Inc.(Li Auto公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出M2A框架,通过模型融合协同数学与代理推理,提升多任务学习下的推理稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09684 2026-05-12 cs.CR cs.AI 57%

MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring

MonitoringBench: 面向代理监控的半自动化红队测试

Monika Jotautaitė, Maria Angelica Martinez, Ollie Matthews, Tyler Tracy

机构 * Independent(独立)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出半自动化红队方法,针对代理监控中的攻击检测问题,通过改进攻击生成和测试流程,构建了包含2644条攻击轨迹的MonitoringBench基准,评估监控能力与失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09534 2026-05-12 cs.CR cs.AI 57%

Governing AI-Assisted Security Operations: A Design Science Framework for Operational Decision Support

治理人工智能辅助的安全运营:一种用于操作决策支持的设计科学框架

Elyson A. De La Cruz, Rishikesh Sahay, Md Rasel Al Mamun

机构 * Department of Artificial Intelligence, University of the Cumberlands(人工智能系,坎伯兰大学) Department of Management Information Systems, University of Illinois Springfield(管理信息系统系,伊利诺伊大学斯普林菲尔德分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出了一种设计科学框架,用于在高风险数字基础设施中管理人工智能辅助的操作决策支持,通过定义设计提案、角色问责制、成熟阶段、质量门禁、评估标准和证据边界。

Comments 28 pages, 1 listing, 1 figure, 20 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09055 2026-05-12 cs.RO cs.AI cs.MA 57%

Octopus Protocol: One-Shot Hardware Discovery and Control for AI Agents via Infrastructure-as-Prompts

Octopus Protocol:通过基础设施即提示实现AI代理的一次性硬件发现与控制

Quilee Simeon, Justin M. Wei, Yile Fan

机构 * MIT(麻省理工学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 Octopus Protocol通过五阶段流程实现硬件发现与控制,利用语言模型API生成MCP协议服务器,使AI代理能自主完成硬件集成与闭环视觉-运动控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08382 2026-05-12 cs.CR cs.CL cs.CY 57%

SecureForge: Finding and Preventing Vulnerabilities in LLM-Generated Code via Prompt Optimization

SecureForge:通过提示优化发现并防止LLM生成代码中的漏洞

Houjun Liu, Lisa Einstein, John Yang, Joachim Baumann, Duncan Eddy, Christopher D. Manning, Mykel Kochenderfer, Diyi Yang

机构 * Stanford University(斯坦福大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 本文提出SecureForge框架,通过自动化流程发现并减少LLM生成代码中的安全漏洞,提升代码安全性的同时保持单元测试性能,实验显示漏洞减少达48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08258 2026-05-12 cs.MA 50%

Designing Intelligent Enterprise Agents: A Capability-Aligned Multi-Agent Architecture

设计智能企业代理:一种能力对齐的多代理架构

John deVadoss

专题命中 软件智能体 :software agent(abstract)

AI总结 本文提出CEAD架构,通过能力对齐设计优化企业代理系统,评估显示其在安全成功率上优于其他架构。

详情

展开后加载摘要…

URL PDF HTML 收藏