arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-11 至 2026-08-11 共收录 14 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 14 篇

2608.09072 2026-08-11 cs.SE cs.AI 新提交 90%

A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents

面向编码智能体的需求澄清、规划与代码生成的统一问题解决基准

Xin Zhou, Chun Yong Chong, Kisub Kim, Yun Peng, Rui Shu, Zihan Wu, Xu Han, Guowen Yuan, Zeyang Zhuang, Jounghoon Kim, Jeongjin Ju, Seongmin Ju, Taein Yoon, David Lo

专题命中 软件智能体 :code generation(title,abstract);coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究推出SWE-RPG编码智能体基准,评估发现主流编码智能体在该基准上平均解决率仅31.5%,隐性需求恢复是主要瓶颈,为改进编码智能体提供了方向。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09268 2026-08-11 cs.HC cs.AI 新提交 88%

Can Coding Agents Solve Repository-Level Issues with Rendered Code? An Exploratory Study of Visual Representations

编码智能体能通过渲染代码解决仓库级问题吗?一项关于视觉表示的探索性研究

Weijie Liang, Yuanfeng Song, Xing Chen, Caleb Chen Cao, Sirui Han, Yike Guo

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.AI

AI总结 本研究探索将渲染代码作为编码智能体的操作上下文,基于 SWE-bench Verified 实验发现其可降低提示 token 成本但受模型架构限制,仅在原始代码读取为瓶颈时有用,是可行但有条件的压缩机制。

Comments 8 pages of main content

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09799 2026-08-11 cs.SE 新提交 83%

SpecPath: Testing Coding Agents Across Contract-Equivalent Specification Histories

SpecPath:在合同等价的规范历史中测试编码智能体

Yangfan Wu, Haozhe Wang, Huanyu Yang, Jianmin Ji, Fangzhen Lin

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 针对编码智能体的规范路径敏感性问题,提出SpecPath诊断评估方法,通过控制变量测试发现多数智能体在等价规范历史中存在行为不一致的问题,凸显需评估智能体对规范路径的鲁棒性。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08793 2026-08-11 cs.CL 新提交 83%

Evidence-Calibrated Runtime Reconstruction for Agent Skills Across Heterogeneous Coding Agents

面向异构编码智能体的技能的证据校准运行时重构

Xueping Gao

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.CL

AI总结 本文提出Skill Runtime Intelligence系统,针对异构编码智能体重构技能生命周期阶段,在多场景实验中验证其能准确定位失败边界,为适配器资格认定提供支撑。

Comments 17 pages, 1 figure, 6 tables. Submitted to PROFES 2026. Code and artifacts: https://github.com/hellogxp/skill-runtime-intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07645 2026-08-11 cs.AI cs.LG 新提交 81%

Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution

孟德尔哥德尔机:基于比较进化的递归自改进编码智能体

Changzhi Liu, Yilun Liu, Sikuan Yan, Volker Tresp, Yunpu Ma

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对现有自改进编码智能体仅利用单轨迹的缺陷,提出孟德尔哥德尔机,新增反应规范突变与跨谱系杂交两种自修改策略,经理论证明与实验验证,其在编码任务上的性能、效率及泛化性均优于基线方法。

Comments Project Page at https://reallcz.github.io/MGM; Code at https://github.com/RealLcz/MGM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08950 2026-08-11 cs.SE 新提交 79%

Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework

基于双向重构-验证框架的代码智能体独立补丁验证

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本研究针对代码智能体生成补丁后缺乏独立验证的问题,提出无需训练的RETRACE双向重构-验证框架,在SWE-bench Verified等基准上显著提升了代码补丁的正确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08654 2026-08-11 cs.AI 新提交 70%

The Scaffolding Matters More Than the Interface: A Controlled Comparison of MCP and CLI Tool Use Across Seven Agent Scaffoldings, Five Language Models, and One Software Task

脚手架比接口更重要:在七种智能体脚手架、五种语言模型和一项软件任务中对MCP与CLI工具使用的对照比较

Marc Alier Forment, María José Casañ Guerrero, Francisco José García-Peñalvo, Juanan Pereira

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 该研究通过对照实验发现,智能体脚手架对AI编码智能体的工具使用成本影响远大于接口,MCP并非必要,且智能体常忽略分配的接口,相关数据已开源。

Comments 29 pages, 4 figures, 8 tables. Companion methodology paper: arXiv:2606.11869. Dataset and measurement harness (open source, GPL-3.0): https://doi.org/10.5281/zenodo.21851992

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09802 2026-08-11 cs.CL cs.SE 新提交 62%

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

SWE-Bench ProMax:面向大规模多语言代码重构的智能体基准测试

Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL

AI总结 该研究推出SWE-Bench ProMax多语言代码重构基准,含170个跨7种语言的大规模重构任务,经严格筛选后前沿模型仅达41.2%解决率,为AI编码智能体提供挑战性测试。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17902 2026-08-11 cs.AI cs.MA cs.SE physics.chem-ph 版本更新 62%

El Agente Gráfico: A Semantic Execution Runtime for Scientific Agents

图形代理:用于科学代理的结构化执行图

Jiaru Bai, Abdulrahman Aldossary, Thomas Swanick, Marcel Müller, Yeonghun Kang, Changhyeok Choi, Naruki Yoshikawa, Zijian Zhang, Jin Won Lee, Tsz Wai Ko, Aiwei Yin, Mohammad Ghazi Vakili, Chris Crebolder, Varinia Bernales, Alán Aspuru-Guzik

机构 * School of Computer Science, McGill University(计算机科学学院,麦吉尔大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 El Agente Gráfico通过结构化执行图和类型安全机制,实现科学代理的高效自动化,适用于复杂计算任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07925 2026-08-11 cs.AI 新提交 57%

ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration

ZhuLong:基于执行的大语言模型智能体,用于结合离线API自探索的EDA脚本编写

Yang Liu, Shiwei Hou, Xiyuan Chen, Yu Wang, Sen Yuan, Qirui Gan, Shao You, Feifan Chen, Wencheng Li, Shuyang Hu, Yongzhou Liu, Emma Xia, Xiaojing Lu, Hao Wang, Fan Xu, Yanfeng Li

机构 * Changxin Memory Technologies, Inc.(长鑫存储技术有限公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出基于执行的LLM智能体ZhuLong,结合API检索、沙箱执行与离线API自探索机制,在EDA脚本任务基准测试中性能远超纯LLM基线,为EDA脚本编写提供了有效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07885 2026-08-11 cs.AI 新提交 57%

Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills

广泛推理,而非深度推理:将推理溢价分摊到提炼技能中

Agamdeep Singh, Srishti Gautam, Priyanshu Gupta, Nikita Mehrotra, Tanmay Bakshi, Sumit Gulwani

机构 * Microsoft(微软公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 该研究提出将推理模式的重复分摊为跨任务提炼的技能,在四个智能体基准上大幅降低代币量的同时恢复多数推理性能,部分场景下优于推理模式。

Comments COLM 2026 Efficient Reasoning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27380 2026-08-11 cs.CV cs.AI 版本更新 57%

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

VideoCoCo:基于智能体双引擎系统的、以代码为思维链(CoT)的物理一致性视频生成方法

Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou, Zhengrong Yue, Yaxin Luo, Xiaotong Li, Yuzhu Wang, Junyan Ye, Jinjing Zhao, Zehui Chen, Lin Chen, Renye Yan, Feng Zhao, Pheng-Ann Heng

机构 * CUHK(香港中文大学) USTC(中国科学技术大学) SCUT(华南理工大学) HKU(香港大学) NTU(南洋理工大学) PKU(北京大学) SJTU(上海交通大学) CMU(卡内基梅隆大学) THU(清华大学) HUST(华中科技大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 VideoCoCo作为智能体双引擎框架,以可执行Blender代码为过程级思维链,构建专属数据集提升视频编辑器适配性,在两个基准上显著优于基线,实现了高质量物理一致性视频生成。

Comments 15 pages, 3 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18171 2026-08-11 cs.LG 版本更新 57%

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

FlashRT:用于引导智能体部署实时多模态应用的智能体框架

Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) AMD(超威半导体公司) University at Buffalo(纽约州立大学水牛城分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 研究实时多模态应用部署难题,提出FlashRT智能体框架。通过新范式引导编码智能体多阶段转换,将参考实现转为高效部署,在不同GPU上显著提升性能,尤其在专家优化不成熟平台更具扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07555 2026-08-11 cs.RO 新提交 50%

You Don't Need To Stay in The Loop: An Agentic Robotics Loop for Robot-Policy Improvement

你无需停留在循环中:用于机器人策略改进的智能体机器人循环

Hang Yu

专题命中 软件智能体 :coding agent(abstract)

AI总结 该研究将编码智能体的软件循环架构迁移至机器人策略改进领域,提出AgenticRobotics控制平面,解决机器人工具易失效问题,实现错误提升控制等性能提升。

Comments Agentic Robotics Preview Version

详情

展开后加载摘要…

URL PDF HTML 收藏