arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-21 至 2026-07-21 共收录 16 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 3 篇

2602.02138 2026-07-21 cs.SE cs.AI 版本更新 81%

CAM: A Causality-based Analysis Framework for Multi-Agent Code Generation Systems

CAM:基于因果分析的多智能体代码生成系统分析框架

Zongyi Lyu, Zhenlan Ji, Songqiang Chen, Liwen Wang, Yuheng Huang, Shuai Wang, Shing-Chi Cheung

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Tokyo(东京大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 CAM提出一种基于因果分析的框架,用于分析多智能体代码生成系统中中间特征对系统正确性的贡献,通过实证分析揭示了依赖上下文的特征和混合架构的优势。

Comments 20 pages, 12 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00594 2026-07-21 cs.AI 版本更新 70%

Agent psychometrics: Task-level performance prediction in agentic coding benchmarks

代理心理测量:在代理编码基准中的任务级性能预测

Chris Ge, Daria Kryvosheieva, Daniel Fried, Uzay Girit, Kaivalya Hariharan

机构 * Massachusetts Institute of Technology(麻省理工学院) Fulcrum Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.AI

AI总结 本文提出了一种基于任务级性能预测的代理编码基准评估框架,结合IRT理论与任务特征,区分LLM和支架能力,以更准确预测未见基准和组合的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11765 2026-07-21 cs.MA cs.AI cs.LG 版本更新 62%

OMAC: A Holistic Optimization Framework for LLM-Based Multi-Agent Collaboration

OMAC:一种面向基于大语言模型的多智能体协作的综合优化框架

Shijun Li, Hilaf Hasson, Joydeep Ghosh

机构 * Department of Electrical and Computer Engineering, The University of Texas at Austin, Austin, United States(得克萨斯大学奥斯汀分校电子与计算机工程系) Intuit AI Research, Mountain View, United States(Intuit AI研究)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OMAC框架,通过五个关键优化维度提升基于大语言模型的多智能体系统性能,采用语义初始化器和对比比较器算法实现单维和多维联合优化。

Comments Accepted as a Oral paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2607.12463 2026-07-21 cs.AI cs.CL 版本更新 81%

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

作为编码智能体基础模型中间训练的函数感知中间填充

Yubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of British Columbia(英属哥伦比亚大学) NVIDIA(英伟达公司) Verdent AI(Verdent人工智能公司) Vector Institute(向量研究所)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21372 2026-07-21 cs.AI 版本更新 79%

NEMO: Execution-Aware Optimization Modeling via Autonomous Coding Agents

NEMO: 通过自主编码代理实现执行感知的优化建模

Yang Song, Anoushka Vyas, Zirui Wei, Sina Khoshfetrat Pakazad, Henrik Ohlsson, Graham Neubig

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,计算机科学学院,卡内基梅隆大学,匹兹堡,PA,美国)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 提出NEMO系统,利用自主编码代理将决策问题的自然语言描述转化为可执行的数学优化实现,通过执行感知的架构和协调模式实现最先进的性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12428 2026-07-21 cs.CR 版本更新 78%

Trust but Verify? Uncovering the Security Debt of Autonomous Coding Agents

信任但要验证?揭示自主编码代理的安全债务

A H M Nazmus Sakib, Dipayan Banik, Murtuza Jadliwala

专题命中 软件智能体 :coding agent(title,abstract)

AI总结 本文利用AIDev数据集,通过大语言模型评判框架和人工分析,研究自主编码代理生成拉取请求中的安全代码异味。发现38.9%的请求含安全异味,供应链问题和硬编码凭证占比高,揭示了安全风险及开发者警惕性降低问题,强调需实施上下文感知安全护栏。

Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17799 2026-07-21 cs.SE cs.AI cs.CL 版本更新 67%

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering

立场:编程基准与智能体软件工程不一致

Maria I. Gorinova, Macey Baker, Amy Heineike, Maksim Shaposhnikov, Rob Willoughby, Dru Knox

机构 * Tessl

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文指出当前编程基准在智能体时代存在三大问题:混淆模型与系统框架、单一参考答案惩罚有效替代方案、缺乏组件级信号导致迭代困难,并提出应重新设计基准以对齐智能体软件工程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22455 2026-07-21 cs.LG 版本更新 57%

SkillRouter: Skill Routing for LLM Agents at Scale

SkillRouter:大规模LLM代理中的技能路由

YanZhao Zheng, ZhenTao Zhang, Chao Ma, YuanQiang Yu, JiHuai Zhu, Yong Wu, Tianze Xu, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 本文提出SkillRouter,通过全文本检索和重排序提升大规模LLM代理的技能路由性能,实验显示隐藏技能体导致路由准确率下降31-44个百分点,SkillRouter在基准测试中达到74.0%的Hit@1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 4 篇

2607.06411 2026-07-21 cs.SE cs.AI cs.CL 版本更新 83%

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

RuBench:一个具有原生编写的俄语任务规范的仓库级智能编码基准测试

Evgeny Shilov

机构 * Independent Researcher(独立研究者)

专题命中 代码评测 :repository(title);coding agent(abstract,comments);分类 cs.SE、cs.CL、cs.AI

AI总结 RuBench 1.0是含25个俄语任务的仓库级智能编码基准测试,任务源于开源仓库修复提交,按客户请求风格编写。评估多种产品配置,报告运行结果,发现最佳配置解决78.7%任务,还发现产品替换模型问题,为智能编码评估提供新基准。

Comments 20 pages, 1 figure, 9 tables. v2 adds Round 2: Russian-market coding agents (SourceCraft CLI, Koda CLI), Antigravity with Gemini 3.1 Pro / 3.5 Flash, and Codex CLI with GPT-5.6 on the same frozen task set, plus a tool-call contamination re-audit (network + disk layers). Data, full trajectories and harness: https://github.com/eugeneshilow/rubench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16011 2026-07-21 cs.SE cs.AI cs.CL 版本更新 75%

FormulaCode: Evaluating Agentic Optimization on Large Codebases

FormulaCode: 评估在大规模代码库上进行代理优化

Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Cornell University(康奈尔大学)

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。

Comments ICML Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26648 2026-07-21 cs.SE cs.AI 版本更新 73%

Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification

Vision2Web: 一个用于视觉网站开发的分层基准,包含代理验证

Zehai He, Wenyi Hong, Zhen Yang, Ziyang Pan, Mingdao Liu, Xiaotao Gu, Jie Tang

机构 * Tsinghua University(清华大学)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Vision2Web基准,用于评估视觉网站开发能力,包含193个任务和16类,通过GUI代理验证器和基于VLM的裁判器评估多个视觉语言模型,揭示了在全栈开发中现有模型的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26548 2026-07-21 cs.CR cs.LG 版本更新 57%

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

SEC-bench Pro:语言模型能解决长周期软件安全任务吗?

Hwiwon Lee, Jiawei Liu, Dongjun Kim, Wubing Xia, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码评测 :coding agent(abstract);分类 cs.LG

AI总结 提出SEC-bench Pro基准,通过三阶段流程构建包含V8和SpiderMonkey共183个已验证漏洞的测试集,评估前沿语言模型在长周期漏洞狩猎任务中的表现,发现最高成功率仅48.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 3 篇

2405.17838 2026-07-21 cs.LG cs.AI 版本更新 62%

Posts of Peril: Detecting Information About Hazards in Text

危险帖子:检测文本中的危害信息

Keith Burghardt, Daniel M. T. Fessler, Chyna Tang, Anne Pisor, Kristina Lerman

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 研究如何检测文本中的危害信息,开发新模型并基于标注X帖子训练,应用于地缘政治事件数据集,发现危害信息常见,无机账户有特定讨论模式,为信息战环境下危害探索迈出第一步。

Comments 21 pages, 14 figures

Journal ref In: ICWSM 2026, 20(1), 370-390 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02947 2026-07-21 econ.GN cs.CL q-fin.EC 版本更新 57%

FOI-O: A global ontology and verification framework for Freedom of Information process modelling

FOI-O:新西兰首个用于信息自由流程建模的本体与验证方法包

Dylan A Mordaunt

机构 * Faculty of Health, Education and Psychology, Victoria University of Wellington(维多利亚大学健康、教育与心理学学院) College of Medicine and Public Health, Flinders University(弗林德斯大学医学院和公共卫生学院) Centre for Health Policy, The University of Melbourne(墨尔本大学健康政策中心)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 针对公共信息请求记录混杂多类数据的问题,提出FOI-O可复用流程建模与验证框架,基于新西兰相关法案实现首个验证配置文件,提供多类标准化语义与流程工具资产。

Comments 22 pages, 4 figures, 9 tables, ancillary supplement; revised manuscript with expanded provenance, versioning, and navigation documentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25468 2026-07-21 cs.DL 版本更新 50%

Metadata conflicts and their impact on DataCite metadata completeness in disciplinary research data repositories

提升元数据流——在学科研究数据存储库中同时使用多种元数据模式

Dorothea Strecker

专题命中 仓库级理解 :repository(abstract)

AI总结 研究探讨了学科研究数据存储库中同时使用多种元数据模式的挑战,发现优化模式映射可显著改进DataCite元数据记录,但学科影响元数据完整性,需进一步完善。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他AI编程 1 篇

2601.17525 2026-07-21 cond-mat.mes-hall 版本更新 50%

An expandable kinetic Monte Carlo platform for modelling electron transport through chiral molecules

用于模拟电子通过手性分子传输的可扩展动力学蒙特卡罗平台

Silvia Giménez-Santamarina, Andrés Mora Martínez, Gérliz M. Gutiérrez-Finol, Alejandro Gaita-Ariño

专题命中 其他AI编程 :code model(abstract)

AI总结 研究旨在建模电子通过手性分子传输的不同理论,编写动力学蒙特卡罗代码,可模拟外部电压下电子输运,区分自旋电流,通过相关参数对分子进行参数化,获得自旋滤波值及低电压下消失的效应等。

详情

展开后加载摘要…

URL PDF HTML 收藏