arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-16 至 2026-07-16 共收录 30 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2603.12712 2026-07-16 cs.SE cs.LG 版本更新 84%

Design-Specification Tiling for ICL-based CAD Code Generation

基于ICL的CAD代码生成的Design-Specification Tiling设计

Yali Du, San-Zhuo Xi, Hui Sun, Ming Li

机构 * National Key Laboratory for Novel Software Technology, School of Artificial Intelligence, Nanjing University(新型软件技术国家实验室,人工智能学院,南京大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.LG

AI总结 本文提出DST方法,通过量化知识充分性提升CAD代码生成质量,优于现有ICL示例选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05396 2026-07-16 cs.CL cs.SE 版本更新 84%

FairCoder: Probing LLM Bias in High-Stakes Decision Making via Coding Tasks

FairCoder:通过编码任务探究高风险决策中语言模型的偏差

Yongkang Du, Jen-tse Huang, Jieyu Zhao, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学)

专题命中 代码生成 :code generation(title,abstract);code model(abstract);分类 cs.SE、cs.CL

AI总结 研究通过FairCoder基准将决策制定设为编码任务,探究LLMs在多领域的偏差,针对现有指标不足提出FairScore指标,经实验揭示了此前未充分探索的偏差模式,凸显LLMs作决策代理的风险并提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18548 2026-07-16 cs.SE cs.AI 版本更新 81%

1D-Bench: A Benchmark for Iterative UI Code Generation with Visual Feedback in Real-World

1D-Bench: 一个用于具有实时反馈的现实世界迭代UI代码生成的基准

Qiao Xu, Yipeng Yu, Chengxiao Feng, Xu Liu

专题命中 代码生成 :code generation(title);repository(abstract);分类 cs.SE、cs.AI

AI总结 1D-Bench通过现实电商工作流提供迭代UI代码生成基准,测试模型在中间表示缺陷下的鲁棒性,实验表明迭代编辑能提升渲染成功率和视觉相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13820 2026-07-16 cs.SE 新提交 79%

PROBE: Benchmarking Code Generation in Large Language Models

PROBE:大语言模型中代码生成的基准测试

Rodrigo Pato Nogueira, Marco Vieira, João R. Campos

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 针对大语言模型代码生成评估不足,介绍PROBE基准框架,基于多维度评估代码,用于评估多种模型和语言,发现LLMs虽有成果,但处理难题及小模型在特定语言上有困难,且常因易避免错误失败。

Comments Accepted for publication in Empirical Software Engineering (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10057 2026-07-16 quant-ph cs.AI cs.CV cs.LG 交叉投稿 76%

Quantum Circuit Vision: Cost-Aware Evaluation of Visual AI Agents for Quantum Code Generation

量子电路视觉:用于量子代码生成的视觉人工智能代理的成本感知评估

Dongping Liu, Aoyu Zhang, Luyao Zhang

机构 * Amazon Web Services(亚马逊网络服务) Duke Kunshan University(杜克昆山大学)

专题命中 代码生成 :code generation(title);分类 cs.AI、cs.LG

AI总结 研究人工智能代理对量子电路图的理解及代码生成成本,提出量子电路视觉评估框架,构建基准并评估模型,发现中级模型在成本-准确性上平衡最佳,电路深度是失败主因,提出级联路由策略并开源数据集及代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02317 2026-07-16 cs.LG cs.AI cs.CY 62%

Defining and Evaluating Physical Safety for Large Language Models

定义和评估大语言模型的物理安全性

Yung-Chen Tang, Pin-Yu Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学) IBM Research(IBM研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无人机控制的全面基准,评估大语言模型在物理安全方面的风险与权衡,揭示了模型在安全性和实用性之间的不理想平衡。

Journal ref Communications of the ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14477 2026-07-16 cs.LG 版本更新 57%

Test-Time Learning with an Evolving Library

测试时学习与进化库

Weijia Xu, Alessandro Sordoni, Chandan Singh, Zelalem Gero, Michel Galley, Xingdi Yuan, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 EvoLib通过维护知识库实现大语言模型在不同实例间积累和进化知识,无需参数更新或外部监督,提升数学推理、代码生成等任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13407 2026-07-16 cs.DB 新提交 50%

From Interpretation to Compilation: Compilation-Based Execution of Semantic Operators [Vision]

从解释到编译:基于编译的语义算子执行 [视觉]

Wenkai Dong, Yifan Wang

专题命中 代码生成 :program synthesis(abstract)

AI总结 研究语义算子系统执行效率问题,提出基于编译的执行方法,在编译时调用LLM将算子规范转为可执行代码,本地运行减少调用次数,应用于多种算子并集成到系统,初步结果显示减少了执行时间和调用次数,还拓展了LLM在该领域的角色认知。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 6 篇

2607.13091 2026-07-16 cs.SE cs.AI 新提交 84%

Self-Improving AI Coding Agents Through Accumulated Behavioral Rules: A Closed-Loop Framework

通过累积行为规则实现自我改进的人工智能编码代理:一个闭环框架

Aditya Aggarwal, Nahid Farhady Ghalaty

机构 * Microsoft(微软)

专题命中 软件智能体 :coding agent(title,abstract);code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究基于大语言模型的编码代理重复犯错问题,提出闭环框架,将审查评论编码为行为规则,经实验验证其能转移审查重点、降低错误复发率且跨接口转移,实现跨会话学习且不更新权重,积累人类工程智慧。

Comments Already presented and accepted in - 32nd ICE IEEE/ITMC Conference (ICE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13080 2026-07-16 cs.SE cs.AI 新提交 81%

Inference Economics of Enterprise Coding Agents: A Case Study of Cloud vs. On-Premise LLMs

企业编码代理的推理经济学:云与本地大语言模型的案例研究

Sheng-Wei Peng, Yi-Hsun Lin, Yi-Pei Lee

机构 * PEGAVERSE Pegatron Corporation(PEGAVERSE 联合科技公司)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究企业编码代理中云与本地大语言模型的权衡,通过案例研究对比两者,发现提示缓存可大幅降低API成本,本地配置缺陷修复负担高,不同场景下各有成本优劣,混合路由网关在成本与质量间有平衡表现。

Comments 20 pages, 13 figures, 14 tables. Industrial longitudinal case study

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03525 2026-07-16 cs.SE cs.CL 版本更新 81%

GameEngineBench: Evaluating Coding Agents on Real C++ Runtime Environments

GameEngineBench:在真实C++运行时环境中评估编码智能体

Brian La, Sejoon Chang, Ben Kim, Junyoung Bae, Aamish Ahmad Beg, Sei Chang, Gonzalo Gonzalez-Pumariega, Kanav Goyal

机构 * Nitrode Nexon Intelligence Labs Dartmouth University(达特茅斯大学) Columbia University(哥伦比亚大学) Cornell University(康奈尔大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL

AI总结 研究利用GameEngineBench在虚幻引擎5项目中评估编码智能体,核心方法是构建来自九个真实游戏仓库的基准测试集,主要贡献是揭示智能体在实时交互软件的C++开发中面临挑战,凸显游戏引擎基准测试的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13085 2026-07-16 cs.CR cs.AI 新提交 79%

Baselines Before Architecture: Evaluating Coding Agents for Autonomous Penetration Testing

架构之前的基线:评估用于自主渗透测试的编码代理

Ananda Dhakal, Krish Neupane, Aarjan Chaudhary

机构 * Kroda Labs(Kroda实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究针对自主渗透测试,以默认编码CLI代理为基线,在XBOW基准上用不同模型运行,比较不同框架结果及模型扩展效果,发现专业框架有提升,普通代理也能解决不少问题,新模型可提升同一框架,强调未来评估应报告模型匹配的普通代理基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14075 2026-07-16 cs.SE 新提交 57%

VisualRepair: Dynamic Tool Calling and Region Focusing for Visual Software Issue Repair

VisualRepair:用于视觉软件问题修复的动态工具调用和区域聚焦

Jingyu Xiao, Zhongyi Zhang, Haoran Hou, Yuxuan Wan, Yuan Jiang, Yintong Huo, Michael R. Lyu

专题命中 软件智能体 :program repair(abstract);分类 cs.SE

AI总结 针对现代软件视觉信息利用难题,提出VisualRepair框架,通过图像类型感知工具调用和动态测试时区域聚焦两模块,在SWE-bench基准测试中性能超现有方法,有效提升自动视觉软件问题修复能力。

Comments The paper was completed in March 2026 and is currently under review. The code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14082 2026-07-16 quant-ph 新提交 50%

Building Shor's Algorithm in Lean: An Agentic Formalization of Quantum Attacks on RSA-2048 and P-256

在Lean中构建肖尔算法:对RSA - 2048和P - 256的量子攻击的智能形式化

Lei Zhang, Yusheng Zhao, Hongshun Yao, Xin Wang

专题命中 软件智能体 :software agent(abstract)

AI总结 研究在Lean中对肖尔算法及其变体进行形式化,采用智能形式化方法让软件代理分析、编写代码及修复证明,建立数学基础用于分析RSA - 2048和P - 256加密设置下的量子攻击,为量子密码分析及算法设计验证助力。

Comments 21 pages, including appendix; 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2607.13111 2026-07-16 cs.SE cs.AI 新提交 62%

SemaDiff: Identifying Semantic-Changing Commits with Generated Code and Tests

SemaDiff:使用生成的代码和测试识别语义变化的提交

Maha Ayub, Michael Konstantinou, Ahmed Khanfir, Nikolaos Tsantalis, Mike Papadakis

机构 * SnT, University of Luxembourg(卢森堡大学SnT分校) RIADI, ENSI, University of Manouba(突尼斯曼努巴大学RIADI与ENSI分校) Concordia University(康科德大学)

专题命中 程序修复 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究软件仓库挖掘中区分语义保留与变化提交的问题,提出SemaDiff方法,通过行为分析、生成额外调用方法及依赖类等,实现对提交的语义判断,实验表明该方法能较准确地区分,语义变化提交检测精度高。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 5 篇

2508.04489 2026-07-16 cs.LG cs.AI 62%

Hierarchical Scoring for Machine Learning Classifier Error Impact Evaluation

层次评分用于机器学习分类器误差影响评估

Erin Lanus, Daniel Wolodkin, Laura J. Freeman

机构 * National Security Institute, Virginia Tech(维吉尼亚理工大学国家安全研究所) Applied Research Corporation, Virginia Tech(维吉尼亚理工大学应用研究公司)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出层次评分度量,通过评分树评估分类器误差影响,实现更细粒度的模型性能评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13104 2026-07-16 cs.AI cs.CL cs.LG 新提交 56%

Self-Improvements in Modern Agentic Systems: A Survey

现代智能系统中的自我改进:一项综述

Zhe Ren, Yimeng Chen, Dandan Guo, Guowei Rong, Tonghui Li, R. B. Xiong, Qingfeng Lan, Wenyi Wang, Li Nanbo, Yibo Yang, Mingchen Zhuge, Jürgen Schmidhuber

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) University of Alberta(阿尔伯塔大学) The Swiss AI Lab IDSIA/USI/SUPSI(瑞士人工智能实验室IDSIA/USI/SUPSI)

专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)

AI总结 综述现代自我改进智能体从研究走向部署,目标是经验驱动的可控进化。提出系统级框架,将智能体视为基础模型与操作支架的耦合配置,自我改进形式化为更新算子,还组织回顾了相关工作、应用、评估等内容并展望未来。

Comments 97 pages, 12 figures. Project page: https://selfimproving-agent.github.io/ Repository: https://github.com/selfimproving-agent/awesome-Self-Improving-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14027 2026-07-16 cs.NE 新提交 50%

SPECS: Speciated Evolutionary Circuit Synthesis

SPECS:特定进化电路合成

Yağız Gençer, Stefan Uhlich, Andrea Bonetti, Arun Venkitaraman, Chia-Yu Hsieh, Lorenzo Servadei

专题命中 代码评测 :repository(abstract)

AI总结 提出用于自动模拟电路合成的SPECS遗传算法,借鉴NEAT原理,重新制定基因组表示并调整遗传算子,纳入布线约束和物种形成,在计算电路合成任务中,其解决方案质量和可靠性优于基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13987 2026-07-16 cs.CR 新提交 50%

Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation

智能体技能安全:威胁模型、攻击、防御与评估

Sanket Badhe, Priyanka Tiwari

专题命中 代码评测 :repository(abstract)

AI总结 研究智能体可复用技能安全,提出SkillSec-Eval框架,刻画技能生命周期并开发威胁分类法,通过对327个真实技能实证评估,发现多阶段有漏洞,强调需进行生命周期感知安全分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27745 2026-07-16 cs.CV 版本更新 50%

Panoramic Scene Understanding: A Survey from Distortion-Aware Engineering to Sphere-Native Modeling

全景场景分析:从畸变感知工程到球面原生基础建模的综述

Qinfeng Zhu, Lei Fan

机构 * University of Liverpool(利物浦大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文综述全景场景分析从投影适应、畸变感知工程到球面原生建模的演进,指出当前方法无法同时实现严格球面等变性和重用预训练基础模型权重,并揭示评估协议中的五个系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 9 篇

2607.13439 2026-07-16 cs.CR cs.SE 新提交 79%

DREA: Decoupled Reasoning and Exploration Agents for Repository-Level Vulnerability Detection

DREA:用于仓库级漏洞检测的解耦推理与探索代理

Mingyang Sun, Guozhu Meng

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 研究针对大语言模型用于仓库级漏洞检测时的不足,提出DREA框架,通过规划与探索代理解耦,实现目标导向上下文获取。构建RepoPairBench评估,提升配对正确性,降低成本,还发现安全推理质量是当前大语言模型的瓶颈。

Comments Accepted for presentation at Internetware 2026. 12 pages, 4 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13285 2026-07-16 cs.AI cs.SE 新提交 73%

Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable

Harness手册:使不断演进的智能体框架具有可读性、可导航性和可编辑性

Ruhan Wang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Yue Yu, Junyao Yang, Kishan Panaganti, Haitao Mi, Dongruo Zhou, Leoweiliang

机构 * Tencent(腾讯) Indiana University(印第安纳大学) University of Maryland, College Park(马里兰大学帕克分校) University of Georgia(佐治亚大学) National University of Singapore(新加坡国立大学)

专题命中 仓库级理解 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究智能体框架演进中行为定位难的问题,提出通过Harness手册和行为引导的渐进式披露,以行为为中心自动合成框架表示并辅助规划,提高行为定位和编辑计划质量,助力复杂智能体系统发展。

Comments 29 pages, 6 figures. Project page: https://ruhan-wang.github.io/Harness-Handbook/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13069 2026-07-16 cs.AI cs.CL cs.LO 新提交 62%

Interventional Grounding Audits: Black-Box Premise-Dependency Tests for LLM Chain-of-Thought via Predicate Substitution

介入式基础审计:通过谓词替换对大语言模型思维链进行黑盒前提依赖性测试

Hironao Nakamura

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型思维链前提依赖性问题,提出介入式基础审计方法,通过谓词替换干预前提并重新运行模型,在ProntoQA基准测试中检测前提依赖性表现优异,还发现了“正确答案,错误推理”信号。

Comments Accepted at the ICLR 2026 Workshop on Logical Reasoning of Large Language Models (https://iclr.cc/virtual/2026/10017466)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10767 2026-07-16 cs.SE 版本更新 57%

VulWeaver: Weaving Broken Semantics for Grounded Vulnerability Detection

VulWeaver: 修补断裂语义以实现基于事实的漏洞检测

Yiheng Cao, Yihao Chen, Xin Hu, Bihuan Chen, Jiayi Deng, Zhuotong Zhou, Susheng Wu, Yiheng Huang, Xueying Du, Xingman Chen, Miaohua Li, Xin Peng

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 VulWeaver通过整合确定性规则与LLM语义推理构建增强依赖图,提取完整漏洞上下文,利用元提示和专家指南提升LLM推理能力,实验显示其在PrimeVul4J数据集上F1得分达0.75,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23043 2026-07-16 cs.LG 版本更新 57%

Mechanistic Evidence for Preserved-but-Misaligned Representations in Non-IID FedAvg

非独立同分布联邦平均中保留但未对齐表示的机制证据

Muhammad Haseeb, Salaar Masood, Muhammad Abdullah Sohail, Mohammad Fatim Shoaib, Muhammad Tahir

机构 * Lahore University of Management Sciences(拉瓦尔大学管理科学学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 研究非独立同分布FedAvg性能下降原因,通过在稀疏客户端训练视觉模型中结合多种分析方法,发现其性能下降不能仅用表示擦除解释,还因保留内部结构与最终预测路径未对齐。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13478 2026-07-16 cs.CL cs.AI cs.LG 56%

NRR-Core: Non-Resolution Reasoning as a Computational Framework for Contextual Identity and Ambiguity Preservation

NRR-Core:非解析推理作为情境身份和歧义保留的计算框架

Kei Saito

机构 * Independent Researcher, Japan(日本独立研究员)

专题命中 仓库级理解 :分类 cs.CL、cs.AI、cs.LG;repository(comments)

AI总结 本文提出NRR框架,通过多向量嵌入、非坍缩注意力和情境身份追踪,解决人工智能系统过早解析歧义的问题,保持歧义保留以提升推理灵活性。

Comments 14 pages, 2 figures, 2 tables. Replacement synced to the current GitHub repository snapshot. Series hub: https://github.com/kei-saito-research/nrr-series-hub

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13277 2026-07-16 math.AG math.OC 新提交 50%

Euclidean Distance Degrees in Macaulay2

Macaulay2中的欧几里得距离度

William Huang, Jose Israel Rodriguez

专题命中 仓库级理解 :repository(abstract)

AI总结 介绍用于计算欧几里得距离度的Macaulay2软件包,它有基于子式和余法丛的符号方法及数值代数几何工具实现的数值方法,通过示例展示了其功能。

Comments to appear in Lecture Notes in Computer Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06315 2026-07-16 eess.SY cs.SY math.OC 版本更新 50%

Control-Oriented System Identification: Classical, Learning, and Physics-Informed Approaches

面向控制的系统辨识:经典、学习及物理信息方法

S. Sivaranjani, Yuanyuan Shi, Nikolay Atanasov, Thai Duong, Jie Feng, Tim Martin, Yuezhu Xu, Vijay Gupta, Frank Allgöwer

专题命中 仓库级理解 :repository(abstract)

AI总结 综述面向控制的系统辨识方法,涵盖经典、机器学习及物理信息方法。通过将系统辨识与控制相关或物理信息特性结合,以优化问题形式强化特性,综述相关方法并给出示例,还指出未来研究挑战方向。

Comments Accepted for publication in the Annual Reviews in Control, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07427 2026-07-16 cs.DB q-bio.QM 50%

RNA-KG v2.0: An RNA-centered Knowledge Graph with Properties

RNA-KG v2.0:一种以RNA为中心的知识图谱及其特性

Emanuele Cavalleri, Paolo Perlasca, Marco Mesiti

专题命中 仓库级理解 :repository(abstract)

AI总结 RNA-KG v2.0通过整合大量手动整理的RNA相互作用和上下文属性,提升RNA研究中的链接预测与上下文感知分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他AI编程 1 篇

2506.00650 2026-07-16 quant-ph cond-mat.stat-mech 版本更新 50%

Coherent error induced phase transition

相干误差诱导的相变

Hanchen Liu, Xiao Chen

专题命中 其他AI编程 :code model(abstract)

AI总结 研究量子稳定子码在相干单元误差下的逻辑信息稳定性,发现临界误差阈值下逻辑态保持不变,超过阈值则逻辑态改变,导致纠错失效。

Comments Fixed notations and figures

详情

展开后加载摘要…

URL PDF HTML 收藏