arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-14 至 2026-08-14 共收录 26 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2602.10840 2026-08-14 cs.LG 版本更新 79%

Training and Benchmarking Code Generation for Physics-Inspired Animations

SimuScene: 通过训练和基准测试代码生成来模拟物理场景

Yanan Wang, Renxi Wang, Yongxin Wang, Xuezhi Liang, Fajri Koto, Timothy Baldwin, Xiaodan Liang, Haonan Li

专题命中 代码生成 :code generation(title,abstract);分类 cs.LG

AI总结 SimuScene通过训练和基准测试代码生成模型,旨在提高模拟物理场景的能力,实验显示即使最强模型也仅达21.5%的通过率,表明该任务具有挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13522 2026-08-14 cs.LG cs.AI cs.LO cs.PL cs.SE 新提交 77%

Vero: Can AI Agents Build Formally Verified Software Repositories?

Vero:AI智能体能否构建形式化验证的软件仓库?

Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song

机构 * University of Chicago(芝加哥大学) California Institute of Technology(加州理工学院) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Amazon Web Services(亚马逊云计算服务) Apodex

专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 研究推出首个仓库级验证软件综合基准Vero,含43个多模块实例,评估发现前沿智能体仅解决27个实例,为相关研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13040 2026-08-14 cs.LG cs.CL 新提交 62%

Latent On-Policy Self-Distillation

隐式在线策略自蒸馏

Guibin Zhang, Jiayang Lyu, Ran Sun, Xinlei Yu, Haoyu Zhao, Qibing Ren, Shuicheng Yan

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出隐式在线策略自蒸馏(LOPD),将教师的特权上下文改为端到端可学习,在智能体工具使用和代码生成任务上,以远低于对比方法的rollout预算实现了更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13317 2026-08-14 cs.AI 新提交 57%

StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems

StateBridge:面向大语言模型多智能体系统潜在通信的无训练隐藏状态对齐

Yanwen Peng, Delvin Ce Zhang, Xi Wang, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 StateBridge 是一种无训练的潜在通信方法,通过闭式正交变换对齐大语言模型多智能体的隐藏状态,在 26 个模型-任务对中 22 个取得最优或并列最优性能,优于基线。

Comments 18 pages, 3 figures, 4 tables, accepted by COLM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12611 2026-08-14 cs.CV cs.LG 新提交 57%

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

从视觉控件到UI代码:高效的基于工具的生成

Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) Concordia University(康考迪亚大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能

Comments ECCV2026 (MUCG Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12518 2026-08-14 cs.SE 新提交 57%

Does It Render Everywhere? A Study of Cross-Environment Compatibility in MLLM-Generated Webpages

它是否在所有环境中都能渲染?对多模态大语言模型(MLLM)生成网页的跨环境兼容性研究

Ziyun Guo, Jingyu Xiao, Yuqiang Sun, Yintong Huo

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 该研究针对MLLM生成网页的跨环境兼容性问题,构建WebCompat数据集并开发XCompat检测器,发现68%的网页存在兼容性问题,XCompat的F1分数达0.903且性能优于现有工具与基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00325 2026-08-14 cs.PL 版本更新 57%

Triton for MTIA: Bridging the Programming Model Gaps for Custom AI Accelerators

用于MTIA的Triton:弥合定制AI加速器的编程模型差距

Haishan Zhu, Domi Yan, Michael Levesque-Dion, Changxu Zhang, Mitch Gamburg, Kirsten Lee, Giancarlo Colmenares, Aditya Bhagwat, Arnab De, Markus Le Roux, Victor Perez Carrasco, Xin Tong, Will Cromar, Simran Barnwal, Andrew Uderian, Sridhar Gopinath, Jan Szczepaniec, Daniel Neilson, Blaine Burton Rister, Jordan Fix, Jazlyn Li, Zejun Huang, Lite Ye, Nan Zhang, Xinchen Guo, Andiry Xu, Michael Roberts, Kunming Ho, Site Cao, Suryadev Sahadevan Rajesh, Tristan Trouwen, Mike Tsai, Jake Lee, Wayne Su, Yuhan Chen, Xiaolong Xie, David Eklov, Aaron Barnes, Max Bremer, Adam Belay, Shintaro Iwasaki, Roman Levenstein, Ajit Mathews

专题命中 代码生成 :code generation(abstract);分类 cs.PL

AI总结 本研究将Triton应用于Meta定制ML加速器MTIA-2i,开发了专属编译器后端与TorchInductor增强,其内核性能可媲美专家调优的C++实现,已部署至生产环境覆盖大量模型,证明Triton可弥合编程模型差距。

Comments 12 pages, 12 figures, to be published in IEEE Micro

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13122 2026-08-14 cs.DC 新提交 50%

Validation-Centric AI-Assisted GPU Porting of a 250,000+ Line Legacy Weather Simulation Code

面向验证的25万行以上遗留气象模拟代码的AI辅助GPU移植

Tetsuya Hoshino, Masaya Kato, Kazuhisa Tsuboki, Daichi Mukunoki, Takahiro Katagiri, Toshihiro Hanawa

专题命中 代码生成 :code generation(abstract)

AI总结 本文以遗留Fortran气象模拟代码CReSS为例,提出面向验证的AI辅助GPU移植工作流,为162个内核生成经数值验证的GPU实现,获5.1倍应用级加速,还检测到5个内核的数值不一致。

Comments 11 pages, 1 figure, 3 tables. Submitted to AgenticAI4HPC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 8 篇

2607.14573 2026-08-14 cs.AI cs.SE 版本更新 84%

Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents

支付宝-PIBench:用于编码代理的现实支付集成基准测试

Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu

机构 * Ant Group(蚂蚁集团)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 研究旨在评估编码代理在支付宝支付集成任务中的表现,引入支付宝-PIBench基准测试,含九个产品项目和18个任务实例,分不同场景。通过评估六个编码代理模型得出评分通过率,发现有技能条件下RPR提升,为诊断模型能力和评估支付集成指导提供可控环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13228 2026-08-14 cs.AI cs.LG 新提交 81%

Capability Sheaves for Compositional Agent-Harness Repair: Controlled Quotients and a Real-Repository Stress Test

用于组合智能体 harness 修复的层架:受控商与真实仓库压力测试

Saveliy Batruin

专题命中 软件智能体 :repository(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出用能力层架建模智能体 harness 故障,通过受控实验验证其可减少候选预算,在SWE-bench多语言库测试中,弃权门解决127个问题,支持其受控不变性机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12440 2026-08-14 cs.SE cs.AI 新提交 81%

Specification-first convergence with an AI coding agent: a case study of dismantling a core architectural invariant across 189 files in a 717k-line codebase with no test oracle and no human code review

采用AI编码智能体的规范优先收敛:在71.7万行代码库中拆解189个文件的核心架构不变量的案例研究

Joel Abenhaim

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本文通过案例研究,展示AI编码智能体在规范优先协议下,成功在71.7万行代码库中拆解核心架构不变量,耗时3天、成本2430美元,修正201个缺陷,涉及189个文件。

Comments 14 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12355 2026-08-14 cs.HC cs.AI cs.SE 新提交 81%

Humans are Missing from AI Coding Agent Research

AI编码智能体研究中缺失了人类

Zora Z. Wang, John Yang, Kilian Lieret, Alexa Tartaglini, Valerie Chen, Yuxiang Wei, Zijian Wang, Lingming Zhang, Karthik Narasimhan, Ludwig Schmidt, Graham Neubig, Daniel Fried, Diyi Yang

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13547 2026-08-14 cs.AI cs.SE 新提交 62%

QuoteBench: How Matched Scores Can Hide Command-Path Failures

QuoteBench:匹配分数如何掩盖命令路径故障

Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang

机构 * Stony Brook University(石溪大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 QuoteBench针对LLM编码智能体的命令路径故障,通过56个任务实验发现匹配分数掩盖执行缺陷,披露边界可恢复部分性能,提出评估需报告多维度配置而非仅匹配分数。

Comments 29 pages, 5 figures. Project page: https://quotebench.lsamc.website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13331 2026-08-14 cs.LG cs.AI 新提交 62%

Training AI Scientists to Replicate Research

训练AI科学家以实现研究的可复现性

Damon Falck, Samer Sabri, Anja Surina, Thom Foster, Anya Sims, Sam Devlin, Dylan Rogers, Tantum Collins, Kaloyan Aleksiev, Louis Kirsch, Edward Hughes

机构 * Inherent(因赫伦特)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发了可扩展的论文复现任务空间Replica,后训练出270亿参数的AI科学家Faraday,其在复现任务上表现优于Claude Opus 4.8和GPT-5.5,为长期科学创新AI智能体奠定基础。

Comments 47 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12161 2026-08-14 cs.CL 版本更新 57%

Token Reduction Is Not Cost Reduction

令牌减少并非成本降低

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 研究基于 API 的编码代理上下文减少层,通过对 2848 次 Claude Code 运行分析,发现提示缓存流量主导成本,工具输出减少不能可靠预测计费成本降低,压缩可能损害任务完成,进而提出以成功调整计费成本为核心的分层证据标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30777 2026-08-14 cs.SE 版本更新 57%

What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants

当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障

Alif Al Hasan, Sumon Biswas

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。

Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2608.13292 2026-08-14 cs.SE 新提交 83%

Refine After Generation: Toward Correct and Concise Patches in LLM-based Program Repair

生成后优化:面向基于大语言模型的程序修复中正确且简洁的补丁

Wenqiang Luo, Jacky Keung, Xiaoyu Shi, Yicheng Sun, Boyang Yang, Zhou Yang, Haoye Tian

专题命中 程序修复 :program repair(title,abstract);repository(abstract);分类 cs.SE

AI总结 针对基于LLM的程序修复中补丁冗余问题,提出RECAP适配器,在保留或提升解决率的同时,大幅降低补丁大小,实现更优的大小-正确性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 2 篇

2608.12583 2026-08-14 q-fin.CP 新提交 50%

Diffusion Models in Finance: A Survey

金融中的扩散模型:一项综述

Zhuohan Wang, Carmine Ventre

专题命中 测试生成 :repository(abstract)

AI总结 该综述聚焦金融领域的扩散族生成模型,按金融数据类型分类梳理相关研究,是首个针对金融数据扩散族模型的专门综述,还开源了相关代码仓库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25339 2026-08-14 astro-ph.GA 版本更新 50%

A Unified [CII] Morpho-Kinematic Corpus for 31 Star-Forming Galaxies at z = 4.26-5.68: The High-z Kinematic Corpus Z1

统一 [CII] 运动学形态数据集:31 个 z=4.26-5.68 恒星形成星系的高红移运动学语料库 Z1

David C. Flynn

专题命中 测试生成 :repository(abstract)

AI总结 基于 ALPINE 巡天数据,构建了 31 个高红移恒星形成星系的 [CII] 形态运动学结构化数据集,包含旋转曲线、动力学质量及分类信息,并公开了多格式数据与示例分析。

Comments 8 pages, 4 tables, 3 figures. Data descriptor for the High-z Kinematic Corpus Z1, the fourth corpus in the EPS Research RAG Astrophysics Corpus Series. Corpus deposited at Zenodo DOI: 10.5281/zenodo.20369285. Jupyter notebooks and figures included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 6 篇

2603.14501 2026-08-14 cs.SE cs.AI cs.CL 版本更新 67%

CangjieBench: Benchmarking LLMs on a Low-Resource General-Purpose Programming Language

仓颉基准:在低资源通用编程语言上评估大语言模型

Junhang Cheng, Fang Liu, Jia Li, Chengru Wu, Nanxiang Jiang, Li Zhang

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出CangjieBench,用于评估大语言模型在低资源通用编程语言上的表现,通过248个高质量样本覆盖文本到代码和代码到代码任务,发现语法受限生成在准确性和计算成本之间取得最佳平衡。

Comments Accepted by ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12926 2026-08-14 cs.LG cs.AI 新提交 62%

H-VAEP and H-xT: Valuing Offensive On-the-Ball Actions in Handball by Estimating Probabilities

H-VAEP与H-xT:通过概率估计评估手球进攻中持球动作的价值

Julius Broermann, Oliver Müller, Michael Döring, Jochen Baumeister

机构 * Paderborn University(帕德博恩大学) SG Flensburg-Handewitt(弗伦斯堡-汉德维特体育俱乐部)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文将足球的xT与VAEP框架适配至手球,开发H-xT与H-VAEP模型,利用手球德甲数据验证其有效性并发布代码,实现了手球球员的合理评估。

Comments 13 pages, 6 figures, 1 table. Accepted at the 13th Workshop on Machine Learning and Data Mining for Sports Analytics (MLSA 2026), co-located with ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07335 2026-08-14 cs.LG cs.AI 版本更新 62%

Aftab: A Comprehensive Benchmark of CNN Encoders and Advanced Value Functions in Parallelized Q-Networks

Aftab:并行Q网络中CNN编码器与高级价值函数的综合基准

Taha Shieenavaz, Shabnam Zareshahraki, Loris Nanni

机构 * University of Padua(帕多瓦大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对并行Q网络,设计评估8种CNN拓扑并集成多种Q学习扩展,提出复合架构Aftab,在Atari-57与Procgen Hard基准上均优于基线,已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13077 2026-08-14 cs.SE 新提交 57%

How Powerful are LLMs in Generating Formal Program Specifications?

大型语言模型在生成形式化程序规约方面的能力有多强?

Fanpeng Yang, Xing Li, Shuling Wang, Jie An, Zeyu Sun, Shenghua Feng, Wenhan Wang, Weiyi Wang, Naijun Zhan, Fanjiang Xu

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 该研究引入基于Rocq的Coins评估框架,在HumanEval数据集上开展大规模研究,发现LLMs生成形式化程序规约仍具挑战,准确的规约评估是理解其能力的核心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12805 2026-08-14 cs.LG 新提交 57%

CoMedBench: A Multi-Source Benchmark of Synthetic Medical Data Fidelity and Downstream Utility

CoMedBench:合成医疗数据保真度与下游效用的多源基准

Akanta Das, Al Amin Farhad, Mrinmoy Sarkar Anto, David Rehkopf, Ayin Vala, Tanmoy Sarkar Pias

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 CoMedBench是涵盖多源合成医疗数据的可复现基准,评估多生成器在静态表格和时序ICU任务上的保真度与下游效用,实验显示合成数据可保留多数下游信号,不同生成器表现存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13441 2026-08-14 cs.CV 新提交 50%

Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ

Edit2TikZ:面向基于TikZ的科学图像编辑的全面且具有挑战性的基准

Zongyun Zhang, Jiacheng Ruan, Xian Gao, Ruizhu Zhou, Lingcheng Meng, Lining Hu, Ting Liu, Yuzhuo Fu

专题命中 代码评测 :code generation(abstract)

AI总结 本文推出科学图像编辑基准Edit2TikZ,评估主流多模态大语言模型发现其性能不足,通过构建混合训练集并采用课程学习,可显著提升紧凑模型的编译成功率。

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 1 篇

2608.12610 2026-08-14 cs.AI 新提交 57%

@skills: Attention is all you have

@skills:你所需的全部注意力

Li Yin, Zhi Li, Zhan Shi, Haoran Zhang, Haebin Seong, Zhangyang, Wang

机构 * SylphAI(西尔菲人工智能公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 针对当前智能体技能安装模式下触发槽位稀缺的问题,提出@skills开放协议,分离技能的内容、持久化与自动触发功能,无需安装即可使用技能,通过Git管理实现灵活适配,搭配免费技能 hub 提供搜索等功能,减少安装、提升使用效率。

Comments 7 pages main, 23 pages in total with appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏