arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-14 至 2026-08-14 共收录 8 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 2 篇

2602.10840 2026-08-14 cs.LG 版本更新 79%

Training and Benchmarking Code Generation for Physics-Inspired Animations

SimuScene: 通过训练和基准测试代码生成来模拟物理场景

Yanan Wang, Renxi Wang, Yongxin Wang, Xuezhi Liang, Fajri Koto, Timothy Baldwin, Xiaodan Liang, Haonan Li

专题命中 代码生成 :code generation(title,abstract);分类 cs.LG

AI总结 SimuScene通过训练和基准测试代码生成模型,旨在提高模拟物理场景的能力,实验显示即使最强模型也仅达21.5%的通过率,表明该任务具有挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00325 2026-08-14 cs.PL 版本更新 57%

Triton for MTIA: Bridging the Programming Model Gaps for Custom AI Accelerators

用于MTIA的Triton:弥合定制AI加速器的编程模型差距

Haishan Zhu, Domi Yan, Michael Levesque-Dion, Changxu Zhang, Mitch Gamburg, Kirsten Lee, Giancarlo Colmenares, Aditya Bhagwat, Arnab De, Markus Le Roux, Victor Perez Carrasco, Xin Tong, Will Cromar, Simran Barnwal, Andrew Uderian, Sridhar Gopinath, Jan Szczepaniec, Daniel Neilson, Blaine Burton Rister, Jordan Fix, Jazlyn Li, Zejun Huang, Lite Ye, Nan Zhang, Xinchen Guo, Andiry Xu, Michael Roberts, Kunming Ho, Site Cao, Suryadev Sahadevan Rajesh, Tristan Trouwen, Mike Tsai, Jake Lee, Wayne Su, Yuhan Chen, Xiaolong Xie, David Eklov, Aaron Barnes, Max Bremer, Adam Belay, Shintaro Iwasaki, Roman Levenstein, Ajit Mathews

专题命中 代码生成 :code generation(abstract);分类 cs.PL

AI总结 本研究将Triton应用于Meta定制ML加速器MTIA-2i,开发了专属编译器后端与TorchInductor增强,其内核性能可媲美专家调优的C++实现,已部署至生产环境覆盖大量模型,证明Triton可弥合编程模型差距。

Comments 12 pages, 12 figures, to be published in IEEE Micro

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2607.14573 2026-08-14 cs.AI cs.SE 版本更新 84%

Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents

支付宝-PIBench:用于编码代理的现实支付集成基准测试

Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu

机构 * Ant Group(蚂蚁集团)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 研究旨在评估编码代理在支付宝支付集成任务中的表现,引入支付宝-PIBench基准测试,含九个产品项目和18个任务实例,分不同场景。通过评估六个编码代理模型得出评分通过率,发现有技能条件下RPR提升,为诊断模型能力和评估支付集成指导提供可控环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12161 2026-08-14 cs.CL 版本更新 57%

Token Reduction Is Not Cost Reduction

令牌减少并非成本降低

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 研究基于 API 的编码代理上下文减少层,通过对 2848 次 Claude Code 运行分析,发现提示缓存流量主导成本,工具输出减少不能可靠预测计费成本降低,压缩可能损害任务完成,进而提出以成功调整计费成本为核心的分层证据标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30777 2026-08-14 cs.SE 版本更新 57%

What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants

当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障

Alif Al Hasan, Sumon Biswas

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。

Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2605.25339 2026-08-14 astro-ph.GA 版本更新 50%

A Unified [CII] Morpho-Kinematic Corpus for 31 Star-Forming Galaxies at z = 4.26-5.68: The High-z Kinematic Corpus Z1

统一 [CII] 运动学形态数据集:31 个 z=4.26-5.68 恒星形成星系的高红移运动学语料库 Z1

David C. Flynn

专题命中 测试生成 :repository(abstract)

AI总结 基于 ALPINE 巡天数据,构建了 31 个高红移恒星形成星系的 [CII] 形态运动学结构化数据集,包含旋转曲线、动力学质量及分类信息,并公开了多格式数据与示例分析。

Comments 8 pages, 4 tables, 3 figures. Data descriptor for the High-z Kinematic Corpus Z1, the fourth corpus in the EPS Research RAG Astrophysics Corpus Series. Corpus deposited at Zenodo DOI: 10.5281/zenodo.20369285. Jupyter notebooks and figures included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 2 篇

2603.14501 2026-08-14 cs.SE cs.AI cs.CL 版本更新 67%

CangjieBench: Benchmarking LLMs on a Low-Resource General-Purpose Programming Language

仓颉基准:在低资源通用编程语言上评估大语言模型

Junhang Cheng, Fang Liu, Jia Li, Chengru Wu, Nanxiang Jiang, Li Zhang

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出CangjieBench,用于评估大语言模型在低资源通用编程语言上的表现,通过248个高质量样本覆盖文本到代码和代码到代码任务,发现语法受限生成在准确性和计算成本之间取得最佳平衡。

Comments Accepted by ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07335 2026-08-14 cs.LG cs.AI 版本更新 62%

Aftab: A Comprehensive Benchmark of CNN Encoders and Advanced Value Functions in Parallelized Q-Networks

Aftab:并行Q网络中CNN编码器与高级价值函数的综合基准

Taha Shieenavaz, Shabnam Zareshahraki, Loris Nanni

机构 * University of Padua(帕多瓦大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对并行Q网络,设计评估8种CNN拓扑并集成多种Q学习扩展,提出复合架构Aftab,在Atari-57与Procgen Hard基准上均优于基线,已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏