Training and Benchmarking Code Generation for Physics-Inspired Animations
SimuScene: 通过训练和基准测试代码生成来模拟物理场景
专题命中 代码生成 :code generation(title,abstract);分类 cs.LG
AI总结 SimuScene通过训练和基准测试代码生成模型,旨在提高模拟物理场景的能力,实验显示即使最强模型也仅达21.5%的通过率,表明该任务具有挑战性。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
SimuScene: 通过训练和基准测试代码生成来模拟物理场景
专题命中 代码生成 :code generation(title,abstract);分类 cs.LG
AI总结 SimuScene通过训练和基准测试代码生成模型,旨在提高模拟物理场景的能力,实验显示即使最强模型也仅达21.5%的通过率,表明该任务具有挑战性。
用于MTIA的Triton:弥合定制AI加速器的编程模型差距
专题命中 代码生成 :code generation(abstract);分类 cs.PL
AI总结 本研究将Triton应用于Meta定制ML加速器MTIA-2i,开发了专属编译器后端与TorchInductor增强,其内核性能可媲美专家调优的C++实现,已部署至生产环境覆盖大量模型,证明Triton可弥合编程模型差距。
Comments 12 pages, 12 figures, to be published in IEEE Micro
支付宝-PIBench:用于编码代理的现实支付集成基准测试
机构 * Ant Group(蚂蚁集团)
专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI
AI总结 研究旨在评估编码代理在支付宝支付集成任务中的表现,引入支付宝-PIBench基准测试,含九个产品项目和18个任务实例,分不同场景。通过评估六个编码代理模型得出评分通过率,发现有技能条件下RPR提升,为诊断模型能力和评估支付集成指导提供可控环境。
令牌减少并非成本降低
机构 * PointFive
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL
AI总结 研究基于 API 的编码代理上下文减少层,通过对 2848 次 Claude Code 运行分析,发现提示缓存流量主导成本,工具输出减少不能可靠预测计费成本降低,压缩可能损害任务完成,进而提出以成功调整计费成本为核心的分层证据标准。
当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。
Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track
统一 [CII] 运动学形态数据集:31 个 z=4.26-5.68 恒星形成星系的高红移运动学语料库 Z1
专题命中 测试生成 :repository(abstract)
AI总结 基于 ALPINE 巡天数据,构建了 31 个高红移恒星形成星系的 [CII] 形态运动学结构化数据集,包含旋转曲线、动力学质量及分类信息,并公开了多格式数据与示例分析。
Comments 8 pages, 4 tables, 3 figures. Data descriptor for the High-z Kinematic Corpus Z1, the fourth corpus in the EPS Research RAG Astrophysics Corpus Series. Corpus deposited at Zenodo DOI: 10.5281/zenodo.20369285. Jupyter notebooks and figures included as ancillary files
仓颉基准:在低资源通用编程语言上评估大语言模型
专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文提出CangjieBench,用于评估大语言模型在低资源通用编程语言上的表现,通过248个高质量样本覆盖文本到代码和代码到代码任务,发现语法受限生成在准确性和计算成本之间取得最佳平衡。
Comments Accepted by ESEM 2026
Aftab:并行Q网络中CNN编码器与高级价值函数的综合基准
机构 * University of Padua(帕多瓦大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG
AI总结 本研究针对并行Q网络,设计评估8种CNN拓扑并集成多种Q学习扩展,提出复合架构Aftab,在Atari-57与Procgen Hard基准上均优于基线,已开源。