Training and Benchmarking Code Generation for Physics-Inspired Animations
SimuScene: 通过训练和基准测试代码生成来模拟物理场景
专题命中 代码生成 :code generation(title,abstract);分类 cs.LG
AI总结 SimuScene通过训练和基准测试代码生成模型,旨在提高模拟物理场景的能力,实验显示即使最强模型也仅达21.5%的通过率,表明该任务具有挑战性。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
SimuScene: 通过训练和基准测试代码生成来模拟物理场景
专题命中 代码生成 :code generation(title,abstract);分类 cs.LG
AI总结 SimuScene通过训练和基准测试代码生成模型,旨在提高模拟物理场景的能力,实验显示即使最强模型也仅达21.5%的通过率,表明该任务具有挑战性。
Vero:AI智能体能否构建形式化验证的软件仓库?
机构 * University of Chicago(芝加哥大学) ; California Institute of Technology(加州理工学院) ; Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; Amazon Web Services(亚马逊云计算服务) ; Apodex
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 研究推出首个仓库级验证软件综合基准Vero,含43个多模块实例,评估发现前沿智能体仅解决27个实例,为相关研究提供测试平台。
隐式在线策略自蒸馏
机构 * Shanghai Jiao Tong University(上海交通大学) ; National University of Singapore(新加坡国立大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出隐式在线策略自蒸馏(LOPD),将教师的特权上下文改为端到端可学习,在智能体工具使用和代码生成任务上,以远低于对比方法的rollout预算实现了更优性能。
StateBridge:面向大语言模型多智能体系统潜在通信的无训练隐藏状态对齐
机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 StateBridge 是一种无训练的潜在通信方法,通过闭式正交变换对齐大语言模型多智能体的隐藏状态,在 26 个模型-任务对中 22 个取得最优或并列最优性能,优于基线。
Comments 18 pages, 3 figures, 4 tables, accepted by COLM2026
从视觉控件到UI代码:高效的基于工具的生成
机构 * McMaster University(麦克马斯特大学) ; University of Toronto(多伦多大学) ; Concordia University(康考迪亚大学)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能
Comments ECCV2026 (MUCG Workshop)
它是否在所有环境中都能渲染?对多模态大语言模型(MLLM)生成网页的跨环境兼容性研究
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 该研究针对MLLM生成网页的跨环境兼容性问题,构建WebCompat数据集并开发XCompat检测器,发现68%的网页存在兼容性问题,XCompat的F1分数达0.903且性能优于现有工具与基线方法。
用于MTIA的Triton:弥合定制AI加速器的编程模型差距
专题命中 代码生成 :code generation(abstract);分类 cs.PL
AI总结 本研究将Triton应用于Meta定制ML加速器MTIA-2i,开发了专属编译器后端与TorchInductor增强,其内核性能可媲美专家调优的C++实现,已部署至生产环境覆盖大量模型,证明Triton可弥合编程模型差距。
Comments 12 pages, 12 figures, to be published in IEEE Micro
面向验证的25万行以上遗留气象模拟代码的AI辅助GPU移植
专题命中 代码生成 :code generation(abstract)
AI总结 本文以遗留Fortran气象模拟代码CReSS为例,提出面向验证的AI辅助GPU移植工作流,为162个内核生成经数值验证的GPU实现,获5.1倍应用级加速,还检测到5个内核的数值不一致。
Comments 11 pages, 1 figure, 3 tables. Submitted to AgenticAI4HPC 2026
支付宝-PIBench:用于编码代理的现实支付集成基准测试
机构 * Ant Group(蚂蚁集团)
专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI
AI总结 研究旨在评估编码代理在支付宝支付集成任务中的表现,引入支付宝-PIBench基准测试,含九个产品项目和18个任务实例,分不同场景。通过评估六个编码代理模型得出评分通过率,发现有技能条件下RPR提升,为诊断模型能力和评估支付集成指导提供可控环境。
用于组合智能体 harness 修复的层架:受控商与真实仓库压力测试
专题命中 软件智能体 :repository(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究提出用能力层架建模智能体 harness 故障,通过受控实验验证其可减少候选预算,在SWE-bench多语言库测试中,弃权门解决127个问题,支持其受控不变性机制。
采用AI编码智能体的规范优先收敛:在71.7万行代码库中拆解189个文件的核心架构不变量的案例研究
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 本文通过案例研究,展示AI编码智能体在规范优先协议下,成功在71.7万行代码库中拆解核心架构不变量,耗时3天、成本2430美元,修正201个缺陷,涉及189个文件。
Comments 14 pages, 4 figures, 3 tables
AI编码智能体研究中缺失了人类
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。
QuoteBench:匹配分数如何掩盖命令路径故障
机构 * Stony Brook University(石溪大学) ; LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 QuoteBench针对LLM编码智能体的命令路径故障,通过56个任务实验发现匹配分数掩盖执行缺陷,披露边界可恢复部分性能,提出评估需报告多维度配置而非仅匹配分数。
Comments 29 pages, 5 figures. Project page: https://quotebench.lsamc.website/
训练AI科学家以实现研究的可复现性
机构 * Inherent(因赫伦特)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG
AI总结 本研究开发了可扩展的论文复现任务空间Replica,后训练出270亿参数的AI科学家Faraday,其在复现任务上表现优于Claude Opus 4.8和GPT-5.5,为长期科学创新AI智能体奠定基础。
Comments 47 pages, 12 figures
令牌减少并非成本降低
机构 * PointFive
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL
AI总结 研究基于 API 的编码代理上下文减少层,通过对 2848 次 Claude Code 运行分析,发现提示缓存流量主导成本,工具输出减少不能可靠预测计费成本降低,压缩可能损害任务完成,进而提出以成功调整计费成本为核心的分层证据标准。
当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。
Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track
生成后优化:面向基于大语言模型的程序修复中正确且简洁的补丁
专题命中 程序修复 :program repair(title,abstract);repository(abstract);分类 cs.SE
AI总结 针对基于LLM的程序修复中补丁冗余问题,提出RECAP适配器,在保留或提升解决率的同时,大幅降低补丁大小,实现更优的大小-正确性权衡。
金融中的扩散模型:一项综述
专题命中 测试生成 :repository(abstract)
AI总结 该综述聚焦金融领域的扩散族生成模型,按金融数据类型分类梳理相关研究,是首个针对金融数据扩散族模型的专门综述,还开源了相关代码仓库。
统一 [CII] 运动学形态数据集:31 个 z=4.26-5.68 恒星形成星系的高红移运动学语料库 Z1
专题命中 测试生成 :repository(abstract)
AI总结 基于 ALPINE 巡天数据,构建了 31 个高红移恒星形成星系的 [CII] 形态运动学结构化数据集,包含旋转曲线、动力学质量及分类信息,并公开了多格式数据与示例分析。
Comments 8 pages, 4 tables, 3 figures. Data descriptor for the High-z Kinematic Corpus Z1, the fourth corpus in the EPS Research RAG Astrophysics Corpus Series. Corpus deposited at Zenodo DOI: 10.5281/zenodo.20369285. Jupyter notebooks and figures included as ancillary files
仓颉基准:在低资源通用编程语言上评估大语言模型
专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文提出CangjieBench,用于评估大语言模型在低资源通用编程语言上的表现,通过248个高质量样本覆盖文本到代码和代码到代码任务,发现语法受限生成在准确性和计算成本之间取得最佳平衡。
Comments Accepted by ESEM 2026
H-VAEP与H-xT:通过概率估计评估手球进攻中持球动作的价值
机构 * Paderborn University(帕德博恩大学) ; SG Flensburg-Handewitt(弗伦斯堡-汉德维特体育俱乐部)
专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG
AI总结 本文将足球的xT与VAEP框架适配至手球,开发H-xT与H-VAEP模型,利用手球德甲数据验证其有效性并发布代码,实现了手球球员的合理评估。
Comments 13 pages, 6 figures, 1 table. Accepted at the 13th Workshop on Machine Learning and Data Mining for Sports Analytics (MLSA 2026), co-located with ECML PKDD 2026
Aftab:并行Q网络中CNN编码器与高级价值函数的综合基准
机构 * University of Padua(帕多瓦大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG
AI总结 本研究针对并行Q网络,设计评估8种CNN拓扑并集成多种Q学习扩展,提出复合架构Aftab,在Atari-57与Procgen Hard基准上均优于基线,已开源。
大型语言模型在生成形式化程序规约方面的能力有多强?
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 该研究引入基于Rocq的Coins评估框架,在HumanEval数据集上开展大规模研究,发现LLMs生成形式化程序规约仍具挑战,准确的规约评估是理解其能力的核心。
CoMedBench:合成医疗数据保真度与下游效用的多源基准
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 CoMedBench是涵盖多源合成医疗数据的可复现基准,评估多生成器在静态表格和时序ICU任务上的保真度与下游效用,实验显示合成数据可保留多数下游信号,不同生成器表现存在差异。
Edit2TikZ:面向基于TikZ的科学图像编辑的全面且具有挑战性的基准
专题命中 代码评测 :code generation(abstract)
AI总结 本文推出科学图像编辑基准Edit2TikZ,评估主流多模态大语言模型发现其性能不足,通过构建混合训练集并采用课程学习,可显著提升紧凑模型的编译成功率。
Comments 9 pages, 6 figures, work in progress
@skills:你所需的全部注意力
机构 * SylphAI(西尔菲人工智能公司) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 仓库级理解 :repository(abstract);分类 cs.AI
AI总结 针对当前智能体技能安装模式下触发槽位稀缺的问题,提出@skills开放协议,分离技能的内容、持久化与自动触发功能,无需安装即可使用技能,通过Git管理实现灵活适配,搭配免费技能 hub 提供搜索等功能,减少安装、提升使用效率。
Comments 7 pages main, 23 pages in total with appendix, 6 figures