Optimising Code Generation with haggies
专题命中 代码生成 :code generation(title)
Comments 66 pages, 5 figures, program files for download at http://www.nikhef.nl/~thomasr/
Journal ref Comput.Phys.Commun.181:1301-1331,2010
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
专题命中 代码生成 :code generation(title)
Comments 66 pages, 5 figures, program files for download at http://www.nikhef.nl/~thomasr/
Journal ref Comput.Phys.Commun.181:1301-1331,2010
专题命中 代码生成 :code generation(title)
Comments Proceedings of HIP3ES Workshop, Vienna, January, 21st 2014
专题命中 代码生成 :code generation(title)
Comments 18 pages, 4 figures, accepted for publication in Scientific Programming
专题命中 代码生成 :code generation(title)
Comments Compumag 2011
专题命中 代码生成 :code generation(title)
Journal ref SIAM J. Sci. Comput. 31(2), 2008, pp. 849-864
专题命中 代码生成 :code generation(title)
Comments 5 pages, 5 figures, accepted to ISIT 2009
专题命中 代码生成 :code generation(title)
Comments 13 pages, LaTeX, axodraw.sty
对软件工程任务中投机解码的实证研究
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE
AI总结 本文通过实证研究评估了投机解码在软件工程任务中的有效性,发现其在代码生成、修复和编辑任务中表现各异,模型基于方法适合生成,模型无关方法更适合仓库级任务,且任务重复性提升模型无关方法性能。
Comments Accepted by ISSTA 2026
像人类一样优化CUDA:微剖析工具作为基于LLM的GPU内核优化的专家替代品
机构 * Amazon(亚马逊) ; Siemens(西门子) ; University of Minnesota(明尼苏达大学)
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.LG
AI总结 提出KernelPro闭环多智能体系统,通过LLM代码生成与硬件剖析反馈及可插拔瓶颈检测工具迭代优化GPU内核,在KernelBench上实现2.42x/4.69x/5.30x加速比,并首次兼顾能效优化。
CURATE:利用大语言模型智能体构建、编目和部署可复现工作流
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.SE
AI总结 该研究提出CURATE多智能体系统,覆盖工作流全生命周期,通过模块目录支持FAIR原则,用Claude Opus 4.8原型验证,完成6项含基准工作流复现及环境工程工作流开发的实验。
Comments 8 pages, 3 figures
通过强化学习学习检测用户界面原则违规
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.CL
AI总结 研究小型语言模型和编码代理生成的网页前端代码违反界面质量原则的问题,通过统一多来源的界面质量原则,构建数据集并利用强化学习训练轻量级视觉语言模型作为评判器,提升检测效果并发布相关方法支持评估和后续工作。
RIDGE:一个用于验证和发现大语言模型生成的期权定价方法的自主框架
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.AI
AI总结 针对大语言模型生成的期权定价实现,介绍自主验证框架RIDGE,通过多种测试和检查优化定价实现与验证方法,应用于五个随机波动率模型,消除缺陷并带来新定价方法。
Comments 33 pages
TraceDev:一种用于需求到代码开发的可追溯性驱动的多智能体框架
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE
AI总结 针对现有方法在自然语言需求到代码转换中存在的不足,提出TraceDev多智能体框架,通过五个特定角色智能体及可追溯性图,实现自动化软件开发,在两个数据集上的评估结果证明了其在需求到代码生成上的有效性。
Comments Accepted by ISSTA 2026
代理心理测量:在代理编码基准中的任务级性能预测
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Fulcrum ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.AI
AI总结 本文提出了一种基于任务级性能预测的代理编码基准评估框架,结合IRT理论与任务特征,区分LLM和支架能力,以更准确预测未见基准和组合的性能。
SEVRA-BENCH:审查智能体中的社会工程漏洞
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft Core AI(微软核心人工智能) ; Amazon AWS(亚马逊AWS) ; Databricks
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.AI
AI总结 提出SEVRA-BENCH基准,通过社会工程攻击框架评估LLM代码审查智能体拒绝恶意PR的能力,发现闭源与开源模型间存在显著安全差距。
内在奖励何时对代码推理有效?一项全面研究
机构 * Purdue University(普渡大学) ; UC Berkeley(加州大学伯克利分校) ; UC Santa Barbara(加州大学圣塔芭芭拉分校)
专题命中 代码生成 :code generation(abstract);code model(abstract);分类 cs.AI
AI总结 通过系统实验,发现基于确定性的内在奖励方法在代码生成中早期有效但最终导致模型崩溃,且作为RLVR预训练无显著优势,并给出实用建议。
Comments 18 pages, 45 figures
EvoTrainer: 协同进化LLM策略与训练框架以实现自主智能体强化学习
机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) ; Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团) ; Alibaba Group(阿里巴巴集团) ; SUAT(深圳大学)
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.AI
AI总结 提出EvoTrainer框架,通过协同进化LLM策略和训练端框架,基于经验反馈自动诊断、修正并积累可复用技能,在数学推理、编程竞赛和仓库级软件工程任务上匹配或超越人工设计的RL基线。
代码相关任务中的参数高效多任务微调
专题命中 代码生成 :code generation(abstract);code model(abstract);分类 cs.SE
AI总结 研究多任务QLoRA微调在代码生成、翻译和总结中的效果,发现其在1.5B、3B和7B规模上达到或优于单任务QLoRA和全微调,大模型平衡正确性与质量更佳。
FrontierOR:基准测试大语言模型在大规模优化中高效算法设计的能力
机构 * Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联盟研究技术) ; Massachusetts Institute of Technology(麻省理工学院) ; Northeastern University(东北大学) ; Uber ; Shanghai Jiaotong University(上海交通大学) ; Boston University(波士顿大学) ; Emory University(埃默里大学) ; Northwestern University(西北大学) ; National University of Singapore(国立新加坡大学) ; Microsoft(微软) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Singapore Management University(新加坡管理学院)
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.AI
AI总结 提出FrontierOR基准,系统评估大语言模型在现实大规模优化问题中设计可扩展算法(而非仅生成求解器代码)的能力,发现最强模型仅在31%案例中优于Gurobi。
学习并行代码的推理世界模型
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.SE
AI总结 提出Parallel-Code World Models (PCWMs),通过推理LLM直接预测并行代码的工具输出,以解决并行代码训练数据稀缺问题,在数据竞争预测和性能分析任务上取得显著提升。
编译时敏感字符串生成器的安全分析与优化
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.PL
AI总结 本文提出一种通用安全内容编译框架,通过扩展内容语言并整合到通用编程语言中,减少安全与不安全惯用法的词法距离,提升运行性能并提供开发者面向的诊断信息。
Comments 10 pages, 9 figures
代理生成的代码需要多少维护?一项实证研究
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.SE
AI总结 研究通过分析AI生成与人工编写代码的维护情况,发现AI代码维护频率较低,主要修改类型为功能扩展,而人工代码则以修复bug为主,人类开发者主导了大部分维护工作。
Comments 6 pages, 2 figures, 2 tables. Accepted at the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026)
Saber: 一种高效的采样方法,具有自适应加速和回溯增强的重新遮蔽,用于扩散语言模型
机构 * School of Computer Science, Peking University(北京大学计算机科学系) ; Tongyi Lab, Alibaba Group(阿里云实验室)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文提出Saber算法,通过动态调整每步未遮蔽令牌数量和回溯机制提升代码生成的推理速度和输出质量,实验显示在多个基准上Pass@1准确率提升1.9%,推理速度提升251.4%。
Comments Accepted to ACL 2026 (main)
通过代码依赖关系进行结构化知识检索以实现多步数据推理
机构 * Simon Fraser University(西蒙弗雷泽大学)
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.CL
AI总结 本文提出SGKR框架,通过函数调用依赖关系构建图结构,提升多步数据推理任务中知识检索的准确性与相关性。
软件系统的代理验证
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.SE
AI总结 本文提出AutoRocq代理,通过与Rocq定理证明器协作实现程序验证,采用迭代优化提升证明质量,实验显示在SV-COMP和Linux内核模块上具有良好的自动验证效果。
Comments Camera-ready version appeared in the Proceedings of the ACM International Conference on the Foundations of Software Engineering (FSE 2026)
CodeMind: 评估大型语言模型的代码推理能力
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文提出CodeMind框架,通过独立执行推理、规范推理和动态语义推理任务评估LLM的代码推理能力,发现LLM在处理复杂代码时性能下降,且bug修复性能与代码推理任务无关。
PRBench: 物理研究中的端到端论文复现
机构 * School of Physics, Peking University(北京大学物理学院) ; Beijing Computational Science Research Center(北京计算科学研究中心)
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.CL
AI总结 PRBench通过30个物理领域专家任务评估AI在复现科学论文中的能力,发现现有模型在数据准确性和代码正确性上表现不佳,揭示了系统性失败模式。
Comments 17 pages, 3 figures
戴上思考帽子:从人类推理机制视角对链式思考微调的综述
机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) ; College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.CL
AI总结 本文从人类推理机制角度综述了链式思考微调,分析其通过六顶思考帽子框架分类方法,并探讨未来研究方向及现有数据集与模型表现。
通过文本模型预测控制对大型语言模型进行测试时对齐
机构 * National Yang Ming Chiao Tung University ; NVIDIA ; National Taiwan University
专题命中 代码生成 :code generation(abstract);program synthesis(abstract);分类 cs.CL
AI总结 本文提出TMPC方法,通过文本模型预测控制解决测试时对齐问题,通过分层强化学习原理改进生成过程,提升不同任务的性能。
Comments Accepted for ICLR 2026. Project page: https://rl-bandits-lab.github.io/TMPC/
对基于大语言模型的代理在单细胞组学分析中的性能评估
专题命中 代码生成 :code generation(abstract);program synthesis(abstract);分类 cs.AI
AI总结 本文提出一个评估系统,用于严格评估代理在单细胞组学分析中的能力,发现Grok3-beta在测试框架中表现最佳,多代理框架通过角色分工提升协作与执行效率。
Comments please see clear figures in this version. 6 main figures; 13 supplementary figures