Contextualized Code Pretraining for Code Generation
基于上下文的代码预训练用于代码生成
专题命中 代码生成 :code generation(title,abstract);code model(abstract);repository(abstract);分类 cs.SE
AI总结 本文提出了一种基于上下文的代码预训练方法,通过整合调用上下文来改进代码生成模型的训练和评估,实验表明该方法在代码生成任务中表现优异。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
基于上下文的代码预训练用于代码生成
专题命中 代码生成 :code generation(title,abstract);code model(abstract);repository(abstract);分类 cs.SE
AI总结 本文提出了一种基于上下文的代码预训练方法,通过整合调用上下文来改进代码生成模型的训练和评估,实验表明该方法在代码生成任务中表现优异。
基于属性的LLM程序合成用于规划
机构 * Federal University of Rio Grande do Sul(里约格朗德杜斯尔大学) ; University of Oxford(牛津大学) ; Linköping University(林奈大学)
专题命中 代码生成 :program synthesis(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了一种基于属性的LLM程序合成方法,通过检查候选程序是否满足形式定义的属性来指导LLM生成更高质量的程序,从而减少生成和评估成本。
超越执行:静态分析奖励与提示条件扩散强化学习用于代码生成
机构 * King’s College London(伦敦国王学院) ; Elm Europe(Elm欧洲)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI
AI总结 本文研究了强化学习在扩散式代码生成中的应用,探讨了静态分析奖励和提示条件扩散强化学习在不同任务难度下的效果,发现静态检查在提升代码生成性能方面表现最佳。
大型语言模型在代码生成中的任务回避
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI
AI总结 本文研究了大型语言模型在代码生成任务中是否应回避生成可能产生幻觉的代码,提出了一种基于多重假设检验原理的校准回避规则,通过代码执行结果评估生成一致性,无需依赖Oracle测试用例或外部数据库,提供了一种可靠的安全且稳健的代码生成机制。
Comments 17 pages, 4 figures
带有离散扩散的约束代码生成
机构 * University of Virginia(弗吉尼亚大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.CL、cs.PL
AI总结 本文提出了一种无需训练的神经符号推理框架CDC,通过将约束满足直接整合到反向去噪过程中,提升代码生成中功能正确性、安全性和语法的约束满足能力。
可扩展的打包布局用于向量长度无关的机器学习代码生成
专题命中 代码生成 :code generation(title,abstract)
AI总结 本文提出了一种基于向量长度感知的打包数据布局和编译器扩展的方法,用于在端到端的机器学习编译流水线中实现向量长度无关的代码生成,通过在MLIR/IREE中集成这些机制,扩展了tiling、融合和向量化操作以支持可扩展的向量长度,实验表明该方法在实际机器学习工作负载上生成的SVE代码性能优于现有的NEON代码生成,且在生产编译器环境中表现出色。
DevBench:一个现实的、面向开发者的代码生成模型基准测试
机构 * California Institute of Technology(加州理工学院) ; Microsoft(微软公司)
专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI、cs.LG
AI总结 DevBench通过真实开发者数据和生成模型合成,构建了包含六种编程语言和任务的1800个实例,评估大语言模型在代码补全任务中的表现,揭示模型在语法精度、语义推理和实用价值上的差异。
A-ProS:通过多模型反馈实现可靠的自主编程
机构 * Dept. of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) ; Dept. of Information Systems, University of Maryland, Baltimore County(马里兰大学巴尔的摩县信息学院) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县)
专题命中 代码生成 :code generation(abstract);program synthesis(abstract);分类 cs.SE、cs.AI
AI总结 本文提出A-ProS,一种通过多模型反馈框架实现自主编程的AI代理,结合生成器和调试器,通过多轮反馈提升代码生成的准确性与效率,实验表明其在解决编程问题上具有显著优势。
Comments Accepted for Publication in ACM Transactions on Software Engineering and Methodology (TOSEM)
编译时敏感字符串生成器的安全分析与优化
专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.PL
AI总结 本文提出一种通用安全内容编译框架,通过扩展内容语言并整合到通用编程语言中,减少安全与不安全惯用法的词法距离,提升运行性能并提供开发者面向的诊断信息。
Comments 10 pages, 9 figures
局部相干并行解码在扩散语言模型中
机构 * IBM Research - Zurich(IBM瑞士研究实验室)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出CoDiLA方法,通过引入小型辅助自回归模型来解决扩散语言模型在并行解码中的相干性问题,从而在代码生成任务中实现更高的准确性和速度。
Comments Accepted at ICML 2026
IsalProgram 编程语言
机构 * Department of Computer Languages and Computer Science(计算机语言与计算机科学系) ; University of Málaga(马拉加大学) ; ITIS Software(ITIS软件) ; Universidad de Málaga(马拉加大学)
专题命中 代码生成 :program synthesis(abstract);分类 cs.CL、cs.AI、cs.PL
AI总结 本文提出了一种新的类似汇编的编程语言IsalProgram,其核心特性包括:1) 作为形式语言理论中的正则语言,其程序可被有限自动机接受;2) 每个有限的指令字母表上的字符串都是语法有效的程序;3) 不显式使用内存地址或变量名。程序由固定指令集中的有限令牌序列组成,并在虚拟机上执行,其唯一数据结构是通过三个数据指针导航的循环双链表,控制流由两个代码指针控制。本文还讨论了IsalProgram作为神经程序合成目标语言的潜在优势,以及通过Levenshtein编辑距离进行程序空间度量探索的可能性,以及在此框架内分析可计算性和复杂性的方向。
DACA-GRPO:去噪感知的信用分配用于扩散语言模型中的强化学习
机构 * The Ohio State University(俄亥俄州立大学) ; Apple(苹果公司)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出DACA-GRPO,通过引入去噪进度评分和分层掩码似然,改进扩散语言模型中强化学习的信用分配,提升数学推理、代码生成等任务性能。
通过基于一致性的强化学习增强大语言模型的代码推理能力
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 代码生成 :code generation(abstract);分类 cs.LG、cs.PL
AI总结 本文提出CodeThinker框架,通过一致性驱动的强化学习方法提升大语言模型的代码推理能力,实验表明其在多个基准测试中表现优异,显著提升了代码生成和数学推理任务的准确性。
Comments Under review
CodeScaler: 通过奖励模型扩展代码大语言模型的训练和测试时间推理
机构 * LARK, HKUST(GZ)(LARK,香港科技大学(广州)) ; Kuaishou Technology(快手科技) ; UCL(伦敦大学学院) ; UZH(苏黎世联邦理工学院) ; NUS(国立新加坡大学)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出CodeScaler,一种通过奖励模型扩展代码生成模型的训练和测试时间推理的框架,通过精心编纂的偏好数据和语法感知的代码提取,实现了在四个编码基准上比基于执行的RL提升1.55分,在Qwen3-14B-Base上提升4.23分,并在无测试用例的情况下通过合成数据进一步提升14.64分,同时在推理时间减少10倍的延迟,且在代码、通用和推理领域均优于现有奖励模型。
通过模板填充解锁扩散语言模型的潜力
机构 * Seoul National University(首尔国立大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种针对扩散语言模型的模板填充方法,通过在生成响应空间中建立全局蓝图,提升了数学推理、代码生成和旅行规划等任务的性能,同时在多token生成中实现了生成质量与速度的平衡。
Comments ACL 2026 Main Conference - Long Paper, Oral Presentation
LaDi-RL:潜在扩散推理防止强化学习中的熵崩溃
机构 * UC San Diego(斯克利普斯海洋研究所) ; Apple(苹果公司)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LaDi-RL方法,通过潜在扩散模型生成潜在推理轨迹,解决强化学习中熵崩溃问题,提升代码生成和数学推理性能。
无需外部奖励的学习推理
机构 * UC Berkeley(加州大学伯克利分校) ; Yale University(耶鲁大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG
AI总结 本文提出Intuitor方法,通过内在反馈实现无需外部奖励的自主学习,实验表明其在数学基准和代码生成等任务中表现优异,为无监督学习提供了新途径。
Comments ICLR 2026
战略性过参数化以实现通用的低秩适应
机构 * School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS, Hangzhou 310024, China(1 基础物理与数学科学学院,杭州先进研究院,UCAS,杭州 310024,中国) ; School of Physical Sciences, University of Chinese Academy of Sciences, No. 19A Yuquan Road, Beijing 100049, China(2 物理科学学院,中国科学院大学,玉泉路19A号,北京 100049,中国) ; CAS Key Laboratory of Theoretical Physics, Institute of Theoretical Physics, Chinese Academy of Sciences, Beijing 100190, China(3 中国科学院理论物理重点实验室,理论物理研究所,中国科学院,北京 100190,中国) ; School of Physics and Key Laboratory of Quantum State Construction and Manipulation (Ministry of Education), Renmin University of China, Beijing 100872, China(4 物理学院和量子态构造与操控(教育部)重点实验室,中国人民大学,北京 100872,中国)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LoRA-Over框架,通过训练时丰富优化景观并推理时压缩,提升低秩适应的泛化能力,实验显示其在多个任务上优于传统LoRA。
面向目标的监督学习用于大语言模型微调
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Intuit AI Research(Intuit人工智能研究)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出目标条件监督学习(GCSL)框架,通过将反馈信号作为显式目标,利用监督学习生成高质量响应,改进了传统监督微调和直接偏好优化的局限性。
面向AI时代的可信模块仓库
机构 * Automation Department, Technical University of Cluj-Napoca, Romania(克卢日-纳波卡技术大学自动化系,罗马尼亚)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 本文提出HCMR框架,通过人类监督与自动化分析结合,确保模块的可信度,为AI辅助开发提供安全可预测的模块组装方法。
Comments v4: acknowledged AI use for grammar and readability, added IEEE copyright notice; v3: 13 pages, new subsection about strong typed languages forcing AI to create more reliable code; v2: 12 pages, improved references; v1: 11 pages, 3 figures, 2 tables, prepared for AQTR 2026
AutoVecCoder: 教授大语言模型生成显式向量化代码
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Xiamen University(厦门大学) ; Tsinghua University(清华大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL
AI总结 本文提出AutoVecCoder框架,通过VecPrompt和VecRL组件,使大语言模型能够自动进行显式向量化,从而在SimdBench的SSE和AVX子集上达到最先进的性能,超越传统自动向量化的方法。
EXG: 基于经验图的自演化代理
机构 * University of Technology Sydney(悉尼科技大学) ; The University of New South Wales(新南威尔士大学)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 本文提出EXG,一种基于经验图的自演化代理框架,通过结构化组织积累的成功与失败经验,提升代理在复杂任务中的解决质量和资源效率。
停止当推理收敛:用于推理模型的语义保留早退出
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Google Research(谷歌研究) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Politecnico di Milano(米兰理工学院)
专题命中 代码生成 :code generation(abstract);分类 cs.CL
AI总结 本文提出PUMA框架,通过识别推理层面的语义冗余信号,实现语义保留的早退出,从而在保持准确性和推理链完整性的同时减少token消耗。
Comments under review
VeriCache: 将损失性KV缓存转换为无损LLM推理
机构 * University of Chicago(芝加哥大学) ; Tensormesh Inc.(Tensormesh公司) ; Samsung Semiconductor(三星半导体) ; Microsoft Research(微软研究院)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 本文提出VeriCache框架,通过利用压缩的KV缓存生成token并验证其与完整KV缓存的一致性,实现了与完整KV缓存解码相同输出的同时保持高解码吞吐量。
NGM: 一种无需训练的插拔式内存模块用于大语言模型
机构 * Nanjing University(南京大学)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 本文提出NGM,一种无需训练的插拔式内存模块,通过因果n-gram编码器和余弦门控内存注入器,实现高效的知识检索,提升大语言模型在代码生成和知识密集型任务中的性能。
Comments Code is available at https://github.com/PioneerQyw/NGM