arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-01 至 2026-06-01 共收录 15 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 15 篇

2605.31478 2026-06-01 cs.SE cs.CL cs.SY eess.SY 81%

Knowledge Boundary Probing and Demand-Guided Intervention for LLM-Based Power System Code Generation

知识边界探测与需求引导干预:面向基于LLM的电力系统代码生成

Hui Wu, Xiaoyang Wang, Zhong Fan

机构 * Department of Engineering, University of Exeter(工程系,埃克塞特大学) Department of Computer Science, University of Exeter(计算机科学系,埃克塞特大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL

AI总结 针对LLM在电力系统代码生成中因API知识边界错误导致失败的问题,提出PowerCodeBench基准、L0-L3文档驱动探测和边界感知干预方法,显著提升模型准确率。

Comments 43 pages, 12 figures, includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30478 2026-06-01 cs.SE cs.CL 81%

Improving Small Language Models for Code Generation with Reinforcement Learning from Verification Feedback

通过验证反馈的强化学习改进用于代码生成的小型语言模型

Egor Skopin, Evgeny Kotelnikov

机构 * Vyatka State University(沃伊亚提卡州立大学) European University at St. Petersburg(圣彼得堡欧洲大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL

AI总结 本研究通过基于验证奖励的强化学习(RLVR)结合LoRA微调,在MBPP基准上对小型语言模型(Qwen3-0.6B和Llama3.2-1B)进行Python代码生成实验,发现奖励设计对功能正确性和行为诊断有显著影响,并提出组合奖励可稳定权衡正确性与风格约束。

Comments Accepted for AINL-2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30394 2026-06-01 cs.SE cs.AI 81%

CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models

CodeGolf Bench:评估大型语言模型简洁代码生成能力的多语言基准

Vedant Padwal

机构 * Independent(独立)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 提出CodeGolf Bench基准,基于代码高尔夫竞赛,在60种编程语言中评估LLM生成简洁高效代码的能力,实验表明推理模型显著优于非推理模型。

Comments 12 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10778 2026-06-01 cs.CR 78%

GoodVibe: Security-by-Vibe for LLM-Based Code Generation

GoodVibe:基于神经元的LLM代码生成安全增强方法

Maximilian Thang, Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Jona te Lintelo, Stjepan Picek, Ahmad-Reza Sadeghi

专题命中 代码生成 :code generation(title,abstract)

AI总结 提出GoodVibe框架,通过梯度归因识别安全相关神经元并进行选择性微调,在保持模型通用性的同时显著提升代码生成安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11683 2026-06-01 cs.LG cs.AI cs.CL 67%

Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models

边界引导策略优化:面向扩散大语言模型的内存高效强化学习

Nianyi Lin, Jiajie Zhang, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对扩散大语言模型中似然函数难以处理导致强化学习内存开销大的问题,提出边界引导策略优化(BGPO),通过构造满足线性和等价性的下界实现内存高效训练,在数学求解、代码生成和规划任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29146 2026-06-01 cs.CL cs.AI 62%

SafeRx-Agent: A Knowledge-Grounded Multi-Agent Framework for Safe and Explainable Medication Recommendation

SafeRx-Agent: 基于知识的多智能体框架用于安全且可解释的药物推荐

Xinyu Wang, Hanwei Wu, Zhenghan Tai, Sicheng Lyu, Qincheng Lu, Ziyu Zhao, Jijun Chi, Jingrui Tian, Xiao-Wen Chang, Ziyang Song

机构 * McGill University(麦吉尔大学) McMaster University(麦马斯特大学) University of Toronto(多伦多大学) Ohio University(俄亥俄大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出SafeRx-Agent,一种基于知识的多智能体框架,通过患者上下文、外部临床知识和安全验证来推荐可追溯的药物集合,在MIMIC-III和MIMIC-IV数据集上提高了细粒度药物预测准确性,同时控制了药物相互作用、禁忌症和药物集合大小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08721 2026-06-01 cs.AR cs.LG cs.SE 62%

KernelCraft: Benchmarking for Agentic Close-to-Metal Kernel Generation on Emerging Hardware

KernelCraft: 面向新兴硬件的近底层内核生成的智能体基准测试

Jiayi Nie, Haoran Wu, Yao Lai, Zeyu Cao, Cheng Zhang, Binglei Lou, Erwei Wang, Jianyi Cheng, Timothy M. Jones, Robert Mullins, Rika Antonova, Yiren Zhao

机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, United Kingdom(计算机科学与技术系,剑桥大学,剑桥,英国) Department of Electrical and Electronic Engineering, Imperial College London, London, United Kingdom(电气与电子工程系,伦敦帝国理工学院,伦敦,英国) School of Informatics, University of Edinburgh, Edinburgh, United Kingdom(信息学院,爱丁堡大学,爱丁堡,英国)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 提出KernelCraft基准,通过函数调用和反馈驱动的工作流评估LLM智能体为新兴加速器生成和优化底层内核的能力,在多个任务上验证其能快速生成正确且高效的内核。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15859 2026-06-01 cs.CL cs.AI 62%

InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training

InfiMed-ORBIT: 通过基于评分标准的增量训练使大语言模型对齐开放复杂任务

Pengkai Wang, Pengwei Liu, Qi Zuo, Zhijie Sang, Congkai Xie, Hongxia Yang

机构 * Department of Computing, The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学计算机系) Department of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出ORBIT框架,利用动态生成的病例条件评分标准指导增量强化学习,仅用2k样本将Qwen3-4B-Instruct在HealthBench-Hard上的得分从7.0提升至27.5,达到同规模开源模型最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19463 2026-06-01 cs.SE cs.AI 62%

Understanding the Fundamental Design Decisions of Retrieval-Augmented Generation Systems

理解检索增强生成系统的基本设计决策

Shengming Zhao, Yuchen Shao, Yuheng Huang, Jiayang Song, Zhijie Wang, Chengcheng Wan, Lei Ma

机构 * Fudan University(复旦大学) East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院) The University of Tokyo(东京大学) Macau University of Science and Technology(澳门科学理工学院) Concordia University(Concordia大学) University of Alberta(阿尔伯塔大学) The University of Tokyo, Japan(日本东京大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文通过系统实验,研究了RAG部署中的三个关键决策(是否部署、检索量、知识集成方式),揭示了任务和模型依赖的优化策略,为实践者提供基于证据的指导。

Journal ref ACM Transactions on Software Engineering and Methodology (TOSEM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31268 2026-06-01 cs.CL 57%

Mellum2 Technical Report

Mellum2 技术报告

Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov, Nikita Pavlichenko

机构 * JetBrains Constructor University(Constructor大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文介绍 Mellum 2,一个12B参数(每token激活2.5B)的混合专家语言模型,专攻软件工程,通过架构创新和训练优化在代码生成、数学推理等基准上达到4B-14B开源模型的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31064 2026-06-01 cs.IR cs.AI 57%

Fighting Numerical Hallucinations via Data-centric Compilation for Online Financial QA

通过数据为中心的编译对抗在线金融问答中的数值幻觉

Hao Chen, Xing Tang, Qirui Liu, Weijie Shi, Shiwei Li, Fuyuan Lyu, Weihong Luo, Xiku Du, Xiuqiang He

机构 * Shenzhen Technology University(深圳科技大学) FiT, Tencent(腾讯金融科技部) South China University of Technology(华南理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Huazhong University of Science and Technology(华中科技大学) McGill University(麦吉尔大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 提出数据为中心推理编译器(DCRC),通过对抗数据构建、多阶段训练和编译执行推理流程,解决在线金融问答中检索增强生成面临的噪声敏感、计算脆弱和可审计性危机,实现可靠的数值推理。

Comments Accepted by KDD 2026 ADS track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30712 2026-06-01 cs.CL 57%

ExpGraph: Model-Agnostic Experience Learning with Graph-Structured Memory for LLM Agents

ExpGraph: 面向LLM智能体的模型无关经验学习与图结构记忆

Tao Feng, Chongrui Ye, Tianyang Luo, Jingjun Xu, Xueqiang Xu, Haozhen Zhang, Zhigang Hua, Yan Xie, Shuang Yang, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学) Meta Monetization AI(Meta 营收人工智能)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出ExpGraph框架,通过图结构记忆和强化学习实现冻结LLM执行器的外部经验复用,在问答、数学推理、代码生成和多步智能体任务上显著提升性能并减少交互步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30680 2026-06-01 cs.AI cs.MA 57%

Healthcare Mechanisms from Policy-as-Code Search under Strategic Provider Response

战略提供者响应下的策略即代码搜索中的医疗机制

Zihan Wang, Xiang Xu, Hongyuan Zha, Wenhao Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tongji University(同济大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 将医疗机制设计转化为语言模型的程序合成,通过多智能体模拟器Medi-Sim评估策略提供者响应下的均衡,并利用LLM引导的进化代码搜索合成可检查的混合目标程序。

Comments 32 pages, 18 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30358 2026-06-01 cs.LG quant-ph 57%

QASM-Eval: A Dataset to Train and Evaluate LLMs on OpenQASM-3 Beyond Quantum Circuits

QASM-Eval:用于训练和评估LLM在超越量子电路的OpenQASM-3上的数据集

Zhenxiao Fu, Lei Jiang, Fan Chen

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 针对LLM在OpenQASM-3硬件级编程上的训练与评估空白,构建了包含专家验证测试集和训练集的数据集,覆盖经典逻辑、时序调度、脉冲控制等,并通过扩展验证器自动验证,实验表明微调后LLM性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30019 2026-06-01 cs.AR 50%

elasticAI.explorer: Towards a Unified End-to-End Framework for Hardware-Aware Neural Architecture Search

elasticAI.explorer:面向硬件感知神经架构搜索的统一端到端框架

Natalie Maman, Florian Hettstedt, Andreas Erbslöh, Gregor Schiele

专题命中 代码生成 :code generation(abstract)

AI总结 提出基于Optuna的弹性AI探索器框架,通过YAML搜索空间规范、硬件代码生成和Docker交叉编译,实现硬件在环的神经架构搜索。

Comments 6 pages, 2 figures, IEEE CODASSCA 2026 (submitted)

详情

展开后加载摘要…

URL PDF HTML 收藏