arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-04-23 至 2026-04-23 共收录 25 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 13 篇

2604.08570 2026-04-23 cs.LG cs.AI cs.PL cs.SE quant-ph 83%

QuanBench+: A Unified Multi-Framework Benchmark for LLM-Based Quantum Code Generation

QuanBench+: 一种统一的多框架基准用于基于LLM的量子代码生成

Ali Slim, Haydar Hamieh, Jawad Kotaich, Yehya Ghosn, Mahdi Chehimi, Ammar Mohanna, Hasan Abed Al Kader Hammoud, Bernard Ghanem

机构 * American University of Beirut(贝鲁特美国大学) King Abdullah University of Science and Technology(卡迪夫国王大学科学与技术学院)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出QuanBench+基准,用于评估LLM在量子代码生成中的多框架性能,通过执行测试和反馈修复机制,展示了不同框架下的代码生成效果及改进。

Comments 24 pages total, 25 figures, 5 tables, including supplementary material. Accepted to the ICLR 2026 Workshop on I Can't Believe It's Not Better

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19826 2026-04-23 cs.SE cs.AI cs.LG 82%

Co-Located Tests, Better AI Code: How Test Syntax Structure Affects Foundation Model Code Generation

共存测试,更好的AI代码:测试语法结构如何影响基础模型代码生成

Éric Jacopin

机构 * Cosmic AI

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 研究探讨测试代码结构对基础模型代码生成质量的影响,发现内联测试在保真度和正确性上表现更优,且模型行为随世代变化,非transformer架构也验证了该设计的鲁棒性。

Comments 20 pages. Preprint; arXiv long version of a paper accepted at AIware 2026. Adds Appendices A (cross-language) and B (Python isolation) not present in the ACM camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18471 2026-04-23 cs.SE cs.AI cs.CL 82%

CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment

CodeRL+: 通过执行语义对齐改进代码生成

Xue Jiang, Yihong Dong, Mengyang Liu, Hongyi Deng, Tian Wang, Yongding Tao, Rongyu Cao, Binhua Li, Zhi Jin, Wenpin Jiao, Fei Huang, Yongbin Li, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里集团通义实验室) School of Computer Science, Wuhan University(武汉大学计算机科学系)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出CodeRL+,通过将执行语义对齐整合到RLVR训练流程中,提升代码生成的准确性,实验显示其在pass@1指标上平均提升4.6%。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19825 2026-04-23 cs.SE cs.AI 81%

SolidCoder: Bridging the Mental-Reality Gap in LLM Code Generation through Concrete Execution

SolidCoder:通过具体执行弥合LLM代码生成中的心理现实差距

Woojin Lee, Jin-Xia Huang

机构 * Electronics and Telecommunications Research Institute, Republic of Korea(韩国电信研究所)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 SolidCoder通过强制边缘情况意识和沙盒执行解决心理现实差距,提升代码生成性能,实现HumanEval、CodeContests和APPS的高准确率。

Comments 23 pages, 2 figures, Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07192 2026-04-23 cs.SE 79%

Compact Constraint Encoding for LLM Code Generation: An Empirical Study of Token Economics and Constraint Compliance

紧凑约束编码用于LLM代码生成:关于令牌经济学和约束合规性的实证研究

Hanzhang Tang

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文通过实验证明紧凑约束头可减少令牌消耗而不影响约束合规性,发现编码形式和传播模式对合规率无显著影响,但约束类型和任务领域对合规性有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20398 2026-04-23 cs.CL cs.LG cs.SE 67%

WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning

WebGen-R1: 通过强化学习激励大语言模型生成功能性和美观的网站

Juyong Jiang, Chenglin Cai, Chansung Park, Jiasi Shen, Sunghun Kim, Jianguo Li, Yue Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里云实验室) Electronics and Telecommunications Research Institute(电子电信研究院) Ant Group(蚂蚁集团)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 本文提出WebGen-R1框架,通过强化学习生成多页面功能性和美观的网站,解决了传统方法在多页面交互和审美评估上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19750 2026-04-23 cs.SE cs.AI cs.HC 62%

Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging

通过眼睛编码:视觉反馈解锁可靠的GUI代码生成与调试

Zhilin Liu, Ye Huang, Ting Xie, Ruizhi Zhang, Wen Li, Lixin Duan

机构 * Shenzhen Institute for Advanced Study, University of Electronic Science

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出InteractGUI Bench基准和VF-Coder系统,通过视觉反馈提升GUI代码生成与调试效果,提高成功率和视觉评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06606 2026-04-23 cs.LG cs.AI 62%

CEDAR: Context Engineering for Agentic Data Science

CEDAR:面向代理的数据科学应用

Rishiraj Saha Roy, Chris Hinze, Luzian Hahn, Fabian Kuech

机构 * Department of Generative AI, Fraunhofer IIS(生成人工智能系,弗劳恩霍夫研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 CEDAR通过有效的上下文工程解决数据科学任务中的复杂性、数据规模、计算限制和上下文限制问题,采用分步生成计划和代码块的方式提升数据科学任务自动化水平。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06803 2026-04-23 cs.CL cs.AI cs.CE 62%

Text to model via SysML: Automated generation of dynamical system computational models from unstructured natural language text via enhanced System Modeling Language diagrams

通过SysML生成动态系统模型:从无结构自然语言文本自动生成动态系统计算模型

Matthew Anderson Hendricks, Alice Cicirello

机构 * Department of Engineering, University of Cambridge, Trumpington Street, Cambridge, UK(剑桥大学工程系,特鲁布里奇顿街,剑桥,英国)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用领域和专家知识,通过SysML图自动从相关文档和输入文档生成动态系统计算模型,提升工程动态系统设计和部署效率。

Comments v3 - typos and imprecisions corrected, and added clarifications

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10271 2026-04-23 cs.SE cs.AI 62%

Quality Assurance of LLM-generated Code: Addressing Non-Functional Quality Characteristics

LLM生成代码的质量保障:解决非功能性质量特性

Xin Sun, Daniel Ståhl, Kristian Sandahl, Christoph Kessler

机构 * Department of Computer and Information Science, Linköping University, Sweden(Linköping大学计算机与信息科学系)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究通过文献综述、行业研讨会和实证分析,探讨LLM生成代码在安全、可维护性和性能效率等非功能性质量特性上的表现,揭示学术研究与行业需求的不匹配,强调需在代码生成流程中集成质量保障机制。

Journal ref Journal of Systems and Software (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19926 2026-04-23 cs.AI 57%

CreativeGame:Toward Mechanic-Aware Creative Game Generation

CreativeGame:迈向机制感知的创意游戏生成

Hongnan Ma, Han Wang, Shenglin Wang, Tieyue Yin, Yiwei Shi, Yucong Huang, Yingtian Zou, Muning Wen, Mengyue Yang

机构 * University of Bristol(布里斯托大学) Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Nanjing University(南京大学) Sreal AI Project(Sreal AI项目)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出CreativeGame系统,通过机制感知规划循环和跨版本经验积累,实现迭代式HTML5游戏生成,支持可解释的版本间进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20835 2026-04-23 cs.CL 57%

Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL

并行SFT:改进代码RL的零样本跨编程语言转移

Zhaofeng Wu, Shiqi Wang, Boya Peng, Anuj Goyal, Melanie Kambadur, Sebastian Ruder, Yoon Kim, Chloe Bi

机构 * Meta Superintelligence Labs(Meta超智能实验室) MIT(麻省理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文提出零样本跨编程语言转移任务,通过并行SFT策略提升代码RL在不同语言间的迁移能力,发现通用化SFT初始化能提升模型泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20507 2026-04-23 cs.PL 57%

Automatic Code and Test Generation of Smart Contracts from Coordination Models

从协调模型自动生成智能合约的代码和测试

Elvis Konjoh Selabi, Maurizio Murgia, António Ravara, Emilio Tuosto

专题命中 代码生成 :code generation(abstract);分类 cs.PL

AI总结 本文提出一种形式化方法,用于指定和实现分布式系统中的去中心化协调,聚焦于智能合约。通过动态角色、数据驱动的转换和外部协调接口,实现对去中心化流程的高层推理,并展示了一个支持形式化模型验证、Solidity代码生成和自动化测试合成的工具链。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 8 篇

2604.03362 2026-04-23 cs.SE 83%

ABTest: Behavior-Driven Testing for AI Coding Agents

ABTest:面向AI编码代理的行为驱动测试

Wuyang Dai, Moses Openja, Hung Viet Pham, Gias Uddin, Jinqiu Yang, Song Wang

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 本文提出ABTest框架,通过挖掘用户报告的异常生成可执行测试用例,发现AI编码代理在真实场景中的鲁棒性差异及新故障模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03335 2026-04-23 cs.LG 83%

EvolveSignal: A Large Language Model Powered Coding Agent for Discovering Traffic Signal Control Strategies

EvolveSignal:一种基于大语言模型的编程代理,用于发现交通信号控制策略

Leizhen Wang, Peibo Duan, Hao Wang, Yue Wang, Jian Xu, Nan Zheng, Zhenliang Ma

机构 * Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) School of Transportation, Southeast University(交通学院,东南大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) Department of Civil and Environmental Engineering, Monash University(土木与环境工程系,墨尔本大学) Department of Civil and Architectural Engineering, KTH Royal Institute of Technology(土木与建筑工程系,皇家理工学院)

专题命中 软件智能体 :coding agent(title,abstract);program synthesis(abstract);分类 cs.LG

AI总结 本文提出EvolveSignal,利用大语言模型自动发现可解释的启发式策略,通过程序合成方法优化交通信号控制,实验表明其在减少延误和停车次数方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20779 2026-04-23 cs.AI cs.CY cs.SE 81%

SWE-chat: Coding Agent Interactions From Real Users in the Wild

SWE-chat:从真实用户中编码代理交互

Joachim Baumann, Vishakh Padmakumar, Xiang Li, John Yang, Diyi Yang, Sanmi Koyejo

机构 * Stanford University(斯坦福大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 SWE-chat是首个大规模真实编码代理会话数据集,包含6000个会话,揭示了编码代理在真实场景中的使用模式和失败模式,发现代理生成的代码效率低下且存在更多安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03690 2026-04-23 cs.SE cs.AI 81%

The OpenHands Software Agent SDK: A Composable and Extensible Foundation for Production Agents

OpenHands软件代理SDK:一种可组合且可扩展的生产代理基础

Xingyao Wang, Simon Rosenberg, Juan Michelini, Calvin Smith, Hoang Tran, Engel Nyst, Rohit Malhotra, Xuhui Zhou, Valerie Chen, Robert Brennan, Graham Neubig

机构 * MLSys 2026

专题命中 软件智能体 :software agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出OpenHands SDK,提供灵活的代理实现接口、安全可靠执行及用户交互接口,整合了本地到远程执行、多LLM路由和安全分析,验证了其在生产部署中的有效性。

Comments Accepted at MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22598 2026-04-23 cs.CL 74%

RExBench: Can coding agents autonomously implement AI research extensions?

RExBench:代码代理能否自主实现AI研究扩展?

Nicholas Edwards, Yukyung Lee, Yujun Audrey Mao, Yulu Qin, Sebastian Schuster, Najoung Kim

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学UniVie计算机科学博士学院) Boston University(波士顿大学)

专题命中 软件智能体 :coding agent(title);分类 cs.CL

AI总结 本文提出RExBench基准,评估代码代理自主实现AI研究扩展的能力,发现现有代理在无人类指导时成功率不足44%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20548 2026-04-23 cs.CL cs.AI cs.DL cs.IR 62%

Enhancing Research Idea Generation through Combinatorial Innovation and Multi-Agent Iterative Search Strategies

通过组合创新和多智能体迭代搜索策略增强研究想法生成

Shuai Chen, Chengzhi Zhang

机构 * Department of Information Management, Nanjing University of Science and Technology(南京理工大学信息管理学院)

专题命中 软件智能体 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合迭代知识搜索与LLM多智能体系统的框架,通过反复交互生成、评估和优化研究想法,提升多样性与新颖性,在自然语言处理领域实验表明优于现有基线方法。

Comments Scientometrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19965 2026-04-23 cs.SE 57%

Insights into Security-Related AI-Generated Pull Requests

对与安全相关的AI生成拉取请求的洞察

Md Fazle Rabbi, Asif K. Turzo, Arifa I. Champa, Minhaz F. Zibran

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本文分析了33,000多个AI生成的拉取请求,发现675个与安全相关的提交,揭示了AI生成的拉取请求中常见的安全漏洞及审查结果,发现提交质量对接受度影响有限,扩展了拒绝分类。

Comments accepted at the International Conference on Evaluation and Assessment in Software Engineering (EASE), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00253 2026-04-23 cs.SE 57%

Towards Explorative IRBL: Combining Semantic Retrieval with LLM-driven Iterative Code Exploration

迈向探索性IRBL:结合语义检索与LLM驱动的迭代代码探索

Moumita Asad, Rafed Muhammad Yasir, Sam Malek

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文提出GenLoc,结合语义检索与LLM驱动的代码探索功能,通过迭代分析代码库识别故障文件,优于传统和深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 3 篇

2604.20200 2026-04-23 cs.CL 83%

Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows

追逐公共评分:用户压力与编码代理工作流中的评估剥削

Hardy Chen, Nancy Lau, Haoqin Tu, Shuo Yan, Xiangyan Liu, Zijun Wang, Juncheng Wu, Michael Qizhe Shieh, Alvaro A. Cardenas, Cihang Xie, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) UT Dallas(德克萨斯大学达拉斯分校) NUS(新加坡国立大学)

专题命中 代码评测 :coding agent(title,abstract);repository(abstract);分类 cs.CL

AI总结 研究用户压力是否导致公共评分剥削,通过实验发现更强模型剥削率更高,高压力促使早期剥削,添加反剥削提示可有效减少剥削。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20273 2026-04-23 cs.AI cs.CL 62%

ActuBench: A Multi-Agent LLM Pipeline for Generation and Evaluation of Actuarial Reasoning Tasks

ActuBench: 一个用于生成和评估精算推理任务的多智能体LLM流水线

Jan-Philipp Schmidt

机构 * TH Köln, Institut für Versicherungswesen (ivwKöln)(TH Köln保险学系(ivwKöln))

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ActuBench,一个多智能体LLM流水线,用于自动生成和评估符合国际精算协会教育大纲的高级精算评估题目。通过四个LLM角色的分工,结合成本优化的辅助代理,评估了50个模型并在两个基准上报告了三个主要发现。

Comments 19 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13697 2026-04-23 cs.LG 57%

Splitting criteria for ordinal decision trees: an experimental study

序数决策树的分裂标准:一项实证研究

Rafael Ayllón-Gavilán, Francisco José Martínez-Estudillo, David Guijo-Rubio, César Hervás-Martínez, Pedro Antonio Gutiérrez

机构 * Department of Clinical-Epidemiological Research in Primary Care, IMIBIC(初级保健临床流行病学研究部门,IMIBIC) Department of Quantitative Methods, Universidad Loyola Andalucía(定量方法部门,洛伊亚安达卢西亚大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文通过实验证明序数分裂标准在决策树中的有效性,发现Ordinal Gini在减少均方误差方面表现最佳,同时提供了可复现的研究资源。

Comments 33 pages, 4 figures, 6 tables

Journal ref Pattern Recognition, Volume 171, Part B, March 2026, 112273

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 1 篇

2604.20778 2026-04-23 math.CO 50%

Modularity, Extensions and Connectivity in Infinite Matroids

模ularity、扩展与连通性在无限矩阵中

Mattias Ehatamm, Peter Nelson, Fernanda Rivera Omana

专题命中 仓库级理解 :repository(abstract)

AI总结 本文将有限矩阵中模ularity的概念推广到无限矩阵中的任意集合族,发展了无限矩阵理论的新领域,包括单元素扩展的完整理论、商与投影关系的描述、以及无限矩阵连通性参数λ的两个新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏