arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-04-30 至 2026-04-30 共收录 25 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 9 篇

2604.26923 2026-04-30 cs.SE cs.CL 81%

ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation

ClassEval-Pro:一个跨领域用于类级别代码生成的基准测试

Yeheng Chen, Chaoxiang Xie, Yuling Shi, Wenhao Zeng, Yongpan Wang, Hongyu Zhang, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Hohai University(淮海大学) Chongqing University(重庆大学)

专题命中 代码生成 :code generation(title);repository(abstract);分类 cs.SE、cs.CL

AI总结 本文提出ClassEval-Pro,一个包含300个跨11个领域的类级别任务的基准测试,通过自动化三阶段流程构建,评估五种前沿LLM在五种生成策略下的表现,揭示了逻辑错误和依赖错误是核心瓶颈。

Comments Accepted to AIware 2026. Code and data available at https://github.com/ian-Kappa/ClassEval-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26615 2026-04-30 cs.SE cs.AI 76%

TDD Governance for Multi-Agent Code Generation via Prompt Engineering

通过提示工程实现多智能体代码生成的TDD治理

Tarlan Hasanli, Shahbaz Siddeeq, Bishwash Khanal, Pyry Kotilainen, Tommi Mikkonen, Pekka Abrahamsson

机构 * University of Jyväskylä(于韦斯屈莱大学) Tampere University(塔尔基尔大学)

专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI

AI总结 本文提出一种AI原生的TDD框架,通过结构化提示和工作流程治理机制将经典TDD原则形式化,提升LLM辅助开发的稳定性与可重复性。

Comments 5 pages. Submitted to the 1st International Workshop on Empirical Prompt Engineering for Software Engineering (PROMPT-SE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18165 2026-04-30 cs.AI cs.CL cs.LG cs.SE 70%

Saber: An Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model

Saber: 一种高效的采样方法,具有自适应加速和回溯增强的重新遮蔽,用于扩散语言模型

Yihong Dong, Zhaoyu Ma, Xue Jiang, Zhiyuan Fan, Jiaru Qian, Yongmin Li, Jianha Xiao, Zhi Jin, Rongyu Cao, Binhua Li, Fei Huang, Yongbin Li, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出Saber算法,通过动态调整每步未遮蔽令牌数量和回溯机制提升代码生成的推理速度和输出质量,实验显示在多个基准上Pass@1准确率提升1.9%,推理速度提升251.4%。

Comments Accepted to ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26951 2026-04-30 cs.CL cs.AI cs.LG 67%

Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models

将TIDE转向:用于扩散大语言模型的跨架构蒸馏

Gongbo Zhang, Wen Wang, Ye Tian, Li Yuan

机构 * Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TIDE框架,通过跨架构蒸馏提升扩散大语言模型性能,采用三个模块解决不同架构间的知识转移问题,在八个基准测试中平均提升1.53分,尤其在代码生成任务中表现突出。

Comments 15 pages, 3 figures. Code: https://github.com/PKU-YuanGroup/TIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25960 2026-04-30 cs.SE cs.LG cs.PL 67%

Large Language Models for Multilingual Code Intelligence: A Survey

大型语言模型用于多语言代码智能:综述

Chao Jiang, Dugang Liu, Cheng Wen, Zhiwu Xu, Hua Zheng, Muhammad Sadiq, Jawwad Ahmed Shamsi, Shengchao Qin, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) Guangzhou Institute of Technology, Xidian University, China(广州理工大学,西安电子科技大学,中国) Guangzhou University of Software, China(广州软件大学,中国) Shenzhen University of Information Technology(深圳信息大学) National University of Computer and Emerging Sciences Karachi, Pakistan(巴基斯坦卡拉奇国家计算机与新兴科学大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG、cs.PL

AI总结 本文综述了多语言代码生成与翻译的关键任务,探讨了现有方法、基准和评估指标,指出多语言代码智能在现实系统中的重要性及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26211 2026-04-30 cs.AI cs.LG 62%

OMEGA: Optimizing Machine Learning by Evaluating Generated Algorithms

OMEGA:通过评估生成算法优化机器学习

Jeremy Nixon, Annika Singh

机构 * Infinity Artificial Intelligence Institute(无限人工智能研究所) Stanford University(斯坦福大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 OMEGA框架结合结构化元提示工程与可执行代码生成,创建新型ML分类器,在20个基准数据集上超越scikit-learn基线。

Comments ICLR 2026: Workshop on AI with Recursive Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06160 2026-04-30 cs.AI 57%

Student Guides Teacher: Weak-to-Strong Inference via Spectral Orthogonal Exploration

学生指导教师:通过频谱正交探索实现弱到强推断

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出Spectral Orthogonal Exploration框架,通过正交探针引入语义异质性推理信号,提升数学推理任务的准确率和采样效率。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26397 2026-04-30 cs.IT math.IT 50%

Existence and Constructions of Strict Function-Correcting Codes with Data Protection

严格函数纠错码与数据保护的存在性与构造

Charul Rajput, B. Sundar Rajan, Ragnar Freij-Hollanti, Camilla Hollanti

专题命中 代码生成 :code generation(abstract)

AI总结 本文研究严格函数纠错码与数据保护的存在性和构造,通过三种贡献:基于α-距离图框架建立存在条件,利用Simonis结果开发反向构造,以及从窄感BCH码中独立构造严格函数纠错码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26153 2026-04-30 cs.AR cs.IR 50%

RAG-Enhanced Kernel-Based Heuristic Synthesis (RKHS): A Structured Methodology Using Large Language Models for Hardware Design

基于检索增强的核启发式合成(RKHS):利用大语言模型的结构化方法用于硬件设计

Shiva Ahir, Alex Doboli

专题命中 代码生成 :code generation(abstract)

AI总结 本文提出RKHS方法,结合检索增强生成、紧凑核启发式模板和LLM驱动的反馈循环,用于硬件设计中的启发式优化,实验证明其在降低延迟的列表调度中有效。

Comments Presented at the NSF Workshop on Agents for Chip Design Automation, UCLA

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2604.25067 2026-04-30 cs.MA cs.AI cs.LG 81%

Frontier Coding Agents Can Now Implement an AlphaZero Self-Play Machine Learning Pipeline For Connect Four That Performs Comparably to an External Solver

前沿编码代理如今可以实现一个AlphaZero自博弈机器学习流水线用于连接四游戏,其性能可与外部求解器相媲美

Joshua Sherwood, Ben Aybar, Benjamin Kaplan

机构 * Department of Computer Science(计算机科学系) University of Chicago(芝加哥大学) Independent Researcher(独立研究员)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基准测试,评估前沿编码代理自主实现AlphaZero式机器学习流水线的能力,通过简洁任务描述而非完整前序工作参考,评估连接四游戏AI性能,发现Claude Opus 4.7在七次试验中胜过Pons求解器,其他代理表现欠佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26278 2026-04-30 cs.NI 78%

SWE-Bench 5G: Benchmarking AI Coding Agents on Telecom Network Engineering Tasks

SWE-Bench 5G:基于电信网络工程任务的AI编码代理基准测试

Jiao Chen, Jianhua Tang, Xiaotong Yang, Zuohong Lv

专题命中 软件智能体 :coding agent(title,abstract)

AI总结 本文提出SWE-Bench 5G基准,评估AI编码代理在5G核心网络软件中解决真实世界bug的能力,通过Docker环境和双测试策略验证领域知识对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26892 2026-04-30 cs.SE 70%

Hot Fixing in the Wild

野火修复

Carol Hanna, Karine Even-Mendoza, W. B. Langdon, Mar Zamorano López, Justyna Petke, Federica Sarro

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 研究分析了61000余个仓库中的人工和AI代理生成的热修复,发现其具有紧迫性特征,揭示了人类与AI在修复行为上的差异,为实际应用中的热修复协作提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2604.26674 2026-04-30 cs.SE 79%

Reproducible Automated Program Repair Is Hard -- Experiences With the Defects4J Dataset

可重复的自动程序修复是困难的——Defects4J数据集的经验

Adam Krafczyk, Klaus Schmid

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE

AI总结 本文探讨了Defects4J数据集在自动程序修复中的挑战,发现21.6%的缺陷无法重复,7.1%的测试套件不足,提出了更严格的评估框架以解决测试套件问题。

Comments To be published in Proceedings of the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE'26)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2604.26523 2026-04-30 cs.SE 57%

RepoDoc: A Knowledge Graph-Based Framework to Automatic Documentation Generation and Incremental Updates

RepoDoc: 基于知识图谱的自动文档生成与增量更新框架

Dong Xu, Mingwei Liu, Xiwen Wang, Jianfeng Zhong, Zibin Zheng

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 RepoDoc通过构建仓库知识图谱,实现代码文档的自动化生成与增量更新,提升文档覆盖率和完整性,同时提高生成效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 6 篇

2604.26275 2026-04-30 cs.SE 70%

Agentic AI in the Software Development Lifecycle: Architecture, Empirical Evidence, and the Reshaping of Software Engineering

软件开发生命周期中的代理AI:架构、实证证据与软件工程的重塑

Happy Bhati

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE

AI总结 本文探讨代理AI在软件开发生命周期中的应用,提出六层参考架构,分析代理SDLC与传统SDLC的差异,并通过实证数据展示其在性能、生产力和劳动力市场的影响。

Comments 9 pages, 5 figures, 2 tables, survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26243 2026-04-30 cs.CL cs.AI 62%

StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual Recall

StratMem-Bench:评估虚拟角色对话中的战略记忆使用超越事实回忆

Yerong Wu, Tianxing Wu, Minghao Zhu, Hangyu Sha, Haofen Wang

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Key Laboratory of New Generation Artificial Intelligence Technology and its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室(东南大学),中华人民共和国教育部,中国) College of Design and Innovation, Tongji University, China(同济大学设计与创新学院,中国)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 StratMem-Bench旨在评估虚拟角色对话中战略记忆的使用,通过异构记忆池测试角色在不同记忆类型间的决策能力,提出多种评估指标以衡量记忆整合与利用效果。

Comments 20 pages, accepted by ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25982 2026-04-30 cs.LG cs.AI cs.CY cs.ET 62%

Open Problems in Frontier AI Risk Management

前沿人工智能风险管理中的开放问题

Marta Ziosi, Miro Plueckebaum, Stephen Casper, Henry Papadatos, Ze Shen Chin, Peter Slattery, James Gealy, Tim G. J. Rudner, Brian Tse, Ariel Gil, Patricia Paskov, Maximilian Negele, Rokas Gipiškis, Nada Madkour, Vera Lummis, Rupal Jain, Luise Eder, Kristina Fort, Malou C. van Draanen Glismann, Inès Belhadj, Amin Oueslati, Anna K. Wisakanto, Richard Mallah, Koen Holtman, Ranj Zuhdi, Daniel S. Schiff, Jessica Newman, Malcolm Murray, Robert Trager

机构 * Oxford Martin AI Governance Initiative, University of Oxford(牛津大学人工智能治理倡议) MIT Computer Science and Artificial Intelligence Laboratory, MIT(麻省理工学院计算机科学与人工智能实验室) MIT Future Tech(麻省理工学院未来技术) Stanford University(斯坦福大学) Governance and Responsible AI Lab, Purdue University(普渡大学治理与负责任的人工智能实验室) University of Toronto(多伦多大学) Mercatus Center, George Mason University(乔治·马歇尔大学麦卡锡中心) Vilnius University(维尔纽斯大学) Vijil SaferAI AI Standards Lab(人工智能标准实验室) The Future Society(未来社会) Concordia AI(康科德人工智能) Pivotal Research Center for AI Risk Management & Alignment(人工智能风险管理和对齐中心) UC Berkeley Center for Long-Term Cybersecurity(伯克利大学长期网络安全中心) Independent(独立)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨前沿人工智能风险管理中的核心问题,通过文献综述识别未解决的挑战,并分类问题类型以指导未来研究与治理。

Comments 81 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21444 2026-04-30 cs.CV 50%

Benchmarking Deep Learning and Vision Foundation Models for Atypical vs. Normal Mitosis Classification with Cross-Dataset Evaluation

基于跨数据集评估的深度学习与视觉基础模型在异常有丝分裂分类中的基准测试

Sweta Banerjee, Viktoria Weiss, Taryn A. Donovan, Rutger H. J. Fick, Thomas Conrad, Jonas Ammeling, Nils Porsche, Robert Klopfleisch, Christopher Kaltenecker, Katharina Breininger, Marc Aubreville, Christof A. Bertram

机构 * Flensburg University of Applied Sciences(弗劳恩霍夫应用科技大学) University of Veterinary Medicine, Vienna(维也纳兽医大学) The Schwarzman Animal Medical Center(施瓦茨曼动物医疗中心) Diffusely(扩散地) Freie Universität Berlin(柏林自由大学) Technische Hochschule Ingolstadt(因戈尔施塔特技术大学) Medical University of Vienna(维也纳医学大学) Julius-Maximilians-Universität Würzburg(维尔茨堡约瑟夫-马克斯姆-大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文通过对比深度学习方法,评估了自动识别异常有丝分裂图的性能,提出两种新数据集并展示在不同领域中的分类准确率。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2026:006

Journal ref Machine.Learning.for.Biomedical.Imaging. 2026 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26495 2026-04-30 cs.CR 50%

Beyond Code Reasoning: A Specification-Anchored Audit Framework for Expert-Augmented Security Verification

超越代码推理:一种基于规范的审计框架用于专家增强的安全验证

Masato Kamba, Hirotake Murakami, Akiyoshi Sannai

专题命中 代码评测 :repository(abstract)

AI总结 本文提出SPECA框架,通过自然语言规范生成类型化安全属性,实现基于规范的审计,解决代码层面无法检测规范依赖漏洞的问题,提升安全验证的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13421 2026-04-30 cs.SD eess.AS 50%

Explainable Detection of Machine Generated Music and Early Systematic Evaluation

可解释性地检测机器生成音乐及早期系统性评估

Yupei Li, Qiyang Sun, Hanqian Li, Lucia Specia, Björn W. Schuller

机构 * Imperial College London, Computing(帝国理工学院伦敦分校,计算机系) Shandong University(山东大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文通过多种模型评估机器生成音乐检测,揭示ResNet18在领域内和领域外测试中的最佳性能,提出未来研究方向以提升检测方法的鲁棒性和有效性。

Comments Accepted at Scientific report

Journal ref Sci Rep 16, 13757 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 5 篇

2604.26880 2026-04-30 cs.CL cs.LG 62%

HealthNLP_Retrievers at ArchEHR-QA 2026: Cascaded LLM Pipeline for Grounded Clinical Question Answering

HealthNLP_Retrievers在ArchEHR-QA 2026中的表现:基于级联LLM管道的 grounded临床问答

Md Biplob Hosen, Md Alomgeer Hussein, Md Akmol Masud, Omar Faruque, Tera L Reynolds, Lujie Karen Chen

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校) Jahangirnagar University(贾旺吉拉大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于Gemini 2.5 Pro的级联管道,通过多阶段模块实现患者问题理解、证据检索与回答生成,提升临床问答的准确性和专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26818 2026-04-30 cs.LG 57%

Semi-supervised learning with max-margin graph cuts

基于最大边际图割的半监督学习

Branislav Kveton, Michal Valko, Ali Rahimi, Ling Huang

机构 * Intel Labs(英特尔实验室) Santa Clara University(圣克拉拉大学) University of Pittsburgh(匹兹堡大学) Berkeley(伯克利)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本文提出了一种新的半监督学习算法,通过最大化谐波函数解诱导标签的边际来学习图割。在合成数据和UCI ML数据集上验证了方法的有效性,并证明了其泛化误差界。

Comments Published at AISTATS 2010 (13th International Conference on Artificial Intelligence and Statistics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26384 2026-04-30 cs.SE cs.SY eess.SY 57%

Asset Administration Shell-Based OCL Validation Framework for Model-Based System Engineering

基于资产管理壳的OCL验证框架用于基于模型的系统工程

Om Parkash, Jannik Bauer, Vincent Schmitt, Thomas Greiner, Rainer Drath

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文提出基于资产管理壳的OCL验证框架,解决MBSE中模型约束管理和验证结果分散的问题,通过虚构工业场景演示方法,并公开所有 artifacts 以支持可重复性。

Comments 7 Pages, Accepted to IFAC 2026 (23rd IFAC World Congress)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17617 2026-04-30 cs.IR cs.CL 57%

Agentic Search in the Wild: Intents and Trajectory Dynamics from 14M+ Real Search Requests

野外代理搜索:从1400万次真实搜索请求中获取意图和轨迹动态

Jingjie Ning, João Coelho, Yibo Kong, Yunfan Long, Bruno Martins, João Magalhães, Jamie Callan, Chenyan Xiong

机构 * Carnegie Mellon University Pittsburgh PA US INESC-ID, Carnegie Mellon University Pittsburgh PA US INESC-ID, Instituto Superior T\'ecnico, University of Lisbon Lisbon Portugal NOVA LINCS\ University Lisbon Caparica Portugal Carnegie Mellon University INESC-ID, Carnegie Mellon University INESC-ID, Instituto Superior T\'ecnico, University of Lisbon NOVA LINCS\ University Lisbon

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 本文分析了1400万次真实搜索请求,揭示了代理搜索会话中的行为模式,包括步骤数、时间间隔及查询重构的可追溯性,为重复敏感停止和意图适应检索预算提供信号。

Comments Accepted at SIGIR 2026. DOI: 10.1145/3805712.3809627

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20414 2026-04-30 cs.CV cs.AI cs.RO 57%

RetroMotion: Retrocausal Motion Forecasting Models are Instructable

RetroMotion:逆因果运动预测模型具有可指导性

Royden Wagner, Omer Sahin Tas, Felix Hauser, Marlon Steiner, Dominik Strutz, Abhishek Vivekanandan, Jaime Villa, Yinzhe Shen, Carlos Fernandez, Christoph Stiller

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心) University Charles III of Madrid(马德里第三大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文提出RetroMotion模型,通过分解多代理运动预测为边际分布和联合分布,利用Transformer生成联合分布,实现信息逆向流动,有效提升预测精度,并在多个数据集上表现优异。

Comments CVPRW26

详情

展开后加载摘要…

URL PDF HTML 收藏