arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-21 至 2026-05-21 共收录 23 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 12 篇

2510.04905 2026-05-21 cs.SE cs.CL 88%

Retrieval-Augmented Code Generation: A Survey with Focus on Repository-Level Approaches

检索增强的代码生成:聚焦于仓库级方法的综述

Yicheng Tao, Yuante Li, Yao Qin, Yepang Liu

机构 * Carnegie Mellon University(卡内基梅隆大学) Chinese University of Hong Kong(香港中文大学) Southern University of Science and Technology(南方科技大学)

专题命中 代码生成 :code generation(title,abstract);repository(title,abstract);分类 cs.SE、cs.CL

AI总结 本文综述了检索增强的代码生成方法,重点探讨仓库级方法,分析了其在大规模代码生成中的挑战与解决方案,总结了现有方法的分类框架及关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07122 2026-05-21 cs.SE 85%

RepoZero: Can LLMs Generate a Code Repository from Scratch?

RepoZero: LLMs能否从零开始生成代码仓库?

Zhaoxi Zhang, Yiming Xu, Jiahui Liang, Weikang Li, Xiaoshuai Chen, Liwei Qian, Xin Pei, Jizhou Huang, Run Sun, Yunfang Wu

专题命中 代码生成 :repository(title,abstract);code generation(abstract);coding agent(abstract);分类 cs.SE

AI总结 本文提出RepoZero基准测试,通过自动化执行验证实现从零开始生成代码仓库的严格评估,展示了Agentic Code-Test Evolution框架在多模型上的实验结果,揭示了当前LLM在代码生成能力与实际需求之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21180 2026-05-21 cs.LG cs.SE 84%

Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards

用于密集奖励的领域可适应强化学习代码生成

Erfan Aghadavoodi Jolfaei, Daniel Maninger, Abhinav Anand, Mert Tiftikci, Mira Mezini

机构 * Hessian Center for Artificial Intelligence (hessian.AI)(海斯曼人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 代码生成 :code generation(title,abstract);program synthesis(abstract);分类 cs.SE、cs.LG

AI总结 本研究提出了一种领域可适应的强化学习框架,用于改进代码生成的正确性、质量和安全性,通过定制化的执行感知奖励公式和令牌级奖励映射机制,提高了代码生成在不同领域中的适应性和执行效率。

Comments 10 pages, 2 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20473 2026-05-21 cs.SE cs.AI cs.LG 82%

Code Generation by Differential Test Time Scaling

通过微分测试时间缩放进行代码生成

Yifeng He, Ethan Wang, Jicheng Wang, Xuanxin Ouyang, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出DiffCodeGen,一种基于覆盖引导的微分分析的代码生成方法,通过生成多样化的代码候选并利用覆盖引导模糊测试来合成输入,无需现有测试用例或大语言模型,从而提高效率和可扩展性。

Comments 16 main text, 21 pages with references

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09724 2026-05-21 cs.SE cs.AI 81%

InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation

InteractScience: 交互式科学演示代码生成的程序化与视觉导向评估

Qiaosheng Chen, Yang Liu, Lei Li, Kai Chen, Qipeng Guo, Gong Cheng, Fei Yuan

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,中国南京) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,中国上海) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学,美国匹兹堡)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出InteractScience基准,用于评估大语言模型在生成交互式科学演示代码时结合科学知识与前端交互能力的综合表现,通过程序化测试和视觉测试相结合的方法,评估30种开源和闭源LLM的表现,揭示了在整合领域知识与交互前端编码方面的持续不足。

Comments 27 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10568 2026-05-21 cs.LO cs.SE 79%

Correct-by-Construction G-Code Generation: A Neuro-Symbolic Approach via Separation Logic

通过分离逻辑的正确性构建G代码生成:一种神经符号方法

Yeonseok Lee

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文提出了一种神经符号框架,通过分离逻辑证明器将GLLM方法的神经生成能力与形式验证相结合,利用几何数据构建两组件架构,将物理碰撞转化为逻辑空间数据 race,从而生成自我校正的G代码生成系统,减少人工监督,提高自主制造的安全性和验证性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09001 2026-05-21 cs.CL cs.AI cs.LG 67%

Retrospective Sparse Attention for Efficient Long-Context Generation

回顾性稀疏注意力用于高效长上下文生成

Seonghwan Choi, Beomseok Kang, Dongwon Jo, Jae-Joon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RetroAttention,一种新的KV缓存更新技术,通过回顾后续解码步骤的KV条目来修正过去的注意力输出,从而提高长上下文生成的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20369 2026-05-21 cs.CL cs.AI cs.LG 67%

DEL: Digit Entropy Loss for Numerical Learning of Large Language Models

DEL:用于大语言模型数值学习的数字熵损失

Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Digit Entropy Loss (DEL)用于大语言模型的自回归数值学习,通过重新设计传统无监督熵优化,引入数字条件概率和二元交叉熵,使熵优化转向监督方式,同时推广整数基于的数值学习到浮点数优化,从而提升数值预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21467 2026-05-21 cs.LG cs.CL 62%

DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards

DelTA: 一种用于可验证奖励强化学习的判别性token信用分配

Kaiyi Zhang, Wei Wu, Yankai Lin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) Ant International(蚂蚁国际)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 本文提出DelTA方法,通过估计token系数来增强特定侧的token梯度方向,从而改进可验证奖励强化学习中的token概率更新,提升了模型在数学基准测试中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25898 2026-05-21 eess.SY cs.AI cs.SE cs.SY 62%

On Integrating Resilience and Human Oversight into LLM-Assisted Modeling Workflows for Digital Twins

在数字孪生构建中整合韧性与人类监督 into LLM辅助建模工作流

Lekshmi P, Neha Karanjkar

机构 * Indian Institute of Technology Goa(印度理工学院 Goa)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出三种关键设计原则,用于将韧性与人类监督整合到LLM辅助的数字孪生建模工作流中,通过FactoryFlow框架的研究,探讨了如何通过正交化结构建模与参数拟合、限制模型IR到参数化预验证库组件以及使用密度保持的IR来提高建模的鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20370 2026-05-21 cs.OS cs.PL 57%

Clove: Object-Level CXL Memory Management in Managed Runtimes

Clove: 有管理运行时中的对象级CXL内存管理

Sam Son, Zhihong Luo, Wen Zhang, Sylvia Ratnasamy, Scott Shenker

专题命中 代码生成 :code generation(abstract);分类 cs.PL

AI总结 本文针对CXL分层内存中对象级管理的研究问题,提出了一种基于有管理语言及其运行时的新设计点,通过结合性能指导的对象热点追踪和对象迁移技术,实现了高效的CXL内存管理,显著提升了内存利用率并降低了运行时开销。

Comments 12 pages (15 pages including references), 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20312 2026-05-21 cs.CR cs.LO cs.MA 50%

Pramana: A Protocol-Layer Treatment of Claim Verification in Autonomous Agent Networks

Pramana:自主代理网络中声明验证的协议层处理

Ravi Kiran Kadaboina

专题命中 代码生成 :code generation(abstract)

AI总结 本文提出Pramana协议层,通过定义缺失的线缆格式,为自主代理网络中的声明验证提供结构化方法,结合经典印度认识论中的四种知识类型,确保验证过程的确定性和可追溯性。

Comments 23 pages, 4 figures, 5 tables, 42 references

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2605.20456 2026-05-21 cs.SE cs.AI cs.MA 82%

Agentic Agile-V: From Vibe Coding to Verified Engineering in Software and Hardware Development

Agentic Agile-V: 从Vibe编码到验证工程在软件和硬件开发中

Christopher Koch

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :code generation(abstract,abstract_cn);repository(abstract,abstract_cn);分类 cs.SE、cs.AI

AI总结 本文研究了代理AI在软件和硬件开发中的应用,提出Agentic Agile-V框架,通过SCOPE-V循环将对话意图转化为结构化工程成果,并贡献了最小输入艺术品类税、对话到合同门、风险自适应工作流和证据包接受模型。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21384 2026-05-21 cs.SE cs.AI cs.CL 82%

SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents

SpecBench: 评估长周期编码代理中的奖励黑客现象

Bingchen Zhao, Dhruv Srikanth, Yuxiang Wu, Zhengyao Jiang

机构 * Weco AI

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 该研究通过分解软件工程任务,提出了一种评估长周期编码代理中奖励黑客现象的方法,通过比较可见测试套件和隐藏测试套件的通过率差异,引入了SpecBench基准,展示了奖励黑客现象在不同任务长度上的显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11060 2026-05-21 cs.SE cs.AI 62%

Code Researcher: Deep Research Agent for Large Systems Code and Commit History

Code Researcher: 用于大型系统代码和提交历史的深度研究代理

Ramneet Singh, Sathvik Joel, Abhav Mehrotra, Nalin Wadhwa, Ramakrishna B Bairi, Aditya Kanade, Nagarajan Natarajan

机构 * Microsoft Research(微软研究院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Code Researcher,一种用于大型系统代码和提交历史的深度研究代理,通过多步骤推理和全局上下文收集,有效解决系统代码崩溃修复问题,显著优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 2 篇

2603.01712 2026-05-21 cs.AI cs.LG 62%

FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents

FT-Dojo: 向自主LLM微调迈进的语言代理

Qizheng Li, Yifei Zhang, Xiao Yang, Xu Yang, Zhuo Wang, Weiqing Liu, Jiang Bian

机构 * Peking University(北京大学) Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) The University of Chicago(芝加哥大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FT-Dojo交互式基准环境,用于研究自主LLM微调,通过标准化任务接口、共享数据仓库、沙盒执行环境和反馈协议,开发了FT-Agent框架,实现了结构化迭代规划和多级反馈分析,实验显示FT-Agent在13个任务中表现优异,且展示了代理在故障恢复和长期规划中的能力。

Comments 26 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20539 2026-05-21 cs.LG 57%

OpenSeisML: Open Large-Scale Real Seismic and well-log Dataset for Generative AI

OpenSeisML: 开放式大规模真实地震和井历数据集用于生成式AI

Ipsita Bhar, Huseyin Tuna Erdinc, Thales Souza, Charles Jones, Felix J. Herrmann

机构 * Georgia Institute of Technology(佐治亚理工学院) Osokey Ltd(Osokey公司)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出OpenSeisML,一个开放的大型真实地震和井历数据集,用于支持生成式AI在地震反演中的应用,通过自动化数据整理流程提供可重复的地震数据准备,以训练生成模型捕捉地下属性的统计分布,从而生成多个统计上一致的现实实现用于不确定性量化。

Comments 5 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 6 篇

2605.21177 2026-05-21 cs.LG cs.CL 62%

ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning

ChunkFT: 用于内存高效全微调的分块优化

Yongkang Liu, Zijing Wang, Mengjie Zhao, Ercong Nie, Mingyang Wang, Qian Li, Feiliang Ren, Shi Feng, Daling Wang, Hinrich Schütze

机构 * Northeastern University, China(中国东北大学) Shanghai Jiao Tong University, China(上海交通大学) CIS, LMU Munich, Germany(慕尼黑大学CIS实验室) MCML, Germany(德国MCML实验室) Shandong University, China(山东大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ChunkFT框架,通过动态激活的工作集重新定义全参数微调,实现了无需修改网络架构即可对任意子张量进行梯度计算,理论分析和实验表明其在内存使用、运行时间和优化质量上均有效,且在下游任务中表现优于现有内存高效基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20678 2026-05-21 cs.LG cs.AI 62%

Dynamic TMoE: A Drift-Aware Dynamic Mixture of Experts Framework for Non-Stationary Time Series Forecasting

动态TMoE:一种针对非平稳时间序列预测的漂移感知动态专家混合框架

Jiawen Zhu, Shuhan Liu, Di Weng, Yingcai Wu

机构 * School of Software Technology, Zhejiang University, Ningbo, China State Key Lab of CAD\&CG, Zhejiang University, Hangzhou, China

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Dynamic TMoE框架,通过动态构建异构专家和剪枝冗余专家来优化容量,并利用时间记忆路由器确保稳定且上下文感知的专家选择,从而在非平稳时间序列预测中实现更优性能。

Comments 27 pages, 7 figures. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12960 2026-05-21 cs.CL 57%

DiM\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging

DiM\textsuperscript{3}: 通过方向和幅度感知融合连接多语言和多模态模型

Zijing Wang, Mingyang Wang, Ercong Nie, Yongkang Liu, Shi Feng, Mengjie Zhao, Daling Wang, Xiaocui Yang, Hinrich Schütze

机构 * Northeastern University, China(东北大学,中国) CIS, LMU Munich, Germany(慕尼黑莱布尼茨大学计算机学院,德国) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心(MCML),德国) Shanghai Jiao Tong University, China(上海交通大学,中国)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 本研究提出DiM3方法,通过在共享语言模型骨干中融合残差更新,实现多语言和多模态能力的无缝整合,从而提升多语言性能并保持多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05897 2026-05-21 cs.CR cs.SE 57%

How Reliable Are FOSS Popularity Metrics? Analyzing the Effort Required for Spoofing Common Software Popularity Metrics

开源软件流行度指标有多可靠?分析伪造常见软件流行度指标所需的努力

Ben Swierzy, Timo Pohl, Marc Ohm, Michael Meier

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文研究了开源软件流行度指标的可靠性,分析了伪造这些指标所需的努力,并指出许多指标类别,如提交数据、问题跟踪器活动、下载量、仓库内容和依赖关系,可以被低至中等程度地操纵,揭示了npm上的一个涉及影响奖励机制的Sybil攻击。

Comments Short Version of arXiv:2505.05897v1, Full paper accepted at ARES 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21172 2026-05-21 physics.comp-ph physics.data-an 50%

Lumina: An AI-Augmented Multiscale Material Informatics Framework for Extreme Aero-Chemo-Thermo-Mechanical Regimes

Lumina:一种增强型多尺度材料信息学框架,用于极端气-化-热-力学环境

Pradeep Kumar Seshadri, Vigneshwaran N, Sudaroli Dhananjeyan, Karthikeyan S, Navbila K, Sridhar S, Subhadevi K, Hari Sree Charan H, Abdul Azeez A, Jeswin Mickle, Harsha C

专题命中 仓库级理解 :repository(abstract)

AI总结 本研究提出Lumina框架,通过整合多尺度材料数据,提升在极端气-化-热-力学环境下的预测模拟和实验设计的精度与效率,同时提供AI辅助的材料检索和自然语言查询功能。

Comments This work was presented in High Energy Materials Conference & Exhibition 2026 and subsequently published in its proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20352 2026-05-21 astro-ph.GA astro-ph.CO 50%

On the correlation between globular clusters and the distribution of dark matter in galaxy clusters: the case of Abell 2744

关于球状星团与星系团暗物质分布的相关性:以阿贝尔2744星系团为例

Marta Reina-Campos, Joshua S. Speagle, William E. Harris

专题命中 仓库级理解 :repository(abstract)

AI总结 本文通过统计方法研究球状星团在星系团中的分布与其暗物质分布的相关性,发现球状星团的分布更紧密地与预测的质量图相关联,为研究星系团质量分布提供了新的独立方法。

Comments 16 pages, 8 figures - scripts available here: https://github.com/mreinacampos/starclusters-in-jwst/tree/a3df64fa8a821ece9ebc014b7010066971a07958/code_poisson_comparison/abell2744 - submitted to ApJ, comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏