arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-27 至 2026-05-27 共收录 18 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 3 篇

2601.03525 2026-05-27 cs.LG cs.AI 81%

Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation

超越二元:将部分成功转化为代码生成中强化学习的密集可验证奖励

Longwen Wang, Yirui Liu, Xuan'er Wu, Xiaohui Hu, Yuankai Fan, Kaidong Yu, Qizhen Weng, Wei Xi, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司Xingchen AGI实验室) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,西安交通大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI、cs.LG

AI总结 提出VeRPO框架,利用代码测试的部分成功作为可验证密集奖励,通过动态密度校准局部奖励修正基数偏差,并与全局执行结果结合,提升代码生成强化学习的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26842 2026-05-27 cs.LG cs.CL 62%

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training

MONA: 基于Nesterov加速的Muon优化器用于可扩展语言模型训练

Jiacheng Li, Jianchao Tan, Hongtao Xu, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

机构 * Meituan(美团)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 提出MONA优化器,通过将Nesterov加速项集成到Muon的梯度处理流程中,实现曲率感知加速,从而帮助逃离尖锐局部最小值,并在1B到68B参数的混合专家预训练中取得更优收敛和下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26646 2026-05-27 cs.AI cs.CL cs.MA 62%

UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems

UnityMAS-O: 基于LLM的多智能体系统的通用强化学习优化框架

Yiqun Chen, Wei Yang, Erhan Zhang, Shijie Wang, Qi Liu, Zechun Niu, Bin Zhang, Haitao Li, Rui Li, Lingyong Yan, Jinyuan Feng, Biqing Qi, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出UnityMAS-O框架,将多智能体工作流作为优化单元,通过逻辑角色、图轨迹、用户定义奖励和智能体-模型映射四个核心对象解耦逻辑与物理参数,支持灵活的参数共享和奖励分配,在检索增强问答、迭代搜索和反思代码生成任务上验证了多智能体RL对手动工作流的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2605.20251 2026-05-27 cs.SE cs.AI 81%

ProcCtrlBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents

ProcCtrlBench: 评估LLM编码智能体中的过程级缺陷与控制保持

Jiawei He, Jie Jia, Chenbo Liu, Chaoyi Xue, Yapeng Song, Xikai Yang, Dong Sun

机构 * Amap, Alibaba Group(阿里云)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 提出ProcCtrlBench基准,通过可复用的缺陷本体和标准化轨迹表示,从过程证据而非仅最终结果评估LLM编码智能体的执行质量,并引入控制保持量化执行过程的可解释性、可中断性等属性。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01327 2026-05-27 cs.SE cs.CL cs.LG 67%

SWE-Adept: An LLM-Based Agentic Framework for Deep Codebase Analysis and Structured Issue Resolution

SWE-Adept:基于LLM的深度代码库分析与结构化问题解决代理框架

Kang He, Kaushik Roy

机构 * Electrical and Computer Engineering, Purdue University(电子工程与计算机工程系,普渡大学)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 提出SWE-Adept双代理框架,通过代理引导的深度优先搜索进行代码定位,结合自适应规划和结构化问题解决,在SWE-Bench上提升端到端解决率最多4.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26835 2026-05-27 cs.AI 57%

Helicase: Uncertainty-Guided Supply Chain Knowledge Graph Construction with Autonomous Multi-Agent LLMs

Helicase: 不确定性引导的供应链知识图谱构建与自主多智能体大语言模型

Yunbo Long, Haolang Zhao, Ge Zheng, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出Helicase,一种基于多智能体大语言模型的自主系统,通过不确定性引导的迭代验证和知识图谱构建,解决供应链中需要多跳推理的结构化推断问题,并引入SCQA基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20690 2026-05-27 cs.AI 57%

Declarative Data Services: Structured Agentic Discovery for Composing Data Systems

声明式数据服务:用于组合数据系统的结构化智能体发现

Shanshan Ye, Duo Lu

机构 * Northeastern University(东北大学) Brown University(布朗大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出声明式数据服务(DDS)架构,通过分层类型契约将全局搜索分解为有界子搜索,解决无界智能体发现无法稳定收敛的问题,并在交易后端工作负载上验证其有效性。

Comments Accepted at AI Agents for Discovery in the Wild (AID-Wild), Workshop at ACM CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 2 篇

2605.27238 2026-05-27 cs.SE 83%

EviACT: An Evidence-to-Action Framework for Agentic Program Repair

EviACT:一种面向智能体程序修复的证据到行动框架

Qianru Meng, Xiao Zhang, Zhaochun Ren, Joost Visser

专题命中 程序修复 :program repair(title,abstract);repository(abstract);分类 cs.SE

AI总结 提出EviACT框架,通过协调三个证据驱动的防护栏(检索支架、编译门、测试驱动门)来提升智能体程序修复的定位、生成和验证效率,在多个基准上修复率提升1.6-6.0个百分点,API成本降低70.1-88.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03194 2026-05-27 cs.CL cs.SE 62%

BeyondSWE: Can Current Code Agent Survive Beyond Single-Repo Bug Fixing?

BeyondSWE:当前代码代理能否超越单仓库错误修复?

Guoxin Chen, Fanzhe Meng, Jiale Zhao, Minghao Li, Daixuan Cheng, Huatong Song, Jie Chen, Yuzhi Lin, Hui Chen, Xin Zhao, Ruihua Song, Chang Liu, Cheng Chen, Kai Jia, Ji-Rong Wen

专题命中 程序修复 :repository(abstract);分类 cs.SE、cs.CL

AI总结 提出BeyondSWE基准测试,评估代码代理在跨仓库、领域特定、依赖迁移和文档生成等复杂软件工程任务上的表现,发现现有代理在利用外部信息进行精确代码修改方面仍存在显著不足。

Comments Benchmark: https://huggingface.co/datasets/AweAI-Team/BeyondSWE. Repo: https://github.com/AweAI-Team/BeyondSWE. Scaffold: https://github.com/AweAI-Team/AweAgent

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 2 篇

2605.26851 2026-05-27 cs.SE 83%

LLM-based Mockless Unit Test Generation for Java

基于LLM的Java无模拟单元测试生成

Qinghua Xu, Guancheng Wang, Lionel Briand, Zhaoqiang Guo, Kui Liu

专题命中 测试生成 :unit test generation(title,abstract);code generation(abstract);分类 cs.SE

AI总结 提出MocklessTester方法,通过上下文增强生成和约束强制修复解决LLM生成无模拟单元测试时的幻觉问题,在Defects4J和Deps4J上显著提升覆盖率和变异得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26651 2026-05-27 cs.CR 50%

Batch Me If You Can: Coverage-guided RPKI Fuzzing at Scale

Batch Me If You Can: 大规模覆盖引导的RPKI模糊测试

Haya Schulmann, Niklas Vogel

专题命中 测试生成 :repository(abstract)

AI总结 针对RPKI软件现有模糊测试无法处理多对象加密仓库的局限性,提出基于连续采样和函数侧信道的覆盖归因技术,结合非顺序模糊测试与ASN.1变异引擎,实现66倍吞吐量提升并发现21个新漏洞。

Comments Published at IEEE S&P 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 3 篇

2605.26457 2026-05-27 cs.SE cs.AI cs.CL cs.PL 70%

Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization

Verus-SpecGym: 用于评估规范自动形式化的智能体环境

Anmol Agarwal, Natalie Neamtu, Pranjal Aggarwal, Seungone Kim, Jannis Limperg, Cedric Flamant, Kanna Shimizu, Bryan Parno, Sean Welleck

机构 * CMU(卡内基梅隆大学) Amazon(亚马逊)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 提出 Verus-SpecGym 环境与 Verus-SpecBench 基准,通过执行规范机制和对抗性测试评估 LLM 智能体将非正式编程问题转化为形式规范的能力,发现前沿模型可解决 77.8% 的任务但存在遗漏假设等脆弱性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00575 2026-05-27 cs.CL 57%

InfoSynth: Information-Guided Benchmark Synthesis for LLMs

InfoSynth: 信息引导的大语言模型基准合成

Ishir Garg, Neel Kolhe, Xuandong Zhao, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 提出基于信息论(KL散度和熵)的InfoSynth框架,自动生成高难度、多样化的Python编程基准,97%的测试用例和解决方案准确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26884 2026-05-27 cs.CV 50%

Small Object Detection in Industrial Recycling: A New Dataset and YOLO Performance Evaluation

工业回收中的小目标检测:新数据集与YOLO性能评估

Oussama Messai, Abbass Zein-Eddine, Abdelouahid Bentamou, Mickael Picq, Nicolas Duquesne, Stéphane Puydarrieux, Yann Gavet

机构 * Mines Saint-Etienne, CNRS, UMR 5307 LGF(圣艾蒂安 Mines、法国国家科学研究中心、UMR 5307 LGF)

专题命中 代码评测 :repository(abstract)

AI总结 针对工业回收中小、密集、重叠目标的检测难题,本文提出新数据集并对比基于深度学习的监督方法,评估YOLO等系统的性能、精度与计算效率,同时探索数据增强与合成图像的优势。

Journal ref Journal of Electronic Imaging 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 4 篇

2605.26177 2026-05-27 cs.SE cs.AI 81%

RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations

RepoMirage: 通过扰动探测代码智能体的仓库上下文推理

Hanyu Li, Yichi Zhang, Speed Zhu, Hang Su, Jun Zhu, Yinpeng Dong

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Tencent(腾讯)

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 提出RepoMirage评估套件,通过语义保持的仓库级扰动和扩展任务,揭示代码智能体在仓库上下文推理中的显著缺陷,并基于结构优先的原型工作流RepoAnchor展示改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20957 2026-05-27 cs.SE cs.AI 81%

One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents

一个工具就够了:面向仓库级LLM智能体的强化学习

Zhaoxi Zhang, Yitong Duan, Yanzhi Zhang, Yiming Xu, Zhixiang Wang, Kun Liang, Weikang Li, Jiahui Liang, Deguo Xia, Jizhou Huang, Jiyan He, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing, Peking University(信息处理国家级重点实验室,北京大学) School of Computer Science, Peking University(北京大学计算机科学学院) Zhongguancun Institute of Artificial Intelligence (ZGCI)(中关村人工智能研究院(ZGCI)) Baidu Inc(百度公司)

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 提出RepoNavigator,一个仅配备单一执行感知工具(跳转到调用符号定义)的LLM智能体,通过强化学习端到端训练,在仓库级问题定位中达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03352 2026-05-27 cs.CV cs.AI cs.LG 62%

Inference-Time Search Using Side Information for Diffusion-Based Image Reconstruction

基于侧信息的推理时搜索用于扩散模型图像重建

Mahdi Farahbakhsh, Vishnu Teja Kunde, Dileep Kalathil, Krishna Narayanan, Jean-Francois Chamberland

机构 * Department of Electrical and Computer Engineering, Texas A&M University(电气与计算机工程系,德克萨斯A&M大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 提出一种即插即用、无需训练的推理时搜索框架,将侧信息融入现有扩散模型逆问题求解器,显著提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26791 2026-05-27 cs.CR 50%

Anonymous YARA Rules Are Not Anonymous

匿名YARA规则并不匿名

Usman Rabiu Isah, Laurent Bobelin, Pascal Berthomé

专题命中 仓库级理解 :repository(abstract)

AI总结 通过分析YARA规则的文体特征,发现仅移除元数据无法保护作者身份,仓库来源、作者和恶意软件家族均可被高精度识别。

详情

展开后加载摘要…

URL PDF HTML 收藏