arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-18 至 2026-05-18 共收录 23 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 11 篇

2605.15238 2026-05-18 cs.SE cs.AI cs.PL 82%

Hydra: Efficient, Correct Code Generation via Checkpoint-and-Rollback Support

Hydra:通过检查点和回滚支持实现高效的正确代码生成

Alexander Du, Jianjun Ou, Danyang Zhuo, Matthew Lentz

机构 * Duke University(杜克大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 Hydra通过异步检查和检查点回滚机制,在代码生成中高效修复静态错误,减少延迟和token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22151 2026-05-18 cs.CV cs.CL 79%

MultiMat: Multimodal Program Synthesis for Procedural Materials using Large Multimodal Models

MultiMat: 多模态程序合成用于基于过程的材料生成

Jonas Belouadi, Tamy Boubekeur, Adrien Kaiser

机构 * University of Mannheim(曼海姆大学) Adobe Research(Adobe研究)

专题命中 代码生成 :program synthesis(title,abstract);分类 cs.CL

AI总结 MultiMat利用大规模多模态模型实现多模态程序合成,提升生成过程材料图的效率与视觉质量,优于纯文本基线方法。

Comments Accepted at ICLR 2026 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15248 2026-05-18 cs.SE cs.CR 79%

Probing Privacy Leaks in LLM-based Code Generation via Test Generation

通过测试生成探测基于LLM的代码生成中的隐私泄露

Yifei Ge, Zhenpeng Chen, Weisong Sun, Yuchen Chen, Chunrong Fang, Juan Zhai, Xiaofang Zhang, Xia Feng, Yang Liu, Zhenyu Chen

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文提出一种模拟实际隐私相关代码生成场景的管道,采用测试驱动策略提取生成测试用例中的记忆信息,通过自动构建隐私特征库提高隐私泄露检测效果,实验表明检测到的隐私泄露增加2.56倍。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15464 2026-05-18 cs.LG cs.AI cs.CL 67%

GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero

GRLO:从零开始在开放环境中的通用强化学习

Shangjian Yin, Yu Fu, Yue Dong, Zhouxing Shi

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GRLO研究从少量交互数据中训练的RLHF在开放环境中的泛化能力,探索其对话能力是否能迁移至数学推理和代码生成等下游任务,展示出高效且低成本的训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03812 2026-05-18 cs.LG cs.AI cs.CL 67%

Antidistillation Fingerprinting

对抗蒸馏指纹

Yixuan Even Xu, John Kirchenbauer, Yash Savani, Asher Trockman, Alexander Robey, Tom Goldstein, Fei Fang, J. Zico Kolter

机构 * Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学) University of Maryland, College Park, MD, USA(马里兰大学学院市分校)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出对抗蒸馏指纹方法,通过代理模型识别并采样最大化指纹检测性的token,提升检测效果同时减少对模型性能的影响。

Comments 28 pages, 13 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19241 2026-05-18 cs.LG cs.AI 62%

ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment

ActiveDPO: 用于高效对齐的主动直接偏好优化

Xiaoqiang Lin, Arun Verma, Zhongxiang Dai, Daniela Rus, See-Kiong Ng, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工联盟研究技术中心) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 ActiveDPO通过理论支撑的非线性奖励函数选择方法,利用LLM自身参数化奖励模型,提升对齐效率和数据收集效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15609 2026-05-18 cs.CL 57%

PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding

PSD: 推动扩散大语言模型的帕累托前沿:通过并行推测解码

Shengyin Sun, Yiming Li, Renxi Liu, Xinqi Li, Hui-Ling Zhen, Weizhe Lin, Chen Chen, Xianzhi Yu, Mingxuan Yuan, Chen Ma

机构 * Huawei Technologies(华为技术)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文提出PSD框架,通过并行推测解码提升推理效率与生成质量,在推理效率和生成质量之间取得良好平衡,达到每前向传递5.5倍的token处理速度。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15585 2026-05-18 cs.AI cs.CV 57%

See Before You Code: Learning Visual Priors for Spatially Aware Educational Animation Generation

在编码前看到:学习视觉先验以生成空间感知的教育动画

Yuejia Li, Ke He, Junheng Li, Shutong Chen, Jingkang Xia, Zhiyue Su, Junchi Zhang, Mang Ye

机构 * Wuhan University(武汉大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出OmniManim框架,通过视觉规划和反馈机制提升教育动画生成质量,改进渲染效果和教学效果。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15301 2026-05-18 cs.AI 57%

Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution

Solvita:通过代理进化增强大型语言模型以应对编程竞赛

Han Li, Jinyu Tian, Rili Feng, Yuqiao Du, Chong Zheng, Chenyu Wang, Chenchen Liu, Shihao Li, Xinping Lei, Yifan Yao, Weihao Xie, Letian Zhu, Jiaheng Liu

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Independent Researcher(独立研究者)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 Solvita通过闭环系统和可训练知识网络,使代理动态学习,提升编程竞赛任务的准确性和经验积累。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15778 2026-05-18 cs.CL 57%

Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR

稳定知识,促进推理:双令牌约束用于RLVR

Jiakang Wang, Runze Liu, Fuzheng Zhang, Xiu Li, Guorui Zhou, Ling Pan

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文提出Archer框架,通过双令牌约束在RLVR中平衡优化,提升LLM的推理和知识保持能力,实验显示在数学推理和代码生成任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15503 2026-05-18 cs.CR 50%

uGen: An Agentic Framework for Generating Microarchitectural Attack PoCs

uGen:一种用于生成微架构攻击PoC的代理框架

Debopriya Roy Dipta, Thore Tiemann, Eduard Marin, Thomas Eisenbarth, Berk Gulmezoglu

专题命中 代码生成 :code generation(abstract)

AI总结 本文提出uGen框架,利用LLM生成微架构攻击代码,解决现有方法的可移植性问题,通过多代理设计提升攻击代码的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 6 篇

2605.15315 2026-05-18 cs.AI cs.CL 84%

Context Pruning for Coding Agents via Multi-Rubric Latent Reasoning

通过多标准潜在推理进行编码代理的上下文剪枝

Jingjing Wang, Xiwen Chen, Wenhui Zhu, Huayu Li, Zhengxiao He, Feiyang Cai, Ana S. Carreon-Rascon, Xuanzhao Dong, Feng Luo

机构 * Clemson University(克莱姆森大学) Morgan Stanley(摩根大通) Arizona State University(亚利桑那州立大学) University of Arizona(亚利桑那大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LaMR框架,通过分解代码相关性为语义证据和依赖支持两个维度,利用多任务CRF模型提升编码代理的上下文剪枝效果,实验表明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14859 2026-05-18 cs.CR cs.AI 79%

Do Coding Agents Understand Least-Privilege Authorization?

编码代理是否理解最小特权授权?

Zheng Yan, Jingxiang Weng, Charles Chen, Dengyun Peng, Ethan Qin, Jiannan Guan, Jinhao Liu, Qiming Yu, Yixin Yuan, Fanqing Meng, Carl Che, Mengkang Hu

机构 * Evolvent AI Research Team(Evolvent AI研究院)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究编码代理是否能自主推断最小特权授权边界,提出Sufficiency-Tightness Decomposition方法,提升敏感任务成功率并降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15221 2026-05-18 cs.SE cs.AI cs.CL 78%

Effective Harness Engineering for Algorithm Discovery with Coding Agents

高效Harness工程在编码代理算法发现中的应用

Yoichi Ishibashi, Taro Yano, Masafumi Oyamada

机构 * Gemini Algorithmicsuperintelligence(算法智能)

专题命中 软件智能体 :coding agent(title);分类 cs.SE、cs.CL、cs.AI

AI总结 本文探讨了在固定token预算下,生成更多算法还是更深入思考每个算法的优劣,以及如何处理评估黑客和安全并行执行的问题,通过Vesper框架验证了深入思考每个算法更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01089 2026-05-18 cs.AI 74%

CodeDistiller: Automatically Generating Code Libraries for Scientific Coding Agents

CodeDistiller:自动为科学编码代理生成代码库

Peter Jansen, Samiah Hassan, Pragnya Narasimha

机构 * University of Arizona(亚利桑那大学) Allen Institute for Artificial Intelligence(人工智能研究所)

专题命中 软件智能体 :coding agent(title);分类 cs.AI

AI总结 CodeDistiller通过自动提炼科学GitHub仓库代码,生成经过验证的领域特定代码库,提升科学发现系统实验的准确性与完整性。

Comments 8 pages, 3 figures, 3 tables. Accepted to ACL 2026 (Demo Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16191 2026-05-18 cs.CL cond-mat.other physics.comp-ph 57%

Optimized Three-Dimensional Photovoltaic Structures with LLM guided Tree Search

优化的三维光伏结构与LLM引导的树搜索

Michael P. Brenner, Lizzie Dorfman, John C. Platt

机构 * Google Research School of Engineering and Applied Sciences, Harvard University(谷歌研究工程与应用科学学院,哈佛大学) Google Research(谷歌研究)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 本文利用AI编码系统生成新型科学假设,通过LLM驱动的树搜索算法优化三维光伏结构,解决中纬度地区传统光伏板的效率瓶颈问题。

Comments 10 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15640 2026-05-18 cs.CV 50%

Learning Disentangled Representations for Generalized Multi-view Clustering

学习解耦表示以实现通用多视图聚类

Xin Zou, Ruimeng Liu, Chang Tang, Zhenglai Li, Xinwang Liu, Kunlun He, Wanqing Li

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能方向) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Computer, National University of Defense Technology(国防科技大学计算机学院) Medical Big Data Research Center, Medical Engineering Laboratory of Chinese PLA General Hospital(中国人民解放军总医院医学大数据研究中心,医学工程实验室) School of Computing and Information Technology, University of Wollongong(沃林根大学计算与信息学院)

专题命中 软件智能体 :repository(abstract)

AI总结 本文提出GMAE框架,通过解耦表示学习保留多视图互补性,提升聚类效果。实验表明其在完整和不完整多视图聚类任务中均优于现有方法。

Comments accepted by IEEE TPAMI 2026 (IEEE Transactions on Pattern Analysis and Machine Intelligence)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2605.15669 2026-05-18 cs.LG 57%

Rule2DRC: Benchmarking LLM Agents for DRC Script Synthesis with Execution-Guided Test Generation

Rule2DRC:用于DRC脚本合成的LLM代理基准测试

Jinuk Kim, Junsoo Byun, Donghwi Hwang, Seong-Jin Park, Hyun Oh Song

机构 * Department of Computer Science and Engineering, Seoul National University(首尔国立大学计算机科学与工程系) Neural Processing Research Center(神经处理研究所以) Samsung Electronics Co., Ltd(三星电子公司)

专题命中 测试生成 :coding agent(abstract);分类 cs.LG

AI总结 Rule2DRC是一个大规模基准,用于评估DRC脚本生成代理,包含1000个规则到脚本任务和13921个用于执行评分的评估芯片布局。它提供了一种通过DRC执行结果衡量功能正确性的评估流程,并引入SplitTester生成区分性测试用例以提升Best-of-N选择性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 2 篇

2603.04459 2026-05-18 cs.CR cs.AI cs.SE 76%

Benchmark of Benchmarks: Unpacking Influence and Code Repository Quality in LLM Safety Benchmarks

基准的基准:解构影响与代码仓库质量在LLM安全基准中的作用

Junjie Chu, Xinyue Shen, Ye Leng, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心) University of Waterloo(滑铁卢大学) Flexera(Flexera公司)

专题命中 代码评测 :repository(title);分类 cs.SE、cs.AI

AI总结 本文通过系统研究31个LLM安全基准及382篇非基准论文,发现仅39%的基准仓库可直接运行,且缺乏伦理考量。研究揭示社区采用基准与作者声望和代码运行性相关,但与代码质量无关,指出安全基准可能存在安全隐患和不可比性问题。

Comments 24 pages. 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15226 2026-05-18 cs.AR cs.AI cs.SE 62%

Is Agentic AI Ready for Real-World Hardware Engineering? A Deep Dive with Phoenix-bench

代理AI是否准备好进行现实世界硬件工程?通过Phoenix-bench的深入探讨

Qingyun Zou, Feng Yu, Hongshi Tan, Bingsheng He, WengFai Wong

机构 * National University of Singapore(新加坡国立大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文通过Phoenix-bench评估代理AI在硬件工程中的表现,发现软件与硬件工程本质不同,且故障集中于设计控制流、验证测试用例等,定位精度比定位本身更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 3 篇

2605.15815 2026-05-18 cs.SE cs.CL cs.MA 81%

BootstrapAgent: Distilling Repository Setup into Reusable Agent Knowledge

BootstrapAgent: 将仓库设置提炼为可重用的代理知识

Sihan Fu, Oucheng Liu, Shiyuan Wang, Jin Shi, Chengkun Wei

机构 * Zhejiang University(浙江大学) The Australian National University(澳大利亚国立大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.CL

AI总结 BootstrapAgent通过提炼仓库初始化过程中的启发式知识,生成可验证的代理合同,提升代码代理在 unfamiliar repositories 的任务成功率和效率。

Comments 19 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10310 2026-05-18 cs.CV math.OC 50%

A Stochastic Birth-and-Death Approach for Street Furniture Geolocation in Urban Environments

面向复杂城市环境的街道设施地理定位的随机生灭方法

Evan Murphy, Marco Viola, Vladimir A. Krylov

机构 * School of Mathematical Sciences, Dublin City University(都柏林城市大学数学科学学院)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出基于能量地图的随机生灭优化算法,用于精确定位城市街道设施,通过整合地理空间信息提升定位精度,验证了其在大规模设施映射中的可行性。

Comments Accepted for publication in the Proceedings of the 27th Irish Machine Vision and Image Processing Conference (IMVIP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15654 2026-05-18 cs.RO 50%

PCASim: Promptable Closed-loop Adversarial Simulation for Urban Traffic Environment

PCASim:可提示的闭环对抗模拟用于城市交通环境

Chuancheng Zhang, Zhenhao Wang, Kaizheng Li, Yaran Lin, Qiang Guo, Bin Jiang

机构 * Shenzhen Research Institute of Shandong University(山东大学深圳研究院) School of Airspace Science and Engineering(空天科学与工程学院) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出PCASim框架,通过结合对抗场景生成与安全代理训练,提升城市交通环境中的安全性和鲁棒性,实验表明其在领域特定语言生成准确率、场景转换成功率和避障能力方面均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏