arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-15 至 2026-05-15 共收录 26 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 12 篇

2605.14478 2026-05-15 cs.SE cs.AI cs.CL 85%

When Retrieval Hurts Code Completion: A Diagnostic Study of Stale Repository Context

当检索伤害代码补全:对过时仓库上下文的诊断研究

Haojun Weng, Qianqian Yang, Hao Fu, Haobin Pan, Xinwei Lv

机构 * Independent Researcher, California, USA(加利福尼亚独立研究员) Independent Researcher, Beijing, China(北京独立研究员)

专题命中 代码生成 :repository(title,abstract);code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文研究过时仓库片段是否对代码生成造成影响,通过对比不同检索条件发现,仅使用过时片段会显著增加错误引用,而加入当前证据可缓解问题。

Comments 31 pages, 2 tables. Submitted to Information and Software Technology (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21104 2026-05-15 cs.LG cs.PL 81%

BRIDGE: Building Representations In Domain Guided Program Synthesis

BRIDGE: 在领域引导的程序合成中构建表示

Robert Joseph George, Carson Eisenach, Udaya Ghai, Dominique Perrault-Joncas, Anima Anandkumar, Dean Foster

机构 * California Institute of Technology(加州理工学院) Amazon(亚马逊)

专题命中 代码生成 :program synthesis(title,abstract);分类 cs.LG、cs.PL

AI总结 BRIDGE通过多艺术ifacts程序合成框架提升Lean验证正确性,结合代码、规范和定理证明领域,提高生成效率和正确率。

Comments 41 pages, 10 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13864 2026-05-15 cs.PL 74%

Source-to-Source Transformations for GPU Code Generation

面向GPU代码生成的源到源转换

Julien de Castelnau, Thomas Koehler, Arthur Charguéraud, Clément Pit-Claudel

专题命中 代码生成 :code generation(title);分类 cs.PL

AI总结 本研究提出OptiGPU系统,通过源到源转换实现GPU编程的强安全性保障,减少传统方法在安全性和低层控制间的权衡,通过证明保留编译提升验证效率。

Comments Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14215 2026-05-15 cs.AI cs.LG q-bio.QM 62%

GenCircuit-RL: Reinforcement Learning from Hierarchical Verification for Genetic Circuit Design

GenCircuit-RL:基于分层验证的遗传电路设计强化学习

Noah Flynn

机构 * University of California, Berkeley, CA, USA(加州大学伯克利分校)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GenCircuit-RL框架,通过分层验证奖励和课程学习提升遗传电路设计的正确性与功能推理能力,实验表明其在功能推理任务中成功率提升14-16个百分点。

Comments Link: https://icml.cc/virtual/2026/poster/61789

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13935 2026-05-15 cs.LG cs.CL 62%

Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models

超越模式寻求强化学习:扩散语言模型的轨迹平衡后训练

Saba Ahmadi, Prasanna Parthasarathi, Yufei Cui

机构 * Noah’s Ark Lab(Noah’s Ark 实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TraFL方法,通过轨迹平衡目标提升扩散语言模型的后训练效果,在多个基准测试中均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14539 2026-05-15 cs.CL 57%

Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards

从失败中学习:具有可验证奖励的纠正导向策略优化

Mengjie Ren, Jie Lou, Boxi Cao, Xueru Wen, Hongyu Lin, Xianpei Han, Le Sun, Xing Yu, Yaojie Lu

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Xiaohongshu Inc(小红书公司)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文提出CIPO方法,通过将失败轨迹转化为纠正监督,提升大语言模型的推理和纠错能力,在11个基准测试中优于基线方法。

Comments Work on progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14503 2026-05-15 cs.SE 57%

Not All RAGs Are Created Equal: A Component-Wise Empirical Study for Software Engineering Tasks

并非所有RAG都同等有效:面向软件工程任务的组件级实证研究

Qiang Ke, Yanjie Zhao, Hongjin Leng, Shengming Zhao, Haoyu Wang

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文通过实证研究分析RAG组件对软件工程任务的影响,发现检索端组件尤其是检索算法对系统性能影响更大,BM25在多种任务中表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08374 2026-05-15 cs.AI 57%

MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs

MemQ:将Q学习整合到基于溯源DAG的自进化记忆代理中

Junwei Liao, Haoting Shi, Ruiwen Zhou, Jiaqian Wang, Shengtao Zhang, Wei Zhang, Ying Wen, Zhiyu Li, Feiyu Xiong, Bo Tang, Weinan Zhang, Muning Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学) Xidian University(西安电子科技大学) University of Science and Technology of China(中国科学技术大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 MemQ通过在溯源DAG中传播信用权重,改进记忆Q值的评估,提升多步任务的泛化能力,尤其在产生深层相关溯源链的任务中表现突出。

Comments 22 pages, 11 figures (containing 43 individual image panels total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14089 2026-05-15 cs.AI 57%

SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration

SkillFlow: 以流程驱动的递归技能进化用于代理编排

Mingda Zhang, Tiesunlong Shen, Haoran Luo, Wenjin Liu, Zikai Xiao, Erik Cambria, Xiaoying Tang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 SkillFlow通过流程驱动的递归技能进化解决代理编排中的策略崩溃、梯度方差高和无指导技能进化问题,实现高效任务编排。

Comments 49 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13898 2026-05-15 cs.SE 57%

Bidirectional Empowerment of Metamorphic Testing and Large Language Models: A Systematic Survey

双向赋能:变形测试与大语言模型的相互促进:系统综述

Zheng Zheng, Zenghui Zhou, Yinwang Xu, Daixu Ren, Tsong Yueh Chen

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文系统综述了93项研究,探讨变形测试与大语言模型之间的双向赋能关系,提出分类框架,分析其在验证、评估和自动化测试中的应用。

Comments Daixu Ren is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14718 2026-05-15 cs.CR 50%

Adapting AlphaEvolve to Optimize Fully Homomorphic Encryption on TPUs

将AlphaEvolve适应于优化TPUs上的全同态加密

Shruthi Gorantala, Jianming Tong, Asra Ali, Baiyu Li, Jonathan Katz, Jeremy Kun, Thomas Steinke, Abhradeep Thakurta, Julian Walker, Amir Yazdanbakhsh

专题命中 代码生成 :code generation(abstract)

AI总结 本文提出利用AlphaEvolve自动化优化TPUs上的全同态加密内核,通过进化搜索提升TFHE和CKKS方案的执行效率,减少延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06759 2026-05-15 cs.CR cs.HC 50%

"Tab, Tab, Bug": Security Pitfalls of Next Edit Suggestions in AI-Integrated IDEs

Tab,Tab,Bug:AI集成IDE中Next Edit Suggestions的安全隐患

Yunlong Lyu, Yixuan Tang, Peng Chen, Tian Dong, Xinyu Wang, Zhiqiang Dong, Hao Chen

专题命中 代码生成 :code generation(abstract)

AI总结 本文研究了AI集成IDE中的Next Edit Suggestions安全问题,揭示了其复杂的上下文检索机制和潜在攻击向量,通过实验室测试和在线调查发现NES易受上下文污染和交易性编辑影响,需加强安全教育和防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2605.14415 2026-05-15 cs.SE cs.AI cs.CL 82%

SWE-Chain: Benchmarking Coding Agents on Chained Release-Level Package Upgrades

SWE-Chain:基于链式发布级包升级的编码代理基准测试

Man Ho Lam, Chaozheng Wang, Hange Liu, Jingyu Xiao, Haau-sing Li, Jen-tse Huang, Terry Yue Zhuo, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Independent(独立) ELLIS Technical University of Darmstadt(达姆施塔特技术大学) Johns Hopkins University(约翰霍普金斯大学) Monash University(墨尔本大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 SWE-Chain通过链式发布级包升级评估编码代理,包含12个升级链和155个版本过渡,揭示当前代理在连续维护中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13950 2026-05-15 cs.LG cs.AI hep-ex hep-ph 62%

Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction

Collider-Bench:通过粒子物理分析复现评估AI代理

Darius A. Faroughy, Sofia Palacios Schweitzer, Ian Pang, Siddharth Mishra-Sharma, David Shih

机构 * New High Energy Theory Center(新高能理论中心) Department of Physics & Astronomy(物理与天文学系) Rutgers University(罗格斯大学) Faculty of Computing & Data Sciences(计算与数据科学学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Collider-Bench,评估AI代理能否仅通过公开论文和开源软件复现LHC实验分析,强调物理推理和领域知识的重要性,结果显示无代理能超越物理学家在环解决方案。

Comments 23 pages | 9 figures | 4 tables | Code: https://github.com/dfaroughy/Collider-Bench | Task Corpus: https://huggingface.co/datasets/Dariusfar/ColliderBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14671 2026-05-15 cond-mat.mtrl-sci cs.AI 57%

Agentic Design of Compositional Descriptors via Autoresearch for Materials Science Applications

通过Autoresearch进行组合描述符的代理设计用于材料科学应用

Matteo Cobelli, Stefano Sanvito

机构 * School of Physics(物理系) CRANN Institute, Trinity College, Dublin 2, Dublin, Ireland(CRANN研究所,三一学院,都柏林2号,都柏林,爱尔兰)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文通过Autoresearch框架设计输入描述符,利用大语言模型生成化学化合物的组合描述符,并通过随机森林工作流评估,提升了材料性质预测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12808 2026-05-15 cs.LG 57%

Neurodata Without Boredom: Benchmarking Agentic AI for Data Reuse

神经数据无厌倦:评估代理AI的数据重用基准测试

Ling-Qi Zhang, Kristin Branson

机构 * HHMI Janelia Research Campus(HHMI贾能利亚研究中心)

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 本文探讨了代理AI在神经数据重用中的应用,通过八篇研究论文评估了通用编码代理在处理多模态数据和任务解码中的表现,发现其在子任务中表现良好,但难以实现端到端无错误解决方案,提出了数据共享的最佳实践。

Comments v2: Added forgotten acknowledgments section

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15187 2026-05-15 cs.CV cs.GR cs.RO 50%

Articraft: An Agentic System for Scalable Articulated 3D Asset Generation

Articraft: 一种可扩展的拟人化3D资产生成代理系统

Matt Zhou, Ruining Li, Xiaoyang Lyu, Zhaomou Song, Zhening Huang, Chuanxia Zheng, Christian Rupprecht, Andrea Vedaldi, Shangzhe Wu

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :coding agent(abstract)

AI总结 本文提出Articraft代理系统,利用大语言模型生成大规模拟人化3D资产,构建了包含10000+资产的Articraft-10K数据集,应用于机器人仿真和虚拟现实等下游任务。

Comments Project page: https://articraft3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2605.14207 2026-05-15 cs.HC 50%

What Should Explanations Contain? A Human-Centered Explanation Content Model for Local, Post-Hoc Explanations

解释应包含什么?一种以人类为中心的解释内容模型用于局部、事后解释

Helmut Degen

专题命中 测试生成 :code model(abstract)

AI总结 本文通过混合归纳-演绎定性内容分析,提出了一种包含14个代码的解释内容模型,用于工业AI系统的局部事后解释,通过专家审查和编码复现性验证其有效性。

Comments paper has 36 pages (without references), 2 figures, and 2 tables; appendix has 165 pages; submitted to International Journal of Human-Computer Studies

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 4 篇

2603.04601 2026-05-15 cs.SE cs.AI cs.CL 67%

Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development

Vibe Code Bench:评估AI模型在端到端Web应用开发中的表现

Hung Tran, Langston Nashold, Rayan Krishnan, Antoine Bigeard, Alex Gu

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出Vibe Code Bench,通过100个Web应用规格和964个浏览器工作流评估AI模型在端到端应用开发中的性能,揭示了可靠开发仍为前沿挑战,并提出评估协议和人类对齐研究。

Comments 23 pages, 8 figures. Accepted to ACM CAIS 2026. Live leaderboard: https://www.vals.ai/benchmarks/vibe-code. Benchmark first released Nov 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07045 2026-05-15 cs.CV cs.AI 57%

VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing

VLRS-Bench: 一种面向遥感的视觉-语言推理基准

Zhiming Luo, Di Wang, Haonan Guo, Jing Zhang, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出VLRS-Bench,首个专注于复杂遥感推理的基准,包含2000个问题-答案对,涵盖14项任务和八个时间阶段,揭示现有MLLM在遥感任务中的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14651 2026-05-15 cs.CV 50%

TERRA-CD: Multi-Temporal Framework for Multi-class and Semantic Change Detection

TERRA-CD:多时相框架用于多类和语义变化检测

Omkar Oak, Rukmini Nazre, Rujuta Budke, Suraj Sawant

机构 * COEP Technological University, Pune, India(科帕尔技术大学,印度普纳) University of Massachusetts, Amherst, USA(马萨诸塞大学,美国阿姆赫斯特) North Carolina State University, USA(北卡罗来纳州立大学,美国)

专题命中 代码评测 :repository(abstract)

AI总结 本文提出TERRA-CD数据集,包含2019和2024年的Sentinel-2影像对,用于多类和语义变化检测,采用多种深度学习方法评估其有效性。

Comments Paper presented at 11th International Congress on Information and Communication Technology (ICICT) 2026, London

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18326 2026-05-15 cs.CV 50%

Enhancing Few-Shot Classification of Benchmark and Disaster Imagery with ABHFA-Net

通过ABHFA-Net增强基准和灾害图像的少样本分类

Gao Yu Lee, Tanmoy Dam, Md Meftahul Ferdaus, Daniel Puiu Poenar, Vu Duong

机构 * School of Mechanical and Aerospace Engineering (MAE), NTU(南洋理工大学机械与航空航天工程学院) Department of Computer Science, The University of New Orleans(新奥尔良大学计算机科学系)

专题命中 代码评测 :repository(abstract)

AI总结 本文提出ABHFA-Net,通过空间通道注意力机制和基于Bhattacharyya距离的对比softmax损失,提升少样本灾害图像分类性能,在基准和真实灾害数据集上均取得优异效果。

Comments Revised and Submitted to SN Computer journal

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 4 篇

2605.14362 2026-05-15 cs.SE cs.AI 81%

Correctness-Aware Repository Filtering Under Maximum Effective Context Window Constraints

在最大有效上下文窗口约束下的正确性感知仓库过滤

Shweta Mishra

机构 * Independent Researcher(独立研究者)

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出一种正确性感知的上下文卫生框架,通过预执行的大小基 heuristic 过滤器在 tokenization 前拦截仓库扫描,实现低开销的上下文优化,提升代码分析准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14231 2026-05-15 cs.LG cs.AI cs.SD 62%

AudioMosaic: Contrastive Masked Audio Representation Learning

AudioMosaic:基于对比学习的音频表示学习

Hanxun Huang, Qizhou Wang, Xingjun Ma, Cihang Xie, Christopher Leckie, Sarah Erfani

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院) Baskin School of Engineering, University of California, Santa Cruz, USA(加州大学圣克鲁兹分校工程学院) Institute of Trustworthy Embodied AI, Fudan University, China(复旦大学可信具身人工智能研究所)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 AudioMosaic通过结构化时频掩码构建正样本对,提升音频表示学习效果,实现跨数据集和声学条件的强迁移能力,优于生成方法。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14549 2026-05-15 cs.LO 50%

CSLibPremiseBench: Structure-Guided Premise Retrieval and Label Robustness for Lean 4 Computer-Science Theorems

CSLibPremiseBench: 结构引导的前提检索与标签鲁棒性用于Lean 4计算机科学定理

Junye Ji

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出CSLibPremiseBench,用于评估Lean 4定理和引理声明的前提检索,通过严格任务集和标签鲁棒性分析,探讨结构引导的重排方法。

Comments 12 pages, 10 tables; artifact available at https://doi.org/10.5281/zenodo.20176641

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14471 2026-05-15 cond-mat.mtrl-sci physics.comp-ph 50%

High-Pressure Crystal Structure Database

高压晶体结构数据库

Zhenyu Wang, Qingchang Wang, Junwen Duan, Heng Ge, Xiaoshan Luo, Pengyue Gao, Wei Zhang, Jian Lv, Yanchao Wang, Yanming Ma

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出高压晶体结构数据库HPCSD,整合实验与理论高压结构,通过统一DFT框架重新优化,提供标准化数据以加速实验相识别和机器学习势函数开发。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏