arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-03-30 至 2026-03-30 共收录 13 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 3 篇

2603.15159 2026-03-30 cs.SE cs.AI cs.CL 82%

To See is Not to Master: Teaching LLMs to Use Private Libraries for Code Generation

看清并非掌握:教LLM使用私有库进行代码生成

Yitong Zhang, Chengze Li, Ruize Chen, Guowei Yang, Xiaoran Jia, Yijie Ren, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Proxseer Inc.(Proxseer公司) School of Computer Science, Nanjing University(南京大学计算机科学与技术学院) Software Institute, Nanjing University(南京大学软件学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出PriCoder方法,通过自动生成数据教LLM有效调用私有库API,提升私有库代码生成能力,实验显示在多种设置下pass@1指标提升超20%。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26091 2026-03-30 cs.SE 79%

Search-Induced Issues in Web-Augmented LLM Code Generation: Detecting and Repairing Error-Inducing Pages

网页增强型大语言模型代码生成中的搜索诱导问题:检测与修复误导页面

Guoqing Wang, Zeyu Sun, Xiaofei Xie, Yizhou Chen, Yanchao Tan, Yifan Zhao, Dan Hao

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文研究了网页增强型LLM代码生成中因误导页面导致的搜索诱导问题,提出Sherlock框架用于检测、调试和修复问题页面,提升系统可靠性。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22687 2026-03-30 cs.CV 78%

GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning

GeoTikzBridge:推动多模态代码生成在几何感知与推理中的发展

Jiayin Sun, Caixia Sun, Boyu Yang, Hailin Li, Xiao Chen, Yi Zhang, Errui Ding, Liang Li, Chao Deng, Junlan Feng

机构 * JIUTIAN Research(九天研究院)

专题命中 代码生成 :code generation(title,abstract)

AI总结 本文提出GeoTikzBridge框架,通过基于tikz的代码生成提升局部几何感知和视觉推理能力,利用两个互补数据集训练模型,实现多模态大语言模型在几何问题解决中的先进性能。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2603.26664 2026-03-30 cs.SE cs.CL 84%

Learning to Commit: Generating Organic Pull Requests via Online Repository Memory

学习承诺:通过在线仓库记忆生成有机的拉取请求

Mo Li, L. H. Xu, Qitai Tan, Ting Cao, Yunxin Liu

机构 * Tsinghua University(清华大学)

专题命中 软件智能体 :repository(title,abstract);coding agent(abstract);分类 cs.SE、cs.CL

AI总结 本文提出Learning to Commit框架,通过在线仓库记忆提升生成拉取请求的有机性,通过对比历史提交改进代码风格和架构约束。

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26130 2026-03-30 cs.SE cs.AI 73%

SWE-PRBench: Benchmarking AI Code Review Quality Against Pull Request Feedback

SWE-PRBench:基于拉取请求反馈的AI代码审查质量基准测试

Deepak Kumar

专题命中 软件智能体 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 SWE-PRBench通过350个带人工标注的拉取请求评估AI代码审查质量,发现即使在代码生成基准测试中表现良好,AI在仅基于差异的配置下仍只能检测出人类标记问题的15-31%,表明AI代码审查距离人类专家表现仍有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08316 2026-03-30 cs.SE cs.AI 62%

SWE Context Bench: A Benchmark for Context Learning in Coding

SWE Context Bench: 一个用于编码上下文学习的基准测试

Jared Zhu, Minhao Hu, Junde Wu

机构 * Independent Researcher(独立研究员) University of Oxford(牛津大学) University of Edinburgh(爱丁堡大学) Technical University of Munich(慕尼黑工业大学) MemoraX AI National University of Singapore(新加坡国立大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出SWE-ContextBench基准,用于评估编程代理的上下文重用能力,通过1100个基础任务和376个相关任务,从GitHub问题和拉取请求中挖掘真实依赖关系,评估预测准确度、时间效率和成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2603.25768 2026-03-30 cs.SE cs.AI cs.AR cs.MA 62%

UCAgent: An End-to-End Agent for Block-Level Functional Verification

UCAgent:一种端到端的块级功能验证代理

Junyue Wang, Zhicheng Yao, Yan Pi, Xiaolong Li, Fangyuan Song, Jinru Wang, Yunlong Xie, Sa Wang, Yungang Bao

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Beijing Institute of Open Source Chip(北京开源芯片研究院)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 UCAgent通过构建纯Python验证环境和31阶段细粒度验证流程,解决传统方法在复杂半导体设计验证中的不足,实现98.5%的代码覆盖率和100%的功能覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 3 篇

2603.26137 2026-03-30 cs.SE cs.AI 81%

ATime-Consistent Benchmark for Repository-Level Software Engineering Evaluation

面向仓库级别的软件工程评估的时间一致性基准

Xianpeng, Sun, Haonan Sun, Tian Yu, Sheng Ma, Qincheng Zhang, Lifei Rao, Chen Tian

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出时间一致性基准方法,通过冻结仓库时间点并利用历史代码知识评估未来任务,展示提示构造对软件工程评估的重要性。

Comments 10 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25804 2026-03-30 cs.CL 79%

RealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task Evaluation

RealChart2Code:通过真实数据和多任务评估推进图表到代码生成

Jiajun Zhang, Yuying Li, Zhixun Li, Xingyu Guo, Jingzhuo Wu, Leqi Zheng, Yiran Yang, Jianke Zhang, Qingbin Li, Shannan Yan, Zhetong Li, Changguo Jia, Junfei Wu, Zilei Wang, Qiang Liu, Liang Wang

机构 * USTC(中国科学技术大学) THU(清华大学) CUHK(香港中文大学) UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) BNU(北京师范大学) BUPT(北京邮电大学) BIT(北京理工大学) PKU(北京大学)

专题命中 代码评测 :code generation(title,abstract);分类 cs.CL

AI总结 本文提出RealChart2Code基准,通过真实数据和多任务评估,评估VLMs在复杂图表生成中的性能,揭示其在多面板图表上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20660 2026-03-30 cs.LG cs.AI cs.SE 67%

The Dual-State Architecture for Reliable LLM Agents

双状态架构用于可靠的LLM代理

Matthew Thompson

机构 * Independent Researcher(独立研究者)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出双状态动作对DSAP,通过结合随机生成与确定性后置条件验证,提升LLM代理在软件工程中的可靠性,实验表明在1.2-2.1倍基准成本下可靠性提升达66个百分点。

Comments 18 pages, 2 figures, 5 tables. V2 extends and supersedes V1, introducing tri-state guard semantics, a three-level recovery hierarchy, and SWE-Bench boundary analysis

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 3 篇

2603.25770 2026-03-30 cs.SE cs.AI 88%

ReCUBE: Evaluating Repository-Level Context Utilization in Code Generation

ReCUBE:评估代码生成中仓库级上下文利用

Jiseung Hong, Benjamin G. Ascoli, Jinho D. Choi

机构 * Carnegie Mellon University(卡内基梅隆大学) Emory University(埃默里大学)

专题命中 仓库级理解 :code generation(title,abstract);repository(title,abstract);分类 cs.SE、cs.AI

AI总结 ReCUBE基准测试评估LLM在代码生成中利用仓库级上下文的有效性,通过重建掩码文件并使用依赖关系和文档作为上下文,发现即使先进模型在完整上下文设置下也仅达到37.57%的通过率,而引入Caller-Centric Exploration工具包可显著提升性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09395 2026-03-30 cond-mat.str-el cond-mat.stat-mech physics.comp-ph 50%

SmoQyDQMC.jl: A flexible implementation of determinant quantum Monte Carlo for Hubbard and electron-phonon interactions (version 2.0 release)

SmoQyDQMC.jl:一种灵活的确定性量子蒙特卡洛实现用于Hubbard和电子-声子相互作用(版本2.0发布)

Benjamin Cohen-Stead, Shruti Agarwal, Sohan Malkaruge Costa, James Neuhaus, Andy Tanjaroon Ly, Yutan Zhang, Richard Scalettar, Kipton Barros, Steven Johnston

专题命中 仓库级理解 :repository(abstract)

AI总结 本文介绍了SmoQyDQMC.jl 2.0版本,该工具支持广义紧束缚哈密顿量及Hubbard和电子-声子相互作用,采用优化的混合蒙特卡洛方法高效采样声子场,适用于低能声子分支模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25947 2026-03-30 eess.AS 50%

UPV_RIR_DB: A Structured Room Impulse Response Database with Hierarchical Metadata and Acoustic Indicators

UPV_RIR_DB:一个带有层次元数据和声学指标的结构化房间冲击响应数据库

Jesús García-Gamborino, Laura Fuster, Daniel de la Prida, Luis A. Azpicueta-Ruiz, Gema Piñero

专题命中 仓库级理解 :repository(abstract)

AI总结 本文介绍了UPV_RIR_DB,一个包含测量房间冲击响应(RIR)的结构化数据库,提供具有明确空间元数据和可追溯采集参数的声学数据。数据库包含166个多通道RIR文件,共18,976个单个冲击响应,通过层次化组织和元数据描述测量上下文,确保可追溯性和可重复分析。

Comments RIR Database available at ZENODO

详情

展开后加载摘要…

URL PDF HTML 收藏