arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 291 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 测试生成 291 篇

2601.05542 2026-01-12 cs.SE cs.AI cs.LG 67%

Understanding LLM-Driven Test Oracle Generation

理解由大语言模型驱动的测试 oracle 生成

Adam Bodicoat, Gunel Jahangirova, Valerio Terragni

机构 * University of Auckland(奥克兰大学) King's College London(伦敦国王学院)

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文研究了大语言模型在生成测试 oracle 以暴露软件故障中的有效性,探讨了提示策略和上下文输入对 oracle 质量的影响。

Comments Accepted for presentation at the 2nd ACM/IEEE International Conference on AI-powered Software (AIware 2025)

Journal ref Proc. 2nd ACM/IEEE International Conference on AI-powered Software (AIware 2025), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22065 2025-07-31 cs.SE cs.AI cs.CR cs.PL 67%

Fuzzing: Randomness? Reasoning! Efficient Directed Fuzzing via Large Language Models

Xiaotao Feng, Xiaogang Zhu, Kun Hu, Jincheng Wang, Yingjie Cao, Guang Gong, Jianfeng Pan

机构 * Security Technology Inc.(360安全技术公司) School of Science Edith Cowan University(科学学院,埃迪斯科文大学)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.PL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12952 2025-02-10 cs.SE cs.AI cs.LG 67%

SWT-Bench: Testing and Validating Real-World Bug-Fixes with Code Agents

Niels Mündler, Mark Niklas Müller, Jingxuan He, Martin Vechev

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

Comments 20 pages, 14 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02883 2024-12-05 cs.SE cs.CL cs.LG 67%

TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?

Toufique Ahmed, Martin Hirzel, Rangeet Pan, Avraham Shinnar, Saurabh Sinha

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11769 2024-10-17 cs.SE cs.AI cs.LG 67%

Can Search-Based Testing with Pareto Optimization Effectively Cover Failure-Revealing Test Inputs?

Lev Sorokin, Damir Safin, Shiva Nejati

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI、cs.LG

Comments Accepted for publication by Empirical Software Engineering Journal (EMSE) (in October 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.10481 2021-03-22 cs.SE cs.LG cs.PL 67%

K-CONFIG: Using Failing Test Cases to Generate Test Cases in GCC Compilers

Md Rafiqul Islam Rabin, Mohammad Amin Alipour

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.LG、cs.PL

Comments ASE 2019 Late Breaking Results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10090 2026-08-12 cs.AI cs.LG 新提交 62%

CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation

CHORUS:用于高覆盖率测试平台激励生成的互补专家

Hejia Zhang, Sheng Lu, Zhongming Yu, Chia-Tung Ho, Brucek Khailany, Jishen Zhao

专题命中 测试生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对芯片设计中高覆盖率测试平台激励生成任务,提出CHORUS后训练框架,整合分阶段SFT与密集奖励RL得到的互补专家,构建4B模型,在CVDP-ECov上的Pass@1指标优于671B参数的DeepSeek-R1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08069 2026-08-11 cs.SE cs.AI 新提交 62%

HugSelect: An Explainable Multi-Criteria Decision-Support Framework for foundation-model selection

HugSelect:一种用于基础模型选择的可解释多标准决策支持框架

Alireza Joonbakhsh, Arda Canser Adalı, Slinger Jansen, Farshad Khunjush, Siamak Farshidi

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 HugSelect是用于基础模型选择的可解释多标准决策支持框架,构建含71274个模型的知识库,经多维度评估,推荐质量与商业系统相当,推理可追溯且实用直观。

Comments Pages: 29, Figures: 5. Corresponding authors: Alireza Joonbakhsh (alireza.joonbakhsh@hafez.shirazu.ac.ir) and Siamak Farshidi (siamak.farshidi@wur.nl)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17242 2026-07-21 cs.SE cs.AI 新提交 62%

A Large-Scale Measurement of AI Bill of Materials Completeness in Hugging Face Models

对Hugging Face模型中人工智能物料清单完整性的大规模测量

Md Erfan, Ahmed Ryan, Md Rayhanur Rahman

机构 * Department of Computer Science, The University of Alabama(计算机科学系,阿拉巴马大学)

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文以Hugging Face模型库为案例,研究人工智能物料清单(AIBOMs)完整性。通过检查大量工件评估AIBOMs在多方面表现,发现其结构覆盖完整,但特定文档完整性有限,部分字段缺失。研究结果推动改进相关实践以促进更完整AIBOMs的生成和采用。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04786 2026-07-07 cs.SE cs.AI cs.MA 新提交 62%

An Exploration of Agentic Information Fusion for Test Maintenance Prediction

用于测试维护预测的智能信息融合探索

Jingxiong Liu, Nasser Mohammadiha, Gregory Gay

机构 * Chalmers University of Technology and University of Gothenburg(楚德斯技术大学和戈特堡大学) Ericsson AB(爱立信有限公司) University of Gothenburg(戈特堡大学)

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究针对测试维护预测问题,提出多智能体框架MAST,通过智能融合多种分析方法及后检查程序,在实际场景中评估,提升了测试维护预测水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11086 2026-07-07 cs.SE cs.AI 版本更新 62%

Evaluating LLM-Based Regression Test Generation

基于大语言模型的回归测试生成评估

Jing Liu, Seongmin Lee, Eleonora Losiouk, Marcel Böhme

机构 * MPI-SP(Max Planck Institute for Software Process Engineering) University of California at Los Angeles(加州大学洛杉矶分校) University of Padua(帕多瓦大学)

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究利用大语言模型为特定程序即时生成回归测试,将其作为机器翻译任务,通过对多个项目测试,反馈导向的零样本原型Cleverest表现良好,还探讨了提交消息对其效果的影响。

Comments 23 pages. Published in PACMSE Volume 3, Issue FSE. Artifact of Paper "Evaluating LLM-based Regression Test Generation": https://dl.acm.org/do/10.5281/zenodo.19616584

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19352 2026-06-19 cs.CL cs.AI 新提交 62%

Sign-Language Datasets at Scale: A Comprehensive Survey on Resources, Benchmarks, and Annotation Standards

大规模手语数据集:资源、基准和标注标准的综合调查

Yiming Ni, Zhi-Qi Cheng, Jiayu Li, Wei Cheng

机构 * Tacoma School of Engineering & Technology, University of Washington(华盛顿大学塔科马工程与技术学院)

专题命中 测试生成 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文调查了35种手语的120个数据集,分析了模态不平衡、标注粒度和手语者偏差等挑战,并提出了24字段手语数据表以支持标准化文档和可复现评估。

Comments Accepted to ACL 2026 Main. 27 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03608 2026-06-03 cs.LG cs.AI 62%

Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification

利用验证-生成差距:基于置信度条件的测试时强化学习

Jiahui Li, Jianfeng Shan, Wenpei Chen, Shunyu Wu, Jian Lou, Wenjie Feng, Dan Li, See-Kiong Ng

机构 * Sun Yat-Sen University(中山大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 测试生成 :repository(abstract);分类 cs.AI、cs.LG

AI总结 提出TTRL-CoCoV框架,通过置信度自适应机制解决无标签设置下Pass@k优化中的伪标签错误和多样性崩溃问题,显著提升Pass@1和Pass@k性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20213 2026-06-03 cs.SE cs.AI cs.CR 62%

CodeHacker: Automated Test Case Generation for Detecting Vulnerabilities in Competitive Programming Solutions

CodeHacker: 用于检测竞赛编程解决方案漏洞的自动化测试用例生成

Jingwei Shi, Xinxiang Yin, Jing Huang, Jinman Zhao, Shengyu Tao

机构 * Shanghai University of Finance and Economics(上海金融学院) Northwestern Polytechnical University(西北工业大学) Meituan(美团) University of Toronto(多伦多大学)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出CodeHacker框架,通过多策略对抗测试用例生成(压力测试、反哈希攻击、逻辑特定攻击)和校准阶段,有效暴露程序漏洞,提升测试集真负率并增强RL训练模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06485 2026-05-13 cs.LG cs.AI 62%

Inference-Time Code Selection via Symbolic Equivalence Partitioning

推理时通过符号等价划分进行代码选择

David Cho, Yifan Wang, Fanping Sui, Ananth Grama

机构 * Texas Instruments(德州仪器)

专题命中 测试生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SEP框架,通过符号执行将候选程序划分为功能等价类,提升推理时代码选择的准确性,无需辅助测试生成或额外LLM推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16790 2026-04-21 cs.SE cs.AI 62%

Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering

循环中的偏见:用于软件工程的LLM作为评判者的审计

Zixiao Zhao, Amirreza Esmaeili, Fatemeh Fard

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文研究了LLM作为评判者在代码评估中的偏见问题,通过测量优先的方法分析了代码生成、修复和测试生成任务中的评判制度,并发现提示偏见显著影响评判结果,甚至改变任务结论和模型排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16771 2026-04-14 cs.SE cs.LG 62%

Enabling Global, Human-Centered Explanations for LLMs:From Tokens to Interpretable Code and Test Generation

使大语言模型具备全球、以人为本的解释能力:从token到可解释的代码和测试生成

Dipin Khati, Daniel Rodriguez-Cardenas, David N. Palacio, Alejandro Velasco, Michele Tufano, Denys Poshyvanyk

机构 * Microsoft(微软) Google(谷歌)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 本文提出code rationales框架,通过将token级解释映射到高层编程类别,实现大语言模型代码生成的全局可解释性,验证了其在减少解释不确定性方面的有效性。

Comments Accepted to ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03135 2026-04-06 cs.SE cs.AI 62%

AI-Assisted Unit Test Writing and Test-Driven Code Refactoring: A Case Study

AI辅助的单元测试编写与测试驱动的代码重构:一个案例研究

Ema Smolic, Mario Brcic, Luka Hobor, Mihael Kovac

机构 * Faculty of Electrical Engineering and Computing, University of Zagreb(萨格勒布大学电气工程与计算学院)

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE、cs.AI

AI总结 本文研究了利用AI生成单元测试并进行安全重构的方法,通过案例展示如何通过迭代测试捕获系统行为,减少重构风险,提升代码维护效率。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25768 2026-03-30 cs.SE cs.AI cs.AR cs.MA 62%

UCAgent: An End-to-End Agent for Block-Level Functional Verification

UCAgent:一种端到端的块级功能验证代理

Junyue Wang, Zhicheng Yao, Yan Pi, Xiaolong Li, Fangyuan Song, Jinru Wang, Yunlong Xie, Sa Wang, Yungang Bao

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Beijing Institute of Open Source Chip(北京开源芯片研究院)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 UCAgent通过构建纯Python验证环境和31阶段细粒度验证流程,解决传统方法在复杂半导体设计验证中的不足,实现98.5%的代码覆盖率和100%的功能覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23443 2026-03-25 cs.SE cs.AI 62%

Evaluating LLM-Based Test Generation Under Software Evolution

评估基于大语言模型的测试生成在软件演化中的表现

Sabaat Haroon, Mohammad Taha Khan, Muhammad Ali Gulzar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE、cs.AI

AI总结 研究评估了基于大语言模型的测试生成在软件演化中的性能,发现其在代码变化时表现下降,测试覆盖和回归检测能力不足。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08254 2026-02-27 cs.SE cs.AI 62%

Toward Automated Validation of Language Model Synthesized Test Cases using Semantic Entropy

迈向利用语义熵自动验证语言模型合成测试用例

Hamed Taherkhani, Jiho Shin, Muhammad Ammar Tahir, Md Rakib Hossain Misu, Vineet Sunil Gattani, Hadi Hemmati

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出VALTEST框架,利用语义熵自动验证LLM生成的测试用例,提升测试有效性与代码生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13611 2026-02-17 cs.SE cs.AI 62%

From What to How: Bridging User Requirements with Software Development Using Large Language Models

从‘是什么’到‘如何做’:利用大型语言模型弥合用户需求与软件开发之间的鸿沟

Xiao He, Ru Chen, Jialun Cao

机构 * University of Science and Technology Beijing(北京科技大学) Hong Kong University of Science and Technology(香港科学大学) University of Science(科学大学)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出DesBench基准测试,评估LLMs在软件设计相关任务中的表现,揭示LLMs在代码生成、面向对象建模及测试用例设计方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12424 2026-02-13 cs.SE cs.AI 62%

EvoGPT: Leveraging LLM-Driven Seed Diversity to Improve Search-Based Test Suite Generation

EvoGPT:利用LLM驱动的种子多样性改进基于搜索的测试套件生成

Lior Broide, Roni Stern, Argaman Mordoch

机构 * Faculty of Computer and Information Science(计算机与信息科学系) Ben-Gurion University of the Negev(内盖夫本·古里安大学)

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE、cs.AI

AI总结 EvoGPT结合LLM生成与进化算法优化,通过强制多样性提升测试套件生成的覆盖率和突变分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01285 2026-02-03 cs.LG cs.AI stat.ML 62%

Multi-LLM Adaptive Conformal Inference for Reliable LLM Responses

多LLM自适应置信推理用于可靠的LLM响应

Kangjun Noh, Seongchan Lee, Ilmun Kim, Kyungwoo Song

机构 * Department of Applied Statistics and Data Science, Yonsei University(应用统计与数据科学系,延世大学) Department of Mathematical Sciences, KAIST(数学科学系,韩国科学技术院)

专题命中 测试生成 :repository(abstract);分类 cs.AI、cs.LG

AI总结 多LLM自适应置信推理通过集成生成更准确的事实性分数,提升高风险领域中LLM响应的可靠性和准确性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22803 2026-02-02 cs.AI cs.SE 62%

CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning

CVeDRL: 一种通过难度感知强化学习实现的高效代码验证器

Ji Shi, Peiming Guo, Meishan Zhang, Miao Zhang, Xuebo Liu, Min Zhang, Weili Guan

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 CVeDRL通过难度感知强化学习提升代码验证效率,实现更高通过率和分支覆盖,参数更少,推理更快。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20882 2026-01-30 cs.SE cs.AI cs.CR 62%

DevOps-Gym: Benchmarking AI Agents in Software DevOps Cycle

DevOps-Gym: 在软件DevOps周期中评估AI代理的基准测试

Yuheng Tang, Kaijie Zhu, Bonan Ruan, Chuqi Zhang, Michael Yang, Hongwei Li, Suyue Guo, Tianneng Shi, Zekun Li, Christopher Kruegel, Giovanni Vigna, Dawn Song, William Yang Wang, Lun Wang, Yangruibo Ding, Zhenkai Liang, Wenbo Guo

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学) UC Berkeley(加州大学伯克利分校) Google(谷歌) UC Los Angeles(加州大学洛杉矶分校)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 DevOps-Gym通过700+真实任务评估AI代理在完整DevOps周期中的能力,揭示其在问题解决和测试生成方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18241 2026-01-27 cs.SE cs.AI 62%

TAM-Eval: Evaluating LLMs for Automated Unit Test Maintenance

TAM-Eval: 评估用于自动单元测试维护的LLM

Elena Bruches, Vadim Alperovich, Dari Baturova, Roman Derunets, Daniil Grebenkin, Georgy Mkrtchyan, Oleg Sedukhin, Mikhail Klementev, Ivan Bondarenko, Nikolay Bushkov, Stanislav Moiseev

机构 * Both authors contributed equally to this research.(共同作者)

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 TAM-Eval提出一个评估LLM在自动单元测试维护能力的框架和基准,通过测试套件创建、修复和更新三个场景,揭示LLM在真实测试维护中的局限性。

Comments Accepted for publication at the 9th Workshop on Validation, Analysis and Evolution of Software Tests (VST 2026), co-located with the the 33rd IEEE International Conference on Software Analysis, Evolution and Reengineering (SANER 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11688 2026-01-21 cs.SE cs.AI 62%

SpecMap: Hierarchical LLM Agent for Datasheet-to-Code Traceability Link Recovery in Systems Engineering

SpecMap:用于系统工程中datasheet到代码可追溯性链接恢复的分层LLM代理

Vedant Nipane, Pulkit Agrawal, Amit Singh

机构 * H2LooP.ai(H2LooP人工智能研究院)

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 SpecMap通过分层LLM代理实现嵌入式系统datasheet到代码的可追溯性链接恢复,提升映射精度与效率,支持自动化分析与下游应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08773 2026-01-14 cs.SE cs.AI 62%

Reliable Graph-RAG for Codebases: AST-Derived Graphs vs LLM-Extracted Knowledge Graphs

可靠的代码库图-RAG:基于AST的图与LLM提取的知识图谱

Manideep Reddy Chinthareddy

机构 * Software Engineer, Centerville, USA(美国辛斯维尔软件工程师)

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文比较了基于AST的图谱和LLM提取的知识图谱在代码库中的检索性能,发现确定性AST图谱在索引成本和多跳推理方面更具优势。

Comments 46 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22659 2025-12-22 cs.SE cs.AI 62%

A Systematic Literature Review on Detecting Software Vulnerabilities with Large Language Models

基于大语言模型的软件漏洞检测系统文献综述

Sabrina Kaniewski, Fabian Schmidt, Markus Enzweiler, Michael Menth, Tobias Heer

机构 * Esslingen University(埃斯林根大学) Institute for Intelligent Systems, Esslingen University(智能系统研究所,埃斯林根大学) Chair of Communication Networks, University of Tübingen(通信网络教研室,图宾根大学)

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文系统综述了基于大语言模型的软件漏洞检测研究,分析了263项研究,提出了细粒度分类法,识别关键限制,并为未来研究提供了方向。

Comments 43 pages + 20 pages references, 7 tables, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏