arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 291 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 测试生成 291 篇

2106.03816 2021-06-08 cs.CL cs.AI cs.IT math.IT 62%

Diversity driven Query Rewriting in Search Advertising

Akash Kumar Mohankumar, Nikit Begwani, Amit Singh

专题命中 测试生成 :repository(abstract);分类 cs.CL、cs.AI

Comments Accepted in KDD 2021, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.05676 2019-06-14 cs.SE cs.AI 62%

Sionnx: Automatic Unit Test Generator for ONNX Conformance

Xinli Cai, Peng Zhou, Shuhan Ding, Guoyang Chen, Weifeng Zhang

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04764 2024-05-08 cs.SE 61%

ChatUniTest: A Framework for LLM-Based Test Generation

Yinghao Chen, Zehao Hu, Chen Zhi, Junxiao Han, Shuiguang Deng, Jianwei Yin

专题命中 测试生成 :unit test generation(abstract,comments);分类 cs.SE

Comments This shorter version is accepted by the FSE 2024 Demonstrations Track, and the previous longer version titled "ChatUniTest: a ChatGPT-based automated unit test generation tool" can be found at arXiv:2305.04764v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09459 2026-08-11 cs.CL 版本更新 57%

From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models

从推理到代理:大型语言模型强化学习中的信用分配

Chenchen Zhang

机构 * Independent Researcher(独立研究员)

专题命中 测试生成 :repository(abstract);分类 cs.CL

AI总结 本文探讨了大型语言模型强化学习中信用分配问题,总结了47种方法,并提出了可重用的资源,指出从推理到代理的转变使信用分配更加复杂,推动了新的方法发展。

Comments 50 pages, 4 figures. v3: expanded to a unified 69-paper corpus through July 31, 2026; adds restored-state identification results, blind coding of a 42-paper full-text subset, a source-located reporting audit, the CA-ID Card, and replay-fidelity analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09222 2026-08-10 cs.SD cs.AI 版本更新 57%

GRM: Utility-Aware Jailbreak Attacks on Audio LLMs via Gradient-Ratio Masking

GRM:通过梯度比掩码实现音频大语言模型的效用感知越权攻击

Yunqiang Wang, Hengyuan Na, Di Wu, Miao Hu, Guocong Quan

机构 * Sun Yat-Sen University(中山大学)

专题命中 测试生成 :repository(abstract);分类 cs.AI

AI总结 本文提出GRM框架,通过频率选择性扰动在音频大语言模型中实现效用感知的越权攻击,实验表明其在攻击成功率与效用平衡方面优于基线方法。

Comments Accpeted by MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05822 2026-08-07 cs.SE 新提交 57%

Agent-Based Test Assertion Generation via Diverse Perspective Aggregation

基于智能体的多视角聚合测试断言生成

Dong Wang, Qiaoyu Han, Lin Yang, Jianyi Zhou, Guangtai Liang, Junjie Chen

专题命中 测试生成 :code generation(abstract);分类 cs.SE

AI总结 针对现有LLM断言生成方法的局限,提出基于智能体的AssertMate框架,通过三个组件聚合多视角,在Defects4J和EvoSuite验证中性能显著优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04857 2026-08-06 cs.CR cs.SE 新提交 57%

Hidden Ciphers and Where to Find Them: Static Discovery and Assessment of Cryptographic Assets in Software

隐藏的密码及其发现途径:软件中密码资产的静态发现与评估

Christian Näther, Eduard Hirsch

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 本文提出分类驱动的静态方法,可在不到6分钟处理57610个文件,发现370个密码资产(含6个CVE漏洞、52个后量子迁移候选),F1达0.75,助力密码资产发现与后量子迁移规划

Comments 22 pages, 8 figures, 5 tables, accepted at ICICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02310 2026-08-04 cs.CL 新提交 57%

An Evidence-Grounded Retrieval-Augmented Transformer Framework for Health Misinformation Verification

用于健康虚假信息验证的基于证据的检索增强Transformer框架

Isah M. Bukar, Bala Mairiga Abduljalil, Bashir Saleh Maina, Abdulbasit Hassan

机构 * Yobe State University(约贝州立大学) Yobe AI Research Laboratory (YAIR Lab)(约贝人工智能研究实验室) Novosibirsk State University(新西伯利亚国立大学) College of Computer Science and Engineering, Hamad Bin Khalifa University(哈马德·本·哈利法大学计算机科学与工程学院)

专题命中 测试生成 :repository(abstract);分类 cs.CL

AI总结 本研究针对发展中国家健康虚假信息验证的本地语境缺失问题,提出基于WHO和尼日利亚疾控中心证据的检索增强Transformer框架,经实验评估BERT模型表现最佳,为资源受限地区开发相关系统提供基础。

Comments 17 pages, 2 figures, To appear in the Reimagining knowledge systems for digital transformation and sustainable development in the 21st century conference 2026, faculty of social sciences education. Federal University of Education, Zaria

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10628 2026-08-04 cs.SE 版本更新 57%

On the Diffusion of Test Smells in LLM-Generated Unit Tests

论LLM生成的单元测试中测试异味的扩散

Wendkûuni C. Ouédraogo, Yinghua Li, Xueqi Dang, Xunzhu Tang, Anil Koyuncu, Jacques Klein, David Lo, Tegawendé F. Bissyandé

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE

AI总结 本研究通过多基准大规模分析,对比LLM生成、人类编写及EvoSuite生成的单元测试,发现LLM生成测试存在特定测试异味,受提示策略等影响,凸显基于LLM的测试生成的潜力与风险,呼吁开发相关优化方案。

Comments Accepted at Transactions on Software Engineering and Methodology (TOSEM) journal on 31 July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09695 2026-07-30 cs.SE 版本更新 57%

How well LLM-based test generation techniques perform with newer LLM versions?

基于新版本LLM的测试生成技术表现如何?

Michael Konstantinou, Renzo Degiovanni, Mike Papadakis

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE

AI总结 本文研究了基于新版本LLM的测试生成技术表现,发现纯LLM方法在覆盖率和变异评分上优于现有方法,且成本相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01232 2026-07-28 cs.DB cs.AI 版本更新 57%

Retrieval-Augmented Generation of Ontologies from Relational Databases

从关系数据库中检索增强生成本体

Nadeen Fathallah, Mojtaba Nayyeri, Athish A Yogi, Ratan Bahadur Thapa, Hans-Michael Tautenhahn, Anton Schnurpel, Steffen Staab

机构 * Institute for Artificial Intelligence, University of Stuttgart(人工智能研究所,斯图加特大学) University of Southampton(南安普顿大学) Universitätsklinikum Leipzig(莱比锡大学医院)

专题命中 测试生成 :repository(abstract);分类 cs.AI

AI总结 研究从关系数据库生成语义丰富的OWL2DL本体的问题,提出RIGOR方法,通过大语言模型驱动,从多源检索并迭代生成本体片段,经验证和纠正后集成,实验表明该方法优于基线且无需人工监督。

Comments Accepted in ISWC26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19742 2026-07-23 cs.CR cs.AI 新提交 57%

An Automated Framework for Extracting Reachable Attack Chains from Cyber Threat Intelligence Reports

一种从网络威胁情报报告中提取可达攻击链的自动化框架

Wenbo Hou, Ning Hu, Xueping Wang, Jiahao Gu, Wenjian Luo

机构 * Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东新型安全情报技术重点实验室) School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology(哈尔滨工业大学) New Network Research Department(新网络研究部) Peng Cheng Laboratory(鹏城实验室) Great Bay University(大湾区大学)

专题命中 测试生成 :repository(abstract);分类 cs.AI

AI总结 该研究针对CTI报告非结构化无法用于自动化攻击路径推理的问题,提出将攻击步骤建模为含条件和行为的单元,经多阶段管道结合大语言模型提取并规范化,编译成规则推理,在数据集上有更好表现,能有效提取可达攻击链。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19315 2026-07-23 cs.SE 57%

Improving LLM-Driven Test Generation by Learning from Mocking Information

通过学习模拟信息改进LLM驱动的测试生成

Jamie Lee, Flynn Teh, Hengcheng Zhu, Mengzhen Li, Mattia Fazzini, Valerio Terragni

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE

AI总结 本文提出MOCKMILL方法,利用开发者编写测试中的模拟信息自动生成测试用例,通过迭代生成与修复过程提升测试覆盖率和有效性。

Comments Accepted for publication in ICST 2026 (AIST workshop). This arXiv version is the authors' accepted manuscript

Journal ref IEEE Conference on Software Testing, Verification and Validation Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09689 2026-07-20 cs.AI math.PR math.ST stat.TH 版本更新 57%

Evidence-Aware MapReduce for Forkable Compute

玻尔兹曼MapReduce:可分叉沙盒的配分函数归约

Yossi Eliaz

机构 * Incredibuild(Incredibuild公司) HIT CS Department(以色列理工学院计算机科学系)

专题命中 测试生成 :repository(abstract);分类 cs.AI

AI总结 研究在局部渐近正态性下工作节点发出的置信密度,指出其为吉布斯 - 玻尔兹曼测度,逆温度是样本大小。高斯/线性下相关结果精确,MapReduce归约是配分函数,还有频率主义一致性等结论。

Comments N/A

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12068 2026-07-15 cs.SE 新提交 57%

Beyond Test Presence: Assessing the Quality and Robustness of Agent-Generated Tests in Open-Source Projects

超越测试存在:评估开源项目中代理生成测试的质量和稳健性

Preet Jhanglani, Zeel Kaushal Desai, Vidhi Kansara, Eman Abdullah AlOmar

专题命中 测试生成 :coding agent(abstract);分类 cs.SE

AI总结 研究开源项目中代理生成测试的质量和稳健性,通过对大量测试工件进行实证比较,用“白盒”静态分析框架评估质量维度,发现代理在边缘情况覆盖率上优于人类,但生成测试更易脆弱,揭示其缺乏编写稳定测试的“环境意识”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03194 2026-07-07 cs.SE 新提交 57%

TATG: Tracking-Aware Testing Objective for LLM-based Test Generation

TATG:基于大语言模型的测试生成的跟踪感知测试目标

Guancheng Wang, Qinghua Xu, Lionel C. Briand

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE

AI总结 针对复杂Java方法自动化单元测试生成难的问题,TATG提出基于大语言模型的单元测试生成方法,引入统一目标表示跟踪测试需求,采用两阶段工作流程,实验证明其相比其他方法有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01425 2026-07-07 cs.AI 新提交 57%

Agent4cs: A Multi-agent System for Code Summarization in Large Hierarchical Codebases

Agent4cs:面向大型分层代码库的代码摘要多智能体系统

Yongjian Tang, Ezgi Sarikayak, Doruk Tuncel, Jie M. Zhang, Thomas Runkler

机构 * Siemens AG(西门子股份公司) Technical University of Munich(慕尼黑工业大学) Kings College London(伦敦国王学院)

专题命中 测试生成 :repository(abstract);分类 cs.AI

AI总结 提出多智能体框架Agent4cs,通过自底向上方式对大型代码库进行摘要,包含摘要、关键词提取和质量保证三个智能体,在语义一致性和关键词覆盖率上分别提升8%和38%。

Comments Accepted to the main track of the 23rd European Conference on Multi-Agent Systems (EUMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30586 2026-06-30 cs.CR cs.LG 57%

A Hybrid Framework For Crypto-Ransomware Detection In Enterprise Shared Storage

面向企业共享存储的加密勒索软件混合检测框架

Gervais Hatungimana, Abdun Naser Mahmood, Mohammad Jabed Morshed Chowdhury

机构 * Department of Computer Science and Information Technology, La Trobe University(拉特罗布大学计算机科学与信息技术系)

专题命中 测试生成 :repository(abstract);分类 cs.LG

AI总结 提出一种混合检测框架,通过感兴趣区域(RoI)技术分析网络流量提取入侵指标(IoC),结合机器学习模型检测高规避性勒索软件变种,在共享存储环境中实现99.64%精度和0%漏报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19224 2026-06-30 cs.SE 57%

iCoRe: An Iterative Correlation-Aware Retriever for Bug Reproduction Test Generation

iCoRe: 一种迭代相关性感知的Bug重现测试生成检索器

Junyi Wang, Jialun Cao, Zhongxin Liu

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 本文提出iCoRe,一种迭代相关性感知的Bug重现测试生成检索器,通过区分源代码与测试用例的检索需求、结合文本语义与函数调用结构、以及实现检索与生成阶段的反馈循环,提升Bug重现测试生成的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27601 2026-06-29 cs.SE 新提交 57%

Test Case Selection for Deep Neural Networks: A Replication Study on LLMs for Code

深度神经网络的测试用例选择:面向代码的大语言模型的复现研究

Ali Asgari, Mitchell Olsthoorn, Annibale Panichella

专题命中 测试生成 :code model(abstract);分类 cs.SE

AI总结 本文对深度神经网络测试用例选择技术在代码大语言模型上的有效性进行了大规模复现研究,发现基于不确定性的特征对早期故障发现有效,而基于表示的特征对准确率估计更鲁棒,且性能因任务和模型而异。

Comments Accepted at ISSTA 2026, the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25588 2026-06-25 cs.SE 新提交 57%

IntentTester: Intent-Driven Multi-agent Framework for Cross-Library Test Migration

IntentTester:面向意图驱动的跨库测试迁移多智能体框架

Yi Gao, Ziyuan Zhang, Xing Hu, Xiaohu Yang, Xin Xia

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 提出IntentTester多智能体框架,通过将测试抽象为语言无关的测试描述语言(TDL),结合知识图谱对齐语义实体,并利用LLM推理与迭代验证生成可执行测试,实现跨库跨语言测试迁移,在9个开源项目上生成2776个测试,正确率85%,有效性74%,并发现多处隐藏缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16072 2026-06-17 cs.CR cs.AI 新提交 57%

MASCOT-Android: A Curated Dataset and Automated Collection Pipeline for Android Malware Source Code Specimens

MASCOT-Android: 一个用于安卓恶意软件源代码样本的精选数据集与自动收集管道

Bojing Li, Duo Zhong, Prajna Bhandary, Raguvir S, Charles Maxa, Robert J Joyce, Charles Nicholas

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 测试生成 :repository(abstract);分类 cs.AI

AI总结 提出MASCOT-Android数据集和自动收集框架,利用仓库级文档(README)训练LinearSVC分类器,以96.28%准确率和1.06%假阳性率从GitHub发现恶意软件源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10211 2026-06-10 cs.SE 新提交 57%

TestMap: Evidence Infrastructure for Foundation-Model-Assisted Test Generation

TestMap:基础模型辅助测试生成的证据基础设施

Hunter Leary, Luke Hanuska, Chris Brown

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 提出TestMap基础设施,自动化C#/.NET仓库的测试生成与验证,记录候选测试生命周期,支持多维度评估。

Comments 10 pages, 1 figure, 2 tables. Accepted to present at AIWare 2026 (arXiv Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08588 2026-06-09 cs.SE 新提交 57%

LLM vs. Human Unit Tests: Fault Detection on Real Python Bugs

LLM vs. 人类单元测试:对真实 Python 错误的故障检测

Phouvadeth Vathana, Prapti Bhatt, Rishi Patel, Nasir U. Eisty

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE

AI总结 通过对比 LLM 生成与人工编写的单元测试在真实 Python 错误上的故障检测能力,发现 LLM 结合检索增强上下文可检测 69% 的故障,远超人工测试的 17.2%,且代码覆盖率相近,表明覆盖率不足以衡量故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26428 2026-05-29 cs.CL cs.HC 57%

Slide Deck Q&A Quality Assurance App: A Multi-Stage Pipeline for Pedagogical Question Generation

Slide Deck Q&A 质量保证应用:面向教学问题生成的多阶段流水线

Jim Salsman

机构 * TalkNicer, Inc.(TalkNicer公司)

专题命中 测试生成 :repository(abstract);分类 cs.CL

AI总结 提出一个基于Flask的多阶段大语言模型流水线,从PDF幻灯片中提取文本和图像,生成结构化的教学问题集,并通过窗口规划、幻灯片合成、标注和协调四个阶段提高问题质量。

Comments 15 pages, 3 research questions, 1 figure, 1 table, 6 references, 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19369 2026-05-20 cs.SE 57%

When to Answer and When to Defer: A Decision Framework for Reliable Code Predictions

何时回答,何时延迟:一种可靠代码预测的决策框架

Ravishka Rathnasuriya, Wei Yang

专题命中 测试生成 :code model(abstract);分类 cs.SE

AI总结 本文提出了一种决策框架,用于在代码预测中可靠地判断何时回答何时延迟,通过整合不确定性估计、模型校准和工具基于的延迟处理,提高代码模型的可靠性。

Comments In Proceedings of the 48th IEEE/ACM International Conference on Software Engineering- New Idea and Emerging Results Track (ICSE-NIER 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15669 2026-05-18 cs.LG 57%

Rule2DRC: Benchmarking LLM Agents for DRC Script Synthesis with Execution-Guided Test Generation

Rule2DRC:用于DRC脚本合成的LLM代理基准测试

Jinuk Kim, Junsoo Byun, Donghwi Hwang, Seong-Jin Park, Hyun Oh Song

机构 * Department of Computer Science and Engineering, Seoul National University(首尔国立大学计算机科学与工程系) Neural Processing Research Center(神经处理研究所以) Samsung Electronics Co., Ltd(三星电子公司)

专题命中 测试生成 :coding agent(abstract);分类 cs.LG

AI总结 Rule2DRC是一个大规模基准,用于评估DRC脚本生成代理,包含1000个规则到脚本任务和13921个用于执行评分的评估芯片布局。它提供了一种通过DRC执行结果衡量功能正确性的评估流程,并引入SplitTester生成区分性测试用例以提升Best-of-N选择性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13275 2026-05-14 cs.SE 57%

ReproScore: Separating Readiness from Outcome in Research Software Reproducibility Assessment

ReproScore:在研究软件可重复性评估中区分准备度与结果

Sheeba Samuel, Daniel Mietchen, Jungsan Kim, Waqas Ahmed, Martin Gaedke

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 本文提出ReproScore框架,通过分离可重复性准备度(RRS)与可重复性结果(ROS),结合成覆盖适应性复合评分(RCS),以解决现有工具将静态仓库完整性误认为执行成功的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07442 2026-05-11 cs.LG 57%

GameGen-Verifier: Parallel Keypoint-Based Verification for LLM-Generated Games via Runtime State Injection

GameGen-Verifier:通过运行时状态注入实现LLM生成游戏的并行关键点验证

Chaobo Jia, Ruipeng Wan, Ting Sun, Weihao Tan, Borui Wan, Yuxuan Tong, Guangming Sheng, Hong Xu

机构 * CUHK(香港中文大学) HUST(华中科技大学) Lionrock AI Lab(Lionrock人工智能实验室) NTU(国立新加坡大学) HKU(香港大学)

专题命中 测试生成 :code generation(abstract);分类 cs.LG

AI总结 本文提出GameGen-Verifier,通过分解规范为可验证的关键点,实现LLM生成游戏的自动化验证,提升验证准确率并减少运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26523 2026-04-30 cs.SE 57%

RepoDoc: A Knowledge Graph-Based Framework to Automatic Documentation Generation and Incremental Updates

RepoDoc: 基于知识图谱的自动文档生成与增量更新框架

Dong Xu, Mingwei Liu, Xiwen Wang, Jianfeng Zhong, Zibin Zheng

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 RepoDoc通过构建仓库知识图谱,实现代码文档的自动化生成与增量更新,提升文档覆盖率和完整性,同时提高生成效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏