arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 24 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 测试生成 24 篇

2607.09101 2026-07-13 cs.SE 新提交 83%

Multi-Agent LLM Collaboration for Unit Test Generation via Human-Testing-Inspired Workflows

通过受人工测试启发的工作流程进行多智能体大语言模型协作以生成单元测试

Quanjun Zhang, Ye Shang, Siqi Gu, Jianyi Zhou, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 测试生成 :unit test generation(title,abstract);repository(abstract);分类 cs.SE

AI总结 研究针对现有基于大语言模型的单元测试生成方法的局限,提出TestAgent,通过多智能体协作机制模拟人工测试,设计专门智能体、配备工具API并构建知识图谱,在Java项目实验中取得优异结果,性能优于基线和搜索工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08983 2026-07-13 cs.SE cs.AI 新提交 81%

SCATE: Learning to Supervise Coding Agents for Cost-Effective Test Generation

SCATE:学习监督编码代理以实现经济高效的测试生成

Sijia Gu, Noor Nashid, Ali Mesbah

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 测试生成 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究针对编码代理惰性生成致代码覆盖不足问题,提出SCATE框架,将监督设为上下文博弈问题,依覆盖和可测试性指标选测试动作,集成不同编码代理,相比基线和其他方法有更高覆盖,能动态优化代理优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19682 2026-07-23 cs.SE 新提交 79%

Context Matters: Improving the Practical Reliability of LLM-Based Unit Test Generation

上下文很重要:提高基于大语言模型的单元测试生成的实际可靠性

Junjie Chen, Ziqi Wang, Lin Yang, Chen Yang, Xiao Chu, Jianyi Zhou, Guangtai Liang, Qianxiang Wang, Dong Wang

专题命中 测试生成 :unit test generation(title,abstract);分类 cs.SE

AI总结 研究基于大语言模型的单元测试生成在实际应用中的问题,提出上下文感知工作流程CATGen,通过明确依赖、稳定框架、静态分析等改进设计,经评估在实际项目和基准测试中提升编译成功率与覆盖率,减少生成时间和消耗。

Comments 23 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11573 2026-07-14 cs.SE 新提交 79%

Knowledge-Guided Synthetic Bug Feedback for LLM-Based Unit Test Generation

基于知识的合成错误反馈用于基于大语言模型的单元测试生成

Ziheng Wang, Maike Li, Chen Zhi

专题命中 测试生成 :unit test generation(title,abstract);分类 cs.SE

AI总结 研究如何将历史真实错误机制转化为可执行反馈目标用于基于大语言模型的单元测试生成,提出相应框架,在Defects4J任务上评估,结果显示该机制引导的合成错误反馈能提高真实错误检测率,是引导测试的有效方式。

Comments 12 pages, 7 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22883 2026-07-28 cs.SE cs.AI cs.LG 新提交 67%

Evaluating and Mitigating the Misguidance Effect of Buggy Code in LLM-Generated Unit Tests

评估和减轻大语言模型生成单元测试中错误代码的误导效应

Junda Zhao, Shurui Zhou, Eldan Cohen

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 研究大语言模型生成单元测试时错误代码的误导效应,提出新指标衡量,分析其双重影响,引入基于规范的单元测试生成范式,有效减少误导性测试,增加有效测试,改善测试生成管道,适用于各类代码。

Comments 24 pages, 7 figures, 12 tables. Accepted at ISSTA 2026; to appear in Proceedings of the ACM on Software Engineering (PACMSE), Vol. 3, No. ISSTA, Article ISSTA113

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10090 2026-08-12 cs.AI cs.LG 新提交 62%

CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation

CHORUS:用于高覆盖率测试平台激励生成的互补专家

Hejia Zhang, Sheng Lu, Zhongming Yu, Chia-Tung Ho, Brucek Khailany, Jishen Zhao

专题命中 测试生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对芯片设计中高覆盖率测试平台激励生成任务,提出CHORUS后训练框架,整合分阶段SFT与密集奖励RL得到的互补专家,构建4B模型,在CVDP-ECov上的Pass@1指标优于671B参数的DeepSeek-R1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08069 2026-08-11 cs.SE cs.AI 新提交 62%

HugSelect: An Explainable Multi-Criteria Decision-Support Framework for foundation-model selection

HugSelect:一种用于基础模型选择的可解释多标准决策支持框架

Alireza Joonbakhsh, Arda Canser Adalı, Slinger Jansen, Farshad Khunjush, Siamak Farshidi

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 HugSelect是用于基础模型选择的可解释多标准决策支持框架,构建含71274个模型的知识库,经多维度评估,推荐质量与商业系统相当,推理可追溯且实用直观。

Comments Pages: 29, Figures: 5. Corresponding authors: Alireza Joonbakhsh (alireza.joonbakhsh@hafez.shirazu.ac.ir) and Siamak Farshidi (siamak.farshidi@wur.nl)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17242 2026-07-21 cs.SE cs.AI 新提交 62%

A Large-Scale Measurement of AI Bill of Materials Completeness in Hugging Face Models

对Hugging Face模型中人工智能物料清单完整性的大规模测量

Md Erfan, Ahmed Ryan, Md Rayhanur Rahman

机构 * Department of Computer Science, The University of Alabama(计算机科学系,阿拉巴马大学)

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文以Hugging Face模型库为案例,研究人工智能物料清单(AIBOMs)完整性。通过检查大量工件评估AIBOMs在多方面表现,发现其结构覆盖完整,但特定文档完整性有限,部分字段缺失。研究结果推动改进相关实践以促进更完整AIBOMs的生成和采用。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04786 2026-07-07 cs.SE cs.AI cs.MA 新提交 62%

An Exploration of Agentic Information Fusion for Test Maintenance Prediction

用于测试维护预测的智能信息融合探索

Jingxiong Liu, Nasser Mohammadiha, Gregory Gay

机构 * Chalmers University of Technology and University of Gothenburg(楚德斯技术大学和戈特堡大学) Ericsson AB(爱立信有限公司) University of Gothenburg(戈特堡大学)

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究针对测试维护预测问题,提出多智能体框架MAST,通过智能融合多种分析方法及后检查程序,在实际场景中评估,提升了测试维护预测水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19352 2026-06-19 cs.CL cs.AI 新提交 62%

Sign-Language Datasets at Scale: A Comprehensive Survey on Resources, Benchmarks, and Annotation Standards

大规模手语数据集:资源、基准和标注标准的综合调查

Yiming Ni, Zhi-Qi Cheng, Jiayu Li, Wei Cheng

机构 * Tacoma School of Engineering & Technology, University of Washington(华盛顿大学塔科马工程与技术学院)

专题命中 测试生成 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文调查了35种手语的120个数据集,分析了模态不平衡、标注粒度和手语者偏差等挑战,并提出了24字段手语数据表以支持标准化文档和可复现评估。

Comments Accepted to ACL 2026 Main. 27 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05822 2026-08-07 cs.SE 新提交 57%

Agent-Based Test Assertion Generation via Diverse Perspective Aggregation

基于智能体的多视角聚合测试断言生成

Dong Wang, Qiaoyu Han, Lin Yang, Jianyi Zhou, Guangtai Liang, Junjie Chen

专题命中 测试生成 :code generation(abstract);分类 cs.SE

AI总结 针对现有LLM断言生成方法的局限,提出基于智能体的AssertMate框架,通过三个组件聚合多视角,在Defects4J和EvoSuite验证中性能显著优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04857 2026-08-06 cs.CR cs.SE 新提交 57%

Hidden Ciphers and Where to Find Them: Static Discovery and Assessment of Cryptographic Assets in Software

隐藏的密码及其发现途径:软件中密码资产的静态发现与评估

Christian Näther, Eduard Hirsch

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 本文提出分类驱动的静态方法,可在不到6分钟处理57610个文件,发现370个密码资产(含6个CVE漏洞、52个后量子迁移候选),F1达0.75,助力密码资产发现与后量子迁移规划

Comments 22 pages, 8 figures, 5 tables, accepted at ICICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02310 2026-08-04 cs.CL 新提交 57%

An Evidence-Grounded Retrieval-Augmented Transformer Framework for Health Misinformation Verification

用于健康虚假信息验证的基于证据的检索增强Transformer框架

Isah M. Bukar, Bala Mairiga Abduljalil, Bashir Saleh Maina, Abdulbasit Hassan

机构 * Yobe State University(约贝州立大学) Yobe AI Research Laboratory (YAIR Lab)(约贝人工智能研究实验室) Novosibirsk State University(新西伯利亚国立大学) College of Computer Science and Engineering, Hamad Bin Khalifa University(哈马德·本·哈利法大学计算机科学与工程学院)

专题命中 测试生成 :repository(abstract);分类 cs.CL

AI总结 本研究针对发展中国家健康虚假信息验证的本地语境缺失问题,提出基于WHO和尼日利亚疾控中心证据的检索增强Transformer框架,经实验评估BERT模型表现最佳,为资源受限地区开发相关系统提供基础。

Comments 17 pages, 2 figures, To appear in the Reimagining knowledge systems for digital transformation and sustainable development in the 21st century conference 2026, faculty of social sciences education. Federal University of Education, Zaria

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19742 2026-07-23 cs.CR cs.AI 新提交 57%

An Automated Framework for Extracting Reachable Attack Chains from Cyber Threat Intelligence Reports

一种从网络威胁情报报告中提取可达攻击链的自动化框架

Wenbo Hou, Ning Hu, Xueping Wang, Jiahao Gu, Wenjian Luo

机构 * Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东新型安全情报技术重点实验室) School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology(哈尔滨工业大学) New Network Research Department(新网络研究部) Peng Cheng Laboratory(鹏城实验室) Great Bay University(大湾区大学)

专题命中 测试生成 :repository(abstract);分类 cs.AI

AI总结 该研究针对CTI报告非结构化无法用于自动化攻击路径推理的问题,提出将攻击步骤建模为含条件和行为的单元,经多阶段管道结合大语言模型提取并规范化,编译成规则推理,在数据集上有更好表现,能有效提取可达攻击链。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12068 2026-07-15 cs.SE 新提交 57%

Beyond Test Presence: Assessing the Quality and Robustness of Agent-Generated Tests in Open-Source Projects

超越测试存在:评估开源项目中代理生成测试的质量和稳健性

Preet Jhanglani, Zeel Kaushal Desai, Vidhi Kansara, Eman Abdullah AlOmar

专题命中 测试生成 :coding agent(abstract);分类 cs.SE

AI总结 研究开源项目中代理生成测试的质量和稳健性,通过对大量测试工件进行实证比较,用“白盒”静态分析框架评估质量维度,发现代理在边缘情况覆盖率上优于人类,但生成测试更易脆弱,揭示其缺乏编写稳定测试的“环境意识”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03194 2026-07-07 cs.SE 新提交 57%

TATG: Tracking-Aware Testing Objective for LLM-based Test Generation

TATG:基于大语言模型的测试生成的跟踪感知测试目标

Guancheng Wang, Qinghua Xu, Lionel C. Briand

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE

AI总结 针对复杂Java方法自动化单元测试生成难的问题,TATG提出基于大语言模型的单元测试生成方法,引入统一目标表示跟踪测试需求,采用两阶段工作流程,实验证明其相比其他方法有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01425 2026-07-07 cs.AI 新提交 57%

Agent4cs: A Multi-agent System for Code Summarization in Large Hierarchical Codebases

Agent4cs:面向大型分层代码库的代码摘要多智能体系统

Yongjian Tang, Ezgi Sarikayak, Doruk Tuncel, Jie M. Zhang, Thomas Runkler

机构 * Siemens AG(西门子股份公司) Technical University of Munich(慕尼黑工业大学) Kings College London(伦敦国王学院)

专题命中 测试生成 :repository(abstract);分类 cs.AI

AI总结 提出多智能体框架Agent4cs,通过自底向上方式对大型代码库进行摘要,包含摘要、关键词提取和质量保证三个智能体,在语义一致性和关键词覆盖率上分别提升8%和38%。

Comments Accepted to the main track of the 23rd European Conference on Multi-Agent Systems (EUMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27601 2026-06-29 cs.SE 新提交 57%

Test Case Selection for Deep Neural Networks: A Replication Study on LLMs for Code

深度神经网络的测试用例选择:面向代码的大语言模型的复现研究

Ali Asgari, Mitchell Olsthoorn, Annibale Panichella

专题命中 测试生成 :code model(abstract);分类 cs.SE

AI总结 本文对深度神经网络测试用例选择技术在代码大语言模型上的有效性进行了大规模复现研究,发现基于不确定性的特征对早期故障发现有效,而基于表示的特征对准确率估计更鲁棒,且性能因任务和模型而异。

Comments Accepted at ISSTA 2026, the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25588 2026-06-25 cs.SE 新提交 57%

IntentTester: Intent-Driven Multi-agent Framework for Cross-Library Test Migration

IntentTester:面向意图驱动的跨库测试迁移多智能体框架

Yi Gao, Ziyuan Zhang, Xing Hu, Xiaohu Yang, Xin Xia

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 提出IntentTester多智能体框架,通过将测试抽象为语言无关的测试描述语言(TDL),结合知识图谱对齐语义实体,并利用LLM推理与迭代验证生成可执行测试,实现跨库跨语言测试迁移,在9个开源项目上生成2776个测试,正确率85%,有效性74%,并发现多处隐藏缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16072 2026-06-17 cs.CR cs.AI 新提交 57%

MASCOT-Android: A Curated Dataset and Automated Collection Pipeline for Android Malware Source Code Specimens

MASCOT-Android: 一个用于安卓恶意软件源代码样本的精选数据集与自动收集管道

Bojing Li, Duo Zhong, Prajna Bhandary, Raguvir S, Charles Maxa, Robert J Joyce, Charles Nicholas

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 测试生成 :repository(abstract);分类 cs.AI

AI总结 提出MASCOT-Android数据集和自动收集框架,利用仓库级文档(README)训练LinearSVC分类器,以96.28%准确率和1.06%假阳性率从GitHub发现恶意软件源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10211 2026-06-10 cs.SE 新提交 57%

TestMap: Evidence Infrastructure for Foundation-Model-Assisted Test Generation

TestMap:基础模型辅助测试生成的证据基础设施

Hunter Leary, Luke Hanuska, Chris Brown

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 提出TestMap基础设施,自动化C#/.NET仓库的测试生成与验证,记录候选测试生命周期,支持多维度评估。

Comments 10 pages, 1 figure, 2 tables. Accepted to present at AIWare 2026 (arXiv Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08588 2026-06-09 cs.SE 新提交 57%

LLM vs. Human Unit Tests: Fault Detection on Real Python Bugs

LLM vs. 人类单元测试:对真实 Python 错误的故障检测

Phouvadeth Vathana, Prapti Bhatt, Rishi Patel, Nasir U. Eisty

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE

AI总结 通过对比 LLM 生成与人工编写的单元测试在真实 Python 错误上的故障检测能力,发现 LLM 结合检索增强上下文可检测 69% 的故障,远超人工测试的 17.2%,且代码覆盖率相近,表明覆盖率不足以衡量故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12583 2026-08-14 q-fin.CP 新提交 50%

Diffusion Models in Finance: A Survey

金融中的扩散模型:一项综述

Zhuohan Wang, Carmine Ventre

专题命中 测试生成 :repository(abstract)

AI总结 该综述聚焦金融领域的扩散族生成模型,按金融数据类型分类梳理相关研究,是首个针对金融数据扩散族模型的专门综述,还开源了相关代码仓库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11436 2026-08-13 cs.CR 新提交 50%

When Agents Talk: Honeytokens under Shared Memory

当智能体对话时:共享内存下的蜜罐

Joshua S. Gans

专题命中 测试生成 :repository(abstract)

AI总结 该研究通过2026年网络能力评估案例,分析共享内存下蜜罐的安全缺陷,提出将令牌身份存于私有引用监视器等架构应对方案,指出蜜罐仍需单独安全边界。

Comments artificial intelligence, cybersecurity, honeytokens, defensive deception, shared memory, intrusion detection

详情

展开后加载摘要…

URL PDF HTML 收藏