Diversity driven Query Rewriting in Search Advertising
专题命中 测试生成 :repository(abstract);分类 cs.CL、cs.AI
Comments Accepted in KDD 2021, 9 pages
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
专题命中 测试生成 :repository(abstract);分类 cs.CL、cs.AI
Comments Accepted in KDD 2021, 9 pages
专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI
专题命中 测试生成 :unit test generation(abstract,comments);分类 cs.SE
Comments This shorter version is accepted by the FSE 2024 Demonstrations Track, and the previous longer version titled "ChatUniTest: a ChatGPT-based automated unit test generation tool" can be found at arXiv:2305.04764v1
从推理到代理:大型语言模型强化学习中的信用分配
机构 * Independent Researcher(独立研究员)
专题命中 测试生成 :repository(abstract);分类 cs.CL
AI总结 本文探讨了大型语言模型强化学习中信用分配问题,总结了47种方法,并提出了可重用的资源,指出从推理到代理的转变使信用分配更加复杂,推动了新的方法发展。
Comments 50 pages, 4 figures. v3: expanded to a unified 69-paper corpus through July 31, 2026; adds restored-state identification results, blind coding of a 42-paper full-text subset, a source-located reporting audit, the CA-ID Card, and replay-fidelity analysis
GRM:通过梯度比掩码实现音频大语言模型的效用感知越权攻击
机构 * Sun Yat-Sen University(中山大学)
专题命中 测试生成 :repository(abstract);分类 cs.AI
AI总结 本文提出GRM框架,通过频率选择性扰动在音频大语言模型中实现效用感知的越权攻击,实验表明其在攻击成功率与效用平衡方面优于基线方法。
Comments Accpeted by MM 2026
基于智能体的多视角聚合测试断言生成
专题命中 测试生成 :code generation(abstract);分类 cs.SE
AI总结 针对现有LLM断言生成方法的局限,提出基于智能体的AssertMate框架,通过三个组件聚合多视角,在Defects4J和EvoSuite验证中性能显著优于现有技术。
隐藏的密码及其发现途径:软件中密码资产的静态发现与评估
专题命中 测试生成 :repository(abstract);分类 cs.SE
AI总结 本文提出分类驱动的静态方法,可在不到6分钟处理57610个文件,发现370个密码资产(含6个CVE漏洞、52个后量子迁移候选),F1达0.75,助力密码资产发现与后量子迁移规划
Comments 22 pages, 8 figures, 5 tables, accepted at ICICS 2026
用于健康虚假信息验证的基于证据的检索增强Transformer框架
机构 * Yobe State University(约贝州立大学) ; Yobe AI Research Laboratory (YAIR Lab)(约贝人工智能研究实验室) ; Novosibirsk State University(新西伯利亚国立大学) ; College of Computer Science and Engineering, Hamad Bin Khalifa University(哈马德·本·哈利法大学计算机科学与工程学院)
专题命中 测试生成 :repository(abstract);分类 cs.CL
AI总结 本研究针对发展中国家健康虚假信息验证的本地语境缺失问题,提出基于WHO和尼日利亚疾控中心证据的检索增强Transformer框架,经实验评估BERT模型表现最佳,为资源受限地区开发相关系统提供基础。
Comments 17 pages, 2 figures, To appear in the Reimagining knowledge systems for digital transformation and sustainable development in the 21st century conference 2026, faculty of social sciences education. Federal University of Education, Zaria
论LLM生成的单元测试中测试异味的扩散
专题命中 测试生成 :unit test generation(abstract);分类 cs.SE
AI总结 本研究通过多基准大规模分析,对比LLM生成、人类编写及EvoSuite生成的单元测试,发现LLM生成测试存在特定测试异味,受提示策略等影响,凸显基于LLM的测试生成的潜力与风险,呼吁开发相关优化方案。
Comments Accepted at Transactions on Software Engineering and Methodology (TOSEM) journal on 31 July 2026
基于新版本LLM的测试生成技术表现如何?
专题命中 测试生成 :unit test generation(abstract);分类 cs.SE
AI总结 本文研究了基于新版本LLM的测试生成技术表现,发现纯LLM方法在覆盖率和变异评分上优于现有方法,且成本相当。
从关系数据库中检索增强生成本体
机构 * Institute for Artificial Intelligence, University of Stuttgart(人工智能研究所,斯图加特大学) ; University of Southampton(南安普顿大学) ; Universitätsklinikum Leipzig(莱比锡大学医院)
专题命中 测试生成 :repository(abstract);分类 cs.AI
AI总结 研究从关系数据库生成语义丰富的OWL2DL本体的问题,提出RIGOR方法,通过大语言模型驱动,从多源检索并迭代生成本体片段,经验证和纠正后集成,实验表明该方法优于基线且无需人工监督。
Comments Accepted in ISWC26
一种从网络威胁情报报告中提取可达攻击链的自动化框架
机构 * Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东新型安全情报技术重点实验室) ; School of Computer Science and Technology(计算机科学与技术学院) ; Harbin Institute of Technology(哈尔滨工业大学) ; New Network Research Department(新网络研究部) ; Peng Cheng Laboratory(鹏城实验室) ; Great Bay University(大湾区大学)
专题命中 测试生成 :repository(abstract);分类 cs.AI
AI总结 该研究针对CTI报告非结构化无法用于自动化攻击路径推理的问题,提出将攻击步骤建模为含条件和行为的单元,经多阶段管道结合大语言模型提取并规范化,编译成规则推理,在数据集上有更好表现,能有效提取可达攻击链。
Comments 16 pages, 3 figures
通过学习模拟信息改进LLM驱动的测试生成
专题命中 测试生成 :unit test generation(abstract);分类 cs.SE
AI总结 本文提出MOCKMILL方法,利用开发者编写测试中的模拟信息自动生成测试用例,通过迭代生成与修复过程提升测试覆盖率和有效性。
Comments Accepted for publication in ICST 2026 (AIST workshop). This arXiv version is the authors' accepted manuscript
Journal ref IEEE Conference on Software Testing, Verification and Validation Workshop 2026
玻尔兹曼MapReduce:可分叉沙盒的配分函数归约
机构 * Incredibuild(Incredibuild公司) ; HIT CS Department(以色列理工学院计算机科学系)
专题命中 测试生成 :repository(abstract);分类 cs.AI
AI总结 研究在局部渐近正态性下工作节点发出的置信密度,指出其为吉布斯 - 玻尔兹曼测度,逆温度是样本大小。高斯/线性下相关结果精确,MapReduce归约是配分函数,还有频率主义一致性等结论。
Comments N/A
超越测试存在:评估开源项目中代理生成测试的质量和稳健性
专题命中 测试生成 :coding agent(abstract);分类 cs.SE
AI总结 研究开源项目中代理生成测试的质量和稳健性,通过对大量测试工件进行实证比较,用“白盒”静态分析框架评估质量维度,发现代理在边缘情况覆盖率上优于人类,但生成测试更易脆弱,揭示其缺乏编写稳定测试的“环境意识”。
TATG:基于大语言模型的测试生成的跟踪感知测试目标
专题命中 测试生成 :unit test generation(abstract);分类 cs.SE
AI总结 针对复杂Java方法自动化单元测试生成难的问题,TATG提出基于大语言模型的单元测试生成方法,引入统一目标表示跟踪测试需求,采用两阶段工作流程,实验证明其相比其他方法有显著提升。
Agent4cs:面向大型分层代码库的代码摘要多智能体系统
机构 * Siemens AG(西门子股份公司) ; Technical University of Munich(慕尼黑工业大学) ; Kings College London(伦敦国王学院)
专题命中 测试生成 :repository(abstract);分类 cs.AI
AI总结 提出多智能体框架Agent4cs,通过自底向上方式对大型代码库进行摘要,包含摘要、关键词提取和质量保证三个智能体,在语义一致性和关键词覆盖率上分别提升8%和38%。
Comments Accepted to the main track of the 23rd European Conference on Multi-Agent Systems (EUMAS 2026)
面向企业共享存储的加密勒索软件混合检测框架
机构 * Department of Computer Science and Information Technology, La Trobe University(拉特罗布大学计算机科学与信息技术系)
专题命中 测试生成 :repository(abstract);分类 cs.LG
AI总结 提出一种混合检测框架,通过感兴趣区域(RoI)技术分析网络流量提取入侵指标(IoC),结合机器学习模型检测高规避性勒索软件变种,在共享存储环境中实现99.64%精度和0%漏报率。
iCoRe: 一种迭代相关性感知的Bug重现测试生成检索器
专题命中 测试生成 :repository(abstract);分类 cs.SE
AI总结 本文提出iCoRe,一种迭代相关性感知的Bug重现测试生成检索器,通过区分源代码与测试用例的检索需求、结合文本语义与函数调用结构、以及实现检索与生成阶段的反馈循环,提升Bug重现测试生成的准确性。
深度神经网络的测试用例选择:面向代码的大语言模型的复现研究
专题命中 测试生成 :code model(abstract);分类 cs.SE
AI总结 本文对深度神经网络测试用例选择技术在代码大语言模型上的有效性进行了大规模复现研究,发现基于不确定性的特征对早期故障发现有效,而基于表示的特征对准确率估计更鲁棒,且性能因任务和模型而异。
Comments Accepted at ISSTA 2026, the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis
IntentTester:面向意图驱动的跨库测试迁移多智能体框架
专题命中 测试生成 :repository(abstract);分类 cs.SE
AI总结 提出IntentTester多智能体框架,通过将测试抽象为语言无关的测试描述语言(TDL),结合知识图谱对齐语义实体,并利用LLM推理与迭代验证生成可执行测试,实现跨库跨语言测试迁移,在9个开源项目上生成2776个测试,正确率85%,有效性74%,并发现多处隐藏缺陷。
MASCOT-Android: 一个用于安卓恶意软件源代码样本的精选数据集与自动收集管道
机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 测试生成 :repository(abstract);分类 cs.AI
AI总结 提出MASCOT-Android数据集和自动收集框架,利用仓库级文档(README)训练LinearSVC分类器,以96.28%准确率和1.06%假阳性率从GitHub发现恶意软件源代码。
TestMap:基础模型辅助测试生成的证据基础设施
专题命中 测试生成 :repository(abstract);分类 cs.SE
AI总结 提出TestMap基础设施,自动化C#/.NET仓库的测试生成与验证,记录候选测试生命周期,支持多维度评估。
Comments 10 pages, 1 figure, 2 tables. Accepted to present at AIWare 2026 (arXiv Track)
LLM vs. 人类单元测试:对真实 Python 错误的故障检测
专题命中 测试生成 :unit test generation(abstract);分类 cs.SE
AI总结 通过对比 LLM 生成与人工编写的单元测试在真实 Python 错误上的故障检测能力,发现 LLM 结合检索增强上下文可检测 69% 的故障,远超人工测试的 17.2%,且代码覆盖率相近,表明覆盖率不足以衡量故障检测能力。
Slide Deck Q&A 质量保证应用:面向教学问题生成的多阶段流水线
机构 * TalkNicer, Inc.(TalkNicer公司)
专题命中 测试生成 :repository(abstract);分类 cs.CL
AI总结 提出一个基于Flask的多阶段大语言模型流水线,从PDF幻灯片中提取文本和图像,生成结构化的教学问题集,并通过窗口规划、幻灯片合成、标注和协调四个阶段提高问题质量。
Comments 15 pages, 3 research questions, 1 figure, 1 table, 6 references, 2 appendices
何时回答,何时延迟:一种可靠代码预测的决策框架
专题命中 测试生成 :code model(abstract);分类 cs.SE
AI总结 本文提出了一种决策框架,用于在代码预测中可靠地判断何时回答何时延迟,通过整合不确定性估计、模型校准和工具基于的延迟处理,提高代码模型的可靠性。
Comments In Proceedings of the 48th IEEE/ACM International Conference on Software Engineering- New Idea and Emerging Results Track (ICSE-NIER 2026)
Rule2DRC:用于DRC脚本合成的LLM代理基准测试
机构 * Department of Computer Science and Engineering, Seoul National University(首尔国立大学计算机科学与工程系) ; Neural Processing Research Center(神经处理研究所以) ; Samsung Electronics Co., Ltd(三星电子公司)
专题命中 测试生成 :coding agent(abstract);分类 cs.LG
AI总结 Rule2DRC是一个大规模基准,用于评估DRC脚本生成代理,包含1000个规则到脚本任务和13921个用于执行评分的评估芯片布局。它提供了一种通过DRC执行结果衡量功能正确性的评估流程,并引入SplitTester生成区分性测试用例以提升Best-of-N选择性能。
Comments ICML 2026
ReproScore:在研究软件可重复性评估中区分准备度与结果
专题命中 测试生成 :repository(abstract);分类 cs.SE
AI总结 本文提出ReproScore框架,通过分离可重复性准备度(RRS)与可重复性结果(ROS),结合成覆盖适应性复合评分(RCS),以解决现有工具将静态仓库完整性误认为执行成功的缺陷。
GameGen-Verifier:通过运行时状态注入实现LLM生成游戏的并行关键点验证
机构 * CUHK(香港中文大学) ; HUST(华中科技大学) ; Lionrock AI Lab(Lionrock人工智能实验室) ; NTU(国立新加坡大学) ; HKU(香港大学)
专题命中 测试生成 :code generation(abstract);分类 cs.LG
AI总结 本文提出GameGen-Verifier,通过分解规范为可验证的关键点,实现LLM生成游戏的自动化验证,提升验证准确率并减少运行时间。
RepoDoc: 基于知识图谱的自动文档生成与增量更新框架
专题命中 测试生成 :repository(abstract);分类 cs.SE
AI总结 RepoDoc通过构建仓库知识图谱,实现代码文档的自动化生成与增量更新,提升文档覆盖率和完整性,同时提高生成效率与准确性。