SmartPaste: Learning to Adapt Source Code
专题命中 程序修复 :program repair(abstract);分类 cs.SE、cs.LG
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
专题命中 程序修复 :program repair(abstract);分类 cs.SE、cs.LG
专题命中 程序修复 :code generation(abstract);分类 cs.SE、cs.PL
Comments In M. Ducasse (ed), proceedings of the Fourth International Workshop on Automated Debugging (AADEBUG 2000), August 2000, Munich. cs.SE/0010035 14 pages, 6 figures
AI 代码沙箱:比较安全研究。第 1 部分(共 2 部分)——引擎级属性(攻击面、泄露、可堆叠性、CVE 历史、补丁节奏、模糊测试)
机构 * orbitalab.dev(orbitalab实验室) ; fellows.tech(fellows技术)
专题命中 程序修复 :repository(abstract,comments);分类 cs.AI
AI总结 本文通过六项引擎级测量,比较五种 AI 沙箱产品隔离访客代码与主机内核的能力,发现引擎类在架构轴上清晰分离,但产品内无差异;补丁策略是主要操作变量;模糊测试投资分为三层,最强组合(微VM × 持续公共模糊测试)空缺。
Comments 61 pages, 7 figures, 33 tables; Part 1 of 2; companion code repository (Apache-2.0): https://github.com/orbitalab/RnD-ai-sandboxes-sec-study-part-1
BloomAPR:基于布鲁姆教育目标分类学的框架,用于评估大语言模型驱动的自动程序修复(APR)方案的能力
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 BloomAPR是基于布鲁姆教育目标分类学的动态评估框架,评估了ChatRepair、CigaR等APR方案在不同LLM及布鲁姆分类层级下的漏洞修复能力,发现其存在性能差异并指出基准演进的必要性。
Comments 22 pages, 7 figures, Manuscript submitted to ACM Transactions on Software Engineering and Methodology
PITMuS: 通过源级变异体重建实现自动化bug数据集生成工具
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 本文提出PITMuS工具,通过源级变异体重建生成自动化bug数据集,解决现有工具生成的变异体难以复现和利用的问题,为bug定位和修复技术提供结构化数据支持。
用于故障定位的大语言模型:一项实证研究
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 本文通过在HumanEval-Java、Defects4J数据集上评估四款LLMs,对比非LLM基线,分析不同提示策略,明确其在语句级故障定位的优缺与实际权衡,为软件工程应用提供实证支持。
READU:README 错误的不一致驱动即时检测与修复
专题命中 程序修复 :repository(abstract);分类 cs.SE
AI总结 研究针对仓库级文档 README 错误,提出不一致驱动技术 READU,通过高召回率提交过滤器、并行一致性检查器等方法,能即时检测并修复错误,在六个流行仓库的提交测试中表现良好,检测到多个真阳性并成功修复部分错误。
单个补丁不够:修复候选的确定性融合
专题命中 程序修复 :coding agent(abstract);分类 cs.SE
AI总结 针对代码修复中候选补丁池的“pass@k到pass@1”差距,提出PatchFusion方法,通过确定性原子证据融合选择并构造最终补丁,无需测试结果,在三个基准上优于现有选择器。
VulKey:基于领域特定修复模式的自动漏洞修复
专题命中 程序修复 :code generation(abstract);分类 cs.SE
AI总结 VulKey通过层级化抽象专家知识指导补丁生成,实现更高泛化性和语义丰富性,其在PrimeVul数据集上达到31.5%的修复准确率,超越现有方法。
Comments Accepted by FSE 26
减少全切片图像分块冗余以实现可扩展索引与检索
机构 * KIMIA Lab Dept. of Artificial Intelligence & Informatics(KIMIA实验室 人工智能与信息学系)
专题命中 程序修复 :repository(abstract);分类 cs.AI
AI总结 提出ARReST框架,通过识别并剪除跨类别判别贡献小的对立块,在保持检索精度的同时显著压缩WSI索引存储(3%-60%),实现可扩展、低成本的病理图像检索。
A11YRepair: 通过知识增强的分治修复弥合网络无障碍障碍
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 针对网络无障碍违规修复问题,提出基于LLM的分治框架A11YRepair,通过聚类关联违规并引入WCAG领域知识,实现多文件协调修复,在60个真实项目中优于现有方法。
Comments Accepted by ASE 2026
MPC-Patch-Bench:面向多方计算的安全感知LLM代码补丁
机构 * University of Central Florida(中央佛罗里达大学)
专题命中 程序修复 :repository(abstract);分类 cs.AI
AI总结 针对多方计算(MPC)软件缺乏仓库级代码修复基准的问题,提出MPC-Patch-Bench,包含数据筛选框架和MPC验证器,评估LLM在MPC仓库级修复中的安全性和数值保真度。
Comments preprint
Simulink需求表中信息物理系统的需求自动修复
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 提出一种利用系统执行数据修复信息物理系统需求以恢复需求与系统一致性的框架,并在六个真实案例中验证其有效性。
Comments 24 pages, 7 figures, accepted to FSE 2026 Research Track
AgenticSZZ: 基于时间知识图谱的代理式Bug引发提交识别
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 本文提出AgenticSZZ,利用时间知识图谱改进Bug引发提交识别,通过构建包含时间与结构关系的知识图谱,并结合LLM代理进行图搜索,提升识别精度与效果。
Comments Add RQ3 with open-source LLMs evaluation, such as DeepSeek-V4-Pro
SiblingRepair: 基于兄弟的多补丁修复与大型语言模型
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 SiblingRepair利用大型语言模型进行基于兄弟的多补丁修复,通过语义相关性搜索和两种修复策略提升修复效率和准确性,优于现有技术。
MAS-SZZ:多智能体SZZ算法用于漏洞引发提交识别
专题命中 程序修复 :repository(abstract);分类 cs.SE
AI总结 本文提出MAS-SZZ算法,通过多智能体协作识别漏洞引发提交,通过结构化向前提示策略定位漏洞相关代码,提升漏洞检测准确性。
通过高效动态分析赋能自主调试代理
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 本文提出Agent-centric Debugging Interface,通过函数级交互和Frame Lifetime Trace提升自主调试代理效率,在SWE-bench验证集上实现63.8%的任务解决率,成本仅为1.28美元/任务。
Comments Accepted to the ACM International Conference on the Foundations of Software Engineering (FSE 2026)
通过历史特征频率排名可能的补丁
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 本文提出PrevaRank技术,通过历史程序员修复相似缺陷的补丁特征相似性,提升自动程序修复工具中正确补丁的排名效果,实验表明其显著提高了正确补丁的排名质量。
LogicEval: 一个系统框架用于评估自动修复技术在现实软件中逻辑漏洞的修复
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 程序修复 :program repair(abstract);分类 cs.AI
AI总结 本文提出LogicEval框架,通过LogicDS数据集评估传统和基于LLM的修复方法,发现编译和测试失败主要由提示敏感性、代码上下文丢失和补丁定位困难导致。
Comments To appear in ACL 2026 Main Conference
HWE-Bench:在真实世界硬件Bug修复任务上评估LLM代理的基准测试
机构 * Peking University(北京大学)
专题命中 程序修复 :repository(abstract);分类 cs.AI
AI总结 HWE-Bench是首个大规模仓库级基准,用于评估LLM代理在真实世界硬件Bug修复任务中的表现,通过417个任务实例验证代理在不同项目中的性能差异。
CodeComp: 用于代理编程的结构化KV缓存压缩
机构 * The University of Hong Kong(香港大学) ; LMSYS Org(LMSYS组织)
专题命中 程序修复 :code generation(abstract);分类 cs.CL
AI总结 CodeComp通过引入静态程序分析,在LLM推理中整合代码属性图先验,有效压缩KV缓存,提升代码定位和生成任务的准确性与效率。
一种基于SHB上下文提取器的端到端并发bug修复方法
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 本文提出ConFixAgent,一种基于LLM的端到端并发bug修复工具,通过静态发生前图识别相关代码段,提升修复准确性。
深度学习基于自动补丁正确性评估中的代码表示效果研究
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 本文研究了不同代码表示在预测补丁正确性中的性能,发现基于图的表示在多个基准上表现最佳,同时整合序列表示可提升性能。
超越崩溃到补丁:Linux内核修复的补丁演变
专题命中 程序修复 :coding agent(abstract);分类 cs.SE
AI总结 本文研究Linux内核修复的补丁演变过程,提出PatchAdvisor框架,通过整合检索与诊断顾问,提升修复质量与审查一致性。
通过跨语言翻译和多代理优化解锁LLM修复能力
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 本文提出LANTERN方法,通过跨语言翻译和多代理迭代修复,提升LLM在多语言程序修复中的能力,尤其在Rust等较少使用语言上表现突出。
毫米波扩散:一种基于观测锚定条件扩散模型的呼吸感知新框架
机构 * Key Laboratory of Underwater Acoustic Signal Processing of Ministry of Education, Southeast University, Nanjing, 211189, China(教育部水下声学信号处理重点实验室,东南大学,南京,211189,中国) ; Purple Mountain Laboratories, Nanjing, 211111, China(紫金山实验室,南京,211111,中国)
专题命中 程序修复 :repository(abstract);分类 cs.LG
AI总结 本文提出mmWave-Diffusion框架,通过观测锚定条件扩散模型消除微运动干扰,实现呼吸信号的高精度重建与估计。
Comments Accepted by IEEE ICASSP 2026
语义对齐、课程驱动和推理增强的漏洞修复框架
专题命中 程序修复 :repository(abstract);分类 cs.SE
AI总结 本文提出SeCuRepair框架,通过语义对齐、课程驱动和推理增强解决现有漏洞修复方法的局限性,提升代码修复的准确性和泛化能力。
信任胜过恐惧:系统提示中的动机框架如何影响AI代理调试深度
专题命中 程序修复 :coding agent(abstract);分类 cs.SE
AI总结 研究探讨了信任与恐惧动机框架对AI代理调试深度的影响,发现信任框架能显著提升问题发现和调查步骤,而恐惧框架无明显效果,揭示了动机框架对AI行为的关键作用。
Comments 13 pages, 2 tables, 23 references. Code and data: https://github.com/wuji-labs/nopua
揭示修补过拟合检测技术的实用性缺陷
专题命中 程序修复 :program repair(abstract);分类 cs.SE
AI总结 研究发现简单随机选择在多数情况下优于现有修补过拟合检测技术,指出当前技术在实际应用中效果有限,需进一步改进。
Comments 12 pages, 5 figures, 5 tables
为何大语言模型失败:自动化安全补丁生成的失败分析与部分成功测量
机构 * University of Passau(帕绍大学)
专题命中 程序修复 :program repair(abstract);分类 cs.AI
AI总结 本研究分析了LLM在生成安全补丁时的失败原因,指出其在安全性和功能上的不足,并提出安全修复评分以量化这一差距。