arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-14 至 2026-05-14 共收录 30 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 10 篇

2605.13536 2026-05-14 cs.LG cs.AI 76%

HLS-Seek: QoR-Aware Code Generation for High-Level Synthesis via Proxy Comparative Reward Reinforcement Learning

HLS-Seek: 一种基于代理比较奖励强化学习的面向高质量结果的高层次综合代码生成

Qingyun Zou, Feng Yu, Hongshi Tan, Yao Chen, Bingsheng He, WengFai Wong

机构 * National University of Singapore(新加坡国立大学)

专题命中 代码生成 :code generation(title);分类 cs.AI、cs.LG

AI总结 HLS-Seek通过代理比较奖励强化学习方法,实现了高质量结果导向的高层次综合代码生成,其在语法正确性和功能准确性上超越了GPT-5.1等前沿模型,并在训练速度和QoR评估中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11299 2026-05-14 cs.LG cs.CL cs.SE 67%

Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling

原始生成,双重判断:从测试时扩展进行自我训练

Yizhu Jiao, Ruixiang Zhang, Richard Bai, Jiawei Han, Ronan Collobert, Yizhe Zhang

机构 * Apple(苹果公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 本文提出DuST框架,通过双重判断空间提升代码生成与判断能力,实验显示在多个模型上显著提升测试时扩展性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05242 2026-05-14 cs.SE cs.AI cs.LG 67%

EGSS: Entropy-guided Stepwise Scaling for Reliable Software Engineering

EGSS: 基于熵引导的逐步缩放以实现可靠的软件工程

Chenhui Mao, Yuanting Lei, Zhixiang Wei, Ming Liang, Zhixiang Wang, Jingxuan Xu, Dajun Chen, Wei Jiang, Yong Li

机构 * Ant Group(蚂蚁集团)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 EGSS通过熵引导的自适应搜索和稳健的测试套件增强,解决了代理测试时间缩放中的计算开销问题,提升了性能并降低了推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12857 2026-05-14 cs.MA cs.AI cs.AR cs.LG 62%

ChipMATE: Multi-Agent Training via Reinforcement Learning for Enhanced RTL Generation

ChipMATE: 通过强化学习进行多智能体训练以提升RTL生成

Zhongkai Yu, Yichen Lin, Chenyang Zhou, Yuwei Zhang, Kun Zhou, Junxia Cui, Haotian Ye, Zhengding Hu, Zaifeng Pan, Ruiyi Wang, Yujie Zhao, Hejia Zhang, Jingbo Shang, Jishen Zhao, Yufei Ding

机构 * UCSD(加州大学圣迭戈分校) Columbia University(哥伦比亚大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 ChipMATE是首个自训练多智能体RTL生成框架,通过相互验证的智能体和混合数据生成框架提升生成质量,实现75.0%和80.1%的VerilogEval V2通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13999 2026-05-14 cs.LG cs.AI 62%

REAP the Experts: Why Pruning Prevails for One-Shot MoE compression

REAP 专家:为何剪枝在单次MoE压缩中占优

Mike Lasby, Ivan Lazarevich, Nish Sinnadurai, Sean Lie, Yani Ioannou, Vithursan Thangarasa

机构 * Cerebras Systems Inc.(Cerebras系统公司) Schulich School of Engineering, University of Calgary(卡莱尔大学施密特工程学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出REAP剪枝方法,通过结合路由门值和专家激活范数,有效减少生成任务中的重建误差,优于合并和其他剪枝方法,尤其在50%压缩下表现优异。

Comments 30 pages, 9 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13414 2026-05-14 cs.AI 57%

TRIAGE: Evaluating Prospective Metacognitive Control in LLMs under Resource Constraints

TRIAGE:在资源限制下评估大语言模型的前瞻性元认知控制

Zabir Al Nazi, Shubhashis Roy Dipta

机构 * University of California, Riverside, USA(加州大学河滨分校) University of Maryland, Baltimore County, USA(马里兰大学巴尔的摩县分校)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 研究评估了大语言模型在资源限制下的前瞻性元认知控制能力,通过Triage框架测试不同模型在多个领域的表现,揭示了现有模型在该能力上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12975 2026-05-14 cs.AI 57%

Retrieval is Cheap, Show Me the Code: Executable Multi-Hop Reasoning for Retrieval-Augmented Generation

检索成本低廉,展示代码:可执行多跳推理的检索增强生成

Jiashuo Sun, Jimeng Shi, Yixuan Xie, Saizhuo Wang, Jash Rajesh Parekh, Pengcheng Jiang, Zhiyi Shi, Jiajun Fan, Qinglong Zheng, Peiran Li, Shaowen Wang, Ge Liu, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong University of Science and Technology(香港科学与技术大学) Texas A&M University(德克萨斯农工大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 本文提出PyRAG框架,将多跳检索增强生成转化为程序合成与执行,通过可执行Python代码实现可调试的推理过程,提升多跳问答性能。

Comments 32 pages, 20 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12746 2026-05-14 cs.CR cs.AI 57%

CoT-Guard: Small Models for Strong Monitoring

CoT-Guard:用于强监控的小型模型

Nirav Diwan, Han Wang, Berkcan Kapusuzoglu, Ramin Moradi, Supriyo Chakraborty, Giri Iyengar, Sambit Sahu, Huan Zhang, Gang Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Capital One

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出CoT-Guard,通过结合监督微调和强化学习,提升小型模型在代码生成任务中检测隐藏目标的能力,其在提示和代码攻击下的表现优于现有大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08992 2026-05-14 cs.LG 57%

Constraints-of-Thought: A Framework for Constrained Reasoning in Language-Model-Guided Search

思维约束:一种在语言模型引导搜索中进行约束推理的框架

Kamel Alrashedy, Vriksha Srihari, Zulfiqar Zaidi, Ridam Srivastava, Pradyumna Tambwekar, Matthew Gombolay

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本文提出Const-o-T框架,通过约束推理提升语言模型在多步骤任务中的规划效率和决策可靠性,适用于风险游戏、CAD代码生成和算术推理等复杂领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12586 2026-05-14 cs.CV cs.AI cs.DB 57%

3D Primitives are a Spatial Language for VLMs

3D基元是一种视觉语言模型的空间语言

Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini, Qingjun Cui, Tian Wang

机构 * Unity Technologies

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出通过3D基元作为中间表示来提升视觉语言模型的空间理解能力,通过SpatialBabel基准、Code-CoT推理策略和S³-FT自监督微调三种贡献,展示了基元在空间任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 7 篇

2605.13357 2026-05-14 cs.SE cs.AI 84%

AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents

AIHarness工程:一种用于基础模型软件代理的运行时基质

Hailin Zhong, Shengxin Zhu

机构 * Hong Kong Baptist University(香港 Baptist大学) Beijin Normal University(北京师范大学)

专题命中 软件智能体 :software agent(title,abstract);code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出AIHarness工程,通过运行时基质提升软件代理的工程能力,定义了十一项核心职责,并提出四层 ladder 框架和基于追踪的评估协议,以验证模型-基质-环境系统生成可验证、可归因和可维护的变更。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03551 2026-05-14 cs.SE cs.AI cs.HC 81%

AgenticFlict: A Large-Scale Dataset of Merge Conflicts in AI Coding Agent Pull Requests on GitHub

AgenticFlict:一个大规模的人工智能编码代理拉取请求中合并冲突数据集

Daniel Ogenrwot, John Businge

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出AgenticFlict数据集,用于研究AI编码代理生成的合并冲突问题,揭示了AI生成代码中合并冲突的频率和影响,强调了对AI辅助软件开发中集成挑战的理解需求。

Comments Accepted at the 3rd ACM International Conference on AI-Powered Software (AIware 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09423 2026-05-14 cs.AI 79%

SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning

SimWorld Studio:基于进化编码代理的自动环境生成用于具身学习

Haoqiang Kang, Xiaokang Ye, Yuhan Liu, Siddhant Hitesh Mantri, Lingjun Mao, James Fleming, Drishti Regmi, Lianhui Qin

机构 * UC San Diego(加州大学圣迭戈分校) New York University(纽约大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本文提出SimWorld Studio平台,通过进化编码代理生成动态3D环境,提升具身学习性能。环境生成与学习相互促进,使代理在未见基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08017 2026-05-14 cs.SE 79%

Collaborator or Assistant? How AI Coding Agents Partition Work Across Pull Request Lifecycles

合作者还是助手?AI编码代理如何在拉取请求生命周期中分配工作

Young Jo, Chung, Safwat Hassan

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本文研究AI编码代理在拉取请求生命周期中如何分配工作,通过分析工具的协作-助手光谱,探讨操作权与合并治理的分离,提出分类学、状态机和可重复实验包。

Comments 10 pages, 8 figures, AIWare 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13139 2026-05-14 cs.SE 70%

SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle

SWE-Cycle:在完整问题解决周期中对齐代码代理的基准测试

Hao Guan, Lingyue Fu, Shao Zhang, Yaoming Zhu, Kangning Zhang, Lin Qiu, Xunliang Cai, Xuezhi Cao, Weiwen Liu, Weinan Zhang, Yong Yu

专题命中 软件智能体 :software agent(abstract);repository(abstract);分类 cs.SE

AI总结 本文提出SWE-Cycle基准测试,评估代码代理在环境重建、代码实现和测试生成等任务中的能力,揭示了在端到端任务中处理跨阶段依赖和保持代码质量的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10005 2026-05-14 cs.PL cs.AI cs.LO cs.SE 67%

Combining Mechanical and Agentic Specification Inference for Move

结合机械和代理规范推断的Move

Wolfgang Grieskamp, Teng Zhang, Vineeth Kashyap

机构 * Aptos Labs(Aptos实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 本文提出结合机械分析与代理编码的Move规范推断工具,通过WP分析和AI辅助生成高阶规范,减少手动编写规范的繁琐工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13624 2026-05-14 cs.CL 57%

Edit-level Majority Voting Mitigates Over-Correction in LLM-based Grammatical Error Correction

基于编辑层面多数投票的过纠正缓解方法:用于基于大语言模型的语法错误修正

Takumi Goto, Yusuke Sakai, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术研究所)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 本文提出一种无需训练的推理方法,通过多候选生成模型进行编辑层面多数投票,缓解LLM在语法纠错中的过纠正问题,在多个语言基准测试中优于贪婪和MBR解码。

Comments BEA Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2605.09134 2026-05-14 cs.AI cs.SE 81%

BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models

BoostAPR:通过基于执行的强化学习与双奖励模型提升自动化程序修复

Yuanhao Li, Hongbo Wang, Xiaotang Shang, Xunzhu Tang, Yiming Cao, Xuhong Chen

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) University of Luxembourg(卢森堡大学)

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE、cs.AI

AI总结 BoostAPR通过基于执行的强化学习与双奖励模型,解决程序修复中反馈稀疏和奖励粗粒度的问题,实现40.7%的SWE-bench Verified准确率,展现强大的跨语言泛化能力。

Comments 21 pages, 2 figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2605.13275 2026-05-14 cs.SE 57%

ReproScore: Separating Readiness from Outcome in Research Software Reproducibility Assessment

ReproScore:在研究软件可重复性评估中区分准备度与结果

Sheeba Samuel, Daniel Mietchen, Jungsan Kim, Waqas Ahmed, Martin Gaedke

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 本文提出ReproScore框架,通过分离可重复性准备度(RRS)与可重复性结果(ROS),结合成覆盖适应性复合评分(RCS),以解决现有工具将静态仓库完整性误认为执行成功的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 6 篇

2605.13141 2026-05-14 cs.SE 79%

UIBenchKit: A unified toolkit for design-to-code model evaluation

UIBenchKit:一个统一的用于设计到代码模型评估的工具包

Chinh T. Le, Trevor Ong Yee Siang, Jingyu Xiao, Yuxuan Wan, Yintong Huo

专题命中 代码评测 :code model(title);code generation(abstract);分类 cs.SE

AI总结 本文提出UIBenchKit,一个统一的工具包,用于评估设计到代码任务,提供一致的环境和分析接口,推动网页工程的基准测试和创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21345 2026-05-14 cs.AI cs.CL 62%

Evaluating AI Meeting Summaries with a Reusable Cross-Domain Pipeline

用可重用的跨领域管道评估AI会议摘要

Philip Zhong, Don Wang, Jason Zhang

机构 * Cisco Systems, Inc.(思科系统公司)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个可重用的跨领域管道,用于评估AI会议摘要,通过结构化真实数据构建、固定候选生成、基于声明评分等方法,在114次会议上验证了不同模型的性能,发现gpt-5.1在保留性上表现更优。

Comments AI Application Feature Quality Evaluation (28 pages total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19185 2026-05-14 cs.LG 57%

MIDST Challenge at SaTML 2025: Membership Inference over Diffusion-models-based Synthetic Tabular data

MIDST挑战赛在SaTML 2025: 基于扩散模型的合成表格数据的成员推断

Masoumeh Shafieinejad, Xi He, Mahshid Alinoori, John Jewell, Sana Ayromlou, Wei Pang, Veronica Chatrath, Gauri Sharma, Deval Pandya

机构 * Vector Institute

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文探讨了基于扩散模型生成的合成表格数据在隐私保护方面的有效性,重点评估其对成员推断攻击的抗性,并开发了针对这些模型的新型攻击方法。

Comments 4 page, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13171 2026-05-14 cs.AI 57%

Formal Conjectures: An Open and Evolving Benchmark for Verified Discovery in Mathematics

形式猜想:一个开放且不断演进的数学验证发现基准

Moritz Firsching, Paul Lezeau, Salvatore Mercuri, Miklós Z. Horváth, Yaël Dillies, Calle Sönne, Eric Wieser, Fred Zhang, Thomas Hubert, Blaise Agüera y Arcas, Pushmeet Kohli

机构 * Google DeepMind(谷歌DeepMind) Imperial College London(帝国理工学院伦敦分校) Stockholms universitet(斯德哥尔摩大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 Formal Conjectures提供2615个形式化的数学问题,包含1029个开放猜想和836个已解决问题,用于评估自动化推理系统的能力,并通过协作项目确保正确性,推动数学证明发现的进展。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12882 2026-05-14 cs.CL cs.CV 57%

CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

CiteVQA:可信赖文档智能的证据归因基准测试

Dongsheng Ma, Jiayu Li, Zhengren Wang, Yijie Wang, Jiahao Kong, Weijun Zeng, Jutao Xiao, Jie Yang, Wentao Zhang, Bin Wang, Conghui He

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 CiteVQA通过要求模型返回元素级边界框引用,评估文档理解中的证据归因,揭示了现有评估方法的可靠性缺口,主要贡献是引入Strict Attributed Accuracy指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12673 2026-05-14 cs.AI cs.CR 57%

Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack

安卓会为打破游戏而做梦吗?通过BenchJack系统性审计AI代理基准

Hao Wang, Hanchen Li, Qiuyang Mang, Alvin Cheung, Koushik Sen, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文提出BenchJack系统,通过自动化红队系统审计AI代理基准,发现219种奖励黑客漏洞,提升基准鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 4 篇

2604.21496 2026-05-14 cs.AI cs.CL cs.CY 62%

How English Print Media Frames Human-Elephant Conflicts in India

印度人类-大象冲突在英语印刷媒体中的框架分析

Bonala Sai Punith, Salveru Jayati, Garima Shakya, Shubham Kumar Nigam

机构 * Chhattisgarh Forest Department(恰特里什加尔森林部门)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文通过大规模计算分析研究印度人类-大象冲突在英语媒体中的报道框架,揭示了恐惧和攻击性语言的主导地位,并提出透明可扩展的方法以促进负责任的野生动物报道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13625 2026-05-14 cs.AI 57%

How to Interpret Agent Behavior

如何解释智能体行为

Jie Gao, Kaiser Sun, Jen-tse Huang, Katherine Van Koevering, Sijie Ji, Heyuan Huang, Weiyan Shi, Zhuoran Lu, Ziang Xiao, Daniel Khashabi, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) California Institute of Technology(加州理工学院) Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文提出ACT*ONOMY框架,通过构建行为分类体系和开放仓库,帮助研究人员更一致地解读智能体行为,提升监控与控制能力。

Comments 34 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13813 2026-05-14 cs.CV 50%

JANUS: Anatomy-Conditioned Gating for Robust CT Triage Under Distribution Shift

JANUS:基于解剖的门控用于在分布偏移下鲁棒的CT分诊

Lavsen Dahal, Yubraj Bhandari, Geoffrey Rubin, Joseph Y. Lo

机构 * Center for Virtual Imaging Trials, RAI Labs, Department of Radiology, Duke University, Durham NC 27708, USA Electrical Computer Engineering, Pratt School of Engineering, Duke University, Durham, NC 27708, USA Department of Mathematics, Trinity College of Arts \& Sciences, Duke University, Durham, NC 27708, USA Department of Radiology

专题命中 仓库级理解 :repository(abstract)

AI总结 JANUS通过解剖引导门控将视觉嵌入与宏放射组学先验条件相结合,提升CT分诊在不同病理和机构偏移下的鲁棒性,实现更高的AUROC和AUPRC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13310 2026-05-14 cs.DL cs.DB cs.IR 50%

SemRepo: A Knowledge Graph for Research Software and Its Scholarly Ecosystem

SemRepo:一个用于研究软件的知识图谱及其学术生态系统

Abdul Rafay, Yuni Susanti, David Lamprecht, Michael Färber

专题命中 仓库级理解 :repository(abstract)

AI总结 SemRepo通过整合科研软件与学术资源,提供跨平台查询能力,支持复现分析和风险识别,推动科研软件可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他AI编程 1 篇

2504.16584 2026-05-14 cs.CR cs.AI 57%

Case Study: Fine-tuning Small Language Models for Accurate and Private CWE Detection in Python Code

案例研究:微调小型语言模型以在Python代码中实现准确且隐私的CWE检测

Md. Azizul Hakim Bappy, Hossen A Mustafa, Prottoy Saha, Rajinus Salehat

机构 * Institute of Information and Communication Technology, Bangladesh University of Engineering Technology(孟加拉工程科技大学信息与通信技术研究所) Hajee Mohammad Danesh Science and Technology University(海杰莫哈默德丹什科学与技术大学)

专题命中 其他AI编程 :code model(abstract);分类 cs.AI

AI总结 本文研究了微调小型语言模型用于在Python代码中准确检测CWEs的可能性,通过半监督方法生成数据并人工审核,最终在测试集上实现了99%的准确率和99.04%的F1分数,展示了其在隐私保护下的高效安全分析潜力。

Comments 11 pages, 2 figures, 3 tables. Dataset available at https://huggingface.co/datasets/floxihunter/synthetic_python_cwe. Model available at https://huggingface.co/floxihunter/codegen-mono-CWEdetect. Keywords: Small Language Models (SLMs), Vulnerability Detection, CWE, Fine-tuning, Python Security, Privacy-Preserving Code Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏