arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-15 至 2026-07-15 共收录 10 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 2 篇

2607.12089 2026-07-15 cs.CR cs.SE 新提交 57%

Cross-Cutting Security Analysis of LLM-Generated Code via Metamorphic Testing and Association Rule Mining

通过变形测试和关联规则挖掘对大语言模型生成代码进行横切安全分析

Zedong Peng, Chenggang Wang, Shangyue Zhu

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 研究针对LLM生成代码的安全漏洞,提出结合变形测试与关联规则挖掘的框架,定义九个MRs并应用于3700个代码片段,揭示共同违反结构与横切模式,还进行提示级风险分析,发现不安全代码生成具结构化和提示依赖性,推动相关验证与干预。

Comments This work has already been accepted by IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12624 2026-07-15 cs.CR 新提交 50%

PVDetector: Detecting Prompt Injection Attacks on Purpose-Specific LLM Agents through Policy-Violation Concept Analysis

PVDetector:通过策略违规概念分析检测针对特定目的大语言模型代理的提示注入攻击

Junhui Wang, Hangtao Zhang, Zhirun Zheng, Li Zeng, Jiejun Xiao, Xi Luo, Lihua Yin, Saiqin Long

专题命中 代码生成 :code generation(abstract)

AI总结 研究针对特定目的LLM代理的提示注入攻击,提出PVDetector框架,通过测量与离线派生的PV概念的隐藏状态对齐来检测攻击,实验表明该方法误报率低、开销小,性能优于现有方法。

Comments Accepted to ACM MM 2026. Code: https://github.com/Claresigle/PVDetector

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2607.12220 2026-07-15 cs.RO 新提交 78%

Contract-Grounded Behavior Tree Synthesis via Coding Agents

通过编码代理实现基于契约的行为树合成

Jonathan Salfity, Robert Blake Anderson, Mitch Pryor

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 软件智能体 :coding agent(title,abstract)

AI总结 研究从自然语言合成机器人行为树时基础设定易出现的问题,提出基于契约的合成架构,编码代理查询服务器获取契约后合成行为树,经实验评估两个大语言模型,结果显示该架构能实现高验证率和成功率,且可转移到物理硬件。

Comments IEEE RA-L Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12057 2026-07-15 cs.SE 新提交 70%

Predicting Acceptance and Review Effort in Human and Agent Pull Requests

预测人类和智能体拉取请求的接受情况及评审工作量

Kartik Ghanshyambhai Pansuriya, Ehsan Ghorbani, Deepak Singh, Eman Abdullah AlOmar

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 研究在拉取请求打开时预测其接受情况及评审工作量的可行性,利用AIDev数据集构建预测管道,评估多种机器学习模型,发现接受度预测可行,评审工作量预测较难,早期模型可支持分类和优先级排序,应作咨询工具。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2607.12605 2026-07-15 cs.SE cs.AI 新提交 81%

Multi-Perspective Agentic Program Repair via Code Property Graphs and Temporal Execution Graphs

通过代码属性图和时间执行图进行多视角智能程序修复

Zhili Huang, Ling Xu, Hongyu Zhang

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE、cs.AI

AI总结 研究针对大语言模型在自动程序修复中的局限,提出CT-Repair框架,通过代码属性图和时间执行图表示证据,利用三阶段过滤管道及多视角智能体分析错误并生成修复策略,实验证明该方法能有效提高修复有效性。

Comments 12 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2607.12068 2026-07-15 cs.SE 新提交 57%

Beyond Test Presence: Assessing the Quality and Robustness of Agent-Generated Tests in Open-Source Projects

超越测试存在:评估开源项目中代理生成测试的质量和稳健性

Preet Jhanglani, Zeel Kaushal Desai, Vidhi Kansara, Eman Abdullah AlOmar

专题命中 测试生成 :coding agent(abstract);分类 cs.SE

AI总结 研究开源项目中代理生成测试的质量和稳健性,通过对大量测试工件进行实证比较,用“白盒”静态分析框架评估质量维度,发现代理在边缘情况覆盖率上优于人类,但生成测试更易脆弱,揭示其缺乏编写稳定测试的“环境意识”。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 2 篇

2607.12962 2026-07-15 cs.SE cs.AI cs.LG 新提交 82%

Form, Not Content? A Preregistered, Placebo-Controlled Evaluation of Learned Error-Conditioned Self-Repair Through Prompts and Weights in Frozen Small Code Models

形式而非内容?对冻结小代码模型中通过提示和权重进行的学习错误条件自修复的预注册、安慰剂对照评估

Mehmet Iscan

机构 * PythaLab, Yıldız Technical University, Istanbul, Turkey(PythaLab,Yıldız技术大学,伊斯坦布尔,土耳其)

专题命中 代码评测 :code model(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 研究冻结小代码模型中错误条件自修复,引入PoPE方法,通过提示和权重通道对其评估,结果表明在提示通道内容消除形式安慰剂下解锁单元数有差异,权重通道各情况有不同表现,未确认内容归因优越性,PoPE是可重新测试的测量标准。

Comments 54 pages, 6 figures, 17 tables. Preregistered, placebo-controlled evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12835 2026-07-15 cs.CL 新提交 57%

Can LLMs Write Reliable Rubrics? A Meta-Evaluation for Experiment Reproduction

大语言模型能写出可靠的评分标准吗?实验复现的元评估

Hanhua Hong, Yizhi Li, Jiaoyan Chen, Luu Gia Huy, Sophia Ananiadou, Jung-jae Kim, Chenghua Lin

机构 * The University of Manchester(曼彻斯特大学) Institute for Infocomm Research (I²R), A*STAR(资讯通信研究院(I²R),新加坡科技研究局) IQuest Research(IQuest研究公司) ELLIS Manchester(ELLIS曼彻斯特) University of Information Technology, VNU(越南国家大学信息技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 研究大语言模型生成的论文复现评分标准,将其 reformulate 为清单样式,在两个骨干模型上评估四种生成设置,通过语义相似性和分数对齐进行元评估,结果显示增强设置改善下游评估对齐,同时指出其存在过于细化、偏向高分和适应性差等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 2 篇

2607.13021 2026-07-15 cs.SE 新提交 57%

Software Supply Chains are Dead: Use-Case-Oriented Regeneration

软件供应链已死:面向用例的再生

Tanmay Singla, James C. Davis

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 研究现代软件开发中构建与复用权衡因软件供应链攻击及生成式人工智能而改变,提出面向用例的再生范式,评估智能工作流程,通过对180个存储库-依赖对测量,证明该方法可行,推动软件采购向可验证的特定于存储库的代码合成发展。

Comments [ESEM'26-ERVR] Proceedings of the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026 Emerging Results, Vision, and Reflection Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12301 2026-07-15 cs.SE cs.MA 新提交 57%

XScientist: A Git-Like Research Protocol for Long-Running Autonomous Scientific Discovery

XScientist:用于长期自主科学发现的类似Git的研究协议

Jixiang Luo

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 研究针对自主研究系统的问题,提出XScientist这一类似Git的研究协议和操作系统,核心方法是将运行视为可移植工件并导出相关协议,主要贡献是使自主科学从单次演示走向可重现、可审查和可分叉的研究基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏