SCOPE: Leveraging Subgoal Critiques for Code Generation
SCOPE:利用子目标批判进行代码生成
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究针对大语言模型代码生成不可靠问题,提出SCOPE方法,利用证明器初始化子目标批判,结合监督微调、强化学习等,通过两个互补奖励改进代码生成,实验显示在多个数据集上优于基线,优势集中在有语义约束任务,代码修正更局部。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
SCOPE:利用子目标批判进行代码生成
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究针对大语言模型代码生成不可靠问题,提出SCOPE方法,利用证明器初始化子目标批判,结合监督微调、强化学习等,通过两个互补奖励改进代码生成,实验显示在多个数据集上优于基线,优势集中在有语义约束任务,代码修正更局部。
SEVRA-BENCH:审查智能体中的社会工程漏洞
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft Core AI(微软核心人工智能) ; Amazon AWS(亚马逊AWS) ; Databricks
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.AI
AI总结 提出SEVRA-BENCH基准,通过社会工程攻击框架评估LLM代码审查智能体拒绝恶意PR的能力,发现闭源与开源模型间存在显著安全差距。
通过检索增强生成和约束解码减轻大语言模型生成的Web API调用中的错误
机构 * Technische Universität Darmstadt(德累斯顿技术大学) ; Hessian Center for Artificial Intelligence (hessian.AI)(黑森人工智能中心) ; Pariton AI ; National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG
AI总结 研究如何减轻大语言模型生成的Web API调用错误,提出检索增强生成(RAG)和约束解码(CD)两种互补方法,设计相应技术细节,在合成和真实数据集上评估,结果显示RAG、CD各有优劣,能提升Web API调用代码正确性。
Comments 54 pages, 11 figures; supersedes arXiv:2509.20172v6, which is a discarded journal extension of our work
KAT-Coder-V2.5技术报告
机构 * KwaiKAT Team(快手KwaiKAT团队)
专题命中 代码生成 :repository(abstract);分类 cs.SE、cs.AI
AI总结 介绍KAT-Coder-V2.5这一专注编码的智能模型,针对其受环境等因素限制的问题,通过端到端框架及多种技术手段解决,经多方法扩展强化学习并统一专家知识,在多个基准测试中取得优异成绩。
Comments 24 pages, 5 figures
FreqDepthKV:用于长上下文语言模型推理中稳健的键值缓存压缩的频率引导深度共享
机构 * Instituto de Investigación en Visión Artificial(人工视觉研究所)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 研究针对长上下文语言模型推理中键值缓存成本问题,提出FreqDepthKV方法,将相邻层键值状态分解,通过在线探测器分配缓存模式,在多基准测试中保持任务准确性,提升解码吞吐量并降低内存,实现高效压缩。
Comments 11 pages, 2 figures
有情感的智能体?多智能体软件工程团队中的个性与情感
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 研究多智能体软件工程团队中个性和情绪特征对团队绩效的影响,采用结合多种因素的心理学框架,通过对78种团队配置评估发现配置显著影响性能、协作及成本,表明智能体配置是重要设计维度。
通过任务分解阐明人工智能生成的科学分析中的假设
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 研究旨在解决大语言模型生成的科学分析结果的可理解性和可重现性问题,通过引入基于数量的语义差异多智能体框架及相关模块,经对撞机物理分析验证,模块化任务分解提升了透明度与可靠性,还能让小模型执行完整流程。
Comments 20 pages, 1 figure and 4 tabels
挥之不去的权限:面向编码智能体的可撤销资源与效果能力
机构 * International University of La Rioja(拉里奥ja国际大学)
专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI
AI总结 针对编码智能体中临时权限残留问题,提出PORTICO监控器,通过可撤销能力生命周期管理,在保持任务成功率的同时消除越权副作用。
Comments 20 pages
从对话到贡献:开源软件中编码代理的特征分析
专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE
AI总结 研究开源软件中开发者与人工智能编码代理聊天交互和后续开发协作的关系,通过收集大量会话及关联仓库历史等进行分析,发现小仓库AI使用多,采用后贡献者有变化,还揭示了开发者对AI代码的看法及相关担忧,为开源开发实践提供见解。
Comments 10 pages, 3 figures
解决率背后隐藏的内容:编码代理的轨迹结构诊断
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 研究编码代理解决率背后隐藏的轨迹结构问题,提出TraceProbe框架,将原始运行归一化并应用两个基于规则的模块,通过对2500个轨迹的实验,发现文件选择、函数选择等行为与结果的关系,以及反模式作用等,为结果添加诊断上下文。
人工智能编码代理执行安全研究的巴尔干化:隔离、访问控制和检查时间到使用时间漏洞
机构 * Department of Computer Science(计算机科学系) ; AI and Media Analysis Lab(人工智能与媒体分析实验室) ; Berlin, Germany(德国柏林)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI
AI总结 研究人工智能编码代理执行安全相关文献分散问题,将39篇论文系统化分类并验证,找出五个交叉差距,如隔离架构与能力模型缺乏共享基准评估等,最后针对差距提出研究议程。
Comments 18 pages, 15 figures, 6 tables. Systematizes 39 execution-security papers (2023-2026) into 17 verified categories. Machine-readable corpus and verification script released as a supplementary artifact
SWE-Review:通过智能代码审查解决问题闭环
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE
AI总结 研究通过智能代码审查闭合PR生成环的问题,核心方法是SWE-Review框架,由审查代理进行审查并提供反馈。主要贡献是能持续改进PR,在多方面表现优于单轮审查,还能推动AI编码代理从一次性PR生成迈向闭环问题解决。
GitHub上的AI代理拉取请求:频率、结构和合并冲突率
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE
AI总结 利用AIDev-pop数据集对AI代理编写的拉取请求并发情况进行大规模实证分析,发现特定时间重叠下部分仓库有协同活动的请求对,多数为同一代理,还研究了合并冲突率及冲突类型。
Comments 7 pages, 4 figures, 2 tables. Replication package: https://doi.org/10.5281/zenodo.21186464
教学型智能体:将偶然学习重新融入人工智能辅助软件开发的设计探索
机构 * Accenture Labs, India(Accenture实验室,印度) ; Accenture, USA(Accenture,美国)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 探讨人工智能编码智能体使开发者过度依赖而失去偶然学习机会并积累知识债务的问题,提出六项设计原则,展示基于“教学型智能体”概念的“SHIELD”系统,推动形成生产力与学习互补的学习感知开发环境。
Comments 5 pages. To be published in the proceedings of 41st International Conference on Automated Software Engineering (ASE '26), October 12-16, 2026, Munich, Germany (New Ideas and Emerging Results Track)
模型上下文协议中工具元数据负载的Unicode标签块隐藏:三个独立服务器实现之间的批准视图保真度差距
机构 * Department of Computer Science(计算机科学系) ; AI and Media Analysis Lab(人工智能与媒体分析实验室)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 研究模型上下文协议中工具元数据负载隐藏问题,通过无模型无协议分析发现Unicode的TAG块可实现隐藏,构建概念验证并在不同元数据表面实现8种技术,验证其能突破客户端防御,且在三个独立服务器库中结果一致。
Comments 15 pages, 4 figures, 7 tables, 5 listings. Real-protocol proof-of-concept, 8 techniques across 3 independently developed MCP server libraries with 32 of 32 cross-library outcome cells agreeing, and 0 of 25 baseline false positives on a benign corpus. Data, harness, and fail-closed verifier released as a supplementary artifact
人工智能代理实际改变了什么?性能改进拉取请求中突变模式的实证分类法
机构 * Edinburgh Napier University(爱丁堡纳皮尔大学) ; University of Stirling(斯特林大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 研究聚焦人工智能编码代理这一黑箱,通过对33596个代理拉取请求中1254个性能相关差异块进行分类,发现主导的三类突变模式,揭示代理身份和目标策略对缩小基于搜索的软件工程操作空间有参考价值。
从提示到论文:用于生物信息学的智能AI系统
机构 * School of Interdisciplinary Engineering and Sciences (SINES), National University of Sciences and Technology (NUST)(跨学科工程与科学学院(SINES),国立科技大学(NUST))
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI
AI总结 研究针对现有AI自动生成稿件系统的缺陷,提出Prompt-to-Paper多智能体框架。通过检索增强生成、自主编码实验及八维质量评分等创新,经质量驱动改进循环,在生物信息学案例中验证,有效提升稿件质量,成本低且获较好外部评价。
Comments NA
大语言模型能否生成可观测性感知代码?
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 研究大语言模型生成的代码在可观测性方面的表现,通过恢复工件和注入故障评估代理生成系统的源级诊断语义与运行时故障信号,发现两者存在差距,引入的技能改进有限,指出当前评估或忽视可观测性这一软件质量维度。
使用北美行业分类系统(NAICS)对GitHub仓库进行行业分类
专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI
AI总结 研究利用北美行业分类系统对GitHub仓库进行行业分类,提出结合多种技术的检索与验证管道生成标签,构建NAICS-GH语料库,测试表明标签精度高,还对预训练编码器进行基准测试,相关数据和代码开源。
评估Dart AOT二进制文件神经反编译的微调与指标
机构 * Cairo University Computer Engineering Department, Faculty of Engineering(开罗大学计算机工程系,工程学院)
专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 研究针对Dart AOT二进制文件神经反编译,在新基准上用三个指标评估六种微调模型变体,发现无微调配置能显著提升pass@k,存在跨语言干扰及指标差异,指出汇编序列长度是任务难度关键预测指标,贡献新基准等并明确pass@k为主要评估指标。
Comments Under review at ACM Transactions on Software Engineering and Methodology (TOSEM)
EvalLoop:一种用于商业人工智能系统评估驱动迭代改进的方法
机构 * Robert Half(罗伯特·哈夫公司)
专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI
AI总结 研究针对商业AI系统评估忽视迭代改进价值的问题,提出EvalLoop方法,通过维度指标分组、故障模式分类和结构化迭代工作流程,实现评估驱动的迭代改进,经案例研究验证有效,还能助力模型选择与部署权衡,且被打包为可重用工件。
大规模科学代码搜索:多领域数据集与基准测试
机构 * The University of Alabama in Huntsville (UAH)(阿拉巴马大学亨茨维尔分校) ; Universities Space Research Association (USRA)(大学空间研究协会) ; NASA Marshall Space Flight Center(美国国家航空航天局马歇尔太空飞行中心)
专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI
AI总结 针对科学家在众多GitHub库中找相关软件难的问题,构建含多领域科学存储库的语料库,引入存储库搜索及代码片段检索两个基准测试,揭示不同领域性能差异,相关数据集和基准已公开,助力科学工具发现研究。
Comments Datasets and benchmarks publicly released on HuggingFace. Code released on GitHub
超越正确性:通过可扩展的智能体判断标注增强代码大模型的架构推理能力
机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) ; Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) ; School of Computing, Queen’s University, Canada(皇后大学计算科学学院)
专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI
AI总结 针对代码大模型缺乏架构理解的问题,提出智能体判断流水线,利用强LLM作为专家架构评估的代理,通过两个判断器(ACJ和AQJ)实现可扩展标注,微调模型在SWE-bench上提升高达540%,并展现跨语言泛化能力。
一种评估智能体人工智能自主模型发现的实验设计方法
机构 * Department of Statistics, Virginia Tech(统计学系,弗吉尼亚理工学院) ; Department of Statistical Science, Baylor University(统计科学系,贝勒大学) ; Advanced Research Computing, Virginia Tech(高级研究计算,弗吉尼亚理工学院)
专题命中 代码评测 :coding agent(abstract);分类 cs.AI;repository(comments)
AI总结 研究大型语言模型编码智能体自主模型发现行为,提出实验设计与分析框架,将智能体视为随机模型发现算子,在多种受控因素下研究Codex和Claude Code两个算子,进行回归模型和推理,开发规范分解,通过网络造词游戏测试平台得出相关深刻发现。
Comments 39 pages, 11 figures, 6 tables. Data and code available at the GitHub repository listed in the paper
语言模型代理的上下文到执行完整性
专题命中 代码评测 :repository(abstract)
AI总结 研究语言模型代理执行中的上下文到执行完整性问题,提出CXI系统,通过策略标记、类型化释放等机制保障安全执行,经多方面评估,在AgentDojo和代码代理基准测试等中取得良好效果,确保权限绑定才允许执行。
Comments 20 pages
衡量无形:评估公共资金对开源软件的影响
专题命中 代码评测 :repository(abstract)
AI总结 研究公共资金对开源软件的影响,结合目标-问题-指标框架与广义合成控制法,估计主权科技基金对OSS仓库活动的因果效应,发现资金对项目速度指标有显著正向影响,为公共OSS资金评估框架设计提供实践启示。
通过复杂网络中的扩散激活和类别探索进行早期语言学习
机构 * National Research Council (CNR)(国家研究理事会)
专题命中 仓库级理解 :repository(abstract);分类 cs.CL
AI总结 研究儿童词汇习得在语义和词汇类别上是否不均衡,将早期语言学习建模为基于图的搜索,由扩散激活和类别探索驱动,用多种资源评估模型在四种语言上的性能,发现扩散激活表现更好,揭示词汇发展与激活动态及约束的关系。
XRFormer:用于X射线荧光光谱表示学习的多尺度令牌化
机构 * Centre de Recherche et de Restauration des Musées de France(法国国家博物馆研究与修复中心)
专题命中 仓库级理解 :repository(abstract)
AI总结 研究针对X射线荧光光谱自动学习难的问题,提出XRFormer架构,通过多尺度卷积令牌器定制,结合自监督预训练方法,在颜料识别和分解任务中表现出色,凸显多尺度令牌化在数据有限时对基于变压器的XRF建模的有效性和高效性。
Comments International Conference on Pattern Recognition, 2026
物理推理公理:在Lean中编码塞伯格 - 维滕解
专题命中 仓库级理解 :repository(abstract)
AI总结 研究利用交互式定理证明器验证物理论证,通过假定物理假设清单,经机器可验证证明得出结果,以Lean 4形式化${N}=2$ $SU(2)$超杨 - 米尔斯的塞伯格 - 维滕解,为验证理论物理中AI生成结果提供合理标准。
Comments 18 pages; companion github repo mrdouglasny/seiberg-witten