Automated Testing and Repair for Verified Compilers Generated by a Coding Agent
基于编码智能体生成的验证编译器的自动化测试与修复
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 该研究针对编码智能体生成的验证编译器,提出了基于智能体的自动化测试与修复系统,经评估其在Axon编译器上无奖励黑客攻击问题,可有效开展测试与修复。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基于编码智能体生成的验证编译器的自动化测试与修复
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 该研究针对编码智能体生成的验证编译器,提出了基于智能体的自动化测试与修复系统,经评估其在Axon编译器上无奖励黑客攻击问题,可有效开展测试与修复。
VISA:面向智能体可复现性的智能体仿真模型结构化描述协议
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
AI总结 该研究提出VISA结构化描述协议,通过八个表格及可执行规则、LLM技能提升智能体模型可复现性,在三类平台的ABMs上验证了其有效性,将复现障碍转化为可处理的依赖项。
跨模型跨语言AI编程智能体性能:并行CLRS算法的准确率与速度
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 本文评估Cursor's Composer 2.0等三款AI编程智能体在三种语言三类算法上的并行代码生成性能,发现其并行能力弱于串行,性能提升高度依赖算法与语言,需将运行时效率纳入大语言模型核心指标。
Kernel Forge:用于基于大语言模型的CUDA内核生成与优化的代理框架
机构 * University of Michigan(密歇根大学)
专题命中 软件智能体 :agent(title);agentic(abstract);分类 cs.AI
AI总结 研究针对机器学习模型中计算内核优化需专家手写代码的问题,提出开源端到端代理框架Kernel Forge,它支持多种工作负载,用蒙特卡洛树搜索优化路径,经实验评估,优化后的内核性能优于PyTorch即时模式。
Comments The code is available at: https://github.com/TheJoshBrod/KernelForge
HELIOS:一个由大语言模型驱动的自主间接轨迹优化智能体
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
AI总结 研究低推力轨迹优化面临的问题,提出基于大语言模型的HELIOS智能体,能自主进行PMP符号推导等。其创新包括约束自适应推导框架等,实验表明可解决多种轨迹优化问题,验证了模型无关架构及模型规模与推导能力的正相关。
输出格式x模型标识:单轮编码代理性能中的交互效应
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 研究输出格式与模型交互对单轮编码代理性能的影响,通过多模型、多格式、多任务实验发现无普遍最优格式,有格式滥用问题,提出特定于模型的输出策略及工具设计原则并开源数据模板。
Comments 16 pages, 7 tables, 3 figures
他们会验证。但他们不会采取行动。权威框架和清洗后的代码如何将一个可信的代理式CI/CD管道变成攻击面
机构 * Senthex Research(Senthex研究机构) ; RELAY Lab(RELAY实验室)
专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI
AI总结 研究五代理CI/CD管道在面对恶意输入时的安全性,通过AxB(xC)析因设计实验发现权威框架注入会使下游验证者放行恶意代码,基于内容的控制会失效,只有来源感知控制可防攻击,揭示了现有保护机制的不足。
Comments 9 pages. Dataset and reproduction code: https://github.com/senthex-security/senthex-research
KernelDiag:基于代理的内核崩溃根本原因诊断
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 针对Linux内核崩溃根本原因诊断难的问题,提出KernelDiag框架,通过日志到代码映射及专门代理进行结构化因果推理,在KGYM基准测试中表现出色,优于现有方法,为自动内核根本原因诊断奠定基础。
使代理介导的贡献具有可治理性:开源人工智能协作的项目级治理宣言
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 研究开源人工智能协作中代理介导贡献的治理问题,开发代理治理宣言(AGM)作为双向治理合同,通过实验验证其有效性,构建三层框架,推进合规数字创新治理并保留维护者决策权。
Comments Preprint. Under journal review
理解模型-框架边界处的代理反应性错误:对大型语言模型代理问题报告的实证研究
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 研究聚焦大型语言模型代理在模型-框架边界处的反应性错误,通过分析255份错误报告构建分类法,发现此类错误多为无明确测试预言的静默错误,检测和重现困难,还揭示了用户与开发者对错误归因及修复的不匹配,推动相关技术设计。
TerraRepair:一种用于基础设施即代码修复的工具接地大语言模型代理
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 研究探讨工具接地能否改进基于LLM的Terraform修复及何时升级问题。提出TerraRepair工具接地LLM代理,通过检索上下文等操作进行修复。实验表明其能显著提高扫描器验证修复率,凸显工具接地改进修复效果,同时指出特定部署上下文是自主修复的主要限制。
Comments The paper has been peer reviewed and accepted for publication in the proceedings of the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026)
面向检索的智能体漏洞定位中的代码表示
专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE
AI总结 研究文件级漏洞定位中代码表示的作用,在LCA和SWE数据集上比较五种代码表示,通过实验发现角色感知摘要性价比最佳,结合互补结果和LLM排序可进一步提升效果,案例研究验证技术有效性,强调代码表示应是智能体定位管道的重要设计选择。
通过数据密集型计算中的属性模板进行智能体证明和基于属性的测试
专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE
AI总结 研究软件工程中意图规范和验证问题,提出用属性模板解决验证候选属性和实施PBT的子问题,设计智能体双轨验证框架,经评估该框架能提高证明成功率、减少幻觉、降低成本并提升代码覆盖,还能发现模型与实现差距。
Comments 12 pages, 7 figures, 4 tables; supplementary material included as ancillary file
一种评估智能体人工智能自主模型发现的实验设计方法
机构 * Department of Statistics, Virginia Tech(统计学系,弗吉尼亚理工学院) ; Department of Statistical Science, Baylor University(统计科学系,贝勒大学) ; Advanced Research Computing, Virginia Tech(高级研究计算,弗吉尼亚理工学院)
专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI
AI总结 研究大型语言模型编码智能体自主模型发现行为,提出实验设计与分析框架,将智能体视为随机模型发现算子,在多种受控因素下研究Codex和Claude Code两个算子,进行回归模型和推理,开发规范分解,通过网络造词游戏测试平台得出相关深刻发现。
Comments 39 pages, 11 figures, 6 tables. Data and code available at the GitHub repository listed in the paper
用于智能任务的以对象为中心的环境建模
机构 * University of Notre Dame(圣母大学)
专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI
AI总结 研究大语言模型智能体经验维护难题,提出以对象为中心的环境建模(OCM),将经验组织成可执行模型,含对象知识与过程知识,在线更新并验证,实验表明其能提升智能体性能。
伪装与引爆:技能型恶意软件的扫描规避与动态检测
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 针对LLM编码代理技能市场中的恶意技能,提出两种规避静态扫描的方法(结构混淆和自提取技能打包),并设计基于沙箱运行时行为审计的检测系统SkillDetonate,实现97%检测率与2%误报率。
Refploit: 通过代码代理轨迹修复促进漏洞利用构建
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 提出Refploit框架,利用大语言模型修复代码代理生成的失败轨迹,通过差分执行验证和约束引导恢复,在Java漏洞数据集上实现80.2%的复现率,相对初始轨迹提升64.3%。
停止手把手指导你的编码智能体:设计替代逐步提示的循环机制
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 本文提出循环规范作为替代逐步提示的编码智能体新范式,定义其结构、分类与设计原则,并通过真实语料分析验证其成熟度。
确保失败安全:一个用于开放网络数据收集的受约束、可验证的智能体框架
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
AI总结 提出一个受约束、可验证的智能体框架,通过将LLM输出从自由形式代码转换为类型化JSON收集器配置,结合六类型收集器分类、模板和效用函数约束、静态Airflow DAG执行、基于规则的质量检查和结构化反馈纠正,实现了零执行阶段LLM令牌消耗和最低平均挂钟时间。
Comments 15 pages, 1 figure
AxDafny: Dafny中的智能验证代码生成
机构 * Axiomatic AI, Boston, MA, USA(Axiomatic AI,波士顿,马萨诸塞州,美国)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI
AI总结 提出AxDafny框架,通过验证器引导的修复迭代生成Dafny代码和证明,在LCB-Pro-Dafny和DafnyBench上显著提升验证成功率。
本地LLM智能体作为易受攻击的运行时:智能体运行时层的源代码审计
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; University at Buffalo, SUNY(布法罗大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
AI总结 提出CLAWAUDIT静态审计框架,通过STRIDE导出的五类漏洞分类法和自定义静态分析规则,评估本地LLM智能体运行时的安全弱点,在OpenClaw基准上显著提升召回率。
CmdNeedle: 衡量AI智能体命令黑名单的不完备性
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI
AI总结 针对终端AI智能体命令黑名单的脆弱性问题,提出LLM驱动的检测流水线CmdNeedle,发现69.0-98.6%的黑名单存在可绕过漏洞。
CMIP-Forge:一个检索、计算和自我审查气候科学的智能体系统
机构 * Alfred Wegener Institute, Helmholtz Centre for Polar and Marine Research(阿尔弗雷德·韦格ener研究所,极地与海洋研究中心)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI
AI总结 提出CMIP-Forge系统,结合检索增强生成与自主分析,通过多层级防御架构和独立审查机制,实现从文献到实时气候数据的端到端自主研究。
Comments 28 pages, 9 figures. Code available at https://github.com/CliDyn/cmip6_gpt
SkillWiki: 一个用于智能体技能的活知识基础设施
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Tencent(腾讯) ; Nanyang Technological University(南洋理工大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.CL
AI总结 提出SkillWiki,一个支持智能体技能组织、落地和持续演化的活知识基础设施,通过将异构知识转化为可复用技能资产并关联原始证据,实现从知识摄入到技能生产、溯源探索、治理和执行驱动演化的完整生命周期。
AI驱动的软件开发:迈向智能开发过程的务实路径
专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE
AI总结 本文提出一个务实框架,指导从辅助性AI使用到可控智能开发过程的过渡,聚焦技术、组织和质量保障机制,并通过中型软件公司案例验证其可行性。
编程语言对你的AI编码队友还重要吗?来自国际象棋引擎的大规模证据
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 通过让前沿AI代理用17种编程语言开发国际象棋引擎,发现AI能生成任何语言的可用系统,但语言选择仍影响性能、成本和功能,主流编译语言才能达到强棋力。
运行时技能审计:针对智能体技能安全的目标运行时探测
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
AI总结 提出运行时技能审计(RSA)动态分析方法,通过目标运行时条件探测技能行为,在100个技能上达到90.0%准确率,优于静态基线。
智能体框架的能耗与债务:一项实证研究(注册报告)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE
AI总结 通过实证研究关联智能体框架中的自我承认技术债务与运行时能耗,探讨代码质量能否指导节能设计。
Comments Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Registered Reports Track
TICoder: 一种具有测试驱动规划和实现感知复用的仓库级代码生成框架
专题命中 软件智能体 :planning(title,abstract);分类 cs.SE
AI总结 提出TICoder框架,通过测试驱动迭代规划机制和实现感知代码复用策略,解决仓库级代码生成中的依赖和上下文限制问题,在多个基准上平均提升11.52%。
Comments 11 pages
警惕智能体僵尸网络:通过通用且可转移的对抗性幻觉蹲点进行可扩展的无目标提示软件攻击
专题命中 软件智能体 :agentic(title,abstract)
AI总结 研究针对实际威胁模型中无直接渠道时攻击者能否利用LLM应用的问题,提出对抗性幻觉蹲点技术,通过识别热门资源计算幻觉分布抢先注册对抗性提示,利用幻觉特性扩大无目标提示软件攻击范围并建立僵尸网络,实验证明该技术可行性及幻觉可转移性。
Comments Website: https://sites.google.com/view/agentic-botnets/home