Automated Lemma Discovery in Agentic Program Verification
代理程序验证中的引理发现
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE
AI总结 本文提出LemmaNet代理,通过分析源代码和规格,发现辅助引理以提升程序验证的正确性保证。
Comments 13 pages. To appear in ASE 26
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
代理程序验证中的引理发现
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE
AI总结 本文提出LemmaNet代理,通过分析源代码和规格,发现辅助引理以提升程序验证的正确性保证。
Comments 13 pages. To appear in ASE 26
Pomona:通过小型自动化变更实现彭博社的持续代码质量改进
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE
AI总结 提出Pomona轻量级代理工具,通过扫描和修复技能自动发现并修复代码问题,生成约10行差异的小型PR,经一个月团队部署和10名高级工程师问卷评估,17个PR中15个成功合并,中位关闭时间低于2小时,8/10工程师愿意采用。
Comments 6 pages, 2 figures, 1 table, under review
一种自演化代理框架用于超材料逆向设计
机构 * University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出一种自演化代理框架,通过上下文级技能进化解决超材料逆向设计中工作流构建的难题,提升任务成功率并减少尝试次数,实现可重用的求解器专业知识积累。
LLMlambda 计算:人工智能代理、对话与信息流
机构 * University of Nottingham, UK(诺丁汉大学) ; University of Edinburgh, UK(爱丁堡大学) ; Chalmers University of Technology(查尔姆斯理工大学) ; The University of Gothenburg, Sweden(哥德堡大学)
专题命中 软件智能体 :AI agent(title);agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出了一种无类型的lambda计算模型,用于形式化描述和验证人工智能代理中对话和信息流的安全性。
TENET:迈向仓库级代码生成的测试驱动开发的第一步
机构 * Purdue University(普渡大学) ; Microsoft Office AI(微软办公人工智能)
专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract);agentic(abstract)
AI总结 研究仓库级代码生成的测试驱动开发问题,提出TENET框架,含测试harness机制、定制工具集和细化工作流程,能选简洁测试套件,实现高效检索调试与迭代改进,性能优于基线,还研究了测试套件特征对LLM代理性能的影响。
Comments Accepted at the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)
当智能体市场到来时
专题命中 软件智能体 :agent(title,abstract);AI agent(abstract)
AI总结 本文提出可编程市场系统diagon,作为智能体认知劳动市场的制度设计实验平台,研究发现市场交换能带来生产力提升,但效果强烈依赖于制度结构。
RIME:实现大规模智能后期制作
机构 * Dartmouth College(达特茅斯学院)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract)
AI总结 研究针对音乐后期制作问题,引入RIME框架,利用POEMS工具包生成配对数据,评估多模态语言模型,展示其通过监督微调提升智能体性能,是迈向迭代音乐智能体、变革音乐制作的早期步骤。
不要责怪大语言模型:脚手架演化如何塑造编码代理质量
机构 * Queen’s University Canada(加拿大女王大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究编码代理中脚手架演化对其质量的影响。通过固定模型、仅改变脚手架,对Qwen Code CLI的35个连续版本进行评估,追踪质量波动与开发模式及架构组件的关系。
FormulaCode: 评估在大规模代码库上进行代理优化
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; California Institute of Technology(加州理工学院) ; Cornell University(康奈尔大学)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。
Comments ICML Camera Ready Version
CORE-Bench:智能体编程时代代码检索的综合基准
专题命中 软件智能体 :agentic(title,abstract);agent(abstract)
AI总结 针对智能体编程中需求驱动的仓库级代码检索问题,构建了包含18万查询和10.6万上下文相关性标签的三级基准CORE-Bench,实验表明现有嵌入模型性能显著下降,微调可提升效果。
超越训练范围编码:Claude Code 与软件开发者的技术前沿
专题命中 软件智能体 :agentic(title,abstract);agent(abstract)
AI总结 利用双重稳健估计器分析 Claude Code 的逐步推出,发现 AI 编码助手显著增加了开发者的月度提交数、贡献仓库数、使用语言数及语言熵,且累积语言效应随时间增长,表明 AI 降低了技术切换障碍。
ThunderAgent: 一个简单、快速且程序感知的智能推理系统
专题命中 软件智能体 :agentic(title,abstract);workflow(abstract)
AI总结 提出ThunderAgent系统,通过LLM程序抽象统一管理KV缓存和工具资源,实现程序感知调度,在编码、路由和科学发现任务中吞吐量提升1.5-3.9倍,磁盘内存节省高达4.2倍。
破解代码:通过系统性越狱攻击对AI代码代理进行安全评估
机构 * University of Maryland – College Park(马里兰大学-College Park) ; AWS AI Labs(AWS人工智能实验室) ; Meta Superintelligence Labs(Meta超智能实验室)
专题命中 软件智能体 :agent(abstract,abstract_cn);tool use(abstract);planning(abstract);分类 cs.AI
AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。
Comments 22 pages, 18 figures, 8 tables
Ouroboros:一种具有经审核的核心演化机制的自发展前沿编码智能体
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本研究提出具有经审核核心演化机制的编码智能体Ouroboros,其在三个基准测试中均创最优结果,Hope部署为长期活体演化实验,同时需应对自发展带来的操作安全问题。
SkillClaw: 让技能与代理进化者共同进化
机构 * DreamX Team(DreamX团队)
专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.CL
AI总结 SkillClaw通过聚合多用户交互数据,实现技能的集体进化,提升代理在现实场景中的性能。
SkillTrace:面向LLM智能体技能复用的多溯源审计
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出SKILLTRACE框架,通过提取三种溯源审计LLM智能体技能复用,在SKILLTRACE-BENCH上取得高指标,野外审计显示其能生成更具操作性的复用审查队列。
代理AI技能的正式分析与供应链安全
机构 * Independent Research(独立研究)
专题命中 软件智能体 :agentic(title);agent(abstract_cn);分类 cs.AI、cs.SE
AI总结 SkillFortify是首个用于代理技能供应链的形式化分析框架,通过六大贡献提升安全性和检测效率。
Comments 32 pages, 5 theorems with full proofs, 68 references, open-source tool: https://github.com/qualixar/skillfortify
μ子何时有助于智能体强化学习?
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.LG
AI总结 研究μ子在稀疏奖励智能体强化学习中的作用,通过与AdamW对比,发现在组内组策略优化下,μ子应用于隐藏权重矩阵能提升成功率,效果与优势估计器、学习率有关,表明其可使智能体RL受益,还需多种子和跨任务验证。
无需云端的智能编码:在纵向数据准备任务中评估开放权重的大语言模型
专题命中 软件智能体 :agentic(title);AI agent(abstract);分类 cs.AI、cs.CL
AI总结 研究在纵向数据准备任务中评估开放权重的大语言模型,介绍开源框架,含真实数据集、任务定义和评估程序,通过基准测试发现当前先进模型表现良好,为治理受限研究中的AI辅助数据准备提供可行路径。
Comments Presented at SLLS 2026; accepted at CLS 2026 and RSS 2026
RESOURCE2SKILL: 从人类创建的多模态资源中提取可执行智能体技能
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Shanghai Jiao Tong University(上海交通大学) ; Microsoft(微软)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 提出RESOURCE2SKILL框架,从教程视频、代码库、文章等人类多模态资源中提取可执行技能,构建分层多模态技能维基,提升智能体在七个领域的任务表现。
利用元记忆智能体增强大语言模型的无数据代码生成
机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) ; School of Computer Science, National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(多媒体软件国家工程研究中心计算机学院,武汉大学,中国) ; The University of Sydney, Sydney, Australia(悉尼大学,澳大利亚) ; Yunnan United Vision Technology Company Ltd., China(云南联合视界技术有限公司,中国) ; School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,中国) ; School of Information Science and Engineering, Yunnan University, Kunming, China(云南大学信息科学与工程学院,中国)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 提出元记忆智能体,通过引导模型回忆、评估和选择性利用相关知识,无需外部示例即可提升无数据场景下的单次代码生成质量。
BLAgent: 一种面向文件级Bug定位的代理RAG
机构 * University of Calgary(卡尔加里大学) ; York University(约克大学)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE
AI总结 本文提出BLAgent,一种新型代理RAG框架,用于文件级Bug定位,通过结合代码结构感知的仓库编码、双视角查询转换和两阶段代理重排序,提高了Bug定位的准确性和效率。
Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM)
LinkAnchor:一个基于自主LLM的代理用于问题到提交链接恢复
机构 * Bowling Green State University(伯灵顿州立大学) ; University of Nebraska-Lincoln(内布拉斯加大学林肯分校) ; University of Zurich(苏黎世大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 针对软件仓库中问题到提交链接恢复的挑战,本文提出LinkAnchor,通过懒惰访问架构动态检索相关数据,提升链接恢复的准确性和效率。
Comments Proceedings of the ACM International Conference on the Foundations of Software Engineering (FSE), Montreal, Canada, July 2026
“不要向用户提及此事”:检测与理解恶意代理技能
机构 * Griffith University(格里菲斯大学) ; Nanyang Technological University(南洋理工大学) ; University of New South Wales(新南威尔士大学) ; Zhejiang Key Laboratory of Digital Fashion and Data Governance, Zhejiang Sci-Tech University(浙江数字时尚与数据治理重点实验室,浙江科技大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 本文通过对两个主要注册中心的98,380个技能进行系统安全分析,结合静态模式匹配和动态行为验证,识别出157个恶意技能,揭示了13种攻击技术中的632个不同漏洞,并发现攻击复杂性与隐藏投入相关。
Comments Accepted to the 35th USENIX Security Symposium (USENIX Security 2026)
从人类引导到自主:面向空间NPU上端到端LLM部署的智能体技能系统
机构 * AMD Research and Advanced Development(AMD研究与高级开发)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 提出两阶段方法,从人类引导的智能体辅助部署到自主技能系统,在AMD XDNA 2 NPU上实现8种LLM的端到端自动部署,性能超越或持平人工优化基线。
Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026
AnyPoC:用于可扩展LLM基于Bug检测的通用证明-概念测试生成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 软件智能体 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 AnyPoC通过多代理框架生成可执行的证明-概念测试,以验证候选Bug报告,提升自动化Bug检测的实用性。
当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障
专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.SE
AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。
Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track
CoEvoSkills: 通过共进化验证实现自进化代理技能
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; McGill University(麦吉尔大学) ; Columbia University(哥伦比亚大学) ; Zhejiang University(浙江大学) ; University of British Columbia(不列颠哥伦比亚大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
AI总结 本文提出CoEvoSkills框架,使代理能自主生成复杂技能包,通过共进化验证提供反馈,实现在SkillsBench上最高通过率和强泛化能力。
Comments COLM accepted
FlashRT:用于引导智能体部署实时多模态应用的智能体框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; AMD(超威半导体公司) ; University at Buffalo(纽约州立大学水牛城分校)
专题命中 软件智能体 :agent(title,abstract);分类 cs.LG
AI总结 研究实时多模态应用部署难题,提出FlashRT智能体框架。通过新范式引导编码智能体多阶段转换,将参考实现转为高效部署,在不同GPU上显著提升性能,尤其在专家优化不成熟平台更具扩展性。
停止即停止:测量和修复智能体框架控制原语中的执行差距
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 研究生产型大语言模型智能体框架控制原语执行差距,用无模型差分探针发现漏洞及差距,提出SOUNDGATE修复,能强制执行多种属性,端到端阻止违规,释放合法效果。
Comments 32 pages, 3 figures, 11 tables. Code: pip install soundgate (PyPI)