TDD-Agent: Test-Driven Reasoning for Code Generation
TDD-Agent:用于代码生成的测试驱动推理
专题命中 软件智能体 :agent(title,title_cn);分类 cs.AI、cs.SE
AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
TDD-Agent:用于代码生成的测试驱动推理
专题命中 软件智能体 :agent(title,title_cn);分类 cs.AI、cs.SE
AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。
责任归属:在智能体软件开发中将人类责任映射到工作流制品
专题命中 软件智能体 :workflow(title,abstract);agentic(title,abstract);agent(abstract);分类 cs.SE
AI总结 该研究分析智能体软件开发中责任归属的矛盾,替换验证分类法,发现责任归属方向相反,指出智能体工具未造成责任差距,相关数据已公开。
Comments 30 pages, 5 tables. Source collection of 118 archived documents and 12 processing scripts deposited at Zenodo, doi: https://doi.org/10.5281/zenodo.21965182
量化智能体剖析:代码合成智能体工作负载中的VRAM稳定性与预测
机构 * Nokia Germany(诺基亚德国)
专题命中 软件智能体 :agent(title,abstract);agentic(title);分类 cs.AI、cs.LG
AI总结 该研究针对基于LangGraph的AgentK智能体,在1920条轨迹上评估量化LLM的VRAM消耗,提出闭式峰值内存预测模型,发现编译成功率受LLM容量限制,且无需复杂VRAM预测模型。
智能体社群中高阶相互作用的拓扑崩溃是集体智能的瓶颈
专题命中 软件智能体 :agent(title,abstract);AI agent(title)
AI总结 该研究发现AI智能体社群中高阶交互的拓扑崩溃会成为集体智能瓶颈,提出HIS和Φ指标,证实该瓶颈与模型无关,为人工社会设计提供了新方向。
工作空间拓扑作为智能体代码助手的攻击向量
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文研究将工作空间拓扑作为攻击向量,发现其会影响智能体代码助手的间接提示注入攻击成功率,高度模块化环境及安全提示可降低攻击成功率,为代码智能体安全测试提供实用价值。
Comments 15 pages, 10 figures. Preprint of a paper accepted at the Conference on Applied Machine Learning in Information Security (CAMLIS 2026)
编码智能体的工作集:仓库规模任务中的一致性债务
专题命中 软件智能体 :agent(title,abstract);分类 cs.LG、cs.SE
AI总结 该研究针对仓库规模编码任务,建模一致性债务,通过7个模型和5个框架实验发现事实可用性决定编码结果,提出测试框架应核对编辑依赖事实可用性的建议。
评估分布式系统中智能体的代码修复能力
专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。
Comments Under submission
采用AI编码智能体的规范优先收敛:在71.7万行代码库中拆解189个文件的核心架构不变量的案例研究
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本文通过案例研究,展示AI编码智能体在规范优先协议下,成功在71.7万行代码库中拆解核心架构不变量,耗时3天、成本2430美元,修正201个缺陷,涉及189个文件。
Comments 14 pages, 4 figures, 3 tables. v2: added plain-text log URLs in Section 10 for LLM readability
超越Pass@k:衡量智能体代码生成的可靠性与安全性
机构 * Stevens Institute of Technology(史蒂文斯理工学院) ; Cornell University(康奈尔大学)
专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI
AI总结 该研究指出AI编码智能体基准误用Pass@k指标,提出正确的Reliability@k及安全调整版,通过实验验证误用指标的偏差,还在SWE-bench试点中发现真实场景下的核心问题。
持久递归世界支持自主软件演化
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 该研究提出 Genesis 框架,以持久递归世界替代持久智能体,成功构建 C 编译器、重实现 MESA 模块,实现长周期软件开发并获显著性能提升。
比较 vibe 编码工具生成代码的质量
专题命中 软件智能体 :agent(abstract_cn);AI agent(abstract);分类 cs.SE
AI总结 本研究对比 Lovable、v0、Replit 三种 vibe 编码工具生成代码的结构质量,发现三者存在不同质量特征,选择工具需考量结构层面的权衡。
Aether.jl:一种用动态语言编写、具备人机交互开发框架的高性能三维磁流体与多流体尘埃代码
专题命中 软件智能体 :agent(abstract);workflow(abstract)
AI总结 Aether.jl是一款用Julia编写的高性能三维磁流体与多流体尘埃代码,采用交互式人机开发框架,单GPU性能优于C++代码,在Frontier超算4096个GCD上并行效率超93%,支持CPU、GPU运行,已公开。
Comments 25 pages, 16 figures
个性化技能对编码智能体有帮助吗?开发者交互历史的实证研究
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本研究通过对13位开发者的206个真实会话实验,发现从交互历史提炼的开发者个性化技能改进有限,而汇集自所有开发者的通用技能增益最大且最一致,为编码智能体的个性化策略提供了实证依据。
Comments 15 pages, 10 figures
进化代理群体
机构 * National University of Singapore(新加坡国立大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出EvE框架,通过进化编码代理群体实现算法发现,解决了传统方法的局限,展示了自修正群体在复杂代码库中的优势。
JailbreakSkill:通过可复用且不断演进的技能扩展自动化红队测试
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Northwestern Polytechnical University(西北工业大学) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本研究提出以技能为核心的JailbreakSkill框架,将攻击策略打包为可复用技能,通过攻击与学习的闭环演进技能,大幅提升攻击成功率,且技能可泛化至未见过的提示词与目标模型。
可执行代码知识:作为AI编码智能体原生、带验证的知识表示的代码
机构 * Alibaba Cloud(阿里云)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 该研究提出可执行代码知识(ECK)及其单元ECKU,构建Python原型验证其在编码智能体任务中的效果,支持源绑定、验证等功能,为AI编码智能体提供了混合架构方案。
Comments 11 pages. Submitted to AgenticDev 2026, co-located with ASE 2026
OpenHarmony Bench:评估LLM与编码智能体在OpenHarmony应用开发中的表现
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 该研究推出OPENHARMONY BENCH应用级编码基准,评估8个LLM驱动的DevEco Code在三类OpenHarmony ArkTS应用任务中的表现,发现新一代模型任务完成率更高、构建性接近饱和但行为正确性不足、spec驱动任务完成率最低。
AutoSQL:从大规模代码仓库中的命令式ORM代码提取SQL模板
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 AutoSQL是从大规模Go仓库的命令式ORM代码提取SQL模板的系统,采用代码索引、混合上下文检索策略,在基准测试中召回率优于现有方法。
Comments Accepted to ASE '26
对软件工程任务中投机解码的实证研究
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本文通过实证研究评估了投机解码在软件工程任务中的有效性,发现其在代码生成、修复和编辑任务中表现各异,模型基于方法适合生成,模型无关方法更适合仓库级任务,且任务重复性提升模型无关方法性能。
Comments Accepted by ISSTA 2026
用于模拟真实城市几何中住宅入室盗窃的有限元框架
专题命中 软件智能体 :agent(abstract)
AI总结 本文提出一种有限元框架,将基于智能体的概率入室盗窃模型转化为PDE模型,采用解耦方案求解,经芝加哥市真实几何测试,鲁棒高效且开源,为多尺度多物理场模型研究奠基。