arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-18 至 2026-08-18 共收录 20 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 20 篇

2608.16742 2026-08-18 cs.SE cs.AI 新提交 90%

TDD-Agent: Test-Driven Reasoning for Code Generation

TDD-Agent:用于代码生成的测试驱动推理

Hongyue Yu, Kefan Li, Jiakun Li, Hongzheng Chai, Yuan Yuan, Rui He, Junyi Wei

专题命中 软件智能体 :agent(title,title_cn);分类 cs.AI、cs.SE

AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15678 2026-08-18 cs.SE 新提交 89%

Where Accountability Lives: Mapping Human Responsibility to Workflow Artifacts in Agentic Software Development

责任归属:在智能体软件开发中将人类责任映射到工作流制品

Sabry E. Farrag

专题命中 软件智能体 :workflow(title,abstract);agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 该研究分析智能体软件开发中责任归属的矛盾,替换验证分类法,发现责任归属方向相反,指出智能体工具未造成责任差距,相关数据已公开。

Comments 30 pages, 5 tables. Source collection of 118 archived documents and 12 processing scripts deposited at Zenodo, doi: https://doi.org/10.5281/zenodo.21965182

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15117 2026-08-18 cs.AI cs.DC cs.LG 新提交 87%

Anatomy of a Quantized Agent: VRAM Stability and Forecasting in Code-Synthesis Agentic Workloads

量化智能体剖析:代码合成智能体工作负载中的VRAM稳定性与预测

Anubhab Banerjee

机构 * Nokia Germany(诺基亚德国)

专题命中 软件智能体 :agent(title,abstract);agentic(title);分类 cs.AI、cs.LG

AI总结 该研究针对基于LangGraph的AgentK智能体,在1920条轨迹上评估量化LLM的VRAM消耗,提出闭式峰值内存预测模型,发现编译成功率受LLM容量限制,且无需复杂VRAM预测模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15519 2026-08-18 cs.SI 新提交 86%

Topological collapse of higher-order interactions bottlenecks collective intelligence in AI agent societies

智能体社群中高阶相互作用的拓扑崩溃是集体智能的瓶颈

Shuo Lu, Weicheng Meng, Aijing Yu, Kun Shao, Jian Luan, Ran He, Jian Liang

专题命中 软件智能体 :agent(title,abstract);AI agent(title)

AI总结 该研究发现AI智能体社群中高阶交互的拓扑崩溃会成为集体智能瓶颈,提出HIS和Φ指标,证实该瓶颈与模型无关,为人工社会设计提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14876 2026-08-18 cs.CR cs.AI cs.CL cs.LG 新提交 82%

Workspace Topology as an Attack Vector in Agentic Coding Assistants

工作空间拓扑作为智能体代码助手的攻击向量

Alexandre G.R. Day, Pradeep Yadlapalli, Sriram Venkatapathy, Thomas Paniagua, Nick Raines, Sahil Wadhwa, Himanshu Kumar, Andy Luo, Sudeep Panyam, Rikhiya Ghosh, Pranab Mohanty, Giri Iyengar

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文研究将工作空间拓扑作为攻击向量,发现其会影响智能体代码助手的间接提示注入攻击成功率,高度模块化环境及安全提示可降低攻击成功率,为代码智能体安全测试提供实用价值。

Comments 15 pages, 10 figures. Preprint of a paper accepted at the Conference on Applied Machine Learning in Information Security (CAMLIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16630 2026-08-18 cs.SE cs.LG 新提交 81%

The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks

编码智能体的工作集:仓库规模任务中的一致性债务

Bardia Mohammadi, Lars Klein, Aman Chadha, Akhil Arora, Laurent Bindschaedler

专题命中 软件智能体 :agent(title,abstract);分类 cs.LG、cs.SE

AI总结 该研究针对仓库规模编码任务,建模一致性债务,通过7个模型和5个框架实验发现事实可用性决定编码结果,提出测试框架应核对编辑依赖事实可用性的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14863 2026-08-18 cs.SE cs.AI cs.DC 新提交 81%

Evaluating Agentic Code Repair Capabilities in Distributed Systems

评估分布式系统中智能体的代码修复能力

Yibo Yan, Huijuan Wang, Junzhou He, Yizhuo Liang, Shaoyu Wang, Huanchen Sun, Seo Jin Park

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12440 2026-08-18 cs.SE cs.AI 版本更新 81%

Specification-first convergence with an AI coding agent: a case study of dismantling a core architectural invariant across 189 files in a 717k-line codebase with no test oracle and no human code review

采用AI编码智能体的规范优先收敛:在71.7万行代码库中拆解189个文件的核心架构不变量的案例研究

Joel Abenhaim

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文通过案例研究,展示AI编码智能体在规范优先协议下,成功在71.7万行代码库中拆解核心架构不变量,耗时3天、成本2430美元,修正201个缺陷,涉及189个文件。

Comments 14 pages, 4 figures, 3 tables. v2: added plain-text log URLs in Section 10 for LLM readability

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14711 2026-08-18 cs.AI 新提交 79%

Beyond Pass@k: Measuring Reliability and Security of Agentic Code Generation

超越Pass@k:衡量智能体代码生成的可靠性与安全性

Jiajun Jiang, Sharon Zheng, Natan Vidra, Spurthi Setty

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Cornell University(康奈尔大学)

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI

AI总结 该研究指出AI编码智能体基准误用Pass@k指标,提出正确的Reliability@k及安全调整版,通过实验验证误用指标的偏差,还在SWE-bench试点中发现真实场景下的核心问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10450 2026-08-18 cs.SE cs.AI cs.MA cs.NE 版本更新 73%

Persistent Recursive Worlds Enable Autonomous Software Evolution

持久递归世界支持自主软件演化

Beichen Huang, Zhenyu Liang, Bowen Zheng, Ran Cheng

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出 Genesis 框架,以持久递归世界替代持久智能体,成功构建 C 编译器、重实现 MESA 模块,实现长周期软件开发并获显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16302 2026-08-18 cs.SE 新提交 70%

Comparing the Quality of Code Generated by Vibe Coding Tools

比较 vibe 编码工具生成代码的质量

Gustavo da Mota, Kiev Gama

专题命中 软件智能体 :agent(abstract_cn);AI agent(abstract);分类 cs.SE

AI总结 本研究对比 Lovable、v0、Replit 三种 vibe 编码工具生成代码的结构质量,发现三者存在不同质量特征,选择工具需考量结构层面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14048 2026-08-18 astro-ph.IM 版本更新 67%

$\texttt{Aether.jl}$: A High-Performance 3D MHD and Multifluid Dust Code Written in a Dynamic Language with an Interactive Human-AI Development Framework

Aether.jl:一种用动态语言编写、具备人机交互开发框架的高性能三维磁流体与多流体尘埃代码

Ka Wai Ho

专题命中 软件智能体 :agent(abstract);workflow(abstract)

AI总结 Aether.jl是一款用Julia编写的高性能三维磁流体与多流体尘埃代码,采用交互式人机开发框架,单GPU性能优于C++代码,在Frontier超算4096个GCD上并行效率超93%,支持CPU、GPU运行,已公开。

Comments 25 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10319 2026-08-18 cs.SE cs.AI 版本更新 62%

Do Personalized Skills Help Coding Agents? An Empirical Study of Developer Interaction Histories

个性化技能对编码智能体有帮助吗?开发者交互历史的实证研究

Shuyan Huang, Kai Du, Andrew Lan

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究通过对13位开发者的206个真实会话实验,发现从交互历史提炼的开发者个性化技能改进有限,而汇集自所有开发者的通用技能增益最大且最一致,为编码智能体的个性化策略提供了实证依据。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09018 2026-08-18 cs.NE cs.AI cs.LG 版本更新 62%

Evolving Ensemble of Agents

进化代理群体

Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EvE框架,通过进化编码代理群体实现算法发现,解决了传统方法的局限,展示了自修正群体在复杂代码库中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16465 2026-08-18 cs.AI 新提交 57%

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills

JailbreakSkill:通过可复用且不断演进的技能扩展自动化红队测试

Xiaoyu Wen, Jiajia Li, Zhida He, Peng Yu, Chenxu Wang, Han Qi, Ziyuan Zhou, Cheng Jin, Ying Wen, Xingcheng Xu, Shuyue Hu, Tianhang Zheng, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本研究提出以技能为核心的JailbreakSkill框架,将攻击策略打包为可复用技能,通过攻击与学习的闭环演进技能,大幅提升攻击成功率,且技能可泛化至未见过的提示词与目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16295 2026-08-18 cs.CL 新提交 57%

Executable Code Knowledge: Code as a Native, Validation-Carrying Knowledge Representation for AI Coding Agents

可执行代码知识:作为AI编码智能体原生、带验证的知识表示的代码

Xueping Gao

机构 * Alibaba Cloud(阿里云)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 该研究提出可执行代码知识(ECK)及其单元ECKU,构建Python原型验证其在编码智能体任务中的效果,支持源绑定、验证等功能,为AI编码智能体提供了混合架构方案。

Comments 11 pages. Submitted to AgenticDev 2026, co-located with ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16022 2026-08-18 cs.SE 新提交 57%

OpenHarmony Bench: Evaluating LLMs and Coding Agents on OpenHarmony App Development

OpenHarmony Bench:评估LLM与编码智能体在OpenHarmony应用开发中的表现

Li Li, Han Hu, Tianjian Zhang, Xin Peng, Fangzhu Mao, Qingyu Zhang, Xiaoheng Xie, Zhongmin Tang, Zhihao Lin, Haolin Ruan, Miaomiao Dong, Liuchuan Zhu, Yue Li, Chi Chen, Wenkang Zhong, Mingfei Zhang, Yang Yu, Bo Sun, Chaorui Zhang, Weixi Zhang, Wei Han, Bo Bai, Kui Liu, Gang Fan, Siru Liu, Jiaqian Zhou, Jiali Sun, Yunbiao Dong, Wenhao Zhong, Yunhong Xu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 该研究推出OPENHARMONY BENCH应用级编码基准,评估8个LLM驱动的DevEco Code在三类OpenHarmony ArkTS应用任务中的表现,发现新一代模型任务完成率更高、构建性接近饱和但行为正确性不足、spec驱动任务完成率最低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15595 2026-08-18 cs.SE 新提交 57%

AutoSQL: Extracting SQL Templates from Imperative ORM Code in Large-Scale Repositories

AutoSQL:从大规模代码仓库中的命令式ORM代码提取SQL模板

Junsong Pu, Yichen Li, Zhuangbin Chen, Zhihan Jiang, Zibin Zheng

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 AutoSQL是从大规模Go仓库的命令式ORM代码提取SQL模板的系统,采用代码索引、混合上下文检索策略,在基准测试中召回率优于现有方法。

Comments Accepted to ASE '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26469 2026-08-18 cs.SE 版本更新 57%

An Empirical Study of Speculative Decoding on Software Engineering Tasks

对软件工程任务中投机解码的实证研究

Yijia Li, Junkai Chen, Xing Hu, Xin Xia

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文通过实证研究评估了投机解码在软件工程任务中的有效性,发现其在代码生成、修复和编辑任务中表现各异,模型基于方法适合生成,模型无关方法更适合仓库级任务,且任务重复性提升模型无关方法性能。

Comments Accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11055 2026-08-18 math.NA 版本更新 50%

A finite element framework for simulating residential burglary in realistic urban geometries

用于模拟真实城市几何中住宅入室盗窃的有限元框架

Baoli Hao, Kamrun Mily, Annalisa Quaini, Ming Zhong

专题命中 软件智能体 :agent(abstract)

AI总结 本文提出一种有限元框架,将基于智能体的概率入室盗窃模型转化为PDE模型,采用解耦方案求解,经芝加哥市真实几何测试,鲁棒高效且开源,为多尺度多物理场模型研究奠基。

详情

展开后加载摘要…

URL PDF HTML 收藏