arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 462 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 462 篇

2607.02389 2026-07-03 cs.AI cs.CR cs.SE 新提交 62%

Steerability via constraints: a substrate for scalable oversight of coding agents

通过约束实现可操控性:编码智能体可扩展监督的基础

Thomas Winninger

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出通过访问控制、网络策略和工具强制编码规范等传统工程管理方法约束编码智能体,以降低人类监督成本并提升安全性;实验表明约束基板使后门检测召回率从54.5%提升至90.9%。

Comments Accepted to the Deep Learning for Code Workshop at the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01418 2026-07-03 cs.SE cs.AI cs.HC 新提交 62%

Adoption and Impact of Command-Line AI Coding Agents: A Study of Microsoft's Early 2026 Rollout of Claude Code and GitHub Copilot CLI

命令行AI编码代理的采用与影响:微软2026年初推出Claude Code和GitHub Copilot CLI的研究

Emerson Murphy-Hill, Jenna Butler, Alexandra Savelieva

机构 * Microsoft(微软)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究微软2026年初推出Claude Code和GitHub Copilot CLI时,数万名工程师的采用模式、留存因素及对代码合并的影响,发现社交网络驱动首次使用,编码活跃度关联留存,采用者合并PR数量增加约24%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00990 2026-07-02 cs.SE cs.AI 新提交 62%

SWE-Doctor: Guiding Software Engineering Agents with Runtime Diagnosis from Multi-Faceted Bug Reproduction Tests

SWE-Doctor: 通过多面缺陷复现测试的运行时诊断引导软件工程智能体

Yaoqi Guo, Yang Liu, Jie M. Zhang, Yun Ma, Yiling Lou, Zhenpeng Chen

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出SWE-Doctor,通过生成多面缺陷复现测试并执行调试,构建运行时诊断记录,结合定位信息指导补丁生成,在SWE-bench Verified和Pro上平均解决率分别达75.7%和59.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27045 2026-06-26 cs.SE cs.AI 新提交 62%

The Spec Growth Engine: Spec-Anchored, Code-Coupled, Drift-Enforced Architecture for AI-Assisted Software Development

规范增长引擎:AI辅助软件开发的规范锚定、代码耦合、漂移强制架构

Hartwig Grabowski

机构 * Hochschule Offenburg(奥芬堡应用科学大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出规范增长引擎框架,通过机器可读的规范图、Spine上下文组装器、垂直切片增长协议和漂移门,解决AI编码代理中的上下文爆炸和规范-代码漂移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26924 2026-06-26 cs.SE cs.AI cs.CR 新提交 62%

A Deterministic Control Plane for LLM Coding Agents

LLM编码代理的确定性控制平面

Padmaraj Madatha

机构 * Happiest Minds Technologies (AIP Centre of Excellence)(happiest minds technologies(aip中心卓越机构))

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 针对LLM编码代理配置缺乏管理的问题,提出确定性控制平面Rel(AI)Build,通过内容寻址、分层权限、阶段状态机等机制确保配置安全与一致性。

Comments 45 pages, 9 figures, 13 tables. Dataset and reproduction scripts: Zenodo DOI 10.5281/zenodo.20780913. Ancillary files include report.json, organizations.txt, and figure-reproduction scripts

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24453 2026-06-24 cs.AI cs.CL 新提交 62%

Bayesian control for coding agents

编码智能体的贝叶斯控制

Theodore Papamarkou, Vladislav Smirnov, Viktor Mazanov, Artem Vazhentsev, Preslav Nakov, Timothy Baldwin, Artem Shelmanov

机构 * PolyShape National Technical University of Athens(雅典国家技术大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 软件智能体 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 将编码智能体的编排建模为成本敏感的序贯假设检验,贝叶斯控制器动态决策证据收集、候选优化、验证或停止,在昂贵验证下最有效,且信念状态提供可解释的正确性分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24429 2026-06-24 cs.SE cs.AI 新提交 62%

Detecting AI Coding Agents in Open Source: A Validated Multi-Method Census of 180 Million Repositories

检测开源中的AI编码代理:对1.8亿个仓库的多方法普查验证

Arsham Khosravani, Audris Mockus

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出多层面检测框架,整合配置扫描、提交消息分析等四种方法,发现单一信号低估AI代理活动达30倍,揭示不同检测渠道捕获的代理群体几乎不重叠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24151 2026-06-24 cs.CL cs.AI 新提交 62%

Metis: Bridging Text and Code Memory for Self-Evolving Agents

Metis: 连接文本与代码记忆以实现自我进化智能体

Zijie Dai, Siuhin He, Hui Li, Qihui Zhou, Jiajun Li, Mingcong Song, Guoping Long, Hongjie Si, Xin Yao, Lin Zhang, James Cheng, Xiao Yan

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei(华为) Wuhan University(武汉大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出Metis系统,通过分层双表示记忆(文本与代码)平衡构建成本、执行效率和可迁移性,在AppWorld上任务准确率提升20.6%,执行成本降低22.8%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23690 2026-06-24 cs.SE cs.AI 新提交 62%

Beyond the Autoregressive Horizon: A Comprehensive Survey of Diffusion Models, World Modelling, and State Space Models for Code

超越自回归视野:扩散模型、世界模型和状态空间模型在代码领域的综合综述

Kishan Maharaj, Ashita Saxena, Srikanth Tamilselvam

机构 * IBM

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.SE

AI总结 综述扩散模型、代码世界模型和状态空间模型在代码生成中的潜力,以克服自回归模型在全局规划、长程依赖和执行语义方面的局限,并展望“系统2”代码生成智能体。

Comments 14 Pages, 1 Table, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21297 2026-06-23 cs.LG cs.AI 新提交 62%

NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning

NASDAQ:归一化观测空间动力学增强Q学习

Xinwei Liu, Junyuan Liang, Zicong Hong, Jianting Zhang, Wuhui Chen

机构 * Sun Yat-sen University(中山大学) EPFL(瑞士联邦理工学院洛桑分校) Purdue University(普渡大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对观测预测强化学习中低维观测维度不平衡导致性能下降的问题,提出归一化方法平衡损失和梯度,并构建NASDAQ框架,结合价值学习与两个辅助任务,在多个领域取得领先性能且训练时间更短。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20882 2026-06-23 cs.SE cs.AI 新提交 62%

The Substrate Collapse: AI Code Generation Invalidates Authorship-Based Knowledge Metrics

基底崩塌:AI代码生成使基于作者身份的知识度量失效

Brett Wheeler

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文论证AI代码生成从根本上切断了代码作者身份与理解之间的推理链,导致基于作者身份的知识度量(如卡车因子)不再有效,并提出以理解证据为基础的新度量方向。

Comments 10 pages, no figures. Position paper; states a falsifiable prediction and deliberately leaves construction of the comprehension-grounded instrument open

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20640 2026-06-23 cs.AI cs.LG math.OC 新提交 62%

An LLM-Explainable DRL Framework for Passenger-Directed Autonomous Driving

面向乘客导向自动驾驶的LLM可解释DRL框架

Ouided Braoui, Meriem Bouali, Nadir Farhi

机构 * LITAN, ESTIN(LITAN,ESTIN) Cosys-Grettia, Univ Gustave Eiffel(Cosys-Grettia,古斯塔夫·埃菲尔大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出结合深度强化学习与大型语言模型可解释模块的框架,实现自适应驾驶控制并向乘客解释决策,平衡安全性、适应性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19613 2026-06-19 cs.SE cs.AI 新提交 62%

StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns

StaminaBench: 对编码智能体进行100轮交互的压力测试

Vlad Sobal, Shuo Yang, Yuting Zhang, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS 代理人工智能)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出StaminaBench基准,通过100轮连续变更请求测试编码智能体的耐力,发现所有模型在5-6轮内失败,而测试反馈和重试机制可将通过轮数提升12倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16231 2026-06-16 cs.LG cs.AI 新提交 62%

From Tokens to Regions: CUDA-Sensitive Instruction Tuning for GPU Kernel Generation

从令牌到区域:面向GPU内核生成的CUDA敏感指令微调

Wentao Chen, Jiace Zhu, Xing Zhe Chai, Zeng Qu, Qiaoling Xiao, Liucheng Duan, An Zou

机构 * Shanghai Jiao Tong University(上海交通大学) Biren Technology(壁仞科技)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出CuSeT方法,通过自适应令牌级掩码和区域感知样本重加权,在简单SFT框架内提升LLM生成CUDA内核的功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15762 2026-06-16 cs.CR cs.AI cs.SE 新提交 62%

Snyk VulnBench JS 1.0: Can LLMs Find the Same Bugs Twice?

Snyk VulnBench JS 1.0: LLM 能否两次发现相同的漏洞?

Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair

机构 * Snyk

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 通过300次重复漏洞扫描实验,评估LLM在相同JavaScript代码上安全审查的可重复性,发现引用匹配结果稳定但额外报告波动大,建议结合确定性SAST使用。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15300 2026-06-16 cs.AI cs.CL 新提交 62%

CODA-BENCH: Can Code Agents Handle Data-Intensive Tasks?

CODA-BENCH:代码智能体能否处理数据密集型任务?

Yuxin Zhang, Ju Fan, Meihao Fan, Shaolei Zhang, Xiaoyong Du

机构 * Renmin University of China(中国人民大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出CODA-BENCH基准,在数据密集型环境中联合评估代码与数据智能,包含1009个任务,平均每个环境980个文件,揭示当前智能体在数据发现与代码执行整合上的不足。

Comments Accepted at ICML 2026. 37 pages, 11 figures. Project page: https://coda-bench.github.io/ Code: https://github.com/ruc-datalab/CoDA-Bench Data: https://huggingface.co/datasets/RUC-DataLab/CoDA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13174 2026-06-12 cs.LG cs.CL 新提交 62%

Getting Better at Working With You: Compiling User Corrections into Runtime Enforcement for Coding Agents

与你合作得更好:将用户修正编译为编码代理的运行时强制

Yujun Zhou, Kehan Guo, Haomin Zhuang, Xiangqi Wang, Yue Huang, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Nuno Moniz, Nitesh V. Chawla, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) IBM Research(IBM研究院) Tencent AI Lab(腾讯AI实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG

AI总结 提出TRACE方法,通过将用户修正编译为原子规则并在运行时强制执行,显著减少编码代理在后续任务中的偏好违反,优于纯记忆方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12231 2026-06-11 cs.SE cs.AI 新提交 62%

Rule Taxonomy and Evolution in AI IDEs: A Mining and Survey Study

AI IDE中的规则分类与演化:挖掘与调查研究

Guangzong Cai, Ruiyin Li, Peng Liang, Zengyang Li, Mojtaba Shahin

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Central China Normal University(中央师范大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 通过挖掘83个开源项目中的7310条规则和99份从业者调查,建立了包含5个主类和25个子类的规则分类法,发现开发者重视架构约束但实际配置多为低级工作流和代码格式规则,规则演化主要由建设性上下文扩展和丰富驱动,且更新规则可使工件合规率平均提升22.99%。

Comments 52 pages, 21 images, 8 tables, Manuscript submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09956 2026-06-10 cs.SE cs.LG 新提交 62%

Multi-task LLMs for Bug Classification: Efficient Inference with Auxiliary Decoding Heads

多任务大语言模型用于缺陷分类:基于辅助解码头的高效推理

Nikolai Rozanov

机构 * Recurse Ltd. Department of Computing, Imperial College London(帝国理工学院计算机系)

专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE

AI总结 提出一种轻量级多任务大语言模型(MLC),通过令牌对齐算法和优化训练策略,实现全文件上下文下的行级缺陷定位,性能与代理方法相当但推理延迟降低数个数量级。

Comments 8 pages, 6 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07792 2026-06-09 cs.CR cs.LG cs.SE 新提交 62%

MOLOT System Card: Malicious Operational Logic Observation Transformer

MOLOT系统卡:恶意操作逻辑观察变换器

Daniil Lopatkin, Maksim Mitrofanov, Stanislav Rakovsky, Aleksandr Khalikov

机构 * False Positive Community

专题命中 软件智能体 :workflow(abstract);分类 cs.LG、cs.SE

AI总结 提出MOLOT系统,利用静态调用图的行为序列进行恶意代码检测,结合解释阶段定位可疑行为,在PyPI和npm包上评估,并发布Open Malicious-Code Bench基准。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14490 2026-08-17 cs.AI 新提交 57%

Twin: Playing an Unknown Game with a Test-Time Digital Twin

Twin:利用测试时数字孪生玩未知游戏

Alexy Skoutnev, Kirill Acharya, Gaston Longhitano, Madeleine Udell, Kevin Ellis, Iddo Drori

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究提出Twin系统,通过测试时数字孪生构建可执行世界模型,在ARC-AGI-3等未知游戏中通关率达97.8%,效率优于人类,核心是通过模拟交互和反例修复推断游戏规则与目标。

Comments Project website with action-by-action replays of all 25 runs: this https URL (https://arc-agi-3-twin.vercel.app/) Code: this https URL (AGI-3" target="_blank" rel="noopener">https://github.com/Alexyskoutnev/TWIN-ARC-AGI-3)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13958 2026-08-17 cs.AI cs.CY cs.LO 新提交 57%

Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence

用Wolfram语言实现计算法以用于人工智能治理

James K. Wiles

机构 * Wolfram Institute for Computational Foundations of Science(沃尔夫勒姆计算基础科学研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文在Wolfram语言中实现Reified Input/Output Logic,测试GPT-4转换英文法律陈述的情况,通过AI看门狗案例展示计算法可作为AI治理工具,理想目标是形式化可编程执行的法律。

Comments 25 pages, 1 figure, 2 tables, 12 code listings. Wolfram Language implementation and verification script (31 assertions) available at this https URL (https://github.com/Zaffer/research-computational-law)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13928 2026-08-17 cs.CR cs.SE 新提交 57%

CoSA: Context-Aware Severity Assessment via Context Analysis with Large Language Models

CoSA:基于大语言模型的上下文分析实现上下文感知的漏洞严重程度评估

Jinfeng Jiang, Yikun Li, Chengran Yang, Ting Zhang, Wen Bin Leow, Yide Yin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 CoSA是一种基于大语言模型的上下文感知漏洞严重程度评估方法,通过两阶段仓库剪枝策略与Transformer预测器,在6816个CVSS标注实例上较最优基线提升了14.4%准确率与15.3% Macro-F1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14396 2026-08-17 math.OC cs.AI 新提交 57%

AI-Assisted Discovery and Construction of a Counterexample to the Convergence of Three-Block ADMM with the Identity Matrix as its Third Constraint Block

AI辅助发现与构造以单位矩阵作为第三个约束块的三块ADMM收敛性反例

Kenan Xu, Xiangfeng Wang

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 该研究借助AI工具构造出以单位矩阵为第三约束块的三块ADMM的收敛反例,还分析了乘子松弛对收敛性的影响,对比了不同AI工具在数学研究中的表现。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13292 2026-08-14 cs.SE 新提交 57%

Refine After Generation: Toward Correct and Concise Patches in LLM-based Program Repair

生成后优化:面向基于大语言模型的程序修复中正确且简洁的补丁

Wenqiang Luo, Jacky Keung, Xiaoyu Shi, Yicheng Sun, Boyang Yang, Zhou Yang, Haoye Tian

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 针对基于LLM的程序修复中补丁冗余问题,提出RECAP适配器,在保留或提升解决率的同时,大幅降低补丁大小,实现更优的大小-正确性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11727 2026-08-13 cs.AI 新提交 57%

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents

Harness-IF:评估编码智能体在不同指令层面的指令遵循能力

Zining Huang, Haoran Que, Hong Zeng, Ge Zhang, Zuo Wang, Jin Chen, Haodong Wang, Zhongfei Hou, Changxin Pu, Shen Yan, Wenhao Huang

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本研究推出Harness-IF评估框架,引入AP-Acc指标区分编码智能体的指令合规与巧合,发现12个前沿模型在对抗先验规则上表现更差,且合并优先级不随提示深度变化。

Comments 26 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11460 2026-08-13 cs.CL 新提交 57%

Principal Trait Analysis: Towards Deriving "Skills" in Human-AI Collaboration

主特质分析:面向人机协作中“技能”的推导

Hunter McNichols, Kai Du, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11225 2026-08-13 cs.AI 新提交 57%

Identity from the Outside: A Conceptual Framework and Research Program for AI Personality Clones

来自外部的身份:AI人格克隆的概念框架与研究计划

Luc E. Brunet

机构 * R&D Mediation(调解研发部)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究针对AI人格克隆问题,提出含六项分解的身份概念框架,定义不可区分性,通过类比阐明线性性,区分代理类型,提出实验计划,主张以环境保真度为长期标准,核心为条件猜想。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10622 2026-08-12 cs.SE 新提交 57%

A Study of Cursorrules Files in GitHub Open Source Projects

GitHub开源项目中Cursorrules文件的研究

Shuang Sun, Jafar Akhoundali, Arina Kudriavtseva, Sengim Karayalcin, Olga Gadyatskaya

专题命中 软件智能体 :AI agent(abstract);分类 cs.SE

AI总结 本研究对GitHub开源项目中的.cursorrules文件开展实证研究,明确其分布、内容特征及与.mdc文件的主题连续性,揭示其多用于小型非专业项目的现状。

Comments Published in ICSOFT 2026. This is the author copy version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09799 2026-08-11 cs.SE 新提交 57%

SpecPath: Testing Coding Agents Across Contract-Equivalent Specification Histories

SpecPath:在合同等价的规范历史中测试编码智能体

Yangfan Wu, Haozhe Wang, Huanyu Yang, Jianmin Ji, Fangzhen Lin

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 针对编码智能体的规范路径敏感性问题,提出SpecPath诊断评估方法,通过控制变量测试发现多数智能体在等价规范历史中存在行为不一致的问题,凸显需评估智能体对规范路径的鲁棒性。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏