arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6842 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 497 篇

2608.17393 2026-08-19 cs.AI 新提交 57%

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

LEGO-RL:利用原生强化学习实现编码智能体

Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。

Comments Webpage: https://lego-rl.pages.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17018 2026-08-19 cs.SE 新提交 57%

ORCA: Observability-Grounded Program Repair for Microservice Incidents

ORCA:基于可观测性的微服务故障程序修复

Yuanchen Gao, Yifang Tian, Yiran Li, Charles Zhang, Hans-Arno Jacobsen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16465 2026-08-18 cs.AI 新提交 57%

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills

JailbreakSkill:通过可复用且不断演进的技能扩展自动化红队测试

Xiaoyu Wen, Jiajia Li, Zhida He, Peng Yu, Chenxu Wang, Han Qi, Ziyuan Zhou, Cheng Jin, Ying Wen, Xingcheng Xu, Shuyue Hu, Tianhang Zheng, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本研究提出以技能为核心的JailbreakSkill框架,将攻击策略打包为可复用技能,通过攻击与学习的闭环演进技能,大幅提升攻击成功率,且技能可泛化至未见过的提示词与目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16295 2026-08-18 cs.CL 新提交 57%

Executable Code Knowledge: Code as a Native, Validation-Carrying Knowledge Representation for AI Coding Agents

可执行代码知识:作为AI编码智能体原生、带验证的知识表示的代码

Xueping Gao

机构 * Alibaba Cloud(阿里云)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 该研究提出可执行代码知识(ECK)及其单元ECKU,构建Python原型验证其在编码智能体任务中的效果,支持源绑定、验证等功能,为AI编码智能体提供了混合架构方案。

Comments 11 pages. Submitted to AgenticDev 2026, co-located with ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16022 2026-08-18 cs.SE 新提交 57%

OpenHarmony Bench: Evaluating LLMs and Coding Agents on OpenHarmony App Development

OpenHarmony Bench:评估LLM与编码智能体在OpenHarmony应用开发中的表现

Li Li, Han Hu, Tianjian Zhang, Xin Peng, Fangzhu Mao, Qingyu Zhang, Xiaoheng Xie, Zhongmin Tang, Zhihao Lin, Haolin Ruan, Miaomiao Dong, Liuchuan Zhu, Yue Li, Chi Chen, Wenkang Zhong, Mingfei Zhang, Yang Yu, Bo Sun, Chaorui Zhang, Weixi Zhang, Wei Han, Bo Bai, Kui Liu, Gang Fan, Siru Liu, Jiaqian Zhou, Jiali Sun, Yunbiao Dong, Wenhao Zhong, Yunhong Xu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 该研究推出OPENHARMONY BENCH应用级编码基准,评估8个LLM驱动的DevEco Code在三类OpenHarmony ArkTS应用任务中的表现,发现新一代模型任务完成率更高、构建性接近饱和但行为正确性不足、spec驱动任务完成率最低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15595 2026-08-18 cs.SE 新提交 57%

AutoSQL: Extracting SQL Templates from Imperative ORM Code in Large-Scale Repositories

AutoSQL:从大规模代码仓库中的命令式ORM代码提取SQL模板

Junsong Pu, Yichen Li, Zhuangbin Chen, Zhihan Jiang, Zibin Zheng

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 AutoSQL是从大规模Go仓库的命令式ORM代码提取SQL模板的系统,采用代码索引、混合上下文检索策略,在基准测试中召回率优于现有方法。

Comments Accepted to ASE '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14490 2026-08-17 cs.AI 新提交 57%

Twin: Playing an Unknown Game with a Test-Time Digital Twin

Twin:利用测试时数字孪生玩未知游戏

Alexy Skoutnev, Kirill Acharya, Gaston Longhitano, Madeleine Udell, Kevin Ellis, Iddo Drori

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究提出Twin系统,通过测试时数字孪生构建可执行世界模型,在ARC-AGI-3等未知游戏中通关率达97.8%,效率优于人类,核心是通过模拟交互和反例修复推断游戏规则与目标。

Comments Project website with action-by-action replays of all 25 runs: https://arc-agi-3-twin.vercel.app/ Code: AGI-3" target="_blank" rel="noopener">https://github.com/Alexyskoutnev/TWIN-ARC-AGI-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13958 2026-08-17 cs.AI cs.CY cs.LO 新提交 57%

Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence

用Wolfram语言实现计算法以用于人工智能治理

James K. Wiles

机构 * Wolfram Institute for Computational Foundations of Science(沃尔夫勒姆计算基础科学研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文在Wolfram语言中实现Reified Input/Output Logic,测试GPT-4转换英文法律陈述的情况,通过AI看门狗案例展示计算法可作为AI治理工具,理想目标是形式化可编程执行的法律。

Comments 25 pages, 1 figure, 2 tables, 12 code listings. Wolfram Language implementation and verification script (31 assertions) available at https://github.com/Zaffer/research-computational-law

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13928 2026-08-17 cs.CR cs.SE 新提交 57%

CoSA: Context-Aware Severity Assessment via Context Analysis with Large Language Models

CoSA:基于大语言模型的上下文分析实现上下文感知的漏洞严重程度评估

Jinfeng Jiang, Yikun Li, Chengran Yang, Ting Zhang, Wen Bin Leow, Yide Yin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 CoSA是一种基于大语言模型的上下文感知漏洞严重程度评估方法,通过两阶段仓库剪枝策略与Transformer预测器,在6816个CVSS标注实例上较最优基线提升了14.4%准确率与15.3% Macro-F1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14396 2026-08-17 math.OC cs.AI 新提交 57%

AI-Assisted Discovery and Construction of a Counterexample to the Convergence of Three-Block ADMM with the Identity Matrix as its Third Constraint Block

AI辅助发现与构造以单位矩阵作为第三个约束块的三块ADMM收敛性反例

Kenan Xu, Xiangfeng Wang

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 该研究借助AI工具构造出以单位矩阵为第三约束块的三块ADMM的收敛反例,还分析了乘子松弛对收敛性的影响,对比了不同AI工具在数学研究中的表现。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13292 2026-08-14 cs.SE 新提交 57%

Refine After Generation: Toward Correct and Concise Patches in LLM-based Program Repair

生成后优化:面向基于大语言模型的程序修复中正确且简洁的补丁

Wenqiang Luo, Jacky Keung, Xiaoyu Shi, Yicheng Sun, Boyang Yang, Zhou Yang, Haoye Tian

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 针对基于LLM的程序修复中补丁冗余问题,提出RECAP适配器,在保留或提升解决率的同时,大幅降低补丁大小,实现更优的大小-正确性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11727 2026-08-13 cs.AI 新提交 57%

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents

Harness-IF:评估编码智能体在不同指令层面的指令遵循能力

Zining Huang, Haoran Que, Hong Zeng, Ge Zhang, Zuo Wang, Jin Chen, Haodong Wang, Zhongfei Hou, Changxin Pu, Shen Yan, Wenhao Huang

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本研究推出Harness-IF评估框架,引入AP-Acc指标区分编码智能体的指令合规与巧合,发现12个前沿模型在对抗先验规则上表现更差,且合并优先级不随提示深度变化。

Comments 26 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11460 2026-08-13 cs.CL 新提交 57%

Principal Trait Analysis: Towards Deriving "Skills" in Human-AI Collaboration

主特质分析:面向人机协作中“技能”的推导

Hunter McNichols, Kai Du, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11225 2026-08-13 cs.AI 新提交 57%

Identity from the Outside: A Conceptual Framework and Research Program for AI Personality Clones

来自外部的身份:AI人格克隆的概念框架与研究计划

Luc E. Brunet

机构 * R&D Mediation(调解研发部)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究针对AI人格克隆问题,提出含六项分解的身份概念框架,定义不可区分性,通过类比阐明线性性,区分代理类型,提出实验计划,主张以环境保真度为长期标准,核心为条件猜想。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10622 2026-08-12 cs.SE 新提交 57%

A Study of Cursorrules Files in GitHub Open Source Projects

GitHub开源项目中Cursorrules文件的研究

Shuang Sun, Jafar Akhoundali, Arina Kudriavtseva, Sengim Karayalcin, Olga Gadyatskaya

专题命中 软件智能体 :AI agent(abstract);分类 cs.SE

AI总结 本研究对GitHub开源项目中的.cursorrules文件开展实证研究,明确其分布、内容特征及与.mdc文件的主题连续性,揭示其多用于小型非专业项目的现状。

Comments Published in ICSOFT 2026. This is the author copy version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09799 2026-08-11 cs.SE 新提交 57%

SpecPath: Testing Coding Agents Across Contract-Equivalent Specification Histories

SpecPath:在合同等价的规范历史中测试编码智能体

Yangfan Wu, Haozhe Wang, Huanyu Yang, Jianmin Ji, Fangzhen Lin

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 针对编码智能体的规范路径敏感性问题,提出SpecPath诊断评估方法,通过控制变量测试发现多数智能体在等价规范历史中存在行为不一致的问题,凸显需评估智能体对规范路径的鲁棒性。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09643 2026-08-11 cs.CR cs.LG 新提交 57%

Activation Probes Surface Code-Security Signals that the Model's Output Misses

激活探针:挖掘模型输出遗漏的表面代码安全信号

Ivan Wiryadi

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本研究提出用线性探针分析开源审查器模型的激活值,发现其携带了仅通过模型提示无法获取的代码安全信号,可有效区分有漏洞与修复后的函数。

Comments 6 pages, 1 figure. Accepted at the TAIGR workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07364 2026-08-10 cs.AI cs.CY 新提交 57%

Curriculum as Code: An AI-Assisted Architecture for Instructional Design in STEM Education

课程即代码:STEM教育中教学设计的AI辅助架构

Henrique Mohallem Paiva

机构 * Universidade Federal de Sao Paulo (Unifesp)(圣保罗联邦大学) Institute of Technology and Leadership (Inteli)(技术与领导力学院)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 该研究提出基于课程即代码的六阶段AI辅助教学设计架构,结合生成式AI与LaTeX、Python,经验证可降低教师STEM教学材料创作工作量,提升材料质量与可扩展性。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07138 2026-08-10 physics.acc-ph cs.AI 新提交 57%

Autonomous discovery of accelerator commissioning algorithms

加速器调试算法的自主发现

Thorsten Hellert

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究提出语言模型智能体闭环循环,自主发现加速器调试算法,在ALS-U储存环射频束流捕获任务中取得良好效果,生成多目标非支配算法,推动调试研究模式转变。

Comments 9 pages, 4 figures. Submitted to Physical Review Accelerators and Beams (ZVR1001)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05430 2026-08-07 cs.CR cs.LG 新提交 57%

Robust Context-Aware Detection of Malicious Instructions in Text

文本中恶意指令的鲁棒上下文感知检测

Buzhao Liu, Xinhang Ma, Yevgeniy Vorobeychik

专题命中 软件智能体 :agentic(abstract);分类 cs.LG

AI总结 该研究针对LLM易受间接提示注入攻击的问题,提出上下文感知的恶意句子分类方法及两种对抗训练技术,在静态和自适应攻击下均提升了IPI防御性能,且需根据领域调整参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05234 2026-08-07 cs.LG cs.PL 新提交 57%

PPDL: LLM-Based Flows as Probabilistic Programs

PPDL:基于大语言模型的流作为概率程序

Louis Mandel, Guillaume Baudart, Mandana Vaziri, Martin Hirzel

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出用于编程基于LLM的流的概率语言PPDL,可量化传播流中不确定性,无需额外代码即可尝试推理缩放技术,还通过实验及面向Rocq的定理证明智能体案例验证了其能力。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05223 2026-08-07 cs.SE cs.CR 新提交 57%

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

面向编码智能体中恶意技能文件的风险评估

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。

Comments 29 pages, 6 figures, 6 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05116 2026-08-06 cs.SE cs.HC 新提交 57%

Characterizing Visual Accessibility Issues in AI Developer Tools: An Empirical Study

AI开发者工具中的视觉可访问性问题表征:一项实证研究

Sabrina Haque, Christoph Csallner

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本研究通过分析五个AI开发者工具生态系统的问题报告,表征了其中的视觉可访问性障碍类型及差异,揭示了交互设计与生态系统实践对工具可访问性记录的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04857 2026-08-06 cs.CR cs.SE 新提交 57%

Hidden Ciphers and Where to Find Them: Static Discovery and Assessment of Cryptographic Assets in Software

隐藏的密码及其发现途径:软件中密码资产的静态发现与评估

Christian Näther, Eduard Hirsch

专题命中 软件智能体 :planning(abstract);分类 cs.SE

AI总结 本文提出分类驱动的静态方法,可在不到6分钟处理57610个文件,发现370个密码资产(含6个CVE漏洞、52个后量子迁移候选),F1达0.75,助力密码资产发现与后量子迁移规划

Comments 22 pages, 8 figures, 5 tables, accepted at ICICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03558 2026-08-05 cs.SE 新提交 57%

EffiHolmes: Differential Profiling-Guided Repository Level Time Inefficiency Fix Localization

EffiHolmes:基于差分分析的仓库级时间低效修复定位

Haowen Yang, Yun Peng, Zishuo Ding

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 EffiHolmes是基于LLM的仓库级时间低效修复定位框架,通过差分分析等技术提升定位精度,在RepoEffi-Bench上优于多种基线方法,且跨模型规模稳健。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). 13 pages, 3 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02642 2026-08-05 physics.chem-ph cs.AI 新提交 57%

MDArena: Evaluating Coding Agents on Realistic Molecular Dynamics Workflows

MDArena:面向真实分子动力学工作流的编码智能体评估基准

Nithishwer Mouroug Anand, Wei-Tse Hsu, Kyle Vaccaro, Eden James Gage, Jonathan David Colburn, Linda Xi Phan, Minjoon Seo, Kevin Guan, Philip C. Biggin

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 MDArena基准评估了6种编码智能体在真实分子动力学任务上的表现,发现其在精细科学工作流细节上存在不足,为追踪其可靠性进展提供了平台。

Comments 17 pages including appendices, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00966 2026-08-04 cs.SE 新提交 57%

AgenTag: Attribution of AI Coding Agents from Behavioral Fingerprints

AgenTag:基于行为指纹的AI编码智能体归因

Taher A. Ghaleb

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出多模态框架AgenTag,基于PR的文本、行为等模态,结合监督对比学习实现开放世界AI编码智能体归因,在AIDev数据集上取得良好效果,且发现归因主要依赖PR描述和提交消息等行为指纹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00808 2026-08-04 cs.SE 新提交 57%

Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents

将交互历史转化为执行状态:面向长程编码智能体的运行时层

Zehao Wang, Yisen Xu, Chenglin Li, Chao Peng, Bram Adams, Ahmed E. Hassan, Tse-Hsun, Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 该研究针对长程编码智能体易受过时状态干扰的问题,提出Ledger运行时层,通过显式执行状态提升编码任务性能并降低成本,效果在多个模型和基准上得到验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00122 2026-08-04 cs.AI 新提交 57%

Shared Organizational Memory for Enterprise Coding Agents: System Design and Deployment Snapshot

企业编码智能体的共享组织记忆:系统设计与部署快照

Harsh Rao Dhanyamraju, Leonidas Raghav

机构 * SAP SE(思爱普公司)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 本文设计部署共享组织记忆系统,将经验捕获融入企业编码工作流,收集并整理任务相关经验,管控风险并供智能体检索,目前其效果仍在评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29637 2026-08-03 cs.CV cs.SE 新提交 57%

CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding

CodeShrink:面向高效多模态代码理解的自适应视觉压缩

Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Zipeng Xie, Junliang Liu, Wang Luo, Yuan Jiang, Yintong Huo, Michael Lyu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 CodeShrink是含无空白渲染、自适应压缩配置、主导令牌选择的自适应视觉压缩框架,可减少代码理解的视觉令牌用量,在三类代码任务上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏