arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3217 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3217 篇

1906.09627 2019-06-25 cs.AI cs.LG 62%

Inductive general game playing

Andrew Cropper, Richard Evans, Mark Law

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

Comments Accepted for the Machine Learning journal

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.11455 2019-04-26 cs.LG cs.AI stat.ML 62%

Ray Interference: a Source of Plateaus in Deep Reinforcement Learning

Tom Schaul, Diana Borsa, Joseph Modayil, Razvan Pascanu

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

Comments Full version of RLDM abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.04546 2019-02-13 cs.LG cs.AI cs.NE stat.ML 62%

ACTRCE: Augmenting Experience via Teacher's Advice For Multi-Goal Reinforcement Learning

Harris Chan, Yuhuai Wu, Jamie Kiros, Sanja Fidler, Jimmy Ba

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.07220 2018-08-24 cs.AI cs.LG stat.ML 62%

Approximating Poker Probabilities with Deep Learning

Brandon Da Silva

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.04287 2018-08-14 cs.LG cs.AI cs.CV stat.ML 62%

Visual Sensor Network Reconfiguration with Deep Reinforcement Learning

Paul Jasek, Bernard Abayowa

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.10467 2018-02-01 cs.AI cs.PL cs.SE 62%

Deep Reinforcement Learning for Programming Language Correction

Rahul Gupta, Aditya Kanade, Shirish Shevade

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.05363 2017-05-16 cs.LG cs.AI cs.CV cs.RO stat.ML 62%

Curiosity-driven Exploration by Self-supervised Prediction

Deepak Pathak, Pulkit Agrawal, Alexei A. Efros, Trevor Darrell

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

Comments In ICML 2017. Website at https://pathak22.github.io/noreward-rl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03353 2026-06-04 cs.CR cs.AI 61%

SkCC: Portable and Secure Skill Compilation for Cross-Framework LLM Agents

SkCC:面向跨框架LLM代理的可移植且安全的技能编译

Yipeng Ouyang, Yi Xiao, Yuhao Gu, Xianwei Zhang

机构 * Sun Yat-sen University(中山大学)

专题命中 软件智能体 :agent(abstract,comments);分类 cs.AI

AI总结 针对LLM代理技能在不同框架间缺乏可移植性和安全性的问题,提出SkCC编译器,通过强类型中间表示SkIR解耦语义与格式,实现跨框架部署,并内置静态优化器强制执行安全约束,显著提升性能并降低适配复杂度。

Comments Accepted by the Agent Skills Workshop at ACM CAIS 2026. 20 pages, 6 figures. Project Homepage: https://skcc.nexa-lang.com/ Code Repo: https://github.com/Nexa-Language/Skill-Compiler/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16165 2025-06-06 cs.AI 61%

EnIGMA: Interactive Tools Substantially Assist LM Agents in Finding Security Vulnerabilities

Talor Abramovich, Meet Udeshi, Minghao Shao, Kilian Lieret, Haoran Xi, Kimberly Milner, Sofija Jancheska, John Yang, Carlos E. Jimenez, Farshad Khorrami, Prashanth Krishnamurthy, Brendan Dolan-Gavitt, Muhammad Shafique, Karthik Narasimhan, Ramesh Karri, Ofir Press

机构 * Tel Aviv University(特拉维夫大学) NYU Tandon School of Engineering(纽约大学工程学院) New York University Abu Dhabi(纽约大学阿布扎克分校) Princeton Language and Intelligence(普林斯顿语言与智能) Stanford University(斯坦福大学)

专题命中 软件智能体 :agent(abstract,comments);分类 cs.AI

Comments ICML 2025; Project website https://enigma-agent.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09827 2024-09-17 cs.RO cs.AI cs.HC 61%

On the Effect of Robot Errors on Human Teaching Dynamics

Jindan Huang, Isaac Sheidlower, Reuben M. Aronson, Elaine Schaertl Short

专题命中 软件智能体 :agent(abstract,comments);分类 cs.AI

Comments Accepted to 2024 International Conference on Human-Agent Interaction (HAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11072 2024-07-17 cs.CR cs.AI 61%

MaPPing Your Model: Assessing the Impact of Adversarial Attacks on LLM-based Programming Assistants

John Heibel, Daniel Lowd

专题命中 软件智能体 :agentic(abstract);分类 cs.AI;AI agent(comments)

Comments 6 pages, 5 figures, Proceedings of the ICML 2024 Workshop on Trustworthy Multimodal Foundation Models and AI Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18041 2026-08-19 cs.CL 新提交 57%

Language Has Two Parameters: Narrative-Induced Semantic Plasticity and Phase-Sensitive Interpretation

语言具有两个参数:叙事诱导的语义可塑性与相位敏感的解读

Hollis Robbins

机构 * University of Utah(犹他大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 该研究提出语言解读需第二个带符号、持久且以个体与二元组为索引的相位参数,指出标准Transformer无相位显式表征,需构建承载相位语义状态的语言模型。

Comments 23 pages; 0 figuresCC

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17393 2026-08-19 cs.AI 新提交 57%

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

LEGO-RL:利用原生强化学习实现编码智能体

Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。

Comments Webpage: https://lego-rl.pages.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17018 2026-08-19 cs.SE 新提交 57%

ORCA: Observability-Grounded Program Repair for Microservice Incidents

ORCA:基于可观测性的微服务故障程序修复

Yuanchen Gao, Yifang Tian, Yiran Li, Charles Zhang, Hans-Arno Jacobsen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31281 2026-08-19 cs.CL 版本更新 57%

Wind Turbine Maintenance Log Labelling Framework: LLM-Driven Data Correction and Enrichment via Semantic Extraction of Reliability Intelligence

风力涡轮机维护日志标注框架:基于LLM驱动的数据校正与语义提取的可靠性智能增强

Max Malyi, Jonathan Shek, Alasdair McDonald, Andre Biscaya

机构 * Institute for Energy Systems, School of Engineering, The University of Edinburgh(能源系统研究所,工程学院,爱丁堡大学) Nadara, Lisbon, Portugal(纳达拉,里斯本,葡萄牙)

专题命中 软件智能体 :workflow(abstract);分类 cs.CL

AI总结 提出一种利用大语言模型自动标准化和结构化风力涡轮机维护日志的方法,通过纠正系统代码、提取故障模式与维护动作分类,将非结构化文本转化为定量可靠性指标。

Comments An adjustable template containing the Python script architecture, applied dynamic prompts, and data schemas is hosted in an open-source GitHub repository: https://github.com/mvmalyi/llm-driven-wind-turbine-maintenance-log-labelling

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16465 2026-08-18 cs.AI 新提交 57%

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills

JailbreakSkill:通过可复用且不断演进的技能扩展自动化红队测试

Xiaoyu Wen, Jiajia Li, Zhida He, Peng Yu, Chenxu Wang, Han Qi, Ziyuan Zhou, Cheng Jin, Ying Wen, Xingcheng Xu, Shuyue Hu, Tianhang Zheng, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本研究提出以技能为核心的JailbreakSkill框架,将攻击策略打包为可复用技能,通过攻击与学习的闭环演进技能,大幅提升攻击成功率,且技能可泛化至未见过的提示词与目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16295 2026-08-18 cs.CL 新提交 57%

Executable Code Knowledge: Code as a Native, Validation-Carrying Knowledge Representation for AI Coding Agents

可执行代码知识:作为AI编码智能体原生、带验证的知识表示的代码

Xueping Gao

机构 * Alibaba Cloud(阿里云)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 该研究提出可执行代码知识(ECK)及其单元ECKU,构建Python原型验证其在编码智能体任务中的效果,支持源绑定、验证等功能,为AI编码智能体提供了混合架构方案。

Comments 11 pages. Submitted to AgenticDev 2026, co-located with ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16022 2026-08-18 cs.SE 新提交 57%

OpenHarmony Bench: Evaluating LLMs and Coding Agents on OpenHarmony App Development

OpenHarmony Bench:评估LLM与编码智能体在OpenHarmony应用开发中的表现

Li Li, Han Hu, Tianjian Zhang, Xin Peng, Fangzhu Mao, Qingyu Zhang, Xiaoheng Xie, Zhongmin Tang, Zhihao Lin, Haolin Ruan, Miaomiao Dong, Liuchuan Zhu, Yue Li, Chi Chen, Wenkang Zhong, Mingfei Zhang, Yang Yu, Bo Sun, Chaorui Zhang, Weixi Zhang, Wei Han, Bo Bai, Kui Liu, Gang Fan, Siru Liu, Jiaqian Zhou, Jiali Sun, Yunbiao Dong, Wenhao Zhong, Yunhong Xu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 该研究推出OPENHARMONY BENCH应用级编码基准,评估8个LLM驱动的DevEco Code在三类OpenHarmony ArkTS应用任务中的表现,发现新一代模型任务完成率更高、构建性接近饱和但行为正确性不足、spec驱动任务完成率最低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15595 2026-08-18 cs.SE 新提交 57%

AutoSQL: Extracting SQL Templates from Imperative ORM Code in Large-Scale Repositories

AutoSQL:从大规模代码仓库中的命令式ORM代码提取SQL模板

Junsong Pu, Yichen Li, Zhuangbin Chen, Zhihan Jiang, Zibin Zheng

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 AutoSQL是从大规模Go仓库的命令式ORM代码提取SQL模板的系统,采用代码索引、混合上下文检索策略,在基准测试中召回率优于现有方法。

Comments Accepted to ASE '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26469 2026-08-18 cs.SE 版本更新 57%

An Empirical Study of Speculative Decoding on Software Engineering Tasks

对软件工程任务中投机解码的实证研究

Yijia Li, Junkai Chen, Xing Hu, Xin Xia

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文通过实证研究评估了投机解码在软件工程任务中的有效性,发现其在代码生成、修复和编辑任务中表现各异,模型基于方法适合生成,模型无关方法更适合仓库级任务,且任务重复性提升模型无关方法性能。

Comments Accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14490 2026-08-17 cs.AI 新提交 57%

Twin: Playing an Unknown Game with a Test-Time Digital Twin

Twin:利用测试时数字孪生玩未知游戏

Alexy Skoutnev, Kirill Acharya, Gaston Longhitano, Madeleine Udell, Kevin Ellis, Iddo Drori

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究提出Twin系统,通过测试时数字孪生构建可执行世界模型,在ARC-AGI-3等未知游戏中通关率达97.8%,效率优于人类,核心是通过模拟交互和反例修复推断游戏规则与目标。

Comments Project website with action-by-action replays of all 25 runs: https://arc-agi-3-twin.vercel.app/ Code: AGI-3" target="_blank" rel="noopener">https://github.com/Alexyskoutnev/TWIN-ARC-AGI-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13958 2026-08-17 cs.AI cs.CY cs.LO 新提交 57%

Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence

用Wolfram语言实现计算法以用于人工智能治理

James K. Wiles

机构 * Wolfram Institute for Computational Foundations of Science(沃尔夫勒姆计算基础科学研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文在Wolfram语言中实现Reified Input/Output Logic,测试GPT-4转换英文法律陈述的情况,通过AI看门狗案例展示计算法可作为AI治理工具,理想目标是形式化可编程执行的法律。

Comments 25 pages, 1 figure, 2 tables, 12 code listings. Wolfram Language implementation and verification script (31 assertions) available at https://github.com/Zaffer/research-computational-law

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13928 2026-08-17 cs.CR cs.SE 新提交 57%

CoSA: Context-Aware Severity Assessment via Context Analysis with Large Language Models

CoSA:基于大语言模型的上下文分析实现上下文感知的漏洞严重程度评估

Jinfeng Jiang, Yikun Li, Chengran Yang, Ting Zhang, Wen Bin Leow, Yide Yin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 CoSA是一种基于大语言模型的上下文感知漏洞严重程度评估方法,通过两阶段仓库剪枝策略与Transformer预测器,在6816个CVSS标注实例上较最优基线提升了14.4%准确率与15.3% Macro-F1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14396 2026-08-17 math.OC cs.AI 新提交 57%

AI-Assisted Discovery and Construction of a Counterexample to the Convergence of Three-Block ADMM with the Identity Matrix as its Third Constraint Block

AI辅助发现与构造以单位矩阵作为第三个约束块的三块ADMM收敛性反例

Kenan Xu, Xiangfeng Wang

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 该研究借助AI工具构造出以单位矩阵为第三约束块的三块ADMM的收敛反例,还分析了乘子松弛对收敛性的影响,对比了不同AI工具在数学研究中的表现。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10119 2026-08-17 cs.SE 版本更新 57%

IntrinTrans: LLM-based Intrinsic Code Translator for RISC-V Vector

IntrinTrans: 基于大语言模型的RISC-V向量内在函数翻译器

Liutong Han, Zhiyuan Tan, Hongbin Zhang, Pengcheng Wang, Chu Kang, Mingjie Xing, Yanjun Wu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出IntrinTrans,利用大语言模型和编译反馈自动翻译跨架构内在函数,并通过寄存器使用信息优化生成代码,实验证明其性能接近原生实现。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13292 2026-08-14 cs.SE 新提交 57%

Refine After Generation: Toward Correct and Concise Patches in LLM-based Program Repair

生成后优化:面向基于大语言模型的程序修复中正确且简洁的补丁

Wenqiang Luo, Jacky Keung, Xiaoyu Shi, Yicheng Sun, Boyang Yang, Zhou Yang, Haoye Tian

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 针对基于LLM的程序修复中补丁冗余问题,提出RECAP适配器,在保留或提升解决率的同时,大幅降低补丁大小,实现更优的大小-正确性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12161 2026-08-14 cs.CL 版本更新 57%

Token Reduction Is Not Cost Reduction

令牌减少并非成本降低

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 研究基于 API 的编码代理上下文减少层,通过对 2848 次 Claude Code 运行分析,发现提示缓存流量主导成本,工具输出减少不能可靠预测计费成本降低,压缩可能损害任务完成,进而提出以成功调整计费成本为核心的分层证据标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11727 2026-08-13 cs.AI 新提交 57%

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents

Harness-IF:评估编码智能体在不同指令层面的指令遵循能力

Zining Huang, Haoran Que, Hong Zeng, Ge Zhang, Zuo Wang, Jin Chen, Haodong Wang, Zhongfei Hou, Changxin Pu, Shen Yan, Wenhao Huang

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本研究推出Harness-IF评估框架,引入AP-Acc指标区分编码智能体的指令合规与巧合,发现12个前沿模型在对抗先验规则上表现更差,且合并优先级不随提示深度变化。

Comments 26 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11460 2026-08-13 cs.CL 新提交 57%

Principal Trait Analysis: Towards Deriving "Skills" in Human-AI Collaboration

主特质分析:面向人机协作中“技能”的推导

Hunter McNichols, Kai Du, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11225 2026-08-13 cs.AI 新提交 57%

Identity from the Outside: A Conceptual Framework and Research Program for AI Personality Clones

来自外部的身份:AI人格克隆的概念框架与研究计划

Luc E. Brunet

机构 * R&D Mediation(调解研发部)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究针对AI人格克隆问题,提出含六项分解的身份概念框架,定义不可区分性,通过类比阐明线性性,区分代理类型,提出实验计划,主张以环境保真度为长期标准,核心为条件猜想。

详情

展开后加载摘要…

URL PDF HTML 收藏