arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-19 至 2026-05-19 共收录 22 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 22 篇

2605.18747 2026-05-19 cs.CL cs.AI 90%

Code as Agent Harness

代码作为代理工具

Xuying Ning, Katherine Tieu, Dongqi Fu, Tianxin Wei, Zihao Li, Yuanchen Bei, Jiaru Zou, Mengting Ai, Zhining Liu, Ting-Wei Li, Lingjie Chen, Yanjun Zhao, Ke Yang, Bingxuan Li, Cheng Qian, Gaotang Li, Xiao Lin, Zhichen Zeng, Ruizhong Qiu, Sirui Chen, Yifan Sun, Xiyuan Yang, Ruida Wang, Rui Pan, Chenyuan Yang, Dylan Zhang, Liri Fang, Zikun Cui, Yang Cao, Pan Chen, Dorothy Sun, Ren Chen, Mahesh Srinivasan, Nipun Mathur, Yinglong Xia, Hong Li, Hong Yan, Pan Lu, Lingming Zhang, Tong Zhang, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta Stanford University(斯坦福大学)

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);tool use(abstract);planning(abstract)

AI总结 本文探讨了代码在代理系统中的作用,提出了一种统一的视角,将代码视为代理基础设施的基础,并讨论了代理工具接口、机制以及扩展到多代理系统的挑战。

Comments GitHub: https://github.com/YennNing/Awesome-Code-as-Agent-Harness-Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03409 2026-05-19 cs.AI 87%

Robust Agent Compensation (RAC): Teaching AI Agents to Compensate

鲁棒代理补偿(RAC):教AI代理补偿

Srinath Perera, Kaviru Hapuarachchi, Frank Leymann, Rania Khalaf

机构 * University of Stuttgart(斯图加特大学)

专题命中 软件智能体 :agent(title,abstract);AI agent(title);分类 cs.AI;agentic(comments)

AI总结 本研究提出了一种基于日志的恢复范式RAC,通过架构扩展实现安全网,可应用于大多数代理框架以支持可靠执行。RAC可在不修改现有代理代码的情况下启用,通过现有的扩展点在大多数现有代理框架中实现,并通过τ-bench和REALM-Bench验证,证明在解决复杂问题时,RAC在延迟和token经济性方面优于现有最先进的LLM-based恢复方法。

Comments Accepted at ACM Conference on AI and Agentic Systems (ACM CAIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17444 2026-05-19 cs.SE cs.AI cs.CL 87%

MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair

MemRepair:用于代理级漏洞修复的分层内存

Simiao Liu, Li Zhang, Fang Liu, Xiaoli Lian, Yang Liu, Yinghao Zhu

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 本研究提出MemRepair,一种增强记忆的代理框架,通过分层记忆和动态反馈循环提高漏洞修复的可靠性,实现了在多个仓库级别的漏洞修复基准上的高修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18684 2026-05-19 cs.SE cs.AI 86%

Reversa: A Reverse Documentation Engineering Framework for Converting Legacy Software into Operational Specifications for AI Agents

Reversa:一个用于将遗留软件转换为AI代理操作规范的反向文档工程框架

Sanderson Oliveira de Macedo, Ronaldo Martins da Costa

机构 * Federal Institute of Goias(戈亚斯联邦理工学院) Federal University of Goias(戈亚斯联邦大学)

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Reversa框架,旨在通过反向文档工程将遗留软件转换为AI代理可操作的规范,通过多代理流水线流程提取隐含规则,生成可追溯的操作规范,并提出评估协议以衡量覆盖率、可追溯性、置信度、效用和成本。

Comments Preprint. Includes a generative AI use statement

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16265 2026-05-19 cs.AI cs.CR 83%

AgentWall: A Runtime Safety Layer for Local AI Agents

AgentWall:本地AI代理的运行时安全层

Ashwin Aravind

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出AgentWall,一种用于本地AI代理的运行时安全与可观测性层,通过拦截代理操作、评估政策、要求人类批准和记录执行轨迹,实现92.9%的政策执行准确率。

Comments 16 pages, 2 figures, open-source implementation at https://github.com/agentwall/Agentwall

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18451 2026-05-19 cs.CV cs.GR 82%

Code-as-Room: Generating 3D Rooms from Top-Down View Images via Agentic Code Synthesis

Code-as-Room: 通过代理代码合成从俯视图图像生成3D房间

Yixuan Yang, Zhen Luo, Wanshui Gan, Jinkun Hao, Junru Lu, Jinghao Yan, Zhaoyang Lyu, Xudong Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) University of Warwick(沃里克大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 本文提出Code-as-Room框架,通过结构化执行 harness 生成3D房间,利用Blender代码表示房间,并引入专门的代码基3D房间合成基准进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16819 2026-05-19 cs.CL cs.AI cs.LG 80%

AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents

AgentKernelArena: GPU核优化代理的通用化意识基准测试

Sharareh Younesian, Wenwen Ouyang, Sina Rafati, Mehdi Rezagholizadeh, Sharon Zhou, Ji Liu, Yue Liu, Yuchen Yang, Hao Li, Ziqiong Liu, Dong Li, Vikram Appia, Zhenyu Gu, Emad Barsoum

机构 * AMD

专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出AgentKernelArena,一个用于评估GPU核优化代理的开源基准,通过隔离工作区和统一评分机制,测试代理在不同任务和硬件目标上的性能和通用化能力,发现大多数任务在正确性和编译效率上表现优异,但在PyTorch到HIP的转换任务中存在显著的正确性下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16079 2026-05-19 cs.CL cs.AI 79%

EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle

EvolveR:通过经验驱动的生命周期实现自进化大语言模型代理

Rong Wu, Xiaoman Wang, Jianbiao Mei, Pinlong Cai, Daocheng Fu, Cheng Yang, Licheng Wen, Xuemeng Yang, Yufan Shen, Yuxin Wang, Botian Shi

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Fudan University(复旦大学) Central South University(中南大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 软件智能体 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 EvolveR通过闭环经验生命周期实现LLM代理的自进化,结合离线自蒸馏和在线交互,利用策略强化机制迭代优化,提升多跳问答任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18073 2026-05-19 cs.SE cs.AI 73%

A-ProS: Towards Reliable Autonomous Programming Through Multi-Model Feedback

A-ProS:通过多模型反馈实现可靠的自主编程

Anika Tabassum, Md Sifat Hossain, Md. Fahim Arefin, Tariqul Islam, Tarannum Shaila Zaman

机构 * Dept. of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) Dept. of Information Systems, University of Maryland, Baltimore County(马里兰大学巴尔的摩县信息学院) University of Maryland, Baltimore County(马里兰大学巴尔的摩县)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出A-ProS,一种通过多模型反馈框架实现自主编程的AI代理,结合生成器和调试器,通过多轮反馈提升代码生成的准确性与效率,实验表明其在解决编程问题上具有显著优势。

Comments Accepted for Publication in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02512 2026-05-19 cs.ET cs.AI cs.SE 73%

Human-Certified Module Repositories for the AI Age

面向AI时代的可信模块仓库

Szilárd Enyedi

机构 * Automation Department, Technical University of Cluj-Napoca, Romania(克卢日-纳波卡技术大学自动化系,罗马尼亚)

专题命中 软件智能体 :AI agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出HCMR框架,通过人类监督与自动化分析结合,确保模块的可信度,为AI辅助开发提供安全可预测的模块组装方法。

Comments v4: acknowledged AI use for grammar and readability, added IEEE copyright notice; v3: 13 pages, new subsection about strong typed languages forcing AI to create more reliable code; v2: 12 pages, improved references; v1: 11 pages, 3 figures, 2 tables, prepared for AQTR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18397 2026-05-19 cs.DC 71%

Duet instrumentation: An Agentic Approach to Improving Sensitivity in Cloud Service Benchmarking

双人乐器:一种改进云服务基准测试灵敏度的代理方法

Sebastian Koch, Nils Japke, David Bermbach

专题命中 软件智能体 :agentic(title)

AI总结 本文提出了一种名为duet instrumentation的新基准测试方法,利用大型语言模型的代码理解能力,通过分析两个连续应用版本之间的代码变更,提高云服务基准测试的灵敏度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21654 2026-05-19 cs.LG 70%

EvilGenie: A Reward Hacking Benchmark

EvilGenie: 一个奖励黑客基准

Jonathan Gabor, Jayson Lynch, Jonathan Rosenfeld

机构 * Cambridge Boston Alignment Initiative(剑桥波士顿对齐倡议) MIT FutureTech(麻省理工 FutureTech)

专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出EvilGenie基准,用于评估编程环境中奖励黑客问题,通过测试用例硬编码和测试文件编辑等方法检测奖励黑客行为,并验证了LLM判断在无歧义情况下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04375 2026-05-19 eess.SY cs.AI cs.SY 70%

Experiment-as-Code Labs: A Declarative Stack for AI-Driven Scientific Discovery

实验作为代码实验室:面向AI驱动科学发现的声明式栈

Zhenning Yang, Yuhan Chen, Patrick Tser Jern Kon, Tongyuan Miao, Hongyi Lin, Venkat Viswanathan, Danai Koutra, Ang Chen

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出实验作为代码实验室框架,通过声明式配置编译至设备API,实现AI代理与自动化实验室设备的高效协同,推动AI在科学发现中的应用突破。

Comments Experiment-as-Code (EaC) white paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18583 2026-05-19 cs.SE cs.AI cs.CL cs.CR 67%

Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks

过度激进的编码代理:在良性任务中测量超出范围的动作

Yubin Qu, Ying Zhang, Yanjun Zhang, Gelei Deng, Yuekang Li, Leo Yu Zhang, Yi Liu

机构 * Griffith University(格里菲斯大学) Wake Forest University(威克森林大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Quantstamp

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出OverEager-Gen基准,用于评估编码代理在良性任务中超出范围的行为。研究发现,当基准中明确列出授权范围时,代理会停止推断边界并开始匹配声明文本,从而影响测量有效性。通过行为梯度验证器和双通道堆栈审计内部工具调用,验证了不同框架下的过度激进行为差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18449 2026-05-19 cs.LG cs.AI 66%

Modelling Customer Trajectories with Reinforcement Learning for Practical Retail Insights

用强化学习建模客户轨迹以获得实际零售洞察

Ken Ming Lee, Paul Barde, Maxime C. Cohen, Derek Nowrouzezahrai

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG;autonomous agent(comments)

AI总结 本文提出了一种基于智能体的建模框架,将客户轨迹预测转化为最大熵强化学习问题,以更准确地反映具有有限理性的客户行为,从而提供更精确的冲动购买率和货架交通密度估计。

Comments Proceeding of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17526 2026-05-19 cs.SE cs.AI 62%

SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering

SaaSBench: 探索编码代理在长周期企业SaaS工程中的边界

Qingnan Ren, Shun Zou, Shiting Huang, Ziao Zhang, Kou Shi, Zhen Fang, Yiming Zhao, Yu Zeng, Qisheng Su, Lin Chen, Yong Wang, Zehui Chen, Xiangxiang Chu, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里云实验室)

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出SaaSBench,首个针对企业SaaS工程的基准,旨在探索AI代理在复杂系统中的边界,通过30个任务和5370个验证节点,涵盖8种编程语言、6种数据库和13种框架,揭示了当前最先进代理在多组件系统配置和集成中的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17338 2026-05-19 cs.SE cs.CL 62%

Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?

精确调试基准:你的模型是在调试还是重生成?

Wang Bill Zhu, Miaosen Chai, Shangshang Wang, Yejia Liu, Song Bian, Honghua Dong, Willie Neiswanger, Robin Jia

机构 * University of Southern California(南加州大学) Microsoft(微软) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Toronto(多伦多大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL、cs.SE

AI总结 本文提出PDB基准,评估LLM调试能力,发现前沿模型调试精度低,即使受指令引导也难以达到高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16352 2026-05-19 cs.IR cs.AI cs.LG 62%

LARGER: Lexically Anchored Repository Graph Exploration and Retrieval

LARGER: 词典锚定的仓库图探索与检索

Yuntong Hu, Tongli Su, Liang Zhao, Bowen Zhu, Hasibul Haque

机构 * Emory University(埃默里大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 LARGER通过词典锚定的结构化定位方法提升代码仓库文件定位精度,实现测试生成和代码库理解任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16699 2026-05-19 cs.CL cs.AI 62%

Calibrate-Then-Act: Cost-Aware Exploration in LLM Agents

校准后再行动:在大语言模型代理中考虑成本的探索

Wenxuan Ding, Nicholas Tomlin, Greg Durrett

机构 * New York University(纽约大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Calibrate-Then-Act框架,使LLM代理在不确定环境下显式平衡成本与不确定性,从而更优地决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17926 2026-05-19 cs.SE 57%

LLM-Based Static Verification of Code Against Natural-Language Requirements: An Industrial Experience Report

基于大语言模型的代码对自然语言要求的静态验证:一项工业经验报告

Zhi Quan Zhou, Dave Towey, Tsong Yueh Chen

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出一种基于大语言模型的两阶段工作流,用于在智能汽车网络安全案例中验证代码是否符合自然语言要求,通过引入结构化中间表示减少幻觉和输出变异,提升静态分析的准确性与解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17907 2026-05-19 cs.CV cs.AI 57%

One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception

一个模型翻译它们所有:面向异构协作感知的通用任意到任意翻译

Yang Li, Weize Li, Quan Yuan, Congzhang Shao, Guiyang Luo, Yunqi Ba, Xuanhan Zhu, Xinyuan Ding, Xiaoyuan Fu, Jinglin Li

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出UniTrans,一种通用任意到任意特征模态翻译模型,通过预训练一组翻译专家参数并学习其组合系数来实现零样本翻译,从而在OPV2V-H和DAIR-V2X数据集上实现了优于现有方法的性能。

Comments 19 pages, accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12485 2026-05-19 q-bio.NC q-bio.QM 50%

Letting the neural code speak: Automated characterization of monkey visual neurons through human language

让神经代码发声:通过人类语言自动表征猴子视觉神经元

Vedang Lad, Katrin Franke, Tamar Rott Shaham, Surya Ganguli, Andreas S. Tolias, Sophia Sanborn, Nikos Karantzas

专题命中 软件智能体 :agentic(abstract)

AI总结 该研究通过人类语言表征猴子视觉皮层神经元的选择性,利用生成模型和神经数字孪生技术,实现了对神经功能的可解释、可测试的大规模描述,推动了智能科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏