arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-07 至 2026-07-07 共收录 442 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 20 篇

2607.04391 2026-07-07 cs.CL 新提交 85%

Memory-Orchestrated Semantic System (MOSS): An Auditable Agentic Memory Architecture

内存编排语义系统(MOSS):一种可审计的智能记忆架构

Serge Lacasse, Jérémie Hatier, Alex Baker

机构 * Faculté de musique, Université Laval, Québec, Canada(加拿大魁北克拉瓦尔大学音乐学院) Faculté des sciences et de génie, Université Laval, Québec, Canada(加拿大魁北克拉瓦尔大学理工学院)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.CL

AI总结 研究针对AI智能体长期记忆的弱点,提出MOSS架构,通过在结构化关系数据库上驱动检索,具有模型、存储、API无关性,检索可审计且从语料库派生概念词汇,报告了在个人学者工作语料库上的长期部署。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03726 2026-07-07 cs.CL 新提交 85%

SelfMem: Self-Optimizing Memory for AI Agents

SelfMem:人工智能代理的自优化内存

Shu Yang, Junchao Wu, Derek F. Wong, Di Wang

机构 * PRADA Lab, King Abdullah University of Science and Technology(阿卜杜拉国王科技大学普拉达实验室) NLP2CT Lab, University of Macau(澳门大学NLP2CT实验室)

专题命中 记忆与上下文管理 :AI agent(title,abstract);agent(abstract);tool use(abstract);分类 cs.CL

AI总结 研究针对当前AI代理内存系统局限,提出SelfMem自优化内存框架,借自我改进AI理念,提供含内存工具与反馈信号的环境让代理自主探索优化内存策略,实验表明其性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30111 2026-07-07 cs.RO cs.AI cs.LG 版本更新 84%

Automating the Design of Embodied Agent Architectures

具身智能体架构设计的自动化

Jian Zhou, Sihao Lin, Jin Li, Shuai Fu, Gengze Zhou, Qi Wu

机构 * Australian Institute for Machine Learning, University of Adelaide, SA, Australia(澳大利亚机器学习研究所,阿德莱德大学,南澳大利亚州,澳大利亚)

专题命中 记忆与上下文管理 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出AgentCanvas运行时和KDLoop搜索过程,将架构搜索扩展到感知型具身智能体,在视觉-语言导航等任务上取得性能提升,但面临噪声、局部最优和信用分配等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04617 2026-07-07 cs.AI 新提交 83%

MRMS: A Multi-Resolution Memory Substrate for Long-Lived AI Agents

MRMS:一种用于长寿命人工智能智能体的多分辨率内存基底

Jizhizi Li, Amy Shi-Nash

机构 * NxtLab Innovations(NxtLab创新公司)

专题命中 记忆与上下文管理 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究长寿命AI智能体的内存问题,提出沿两个正交轴组织的架构内存基底,介绍其设计约束和核心主张,还给出轻量级原型实现并验证核心机制。

Comments 11 pages, 1 figure, 7 tables; technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03702 2026-07-07 cs.AI 新提交 79%

Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry

通过关键感知自反馈重试的智能体强化学习

Weiyang Guo, Zesheng Shi, Longhui Zhang, Zeen Zhu, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 研究大语言模型智能体在处理失败轨迹时的问题,提出PivoARL框架,通过结构化反思识别关键错误转向并局部重试,减少冗余交互,设计关键感知信用分配机制,实验证明该方法能显著提升性能。

Comments 26pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02579 2026-07-07 cs.SE 新提交 79%

When Not to Write Memory: Governing False Promotion from Correlated Agent Traces

何时不写入内存:管理来自相关代理痕迹的错误推广

Yijiashun Qi, Xiang Xu, Yuxuan Li

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.SE

AI总结 研究语言代理从执行痕迹写入可复用内存时何时应拒绝写入的问题,引入GovMem策略,通过估计依赖感知支持等进行决策,在测试中能减少错误推广。

Comments accepted by mlise 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02617 2026-07-07 cs.SE 版本更新 79%

His2Trans: A Knowledge-Guided Agentic Framework for Project-Level C-to-Rust Migration

基于构建意识的增量C到Rust迁移:通过骨架优先翻译和历史知识重用

Shengbo Wang, Mingwei Liu, Guangsheng Ou, Yuwen Chen, Zike Li, Yanlin Wang

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.SE

AI总结 本文提出His2Trans框架,通过构建意识的骨架构建和历史知识重用,实现C到Rust的增量迁移,提升构建可行性并减少警告数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14323 2026-07-07 cs.NI 版本更新 78%

FUSION: Forecast-Embedded Agent Scheduling with Service Incentive Optimization over Distributed Air-Ground Edge Networks

融合:分布式空地边缘网络中具有服务激励优化的预测嵌入式智能体调度

Houyi Qi, Minghui Liwang, Seyyedali Hosseinalipour, Liqun Fu, Sai Zou, Xianbin Wang, Wei Ni, Yiguang Hong

专题命中 记忆与上下文管理 :agent(title,abstract)

AI总结 针对分布式空地集成网络,提出含离线和在线阶段的FUSION两阶段优化框架。离线阶段用液神经网络预测需求,经路由和激励机制确定合同与路线;在线阶段将任务调度建模为博弈求解。实验表明该框架能提升福利与利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05189 2026-07-07 cs.CR cs.AI 新提交 70%

When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents

当智能体的记忆留存却不外露:持久化个人智能体中的隐秘内存注入攻击

Yechao Zhang, Shiqian Zhao, Jiawen Zhang, Jie Zhang, Gelei Deng, Xiaogeng Liu, Chaowei Xiao, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) CFAR, A*STAR(CFAR,A*STAR) Johns Hopkins University(约翰霍普金斯大学)

专题命中 记忆与上下文管理 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 针对持久化个人智能体的隐秘内存注入威胁,构建多场景基准测试集WhisperBench,提出单次邮件投送的黑盒攻击框架MemGhost,可跨架构、跨防御实现高成功率的长期智能体入侵。

Comments 25 pages, 8 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04153 2026-07-07 cs.LG cs.AI 新提交 62%

Mask-based Predictive Representations for Reinforcement Learning

基于掩码的强化学习预测表示

Kai Zhao

机构 * Beijing Normal University(北京师范大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对视觉深度强化学习中高维图像输入问题,受自然语言处理等启发,提出基于掩码预测的自监督任务作辅助,结合transformer提升强化学习样本效率,在多控制基准测试中优于现有方法。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02932 2026-07-07 cs.CR cs.AI cs.HC cs.LG 新提交 62%

PromptPET: Privacy-Utility Optimized Prompt Obfuscation

PromptPET:隐私-效用优化的提示混淆

Ke Yang, Olivia Figueira, Umar Iqbal, Athina Markopoulou

机构 * University of California, Irvine(加州大学 Irvine 分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 旨在通过用户端机制保护用户隐私,该机制转换用户提示中的敏感信息,在保护隐私和保留效用间权衡。考虑评估比较四种混淆动作,提出基于大语言模型的PROMPTPET,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11512 2026-07-07 cs.LG cs.AI cs.IT math.IT 版本更新 62%

TERC: A Transfer Entropy Redundancy Criterion for State Variable Selection in Reinforcement Learning

TERC:一种用于强化学习状态变量选择的转移熵冗余准则

Charles Westphal, Stephen Hailes, Mirco Musolesi

机构 * UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TERC准则,用于选择强化学习中的最优状态变量,通过信息理论方法排除冗余变量,提升推理效率,适用于多种算法和环境。

Comments 47 pages, 12 figures, accepted in TMLR (https://openreview.net/forum?id=J0ad21E0vX)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04562 2026-07-07 cs.AI cs.NE 新提交 57%

Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

用于消除大语言模型认知熵的滚动系数的海维赛德连续性

MY Pitsane, Hope Mogale

机构 * North-West University, RSA(南非北开普大学) University of Pretoria, RSA(南非彼得里亚大学) Mankind Research Labs, Sandton(沙顿人类研究实验室)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 研究大语言模型输出难检测错误的问题,提出海维赛德连续性的滚动系数框架,将推理重新表述为谓词门控状态转换,结合模型置信度与并行验证信号,防止无效状态传播,降低认知熵。

Comments A First draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04089 2026-07-07 cs.AI 新提交 57%

PLACEMEM: Toward a Compute-Aware Memory Plane for Lifelong Agents

PLACEMEM:迈向用于终身智能体的计算感知内存平面

Sukanta Ganguly

机构 * NetApp

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究终身智能体的内存需求,提出PLACEMEM,以版本化胶囊表示智能体内存,介绍其在当前原型中的应用及特性,给出vLLM优先原型及基准测试工具,展示了成果与未来路线图。

Comments 6 pages, 3 Tables,. 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02689 2026-07-07 cs.CV cs.AI 新提交 57%

S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval

S-EMBER:用于流式自我中心记忆检索的大规模基准测试

Xiaodong Wang, Xuanyi Zhao, Pedro Rodriguez, Devendra Singh Sachan, Barlas Oguz, Seungwhan Moon, Shang-Wen Li, Gargi Ghosh, Xin Dong, Wen-Tau Yih

机构 * FAIR, Meta(公平研究院,元公司) Reality Labs, Meta(现实实验室,元公司)

专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.AI

AI总结 研究针对可穿戴设备连续第一人称记录下AI助手的情景记忆问题,引入S-EMBER基准测试,通过视频及问答对模拟真实交互,发现前沿模型存在定位矛盾,为可穿戴AI代理情景记忆发展奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03000 2026-07-07 eess.SY cs.SY 新提交 50%

Physics-Informed Neural State-Space Modeling of Battery-Electric Vehicle Dynamics for Closed-Loop Automated Parking Simulation

用于闭环自动泊车模拟的电池电动车辆动力学的物理信息神经状态空间建模

Sirong Pan, Guannan Tian, Pan Song

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 为生产型纯电轿车泊车工况引入物理信息神经状态空间模型,基于实地测试识别,训练时施加速度约束,用专用子模型再现执行器行为,可用于预校准自动泊车规划与控制堆栈。

Comments 11 pages, 10 figures. Under review at IEEE Transactions on Intelligent Vehicles. Code and trained models: https://github.com/pansong/PyNSSM-Parking ; interactive simulator: https://github.com/pansong/auto-parking-sim

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03677 2026-07-07 math.AP 新提交 50%

Dynamics of Chemotactic Gliding-Aggregation in Myxobacteria on Bounded Domains: Stochastic Modeling, Analysis, and Deep Neural Network Simulations

有界域上粘细菌趋化性滑动聚集的动力学:随机建模、分析和深度神经网络模拟

Fugui Ma, Zhimeng Ouyang, Wenyi Tian, Lei Wu

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 提出统一框架,整合随机建模、严格分析和基于深度神经网络的模拟,刻画粗糙表面异常滑动动力学,推导宏观模型并建立解理论,设计神经网络方法,数值实验验证框架有效性。

Comments 78 pages,23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04785 2026-07-07 astro-ph.IM astro-ph.HE 新提交 50%

Emulation of non-linear 1D spectral models: relativistic X-ray reflection

非线性一维光谱模型的仿真:相对论性X射线反射

Benjamin J. Ricketts, Tin Hadži Veljković, Daniela Huppenkothen, Adam Ingram, Matteo Lucchini, Guglielmo Mastroserio, Fergus J. E. Baker

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 探讨在天体物理数值模型reltrans中一维模型模拟器的实现,通过系统表征目标模型,采用模块化策略,用特定架构实现高精度仿真,速度提升且无系统偏差,为数值模型模拟器提供策略。

Comments 16 pages, 13 figures, submitted to Royal Astronomy Society Techniques and Instruments (RASTI), comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07877 2026-07-07 math.OC 版本更新 50%

Mean-field games of speedy information access with observation costs

具有观测成本的快速信息获取平均场博弈

Dirk Becherer, Christoph Reisinger, Jonathan Tam

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究主体可主动控制信息获取速度的平均场博弈,通过接受更高成本降低观测延迟,利用主动信息获取影响状态动态以最大化奖励,用参数化信念状态将其转化为标准平均场博弈并求解。

Comments Accepted for publication in Mathematics and Operations Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14431 2026-07-07 math-ph math.AP math.MP math.OC physics.soc-ph 50%

Breaking Consensus in Kinetic Opinion Formation Models on Graphons

在图隆上打破动能意见形成模型中的共识

Bertram Düring, Jonathan Franceschi, Marie-Therese Wolfram, Mattia Zanella

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出了一种防止动能意见形成模型中达成共识的策略,通过分析图隆结构和微观数学模型,展示如何通过惩罚机制引导系统走向非聚类状态。

Comments Changed to align to the in-print version

Journal ref J. Nonlinear Sci. 34 (2024), 79

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 91 篇

2606.25996 2026-07-07 cs.AI cs.CL cs.LG 新提交 88%

Autodata: An agentic data scientist to create high quality synthetic data

Autodata: 一种创建高质量合成数据的智能数据科学家方法

Ilia Kulikov, Chenxi Whitehouse, Tianhao Wu, Yixin Nie, Swarnadeep Saha, Eryk Helenowski, Weizhe Yuan, Olga Golovneva, Jack Lanchantin, Yoram Bachrach, Jakob Foerster, Xian Li, Han Fang, Sainbayar Sukhbaatar, Jason Weston

机构 * Meta

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出Autodata方法,让AI代理充当数据科学家,通过元优化学习创建更优的训练和评估数据,在计算机科学、法律推理和数学推理任务上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02116 2026-07-07 cs.AI 新提交 88%

ContextNest: Verifiable Context Governance for Autonomous AI Agent

ContextNest:自主AI智能体的可验证上下文治理

Misha Sulpovar, Benn R. Konsynski, Qaish Kanchwala, Gabe Goodhart

机构 * PromptOwl, LLC(PromptOwl公司) Goizueta Business School, Emory University(埃默里大学戈伊苏埃塔商学院) IBM Research(IBM研究院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 提出ContextNest,一种在检索前提供上下文治理的开放规范,通过版本链、哈希校验和审计追踪确保知识可验证性,实验表明其在防过时攻击和检索确定性上优于传统方法。

Comments 35 pages, 11 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04240 2026-07-07 cs.AI q-bio.CB 新提交 87%

Biological Motifs for Agentic Control

用于智能体控制的生物基序

Bogdan Banu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 研究大语言模型向自主智能体转变带来的可靠性等挑战,通过基因调控网络与智能体软件系统的类型化接口对应,映射生物基序到软件设计模式,给出智能体操作数等核心贡献并具实践可行性。

Comments 80 pages. Preprint; feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24380 2026-07-07 cs.SE 版本更新 87%

Agentic Services Computing

智能服务计算

Shuiguang Deng, Hailiang Zhao, Ziqi Wang, Wenzhuo Qian, Xiang Ao, Guanjie Cheng, Jianwei Yin, Albert Y. Zomaya, Schahram Dustdar

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 探讨服务计算范式转变带来的新问题,基于现有研究基础,引入智能服务计算,扩展服务计算范畴,为未来服务生态系统奠定以服务为中心的基础,实现对自治代理的系统管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15579 2026-07-07 cs.SE cs.AI cs.CR 版本更新 86%

Don't Make Models Guess Security and Safety: Symbolic Guardrails for Domain-Specific AI Agents

领域特定智能体的符号护栏:在不牺牲效用的情况下提供更强的安全性和安全性保证

Yining Hong, Yining She, Eunsuk Kang, Christopher S. Timperley, Christian Kästner

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.SE

AI总结 本文研究了符号护栏在提高AI智能体安全性和安全性方面的有效性,通过系统回顾80个最新基准测试,发现74%的政策要求可通过符号护栏实现,从而在不牺牲效用的情况下提升安全性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04433 2026-07-07 cs.IR cs.CL 新提交 85%

Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems

自主信息寻求:智能推荐系统路线图

Xinyu Lin, Yashar Deldjoo, Sunhao Dai, Honghui Bao, Xiaopeng Ye, Fatemeh Nazary, Wenjie Wang, Tommaso Di Noia, Jun Xu, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Polytechnic University of Bari(巴里理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.CL

AI总结 综述基于大语言模型的智能体融入推荐系统带来的转变,介绍基于自主性水平的分类法及三种核心范式,分析各范式采用的架构和智能体对关键组件的增强,探讨评估方法及未解决问题,指出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03601 2026-07-07 cs.AR 新提交 85%

ArchEval: Measuring AI Agents as Computer Architects

ArchEval:将人工智能代理作为计算机架构师进行评估

Chenyu Wang, Zishen Wan, Jeffrey Ma, Shvetank Prakash, Zhenting Qi, Haebin Do, Andy Cheng, Arya Tschand, Jiahe Shi, Yilun Du, Vijay Janapa Reddi

专题命中 Agent评测 :AI agent(title);agent(abstract);tool use(abstract);workflow(abstract)

AI总结 介绍用于评估大语言模型代理在计算机架构设计与优化方面的ArchEval基准和平台,含20个挑战及8个模拟器,通过不同设置运行,报告性能并记录轨迹,揭示当前代理的优缺点及后续所需能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03510 2026-07-07 cs.SE cs.AI cs.CY 新提交 84%

CAGE-1: Control, Assurance, and Governance Evaluation for Enterprise Agentic AI

CAGE-1:企业智能代理人工智能的控制、保证和治理评估

Roopam W. Sure

机构 * Independent technical report(独立技术报告)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究企业人工智能从实验转向运营工作流带来的评估问题,介绍CAGE-1评估框架,评估多方面内容,引入预绑定保证,用于判断企业代理是否可部署。

Comments 17 pages, 3 figures; independent technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02032 2026-07-07 cs.AI cs.CL 新提交 84%

PACE: A Proxy for Agentic Capability Evaluation

PACE:智能体能力评估的代理框架

Yueqi Song, Lintang Sutawika, Jiarui Liu, Lindia Tjuatja, Jiayi Geng, Yunze Xiao, Daniel Lee, Aditya Bharat Soni, Vincent Lo, Xiang Yue, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出PACE框架,通过从非智能体评测中选取原子实例构建代理基准,以低成本高精度预测智能体基准性能,在14个模型上实现MAE<4%、Spearman>0.80。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05202 2026-07-07 cs.AI 新提交 83%

EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer

EvoAgentBench:通过能力迁移评测智能体自进化的基准平台

Xingze Gao, Chuanrui Hu, Hongda Chen, Pengfei Yao, Zhao Wang, Yi Bai, Zhengwei Wu, Yunyun Han, Xiaofeng Cong, Jie Gui, Yafeng Deng, Teng Li

机构 * Anhui University(安徽大学) EverMind, Shanda Group(盛趣游戏灵眸智能科技) Southeast University(东南大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 针对现有评测无法分离大语言模型智能体程序性经验迁移的问题,提出跨四领域的EvoAgentBench基准,可将自进化评测转为对经验编码、路由与吸收的细粒度诊断。

Comments 15 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏