arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-18 至 2026-05-18 共收录 167 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 17 篇

2605.16035 2026-05-18 cs.CR cs.AI cs.MA 88%

Who Owns This Agent? Tracing AI Agents Back to Their Owners

谁拥有这个智能体?追溯AI智能体回其所有者

Ruben Chocron, Doron Jonathan Ben Chayim, Eyal Lenga, Gilad Gressel, Alina Oprea, Yisroel Mirsky

机构 * Ben-Gurion University of the Negev Beer-Sheva Israel Center for Cybersecurity Systems \& Networks, Amrita Vishwa Vidyapeetham Amritapuri India Northeastern University Boston Massachusetts USA Ben-Gurion University of the Negev Center for Cybersecurity Systems \& Networks, Amrita Vishwa Vidyapeetham Northeastern University

专题命中 记忆与上下文管理 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于canary的智能体归属追踪方法,解决无法追溯恶意或误配置智能体所有者的问题,展示了其在实际场景中的可靠性与鲁棒性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01970 2026-05-18 cs.CR cs.AI 83%

Trojan Hippo: Weaponizing Agent Memory for Data Exfiltration

Trojan Hippo:利用代理记忆进行数据外泄

Debeshee Das, Julien Piet, Darya Kaviani, Luca Beurer-Kellner, Florian Tramèr, David Wagner

机构 * ETH Z\"urich

专题命中 记忆与上下文管理 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 研究提出Trojan Hippo攻击,通过单次不可信工具调用在代理长期记忆中植入潜伏载荷,当用户讨论敏感话题时激活并外泄数据。通过动态评估框架评估不同内存架构和防御措施,发现现有防御措施在安全性和实用性之间存在显著权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16233 2026-05-18 cs.AI cs.CL cs.LG cs.MA cs.SY eess.SY 82%

FORGE: Self-Evolving Agent Memory With No Weight Updates via Population Broadcast

FORGE:无权重更新的自演化代理记忆

Igor Bogdanov, Chung-Horng Lung, Thomas Kunz, Jie Gao, Adrian Taylor, Marzia Zaman

机构 * Carleton University(卡尔顿大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 FORGE通过群体广播机制实现无梯度更新的自生成记忆,提升层次ReAct代理决策能力,在CybORG CAGE-2任务中显著提高性能并降低失败率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15701 2026-05-18 cs.CL cs.AI 81%

H-Mem: A Novel Memory Mechanism for Evolving and Retrieving Agent Memory via a Hybrid Structure

H-Mem: 一种通过混合结构进化和检索智能体记忆的新型记忆机制

Jiawei Yu, Yixiang Fang, Xilin Liu, Yuchi Ma

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huawei Cloud Computing Technologies CO., LTD.(华为云计算技术有限公司)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 H-Mem通过混合结构有效建模智能体记忆的长期演化并高效检索记忆数据,提升问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15461 2026-05-18 cs.LG cs.AI 81%

DrugSAGE:Self-evolving Agent Experience for Efficient State-of-the-Art Drug Discovery

DrugSAGE: 自演化代理经验用于高效前沿药物发现

Yikun Zhang, Xiwei Cheng, Tianyu Liu, Yuanqi Du, Wengong Jin

机构 * Northeastern University(东北大学) Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所) Yale University(耶鲁大学) Microsoft Research New England(微软研究院新英格兰分部)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 DrugSAGE通过自演化代理经验框架,高效构建前沿药物发现模型,跨任务记忆提升模型性能,实现零次搜索下的显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14401 2026-05-18 cs.CL cs.AI 81%

Agentic Recommender System with Hierarchical Belief-State Memory

具有分层信念状态记忆的代理推荐系统

Xiang Shen, Yuhang Zhou, Yifan Wu, Zhuokai Zhao, Siyu Lin, Lei Huang, Qianqian Zhong, Lizhu Zhang, Benyu Zhang, Xiangjun Fan, Hong Yan

机构 * Meta Recommendation Systems (MRS)(Meta推荐系统)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出MARS框架,通过分层信念状态记忆提升推荐系统,采用LLM规划器动态调度六种操作,实验显示在四个基准领域中实现SOTA性能。

Comments 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16149 2026-05-18 cs.DS 79%

Fast and Memory Efficient Multimodal Journey Planning with Delays

快速且内存高效的考虑延迟的多模式行程规划

Denys Katkalo, Andrii Rohovyi, Toby Walsh

专题命中 记忆与上下文管理 :planning(title,abstract)

AI总结 本文提出一种更高效、快速且准确的多模式行程规划方法,适用于单目标和双目标场景,通过优化算法提升速度和精度。

Comments v4: revised manuscript incorporating reviewer feedback (Related Work restructure, temporal-planning baselines, Bez 2020 thesis acknowledgment, equation relocation); style switched to the AAAI 2026 format

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01290 2026-05-18 cs.AI cs.GT cs.LG cs.SY eess.SY 73%

Opponent State Inference Under Partial Observability: An HMM-POMDP Framework for 2026 Formula 1 Energy Strategy

在部分可观测性下对手状态推断:一种用于2026年F1能源策略的HMM-POMDP框架

Kalliopi Kleisarchaki

机构 * Independent Researcher(独立研究者)

专题命中 记忆与上下文管理 :agent(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出HMM-POMDP框架用于2026F1能源策略,通过HMM推断对手状态并利用DQN决策,解决部分可观测博弈问题,检测反收割陷阱。

Comments 17 pages. v3: editorial corrections and bibliographic updates. Pre-registered theoretical framework; empirical calibration on 2026 race telemetry from Australian Grand Prix (8 March 2026) onwards

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10454 2026-05-18 cs.AI 70%

Traj-CoA: Patient Trajectory Modeling via Chain-of-Agents for Lung Cancer Risk Prediction

Traj-CoA:通过链式代理进行患者轨迹建模用于肺癌风险预测

Sihang Zeng, Yujuan Fu, Sitong Zhou, Zixuan Yu, Lucas Jing Liu, Jun Wen, Matthew Thompson, Ruth Etzioni, Meliha Yetisgen

机构 * University of Washington(华盛顿大学) Fred Hutch Cancer Center(Fred Hutch癌症中心) Harvard University(哈佛大学) Google(谷歌)

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 Traj-CoA通过链式代理系统处理电子健康记录数据,减少噪声并保留完整时间线,从而在肺癌风险预测中优于基线方法。

Comments Accepted by NeurIPS 2025 GenAI4Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16045 2026-05-18 cs.CL cs.AI cs.LG 67%

RecMem: Recurrence-based Memory Consolidation for Efficient and Effective Long-Running LLM Agents

RecMem:基于递归的记忆巩固用于高效且有效的长运行LLM代理

Zijie Dai, Shiyuan Deng, Sheng Guan, Yizhou Tian, Xin Yao, Xiao Yan, James Cheng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) Huawei Cloud(华为云) Huawei Theory Lab(华为理论实验室) Institute for Math and AI, Wuhan University(武汉大学数学与人工智能研究院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 RecMem通过递归机制优化内存巩固,减少token消耗并提升准确性,有效解决长运行LLM代理的内存管理问题。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09378 2026-05-18 cs.AI cs.LG 62%

Frontier Large Language Models Rival State-of-the-Art Planners

前沿大语言模型与最先进的规划器相媲美

Augusto B. Corrêa, André G. Pereira, Jendrik Seipp

机构 * University of Oxford(牛津大学) Federal University of Rio Grande do Sul(里约格兰德杜斯尔大学) Linköping University(林霍普大学)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究显示前沿大语言模型在规划任务中超越传统规划器, Gemini 3.1 Pro在标准任务中表现突出,GPT-5表现接近基线,且在符号规划中仍具竞争力,揭示了大语言模型规划能力的提升趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15812 2026-05-18 cs.HC cs.AI 57%

Toward Natural and Companionable Virtual Agents via Cross-Temporal Emotional Modeling

通过跨时间情感建模实现自然和陪伴型虚拟代理

Feier Qin, Xiao Li, Yi Zheng, Haibin Huang, Hanyao Wang, Xiaoyu Wang, Yan Lu, Yuan Zhang

机构 * Communication University of China(中国通信大学) Microsoft Research Asia(微软亚洲研究院) Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出CTEM框架,通过链接长期行为历史与即时情感表达,提升虚拟代理的自然性和情感和谐度,实验显示在21天的真实场景中效果显著。

Comments 21 pages, published in CHI '26

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15665 2026-05-18 cs.AI 57%

PRISM: Prompt Reliability via Iterative Simulation and Monitoring for Enterprise Conversational AI

PRISM:通过迭代模拟和监控实现提示的可靠性用于企业对话式AI

Keshava Chaitanya, Jahnavi Gundakaram

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 PRISM通过持续模拟和监控,将提示工程视为可靠性工程问题,提升企业对话式AI的可靠性,减少提示开发时间并修复生产中的回归问题。

Comments 12 pages, 1 figure, 5 tables. arXiv preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15480 2026-05-18 cs.RO cs.AI 57%

Residual Reinforcement Learning for Robot Teleoperation under Stochastic Delays

残差强化学习用于具有随机延迟的机器人遥控

Kaize Deng, Zewen Yang

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 针对随机延迟导致的信号不连续问题,本文提出一种混合控制框架,通过LSTM状态估计器与残差强化学习策略相结合,提升遥控稳定性与性能。

Comments Accepted at 23rd IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15934 2026-05-18 cs.CR cs.CY 50%

Privacy is Fungibility: Why Endogenous Tokens Are Not Money

隐私即是法币性:为何内生代币不是货币

Alex Lynham, Geoffrey Goodell

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文论证内生代币如加密资产并非货币。通过定义和分类公开无许可账本上的代币,对比私人发行的稳定币及CBDC设计,指出多数公开账本缺乏现金原生要素,稳定币无法胜任,且依赖内生代币的网络会将持有者暴露于相同风险。

Comments 20 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11002 2026-05-18 physics.flu-dyn 50%

Real-time reinforcement learning for turbulent state-dependent control in a bluff-body wake

湍流状态依赖控制的实时强化学习

Junjie Zhang, Chengwei Xia, Xianyang Jiang, Isabella Fumarola, Georgios Rigas

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出REACT框架,通过实时强化学习控制风洞中 bluff-body 唆流,减少阻力并实现能耗节省,发现动态抑制相干结构能提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 31 篇

2605.15228 2026-05-18 cs.AI cs.LG 88%

Verifiable Agentic Infrastructure: Proof-Derived Authorization for Sovereign AI Systems

可验证的代理基础设施:基于证明的授权机制用于主权AI系统

Jun He, Deying Yu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);autonomous agent(abstract)

AI总结 本文提出Distributed Trust Framework,通过结构化可验证的艺术品计算执行权限,解决自主AI代理执行安全风险问题,实现授权过程的可验证、分布和可回放。

Comments 19 pager, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15625 2026-05-18 cs.AI cond-mat.soft 85%

ColPackAgent: Agent-Skill-Guided Hard-Particle Monte Carlo Workflows for Colloidal Packing

ColPackAgent:基于代理技能的硬粒子蒙特卡罗工作流程用于胶体堆积

Lijie Ding, Changwoo Do

机构 * Neutron Scattering Division, Oak Ridge National Laboratory, Oak Ridge, TN 37831, USA(奥克勒德国家实验室中子散射部)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);workflow(abstract);分类 cs.AI

AI总结 ColPackAgent通过MCP工具服务器和代理技能实现胶体堆积模拟的自主工作流程,展示了如何利用LLM代理执行模拟任务并评估不同模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15226 2026-05-18 cs.AR cs.AI cs.SE 84%

Is Agentic AI Ready for Real-World Hardware Engineering? A Deep Dive with Phoenix-bench

代理AI是否准备好进行现实世界硬件工程?通过Phoenix-bench的深入探讨

Qingyun Zou, Feng Yu, Hongshi Tan, Bingsheng He, WengFai Wong

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文通过Phoenix-bench评估代理AI在硬件工程中的表现,发现软件与硬件工程本质不同,且故障集中于设计控制流、验证测试用例等,定位精度比定位本身更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15215 2026-05-18 cs.AI cs.SE 84%

SkillSmith: Compiling Agent Skills into Boundary-Guided Runtime Interfaces

SkillSmith:将技能编译为边界引导的运行时接口

Duling Xu, Zheng Chen, Zaifeng Pan, Jiawei Guan, Dong Dong, Jialin Li, Bangzheng Pu

机构 * AetherHeart Tech Co., Ltd.(AetherHeart科技有限公司) Renmin University of China(中国人民大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 SkillSmith通过将技能包编译为最小执行接口,减少运行时冗余,提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14572 2026-05-18 cs.IR cs.AI cs.CL cs.MA 84%

Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG

不要检索,导航:将企业知识转化为可导航的代理技能用于问答和RAG

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute(马格纳技术研究 institute)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Corpus2Skill,通过将文档库转化为层次化技能目录,使LLM代理在服务时能导航该目录,提升问答质量和 grounding,但指出导航并非所有场景下的最佳替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15871 2026-05-18 cs.AI 83%

Agentic Discovery of Neural Architectures: AIRA-Compose and AIRA-Design

代理发现神经架构:AIRA-Compose和AIRA-Design

Alberto Pepe, Chien-Yu Lin, Despoina Magka, Bilge Acun, Yannan Nellie Wu, Anton Protopopov, Carole-Jean Wu, Yoram Bachrach

机构 * FAIR at Meta(Meta的FAIR)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出AIRA-Compose和AIRA-Design框架,通过自主设计神经网络架构,实现超越标准Transformer的基础模型,提升模型性能和效率。

Comments 55 pages, 28 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16194 2026-05-18 cs.DL cs.AI cs.IR cs.MA 79%

paper.json: A Coordination Convention for LLM-Agent-Actionable Papers

为LLM-代理可操作论文的协调约定

Arquimedes Canedo

机构 * arquicanedo

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出paper.json文件,通过稳定声明ID、明确不声明列表、精确图示命令和稳定定义ID等约定,解决LLM代理在阅读学术论文时的重复失败问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15710 2026-05-18 cs.CL 79%

SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory

SMMBench:一种用于源分布多模态智能体记忆的基准测试

Huacan Chai, Yukai Wang, Yingxuan Yang, Dan Peng, Yuanyi Song, Zhihui Fu, Weiwen Liu, Jianghao Lin, Jun Wang, Weinan Zhang

机构 * Shanghai Jiao Tong University, China(上海交通大学,中国) OPPO, China(OPPO,中国)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 SMMBench旨在评估智能体在多源分布证据下进行多模态推理、冲突解决和行动预测的能力,揭示当前系统在处理碎片化异构数据时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15537 2026-05-18 cs.AI 79%

RTL-BenchMT: Dynamic Maintenance of RTL Generation Benchmark Through Agent-Assisted Analysis and Revision

RTL-BenchMT:通过代理辅助分析和修订动态维护RTL生成基准

Jing Wang, Shang Liu, Hangan Zhou, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出RTL-BenchMT框架,通过自动识别和修正错误案例及检测更新过拟合案例,解决RTL基准中的缺陷和过拟合问题,降低人工维护成本。

Comments This paper has been accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15473 2026-05-18 cs.CY 78%

Validated Hypotheses as a Lens for Human-Likeness Evaluation in AI Agents

以验证假设为视角评估AI代理的人性化程度

Xuan Liu, HaoYang Shang, Zizhang Liu, Yuanjun Feng, Guankai Zhai, Yunze Xiao, Yiwen Tu, Haojian Jin

专题命中 Agent评测 :AI agent(title);agent(abstract)

AI总结 本文提出利用验证过的行为假设作为评估AI代理人性化的视角,通过HumanStudy-Bench平台对12个研究进行评估,发现代理响应在完全复制与彻底失败间极化,代理设计比模型规模对齐影响更大但效果非单调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15581 2026-05-18 cs.AI 77%

STAR: A Stage-attributed Triage and Repair framework for RCA Agents in Microservices

STAR: 一种针对微服务中RCA代理的阶段属性分诊与修复框架

Junle Wang, Xingchuang Liao, Wenjun Wu

机构 * School of Artificial Intelligence, Beihang University Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出STAR框架,通过将RCA流程分解为四个阶段,提升微服务中RCA代理的可靠性与自修复能力。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01283 2026-05-18 cs.AI cs.LG 73%

The Informational Cost of Agency: A Bounded Measure of Interaction Efficiency for Deployed Reinforcement Learning

代理的信息成本:部署强化学习的有限交互效率度量

Wael Hafez, Cameron Reid, Amit Nazeri

机构 * Semarx Research LLC(Semarx研究公司)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Bipredictability度量代理与环境交互的效率,通过实验证明代理行为会降低该度量,且在多个系统中验证其普遍性,为部署自主系统提供运行可靠性测量。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00417 2026-05-18 cs.CL 70%

CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency

CryptoBench: 一种动态基准,用于评估LLM代理在加密货币领域的专家级能力

Jiacheng Guo, Suozhi Huang, Zixin Yao, Yifan Zhang, Yifu Lu, Jiashuo Liu, Zihao Li, Nicholas Deng, Qixin Xiao, Jia Tian, Kanghong Zhan, Tianyi Li, Xiaochen Liu, Jason Ge, Chaoyang He, Kaixuan Huang, Lin Yang, Wenhao Huang, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Zenith Lab(Zenith实验室) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出CryptoBench,首个专家 curated 的动态基准,用于严格评估LLM在加密货币领域的真实能力。通过50题/月的动态任务,细分子类评估数据获取与预测能力,揭示LLM在检索与预测上的不平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15225 2026-05-18 q-bio.QM cs.AI 70%

Do Biological Structural Guarantees Earn Their Complexity?

生物结构保证是否值得其复杂性?

Bogdan Banu

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文通过三个深度基准测试,比较生物启发式实现与非生物替代方案,评估生物结构保证在AI代理中的可靠性优势。

详情

展开后加载摘要…

URL PDF HTML 收藏