arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-04 至 2026-05-04 共收录 5 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 5 篇

2510.19897 2026-05-04 cs.CL cs.AI cs.LG 78%

Learning from Supervision with Semantic and Episodic Memory: A Reflective Approach to Agent Adaptation

通过语义和事件记忆学习:一种反思式智能体适应方法

Jackson Hassell, Dan Zhang, Hannah Kim, Tom Mitchell, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 记忆与上下文管理 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出一种基于记忆增强的框架,利用预训练大语言模型生成的批判性反馈,通过语义和事件记忆提升智能体适应能力,实验证明其在多个任务中有效。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00034 2026-05-04 cs.CR cs.PL cs.SE 70%

Symbolic Execution Meets Multi-LLM Orchestration: Detecting Memory Vulnerabilities in Incomplete Rust CVE Snippets

符号执行与多LLM协调:在不完整的Rust CVE代码片段中检测内存漏洞

Zeyad Abdelrazek, Young Lee

专题命中 记忆与上下文管理 :agent(abstract);planning(abstract);分类 cs.SE

AI总结 本文提出结合符号执行(KLEE)与四代理多LLM架构,解决不完整代码问题,通过协作合成可编译的KLEE测试用例,检测Rust不安全代码中的内存漏洞,实现90.3%的测试用例编译成功率,检测到1,206个关键错误。

Comments 11 pages, 1 figure, to be published in : Ease 2026 The 6th International Workshop on Software Security Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00393 2026-05-04 cs.LG 57%

Model-Based Reinforcement Learning with Double Oracle Efficiency in Policy Optimization and Offline Estimation

基于双 oracle 效率的模型驱动强化学习:在策略优化和离线估计中的应用

Haichen Hu, Jian Qian, David Simchi-Levi

机构 * Laboratory for Information and Decision Systems(信息与决策系统实验室) Massachusetts Institute of Technology(麻省理工学院) The University of Hong Kong(香港大学)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.LG

AI总结 本文提出一种新的算法,通过 log-barrier 和 log-determinant 正则化,在离线 oracle 效率的 episodic RL 中实现最优 regret 绑定,且 oracle 复杂度与状态和动作空间大小无关,适用于大规模和连续环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23557 2026-05-04 stat.ML cs.LG 57%

Minimizing Human Intervention in Online Classification

在在线分类中最小化人类干预

William Réveillard, Vasileios Saketos, Alexandre Proutiere, Richard Combes

机构 * KTH Royal Institute of Technology(皇家理工学院) Univ. Paris-Saclay, CNRS, CentraleSupélec(巴黎-萨克雷大学、国家科学研究中心、中央超导实验室)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文研究了在主动学习框架下,如何通过保守包络分类器(CHC)和通用包络分类器(GHC)在不同条件下最小化人类干预,同时保证误差保障。

Comments 53 pages, 10 figures. AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00160 2026-05-04 math.OC math.PR 50%

Approximations and Learning for Decentralized Stochastic Control and Near Optimal Finite Window Policies

近似与学习用于去中心化随机控制及近最优有限窗口策略

Omar Mrani-Zentar, Serdar Yuksel

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究去中心化随机控制问题,提出在一般标准Borel空间下,通过有限窗口信息策略实现近最优局部策略,并证明其稳定性条件及Q学习算法的收敛性。

Comments arXiv admin note: text overlap with arXiv:2408.13828

详情

展开后加载摘要…

URL PDF HTML 收藏