arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-04 至 2026-08-04 共收录 388 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 27 篇

2605.10036 2026-08-04 cs.NI cs.AI 版本更新 83%

Bridging the Cognitive Gap: A Unified Memory Paradigm for 6G Agentic AI-RAN

弥合认知鸿沟:面向6G智能AI-RAN的统一记忆范式

Xijun Wang, Zhaoyang Liu, Chenyuan Feng, Xiang Chen, Howard H. Yang, Tony Q. S. Quek

机构 * Sun Yat-sen University, China(中山大学,中国) Zhejiang University, China(浙江大学,中国) University of Exeter, U.K.(埃克塞特大学,英国) Singapore University of Technology and Design, Singapore(新加坡科技设计大学,新加坡) Purple Mountain Laboratories, Nanjing, China(紫金山实验室,南京,中国)

专题命中 记忆与上下文管理 :agentic(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出一种统一记忆范式,通过将生物记忆层次映射到异构计算架构,弥合感知与推理之间的鸿沟,实现6G网络中自主决策的跨时间尺度状态共享。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01561 2026-08-04 cs.HC 新提交 82%

FedWorld: Scope-Aware Federation of Agent World Models

FedWorld:感知范围的智能体世界模型联邦

Yuchao Hou

专题命中 记忆与上下文管理 :agent(title,abstract);planning(abstract)

AI总结 FEDWORLD是一种感知范围的智能体世界模型联邦协议,通过交换结构化抽象转移规则,减少冲突动态下的负迁移,提升智能体任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00801 2026-08-04 cs.CR 新提交 82%

Hardware-rooted attestation for AI-agent evidence: composing IETF RATS with action evidence packages

AI智能体证据的硬件根证明:将IETF RATS与行动证据包组合

Anton Sokolov

专题命中 记忆与上下文管理 :agent(title,abstract);AI agent(abstract)

AI总结 本研究提出将IETF RATS架构与行动证据包组合,实现AI智能体的硬件根证明,通过仿真TPM实验验证了该方案的可行性。

Comments 9 pages, 1 figure, 1 table. Technical note. Also deposited at Zenodo: doi:10.5281/zenodo.20818671

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00009 2026-08-04 cs.CL cs.AI 新提交 81%

AgentMemBench: A Systematic Benchmark for Evaluating Long-Term Memory Management Strategies in Conversational AI Agents

AgentMemBench:用于评估对话AI智能体长期记忆管理策略的系统基准

Ahmed Cherif

机构 * Sofrecom(索弗雷科姆)

专题命中 记忆与上下文管理 :AI agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究构建了AgentMemBench基准,评估五种记忆策略及两款现有系统,发现外部键值存储(EKV)在长程对话记忆任务中表现最优,但存在内存占用成本,同时公开了全部可复现资源。

Comments 22 pages, 3 figures submitted on Neural Computing and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31650 2026-08-04 cs.LG cs.AI 版本更新 81%

ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL

ECHO: 在智能体强化学习中通过选择性回合记忆进行剪枝行动与追踪学习

Zijun Xie, Binbin Zheng, Enlei Gong, Jihua Liu, Yuyang You, Lingfeng Liu, Jiayao Tang, Guanqun Zhao, Aoqi Hu, Zeyu Chen

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Baidu Inc.(百度公司) University of Science and Technology of China(中国科学技术大学)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出ECHO框架,通过选择性回合记忆和源索引重建解决长程智能体强化学习中的历史崩溃与可追踪学习问题,在BrowseComp-Plus上达到43.4%准确率,优于GRPO和SUPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02553 2026-08-04 cs.AI 新提交 79%

A Taxonomy of Cognitive Capability Gaps in Generative and Agentic AI

生成式与智能体式AI中认知能力差距的分类学

Taye Akinrele, Sindhuja Penchala, Noorbakhsh Amiri Golilarz, Sudip Mittal, Shahram Rahimi

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI

AI总结 本文针对制约认知AI发展的认知能力差距开展分类学综述,梳理五大维度的进展与挑战,提出ACIA架构及认知导向评估框架,为构建可靠认知AI与AGI提供路线图。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01710 2026-08-04 cs.AI 新提交 79%

Beyond Single-Use Tokens: Durable Authorization State for Replay-Resistant LLM Agent Actions

超越单次使用令牌:面向抗重放的大语言模型智能体行动的持久授权状态

Jinghan Xu, Longze Fan, Zeyuan Wang, Xinjin Li, Hankai Liu

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 该研究针对大语言模型智能体重规划等行为引发的语义重放问题,提出 CapLease 授权消耗层,结合服务器账本实现抗重放,证明持久授权状态是抗重放智能体执行的系统要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01619 2026-08-04 cs.AI 新提交 79%

When Memory Updates but Behavior Does Not: Repairing Implicit Stale Dependencies in Personalized Agent Responses

当记忆更新但行为未更新时:修复个性化智能体响应中的隐式陈旧依赖

Haofei Sun, Lin He

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 该研究针对智能体存在的隐式陈旧依赖问题,提出StateAuditor反向审计方法,在STALE基准上实现显著性能提升,验证了转换机制对修复IPA缺口的有效性。

Comments 9 pages, 4 figures; supplementary material in ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01435 2026-08-04 cs.AI cs.CL cs.IR 版本更新 77%

Reliable Post-Retrieval Assembly for Agent Memory: Separating Evidence Extraction from Policy Execution

不要询问LLM追踪新鲜度:一种确定性的内存冲突解决策略

Vikas Reddy, Sumanth Reddy Challaram

机构 * IIT Kgp(印度理工学院科钦分校)

专题命中 记忆与上下文管理 :agent(title,comments);分类 cs.AI、cs.CL

AI总结 针对基于LLM的内存系统中事实冲突解决性能低下的问题,提出用候选提取加Python max(serial)的确定性聚合替代LLM判断,在单跳任务上提升10.8个百分点,并扩展到多跳任务。

Comments 11 pages, 5 tables. Accepted as a poster at the Lifelong Agent Workshop at COLM 2026. Code: https://github.com/cvikasreddy/memory-conflict-resolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15671 2026-08-04 cs.RO 版本更新 75%

Long-Term Memory for VLA-based Agents in Open-World Task Execution

基于VLA的智能体长期记忆在开放世界任务执行中的应用

Xu Huang, Weixin Mao, Yinhao Li, Hua Chen, Jiabao Zhao

机构 * Nanjing University(南京大学) LimX Dynamics(LimX 动态)

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);planning(abstract)

AI总结 本文提出ChemBot框架,通过双层记忆和MCP服务器提升复杂化学实验中的任务执行效率与安全性。

Comments Added references

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00962 2026-08-04 cs.AI 新提交 70%

PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents

PMMC:面向长期LVLM智能体的前瞻性多模态记忆编译

Jingyu Sun, Yan Lin, Yuyang Xue, Yifan Wang, Zhengtao Yao, Rui Qian, Zefeng Xu, Jiachen Li, Xianyang Liu, Jiancheng Pan, Jingyuan Sun, Syed Murtuza Baker, Hongpeng Zhou

专题命中 记忆与上下文管理 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 针对现有LVLM智能体记忆系统的缺陷,提出PMMC框架,将部分记忆推理移至整合阶段,构建结构化问题库,提升答案质量与证据召回率,降低查询成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00783 2026-08-04 cs.CR 新提交 67%

Safety Invariants for Agents Orchestrating Irreversible State Transitions: A Four-Dimensional Formalism Evaluated on Public Ledgers

编排不可逆状态转换的智能体的安全不变量:在公共账本上评估的四维形式主义

Zhaoming Yin

专题命中 记忆与上下文管理 :agent(abstract);autonomous agent(abstract)

AI总结 该研究针对编排不可逆状态转换的智能体,提出四维形式主义与七个安全不变量,在公共账本场景下验证其可提升智能体安全栈通过率,且可推广至其他不可逆状态交互场景。

Comments 29 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00007 2026-08-04 cs.CL cs.AI cs.LG 新提交 67%

MemoryForge: Synthesize Lifelong Memory for Human-Like LLM Agents

MemoryForge:为类人LLM智能体合成终身记忆

Bohan Tang, Yiwen Guo

机构 * Tencent(腾讯)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 MemoryForge是从简短目标画像合成终身记忆的框架,通过记忆条件让冻结LLM动态检索相关记忆,在两类任务实验中使其表现更类人。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01651 2026-08-04 cs.DC cs.CL cs.LG 新提交 62%

Bole: Efficient Tree Speculation for Hybrid-Attention Language Models

Bole:面向混合注意力语言模型的高效树推测解码

Li Wang, Yi Su, Xiabao Wu, Chiran You, Yongchao Liu, Zhan Qiu, Juelu Zhang, Jiajun Zheng, Fangxin Liu, Jie Zhang, Chen Tian, Chengying Huan

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL、cs.LG

AI总结 Bole是内核-运行时协同设计方案,通过优化树推测解码的线性注意力树验证与瞬态内存管理,显著提升混合注意力LLM的离线解码吞吐量与在线智能体工作负载的延迟性能。

Comments 14 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01285 2026-08-04 cs.LG cs.AI 新提交 62%

Stop When Memory Suffices: Evidence-Conditioned Progressive Execution for LLM Agents

当内存充足时停止:面向大语言模型智能体的证据条件渐进式执行

Yidan Lin, Kaixiang Wang, Jiong Lou, Jie Li

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对大语言模型智能体记忆系统的延迟与质量矛盾,提出Router-Mem框架,通过证据条件渐进式执行,在降低推理时间的同时保持了优异的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25538 2026-08-04 cs.LG cs.SE 版本更新 62%

ARMOR: A Robust Self-Supervised Framework for Root Cause Analysis in Microservices under Missing Modality

面向缺失数据的多模态融合用于统一微服务故障管理

Wenzhuo Qian, Hailiang Zhao, Ziqi Wang, Zhipeng Gao, Jiayi Chen, Zhiwei Ling, Shuiguang Deng

机构 * Zhejiang University(浙江大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG、cs.SE

AI总结 本文提出ARMOR框架,通过自监督学习解决微服务故障管理中多模态数据缺失问题,提升异常检测、故障分类和根本原因定位的性能。

Comments Accepted by the Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), 2026. This is the authors' version of the work; the definitive Version of Record is forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01708 2026-08-04 cs.CL 新提交 57%

PGMem: Tightly Coupled Persona-Memory Graph for Lifelong Personalized Agents

PGMem:用于终身个性化智能体的紧耦合角色记忆图

Wonjun Choi, Yerim Kim, Yukyung Lee, Susik Yoon

机构 * Korea University(高丽大学) Boston University(波士顿大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL

AI总结 该研究针对现有对话智能体记忆系统的角色与事件松散耦合问题,提出PGMem异构角色记忆图,通过溯源边关联角色与事件,在多个基准测试中性能优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01637 2026-08-04 cs.AI 新提交 57%

Salami Attack: Stealthy Collusive Memory Poisoning against OpenClaw

Salami攻击:针对OpenClaw的隐蔽合谋式内存投毒

Zheng Lin, Yuzhe Huang, Zhenxing Niu, Xianmin Ye, Haichang Gao

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 针对OpenClaw,提出MemCollusion框架,采用Salami策略生成合谋式内存投毒攻击,在48种场景下平均内存保存率81.3%、攻击成功率75.0%,可应对良性内存稀释与内存级防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01234 2026-08-04 cs.AI 新提交 57%

Learning What to Remember and What to Internalize in LLM Self-Evolution via Adaptive Memory-Parameter Coordination

在大语言模型自进化中通过自适应记忆-参数协调学习该记住什么和该内化什么

Tianyun Ji, Zhenya Huang, Jiayu Liu, Zirui Liu, Yu Su, Hongbin Pei

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Hefei Normal University(合肥师范学院) Xi’an Jiaotong University(西安交通大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 该研究提出 COVE 框架,通过任务感知路由等方式协调大语言模型自进化的记忆与参数通道,解决单通道进化的灵活性与性能权衡问题,在多任务上实现更稳健高效的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00321 2026-08-04 cs.AI 新提交 57%

Trust and Its Betrayal under Three Representational Strategies

三种表征策略下的信任及其背叛

Mihnea C. Moldoveanu, Joel A. C. Baum

机构 * Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 该研究将信任视为虚拟认知状态,构建三种表征并探究其对Brandenburger-Keisler不可能性的影响,发现不同表征遭遇背叛时的存续方式存在显著差异。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00303 2026-08-04 cs.AI 新提交 57%

CrystalMem: Elastic Memory for Self-Evolving LLM Agents via Knowledge Crystallization

CrystalMem:基于知识结晶的自进化大语言模型智能体弹性内存

Beining Wu, Jun Huang

机构 * South Dakota State University(南达科他州立大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体的内存滞后问题,提出弹性内存组件CrystalMem,通过知识结晶策略恢复能力,在多环境实验中性能优于基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00033 2026-08-04 cs.AI 新提交 57%

SIRIN: A Unified Toolkit for Detecting Contextual Hallucinations in Retrieval-Augmented and Memory-Grounded LLM Systems

SIRIN:用于检测检索增强与记忆基大型语言模型系统中上下文幻觉的统一工具包

Julia Belikova, Rauf Parchiev, Mikhail Filimonov, Konstantin Polev, Andrey Savchenko, Maksim Makarenko

机构 * Sber AI Lab(Sber AI实验室)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 本研究提出SIRIN工具包,整合三类检测器范式与查询可回答性任务,支持多设置下的幻觉检测,可作为长期记忆系统的忠实性门控,源代码公开可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00017 2026-08-04 cs.AI cs.CE 新提交 57%

Memory Reward Inflation in Self-Improving LLM Agents

自改进大语言模型智能体中的记忆奖励膨胀

Mohammad Asadolahi, Amir Amini, Samira Talebi, Amirfarhad Farhadi, Azadeh Zamanifar

机构 * University Of North Texas(北得克萨斯大学) Edge Hill University(边山大学) University of Cincinnati(辛辛那提大学) Iran University of Science and Technology(伊朗科技大学) Islamic Azad University(伊斯兰阿扎德大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 该研究发现自改进大语言模型智能体存在记忆奖励膨胀的“回声差距”问题,提出误差独立性假设(EIA),并通过LUCID算法在BIRD文本到SQL基准上提升了执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15038 2026-08-04 cs.AI 版本更新 57%

LADY: Linear Attention for Autonomous Driving Efficiency without Transformers

LADY:用于自动驾驶效率的线性注意力,无需Transformer

Jihao Huang, Xi Xia, Zhiyuan Li, Tianle Liu, Jingke Wang, Junbo Chen, Tengju Ye

机构 * Udeer AI Zhejiang University(浙江大学) Yuanshi Intelligence(元世智能)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI

AI总结 LADY是首个基于线性注意力的端到端自动驾驶生成模型,通过常数时间与内存复杂度实现高效长时序建模与跨模态交互。

Comments Accepted by IEEE RAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04630 2026-08-04 cs.CY 版本更新 50%

Reflection-Satisfaction Tradeoff: Investigating Impact of Reflection on Student Engagement with AI-Generated Programming Hints

反思与满足度的权衡:探讨反思对学生成就AI生成编程提示的影响

Heeryung Choi, Tung Phung, Mengyan Wu, Adish Singla, Christopher Brooks

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 本研究探讨了反思提示对学生成就AI生成编程提示的影响,发现反思质量与提示满意度呈负相关,强调需重新考虑AI在教育中的训练和评估方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 61 篇

2608.00548 2026-08-04 cs.CV 新提交 89%

DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable

DrawAI:用于生成可编辑光栅图像的智能体基准与工作流

Pu Cao, Qingye Kong, Xuedan Yin, Xuekun Zhao, Rupeng Yan, Qing Song, Yao Zhang, Lu Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 Agent评测 :workflow(title,abstract);agentic(title,abstract);agent(abstract)

AI总结 DrawAI提出图像到可编辑重建任务,构建含DrawAI-Bench基准与DrawAI-Flow工作流的智能体方案,经实验验证DrawAI-Flow可提升可编辑结构,不同模型-harness配置的重建质量与成本差异显著。

Comments Project URL: https://drawai.renaissancemind.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01341 2026-08-04 cs.AI 新提交 88%

402Pilot: An x402 Decision Layer for Autonomous Agent Micropayments

402Pilot:面向自主智能体微支付的x402决策层

Yin Li, Yanbo He, Boo-Ho Yang, Rav Lawana, Ziyue Li, Wei Zeng, Jing Tang, Fugee Tsung

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI

AI总结 针对自主智能体微支付的买方决策问题,提出协议无关的402Pilot决策层,结合PA-DCT策略在402Pilot-Bench基准中验证其自适应采购的有效性,为可编程支付补充买方决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02441 2026-08-04 cs.AI 新提交 87%

Agentic Commerce World: An Auditable and Verifiable Environment for Vibe Commerce

智能体商业世界:一种可审计可验证的氛围式商业环境

Shicheng Fan, Mingdai Yang, Duohao Wang, Canyu Chen, Yongfeng Zhang, Hua Wei, Manling Li, Julian McAuley, Kun Zhang, Philip S. Yu, Kejing Yu, Zhiwei Liu

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) Springbrand(斯普林布兰德公司) Northwestern University(西北大学) Rutgers University(罗格斯大学) Arizona State University(亚利桑那州立大学) University of California San Diego(加州大学圣迭戈分校) Carnegie Mellon University(卡内基梅隆大学) MBZUAI(Mohamed bin Zayed 人工智能大学) Microsoft AI(微软人工智能部门)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究提出智能体商业世界(ACWorld)环境,通过氛围式商业协议(VCP)实现可审计可验证的氛围式商业智能体评估,构建含两类轨道的基准并验证模型性能,分析得出过程级证据对评估智能体的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02470 2026-08-04 cs.CV cs.AI 新提交 85%

Grounding Agentic VLMs with Dedicated Segmentation for Fine-Grained Vehicle Damage Assessment

基于专用分割模型实现具身智能视觉语言模型(Agentic VLMs)的细粒度车辆损伤评估

Vishwajeet Shivaji Hogale, Anjali Pai, Nitya Ravi

机构 * Northeastern University(东北大学)

专题命中 Agent评测 :agentic(title,title_cn);agent(abstract);分类 cs.AI

AI总结 针对VLMs空间定位不可靠问题,本文提出TinyDamage架构,将空间定位委托给专用多任务分割模型,集成至7节点LangGraph智能体流程,在车辆损伤评估中大幅降低报告虚构率。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01042 2026-08-04 cs.SE cs.AI cs.HC cs.LG 新提交 85%

What Could the Agent See at 19:05? Generating Temporal Enterprise Scenarios from Real Research and Replaying Them to Evaluate Agents

智能体在19:05能看到什么?从真实研究生成时间化企业场景并回放以评估智能体

Tezan Sahu, Himani Arora

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本研究提出从真实研究生成时间化企业场景并回放的系统,用于解决现有离线评估智能体仅基于最终静态快照的问题,可在任意时刻评估可插拔智能体。

Comments 6 pages, 3 figures, 4 tables. Accepted as a poster at SERI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏