arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 4753 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 4753 篇

2606.27499 2026-06-29 cs.CV cs.AI cs.CL 新提交 62%

DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection

DMV-Bench: 通过偶然线索注入诊断长程多模态智能体的视觉记忆

Yujin Tang, Chenming Shang, Ruize Xu, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出首个交互式多模态智能体视觉记忆基准DMV-Bench,基于双编码理论设计DualMem架构,在长链任务中优于现有方法。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27032 2026-06-26 cs.LG cs.AI 新提交 62%

State Representation Matters in Deep Reinforcement Learning: Application to Energy Trading

状态表示在深度强化学习中至关重要:应用于能源交易

Jesper Klicks, Sander Vržina, Vincent François-Lavet

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究深度强化学习中状态表示对抽水蓄能交易策略的影响,发现结合绝对价格、相对价格和预测特征能显著提升跨市场迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15877 2026-06-26 cs.AI cs.CL cs.MA 版本更新 62%

Experience Compression Spectrum: Unifying Memory, Skills, and Rules in LLM Agents

经验压缩光谱:在LLM代理中统一记忆、技能和规则

Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对LLM代理长期多会话部署中经验管理效率问题,提出经验压缩光谱框架,统一记忆、技能和规则的压缩轴,解决压缩适应性和跨层级压缩缺失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25361 2026-06-25 cs.CL cs.AI cs.IR 新提交 62%

Memory Makes the Difference: Evaluating How Different Memory Roles Shape Conversational Agents

记忆决定差异:评估不同记忆角色如何塑造对话代理

Yuxin Wang, Paul Thomas, Zhiwei Yu, Yuan Gao, Saeed Hassanpour, Soroush Vosoughi, Robert Sim, Nick Craswell

机构 * Dartmouth College(达特茅斯学院) Microsoft(微软公司)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出对话记忆细粒度分类法,通过用户中心评估框架,揭示不同类型记忆(如澄清记忆、无关记忆)对RAG对话系统响应准确性、个性化及主题相关性的差异化影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25200 2026-06-25 cs.LG cs.AI 新提交 62%

A Hybrid CNN-LSTM Intrusion Detection Framework for Cybersecurity in Smart Renewable Energy Grids

面向智能可再生能源电网网络安全的混合CNN-LSTM入侵检测框架

Sajib Debnath, Remon Das

机构 * O&M Analytics(O&M分析) AES Clean Energy(AES清洁能源) The AES Corporation(AES公司) Renewable Infrastructure(可再生能源基础设施) Dominion Energy(Dominion能源)

专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出混合CNN-LSTM入侵检测框架,结合CNN空间特征提取与LSTM时序建模,解决多步攻击时序建模不足、类不平衡和泛化性差问题,在CICIDS-2017和NSL-KDD上精度达98.2%以上,并实现低延迟实时推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03785 2026-06-25 cs.CL cs.AI 版本更新 62%

Membox: Weaving Topic Continuity into Long-Range Memory for LLM Agents

Membox: 将主题连续性编织到LLM智能体的长期记忆中

Dehao Tao, Guoliang Ma, Yongfeng Huang, Minghu Jiang

机构 * Tsinghua University(清华大学) Xinjiang University(新疆大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出Membox层次记忆架构,通过主题织机按局部主题组织对话,并通过轨迹织机跨会话链接宏主题轨迹,在LoCoMo和DialSim上显著提升长程记忆检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03867 2026-06-24 cs.CL cs.AI 版本更新 62%

A Training-Free Mixture-of-Agents Framework for Multi-Document Summarization using LLMs and Knowledge Graphs

一种基于LLM和知识图谱的无训练混合智能体框架用于多文档摘要

Cuong Vuong Tuan, Trang Mai Xuan, Tien-Cuong Nguyen, Vu-Duc Ngo, Thien Van Luong

机构 * Faculty of Artificial Intelligence and Data Science, Phenikaa University(人工智能与数据科学学院,泛尼克大学) VNPT AI, VNPT Group(VNPT AI,VNPT集团) MobiFone Research and Development Center, MobiFone Corporation(MobiFone研发与开发中心,MobiFone公司) Business AI Lab, Faculty of Data Science and Artificial Intelligence, National Economics University, College of Technology(商业人工智能实验室,数据科学与人工智能学院,国家经济大学,技术学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种无需训练、结合大语言模型和知识图谱的混合智能体框架,通过分解摘要任务为专用智能体(抽取、知识感知抽象、迭代精炼)并利用多视角一致性机制,在英文和越南语数据集上取得领先性能。

Comments Accepted by Neural Computing and Applications

Journal ref Neural Comput & Applic 38, 538 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22953 2026-06-23 cs.AI cs.CL 新提交 62%

Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents

计划不会持久:为什么上下文管理对LLM代理至关重要

Aman Mehta, Anupam Datta

机构 * Snowflake AI Research(Snowflake AI研究)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过重放配对诊断和压缩压力测试,证明标准LLM代理不将计划作为持久状态携带,而是依赖上下文中的计划,并揭示了推理模型的推理痕迹混淆问题。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22692 2026-06-23 cs.AI cs.CL cs.DB cs.IR 新提交 62%

VISTA Architect: A graph database-oriented health AI system demonstrated in multidisciplinary tumor boards

VISTA Architect:一种面向图数据库的健康AI系统,在多学科肿瘤委员会中展示

Tuomo Kiiskinen, Jason Fries, Philip Adamson, David Wu, Timothy John Ellis-Caleo, Aaron Fanous, Balasubramanian Narasimhan, Joel Neal, Sylvia Plevritis, Manuel A. Rivas

机构 * Department of Biomedical Data Science, Stanford University School of Medicine(斯坦福大学医学院生物医学数据科学系) Department of Medicine, Stanford University School of Medicine(斯坦福大学医学院医学系)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出VISTA Architect架构,通过图数据库和LLM将EHR转化为持久知识图谱,解决长上下文提示和RAG的时序缺失与高成本问题,在胸科肿瘤委员会中实现96.4%准确率。

Comments 22 pages, 4 figures, 6 tables; includes Supplementary Information. Code: https://github.com/VISTA-Stanford/vista-architect (tag v0.1.0-preprint, commit 8837d44)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22330 2026-06-23 cs.AI cs.SE 新提交 62%

Hypothesis-Driven Skill Optimization for LLM Agents

假设驱动的技能优化用于LLM智能体

Fangxin Shang, Yehui Yang

机构 * AI Lab, Qifu Technology(奇富科技人工智能实验室)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出HDSO框架,通过可证伪假设与验证机制从稀疏轨迹中提取可靠技能,无需训练,在ALFWorld上提升平均成功率6.9-7.1个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21024 2026-06-23 cs.AI cs.CY cs.LG cs.MA 新提交 62%

Negative Knowledge as Failure-aware Shared Memory for AutoResearch

作为自动研究失败感知共享记忆的负面知识

Hanchun Wang

机构 * Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出负面知识记忆层,通过策展代理将失败尝试转化为共享库中的记录,供研究代理采纳或拒绝,在ScienceAgentBench和PDE问题上提升性能并减少令牌使用。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20638 2026-06-23 cs.AI cs.LG 新提交 62%

RIZZ: Routing Interactions to Near Zero-Interference Zones for Continual Adaptation of Black-Box Agents

RIZZ: 将交互路由到近零干扰区域以实现黑盒智能体的持续适应

Sonali Goel, Pranav Vaidhyanathan, Lucas Schorling, Natalia Ares, Maike Osborne

机构 * University of Oxford(牛津大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出RIZZ框架,通过验证器门控记忆、路由和提示编译,实现黑盒语言模型系统在非平稳流数据上的持续适应,有效控制干扰并提升性能。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20571 2026-06-23 cs.CL cs.AI 新提交 62%

Less is More: Lightweight Prompt Compression for Question Answering Applications on Edge Devices

少即是多:面向边缘设备问答应用的轻量级提示压缩

Zihuai Xu, Ruofei Hou, Yang Xu, Hongli Xu, Yunming Liao, Ying Zhu

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出CORE,一种无需辅助语言模型的两阶段句子级提示压缩方法,通过NER和语义匹配构建答案集与线索集,结合正交残差检索和空间邻近度过滤,在边缘设备上显著提升准确率、降低内存和能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15678 2026-06-23 cs.LG cs.AI 新提交 62%

The Reservoir Attention Network: Cross-Pass State in Pretrained Transformers via Content-Addressable Reservoir Injection

储层注意力网络:通过内容可寻址储层注入在预训练Transformer中的跨前向传播状态

Emma Leonhart

机构 * Emma Leonhart

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出储层注意力网络(RAN),通过在预训练Transformer中间层注入固定随机储层来携带跨前向传播状态,实验表明未训练的循环动态足以传递可用状态。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18829 2026-06-18 cs.LG cs.CL 新提交 62%

GateMem: Benchmarking Memory Governance in Multi-Principal Shared-Memory Agents

GateMem:多主体共享内存代理中的内存治理基准

Zhe Ren, Yibo Yang, Yimeng Chen, Zijun Zhao, Benshuo Fu, Zhihao Shu, Bingjie Zhang, Yangyang Xu, Dandan Guo, Shuicheng Yan

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Shanghai Jiao Tong University(上海交通大学) King Abdullah University of Science and Technology (KAUST)(卡尔斯鲁厄大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL、cs.LG

AI总结 提出GateMem基准,评估多主体共享内存代理在效用、访问控制和遗忘三方面的治理能力,发现现有方法无法同时满足三者。

Comments 24 pages, 8 figures. Code and dataset are available at https://github.com/rzhub/GateMem and https://huggingface.co/datasets/Ray368/GateMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17398 2026-06-17 cs.CR cs.AI cs.SE 新提交 62%

SoK: AI-Augmented Binary Reversing

SoK: AI增强的二进制逆向工程

Yujeong Kwon, Yiyue Zhang, Shakhzod Yuldoshkhujaev, Kexin Pei, Dokyung Song, Hyungjoon Koo

机构 * Sungkyunkwan University(成均馆大学) The University of Chicago(芝加哥大学) Yonsei University(延世大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 系统化梳理AI增强二进制逆向工程领域,提出统一分类法涵盖传统与AI方法,揭示LLM和智能体AI的新角色,识别技术挑战与评估缺口。

Comments 20 pages, 7 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11837 2026-06-17 cs.CL cs.AI 版本更新 62%

EmoFSM: A Finite State Machine for Emotional Support Conversation

EmoFSM:一种用于情感支持对话的有限状态机

Yue Zhao, Qingqing Gu, Xiaoyu Wang, Teng Chen, Zhonglin Jiang, Yong Chen, Hongyan Li, Luo Ji

机构 * Geely AI Lab(吉利人工智能实验室)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.CL

AI总结 针对情感支持对话中长期满意度不足的问题,提出EmoFSM框架,利用有限状态机引导大语言模型进行规划与自我推理,在多个数据集上优于多种基线方法。

Comments 15 pages, 4 figures. PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21312 2026-06-16 cs.DC cs.AI cs.LG 版本更新 62%

Frontier: Towards Comprehensive and Accurate LLM Inference Simulation

Frontier: 向全面且准确的LLM推理模拟迈进

Yicheng Feng, Xin Tan, Yangtao Deng, Yimin Jiang, Yibo Zhu, Hong Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Anuttacon StepFun

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Frontier,一种用于现代LLM推理服务的离散事件模拟器,通过离散化抽象和对关键运行时优化的建模,实现了对复杂工作负载的准确预测,从而在不同服务场景中提供更精确的计算、通信和内存成本预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18227 2026-06-16 cs.LG cs.AI 版本更新 62%

Token Reduction Should Go Beyond Efficiency in Generative Models -- From Vision, Language to Multimodality

Token缩减应超越生成模型中的效率——从视觉、语言到多模态

Zhenglun Kong, Yize Li, Fanhu Zeng, Lei Xin, Shvat Messica, Xue Lin, Pu Zhao, Manolis Kellis, Hao Tang, Marinka Zitnik

机构 * Harvard University(哈佛大学) Northeastern University(东北大学) CAS(中国科学院) Wuhan University(武汉大学) MIT(麻省理工学院) Peking University(北京大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Token缩减应超越传统效率优化,成为生成模型的基础原则,通过减少冗余token来促进多模态融合、缓解幻觉、维持长输入连贯性并提升训练稳定性。

Comments Project page: https://github.com/ZLKong/Awesome-Collection-Token-Reduction

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31514 2026-06-12 cs.CL cs.AI cs.CY 版本更新 62%

If LLMs Have Human-Like Attributes, Then So Does Age of Empires II

如果LLM具有类人属性,那么《帝国时代II》也具有

Adrian de Wynter

机构 * Microsoft(微软公司) The University of York(约克大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 通过训练简单神经网络于《帝国时代II》,论证LLM的拟人属性在经验上非唯一,提出应假设LLM非独特性而非拟人属性来设计实验。

Comments Fixed corollary 1, added stat sig

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10315 2026-06-10 cs.CL cs.AI 新提交 62%

Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents

捕捉五分之一:LLM作为评判员在生产环境多轮交易代理中的盲点

Sawyer Zhang, Alexander Wang, Sophie Lei

机构 * Lumivate (Lumi)(Lumivate(Lumi))

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究部署的餐饮订购代理中LLM评判员对真实缺陷的召回率,发现其仅捕获22%的系统性问题,主要因评分标准缺乏状态跟踪等行为维度,且路由机制导致缺陷被错误分类。

Comments 13 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09483 2026-06-09 cs.CL cs.AI 新提交 62%

Memory Beyond Recall: A Dual-Process Cognitive Memory System for Self-Evolving LLM Agents

超越回忆的记忆:用于自进化LLM代理的双过程认知记忆系统

Tianxiang Fei, Mingyang Song, Mao Zheng, Xiang Yu

机构 * Tencent(腾讯)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出DCPM系统,基于双过程理论将代理记忆组织为认知能力层次,通过同步日间写入器和异步夜间引擎分别处理信念修正和模式归纳,在隐式跨会话推理任务上提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28831 2026-06-09 cs.CL cs.AI 版本更新 62%

S3Mem: Structured Spatiotemporal Scene-Event Memory for Long-Horizon Interactive Question Answering

S3Mem:用于长时域交互式问答的结构化时空场景-事件记忆

Encheng Su, Jianyu Wu, Jinouwen Zhang, Qiucheng Yu, Chen Tang, Pengze Li, Lintao Wang, Aoran Wang, Xinzhu Ma, Shixiang Tang, Yizhou Wang, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) The University of Sydney(悉尼大学) Beihang University(北航)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出S3MEM框架,通过结构化场景-事件记忆和锚点敏感检索,在长时域交互式问答中实现比通用记忆接口更优的准确率-效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16309 2026-06-09 cs.AI cs.LG cs.MA 版本更新 62%

ANNEAL: Adapting LLM Agents via Governed Symbolic Patch Learning

ANNEAL:通过受控符号补丁学习适应大语言模型代理

Safayat Bin Hakim, Keyan Guo, Wenkai Tan, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) University at Buffalo(布法罗大学) University of Colorado Boulder(科罗拉多大学博尔德分校) University of Colorado Colorado Springs(科罗拉多大学科罗拉多州立分校)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 ANNEAL通过受控符号补丁学习适应大语言模型代理,解决重复故障问题,其核心机制FDKA能定位责任操作符并生成类型补丁,实现持久结构修复,优于现有方法。

Comments Code Implementation: https://github.com/sbhakim/anneal-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16346 2026-06-09 cs.CL cs.LG 版本更新 62%

Helpful to a Fault: Measuring Illicit Assistance in Multi-Turn, Multilingual LLM Agents

有益于故障:测量多轮、多语言LLM代理中的非法协助

Nivya Talokar, Ayush K Tarun, Murari Mandal, Maksym Andriushchenko, Antoine Bosselut

机构 * EPFL(苏黎世联邦理工学院) independent(独立研究员) tubingen(图宾根大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出STING框架,用于评估多轮多语言LLM代理在执行非法任务时的协助能力,发现低资源语言中攻击成功率不一致,提供实际部署中的压力测试方法。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08235 2026-06-09 cs.CL cs.AI cs.CR 版本更新 62%

When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents

当良性输入导致严重危害:引发计算机使用代理的不安全意外行为

Jaylen Jones, Zhehao Zhang, Yuting Ning, Eric Fosler-Lussier, Pierre-Luc St-Charles, Yoshua Bengio, Dawn Song, Yu Su, Huan Sun

机构 * DeepMind, London, UK(深度Mind,伦敦,英国) Stanford University, Stanford, CA, USA(斯坦福大学,斯坦福,加利福尼亚州,美国) UC Berkeley, Berkeley, CA, USA(加州大学伯克利分校,伯克利,加利福尼亚州,美国)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出AutoElicit框架,通过迭代扰动良性指令并利用CUA执行反馈,自动引发前沿CUAs(如Claude 4.5 Haiku等)的数百种有害意外行为,并验证其跨模型可迁移性。

Comments ICML 2026, Project Homepage: https://osu-nlp-group.github.io/AutoElicit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05513 2026-06-05 cs.AI cs.CL 62%

EpiEvolve: Self-Evolving Agents for Streaming Pandemic Forecasting under Regime Shifts

EpiEvolve:用于制度转变下流式疫情预测的自演化智能体

Yiming Lu, Sihang Zeng, Zhengxu Tang, Max Lau, Fei Liu, Wei Jin

机构 * Emory University(埃默里大学) University of Washington(华盛顿大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对流式疫情预测中标签延迟和制度转变问题,提出自演化智能体EpiEvolve,通过层次化情景记忆、延迟标签反思和制度感知检索,在COVID-19住院趋势预测中达到0.629准确率,并将制度转变后的恢复滞后从5周缩短至2周。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01619 2026-06-04 cs.LG cs.AI 62%

SUSD: Structured Unsupervised Skill Discovery through State Factorization

SUSD: 通过状态分解的结构化无监督技能发现

Seyed Mohammad Hadi Hosseini, Mahdieh Soleymani Baghshah

机构 * Department of Computer Engineering(计算机工程系)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出SUSD框架,通过将状态空间分解为独立组件并分配不同技能变量,结合动态模型自适应引导探索,实现更丰富多样的无监督技能发现,并在分解环境中显著优于现有方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.00634 2026-06-04 cs.LG cs.AI cs.RO cs.SY eess.SY math.OC 62%

PFAx: Predictable Feature Analysis to Perform Control

PFAx:可预测特征分析用于控制

Stefan Richthofer, Laurenz Wiskott

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 PFAx通过整合补充信息提升预测性能,并透明展示补充信息对特征选择的影响,应用于强化学习环境中的智能体控制优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
1509.03044 2026-06-04 cs.LG cs.AI cs.SY eess.SY 62%

Recurrent Reinforcement Learning: A Hybrid Approach

递归强化学习:一种混合方法

Xiujun Li, Lihong Li, Jianfeng Gao, Xiaodong He, Jianshu Chen, Li Deng, Ji He

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合模型,结合监督学习和强化学习,用于部分可观测任务的状态表示学习,在极少领域知识下有效。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏