arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 4753 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 4753 篇

2607.26587 2026-07-30 cs.MA cs.AI 新提交 57%

One Run Is Not an Idea: The Implementation Lottery in Automated Research

一次运行并非一个想法:自动化研究中的实施彩票

Jingjie Ning, Shanshan Zhong, Xiaochuan Li, Ji Zeng, Chenyan Xiong

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 该研究针对自动化研究中存在的“实施彩票”问题,提出想法可靠性审计方法,通过312次分配实验发现实施方差远大于成果重运行方差,表明需多实施证据支撑想法决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25379 2026-07-30 cs.CL 版本更新 57%

StateRAG: Typed State Contracts for Complex Retrieval-Augmented Generation

EfficientGraph-RAG:面向跨任务检索增强生成的结构化检索状态管理

Miaohe Niu, Pengxiang Li, Jingbo Zhu, Tong Xiao

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Tsinghua University, China(清华大学) Kunming University of Science and Technology, China(昆明理工大学) NiuTrans Research, Shenyang, China(沈阳NiuTrans研究院)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL

AI总结 提出EfficientGraph-RAG框架,通过显式定义检索状态(TAM、MARS、SMP三个机制)实现结构化状态管理,在多个基准上提升答案质量并降低大模型token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18634 2026-07-29 cs.CV cs.LG 版本更新 57%

SwiftGS: Episodic Priors for Immediate Satellite Surface Recovery

SwiftGS: 基于事件的先验知识用于即时卫星表面恢复

Rong Fu, Jiekai Wu, Xiaowen Ma, Shiyin Lin, Kangan Qian, Chuang Liu, Simon James Fong

机构 * University of Macau(澳门大学) Juntendo University(顺天堂大学) Tongji University(同济大学) Zhejiang University(浙江大学) University of Florida(佛罗里达大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Juniata College(朱尼亚塔学院)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.LG

AI总结 SwiftGS通过元学习方法实现单次前向传递的3D重建,结合几何-辐射解耦的高斯基元和轻量SDF,降低单场景优化成本,实现高效准确的数字表面模型重建和视图一致渲染。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23693 2026-07-28 cs.AI 新提交 57%

Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV

全局计算,本地物化:稀疏事件键值对的内存契约

Zefeng Cai, Zerui Cai

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究长期智能体键值缓存内存问题,提出语义物化概念,通过实验发现精心措辞的无答案事件可提高恢复率,得出稀疏事件键值对服务的内存契约,指出丢弃源事件无准确性损失不代表其不必要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14952 2026-07-28 cs.LG cs.DC 版本更新 57%

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

LongStraw:在固定GPU预算下超越200万个令牌的长上下文强化学习

Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin

专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.LG

AI总结 研究针对推理上下文长度与强化学习后训练的差距问题,提出LongStraw架构感知执行堆栈,用GRPO优化,在固定GPU预算下实现百万令牌强化学习后训练,通过实验验证了其执行能力。

Comments 44 pages, 10 figures, 11 tables. Code: https://github.com/MindLab-Research/longstraw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21777 2026-07-27 cs.HC cs.AI 新提交 57%

AI-Integrated Scientific Inquiry: A Practice-Centered Vision for Science Education

人工智能集成的科学探究:以实践为中心的科学教育愿景

Arne Bewersdorff, Matias Rojas, Xiaoming Zhai

机构 * AI4STEM Education Center, University of Georgia(AI4STEM教育中心,佐治亚大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 探讨人工智能融入科学教育问题,提出将其视为科学仪器,学生在科学实践中使用,以实现真实探究与培养相关素养。聚焦探究核心介绍相关仪器示例,强调仪器应有反思点,并阐述智能代理人工智能的表示及学生学习基础。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20764 2026-07-24 cs.AI 新提交 57%

ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management

ArbiGraph:用于评估上下文管理的任意可扩展可验证任务图

Pavel Golikov, Evgenii Opryshko, Gennady Pekhimenko, Mark C. Jeffrey

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 ArbiGraph作为基准生成器,将任务表示为带Python求解器的自然语言问题,通过类型化中间状态组合任务。用多种任务类别实例化并评估智能体,发现其在孤立任务和复杂相关任务上表现不同,揭示了单任务评估无法发现的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14502 2026-07-24 cs.AI 版本更新 57%

From Chatbot to Digital Colleague: The Paradigm Shift Toward Persistent Autonomous AI

从聊天机器人到数字同事:向持久自主人工智能的范式转变

Yongheng Zhang, Ziang Liu, Jiaxuan Zhu, Shuai Wang, Xiangqi Chen, Haojing Huang, Jiayi Kuang, Siyu Chen, Ao Shen, Hao Wu, Qiufeng Wang, Qian-Wen Zhang, Junnan Dong, Wenhao Jiang, Ying Shen, Hai-Tao Zheng, Yinghui Li, Di Yin, Xing Sun, Philip S. Yu

专题命中 记忆与上下文管理 :tool use(abstract);分类 cs.AI

AI总结 本文提出LLM从聊天机器人向数字同事的范式转变,通过认知核心(思考型LLM)和工具增强任务执行(OpenClaw工作站系统)两个维度,实现持久工作、状态持久化、可重用技能和自改进能力。

Comments The paper is available on the project website: https://from-chatbot-to-digital-colleague.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14557 2026-07-24 stat.ML cs.LG math.OC 版本更新 57%

Exploiting Exogenous Structure for Sample-Efficient Reinforcement Learning

利用外部结构进行样本高效强化学习

Jia Wan, Sean R. Sinclair, Devavrat Shah, Martin J. Wainwright

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 研究Exo-MDPs这类结构化马尔可夫决策过程,建立离散MDPs等之间的表示等价性,刻画其学习的极小极大遗憾值,证明不同情况下的遗憾值界,表明其解耦样本复杂度,通过实验验证相关见解。

Comments 70 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19616 2026-07-23 cs.LG 新提交 57%

The Mechanism Matters: When Knowledge Graphs Help Reinforcement Learning

机制很重要:知识图谱何时有助于强化学习

Mohammed Sameer Syed

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 研究探讨知识图谱对强化学习的影响,通过对照研究改变任务、机制和质量,发现结构化KG在特定任务上提升样本效率,其价值与知识量有关,安全性取决于机制,为从业者使用KG指导RL提供具体指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18275 2026-07-22 cs.GT cs.AI 新提交 57%

A Calculus of Discernment: Decision-Relevant Insight, Sequence Value, and Forgetting as Higher-Order Learning

一种辨别演算:决策相关洞察、序列价值与遗忘作为高阶学习

Suyash Mishra

机构 * Independent AI Researcher, Zürich, Switzerland(独立AI研究员,瑞士苏黎世)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究在生成式AI丰富候选洞察下,稀缺的辨别、行动及遗忘能力问题。构建围绕特定对象的框架,提出APOHA理论。通过在肥胖治疗决策世界测试,表明自适应遗忘能降决策后悔、优化记忆,价值感知遗忘有优势。

Comments 17 pages, 5 figures. Includes a pre-registered empirical study (30 seeds x 100 iterations) and a reference implementation; a companion interactive demo is available from the author

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12721 2026-07-22 cs.AI 版本更新 57%

The Theory of Mind Utility: Formal Specification of a Mentalizing Mechanism

心智理论效用:心理化机制的形式化规范

Nikolos Gurney, Stacy Marsella

机构 * Institute for Creative Technologies, University of Southern California(南加州大学创意技术研究所) Khoury College of Computer Sciences, Northeastern University(东北大学库里计算机科学学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 提出心智理论效用(ToM-U)框架,通过局部认知世界模型(LEWM)形式化推断他人信念的计算问题,定义结构、推理过程及失败痕迹,区别于贝叶斯心智理论等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17879 2026-07-21 cs.AI 新提交 57%

Exploratory and Assimilating Reflection: Reflective Recall Cycle for Long-term Memory

探索性与同化性反思:用于长期记忆的反思性回忆循环

Ganesh Senrayan, Moyuru Yamada, Ishan Jindal, Kiran Purohit

专题命中 记忆与上下文管理 :autonomous agent(abstract);分类 cs.AI

AI总结 研究基于大语言模型的自主智能体外部记忆问题,提出探索性 - 同化性反思(EAR)框架,结合探索性反思与同化性反思两种机制,提高初始检索性能和样本效率,在长期对话基准上比基线检索器提升检索率达 17.9%,且样本效率高、抗噪声反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17432 2026-07-21 cs.AI 新提交 57%

Intermittent Control Is Not Diluted Control: A Switching Effect in Artificial Agency

间歇控制并非稀释控制:人工智能体中的一种切换效应

Veronique Ziegler

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究自适应智能体在不同定时条件下的调节,发现间歇性预期控制可降低平均调节负担,其效果不受切换调度影响,确定了依赖历史的自适应系统中与设计相关的定时原则,表明间歇性预期控制能减轻长期恢复负担。

Comments 20 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16621 2026-07-21 cs.CL 新提交 57%

From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents

从记忆到技能:基于证据的长期大语言模型智能体协同进化治理

Bo Tang, Yang Zhang, Guomian Zhuang, Wenqiang Wei, Gaoyang Zheng, Lindong Xie, Yanchao Tan, Feiyu Xiong, Qingyu Yang, Edward Chung, Zhiyu li

机构 * University of Science and Technology of China(中国科学技术大学) Hong Kong Polytechnic University(香港理工大学) Fuzhou University(福州大学) Xi’an Jiaotong University(西安交通大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL

AI总结 针对长期大语言模型智能体记忆系统问题,提出无需训练的MSCE框架,将经验组织为多种形式,把证据支持的策略转化为可调用技能,引入反射加权值回填,实验证明其性能优于基线,有跨域转移性和终身进化能力。

Comments Submitted into EMNLP'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16211 2026-07-21 cs.AI 新提交 57%

Accurate and Efficient Long-Term Memory for LLM Agents

用于大语言模型智能体的准确高效长期记忆

Zicheng Zhao, Xinyang Guo, Luyao Lv, Menghan Wang, Ming Li, Shuaicheng Li

机构 * Central China Research Institute for AI Technology(华中人工智能技术研究院) Guangdong Provincial Key Laboratory of Interdisciplinary Research and Application for Data Science, BNU-HKBU United International College, Zhuhai(北京师范大学-香港浸会大学联合国际学院数据科学跨学科研究与应用广东省重点实验室) City University of Hong Kong(香港城市大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究大语言模型智能体长时记忆问题,提出MOSAIC框架,通过实体类型图存储、哈希加速双路径检索和主动冲突检测,提升了准确性和效率,在多项测试中取得更好结果,如准确率提高、冲突检测能力增强且检索延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16276 2026-07-21 quant-ph cs.AI cs.ET cs.NI 新提交 57%

Intelligence-Guided Adaptive Purification for DDoS-Resilient Quantum Networks: A CUDA-Q based Study

面向抗分布式拒绝服务量子网络的智能引导自适应纯化:基于CUDA-Q的研究

Santanu Ganguly

专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.AI

AI总结 研究量子中继器网络在经典控制平面受攻击时自适应控制策略的权衡。开发CUDA-Q/SeQUeNCe联合仿真工作流,对比多种纯化策略,结果表明网络态势感知能通过牺牲原始吞吐量来提高量子网络中合格纠缠传递的保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20799 2026-07-21 cs.CV cs.AI 版本更新 57%

GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling

GroundShot: 通过实体锚定镜头调度实现视觉一致的多镜头长视频生成

Yixuan Lai, Tianjia Shao, Weijia Dou, Siyu Zhu, Jingdong Wang

机构 * Fudan University(复旦大学) Baidu(百度)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 提出GroundShot框架,通过在线构建实体级视觉记忆并调度镜头生成顺序,无需训练即可提升多镜头视频中实体的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01483 2026-07-21 cs.RO cs.AI 版本更新 57%

Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering

VL-KnG:从单目视频构建持久时空知识图谱以实现具身场景理解

Mohamad Al Mdfaa, Svetlana Lukina, Timur Akhtyamov, Arthur Nigmatzyanov, Dmitrii Nalberskii, Sergey Zagoruyko, Gonzalo Ferrer

机构 * Applied AI Institute, Moscow, Russia(莫斯科应用人工智能研究所)

专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.AI

AI总结 VL-KnG通过构建时空知识图谱实现高效具身场景理解,采用LLM驱动的时空对象关联和图增强检索,无需3D重建,支持常数时间推理,优于现有前沿VLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15440 2026-07-20 cs.LG 新提交 57%

Stochastic Reset Pathfinding: Path-Level Regret for Cascading Bandits over Graph Paths

随机重置路径寻找:图路径上级联强盗问题的路径级遗憾

Guni Sharon, Wei Zhang

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 研究随机重置路径寻找(SRP)问题,它在已知有向图上,边成功概率未知。提出 Log - Dijkstra 元算法及 PathUCB、PathTS 实例,给出 PathUCB 路径级遗憾界,实验表明 PathTS 性能佳但有对抗实例,推荐其为实用默认算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14651 2026-07-17 cs.CR cs.AI 新提交 57%

MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents

MemPoison:揭示大语言模型智能体中持久内存威胁和结构盲点

Jifeng Gao, Kang Xia, Yi Zhang, Xiaobin Hong, Mingkai Lin, Xingshen Wei, Wenzhong Li, Sanglu Lu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) NARI Group Corporation/State Grid Electric Power Research Institute, China(国网电力研究院/国电电力集团)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究大语言模型智能体持久内存安全漏洞,提出MemPoison框架,含1227个案例,涵盖多种攻击类型等并评估多个模型系列。引入分类法,揭示防御边界及盲点,主张转向自适应、上下文敏感的内存防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14393 2026-07-17 cs.RO cs.AI 新提交 57%

An offline approach to fNIRS-guided reinforcement learning for robot behavior

一种用于机器人行为的基于fNIRS引导的强化学习的离线方法

Julia Santaniello, Madelaine Brower, Benson Jiang, Donatello Sassaroli, Robert Jacob, Jivko Sinapov

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究利用fNIRS脑信号调节机器人模拟学习的可行性,比较不同交互任务训练的智能体,测试多种增强强化学习算法的方法,发现该框架能有效利用神经信号增强学习,还可离线学习,为特定场景提供替代方案。

Comments Preliminary results

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13475 2026-07-16 cs.RO cs.LG 新提交 57%

Deformable State Estimation for Autonomous Surgical Tissue Retraction Under Partial Observability

部分可观测性下自主手术组织牵开的可变形状态估计

Everest Yang, Skye Thompson, George D. Konidaris

机构 * Brown University(布朗大学)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.LG

AI总结 研究部分可观测下自主手术组织牵开的可变形状态估计问题,提出结合多层感知器与低维PCA潜在表示、用几何感知正则化训练的状态估计器,在二维模拟中评估,结果显示该估计器在多步牵开中性能良好,能支持有效可变形操作。

Comments Accepted to the ICRA 2026 RASEI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12924 2026-07-16 cs.AI 版本更新 57%

Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes

用于参数化动作马尔可夫决策过程的知识与梯度引导强化学习

Jonas Ehrhardt, René Heesch, Oliver Niggemann

机构 * HSU-AI Institute for Artificial Intelligence(HSU人工智能研究所)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究参数化动作马尔可夫决策过程中的强化学习,提出KGRL算法,利用领域知识修剪动作、约束参数空间,结合梯度细化参数,能提供局部解释并提高样本效率,优于现有强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12397 2026-07-15 cs.AI 新提交 57%

Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents

评论家经验库:大语言模型智能体的自进化步骤级置信度估计

Yaopei Zeng, Congchao Wang, JianHang Chen, Nan Wang, Yurui Chang, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Virginia Tech(弗吉尼亚理工大学) Purdue University(普渡大学) Amazon AGI(亚马逊通用人工智能)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究大语言模型智能体的步骤级置信度估计问题,提出自进化评论家框架CEB,其通过积累自身过去判断及后果证据来估计置信度,无需训练和真实步骤标签,在多个基准和主干上校准和排名表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11272 2026-07-14 stat.ML cs.LG 新提交 57%

Long-Memory Reservoir Computing for Data-Scarce Dengue Forecasting

用于数据稀缺的登革热预测的长记忆回声状态网络计算

Rahul Goswami, Shinjini Paul, Palash Ghosh, Tanujit Chakraborty

机构 * Indian Institute of Technology Guwahati(印度理工学院古瓦哈蒂分校) Sorbonne University Abu Dhabi(阿布扎赫大学索邦大学) Leiden University(莱顿大学) Sorbonne University(索邦大学)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.LG

AI总结 针对登革热预测中数据稀缺、序列复杂的问题,提出长记忆回声状态网络计算框架,包含fESN和wESN两个变体,能有效编码长期依赖性,优于统计和深度学习基线,结合共形预测可提供不确定性区间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09714 2026-07-14 cs.AI cs.MA 新提交 57%

Feedback-Coupled Memory Systems in Continuous Time

连续时间中的反馈耦合记忆系统

Stefano Grassi

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究反馈耦合记忆系统,通过基于机制的智能和耦合记忆图过程分别定义未明确的代理更新算子和环境更新算子,推广了离散FCMS稳定性条件等,实现连续时间FCMS实例的李雅普诺夫全局耗散性,数值模拟和验证证实相关结论。

Comments 19 pages, 4 figures. Extends arXiv:2603.11560 to continuous time. Code: github.com/stevefatz95/fcms-continuous

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01063 2026-07-14 cs.AI 版本更新 57%

MindClaw: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention

MindClaw: 用于精确干预的闭环具身心理状态推理

Ruoxuan Zhang, Qiaoqiao Wan, Zhengguang Wang, Chenghao Yu, Hongxia Xie, Jianlong Fu, Wen-Huang Cheng

机构 * Jilin University(吉林大学) Microsoft Asia(微软亚洲) National Taiwan University(国立台湾大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 提出MindClaw框架,通过闭环具身心理状态推理实现精确干预,结合多源输入、信念记忆、认知触发技能和动作生成,在动态环境中优化干预时机。

Comments Extended version of the CVPR 2026 paper *MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents*. This work is in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10332 2026-07-14 cs.AI 版本更新 57%

EmbodiSkill: Skill-Aware Reflection for Self-Evolving Embodied Agents

EmbodiSkill:基于技能的反思以实现自我进化的具身智能体

Ruofei Ju, Xinrui Wang, Xin Ding, Yifan Yang, Hao Wu, Shiqi Jiang, Qianxi Zhang, Hao Wen, Xiangyu Li, Weijun Wang, Kun Li, Yunxin Liu, Haipeng Dai, Wei Wang, Ting Cao

机构 * Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR) Tsinghua University(清华大学人工智能产业研究院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出EmbodiSkill,一种无需训练的具身技能自我进化框架,通过技能感知反思和针对性修订提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05002 2026-07-14 cs.LG 版本更新 57%

Randomized Confidence Bounds for Stochastic Partial Monitoring

随机部分监测的随机置信界

Maxime Heuillet, Ola Ahmad, Audrey Durand

机构 * Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Mila - Québec AI Institute(魁北克人工智能研究所) Thales Digital Solutions (cortAIx lab)(泰勒斯数字解决方案(cortAIx实验室))

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 研究随机结果下的上下文和非上下文部分监测设置,基于确定性置信界随机化引入新策略,扩展遗憾保证,实验表明新策略在多个PM博弈中性能良好,还设计了监测分类系统错误率的用例。

详情

展开后加载摘要…

URL PDF HTML 收藏