arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 35504 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 35504 篇

2605.00424 2026-05-18 cs.CR cs.AI cs.MA cs.SE 81%

Skills as Verifiable Artifacts: A Trust Schema and a Biconditional Correctness Criterion for Human-in-the-Loop Agent Runtimes

技能作为可验证的成果:为有人参与的代理运行时的可信架构和双向正确性标准

Alfredo Metere

机构 * Enclawed, LLC(Enclawed公司)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出了一种可信架构和双向正确性标准,用于人类参与的代理运行时,强调技能验证的重要性,以确保运行时的可信性和可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15198 2026-05-15 cs.CV cs.AI cs.CL 81%

ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both

ATLAS:是代理还是潜在的视觉推理?一个词足以兼顾两者

Ziyu Guo, Rain Liu, Xinyan Chen, Pheng-Ann Heng

机构 * Meta AI The Chinese University of Hong Kong(香港中文大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 ATLAS结合代理推理与潜在推理,通过单一功能词实现两者结合,避免冗长中间视觉生成,保持与传统训练方法兼容。

Comments Project Page: https://atlas-oneword.github.io Code: https://github.com/ZiyuGuo99/ATLAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14443 2026-05-15 cs.AI cs.LG cs.MA 81%

Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience

多步推理和工具使用中黑盒LLM的提示策略:基于经验迭代蒸馏的强化学习框架

Krishna Sayana, Ketan Todi, Ambarish Jash

机构 * Google Research(谷歌研究)

专题命中 规划决策 :tool-use(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于经验迭代蒸馏的强化学习框架,用于训练提示策略以提升黑盒LLM的多步推理和工具使用能力,实验显示在逻辑推理和工具使用任务中性能显著提升。

Comments 10 pages and reference, appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13101 2026-05-14 cs.LG cs.AI 81%

Margin-calibrated Classifier Guidance for Property-driven Synthesis Planning

基于边界的分类器引导的属性驱动合成规划

Najwa Laabid, Vikas Garg

机构 * Aalto University(阿alto大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Sequence Completion Ranking方法,通过对比论证和边界损失校准分类器,提升合成规划中满足特定约束的反应序列生成效率,显著提高多步求解率和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10488 2026-05-12 cs.CL cs.AI 81%

DeepRefine: Agent-Compiled Knowledge Refinement via Reinforcement Learning

DeepRefine: 通过强化学习进行代理编译知识的精炼

Haoyu Huang, Jiaxin Bai, Shujie Liu, Yang Wei, Hong Ting Tsang, Yisen Gao, Zhongwei Xie, Yufei Li, Yangqiu Song

机构 * HKUST(香港科技大学) HKBU(香港大学) Microsoft Research Asia Hong Kong(微软亚洲研究院(香港))

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 DeepRefine是一种基于LLM的推理模型,通过用户查询提升预构建知识库的质量,以适应下游任务。该模型通过多轮交互和归纳诊断定位缺陷并进行针对性精炼,采用Gain-Beyond-Draft奖励机制进行强化学习训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10268 2026-05-12 cs.CL cs.AI 81%

MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading

MemReread: 通过记忆引导重读增强代理长上下文推理

Baibei Ji, Xiaoyang Weng, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang

机构 * Soochow University(苏州大学) Peking University(北京大学)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 MemReread通过记忆引导重读机制,在线性处理文档片段时避免二次检索,实现非线性推理并保持文档理解的逻辑流,通过强化学习框架提升长上下文推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09315 2026-05-12 cs.AI cs.CL 81%

Do Self-Evolving Agents Forget? Capability Degradation and Preservation in Lifelong LLM Agent Adaptation

自我进化代理会遗忘吗?在终身大语言模型代理适应中的能力退化与保持

Ye Yu, Xiaopeng Yuan, Haibo Jin, Heming Liu, Yaoning Yu, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agent(title);workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨了自我进化过程中能力退化现象,提出能力保持进化原则,通过四种进化维度提升能力稳定性与适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02450 2026-05-12 cs.RO cs.AI cs.LG 81%

CHARMS: A Cognitive Hierarchical Agent for Reasoning and Motion Stylization in Autonomous Driving

CHARMS:用于自动驾驶中的推理与运动风格化的认知层次代理

Jingyi Wang, Duanfeng Chu, Zejian Deng, Liping Lu, Jinxiang Wang, Chen Sun

机构 * School of Mechanical and Electronic Engineering, Wuhan University of Technology(武汉理工大学机械与电子工程学院) Intelligent Transportation Systems Research Center, Wuhan University of Technology(武汉理工大学智能交通系统研究所) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Mechanical Engineering, Southeast University(东南大学机械工程学院)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 CHARMS通过强化学习预训练和监督微调pipeline,实现人类般的决策行为和交互真实性,同时利用泊松认知层次理论生成多样化驾驶场景。

Journal ref ITSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09218 2026-05-12 cs.CV cs.AI cs.LG cs.RO 81%

Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models

Flame3D: 无需3D特定训练的3D场景零样本组合推理

Sagar Bharadwaj, Ziyong Ma, Anurag Ghosh, Srinivasan Seshan, Anthony Rowe

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 Flame3D通过可组合的空间工具和训练自由框架,实现3D场景的零样本组合推理,支持动态空间合成和外部数据整合,展示了在ScanQA和Compose3D上的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10872 2026-05-12 cs.RO cs.AI cs.CL 81%

REI-Bench: Can Embodied Agents Understand Vague Human Instructions in Task Planning?

REI-Bench: 体感代理能否在任务规划中理解模糊的人类指令?

Chenxi Jiang, Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, School of Mechanical and Aerospace Engineering(MARS实验室,机械与航空航天工程学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 本文研究模糊参照表达对LLM任务规划的影响,提出REI-Bench基准,发现模糊性会显著降低机器人规划性能,提出任务导向上下文认知方法提升表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09629 2026-05-11 cs.AI cs.LG 81%

End-to-end PDDL Planning with Hardcoded and Dynamic Agents

端到端PDDL规划与硬编码和动态智能体

Emanuele La Malfa, Ping Zhu, Samuele Marro, Sara Bernardini, Michael Wooldridge

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Engineering, University of Oxford(牛津大学工程系)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个端到端框架,通过验证器支持规划。协调器接收自然语言规范,转换为PDDL模型,子模块(智能体)迭代优化规划需求。支持硬编码和动态智能体,最终计划转换为自然语言。

Comments Code: https://github.com/EmanueleLM/MultiAgentPlanning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07248 2026-05-11 cs.CL cs.LG 81%

PaT: Planning-after-Trial for Efficient Test-Time Code Generation

PaT:在试后进行规划以实现高效的测试时间代码生成

Youngsik Yoon, Sungjae Lee, Seockbean Song, Siwei Wang, Wei Chen, Jungseul Ok

机构 * Department of Computer Science and Engineering, POSTECH, South Korea(韩国POSTECH计算机科学与工程系) Graduate School of Artificial Intelligence, POSTECH, South Korea(韩国POSTECH人工智能研究生院) Microsoft Research Asia, Beijing, China(中国北京微软亚洲研究院)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出PaT方法,通过在试后规划来提高测试时间代码生成的效率,采用异构模型配置在多个基准和模型家族中显著提升了成本性能帕累托前沿。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06717 2026-05-11 cs.SE cs.AI 81%

Agentic Coding Needs Proactivity, Not Just Autonomy

代理编码需要主动性,而非仅仅自主性

Nghi D. Q. Bui, Georgios Evangelopoulos

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨了软件开发中代理编码的主动性与自主性区别,提出主动性分类和评估标准,旨在提升编码代理的洞察力和适应性。

Comments Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06642 2026-05-08 cs.CL cs.AI 81%

StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction

StraTA: 通过战略轨迹抽象激励代理强化学习

Xiangyuan Xue, Yifan Zhou, Zidong Wang, Shengji Tang, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Georgia(佐治亚大学) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出StraTA框架,通过引入显式的轨迹级策略提升代理强化学习的样本效率和最终性能,实验显示其在ALFWorld、WebShop和SciWorld上均优于基线模型。

Comments 26 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06040 2026-05-08 cs.AI cs.CL 81%

Novelty-based Tree-of-Thought Search for LLM Reasoning and Planning

基于新颖性的树状思维搜索用于大语言模型推理与规划

Leon Hamm, Zlatan Ajanovic

机构 * RWTH Aachen(亚琛工业大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于新颖性的树状思维搜索方法,通过引入新颖性概念优化语言领域推理与规划任务,减少搜索范围和token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13682 2026-04-30 cs.AI cs.CL 81%

ChinaTravel: An Open-Ended Travel Planning Benchmark with Compositional Constraint Validation for Language Agents

ChinaTravel: 一个带有组合约束验证的开放旅行规划基准,用于语言代理

Jie-Jing Shao, Bo-Wen Zhang, Xiao-Wen Yang, Baizhi Chen, Si-Yu Han, Jinghao Pang, Wen-Da Wei, Guohao Cai, Zhenhua Dong, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University, China(南京大学智能科学与技术学院) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) Noah’s Ark Lab, Huawei, China(华为诺亚实验室)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 ChinaTravel通过开放数据集和组合通用领域语言,提升语言代理在复杂真实场景中的约束满足能力,实现37%的约束满足率,比纯神经模型提升10倍。

Comments ICLR 2026. Webpage: https://www.lamda.nju.edu.cn/shaojj/chinatravel

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24005 2026-04-30 cs.LG cs.AI 81%

TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents

TCOD:探索在线蒸馏在多轮自主代理中的时间课程

Jiaqi Wang, Wenhao Zhang, Weijie Shi, Yaliang Li, James Cheng

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 规划决策 :autonomous agent(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TCOD框架,通过时间课程策略缓解在线蒸馏在多轮任务中的KL不稳定性,提升代理性能,实验显示性能提升达18个百分点,甚至超越教师模型。

Comments Update code, model weight

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14248 2026-04-29 cs.AI cs.CL 81%

Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective

为什么基于大语言模型的网络代理会失败?一种分层规划视角

Mohamed Aghzal, Gregory J. Stein, Ziyu Yao

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 本文从分层规划角度分析了LLM网络代理失败原因,发现低层执行是主要瓶颈,改进感知接地和自适应控制对实现人类可靠性至关重要。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24473 2026-04-28 cs.AI cs.CL 81%

Agentic clinical reasoning over longitudinal myeloma records: a retrospective evaluation against expert consensus

基于纵向骨髓瘤记录的代理临床推理:一项回顾性评估与专家共识的对比

Johannes Moll, Jannik Lübberstedt, Christoph Nuernbergk, Jacob Stroh, Luisa Mertens, Anna Purcarea, Christopher Zirn, Zeineb Benchaaben, Fabian Drexel, Hartmut Häntze, Anirudh Narayanan, Friedrich Puttkammer, Andrei Zhukov, Jacqueline Lammert, Sebastian Ziegelmayer, Markus Graf, Marion Högner, Marcus Makowski, Florian Bassermann, Lisa C. Adams, Jiazhen Pan, Daniel Rueckert, Krischan Braitsch, Keno K. Bressem

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital(人工智能在医疗与健康中的研究所,慕尼黑技术大学(TUM)及慕尼黑技术大学医院) Department of Diagnostic and Interventional Radiology, Klinikum rechts der Isar, TUM University Hospital, School of Medicine and Health, Technical University of Munich(诊断与介入放射科,莱茵河右岸医院,慕尼黑技术大学医院,医学与健康学院,慕尼黑技术大学) Department of Cardiovascular Radiology and Nuclear Medicine, German Heart Center, TUM University Hospital, School of Medicine and Health, Technical University of Munich(心血管放射学与核医学科,德国心脏中心,慕尼黑技术大学医院,医学与健康学院,慕尼黑技术大学) Department of Medicine III, Klinikum rechts der Isar, TUM University Hospital, School of Medicine and Health, Technical University of Munich(第三医学部,莱茵河右岸医院,慕尼黑技术大学医院,医学与健康学院,慕尼黑技术大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本研究评估了代理推理系统在骨髓瘤长期记录中的表现,发现其在复杂问题和长记录中优于传统方法,但需进一步验证以确保临床应用的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23210 2026-04-28 cs.AI cs.CL 81%

Discovering Agentic Safety Specifications from 1-Bit Danger Signals

从1位危险信号中发现代理安全规范

Víctor Gallego

机构 * Komorebi AI

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出EPO-Safe框架,通过经验优化使LLM在仅接收二进制危险信号的情况下发现安全规范,展示LLM能在贫乏信号中进行安全推理,并验证了安全反思需配合专用安全通道以避免奖励黑客问题。

Comments Accepted to the Adaptive and Learning Agents Workshop (ALA 2026) @ AAMAS 2026. Code is available at github.com/vicgalle/experiential-prompt-optimization-safe

Journal ref Proc. of the Adaptive and Learning Agents Workshop (ALA 2026) @ AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02548 2026-04-28 cs.LG cs.AI 81%

Planning Under Observation Mismatch for Traffic Signal Control via Adaptive Modular World Models

基于观测不匹配的交通信号控制的适应性模块化世界模型规划

Zherui Huang, Yicheng Liu, Chumeng Liang, Guanjie Zheng

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出适应性模块化模型,用于解决观测不匹配下的交通信号控制问题,通过模块化规划架构提升性能和数据效率。

Comments Accepted by ICAPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21253 2026-04-24 cs.CL cs.AI 81%

Planning Beyond Text: Graph-based Reasoning for Complex Narrative Generation

超越文本的规划:基于图的复杂叙事生成推理

Hanwen Gu, Chao Guo, Junle Wang, Wenda Xie, Yisheng Lv

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Turing Lab(腾讯人工智能实验室)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出PLOTTER框架,通过结构图进行叙事规划,提升LLM在复杂叙事生成中的长上下文推理能力。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20179 2026-04-23 cs.CR cs.AI cs.SE 81%

Taint-Style Vulnerability Detection and Confirmation for Node.js Packages Using LLM Agent Reasoning

基于LLM代理推理的Node.js包污点式漏洞检测与验证

Ronghao Ni, Mihai Christodorescu, Limin Jia

机构 * Carnegie Mellon University(卡内基梅隆大学) Google(谷歌)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出LLMVD.js,通过LLM代理实现Node.js包的污点式漏洞检测与验证,有效率达84%,优于传统方法,无需注解或报告。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18715 2026-04-22 cs.CL cs.AI 81%

Characterizing AlphaEarth Embedding Geometry for Agentic Environmental Reasoning

表征AlphaEarth嵌入几何用于代理环境推理

Mashrekur Rahman, Samuel J. Barrett, Christina Last

机构 * Dartmouth Libraries(达特茅斯图书馆) Dartmouth College(达特茅斯学院)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文研究AlphaEarth嵌入几何结构,开发代理系统用于环境推理,发现其非欧几里得特性及检索优于线性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18463 2026-04-21 cs.AI cs.LG cs.RO 81%

Using large language models for embodied planning introduces systematic safety risks

使用大型语言模型进行具身规划引入了系统性的安全风险

Tao Zhang, Kaixian Qu, Zhibin Li, Jiajun Wu, Marco Hutter, Manling Li, Fan Shi

机构 * ETH Zurich(苏黎世联邦理工学院) University College London(伦敦大学学院) Stanford University(斯坦福大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究评估了大型语言模型在机器人规划中的安全性,发现即使规划能力高,安全风险仍显著存在,揭示了规划能力与安全意识之间的乘法关系。

Comments Project page: https://despite-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11407 2026-04-21 cs.CL cs.AI 81%

Retrieval as Generation: A Unified Framework with Self-Triggered Information Planning

检索即生成:一个统一框架与自触发信息规划

Bo Li, Mingda Wang, Gexiang Fang, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) School of Computer Science, Peking University(北京大学计算机学院) School of Health Sciences and Biomedical Engineering, Hebei University of Technology(河北工业大学健康科学与生物医学工程学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 GRIP框架通过生成引导检索与信息规划,实现检索与推理的紧密耦合,支持动态多步推理,实验表明其在问答基准上优于RAG基线并接近GPT-4o。

Comments Github: https://github.com/WisdomShell/GRIP HuggingFace:https://huggingface.co/collections/WisdomShell/grip

Journal ref ACL2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16585 2026-04-21 cs.LG cs.AI 81%

The Global Neural World Model: Spatially Grounded Discrete Topologies for Action-Conditioned Planning

全局神经世界模型:用于动作条件规划的空间接地离散拓扑

Noureddine Kermiche

机构 * Western Digital Corporation(西部数据公司)

专题命中 规划决策 :planning(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出全局神经世界模型,通过平衡的连续熵约束实现拓扑量化,采用连续动作条件联合嵌入预测架构,将环境映射到离散2D网格,防止流形漂移,通过最大熵探索学习通用过渡动态。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13541 2026-04-20 cs.NE cs.AI cs.LG cs.RO 81%

Scalable Multi-Task Learning through Spiking Neural Networks with Adaptive Task-Switching Policy for Intelligent Autonomous Agents

通过具有自适应任务切换策略的脉冲神经网络实现可扩展的多任务学习用于智能自主代理

Rachmad Vidya Wicaksana Putra, Avaneesh Devkota, Muhammad Shafique

机构 * eBRAIN Lab, New York University (NYU) Abu Dhabi(eBRAIN实验室,纽约大学(NYU)阿布扎比分校)

专题命中 规划决策 :autonomous agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SwitchMT方法,通过自适应任务切换策略和深度脉冲Q网络实现高效的多任务学习,提升自主代理在多个Atari游戏中表现。

Comments Accepted at the 63rd ACM/IEEE Design Automation Conference (DAC), July 26-29, 2026 in Long Beach, CA, USA. [Codes: https://github.com/rachmadvwp/SwitchMT]

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17091 2026-04-17 cs.LG cs.AI cs.RO 81%

Learning to Plan, Planning to Learn: Adaptive Hierarchical RL-MPC for Sample-Efficient Decision Making

学习与规划:自适应分层RL-MPC用于样本高效决策

Toshiaki Hori, Jonathan DeCastro, Deepak Gopinath, Avinash Balachandran, Guy Rosman

机构 * Toyota Research Institute(丰田研究院) Learning to Plan, Planning to Learn: Adaptive Hierarchical RL-MPC for Sample-Efficient Decision Making(学习规划,规划学习:自适应分层RL-MPC用于样本高效决策)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种融合强化学习和MPC规划的分层方法,通过自适应聚合MPPI样本提升策略鲁棒性,实现在复杂规划问题中提高样本效率和任务成功率。

Comments 27 pages, 10 figures, 8th Annual Learning for Dynamics & Control Conference (L4DC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13609 2026-04-16 cs.LG cs.AI 81%

Golden Handcuffs make safer AI agents

黄金手铐使AI代理更安全

Aram Ebtekar, Michael K. Cohen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 规划决策 :AI agent(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了一种贝叶斯缓解方法,通过扩展代理的主观奖励范围以包含大负值,从而在一般环境中提高安全性。设计了一种简单的覆盖机制,当预测值低于固定阈值时,将控制权交给安全导师。证明了该代理在能力与安全方面的双重属性。

Comments 26 pages, preliminary version

详情

展开后加载摘要…

URL PDF HTML 收藏