arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-08 至 2026-05-08 共收录 47 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 47 篇

2605.05963 2026-05-08 cs.AI cs.CL 87%

TheraAgent: Self-Improving Therapeutic Agent for Precise and Comprehensive Treatment Planning

TheraAgent:自我改进的治疗剂用于精准且全面的治疗计划

Junkai Li, Yunghwei Lai, Tianyi Zhu, Zheng Long Lee, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) School of Computing, National University of Singapore, Singapore(计算学院,新加坡国立大学,新加坡)

专题命中 规划决策 :agent(title);planning(title);agentic(abstract);分类 cs.AI、cs.CL

AI总结 TheraAgent通过迭代生成-判断-改进流程提升治疗计划的精准度和完整性,实验显示其在HealthBench上表现优异,专家评估中胜率高达86%。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03213 2026-05-08 cs.CR cs.AI 85%

When Agents Handle Secrets: A Survey of Confidential Computing for Agentic AI

当代理处理秘密:关于代理AI的保密计算调查

Javad Forough, Marios Kogias, Hamed Haddadi

机构 * Department of Computing Imperial College London London, United Kingdom(计算系帝国理工学院伦敦英国)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了代理AI中保密计算的应用,分析了六个TEE平台的设计,提出了基于代理的威胁模型,并指出了六个开放挑战,旨在为生产级代理AI提供安全基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05386 2026-05-08 cs.AI cs.CL cs.LG 85%

BALAR : A Bayesian Agentic Loop for Active Reasoning

BALAR:主动推理的贝叶斯代理循环

Aymen Echarghaoui, Dongxia Wu, Emily B. Fox

机构 * Department of Statistics, Stanford University(统计学系,斯坦福大学) Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 BALAR是一种无需微调的任务无关外环算法,通过维护潜在状态的结构信念,选择澄清问题以最大化预期互信息,并动态扩展状态表示,从而在三个基准测试中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06365 2026-05-08 cs.AI cs.MA cs.SE 84%

From Agent Loops to Deterministic Graphs: Execution Lineage for Reproducible AI-Native Work

从代理循环到确定性图:可重复AI原生工作的执行轨迹

Josh Rosen, Seth Rosen

机构 * ThruWire, Inc.(ThruWire公司)

专题命中 规划决策 :agent(title);tool use(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出执行轨迹模型,通过有向无环图表示AI生成工作,确保在变化中保持稳定性。对比实验显示,DAG在保持最终结果和中间状态一致性方面优于循环更新方法。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06285 2026-05-08 cs.CL cs.LG 84%

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG

LatentRAG: 基于潜在空间的高效代理RAG推理与检索

Yijia Zheng, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.LG

AI总结 LatentRAG通过将推理与检索从离散语言空间转移到连续潜在空间,提升代理RAG的效率,实验表明其在七种基准数据集上性能与显式方法相当,推理延迟降低约90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06601 2026-05-08 cs.CR cs.AI 83%

Patch2Vuln: Agentic Reconstruction of Vulnerabilities from Linux Distribution Binary Patches

Patch2Vuln: 基于Linux发行版二进制补丁的漏洞重构

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文探讨利用语言模型代理从Linux发行版二进制补丁中重构漏洞,提出Patch2Vuln流程,通过提取ELF对、差异分析和代理审计,验证了二进制补丁中漏洞重构的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22382 2026-05-08 cs.LG 83%

Purely Agent-Driven Black-Box Optimization for Biological Design

纯粹的基于代理的黑盒优化用于生物设计

Natalie Maus, Yimeng Zeng, Haydn Thomas Jones, Yining Huang, Gaurav Ng Goel, Alden Rose, Kyurae Kim, Hyun-Su Lee, Marcelo Der Torossian Torres, Fangping Wan, Cesar de la Fuente-Nunez, Mark Yatskar, Osbert Bastani, Jacob R. Gardner

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出PABLO框架,通过基于语言的代理方法在生物设计中实现高效黑盒优化,提升样本效率和目标值,展示其在抗微生物肽优化中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05632 2026-05-08 cs.CR cs.CL cs.LG 82%

Architecture Matters: Comparing RAG Systems under Knowledge Base Poisoning

架构至关重要:在知识库中毒情况下比较RAG系统

Samuel Korn

专题命中 规划决策 :agentic(abstract,abstract_cn);agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了在知识库中毒情况下不同RAG架构的鲁棒性,发现架构设计对攻击成功率影响显著,MADAM-RAG在矛盾检测上表现最佳但仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06642 2026-05-08 cs.CL cs.AI 81%

StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction

StraTA: 通过战略轨迹抽象激励代理强化学习

Xiangyuan Xue, Yifan Zhou, Zidong Wang, Shengji Tang, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Georgia(佐治亚大学) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出StraTA框架,通过引入显式的轨迹级策略提升代理强化学习的样本效率和最终性能,实验显示其在ALFWorld、WebShop和SciWorld上均优于基线模型。

Comments 26 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06040 2026-05-08 cs.AI cs.CL 81%

Novelty-based Tree-of-Thought Search for LLM Reasoning and Planning

基于新颖性的树状思维搜索用于大语言模型推理与规划

Leon Hamm, Zlatan Ajanovic

机构 * RWTH Aachen(亚琛工业大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于新颖性的树状思维搜索方法,通过引入新颖性概念优化语言领域推理与规划任务,减少搜索范围和token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06470 2026-05-08 cs.LG 79%

Hitting Time Isomorphism for Multi-Stage Planning with Foundation Policies

多阶段规划中的击中时间同构性

Magnus Victor Boock, Abdullah Akgül, Mustafa Mert Çelikok, Melih Kandemir

机构 * Department of Mathematics and Computer Science(数学与计算机科学系)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文提出基于击中时间同构性的新框架,通过学习希尔伯特空间位移几何,实现离线强化学习中的非对称表示学习,提升多阶段规划在长周期导航中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06200 2026-05-08 cs.CL 79%

A$^2$TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping

A$^2$TGPO: 基于自适应回合裁剪的代理回合策略优化

Dingwei Chen, Zefang Zong, Zhipeng Ma, Leo Luo, Yang Li, Chengming Li, Peng Chen, Jie Jiang

机构 * Tencent Inc(腾讯公司) The Chinese University of Hong Kong(香港中文大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.CL

AI总结 本文提出A$^2$TGPO,通过自适应回合裁剪和改进的归一化与累积方法,解决强化学习中代理大语言模型的回合级信用分配问题,提升多轮交互中单个工具调用的评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05951 2026-05-08 cs.AI 79%

HaM-World: Soft-Hamiltonian World Models with Selective Memory for Planning

HaM-World: 带选择性记忆的软哈密顿世界模型用于规划

Haoyun Tang, Haodong Cui, Keyao Xu, Kun Wang, Zhandong Mei

机构 * Xi’an Jiaotong University(西安交通大学) Huazhong University of Science and Technology(华中科技大学) Nankai University(南开大学) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 HaM-World通过分解潜在状态为规范子空间和上下文子空间,结合Mamba选择性状态空间记忆,提升规划稳定性与鲁棒性,实现高精度预测和任务完成。

Comments 22 pages, 5 figures. Code: https://github.com/HaoyunT/HaM_World

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05802 2026-05-08 cs.LG 79%

Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL

选择性回放:多样本代理强化学习中的中程轨迹终止

Zhiyuan Zhai, Xin Wang

机构 * Fudan University(复旦大学)

专题命中 规划决策 :agent(title);agentic(abstract);分类 cs.LG

AI总结 本文提出一种中程轨迹终止方法,通过在轨迹中途检测行动序列的编辑距离来提前停止无方差组,从而减少计算开销并提升测试任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05499 2026-05-08 cs.AI 79%

FoodCHA: Multi-Modal LLM Agent for Fine-Grained Food Analysis

FoodCHA:多模态LLM代理用于细粒度食物分析

Woojin Lee, Pranav Mekkoth, Ye Tian, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 规划决策 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出FoodCHA,一种多模态代理框架,通过分层决策过程提升食物识别的细粒度属性区分能力,实验显示其在类别和子类识别精度上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05216 2026-05-08 cs.LG 79%

SAT: Sequential Agent Tuning for Coordinator Free Plug and Play Multi-LLM Training with Monotonic Improvement Guarantees

SAT: 为无协调自由插拔多LLM训练的单调改进保证的序列代理调优

Yi Xie, Yangyang Xu, Yi Fan, Bo Liu

机构 * Department of Electrical \& Computer Engineering, University of Arizona Tucson, Arizona USA Department of Mathematical Sciences, Rensselaer Polytechnic Institute Troy, New York USA Amazon Web Services New York USA Department of Electrical \& Computer Engineering, University of Arizona Department of Mathematical Sciences, Rensselaer Polytechnic Institute Amazon Web Services

专题命中 规划决策 :agent(title,abstract);分类 cs.LG

AI总结 本文提出SAT方法,通过因子化策略和块坐标更新实现无协调的分布式训练,保证训练过程单调改进和插拔不变性,实验表明其在AIME24/25基准上性能优于Qwen3-32B。

Comments Published at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15119 2026-05-08 cs.AI cs.CL cs.LG cs.RO 78%

Flexible Agent Alignment with Goal Inference from Open-Ended Dialog

基于开放对话的目标推断的灵活代理对齐

Rachel Ma, Jingyi Qu, Andreea Bobu, Dylan Hadfield-Menell

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 规划决策 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出OU-AGs框架,通过开放对话中目标推断提升代理对齐能力,采用GOOD方法实现动态目标分布,提高多领域任务中的意图对齐效果。

Comments Previous version of the paper was titled: Open-Universe Assistance Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05502 2026-05-08 math.OC cs.SY eess.SY 78%

A Computationally Tractable Path-Planning Method for Airborne Wind Energy Systems

一种适用于空载风能系统的计算可行路径规划方法

Manuel C. R. M. Fernandes, Fernando A. C. C. Fontes

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种计算可行的框架,用于空载风能系统交叉风飞行控制的参考选择问题,通过非线性规划设计最大化功率的几何飞行路径。

Comments This paper is based on a chapter of the PhD thesis of the first author, with minor revisions and extensions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05338 2026-05-08 cs.RO 78%

Track A*: Fast Visibility-Aware Trajectory Planning for Active Target Tracking

Track A*: 为主动目标跟踪的快速可见性感知轨迹规划

Hanxuan Chen, Kangli Wang, Ji Pei

机构 * Autel Robotics(奥特 Robotics)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出Track A*,一种基于离线搜索的轨迹规划器,用于在离散的四维时空网格上实现可见性感知的目标跟踪。通过分层有向无环图搜索和三种工程优化,Track A*在保证实用性的同时提升了可扩展性,实验证明其在计算成本低的情况下具有稳健的可见性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05492 2026-05-08 cs.LG 77%

MEMOA: Massive Mixtures of Online Agents via Mean-Field Decentralized Nash Equilibria

MEMOA: 通过均场去中心化纳什均衡实现大规模在线代理混合

Xuwei Yang, David B. Emerson, Fatemeh Tavakoli, Anastasis Kratsios

机构 * Department of Mathematics and Statistics(数学与统计学系) Vector Institute(向量研究所) McMaster University(麦马斯特大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出MEMOA算法,通过均场去中心化纳什均衡优化大规模在线代理混合,解决计算和通信成本随代理数量增长的问题,证明其在大规模极限下收敛于集中纳什最优策略。

Comments 43 pages, 11 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06614 2026-05-08 cs.AI cs.CL 73%

SkillOS: Learning Skill Curation for Self-Evolving Agents

SkillOS: 为自演化代理学习技能编目

Siru Ouyang, Jun Yan, Yanfei Chen, Rujun Han, Zifeng Wang, Bhavana Dalvi Mishra, Rui Meng, Chun-Liang Li, Yizhu Jiao, Kaiwen Zha, Maohao Shen, Vishy Tirumalashetty, George Lee, Jiawei Han, Tomas Pfister, Chen-Yu Lee

机构 * Google Cloud AI Research(谷歌云人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 SkillOS通过经验驱动的强化学习方法,解决自演化代理中复杂长期技能编目的学习问题,优于记忆-free和强记忆基线,在效果和效率上均表现优异,技能库逐步演变成更丰富的Markdown文件。

Comments 11 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05797 2026-05-08 cs.RO cs.FL 71%

Resource-Constrained Robotic Planning in the face of Mixed Uncertainty

面对混合不确定性的资源受限机器人规划

Yihao Yin, Pian Yu, Andrea Turrini, Zhiming Chi, Yong Li, Lijun Zhang

机构 * Hangzhou Institute for Advanced Study (HIAS), UCAS, China(杭州先进研究院(HIAS),UCAS,中国) Key Laboratory of System Software (Chinese Academy of Sciences), Institute of Software Chinese Academy of Sciences, Beijing, China(系统软件重点实验室(中国科学院),软件研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) University College London, London, UK(伦敦大学学院,伦敦,英国)

专题命中 规划决策 :planning(title)

AI总结 本文提出基于CMDPST和LTLf的框架,解决机器人在资源受限条件下鲁棒策略合成问题,通过直接展开和优化方法提升效率,实验验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05544 2026-05-08 cs.LG cs.RO 70%

Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning

自适应Q分块用于离线到在线强化学习

Nandiraju Gireesh, Yuanliang Ju, He Wang

机构 * Peking University(北京大学) Galbot University of Toronto(多伦多大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出自适应Q分块方法,通过动态选择不同分块大小的 critic 来解决离线到在线强化学习中的偏置问题,提升在 OGBench 和 Robomimic 上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26240 2026-05-08 cs.RO cs.MA cs.NE 67%

SwarmCoDe: A Scalable Co-Design Framework for Heterogeneous Robot Swarms via Dynamic Speciation

SwarmCoDe:一种通过动态种群划分实现异构机器人群规模化协同设计的框架

Andrew Wilhelm, Josie Hughes

机构 * Department of Mechanical Engineering, École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑分校机械工程系)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 本文提出SwarmCoDe框架,通过动态种群划分自动扩展机器人群异质性以匹配任务复杂度,实现大规模异构机器人群的协同设计优化。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06161 2026-05-08 cs.AI cs.SE 62%

Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges

超越准确性:将政策不变性作为LLM安全裁判的可靠性测试

Shihao Weng, Yang Feng, Xiaofei Xie

机构 * Nanjing University(南京大学) Singapore Management University(新加坡国立管理学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出政策不变性作为LLM安全裁判可靠性测试,通过三个可测试原则揭示现有裁判在面对规范性变化和结构性重写时的失效模式,并提出政策不变性分数和裁判卡报告协议以评估裁判可靠性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06078 2026-05-08 cs.CL cs.AI 62%

Milestone-Guided Policy Learning for Long-Horizon Language Agents

为长周期语言代理设计的里程碑引导策略学习

Zixuan Wang, Yuchen Yan, Hongxing Li, Teng Pan, Dingming Li, Ruiqing Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Baidu Inc.(百度公司)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出BEACON框架,通过任务的组合结构实现精准信用分配,提升长周期语言代理的训练效果,在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07906 2026-05-08 cs.LG cs.AI 62%

AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering

AceGRPO:自适应课程增强的群体相对策略优化用于自主机器学习工程

Yuzhu Cai, Zexi Liu, Xinyu Zhu, Cheng Wang, Yanfeng Wang, Siheng Chen

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AceGRPO,通过动态数据缓冲和可学习潜力函数提升自主机器学习工程的持续迭代优化能力,实验证明其在MLE-Bench-Lite上达到100%有效提交率。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19043 2026-05-08 cs.AI 61%

Learning Lifted Action Models from Unsupervised Visual Traces

从无监督视觉轨迹中学习提升的动作模型

Kai Xi, Stephen Gould, Sylvie Thiébaux

机构 * School of Computing, The Australian National University(澳大利亚国立大学计算机学院)

专题命中 规划决策 :planning(abstract,comments);分类 cs.AI

AI总结 本文提出一种深度学习框架,通过无监督视觉轨迹学习状态预测、动作预测及提升的动作模型,并引入混合整数线性规划防止预测崩溃,提升模型在多领域中的全局一致性。

Comments Accepted to the 36th International Conference on Automated Planning and Scheduling (ICAPS-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06527 2026-05-08 cs.CL 57%

STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?

STALE:LLM代理能否知道其记忆已不再有效?

Hanxiang Chao, Yihan Bai, Rui Sheng, Tianle Li, Yushi Sun

机构 * Wuhan University(武汉大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 STALE基准测试评估LLM代理在新证据出现时修订存储信念的能力,揭示了现有模型在处理隐含冲突和更新状态时的不足,提出三种探查框架并提出CUPMem原型以改进状态感知记忆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06388 2026-05-08 cs.CV cs.LG cs.RO 57%

Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models

重建还是语义?什么使潜在空间对机器人世界模型有用

Nilaksh, Saurav Jha, Artem Zholus, Sarath Chandar

机构 * Chandar Research Lab(昌达尔研究实验室) Mila – Quebec AI Institute(魁北克人工智能研究院) Polytechnique Montréal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文评估了不同潜在空间在机器人世界模型中的有效性,发现语义潜在空间在规划和下游政策性能方面优于重建潜在空间。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏