Learning Dynamic Attribute-factored World Models for Efficient Multi-object Reinforcement Learning
专题命中 模仿学习与强化学习 :world model(title);分类 cs.LG
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 模仿学习与强化学习 :world model(title);分类 cs.LG
专题命中 模仿学习与强化学习 :robotic(title);分类 cs.RO
Comments 8 pages, Submitted to IROS 2023
专题命中 模仿学习与强化学习 :robotic(title);分类 cs.RO
专题命中 模仿学习与强化学习 :robotic(title);分类 cs.RO
专题命中 模仿学习与强化学习 :navigation(title);分类 cs.LG
专题命中 模仿学习与强化学习 :world model(title);分类 cs.LG
专题命中 模仿学习与强化学习 :manipulation(title);分类 cs.RO
Journal ref Global Oceans 2020: Singapore - U.S. Gulf Coast
专题命中 模仿学习与强化学习 :navigation(title);分类 cs.LG
Comments To be published in ICASSP 2021
专题命中 模仿学习与强化学习 :robotic(title);分类 cs.LG
专题命中 模仿学习与强化学习 :robotic(title);分类 cs.RO
Comments Presented at the 2020 Workshop on Assessing, Explaining, and Conveying Robot Proficiency for Human-Robot Teaming
专题命中 模仿学习与强化学习 :robotic(title);分类 cs.LG
专题命中 模仿学习与强化学习 :robotics(title);分类 cs.RO
专题命中 模仿学习与强化学习 :navigation(title);分类 cs.RO
Comments 8 pages, 13 figures, IEEE International Conference on Mechatronics and Automation (ICMA 2019)
专题命中 模仿学习与强化学习 :robot learning(title);分类 cs.AI
专题命中 模仿学习与强化学习 :navigation(title);分类 cs.RO
专题命中 模仿学习与强化学习 :navigation(title);分类 cs.AI
Comments Diploma Thesis
专题命中 模仿学习与强化学习 :robotic(title);分类 cs.RO
Comments 12 pages, 3 figures, 2 tables, 9th International Conference on Artificial Evolution (EA 09),
Journal ref Proceedings of the 9th International Conference on Artificial Evolution (EA 09), LNCS 5975, Strasbourg, France, 2010, p 122-133
基于重分配的代价推断改进稀疏安全离线强化学习
机构 * University of the Witwatersrand(威特沃特斯兰德大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG
AI总结 针对安全离线强化学习中稀疏轨迹级停止反馈问题,提出RCI框架转换为密集每步代价,经理论证明转换无损,实验在两类任务上违规率更低且鲁棒性好。
Comments Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), affiliated with IJCAI/ECAI 2026
可指导的交互式游戏智能体
机构 * Sony AI, Zurich, Switzerland(索尼AI,苏黎世,瑞士) ; Sony AI, North America (various locations)(索尼AI,北美(多地)) ; Sony AI, Tokyo, Japan(索尼AI,东京,日本)
专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.AI、cs.LG
AI总结 提出结合通用价值函数近似器与精心选择的训练场景、学习算法和数据增强的框架,使智能体在复杂领域(如《地平线:西之绝境》、《GT赛车》和类人机器人)中实时展现不同风格,同时保持主任务性能。
Comments Source code: https://github.com/SonyResearch/coachable_agents - Videos: https://drive.google.com/drive/folders/19F5uKziT_zkDurze5sy5iMFD4BHfD3lV
Warp RL: 重塑基础策略分布以进行动力学自适应
机构 * University of Sydney(悉尼大学) ; NVIDIA(英伟达)
专题命中 模仿学习与强化学习 :manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.LG
AI总结 针对残差强化学习在动力学偏移下无法调整分布形状的问题,提出Warp RL方法,通过可逆状态条件变换重塑基础策略的动作分布,在ManiSkill3任务和真实机器人插销任务中优于残差校正。
Comments 17 pages, 7 figures
Robo-ValueRL:离线到在线强化学习的可靠价值估计
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; Beijing Forestry University(北京林业大学) ; Peking University(北京大学) ; Microsoft Research(微软研究院)
专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 研究离线到在线强化学习中价值函数可靠性对策略优化的影响,提出Robo-ValueRL框架,通过特定指标评估价值估计可靠性并用于策略预训练和在线改进,实验显示其能有效提升下游策略性能,突出价值引导数据利用对策略改进的重要性。
Comments Please refer to our website: https://gewu-lab.github.io/Robo-ValueRL/
HERB:用于装箱的人类增强高效强化学习
机构 * BioRobotics Institute, Scuola Superiore Sant’Anna, Pisa, Italy, and with the Department of Excellence in Robotics and AI, Scuola Superiore Sant’Anna, Pisa, Italy(生物机器人研究所,圣安娜高等学院,意大利比萨,以及与机器人与人工智能卓越部门,圣安娜高等学院,意大利比萨) ; Institute for Systems and Robotics, Instituto Superior Técnico, Universidade de Lisboa(系统与机器人研究所,技术高等学院,里斯本大学)
专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.LG
AI总结 研究针对不规则物体装箱问题,提出HERB人类增强RL框架,结合人类示范与RL探索确定物体放置,实验表明该方法在效率、延迟上优于其他方法,且策略更稳定、似人类,还验证了现实可行性。
Comments 8 pages, 8 Figures
HALO-WA:用于世界-动作模型的混合注意力潜在引导在线强化学习
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; GigaAI(字节跳动公司(推测,根据常见语境)) ; Tsinghua University(清华大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 针对世界-动作模型在现实精度任务中易受多种误差影响的问题,提出HALO-WA框架,利用潜在特征和动作先验,通过混合注意力结构实现快速在线适应,提升动作块精度,实验验证效果显著。
语言-批评模仿学习从次优演示中
机构 * Graduate Institute of Communication Engineering, National Taiwan University (NTU)(国立台湾大学电信工程学研究所) ; University of Utah(犹他大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学) ; NTU Artificial Intelligence Center of Research Excellence(国立台湾大学人工智能卓越研究中心)
专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.AI、cs.LG
AI总结 提出语言批评框架,用自然语言作为结构化监督信号从次优演示中学习策略,避免压缩为标量,在连续控制任务上优于基线方法。
Z-1: 面向视觉-语言-动作模型的高效强化学习
机构 * Zioneer Robot Team(Zioneer机器人团队)
专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 提出Z-1框架,结合共享前缀生成、树状轨迹分支、完成感知奖励校准和选择性联合训练,通过GRPO策略在24个RoboCasa任务上平均成功率80.6%,较SFT提升13.2%。
面向强化学习的阶段转换密集奖励建模
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Zerith Robotics
专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 提出阶段转换密集奖励(STDR)框架,利用专家视频学习任务阶段结构,提供阶段转换和阶段内进展两种密集奖励信号,结合OOD检测和抓取调节模块,提升机器人操作任务的样本效率和成功率。
Comments 8 pages,3 figures
HydroGym:流体动力学的强化学习平台
机构 * University of Washington(华盛顿大学) ; AI Institute in Dynamic Systems, University of Washington(华盛顿大学人工智能研究所) ; RWTH Aachen University(亚琛工业大学) ; Inha University(仁荷大学) ; University of Michigan(密歇根大学) ; KTH Royal Institute of Technology(瑞典皇家理工学院) ; Technical University of Munich(慕尼黑工业大学) ; Arts et Métiers Institute of Technology(国立高等工程技术学校) ; CNAM(法国国立工艺学院) ; DynFluid, HESAM Université(HESAM大学流体动力学实验室) ; Munich Institute of Integrated Materials, Energy and Process Engineering, Technical University of Munich(慕尼黑工业大学综合材料、能源与工艺工程研究所) ; JARA Center for Simulation and Data Science, RWTH Aachen University(亚琛工业大学JARA模拟与数据中心) ; MediaTek Research(联发科技研究中心) ; German Center for Neurodegenerative Diseases(德国神经退行性疾病中心)
专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.AI、cs.LG
AI总结 提出HydroGym,一个求解器无关的强化学习平台,提供61+个已验证的流场环境,支持多种后端,RL智能体发现鲁棒控制原理,并实现零样本迁移,显著降低探索成本。
正则化奖惩强化学习
机构 * Dept. of Brain Robot Interface, ATR Computational Neuroscience Laboratories(ATR计算神经科学实验室脑机接口系)
专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.LG
AI总结 提出KL耦合策略正则化(KCPR)框架,通过策略间动态先验交互实现奖惩强化学习中的策略协调,并衍生出KL耦合软最优性(KCSO)及深度实现klDMP,在网格世界和Gazebo机器人导航任务中提升了安全性和学习稳定性。
支持约束强化学习实现无需真实世界经验的真实世界策略改进
机构 * University of Washington(华盛顿大学) ; Amazon FAR(亚马逊FAR)
专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG
AI总结 提出SCORE框架,通过流导向约束模拟中的强化学习到真实数据预训练生成策略的支持集,实现无需真实世界经验即可改进真实世界操作策略,在八项灵巧操作任务中成功率从37.8%提升至89.9%。
Comments 35 pages, 23 figures
OGPO:生成控制策略的样本高效全微调
机构 * University of California, Berkeley(加州大学伯克利分校) ; UC Berkeley(加州大学伯克利分校)
专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.LG
AI总结 提出OGPO算法,通过离策略评论网络和修改的PPO目标,实现生成控制策略的样本高效微调,在多种操作任务上达到最优性能,并能在无专家数据下微调不良初始化的行为克隆策略。
Comments Website: https://simchowitzlabpublic.github.io/ogpo-site/ Code: https://github.com/simchowitzlabpublic/OGPO_public