arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4116 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4116 篇

2605.00384 2026-05-04 cs.RO 57%

PrefMoE: Robust Preference Modeling with Mixture-of-Experts Reward Learning

PrefMoE:基于专家混合的鲁棒偏好建模

Ziqin Yuan, Ruiqi Wang, Dezhong Zhao, Baijian Yang, Byung-Cheol Min

机构 * Purdue University(普渡大学) Beijing University of Chemical Technology(北京化工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 PrefMoE通过混合专家框架提升偏好建模鲁棒性,采用轨迹级软路由结合多个专用奖励专家,有效处理异质且部分冲突的偏好监督,提升下游策略学习可靠性。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00012 2026-05-04 cs.IR cs.AI cs.CL 57%

Exploring LLM biases to manipulate AI search overview

探索LLM偏见以操控AI搜索概述

Roman Smirnov

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 研究探索LLM偏见在AI搜索概述系统中的影响,通过强化学习优化搜索片段内容以操控结果,并发现偏见驱动相对优势而非绝对优势。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04341 2026-05-04 cs.LG 57%

Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism

长周期基于模型的离线强化学习无需显式保守性

Tianwei Ni, Esther Derman, Vineet Jain, Vincent Taboga, Siamak Ravanbakhsh, Pierre-Luc Bacon

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出NEUBAY算法,通过贝叶斯方法解决长周期rollout中的价值过估计问题,在D4RL和NeoRL基准上取得新进展。

Comments ICML 2026. 50 pages, 15 figures. Code is available at https://github.com/twni2016/neubay

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28056 2026-05-01 cs.AI 57%

RHyVE: Competence-Aware Verification and Phase-Aware Deployment for LLM-Generated Reward Hypotheses

RHyVE:基于能力的验证与阶段感知部署用于LLM生成的奖励假说

Feiyu Wu, Xu Zheng, Zhuocheng Wang, Yi ming Dai, Hui Li

机构 * School of Cyber Engineering, Xidian University(西安电子科技大学电子工程学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 研究提出RHyVE框架,通过能力感知验证和阶段感知部署提升LLM生成奖励假说的可靠性,实验显示在低能力阶段奖励排名不可靠,但经过任务依赖阈值后变得有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08049 2026-04-30 cs.CL cs.AI 57%

A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models

对过程奖励模型的调查:从结果信号到大语言模型的过程监督

Congmin Zheng, Jiachen Zhu, Zhuoying Ou, Yuxiang Chen, Kangning Zhang, Rong Shan, Zeyu Zheng, Mengyue Yang, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) Carnegie Mellon University(卡内基梅隆大学) University of Bristol(布里斯托大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI

AI总结 本文综述了过程奖励模型,探讨了如何生成过程数据、构建PRMs及在测试时扩展和强化学习中的应用,涵盖数学、代码、文本、多模态推理、机器人和智能体等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11218 2026-04-28 cs.RO 57%

Humanoid Whole-Body Badminton via Multi-Stage Reinforcement Learning

人形机器人多阶段强化学习实现全身体育羽毛球

Chenhao Liu, Leyun Jiang, Yibo Wang, Kairan Yao, Jinchen Fu, Xiaoyu Ren

机构 * Beijing Phybot Technology Co., Ltd(北京 Phybot 技术有限公司)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出多阶段强化学习框架,实现人形机器人羽毛球全身体术控制,通过三阶段课程学习协调步伐与击球,实验验证在仿真和硬件上均取得高精度击球性能。

Comments Project Page: https://humanoid-badminton.github.io/Humanoid-Whole-Body-Badminton-via-Multi-Stage-Reinforcement-Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23000 2026-04-28 cs.RO 57%

Learning from the Best: Smoothness-Driven Metrics for Data Quality in Imitation Learning

向最佳学习:用于模仿学习中数据质量的平滑驱动度量

Soham Kulkarni, Raayan Dhar, Yuchen Cui

机构 * Department of Computer Science, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出RINSE框架,通过轨迹平滑度评估演示数据质量,改进模仿学习中的数据筛选与重加权,实验证明在不同任务中提升性能。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22081 2026-04-27 cs.LG physics.comp-ph 57%

Insect-inspired modular architectures as inductive biases for reinforcement learning

受昆虫启发的模块化架构作为强化学习的归纳偏差

Anne E. Staples

机构 * Department of Mechanical Engineering, Virginia Tech(弗吉尼亚理工大学机械工程系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出了一种模块化强化学习架构,通过分布式电路实现感知编码、方向表示、稀疏联想记忆等功能,以应对动态竞争的行为目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17706 2026-04-27 cs.RO 57%

OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL

OmniVLA-RL:具备空间理解与在线强化学习的视觉-语言-动作模型

Haoxiang Jie, Yaoyuan Yan, Xiangyu Wei, Kailin Wang, Hongjie Yan, Zhiyou Heng, Daocheng Chen

机构 * AI Lab, Country Garden Services(国家花园服务人工智能实验室) Omni AI(奥米尼人工智能) VBot East China Normal University(东华大学)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.RO

AI总结 本文提出OmniVLA-RL模型,通过混合Transformer架构整合推理、空间和动作专家,结合Flow-GSPO提升动作精度与训练稳定性,在LIBERO和LIBERO-Plus基准上表现优异,克服了现有VLA模型的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21160 2026-04-24 cs.CV 57%

Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

通过几何奖励信用分配强化点-视觉-语言模型的3D理解

Jingkun Chen, Ruoshi Xu, Mingqi Gao, Shengda Luo, Jungong Han

机构 * Northwestern Polytechnical University(西北工业大学) Southern University of Science and Technology(南方科技大学) The University of Sheffield(谢菲尔德大学) Hengqin Laboratory(横琴实验室) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.CV

AI总结 本文提出几何奖励信用分配框架,通过分离整体监督信号并定向反馈,提升点-视觉-语言模型的3D结构对齐能力,同时引入重投影一致性项约束物理可行性,从而提升3D KPA和重投影一致性评分。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17050 2026-04-21 cs.RO 57%

Web-Gewu: A Browser-Based Interactive Playground for Robot Reinforcement Learning

Web-Gewu: 一个基于浏览器的机器人强化学习交互 playground

Kaixuan Chen, Linqi Ye

机构 * School of Future Technology, Shanghai University(上海大学未来技术学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 Web-Gewu 通过 WebRTC 云-边-端架构降低机器人强化学习教育的计算和环境配置门槛,实现低延迟的浏览器端交互和实时可视化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22149 2026-04-21 cs.CL cs.AI 57%

DynaWeb: Model-Based Reinforcement Learning of Web Agents

DynaWeb:基于模型的Web代理强化学习

Hang Ding, Peidong Liu, Junqiao Wang, Ziwei Ji, Meng Cao, Rongzhao Zhang, Lynn Ai, Eric Yang, Tianyu Shi, Lei Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Hong Kong University of Science and Technology(香港科学与技术大学) McGill University(麦吉尔大学) Shanghai AI Lab(上海人工智能实验室) Gradient University of Toronto(多伦多大学) Mila - Quebec AI Institute(魁北克AI研究所)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本文提出DynaWeb框架,通过模拟环境提升Web代理的强化学习效率,实验表明其在WebArena和WebVoyager基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15772 2026-04-20 cs.RO 57%

Fuzzy Logic Theory-based Adaptive Reward Shaping for Robust Reinforcement Learning (FARS)

基于模糊逻辑理论的自适应奖励塑造用于鲁棒强化学习(FARS)

Hürkan Şahin, Van Huyen Dang, Erdi Sayar, Alper Yegenoglu, Erdal Kayacan

机构 * Automatic Control Group (RAT)(自动控制组(RAT))

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出基于模糊逻辑的自适应奖励塑造方法,通过整合人类直觉提升强化学习的稳定性与鲁棒性,在复杂导航任务中实现更平滑的运动与控制过渡。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15289 2026-04-17 cs.RO 57%

Abstract Sim2Real through Approximate Information States

通过近似信息状态实现抽象sim2real

Yunfu Deng, Yuhao Li, Josiah P. Hanna

机构 * Prediction and Action Lab (PAL)(预测与行动实验室) University of Wisconsin – Madison(威斯康星大学麦迪逊分校) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校信息与计算机科学学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文研究了在抽象模拟器中通过强化学习训练政策并成功迁移到现实世界的问题,提出了一种利用真实任务数据修正抽象模拟器动力学的方法,实现了sim2sim和sim2real的政策迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15201 2026-04-17 cs.LG 57%

RL-STPA: Adapting System-Theoretic Hazard Analysis for Safety-Critical Reinforcement Learning

RL-STPA:将系统理论危害分析适应于安全关键强化学习

Steven A. Senczyszyn, Timothy C. Havens, Nathaniel Rice, Jason E. Summers, Benjamin D. Werner, Benjamin J. Schumeg

机构 * Michigan Technological University(密歇根技术大学) ARiA DEVCOM

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出RL-STPA框架,通过分层子任务分解、覆盖引导扰动测试和迭代检查点,系统分析强化学习中的安全风险,提升安全关键应用的安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04282 2026-04-15 cs.AI 57%

Synthetic POMDPs to Challenge Memory-Augmented RL: Memory Demand Structure Modeling

合成POMDPs挑战记忆增强型RL:内存需求结构建模

Yongyi Wang, Lingfeng Li, Bozhou Chen, Ang Li, Hanyu Liu, Qirui Zheng, Xionghui Yang, Wenxin Li

机构 * School of Computer Science, Peking University, Beijing 100871, China(北京大学计算机学院,北京100871,中国)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 本文提出定制化的POMDP环境设计,通过理论框架、线性动力学和奖励再分配方法,构建具有预定义内存需求结构的环境,以评估记忆增强型RL的挑战与性能。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-52148-y}

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10598 2026-04-14 cs.RO 57%

AWARE: Adaptive Whole-body Active Rotating Control for Enhanced LiDAR-Inertial Odometry under Human-in-the-Loop Interaction

AWARE: 一种适应性全身主动旋转控制用于增强人体在环交互下的激光雷达惯性里程计

Yizhe Zhang, Jianping Li, Liangliang Yin, Zhen Dong, Bisheng Yang

机构 * organization= State Key Laboratory of Information Engineering in Surveying, Mapping Remote Sensing , addressline= Wuhan University , city= Wuhan , postcode= 430079 , country= China organization= School of Electrical Electronic Engineering , addressline= Nanyang Technological University , postcode= 639798 , country= Singapore

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出AWARE框架,通过UAV自身旋转能力扩展传感器视野,提升LIO可观测性。采用可微分MPC与强化学习结合,实现估计精度与飞行稳定性平衡,并通过安全飞行走廊机制确保操作安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10429 2026-04-14 cs.AI 57%

Safety Guarantees in Zero-Shot Reinforcement Learning for Cascade Dynamical Systems

在级联动力系统中零样本强化学习的安全保障

Shima Rabiei, Sandipan Mishra, Santiago Paternain

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文研究了级联动力系统中零样本安全保证问题,提出在简化模型上训练安全RL策略,并通过低层控制器跟踪RL策略的参考信号,理论分析了安全概率与内状态跟踪质量的关系。

Comments 8 pages, 2 figures; submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11019 2026-04-14 cs.LG 57%

Relative Entropy Pathwise Policy Optimization

相对熵路径策略优化

Claas Voelcker, Axel Brunnbauer, Marcel Hussing, Michal Nauman, Pieter Abbeel, Eric Eaton, Radu Grosu, Amir-massoud Farahmand, Igor Gilitschenski

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) TU Wien(维也纳工业大学) University of Pennsylvania(宾夕法尼亚大学) University of Warsaw(华沙大学) UC Berkeley(加州大学伯克利分校) Polytechnique Montréal(蒙特利尔综合理工学院) Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出REPPO算法,通过路径策略梯度结合在线学习,提升训练稳定性与效率,展现优越的样本效率和内存表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09499 2026-04-13 cs.RO 57%

Physics-Informed Reinforcement Learning of Spatial Density Velocity Potentials for Map-Free Racing

基于空间密度速度势的物理引导强化学习用于无地图赛车

Shathushan Sivashangaran, Apoorva Khairnar, Sepideh Gohari, Vihaan Dutta, Azim Eskandarian

机构 * Autonomous Robots and Vehicles Laboratory, College of Engineering, Virginia Commonwealth University(弗吉尼亚联邦大学工程学院自主机器人与车辆实验室) Department of Mechanical Engineering, Virginia Tech(弗吉尼亚理工学院机械工程系) Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种物理引导的强化学习方法,通过参数化非线性车辆动力学,利用深度神经网络实现时间最优和超车赛车控制,显著提升无地图赛车性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21872 2026-04-10 cs.AI 57%

WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents

WebArbiter: 一种基于原则的推理过程奖励模型用于网络代理

Yao Zhang, Shijie Tang, Zeyu Li, Zhen Han, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文提出WebArbiter,一种基于原则的推理过程奖励模型,用于网络导航任务。该模型通过文本生成产生结构化的解释,以指导任务完成。通过两阶段训练流程,提升模型的泛化能力,并在WebPRMBench基准测试中优于现有方法。

Comments Published as a conference paper at ICLR 2026. Extended version with additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06949 2026-04-09 cs.RO 57%

Learning-Based Strategy for Composite Robot Assembly Skill Adaptation

基于学习的复合机器人装配技能适应策略

Khalil Abuibaid, Aleksandr Sidorenko, Achim Wagner, Martin Ruskowski

机构 * Chair of Machine Tools and Control System, RPTU University Kaiserslautern-Landau(机床与控制系统系,凯撒斯劳滕-兰道大学) Innovative Factory Systems, German Institute of Artificial Intelligence(创新工厂系统,德国人工智能研究中心)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种基于残差强化学习的复合机器人装配技能适应方法,通过显式预置、后置和不变条件实现模块化和可重用性,提升工业机器人在接触密集任务中的安全性和样本效率。

Comments Accepted at RAAD 2026 (Springer). 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06268 2026-04-09 cs.LG 57%

RAGEN-2: Reasoning Collapse in Agentic RL

RAGEN-2:代理强化学习中的推理崩溃

Zihan Wang, Chi Gui, Xing Jin, Qineng Wang, Licheng Liu, Kangrui Wang, Shiqi Chen, Linjie Li, Zhengyuan Yang, Pingyue Zhang, Yiping Lu, Jiajun Wu, Li Fei-Fei, Lijuan Wang, Yejin Choi, Manling Li

机构 * Northwestern University(西北大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Independent(独立研究者) Imperial College London(伦敦帝国学院) Oxford University(牛津大学) University of Washington(华盛顿大学) Microsoft(微软) Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究发现代理强化学习中推理稳定性受模板崩溃影响,通过引入互信息代理提升推理质量与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22844 2026-04-08 cs.AI 57%

PhySe-RPO: Physics and Semantics Guided Relative Policy Optimization for Diffusion-Based Surgical Smoke Removal

PhySe-RPO:物理与语义引导的相对策略优化用于基于扩散的手术烟雾去除

Zining Fang, Cheng Xue, Chunhui Liu, Bin Xu, Ming Chen, Xiaowei Hu

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

AI总结 本文提出PhySe-RPO框架,通过物理和语义引导的相对策略优化,解决手术烟雾去除中配对监督不足的问题,实现物理一致、语义忠实且临床可解释的扩散修复。

Comments 12 pages,7figures,published to CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05765 2026-04-08 cs.AI 57%

RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training

RL-VLA$^3$:一种灵活且异步的强化学习框架用于VLA训练

Haoran Sun, Yongjian Guo, Zhong Guan, Shuai Di, Xiaodong Bai, Jing Long, Tianyun Zhao, Mingxi Luo, Hongke Zhao, Likang Wu, Xiaotie Deng, Xu Chu, Xi Xiao, Sheng Wen, Yicheng Gong, Junwu Xiong

机构 * Peking University(北京大学) Tsinghua University(清华大学) Tianjin University(天津大学) JDT AI Infra(京东科技AI基础设施) Swinburne University of Technology(斯威本科技大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 本文提出RL-VLA$^3$,一种异步强化学习框架,通过动态批调度和灵活环境分片策略,提升VLA训练效率,实验显示其在8至256GPU上均取得85.2%的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04618 2026-04-07 cs.RO 57%

Biologically Inspired Event-Based Perception and Sample-Efficient Learning for High-Speed Table Tennis Robots

生物启发的事件感知与高效学习方法用于高速乒乓球机器人

Ziqi Wang, Jingyue Zhao, Xun Xiao, Jichao Yang, Yaohua Wang, Shi Xu, Lei Wang, Huadong Dai

机构 * National University of Defence Technology(国防科技大学) Defense Innovation Institute, AMS(军事科学院国防科技创新研究院) Qiyuan Lab(启元实验室)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出生物启发的高速乒乓球机器人方法,结合事件感知与高效学习,通过异步感知和稀疏数据实现高效检测与决策,提升目标返回精度35.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13920 2026-04-07 cs.LG 57%

Causal Process Models: Reframing Dynamic Causal Graph Discovery as a Reinforcement Learning Problem

因果过程模型:将动态因果图发现重新表述为强化学习问题

Turan Orujlu, Christian Gumbsch, Martin V. Butz, Charley M Wu

机构 * University of Tübingen(图宾根大学) MPI for Biological Cybernetics(马克斯·普朗克生物控制论研究所) University of Amsterdam(阿姆斯特丹大学) TU Darmstadt(达姆施塔特工业大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出因果过程模型,通过将动态因果图构建视为多智能体强化学习问题,实现了从视觉观测中学习稀疏时间变化因果图,提升可解释性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03023 2026-04-06 cs.RO 57%

Behavior-Constrained Reinforcement Learning with Receding-Horizon Credit Assignment for High-Performance Control

具有递推地 horizon 信用分配的行为约束强化学习

Siwei Ju, Jan Tauberschmidt, Oleg Arenz, Peter van Vliet, Jan Peters

机构 * TU Darmstadt(达姆施塔特工业大学) Porsche AG(保时捷股份公司) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种行为约束强化学习框架,通过递推地 horizon 预测机制和参考轨迹条件化策略,实现超越演示并保持专家行为一致的高性能控制策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02348 2026-04-06 cs.LG 57%

Contextual Intelligence The Next Leap for Reinforcement Learning

情境智能:强化学习的下一步

André Biedenkapp

机构 * Albert-Ludwigs-Universität(弗莱堡大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出情境智能的新框架,通过区分环境驱动和代理驱动因素,探索异构情境学习、多时间尺度建模和抽象高层情境整合,以提升强化学习的泛化能力与现实应用效率。

Comments Accepted to AAMAS 2025 (Blue Sky Ideas Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01064 2026-04-02 cs.RO 57%

BAT: Balancing Agility and Stability via Online Policy Switching for Long-Horizon Whole-Body Humanoid Control

BAT:通过在线策略切换平衡敏捷性与稳定性以实现长周期全身人形控制

Donghoon Baek, Sang-Hun Kim, Sehoon Ha

机构 * Georgia Institute of Technology(佐治亚理工学院) Samsung Research(三星研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出BAT框架,通过在线策略切换平衡敏捷性与稳定性,实现长周期全身人形控制,实验表明其在多样任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏