Path-conditioned Reinforcement Learning-based Local Planning for Long-Range Navigation
基于路径条件的强化学习局部规划用于远距离导航
专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO
AI总结 本文提出一种基于强化学习的局部导航策略,利用路径信息作为上下文指导,提升远距离导航效率并保持在路径信息退化时的鲁棒性。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
基于路径条件的强化学习局部规划用于远距离导航
专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO
AI总结 本文提出一种基于强化学习的局部导航策略,利用路径信息作为上下文指导,提升远距离导航效率并保持在路径信息退化时的鲁棒性。
结合增量知识的神经符号推理用于样本高效分层强化学习
机构 * NTU Singapore(新加坡南洋理工大学) ; IPAL, CNRS, France(法国IPAL-CNRS)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI
AI总结 本研究提出结合增量知识(InK)的神经符号分层强化学习,通过符号高层组件执行符号规划、低层神经模块学习运动原语,在导航任务中显著提升了样本效率,还开发了信念世界树搜索方法。
Comments Published in ECML-PKDD 2026
SP3O:无需奖励建模的分段偏好强化学习
机构 * University of Michigan(密歇根大学)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG
AI总结 SP3O是一种无需奖励建模的新型PbRL算法,利用分段级偏好反馈,通过PPO型损失函数优化策略,在机器人控制和LLM微调等长视界任务中性能优于现有算法。
EvoHIL:用于鲁棒交互式强化学习的自演化奖励与流匹配策略优化
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO
AI总结 EvoHIL是适配奖励模型、动作生成器和视觉域的统一交互式学习框架,在六类机械臂操纵任务中提升了成功率、运动平滑度等性能。
SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理
专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI
AI总结 本研究提出SpatialCLI框架,通过三个阶段让视觉语言模型先借助专用空间工具推理,再内化感知能力,在MindCube上大幅提升了Qwen3-VL-8B-Instruct的性能,表现优于对比模型。
概率状态空间模型中的对抗观测用于鲁棒强化学习
机构 * Inst. Math. Sciences, Spanish Nat. Research Council, Madrid, Spain(西班牙国家研究委员会数学科学研究所,马德里)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 分析线性概率状态空间模型中受似然约束的对抗观测对潜在状态和策略决策的影响,为构建鲁棒强化学习系统提供理论基础,适用于机器人等安全关键领域。
Comments 42 pages, 10 figures, PREPRINT ONGOING: Revised version with additional theoretical results and experiments
具有关节灵活性和时变延迟的遥操作机器人控制中自适应增益调整的深度强化学习
专题命中 模仿学习与强化学习 :robotic(abstract)
AI总结 针对含有关节灵活性和时变延迟的遥操作机器人控制问题,提出结合稳定P+d控制器与基于TD3算法的深度强化学习智能体的混合控制方法,可实时调整增益减少振动,为相关遥操作系统提供实用方案。
Comments 7 pages, 6 figures. Source code available at: https://github.com/ArminAttarzadeh/DRL-Controller-Gain-Tuner