arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-29 至 2026-06-29 共收录 11 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 11 篇

2606.27861 2026-06-29 cs.RO 新提交 79%

PPO-EAL: Exact Augmented Lagrangian Proximal Policy Optimization for Safe Robotic Control

PPO-EAL:用于安全机器人控制的精确增广拉格朗日近端策略优化

Jiatao Ding, Songqun Gao, Andrea Del Prete, Matteo Saveriano

机构 * University of Trento(特伦托大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出PPO-EAL框架,将精确增广拉格朗日优化与近端策略优化结合,通过裁剪策略更新和精确二次惩罚项实现安全约束,在多种机器人任务中优于现有方法。

Comments 11 pages, 8 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27483 2026-06-29 cs.AI 新提交 79%

Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning

内化未来:一种统一的世界模型规划智能体训练范式

Xuan Zhang, Zhijian Zhou, Lingfeng Qiao, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI

AI总结 提出一种三阶段训练范式(WM-AMT、FE-SFT、FC-RL),使LLM智能体内化世界模型以进行前瞻性规划,在搜索和数学推理任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26048 2026-06-29 cs.RO cs.SY eess.SY 新提交 79%

Deep Reinforcement Learning-Enhanced Event-Triggered Data-Driven Predictive Control for a 3D Cable-Driven Soft Robotic Arm

深度强化学习增强的事件触发数据驱动预测控制用于三维缆索驱动软体机械臂

Cheng Ouyang, Moeen Ul Islam, Kaixiang Zhang, Zhaojian Li, Xiaobo Tan, Dong Chen

机构 * Mississippi State University(密西西比州立大学) Michigan State University(密歇根州立大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出一种强化学习自适应事件触发DeePC框架,通过训练RL策略决定何时调用优化器,在保持跟踪精度的同时减少计算开销,实验显示优化频率降低66%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28152 2026-06-29 cs.LG cs.RO 新提交 73%

Regularized Reward-Punishment Reinforcement Learning

正则化奖惩强化学习

Jiexin Wang, Eiji Uchibe

机构 * Dept. of Brain Robot Interface, ATR Computational Neuroscience Laboratories(ATR计算神经科学实验室脑机接口系)

专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出KL耦合策略正则化(KCPR)框架,通过策略间动态先验交互实现奖惩强化学习中的策略协调,并衍生出KL耦合软最优性(KCSO)及深度实现klDMP,在网格世界和Gazebo机器人导航任务中提升了安全性和学习稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27475 2026-06-29 cs.RO cs.LG 新提交 73%

Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience

支持约束强化学习实现无需真实世界经验的真实世界策略改进

Raymond Yu, William Huey, Mustafa Mukadam, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Amazon FAR(亚马逊FAR)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出SCORE框架,通过流导向约束模拟中的强化学习到真实数据预训练生成策略的支持集,实现无需真实世界经验即可改进真实世界操作策略,在八项灵巧操作任务中成功率从37.8%提升至89.9%。

Comments 35 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03065 2026-06-29 cs.LG cs.RO 版本更新 73%

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies

OGPO:生成控制策略的样本高效全微调

Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal, Shashwat Saxena, Jesse Zhang, Giri Anantharaman, Cleah Winston, Chaoyi Pan, Douglas Chen, Nai-Chieh Huang, Zeynep Temel, Oliver Kroemer, Sergey Levine, Abhishek Gupta, Hongkai Dai, Paarth Shah, Max Simchowitz

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 提出OGPO算法,通过离策略评论网络和修改的PPO目标,实现生成控制策略的样本高效微调,在多种操作任务上达到最优性能,并能在无专家数据下微调不良初始化的行为克隆策略。

Comments Website: https://simchowitzlabpublic.github.io/ogpo-site/ Code: https://github.com/simchowitzlabpublic/OGPO_public

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11103 2026-06-29 cs.RO cs.AI 版本更新 73%

A Primer on SO(3) Action Representations in Deep Reinforcement Learning

深度强化学习中SO(3)动作表示入门

Martin Schuck, Sherif Samy, Angela P. Schoellig

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对SO(3)动作表示在强化学习中的选择问题,系统评估了多种表示在PPO、SAC、TD3算法下的效果,发现切向量表示最可靠。

Comments Published at The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27766 2026-06-29 cs.LG cs.AI cs.RO 新提交 67%

RS-Diffuser: Risk-Sensitive Diffusion Planning with Distributional Value Guidance

RS-Diffuser: 基于分布价值引导的风险敏感扩散规划

Shiqiang Gong

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出RS-Diffuser,一种结合扩散轨迹生成与分布价值评论家的风险敏感离线规划框架,通过尾部感知目标引导去噪过程,实现灵活的风险偏好行为,在风险敏感D4RL和机器人导航基准上达到最优性能。

Comments ICIC 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30719 2026-06-29 cs.LG cs.AI 版本更新 62%

When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?

何时LLMs足以作为序列RL任务的策略优化器?

Stephane Hatgis-Kessell, Emma Brunskill

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出PromptPO方法,利用LLM通过Python描述状态空间、动作空间和奖励函数,基于rollout反馈迭代生成和优化可执行策略,在多种环境中匹配或超越标准RL基线,但在细粒度连续控制任务中表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27603 2026-06-29 cs.RO 新提交 57%

Learning to Throw: Agile and Accurate Cable-Suspended Payload Delivery with a Quadrotor

学习投掷:四旋翼飞行器实现灵活精确的缆绳悬挂载荷投送

Yifan Zhai, Elia Raimondi, Yunfan Ren, Ismail Geles, Yannick Armati, Jiaxu Xing, Davide Scaramuzza

机构 * Robotics and Perception Group, Department of Informatics, University of Zurich(苏黎世大学信息学系机器人感知组)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出一种混合仿真框架,结合高保真四旋翼模型和物理求解器模拟缆绳-载荷系统,通过深度强化学习训练策略,实现零样本部署下投掷误差降低50%、时间缩短30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-06-29 cs.CV 新提交 57%

ReWorld: Learning Better Representations for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 19 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏