arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-04 至 2026-06-04 共收录 432 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 8 篇

2605.03927 2026-06-04 cs.CV 83%

StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning

StateVLM: 一种用于机器人可操作推理的状态感知视觉语言模型

Xiaowen Sun, Matthias Kerzel, Mengdi Li, Xufeng Zhao, Paul Striker, Stefan Wermter

机构 * Department of Informatics, University of Hamburg(汉堡大学信息学院) King Abdullah University of Science and Technology(卡塔尔科学与技术大学)

专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.CV

AI总结 提出StateVLM模型,通过辅助回归损失训练策略增强视觉语言模型在目标检测和状态定位中的数值推理能力,并构建OSAR基准验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03482 2026-06-04 cs.CV cs.AI cs.LG 82%

Beyond Pixel Histories: World Models with Persistent 3D State

超越像素历史:具有持久3D状态的世界模型

Samuel Garcin, Thomas Walker, Steven McDonagh, Tim Pearce, Hakan Bilen, Tianyu He, Kaixin Wang, Jiang Bian

机构 * University of Edinburgh(爱丁堡大学) Microsoft Research(微软研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出PERSIST范式,通过模拟潜在3D场景(环境、相机、渲染器)的演化,实现具有持久空间记忆和一致几何的世界模型,显著提升3D一致性、空间记忆和长期稳定性。

Comments Accepted to the International Conference on Machine Learning (ICML) 2026. To appear in the Proceedings of Machine Learning Research (PMLR). 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02697 2026-06-04 cs.CV cs.AI 81%

ShareVerse: Multi-Agent Consistent Video Generation for Shared World Modeling

ShareVerse:面向共享世界建模的多智能体一致视频生成

Jiayi Zhu, Jianing Zhang, Yiying Yang, Wei Cheng, Xiaoyun Yuan

机构 * Shanghai Jiao Tong University China(上海交通大学中国) Fudan University China(复旦大学中国) StepFun China(StepFun中国)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 提出ShareVerse框架,通过构建多智能体交互数据集、空间拼接策略和跨智能体注意力机制,实现多智能体共享世界的一致视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04130 2026-06-04 cs.RO 79%

CLAW: Learning Continuous Latent Action World Models via Adversarial Latent Regularization

CLAW: 通过对抗潜在正则化学习连续潜在动作世界模型

Tewodros Ayalew, Matthew Jeung, Samuel Wheeler, Xiao Zhang, Andre de la Cruz Arce, Kaylene Stocking, Michael Maire, Matthew R. Walter

机构 * University of Chicago(芝加哥大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Argonne National Laboratory(阿贡国家实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 提出CLAW框架,利用对抗潜在正则化和扩散视频生成,从无动作视频中端到端学习世界模型与连续潜在动作表示,支持观察模仿学习和目标导向规划。

Comments 8 pages, 15 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06006 2026-06-04 cs.CV cs.AI cs.CL 76%

Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics

视觉语言模型能预测未来状态吗?从逆动力学引导世界模型

Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

机构 * Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) NVIDIA(NVIDIA公司) University of Groningen(格罗宁根大学)

专题命中 具身推理 :world model(title);分类 cs.AI、cs.CV

AI总结 本文发现视觉语言模型(VLM)难以直接进行前向动力学预测(FDP),但逆动力学预测(IDP)更容易学习,并利用IDP通过弱监督学习和推理时验证两种策略引导FDP,在Aurora-Bench上取得与最先进图像编辑模型竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.06498 2026-06-04 cs.RO cs.LG cs.SY eess.SY 66%

Conditional Affordance Learning for Driving in Urban Environments

面向城市环境的条件性 affordance 学习

Axel Sauer, Nikolay Savinov, Andreas Geiger

机构 * Chair of Robotics Science and System Intelligence, Technical University of Munich(慕尼黑技术大学机器人科学与系统智能系)

专题命中 具身推理 :navigation(abstract);分类 cs.RO、cs.LG;robot learning(comments)

AI总结 本文提出了一种直接感知方法,通过将视频输入映射到适合复杂城市环境自主导航的中间表示,结合高层方向输入,实现了比现有强化学习和条件模仿学习方法更高的目标导向导航性能,并首次通过图像级标签处理交通灯和速度标志,显著减少模拟中的交通事故。

Comments Accepted for Conference on Robot Learning (CoRL) 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04264 2026-06-04 cs.CV 57%

UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation

UniCanvas: 一种基于扩散的图文联合生成统一模型

Zeyuan Yang, Hao-Wei Chen, Xueyang Yu, Yuncong Yang, Haoyu Zhen, Ziqiao Ma, Maohao Shen, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) University of Michigan(密歇根大学) MIT(麻省理工学院)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 提出UniCanvas,通过扩散模型在像素画布上以文本嵌入图像的方式实现图文联合生成,解决现有模型在视觉与文本生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17262 2026-06-04 hep-th gr-qc 50%

Kalb-Ramond Topological Term in Majorana Superspace and Kaluza-Klein Spectrum Deformation in Five Dimensions

Majorana超空间中的Kalb-Ramond拓扑项与五维Kaluza-Klein谱变形

L. A. S. Nunes, C. A. S. Almeida

专题命中 具身推理 :world model(abstract)

AI总结 在五维N=1超空间中构造Kalb-Ramond拓扑项的超对称完备,揭示伪超对称构造的缺失项,并证明新玻色子项导致KK谱变形,影响Randall-Sundrum膜世界模型中的挠率现象。

Comments 21 pages. v2: added appendix; minor clarifications and corrections

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人基础模型 5 篇

2602.03920 2026-06-04 cs.RO cs.HC 79%

How Users Understand Robot Foundation Model Performance through Task Success Rates and Beyond

用户如何通过任务成功率及其他方式理解机器人基础模型性能

Isaac Sheidlower, Jindan Huang, James Staley, Bingyu Wu, Qicong Chen, Reuben Aronson, Elaine Short

机构 * Brown University(布朗大学) Tufts University(塔夫茨大学)

专题命中 机器人基础模型 :robot foundation model(title,abstract);分类 cs.RO

AI总结 通过用户研究,探讨非机器人专家如何理解机器人基础模型(RFM)评估中的任务成功率(TSR)及其他信息,发现用户不仅按专家预期使用TSR,还重视未常报告的失败案例,并希望获取历史评估数据和机器人对新任务的性能估计。

Comments Submitted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03598 2026-06-04 cs.RO cs.AI cs.CV 75%

PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models

PHASER: 面向视觉-语言-动作模型的相位感知与语义经验回放

Ziyang Chen, Shaoguang Wang, Weiyu Guo, Qianyi Cai, He Zhang, Pengteng Li, Yiren Zhao, Yandong Guo

机构 * Thrust of AI, HKUST(Guangzhou)(人工智能 thrust,香港科技大学(广州)) AI 2 Robotics, Shenzhen, China(人工智能与机器人,深圳,中国)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出PHASER框架,通过相位感知容量分配和多模态干扰路由策略,结合自动相位提取管线Auto-PC,解决VLA模型在持续学习中的灾难性遗忘问题,在LIBERO基准上平均成功率提升高达31%。

Comments 20 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12215 2026-06-04 cs.RO 70%

LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion

LDA-1B:通过通用具身数据摄取扩展潜动力学动作模型

Jiangran Lyu, Kai Liu, Xuheng Zhang, Haoran Liao, Yusen Feng, Wenxuan Zhu, Tingrui Shen, Jiayi Chen, Jiazhao Zhang, Yifei Dong, Wenbo Cui, Senmao Qi, Shuo Wang, Yixin Zheng, Mi Yan, Xuesong Shi, Haoran Li, Dongbin Zhao, Ming-Yu Liu, Zhizheng Zhang, Li Yi, Yizhou Wang, He Wang

机构 * Peking University(北京大学) Galbot CASIA(中国科学院自动化研究所) BAAI(北京人工智能研究院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) NVIDIA

专题命中 机器人基础模型 :world model(abstract);robot foundation model(abstract);分类 cs.RO

AI总结 提出LDA-1B机器人基础模型,通过统一格式的具身交互数据集EI-30k和结构化DINO潜空间中的动力学学习,联合建模动力学、策略和视觉预测,在接触丰富、灵巧和长时任务上分别提升高达21%、48%和23%。

Comments Accepted at RSS 2026, Project Page:https://pku-epic.github.io/LDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04436 2026-06-04 cs.CV cs.RO 62%

3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training

3DThinkVLA:通过3D思维引导的协同训练赋予视觉-语言-动作模型潜在3D先验

Jiaxin Shi, Xidong Zhang, Fucai Zhu, Zhe Li, Siyu Zhu, Weihao Yuan

机构 * Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics(达梦机器人) Great Bay University(大亚大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出3D思维引导的协同训练框架,通过解耦3D几何感知与空间推理并在不同特征层次注入,使VLA模型在动作预测中隐式进行3D空间推理,无需3D传感器或外部模型,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00416 2026-06-04 cs.RO 57%

Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies

在部署中学习:面向通用机器人策略的机群规模强化学习

Yi Wang, Xinchen Li, Pengwei Xie, Pu Yang, Buqing Nie, Yunuo Cai, Qinglin Zhang, Chendi Qu, Jeffrey Wu, Jianheng Song, Xinlin Ren, Jingshun Huang, Mingjie Pan, Siyuan Feng, Zhi Chen, Jianlan Luo

机构 * Shanghai Innovation Institute(上海创新研究院) AGIBOT Finch Columbia University(哥伦比亚大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 提出LWD框架,通过机群规模的离线到在线强化学习,结合分布式隐式价值学习与伴随匹配Q学习,持续后训练通用视觉-语言-动作策略,在16台双臂机器人上实现95%平均成功率。

Comments No

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 26 篇

1806.06161 2026-06-04 cs.RO cs.LG cs.SY eess.SY 81%

BaRC: Backward Reachability Curriculum for Robotic Reinforcement Learning

BaRC:机器人强化学习中的逆向可达性课程

Boris Ivanovic, James Harrison, Apoorva Sharma, Mo Chen, Marco Pavone

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) School of Computing Science, Simon Fraser University(西蒙弗雷泽大学计算机科学学院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出BaRC方法,利用物理先验知识设计课程方案,通过逆向可达性策略加速连续控制MDP中模型无关RL算法的训练,提升性能并减少探索需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
1502.02860 2026-06-04 stat.ML cs.LG cs.RO cs.SY eess.SY 81%

Gaussian Processes for Data-Efficient Learning in Robotics and Control

高斯过程在机器人和控制中的数据高效学习

Marc Peter Deisenroth, Dieter Fox, Carl Edward Rasmussen

专题命中 模仿学习与强化学习 :robotics(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出基于高斯过程的非参数转移模型,通过提取更多数据信息加速学习,减少模型误差影响,实现高效自主学习。

Comments 20 pages, 29 figures; fixed a typo in equation on page 8

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 37, issue no 2, pages 408-423, February 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.01292 2026-06-04 cs.RO cs.SY eess.SY 79%

A General Safety Framework for Learning-Based Control in Uncertain Robotic Systems

一种用于不确定机器人系统中基于学习的控制的通用安全框架

Jaime F. Fisac, Anayo K. Akametalu, Melanie N. Zeilinger, Shahab Kaynama, Jeremy Gillula, Claire J. Tomlin

机构 * Department of Mechanical and Process Engineering, ETH Zurich(瑞士苏黎世联邦理工学院机械与过程工程系) Clearpath Robotics(Clearpath机器人公司) Electronic Frontier Foundation(电子前沿基金会)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出一种通用安全框架,结合Hamilton-Jacobi可达性方法和任意学习算法,通过近似系统动力学知识确保约束满足,同时减少对学习过程的干扰,并引入贝叶斯机制提升安全分析。

Comments Accepted for publication in IEEE Transactions on Automatic Control. Video with experiments: https://youtu.be/WAAxyeSk2bw

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.09865 2026-06-04 eess.SY cs.SY 78%

Adaptive Guidance and Integrated Navigation with Reinforcement Meta-Learning

自适应引导与集成导航的强化元学习

Brian Gaudet, Richard Linares, Roberto Furfaro

专题命中 模仿学习与强化学习 :navigation(title,abstract)

AI总结 本文提出了一种基于强化元学习的自适应引导系统,采用递归策略和价值函数近似器,通过递归网络层使部署策略能实时适应作用在智能体上的环境力,在四个具有未知但高度动态变化的挑战性环境中比较了DR/DV引导律、非递归策略的RL代理和递归策略的RL代理的性能,并展示了RL元学习优化的策略在火星着陆环境中仅使用多普勒雷达高度计读数,在小行星着陆环境中仅使用LIDAR高度计读数时实现引导和导航的整合能力。

Comments arXiv admin note: substantial text overlap with arXiv:1901.04473

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.09627 2026-06-04 cs.LG cs.RO cs.SY eess.SY 77%

Barrier-Certified Adaptive Reinforcement Learning with Applications to Brushbot Navigation

具有应用的障碍证书自适应强化学习:Brushbot导航

Motoya Ohnishi, Li Wang, Gennaro Notomista, Magnus Egerstedt

机构 * School of Electrical Engineering, Royal Institute of Technology(皇家理工学院电气工程学院) Georgia Institute of Technology(佐治亚理工学院) RIKEN Center for Advanced Intelligence Project(日本理化学研究所高级智能研究中心) School of Mechanical Engineering(机械工程学院)

专题命中 模仿学习与强化学习 :navigation(title);分类 cs.RO、cs.LG;robotics(journal_ref)

AI总结 本文提出了一种安全学习框架,结合自适应模型学习算法和障碍证书,用于具有可能非平稳智能体动态的系统。通过稀疏优化技术提取模型的动态结构,并利用学习的模型结合控制障碍证书来约束策略(反馈控制器),以保持安全性,即避免特定的不利状态空间区域。在某些条件下,保证了在安全被非平稳性破坏后,以李雅普诺夫稳定性的方式恢复安全。此外,将动作-价值函数近似重新公式化,使任何基于内核的非线性函数估计方法都能应用于我们的自适应学习框架。最后,保证了障碍证书策略优化的解是全局最优的,确保在温和条件下进行贪心策略改进。所得到的框架通过四旋翼无人机的模拟进行验证,该无人机此前在安全学习文献中被假设为平稳性,然后在动态未知、高度复杂且非平稳的Brushbot机器人上进行测试。

Comments ©2019 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

Journal ref Published in IEEE Transactions on Robotics, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.10371 2026-06-04 cs.RO cs.LG cs.SY eess.SY 76%

Reinforcement learning for non-prehensile manipulation: Transfer from simulation to physical system

基于非操控操作的强化学习:从仿真到物理系统的迁移

Kendall Lowrey, Svetoslav Kolev, Jeremy Dao, Aravind Rajeswaran, Emanuel Todorov

机构 * University of Washington(华盛顿大学) Roboti LLC(Roboti公司)

专题命中 模仿学习与强化学习 :manipulation(title);分类 cs.RO、cs.LG

AI总结 本文提出了一种基于仿真的强化学习方法,用于非操控操作任务,通过在仿真环境中训练策略,成功迁移到物理系统中,且在模型集合训练下提升了策略的鲁棒性。

Comments Accepted at IEEE SIMPAR 2018. Project page: https://sites.google.com/view/phantomsim2real

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.03314 2026-06-04 cs.CV cs.SY eess.SY 74%

A Robotic Auto-Focus System based on Deep Reinforcement Learning

基于深度强化学习的机器人自动对焦系统

Xiaofan Yu, Runze Yu, Jingsong Yang, Xiaohui Duan

机构 * Center of Wireless Communication and Signal Processing(无线通信与信号处理中心)

专题命中 模仿学习与强化学习 :robotic(title);分类 cs.CV

AI总结 本文提出一种端到端的自动对焦方法,通过深度强化学习在视觉输入中学习对焦策略,实现自动清晰成像。方法通过离散化动作空间和应用DQN,解决自动对焦问题并推广至基于视觉的控制问题。

Comments To Appear at ICARCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.08705 2026-06-04 cs.RO cs.AI cs.LG cs.SY eess.SY 67%

A General Framework for Structured Learning of Mechanical Systems

结构机械系统学习的通用框架

Jayesh K. Gupta, Kunal Menda, Zachary Manchester, Mykel J. Kochenderfer

机构 * Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种通用框架,用于结构化学习机械系统,通过结合先验知识和训练表达式近似器来提高模型的准确性和效率。

Comments 10 pages, 7 figures. First two authors contributed equally. Submitted to IROS/RA-L. Code at https://github.com/sisl/mechamodlearn/

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.11706 2026-06-04 cs.LG cs.AI cs.RO cs.SY eess.SY stat.ML 67%

Supervised Policy Update for Deep Reinforcement Learning

深度强化学习中的监督策略更新

Quan Vuong, Yiming Zhang, Keith W. Ross

机构 * University of California, San Diego(加州大学圣地亚哥分校) New York University(纽约大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种新的样本效率高的方法,称为监督策略更新(SPU),用于深度强化学习。该方法通过当前策略生成的数据,在非参数化的近端策略空间中构建并求解一个约束优化问题,然后利用监督回归将最优的非参数化策略转换为参数化策略,从而生成新的样本。该方法适用于离散和连续动作空间,并能处理多种接近约束。本文展示了如何通过该方法解决自然策略梯度和信任区域策略优化(NPG/TRPO)以及近端策略优化(PPO)问题。SPU的实现比TRPO更简单,在样本效率方面,实验表明SPU在Mujoco模拟机器人任务中优于TRPO,在Atari视频游戏任务中优于PPO。

Comments Accepted as a conference paper at ICLR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.00748 2026-06-04 cs.LG cs.AI cs.RO cs.SY eess.SY 67%

Continuous Deep Q-Learning with Model-based Acceleration

基于模型的连续深度Q学习加速

Shixiang Gu, Timothy Lillicrap, Ilya Sutskever, Sergey Levine

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出连续深度Q学习算法NAF及基于模型的加速方法,用于提升连续控制任务的样本效率和学习速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.02312 2026-06-04 cs.AI cs.LG cs.RO cs.SY eess.SY 67%

A Framework for Constrained and Adaptive Behavior-Based Agents

一种用于约束和自适应行为基 agent 的框架

Renato de Pontes Pereira, Paulo Martins Engel

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种框架,通过强化学习节点整合到行为树中,解决约束 agent 的学习能力问题,并展示其与分层强化学习选项的关系,确保嵌套学习节点的收敛性。

Comments 2015; 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.01250 2026-06-04 cs.RO cs.LG cs.SY eess.SY 66%

Virtual vs. Real: Trading Off Simulations and Physical Experiments in Reinforcement Learning with Bayesian Optimization

虚拟与现实:在强化学习中权衡模拟与物理实验

Alonso Marco, Felix Berkenkamp, Philipp Hennig, Angela P. Schoellig, Andreas Krause, Stefan Schaal, Sebastian Trimpe

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG;robotics(comments)

AI总结 本文提出利用模拟数据优化强化学习,通过结合低成本但不准确的模拟信息与高成本但准确的物理实验,提高效率。

Comments 7 pages, 6 figures, to appear in IEEE 2017 International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04749 2026-06-04 cs.RO cs.LG 62%

COP-Q: Safety-First Reinforcement Learning for Robot Control via Cholesky-Ordered Projection

COP-Q:基于Cholesky有序投影的安全优先强化学习机器人控制

Guopeng Li, Moritz A. Zanger, Matthijs T. J. Spaan, Julian F. P. Kooij

机构 * Department of Cognitive Robotics, Delft University of Technology(代尔夫特理工大学认知机器人系) Department of Intelligent Systems, Delft University of Technology(代尔夫特理工大学智能系统系) School of Transportation, Southeast University(东南大学交通学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 提出COP-Q方法,通过Cholesky分解编码目标优先级并利用联合Q值空间的广义置信界,在安全优先的离线策略强化学习中平衡安全与奖励目标,减少过度保守性,提升样本效率。

Comments 7 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.02219 2026-06-04 cs.RO cs.LG cs.SY eess.SY 62%

Training in Task Space to Speed Up and Guide Reinforcement Learning

在任务空间中训练以加速和引导强化学习

Guillaume Bellegarda, Katie Byl

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出在任务空间中训练以提高强化学习的效率和稳定性,通过简化高自由度系统模型、利用正逆运动学以及在笛卡尔空间中学习运动策略,从而减少样本复杂度和训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.00113 2026-06-04 eess.SY cs.LG cs.RO cs.SY math.OC 62%

Learning Stabilizable Dynamical Systems via Control Contraction Metrics

通过控制收缩度量学习可稳定化的动态系统

Sumeet Singh, Vikas Sindhwani, Jean-Jacques E. Slotine, Marco Pavone

机构 * Dept. of Aeronautics and Astronautics, Stanford University(航空航天系,斯坦福大学) Google Brain Robotics, New York(谷歌大脑机器人,纽约) Dept. of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种新的框架,用于学习可稳定化的非线性动态系统,以实现机器人连续控制任务。核心方法是开发一种基于稳定性的控制理论正则化器,以确保学习到的系统可以配备一个稳健的控制器,能够稳定任何系统生成的开环轨迹。通过利用收缩理论、统计学习和凸优化工具,我们提供了一个通用且可操作的半监督算法来学习可稳定化的动态系统,可以应用于复杂的欠驱动系统。在模拟平面四旋翼系统上验证了所提算法,并观察到与传统回归技术学习的模型相比,使用控制理论正则化模型在轨迹生成和跟踪性能上有显著改进,尤其是在使用少量示范示例时。结果展示了将标准基于模型的强化学习算法与非线性控制理论概念结合的必要性,以提高可靠性。

Comments To appear at WAFR 2018. v2: re-structured Sections 3 & 4 to improve clarity; expanded discussion on limitations & future work in Section 5; added details on training & validation, significantly expanded experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.09342 2026-06-04 eess.SY cs.LG cs.RO cs.SY math.OC 62%

Optimal and Learning Control for Autonomous Robots

自主机器人最优与学习控制

Jonas Buchli, Farbod Farshidian, Alexander Winkler, Timothy Sandy, Markus Giftthaler

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文基于最优控制与强化学习,从统一视角探讨自主机器人闭环控制问题,提供统一符号和术语对比,帮助理解不同领域方法。

Comments Lecture Notes, 101 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.05984 2026-06-04 cs.NE cs.AI cs.LG cs.SY eess.SY 62%

Particle Swarm Optimization for Generating Interpretable Fuzzy Reinforcement Learning Policies

粒子群优化用于生成可解释的模糊强化学习策略

Daniel Hein, Alexander Hentschel, Thomas Runkler, Steffen Udluft

机构 * Siemens AG, Corporate Technology(西门子公司企业技术部)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于模糊粒子群强化学习(FPSRL)的方法,通过训练参数在模拟真实系统动态的世界模型上生成可解释的模糊强化学习策略,适用于无法进行在线学习的领域。

Journal ref Engineering Applications of Artificial Intelligence, Volume 65C, October 2017, Pages 87-98

详情

展开后加载摘要…

URL PDF HTML 收藏