arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-17 至 2026-03-17 共收录 13 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 13 篇

2510.21758 2026-03-17 cs.RO cs.LG 86%

Taxonomy and Trends in Reinforcement Learning for Robotics and Control Systems: A Structured Review

强化学习在机器人与控制系统中的分类与趋势:一种结构化综述

Kumater Ter, Abolanle Adetifa, Daniel Udekwe

专题命中 模仿学习与强化学习 :robotics(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文综述了强化学习原理、深度强化学习算法及其在机器人和控制系统中的应用,探讨了核心算法策略及现代DRL技术,旨在连接理论进展与实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07976 2026-03-17 cs.RO cs.CV 84%

VLD: Visual Language Goal Distance for Reinforcement Learning Navigation

VLD:用于强化学习导航的视觉语言目标距离

Lazar Milikic, Manthan Patel, Jonas Frey

机构 * ETH Zurich(苏黎世联邦理工学院) EPFL(瑞士联邦理工学院) Stanford University(斯坦福大学) UC Berkeley(伯克利大学)

专题命中 模仿学习与强化学习 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出VLD学习框架,通过解耦感知学习与策略学习,利用大规模视频数据训练距离预测器,提升机器人导航性能与现实迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17424 2026-03-17 cs.RO cs.LG 81%

Certificated Actor-Critic: Hierarchical Reinforcement Learning with Control Barrier Functions for Safe Navigation

可信的Actor-Critic:基于控制屏障函数的分层强化学习用于安全导航

Junjun Xie, Shuhao Zhao, Liang Hu, Huijun Gao

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出可信Actor-Critic算法,结合控制屏障函数设计分层强化学习框架,通过理论分析和实验验证,提升机器人安全导航性能。

Comments Accepted to ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15370 2026-03-17 cs.CV 79%

Trajectory-Diversity-Driven Robust Vision-and-Language Navigation

轨迹多样性驱动的鲁棒视觉-语言导航

Jiangyang Li, Cong Wan, SongLin Dong, Chenhao Ding, Qiang Wang, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术大学微电子学院)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.CV

AI总结 本文提出NavGRPO框架,通过群体相对策略优化实现目标导向的导航策略学习,在未见环境中提升鲁棒性,实验显示在R2R和REVERIE基准上SPL提升达3.0%和1.71%。

Comments 17pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14811 2026-03-17 cs.RO cs.CV 73%

Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning

从自身视角到世界视角:通过强化学习实现具身系统的协作空间推理

Heng Zhou, Li Kang, Yiran Qin, Xiufeng Song, Ao Yu, Zilu Zhang, Haoming Song, Kaixin Xu, Yuchen Fan, Dongzhan Zhou, Xiaohong Liu, Ruimao Zhang, Philip Torr, Lei Bai, Zhenfei Yin

专题命中 模仿学习与强化学习 :embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出E2W基准和CoRL框架,通过结合链式推理监督微调与强化学习,解决多智能体系统中分布式视角下的空间推理问题,实现跨视角实体识别与任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13925 2026-03-17 cs.RO cs.AI 73%

SmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness Optimization

SmoothVLA: 通过内在平滑性优化对齐视觉-语言-动作模型与物理约束

Jiashun Li, Xiaoyu Shi, Hong Xie, Mingsheng Shang, Yun Lu

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 SmoothVLA通过内在平滑性优化对齐视觉-语言-动作模型与物理约束,结合物理指导的混合奖励函数和GRPO方法,提升轨迹平滑度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15388 2026-03-17 cs.LG cs.AI cs.RO stat.ML 67%

Efficient Morphology-Control Co-Design via Stackelberg Proximal Policy Optimization

通过Stackelberg近端策略优化实现高效的形态-控制协同设计

Yanning Dai, Yuhui Wang, Dylan R. Ashley, Jürgen Schmidhuber

机构 * Center of Excellence for Generative AI, King Abdullah University of Science and Technology (KAUST)(生成人工智能卓越中心,卡奥斯特大学) Dalle Molle Institute for Artificial Intelligence Research (IDSIA)(人工智能研究达勒莫利研究所) Università della Svizzera italiana (USI)(瑞士意大利大学) Scuola universitaria professionale della Svizzera italiana (SUPSI)(瑞士意大利专业大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出Stackelberg PPO方法,通过将形态与控制的内在耦合建模为Stackelberg博弈变体,解决形态与控制策略的协同优化问题,提升机器人设计效率。

Comments presented at the Fourteenth International Conference on Learning Representations; 11 pages in main text + 3 pages of references + 23 pages of appendices, 5 figures in main text + 11 figures in appendices, 16 tables in appendices; accompanying website available at https://yanningdai.github.io/stackelberg-ppo-co-design/ ; source code available at https://github.com/YanningDai/StackelbergPPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13782 2026-03-17 cs.RO cs.CV 66%

Your Vision-Language-Action Model Already Has Attention Heads For Path Deviation Detection

您的视觉-语言-动作模型已具备路径偏差检测的注意力头

Jaehwan Jeong, Evelyn Zhu, Jinying Lin, Emmanuel Jaimes, Tuan-Anh Vu, Jungseock Joo, Sangpil Kim, M. Khalid Jawed

专题命中 模仿学习与强化学习 :navigation(abstract,comments);分类 cs.RO、cs.CV

AI总结 本文提出一种无需训练的异常检测框架,通过监控VLA模型中的三个注意力头实时检测路径偏差,并利用轻量级RL策略进行恢复,展示了其在物理机器人上的实际鲁棒性。

Comments Keywords: Vision-Language Action (VLA), Reinforcement Learning (RL), Navigation Path Recovery, Robot Operating System (ROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15418 2026-03-17 cs.RO cs.AI 62%

MA-VLCM: A Vision Language Critic Model for Value Estimation of Policies in Multi-Agent Team Settings

MA-VLCM:一种用于多智能体团队设置中策略价值估计的视觉语言批评模型

Shahil Shaik, Aditya Parameshwaran, Anshul Nayak, Jonathon M. Smereka, Yue Wang

机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Clemson University(克莱姆斯大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出MA-VLCM,通过预训练的视觉语言模型替代传统集中批评者,提升多智能体强化学习的样本效率和泛化能力,适用于资源受限的机器人部署。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14908 2026-03-17 cs.RO cs.CV 62%

PerlAD: Towards Enhanced Closed-loop End-to-end Autonomous Driving with Pseudo-simulation-based Reinforcement Learning

PerlAD:基于伪模拟的强化学习在闭环端到端自动驾驶中的应用

Yinfeng Gao, Qichao Zhang, Deqing Liu, Zhongpu Xia, Guang Li, Kun Ma, Guang Chen, Hangjun Ye, Long Chen, Da-Wei Ding, Dongbin Zhao

机构 * School of Automation and Electrical Engineering, University of Science and Technology Beijing(北京科技大学自动化与电气工程学院) Xiaomi EV(小牛电动车) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.CV

AI总结 PerlAD通过伪模拟强化学习方法解决闭环端到端自动驾驶中训练与现实需求不匹配的问题,利用向量空间构建伪模拟环境,结合预测世界模型和分层解耦规划器,实现高效训练和规划,实验表明其在Bench2Drive和DOS基准上均表现优异。

Comments Accepted by IEEE RA-L. Submitted: 2025.12.2; Revised: 2026.2.4; Accepeted: 2026.3.7

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13295 2026-03-17 cs.LG cs.AI 62%

ICPRL: Acquiring Physical Intuition from Interactive Control

ICPRL: 从交互控制中获取物理直觉

Xinrun Xu, Pi Bu, Ye Wang, Börje F. Karlsson, Ziming Wang, Tengtao Song, Qi Zhu, Jun Song, Shuo Zhang, Zhiming Ding, Bo Zheng

机构 * Institute of Software, Chinese Academy of Science(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) RUC(中国人民大学) PUC-Rio(里约热内卢联邦大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 ICPRL通过多轮组相对策略优化,使VLM在动态物理环境中获取物理直觉并适应策略,其世界模型预测潜在动作结果,提升物理谜题解决能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03592 2026-03-17 cs.LG cs.AI cs.MA cs.RO 60%

Deep Reinforcement Learning for Multi-Agent Coordination

多智能体协调的深度强化学习

Kehinde O. Aina, Sehoon Ha

专题命中 模仿学习与强化学习 :robotics(comments,journal_ref);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种基于信息素的多智能体深度强化学习框架,通过虚拟信息素模拟局部和社会交互,实现无通信的去中心化协调,解决狭窄环境中多机器人协作的挑战。

Comments 11 pages, 8 figures, 1 table, presented at SWARM 2022, to be published in Journal of Artificial Life and Robotics

Journal ref Artificial Life and Robotics (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18002 2026-03-17 cs.RO 57%

Humanoid Goalkeeper: Learning from Position Conditioned Task-Motion Constraints

人形守门员:从位置条件任务-运动约束中学习

Junli Ren, Junfeng Long, Tao Huang, Huayi Wang, Zirui Wang, Feiyu Jia, Wentao Zhang, Jingbo Wang, Ping Luo, Jiangmiao Pang

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种强化学习框架,用于人形机器人在真实环境中自主守门。通过整合感知输入的多个人类动作先验,学习端到端RL策略,实现自然、动态的机器人与物体交互。

详情

展开后加载摘要…

URL PDF HTML 收藏