arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-01 至 2026-07-01 共收录 6 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 6 篇

2606.31846 2026-07-01 cs.RO cs.AI 新提交 73%

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models

Z-1: 面向视觉-语言-动作模型的高效强化学习

Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

机构 * Zioneer Robot Team(Zioneer机器人团队)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出Z-1框架,结合共享前缀生成、树状轨迹分支、完成感知奖励校准和选择性联合训练,通过GRPO策略在24个RoboCasa任务上平均成功率80.6%,较SFT提升13.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31377 2026-07-01 cs.RO cs.AI 新提交 73%

Stage-Transition Dense Reward Modeling for Reinforcement Learning

面向强化学习的阶段转换密集奖励建模

Yang Yang, Bingjie Chen, Zihan Wang, Yizhe Li, Guoping Pan, Yi Cheng, Houde Liu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Zerith Robotics

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出阶段转换密集奖励(STDR)框架,利用专家视频学习任务阶段结构,提供阶段转换和阶段内进展两种密集奖励信号,结合OOD检测和抓取调节模块,提升机器人操作任务的样本效率和成功率。

Comments 8 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17534 2026-07-01 physics.flu-dyn cs.AI cs.LG 版本更新 73%

The HydroGym Reinforcement Learning Platform for Fluid Dynamics

HydroGym:流体动力学的强化学习平台

Christian Lagemann, Sajeda Mokbel, Miro Gondrum, Mario Rüttgers, Yuning Wang, Pol Suárez, Ludger Paehler, Deniz A. Bezgin, Aaron B. Buhendwa, Jared L. Callaham, Samuel Ahnert, Nicholas Zolman, Xiao Shao, Jean-Christophe Loiseau, Nikolaus Adams, Matthias Meinke, Wolfgang Schröder, Kai Lagemann, Esther Lagemann, Ricardo Vinuesa, Steven L. Brunton

机构 * University of Washington(华盛顿大学) AI Institute in Dynamic Systems, University of Washington(华盛顿大学人工智能研究所) RWTH Aachen University(亚琛工业大学) Inha University(仁荷大学) University of Michigan(密歇根大学) KTH Royal Institute of Technology(瑞典皇家理工学院) Technical University of Munich(慕尼黑工业大学) Arts et Métiers Institute of Technology(国立高等工程技术学校) CNAM(法国国立工艺学院) DynFluid, HESAM Université(HESAM大学流体动力学实验室) Munich Institute of Integrated Materials, Energy and Process Engineering, Technical University of Munich(慕尼黑工业大学综合材料、能源与工艺工程研究所) JARA Center for Simulation and Data Science, RWTH Aachen University(亚琛工业大学JARA模拟与数据中心) MediaTek Research(联发科技研究中心) German Center for Neurodegenerative Diseases(德国神经退行性疾病中心)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.AI、cs.LG

AI总结 提出HydroGym,一个求解器无关的强化学习平台,提供61+个已验证的流场环境,支持多种后端,RL智能体发现鲁棒控制原理,并实现零样本迁移,显著降低探索成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08653 2026-07-01 cs.RO 版本更新 65%

High-Speed Vision-Based Flight in Clutter with Safety-Shielded Reinforcement Learning

基于安全盾牌强化学习的高速度视觉飞行在杂乱环境中

Jiarui Zhang, Chengyong Lei, Chengjiang Dai, Kenghou Hoi, Lijie Wang, Zhichao Han, Fei Gao

机构 * Institute of Cyber-Systems and Control, College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院工业控制技术研究所) Differential Robotics(微分机器人)

专题命中 模仿学习与强化学习 :navigation(abstract);robotics(comments,journal_ref);分类 cs.RO

AI总结 提出一种结合模型安全机制的端到端强化学习框架,通过物理信息奖励和实时安全滤波器实现高速飞行与严格避障,在杂乱环境和森林中速度达7.5 m/s。

Comments Published in IEEE Robotics and Automation Letters

Journal ref IEEE Robotics and Automation Letters, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31372 2026-07-01 cs.SE 新提交 50%

Failure-Based Testing for Deep Reinforcement Learning Agents

基于失败的深度强化学习智能体测试方法

Weibin Lin, Jiangtao Meng, Zheng Zheng

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 针对深度强化学习智能体测试中奖励信号失效的问题,提出一种基于任务失败洞察的黑盒测试方法PRT,通过优先测试高难度任务来提升故障检测效率,在四个基准上测试成本降低超50%。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08566 2026-07-01 cond-mat.soft cond-mat.stat-mech 版本更新 50%

Homing through Reinforcement Learning

通过强化学习实现归巢

Riya Singh, Pratikshya Jena, Anish Kumar, Shradha Mishra

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 提出强化学习框架模拟连续二维域中的自适应归巢,发现平均归巢时间随旋转扩散强度呈非单调变化,且RL智能体比主动布朗粒子更快、更定向。

详情

展开后加载摘要…

URL PDF HTML 收藏