arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-30 至 2026-06-30 共收录 6 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 6 篇

2602.13977 2026-06-30 cs.RO cs.AI 84%

WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL

WoVR:基于世界模型的可靠模拟器用于训练后VLA策略的强化学习

Zhennan Jiang, Shangqing Zhou, Yutong Jiang, Zefang Huang, Mingjie Wei, Yuhui Chen, Tianxing Zhou, Zhen Guo, Hao Lin, Quanlu Zhang, Yu Wang, Haoran Li, Chao Yu, Dongbin Zhao

专题命中 模仿学习与强化学习 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出WoVR框架,通过可控动作条件视频世界模型和关键帧初始化回放提升模拟稳定性,实现稳定长周期模拟回放和有效策略优化,取得优于LIBERO的性能。

Comments 25pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02714 2026-06-30 cs.CV 79%

ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving

ExploreVLA: 为端到端自动驾驶的密集世界建模与探索

Zihao Sheng, Xin Ye, Jingru Luo, Sikai Chen, Liu Ren

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.CV

AI总结 本文提出基于世界建模的统一理解与生成框架,通过密集监督和内在奖励提升自动驾驶策略探索能力,在NAVSIM和nuScenes基准上取得优异性能。

Comments Accepted to ECCV 2026. The code is available at https://zihaosheng.github.io/ExploreVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30192 2026-06-30 cs.AI 70%

Domain Adaptation with Adaptive Imagination for Visual Reinforcement Learning under Limited Target Data

面向有限目标数据的视觉强化学习自适应想象域适应

Hyunwoo Park, Sang-Hyun Lee

机构 * STRADVISION Department of Mobility Engineering, Ajou University(移动工程系,阿乔大学)

专题命中 模仿学习与强化学习 :robotics(abstract,abstract_cn);分类 cs.AI

AI总结 提出AIDA框架,通过自适应想象生成可靠轨迹增强有限目标数据,并利用自一致性损失学习语义状态表示,在少数据下提升视觉强化学习迁移性能。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29867 2026-06-30 cs.LG cs.AI 62%

RoAd-RL: A Unified Library and Benchmark for Robust Adversarial Reinforcement Learning

RoAd-RL:鲁棒对抗强化学习的统一库与基准

Adithya Mohan, Daniel Kriegl, Torsten Schön

机构 * Hightech-Agenda Bayern(巴伐利亚高科技议程)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出RoAd-RL开源基准框架,统一策略、攻击、防御和鲁棒性指标,评估192种配置下DQN/PPO/SAC的鲁棒性,发现常用防御可能比攻击更有害。

Comments Accepted at ICECCME'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06347 2026-06-30 cs.RO cs.AI 62%

Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning

多目标离线强化学习中的目标条件决策变压器

Paweł Gajewski, Dominik Żurek, Marcin Pietroń, Kamil Faber

机构 * Faculty of Computer Science, AGH University of Krakow(计算机科学学院,克拉科夫AGH大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种目标条件决策变压器,用于多目标离线强化学习,通过显式整合目标状态到序列建模框架中,有效解决不同任务,仅使用预收集数据,并在Franka Emika Panda平台上验证,优于现有在线基线。

Journal ref Computational Science -- ICCS 2026, Lecture Notes in Computer Science, vol. 16784, Springer, Cham, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29032 2026-06-30 cs.LG stat.ML 57%

Theoretical Foundations and Effective Algorithms for Policy-Aware Simulator Learning

策略感知模拟器学习的理论基础与有效算法

Christoph Dann, Yishay Mansour, Mehryar Mohri

机构 * Google Research(谷歌研究) Tel Aviv University(特拉维夫大学) Courant Institute of Mathematical Sciences(数学科学学院)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 针对模型强化学习中模拟器利用问题,提出以策略鲁棒性为目标,通过零和极小极大博弈学习模拟器,并给出理论保证与有效算法。

详情

展开后加载摘要…

URL PDF HTML 收藏