arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-02 至 2026-04-02 共收录 6 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 6 篇

2604.00055 2026-04-02 cs.RO cs.CV cs.LG 87%

Generalizable Dense Reward for Long-Horizon Robotic Tasks

可泛化的密集奖励用于长周期机器人任务

Silong Yong, Stephen Sheng, Carl Qi, Xiaojie Wang, Evan Sheehan, Anurag Shivaprasad, Yaqi Xie, Katia Sycara, Yesh Dattatreya

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Robotics(亚马逊机器人) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 模仿学习与强化学习 :robotic(title,abstract);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出VLLR框架,结合外部奖励和内部奖励提升长周期机器人任务性能,通过任务分解和自信心引导实现无需人工奖励工程的高效训练。

Comments Project page: https://silongyong.github.io/vllr_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24587 2026-04-02 cs.LG cs.RO 81%

DreamerAD: Efficient Reinforcement Learning via Latent World Model for Autonomous Driving

DreamerAD:通过潜在世界模型实现高效的强化学习用于自动驾驶

Pengxuan Yang, Yupeng Zheng, Deheng Qian, Zebin Xing, Qichao Zhang, Linbo Wang, Yichen Zhang, Shaoyu Guo, Zhongpu Xia, Qiang Chen, Junyu Han, Lingyun Xu, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Advanced Interdisciplinary Sciences, UCAS(中国科学院大学先进交叉科学学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.RO、cs.LG

AI总结 DreamerAD通过压缩扩散采样将步骤从100步减少到1步,实现80倍加速并保持视觉可解释性,解决了自动驾驶中真实世界数据训练成本高和安全风险大的问题。

Comments authors update

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27317 2026-04-02 cs.RO 79%

Where-to-Learn: Analytical Policy Gradient Directed Exploration for On-Policy Robotic Reinforcement Learning

Where-to-Learn: 分析性策略梯度引导的在线机器人强化学习探索

Leixin Chang, Xinchen Yao, Ben Liu, Liangjing Yang, Hua Chen

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出利用可微动力学模型的分析性策略梯度,引导机器人强化学习探索更优轨迹,提升策略学习效率和质量。

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00557 2026-04-02 cs.RO cs.CV cs.LG 75%

Multi-Camera View Scaling for Data-Efficient Robot Imitation Learning

多摄像头视角缩放用于数据高效的机器人模仿学习

Yichen Xie, Yixiao Wang, Shuqi Zhao, Cheng-En Wu, Masayoshi Tomizuka, Jianwen Xie, Hao-Shu Fang

机构 * UC Berkeley(加州大学伯克利分校) Lambda, Inc(Lambda公司) MIT(麻省理工学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出一种利用场景多样性提升机器人模仿学习数据效率的方法,通过摄像头视角缩放生成伪演示,增强视觉表示的视角不变性,并在仿真和现实任务中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01064 2026-04-02 cs.RO 57%

BAT: Balancing Agility and Stability via Online Policy Switching for Long-Horizon Whole-Body Humanoid Control

BAT:通过在线策略切换平衡敏捷性与稳定性以实现长周期全身人形控制

Donghoon Baek, Sang-Hun Kim, Sehoon Ha

机构 * Georgia Institute of Technology(佐治亚理工学院) Samsung Research(三星研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出BAT框架,通过在线策略切换平衡敏捷性与稳定性,实现长周期全身人形控制,实验表明其在多样任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00391 2026-04-02 cs.RO cs.SY eess.SY 57%

Behavioral Score Diffusion: Model-Free Trajectory Planning via Kernel-Based Score Estimation from Data

行为得分扩散:通过核基得分估计实现无模型轨迹规划

Shihao Li, Jiachen Li, Jiamin Xu, Dongmei Chen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出行为得分扩散(BSD),通过核加权估计直接从轨迹数据中计算扩散得分函数,无需学习模型或动力学模型,在停车场景中实现高效轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏