arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-16 至 2026-04-16 共收录 5 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 5 篇

2512.01773 2026-04-16 cs.RO 85%

IGen: Scalable Data Generation for Robot Learning from Open-World Images

IGen: 为机器人学习从开放世界图像中实现可扩展的数据生成

Chenghao Gu, Haolan Kang, Junchao Lin, Jinghe Wang, Duo Wu, Shuzhao Xie, Fanding Huang, Junchen Ge, Ziyang Gong, Letian Li, Hongying Zheng, Changwei Lv, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) Beijing University of Chemical Technology(北京化工大学) Shanghai Jiao Tong University(上海交通大学) Shenzhen University of Infomation Technology(深圳信息大学)

专题命中 机器人学习 :robot learning(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出IGen框架,通过开放世界图像生成高质量的视觉-运动数据,验证了其在机器人学习中的有效性。

Comments 8 pages, 8 figures; Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00573 2026-04-16 cs.RO 77%

GRITS: A Spillage-Aware Guided Diffusion Policy for Robot Food Scooping Tasks

GRITS:一种考虑泄漏的引导扩散策略用于机器人食物舀取任务

Yen-Ling Tai, Yi-Ru Yang, Kuan-Ting Yu, Yu-Wei Chao, Yi-Ting Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) XYZ Robotics(XYZ机器人公司) NVIDIA

专题命中 机器人学习 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 GRITS通过引导扩散策略减少食物泄漏,提高机器人食物舀取任务的可靠性与成功率,实验表明其在任务成功率和泄漏率上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04671 2026-04-16 cs.RO cs.AI cs.CV 75%

X-Diffusion: Training Diffusion Policies on Cross-Embodiment Human Demonstrations

X-Diffusion:在跨具身人类示范上训练扩散策略

Maximus A. Pace, Prithwish Dan, Chuanruo Ning, Atiksh Bhardwaj, Audrey Du, Edward W. Duan, Wei-Chiu Ma, Kushal Kedia

机构 * Cornell University(康奈尔大学)

专题命中 机器人学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出X-Diffusion框架,通过在噪声人类动作上训练扩散策略,提升机器人任务成功率16%。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06168 2026-04-16 cs.CV cs.RO 73%

Action Images: End-to-End Policy Learning via Multiview Video Generation

动作图像:通过多视图视频生成实现端到端策略学习

Haoyu Zhen, Zixian Gao, Qiao Sun, Yilin Zhao, Yuncong Yang, Yilun Du, Pengsheng Guo, Tsun-Hsuan Wang, Yi-Ling Qiao, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) NVIDIA(英伟达) Harvard University(哈佛大学) Genesis AI

专题命中 机器人学习 :world model(abstract);robot policy(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Action Images,通过多视图视频生成实现策略学习,利用像素化的动作表示,使视频模型本身成为零样本策略,提升视频-动作联合生成质量。

Comments Project Page: https://actionimages.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19054 2026-04-16 cs.LG 57%

RANDPOL: Parameter-Efficient End-to-End Quadruped Locomotion via Randomized Policy Learning

RANDPOL: 通过随机策略学习实现参数高效的端到端四足运动

Zhuochen Liu, Rahul Jain, Quan Nguyen

机构 * Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California(明希德电气与计算机工程系,南加州大学) Department of Aerospace & Mechanical Engineering, University of Southern California(航空航天与机械工程系,南加州大学)

专题命中 机器人学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出RANDPOL,一种通过随机初始化隐藏层实现参数高效端到端四足运动控制的方法,相比PPO在参数量、计算效率和性能-复杂度平衡上表现更优。

Comments 6 pages main, 7 pages total, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏