arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 60891 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 858 篇

2606.05960 2026-06-05 cs.RO 70%

Towards a Data Flywheel for Embodied Intelligence in Logistics

面向物流具身智能的数据飞轮

Anlan Yu, Zaishu Chen, Zhiqing Hong, Daqing Zhang

机构 * Peking University(北京大学) JD Logistics(京东物流) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 机器人学习 :manipulation(abstract);world model(abstract);分类 cs.RO

AI总结 提出一种数据驱动的物流具身智能框架,通过构建数据飞轮将日常操作转化为可复用数据资产,利用世界模型生成长尾包裹操作的可靠监督,并整合多模态数据实现策略持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06218 2026-05-26 cs.RO 70%

Few-Shot Neural Differentiable Simulator: Real-to-Sim Rigid-Contact Modeling

少样本神经可微模拟器:真实到模拟的刚体接触建模

Zhenhao Huang, Siyuan Luo, Bingyang Zhou, Ziqiu Zeng, Jason Pho, Fan Shi

机构 * National University of Singapore(新加坡国立大学) Prana Lab(Prana实验室)

专题命中 机器人学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种结合解析公式物理一致性与图神经网络表示能力的少样本真实到模拟方法,通过少量真实数据校准解析模拟器生成大规模合成数据集,并引入基于网格的图神经网络隐式建模刚体前向动力学及碰撞检测的代理梯度,实现完全可微性,从而提升模拟保真度和策略学习效率。

Comments Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16871 2026-05-19 cs.RO 70%

SADP: Subgoal-Aware Diffusion Policy for Explainable Robots Learned from Foundation Model Generated Demonstrations

SADP:基于基础模型生成示范的子目标感知扩散策略用于可解释机器人

Site Hu, Takato Horii

机构 * Department of Systems Innovation, Graduate School of Engineering Science, Osaka University(系统创新系,工学研究科,大阪大学)

专题命中 机器人学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出SADP,一种基于基础模型生成示范的子目标感知扩散策略,用于可解释机器人,通过自主生成子目标标注的示范数据,训练扩散策略,使机器人能够通过子目标结构和执行进度向用户解释决策过程,从而在长周期操作中实现更高的任务成功率和故障诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06067 2026-04-08 cs.RO 70%

HiPolicy: Hierarchical Multi-Frequency Action Chunking for Policy Learning

HiPolicy:分层多频动作分块用于策略学习

Jiyao Zhang, Zimu Han, Junhan Wang, Xionghao Wu, Shihong Lin, Jinzhou Li, Hongwei Fan, Ruihai Wu, Dongjiang Li, Hao Dong

机构 * CFCS, School of CS, PKU(北京大学计算机学院计算与金融研究中心) National Key Laboratory for Multimedia Information Processing, School of CS, PKU(北京大学计算机学院多媒体信息处理国家重点实验室) XJTU(西安交通大学) THU(清华大学) BUAA(北京航空航天大学) Jingdong Technology Information Technology Co., Ltd(京东科技信息技术有限公司)

专题命中 机器人学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 HiPolicy通过分层多频动作分块框架,联合预测不同频率的动作序列,以捕捉粗粒度高层次计划和精确的反应动作,提升策略学习的性能和执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01860 2026-04-03 cs.RO 70%

Posterior Optimization with Clipped Objective for Bridging Efficiency and Stability in Generative Policy Learning

后验优化与截断目标:在生成策略学习中平衡效率与稳定性

Yuhui Chen, Haoran Li, Zhennan Jiang, Yuxing Qin, Yuxuan Wan, Weiheng Liu, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CFCS, School of Computer Science, Peking University(北京大学计算机学院前沿计算研究中心) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 机器人学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出POCO框架,通过后验推断方法改进策略,结合离线到在线范式,提升生成模型在机器人操控中的稳定性和效率,实验证明其在多个任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29856 2026-04-01 cs.HC cs.GR cs.RO 70%

An Interactive LLM-Based Simulator for Dementia-Related Activities of Daily Living

基于交互式大语言模型的痴呆相关日常活动模拟器

Kruthika Gangaraju, Shu-Fen Wung, Kevin Berner, Jing Wang, Fengpei Yuan

机构 * Worcester Polytechnic Institute(伍斯特理工学院) University of California Davis(加州大学戴维斯分校) MGH Institute of Health Professionals(麻省总医院健康专业学院) University of New Hampshire(新罕布什尔大学)

专题命中 机器人学习 :robotics(abstract);robot policy(abstract);分类 cs.RO

AI总结 本文提出一个交互式模拟器,利用大语言模型生成痴呆患者在日常活动中的多轮行为,通过专家反馈优化策略,提升辅助AI和机器人在痴呆护理中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28955 2026-04-01 cs.AI 70%

Enhancing Policy Learning with World-Action Model

通过世界-动作模型增强策略学习

Yuci Han, Alper Yilmaz

机构 * Photogrammetry and Computer Vision Lab, The Ohio State University(俄亥俄州立大学摄影测量与计算机视觉实验室)

专题命中 机器人学习 :manipulation(abstract);world model(abstract);分类 cs.AI

AI总结 本文提出World-Action Model,通过联合推理未来视觉观测和驱动状态转移的动作,提升策略学习效果。在CALVIN基准的八项任务中,WAM通过行为克隆和基于模型的PPO优化,显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17240 2026-03-24 cs.CV 70%

GigaWorld-Policy: An Efficient Action-Centered World--Action Model

GigaWorld-Policy: 一种高效的以动作为中心的世界-动作模型

Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jie Li, Jindi Lv, Jingyu Liu, Min Cao, Peng Li, Qiuping Deng, Wenjun Mei, Xiaofeng Wang, Xinze Chen, Xinyu Zhou, Yang Wang, Yifan Chang, Yifan Li, Yukun Zhou, Yun Ye, Zhichao Liu, Zheng Zhu

机构 * GigaAI Project Page(GigaAI项目页) GigaWorld Team(GigaWorld团队)

专题命中 机器人学习 :robot policy(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出GigaWorld-Policy,通过高效动作解码和可选视频生成,解决世界-动作模型在机器人策略学习中的性能瓶颈问题,实验显示其在实际机器人平台上的运行速度提升9倍,任务成功率提高7%。

Comments Added references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13781 2026-03-17 cs.RO 70%

KoopmanFlow: Spectrally Decoupled Generative Control Policy via Koopman Structural Bias

KoopmanFlow: 通过Koopman结构偏差实现谱解耦的生成控制策略

Chengsi Yao, Ge Wang, Kai Kang, Shenhao Yan, Jiahao Yang, Fan Feng, Honghao Cai, Xianxian Zeng, Rongjun Chen, Yiming Zhao, Yatong Han, Xi Li

专题命中 机器人学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出KoopmanFlow,一种基于Koopman结构偏差的生成控制策略,通过统一多模态潜在空间和视觉上下文,分离全局稳定运动与高频局部修正,提升接触密集任务中的控制精度和参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01252 2026-03-10 cs.RO 70%

Diffusion Stabilizer Policy for Automated Surgical Robot Manipulations

扩散稳定策略用于自动化手术机器人操作

Chonlam Ho, Jianshu Hu, Lei Song, Hesheng Wang, Qi Dou, Yutong Ban

机构 * UM-SJTU Joint Intuitute(UM-SJTU联合学院) Shanghai Jiao Tong University(上海交通大学) Department of Computer Science and Engineering(计算机科学与工程系) The Chinese University of Hong Kong(香港中文大学) Department of Automation(自动化系)

专题命中 机器人学习 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出了一种基于扩散的策略学习框架,用于提升手术机器人在不完美或失败轨迹下的操作稳定性与鲁棒性。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09708 2026-02-25 cs.CV cs.AI cs.LG cs.RO 70%

Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

Fast-ThinkAct: 通过可言说的潜在规划实现高效的视觉-语言-动作推理

Chi-Pin Huang, Yunze Man, Zhiding Yu, Min-Hung Chen, Jan Kautz, Yu-Chiang Frank Wang, Fu-En Yang

机构 * NVIDIA(英伟达)

专题命中 机器人学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 Fast-ThinkAct通过可言说的潜在规划实现高效的视觉-语言-动作推理,显著降低推理延迟并保持长周期规划能力。

Comments CVPR 2026. Project page: https://jasper0314-huang.github.io/fast-thinkact/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19184 2026-02-24 cs.RO 70%

Human-to-Robot Interaction: Learning from Video Demonstration for Robot Imitation

人机交互:从视频演示中学习机器人模仿

Thanh Nguyen Canh, Thanh-Tuan Tran, Haolan Zhang, Ziyan Gao, Nak Young Chong, Xiem HoangVan

专题命中 机器人学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究提出了一种基于视频演示的机器人模仿学习方法,通过模块化框架结合时间位移模块和深度强化学习,实现机器人从无结构视频中学习基本操作技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16911 2026-02-20 cs.RO 70%

SparTa: Sparse Graphical Task Models from a Handful of Demonstrations

SparTa:从少量示范中学习稀疏的图形任务模型

Adrian Röfer, Nick Heppert, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Zuse School ELIZA(祖斯学校ELIZA)

专题命中 机器人学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 SparTa通过从少量示范中学习稀疏图形任务模型,提高机器人在不同环境中的可靠执行能力。

Comments 9 pages, 6 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17486 2026-01-27 cs.RO 70%

EquiForm: Noise-Robust SE(3)-Equivariant Policy Learning from 3D Point Clouds

EquiForm: 基于3D点云的噪声鲁棒SE(3)等价政策学习

Zhiyuan Zhang, Yu She

机构 * School of Industrial Engineering, Purdue University(工业工程学院,普渡大学)

专题命中 机器人学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 EquiForm通过引入噪声鲁棒的几何去噪模块和对比等价对齐目标,提升基于3D点云的政策学习在噪声和遮挡下的鲁棒性与泛化能力。

Comments Project website: https://ZhangZhiyuanZhang.github.io/equiform-website/ Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03408 2025-12-01 cs.RO 70%

Efficient Learning of Object Placement with Intra-Category Transfer

高效学习物体摆放的跨类迁移

Adrian Röfer, Russell Buchanan, Max Argus, Sethu Vijayakumar, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) University of Edinburgh(爱丁堡大学) University of Waterloo(滑铁卢大学)

专题命中 机器人学习 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种通过跨类别迁移高效学习物体摆放的方法,利用少量示范训练模型,实现对多种物体的高效任务学习。

Comments 12 pages, 8 figures, 3 tables, accepted at RA-L November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16969 2025-10-31 cs.RO 70%

3D Equivariant Visuomotor Policy Learning via Spherical Projection

Boce Hu, Dian Wang, David Klee, Heng Tian, Xupeng Zhu, Haojie Huang, Robert Platt, Robin Walters

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学)

专题命中 机器人学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18676 2025-09-24 cs.RO cs.SY eess.SY 70%

3D Flow Diffusion Policy: Visuomotor Policy Learning via Generating Flow in 3D Space

Sangjun Noh, Dongwoo Nam, Kangmin Kim, Geonhyup Lee, Yeonguk Yu, Raeyoung Kang, Kyoobin Lee

机构 * School of Integrated Technology (SIT), Gwangju Institute of Science and Technology (GIST)(整合技术学院(SIT)、全州科学技术学院(GIST))

专题命中 机器人学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

Comments 7 main scripts + 2 reference pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09371 2025-09-24 cs.RO 70%

Constrained Style Learning from Imperfect Demonstrations under Task Optimality

Kehan Wen, Chenhao Li, Junzhe He, Marco Hutter

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 机器人学习 :robotics(abstract);robotic(abstract);分类 cs.RO

Comments This paper has been accepted to CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14688 2025-09-19 cs.RO 70%

exUMI: Extensible Robot Teaching System with Action-aware Task-agnostic Tactile Representation

Yue Xu, Litao Wei, Pengyu An, Qingyu Zhang, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO

Comments Accepted at CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02876 2025-09-04 cs.RO 70%

Generalizable Skill Learning for Construction Robots with Crowdsourced Natural Language Instructions, Composable Skills Standardization, and Large Language Model

Hongrui Yu, Vineet R. Kamat, Carol C. Menassa

专题命中 机器人学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

Comments Under review for ASCE OPEN: Multidisciplinary Journal of Civil Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00795 2025-08-04 cs.RO 70%

Video Generators are Robot Policies

Junbang Liang, Pavel Tokmakov, Ruoshi Liu, Sruthi Sudhakar, Paarth Shah, Rares Ambrus, Carl Vondrick

机构 * Columbia University(哥伦比亚大学) Toyota Research Institute(丰田研究院)

专题命中 机器人学习 :manipulation(abstract);robot policy(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06710 2025-07-15 cs.RO 70%

Spatial-Temporal Aware Visuomotor Diffusion Policy Learning

Zhenyang Liu, Yikai Wang, Kuanning Wang, Longfei Liang, Xiangyang Xue, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Nanyang Technological University(南洋理工大学) NeuHelium Co., Ltd(NeuHelium公司)

专题命中 机器人学习 :world model(abstract);robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04331 2025-07-08 cs.RO 70%

Wavelet Policy: Lifting Scheme for Policy Learning in Long-Horizon Tasks

Hao Huang, Shuaihang Yuan, Geeta Chandra Raju Bethala, Congcong Wen, Anthony Tzes, Yi Fang

机构 * Embodied AI and Robotics (AIR) Lab, NYUAD(纽约大学阿布扎克分校 embodied AI 和机器人实验室) NYUAD Center for Artificial Intelligence and Robotics (CAIR)(纽约大学阿布扎克分校人工智能与机器人中心) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 机器人学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

Comments 11 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22473 2025-07-01 cs.RO eess.SP 70%

Unsupervised Discovery of Behavioral Primitives from Sensorimotor Dynamic Functional Connectivity

Fernando Diaz Ledezma, Valentin Marcel, Matej Hoffmann

机构 * Munich Institute of Robotics and Machine Intelligence, Technical University of Munich(慕尼黑机器人与机器智能研究所,慕尼黑技术大学) Faculty of Electrical Engineering, Czech Technical University in Prague(布拉格捷克技术大学电子工程学院)

专题命中 机器人学习 :robot learning(abstract);robotic(abstract);分类 cs.RO

Comments 8 pages with 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14857 2025-04-22 cs.RO 70%

SuFIA-BC: Generating High Quality Demonstration Data for Visuomotor Policy Learning in Surgical Subtasks

Masoud Moghani, Nigel Nelson, Mohamed Ghanem, Andres Diaz-Pinto, Kush Hari, Mahdi Azizian, Ken Goldberg, Sean Huver, Animesh Garg

机构 * University of Toronto(多伦多大学) NVIDIA(NVIDIA公司) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(伯克利大学)

专题命中 机器人学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02277 2025-03-05 cs.RO 70%

Active Robot Curriculum Learning from Online Human Demonstrations

Muhan Hou, Koen Hindriks, A. E. Eiben, Kim Baraka

专题命中 机器人学习 :robot learning(abstract);robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13865 2025-02-12 cs.RO 70%

SurgicAI: A Hierarchical Platform for Fine-Grained Surgical Policy Learning and Benchmarking

Jin Wu, Haoying Zhou, Peter Kazanzides, Adnan Munawar, Anqi Liu

专题命中 机器人学习 :robotics(abstract);robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03491 2025-01-09 cs.RO 70%

Jointly Learning Cost and Constraints from Demonstrations for Safe Trajectory Generation

Shivam Chaubey, Francesco Verdoja, Ville Kyrki

专题命中 机器人学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

Comments (Accepted/In press) 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

Journal ref 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Oct. 2024, pp. 3635-3642

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23277 2024-11-04 cs.CV cs.AI cs.CL cs.LG cs.RO 70%

SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation

Yining Hong, Beide Liu, Maxine Wu, Yuanhao Zhai, Kai-Wei Chang, Linjie Li, Kevin Lin, Chung-Ching Lin, Jianfeng Wang, Zhengyuan Yang, Yingnian Wu, Lijuan Wang

专题命中 机器人学习 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07539 2024-07-18 cs.RO 70%

BAKU: An Efficient Transformer for Multi-Task Policy Learning

Siddhant Haldar, Zhuoran Peng, Lerrel Pinto

专题命中 机器人学习 :robotics(abstract);manipulation(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏