arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3076 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3076 篇

2606.00267 2026-06-02 cs.CV cs.AI cs.LG cs.RO 87%

StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement

StressDream: 引导视频世界模型实现鲁棒的策略评估与改进

Junwon Seo, Sushant Veer, Ran Tian, Wenhao Ding, Apoorva Sharma, Karen Leung, Edward Schmerling, Marco Pavone, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA Research(NVIDIA研究) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出StressDream方法,通过优化扩散视频世界模型的初始噪声,在推理时引导生成高影响且合理的未来场景,以支持鲁棒的策略评估与改进。

Comments Project page: https://junwon.me/StressDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00917 2025-09-04 cs.RO 87%

A Survey: Learning Embodied Intelligence from Physical Simulators and World Models

Xiaoxiao Long, Qingrui Zhao, Kaiwen Zhang, Zihao Zhang, Dingrui Wang, Yumeng Liu, Zhengjie Shu, Yi Lu, Shouzheng Wang, Xinzhe Wei, Wei Li, Wei Yin, Yao Yao, Jia Pan, Qiu Shen, Ruigang Yang, Xun Cao, Qionghai Dai

机构 * Nanjing University(南京大学) University of Hong Kong(香港大学) Central South University(中南大学) Horizon Robotics(Horizon机器人) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Jiao Tong University(上海交通大学) Technical University of Munich(慕尼黑技术大学) Tsinghua University(清华大学)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);embodied AI(abstract);robotic(abstract)

Comments Update with recent progresses. 49pages, 25figures, 6tables, github repository avalible in https://github.com/NJU3DV-LoongGroup/Embodied-World-Models-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01017 2024-04-02 cs.CV cs.AI cs.LG cs.RO 87%

Copilot4D: Learning Unsupervised World Models for Autonomous Driving via Discrete Diffusion

Lunjun Zhang, Yuwen Xiong, Ze Yang, Sergio Casas, Rui Hu, Raquel Urtasun

专题命中 具身推理 :world model(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.09514 2021-10-19 cs.LG cs.AI cs.CV cs.RO stat.ML 87%

Discovering and Achieving Goals via World Models

Russell Mendonca, Oleh Rybkin, Kostas Daniilidis, Danijar Hafner, Deepak Pathak

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments NeurIPS 2021. First two authors contributed equally. Website at https://orybkin.github.io/lexa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.12491 2021-07-02 cs.AI 87%

World Model as a Graph: Learning Latent Landmarks for Planning

Lunjun Zhang, Ge Yang, Bradly C. Stadie

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);navigation(abstract);robotic(abstract)

Journal ref International Conference on Machine Learning (ICML). 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11193 2026-05-14 cs.RO cs.AI cs.CV 87%

Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy

多模态世界模型用于物理机器人交互:同时进行视觉和触觉预测以提高准确性

Willow Mandil, Amir Ghalamzan-E

机构 * University of Lincoln(林肯大学) University of Sheffield(谢菲尔德大学)

专题命中 具身推理 :world model(title,abstract);robotics(abstract,comments);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出多模态世界模型,通过整合视觉和触觉信息提升机器人物理交互的预测精度,特别是在物理模糊场景中表现更优。

Comments This paper is accepted for publication in Robotics and Autonomous Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00622 2026-03-13 cs.RO cs.CV cs.LG 87%

Inference-Time Enhancement of Generative Robot Policies via Predictive World Modeling

生成式预测控制:通过预测世界建模增强推理时间的机器人策略

Han Qi, Haocheng Yin, Aris Zhu, Yilun Du, Heng Yang

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 GPC通过预测世界建模在推理时间提升机器人策略,结合生成先验与前瞻性预测,实现测试时间适应,优于行为克隆并与其他基线方法相媲美。

Comments Acceptance to IEEE Robotics and Automation Letters. Website: https://computationalrobotics.seas.harvard.edu/GPC

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14040 2025-12-15 cs.LG cs.AI cs.RO 87%

WARPD: World model Assisted Reactive Policy Diffusion

WARPD:世界模型辅助的反应策略扩散

Shashank Hegde, Satyajeet Das, Gautam Salhotra, Gaurav S. Sukhatme

机构 * University of Southern California(南加州大学) Google(谷歌) Intrinsic LLC(Intrinsic 公司)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 WARPD通过直接生成闭环策略,提高了机器人任务中长动作时间跨度和鲁棒性的性能,同时显著降低了推理成本。

Comments Outstanding Paper Award at the Embodied World Models for Decision Making Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03645 2025-08-06 cs.RO cs.CV cs.LG 87%

DiWA: Diffusion Policy Adaptation with World Models

Akshay L Chandra, Iman Nematollahi, Chenguang Huang, Tim Welschehold, Wolfram Burgard, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) University of Technology Nuremberg(纽伦堡技术大学)

专题命中 具身推理 :world model(title,abstract);robot learning(abstract,comments);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

Comments Accepted at the 2025 Conference on Robot Learning (CoRL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18697 2026-06-23 cs.LG cs.CR cs.RO 新提交 87%

Stealthy World Model Manipulation via Data Poisoning

通过数据投毒进行隐蔽的世界模型操纵

Yibin Hu, Xiaolin Sun, Zizhan Zheng

机构 * Department of Computer Science(计算机科学系)

专题命中 具身推理 :world model(title,abstract);manipulation(title);分类 cs.RO、cs.LG

AI总结 提出SWAAP框架,通过两阶段数据投毒(双层级优化寻找有害目标模型+梯度匹配隐蔽实现)操纵学习到的世界模型,导致规划性能显著下降,且能规避多种防御检测。

Comments 41 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01182 2025-07-10 cs.RO cs.AI 87%

Humanoid World Models: Open World Foundation Models for Humanoid Robotics

Muhammad Qasim Ali, Aditya Sridhar, Shahbuland Matiana, Alex Wong, Mohammad Al-Sharman

机构 * University of Waterloo(滑铁卢大学)

专题命中 具身推理 :world model(title,abstract);robotics(title);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20653 2026-07-24 cs.RO cs.CV cs.LG 新提交 87%

PhysCoRe: Physics-Corrected Residual World Models for Material-Aware Deformable Dynamics

PhysCoRe:用于材料感知可变形动力学的物理校正残差世界模型

Haocheng Yin, Shuohan Tao, Yongsheng Chen, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 针对可变形物体操作演变预测难题,提出PhysCoRe模型,结合可微MPM模拟器与两个前馈神经网络,通过MfM和RfD模块实现物理校正与残差学习,提升预测精度,其置信度分布为未来探索提供信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02403 2026-07-03 cs.RO cs.AI cs.CV 新提交 87%

ACID: Action Consistency via Inverse Dynamics for Planning with World Models

ACID: 通过逆动力学实现行动一致性以用于世界模型规划

Gawon Seo, Dongwon Kim, Suha Kwak

机构 * POSTECH KAIST(韩国科学技术院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出ACID框架,通过逆动力学模型引入循环行动一致性约束,改进基于世界模型的决策时规划,在多种任务中提升规划效果并降低计算成本。

Comments Project Page: [this https URL](https://gawon1224.github.io/ACID/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29090 2026-04-01 cs.LG cs.CV cs.RO 87%

HCLSM: Hierarchical Causal Latent State Machines for Object-Centric World Modeling

HCLSM:面向对象的世界建模的分层因果潜在状态机

Jaber Jaber, Osama Jaber

机构 * RightNow AI

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 HCLSM通过分层时序动态和因果结构学习,改进了基于视频预测未来状态的世界模型,实现了更精确的对象中心化表示和事件边界学习。

Comments 10 pages, 3 tables, 4 figures, 1 algorithm. Code: https://github.com/rightnow-ai/hclsm

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13030 2025-12-29 cs.CV cs.LG cs.RO 87%

Motus: A Unified Latent Action World Model

Motus:一个统一的潜在动作世界模型

Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, Ruowen Zhao, Yao Feng, Chendong Xiang, Yinze Rong, Hongyan Zhao, Hanyu Liu, Zhizhong Su, Lei Ma, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) Peking University(北京大学) Horizon Robotics

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 Motus通过统一的潜在动作世界模型整合理解、视频生成和动作模块,利用光流和三阶段训练流程提升大规模动作预训练效果,实现模拟与现实场景中的性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12508 2025-11-04 cs.CV cs.AI cs.RO 87%

MindJourney: Test-Time Scaling with World Models for Spatial Reasoning

Yuncong Yang, Jiageng Liu, Zheyuan Zhang, Siyuan Zhou, Reuben Tan, Jianwei Yang, Yilun Du, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) JHU(约翰·霍普金斯大学) HKUST(香港科技大学) Microsoft Research(微软研究院) Harvard(哈佛大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV

Comments Project Page: https://umass-embodied-agi.github.io/MindJourney

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19818 2025-10-23 cs.LG cs.AI cs.RO 87%

Semantic World Models

Jacob Berg, Chuning Zhu, Yanda Bao, Ishan Durugkar, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Sony AI(索尼人工智能)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15223 2024-11-01 cs.CV cs.LG cs.RO 87%

iVideoGPT: Interactive VideoGPTs are Scalable World Models

Jialong Wu, Shaofeng Yin, Ningya Feng, Xu He, Dong Li, Jianye Hao, Mingsheng Long

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

Comments NeurIPS 2024. Code is available at project website: https://thuml.github.io/iVideoGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10721 2024-06-18 cs.RO cs.AI cs.CV 87%

RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics

Wentao Yuan, Jiafei Duan, Valts Blukis, Wilbert Pumacay, Ranjay Krishna, Adithyavairavan Murali, Arsalan Mousavian, Dieter Fox

专题命中 具身推理 :robotics(title);manipulation(abstract);navigation(abstract);robotic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18499 2023-10-30 cs.CV cs.LG cs.RO 87%

Pre-training Contextualized World Models with In-the-wild Videos for Reinforcement Learning

Jialong Wu, Haoyu Ma, Chaoyi Deng, Mingsheng Long

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

Comments NeurIPS 2023. Code is available at https://github.com/thuml/ContextWM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28804 2026-06-30 cs.CV cs.RO 87%

ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models

ViPSim: 协同视觉与参数空间实现一致的长时程具身世界模型

Longyu Chen, Heng Li, Wei Yang, Manqi Zhao, Dongsheng Jiang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出ViPSim框架,通过协同视觉空间(显式空间先验)和参数空间(数值驱动)解决长时程视频生成中的轨迹漂移和不一致问题,实现高保真具身世界模型。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.12050 2023-04-28 cs.LG cs.CL 86%

Do Embodied Agents Dream of Pixelated Sheep: Embodied Decision Making using Language Guided World Modelling

Kolby Nottingham, Prithviraj Ammanabrolu, Alane Suhr, Yejin Choi, Hannaneh Hajishirzi, Sameer Singh, Roy Fox

专题命中 具身推理 :world model(title,abstract);embodied agent(title);分类 cs.LG

Comments in proceedings of ICML 23

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05799 2026-08-07 cs.RO cs.CV 新提交 86%

XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments?

XEWorld:基于动作的世界模型能否泛化至未见过的机器人 embodiment?

Yixiang Chen, Jiabing Yang, Yuan Xu, Qisen Ma, Keji He, Peiyan Li, Kai Wang, Ziheng He, Xiangnan Wu, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 该研究针对XEWorld测试平台,发现基于动作的世界模型因视觉与物理动力学解耦不足,难以跨机器人 embodiment 泛化,需架构创新突破瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26336 2026-07-30 cs.LG cs.MA cs.RO 新提交 86%

Learning Implicit Causal World Models from Multi-Agent Demonstrations

从多智能体演示中学习隐式因果世界模型

Jasorsi Ghosh

专题命中 具身推理 :world model(title,abstract);navigation(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 该研究针对多智能体系统中世界模型因相关性与因果机制混淆导致分布偏移下失效的问题,提出隐式因果世界模型,经评估在协调任务上表现出可解释因果表示且精度随干预强度提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19343 2026-07-22 cs.CV cs.RO 新提交 86%

Masked Visual Actions for Unified World Modeling

用于统一世界建模的掩码视觉动作

Hadi Alzayer, Wenlong Huang, Haonan Chen, Christopher Luey, Lvmin Zhang, Maneesh Agrawala, Gordon Wetzstein, Li Fei-Fei, Yilun Du, Jiajun Wu, Jia-Bin Huang

机构 * Stanford University(斯坦福大学) University of Maryland, College Park(马里兰大学帕克分校) Harvard University(哈佛大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究如何将动作传达给视频模型用于机器人世界建模,提出掩码视觉动作这一像素空间控制接口,经微调后单个检查点在多场景和实施例中表现出色,在下游操作中能辅助策略评估、改进决策和支持逆建模。

Comments Project webpage: https://masked-visual-actions.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03964 2026-07-07 cs.RO cs.AI 新提交 86%

Worldscape-MoE: A Unified Mixture-of-Experts World Model for Scalable Heterogeneous Action Control

Worldscape-MoE:用于可扩展异构动作控制的统一专家混合世界模型

Jianjie Fang, Yongyan Xu, Ziyou Wang, Chen Gao, Yuchao Huang, Zhaolu Wang, Rongze Tang, Mingyuan Jia, Baining Zhao, Weichen Zhang, Xin Zhang, Haisheng Su, Yu Shang, Wei Wu, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究视频生成世界模型控制接口碎片化瓶颈,提出基于扩散变换器的专家混合世界模型Worldscape-MoE,通过模态感知控制注入等实现异构动作控制,实验验证其有效性和扩展性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03461 2026-07-07 cs.CV cs.LG 新提交 86%

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

WorldBagel:揭示统一多模态模型在视觉-语言-动作-世界建模中的力量

Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.CV、cs.LG

AI总结 研究统一多模态模型在视觉-语言-动作-世界建模中的作用,基于BAGEL构建WorldBagel框架,通过多任务机器人操作等实验,发现统一不仅便利,更是学习有效模型的关键因素。

Comments Rejected by ECCV 2026, Arxiv Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00412 2026-07-03 cs.AI cs.RO 版本更新 86%

Physically Native World Models: A Hamiltonian Perspective on Generative World Modeling

物理原生世界模型:生成式世界建模的哈密顿视角

Sen Cui, Jingheng Ma

机构 * Tsinghua University(清华大学)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出哈密顿世界模型,通过结构化潜相空间和哈密顿动力学演化实现物理可靠、动作可控且长期稳定的未来预测,用于具身决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00148 2026-07-02 cs.RO cs.CV 新提交 86%

3D Point World Models: Point Completion Enables More Accurate Dynamics Learning

3D点云世界模型:点云补全实现更准确的动力学学习

Skand Peri, Hung Nguyen, Chanho Kim, Li Fuxin, Stefan Lee

机构 * Oregon State University(俄勒冈州立大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出3D点云世界模型(3DPWM),通过先补全部分点云再学习动作条件动力学,实现长时程可靠推演和精确成本评估,支持多种机器人操作任务。

Comments 21 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31158 2026-06-19 cs.CV cs.LG 版本更新 86%

Light Interaction: Training-Free Inference Acceleration for Interactive Video World Models

光交互:交互式视频世界模型的免训练推理加速

Jiacheng Lu, Haoyi Zhu, Sipei Yi, Enze Xie, Yu Li, Cheng Zhuo

机构 * Zhejiang University(浙江大学) NVIDIA

专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);navigation(abstract);分类 cs.CV、cs.LG

AI总结 针对交互式视频世界模型推理成本高的问题,提出免训练加速框架Light Interaction,通过自适应上下文管理、去噪缓存加速和3D块稀疏注意力实现最高2.59倍加速。

Comments 13 pages, 6 figures, 3 tables. Project page: https://2843721358l-del.github.io/Light-Interaction-Project/

详情

展开后加载摘要…

URL PDF HTML 收藏