arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 504 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 具身与机器人 504 篇

2605.17912 2026-05-19 cs.RO cs.CV 96%

WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform

WorldArena 2.0: 扩展模态、功能和平台的具身世界模型基准测试

Yu Shang, Yinzhou Tang, Yiding Ma, Zhuohang Li, Lei Jin, Weikang Su, Xin Jin, Zhaolu Wang, Ziyou Wang, Xin Zhang, Haisheng Su, Weizhen He, Wei Wu, Haoyi Duan, Gordon Wetzstein, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Chen Gao, Yong Li

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Stanford University(斯坦福大学) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学) Chinese Academy of Sciences(中国科学院) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 具身与机器人 :world model(title,abstract);embodied world model(title,abstract);world model(title,abstract);embodied world model(title,abstract)

AI总结 本文提出WorldArena 2.0,扩展了具身世界模型的评估,涵盖模态、功能和平台三个维度,提供全面的测试平台以评估具身世界模型的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19876 2026-07-23 cs.RO cs.CV 新提交 96%

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding

KineBench:通过无逆动力学模型的运动学基础对具身世界模型进行基准测试

Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 具身与机器人 :world model(title,abstract);world models(title,abstract);embodied world model(title,abstract);world model(title,abstract)

AI总结 研究旨在评估具身世界模型物理一致性,提出无逆动力学模型的KineBench基准测试。利用级联视觉基础模型提取姿态,在物理模拟器中闭环验证,纳入运动学指标,基于ManiSkill3的任务评估EWMs,揭示任务复杂度受限的非线性缩放,为数据缩放策略提供指导。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28804 2026-06-30 cs.CV cs.RO 96%

ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models

ViPSim: 协同视觉与参数空间实现一致的长时程具身世界模型

Longyu Chen, Heng Li, Wei Yang, Manqi Zhao, Dongsheng Jiang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 具身与机器人 :world model(title,abstract);world models(title,abstract);embodied world model(title,abstract);world model(title,abstract)

AI总结 提出ViPSim框架,通过协同视觉空间(显式空间先验)和参数空间(数值驱动)解决长时程视频生成中的轨迹漂移和不一致问题,实现高保真具身世界模型。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09813 2026-06-09 cs.RO cs.CV 新提交 96%

iMaC: Translating Actions into Motion and Contact Images for Embodied World Models

iMaC: 将动作转化为运动与接触图像用于具身世界模型

Zhenyu Wu, Xiuwei Xu, Yukun Zhou, Yifan Li, Qiuping Deng, Xiaofeng Wang, Zheng Zhu, Bingyao Yu, Ziwei Wang, Jiwen Lu, Haibin Yan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) GigaAI Nanyang Technological University(南洋理工大学)

专题命中 具身与机器人 :world model(title,abstract);world models(title,abstract);embodied world model(title,abstract);world model(title,abstract)

AI总结 提出iMac框架,将原始视觉图像作为动作表示,通过图像-动作编码器和动态预测器实现高保真未来状态预测和闭环控制,在预测精度、任务成功率和跨场景泛化上优于传统向量动作控制。

Comments Project page: https://imac-wm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00664 2026-06-02 cs.RO cs.CV 96%

SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models

SKIP: 用于高效具身世界模型的稀疏关键帧插值范式

Ziheng He, Yixiang Chen, Ning Yang, Zhanqian Wu, Qisen Ma, Yuan Xu, Jiabing Yang, Peiyan Li, Xiangnan Wu, Xiaofeng Wang, Zheng Zhu, Jing Liu, Nianfeng Liu, Yan Huang

机构 * UCAS(中国科学院自动化研究所) CASIA(中国科学院自动化研究所) NJU(南京大学) GigaAI THU(清华大学) FiveAges

专题命中 具身与机器人 :world model(title,abstract);world models(title,abstract);embodied world model(title,abstract);world model(title,abstract)

AI总结 提出稀疏关键帧插值范式(SKIP),通过识别任务相关关键帧并仅生成这些帧,再基于机器人动作插值缺失帧,实现高效视频生成,在LIBERO上速度提升4.16倍,FVD降低89%,且生成视频作为训练数据时策略性能下降极小。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03793 2026-02-04 cs.RO cs.CV 96%

BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks

BridgeV2W: 通过具身遮罩将视频生成模型与具身世界模型 bridging

Yixiang Chen, Peiyan Li, Jiabing Yang, Keji He, Xiangnan Wu, Yuan Xu, Kai Wang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(模式识别新实验室(NLPR),自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Shandong University(山东大学)

专题命中 具身与机器人 :world model(title,abstract);world models(title,abstract);embodied world model(title,abstract);world model(title,abstract)

AI总结 BridgeV2W 通过具身遮罩将视频生成模型与具身世界模型结合,解决坐标空间动作与像素空间视频的不匹配问题,并提升视频生成质量与跨具身统一性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12428 2026-01-21 cs.RO cs.CV 96%

ReWorld: Multi-Dimensional Reward Modeling for Embodied World Models

ReWorld:面向具身世界模型的多维奖励建模

Baorui Peng, Wenyao Zhang, Liang Xu, Zekun Qi, Jiazhao Zhang, Hongsi Liu, Wenjun Zeng, Xin Jin

机构 * Eastern Institute of Technology(东部技术研究所) Georgia Institute of Technology(佐治亚理工学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 具身与机器人 :world model(title,abstract);world models(title,abstract);embodied world model(title,abstract);world model(title,abstract)

AI总结 ReWorld通过多维奖励建模提升具身世界模型的物理真实性和任务完成能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20995 2025-04-30 cs.CV cs.RO 96%

TesserAct: Learning 4D Embodied World Models

Haoyu Zhen, Qiao Sun, Hongxin Zhang, Junyan Li, Siyuan Zhou, Yilun Du, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) HKUST(香港科技大学) Harvard University(哈佛大学)

专题命中 具身与机器人 :world model(title,abstract);world models(title,abstract);embodied world model(title,abstract);world model(title,abstract)

Comments Project Page: https://tesseractworld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06559 2026-07-08 cs.RO 新提交 95%

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

RynnWorld-4D:用于机器人操作的4D具身世界模型

Haoyu Zhao, Xingyue Zhao, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hong Kong Embodied AI Lab(香港具身人工智能实验室) CUHK(香港中文大学) Hupan Lab(湖畔实验室)

专题命中 具身与机器人 :world model(title,abstract);world models(title);embodied world model(title);world model(title,abstract)

AI总结 研究针对开放世界机器人操作,提出RynnWorld-4D生成模型,通过RGB-DF捕捉4D动态,其具三分支架构,还整理数据集并提出RynnWorld-4D-Policy,实验证明该模型在时空预测及实际操作任务中表现出色。

Comments Project Page: https://alibaba-damo-academy.github.io/RynnWorld-4D.github.io, Github: https://github.com/alibaba-damo-academy/RynnWorld-4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08188 2025-12-10 cs.RO cs.AI cs.CV 94%

Embodied Tree of Thoughts: Deliberate Manipulation Planning with Embodied World Model

具身思维树:基于具身世界模型的 deliberative 操控规划

Wenjiang Xu, Cindy Wang, Rui Fang, Mingkang Zhang, Lusong Li, Jing Xu, Jiayuan Gu, Zecui Zeng, Rui Chen

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tsinghua University(清华大学) JD Explore Academy(京东探索学院) ShanghaiTech University(上海科技大学) Nanjing University(南京大学)

专题命中 具身与机器人 :world model(title,abstract);embodied world model(title,abstract);world model(title,abstract);embodied world model(title,abstract)

AI总结 EToT通过基于物理的交互数字双胞胎实现具身世界模型,结合先验分支和反思分支机制,提升机器人操控规划的物理一致性和鲁棒性。

Comments Website at https://embodied-tree-of-thoughts.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12882 2026-04-01 cs.RO cs.AI 94%

Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos

面向多视角轨迹视频的高一致性具身世界模型

Taiyi Su, Jian Zhu, Yaxuan Li, Chong Ma, Jianjun Zhang, Zitai Huang, Hanli Wang, Yi Xu

机构 * Midea Group(美的集团) Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 具身与机器人 :world model(title,abstract);embodied world model(title,abstract);world model(title,abstract);embodied world model(title,abstract)

AI总结 本文提出MTV-World模型,通过多视角轨迹视频控制实现精准的视觉-运动预测,解决低层次动作与真实物理交互不一致的问题,实验表明其在复杂双臂场景中表现优异。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23135 2025-07-01 cs.CV cs.RO 94%

RoboScape: Physics-informed Embodied World Model

Yu Shang, Xin Zhang, Yinzhou Tang, Lei Jin, Chen Gao, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 具身与机器人 :world model(title,abstract);embodied world model(title,abstract);world model(title,abstract);embodied world model(title,abstract)

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15461 2025-06-11 cs.CV cs.MM cs.RO 94%

EVA: An Embodied World Model for Future Video Anticipation

Xiaowei Chi, Chun-Kai Fan, Hengyuan Zhang, Xingqun Qi, Rongyu Zhang, Anthony Chen, Chi-min Chan, Wei Xue, Qifeng Liu, Shanghang Zhang, Yike Guo

机构 * Hong Kong University of Science(香港科学与技术大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学)

专题命中 具身与机器人 :world model(title,abstract);embodied world model(title,abstract);world model(title,abstract);embodied world model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32028 2026-07-03 cs.RO 新提交 94%

DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation

DVG-WM:解耦视频生成实现高效机器人操作具身世界模型

Ziyu Shan, Zhenyu Wu, Xiaofeng Wang, Zheng Zhu, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学(新加坡)) Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学(中国北京)) GigaAI

专题命中 具身与机器人 :world model(title,abstract);embodied world model(title,abstract);world model(title,abstract);embodied world model(title,abstract)

AI总结 提出解耦视频生成世界模型(DVG-WM),将世界模型分解为动力学学习和视觉合成,通过流匹配直接映射动力学到视频潜变量,并引入潜变量退化机制再生接触细节,在LIBERO和真实平台实现高达3.97倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04137 2026-01-08 cs.RO cs.AI cs.CV 94%

Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test

哇,哇,val!一个综合的具身世界模型评估图灵测试

Chun-Kai Fan, Xiaowei Chi, Xiaozhu Ju, Hao Li, Yong Bao, Yu-Kai Wang, Lizhang Chen, Zhiyuan Jiang, Kuangzhi Ge, Ying Li, Weishi Mi, Qingpo Wuwu, Peidong Jia, Yulin Luo, Kevin Zhang, Zhiyuan Qin, Yong Dai, Sirui Han, Yike Guo, Shanghang Zhang, Jian Tang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 具身与机器人 :world model(title,abstract);embodied world model(title);world model(title,abstract);embodied world model(title)

AI总结 本文提出Wow-wo-val基准测试,评估视频基础模型在具身人工智能中的生成能力,发现其在长期规划和物理一致性上表现有限,揭示了现实世界与生成视频之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.02427 2023-07-10 cs.RO cs.AI 94%

FOCUS: Object-Centric World Models for Robotics Manipulation

Stefano Ferraro, Pietro Mazzaglia, Tim Verbelen, Bart Dhoedt

专题命中 具身与机器人 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18709 2026-07-23 cs.RO 版本更新 93%

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation

RoboInter1.5:用于具身世界建模和机器人操作的整体中间表示套件

Ziqin Wang, Hao Li, Weijun Wang, Junhao Cai, Jia Zeng, Yilun Chen, Jiangmiao Pang, Si Liu

专题命中 具身与机器人 :world model(title,abstract);embodied world model(title,abstract);world model(title,abstract);embodied world model(title,abstract)

AI总结 研究针对现有机器人数据集问题,基于RoboInter1.0提出RoboInter1.5套件,含多种中间表示资源及相关任务,通过广泛评估证明其为中间表示提供统一时空框架,将其作为双向接口,规范动作空间并约束物理模拟器潜在展开。

Comments 28 pages. arXiv admin note: substantial text overlap with arXiv:2602.09973

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17030 2026-06-18 cs.CV 新提交 93%

Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation

Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界模型

Jie Zhang, Xiaoyue Chen, Anzhe Chen, Dayiheng Liu, Deqing Li, Gengze Zhou, Hale Yin, Haoqi Yuan, Haoyang Li, Jiahao Li, Jiazhao Zhang, Jingren Zhou, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Pei Lin, Qihang Peng, Shengming Yin, Tianhe Wu, Tianyi Yan, Xiao Xu, Yan Shu, Yanran Zhang, Ye Wang, Yi Wang, Yilei Chen, Yixian Xu, Yiyang Huang, Yuxiang Chen, Zekai Zhang, Zhendong Wang, Zixing Lei, Zhixuan Liang, Zihao Liu, Zikai Zhou, Chenxu Lv, Xiong-Hui Chen, Chenfei Wu

机构 * Qwen Team(Qwen团队)

专题命中 具身与机器人 :world model(title,abstract);embodied world model(title);world model(title,abstract);embodied world model(title)

AI总结 提出Qwen-RobotWorld,一种以自然语言为统一动作接口的语言条件视频世界模型,通过双流MMDiT、大规模具身世界知识语料和渐进式课程训练,在机器人操作、自动驾驶等任务中实现物理一致的未来视觉轨迹预测,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22530 2026-07-27 cs.RO 新提交 92%

ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation

ViTacWorld:用于丰富接触式机器人操作的视觉-触觉世界模型扩展

Yunao Huang, Shiyu Sang, Haotao Lu, Suting Ni, Shijie Wu, Ziyang Guo, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) InstAdapt

专题命中 具身与机器人 :world model(title,abstract);world models(title);world model(title,abstract);world models(title)

AI总结 研究针对丰富接触式机器人操作中视觉-触觉学习扩展难的问题,提出ViTacWorld模型,利用真实和模拟数据预训练并微调,能根据机器人动作预测视觉与触觉反馈,实现动作条件策略评估,提升策略性能。

Comments 18 pages, 6 figures, 5 tables. Project page: https://vitacworld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00765 2024-06-05 cs.AI cs.CL 92%

The Embodied World Model Based on LLM with Visual Information and Prediction-Oriented Prompts

Wakana Haijima, Kou Nakakubo, Masahiro Suzuki, Yutaka Matsuo

专题命中 具身与机器人 :world model(title,abstract);embodied world model(title);world model(title,abstract);embodied world model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14236 2024-05-14 cs.RO cs.AI cs.CV cs.LG 92%

MoDem-V2: Visuo-Motor World Models for Real-World Robot Manipulation

Patrick Lancaster, Nicklas Hansen, Aravind Rajeswaran, Vikash Kumar

专题命中 具身与机器人 :world model(title);world models(title);world model(title);world models(title)

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20425 2025-09-03 cs.AI cs.RO 92%

Perspective-Shifted Neuro-Symbolic World Models: A Framework for Socially-Aware Robot Navigation

Kevin Alcedo, Pedro U. Lima, Rachid Alami

机构 * Institute for Systems and Robotics, Instituto Superior Técnico, Universidade de Lisboa(系统机器人研究所,理工学院,里斯本大学) LAAS-CNRS, Artificial and Natural Intelligence Toulouse Institute (ANITI)(LAAS-CNRS,图卢兹人工智能研究所(ANITI))

专题命中 具身与机器人 :world model(title);world models(title);world model(title);world models(title)

Comments Accepted as a regular paper at the 2025 IEEE International Conference on Robot & Human Interactive Communication (RO-MAN). \c{opyright} 2025 IEEE. The final version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05198 2025-07-08 cs.RO cs.AI cs.CV 91%

EmbodieDreamer: Advancing Real2Sim2Real Transfer for Policy Training via Embodied World Modeling

Boyuan Wang, Xinpan Meng, Xiaofeng Wang, Zheng Zhu, Angen Ye, Yang Wang, Zhiqin Yang, Chaojun Ni, Guan Huang, Xingang Wang

机构 * GigaAI Institute of Automation, Chinese Academy of Sciences(自动化研究所) Peking University(北京大学)

专题命中 具身与机器人 :world model(title);embodied world model(title);world model(title);embodied world model(title)

Comments Project Page: https://embodiedreamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01938 2026-07-03 cs.RO cs.AI cs.CL cs.CV cs.LG 新提交 91%

PhysMani: Physics-principled 3D World Model for Dynamic Object Manipulation

PhysMani:基于物理原理的动态物体操作3D世界模型

Peng Yun, Shouwang Huang, Hao Li, Jinxi Li, Jianan Wang, Bo Yang

机构 * vLAR Group, The Hong Kong Polytechnic University(香港理工大学vLAR Group) Astribot

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 提出PhysMani框架,结合物理原理的3D高斯世界模型与未来感知动作策略模型,通过在线优化学习无散度高斯速度场预测动态,在16个任务基准上超越基线方法。

Comments ECCV 2026. Code and data are available at: https://github.com/vLAR-group/PhysMani

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09036 2026-06-25 cs.RO 版本更新 91%

RoDyn: Taming Interactive Robot-Dynamic 2.5D World Model for Robotic Manipulation

RoDyn: 驯服交互式机器人动态2.5D世界模型用于机器人操作

Chuanrui Zhang, Zhengxian Wu, Guanxing Lu, Yansong Tang, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 提出RoDyn,一种几何感知的2.5D世界模型,通过机器人动态分词器和掩码引导自回归架构,在高效潜在空间中建模环境动态,提升生成保真度并显著改善下游强化学习和模仿学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11528 2025-09-15 cs.RO cs.AI cs.LG 91%

LaDi-WM: A Latent Diffusion-based World Model for Predictive Manipulation

Yuhang Huang, Jiazhao Zhang, Shilong Zou, Xinwang Liu, Ruizhen Hu, Kai Xu

机构 * National University of Defense Technology(国防科技大学) Peking University(北京大学) Shenzhen University(深圳大学)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

Comments CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14540 2025-07-30 cs.RO cs.AI cs.CV 91%

IRASim: A Fine-Grained World Model for Robot Manipulation

Fangqi Zhu, Hongtao Wu, Song Guo, Yuxiao Liu, Chilam Cheang, Tao Kong

机构 * Hong Kong University of Science and Technology(香港科技大学) ByteDance Seed(字节跳动种子)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

Comments Opensource, project website: https://gen-irasim.github.io

Journal ref ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19017 2025-05-27 cs.RO cs.CV cs.LG 91%

WorldEval: World Model as Real-World Robot Policies Evaluator

Yaxuan Li, Yichen Zhu, Junjie Wen, Chaomin Shen, Yi Xu

机构 * Midea Group(美的集团) East China Normal University(华东师范大学)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

Comments The project page is available at https://worldeval.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10125 2026-03-03 cs.RO cs.AI 90%

Ctrl-World: A Controllable Generative World Model for Robot Manipulation

Ctrl-World: 一个可控制的生成世界模型用于机器人操作

Yanjiang Guo, Lucy Xiaoyang Shi, Jianyu Chen, Chelsea Finn

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 本文提出了一种可控的多视图世界模型,用于评估和改进通用机器人策略的指令遵循能力,通过姿态条件化记忆检索和帧级动作条件化实现长时一致性和精确动作控制,提升策略成功率44.7%。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10075 2025-05-16 cs.RO cs.CV 90%

FlowDreamer: A RGB-D World Model with Flow-based Motion Representations for Robot Manipulation

Jun Guo, Xiaojian Ma, Yikai Wang, Min Yang, Huaping Liu, Qing Li

机构 * State Key Laboratory of General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室(BIGAI)) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

Comments Project page: see https://sharinka0715.github.io/FlowDreamer/

详情

展开后加载摘要…

URL PDF HTML 收藏