arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 592 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 具身与机器人 73 篇

2607.23899 2026-07-28 cs.RO cs.AI 新提交 89%

Embodied GPT-5.1: Evidence of a World Model?

具身化GPT-5.1:世界模型的证据?

Roberto Spinelli, Thiago C. Martins

专题命中 具身与机器人 :world model(title,journal_ref);world model(title,journal_ref);world-model(abstract);world-model(abstract)

AI总结 研究探索无实体化训练的GPT-5.1能否控制物理移动机器人,通过低分辨率图像和离散动作集执行任务。它展现出空间推理等新兴能力,但也有效率和感知局限。结果挑战传统观点,促使深入研究大语言模型中物理理解相关问题。

Comments 6 pages, 16 figures. Published in the 2026 Brazilian Conference on Robotics (CROS)

Journal ref R. Spinelli and T. C. Martins, "Embodied GPT-5.1: Evidence of a World Model?," 2026 Brazilian Conference on Robotics (CROS), pp. 394-399, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11184 2026-06-10 cs.RO 新提交 89%

TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation

TacForeSight:面向接触丰富操作的力引导触觉世界模型

Yujie Zang, Yuhang Zheng, Xian Nie, Yupeng Zheng, Shuai Tian, Songen Gu, Chen Gao, Zining Wang, Shuicheng Yan, Wenchao Ding

机构 * TARS Robotics National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Fudan University(复旦大学)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);latent dynamics(abstract);分类 cs.RO

AI总结 提出TacForeSight框架,通过力条件触觉世界模型预测触觉潜动态,结合预测性触觉条件策略实现高频操作下的主动接触推理,在动态接触干扰下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16885 2026-08-18 cs.RO 新提交 88%

$τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

$τ_0$-VLA:一种具有世界模型引导测试时计算能力的分层机器人基础模型

Xiaowei Cai, Yunuo Cai, Bingao Chen, Jingxiao Chen, Zhi Chen, Siyuan Feng, Tengyu Hou, Jingshun Huang, Han Jiang, Runkun Ju, Dong Li, Mingxiang Li, Shaowei Li, Xinchen Li, Yifan Li, Yi Liu, Zhongyuan Liu, Jianlan Luo, Junwen Miao, Ruiqi Ni, Buqing Nie, Mingjie Pan, Xinlin Ren, Jianheng Song, Jiaxu Wang, Peiqi Wang, Sen Wang, Xiaoyan Wang, Dafeng Wei, Dongming Wu, Pengwei Xie, Pu Yang, Hangjian Ye, Xiangyu Yue, Jinyu Zhang, Qinglin Zhang, Xueyong Zhao, Pengfei Zhou, Yue Zhou

机构 * Shanghai Innovation Institute(上海创新研究院) Agibot Finch(智元 Finch(智元鹦鹉)) The Chinese University of Hong Kong(香港中文大学)

专题命中 具身与机器人 :world-model(title,abstract);world-model(title,abstract);分类 cs.RO

AI总结 $τ_0$-VLA是一种分层机器人基础模型,通过世界模型引导的测试时计算分配额外资源优化子任务生成,经40115小时异构真实数据训练后,可提升长时程机器人操作的闭环成功率。

Comments 18 pages, 5 figures. Project page: https://tau0-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01381 2026-08-04 cs.RO 新提交 88%

DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation

DreamTrajectory:面向移动操作的、结合世界模型对齐的轨迹引导动作生成方法

Zheng Yang, Wenjie Zhang, Xiangyu Chen, Wenxuan Song, Xianpeng Wang, Yihang Kang, Wen Chen, Lujia Wang, Renjing Xu, Xiaowen Chu

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 DreamTrajectory是面向移动操作的轨迹引导框架,通过联合预测末端执行器轨迹与全身动作块、结合轨迹世界模型的测试时细化,在MS-HAB及真实任务中大幅提升操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27511 2026-07-31 cs.RO 新提交 88%

Failure Detection for Surgical Robot Imitation Policies via Flow-Matching World Modeling

基于流匹配世界建模的外科机器人模仿策略故障检测

Zhefeng Huang, Yilin Cai, Ankit Patel, Mohammad Hajiha, Brendan Browne, Yue Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学)

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 该研究针对外科机器人模仿策略的故障检测难题,提出FoMo-FD方法,利用流匹配世界模型实现无故障演示的视觉-动作不一致性窗口级检测,在dVRK的模拟与真实实验中表现优于基线方法。

Comments 9 pages, 6 figures. Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11643 2026-07-14 cs.RO cs.AI 新提交 87%

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

小米机器人-U0:基于世界基础模型的统一具身合成

Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li

机构 * Xiaomi Robotics(小米机器人)

专题命中 具身与机器人 :world model(abstract);world models(abstract);embodied world model(abstract);world model(abstract)

AI总结 研究针对基础模型应用于具身场景受限问题,提出小米机器人-U0多模态自回归模型,将具身生成扩展为基础图像和视频生成的形式,联合优化多种生成任务,在多方面取得领先成果,证明基础世界模型可用于具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18610 2026-06-29 cs.RO cs.CV 新提交 87%

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

SC3-Eval: 通过自洽视频生成评估机器人基础模型

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA(英伟达) Physical Intelligence Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Allen Institute for AI(艾伦人工智能研究所)

专题命中 具身与机器人 :world model(abstract);world models(abstract);video world model(abstract);world model(abstract)

AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13494 2026-06-12 cs.RO cs.CV 新提交 87%

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM:用于目标条件视觉导航的导航世界动作模型

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) AIRoA ATR

专题命中 具身与机器人 :world model(abstract);world models(abstract);world-model(abstract);world model(abstract)

AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。

Comments Project page: https://dachii-azm.github.io/navwam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18647 2026-08-20 cs.RO cs.LG 新提交 85%

Progressive Experience Fusion for Multi-Task World Model Control in Endovascular Navigation

用于血管内导航多任务世界模型控制的渐进式经验融合

Harry Robertshaw, Maxence Boels, Nikola Fischer, Sebastien Ourselin, Christos Bergeles, Alejandro Granados, Thomas C Booth

机构 * School of Biomedical Engineering & Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院) Surgical & Interventional Engineering(外科与介入工程)

专题命中 具身与机器人 :world model(title);world model(title);分类 cs.LG、cs.RO

AI总结 本研究提出渐进式经验融合(PEF)训练多任务TD-MPC2控制器,在血管内导航任务中提升了成功率,可实现跨血管结构迁移与患者特异性微调,为临床应用提供概念验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23181 2026-07-28 cs.CV 新提交 83%

Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation

迈向视觉语言导航的双脑最小充分表示

Yihao Wu, Chenyi Xu, Liqi Yan, Chenhuan Cai, Geyong Min, Bin Lin, Fangli Guan, Jianhui Zhang, Pan Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) University of Zurich(苏黎世大学) University of Exeter(埃克塞特大学)

专题命中 具身与机器人 :world model(abstract);world-model(abstract);world model(abstract);world-model(abstract)

AI总结 针对视觉语言导航中存在的问题,提出BrainNav框架,包含逻辑锚定模型等三个组件,通过将语义意图与空间感知对齐,提升智能体在复杂任务中的表现,在实验中相比之前最优方法有改进,为鲁棒的视觉语言导航提供有效基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25880 2026-06-25 cs.CV 新提交 83%

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习

Yuchen Xie, Xinyu Zhou, Kuangji Zuo, Yanshuo Lu, Fengrui Huang, Boyu Ma, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 具身与机器人 :latent dynamics(title,abstract);world model(abstract);world model(abstract);分类 cs.CV

AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11204 2026-08-12 cs.RO cs.AI cs.CV 新提交 83%

Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning

Surgical WAM:面向数据高效型手术机器人学习的世界-动作模型

Wenrui Bao, Tianyun Jiang, Zhiben Chen, Ser-Nam Lim, Peter D. Peng, Yuzhang Shang

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文提出Surgical WAM模型,通过无动作视频预训练结合带动作标注数据微调,在四项模拟手术操纵任务中将平均成功率从63.5%提至77.8%,为数据高效的手术机器人学习提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06706 2026-07-09 cs.RO cs.AI cs.LG 新提交 83%

Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review

用于无人机机器人和双手操作的视觉语言动作(VLA)模型综述

Inkyu Sa, Chanoh Park, Hea-Min Lee, Donghee Noh, Ho Seok Ahn

机构 * Chef Robotics RovifyLab IT Application Research Center, Jeonbuk Regional Branch Department of Electrical, Computer and Software Engineering(电气与计算机软件工程系)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 综述2017 - 2026年183篇文献,围绕视觉语言动作模型在无人机机器人和双手操作方面的应用,涵盖多维度,表明双手VLA相关策略可转移至无人机系统,还确定了两领域的14个研究方向。

Comments 56 pages, 11 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02604 2026-07-07 cs.CV cs.RO 新提交 83%

DynaWM: A Base-VLA-Guided World Foundation Model for Moving-Object Manipulation

DynaWM:用于移动物体操纵的基于基础VLA的世界基础模型

Chongkei Chang, Zhidong Deng

机构 * Department of Computer Science and Technology, THUAI, Tsinghua University, Beijing 100084, China(计算机科学与技术系,THUAI,清华大学,北京100084,中国)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 针对移动物体操纵挑战,提出DynaWM模型,用多种编码器提取特征,联合条件流匹配DiT生成动作轨迹,构建数据集评估,相比其他模型有性能提升,消融实验验证各部分作用。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01221 2026-08-04 cs.RO 新提交 82%

EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation

EndoWAM:用于通用内窥镜导航的基于接地的世界-动作模型

Jinsong Lin, Zikang Pan, Wanhao Liu, Chi Kit Ng, Liangjing Shao, Zihang Yu, Ziyu Wang, Yin Wang, Jiaxi Wang, Jeremy Yuen-Chun Teoh, Zhiyong Xiong, Huxin Gao, Hongliang Ren

专题命中 具身与机器人 :world model(abstract);video world model(abstract);world model(abstract);video world model(abstract)

AI总结 EndoWAM是首个用于通用机器人内窥镜导航的世界-动作模型,通过未来接地机制结合轻量型扩散Transformer与离散动作专家,在EndoMotion数据集上优于基线,具强零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29302 2026-08-03 cs.RO cs.CV 新提交 82%

BWM: A Low-Cost High-Fidelity World Simulator for Robot Learning

BWM:面向机器人学习的低成本高保真世界模拟器

BWM Team

专题命中 具身与机器人 :world model(abstract,abstract_cn);world model(abstract,abstract_cn);分类 cs.CV、cs.RO

AI总结 本文提出面向机器人操纵的开源世界模拟器BWM,通过动作条件化自回归预测实现高保真,兼具数据引擎与策略评估器功能,在WorldArena挑战赛中表现最优并开源相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14187 2026-07-17 cs.AI cs.RO 新提交 82%

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

RxBrain:具有联合语言-视觉推理与想象的具身认知基础模型

Haotian Liang, Mingkang Chen, Yufei Huang, Yuchun Guo, Xiaomeng Zhu, Xiangli Shi, Kaixuan Wang, Yunxuan Mao, Weijie Zhou, Ling Chen, Shirong Zeng, Yueyu Long, Yuchen Si, Yajuan Zhu, Xingyu Zhou, Minghui Wang, Wanjia He, Xin Yang, Lingzhu Xiang, Zhiqing Liu, Bohan Ma, Xiran Huang, Tianshuo Yang, Zhiheng Liu, Xuantang Xiong, Zisheng Lu, Ping Luo, Yao Mu, Han Hu, Zhengyou Zhang

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 研究提出具身认知基础模型RxBrain,采用统一多模态架构,通过构建自动管道训练,引入RxBrain-Bench评估,能保持具身理解和生成能力,扩展到连续机器人动作生成,为具身认知基础模型发展奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11689 2026-07-14 cs.RO cs.AI 新提交 82%

From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence

从世界行动模型到具身大脑:开放世界物理智能路线图

Yuanzhi Liang, Xufeng Zhan, Haibin Huang, Chi Zhang, Xuelong Li

机构 * IEEE

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 研究针对通用人工智能中物理世界推理行动的进展零散问题,提出以具身大脑为中心的物理智能协同进化路线图,利用世界行动模型等,通过物理框架、共享契约和闭环训练等构建模块化智能栈,推动物理智能发展。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09771 2026-08-11 cs.RO 新提交 81%

SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation

SLIM-0.5B:学习机器人操作的动作基础预测隐变量

Jingkai Wang, Zihan Tang, Gu Zhang, Mingyu Cao, Jiapeng Chen, Jingjiao Zhao, Xiansheng Chen, Pengwei Wang, Lemao Liu, Dejing Dou

机构 * Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 SLIM-0.5B是0.5B参数的紧凑机器人操作策略,通过自监督掩码轨迹预测学习动作基础预测隐变量,性能优于或匹配大型基线,参数量少、推理延迟低、内存占用小。

Comments 18 pages, 11 figures. Project page: https://kzz1031.github.io/slim-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03244 2026-08-05 cs.AI 新提交 81%

UniNav: A Unified World-Action Diffusion Model for Visual Navigation

UniNav:用于视觉导航的统一世界-动作扩散模型

Changqing Zhou, Yueru Luo, Zeyu Jiang, Changhao Chen

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02990 2026-08-05 cs.RO 新提交 81%

EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation

EmbodiedVAE:用于高效可控具身操作的解耦视频变分自编码器

Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) CASIA, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所(CASIA)) Microsoft Research Asia(微软亚洲研究院)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 针对现有潜在扩散模型适配具身操作场景的缺陷,提出EmbodiedVAE视频变分自编码器,通过双编码器架构与最优传输一致性模块实现更优重建质量、压缩率及精确动作控制。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28625 2026-07-31 cs.CV 新提交 81%

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

ACE-Data-0:以人为中心的环境捕获作为具身数据引擎

Yukang Cao, Haozhe Xie, Beichen Wen, Runmao Yao, Yinghao Liu, Yue Huang, Zhichao Liao, Yunxiang Wang, Haiheng Liu, Xingshun Tian, Dawei Su, Long Zhuo, Dacheng Tao, Xiaogang Wang, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab) ACE Robotics(ACE机器人公司)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本研究提出以人为中心的具身数据引擎ACE,构建含150小时数据的ACE-Data-0数据集,引入分层基准,暴露现有方法缺陷,为具身AI等领域提供基础。

Comments Project Page: https://ace-data-engine.github.io/ACE-Data-0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24481 2026-07-28 cs.RO 新提交 81%

ArmnetBench v0.1: Parallel Real-World Evaluation of Manipulation Policies on a Low-Cost Arm Farm

ArmnetBench v0.1:在低成本机械臂集群上对操作策略进行并行实际评估

Praveen Selvaraj, Lorenzo Uttini, Ville Kuosmanen

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 研究针对通用机器人操作策略开发中实际评估的瓶颈问题,引入ArmnetBench v0.1基准测试,在低成本机械臂集群上对7种策略进行评估,涵盖12项任务,通过大量演示训练策略,发布核心情节数据,支持下游学习并给出排行榜比较结果。

Comments 11 pages, 6 tables, 3 figures. data available at https://huggingface.co/collections/armnet/armnetbench-v01

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06501 2026-07-08 cs.RO 新提交 81%

Hypothesis-driven Model Expansion under Uncertainty for Open-World Robot Planning

不确定性下用于开放世界机器人规划的假设驱动模型扩展

Anxing Xiao, Hanbo Zhang, Tianrun Hu, David Hsu

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Smart Systems Institute, National University of Singapore(新加坡国立大学智能系统研究所)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 针对开放世界机器人规划中传统方法失效的问题,提出假设驱动模型扩展框架,利用基础模型生成假设,结合自动规划与验证反馈进行迭代优化,实现自主知识扩展,推动家用服务机器人实际部署。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03283 2026-07-07 cs.AI 新提交 81%

Embodied Operators and Benchmarking: Toward Reusable and Deployable Embodied Intelligence Systems

具身算子与基准测试:迈向可复用和可部署的具身智能系统

Junwu Xiong, Jiaxuan Gao, Wei Chai, Renxing Chen, Yuzhen Li, Yu Guo, Yucheng Guo, Mingxi Luo, Wenyang Ma, Yiyun Mou, Yifei Zhang, Chen Zhou, Yongjian Guo

机构 * JDT Tsinghua University(清华大学) Tianjin University(天津大学) Beihang University(北京航空航天大学)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 研究具身智能系统中可复用功能模块即具身算子,明确其定义边界、构建分类法,提出多维度基准框架,探讨加速及挑战,为具身智能系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26321 2026-06-26 cs.RO 新提交 81%

KRVF: A Source-Aware Semantic Voxel World Representation for Edge Mobile Manipulation

KRVF:面向边缘移动操作的源感知语义体素世界表示

Runfeng Ling

机构 * The University of Manchester(曼彻斯特大学)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出KRVF,一种源感知语义体素表示,用于边缘移动操作,通过任务导向体素编码占用、语义、时间新鲜度和证据源,实现深度故障感知推理和映射-感知闭环。

Comments Technical report, 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24742 2026-06-24 cs.RO 新提交 81%

World Value Models for Robotic Manipulation

机器人操作的世界价值模型

Zhihao Wang, Jianxiong Li, Yu Cui, Yuan Gao, Xianyuan Zhan, Junzhi Yu, Xiao Ma

机构 * Peking University(北京大学) Tsinghua University(清华大学)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出世界价值模型(WVM),融合世界模型与价值估计,通过时序建模评估数据质量,在标准基准和次优轨迹基准上达到SOTA,提升策略学习性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18375 2026-06-24 cs.RO 新提交 81%

PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation

PAIWorld: 用于机器人操作的三维一致世界基础模型

Yuhang Huang, Xuan Lv, Junyan Xu, Zhiyuan Yu, Jiazhao Zhang, Ruizhen Hu, Wancheng Feng, Shilong Zou, Hewen Xiao, Ziqiao Zhou, Kaiyun Huang, Zhiyu Peng, Juzhan Xu, Hang Zhao, Chenyang Zhu, Renjiao Yi, Yifei Huang, Douhui Wu, Yan Zhang, Kexu Cheng, Chunhe Song, Yunzhi Xue, Xiuhong Zhang, Leitao Guo, Yunji Chen, Bin Wu, Haibin Yu, Kai Xu

机构 * Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出PAIWorld框架,通过几何感知交叉注意力、几何旋转位置编码和潜在3D-REPA蒸馏,解决多视图世界模型的3D不一致问题,在机器人操作基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09215 2026-06-09 cs.RO 新提交 81%

MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation

MotionWAM:迈向实时人形机器人全身操作的基础世界动作模型

Jia Zheng, Teli Ma, Yudong Fan, Zifan Wang, Shuo Yang, Junwei Liang

机构 * Mondo Robotics HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 具身与机器人 :world model(abstract);video world model(abstract);world model(abstract);video world model(abstract)

AI总结 提出MotionWAM,一种实时世界动作模型,通过统一运动潜变量和全身动作令牌,实现单目相机驱动的自主人形机器人全身操作,在真实任务上成功率比VLA基线高30%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08737 2026-06-09 cs.RO 新提交 81%

Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation

Dream-Tac: 用于接触丰富机器人操作任务的统一触觉世界动作模型

Yunfan Lou, Yifan Ye, Yankai Fu, Jun Cen, Xiaowei Chi, Yaoxu Lyu, Peidong Jia, Sirui Han, Zhihe Lu, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Nanjing University(南京大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出Dream-Tac统一触觉世界动作模型,通过接触门控视觉-触觉融合和接触感知注意力偏置,联合建模动作、未来视觉观察和触觉动态,在六项接触丰富操作任务中平均动作准确率提升31.7%。

Comments 16 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏