arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3021 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 343 篇

2607.27511 2026-07-31 cs.RO 新提交 86%

Failure Detection for Surgical Robot Imitation Policies via Flow-Matching World Modeling

基于流匹配世界建模的外科机器人模仿策略故障检测

Zhefeng Huang, Yilin Cai, Ankit Patel, Mohammad Hajiha, Brendan Browne, Yue Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 该研究针对外科机器人模仿策略的故障检测难题,提出FoMo-FD方法,利用流匹配世界模型实现无故障演示的视觉-动作不一致性窗口级检测,在dVRK的模拟与真实实验中表现优于基线方法。

Comments 9 pages, 6 figures. Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26425 2026-06-26 cs.RO 新提交 86%

A System for Fast, Resilient, and Adaptable Loco-Manipulation Behaviors on Humanoid Robots

一种用于人形机器人快速、鲁棒且可适应的移动操作行为的系统

Duncan William Calvert

专题命中 具身推理 :manipulation(title,abstract);robotics(abstract,abstract_cn);分类 cs.RO

AI总结 提出一种机器人本地、运行时可编辑的行为编写与运行系统,结合Coactive Design原则、对象中心Affordance模板、行为树逻辑和运行时场景感知,支持双臂行走、并发动作分层,已部署于多种人形机器人,实现20多种任务变体,可在数分钟或数小时内创建新行为。

Comments PhD dissertation, University of West Florida, Department of Intelligent Systems and Robotics, June 2026. 331 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23899 2026-07-28 cs.RO cs.AI 新提交 86%

Embodied GPT-5.1: Evidence of a World Model?

具身化GPT-5.1:世界模型的证据?

Roberto Spinelli, Thiago C. Martins

专题命中 具身推理 :world model(title,journal_ref);robotics(abstract,comments);navigation(abstract);分类 cs.RO、cs.AI

AI总结 研究探索无实体化训练的GPT-5.1能否控制物理移动机器人,通过低分辨率图像和离散动作集执行任务。它展现出空间推理等新兴能力,但也有效率和感知局限。结果挑战传统观点,促使深入研究大语言模型中物理理解相关问题。

Comments 6 pages, 16 figures. Published in the 2026 Brazilian Conference on Robotics (CROS)

Journal ref R. Spinelli and T. C. Martins, "Embodied GPT-5.1: Evidence of a World Model?," 2026 Brazilian Conference on Robotics (CROS), pp. 394-399, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16234 2026-08-18 cs.CV 新提交 85%

GaussianDWM++: Language-Grounded 3D Gaussian Driving World Model for Unified Scene Understanding, Editing, and Multi-Modal Generation

GaussianDWM++:用于统一场景理解、编辑与多模态生成的语言接地3D高斯驾驶世界模型

Tianchen Deng, Xuefeng Chen, Shuang Wu, Qu Chen, Jiajun Zhu, Bo Dai, Jianfei Yang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Tsinghua University(清华大学) Chongqing Afari Intelligent Drive Co., Ltd.(重庆阿法瑞智能驾驶有限公司) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.CV

AI总结 该研究提出GaussianDWM++,通过基础特征高斯分词器等模块构建统一框架,在多类驾驶任务中实现场景理解、编辑与多模态生成,性能达当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04409 2026-07-07 cs.LG 新提交 85%

Learning Task-Sufficient World Models by Synergizing Agentic Exploration and Structured Modeling

通过协同能动探索和结构化建模学习任务充分的世界模型

Fan Feng, Yujia Zheng, Minghao Fu, Yongqiang Chen, Guangyi Chen, Kevin Murphy, Biwei Huang, Kun Zhang

机构 * UCSD(加州大学圣地亚哥分校) MBZUAI(Mubarakzai Institute of Artificial Intelligence) CMU(卡内基梅隆大学) UBC(不列颠哥伦比亚大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 研究如何让智能体学习特定于任务、最小且足以决策的世界模型表示,通过智能体与世界模型闭环协同,智能体主动探索收集信息轨迹,世界模型学习结构化表示,提升样本效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27575 2026-06-29 cs.CV 新提交 85%

Perceptual 3D Simulation With Physical World Modeling

基于物理世界建模的感知3D仿真

Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh, Jared Watrous, Daniel L. K. Yamins

机构 * Stanford University(斯坦福大学)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);manipulation(abstract);分类 cs.CV

AI总结 提出P3Sim系统,结合学习型物理世界模型、几何条件模块和持久场景记忆,在部分观测和不完整3D变换信号下模拟未来场景状态,实现多任务泛化。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11129 2026-06-24 cs.CV 新提交 85%

WorldOlympiad: Can Your World Model Survive a Triathlon?

WorldOlympiad:你的世界模型能经受铁人三项考验吗?

Yuke Zhao, Wangbo Zhao, Weijie Wang, Zeyu Zhang, Dakai An, Akide Liu, Yinghao Yu, Jiasheng Tang, Fan Wang, Wei Wang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) The Hong Kong University of Science and Technology(香港科技大学) Monash University(莫纳什大学) TRE, Alibaba Group(阿里巴巴TRE)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);manipulation(abstract);分类 cs.CV

AI总结 提出WorldOlympiad基准,从物理忠实性、几何一致性和交互保真度三个维度诊断视频世界模型,揭示现有模型在物理推理、3D一致性和长程交互方面的显著不足。

Comments Project Page: https://alibaba-damo-academy.github.io/WorldOlympiad/, Code: https://github.com/alibaba-damo-academy/WorldOlympiad

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12072 2026-06-11 cs.CV 新提交 85%

World Model Self-Distillation: Training World Models to Solve General Tasks

世界模型自蒸馏:训练世界模型以解决通用任务

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

机构 * Department of Computer Science(计算机科学系)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);robotic(abstract);分类 cs.CV

AI总结 提出结合自蒸馏与强化学习的框架,从预训练视频生成器中提取任务解决能力,无需配对任务视频,在基准测试中超越原始模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13438 2026-08-14 cs.RO cs.AI cs.CV 新提交 85%

ContactGuard: Pre-Contact Execution Monitoring with Action-Conditioned Latent World Models

ContactGuard:基于动作条件潜世界模型的接触前执行监控器

Gehan Zheng, Matthew Johnson-Roberson, Weiming Zhi

机构 * College of Connected Computing, Vanderbilt University(范德堡大学连接计算学院) School of Computer Science, The University of Sydney(悉尼大学计算机学院) Australian Centre for Robotics, The University of Sydney(悉尼大学澳大利亚机器人中心)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 ContactGuard是基于动作条件潜世界模型的接触前执行监控器,通过预测接触前动作的潜态后果判断是否失败,能准确预测接触型操纵任务失败,可迁移至真实机器人且无需修改底层策略。

Comments 14 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21672 2026-06-23 cs.RO cs.AI cs.LG 新提交 85%

Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models

使用基于接地潜在动作世界模型的异构演示模仿学习

Tianyou Wang, Anson Lei, Joe Watson, Ingmar Posner

机构 * University of Oxford(牛津大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出GLAM方法,通过共享潜在动作空间对齐异构数据源,学习接地潜在动作世界模型,在数据稀缺时提升模仿学习性能,平均任务成功率提高48%。

Comments 17 pages, 8 figures. Project page: https://viccccciv.github.io/glam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16286 2026-06-16 cs.LG cs.AI cs.RO 新提交 85%

FlowMPC: Improving Flow Matching policies with World Models

FlowMPC:利用世界模型改进流匹配策略

Chandon Hamel

机构 * Stanford University(斯坦福大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出FlowMPC框架,结合流匹配模仿策略与学习的世界模型,通过MPPI规划提升测试时性能,在ManiSkill操作任务中显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16651 2026-08-18 cs.RO cs.AI 新提交 84%

Orbit-Planner: Towards Latent World Models for On-Orbit Obstacle Avoidance of Satellite Agents

Orbit-Planner:面向卫星智能体在轨避障的潜世界模型

Zhijian Li, Chao Ren, Peijin Wang, Xian Sun

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 该研究针对卫星在轨避障问题,提出两阶段潜世界模型Orbit-Planner,结合动作条件动力学与物理探测器,在Isaac Sim闭环避障任务中获91.7%成功率,提升了动态场景适应性。

Comments 4 pages, 6 figures. Accepted to AP-GARSS 2026. Project page: https://zhijianli2003.github.io/Orbit_Planner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13456 2026-08-14 cs.AI cs.CV 新提交 84%

A Unifying Perspective on Causal World Models: From Observations to Representations to Structure

因果世界模型的统一视角:从观测到表征再到结构

Avinash Kori, Fabrizio Russo

机构 * Imperial College London(帝国理工学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本文从因果视角研究不同抽象层级的世界模型,提出因果世界模型的形式定义,关联相关领域工作并阐明其组件可从数据恢复的条件,为世界模型奠定支持因果推理与决策的基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06020 2026-08-07 cs.AI cs.LG 新提交 84%

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

从经济智能体到智能体经济:经济世界模型的系统蓝图

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong

机构 * Shenzhen Loop Area Institute(深圳河套学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。

Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29031 2026-08-03 cs.RO cs.AI 新提交 84%

Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving

Auto-JEPA:面向端到端自动驾驶的连续意图隐式世界模型

Jiwei Yang, Zhengxian Chen, Chaosheng Huang, Jun Li

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 Auto-JEPA是面向端到端自动驾驶的连续意图隐式世界模型,通过联合嵌入预测学习未来驾驶意图,无需密集未来世界建模,在NAVSIM数据集上取得优异规划性能,可聚焦规划相关视觉特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19876 2026-07-23 cs.RO cs.CV 新提交 84%

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding

KineBench:通过无逆动力学模型的运动学基础对具身世界模型进行基准测试

Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 研究旨在评估具身世界模型物理一致性,提出无逆动力学模型的KineBench基准测试。利用级联视觉基础模型提取姿态,在物理模拟器中闭环验证,纳入运动学指标,基于ManiSkill3的任务评估EWMs,揭示任务复杂度受限的非线性缩放,为数据缩放策略提供指导。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08894 2026-07-13 cs.AI cs.LG 新提交 84%

GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning

GATS:用于高效智能体规划的具有分层世界模型的图增强树搜索

Maureese Williams, Dymitr Nowicki

机构 * Institute for Cybernetics of NAS of Ukraine(乌克兰国家科学院控制论研究所)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.LG

AI总结 研究针对LLM智能体规划计算成本高和行为随机的问题,提出GATS框架,结合系统树搜索与分层世界模型,在合成任务和综合测试中表现优异,规划时无需LLM调用,生成确定性计划,优于LLM引导探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00310 2026-07-02 cs.CV cs.AI 新提交 84%

RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail

RetailSMV:零售场景中基础视频世界模型的外视角与内视角适应

Amirreza Rouhi, Rajat Aggarwal, Parikshit Sakurikar, Anoop M. Namboodiri, Sashi P. Reddi

机构 * DreamVu

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 研究零售场景下基础视频世界模型的外视角与内视角适应,发现仅用外视角数据训练的模型在多项指标上优于或等同于联合训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13817 2026-06-15 cs.RO cs.LG 新提交 84%

FlowMo-WM: A World Model with Object Momentum and Hidden Ambient Drift

FlowMo-WM:具有物体动量和隐藏环境漂移的世界模型

Yitao Jiang, Luyang Zhao, Muhao Chen, Devin Balkcom

机构 * Dartmouth College(达特茅斯学院) Clemson University(克莱姆森大学) University of Houston(休斯顿大学)

专题命中 具身推理 :world model(title,abstract);robot learning(abstract);分类 cs.RO、cs.LG

AI总结 提出FlowMo-WM,一种端到端可训练的视觉世界模型,通过分解图像-动作历史为短历史潜在状态和长历史上下文,分别建模物体运动和环境漂移,提升水下机器人等场景的长程预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07687 2026-06-09 cs.CV cs.AI 新提交 84%

What Makes Video World Model Latents Action-Relevant: Prediction over Reconstruction

什么使视频世界模型潜在空间与动作相关:预测优于重建

Jewon Yeom, Hanseul Kim, Jeongjae Park, Sungmok Jung, Jaejin Lee, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 通过统一探针评估,发现动作相关结构主要由时间视频预训练驱动,而非像素重建保真度,其中视频预训练自监督编码器在视觉保真度和动作预测间取得最佳帕累托权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15309 2026-08-18 cs.AI 新提交 83%

Physiological World Models for Human State Transitions

面向人体状态转换的生理世界模型

Chongyang Zhang, Rendong Wang, Hao Zheng, Hanwen Zhang, Yang Liu, Xiaolong Wei, Bin Chong

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出生理世界模型(PWM),引入人体状态转换标记,构建含六项基准任务的框架,用于建模人体生理状态响应现实因素的变化,助力个性化健康管理等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07420 2026-08-10 cs.LG 新提交 83%

Beyond Myopic World Models: Long-Horizon End-to-End Training for Direct Future Prediction

超越近视世界模型:面向直接未来预测的长视端到端训练

Xinyi Li, Zaishuo Xia, Chenjie Hao, Yubei Chen

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 该研究针对世界模型训练中局部与长视目标不匹配的问题,提出DPWM非递归架构,采用端到端长视终点目标训练,显著提升了连续控制等基准的长时预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05371 2026-08-07 cs.LG 新提交 83%

Quantum-Structured World Models (QSWMs) for Predictive Latent Dynamics

用于预测潜在动力学的量子结构化世界模型(QSWMs)

Hailong Jiang, Emran Hossain, Feng Yu, Jianfeng Zhu, Guilin Zhang, Wulan Guo

机构 * Youngstown State University(扬斯敦州立大学) Kent State University(肯特州立大学) George Washington University(乔治·华盛顿大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本文提出量子结构化世界模型(QSWMs),研究量子启发结构对世界建模的作用,在基本元胞自动机上评估其变体,发现复值QSWM局部预测潜力良好但类密度矩阵变体存在长时序预测局限。

Comments 19 pages, 5 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28415 2026-07-31 cs.LG cs.AI cs.CV cs.MM cs.RO 新提交 83%

QQWorld: Quantile-Quantile Matching for World Model Regularization

QQWorld:用于世界模型正则化的分位数-分位数匹配

Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 该研究针对潜在世界模型正则化中EP目标函数对尾部样本校正梯度不足的问题,提出QQWorld方法,通过分位数-分位数匹配目标函数及跨批次QQ技术,提升了LeWM在四个控制环境中的规划成功率与高斯对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25236 2026-07-29 cs.CL cs.RO 新提交 83%

VisualPatchWorld: Code World Models as Latent Structured Representations for Planning

视觉补丁世界:作为规划潜在结构化表示的代码世界模型

Jiaxin Bai, Jiaxuan Xiong

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO

AI总结 研究旨在构建用于规划的代码世界模型。提出VisualPatchWorld方法,先选定性动力学形式,再拟合参数。实验表明其平均规划成功率69.0%,超基线23.5分,在多方面接近真实引擎成功率,为自动构建有用的代码世界模型提供实用途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15898 2026-07-20 cs.CV cs.AI cs.LG cs.RO 新提交 83%

Orbis 2: A Hierarchical World Model for Driving

Orbis 2:一种用于驾驶的分层世界模型

Sudhanshu Mittal, Arian Mousakhan, Silvio Galesso, Karim Farid, Jonannes Dienert, Rajat Sahay, Thomas Brox

机构 * University of Freiburg(弗莱堡大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究针对当前世界模型不足提出分层驾驶世界模型,跨两层分解预测,结合扩散强制预训练和教师强制微调,在长距离生成保真度等多方面取得领先成果。

Comments Project page: https://lmb-freiburg.github.io/orbis2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06401 2026-07-08 cs.AI 新提交 83%

A Definition and Roadmap for World Models

世界模型的定义与路线图

Xinyuan Chen, Haoyu Guo, Shi Guo, Bingqi Jiang, Chunhua Shen, Xing Shen, Tianfan Xue, Yufei Xue, Mulin Yu, Weinan Zhang, Bin Zhao, Bowen Zhou, Ming Zhou

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.AI

AI总结 本文针对人工智能领域对世界模型定义、预测内容及构建方式缺乏共识的问题,给出科学定义,讨论关键技术,提供分阶段路线图,以助力有效世界模型的开发。

Comments Technical report, 58 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10044 2026-06-30 cs.AI 新提交 83%

Business World Model

商业世界模型

Cecil Pang, Hiroki Sayama

机构 * AI Engineering, USA TODAY Co., Inc.(AI工程,USA TODAY公司) School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(系统科学与工业工程学院,宾夕法尼亚州立大学宾夕法尼亚州立大学) Binghamton Center of Complex Systems, Binghamton University, State University of New York(宾夕法尼亚州立大学复杂系统中心) Waseda Innovation Lab, Waseda University, Tokyo, Japan(早稻田大学创新实验室)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.AI

AI总结 提出商业世界模型(BWM)架构,将世界模型思想应用于商业环境,通过编码状态、动态、约束和目标,支持自主决策与规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26694 2026-06-26 cs.CV 新提交 83%

PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models

PhysEditWorld: 一个面向物理可编辑世界模型的大规模数据集

Bin Hu, Yanwen Ma, Jiehui Huang, Ziliang Zhang, Haoning Wu, Ruicheng Zhang, Yaokun Li, Zijun Wang, Yuechen Zhang, Chun-Mei Tseng, Hanhui Li, Shengju Qian, Jun Zhou, Kaipeng Zhang, Xiaodan Liang, Jiaya Jia, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Beihang University(北京航空航天大学) The Hong Kong University of Science and Technology(香港科技大学) Independent Researcher(独立研究者) Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Tencent(腾讯)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.CV

AI总结 提出PhysEditWorld数据集,通过UE5重放渲染管线生成多重力配置下的动作条件视频,支持可控物理编辑,用于改进世界模型的动力学建模和一致性。

Comments Project page: https://yizhiqianbi.github.io/physeditworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21501 2026-06-23 cs.RO 新提交 83%

UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling

UniviewVLA:统一的多视图视觉-语言-动作模型与世界建模

Tao Xu, Runhao Zhang, Zhijian Huang, Jiayi Guan, Jiaxin Wang, Yifan Ding, Yong-Lu Li, Long Chen, Guang Chen, Jinghui Lu

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Xiaomi EV(小米汽车)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 提出UniviewVLA,利用世界模型生成多视图未来帧,从标准双摄像头观测中预测动作,解决遮挡问题,无需额外硬件或显式重建,并通过运动信息令牌压缩和动作熵视图选择提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏