Addressing the Sim2Real Gap in Robotic 3D Object Classification
专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.CV
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.CV
NeuroHex:一种脑启发的六边形坐标系统,用于构建高效计算的世界模型以支持连续在线自适应学习
机构 * NeuroAI Computer Architecture Lab (NCAL)(神经人工智能计算机架构实验室)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI
AI总结 NeuroHex通过六边形坐标系统实现高效世界模型,利用环索引和量化角编码等方法,降低计算成本并支持空间匹配,同时提供OSM2Hex工具将地图数据转换为该坐标系统,提升自主系统空间推理效率。
Comments This is an expanded version of the paper titled "NeuroHex: Highly Efficient Hex Coordinate System for Creating World Models to Enable Adaptive AI" published in the proceedings of the 2026 Neuro Inspired Computational Elements (NICE) [1] conference. This is an archival version of the paper and is currently under review for an ACM journal publication
MetaWorld: 一个用于地面指令基础的分层世界模型中的技能迁移与组合
机构 * Beijing University of Technology(北京理工大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学)
专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO
AI总结 MetaWorld通过整合语义规划与物理控制,利用专家策略迁移提升人形机器人在定位-操作任务中的性能。
Comments 8 pages, 4 figures, Submitted to ICLR 2026 World Model Workshop
机构 * Tampere University(塔尔皮耶大学) ; Czech Technical University(捷克技术大学) ; University of Tartu(塔尔图大学) ; Aalto University(阿尔托大学)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO;robotics(comments)
Comments This paper is submitted to IEEE International Conference on Robotics and Automation (ICRA) 2026
具身智能工业机器人:框架与技术
专题命中 具身推理 :robotics(title,abstract);world model(abstract);分类 cs.RO
AI总结 本文提出了一种新的基于知识的具身智能工业机器人框架,旨在提升工业机器人在复杂环境中的智能水平和应用潜力。
Comments 70 pages, 13 figures. The associated project can be found at https://github.com/jackyzengl/EIIR
Journal ref Journal of Manufacturing Systems 88 (2026) 158-189
超越近视世界模型:面向直接未来预测的长视端到端训练
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 具身推理 :world model(title,abstract);分类 cs.LG
AI总结 该研究针对世界模型训练中局部与长视目标不匹配的问题,提出DPWM非递归架构,采用端到端长视终点目标训练,显著提升了连续控制等基准的长时预测性能。
用于预测潜在动力学的量子结构化世界模型(QSWMs)
机构 * Youngstown State University(扬斯敦州立大学) ; Kent State University(肯特州立大学) ; George Washington University(乔治·华盛顿大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.LG
AI总结 本文提出量子结构化世界模型(QSWMs),研究量子启发结构对世界建模的作用,在基本元胞自动机上评估其变体,发现复值QSWM局部预测潜力良好但类密度矩阵变体存在长时序预测局限。
Comments 19 pages, 5 figures,
MiniWorld:从零开始普及视频世界模型的训练
机构 * Peking University(北京大学)
专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.CV
AI总结 MiniWorld是从零开始训练流式视频世界模型的可复现框架,采用特定模型与训练策略,可在单台8-GPU服务器数天内完成训练,旨在降低训练门槛以推动相关研究。
Comments 19 pages
QQWorld:用于世界模型正则化的分位数-分位数匹配
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 该研究针对潜在世界模型正则化中EP目标函数对尾部样本校正梯度不足的问题,提出QQWorld方法,通过分位数-分位数匹配目标函数及跨批次QQ技术,提升了LeWM在四个控制环境中的规划成功率与高斯对齐效果。
视觉补丁世界:作为规划潜在结构化表示的代码世界模型
机构 * Hong Kong Baptist University(香港浸会大学)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO
AI总结 研究旨在构建用于规划的代码世界模型。提出VisualPatchWorld方法,先选定性动力学形式,再拟合参数。实验表明其平均规划成功率69.0%,超基线23.5分,在多方面接近真实引擎成功率,为自动构建有用的代码世界模型提供实用途径。
AutoWorld: 通过自监督世界模型扩展多智能体交通仿真
机构 * University of Toronto(多伦多大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出AutoWorld框架,利用未标记的LiDAR数据自监督学习世界模型,提升多智能体交通仿真的真实感与性能,实验表明未标记数据能有效提升仿真效果。
Orbis 2:一种用于驾驶的分层世界模型
机构 * University of Freiburg(弗莱堡大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 研究针对当前世界模型不足提出分层驾驶世界模型,跨两层分解预测,结合扩散强制预训练和教师强制微调,在长距离生成保真度等多方面取得领先成果。
Comments Project page: https://lmb-freiburg.github.io/orbis2.github.io/
世界模型的定义与路线图
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.AI
AI总结 本文针对人工智能领域对世界模型定义、预测内容及构建方式缺乏共识的问题,给出科学定义,讨论关键技术,提供分阶段路线图,以助力有效世界模型的开发。
Comments Technical report, 58 pages, 10 figures
视频生成模型作为世界模型:高效的范式、架构和算法
机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) ; Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与开发中心)
专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.CV
AI总结 本文系统回顾了考虑效率的世界模拟视频生成框架,提出三维分类方法,展示提升效率对自动驾驶等应用的重要性,并指出高效视频生成向通用世界模拟器演进的关键性。
商业世界模型
机构 * AI Engineering, USA TODAY Co., Inc.(AI工程,USA TODAY公司) ; School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(系统科学与工业工程学院,宾夕法尼亚州立大学宾夕法尼亚州立大学) ; Binghamton Center of Complex Systems, Binghamton University, State University of New York(宾夕法尼亚州立大学复杂系统中心) ; Waseda Innovation Lab, Waseda University, Tokyo, Japan(早稻田大学创新实验室)
专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.AI
AI总结 提出商业世界模型(BWM)架构,将世界模型思想应用于商业环境,通过编码状态、动态、约束和目标,支持自主决策与规划。
PhysEditWorld: 一个面向物理可编辑世界模型的大规模数据集
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Beihang University(北京航空航天大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Independent Researcher(独立研究者) ; Shanghai Jiao Tong University(上海交通大学) ; Sun Yat-sen University(中山大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tencent(腾讯)
专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.CV
AI总结 提出PhysEditWorld数据集,通过UE5重放渲染管线生成多重力配置下的动作条件视频,支持可控物理编辑,用于改进世界模型的动力学建模和一致性。
Comments Project page: https://yizhiqianbi.github.io/physeditworld/
UniviewVLA:统一的多视图视觉-语言-动作模型与世界建模
机构 * Tongji University(同济大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Xiaomi EV(小米汽车)
专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO
AI总结 提出UniviewVLA,利用世界模型生成多视图未来帧,从标准双摄像头观测中预测动作,解决遮挡问题,无需额外硬件或显式重建,并通过运动信息令牌压缩和动作熵视图选择提升效率。
SurgVista:具有合理器械-组织动力学的长程手术世界建模
机构 * The Chinese University of Hong Kong(香港中文大学) ; EPFL(瑞士联邦理工学院洛桑) ; Imperial College London(伦敦帝国学院)
专题命中 具身推理 :world model(title,abstract);robot policy(abstract);分类 cs.CV
AI总结 提出SurgVista手术世界模型,通过变形一致性正则化和漂移适应训练,解决空间交互不连贯和时间保真度崩溃问题,在长程预测中显著优于现有方法。
世界模型批判:一种用于世界建模的生成式潜在预测架构
机构 * Institute of Foundation Models(基础模型研究院) ; Mohamed bin Zayed University of Artificial Intelligence(莫莫德 bin Zayed 人工智能大学) ; School of Computer Science Carnegie Mellon University(计算机科学学院卡内基梅隆大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文从心理学“假设性思维”出发,提出世界模型的核心目标是模拟真实世界的所有可行动可能性,并设计了一种基于状态化、分层、多级、混合连续/离散表示的生成式潜在预测(GLP)架构。
DreamReg:基于信念驱动的世界模型用于2D-3D超声配准
机构 * T Stone Robotics Institute, The Chinese University of Hong Kong(香港中文大学T Stone机器人研究所) ; Multi-scale Medical Robotics Center(多尺度医疗机器人中心) ; Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.CV
AI总结 提出DreamReg框架,将2D-3D超声配准建模为信念更新,通过世界模型模拟探头运动并整合想象结果,在CAMUS和u-RegPro数据集上实现鲁棒且准确的实时配准。
DREAM-Chunk:基于潜在世界模型的反应式动作分块
机构 * Purdue University(普渡大学) ; Stanford University(斯坦福大学)
专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO
AI总结 提出DREAM-Chunk方法,通过轻量级潜在世界模型在测试时采样多个候选动作分块并选择最优执行,提升动作分块策略在随机动态下的鲁棒性。
ActWorld: 从可探索到可交互的世界模型——基于动作感知记忆
机构 * Washington University in St. Louis(圣路易斯华盛顿大学) ; Intelligent Creation, ByteDance(字节跳动智能创作)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.CV
AI总结 提出ActWorld,通过构建10万交互视频数据集和分层动作感知记忆机制,在块自回归框架中扩展导航模型以支持对象交互,解决数据稀缺和记忆瓶颈问题。
Comments Project page: https://interactwm.github.io/ActWorld
DreamX-World 1.0:通用交互式世界模型
机构 * DreamX Team(DreamX团队)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.CV
AI总结 提出通用交互式文图生视频世界模型DreamX-World 1.0,通过E-PRoPE相机控制、因果强制自回归生成、记忆条件场景持久化和事件指令微调,实现可控长时程生成,在多项指标上超越现有方法。
Comments Project page: https://amap-ml.github.io/DreamX_World, Code: https://github.com/AMAP-ML/DreamX-World
从像素到证明:通过并行保形鲁棒MPC实现概率安全的潜在世界模型控制
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出SLS^2框架,结合保形预测与鲁棒模型预测控制,在学习的潜在世界模型中实现基于视觉的安全运动规划,提升目标到达性能与安全性。
世界模型与物理AI教程
机构 * Department of Computer Science and Artificial Intelligence/CAIIT, Jeonju, Jeonbuk, South Korea(韩国全北全州计算机科学与人工智能系/CAIIT)
专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.AI
AI总结 本文提出统一框架,区分显式与隐式世界模型,并探讨其在机器人、自动驾驶等物理AI领域的应用,以及迈向通用人工智能的挑战。
STRIPS-WM:从图像学习基于命题的STRIPS风格世界模型
机构 * Worcester Polytechnic Institute(沃斯特理工学院)
专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO
AI总结 提出STRIPS-WM框架,从图像转换中学习符号化世界模型,用于机器人视觉任务规划,提升规划成功率。
StateVLM: 一种用于机器人可操作推理的状态感知视觉语言模型
机构 * Department of Informatics, University of Hamburg(汉堡大学信息学院) ; King Abdullah University of Science and Technology(卡塔尔科学与技术大学)
专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.CV
AI总结 提出StateVLM模型,通过辅助回归损失训练策略增强视觉语言模型在目标检测和状态定位中的数值推理能力,并构建OSAR基准验证其有效性。
COMAP:面向LLM智能体的世界模型与智能体策略协同进化
机构 * Central South University(中南大学) ; College of Computer Science, Sichuan University(四川大学计算机学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI
AI总结 提出COMAP框架,通过闭环交互协同进化文本世界模型和智能体策略,在具身任务规划、网页导航和工具使用基准上显著提升性能。
世界模型:架构、方法论、推理范式与应用的全面综述
机构 * School of Computer and Cyber Sciences, Augusta University(奥古斯塔大学计算机与网络科学学院) ; School of Computing, University of Georgia(佐治亚大学计算机学院) ; Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) ; Department of Radiology, Massachusetts General Hospital, Harvard Medical School(麻省总医院放射科,哈佛医学院) ; Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) ; Department of Graduate Psychology, James Madison University(詹姆斯麦迪逊大学研究生心理学系) ; Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) ; School of Biomedical Engineering, The University of Sydney(悉尼大学生物医学工程学院) ; Tandon School of Engineering, New York University(纽约大学泰坦工程学院) ; Department of Radiation Oncology, City of Hope National Medical Center(城市希望国家医学中心放射肿瘤科) ; Department of Mayo Clinic Comprehensive Cancer Center, Mayo Clinics(梅奥诊所综合癌症中心,梅奥诊所) ; Savannah River Ecology Laboratory (SREL), University of Georgia(萨凡纳河生态实验室(SREL),佐治亚大学)
专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.LG
AI总结 本文提出一个多轴分类法,从架构、方法论、推理策略和应用领域四个维度系统综述世界模型,涵盖从早期认知科学基础到PlaNet、Dreamer系列、MuZero、Sora等里程碑系统,并指出未来方向。
WorldLens:真实世界中驾驶世界模型的全光谱评估
机构 * WorldBench Team(WorldBench团队) ; Equal Contributions Project Lead(同等贡献项目负责人) ; Project Lead(项目负责人) ; Corresponding Author(通讯作者)
专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.CV
AI总结 提出WorldLens基准,从生成、重建、动作跟随、下游任务和人类偏好五个方面评估生成世界模型在视觉真实性、几何一致性、物理合理性和功能可靠性上的表现,并构建WorldLens-26K数据集和WorldLens-Agent评估模型以实现可扩展的可解释评分。
Comments CVPR 2026 Oral Presentation; 80 pages, 37 figures, 29 tables; Project Page at https://worldbench.github.io/worldlens GitHub at https://github.com/worldbench/WorldLens