arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-11 至 2026-05-11 共收录 12 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 12 篇

2505.22976 2026-05-11 cs.CV cs.AI 84%

LoopNav: Benchmarking Spatial Consistency in World Models

LoopNav:世界模型中空间一致性评估的基准测试

Kewei Lian, Shaofei Cai, Yitao Liang, Anji Liu

机构 * NUS(国立新加坡大学) Peking Univeristy(北京大学)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 LoopNav提出一个基于循环导航的基准测试,用于评估世界模型的空间一致性,通过Minecraft开放世界环境收集250小时视频数据,并引入场景图一致性评分以量化空间一致性。

Comments V3: SGCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07278 2026-05-11 cs.LG cs.AI cs.CV 82%

Predictive but Not Plannable: RC-aux for Latent World Models

可预测但不可计划:RC-aux用于潜在世界模型

Wenyuan Li, Guang Li, Keisuke Maeda, Takahiro Ogawa, Miki Haseyama

机构 * Hokkaido University(北海道大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出RC-aux,通过改进潜在世界模型的时空匹配,提升规划能力,实验表明其在目标导向任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06841 2026-05-11 cs.AI cs.LG 81%

AGWM: Affordance-Grounded World Models for Environments with Compositional Prerequisites

AGWM:基于 affordance 的世界模型用于具有组合前提条件的环境

Qinshi Zhang, Weipeng Deng, Zhihan Jiang, Jiaming Qu, Qianren Li, Weitao Xu, Ray LC

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Hong Kong(香港大学) Columbia University(哥伦比亚大学) Amazon(亚马逊) City University of Hong Kong(香港城市大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出 AGWM 模型,通过学习抽象 affordance 结构来跟踪动作的动态可执行性,以解决传统世界模型在多步预测中的误差累积问题。

Comments 16 pages, 3 figures, 4 tables. Appendix on pages 11-16 (main text is self-contained)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06298 2026-05-11 cs.CV cs.AI 81%

Render, Don't Decode: Weight-Space World Models with Latent Structural Disentanglement

渲染,而非解码:具有潜在结构解耦的权重空间世界模型

Roussel Desmond Nzoyem, Mauro Comi

机构 * Department of Computer Science(计算机科学系) University of Manchester(曼彻斯特大学) University of Bristol(布里斯托大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出NOVA框架,通过权重和偏置构建隐式神经表示,实现高效且可解释的世界模型,支持结构场景组件的解耦与编辑。

Comments 35 pages, 30 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03454 2026-05-11 cs.CV cs.AI 81%

Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles

在驾驶前思考:基于世界模型的多模态接地用于自动驾驶车辆

Haicheng Liao, Huanming Shen, Bonan Wang, Yongkang Li, Yihong Tang, Chengyue Wang, Dingyi Zhuang, Kehua Chen, Hai Yang, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) UESTC(电子科技大学) Purdue University(普渡大学) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出ThinkDeeper框架,通过预测未来空间状态提升自动驾驶车辆的自然语言指令理解能力,结合超图引导解码器融合多模态输入,提出DrivePilot数据集并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00932 2026-05-11 cs.SE cs.AI 79%

Code World Model Preparedness Report

代码世界模型准备性报告

Daniel Song, Peter Ney, Cristina Menghini, Faizan Ahmad, Aidan Boyd, Nathaniel Li, Ziwen Han, Jean-Christophe Testud, Saisuke Okabayashi, Maeve Ryan, Jinpeng Miao, Hamza Kwisaba, Felix Binder, Spencer Whitman, Jim Gust, Esteban Arcaute, Dhaval Kapil, Jacob Kahn, Ayaz Minhas, Tristan Goodman, Lauren Deason, Alexander Vaughan, Shengjia Zhao, Summer Yue

机构 * MSL Preparedness Team(MSL准备团队) AI Security Team(AI安全团队)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 报告评估了Meta的代码世界模型在潜在灾难性风险领域的准备情况,发现其风险与现有AI生态无异,因此作为开源模型发布。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11758 2026-05-11 cs.RO 79%

HAIC: Humanoid Agile Object Interaction Control via Dynamics-Aware World Model

HAIC:通过动态感知世界模型实现人形敏捷物体交互控制

Dongting Li, Xingyu Chen, Qianyang Wu, Bo Chen, Sikai Wu, Hanyu Wu, Guoyao Zhang, Liang Li, Mingliang Zhou, Diyun Xiang, Jianzhu Ma, Qiang Zhang, Renjing Xu

机构 * Tsinghua University(清华大学) HKUST(Guangzhou)(香港科技大学(广州)) ETH Zurich(苏黎世联邦理工学院) Xiaomi Robotics Lab(小米机器人实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 本文提出HAIC框架,通过动态预测和空间优先级构建动态占用地图,实现人形机器人在复杂动态环境下与不同物体的稳健交互,提升敏捷任务和多物体长周期任务的完成能力。

Comments RSS 2026. Webpage: https://haic-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07390 2026-05-11 cs.CV 79%

ST-Gen4D: Embedding 4D Spatiotemporal Cognition into World Model for 4D Generation

ST-Gen4D:将4D时空认知嵌入世界模型以实现4D生成

Haonan Wang, Hanyu Zhou, Tao Gu, Luxin Yan

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出ST-Gen4D框架,通过4D时空认知世界模型实现4D生成,结合时空表示、认知、推理和生成四大设计,提升4D生成的结构合理性和拓扑一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07326 2026-05-11 cs.CV 79%

GEM: Generating LiDAR World Model via Deformable Mamba

GEM: 通过可变形Mamba生成LiDAR世界模型

Yang Wu, Zhaojiang Liu, Qiang Meng, Youquan Liu, Renliang Weng, Jianjun Qian, Jian Yang, Jin Xie

机构 * NJU(南京大学) SJTU(上海交通大学) FDU(福建师范大学) NTU(南京理工大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 GEM通过可变形Mamba架构提升LiDAR世界模型的逼真度与想象力,解决点云无序和动态静态区分难题,实现空间时间感知与自主探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07199 2026-05-11 cs.AI cs.LG 76%

Three-in-One World Model: Energy-Based Consistency, Prediction, and Counterfactual Inference for Marketing Intervention

三位一体世界模型:用于营销干预的能量一致性、预测和反事实推断

Junichiro Niimi

机构 * Meijo University(名古屋大学)

专题命中 具身推理 :world model(title);分类 cs.AI、cs.LG

AI总结 本文提出三位一体世界模型,利用深度玻尔兹曼机学习消费者特征,通过轻量任务适配器实现一致性评估、预测和反事实推断,展示其在营销干预中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03490 2026-05-11 cs.LG q-bio.NC 57%

Path Integration and Object-Location Binding Emerge in an Action-Conditioned Predictive Sequence Network

路径整合与物体-位置绑定在动作条件预测序列网络中出现

Linda Ariel Ventura, Victoria Bosch, Tim C Kietzmann, Sushrut Thorat

机构 * Sorbonne University(索邦大学) Institute of Cognitive Science(认知科学研究所) Osnabrück University(奥斯纳布吕克大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 研究探讨了动作条件预测序列网络如何通过上下文学习提升预测准确性,并揭示了路径整合和动态绑定在结构化表示中的作用。

Comments 8 pages, 4 figures; accepted at CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07195 2026-05-11 cs.CV 57%

See Tomorrow, Act Today: Foresight-Driven Autonomous Driving

预见未来,立即行动:基于预见的自动驾驶

Bozhou Zhang, Nan Song, Yuang Wang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出ForeSight框架,通过生成未来场景并据此规划动作,实现前瞻性决策,实验表明其在动态场景中优于现有方法。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏