arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-01 至 2026-04-01 共收录 9 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 9 篇

2603.29090 2026-04-01 cs.LG cs.CV cs.RO 87%

HCLSM: Hierarchical Causal Latent State Machines for Object-Centric World Modeling

HCLSM:面向对象的世界建模的分层因果潜在状态机

Jaber Jaber, Osama Jaber

机构 * RightNow AI

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 HCLSM通过分层时序动态和因果结构学习,改进了基于视频预测未来状态的世界模型,实现了更精确的对象中心化表示和事件边界学习。

Comments 10 pages, 3 tables, 4 figures, 1 algorithm. Code: https://github.com/rightnow-ai/hclsm

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12882 2026-04-01 cs.RO cs.AI 84%

Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos

面向多视角轨迹视频的高一致性具身世界模型

Taiyi Su, Jian Zhu, Yaxuan Li, Chong Ma, Jianjun Zhang, Zitai Huang, Hanli Wang, Yi Xu

机构 * Midea Group(美的集团) Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出MTV-World模型,通过多视角轨迹视频控制实现精准的视觉-运动预测,解决低层次动作与真实物理交互不一致的问题,实验表明其在复杂双臂场景中表现优异。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17094 2026-04-01 cs.LG cs.AI cs.CL 82%

The Mouth is Not the Brain: Bridging Energy-Based World Models and Language Generation

嘴巴不是大脑:连接基于能量的世界模型与语言生成

Junichiro Niimi

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出'嘴巴不是大脑'原则,通过基于能量的世界模型与语言模型分离,展示在消费者评论领域中,世界模型能提升生成质量与可控性,为语言能力与世界理解分离提供实证支持。

Comments ICLR 2026 The 2nd Workshop on World Models: Understanding, Modelling, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19979 2026-04-01 cs.CV cs.AI 81%

X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving

X-World: 可控的以自身为中心的多摄像头世界模型用于可扩展的端到端驾驶

Chaoda Zheng, Sean Li, Jinhao Deng, Zhennan Wang, Shijia Chen, Liqiang Xiao, Ziheng Chi, Hongbin Lin, Kangjie Chen, Boyang Wang, Yu Zhang, Xianming Liu

机构 * GWM Team(长城汽车团队) XPeng Inc.(小鹏汽车)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 X-World通过可控的多摄像头生成世界模型,实现高质量多视角视频生成,支持跨摄像头一致性、长时间动态稳定性和严格动作遵循,为可扩展的端到端驾驶评估提供基础。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29419 2026-04-01 cs.RO cs.AI cs.CV 75%

RAAP: Retrieval-Augmented Affordance Prediction with Cross-Image Action Alignment

RAAP:基于跨图像动作对齐的检索增强的可达性预测

Qiyuan Zhuang, He-Yang Xu, Yijun Wang, Xin-Yang Zhao, Yang-Yang Li, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University(东南大学计算机科学与工程学院、新一代人工智能技术与交叉应用重点实验室) Southeast University-Monash University Joint Graduate School, Southeast University(东南大学-蒙纳士大学联合研究生院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 RAAP通过结合检索与对齐学习,统一了可达性检索与动作方向预测,利用密集对应转移接触点并预测动作方向,实现了跨未见物体和类别的稳健泛化。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29798 2026-04-01 cs.CV 70%

SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes

SceneTeract:代理功能可能性与视觉语言模型在3D场景中的 grounded 性

Léopold Maillard, Francis Engelmann, Tom Durand, Boxiao Pan, Yang You, Or Litany, Leonidas Guibas, Maks Ovsjanikov

机构 * École Polytechnique(巴黎综合理工学院) Dassault Systèmes(达索系统) Stanford University(斯坦福大学) USI Lugano(卢加诺大学) Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 具身推理 :embodied AI(abstract);embodied agent(abstract);分类 cs.CV

AI总结 SceneTeract 通过结合高层语义推理与低层几何检查,验证3D场景功能,评估合成环境中的功能失败及VLM对功能可能性的预测能力,揭示语义信心与物理可行性之间的系统性不匹配。

Comments Project page: https://sceneteract.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29572 2026-04-01 cs.GR cs.AI cs.CV 62%

Turbo4DGen: Ultra-Fast Acceleration for 4D Generation

Turbo4DGen: 4D生成的超快加速

Yuanbin Man, Ying Huang, Zhile Ren, Miao Yin

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Turbo4DGen框架,通过时空缓存机制和动态语义感知注意力剪枝,显著减少4D生成中的冗余计算,实现9.7倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06679 2026-04-01 cs.AI cs.CV cs.GR 62%

MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines

MultiGen:扩散游戏引擎中可编辑多人世界的层级设计

Ryan Po, David Junhao Zhang, Amir Hertz, Gordon Wetzstein, Neal Wadhwa, Nataniel Ruiz

机构 * Stanford University(斯坦福大学) Google(谷歌)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出MultiGen,通过引入显式外部内存模块,实现可编辑多人世界中的环境控制与共享推理,提升交互性和一致性。

Comments Project page here: https://ryanpo.com/multigen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18887 2026-04-01 cs.CV 57%

SafeDrive: Fine-Grained Safety Reasoning for End-to-End Driving in a Sparse World

SafeDrive: 为稀疏世界中的端到端驾驶进行细粒度安全推理

Jungho Kim, Jiyong Oh, Seunghoon Yu, Hongjae Shin, Donghyuk Kwak, Jun Won Choi

机构 * Seoul National University(首尔大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 SafeDrive提出了一种端到端规划框架,通过轨迹条件化的稀疏世界模型进行显式且可解释的安全推理,实现了在开放循环和闭合循环基准上的最佳性能,有效降低了碰撞率。

Comments Accepted to CVPR 2026, 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏