arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-19 至 2026-03-19 共收录 7 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 7 篇

2603.17652 2026-03-19 cs.RO cs.CV 81%

VectorWorld: Efficient Streaming World Model via Diffusion Flow on Vector Graphs

VectorWorld: 通过向量图上的扩散流实现高效的流式世界模型

Chaokang Jiang, Desen Zhou, Jiuming Liu, Kevin Li Sun

机构 * University of Cambridge, Cambridge, United Kingdom(剑桥大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 VectorWorld通过向量图上的扩散流实现高效的流式世界模型,解决了自动驾驶政策闭环评估中的初始化不匹配、采样延迟和运动可行性问题,提升了地图结构精度和闭环运行稳定性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17420 2026-03-19 cs.AI 79%

From Digital Twins to World Models:Opportunities, Challenges, and Applications for Mobile Edge General Intelligence

从数字孪生到世界模型:移动边缘通用智能的机会、挑战与应用

Jie Zheng, Dusit Niyato, Changyuan Zhao, Jiawen Kang, Jiacheng Wang

机构 * State-Province Joint Engineering and Research Center of Advanced Networking and Intelligent Information Services, College of Computer, Northwest University(高级网络与智能信息服务省州联合工程研究中心,计算机学院,西北大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Automation of School, Guangdong University of Technology(自动化学院,广东工业大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文探讨了从数字孪生到世界模型的转变,分析了其在移动边缘通用智能中的作用,涵盖概念差异、设计原则、关键组件及应用挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17375 2026-03-19 cs.CV 79%

Stereo World Model: Camera-Guided Stereo Video Generation

立体世界模型:基于摄像头的立体视频生成

Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) VAST ByteDance Pico(字节跳动Pico)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出StereoWorld,一种基于摄像头的立体世界模型,通过联合学习外观和双眼几何实现端到端的立体视频生成。该模型在RGB模态中操作,直接从视差中获取几何信息,通过统一的相机帧RoPE和立体感知注意力分解提升生成效率和一致性。

Comments Project Page: https://sunyangtian.github.io/StereoWorld-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17117 2026-03-19 cs.CV 79%

MosaicMem: Hybrid Spatial Memory for Controllable Video World Models

MosaicMem: 用于可控视频世界模型的混合空间记忆

Wei Yu, Runjia Qian, Yumeng Li, Liquan Wang, Songheng Yin, Sri Siddarth Chakaravarthy P, Dennis Anthony, Yang Ye, Yidi Li, Weiwei Wan, Animesh Garg

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The University of Osaka(大阪大学) Georgia Institute of Technology(佐治亚理工学院) Mujin Inc.(Mujin公司) University of Texas at Austin(德克萨斯大学奥斯汀分校) Taiyuan University of Technology(太原本科技大学)

专题命中 具身推理 :world model(title);navigation(abstract);分类 cs.CV

AI总结 MosaicMem提出一种混合空间记忆方法,通过提升片段至3D实现可靠定位与检索,结合模型原生条件化保留提示生成,提升姿态一致性与动态建模能力,支持细粒度导航与场景编辑。

Comments Project Page: https://mosaicmem.github.io/mosaicmem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20095 2026-03-19 cs.CV 79%

WPT: World-to-Policy Transfer via Online World Model Distillation

WPT: 通过在线世界模型蒸馏实现世界到策略的迁移

Guangfeng Jiang, Yueru Luo, Jun Liu, Yi Huang, Yiyao Zhu, Zhan Qu, Dave Zhenyu Chen, Bingbing Liu, Xu Yan

机构 * University of Science and Technology of China(科学技术大学) CUHK-SZ(香港中文大学(深圳)) HKUST(香港理工大学) Huawei Foundation Model Department(华为基金会模型部)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出WPT方法,通过在线世界模型蒸馏实现策略迁移,提升规划性能并保持实时部署能力,实验表明其在开放环和闭合环基准上表现优异。

Comments CVPR2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03887 2026-03-19 cs.CV 79%

OccTENS: 3D Occupancy World Model via Temporal Next-Scale Prediction

OccTENS: 通过时间下一尺度预测实现的3D占用世界模型

Bu Jin, Songen Gu, Xiaotao Hu, Yupeng Zheng, Xiaoyang Guo, Qian Zhang, Xiaoxiao Long, Wei Yin

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Chinese Academy of Sciences(中国科学院大学) Horizon Robotics(地平线机器人) Nanjing University(南京大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出OccTENS,一种能高效生成高质量长期占用场景的生成模型,通过时间下一尺度预测任务解决效率、时间退化和可控性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17333 2026-03-19 cs.CL 67%

Grid Spatial Understanding: A Dataset for Textual Spatial Reasoning over Grids, Embodied Settings, and Coordinate Structures

网格空间理解:一个用于文本空间推理、具身场景和坐标结构的数据集

Risham Sidhu, Julia Hockenmaier

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 具身推理 :embodied agent(abstract);navigation(abstract)

AI总结 本文提出GSU数据集,用于评估LLM在导航、物体定位和结构组合任务中的空间推理能力,发现模型在具身代理参考框架和坐标列表识别上存在困难,且微调小模型可能达到前沿模型性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏