arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-22 至 2026-04-22 共收录 5 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 5 篇

2510.26782 2026-04-22 cs.LG cs.AI cs.CV 89%

Cloning Deterministic Worlds: The Critical Role of Latent Geometry in Long-Horizon World Models

克隆确定性世界:潜在几何在长周期世界模型中的关键作用

Zaishuo Xia, Yukuan Lu, Xinyi Li, Yifan Xu, Yubei Chen

机构 * UC Davis(加州大学戴维斯分校) Open Path AI Foundation(Open Path AI基金会)

专题命中 具身推理 :world model(title,summary_cn);embodied agent(abstract);navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出Geometrically-Regularized World Models (GRWM),通过时间对比学习原理对潜在空间进行几何正则化,提升世界模型的克隆精度和稳定性,解决长周期高保真建模中的几何结构瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19639 2026-04-22 eess.SY cs.AI cs.SY 83%

Safety-Critical Contextual Control via Online Riemannian Optimization with World Models

安全关键的上下文控制 via 在线黎曼优化与世界模型

Tongxin Li

机构 * Tongxin Li(李通心)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI

AI总结 本文研究安全关键的上下文控制问题,提出基于在线黎曼优化的样本惩罚预测控制框架,通过世界模型压缩可行性流形为密度,指导规划器梯度下降,建立基于曲率的安全界限。

Comments 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18564 2026-04-22 cs.CV 83%

MultiWorld: Scalable Multi-Agent Multi-View Video World Models

多世界:可扩展的多智能体多视角视频世界模型

Haoyu Wu, Jiwen Yu, Yingtian Zou, Xihui Liu

机构 * The University of Hong Kong(香港大学) Sreal AI

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.CV

AI总结 多世界框架通过多智能体控制模块和全局状态编码器,实现多智能体多视角视频世界建模,提升视频保真度和多视角一致性。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05540 2026-04-22 cs.RO cs.AI cs.CV cs.LG cs.NE 77%

Constructing the Umwelt: Cognitive Planning through Belief-Intent Co-Evolution

构建环境:通过信念-意图共演的认知规划

Shiyao Sang

机构 * Shiyao Sang(桑世尧)

专题命中 具身推理 :world model(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出基于信念-意图共演的认知规划方法,通过MBCWM和TIWM模型实现环境与现实的认知一致性,提升自动驾驶规划性能并展现类人认知行为。

Comments 12 pages, 8 figures. A paradigm shift from reconstructing the world to understanding it: planning through Belief-Intent Co-Evolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19509 2026-04-22 cs.RO cs.MA 57%

Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies

评估基于视觉语言模型的非人形机器人语义可及性推理

Jess Jones, Raul Santos-Rodriguez, Sabine Hauert

机构 * Bristol Robotics Laboratory, University of Bristol(布里斯托尔机器人实验室,布里斯托尔大学) University of Bristol(布里斯托尔大学)

专题命中 具身推理 :robotic(abstract);分类 cs.RO

AI总结 本文研究了视觉语言模型在非人形机器人上的语义可及性推理能力,通过混合数据集分析发现模型在不同物体和机器人形态上表现不一,存在保守预测倾向,需结合其他方法以提高性能。

Comments AAMAS 2026 (main track), 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏