arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-22 至 2026-05-22 共收录 7 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 7 篇

2507.23773 2026-05-22 cs.AI cs.CL cs.LG cs.RO 85%

General Agentic Planning Through Simulative Reasoning with World Models

通过世界模型的模拟推理实现通用代理规划

Mingkai Deng, Jinyu Hou, Zhiting Hu, Eric Xing

机构 * Institute of Foundation Models (IFM)(基础模型研究所) Carnegie Mellon University(卡内基梅隆大学) UC San Diego(南加州大学)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出通过模拟推理实现通用代理规划,利用世界模型进行未来状态预测,提升决策能力,通过SiRA架构在不同任务中取得更高任务完成率。

Comments Winner of Berkeley LLM Agents Hackathon (Fundamentals Track); code available at https://github.com/sailing-lab/sira

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22164 2026-05-22 cs.LG cs.RO 84%

Beyond Euclidean Proximity: Repairing Latent World Models with Horizon-Matched Trajectory Reachability Metrics

超越欧几里得距离:通过地平线匹配轨迹可达性度量修复潜在世界模型

Liangyu Li, Shengzhi Wang, Qingwen Liu

机构 * Tongji University(同济大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出轨迹可达性度量(TRM)作为固定潜在世界模型的后处理终端排名方法,通过训练小的成对头部来改进终端排名,从而提高连续操控任务的性能。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21963 2026-05-22 cs.LG cs.AI 81%

ChronoMedicalWorld: A Medical World Model for Learning Patient Trajectories from Longitudinal Care Data

ChronoMedicalWorld:一个用于从纵向护理数据中学习患者轨迹的医学世界模型

Jiangyuan Wang, Xuyong Chen, Junwei He, Xu Xu, Shasha Xie, Fuman Han

机构 * Beijing KidneyTec Medical Technology Co., Ltd.(北京肾科医疗技术有限公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种名为ChronoMedicalWorld的模型,旨在通过纵向护理数据学习患者轨迹,该模型结合了联合嵌入状态编码器和宽动作编码器,并在六个术语目标下训练了循环潜在转移模块,以提高慢性病护理中长期预测的准确性。

Comments 14 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11836 2026-05-22 cs.AI 79%

Finite Automata Extraction: Low-data World Model Learning as Programs from Gameplay Video

有限自动机提取:从游戏录像中学习低数据世界模型作为程序

Dave Goel, Matthew Guzdial, Anurag Sarkar

机构 * Department of Computing Science, Alberta Machine Intelligence Institute (Amii), University of Alberta(计算科学系,阿尔伯塔机器智能研究所(Amii),阿尔伯塔大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出了一种名为有限自动机提取(FAE)的方法,通过一种新的领域特定语言(DSL)Retro Coder,从游戏录像中学习神经符号世界模型,相较于以往的方法,FAE能够更精确地建模环境并生成更通用的代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02193 2026-05-22 cs.AI 79%

From monoliths to modules: Decomposing transducers for efficient world modelling

从整体到模块:分解转换器以实现高效的world建模

Alexander Boyd, Franz Nowak, David Hyland, Manuel Baltieri, Fernando E. Rosas

机构 * Department of Informatics, University of Sussex(Sussex大学信息学院) Beyond Institute for Theoretical Science (BITS)(理论科学研究所) ETH Zürich(苏黎世联邦理工学院) Principles of Intelligent Behaviour in Biological and Social Systems (PIBBSS)(生物和社会系统智能行为原理研究所) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Araya Inc.(Araya公司) Sussex AI and Sussex Centre for Consciousness Science, University of Sussex(Sussex大学人工智能与意识科学中心) Centre for Complexity Science and Center for Psychedelic Research, Department of Brain Sciences, Imperial College London(复杂科学中心和迷幻研究中心,伦敦帝国理工学院脑科学系) Center for Eudaimonia and Human Flourishing, University of Oxford(幸福与人类繁荣中心,牛津大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出了一种分解复杂world建模的方法,通过转换器框架将世界模型分解为多个模块,从而提高计算效率并支持分布式推理,为AI安全和现实应用提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22456 2026-05-22 cs.RO cs.AI 62%

Steins;Gate Drive: Semantic Safety Arbitration over Structured Futures for Latency-Decoupled LLM Planning

Steins;Gate Drive: 基于结构化未来语义安全仲裁的延迟解耦LLM规划

Anjie Qiu, Hans D. Schotten

机构 * Institute for Wireless Communication and Navigation(无线通信与导航研究所) RPTU University Kaiserslautern-Landau(凯撒斯劳滕-兰道大学) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出SteinsGateDrive架构,通过延迟解耦规划与运行时架构,在保持安全边界的同时,将有效延迟从+3.07秒减少到-0.01秒,提升了自动驾驶的规划效率。

Comments 10 pages, 2 figures, 5 tables, submitted to IEEE transaction of intelligent vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22089 2026-05-22 cs.CV cs.AI 62%

LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model

LVDrive: 基于潜在视觉表征的视觉-语言-动作自动驾驶模型

Xiaodong Mei, Diankun Zhang, Hongwei Xie, Guang Chen, Hangjun Ye, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaomi EV(小米电动车)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出LVDrive,一种增强视觉-语言-动作能力的自动驾驶模型,通过引入未来场景预测任务,在高维潜在空间中学习语义丰富的场景表示,从而提升闭环驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏