arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-13 至 2026-04-13 共收录 5 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 5 篇

2604.08719 2026-04-13 cs.CV cs.AI cs.RO 82%

LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving

LMGenDrive: 联合多模态理解与生成世界建模以实现端到端驾驶

Hao Shao, Letian Wang, Yang Zhou, Yuxuan Hu, Zhuofan Zong, Steven L. Waslander, Wei Zhan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出LMGenDrive框架,结合LLM多模态理解与生成世界模型,提升自动驾驶的闭环性能,通过视频预测和控制信号生成,增强时空场景建模和指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09059 2026-04-13 cs.CV cs.AI 81%

Learning Vision-Language-Action World Models for Autonomous Driving

学习视觉-语言-动作世界模型以实现自动驾驶

Guoqing Wang, Pin Tang, Xiangxuan Ren, Guodongfang Zhao, Bailan Feng, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) Central Research Institute, Huawei(华为中央研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出VLA-World模型,通过结合预测想象与反思推理提升自动驾驶的前瞻性。该模型利用生成的轨迹引导图像生成,并通过反思优化轨迹预测,实验表明其在规划和未来场景生成任务中优于现有方法。

Comments Accepted by CVPR2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03353 2026-04-13 cs.MA cs.AI 79%

Decentralized Collective World Model for Emergent Communication and Coordination

去中心化的集体世界模型用于涌现通信与协调

Kentaro Nomura, Tatsuya Aoki, Tadahiro Taniguchi, Takato Horii

机构 * The University of Osaka(大阪大学) Kyoto University(京都大学) Ritsumeikan University(立命馆大学) The University of Tokyo(东京大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出一种去中心化的多智能体世界模型,通过时间扩展的集体预测编码实现通信与协调的同步发展,通过对比学习促进信息对齐,展示了在双智能体轨迹绘制任务中优于非通信模型的协调能力。

Comments Accepted at IEEE ICDL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09338 2026-04-13 cs.AI cs.CL 70%

Mind the Gap Between Spatial Reasoning and Acting! Step-by-Step Evaluation of Agents With Spatial-Gym

注意空间推理与行动之间的差距!通过Spatial-Gym进行分步评估代理

Lars Benedikt Kaesberg, Tianyu Yang, Niklas Bauer, Terry Ruas, Jan Philip Wahle, Bela Gipp

专题命中 具身推理 :robotics(abstract);navigation(abstract);分类 cs.AI

AI总结 本文提出Spatial-Gym环境,通过2D网格谜题的分步决策任务评估模型在空间推理中的能力,发现分步格式对弱模型有益但对强模型有负面影响,且视觉模型在空间环境中的表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11340 2026-04-13 cs.CV cs.RO 54%

REACT3D: Recovering Articulations for Interactive Physical 3D Scenes

REACT3D: 交互式物理3D场景中关节的恢复

Zhao Huang, Boyang Sun, Alexandros Delitzas, Jiaqi Chen, Marc Pollefeys

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) Microsoft Spatial AI Lab(微软空间人工智能实验室)

专题命中 具身推理 :robotics(comments,journal_ref);分类 cs.RO、cs.CV

AI总结 REACT3D通过零样本框架实现静态3D场景到可交互模拟的转换,解决了标注过程繁琐的问题,提升了多任务应用的兼容性与效率。

Comments Accepted at IEEE Robotics and Automation Letters (RA-L)

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 5, pp. 5954-5961, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏