Imaginative World Modeling with Scene Graphs for Embodied Agent Navigation
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);embodied agent(title);分类 cs.RO
Comments 23 pages
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);embodied agent(title);分类 cs.RO
Comments 23 pages
带有单调规划代价的潜在世界模型用于图像目标导航
机构 * Drexel University(卓克索大学)
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);分类 cs.RO
AI总结 本文提出基于冻结DINO编码器的潜在世界模型,通过自回归回退损失与单调代价排序损失优化,在GNM数据集上实现图像目标导航最优性能,方向误差较基线降低2.7倍,还可零样本部署于物理机器人。
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
Comments CVPR 2025. Project page: https://www.amirbar.net/nwm/
基于语言的视觉导航世界建模
机构 * University of Washington(华盛顿大学) ; National University of Singapore(新加坡国立大学) ; Clemson University(克莱姆森大学) ; Drexel University(德雷塞尔大学) ; Microsoft Research(微软研究院)
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文研究了基于语言的视觉导航问题,提出LCVN数据集并开发了两种模型家族,通过语言 grounding、未来状态预测和动作生成实现统一任务学习。
Comments 19 pages, 6 figures, Code: https://github.com/F1y1113/LCVN
通过记忆增强的规划和前瞻性构建视觉导航的统一世界模型
机构 * University of Washington(华盛顿大学) ; National University of Singapore(新加坡国立大学) ; Apple(苹果公司) ; Microsoft Research(微软研究院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出UniWM,一种整合视觉前瞻性与规划的统一世界模型,通过记忆机制提升导航鲁棒性和泛化能力,在多个基准测试中显著提升导航成功率。
Comments 21 pages, 12 figures, code: https://github.com/F1y1113/UniWM
机构 * School of Integrated Design Engineering, Keio University(整合设计工程学院,庆应大学)
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
Comments Preprint version
机构 * Stanford University(斯坦福大学) ; Jet Propulsion Laboratory(喷气推进实验室) ; California Institute of Technology(加州理工学院)
专题命中 具身导航 :navigation(title,abstract);robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.AI、cs.CV
专题命中 具身导航 :navigation(title,abstract);robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.AI、cs.LG
Comments Final print version is here: https://royalsocietypublishing.org/doi/10.1098/rstb.2021.0447
Journal ref Philosophical Transactions of the Royal Society B, Volume 378 Issue 1869, 2022
NavWM:一种用于前瞻性规划的统一导航世界模型
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beihang University(北京航空航天大学) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);robotics(abstract);分类 cs.RO、cs.CV
AI总结 提出NavWM统一导航世界模型,通过潜在世界令牌提取几何与语义先验,结合锚点多模态轨迹预测框架生成多样化动作空间,利用视觉前瞻评估最优路径,在多种机器人数据集上显著提升未来状态生成与零样本导航成功率。
Comments 13 pages, 5 figures, accepted to ECCV 2026
基于策略引导的世界模型规划用于语言条件的视觉导航
机构 * Drexel University(德雷塞尔大学)
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);embodied AI(abstract);分类 cs.RO、cs.AI
AI总结 本文提出PiJEPA框架,结合学习导航策略与潜在世界模型规划,通过微调Octo策略和冻结预训练视觉编码器,提升语言指导下的视觉导航准确性与指令遵循性。
NavForesee: 一种统一的视觉-语言世界模型用于分层规划和双时间尺度导航预测
机构 * Alibaba Group(阿里巴巴集团)
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV
AI总结 NavForesee通过统一的视觉-语言模型实现分层规划和双时间尺度导航预测,结合任务分解与环境预测,提升复杂场景下的导航能力。
空域世界模型用于3D空间中的长视距视觉生成与导航
机构 * Tsinghua University(清华大学)
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);embodied agent(abstract);分类 cs.RO、cs.AI
AI总结 ANWM是一种空域导航世界模型,通过预测未来视觉观察来提升无人机在大规模3D空间中的长视距导航性能。
机构 * School of Biomedical Engineering & Imaging Sciences(生物医学工程与成像科学学院) ; Kings College London(伦敦国王学院) ; Nuffield Department of Primary Care Health Sciences(初级卫生保健科学纽菲尔德部门) ; University of Oxford(牛津大学)
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);robotic(abstract);分类 cs.RO、cs.LG
Comments Published in Medical Image Computing and Computer Assisted Intervention - MICCAI 2025, Lecture Notes in Computer Science, vol 15968
Journal ref MICCAI 2025. Lecture Notes in Computer Science, vol 15968 (2026)
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Computer Science, University of Technology Sydney(悉尼大学计算机学院) ; IAIR, Xi’an Jiaotong University(西安交通大学IAIR)
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);embodied AI(abstract);分类 cs.RO、cs.CV
Comments 8 pages, 5 figures
Journal ref IROS 2025
专题命中 具身导航 :navigation(title,abstract);robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV
专题命中 具身导航 :manipulation(title,abstract);navigation(title);robot learning(abstract);robotic(abstract)
Comments Project website at https://crossformer-model.github.io/
专题命中 具身导航 :navigation(title,abstract);robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.CV
专题命中 具身导航 :navigation(title,abstract);robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.LG
Comments To appear in Proc. 29th Int. Conf. on Tools and Algorithms for the Construction and Analysis of Systems (TACAS)
专题命中 具身导航 :navigation(title,abstract);robotics(abstract);embodied AI(abstract);embodied agent(abstract)
Comments Accepted by TPAMI 2025
Bench-Push:基于推动的移动机器人导航与操作任务基准测试
机构 * Institute for Robotics and Intelligent Machines, Georgia Institute of Technology(机器人与智能机器研究所,佐治亚理工学院) ; Department of Electrical and Computer Engineering, University of Waterloo(电气与计算机工程系,滑铁卢大学) ; Department of Mechanical Engineering, University of Alberta(机械工程系,阿尔伯塔大学)
专题命中 具身导航 :manipulation(title,abstract);navigation(title,abstract);robotics(abstract);分类 cs.RO
AI总结 提出首个统一的推动式移动机器人导航与操作基准Bench-Push,包含多种模拟环境、新评估指标和基线实现,用于解决可移动障碍物环境中的机器人推动任务评估问题。
Comments Published in CRV 2026
关于内血管模型和机械取栓导航的有效性指标的立场声明,代表人工智能辅助机器人取栓利益相关者工作组(START)
机构 * on behalf of the Stakeholder Taskforce for AI-assisted Robotic Thrombectomy (START)(人工智能辅助机器人取栓任务组成员)
专题命中 具身导航 :navigation(title,abstract);robotic(title,abstract);robotics(abstract);分类 cs.RO
AI总结 本文旨在建立共识框架,开发和验证人工智能辅助机器人用于取栓,标准化有效性指标并定义参考测试环境,以提升地理多样性人群的及时取栓访问。
Comments Published in Journal of the American Heart Association
Journal ref J Am Heart Assoc. 2026;15:e044931
SimWorld-Robotics: 为多模态机器人导航与协作合成逼真动态城市环境
机构 * University of Virginia(弗吉尼亚大学) ; UC San Diego(加州大学圣地亚哥分校) ; Johns Hopkins University(约翰霍普金斯大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan(密歇根大学)
专题命中 具身导航 :robotics(title,abstract);navigation(title,abstract);embodied AI(abstract);分类 cs.AI
AI总结 SimWorld-Robotics通过合成逼真动态城市环境,提出两个多模态机器人基准测试,评估机器人在复杂场景中的导航、协作与通信能力。
Comments Conference: NeurIPS 2025 (main)
机构 * University of Bonn(波恩大学)
专题命中 具身导航 :manipulation(title,abstract);navigation(title,abstract);robotic(abstract);分类 cs.RO
机构 * NVIDIA ; UC Berkeley(加州大学伯克利分校) ; UT Austin(德克萨斯大学奥斯汀分校)
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);robotics(abstract);分类 cs.RO
专题命中 具身导航 :manipulation(title,abstract);navigation(title,abstract);robotics(abstract);分类 cs.RO
Comments 16 pages, 19 figures, conference
专题命中 具身导航 :navigation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.LG;robotics(journal_ref)
Journal ref IEEE Robotics and Automation Letters, Volume: 4, Issue:4, On Page(s): 4555-4562, 2019
360CityArena:面向具身智能体的真实虚拟城市导航基准
机构 * The University of Tokyo(东京大学)
专题命中 具身导航 :embodied agent(title,abstract);navigation(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 研究人员提出基于东京秋叶原重建的360CityArena城市导航基准,评估具身智能体城市探索能力,发现最强模型Gemini 2.5 Flash表现远低于人类,为相关研究提供了挑战性测试平台。
Comments ECCV2026. Project Page: https://360mm-team.github.io/360CityArena/
实现24小时农业机器人技术:用于夜间视觉导航的无监督日夜跨模态图像翻译
机构 * LaSER Lab, Kennesaw State University(激光实验室,肯尼索州立大学) ; Lincoln Institute for Agri-Food Technology, University of Lincoln(林肯农业食品技术研究所,林肯大学)
专题命中 具身导航 :robotics(title,abstract);navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 该研究针对农业机器人夜间视觉导航中大规模标注图像数据集难获取的问题,提出无监督图像翻译框架,整合CLIP模型并引入可见性掩码,复用白天语义标签训练模型,经实验验证提升了图像质量和下游语义分割性能。
Comments Accepted to IROS2026
WorldMAP: 通过生成世界模型提升视觉-语言导航轨迹预测
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Shandong University(山东大学) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy(中关村学院)
专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 WorldMAP通过生成世界模型与教师-学生框架,将生成的未来场景转化为语义空间结构和规划监督,提升导航轨迹预测的稳定性与准确性,取得最佳性能。
机构 * Dept. of Computer Science University of Texas at Dallas Richardson, TX, USA(计算机科学系 德州大学达拉斯分校 Richardson, TX, USA)
专题命中 具身导航 :navigation(title,abstract);robotics(title);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
Comments 8 pages, 4 figures