Grounding Generated Videos in Feasible Plans via World Models
通过世界模型将生成视频接地到可行计划中
专题命中 具身推理 :world model(title,abstract);manipulation(abstract);navigation(abstract);分类 cs.LG
AI总结 本文提出GVP-WM方法,通过学习动作条件的世界模型,将生成视频计划接地为可行动作序列,解决视频生成计划在时间一致性和物理约束上的问题。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
通过世界模型将生成视频接地到可行计划中
专题命中 具身推理 :world model(title,abstract);manipulation(abstract);navigation(abstract);分类 cs.LG
AI总结 本文提出GVP-WM方法,通过学习动作条件的世界模型,将生成视频计划接地为可行动作序列,解决视频生成计划在时间一致性和物理约束上的问题。
想象后再计划:基于世界模型的自适应前瞻学习 agent 学习框架
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出Imagine-then-Plan框架,通过自适应前瞻机制提升agent在复杂任务中的推理能力,实验表明其优于现有方法。
弥合场景生成与规划:通过统一视觉与运动表示进行驾驶世界模型
机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) ; Afari Intelligent Drive(Afari智能驾驶)
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 本文提出WorldDrive框架,通过统一视觉与运动表示弥合场景生成与规划之间的差距,利用轨迹感知驾驶世界模型和未来感知奖励器提升自动驾驶规划性能。
Comments 16 pages, 9 figures. The code is available at https://github.com/TabGuigui/WorldDrive
EyeWorld: 一种眼态与动态的生成世界模型
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 EyeWorld通过统一多模态解析与时间条件状态转移,实现对眼态的鲁棒多模态解释与临床预测模拟。
Comments 38 pages, 8 figures
从梯度到里卡蒂几何:用于单次学习的卡尔曼世界模型
机构 * UC Berkeley School of Information(伯克利大学信息学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.LG
AI总结 本文提出卡尔曼世界模型(KWM),通过递归贝叶斯滤波而非反向传播优化动态系统,实现无梯度的训练与适应,适用于序列建模任务,展示出竞争性能和增强的鲁棒性与持续适应性。
超越注意力:通过球面核算子构建真正的自适应世界模型
机构 * Independent Researcher(独立研究者)
专题命中 具身推理 :world model(title,abstract);分类 cs.LG
AI总结 本文提出球面核算子,通过将数据流形投影到统一的高维球面并利用超球面多项式,解决传统注意力机制的饱和问题,提升世界模型的预测能力与收敛速度。
ExoPredicator:为机器人规划学习动态世界的抽象模型
专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出ExoPredicator框架,通过联合学习符号状态表示和因果过程,解决长周期具身规划中的外源性过程建模问题,实现对复杂任务的泛化能力。
Comments ICLR 2026. The last two authors contributed equally in co-advising
全景 affordance 预测
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; SJTU(上海交通大学) ; MBZUAI(慕尼黑工业大学人工智能研究所) ; UniTrento(特伦特大学) ; Knowin
专题命中 具身推理 :embodied AI(abstract);分类 cs.RO、cs.CV
AI总结 本文提出全景 affordance 预测,利用 360 度影像捕捉全局空间关系,通过 PAP-12K 数据集和 PAP 框架解决超高清影像的高分辨率和畸变问题,展现全景感知在具身智能中的潜力。
BLINK:自然杀伤细胞杀伤行为的隐式建模
专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG
AI总结 BLINK通过轨迹基于的递归状态空间模型,从部分观测的NK-肿瘤相互作用序列中学习隐式相互作用动力学,预测凋亡增量并提升单细胞水平的NK细胞杀伤行为的定量评估与结构建模能力。
耦合粒子滤波器用于鲁棒的 affordance 估计
机构 * Robotics and Biology Laboratory, Technische Universität Berlin(技术大学柏林机器人与生物学实验室) ; Robotics Institute Germany(德国机器人研究所) ; Science of Intelligence (SCIoI), Cluster of Excellence, Berlin, Germany(智能科学(SCIoI),卓越中心,柏林,德国)
专题命中 具身推理 :robotic(abstract);分类 cs.RO;robotics(comments)
AI总结 本文提出耦合递归估计器用于估计 affordance 的可抓取和可移动区域,通过双向信息交换提升鲁棒性和精度,在真实数据集上优于现有方法。
Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026
RS-WorldModel:一种用于遥感理解与未来感知预测的统一模型
机构 * Central South University(中南大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Guangming Laboratory(光明实验室) ; South China University of Technology(华南理工大学)
专题命中 具身推理 :world model(abstract);分类 cs.AI
AI总结 RS-WorldModel通过联合处理时空变化理解和文本引导的未来场景预测,提升遥感任务的跨任务迁移能力,其在1.1 million样本数据集上训练,参数仅2B即可超越多数开源模型。
学习2D不变的可供性知识以实现3D可供性定位
专题命中 具身推理 :robotics(abstract);分类 cs.CV
AI总结 本文提出MIFAG框架,通过多视角交互图像提取不变可供性知识,提升3D对象可供性定位的泛化能力。
Comments Accepted by AAAI 2025 (Oral)
RenderMem:将渲染作为空间记忆检索
专题命中 具身推理 :embodied agent(abstract);分类 cs.AI
AI总结 RenderMem通过将渲染作为3D世界与空间推理的接口,使智能体能直接进行视角相关的可见性与遮挡推理,提升空间记忆系统的表现。
理解下一token预测器中看似无用特征的出现
专题命中 具身推理 :world model(abstract);分类 cs.LG
AI总结 研究探讨了训练中的Transformer模型如何计算看似冗余的抽象特征,并提出方法分析梯度信号对特定特征形成的影响,通过玩具任务和小型模型验证,揭示了预训练语言模型中形式推理领域特征的产生机制。
Comments ICLR 2026
利用视觉语言模型推理来约束任务和运动规划
机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) ; Department of Computer Science, Rice University(莱斯大学计算机科学系) ; Ken Kennedy Institute, Rice University(莱斯大学肯尼迪研究所)
专题命中 具身推理 :robotics(abstract);分类 cs.RO
AI总结 本文提出VIZ-COAST方法,利用大预训练视觉语言模型的空间推理能力,提前识别向下细化中的问题,减少规划时间并消除失败。
Comments 9 pages, 7 figures, 1 table. Submitted to IROS 2026