Overcoming Statistical Bias in Action-Controllable World Models
克服动作可控世界模型中的统计偏差
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 该研究针对动作可控世界模型的统计偏差问题,提出CoCo反事实一致性框架,结合ARC、DE评估指标及Mini-SSMB数据集,在多项任务上提升了动作可控性与视频预测性能。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
克服动作可控世界模型中的统计偏差
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 该研究针对动作可控世界模型的统计偏差问题,提出CoCo反事实一致性框架,结合ARC、DE评估指标及Mini-SSMB数据集,在多项任务上提升了动作可控性与视频预测性能。
WorldMark:交互式视频世界模型的统一基准套件
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 WorldMark 是交互式视频世界模型的统一基准套件,通过适配器解决动作格式不兼容问题,从多维度评估模型,揭示现有协议未察觉的差异,将发布相关数据与代码。
HelloWorld:在视频世界模型中实现具有社交互动性的角色
机构 * The University of Tokyo(东京大学) ; Alaya Lab(阿莱亚实验室)
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 该研究提出HelloWorld视频世界模型,通过自蒸馏流水线和训练模块实现角色与用户的社交互动,构建含400样本的基准,其互动质量优于基线且保持顶尖图像美学。
Comments Project page: https://github.com/AlayaLab/HelloWorld
助力音乐协同创作智能体“良好聆听”:用于理解与生成的分层自监督世界模型
机构 * Belmont University(贝尔蒙特大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.LG
AI总结 本研究提出分层自监督世界模型,通过Swin V2编码器与条件流匹配模型构建协同音乐创作智能体,提升了和弦与调式检测准确率,可快速生成音乐建议并支持交互演示。
Comments 20 pages, 14 figures. A 6-page version was submitted to the NeurIPS 2026 Creative AI Track. Supplemental website with listening examples: https://drscotthawley.github.io/midi-rae-jepa-son/. Live demo: https://drscotthawley-midi-rae-jepa-son.hf.space/
muSync-GS:面向天气与几何道路危险场景的物理同步驾驶视频合成方法
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; City University of Hong Kong(香港城市大学)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 muSync-GS是一种物理同步驾驶视频合成框架,通过耦合天气、道路几何编辑与车辆动力学,在12个CarSim案例上实现了车辆状态的精准预测与场景同步。
Comments 42 pages, 14 figures; includes an appendix