V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
机构 * FAIR at Meta ; Mila -- Quebec AI Institute
专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
Comments 48 pages, 19 figures
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
机构 * FAIR at Meta ; Mila -- Quebec AI Institute
专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
Comments 48 pages, 19 figures
专题命中 具身推理 :robotics(abstract);navigation(abstract);robotic(abstract);分类 cs.LG
专题命中 具身推理 :robotics(abstract);embodied AI(abstract);manipulation(abstract);分类 cs.CV
Comments project page: https://embodied-videoagent.github.io/
专题命中 具身推理 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.CV
Comments 14 pages, 11 figures
专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
Comments Project website: https://innermonologue.github.io
专题命中 具身推理 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.CV
Comments Unpublished draft of book chapter
在信任世界模型模拟器的裁决之前先验证其可靠性:世界模型模拟器的可接受性
机构 * Autonomous Vehicle Systems Lab(自主车辆系统实验室) ; Technical University of Munich(慕尼黑技术大学)
专题命中 具身推理 :world model(abstract,comments);robotics(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 研究世界模型模拟器裁决的可靠性问题,基于安全关键模拟的可信度实践定义可接受性阶梯,通过自动驾驶实例验证,指出视觉保真度不能预测行动稳健性,为世界模型模拟器的评估提供了新框架。
Comments Accepted at RSS 2026 Workshop on Robot World Models
DriveCache:面向驾驶世界模型推理的动作感知缓存
专题命中 具身推理 :world model(title);分类 cs.AI、cs.CV
AI总结 针对扩散驾驶生成器吞吐量受限的问题,提出动作感知的DriveCache控制器,利用规划运动与动态规划优化缓存,提升保真度-效率权衡,代码将公开。
Comments 9 pages, 7 figures, 4 tables
SpikeWorld:用于冻结脉冲世界模型的快速状态适应
机构 * DiDi International Business Group(滴滴国际业务集团)
专题命中 具身推理 :world model(title);分类 cs.AI、cs.CV
AI总结 SpikeWorld是145万参数的稀疏脉冲模型,冻结训练参数后通过外部路径实现快速状态适应,提升多模态预测等性能,在Meta-World任务中提高冻结策略奖励与成功率。
Comments 14 pages, 2 figures, 4 tables. Code: https://github.com/Oooorca/SpikeWorld
Enfold:将世界生成器计算融入预测表示以实现高效具身控制
机构 * Shanghai Jiao Tong University(上海交通大学) ; South China University of Technology(华南理工大学) ; Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))
专题命中 具身推理 :world model(title);分类 cs.RO、cs.CV
AI总结 Enfold将世界生成器计算融入预测表示,在LIBERO等多任务中实现高效具身控制,大幅降低动作延迟,且能适应场景变化,为具身控制提供了新范式。
Comments project page, https://zwl666666.github.io/enfold/
SG-WAM:几何感知策略空间中的自引导世界建模
专题命中 具身推理 :world model(title);分类 cs.RO、cs.CV
AI总结 SG-WAM是自引导的几何感知世界动作模型框架,通过策略衍生空间联合优化动态预测等,在LIBERO等数据集上实现高成功率,性能优于基线。
DreamQAS:面向VQE高效量子架构搜索的决策有用世界模型学习
机构 * School of Computing Technologies, RMIT University(RMIT大学计算技术学院) ; Quantum Systems, Data61, CSIRO(澳大利亚联邦科学与工业研究组织数据61分部量子系统部)
专题命中 具身推理 :world model(title);分类 cs.AI、cs.LG
AI总结 该研究提出DreamQAS模型,以基于模型的强化学习框架实现VQE高效量子架构搜索,在多个分子任务上降低了真实VQE调用次数并提升了反事实动作排名效用。
Comments 26 pages, 4 figures, including appendices
Tycho:面向ARC-AGI-3的基于可编程世界模型的主动抽象
机构 * Dresden University of Technology(德累斯顿工业大学) ; Amazon(亚马逊) ; TIB – Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心) ; Leibniz University of Hannover(汉诺威莱布尼茨大学)
专题命中 具身推理 :world model(title);分类 cs.AI、cs.CV
AI总结 针对ARC-AGI-3的交互式抽象问题,提出编码智能体系统Tycho,通过结构化观测构建游戏模型,选定策略下GPT-5.6 Sol与Opus 5可达成100%相对人类行动效率并完成全部关卡。
Comments 52 pages, 18 figures, 17 tables. Open-source implementation: https://github.com/NIMI-research/Tycho
攻击可信想象:对“先想象后行动”世界模型的预言机级完整性攻击
机构 * Adelaide University(阿德莱德大学)
专题命中 具身推理 :world model(title);分类 cs.AI、cs.LG
AI总结 针对“先想象后行动”的视觉-语言-动作策略,发现世界模型中的想象轨迹是暴露的攻击面,通过有界观测扰动破坏想象,并设计无参数去噪检测器,实验显示非定向破坏效果显著,但定向控制受限。
Comments 13 pages, 5 figures, 10 tables
视觉语言模型能预测未来状态吗?从逆动力学引导世界模型
机构 * Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学) ; Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) ; NVIDIA(NVIDIA公司) ; University of Groningen(格罗宁根大学)
专题命中 具身推理 :world model(title);分类 cs.AI、cs.CV
AI总结 本文发现视觉语言模型(VLM)难以直接进行前向动力学预测(FDP),但逆动力学预测(IDP)更容易学习,并利用IDP通过弱监督学习和推理时验证两种策略引导FDP,在Aurora-Bench上取得与最先进图像编辑模型竞争的性能。
为什么我们需要世界模型来实现通用人工智能:大语言模型失败之处以及世界模型如何可能超越
机构 * Department of Computing Technologies(计算技术系) ; SRM Institute of Science and Technology(SRM科学与技术学院) ; Bio-Sensing and Bio-Sensors Group(生物传感与生物传感器组) ; Smart Automation and Communication Technologies Research Institute of Sciences and Engineering(科学与工程智能自动化与通信技术研究所) ; University of Sharjah, UAE(阿联酋沙迦大学) ; Department of Computer Engineering(计算机工程系) ; College of Computing and Informatics(计算与信息学院)
专题命中 具身推理 :world model(title);分类 cs.RO、cs.AI
AI总结 本文通过提出潜在动态推理(LDI)概念和Flux环境案例研究,论证了大语言模型在因果推理、状态跟踪和长程规划上的局限性,并展示基于显式状态空间的强化学习智能体在长程游戏中显著优于纯文本LLM。
Comments 19 pages, 5 figures
三位一体世界模型:用于营销干预的能量一致性、预测和反事实推断
机构 * Meijo University(名古屋大学)
专题命中 具身推理 :world model(title);分类 cs.AI、cs.LG
AI总结 本文提出三位一体世界模型,利用深度玻尔兹曼机学习消费者特征,通过轻量任务适配器实现一致性评估、预测和反事实推断,展示其在营销干预中的优势。
基于观测不匹配的交通信号控制的适应性模块化世界模型规划
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 具身推理 :world model(title);分类 cs.AI、cs.LG
AI总结 本文提出适应性模块化模型,用于解决观测不匹配下的交通信号控制问题,通过模块化规划架构提升性能和数据效率。
Comments Accepted by ICAPS 2026
无需世界模型的世界属性:从静态词嵌入的共现统计中恢复空间和时间结构
机构 * Department of Psychology & Center for Complex Systems and Brain Sciences(心理学系及复杂系统与脑科学中心)
专题命中 具身推理 :world model(title);分类 cs.AI、cs.LG
AI总结 研究通过静态词嵌入的共现统计恢复空间和时间结构,发现文本本身保留了丰富的世界属性信息,挑战了传统对语言模型内部表示的理解。
Comments 12 pages, 3 figures, 3 tables
下一步嵌入预测使世界模型更强大
专题命中 具身推理 :world model(title);分类 cs.AI、cs.LG
AI总结 NE-Dreamer通过时间转换器预测下一步嵌入,无需解码器即可在复杂环境中提升基于模型的强化学习性能。
机构 * University of Edinburgh(爱丁堡大学) ; Cohere ; Vrije Universiteit Brussel(布鲁塞尔自由大学) ; Université de Montréal(蒙特利尔大学)
专题命中 具身推理 :world model(title);分类 cs.AI、cs.LG
机构 * Department of Computer Science and Engineering, University of California, Merced(计算机科学与工程系,加州大学梅尔德分校)
专题命中 具身推理 :robotics(abstract,comments);robotic(abstract);分类 cs.RO、cs.AI
Comments Published in Proceedings of 2025 International Conference on Robotics and Automation (ICRA)
Journal ref IEEE International Conference on Robotics and Automation (ICRA), pages 7146-7152, 2025
机构 * Microsoft Research(微软研究院) ; Tsinghua University(清华大学)
专题命中 具身推理 :world model(title);分类 cs.AI、cs.CV
Comments 18 pages, project page: https://GeometryForcing.github.io
专题命中 具身推理 :world model(title);分类 cs.AI、cs.LG
Comments ICLR 2024 (oral). Updated agents section, new corollary
专题命中 具身推理 :world model(title);分类 cs.AI、cs.LG
Comments Website: https://danijar.com/dreamerv3
专题命中 具身推理 :robotic(title);分类 cs.RO、cs.CV
Comments To appear in MICCAI 2023. Code availability: https://github.com/longbai1006/CS-VQLA
专题命中 具身推理 :world model(title);分类 cs.RO、cs.LG
Comments arXiv admin note: substantial text overlap with arXiv:2205.08712
专题命中 具身推理 :world model(title);分类 cs.AI、cs.LG
Comments 58 pages, 27 figures, comments
Journal ref Advances in Artificial Intelligence and Machine Learning, 2023, Research 3 (1) 778-815
专家评估LLM世界模型:一个高温超导体案例研究
专题命中 具身推理 :world model(title,comments);分类 cs.AI
AI总结 本文通过专家评估LLM在高温超导领域的问题回答能力,发现基于RAG的系统在全面性和证据支持方面优于封闭模型。
Comments (v1) 9 pages, 4 figures, with 7-page supporting information. Accepted at the ICML 2025 workshop on Assessing World Models and the Explorations in AI Today workshop at ICML'25
Journal ref Proceedings of the National Academy of Sciences 123, e2533676123 (2026)
接下来会发生什么?通过生成点轨迹预测未来运动
机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 提出一种基于单张图像预测未来运动的方法,通过生成密集轨迹网格来捕捉场景动态和不确定性,相比现有方法更准确多样,并验证其在机器人等下游任务中的有效性。
Journal ref ICLR 2026