arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3082 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3082 篇

2510.04391 2026-07-03 cs.AI cs.CL cs.SI q-bio.NC 版本更新 79%

Psychological Imagination Networks Show Cross-Population Centrality and Clustering Alignment in Humans That Large Language Models Fail to Replicate

心理想象网络显示人类跨群体中心性和聚类对齐,而大型语言模型无法复制

Saurabh Ranjan, Brian Odegaard

机构 * University of Florida(佛罗里达大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本研究通过心理网络分析发现,人类对心理意象的生动性评分在不同文化群体中形成稳定的网络结构,而大型语言模型(LLM)无法复制这种结构,表明人类想象网络根植于具身经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01896 2026-07-02 cs.CV 版本更新 79%

Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models

分而治之:多模态世界模型的解耦表示对齐

Junyuan Xiao, Dingkang Liang, Xin Zhou, Yixuan Ye, Tongtong Su, Guangmo Yi, Bin Xia, Qiang Lyu, Shurui Shi, Jun Huang, Jianlou Si, Wenming Yang

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) CSU(中南大学) ZJU(浙江大学) CUHK(香港中文大学) UCAS(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出M²-REPA方法,通过解耦扩散模型中间表示中的模态特定特征并与对应的专家基础模型对齐,实现多模态视频生成中多种基础模型先验的充分利用,显著提升视觉质量和长期一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20083 2026-07-02 cs.CV 新提交 79%

Holo-World: Unified Camera, Object and Weather Control for Video World Model

Holo-World: 视频世界模型的统一相机、物体和天气控制

Xiangchen Yin, Wenzhang Sun, Jiahui Yuan, Zijie Liu, Yinda Chen, Wei Li, Dachun Kai, Chunfeng Wang, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出Holo-World,一种从单张图像联合控制相机、物体运动和天气的统一视频世界模型,通过场景适配器和解耦CFG实现世界保持与天气迁移。

Comments Project Page: https://xiangchenyin.github.io/Holo-World Code: https://github.com/XiangchenYin/Holo-World

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04453 2026-07-02 cs.CV 版本更新 79%

UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving

UniDrive-WM:面向自动驾驶的统一理解、规划和生成世界模型

Zhexiao Xiong, Xin Ye, Burhan Yaman, Sheng Cheng, Yiren Lu, Jingru Luo, Nathan Jacobs, Liu Ren

机构 * Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究院与博世人工智能中心) Washington University in St. Louis(圣路易斯华盛顿大学) Arizona State University(亚利桑那州立大学) Case Western Reserve University(凯斯西储大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出UniDrive-WM,一个基于VLM的统一世界模型,联合执行场景理解、轨迹规划和未来图像生成,在Bench2Drive上轨迹误差降低7.3%,碰撞率降低10.4%。

Comments Accepted to ECCV 2026. Project Page: https://unidrive-wm.github.io/UniDrive-WM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23164 2026-07-02 cs.LG 版本更新 79%

MetaOthello: A Controlled Study of Multiple World Models in Transformers

MetaOthello: Transformer中多个世界模型的控制研究

Aviral Chawla, Galen Hall, Juniper Lovato

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 通过引入共享语法但规则或分词不同的Othello变体套件,训练小型GPT处理混合数据,发现Transformer不划分容量为孤立子模型,而是收敛于跨变体因果转移的共享棋盘状态表示。

Comments Camera-ready version. Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31734 2026-07-01 cs.CV 新提交 79%

MemLearner: Learning to Query Context memory for Video World Models

MemLearner: 学习查询上下文记忆用于视频世界模型

Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出基于学习的自适应上下文查询方法MemLearner,利用视频生成模型自身进行上下文记忆查询,解决视频世界模型在遮挡和动态场景下的场景一致性问题。

Comments ECCV 2026, Project Page: https://yujiwen.github.io/memlearner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31232 2026-07-01 cs.AI 新提交 79%

Delta-JEPA: Learning Action-Sensitive World Models via Latent Difference Decoding

Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型

Zhenghao Zhang, Yuanxiang Wang, Zhenyu Guan, Yujia Yang, Bingkang Shi, Tianyu Zong, Hongzhu Yi, Guoqing Chao, Xingchen Chen, Tiankun Yang, Chenxi Bao, Tao Yu, Jingjing Zhou, Jungang Xu

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Computer Science and Technology, Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)计算机科学与技术学院) Faculty of Computing, Harbin Institute of Technology, Harbin(哈尔滨工业大学计算学部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出Delta-JEPA,一种无重建的世界模型,通过潜在差异动作解码器(LDAD)从连续观测的潜在位移中重建动作,防止表示坍塌,提升基于规划的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30639 2026-06-30 cs.AI cs.CL 79%

Self-Evolving World Models for LLM Agent Planning

面向LLM智能体规划的自我进化世界模型

Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, Yang Deng

机构 * National University of Singapore(国立新加坡大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出WorldEvolver框架,通过情景记忆、语义记忆和选择性预见三个模块在测试时修正世界模型,提升预测准确性和下游规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30421 2026-06-30 cs.CV 79%

OWMDrive: Causality-Aware End-to-End Autonomous Driving via 4D Occupancy World Model

OWMDrive: 基于4D占用世界模型的因果感知端到端自动驾驶

Junjie Cheng, Ruiqi Song, Ye Wu, Nanxing Zeng, Ximiao Li, Yunfeng Ai

机构 * The School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Waytous Inc.(Waytous公司) The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) The College of Surveying and Geo-Informatics, Tongji University(同济大学测绘与地理信息学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出OWMDrive框架,利用4D占用世界模型预测多步3D占用,作为条件先验引导扩散规划器生成强化轨迹,显式建模时空因果依赖,提升复杂场景下的规划鲁棒性和安全性。

Comments International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29850 2026-06-30 cs.CV 79%

Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction

面向具身AI的高效视觉指代:智能体驱动数据合成、跨块注意力与迭代校正

Zijian Hong, Qi Lv, Yuxiang Xie, Jianming Xing, Xiang Deng, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 具身推理 :embodied AI(title,abstract);分类 cs.CV

AI总结 提出PointArena 2026解决方案,通过智能体驱动数据合成、确定性可操控数据流水线、跨块注意力与迭代校正模块,实现77.2%总体准确率,排名第二。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29799 2026-06-30 cs.AI 79%

The CRISTAL Method: Neurosymbolic analysis from AI-synthesized world models

CRISTAL方法:来自AI合成世界模型的神经符号分析

Rafael Kaufmann, Felix Neubürger, Michael Walters, Thomas Kopinski, Dimitrije Marković

机构 * GAIA Lab(GAIA实验室) South Westphalia University of Applied Sciences(西南弗里西亚应用科学大学) Technical University Dresden(德累斯顿技术大学) Primordia Co.(Primordia公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出CRISTAL神经符号框架,通过贝叶斯推理、主动学习和持续学习自动化复杂分析,在合成股票分类任务中仅用5个样本和5秒达到贝叶斯最优精度,远超LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29465 2026-06-30 cs.LG 79%

Prototype Latent World Model Replay for Class-Incremental Learning

原型潜在世界模型回放用于类增量学习

Weizhi Nie, Hui Wang, Weijie Wang, Yuting Su

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出无记忆框架,通过冻结的ImageNet预训练编码器将旧类存储为潜在状态分布,在新类到来时采样回放,结合轻量适配器和对比学习,显著提升类增量学习性能。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28751 2026-06-30 cs.LG cond-mat.stat-mech 79%

A Path-Space Formulation of Prediction in World Models: From a Single Action to Prediction, Planning, and Irreversibility

世界模型中预测的路径空间表述:从单一动作到预测、规划和不可逆性

Gunn Kim

机构 * Department of Physics, Sejong University, Seoul 05006, Republic of Korea(首尔大学物理系,首尔05006,韩国)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出世界模型中预测的路径空间表述,将预测、规划和不确定性统一为作用泛函上的操作,并发现注意力不对称性编码了数据的不可逆性。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22960 2026-06-30 cs.CV 79%

UCM: Unified Modeling of Camera Control and Memory with Time-aware Positional Encoding Warping for World Models

UCM:基于时间感知位置编码变形的相机控制与内存统一建模

Tianxing Xu, Zixuan Wang, Guangyuan Wang, Li Hu, Zhongyi Zhang, Peng Zhang, Bang Zhang, Songhai Zhang

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 UCM通过时间感知位置编码变形机制实现相机控制与长期记忆的统一建模,在真实和合成基准测试中显著提升场景一致性并实现高保真视频生成的精确控制。

Comments Project Page: https://humanaigc.github.io/ucm-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27681 2026-06-29 cs.LG cs.CL 新提交 79%

Textual Belief States for World Models: Identifiable Representation Learning Under Strict Mediation

用于世界模型的文本信念状态:严格中介下的可识别表示学习

Xiang Gao, Kaiwen Dong, Yuguang Yao, Padmaja Jonnalagedda, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出严格中介原则解决LLM中历史旁路导致的潜在状态不可识别问题,引入离散文本潜在状态和因子化GRPO方法,在TextWorld和ScienceWorld上实现表示质量和滚动性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27644 2026-06-29 cs.CV 新提交 79%

CascadeOcc: Rethinking 3D Occupancy World Models with Cascaded VQ Representations

CascadeOcc: 用级联VQ表示重新思考3D占用世界模型

Kyumin Hwang, Wonhyeok Choi, Jaeyeul Kim, Jihun Park, Daehee Park, Sunghoon Im

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出CascadeOcc,一种通过级联向量量化机制在自回归框架中利用占用表示内在结构层次,实现从粗到细的3D场景预测和运动规划,在4D占用预测和运动规划基准上取得优越性能。

Comments Accepted to IEEE Signal Processing Letters (SPL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27014 2026-06-26 cs.LG 新提交 79%

A Generalization Theory for JEPA-Based World Models

基于JEPA的世界模型的泛化理论

Jingyi Cui, Qi Zhang, Hongwei Wen, Yisen Wang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) University of Sydney(悉尼大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本文首次为JEPA世界模型建立泛化理论,将其预训练表述为条件谱图学习问题,并证明JEPA目标等价于动作条件共现矩阵的低秩分解,进而推导出有限样本泛化界,揭示了潜在维度在近似误差与样本误差之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26713 2026-06-26 cs.AI 新提交 79%

LithoDreamer: A Physics-Informed World Model for Multi-Stage Computational Lithography

LithoDreamer: 一种用于多阶段计算光刻的物理信息世界模型

Yuqi Jiang, Yumeng Liu, Zimu Li, Jinyuan Deng, Qian Jin, Yucheng Cui, Yu Li, Xunzhao Yin, Qi Sun, Cheng Zhuo

机构 * Zhejiang University(浙江大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出首个物理信息世界模型LithoDreamer,将光刻流程建模为决策驱动的多步演化系统,通过对比变分优化实现可解释干预,在正向演化和逆向规划中达到最优性能。

Comments Correspondence to: Qi Sun <qisunchn \at zju \dot edu \dot cn>

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML), Jul. 6-11, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25368 2026-06-25 cs.CV 新提交 79%

Hypergraph Normal World Models for Logical Visual Anomaly Detection

超图常态世界模型用于逻辑视觉异常检测

Weizhi Nie, Zibo Xu, Weijie Wang, Yuting Su

机构 * Tianjin University(天津大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出超图常态世界模型,利用DINOv2补丁令牌构建超图统计,通过信息商分离局部、关系和超边证据,在MVTec LOCO上逻辑异常AUROC从0.8434提升至0.9279。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24842 2026-06-24 cs.AI 新提交 79%

World Models in Pieces: Structural Certification for General Agents

分片世界模型:通用智能体的结构化认证

Yikai Lu, Yifei Wu, Xinyu Lu, Tongxin Li

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, Shenzhen, China(香港中文大学(深圳)数据科学学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 针对通用智能体在大世界场景下无法普遍胜任的问题,提出结构化认证框架,通过深度组合目标过滤特定转移,证明世界模型具有O(1/n)+O(δ)误差界,实现可认证部署。

Comments 30 pages, camera-ready version in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24338 2026-06-24 cs.RO 新提交 79%

RoBoSR: Structured Scene Representations for Embodied Robotic Reasoning

RoBoSR:面向具身机器人推理的结构化场景表示

Kewei Hu, Wanchan Yu, Fangwen Chen, Jing Jiajian, Zimeng Li, Ying Wei, Tianhao Liu, Michael Zhang, Hanwen Kang

专题命中 具身推理 :robotic(title);manipulation(abstract);分类 cs.RO

AI总结 提出RoBoSR,一种基于语义对象中心场景图的中间结构表示,将操作建模为逐步状态转换,实现因果推理和长期任务规划,并在零样本泛化中优于提示方法和经典TAMP基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23690 2026-06-24 cs.SE cs.AI 新提交 79%

Beyond the Autoregressive Horizon: A Comprehensive Survey of Diffusion Models, World Modelling, and State Space Models for Code

超越自回归视野:扩散模型、世界模型和状态空间模型在代码领域的综合综述

Kishan Maharaj, Ashita Saxena, Srikanth Tamilselvam

机构 * IBM

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 综述扩散模型、代码世界模型和状态空间模型在代码生成中的潜力,以克服自回归模型在全局规划、长程依赖和执行语义方面的局限,并展望“系统2”代码生成智能体。

Comments 14 Pages, 1 Table, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23105 2026-06-23 cs.CV 新提交 79%

Compression and Retrieval: Implicit Memory Retrieval for Video World Models

压缩与检索:视频世界模型的隐式记忆检索

Zhan Peng, Jie Ma, Huiqiang Sun, Chong Gao, Zhijie Xue, Zhiyu Pan, Zhiguo Cao, Jun Liang, Jing Li

机构 * Huazhong University of Science and Technology(华中科技大学) HUJING Digital Media & Entertainment Group(虎鲸数字媒体与娱乐集团) Sun Yat-sen University(中山大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出注意力驱动的隐式记忆检索机制CaR,通过位置编码注入视角信息实现灵活检索,并引入轻量级上下文压缩网络,在构建的SceneFly数据集上取得SOTA结果并展现强泛化性。

Comments Project page: 3DV-Team/CaR" target="_blank" rel="noopener">https://github.com/Orange-3DV-Team/CaR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22261 2026-06-23 cs.LG cs.GT 新提交 79%

Learning a Normal World Model for Few-Shot Boundary-Calibrated Abnormality Detection

学习正常世界模型用于少样本边界校准的异常检测

Weizhi Nie, Weichao Liu, Weijie Wang, Yuting Su

机构 * Tianjin University(天津大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出超图熵正常世界模型,通过正常事件学习正常世界并用少量异常样本校准边界,在NASA C-MAPSS数据集上实现强零样本和少样本异常检测性能。

Comments 23 pages,8 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21961 2026-06-23 cs.LG 新提交 79%

VegSim: A Geospatial World Model for Scenario-Conditioned Vegetation Simulation

VegSim:一种用于情景条件植被模拟的地理空间世界模型

Irene Iele, Elena Mulero Ayllón, Paolo Soda, Matteo Tortora

机构 * Università Campus Bio-Medico di Roma(罗马生物医学大学) Umeå University(于默奥大学) University of Genoa(热那亚大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出VegSim,一种地理空间世界模型,通过可控制的未来气象输入,实现情景条件植被模拟,在分布内和分布外数据上均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21315 2026-06-23 cs.AI 新提交 79%

Social World Model for Lifelong Social Intelligence

社会世界模型:面向终身社会智能

Yu Luo

机构 * Central South University(中南大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出社会世界模型,将社交互动分解为五个维度构建闭环学习框架,并配套数据合成机制与终身学习基准,使小模型可持续获取社会协调能力。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21172 2026-06-23 cs.CV 新提交 79%

BadDreamer: Transferable Backdoor Attacks against Video World Models for Autonomous Driving

BadDreamer: 针对自动驾驶视频世界模型的可迁移后门攻击

Zhe Shuai, Xiaopeng Xie, Yikun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出BadDreamer,一种针对自动驾驶视频世界模型的可迁移时空后门攻击,通过污染未来帧中的触发-擦除序列,使模型在物理触发出现时幻觉化障碍物消失,进而误导下游动作预测。

Comments 19 pages, 8 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24354 2026-06-23 cs.CV 版本更新 79%

SparseWorld: Enhancing End-to-End Autonomous Driving via World Models with Sparse Scene Representation

SparseWorld: 通过具有稀疏场景表示的世界模型增强端到端自动驾驶

Ruoyu Wang, Jingke Wang, Yukai Ma, Yuehao Huang, Shuangming Lei, Guanglin Xu, Aixue Ye, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学控制系统研究所) Labs, Huawei(华为2012实验室) State Key Laboratory of Industrial Control Technology(国家工业控制技术重点实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出SparseWorld,一种基于稀疏场景表示的轻量级世界模型,通过自回归预测未来地图元素和周围智能体,并利用预测结果优化下游运动预测和轨迹规划,在nuScenes数据集上实现0.05%的碰撞率,达到开放循环规划指标的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11061 2026-06-23 cs.CV 版本更新 79%

VDAWorld: World Modelling via VLM-Directed Abstraction and Simulation

VDAWorld: 通过VLM导向的抽象与模拟进行世界建模

Felix O'Mahony, Roberto Cipolla, Ayush Tewari

机构 * University of Cambridge(剑桥大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出VDAWorld框架,利用视觉语言模型自主构建场景表示并选择物理模拟器,通过抽象与自适应模拟实现高质量世界建模,在交互控制、反事实生成和物理逻辑推理任务上取得最优结果。

Comments Website: https://felixomahony.github.io/vdaworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20545 2026-06-19 cs.CV 新提交 79%

Current World Models Lack a Persistent State Core

当前世界模型缺乏持久状态核心

Jinpeng Lu, Dexu Zhu, Haoyuan Shi, Linghan Cai, Guo Tang, Yinda Chen, Jie Cao, Duyu Tang, Yi Zhang, Yong Dai, Xiaozhu Ju

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京人形机器人创新中心) NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) Independent Researcher(独立研究者) Dresden University of Technology(德累斯顿工业大学) Peking University(北京大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出WRBench基准测试,发现现有世界模型在观测中断时无法维持世界状态演化,强调物理状态核稳定性应成为世界模型设计首要目标。

Comments 39 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏