arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3082 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3082 篇

2606.13376 2026-06-18 cs.CV 新提交 79%

MoVerse: Real-Time Video World Modeling with Panoramic Gaussian Scaffold

MoVerse: 基于全景高斯支架的实时视频世界建模

Yang Zhou, Ziheng Wang, Yuqin Lu, Haofeng Liu, Jun Liang, Shengfeng He, Jing Li

机构 * South China University of Technology Columbia University Orange Team, Youku Moku-Lab, HUJING Digital Media \& Entertainment Group Singapore Management University

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出MoVerse,从单张窄视场图像实时构建可交互漫游的360度全景世界,通过拓扑感知扩散补全视场、全景几何残差预测生成3D高斯支架,并结合双向扩散教师蒸馏为因果自回归学生实现低延迟视频渲染。

Comments Project Page: https://orange-3dv-team.github.io/MoVerse/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18250 2026-06-17 cs.CV 新提交 79%

Future Dynamic 3D Reconstruction: A 3D World Model with Disentangled Ego-Motion

未来动态3D重建:一种具有解耦自运动的3D世界模型

Nils Morbitzer, Jonathan Evers, Artem Savkin, Thomas Stauner, Nassir Navab, Federico Tombari, Stefano Gasperini

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出FR3D世界模型,通过解耦场景3D演化与智能体轨迹,利用教师-学生蒸馏策略实现从单目观测到未来动态3D重建的几何一致性和零样本泛化。

Comments ICML 2026. Project page: https://fr3d-wm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17800 2026-06-17 cs.CV 新提交 79%

MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model

MaineCoon: 追求实时音视频社交世界模型

Lichen Bai, Tianhao Zhang, Shitong Shao, Dingwei Tan, Qiyu Zhong, Zhengpeng Xie, Haopeng Li, Qinghao Huang, Dandan Shen, Tengjiao Ji, Wei Wang, Peicheng Wu, Yuxuan Zhao, Xiangyu Zhu, Welly Luo, Shurui Yang, Zeke Xie

机构 * Catnip AI Team(Catnip AI团队)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出MaineCoon,首个22B参数的实时音视频自回归模型,支持单GPU上高达47.5 FPS的流式生成和亚秒级交互,专为社交互动应用优化,引入自重采样、跨模态对齐、领域偏好优化和强化在线策略蒸馏等技术。

Comments 32 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16070 2026-06-17 cs.AI 新提交 79%

Mind-Studio: Executable World Models with Lookahead Evaluation for Partially Observable Games

Mind-Studio: 针对部分可观测游戏的可执行世界模型与前向评估

Yifei Dong, Mingen Zheng, Linquan Wu, Jeff Z. Pan, Jiaxin Bai

机构 * Hong Kong University of Science and Technology(香港科技大学) City University of Hong Kong(香港城市大学) University of Edinburgh(爱丁堡大学) Hong Kong Baptist University(香港浸会大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出Mind-Studio框架,利用大语言模型从轨迹合成可执行的pygame风格世界模型,通过K步前向保真度协议评估,在Montezuma's Revenge等游戏中显著提升预测准确性和子目标验证。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22748 2026-06-17 cs.AI 版本更新 79%

Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond

代理世界建模:基础、能力、定律及更远

Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang, Teng Tu, Weijian Ma, Ziqi Huang, Senqiao Yang, Wei Huang, Yeying Jin, Zhefan Rao, Jinhui Ye, Xinyu Lin, Xichen Zhang, Qisheng Hu, Shuai Yang, Leyang Shen, Wei Chow, Yifei Dong, Fengyi Wu, Quanyu Long, Bin Xia, Shaozuo Yu, Mingkang Zhu, Wenhu Zhang, Jiehui Huang, Haokun Gui, Runyi Li, Chenyu Tang, Dong Huang, Xuhang Chen, Rui Liu, Chengzu Li, Shiyi Du, Xu Huang, Haoxuan Che, Long Chen, Qifeng Chen, Wenya Wang, Wenxuan Zhang, Xiaojuan Qi, Yang Deng, Yanwei Li, Mike Zheng Shou, Zhi-Qi Cheng, See-Kiong Ng, Ziwei Liu, Philip Torr, Jiaya Jia

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Chinese University of Hong Kong(香港中文大学) University of Hong Kong(香港大学) University of Washington(华盛顿大学) University of Tokyo(东京大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院) XGEN Labs(XGEN实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出'层次x定律'分类法,定义三个能力层级和四个约束领域,综合400余篇文献总结100余系统,分析方法、失败模式和评估实践,提出决策导向的评估原则和可复现评估包,展望从被动预测到重塑环境的代理世界建模路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16721 2026-06-16 cs.AI 新提交 79%

Medical world models: representing medical states, modelling clinical dynamics and guiding intervention policies

医疗世界模型:表示医疗状态、建模临床动态与指导干预策略

Ke Liu, Mengxuan Li, Yanyi Bao, Tianyun Zhang, Chong Chu, Jiajun Bu, Haishuai Wang

机构 * College of Computer Science, Zhejiang University(浙江大学计算机科学与技术学院) School of Medicine, Zhejiang University(浙江大学医学院) Department of Biomedical Informatics, Harvard University(哈佛大学生物医学信息学系)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出医疗世界模型框架,通过构建患者状态、建模临床动态和支持干预决策,推动医疗AI从静态诊断向动态模拟演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16519 2026-06-16 cs.CV 新提交 79%

BadWorld: Adversarial Attacks on World Models

BadWorld:对世界模型的对抗攻击

Linghui Shen, Mingyue Cui, Xingyi Yang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出BadWorld框架,通过自监督速度攻击和轨迹自适应双层优化,对自回归视觉世界模型进行无标签对抗攻击,暴露其结构脆弱性。

Comments Project Page: https://linghuiishen.github.io/BadWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16489 2026-06-16 cs.LG 新提交 79%

BRICKS-WM: Building Reusability via Interface Composition Kinetics for Structured World Models

BRICKS-WM:通过接口组合动力学构建结构化世界模型的可重用性

Shaowei Zhang, Jiahan Cao, Xunlan Zhou, Shenghua Wan, De-Chuan Zhan

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) School of Intelligence Science and Technology, Nanjing University, China(南京大学智能科学与技术学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出BRICKS-WM框架,将全局动力学分解为通过潜在接口交互的独立模块(如智能体和背景),实现冻结背景模块跨智能体重用,避免从头训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16274 2026-06-16 cs.CV 新提交 79%

GraphWorld: Long-Horizon Planning with World Models for End-to-End Autonomous Driving

GraphWorld: 基于世界模型的长时域规划实现端到端自动驾驶

Ziying Song, Caiyan Jia, Lin Liu, Lei Yang, Shengkai Zhang, Feiyang Jia, Fengda Zhao, Peiliang Wu, Shaoqing Xu, Chen Lv, Yadan Luo

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院,交通数据挖掘与具身智能北京市重点实验室) School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) University of Macau(澳门大学) The University of Queensland(昆士兰大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出GraphWorld框架,通过潜在世界建模增强长时域规划,利用自车中心交互图建模邻车关系,并基于世界状态条件规划实现安全轨迹生成,显著降低碰撞率。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15861 2026-06-16 cs.CV 新提交 79%

Object Tokens as a Bridge Between Segmentation and Visual Question Answering in Robotic Surgery

对象标记作为机器人手术中分割与视觉问答的桥梁

Yiping Li, Ronald de Jong, Romy van Jaarsveld, Franco Badaloni, Gino Kuiper, Jelle Ruurda, Josien Pluim, Marcel Breeuwer

机构 * Department of Biomedical Engineering, Eindhoven University of Technology(埃因霍温理工大学生物医学工程系) Department of Electrical Engineering, Eindhoven University of Technology(埃因霍温理工大学电气工程系) Department of Surgery, University Medical Center Utrecht(乌得勒支大学医学中心外科)

专题命中 具身推理 :robotic(title,abstract);分类 cs.CV

AI总结 提出统一框架,联合像素级分割与视觉问答,通过VLM生成对象标记引导答案预测和分割掩码,在RAMIE和EndoVis18数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15341 2026-06-16 cs.CV 新提交 79%

CausalDrive: Real-time Causal World Models for Autonomous Driving

CausalDrive: 用于自动驾驶的实时因果世界模型

Tianyi Yan, Huan Zheng, Dubing Chen, Meizhi Qu, Yingying Shen, Lijun Zhou, Mingfei Tu, Bing Wang, Guang Chen, Hangjun Ye, Haiyang Sun, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院,科技学院) Xiaomi EV(小米汽车) CASIA(中国科学院自动化研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出CausalDrive,一种可控、实时的驾驶世界渲染器,通过因果预测和Context-Forced DMD架构实现交互式模拟,支持闭环评估、强化学习后训练和人在环仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15032 2026-06-16 cs.LG 新提交 79%

How Should World Models Be Evaluated for Embodied Decision-Making? A Decision-Making-Centric Position

世界模型应如何评估?一个以决策为中心的立场

Yang Yu, Shiyuan Zhang, Yifei Sheng, Haoxiang Ren, Haoxin Lin

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Cirquar Technologies

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本文指出世界模型评估中声明与证据不匹配的问题,提出以决策为中心的评估框架,强调反事实推理、策略优化等能力,并定义L0-L7评估阶梯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05963 2026-06-16 cs.LG 版本更新 79%

Next-Latent Prediction Transformers Learn Compact World Models

下一潜在预测变换器学习紧凑世界模型

Jayden Teoh, Manan Tomar, Kwangjun Ahn, Edward S. Hu, Tim Pearce, Pratyusha Sharma, Akshay Krishnamurthy, Riashat Islam, Alex Lamb, John Langford

机构 * Massachusetts Institute of Technology(麻省理工学院) Microsoft Research(微软研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出NextLat方法,通过潜在空间中的自监督预测训练变换器学习紧凑世界模型,提升泛化能力和推理效率。

Comments Microsoft Research Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12979 2026-06-12 cs.LG 新提交 79%

EPM-JEPA: Operator-Side Experience Modulation in JEPA-Family World Models

EPM-JEPA:JEPA系列世界模型中的算子侧经验调制

Vedant Pandya

机构 * School of Artificial Intelligence and Data Engineering (SAIDE), Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校人工智能与数据工程学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出EPM-JEPA,通过LoRA在权重层面调制预测器,以应对测试时动态偏移;实验表明其优于无记忆基线,但效果弱于预期,并揭示了三种独立动力学过程。

Comments 16 pages, 5 figures, 9 tables, 5 code listings. Pre-registered experimental study with mechanism analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12780 2026-06-12 cs.LG cs.CL 新提交 79%

ProPlay: Procedural World Models for Self-Evolving LLM Agents

ProPlay: 用于自我进化LLM智能体的程序化世界模型

Yijun Ma, Zehong Wang, Yiyang Li, Ziming Li, Xiaoguang Guo, Weixiang Sun, Chuxu Zhang, Yanfang Ye

机构 * University of Notre Dame(圣母大学) University of Connecticut(康涅狄格大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出ProPlay程序化世界模型,通过程序级预演和因果过程图,使LLM智能体在部分可观测环境中自我进化,无需外部监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02274 2026-06-12 q-bio.QM cs.AI 版本更新 79%

Contextual Invertible World Models: A Neuro-Symbolic Agentic Framework for Colorectal Cancer Drug Response

上下文可逆世界模型:用于结直肠癌药物反应的神经符号智能框架

Christopher Baker, Tianyu Ren, Karen Rafferty, Hui Wang

机构 * School of Electronics, Electrical Engineering and Computer Science(电子工程与计算机科学学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出上下文可逆世界模型(CIWM),结合机器学习模拟器与大语言模型推理层,通过逆推理进行CRISPR扰动,揭示KRAS突变在5-氟尿嘧啶耐药中的主导作用及PIK3CA修复的意外效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11187 2026-06-10 cs.CV 新提交 79%

Next Forcing: Causal World Modeling with Multi-Chunk Prediction

Next Forcing: 基于多块预测的因果世界建模

Gangwei Xu, Qihang Zhang, Jiaming Zhou, Xing Zhu, Yujun Shen, Xin Yang, Yinghao Xu

机构 * Robbyant HUST(华中科技大学) HKUST(香港科技大学) HKUST (GZ)(香港科技大学(广州))

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出Next Forcing框架,通过多块预测训练目标加速视频生成模型收敛、提升精度并实现推理加速,在多个基准上取得最优结果。

Comments Project page: https://gangweix.github.io/next-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10934 2026-06-10 cs.AI 新提交 79%

WorldKernel: A World Model is the Coupling Kernel of Admissible Possible Worlds

WorldKernel:世界模型是可能世界的耦合核

Fabio Rovai

机构 * The Tesseract Academy(泰塞克特学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文发现强预测器在反事实耦合上失效,提出将世界模型建模为可能世界上的半正定耦合核,其非对角元编码反事实信息,并通过半正定性约束和逻辑公理实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10359 2026-06-10 cs.AI 新提交 79%

ReflectiChain: Epistemic Grounding in LLM-Driven World Models for Supply Chain Resilience

ReflectiChain: 面向供应链韧性的LLM驱动世界模型中的认知基础

Jia Luo

机构 * School of Foreign Languages, Huazhong University of Science

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出ReflectiChain框架,通过生成式供应链世界模型和双环学习分离认知不确定性与偶然不确定性,在半导体基准上提升推理一致性33.0%,并在对抗冲击下保持82.3%可操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14614 2026-06-10 cs.CV cs.GR 版本更新 79%

WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling

WorldPlay:面向实时交互式世界建模的长期几何一致性

Wenqiang Sun, Haiyu Zhang, Haoyuan Wang, Junta Wu, Zehan Wang, Zhenwei Wang, Yunhong Wang, Jun Zhang, Tengfei Wang, Chunchao Guo

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出WorldPlay流式视频扩散模型,通过双重动作表示、重构上下文记忆和上下文强制蒸馏方法,实现实时交互式世界建模并保持长期几何一致性,生成24 FPS的720p长视频。

Comments project page: https://3d-models.hunyuan.tencent.com/world/, demo: https://3d.hunyuan.tencent.com/sceneTo3D, code: https://github.com/Tencent-Hunyuan/HY-WorldPlay

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09828 2026-06-09 cs.CV 新提交 79%

Latent Spatial Memory for Video World Models

视频世界模型的潜在空间记忆

Weijie Wang, Haoyu Zhao, Yifan Yang, Feng Chen, Zeyu Zhang, Yefei He, Zicheng Duan, Donny Y. Chen, Yuqing Yang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Adelaide University(阿德莱德大学) Monash University(莫纳什大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出潜在空间记忆框架Mirage,通过在扩散潜在空间中直接构建和查询3D缓存,避免像素空间重建,实现高效视频生成,速度提升10.57倍,内存减少55倍。

Comments Project Page: https://aka.ms/latent-spatial-memory, Code: https://github.com/microsoft/LatentSpatialMemory

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09507 2026-06-09 cs.CV 新提交 79%

Prisma-World: Camera-Controllable Multi-Agent Video World Model

Prisma-World: 相机可控的多智能体视频世界模型

Huiqiang Sun, Zhan Peng, Size Wu, Kun Wang, Kang Liao, Dianyi Wang, Xingyu Zeng, Sheng Jin, Yangguang Li, Zhiguo Cao, Ziwei Liu, Wei Li

机构 * School of AIA, HUST(华中科技大学人工智能与自动化学院) S-Lab, NTU(南洋理工大学S-Lab) SenseTime Research(商汤科技研究院) FDU(复旦大学) SUAT(深圳大学) HKU(香港大学) CUHK(香港中文大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出Prisma-World,通过联合几何感知去噪过程实现多智能体视频生成中的跨视角一致性,支持灵活智能体数量和相机控制。

Comments Project page: https://huiqiang-sun.github.io/prisma-world/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09311 2026-06-09 cs.AI 新提交 79%

FF-JEPA: Long-Horizon Planning in World Models with Latent Planners

FF-JEPA:基于潜在规划器的世界模型中的长时域规划

Sergi Masip, Jonathan Swinnen, Yutong Hu, Renaud Detry, Tinne Tuytelaars

机构 * KU Leuven(鲁汶大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出FF-JEPA层次化方法,通过引入无动作潜在规划器预测子目标,将复杂轨迹分解为短期优化问题,解决长时域规划中计算昂贵和需要目标图像的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07967 2026-06-09 cs.CV 新提交 79%

DisCo: World Models with Discrete Camera Motion Control

DisCo: 具有离散相机运动控制的世界模型

Hongrui Huang, Junke Wang, Quanhao Li, Yu-Gang Jiang, Zuxuan Wu

机构 * Fudan University(复旦大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出DisCo,通过离散动作原语替代连续相机轨迹作为条件,解决可控视频生成中动作表示纠缠问题,提升动作跟随可靠性,并引入DisCoBench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05138 2026-06-09 cs.AI 版本更新 79%

Executable World Models for ARC-AGI-3 in the Era of Coding Agents

可执行世界模型在编码智能体时代的ARC-AGI-3应用

Sergey Rodionov

机构 * SingularityNET

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出一种编码智能体系统,通过维护可执行Python世界模型、验证观察、重构简化抽象和模型内规划,在ARC-AGI-3游戏中取得初步成果,GPT-5.5高推理下完全解决15个游戏。

Comments 13 pages. Accepted for publication at AGI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04627 2026-06-09 cs.AI 版本更新 79%

MIRAGE: Mobile Agents with Implicit Reasoning and Generative World Models

MIRAGE: 具有隐式推理和生成世界模型的移动智能体

Zhichao Yang, Yuanze Hu, Haojie Hao, Longkun Hao, Dongshuo Huang, Hongyu Lin, Gen Li, Lanqing Hong, Yihang Lou, Yan Bai

机构 * Beihang University(北京航空航天大学) Northwestern Polytechnical University(西北工业大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National University of Singapore(新加坡国立大学) Peking University(北京大学)

专题命中 具身推理 :world model(title);navigation(abstract);分类 cs.AI

AI总结 提出MIRAGE框架,通过从显式推理轨迹学习连续潜在表示,使移动智能体能够内部推理并预测未来屏幕状态,在减少生成token的同时提升执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00793 2026-06-09 cs.CV 版本更新 79%

MBench: A Comprehensive Benchmark on Memory Capability for Video World Models

MBench: 视频世界模型记忆能力的综合基准

Shengjun Zhang, Zhang Zhang, Simin Huang, Zhenyu Tang, Hanyang Wang, Chensheng Dai, Min Chen, Yifan Li, Yuxin Li, Yingjie Chen, Hao Liu, Chen Li, Jing Lyu, Yueqi Duan

机构 * Tsinghua University(清华大学) WeChat Vision, Tecent Inc.(微信视觉,腾讯公司) Peking University(北京大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出MBench基准,通过实体一致性、环境一致性和因果一致性三个核心维度及其12个子维度,系统评估视频世界模型的长期记忆能力,并揭示现有方法在长期状态保持上的关键局限。

Comments Project Page: https://peanutup.github.io/MBench-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15466 2026-06-09 cs.CV 版本更新 79%

Entity-Centric World Models: Interaction-Aware Masking for Causal Video Prediction

以实体为中心的世界模型:交互感知的掩码用于因果视频预测

Santosh Kumar Paidi

机构 * Genentech, Inc.(基因泰克公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出IA-JEPA,通过运动中心的自监督掩码策略,优先捕捉物理交互,提升因果推理任务的准确性,并在真实世界动作和物理谜题中验证了其泛化能力。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10376 2026-06-09 cs.CV 版本更新 79%

SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation

SleepWalk:一种三层压力测试基准,用于指导的视觉-语言导航

Niyati Rawal, Sushant Ravva, Shah Alam Abir, Saksham Jain, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * Indian AI Research Organization (IAIRO)(印度人工智能研究组织) ĸragya Lab, BITS Pilani Goa(BITS Pilani Goa 的 ĸragya 实验室) University of Dhaka(达卡大学) Delhi Technological University(德里技术大学) Apple(苹果公司) Meta

专题命中 具身推理 :navigation(title,abstract);分类 cs.CV

AI总结 本文提出SleepWalk基准,用于评估基于指令的轨迹预测,针对局部化、交互导向的具身推理,揭示当前VLM在空间推理中的系统性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06492 2026-06-09 cs.RO 版本更新 79%

How Well Do Latent World Models Understand Partially Observable Safety Constraints?

潜在世界模型如何理解部分可观测的安全约束?

Matthew Kim, Kensuke Nakamura, Andrea Bajcsy

机构 * UC San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 研究潜在世界模型在部分可观测安全约束下的故障模式,提出互信息度量和滚动预测度量来诊断估计间隙和预测间隙,并通过多模态监督和共形风险校准缓解问题,提高机器人操作安全性。

Comments 10 tables 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏