arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-11 至 2026-08-11 共收录 24 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 24 篇

2608.09298 2026-08-11 cs.RO cs.AI 新提交 88%

WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation

WorldSimProbe:面向具身操控的动作条件世界模型的模拟器保真度诊断

Peterson Co, Sicheng Hu, Chunxuan Jiao, Hongyang Cheng, Yulin Luo, Yijie Xu, Sixiang Chen, Zhongxia Zhao, Zihao Wang, DaFeng Chi, Peidong Liu, YuTong Chen, Henghua Liu, Zhihao Yuan, Huizhu Jia, Yuzheng Zhuang, Tianle Zhang, Liang Lin, Huajie Tan, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) EvoPhys AI(EvoPhys人工智能公司) Joy Future Academy, JD(京东探索研究院) The University of Sydney(悉尼大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 具身推理 :world model(title,abstract);manipulation(title);embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 该研究提出WorldSimProbe框架,通过五套受控测试评估动作条件世界模型的模拟器保真度,发现其存在动作实现退化等问题,为具身操控模型提供标准化诊断方法。

Comments 20 pages, 18 figures, and 10 tables, including supplementary material. Code and data: https://evophys.com/WorldSimProbe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09876 2026-08-11 cs.RO cs.AI 新提交 88%

Energy-Structured Latent World Models with Neural Time Fields for Physically Constistent Open-World Motion Planning

用于物理一致性开放世界运动规划的能量结构化潜在世界模型与神经时间场

Yapeng Liu, Yuanzhao Zhai, Bo Ding, Huaimin Wang, Lin Wang

专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 针对开放世界运动规划的物理一致性挑战,提出能量结构化潜在世界模型ELWM,结合物理条件神经时间场PC-NTF,显著提升了运动预测精度与导航成功率,降低了碰撞率与残差。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08600 2026-08-11 cs.CV cs.AI cs.LG 新提交 82%

Population-Scalable Multi-Agent World Modeling

支持种群规模扩展的多智能体世界建模

Renjie Zhao, Yuxiang Wu, Mingyu Zhang, Jiaxin Li, Sisi Li, Yimin Sheng, Tianxi Tan, Zhenkai Zhang, Jianyi Zhu, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 针对多智能体世界模型的种群可扩展性问题,提出无需重训练即可扩展至任意智能体数量的Khora模型,通过解耦世界状态演化与渲染实现跨视图一致性,验证了泛化性并构建了实时交互系统。

Comments Technical report. Project page: https://rhos.ai/research/khora. Online demo: https://ophilus.ai/khora

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08553 2026-08-11 cs.CV cs.LG cs.MM 新提交 81%

MotionCraft: Latent World Modeling with Sparse Attention for Visual Upscaling

MotionCraft:用于视频超分辨率的基于稀疏注意力的潜在世界建模

Rong Fu, Chunlei Meng, Yangchen Zeng, Xiaowen Ma, Yongtai Liu, Wangyu Wu, Shuo Yin, Zijian Zhang, Sicheng Li, Yingrui Ji, Chenhao Wang, Simon Fong

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 MotionCraft是一种可控视频超分辨率框架,通过结合鲁棒运动融合、潜在世界Transformer与自适应稀疏注意力,实现了时间一致的高质量视频重建,且能灵活权衡时间平滑性与重建保真度。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15142 2026-08-11 cs.AI cs.LG 版本更新 81%

Concept-Guided Spatial Regularization for World Models in Atari Pong

《雅达利乒乓球游戏中用于世界模型的概念引导空间正则化》

Yukuan Lu, Zaishuo Xia, Weyl Lu, Yubei Chen

机构 * UC Davis(加州大学戴维斯分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究雅达利乒乓球游戏中五个视觉世界模型智能体,发现其存在诸多问题。提出概念引导空间正则化(CGSReg),实验表明该方法在部分模型中改善了闭环展开和像素空间零样本MBRL,但不能解决所有世界模型瓶颈。

Comments Revised manuscript with updated presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09926 2026-08-11 cs.CV 新提交 79%

Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning

学习世界如何演化:基于潜动态推理的外推视频世界模型

Haodong Li, Shaoteng Liu, Tianyu Wang, Chongjian Ge, Sihui Ji, Jiahan Zhang, Xin Lin, Haolin Lu, Zhe Lin, Manmohan Chandraker

机构 * UCSD(加利福尼亚大学圣迭戈分校) Adobe(奥多比公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 针对主流视频扩散模型未建模像素时间转换的问题,提出LDR方法,在PhyWorld基准上实现更优动态外推,参数更少、速度更快,是首个能泛化至训练分布外的视频世界模型

Comments Project page: https://lat-dyn-reason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09537 2026-08-11 cs.AI 新提交 79%

verdi: retrieval is not transfer for continual world model optimization

VERDI:检索并非持续世界模型优化的迁移

Junyu Wu, Shiqin Nie, Youyi Kou, Baohua Yin, Guocai Yao, Qingyu Chen, Jingheng Ma, Shiji Zhou, Hongyong Song, Mingchen Zhuge, Sen Cui, Changshui Zhang

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文针对基础世界模型优化中策略难迁移的问题,提出VERDI框架,通过构建优化指纹、检索假设并经目标侧验证来实现持续优化,可降低搜索与GPU成本,减少负迁移并提升迁移结果预测准确率。

Comments 28pages, 13figures,conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08982 2026-08-11 cs.LG 新提交 79%

Twin Rollouts: Noise-Coupled Counterfactual Branching in Interactive Video World Models

双回滚:交互式视频世界模型中的噪声耦合反事实分支

Yu Ma, Hongli Shi, Xinran Xu

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本研究提出噪声耦合双回滚框架,解决交互式视频世界模型的反事实生成问题,规避近似逆问题,定义时空局部性度量,待开展实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08689 2026-08-11 cs.AI 新提交 79%

A Structural Dynamics Graph World Model: Unified Modeling, Constrained Rollout, and Interpretable Calibration

结构动力学图世界模型:统一建模、约束展开与可解释校准

Wei Wang, Yaosen Chen, Han Yang, Yuegen Liu, Mingli Luo, Xinxin Jiao, Xuming Wen, Ming Liu

机构 * Sobey(Sobey公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出SD-GWM结构动力学图世界模型,实现异构集成、语义保真与可审计治理,在极端洪水预测中较基线模型有8-28倍精度提升,为可审计的时空挖掘提供约束安全的可验证底物。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07981 2026-08-11 cs.CV 新提交 79%

Distilling Physical Priors into Streaming World Models

将物理先验知识蒸馏为流式世界模型

Liangliang Zhao, Junying Wang, Danni Yang, Yifan Chang, Bin Fu, Yu Qiao, Bowen Zhou, Yihao Liu

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出PhyS三阶段框架,构建120K物理交互数据集,经微调、蒸馏及在线强化学习结合TCR方法,提升流式世界模型的物理一致性,在PhysicsIQ等基准上取得显著性能提升。

Comments 9 pages, 7 figures. Project page: https://lyongo.github.io/PhyS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07809 2026-08-11 cs.AI 新提交 79%

CausalNav: Reliability-Certified Causal World Models for Control under Physical-Parameter Shift

CausalNav:用于物理参数偏移下控制的可靠性可验证因果世界模型

Yiyao Zhang, Diksha Goel, Hussain Ahmad, Shixun Huang, Jun Shen

机构 * University of Wollongong(卧龙岗大学) CSIRO’s Data61(联邦科学与工业研究组织Data61) Adelaide University(阿德莱德大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出CausalNav控制器,其结合因果转移图与多门控可靠性验证机制,在物理参数偏移的CartPole-v1和Pendulum-v1任务上,较9种基准取得最佳平均排名,关键在于经认证的弃权(不执行)提升了部署安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06257 2026-08-11 cs.CV cs.HC 版本更新 79%

MASS: Multiplayer World Models with Authoritative Shared State

MASS:具有权威共享状态的多人世界模型

Ziqi Cai, Siqi Yang, Yimu Wang, Zixian Gao, Yunheng Liu, Shuchen Weng, Erwin Wu, Kaipeng Zhang, Boxin Shi

机构 * Alaya Lab(Alaya实验室) Peking University(北京大学) Institute of Science Tokyo(东京科学大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 该研究提出MASS模型,通过将世界动态与视图渲染解耦,解决现有视频世界模型在多人环境中的缺陷,在多人Snake基准测试中实现更优状态精度,为多智能体世界模拟提供实用基础。

Comments Project Page: https://alaya-lab.github.io/MASS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00591 2026-08-11 cs.AI 版本更新 79%

Why Does the Future Branch? Identifiable Closure Tests for Stochastic Physical World Models

未来为何分支?随机物理世界模型的可识别闭合测试

Yibin Dong

机构 * Shandong University(山东大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 针对随机物理世界模型无法从普通转移数据识别未来分支原因的问题,提出ClosurePairs干预评估协议,可精准分解状态混淆与过程噪声,大幅提升归因准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14574 2026-08-11 cs.CL cs.AI 版本更新 79%

SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model

SIMMER: 基于世界模型评估LLM可执行规划中的潜在故障

Xiaoxin Lu, Ranran Haoran Zhang, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出SIMMER基准,通过人工策划的厨房领域符号世界模型,评估LLM规划中的潜在故障;实验发现前沿模型最多17%无错误计划,56%含潜在故障,多数不可逆;反事实预演可减少72%潜在故障和75%不可逆案例。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07195 2026-08-11 cs.CL cs.AI cs.CY cs.MA cs.SI 版本更新 79%

Multilingual Agent-Based World Modeling for Social Science

MASim:面向社会科学的多语言代理模拟

Xuan Zhang, Wenxuan Zhang, Anxu Wang, See-Kiong Ng, Yang Deng

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 MASim是一种多语言代理模拟框架,用于研究社会行为,通过多语言代理模拟公众意见和媒体影响,展现多语言模拟在社会科学中的重要性。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19990 2026-08-11 cs.AI 版本更新 77%

LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?

LEGO-Puzzles:多模态大语言模型(MLLMs)在多步骤空间推理上的表现如何?

Kexian Tang, Junyao Gao, Yanhong Zeng, Haodong Duan, Yanan Sun, Zhening Xing, Wenran Liu, Kai Chen, Kaifeng Lyu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) Tsinghua University(清华大学)

专题命中 具身推理 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.AI

AI总结 该研究推出多步骤空间推理基准LEGO-Puzzles,评估29个顶尖MLLMs,发现其在基础空间推理、多步骤规划任务上远逊于人类,凸显其空间推理能力存在关键局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07712 2026-08-11 cs.CV cs.AI 新提交 76%

SpikeWorld: Fast-State Adaptation for Frozen Spiking World Models

SpikeWorld:用于冻结脉冲世界模型的快速状态适应

Ziqiao Yu

机构 * DiDi International Business Group(滴滴国际业务集团)

专题命中 具身推理 :world model(title);分类 cs.AI、cs.CV

AI总结 SpikeWorld是145万参数的稀疏脉冲模型,冻结训练参数后通过外部路径实现快速状态适应,提升多模态预测等性能,在Meta-World任务中提高冻结策略奖励与成功率。

Comments 14 pages, 2 figures, 4 tables. Code: https://github.com/Oooorca/SpikeWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25532 2026-08-11 gr-qc 版本更新 71%

A New Self-Dual Gravitational Instanton Solution on a Local Conformal Kählerian Manifold in a Brane World Model

一种在膜世界模型中局部共形凯勒流形上的新自对偶引力瞬子解

Reinoud Jan Slagter

专题命中 具身推理 :world model(title)

AI总结 本文在共形膨胀子引力中找到了一种真空类克尔扭曲时空上的精确引力瞬子解,该解由一阶偏微分方程导出,与自对偶性相关,其奇点由五次多项式决定,拓扑为S^3×R/Z_2,并利用克莱因瓶上的对径边界条件描述了霍金粒子蒸发过程,最后揭示了与Janis-Newman-Winicour模型之间的联系。

Comments Draft version V3 : pictures improved --- spelling improved --- comments welcome---70 pages---70 pictures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09266 2026-08-11 cs.CV cs.LG 新提交 66%

Did the Grid Erase the Event? EndoClock for Auditing Medical World-Model Pipelines

网格是否抹去了事件?用于审计医疗世界模型流程的EndoClock

Yarin Udi, Tom Sharon-Shahak, Roee Masad, Dan Pri-Tal

机构 * Diastole Medical R&D(Diastole医疗研发机构)

专题命中 具身推理 :world model(abstract,comments);分类 cs.CV、cs.LG

AI总结 本研究针对医疗世界模型同步预处理可能抹去任务相关证据的问题,提出EndoClock审计方法及四分类法,以超声心动图为例验证其有效性,为医疗AI流程审计提供可执行方案。

Comments Accepted for publication at the 1st MICCAI Workshop on Medical World Models (MWM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07693 2026-08-11 cs.CV cs.AI cs.CL 新提交 62%

CosmosAlign: Adapting a World Foundation Model for Generative Traffic Video Forecasting

CosmosAlign:适配世界基础模型用于生成式交通视频预测

Quang Minh Dinh, Tuan Kiet Doan

机构 * Simon Fraser University(西蒙菲莎大学) Institut Polytechnique de Paris(巴黎综合理工学院)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 该研究提出基于Cosmos3-Nano的CosmosAlign框架,通过两阶段LoRA适配与推理优化,在AI City Challenge 2026 Track 5基准中获76.49分排名第一,实现了高质量交通视频预测。

Comments Accepted at ECCVW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08476 2026-08-11 cs.CV 新提交 57%

RayLift: Lifting Complementary Ray-Wise Evidence with 3D Geometry Priors for Semantic Scene Completion

RayLift:利用3D几何先验提升互补射线级证据以实现语义场景补全

Meng Wang, Hongxia Yu, Wenzhe He, Xingdong Song, Huilong Pi, Jiapeng Zhang, Ruihui Li

专题命中 具身推理 :robotics(abstract);分类 cs.CV

AI总结 针对现有语义场景补全方法的深度误差传播问题,提出RayLift框架,通过互补上下文编码器、深度射线证据提升模块和语义感知体素集成器,在两个基准数据集上实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29393 2026-08-11 cs.RO 版本更新 57%

AquaJEPA: An Action-Conditioned Multimodal JEPA Family for Underwater Robot Dynamics

AquaJEPA:面向水下机器人动力学的动作条件多模态预测表示

Alan-Barsag Gazzaev, Alexey Gavrilov, Sergey Muravyov

机构 * ITMO University(ITMO大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 该研究提出动作条件多模态预测模型AquaJEPA,在Stonefish环境中对比多种基线,经120个带计划DVL损失的配对环境实验,其闭环性能最优,配对最终误差显著优于多数基线。

Comments Submitted to IEEE ICRA 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21109 2026-08-11 cs.RO 版本更新 57%

Anomaly-Informed Confidence Calibration for Vision-Based Safety Prediction

基于异常的置信度校准用于基于视觉的安全预测

Zhenjiang Mao, Jiawen Wu, Gabriel Wagner, Zhongzheng Zhang, Ivan Ruchkin

机构 * Trustworthy Engineered Autonomy (TEA) Lab, Department of Electrical and Computer Engineering, University of Florida(可信工程自主性实验室,电气与计算机工程系,佛罗里达大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 本文提出了一种基于异常的在线校准方法,通过融合感知和动态异常分数来改进基于视觉的安全预测中的置信度估计,从而在面对分布偏移时减少过自信,提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14382 2026-08-11 cs.CV cs.GR cs.MM 版本更新 57%

Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation

Delta Forcing:交互式自回归视频生成中的信任区域引导

Yuheng Wu, Xiangbo Gao, Tianhao Chen, Xinghao Chen, Qing Yin, Zhengzhong Tu, Dongman Lee

机构 * Texas A\&M University(德克萨斯A&M大学) University of Washington(华盛顿大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出Delta Forcing方法,通过约束不可靠的教师监督在适应性信任区域中,以提高自回归视频生成的一致性并保持对新事件的响应性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏