arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-16 至 2026-03-16 共收录 4 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 4 篇

2603.13024 2026-03-16 cs.CV cs.AI cs.LG eess.IV 82%

SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation

SAW:通过可控且可扩展的视频生成实现手术动作世界模型

Sampath Rapuri, Lalithkumar Seenivasan, Dominik Schneider, Roger Soberanis-Mukul, Yufan He, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Pengfei Guo, Daguang Xu, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) NVIDIA

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 SAW通过四个轻量信号条件的视频扩散模型生成真实手术动作视频,解决手术AI和模拟中的数据稀缺、稀有事件合成及仿真到现实的差距问题,实现高时间一致性和视觉质量。

Comments The manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13215 2026-03-16 cs.CV 79%

Out of Sight, Out of Mind? Evaluating State Evolution in Video World Models

看得不见就忘记了吗?评估视频世界模型中的状态演变

Ziqi Ma, Mengzhan Liufu, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文设计STEVO-Bench基准测试,评估视频世界模型能否脱离观察独立演进,揭示其在自然状态演变中的局限性。

Comments https://glab-caltech.github.io/STEVOBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12655 2026-03-16 cs.CV 79%

VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model

VGGT-World:将VGGT转变为一个自回归的几何世界模型

Xiangyu Sun, Shijie Wang, Fengyi Zhang, Lin Liu, Caiyan Jia, Ziying Song, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Beijing Jiaotong University(北京交通大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出VGGT-World,通过自回归方法预测冻结几何基础模型特征的时空演变,提升深度预测性能并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09346 2026-03-16 cs.RO 57%

How Safe Will I Be Given What I Saw? Calibrated Prediction of Safety Chances for Image-Controlled Autonomy

给我所见的安全性如何?面向图像控制自主系统的校准安全性预测

Zhenjiang Mao, Mrinall Eashaan Umasudhan, Ivan Ruchkin

机构 * Trustworthy Engineered Autonomy (TEA) Lab(可信工程自主性实验室)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 本文提出一种校准的安全性预测框架,用于端到端视觉控制系统,解决部分可观测性和分布偏移下的安全性预测问题,通过无监督域适应和世界模型提升预测鲁棒性。

Comments arXiv admin note: text overlap with arXiv:2308.12252

详情

展开后加载摘要…

URL PDF HTML 收藏