arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-30 至 2026-06-30 共收录 18 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 18 篇

2606.28804 2026-06-30 cs.CV cs.RO 87%

ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models

ViPSim: 协同视觉与参数空间实现一致的长时程具身世界模型

Longyu Chen, Heng Li, Wei Yang, Manqi Zhao, Dongsheng Jiang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出ViPSim框架,通过协同视觉空间(显式空间先验)和参数空间(数值驱动)解决长时程视频生成中的轨迹漂移和不一致问题,实现高保真具身世界模型。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28758 2026-06-30 cs.CV cs.AI 84%

X-Mind: Efficient Visual Chain-of-Thought via Predictive World Model for End-to-End Driving

X-Mind: 通过预测世界模型实现高效视觉思维链的端到端驾驶

Bohao Zhao, Chengrui Wei, Guangfeng Jiang, Ruixin Liu, Xuejie Lv, Liu Liang, Sutao Deng, Xiuyang Fan, Pengkun Zheng, Jinyun Zhou, Rui Guo, Hanpeng Liu, Yutong Zheng, Yi Guo, Xinlong Zheng, Qingyu Luo, Zhuangzhuang Ding, Yu Zhang, Hang Zhang, Xianming Liu

机构 * XPeng Inc.(小鹏汽车)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 提出X-Mind框架,将预测世界模型内化为视觉思维链,通过紧凑的草图表示和循环块扩散方案,实现高效、低延迟的端到端驾驶策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10044 2026-06-30 cs.AI 新提交 83%

Business World Model

商业世界模型

Cecil Pang, Hiroki Sayama

机构 * AI Engineering, USA TODAY Co., Inc.(AI工程,USA TODAY公司) School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(系统科学与工业工程学院,宾夕法尼亚州立大学宾夕法尼亚州立大学) Binghamton Center of Complex Systems, Binghamton University, State University of New York(宾夕法尼亚州立大学复杂系统中心) Waseda Innovation Lab, Waseda University, Tokyo, Japan(早稻田大学创新实验室)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.AI

AI总结 提出商业世界模型(BWM)架构,将世界模型思想应用于商业环境,通过编码状态、动态、约束和目标,支持自主决策与规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30292 2026-06-30 cs.LG cs.CV 81%

DreamForge-World 0.1 Preview: A Low-Compute Real-Time Controllable World Model

DreamForge-World 0.1 Preview:一种低计算量实时可控世界模型

Daniyel Ayupov, Artur Markov-Tsoy

机构 * DreamForge AI Lab(DreamForge AI实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 提出DreamForge-World 0.1 Preview,一种基于自回归视频堆栈和残差动作路径的低计算量实时交互世界模型,支持消费级GPU运行和多种交互功能。

Comments Project page: https://trydreamforge.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28712 2026-06-30 cs.RO cs.LG 81%

J-LAW: Joint Localization and Actionable World Modeling via Coupled Latent Factor Graphs

J-LAW:通过耦合潜在因子图实现联合定位与可操作世界建模

Guanqun Cao, Liang Chen

机构 * Geely Technology Europe(吉利技术欧洲公司) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘与遥感国家重点实验室(LIESMARS)) Wuhan University(武汉大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG

AI总结 提出J-LAW,通过耦合因子图联合优化度量物体位姿、潜在世界状态和潜在地标嵌入,实现定位与可操作世界建模的协同提升,实验证明能显著降低潜在预测误差和端点漂移。

Comments 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30639 2026-06-30 cs.AI cs.CL 79%

Self-Evolving World Models for LLM Agent Planning

面向LLM智能体规划的自我进化世界模型

Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, Yang Deng

机构 * National University of Singapore(国立新加坡大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出WorldEvolver框架,通过情景记忆、语义记忆和选择性预见三个模块在测试时修正世界模型,提升预测准确性和下游规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30421 2026-06-30 cs.CV 79%

OWMDrive: Causality-Aware End-to-End Autonomous Driving via 4D Occupancy World Model

OWMDrive: 基于4D占用世界模型的因果感知端到端自动驾驶

Junjie Cheng, Ruiqi Song, Ye Wu, Nanxing Zeng, Ximiao Li, Yunfeng Ai

机构 * The School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Waytous Inc.(Waytous公司) The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) The College of Surveying and Geo-Informatics, Tongji University(同济大学测绘与地理信息学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出OWMDrive框架,利用4D占用世界模型预测多步3D占用,作为条件先验引导扩散规划器生成强化轨迹,显式建模时空因果依赖,提升复杂场景下的规划鲁棒性和安全性。

Comments International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29850 2026-06-30 cs.CV 79%

Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction

面向具身AI的高效视觉指代:智能体驱动数据合成、跨块注意力与迭代校正

Zijian Hong, Qi Lv, Yuxiang Xie, Jianming Xing, Xiang Deng, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 具身推理 :embodied AI(title,abstract);分类 cs.CV

AI总结 提出PointArena 2026解决方案,通过智能体驱动数据合成、确定性可操控数据流水线、跨块注意力与迭代校正模块,实现77.2%总体准确率,排名第二。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29799 2026-06-30 cs.AI 79%

The CRISTAL Method: Neurosymbolic analysis from AI-synthesized world models

CRISTAL方法:来自AI合成世界模型的神经符号分析

Rafael Kaufmann, Felix Neubürger, Michael Walters, Thomas Kopinski, Dimitrije Marković

机构 * GAIA Lab(GAIA实验室) South Westphalia University of Applied Sciences(西南弗里西亚应用科学大学) Technical University Dresden(德累斯顿技术大学) Primordia Co.(Primordia公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出CRISTAL神经符号框架,通过贝叶斯推理、主动学习和持续学习自动化复杂分析,在合成股票分类任务中仅用5个样本和5秒达到贝叶斯最优精度,远超LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29465 2026-06-30 cs.LG 79%

Prototype Latent World Model Replay for Class-Incremental Learning

原型潜在世界模型回放用于类增量学习

Weizhi Nie, Hui Wang, Weijie Wang, Yuting Su

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出无记忆框架,通过冻结的ImageNet预训练编码器将旧类存储为潜在状态分布,在新类到来时采样回放,结合轻量适配器和对比学习,显著提升类增量学习性能。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28751 2026-06-30 cs.LG cond-mat.stat-mech 79%

A Path-Space Formulation of Prediction in World Models: From a Single Action to Prediction, Planning, and Irreversibility

世界模型中预测的路径空间表述:从单一动作到预测、规划和不可逆性

Gunn Kim

机构 * Department of Physics, Sejong University, Seoul 05006, Republic of Korea(首尔大学物理系,首尔05006,韩国)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出世界模型中预测的路径空间表述,将预测、规划和不确定性统一为作用泛函上的操作,并发现注意力不对称性编码了数据的不可逆性。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22960 2026-06-30 cs.CV 79%

UCM: Unified Modeling of Camera Control and Memory with Time-aware Positional Encoding Warping for World Models

UCM:基于时间感知位置编码变形的相机控制与内存统一建模

Tianxing Xu, Zixuan Wang, Guangyuan Wang, Li Hu, Zhongyi Zhang, Peng Zhang, Bang Zhang, Songhai Zhang

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 UCM通过时间感知位置编码变形机制实现相机控制与长期记忆的统一建模,在真实和合成基准测试中显著提升场景一致性并实现高保真视频生成的精确控制。

Comments Project Page: https://humanaigc.github.io/ucm-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30568 2026-06-30 cs.IT math.IT 78%

Towards World Model-Empowered Integrated Sensing, Communication, and Decision for Complex Unmanned Systems

迈向世界模型赋能的复杂无人系统集成感知、通信与决策

Xue Han, Yongpeng Wu, Meng Shen, Wenjun Xu, Biqian Feng, Zijin Wang, Xiaohu You, Shengli Sun, Wenjun Zhang

专题命中 具身推理 :world model(title,abstract)

AI总结 针对复杂无人系统,提出一种世界模型赋能的感知-通信-决策集成框架,通过时敏AoI驱动感知、预测世界模型和多粒度知识图谱,实现联合优化。

Comments Accepted by IEEE Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02459 2026-06-30 cs.CV 70%

ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing

ReSpace:基于文本的自回归3D室内场景合成与编辑

Martin JJ. Bucher, Iro Armeni

机构 * Stanford University(斯坦福大学)

专题命中 具身推理 :manipulation(abstract);world model(abstract);分类 cs.CV

AI总结 ReSpace通过自回归方法实现文本驱动的3D室内场景合成与编辑,具备明确房间边界和资产无关部署能力,支持通过自然语言添加、移除和交换物体,实验在物体添加和完整场景合成质量上超越现有方法。

Comments 23 pages, 17 figures, 11 tables (incl. appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02491 2026-06-30 cs.LG cs.AI cs.RO q-bio.NC stat.ML 67%

What Capable Agents Must Know: Selection Theorems for Robust Decision-Making under Uncertainty

什么是有能力的智能体必须知道:在不确定性下鲁棒决策制定的选取定理

Aran Nayebi

机构 * Machine Learning Department and Neuroscience & Robotics Institutes, Carnegie Mellon University(机器学习系和神经科学与机器人研究院,卡内基梅隆大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文探讨了在不确定性下智能体必需的内部结构,证明了强任务表现迫使世界模型、信念记忆及持久变量的必要性,提出了选取定理以解决部分可观测性和任务分布下的决策问题。

Comments 23 pages, 1 figure. To appear in Uncertainty in Artificial Intelligence (UAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30638 2026-06-30 cs.CV 57%

Open-Vocabulary and Referring Segmentation for 3D Gaussians Using 2D Detectors

开放词汇与指代分割:利用2D检测器实现3D高斯

Jameel Hassan, Yasiru Ranasinghe, Vishal Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 具身推理 :embodied AI(abstract);分类 cs.CV

AI总结 提出GaussDet方法,利用离散的2D开放词汇检测器与指代表达能力,通过视图聚合语义标签分布实现3D场景的开放词汇分割和指代分割,在零样本设置下显著提升指代分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19119 2026-06-30 cs.CV 57%

MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images

MonoSR: 从单目图像进行开放词汇空间推理

Qirui Wang, Jingyi He, Yining Pan, Si Yong Yeo, Xulei Yang, Shijie Li

机构 * Technical University of Munich(慕尼黑工业大学) A*STAR Institute of Advanced Intelligence and Computing(新加坡科技研究局高级智能与计算研究所) Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出MonoSR大规模单目空间推理数据集,涵盖多种场景并支持多种问题类型,评估先进视觉-语言模型并分析辅助信息对单目空间推理的重要性,为开放世界中的单目空间推理提供基础。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06597 2026-06-30 cs.CR 50%

No TPU Left Behind: Retrofitting Side-Channel Protection into Edge TPUs

TPU 无所不在:将侧信道保护融入边缘TPU

Ashley Kurian, Anuj Dubey, Modini Ayyagari, Aydin Aysu

专题命中 具身推理 :world model(abstract)

AI总结 本文提出一种训练时防护方法,在不修改硬件或固件的情况下,通过在边缘TPU上训练多个功能等价的参数版本并随机组合,降低侧信道攻击依赖的相关性,同时保持模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏