arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-01 至 2026-06-01 共收录 13 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 13 篇

2605.30542 2026-06-01 cs.AI 88%

Physically Viable World Models: A Case for Query-Conditioned Embodied AI

物理可行的世界模型:面向查询条件具身AI的案例

Adam J. Thorpe, Stepan Tretiakov, Cheng-Hsi Hsiao, Su Ann Low, Xingjian Li, Hassan Iqbal, Neel P. Bhatt, Ufuk Topcu, Krishna Kumar

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 具身推理 :embodied AI(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 针对具身AI中现有世界模型预测未来观测但物理不可行的问题,提出应构建基于查询条件、识别最简物理抽象的世界模型,通过模块化分解确保可解释性和可验证性。

Comments 21 pages; Adam J. Thorpe and Stepan Tretiakov contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11367 2026-06-01 cs.CV 85%

3D-Belief: Embodied Belief Inference via Generative 3D World Modeling

3D-Belief:通过生成式3D世界建模实现具身信念推断

Yifan Yin, Zehao Wen, Suyu Ye, Jieneng Chen, Zehan Zheng, Nanru Dai, Haojun Shi, Aydan Huang, Zheyuan Zhang, Alan Yuille, Jianwen Xie, Ayush Tewari, Tianmin Shu

机构 * Johns Hopkins University(约翰霍普金斯大学) Lambda University of Cambridge(剑桥大学)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);navigation(abstract);分类 cs.CV

AI总结 提出3D-Belief,一种生成式3D世界模型,通过在线更新显式3D信念,使具身智能体能够在部分可观测环境中想象场景补全并推理,在2D/3D想象质量和下游物体导航任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01985 2026-06-01 cs.LG cs.AI cs.RO 82%

World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry

World Action Verifier: 通过前向-反向不对称性自我改进世界模型

Yuejiang Liu, Fan Feng, Lingjing Kong, Weifeng Lu, Jinzhou Tang, Kun Zhang, Kevin Murphy, Chelsea Finn, Yilun Du

机构 * Stanford University(斯坦福大学) UC San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出World Action Verifier (WAV)框架,利用状态合理性和动作可达性的独立验证以及前向-反向不对称性,通过视频语料库的多样子目标生成器和稀疏逆模型实现循环一致性,从而在欠探索区域自我改进世界模型,在多个任务中样本效率提升2倍且下游策略性能提升22%以上。

Comments Project Website: https://world-action-verifier.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01075 2026-06-01 cs.LG cs.AI cs.CV 82%

Flow Equivariant World Models: Memory for Partially Observed Dynamic Environments

流等变世界模型:部分观测动态环境的记忆

Hansen Jin Lillemark, Benhao Huang, Fangneng Zhan, Yilun Du, Thomas Anderson Keller

机构 * Kempner Institute, Harvard University(哈佛大学 Kempner 研究所) ML, Carnegie Mellon University(卡内基梅隆大学 ML 研究所) SEAS, Harvard University(哈佛大学 SEAS 研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出流等变世界建模框架,利用时间参数化对称性在潜在记忆中实现长时程稳定准确的动力学预测,解决部分观测问题。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31361 2026-06-01 cs.MA cs.AI cs.LG 82%

Dreaming Of Others: Latent Teammate Modeling In World Models For Multi-Agent Reinforcement Learning

梦见他人:多智能体强化学习中世界模型内的潜在队友建模

Tomas Leroy-Stone

机构 * Tomas Leroy-Stone

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种将队友建模为世界模型中可学习组件的方法,通过分解潜在状态并引入心智理论头来推断队友行为,实现零样本和少样本协调。

Comments 5 pages, 2 figures. Accepted as a poster at the 2026 World Modeling Workshop. Conceptual workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18803 2026-06-01 cs.LG cs.AI 81%

PROWL: Prioritized Regret-Driven Optimization for World Model Learning

PROWL: 基于优先遗憾驱动的世界模型学习优化

Ahmet H. Güzel, Jenny Seidenschwarz, Benjamin Graham, Jonathan Sadeghi, Jeffrey Hawke, Ilija Bogunovic

机构 * University College London AI Centre(伦敦大学学院人工智能中心) Odyssey University of Basel(巴塞尔大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种KL约束的对抗课程,通过训练策略暴露扩散世界模型的高误差轨迹并持续微调,结合优先对抗轨迹缓冲区,解决被动数据中罕见关键转换的鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31460 2026-06-01 cs.RO cs.SY eess.SY 79%

On-Device Robotic Planning: Eliminating Inference Redundancy for Efficient Decision-Making

设备端机器人规划:消除推理冗余以实现高效决策

Joonhee Lee, Hyunseung Shin, Hyunmi Kim, Pei Zhang, Jeonggil Ko

机构 * School of Integrated Technology, College of Computing, Yonsei University(延世大学整合技术学院,计算学院) Department of Hyperscale AI SoC Research Section, ETRI(ETRI超大规模AI SoC研究部) EECS - Electrical and Computer Engineering, University of Michigan(密歇根大学电气与计算机工程学院)

专题命中 具身推理 :robotic(title,abstract);分类 cs.RO

AI总结 提出REIS框架,通过场景门控、KV引导的affordance路由和审慎推理减少推理冗余,在保持语义适应性的同时加速机器人控制。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31111 2026-06-01 cs.LG 79%

Subspace-Decomposed JEPAs: Disentangling Progression and Content in Latent World Models

子空间分解的JEPA:解耦潜在世界模型中的进展与内容

Lucas Thil, Jesse Read, Rim Kaddah, Guillaume Doquet

机构 * LIX, École Polytechnique(巴黎高等学院LIX实验室) IRT SystemX(系统X研究院) Safran Tech(萨弗兰科技)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出SD-JEPA方法,通过将JEPA潜在空间分解为正交的进展子空间和内容子空间,利用余弦边际三元组损失和SIGReg正则化分别约束,在控制基准上优于LeWM基线,并证明进展坐标可作为场景感知的指南针。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31251 2026-06-01 cs.CV cs.AI 62%

ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

ERGeoBench:多模态大语言模型中具身推理与地理定位的综合基准

Kaiwen Xue, Tao Wei, Guoxin Zhang, Zhonghong Ou, Kaoyan Lu, Yu Feng, Yifan Zhu, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) School of Materials Science and Engineering(材料科学与工程学院) China Mobile Research Institute(中国移动研究院) College of Computing and Data Science(计算与数据科学学院)

专题命中 具身推理 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 提出ERGeoBench基准,通过单视图、全景视图和具身视图三种渐进设置评估多模态大语言模型在视觉驱动的具身地理定位中的能力,发现当前模型在高层次地理语义推理上表现良好,但在细粒度感知、度量定位和视图间空间一致性上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29879 2026-06-01 cs.CV cs.RO 62%

DGSG-Mind: Dynamic 3D Gaussian Scene Graphs for Long-Term Scene Understanding and Grounding

DGSG-Mind:用于长期场景理解与定位的动态3D高斯场景图

Luzhou Ge, Xiangyu Zhu, Jinyan Liu, Xuesong Li

机构 * School of Computer Science, Beijing Institute of Technology, China(北京理工大学计算机科学学院)

专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出DGSG-Mind,一种混合实例感知的3D高斯动态场景图系统,通过概率体素网格与显式3D高斯结合实现鲁棒的跨模态实例融合和增量语义映射,并构建层次化场景图与3D高斯思维进行多模态推理,在零样本3D视觉定位、开放词汇语义分割和场景重建中取得领先性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31476 2026-06-01 cs.RO 57%

IDOL: Inverse-Dynamics-Guided Future Prediction for End-to-End Autonomous Driving

IDOL: 逆动力学引导的未来预测用于端到端自动驾驶

Chenghao Zhang, Timin Li, Dongmei Li

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 提出IDOL框架,通过逆动力学模型将BEV世界模型预测的未来潜在场景状态转化为规划相关的轨迹增量,实现未来预测与轨迹优化的紧密耦合,在NAVSIM基准上达到最优性能。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31387 2026-06-01 cs.CL cs.RO 57%

Multi-Turn Multi-Agent Dialogue for Collaborative Reconstruction Improves VLM Performance on Spatial Reasoning, But Only Barely

多轮多智能体对话用于协作重建仅略微提升VLM在空间推理上的性能

Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(语言学计算系,语言学系 柏林洪堡大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 具身推理 :robotic(abstract);分类 cs.RO

AI总结 研究通过多轮多智能体对话框架评估视觉语言模型在协作空间推理任务中的表现,发现视觉空间理解仍是主要瓶颈,文本表示和分解图像表示可部分提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31336 2026-06-01 cs.CV 57%

DecMem: Towards Minute-Long Consistent World Generation with Decoupled Memory

DecMem:基于解耦记忆的分钟级一致世界生成

Zhenhao Yang, Xiaoshi Wu, Zhengyao Lv, Xiaoyu Shi, Xintao Wang, Pengfei Wan, Kun Gai, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 提出解耦记忆架构DecMem,通过稀疏全局记忆和锚定局部记忆解决长程视频生成中的时空一致性问题,实现分钟级可控长视频生成。

Comments Project page is available at https://jeffreyyzh.github.io/DecMem-Page

详情

展开后加载摘要…

URL PDF HTML 收藏