arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 320 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 仿真与规划 320 篇

2607.18589 2026-07-22 cs.LG cs.AI 新提交 71%

Planning as Emergent Behavior in Reinforcement Learning with Relational Hidden States

关系隐藏状态强化学习中作为涌现行为的规划

Armin Sommer

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 研究无模型强化学习中规划作为涌现行为的现象,发现神经架构的隐藏状态结构是决定因素,关系隐藏状态网络能获规划机制,恢复环境转移结构并改进策略,解释了涌现规划现象并引发相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19531 2026-06-19 cs.CV cs.RO 新提交 71%

ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?

ImageWAM:世界动作模型真的需要视频生成,还是只需要图像编辑?

Yuyang Zhang, Wenyao Zhang, Zekun Qi, He Zhang, Haitao Lin, Jingbo Zhang, Yao Mu, Xiaokang Yang, Wenjun Zeng, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东方理工学院) Tencent Robotics X(腾讯机器人X) Tsinghua University(清华大学) Zhongguancun Academy(中关村学院)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 提出ImageWAM框架,利用预训练图像编辑模型替代视频生成进行机器人动作预测,通过编辑去噪的KV缓存作为世界动作上下文,在多个模拟和真实实验中优于基线,计算量降至1/6,延迟降至1/4。

Comments Project Page: https://zhangwenyao1.github.io/ImageWAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16480 2026-06-16 cs.RO cs.AI cs.SY eess.SY 新提交 71%

HOLO-MPPI: Multi-Scenario Motion Planning via Hierarchical Policy Optimization

HOLO-MPPI:通过分层策略优化的多场景运动规划

Youngjae Min, Jovin D'sa, Faizan M. Tariq, David Isele, Navid Azizan, Sangjae Bae

机构 * Massachusetts Institute of Technology(麻省理工学院) Honda Research Institute, USA(本田研究所(美国))

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

AI总结 提出HOLO-MPPI框架,结合离线高层策略学习与在线低层随机最优控制,实现多场景运动规划,无需针对每个场景重新调整参数,在自动驾驶中优于MPPI和端到端RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09171 2026-06-10 cs.LG cs.AI cs.CL 版本更新 71%

Fact-Augmented Lookahead Planning for LLM Agents

面向LLM智能体的事实增强前瞻规划

Samuel Holt, Max Ruiz Luyten, Thomas Pouplin, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 仿真与规划 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.LG

AI总结 提出LWM-Planner框架,通过从轨迹中提取关键事实并用于条件化动作提议、世界模型模拟和状态值估计,实现无需参数更新的在线规划改进,在多个环境上优于ReAct/Reflexion和纯搜索基线。

Comments Accepted at the 29th International Conference on Artificial Intelligence and Statistics (AISTATS 2026). Camera-ready version. 9-page main text plus appendices (63 pages total), 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09827 2026-06-09 cs.RO cs.CV 新提交 71%

MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models

MemoryVLA++:通过记忆与想象在视觉-语言-动作模型中进行时间建模

Hao Shi, Weiye Li, Bin Xie, Yulin Wang, Renping Zhou, Tiancai Wang, Xiangyu Zhang, Ping Luo, Gao Huang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) Dexmal StepFun

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 提出MemoryVLA++框架,通过工作记忆、感知-认知记忆库和想象未来状态的世界模型,实现完整时间建模,在模拟和真实机器人任务上显著提升长时域和依赖记忆与想象的任务性能。

Comments The project is available at https://shihao1895.github.io/MemoryVLA-PP-Web

详情

展开后加载摘要…

URL PDF HTML 收藏
1206.3285 2026-06-03 cs.AI cs.LG cs.SY eess.SY 71%

Dyna-Style Planning with Linear Function Approximation and Prioritized Sweeping

具有线性函数逼近和优先级扫描的Dyna风格规划

Richard S. Sutton, Csaba Szepesvari, Alborz Geramifard, Michael P. Bowling

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于模型的Dyna风格规划方法,扩展至线性函数逼近,证明其收敛性,并引入线性Dyna的优先级扫描算法。

Comments Appears in Proceedings of the Twenty-Fourth Conference on Uncertainty in Artificial Intelligence (UAI2008)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14851 2026-05-15 cs.MA cs.AI 71%

IFPV: An Integrated Multi-Agent Framework for Generative Operational Planning and High-Fidelity Plan Verification

IFPV:一种用于生成性操作规划和高保真计划验证的集成多智能体框架

Zhigao Huang, Zhengqing Hu, Dong Chen, Shaohan Zhang, Zhao Jin, Bo Zhang, Han Wu, Mingliang Xu

机构 * School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) Engineering Research Center of Intelligent Swarm Systems, Ministry of Education(教育部智能群体系统工程研究中心) National Supercomputing Center in Zhengzhou(郑州国家超算中心) Henan Research Center for Large Model Technology(河南省大模型技术与新质软件工程研究中心)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.MA

AI总结 IFPV通过多视角分层智能体和对抗认知仿真引擎,提升复杂战场环境下的规划准确性和验证严格性,实验显示其在任务成功率和运营成本上有显著提升。

Comments Submitted to Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18486 2026-05-12 cs.CV cs.CL cs.RO 71%

Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation

小米OneVL:基于视觉-语言解释的一步潜在推理与规划

Jinghui Lu, Jiayi Guan, Zhijian Huang, Jinlong Li, Guang Li, Lingdong Kong, Yingyan Li, Han Wang, Shaoqing Xu, Yuechen Luo, Fang Li, Chenxu Dang, Junli Wang, Tao Xu, Jing Wu, Jianhua Wu, Xiaoshuai Hao, Wen Zhang, Tianyi Jiang, Lingfeng Zhang, Lei Zhou, Yingbo Tang, Jie Wang, Yinfeng Gao, Xizhou Bu, Haochen Tian, Yihang Qiu, Feiyang Jia, Lin Liu, Yigu Ge, Hanbing Li, Yuannan Shen, Jianwei Cui, Hongwei Xie, Bing Wang, Haiyang Sun, Jingwei Zhao, Jiahui Huang, Pei Liu, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Hanchao Leng, Kun Ma, Naiyan Wang, Guang Chen, Kuiyuan Yang, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 OneVL通过双重辅助解码器监督的紧凑潜在标记,实现了视觉-语言解释的一步潜在推理与规划,首次在延迟条件下超越了显式推理方法。

Comments Technical Report; 49 pages, 22 figures, 10 tables; Project Page at https://xiaomi-embodied-intelligence.github.io/OneVL GitHub at https://github.com/xiaomi-research/onevl

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14732 2026-04-21 cs.RO cs.LG 71%

World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems

世界价值-动作模型:面向视觉-语言-动作系统的隐式规划

Runze Li, Hongyin Zhang, Junxi Jin, Qixin Zeng, Zifeng Zhuang, Yiqi Tang, Shangke Lyu, Donglin Wang

机构 * Westlake University(西湖大学) Nanjing University Suzhou Campus(南京大学苏州校区)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.LG、cs.RO

AI总结 本文提出World-Value-Action模型,通过隐式规划提升视觉-语言-动作系统在长时域决策中的性能,通过学习潜在表示和价值函数实现高效规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05955 2026-04-01 cs.RO cs.CV 71%

SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models

SIMPACT:基于视觉-语言模型的仿真增强动作规划

Haowen Liu, Shaoxiong Yao, Haonan Chen, Jiawei Gao, Jiayuan Mao, Jia-Bin Huang, Yilun Du

机构 * UMD(马里兰大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学) Amazon FAR(亚马逊FAR) UPenn(宾夕法尼亚大学)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 SIMPACT通过仿真循环世界建模赋予视觉-语言模型物理推理能力,实现高效动作规划,优于现有通用机器人操作模型,在五个复杂真实世界任务中表现优异。

Comments Accepted to CVPR 2026; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04289 2026-03-05 cs.LG cs.AI 71%

IPD: Boosting Sequential Policy with Imaginary Planning Distillation in Offline Reinforcement Learning

IPD: 通过离线规划蒸馏提升序列策略

Yihao Qin, Yuanfei Wang, Hang Zhou, Peiran Liu, Hao Dong, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 IPD通过引入离线规划蒸馏技术,提升离线强化学习中序列策略的决策稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11541 2026-02-13 cs.AI cs.LG 71%

Budget-Constrained Agentic Large Language Models: Intention-Based Planning for Costly Tool Use

预算约束下的代理型大语言模型:基于意图的规划以应对昂贵的工具使用

Hanbing Liu, Chunhao Tian, Nan An, Ziyuan Wang, Pinyan Lu, Changyuan Yu, Qi Qi

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Shanghai University of Finance(上海财经大学) Baidu Inc.(百度公司)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出INTENT框架,通过意图感知的分层世界模型,在预算约束下提升工具使用任务的成功率并保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16163 2026-01-23 cs.AI cs.RO 71%

Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning

Cosmos Policy: 为视觉运动控制和规划微调视频模型

Moo Jin Kim, Yihuai Gao, Tsung-Yi Lin, Yen-Chen Lin, Yunhao Ge, Grace Lam, Percy Liang, Shuran Song, Ming-Yu Liu, Chelsea Finn, Jinwei Gu

机构 * NVIDIA Stanford University(斯坦福大学)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

AI总结 Cosmos Policy通过单阶段后训练将预训练视频模型转化为高效机器人策略,实现视觉运动控制与规划的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04686 2026-01-09 cs.LG cs.RO 71%

Nightmare Dreamer: Dreaming About Unsafe States And Planning Ahead

噩梦梦游者:对不安全状态的梦境与提前规划

Oluwatosin Oseni, Shengjie Wang, Jun Zhu, Micah Corah

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.LG、cs.RO

AI总结 Nightmare Dreamer是一种基于模型的安全强化学习算法,通过预测潜在安全违规并规划动作,在机器人控制任务中实现了接近零安全违规和高奖励效率。

Comments RSS'25: Multi-Objective Optimization and Planning in Robotics Workshop: 5 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00041 2025-12-02 cs.RO cs.CV 71%

VISTAv2: World Imagination for Indoor Vision-and-Language Navigation

VISTAv2:室内视觉与语言导航的世界想象

Yanjia Huang, Xianshun Jiang, Xiangbo Gao, Mingyang Wu, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 VISTAv2通过生成式世界模型实现室内视觉与语言导航的稳健规划,结合动作条件想象和在线价值图融合,提升导航效率与鲁棒性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12967 2024-11-21 cs.RO cs.AI 71%

Shrinking POMCP: A Framework for Real-Time UAV Search and Rescue

Yunuo Zhang, Baiting Luo, Ayan Mukhopadhyay, Daniel Stojcsics, Daniel Elenius, Anirban Roy, Susmit Jha, Miklos Maroti, Xenofon Koutsoukos, Gabor Karsai, Abhishek Dubey

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

Comments Accepted to the The 3rd International Conference on Assured Autonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17406 2024-04-23 cs.RO cs.AI 71%

LLM-State: Open World State Representation for Long-horizon Task Planning with Large Language Model

Siwei Chen, Anxing Xiao, David Hsu

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18239 2024-04-02 cs.AI cs.CL cs.FL cs.RO 71%

Fine-Tuning Language Models Using Formal Methods Feedback

Yunhao Yang, Neel P. Bhatt, Tyler Ingebrand, William Ward, Steven Carr, Zhangyang Wang, Ufuk Topcu

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13827 2024-03-22 cs.RO cs.LG eess.SP 71%

Self-Supervised Path Planning in UAV-aided Wireless Networks based on Active Inference

Ali Krayani, Khalid Khan, Lucio Marcenaro, Mario Marchese, Carlo Regazzoni

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.LG、cs.RO

Comments Accepted for publication in the 2024 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13350 2024-01-22 cs.AI cs.LG 71%

Choreographer: Learning and Adapting Skills in Imagination

Pietro Mazzaglia, Tim Verbelen, Bart Dhoedt, Alexandre Lacoste, Sai Rajeswar

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

Comments Accepted at ICLR 2023 (notable top 25%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05946 2024-01-12 cs.LG cs.AI 71%

Learning Cognitive Maps from Transformer Representations for Efficient Planning in Partially Observed Environments

Antoine Dedieu, Wolfgang Lehrach, Guangyao Zhou, Dileep George, Miguel Lázaro-Gredilla

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.01507 2022-03-04 cs.MA cs.RO cs.SY eess.SY 71%

SMA-NBO: A Sequential Multi-Agent Planning with Nominal Belief-State Optimization in Target Tracking

Tianqi Li, Lucas W. Krakow, Swaminathan Gopalswamy

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.RO、cs.MA

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.01770 2021-10-12 cs.CV cs.AI 71%

Procedure Planning in Instructional Videos via Contextual Modeling and Model-based Policy Learning

Jing Bi, Jiebo Luo, Chenliang Xu

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

Comments ICCV 2021 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.07550 2018-11-20 cs.CL cs.AI cs.LG cs.NE 71%

Switch-based Active Deep Dyna-Q: Efficient Adaptive Planning for Task-Completion Dialogue Policy Learning

Yuexin Wu, Xiujun Li, Jingjing Liu, Jianfeng Gao, Yiming Yang

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 9 figures, AAAI 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.06176 2018-05-24 cs.CL cs.AI cs.LG cs.NE 71%

Deep Dyna-Q: Integrating Planning for Task-Completion Dialogue Policy Learning

Baolin Peng, Xiujun Li, Jianfeng Gao, Jingjing Liu, Kam-Fai Wong, Shang-Yu Su

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

Comments 11 pages, 8 figures, Accepted in ACL 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.08038 2016-07-28 cs.AI cs.RO 71%

Behavior and path planning for the coalition of cognitive robots in smart relocation tasks

Aleksandr I. Panov, Konstantin Yakovlev

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

Comments As submitted to the 4th International Conference on Robot Intelligence Technology and Applications (RiTA-2015), Bucheon, Korea, December 14-16, 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00573 2023-04-04 cs.LG cs.AI 70%

Risk-Sensitive and Robust Model-Based Reinforcement Learning and Planning

Marc Rigter

专题命中 仿真与规划 :model-based reinforcement learning(title);分类 cs.AI、cs.LG

Comments DPhil (PhD) thesis, University of Oxford

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.02097 2021-11-05 cs.AI cs.LG 70%

A Consciousness-Inspired Planning Agent for Model-Based Reinforcement Learning

Mingde Zhao, Zhen Liu, Sitao Luan, Shuyuan Zhang, Doina Precup, Yoshua Bengio

专题命中 仿真与规划 :model-based reinforcement learning(title);分类 cs.AI、cs.LG

Comments NeurIPS camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06008 2026-08-07 cs.RO 新提交 69%

Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features

Adaptive-WAM:基于质量引导的中间视频扩散特征早期退出规划

Sining Ang, Yuguang Yang, Yan Wang

专题命中 仿真与规划 :world-model(abstract);world-model(abstract);分类 cs.RO

AI总结 Adaptive-WAM是基于Wan2.2-5B主干的质量感知多出口规划器,通过动态分配主干深度减少计算量,在NAVSIM、nuScenes等数据集上取得优异规划性能,延迟显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20633 2026-08-07 cs.RO 版本更新 69%

Reinforcing Action Policies by Prophesying

通过预言强化行动策略

Jiahui Zhang, Ze Huang, Chun Gu, Zipei Ma, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 ProphRL通过Prophet、FA-GRPO和FlowScale提升VLA后训练的效率与稳定性,实现机器人任务的成功率提升。

Comments https://LogosRoboticsGroup.github.io/ProphRL

详情

展开后加载摘要…

URL PDF HTML 收藏