arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-06-23 至 2026-06-23 共收录 50 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 39 篇

2511.22973 2026-06-23 cs.CV 版本更新 81%

BIFE: Better Interaction, Fewer Errors for Minute-Long Video Generation

BIFE:更好的交互,更少的错误,用于分钟级视频生成

Zeyu Zhang, Jinyuan Mao, Shuning Chang, Yuanyu He, Yizeng Han, Jiasheng Tang, Fan Wang, Bohan Zhuang

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) Zhejiang University(浙江大学) Hupan Lab(虎扑实验室)

专题命中 通用世界模型 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出BIFE框架,通过语义稀疏KV缓存和块强制训练策略,解决长视频生成中的长程交互保持和误差累积问题,实现稳定连贯的分钟级视频生成,在VDE指标上提升约20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20583 2026-06-23 cs.NI cs.AI 新提交 75%

Physical-AI: From Channel Awareness to Environmental Intelligence in 6G Wireless Networks

Physical-AI: 从信道感知到6G无线网络中的环境智能

Farooque Hassan Kumbhar, Kapal Dev, Sunder Ali Khowaja, Alexandros-Apostolos A. Boulogeorgos, Mehdi Bennis, Yuanwei Liu

机构 * Augmented Cognition Meta-communications ERC Research Center, Korea University, Korea(增强认知元通信ERC研究中心,韩国大学,韩国) Department of Computer Science, Munster Technological University (MTU)(计算机科学系,穆斯特技术大学(MTU)) School of Computing, Faculty of Engineering and Computing, Dublin City University, Ireland(计算学院,工程与计算学院,都柏林城市大学,爱尔兰) Department of Electrical and Computer Engineering of the Democritus University, Greece(德米特里大学电气与计算机工程系,希腊) Department of Electrical and Computer Engineering, The University of Hong Kong, Hong Kong(电气与计算机工程系,香港大学,香港) Department of Electronic Engineering, Kyung Hee University, Yongin-si, Gyeonggi-do 17104, South Korea(电子工程系, Kyung Hee大学, Yongin-si, Gyeonggi-do 17104, 韩国)

专题命中 通用世界模型 :world model(abstract);world model(abstract);environment model(abstract);分类 cs.AI

AI总结 提出Physical-AI架构,利用自监督时空无线电基础模型将分布式观测转化为共享环境表征,通过多推理头估计阻塞、用户分布等环境属性,并基于神经决策层实现主动控制,降低中断概率和阻塞响应延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22430 2026-06-23 cs.CL cs.AI cs.LG 新提交 71%

Words as Difference Makers: How Large Language Models Determine Causal Structure in Text

词汇作为差异制造者:大型语言模型如何确定文本中的因果结构

Wolfgang Pietsch

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大型语言模型通过变分归纳逻辑学习因果结构,并分析其训练过程与架构特征如何实现差异制造者识别。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20707 2026-06-23 cs.CV cs.AI 新提交 71%

GEOPHYS: The Geometry of Physical Plausibility

GEOPHYS: 物理合理性的几何学

Christian Internò, Alexander Pondaven, Habon Issa, Fabio Pizzati, Francesco Pinto, Markus Olhofer, Ivan Laptev, Philip Torr, Eero P. Simoncelli, Barbara Hammer, David Klindt

机构 * Bielefeld University(比勒费尔德大学) University of Oxford(牛津大学) Cold Spring Harbor Laboratory(冷泉港实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Independent(独立作者) Honda Research Institute EU(本田欧洲研究院) New York University(纽约大学) Flatiron Institute, Simons Foundation(西蒙斯基金会熨斗研究所)

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.CV

AI总结 提出GEOPHYS方法,利用冻结图像编码器的每帧嵌入的五个几何特征检测视频中的物理不合理性,在物理违反检测上达到SOTA,并作为验证器提升视频生成模型的物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23312 2026-06-23 cs.RO 新提交 69%

From Pixels to Concepts: Growing Rich 3D Semantic Scene Graph Forests utilizing Foundation Models

从像素到概念:利用基础模型构建丰富的3D语义场景图森林

David Oberacker, Meike Deitersen, Niklas Spielbauer, Tristan Schnell, Georg Heppner, Arne Roennau

机构 * FZI Research Center for Information Technology(FZI信息技术研究中心) Machine Intelligence and Robotics Lab (MaiRo), Karlsruhe Institute for Technology (KIT)(卡尔斯鲁厄理工学院机器智能与机器人实验室)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 提出利用基础模型构建具有开放语义关系的3D场景图森林,通过VLM和LLM推理抽象概念节点与关系,提升机器人场景理解与任务执行能力。

Comments To be published in the Proceedings of the IEEE/RSJ International Conference on Intelligent Robots & Systems (IEEE IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22131 2026-06-23 cs.CV 新提交 69%

Feed-forward Motion In-betweening for Any 4D

任意4D的前馈运动插值

Hiroki Nishizawa, Hubert P. H. Shum, Yoshihiro Fukuhara, Hirokatsu Kataoka, Shigeo Morishima

机构 * Waseda University(早稻田大学) AIST(产业技术综合研究所) Durham University(杜伦大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 提出一种基于关键帧条件的前馈插值框架,利用网格VAE和MMDiT骨干的整流流模型,实现任意4D网格的快速运动插值,在DyMesh16和DyMesh32上表现优异。

Comments Video: https://youtu.be/jZAjPUtSq38?si=aXtDMDviFdfkjKUU

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21596 2026-06-23 cs.CV 新提交 69%

$ϕ$-Scene: Physically Grounded Image-to-3D Scene Reconstruction

$\phi$-Scene: 物理驱动的图像到3D场景重建

Haodong Li, Lulu Shao, Haolin Lu, Yu Fu, Yen-Ru Chen, Seemandhar Jain, Manmohan Chandraker

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 提出$\phi$-Scene方法,将单图像3D场景重建视为拓扑驱动的物理组装过程,通过SDF优化和刚体仿真解决穿透与不稳定接触问题,在3D-Front数据集上取得最优性能。

Comments Project page: https://phi-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21271 2026-06-23 cs.LG 新提交 69%

Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization

通过占据覆盖最大化进行强化学习的无奖励预训练

Marco Pratticò, Pietro Novelli, Massimiliano Pontil, Carlo Ciliberto

机构 * Computational Statistics and Machine Learning - Istituto Italiano di Tecnologia(计算统计与机器学习 - 意大利技术研究院) AI Centre, Computer Science Department, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.LG

AI总结 提出一种无奖励预训练方法ROVER,通过最大化状态占据测度的覆盖来学习可迁移探索策略,在稀疏奖励下游任务中快速适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08690 2026-06-23 cs.LG cs.CR 版本更新 50%

SoK: The Pitfalls of Deep Reinforcement Learning for Cybersecurity

SoK: 深度强化学习在网络安全中的陷阱

Shae McFadden, Myles Foley, Elizabeth Bates, Ilias Tsingenopoulos, Sanyam Vyas, Vasilios Mavroudis, Chris Hicks, Fabio Pierazzi

机构 * King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所) University College London(伦敦大学学院) Cardiff University(卡迪夫大学) KU Leuven(鲁汶大学) Devotion AI Labs(Devotion AI 实验室)

专题命中 通用世界模型 :environment model(abstract);分类 cs.LG

AI总结 本文系统梳理了深度强化学习应用于网络安全时的11个方法学陷阱,通过分析66篇论文量化其普遍性,并在三个典型场景中实验验证其影响,最后提出改进建议。

Comments Accepted at USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频世界模型 2 篇

2606.21172 2026-06-23 cs.CV 新提交 96%

BadDreamer: Transferable Backdoor Attacks against Video World Models for Autonomous Driving

BadDreamer: 针对自动驾驶视频世界模型的可迁移后门攻击

Zhe Shuai, Xiaopeng Xie, Yikun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频世界模型 :world model(title,abstract);world models(title,abstract);video world model(title,abstract);world model(title,abstract)

AI总结 提出BadDreamer,一种针对自动驾驶视频世界模型的可迁移时空后门攻击,通过污染未来帧中的触发-擦除序列,使模型在物理触发出现时幻觉化障碍物消失,进而误导下游动作预测。

Comments 19 pages, 8 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20698 2026-06-23 cs.RO 新提交 91%

SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model

SafeDojo:基于交互世界模型的安全强化学习用于视觉-语言-动作模型

Kai Tang, Peidong Jia, Zhong Chu, Jixian Wu, Rui Ma, Jiajun Cao, Fangyuan Zhao, Sixiang Chen, Yichen Guo, Xiaowei Chi, Chun-Kai Fan, Kevin Zhang, Jinchang Xu, Fubing Yang, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视频世界模型 :world model(title,abstract);world model(title,abstract);video world model(abstract);video world model(abstract)

AI总结 提出SafeDojo,首个基于模型的安全强化学习框架,通过交互式视频世界模型进行想象学习安全动作,结合解耦的任务奖励和安全代价信号,在SafeLIBERO和真实机器人上取得最佳安全成功率。

Comments 20 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身与机器人 4 篇

2606.20679 2026-06-23 cs.RO cs.AI cs.CV 新提交 73%

MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation

MemoryVAM:将记忆融入视频动作模型以实现机器人操作

Yuxin Jiang, Chang Yu, Yunuo Chen, Xiang Feng, Yin Yang, Nishank Gite, Chenfanfu Jiang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Nirvana Robotics(涅槃机器人) University of California, San Diego(加州大学圣迭戈分校) University of Utah(犹他大学)

专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.AI、cs.CV、cs.RO

AI总结 提出MemoryVAM,通过Recap-Cue模块将情景记忆注入视频世界模型策略,解决长时域操作中的非马尔可夫性问题,在LIBERO-Mem和真实机器人任务上显著提升成功率。

Comments Project page: https://MemoryVAM.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23685 2026-06-23 cs.RO 新提交 69%

LaST-HD: Learning Latent Physical Reasoning from Scalable Human Data for Robot Manipulation

LaST-HD:从可扩展人类数据中学习潜在物理推理以进行机器人操作

Jiaming Liu, Yinxi Wang, Chenyang Gu, Siyuan Qian, Xiangju Mi, Hao Chen, Jiawei Chen, Qingpo Wuwu, Xiaoqi Li, Nuowei Han, Yiming Zhang, Xuheng Zhang, Yang Yue, Yeqing Yang, Lei Wang, Peng Jia, Hao Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) The Chinese University of Hong Kong(香港中文大学) Simplexity Robotics Aether Tech

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 提出LaST-HD框架,通过将人手与机器人演示在共享潜在推理空间中对齐,利用未配对轨迹训练世界模型合成统一潜在目标,实现跨形态物理动力学内化,并开发低成本数据手套OOL Glove,结合混合训练策略,仅用少量人类数据即可达到高泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22509 2026-06-23 cs.AI 新提交 69%

Imagine to Ensure Safety in Hierarchical Reinforcement Learning

想象以确保分层强化学习的安全性

Gregory Gorbov, Artem Latyshev, Aleksandr I. Panov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所) FRC Computer Science RAS(俄罗斯科学院联邦研究中心计算机科学研究所)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 提出结合可学习世界模型与高低层策略的分层方法,通过高层生成安全子目标、低层利用想象滚动减少不安全行为,在长时域任务中显著优于现有安全强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21406 2026-06-23 cs.RO cs.CV 新提交 53%

Robot Self-Improvement via Human-Video Dynamics Models

机器人通过人类视频动力学模型自我改进

Hanzhi Chen, Anran Zhang, Simon Schaefer, Kejia Chen, Shi Chen, Daniel Cremers, Oier Mees, Stefan Leutenegger

机构 * ETH Zurich(苏黎世联邦理工学院) Technical University of Munich(慕尼黑工业大学) Microsoft(微软) MCML(慕尼黑机器学习中心)

专题命中 具身与机器人 :dynamics model(title);分类 cs.CV、cs.RO

AI总结 提出DGAC方法,利用人类视频学习跨本体的动作、动力学和价值表征,使机器人能从自身失败中自主改进,在7个真实操作任务中将成功率从40%提升至81%。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 自动驾驶 1 篇

2606.22813 2026-06-23 cs.AI 新提交 81%

Active Inference as the Test-Time Scaling Law for Physical AI Agents

主动推理作为物理AI代理的测试时缩放定律

Omar Hashash, Christo Kurisummoottil Thomas, Walid Saad, Merouane Debbah, Karl Friston, Adeel Razi

机构 * Bradley Department of Electrical and Computer Engineering(布拉德利电气与计算机工程系) Institute for Advanced Computing(先进计算研究所) Virginia Tech(弗吉尼亚理工大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Worcester Polytechnic Institute(沃思堡理工学院) Khalifa University of Science and Technology(卡利法科学与技术大学) CentraleSupelec(中央超导研究所) University Paris Saclay(巴黎萨克雷大学) Queen Square Institute of Neurology(伦敦大学学院神经科学研究所) School of Psychological Sciences(心理学系) Monash University(莫纳什大学) CIFAR Global Scholars Program(CIFAR全球学者计划) Queen Square Institute of Neurology, University College London(伦敦大学学院神经科学研究所)

专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出基于主动推理第一性原理的测试时缩放定律,使物理AI代理通过世界模型推理在非平稳环境中泛化,并利用变分推理更新策略,在自动驾驶任务中提升36%以上推理效率。

Comments 53 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模型式强化学习 3 篇

2602.21816 2026-06-23 cs.RO 版本更新 76%

Self-Curriculum Model-based Reinforcement Learning for Shape Control of Deformable Linear Objects

基于自课程模型的可变形线性物体形状控制强化学习

Zhaowei Liang, Song Wang, Zhao Jin, Shirui Wu, Dan Wu

机构 * Department of Mechanical Engineering, Tsinghua University(清华大学机械工程系)

专题命中 模型式强化学习 :model-based reinforcement learning(title,abstract);分类 cs.RO;dynamics model(abstract)

AI总结 提出两阶段框架,结合基于模型强化学习与在线视觉伺服,通过自课程目标生成机制实现可变形线性物体高效精确的形状控制,在仿真和真实任务中优于主流方法。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11259 2026-06-23 cs.LG cs.NA math.NA 74%

Latent Dynamics Graph Convolutional Networks for model order reduction of parameterized time-dependent PDEs

隐式动力学图卷积网络用于参数化时变偏微分方程的模型降阶

Lorenzo Tomada, Federico Pichi, Gianluigi Rozza

机构 * mathLab, Mathematics Area, SISSA, via Bonomea 265, I-34136 Trieste, Italy(SISSA数学实验室)

专题命中 模型式强化学习 :latent dynamics(title,abstract);分类 cs.LG

AI总结 本文提出LD-GCN,一种数据驱动的编码器-free架构,通过隐式空间建模时间演化,实现降阶动态分析与零样本预测,数学上通过通用逼近定理验证,应用于复杂计算力学问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23436 2026-06-23 cs.CV cs.AI cs.LG 新提交 58%

Rethinking Object-Centric Representations for Video Dynamics Modeling

重新思考面向对象的视频动态建模表示

Amaury Wei, Ismail Nejjar, Olga Fink

机构 * Intelligent Maintenance and Operation Systems (IMOS) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院智能维护与操作系统实验室(IMOS))

专题命中 模型式强化学习 :dynamics model(title);分类 cs.AI、cs.LG、cs.CV

AI总结 提出STAITUS框架,通过解耦每个槽为外观和几何位姿,在运动、遮挡等场景下实现更清晰的分割和更稳定的身份保持。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仿真与规划 1 篇

2606.20627 2026-06-23 cs.AI cs.LG 新提交 82%

Latent Goal Prediction from Language for Model-Based Planning

基于语言隐式目标预测的模型规划

Samuel Barbeau, Simon Roy, Giovanni Beltrame, Christian Desrosiers, Nicolas Thome

机构 * École de Technologie Supérieure, Montréal(蒙特利尔高等技术学院) International Laboratory on Learning Systems (ILLS)(国际学习系统实验室) Polytechnique Montréal(蒙特利尔综合理工学院) MILA Institut Universitaire de France (IUF)(法国大学研究院) Université Sorbonne, CNRS, ISIR(索邦大学,法国国家科学研究中心,智能系统与机器人研究所)

专题命中 仿真与规划 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 提出LAGO框架,通过在同一隐空间预测语言指令的中间子目标序列和动作条件轨迹,结合软最小轨迹代价规划,实现长程鲁棒规划。

Comments 9 pages. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏