arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-30 至 2026-06-30 共收录 163 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 39 篇

2511.12058 2026-06-30 gr-qc 50%

Relativistic framework for high-precision GNSS processing in GCRS/BCRS with extension to cislunar space

相对论框架用于高精度GNSS处理在GCRS/BCRS中的应用并扩展至地月空间

Slava G. Turyshev, Yoaz E. Bar-Sever, William I. Bertiger

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出基于相对论的高精度GNSS处理框架,实现GCRS与BCRS间的O(c^{-2})转换,验证了地月空间中厘米级轨道建模的精度,并定义了月心参考系及时间系统以支持地月导航应用。

Comments 30 pages, 1 figure, 7 tables

Journal ref Astron. J. 172(1), 58 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 18 篇

2606.28804 2026-06-30 cs.CV cs.RO 87%

ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models

ViPSim: 协同视觉与参数空间实现一致的长时程具身世界模型

Longyu Chen, Heng Li, Wei Yang, Manqi Zhao, Dongsheng Jiang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出ViPSim框架,通过协同视觉空间(显式空间先验)和参数空间(数值驱动)解决长时程视频生成中的轨迹漂移和不一致问题,实现高保真具身世界模型。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28758 2026-06-30 cs.CV cs.AI 84%

X-Mind: Efficient Visual Chain-of-Thought via Predictive World Model for End-to-End Driving

X-Mind: 通过预测世界模型实现高效视觉思维链的端到端驾驶

Bohao Zhao, Chengrui Wei, Guangfeng Jiang, Ruixin Liu, Xuejie Lv, Liu Liang, Sutao Deng, Xiuyang Fan, Pengkun Zheng, Jinyun Zhou, Rui Guo, Hanpeng Liu, Yutong Zheng, Yi Guo, Xinlong Zheng, Qingyu Luo, Zhuangzhuang Ding, Yu Zhang, Hang Zhang, Xianming Liu

机构 * XPeng Inc.(小鹏汽车)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 提出X-Mind框架,将预测世界模型内化为视觉思维链,通过紧凑的草图表示和循环块扩散方案,实现高效、低延迟的端到端驾驶策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10044 2026-06-30 cs.AI 新提交 83%

Business World Model

商业世界模型

Cecil Pang, Hiroki Sayama

机构 * AI Engineering, USA TODAY Co., Inc.(AI工程,USA TODAY公司) School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(系统科学与工业工程学院,宾夕法尼亚州立大学宾夕法尼亚州立大学) Binghamton Center of Complex Systems, Binghamton University, State University of New York(宾夕法尼亚州立大学复杂系统中心) Waseda Innovation Lab, Waseda University, Tokyo, Japan(早稻田大学创新实验室)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.AI

AI总结 提出商业世界模型(BWM)架构,将世界模型思想应用于商业环境,通过编码状态、动态、约束和目标,支持自主决策与规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30292 2026-06-30 cs.LG cs.CV 81%

DreamForge-World 0.1 Preview: A Low-Compute Real-Time Controllable World Model

DreamForge-World 0.1 Preview:一种低计算量实时可控世界模型

Daniyel Ayupov, Artur Markov-Tsoy

机构 * DreamForge AI Lab(DreamForge AI实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 提出DreamForge-World 0.1 Preview,一种基于自回归视频堆栈和残差动作路径的低计算量实时交互世界模型,支持消费级GPU运行和多种交互功能。

Comments Project page: https://trydreamforge.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28712 2026-06-30 cs.RO cs.LG 81%

J-LAW: Joint Localization and Actionable World Modeling via Coupled Latent Factor Graphs

J-LAW:通过耦合潜在因子图实现联合定位与可操作世界建模

Guanqun Cao, Liang Chen

机构 * Geely Technology Europe(吉利技术欧洲公司) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘与遥感国家重点实验室(LIESMARS)) Wuhan University(武汉大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG

AI总结 提出J-LAW,通过耦合因子图联合优化度量物体位姿、潜在世界状态和潜在地标嵌入,实现定位与可操作世界建模的协同提升,实验证明能显著降低潜在预测误差和端点漂移。

Comments 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30639 2026-06-30 cs.AI cs.CL 79%

Self-Evolving World Models for LLM Agent Planning

面向LLM智能体规划的自我进化世界模型

Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, Yang Deng

机构 * National University of Singapore(国立新加坡大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出WorldEvolver框架,通过情景记忆、语义记忆和选择性预见三个模块在测试时修正世界模型,提升预测准确性和下游规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30421 2026-06-30 cs.CV 79%

OWMDrive: Causality-Aware End-to-End Autonomous Driving via 4D Occupancy World Model

OWMDrive: 基于4D占用世界模型的因果感知端到端自动驾驶

Junjie Cheng, Ruiqi Song, Ye Wu, Nanxing Zeng, Ximiao Li, Yunfeng Ai

机构 * The School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Waytous Inc.(Waytous公司) The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) The College of Surveying and Geo-Informatics, Tongji University(同济大学测绘与地理信息学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出OWMDrive框架,利用4D占用世界模型预测多步3D占用,作为条件先验引导扩散规划器生成强化轨迹,显式建模时空因果依赖,提升复杂场景下的规划鲁棒性和安全性。

Comments International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29850 2026-06-30 cs.CV 79%

Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction

面向具身AI的高效视觉指代:智能体驱动数据合成、跨块注意力与迭代校正

Zijian Hong, Qi Lv, Yuxiang Xie, Jianming Xing, Xiang Deng, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 具身推理 :embodied AI(title,abstract);分类 cs.CV

AI总结 提出PointArena 2026解决方案,通过智能体驱动数据合成、确定性可操控数据流水线、跨块注意力与迭代校正模块,实现77.2%总体准确率,排名第二。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29799 2026-06-30 cs.AI 79%

The CRISTAL Method: Neurosymbolic analysis from AI-synthesized world models

CRISTAL方法:来自AI合成世界模型的神经符号分析

Rafael Kaufmann, Felix Neubürger, Michael Walters, Thomas Kopinski, Dimitrije Marković

机构 * GAIA Lab(GAIA实验室) South Westphalia University of Applied Sciences(西南弗里西亚应用科学大学) Technical University Dresden(德累斯顿技术大学) Primordia Co.(Primordia公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出CRISTAL神经符号框架,通过贝叶斯推理、主动学习和持续学习自动化复杂分析,在合成股票分类任务中仅用5个样本和5秒达到贝叶斯最优精度,远超LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29465 2026-06-30 cs.LG 79%

Prototype Latent World Model Replay for Class-Incremental Learning

原型潜在世界模型回放用于类增量学习

Weizhi Nie, Hui Wang, Weijie Wang, Yuting Su

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出无记忆框架,通过冻结的ImageNet预训练编码器将旧类存储为潜在状态分布,在新类到来时采样回放,结合轻量适配器和对比学习,显著提升类增量学习性能。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28751 2026-06-30 cs.LG cond-mat.stat-mech 79%

A Path-Space Formulation of Prediction in World Models: From a Single Action to Prediction, Planning, and Irreversibility

世界模型中预测的路径空间表述:从单一动作到预测、规划和不可逆性

Gunn Kim

机构 * Department of Physics, Sejong University, Seoul 05006, Republic of Korea(首尔大学物理系,首尔05006,韩国)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出世界模型中预测的路径空间表述,将预测、规划和不确定性统一为作用泛函上的操作,并发现注意力不对称性编码了数据的不可逆性。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22960 2026-06-30 cs.CV 79%

UCM: Unified Modeling of Camera Control and Memory with Time-aware Positional Encoding Warping for World Models

UCM:基于时间感知位置编码变形的相机控制与内存统一建模

Tianxing Xu, Zixuan Wang, Guangyuan Wang, Li Hu, Zhongyi Zhang, Peng Zhang, Bang Zhang, Songhai Zhang

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 UCM通过时间感知位置编码变形机制实现相机控制与长期记忆的统一建模,在真实和合成基准测试中显著提升场景一致性并实现高保真视频生成的精确控制。

Comments Project Page: https://humanaigc.github.io/ucm-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30568 2026-06-30 cs.IT math.IT 78%

Towards World Model-Empowered Integrated Sensing, Communication, and Decision for Complex Unmanned Systems

迈向世界模型赋能的复杂无人系统集成感知、通信与决策

Xue Han, Yongpeng Wu, Meng Shen, Wenjun Xu, Biqian Feng, Zijin Wang, Xiaohu You, Shengli Sun, Wenjun Zhang

专题命中 具身推理 :world model(title,abstract)

AI总结 针对复杂无人系统,提出一种世界模型赋能的感知-通信-决策集成框架,通过时敏AoI驱动感知、预测世界模型和多粒度知识图谱,实现联合优化。

Comments Accepted by IEEE Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02459 2026-06-30 cs.CV 70%

ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing

ReSpace:基于文本的自回归3D室内场景合成与编辑

Martin JJ. Bucher, Iro Armeni

机构 * Stanford University(斯坦福大学)

专题命中 具身推理 :manipulation(abstract);world model(abstract);分类 cs.CV

AI总结 ReSpace通过自回归方法实现文本驱动的3D室内场景合成与编辑,具备明确房间边界和资产无关部署能力,支持通过自然语言添加、移除和交换物体,实验在物体添加和完整场景合成质量上超越现有方法。

Comments 23 pages, 17 figures, 11 tables (incl. appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02491 2026-06-30 cs.LG cs.AI cs.RO q-bio.NC stat.ML 67%

What Capable Agents Must Know: Selection Theorems for Robust Decision-Making under Uncertainty

什么是有能力的智能体必须知道:在不确定性下鲁棒决策制定的选取定理

Aran Nayebi

机构 * Machine Learning Department and Neuroscience & Robotics Institutes, Carnegie Mellon University(机器学习系和神经科学与机器人研究院,卡内基梅隆大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文探讨了在不确定性下智能体必需的内部结构,证明了强任务表现迫使世界模型、信念记忆及持久变量的必要性,提出了选取定理以解决部分可观测性和任务分布下的决策问题。

Comments 23 pages, 1 figure. To appear in Uncertainty in Artificial Intelligence (UAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30638 2026-06-30 cs.CV 57%

Open-Vocabulary and Referring Segmentation for 3D Gaussians Using 2D Detectors

开放词汇与指代分割:利用2D检测器实现3D高斯

Jameel Hassan, Yasiru Ranasinghe, Vishal Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 具身推理 :embodied AI(abstract);分类 cs.CV

AI总结 提出GaussDet方法,利用离散的2D开放词汇检测器与指代表达能力,通过视图聚合语义标签分布实现3D场景的开放词汇分割和指代分割,在零样本设置下显著提升指代分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19119 2026-06-30 cs.CV 57%

MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images

MonoSR: 从单目图像进行开放词汇空间推理

Qirui Wang, Jingyi He, Yining Pan, Si Yong Yeo, Xulei Yang, Shijie Li

机构 * Technical University of Munich(慕尼黑工业大学) A*STAR Institute of Advanced Intelligence and Computing(新加坡科技研究局高级智能与计算研究所) Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出MonoSR大规模单目空间推理数据集,涵盖多种场景并支持多种问题类型,评估先进视觉-语言模型并分析辅助信息对单目空间推理的重要性,为开放世界中的单目空间推理提供基础。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06597 2026-06-30 cs.CR 50%

No TPU Left Behind: Retrofitting Side-Channel Protection into Edge TPUs

TPU 无所不在:将侧信道保护融入边缘TPU

Ashley Kurian, Anuj Dubey, Modini Ayyagari, Aydin Aysu

专题命中 具身推理 :world model(abstract)

AI总结 本文提出一种训练时防护方法,在不修改硬件或固件的情况下,通过在边缘TPU上训练多个功能等价的参数版本并随机组合,降低侧信道攻击依赖的相关性,同时保持模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 9 篇

2606.30613 2026-06-30 cs.RO 83%

Sequential Planning via Anchored Robotic Keypoints

基于锚定机器人关键点的顺序规划

Bryce Grant, Aryeh Rothenberg, Logan Senning, Zonghe Chua, Zach Patterson, Peng Wang

机构 * Department of Electrical, Computer, and Systems Engineering(电气、计算机与系统工程系) Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)

专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 提出SPARK,一种无训练神经符号操作系统,通过单一Gemini调用生成类型化行为树,结合SAM3的替代提示检测和恢复循环,在LIBERO-PRO上达到43.7%,超越CaP-Agent0和VLA基线。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29247 2026-06-30 cs.AI 79%

SurgVLA-Bench: Towards Evaluating Vision-Language-Action Models for Laparoscopic Surgical Robotics

SurgVLA-Bench:面向腹腔镜手术机器人的视觉-语言-动作模型评估基准

Jiashuo Sun, Yue He, Wenxuan Liu, Tao Mao, Jiazheng Wang, Xiang Chen, Min Liu

机构 * the National Engineering Research Center of Robot Visual Perception and Control Technology, China(中国机器人视觉感知与控制技术国家工程研究中心) the national graduate college for elite engineers, Hunan University, Hunan, China(湖南大学精英工程师国家研究生学院) the School of Artificial Intelligence and Robotics, Hunan University, Hunan, China(湖南大学人工智能与机器人学院)

专题命中 机器人基础模型 :robotics(title,abstract);分类 cs.AI

AI总结 提出首个腹腔镜手术机器人VLA模型评估基准SurgVLA-Bench,基于SurRoL平台构建层次化任务体系,系统评估自回归与流匹配两类模型,揭示其语义理解与任务精度的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30456 2026-06-30 cs.RO cs.CV 79%

Vision-Language-Action Models: Experimental Insights from a Real-World UR5 Platform

视觉-语言-动作模型:来自真实世界UR5平台的实验洞察

Mathilde Hochedel, Marc Lalonde

机构 * Luqia Technologies(卢西亚科技)

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究将VLA模型迁移到真实UR5e机器人,发现离线指标与闭环行为之间存在差距,强调数据-模型-控制管线的系统级优化比模型容量提升更重要。

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29384 2026-06-30 cs.CV cs.RO 79%

Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model

Event-VLA: 基于动作条件的事件融合用于鲁棒的视觉-语言-动作模型

Jiaxin Liu, Xun Xu, Zhenhao Zhang, Hanqing Wang, Ruiqi Chen, Shi Chang, Weiyu Guo, Laurent Kneip

专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对现有VLA模型在光照变化下鲁棒性不足的问题,提出Event-VLA框架,通过事件流作为光照鲁棒的运动敏感互补观测,利用动作查询路由和门控交叉注意力融合事件信息,提升低光及近黑暗环境下的操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29350 2026-06-30 cs.CV cs.AI 76%

Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs

快得足以行动:面向低延迟机器人视觉语言模型和视觉语言动作模型的时空视觉令牌融合

Junzhou Chen, Jindong Wang, Gang Zhou

机构 * Department of Computer Science(计算机科学系) Department of Data Science(数据科学系) William & Mary(威廉玛丽学院)

专题命中 机器人基础模型 :robotic(title);分类 cs.AI、cs.CV

AI总结 提出ST-Merge框架,在视觉编码阶段通过构建3D时空坐标和多队列并行匹配加权聚合机制高效融合冗余令牌,并引入后融合位置校正消除空间偏差,在Qwen2.5-VL上实现2倍推理加速且精度损失仅1%,在π0.5 VLA策略上实现8.3倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25044 2026-06-30 cs.RO 70%

X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models

X-DiffVLA:面向视觉-语言-动作模型的跨具身扩散动作头

Boyu Li, Chaoyi Xu, Haoqi Yuan, Xinrun Xu, Börje F. Karlsson, Haoran Li, Zongqing Lu, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(SKL-MAIS,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) BeingBeyond School of Computer Science, Peking University(北京大学计算机学院)

专题命中 机器人基础模型 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 针对跨具身数据学习通用策略的挑战,提出X-DiffVLA模型,通过扩散模型和具身强制技术实现异构末端执行器间的知识迁移,在RoboCasa和Isaac Gym上分别提升15.3%和12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30113 2026-06-30 cs.RO cs.AI 62%

SA-VLA: State-aware tokenizer for improving Vision-Language-Action Models' performance

SA-VLA: 状态感知分词器提升视觉-语言-动作模型性能

Tengyue Jiang, Chunpu Xu, Jiayue Kang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(东华大学) Hong Kong Polytechnic University(香港理工大学) Xi’an University of Electronic Science and Technology(西安电子科技大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出状态感知动作分词器SA-VLA,通过状态条件动作解码减少离散化压缩损失,在12个操作任务上将成功率从0.29提升至0.56。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29201 2026-06-30 cs.RO cs.AI 62%

Behavior Uncloning: Distilling Mode Redirection into Policy Weights without Inference-Time Steering

行为去克隆:将模式重定向蒸馏到策略权重中,无需推理时引导

Hao Wang, Jiuzhou Lei, Dayou Li, Bangya Liu, Minghui Zheng, Manling Li, Ruohan Zhang, Zhiwen Fan

专题命中 机器人基础模型 :robot policy(abstract);分类 cs.RO、cs.AI

AI总结 提出MoRE方法,通过短时“去克隆”步骤将模式分类器的重定向信号蒸馏到策略权重中,抑制不安全行为模式,零推理开销提升部署成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29089 2026-06-30 cs.RO 57%

TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models

TAP-VLA:面向视觉语言动作模型的触觉标注提示

Mark Van der Merwe, Mohamad Louai Shehab, Jayjun Lee, Youngsun Wi, Yinpei Dai, Dmitry Berenson, Nima Fazeli

机构 * Robotics Department, University of Michigan(密歇根大学机器人系) Computer Science and Engineering Department, University of Michigan(密歇根大学计算机科学与工程系)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 提出TAP-VLA框架,通过将触觉剪切场叠加到RGB图像上作为视觉增强,无需修改架构或触觉预训练,即可将触觉反馈融入VLA模型,在接触丰富任务中成功率78%,显著优于基线。

Comments 8 pages + references

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 6 篇

2602.13977 2026-06-30 cs.RO cs.AI 84%

WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL

WoVR:基于世界模型的可靠模拟器用于训练后VLA策略的强化学习

Zhennan Jiang, Shangqing Zhou, Yutong Jiang, Zefang Huang, Mingjie Wei, Yuhui Chen, Tianxing Zhou, Zhen Guo, Hao Lin, Quanlu Zhang, Yu Wang, Haoran Li, Chao Yu, Dongbin Zhao

专题命中 模仿学习与强化学习 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出WoVR框架,通过可控动作条件视频世界模型和关键帧初始化回放提升模拟稳定性,实现稳定长周期模拟回放和有效策略优化,取得优于LIBERO的性能。

Comments 25pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02714 2026-06-30 cs.CV 79%

ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving

ExploreVLA: 为端到端自动驾驶的密集世界建模与探索

Zihao Sheng, Xin Ye, Jingru Luo, Sikai Chen, Liu Ren

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.CV

AI总结 本文提出基于世界建模的统一理解与生成框架,通过密集监督和内在奖励提升自动驾驶策略探索能力,在NAVSIM和nuScenes基准上取得优异性能。

Comments Accepted to ECCV 2026. The code is available at https://zihaosheng.github.io/ExploreVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏