arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-19 至 2026-08-19 共收录 3 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 3 篇

2606.07464 2026-08-19 cs.RO cs.AI cs.CV 版本更新 67%

Planning-aligned Token Compression for Long-Context Autonomous Driving

面向长上下文自动驾驶的规划对齐令牌压缩

Zhixuan Liang, Yuxiao Chen, Yurong You, Peter Karkus, Wenhao Ding, Boyi Li, Alexander Popov, Yan Wang, Maximilian Igl, Yiming Li, Danfei Xu, Nikolai Smolyanskiy, Boris Ivanovic, Ping Luo, Marco Pavone

机构 * NVIDIA Research(NVIDIA研究) School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出COMPACT-VA框架,基于条件VQ-VAE将长上下文压缩为有界表示,通过规划对齐实现决策关键信息保留,在动态场景中成功率提升超6%,速度提升3.3倍。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L) 2026. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18077 2026-08-19 cs.RO 新提交 57%

Hydra-0: Action Flow for Generalist World Modeling and Control

Hydra-0:面向通用世界建模与控制的动作流

Hongyu Li, Bowen Wen, Xinghao Zhu, Yixuan Wang, Yilun Du, Yunzhu Li, George Konidaris, Stan Birchfield, Soha Pouya, Chenran Li, Yan Chang

机构 * NVIDIA(英伟达) Brown University(布朗大学) Columbia University(哥伦比亚大学) Harvard University(哈佛大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 本研究提出Hydra-0通用世界模型,以动作流为条件实现跨实体、任务等的通用建模控制,在RoboLab基准获高相关性,还涌现出逆模式,可助力机器人控制。

Comments Project page: this https URL (https://nvidia-isaac.github.io/video_to_data/hydra-0/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14000 2026-08-19 cs.RO 版本更新 57%

A Diffusion-Refined Planner with Reinforcement Learning Priors for Confined-Space Parking

用于狭窄空间泊车的带强化学习先验的扩散优化规划器

Mingyang Jiang, Yueyuan Li, Jiaru Zhang, Songan Zhang, Ming Yang

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 本文提出带强化学习先验的扩散优化规划器DRIP,用于解决狭窄空间泊车规划精度不足的问题,在提升狭窄空间泊车规划性能的同时保持常规场景泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏