arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-24 至 2026-03-24 共收录 5 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 5 篇

2603.17240 2026-03-24 cs.CV 79%

GigaWorld-Policy: An Efficient Action-Centered World--Action Model

GigaWorld-Policy: 一种高效的以动作为中心的世界-动作模型

Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jie Li, Jindi Lv, Jingyu Liu, Min Cao, Peng Li, Qiuping Deng, Wenjun Mei, Xiaofeng Wang, Xinze Chen, Xinyu Zhou, Yang Wang, Yifan Chang, Yifan Li, Yukun Zhou, Yun Ye, Zhichao Liu, Zheng Zhu

机构 * GigaAI Project Page(GigaAI项目页) GigaWorld Team(GigaWorld团队)

专题命中 动作表示与策略 :action model(title,abstract);分类 cs.CV

AI总结 本文提出GigaWorld-Policy,通过高效动作解码和可选视频生成,解决世界-动作模型在机器人策略学习中的性能瓶颈问题,实验显示其在实际机器人平台上的运行速度提升9倍,任务成功率提高7%。

Comments Added references

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00021 2026-03-24 cs.RO cs.CV 73%

Foundation Models for Trajectory Planning in Autonomous Driving: A Review of Progress and Open Challenges

自动驾驶轨迹规划中的基础模型:进展与开放挑战综述

Kemal Oksuz, Alexandru Buburuzan, Anthony Knittel, Yuhan Yao, Puneet K. Dokania

机构 * Five AI Ltd.(Five AI有限公司) Robert Bosch GmbH(罗伯特·博世有限公司) United Kingdom(英国)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文综述了自动驾驶中基于基础模型的轨迹规划方法,分析了其架构设计、方法优势及局限性,并评估了37种最新方法的代码和数据集开放性。

Comments Accepted to TMLR (Survey Certification)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22264 2026-03-24 cs.RO 70%

UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos

UniDex:一种机器人基础套件,用于从第一人称人类视频中实现通用灵巧手控制

Gu Zhang, Qicheng Xu, Haozhe Zhang, Jianhan Ma, Long He, Yiming Bao, Zeyu Ping, Zhecheng Yuan, Chenhao Lu, Chengbo Yuan, Tianhai Liang, Xiaoyu Tian, Maanping Shao, Feihong Zhang, Mingyu Ding, Yang Gao, Hao Zhao, Hang Zhao, Huazhe Xu

机构 * Tsinghua University(清华大学) Shanghai Qizhi Institute(上海启智研究院) Sun Yat-sen University(中山大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出UniDex,通过机器人中心数据集、统一视觉-语言-动作策略和实用人类数据采集设置,实现通用灵巧手控制。UniDex-VLA在两项不同手的挑战性工具使用任务中达到81%的平均任务进度,优于现有VLA基线。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16407 2026-03-24 cs.RO 57%

LAOF: Robust Latent Action Learning with Optical Flow Constraints

LAOF:基于光流约束的鲁棒潜在动作学习

Xizhou Bu, Jiexi Lyu, Fulei Sun, Ruichen Yang, Zhiqiang Ma, Wei Li

机构 * Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学)

专题命中 动作表示与策略 :embodied foundation model(abstract);分类 cs.RO

AI总结 本文提出LAOF方法,通过利用光流作为动作驱动信号,学习鲁棒的潜在动作表示,以应对动作无关的干扰。实验表明,LAOF在下游模仿学习和强化学习任务中表现优异,尤其在标注稀缺条件下效果显著。

Comments CVPR 2026; Project page: https://github.com/XizoB/LAOF

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20538 2026-03-24 cs.LG stat.ML 57%

Understanding Behavior Cloning with Action Quantization

通过动作量化理解行为克隆

Haoqun Cao, Tengyang Xie

机构 * Department of Computer Sciences, University of Wisconsin–Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机科学系)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.LG

AI总结 本文研究行为克隆中动作量化的影响,分析量化误差传播与统计样本复杂度的相互作用,证明量化行为克隆在稳定动态和概率光滑性条件下可达到最优样本复杂度,提出基于模型的增强方法以改进误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏