arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 160 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 部署与泛化 160 篇

2603.18532 2026-03-31 cs.RO cs.AI cs.LG 75%

Scaling Sim-to-Real Reinforcement Learning for Robot VLAs with Generative 3D Worlds

在生成3D世界中扩展机器人视觉语言动作的强化学习

Andrew Choi, Xinjie Wang, Zhizhong Su, Wei Xu

机构 * Horizon Robotics(地平线机器人)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出利用生成3D世界模型来提升机器人视觉语言动作模型的泛化能力,通过生成多样化的交互场景,提高模拟到现实的迁移效果,并展示在真实世界中的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16917 2026-06-23 cs.RO 新提交 74%

Unified Motion-Action Modeling for Heterogeneous Robot Learning

统一运动-动作建模用于异构机器人学习

Yunhao Cao, Shitong Liu, Chao Feng, Meryl Zhang, Xuanchen Lu, Andrew Owens, Kuan Fang

机构 * Cornell University(康奈尔大学)

专题命中 部署与泛化 :action model(title);分类 cs.RO

AI总结 提出UMA模型,利用3D物体运动轨迹作为共享接口,通过掩码生成目标统一视觉运动控制和动力学建模,实现跨异构数据源的多任务预训练,并在部署时支持多种推理模式。

Comments https://uma-manipulation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11363 2026-08-13 cs.RO cs.LG 新提交 73%

Adaptation of Generalist Robot Policies with Minimal Data

基于最少数据的通用机器人策略适配

Shreyas Kowshik, Sreyas Venkataraman, Leo Wang, Niharika Pant, Max Simchowitz, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 部署与泛化 :VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文提出MiDAS算法,结合离线行为克隆与在线强化学习,实现机器人策略仅用1次演示即可完成任务适配,性能优于基线且能泛化,为机器人自主学习提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03895 2026-05-12 cs.RO cs.CV 73%

NoTVLA: Semantics-Preserving Robot Adaptation via Narrative Action Interfaces

NoTVLA:通过叙事动作接口实现语义保留的机器人适应

Zheng Huang, Mingyu Liu, Xiaoyi Lin, Muzhi Zhu, Canyu Zhao, Zongze Du, Ye Lin, Xiaoman Li, Yiduo Jia, Hao Zhong, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 NoTVLA通过稀疏轨迹规划减少灾难性遗忘,提升多任务性能,以更低计算成本和无需腕部摄像头实现高精度与语言能力保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21192 2026-04-24 cs.RO cs.AI 73%

How VLAs (Really) Work In Open-World Environments

视觉-语言-动作模型(VLAs)在开放世界环境中的实际运作方式

Amir Rasouli, Yangzheng Wu, Zhiyuan Li, Rui Heng Yang, Xuan Zhao, Charles Eret, Sajjad Pakdamansavoji

机构 * Noah’s Ark Laboratory, Huawei Technologies Canada(华为加拿大技术有限公司诺亚实验室)

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 本文探讨了VLAs在开放世界环境中的实际运作,指出现有评估方法可能忽视安全性问题,并提出改进的评估协议以更准确衡量复杂交互场景中的性能。

Comments 8 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20246 2026-04-23 cs.RO cs.AI 73%

Cortex 2.0: Grounding World Models in Real-World Industrial Deployment

Cortex 2.0:在真实工业部署中将世界模型接地

Adriana Aida, Walida Amer, Katarina Bankovic, Dhruv Behl, Fabian Busch, Annie Bhalla, Minh Duong, Florian Gienger, Rohan Godse, Denis Grachev, Ralf Gulde, Elisa Hagensieker, Junpeng Hu, Shivam Joshi, Tobias Knoblauch, Likith Kumar, Damien LaRocque, Keerthana Lokesh, Omar Moured, Khiem Nguyen, Christian Preyss, Ranjith Sriganesan, Vikram Singh, Carsten Sponner, Anh Tong, Dominik Tuscher, Marc Tuscher, Pavan Upputuri

机构 * Sereact GmbH(Sereact公司)

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 Cortex 2.0通过在视觉潜在空间中生成候选未来轨迹并评分,实现了从反应式控制到计划与行动的转变,展示了在复杂工业环境中可靠的世界模型规划。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04664 2026-04-07 cs.RO cs.AI cs.MA 73%

ROSClaw: A Hierarchical Semantic-Physical Framework for Heterogeneous Multi-Agent Collaboration

ROSClaw:一种用于异构多智能体协作的分层语义-物理框架

Rongfeng Zhao, Xuanhao Zhang, Zhaochen Guo, Xiang Shao, Zhongpan Zhu, Bin He, Jie Chen

机构 * Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院) National Key Laboratory of Autonomous Intelligent Unmanned Systems (Tongji University)(自主智能无人系统全国重点实验室(同济大学)) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心) Tongji University(同济大学) College of Electronics and Information Engineering, Tongji University(同济大学电子与信息工程学院)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 ROSClaw通过统一视觉语言模型控制器整合策略学习与任务执行,构建仿真到现实的拓扑映射,实现多智能体协作中的语义连续性和动态任务分配,提升多策略执行的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11558 2026-04-02 cs.RO cs.AI 73%

RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks

RoboClaw:一个用于可扩展长周期机器人任务的代理框架

Ruiying Li, Yunlang Zhou, YuYao Zhu, Kylin Chen, Jingyuan Wang, Sukai Wang, Kongtao Hu, Minhui Yu, Bowen Jiang, Zhan Su, Jiayao Ma, Xin He, Yongjian Shen, Yang Yang, Guanghui Ren, Maoqing Yao, Wenhao Wang, Yao Mu

机构 * AgiBot National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) MoE Key Lab of Artificial Intelligence, AI Institute, SJTU(上海交通大学人工智能研究院教育部人工智能重点实验室)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 RoboClaw通过统一数据收集、策略学习和任务执行,提高长周期机器人任务的稳定性和可扩展性,减少人工干预,提升多策略鲁棒性。

Comments Code available at: https://github.com/RoboClaw-Robotics/RoboClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12224 2026-03-24 cs.RO cs.AI 73%

RoboFAC: A Comprehensive Framework for Robotic Failure Analysis and Correction

RoboFAC:机器人故障分析与纠正的综合框架

Zewei Ye, Weifeng Lu, Minghao Ye, Tao Lin, Shuo Yang, Junchi Yan, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 RoboFAC通过构建大规模故障中心数据集,开发轻量级多模态模型,提升机器人故障诊断与纠正能力,实验显示其故障分析准确率比GPT-4o高34.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22407 2026-03-17 cs.AI cs.RO 73%

EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer

EMMA: 通过生成性视觉迁移实现现实世界机器人操作的泛化

Zhehao Dong, Xiaofeng Wang, Zheng Zhu, Yirui Wang, Yang Wang, Yukun Zhou, Boyuan Wang, Chaojun Ni, Runqi Ouyang, Wenkang Qin, Xinze Chen, Yun Ye, Guan Huang, Zhen Lu, Yue Yang

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 EMMA通过生成性视觉迁移框架提升机器人操作的泛化能力,结合生成数据引擎与高效训练流程,实现多视角一致性和几何精度的提升,实验证明其在零样本场景下的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02083 2026-03-10 cs.RO cs.CV 73%

$π$-StepNFT: Wider Space Needs Finer Steps in Online RL for Flow-based VLAs

$π$-StepNFT: 更宽的空间需要更细的步骤在线RL用于基于流的VLAs

Siting Wang, Xiaofeng Wang, Zheng Zhu, Minnan Pei, Xinyu Cui, Cheng Deng, Jian Zhao, Guan Huang, Haifeng Zhang, Jun Wang

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 $π$-StepNFT通过分步负向感知微调方法,在在线强化学习中提升基于流的VLAs的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13764 2026-02-17 cs.RO cs.AI 73%

MOTIF: Learning Action Motifs for Few-shot Cross-Embodiment Transfer

MOTIF: 为少样本跨躯体迁移学习动作动机

Heng Zhi, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(技术悉尼大学) University of Electronic Science(电子科学大学) Advanced Institute of Big Data(大数据高级研究所)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 MOTIF通过学习动作动机实现高效的少样本跨躯体迁移,提升机器人在新躯体上的动作生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05441 2026-02-06 cs.RO cs.AI 73%

Benchmarking Affordance Generalization with BusyBox

通过BusyBox评估具身泛化能力

Dean Fortier, Timothy Adamson, Tess Hellebrekers, Teresa LaScala, Kofi Ennin, Michael Murray, Andrey Kolobov, Galen Mullins

机构 * Microsoft Research(微软研究院) Mississippi State University(密苏里州立大学)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出BusyBox基准,用于评估VLA模型在具身泛化能力上的表现,通过模块化设计挑战模型对新物体的操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19562 2025-12-23 cs.RO cs.AI 73%

REALM: A Real-to-Sim Validated Benchmark for Generalization in Robotic Manipulation

REALM:一种用于机器人操作中泛化能力评估的实-仿真实验室基准

Martin Sedlacek, Pavlo Yefanov, Georgy Ponimatkin, Jai Bardhan, Simon Pilc, Mederic Fourmy, Evangelos Kazakos, Cees G. M. Snoek, Josef Sivic, Vladimir Petrik

机构 * Czech Institute of Informatics, Robotics and Cybernetics(捷克信息学、机器人学与自动化研究所) Czech Technical University in Prague(布拉格捷克技术大学) Faculty of Electrical Engineering(电气工程学院) University of Amsterdam(阿姆斯特丹大学)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 REALM通过高保真仿真环境评估VLA模型在机器人操作中的泛化能力,揭示了其在现实世界中的挑战和局限性。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22777 2025-12-01 cs.RO cs.AI 73%

Improving Robotic Manipulation Robustness via NICE Scene Surgery

通过NICE场景手术提升机器人操作的鲁棒性

Sajjad Pakdamansavoji, Mozhgan Pourkeshavarz, Adam Sigal, Zhiyuan Li, Rui Heng Yang, Amir Rasouli

机构 * Huawei Technologies Canada(华为技术加拿大公司)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 NICE通过增强场景上下文减少分布外差距,提升机器人操作在复杂环境中的鲁棒性和安全性。

Comments 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07127 2025-10-31 cs.RO cs.AI 73%

Human-assisted Robotic Policy Refinement via Action Preference Optimization

Wenke Xia, Yichu Yang, Hongtao Wu, Xiao Ma, Tao Kong, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing(中国人民大学北京校区人工智能学院) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程研究中心) Beijing Key Laboratory of Research on Large Models(北京大型模型研究重点实验室)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments Accepted By NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19516 2025-08-05 cs.RO cs.LG 73%

Boosting Robotic Manipulation Generalization with Minimal Costly Data

Liming Zheng, Feng Yan, Fanfan Liu, Chengjian Feng, Yufeng Zhong, Lin Ma

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15098 2025-05-22 cs.RO cs.AI 73%

Object-Focus Actor for Data-efficient Robot Generalization Dexterous Manipulation

Yihang Li, Tianle Zhang, Xuelong Wei, Jiayi Li, Lin Zhao, Dongchi Huang, Zhirui Fang, Minhua Zheng, Wenjun Dai, Xiaodong He

机构 * JD Explore Academy(京东探索学院) JD Company(京东公司) Beijing Jiaotong University(北京交通大学)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14526 2025-03-20 cs.CV cs.GR cs.RO 73%

ReBot: Scaling Robot Learning with Real-to-Sim-to-Real Robotic Video Synthesis

Yu Fang, Yue Yang, Xinghao Zhu, Kaiyuan Zheng, Gedas Bertasius, Daniel Szafir, Mingyu Ding

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

Comments Website: https://yuffish.github.io/rebot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09268 2025-02-17 cs.RO cs.LG 73%

GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation

Hongyin Zhang, Pengxiang Ding, Shangke Lyu, Ying Peng, Donglin Wang

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07071 2026-04-09 cs.HC cs.CR 71%

BioMoTouch: Touch-Based Behavioral Authentication via Biometric-Motion Interaction Modeling

BioMoTouch:基于生物-运动交互建模的触控行为认证

Zijian Ling, Jianbang Chen, Hongwei Li, Hongda Zhai, Man Zhou, Jun Feng, Zhengxiong Li, Qi Li, Qian Wang

专题命中 部署与泛化 :action model(title)

AI总结 BioMoTouch通过整合电容触控屏与惯性传感器信号,建立生物特征与行为动态的联合模型,实现高鲁棒性的触控认证,实验显示其在99.71%的平衡准确率和0.27%的误判率下表现优异。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07444 2024-06-12 cs.CL 71%

On the Robustness of Document-Level Relation Extraction Models to Entity Name Variations

Shiao Meng, Xuming Hu, Aiwei Liu, Fukun Ma, Yawen Yang, Shuang Li, Lijie Wen

专题命中 部署与泛化 :action model(title)

Comments Accepted to ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12416 2026-08-14 cs.RO 新提交 70%

RoboSynChallenge: Mastering Real-World Dexterity via Generalizing Synthesized Manipulation Skills

RoboSynChallenge:通过泛化合成操作技能掌握真实世界灵巧操作

Runyi Zhao, Ruixin Wu, Chengkun Li, Hongrui Zhang, Ang Li, Ruixing Jin, Yueci Deng, Yingying Guo, Lihe Ding, Shaocong Dong, Tianfan Xue, Yanjun Gao, Yudong Luo, Pascal Poupart, Simo Wu, Kui Jia, Wei-shi Zheng, Guiliang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce(德克斯力公司) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学) University of Colorado Anschutz(科罗拉多大学安舒茨医学中心) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Vector Institute(向量研究所) University of Waterloo(滑铁卢大学) Fudan University(复旦大学) Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute (SLAI)(深圳环区研究所)

专题命中 部署与泛化 :vision-language-action(abstract,abstract_cn);分类 cs.RO

AI总结 RoboSynChallenge竞赛推出统一基准,结合合成数据与真实评估,提供多类基准策略,旨在推动开发泛化性强、数据高效的机器人操作系统,助力通用机器人智能发展。

Comments NeurIPS 2026 Competition Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02195 2026-07-03 cs.RO 新提交 70%

Bridge-WA: Predicting Where and How the World Changes for Robotic Action

Bridge-WA: 预测世界变化的位置和方式以支持机器人动作

Yongjie Bai, Hanting Wang, Mingtong Dai, Qijun Zhong, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) X-Era AI Lab(X-Era AI实验室)

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出Bridge-WA轻量框架,通过蒸馏未来变化教师模型为三个紧凑先验,引导动作生成聚焦于场景变化的位置和方式,提升机器人操作的成功率和鲁棒性。

Comments 21 pages, 8 figures, https://hcplab-sysu.github.io/BRIDGE-WA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05291 2026-06-10 cs.RO 版本更新 70%

Online Self-Training for Co-Adaptation in Hierarchical Diffusion Policies

层次扩散策略中的在线自训练协同适应

Clemence Grislain, Mathilde Kappel, Olivier Sigaud, Mohamed Chetouani

机构 * ISIR, Sorbonne Université, CNRS(ISIR,索邦大学,国家科学研究中心)

专题命中 部署与泛化 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出ORCHID自训练框架,通过环境反馈过滤轨迹并蒸馏回规划器和控制器,实现层次扩散策略的在线稳定改进,在CALVIN基准上轻量模型超越纯离线方法。

Comments Accepted at ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation (DEMO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09298 2026-03-11 cs.RO 70%

CORAL: Scalable Multi-Task Robot Learning via LoRA Experts

CORAL:通过LoRA专家实现可扩展的多任务机器人学习

Yuankai Luo, Woping Chen, Tong Liang, Zhenguo Li

机构 * Frontier Robotics(前沿机器人)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 CORAL通过LoRA专家实现多任务机器人学习,解决任务干扰问题,提升学习效率与扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07837 2026-02-13 cs.RO 70%

RLinf-USER: A Unified and Extensible System for Real-World Online Policy Learning in Embodied AI

RLinf-USER: 一个统一且可扩展的系统,用于具身人工智能中的现实世界在线策略学习

Hongzhi Zang, Shu'ang Yu, Hao Lin, Tianxing Zhou, Zefang Huang, Zhen Guo, Xin Xu, Jiakai Zhou, Yuze Sheng, Shizhe Zhang, Feng Gao, Wenhao Tang, Yufeng Yue, Quanlu Zhang, Xinlei Chen, Chao Yu, Yu Wang

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 RLinf-USER是一个统一且可扩展的系统,用于现实世界中的在线策略学习,通过统一硬件抽象层和异步框架实现多机器人协调与长时训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12993 2026-01-21 cs.RO 70%

Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization

Being-H0.5:面向跨躯体泛化的以人为本的机器人学习规模化

Hao Luo, Ye Wang, Wanpeng Zhang, Sipeng Zheng, Ziheng Xi, Chaoyi Xu, Haiweng Xu, Haoqi Yuan, Chi Zhang, Yiqing Wang, Yicheng Feng, Zongqing Lu

机构 * BeingBeyond Team(BeingBeyond 团队)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 Being-H0.5通过以人为本的学习范式和统一动作空间,实现了在不同机器人平台间的跨躯体泛化,结合混合流框架和流形保持门控,达到模拟和现实中的高性能表现。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18793 2026-01-21 cs.RO 70%

Genie Centurion: Accelerating Scalable Real-World Robot Training with Human Rewind-and-Refine Guidance

Genie Centurion:通过人类 rewind-and-refine 指导加速可扩展的现实世界机器人训练

Wenhao Wang, Jianheng Song, Chiming Liu, Jiayao Ma, Siyuan Feng, Jingyuan Wang, Yuxin Jiang, Kylin Chen, Sikang Zhan, Yi Wang, Tong Meng, Modi Shi, Xindong He, Guanghui Ren, Yang Yang, Maoqing Yao

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 Genie Centurion 通过人类 rewind-and-refine 指导提升现实世界机器人训练效率,实现高任务成功率和低成本数据收集

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01618 2026-01-06 cs.RO 70%

Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation

动作草图生成器:通过视觉草图实现从推理到动作的长周期机器人操作

Huajie Tan, Peterson Co, Yijie Xu, Shanyu Rong, Yuheng Ji, Cheng Chi, Xiansheng Chen, Qiongyu Zhang, Zhongxia Zhao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(1 多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Academy of Artificial Intelligence(2 北京人工智能研究院) University of Sydney(3 新南威尔士大学) Institute of Automation, Chinese Academy of Sciences(4 中国科学院自动化研究所)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 动作草图生成器通过视觉草图实现从推理到动作的长周期机器人操作,结合视觉-语言-动作框架提升任务执行的鲁棒性和可解释性。

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏