arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 42 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 机器人基础模型 42 篇

2607.06988 2026-07-13 cs.RO cs.AI 新提交 84%

WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time

WAM-TTT:在测试时通过观察人类行为来引导世界行动模型

Yusen Feng, Bingchen Han, Jiangran Lyu, Kai Liu, Yixin Zheng, Yuxuan Wan, Weiheng Liu, Sun Han, Ruiqin Li, Yulong Zhang, Fangfu Liu, Xuesong Shi, Libin Liu, Yizhou Wang, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot CASIA(中国科学院自动化所) Tsinghua University(清华大学)

专题命中 机器人基础模型 :action model(title,abstract);robot foundation model(abstract);分类 cs.RO、cs.AI

AI总结 研究旨在解决引导机器人基础模型的难题,提出WAM-TTT框架,通过自监督视频预测吸收人类视频到自适应内存,经元训练阶段对齐人机行为,测试时仅用未标记人类视频,实现高效可重复引导且优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16952 2026-03-20 cs.RO cs.AI 84%

Embodied Foundation Models at the Edge: A Survey of Deployment Constraints and Mitigation Strategies

边缘端具身基础模型:部署约束及缓解策略综述

Utkarsh Grover, Ravi Ranjan, Mingyang Mao, Trung Tien Dong, Satvik Praveen, Zhenqi Wu, J. Morris Chang, Tinoosh Mohsenin, Yi Sheng, Agoritsa Polyzou, Eiman Kanjo, Xiaomin Lin

机构 * University of South Florida(佛罗里达州立大学) Florida International University(佛罗里达国际大学) Johns Hopkins University(约翰霍普金斯大学) Nottingham Trent University(诺丁汉特伦特大学) Imperial College London(伦敦帝国理工学院)

专题命中 机器人基础模型 :embodied foundation model(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文综述了在边缘端部署具身基础模型时面临的系统性约束及缓解策略,重点探讨了内存带宽、计算延迟和执行成本等关键因素对自动回归视觉-语言-动作策略和扩散控制器的影响,强调了内存、调度、通信和模型架构的协同设计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03941 2026-07-07 cs.RO 新提交 83%

WSA$_1$: a 3D-Centric World-Spatial-Action Model for Generalizable Robot Control

WSA$_1$:用于可泛化机器人控制的以3D为中心的世界-空间-动作模型

Jiahao Jiang, Jianing Zhang, Zhenhan Yin, Ruidong Chen, Sen Wang, Zhaoshu Yu, Pengpeng Zeng, Xiaofeng Cao, Xuanhan Wang, Jingkuan Song, Heng Tao Shen

机构 * Tongji University(同济大学) Shanghai Innovation Institution(上海创新机构) Shanghai Magic(上海魔星) Koala Uran Project(考拉铀项目)

专题命中 机器人基础模型 :action model(title,abstract);robot foundation model(abstract);分类 cs.RO

AI总结 研究针对当前机器人基础模型缺乏物理动力学推理等问题,提出以3D为中心的世界-空间-动作建模范式构建WSA$_1$模型,能学习3D世界感知视觉思维并建模约束,提升泛化能力且数据高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14979 2026-02-17 cs.RO 83%

RynnBrain: Open Embodied Foundation Models

RynnBrain: 开放式具身基础模型

Ronghao Dang, Jiayan Guo, Bohan Hou, Sicong Leng, Kehan Li, Xin Li, Jiangpin Liu, Yunxuan Mao, Zhikai Wang, Yuqian Yuan, Minghao Zhu, Xiao Lin, Yang Bai, Qian Jiang, Yaxi Zhao, Minghua Zeng, Junlong Gao, Yuming Jiang, Jun Cen, Siteng Huang, Liuyi Wang, Wenqiao Zhang, Chengju Liu, Jianfei Yang, Shijian Lu, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)

专题命中 机器人基础模型 :embodied foundation model(title,abstract);VLA(abstract);分类 cs.RO

AI总结 RynnBrain提出了一种开放的具身基础模型,通过统一框架强化感知、推理、规划等能力,显著优于现有模型,并能高效适应多种具身任务。

Comments Homepage: https://alibaba-damo-academy.github.io/RynnBrain.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12963 2024-07-03 cs.RO cs.AI cs.CL cs.CV cs.LG 83%

AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents

Michael Ahn, Debidatta Dwibedi, Chelsea Finn, Montse Gonzalez Arenas, Keerthana Gopalakrishnan, Karol Hausman, Brian Ichter, Alex Irpan, Nikhil Joshi, Ryan Julian, Sean Kirmani, Isabel Leal, Edward Lee, Sergey Levine, Yao Lu, Isabel Leal, Sharath Maddineni, Kanishka Rao, Dorsa Sadigh, Pannag Sanketi, Pierre Sermanet, Quan Vuong, Stefan Welker, Fei Xia, Ted Xiao, Peng Xu, Steve Xu, Zhuo Xu

专题命中 机器人基础模型 :embodied foundation model(title,abstract);分类 cs.RO、cs.CV、cs.AI

Comments 26 pages, 9 figures, ICRA 2024 VLMNM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13548 2026-06-02 cs.RO cs.AI 82%

AttenA+: Rectifying Action Inequality in Robotic Foundation Models

AttenA+: 纠正机器人基础模型中的动作不平等性

Daojie Peng, Fulong Ma, Jiahang Cao, Qiang Zhang, Xupeng Xie, Jian Guo, Ping Luo, Andrew F. Luo, Boyu Zhou, Jun Ma

机构 * HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USTC(中国科学技术大学) IDEA Research(IDEA研究院) SUSTech(南方科技大学) X-Humaniod

专题命中 机器人基础模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 针对机器人基础模型忽视动作物理重要性的问题,提出AttenA+框架,通过速度驱动的动作注意力重加权训练目标,提升复杂长程任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15840 2026-05-11 cs.RO cs.CV 82%

Large Video Planner Enables Generalizable Robot Control

大视频规划器实现通用机器人控制

Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Pieter Abbeel, Russ Tedrake, Vincent Sitzmann, Yilun Du

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) Harvard(哈佛大学)

专题命中 机器人基础模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);robot foundation model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出利用大规模视频预训练构建通用机器人基础模型,通过生成视频计划实现跨任务和环境的泛化控制,并在真实机器人上验证了其可行性。

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10105 2025-03-11 cs.RO cs.AI cs.CV 82%

Universal Actions for Enhanced Embodied Foundation Models

Jinliang Zheng, Jianxiong Li, Dongxiu Liu, Yinan Zheng, Zhihao Wang, Zhonghong Ou, Yu Liu, Jingjing Liu, Ya-Qin Zhang, Xianyuan Zhan

专题命中 机器人基础模型 :embodied foundation model(title,abstract);分类 cs.RO、cs.CV、cs.AI

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18610 2026-06-29 cs.RO cs.CV 新提交 81%

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

SC3-Eval: 通过自洽视频生成评估机器人基础模型

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA(英伟达) Physical Intelligence Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Allen Institute for AI(艾伦人工智能研究所)

专题命中 机器人基础模型 :robot foundation model(title);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16518 2026-04-29 cs.RO cs.CL cs.CV 81%

MiMo-Embodied: X-Embodied Foundation Model Technical Report

MiMo-Embodied:X-Embodied基础模型技术报告

Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu, Zhiyi Hou, Hanbing Li, Shumeng Xia, Mingliang Zhou, Yinan Zheng, Zihao Yue, Shuhao Gu, Hao Tian, Yuannan Shen, Jianwei Cui, Wen Zhang, Shaoqing Xu, Bing Wang, Haiyang Sun, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Chaofan Zhang, Wenbo Ding, Kun Ma, Guang Chen, Rui Cai, Diyun Xiang, Heng Qu, Fuli Luo, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 机器人基础模型 :embodied foundation model(title,abstract);分类 cs.RO、cs.CV

AI总结 MiMo-Embodied是首个跨具身基础模型,成功整合并实现自动驾驶和具身AI领域的最先进性能,在17个具身AI基准和12个自动驾驶基准中均取得新纪录,通过多阶段学习、数据构建和CoT/RL微调实现领域间的强正迁移。

Comments Code: https://github.com/XiaomiMiMo/MiMo-Embodied | Model: https://huggingface.co/XiaomiMiMo/MiMo-Embodied-7B

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15155 2025-09-19 cs.LG cs.RO 81%

Self-Improving Embodied Foundation Models

Seyed Kamyar Seyed Ghasemipour, Ayzaan Wahid, Jonathan Tompson, Pannag Sanketi, Igor Mordatch

机构 * Generalist Google DeepMind(谷歌DeepMind)

专题命中 机器人基础模型 :embodied foundation model(title,abstract);分类 cs.RO、cs.LG

Comments Appearing in the Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12215 2026-06-04 cs.RO 79%

LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion

LDA-1B:通过通用具身数据摄取扩展潜动力学动作模型

Jiangran Lyu, Kai Liu, Xuheng Zhang, Haoran Liao, Yusen Feng, Wenxuan Zhu, Tingrui Shen, Jiayi Chen, Jiazhao Zhang, Yifei Dong, Wenbo Cui, Senmao Qi, Shuo Wang, Yixin Zheng, Mi Yan, Xuesong Shi, Haoran Li, Dongbin Zhao, Ming-Yu Liu, Zhizheng Zhang, Li Yi, Yizhou Wang, He Wang

机构 * Peking University(北京大学) Galbot CASIA(中国科学院自动化研究所) BAAI(北京人工智能研究院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) NVIDIA

专题命中 机器人基础模型 :action model(title);robot foundation model(abstract);分类 cs.RO

AI总结 提出LDA-1B机器人基础模型,通过统一格式的具身交互数据集EI-30k和结构化DINO潜空间中的动力学学习,联合建模动力学、策略和视觉预测,在接触丰富、灵巧和长时任务上分别提升高达21%、48%和23%。

Comments Accepted at RSS 2026, Project Page:https://pku-epic.github.io/LDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03920 2026-06-04 cs.RO cs.HC 79%

How Users Understand Robot Foundation Model Performance through Task Success Rates and Beyond

用户如何通过任务成功率及其他方式理解机器人基础模型性能

Isaac Sheidlower, Jindan Huang, James Staley, Bingyu Wu, Qicong Chen, Reuben Aronson, Elaine Short

机构 * Brown University(布朗大学) Tufts University(塔夫茨大学)

专题命中 机器人基础模型 :robot foundation model(title,abstract);分类 cs.RO

AI总结 通过用户研究,探讨非机器人专家如何理解机器人基础模型(RFM)评估中的任务成功率(TSR)及其他信息,发现用户不仅按专家预期使用TSR,还重视未常报告的失败案例,并希望获取历史评估数据和机器人对新任务的性能估计。

Comments Submitted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09623 2025-06-12 cs.RO 79%

Analytic Task Scheduler: Recursive Least Squares Based Method for Continual Learning in Embodied Foundation Models

Lipei Xie, Yingxin Li, Huiping Zhuang

机构 * Shien-Ming Wu School of Intelligent Engineering, South China University of Technology, Guangzhou 510641, P. R. China(华南理工大学智能工程学院)

专题命中 机器人基础模型 :embodied foundation model(title,abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10219 2025-05-16 cs.RO 79%

Towards Safe Robot Foundation Models Using Inductive Biases

Maximilian Tölle, Theo Gruner, Daniel Palenicek, Tim Schneider, Jonas Günster, Joe Watson, Davide Tateo, Puze Liu, Jan Peters

机构 * Technical University of Darmstadt(德累斯顿技术大学) German Research Center for AI ( dfki )(人工智能研究中心) University of Oxford(牛津大学) Robotics Institute Germany ( rig )(德国机器人研究所) Centre for Cognitive Science(认知科学中心)

专题命中 机器人基础模型 :robot foundation model(title,abstract);分类 cs.RO

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07404 2025-03-11 cs.RO 79%

Towards Safe Robot Foundation Models

Maximilian Tölle, Theo Gruner, Daniel Palenicek, Jonas Günster, Puze Liu, Joe Watson, Davide Tateo, Jan Peters

专题命中 机器人基础模型 :robot foundation model(title,abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27817 2026-05-28 cs.RO cs.AI cs.CV cs.LG 77%

Turning Video Models into Generalist Robot Policies

将视频模型转化为通用机器人策略

Sizhe Lester Li, Evan Kim, Xingjian Bai, Tong Zhao, Tao Pang, Max Simchowitz, Vincent Sitzmann

机构 * MIT(麻省理工学院) CMU(卡内基梅隆大学) Amazon FAR(亚马逊公司)

专题命中 机器人基础模型 :robot foundation model(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出一种解耦的视频到动作策略VERA,利用无动作视频世界模型和基于机器人雅可比矩阵的逆动力学模型,实现跨本体的零样本机器人控制。

Comments project page: https://vera.csail.mit.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17601 2025-06-24 cs.RO cs.AI 76%

Risk-Guided Diffusion: Toward Deploying Robot Foundation Models in Space, Where Failure Is Not An Option

Rohan Thakker, Adarsh Patnaik, Vince Kurtz, Jonas Frey, Jonathan Becktor, Sangwoo Moon, Rob Royce, Marcel Kaufmann, Georgios Georgakis, Pascal Roth, Joel Burdick, Marco Hutter, Shehryar Khattak

机构 * NASA-JPL, Caltech(美国国家航空航天局喷气推进实验室,加州理工学院) CME, Caltech(加州理工学院计算机工程系) Robotic Systems Lab, ETH Zurich(苏黎世联邦理工学院机器人系统实验室)

专题命中 机器人基础模型 :robot foundation model(title);分类 cs.RO、cs.AI

Journal ref Robotics Science and Systems 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15275 2026-07-17 cs.RO cs.AI cs.LG 新提交 75%

RoboTTT: Context Scaling for Robot Policies

RoboTTT:机器人策略的上下文扩展

Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan

机构 * NVIDIA(英伟达公司) Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人基础模型 :vision-language-action(abstract);robot foundation model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究提出RoboTTT,将测试时训练集成到机器人基础模型,通过序列动作强制和截断反向传播扩展视觉运动上下文到8K时间步长,解锁新能力,提升多任务性能,证明上下文长度是机器人基础模型新扩展轴。

Comments Project website: http://research.nvidia.com/labs/gear/robottt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01238 2026-02-09 cs.RO cs.AI cs.LG 75%

A Taxonomy for Evaluating Generalist Robot Manipulation Policies

机器人通用操作策略评估的分类

Jensen Gao, Suneel Belkhale, Sudeep Dasari, Ashwin Balakrishna, Dhruv Shah, Dorsa Sadigh

专题命中 机器人基础模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出STAR-Gen分类,旨在系统化评估机器人操作策略的泛化能力,通过视觉、语义和行为三个维度,结合现实案例研究揭示泛化评估的挑战与改进方向。

Comments IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15250 2025-05-21 cs.CV cs.RO 73%

ReVLA: Reverting Visual Domain Limitation of Robotic Foundation Models

Sombit Dey, Jan-Nico Zaech, Nikolay Nikolov, Luc Van Gool, Danda Pani Paudel

专题命中 机器人基础模型 :vision language action(abstract);action model(abstract);分类 cs.RO、cs.CV

Comments Accepted at ICRA-2025, Atlanta

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04693 2025-01-16 cs.RO cs.AI 73%

Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding

Joshua Jones, Oier Mees, Carmelo Sferrazza, Kyle Stachowicz, Pieter Abbeel, Sergey Levine

专题命中 机器人基础模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10655 2026-07-14 cs.RO 新提交 70%

Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models

用于减轻机器人基础模型中捷径学习的人工中央凹感知

Xiatao Sun, Yuan Zhuang, Mateo Sanchez Lopez Negrete, Matei-Victor Coldea, Chen Liang, Haoyang Zhang, Che Liu, Ziyao Zeng, Shawn Li, Qian Wang, Fei Miao, Daniel Rakita

机构 * Yale University(耶鲁大学) University of Connecticut(康涅狄格大学) Peking University(北京大学) Imperial College London(帝国理工学院) Digients

专题命中 机器人基础模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 研究机器人基础模型因捷径学习难以稳健部署的问题,提出人工中央凹感知模块AFP,通过预测任务条件掩码辅助微调,使策略关注任务相关区域,实验证明其能减少微调时间、抑制过拟合并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31958 2026-07-01 cs.RO 新提交 70%

Adapting Generalist Robot Policies with Semantic Reinforcement Learning

基于语义强化学习的通用机器人策略自适应

Jagdeep Singh Bhatia, Andrew Wagenmaker, William Chen, Sergey Levine

机构 * U.C. Berkeley(加州大学伯克利分校)

专题命中 机器人基础模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出语义动作强化学习(SARL),通过在线交互优化语言提示空间,利用通用策略的预训练技能解决复杂长时任务,显著优于现有方法。

Comments Website: https://semantic-action-rl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28529 2026-07-01 cs.RO cs.AI cs.CV 版本更新 67%

The Speedup Paradox: Rethinking Inference Speed-Quality Trade-off in Embodied Tasks

加速悖论:具身任务中推理速度与质量权衡的再思考

Yujin Wang, Junli Chen, Yixuan Li, Shunan Dong, Huazhong Yang, Yongpan Liu, Hongyang Jia

机构 * Tsinghua University(清华大学)

专题命中 机器人基础模型 :embodied foundation model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出TISED分析框架,揭示具身任务中推理加速技术对任务级性能的悖论效应:静态任务中可能延长完成时间,动态任务中适度优化可提升成功率,且效果受硬件配置影响。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04356 2026-03-05 cs.RO cs.AI cs.LG 67%

RoboCasa365: A Large-Scale Simulation Framework for Training and Benchmarking Generalist Robots

RoboCasa365:一种大规模仿真框架,用于训练和评估通用机器人

Soroush Nasiriany, Sepehr Nasiriany, Abhiram Maddukuri, Yuke Zhu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) NVIDIA Research(NVIDIA研究)

专题命中 机器人基础模型 :robot foundation model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 RoboCasa365通过大规模仿真框架提供多样化任务和环境,用于训练和评估通用机器人,分析任务多样性、数据集规模和环境变化对泛化的影响。

Comments ICLR 2026; First three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18676 2025-02-11 cs.RO cs.AI cs.LG 67%

Embodied Red Teaming for Auditing Robotic Foundation Models

Sathwik Karnik, Zhang-Wei Hong, Nishant Abhangi, Yen-Chen Lin, Tsun-Hsuan Wang, Christophe Dupuy, Rahul Gupta, Pulkit Agrawal

专题命中 机器人基础模型 :language-conditioned robot(abstract);分类 cs.RO、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13358 2024-04-10 cs.RO cs.CV cs.LG 67%

GeRM: A Generalist Robotic Model with Mixture-of-experts for Quadruped Robot

Wenxuan Song, Han Zhao, Pengxiang Ding, Can Cui, Shangke Lyu, Yaning Fan, Donglin Wang

专题命中 机器人基础模型 :VLA(abstract);分类 cs.RO、cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13497 2026-06-12 cs.RO cs.CV 新提交 62%

SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale

SPARC:来自机器人演示的可靠空间标注

Nils Blank, Paul Mattes, Maximilian Xiling Li, Jakub Suliga, Thomas Roth, Moritz Reuss, Pankhuri Vanjani, Rudolf Lioutikov

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) NVIDIA(英伟达) Robotics Institute Germany(德国机器人研究所)

专题命中 机器人基础模型 :embodied foundation model(abstract);分类 cs.RO、cs.CV

AI总结 提出SPARC框架,利用机器人任务的时空结构生成可靠性评分,自动标注演示中的空间信息,减少噪声标签并保留更多有用样本,在物体定位基准上优于纯检测基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15153 2026-05-22 cs.RO cs.AI 62%

Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action

Pelican-Unify 1.0:一种用于理解和推理、想象和行动的统一具身智能模型

Yi Zhang, Yinda Chen, Che Liu, Zeyuan Ding, Jin Xu, Shilong Zou, Junwei Liao, Jiayu Hu, Xiancong Ren, Xiaopeng Zhang, Yechi Liu, Haoyuan Shi, Zecong Tang, Haosong Sun, Renwen Cui, Kuishu Wu, Wenhai Liu, Yang Xu, Yingji Zhang, Yidong Wang, Senkang Hu, Jinpeng Lu, Nga Teng Chan, Yechen Wu, Zeting Liu, Xianzhou Hou, Yong Dai, Jian Tang, Xiaozhu Ju

机构 * Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京人形机器人创新中心(X-Humanoid))

专题命中 机器人基础模型 :embodied foundation model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Pelican-Unify 1.0,一种基于统一原则训练的首个具身基础模型,通过单一视觉语言模型作为统一理解模块,将场景、指令、视觉上下文和行动历史映射到共享语义空间,并通过统一推理模块生成任务、行动和未来导向的思维链,最终将隐藏状态投影到密集潜在变量中,再通过统一未来生成器生成未来视频和行动。

详情

展开后加载摘要…

URL PDF HTML 收藏