arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9819 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9146 篇

2603.07093 2026-03-10 cs.CV 70%

Facial Expression Generation Aligned with Human Preference for Natural Dyadic Interaction

面向自然双人互动的人类偏好对齐的面部表情生成

Xu Chen, Rui Gao, Xinjie Zhang, Haoyu Zhang, Che Sun, Zhi Gao, Yuwei Wu, Yunde Jia

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 本文提出了一种基于人类反馈的面部表情生成方法,通过动作学习和强化学习策略实现自然双人互动中与人类偏好的对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11291 2026-03-05 cs.RO 70%

H-WM: Robotic Task and Motion Planning Guided by Hierarchical World Model

H-WM:由分层世界模型引导的机器人任务和运动规划

Jinbang Huang, Wenyuan Chen, Zhiyuan Li, Oscar Pang, Xiao Hu, Lingfeng Zhang, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Tongtong Cao, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 H-WM通过结合逻辑和视觉世界模型,实现机器人任务和运动规划中的鲁棒长视界推理与稳定引导。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19400 2026-03-03 cs.CV 70%

Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes

跨视角视觉:评估视觉-语言模型在机器人场景中的空间推理能力

Zhiyuan Feng, Zhaolu Kang, Qijie Wang, Zhiying Du, Jiongrui Yan, Shubin Shi, Chengbo Yuan, Huizhi Liang, Yu Deng, Qixiu Li, Rushuai Yang, Arctanx An, Leqi Zheng, Weijie Wang, Shawn Chen, Sicheng Xu, Yaobo Liang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Peking University(北京大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 本文提出MV-RoboBench基准,评估视觉-语言模型在机器人场景中的多视角空间推理能力,揭示其在多视角机器人感知中的挑战。

Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://aaronfengzy.github.io/MV-RoboBench-Webpage/

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23583 2026-03-02 cs.RO 70%

VCA: Vision-Click-Action Framework for Precise Manipulation of Segmented Objects in Target Ambiguous Environments

VCA:面向目标模糊环境中的分割物体精确操控的视觉-点击-动作框架

Donggeon Kim, Seungwon Jan, Hyeonjun Park, Daegyu Lim

机构 * ROBROS Inc.(ROBROS公司)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 VCA框架通过视觉点击交互替代文本指令,实现目标模糊环境中分割物体的精确操控,提升机器人操作的准确性和实用性。

Comments Submitted to UR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21161 2026-02-25 cs.RO 70%

ActionReasoning: Robot Action Reasoning in 3D Space with LLM for Robotic Brick Stacking

动作推理:利用LLM进行三维空间中的机器人动作推理以实现积木堆叠

Guangming Wang, Qizhen Ying, Yixiong Jing, Olaf Wysocki, Brian Sheil

机构 * CV4DT, CSIC, Department of Engineering, University of Cambridge(CV4DT、CSIC、工程系、剑桥大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出ActionReasoning框架,利用LLM进行三维空间中的动作推理,实现稳定积木堆叠,提升机器人操作的泛化能力。

Comments 8 pages, 5 figures, accepted by the 2026 IEEE International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19260 2026-02-24 cs.RO 70%

The Price Is Not Right: Neuro-Symbolic Methods Outperform VLAs on Structured Long-Horizon Manipulation Tasks with Significantly Lower Energy Consumption

价格并不合理:神经符号方法在结构化长周期操作任务中优于VLA,且能耗显著更低

Timothy Duggan, Pierrick Lorang, Hong Lu, Matthias Scheutz

机构 * Human-Robot Interaction Lab, Tufts University(Tufts大学人机交互实验室) AIT Austrian Institute of Technology GmbH(奥地利技术研究所)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 神经符号方法在结构化长周期操作任务中表现优于VLA,且能耗更低。

Comments Accepted at the 2026 IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16710 2026-02-19 cs.RO 70%

EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data

EgoScale:利用多样化的视点人类数据进行规模化灵巧操作

Ruijie Zheng, Dantong Niu, Yuqi Xie, Jing Wang, Mengda Xu, Yunfan Jiang, Fernando Castañeda, Fengyuan Hu, You Liang Tan, Letian Fu, Trevor Darrell, Furong Huang, Yuke Zhu, Danfei Xu, Linxi Fan

机构 * NVIDIA University of California, Berkeley(加州大学伯克利分校) University of Maryland(马里兰大学)

专题命中 VLA模型 :vision language action(abstract);VLA(abstract);分类 cs.RO

AI总结 EgoScale通过大规模视点人类数据训练视觉语言动作模型,实现高效的灵巧操作转移,提升机器人任务成功率54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01843 2026-02-18 cs.RO 70%

MoIRA: Modular Instruction Routing Architecture for Multi-Task Robotics

MoIRA:多任务机器人中的模块化指令路由架构

Dmytro Kuzmenko, Nadiya Shvai

机构 * Department of Multimedia Systems, National University of Kyiv-Mohyla Academy(多媒体系统系,基尔夫学院国家大学) Department of Mathematics, National University of Kyiv-Mohyla Academy(数学系,基尔夫学院国家大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 MoIRA是一种模块化指令路由架构,通过外部文本路由器协调专家,实现高效多任务机器人系统。

Comments Updated to reflect the final accepted version published in Neurocomputing

Journal ref Neurocomputing, vol. 674, 132962, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02456 2026-02-17 cs.RO 70%

InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation

InternVLA-A1:统一理解、生成和行动以实现机器人操作

Junhao Cai, Zetao Cai, Jiafei Cao, Yilun Chen, Zeyu He, Lei Jiang, Hang Li, Hengjie Li, Yang Li, Yufei Liu, Yanan Lu, Qi Lv, Haoxiang Ma, Jiangmiao Pang, Yu Qiao, Zherui Qiu, Yanqing Shen, Xu Shi, Yang Tian, Bolun Wang, Hanqing Wang, Jiaheng Wang, Tai Wang, Xueyuan Wei, Chao Wu, Yiman Xie, Boyang Xing, Yuqiang Yang, Yuyin Yang, Qiaojun Yu, Feng Yuan, Jia Zeng, Jingjing Zhang, Shenghan Zhang, Shi Zhang, Zhuoma Zhaxi, Bowen Zhou, Yuanzhen Zhou, Yunsong Zhou, Hongrui Zhu, Yangkun Zhu, Yuchen Zhu

机构 * InternVLA-A1 Team(InternVLA-A1团队)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 InternVLA-A1通过统一的Transformer架构,结合语义理解和动态预测能力,提升了机器人操作任务的性能。

Comments Homepage: https://internrobotics.github.io/internvla-a1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13086 2026-02-16 cs.RO 70%

UniManip: General-Purpose Zero-Shot Robotic Manipulation with Agentic Operational Graph

UniManip: 通用目的零样本机器人操作的代理操作图

Haichao Liu, Yuanjiang Xue, Yuheng Zhou, Haoyuan Deng, Yinan Liang, Lihua Xie, Ziwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) Department of Automation, Tsinghua University, China(清华大学自动化系)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 UniManip通过双层代理操作图实现通用零样本机器人操作,结合高层任务协调与底层动态状态表示,提升无监督环境下的执行鲁棒性。

Comments 15 pages, 12 figures, 6 tables, project page: https://henryhcliu.github.io/unimanip

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12062 2026-02-13 cs.RO 70%

HoloBrain-0 Technical Report

HoloBrain-0 技术报告

Xuewu Lin, Tianwei Lin, Yun Du, Hongyu Xie, Yiwei Jin, Jiawei Li, Shijie Wu, Qingze Wang, Mengdi Li, Mengao Zhao, Ziang Li, Chaodong Huang, Hongzhe Bi, Lichao Huang, Zhizhong Su

机构 * Horizon Robotics

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 HoloBrain-0 提出了一种融合视觉、语言和动作的框架,通过预训练和后训练范式,在模拟和现实任务中取得领先性能,并开源完整生态系统促进机器人研究。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10983 2026-02-13 cs.RO 70%

Scaling World Model for Hierarchical Manipulation Policies

为分层操作策略扩展世界模型

Qian Long, Yueze Wang, Jiaxi Song, Junbo Zhang, Peiyan Li, Wenxuan Wang, Yuqi Wang, Haoyang Li, Shaoxuan Xie, Guocai Yao, Hanbo Zhang, Xinlong Wang, Zhongyuan Wang, Xuguang Lan, Huaping Liu, Xinghang Li

机构 * Xi’an Jiao Tong University(西安交通大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出分层VLA框架,利用大规模预训练世界模型提升机器人操作在分布外场景的泛化能力,实验显示性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10377 2026-02-12 cs.LG cs.CL 70%

Hardware Co-Design Scaling Laws via Roofline Modelling for On-Device LLMs

通过屋顶线建模为设备端大语言模型设计硬件协同缩放定律

Luoyang Sun, Jiwen Jiang, Yifeng Ding, Fengfa Li, Yan Song, Haifeng Zhang, Jian Ying, Lei Ren, Kun Zhan, Wei Chen, Yan Xie, Cheng Deng

机构 * AI Lab, The Yangtze River Delta Institution of Automation, Chinese Academy of Sciences(人工智能实验室,长江三角洲自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University College London(伦敦大学学院) Institution of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) The University of Edinburgh(爱丁堡大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.LG

AI总结 本文提出通过屋顶线建模为设备端大语言模型设计硬件协同缩放定律,通过训练170个模型建立架构与训练损失的缩放关系,实现准确度与延迟的直接对应,降低架构选择时间并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10093 2026-02-11 cs.RO 70%

UniVTAC: A Unified Simulation Platform for Visuo-Tactile Manipulation Data Generation, Learning, and Benchmarking

UniVTAC:一种用于视觉-触觉操作数据生成、学习和评估的统一仿真平台

Baijun Chen, Weijie Wan, Tianxing Chen, Xianda Guo, Congsheng Xu, Yuanyang Qi, Haojie Zhang, Longyan Wu, Tianling Xu, Zixuan Li, Yizhe Wu, Rui Li, Xiaokang Yang, Ping Luo, Wei Sui, Yao Mu

机构 * ScaleLab, Shanghai Jiao Tong University(上海交通大学ScaleLab) D-Robotics ViTai Robotics The University of Hong Kong(香港大学) Nanjing University(南京大学) Shenzhen University(深圳大学) Wuhan University(武汉大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 UniVTAC提出了一种统一的视觉-触觉数据生成平台,通过训练触觉中心的编码器和基准任务提升机器人操作的成功率。

Comments Website: https://univtac.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09973 2026-02-11 cs.RO 70%

RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation

RoboInter: 一种面向机器人操控的综合中间表示套件

Hao Li, Ziqin Wang, Zi-han Ding, Shuai Yang, Yilun Chen, Yang Tian, Xiaolin Hu, Tai Wang, Dahua Lin, Feng Zhao, Si Liu, Jiangmiao Pang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北航) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 RoboInter通过统一的中间表示套件,提升机器人操控中视觉-语言-动作系统的泛化能力和推理能力。

Comments Published to ICLR 2026, 69 pages, 40 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09765 2026-02-11 cs.RO 70%

NavDreamer: Video Models as Zero-Shot 3D Navigators

NavDreamer: 视频模型作为零样本三维导航器

Xijie Huang, Weiqi Gai, Tianyue Wu, Congyu Wang, Zhiyang Liu, Xin Zhou, Yuze Wu, Fei Gao

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 NavDreamer利用视频模型实现零样本三维导航,通过生成视频模型作为语言指令与导航轨迹的接口,结合时空信息和物理动态,实现强大泛化能力。

Comments Work in the progress. 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07541 2026-02-10 cs.RO 70%

Differentiate-and-Inject: Enhancing VLAs via Functional Differentiation Induced by In-Parameter Structural Reasoning

区分与注入:通过参数结构推理诱导的功能区分来增强VLAs

Jingyi Hou, Leyu Zhou, Chenchen Jing, Jinghan Yang, Xinbo Yu, Wei He

机构 * University of Science(科学大学) Zhejiang University of Technology(浙江工业大学) Technology University(技术大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 iSTAR通过参数结构推理诱导功能区分,提升VLA模型在任务分解和任务变化下的可靠性与成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05325 2026-02-10 cs.RO 70%

RoboPaint: From Human Demonstration to Any Robot and Any View

RoboPaint:从人类示范到任何机器人和任何视角

Jiacheng Fan, Zhiyue Zhao, Yiqian Zhang, Chao Chen, Peide Wang, Hengdi Zhang, Zhengxue Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 RoboPaint通过真实-仿真-真实数据流程,将人类示范转化为机器人训练数据,实现高效、低成本的复杂灵巧操作训练。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01100 2026-02-10 cs.RO 70%

StreamVLA: Breaking the Reason-Act Cycle via Completion-State Gating

StreamVLA: 通过完成状态门控打破原因-行动循环

Tongqing Chen, Hang Wu, Jiasen Wang, Xiaotao Li, Lu Fang

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) Shanghai University(上海大学) Wuhan University(武汉大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 StreamVLA通过完成状态门控机制,实现高效机器人操作,减少推理延迟并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16793 2026-02-05 cs.RO 70%

PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence

PhysBrain: 人眼视角数据作为视觉语言模型到物理智能的桥梁

Xiaopeng Lin, Shijie Lian, Bin Yu, Ruoqi Yang, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Yurun Jin, Yukun Shi, Jiyan He, Cong Huang, Bojun Cheng, Kai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 PhysBrain通过将人类眼动视频转化为多级具身监督,提升机器人在眼动感知和长期规划中的能力,实现从人类视角到机器人控制的有效迁移。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03153 2026-02-04 cs.RO 70%

When Attention Betrays: Erasing Backdoor Attacks in Robotic Policies by Reconstructing Visual Tokens

当注意力背叛时:通过重建视觉标记在机器人策略中消除后门攻击

Xuetao Li, Pinhan Fu, Wenke Huang, Nengyuan Pan, Songhua Yang, Kaiyan Zhao, Guancheng Wan, Mengde Li, Jifeng Xuan, Miao Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Faculty of Artificial Intelligence, Hubei University(湖北大学人工智能学院) Institute of Technological Sciences, Wuhan University(武汉大学技术科学研究院) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 Bera通过重建视觉标记消除机器人策略中的后门攻击,无需重新训练模型即可有效防御后门风险。

Comments ICRA2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02864 2026-02-04 cs.RO 70%

Accelerating Structured Chain-of-Thought in Autonomous Vehicles

加速自动驾驶中的结构化链式推理

Yi Gu, Yan Wang, Yuxiao Chen, Yurong You, Wenjie Luo, Yue Wang, Wenhao Ding, Boyi Li, Heng Yang, Boris Ivanovic, Marco Pavone

机构 * NVIDIA University of Southern California(南加州大学) Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 FastDriveCoT通过并行解码方法加速自动驾驶中的结构化链式推理,实现3-4倍的生成速度提升和端到端延迟的显著降低,同时保持推理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00557 2026-02-03 cs.RO 70%

ConLA: Contrastive Latent Action Learning from Human Videos for Robotic Manipulation

ConLA:从人类视频中通过对比学习学习机器人操作

Weisheng Dai, Kai Lan, Jianyi Zhou, Bo Zhao, Xiu Su, Junwen Tong, Weili Guan, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) State Key Laboratory of Mobile Network and Mobile Multimedia Technology, Shenzhen(移动网络与移动多媒体技术国家重点实验室(深圳)) ZTE Corporation(中兴通讯) Shanghai Jiao Tong University(上海交通大学) Central South University(中南大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 ConLA通过对比学习从人类视频中学习机器人操作,有效解决潜在表示中的捷径学习问题,提升机器人学习的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21506 2026-01-30 cs.RO cs.SY eess.SY 70%

IROS: A Dual-Process Architecture for Real-Time VLM-Based Indoor Navigation

IROS: 一种用于实时基于视觉语言模型的室内导航的双过程架构

Joonhee Lee, Hyunseung Shin, Jeonggil Ko

机构 * Yonsei University(延世大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 IROS是一种结合视觉语言模型上下文推理与轻量级感知模块的双过程架构,实现低延迟的室内导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19859 2026-01-30 cs.RO 70%

Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation

统一感知与行动:一种融合模态的管道,具有隐式视觉推理链的机器人行动生成

Xiangkai Ma, Lekai Xing, Han Zhang, Wenzhong Li, Sanglu Lu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 VITA通过融合视觉和动作的共享潜在空间,实现机器人行动生成的统一感知与行动,提升了多个任务的成功率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20262 2026-01-29 cs.RO 70%

Shallow-π: Knowledge Distillation for Flow-based VLAs

Shallow-π:基于流的视觉-语言-动作模型的知识蒸馏

Boseong Jeon, Yunho Choi, Taehan Kim

机构 * Samsung Research South Korea(三星韩国研究)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 Shallow-π通过知识蒸馏显著减少基于流的VLA模型的transformer深度,实现更快的推理速度和更高的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18323 2026-01-27 cs.RO 70%

TC-IDM: Grounding Video Generation for Executable Zero-shot Robot Motion

TC-IDM:为可执行零样本机器人运动实现视频生成

Weishi Mi, Yong Bao, Xiaowei Chi, Xiaozhu Ju, Zhiyuan Qin, Kuangzhi Ge, Kai Tang, Peidong Jia, Shanghang Zhang, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 TC-IDM通过工具中心逆动力学模型实现视频生成,提升机器人零样本任务的执行能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11475 2026-01-19 cs.CV 70%

Generative Scenario Rollouts for End-to-End Autonomous Driving

生成场景回放用于端到端自动驾驶

Rajeev Yasarla, Deepti Hegde, Shizhong Han, Hsin-Pai Cheng, Yunxiao Shi, Meysam Sadeghigooghari, Shweta Mahajan, Apratim Bhattacharyya, Litian Liu, Risheek Garrepalli, Thomas Svantesson, Fatih Porikli, Hong Cai

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 GeRo通过自回归回放策略,结合规划与生成,提升自动驾驶系统的长期推理和多代理规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24210 2026-01-12 cs.RO 70%

GR-Dexter Technical Report

GR-Dexter 技术报告

Ruoshi Wen, Guangzeng Chen, Zhongren Cui, Min Du, Yang Gou, Zhigang Han, Liqun Huang, Mingyu Lei, Yunfei Li, Zhuohang Li, Wenlei Liu, Yuxiao Liu, Xiao Ma, Hao Niu, Yutao Ouyang, Zeyu Ren, Haixin Shi, Wei Xu, Haoxiang Zhang, Jiajun Zhang, Xiao Zhang, Liwei Zheng, Weiheng Zhong, Yifei Zhou, Zhengming Zhu, Hang Li

机构 * ByteDance Seed(字节跳动种子)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 GR-Dexter 提出了一种综合框架,通过紧凑机械手、双臂遥控系统和训练配方,实现基于VLA的通用灵巧手机器人操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20166 2025-12-24 cs.RO 70%

LoLA: Long Horizon Latent Action Learning for General Robot Manipulation

LoLA:面向通用机器人操作的长周期隐式动作学习

Xiaofan Wang, Xingyu Gao, Jianlong Fu, Zuolei Li, Dean Fortier, Galen Mullins, Andrey Kolobov, Baining Guo

机构 * Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学) Microsoft Research(微软研究院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 LoLA通过整合长期多视角观察和机器人本体感觉,实现长周期、语言引导的机器人操作任务,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏