arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 566 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 566 篇

2604.07430 2026-04-10 cs.CV 57%

HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents

HY-Embodied-0.5:面向现实世界代理的具身基础模型

Tencent Robotics X, HY Vision Team, :, Xumin Yu, Zuyan Liu, Ziyi Wang, He Zhang, Yongming Rao, Fangfu Liu, Yani Zhang, Ruowen Zhao, Oran Wang, Yves Liang, Haitao Lin, Minghui Wang, Yubo Dong, Kevin Cheng, Bolin Ni, Rui Huang, Han Hu, Zhengyou Zhang, Linus, Shunyu Yao

机构 * Tencent Robotics X(腾讯机器人X实验室) HY Vision Team(HY视觉团队)

专题命中 机器人基础模型 :embodied agent(abstract);分类 cs.CV

AI总结 本文提出HY-Embodied-0.5,旨在提升现实世界代理的具身智能能力,通过混合Transformer架构和迭代自演化训练方法,实现高效和强大的模型变体,验证了其在多个基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12710 2026-04-10 cs.RO 57%

Reflection-Based Task Adaptation for Self-Improving VLA

基于反射的任务适应用于自我改进的VLA

Baicheng Li, Dong Wu, Zike Yan, Xinchen Liu, Lusong Li, Zecui Zeng, Hongbin Zha

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) JD Explore Academy(京东探索研究院) AIR, Tsinghua University(清华大学智能产业研究院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本文提出反射式自我适应框架,通过双路径架构实现快速自主任务适应,结合失败驱动的强化学习与成功驱动的质量引导微调,提升机器人在复杂任务中的适应效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20309 2026-04-08 cs.LG 57%

QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models

QuantVLA: 用于视觉-语言-动作模型的可扩展后训练量化

Jingxuan Zhang, Yunta Hsieh, Zhongwei Wan, Haokun Lin, Xin Wang, Ziqi Wang, Yingtie Lei, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) University of Michigan(密歇根大学) City University of Hong Kong(香港城市大学)

专题命中 机器人基础模型 :embodied agent(abstract);分类 cs.LG

AI总结 QuantVLA是一种无需训练的后训练量化框架,首次应用于视觉-语言-动作系统,并成功量化了扩散变换器(DiT)动作头,通过三种可扩展组件实现了高效的低比特量化,显著提升任务成功率并降低内存消耗。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02965 2026-04-06 cs.RO cs.CL 57%

Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA

开环规划,闭环验证:VLA的推测验证

Zihua Wang, Zhitao Lin, Ruibo Li, Yu Zhang, Xu Yang, Siya Mi, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Nanyang Technological University(南洋理工大学) School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) Purple Mountain Laboratories(紫金山实验室)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本文提出SV-VLA框架,结合高效开环长周期规划与轻量闭环在线验证,提升VLA在动态环境中的效率与可靠性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11404 2026-03-31 cs.RO 57%

ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models

ACoT-VLA:面向视觉-语言-动作模型的行动链式推理

Linqing Zhong, Yi Liu, Yifei Wei, Ziyu Xiong, Maoqing Yao, Si Liu, Guanghui Ren

机构 * Beihang University(北京航空航天大学) AgiBot

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本文提出ACoT-VLA,通过在动作空间中直接进行推理,改进视觉-语言-动作模型的行动生成,引入显式和隐式动作推理器,实验证明其在真实和仿真环境中的优越性。

Comments Accepted by Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26360 2026-03-30 cs.RO 57%

Realtime-VLA V2: Learning to Run VLAs Fast, Smooth, and Accurate

Realtime-VLA V2:学习以快速、平滑和准确地运行VLAs

Chen Yang, Yucheng Hu, Yunchao Ma, Yunhuan Yang, Jing Tan, Haoqiang Fan

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

AI总结 本文提出Realtime-VLA V2,通过校准、规划与控制及学习方法,实现机器人在真实任务中高速、高精度和高灵活性的VLAs运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14117 2026-03-10 cs.RO 57%

GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model

GeoAware-VLA: 基于隐式几何的视觉-语言-动作模型

Ali Abouzeid, Malak Mansour, Qinbo Sun, Zezhou Sun, Dezhen Song

机构 * Department of Robotics, Mohamed bin Zayed University of Artificial Intelligence(机器人系,Mohamed bin Zayed人工智能大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

AI总结 GeoAware-VLA通过整合几何先验提升视觉-语言-动作模型的视角不变性,显著提高零样本泛化能力,并在现实机器人平台中取得显著效果。

Comments Under Review, Project Page https://alisharey.github.io/GeoAware-VLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01700 2026-03-03 cs.RO 57%

TacMamba: A Tactile History Compression Adapter Bridging Fast Reflexes and Slow VLA Reasoning

TacMamba: 一种连接快速反射与慢速VLA推理的触觉历史压缩适配器

Zhenan Wang, Yanzhe Wang, Meixuan Ren, Peng Li, Yang Liu, Yifei Nie, Limin Long, Yun Ye, Xiaofeng Wang, Zhen Zhu, Huixu Dong

机构 * Zhejiang University(浙江大学) GigaAI Harbin Institute of Technology(哈尔滨工业大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 TacMamba通过触觉历史压缩器和双阶段训练策略,实现高频率触觉数据与低频视觉推理的高效融合,提升实时任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21736 2026-02-26 cs.RO 57%

Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild

联合对齐的潜在动作:迈向大规模野外VLA预训练

Hao Luo, Ye Wang, Wanpeng Zhang, Haoqi Yuan, Yicheng Feng, Haiweng Xu, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 JALA通过联合对齐的潜在动作预训练框架,提升从人类数据中大规模预训练视觉-语言-动作模型的效率与性能。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18397 2026-02-23 cs.RO 57%

How Fast Can I Run My VLA? Demystifying VLA Inference Performance with VLA-Perf

我如何快速跑动我的VLA?通过VLA-Perf解密VLA推理性能

Wenqi Jiang, Jason Clemons, Karu Sankaralingam, Christos Kozyrakis

机构 * NVIDIA Research(英伟达研究)

专题命中 机器人基础模型 :embodied AI(abstract);分类 cs.RO

AI总结 本文通过VLA-Perf分析VLA模型的推理性能,探讨了模型设计和部署对实时推理的影响,提出了15项关键结论以指导未来VLA系统设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13710 2026-02-17 cs.LG 57%

HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models

HBVLA: 推动面向视觉-语言-动作模型的1位后训练量化

Xin Yan, Zhenglin Wan, Feiyang Ye, Xingrui Yu, Hangyu Du, Yang You, Ivor Tsang

专题命中 机器人基础模型 :robotic(abstract);分类 cs.LG

AI总结 HBVLA通过改进的二值化框架,实现对视觉-语言-动作模型的高效1位量化,保留了高精度性能,适用于资源受限的机器人部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11250 2026-01-19 cs.RO 57%

VLAgents: A Policy Server for Efficient VLA Inference

VLAgents: 一种高效的VLA推理政策服务器

Tobias Jülg, Khaled Gamal, Nisarga Nilavadi, Pierre Krack, Seongjin Bien, Michael Krawez, Florian Walter, Wolfram Burgard

机构 * University of Technology Nuremberg(图恩大学) Technical University of Munich(慕尼黑技术大学)

专题命中 机器人基础模型 :robotics(abstract);分类 cs.RO

AI总结 VLAgents是一种高效的VLA推理政策服务器,通过统一协议和上下文适应通信层,提升了机器人中VLAs的部署效率和性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03044 2026-01-07 cs.RO 57%

SOP: A Scalable Online Post-Training System for Vision-Language-Action Models

SOP:一种可扩展的在线后训练系统用于视觉-语言-动作模型

Mingjie Pan, Siyuan Feng, Qinglin Zhang, Xinchen Li, Jianheng Song, Chendi Qu, Yi Wang, Chuankang Li, Ziyu Xiong, Zhi Chen, Yi Liu, Jianlan Luo

机构 * Agibot Research(Agibot研究机构) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 SOP系统通过在线分布式后训练提升视觉-语言-动作模型在现实世界中的性能,实现高效可靠的多任务适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11960 2025-12-23 cs.RO 57%

Human Centric General Physical Intelligence for Agile Manufacturing Automation

以人为中心的敏捷制造通用物理智能

Sandeep Kanta, Mehrdad Tavassoli, Varun Teja Chirkuri, Venkata Akhil Kumar, Santhi Bharath Punati, Praveen Damacharla, Sunny Katyara

机构 * Northeastern University(东北大学) Bmade Robotics(Bmade机器人)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

AI总结 本文探讨了通过VLA模型实现通用物理智能在敏捷制造中的应用,系统回顾了最新进展并提出未来研究方向。

Comments Advanced Engineering Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09927 2025-12-11 cs.RO 57%

Token Expand-Merge: Training-Free Token Compression for Vision-Language-Action Models

令牌扩展-合并:面向视觉-语言-动作模型的免训练 令牌压缩

Yifan Ye, Jiaqi Ma, Jun Cen, Zhihe Lu

机构 * College of Science and Engineering, Hamad Bin Khalifa University(1 科学与工程学院,哈马德·本·卡西姆大学) Mohamed bin Zayed University of Artificial Intelligence(2 摩萨·本·扎耶德人工智能大学) College of Computer Science and Technology, Zhejiang University(3 计算机科学与技术学院,浙江大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

AI总结 TEAM-VLA通过动态令牌扩展与合并机制,实现无需训练的视觉-语言-动作模型高效推理,提升速度并保持任务性能。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12405 2025-11-18 cs.CV 57%

VLA-R: Vision-Language Action Retrieval toward Open-World End-to-End Autonomous Driving

Hyunki Seong, Seongwoo Moon, Hojin Ahn, Jehun Kang, David Hyunchul Shim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.CV

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10560 2025-11-17 cs.CV 57%

OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer

Haosong Peng, Hao Li, Yalun Dai, Yushi Lan, Yihang Luo, Tianyu Qi, Zhengshen Zhang, Yufeng Zhan, Junfei Zhang, Wenchao Xu, Ziwei Liu

机构 * HKUST(香港科技大学) NTU(国立台湾大学) SYSU(南方科技大学) NUS(国立新加坡大学) Alibaba Group(阿里巴巴集团)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.CV

Comments Project Page: https://livioni.github.io/OmniVGGT-official/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16617 2025-10-21 cs.RO 57%

MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation

Ruihan Zhao, Tyler Ingebrand, Sandeep Chinchali, Ufuk Topcu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24768 2025-09-30 cs.RO 57%

IA-VLA: Input Augmentation for Vision-Language-Action models in settings with semantically complex tasks

Eric Hannus, Miika Malin, Tran Nguyen Le, Ville Kyrki

机构 * Intelligent Robotics Group at the Department of Electrical Engineering and Automation, School of Electrical Engineering, Aalto University(Aalto大学电气工程学院电气工程与自动化系智能机器人组) Biomimetics and Intelligent Systems Group at the Faculty of Information Technology and Electrical Engineering, University of Oulu(奥卢大学信息科技与电气工程学院仿生学与智能系统组) Section of Mechanical Technology at the Department of Engineering Technology and Didactics, Technical University of Denmark(丹麦技术大学工程技术与教学系机械技术部门)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

Comments Under review for ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24559 2025-09-30 cs.LG 57%

Emergent World Representations in OpenVLA

Marco Molinari, Leonardo Nevali, Saharsha Navani, Omar G. Younis

机构 * London School of Economics(伦敦经济学院) ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学) Department of Computer Science(计算机科学系) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 机器人基础模型 :world model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09372 2025-09-23 cs.RO 57%

VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model

Yihao Wang, Pengxiang Ding, Lingxiao Li, Can Cui, Zirui Ge, Xinyang Tong, Wenxuan Song, Han Zhao, Wei Zhao, Pengxu Hou, Siteng Huang, Yifan Tang, Wenhui Wang, Ru Zhang, Jianyi Liu, Donglin Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Westlake University(西湖大学) Zhejiang University(浙江大学) OpenHelix Team(OpenHelix团队) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

Comments 28 pages; Project page: https://vla-adapter.github.io/; Github: https://github.com/OpenHelix-Team/VLA-Adapter; HuggingFace: https://huggingface.co/VLA-Adapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16640 2025-05-23 cs.CR cs.AI 57%

BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization

Xueyang Zhou, Guiyao Tie, Guowen Zhang, Hechang Wang, Pan Zhou, Lichao Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Lehigh University(莱斯大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI

Comments 19 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01045 2026-07-02 astro-ph.IM 新提交 50%

Studying Ionosphere Using SKA-Low and SKA-Mid

利用SKA-Low和SKA-Mid研究电离层

Abhirup Datta, Samit Kumar Pal, Sarvesh Mangla, Bhuvnesh Brawar, Sumanjit Chakraborty, Sudipta Sasmal, Anshuman Tripathi

专题命中 机器人基础模型 :navigation(abstract)

AI总结 本文通过对比uGMRT、VLA、MWA和LOFAR的观测,量化电离层相位波动、位置偏移和闪烁效应,评估对校准和成像的影响,并预测SKA-Low和SKA-Mid的电离层效应。

Comments Published in Advancing Astrophysics with the SKA II (AASKAII), 2026 (arXiv:2606.20366). Report-no:AASKAII/Datta01. Advancing Astrophysics with the SKA II (AASKAII) outlines the transformative scientific advances that will be enabled by the SKA telescopes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03724 2026-06-03 cs.CR 50%

Same Weights, Different Robot: A Deployment Safety View of VLA Policies

相同权重,不同机器人:VLA策略的部署安全性视角

Jianwei Tai

专题命中 机器人基础模型 :robot policy(abstract)

AI总结 本文提出视觉-语言-动作(VLA)策略的部署安全性问题,通过形式化可执行策略规范,揭示相同检查点因动作元数据不匹配导致执行不等价,并给出量化漂移的证书方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09001 2026-03-11 astro-ph.IM 50%

Correcting Ionospheric Faraday Rotation for the VLA and MeerKAT

校正VLBA和MeerKAT的电离层法拉第旋转

Richard A. Perley, Bryan J. Butler, Eric W. Greisen, Benjamin V. Hugo, Evangelia Tremou, A. G. Willis

专题命中 机器人基础模型 :navigation(abstract)

AI总结 本文通过比较传统方法与ALBUS软件,校正VLBA和MeerKAT的电离层法拉第旋转测量误差,提高观测精度。

Comments Accepted for publication in ApJS

详情

展开后加载摘要…

URL PDF HTML 收藏
astro-ph/0609582 2010-05-12 astro-ph 50%

The short-hard GRB 051103: Observations and implications for its nature

E. O. Ofek, S. R. Kulkarni, E. Nakar, S. B. Cenko, P. B. Cameron, D. A. Frail, A. Gal-Yam, A. M. Soderberg, D. B. Fox

专题命中 机器人基础模型 :robotic(abstract)

Comments 5 pages, ApJ in Press, to appear on Nov 10, 2006, vol 651

Journal ref Astrophys.J.652:507-511,2006

详情

展开后加载摘要…

URL PDF HTML 收藏