arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 544 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 544 篇

2606.15631 2026-06-16 cs.RO cs.AI 新提交 91%

Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time

检索,不重新训练:在测试时将视觉语言动作模型扩展到新任务

Jeongeun Park, Juhan Park, Taekyung Kim, Sungjoon Choi, Dongyoon Han, Sangdoo Yun

机构 * NAVER AI Lab(NAVER AI实验室) Korea University(高丽大学)

专题命中 VLA模型 :action model(title,abstract);vision language action(title);VLA(abstract,abstract_cn);vision-language-action(abstract)

AI总结 提出检索增强策略,通过一次训练冻结模型,部署时仅添加检索数据即可适应新任务,无需逐任务微调,在跨本体泛化中优于基线。

Comments https://recap-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05730 2026-08-07 cs.HC 新提交 90%

SpaceVLA: Spatially Grounded VLA for Robotic Manipulation with User-Authored Grasp and Place Anchors

SpaceVLA:用于机器人操作的空间 grounding VLA,支持用户编写的抓取与放置锚点

Daniia Zinniatullina, Iaroslav Kolomiets, Mikhail Konenkov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract)

AI总结 本研究针对VLA模型操作时缺乏显式空间意图的问题,提出视觉意图锚点的XR流程,通过微调OpenVLA-7B的SpaceVLA模型,在Unity试验中实现91.25%抓取成功率,完成机器人抓取放置任务。

Comments A poster for the ISMAR conference, 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21470 2026-06-23 cs.RO cs.CV cs.LG 新提交 90%

ASCII Art Turns LLMs into VLA Controllers

ASCII艺术将LLMs转化为VLA控制器

Yitao Jiang, Roy Xing, Luyang Zhao, Brian Plancher, Muhao Chen, Devin Balkcom

机构 * Dept. of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) Dept. of Electrical and Computer Engineering, Clemson University(克莱姆森大学电气与计算机工程系) Dept. of Mechanical and Aerospace Engineering, University of Houston(休斯顿大学机械与航空航天工程系)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.CV、cs.LG

AI总结 通过ASCII表示将视觉观察渲染为文本输入,仅使用文本LLM即可实现VLA式控制,在2D操作任务中表现良好,提供轻量级可解释的模态桥接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02197 2026-08-04 cs.RO 新提交 90%

Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models

关注关键区域:面向视觉-语言-动作模型的自适应视觉细化

Jin Cui, Yanbin Hu, Xinyue Long, Linkai Li, Boran Zhao, Pengju Ren

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);action model(title);分类 cs.RO

AI总结 针对VLA模型视觉表示不可靠的问题,提出AtVLA框架,结合注意力校正与不确定性门控局部细化,在多基准测试中显著提升机器人操作成功率且计算开销可控。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01573 2026-08-04 cs.RO 新提交 90%

Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models

揭示并缓解视觉-语言-动作模型中的位置盲区

Dongdong An, Pengjie Zhao, Yihao Huang, Wenbing Tang, Ziming He, Jiayi Zhu, Jifeng Ning, Qin Zhao

机构 * Shanghai Normal University(上海师范大学) East China Normal University(华东师范大学) Northwest A&F University(西北农林科技大学) Xidian University(西安电子科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 针对视觉-语言-动作模型存在的位置盲区问题,提出两阶段黑箱框架,通过网格划分与单侧对数似然比检验定位盲区,再经LoRA微调缓解,在五个模型上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05396 2026-07-07 cs.CV cs.AI cs.LG cs.RO 新提交 90%

From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model

从固定相机到自由相机:无需标定的视图鲁棒视觉-语言-动作模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 针对真实机器人部署中相机位姿变动问题,提出CamVLA模型,解耦操控控制与相机几何,实现无标定视图鲁棒的机器人任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04637 2026-07-07 cs.CV 新提交 90%

PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving

PixelPilot:用于端到端自动驾驶的可扩展视觉-语言-动作模型

Pin Tang, Guoqing Wang, Xiangxuan Ren, Zhongdao Wang, Guodongfang Zhao, Bailan, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, Institute of AI, Shanghai Jiao Tong University(教育部人工智能重点实验室,上海交通大学人工智能研究院) Central Research Institute, Huawei(华为中央研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有视觉-语言-动作模型在自动驾驶场景中数据可扩展性有限等问题,提出PixelPilot,采用解耦规划和提升范式,通过知识灌输策略学习,提升了模型性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交 90%

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);embodied foundation model(abstract)

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23574 2026-06-23 cs.CR cs.RO 新提交 90%

A Watermark for Vision-Language-Action and World Action Models

视觉-语言-动作与世界动作模型的水印技术

Yule Liu, Shuai Liu, Jiaheng Wei, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学) Xi’an Jiao Tong University(西安交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出密钥潜在来源验证方法,通过替换高斯噪声种子为密钥种子为机器人策略模型添加水印,在保持任务性能的同时实现版权保护,并能抵抗输出移除和权重修改攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22794 2026-06-23 cs.RO 新提交 90%

UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models

UniFS:面向视觉-语言-动作模型的统一快慢层次架构

Lin Sun, Zhiwei Guan, Conglin Wang, Zihong Chen, Jianhai Yu, Zongsheng Li, Boyong He, Tao Sun, Jiale Cao, Lige Liu

机构 * Tianjin University(天津大学) Yiwu Research Institute of Fudan University(复旦大学义乌研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出UniFS统一快慢层次架构,通过分层更新频率、潜向量反转和多级监督策略,解决快慢双系统视觉-语言-动作模型中的频率困境和信息耦合问题,在LIBERO上实现98.3%成功率并提速2.1倍。

Comments Code is opensourced at https://github.com/linsun449/UniFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19565 2026-06-19 cs.CV 新提交 90%

Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models

Mix-QVLA:任务证据感知的视觉-语言-动作模型混合精度量化

Navin Ranjan, Andreas Savakis

机构 * Rochester Institute of Technology(罗彻斯特理工学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);action model(title);分类 cs.CV

AI总结 提出Mix-QVLA框架,通过任务证据感知的混合精度后训练量化,在保持任务性能的同时大幅降低VLA模型的内存和计算开销,在LIBERO上实现4.1GB内存和1.52倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15285 2026-06-16 cs.RO 新提交 90%

Acting While Understanding: Asynchronous Semantic-Action Decoupling for Real-Time Vision-Language-Action Models

理解中行动:面向实时视觉-语言-动作模型的异步语义-动作解耦

Shenhao Yan, Ge Wang, Qi Liu, Weilin Meng, Jiahao Yang, Chengsi Yao, Fan Feng, Xiaoguang Ma, Yiming Zhao, Yatong Han

机构 * Northeastern University(东北大学) Ising AI CUHK-Shenzhen(香港中文大学(深圳))

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出异步语义-动作解耦框架,分离VLAs中的语义理解与动作生成,通过低频率语义更新和高频率动作推理实现高频闭环控制,在LIBERO和真实机器人上验证了高达35.6Hz的动作模块吞吐率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09009 2026-06-09 cs.CV 新提交 90%

Scaling by Diversified Experience for Vision-Language-Action Models

通过多样化经验扩展视觉-语言-动作模型

Leiyu Wang, Zhaofengnian Wang, Xueqi Li, Luoyi Fan, Cewu Lu, Nanyang Ye

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出SyVLA模型,通过意图解耦算法和相似样本引导的强化学习管道,解决视觉-语言-动作模型在推理与控制耦合及策略优化不稳定问题,在真实机器人任务中取得更高成功率和泛化能力。

Comments ICML 2026, SyVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04246 2026-08-06 cs.RO cs.CV 新提交 90%

SAFECAST: Robust Failure Detection for VLA Policies with Contrast-Set Training and Calibration

SAFECAST:结合对比集训练与校准的VLA策略鲁棒故障检测

Harshitha Rajaprakash, Aditeya Prajapati, Rong Xue, Abrar Anwar, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 SAFECAST 借助对比集扰动优化隐状态探测器训练与校准,在真实和模拟实验中显著提升 VLA 策略故障检测 ROC-AUC,且视觉与语言对比集扰动结合时效果最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00391 2026-08-04 cs.RO cs.AI 新提交 90%

The Gate, Not the Cache: Gate Provenance Bounds the Closed-Loop Reliability of Training-Free VLA Token Skipping

门控而非缓存:门控溯源界定无训练VLA令牌跳过的闭环可靠性

Qi Luo, Shuaijun Liu, Hao Zhao, Kunlin Li, Xiaobo Wang, Ningxing Su, Dongsheng Wang, Yun Chen

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.AI

AI总结 本研究针对无训练VLA令牌跳过的闭环可靠性问题,提出动作松弛刷新方法,集成后修复门控自采集导致的性能崩溃,服务延迟降低18%-22%。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17157 2026-07-21 cs.CV cs.AI 新提交 90%

VLA-ReID: Video-Level Association for Re-Identification in Multi-Object Tracking with Highly Similar Objects

VLA-ReID:具有高度相似对象的多目标跟踪中用于重新识别的视频级关联

Yanrong Qin, Xiaoyan Cao, Yao Yao

机构 * Glasgow College, University of Electronic Science and Technology of China(电子科技大学格拉斯哥学院) Key Laboratory for Urban Habitat Environmental Science and Technology, School of Environment and Energy, Peking University Shenzhen Graduate School(北京大学深圳研究生院环境与能源学院城市人居环境科学与技术重点实验室) School of Management Science and Real Estate, Chongqing University(重庆大学管理科学与房地产学院)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.CV、cs.AI

AI总结 针对多目标跟踪中对象外观相似时身份保持难的问题,提出VLA-ReID方法,将重新识别建模为视频级关联,通过聚合历史轨迹特征等进行全局关联优化,实验显示该方法有效提升多项指标并减少身份切换。

Comments 11 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08974 2026-07-13 cs.RO cs.AI 新提交 90%

CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding

CLAP:通过语言-动作基础实现从视觉语言模型到视觉语言动作模型的直接适配

Yuri Ishitoya, Jeremy Siburian, Masashi Hamaya, Kuniaki Saito, Cristian C. Beltran-Hernandez, Mai Nishimura

机构 * Ochanomizu University(御茶水女子大学) University of Tokyo(东京大学) OMRON SINIC X Corp(欧姆龙(中国)有限公司)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 研究如何将预训练视觉语言模型直接转换为视觉语言动作模型,核心方法是提出CLAP,通过在数字动作序列前加自然语言描述来解决输出分布不匹配问题,单轮微调效果良好,还将发布多尺度紧凑VLA家族助力能力转移分析。

Comments Project website: https://omron-sinicx.github.io/clap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06655 2026-07-10 cs.RO cs.LG 新提交 90%

Pelican-VLA 0.5: Attending Before Acting Benefits Generalization

Pelican-VLA 0.5:行动前关注有益于泛化

Zeyuan Ding, Wenhai Liu, Yang Xu, Jiayu Hu, Yinda Chen, Yi Zhang, Yong Dai, Jian Tang, Xiaozhu Ju

机构 * Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京人形机器人创新中心(X-人形机器人))

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.LG

AI总结 研究展示了Pelican-VLA 0.5统一VLA模型,无需特定注释或微调就能实现注意力级泛化。其动作路径聚焦指令相关对象和区域,能力源于感知与动作间的可学习推理插槽,在不同场景和架构中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03182 2026-07-07 cs.RO cs.AI 新提交 90%

AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning

AnchorVLA:为视觉-语言-动作规划连接离散决策与连续轨迹

Qi Liu, Yabei Li, Hongsong Wang, Heng Zhang, Lei He

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与交通国家重点实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Meituan Inc.(美团公司) Dongfeng Motor Corporation(东风汽车公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 自动驾驶规划需将多种信息转化为连续轨迹,现有视觉-语言-动作(VLA)规划器有局限。提出AnchorVLA框架,用轨迹模式锚连接高层VLA推理与连续轨迹执行,提升效率、语义动作对齐和生成灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09572 2026-06-09 cs.RO cs.AI 新提交 90%

CT-VAM: A Cerebello-Thalamic-Inspired Vision-Action Model for Efficient Visuomotor Control

CT-VAM: 一种小脑-丘脑启发的视觉-动作模型用于高效视觉运动控制

Jiacheng Li, Yize Guo, Jiabin Guo, Qingchen Liu, Jiahu Qin

机构 * University of Science and Technology of China(中国科学技术大学) AIRLab, Department of Automation(自动化系AIRLab)

专题命中 VLA模型 :VLA(summary_cn,abstract);action model(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出CT-VAM模型,通过TARS条件注意力解码器融合异构输入,以68M参数实现与大型VLA模型相当的LIBERO成功率,并降低推理延迟,支持高频控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06403 2026-07-08 cs.RO 新提交 90%

From Foundation to Application: Improving VLA Models in Practice

从基础到应用:在实践中改进VLA模型

Wei Wu, Fangjing Wang, Fan Lu, He Sun, Shi Liu, Yunnan Wang, Yibin Yan, Yong Wang, Shuailei Ma, Xinyang Wang, Yibin Liu, Shuai Yang, Tianxiang Zhou, Kejia Zhang, Lei Zhou, Cheng Su, Nan Xue, Bin Tan, Han Zhang, Youchao Zhang, Fei Liao, Xing Zhu, Yujun Shen, Kecheng Zheng

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO

AI总结 针对VLA模型实验室与实际应用差距问题,提出LingBot-VLA 2.0。通过改进数据处理、扩展动作空间及预测动力学建模等方法,经GM-100基准测试验证,提升了模型跨实体长距离移动操作能力。

Comments Website: https://technology.robbyant.com/lingbot-vla-v2, Github: https://github.com/robbyant/lingbot-vla-v2, Checkpoints: https://huggingface.co/collections/robbyant/lingbot-vla-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04765 2026-08-06 cs.RO cs.AI cs.CV 新提交 90%

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models

用于视觉-语言-动作模型长程规划的显式语言记忆

Houze Xu, Jizhong Li, Ziyi Ye

机构 * Fudan University(复旦大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究针对视觉-语言-动作模型长程规划的挑战,提出带显式语言记忆模块的分层架构,经仿真与实机实验验证,可提升复杂长程任务的成功率、鲁棒性与决策可解释性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19399 2026-07-23 cs.LG cs.AI cs.CV 新提交 90%

Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models

在大规模视觉-语言-动作模型中利用离线监督实现高效且通用的强化学习

Dmitriy Poyarkov, Aleksei Staroverov, Aleksandr I. Panov

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 研究在大规模视觉-语言-动作模型中,通过将离线监督纳入强化学习,结合离线与在线训练优点,提升训练效率。经实验验证,该混合方法在保持强大分布外能力的同时,所需训练预算减半,实现效率与性能双赢。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17786 2026-07-21 cs.RO cs.AI cs.CR cs.LG 新提交 90%

Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models

推理是一把双刃剑:视觉-语言-动作模型中的架构与跨阶段鲁棒性

Tuan Duong Trinh, Naveed Akhtar, Basim Azam

机构 * University of Melbourne(墨尔本大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 研究视觉-语言-动作模型中添加推理步骤对模型鲁棒性的影响,通过在三个模型上进行实验,发现潜在迭代模型鲁棒性最差,推理输出监测在公平测试下失败,计划-行动一致性探测器在自适应攻击下效果不佳,为可行防御设定了前提条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13578 2026-06-16 cs.CL cs.AI cs.LG cs.MM cs.RO 新提交 90%

LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories

LabVLA:在科学实验室中落地视觉-语言-动作模型

Baochang Ren, Xinjie Liu, Xi Chen, Yanshuo Liu, Chenxi Li, Daqi Gao, Zeqin Su, Jintao Xing, Zirui Xue, Rui Li, Xiangyu Zhao, Shuofei Qiao, Minting Pan, Wangmeng Zuo, Lei Bai, Dongzhan Zhou, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 针对科学实验室中机器人执行协议面临的数据和实体瓶颈,提出模拟数据引擎RoboGenesis和两阶段训练策略LabVLA,在LabUtopia基准上取得最高平均成功率。

Comments Work in progress. Project website at https://zjunlp.github.io/LabVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13474 2026-08-14 cs.RO 新提交 90%

Decoding Task Progress from VLA Representations

从视觉-语言-动作模型(VLA)表征中解码任务进度

Atiksh Bhardwaj, Edward Weiyi Duan, Prithwish Dan, Wei-Chiu Ma, Preston Culbertson

机构 * Cornell University(康奈尔大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 该研究利用机制可解释性探究VLA的π₀.₅残差流,发现任务进度可从激活值线性读取,基于此构建的探测器可作为无标签OOD检测器,性能接近最先进方法,为监控部署的视觉运动策略提供轻量可解释路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06688 2026-08-10 cs.RO 新提交 90%

CrossTracer: Cross-Embodiment Navigation via VLA Model Reasoning and Trace Residuals Adapting

CrossTracer:基于VLA模型推理与轨迹残差自适应的跨 embodiments 导航

Yao Wang, Siyuan Wang, Zhirui Sun, Wenzheng Chi, Liang Lin, Jiankun Wang, Wenjun Xu

机构 * Peng Cheng Laboratory(鹏城实验室) Southern University of Science and Technology(南方科技大学) Innovation Investment Research Institute(创新投资研究院) Soochow University(苏州大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO

AI总结 本研究提出跨 embodiment 导航框架 CrossTracer,通过 VL-Tracer 和 CE-Adapter 优化轨迹,在 NaviTrace 基准得分 45.68,优于 Gemini-2.5-Pro,实际部署于轮式、腿式机器人效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01066 2026-08-04 cs.RO 新提交 90%

OC-VLA++: Monocular Geometry-Guided Cross-View Consistency for Viewpoint-Robust Robotic Manipulation

OC-VLA++:用于视点鲁棒机器人操作的单目几何引导跨视图一致性

Tianyi Zhang, Ziyang Gong, Zhenjie Yang, Zhe Qian, Haonan Duan

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO

AI总结 该研究针对相机覆盖有限时机器人操作的视点泛化问题,提出OC-VLA++模型,通过几何引导的配对视图监督和跨视图动作等变目标提升未见视点泛化能力,性能优于原模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26807 2026-07-30 cs.RO 新提交 90%

Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA

基于运动学的路由、基于观测的执行:MoE增强视觉-语言智能体(VLA)中的运动学监督专家路由

Tianhang Yang, Yanze Zheng, Junjie Wang, Wei-Bin Kou, Ruotong Li, Yujiu Yang

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO

AI总结 本研究针对MoE增强VLA的专家路由问题,提出KinRT方法,通过运动学聚类监督路由器训练,在两个平台上验证其性能优于现有模型,相关代码与平台将开源。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13605 2026-07-16 cs.RO 新提交 90%

An Empirical Study on Stage-Information Interfaces for VLA Fine-Tuning

关于VLA微调的阶段信息接口的实证研究

Yingwei Ji

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO

AI总结 研究长期操作中VLA微调的阶段信息接口,通过分段动作注释等方法,在直接微调与延续微调下和GR00T N1.6比较,发现不同接口表示和训练安排下阶段信息对策略成功率影响不同。

Comments 5 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏