arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-30 至 2026-07-30 共收录 13 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 11 篇

2607.04171 2026-07-30 cs.RO cs.LG 版本更新 92%

Teaching Tiny VLA Models Where to Look and How to Move

XS-VLA:将粗粒度空间蒸馏与潜在流匹配相结合用于轻量级机器人控制

Iok Tong Lei, Ying Jie Yap, Wei Huang, Qingchen Xie, Qianzhi Li, Yujie Zhang, Xiaolong Liu, Zhidong Deng

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.LG

AI总结 提出XS-VLA框架,先通过微调从Qwen3-VL-4B向SmolVLM2-0.25B骨干网蒸馏空间语义知识,再用其增强骨干网训练潜在流匹配策略,提升轻量级机器人控制性能,在LIBERO基准测试中表现出色。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27205 2026-07-30 cs.CV cs.RO 新提交 91%

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA:在RTX 4090上以32 Hz运行、显存占用<1 GB的实时视觉-语言-动作模型

Hengyi Xie, Chenfei Yao, Xianjin Wu, Xuanyang Xi, Yiping Tang, Di Xu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本研究提出TurboVLA,将传统VLA模型的LLM中心路径重构为视觉语言直接映射,仅0.2B参数即可在RTX 4090上实现97.7%LIBERO任务成功率,性能优于更大模型且显存占用极低。

Comments Code is available at https://github.com/H-EmbodVis/TurboVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26807 2026-07-30 cs.RO 新提交 90%

Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA

基于运动学的路由、基于观测的执行:MoE增强视觉-语言智能体(VLA)中的运动学监督专家路由

Tianhang Yang, Yanze Zheng, Junjie Wang, Wei-Bin Kou, Ruotong Li, Yujiu Yang

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO

AI总结 本研究针对MoE增强VLA的专家路由问题,提出KinRT方法,通过运动学聚类监督路由器训练,在两个平台上验证其性能优于现有模型,相关代码与平台将开源。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26513 2026-07-30 cs.RO 新提交 89%

Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models

面向视觉-语言-动作模型的来自解析概念的显式运动学引导

Mingyang Sun, Jiude Wei, Xiujian Liang, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 该研究针对视觉-语言-动作模型忽略3D物体结构信息的缺陷,构建概念专家模块生成解析概念,通过双阶段机制提供显式引导,提升了模型的操作成功率与学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27138 2026-07-30 cs.RO cs.AI cs.CV 新提交 88%

DLAM: Distributional Latent Actions with Temporal Constraints

DLAM:带时间约束的分布隐式动作模型

Zuojin Tang, Feifan Luo, Haoyun Liu, Botai Yuan, Dekang Qi, Ronghan Chen, Yandan Yang, Tong Lin, Xinyuan Chang, Mu Xu, Bin Liu, De Ma, Zhiheng Ma

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究针对VLA模型数据稀缺问题,提出带时间约束的分布隐式动作模型DLAM,通过特定约束优化隐式动力学,提升了视频重建效果及机器人操作任务的策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18426 2026-07-30 cs.RO 版本更新 86%

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

VEGA: 从野外自我中心视频中通过几何轨迹监督学习导航VLA

Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Rahul Kumar, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO

AI总结 提出VEGA方法,利用未标注的自我中心视频通过重建场景几何生成障碍感知轨迹,训练流匹配VLA导航策略,在VEGA-Bench上碰撞减少33.0%,真实世界成功率提升至少150.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26789 2026-07-30 cs.RO 新提交 77%

CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation

CheckVLA:面向长 horizon 移动操作的基于动作条件世界模型的执行时验证

Yushan Liu, Peibo Sun, Xintao Chao, Zhenyang Yang, Yifan Xie, Lingfeng Zhang, Shoujie Li, Chenyu Tang, Fang Chen, Xiao-Ping Zhang, Wenbo Ding

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 CheckVLA 是基于动作条件世界模型的长 horizon 移动操作执行时验证方法,在 RoboCasa365 上其平均成功率比定期重规划提升 8.5 个百分点,且及时召回率显著优于仅观测及动作打乱的对照方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09971 2026-07-30 cs.RO 版本更新 70%

TiPToP: A Modular Open-Vocabulary Robot Manipulation System That Plans

TiPToP:一种用于机器人操作的模块化开放式词汇规划系统

William Shen, Nishanth Kumar, Sahit Chintalapudi, Ryan Lindeborg, Jie Wang, Christopher Watson, Edward Hu, Jing Cao, Dinesh Jayaraman, Leslie Pack Kaelbling, Tomás Lozano-Pérez

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 TiPToP是一种模块化开放式词汇规划系统,结合预训练视觉模型与任务规划器,通过自然语言指令和RGB图像直接解决多步骤操作任务,实现实时高效的操作规划。

Comments Project website: https://tiptop-robot.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00537 2026-07-30 cs.RO 版本更新 57%

PACE: Phase-Aware Chunk Execution for Robot Policies with Action Chunking

PACE: 面向动作分块策略的相位感知分块执行方法

Junnan Nie, Jiayi Li, Jiachen Zhang, Junyi Lao, Chenghao Liu, Tianle Zhang, Liang Lin, Songfang Huang

机构 * Peking University(北京大学) JD Explore Academy(京东探索研究院)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 提出PACE方法,通过在线预测动作分块中的低速过渡点作为重规划边界,自适应选择执行步长,无需重新训练即可提升机器人策略成功率。

Comments 21 pages, 7 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10838 2026-07-30 cond-mat.mtrl-sci physics.comp-ph 版本更新 50%

Ab initio informed electronic stopping models for light ion propagation in metals

在原子尺度上建模轻离子的各向异性能量耗散

Evgeniia Ponomareva, Artur Tamm, Andrea E. Sand

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出在原子尺度上使用局部电子停止模型,以更高效地描述轻离子能量耗散过程,并通过实验数据验证其有效性。

Journal ref Ponomareva, E., Tamm, A., & Sand, A. E. (2026). Ab initio informed electronic stopping models for light ion propagation in metals. Journal of Nuclear Materials, 156906

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11749 2026-07-30 nucl-th 版本更新 50%

Pauli Consistent $α$--$α$ Interaction from Inverse Scattering via Phase Function Wavefunctions and RGM Antisymmetrization

一种计算相函数方法用于α-α散射:从单项和双项莫尔斯势构造波函数

Anil Khachi, Shikha Awasthi, Tarachand Verma, Ranjana Joshi

专题命中 VLA模型 :action model(abstract)

AI总结 本文首次利用相函数方法构建α-α系统散射波函数,通过单项和双项莫尔斯势验证了该方法在簇-簇系统中的有效性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 数据集与评测 2 篇

2607.26452 2026-07-30 cs.AI cs.CV cs.GR 新提交 73%

CG-World: A Large-Scale World-State Dataset and Protocol for World Models

CG-World:面向世界模型的大规模世界状态数据集与协议

Yiming Cai, Fangjie Yu, Meiqing Yu, Ziyue Shi, Pengfei Yuan, Yong Guo

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.AI

AI总结 CG-World是源自工业计算机图形流水线的大规模世界状态数据集,含约85万时间对齐片段,支持干预学习与反事实推理,经评估可为世界模型相关任务提供结构化监督,拟打造共享数据基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23704 2026-07-30 cs.RO cs.CV 版本更新 62%

LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratory

LabRobFail:化学自动驾驶实验室中机器人故障分析的基准

Haobo Wang, Baoli Sun, Anqi Zou, Dongsheng Huang, Zelin Lv, Ning Wang, Rui Li, Dongzhan Zhou, Weiyu Guo, Zhihui Wang, Wanli Ouyang

专题命中 数据集与评测 :VLA(abstract_cn);分类 cs.RO、cs.CV

AI总结 针对化学自动驾驶实验室中机器人可靠性受化学实验特性限制、故障数据稀缺及评估协议缺乏等问题,引入LabRobFail框架,通过注入故障构建数据集,开发专门模型,提升故障检测等能力及下游任务成功率。

Comments Under review. Haobo Wang and Baoli Sun contributed equally. Code and data: https://github.com/Su-ISE-2001/SciRobo

详情

展开后加载摘要…

URL PDF HTML 收藏