arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-30 至 2026-07-30 共收录 6 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 6 篇

2606.18426 2026-07-30 cs.RO 版本更新 79%

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

VEGA: 从野外自我中心视频中通过几何轨迹监督学习导航VLA

Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Rahul Kumar, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 机器人基础模型 :navigation(title,abstract);分类 cs.RO

AI总结 提出VEGA方法,利用未标注的自我中心视频通过重建场景几何生成障碍感知轨迹,训练流匹配VLA导航策略,在VEGA-Bench上碰撞减少33.0%,真实世界成功率提升至少150.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27205 2026-07-30 cs.CV cs.RO 新提交 73%

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA:在RTX 4090上以32 Hz运行、显存占用<1 GB的实时视觉-语言-动作模型

Hengyi Xie, Chenfei Yao, Xianjin Wu, Xuanyang Xi, Yiping Tang, Di Xu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出TurboVLA,将传统VLA模型的LLM中心路径重构为视觉语言直接映射,仅0.2B参数即可在RTX 4090上实现97.7%LIBERO任务成功率,性能优于更大模型且显存占用极低。

Comments Code is available at https://github.com/H-EmbodVis/TurboVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04171 2026-07-30 cs.RO cs.LG 版本更新 73%

Teaching Tiny VLA Models Where to Look and How to Move

XS-VLA:将粗粒度空间蒸馏与潜在流匹配相结合用于轻量级机器人控制

Iok Tong Lei, Ying Jie Yap, Wei Huang, Qingchen Xie, Qianzhi Li, Yujie Zhang, Xiaolong Liu, Zhidong Deng

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出XS-VLA框架,先通过微调从Qwen3-VL-4B向SmolVLM2-0.25B骨干网蒸馏空间语义知识,再用其增强骨干网训练潜在流匹配策略,提升轻量级机器人控制性能,在LIBERO基准测试中表现出色。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27138 2026-07-30 cs.RO cs.AI cs.CV 新提交 67%

DLAM: Distributional Latent Actions with Temporal Constraints

DLAM:带时间约束的分布隐式动作模型

Zuojin Tang, Feifan Luo, Haoyun Liu, Botai Yuan, Dekang Qi, Ronghan Chen, Yandan Yang, Tong Lin, Xinyuan Chang, Mu Xu, Bin Liu, De Ma, Zhiheng Ma

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 该研究针对VLA模型数据稀缺问题,提出带时间约束的分布隐式动作模型DLAM,通过特定约束优化隐式动力学,提升了视频重建效果及机器人操作任务的策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26807 2026-07-30 cs.RO 新提交 57%

Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA

基于运动学的路由、基于观测的执行:MoE增强视觉-语言智能体(VLA)中的运动学监督专家路由

Tianhang Yang, Yanze Zheng, Junjie Wang, Wei-Bin Kou, Ruotong Li, Yujiu Yang

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本研究针对MoE增强VLA的专家路由问题,提出KinRT方法,通过运动学聚类监督路由器训练,在两个平台上验证其性能优于现有模型,相关代码与平台将开源。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26513 2026-07-30 cs.RO 新提交 57%

Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models

面向视觉-语言-动作模型的来自解析概念的显式运动学引导

Mingyang Sun, Jiude Wei, Xiujian Liang, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 该研究针对视觉-语言-动作模型忽略3D物体结构信息的缺陷,构建概念专家模块生成解析概念,通过双阶段机制提供显式引导,提升了模型的操作成功率与学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏