arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-25 至 2026-06-25 共收录 5 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 5 篇

2606.25800 2026-06-25 cs.LG cs.RO 新提交 73%

ROAD-VLA: Robust Online Adaptation via Self-Distillation for Vision-Language-Action Models

ROAD-VLA:通过自蒸馏实现视觉-语言-动作模型的鲁棒在线自适应

Kejing Wang, Toan Nguyen, Minh Hoang Nguyen, Simon Khan, Flora D. Salim

机构 * Air Force Research Laboratory(空军研究实验室)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 针对稀疏奖励下VLA模型在线自适应困难,提出ROAD-VLA框架,通过优势引导的自蒸馏在动作空间构建近端教师,将稀疏奖励转化为密集token级监督,并在7个机器人操作环境中优于PPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25591 2026-06-25 cs.RO 新提交 70%

WOLF-VLA: Whole-Body Humanoid Optimal Locomotion Framework for Vision-Language-Action Learning

WOLF-VLA:面向视觉-语言-动作学习的全身人形最优运动框架

Melya Boukheddimi, Omar Adjali, Daniel Sontag, Frank Kirchner

机构 * Robotics Innovation Center, DFKI GmbH(德国人工智能研究中心机器人创新中心) University of Oldenburg(奥尔登堡大学) AG Robotik University of Bremen(不来梅大学机器人工作组)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出WOLF-VLA框架,结合全身最优控制运动合成与大规模多模态数据集,训练VLA模型从自然语言指令生成人形运动策略,在多种任务中展现强鲁棒性和竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26006 2026-06-25 cs.RO cs.AI 新提交 62%

FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation

FORCE: 通过值校准预热和自蒸馏实现高效的VLA强化学习微调

Shuyi Zhang, Yunfan Lou, Hongyang Cheng, Yichen Guo, Chuyao Fu, Yaoxu Lyu, Xiaojie Zhang, Haoran Li, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出FORCE框架,通过值校准预热和自蒸馏解决VLA模型RL微调中的样本效率低和初始遗忘问题,在仿真和真实任务中成功率提升79%,训练加速32.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25985 2026-06-25 cs.RO 新提交 57%

Action ControlNet: A Lightweight Delay-Aware Adapter for Smooth Asynchronous Control in Vision-Language-Action Models

Action ControlNet: 一种轻量级延迟感知适配器,用于视觉-语言-动作模型中的平滑异步控制

Tiecheng Guo, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 提出Action ControlNet,一种轻量级延迟感知适配器,通过将已执行的动作后缀作为残差条件,在不重新训练骨干网络的情况下,减少异步执行中的动作不连续和抖动,提升机器人操控的鲁棒性和平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24815 2026-06-25 cs.SE cs.RO 新提交 57%

MANGO: Automated Multi-Agent Test Oracle Generation for Vision-Language-Action Models

MANGO: 面向视觉-语言-动作模型的自动化多智能体测试预言生成

Pablo Valle, Shaukat Ali, Aitor Arrieta, Lionel Briand

机构 * Mondragon University(蒙得龙大学) Simula Research Laboratory(Simula研究实验室) University of Ottawa(渥太华大学) Research Ireland Lero Centre for Software(爱尔兰Lero软件研究中心)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

AI总结 提出MANGO多智能体框架,从自然语言任务描述自动生成细粒度测试预言,通过协作智能体迭代精炼,在机器人基准测试中有效检测故障并定位。

详情

展开后加载摘要…

URL PDF HTML 收藏