arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-06-12 至 2026-06-12 共收录 2 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 部署与泛化 2 篇

2606.12690 2026-06-12 cs.RO cs.AI 新提交 81%

EWAM: An Enhanced World Action Model for Closed-Loop Online Adaptation in Embodied Intelligence

EWAM:一种用于具身智能闭环在线自适应的增强世界动作模型

Xin Zhou, Cong Miao

机构 * Astronex Robotics Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 提出EWAM架构,基于冻结的Cosmos3骨干网络,通过四个轻量级神经层实现零样本在线自适应,无需微调或额外演示数据,显著减少新任务布局的部署数据需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03896 2026-06-12 cs.CV cs.RO 版本更新 62%

GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert

GAE: 利用可泛化动作专家释放VLM的物理潜力

Mingyu Liu, Zheng Huang, Xiaoyi Lin, Muzhi Zhu, Canyu Zhao, Yating Wang, Haoyi Zhu, Hao Chen, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出通用动作专家(GAE),通过稀疏几何接口将VLM的高层意图转化为连续动作轨迹,采用动作预训练-点云微调(APPF)方案解耦动作动力学与几何基础,实现跨视觉域、视角和指令的强泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏