arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-15 至 2026-07-15 共收录 2 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 2 篇

2607.13017 2026-07-15 cs.RO cs.CV 新提交 86%

FlowWAM: Optical Flow as a Unified Action Representation for World Action Models

FlowWAM:光流作为世界动作模型的统一动作表示

Yixiang Chen, Peiyan Li, Yuan Xu, Qisen Ma, Jiabing Yang, Kai Wang, Jianhua Yang, Dong An, He Guan, Gaoteng Liu, Jianlou Si, Jun Huang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(无) MBZUAI(无) Alibaba Group(阿里巴巴集团)

专题命中 动作表示与策略 :action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 研究针对世界动作模型控制中动作表示难题,提出FlowWAM双流扩散框架,以光流为统一动作表示。该框架可实现WAMs两种模式,能利用无动作标签视频预训练,实验表明在操纵和世界建模任务中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12992 2026-07-15 cs.RO 新提交 70%

ChunkFlow: Towards Continuity-Consistent Chunked Policy Learning

ChunkFlow:迈向连续性一致的分块策略学习

Zhao Yang, Yinan Shi, Mingyuan Yao, Wenyao Xue, Yawei Jueluo, Longjun Liu

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) Jiangsu Cytoderm Intelligent Technology Co., Ltd.(江苏希迪姆智能科技有限公司)

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 研究视觉语言动作模型分块策略的边界抖动问题,提出ChunkFlow框架划分块区域,执行时用确定性重叠混合,训练时用多种损失,通过实验验证该框架在低延迟推理下能改善成功稳定性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏