HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models
HiF-VLA:通过运动表示实现视觉-语言-动作模型的回顾、洞察与前瞻性
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; HKUST(GZ)(香港科技大学(广州)) ; Nanjing University(南京大学) ; Westlake Robotics(西湖机器人)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO
AI总结 HiF-VLA通过运动表示提升视觉-语言-动作模型的时序推理能力,采用回顾、洞察和前瞻性机制,在长时域任务中表现优异,且推理延迟低。
Comments CVPR 2026, Project page: https://hifvla.github.io, Github: https://github.com/OpenHelix-Team/HiF-VLA