StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
StreamVLN:通过快慢上下文建模实现流式视觉与语言导航
机构 * Shanghai AI Lab(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
AI总结 研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。
Comments Accepted to ICRA 2026