2507.05240
2026-07-10
cs.RO
cs.CV
版本更新
50%
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
StreamVLN:通过快慢上下文建模实现流式视觉与语言导航
Meng Wei, Chenyang Wan, Xiqian Yu, Tai Wang, Yuqiang Yang, Xiaohan Mao, Chenming Zhu, Wenzhe Cai, Hanqing Wang, Yilun Chen, Xihui Liu, Jiangmiao Pang
机构
*
Shanghai AI Lab(上海人工智能实验室)
;
The University of Hong Kong(香港大学)
;
Zhejiang University(浙江大学)
;
Shanghai Jiao Tong University(上海交通大学)
专题命中
视觉空间推理
:reasoning(abstract)
AI总结
研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。