BiliVLA: Scene-Aware Vision-Language-Action Model with Reinforcement Learning for Autonomous Biliary Endoscopic Navigation
BiliVLA: 基于强化学习的场景感知视觉-语言-动作模型用于自主胆道内镜导航
机构 * The Chinese University of Hong Kong(香港中文大学) ; The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院) ; University of Cambridge(剑桥大学) ; University of California, Davis(加州大学戴维斯分校)
AI总结 提出BiliVLA框架,将胆道内镜导航建模为指令条件化的视觉运动学习问题,结合场景感知监督和两阶段训练(SFT+GRPO),在ERCP子任务中实现91.96%的动作精度和84.85%的成功率。