LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition
LAVIFT:用于手术交互识别的潜在动作引导视觉微调
机构 * Arizona State University(亚利桑那州立大学) ; University of California, Merced(加州大学默塞德分校) ; Intel Corporation(英特尔公司)
AI总结 研究针对手术交互识别中预训练模型适应细粒度交互的挑战,提出LAViFiT框架,通过逆动力学模型、前向世界模型及补丁级SIG正则化器,实现视觉语言微调,提升了识别率和图像-文本对齐,增强了特征基础和空间连贯性。