Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins
面向手术室视频的推理式文本-视频检索:基于动作驱动数字孪生
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 动作与事件理解 :text-to-video(title,abstract);分类 cs.CV
AI总结 提出OR3方法,通过动作驱动数字孪生(ActDT)将视频片段转化为结构化表示,并利用大语言模型生成假设ActDT进行检索,结合证据修正实现隐式查询推理,在手术室视频检索中显著优于基线。