T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs
T2T-VICL:通过隐式文本驱动的视觉语言模型进行跨任务视觉上下文学习
机构 * Duke University(杜克大学) ; Texas A&M University(德克萨斯农工大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究跨任务视觉上下文学习问题,提出T2T-VICL协作式提示转移框架,通过大教师VLM生成结构化描述构建数据集,提炼能力到轻量级学生VLM,实验表明该框架能改进任务感知对齐,揭示跨任务VICL的潜力与局限。
Comments 22 pages, 6 figures, under submission