Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention
凝视到文本生成:超越人类注意力的分类解码
机构 * Stony Brook University(纽约州立大学石溪分校) ; Australian Institute for Machine Learning(澳大利亚机器学习研究所) ; Adelaide University(阿德莱德大学)
专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract)
AI总结 该研究提出将凝视解码为自然语言描述人类目标的新问题,构建Gazette框架,基于多模态大语言模型,利用新颖策略合成出声思考转录本并指令调优,使其在多任务凝视解码中达最优性能,能推断多样场景下人类目标意图。
Comments To appear in European Conference on Computer Vision (ECCV) 2026