ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering
ViTexQA: 面向视频文本问答的多帧时序感知数据集
机构 * Meituan(美团) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出ViTexQA数据集和FrameThinker方法,通过跨帧文本融合的问答对和两阶段训练(CoT微调+时序强化学习),解决多帧时序文本感知难题,ROUGE-L提升6.3%。
Comments Accepted by ECCV2026