Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods
推进面向艺术字的场景文本识别:数据集与方法
机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) ; Shanghai Key Laboratory of Multimodal Embodied AI, Fudan University(复旦大学上海市多模态具身人工智能重点实验室) ; WeChat Vision, Tencent Inc.(腾讯微信视觉团队) ; South China University of Technology(华南理工大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
AI总结 针对艺术字场景文本识别(WATER)的挑战,构建了百万级合成数据集WATER-S,并提出支持任意形状输入和自回归解码的WATERec模型,在WordArt-Bench上达到90.40%准确率。
Comments Accepted by ECCV 2026