One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting
一个补丁就够:面向基于多模态大语言模型(MLLM)的场景文本定位的强化优化视觉标记接地
机构 * South China University of Technology(华南理工大学) ; HiThink Research(海思思考研究院)
AI总结 针对现有多补丁场景文本定位范式的冗余噪声与定位歧义问题,提出以视觉为中心的单补丁文本定位框架 SPaTS,通过强化学习优化的单补丁选择等技术实现性能提升,显著优于前沿相关模型。
Comments 15 pages, 11 figures. Accepted to ACM Multimedia 2026
Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026