2607.04884
2026-08-07
cs.CV
版本更新
70%
HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
浑元OCR-1.5:让轻量级OCR视觉语言模型更快更好
Gengluo Li, Xingyu Wan, Shangpin Peng, Weinong Wang, Hao Feng, Yongkun Du, Binghong Wu, Zheng Ruan, Zhiqiong Lu, Liang Wu, Pengyuan Lyu, Huawen Shen, Zibin Lin, Shijing Hu, Jieneng Yang, Hongbing Wen, Guanghua Yu, Hong Liu, Bochao Wang, Can Ma, Han Hu, Chengquan Zhang, Yu Zhou
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
Large Language Model Department, Tencent(腾讯大语言模型部)
;
Nankai University(南开大学)
纠错
专题命中
文档图表理解
:vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结
研究改进轻量级端到端OCR视觉语言模型。基于HunyuanOCR-1.0架构,用DFlash提升效率,提出Agentic Data Flow增强能力,在多任务表现出色,还将发布模型权重和代码。