FireRed-OCR Technical Report
FireRed-OCR 技术报告
机构 * Super Intelligence Team(超级智能团队) ; Xiaohongshu Inc(小红书公司)
AI总结 FireRed-OCR 通过三阶段渐进训练策略,将通用 VLM 转化为高精度结构文档解析专家,实现 OCR 领域的突破性性能。
大厂专区
FireRed-OCR 技术报告
机构 * Super Intelligence Team(超级智能团队) ; Xiaohongshu Inc(小红书公司)
AI总结 FireRed-OCR 通过三阶段渐进训练策略,将通用 VLM 转化为高精度结构文档解析专家,实现 OCR 领域的突破性性能。
IDProxy:小红书广告与推荐中基于多模态大语言模型的冷启动CTR预测
机构 * Xiaohongshu Inc.(小红书公司) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学)
AI总结 IDProxy通过多模态大语言模型生成代理嵌入,解决广告和推荐系统中物品冷启动的CTR预测问题,实现与现有嵌入空间的对齐和端到端优化,已在小红书大规模应用。
ExPO-HM:为仇恨表情包检测学习解释-然后检测
机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) ; Xiaohongshu Inc.(小红书公司) ; University of Bath(巴斯大学) ; Tencent Company, China(腾讯公司) ; Alibaba Group(阿里巴巴集团)
AI总结 ExPO-HM通过结合SFT预热、GRPO与课程学习及CDE,提升仇恨表情包检测的解释性和准确性。
Comments ICLR 2026
DeepEyes: 通过强化学习激励'图像思考'
机构 * Xiaohongshu Inc.(小红书公司) ; Xi’an Jiaotong University(西安交通大学)
AI总结 DeepEyes通过强化学习实现图像引导的推理,无需预训练数据,提升多模态任务性能。
Comments Accepted by ICLR2026. Ziwei, Michael, Jack, and Chenxiao are equal-contribution. The list order is random
Vision-R1: 促进多模态大语言模型推理能力的激励方法
机构 * East China Normal University(华东师范大学) ; The Chinese University of Hong Kong(香港中文大学) ; Xiaohongshu Inc.(小红书公司)
AI总结 Vision-R1通过构建高质量多模态CoT数据集和渐进性思维抑制训练策略,提升多模态推理能力,在数学推理基准中取得显著成绩。
Comments Accepted to ICLR 2026. Code is available at https://github.com/Osilly/Vision-R1
WorldSense: 评估多模态大语言模型的现实世界多模态理解
机构 * Xiaohongshu Inc.(小红书公司) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 WorldSense是首个评估多模态大语言模型现实世界多模态理解能力的基准,通过多模态协作、多样化视频任务和高质量标注,全面评估模型在复杂场景中的表现。
Comments Accepted by ICLR2026