Structure-Aware Text Recognition for Ancient Greek Critical Editions
面向古希腊校勘本的结构感知文本识别
机构 * Inria(法国国家信息与自动化技术研究所)
专题命中 预训练与数据 :language model(abstract)
AI总结 本文通过构建大规模合成语料库和真实扫描基准,评估了视觉语言模型在结构感知文本识别上的性能,发现Qwen3VL-8B模型在真实扫描上达到1.0%的中位字符错误率。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
面向古希腊校勘本的结构感知文本识别
机构 * Inria(法国国家信息与自动化技术研究所)
专题命中 预训练与数据 :language model(abstract)
AI总结 本文通过构建大规模合成语料库和真实扫描基准,评估了视觉语言模型在结构感知文本识别上的性能,发现Qwen3VL-8B模型在真实扫描上达到1.0%的中位字符错误率。
新时代的视觉生成:从原子映射到智能世界建模的演进
机构 * Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; University of Hong Kong(香港大学) ; National University of Singapore(新加坡国立大学) ; University of Waterloo(滑铁卢大学) ; StepFun ; MiroMind ; Baidu(百度) ; Fudan University(复旦大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; LMMs-Lab(LMMs实验室)
专题命中 预训练与数据 :post-training(abstract)
AI总结 提出五级分类法(原子生成、条件生成、上下文生成、智能生成、世界建模生成),分析流匹配、统一理解与生成模型等关键技术,并指出现有评估高估感知质量而忽视结构、时序和因果缺陷。
Comments Project Page: https://github.com/EvolvingLMMs-Lab/Evolving-Visual-Generation
BabAR:从音素识别到幼儿语音产出的发展性测量
专题命中 预训练与数据 :pretraining(abstract)
AI总结 提出跨语言音素识别系统BabAR,利用多语种儿童语音语料库TinyVox训练,通过预训练和上下文微调提升性能,自动测量与发育评估一致。