Beyond Text and Tables: Vision-Language Model Integration in ComProScanner for Extracting Materials Data from Scientific Figures with High Accuracy
超越文本与表格:ComProScanner中视觉-语言模型集成实现从科学图表中高精度提取材料数据
机构 * Energy, Materials and Environment Research Centre, London South Bank University, London SE1 0AA, UK(能源、材料与环境研究中心,伦敦南银行大学) ; School of Engineering and Design, London South Bank University, London SE1 0AA, UK(工程与设计学院,伦敦南银行大学) ; Bioscience and Bioengineering Research Centre, London South Bank University, London SE1 0AA, UK(生物科学与生物工程研究中心,伦敦南银行大学) ; Department of Physics, Kings College London, London WC2R 2LS, UK(物理系,伦敦国王学院)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文通过集成视觉-语言模型扩展ComProScanner框架,实现了从科学图表中自动提取成分-性能数据,在压电陶瓷数据集上达到0.97的组成准确率和归一化F1分数,并引入基于范围的误差阈值评估方法。
Comments 18 pages, 3 figures