Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation
Naamah:通过DBpedia seeding和LLM生成构建大规模合成梵语命名实体识别语料库
机构 * Centre for Development of Advanced Computing (C-DAC)(发展高级计算中心)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Naamah,一个包含102942个句子的高质量梵语NER数据集,结合DBpedia实体提取与混合推理模型生成,用于评估XLM RoBERTa和IndicBERTv2模型。