TharuChat: Bootstrapping Large Language Models for a Low-Resource Language via Synthetic Data and Human Validation
TharuChat:通过合成数据和人类验证提升低资源语言的大型语言模型
机构 * School of Computer Engineering KIIT Deemed to be University(计算机工程学院 KIIT 研究生大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Tharu-LLaMA(3B)模型,通过合成数据和人类验证构建TharuChat数据集,解决低资源语言在AI中的代表性问题,提升模型性能并证明生成式AI在保护濒危语言中的可行性。
Comments 6 pages, 1 figure, 2 tables. Preprint. Code and dataset available on Hugging Face