Detecting Sensitive Personal Information in Japanese Pre-Training Corpora for Large Language Models
检测日语大语言模型预训练语料库中的敏感个人信息
机构 * Waseda University(早稻田大学) ; Research and Development Center for LLMs, National Institute of Informatics(国立信息学研究所大语言模型研发中心)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL
AI总结 针对日语大语言模型预训练语料中的敏感个人信息,基于日本《个人信息保护法》定义的特殊要保护个人信息,构建数据集并训练机器学习模型进行快速检测,首次探索日语文本中的SCPI检测。