LLM Hypnosis: Exploiting User Feedback for Unauthorized Knowledge Injection to All Users
LLM催眠:利用用户反馈进行未经授权的知识注入以影响所有用户
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; IBM Research(IBM研究院)
专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 研究揭示语言模型通过用户反馈进行知识注入的漏洞,通过反馈信号可操控模型行为,导致事实错误、代码漏洞和虚假新闻。