Information Theoretic Adversarial Training of Large Language Models
信息论视角下的大语言模型对抗训练
机构 * Purdue University(普渡大学) ; Texas State University(德克萨斯州立大学) ; University of South Florida(佛罗里达州立大学) ; University of Arizona(亚利桑那大学)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);preference optimization(abstract)
AI总结 本文提出WARDEN框架,通过信息论方法动态调整对抗示例权重,提升大语言模型的鲁棒性,减少攻击成功率且保持模型效用。