State-Dependent Refusal and Learned Incapacity in RLHF-Aligned Language Models
基于状态依赖拒绝和学习无能的强化学习人类反馈对齐语言模型
专题命中 安全训练 :RLHF(title);alignment(abstract);分类 cs.AI
AI总结 本研究提出通过观察行为来审计强化学习人类反馈对齐语言模型中的状态依赖拒绝和学习无能现象。
Comments 23 pages, 6 figures. Qualitative interaction-level analysis of response patterns in a large language model. Code and processed interaction data are available at https://github.com/theMaker-EnvData/llm_learned_incapacity_corpus