Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models
自回归与扩散语言模型中的逐步拒绝动态
机构 * Department of Computer Science, Technion – Israel Institute of Technology(技术学院计算机科学系,以色列技术学院) ; INSIGHT Lab, School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Israel(内斯坦实验室,贝内-加隆大学内加尔分校,以色列) ; Computer Science Department, University of Haifa, Haifa, Israel(海法大学计算机科学系,海法,以色列)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 研究扩散语言模型(DLM)与自回归(AR)模型在拒绝有害生成行为上的差异,发现扩散重掩码机制可促进恢复,提出逐步拒绝内部动态(SRI)信号,并基于此构建无需修改推理的越狱检测器。
Comments Preprint