When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space
当言语安全但行动致命:在隐藏状态风险空间中探究超越文本安全的物理危险
机构 * Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学)
AI总结 研究大语言模型中语言无害指令在现实世界中的物理危险与文本级内容危险是否相同,提出PRISM方法,通过隐藏状态方向分析等证明CD和PD可分离,PRISM在多个基准测试中表现良好,能检测物理危险而非仅依赖明确不安全措辞。