One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue
一念之差:多轮对话中针对隐藏恶意意图的响应感知防御
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; UCSD(加州大学圣地亚哥分校) ; National Taiwan University(台湾大学) ; IBM Research(IBM研究院) ; Virtue AI
AI总结 本文提出TurnGate,通过检测最早使交互达到有害行为阈值的轮次,提升多轮对话中恶意意图检测效果,同时保持低拒绝率。
Comments Project Website: https://turn-gate.github.io/