A Decision-Theoretic Formalisation of Steganography With Applications to LLM Monitoring
基于决策理论的隐写术形式化及其在大语言模型监控中的应用
机构 * University of Cambridge(剑桥大学) ; Massachusetts Institute of Technology(麻省理工学院) ; UK AI Safety Institute(英国人工智能安全研究所) ; University of Oxford(牛津大学) ; Mila, University of Montreal(蒙特利尔大学米尔人工智能实验室)
AI总结 本文提出决策理论视角下的隐写术形式化方法,通过通用V-信息量定义隐写差距,用于检测和缓解大语言模型中的隐写推理行为。
Comments First two authors contributed equally