Hidden Topics: Measuring Sensitive AI Beliefs with List Experiments
隐藏主题:通过列表实验测量敏感的AI信念
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文通过列表实验揭示大型语言模型对监控、酷刑和核打击等敏感问题的潜在态度,验证了该方法在检测AI隐藏信念的有效性。
Comments 14 pages, 3 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
隐藏主题:通过列表实验测量敏感的AI信念
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文通过列表实验揭示大型语言模型对监控、酷刑和核打击等敏感问题的潜在态度,验证了该方法在检测AI隐藏信念的有效性。
Comments 14 pages, 3 figures