Evaluating Reliability Gaps in Large Language Model Safety via Repeated Prompt Sampling
通过重复提示采样评估大语言模型安全性的可靠性差距
机构 * Independent Researcher(独立研究员)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 本文提出APST框架,通过重复采样相同提示在受控条件下揭示LLM潜在故障模式,量化不同模型和配置下的操作风险,展示浅层基准分数可能掩盖持续使用下的可靠性差异。
Comments 9 pages, 4 figures; accepted at the CCAI 2026 conference