CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs
CIAware-Bench: 评估前沿大语言模型的控制干预感知能力
机构 * MATS ; Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; Astra Fellowship ; ELLIS Institute Tübingen, MPI for Intelligent Systems & Tübingen AI Center ; LawZero ; Google DeepMind(谷歌DeepMind)
AI总结 提出CIAware-Bench基准,通过四个任务域测试模型能否区分自身轨迹与被控制干预修改的轨迹,发现前沿模型在默认设置下感知能力低至中等,且因任务和模型对而异。