Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models
压力下的风险:语言模型对抗鲁棒性的计算感知评估
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; Hugging Face
AI总结 提出基于计算压力(累积FLOPs)的对抗鲁棒性评估框架,通过风险-计算曲线和两个新指标,揭示不同攻击策略的计算成本差异,并在10个模型上验证了对齐训练、模型规模等因素对计算空间鲁棒性的非单调影响。