When Scanners Lie: Evaluator Instability in LLM Red-Teaming
当扫描器撒谎:在LLM红队测试中的评估者不稳定性
AI总结 本文研究了LLM安全评估中评估者不稳定性问题,提出了一种可靠性意识的评估框架,通过量化评估者分歧和验证方法提升评估准确性,发现22个攻击类别存在评估不稳定现象,使评估准确率从72%提升至89%。
Comments Submitted to the EvalEval Workshop at ACL 2026
期刊&会议
Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing
当扫描器撒谎:在LLM红队测试中的评估者不稳定性
AI总结 本文研究了LLM安全评估中评估者不稳定性问题,提出了一种可靠性意识的评估框架,通过量化评估者分歧和验证方法提升评估准确性,发现22个攻击类别存在评估不稳定现象,使评估准确率从72%提升至89%。
Comments Submitted to the EvalEval Workshop at ACL 2026
安全潜力修剪:提升对抗VLM劫持的安全提示而无需重新训练
AI总结 本文提出安全潜力修剪方法,通过去除对安全提示不敏感的权重,增强安全路径,提升VLM对抗能力,减少攻击成功率22%。
Comments Accepted for publication in Transactions of the Association for Computational Linguistics (TACL)
QAQ:双向语义一致性用于选择高质量的合成代码指令
AI总结 本文提出QAQ框架,通过双向语义一致性评估合成数据质量,利用反向互信息量化答案对查询的信息增益,实验表明选择25%数据可达到全数据训练效果,提升数据筛选效率。
Comments 14 pages, 5 figures. Under review at ACL 2026
将人格融入数字人类:一种基于大语言模型的虚拟现实方法综述
AI总结 本文综述了利用大语言模型驱动虚拟现实中的数字人类人格塑造方法,探讨了零样本、少样本和微调等技术,并指出计算需求、延迟及多模态交互评估框架缺乏等挑战。
Comments Revised and expanded version of the survey published in Findings of EMNLP 2025. Includes 14 pages and 2 figures
Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, 9519--9532
ArithmAttack:评估LLMs在数学问题解决中对噪声上下文的鲁棒性
AI总结 本文提出ArithmAttack方法,评估LLMs在包含标点符号噪声的提示下鲁棒性,发现所有模型在噪声增加时表现下降。
Comments Accepted to LLMSEC Workshop at ACL 2025