How Far Will They Go? Red-Teaming Online Influence with Large Language Models
它们会走多远?使用大型语言模型对在线影响力进行红队测试
机构 * Information Sciences Institute University of Southern California(信息科学研究所 乌德穆尔特国立大学)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出一个红队测试框架,通过测量大型语言模型在争议话题上的政治观点表达范围(Overton Window),并量化简单自然语言越狱如何扩展该范围,发现开源LLM在政治表达上存在系统性不对称,且越狱效果因模型系列而异。
Comments 30 pages, 8 figures, submitted to COLM 2026