Decision-Level Hijacking: Injecting Cognitive Bias into Large Language Models via Bit-Flip Attacks
决策级劫持:通过位翻转攻击向大语言模型注入认知偏差
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG
AI总结 研究大语言模型在高风险决策场景中的决策级劫持问题,提出CogBias框架,利用位翻转攻击,通过可微情感评估器等将主观偏好转化为优化信号,经实验验证该方法能在少量位翻转下诱导目标主题立场转变,破坏模型价值对齐。