Cultural Value Alignment Via Latent Activation Steering in Large Language Models
大型语言模型中通过潜在激活引导的文化价值对齐
机构 * University of Copenhagen(哥本哈根大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.CL
AI总结 提出一种基于场景行为探测和潜在激活引导的框架,用于评估和干预LLMs的文化价值,发现文化价值以耦合结构编码,限制了精确对齐。
Comments ACL 2026 Student Research Workshop (Non-Archival Track)