Accounting for Context: Shaping Moral Credences for Value Alignment
考虑情境:塑造道德信念以实现价值对齐
机构 * University of Oxford(牛津大学)
专题命中 幻觉与事实性 :alignment(title);分类 cs.AI
AI总结 本文针对价值对齐中道德多元性问题,提出在聚合道德评估时必须考虑情境因素,并形式化道德不确定性下的决策,揭示弱帕累托原则的违反是辛普森悖论的一种变体。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
考虑情境:塑造道德信念以实现价值对齐
机构 * University of Oxford(牛津大学)
专题命中 幻觉与事实性 :alignment(title);分类 cs.AI
AI总结 本文针对价值对齐中道德多元性问题,提出在聚合道德评估时必须考虑情境因素,并形式化道德不确定性下的决策,揭示弱帕累托原则的违反是辛普森悖论的一种变体。
谄媚式赞美:评估语言模型中的过度赞美
机构 * University of Cincinnati(辛辛那提大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Texas A&M University(德克萨斯大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 提出参数化框架衡量赞美是否过度,发现谄媚式赞美在社交和解释性领域远多于客观推理领域,且现有方法无法可靠测量。
通过结构化内联引文生成实现显式证据基础
机构 * University of the Basque Country (UPV/EHU)(巴斯克大学) ; IT University of Copenhagen(哥本哈根IT大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 提出FullCite框架,通过提示生成、约束解码和后处理跨度对齐三种策略生成结构化内联引文,在三个QA基准上评估引文质量和忠实性,发现LLMs虽能识别相关文档但难以精确定位支持性证据跨度。
超越事后解释:通过概率中介迈向玻璃箱AI
机构 * Manuele Leonelli(曼努埃尔·莱奥内利)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 针对大语言模型在关键领域的不透明性,提出玻璃箱框架,利用贝叶斯网络作为事前中介层,实现可审计推理、不确定性量化和可争议输出。