Making Bias Non-Predictive: Training Robust LLM Reasoning via Reinforcement Learning
消除偏见的可预测性:通过强化学习训练鲁棒的大语言模型推理
AI总结 本文提出Epistemic Independence Training (EIT)框架,通过使偏见提示非预测性来提升大语言模型的推理鲁棒性,实验表明其在对抗性偏见下表现更优,并能泛化至多种偏见类型。
作者
AI / Security
消除偏见的可预测性:通过强化学习训练鲁棒的大语言模型推理
AI总结 本文提出Epistemic Independence Training (EIT)框架,通过使偏见提示非预测性来提升大语言模型的推理鲁棒性,实验表明其在对抗性偏见下表现更优,并能泛化至多种偏见类型。
SecPI: 通过安全推理内化实现安全代码生成
机构 * University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 SecPI通过内化结构化安全推理,使推理模型在无需安全指令的情况下生成安全代码,经验证在多个安全基准测试中显著提升代码功能正确性和安全性。
上下文水印用于大型语言模型
机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) ; UC Berkeley(加州大学伯克利分校)
AI总结 本文提出In-Context Watermarking方法,通过提示工程在生成文本中嵌入水印,无需访问解码过程,适用于检测AI生成内容,验证了其作为通用且实用的水印方法的可行性。
Comments ICLR2026