Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment
摩擦性政策优化用于大语言模型:认知干预、风险敏感控制与反思对齐
机构 * Brandeis University(布拉德雷大学) ; Colorado State University(科罗拉多州立大学)
专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出摩擦性政策优化框架,通过干预管理认知与规范风险,引入摩擦干预分类和统一方法,提升模型的认知能力与对齐性。
Comments Frictive Policy Optimization; epistemic alignment; risk-sensitive control; LLM alignment; clarification and refusal; preference learning; trust regions; dialogue agents