Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction
建构性对齐:人机交互中的偏好动态治理
机构 * Stanford University(斯坦福大学) ; Northwestern University(西北大学)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.CY
AI总结 提出建构性对齐范式,将对齐问题重构为控制人类偏好轨迹演化的控制问题,而非静态偏好满足,通过控制论框架确保价值轨迹的连贯性与反思性。
Comments 23 pages, 1 figure; Proceedings of the AAAI-26 Workshop on Machine Ethics