Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model
深度对齐但不确定性依然存在:通过将不安全行为归因于基础模型来改进推理时间的安全性
Pankayaraj Pathmanathan, Furong Huang
机构
*
University of Maryland College Park(马里兰大学学院市)
Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach
基于原始能力的分层强化学习的直接偏好优化:双层方法
Utsav Singh, Souradip Chakraborty, Wesley A. Suttle, Brian M. Sadler, Derrik E. Asher, Anit Kumar Sahu, Mubarak Shah, Vinay P. Namboodiri, Amrit Singh Bedi
机构
*
IIT Kanpur(印度理工学院坎浦尔分校)
;
University of Maryland, College Park(马里兰大学学院公园分校)
;
U.S. Army Research Laboratory(美国陆军研究实验室)
;
University of Texas, Austin(德克萨斯大学奥斯汀分校)
;
Oracle(Oracle公司)
;
University of Central Florida(中央佛罗里达大学)
;
University of Bath(巴斯大学)