TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue
TD-DPO:用于减轻临床自闭症干预对话中谄媚行为的差异感知偏好优化
Shuzhong Lai, Junhong Lai, Chenxi Li, Qing Zhou, Haifeng Li, Gang Pan, Lin Yao, Yueming Wang
机构
*
Nanhu Brain-Computer Interface Institute(南湖脑机接口研究所)
;
MOE Frontiers Science Center for Brain and Brain-Machine Integration, Zhejiang University(浙江大学脑与脑机融合教育部前沿科学中心)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
Children’s Hospital Zhejiang University School of Medicine(浙江大学医学院附属儿童医院)
;
State Key Laboratory of Brain-Machine Intelligence(脑机智能技术国家重点实验室)
;
Department of Neurobiology, Affiliated Mental Health Center and Hangzhou Seventh People’s Hospital, Zhejiang University School of Medicine(浙江大学医学院附属精神卫生中心和杭州市第七人民医院神经生物学系)
机构
*
Peking University(北京大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Tsinghua University(清华大学)
;
Beihang University(北京航空航天大学)
;
Xiaohongshu Inc.(小红书公司)
机构
*
National Taiwan University(国立台湾大学)
;
Texas A&M University(德克萨斯A&M大学)
;
Appier AI Research(Appier人工智能研究院)
;
Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)
Position: The Complexity of Perfect AI Alignment -- Formalizing the RLHF Trilemma
位置:完美AI对齐的复杂性——形式化RLHF三重困境
Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary
机构
*
Berkeley AI Safety Initiative (BASIS), University of California, Berkeley(伯克利人工智能安全倡议(BASIS),加州大学伯克利分校)
;
AWS Generative AI Innovation Center, Amazon Web Services(亚马逊网络服务生成式人工智能创新中心)
;
Meta AI
;
Stanford University(斯坦福大学)
;
Northeastern University, Seattle, WA, USA(东北大学,西雅图,华盛顿州,美国)