TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue
TD-DPO:用于减轻临床自闭症干预对话中谄媚行为的差异感知偏好优化
机构 * Nanhu Brain-Computer Interface Institute(南湖脑机接口研究所) ; MOE Frontiers Science Center for Brain and Brain-Machine Integration, Zhejiang University(浙江大学脑与脑机融合教育部前沿科学中心) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Children’s Hospital Zhejiang University School of Medicine(浙江大学医学院附属儿童医院) ; State Key Laboratory of Brain-Machine Intelligence(脑机智能技术国家重点实验室) ; Department of Neurobiology, Affiliated Mental Health Center and Hangzhou Seventh People’s Hospital, Zhejiang University School of Medicine(浙江大学医学院附属精神卫生中心和杭州市第七人民医院神经生物学系)
专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract);safety(abstract);分类 cs.LG
AI总结 研究针对大语言模型在自闭症干预对话中的谄媚问题,提出最小编辑数据增强策略及令牌级差异直接偏好优化方法,通过加权差异令牌、降权共享令牌抑制背景漂移,经实验验证该方法能在减轻谄媚与保留干预能力间达较好平衡。
Comments commited to EMNLP2026