Auditing Framing-Sensitive Behavioral Instability in Large Language Models for Mental Health Interactions
审计心理健康交互中大语言模型的框架敏感行为不稳定性
机构 * a School of computer science, digital engineering and AI, Long Island University, Brooklyn, NY, USA(a 计算科学与数字工程及人工智能学院,罗格斯大学,布鲁克林,纽约,美国) ; b Department of Psychology, Long Island University, Brooklyn, NY, USA(b 心理学系,罗格斯大学,布鲁克林,纽约,美国)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究通过控制匹配提示,调查大语言模型在不同上下文框架下的行为变异性,发现框架系统性改变解释响应倾向,且内部表征可解码,激活操控可部分调节行为。