Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance
构建快速,评估缓慢:管道选择主导自动可解释性得分方差
机构 * ETH Zürich(苏黎世联邦理工学院)
AI总结 研究稀疏自动编码器可解释性得分的跨论文比较,通过多指标、多模型及方法变化轴的实验发现方法方差主导得分方差,排名不稳定,基于得分的比较可能反映管道差异,贡献评估方法以推动可解释性研究。
高校专区
构建快速,评估缓慢:管道选择主导自动可解释性得分方差
机构 * ETH Zürich(苏黎世联邦理工学院)
AI总结 研究稀疏自动编码器可解释性得分的跨论文比较,通过多指标、多模型及方法变化轴的实验发现方法方差主导得分方差,排名不稳定,基于得分的比较可能反映管道差异,贡献评估方法以推动可解释性研究。
重要的不是你说了什么,而是你怎么说:评估大语言模型对信念表达的回应
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Zurich(苏黎世大学) ; UC San Diego(加州大学圣地亚哥分校)
AI总结 研究用户信念表达形式对大语言模型的影响,引入基于语言维度的类型学,生成可控查询对,评估不同架构、规模和训练阶段的16个LLMs,发现响应行为差异及能显著说服模型的特定信念表达,揭示语言框架对模型情境整合的影响。
Comments Published at ACL 2026