arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

ETH Zurich(苏黎世联邦理工学院)

2026-07-23 至 2026-07-23 共收录 2
2607.19386 2026-07-23 cs.LG cs.CL 新提交

Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance

构建快速,评估缓慢:管道选择主导自动可解释性得分方差

Sinie van der Ben, Neele Roch, Anna Hedström, Mennatallah El-Assady

机构 * ETH Zürich(苏黎世联邦理工学院)

AI总结 研究稀疏自动编码器可解释性得分的跨论文比较,通过多指标、多模型及方法变化轴的实验发现方法方差主导得分方差,排名不稳定,基于得分的比较可能反映管道差异,贡献评估方法以推动可解释性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18232 2026-07-23 cs.CL 版本更新

It's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of Belief

重要的不是你说了什么,而是你怎么说:评估大语言模型对信念表达的回应

Kevin Du, Clara Kümpel, Michelle Wastl, Alex Warstadt

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) UC San Diego(加州大学圣地亚哥分校)

AI总结 研究用户信念表达形式对大语言模型的影响,引入基于语言维度的类型学,生成可控查询对,评估不同架构、规模和训练阶段的16个LLMs,发现响应行为差异及能显著说服模型的特定信念表达,揭示语言框架对模型情境整合的影响。

Comments Published at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏