Distributional Semantics Tracing: A Framework for Explaining Hallucinations in Large Language Models
分布语义追踪:一种解释大语言模型幻觉的框架
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文提出分布语义追踪框架,通过解码残差流状态构建语义图谱,揭示大语言模型幻觉源于表征漂移,通过轻量因果追踪验证假设,实验显示其解释效果优于基线方法。