PreDiff-LM: Pretrained Discrete Masked Diffusion Language Modeling with Hybrid Attention
PreDiff-LM:具有混合注意力的预训练离散掩码扩散语言模型
机构 * University of Southern California(南加州大学) ; New York University(纽约大学) ; Columbia University(哥伦比亚大学) ; University of California, Berkeley(加州大学伯克利分校) ; Stevens Institute of Technology(史蒂文斯理工学院) ; University of Notre Dame(圣母大学) ; Nanyang Technological University(南洋理工大学)
AI总结 研究离散掩码扩散语言模型中因果预训练与双向去噪协调问题,提出PreDiff-LM模型,通过混合注意力机制改进无条件困惑度等指标,在多方面优于先前扩散基线,明确与优化AR模型的差距,为预训练因果主干调整提供补充机制。