Weight Tying Biases Token Embeddings Towards the Output Space
参数共享使词嵌入偏向输出空间
机构 * EleutherAI ; University of California Berkeley(加州大学伯克利分校)
AI总结 本文研究了参数共享对词嵌入空间的影响,发现共享矩阵更偏向输出预测而非输入表示,且早期训练中输出梯度主导导致偏差,通过调整梯度可缓解此问题。
高校专区
参数共享使词嵌入偏向输出空间
机构 * EleutherAI ; University of California Berkeley(加州大学伯克利分校)
AI总结 本文研究了参数共享对词嵌入空间的影响,发现共享矩阵更偏向输出预测而非输入表示,且早期训练中输出梯度主导导致偏差,通过调整梯度可缓解此问题。
一种增强型变换器用于DNA序列分类
机构 * Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出了一种结合玻尔兹曼机和变换器的模型,用于DNA序列分类,通过引入结构化的二进制门控变量和能量函数约束,提升对潜在相互作用和高阶依赖的建模能力。
Comments 19 pages
StreamDiT:实时流式文本到视频生成
机构 * UC Berkeley(加州大学伯克利分校) ; Meta
AI总结 本文提出StreamDiT模型,通过流匹配和混合训练提升内容一致性和视觉质量,实现16FPS实时视频生成,支持流式生成等实时应用。
Comments CVPR 2026
草稿与修剪:提升逻辑推理自动形式化可靠性
机构 * University of California, Berkeley(加州大学伯克利分校) ; Microsoft(微软)
AI总结 本文提出D&P框架,通过多样性与验证提升自动形式化逻辑推理可靠性,实验显示在多个基准测试中显著优于现有方法,如在AR-LSAT上准确率达78.43%。