arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Los Angeles(加州大学洛杉矶分校)

2026-08-10 至 2026-08-10 共收录 3
2607.13491 2026-08-10 cs.LG cs.AI 版本更新

DeepLoop: Depth Scaling for Looped Transformers

DeepLoop:循环变换器的深度缩放

Shuzhen Li, Yifan Zhang, Jiacheng Guo, Quanquan Gu, Mengdi Wang

机构 * Princeton University(普林斯顿大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 研究循环变换器中深度缩放问题,提出DeepLoop方法,通过控制访问对齐系数形式化绑定深度效应,保持特定架构并设置参数,在不同规模GPT风格模型上实验,结果显示稳定循环深度需考虑参数访问的残差缩放规则。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12383 2026-08-10 cs.CL 版本更新

Beyond Binary Detection: A Multi-Dimensional Taxonomy of Cancer Misinformation on Reddit

超越二元检测:Reddit 上癌症错误信息的多维分类法

Aria Pessianzadeh, Pooriya Jamie, Naima Sultana, Georgia Himmelstein, Yuliya Zektser, Patricia Ganz, Homa Hosseinmardi, Amir Ghasemian, Rezvaneh Rezapour

机构 * Drexel University(德雷塞尔大学) UCLA(加州大学洛杉矶分校)

AI总结 研究旨在刻画Reddit上癌症错误信息,引入多维分类法涵盖七个维度。利用专家标注数据评估大语言模型,分析错误信息。发现其约占癌症讨论6%,少样本提示可提高性能,还识别出常见错误信息叙述,为相关建模奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09904 2026-08-10 cs.LG cs.AI math.OC 版本更新

Stability of Transformers under Layer Normalization

层归一化下Transformer的稳定性

Kelvin Kan, Xingjian Li, Benjamin J. Zhang, Tuhin Sahai, Stanley Osher, Krishna Kumar, Markos A. Katsoulakis

机构 * UCLA(加州大学洛杉矶分校) UT Austin(德克萨斯大学奥斯汀分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校) SRI International(SRI国际) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 本文系统性研究不同层归一化放置下Transformer的前向与反向稳定性,推导相关边界、分析梯度反向传播影响,为残差步长缩放提供指导,其框架可用于检查新型Transformer架构的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏