A Theory of Generalization in Deep Learning
深度学习中泛化的理论
机构 * Stanford University(斯坦福大学)
AI总结 本文提出深度学习中泛化的非渐近理论,通过经验神经切线核划分输出空间,在信号方向快速消散误差,而在噪声方向通过近零特征值捕获残余误差。该理论解释了良性过拟合、双下降等现象,并推导出一个精确的群体风险目标。
高校专区
深度学习中泛化的理论
机构 * Stanford University(斯坦福大学)
AI总结 本文提出深度学习中泛化的非渐近理论,通过经验神经切线核划分输出空间,在信号方向快速消散误差,而在噪声方向通过近零特征值捕获残余误差。该理论解释了良性过拟合、双下降等现象,并推导出一个精确的群体风险目标。
野性算术:Llama使用十进制加法来推理循环概念
机构 * Northeastern University(东北大学) ; Technion IIT(技术ion理工学院) ; Harvard University(哈佛大学) ; Stanford University(斯坦福大学)
AI总结 研究Llama-3.1-8B如何用十进制加法处理循环概念,发现其通过通用加法机制而非模运算实现,利用傅里叶特征进行计算,揭示了因果抽象与特征几何的交互对语言模型的理解作用。
P3-LLM:一种用于边缘LLM推理的NPU-PIM集成加速器,采用混合数值格式
机构 * Department of Electrical and Computer Engineering, Cornell University(康奈尔大学电气与计算机工程系) ; EAST-MICAS, KU Leuven(KU莱顿大学EAST-MICAS) ; Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)
AI总结 本文提出P3-LLM,通过混合精度量化和PIM架构设计,提升边缘LLM推理效率,实现4.9倍以上的加速效果。
Comments Accepted to the 53rd IEEE/ACM International Symposium on Computer Architecture (ISCA), 2026
生成式接口用于语言模型
机构 * Stanford University(斯坦福大学) ; Georgia Tech(佐治亚理工学院)
AI总结 本文提出生成式接口,通过主动生成用户界面提升多轮交互效率,实验表明其在人类偏好上提升达72%。
Comments ACL 2026 Findings