H$^{2}$MT: Semantic Hierarchy-Aware Hierarchical Memory Transformer
H$^{2}$MT: 语义层次感知的层次记忆Transformer
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 提出H$^{2}$MT模型,通过离线构建语义层次结构并利用自底向上的后序聚合计算记忆嵌入,在推理时实现从粗到细的查询路由,从而在长上下文推理中实现质量与效率的权衡。
高校专区
H$^{2}$MT: 语义层次感知的层次记忆Transformer
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 提出H$^{2}$MT模型,通过离线构建语义层次结构并利用自底向上的后序聚合计算记忆嵌入,在推理时实现从粗到细的查询路由,从而在长上下文推理中实现质量与效率的权衡。
WorldBench: 为世界模型诊断评估进行物理辨析
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Sony AI(索尼人工智能) ; Yale University(耶鲁大学) ; DEVCOM Army Research Laboratory(陆军研究实验室)
AI总结 WorldBench通过概念特定的解耦评估,提升世界模型的物理推理能力评估的准确性和可扩展性。
Comments Webpage: this https URL (https://world-bench.github.io/)
大型语言模型在持续预训练中如何学习概念?
机构 * UC Davis(加州大学戴维斯分校) ; Virginia Tech(弗吉尼亚理工大学) ; UCLA(加州大学洛杉矶分校) ; Meta AI
AI总结 本研究揭示了大型语言模型在持续预训练中概念学习的动态机制,通过分析概念电路揭示了概念获取、遗忘及相互作用的规律,为设计更可解释的训练策略提供依据。
Comments 19 pages, 27 figures