Multi-Head Attention Residuals
多头注意力残差
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
AI总结 该研究提出多头注意力残差(MHAR),通过多子空间头优化注意力残差,在多参数规模下降低Transformer验证损失,提升训练吞吐量,中途训练8B模型在GSM8K和GPQA上获显著增益。
高校专区
多头注意力残差
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
AI总结 该研究提出多头注意力残差(MHAR),通过多子空间头优化注意力残差,在多参数规模下降低Transformer验证损失,提升训练吞吐量,中途训练8B模型在GSM8K和GPQA上获显著增益。
检索增强可解释学习:迈向医疗保健领域特定任务的零样本模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) ; GenBio AI(基因生物人工智能公司) ; Intel(英特尔公司)
AI总结 研究针对医疗保健领域特定任务零样本模型问题推出检索增强可解释学习(RAIL)框架,通过检索相关任务并传递结构生成新预测器,概率公式提供不确定性支持可靠性感知部署,在临床程序预测任务中性能可靠,还提升模型透明度。
Comments A preliminary, non-archival version of this work, titled RAG-IM, was presented at NeurIPS 2024 workshops and the ML4H 2024 Findings track. The work was subsequently renamed Retrieval-Augmented Interpretable Learning (RAIL)
专家选择路由使扩散语言模型实现自适应计算
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Scitix ; Cornell University(康奈尔大学) ; Duke University(杜克大学) ; UC Davis(加州大学戴维斯分校) ; Southern University of Science and Technology(南方科技大学)
AI总结 本文提出专家选择路由方法,通过确定性负载平衡提升扩散语言模型的吞吐量和收敛速度,并展示如何通过时间步依赖的专家容量优化计算分配,从而在匹配FLOPs下提升性能。
Comments Accepted at COLM 2026
DiffPhysCam:面向逆渲染与具身智能的可微分基于物理的相机仿真
机构 * Simulation-Based Engineering Lab, University of Wisconsin-Madison(模拟基于工程实验室,威斯康星大学麦迪逊分校)
AI总结 本文提出DiffPhysCam,一款可微分基于物理的相机模拟器,解决现有虚拟相机局限,支持正向与逆渲染,经实验验证可提升机器人感知性能,还用于自主地面车辆导航的虚拟实验。
Comments 37 pages, 24 figures, and 5 tables. Code of DiffPhysCam-CamCaliExp: https://github.com/DanielYamChen/DiffPhysCam-CamCaliExp Code of DiffPhysCam-NovelViewSynthesis: https://github.com/DanielYamChen/DiffPhysCam-NovelViewSynthesis Data of DiffPhysCam_Data: https://huggingface.co/datasets/DanielYamChen/DiffPhysCam_Data Simulation video: https://youtu.be/gQwSMrdmHJI