Interaction Scaling: Grounding the Third Axis of Test-Time Compute
交互缩放:奠定测试时计算的第三轴基础
机构 * Pine AI(松树人工智能公司) ; University of Washington(华盛顿大学)
AI总结 研究测试时增加计算量的新方法,提出交互缩放概念,通过模型与外部仪器交互突破传统方法局限,在硬编码任务和视觉工件处理上展现优势,表明交互缩放真实且区别于推理和采样,需反馈和度量基于实际。
高校专区
交互缩放:奠定测试时计算的第三轴基础
机构 * Pine AI(松树人工智能公司) ; University of Washington(华盛顿大学)
AI总结 研究测试时增加计算量的新方法,提出交互缩放概念,通过模型与外部仪器交互突破传统方法局限,在硬编码任务和视觉工件处理上展现优势,表明交互缩放真实且区别于推理和采样,需反馈和度量基于实际。
通过匹配的 FP16 中间层分解运行时、内核和量化加速:基于四块 NVIDIA RTX A5000 GPU 的硬件条件案例研究
机构 * University of Washington(华盛顿大学)
AI总结 研究通过匹配的 FP16 中间层分解运行时、内核和量化加速,以四块 NVIDIA RTX A5000 GPU 为案例,分析加速各部分占比、分片影响因素等,得出运行时占主要加速比例,量化可扩展并发用户,还探讨了实例选择及有效性威胁。
Comments 36 pages, 8 figures
分数集之前的核心集:用于大语言模型基准测试的评估无监督提示子集选择
机构 * University of Washington(华盛顿大学) ; University of California, Berkeley(加利福尼亚大学伯克利分校) ; Oracle(甲骨文公司) ; Together AI(Together AI公司) ; LMSYS ; NVIDIA(英伟达公司)
AI总结 研究大语言模型基准测试的核心集选择,采用评估无监督方法,利用次模子集选择,开发多种次模函数。在新大规模套件上实验发现设施选址函数效果好,该目标不限于特定模式,在相关排行榜上表现优且计算成本低,证明次模性对基准压缩有用。