研究人员调查了在低精度Transformer推理中使用随机舍入(SR)与就近舍入(RN)的对比,发现最佳方法取决于模型中的特定层。他们开发了一种可变精度随机舍入(VPSR)算法,以便在任意精度下进行实验。他们的分析显示,SR的误差包络比RN增长得慢,尤其是在多层感知机(MLP)中,而RN更适合语言模型头。通过将SR策略性地应用于MLP,将RN应用于头部,他们在DistilGPT-2上实现了接近全精度的困惑度。 AI
影响 优化低精度推理可以实现资源受限硬件上大型语言模型的更高效部署。
排序理由 学术论文,详细介绍了优化Transformer推理的新算法和实验结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →