研究人员提出了一种将大语言模型(LLMs)视为掩码扩散模型(MDMs)的新方法来扩展LLMs。这种方法将建模选择与架构差异解耦,从而能够更公平地比较标准的自回归(AR)方法和MDMs。研究表明,仅解码器的MDMs可以实现显著的推理速度提升,大约快25倍,同时保持与AR模型相当的困惑度。这项研究通过将核心建模决策与架构影响分离开来,为开发更具计算效率的基础模型提供了一条潜在途径。 AI
影响 提出了一种新的大语言模型(LLMs)的表述方式,可能带来显著的推理速度提升和计算成本降低。
排序理由 详细介绍大语言模型(LLMs)新表述方式的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →