研究人员正在探索降低大型语言模型计算和内存需求的方法,而不仅仅是增加模型大小。一种有前途的方法 BitNet,研究在权重限制为三元值(-1、0、+1)的模型上进行训练。该技术将内存需求显著降低了一个数量级,并将昂贵的矩阵乘法转变为简单的加法。Microsoft 已经使用 4 万亿个 token 训练了一个 20 亿参数的 BitNet 模型,证明了其匹配全精度基线性能的潜力。 AI
影响 这项研究通过大幅减少内存占用和计算成本,有可能使更大、更强大的模型在消费级硬件上运行。
排序理由 该条目讨论了一种新颖的研究方法(BitNet),用于使用三元权重训练 LLM,详细介绍了其潜在优势以及 Microsoft 的具体实现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →