大型语言模型(LLM)即使在温度设置为0时也会表现出不可复现的输出,这是由于推理过程中的批处理。这是因为批处理计算涉及与非批处理不同的矩阵乘法和浮点运算,导致logits的微小差异,当概率接近时会改变token的选择。作者在A/B测试比较过滤器的有效性时发现了一个不可能的结果,从而发现了这个问题,揭示了底层模型输出在运行之间存在显著差异(约30%的记录发生变化),这并非由于采样,而是由于批处理。 AI
影响 LLM输出的可复现性对于研究和生产至关重要;这一发现表明批处理会引入微妙但显著的变化,影响基准测试和A/B测试。
排序理由 该条目详细介绍了关于LLM推理行为的技术发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →