LLM 在 temperature=0(通常选择概率最高的 token)下的推理并不保证是确定性的,因为浮点运算和 GPU 上的批处理的性质。共享 GPU 资源的并发请求会改变矩阵乘法和注意力等计算中的操作顺序,导致输出概率出现微小差异。当两个最高概率 token 的概率非常接近时,这些微小的差异会导致模型选择不同的 token,从而产生完全不同的输出序列。为了实现真正的逐位可重现性,需要专门的批处理不变内核,这可能会带来性能成本。 AI
影响 为使用 LLM 进行评估和回归测试的开发人员强调了一个微妙但重要的细节。
排序理由 对 LLM 推理行为细微之处的技术解释。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →