困惑度是用于评估语言模型的一个指标,通过衡量模型对给定文本的惊讶程度来计算。较低的困惑度分数表明模型认为文本更可预测,因此更好地理解了它,这类似于掷一个面数更少的骰子。该指标的计算方法是,对文本中每个位置的真实下一个词的概率取负对数并求平均值,然后对结果进行指数运算。 AI
影响 提供了对评估语言模型性能的关键指标的基础理解。
排序理由 该条目解释了语言模型评估中的一个核心概念(困惑度),并提供了如何衡量它的教程,包括代码示例。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →