实体
Kish
Kish
PulseAugur coverage of Kish — every cluster mentioning Kish across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
LLM 评估方法需要对客户评分方差进行统计校正
本文深入探讨了评估大型语言模型(LLM)的统计细微之处,特别关注客户评分的分布如何影响这些评估的感知效力和方差。作者认为,当应用于 LLM 的偏好判断时,标准的统计方法可能会产生误导,因为这些判断并非简单的测量,而是复杂的交互作用。通过限制单个客户的影响并根据 Zipf 流量分布等因素进行调整,可以在不增加评分数量或成本的情况下,显著提高评估的准确性和统计效力。
-
LLM评估置信区间因数据聚类而过于狭窄
评估语言模型的常见假设是每个测试示例都是独立的,但在实践中这通常会被违反。当示例是聚类的(例如,来自同一文档的多个问题或同一对话的多个轮次)时,它们携带重叠的信息,导致置信区间比应有的更窄。这种统计偏差可能导致研究人员错误地认为他们取得了显著的改进,而实际上并没有。解决方案是通过对整个聚类进行重采样,而不是对单个示例进行重采样,以准确反映有效的样本量并纠正置信区间宽度。