PulseAugur
实时 08:57:14
实体 Black-Box LLM Observers

Black-Box LLM Observers

PulseAugur coverage of Black-Box LLM Observers — every cluster mentioning Black-Box LLM Observers across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_235416 ·

    LLM 裁判测量不稳定,可靠性测试失败

    一项新的研究论文强调了使用大型语言模型(LLM)作为评估 AI 输出的裁判时存在的重大不可靠性问题。研究发现,发送到同一模型端点的相同请求会随着时间的推移产生不同的排名,同一窗口重复排名的 Spearman 相关性仅为 0.400,次日重测为 0.78,远低于要求的 0.90 和 0.99。研究确定了三个主要原因:有偏见的标签到含义映射、候选差距远小于测量仪器的噪声水平,以及模型响应的固有变异性。即使在切换提供商或尝试通过采样来缓解这…