本文为 LLM Harnesses 中的部分相关验证器级联引入了一个新理论,解决了该领域的一个开放性问题。它将虚假接受率建模为一个潜在变量,揭示了对数几率增益在门数量上是凹的,导致失败衰减呈多项式而非指数级。该理论还确定了一个可靠性饱和的“盲点上限”,以及一个表明增加更多门会产生不利影响的三分法定理。 AI
影响 为提高 LLM 评估系统的可靠性提供了理论框架。
排序理由 学术论文发布在 arXiv 上,详细介绍了 LLM Harnesses 的新理论。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- arXiv:2606.15712
- Hugging Face
- Odds Law
- Partially Correlated Verifier Cascades in LLM Harnesses: Concave Log-Odds, Polynomial Reliability, and Blind-Spot Ceilings
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →