实体
Florian E. Dorner
Florian E. Dorner
PulseAugur coverage of Florian E. Dorner — every cluster mentioning Florian E. Dorner across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新理论解释了验证器不完美如何影响LLM的测试时扩展
一篇题为“ROC-n-reroll:验证器不完美如何影响测试时扩展”的新论文探讨了通过在推理过程中增加计算量来提高语言模型性能的理论基础。研究证明,像Best-of-N和Rejection Sampling这样的方法的准确性直接关系到验证器ROC曲线的几何形状。使用Qwen和Llama模型在GSM8K和MATH500数据集上进行的实验证实,在固定计算量的情况下,Rejection Sampling比Best-of-N更有效,尽管两种方…
-
研究发现:LLM作为裁判的评估面临理论极限
一篇来自arXiv的新论文探讨了使用大型语言模型(LLM)作为裁判来评估其他AI模型的局限性。由Florian E. Dorner领导的研究表明,即使采用去偏技术,LLM裁判也无法显著减少对高质量人类标注的需求。该研究的主要发现是,如果裁判模型的准确性不高于其评估的模型,去偏方法最多只能将所需的真实标签数量减半。这凸显了LLM作为裁判范式的严重限制,尤其是在评估可能超越裁判能力的前沿模型时。