一篇新论文研究了Qwen2.5-1.5B模型生成的完成组内验证器错误的独立性。该研究分析了多个数学数据集上近25,000组八个完成项,发现组内验证器错误具有显著的0.530的相关性。这种依赖性因答案格式而异,分数和符号表达式比单位注释显示出更强的聚类。研究结果表明,对验证器噪声的分析应考虑提示难度和答案形式,而不是仅仅依赖于聚合错误率。 AI
影响 强调了对LLM输出进行更细致评估的必要性,尤其是在复杂推理任务中。
排序理由 研究论文,分析模型在特定数据集上的行为。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →