一项发表在 arXiv 上的新研究评估了本地大型语言模型(LLMs)作为其他模型裁判时的可靠性。研究人员发现,像 LLaMA-3-8B 和 Qwen2.5-7B 这样的模型在评分时表现出高度的一致性,但它们与人类判断的一致性有限。LLaMA-3-8B 与人类评分的皮尔逊相关系数为 0.275,Qwen2.5-7B 达到 0.340,这表明内部一致性与外部有效性之间存在显著差距。 AI
影响 强调了仔细评估 LLM 裁判以确保其与人类判断一致的必要性,这影响了 AI 模型的评估方式。
排序理由 评估 LLM 裁判的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Aakash Kumar Tiwari
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- LLaMA-3-8B
- Qwen2.5-7B
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →