一篇新发表在 arXiv 上的研究论文,考察了大型语言模型(LLM)作为论文评分者的可靠性和一致性。该研究将 LLM 视为人类评分者,发现在不同的 LLM 评分者和版本之间存在显著的评分偏见和版本不稳定性。尽管 LLM 表现出一定的自我一致性,但其准确性并未达到人类水平,并且在适当校准后,其表现出的“光环效应”与训练有素的人类评分者相当。 AI
影响 强调了 LLM 在教育评估中可靠性方面存在的潜在问题,建议在部署用于评分时需谨慎。
排序理由 发表在 arXiv 上的研究论文,详细介绍了 LLM 性能的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →