名为THPT-Ladder的新基准已被开发出来,用于评估语言模型在人类考试中的表现,特别关注评分中的部分学分问题。该基准采用了越南2025年凸度评分标准,该标准不同于标准的准确性指标,因为它不对部分正确答案给予比例学分。研究发现,该评分标准严重惩罚了模型,改变了它们相对于人类考生的感知能力和百分位排名。研究强调,传统的准确性衡量方法无法充分捕捉模型在非加性评分系统下的表现。 AI
影响 强调了需要AI评估方法来考虑细微的评分方案,从而影响AI在教育背景下的表现如何被理解。
排序理由 该集群包含一篇介绍用于评估AI模型的新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →