研究人员开发了一个新的自动论文评分(AES)框架,该框架提高了对未见评分标准的泛化能力。通过使用称为“特质”(traits)的评分标准无关的中间表示和受控监督,他们微调的基于 Llama 的模型在最具挑战性的场景中,与没有特质的基线相比,宏 F1 分数提高了 5.0%。该方法还显示出与专有模型相比具有竞争力,其中最好的开源模型在宏 F1 上比 GPT-5-mini 提高了 2.1%,仅比 GPT-5 落后 1.9%。 AI
影响 增强了人工智能系统跨不同评分标准评估论文的能力,有潜力改进教育工具。
排序理由 详细介绍一种新的自动论文评分方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →