PulseAugur
实时 16:46:10
English(EN) When Rubrics Change: Cross-Rubric Generalization for Critical Thinking Essay Scoring

新的基于 Llama 的模型提高了论文评分对未见评分标准的泛化能力

研究人员开发了一个新的自动论文评分(AES)框架,该框架提高了对未见评分标准的泛化能力。通过使用称为“特质”(traits)的评分标准无关的中间表示和受控监督,他们微调的基于 Llama 的模型在最具挑战性的场景中,与没有特质的基线相比,宏 F1 分数提高了 5.0%。该方法还显示出与专有模型相比具有竞争力,其中最好的开源模型在宏 F1 上比 GPT-5-mini 提高了 2.1%,仅比 GPT-5 落后 1.9%。 AI

影响 增强了人工智能系统跨不同评分标准评估论文的能力,有潜力改进教育工具。

排序理由 详细介绍一种新的自动论文评分方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的基于 Llama 的模型提高了论文评分对未见评分标准的泛化能力

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Andrew Lan ·

    当评分标准改变时:跨评分标准泛化用于批判性思维论文评分

    Automated essay scoring (AES) research has largely focused on cross-prompt generalization, where essays from unseen prompts are scored while the scoring criteria are typically held constant. In practice, however, educators may revise or even introduce new rubrics in their scoring…