引入了一个新的条件泛化框架,用于评估自动化评分系统的可靠性,特别是在自动化作文评分等环境中。该框架将不同的编码器架构和评分头族视为测量条件的集合,超越了简单的聚合可靠性估计。通过比较分析预测和经验扫描,该框架诊断了实现的配置集合,并根据熵定义的响应层级来提供证据。在计时L2写作上的演示显示,该系统具有聚合可靠性(Phi约0.76),在不同熵层级上的可靠性保持较高但略有下降,表明决策研究要求不同。 AI
影响 该框架通过考虑不同条件下性能的变化,可以提高AI评分系统的可靠性和公平性。
排序理由 该项目是一篇研究论文,详细介绍了一个用于评估AI系统的新框架。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- Automated essay scoring
- Conditional Generalizability Framework
- D-study
- encoder architectures
- G-study
- Hugging Face
- scoring-head families
- second language composition
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →