实体
second language composition
second language composition
PulseAugur coverage of second language composition — every cluster mentioning second language composition across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新框架评估人工智能驱动的作文评分的可靠性
研究人员引入了一个新的条件泛化框架来评估自动化作文评分系统的可靠性。该框架将编码器架构和评分头家族视为可接受的测量条件集合,超越了简单的聚合可靠性估计。通过根据熵定义的响应层级来条件化证据,研究表明,虽然总体可靠性保持较高水平(Phi 约 0.76),但在不同的层级上会适度下降,这表明基于响应复杂性的决策研究有不同的要求。
-
新框架评估AI评分在不同条件下的可靠性
引入了一个新的条件泛化框架,用于评估自动化评分系统的可靠性,特别是在自动化作文评分等环境中。该框架将不同的编码器架构和评分头族视为测量条件的集合,超越了简单的聚合可靠性估计。通过比较分析预测和经验扫描,该框架诊断了实现的配置集合,并根据熵定义的响应层级来提供证据。在计时L2写作上的演示显示,该系统具有聚合可靠性(Phi约0.76),在不同熵层级上的可靠性保持较高但略有下降,表明决策研究要求不同。