PulseAugur
实时 12:14:39
实体 Automated essay scoring

Automated essay scoring

PulseAugur coverage of Automated essay scoring — every cluster mentioning Automated essay scoring across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_143758 ·

    新框架评估人工智能驱动的作文评分的可靠性

    研究人员引入了一个新的条件泛化框架来评估自动化作文评分系统的可靠性。该框架将编码器架构和评分头家族视为可接受的测量条件集合,超越了简单的聚合可靠性估计。通过根据熵定义的响应层级来条件化证据,研究表明,虽然总体可靠性保持较高水平(Phi 约 0.76),但在不同的层级上会适度下降,这表明基于响应复杂性的决策研究有不同的要求。

  2. TOOL · CL_152473 ·

    新框架评估AI评分在不同条件下的可靠性

    引入了一个新的条件泛化框架,用于评估自动化评分系统的可靠性,特别是在自动化作文评分等环境中。该框架将不同的编码器架构和评分头族视为测量条件的集合,超越了简单的聚合可靠性估计。通过比较分析预测和经验扫描,该框架诊断了实现的配置集合,并根据熵定义的响应层级来提供证据。在计时L2写作上的演示显示,该系统具有聚合可靠性(Phi约0.76),在不同熵层级上的可靠性保持较高但略有下降,表明决策研究要求不同。

  3. RESEARCH · CL_99588 ·

    研究发现:大型语言模型线性编码作文质量表征

    研究人员调查了大型语言模型(LLMs)如何在内部表征作文质量,发现这些信息以一种线性可访问的形式编码在模型的表征中。这些信息在不同层级中逐步涌现,并且在不同的提示策略下保持稳健,甚至在不同的作文提示和评分标准之间部分转移。该研究还识别出与作文分数强相关的特定神经元,并且其行为对干预敏感,从而为理解基于LLM的自动作文评分系统的可解释性提供了新见解。

  4. RESEARCH · CL_82110 ·

    顺序微调提升 LLaMA 在论文评分方面的能力

    研究人员开发了一种针对 LLaMA-3.1-8B 的顺序微调方法,通过考虑话语元素的相互依赖性,显著提高了自动论文评分 (AES) 的性能。该方法逐步在模型上训练论文的不同组成部分,如开头、论点、证据和结论,在某些指标上优于独立的特定任务模型和一个规模大得多的 LLaMA-70B 基线。研究表明,与话语结构一致的课程设计对于 AES 至关重要,并且更小、更专业的模型可以与更大的 LLM 竞争,为教育 NLP 提供更具成本效益的解决方案。

  5. RESEARCH · CL_65831 ·

    新框架提升法语语言测试的自动化作文评分

    研究人员为自动化作文评分(AES)系统开发了一个增强的基于论证的验证(ABV)框架,专注于法语语言测试。这个改进的框架包括公平性分析、语言特征相关性、预测误差评估以及模型与人类评分者的一致性。该研究将此框架应用于比较八种不同的模型架构,使用了一个大型法语作文语料库,旨在更全面地理解AES模型的能力和局限性。

  6. RESEARCH · CL_50662 ·

    大型语言模型在自动化作文评分方面表现不一

    两篇新研究论文探讨了大型语言模型(LLMs)在自动化作文评分(AES)方面的有效性。第一篇论文综合了 65 项研究,发现 LLM 与人类在作文评分上的一致性高度依赖于上下文,并且差异显著。第二篇论文研究了在学习者语料库上进行领域自适应预训练(DAPT)以用于 AES,表明虽然有针对性的 DAPT 可以提高领域内评分,但并不能持续增强跨数据集的可迁移性。