ASAP++
PulseAugur coverage of ASAP++ — every cluster mentioning ASAP++ across labs, papers, and developer communities, ranked by signal.
-
新框架统一作文评分与反馈生成
研究人员开发了HiFTS,一个新颖的自回归框架,旨在通过整合反馈生成与分数预测来改进自动作文评分(AES)。这种统一的方法旨在提高分数-反馈一致性,并更好地与评分标准对齐。HiFTS从教师LLM中提炼出分层反馈,并训练学生模型联合生成反馈和分数,利用组相对策略优化(Group Relative Policy Optimization)实现平衡的奖励系统。该框架还引入了CFMS-34,一个用于多特征AES的新中文数据集,并在CFMS-3…
-
新技术在数据有限的情况下提升AI论文评分
研究人员开发了一种新颖的方法来增强自动化论文评分(AES)系统,特别是在标记数据有限的情况下。该方法集成了三种技术:使用低秩适配的两阶段微调策略、用于提高一致性的分数对齐方法以及利用未标记数据的具有不确定性感知的自训练。在ASAP++数据集上的实验表明,这些技术结合使用时,即使只有大约1000个标记样本,也能达到全数据训练模型91.2%的性能。特别是分数对齐技术在性能上显示出持续的改进,并且在应用于DualBERT模型时,在全数据设置…
-
新框架整合论文评分与自适应反馈
研究人员开发了PsyScore,一个旨在通过整合评估与教学反馈来改进自动论文评分(AES)的新框架。与之前将这些组件分开处理的方法不同,PsyScore使用共享的潜在能力表示。它包含一个用于精确能力估计的Trait-Adaptive Neural IRT Scorer和一个根据学生熟练程度定制反馈的ZPD-Scaffolded Feedback Generator。在ASAP++数据集上的实验表明,PsyScore在评分方面表现具有竞…
-
研究发现:大型语言模型线性编码作文质量表征
研究人员调查了大型语言模型(LLMs)如何在内部表征作文质量,发现这些信息以一种线性可访问的形式编码在模型的表征中。这些信息在不同层级中逐步涌现,并且在不同的提示策略下保持稳健,甚至在不同的作文提示和评分标准之间部分转移。该研究还识别出与作文分数强相关的特定神经元,并且其行为对干预敏感,从而为理解基于LLM的自动作文评分系统的可解释性提供了新见解。
-
新框架评估大语言模型生成的论文反馈的教学质量
研究人员开发了FeedEval,一个旨在评估大语言模型(LLMs)为论文生成的反馈质量的新框架。该系统基于特异性、有用性和有效性等教学原则来评估反馈,并使用专门的大语言模型评估器。在ASAP++基准上的实验表明,FeedEval的评估与人类专家的判断非常接近,并且使用FeedEval过滤后的反馈可以提高论文评分模型的性能,并带来更有效的论文修改。