研究人员开发了Edu-QuRating,一个用于多维度教育数据评分和策展的新流程。该系统定义了教育特定标准,并使用LLM裁判来标记文档对,将这些偏好提炼成可重用的Edu-QuRaters。这些评分器可以根据各种教育标准对文本块进行评分,在预测成对判断方面取得了高准确率。该流程已应用于过滤小型语言模型的预训练语料库,从而提高了基准测试的总体准确率,并通过使用Edu-QuRater分数作为奖励项来增强GRPO的训练后阶段,从而在教学质量和指令遵循方面获得更优的响应。 AI
影响 通过实现更细致的教育数据过滤和奖励塑造来增强LLM的预训练。
排序理由 该集群描述了一篇详细介绍新数据策展方法的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Edu-QuRaters
- Edu-QuRating
- FineWeb-Edu
- FineWeb-Edu-Fortified
- GPT-4.1 mini
- GRPO
- QuRating
- Qwen3-4B
- Wettig et al.
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →