一篇来自arXiv的新研究论文调查了用于训练人类反馈强化学习(RLHF)模型的合成语料库中潜在的数据制品。该研究专门审计了GooseReason-0.7M数据集,该数据集通过让语言模型在真实人类文本周围编造不正确的答案来生成干扰项。研究人员发现,虽然一个简单的分类器几乎无法区分合成数据和真实数据,但更细致的分析显示,基于代码的干扰项在构造上与正确答案过于相似。此外,一项干预实验表明,在具有这些制品的数据上训练策略,其结果并不比在对照语料库上训练更好,这表明在给定预算下该制品未被利用。 AI
影响 强调了RLHF合成数据生成中潜在的问题,为语料库策展的最佳实践提供信息。
排序理由 该集群包含一篇在arXiv上发表的研究论文,详细介绍了对用于RLHF模型的合成数据的审计。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →