本文讨论了为大型语言模型从生产日志构建有效微调数据集的关键过程。文章强调原始日志并非数据集,并着重指出了选择高信号示例的重要性,例如用户编辑、验证器失败或路由到更昂贵模型的请求。作者还提供了数据清理技术的建议,推荐使用代理进行 redaction、使用 MinHash 进行去重、限制每个来源的贡献,以及过滤截断的输出。最后,文章警告了训练集和测试集之间的时间和近乎重复的泄露问题,建议在拆分前进行去重,并使用基于时间的拆分来确保准确评估。 AI
影响 通过利用真实使用场景中提取的精选微调数据集,提供了一种改进 LLM 性能的方法。
排序理由 文章描述了一种为 AI 模型创建训练数据的方法,这是一种工具或技术。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →