PulseAugur
实时 00:56:34
English(EN) Building a Fine-Tuning Dataset From Production Logs

从生产日志构建 LLM 微调数据集

本文讨论了为大型语言模型从生产日志构建有效微调数据集的关键过程。文章强调原始日志并非数据集,并着重指出了选择高信号示例的重要性,例如用户编辑、验证器失败或路由到更昂贵模型的请求。作者还提供了数据清理技术的建议,推荐使用代理进行 redaction、使用 MinHash 进行去重、限制每个来源的贡献,以及过滤截断的输出。最后,文章警告了训练集和测试集之间的时间和近乎重复的泄露问题,建议在拆分前进行去重,并使用基于时间的拆分来确保准确评估。 AI

影响 通过利用真实使用场景中提取的精选微调数据集,提供了一种改进 LLM 性能的方法。

排序理由 文章描述了一种为 AI 模型创建训练数据的方法,这是一种工具或技术。

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

从生产日志构建 LLM 微调数据集

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · Multigrid ·

    从生产日志构建微调数据集

    <p>Production logs are the best training data you will ever have and the most dangerous. They are real inputs in the real distribution — and they are full of your current model’s outputs, which is exactly what you must not train on.</p> <h2> Selection is the entire job </h2> <p>A…