一位开发者从头开始构建了一个名为 Lilas 的日语对话 AI 模型,该模型表现出一种奇怪的倾向,即对积极消息回应“听起来很难”。对原始训练数据的初步分析表明,该短语的出现频率过高。然而,对数据进行更细致的加权,考虑到训练过程中特定文件的重复次数,发现“我很高兴听到这个”这个短语实际上要少得多,其出现频率明显低于“听起来很难”。 AI
影响 强调了平衡训练数据对于细致的对话式 AI 的关键重要性。
排序理由 开发者博客文章,详细介绍了构建和调试自定义 LLM 的过程。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →