PulseAugur
实时 22:34:49
English(EN) Why do people keep fine-tuning on summarized/censored SOTA CoT traces?

Reddit用户质疑对LLM进行总结推理轨迹微调

Reddit上的一篇讨论质疑了在总结或审查过的思维链(CoT)轨迹上微调大型语言模型的做法。用户认为,这种方法,特别是使用Anthropic的Fable微调模型,可能不会提高输出质量,甚至可能降低输出质量。这是因为提供的推理轨迹可能无法准确反映模型的内部思考过程,从而导致次优结果。 AI

影响 这次讨论对大型语言模型的某些微调技术的有效性提出了质疑。

排序理由 该条目是Reddit上对特定AI训练方法提出的质疑讨论。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Reddit用户质疑对LLM进行总结推理轨迹微调

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/wombweed ·

    为什么人们持续在已摘要/审查的SOTA CoT轨迹上进行微调?

    <!-- SC_OFF --><div class="md"><p>Am I missing something? It seems like some people think distillation is magic and will raise the quality of output above what the base model is actually capable of. It's especially weird to me to see all these Fable fine-tunes, because as far as …