研究人员发现了一种深度学习模型中新的泛化故障,称为“Forking”,它发生在数据重放时。这种现象在 NanoGPT 和 DeepSeek 等模型中观察到,表现为训练和验证损失在 epoch 边界处急剧发散。n-gram 内存分支过度编码上下文会加剧这个问题,导致未见过的续写的概率被抑制。虽然自动研究代理可以产生大量结果,但本文强调了在使用它们的输出时需要谨慎,因为 Forking 似乎是此类技术的一个意外后果。 AI
影响 突出了大型语言模型的一种新故障模式,可能影响模型的可靠性以及自动研究工具的使用。
排序理由 学术论文,详细介绍了深度学习模型中的一种新现象。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →