一项新的研究论文表明,在大型语言模型(LLM)输出中观察到的同质性可能源于预训练阶段,而非仅仅在调优过程中产生。研究发现,语义收敛可以通过监督微调(SFT)被揭示和放大,但不能由其引入。此外,通过单独提示就可以在基础模型中诱导类似指令的崩溃,这表明收敛可能是LLM训练目标的自然结果,使得后调优干预不足以缓解。 AI
影响 表明当前的调优技术可能不足以解决LLM输出同质性问题,需要重新评估预训练策略。
排序理由 在arXiv上发表的研究论文,讨论LLM训练动态。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →