一篇新研究论文探讨了语言模型中语义遗忘的现象,特别比较了监督微调(SFT)和强化微调(RFT)在分类任务上的表现。该研究使用线性-softmax策略将模型更新分解为语义和风格成分。它提出,虽然两种方法都表现出并行的语义更新,但SFT可能导致风格漂移和随后的遗忘,而RFT在某些条件下可以保持语义准确性。 AI
影响 为模型训练动态提供了理论见解,可能指导未来的微调策略以减轻灾难性遗忘。
排序理由 该集群包含一篇发表在arXiv上的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →