一篇新的研究论文探讨了监督微调(SFT)对大型语言模型(LLM)在顺序决策任务中行为多样性的影响。该研究使用井字棋的变体进行,发现虽然SFT可以提高行动准确性,但它通常会导致行动多样性过早崩溃。这种被称为窄支持模仿的现象会阻碍LLM的探索行为。研究人员建议,行动增强(在每个状态下对所有最优行动进行模型训练)可以帮助缓解这种多样性崩溃。 AI
影响 监督微调可能会无意中限制LLM的探索和决策能力,这表明需要新的训练方法。
排序理由 发表在arXiv上的研究论文,详细介绍了LLM行为的发现。[lever_c_demoted from research: ic=1 ai=1.0]
- action accuracy
- action augmentation
- action diversity
- arXiv
- Large language models
- narrow-support imitation
- policy collapse
- Supervised fine-tuning
- Tic Tac Toe
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →