研究人员调查了大型语言模型为何在汉诺塔等规划谜题上遇到困难,特别是初始状态和目标状态复杂的变体。通过在预先计算好的解决方案上训练较小的 Transformer 模型,他们发现这些模型会发展出对谜题状态空间的一种涌现的“世界模型”,这对解决问题至关重要。然而,当将此应用于 Qwen3.6-27B 和 DeepSeek-R1-Distill-Qwen-32B 等更大的模型时,研究表明,虽然这些模型编码了类似的世界模型,但由于在规划过程中该模型的表示会衰减,它们的性能会显著下降。该研究表明,改进这些内部表示的维护可以增强模型的推理能力。 AI
影响 突出了当前大型语言模型在推理和规划能力方面的一个关键限制,并为模型架构和表示维护的未来改进指明了方向。
排序理由 研究论文分析了大型语言模型在特定推理任务上的局限性。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- DeepSeek-R1-Distill-Qwen-32B
- Hugging Face
- Qwen3.6-27B
- Sierpiński triangle
- Tower of Hanoi
- transformers
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →