一篇新论文探讨了大型语言模型如何执行多步推理,研究了不同的计算方法是否依赖于共享的底层机制。研究人员在复杂的推理任务上训练了 GPTNeoX 模型的五个变体,发现与使用思维链或暂停令牌方法相比,使用潜在推理的模型在分布外问题上泛化得更好。电路分析显示,潜在变体采用了稀疏循环搜索算法,这表明不同的推理机制确实可以学习独立的计算解决方案。 AI
影响 研究了大型语言模型中推理的不同计算解决方案,可能为未来模型的架构提供信息,以实现更好的泛化。
排序理由 该集群包含一篇详细介绍大型语言模型推理机制研究结果的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →