研究人员发现,即使是所谓的“前沿”大型语言模型,在精确复制其上下文窗口内的输入文本这一简单任务上也存在显著局限性。这种失败归因于Transformer架构中使用的位置编码方法,这些方法会创建阻碍精确复制的捷径。为解决此问题,提出了一种名为2D-RoPE的新方法,该方法将文本组织成二维网格,使复制成为一个更简单的检索任务。实验表明,使用2D-RoPE的Transformer模型在比标准模型长得多的输入长度下也能实现完美的复制,并且在大规模预训练中观察到了益处。 AI
影响 这项研究有望提高LLM在需要精确文本回忆的任务中的可靠性和精确性,从而可能增强其在代码生成或数据处理等应用中的效用。
排序理由 介绍LLM中新位置编码方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →