最近发表在《计算语言学学报》(Transactions of the ACL) 上的一项由刘等人进行的研究,识别出一种被称为“迷失在中间”的现象。在该现象中,当关键信息被置于长上下文窗口的中间时,语言模型的准确性会下降。当相关文档既不在提示的开头也不在结尾时,性能会显著下降,有时甚至比闭卷回忆的表现还要差。这种现象已在各种模型架构和上下文长度中观察到,表明这是模型处理扩展信息方式的一个基本挑战。该论文提出,具有固定预算的注意力机制、不完美的词位置编码以及训练数据的分布等因素导致了这种位置偏差。 AI
影响 这一发现突显了当前大型语言模型的一个关键局限性,影响了提示工程策略以及长上下文模型的实际应用。
排序理由 该集群讨论了一篇研究论文,其中详细介绍了在语言模型中观察到的特定现象。[lever_c_demoted from research: ic=1 ai=1.0]
- Bevilacqua
- Greg Kamradt
- Hewitt
- Liang
- Lin
- Liu
- Lost in the Middle: How Language Models Use Long Contexts
- Paranjape
- Petroni
- Rhodes
- Transactions of the ACL
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →