研究人员提出了一个新框架,用以解释大型语言模型(LLMs)为何在冗长、多轮的对话中难以保持上下文。他们的“通道-转换模型”表明,虽然对关键指令的注意力可能会减弱,但信息可以在模型内部的残余表示中持续存在。为了量化这一点,他们引入了目标可达性比率(GAR),并用它来分析各种架构,发现注意力消散的点在不同模型之间存在显著差异。 AI
影响 为理解和潜在缓解大型语言模型中的上下文丢失问题提供了一个新框架,这对于开发更强大的对话式人工智能至关重要。
排序理由 学术论文,详细介绍了大型语言模型行为的新机制解释和诊断工具。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →