一位用户已成功将 Muse Glimmer 30B 模型的上下文窗口扩展到 512k 个 token,鉴于该模型不寻常的架构,这是一项重大成就。与许多在长上下文适应方面因全注意力层和位置编码而苦苦挣扎的其他模型不同,Muse Glimmer 30B 使用了稀疏窗口注意力 (SWA) 层,并带有 RoPE 和 GQA 注意力层,没有位置编码。这种独特的设计允许通过简单地调整配置设置来轻松扩展上下文。基准测试表明,扩展后的模型在高达 512k token 的情况下,在针尖寻宝和多跳检索等任务上保持 100% 的性能,尽管在最高上下文长度下的计数任务性能有所下降。 AI
影响 展示了在 LLM 中轻松扩展上下文窗口的潜力,影响了代理应用和长篇内容处理。
排序理由 用户驱动的研究,展示了现有模型的扩展上下文窗口能力。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →