PulseAugur
实时 12:15:57
English(EN) Muse Glimmer 30B with 512k context

Muse Glimmer 30B 模型上下文窗口扩展至 512k

一位用户已成功将 Muse Glimmer 30B 模型的上下文窗口扩展到 512k 个 token,鉴于该模型不寻常的架构,这是一项重大成就。与许多在长上下文适应方面因全注意力层和位置编码而苦苦挣扎的其他模型不同,Muse Glimmer 30B 使用了稀疏窗口注意力 (SWA) 层,并带有 RoPE 和 GQA 注意力层,没有位置编码。这种独特的设计允许通过简单地调整配置设置来轻松扩展上下文。基准测试表明,扩展后的模型在高达 512k token 的情况下,在针尖寻宝和多跳检索等任务上保持 100% 的性能,尽管在最高上下文长度下的计数任务性能有所下降。 AI

影响 展示了在 LLM 中轻松扩展上下文窗口的潜力,影响了代理应用和长篇内容处理。

排序理由 用户驱动的研究,展示了现有模型的扩展上下文窗口能力。[lever_c_demoted from research: ic=1 ai=1.0]

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Muse Glimmer 30B 模型上下文窗口扩展至 512k

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/mr_il ·

    Muse Glimmer 30B 拥有 512k 上下文

    <!-- SC_OFF --><div class="md"><p>My fun weekend project was to try to make the new Muse Glimmer 30B work with a longer context, deciding to go for 512k first. I had expected the usual YaRN shenanigans and maybe a LoRA. I couldn't have been wrong more.</p> <p>Upon closer look, Gl…