PulseAugur
实时 17:29:32
English(EN) HiLS Attention: How Tencent Built a Sparse Attention Mechanism That Extrapolates to 4 Million Tokens

腾讯的 HiLS Attention 将 LLM 上下文扩展至 400 万 token

腾讯的 Hunyuan 团队在一篇新论文中详细介绍了一种名为 HiLS Attention 的新型稀疏注意力机制。该方法通过使用总结块内容的标志性 token,使块选择成为模型可学习的一部分。这种方法使模型能够在领域内长度上保持全注意力质量,同时将上下文扩展到训练长度的 64 倍以上,在 512K token 时实现 13-15 倍的加速。HiLS Attention 机制已在 Hugging Face 上提供,并开源了代码。 AI

影响 使 LLM 能够处理显著更长的上下文,有可能提高需要广泛信息检索的任务的性能。

排序理由 研究论文,详细介绍了一种用于 LLM 的新注意力机制。 [lever_c_demoted from research: ic=1 ai=1.0]

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

腾讯的 HiLS Attention 将 LLM 上下文扩展至 400 万 token

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · Prabhakar Chaudhary ·

    HiLS Attention: How Tencent Built a Sparse Attention Mechanism That Extrapolates to 4 Million Tokens

    <h1> HiLS Attention: How Tencent Built a Sparse Attention Mechanism That Extrapolates to 4 Million Tokens </h1> <p>Long-context modeling has a persistent tension at its core: full attention is accurate but scales quadratically with sequence length, while sparse attention is fast …