PulseAugur
实时 06:40:21
实体 StreamingLLM

StreamingLLM

PulseAugur coverage of StreamingLLM — every cluster mentioning StreamingLLM across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_204830 ·

    复现StreamingLLM产生零结果,凸显模型学习到的行为

    一项试图复现大型语言模型StreamingLLM技术的尝试,该技术声称通过保留固定数量的初始token在KV缓存中来提高性能,但并未产生任何可辨别的影响。作者使用随机查询/键对进行的实验表明,当模型学习到的行为不存在时,StreamingLLM的所谓好处也随之消失。这表明StreamingLLM的有效性与其模型学习到的路由机制有关,而不是token位置的几何属性。

  2. TOOL · CL_167283 ·

    新框架将语言模型记忆驱逐重塑为估计问题

    研究人员引入了一个新的语言模型工作记忆管理框架,将驱逐决策视为一个估计问题。这种方法被称为“驱逐即估计”,旨在通过考虑存储项未来重用的可能性来优化内存使用。一种名为 RMM 的提议策略是对 StreamingLLM 和 H2O 等现有方法的泛化,在标准基准测试上表现相当,但在内存重用更可预测和内生时显示出潜在优势。

  3. RESEARCH · CL_160856 ·

    Windowed-MTP 优化百万token上下文的投机解码

    研究人员开发了 Windowed-MTP,一种优化语言模型大上下文窗口投机解码的新技术。该方法通过应用滑动窗口和注意力汇聚点,解决了在百万token上下文下草稿头注意力机制成为瓶颈的问题。Windowed-MTP 无需训练且无损,确保目标模型的输出分布不变。在 Qwen GDN-MoE 和 Mamba2-hybrid 模型上的测试表明,每解码步成本和端到端延迟均显著降低。

  4. TOOL · CL_149931 ·

    大型语言模型通过注意力技巧应对长上下文挑战

    大型语言模型中自注意力机制的二次方复杂度,即计算和内存随输入令牌数量的平方而扩展,对处理长上下文构成了重大挑战。各种技术旨在规避这一限制,包括滑动窗口注意力,它将每个令牌的关注范围限制在局部片段;以及注意力沉没(attention sinks),通过保持最初几个令牌的持续可见性来稳定流式处理。稀疏注意力结合了局部窗口与全局和跨步连接,使信息能够跨越更长的序列;而 RoPE 缩放调整位置嵌入,使在较短上下文上训练的模型能够处理扩展输入。

  5. TOOL · CL_148163 ·

    Attention Sinks: Why Early Tokens Are Critical for LLM Stability

    一项技术分析表明,序列中的早期标记(称为“注意力汇聚点”)对于基于 Transformer 的大型语言模型的稳定运行至关重要。这些汇聚点充当注意力概率质量的停泊点,防止其破坏真实标记的表示。当这些初始标记被移除时,尤其是在使用滑动窗口 KV 缓存的流式 LLM 架构中,模型性能会显著下降,这种现象被称为“注意力汇聚点”。

  6. TOOL · CL_38307 ·

    KV 缓存驱逐保护比评分更重要

    研究人员开发了一种管理大型语言模型中 KV 缓存驱逐的新方法,发现结构性保护比评分算法更关键。他们对 Transformer 模型的研究表明,如果没有保护,现有的驱逐策略会显著退化。通过为结构性保护保留一小部分缓存,模型即使在缓存大小有限的情况下,也能恢复相当数量的原始质量。