PulseAugur
实时 06:40:21
实体 LRU

LRU

PulseAugur coverage of LRU — every cluster mentioning LRU across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 9
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_212151 ·

    LLM 缓存研究:LFU 优于其他驱逐策略,但有效性有限

    arXiv 上发表的一项新研究评估了大型语言模型 (LLM) 缓存的各种驱逐策略,发现最不常用 (LFU) 策略在测试中表现最佳。该研究使用了一个名为 CLEVER 的框架,在不同的工作负载、缓存容量和编码器中比较了 FIFO、LRU 等策略。研究结果表明,虽然 LFU 是一个强有力的默认选项,但由于在典型操作点下答案可替代查询的百分比很低,驱逐策略的有效性受到限制,这表明在优化驱逐策略之前应优先考虑建立答案的有效性。

  2. TOOL · CL_193777 ·

    MoE 专家缓存评估方法被发现具有误导性

    研究人员发现了用于混合专家(MoE)模型的 trace-driven 评估方法中的关键缺陷,这些缺陷可能导致关于专家缓存策略的结论具有误导性。研究强调了回放语义、工作负载污染和运行模式如何显著改变性能指标并颠倒策略排名。即使经过修正的评估,与离线最优值之间仍然存在显著差距,这主要归因于对未来专家使用情况的预测,表明当前轻量级的因果机制并未完全恢复这些潜在收益。

  3. TOOL · CL_178704 ·

    新分析探讨遗传编程符号回归的缓存策略

    本文分析了遗传编程符号回归(GPSR)的缓存策略,以减少计算运行时。该研究探讨了各种缓存机制(包括LRU和FIFO)在合成和真实世界数据集上的内存-运行时权衡。它还提供了根据可用计算和内存资源配置这些策略的指南,建议复杂的缓存需要最小尺寸才能减少时间,而LRU和FIFO等简单方法可以显著减少适应度评估时间。

  4. COMMENTARY · CL_172882 ·

    LLM KV 缓存管理需要超越简单驱逐的重新思考

    LLM 推理服务器中的 KV 缓存通常采用简单的 LRU 或基于容量的驱逐策略进行管理,这对于现代工作负载来说是一种不足的方法。该策略未能考虑到 KV 缓存条目未来价值的可变性,尤其是在代理循环、检索增强生成(RAG)和多轮聊天场景中。将 KV 缓存视为纯粹的内存存储,忽视了其在准入控制和定价方面的作用,导致吞吐量不佳和延迟增加。

  5. TOOL · CL_156268 ·

    Phionyx 推出确定性 AI 运行时以加强治理

    研究人员推出 Phionyx,这是一种新颖的 AI 运行时架构,旨在实现确定性行为和加强治理。该架构将 LLM 输出视为噪声测量,采用确定性状态演化方程来确保可复现的结果。Phionyx 集成了确定性评估内核、用于响应前控制的统一安全层以及具有影响加权缓存驱逐的语义内存系统。初步实验表明,与传统方法相比,计算开销显著降低,数据保留能力得到改善,并且在多次运行中均验证了确定性执行。

  6. TOOL · CL_38307 ·

    KV 缓存驱逐保护比评分更重要

    研究人员开发了一种管理大型语言模型中 KV 缓存驱逐的新方法,发现结构性保护比评分算法更关键。他们对 Transformer 模型的研究表明,如果没有保护,现有的驱逐策略会显著退化。通过为结构性保护保留一小部分缓存,模型即使在缓存大小有限的情况下,也能恢复相当数量的原始质量。

  7. TOOL · CL_36599 ·

    Looped SSMs 通过深度递归提升时间序列分类性能

    研究人员推出了一种新颖的状态空间模型(SSM)方法——Looped SSMs,用于时间序列分类。该方法通过应用深度递归来提高性能,其中模型块跨层重用,类似于循环 Transformer。研究还强调了输入重塑技术(如连接或展平时间步)的显著优势,这些技术进一步提高了准确性。

  8. TOOL · CL_20119 ·

    Apple 研究人员发布 SpecMD 以加速 MoE 模型推理

    Apple 的机器学习研究团队发表了一篇论文,详细介绍了 SpecMD,这是一个用于评估专家混合(MoE)模型缓存策略的新框架。他们的实验表明,由于专家访问模式不一致,像最近最少使用(LRU)这样的传统缓存假设对 MoE 模型无效。为了解决这个问题,他们提出了一种名为“最不陈旧”(Least-Stale)的新型驱逐策略,该策略利用可预测的专家访问来显著减少缓存未命中并提高推理速度。

  9. RESEARCH · CL_05173 ·

    新的基于机器学习的GPU缓存算法LCR提升LLM推理速度

    研究人员开发了一种名为学习增强LRU (LALRU) 的新GPU缓存算法,旨在提高AI推理期间的效率。该算法将学习到的预测与缓存策略相结合,以确保在预测准确时接近最优,并在预测不准确时限制性能下降。基于LALRU的一个实际实现LCR,在LLM工作负载中表现出显著的改进,将P99首个令牌时间缩短了高达28.3%,并将DLRM工作负载的吞吐量提高了高达24.2%。

  10. RESEARCH · CL_03019 ·

    基于忆阻器的AI系统在高效学习和神经形态计算方面展现出潜力

    研究人员正在探索自组织忆阻网络(SOMNs)作为人工智能的传统硬件的物理替代方案,旨在实现节能、类脑的持续学习。这些网络利用纳米级电阻式存储器元件的独特动力学来执行计算。最近的工作表明,它们在图像分类方面具有高精度和对器件变化的鲁棒性,并在时间序列分类方面表现出色,优于传统的基于梯度的模型,同时大大缩短了训练时间。