PulseAugur
中
实时 11:57:26
实体 LRU

LRU

PulseAugur coverage of LRU — every cluster mentioning LRU across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
15
90 天内 15
发布 · 30天
0
90 天内 0
论文 · 30天
12
90 天内 12
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/1 页 · 共 17 条
  1. TOOL · CL_277200 ·

    新的NC-SSM模型克服了Mamba、S4D和LRU的局限性

    研究人员引入了非交换状态空间模型(NC-SSM),以解决现有选择性状态空间模型(如Mamba)的局限性。这些新模型,包括SO(3)-SSM和Cayley-SSM,将状态转换扩展到紧李群,实现了精确的保持范数的等距。基准测试表明,NC-SSM在跟踪A_5和S_5等复杂群方面显著优于对角线模型,并以最小的漂移保持黎曼流形。

  2. TOOL · CL_275250 ·

    新研究通过深度递归和输入重塑改进状态空间模型

    一篇新的研究论文介绍了两种增强状态空间模型(SSM)的方法,使其更高效、性能更好。第一种方法是深度递归,通过多次迭代一个较小的模型来减少SSM的内存占用,同时不牺牲性能。第二种方法通过调整时间粒度和特征维度来优化呈现给模型的信息,从而提高性能。这些技术在LRU、S5、LinOSS和LrcSSM等几种SSM架构上进行了测试,并显示出持续的益处。

  3. TOOL · CL_268856 ·

    新研究探讨记忆对路由博弈的影响,并引入“回忆悖论”

    一篇新的研究论文探讨了在路由博弈中,旅行者的路线选择受记忆和回忆机制影响,而非仅仅受固定的外部因素影响。该研究引入了遗忘沃尔多普均衡(FWE)的概念和显著性模型来表示持久的记忆效应。它还定义并展示了“回忆悖论”,即改进的记忆回忆反而会增加均衡延迟。

  4. TOOL · CL_259225 ·

    AI代理报告工具进度以提高性能

    研究人员开发了一种新方法,使AI代理在使用外部工具时能更好地管理其进度。当前系统经常猜测工具需要多长时间,导致GPU内存使用效率低下。提出的解决方案涉及工具实时报告其进度,提供比以往估算方法更准确的信号。这种方法可以显著减少代理在工具调用后收到第一个令牌所需的时间,从而提高整体性能。

  5. COMMENTARY · CL_250482 ·

    LRU 缓存被证明比先进的 AI 缓存方法更具韧性

    一篇近期文章指出,最近最少使用 (LRU) 缓存策略比之前理解的更有效,即使与 AI 模型中使用的先进 KV 缓存技术相比也是如此。作者强调,LRU 的简单性和效率使其成为一个强有力的竞争者,挑战了在大型系统中管理缓存内存时,更复杂的方法总是更优越的观念。

  6. TOOL · CL_245381 ·

    新的H-MC缓存策略为LRU/LFU提供了改进的悔恨保证

    研究人员开发了一种名为H-MC的新缓存策略,旨在改进现有的LRU和LFU等方法。与可能在某些请求序列中遭受线性悔恨的LeCar和Cacheus等先前策略不同,H-MC旨在实现亚线性悔恨。这是通过使用基于Hedge的虚拟LRU和LFU缓存混合来实现的,该方法在保持最优悔恨保证的同时最大限度地减少了切换成本。

  7. TOOL · CL_226678 ·

    开发者可通过缓存修复LLM API 429错误

    遇到免费套餐LLM API频繁出现HTTP 429“请求过多”错误的开发者,通常可以通过实现缓存来解决此问题。这些错误,尤其是在高峰时段发生时,可能源于重复请求,而非超出实际配额限制。本文提供了一份指南,用于审计请求日志以识别可缓存的提示,并提供了一个具有生存时间和LRU淘汰机制的、感知配额的缓存的Python实现。

  8. TOOL · CL_212151 ·

    LLM 缓存研究:LFU 优于其他驱逐策略,但有效性有限

    arXiv 上发表的一项新研究评估了大型语言模型 (LLM) 缓存的各种驱逐策略,发现最不常用 (LFU) 策略在测试中表现最佳。该研究使用了一个名为 CLEVER 的框架,在不同的工作负载、缓存容量和编码器中比较了 FIFO、LRU 等策略。研究结果表明,虽然 LFU 是一个强有力的默认选项,但由于在典型操作点下答案可替代查询的百分比很低,驱逐策略的有效性受到限制,这表明在优化驱逐策略之前应优先考虑建立答案的有效性。

  9. TOOL · CL_193777 ·

    MoE 专家缓存评估方法被发现具有误导性

    研究人员发现了用于混合专家(MoE)模型的 trace-driven 评估方法中的关键缺陷,这些缺陷可能导致关于专家缓存策略的结论具有误导性。研究强调了回放语义、工作负载污染和运行模式如何显著改变性能指标并颠倒策略排名。即使经过修正的评估,与离线最优值之间仍然存在显著差距,这主要归因于对未来专家使用情况的预测,表明当前轻量级的因果机制并未完全恢复这些潜在收益。

  10. TOOL · CL_178704 ·

    新分析探讨遗传编程符号回归的缓存策略

    本文分析了遗传编程符号回归(GPSR)的缓存策略,以减少计算运行时。该研究探讨了各种缓存机制(包括LRU和FIFO)在合成和真实世界数据集上的内存-运行时权衡。它还提供了根据可用计算和内存资源配置这些策略的指南,建议复杂的缓存需要最小尺寸才能减少时间,而LRU和FIFO等简单方法可以显著减少适应度评估时间。

  11. COMMENTARY · CL_172882 ·

    LLM KV 缓存管理需要超越简单驱逐的重新思考

    LLM 推理服务器中的 KV 缓存通常采用简单的 LRU 或基于容量的驱逐策略进行管理,这对于现代工作负载来说是一种不足的方法。该策略未能考虑到 KV 缓存条目未来价值的可变性,尤其是在代理循环、检索增强生成(RAG)和多轮聊天场景中。将 KV 缓存视为纯粹的内存存储,忽视了其在准入控制和定价方面的作用,导致吞吐量不佳和延迟增加。

  12. TOOL · CL_156268 ·

    Phionyx 推出确定性 AI 运行时以加强治理

    研究人员推出 Phionyx,这是一种新颖的 AI 运行时架构,旨在实现确定性行为和加强治理。该架构将 LLM 输出视为噪声测量,采用确定性状态演化方程来确保可复现的结果。Phionyx 集成了确定性评估内核、用于响应前控制的统一安全层以及具有影响加权缓存驱逐的语义内存系统。初步实验表明,与传统方法相比,计算开销显著降低,数据保留能力得到改善,并且在多次运行中均验证了确定性执行。

  13. TOOL · CL_38307 ·

    KV 缓存驱逐保护比评分更重要

    研究人员开发了一种管理大型语言模型中 KV 缓存驱逐的新方法,发现结构性保护比评分算法更关键。他们对 Transformer 模型的研究表明,如果没有保护,现有的驱逐策略会显著退化。通过为结构性保护保留一小部分缓存,模型即使在缓存大小有限的情况下,也能恢复相当数量的原始质量。

  14. TOOL · CL_36599 ·

    Looped SSMs 通过深度递归提升时间序列分类性能

    研究人员推出了一种新颖的状态空间模型(SSM)方法——Looped SSMs,用于时间序列分类。该方法通过应用深度递归来提高性能,其中模型块跨层重用,类似于循环 Transformer。研究还强调了输入重塑技术(如连接或展平时间步)的显著优势,这些技术进一步提高了准确性。

  15. TOOL · CL_20119 ·

    Apple 研究人员发布 SpecMD 以加速 MoE 模型推理

    Apple 的机器学习研究团队发表了一篇论文,详细介绍了 SpecMD,这是一个用于评估专家混合(MoE)模型缓存策略的新框架。他们的实验表明,由于专家访问模式不一致,像最近最少使用(LRU)这样的传统缓存假设对 MoE 模型无效。为了解决这个问题,他们提出了一种名为“最不陈旧”(Least-Stale)的新型驱逐策略,该策略利用可预测的专家访问来显著减少缓存未命中并提高推理速度。

  16. RESEARCH · CL_05173 ·

    新的基于机器学习的GPU缓存算法LCR提升LLM推理速度

    研究人员开发了一种名为学习增强LRU (LALRU) 的新GPU缓存算法,旨在提高AI推理期间的效率。该算法将学习到的预测与缓存策略相结合,以确保在预测准确时接近最优,并在预测不准确时限制性能下降。基于LALRU的一个实际实现LCR,在LLM工作负载中表现出显著的改进,将P99首个令牌时间缩短了高达28.3%,并将DLRM工作负载的吞吐量提高了高达24.2%。

  17. RESEARCH · CL_03019 ·

    基于忆阻器的AI系统在高效学习和神经形态计算方面展现出潜力

    研究人员正在探索自组织忆阻网络(SOMNs)作为人工智能的传统硬件的物理替代方案,旨在实现节能、类脑的持续学习。这些网络利用纳米级电阻式存储器元件的独特动力学来执行计算。最近的工作表明,它们在图像分类方面具有高精度和对器件变化的鲁棒性,并在时间序列分类方面表现出色,优于传统的基于梯度的模型,同时大大缩短了训练时间。