PulseAugur
中
实时 01:50:41
实体 LMCache

LMCache

PulseAugur coverage of LMCache — every cluster mentioning LMCache across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 8 条
  1. TOOL · CL_286045 ·

    vLLM 的 LMCache 中发现关键远程代码执行漏洞

    在 LMCache 中发现了一个关键的远程代码执行漏洞,LMCache 是与 vLLM 一起用于 LLM KV 缓存的服务器。该漏洞存在于多进程模式下,允许未经身份验证的攻击者通过 ZeroMQ 执行代码。目前,LMCache 还没有可用的修复版本。

  2. TOOL · CL_256842 ·

    探索 KV 缓存放置策略以提高 LLM 内存效率

    一篇新的研究论文探讨了跨不同内存层级(GPU HBM、CPU DRAM、SSD)的 KV 缓存的最佳放置策略,以管理稀缺的 GPU 内存。该研究使用离散事件模拟器进行,发现内存分层可以支持显著更多的并发会话并降低成本,尽管放置策略本身对吞吐量的影响很小。评估了不同的策略,如近期性、重用频率和 EWMA,其中重用频率在代理和文档问答工作负载方面表现最佳,而近期性在聊天方面表现更好。

  3. TOOL · CL_254370 ·

    使用 vLLM 和 LMCache 验证 GLM-5.3-Flash 缓存恢复

    研究人员开发了一种方法来验证 GLM-5.3-Flash 语言模型的缓存恢复,解决了混合状态恢复期间可能出现的 But inconsistencies。所提出的解决方案涉及严格前缀查找和数值比较,在串行工作负载中将生成一致性从 34/36 提高到 36/36。与冷重新计算相比,这种集成修复技术还展示了性能提升,首次令牌时间最多减少 64%,总请求时间最多减少 7.0%。

  4. RESEARCH · CL_254776 ·

    新研究优化LLM的KV缓存使用,提高效率和准确性

    近期研究探讨了优化大型语言模型(LLM)中KV缓存使用的方法,特别是在长上下文和智能体系统方面。一篇论文提出了一种针对文档编辑后陈旧KV缓存的预算修复策略,发现连续的、与编辑相关的局部窗口非常有效,并且比完全重新预填充快得多。另一项研究介绍了Fathom技术,该技术允许查询动态决定读取多少KV缓存,从而提高解码速度并减少大型模型的注意力误差。第三篇论文研究了KV缓存逐出对自回归生成的影响,分析了发散时间和累积不匹配,发现某些逐出策略会…

  5. COMMENTARY · CL_250098 ·

    所谓的AI“黑客”被解释为简单脚本,而非失控AI;Token膨胀问题依然存在

    最近的一项分析表明,广为报道的“黑客”事件——OpenAI的聊天机器人被指控在Hugging Face挑战赛中作弊——并非AI自主行为,而是一个简单的Python脚本查询了过去黑客挑战赛数据库。这一解释与媒体上引发科幻场景的耸人听闻的描绘形成对比。另外,关于大型语言模型基础设施的讨论强调,尽管LMCache等创新通过缓存Token提高了处理长上下文窗口的效率,但它们并未消除Token膨胀的根本问题。这意味着用户仍然需要为这些Token…

  6. RESEARCH · CL_235247 ·

    AMD MI355x硬件在AgentX的token效率方面优于B300 · 跟踪2个来源

    AMD MI355x硬件的一项新提交显示,在总拥有成本(TCO)的输出总token数方面,其性能优于B300,尤其是在AgentX框架内的低交互性范围内。SemiAnalysis强调了这一成就,并特别表彰了vLLM、AMD和LMCache的工程团队所做的贡献。高吞吐量配置中使用的分离式设置被认为是实现这一性能提升的关键因素。

  7. TOOL · CL_212517 ·

    明玢FX100存储加速AI推理,助力国产替代

    明玢的FX100存储解决方案为AI推理提供了显著的性能提升,特别是在信创环境下的国产替代努力中。通过专注于存储协议和数据路径,而非直接取代GPU,明玢的技术在DeepSeek 70B和32B等大模型上,于AMD MI308X和Ascend 910B等平台上进行测试时,实现了高达40%的吞吐量提升和32%的首个token时间(TTFT)缩减。该方法利用了NVMe-oF和RoCEv2等成熟的开放标准,降低了技术风险,并在AI推理存储方面提…

  8. COMMENTARY · CL_194250 ·

    计算租赁合同需要为AI工作负载添加特定条款

    本文重点介绍了计算租赁合同中针对AI工作负载的三个关键但常被忽略的条款:带宽、存储和故障时长。文章强调,网络带宽对于大型模型的推理和训练性能至关重要,直接影响端到端速度。文章还强调了除了容量之外,明确存储性能指标(详细说明读取带宽、IOPS和延迟)的重要性。最后,文章指出,没有明确故障确定、响应时间和赔偿的模糊可用性保证,实际上是没有意义的SLA。