PulseAugur
实时 15:48:09
实体 1960s

1960s

PulseAugur coverage of 1960s — every cluster mentioning 1960s across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_236234 ·

    vLLM通过虚拟内存分页提升LLM推理速度 · 跟踪1个来源

    vLLM通过采用类似于1960年代操作系统使用的虚拟内存分页技术,显著提高了LLM的推理速度。这种PagedAttention算法解决了KV缓存静态GPU内存分配的低效率问题,而这种低效率之前导致了大量的内存浪费。通过根据需要动态分配KV缓存块的内存,vLLM大大减少了GPU显存的浪费,从而使AI模型服务的吞吐量提高2到4倍。