PulseAugur
实时 05:51:02
实体 Srikanta Datta Tumkur

Srikanta Datta Tumkur

PulseAugur coverage of Srikanta Datta Tumkur — every cluster mentioning Srikanta Datta Tumkur across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_218891 ·

    研究发现:KV 压缩比更多 GPU 更便宜,适用于 LLM 服务

    一篇新的研究论文比较了两种优化大型语言模型 (LLM) 服务的方法:张量并行和 KV 缓存压缩。该研究在 A100、A40 和 H100 硬件上模拟了性能,发现对于内存受限的 LLM 部署,KV 压缩比增加 GPU 数量更具成本效益。压缩提供了 1.20 倍至 2.00 倍的成本优势,而张量并行对于超出设备内存容量的模型以及降低延迟是必要的,尽管它会增加每 token 的延迟。