PulseAugur
中
实时 03:27:20
实体 GPUStack

GPUStack

PulseAugur coverage of GPUStack — every cluster mentioning GPUStack across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
时间线
  1. 2026-07-08 product_launch GPUStack launched a new Usage feature for tracking resource consumption in shared GPU clusters. 来源
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_172545 ·

    vLLM vs. SGLang:Kimi-K3 基准测试显示上下文长度影响

    对 Kimi-K3 模型进行的 vLLM 和 SGLang 推理基准测试比较显示,性能差异取决于上下文长度。在 64K 上下文窗口下,vLLM 表现出卓越的速度;而 SGLang 凭借其 Decode Context Parallelism (DCP) 功能,在更长的 200K 上下文工作负载下速度更快。主要性能瓶颈被确定在解码阶段,而非预填充阶段,并且随着上下文长度的增加,SGLang 显示出更好的吞吐量稳定性。

  2. TOOL · CL_157126 ·

    GLM-5.2-FP8-DSpark 部署显示性能提升参差不齐

    GPUStack 上的一位社区成员部署了 GLM-5.2-FP8-DSpark,这是 GLM-5.2-FP8 的增强版本,它整合了来自 Red Hat AI 的外部草稿模型的推测性解码。性能测试结果喜忧参半:在单并发场景下,DSpark 提升了 2.2 倍;但在高并发情况下,其表现不如原始模型。研究结果表明,DSpark 目前最适合低并发交互式用例,而非高吞吐量的生产工作负载。

  3. TOOL · CL_131113 ·

    GPUStack 推出共享 GPU 集群使用追踪功能

    GPUStack 推出了新的使用(Usage)功能,旨在提供对共享 GPU 集群内资源消耗的详细洞察。此功能旨在回答关于计算资源在哪里被使用、由谁使用以及用于哪些模型的关键问题。它提供了对 token 使用量、GPU/CPU 实例运行时间和存储的可见性,并能够按用户、API 密钥和模型类型细分使用情况,从而促进成本分配和资源管理。