PulseAugur
实时 11:50:43
实体 DGX Sparks

DGX Sparks

PulseAugur coverage of DGX Sparks — every cluster mentioning DGX Sparks across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. RESEARCH · CL_252622 ·

    DeepSeek 发布 v4.1 Flash 模型;MiniMax 分享 H3 开源权重

    DeepSeek 发布了其 Flash 模型 4.1 版本,可在 4x DGX Sparks 硬件上运行。另外,MiniMax 发布了其 H3 模型的开源权重,表明其开发取得了快速进展。

  2. COMMENTARY · CL_231194 ·

    AMD Epyc 与 DGX Sparks 在大模型集群上的对比:成本与性能的权衡

    Reddit 上的一篇讨论比较了使用 NVIDIA DGX Sparks 构建本地大语言模型(LLM)集群与使用 AMD Epyc 处理器构建系统的成本效益。用户质疑选择 DGX Sparks 的逻辑,认为配备更多内存和可能更少但更强大 GPU 的 AMD Epyc 服务器可能以相同的成本提供更好的性能和带宽。比较突出了理论带宽差异,Epyc 系统显示出更高的潜在吞吐量。

  3. TOOL · CL_214664 ·

    个人用户将 GPU 集群扩展到 36 个 DGX Sparks,实现 4.6TB 统一内存

    一位用户已将其个人实验室的 GPU 集群从 16 个 DGX Sparks 扩展到 36 个,实现了 4.6TB 的统一内存。此次升级使得 Kimi K3 等先进模型能够与重排、嵌入以及各种生成媒体处理任务同时运行。用户选择 DGX Sparks 而非 6000 Pros 或 B200s,是因为其在可扩展统一内存方面的价值、针对个人实验室的散热和能源考量,以及未来升级的灵活性。

  4. TOOL · CL_124530 ·

    GLM-5.2 NVFP4 修复bug后在128K上下文下达到24 tok/s · 跟踪到1个来源

    一位用户解决了在四台DGX Spark上运行GLM-5.2 NVFP4模型时遇到的问题,在128K上下文长度下实现了约每秒24个token的吞吐量。该问题涉及推测解码配置中的一个bug,其中草稿模型的KV缓存和元数据被分片,但其注意力机制未能识别这种分片,导致计算错误。通过确保在配置过程中正确复制`decode_context_parallel_size`,修复了此bug,消除了之前上下文长度和速度之间的权衡。

  5. TOOL · CL_90048 ·

    DeepSeek V4-Flash 在双DGX Sparks上达到40 Ttk/s

    一位用户分享了在双DGX Sparks硬件上运行DeepSeek V4-Flash模型的配置和基准测试。该设置在FP8精度下实现了约每秒40万亿token(tera-tokens per second)的吞吐量,并在处理具有256k上下文窗口的多个请求时,聚合吞吐量可达每秒350万亿token。此性能与Nvidia RTX Pro 6000和Mac M2 Ultra系统进行了比较,突显了双DGX设置在大模型推理方面的效率。

  6. MEME · CL_84115 ·

    LLM 爱好者寻求机架以容纳多个 AI 计算设备

    一位用户在 r/LocalLLaMA 子版块上寻求高质量、全金属机架或置物架的推荐,用于整理用于托管大型语言模型的多个小型计算设备。该用户目前拥有两台 DGX Sparks 和一台 Framework Strix Halo 电脑,并计划用更多设备扩展其设置,需要一个能够适应未来增长的解决方案。他们正在寻找在美国可用的选项,并对亚马逊上找到的塑料侧面机架的制造质量表示担忧。