V100s
PulseAugur coverage of V100s — every cluster mentioning V100s across labs, papers, and developer communities, ranked by signal.
-
Qwen3.6-27B 模型针对 V100 GPU 优化,速度达 366 t/s
一位开发者已针对 NVIDIA V100 GPU 优化了 Qwen3.6-27B 模型,在特定基准测试中达到了每秒 366 个 token 的速度。此优化名为“v100-skinny”,专注于为 NVFP4 权重创建快速路径,并在 SM70 架构上实现高效的深度推断。虽然峰值性能针对特定提取任务有所体现,但对于 JSON 等结构化数据,实际生成速度约为每秒 240 个 token,代码生成速度约为每秒 200 个 token。
-
Reddit 用户分析 GPU 规格以实现 LLM 预填充性能
r/LocalLLaMA 上的一个 Reddit 用户分析了各种 GPU 和机器在运行大型语言模型方面的适用性,强调了预填充性能相对于原始生成速度的重要性。分析表明,虽然像 3090 这样的高端 GPU 对于单流使用来说可能有点过头,但像 P100 这样的旧卡因其内存和带宽而具有显著价值。用户还指出,与其它选项相比,Mac Studio 定价过高且效率低下,并正在寻求用户提交的功耗数据以进一步完善其性能图表。
-
Qwen3.6 27B 模型在 V100 GPU 上达到 1000 tps
Reddit 的 r/LocalLLaMA 论坛上一位用户报告称,在使用 Qwen3.6 27B 模型时实现了每秒 1000 个 token (tps) 的生成速度。这一令人印象深刻的性能是在使用 NVIDIA V100 GPU 并处理 128 个并发请求的情况下实现的。对于单用户场景(批处理大小为 1),生成速度约为 80 tps,处理速度约为 3000 tps,并且没有提及多线程处理 (MTP) 的限制。