实体
Tesla P40
Tesla P40
PulseAugur coverage of Tesla P40 — every cluster mentioning Tesla P40 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
Tesla P40:F16 KV 在 LLM 生成方面比 Q8 更快
r/LocalLLaMA 上的一个 Reddit 用户详细介绍了在 Tesla P40 GPU 上为大型语言模型使用 F16 KV 和 Q8 KV 之间的性能差异。分析表明,虽然 Q8 使用的 VRAM 更少,但 F16 KV 在生成 token 方面速度更快,尤其是在上下文小于 10 万 token 时。这是因为 F16 KV 可以直接利用张量核心,而 Q8 需要进行即时反量化,这会引入显著的计算开销。
-
Tesla P40 GPU 改造以改善 AI 推理散热
Reddit 的 r/LocalLLaMA 子版块上一位用户详细介绍了他们改造 Tesla P40 GPU 以进行 AI 推理的实验。他们成功地将一块 P40 改装成 8+6pin 接口并使用标准的 1080 TI 散热器,显著降低了噪音并改善了散热性能。该用户设计并测试了一个新的风扇导流罩,允许两块显卡在 120-130W 的功耗下可持续运行而不会出现热关机,噪音水平约为 42DB。