一位开发者成功地在四块2017年的NVIDIA V100 GPU上运行了使用NVFP4量化的Qwen 3.8模型,实现了与现代RTX 5090相当的性能。这一壮举值得注意,因为NVFP4是为更新的NVIDIA Blackwell架构设计的,而V100缺乏对模型使用的FP4和FP8格式的原生支持。开发者通过创建名为QPN的软件翻译器实现了这一点,该翻译器允许V100高效地处理模型,在解码吞吐量和得到正确答案的时间上与RTX 5090相当。 AI
影响 使得在旧的、成本较低的硬件上运行现代LLM成为可能,从而可能降低AI实验的门槛。
排序理由 开发者创建的软件,使旧硬件能够高效运行模型。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →