nvidia-smi
PulseAugur coverage of nvidia-smi — every cluster mentioning nvidia-smi across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
使用 PrismML llama.cpp 和兼容 OpenAI 的服务器部署 1-Bit Bonsai-27B 模型
本教程详细介绍了使用 llama.cpp 的专用分支部署 1-bit Bonsai-27B 语言模型,该分支包含针对其独特量化格式的 CUDA 内核。该过程包括设置环境、编译必要的推理二进制文件以及从 Hugging Face 下载模型权重。然后,用户可以通过命令行界面或兼容 OpenAI 的本地推理服务器与模型进行交互,并提供流式响应、多轮对话和多模态扩展等高级配置选项。
-
DGX Spark GPU 过热问题通过 nvidia-smi 时钟锁定解决
一位开发者找到了解决 DGX Spark GPU 在运行 Ollama 和 Qwen2.5 等大型语言模型时过热问题的变通方法。该 GPU,特别是 GB10,缺乏用户可访问的电源和风扇控制,导致在持续负载下温度约为 83°C。通过使用 `nvidia-smi --lock-gpu-clocks` 命令,开发者创建了一个守护进程,动态调整 GPU 时钟速度,将温度保持在 78°C 以下,使其稳定在 72°C。虽然此方法会略微影响推理速度…
-
KV 缓存内存问题困扰 LLM 服务,vLLM 的 PagedAttention 提供解决方案
KV 缓存是 LLM 推理中的关键组件,它存储过去的计算结果,以避免为每个新 token 重新计算。然而,其内存占用可能成为一个重大瓶颈,尤其是在具有并发用户和长上下文窗口的生产环境中。单个序列可能消耗数 GB 的内存,当有多个对话同时进行时,会迅速超出 GPU 容量。传统方法为 KV 缓存预先分配大块连续内存,导致内部碎片化和内存浪费,因为大多数对话并未达到分配的最大长度。
-
本地 LLM 硬件指南:VRAM、量化与性能
在本地运行大型语言模型(LLM),尤其是拥有 700 亿参数的模型,带来了严峻的硬件挑战,主要涉及 VRAM 容量。尽管营销宣传常暗示最低要求,但实际使用表明,将 70B 模型装入 8GB VRAM 必须进行大量优化,如量化。量化通过降低模型权重的比特表示来减小模型大小,对于在消费级硬件上运行这些模型至关重要,尽管它需要在内存使用、速度和输出质量之间进行权衡。使用 `nvidia-smi` 等工具监控 VRAM 使用情况对于理解 LL…
-
用户通过修复PCIe插槽瓶颈将LLM推理速度提升一倍
一位用户在构建用于本地LLM推理的多GPU设置时,发现一个配置错误的PCIe插槽造成了严重的性能瓶颈。四块RTX 3090 GPU中的一块被错误地安装在一个仅支持PCIe 2.0 x4速度的插槽中,严重限制了其带宽。在重新配置GPU以充分利用其PCIe能力后,用户观察到推理速度显著提升,Mistral 128B的性能几乎翻倍。
-
Utilyze 提供开源工具,实现超越负载的更深入 GPU 性能洞察
Utilyze 是一款新的开源工具,旨在提供超越简单负载百分比的更深入的 GPU 性能洞察。它直接访问 GPU 性能计数器,以衡量推理过程中 AI 模型的实际利用率和效率。该工具旨在通过提供更准确的硬件使用情况视图,帮助工程师优化其 AI 部署环境,特别是针对 vLLM 等框架。