nvidia-smi
PulseAugur coverage of nvidia-smi — every cluster mentioning nvidia-smi across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
消费级GPU上大语言模型的能效因架构而异,而非仅取决于大小
一篇新论文对本地部署的大语言模型(LLMs)在消费级硬件上的能效进行了基准测试,结果表明,除了参数数量之外,模型架构和量化等因素也显著影响能耗。研究发现,qwen2.5:0.5b和tinyllama:1.1b等小型模型能效最高,而像7B-Mistral这样的大型模型每token消耗的功耗则要高得多。该研究还强调了区分不同token生成模式的重要性,因为有些模型由于内部推理时间过长而表现出异常高的能耗。
-
指南解释本地部署大语言模型所需的VRAM
在本地运行大语言模型需要仔细管理VRAM,因为模型大小和量化会显著影响内存使用。虽然没有精确的公式,但可以通过考虑模型的参数数量、权重的比特宽度(例如FP16、INT8、INT4)以及激活和临时缓冲区的开销来估算VRAM需求。Ollama、GPTQ和bitsandbytes等工具可以促进量化,从而减小内存占用。例如,一个量化到INT8的130亿参数模型可能需要大约18 GB的VRAM,这个数字可以使用nvidia-smi等工具进行检查。
-
LingBot-Map教程展示GPU感知3D重建
一个教程演示了如何使用LingBot-Map进行GPU感知3D重建和点云导出。该过程包括配置输入源、重建设置和输出格式,然后根据检测到的GPU功能自动调整帧限制和VRAM使用等参数。用户可以安装必要的存储库,下载预训练的检查点,并处理图像或视频帧来构建GCTStream模型,最终执行推理、解码相机参数,并将重建的场景导出为各种文件类型。
-
NVIDIA AI 基础设施认证计划启动,提供培训资源
现已推出 NVIDIA 认证助理:AI 基础设施与运营 (NCA-AIIO) 认证的培训计划及相关资源。该计划包括录播课程、考试指南和模拟考试,并提供直播课程。一位学员分享了他们通过考试的经验,指出考试侧重于基础概念,并提供了视频概览和免费模拟测试等额外资源,以帮助他人备考。
-
使用 PrismML llama.cpp 和兼容 OpenAI 的服务器部署 1-Bit Bonsai-27B 模型
本教程详细介绍了使用 llama.cpp 的专用分支部署 1-bit Bonsai-27B 语言模型,该分支包含针对其独特量化格式的 CUDA 内核。该过程包括设置环境、编译必要的推理二进制文件以及从 Hugging Face 下载模型权重。然后,用户可以通过命令行界面或兼容 OpenAI 的本地推理服务器与模型进行交互,并提供流式响应、多轮对话和多模态扩展等高级配置选项。
-
DGX Spark GPU 过热问题通过 nvidia-smi 时钟锁定解决
一位开发者找到了解决 DGX Spark GPU 在运行 Ollama 和 Qwen2.5 等大型语言模型时过热问题的变通方法。该 GPU,特别是 GB10,缺乏用户可访问的电源和风扇控制,导致在持续负载下温度约为 83°C。通过使用 `nvidia-smi --lock-gpu-clocks` 命令,开发者创建了一个守护进程,动态调整 GPU 时钟速度,将温度保持在 78°C 以下,使其稳定在 72°C。虽然此方法会略微影响推理速度…
-
KV 缓存内存问题困扰 LLM 服务,vLLM 的 PagedAttention 提供解决方案
KV 缓存是 LLM 推理中的关键组件,它存储过去的计算结果,以避免为每个新 token 重新计算。然而,其内存占用可能成为一个重大瓶颈,尤其是在具有并发用户和长上下文窗口的生产环境中。单个序列可能消耗数 GB 的内存,当有多个对话同时进行时,会迅速超出 GPU 容量。传统方法为 KV 缓存预先分配大块连续内存,导致内部碎片化和内存浪费,因为大多数对话并未达到分配的最大长度。
-
本地 LLM 硬件指南:VRAM、量化与性能
在本地运行大型语言模型(LLM),尤其是拥有 700 亿参数的模型,带来了严峻的硬件挑战,主要涉及 VRAM 容量。尽管营销宣传常暗示最低要求,但实际使用表明,将 70B 模型装入 8GB VRAM 必须进行大量优化,如量化。量化通过降低模型权重的比特表示来减小模型大小,对于在消费级硬件上运行这些模型至关重要,尽管它需要在内存使用、速度和输出质量之间进行权衡。使用 `nvidia-smi` 等工具监控 VRAM 使用情况对于理解 LL…
-
用户通过修复PCIe插槽瓶颈将LLM推理速度提升一倍
一位用户在构建用于本地LLM推理的多GPU设置时,发现一个配置错误的PCIe插槽造成了严重的性能瓶颈。四块RTX 3090 GPU中的一块被错误地安装在一个仅支持PCIe 2.0 x4速度的插槽中,严重限制了其带宽。在重新配置GPU以充分利用其PCIe能力后,用户观察到推理速度显著提升,Mistral 128B的性能几乎翻倍。
-
Utilyze 提供开源工具,实现超越负载的更深入 GPU 性能洞察
Utilyze 是一款新的开源工具,旨在提供超越简单负载百分比的更深入的 GPU 性能洞察。它直接访问 GPU 性能计数器,以衡量推理过程中 AI 模型的实际利用率和效率。该工具旨在通过提供更准确的硬件使用情况视图,帮助工程师优化其 AI 部署环境,特别是针对 vLLM 等框架。