NVML
PulseAugur coverage of NVML — every cluster mentioning NVML across labs, papers, and developer communities, ranked by signal.
-
开发者构建本地LLM服务器,支持自动VRAM模型选择
一位开发者使用FastAPI和llama.cpp创建了一个本地LLM服务器,该服务器可根据可用的GPU VRAM自动选择合适的GGUF模型。该设置允许用户在本地运行各种模型,从7B到70B参数不等,并提供与OpenAI兼容的API。该系统使用NVML检测NVIDIA GPU的VRAM,或使用Metal检测Apple Silicon的VRAM,确保在不依赖云服务或达到速率限制的情况下高效部署模型。该项目还被打包成一个名为Strata的桌…
-
本地 LLM 服务器使用 VRAM 路由实现高效模型选择
一份技术指南演示了如何使用 llama.cpp 和 FastAPI 设置本地大型语言模型服务器。该系统具有 VRAM 感知路由功能,可以根据可用的 GPU 内存和请求的上下文大小自动选择最合适的 LLM。这种方法使用户能够运行各种 GGUF 量化模型,包括 Llama 和 Mistral 系列的模型,并提供兼容 OpenAI 的 API 端点,以便于集成。
-
新方法使用 GPU 遥测检测隐藏的机器学习训练
研究人员开发了一种使用图形处理单元 (GPU) 的零开销遥测来检测隐藏的机器学习训练的方法。该方法利用隐私保护的 NVML 遥测,该遥测可以观察计算的物理效应,而无需访问模型权重或训练数据等敏感数据。开发的分类器在识别训练工作负载方面达到了 98.2% 的准确率,并证明了其对抗对手伪装的有效性。
-
Kubernetes 算子实现 LLM 服务的缩减至零
新的 Kubernetes 算子正在涌现,以解决运行大型语言模型的成本问题,特别是闲置 GPU 烧钱的问题。Hearth 是一个处于 alpha 阶段的算子,允许用户声明式地服务开源 LLM,并在不使用时将其缩减至零,在冷启动期间缓冲请求。另一种方法是构建一个使用 NVML 的 KEDA 外部扩展器,以实现基于实际 GPU 利用率的自动扩展,从而减少对 Prometheus 等完整指标堆栈的需求。
-
NVIDIA 边缘 AI 硬件缺乏能源归因能力
一篇新论文指出了 NVIDIA 旗舰边缘 AI 硬件(特别是 ASUS Ascent GX10 系统中发现的 GB10 SoC)存在严重的能源可观测性差距。研究表明,当前硬件缺乏在进程级别归因能耗的必要遥测数据,而这对于理解 agentic AI 工作负载的能源成本至关重要。与 x86 平台不同,这种缺陷阻碍了准确的能源归因。该论文提出了能源归因 AI 的硬件需求规范,并建议了一个临时的校准桥梁。