PulseAugur
实时 12:00:04
English(EN) Building an AI Runtime Operating System for Commodity Hardware (UGR)

新的AI运行时操作系统在通用硬件上编排模型

一位开发者创建了UGR,一个开源的AI运行时操作系统,旨在管理通用硬件上的AI推理工作负载。UGR作为现有推理引擎(如llama.cpp和TensorRT-LLM)之上的一个编排层,将AI模型视为可以动态地在不同内存层级(VRAM、RAM、NVMe)之间移动的资源集合。这种方法旨在克服CUDA内存不足等限制,特别是对于拥有较旧或性能较低GPU的用户。该项目还包括一个模拟引擎,用于在执行前预测性能和资源使用情况。 AI

影响 使更多开发者能够在现有硬件上运行大型语言模型,可能降低AI实验的门槛。

排序理由 这是一个新的开源项目,它提供了一种管理AI推理的新方法,但它不是来自主要实验室的前沿发布,也不是一项重大的全行业事件。

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的AI运行时操作系统在通用硬件上编排模型

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · sumeet saraf ·

    为通用硬件构建AI运行时操作系统 (UGR)

    <h1> Building an AI Runtime Operating System for Commodity Hardware </h1> <p>For the last few months I've been working on something that started as a simple question:</p> <blockquote> <p>Why do we still treat AI inference as "load an entire model into GPU memory and hope it fits"…