一位开发者创建了UGR,一个开源的AI运行时操作系统,旨在管理通用硬件上的AI推理工作负载。UGR作为现有推理引擎(如llama.cpp和TensorRT-LLM)之上的一个编排层,将AI模型视为可以动态地在不同内存层级(VRAM、RAM、NVMe)之间移动的资源集合。这种方法旨在克服CUDA内存不足等限制,特别是对于拥有较旧或性能较低GPU的用户。该项目还包括一个模拟引擎,用于在执行前预测性能和资源使用情况。 AI
影响 使更多开发者能够在现有硬件上运行大型语言模型,可能降低AI实验的门槛。
排序理由 这是一个新的开源项目,它提供了一种管理AI推理的新方法,但它不是来自主要实验室的前沿发布,也不是一项重大的全行业事件。
- AI Runtime Operating System
- Colibri
- CUDA
- Dell Precision 5520
- gemma-4-31b.gguf
- GGUF
- llama.cpp
- NVIDIA Quadro M1200
- Ollama
- OpenAI
- TensorRT-LLM
- Vulkan
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →