一位开发者使用FastAPI和llama.cpp创建了一个本地LLM服务器,该服务器可根据可用的GPU VRAM自动选择合适的GGUF模型。该设置允许用户在本地运行各种模型,从7B到70B参数不等,并提供与OpenAI兼容的API。该系统使用NVML检测NVIDIA GPU的VRAM,或使用Metal检测Apple Silicon的VRAM,确保在不依赖云服务或达到速率限制的情况下高效部署模型。该项目还被打包成一个名为Strata的桌面应用程序,使用Tauri 2和React构建,具有聊天UI和模型浏览器。 AI
影响 使用户能够在本地部署LLM,绕过云成本和速率限制,前提是用户拥有足够的VRAM。
排序理由 开发者创建的用于在本地运行LLM的工具。
- FastAPI
- GGUF
- Llama-2-13B-Chat-GGUF
- Llama-2-70B-Chat-GGUF
- Llama-2-7B-Chat-GGUF
- llama.cpp
- Metal
- NVML
- Omerfaruk-aydn
- OpenAI
- React
- Strata
- Tauri 2
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →