一款名为 Eider 的新推理运行时已为 NVIDIA DGX Spark 及类似硬件开发,使用 Rust 和 CUDA 从头构建。Eider 旨在利用 SM121 GPU 的 NVFP4 功能,不依赖 llama.cpp 或 vLLM 等现有库。它支持 Qwen、Agents-A1、Step-3.7-Flash、Gemma 4 以及 NVIDIA 的 Nemotron 3 等多种模型,其显著特点是将专家从磁盘分页以适应内存中更大的模型。该运行时包含一个 OpenAI 兼容的服务器,并旨在通过专注于 SM121 优化来为本地编码任务提供更快的启动速度。 AI
影响 这个新运行时可以在特定的 NVIDIA 硬件上实现更快的本地 AI 模型推理,从而可能改善开发人员的工作流程。
排序理由 该条目描述了一个用于在特定硬件上运行 AI 模型的新软件工具,而不是一个核心 AI 模型发布或研究。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →