一个新仓库已被开发出来,通过将 spec-decode 草稿模型的部分卸载到备用 GPU 来协助 DGX Spark 系统的用户。这种技术可以释放 DGX Spark 上的内存,从而实现更长的上下文长度或提高量化质量。该解决方案支持 TCP 和 RDMA 协议,并与 eugr-vllm 修改兼容。 AI
影响 该工具可以通过优化内存使用,使 DGX Spark 用户能够运行更大的模型或处理更复杂的任务。
排序理由 该项目描述了一个增强现有硬件的软件工具/仓库,而不是一个新的模型发布或重大的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →