NVIDIA 推出了 Shadow Engine Recovery 功能,旨在大幅缩短大型语言模型 (LLM) 推理的停机时间。这项新功能允许备用引擎接管,耗时约 7.3 秒,相比冷重启通常需要的 283 秒有了显著改进。通过在相同的 GPU 上维护一个就绪引擎,并利用 NVIDIA Dynamo 的 GPU Memory Service 共享权重,该功能旨在几乎消除服务中断。 AI
影响 减少 LLM 推理停机时间,可能提高 AI 驱动应用程序的可靠性和响应能力。
排序理由 这是对现有技术的功能发布,而不是新的前沿模型或重大的行业变革。
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →