Cohere 推出了一个围绕“巨型内核”架构构建的新 LLM 服务系统,该系统将整个 LLM 解码步骤融合到一次内核启动中。这项创新旨在最大限度地提高 GPU 利用率并提高性能。该系统名为 North Mini Code,据报道在某些基准测试中比 vLLM 的性能快 1.58 倍,并且是完全开源的。 AI
影响 这一发展可能导致更高效的 LLM 服务基础设施,从而可能降低成本并提高推理速度。
排序理由 这是来自一家人工智能公司的产品/基础设施公告,而不是前沿模型发布或核心研究。
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →