Ling-3.0 (BailingMoE3) 模型已正式集成到 llama.cpp 主线,可在本地设置中使用。Ling-3.0 tiny (8B) 和 flash (127B) 模型的量化 GGUF 版本现已可用。在 Intel Arc B580 GPU 上的初步基准测试显示出有希望的性能,其中 8B 模型在 12GB VRAM 内实现了超过 120 tokens/秒的速度,并支持高达 128K 的上下文。 AI
影响 实现了 Ling-3.0 模型更广泛的本地部署和测试。
排序理由 将特定模型集成到现有的开源推理引擎中。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →