中国公司美团开发了LongCat-2.0,一个拥有1.6万亿参数的AI模型。值得注意的是,该模型完全在中国国产AI芯片上训练,避免了使用NVIDIA硬件。该模型的效率源于其混合专家(Mixture-of-Experts)设计,每个token仅使用其3%的参数,使其可以在性能较低的非NVIDIA加速器上进行训练。 AI
影响 证明了在非NVIDIA硬件上训练大型模型的可能性,可能使AI基础设施格局更加多元化。
排序理由 前沿实验室模型发布,附带系统卡 [lever_c 从 frontier_release 降级:ic=2 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →