NVIDIA发布了一系列Nemotron-Labs-Teacher模型,每个模型拥有5500亿参数,但只有550亿参数被激活使用。这些模型采用了包含Mamba-2、MoE和多Token预测的LatentMoE架构,支持高达100万Token的上下文窗口。这些模型在OpenMDW-1.1许可下可用,并且需要大量的硬件支持,例如4块B200/GB200或8块H100 GPU才能运行。 AI
影响 这些模型在上下文窗口长度和架构方面推动了界限,可能影响未来的LLM开发。
排序理由 前沿实验室模型发布,附带系统卡。
在 Mastodon — mastodon.social 阅读 →
- GB200
- LatentMoE
- Mamba-2
- Nemotron-Labs-Teacher-Chat
- Nemotron-Labs-Teacher-Competition-Coding
- Nemotron-Labs-Teacher-General-Reasoning
- Nemotron-Labs-Teacher-STEM
- NVIDIA
- OpenMDW-1.1
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →