NVIDIA 发布了 Nemotron 3.5 Lightning 30B-A3B 系列下的新型草稿模型,专为专业化解码任务设计。Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash 拥有 8.33 亿参数,可在 H100 和 RTX 5090 等硬件上加速 30B 目标模型以进行 DFlash 解码。另一个变体 Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark 拥有 9.67 亿参数,并优化了 DGX Spark 和 H100 系统上 DSpark 解码的延迟。这些模型采用混合专家混合(MoE)架构,结合了 Mamba2 和 Transformer 组件,拥有 30 亿激活参数,并在 OpenMDW-1.1 许可下支持 100 万个 token 的上下文窗口。 AI
影响 这些专业的草稿模型可能为特定的解码任务和硬件配置提供性能改进。
排序理由 来自前沿实验室(NVIDIA)的新模型发布。
在 Mastodon — mastodon.social 阅读 →
- DGX Spark
- DSpark
- FLASH
- Mamba2
- Nemotron 3.5 Lightning 30B-A3B
- Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash
- Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark
- NVFP4
- NVIDIA
- Transformer
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →