NVIDIA 推出了 Nemotron-Labs-TwoTower,这是一款开放权重的扩散语言模型,旨在提高文本生成吞吐量。该模型将扩散过程分为两个独立的组件:一个冻结的自回归上下文塔和一个训练好的去噪器塔。这种架构允许并行生成 token,实现了 2.42 倍的吞吐量提升,同时保留了传统自回归模型 98.7% 的质量。 AI
影响 这种新颖的双塔架构可能为高效的 LLM 推理设定新标准,有望加速实时 AI 应用。
排序理由 NVIDIA 发布了一款具有新颖架构的新型开放权重模型,以提高性能。
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →