PulseAugur
实时 13:40:26
Deutsch(DE) NVIDIA Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash ist ein 833M-Parameter-Draft-Modell für DFlash-spezifische Dekodierung. Es beschleunigt das 30B-Zielmodell au

NVIDIA 发布 Nemotron 3.5 Lightning 草稿模型以实现专业化解码 · 跟踪 3 个来源

NVIDIA 发布了 Nemotron 3.5 Lightning 30B-A3B 系列下的新型草稿模型,专为专业化解码任务设计。Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash 拥有 8.33 亿参数,可在 H100 和 RTX 5090 等硬件上加速 30B 目标模型以进行 DFlash 解码。另一个变体 Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark 拥有 9.67 亿参数,并优化了 DGX Spark 和 H100 系统上 DSpark 解码的延迟。这些模型采用混合专家混合(MoE)架构,结合了 Mamba2Transformer 组件,拥有 30 亿激活参数,并在 OpenMDW-1.1 许可下支持 100 万个 token 的上下文窗口。 AI

影响 这些专业的草稿模型可能为特定的解码任务和硬件配置提供性能改进。

排序理由 来自前沿实验室(NVIDIA)的新模型发布。

在 Mastodon — mastodon.social 阅读 →

AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →

NVIDIA 发布 Nemotron 3.5 Lightning 草稿模型以实现专业化解码 · 跟踪 3 个来源

报道来源 [3]

  1. Mastodon — mastodon.social TIER_1 Deutsch(DE) · aisyndicate ·

    NVIDIA Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash 是一个 8.33 亿参数的草稿模型,用于 DFlash 特定解码。它加速了 30B 目标模型

    NVIDIA Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash ist ein 833M-Parameter-Draft-Modell für DFlash-spezifische Dekodierung. Es beschleunigt das 30B-Zielmodell auf H100/RTX 5090. SPEED-Bench-Akzeptanzrate: 3.16 (Draft-Länge 7). Lizenz: OpenMDW-1.1. https:// huggingface.co/nvidia/NV…

  2. Mastodon — mastodon.social TIER_1 Deutsch(DE) · aisyndicate ·

    NVIDIA Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark 是一个 9.67 亿参数的草稿模型,用于 DSpark 投机解码。它优化了 DGX Spark 的延迟

    NVIDIA Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark ist ein 967M-Parameter-Draft-Modell für DSpark-spekulative Dekodierung. Es optimiert die Latenz auf DGX Spark (GB10) und H100. SPEED-Bench-Akzeptanzrate: 3,75 (Draft-Länge 7). Lizenz: OpenMDW-1.1. https:// huggingface.co/nvidia/N…

  3. Mastodon — mastodon.social TIER_1 English(EN) · aisyndicate ·

    NVIDIA Nemotron 3.5 Lightning 30B-A3B:混合MoE(Mamba2/Transformer),3B激活参数。NVFP4训练和多Token预测(MTP)实现

    NVIDIA Nemotron 3.5 Lightning 30B-A3B: Hybrid MoE (Mamba2/Transformer) mit 3B aktiven Parametern. NVFP4-Training und Multi-Token Prediction (MTP) ermöglichen native spekulative Dekodierung. 1M Kontextfenster, OpenMDW-Lizenz. https:// huggingface.co/nvidia/NVIDIA-N emotron-3.5-Lig…