NVIDIA 已发布两种大型语言模型的量化版本,DeepSeek-V4-Pro-0813 和 Qwen3.8-2.4T-A95B,采用了其 NVFP4 量化方法。DeepSeek 模型拥有 1.65 万亿参数,采用混合注意力机制,并通过 SGLang 在 Nvidia 的 Blackwell B200 硬件上运行。Qwen 模型是一个拥有 2.4 万亿参数、950 亿激活参数的 MoE 模型,支持 100 万 token 的上下文长度,并在 GB200/B300 硬件上使用 vLLM 和 SGLang 运行。 AI
影响 能够在大规模 LLM 上部署新硬件,提高效率和性能。
排序理由 NVIDIA 正在为其新硬件发布前沿模型(DeepSeek、Qwen)的量化版本,这是来自主要 AI 基础设施提供商的直接发布。[lever_c_demoted from frontier_release: ic=2 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →