Nvidia 发布了 Qwen3.8-Flash-Next,一个拥有 1250 亿参数的模型,作为 NVFP4 检查点。该模型集成了混合注意力和专家混合 (MoE) 架构。它已针对在 Nvidia 的 Blackwell B200/B300 硬件上通过 vLLM 运行进行了优化,与 BF16 相比,量化使其磁盘大小减少了 63%。 AI
影响 为新硬件优化的模型发布加速了大型语言模型的推理性能。
排序理由 前沿实验室模型发布,附带系统卡。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
- Hybrid Attention based Multimodal Network for Spoken Language Classification
- NVFP4
- Nvidia
- Nvidia Blackwell B200
- Nvidia Blackwell B300
- Qwen3.8-Flash-Next
- vLLM
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →