小米的MiMo团队宣布了MiMo-V2.5-Pro UltraSpeed,这是一个拥有1万亿参数的专家混合(Mixture-of-Experts)模型,能够超过每秒1000个token。这一性能是在标准的8GPU服务器上实现的,采用了FP4量化与QAT、DFlash投机解码以及TileRT延迟优化内核等技术。该公司已通过其API以高价向部分用户提供此高速模型。 AI
影响 展示了在标准硬件上大型模型的推理速度取得了重大飞跃,可能降低高性能AI的成本并提高其可及性。
排序理由 在商品硬件上对大型模型提出了显著的性能声明,表明AI推理速度有了显著的进步。
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →