PulseAugur
实时 09:26:46
English(EN) Xiaomi just claimed 1,000+ tps on a 1T model using a standard 8-GPU server

小米声称在8GPU上1T参数模型达到1000+ token/秒

小米的MiMo团队宣布了MiMo-V2.5-Pro UltraSpeed,这是一个拥有1万亿参数的专家混合(Mixture-of-Experts)模型,能够超过每秒1000个token。这一性能是在标准的8GPU服务器上实现的,采用了FP4量化与QAT、DFlash投机解码以及TileRT延迟优化内核等技术。该公司已通过其API以高价向部分用户提供此高速模型。 AI

影响 展示了在标准硬件上大型模型的推理速度取得了重大飞跃,可能降低高性能AI的成本并提高其可及性。

排序理由 在商品硬件上对大型模型提出了显著的性能声明,表明AI推理速度有了显著的进步。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →

小米声称在8GPU上1T参数模型达到1000+ token/秒

报道来源 [3]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/No-Selection2972 ·

    小米在标准8GPU服务器上声称1T模型实现了1000+ tps

    <!-- SC_OFF --><div class="md"><p>Just saw Xiaomi MiMo announce <strong>MiMo-V2.5-Pro UltraSpeed</strong>, claiming they broke the <strong>1,000 tokens/sec output barrier on a 1 trillion parameter MoE model</strong>. According to them, they’re doing it on a <strong>single standar…

  2. r/singularity TIER_2 English(EN) · /u/Worldly_Evidence9113 ·

    小米与 TileRT 在标准商用 GPU 上实现了 1 万亿参数模型的 1000+ TPS…… 定制芯片的时代结束了?

    &#32; submitted by &#32; <a href="https://www.reddit.com/user/Worldly_Evidence9113"> /u/Worldly_Evidence9113 </a> <br /> <span><a href="https://v.redd.it/yhhcffbui66h1">[link]</a></span> &#32; <span><a href="https://www.reddit.com/r/singularity/comments/1u270b8/xiaomi_tilert_just…

  3. r/singularity TIER_2 English(EN) · /u/elemental-mind ·

    小米在拥有1T权重模型的8个商品GPU集群上实现了1000+t/s

    <table> <tr><td> <a href="https://www.reddit.com/r/singularity/comments/1u0o9xn/xiaomi_achieves_1000ts_on_8x_commodity_gpu/"> <img alt="Xiaomi achieves 1000+t/s on 8x commodity GPU cluster with 1T weights model" src="https://external-preview.redd.it/djdiNW5tbHY1NTZoMcwdOZIKfH_YdK…