PulseAugur
实时 15:57:32
Deutsch(DE) Qwen3.8 auf DGX Spark: Warum ein Score von 71 kein Modellurteil war Ein Tool-Score von 71 lag nicht am Modell, sondern am veralteten vLLM-Stack: Mit aktuellem A

Qwen3.8在DGX Spark上通过vLLM更新提升性能

在DGX Spark上对Qwen3.8模型的性能测试显示,71分的得分并非模型能力的体现,而是由于vLLM堆栈过时。更新到带有原生MTP5 on NVFP4的ARM64版本后,同一基准测试获得了93分,解码吞吐量提高了46-57%。尽管有这些改进,但由于缺乏发布门禁,安全门禁仍然存在。 AI

影响 展示了软件堆栈优化如何在专用硬件上显著提升LLM性能。

排序理由 特定硬件上LLM的性能基准测试,包含软件堆栈改进的细节。[lever_c_demoted from research: ic=1 ai=1.0]

在 Mastodon — mastodon.social 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Qwen3.8在DGX Spark上通过vLLM更新提升性能

报道来源 [1]

  1. Mastodon — mastodon.social TIER_1 Deutsch(DE) · aisyndicate ·

    Qwen3.8 on DGX Spark:为何71分并非模型判断失误,而是vLLM堆栈过时所致:当前A

    Qwen3.8 auf DGX Spark: Warum ein Score von 71 kein Modellurteil war Ein Tool-Score von 71 lag nicht am Modell, sondern am veralteten vLLM-Stack: Mit aktuellem ARM64-Build und nativem MTP5 auf NVFP4 steigt derselbe Lauf auf 93 Punkte, plus 46-57% Decode-Durchsatz. Ein rotes Securi…