在DGX Spark上对Qwen3.8模型的性能测试显示,71分的得分并非模型能力的体现,而是由于vLLM堆栈过时。更新到带有原生MTP5 on NVFP4的ARM64版本后,同一基准测试获得了93分,解码吞吐量提高了46-57%。尽管有这些改进,但由于缺乏发布门禁,安全门禁仍然存在。 AI
影响 展示了软件堆栈优化如何在专用硬件上显著提升LLM性能。
排序理由 特定硬件上LLM的性能基准测试,包含软件堆栈改进的细节。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →