PulseAugur
实时 18:15:26
English(EN) Extened garlic to run Qwen3.5 35B A3B float8 at 55 tok/s on RTX 5060 Ti

Qwen3.5 35B 模型在 RTX 5060 Ti 上以 float8 优化运行,速度达 55 token/秒

一位 Reddit 用户分享了使用 float8 精度运行 Qwen3.5 35B 模型的一种优化方法,在 RTX 5060 Ti 上实现了 55 token/秒的速度。这一性能显著超过了 llama.cpp 在相同模型上运行 Q8 量化时的表现。该用户还指出,通过 MTP(一次生成多个 token)等技术可以进一步提高速度,并计划在博客文章中记录这种优化方法。 AI

影响 展示了在消费级 GPU 上实现更快本地推理的潜力,从而使更多用户能够访问更大的模型。

排序理由 用户驱动的优化,用于在消费级硬件上运行特定的 LLM。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Qwen3.5 35B 模型在 RTX 5060 Ti 上以 float8 优化运行,速度达 55 token/秒

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/Azazelionide ·

    Extened garlic to run Qwen3.5 35B A3B float8 at 55 tok/s on RTX 5060 Ti

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1v53ymz/extened_garlic_to_run_qwen35_35b_a3b_float8_at_55/"> <img alt="Extened garlic to run Qwen3.5 35B A3B float8 at 55 tok/s on RTX 5060 Ti" src="https://external-preview.redd.it/cmU5cDAyMHRtNGZoMfvZj5R1nvA…