Reddit用户在r/LocalLLaMA子版块分享了他们使用GGUF格式的Qwen 3.6 35B模型在Radeon 7600显卡上运行的经验。在超频VRAM并使用llama.cpp优化设置后,他们达到了每秒21个token的速度。用户还注意到一个奇怪的bug,即当应用程序窗口可见时,token生成速度会降低,而最小化时则会提高。 AI
影响 展示了在消费级硬件上运行大型语言模型可实现的性能。
排序理由 用户在特定硬件和软件上运行特定模型的性能报告。
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →