在 r/LocalLLaMA 子版块的用户正在讨论哪些大语言模型(LLMs)在 M5 Max 硬件上表现最佳。参与者们分享了他们使用不同模型和量化方法的经验,以优化性能和每秒生成的 token 数(tk/s)。对话突出了 Qwen 和 GLM 等模型的进展,用户将当前速度与旧的基准进行比较。 AI
影响 用户正在分享关于优化本地大语言模型性能的见解,这可能会为使用类似硬件的其他人提供信息。
排序理由 用户讨论现有模型在硬件上的性能表现。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →