一位Reddit用户分享了他在配备128GB内存的MacBook Max上运行Qwen 3.8 27B模型的经验。他们报告称,初始速度约为每秒30个token,即使在使用高达50,000个token的上下文窗口时,速度也仅略微下降到每秒27个token。该用户正在寻求关于优化性能和确认模型量化设置的建议,该模型通过Unsloth Studio运行。 AI
影响 提供了关于大型语言模型在高端消费硬件上实际性能的见解。
排序理由 用户在消费硬件上对特定模型的性能测试。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →