r/LocalLLaMA 子版块的用户正在讨论在本地运行大型语言模型的最低可接受性能指标。参与者正在分享他们对每秒 token 数的提示处理 (PP) 和文本生成 (TG) 的阈值。一位用户报告称,需要至少 300-350 tokens/秒的提示处理和 9 tokens/秒的文本生成才能认为本地设置可用。 AI
影响 为在消费级硬件上运行 LLM 的用户定义了基线性能预期。
排序理由 用户讨论本地 LLM 部署的性能指标。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →