一位 Reddit 用户分享了他们对新测试模型 ExLlamaV3 的积极体验。他们报告称,在 8x3090 配置上运行 GLM 5.3 Flash 时,预填充速度达到惊人的 700 tokens/秒,解码速度达到 42 tokens/秒。该用户还指出,该模型在处理超过 3000 万个 token 时表现良好,并对 ExLlamaV3 等社区驱动的项目表示感谢。 AI
影响 展示了本地 LLM 部署的性能提升。
排序理由 用户对特定模型实现的评论。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →