Reddit 的 r/LocalLLaMA 社区正在讨论即将发布的 Qwen 3.8-27B 模型的技术规格。用户们正在争论该模型将采用多令牌预测 (MTP) 还是 DFlash 头部,其中一位用户指出,采用 MTP 的 3.6 27B 版本在其系统上实现了大约 8 tokens/秒的性能。尽管与更大模型相比可能存在性能限制,但对新发布的期待显而易见。 AI
影响 社区讨论突显了用户对即将发布的模型版本的兴趣和技术考量。
排序理由 关于即将发布的模型技术细节的社区讨论,而非直接公告。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →