一种新的模型架构 Qwen3.8-Flash-Next 被讨论,估计其在理想的 4 位量化下可能需要约 82 GB。该模型的大 n-gram 表被认为访问稀疏,使其成为卸载到系统 RAM 的良好候选者。这种设计表明,一旦权重可用,该架构可能非常适合本地使用。 AI
影响 如果权重发布,则有可能实现更易于访问的本地人工智能部署。
排序理由 讨论一种新的模型架构及其本地部署的潜力。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →