一个名为 Whittle MoE 27B 的新型混合专家(MoE)模型,通过从 Qwen3.8-27B 模型中分离专家并仅重训路由器而开发。此方法旨在减少模型循环和截断响应的倾向,据报道在对话能力和结构化输出生成方面有所改进。该模型在量化运行时需要 24GB 的 VRAM,可通过 Hugging Face 下载,但进一步开发取决于捐赠。 AI
影响 展示了一种通过重训路由器来改进现有模型的方法,可能为更高效的微调提供途径。
排序理由 来自非前沿实验室的模型发布,附有详细的技术描述。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Trending Models 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →