一个名为 AgrillaMoE 的新推理引擎已被开发出来,它从 llama.cpp 分叉而来,用于优化 Qwen 3.6-35B-A3B 模型在 16GB GPU 上的使用。该引擎利用 Unsloth quants 和一种新颖的“MoE 扩展”技术,允许在不重新训练的情况下,每 token 咨询更多的模型专家。据报道,这种方法在 GPQA-Diamond 等基准测试中提高了性能,得分高于标准配置。 AI
影响 使得在消费级硬件上更有效地使用大型语言模型成为可能,从而可能降低高级 AI 应用的入门门槛。
排序理由 这是一个用户开发的用于优化现有模型的工具/引擎,而不是来自前沿实验室的发布或重大的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →