一篇新的研究论文介绍了一种无需重新训练即可减少推理 token 数量和延迟的方法。通过在推理时调整路由器,将更多专家容量分配给最终的 Transformer 层,模型可以实现更短的推理轨迹。该技术应用于 Qwen 3.6 35B A3B 以创建 Qwen 3.6 35B A4B+,在保持准确性的同时,平均推理 token 减少了 8.5%,延迟降低了 10.9%。 AI
影响 这项技术可能导致在不进行昂贵重新训练的情况下,大型语言模型实现更高效、更快速的推理。
排序理由 研究论文,详细介绍了一种优化 MoE 模型的新颖方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →