研究人员为Ascend系统上的混合专家(MoE)推理开发了一种新的通信设计,旨在减少令牌交换中的瓶颈。该方法通过直接将数据放入目标专家窗口并从远程窗口读取,消除了中间中继和重新排序缓冲区。该系统利用全局汇聚式高带宽内存(HBM)和对称内存分配,从而提高了MoE工作负载的首个令牌时间和每输出令牌的竞争力。 AI
影响 这项研究可能导致在特定硬件平台上对大型MoE模型进行更高效的推理。
排序理由 这是一篇详细介绍MoE推理优化新颖技术方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →