研究人员开发了ThAME,这是一种新颖的3D异构多芯片架构,旨在加速利用专家混合(MoE)架构的大型语言模型(LLM)的推理。ThAME解决了MoE推理中的关键瓶颈,包括内存带宽限制、令牌路由的非确定性流量以及同步专家输出聚合。该架构集成了基于FeFET的非易失性内存和基于DRAM的易失性内存芯片,并配有专门的通信骨干网,在速度和能效方面均取得了显著改进。 AI
影响 这种新架构可以显著提高运行大型复杂LLM的效率和速度,可能降低推理成本并支持新应用。
排序理由 关于LLM新硬件架构的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →