PulseAugur
实时 15:02:29

新型3D架构ThAME加速LLM专家混合模型推理

研究人员开发了ThAME,这是一种新颖的3D异构多芯片架构,旨在加速利用专家混合(MoE)架构的大型语言模型(LLM)的推理。ThAME解决了MoE推理中的关键瓶颈,包括内存带宽限制、令牌路由的非确定性流量以及同步专家输出聚合。该架构集成了基于FeFET的非易失性内存和基于DRAM的易失性内存芯片,并配有专门的通信骨干网,在速度和能效方面均取得了显著改进。 AI

影响 这种新架构可以显著提高运行大型复杂LLM的效率和速度,可能降低推理成本并支持新应用。

排序理由 关于LLM新硬件架构的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新型3D架构ThAME加速LLM专家混合模型推理

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Pratyush Dhingra, Pramit Kumar Pal, Janardhan Rao Doppa, Partha Pratim Pande ·

    ThAME:用于 LLM 专家混合的 3D 内存异构加速器

    arXiv:2607.17074v1 Announce Type: cross Abstract: Mixture of Experts (MoE) architectures have emerged as a dominant paradigm for scaling Large Language Models (LLMs). However, MoE inference on conventional hardware is constrained by three fundamental bottlenecks. These encompass …