研究人员推出了一种新颖的混合专家(MoE)架构EntropyMoE,专为处理动态字节块的无分词器大型语言模型设计。与对所有块应用统一计算的现有模型不同,EntropyMoE根据其熵将块路由到特定的专家,从而实现自适应容量分配。该方法旨在通过根据字节块内的语义和粒度变化定制计算来提高效率和性能。实验表明,与密集和稀疏基线相比,EntropyMoE在持出每字节比特数方面取得了卓越的性能,同时保持了可比的下游准确性。 AI
影响 这项研究通过优化无分词器架构的计算,有望带来更高效、更具适应性的大型语言模型。
排序理由 该集群包含一篇详细介绍LLM新模型架构的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →