PulseAugur
实时 07:16:44
English(EN) EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs

新的EntropyMoE架构通过稀疏专家路由优化了无分词器的LLM

研究人员推出了一种新颖的混合专家(MoE)架构EntropyMoE,专为处理动态字节块的无分词器大型语言模型设计。与对所有块应用统一计算的现有模型不同,EntropyMoE根据其熵将块路由到特定的专家,从而实现自适应容量分配。该方法旨在通过根据字节块内的语义和粒度变化定制计算来提高效率和性能。实验表明,与密集和稀疏基线相比,EntropyMoE在持出每字节比特数方面取得了卓越的性能,同时保持了可比的下游准确性。 AI

影响 这项研究通过优化无分词器架构的计算,有望带来更高效、更具适应性的大型语言模型。

排序理由 该集群包含一篇详细介绍LLM新模型架构的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的EntropyMoE架构通过稀疏专家路由优化了无分词器的LLM

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Bo Liu, Muxuab Yu, Yu Zhang, Pengfei Gao, Yongping Zhang ·

    EntropyMoE:面向无分词器的LLM的熵感知稀疏专家路由

    arXiv:2608.06398v1 Announce Type: new Abstract: Recent byte-level large language models (LLMs) have made tokenizer-free modeling increasingly competitive by grouping bytes into dynamically sized patches. However, existing byte-patch architectures still apply the same dense feed-f…