PulseAugur
实时 08:17:24
English(EN) Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference

新型 Daedalus-150M 模型通过混合架构实现更快的 CPU 推理

研究人员开发了 Daedalus-150M,这是一种针对高效 CPU 推理进行了优化的新型语言模型。该混合模型结合了稀疏注意力和短卷积,使其三分之二的架构能够避免重新读取广泛的上下文缓存。尽管 Daedalus-150M 在比同类模型少得多的数据上进行了训练,但在五任务基准测试中,其表现优于 GPT-2 124MPythia-160M 等大型模型,得分达到 47.31,目标是 42.20。该模型在解码速度方面也表现出更快的速度,尤其是在处理更长上下文时,并且其 4 位量化形式的文件大小更小。 AI

影响 该模型的混合架构可能为在消费级硬件上运行更高效的 LLM 铺平道路,从而减少对强大 GPU 的依赖。

排序理由 该条目描述了一种新的语言模型架构及其在基准测试中的表现,发布在 Hugging Face Papers 上。[lever_c_demoted from research: ic=1 ai=1.0]

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新型 Daedalus-150M 模型通过混合架构实现更快的 CPU 推理

报道来源 [1]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    Daedalus-150M:专为CPU推理设计的卷积-注意力混合模型

    A small hybrid language model using sparse attention and short convolutions achieves faster CPU inference and better benchmark scores than larger conventional models despite training on far less data.