研究人员开发了 Daedalus-150M,这是一种针对高效 CPU 推理进行了优化的新型语言模型。该混合模型结合了稀疏注意力和短卷积,使其三分之二的架构能够避免重新读取广泛的上下文缓存。尽管 Daedalus-150M 在比同类模型少得多的数据上进行了训练,但在五任务基准测试中,其表现优于 GPT-2 124M 和 Pythia-160M 等大型模型,得分达到 47.31,目标是 42.20。该模型在解码速度方面也表现出更快的速度,尤其是在处理更长上下文时,并且其 4 位量化形式的文件大小更小。 AI
影响 该模型的混合架构可能为在消费级硬件上运行更高效的 LLM 铺平道路,从而减少对强大 GPU 的依赖。
排序理由 该条目描述了一种新的语言模型架构及其在基准测试中的表现,发布在 Hugging Face Papers 上。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- ARC-Easy
- central processing unit
- Daedalus-150M
- GPT-2 124M
- GPT-neo-125M
- HellaSwag
- MobileLLM-125M
- OpenBookQA
- OPT-125M
- Pythia-160M
- WinoGrande
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →