GPT-2 124M
PulseAugur coverage of GPT-2 124M — every cluster mentioning GPT-2 124M across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Daedalus-150M:一种针对CPU推理优化的新型混合LLM架构
研究人员开发了Daedalus-150M,这是一种针对CPU推理优化的新型语言模型架构。与传统模型在设计后进行缩减不同,Daedalus-150M在设计时就考虑了CPU的限制,并采用了卷积-注意力混合机制。这种设计使其能够在显著减少内存需求的情况下保持性能,尤其是在处理长上下文时。
-
新型 Daedalus-150M 模型通过混合架构实现更快的 CPU 推理
研究人员开发了 Daedalus-150M,这是一种针对高效 CPU 推理进行了优化的新型语言模型。该混合模型结合了稀疏注意力和短卷积,使其三分之二的架构能够避免重新读取广泛的上下文缓存。尽管 Daedalus-150M 在比同类模型少得多的数据上进行了训练,但在五任务基准测试中,其表现优于 GPT-2 124M 和 Pythia-160M 等大型模型,得分达到 47.31,目标是 42.20。该模型在解码速度方面也表现出更快的速度,…
-
新的ELO算法增强了学优化器在长视野任务上的性能
研究人员开发了一种名为ELO(Efficient Long-hOrizon)的新元训练算法,以改进学优化器(LOs)。ELO解决了元训练扩展到长视野问题以及与Adam和Muon等成熟优化器竞争的挑战。该算法将计算重新分配到更长的失败模式,并使用渐进式专家监督来获得稳定的学习信号。实证研究表明,ELO在下游语言建模和图像分类任务上显著增强了LO的性能,其中ELO-Celo2在语言建模上持续优于AdamW,并与Muon保持竞争力,同时元训…
-
研究发现自训练重构语言模型
一篇新的研究论文挑战了对语言模型自训练的普遍理解,认为它重构而非扁平化语言。研究发现,虽然话语标记等表面语言特征有所增加,但问句和被动语态等深层句法结构却有所下降。这种“结构深度假说”认为,语言特征的衰减率主要由其结构复杂性决定,而不仅仅是模型输出中的频率。