PulseAugur
实时 08:54:02
实体 GPT-2 124M

GPT-2 124M

PulseAugur coverage of GPT-2 124M — every cluster mentioning GPT-2 124M across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_212038 ·

    Daedalus-150M:一种针对CPU推理优化的新型混合LLM架构

    研究人员开发了Daedalus-150M,这是一种针对CPU推理优化的新型语言模型架构。与传统模型在设计后进行缩减不同,Daedalus-150M在设计时就考虑了CPU的限制,并采用了卷积-注意力混合机制。这种设计使其能够在显著减少内存需求的情况下保持性能,尤其是在处理长上下文时。

  2. TOOL · CL_216305 ·

    新型 Daedalus-150M 模型通过混合架构实现更快的 CPU 推理

    研究人员开发了 Daedalus-150M,这是一种针对高效 CPU 推理进行了优化的新型语言模型。该混合模型结合了稀疏注意力和短卷积,使其三分之二的架构能够避免重新读取广泛的上下文缓存。尽管 Daedalus-150M 在比同类模型少得多的数据上进行了训练,但在五任务基准测试中,其表现优于 GPT-2 124M 和 Pythia-160M 等大型模型,得分达到 47.31,目标是 42.20。该模型在解码速度方面也表现出更快的速度,…

  3. TOOL · CL_138256 ·

    新的ELO算法增强了学优化器在长视野任务上的性能

    研究人员开发了一种名为ELO(Efficient Long-hOrizon)的新元训练算法,以改进学优化器(LOs)。ELO解决了元训练扩展到长视野问题以及与Adam和Muon等成熟优化器竞争的挑战。该算法将计算重新分配到更长的失败模式,并使用渐进式专家监督来获得稳定的学习信号。实证研究表明,ELO在下游语言建模和图像分类任务上显著增强了LO的性能,其中ELO-Celo2在语言建模上持续优于AdamW,并与Muon保持竞争力,同时元训…

  4. RESEARCH · CL_41829 ·

    研究发现自训练重构语言模型

    一篇新的研究论文挑战了对语言模型自训练的普遍理解,认为它重构而非扁平化语言。研究发现,虽然话语标记等表面语言特征有所增加,但问句和被动语态等深层句法结构却有所下降。这种“结构深度假说”认为,语言特征的衰减率主要由其结构复杂性决定,而不仅仅是模型输出中的频率。