PulseAugur
实时 12:35:00
实体 GPT-style models

GPT-style models

PulseAugur coverage of GPT-style models — every cluster mentioning GPT-style models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_129931 ·

    新方法估算语言模型容量为每参数 3.6 比特

    研究人员开发了一种新颖的方法来量化语言模型的记忆容量,区分了无意记忆和泛化。他们的发现表明,GPT 类模型拥有大约每参数 3.6 比特的容量。研究观察到,模型会一直记忆数据直到其容量被填满,之后开始泛化,记忆量随之下降。这项涉及数百个 Transformer 模型的研究,建立了将模型容量和数据大小与成员推断联系起来的标度律。

  2. RESEARCH · CL_128373 ·

    新框架统一了因果和掩码模型的上下文学习分析

    研究人员开发了一个统一的统计学习框架,用于分析因果和掩码语言模型的上下文学习(ICL)能力。该框架将自回归和掩码预训练目标置于共同的超额风险分析中,为两者提供了理论界限。实验表明,像掩码对编码器(MPE)这样的掩码语言模型可以达到与GPT-2风格的因果Transformer相当的性能,这表明ICL并非因果模型的专属。

  3. TOOL · CL_74697 ·

    个人在GTX 1050 GPU上训练GPT风格模型

    一位个人详细介绍了他在配备有限显存的消费级GTX 1050 GPU上训练GPT风格语言模型的经验。最初目标是训练一个编码模型,但遇到了数据集大小的限制,于是将重点转移到一个面向土耳其税务的助手。这一转变揭示了现有土耳其语模型的不足,促使他设定了一个新目标:在本地训练一个基础的土耳其语GPT模型。作者发现维基百科数据集为此类项目提供了更易于管理的规模,尽管分词器训练最初带来了一些挑战。