GPT-style models
PulseAugur coverage of GPT-style models — every cluster mentioning GPT-style models across labs, papers, and developer communities, ranked by signal.
-
研究:GPT模型因分词挑战难以处理符号音乐
一篇新的研究论文探讨了类GPT模型为何难以直接应用于符号音乐生成。该研究认为,虽然这些模型通过使用离散的、可重用结构标记来擅长处理语言,但音乐分词在寻找有效的压缩坐标系方面面临挑战。该研究引入了有效性-无损性框架(Effectiveness--Losslessness Framework),强调成功的分词需要一个能够预测性地压缩音乐事实并保留关系自由度以进行上下文建模的坐标系。
-
新方法估算语言模型容量为每参数 3.6 比特
研究人员开发了一种新颖的方法来量化语言模型的记忆容量,区分了无意记忆和泛化。他们的发现表明,GPT 类模型拥有大约每参数 3.6 比特的容量。研究观察到,模型会一直记忆数据直到其容量被填满,之后开始泛化,记忆量随之下降。这项涉及数百个 Transformer 模型的研究,建立了将模型容量和数据大小与成员推断联系起来的标度律。
-
新框架统一了因果和掩码模型的上下文学习分析
研究人员开发了一个统一的统计学习框架,用于分析因果和掩码语言模型的上下文学习(ICL)能力。该框架将自回归和掩码预训练目标置于共同的超额风险分析中,为两者提供了理论界限。实验表明,像掩码对编码器(MPE)这样的掩码语言模型可以达到与GPT-2风格的因果Transformer相当的性能,这表明ICL并非因果模型的专属。
-
个人在GTX 1050 GPU上训练GPT风格模型
一位个人详细介绍了他在配备有限显存的消费级GTX 1050 GPU上训练GPT风格语言模型的经验。最初目标是训练一个编码模型,但遇到了数据集大小的限制,于是将重点转移到一个面向土耳其税务的助手。这一转变揭示了现有土耳其语模型的不足,促使他设定了一个新目标:在本地训练一个基础的土耳其语GPT模型。作者发现维基百科数据集为此类项目提供了更易于管理的规模,尽管分词器训练最初带来了一些挑战。