一位独立开发者创建了一种名为WarpState的新语言模型架构,拥有1.5013亿个参数,并在约3亿个英文token上进行了训练。该模型通过在128个token的块内使用局部分块注意力(local tiled attention)和双快/慢张量内存系统来保留长序列信息,从而偏离了标准的Transformer架构。开发者在笔记本电脑GPU上训练了这个实验性模型,突显了其高效计算的潜力。 AI
影响 这项研究探索了Transformer的替代架构,可能带来更高效、更专业的语言模型。
排序理由 该条目描述了一种新颖的语言模型架构及其训练,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →