多家初创公司正在开发大语言模型(LLMs)的新方法,旨在克服当前 Transformer 架构的局限性。这些 Transformer 模型虽然是现代大语言模型的基础,但随着文本长度的增加,计算成本会变得非常高且效率低下,导致能源消耗过大并限制了上下文窗口的大小。这些新兴公司正在探索稀疏注意力(sparse attention)和替代架构等创新方法,以创建更快、更高效、潜力更大的大语言模型。 AI
影响 新的架构可能会显著降低大语言模型的计算成本和能源消耗,从而有可能实现更大的上下文窗口和更复杂的推理能力。
排序理由 文章讨论了大语言模型领域的趋势和新兴技术,但没有宣布具体的新产品或研究里程碑。
- Attention Is All You Need
- Greg Brockman
- International Energy Agency
- Justin Dangel
- LLMs
- MIT Technology Review
- OpenAI
- Subquadratic Inc.
- Transformer++
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →