PulseAugur
实时 10:45:51
English(EN) These startups are chasing the next big thing in LLMs

初创公司挑战 Transformer 架构,寻求下一代大语言模型

多家初创公司正在开发大语言模型(LLMs)的新方法,旨在克服当前 Transformer 架构的局限性。这些 Transformer 模型虽然是现代大语言模型的基础,但随着文本长度的增加,计算成本会变得非常高且效率低下,导致能源消耗过大并限制了上下文窗口的大小。这些新兴公司正在探索稀疏注意力(sparse attention)和替代架构等创新方法,以创建更快、更高效、潜力更大的大语言模型。 AI

影响 新的架构可能会显著降低大语言模型的计算成本和能源消耗,从而有可能实现更大的上下文窗口和更复杂的推理能力。

排序理由 文章讨论了大语言模型领域的趋势和新兴技术,但没有宣布具体的新产品或研究里程碑。

在 MIT Technology Review 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

初创公司挑战 Transformer 架构,寻求下一代大语言模型

报道来源 [1]

  1. MIT Technology Review TIER_1 English(EN) · Will Douglas Heaven ·

    这些初创公司正在追逐大语言模型的下一个重大突破

    MIT Technology Review’s What’s Next series looks across industries, trends, and technologies to give you a first look at the future. You can read the rest of them here. Way back in the summer of 2017, AI researchers at Google put out a paper called “Attention Is All You Need…