Attention Is All You Need
PulseAugur coverage of Attention Is All You Need — every cluster mentioning Attention Is All You Need across labs, papers, and developer communities, ranked by signal.
- authored by Łukasz Kaiser 100%
- authored by Noam Shazeer 100%
- authored by Aidan N. Gomez 100%
- authored by Ashish Vaswani 100%
- authored by Illia Polosukhin 100%
- authored by Jakob Uszkoreit 100%
- authored by Niki Parmar 100%
- used by generative pre-trained transformer 90%
- authored by Google Brain 90%
- authored by transformers 90%
- instance of transformers 90%
- instance of generative pre-trained transformer 70%
10 天有情绪数据
-
IBM发布Granite 4.0 3B Vision,Hugging Face分享vLLM和PyTorch工具
IBM发布了Granite 4.0 3B Vision,这是一款专为企业文档设计的紧凑型多模态智能模型。此次发布是Hugging Face上共享的更广泛进展的一部分,包括新工具和研究。其他相关内容包括关于使用HF Jobs运行vLLM服务器的指南以及对使用PyTorch进行性能分析的深入探讨,重点关注注意力机制。
-
从零开始构建 Transformer:深入解析 LLM 架构
一篇技术文章详细介绍了从零开始构建 Transformer 模型的过程,旨在揭开其内部工作原理的神秘面纱。作者通过一个简单的英译德任务,引导读者完成每个步骤,包括分词、向量嵌入以及编码器-解码器结构。这种实践方法有助于更深入地理解支撑许多现代大型语言模型的架构。
-
“Attention Is All You Need”论文作者离开Google,预示着TPU货币化转型
开创性论文“Attention Is All You Need”的所有合著者现已离开Google。Jeff Dean和Sanjay Ghemawat等关键人物已离职创办Discovery Loop,而其他人则加入了OpenAI和Anthropic等主要AI实验室。这次人才外流表明Google的战略重心可能正在从前沿模型开发转向其张量处理单元(TPU)基础设施和云服务的货币化。
-
研究人员发布“Attention Is All You Need”论文,彻底改变大语言模型架构
2017年,来自Google Brain和Google Research的八位研究人员发表了题为“Attention Is All You Need”的论文,提出了一种革命性的自然语言处理方法。该论文解决了之前像循环神经网络(RNN)和长短期记忆(LSTM)网络等模型存在的关键内存限制问题,这些模型按顺序处理信息,并饱受梯度消失和训练缓慢等问题的困扰。新的架构基于注意力机制的概念,旨在通过一种更有效的方法取代传统的内存机制来克服这些挑…
-
初创公司挑战 Transformer 架构,寻求下一代大语言模型
多家初创公司正在开发大语言模型(LLMs)的新方法,旨在克服当前 Transformer 架构的局限性。这些 Transformer 模型虽然是现代大语言模型的基础,但随着文本长度的增加,计算成本会变得非常高且效率低下,导致能源消耗过大并限制了上下文窗口的大小。这些新兴公司正在探索稀疏注意力(sparse attention)和替代架构等创新方法,以创建更快、更高效、潜力更大的大语言模型。
-
乐高积木类比解析现代GPT架构及效率提升
本文使用乐高积木类比解释现代GPT架构的内部工作原理,详细说明了单个token如何从输入处理到输出。文章分解了RoPE、RMSNorm和SwiGLU等关键改进,解释了这些进步如何比GPT-2等旧模型提高效率。解释侧重于Transformer Blocks和注意力机制,这对于理解GPT模型如何通过预测下一个token来生成文本至关重要。
-
生成式AI将重心转移到应用和基础设施优化
生成式AI的发展已从基础性突破转向渐进式改进和以应用为中心的创新。随着大型语言模型(LLM)接近学习平台期,公司们现在正专注于提高底层基础设施的效率和优化,并开发实际应用。这包括在智能体编码、检索增强生成(RAG)和键值(KV)缓存优化方面的进展,预示着对于有新想法的构建者来说,这是一个绝佳的机会。
-
Hugging Face 博客系列涵盖 vLLM、PyTorch 性能分析和 AI 导师
Hugging Face 正在发布一系列涵盖各种 AI 主题的博客文章。这些文章包括关于使用 HF Jobs 运行 vLLM 服务器的说明、PyTorch 中注意力机制性能分析指南,以及对 AI 导师在何时进行干预(TutorMoments)的能力的探讨。
-
Eric Leung 在 PWL NYC 讨论 "Attention Is All You Need"
Eric Leung 于 2024 年在 Papers We Love NYC 活动上介绍了开创性论文 "Attention Is All You Need"。本次演讲可能深入探讨了该论文的核心概念、其对大型语言模型 (LLM) 发展的影响以及它在现代 AI 架构中的基础性作用。
-
开发者用 PyTorch 从头开始构建 Transformer 模型
Sparsh Sharma 详细介绍了使用 PyTorch 从头开始构建 Transformer 模型的过程,强调了理解底层机制的重要性,而不仅仅是使用预训练模型。该教程涵盖了自注意力机制、多头注意力和位置编码等关键组件,并指出了常见的陷阱,例如 RNN 中的梯度消失以及注意力机制中进行缩放的必要性。Sharma 的动机源于在为 Manshverse 项目微调 Groq、Gemini 和 Mistral AI 等 API 时遇到问题后…
-
从头开始构建的 Transformer 架构用于英语到泰米尔语翻译
某个人使用 PyTorch 从头开始开发和训练了一个 Transformer 神经网络架构。该模型专门用于英语到泰米尔语的机器翻译,并基于 "Attention Is All You Need" 论文。该项目包括详细的数学解析和分步教程,代码可在 GitHub 上找到,数据集托管在 Hugging Face 上。
-
IBM 发布用于企业文档的 Granite 4.0 3B Vision 模型
IBM 发布了 Granite 4.0 3B Vision,这是一款专为企业文档设计的紧凑型多模态智能模型。此次发布是 Hugging Face 上共享的更广泛进展的一部分,包括用于运行 vLLM 服务器的新工具和对 PyTorch 性能分析的见解。
-
AI人才战升温:顶尖研究员被OpenAI、Anthropic挖角
AI行业正经历一场人才大战,OpenAI、Google DeepMind、Anthropic、xAI和Meta等大公司在稀缺的顶尖研究员群体中展开激烈竞争。这种竞争以巨额薪酬为特点,近期Google DeepMind的关键人物,如基础Transformer论文的合著者Noam Shazeer,被挖角至OpenAI;而因AlphaFold获得诺贝尔奖的John Jumper则去了Anthropic。这种对人才的极度关注引发了关于谁将最终…
-
理解 GPT:令牌、Transformer 和训练详解
本文提供了一份关于理解生成式预训练 Transformer(GPT)的实用指南,解释了它们是用于处理和预测令牌序列的神经网络语言模型。文章详细介绍了 GPT 的含义,即生成式(Generative)、预训练(Pre-trained)和 Transformer(Transformer),并强调了 Transformer 架构使用了“Attention Is All You Need”论文中引入的注意力机制。该指南还解释了令牌化(toke…
-
Hugging Face 详细介绍 PyTorch 性能分析和 vLLM 部署
Hugging Face 发布了一系列博文,详细介绍了 PyTorch 中的高级性能分析技术。这些文章涵盖了优化神经网络组件(如 nn.Linear 和融合 MLP)以及关注注意力机制以进行性能分析。此外,其中一篇文章演示了如何使用 HF Jobs 运行 vLLM 服务器以实现高效部署。
-
LLM 详解:Transformer 和 Token 如何驱动人工智能语言模型
本文是一篇关于大型语言模型(LLM)的入门指南,解释了它们作为复杂的预测机器,通过猜测序列中的下一个词来发挥基本功能。文章详细介绍了像 ChatGPT、Claude 和 Gemini 这样的 LLM 如何构建在 Transformer 架构之上,该架构利用自注意力机制,通过同时权衡句子中所有词的重要性来理解上下文。将文本转换为计算机可理解的格式的过程包括分词(将词分解成更小的单元)和创建向量嵌入(以数值形式表示这些词的含义)。
-
AI社区分享
Reddit上的一个讨论探讨了重要的
-
Genesis Molecular AI 开发 PEARL 模型用于药物发现
Genesis Molecular AI 是一家专注于药物发现人工智能的公司,开发了一个名为 PEARL 的新模型,该模型可以高精度地预测蛋白质的三维结构。这一突破解决了长期存在的蛋白质柔性建模的挑战,这是识别可行药物候选物的关键步骤。公司首席技术官 Sergey Edunov 曾领导 Meta 的 LLM 训练,联合创始人 Evan Feinberg 强调,现在这一领域正在进行创新的扩散研究,超越了传统的 LLM 架构。
-
理解大型语言模型:GPT、ChatGPT 和 Transformer 架构
本文解释了像 GPT 这样的大型语言模型(LLMs)的基本概念,详细说明了它们如何通过模式预测而非事实回忆来生成文本。它澄清了 GPT 是底层模型架构,而 ChatGPT 是面向用户的应用程序。文章强调了 OpenAI 的使命是确保人工智能造福人类,并将大型语言模型的发展追溯到 2017 年的开创性论文《Attention Is All You Need》,该论文介绍了彻底改变了顺序词处理的 Transformer 架构。
-
RAG 基准测试缺陷揭露:分块策略而非 LLM 驱动结果
一位开发检索增强生成(RAG)系统的开发者遇到了其基准测试的问题,发现分块策略和问题难度的变化同时改变了模型排名。该开发者发现,基准测试并未准确衡量 LLM 能力,而是衡量了分块配置的有效性。在对 Transformer 论文的一个特定问题进行检索失败导致模型回答错误后,尽管答案存在于原始文档中,开发者才意识到这一点。