Attention Is All You Need
PulseAugur coverage of Attention Is All You Need — every cluster mentioning Attention Is All You Need across labs, papers, and developer communities, ranked by signal.
- authored by Łukasz Kaiser 100%
- authored by Noam Shazeer 100%
- authored by Aidan N. Gomez 100%
- authored by Jakob Uszkoreit 100%
- authored by Illia Polosukhin 100%
- authored by Ashish Vaswani 100%
- authored by Niki Parmar 100%
- instance of generative pre-trained transformer 90%
- authored by transformers 90%
- authored by John Michael Jumper 90%
- authored by Google Brain 90%
- used by vLLM 70%
3 天有情绪数据
-
引用量排名前 50 的人工智能研究人员
已编制了一份按引用次数排名的前 50 名人工智能研究人员名单。该排名突出了有影响力的论文(如“Attention Is All You Need”)的重大影响,该论文的作者引用次数很高。该名单深入介绍了人工智能领域被引用次数最多的个人。
-
新研究探索注意力机制在持久记忆和激波传输中的应用
两篇新研究论文探索了注意力机制在人工智能中的新颖应用。第一篇论文引入了一个“Retention Layer”(保留层)作为Transformer的持久记忆,旨在保留模型在单次会话之外学习到的信息,并纳入了社会学习策略来决定保留什么。第二篇论文研究了如何利用注意力机制,使有限体积法能够在单次更新中跨单元移动激波而不破坏它们,证明了其在流体动力学模拟中保持激波清晰度的有效性。
-
理解 Transformer 中的注意力机制
本文解释了 Transformer 模型中注意力机制的基本概念,这是现代 AI 的一个关键组成部分。它详细介绍了注意力机制如何让模型权衡输入数据不同部分的重要性,这类似于人类如何关注相关信息。文章分解了 "Attention Is All You Need" 论文中提出的缩放点积注意力,解释了其计算得分关系、缩放和应用 softmax 生成注意力权重的步骤。
-
前Google DeepMind研究员Danijar Hafner正在构建能够提前规划的AI智能体
前Google DeepMind研究员Danijar Hafner正在开发能够为不可预见情况进行规划的AI智能体。他的新创业公司目前处于隐秘模式,专注于通过使用基于模型的强化学习来使机器人能够导航不熟悉的环境。这种方法在模拟世界模型中训练智能体,使它们能够预测未来结果并在现实世界场景中有效行动,而无需大量的试错。
-
Hugging Face 指南详述 vLLM 部署和 PyTorch 注意力剖析
Hugging Face 发布了关于两个不同 AI 开发主题的指南。第一个指南详细介绍了如何使用 HF Jobs 通过一条命令运行 vLLM 服务器,从而简化大型语言模型的部署。第二个指南是关于 PyTorch 剖析系列文章的第三部分,重点关注注意力机制在性能分析中的关键作用。
-
Transformer 架构详解:编码器、解码器与 GPT 的方法
Transformer 架构于 2017 年的论文“Attention Is All You Need”中首次提出,是现代人工智能,特别是语言模型的基础概念。它包含一个编码器和一个解码器,但也存在仅编码器(如 BERT)和仅解码器(如 GPT)等变体。文本首先被分词并转换为数值嵌入,然后添加位置信息以保留序列顺序。核心机制是自注意力(self-attention),它允许词元(token)权衡序列中其他词元的相关性以理解上下文。
-
AI 作为工具:“Attention Is All You Need”如何重塑软件开发
2017年Google工程师发表的“Attention Is All You Need”论文的出现标志着软件开发发生了重大转变,催生了OpenAI的ChatGPT等模型的创建。虽然AI已成为软件创作不可或缺的一部分,但它被视为一种工具,而不是开发者的替代品。理解AI的基本原理,如生成式预训练Transformer(GPT)和分词,对开发人员有效利用其能力是有益的,但并非绝对必要。
-
AI领袖齐聚北京,共襄2026奇点智能大会
由奇点智能研究院与CSDN联合主办的2026奇点智能大会北京站定于11月20日至21日举行。本次盛会将汇聚AI领域的杰出人物,包括OpenAI高级研究科学家、《Attention Is All You Need》论文的合著者Łukasz Kaiser。大会旨在探讨前沿AI技术与工程实践,并设有平行分论坛,聚焦大模型演进与底层系统软件基础设施。
-
quickarXiv将学术论文转化为即时博客文章
quickarXiv是一款新工具,可将arXiv上的学术论文转化为易于理解的博客文章。只需将URL从arXiv更改为quickarXiv,用户即可访问研究论文的即时摘要、关键图表和解释。该服务旨在使更广泛的受众更容易获取复杂的科学信息。
-
使用 llama.cpp 在消费级 GPU 上优化 LLM 性能
这篇博文详细介绍了在消费级多 GPU 硬件上运行大型语言模型的技木挑战和解决方案。作者侧重于使用 llama.cpp 等现有工具和多 GPU 并行等技术来优化性能,而不是开发新的底层代码。解释深入探讨了底层 Transformer 模型架构、Token 的概念以及注意力机制,并将其与马尔可夫链等更简单的模型进行对比,以突出生成连贯文本所涉及的复杂性。
-
IBM发布Granite 4.0 3B Vision,Hugging Face分享vLLM和PyTorch工具
IBM发布了Granite 4.0 3B Vision,这是一款专为企业文档设计的紧凑型多模态智能模型。此次发布是Hugging Face上共享的更广泛进展的一部分,包括新工具和研究。其他相关内容包括关于使用HF Jobs运行vLLM服务器的指南以及对使用PyTorch进行性能分析的深入探讨,重点关注注意力机制。
-
从零开始构建 Transformer:深入解析 LLM 架构
一篇技术文章详细介绍了从零开始构建 Transformer 模型的过程,旨在揭开其内部工作原理的神秘面纱。作者通过一个简单的英译德任务,引导读者完成每个步骤,包括分词、向量嵌入以及编码器-解码器结构。这种实践方法有助于更深入地理解支撑许多现代大型语言模型的架构。
-
“Attention Is All You Need”论文作者离开Google,预示着TPU货币化转型
开创性论文“Attention Is All You Need”的所有合著者现已离开Google。Jeff Dean和Sanjay Ghemawat等关键人物已离职创办Discovery Loop,而其他人则加入了OpenAI和Anthropic等主要AI实验室。这次人才外流表明Google的战略重心可能正在从前沿模型开发转向其张量处理单元(TPU)基础设施和云服务的货币化。
-
研究人员发布“Attention Is All You Need”论文,彻底改变大语言模型架构
2017年,来自Google Brain和Google Research的八位研究人员发表了题为“Attention Is All You Need”的论文,提出了一种革命性的自然语言处理方法。该论文解决了之前像循环神经网络(RNN)和长短期记忆(LSTM)网络等模型存在的关键内存限制问题,这些模型按顺序处理信息,并饱受梯度消失和训练缓慢等问题的困扰。新的架构基于注意力机制的概念,旨在通过一种更有效的方法取代传统的内存机制来克服这些挑…
-
初创公司挑战 Transformer 架构,寻求下一代大语言模型
多家初创公司正在开发大语言模型(LLMs)的新方法,旨在克服当前 Transformer 架构的局限性。这些 Transformer 模型虽然是现代大语言模型的基础,但随着文本长度的增加,计算成本会变得非常高且效率低下,导致能源消耗过大并限制了上下文窗口的大小。这些新兴公司正在探索稀疏注意力(sparse attention)和替代架构等创新方法,以创建更快、更高效、潜力更大的大语言模型。
-
乐高积木类比解析现代GPT架构及效率提升
本文使用乐高积木类比解释现代GPT架构的内部工作原理,详细说明了单个token如何从输入处理到输出。文章分解了RoPE、RMSNorm和SwiGLU等关键改进,解释了这些进步如何比GPT-2等旧模型提高效率。解释侧重于Transformer Blocks和注意力机制,这对于理解GPT模型如何通过预测下一个token来生成文本至关重要。
-
生成式AI将重心转移到应用和基础设施优化
生成式AI的发展已从基础性突破转向渐进式改进和以应用为中心的创新。随着大型语言模型(LLM)接近学习平台期,公司们现在正专注于提高底层基础设施的效率和优化,并开发实际应用。这包括在智能体编码、检索增强生成(RAG)和键值(KV)缓存优化方面的进展,预示着对于有新想法的构建者来说,这是一个绝佳的机会。
-
Hugging Face 博客系列涵盖 vLLM、PyTorch 性能分析和 AI 导师
Hugging Face 正在发布一系列涵盖各种 AI 主题的博客文章。这些文章包括关于使用 HF Jobs 运行 vLLM 服务器的说明、PyTorch 中注意力机制性能分析指南,以及对 AI 导师在何时进行干预(TutorMoments)的能力的探讨。
-
Eric Leung 在 PWL NYC 讨论 "Attention Is All You Need"
Eric Leung 于 2024 年在 Papers We Love NYC 活动上介绍了开创性论文 "Attention Is All You Need"。本次演讲可能深入探讨了该论文的核心概念、其对大型语言模型 (LLM) 发展的影响以及它在现代 AI 架构中的基础性作用。
-
开发者用 PyTorch 从头开始构建 Transformer 模型
Sparsh Sharma 详细介绍了使用 PyTorch 从头开始构建 Transformer 模型的过程,强调了理解底层机制的重要性,而不仅仅是使用预训练模型。该教程涵盖了自注意力机制、多头注意力和位置编码等关键组件,并指出了常见的陷阱,例如 RNN 中的梯度消失以及注意力机制中进行缩放的必要性。Sharma 的动机源于在为 Manshverse 项目微调 Groq、Gemini 和 Mistral AI 等 API 时遇到问题后…