PulseAugur
实时 05:59:20
实体 Vaswani

Vaswani

PulseAugur coverage of Vaswani — every cluster mentioning Vaswani across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_244658 ·

    研究发现 RoPE 位置编码无法外推到更长上下文

    与普遍看法相反,旋转位置嵌入(RoPE)本身并不能外推到比其训练数据显著更长的上下文。2017 年的早期研究表明正弦编码可能具有外推能力,但 2022 年的后续测量显示,正弦和 RoPE 方法的外推能力都有限。2023 年开发了一种称为位置插值(Position Interpolation)的技术,正是因为 RoPE 和类似方法难以进行长度外推,这表明自由外推的说法是不准确的。虽然 RoPE 具有其他优势,例如高效的 KV 缓存,但其…

  2. COMMENTARY · CL_207536 ·

    AI的优势在于假设检验,而非新想法,推动数学和架构的突破

    近期AI的进展并非在于模型产生新想法,而在于其严格验证人类定义的特定假设的能力。这种方法在复杂数学领域取得了重大突破,例如改进了黎曼猜想的覆盖范围,并解决了群论中一个长期存在的问题。AIRA-Compose系统通过系统地测试现有AI组件的组合来发现优于当前模型(如Llama 3.2)在下游任务上的新架构,以此为例证。

  3. TOOL · CL_151152 ·

    注意力机制详解:语言模型如何访问长距离上下文

    语言模型中的注意力机制允许 Token 访问输入序列中的任何位置的信息,克服了早期循环神经网络(RNN)在处理长距离依赖方面存在的局限性。该机制使用查询(queries)、键(keys)和值(values)来计算相关性得分,使 Token 能够直接从任何其他 Token 提取信息,无论其位置如何。这项创新由 Vaswani 及其在 Google 的同事在“Attention Is All You Need”论文中提出,对于 Trans…

  4. COMMENTARY · CL_143072 ·

    理解 GPT:令牌、Transformer 和训练详解

    本文提供了一份关于理解生成式预训练 Transformer(GPT)的实用指南,解释了它们是用于处理和预测令牌序列的神经网络语言模型。文章详细介绍了 GPT 的含义,即生成式(Generative)、预训练(Pre-trained)和 Transformer(Transformer),并强调了 Transformer 架构使用了“Attention Is All You Need”论文中引入的注意力机制。该指南还解释了令牌化(toke…