tokenization
PulseAugur coverage of tokenization — every cluster mentioning tokenization across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Coinbase 在阿布扎比设立代币化中心,助力该酋长国数字资产雄心
Coinbase 宣布在阿布扎比设立国际代币化中心,这标志着该酋长国成为全球数字资产中心的雄心迈出了重要一步。该中心设在阿布扎比国际金融中心(ADGM)内,将专注于代币化证券,Coinbase 已获得安排投资交易和提供这些资产托管的许可。这一发展凸显了阿布扎比已建立的虚拟资产监管框架,该框架已吸引了包括 Binance 在内的众多加密货币公司。
-
理解 Transformer:从分词到自注意力机制
本文剖析了 Transformer 模型背后的核心概念,重点介绍了它们如何处理语言。文章解释了分词(tokenization),即将文本分割成更小的片段,以及分词 ID(token IDs),即这些片段的数值表示。该过程继续介绍嵌入(embeddings),将分词转换为捕获它们之间关系的向量,以及位置编码(positional encoding),它为序列中分词的位置添加信息。最后,文章深入探讨了自注意力机制(self-attenti…
-
神经网络:令牌ID如何变成矩阵乘法
本文解释了自然语言处理中使用的神经网络的基本计算。它详细说明了单词如何首先被转换为数字令牌ID,然后由网络层进行处理。每一层都执行带有学习权重的矩阵乘法,然后进行ReLU等非线性激活函数,将输入向量转换为新的表示。文章强调了GPU如何加速这些可并行化的矩阵运算,并将其与循环神经网络(RNN)的顺序计算进行对比,解释了Transformer为何能更有效地扩展。
-
计算机通过分词处理单词,而非类人阅读
计算机不像人类那样阅读单词,而是依赖分词。这个过程将文本分解成更小的单元,这可能导致误解或错误,例如误解像“草莓”这样的单词拼写。文章认为,这类语言处理问题根源在于分词,而非 LLM 的内在能力。
-
新研究探索用于AI模型的先进压缩技术
研究人员正在探索压缩大型模型和数据集以提高效率的新颖方法。论文讨论了数据集剪枝和蒸馏的统一、图像生成的自举标记化以及用于LLM和VLM的激活感知低秩压缩。其他工作侧重于通用三潜在序列模型、不完美压缩下的预测的理论方面,以及LLM压缩的架构和量化选择的联合优化。
-
论文揭示了用于 Transformer 的图标记化的权衡及其对模型表达能力的影响
一篇新论文探讨了图标记化在将 Transformer 应用于图学习任务中的关键作用。研究人员证明,将图结构转换为标记的方法会显著影响 Transformer 的表达能力以及计算所需的深度。研究表明,某些标记化方法(如随机游走)本质上是有损的,而另一些方法(如谱标记化)可能不适合特定任务。研究结果表明,结合互补的标记化策略可以增强 Transformer 利用多样化结构信号的能力,从而提高性能。