GPT-2
PulseAugur coverage of GPT-2 — every cluster mentioning GPT-2 across labs, papers, and developer communities, ranked by signal.
- developed by .openai 100%
- instance of arXiv 90%
- instance of large-language models 90%
- instance of transformer 90%
- instance of CatalyzeX 90%
- instance of LLM 90%
- used by byte-pair encoding 90%
- developed Andrej Karpathy 90%
- used by arXiv 70%
- authored by arXiv 70%
- used by transformer 70%
- used by alphaXiv 70%
17 天有情绪数据
-
新研究探索用于大型语言模型的先进压缩技术,包括条件计算和结构引导方法
三篇新研究论文探索了大型语言模型的先进压缩技术。LRCC将条件计算引入低秩分解,动态分配每个token的计算量,以提高Llama和Qwen等模型的性能。NeuralZip专注于通过重用统计分析和代码构建来实现快速无损压缩,从而显著加快速度并实现精确重建。OrBIT提出了一个用于嵌入压缩的结构引导框架,学习可重用的局部几何形状,在GPT-2等模型上实现高压缩率,同时保持有竞争力的性能。
-
新方法无需参考模型即可估算人工智能模型隐私风险
研究人员开发了一种新方法,可以在无需训练单独参考模型的情况下估算人工智能模型对成员推理攻击(MIA)的脆弱性。该方法分析目标模型本身的损失分布,识别与攻击成功相关的特定统计代理。研究结果表明,模型存在一个脆弱性连续体,不同的损失分布形状表明哪个代理最适合估算隐私风险。
-
小型Transformer通过新的训练方法实现更高的算术准确性
研究人员开发了一种方法,通过使用算法草稿板和分层课程来提高小型语言模型的算术推理能力。他们发现,正确的数据加载和语言预训练至关重要,而像RoPE和SwiGLU这样的现代架构组件可以提高性能。特定的逐位长除法草稿板显著提高了准确性,但由于加法复杂性,多位数乘法仍然具有挑战性。该研究还强调了在无缓冲训练期间未见操作数和灾难性遗忘的问题。
-
新框架Tokka-Bench评估跨越120种语言的大模型分词器
研究人员开发了Tokka-Bench,一个开源框架,用于评估大语言模型中使用的分词器。该框架使用五种不同的指标,在100种自然语言和20种编程语言上评估分词器。对包括GPT-2、GPT-4、Llama 3.1和Gemma 3在内的七种BPE分词器的初步比较表明,词汇分配策略比词汇大小对分词器性能更为关键。
-
Bregman散度统一用于改进神经网络优化器
研究人员开发了一个使用Bregman散度的统一框架,用于分析不同散度选择对神经网络优化器(特别是Shampoo)的影响。该框架连接了各种流行的散度,从而可以联合研究它们的影响。该研究通过经验分析了散度选择如何影响Kronecker近似,并与预处理中的有限样本误差相互作用,表明某些散度可以更好地减轻对经验二阶矩的低估。这些发现通过GPT-2预训练实验得到了验证,为改进Shampoo及相关优化技术提供了指导。
-
新的Inner Momentum技术增强了差分隐私模型训练
研究人员开发了一种名为Inner Momentum (IM) 的新方法,以提高差分隐私机器学习模型的准确性,特别是在微调GPT-2等任务中。该技术解决了梯度裁剪(一种标准的隐私保护措施)可能扭曲模型几何特性的问题。通过在裁剪之前对近期模型的一小段历史中的梯度进行平均,DP-Muon-IM减少了这种失真,并在BLEU和ROUGE-L等基准测试中显示出比原始DP-Muon方法更好的性能。
-
随机舍入可改善低精度Transformer推理
研究人员调查了在低精度Transformer推理中使用随机舍入(SR)与就近舍入(RN)的对比,发现最佳方法取决于模型中的特定层。他们开发了一种可变精度随机舍入(VPSR)算法,以便在任意精度下进行实验。他们的分析显示,SR的误差包络比RN增长得慢,尤其是在多层感知机(MLP)中,而RN更适合语言模型头。通过将SR策略性地应用于MLP,将RN应用于头部,他们在DistilGPT-2上实现了接近全精度的困惑度。
-
新研究质疑语言模型注意力头消融的因果论断
一篇新发表在arXiv上的研究论文,调查了语言模型中注意力头消融在推断组件功能因果关系方面的可靠性。该研究使用GPT-2 small和DistilGPT2,证明了“归零”注意力头的常用实现方法可能产生与修正后预投影消融几乎不相关的结果。研究强调,像二元准确率这样的评估指标可能会掩盖行为极端下的效应,而黄金令牌对数概率提供了更分级的度量。通过采用匹配对照和发现/保留集划分,该论文表明修正后的每头效应排名非常稳定,但任务特异性的证据仍然薄弱。
-
微调LLM:内存成本解析,LoRA & QLoRA解决方案
微调一个拥有70亿参数的模型所需的内存远超模型本身的权重大小,完全微调大约需要112GB。如此大的内存需求主要是因为梯度和优化器状态,它们大约占用了84GB,而模型fp16权重仅需14GB。LoRA和QLoRA等技术通过冻结基础模型权重并仅训练一小部分适配器参数,极大地降低了内存需求,其中QLoRA通过以4位精度存储基础模型进一步优化。
-
新的PassGPT+模型利用语言先验增强密码安全分析
研究人员开发了PassGPT+,一个利用GPT-2的语言先验来改进密码建模的新模型。这种方法将语言模型对语言结构的理解应用于人类生成的密码中发现的特定模式。该研究还引入了PassDiffusion,一个用于密码生成的离散扩散模型,但发现其在此任务上的效果远不如自回归模型。在RockYou基准测试中,PassGPT+比其前身PassGPT相对提高了16%,并在对更近期数据集的泛化能力方面表现强劲。
-
语言结构影响大型语言模型的上下文学习效果
一篇新的研究论文探讨了语言结构如何影响大型语言模型(LLM)的上下文学习(ICL)的有效性。研究发现,某些语言操作,如前向屈折,可以有效地分摊到潜在的任务表征中,从而实现超越传统ICL的零样本推理。然而,其他操作,如反义词等任意配对,则无法从这种摊销中受益,表现不佳。研究强调,生成性规则比记忆性配对更能有效地编码到潜在表征中,这表明对语言属性的更深入理解是优化LLM性能的关键。
-
研究发现分体式语言模型通过梯度泄露客户文本
一篇新的研究论文探讨了分体式语言模型相关的隐私风险,在这种模型中,客户在服务器上训练模型,而无需发送其原始文本。研究表明,能够访问模型公开权重观察者可以从训练过程中交换的激活和梯度中重建客户文本的很大一部分。具体来说,在GPT-2上的实验表明,添加梯度将 token 恢复率从 94.20% 提高到 97.38%,将精确文档恢复率从 13.71% 提高到 37.77%。该研究主张在 token 和文档级别报告泄露情况,并将分体式模型中传…
-
开发者用PyTorch构建GPT-2风格的LLM解码器以揭开AI的神秘面纱
一位开发者正在使用PyTorch从头开始创建一个GPT-2风格的解码器,以揭开大型语言模型的神秘面纱。该项目旨在将用户界面设置映射到底层的数学运算,从而摆脱将LLM视为不透明的“黑箱”的看法。
-
LLM 的注意力机制在新颖的语境和不同模型中表现出独特的行为 · 跟踪 3 个来源
研究人员正在探索大型语言模型(LLM)的内部机制,特别是注意力函数,如何影响它们在新颖语境下的行为。一项研究提出了一种“函数混合注意力”(MoFA),该模型为 softmax 和 sigmoid 头分配固定的比例,发现这种比例对分布内任务的影响很小,但对分布外性能有显著影响,并根据比例区分文本类型。另一篇论文回顾了 LLM 中注意力机制的演变,通过记忆表示、更新、访问、读出和整合等视角分析了上下文记忆的发展,强调了深度和异构架构如何协…
-
研究表明 Transformer 可实现高斯核回归
一项新的研究论文表明,标准的 softmax 注意力 Transformer 可以在其前向传播过程中近似高斯核岭回归 (KRR) 预测器。该研究构建了一个单头 Transformer,能够实现预条件 Richardson 迭代,这是一种求解核系统的方法。这项工作揭示了 Transformer 内部的功能分解,其中注意力层处理跨 token 交互,MLP 层管理 intra-token 算术。在 GPT-2 风格的 Transforme…
-
新的FTB Graph方法绘制多语言LLM中的语言电路
研究人员开发了一种称为FTB Graph的方法来分析多语言大型语言模型的内部工作原理,特别是它们如何决定首先生成哪种语言。该技术使用边缘归因修补(Edge Attribution Patching)和精确激活修补(exact activation patching)来绘制GPT-2、BLOOM-560M、Pythia和Qwen2.5等各种模型中负责此决策的因果电路。研究发现,这些语言身份电路通常位于深层或中深层,并且其结构在预训练期间…
-
新研究探讨大语言模型推理、概念发现和知识处理
近期研究探索了大语言模型(LLMs)的内部工作机制和推理能力。研究正在调查LLMs如何处理超越线性假设的信息,检查内部概率与口头表达概率之间的耦合,并开发解释推理轨迹的框架。此外,研究人员正在评估LLMs处理多值关系的能力、它们对外部指导的选择性依赖以及它们对所有权概念的理解。
-
新的量化方法优化 Transformer 注意力输出
研究人员开发了一种新的量化 Transformer 模型的方法,重点关注注意力机制的 Q、K 和 V 投影。这种方法称为 JAB,直接优化注意力输出而不是单个权重矩阵,在 Mistral-7B 的 3 位量化上表现出改进的性能。然而,当包含 MLP 层时,该方法的有效性会降低,在这种情况下,一种面向角色的偏移规则被证明更成功,在 Mistral-7B 上实现了接近全精度困惑度但压缩率很高。
-
新的逐层课程学习方法提高了LLM压缩效率
研究人员开发了一种新颖的逐层课程学习方法,用于高效的大型语言模型(LLM)压缩。该方法通过将LLM分解为多个部分并逐步在日益复杂的任务上进行训练,促进了从大型教师模型到小型学生模型的知识转移。该技术旨在加速收敛并稳定训练过程,同时通过特征缓存和多线程策略提高计算效率。实验表明,在BERT、GPT-2、LLaMA系列和Qwen等模型上,GPU内存使用量和训练时间显著减少,并达到了最先进的性能。
-
Reddit用户认为AI末日论是营销炒作
一位Reddit用户认为,当前的许多AI末日论是夸大的营销,特别是来自OpenAI等公司,目的是为其未来增长和潜在的首次公开募股(IPO)辩护。该用户指出过去关于AI能力和危险的戏剧性预测,并认为像持续自我改进之类的新技术很可能导致收益递减,而不是创造出超级智能实体。他们认为,这种模式与历史上的技术和生物进化相似。