PulseAugur
中
实时 09:30:55
实体 GPT-2 small

GPT-2 small

PulseAugur coverage of GPT-2 small — every cluster mentioning GPT-2 small across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
31
90 天内 31
发布 · 30天
0
90 天内 0
论文 · 30天
29
90 天内 29
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/2 页 · 共 31 条
  1. TOOL · CL_277298 ·

    新理论通过平衡物解释语言模型的自我修复

    研究人员提出了一个理解语言模型自我修复的新框架,认为对模型组件的干预可以被视为代表反事实对比的坐标轴上的点。这种观点认为,一个固定的系数 $\gamma_r$ 控制着细粒度单元的因果修复响应,决定它们是抵消还是增强被移除的信号。在 Gemma、Qwen、LLaMA 和 Mistral 四个不同的模型家族上进行的实验,识别出许多组件,包括 MLP 和 OV 神经元,它们遵循这种仿射定律,并且 $\gamma_r$ 的大小可以从固定权重中预测。

  2. TOOL · CL_277203 ·

    新研究质疑语言模型注意力头消融的因果论断

    一篇新发表在arXiv上的研究论文,调查了语言模型中注意力头消融在推断组件功能因果关系方面的可靠性。该研究使用GPT-2 small和DistilGPT2,证明了“归零”注意力头的常用实现方法可能产生与修正后预投影消融几乎不相关的结果。研究强调,像二元准确率这样的评估指标可能会掩盖行为极端下的效应,而黄金令牌对数概率提供了更分级的度量。通过采用匹配对照和发现/保留集划分,该论文表明修正后的每头效应排名非常稳定,但任务特异性的证据仍然薄弱。

  3. RESEARCH · CL_268263 ·

    新研究推进AI模型的因果推断方法 · 追踪6个来源

    研究人员正在开发新方法来改进机器学习模型中的因果推断,特别是在处理未测量混淆因素时。一种方法,隐藏路径贡献(HPC),旨在区分通过合法模型路径产生正确答案的干预措施与利用隐藏路径的干预措施。另一个研究领域侧重于因果基础模型(CFMs),它们利用多样化的实验方案和观测数据来更准确地预测条件干预分布。研究还探讨了可用观测数据如何影响因果效应的识别,并引入了因果ID视图(CausalIDView)等基准来评估CFMs在不同数据视图下的性能。…

  4. TOOL · CL_254408 ·

    新框架为大语言模型可解释性提供形式化保证

    一个新形式化验证框架已被开发出来,以解决大语言模型中机械可解释性的脆弱性。研究人员证明,在像GPT-2 small、Gemma、Llama和Qwen这样的模型中,微小的输入变化会极大地改变替换网络识别出的可解释特征。所提出的框架为对抗性场景中的忠实度差距提供了可靠的上限,并且在集成到训练中时,可以为安全审计员恢复可靠的特征级解释。

  5. TOOL · CL_251599 ·

    AuroraAI Research 发布 Aurora1.0-150M 语言模型

    AuroraAI Research 发布了 Aurora1.0-150M,一个拥有 1.5 亿参数的新型语言模型。该模型的性能与 GPT-2 Small 相当,基准测试得分包括 PIQA 上的 62.24% 和 Hellaswag 上的 32.20%。它使用 RTX Pro 6000 在 70 亿 token 上进行了训练,并且在 Hugging Face 上提供了推理脚本。

  6. TOOL · CL_244910 ·

    新的PAC隐私方法增强了安全自回归生成

    研究人员开发了一种新的自回归语言生成隐私保障方法,该技术以前仅限于分类任务。这种方法称为PAC-Private Autoregressive Generation,根据不同潜在秘密输出的可变性来校准噪声。通过在私有数据的重叠子集上训练多个适配器,系统可以在限制信息泄露的同时生成文本,与非私有方法相比,保留了相当一部分微调收益。

  7. RESEARCH · CL_235425 ·

    新的ObserverBench框架评估AI可解释性以进行干预

    研究人员推出了一款名为ObserverBench的新框架,旨在评估内部估计器(或称“观察者”)在指导AI干预和安全监控方面的有效性。该基准区分了观察者的估计准确性与其指导的行动所产生的实际损失,强调高准确性并不总是能转化为最佳决策。在GPT-2 small和Qwen2.5-7B等模型上的实验表明,在实际场景中,经过行动损失训练的观察者比仅关注预测准确性的观察者表现更好,尤其是在安全分类任务中,因为不同的违规成本会影响资源分配。

  8. TOOL · CL_229319 ·

    新方法使用随机层归一化追踪 Transformer 中的可区分性

    研究人员开发了一种新方法,通过引入随机层归一化来分析 Transformer 模型内部的工作原理。这种修改使得表示在统计上可区分,将可解释性建立在功能结果而非仅仅是接近度的基础上。该方法使用共享的全局速率预算将有限精度分配到模型的层中,从而能够追踪区分度如何在 MLP 块和注意力头中传播。使用 ViT-S 和 GPT-2 small 进行的实验证明了该技术能够揭示连续扰动和特定头部的敏感性,为理解 Transformer 计算提供了新视角。

  9. TOOL · CL_226011 ·

    用户创建交互式游戏以探索GPT-2 Small模型内部

    一位用户创建了一个交互式“游戏”,允许其他人探索GPT-2 Small模型的内部工作原理。参与者可以建议神经元ID,用户将报告他们在模型架构中发现的内容。该项目将GPT-2 Small与其他工具(如Claude和Godot)结合起来,目标是使探索过程引人入胜并可能揭示新信息。

  10. TOOL · CL_221392 ·

    门控循环Transformer在深度和效率上优于标准模型

    研究人员引入了一种名为门控循环Transformer的新架构,旨在提高Transformer模型的表达能力和内存效率。这种新设计跨越多层复用共享核心,并通过自适应更新门进行调制,从而无需大量独特参数即可实现专业化表示。在实验中,一个3层门控循环Transformer在相似的计算约束下达到了与12层GPT-2 Small模型相当的性能,展示了参数和内存使用量的显著减少。

  11. TOOL · CL_213067 ·

    语言模型中的权重绑定:梯度分析与性能影响

    研究人员探讨了语言模型中权重绑定的影响,特别是输入嵌入层和输出投影矩阵的绑定如何影响梯度计算和模型性能。他们发现,删除绑定嵌入层一半的梯度在很大一部分 token 行上是完全正确的,并且模型即使在这种修改下也能有效训练。该研究还调查了绑定模型固有的“重复偏差”,并证明绑定不一定会使参数减半,而是根据词汇量大小的百分比减少参数。

  12. TOOL · CL_211995 ·

    Mechanistic Tomography 框架统一了 AI 模型可解释性方法

    研究人员引入了“Mechanistic Tomography”,一个用于 AI 模型可解释性的框架。该方法将打补丁和 Hessian-向量积等各种测量技术统一在一个共享的数学结构下,从而能够更系统地恢复模型的内部机制和干预效果。该框架提出了一种应用这些测量的实用程序,从更简单的方法开始,并根据残差误差按需扩展。它在面向控制的可解释性任务中显示了有效性,展示了测量精度如何直接影响像双 HMM 系统这样的模型的控制误差,并识别了 GPT-…

  13. TOOL · CL_208541 ·

    FishBack 方法使用非欧几里得几何改进 Transformer 激活定向

    研究人员开发了一种名为 FishBack 的新方法,以改进 Transformer 中的激活定向,这是一种无需更新参数即可修改语言模型行为的技术。现有方法由于激活空间是欧几里得空间的错误假设,通常不稳定,并且会干扰不相关的行为。FishBack 通过使用 softmax 层的 Fisher 信息度量,通过雅可比矩阵拉回,推导出最佳定向,从而纠正了这一点。该方法通过减少目标外失真,尤其是在几何校正影响最大的早期和中间层,在 GPT-2 …

  14. TOOL · CL_206280 ·

    RecurrentGPT 引入循环调制以提高 Transformer 效率

    研究人员推出了一种新颖的 Transformer 架构 RecurrentGPT,旨在增强大型语言模型在表达能力和内存效率方面的表现。该模型利用循环调制,允许共享核心迭代多次,从而减少了对大量独特层数的需要。在可比的计算限制下,RecurrentGPT 在准确性方面与显著更深的標準 Transformer 相当,同时在参数更少和内存使用量减少的情况下取得了有竞争力的结果。

  15. TOOL · CL_203878 ·

    研究发现:AI可解释性证据不可靠,无法满足监管合规要求

    一项新的研究论文认为,源自机械可解释性(一种用于理解AI决策过程的方法)的证据,其可靠性不足以满足监管要求。研究发现,即使使用相同的AI模型和工具,分析设置的微小差异也会导致对AI决策产生截然不同的解释。这种不稳定性表明,当前的可解释性方法可能不适用于满足欧盟《AI法案》等法规要求的文档规定,这些法规要求对高风险AI系统提供清晰一致的解释。

  16. TOOL · CL_196113 ·

    新方法使用Koopman算子进行模型可解释性分析

    研究人员开发了一种名为“内在结构”的机制可解释性新方法,该方法利用Koopman算子分析模型内部动力学的谱特性。这种方法旨在区分模型固有的特征和可解释性方法产生的伪影。该研究为机制可解释性原语提供了第一个识别定理,证明了可以从校准样本中恢复模型的频谱,且误差率可预测。在GPT-2 small、Gemma 2-2B和Qwen3-8B-Base上的实验表明,频谱会收敛,并且在Qwen3-8B-Base上实现了预测的误差指数,这表明Koop…

  17. RESEARCH · CL_185428 ·

    新研究探讨MUON优化器的收敛性并提出MALT扩展

    两篇新研究论文探讨了MUON优化算法,这是一种用于训练大型语言模型的方法。第一篇论文介绍了MALT,它是MUON的一个扩展,通过轻量级的对角预处理来提高对损失曲面曲率各向异性的鲁棒性。MALT旨在保持MUON的效率,同时提高其性能,这在GPT-2模型的实验中得到了证明。第二篇论文分析了MUON的收敛特性,表明它可能无法收敛于某些随机优化问题,并对该算法的广义变体进行了误差分析。

  18. RESEARCH · CL_154389 ·

    研究人员探索自适应深度和循环折叠以优化 Transformer

    两篇新研究论文探索了通过动态调整深度来优化 Transformer 模型的新方法。第一篇论文《Looped Transformers 中的自适应深度》研究了学习到的停止门和轨迹读出,发现固定的先验深度监督可以带来更好的性能和实际的推理时间节省。第二篇论文《Mobius Learning: Transformers 中的循环深度折叠》介绍了一种训练架构,其中不同的数据流遵循循环移位的块顺序,允许块同时针对浅层和深层角色进行优化,并在内存…

  19. TOOL · CL_150221 ·

    分析 GPT-2 Small 嵌入的“Trump”周围的几何形状

    研究人员探索了 GPT-2 Small 模型静态嵌入表中“Trump”这一 token 的嵌入几何形状。通过分析离散和连续表示的 token 嵌入下的最近邻居,他们观察到了不同的结果。离散方法产生了通用的政治术语,而连续方法则揭示了一组更具体的相关个体,包括家庭成员、工作人员和其他总统。

  20. RESEARCH · CL_135237 ·

    新框架提升了 AI 模型可解释性的统计严谨性

    研究人员开发了认证干预保真度(CIF),一个旨在严格评估机制可解释性中因果声明的新统计框架。CIF 将评估指标视为因果估计量,提供随时有效的置信区间和考虑自适应采样策略的序列。该方法已在涉及 MNIST 抽象和 GPT-2 Small IOI 电路的任务中证明了其有效性,从而能够对模型行为和干预效果得出更可靠的结论。