PulseAugur
实时 09:16:49
English(EN) Transformers perform adaptive partial pooling

Transformer 表现出与分层回归相似的自适应部分池化

一篇新发表在 arXiv 上的论文详细介绍了 Transformer 模型,特别是 GPT-2,如何表现出自适应部分池化。这种现象类似于分层回归,意味着模型的预测会受到来自相似上下文的观察的影响,尤其是在当前上下文不频繁的情况下。研究人员发现,这种池化效应随着训练的增加而减小,但在某个最佳训练点,Transformer 的行为最接近分层回归,从而最大化上下文频率对池化的影响。 AI

影响 深入了解 Transformer 模型如何从不频繁的上下文中学习,可能提高其泛化能力。

排序理由 详细介绍特定模型行为的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Transformer 表现出与分层回归相似的自适应部分池化

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Vsevolod Kapatsinski ·

    Transformers perform adaptive partial pooling

    arXiv:2602.03980v2 Announce Type: replace Abstract: Any language model must decide what to say in novel contexts based on information from similar contexts. But what about contexts that are not novel but merely infrequent? In hierarchical regression, the model's predictions for b…