研究人员调查了语言模型是否能在其训练数据中没有直接曝光的情况下,学习理解与众不同的协调(一种将不同类别的元素连接起来的语言结构)。他们使用一种名为过滤语料库训练(FiCT)的方法对GPT-2模型进行训练,并从训练语料库中移除了所有与众不同的协调实例。研究发现,这些模型仍然能够泛化并正确处理与众不同的协调,其性能与在未过滤文本上训练的模型相当。对模型内部表征的分析表明,它们通过将连接的元素视为结构相似,或通过一种类似删除的机制来实现这一点,这两种方式都可以仅通过接触相似的协调来学习。 AI
影响 表明语言模型可能具备在没有明确训练数据的情况下理解复杂语言结构的新兴能力,这可能影响未来的模型训练策略。
排序理由 详细介绍语言模型能力新发现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →