研究人员开发了 FreqBLiMP,这是一个旨在通过控制词汇频率来评估大型语言模型 (LLM) 鲁棒性的新基准。这是 BLiMP 基准的扩展,专门解决了现有评估中对词频的忽视问题,词频是自然语言使用中的一个重要因素。FreqBLiMP 在明确的 Zipf 频率模型下重新生成最小对范式,以测试在罕见词情况下语法偏好是否能保持。对各种 LLM 系列的初步评估表明,虽然降低词汇频率会持续降低句子可能性,但对整体对比准确率的影响仅为中等。然而,这种稳定性掩盖了语言现象之间的显著差异,LLM 在形态句法泛化方面表现良好,但在需要词条特定信息的任务上表现下降。 AI
影响 该基准通过突出 LLM 在处理罕见词时的脆弱性,可能导致更鲁棒的 LLM,从而提高它们在各种真实语言场景中的表现。
排序理由 该集群包含一篇介绍 LLM 评估新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →