研究人员开发了一种名为量化引导密度估计(QGDE)的新方法,用于估计大型语言模型(LLM)的隐藏训练语料库的构成。该技术利用已发布的tokenizer词汇表,表明token ID到比例的分布在不同语料库中是稳定的。QGDE使用量化趋势和局部密度加权来近似这些分布,在受控和现实场景中都实现了低估计误差,包括使用SmolLM tokenizer。研究结果表明,tokenizer词汇表可以提供对细粒度语料库估计的有价值的见解,超越了广泛的混合推断。 AI
影响 提供了一种分析LLM训练数据构成的新颖方法,可能影响模型的解释性和偏见检测。
排序理由 详细介绍分析LLM训练数据新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →