PulseAugur
实时 09:15:54
English(EN) Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

新方法通过词汇表估计LLM训练数据构成

研究人员开发了一种名为量化引导密度估计(QGDE)的新方法,用于估计大型语言模型(LLM)的隐藏训练语料库的构成。该技术利用已发布的tokenizer词汇表,表明token ID到比例的分布在不同语料库中是稳定的。QGDE使用量化趋势和局部密度加权来近似这些分布,在受控和现实场景中都实现了低估计误差,包括使用SmolLM tokenizer。研究结果表明,tokenizer词汇表可以提供对细粒度语料库估计的有价值的见解,超越了广泛的混合推断。 AI

影响 提供了一种分析LLM训练数据构成的新颖方法,可能影响模型的解释性和偏见检测。

排序理由 详细介绍分析LLM训练数据新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新方法通过词汇表估计LLM训练数据构成

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu ·

    发布的LLM词汇表能否支持隐藏语料库的Token级估计?

    arXiv:2608.10690v1 Announce Type: new Abstract: Pretraining corpus composition shapes LLM capabilities, but it often remains hidden even when model weights are released. Prior work has inferred corpus mixtures or traced specific token groups from released tokenizer vocabularies; …