PulseAugur
实时 04:03:35
English(EN) Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

面向百亿级容量用户表征学习的新致密化定律

研究人员提出了一种“用户行为致密化定律”,用于表征大规模用户表征学习中数据规模与分词容量之间的关系。一项使用支付宝数据的试点研究表明,与原始数据扩展相比,分词可提供持续的性能提升。该定律源于理论分析和实验,表明最小充分分词容量的对数与输入数据大小的对数之间存在近似线性关系。该定律指导了 ALGN 的开发,这是一种自适应可变长度分词方法,可提高容量分配效率,并在各种数据源和任务中优于现有基线。 AI

影响 为大规模用户表征学习中的分词优化提供了实践指导,有望提高效率和性能。

排序理由 关于用户表征学习新理论定律和方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.IR (Information Retrieval) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

面向百亿级容量用户表征学习的新致密化定律

报道来源 [1]

  1. arXiv cs.IR (Information Retrieval) TIER_1 English(EN) · Weiqiang Wang ·

    迈向百亿级用户表示学习的致密化定律

    User representation learning in real-world industrial scenarios is commonly scaled by increasing user amount, behavioral sequence length and model size. However, existing methods face two challenges: (i) Bottleneck for raw data scaling at billion-scale capacity, as performance ex…