一种名为SIFT(自改进、冻门训练)的新的自改进分类系统已被开发出来,以应对企业环境中动态文档分类的挑战。SIFT利用一个成本效益高的流水线,结合了SPLADE稀疏编码器和LightGBM头部,并将低置信度的预测升级给LLM裁判进行标注。这个过程创建了一个不断增长的标注语料库,随着时间的推移提高了准确性,而无需大量的预先标注。通过一个两部分的推广门来维护安全性,该门检查关键标签回归,并使用一个固定的黄金回归集来防止自主再训练导致性能下降。 AI
影响 这种方法可以显著降低在实际应用中维护准确文档分类系统的成本和精力。
排序理由 该集群包含一篇详细介绍文档分类新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →