研究人员开发了一种新颖的几何过滤框架,以提高大型语言模型(LLM)为文本分类任务生成的合成数据的质量。该方法根据LLM生成的样本在嵌入空间中到真实数据点的欧氏距离进行评估,仅选择在几何上与目标类别一致的样本。该方法在各种数据集和分类器上均显示出显著的改进,优于SMOTE等现有方法,并在命名实体识别任务中表现出特别的功效。 AI
影响 这项技术可以通过提高合成数据的质量,从而更高效、更准确地训练AI模型。
排序理由 该集群包含一篇详细介绍改进LLM生成数据的新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →