研究人员开发了一种新的多语言命名实体标记器,用于隐私 redaction,其性能优于 GLiNER2、Microsoft Presidio 和 OpenAI Privacy Filter 等现有工具。该标记器在多语言编码器上进行了微调,在 35 种语言中实现了 88.8 的 redaction F1 分数和 76.3 的精确类型跨度识别。该系统比本地 LLM 快得多,CPU 吞吐量是 GLiNER2 的 4.9 倍,使其在隐私保护文本分析方面效率很高。 AI
影响 这款新的隐私标记模型在速度和准确性方面都比现有解决方案有了显著的改进,有望加速隐私保护 NLP 技术的使用。
排序理由 该项目是一篇研究论文,详细介绍了新模型及其在特定基准上的性能。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →