研究人员开发了Meddies-PII,一个用于从临床文档中提取个人身份信息(PII)的多语言框架。该框架包含一个由一百万份十七种语言的临床文档组成的大型合成数据集,该数据集通过属性条件提示生成,并通过一致性检查进行验证。相关的Meddies-PII-Model,一个BIOES令牌分类器,在PII提取基准测试中表现出色,平均F1得分为0.827,显著优于最强的基线0.658。该数据集、模型和相关代码将公开发布,以促进多语言临床去标识化领域的研究。 AI
影响 提高了跨多种语言识别敏感临床数据的准确性和效率。
排序理由 该集群描述了一篇关于特定NLP任务的框架、数据集和模型的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- BioEssays
- clinical de-identification
- Hugging Face
- Meddies-PII
- Meddies-PII-Dataset
- Meddies-PII-Model
- personally identifiable information
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →