Synthetic data generation for training of natural language understanding models
PulseAugur coverage of Synthetic data generation for training of natural language understanding models — every cluster mentioning Synthetic data generation for training of natural language understanding models across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
匿名化 LLM 管道中 PII 的 5 种技术
保护大型语言模型 (LLM) 管道中的个人身份信息 (PII) 是人工智能开发中一个关键但常被忽视的方面。用于训练、微调、检索增强生成和用户提示的数据可能包含姓名、电子邮件和健康记录等敏感详细信息,存在重大的法律和声誉风险。为减轻这些责任,五种关键的匿名化技术至关重要:数据屏蔽、假名化、泛化、数据交换和合成数据生成。实施这些方法对于防止数据泄露和确保负责任的人工智能开发至关重要。
-
新研究探讨用于公平性和隐私的合成数据生成
两篇研究论文探讨了以公平性和隐私为重点的合成数据生成(SDG)的新方法。第一篇论文重新审视了SDG中不同影响的概念,研究了近似和估计误差如何不成比例地影响不同群体,并提出了分组SDG模型以提高效用和公平性。第二篇论文介绍了一个不相交生成模型框架,将数据集分区进行单独生成,然后将它们组合起来而不使用通用标识符,这在保持效用的同时增强了隐私和计算可行性。
-
合成数据测试可防止因架构更改而导致的 ML 模型静默故障
数据库架构更改会通过更改数据格式或列名来悄悄破坏机器学习模型,从而导致错误的特征计算和模型性能下降。一个常见的问题涉及重命名列,在这种情况下,管道可能会默认缺少数据为零值,导致模型误解新用户。为防止这些静默故障,可以实施合成架构测试框架。该框架生成模拟生产架构的合成数据库,允许在迁移影响实时数据之前针对 ML 管道对其进行测试。