PulseAugur
实时 07:41:23
实体 personally identifiable information

personally identifiable information

PulseAugur coverage of personally identifiable information — every cluster mentioning personally identifiable information across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. TOOL · CL_233465 ·

    新的LeakageBench基准测试突显文档图像中持续存在的个人身份信息(PII)泄露风险

    研究人员推出了LeakageBench,这是一个旨在评估文档图像中个人身份信息(PII)泄露风险的新基准测试。该基准测试侧重于文档级信息屏蔽,确保敏感数据能够从整个页面中完全移除,而不仅仅是单个实例。使用LeakageBench进行的评估表明,虽然像Code Interpreter这样的工具在与GPT-5.5等模型配对使用时可以改善个人身份信息(PII)的定位,但在页面级别仍然存在重大的泄露风险。

  2. TOOL · CL_206255 ·

    新的AWED-PIPER框架提供36种语言的FgNER和PII匿名化

    研究人员开发了AWED-PIPER,一个开源框架,用于细粒度命名实体识别(FgNER)和个人身份信息(PII)匿名化。该系统集成了代理工具、Web应用程序和54个专家探测器模型,支持36种语言。AWED-PIPER可以识别上下文实体(如人物和地点),以及技术性PII(如电子邮件和电话号码),提供提取和可逆匿名化功能。该框架因其广泛的语言支持(包括极低资源语言)而备受关注。

  3. TOOL · CL_167212 ·

    新的PANOPTICON数据集利用PII数据解决LLM隐私风险

    研究人员开发了一个名为PANOPTICON的新管道和数据集,以应对研究大型语言模型(LLM)隐私风险的挑战。该数据集使用Meta的Llama-3.1-8B-Instruct模型生成,包含超过67,000个包含个人身份信息(PII)的提示,这些信息源自合成用户配置文件。该基准数据集旨在促进对提示反演攻击(PIA)的研究,并量化LLM上下文窗口内的隐私泄露,标志着LLM隐私研究向前迈出了重要一步。

  4. TOOL · CL_127842 ·

    Amazon Nova 使用 AI 自动屏蔽图像中的 PII

    Amazon 推出了 Amazon Nova,这是一系列新的基础模型,旨在自动识别和屏蔽图像中的个人身份信息 (PII)。该先进系统利用上下文视觉推理来协调 Meta 的 Segment Anything Model (SAM 3) 等专业工具进行精确分割,以及 Amazon Textract 进行光学字符识别。该流程旨在处理具有挑战性的 PII 情况,例如反射或部分视图,确保符合 GDPR 和 PCI DSS 等法规。

  5. RESEARCH · CL_99948 ·

    新框架支持AI代理的概率验证

    研究人员开发了一个新的框架,用于验证具有概率策略的AI代理,解决了现有确定性方法的局限性。该方法基于分布鲁棒优化,即使在谓词相关性未知的情况下,也能计算策略违反概率的上限。该框架在终端代理和工具调用代理的基准测试中得到验证,显示出改进的安全-实用性权衡,并且优于先前的方法。

  6. RESEARCH · CL_97857 ·

    新的RedactionBench基准揭示LLM在上下文PII redaction方面存在困难

    研究人员推出了RedactionBench,这是一个新的基准测试,旨在评估大型语言模型在考虑上下文隐私的同时,能够多好地redact个人身份信息(PII)。该基准包含200份多样化的文档和一个新颖的R-Score指标,该指标考虑了redaction中的语义相似性。评估显示,包括具有agentic工具的前沿模型在内的当前模型在上下文redaction方面存在困难,人类标注者在何构成上下文redaction方面也存在显著分歧。

  7. COMMENTARY · CL_34848 ·

    AI聊天机器人暴露来自公开来源的个人数据

    AI聊天机器人能够从各种来源提取个人信息,包括旧的社交媒体帖子、公共记录和网站。最近的事件表明,电话号码和其他敏感数据可能会被揭露,而用户往往没有预料到此类信息泄露。这凸显了当前AI技术带来的重大隐私问题。

  8. RESEARCH · CL_27524 ·

    新的NCO插件增强了LLM对不良内容的控制能力

    研究人员开发了NCO,这是一种旨在增强对大型语言模型(LLM)输出控制的新解码策略。该插件解决了防止多种禁止模式(如脏话或个人身份信息(PII))出现在生成文本中的挑战。NCO通过执行高效的在线模式匹配来实现这一点,避免了将多个约束转换为单个自动机时常见的状态爆炸问题。该策略与标准推理方法兼容,并在实际应用中证明了其有效性。

  9. TOOL · CL_27542 ·

    新的GLiNER2-PII模型在多语言PII提取方面表现出色

    研究人员开发了GLiNER2-PII,一个紧凑的0.3十亿参数模型,用于多语言个人身份信息(PII)提取。该模型改编自GLiNER2,能够识别42种不同类型的PII,并达到字符跨度级别。为了克服数据稀缺和隐私问题,使用了一个受约束的生成管道创建了一个合成多语言语料库。与包括OpenAI的Privacy Filter在内的其他系统相比,GLiNER2-PII在SPY基准测试中表现出优越的性能,并且已在Hugging Face上发布。