PulseAugur
实时 09:47:17
English(EN) Benchmarking Classical and Transformer-Based Models for Document Sensitivity Classification

新数据集 Strategic 16K 为文档敏感性基准测试 AI 模型

研究人员开发了 Strategic 16K,这是一个包含 16,000 份来自 WikiLeaks 的外交电报的新数据集,旨在防止文档敏感性分类中的标签泄露。该语料库被用于对经典模型和基于 Transformer 的模型进行基准测试,结果显示 BERT 在清理后的数据上取得了最高的准确率 (89.14%) 和 F1 分数 (89.33%)。虽然像 BERT 和 ELECTRA 这样的 Transformer 模型表现最佳,但 TF-IDF 结合逻辑回归在较低的计算成本下也提供了强大的性能。 AI

影响 为文档敏感性分类建立了新的基准,强调了干净数据对于可靠的 AI 性能的重要性。

排序理由 该集群包含一篇学术论文,详细介绍了新的数据集和 AI 模型的基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新数据集 Strategic 16K 为文档敏感性基准测试 AI 模型

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Aleesha Zainab, Muhammad Ahmed Khalid, Faheem Ullah Khan, Asifullah Khan ·

    文档敏感性分类的经典模型与Transformer模型基准测试

    arXiv:2608.16928v1 Announce Type: new Abstract: Automatic sensitivity classification of organizational documents is a critical yet underserved problem, where the consequences of misclassification range from regulatory violations to security breaches. While AI-based approaches off…