研究人员开发了 Strategic 16K,这是一个包含 16,000 份来自 WikiLeaks 的外交电报的新数据集,旨在防止文档敏感性分类中的标签泄露。该语料库被用于对经典模型和基于 Transformer 的模型进行基准测试,结果显示 BERT 在清理后的数据上取得了最高的准确率 (89.14%) 和 F1 分数 (89.33%)。虽然像 BERT 和 ELECTRA 这样的 Transformer 模型表现最佳,但 TF-IDF 结合逻辑回归在较低的计算成本下也提供了强大的性能。 AI
影响 为文档敏感性分类建立了新的基准,强调了干净数据对于可靠的 AI 性能的重要性。
排序理由 该集群包含一篇学术论文,详细介绍了新的数据集和 AI 模型的基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- BERT
- ELECTRA
- Hugging Face
- logistic regression model
- Strategic 16K
- tf–idf
- WikiLeaks Public Library of US Diplomacy (PlusD)
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →