一篇新发表在arXiv上的论文审视了用于加密流量分类的数据标记方法,这是训练AI模型的关键步骤。研究确定了两种主要策略:粗粒度继承,可能导致不准确的标签;以及过度严格的过滤,可能丢弃有价值的数据。研究发现,现有基准在标记过程中的透明度往往不足,并且后续论文经常与与这些标签相关的恢复记录存在分歧。该论文提出了改进该领域数据标记质量和可靠性的建议。 AI
影响 强调网络安全AI模型训练数据中潜在的不准确性,表明需要改进数据来源和标记实践。
排序理由 在arXiv上发表的学术论文,详细介绍了研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- ScienceCast
- Seneca Nation of Indians
- South Kenton station
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →