研究人员开发了一种新颖的可审计可靠性层,旨在通过解决大规模语料库中的伪影来提高生物医学文本分类的准确性。该系统充当面向安全的预处理模块,在不确定时避免编辑,以遵循“不造成伤害”的理念。它结合了编辑距离候选生成、n-gram评分和生物医学安全门,以保护关键术语。评估表明,该层实现了高错误修复召回率,并恢复了下游分类器中由噪声引起的性能下降的很大一部分,同时还证明了对 transformer 编码器的鲁棒性。 AI
影响 通过提高数据质量,增强了人工智能在敏感生物医学领域中模型的可靠性。
排序理由 该项目是一篇学术论文,详细介绍了一种新的文本分类方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- BioBERT
- CatalyzeX
- CORD-19: The Covid-19 Open Research Dataset
- DagsHub
- Gotit.pub
- Hugging Face
- Moustafa Yehia Hassan
- ScienceCast
- Unified Medical Language System
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →