研究人员开发了一个包含 10,000 句孟加拉语的新语料库,这些句子被手动分为陈述句、疑问句、祈使句和感叹句四种功能,以解决孟加拉语句功能分类资源有限的问题。该研究评估了各种特征表示,包括词袋模型 (Bag-of-Words)、TF-IDF 和 Word2Vec,以及经典的机器学习分类器和集成模型。结合 TF-IDF 特征的双层集成模型取得了最高性能,准确率和宏 F1 分数均为 0.95,证明了稀疏词汇表示和集成学习在此自然语言处理任务中的有效性。 AI
影响 为孟加拉语句功能分类建立了一个新的基准和基线模型,有望改进该语言的下游自然语言处理应用。
排序理由 该条目是一篇学术论文,详细介绍了特定自然语言处理任务的语料库开发和模型基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →