实体
Norwegian
Norwegian
PulseAugur coverage of Norwegian — every cluster mentioning Norwegian across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新数据集用近亲语言和噪声挑战语言识别系统
研究人员推出了CHALIS,一个旨在测试语言识别系统在挑战性场景下性能的新数据集。该数据集包含近亲语言的示例以及带有拼写噪声的文本,例如音译和网络俚语。评估表明,当前的语言识别系统在这些困难案例中表现不佳,尤其是在低资源语言和有噪声输入方面。
-
新的临床自然语言处理模型提升德语和挪威语医学文本分析能力
研究人员开发了针对德语和挪威语临床自然语言处理的新领域特定语言模型。基于RoBERTa的德语ChristBERT模型在一个13.5GB的语料库上进行了训练,在医学任务上的表现优于现有模型。挪威语KliniskVestBERT套件使用BERT编码器,在Helse Vest的去标识化临床文本上进行了预训练,相比基线模型有了显著改进。这两个项目都强调了专业化预训练在临床语言理解方面的优势,并公开发布了它们的模型。
-
发布新的北欧客户服务语料库用于自然语言处理研究
研究人员推出一个新的多语言客户服务自助语料库,专为北欧语言设计。该语料库包含超过 1,122 份经过人工验证的芬兰语、丹麦语、挪威语和瑞典语文档,总计超过一百万个词元。数据收集自四家电信运营商的公开自助页面,并结合使用大型语言模型和人工标注进行处理,以过滤个人信息并确保相关性。该数据集现已根据 CC-BY-NC-SA-4.0 许可协议公开提供,以促进北欧自然语言处理和信息检索领域的研究。