Murilo Fischer
PulseAugur coverage of Murilo Fischer — every cluster mentioning Murilo Fischer across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的IndicTriMix方法改进了混合语文本中的语言识别
研究人员开发了一种名为IndicTriMix的新方法,用于识别混合语文本中的语言,这种文本在社交媒体上很常见。该方法将语言识别视为一个序列标注问题,并对MuRIL和XLM-RoBERTa等基于Transformer的模型进行微调。该系统在涉及印地语、古吉拉特语和孟加拉语的数据集上进行了评估,证明了在标记级别预测语言标签的有效性。该团队还发布了微调模型和基准数据集,以支持该领域的未来研究。
-
新型多语言模型NE-BERT助力九种东北印度语言的NLP发展
研究人员开发了NE-BERT,这是一种专为九种代表性不足的东北印度语言设计的新型多语言语言模型。该模型在约830万个句子上进行了训练,在这些低资源语言的困惑度和分词方面,其性能显著优于IndicBERT-V2和MuRIL等现有模型。NE-BERT通过积极的上采样解决了词汇碎片化问题,并在词性标注等下游任务中展示了实际效用,其代码和数据已发布,以促进进一步的NLP研究和数字包容性。
-
新的基准测试destroR测试并防御孟加拉语NLP模型免受攻击
研究人员推出destroR,这是一个旨在评估和增强孟加拉语迁移模型对抗鲁棒性的新流程。该系统包括三种新颖的保持意义的攻击方法:释义攻击、回译攻击和独热词替换攻击。这些攻击旨在扰乱输入,同时保持语义保真度和流畅性,从而测试模型的弹性。随附的基准测试评估了包括BanglaBERT和XLM-RoBERTa在内的五个迁移模型,针对这些攻击和其他基线攻击,结果显示词替换攻击比语义受限的攻击更有效。对抗训练被发现可以提高所有测试模型的鲁棒性,其中…
-
初创公司寻求针对印度语言情感分析的机器学习模型训练建议
一家初创公司正在寻求关于训练机器学习模型以进行情感分析的指导,特别是针对印度语言。该团队缺乏专门的机器学习工程师,正在考虑使用在政治数据上进行了微调的 muRIL 模型作为他们项目的潜在解决方案。他们也愿意接受其他建议,以在有限的预算内获得更好的性能。
-
发布新的马拉地语词性标注数据集和BERT模型
研究人员推出了L3Cube-MahaPOS,这是一个用于马拉地语词性(POS)标注的新数据集,解决了该语言标注资源稀缺的问题。该数据集包含32,000多句新闻文本中的手动标注句子,并与通用依存关系对齐。它被用于对六个模型家族进行基准测试,表现最好的系统达到了88.67%的词级别准确率和81.67%的宏F1分数。该数据集、标注指南和训练好的模型正在发布,以促进马拉地语自然语言处理的进一步研究。