Wiktionary
PulseAugur coverage of Wiktionary — every cluster mentioning Wiktionary across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
基于 ByT5 和 LLM 辅助数据的菲律宾语 G2P 模型实现高精度
研究人员开发了一种用于句子级别带压力的菲律宾语音素转换(G2P)的方法。该方法通过使用 LLM 辅助流程和 Wiktionary 的数据对 ByT5 模型进行微调,解决了句子级别音素数据有限的挑战。结果模型在 G2P 准确性方面显示出显著的改进,在修正后的测试集上词错误率约为 0.54%,字符错误率约为 2.50%,并展示了菲律宾语同形异义词消歧的潜力。
-
研究发现:维基词典在方言覆盖方面可与《牛津英语词典》媲美
一篇新论文探讨了维基词典作为英语方言众包词典的潜力,发现其在覆盖范围上可与《牛津英语词典》(OED)等传统词典相媲美。研究分析了维基词典对12种英语国家变体的覆盖情况,并测试了其在社交媒体数据上的表现。结果显示,在对新西兰英语的覆盖方面与OED高度一致,并且能有效应用于地理标记的社交媒体语言,但也指出了语言接触和语域效应相关的挑战。
-
新的基准 G-IdiomAlign 解决了大型语言模型中的跨语言习语翻译问题
研究人员推出了 G-IdiomAlign,这是一个旨在评估大型语言模型在不同语言中对齐习语能力的新基准。该基准使用维基词典的英文注音作为枢纽来锚定习语,解决了习语非组合性及其表面形式基础薄弱带来的挑战。初步测试显示,大型语言模型常常表现出字面翻译的倾向,尤其是在低资源语言方面,并且使用注音可以提高受控生成任务的性能,尽管仍有很大的改进空间。
-
新论文概述了句子编码器中概念表示的原理
研究人员发表了一篇论文,详细介绍了句子编码器表示概念的四项原则。该研究对编码器进行了数百万个词对的训练,发现微调主要重新校准现有的潜在几何结构,而不是扩展它。语义信息集中在最后的 Transformer 层,因此无需跨层池化。该研究还引入了两个新的评估数据集,用于评估语义差距和释义。