Luxembourgish
PulseAugur coverage of Luxembourgish — every cluster mentioning Luxembourgish across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的数据集和研究探索了大型语言模型的跨语言指令调优
研究人员开发了在低资源语言中对大型语言模型进行指令调优的新方法。一项研究介绍了 LuxInstruct,一个针对卢森堡语的跨语言数据集,该数据集避免了机器翻译,以保留语言和文化细微差别。另一篇论文研究了跨语言指令调优,得出结论认为不存在单一的最佳语言集,并且性能高度依赖于所使用的特定任务和模型,并警告不要进行基准平均评估。
-
新的卢森堡语SQA系统使用TTS,发布新的表达式语音语料库
研究人员开发了LuxSQA,一个用于卢森堡语(一种资源匮乏的语言)的口语问答系统。该系统利用文本到语音(TTS)技术生成合成口语问题,扩充了现有的基于文本的QA资源。通过使用多种TTS系统训练参数高效的架构,LuxSQA在卢森堡语测试集上取得了优异的性能,证明了合成数据在资源匮乏的SQA中的有效性。另外,一个名为LuxEmo的新的卢森堡语表达式语音语料库已从广播节目中创建,包含21小时的数据,涵盖四种情绪类别,并使用五种TTS系统进行了基准测试。
-
发布了新的卢森堡语富有表现力的语音语料库
研究人员推出了 LuxEmo,这是一个针对卢森堡语的新的 21 小时富有表现力的语音语料库,解决了低资源语言在语音技术中代表性不足的问题。该语料库源自 Radio Télévision Luxembourg (RTL) 的青年广播节目,包含四个情感类别,并通过涉及自动检测和人工验证的半自动工作流程进行策划。这项工作还包括对五个文本到语音 (TTS) 系统的基准测试,以评估它们在卢森堡语上的性能,并评估跨语言迁移、适应和韵律迁移能力。
-
大型语言模型通过知识图谱提示改进卢森堡语借词检测
研究人员开发了一个新的基准LexNeo-Bench,用于评估大型语言模型对卢森堡语等低资源语言的词汇借用理解程度。该基准源自卢森堡语新闻语料库,将词标记为本地词或从法语、德语或英语借用的词。当使用语言知识图谱进行提示时,大型语言模型在分类借词方面的准确性显著提高,缩小了小型模型和大型模型之间的性能差距。
-
低资源自然语言处理(NLP)需要跨语言迁移和特定数据
一篇新论文认为,低资源自然语言处理(NLP)需要跨语言迁移和特定语言开发的结合。虽然跨语言迁移可以利用高资源语言的数据来提高性能,但其有效性受到目标语言高质量数据可用性的限制。研究表明,特定语言的努力,尽管规模通常有限,但在跨语言框架内整合时最为有效。该论文为在可持续的低资源自然语言处理(NLP)流程中平衡这两种方法提供了指导。
-
大型语言模型分析卢森堡语新闻评论中的语言意识形态
研究人员开发了一种使用稀疏交叉编码器的新方法,用于跟踪大型语言模型在预训练过程中语言特征的出现和巩固。该技术包括一个名为相对间接效应(RelIE)的新指标,有助于识别特定能力何时对任务性能产生因果重要性。该方法不依赖于特定架构且可扩展,为分析大型语言模型中的表征学习提供了一种更具可解释性的方式。另外,另一项研究探讨了使用大型语言模型检测卢森堡语新闻评论中的语言意识形态,这是一种在训练数据中代表性有限的小语种。研究调查了机器翻译成高资源…