Luxembourgish
PulseAugur coverage of Luxembourgish — every cluster mentioning Luxembourgish across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
双语政治家根据语言选择重新组织演讲时序
一篇新发表在arXiv上的研究论文,考察了双语政治演讲的时间组织,重点关注政治家在说卢森堡语和法语时如何构建他们的时序。研究人员分析了十位政治家共400句话,测量了辅音和元音的节奏指标。研究结果表明,辅音时序是特定于说话者的,而元音时序则更多地受到语言选择的影响,法语的元音更长且变化更大。
-
说话者身份而非语言,驱动双语演讲中的魅力韵律
一项发表在arXiv上的新研究调查了语言与说话者身份对魅力演讲模式的影响。研究人员分析了10位政治家以卢森堡语和法语发表可比内容的演讲,提取了41个声学-韵律特征。研究结果表明,说话者身份是声音魅力差异的主要驱动因素,语言起次要作用。观察到了特定的韵律差异,法语发音表现出与礼貌和尊重相关的特征,而卢森堡语发音则表现出更具声音存在感的特征,这与其各自的社会语言学角色相符。
-
新的 LëtzCross 基准测试评估卢森堡语文档的跨语言多模态检索
研究人员推出 LëtzCross,这是一个专为卢森堡语 PDF 文档设计的跨语言页面级检索任务的新基准测试。该基准测试旨在评估多模态检索系统在低资源、跨语言场景下的表现,结合了文本问答和视觉基础查询。初步比较显示,像 ColPali 这样的页面图像检索方法在不同查询语言上优于传统的基于 OCR 的纯文本检索器,而包括卢森堡语在内的多语言微调在卢森堡语查询上取得了最佳效果。
-
新的数据集和研究探索了大型语言模型的跨语言指令调优
研究人员开发了在低资源语言中对大型语言模型进行指令调优的新方法。一项研究介绍了 LuxInstruct,一个针对卢森堡语的跨语言数据集,该数据集避免了机器翻译,以保留语言和文化细微差别。另一篇论文研究了跨语言指令调优,得出结论认为不存在单一的最佳语言集,并且性能高度依赖于所使用的特定任务和模型,并警告不要进行基准平均评估。
-
新数据集提升卢森堡语大语言模型性能
研究人员开发了LuxIT,一个旨在提高大语言模型(LLMs)在卢森堡语方面能力的新数据集。通过综合母语文本数据并使用DeepSeek-R1-0528进行生成,他们创建了超过227,000个指令-回答对。在LuxIT上对较小的LLMs进行微调,显著提高了模型在卢森堡语考试上的准确性,并改善了大多数测试模型在下游NLP任务上的表现。
-
新的卢森堡语SQA系统使用TTS,发布新的表达式语音语料库
研究人员开发了LuxSQA,一个用于卢森堡语(一种资源匮乏的语言)的口语问答系统。该系统利用文本到语音(TTS)技术生成合成口语问题,扩充了现有的基于文本的QA资源。通过使用多种TTS系统训练参数高效的架构,LuxSQA在卢森堡语测试集上取得了优异的性能,证明了合成数据在资源匮乏的SQA中的有效性。另外,一个名为LuxEmo的新的卢森堡语表达式语音语料库已从广播节目中创建,包含21小时的数据,涵盖四种情绪类别,并使用五种TTS系统进行了基准测试。
-
发布了新的卢森堡语富有表现力的语音语料库
研究人员推出了 LuxEmo,这是一个针对卢森堡语的新的 21 小时富有表现力的语音语料库,解决了低资源语言在语音技术中代表性不足的问题。该语料库源自 Radio Télévision Luxembourg (RTL) 的青年广播节目,包含四个情感类别,并通过涉及自动检测和人工验证的半自动工作流程进行策划。这项工作还包括对五个文本到语音 (TTS) 系统的基准测试,以评估它们在卢森堡语上的性能,并评估跨语言迁移、适应和韵律迁移能力。
-
大型语言模型通过知识图谱提示改进卢森堡语借词检测
研究人员开发了一个新的基准LexNeo-Bench,用于评估大型语言模型对卢森堡语等低资源语言的词汇借用理解程度。该基准源自卢森堡语新闻语料库,将词标记为本地词或从法语、德语或英语借用的词。当使用语言知识图谱进行提示时,大型语言模型在分类借词方面的准确性显著提高,缩小了小型模型和大型模型之间的性能差距。
-
低资源自然语言处理(NLP)需要跨语言迁移和特定数据
一篇新论文认为,低资源自然语言处理(NLP)需要跨语言迁移和特定语言开发的结合。虽然跨语言迁移可以利用高资源语言的数据来提高性能,但其有效性受到目标语言高质量数据可用性的限制。研究表明,特定语言的努力,尽管规模通常有限,但在跨语言框架内整合时最为有效。该论文为在可持续的低资源自然语言处理(NLP)流程中平衡这两种方法提供了指导。
-
大型语言模型分析卢森堡语新闻评论中的语言意识形态
研究人员开发了一种使用稀疏交叉编码器的新方法,用于跟踪大型语言模型在预训练过程中语言特征的出现和巩固。该技术包括一个名为相对间接效应(RelIE)的新指标,有助于识别特定能力何时对任务性能产生因果重要性。该方法不依赖于特定架构且可扩展,为分析大型语言模型中的表征学习提供了一种更具可解释性的方式。另外,另一项研究探讨了使用大型语言模型检测卢森堡语新闻评论中的语言意识形态,这是一种在训练数据中代表性有限的小语种。研究调查了机器翻译成高资源…