Sinhala
PulseAugur coverage of Sinhala — every cluster mentioning Sinhala across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新的LKValues资源将大型语言模型与斯里兰卡社会价值观对齐
研究人员开发了LKValues,这是一个新的资源套件,旨在将大型语言模型(LLMs)与斯里兰卡的特定社会价值观对齐。现有的基准通常反映西方规范,未能捕捉到像斯里兰卡这样的多语言国家独特的文化动态。LKValues包括一个基于调查的资源套件、一个僧伽罗语和英语的指令语料库以及一个评估基准,以弥补这一差距。对包括Qwen系列模型微调在内的各种LLMs进行的实验表明,LKValues可以改善文化价值观的对齐并减少跨语言差异,为低资源、特定国…
-
面向方面级情感分析的新僧伽罗语数据集发布
研究人员推出了 SalAngaBhava,一个专为僧伽罗语(一种主要在斯里兰卡使用的低资源语言)方面级情感分析(ABSA)设计的新数据集。该数据集包含僧伽罗语的产品评论,这些评论已手动标注了特定的方面词及其相应的情感(正面、负面或中性)。SalAngaBhava 的创建旨在解决低资源语言此类资源的稀缺性问题,从而促进僧伽罗语自然语言处理和情感分析的进一步研究和开发。
-
跨语言迁移学习在低资源ASR方面效果不一
研究人员探索了跨语言迁移学习以改进低资源语言的自动语音识别(ASR)。一项研究成功利用僧伽罗语提升了迪维希语ASR,通过持续预训练和微调实现了12.89%的词错误率(WER)。相比之下,另一项研究发现,对于大规模多语言ASR模型,在相关辅助语言上进行预适应并未显著提升低资源非洲语言的性能,表明在这种情况下,语言相关性本身可能不足够。
-
新的僧伽罗语 OCR 数据集和模型达到最先进性能
研究人员开发了一个新的数据集 sinhala-ocr-lk-acts-1010,以改进僧伽罗语的光学字符识别 (OCR)。僧伽罗语是斯里兰卡约 1600 万人使用的语言。该数据集包含 1010 页图像及其转录文本,来源是跨越二十年的斯里兰卡立法法案。实验对包括 DeepSeek-OCR V1、DeepSeek-OCR V2 和 LightOnOCR-2-1B 在内的三个深度学习模型进行了微调,结果表明 LightOnOCR-2-1B …
-
新的僧伽罗语 OCR 数据集和 LightOnOCR-2-1B 达到最先进性能
研究人员开发了一个新的数据集 sinhala-ocr-lk-acts-1010,以改进僧伽罗语的光学字符识别 (OCR)。僧伽罗语是一种约有 1600 万人使用的语言。该数据集包含来自斯里兰卡立法法案跨越二十年的 1010 个页面级图像和转录文本。通过使用 QLoRA 对 DeepSeek-OCR V1、DeepSeek-OCR V2 和 LightOnOCR-2-1B 等模型进行微调,研究发现 LightOnOCR-2-1B 是表现…
-
僧伽罗语自然语言处理研究中心发布音译系统和数据资源
一篇新论文介绍了 Swa-bhasha 资源中心,该中心收集了在 2020 年至 2025 年间开发的用于罗马化僧伽罗语到僧伽罗语音译的数据和算法。这些资源对于推进僧伽罗语自然语言处理 (NLP) 研究至关重要,能够训练音译模型并开发相关应用程序。论文详细介绍了作者的贡献,并对该领域现有的音译工具进行了比较分析。