PulseAugur
实时 10:00:59
实体 Sinhala

Sinhala

PulseAugur coverage of Sinhala — every cluster mentioning Sinhala across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 12
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 12
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 12 条
  1. TOOL · CL_245294 ·

    使用 Llama-3.1-8B 分析僧伽罗语语义变化

    研究人员开发了一个计算框架,用于分析僧伽罗语从13世纪到20世纪的历时语义变化。该研究利用了静态嵌入(Word2Vec、FastText)和经过微调的 Llama-3.1-8B 模型的上下文嵌入。研究结果表明,语义漂移并非均匀发生,而是显著受到一小部分高影响上下文实例的影响,而非渐进式、广泛的转变。

  2. TOOL · CL_229190 ·

    SinLlama 模型增强 Llama 3-8B 以用于僧伽罗语任务

    研究人员开发了 SinLlama,这是一种专为僧伽罗语设计的新型开源大型语言模型。通过使用僧伽罗语词汇增强 Llama-3-8B 模型并使用大量的僧伽罗语语料库进行训练,SinLlama 在文本分类任务上的表现优于其基础模型。这一发展标志着在为低资源语言提供先进人工智能能力方面迈出了重要一步。

  3. TOOL · CL_218168 ·

    新的HelaBERT模型提升僧伽罗语理解能力

    研究人员开发了HelaBERT,这是一个新的基于BERT的语言模型家族,专门用于增强对僧伽罗语的理解。这些模型,HelaBERT-Small和HelaBERT-Large,在来自新闻文章和维基百科等各种来源的约十亿个僧伽罗语词元上进行了预训练。模型使用专门的SentencePiece Unigram分词器来处理僧伽罗语独特的语言特征。在四个下游僧伽罗语文本分类任务上的评估显示出有希望的结果,提出的双池化分类头在情感分析方面提供了持续的…

  4. TOOL · CL_215926 ·

    新框架支持对斯里兰卡议会辩论进行三语主题建模

    研究人员开发了一个新颖的框架,用于对斯里兰卡的国家议会辩论进行主题建模,这些辩论包含僧伽罗语、泰米尔语和英语。该系统通过采用基于LLM的文本提取以及多语言嵌入和聚类管道,克服了复杂的PDF布局、多语言脚本和黏着语形态带来的挑战。BiTopic扩展进一步提高了可解释性和降噪能力。该框架应用于2017-2026年超过19,000场演讲,成功识别出30个宏观主题,与2019年复活节爆炸案和2022年经济危机等重大国家事件相吻合,其表现优于传…

  5. TOOL · CL_199758 ·

    僧伽罗语-泰米尔语跨语言信息检索研究:嵌入模型优于翻译模型

    一篇新研究论文评估了使用僧伽罗语和泰米尔语查询访问英文政务信息的跨语言信息检索(CLIR)方法。该研究比较了查询翻译技术(包括 Google Translate、NLLB-200 和 mBART50)与跨语言嵌入模型(如 LaBSE、Multilingual E5 和 BGE-M3)的性能。在斯里兰卡政府信息中心的基准数据集上进行的实验表明,虽然两种方法都比单语方法提高了检索准确性,但 BGE-M3 嵌入模型取得了最高的性能,证明了其…

  6. TOOL · CL_165033 ·

    新的Python库grapheme-kit改进了多语言自然语言处理的度量标准

    一个名为grapheme-kit的新开源Python库已被开发出来,以解决现有文本处理度量标准的局限性。这些通常基于Unicode码点的度量标准,在书写系统中,当一个字素由多个码点组成时,可能无法准确表示错误。Grapheme-kit将这些度量标准扩展到字素簇,为泰米尔语和僧伽罗语等语言提供改进的处理。一项涉及光学字符识别的案例研究表明,字素级度量标准能为复杂脚本提供更准确的评估。

  7. TOOL · CL_158655 ·

    新的LKValues资源将大型语言模型与斯里兰卡社会价值观对齐

    研究人员开发了LKValues,这是一个新的资源套件,旨在将大型语言模型(LLMs)与斯里兰卡的特定社会价值观对齐。现有的基准通常反映西方规范,未能捕捉到像斯里兰卡这样的多语言国家独特的文化动态。LKValues包括一个基于调查的资源套件、一个僧伽罗语和英语的指令语料库以及一个评估基准,以弥补这一差距。对包括Qwen系列模型微调在内的各种LLMs进行的实验表明,LKValues可以改善文化价值观的对齐并减少跨语言差异,为低资源、特定国…

  8. RESEARCH · CL_128485 ·

    面向方面级情感分析的新僧伽罗语数据集发布

    研究人员推出了 SalAngaBhava,一个专为僧伽罗语(一种主要在斯里兰卡使用的低资源语言)方面级情感分析(ABSA)设计的新数据集。该数据集包含僧伽罗语的产品评论,这些评论已手动标注了特定的方面词及其相应的情感(正面、负面或中性)。SalAngaBhava 的创建旨在解决低资源语言此类资源的稀缺性问题,从而促进僧伽罗语自然语言处理和情感分析的进一步研究和开发。

  9. RESEARCH · CL_128480 ·

    跨语言迁移学习在低资源ASR方面效果不一

    研究人员探索了跨语言迁移学习以改进低资源语言的自动语音识别(ASR)。一项研究成功利用僧伽罗语提升了迪维希语ASR,通过持续预训练和微调实现了12.89%的词错误率(WER)。相比之下,另一项研究发现,对于大规模多语言ASR模型,在相关辅助语言上进行预适应并未显著提升低资源非洲语言的性能,表明在这种情况下,语言相关性本身可能不足够。

  10. TOOL · CL_117795 ·

    新的僧伽罗语 OCR 数据集和模型达到最先进性能

    研究人员开发了一个新的数据集 sinhala-ocr-lk-acts-1010,以改进僧伽罗语的光学字符识别 (OCR)。僧伽罗语是斯里兰卡约 1600 万人使用的语言。该数据集包含 1010 页图像及其转录文本,来源是跨越二十年的斯里兰卡立法法案。实验对包括 DeepSeek-OCR V1、DeepSeek-OCR V2 和 LightOnOCR-2-1B 在内的三个深度学习模型进行了微调,结果表明 LightOnOCR-2-1B …

  11. TOOL · CL_125165 ·

    新的僧伽罗语 OCR 数据集和 LightOnOCR-2-1B 达到最先进性能

    研究人员开发了一个新的数据集 sinhala-ocr-lk-acts-1010,以改进僧伽罗语的光学字符识别 (OCR)。僧伽罗语是一种约有 1600 万人使用的语言。该数据集包含来自斯里兰卡立法法案跨越二十年的 1010 个页面级图像和转录文本。通过使用 QLoRA 对 DeepSeek-OCR V1、DeepSeek-OCR V2 和 LightOnOCR-2-1B 等模型进行微调,研究发现 LightOnOCR-2-1B 是表现…

  12. RESEARCH · CL_06680 ·

    僧伽罗语自然语言处理研究中心发布音译系统和数据资源

    一篇新论文介绍了 Swa-bhasha 资源中心,该中心收集了在 2020 年至 2025 年间开发的用于罗马化僧伽罗语到僧伽罗语音译的数据和算法。这些资源对于推进僧伽罗语自然语言处理 (NLP) 研究至关重要,能够训练音译模型并开发相关应用程序。论文详细介绍了作者的贡献,并对该领域现有的音译工具进行了比较分析。