PulseAugur
实时 04:02:21
English(EN) BHARATI: Morphology-Aware Tokenizers for Classical Indian Languages with Subword Fertility Analysis

新的BHARATI分词器提高了古典印度语言的效率

研究人员开发了BHARATI,这是一套专为梵语和泰米尔语等古典印度语言设计的新分词器。与难以处理这些语言的黏着语形态和 संधि(sandhi)的标准算法不同,BHARATI实现了更有效的分段。这导致序列长度缩短,有效地增加了下游语言模型的上下文窗口,并提高了在专门的印度知识体系术语上的性能。 AI

影响 提高了古典印度语言的语言模型效率和上下文长度,可能在专门任务上实现更好的性能。

排序理由 该集群包含一篇详细介绍新方法及其评估的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的BHARATI分词器提高了古典印度语言的效率

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Poornima Kumaresan, Pavithra Muruganantham, Lakshmi Rajendran, Santhosh Sivasubramani ·

    BHARATI:面向古典印度语言的形态感知分词器及子词丰度分析

    arXiv:2607.23319v1 Announce Type: new Abstract: Standard subword tokenization algorithms such as Byte-Pair Encoding (BPE) and SentencePiece are trained predominantly on modern language corpora and produce inefficient segmentations when applied to classical Indian languages. Sansk…