PulseAugur
实时 01:35:08
实体 Tanakh

Tanakh

PulseAugur coverage of Tanakh — every cluster mentioning Tanakh across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_199491 ·

    由于预处理和训练数据限制,带尼库德的希伯来语文本的光学字符识别面临挑战

    带尼库德(元音符号)的希伯来语文本的光学字符识别(OCR)常常难以处理这些符号,因为在识别模型看到文本之前,多个预处理阶段会移除这些精细的标记。这些阶段包括分辨率缩放、二值化阈值处理、去噪点滤波和行分割裁剪。此外,主要在省略尼库德的现代希伯来语上训练的模型,即使尼库德得以保留,也缺乏识别这些标记所需的训练数据。常见的混淆出现在外观相似的元音符号之间,例如卡马茨(qamats)和帕塔赫(patah),或塞戈尔(segol)和舍瓦(she…

  2. TOOL · CL_169809 ·

    新算法利用信息论发现公式化文本聚类

    研究人员开发了一种新颖的信息论算法,用于识别文本数据中的公式化聚类。该方法利用加权自信息分布,将经典度量扩展到连续公式,以应用于神经嵌入。当应用于《希伯来圣经》时,该算法成功分离了风格层次,并提供了一个量化的文本分层框架,为文本的构成和演变提供了新的见解。

  3. RESEARCH · CL_99665 ·

    MiqraBERT模型增强圣经希伯来语平行文本检测能力

    研究人员开发了MiqraBERT,一个新颖的Sentence-BERT模型,专门针对圣经希伯来语的语义相似性检测进行了微调。该模型基于AlephBERT,采用基于回归的方法和余弦相似度,创建了一个平行经文能够聚集在一起的嵌入空间。MiqraBERT在基线方法上表现出显著的改进,减少了歧义重叠,并实现了叙事平行文本的高召回率,尽管诗歌平行文本仍具挑战性。