Latin
PulseAugur coverage of Latin — every cluster mentioning Latin across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
Voynich manuscript analysis may indicate a novel form of symbolic representation
The recent analysis of the Voynich manuscript, questioning standard assumptions about glyphs, tokens, and word separation, suggests it may not follow typical linguistic or cryptographic conventions. The high glyph regularity and unusual space behavior could point to a unique system of symbolic representation or encoding that requires entirely new analytical frameworks, potentially moving beyond traditional text-based decipherment methods.
Multilingual ASR models require script-normalization for accurate evaluation
The evaluation of multilingual ASR models on languages like Garrusi Kurdish, which uses Latin script, reveals that differences in writing systems between reference and hypothesis can lead to significant errors. The proposed staged normalization approach suggests that future ASR research and development will need to incorporate robust methods for handling script variations to achieve more accurate performance metrics and improve model robustness across diverse linguistic inputs.
OCR challenges extend beyond Latin script to diverse writing systems
Recent evidence highlights significant OCR difficulties not only with historical Latin-based scripts like Fraktur but also with non-Latin scripts such as Thai, Khmer, Korean, and Ethiopic. These challenges stem from unique linguistic features like word segmentation in Thai, complex character stacking in Khmer, mixed character sets in Korean, and distinct letterforms in Ethiopic. This suggests a broad need for specialized OCR models and training data across a wide array of global languages and scripts.
-
在没有人类审查的情况下评估古典文本中的大型语言模型翻译错误
研究人员开发了一种新颖的方法,可以在不需要人类参考的情况下评估大型语言模型(LLM)翻译古典文本的准确性。该研究侧重于巴利语到英语的翻译,比较了五个信号:来源新颖性、嵌入距离、同伴翻译分歧、回译和无参考GEMBA评分。由更强的LLM组成的专家小组进行的GEMBA评分被证明是最有效的无参考信号,成功识别了校准集和锚定集中很大一部分的错误。提出的工作流程结合了多个信号,以有效地分配古典语言翻译的人工审查资源。
-
新的LLM管道有助于历史语言的词义消歧
研究人员开发了Inspicio,一个旨在改进历史和低资源语言的词义消歧的新型管道。与需要现有词义清单的传统方法不同,Inspicio使用指令微调的LLM生成英文翻译和定义,使其能够将单词链接到Open English WordNet,而无需特定于源语言的映射。该系统在拉丁语、古希腊语和意大利语上进行了评估,取得了较高的召回率,并证明了在跨语言和域外场景中的有效性。
-
UniLipi OCR模型统一了13种印度历史手稿文字
研究人员开发了UniLipi,一种新颖的统一多脚本光学字符识别(OCR)模型,专为历史印度手稿设计。该单一框架可以处理13种不同的印度文字,克服了现有特定文字OCR系统的局限性。UniLipi通过利用感知文字的合成数据生成,能够处理手稿中的挑战性条件,如行几何形状的变化、污渍或插图的干扰以及低资源场景。该模型的学习表示也对当代印度手写体有效,并可扩展到藏文、意大利文、拉丁文和标准中文等非印度文字。
-
研究揭示分词器设计缺陷限制多语言AI模型
一篇新研究论文指出了许多AI模型所使用的多语言分词器的一个重大限制,包括Hugging Face的模型,并可能影响GPT-4o等模型。该研究发现,使用“仅字母”单词定义的分词器(常见于源自GPT-2的模型)会通过将元音与辅音分开来错误地分割阿布吉达文字中的单词。这种预分词问题造成了分词器有效性的上限,不成比例地影响了藏语和泰语等语言。研究表明,修正后的分词器显著提高了模型性能,并量化了这种有缺陷的方法在众多流行文本生成模型中的广泛部署情况。
-
指甲月牙的解释:生物学家揭穿健康迷思
指甲上的白色月牙形区域称为月牙,它并非健康指标,而是指甲基质(生产新指甲细胞的部分)的可见区域。指甲基质的这部分比其余的甲床更厚、更不透明,因此会散射光线而呈现白色。月牙在不同手指上的可见度和大小各不相同,基质越大,月牙越明显;如果某个手指没有月牙,则表示基质只是位于皮肤下方更靠后的位置。生物学家认为月牙是甲状腺发育的结构性结果,类似于建筑中的拱肩,而不是自然选择塑造的特征。
-
沃伊尼奇手稿分析质疑符号-字母、标记-词语的假设
一篇新论文挑战了关于沃伊尼奇手稿的基本假设,认为其符号不是字母,其标记不是词语,其空格也不是词语分隔符。研究人员分析了 Zandbergen-Landini 转写本,发现手稿的结构更多地与内部标记边界有关,而不是标记本身的序列。研究表明,符号的规律性对于简单的替换密码来说太高了,而且空格的行为与典型的词语分隔符不同,有些更像是内部连接符。
-
多语言自动语音识别模型在加鲁斯库尔德语上进行评估
一篇新的研究论文分析了 MMS-1B-all 多语言语音识别模型在加鲁斯库尔德语(一种使用拉丁字母书写的库尔德语变体)上的性能。该研究强调了在参考和假设使用不同书写系统时评估语音识别的挑战,并提出了一种通用的参考分阶段归一化方法来解决这个问题。结果表明,归一化后词错误率 (WER) 和字符错误率 (CER) 有显著提高,但仍然存在大量错误,这表明识别模型和评分流程都存在局限性。
-
OCR引擎因独特的字形而在德语Fraktur字体上失败
光学字符识别(OCR)引擎在处理历史德语Fraktur字体时遇到困难,因为其字形特征与现代拉丁字体相比存在显著差异。这些差异,如断笔画和密集的垂直笔画,导致错误率很高,因为OCR模型缺乏对这些独特字形的足够训练数据。关键的混淆出现在字母'k'和't'、'n'和'u'以及'B'和'V'之间,而长s(ſ)由于与'f'的细微视觉区别和位置使用规则而尤其成问题。此外,连字和诸如Sperrsatz之类的字母间距技术进一步增加了准确转录和搜索的难度。
-
泰语、高棉语、韩语和埃塞俄比亚文字的OCR挑战详述
像泰语、高棉语、韩语和埃塞俄比亚语这样的文字的光学字符识别(OCR)面临着不同于标准拉丁字母文本的独特挑战。泰语OCR由于词语之间没有空格,在词语分割方面存在困难,需要基于词典的方法。高棉语OCR面临堆叠的辅音下标和可能被标准识别模型丢失或误解的小型变音符号的问题。韩语OCR因历史上混合使用谚文和汉字而变得复杂,在有限的谚文数据集上训练的模型可能会错误地替换汉字。埃塞俄比亚文字是一种音节文字,其字符家族内部存在系统性的混淆,这意味着错…
-
无监督方法为古语生成有效的句子嵌入
研究人员开发了两种无监督学习策略,TSDAE 和对比句子嵌入 (CSE),为古语创建有效的句子嵌入。这些方法仅使用原始文本来调整现有语言模型,在拉丁语和古希腊语文本的复用识别和对应检索等任务上,其表现优于多语言和专业基线。调整后的编码器即使在处理嘈杂的自动转录文本时也特别有效,并且有一个名为 Paraphrasis 的工具可供非专业人士使用完整的流程。
-
新的合成数据集提升波斯语OCR能力
研究人员推出了Persian Pixel,一个旨在提高波斯语光学字符识别(OCR)能力的大规模合成数据集。该数据集包含超过343,000个图像-文本对,使用SynthOCR-Gen框架生成,以准确模拟波斯语脚本的复杂性,包括连写连接和风格变化。Persian Pixel旨在克服标注数据的稀缺性,从而能够训练TrOCR和Donut等先进的OCR模型,并推动波斯语文档分析的发展。
-
New benchmark Loci Similes aids Latin intertextuality detection
研究人员推出 Loci Similes,一个旨在帮助检测拉丁文学中互文性联系的新基准。该基准包含一个包含约 172,000 个文本片段的数据集,其中有 545 个经过专家验证的对应关系,重点关注晚期古代作家及其古典影响。目标是促进能够识别超越简单词汇匹配的语义相似性的语言模型的发展,从而推进互文性研究。
-
扩散模型生成乌克兰手写文本,创建新数据集
研究人员开发了一种使用扩散模型生成乌克兰手写文本的方法,解决了低资源书写系统中的空白。他们创建了一个包含来自308位作者的超过126,000个乌克兰手写单词的新数据集。最初在拉丁字母脚本上训练的DiffusionPen模型,在该数据集上进行了重新训练,并展示了有效的跨域风格迁移能力,能够泛化到历史和当代乌克兰手写体。
-
深度学习框架分析罗曼语族语法性别转变
研究人员开发了一个可解释的深度学习框架,用于研究从拉丁语到奥克西唐语的语法性别演变。该研究通过提出一种新颖的分词器来解决低资源历史语言学的挑战,并分析了形态特征和词性类别对性别预测的贡献。研究结果阐明了性别信息如何在词形和句子语境之间分布。
-
深度学习模型追踪语法性别从拉丁语到罗曼语系的转变
研究人员开发了一个深度学习框架,用于研究语法性别系统从拉丁语到罗曼语系的演变。该研究侧重于在大多数罗曼语系中从三性别系统(阳性、阴性、中性)转变为两性别系统(阳性、阴性)。该框架分析了词汇和上下文因素,发现传统的标记化方法对于低资源历史语言来说是不够的,并且形态特征和词性类别在预测语法性别方面起着重要作用。
-
新的HGQ-LUT和da4ml方法加速DNN训练和FPGA部署
研究人员开发了HGQ-LUT,一种用于训练基于查找表(LUT)的神经网络的新方法,该方法显著加快了训练过程,在现代GPU上速度提升超过100倍。该方法引入了专门的层和细粒度量化,以自动探索精度-资源权衡,无需手动调整。HGQ-LUT已集成到开源工具链中,能够为像CERN大型强子对撞机这样的应用实际部署这些高效的DNN。