Ancient Greek
PulseAugur coverage of Ancient Greek — every cluster mentioning Ancient Greek across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新AI模型Stoicheia增强古希腊文本分析
研究人员开发了Stoicheia,一个拥有4.05亿参数的字符级掩码扩散模型,专门用于古希腊语。该模型能够同时修复损坏的文本、解析句子以及确定格律扫描,而无需进行特定任务的重新分词。Stoicheia在大型语料库上进行了预训练,在铭文重建、词法句法标记和长音标记方面,相比之前的最先进系统有了显著改进。
-
新工具可自动标注古希腊语元音长度,用于自然语言处理
研究人员开发了一种新颖的抑扬符标注工具,可自动标注古希腊文本中的元音长度。该工具解决了缺乏大规模、公开可用的抑扬符标注语料库的问题,而这些语料库对于古希腊自然语言处理(NLP)至关重要。该系统采用基于规则的方法,并结合递归模块,根据上下文、形态学和词汇信息推断元音长度,并可为机器学习模型生成训练数据。该抑扬符标注工具预计将改进下游的NLP任务,如诗歌格律分析。
-
无监督方法为古语生成有效的句子嵌入
研究人员开发了两种无监督学习策略,TSDAE 和对比句子嵌入 (CSE),为古语创建有效的句子嵌入。这些方法仅使用原始文本来调整现有语言模型,在拉丁语和古希腊语文本的复用识别和对应检索等任务上,其表现优于多语言和专业基线。调整后的编码器即使在处理嘈杂的自动转录文本时也特别有效,并且有一个名为 Paraphrasis 的工具可供非专业人士使用完整的流程。
-
新的视觉语言模型评估方法应对复杂的古希腊文本识别
研究人员开发了新的资源并评估了现有的视觉语言模型(VLMs),以应对古希腊评注本中复杂的文本识别任务。这些历史文献具有复杂的版式语义、密集的引用层级和大量的页边注释,对当前的VLMs构成了挑战。该研究引入了一个包含185,000张页面图像的合成语料库和一个真实扫描版评注本的基准测试,结果显示在零样本设置下,大多数VLMs的表现不如传统软件。然而,Qwen3VL-8B模型表现出了最先进的性能,在真实扫描版上实现了1.0%的字符错误率,凸…
-
新基准和语料库推动古希腊语到现代希腊语的翻译
研究人员开发了一个新的古希腊语到现代希腊语翻译基准和数据集,这项任务以前因缺乏平行数据而受到阻碍。AG-MG平行语料库包含超过132,000个句子对,是通过一个涉及网络抓取、先进对齐技术以及使用Gemini 2.5 Flash进行的大型语言模型错误纠正的新颖流程创建的。实验表明,微调Llama-Krikri-8B和M2M100等模型可显著提高翻译质量,最佳模型的BLEU得分达到13.16。
-
Claude Opus 4.7 掌握古希腊语填空挑战
一位AI对齐研究员向Claude Opus 4.6发出了一个挑战,要求它在无人协助的情况下正确完成古希腊语填空练习。该模型在重音规则上遇到了困难,这是大型语言模型在专业语言任务中普遍存在的问题。虽然最初引导Opus 4.6的尝试只取得部分成功,但稍后的版本Opus 4.7能够一次性解决该挑战。