实体
mT5-base
mT5-base
PulseAugur coverage of mT5-base — every cluster mentioning mT5-base across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
推出阿拉伯-俄语LLM基准以促进科学知识转移
研究人员开发了一个新的基准和并行语料库,以改进阿拉伯语和俄语之间的科学翻译,旨在促进知识交流与合作。该基准由约27,000个句子对组成,这些句子对来源于科学摘要和一般文本。使用QLoRA对Qwen2.5-7B-Instruct等多种语言模型进行微调,在翻译质量上取得了显著的改进,证明了领域特定微调比少样本提示的必要性。
-
新的阿拉伯语-俄语平行语料库和基准改进科学翻译
研究人员开发了一个新的基准和并行语料库,以改进阿拉伯语-俄语科学翻译。该基准包含约 27,000 个句子对,这些句子对是从科学摘要和一般文本中汇编而成的。使用 LoRA 技术对 Qwen2.5-7B-Instruct 等多语言语言模型进行微调,显著提高了翻译质量,证明了领域特定微调相对于少样本提示的必要性。
-
人工智能合成数据以启动克奇语玛雅语翻译模型
研究人员开发了一种新颖的数据合成方法,为低资源土著语言(特别是克奇语玛雅语)创建神经机器翻译(NMT)模型。通过将词典转换为合成语料库,并在 mT5-base 模型上使用带有 LoRA 适配器的参数高效微调(PEFT),他们实现了强大的结构习得。然而,与自然语言相比,所得模型在词汇基础方面存在显著差距,这表明虽然合成数据在学习语法方面有效,但真实数据对于语义完善至关重要。