NLLB-200
PulseAugur coverage of NLLB-200 — every cluster mentioning NLLB-200 across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
僧伽罗语-泰米尔语跨语言信息检索研究:嵌入模型优于翻译模型
一篇新研究论文评估了使用僧伽罗语和泰米尔语查询访问英文政务信息的跨语言信息检索(CLIR)方法。该研究比较了查询翻译技术(包括 Google Translate、NLLB-200 和 mBART50)与跨语言嵌入模型(如 LaBSE、Multilingual E5 和 BGE-M3)的性能。在斯里兰卡政府信息中心的基准数据集上进行的实验表明,虽然两种方法都比单语方法提高了检索准确性,但 BGE-M3 嵌入模型取得了最高的性能,证明了其…
-
新的孟加拉语翻译系统连接12种地区方言
研究人员开发了一种新颖的多方言神经机器翻译系统,旨在解决孟加拉语方言差异带来的重大挑战。该系统可以在12种地区孟加拉语方言之间进行翻译,而无需中间标准语言。经过微调的BanglaT5模型利用权重分解低秩适配(DoRA),取得了最先进的性能,优于NLLB-200和mBART-50等大型模型。该项目还汇编了迄今为止最大的孟加拉语多方言平行语料库,并发布了一个优化的模型开放访问的Web应用程序,以促进数字包容性。
-
研究发现:人工智能基准测试覆盖的语言不到世界语言的3%
当前人工智能语言模型的基准测试严重低估了世界语言多样性,最广泛的基准测试仅覆盖了约7000种现存语言中的2.9%。即使是最全面的文本基准测试FLORES-200,也只包含200种语言,而像MMLU这样被广泛引用的基准测试则专注于单一语言——英语。这种有限的覆盖意味着,虽然模型可能在几十种语言的翻译能力上有所表现,但它们在推理、安全或指令遵循等复杂任务上的表现,在绝大多数世界语言中却很少得到评估。
-
新方法改进了NMT模型中低资源语言的翻译
研究人员开发了一种新方法,用于在多语言神经机器翻译模型中为低资源语言初始化嵌入。该方法通过对模型中已有的类型学上相关的语言的嵌入进行平均,并在林布姆-英语翻译上进行了测试。新方法取得了与使用单语代理相当的性能,显著优于从头开始训练的Transformer,并展示了多语言迁移对于极低资源语言的强大作用。
-
新方法将多语言神经机器翻译模型大小缩减60%,性能无损
研究人员开发了一个新颖的框架,通过剪枝词汇来优化多语言神经机器翻译(MNMT)模型。该方法通过将词汇量从超过128,000个词元减少到约10,000个词元,显著降低了内存和计算需求,在不影响性能的情况下实现了高达60%的内存节省。在针对英阿翻译的M2M100、NLLB-200和mBART-50等模型上进行的测试中,优化后的模型在语义充分性和流畅性方面表现出与专用双语基线相当或更优的性能。
-
评估了本地大语言模型在不同提示下的机器翻译效果
一篇新的arXiv论文探讨了提示设计和示范选择如何影响本地大语言模型(LLMs)的机器翻译能力。该研究评估了Llama3.2 3B、mistral:latest和Qwen2.5:14b等模型在英语和九种欧盟语言之间的翻译能力,并与OPUS-MT和NLLB-200等专业机器翻译系统进行了比较。研究结果表明,虽然专用机器翻译系统通常表现更好,但少样本提示可以使一些LLMs受益,并且嵌入相似性检索用于示范可以带来适度的优势。研究还强调了在L…
-
新研究比较AI在多语言极化检测中的策略
研究人员对SemEval-2026任务9的多语言极化检测进行了22种语言的比较研究。该研究评估了通才模型、特定语言的专才模型以及集成策略。虽然像XLM-RoBERTa这样的通才模型在分词器对齐时表现良好,但特定语言的专才模型在柬埔寨语和奥里亚语等具有独特书写系统的语言上表现出显著的改进。该团队开发了一个语言自适应框架,该框架根据开发性能动态地在通才模型、专才模型和集成模型之间进行选择,实现了0.796的总体宏平均F1分数。
-
NagaTranslate 使用 LLMs、Whisper、VITS 构建低资源语言管线
一个名为 NagaTranslate 的项目正在为印度那加兰邦的低资源语言(包括 Nagamese、Ao 和 Sema)开发翻译和语音管线。该系统利用商业 LLM API 进行文本翻译,利用微调后的 VITS 模型进行语音合成,并利用微调后的 Whisper 模型进行语音识别。开发者正在寻求关于自托管开放权重模型、处理 Nagamese 的拼写变体以及用有限数据提高 TTS/ASR 对地区口音的鲁棒性的建议。
-
新数据集和模型推动手语识别和翻译发展
研究人员开发了手语识别和翻译的新方法。一种方法使用深度学习流程,结合视频MAE视频Transformer将手语手势分类为英语单词,并使用Meta AI的NLLB-200模型将这些单词翻译成印地语、泰卢固语和孟加拉语等印度语言。另一项开发是SignNet-1M数据集,该数据集旨在通过使用3D高斯溅射和扩散模型等技术合成视角、背景和 the signer identity 的真实变化,来提高手语模型的鲁棒性。该数据集及其相关的基准测试旨在…
-
新的V-ASR系统使用音素预测和LLM提高准确性
研究人员开发了一种新的两阶段视觉自动语音识别(V-ASR)框架,旨在通过关注音素而非直接的单词预测来提高准确性。该系统首先融合视觉线索和面部地标运动特征来预测音素,然后利用一个名为NLLB的大型语言模型(LLM)进行单词重建。据报道,这种方法在LRS2数据集上实现了17.4%的词错误率,在LRS3数据集上实现了21.0%,优于以往在唇形(viseme)模糊方面存在困难的方法。
-
研究人员在有限硬件上微调 NLLB 以支持 Twi
一位研究人员详细介绍了他们在简陋的 6GB 显存设置上微调 NLLB 模型以支持 Twi 语言的经验。该过程涉及克服与规模化限制和确保人类对齐相关的挑战。最终模型被呈现为一个进行中的工作,而不是一个最终的、完美的解决方案。
-
用户寻求能保留100多种语言专有名词的翻译模型
一位Reddit用户在r/MachineLearning板块寻求关于文本到文本翻译模型的建议,该项目需要将100多种语言翻译成英语。用户在保留专有名词(如姓名、地点、日期和组织机构)方面遇到了困难,即使使用NLLB等先进的NMT模型和Gemma 4、Qwen 3 4B等LLM也未能解决。用户正在寻找能在RTX GPU上本地运行、参数量在7B以下的解决方案,并对更好的多语言翻译模型、NER方法或解码技术持开放态度。
-
新基准和语料库推动古希腊语到现代希腊语的翻译
研究人员开发了一个新的古希腊语到现代希腊语翻译基准和数据集,这项任务以前因缺乏平行数据而受到阻碍。AG-MG平行语料库包含超过132,000个句子对,是通过一个涉及网络抓取、先进对齐技术以及使用Gemini 2.5 Flash进行的大型语言模型错误纠正的新颖流程创建的。实验表明,微调Llama-Krikri-8B和M2M100等模型可显著提高翻译质量,最佳模型的BLEU得分达到13.16。
-
CRAFT方法加速了序列到序列模型的训练数据选择
研究人员开发了一种名为CRAFT(Clustered Regression for Adaptive Filtering of Training data)的新方法,用于高效地为序列到序列模型选择高质量的训练数据子集。该方法分解了联合源-目标分布,并使用两阶段选择过程来匹配验证分布并最小化预期距离。CRAFT在英-印翻译任务中表现出显著的改进,取得了比现有方法更高的BLEU分数,同时大大缩短了选择时间。