PulseAugur
实时 01:53:22
English(EN) Bekko Embedding: Parameter-Efficient Multilingual Retrieval with Ultra-Compact Encoders

Bekko Embedding 以超紧凑模型实现具有竞争力的多语言检索

研究人员开发了 Bekko Embedding,这是一个新的参数高效多语言检索模型系列。最小的版本 bekko-embedding-v1-a8m,拥有不到 800 万个活跃参数,在 MMTEB Multilingual v2 Retrieval 基准测试中得分 56.2,优于 multilingual-e5BGE-M3 等更大的模型。一个稍大的模型 a25m,其性能与 gte-multilingual-base 相当。这些模型支持高达 8192 个 token 的输入,并且在 CPU 和 GPU 上都明显更快,其中 a8m 模型是测试模型中最快的。这些模型具有紧凑的 384 维输出,并且可以进行量化以减小尺寸,使其适用于浏览器搜索等应用。 AI

影响 为多语言检索的效率树立了新标准,有望实现更快、更易于访问的搜索应用。

排序理由 该集群描述了一篇介绍新模型架构及其在检索基准测试中性能的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.IR (Information Retrieval) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Bekko Embedding 以超紧凑模型实现具有竞争力的多语言检索

报道来源 [1]

  1. arXiv cs.IR (Information Retrieval) TIER_1 English(EN) · Yuichi Tateno ·

    Bekko Embedding:超紧凑编码器的参数高效多语言检索

    How small can a competitive multilingual retrieval model be? We present Bekko Embedding: its smallest model, bekko-embedding-v1-a8m, has just under 8M Active Parameters (AP) -- the non-embedding parameters that dominate inference compute -- yet on official MMTEB Multilingual v2 R…