研究人员开发了 Bekko Embedding,这是一个新的参数高效多语言检索模型系列。最小的版本 bekko-embedding-v1-a8m,拥有不到 800 万个活跃参数,在 MMTEB Multilingual v2 Retrieval 基准测试中得分 56.2,优于 multilingual-e5 和 BGE-M3 等更大的模型。一个稍大的模型 a25m,其性能与 gte-multilingual-base 相当。这些模型支持高达 8192 个 token 的输入,并且在 CPU 和 GPU 上都明显更快,其中 a8m 模型是测试模型中最快的。这些模型具有紧凑的 384 维输出,并且可以进行量化以减小尺寸,使其适用于浏览器搜索等应用。 AI
影响 为多语言检索的效率树立了新标准,有望实现更快、更易于访问的搜索应用。
排序理由 该集群描述了一篇介绍新模型架构及其在检索基准测试中性能的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.IR (Information Retrieval) 阅读 →
- Bekko Embedding
- bekko-embedding-v1-a25m
- bekko-embedding-v1-a8m
- BGE-M3
- gte-multilingual-base
- mmBERT-small
- MMTEB Multilingual v2 Retrieval
- multilingual-e5
- Multilingual NanoBEIR
- NanoLongEmbed
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →