MMTEB: Massive Multilingual Text Embedding Benchmark
PulseAugur coverage of MMTEB: Massive Multilingual Text Embedding Benchmark — every cluster mentioning MMTEB: Massive Multilingual Text Embedding Benchmark across labs, papers, and developer communities, ranked by signal.
-
新的基准测试评估葡萄牙语文本嵌入模型,揭示性能差距
发布了两个新的基准测试 MTEB-PT 和 MTEB-PT(巴西葡萄牙语),专门用于评估葡萄牙语的文本嵌入模型。这些基准测试解决了现有评估中葡萄牙语代表性不足的问题,而现有评估通常依赖于翻译的数据集或多语言平均值。新的基准测试包含大量葡萄牙语原生任务,涵盖语义文本相似性、分类、检索和重新排序等多个类别。初步评估表明,模型性能高度依赖于任务,并且在多语言基准测试上的排名并不能可靠地预测葡萄牙语特定性能,这凸显了进行原生语言评估的必要性。
-
新的 BITEMBED 框架大幅降低了大型语言模型嵌入成本
研究人员开发了 BITEMBED,一个旨在为大型语言模型创建高效文本嵌入的新颖框架。该方法使用三元权重和量化激活将大型语言模型主干转换为低比特编码器,显著降低了计算成本和存储需求。BITEMBED 通过对比预训练和微调进行适应,并支持多种输出精度以平衡性能和存储需求。实验表明,BITEMBED 在提供显著效率提升的同时,实现了与全精度模型相当的性能。
-
HAKARI-Bench 为检索模型提供轻量级评估 · 跟踪 2 个来源
研究人员推出了 HAKARI-Bench,这是一个轻量级基准,旨在简化检索增强生成和语义搜索的检索架构和效率设置的评估。这个新基准将现有的庞大检索套件重构为更小的数据集,能够对各种检索家族及其效率变体(如降维和量化)进行快速、与模型无关的比较。HAKARI-Bench 表现出高保真度,以高于 0.97 的 Spearman 相关性重现了大型基准的排名,使其成为开发过程中模型选择和回归检测的宝贵工具。
-
新方法修正文本嵌入中的均值偏差
研究人员发现当前文本嵌入模型中存在一种持续的偏差,其中每个嵌入都可以分解为句子特定成分和跨所有句子的几乎相同的均值成分。他们提出了两种无需训练的修正方法 R1 和 R2,其中 R2 通过将嵌入投影到均值方向之外而表现出更优越的性能。在 Massive Multilingual Text Embedding Benchmark (MMTEB) 上的 38 个模型中,R2 持续提高了分类准确率,均值嵌入的范数与模型收益相关。