研究人员推出了 TabiBERT,一个基于 ModernBERT 架构的新型大规模土耳其语基础模型。该模型在超过一万亿个 token 的海量数据集上进行了训练,涵盖了网络文本、科学出版物和源代码,并支持 8,192 个 token 的上下文长度。为了评估 TabiBERT,开发了一个名为 TabiBench 的新基准,该基准包含八个任务类别中的 27 个数据集。与之前的土耳其语模型相比,TabiBERT 在问答和代码检索任务上表现出了卓越的性能。 AI
影响 为土耳其语语言模型树立了新的最先进水平,并为未来的研究提供了一个标准化的评估框架。
排序理由 该集群描述了一篇介绍新型语言模型和基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →