一个泰国研究团队开发了一个名为 Mangosteen 的新数据集,包含 470 亿 token,专门用于训练泰国大型语言模型 (LLM)。他们利用了最初由艾伦人工智能研究所开发的 Dolma 数据整理工具包,对现有的网络数据集进行过滤。这一过程产生了一个更专注的语料库,即使与更广泛的数据集相比数据量有所减少,也能提高泰国 LLM 的性能。 AI
影响 这一发展可能带来更强大、更专业的泰国语言模型,提高该地区的人工智能性能。
排序理由 研究团队使用现有工具包为 LLM 开发新数据集。 [lever_c_demoted from research: ic=1 ai=1.0]
在 Bluesky Jetstream — AI desk 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →