一篇新研究论文提出了一种“代币成本账本”,用于量化大型语言模型处理非英语文本所产生的额外成本。该研究分析了 FLORES-200 数据集上的八种语言,发现与英语相比,印度语言脚本的分词税成本最高可增加 8.9 倍。研究表明,这种税收的很大一部分是由于表示效率低下,而非内在信息差异,通过改进代码可以消除高达 64% 的多余代币使用量。 AI
影响 量化了大型语言模型处理非英语文本的显著但很大程度上可移除的成本惩罚,可能指导未来的分词器开发。
排序理由 一篇在 arXiv 上发表的研究论文,详细介绍了一种分析大型语言模型代币成本的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →