cl100k_base
PulseAugur coverage of cl100k_base — every cluster mentioning cl100k_base across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
CTXLENS 为开发者分析 AI 上下文窗口 token 使用情况
CTXLENS 是一款开发者工具,旨在分析 AI 上下文窗口的代码库 token 使用情况,其功能类似于用于磁盘空间的 `du` 命令。它帮助开发者了解他们的项目是否符合各种 AI 模型的上下文限制,识别 token 量大的文件,并模拟更改(如删除注释)的影响。该工具支持来自 7 家提供商的 23 个模型,包括 Claude、GPT-4o 和 Grok,并提供实时监控和用于预算检查的 CI 集成等功能。虽然随着前沿模型中更大的上下文窗…
-
MCP 协议加载的上下文比所需多 6.6 倍,效率低下
近期对 MCP(模型通信协议)的分析显示,在用户进行任何交互之前,代理工具会消耗比必要多约 6.6 倍的上下文,这存在显著的效率低下问题。
-
由于以英语为中心的训练,印度语言在大型语言模型中面临 8 倍的“分词器税”
一篇新的研究论文强调了印度语言在通过大型语言模型处理时面临的重大劣势,这是由于子词分词造成的。这些主要在英语数据上训练的分词器,导致印度语言平均面临 8.0 倍的“分词器税”,极大地缩减了其有效上下文窗口。研究确定字节对合并失败是主要原因,但也表明多语言分词器可以显著降低这种税负,表明该问题可以通过更好的分词器设计来解决。
-
新协议大幅削减多智能体系统的 LLM token 使用量
一位开发者创建了一种新的序列化协议,旨在减少多智能体大型语言模型 (LLM) 系统中的 token 使用量。该协议受 Protocol Buffers 启发,使用简短的、位置性的 ASCII 标识符,而不是冗长的自然语言或 JSON 来进行智能体间的消息传递。在 cl100k_base 分词器上的基准测试表明,它使用的 token 比 JSON 少 3.45 倍,由于分词器的偏见,对于非英语内容节省的 token 更多。该协议适用于结…
-
非洲语言在前沿大型语言模型中面临严重分词惩罚
一项新的研究论文揭示了前沿大型语言模型中存在显著的“非洲语言税”,其中分词器为非洲语言分配的子词数量远超英语。这导致这些语言的使用者面临更高的推理成本、增加的延迟以及缩小的有效上下文窗口。该研究衡量了这种惩罚在20种非洲语言中的表现,发现使用埃塞俄比亚文字和N'Ko文字的语言惩罚尤为严重,某些情况下的成本倍增高达8.9倍。虽然Gemma 4等较新的分词器有所改进,但并未消除这种惩罚,凸显了大型语言模型基础设施中编码的数字鸿沟。