Toolkit Labs
PulseAugur coverage of Toolkit Labs — every cluster mentioning Toolkit Labs across labs, papers, and developer communities, ranked by signal.
-
AI API模式拒绝困扰Gemini、Groq;模型在生成前失败
最近对API调用的分析显示,大量结构化输出请求失败并非由于模型错误,而是因为API提供商拒绝了JSON Schema本身。Toolkit Labs发现,72个调用中有28个导致了HTTP 400错误,其中Google AI Studio的Gemini 3.1 Flash-Lite拒绝了其所有18个测试Schema。其他提供商如Groq也遇到了Schema拒绝,通常是由于对'required'或'additionalProperties…
-
json-repair 在提取 LLM 封装的 JSON 方面表现出色,优于 jsonshim
一项新的基准测试 MALFORMED-300 评估了解析器从格式错误的 LLM 输出中提取 JSON 的能力,特别是当 JSON 被封装在 XML、HTML 或 SQL 等其他格式中时。json-repair 工具在此特定类别中取得了完美的 25/25 分,优于 jsonshim (17/25) 和标准库 (0/25)。然而,在整个 300 个案例的基准测试中,jsonshim 仍以 94.0% 的总分领先,json-repair 以…
-
开发者发布Unicode字符串语料库,暴露文本处理缺陷
一位开发者创建了一个包含300个Unicode字符串的语料库,旨在暴露朴素文本处理函数(尤其是`len()`)的缺陷。该语料库包含各种复杂的Unicode特性,如零宽度连接符(ZWJ)序列和Astral平面码点,其中20个案例根据CC0许可免费提供。完整数据集可供购买,旨在帮助开发者识别其文本处理代码在处理用户可粘贴字符串时的行为,并强调像表情符号处理这样的简单测试并不能保证全面的覆盖。
-
Nostr NIP-90就业市场有1860个请求但零出价
对Nostr NIP-90就业市场为期30天的分析显示,工作请求和出价之间存在显著失衡。在1860个工作请求中,没有一个包含指定最高付款的出价标签,这表明客户没有利用该协议为价格谈判指定的字段。相反,定价似乎由提供商在他们的反馈中确定,在所有分析的中继中观察到的最高金额为100 sats,相当于每项工作几美分。该市场还显示了大量的内容发现请求(kind 5300)以及相对于实际交付结果的提供商而言,大量的列表。
-
LLM JSON解析器难以处理截断输出;Toolkit Labs发布基准测试
Toolkit Labs发布了对旨在处理大型语言模型(LLM)错误输出的JSON解析器的基准测试结果。该研究聚焦于25个截断的JSON案例,即模型输出在流式传输过程中被截断。在Python和Node.js运行时中测试的21个解析器中,有12个得分零,未能恢复任何截断的输出。该公司自己的解析器jsonshim,在恢复25个截断案例中的23个方面,表现与json-repair相当。