一项新的基准测试 MALFORMED-300 评估了解析器从格式错误的 LLM 输出中提取 JSON 的能力,特别是当 JSON 被封装在 XML、HTML 或 SQL 等其他格式中时。json-repair 工具在此特定类别中取得了完美的 25/25 分,优于 jsonshim (17/25) 和标准库 (0/25)。然而,在整个 300 个案例的基准测试中,jsonshim 仍以 94.0% 的总分领先,json-repair 以 88.3% 的得分紧随其后。 AI
影响 提高 LLM 输出解析的可靠性,可能减少消耗 LLM 生成的结构化数据的应用程序中的错误。
排序理由 该条目详细介绍了特定工具 json-repair 在解析格式错误的 LLM 输出基准测试中的表现。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →