MALFORMED-300
PulseAugur coverage of MALFORMED-300 — every cluster mentioning MALFORMED-300 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
LLM JSON解析器难以处理截断输出;Toolkit Labs发布基准测试
Toolkit Labs发布了对旨在处理大型语言模型(LLM)错误输出的JSON解析器的基准测试结果。该研究聚焦于25个截断的JSON案例,即模型输出在流式传输过程中被截断。在Python和Node.js运行时中测试的21个解析器中,有12个得分零,未能恢复任何截断的输出。该公司自己的解析器jsonshim,在恢复25个截断案例中的23个方面,表现与json-repair相当。
-
Python JSON解析器在格式错误的LLM输出上的基准测试
对七个Python JSON解析器进行了基准测试,以评估它们在大型语言模型(LLM)格式错误输出上的性能。测试套件MALFORMED-300包含300个格式错误的JSON案例。结果显示,在可恢复的案例中,`json-repair`在数据恢复方面优于作者的工具`jsonshim`。然而,`jsonshim`在不可恢复的案例中采取了更严格的拒绝策略,这对于数据库条目或工具调用来说是更可取的,而`json-repair`总是返回一个值的做法…
-
开发者创建 300 案例套件以测试 LLM JSON 解析的稳健性
一位开发者创建了一个名为 MALFORMED-300 的包含 300 个案例的合规性套件,用于测试大型语言模型 (LLM) 解析器在处理格式错误的 JSON 输出时的稳健性。该套件将错误分为十二种类型,包括代码围栏、散文包装器以及 Python/JS 字面量,并特别关注仅正确的响应是拒绝解析的情况。初步测试显示,标准的 Python `json` 库在 300 个案例中有 275 个失败,而开发者自己的解析器取得了 94.0% 的成功…