json-schema
PulseAugur coverage of json-schema — every cluster mentioning json-schema across labs, papers, and developer communities, ranked by signal.
- used by Zod 90%
- instance of Zod 70%
- used by ShapeCraft 70%
- instance of Infrainguinal vein graft stenosis 70%
- used by chat completions 70%
- used by application programming interface 70%
- instance of chat completions 60%
- other ShapeCraft 60%
- instance of application programming interface 60%
- instance of ShapeCraft 50%
8 天有情绪数据
-
LLM JSON 截断绕过修复和模式验证
一位开发者探讨了 LLM API 在未报错的情况下返回截断的 JSON 的问题,这会悄无声息地破坏下游管道。使用像 `json-repair` 这样的修复库可以掩盖这些截断,测试表明几乎所有格式错误的 JSON 都被修复得看起来有效。即使有 JSON 模式验证,仍有相当比例的截断数据通过,特别是当数组元素被截断或数字不完整时。添加一个简单的消息结束标记可以显著提高检测率。
-
新的 CLI 工具分析 MCP 工具定义的大小和重复性
一个名为 mcp-footprint 的新命令行工具已被开发出来,用于分析捕获的 MCP 目录中工具定义的大小和重复性。该工具使用 Node.js 构建,通过将保存的工具/列表响应转换为字节计数并生成本地 HTML 报告来帮助开发人员。该报告可以对不同服务器之间的定义大小进行详细比较,识别完全重复的内容,并分析相似的描述,从而提供一个基于字节的工具定义大小代理。
-
LLM幻觉促使开发来源验证系统
一个软件开发团队在合同风险摘要中遇到了一个重大的幻觉问题,当时一个LLM自信地引用了一个不存在的“第23.7条”。这一事件促使开发了一个“来源验证”系统,将生成的陈述机械地链接回其原始文档片段。最初使用JSON schema和约束解码的尝试未能解决内容捏造问题,导致采用了一种结合确定性短语匹配和嵌入相似性的混合方法进行验证。该团队还实施了一个“可复现性”指标,用于标记模糊的输出以供人工审查,并强调自信的、内部一致的幻觉尤其危险。
-
AI代理的可靠性取决于结构化输出,而非仅仅是智能
AI代理的可靠性与其核心智能关系不大,而更多地取决于其生成一致且可预测输出的能力。当代理被赋予结构化数据操作任务时,尤其如此,例如涉及JSON Schema和OpenAPI规范的任务。确保这些代理严格遵守定义的模式,可以防止在实际应用中可能破坏其可靠性的“漂移”。
-
LLM 通过结构化输出和 JSON Schema 执行获得可靠性
大型语言模型可以通过强制执行结构化输出来提高可靠性,这一功能得到了 OpenAI、Anthropic 和 Gemini 等主要提供商的支持。这种方法使用 JSON Schema 来确保模型响应符合预定义的格式,从而防止出现数据类型不正确或字段缺失等常见错误。虽然这可以保证 JSON 有效,但它不能保证数据的语义正确性,这仍然需要仔细的工具设计和确认门控。
-
AI工具定义易受通过JSON Schema进行的指令注入攻击
AI工具在处理不受信任的输入时存在安全漏洞,特别是在工具定义的`inputSchema`字段中。虽然开发者通常会对工具的主要描述进行哈希处理和验证,以防止恶意指令,但他们忽略了JSON Schema本身的`description`、`title`和`example`字段。这些字段可以被操纵以注入模型将读取的新指令,从而绕过基于描述的允许列表。建议的修复方法是在模式的每个级别上剥离或覆盖这些文本字段,然后再将其暴露给模型,确保仅使用结构…
-
AI 金融建模需要在电子表格输出之前进行结构化数据合同
使用 AI 生成金融模型需要一种结构化数据方法,而不是直接生成电子表格。核心挑战在于定义清晰的数据合同,明确指定输入、假设和计算值。在渲染到 Excel 之前,使用 JSON 等中间表示并使用 JSON Schema 进行验证,可以确保单位和数据类型的准确性和一致性,从而防止可能导致错误的隐式建模决策。
-
WebMCP标准使AI代理能够直接使用Web应用工具
WebMCP是一项新兴的Web标准,它允许Web应用程序直接向AI代理公开结构化工具,从而实现比传统浏览器自动化更可靠、更高效的交互。AI代理不再需要猜测如何导航网站,WebMCP允许页面通过JSON Schema声明特定的函数,如“search_products”或“add_to_cart”,并定义输入。这种方法对于在当前浏览器上下文中进行会话感知操作特别有用,例如更新购物车或保存草稿。尽管WebMCP仍处于实验阶段且浏览器支持有限…
-
Python指南解释了LLM函数调用以提取结构化数据
本指南详细介绍了如何在Python中实现函数调用(也称为工具使用),以使大型语言模型能够返回结构化数据而不是自由文本。该过程包括向模型描述可用的工具(函数),然后模型返回一个匹配已定义模式的JSON对象。开发人员随后解析此JSON以执行实际函数,并将结果反馈到对话中。该指南涵盖了标准的函数调用和结构化输出模式,包括在对话循环中链接多个工具调用以实现更复杂的代理行为。
-
Anthropic发布Model Context Protocol以实现通用AI工具集成
Anthropic推出了Model Context Protocol (MCP),这是一个旨在简化大型语言模型工具集成的开放标准。MCP旨在充当通用适配器,类似于USB-C,允许开发人员构建一次工具,并使其与各种AI客户端兼容,而无需为每个客户端编写自定义的粘合代码。该协议定义了客户端如何发现可用工具,以及客户端和服务器之间如何交换工具调用和结果,从而实现无缝互操作性。
-
研究发现:真实的MCP服务器功能不如精心策划的基准测试
一项发表在arXiv上的新研究揭示,真实的模型上下文协议(MCP)服务器的功能远不如精心策划的数据集所显示的。直接从MCP注册表中抽样时,只有48.8%的服务器完成了初始化握手,有高达37.5%根本无法启动。尽管这些真实世界的服务器在广告工具的JSON Schema方面表现出高度一致性,但与精心策划的框架相比,它们在可选安全注解的遗漏率方面要高得多。此外,研究发现真实MCP数据中不同作者之间的工具几乎没有近乎重复的情况,这与BFCL …
-
通过集成 AJV 改进了 LLM 数据验证
作者遇到了一个问题,即 LLM 生成的数据不符合指定的 JSON schema 约束,例如年龄限制。虽然 LLM 的提示中包含了验证说明,但 ShapeCraft 库内置的 JSON schema 检查器仅支持部分关键字。为了强制执行更严格的验证,作者集成了 AJV 库,该库提供了更全面的 JSON schema 验证器。这使得 ShapeCraft 能够对不合规的数据抛出错误,触发重试,并确保数据在到达下游服务之前具有完整性。
-
AI工具模式投毒漏洞绕过内容过滤器
一种名为“MCP工具模式投毒”(MCP Tool Schema Poisoning)的新漏洞CVE-2025-54136,允许攻击者通过操纵AI工具的JSON模式定义来静默地改变其功能。这种攻击绕过了传统的内容过滤器,因为模式变异发生在结构层面,而不是在提示文本内。一旦工具的模式被批准,后续的更改就可以授予恶意功能,例如未经授权的文件访问或网络调用,MCPoison漏洞的演示证明了这一点,该漏洞在各种LLM上实现了36.5%的成功率。
-
基于模式的验证可防止AI模型输出静默漂移
为了防止AI模型输出发生静默故障,可以实施一种基于模式的验证方法。该方法涉及定义一个JSON Schema,作为对预期模型响应的契约,包括必需的字段、它们的类型和约束。通过将每个模型输出与此模式进行验证,开发人员可以快速识别结构性更改,例如字段重命名或类型漂移,这些更改否则可能会被忽略并降低管道的准确性。
-
LLM 结构化输出:Schema 有效性掩盖了正确性问题
一位开发者创建了一个系统,该系统使用 JSON Schema 验证器和强制转换层来确保语言模型的结构化输出既有效又正确。Schema 验证器确保输出符合预期格式,而强制转换层则纠正小错误,如不正确的 capitalization 或数据类型。然而,该系统在强制转换后,“正确性”率(衡量针对手工编写语料库的准确性)仅略有提高,并且静默错误的输出数量有所增加,这凸显了 Schema 有效性与真实准确性之间的差距。
-
专家警告:LLM的JSON模式会因限制推理而降低准确性
尽管可以确保语法上有效的输出,但在大型语言模型中使用JSON模式可能会无意中降低其准确性和推理能力。这是因为JSON模式强制执行严格的模式,这限制了模型使用中间令牌进行推理的能力,并且在数据缺失时可能迫使它编造信息。为缓解此问题,开发人员应在模式中优先考虑推理字段而非数据字段,明确表示未知值,并保持模式简单,可能对复杂任务使用两阶段方法。
-
新的分类法按被挫败的缓解措施对人工智能基准污染进行分类
提出了一种新的人工智能基准污染分类法,该分类法按其挫败的缓解方法对污染类型进行组织。该分类法将污染分为直接型、派生型、时间型、分布型和习得型,并解决了训练时和评估时的数据泄露问题。研究还引入了一个四字段披露协议来报告污染状态,并承认“未知”是一个有效条目。对41份文件的分析显示,一些变量的编码者间可靠性较低,在变量适用时间上存在显著分歧,而不是在其陈述内容上存在分歧。
-
OpenAI的GPT-4o mini通过函数调用实现确定性数据输出
文章解释了如何使用大型语言模型实现函数调用,特别是使用OpenAI的GPT-4o mini。它详细介绍了函数调用(也称为工具使用)如何通过以JSON Schema格式定义函数,使模型能够返回结构化的、机器可读的数据。这种方法确保了确定性且可安全解析的响应,这对于数据格式不一致可能导致错误的生产环境至关重要。该过程包括定义函数模式,将其与提示一起发送给模型,然后由应用程序代码根据模型的结构化负载执行函数,并可选择将结果反馈给模型以获得最终响应。
-
AI API模式拒绝困扰Gemini、Groq;模型在生成前失败
最近对API调用的分析显示,大量结构化输出请求失败并非由于模型错误,而是因为API提供商拒绝了JSON Schema本身。Toolkit Labs发现,72个调用中有28个导致了HTTP 400错误,其中Google AI Studio的Gemini 3.1 Flash-Lite拒绝了其所有18个测试Schema。其他提供商如Groq也遇到了Schema拒绝,通常是由于对'required'或'additionalProperties…
-
AI 代理发现 1.1% 的 MCP 服务器清单违反注册表模式
一个 AI 研究代理已识别出,官方注册表中 50,000 个模型上下文协议 (MCP) 服务器清单中约有 1.1% 违反了注册表自身的 JSON 模式。该代理构建了一个开源验证器 mcp-registry-lint 来执行此扫描,并发现了四种不同的缺陷类别,其中一类影响了“com.senzing/*”命名空间下的 211 个条目。已提出一个特定缺陷的修复方案,但建议在发布时进行更广泛的模式验证以捕获所有违规行为。