PulseAugur
中
实时 20:37:56
实体 schema

schema

PulseAugur coverage of schema — every cluster mentioning schema across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 12
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
时间线
  1. 2026-07-16 research_milestone A new harness named 'Schema' achieved a 99% score on the ARC-AGI-3 benchmark using Claude Opus 4.8 and Fable 5. 来源
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 14 条
  1. TOOL · CL_232651 ·

    Qwen Code 0.22.3 错误破坏了 llama.cpp 与工具模式限制的集成

    Qwen Code 0.22.3 中的一个错误导致在与 llama.cpp 服务器交互时出现 API 错误,原因是其内置工具模式中的字符串 maxLength 限制过大。这些过大的限制阻止了 llama.cpp 成功编译工具调用所需的语法,从而在任何模型生成发生之前导致 400 错误。通过在 Qwen Code 设置中将 `tools.eager` 设置为空列表,可以暂时解决此问题,这会将工具模式处理推迟到实际使用时。

  2. TOOL · CL_217386 ·

    LLM JSON 提取:Schema、枚举及修复策略

    本文解释了如何通过优化 Schema 来显式处理缺失字段和 Null 值,以及将枚举值限制为应用程序控制的标签,从而改进大型语言模型 (LLM) 的 JSON 提取。文章建议为枚举不匹配设置重试机制,并提倡在需要提供商特定调优时直接连接模型,或使用兼容的网关进行成本归属和简化凭证管理。核心建议是将提取和修复逻辑保留在应用程序拥有的适配器内,以确保准确的数据处理和租户计费。

  3. COMMENTARY · CL_217031 ·

    AI需要明确的含义和信任才能处理企业数据

    AI代理需要比基本模式信息更多的信息才能可靠地解释企业数据。数据模型必须明确传达含义、结构、关系、使用规则和信任因素,以便AI系统能够理解超越简单列类型的上下文。仅仅为列添加描述是不够的;更健健的方法包括定义具有清晰业务术语、聚合规则和源映射的显式指标,以确保AI能够准确地检索和分析数据。

  4. TOOL · CL_214587 ·

    Trust Gateway 管道通过 12 级验证完善安全性

    Trust Gateway,此前被错误地标记为防火墙,现在是一个 12 级验证管道,旨在在任何阶段拒绝请求。它包含了提示注入检测规则和参数检查,尽管这些并未被呈现为完整的防御措施,而是一个隔离层。该系统已经过大量使用变异凭证的模糊测试,确保了拒绝而不会崩溃,并且基于属性的测试验证了规范化不变性。未来的更新将包括用于增强安全性的工具输出的执行后过滤和伪影摘要固定。

  5. TOOL · CL_202591 ·

    聊天机器人的LLM API成本:质量门槛优于令牌速率

    在为客户支持聊天机器人选择LLM API时,最具成本效益的选择取决于每条可接受答案或目录更新的最低成本,而不仅仅是宣传的令牌速率。这需要一个严格的测试过程,所有候选LLM处理相同的一组代表性数据,并根据预定义的质量门槛和模式要求验证其输出。最终决定应考虑成本、延迟、重试率以及生成结构化、可验证输出的能力,确保所选模型真正满足应用程序的特定需求和安全标准。

  6. TOOL · CL_201847 ·

    LLM结构化输出依赖JSON模式和验证器,而非提示

    为了提高LLM输出的可靠性,开发人员正在使用JSON模式和验证器来实现结构化输出契约。这种方法通过拒绝格式错误的响应并将验证错误反馈给模型进行纠正来强制执行数据完整性。关键策略包括使用枚举来限制文本字段,向LLM提供逐字错误消息,并将温度设置为零以最小化随机性,确保由验证器而非模型来决定真相。

  7. TOOL · CL_197605 ·

    LLM提取审计跟踪:版本化模型和跟踪人工更正

    第一篇文章讨论了对LLM提取进行版本化的重要性,以便准确地追溯错误。它强调存储API返回的确切模型标识符,而不仅仅是别名,并将解码参数(如temperature和max tokens)包含在版本戳中。第二篇文章详细介绍了如何为字段更正构建审计跟踪,重点关注捕获谁进行了更改、何时进行的以及他们查看了什么。它提出了一种结构化记录,包括稳定的审阅者ID、先前的值和来源,以及所审查内容的证据,并强调了数据完整性的仅追加方法。

  8. SIGNIFICANT · CL_147628 ·

    Kimi K3挑战前沿模型;GPT-5.6智能体导致数据丢失

    Moonshot AI发布了Kimi K3,一个拥有2.8万亿参数的模型,其能力可媲美顶尖西方AI,并已通过API提供服务,计划于7月开放权重。该模型在编码基准测试中表现出色,并展示了令人印象深刻的自主能力,例如设计芯片和编译GPU。与此同时,OpenAI的GPT-5.6在数学推理方面表现出先进能力,能够解决复杂的定理,但也引发了重大的安全担忧,因为其自主智能体在非沙盒环境中意外删除了用户文件。这凸显了先进AI智能体在应用层面安全方面…

  9. SIGNIFICANT · CL_148706 ·

    Moonshot 发布 Kimi K3;Google 延迟 Gemini 3.5 Pro;新工具提升 ARC-AGI 性能

    Moonshot 发布了 Kimi K3,这是一个拥有 2.8 万亿参数的多模态模型,具有 100 万 token 的上下文窗口,并针对更快的长上下文解码和代理编码进行了优化。据报道,Google 因性能问题(尤其是在编码方面)推迟了其 Gemini 3.5 Pro 模型,尽管该公司表示该模型仍在进行合作伙伴测试。此外,一个名为 Schema 的新工具已被开发出来,通过让模型根据游戏机制编写、测试和执行程序,来提高前沿模型在 ARC-…

  10. TOOL · CL_147288 ·

    新型“Schema”工具将ARC-AGI-3分数提升至99%,使用Claude Opus 4.8

    一款名为“Schema”的新型AI工具已被开发出来,它显著提高了在ARC-AGI-3基准测试上的性能。当与Anthropic的Claude Opus 4.8和Meta的Fable 5结合使用时,“Schema”在该基准测试上取得了99%的分数。另一项使用OpenAI的GPT-5.6 Sol模型的独立测试得分为95.35%。Schema的改进源于其在处理观察、测试预测和执行计划方面的新颖方法,而不是改变底层模型的权重。

  11. TOOL · CL_147368 ·

    Schema 框架声称在 ARC-AGI 3 基准测试中取得高分

    一个名为 Schema 的新框架已被推出,旨在评估大型语言模型。早期报告表明,Schema 在使用 Fable+4.8 和 GPT 5.6 Sol 等模型时,在 ARC-AGI 3 基准测试中分别取得了 99% 和 95.35% 的令人印象深刻的分数。然而,一项澄清表明这些分数是在公共数据集上取得的,在保留集上的表现仍有待观察。

  12. TOOL · CL_122790 ·

    AI代理的失败凸显了面向操作员设计的必要性

    一个用于法律合同提取的AI代理经历了三次不同的失败,揭示了“面向操作员”的设计超越了技术规范。最初的问题包括模式验证通过但数据不正确,以及重试循环生成看似合理但错误的默认值。最严重的失败源于分布变化,由于未见过的数据模式,该代理在处理收购子公司提供的合同方面表现不佳。解决方案包括将模式有效性与内容准确性分开,对内容提取失败实施人工审查,并在部署前使用操作员自己的数据建立基线准确性。

  13. TOOL · CL_89481 ·

    MLOps:用于模型稳定的条件化特征存储版本控制

    本文讨论了在特征存储模式演进时,在MLOps中保持模型稳定性的挑战。它强调了需要强大的版本控制策略,以防止模型因意外的模式更改而中断。作者提出了条件化特征存储版本控制作为一种解决方案,以确保模型保持功能性和可靠性。

  14. COMMENTARY · CL_62487 ·

    LLM结构化输出可能掩盖虚假数据,通过模式检查

    LLM的结构化输出模式可以通过生成看似合理但错误的值来掩盖数据提取错误,即使输出格式有效。这是因为模型可能会编造数据来满足模式要求,而不是表示不确定性或缺失信息。一种常见的失败模式是,当LLM提供一个完整、格式良好的JSON响应,其中包含编造的值(例如,一个不可能的分数)时,下游系统可能会将其作为事实摄取。