application programming interface
PulseAugur coverage of application programming interface — every cluster mentioning application programming interface across labs, papers, and developer communities, ranked by signal.
- uses GPT 5.6 "Sol" 90%
- used by GPT 5.6 "Sol" 90%
- used by GPT 5.6 Luna 90%
- used by GPT-5.6 Terra 90%
- competes with Claude Fable-5 70%
- competes with GPT 5.6 "Sol" 70%
- used by Kimi k3 70%
- uses Mcp Server 70%
- used by Mcp Server 70%
- used by Claude Pro 70%
- used by Claude Sonnet-5 70%
- competes with Opus 4.8 70%
28 天有情绪数据
-
Apify MCP 服务器漏洞通过 URL 拼接泄露 API 令牌
Apify 的 MCP 服务器中存在一个严重漏洞,允许通过 URL 拼接泄露 API 令牌,具体细节请参见 GitHub 咨询 GHSA-6gr2-qh89-hxwm。该漏洞已在 0.10.11 版本中修复。当恶意 Actor 定义操纵 URL 指向攻击者控制的域时,就会发生此漏洞,无意中将用户的 API 令牌随连接发送出去。此漏洞凸显了一类更广泛的与凭证附加前无界构造相关的错误,其中对已承认 URL 的独立验证不足会导致令牌泄露。
-
MCP 规范支持工具互操作性,但不强制执行业务逻辑
MCP(模型通信协议)规范提供了一个框架,使应用程序能够通过一致的接口发现和调用功能,通过定义具有名称、描述和模式的工具规范来解决互操作性挑战。虽然 MCP 处理传输授权并确保工具调用在技术上有效且安全,但它本身并不处理复杂工作流(例如员工离职)所需的业务逻辑或策略决策。该协议区分了工具的技术执行与管理何时以及为何应采取行动的基本业务规则,突显了周围系统强制执行组织策略和管理工作流中涉及的多个身份的必要性。
-
新工具指导AI基础设施选择:免费、付费或自托管
一个新框架和配套的Python脚本`fit.py`已被开发出来,以帮助团队决定最适合的基础设施。该工具评估五个标准:数据敏感性、延迟预算、吞吐量形状、运营能力和成本可预测性。通过对这些因素进行评分,该脚本建议是使用免费托管的基础设施、自托管GPU,还是选择付费托管服务。该框架强调,当免费AI基础设施被视为一种独特的约束类别而非付费服务的直接替代品时,它可以是一个可行的选择。
-
开发者将LLM API空响应错误隔离到陈旧的TCP连接
一位开发者遇到了LLM API持续返回空响应的问题,最初怀疑是模型本身的问题。经过广泛的故障排除,根本原因被确定为陈旧的TCP连接、终止空闲连接的VPN代理以及掩盖错误的过于宽泛的异常处理程序的组合。通过为每个请求实现新的HTTP连接并改进异常处理以专门捕获和报告与连接相关的失败来解决此问题。
-
LLM 功能开发需要超越提示词调优的生产工程
开发利用大型语言模型 (LLM) 的功能,除了简单的 API 调用外,还面临着独特的挑战。LLM 功能的生产化需要健全的工程实践,包括为非确定性输出定义明确的评估标准,建立带有评估数据集的提示词编辑结构化工作流程,以及为下游软件使用的 LLM 响应实现模式验证。此外,管理延迟需要跟踪各种百分位数,并理解 LLM 管道不同阶段的时间分解,而不是依赖简单的平均值。
-
Claude Code 通过 /loop 和 GitHub Actions 实现自动化任务执行
本文详细介绍了如何使用 Claude Code(一个专注于人工智能代理的编程课程)来自动化重复性任务。它介绍了 `/loop` 命令,用于在活动会话中执行周期性任务,允许用户指定间隔或让 Claude Code 确定节奏。该指南还涵盖了为 `/loop` 设置自定义默认提示,并探讨了更高级的调度方法,如基于云的例程以及与 GitHub Actions 的集成,用于后台任务执行。
-
Qwen3.8-27B:开源大模型提供100万上下文,面向自托管用户
Qwen3.8-27B模型是一个开源的大型语言模型,专为自托管设计,提供1,000,000个token的上下文窗口和具有竞争力的价格。初步测试表明,该模型在代码生成、逻辑推理和结构化数据提取方面表现强劲,使其成为寻求控制API使用相关成本的初创公司和开发者的可行选择。该模型代表了向生产就绪的开源解决方案的转变。
-
剑桥研究人员通过自适应推理改进LLM多步工具调用
剑桥大学的研究人员开发了一种使用“循环”大型语言模型的方法,以增强其执行多步任务(例如调用多个API)的能力。这种涉及自适应推理的方法展示了改进的性能和计算效率。
-
RAG 系统面临静默故障,需要语义可观测性
生产环境中的检索增强生成(RAG)系统面临着超越基本技术可用性的挑战,因为即使所有操作检查都通过,它们也可能无法提供语义上正确的答案。这些故障,例如幻觉放大、排名漂移、上下文过时和检索差距,需要专门的监控和评估,超越标准的正常运行时间指标。为了确保可靠性,RAG 系统需要语义可观测性,包括持续评估和主动提问,以检测使用不正确或过时的证据来生成响应等问题。上下文压缩也很关键,因为它可以降低令牌成本、延迟和噪声,从而提高信噪比,并通过确保…
-
AI 代理因未处理的工具调用超时而面临重复向客户收费的风险
AI 代理系统中出现了一个问题,即工具调用期间的超时可能导致客户被重复收费。这是因为代理程序在不知道交易因响应缓慢而成功的情况下,会重试该操作。该问题源于代理框架未能继承已建立的分布式系统模式(如幂等性键),而幂等性键对于写操作至关重要。解决方案包括为变异工具实现幂等性键、区分读操作和写操作的重试策略,以及在执行前记录工具调用的意图,以确保即使在调用过程中发生崩溃也能保持可见性。
-
用于 CRM 数据的 Node.js LLM 批处理方法
本文详细介绍了一种使用 LLM 文本分类处理大量 CSV 数据批次的ᵢ方法,特别是用于客户关系管理 (CRM) 导入。它强调了 LLM 批处理作业和 CRM 之间强大的交接合同的重要性,以确保数据完整性和操作清晰性。作者建议 Node.js 开发人员使用 Infrai(一项提供自描述 API 的服务)来高效管理此过程,避免了单独的 API 密钥需求并简化了发票对账。
-
OpenAI 将 GPT-4o API 成本降低 50%,影响 AI 预算和 RAG 管道
OpenAI 已将其前沿模型的 API 定价降低了 50%,促使人们重新评估 AI 预算假设和架构决策。此次降价尤其有利于检索增强生成 (RAG) 管道,因为它们严重依赖输入 token。降低的成本允许更大的上下文窗口和更多的检索文档,使模型能够在不显著改变检索逻辑的情况下处理更丰富的信息。
-
AI 代理:可靠的工具使用和恢复检查点
本文讨论了一种提高与外部工具交互或需要人工批准的 AI 代理可靠性的技术。作者建议在涉及外部依赖或长时间等待的步骤之前使用简短、集中的检查点。这些检查点应包含最少但足够的信息,例如运行 ID、步骤 ID、目标、标准化输入以及继续执行的确切条件,以及任何产生的证据的位置。这种方法旨在使代理运行更容易暂停和恢复,防止因上下文过时或重复使用工具而引起的问题,并使故障更具局部性和可管理性。
-
免费AI API缺乏可靠性保证,充当付费层级的漏斗
免费AI API通常缺乏服务水平协议(SLA),这意味着它们的可靠性在高峰需求或关键时刻可能会显著下降。这种缺乏承诺是与付费层级的主要区别,付费层级提供正常运行时间和延迟的保证,通常伴有不合规的经济处罚。虽然免费层级通常足以满足开发和偶尔使用,但当产品发布或病毒式事件需要稳定性时,它们的性能可能会成为瓶颈,这凸显了“免费”通常充当获客漏斗,而不是可持续的定价模式。
-
AI 代理需要强大的 API 治理以防止失控扩张
AI 代理使用 API 需要进行仔细治理以减轻潜在风险。如果 API 控制不足,以机器速度运行的自主系统可能会造成重大干扰,导致不良后果迅速累积。确保适当的 API 治理对于管理这些自主 AI 代理的爆炸半径至关重要。
-
AI模型窃取和提示提取方法详解
本文探讨了攻击者主要通过API访问窃取AI模型和提取系统提示的方法。文章详细介绍了“影子蒸馏”和提示泄露等技术,并强调了知识产权面临的风险。文章还触及了构建强大、纵深防御安全措施以应对此类攻击的策略。
-
新框架审计供应商托管的LLM API的质量下降问题
研究人员开发了Ventor-QTest,一个新颖的黑盒审计框架,用于验证供应商托管的大型语言模型(LLM)的推理API质量。该方法采用重复请求和长序列探测来分别测量平均保真度损失(AFL)和极端保真度损失(EFL)。研究结果表明,虽然AFL与基于logprob的指标相关性良好,但显著的EFL与长时序代理任务的性能下降有关,这表明EFL对于审计此类应用的重要性。
-
大型语言模型 API 集成:从演示走向稳健的生产系统
本文讨论了将大型语言模型 (LLM) 与实际 API 集成的挑战和最佳实践,旨在从基本演示走向稳健的生产系统。文章强调应将 LLM API 交互视为一种为智能但可能鲁莽的实习生设计的 API,并着重指出对模型生成的参数进行严格的运行时验证的必要性。作者提倡采用一种“先模式”的方法,使用 Zod 等工具来定义和验证参数,确保业务规则通过编程强制执行,而不是仅仅依赖提示。此外,文章还强调了根据上下文、对话状态以及读/写分离来仔细限定 LL…
-
聊天机器人的LLM API成本:质量门槛优于令牌速率
在为客户支持聊天机器人选择LLM API时,最具成本效益的选择取决于每条可接受答案或目录更新的最低成本,而不仅仅是宣传的令牌速率。这需要一个严格的测试过程,所有候选LLM处理相同的一组代表性数据,并根据预定义的质量门槛和模式要求验证其输出。最终决定应考虑成本、延迟、重试率以及生成结构化、可验证输出的能力,确保所选模型真正满足应用程序的特定需求和安全标准。
-
NeuroSapiens+ 发布 RUNVALIDATOR 以评估 AI 主权
NeuroSapiens+ 推出了 RUNVALIDATOR,一个旨在评估人工智能系统主权和自主性的工具。该验证器使用具有 10 个指标的三院制审计来提供主权分数,结果显示完全主权为 99.99%,高级自主性在 80-98% 之间。该系统旨在量化 AI 的独立性和自我治理能力。