bedrock
PulseAugur coverage of bedrock — every cluster mentioning bedrock across labs, papers, and developer communities, ranked by signal.
- used by Bifröst 90%
- acquired by Helicone 90%
- uses Bifröst 90%
- used by Portkey 70%
- used by Claude Opus-5 70%
- used by Google Cloud Vertex AI 70%
- used by Nexus Labs 70%
- used by Helicone 60%
- competes with Google Cloud Vertex AI 60%
- affiliated with Portkey 50%
- affiliated with Bifröst 50%
- competes with FinOps 50%
12 天有情绪数据
-
Anthropic 修复了美国境内 Claude 推理成本的 10% 低估问题
Anthropic 已将其 Claude Code CLI 更新至 2.1.239 版本,解决了导致美国境内工作空间推理成本被低估 10% 的错误。此修复确保 CLI 准确反映 Anthropic 对 Claude Opus 5 及更高版本模型在美国境内推理收取的 1.1 倍溢价。此更改会影响成本估算、状态行和预算上限,可能导致那些工作空间在未明确配置的情况下自动迁移到美国境内推理的用户收到高于预期的账单。
-
Microsoft Foundry 和 Amazon Bedrock 集成以实现多层云路由
本文详细介绍了 Microsoft Foundry 和 Amazon Bedrock 这两个主要云服务提供商的集成。它描述了一个促进这些平台之间路由的系统的创建,从而实现了多层云服务的方法。该实现使用 C# 作为编程语言。
-
Claude Code 与 AI 网关集成需要特定配置
一篇技术指南详细介绍了如何配置 Claude Code 以便与 AI 网关协同工作,解决了在使用标准 OpenAI 兼容端点时出现的各种问题。文章解释说,Claude Code 需要一个原生的 Anthropic Messages API 端点,而不仅仅是 OpenAI 的聊天补全代理,才能正确处理工具使用和提示缓存。它提供了正确网关集成所需的四个特定环境变量,其中包括两个未公开的变量,用于禁用实验性功能和交错思考,这可能导致与 Be…
-
Anthropic 的 ARR 转向间接渠道,影响收入模式 · 已追踪 4 个来源
Anthropic 越来越依赖间接收入渠道,到 2026 年第二季度,其年经常性收入 (ARR) 的 40% 以上来自 Amazon Bedrock、Google 的 Gemini Agent Enterprise 和 Microsoft Azure Foundry 等平台。这一转变意义重大,因为间接收入的变现方式与直接销售不同,会影响利润率。虽然这些合作伙伴关系降低了 Anthropic 的直接销售人员成本并利用了超大规模云服务商的…
-
Kubernetes 和 Envoy AI Gateway 简化 AI 工作负载管理
文章讨论了 MLOps 的实现和架构,重点关注使用 Kubernetes 运行大规模 AI 工作负载。关键主题包括在 Kubernetes 上使用 KServe 进行模型服务,以及开发 Envoy AI Gateway 作为管理各种 LLM 流量的解决方案。Envoy AI Gateway 旨在通过抽象 API 调用、计费和响应流的差异,来标准化与 OpenAI、Anthropic 和 Bedrock 等不同 LLM 提供商的交互。
-
用户报告称Amazon Bedrock模型访问与直接API不同
一位用户在使用Amazon Bedrock访问AI模型时遇到了意外行为,并注意到与直接API访问相比存在差异。特定的模型版本可用,但缺少一个必需的参数。此外,响应模式也不同,导致了JSON解析错误。这表明,根据托管层不同,对模型的访问及其功能的完整性可能有所不同。
-
AWS Bedrock 预置吞吐量:成本计算指南
Amazon Bedrock 提供预置吞吐量选项,用于专用的模型容量,按小时计费而非按 token 计费。这种固定容量模型对于自定义模型是必需的,但不支持批量推理或推理配置文件。为了确定预置吞吐量是否具有成本效益,用户必须从其 AWS 客户经理处获取特定的、未公开的详细信息,包括每个模型单元的每小时价格以及模型单元每分钟可以处理的输入/输出 token 数。
-
开发者的 LLM 支出上限在并行负载下失效,修复涉及预付费
一位开发者试图构建一个本地的 LLM API 调用支出上限,以防止意外的高额账单,但其初始实现未能应对并行负载。最初的设计是在 API 调用完成后添加成本,允许多个并行请求在任何请求被注册之前通过上限检查。修复方法是在每次调用前预留估计的最坏情况成本,然后进行实际成本的核对,确保即使在并发操作中也能强制执行上限。
-
AI代理需要仔细选择API操作以实现安全有效的利用
AI代理与API交互的能力取决于仔细选择其可访问的操作。虽然将代理连接到API在技术上很简单,但关键的挑战在于定义适当的权限。这需要考虑各种因素,以确保代理能够有效且安全地使用API。
-
MCP 工具更新检测到昂贵的 AI 代理重试循环
MCP(模型通信协议)工具的新版本 v0.6.1 已发布,以解决重复工具失败未被正确检测导致 AWS Bedrock 等平台成本膨胀的问题。先前版本错误地将工具错误标记为成功操作,导致 AI 代理多次重试同一失败任务。此次新版本引入了“卡顿检测”功能,用于识别和标记这些重试循环,提供有关浪费的 token、成本和持续时间等指标,并提供特定的指纹来对相似的失败进行分组。
-
Claude Code的免费语音听写功能挑战付费替代品
语音编码工具正变得越来越复杂,从简单的听写发展到合成代理回复。Claude Code 提供免费的内置语音命令功能,对于主要使用该平台的大多数开发者来说已经足够。然而,对于需要在多个应用程序中进行语音听写或需要语音编辑等高级功能的用户,Wispr Flow 等付费工具提供更广泛的覆盖范围和每月无限次使用。
-
RAG 助手 bug:LLM 不应计数,应由数据库计数
一位用户在使用为文档搜索设计的检索增强生成 (RAG) 助手时遇到了一个问题。当被要求计算特定人员撰写的文档数量时,该助手给出了一个不正确且偏低的数字,因为它只计算了过滤和去重后的可见结果,而不是数据库中的实际总数。这是因为一个单一的状态字段被用来存储数据库的总计数和 UI 显示的计数,导致后者覆盖了前者。修复方法是引入一个单独的、不可变的字段来保存权威的数据库计数,确保 LLM 只叙述记录系统提供的数字。
-
亚马逊第二季度利润因Anthropic投资收益增长534亿美元
亚马逊报告称,其2026年第二季度净收入大幅增长,这主要得益于其对Anthropic投资的534亿美元未实现收益。这笔账面收益是其股份的重新估值,而非实际收入,其金额远超公司营业收入和去年利润。尽管发生了这一会计事件,亚马逊也强调了其持续的战略合作,包括为Anthropic和OpenAI等AI实验室提供云服务和Trainium芯片,并扩展其Bedrock服务以支持新模型。
-
开发者使用新颖的测试方法对 Qwen3.6-27B 模型进行量化
一位开发者创建了一个工具,可以系统地测试量化大型语言模型中各个权重组的影响,从而超越了传统的“凭感觉”方法。测试表明,模型大小并不能预测压缩容忍度,并且当量化过于激进时,工具调用能力会首先下降。基于这些发现,Qwen3.6-27B 模型发布了三个版本:Bedrock(最接近原始版本)、Tightrope(平衡版)和 Gambit(激进版,占用空间最小)。
-
分析发现,人工智能支出由少数重度用户驱动,而非需求骤降 · 跟踪 6 个来源
最近的一项分析表明,虽然企业人工智能支出是真实的,“需求骤降”的说法是不准确的。相反,重点在于分配,一小部分高使用率客户为 OpenAI 和 Anthropic 等公司贡献了大部分收入。正在实施控制措施,例如禁用快速模式和默认使用成本较低的模型,目前编码应用程序占 OpenAI 和 Anthropic 两家公司收入的 70% 以上。
-
OpenAI 的 GPT-5.6 Luna 为常规 AI 任务提供价值层
OpenAI 推出了 GPT-5.6 Luna,定位为价值层模型,用于常规任务,其每 token 成本显著低于同类模型。该模型专为有界工作设计,如分类、摘要和简单的代码编辑,旨在通过使频繁运行更经济来减少使用 AI 代理时的犹豫。另一方面,Terra 被定位为交互式和代码密集型任务的平衡默认选项,在价格更高的情况下,性能略有提升。Sol 仍然是复杂、高风险操作的高级选项,其高级功能证明了其成本的合理性。
-
AWS LLM 托管:Bedrock、SageMaker 与自托管成本对比
对在 AWS 上运行大型语言模型 (LLM) 的比较显示,Bedrock、SageMaker Endpoints 和 EKS 上的自托管解决方案在成本和运营方面存在不同的权衡。对于客户服务聊天等低流量、高质量的任务,Bedrock 的按 token 付费模式提供了简洁性和速度。然而,对于分类或嵌入等高流量、成本敏感的任务,使用 vLLM 在 EKS 上结合 GPU spot 实例自托管 LLM 更具经济效益,预计在每天 10,000-…
-
Nous Research 发布 Hermes AI 代理,支持 20 多个聊天平台
Hermes 是 Nous Research 推出的一个开源 AI 代理运行时,允许用户在 20 多个不同的聊天应用程序中控制一个单一的、持久的代理。这个自托管系统(当前版本为 0.18.2)使用户能够从任何连接的平台(如 Telegram、Slack、Discord 和 WhatsApp)发出命令,而无需重复身份验证或会话管理。Hermes 支持来自不同提供商的 300 多个模型,但其多步工具工作流需要至少 64K tokens 的上下文窗口。
-
金融科技开发者构建自定义LLM网关以保护AWS Bedrock访问
一家金融科技公司的开发人员构建了一个自定义LLM网关,以管理内部对AWS Bedrock的访问,避免了直接分发AWS凭证的风险。该网关向团队发放唯一密钥,允许对模型访问和令牌预算进行细粒度控制。这种方法将敏感数据保留在公司网络内,并为财务报告提供清晰的使用跟踪,解决了直接IAM凭证分发和共享密钥的局限性。
-
AWS 安全 AI:三种适用于不同工作流的架构
AWS 安全团队可以根据具体工作流,利用三种不同的架构模式来实现 AI 辅助调查。对于 AWS 安全发现的实时交互式分析,AWS 托管 MCP 结合 Claude Code 或 Codex 等工具,可提供对 AWS API 的只读访问。在分析预先存在的安全报告时,自定义 MCP 方法适用于处理存储在 Amazon S3 中的数据。对于自动化、计划性的报告生成,AWS Lambda、boto3 和 Bedrock 的组合提供了一条确定的…