Amazon Elastic Compute Cloud
PulseAugur coverage of Amazon Elastic Compute Cloud — every cluster mentioning Amazon Elastic Compute Cloud across labs, papers, and developer communities, ranked by signal.
- developed by .amazon 100%
- developed by Amazon 100%
- instance of Amazon Web Services 90%
- affiliated with Amazon Web Services 70%
- used by Amazon Relational Database Service 70%
- used by Kubernetes 70%
- used by Amazon EKS 70%
- used by Amazon CloudWatch 70%
- used by Amazon Bedrock AgentCore 70%
- used by Docker 70%
- used by DeepSeek-32B 60%
- used by DeepSeek 70B 60%
- 2026-06-30 product_launch AWS launched new Graviton5-powered EC2 instances (C9g and C9gd) for AI and HPC workloads. 来源
7 天有情绪数据
-
AWS详解面向制造业的事件驱动机器学习训练基础设施
研究人员详细介绍了为期三年的运营经验,该经验涉及一个为汽车制造业中持续机器学习训练而设计的事件驱动云基础设施。该系统跨多个工厂编排了专业模型对的GPU加速训练,包括一个物理预测模型和一个强化学习控制策略。通过将Amazon ECS与EC2 GPU容量、SQS消息传递和由准入控制的Lambda调度器集成,该架构在超过40,000个生产训练作业的基础上,与始终开启的GPU基础设施相比,成本降低了72-78%。研究人员还发布了经验教训和开源…
-
模型上下文协议(MCP)提供增强的AI洞察力,但会增加Token成本
由Anthropic推出、OpenAI支持的模型上下文协议(MCP)允许AI代理访问外部工具和实时数据,以获得更具体、更有用的响应。虽然MCP增强了AI代理的能力,特别是对于像分析云支出这样的FinOps任务,但它也带来了一个权衡:增加的上下文可能导致更高的Token使用量和相关成本。为了管理这一点,系统应采用选择性的工具和数据加载,确保只为给定任务激活必要的上下文,而不是用所有可用信息压倒AI。
-
2026年顶级RunPod替代品GPU计算评测
本文评测了2026年10款RunPod的替代品,适用于GPU计算,重点关注训练、推理和通用计算需求。文章比较了Lambda Labs、CoreWeave、Amazon Elastic Compute Cloud、Google Cloud和Azure等提供商在定价、可用性、无服务器推理能力、存储和可靠性方面的表现。
-
AWS Bedrock AgentCore 推出 Runtime Instances,支持长时间运行的多代理工作流
AWS 为其 Amazon Bedrock AgentCore 推出了新的计算选项 Runtime Instances,专为持久化、长时间运行的多代理工作流而设计。与无服务器微虚拟机不同,Runtime Instances 利用托管的 EC2 基础设施来支持多天会话、GPU 和共享文件系统,使多个代理能够协作完成复杂任务。这项新功能通过一个涉及三个专业代理的音乐制作流水线得到演示:一个负责作曲和音频生成,另一个负责交付和音频工程,第三…
-
通过个体服务学习 AWS
该条目讨论了个人通常如何通过专注于 EC2、S3 和 RDS 等个体服务来学习 Amazon Web Services (AWS)。它表明这种方法对于理解云计算平台的架构和功能很常见。
-
MCP Python SDK 从 1.x 更新至 2.x,需要服务器迁移
MCP Python SDK 已从 1.x 版本(FastMCP)更新至 2.x 版本(MCPServer),现有 Python MCP 服务器需要进行迁移。此次更新包括将 FastMCP 重命名为 MCPServer,并对 API 进行更改,涉及传输机制和依赖项。开发者需要更新代码以使用新 SDK,或将项目固定到旧版本以保持兼容性。迁移过程涉及识别受这些更改影响的代码(如工具定义和传输协议),并调整依赖项(如将 httpx 更改为 …
-
通过优化数据传输效率降低GPU计算租赁成本
本文讨论了优化GPU计算租赁中的数据传输效率,这是降低AI工作负载成本和提高性能的关键因素。文章强调,GPU计算通常按小时计费,数据加载瓶颈成为一项重大的隐藏成本。文章提出了三种优化策略:通过从传统的网络文件系统(NFS)迁移到NVMe-oF全闪存阵列来增强存储架构;利用RDMA等网络协议绕过CPU和操作系统开销;以及实施缓存分层,将频繁访问的数据移近GPU。
-
云计算成本优化:按需与动态扩展策略
AI工作负载的云计算成本优化涉及按需分配与动态扩展之间的战略选择,具体取决于工作负载模式和服务水平协议(SLA)。按需分配最适合稳定、对延迟敏感的生产任务,而动态扩展则更适用于需求波动的推理工作负载。GPU实例在Amazon Web Services、Microsoft Azure和Google Cloud等提供商之间的定价,以及模型加载时间等因素,显著影响最佳策略。例如,在华为Ascend等平台上更快的模型加载可以提高动态扩展策略对…
-
AWS MCP Suite 支持通过自然语言管理云基础设施
AWS MCP Suite 是一款新工具,允许用户通过 Claude 或 Cursor 等 AI 代理使用自然语言提示来管理其 AWS 云基础设施。该套件与 EC2、DynamoDB、S3、Lambda 和 RDS 等核心 AWS 服务集成,并利用现有的 IAM 权限来确保安全。它通过将对话式命令转换为 API 调用,简化了基础设施审计、数据库操作和 CI/CD 管道管理等复杂任务。
-
AI 测试组织 METR 因 API 密钥被盗损失 60 万美元模型积分
AI 模型测试组织 METR 披露了今年早些时候发生的两次安全事件。在第一次事件中,一名攻击者窃取了一个 API 密钥,并在三周内消耗了价值约 60 万美元的公共模型积分。这是由于一名研究人员的公共实例暴露了 API 密钥,攻击者通过搜索高信号关键词找到了它。第二次事件涉及攻击者探测 METR 的基础设施并试图获取内部数据。
-
Musl C 库显示出显著的性能问题,影响 Rust 应用
最近的一项分析强调,在使用 musl C 库时会出现显著的性能回归,尤其是在 Rust 应用程序中。作者发现,与 mimalloc 或 jemalloc 等替代品相比,musl 的默认内存分配器速度明显较慢,即使使用优化的分配器,性能也会下降高达 26%。这种性能差距在各种任务中持续存在,一些内存密集型例程显示出更大的比例减速。因此,作者建议避免在性能关键型应用程序中使用 musl,并且将从他们自己的项目 Bifrost 中移除它作为预构建选项。
-
AWS、NVIDIA 和 Heidi Health 将 ASR 推理成本降低 75%
AWS、NVIDIA 和 Heidi Health 合作,在 Amazon EC2 实例上将自动语音识别 (ASR) 推理成本降低了 75%。通过实施 NVIDIA MPS 和 NVIDIA Triton 推理服务器,他们实现了所需 GPU 实例数量的 75% 的降低,从 16 个减少到 4 个,同时保持了亚秒级延迟。这种优化解决了 ASR 中每个请求的 GPU 利用率低的问题,而传统的 CUDA 时间切片会导致大量硬件容量闲置。
-
MaaS 单元经济学:折扣和延迟侵蚀净收入
模型即服务 (MaaS) 的真实成本并非由标价决定,而是由折扣和效率低下后的净收入决定,其中折扣链和存储延迟是关键因素。存储延迟,尤其是在长上下文推理中,会显著降低 GPU 利用率高达 30%,影响吞吐量并增加净成本。优化 MaaS 单元经济学需要将重点从简单地购买更便宜的 GPU 转移到最大化现有硬件的吞吐量,并考虑计算、存储和网络性能的相互作用。
-
AWS 推出异步模式以降低 Bedrock 代理成本
AWS 推出了用于在无服务器管道中调用 Amazon Bedrock AgentCore 代理的新异步模式。这些模式旨在通过在代理处理请求时释放调用服务(如 AWS Lambda)来降低计算成本。传统的同步调用会导致计算资源浪费,因为在代理处理期间调用方保持活动状态并产生费用。新的方法,包括任务令牌回调、直接服务集成和持久化函数,允许管道仅在代理提供结果时恢复,从而优化成本和效率。
-
云基础设施成本飙升是由于架构缺陷而非代码错误
作者详细介绍了他们的云基础设施成本,特别是在 AWS 上,每月意外超出预算 400 美元。他们将这种超支归因于架构选择,而不是编码错误。文章重点介绍了 Amazon Elastic Compute Cloud、EBS、Amazon S3、Amazon RDS 和 AWS Lambda 等服务的问题,并建议审查底层架构对于成本优化至关重要。
-
AWS 推出 Claude 应用网关,用于企业 Anthropic 模型管理
AWS 推出了新的网关解决方案,旨在帮助企业为其员工管理 Anthropic 的 Claude 模型。该网关提供对身份验证、模型访问、成本归属和支出强制执行的集中控制,从而减少运营开销并确保大规模的一致治理。该解决方案可在 AWS Fargate、EKS 或 EC2 上部署,并与 Amazon Bedrock 和 Claude Platform on AWS 等服务集成,支持包括 OIDC 身份提供商在内的多种身份验证方法。
-
计算租赁合同需要为AI工作负载添加特定条款
本文重点介绍了计算租赁合同中针对AI工作负载的三个关键但常被忽略的条款:带宽、存储和故障时长。文章强调,网络带宽对于大型模型的推理和训练性能至关重要,直接影响端到端速度。文章还强调了除了容量之外,明确存储性能指标(详细说明读取带宽、IOPS和延迟)的重要性。最后,文章指出,没有明确故障确定、响应时间和赔偿的模糊可用性保证,实际上是没有意义的SLA。
-
LLM计算成本优化取决于动态扩展和SLA指标
优化LLM计算租赁成本需要关注动态扩展策略而非静态按需分配,尤其是在处理长上下文推理时。关键在于确保存储层能够支持弹性扩展的读取带宽需求,正如明溪科技的测试所示。除了单价,诸如首个Token时间(TTFT)、稳态吞吐量和长尾稳定性等关键服务水平协议(SLA)指标对于准确确定所需GPU数量和避免隐藏成本至关重要。
-
云工程师应了解的 EC2 和 S3 之外的 AWS AI/ML 服务
本文重点介绍了云和 DevOps 工程师应了解的 15 项 AWS AI 和机器学习服务,超越了 EC2 和 S3 等基础服务。它涵盖了为各种机器学习任务设计的系列产品,包括数据处理、模型训练和自然语言处理。
-
开发者的 LLM 支出上限在并行负载下失效,修复涉及预付费
一位开发者试图构建一个本地的 LLM API 调用支出上限,以防止意外的高额账单,但其初始实现未能应对并行负载。最初的设计是在 API 调用完成后添加成本,允许多个并行请求在任何请求被注册之前通过上限检查。修复方法是在每次调用前预留估计的最坏情况成本,然后进行实际成本的核对,确保即使在并发操作中也能强制执行上限。