Amazon Elastic Compute Cloud
PulseAugur coverage of Amazon Elastic Compute Cloud — every cluster mentioning Amazon Elastic Compute Cloud across labs, papers, and developer communities, ranked by signal.
- developed by .amazon 100%
- developed by Amazon 100%
- instance of Amazon Web Services 90%
- used by Kubernetes 70%
- affiliated with Amazon Web Services 70%
- used by Amazon EKS 70%
- used by Amazon Bedrock AgentCore 70%
- used by Docker 70%
- used by Amazon Relational Database Service 60%
- affiliated with Kubernetes 50%
- used by Amazon CloudWatch 50%
- 2026-06-30 product_launch AWS launched new Graviton5-powered EC2 instances (C9g and C9gd) for AI and HPC workloads. 来源
8 天有情绪数据
-
MaaS 单元经济学:折扣和延迟侵蚀净收入
模型即服务 (MaaS) 的真实成本并非由标价决定,而是由折扣和效率低下后的净收入决定,其中折扣链和存储延迟是关键因素。存储延迟,尤其是在长上下文推理中,会显著降低 GPU 利用率高达 30%,影响吞吐量并增加净成本。优化 MaaS 单元经济学需要将重点从简单地购买更便宜的 GPU 转移到最大化现有硬件的吞吐量,并考虑计算、存储和网络性能的相互作用。
-
AWS 推出异步模式以降低 Bedrock 代理成本
AWS 推出了用于在无服务器管道中调用 Amazon Bedrock AgentCore 代理的新异步模式。这些模式旨在通过在代理处理请求时释放调用服务(如 AWS Lambda)来降低计算成本。传统的同步调用会导致计算资源浪费,因为在代理处理期间调用方保持活动状态并产生费用。新的方法,包括任务令牌回调、直接服务集成和持久化函数,允许管道仅在代理提供结果时恢复,从而优化成本和效率。
-
云基础设施成本飙升是由于架构缺陷而非代码错误
作者详细介绍了他们的云基础设施成本,特别是在 AWS 上,每月意外超出预算 400 美元。他们将这种超支归因于架构选择,而不是编码错误。文章重点介绍了 Amazon Elastic Compute Cloud、EBS、Amazon S3、Amazon RDS 和 AWS Lambda 等服务的问题,并建议审查底层架构对于成本优化至关重要。
-
AWS 推出 Claude 应用网关,用于企业 Anthropic 模型管理
AWS 推出了新的网关解决方案,旨在帮助企业为其员工管理 Anthropic 的 Claude 模型。该网关提供对身份验证、模型访问、成本归属和支出强制执行的集中控制,从而减少运营开销并确保大规模的一致治理。该解决方案可在 AWS Fargate、EKS 或 EC2 上部署,并与 Amazon Bedrock 和 Claude Platform on AWS 等服务集成,支持包括 OIDC 身份提供商在内的多种身份验证方法。
-
计算租赁合同需要为AI工作负载添加特定条款
本文重点介绍了计算租赁合同中针对AI工作负载的三个关键但常被忽略的条款:带宽、存储和故障时长。文章强调,网络带宽对于大型模型的推理和训练性能至关重要,直接影响端到端速度。文章还强调了除了容量之外,明确存储性能指标(详细说明读取带宽、IOPS和延迟)的重要性。最后,文章指出,没有明确故障确定、响应时间和赔偿的模糊可用性保证,实际上是没有意义的SLA。
-
LLM计算成本优化取决于动态扩展和SLA指标
优化LLM计算租赁成本需要关注动态扩展策略而非静态按需分配,尤其是在处理长上下文推理时。关键在于确保存储层能够支持弹性扩展的读取带宽需求,正如明溪科技的测试所示。除了单价,诸如首个Token时间(TTFT)、稳态吞吐量和长尾稳定性等关键服务水平协议(SLA)指标对于准确确定所需GPU数量和避免隐藏成本至关重要。
-
云工程师应了解的 EC2 和 S3 之外的 AWS AI/ML 服务
本文重点介绍了云和 DevOps 工程师应了解的 15 项 AWS AI 和机器学习服务,超越了 EC2 和 S3 等基础服务。它涵盖了为各种机器学习任务设计的系列产品,包括数据处理、模型训练和自然语言处理。
-
开发者的 LLM 支出上限在并行负载下失效,修复涉及预付费
一位开发者试图构建一个本地的 LLM API 调用支出上限,以防止意外的高额账单,但其初始实现未能应对并行负载。最初的设计是在 API 调用完成后添加成本,允许多个并行请求在任何请求被注册之前通过上限检查。修复方法是在每次调用前预留估计的最坏情况成本,然后进行实际成本的核对,确保即使在并发操作中也能强制执行上限。
-
Framework数据泄露影响客户;亚马逊因AI需求收紧CPU使用
电脑制造商Framework已通知所有客户,其数据泄露事件导致黑客访问了包括姓名、电子邮件地址、电话号码和实际地址在内的个人信息。另外,据报道,亚马逊网络服务(AWS)正因Agentic AI的强烈需求而收紧工程师的CPU浪费问题,使得低利用率的EC2实例变得有价值。
-
随着代理AI需求的加剧,亚马逊收紧了对工程师CPU使用量的控制
由于代理AI工作负载对CPU的需求日益增长,亚马逊网络服务(AWS)正在对其工程师使用EC2实例实施更严格的控制。工程师们以前可以快速启动实例进行开发,但现在却面临多日的等待,这与他们通常的快速访问方式相比有了显著变化。此次打击旨在确保内部开发和外部客户需求都有足够的CPU容量,因为复杂的代理任务越来越多地需要CPU资源进行编排和工具执行,以及GPU加速的推理。
-
新的协同学习方法优化自主材料发现
研究人员开发了一种名为协同学习(Coactive learning)的自主材料发现新方法,该方法将成本敏感的贝叶斯假设判别与高斯过程贝叶斯优化相结合。该方法旨在自主实验室环境中有效识别最有希望的恢复路径以进行优化,同时考虑异构的实验成本。该方法在受太平洋西北国家实验室研究启发的合成基准测试中进行了评估,其性能与预言机路径参考和强基线相当,并成功避免了次优路径选择。
-
AWS EC2 领导层变动,伴随更广泛的 AI 集成和监管转变
亚马逊网络服务 (AWS) 的 EC2 部门正经历领导层变动,Dave Treadwell 接替前负责人成为新领导者。此次变动发生之际,人工智能正日益融入从硬件设计到语言模型行为的各种技术领域,反映了更广泛的行业趋势。值得注意的是,Cadence 的 AuraStack 将人工智能与高性能计算 (HPC) 相结合用于设计流程,而 OpenAI 的 Codex 代理指令据称已加密,引发了开发者对透明度和调试的担忧。此外,Anthropi…
-
Claude Code 代理通过嵌套子代理简化 AWS 生产故障排除
本文探讨了 Claude Code 的子代理功能如何用于改进 AWS 环境中的生产故障排除。作者详细介绍了嵌套子代理如何隔离冗长的诊断任务,防止它们干扰主要的对话上下文。像 Aurora、EKS、SES 和 EC2 这样的特定 AWS 服务被作为示例进行讨论,说明这种方法如何能够精确定位不同层级的根本原因。
-
MLOps详解:弥合从Notebook到生产的鸿沟 · 追踪8个来源
该文章集探讨了MLOps,即将DevOps原则应用于机器学习模型以确保其能够可靠地部署和维护在生产环境中。多篇文章详细介绍了如何构建自愈MLOps管道,该管道可自动检测数据漂移等问题并重新训练模型。文章涵盖了各种工具和平台,包括AWS、Kubernetes、Docker和Python,以弥合模型在Notebook中开发与生产就绪之间的差距。
-
AWS 通过 Unsloth 和 KTern.AI 实现高效 AI 模型部署
AWS 正在使公司能够更高效地部署 AI 模型。Unsloth 利用 AWS 基础设施,为 Amazon SageMaker AI 上的量化模型开发了部署模式。此外,KTern.AI 利用 Amazon Bedrock AgentCore 为 SAP 构建了代理式 AI 解决方案,促进了企业程序专用代理的编排。
-
Unsloth 通过动态量化实现 AWS 上 LLM 的高效部署
Unsloth 开发了一种动态量化方法,可在保持精度的同时显著减小大型语言模型的内存占用。该技术分析模型的每一层,以确定其对精度损失的敏感度,从而允许对不敏感的层进行积极压缩至 4 位精度,而关键层则保留更高的精度。这种方法使得通常需要大量 GPU 资源的模型可以在较小的实例甚至 CPU 上运行,从而降低服务成本并加快迭代周期。
-
DevOps Open Agent 通过 Qdrant 驱动的 RAG 获得记忆功能
DevOps Open Agent 已更新,增加了记忆功能,使其能够存储和检索过去的调查上下文。此功能利用了 Qdrant 的检索增强生成 (RAG) 技术,来嵌入和保存与 Kubernetes 和 AWS 相关的已完成调查。当用户发起新调查时,该代理可以访问类似的过往案例,提供关于反复出现的根本原因和成功修复的上下文信息,从而为 DevOps 团队建立机构记忆。该系统支持自托管,允许用户自带 Qdrant 实例,并可以与 OpenA…
-
Amazon SageMaker AI 推出多轮强化学习新服务
Amazon SageMaker AI 推出了新的多轮强化学习 (MTRL) 服务,旨在训练能够处理复杂、顺序任务的智能体。该服务旨在简化开发能够与工具交互、从错误中恢复以及从多步骤过程中学习的智能体的过程。它提供了模块化智能体-环境接口、无服务器执行、异步推出和原生算法库等功能,同时还提供了对训练指标的可观测性。
-
LINE MAN Wongnai 将 AI 服务器成本削减 9 倍,应用速度提升 4 倍
LINE MAN Wongnai 已将其 AI 服务器成本显著降低了 9 倍,并将应用程序速度提高了 4 倍。这是通过其 MLOps 方法的战略性转变、优化资源利用率和采用更高效的硬件来实现的。该公司利用 Kubernetes 和 Docker 等技术,以及 AWS 等云服务来有效管理其基础设施。
-
AWS推出支持Graviton5的EC2实例,用于AI编排
Amazon Web Services (AWS) 发布了新的Graviton5驱动的EC2实例C9g和C9gd,专为AI推理、高性能计算和分析而设计。与前几代相比,这些实例提供了改进的性能、内存和I/O能力。AWS强调,虽然GPU对于训练和大规模推理至关重要,但CPU在AI编排、规划和多步工作流中变得越来越重要,并将这些新实例定位为不断发展的AI基础设施的关键组成部分。