Amazon EKS
PulseAugur coverage of Amazon EKS — every cluster mentioning Amazon EKS across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
Argus 系统预测云中断以节省训练进度
研究人员开发了 Argus,这是一个 Kubernetes 运算符,旨在减轻在 Amazon EKS 等云平台上进行训练时的数据丢失。该系统旨在预测和处理 EC2 Spot 实例等服务的服务中断,这些服务可能会在短时间内被收回。在 CIFAR-10 测试平台上进行的实证研究表明,Argus 可以成功地检查点并恢复训练,只丢失正在进行的 epoch,从而在昂贵的、多节点的训练作业中保留大量进度。
-
AWS 和 NVIDIA 通过 S3 Vectors 集成增强 AI 代理记忆
AWS 和 NVIDIA 合作增强了 AI 代理的记忆能力。NVIDIA NeMo Agent Toolkit (NAT) 现在可以与 Amazon Simple Storage Service 的一项功能 Amazon S3 Vectors 集成,为 AI 代理提供持久且可扩展的记忆。此次集成允许在 Amazon EKS 上部署以进行操作控制,从而高效地存储和检索对话历史、用户偏好和其他关键数据。
-
AWS 详解 Anthropic 的 Claude 平台多环境访问
Amazon Web Services (AWS) 详细介绍了一种在 AWS 上为 Claude 平台 (CPonAWS) 实现多环境访问的方法。该方法允许从 AWS 上的生产工作负载、用于本地迭代的开发者笔记本电脑以及其他云提供商或本地 CI/CD 管道上的外部服务进行推理。该设置涉及在组织内设立一个专门的 AI 服务账户来管理 CPonAWS 订阅,并为每个环境提供不同的身份验证方法,包括跨账户 SigV4 用于 AWS 工作负载…
-
uniopen 微调 Amazon Nova 2 Lite 以用于零售内容审核
来自台湾统一集团的零售平台 uniopen 已为其特定的内容审核需求调整了 Amazon Nova 2 Lite。该公司利用 Amazon SageMaker 上的监督微调,使其模型符合其分类用户交互的独特政策。该过程涉及一个强大的数据纠正、训练、评估和部署工作流程,通过对模糊案例和纠正强制进行人工审查来确保负责任的 AI 实践。
-
OpenAI 指导 AI 业务价值;NVIDIA 增强 AWS 上的 PyTorch 训练
OpenAI 发布了一份指南,介绍如何将 AI 使用与业务价值联系起来,详细说明 ChatGPT Work 和 Codex 分析如何帮助团队了解其 AI 采用和支出。另外,NVIDIA 推出了其 Resiliency Extension (NVRx) 用于 Amazon EKS 上的 PyTorch FSDP 训练,从而能够更快地从 GPU 故障中恢复。在不相关的消息中,经典 PlayStation 游戏的复制钥匙扣现已在北美扭蛋机中发售。
-
NVIDIA NVRx 增强 Amazon EKS 上的分布式 AI 训练容错能力
NVIDIA 推出了 NVRx,这是一个 Python 库,旨在增强 Amazon EKS 上大规模分布式 AI 训练的容错能力。NVRx 与 PyTorch 的 Fully Sharded Data Parallel (FSDP) 集成,支持异步检查点,将 I/O 操作与训练重叠,从而显著减少空闲时间。它还提供进程内重启功能,可在几秒钟内从故障中恢复,而无需重启容器,并提供作业内重启机制来处理严重崩溃。
-
NVIDIA 开源 OSMO 以统一 AI 机器人开发
NVIDIA 已开源 OSMO,一个为简化物理 AI 开发而设计的原生 Kubernetes 工作流编排器。该工具允许机器人团队在单个 YAML 文件中定义训练、模拟和机器人测试流程,解决了不同计算层之间的碎片化问题。OSMO 支持跨各种 Kubernetes 环境和边缘设备的便携性,简化了机器人 AI 开发的复杂过程。
-
DevOps 问题:Prometheus 在 EKS 上抓取不存在的 Telegraf;AI 代理内存不一致已注意到
一位 DevOps 工程师遇到了一个问题,其中 Prometheus 开始从未安装 Telegraf 的 Kubernetes 节点抓取 Telegraf 指标。这发生在将 EKS 工作节点标记为与应用程序服务器类似之后。另一位用户报告了一个 AI 代理提供了关于已删除文件的错误信息,突显了代理内存与实际文件系统状态之间的差异。
-
AI生成的AWS架构常有缺陷,新工具旨在修复
像Claude和Cursor这样的AI模型可以生成复杂的AWS架构,这些架构看起来令人印象深刻,但通常昂贵且不安全。这些模型倾向于默认使用其训练数据中流行的但效率低下的解决方案,导致不必要的服务蔓延和成本超支。为了解决这个问题,一个名为AWS Solutions Architect Prover的新工具已被开发出来,它可以在设计阶段充当高级审查员,在配置任何基础设施之前强制执行可量化的要求并最大限度地减少服务复杂性。
-
AWS 推出新的 Ray Serve 容器,简化 AI 推理流程,因 TorchServe 已弃用
AWS 发布了新的深度学习容器 (DLCs),利用 Ray Serve 来简化和支持之前由 TorchServe 管理的工作负载。TorchServe 已不再积极维护,用户需要自行负责管理其依赖项、安全补丁和兼容性问题。新的 Ray Serve DLCs 可用于 Amazon EKS 和 Amazon SageMaker,将 PyTorch、CUDA 和 Ray Serve 打包到一个经过测试和维护的容器中,减少了工程师的重复性工作,…
-
AWS 和 NVIDIA 发布 Cosmos 3 物理 AI 模型工厂
AWS 和 NVIDIA 已合作推出使用 SageMaker HyperPod 上的 NVIDIA Cosmos 3 构建的物理 AI 模型工厂。该系统旨在持续生成合成数据、训练感知和策略模型,并在模拟中进行评估,使机器人和自动驾驶汽车能够在现实世界中运行。NVIDIA Cosmos 3 模型采用 Transformer 混合架构,将视频、图像、动作和声音等多种模态整合到单一 token 流中,使其能够在 AWS 基础设施上通过统一的…
-
AWS 通过 SageMaker HyperPod InstantStart 简化 FM 工作负载操作
AWS 推出了 HyperPod InstantStart,这是一个开源控制平面,旨在简化 Amazon SageMaker HyperPod 上基础模型工作负载的管理。这个新系统自动化了复杂的、多阶段的操作,如基础设施设置、依赖项安装和作业管理,减少了这些任务通常伴随的手动工作和出错的可能性。用户可以通过 Web 界面或命令行代理与 InstantStart 进行交互,两者都利用相同的后端逻辑来配置和管理资源,从而使过程更高效、更可靠。
-
AWS SageMaker HyperPod 集成新 Ray 功能以进行基础模型训练
Amazon SageMaker HyperPod 现在提供与开源 Ray 框架的增强集成,简化了基础模型的训练和部署过程。此更新允许数据科学家直接在 SageMaker Studio 中管理 Ray 集群,无需手动配置 Kubernetes 和复杂的命令行操作。该集成提供了自动容错、通过分层检查点更快地恢复作业,以及对仪表板和模型权重的简化访问。
-
Fanatics Betting and Gaming 在 AWS 上构建多智能体 AI 支持系统
Fanatics Betting and Gaming 已在 AWS 上开发了一个多智能体 AI 客户支持系统,以满足体育博彩用户复杂且快速变化的需求。该系统基于 Amazon EKS 构建,并利用 Amazon Bedrock 访问各种基础模型,旨在提供比传统聊天机器人更快、更准确的响应,尤其是在超级碗等高流量赛事期间。该架构利用专门的智能体来处理各种查询,包括特定州的法规和负责任博彩,同时纳入了合规和负责任 AI 的安全措施。
-
AWS 推出 Claude 应用网关,用于企业 Anthropic 模型管理
AWS 推出了新的网关解决方案,旨在帮助企业为其员工管理 Anthropic 的 Claude 模型。该网关提供对身份验证、模型访问、成本归属和支出强制执行的集中控制,从而减少运营开销并确保大规模的一致治理。该解决方案可在 AWS Fargate、EKS 或 EC2 上部署,并与 Amazon Bedrock 和 Claude Platform on AWS 等服务集成,支持包括 OIDC 身份提供商在内的多种身份验证方法。
-
Amazon SageMaker AI 与 EKS 集成,增强 AI 工作流
Amazon SageMaker AI 为 Amazon EKS 推出了一个插件,支持在 EKS 集群上直接运行交互式 IDE 和 JupyterLab 环境。此次集成旨在通过允许 ML 团队在现有基础设施内管理其开发环境,来简化 AI 工作流。该解决方案旨在简化 EKS 上的代码编辑器和托管 JupyterLab 实例的设置和配置。
-
AWS SageMaker AI Spaces 将 IDE 集成到 EKS 集群中
Amazon Web Services 为 Amazon EKS 推出了名为 SageMaker AI Spaces 的新附加组件。此功能允许数据科学家直接在其现有的 Amazon EKS 集群中运行交互式集成开发环境 (IDE),例如 JupyterLab 和 Code Editor。以前,用户必须将工作流移出集群,从而失去对 GPU 节点和共享存储等关键资源的访问权限。SageMaker AI Spaces 附加组件简化了此过程,…
-
OpenAI CFO 分享 AI 财务经验;nOps 通过 AWS 加速代理交付
OpenAI CFO Sarah Friar 概述了在开发原生 AI 财务功能方面学到的五项关键经验,强调了自动化预测和控制的重要性,以及衡量 AI 投资回报的必要性。在另一项发展中,nOps 通过将其 Clara FinOps AI 代理迁移到 Amazon Bedrock AgentCore,将 FinOps 代理的交付速度提高了 75%,取代了之前使用 LangChain 和 LangGraph 的自管 Amazon EKS 堆栈。
-
使用 vLLM 在 Amazon EKS 上部署 LLM:分步指南
本文提供了使用 vLLM 在 Amazon EKS 上部署大型语言模型 (LLM) 的分步指南。文章强调了 Gartner 的预测,即到 2028 年,95% 的 AI 部署将使用 Kubernetes,并突出了对 MLOps 和平台工程技能的需求。该指南详细介绍了设置 EKS 集群、使用 vLLM 部署 meta-llama/Llama-3.1-8B-Instruct 模型以实现高效推理,以及配置兼容 OpenAI 的 API 和聊…
-
Amazon EKS with MCP:AI 驱动的 Kubernetes 管理指南
本文提供了设置和管理 Amazon Elastic Kubernetes Service (EKS) 的综合指南,重点关注使用 MCP 进行 AI 驱动的 Kubernetes 管理。它详细介绍了核心架构,包括 EKS 控制平面、托管节点组以及 VPC CNI 等网络组件。该指南还涵盖了 AWS 身份验证、EKS 访问条目、Kubernetes 基于角色的访问控制 (RBAC) 以及使用 Terraform 部署应用程序等基本方面。