基础设施
AI 基础设施报道涵盖芯片(NVIDIA、AMD、Intel 以及超大规模厂商的定制芯片)、数据中心(产能扩建、电力约束、液冷、地理分布)、训练算力(集群规模、供应合同、数十亿美元的交易)以及运行时基础设施(推理平台、部署工具、向量数据库)。PulseAugur 的基础设施流采集财报文件、厂商公告、对数据中心扩建的卫星影像分析以及供应链报道,揭示大多数读者错过的产能故事——因为它散落在财报、小众行业媒体与开发者工具博客之中。
- 覆盖
- 50条故事
- 时间窗口
- 今天
- 层级分布
- tool 38 research 5 commentary 3 significant 3
是什么推动了对AI基础设施的大规模投资?对AI基础设施前所未有的投资,是由先进AI模型不断升级的计算需求所驱动的。OpenAI等主要参与者正投入数千亿美元,仅OpenAI就计划到2030年投入7500亿美元,包括建设庞大的数据中心园区。这种规模需要巨大的电力,将电网推向极限,并显著增加电力消耗,例如谷歌在2025年增长37%,爱尔兰的数据中心消耗了全国23%的电力。为什么AI实验室要开发定制芯片?领先的AI实验室正在战略性地转向定制AI芯片,以优化性能、降低成本并摆脱对外部供应商的依赖。谷歌的“Rigel”芯片专为Gemini模型设计,承诺比TPU具有更卓越的能效。OpenAI与博通合作开发的“Jalapeño”旨在提高LLM每瓦推理性能。甚至中国的DeepSeek也计划开发内部数据中心芯片,以应对出口管制并控制其技术栈,使定制芯片成为新的行业标准。软件创新如何提升AI效率?除了硬件,模型架构和推理优化方面的进步对于使AI更易于访问和高效至关重要。DeepSeek的DSpark更新将推理速度提高了80%,而Sber的GigaChat 3.5 Ultra将KV缓存使用量减少了四倍,从而在更少的内存下处理更多上下文。月之暗面的Kimi K3,一个2.8万亿参数的MoE模型,展示了开源产品在规模和效率方面的推动,进一步驱动了对优化计算的需求。哪些新兴技术正在塑造AI基础设施?基础设施的叙事超越了传统数据中心,涵盖了边缘计算和新兴的量子AI领域。Verizon正在利用其暗光纤网络为谷歌的数据中心服务,并将中心局转换为边缘数据中心,以实现低延迟的AI推理。中国也推出了其原子量子AI基地“Q-Cub”,拥有超过1500个量子比特,而QuiX Quantum则交付了首个用于数据中心的通用光子量子计算机,预示着未来的计算范式。开源模型如何影响AI基础设施?强大开源模型的兴起正在推动对国内计算基础设施的需求,并挑战现有参与者。月之暗面的Kimi K3,一个2.8万亿参数的开源模型,经历了压倒性的需求,在48小时内填满了现有集群。同样,华为在昇腾NPU上训练的openPangu-2.0-Pro,标志着对国内计算生态系统的推动,减少了对外国硬件的依赖并促进了竞争。
近期动态
- — 华为发布openPangu-2.0-Pro,首个在昇腾NPU上训练的505B模型。
- — DeepSeek V4 Flash每日处理8万亿个token,凸显了代理经济中的成本效益。
- — 月之暗面发布2.8万亿参数Kimi K3模型,震惊硅谷。
- — Verizon与谷歌合作建设AI基础设施,计划建设边缘数据中心。
- — OpenAI计划投入7500亿美元用于基础设施建设,关注佐治亚州数据中心。
- — 谷歌开发“Rigel”芯片,专为Gemini AI模型提供动力。
- — OpenAI推出定制AI芯片Jalapeño,Anthropic转变代理范式。
为何这些故事上榜
-
95
OpenAI's massive, escalating infrastructure investment is a foundational story, setting the benchmark for the scale of compute required for future AI development.
-
90
The overwhelming demand for Kimi K3 immediately straining existing compute infrastructure underscores the real-world impact of powerful open-source models on hardware needs.
-
92
This cluster is highly significant, showcasing a frontier model trained entirely on domestic hardware, directly addressing strategic independence and the global compute ecosystem.
-
89
OpenAI's custom chip development with Broadcom signals a strategic shift towards in-house silicon, aiming for performance-per-watt gains and reduced reliance on external GPU suppliers.
-
85
This partnership signifies a major telecom player's entry into AI infrastructure, leveraging dark fiber and edge data centers for low-latency AI, a key future trend.
-
80
This cluster highlights the pressing energy consumption challenges and grid stability risks associated with the rapid expansion of AI data centers.
基础设施报道走势
趋势
Coverage of Infra is accelerating, driven by massive investment announcements and the real-world impact of new models. OpenAI's $750B plan (cluster 157695) and the overwhelming demand for Moonshot AI's Kimi K3 (cluster 176966) highlight the escalating need for compute. The focus is shifting towards how this infrastructure is built and sustained.
与同行对比
Infra's coverage is distinct from peers like Nvidia, which is a supplier, or Anthropic, a model developer. Infra stories focus on the foundational layer: custom chip development (Google Rigel, OpenAI Jalapeño, DeepSeek), energy consumption (Ireland data centers, Google's power use), and the strategic independence sought by major players and nations (Huawei, DeepSeek).
话题分布
This cycle sees a significant shift towards topics like custom silicon development, energy efficiency, grid stability, and the direct impact of open-source models on compute demand. There's also an increased focus on software optimizations for inference and edge computing, moving beyond just raw data center expansion.
编辑观点
We see the 'Infra' narrative dominated by an unprecedented scale of investment and a strategic pivot towards custom silicon. The sheer energy demands of AI data centers are becoming a critical concern, pushing both technological innovation in efficiency and regulatory scrutiny. The rapid adoption of powerful open-source models is also creating immediate, tangible strains on existing compute, underscoring the urgency of scalable and domestically controlled infrastructure.
常见问题
- 为什么AI公司在基础设施上投入如此巨大?
- AI公司在基础设施上投入巨资,是为了满足训练和部署日益复杂的AI模型不断升级的计算需求。这包括建设庞大的数据中心、确保巨大的电力供应以及开发专用硬件。目标是降低运营成本、提升性能,并在快速发展的行业中保持竞争优势,因为模型规模和能力往往与可用的计算资源挂钩,正如OpenAI的7500亿美元计划所示。
- 公司如何应对AI基础设施的能源需求?
- AI基础设施日益增长的能源需求是一个重大问题,爱尔兰等地区的数据中心消耗了全国相当一部分电力。公司正通过投资可再生能源、优化数据中心设计以提高效率以及开发更节能的定制AI芯片来解决这一问题。北美电力可靠性公司(NERC)也将AI数据中心标记为电网稳定风险,促使人们关注精细化的24/7无碳能源目标和管理电网影响的监管措施。
- 定制AI芯片在当前格局中扮演什么角色?
- 定制AI芯片,例如谷歌的“Rigel”和OpenAI的“Jalapeño”,正变得至关重要。这些芯片专为AI工作负载设计,与通用GPU相比,提供卓越的每瓦性能、更低的延迟和更低的运营成本。通过开发内部芯片,公司可以更好地控制其技术栈,针对其独特的模型架构进行优化,并减少对外部供应商的依赖,这对于竞争优势和战略独立性至关重要,特别是对于面临出口管制的DeepSeek等中国公司。
- 开源模型如何影响AI基础设施的发展?
- 月之暗面的Kimi K3和华为的openPangu-2.0-Pro等开源模型通过推动对可访问和高效计算的需求,显著影响着基础设施。它们的发布常常导致现有集群立即面临压力,正如Kimi K3在48小时内填满集群所示,这凸显了对可扩展推理能力的需求。这一趋势也促进了国内计算平台和供应链的发展,因为公司寻求支持这些强大的模型并减少对专有或外国硬件的依赖。
相关
-
LLM API 错误代码在不同提供商之间不一致
集成大型语言模型 API 的开发者面临着不同提供商之间错误处理不一致的挑战。虽然使用了像 400(错误请求)和 429(请求过多)这样的 HTTP 状态码,但它们的具体含义和错误的根本原因差异很大。这种模糊性要求开发者必须仔细地将这些通用代码映射到特定提供商的错误消息和标头,才能正确诊断和解决诸如上下文窗口限制、不支持的参数或速率限制之类的问题。
-
Kubernetes AI 推理自动扩缩:基于队列深度进行扩缩
本文详细介绍了如何在 Kubernetes 上为 AI 推理服务实现水平 Pod 自动扩缩器 (HPA),特别是解决了使用 CPU 利用率作为扩缩指标的局限性。文章解释说,即使在重负载下,GPU 密集型工作负载通常也显示出较低的 CPU 使用率,而高 GPU 利用率并不一定表明请求积压。推荐的方法是基于等待推理请求的数量进行扩缩,这是 vLLM 等工具公开的一个指标。该过程包括配置 Prometheus 来抓取此指标,使用适配器将其暴…
-
Rick Perry's Fermi 终于为其德州 AI 能源计划找到首个客户
由前德州州长 Rick Perry 创立的公司 Fermi 已为其在该州雄心勃勃的 AI 数据中心项目敲定了首个主要客户。这项交易标志着 Fermi 计划建设庞大能源基础设施以满足人工智能巨大能源需求的重要一步。
-
GPT 模型支付 1 美元费用注册 AI 代理论坛
一位用户实现了一个系统,要求 AI 代理必须通过 Base 网络上的 x402 协议支付 1 美元的 USDC 费用才能注册公开论坛。这种微支付作为一种 Sybil 防御机制,防止重复注册。值得注意的是,一个被识别为 'gpt-5.6-sol' 的 GPT 模型成功通过此支付网关注册,标志着第一个外部 AI 代理独立加入论坛的实例。
-
Writer推出Palmyra X6 AI模型,将企业代币成本降低50%
面向营销人员的AI工具提供商Writer推出了一款名为Palmyra X6的新旗舰模型,该模型基于开源的GLM-5.2模型。该新系统旨在显著降低企业用户的代币成本,据估计,当与Writer的agentic harness基础设施升级相结合时,基本任务的成本可降低高达50%。该公司强调,优化harness对于成本效益至关重要,因为它会影响组织使用的所有模型。
-
苏格兰水务公司通过 Databricks Genie 使资本投资数据实现对话化
苏格兰水务公司已实施 Databricks Genie,以改变其资本投资数据的访问方式。此前,团队在查找零散报告中的信息时遇到困难,或依赖数据专家。现在,通过一个名为 SPARK 的对话界面,该界面集成了 Microsoft Teams 和 Copilot,用户可以通过简单的英语提问,并获得通过 Unity Catalog 治理的数据提供的即时、可信赖的答案。该解决方案通过从静态报告转向交互式数据对话,减少了摩擦,加速了决策制定,并促…
-
日本在安全审查中考虑使用美国云处理绝密数据
日本政府正计划引进能够处理包括国家机密和关键经济安全数据在内的高度机密信息的私有云服务。目前,没有国内云服务满足“保密级别3”的安全要求。因此,来自Amazon和Google等公司的美国制造云服务被认为是采用的主要候选。
-
AI 工具利用 Claude 自动化研究优化循环
一位 Reddit 用户开发了一个名为 'hills' 的工具,该工具利用 Claude 等 AI 模型来自动化研究和开发的迭代优化循环。该用户强调了仔细设计评估指标、优化目标和约束条件的重要性,然后 AI 就可以在较长时间内自主地改进解决方案。这种方法使研究人员能够专注于高级战略和想法生成,并信任 AI 来处理详细的优化过程。
-
Google 的 Gemini 将自动修复密码;微软合并 Copilot 应用
据报道,Google 正在 Chrome Canary 中测试一项功能,允许 Gemini 自动建议和修复重复使用或弱密码。此集成旨在通过识别和纠正密码漏洞来增强用户安全性。与此同时,微软正在将其 Copilot 应用程序整合到一个统一的“超级应用”体验中,旨在简化跨各种平台访问其 AI 助手。
-
Perplexity 将 Sonar 模型迁移至增强型 Agent API
Perplexity 正在将其 Sonar 模型迁移至 Agent API,后者提供了增强的功能,如基于事实的网络搜索、多步研究、代码执行以及访问各种模型。此举旨在提高性能,据报道,Agent API 在 BrowseComp 和 WideSearch 等基准测试中使 Sonar 的得分翻倍以上。
-
MCP C# SDK 2.0.0 增加了协议协商和回退功能
MCP C# SDK 2.0.0 版本引入了协议协商,默认使用 2026-07-28 规范,无需初始化握手和基于会话的 HTTP。新版本通过允许在服务器不支持现代规范时回退到旧协议来保持向后兼容性。建议开发人员显式固定所需的协议版本,以确保满足特定功能或部署假设,并将协商结果视为应用程序合同的一部分,用于回归测试,而不是盲目捕获连接异常。
-
AI项目推动德州电网容量需求激增
寻求接入德州电网的潜在项目提交的申请总容量超过474吉瓦。截至8月3日,这一数字是电网峰值需求的五倍多。申请激增主要归因于AI和科技项目的能源需求。
-
尼日利亚推出首个AI驱动的劳动力风险情报平台
尼日利亚公司WellNewMe推出了其声称是该国首个劳动力风险情报平台。该平台旨在为雇主、经纪人和保险公司提供可操作的健康风险分析,超越了传统的健康应用。该开发涉及构建一个多方参与的AI驱动基础设施。
-
企业MCP网关对于安全Claude代码集成至关重要
文章讨论了企业模型上下文协议(MCP)网关对于管理Claude Code等AI编码代理的必要性。这些网关集中了基础设施,用于保护、路由和审计AI客户端与外部工具之间的通信,解决了直接本地集成中固有的令牌膨胀、凭证蔓延、缺乏审计和单点故障等问题。这些网关的关键评估标准包括联合、动态发现、细粒度安全、身份提供商集成和端点级强制执行,以确保强大且安全的AI开发工作流程。
-
Liquid Intelligent Technologies 使用光束扩大拉各斯的数据中心容量
Liquid Intelligent Technologies 正在拉各斯实施 Taara 的无线光技术,以克服光纤限制并增加数据中心容量。此次部署利用光束建立连接,为在难以部署传统光纤的地区扩展基础设施提供了一种替代解决方案。
-
Namecheap 宕机由数据中心冷却故障引起
网络托管服务提供商 Namecheap 因其位于凤凰城的数据中心冷却系统发生故障而经历了一次重大宕机。据报道,此次故障是由夜间风暴造成的损坏引起的,影响了包括 Namecheap 网站、EasyWP 托管和 DNS 服务在内的多项服务。首席执行官 Hillan Klein 表示,服务可能在东部时间下午中叶开始恢复在线。
-
使用 React Flow 和 TypeScript 构建基于节点的生成媒体编辑器
本文探讨了用于生成媒体工作流的基于节点的视觉编辑器的架构,并将其与传统的线性软件执行进行对比。文章重点介绍了数据流编程和有向无环图(DAG)的使用,以管理复杂、并发的处理,其中节点充当独立的计算单元,边表示响应式数据流。文章强调需要将图的结构状态与管道的操作状态分离,以处理实时生成应用程序中的高频更新,并将其与从单体 Web 应用程序到微服务的演变进行类比。
-
Blacksmith CI/CD 平台遭遇 8 小时宕机,引发与 GitHub Actions 的比较
CI/CD 平台 useblacksmith 经历了超过 8 小时的重大宕机,影响了依赖其服务的用户。这种长时间的宕机尤其值得注意,因为在 2026 年之前,这种长时间的宕机并不常见。此次事件发生在 GitHub Actions 因其自身可靠性问题而持续受到批评的背景下。
-
AI 工具发布:Freebeat AI 用于音乐视频,Optima 用于自定义基准测试
Freebeat AI 推出了一个能够根据歌曲链接生成 AI 音乐视频和舞蹈序列的代理,支持来自 Suno、TikTok 和 YouTube 的输入。同时,Artificial Analysis 发布了 Optima,一个用于创建和运行针对特定用例定制的基准测试的平台,帮助 AI 开发团队进行模型选择和性能验证。
-
Microsoft 通过新的路由和故障转移功能增强 AI 集成
Microsoft 为其 Microsoft.Extensions.AI 库引入了新的路由和故障转移功能。此次更新旨在提高 .NET 应用程序中 AI 集成的可靠性和灵活性。这些增强功能使开发人员能够更好地管理多个 AI 模型,并确保即使某个服务不可用也能持续运行。
-
Google Gemini 3.7 Flash 和 OpenAI GPT-5.6 Sol Ultrafast 优先考虑速度
Google 推出了 Gemini 3.7 Flash,这是一款专为极速和广泛可访问性设计的新模型,目标是低成本。与此同时,据报道 OpenAI 正在通过其 GPT-5.6 Sol Ultrafast 模型的新芯片来突破性能极限,在创纪录的成就上展开竞争。
-
LM Studio 简化了用户本地 AI 模型部署
LM Studio 是一款桌面应用程序,允许用户在自己的硬件上本地发现、下载和运行大型语言模型 (LLM)。该软件旨在简化设置和与 AI 模型交互的过程,使其易于个人使用和实验,而无需广泛的技术专业知识。
-
用户为 Whisper 寻找更快的 Pyannote 替代方案
一位 Reddit 用户正在寻找 Pyannote 库的更快替代方案,用于与 OpenAI 的 Whisper 模型配合进行音频说话人分离。目前使用 Pyannote 和 Whisper Base 在 CPU 上进行设置,导致说话人分离过程比转录本身花费的时间长得多。用户正在寻找更快捷的方法或优化来提高 Pyannote 与 Whisper 结合使用的性能速度。
-
OpenAI 通过“Ultrafast”模式提升 GPT 5.6 "Sol" 速度,并与 IBM 合作
OpenAI 为其 GPT 5.6 "Sol" 模型推出了一种名为“Ultrafast”的新模式,将处理速度显著提高了 14 倍。与此同时,OpenAI 正与 IBM 合作,以增强其企业人工智能产品。此次合作旨在利用 OpenAI 的先进人工智能能力,支持 IBM 在企业人工智能市场的更广泛推广。
-
Fireworks 与 Arcee 合作,简化 AI 模型部署
Fireworks 已与 Arcee 合作,为用户提供一种管理自身智能基础设施的方式。此次合作允许用户通过 Arcee 平台访问 Fireworks 的 Kimi-K3 模型。该合作伙伴关系旨在简化部署和管理 AI 模型的过程。
-
Fireworks AI 与微软合作推出面向初创企业的 AI 部署指南
Fireworks AI 已与微软合作,为初创企业提供有关部署 AI 模型的指南。此次合作的重点是将 AI 产品从原型推向生产,强调架构演进和模型选择。初创企业可以在 Microsoft Foundry 上利用 Fireworks 模型,使用 Azure 来托管开放模型,并通过监控、缓存和治理等功能进行扩展。
-
AI 驱动的 PowerShell DSL 简化了复杂的 Windows 开发工具
一位开发人员创建了一个名为 SkillOpt 的 PowerShell DSL 环境,以简化 Windows 开发所需的复杂工具。这款 AI 驱动的自动优化器旨在通过外包 WinDBG、事件跟踪、Sysinternals 和 Windows Driver Kit 等工具的繁琐工作来帮助开发人员。该开发人员质疑为什么 Microsoft 没有开发类似的集成解决方案。
-
Microsoft Clarity 工具追踪 AI 运营商抓取与推荐情况
Microsoft Clarity,一个免费的网站分析工具,推出了一项功能,根据 AI 运营商的抓取活动与网站推荐量进行排名。一个示例卡片突显了 6,000:1 的抓取与推荐比例,表明在极少的流量回访情况下进行了大量数据收集。该工具可与连接的 CDN 一起使用。
-
MiniMax AI 与 fal.ai 合作展示开发者项目
MiniMax AI 和 fal.ai 正在合作,鼓励开发者使用 MiniMax 的 H3 模型构建项目。该计划有机会展示项目,重点是利用 H3 的功能,如多模态引用、原生音频、编辑、LoRAs、模型链和生产工作流。此次合作旨在促进开发者社区中 H3 模型的创新和采用。
-
Personal Vault 开发者强调 AI 在复杂软件创作中的作用
Personal Vault 的创建者(一款自托管的照片管理应用程序)详细介绍了开发单个过滤器按钮所涉及的重大工程工作。这一过程凸显了日常软件(如 Apple 的 iCloud Photos 应用)背后隐藏的复杂性,从而更加欣赏此类工具背后的开发者。创建者在整个开发周期中使用了各种 AI 工具,包括 ChatGPT、Codex 和 Florence,以协助架构、设计和实现。
-
LLM 批量审核策略针对存档内容详解
本文详细介绍了一种使用大型语言模型 (LLM) 分类作业批量审核现有帖子和评论的策略,并将其与逐行实时审核进行对比。作者主张对存档内容进行批量处理,因为它具有更简单的重试机制,可以防止重复写入并避免诸如重新打开已关闭工单之类的问题。该方法包括提交行进行分类、轮询作业状态以及获取结果,其中 LLM 分类通过受 JSON 模式约束以实现机器可路由输出的聊天模型运行。
-
CoreWeave、NVIDIA详述AI工厂验证;Docker发布Agent安全蓝图
CoreWeave与NVIDIA合作开发了AI工厂的验证流程,确保AI部署已准备好投入生产。该流程旨在提供全面部署前的就绪证明。另外,Docker推出了Agent Baseline,一个旨在通过解决Agent工作流中的运行时重编程风险和控制差距,帮助企业安全采用Agentic AI的安全蓝图。
-
安大略省省长道格·福特支持数据中心,但未提供现金激励
安大略省省长道格·福特表示,数据中心是未来的方向,但该省不会为数据中心的建设提供财政激励。这些新的数据中心将负责支付其所有能源成本。这项政策旨在确保这些设施的开发符合该省的能源需求和财务考量。
-
研究发现,没有公共 MCP 服务器使用旧版传输
对 86 个公共 MCP 服务器进行的最新健康检查显示,没有一个服务器使用旧版 HTTP+SSE 传输协议。分析于 2026 年 8 月 4 日进行,发现所有服务器都已采用 Streamable HTTP 传输,该传输使用单个端点进行请求和响应。这一发现与许多当前仍教授旧版双端点方法的教程形成对比。此外,研究强调,86% 的公共服务器需要身份验证,这意味着它们并非真正开放给未经身份验证的访问,并且有相当一部分服务器仍在使用的 prot…
-
专家称,后量子密码学转型是可控的演进
专家认为,向后量子密码学(PQC)的转型是一个演进过程,而非迫在眉睫的危机。虽然量子计算机对当前加密方法构成了未来威胁,但打破 2048 位 RSA 密钥的时间表大约在 2040 年,表明这是一个可控的演进过程。政府指令,例如美国国家安全系统(NSS)要求在 2027 年前支持 CNSA 2.0 的指令,为组织规划自己的密码现代化工作提供了路线图。
-
OpenAI携手Cerebras推出速度提升14倍的GPT-5.6 Sol模式
OpenAI为其GPT-5.6 Sol模型推出了新的“超快”(Ultrafast)模式,使其信息处理速度比标准速度快14倍。这种通过与芯片制造商Cerebras合作实现的加速,使模型能够每秒生成多达750个token。超快模式目前处于预览阶段,面向部分客户开放,旨在用于客户服务、金融分析和事件响应等应用。值得注意的是,OpenAI此前已收购Cerebras 4.2%的股份,凸显了此次合作的战略重要性。
-
Databricks AI Gateway 推出智能路由以降低编码成本
Databricks 推出了其 Unity AI Gateway 的新“智能路由”功能,旨在通过根据复杂性将 AI 编码任务匹配到最合适的模型来对其进行优化。这旨在通过避免对简单任务默认使用昂贵的高能力模型来降低成本。该功能目前处于测试阶段,可与 Claude Code 和 Codex 等工具配合使用,并与 Omnigent 集成以实现更广泛的 Harness 优化,据报道,其性能可与领先模型相媲美,但成本却大大降低。
-
敦促领导者采取战略性、受量子启发的计算之路
建议企业领导者采取一种战略性和审慎的方法来应对量子计算,重点关注可在当前经典硬件上实现的受量子启发的(quantum-inspired)技术。这些技术,例如用于机器学习的受量子启发的特征工程、用于优化的模拟退火以及用于风险评估的蒙特卡洛替代方案,可以在不承担投资不成熟量子技术的早期风险的情况下提供切实的益处。建议组织在探索量子计算之旅时,采用一个强调可测试性和业务成果而非纯粹科学探索的四部分框架。
-
重试逻辑中的正则表达式错误悄悄破坏了Hindsight的交易生成
一位开发者在其Hindsight重试逻辑中遇到了一个微妙的错误,该错误由一个正则表达式引起,该正则表达式未能正确解析Groq的速率限制错误消息。该正则表达式旨在提取秒为单位的重试时间,但错误地处理了指示以分钟和秒为单位的重试延迟的消息,导致了不足的退避时间。这导致重试机制耗尽了最大尝试次数而未能成功完成任务,并非由于实际的服务不可用,而是由于解析错误。
-
多部分指南全新解读 Kubernetes 架构
本文深入介绍了 Kubernetes 架构,重点关注其核心组件和设计原则。旨在作为理解 Kubernetes 如何运行和构建的全面资源。内容作为系列的第一部分,后续章节将涵盖更高级的主题。
-
代码库内存MCP为AI代理提供结构化代码理解
代码库内存MCP (MCP) 是一款旨在为AI代理提供代码仓库结构化理解的新工具,超越了简单的文本搜索。它将代码解析为知识图谱,支持亚毫秒级查询,并与传统的grep类方法相比,显著减少了token使用量和工具调用次数。这种方法使代理能够跨会话保留上下文并理解代码结构,例如调用路径和跨文件依赖关系,但它不解释代码的意图。
-
MgntUtils 提供工具,可在用户数据上验证 AI Token 成本节省
一位开发者创建了一个名为 MgntUtils 的工具,该工具可以通过分析堆栈跟踪来过滤 AI Token 成本。本文提供了关于如何使用 MgntUtils 在实施更改之前,在用户自己的数据上验证 AI Token 节省的后续指南。该过程涉及编写一个独立的 Java 程序,该程序使用 MgntUtils 的冷过滤功能来处理捕获的堆栈跟踪,从而使用户能够比较原始数据和过滤后的数据在行、字节和 Token 方面的减少量。
-
Hugging Face 通过新的数据循环系统简化 AI Agent 工作流
Hugging Face 推出了一个新系统,使 Agent 能够持续记录、训练和部署模型。该系统利用 Strands Agents、LeRobot 和 Hugging Face Storage Buckets 创建了一个高效的数据循环。该过程包括记录演示、将更改的字节上传到 Storage Bucket 进行同步,然后直接从 Hub 流式传输数据集进行训练,无需完全下载。最后,将训练好的检查点以最小的更改部署回硬件。
-
Perplexity 优化搜索即代码,成本降低 10%
Perplexity 宣布对其最初于 6 月发布的搜索即代码 (SaC) 系统进行了重大优化。这些更新旨在进一步提高性能,并将每项任务的成本降低近 10%。该公司还报告称,其在“Computer”环境中的搜索 SDK 更新的可靠性有所提高,执行可靠性从 81.9% 提高到 92.6%。这些进步预计将转化为更高的用户满意度和跨各种实际用户工作流程更强的编排能力。
-
DFT Labs 提出可构建实时知识图谱的 AI 智能体
DFT Labs(HeyDonto 的一项业务)正在开发能够实时从原始数据构建自身知识图谱的 AI 智能体。这种被称为数据场理论的方法,旨在超越简单的下一个词预测,以评估 AI 对数据上下文的真正理解和保留能力。该公司还提出了评估这些能力的新基准,可能对 AI 合规性和数据智能产生影响。
-
作者使用官方罗马尼亚开放数据构建MCP服务器,绕过抓取
作者描述了使用官方罗马尼亚政府开放数据而不是抓取商业目录来构建MCP服务器。通过利用data.gov.ro提供的月度CSV快照(包含全面的公司注册信息),作者创建了一个自托管系统。该流程涉及从CKAN下载数据,将其加载到SQLite中,然后通过MCP服务器通过三个工具公开这些数据,为访问商业数据提供了一种更可靠、更有效的方法。
-
OpenAI 预览 GPT-5.6 "Sol",通过超快模式实现 14 倍速度提升
OpenAI 正在预览一项名为超快模式 (Ultrafast Mode) 的新 API 服务层,旨在将 GPT-5.6 "Sol" 模型的速度提升高达 14 倍。这种速度提升是通过 Cerebras 技术实现的,使模型能够提供每秒高达 750 个输出 token。此举旨在显著提高利用 GPT-5.6 "Sol" 模型的 AI 应用的性能和效率。
-
Gemini AI 扩展应用集成;Celld 项目展示分布式对象
谷歌的 Gemini AI 正在扩展其集成能力,使其能够与更广泛的应用程序协同工作。此举旨在通过将其与流行实用的工具连接来增强 Gemini 的实用性。另外,一个名为 Celld 的项目因其自托管、分布式持久化对象技术而受到关注,该技术对软件开发和基础设施具有重要意义。
-
三星使用Anthropic的Claude加速芯片验证
三星正在试验Anthropic的Claude LLM以加速芯片验证,将测试生成时间从数小时缩短到数分钟。虽然Claude可以快速起草测试平台和约束,但与Cadence和Synopsys等传统EDA工具相比,它引入了更高比例的假阴性和潜在的知识产权泄露。该公司将Claude用作副驾驶,人类工程师仍进行最终验证,并采用沙盒和提示过滤等策略来降低风险。
-
近封装光学获得关注,行业寻求CPO替代方案
近封装光学(NPO)正成为传统可插拔收发器和全共封装光学(CPO)之间一种可行的中间解决方案。分析师认为,NPO在本十年末将实现显著销量,与CPO相比,它具有现场可更换模块和更简单的组装等优势。虽然CPO通过将光学器件直接放置在ASIC基板上来提供更高的能效,但其复杂性和潜在的良率问题正促使人们对NPO作为一种更易于管理的过渡方案产生兴趣。