AI inference
PulseAugur coverage of AI inference — every cluster mentioning AI inference across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
AWS 与高通合作开发定制 AI 推理芯片并降低成本
Amazon Web Services (AWS) 与高通公司已达成一项多年合作伙伴关系,旨在降低 AI 模型推理的相关成本。此次合作涉及开发专用于 AI 推理任务的定制硅芯片。此外,高通将利用 AWS 的 Amazon Bedrock 平台进行其芯片设计流程。
-
新的MeanField模型改进了GPU上的AI推理调度
研究人员开发了一种MeanField代理模型,以解决在共享GPU上调度并发AI推理工作负载的挑战。这种新方法基于局部配置和聚合GPU状态来预测模型性能,避免了传统代理模型的组合复杂性。实验证明了其高预测准确性和可扩展性,MeanField代理使遗传算法调度器能够有效地处理大量配置并避免服务级别协议违规。
-
Agentrys 完成 2450 万美元融资,用于 AI 芯片设计;Agentic AI 有望提振代币需求
Agentrys 已为其 Agentic AI 芯片设计平台筹集到 2450 万美元资金,该平台据称在 NVIDIA 基准测试中取得了超过 90% 的成绩。这一发展恰逢关于 Agentic AI 如何显著增加 AI 推理代币需求的讨论,并将其与铝的历史轨迹进行了类比。
-
Oxmiq Labs 提出用于 AI 推理容量的高带宽闪存
Oxmiq Labs 正在提出高带宽闪存 (HBF) 作为 AI 推理的新容量层,旨在以与高带宽内存 (HBM) 相当的成本提供显著更多的存储空间。他们在 Hot Chips 2026 上的演示概述了 HBF 硬件规格,该规格在相同价格下可提供 HBM 8 到 16 倍的容量。虽然 HBM 在带宽密集型任务中表现出色,但 Oxmiq 建议 HBF 可有效地部署在混合专家 (MoE) 模型中,特别是用于存储专家权重和卸载 KV 缓存,从…
-
AI框架推动硅光子设计和能量收集AI概念的发展
研究人员开发了PICasso,一个支持AI的框架,它使用自然语言来设计、验证和优化硅光子集成电路。该框架将大型语言模型与领域特定知识和物理验证相结合,以提高设计满意度并减少插入损耗。另外,一个名为SOLACE的概念架构提出将集成光伏与光学神经网络和低功耗CMOS相结合,以创建能够收集环境光的节能AI推理系统。
-
三星将逻辑单元集成到LPDDR5X内存中,以加快AI推理速度
三星公司开发了LPDDR5X-PIM,一种将逻辑单元直接集成到内存芯片中的新型内存技术。这种内存处理(PIM)方法旨在降低AI推理任务的成本和功耗,这些任务通常受限于传统内存架构的瓶颈。该公司展示了LPDDR5X-PIM与标准LPDDR5X相比,可以实现显著更高的速度和带宽,从而满足了对AI硬件日益增长的需求和成本担忧。
-
Intel 发布用于推理的实用型 AI 加速器 Crescent Island
在 Hot Chips 研讨会上,Intel 披露了其基于 Xe3P 架构的 Crescent Island AI 加速器的更多细节。该加速器专为推理任务设计,采用 350W 风冷 PCIe 卡,配备 480 GB LPDDR5X 内存。与竞争对手的高功耗液冷 GPU 不同,Crescent Island 优先考虑更实用、低功耗的 AI 推理部署。
-
SK Hynix 和 SanDisk 在 2026 FMS 大会上推进 AI 高带宽闪存
在 2026 FMS 大会上,SK Hynix 和 SanDisk 展示了高带宽闪存(HBF)技术的进展,该技术旨在增强 AI 推理能力。SK Hynix 推出了新的内存层级,包括具有 TB 级带宽的 G1.5 HBF,旨在优化 AI 性能和成本。SanDisk 详细介绍了其最新的 NAND 闪存芯片以及与 SK Hynix 在 HBF 上的合作,HBF 类似于 HBM 堆叠 NAND 芯片,为 AI 加速器提供高容量、高性能的存储解决方案。
-
Azure Storage 增强 AI 推理能力,支持提示缓存和 KV 卸载
Microsoft Azure Storage 正在增强其加速 AI 推理的能力。该平台正在实施提示缓存等技术以提高 token 效率,并将 KV 缓存卸载到 Blob 存储。这些优化旨在显著缩短模型加载时间,并提高 AI 模型在推理过程中的整体性能。
-
Kog 的新引擎提升现有 GPU 的 AI 推理速度 · 已追踪 4 个来源
法国初创公司 Kog 开发了一款新的推理引擎,旨在显著加速现有数据中心 GPU(如 AMD MI300X 和 NVIDIA H200)上的 AI 模型性能。该公司的软件驱动方法旨在通过优化推理速度来绕过昂贵新硬件的需求,而推理速度已成为许多 AI 应用的关键瓶颈。Kog 的技术已引起了极大的商业兴趣,特别是来自软件工程等领域对当前 AI 延迟感到沮丧的专业用户。
-
AI语音代理使用函数调用避免幻觉
已开发出一种基于Python的AI语音代理,通过集成函数调用功能来克服AI代理产生幻觉答案的问题。该代理使用Telnyx进行语音识别和文本转语音,使其能够与真实API交互,获取天气、订单状态和账户余额等信息。该系统被设计为一个单独的Flask文件,简化了其架构,并使其能够在对话中提供准确的、有数据支持的响应。
-
SanDisk、SK Hynix 推出面向 AI 内存的高带宽闪存规范
SanDisk 和 SK Hynix 联合推出了高带宽闪存 (HBF) 规范,这是一项旨在提高 AI 推理系统内存容量和带宽的新开放标准。该技术旨在弥合高带宽内存 (HBM) 的高性能与 NAND 闪存的大容量之间的差距。HBF 规范的目标是每个封装实现高达 3 TB/s 的带宽和 512GB 的容量,在容量上可能超越 HBM4 的能力,并为 AI 工作负载提供新的内存层级。
-
AI应用边缘计算最佳实践详解
边缘计算最适合用于AI应用的特定功能,例如身份验证检查、A/B测试、地理位置路由和速率限制。然而,它不适用于计算密集型任务,如重度AI推理、需要持久连接的数据库查询或大规模文件处理。边缘计算的战略性应用可以通过高效处理这些有针对性的轻量级操作来提高性能。
-
AI推理盈利能力引发泡沫担忧的争论 · 跟踪2个来源
AI推理的盈利能力是一个讨论话题,一些人认为这显然是一项有利可图的业务。这种观点认为,底层技术及其应用正在产生可观的回报。对话涉及AI泡沫的可能性,暗示当前的估值或市场状况可能不可持续。
-
AI 代理和推理驱动科技新前沿:3D 世界获 20 亿美元,Baseten 获 130 亿美元
General Intuition 正在向专为 3D 环境设计的 AI 代理投资 20 亿美元,旨在彻底改变模拟、游戏和数字工作。与此同时,Baseten 的估值目标为 130 亿美元,凸显了 AI 推理在科技行业中的快速增长和日益增长的重要性。这些发展突显了技术竞争正显著转向由 AI 驱动的应用和基础设施。
-
AI 推理需要超越计算的可扩展内存
人工智能行业正将其基础设施重点从模型训练转向推理,这给内存管理带来了新的挑战。与计算和带宽密集型的训练不同,推理需要高效地存储和提供持久的、驻留在内存中的数据。这需要将内存和计算解耦,以避免过度配置昂贵的处理器,并根据用户活动和上下文窗口的扩展独立扩展内存容量。
-
新方法论解决了企业报告中的AI推理排放问题
已提出一种新方法论,用于在企业可持续性报告中准确核算AI推理服务产生的温室气体排放。该四级框架旨在提供比当前实践更精确的估算,当前实践通常会忽略这些排放或使用过于宽泛的经济因素。所提出的方法利用GPU能耗基准和区域电网碳强度进行直接估算,对于缺乏使用数据的服务,则回退到基于支出的经济因素。
-
研究揭穿Pearl区块链“AI挖矿”的宣传
一项新研究揭穿了Pearl区块链“有用功证明”(PoUW)机制的宣传,发现它并未如宣传的那样为AI推理做出贡献。尽管该网络声称拥有强大的计算能力,但研究发现其运行仅包含琐碎的算术计算,未能产生任何有价值的AI输出。研究指出,该系统导致GPU租赁价格虚高,并转移了真正科学研究的资源,暴露了理论PoUW与其现实应用之间的实用性鸿沟。
-
在自管基础设施上部署符合HIPAA的AI推理
本文提供了一份关于部署符合HIPAA法规的AI推理服务的指南,强调使用自控基础设施。文章详细介绍了如何设置安全环境、管理数据隐私以及确保医疗应用AI模型的可靠性。重点在于在整个AI推理过程中维护对敏感患者数据的控制权。
-
分析发现轨道计算仅对主权云可行
Brandon Karpf 分析了轨道计算基础设施的五种潜在商业模式,包括 AI 训练、AI 推理、公共云、内容分发和边缘计算。他的研究表明,只有主权云模式在轨道上具有经济可行性。这表明未来太空计算资源的利用方式将发生重大转变。