ZML
PulseAugur coverage of ZML — every cluster mentioning ZML across labs, papers, and developer communities, ranked by signal.
- 2026-06-06 product_launch ZML has launched a new production inference stack designed for hardware-agnostic AI workloads. 来源
-
Kog 的新引擎提升现有 GPU 的 AI 推理速度 · 已追踪 4 个来源
法国初创公司 Kog 开发了一款新的推理引擎,旨在显著加速现有数据中心 GPU(如 AMD MI300X 和 NVIDIA H200)上的 AI 模型性能。该公司的软件驱动方法旨在通过优化推理速度来绕过昂贵新硬件的需求,而推理速度已成为许多 AI 应用的关键瓶颈。Kog 的技术已引起了极大的商业兴趣,特别是来自软件工程等领域对当前 AI 延迟感到沮丧的专业用户。
-
EschaLabs 发布 2 位量化 Qwen3.6-35B-A3B 模型,支持本地 GPU 使用
EschaLabs 发布了 Escha-W2,这是 Qwen3.6-35B-A3B 混合专家模型的 2 位量化版本。该版本专为本地部署而设计,仅需一块 24 GB 的消费级 GPU,并提供兼容 OpenAI 的 HTTP API。用户可在两个运行时引擎之间选择:SGLang 支持并发和工具调用等功能;ZML 提供无 Python、单二进制文件的体验,在某些硬件上可能解码速度更快,但初始启动时间较长,且在较低显存的 GPU 上存在限制。
-
法国初创公司 ZML 发布免费 AI 推理软件,支持多种芯片 · 追踪 2 个来源
法国 AI 初创公司 ZML 推出了 ZML/LLMD,这是一款旨在优化多种硬件(包括来自 Nvidia、AMD、Google、Apple 和 Intel 的芯片)上 AI 推理速度的新软件。该工具旨在打破供应商锁定,并通过实现对不同芯片架构的高效利用来降低企业的 AI 相关成本。在 Yann LeCun 和 2000 万美元融资的支持下,ZML 最初免费提供该软件,以评估使用情况和市场影响。
-
ZML 发布硬件无关的 AI 推理栈
ZML 发布了一个新的生产推理栈,旨在独立于特定硬件运行 AI 工作负载。该系统旨在将任何 AI 模型直接编译到 NVIDIA、AMD、TPU 或 Trainium 加速器,而无需重写代码。ZML 通过直接编译到硬件并避免 Python 运行时或隐藏状态抽象来强调性能和可预测性。