Hetzner 正在试验通过兼容 OpenAI 的 API 提供 LLM 推理服务。这项早期服务目前没有计费或 SLA,使用了 Qwen/Qwen3.6-35B-A3B-FP8 模型,旨在评估用户兴趣和系统可扩展性。初步测试表明性能快速,首个 token 的中位时间为 153 毫秒,输出速度为每秒 224 个 token。 AI
影响 这项试验可能预示着云服务提供商提供直接 LLM 推理的新趋势,可能增加竞争和可访问性。
排序理由 Hetzner 正在试验一项 LLM 推理服务,这是一项产品,但并非前沿发布或重大的行业举措。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →