Cerebras 已宣布在其平台上提供 Qwen 3.8 27B 模型,处理速度可达每秒 1500 个 token。该公司强调,它通过其公共端点提供开源模型的原始、未剪枝版本。虽然 Cerebras 研究 REAP 等剪枝技术,但这些修改后的模型会单独在 Hugging Face 上与研究社区共享,并且不属于生产 API。 AI
影响 在专用硬件上提供对特定 LLM 的访问,可能提高某些应用程序的推理速度。
排序理由 特定硬件平台上开源模型的可用性。
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →