vLLM 发布了新的 TT 插件,支持使用 Tenstorrent 硬件部署大型语言模型。该插件通过标准的平台插件机制将 Tenstorrent 的加速器集成到 vLLM 框架中。此次集成允许使用兼容 OpenAI 的 API 部署包括纯文本和多模态模型在内的各种模型,而无需更改现有的客户端代码。该插件利用了 Tenstorrent 独特的 Mesh 架构,直接在编译后的 Mesh 程序中表达了相位约束调度器和自定义数据并行拓扑等差异。 AI
影响 为 LLM 部署提供了更广泛的硬件选择,可能提高成本效益和性能。
排序理由 该条目描述了一个软件插件,它使现有的 LLM 部署基础设施 (vLLM) 能够利用特定硬件 (Tenstorrent),这属于“工具”类别。
在 Mastodon — mastodon.social 阅读 →
- Galaxy
- Gemma 3
- Llama 3.2 Vision
- Mistral 3
- OpenAI
- QuietBox
- Qwen-3.6
- Qwen3.6-27B
- Qwen VL
- Tenstorrent
- TT-Metal
- vLLM
- vLLM TT Plugin
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →