Perplexity 详细介绍了其 GPU 嵌入栈,重点关注服务其 pplx-embed 模型的基础设施。该公司工程团队强调,通过重用其 LLM 栈中的内核,他们优化了批量和在线嵌入工作负载。关键组件包括用于请求处理的 Ivy、用于调度的 Tulip 和用于模型推理的 ROSE,所有这些都旨在最大限度地提高在 Hopper 和 Blackwell 等现代 GPU 硬件上的效率。 AI
影响 优化 AI 搜索产品的检索质量和成本,可能改善用户体验和可扩展性。
排序理由 文章详细介绍了 AI 产品的内部基础设施和提供栈,而非新的模型发布或核心研究。
- Blackwell
- CUDA
- Fast Embeddings on GPUs
- Hedera
- Hopper
- Perplexity
- pplx-embed
- Python
- Rose Optimizer
- Rust
- Tulipa
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →