百度发布了vLLM昆仑,这是一个社区维护的插件,使vLLM推理引擎能够在昆仑XPU硬件上运行。该集成允许在昆仑硬件上无缝执行各种开源LLM,包括基于Transformer的模型、混合专家(MoE)模型、嵌入式模型和多模态模型。该插件支持广泛的模型和功能,如量化、LoRA微调、优化注意力机制、推测性解码和张量并行,同时还提供了一个兼容OpenAI的API用于模型服务。 AI
影响 使LLM在专用硬件上的应用更加广泛,可能提高推理效率和成本效益。
排序理由 这是一个现有推理引擎的硬件插件,而不是新的前沿模型发布或核心研究。
- Baidu
- vLLM
- Xiaomi Kunlun Suv
- DeepSeek MLA
- DeepSeek-V3.2
- Gemma4
- GLM MoE DSA
- InternVL
- Kimi-K2
- Kunlun XPU
- Llama
- Qwen3.5-MoE
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →