实体
vllm-metal
vllm-metal
PulseAugur coverage of vllm-metal — every cluster mentioning vllm-metal across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
MoFlux 准入控制显示 LLM 推理中的容量恢复延迟
MoFlux,一个用于 LLM 推理引擎的准入控制层,已对其容量恢复能力进行了评估。在 Apple M1 设置上使用 vLLM 和 Qwen2.5-1.5B-Instruct 模型进行的测试表明,虽然 MoFlux 允许交互式请求在 1 秒内重新进入,但借用容量的批量请求需要更长时间才能完成,长提示的完成时间长达 20 秒。引擎对返回的交互式请求的调度也引入了延迟,一种设计在拨款恢复后导致 3.6 到 4.0 秒的等待时间。这些容量恢…
-
Apple Silicon LLM 推理受制于碎片化的软件栈
在 Apple Silicon 上高效运行大型语言模型受到碎片化且不成熟的软件生态系统的阻碍。与 NVIDIA 的 CUDA 平台提供的集成优化不同,Apple 的平台缺乏一个统一的框架来整合关键功能,如前缀缓存、推测解码和连续批处理,以支持 Qwen 等较新模型。作者建议将精力集中在一个强大且统一的框架上,可能基于 vllm-metal 进行构建,以提高本地 LLM 推理的性能和用户体验。