PulseAugur
实时 12:00:47
实体 Continuous Batching

Continuous Batching

PulseAugur coverage of Continuous Batching — every cluster mentioning Continuous Batching across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. COMMENTARY · CL_138790 ·

    大语言模型推理速度受硬件物理限制,而非模型复杂度

    一篇文章探讨了大语言模型(LLM)推理的性能瓶颈,认为主要限制因素并非模型本身,而是硬件的底层物理限制,特别是内存带宽。文章解释说,GPU的设计是为了大规模并行处理,对大型数据集执行相同的操作,这对于AI工作负载至关重要。文章强调,LLM的推理速度取决于两个关键GPU资源中较慢的那个:计算能力和内存带宽,并引入了算力强度(arithmetic intensity)的概念来衡量这种关系。

  2. TOOL · CL_99068 ·

    连续批处理通过优化 GPU 使用率来提高 LLM 推理效率

    连续批处理是一种旨在提高大型语言模型 (LLM) 推理过程中 GPU 利用率的优化技术。传统的静态批处理方法存在“拖尾问题”,即批次中最慢的请求决定了所有请求的处理时间,导致 GPU 大量空闲。连续批处理通过在每次迭代中动态重新评估和调整批次来解决此问题,允许已完成的请求立即被队列中的新请求替换。与静态批处理相比,这种迭代调度确保 GPU 资源得到持续利用,从而显著提高吞吐量和效率。

  3. RESEARCH · CL_92655 ·

    Hugging Face 详细介绍连续批处理和 DeepMath 代理

    Hugging Face 发布了介绍两项新 AI 发展的文章。第一篇介绍了连续批处理,一种更有效地处理 AI 模型的技术。第二篇文章重点介绍了 DeepMath,一个由 smolagents 提供支持的轻量级数学推理代理,由英特尔合作开发。

  4. RESEARCH · CL_88570 ·

    oMLX 在 Mac LLM 推理速度上显著优于 Ollama

    对在 Mac 设备上本地运行 LLM 的 oMLX 和 Ollama 进行的性能比较显示出显著的速度差异。oMLX 利用 Apple Silicon 的 MLX 框架,与使用 GGUF 后端的 Ollama 相比,其 token 生成速度快了 35%,多轮对话延迟降低了 7 倍。虽然 oMLX 提供了 SSD KV Cache 和 Continuous Batching 等专业功能,但 Ollama 在跨平台兼容性和更广泛的模型生态系…