PulseAugur
中
实时 13:31:13
实体 Sarathi-Serve

Sarathi-Serve

PulseAugur coverage of Sarathi-Serve — every cluster mentioning Sarathi-Serve across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_281860 ·

    LLM 服务拆分为两个阶段,GPU 通量加倍

    现代 LLM 服务架构正通过将过程拆分为两个不同的阶段来更有效地处理请求:预填充(prefill)和解码(decode)。预填充阶段处理整个提示,是计算密集型的,受益于高 GPU 利用率。解码阶段负责逐个生成 token,是内存带宽密集型的,需要高效的 KV 缓存管理。PagedAttention、连续批处理(continuous batching)和分块预填充(chunked prefill)等创新对于优化这些阶段至关重要,而分离式…

  2. TOOL · CL_206491 ·

    LLM服务调度器扩展以支持多层SLA

    研究人员扩展了Llumnix LLM服务调度器,使其支持两个以上的优先级层,从而能够更好地管理异构的服务等级目标(SLO)。通过Vidur模拟器对增强型调度器进行了评估,结果表明在多个优先级层面上,成本效益和延迟降低方面都有显著提高。实验表明,四个优先级层提供了最佳的权衡,与INFaaS、vLLM、Orca和Sarathi-Serve等基线系统相比,实现了显著的加速和每延迟成本的改进。

  3. RESEARCH · CL_36289 ·

    LLM 推理和推理技术随着新研究和硬件的进步而发展

    研究人员正在探索新的方法来提高大型语言模型 (LLM) 的效率和推理能力。Google Research 正在开发训练 LLM 以贝叶斯方式进行推理的技术,从而提高它们更新概率估计和泛化到新任务的能力。同时,推理优化方面的进展包括“投机级联”,它将更小、更快的模型与更大的模型结合起来,以及“上下文回收”来管理长对话范围。此外,正在开发“级联多粒度剪枝”和“SharQ”等方法来压缩 LLM 以进行设备上推理,从而在保持准确性的同时降低延…