PulseAugur
实时 20:59:35
实体 LLM Serving

LLM Serving

PulseAugur coverage of LLM Serving — every cluster mentioning LLM Serving across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_259406 ·

    FairInference 系统为多租户 LLM 服务提供新颖的延迟隔离

    研究人员推出 FairInference,一个旨在为多租户 LLM 服务提供强大延迟隔离的新颖系统。与专注于吞吐量公平性的现有解决方案不同,FairInference 保证了一个行为良好的客户端的 token 生成时间不会超过其隔离的生成时间超过指定的 delta ($\delta$)。这是通过强制执行每个 token 的截止日期以及管理来自共享 GPU 资源和 KV 缓存的延迟来实现的。该系统旨在防止一个客户端的高需求工作负载降低其…

  2. RESEARCH · CL_128697 ·

    新的LLM路由框架使用在线线性规划优化性能 · 跟踪2个来源

    已开发出一种新的在线线性规划框架,用于优化大型语言模型(LLM)服务的路由。该方法采用多目标优化策略来平衡延迟、吞吐量和其他服务级别目标(SLO),其性能优于基于启发式的方法。该系统专为毫秒级决策而设计,并在集成到模拟器后在各种性能指标上显示出显著的改进。

  3. RESEARCH · CL_72499 ·

    新系统应对LLM长上下文服务瓶颈

    两篇新研究论文介绍了管理KV缓存的新方法,KV缓存是在服务具有长上下文的大型语言模型时的关键瓶颈。RedKnot提出了一种头感知的KV缓存管理系统,该系统根据注意力头的注意力和有效范围对缓存进行分解,从而提高资源效率和可扩展性。TokenMizer将对话历史建模为图结构知识图,通过保留关系结构实现了显著的令牌经济和更高的决策召回率。