PulseAugur
中
实时 23:18:35
实体 Llm D

Llm D

PulseAugur coverage of Llm D — every cluster mentioning Llm D across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
时间线
  1. 2026-08-01 product_launch The open-source project llm-d has released version v0.7. 来源
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. TOOL · CL_277056 ·

    Kubernetes LLM 服务:拥挤的领域与关键的差距已识别

    在 Kubernetes 上部署大型语言模型的服务领域正在迅速发展,许多曾经开放的挑战现在已被资金雄厚的项目和标准所解决。KV 缓存感知路由、预填充/解码分离、分数 GPU 共享和基本 GPU 调度原语等领域正变得拥挤。然而,仍然存在显著的差距,特别是在将模型权重分发视为一等 Kubernetes 原语方面,这目前会导致漫长的冷启动时间。

  2. TOOL · CL_248527 ·

    llm-d 增强 Kubernetes 以支持 LLM 推理

    一个名为 llm-d 的新开源项目旨在弥合 Kubernetes 的编排能力与大型语言模型 (LLM) 推理的特定需求之间的差距。llm-d 作为现有工具(如 vLLM 和 Kubernetes)之上的一个层,引入了新的对象和行为,使编排能够感知推理。它通过考虑缓存局部性和服务级别协议等因素来增强调度,并允许将预填充和解码阶段分离到不同的 GPU 池上。

  3. TOOL · CL_247801 ·

    Kubernetes-Native CXL Memory Enhances LLM Serving Efficiency

    研究人员开发了一个Kubernetes动态资源分配(DRA)驱动程序,使可组合CXL内存能够作为LLM服务可调度的集群资源。该系统支持跨节点KV缓存重用,在Qwen2.5-7B-Instruct的测试中,将首次令牌时间(TTFT)显著缩短了高达36.6倍。该研究证明了内存分离的可行性,与同节点重用相比,跨节点重用的延迟影响极小。

  4. COMMENTARY · CL_199046 ·

    Red Hat AI 的 vllm 和 llm-d 团队因其推理专业知识而受到赞誉

    SemiAnalysis 强调了 Red Hat AI 的 vllm 项目和 llm-d 维护者们的卓越工作,承认他们是推理领域的顶尖专家。该帖子特别赞扬了 Robert Shaw 和 Mariléia Goin 等人的乐于助人和友善。SemiAnalysis 对有机会与这些人合作表示感谢。

  5. TOOL · CL_184646 ·

    使用 llm-d 和 SGLang 上的异构 E/PD 扩展 Kimi-VL 模型

    本文详细介绍了扩展支持视觉的 Kimi-VL 模型的技​​术进展。通过在 llm-d 和 SGLang 框架上实现的异构 E/PD(执行/处理分布)方法实现了扩展。此方法旨在提高大型语言模型(尤其是具有多模态能力的模型)的效率和性能。

  6. SIGNIFICANT · CL_179979 ·

    GLM-5.2 模型发布,用于 llm-d 上的 Agentic Workloads

    新模型 GLM-5.2 现已在 llm-d 平台上可用于 Agentic Workloads。此次发布专注于增强 AI 代理的功能。

  7. TOOL · CL_176772 ·

    llm-d v0.7 发布,重点关注生产加固

    开源项目llm-d发布了v0.7版本,重点关注从初始功能实现到健壮的生产加固的转变。此次更新旨在提高系统在实际应用中的稳定性和可靠性。

  8. TOOL · CL_113353 ·

    llm-d 路由层将 AWS EKS 上 Qwen 7B 的推理速度提升 2.3 倍

    一个名为 llm-d 的新路由层在 LLM 推理方面取得了显著的速度提升,特别是在 AWS EKS 上使用 Qwen2.5-7B-Instruct 模型时。通过智能地将请求路由到可能已经缓存了必要前缀数据的 vLLM 副本,llm-d 将基准测试完成时间缩短了一半以上,吞吐量增加了一倍多。这种方法解决了当请求在副本之间随机分布时重复前缀计算的低效率问题,从而大大缩短了首次令牌的平均时间。

  9. TOOL · CL_41948 ·

    Google为LLM赋能OSS生产Kubernetes推理

    Google通过为llm-d添加夜间CI,增强了其开源生产Kubernetes推理能力。这一发展被视为朝着在生产环境中更广泛地采用大型语言模型迈出的重要一步。