PulseAugur
实时 03:05:05
实体 SGLang

SGLang

PulseAugur coverage of SGLang — every cluster mentioning SGLang across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
79
90 天内 241
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 34
层级分布 · 90 天
主题
关系
时间线
  1. 2026-08-22 product_launch SGLang released version v0.5.18, featuring 710 pull requests from 212 contributors. 来源
  2. 2026-08-22 product_launch SGLang released version 0.5.18. 来源
  3. 2026-07-25 product_launch SGLang released version 0.5.16, including the new DSpark speculative decoding algorithm. 来源
  4. 2026-07-23 controversy A critical vulnerability, CVE-2026-14890, was disclosed in SGLang, enabling unauthenticated remote code execution. 来源
  5. 2026-06-20 product_launch SGLang and MUSA merge backends, enabling native GPU support for China's open-source AI ecosystem. 来源
  6. 2026-01-09 product_launch SGLang released version 0.3.1 of its model gateway, featuring performance and memory improvements. 来源
情绪 · 30 天

28 天有情绪数据

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_214400 ·

    NInfer 分叉版在 CMP170HX 硬件上实现了 Qwen3.6-35B 性能翻倍

    一位用户成功分叉了 NInfer 项目,使其能够在 CMP170HX 硬件上运行,并为 Qwen3.6-35B 模型实现了两倍的性能提升。此修改涉及调整 CUDA 内核和编译器标志,以适应 CMP170HX 的特定架构,这与它最初基于的 RTX 3090 不同。用户强调了本地 AI 社区其他开发者的贡献,并详细介绍了为实现这一性能提升所克服的技术挑战,包括内核启动大小错误和工作区大小调整。

  2. TOOL · CL_213874 ·

    SGLang v0.5.18 发布,拥有 212 位贡献者的 710 个 PR · 跟踪 2 个来源

    SGLang 发布了 0.5.18 版本,这是一个重要的更新,包含来自 212 位贡献者的 710 个拉取请求。这种快速的开发节奏凸显了 LLM 推理栈的快速发展特性。该版本还指出,该项目已获得 32,263 颗星,表明社区的浓厚兴趣和参与度。

  3. TOOL · CL_212471 ·

    Alibaba Qwen 为 Qwen3.8-27B 模型发布新食谱,支持 NVFP4 和 DFlash2

    Alibaba 的 Qwen 团队为其 Qwen3.8-27B 模型发布了新食谱,集成了 NVFP4 和 DFlash2 技术。这些食谱现已在 SGLang 食谱中提供,为用户提供了实验的起点。该团队表示,未来还将为 Qwen3.8-27B 模型提供进一步的更新。

  4. SIGNIFICANT · CL_211527 ·

    Liquid AI 通过 DSpark 投机性解码将 LFM2.5 模型速度提升高达 3.18 倍

    Liquid AI 发布了其 LFM2.5 系列的 DSpark 草稿模型,这些模型在不改变输出质量的情况下,将解码速度提高了高达 3.18 倍。该方法使用投机性解码,其中一个较小的草稿模型提出代币候选,然后由一个较大的目标模型进行验证。这种方法显著加快了推理速度,尤其适用于延迟至关重要的代理应用。这些模型可供自托管,并兼容 llama.cpp 和 SGLang 等工具。

  5. TOOL · CL_213059 ·

    EschaLabs 发布面向消费级 GPU 的 2 位量化 Qwen3.8-27B 模型

    EschaLabs 发布了 Qwen3.8-27B 模型的 2 位量化版本,命名为 Escha-W2。新版本将模型大小显著减小至 10.15 GB,使其能够装入单块 24 GB 消费级 GPU,并支持 64k 上下文窗口。性能基准测试表明,Escha-W2 在常识推理方面具有与其 FP8 版本相当的竞争力,甚至超越了后者,在 LiveCodeBench 上与之持平,但在 GPQA-Diamond 上的性能略有下降。

  6. TOOL · CL_208707 ·

    Mistral 发布自托管 3B 审核模型 Shieldstral 1.0

    Mistral 发布了 Shieldstral 1.0,这是一款拥有 30 亿参数、专为自托管文本和图像内容审核设计的模型。该模型在 Apache 2.0 许可下提供,并包含完整权重,可在单块 16GB GPU 上运行,并可与常见的推理栈集成。其主要特点是“策略自适应”审核,允许用户通过自然语言提示定义审核规则,而无需重新训练。尽管 Mistral 报告了强劲的基准分数,但这些分数尚未得到独立验证,且该模型专注于审核而非通用任务。

  7. RESEARCH · CL_208342 ·

    Inco AI 发布 DFlash 2 以加快 LLM 推理速度

    Inco AI 发布了 DFlash 2,这是大型语言模型(LLM)投机解码的一项进展。新版本在原始 DFlash 的并行草稿方法的基础上,通过最小的延迟增加,将每次验证的输出提高了 20% 以上。DFlash 2 旨在通过在单次传递中优化 token 预测和选择,来提高推理效率,这是 AI 代理的一个关键瓶颈。

  8. TOOL · CL_206863 ·

    开发者详解在双RTX 3090上设置Qwen3.8-27B

    一位开发者详细介绍了在没有NVLink的双RTX 3090配置上运行Qwen3.8-27B模型所需的广泛故障排除工作。使用vLLM和SGLang的初步尝试遇到了重大问题,包括编译错误、依赖冲突和模型加载失败,尤其是在量化检查点方面。通过将CUDA 13.0与SGLang 0.5.17匹配并应用特定的无NVLink和内存相关补丁,终于取得了突破。进一步的优化包括使用DSpark进行推测解码,这显著提高了令牌生成速度。

  9. FRONTIER RELEASE · CL_209297 ·

    Ornith AI 发布 Ornith-1.5 模型系列,专注于自我改进

    Ornith AI 发布了 Ornith-1.5 模型系列,其中包括一个 9B 的密集模型以及 35B 和 397B 的混合专家(MoE)变体。这些模型旨在实现自我改进,并在推理、编码和代理任务等各种基准测试中表现出与 Claude Opus 4.8 等成熟模型相媲美的性能。这些模型可在 Hugging Face 上获取,并兼容 Transformers、llama.cpp、vLLM 和 SGLang 等流行推理工具,并提供了集成说明。

  10. TOOL · CL_206099 ·

    MAPLE框架优化MoE LLM专家分配以提高效率

    研究人员开发了MAPLE,一个新颖的框架,旨在优化混合专家(MoE)Transformer模型中专家的分配。与将专家均匀分布在所有层中的传统方法不同,MAPLE根据层级敏感性自适应地重新分配专家预算。这种即插即用方法在不改变模型权重或需要重新训练的情况下提高了性能。实验表明,MAPLE在DeepSeek-MoE-16B等模型上提高了准确性,并显著降低了服务延迟和提高了吞吐量。

  11. TOOL · CL_215497 ·

    orcarouter/Qwen3.8-27B-Uncensored 多模态模型在 Hugging Face 上发布

    orcarouter/Qwen3.8-27B-Uncensored 模型现已在 Hugging Face 上提供,具备多模态能力。提供了使用 Transformers 和 vLLM 等流行库集成该模型的说明,以及通过 SGLang 和 Docker 进行部署的选项。此次发布旨在简化 Qwen3.8-27B-Uncensored 模型在各种应用中的使用,包括图像到文本生成。

  12. COMMENTARY · CL_204638 ·

    SGLang 为主要的 AI 推理提供支持,尽管 vLLM 的 GitHub 星标更高 · 跟踪 1 个来源

    选择用于自托管大型语言模型的推理引擎对于运营效率和成本至关重要,其中 vLLM、SGLang 和 TensorRT-LLM 是主要竞争者。尽管 vLLM 的 GitHub 星标数量更高,但 SGLang 正在为 xAI 的 Grok 和 Microsoft Azure 的 DeepSeek R1 等重要部署提供支持,这凸显了社区受欢迎程度与生产使用之间的差异。这一决定会影响 GPU 利用率、延迟、硬件灵活性和工程工作量,特别是随着涉及…

  13. TOOL · CL_205398 ·

    Hugging Face 托管 huihui-ai 新的多模态 Qwen 模型

    Hugging Face 正在托管来自 huihui-ai 的两个新的多模态模型:Huihui-Qwen3.8-27B-abliterated-GGUF 和 Huihui-Qwen3.8-27B-abliterated。这些模型专为图像到文本和文本到图像生成任务而设计。提供了将它们与 Transformers 等流行库以及 vLLM 和 SGLang 等推理提供商以及 llama.cpp、LM Studio 和 Jan 等本地应用程序集成的说明。

  14. RESEARCH · CL_209381 ·

    Qwen3.8-27B-DFlash2 模型已通过两个 Hugging Face 仓库提供

    Hugging Face 上出现了两个不同的仓库,incoai/Qwen3.8-27B-DFlash2-GGUF 和 z-lab/Qwen3.8-27B-DFlash2-GGUF,均提供 Qwen3.8-27B-DFlash2 模型。这些模型被设计为用于推测性解码的草稿模型,旨在与 llama.cpp、vLLM 和 Ollama 等库配合使用。DFlash 2 技术旨在通过预测 token 块来提高解码速度,并提供了集成到各种推理提供…

  15. TOOL · CL_203340 ·

    新版未经审查的多模态大语言模型AEON-7/Qwen3.8-27B在Hugging Face上发布

    一款新的多模态大语言模型AEON-7/Qwen3.8-27B-AEON-ULTIMATE-UNCENSORED-BF16已在Hugging Face上发布。该模型是Qwen/Qwen3.8-27B的未经审查版本,经过优化以提高连贯性和响应质量。提供了将该模型与Transformers等流行库以及vLLM和SGLang等推理引擎集成的说明和代码示例,使其能够在包括Google Colab和Kaggle在内的各种应用程序和环境中使用。

  16. TOOL · CL_204808 ·

    Empero AI 发布 Qwen3.8-9B 模型,支持广泛的框架兼容性

    Empero AI 在 Hugging Face 上发布了其 Qwen3.8-9B 模型的多个版本,包括基础版、蒸馏版和量化版。这些模型旨在兼容 llama.cpp、vLLM、Ollama 和 Transformers 等多种流行的推理框架。此次发布提供了详细的说明和代码片段,用于将这些模型集成到不同的开发环境中,从本地应用程序到云端笔记本。

  17. SIGNIFICANT · CL_201694 ·

    Qwen3.8-27B 开源模型在基准测试中可与 Claude Opus 相媲美

    Qwen 发布了其 Qwen3.8-27B 模型,这是一个开源模型,在各种基准测试中,尤其是在编码和代理任务方面,其性能可与 Claude Opus 4.6 Max 等更大、专有的模型相媲美。这个拥有 270 亿参数的模型设计用于在消费级 GPU 上运行,提供 262K 的原生上下文窗口,可扩展至 100 万个 token。它还具有原生多模态能力,能够处理图像、PDF 甚至视频,并具有可定制的推理深度以提高效率。

  18. TOOL · CL_204434 ·

    Hugging Face 托管 Qwen3.8-27B 模型变体并提供集成指南

    Hugging Face 正在托管 DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN 模型的多个版本,包括一个 "GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF" 变体。该平台提供了详细的说明和代码片段,用于将这些模型与各种流行的推理工具(如 llama.cpp、vLLM、Ollama 和 LM Studio)集成。用户还可以找到在 Google Colab 和 Kaggle 等开发环境以及…

  19. SIGNIFICANT · CL_200937 ·

    阿里巴巴的Qwen3.8-27B模型在RTX 5090上达到206 tok/s

    阿里巴巴的Qwen团队发布了Qwen3.8-27B,这是一个开源的小型模型,取得了令人印象深刻的性能指标。该模型在使用NVFP4和DSpark优化的情况下,在单块RTX 5090 GPU上解码速度达到每秒206.1个token。此次发布还包括SGLang的Day-0支持,SGLang是一个促进模型高效执行的项目。

  20. TOOL · CL_215644 ·

    腾讯在Hugging Face上发布UI-Mate-27B多模态模型

    tencent/UI-Mate-27B模型已在Hugging Face上发布,提供用于图像和文本处理的多模态能力。该模型可以与Transformers和vLLM等流行库集成,并提供了各种部署场景的说明,包括Google Colab、Kaggle以及通过Docker进行本地应用程序部署。它还支持通过SGLang进行推理,SGLang是另一种服务框架。