SGLang
PulseAugur coverage of SGLang — every cluster mentioning SGLang across labs, papers, and developer communities, ranked by signal.
- 2026-10-02 product_launch SGLang released version 0.5.21, adding support for DeepSeek-V4.1 Flash. 来源
- 2026-09-05 product_launch SGLang released version 0.5.19, featuring a large number of contributions. 来源
- 2026-08-22 product_launch SGLang released version v0.5.18, featuring 710 pull requests from 212 contributors. 来源
- 2026-08-22 product_launch SGLang released version 0.5.18. 来源
- 2026-07-25 product_launch SGLang released version 0.5.16, including the new DSpark speculative decoding algorithm. 来源
- 2026-07-23 controversy A critical vulnerability, CVE-2026-14890, was disclosed in SGLang, enabling unauthenticated remote code execution. 来源
- 2026-06-20 product_launch SGLang and MUSA merge backends, enabling native GPU support for China's open-source AI ecosystem. 来源
- 2026-01-09 product_launch SGLang released version 0.3.1 of its model gateway, featuring performance and memory improvements. 来源
17 天有情绪数据
-
本地 LLM 运行时显示不一致的工具调用解析器支持
对四个流行的本地 LLM 运行时——Ollama、llama.cpp、vLLM 和 SGLang——的最新分析显示,它们在支持各种模型系列的工具调用方面存在不一致。虽然这些运行时总共提供了 136 个命名的工具调用解析器,但在所有四个运行时中,只有 8 个支持的模型系列拥有专用的解析器。这些解析器的文档通常滞后于代码更新,许多解析器出现在代码中但未出现在官方文档中。
-
VisionWeave 使多模态大语言模型能够自适应地分配视觉表示,节省 token 并提高性能
研究人员开发了 VisionWeave,一种用于多模态大语言模型(MLLMs)的新方法,该方法允许它们根据内容自适应地分配视觉表示。这种方法与当前使用固定大小 token 的方法形成对比,后者可能导致细节丢失。VisionWeave 结合了门控空间池化器和粒度路由器,以实现内容自适应粒度和提高效率。在 Qwen3.5-4B 上进行测试并扩展到 Qwen3.8-27B 后,VisionWeave 在八个基准测试中平均节省了 43% 的 …
-
FluidPD 系统通过原地弹性增强 LLM 服务
研究人员开发了 FluidPD,一个旨在提高大型语言模型 (LLM) 服务效率和可靠性的新系统。FluidPD 通过引入原地弹性来应对 LLM 推理的预填充和解码阶段之间不断变化的需求的挑战。该系统使用 FluidToken 和 FluidRole 等机制,无需额外硬件即可动态调整资源和工作角色,从而在满足延迟服务水平目标 (SLO) 方面取得显著改进。
-
开放权重模型 apex-flash-1 应对安全研究任务
Cantina Security 与 Yeta Labs 合作推出了 apex-flash-1,这是一个专门为漏洞研究设计的开放权重大型语言模型。该模型是 GLM-5.3-Flash 的微调版本,在 60 个预留的 bug 任务上达到了 66.7% 的通过率,展示了其在安全研究方面的能力。虽然其表现略低于 Anthropic 的 Claude Opus 5 High,但 apex-flash-1 的成本效益显著,运行成本约为 2.38…
-
SGLang v0.5.21 发布,支持 DeepSeek-V4.1 Flash
SGLang 发布了 0.5.21 版本,这是一个重要的里程碑,拥有 227 位个人贡献的 779 个拉取请求。此次发布引入了对 DeepSeek-V4.1 Flash 的支持,彰显了强大的社区参与度。该项目强调其活跃贡献者群体产生的难得的发展势头。
-
新的推理拍卖系统可高效分配LLM API计算资源
研究人员开发了一种新颖的推理拍卖系统,旨在高效分配LLM API请求有限的计算能力。该拍卖允许用户竞价以获得更快的服务,通过适应用户对延迟的不同容忍度,解决了当前固定价格层级的局限性。该系统旨在最大化经济效率和用户效用,甚至包含一个自动竞价代理,可在指定预算内动态调整出价。实验表明,这种拍卖方法与SGLang推理服务框架集成后,在保持缓存利用率和延迟的同时,提高了系统福利。
-
Cloudflare发布开源Clef模型,加速AI代理决策
Cloudflare发布了两款新的开源模型Clef和Clef-flash,专为AI代理决策而设计。这些模型基于Qwen,并针对速度进行了优化,Clef-flash能够在大约39毫秒内完成分类。与传统的生成模型不同,Clef和Clef-flash从预定义集合中选择响应并分配概率,使其成为自主代理工作流的更快替代方案。
-
新方法提高 LLM 的推测解码效率 · 已追踪 10 个来源
多篇研究论文介绍了增强大型语言模型 (LLM) 推测解码的新方法,旨在提高效率和准确性。DRelay 专注于使用全局上下文修复并行草稿中的早期选择错误,而 DEdit 提出对草稿进行迭代编辑以纠正错误并扩展已接受的前缀。UBTree 结合了 unigram 和 bigram 模型来创建多样化的草稿树,而 LongSpark 开发了一种独立于前缀长度的固定成本并行草稿器。其他方法,如 SEED 重用已验证的上下文表示以加快草稿速度,HA…
-
Glean 发布 Jev,一款用于类型化决策的零样本分类模型
Glean 推出了 Jev,一款“System One”模型,专为分类和评分等类型化决策而设计,通过托管 API 提供零样本灵活性。尽管一些人认为 Jev 是现有技术的翻版,但它的价值在于使用户无需重新训练即可更改问题和选项,并避免了自托管模型的复杂性。Glean 的内部测试表明,Jev 在重新排序任务上的表现具有竞争力,并且在某些情况下,在查询分类的成本和延迟方面优于基于 LLM 的路由器。
-
Galahad 内存层使 LLM 读取成为一次性成本
研究人员开发了 Galahad,这是一种新颖的内存层,旨在使大型语言模型 (LLM) 读取成为一次性成本,从而显著提高 LLM 服务效率。Galahad 通过保存和加载模型的键值 (KV) 状态来解决无状态服务的问题,防止对已处理文本进行重复计算。这项创新将 LLM 服务从无状态推理模型转变为有状态推理模型,在召回测试中速度和能耗方面得到了显著改善。
-
BAAI/AREX-2 多模态模型在 Hugging Face 上发布
BAAI/AREX-2 模型现已在 Hugging Face 上可用,提供图像和文本处理的多模态能力。该模型可以与 Transformers 和 vLLM 等流行库集成,并提供了通过 Hugging Face 的 Docker 镜像、vLLM 和 SGLang 进行部署的说明。此次发布旨在简化 AREX-2 在各种平台和应用程序中对开发者的使用。
-
Autotrust发布具有快速视觉能力的JEV多模态模型
Autotrust已发布两款新的多模态模型JEV-27B-VL和JEV-9B,可在Hugging Face上获取。JEV-27B-VL专为图像到文本任务设计,可与Transformers、vLLM和SGLang等库集成。JEV-9B模型是Qwen3.5-9B的演进版本,集成了“系统1”快速决策层和“系统2”推理层,使其能够以惊人的速度和准确性执行机器人手臂操作和计算机界面控制等视觉任务。
-
Nvidia 发布 GLM-5.3,支持 1M 上下文和 MoE 架构
Nvidia 发布了 GLM-5.3,这是一款采用混合专家(MoE)架构的新模型,拥有 7530 亿总参数和 400 亿活跃参数。该模型采用稀疏 Attention 机制,支持 100 万个 token 的上下文窗口。通过 Model Optimizer 进行量化,将内存需求降低了 1.66 倍,允许在 Blackwell B300 平台上使用 SGLang 进行推理。
-
Xing4.0-29B-A4B-GGUF 模型在 Hugging Face 上发布,并附带集成指南
Venastine-Research/Xing4.0-29B-A4B-GGUF 模型现已在 Hugging Face 上提供,为用户提供详细的集成说明。该模型可与 Transformers 等流行库以及 llama.cpp、LM Studio、Jan、vLLM 和 SGLang 等推理提供商一起使用。提供的文档包括适用于 Google Colab、Kaggle 和通过 Winget 在 Windows 上等各种平台的代码片段和设置指南。
-
LLM调谐器PolyServe揭示bug,通过量化提升性能
一个名为PolyServe的开源LLM调谐器被开发出来,用于优化模型服务配置。基准测试揭示了该调谐器假设中的几个缺陷,包括一个未能强制执行其预期功能的质量门,以及一个排除了最快配置的搜索空间。该调谐器在跨不同硬件设置泛化多GPU性能方面也遇到了问题。在修复了这些bug之后,该调谐器证明使用预量化检查点可以显著提高吞吐量,尽管仍需要仔细评估答案质量的影响。
-
XingChen-AGI 发布 Xing4.0-29B-A4B,支持 256K 上下文长度
XingChen-AGI 发布了 Xing 系列(前身为 TeleChat)的新大型语言模型 Xing4.0-29B-A4B。该模型拥有 290 亿参数,但每个 token 仅激活 40 亿参数,实现了 256K 的原生上下文长度,可扩展至 512K。值得注意的是,该模型完全在 Ascend NPU 平台上使用 MindSpore 框架进行训练,并针对复杂的工程任务进行了优化,采用了面向代理的架构,并与 Ascend 硬件进行了深度协…
-
AMD MI355X 通过 SGLang 和 UMBP 集成缩小了与 GB300 的性能差距 · 跟踪 3 个来源
SemiAnalysis 报道称,AMD 的 MI355X 在代理推理性能和总拥有成本方面正在迅速提高,接近 GB300 的水平。这一进步归功于 AMD 的 SGLang 团队及其 MoRI 库,Universitas Mandiri Bina Prestasi (UMBP) 也做出了重要贡献。UMBP 作为 KV 卸载后端集成到 SGLang 中,特别是通过 KVCache Store Linker,优化了 High Bandwid…
-
LLMeter CLI 衡量本地硬件上的 LLM 性能
LLMeter 是一款新的命令行界面工具,旨在衡量大型语言模型 (LLM) 在用户特定硬件和配置上的性能。与在优化过的远程机器上测试模型的传统排行榜不同,LLMeter 侧重于实际运行环境,考虑了量化、提供商软件(例如 Ollama、LM Studio)和硬件特定因素。它提供了用于聊天生成、响应一致性、计时、结构化输出和工具调用的各种基准测试,并为调整部署提供了额外的性能配置文件。
-
AgentKV通过面向阶段的KV驱逐提高了LLM效率
研究人员开发了AgentKV,一种用于管理Agentic大型语言模型(LLM)中KV缓存的新方法。AgentKV解决了传统KV驱逐方法(依赖最近的token)未能考虑Agentic LLM在思考、行动和工具使用等不同阶段的多样化查询模式的问题。通过为每个阶段维护单独的查询缓冲区,AgentKV可以更有效地对相关缓存键进行评分和保留。与R-KV和Tri-attention等现有方法相比,这种方法提高了任务性能并增加了输出token吞吐量…
-
蚂蚁集团推出SingProbe,一款过程内AI安全护栏
蚂蚁集团推出了SingProbe,一个内部开发的旨在将风险检测直接集成到AI模型生成过程中的安全系统。这种方法旨在以最小的开销识别不安全内容和事实错误,据报道在解码阶段的额外成本不到0.5%。SingProbe已适配29个开源模型,并支持SGLang和vLLM等推理框架,代码和基准测试现已公开。