PulseAugur
实时 19:31:01
实体 BeeLlama

BeeLlama

PulseAugur coverage of BeeLlama — every cluster mentioning BeeLlama across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
时间线
  1. 2026-05-23 product_launch BeeLlama released version 0.2.0, showcasing significant inference speedups using speculative decoding on consumer hardware.
  2. 2026-05-22 product_launch BeeLlama v0.2.0 was released, significantly improving LLM inference speeds on consumer hardware.
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_71888 ·

    BeeLlama v0.3.1 通过 DFlash, MTP 提升本地 LLM 性能

    BeeLlama v0.3.1,一个 llama.cpp 的分支版本,已发布并带来了显著的性能提升。此次更新集成了 DFlash、多线程处理 (MTP) 以及 q6_0 缓存和 TurboQuant 等新的量化选项。在单块 RTX 3090 上的基准测试显示速度大幅提升,Qwen 3.6 27B 和 Gemma 4 31B 模型达到了 177.8 tps,比基线提高了 4.93 倍。

  2. TOOL · CL_48200 ·

    BeeLlama、ByteShape 提升消费级硬件上的本地 LLM 推理速度

    本地 LLM 推理的新进展正在提升消费级硬件上的性能。BeeLlama v0.2.0 版本利用 DFlash 更新,显著提高了 Qwen 和 Gemma 等模型在 RTX 3090 等 GPU 上的令牌生成速度,速度提升高达 5 倍。此外,ByteShape 量化正在改善 Qwen 模型在显存有限的笔记本电脑上的性能,提供了显著的速度提升。这些进展旨在使更大、更强大的开放权重模型在日常本地使用中变得实用。