PulseAugur
实时 05:13:05
实体 ExLlamaV3

ExLlamaV3

PulseAugur coverage of ExLlamaV3 — every cluster mentioning ExLlamaV3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
时间线
  1. 2026-07-15 product_launch ExLlamaV3 has released version 1.0.0, introducing significant performance upgrades and new features. 来源
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_231196 ·

    ExLlamaV3 因其出色的速度和性能而受到赞扬

    一位 Reddit 用户分享了他们对新测试模型 ExLlamaV3 的积极体验。他们报告称,在 8x3090 配置上运行 GLM 5.3 Flash 时,预填充速度达到惊人的 700 tokens/秒,解码速度达到 42 tokens/秒。该用户还指出,该模型在处理超过 3000 万个 token 时表现良好,并对 ExLlamaV3 等社区驱动的项目表示感谢。

  2. TOOL · CL_145030 ·

    ExLlamaV3 v1.0.0 发布,带来重大性能升级

    ExLlamaV3 项目发布了 1.0.0 版本,标志着经过一年多的开发后取得了重大的性能升级。此次发布引入了具有先进量化和缓存的新注意力内核,改进了 Ampere 硬件上的 GEMM/GEMV 性能,并为 INT8 和 MoE 操作提供了新的内核。ExLlamaV3 现在还支持更广泛模型的张量并行,包括 Gemma4,并且移除了对 flash-attention-2 和 xformers 的依赖。

  3. TOOL · CL_27223 ·

    ExLlamaV3、Unsloth Qwen 和 Phi3 代理迎来重大本地 AI 更新

    本周的本地 AI 新闻重点介绍了 ExLlamaV3 推理库的重大更新,提高了在消费级 GPU 上运行量化 Llama 模型时的效率。此外,通过 Unsloth 提供了 Qwen 3.6 模型的新 GGUF 量化版本,使其更容易在本地使用。该集群还展示了一个创新项目,该项目使用 Phi3 模型创建一个能够控制用户主计算机的自主代理。