PulseAugur
实时 12:10:05
实体 mill

mill

PulseAugur coverage of mill — every cluster mentioning mill across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_192291 ·

    用户通过KVarN量化在17GB模型上实现100万上下文窗口

    Reddit的r/LocalLLaMA论坛上一位用户报告称,他成功加载了一个拥有100万token上下文窗口的大型语言模型,在24GB显存的显卡上使用了约17GB显存。这是通过一个基于Qwen的350亿参数模型实现的,使用了KVarN 4位量化方法来处理KV缓存。该用户能够从文本的各个部分提取信息,表明上下文窗口是功能性的,并且没有损坏。

  2. TOOL · CL_164268 ·

    BeeLlama.cpp v0.4.1 通过 KVarN 和精度尾部增强 KV 缓存量化

    BeeLlama.cpp 发布了 0.4.1 版本,对 KV 缓存量化进行了重大增强。更新包括 KVarN,可在性能略有折衷的情况下提高每比特精度,以及 KV 缓存精度尾部 (KVPT),允许最近的 token 无损存储,其余的则进行量化。此外,还添加了 q6_0、q6_1、q2_0、q2_1、q3_0 和 q3_1 等新的量化类型,以在精度和 VRAM 使用之间提供更大的灵活性。

  3. TOOL · CL_151301 ·

    BeeLlama.cpp v0.4.0 增加了 KVarN 和 KV 缓存精度尾部

    BeeLlama.cpp 发布了 v0.4.0 版本,这是对其 llama.cpp 分支的重要更新。此次发布专注于增强 KV 缓存量化功能,引入了 KVarN 以提高每比特的精度,并增加了 KV 缓存精度尾部,将最近的 token 以更高精度格式存储。更新还增加了新的标准 KV 缓存量化类型,如 q6_0 和 q6_1,在平衡精度和 VRAM 使用方面提供了更大的灵活性。虽然 KVarN 和精度尾部等功能仍在针对 SWA 等特定架构进…

  4. RESEARCH · CL_77183 ·

    AI代理在服务、测量和输入方面涌现成本压缩技术

    AI代理生态系统正在快速开发成本压缩技术,在一周内出现了三个不同的领域。KVarN,由华为开发的vLLM推理服务器的新后端,专注于通过优化KV缓存量化来实现模型服务压缩。Cost.dev已推出功能,使AI代理更具成本意识,允许开发人员在实施优化之前衡量和了解其支出。此外,处理输入压缩的chopratejas/headroom存储库的采用速度显著加快,表明人们对减少AI运行时账单的兴趣日益浓厚。

  5. TOOL · CL_73448 ·

    开发者在 llama.cpp 分支中实现 KVarN KV 缓存压缩

    一位开发者在 llama.cpp 项目的一个分支 BeeLlama.cpp 中实现了华为的 KVarN KV 缓存量化技术。该实现允许用户将 KV 缓存压缩 3-5 倍,旨在减少 VRAM 使用量,同时不显著影响模型性能。初步基准测试表明,KVarN 在仅使用 3.5 位的情况下提供了与 4 位量化相当的质量,但速度提升仍在开发中。

  6. RESEARCH · CL_71433 ·

    华为 KVarN 增强 vLLM KV 缓存以获得更大的 AI 上下文

    华为发布了 KVarN,这是 vLLM 框架的一个新后端,可增强 KV 缓存量化。这项创新旨在显著增加上下文窗口大小,有消息称可提高 35 倍。KVarN 旨在优化 AI 代理的性能,尤其是在 GitHub 等复杂环境中。