实体
TheBloke
TheBloke
PulseAugur coverage of TheBloke — every cluster mentioning TheBloke across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
LLM用户寻求关于比较来自不同来源的量化模型的指导
r/LocalLLaMA subreddit上的用户正在寻求关于如何有效比较和管理来自各种来源的量化大型语言模型(LLM)的指导。主要挑战在于变量过多,包括不同的发布者、GGUF和GPTQ等量化格式,以及温度和top-k等模型参数。参与者正在寻找简化评估过程的策略,由于下载和配置要求,这个过程非常耗时,以确定性能最佳的模型。
-
Rust 引擎在廉价虚拟机上流式传输 Mixtral 8x7B
一款名为 MER 的新 Rust 推理引擎能够从 NVMe 存储高效地流式传输大型语言模型(如 Mixtral 8x7B)到性能较低且更便宜的虚拟机上。这种方法通过按需加载模型专家、将常用模型缓存到 RAM 中,避免了对高端 GPU 的需求,并在每小时 0.40 美元的虚拟机上实现了 3.32 tps 的速度。该引擎展示了 15.56% 的缓存命中率,目前受 CPU 限制,并计划集成 GPU 推理以获得进一步的性能提升。