PulseAugur
实时 15:45:58
实体 q4_k_xl

q4_k_xl

PulseAugur coverage of q4_k_xl — every cluster mentioning q4_k_xl across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_208339 ·

    DeepSeek V4 Flash 模型在消费级 GPU 上的详细运行表现

    Reddit 的 r/LocalLLaMA 社区用户正在分享他们在各种硬件配置上运行 DeepSeek V4 Flash 模型的经验。一位用户详细介绍了一个使用两个 PLX88096 开关上的 16 个 NVIDIA RTX 5060 Ti GPU 的设置,实现了 500k 上下文(张量并行 8,流水线并行 2),或使用张量并行 4 和流水线并行 4 实现完整的 1M 上下文。另一位用户描述了在四块 RTX 3060 12GB 显卡上…

  2. RESEARCH · CL_204342 ·

    Qwen3.8-27B模型在多种硬件配置下表现强劲 · 已追踪4个来源

    用户报告称Qwen3.8-27B模型在各种硬件配置下展现出令人印象深刻的性能和能力。一位用户在使用vLLM的单块RTX 5090上实现了262K的上下文窗口,以合理的token生成速度展示了长上下文处理能力。另一套使用Strix Halo搭配RTX 3090 Ti和llama.cpp的配置,在32K和200K上下文下实现了高token生成速率,并且在HumanEval基准测试中显著优于双RTX 3090 vLLM配置。在Strix H…

  3. TOOL · CL_175440 ·

    Reddit 上关于 DeepSeek-V4-Flash-0731 显存需求的讨论

    r/LocalLLaMA 子版块的一位用户正在询问运行 DeepSeek-V4-Flash-0731 模型所需的最低显存。他们特别关注 Q4_K_XL 量化,并希望由于模型的活跃参数数量,显存需求能够得到控制。该用户正在寻求可能在高达 48GB 显存的 GPU 上测试过该模型的其他人的反馈。

  4. TOOL · CL_77165 ·

    Google 的 QATs 显示出比 Unsloth 变体更高的精度

    r/LocalLLaMA 上的一位用户观察到,Google 的 QATs(量化感知训练)Q4_0 模型似乎比 Unsloth 的 Q4_K_XL 变体具有更高的精度,这与预期相反。这一观察基于文件大小和张量数量,其中 Google 的 Q4_0 模型有时比 Unsloth 的 Q4_K_XL 更大,这表明量化策略或实现方式存在差异。用户正在寻求关于为何会出现这种差异以及如何正确分析 GGUF 文件中张量数据的解释。

  5. TOOL · CL_70683 ·

    Jetson AGX Orin 64GB 使用 q8_0 量化可加快 LLM 预填充速度

    一位用户在 r/LocalLLaMA 子版块分享了 Jetson AGX Orin 64GB 的性能观察结果,指出使用 q8_0 量化方法处理模型时,提示词处理速度明显快于 q6_k 和 q4_k_xl。该用户在最近的 llama.cpp 构建版本上使用 Unsloth Qwen3.6-27B-MTP-GGUF 模型进行了测试,观察到 q8_0 的速度提升超过 20%。他们推测,Jetson 的 CUDA 核心可能没有针对该特定硬件上…