UD-Q4_K_XL
PulseAugur coverage of UD-Q4_K_XL — every cluster mentioning UD-Q4_K_XL across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Liquid AI 发布 LFM2.5 模型的 QAD 检查点,提升边缘性能
Liquid AI 发布了其 LFM2.5 模型的新检查点,利用量化感知蒸馏 (QAD) 来提高性能。这些 QAD Q4_0 检查点在保持标准 Q4_0 GGUF 低内存占用和高吞吐量的同时,恢复了量化过程中约 97% 的精度损失。基准测试表明,这些新检查点在各种边缘硬件上具有改进的解码吞吐量,其质量可与 Q5_K_M 和 Unsloth 的 UD-Q4_K_XL 等其他量化方法相媲美或超越。
-
使用 DeepSeek Harness 和 Unsloth 在本地运行 Qwen 3.8-27B
一份技术指南详细介绍了如何在配备 RTX 3090 显卡的 Windows 11 机器上本地运行 Qwen 3.8-27B 代码模型。该设置利用 DeepSeek Harness 进行代理编排,并利用 Unsloth Engine 进行优化推理,从而实现 100% 私有、低延迟的软件工程代理。该指南强调 RTX 3090 的 24GB VRAM 非常适合托管此类规模的模型,特别是使用一种平衡性能和内存使用的动态量化格式。
-
Flash-MoE 技术让大型 AI 模型能在 16GB 内存的 Mac 上运行
一种名为 anemll-flash-llama.cpp 的新技术,能够让大型专家混合(MoE)模型在内存仅为 16GB 的 Mac 上运行。该方法将模型专家存储在 SSD 上,仅将必要的专家加载到小型缓存中,从而显著降低内存需求。基准测试表明,虽然这种方法受存储 I/O 限制,但它使得 Qwen3.5-35B-A3B 等模型能在消费级硬件上使用,其中 Q3_K_M 等量化方法被证明更实用。
-
Unsloth 支持本地运行 Kimi K3、DeepSeek-V4 Flash,并新增深度研究和并行聊天功能
Unsloth 发布了更新,支持使用 Unsloth Dynamic GGUFs 在本地运行 Moonshot AI 的 Kimi K3 和 DeepSeek-V4 Flash 模型。此次更新还引入了“深度研究”模式,允许本地模型进行规划、阅读、引用来源并生成报告。此外,Unsloth 现在支持并行聊天会话、改进的 AMD 和 Intel GPU 兼容性以及 DoRA 训练。
-
Qwen3.5-122B 模型可装入 64GB 内存,提供更高质量但速度较慢
一位用户在 r/LocalLLaMA 上分享了他们在拥有 64GB 内存的系统上运行具有 UD-Q2_K_XL 量化的 Qwen3.5-122B 模型的经验。该设置允许更大的模型装入内存,与 Qwen3 Next 80B 等较小模型相比,提供了明显更好的响应质量和内部知识。然而,这以生成速度降低(约 2.9 tokens/秒)和提示处理速度大幅下降为代价,使其不适合代理任务。