一种名为 Q8_CR 的新 GGUF 格式已被开发出来,旨在针对 Ampere 和 Turing 等特定 GPU 架构优化扩散模型。该格式利用 ComfyUI 的 INT8 内核,并旨在最大限度地减小 INT8 和 FP16 检查点之间的质量差异。Q8_CR 将线性权重存储为预旋转的 INT8 和 FP32 标度,同时为敏感张量保留精度,与标准的 Q8_0 和 FP16 格式相比,提供了更快的推理速度和更少的 VRAM 使用量。 AI
影响 在兼容硬件上为特定的扩散模型提供了更快的推理速度和更少的 VRAM 使用量。
排序理由 这是对 AI 模型文件格式的一项技术改进,并非来自前沿实验室的发布。
- Turing
- Ampere
- ComfyUI
- Flux 2 Klein
- GGUF
- Ideogram
- INT8 ConvRot
- Krea 2
- Q8_CR
- RTX 20xx
- RTX 30xx
- Z-Image
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →