一位开发者逆向工程了一个NPU供应商的引擎格式,使得GGUF模型能够以比供应商自己的运行时快1.5倍的速度运行。这是通过解码供应商专有的int8权重存储为两个尼布尔平面,并在加载时将GGUF权重直接修补到预编译的引擎中实现的。开发者还发现并修复了批量预填充路径的一个问题,显著提高了提示处理速度,并实现了与CPU参考完全相同的字节输出。 AI
影响 通过优化模型加载和处理,在特定的NPU硬件上实现更快的推理。
排序理由 该条目描述了针对特定硬件/软件组合的技术优化和逆向工程工作,而不是新的模型发布或重大的行业性事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →