为Qwen 3.8 27B模型开发了一个新的CUDA megakernel,与在单块RTX 3090 GPU上运行的llama.cpp相比,提供了显著更快的推理速度。基准测试表明,该megakernel在代码编写任务中达到每秒140个token,速度接近llama.cpp的两倍,同时具有可比的准确性和极小的KL散度。该项目在模型加载和量化支持方面也得到了改进,并且有更多的贡献合并到代码库中。 AI
影响 这一进展显著加快了在本地运行Qwen 3.8 27B模型的速度,有可能在消费级硬件上实现更复杂的应用。
排序理由 为现有的开源模型提供新的优化内核。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →