一位开发者为 Falcon3-10B-1.58bit 模型创建了一个新的 Triton 后端,显著提高了 NVIDIA RTX 5070 GPU 上的推理速度。新的后端实现了每秒 97.5 个 token 的解码速度,比标准的 Transformers BitLinear 实现快了近 10 倍。该优化利用了 K-contiguous 压缩三元权重、压缩字 DP4A 解码路径和 CUDA Graph 重放等技术,开发者正在寻求在不同 GPU 架构上进行进一步的复现和基准测试。 AI
影响 通过自定义后端在消费级硬件上优化推理速度方面展示了巨大潜力。
排序理由 开发者为现有模型和硬件创建的优化。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →